跳到主要內容
Lab Grimoire
TW
請喝咖啡
動手實作

敘述統計與資料摘要:平均數、四分位距與盒鬚圖

用集中趨勢、離散程度與形狀描述資料,學會判斷何時用中位數與 IQR、如何從盒鬚圖讀出偏態與離群值,並用 Z 分數與變異係數比較不同尺度。

作者
CY
發表
AI 的資料基礎:從統計到生成式 AI · 第 2/19 篇

本系列第 2 篇|這篇回答:一組資料要怎麼用幾個數字講清楚?什麼時候平均數會誤導人? 讀完這篇,你應該能:

  • 用集中趨勢與離散程度描述一組資料,並依有沒有極端值選擇摘要
  • 從盒鬚圖讀出偏態與離群值
  • 用 Z 分數與變異係數比較不同尺度的資料

一、為什麼先做摘要

敘述統計用幾個數字回答三件事:中心在哪、散得多開、形狀如何。

詳細說明

一組訂單、感測值或問卷,筆數一多就無法逐筆閱讀。敘述統計(descriptive statistics)把整組收成少數幾個數字,只回答三件事:中心在哪,稱為集中趨勢(central tendency);散得多開,稱為離散程度(dispersion);形狀如何,分成偏態(skewness)與峰態(kurtosis)。三件事要分開看。中心相同的兩組,可以一組擠在一起、一組拉得很開;散開程度相同的兩組,也可以一組左右對稱、另一組單邊拖著長尾。

摘要選錯,讀到的會是另一個中心。平均數(mean)把每一筆都加進總和,離群很遠的那一筆會把中心一起拖走。中位數(median)只看排序後站在正中間的位置,最遠的那一筆再怎麼遠,只要名次不變,中位數就不動。因此先問這組有沒有極端值:沒有,平均數可以代表中心;有,中位數比較能代表典型的一筆。後面的全距、標準差、四分位距,也是沿這條界線在選。

二、把一組資料收成可比較的數字

同一列已排序的 7 筆會貫穿這一節:3, 5, 5, 6, 8, 9, 31。先把中心算出來,再看它散多開、形狀往哪邊歪。

集中趨勢

平均數會被極端值拉走,中位數只看排序後的中間位置。

詳細說明

平均數記為 x̄ = Σx / n。這 7 筆的總和是 3 + 5 + 5 + 6 + 8 + 9 + 31 = 67,所以 x̄ = 67 / 7 ≈ 9.57。

中位數是排序後的中間值。筆數為奇數時取正中間一筆;為偶數時取中間兩筆的平均。這裡 n = 7,第 4 筆是 6,中位數就是 6。

眾數(mode)是出現最多次的值,類別資料沒有平均數時也能用。這裡 5 出現兩次,其餘各值只出現一次,眾數是 5。

9.57 遠大於 6。把 31 拿掉再想一次總和,中心不會停在 9.57 附近;是這一筆把平均數拉高。中位數仍是排序後的第 4 筆,不跟著 31 走。

離散程度

全距只看兩端;四分位距只量中間 50%,不受極端值影響。

詳細說明

全距(range)=最大 − 最小。這裡是 31 − 3 = 28。全距只看兩端,31 換成更大的數,全距就跟著變大,中段那幾筆完全沒有發言權。

變異數(variance)改看每一筆離中心多遠,而且把差距平方後加總,避免正負抵銷。整組就是母體時,用母體平均數 μ,

σ² = Σ(x − μ)² / N

手上只是樣本時,中心只能用 x̄,

s² = Σ(x − x̄)² / (n − 1)

分母用 n − 1,是為了讓樣本變異數成為母體變異數的不偏估計。原因在於:x̄ 是「讓平方和最小」的那個中心,Σ(x − x̄)² 會小於拿未知的 μ 去算的平方和。若仍除以 n,得到的數會系統性地偏小;改除以 n − 1,這個偏小才被補上。

標準差(standard deviation)是變異數開根號,母體為 σ、樣本為 s。變異數的單位是原單位的平方,不好直接當成距離;開根號之後,單位回到與原資料相同。標準差仍會被極端值影響,因為極端值的差距平方後,在總和裡佔的分量很大。

四分位數(quartiles)把排序後的資料切成四段。Q1 是下四分位數,Q2 就是中位數,Q3 是上四分位數。四分位距(IQR)= Q3 − Q1,是中間 50% 的寬度。計算位置時,兩端的極端值通常進不了 Q1 與 Q3,所以 IQR 不跟著極端值走。

這 7 筆若用 pandas 的預設(線性插值),位置由 0 起算:位置 = (n − 1) × p。

  • Q1:p = 0.25,位置 = 6 × 0.25 = 1.5,落在編號 1 與 2 之間,兩筆都是 5,所以 Q1 = 5。
  • Q2:p = 0.50,位置 = 6 × 0.50 = 3,編號 3 的值是 6。
  • Q3:p = 0.75,位置 = 6 × 0.75 = 4.5,落在編號 4 的 8 與編號 5 的 9 之間,Q3 = 8 + 0.5 × (9 − 8) = 8.5。

IQR = 8.5 − 5 = 3.5。對照全距 28,中段其實只寬 3.5,大部分的「很散」是 31 造成的。把 31 換成更大的數,位置 1.5 與 4.5 仍落在同樣的兩筆之間,Q1、Q3、IQR 都不變。

離群值(outlier)在這裡用 1.5×IQR 規則判定:小於 Q1 − 1.5×IQR,或大於 Q3 + 1.5×IQR。

1.5 × 3.5 = 5.25 上界 = 8.5 + 5.25 = 13.75 下界 = 5 − 5.25 = −0.25

31 > 13.75,所以 31 是離群值。其餘各筆都大於 −0.25,沒有低值離群值。

變異係數(coefficient of variation, CV)= 標準差 / 平均數。標準差和平均數單位相同,相除後單位消掉。寫成百分比時再乘以 100%。兩組的平均數差很多,或單位根本不同(一組是元、一組是公斤)時,直接比標準差會把「中心本來就比較大」誤當成「比較散」。CV 比的是相對自己中心的離散程度。

形狀

右偏是右側長尾,平均數通常大於中位數;左偏相反。

詳細說明

右偏(正偏態,positive skew)是右側長尾,通常平均數 > 中位數。左偏(負偏態,negative skew)是左側長尾,通常平均數 < 中位數。長尾那一側的少數遠值把平均數拉離中位數,中位數留在較厚的那一側。上面這 7 筆,9.57 > 6,而且高的一側有離群值 31,方向與右偏一致。

峰態描述尾巴厚薄。尾巴厚,表示極端值比常態分佈(normal distribution)多。峰態回答的是「極端值出沒的厚度」,不是中心在哪,也不是中段寬度。

盒鬚圖怎麼讀

箱子是 Q1 到 Q3,箱內線是中位數,鬚外的點是離群值。

詳細說明

盒鬚圖(box plot)把四分位數畫出來。箱子從 Q1 畫到 Q3,箱子長度就是 IQR。箱內的線是中位數。鬚延伸到 1.5×IQR 範圍內最遠的資料點;範圍外的點單獨畫出,就是離群值。

用同一列資料:箱子從 5 到 8.5。中位數線在 6。6 − 5 = 1,8.5 − 6 = 2.5,線離下緣較近。下界 −0.25 以內最遠的點是 3,上界 13.75 以內最遠的點是 9,所以下鬚收到 3、上鬚收到 9,31 單獨畫在上鬚之外。

判讀偏態時看兩件事。中位數線靠近 Q1(箱子下緣)且上鬚較長,是右偏;靠近 Q3 且下鬚較長,是左偏。箱子長短只代表中段資料的分散程度,與樣本數多寡無關。樣本很大,中段仍可以擠在一個窄箱子裡。

標準化:Z 分數與變異係數

Z 分數看一筆離平均幾個標準差;比較兩組散不散,用變異係數。

詳細說明

Z 分數(z-score)把單一筆換成「離平均幾個標準差」:

z = (x − μ) / σ

平均 70、標準差 8、x = 86 時,z = (86 − 70) / 8 = 16 / 8 = 2,也就是高於平均 2 個標準差。不同科目、不同單位的原始分數不能直接相減;各自換成 Z 分數之後,比的是同一種距離。Z 分數看的是「這一筆在自己那組裡的位置」。若問的是整組散得開不開,而且兩組平均差很多或單位不同,用的是上一節的 CV,不是 Z 分數。

程式對照

pandas 的 describe() 一次印出平均數、標準差與四分位數。

詳細說明

pandas 裡同一套定義可以一次印出。describe() 的 std 是樣本標準差,分母為 n − 1。

import pandas as pd

df = pd.DataFrame({"x": [3, 5, 5, 6, 8, 9, 31]})
print(df["x"].describe())
print(df["x"].quantile([0.25, 0.75]))
print(df["x"].median())
print(df["x"].mode())
print(df["x"].skew())

describe() 依序給出 count、mean、std、min、25%、50%、75%、max。25%、50%、75% 就是這份預設下的 Q1、中位數、Q3,與上面的 5、6、8.5 同一套位置算法。quantile([0.25, 0.75]) 只取 Q1 與 Q3。median()、mode() 分別是中位數與眾數。skew() 用來看偏態;右偏是右側長尾,通常平均數大於中位數,左偏則相反。程式輸出要跟這個定義一起讀,不要把某一格數字背成另一套指標。

三、容易混淆的地方

實務上容易把「會被極端值拉動的指標」和「不會的指標」混在一起。先看資料特徵,再計算。

容易混淆 差別在哪 實際遇到時的線索
平均數與中位數 平均數用全部數值的總和,極端值會把它拉走;中位數只看排序後的中間位置。有極端值或偏態時,中位數較能代表典型值。 資料裡有少數極高薪、極長工時或超大訂單,報告卻要寫出典型值。
標準差與 IQR 標準差來自偏差的平方和,極端值影響大;IQR = Q3 − Q1,只描述中間 50%。 資料已有離群值或長尾,摘要卻用標準差表達多數觀測的分散程度。
箱子長度與樣本數 箱子長度等於 IQR,表示中段分散,與樣本數多寡無關。 儀表板上的箱子短或長,被解讀成樣本數少或多。
母體變異數與樣本變異數 母體 σ² 的分母是 N;樣本 s² 的分母是 n − 1,這樣 s² 才是 σ² 的不偏估計。 分析資料標示完整母體並提供 μ、N;若只有抽樣資料,或看到 describe() 的 std,則是樣本情況。
標準差與變異係數 標準差單位與原資料相同;CV = 標準差 / 平均數,沒有單位,用於平均數差很多或單位不同的比較。 比較兩組平均差很多或單位不同的資料時,報告卻只列標準差。

四、基礎練習

第 1 題

某電商把一週的訂單金額畫成盒鬚圖。中位數那條線幾乎貼著箱子下緣(Q1),上鬚拉得很長,箱子上方還有數個單獨的點。

  • (A) 這是左偏:中位數靠近箱子下緣,代表長尾在左側。
  • (B) 箱子若不長,就代表這一週訂單筆數少,樣本不足,形狀不能判。
  • (C) 中段金額集中在較低值,右側有長尾,分佈右偏,上方那些點是高值離群值。
  • (D) 盒鬚圖只畫得出四分位數,看不出偏態,也指不出離群值。
看答案與解析

答案:C

中位數線貼著 Q1,表示中段的中心靠在較低值。上鬚很長,表示高的一側延伸成右側長尾,這是右偏。單獨畫在鬚外的點,落在 1.5×IQR 範圍之外,是高值離群值。

  • (A) 方向相反。左偏要看中位數靠近 Q3,而且下鬚較長。
  • (B) 箱子長度是 IQR,只表示中段分散,與樣本數無關。
  • (D) 中位數在箱內的位置、哪一側的鬚較長、箱外的點,就是偏態與離群值的讀法。

第 2 題

某工廠產線的加工秒數,Q1 = 20、Q3 = 30。其中一筆是 47 秒。依 1.5×IQR 規則,這一筆應如何判斷?

  • (A) 要用全距判斷;題目沒有最大值與最小值,所以不能把 47 當成離群值。
  • (B) 上界是 Q3 加一個 IQR,即 30 + 10 = 40;47 超過 40,所以是離群值。
  • (C) 沒有平均數與標準差,只靠四分位數無法判斷。
  • (D) IQR = 30 − 20 = 10,上界 = 30 + 1.5 × 10 = 45;47 > 45,是離群值。
看答案與解析

答案:D

IQR = 30 − 20 = 10。1.5 × IQR = 1.5 × 10 = 15。上界 = 30 + 15 = 45。47 > 45,所以 47 是離群值。

  • (A) 全距需要最大值與最小值,而且全距不是 1.5×IQR 這條規則。
  • (B) 倍數用錯了。上界是 Q3 + 1.5×IQR = 45,不是 Q3 + 1×IQR = 40。
  • (C) 這條規則只需要 Q1 與 Q3。

第 3 題

某次內部測驗,全體平均 50 分、標準差 5 分。某員得 38 分,他的 Z 分數是多少?

  • (A) z = +2.4,高於平均 2.4 個標準差。
  • (B) z = (38 − 50) / 5 = −2.4,低於平均 2.4 個標準差。
  • (C) z = 38 − 50 = −12,低於平均 12 個標準差。
  • (D) z = (38 − 50) / 50 = −0.24,低於平均 0.24 個標準差。
看答案與解析

答案:B

z = (x − μ) / σ = (38 − 50) / 5 = −12 / 5 = −2.4。負號表示低於平均,2.4 是標準差的個數。

  • (A) 38 小於 50,分子為負,Z 分數不會是正的。
  • (C) −12 只是原始分數的差,還沒除以標準差,單位仍是分。
  • (D) 分母誤用平均數 50。(38 − 50) / 50 = −0.24,不符合 z = (x − μ) / σ。

第 4 題

某公司的月薪有少數極高薪。若要描述典型員工的薪資,以及多數人薪資的分散程度,應使用哪一組?

  • (A) 中位數與四分位距(IQR)
  • (B) 平均數與標準差
  • (C) 眾數與全距
  • (D) 平均數與全距
看答案與解析

答案:A

極高薪是極端值。典型薪資要用不會被它們拉走的中位數;多數人的分散要看中間 50% 的寬度,也就是 IQR。

  • (B) 平均數被極高薪拉高,標準差又把偏差平方後加總,極端值的影響被放大。
  • (C) 全距=最大 − 最小,極高薪直接決定上端;眾數只說哪個值出現最多次,沒有描述中段的寬度。
  • (D) 平均數與全距都會跟著最高薪移動,中心和分散一起被扭曲。

第 5 題

某廠兩項產品的單價:A 平均 100、標準差 10;B 平均 20、標準差 4。要比較哪一項的相對離散較大。

  • (A) A 的標準差是 10,B 是 4,所以 A 比較散。
  • (B) 兩組平均相差 100 − 20 = 80,差距大就表示 A 比較不穩定。
  • (C) CV_A = 10 / 100 = 10%,CV_B = 4 / 20 = 20%,B 的相對離散較大。
  • (D) 平均數差這麼多,離散程度無法比較。
看答案與解析

答案:C

CV_A = 10 / 100 = 0.10 = 10%,CV_B = 4 / 20 = 0.20 = 20%。20% > 10%,所以 B 的相對離散較大。A 的標準差雖然較大(10 > 4),那是絕對離散;A 的平均也高很多,不能直接拿來比。

  • (A) 兩組平均數差很多,只比標準差會漏掉相對尺度。
  • (B) 100 − 20 = 80 是兩個中心的差距,不是任何一組內部的離散。
  • (D) 這種情況比得了,作法是把標準差除以各自的平均數。

第 6 題

某客服中心的結案時間,平均數 42 分鐘、中位數 55 分鐘。這組資料的形狀應如何描述?

  • (A) 平均數小於中位數,右側有長尾,屬於右偏(正偏態)。
  • (B) 兩個中心不相等,但沒有給眾數,偏態無法判斷。
  • (C) 平均數與中位數都是中心的指標,同時算得出來就表示大致對稱。
  • (D) 平均數小於中位數,左側有長尾,屬於左偏(負偏態)。
看答案與解析

答案:D

42 < 55,平均數落在中位數左側,表示左側的長尾把平均數拉低,屬於左偏(負偏態)。

  • (A) 右偏通常是平均數大於中位數,長尾在右側;這裡的大小關係相反。
  • (B) 這個判斷只用平均數與中位數,不需要眾數。
  • (C) 對稱時平均數會接近中位數。42 與 55 分開兩側,不能讀成對稱。

五、重點回顧

  • 敘述統計用少數數字交代中心、散開程度與形狀;有極端值時平均數會被拉走,中位數不會,摘要要先看極端值在不在。
  • 母體變異數 σ² = Σ(x − μ)² / N,樣本變異數 s² = Σ(x − x̄)² / (n − 1);除以 n − 1 是為了讓 s² 成為 σ² 的不偏估計。標準差是變異數開根號,單位與原資料相同。
  • 四分位距 IQR = Q3 − Q1,是中間 50% 的寬度。小於 Q1 − 1.5×IQR 或大於 Q3 + 1.5×IQR 的點,依這個規則判為離群值。
  • 盒鬚圖的箱子是 Q1 到 Q3,箱內線是中位數,鬚收到 1.5×IQR 範圍內最遠的點,再外面的點是離群值;箱子長短與樣本數無關。
  • 中位數靠近 Q1 且上鬚較長,通常是右偏,此時平均數常大於中位數;靠近 Q3 且下鬚較長,通常是左偏,此時平均數常小於中位數。
  • Z 分數 z = (x − μ) / σ,表示該值離平均幾個標準差;變異係數 CV = 標準差 / 平均數,沒有單位,用來比較平均數差很多或單位不同的相對離散。

覺得有幫助? RSS · X · 請我喝杯咖啡

同一組七筆資料,分別用中位數與平均數找中心;留意右端的 31。

一筆極端值,就把平均數拉走
1 / 3
七筆資料排在數線上
31 讓平均數升到 9.57;中位數只看排序後的中間位置,仍是 6。
  1. 資料是 3、5、5、6、8、9、31。排在數線上,正中間的位置和極端值 31 一眼就看得到。
  2. n = 7 是奇數,中位數只取排序後正中間那一筆;31 再大,也不會改變第 4 筆是誰。
  3. 七筆總和是 67,x̄ = 67 / 7 ≈ 9.57。31 算進了總和,平均數因此遠大於中位數 6。

全距看兩端,四分位距(IQR)只看中間 50%;同一組資料,兩者差很多。

全距 28,中段只寬 3.5
1 / 3
同樣七筆資料
全距只看兩端;四分位距 IQR 只量中間 50%,31 換成更大的數也不會變。
  1. 仍是 3、5、5、6、8、9、31。用同一組資料算兩種離散程度,才看得出 31 影響的是哪一段。
  2. 全距 = 31 − 3 = 28,只用最大值與最小值。31 換成更大的數,全距就跟著變大。
  3. Q1 = 5、Q3 = 8.5,IQR = 8.5 − 5 = 3.5。位置 1.5 與 4.5 仍落在同樣兩筆之間,31 再大,IQR 也不變。

右偏(正偏態,positive skew)的分佈:看長尾在哪一側,中位數與平均數各落在哪裡。曲線為示意。

右偏:長尾把平均數拉向右
1 / 3
右偏分佈:長尾在右
右側長尾讓平均數大於中位數;左偏時方向相反。曲線為示意。
  1. 右偏的長尾在右側。前面那七筆也是這樣:高的一側有離群值 31,平均數 9.57 大於中位數 6。
  2. 長尾只有少數遠值。中位數只看排序後的中間位置,所以留在資料較多、較厚的那一側。
  3. 遠值把平均數拉向長尾,所以右偏時通常平均數 > 中位數;左偏(負偏態)則通常相反。

盒鬚圖(box plot)依序看箱子、箱內線、鬚,以及鬚外單獨畫出的點。

箱子是 IQR,鬚收到 1.5×IQR 以內
1 / 5
先看原始七筆
箱子 5 到 8.5、中位數 6;上界 13.75 之外的 31 單獨畫出,是離群值。
  1. 同樣是 3、5、5、6、8、9、31。箱子、中位數線、鬚和離群值,都由這七筆的位置算出。
  2. 箱子長度就是 IQR = 3.5,只代表中間 50% 資料的分散程度,與樣本數多寡無關。
  3. 中位數 6 離 Q1 只有 1、離 Q3 有 2.5,所以線靠近箱子下緣;判斷偏態還要看哪一側的鬚較長。
  4. 鬚只延伸到界限內最遠的資料點:下界 −0.25 以內最遠是 3,上界 13.75 以內最遠是 9。
  5. 上界 = Q3 + 1.5 × IQR = 8.5 + 5.25 = 13.75。31 超過上界,所以單獨畫在鬚外,是離群值。

動手試試按「載入範例」:20 筆裡的 42.3 超出 1.5×IQR 的上界,工具會把它列為離群值。

描述統計