本系列第 2 篇|這篇回答:一組資料要怎麼用幾個數字講清楚?什麼時候平均數會誤導人? 讀完這篇,你應該能:
- 用集中趨勢與離散程度描述一組資料,並依有沒有極端值選擇摘要
- 從盒鬚圖讀出偏態與離群值
- 用 Z 分數與變異係數比較不同尺度的資料
一、為什麼先做摘要
敘述統計用幾個數字回答三件事:中心在哪、散得多開、形狀如何。
詳細說明
一組訂單、感測值或問卷,筆數一多就無法逐筆閱讀。敘述統計(descriptive statistics)把整組收成少數幾個數字,只回答三件事:中心在哪,稱為集中趨勢(central tendency);散得多開,稱為離散程度(dispersion);形狀如何,分成偏態(skewness)與峰態(kurtosis)。三件事要分開看。中心相同的兩組,可以一組擠在一起、一組拉得很開;散開程度相同的兩組,也可以一組左右對稱、另一組單邊拖著長尾。
摘要選錯,讀到的會是另一個中心。平均數(mean)把每一筆都加進總和,離群很遠的那一筆會把中心一起拖走。中位數(median)只看排序後站在正中間的位置,最遠的那一筆再怎麼遠,只要名次不變,中位數就不動。因此先問這組有沒有極端值:沒有,平均數可以代表中心;有,中位數比較能代表典型的一筆。後面的全距、標準差、四分位距,也是沿這條界線在選。
二、把一組資料收成可比較的數字
同一列已排序的 7 筆會貫穿這一節:3, 5, 5, 6, 8, 9, 31。先把中心算出來,再看它散多開、形狀往哪邊歪。
集中趨勢
平均數會被極端值拉走,中位數只看排序後的中間位置。
詳細說明
平均數記為 x̄ = Σx / n。這 7 筆的總和是 3 + 5 + 5 + 6 + 8 + 9 + 31 = 67,所以 x̄ = 67 / 7 ≈ 9.57。
中位數是排序後的中間值。筆數為奇數時取正中間一筆;為偶數時取中間兩筆的平均。這裡 n = 7,第 4 筆是 6,中位數就是 6。
眾數(mode)是出現最多次的值,類別資料沒有平均數時也能用。這裡 5 出現兩次,其餘各值只出現一次,眾數是 5。
9.57 遠大於 6。把 31 拿掉再想一次總和,中心不會停在 9.57 附近;是這一筆把平均數拉高。中位數仍是排序後的第 4 筆,不跟著 31 走。
離散程度
全距只看兩端;四分位距只量中間 50%,不受極端值影響。
詳細說明
全距(range)=最大 − 最小。這裡是 31 − 3 = 28。全距只看兩端,31 換成更大的數,全距就跟著變大,中段那幾筆完全沒有發言權。
變異數(variance)改看每一筆離中心多遠,而且把差距平方後加總,避免正負抵銷。整組就是母體時,用母體平均數 μ,
σ² = Σ(x − μ)² / N
手上只是樣本時,中心只能用 x̄,
s² = Σ(x − x̄)² / (n − 1)
分母用 n − 1,是為了讓樣本變異數成為母體變異數的不偏估計。原因在於:x̄ 是「讓平方和最小」的那個中心,Σ(x − x̄)² 會小於拿未知的 μ 去算的平方和。若仍除以 n,得到的數會系統性地偏小;改除以 n − 1,這個偏小才被補上。
標準差(standard deviation)是變異數開根號,母體為 σ、樣本為 s。變異數的單位是原單位的平方,不好直接當成距離;開根號之後,單位回到與原資料相同。標準差仍會被極端值影響,因為極端值的差距平方後,在總和裡佔的分量很大。
四分位數(quartiles)把排序後的資料切成四段。Q1 是下四分位數,Q2 就是中位數,Q3 是上四分位數。四分位距(IQR)= Q3 − Q1,是中間 50% 的寬度。計算位置時,兩端的極端值通常進不了 Q1 與 Q3,所以 IQR 不跟著極端值走。
這 7 筆若用 pandas 的預設(線性插值),位置由 0 起算:位置 = (n − 1) × p。
- Q1:p = 0.25,位置 = 6 × 0.25 = 1.5,落在編號 1 與 2 之間,兩筆都是 5,所以 Q1 = 5。
- Q2:p = 0.50,位置 = 6 × 0.50 = 3,編號 3 的值是 6。
- Q3:p = 0.75,位置 = 6 × 0.75 = 4.5,落在編號 4 的 8 與編號 5 的 9 之間,Q3 = 8 + 0.5 × (9 − 8) = 8.5。
IQR = 8.5 − 5 = 3.5。對照全距 28,中段其實只寬 3.5,大部分的「很散」是 31 造成的。把 31 換成更大的數,位置 1.5 與 4.5 仍落在同樣的兩筆之間,Q1、Q3、IQR 都不變。
離群值(outlier)在這裡用 1.5×IQR 規則判定:小於 Q1 − 1.5×IQR,或大於 Q3 + 1.5×IQR。
1.5 × 3.5 = 5.25 上界 = 8.5 + 5.25 = 13.75 下界 = 5 − 5.25 = −0.25
31 > 13.75,所以 31 是離群值。其餘各筆都大於 −0.25,沒有低值離群值。
變異係數(coefficient of variation, CV)= 標準差 / 平均數。標準差和平均數單位相同,相除後單位消掉。寫成百分比時再乘以 100%。兩組的平均數差很多,或單位根本不同(一組是元、一組是公斤)時,直接比標準差會把「中心本來就比較大」誤當成「比較散」。CV 比的是相對自己中心的離散程度。
形狀
右偏是右側長尾,平均數通常大於中位數;左偏相反。
詳細說明
右偏(正偏態,positive skew)是右側長尾,通常平均數 > 中位數。左偏(負偏態,negative skew)是左側長尾,通常平均數 < 中位數。長尾那一側的少數遠值把平均數拉離中位數,中位數留在較厚的那一側。上面這 7 筆,9.57 > 6,而且高的一側有離群值 31,方向與右偏一致。
峰態描述尾巴厚薄。尾巴厚,表示極端值比常態分佈(normal distribution)多。峰態回答的是「極端值出沒的厚度」,不是中心在哪,也不是中段寬度。
盒鬚圖怎麼讀
箱子是 Q1 到 Q3,箱內線是中位數,鬚外的點是離群值。
詳細說明
盒鬚圖(box plot)把四分位數畫出來。箱子從 Q1 畫到 Q3,箱子長度就是 IQR。箱內的線是中位數。鬚延伸到 1.5×IQR 範圍內最遠的資料點;範圍外的點單獨畫出,就是離群值。
用同一列資料:箱子從 5 到 8.5。中位數線在 6。6 − 5 = 1,8.5 − 6 = 2.5,線離下緣較近。下界 −0.25 以內最遠的點是 3,上界 13.75 以內最遠的點是 9,所以下鬚收到 3、上鬚收到 9,31 單獨畫在上鬚之外。
判讀偏態時看兩件事。中位數線靠近 Q1(箱子下緣)且上鬚較長,是右偏;靠近 Q3 且下鬚較長,是左偏。箱子長短只代表中段資料的分散程度,與樣本數多寡無關。樣本很大,中段仍可以擠在一個窄箱子裡。
標準化:Z 分數與變異係數
Z 分數看一筆離平均幾個標準差;比較兩組散不散,用變異係數。
詳細說明
Z 分數(z-score)把單一筆換成「離平均幾個標準差」:
z = (x − μ) / σ
平均 70、標準差 8、x = 86 時,z = (86 − 70) / 8 = 16 / 8 = 2,也就是高於平均 2 個標準差。不同科目、不同單位的原始分數不能直接相減;各自換成 Z 分數之後,比的是同一種距離。Z 分數看的是「這一筆在自己那組裡的位置」。若問的是整組散得開不開,而且兩組平均差很多或單位不同,用的是上一節的 CV,不是 Z 分數。
程式對照
pandas 的 describe() 一次印出平均數、標準差與四分位數。
詳細說明
pandas 裡同一套定義可以一次印出。describe() 的 std 是樣本標準差,分母為 n − 1。
import pandas as pd
df = pd.DataFrame({"x": [3, 5, 5, 6, 8, 9, 31]})
print(df["x"].describe())
print(df["x"].quantile([0.25, 0.75]))
print(df["x"].median())
print(df["x"].mode())
print(df["x"].skew())
describe() 依序給出 count、mean、std、min、25%、50%、75%、max。25%、50%、75% 就是這份預設下的 Q1、中位數、Q3,與上面的 5、6、8.5 同一套位置算法。quantile([0.25, 0.75]) 只取 Q1 與 Q3。median()、mode() 分別是中位數與眾數。skew() 用來看偏態;右偏是右側長尾,通常平均數大於中位數,左偏則相反。程式輸出要跟這個定義一起讀,不要把某一格數字背成另一套指標。
三、容易混淆的地方
實務上容易把「會被極端值拉動的指標」和「不會的指標」混在一起。先看資料特徵,再計算。
| 容易混淆 | 差別在哪 | 實際遇到時的線索 |
|---|---|---|
| 平均數與中位數 | 平均數用全部數值的總和,極端值會把它拉走;中位數只看排序後的中間位置。有極端值或偏態時,中位數較能代表典型值。 | 資料裡有少數極高薪、極長工時或超大訂單,報告卻要寫出典型值。 |
| 標準差與 IQR | 標準差來自偏差的平方和,極端值影響大;IQR = Q3 − Q1,只描述中間 50%。 | 資料已有離群值或長尾,摘要卻用標準差表達多數觀測的分散程度。 |
| 箱子長度與樣本數 | 箱子長度等於 IQR,表示中段分散,與樣本數多寡無關。 | 儀表板上的箱子短或長,被解讀成樣本數少或多。 |
| 母體變異數與樣本變異數 | 母體 σ² 的分母是 N;樣本 s² 的分母是 n − 1,這樣 s² 才是 σ² 的不偏估計。 | 分析資料標示完整母體並提供 μ、N;若只有抽樣資料,或看到 describe() 的 std,則是樣本情況。 |
| 標準差與變異係數 | 標準差單位與原資料相同;CV = 標準差 / 平均數,沒有單位,用於平均數差很多或單位不同的比較。 | 比較兩組平均差很多或單位不同的資料時,報告卻只列標準差。 |
四、基礎練習
第 1 題
某電商把一週的訂單金額畫成盒鬚圖。中位數那條線幾乎貼著箱子下緣(Q1),上鬚拉得很長,箱子上方還有數個單獨的點。
- (A) 這是左偏:中位數靠近箱子下緣,代表長尾在左側。
- (B) 箱子若不長,就代表這一週訂單筆數少,樣本不足,形狀不能判。
- (C) 中段金額集中在較低值,右側有長尾,分佈右偏,上方那些點是高值離群值。
- (D) 盒鬚圖只畫得出四分位數,看不出偏態,也指不出離群值。
看答案與解析
答案:C
中位數線貼著 Q1,表示中段的中心靠在較低值。上鬚很長,表示高的一側延伸成右側長尾,這是右偏。單獨畫在鬚外的點,落在 1.5×IQR 範圍之外,是高值離群值。
- (A) 方向相反。左偏要看中位數靠近 Q3,而且下鬚較長。
- (B) 箱子長度是 IQR,只表示中段分散,與樣本數無關。
- (D) 中位數在箱內的位置、哪一側的鬚較長、箱外的點,就是偏態與離群值的讀法。
第 2 題
某工廠產線的加工秒數,Q1 = 20、Q3 = 30。其中一筆是 47 秒。依 1.5×IQR 規則,這一筆應如何判斷?
- (A) 要用全距判斷;題目沒有最大值與最小值,所以不能把 47 當成離群值。
- (B) 上界是 Q3 加一個 IQR,即 30 + 10 = 40;47 超過 40,所以是離群值。
- (C) 沒有平均數與標準差,只靠四分位數無法判斷。
- (D) IQR = 30 − 20 = 10,上界 = 30 + 1.5 × 10 = 45;47 > 45,是離群值。
看答案與解析
答案:D
IQR = 30 − 20 = 10。1.5 × IQR = 1.5 × 10 = 15。上界 = 30 + 15 = 45。47 > 45,所以 47 是離群值。
- (A) 全距需要最大值與最小值,而且全距不是 1.5×IQR 這條規則。
- (B) 倍數用錯了。上界是 Q3 + 1.5×IQR = 45,不是 Q3 + 1×IQR = 40。
- (C) 這條規則只需要 Q1 與 Q3。
第 3 題
某次內部測驗,全體平均 50 分、標準差 5 分。某員得 38 分,他的 Z 分數是多少?
- (A) z = +2.4,高於平均 2.4 個標準差。
- (B) z = (38 − 50) / 5 = −2.4,低於平均 2.4 個標準差。
- (C) z = 38 − 50 = −12,低於平均 12 個標準差。
- (D) z = (38 − 50) / 50 = −0.24,低於平均 0.24 個標準差。
看答案與解析
答案:B
z = (x − μ) / σ = (38 − 50) / 5 = −12 / 5 = −2.4。負號表示低於平均,2.4 是標準差的個數。
- (A) 38 小於 50,分子為負,Z 分數不會是正的。
- (C) −12 只是原始分數的差,還沒除以標準差,單位仍是分。
- (D) 分母誤用平均數 50。(38 − 50) / 50 = −0.24,不符合 z = (x − μ) / σ。
第 4 題
某公司的月薪有少數極高薪。若要描述典型員工的薪資,以及多數人薪資的分散程度,應使用哪一組?
- (A) 中位數與四分位距(IQR)
- (B) 平均數與標準差
- (C) 眾數與全距
- (D) 平均數與全距
看答案與解析
答案:A
極高薪是極端值。典型薪資要用不會被它們拉走的中位數;多數人的分散要看中間 50% 的寬度,也就是 IQR。
- (B) 平均數被極高薪拉高,標準差又把偏差平方後加總,極端值的影響被放大。
- (C) 全距=最大 − 最小,極高薪直接決定上端;眾數只說哪個值出現最多次,沒有描述中段的寬度。
- (D) 平均數與全距都會跟著最高薪移動,中心和分散一起被扭曲。
第 5 題
某廠兩項產品的單價:A 平均 100、標準差 10;B 平均 20、標準差 4。要比較哪一項的相對離散較大。
- (A) A 的標準差是 10,B 是 4,所以 A 比較散。
- (B) 兩組平均相差 100 − 20 = 80,差距大就表示 A 比較不穩定。
- (C) CV_A = 10 / 100 = 10%,CV_B = 4 / 20 = 20%,B 的相對離散較大。
- (D) 平均數差這麼多,離散程度無法比較。
看答案與解析
答案:C
CV_A = 10 / 100 = 0.10 = 10%,CV_B = 4 / 20 = 0.20 = 20%。20% > 10%,所以 B 的相對離散較大。A 的標準差雖然較大(10 > 4),那是絕對離散;A 的平均也高很多,不能直接拿來比。
- (A) 兩組平均數差很多,只比標準差會漏掉相對尺度。
- (B) 100 − 20 = 80 是兩個中心的差距,不是任何一組內部的離散。
- (D) 這種情況比得了,作法是把標準差除以各自的平均數。
第 6 題
某客服中心的結案時間,平均數 42 分鐘、中位數 55 分鐘。這組資料的形狀應如何描述?
- (A) 平均數小於中位數,右側有長尾,屬於右偏(正偏態)。
- (B) 兩個中心不相等,但沒有給眾數,偏態無法判斷。
- (C) 平均數與中位數都是中心的指標,同時算得出來就表示大致對稱。
- (D) 平均數小於中位數,左側有長尾,屬於左偏(負偏態)。
看答案與解析
答案:D
42 < 55,平均數落在中位數左側,表示左側的長尾把平均數拉低,屬於左偏(負偏態)。
- (A) 右偏通常是平均數大於中位數,長尾在右側;這裡的大小關係相反。
- (B) 這個判斷只用平均數與中位數,不需要眾數。
- (C) 對稱時平均數會接近中位數。42 與 55 分開兩側,不能讀成對稱。
五、重點回顧
- 敘述統計用少數數字交代中心、散開程度與形狀;有極端值時平均數會被拉走,中位數不會,摘要要先看極端值在不在。
- 母體變異數 σ² = Σ(x − μ)² / N,樣本變異數 s² = Σ(x − x̄)² / (n − 1);除以 n − 1 是為了讓 s² 成為 σ² 的不偏估計。標準差是變異數開根號,單位與原資料相同。
- 四分位距 IQR = Q3 − Q1,是中間 50% 的寬度。小於 Q1 − 1.5×IQR 或大於 Q3 + 1.5×IQR 的點,依這個規則判為離群值。
- 盒鬚圖的箱子是 Q1 到 Q3,箱內線是中位數,鬚收到 1.5×IQR 範圍內最遠的點,再外面的點是離群值;箱子長短與樣本數無關。
- 中位數靠近 Q1 且上鬚較長,通常是右偏,此時平均數常大於中位數;靠近 Q3 且下鬚較長,通常是左偏,此時平均數常小於中位數。
- Z 分數 z = (x − μ) / σ,表示該值離平均幾個標準差;變異係數 CV = 標準差 / 平均數,沒有單位,用來比較平均數差很多或單位不同的相對離散。