本系列第 4 篇|這篇回答:只看到一部分樣本時,怎麼判斷差異是真的還是運氣? 讀完這篇,你應該能:
- 正確說出 p 值與兩類錯誤的意思
- 依資料型態與設計選對檢定
- 讀懂信賴區間與檢定結果的對應
一、用樣本對母體下判斷
p ≤ α 才拒絕 H0,不拒絕並未證明 H0 為真。
詳細說明
拿到的幾乎都是樣本。要判斷的是母體的平均、比例,或組與組之間有沒有差異。假設檢定先寫下一個可被資料挑戰的說法,再問:若這個說法為真,眼前這批資料算不算罕見。
虛無假設(null hypothesis, H0)寫的是沒有差異、沒有效果。平台宣稱平均處理時間就是 50 秒時,H0 是母體平均 μ = 50。對立假設(alternative hypothesis, H1)是研究者想支持的方向:比 50 長、比 50 短,或只是不等於 50。檢定不從 H1 起算。它假設 H0 為真,再看「目前這麼極端,或更極端」的資料有多難得。難得的程度夠高,才拒絕 H0。
這個「難得的程度」是 p 值(p-value):在 H0 為真的前提下,得到至少與觀察結果一樣極端的資料的機率。p 值不是「H0 為真的機率」,也不是效果大小。它不回答母體到底差了幾秒、差了幾個百分點。
拒不拒絕,用事先訂好的 顯著水準(significance level, α)當門檻,常用 0.05。p ≤ α 就拒絕 H0;p > α 則不拒絕 H0。不拒絕只表示這批樣本還沒有把 H0 推開,不是證明 H0 為真。樣本小、波動大時,真的有差異,也可能停在不拒絕。
兩種錯誤的方向相反。
型一錯誤(Type I error)是 H0 為真卻拒絕,也就是偽陽性,機率等於 α。α = 0.05 時,若 H0 確實為真,長期而言約有 0.05 的檢定會誤拒絕。
型二錯誤(Type II error)是 H0 為假卻沒有拒絕,也就是偽陰性,機率記為 β。檢定力(power)是 H0 為假時成功拒絕的機率,power = 1 − β。
n 固定時,兩種錯誤彼此拉扯。α 從 0.05 調到 0.01,拒絕區變窄,型一錯誤變少,但同一批資料更難跨過門檻,β 變大,檢定力下降。想讓型一與型二一起下降,要增加樣本數,而不是只把 α 調小。
尾的選擇跟 H1 的寫法綁在一起。H1 是 μ > μ0 或 μ < μ0 時,用單尾檢定(one-tailed test),極端只算指定的那一側。H1 只問「是否不同」(μ ≠ μ0)時,用雙尾檢定(two-tailed test),兩側都算。同一筆資料、同一個 α,雙尾把門檻分到兩側,臨界值離 0 更遠,比單尾更不容易拒絕 H0。研究假設已設定方向,就用該側的臨界值,不要改套雙尾的臨界值。
二、選檢定的決策
先看三件事:結果是平均、比例,還是類別次數;有幾組;各筆是不同的人,還是同一人的前後測。母體標準差 σ 知不知道,只決定「一個平均」這條要用 Z 還是 t。
一個平均:Z 或 t
σ 已知用 Z 檢定,分母是 σ/√n;未知就改用 t 檢定。
詳細說明
只有一組樣本,要檢驗母體平均是否等於 H0 所寫的 μ0。σ 已知時用 Z 檢定(Z-test):
z = (x̄ − μ0) / (σ / √n)
分母 σ/√n 是樣本平均的標準誤。n 愈大,標準誤愈小,同樣的差距 x̄ − μ0 會得到愈大的 |z|。
以這個可手算的設計為例。H0: μ = 50,H1: μ > 50,σ = 12,n = 16,x̄ = 55。
σ/√n = 12/√16 = 12/4 = 3
z = (55 − 50) / 3 = 5/3 ≈ 1.67
右尾、α = 0.05 的臨界值是 1.645。1.67 > 1.645,拒絕 H0。這個 z 的右尾 p 值約為 0.048,也小於 0.05。若分母誤用 σ、沒有除以 √n,會得到 z = (55 − 50)/12 = 5/12 ≈ 0.42,結論就反了。
σ 未知、只有樣本標準差時,改用t 檢定(t-test)裡的單一樣本 t 檢定。標準誤改由樣本標準差估計,臨界值來自 t 分配,不能直接沿用常態的 1.645 或 1.96,除非分析規格另外提供 t 的臨界值。
兩組與多組平均
人不同用獨立樣本 t,前後用配對 t,三組以上用單因子變異數分析。
詳細說明
兩群不同的人、各有一個平均,用獨立樣本 t 檢定(independent-samples t-test)。兩組變異數不相等時,改用 Welch t 檢定(Welch's t-test),不要再用假設變異數相等的那一版。
同一群人前後各量一次,或本來就配對的兩筆,用配對 t 檢定(paired t-test)。先算每一對的差值,再對差值做單一樣本 t,H0 通常是差值的母體平均為 0。把前後測拆成兩組獨立樣本,會忽略「是同一個人」這件事,問的就不再是這題的改變。
三組以上的平均,各組獨立,用單因子變異數分析(one-way ANOVA),統計量是 F。若研究資料近似常態且變異數相近,就符合這條。ANOVA 顯著只表示至少有一組與其他組不同,沒有指出是哪一組。要知道哪幾組不同,接事後比較(post hoc test),例如 Tukey HSD。若改做多次兩兩 t 檢定,每一次都帶著自己的 α,整體型一錯誤會膨脹,不能把「每一次都用 0.05」當成整體仍是 0.05。
類別、比例,以及非常態
卡方吃次數,兩組比例用兩比例 Z,非常態改用對應的無母數檢定。
詳細說明
兩個類別變數是否相關,用卡方獨立性檢定(chi-square test of independence)。表裡是次數。會員等級三類、回購只有是否,問的就是等級與回購是否獨立。觀察次數是否符合某個理論比例,用卡方適合度檢定(chi-square goodness-of-fit test)。兩種卡方都吃次數;同一人的前後測數值不進卡方。
兩組比例,例如 A/B 測試的轉換率,用兩比例 Z 檢定(two-proportion Z-test)。比的是比例,不是平均。
資料不符合常態,或變數只是順序,改用無母數檢定(nonparametric test)。兩組獨立用 Mann-Whitney U 檢定;配對用 Wilcoxon 符號等級檢定(Wilcoxon signed-rank test);三組以上用 Kruskal-Wallis 檢定。對應仍是:獨立對獨立、配對對配對、多組對多組。
信賴區間怎麼和檢定對上
雙尾 α = 0.05 拒絕 H0,等價於 95% CI 不含該值。
詳細說明
σ 已知時,母體平均的 95% 信賴區間(confidence interval, CI)是:
x̄ ± 1.96 × (σ / √n)
1.96 是標準常態在雙尾、兩側合計 0.05 時的臨界值。解讀指的是重複抽樣:用同樣方法抽很多次,約 95% 的區間會涵蓋真實的 μ。區間算出之後,不要把它說成「真實 μ 有 95% 的機率落在這一條區間裡」。
在同一參數、同一組假設下,雙尾檢定和信賴區間是同一件事的兩種寫法。雙尾 α = 0.05 時拒絕 H0,等價於 95% CI 不含 H0 所寫的值。比的若是兩組差距,H0 通常是差距 = 0;95% CI 不含 0,就對應這個顯著水準下拒絕 H0。區間是 [0.4%, 1.8%] 時,下界已經大於 0,不必再等一個 p 值才能做這個對應。區間若跨過 0,則同一水準下不拒絕 H0。
多重比較與大樣本
同時做 m 個檢定時門檻改為 α/m,顯著還要看效果量。
詳細說明
同時做 m 個檢定時,Bonferroni 校正(Bonferroni correction)把每一個檢定的門檻改為 α/m。它處理的是整體型一錯誤,不是把差異本身變大。門檻變嚴,個別檢定更不容易拒絕,和「n 不變、只把 α 調小」是同一種拉扯。
另一個陷阱在 n 非常大。標準誤的分母有 √n,n 一大,極小的差距也能跨過臨界值。顯著只表示這個差距不太像單純的抽樣波動。實務上要不要行動,還要看效果量(effect size),把差距的大小和決策在意的幅度放在一起。p 值小,不自動等於值得改做法。
程式對照
equal_var=False 才是 Welch,配對不可改送獨立。
詳細說明
scipy.stats 的呼叫與前面的選擇對上。a、b、before、after、g1、g2、g3 是數值資料,table 是列聯表的次數。
from scipy import stats
def welch_t(a, b):
return stats.ttest_ind(a, b, equal_var=False)
def paired_t(before, after):
return stats.ttest_rel(before, after)
def one_way_anova(g1, g2, g3):
return stats.f_oneway(g1, g2, g3)
def chi2_independence(table):
return stats.chi2_contingency(table)
equal_var=False 才是 Welch。前後測要用 ttest_rel,兩筆依同一順序配對;打散之後再送進 ttest_ind,就不再是配對設計。
三、容易混淆的地方
實務上常把幾個條件混在一起:資料來自同一批人還是兩批人、要比較平均還是次數、門檻有沒有事先調緊。
| 容易混淆 | 差別在哪 | 實際遇到時的線索 |
|---|---|---|
| p 值 vs「H0 為真的機率」 | p 值先假設 H0 為真,再算資料至少這麼極端的機率。它不是 H0 本身的機率,也不是效果大小。 | 分析報告若把 p 值寫成「H0 為真的機率」,或當成差異大小,就混淆了概念。 |
| 不拒絕 H0 vs 接受 H0 | 不拒絕表示證據還不夠拒絕。接受 H0 等於宣稱沒有差異,檢定給不出這個證明。 | 研究結論若寫成「證明兩組相同」或「因此 H0 為真」,就把不拒絕誤作接受。 |
| 型一錯誤 vs 型二錯誤 | 型一是 H0 為真卻拒絕,機率 = α。型二是 H0 為假卻不拒絕,機率 = β。檢定力 = 1 − β。n 固定而 α 變小,則 β 變大、檢定力下降。 | 分析備忘錄記錄「α 從 0.05 改為 0.01,n 不變」,卻預期兩種錯誤都下降或檢定力上升,表示判讀有誤。 |
| 獨立樣本 t vs 配對 t | 獨立 t 比較兩群不同的觀測。配對 t 用同一對的差值,檢定差值平均是否為 0。 | 研究設計若讓同一批人前後各量一次,資料是配對;若參與者隨機分到兩組、各量一次,則是獨立。 |
| ANOVA vs 多次 t 檢定 | ANOVA 一次比較三組以上的平均;顯著只表示至少有一組不同,還要事後比較。多次兩兩 t 會使整體型一錯誤膨脹。 | 分析計畫若對三組以上各做一次 t 檢定,卻認為整體 α 仍是 0.05,就忽略了整體型一錯誤膨脹。 |
| 統計顯著 vs 實務重要 | 顯著表示差異不像純抽樣波動。n 很大時,極小差異也會顯著。要不要行動要看效果量。 | 報告中的 p 值很小,但差距在實務上可忽略,仍不能只憑統計顯著就決定改做法。 |
單尾和雙尾也常被臨界值帶錯。右尾 α = 0.05 看 1.645,雙尾 α = 0.05 看 1.96。H1 已經寫了方向,就用單尾那個臨界值。
四、基礎練習
第 1 題
某診所讓 40 位病患導入一套用藥提醒。每一位在導入前量一次血壓,導入後再量一次。40 筆「後減前」的差值近似常態。若要檢驗血壓是否有改變,最適合的檢定是哪一個?
- (A) 獨立樣本 t 檢定
- (B) 卡方獨立性檢定
- (C) 配對 t 檢定
- (D) 單因子 ANOVA
看答案與解析
答案:C
同一位病患有前、後兩次測量,分析用的是 40 筆差值,差值又近似常態,所以對差值做單一樣本 t,也就是配對 t 檢定。
- (A) 獨立樣本 t 把前後測當成兩群互不對應的人,忽略同一人的配對。
- (B) 卡方獨立性檢定處理兩個類別變數的次數,這裡是數值差值。
- (D) 單因子 ANOVA 用於三組以上的平均,本題只有前與後這一對。
第 2 題
某平台宣稱工單平均處理時間為 50 秒。母體標準差 σ = 12 秒已知。抽 16 筆得到 x̄ = 55 秒。研究問題是平均是否長於 50 秒,用右尾 α = 0.05,臨界值 1.645。下列哪一個判斷正確?
- (A) z = 5/12 ≈ 0.42,小於 1.645,不拒絕 H0
- (B) z ≈ 1.67,但右尾 p ≈ 0.95,所以不拒絕 H0
- (C) z ≈ 1.67,小於雙尾臨界值 1.96,不拒絕 H0
- (D) z = (55 − 50) / (12/4) ≈ 1.67,大於 1.645,拒絕 H0
看答案與解析
答案:D
H0: μ = 50,H1: μ > 50。標準誤 σ/√n = 12/√16 = 12/4 = 3。z = (55 − 50) / 3 = 5/3 ≈ 1.67。1.67 > 1.645,右尾拒絕 H0。右尾 p ≈ 0.048,也小於 0.05。
- (A) 分母誤用 σ = 12,沒有除以 √n。5/12 ≈ 0.42 不是這個設計的 z。
- (B) z ≈ 1.67 這一步算對,但右尾 p 約為 0.048,不是 0.95。
- (C) 1.96 是雙尾 α = 0.05 的臨界值。本題 H1 是「大於」,要用右尾臨界值 1.645。
第 3 題
某工廠以固定的樣本數,檢驗新參數能否降低不良率。原本 α = 0.05,現在改為 α = 0.01,樣本數不變。這個調整對兩類錯誤和檢定力的影響是?
- (A) 型一錯誤機率下降,型二錯誤機率上升,檢定力下降
- (B) 型一錯誤與型二錯誤的機率都下降
- (C) 型一錯誤機率下降,檢定力上升
- (D) 型一錯誤機率下降,β 維持不變
看答案與解析
答案:A
型一錯誤的機率就是 α,從 0.05 降到 0.01,型一錯誤變少。n 固定時拒絕區變窄,H0 為假時更不容易拒絕,所以 β 上升。檢定力 = 1 − β,β 上升則檢定力下降。兩類錯誤要一起降,需要增加樣本數。
- (B) n 不變時,α 變小不會讓 β 跟著變小。
- (C) 門檻變嚴使 β 變大,檢定力是下降,不是上升。
- (D) β 沒有被鎖住;α 變小而 n 不變時,β 會變大。
第 4 題
團隊用三種學習率各訓練一批模型。三批彼此獨立,損失近似常態,三組變異數相近。若要比較三種學習率的平均損失是否不同,適當的做法是?
- (A) 配對 t 檢定,因為三種學習率看的都是損失
- (B) 單因子 ANOVA;若顯著,再做事後比較,找出哪幾組不同
- (C) 卡方適合度檢定,看三組損失是否符合某個理論比例
- (D) 做三次獨立樣本 t 檢定、兩兩比較即可,整體型一錯誤仍是單次的 α
看答案與解析
答案:B
三組獨立、結果是平均損失、近似常態且變異數相近,用單因子 ANOVA。F 檢定顯著只說明至少有一組不同;哪幾組不同,要另做事後比較,例如 Tukey HSD。
- (A) 配對 t 需要同一批對象的前後或配對差值。三種學習率是三批獨立模型。
- (C) 卡方適合度檢定看次數是否符合理論比例,不是三組平均。
- (D) 三次兩兩 t 檢定會讓整體型一錯誤膨脹,不能把每一次的 α 當成整體仍然不變。
第 5 題
某電商想知道「會員等級」(一般、銀、金,共三類)和「是否回購」(是/否)是否相關。資料是各組合的人數。適用的檢定是?
- (A) Pearson 相關,因為題目在問兩個變數是否相關
- (B) 單因子 ANOVA,因為會員等級有三類
- (C) 卡方獨立性檢定
- (D) 配對 t 檢定,把「有回購」和「無回購」當成前後兩次
看答案與解析
答案:C
兩個變數都是類別,儲存的是人數,問題是兩者是否獨立。這是卡方獨立性檢定。
- (A) Pearson 相關用於兩個數值變數的線性相關,不是兩份類別次數。
- (B) ANOVA 比較的是各組平均。這裡沒有對回購計算平均,只有人數。
- (D) 沒有同一人的前後測。有回購與無回購是回購這個類別的兩個結果,不是配對差值。
第 6 題
某 A/B 測試比較新版與舊版的轉換率。兩者差距(新減舊)的 95% 信賴區間是 [0.4%, 1.8%]。在雙尾 α = 0.05 的設定下,下列哪一個說法站得住?
- (A) 真實差距有 95% 的機率落在 0.4% 到 1.8% 之間
- (B) 這個區間含有 0,所以不能拒絕「差距為 0」
- (C) 信賴區間不能對應檢定結論,必須另有 p 值才能判斷要不要拒絕 H0
- (D) 區間不含 0,所以雙尾 α = 0.05 下應拒絕「差距為 0」,差異顯著
看答案與解析
答案:D
H0 是差距 = 0。區間 [0.4%, 1.8%] 的下界 0.4% > 0,整段不含 0。雙尾 α = 0.05 時拒絕 H0,等價於 95% CI 不含 H0 的值,因此差異顯著。
- (A) 這是把已算出的區間讀成「真實差距有 95% 機率落在裡面」。頻率的讀法是:用同樣方法重複抽樣,約 95% 的區間會涵蓋真實差距。
- (B) 0.4% 到 1.8% 沒有經過 0,不能說區間含 0。
- (C) 在雙尾 α = 0.05 與 95% CI 這組對應下,看區間是否包含 0,就能決定是否拒絕「差距為 0」。
五、重點回顧
- p 值是「H0 為真時,出現至少一樣極端的資料」的機率;它不是 H0 為真的機率,也不是效果大小。
- p ≤ α 才拒絕 H0;p > α 只是不拒絕,不是證明沒有差異。型一錯誤機率等於 α,型二錯誤機率是 β,檢定力是 1 − β。
- 樣本數固定時,α 從 0.05 降到 0.01 會減少型一錯誤,同時使 β 上升、檢定力下降;兩類錯誤要一起降,必須增加樣本數。
- 選檢定時先看結果是平均、比例還是類別次數,再看組數與是否配對:σ 已知的單一樣本平均用 Z,σ 未知用 t;兩獨立組用獨立樣本 t,變異數不等改用 Welch;前後測用配對 t;三組以上平均用 ANOVA,顯著後再事後比較;兩個類別變數用卡方獨立性檢定,理論比例用卡方適合度檢定;兩組比例用兩比例 Z;不符合常態或順序資料,改用對應的 Mann-Whitney U、Wilcoxon 符號等級或 Kruskal-Wallis。
- 多次兩兩 t 檢定會使整體型一錯誤膨脹;Bonferroni 校正把每個檢定的門檻改為 α/m。
- σ 已知時,平均的 95% CI 是 x̄ ± 1.96 × σ/√n。雙尾 α = 0.05 下拒絕 H0,等價於 95% CI 不含 H0 的值。n 很大時極小差距也會顯著,判斷實務意義要同時看效果量。