跳到主要內容
Lab Grimoire
TW
請喝咖啡
動手實作

假設檢定與統計推論:p 值、兩類錯誤與檢定選擇

p 值、顯著水準、型一與型二錯誤、檢定力的正確意思,Z、t、配對 t、ANOVA、卡方與無母數檢定的選擇,以及信賴區間與檢定的對應。

作者
CY
發表
AI 的資料基礎:從統計到生成式 AI · 第 4/19 篇

本系列第 4 篇|這篇回答:只看到一部分樣本時,怎麼判斷差異是真的還是運氣? 讀完這篇,你應該能:

  • 正確說出 p 值與兩類錯誤的意思
  • 依資料型態與設計選對檢定
  • 讀懂信賴區間與檢定結果的對應

一、用樣本對母體下判斷

p ≤ α 才拒絕 H0,不拒絕並未證明 H0 為真。

詳細說明

拿到的幾乎都是樣本。要判斷的是母體的平均、比例,或組與組之間有沒有差異。假設檢定先寫下一個可被資料挑戰的說法,再問:若這個說法為真,眼前這批資料算不算罕見。

虛無假設(null hypothesis, H0)寫的是沒有差異、沒有效果。平台宣稱平均處理時間就是 50 秒時,H0 是母體平均 μ = 50。對立假設(alternative hypothesis, H1)是研究者想支持的方向:比 50 長、比 50 短,或只是不等於 50。檢定不從 H1 起算。它假設 H0 為真,再看「目前這麼極端,或更極端」的資料有多難得。難得的程度夠高,才拒絕 H0。

這個「難得的程度」是 p 值(p-value):在 H0 為真的前提下,得到至少與觀察結果一樣極端的資料的機率。p 值不是「H0 為真的機率」,也不是效果大小。它不回答母體到底差了幾秒、差了幾個百分點。

拒不拒絕,用事先訂好的 顯著水準(significance level, α)當門檻,常用 0.05。p ≤ α 就拒絕 H0;p > α 則不拒絕 H0。不拒絕只表示這批樣本還沒有把 H0 推開,不是證明 H0 為真。樣本小、波動大時,真的有差異,也可能停在不拒絕。

兩種錯誤的方向相反。

型一錯誤(Type I error)是 H0 為真卻拒絕,也就是偽陽性,機率等於 α。α = 0.05 時,若 H0 確實為真,長期而言約有 0.05 的檢定會誤拒絕。

型二錯誤(Type II error)是 H0 為假卻沒有拒絕,也就是偽陰性,機率記為 β。檢定力(power)是 H0 為假時成功拒絕的機率,power = 1 − β。

n 固定時,兩種錯誤彼此拉扯。α 從 0.05 調到 0.01,拒絕區變窄,型一錯誤變少,但同一批資料更難跨過門檻,β 變大,檢定力下降。想讓型一與型二一起下降,要增加樣本數,而不是只把 α 調小。

尾的選擇跟 H1 的寫法綁在一起。H1 是 μ > μ0 或 μ < μ0 時,用單尾檢定(one-tailed test),極端只算指定的那一側。H1 只問「是否不同」(μ ≠ μ0)時,用雙尾檢定(two-tailed test),兩側都算。同一筆資料、同一個 α,雙尾把門檻分到兩側,臨界值離 0 更遠,比單尾更不容易拒絕 H0。研究假設已設定方向,就用該側的臨界值,不要改套雙尾的臨界值。

二、選檢定的決策

先看三件事:結果是平均、比例,還是類別次數;有幾組;各筆是不同的人,還是同一人的前後測。母體標準差 σ 知不知道,只決定「一個平均」這條要用 Z 還是 t。

一個平均:Z 或 t

σ 已知用 Z 檢定,分母是 σ/√n;未知就改用 t 檢定。

詳細說明

只有一組樣本,要檢驗母體平均是否等於 H0 所寫的 μ0。σ 已知時用 Z 檢定(Z-test):

z = (x̄ − μ0) / (σ / √n)

分母 σ/√n 是樣本平均的標準誤。n 愈大,標準誤愈小,同樣的差距 x̄ − μ0 會得到愈大的 |z|。

以這個可手算的設計為例。H0: μ = 50,H1: μ > 50,σ = 12,n = 16,x̄ = 55。

σ/√n = 12/√16 = 12/4 = 3

z = (55 − 50) / 3 = 5/3 ≈ 1.67

右尾、α = 0.05 的臨界值是 1.645。1.67 > 1.645,拒絕 H0。這個 z 的右尾 p 值約為 0.048,也小於 0.05。若分母誤用 σ、沒有除以 √n,會得到 z = (55 − 50)/12 = 5/12 ≈ 0.42,結論就反了。

σ 未知、只有樣本標準差時,改用t 檢定(t-test)裡的單一樣本 t 檢定。標準誤改由樣本標準差估計,臨界值來自 t 分配,不能直接沿用常態的 1.645 或 1.96,除非分析規格另外提供 t 的臨界值。

兩組與多組平均

人不同用獨立樣本 t,前後用配對 t,三組以上用單因子變異數分析。

詳細說明

兩群不同的人、各有一個平均,用獨立樣本 t 檢定(independent-samples t-test)。兩組變異數不相等時,改用 Welch t 檢定(Welch's t-test),不要再用假設變異數相等的那一版。

同一群人前後各量一次,或本來就配對的兩筆,用配對 t 檢定(paired t-test)。先算每一對的差值,再對差值做單一樣本 t,H0 通常是差值的母體平均為 0。把前後測拆成兩組獨立樣本,會忽略「是同一個人」這件事,問的就不再是這題的改變。

三組以上的平均,各組獨立,用單因子變異數分析(one-way ANOVA),統計量是 F。若研究資料近似常態且變異數相近,就符合這條。ANOVA 顯著只表示至少有一組與其他組不同,沒有指出是哪一組。要知道哪幾組不同,接事後比較(post hoc test),例如 Tukey HSD。若改做多次兩兩 t 檢定,每一次都帶著自己的 α,整體型一錯誤會膨脹,不能把「每一次都用 0.05」當成整體仍是 0.05。

類別、比例,以及非常態

卡方吃次數,兩組比例用兩比例 Z,非常態改用對應的無母數檢定。

詳細說明

兩個類別變數是否相關,用卡方獨立性檢定(chi-square test of independence)。表裡是次數。會員等級三類、回購只有是否,問的就是等級與回購是否獨立。觀察次數是否符合某個理論比例,用卡方適合度檢定(chi-square goodness-of-fit test)。兩種卡方都吃次數;同一人的前後測數值不進卡方。

兩組比例,例如 A/B 測試的轉換率,用兩比例 Z 檢定(two-proportion Z-test)。比的是比例,不是平均。

資料不符合常態,或變數只是順序,改用無母數檢定(nonparametric test)。兩組獨立用 Mann-Whitney U 檢定;配對用 Wilcoxon 符號等級檢定(Wilcoxon signed-rank test);三組以上用 Kruskal-Wallis 檢定。對應仍是:獨立對獨立、配對對配對、多組對多組。

信賴區間怎麼和檢定對上

雙尾 α = 0.05 拒絕 H0,等價於 95% CI 不含該值。

詳細說明

σ 已知時,母體平均的 95% 信賴區間(confidence interval, CI)是:

x̄ ± 1.96 × (σ / √n)

1.96 是標準常態在雙尾、兩側合計 0.05 時的臨界值。解讀指的是重複抽樣:用同樣方法抽很多次,約 95% 的區間會涵蓋真實的 μ。區間算出之後,不要把它說成「真實 μ 有 95% 的機率落在這一條區間裡」。

在同一參數、同一組假設下,雙尾檢定和信賴區間是同一件事的兩種寫法。雙尾 α = 0.05 時拒絕 H0,等價於 95% CI 不含 H0 所寫的值。比的若是兩組差距,H0 通常是差距 = 0;95% CI 不含 0,就對應這個顯著水準下拒絕 H0。區間是 [0.4%, 1.8%] 時,下界已經大於 0,不必再等一個 p 值才能做這個對應。區間若跨過 0,則同一水準下不拒絕 H0。

多重比較與大樣本

同時做 m 個檢定時門檻改為 α/m,顯著還要看效果量。

詳細說明

同時做 m 個檢定時,Bonferroni 校正(Bonferroni correction)把每一個檢定的門檻改為 α/m。它處理的是整體型一錯誤,不是把差異本身變大。門檻變嚴,個別檢定更不容易拒絕,和「n 不變、只把 α 調小」是同一種拉扯。

另一個陷阱在 n 非常大。標準誤的分母有 √n,n 一大,極小的差距也能跨過臨界值。顯著只表示這個差距不太像單純的抽樣波動。實務上要不要行動,還要看效果量(effect size),把差距的大小和決策在意的幅度放在一起。p 值小,不自動等於值得改做法。

程式對照

equal_var=False 才是 Welch,配對不可改送獨立。

詳細說明

scipy.stats 的呼叫與前面的選擇對上。a、b、before、after、g1、g2、g3 是數值資料,table 是列聯表的次數。

from scipy import stats

def welch_t(a, b):
    return stats.ttest_ind(a, b, equal_var=False)

def paired_t(before, after):
    return stats.ttest_rel(before, after)

def one_way_anova(g1, g2, g3):
    return stats.f_oneway(g1, g2, g3)

def chi2_independence(table):
    return stats.chi2_contingency(table)

equal_var=False 才是 Welch。前後測要用 ttest_rel,兩筆依同一順序配對;打散之後再送進 ttest_ind,就不再是配對設計。

三、容易混淆的地方

實務上常把幾個條件混在一起:資料來自同一批人還是兩批人、要比較平均還是次數、門檻有沒有事先調緊。

容易混淆 差別在哪 實際遇到時的線索
p 值 vs「H0 為真的機率」 p 值先假設 H0 為真,再算資料至少這麼極端的機率。它不是 H0 本身的機率,也不是效果大小。 分析報告若把 p 值寫成「H0 為真的機率」,或當成差異大小,就混淆了概念。
不拒絕 H0 vs 接受 H0 不拒絕表示證據還不夠拒絕。接受 H0 等於宣稱沒有差異,檢定給不出這個證明。 研究結論若寫成「證明兩組相同」或「因此 H0 為真」,就把不拒絕誤作接受。
型一錯誤 vs 型二錯誤 型一是 H0 為真卻拒絕,機率 = α。型二是 H0 為假卻不拒絕,機率 = β。檢定力 = 1 − β。n 固定而 α 變小,則 β 變大、檢定力下降。 分析備忘錄記錄「α 從 0.05 改為 0.01,n 不變」,卻預期兩種錯誤都下降或檢定力上升,表示判讀有誤。
獨立樣本 t vs 配對 t 獨立 t 比較兩群不同的觀測。配對 t 用同一對的差值,檢定差值平均是否為 0。 研究設計若讓同一批人前後各量一次,資料是配對;若參與者隨機分到兩組、各量一次,則是獨立。
ANOVA vs 多次 t 檢定 ANOVA 一次比較三組以上的平均;顯著只表示至少有一組不同,還要事後比較。多次兩兩 t 會使整體型一錯誤膨脹。 分析計畫若對三組以上各做一次 t 檢定,卻認為整體 α 仍是 0.05,就忽略了整體型一錯誤膨脹。
統計顯著 vs 實務重要 顯著表示差異不像純抽樣波動。n 很大時,極小差異也會顯著。要不要行動要看效果量。 報告中的 p 值很小,但差距在實務上可忽略,仍不能只憑統計顯著就決定改做法。

單尾和雙尾也常被臨界值帶錯。右尾 α = 0.05 看 1.645,雙尾 α = 0.05 看 1.96。H1 已經寫了方向,就用單尾那個臨界值。

四、基礎練習

第 1 題

某診所讓 40 位病患導入一套用藥提醒。每一位在導入前量一次血壓,導入後再量一次。40 筆「後減前」的差值近似常態。若要檢驗血壓是否有改變,最適合的檢定是哪一個?

  • (A) 獨立樣本 t 檢定
  • (B) 卡方獨立性檢定
  • (C) 配對 t 檢定
  • (D) 單因子 ANOVA
看答案與解析

答案:C

同一位病患有前、後兩次測量,分析用的是 40 筆差值,差值又近似常態,所以對差值做單一樣本 t,也就是配對 t 檢定。

  • (A) 獨立樣本 t 把前後測當成兩群互不對應的人,忽略同一人的配對。
  • (B) 卡方獨立性檢定處理兩個類別變數的次數,這裡是數值差值。
  • (D) 單因子 ANOVA 用於三組以上的平均,本題只有前與後這一對。

第 2 題

某平台宣稱工單平均處理時間為 50 秒。母體標準差 σ = 12 秒已知。抽 16 筆得到 x̄ = 55 秒。研究問題是平均是否長於 50 秒,用右尾 α = 0.05,臨界值 1.645。下列哪一個判斷正確?

  • (A) z = 5/12 ≈ 0.42,小於 1.645,不拒絕 H0
  • (B) z ≈ 1.67,但右尾 p ≈ 0.95,所以不拒絕 H0
  • (C) z ≈ 1.67,小於雙尾臨界值 1.96,不拒絕 H0
  • (D) z = (55 − 50) / (12/4) ≈ 1.67,大於 1.645,拒絕 H0
看答案與解析

答案:D

H0: μ = 50,H1: μ > 50。標準誤 σ/√n = 12/√16 = 12/4 = 3。z = (55 − 50) / 3 = 5/3 ≈ 1.67。1.67 > 1.645,右尾拒絕 H0。右尾 p ≈ 0.048,也小於 0.05。

  • (A) 分母誤用 σ = 12,沒有除以 √n。5/12 ≈ 0.42 不是這個設計的 z。
  • (B) z ≈ 1.67 這一步算對,但右尾 p 約為 0.048,不是 0.95。
  • (C) 1.96 是雙尾 α = 0.05 的臨界值。本題 H1 是「大於」,要用右尾臨界值 1.645。

第 3 題

某工廠以固定的樣本數,檢驗新參數能否降低不良率。原本 α = 0.05,現在改為 α = 0.01,樣本數不變。這個調整對兩類錯誤和檢定力的影響是?

  • (A) 型一錯誤機率下降,型二錯誤機率上升,檢定力下降
  • (B) 型一錯誤與型二錯誤的機率都下降
  • (C) 型一錯誤機率下降,檢定力上升
  • (D) 型一錯誤機率下降,β 維持不變
看答案與解析

答案:A

型一錯誤的機率就是 α,從 0.05 降到 0.01,型一錯誤變少。n 固定時拒絕區變窄,H0 為假時更不容易拒絕,所以 β 上升。檢定力 = 1 − β,β 上升則檢定力下降。兩類錯誤要一起降,需要增加樣本數。

  • (B) n 不變時,α 變小不會讓 β 跟著變小。
  • (C) 門檻變嚴使 β 變大,檢定力是下降,不是上升。
  • (D) β 沒有被鎖住;α 變小而 n 不變時,β 會變大。

第 4 題

團隊用三種學習率各訓練一批模型。三批彼此獨立,損失近似常態,三組變異數相近。若要比較三種學習率的平均損失是否不同,適當的做法是?

  • (A) 配對 t 檢定,因為三種學習率看的都是損失
  • (B) 單因子 ANOVA;若顯著,再做事後比較,找出哪幾組不同
  • (C) 卡方適合度檢定,看三組損失是否符合某個理論比例
  • (D) 做三次獨立樣本 t 檢定、兩兩比較即可,整體型一錯誤仍是單次的 α
看答案與解析

答案:B

三組獨立、結果是平均損失、近似常態且變異數相近,用單因子 ANOVA。F 檢定顯著只說明至少有一組不同;哪幾組不同,要另做事後比較,例如 Tukey HSD。

  • (A) 配對 t 需要同一批對象的前後或配對差值。三種學習率是三批獨立模型。
  • (C) 卡方適合度檢定看次數是否符合理論比例,不是三組平均。
  • (D) 三次兩兩 t 檢定會讓整體型一錯誤膨脹,不能把每一次的 α 當成整體仍然不變。

第 5 題

某電商想知道「會員等級」(一般、銀、金,共三類)和「是否回購」(是/否)是否相關。資料是各組合的人數。適用的檢定是?

  • (A) Pearson 相關,因為題目在問兩個變數是否相關
  • (B) 單因子 ANOVA,因為會員等級有三類
  • (C) 卡方獨立性檢定
  • (D) 配對 t 檢定,把「有回購」和「無回購」當成前後兩次
看答案與解析

答案:C

兩個變數都是類別,儲存的是人數,問題是兩者是否獨立。這是卡方獨立性檢定。

  • (A) Pearson 相關用於兩個數值變數的線性相關,不是兩份類別次數。
  • (B) ANOVA 比較的是各組平均。這裡沒有對回購計算平均,只有人數。
  • (D) 沒有同一人的前後測。有回購與無回購是回購這個類別的兩個結果,不是配對差值。

第 6 題

某 A/B 測試比較新版與舊版的轉換率。兩者差距(新減舊)的 95% 信賴區間是 [0.4%, 1.8%]。在雙尾 α = 0.05 的設定下,下列哪一個說法站得住?

  • (A) 真實差距有 95% 的機率落在 0.4% 到 1.8% 之間
  • (B) 這個區間含有 0,所以不能拒絕「差距為 0」
  • (C) 信賴區間不能對應檢定結論,必須另有 p 值才能判斷要不要拒絕 H0
  • (D) 區間不含 0,所以雙尾 α = 0.05 下應拒絕「差距為 0」,差異顯著
看答案與解析

答案:D

H0 是差距 = 0。區間 [0.4%, 1.8%] 的下界 0.4% > 0,整段不含 0。雙尾 α = 0.05 時拒絕 H0,等價於 95% CI 不含 H0 的值,因此差異顯著。

  • (A) 這是把已算出的區間讀成「真實差距有 95% 機率落在裡面」。頻率的讀法是:用同樣方法重複抽樣,約 95% 的區間會涵蓋真實差距。
  • (B) 0.4% 到 1.8% 沒有經過 0,不能說區間含 0。
  • (C) 在雙尾 α = 0.05 與 95% CI 這組對應下,看區間是否包含 0,就能決定是否拒絕「差距為 0」。

五、重點回顧

  • p 值是「H0 為真時,出現至少一樣極端的資料」的機率;它不是 H0 為真的機率,也不是效果大小。
  • p ≤ α 才拒絕 H0;p > α 只是不拒絕,不是證明沒有差異。型一錯誤機率等於 α,型二錯誤機率是 β,檢定力是 1 − β。
  • 樣本數固定時,α 從 0.05 降到 0.01 會減少型一錯誤,同時使 β 上升、檢定力下降;兩類錯誤要一起降,必須增加樣本數。
  • 選檢定時先看結果是平均、比例還是類別次數,再看組數與是否配對:σ 已知的單一樣本平均用 Z,σ 未知用 t;兩獨立組用獨立樣本 t,變異數不等改用 Welch;前後測用配對 t;三組以上平均用 ANOVA,顯著後再事後比較;兩個類別變數用卡方獨立性檢定,理論比例用卡方適合度檢定;兩組比例用兩比例 Z;不符合常態或順序資料,改用對應的 Mann-Whitney U、Wilcoxon 符號等級或 Kruskal-Wallis。
  • 多次兩兩 t 檢定會使整體型一錯誤膨脹;Bonferroni 校正把每個檢定的門檻改為 α/m。
  • σ 已知時,平均的 95% CI 是 x̄ ± 1.96 × σ/√n。雙尾 α = 0.05 下拒絕 H0,等價於 95% CI 不含 H0 的值。n 很大時極小差距也會顯著,判斷實務意義要同時看效果量。

覺得有幫助? RSS · X · 請我喝杯咖啡

列是 H0 為真或為假,欄是不拒絕或拒絕;四格裡有兩格是錯誤。

錯誤取決於真相與檢定決定
1 / 5
表頭分成真實情況與決定
H0 為真卻拒絕是型一錯誤 α;H0 為假卻不拒絕是型二錯誤 β。
  1. 列放 H0 的真假,欄放不拒絕或拒絕。兩種錯誤都是某一列配上某一欄,不是整列都錯。
  2. 不拒絕在這一列是正確決定。落到拒絕就是偽陽性,長期機率等於事先訂下的 α。
  3. α = 0.05 且 H0 確實為真時,長期約有 0.05 的檢定會落在這格。那就是誤拒絕。
  4. H0 為假卻不拒絕是偽陰性,機率記為 β。成功拒絕的機率是檢定力,等於 1 − β。
  5. n 固定而 α 從 0.05 調到 0.01 時,型一變少,β 卻變大。兩種錯誤要一起下降,得增加樣本數。

標準常態上先有雙尾切點 ±1.96,文章例的 z ≈ 1.67 畫在右側、尚未碰到 1.96。

檢定統計量跨過門檻才拒絕
1 / 3
畫出標準常態曲線
雙尾 α = 0.05 的切點是 ±1.96;文章的單尾例子 z ≈ 1.67,超過右尾門檻 1.645。
  1. σ 已知時統計量才放上這條曲線。分母若誤用 σ、沒除以 √n,例題會得到 z ≈ 0.42,結論就反了。
  2. 1.96 是標準常態在雙尾、兩側合計 0.05 的臨界值。同一個 α 下,雙尾臨界值離 0 更遠,比單尾更不容易拒絕 H0。
  3. 例題是右尾、α = 0.05,臨界值 1.645。1.67 > 1.645,故拒絕 H0,右尾 p 值約 0.048。這條線仍在 1.96 左側。

依人數與是否同一批人分四條:一個平均、兩組獨立、前後測、三組以上。

檢定選擇先看資料是否配對
1 / 4
一個平均:Z 或單一樣本 t
兩組不同的人用獨立樣本 t;同一批人前後測用配對 t;三組以上先用 ANOVA。
  1. 只有一組、要檢驗母體平均是否等於 μ0,就停在這節點。σ 已知用 Z 檢定,只有樣本標準差則改單一樣本 t。
  2. 兩群人各有一個平均,用獨立樣本 t 檢定。變異數不相等要改用 Welch t 檢定,不再用變異數相等那一版。
  3. 先算每一對差值,再對差值做單一樣本 t,H0 通常是差值的母體平均為 0。拆成兩組獨立樣本,問的就不再是這題的改變。
  4. 各組獨立、近似常態且變異數相近時,用單因子變異數分析,統計量是 F。顯著只表示至少一組不同;多次兩兩 t 每次帶著自己的 α,整體型一錯誤會膨脹。

0 的位置先標出來,兩端 0.4% 與 1.8% 都在它右側,區間因此沒有蓋到它。

信賴區間不含零,就拒絕零差異
1 / 3
先標出比較用的 μ₀ = 0
文章的 95% CI 為 [0.4%, 1.8%],不含 μ₀ = 0;等價於雙尾 α = 0.05 時拒絕 H0。
  1. 比兩組差距時,H0 通常是差距 = 0。雙尾檢定要看區間有沒有蓋住這個值。
  2. 文章給的區間是 [0.4%, 1.8%]。兩端都大於 0,下界已經過了 μ₀,所以這條區間不會含 0。
  3. 同一參數、同一組假設下,雙尾 α = 0.05 時拒絕 H0,等價於 95% CI 不含該值。區間若跨過 0,同一水準下不拒絕 H0。

畫面是 k 次檢定的 1 − 0.95ᵏ,三根長條分別為 0.050、0.143、0.401。

偷看次數增加,整體誤報上升
1 / 3
k = 1 的長條等於 0.050
每次檢定用 0.05 時,至少一次型一錯誤的機率依序為 0.050、0.143、0.401。
  1. 只做一次、門檻 0.05 時,至少一次誤拒絕的機率與這次的 α 相同,還沒有因為重複檢定而膨脹。
  2. 三次檢定若各自保持 0.05,整體就不再是 0.05。Bonferroni 校正把每一個門檻改成 α/m,處理的是整體型一錯誤,不是把差異變大。
  3. 10 次檢定各用 0.05,至少一次誤報的機率約 0.401。門檻改成 α/m 能壓回整體型一錯誤,代價是個別檢定更不容易拒絕。

動手試試兩組平均用 T 檢定,可選獨立或配對;三組以上用 ANOVA。兩個工具都附範例資料。

T 檢定ANOVA