跳到主要內容
Lab Grimoire
TW
請喝咖啡
動手實作

機率分佈:二項、卜瓦松、常態與中央極限定理

從資料產生方式選分佈:二項、卜瓦松、指數、常態與負二項的使用情境、平均與變異數,以及中央極限定理與標準誤的意義。

作者
CY
發表
AI 的資料基礎:從統計到生成式 AI · 第 3/19 篇

本系列第 3 篇|這篇回答:資料是怎麼產生的?為什麼同一類現象可以用同一個分佈描述? 讀完這篇,你應該能:

  • 依「固定 n 次成敗、區間內次數、等待時間、連續測量」判斷該用哪一種分佈。
  • 算出伯努利、二項、卜瓦松等常見分佈的平均與變異數,並把算式留下。
  • 用中央極限定理與標準誤解釋樣本平均的抽樣行為,並把它和原始資料分開。

一、原理:分佈是資料怎麼產生的模型

選分佈時對的是問題形狀,不是產業名稱。

詳細說明

機率要先有一個會變的量。機率分佈描述一個隨機變數各種結果的可能性:哪些結果比較容易出現,哪些很少。

數得出來的次數是離散型,用機率質量函數(probability mass function, PMF)。PMF 給的是「正好等於這個點」的機率。一個合格的 PMF 裡,所有可能點的機率加總為 1。

量出來的長度、時間、金額是連續型,用機率密度函數(probability density function, PDF)。密度是曲線的高度,機率是曲線在一個區間上的面積。單點沒有寬度,面積是 0,所以單點機率是 0。連續分佈要回答的是一段區間。

「落到某個值以左」的機率寫成累積分佈函數(cumulative distribution function, CDF):

F(x) = P(X ≤ x)

x 增大時,事件 {X ≤ x} 只會多納入結果,或維持不變,所以 F 從 0 單調不減,終點是 1。標準常態(standard normal;平均 0、標準差 1,記作 Z)有一個常用切點:P(Z ≤ 1.96) ≈ 0.975。分佈左右對稱,左尾是

P(Z ≤ −1.96) = 1 − 0.975 = 0.025

兩切點中間就是

P(−1.96 ≤ Z ≤ 1.96) = 0.975 − 0.025 = 0.95

選分佈時對的是問題形狀,不是產業名稱。固定做了 n 次獨立的成功/失敗試驗,要的是成功次數。在一段固定的時間或空間裡數事件發生幾次,試驗次數沒有事先固定的上限。問的是下一次還要再等多久。問的是一個量出來的連續值,要看它在區間裡怎麼散。場景從客服換成產線,只要資料產生的方式沒變,分佈就還是同一個。

二、方法:常見分佈(名稱、情境、平均、變異數)

計數模型

固定 n 次成敗用二項分佈,區間內次數用卜瓦松分佈。

詳細說明

伯努利分佈(Bernoulli)只有一次試驗。成功機率是 p,失敗機率是 1 − p。平均是 p,變異數是 p(1 − p)。

二項分佈(Binomial)把這種試驗獨立重複 n 次,每次成功機率都是同一個 p,再數成功的次數。每一次的平均與變異數相同,n 次獨立相加之後,平均是 np,變異數是 np(1 − p)。

n = 10、p = 0.2 時:

平均 10 × 0.2 = 2

變異數 10 × 0.2 × (1 − 0.2) = 10 × 0.2 × 0.8 = 1.6

卜瓦松分佈(Poisson)數的也是次數,產生方式換了:在你劃定的那段時間或空間裡,事件彼此獨立,平均發生率 λ 維持穩定。模型的參數是 λ。試驗次數 n 不進入這個模型。

P(X = k) = e^(−λ) λ^k / k!

平均與變異數都等於 λ。λ = 3、k = 0 時,3^0 = 1,0! = 1,所以

P(X = 0) = e^(−3) × 1 / 1 = e^(−3) ≈ 0.0498

計數資料的變異數若明顯大於平均數,就出現過度離散(overdispersion)。卜瓦松把平均和變異數定成同一個 λ,這條假設對不上。這種計數常改用負二項分佈(Negative Binomial)。

連續模型

等待用指數分佈,對稱用常態分佈,正值且右偏用對數常態分佈。

詳細說明

同一條卜瓦松過程,若改問兩次事件之間的等待時間,用指數分佈(Exponential)。平均等待是 1/λ。它具有無記憶性(memoryless):已經等待的時間,不改變從現在起還要再等多久的機率。

均勻分佈(Uniform)用在一個區間內部,每個值的機率密度相同。密度是平的。

常態分佈(Normal)是對稱的鐘形。位置由平均 μ 決定,寬度由標準差 σ 決定,變異數是 σ²。經驗法則用三個區間記大概的落點:

  • 約 68% 在 μ ± 1σ
  • 約 95% 在 μ ± 2σ
  • 約 99.7% 在 μ ± 3σ

標準常態寫成 Z ~ N(0, 1)。第一節那個 1.96,兩側蓋住約 0.95。經驗法則把 1.96 收成好算的 2,用 μ ± 2σ 記約 95%。

對數常態分佈(Log-normal)是取對數之後成常態。原始值為正、而且右偏時會見到它,所得和交易金額是典型情境。取對數可以讓形狀接近對稱。

二項的次數在樣本條件夠寬時,可以用常態近似。常用經驗規則是 np ≥ 5 且 n(1 − p) ≥ 5,兩條同時成立,才用平均 np、變異數 np(1 − p) 的常態去近似。回到 n = 10、p = 0.2:np = 2,尚未達到 5;n(1 − p) = 8,已達到 5。兩條要同時成立,這組數字還不適合做常態近似。

樣本平均的抽樣分佈

樣本平均數在 n ≥ 30 時近似常態,標準誤是 σ / √n。

詳細說明

中央極限定理(central limit theorem, CLT)的對象是樣本平均數。不論母體是什麼形狀,只要樣本數夠大,常用經驗值 n ≥ 30,樣本平均數的抽樣分佈就近似常態。這個常態的平均仍是母體平均 μ,標準差稱為標準誤(standard error, SE):

SE = σ / √n

σ = 12、n = 36 時,√36 = 6,SE = 12 / 6 = 2。樣本數變為 4 倍時,n = 36 × 4 = 144,√144 = 12,SE = 12 / 12 = 1,是原來的一半。標準誤跟著 √n 走。

定理近似的是樣本平均數的抽樣分佈。每一筆原始資料仍按母體原來的分佈出現。

程式對照

pmf 算單點機率,cdf 算累積,ppf 算 CDF 的反函數。

詳細說明

scipy.stats 用 pmf 算離散分佈的單點機率,用 cdf 算累積,用 ppf 算 CDF 的反函數。

from scipy import stats

n, p = 10, 0.2
mean_binom = n * p                    # 10 * 0.2 = 2
var_binom = n * p * (1 - p)           # 10 * 0.2 * 0.8 = 1.6
binom_pmf = stats.binom.pmf(2, n, p)

poisson_pmf = stats.poisson.pmf(0, 3)  # e^(-3) ≈ 0.0498
norm_cdf = stats.norm.cdf(1.96)        # P(Z ≤ 1.96) ≈ 0.975
norm_ppf = stats.norm.ppf(0.975)       # CDF 的反函數,約 1.96

三、容易混淆的地方

五組配對看的是「資料到底在數什麼」。差別先看第二欄,實務資料中可觀察到的線索看第三欄。

容易混淆 差別在哪 實際遇到時的線索
二項分佈 vs 卜瓦松分佈 二項有固定試驗次數 n,每次成功機率同為 p,平均 np、變異數 np(1−p)。卜瓦松是一段區間裡的發生次數,參數是 λ,平均與變異數都等於 λ。 資料記錄固定試驗次數 n 與每次成功機率 p;事件日誌若記每小時或每區段平均 λ 次、沒有固定 n,則對應卜瓦松。
卜瓦松分佈 vs 指數分佈 卜瓦松數「幾次」。指數量同一過程裡兩次事件的等待時間,平均 1/λ,並具無記憶性。 監控資料統計事件發生次數時用卜瓦松;若衡量同一過程兩次事件間的等待時間,則用指數。
PDF vs CDF PDF 是密度;連續分佈的機率來自區間面積,單點機率為 0。CDF 是 F(x) = P(X ≤ x),從 0 單調不減到 1。計數的單點則用 PMF。 資料需求是計算正好 k 次時找 PMF;要算不大於某值或累積到某值時找 CDF。stats.norm.cdf(1.96) 約 0.975,stats.norm.ppf(0.975) 約 1.96。
標準差 vs 標準誤 標準差 σ 描述個別資料離平均有多遠。標準誤描述樣本平均數的分散,SE = σ / √n。 分析報告描述個別資料離平均多遠時看標準差;描述抽樣平均值的分散時看標準誤。σ = 12、n = 36 時,SE = 2。
中央極限定理的對象 n 夠大(常用 n ≥ 30)時,近似成常態的是樣本平均數的抽樣分佈,平均 μ、標準差為 SE。原始資料保持母體原來的形狀。 報告若分析樣本平均,n 夠大(常用 n ≥ 30)時可用常態近似;若分析單筆觀測,筆數多仍不會讓原始資料變成常態。

四、基礎練習

六題都先判斷資料怎麼產生,再決定要算平均、變異數、單點機率或標準誤。

第 1 題

某電商的客服中心要為「每小時進線次數」配模型。進線彼此獨立,平均發生率在這段營運時間裡維持穩定。分析時沒有設定「每小時只做固定的 n 次試驗」。適合的模型是哪一個?

  • (A) 二項分佈
  • (B) 卜瓦松分佈
  • (C) 常態分佈
  • (D) 均勻分佈
看答案與解析

答案:B

固定一小時內的事件次數,事件獨立、平均發生率穩定,這是卜瓦松的產生方式。模型用的是這段區間上的 λ。

  • (A) 二項分佈要先有固定的試驗次數 n,以及每次相同的成功機率 p。情境沒有這個 n。
  • (C) 常態分佈用於連續測量的鐘形。進線是計數,次數不大時還可能偏斜。
  • (D) 均勻分佈表示區間內每個值的密度相同。穩定的平均發生率並沒有給出這種平坦的形狀。

第 2 題

某網站的錯誤次數符合卜瓦松分佈,每分鐘平均 2 次(λ = 2)。某一分鐘完全沒有錯誤的機率是多少?

  • (A) 0
  • (B) 0.5
  • (C) 2e^(−2) ≈ 0.271
  • (D) e^(−2) ≈ 0.135
看答案與解析

答案:D

P(X = 0) = e^(−λ) × λ^0 / 0!。代入 λ = 2:λ^0 = 1,0! = 1,所以 P(X = 0) = e^(−2) × 1 / 1 = e^(−2) ≈ 0.135。

  • (A) 0 把「平均每分鐘 2 次」讀成「這一分鐘不可能是 0」。平均是長期的發生率,單點 k = 0 仍有機率。
  • (B) 0.5 對不上 e^(−λ) λ^k / k! 在 k = 0 的結果。
  • (C) 2e^(−2) = e^(−2) × 2^1 / 1! ≈ 0.271,那是 P(X = 1)。

第 3 題

某工廠彙總機台的異常次數,平均是 4,變異數是 15。模型該怎麼處理?

  • (A) 視為過度離散;卜瓦松「平均=變異數」不成立,改用負二項分佈
  • (B) 資料是計數,繼續使用卜瓦松分佈
  • (C) 改用均勻分佈
  • (D) 取平均數 4 作為模型即可
看答案與解析

答案:A

卜瓦松要求平均=變異數=λ。這裡平均是 4、變異數是 15,15 明顯大於 4,假設不成立。計數資料的這種過度離散,常改用負二項分佈。

  • (B) 「是計數」只說明要用離散模型,沒有保住平均等於變異數。
  • (C) 均勻分佈描述區間內密度相同,對不上「次數的變異數大於平均」。
  • (D) 平均 4 只定了中心位置。變異數 15 已經否定「用同一個 λ 同時當變異數」。

第 4 題

某產線的零件尺寸,母體標準差是 20。抽出 100 筆計算樣本平均。這個樣本平均的標準誤是多少?

  • (A) 20
  • (B) 0.2
  • (C) 2
  • (D) 200
看答案與解析

答案:C

SE = σ / √n = 20 / √100 = 20 / 10 = 2。

  • (A) 20 是個別尺寸的標準差 σ。標準誤還要再除以 √n。
  • (B) 20 / 100 = 0.2,分母用成 n,少了平方根。
  • (D) 20 × 10 = 200,把除以 √n 做成了乘上 √n。

第 5 題

某電商寄出 50 封行銷信。每封是否被打開互相獨立,開信率都是 0.1。開信封數的平均與變異數是多少?

  • (A) 平均 5、變異數 5
  • (B) 平均 5、變異數 4.5
  • (C) 平均 0.1、變異數 4.5
  • (D) 平均 5、變異數 0.09
看答案與解析

答案:B

開信封數是 n = 50、p = 0.1 的二項分佈。

平均 np = 50 × 0.1 = 5

變異數 np(1 − p) = 50 × 0.1 × 0.9 = 4.5

  • (A) 平均 5、變異數 5 把平均和變異數設成同一個數,那是卜瓦松。這裡 n 與 p 都固定,變異數還要乘上 (1 − p)。
  • (C) 0.1 是單封信的開信率 p。50 封的開信數,平均要乘上 n,得 5。
  • (D) 0.09 = 0.1 × 0.9 = p(1 − p),是單封伯努利的變異數。50 封獨立相加還要再乘 n,得 4.5。

第 6 題

某工廠有一項製程指標,近似常態,平均 100、標準差 15。依經驗法則,約 95% 的個別觀測落在哪個範圍?

  • (A) 85 到 115
  • (B) 55 到 145
  • (C) 只有平均與標準差,無法判斷
  • (D) 70 到 130
看答案與解析

答案:D

約 95% 落在 μ ± 2σ。2σ = 2 × 15 = 30,所以下界 100 − 30 = 70,上界 100 + 30 = 130。

  • (A) 100 ± 15 得到 85 到 115,是 μ ± 1σ,約 68%。
  • (B) 3σ = 3 × 15 = 45,100 ± 45 得到 55 到 145,是 μ ± 3σ,約 99.7%。
  • (C) 題目已給近似常態、平均與標準差。經驗法則的三個區間可以直接算。

五、重點回顧

  • 選分佈先看資料怎麼產生:單次成敗是伯努利,固定 n 次獨立成敗的成功次數是二項,固定區間裡的事件次數是卜瓦松,兩次事件的等待時間是指數,區間內密度相同是均勻,對稱鐘形是常態,正值右偏且取對數後成常態是對數常態。
  • 伯努利的平均是 p、變異數是 p(1−p)。二項的平均是 np、變異數是 np(1−p)。n = 10、p = 0.2 時,平均 10 × 0.2 = 2,變異數 10 × 0.2 × 0.8 = 1.6。
  • 卜瓦松的 P(X = k) = e^(−λ) λ^k / k!,平均與變異數都是 λ。λ = 3 時,P(X = 0) = e^(−3) ≈ 0.0498。計數的變異數明顯大於平均,就是過度離散,常改用負二項。
  • 指數分佈的平均等待是 1/λ,並具無記憶性。常態約 68%、95%、99.7% 落在 ±1σ、±2σ、±3σ。二項要做常態近似,常用門檻是 np ≥ 5 且 n(1−p) ≥ 5。
  • 標準誤 SE = σ / √n,描述樣本平均的分散。σ = 12、n = 36 時,SE = 12 / 6 = 2。樣本數變為 4 倍,標準誤減半。
  • 中央極限定理在樣本數夠大(常用 n ≥ 30)時,把樣本平均的抽樣分佈近似成平均 μ、標準差為 SE 的常態。原始每一筆資料保持母體原來的形狀。

覺得有幫助? RSS · X · 請我喝杯咖啡

沿箭頭的順序看:先是產生方式的三個問句,接著才是分佈與平均、變異數。

先辨認資料怎麼產生
1 / 3
先出現產生方式的問句
固定次數的成敗看二項;固定區間的事件次數看卜瓦松;量測值看連續分佈。
  1. 問的是固定 n 次成敗、固定時間或空間裡的事件次數,還是量出來的連續值。對的是問題形狀,不是產業名稱。
  2. 固定次數的成敗看二項分佈,固定區間的事件次數看卜瓦松分佈,量出來的連續值看連續模型。
  3. 平均與變異數由該分佈的參數與假設決定。場景從客服換成產線,產生方式不變,分佈就還是同一個。

先看 n = 10、p = 0.2 各 k 的長條高度,再看 λ = 3 時同一組 k 的高度。

二項平均是 np,卜瓦松平均是 λ
1 / 2
二項長條,高峰在 k = 2
n = 10、p = 0.2 的二項平均為 2;λ = 3 的卜瓦松平均為 3。機率依文章參數計算。
  1. n = 10、p = 0.2 時平均是 10 × 0.2 = 2,變異數是 1.6。二項分佈把成功機率同為 p 的試驗獨立做了 n 次。
  2. 卜瓦松的平均與變異數都等於 λ,這裡都是 3;它不需要試驗次數 n。k = 0 的機率是 e^(−3) ≈ 0.0498。

看兩條示意曲線的形狀:N(0, 1) 的對稱鐘形,以及 λ = 1.5 的等待時間曲線。

常態對稱,指數分佈帶長尾
1 / 2
先畫標準常態的鐘形
常態分佈由平均與標準差定位;指數分佈描述卜瓦松事件之間的等待時間。曲線為示意。
  1. 標準常態 Z ~ N(0, 1),平均 0、標準差 1。P(Z ≤ 1.96) ≈ 0.975,左右對稱,所以中間約 0.95 落在 −1.96 到 1.96 之間。
  2. 指數分佈描述卜瓦松事件之間的等待時間,平均等待是 1/λ。無記憶性是說,已經等待的時間不改變從現在起還要再等多久的機率。

寬的是母體 σ = 12 的示意曲線,窄的是樣本平均數,標準誤 SE = 2。

樣本平均比原始資料集中得多
1 / 2
先畫母體 σ = 12
母體標準差 σ = 12、每次抽 n = 36 筆時,樣本平均的標準誤 SE = 12 / √36 = 2;原始資料仍保有母體的偏斜形狀。曲線為示意。
  1. 這條示意曲線保留母體的偏斜形狀,標準差是 σ = 12。每一筆原始資料仍按母體原來的分佈出現。
  2. n = 36 時 √36 = 6,SE = 12 / 6 = 2。這個常態的平均仍是母體平均 μ,近似的常用經驗值是 n ≥ 30。