跳到主要內容
Lab Grimoire
TW
請喝咖啡
動手實作

導讀:AI 為什麼建立在資料與統計上

AI 的能力與錯誤都來自資料。這篇說明一個 AI 專案從資料到上線的環節、本系列 19 篇的地圖與閱讀路線,以及遇到實際問題時先問的三件事。

作者
CY
發表
AI 的資料基礎:從統計到生成式 AI · 第 1/19 篇

本系列第 1 篇|這篇回答:想真正看懂 AI,為什麼要先懂資料與統計?這個系列要怎麼讀? 讀完這篇,你應該能:

  • 說出一個 AI 系統從資料到模型到上線的主要環節,以及各環節在本系列哪一篇
  • 用三個問題(資料長什麼樣、要回答什麼、有什麼限制)拆解一個實際問題
  • 依自己的背景選一條閱讀路線

一、AI 是從資料學出來的

模型會什麼、會錯在哪裡,主要看它學過的資料。

詳細說明

模型會什麼、會錯在哪裡,主要看它學過的資料。要看懂 人工智慧(artificial intelligence,以下稱 AI),得先看懂資料,以及人怎麼在不完整的資料上做判斷。

機器學習(machine learning)模型的行為來自訓練資料(training data)。資料裡有的規律、偏誤(bias)、錯誤與缺漏,都會進到模型。品質差的資料,換再好的演算法(algorithm)也救不回來。英文裡常把這件事說成 garbage in, garbage out:進去的資料差,出來的結果也不會好。

這三個詞不是同一件事。深度學習(deep learning)是機器學習的一種,機器學習是 AI 的一種。AI 裡面也有不靠資料學習、由人寫規則的系統。本系列主要走「從資料學」的這一支,並接到後面的生成式 AI(generative AI)。

統計(statistics)是處理「不確定」的語言。手上通常只有樣本(sample),資料有雜訊(noise),結論有誤差。判斷模型的準確率是不是運氣、用 A/B 測試(A/B test)比較新舊兩個版本誰好、檢查資料有沒有偏向某些族群,用的都是統計。沒有這層判斷,一個分數只是一個數字。

生成式 AI 也不例外。大型語言模型(large language model)本質上是「預測下一個 token 的機率模型」。token 是它這一步準備接上去的那一小段文字。它的能力與錯誤都來自訓練資料與這個機率機制。它怎麼「寫」出一段話、為什麼會說得很順卻說錯,第 16 篇會拆開來看。

一個 AI 專案是一條鏈:提出問題 → 收集與清理資料 → 儲存與處理 → 探索與視覺化 → 建模與評估 → 上線與監控。隱私與合規貫穿全程,不是上線前才補的手續。前面任一環出錯,後面的分數再漂亮也不可信。

每一環在本系列哪一篇,下一節的系列地圖逐篇列出。

二、系列地圖與讀法

第 2 篇到第 18 篇分成四部,第 19 篇做總整。第 1 篇就是你正在讀的導讀。表的第三欄是該篇要回答的問題,可以用它決定現在該不該讀。

第一部:統計基礎

第一部要摘要資料、用機率分佈描述產生過程,並分辨差異是否為運氣。

詳細說明

這一部處理敘述統計(descriptive statistics)、機率分佈(probability distribution)、假設檢定(hypothesis testing)與統計推論(statistical inference)。

篇 主題 這篇回答的問題
第 2 篇 敘述統計與資料摘要 一組資料要怎麼用幾個數字講清楚?什麼時候平均數會誤導人?
第 3 篇 機率分佈 資料是怎麼產生的?為什麼同一類現象可以用同一個分佈描述?
第 4 篇 假設檢定與統計推論 只看到一部分樣本時,怎麼判斷差異是真的還是運氣?

第二部:資料工程

模型好不好,大半在收集、清理、儲存與拆開工作時就決定了。

詳細說明

這一部處理資料進模型之前的收集與清理(data cleaning)、放在哪裡,以及大到一台電腦處理不了時怎麼拆。

篇 主題 這篇回答的問題
第 5 篇 資料收集與清理 為什麼模型好不好,大半在資料進模型之前就決定了?
第 6 篇 資料儲存與管理 資料要放在哪裡?不同儲存方式各自保證什麼?
第 7 篇 資料處理技術 資料大到一台電腦處理不了時,工作要怎麼拆?
第 8 篇 Python 與 pandas 讀碼 拿到一段 pandas 程式,怎麼看懂它對資料做了什麼?

第三部:分析方法

資料變多後仍要靠統計並找出結構,圖表也必須照實呈現。

詳細說明

這一部處理資料變多之後統計還能做什麼、沒有標準答案時怎麼找結構,以及圖表怎麼才不會誤導人。

篇 主題 這篇回答的問題
第 9 篇 統計在大數據中的應用 資料很多時,哪些判斷仍然要靠統計,哪些問題資料再多也救不了?
第 10 篇 常見分析方法 沒有標準答案的資料,要怎麼找出結構與規律?
第 11 篇 資料視覺化 怎麼讓圖表照實呈現資料,而不是誤導看圖的人?

第四部:從機器學習到生成式 AI

從資料學到規律,再走到先查資料再回答,並保護資料裡的人。

詳細說明

這一部從「怎麼學」走到分類、神經網路(neural network)、大型語言模型,再走到嵌入(embedding)、向量資料庫(vector database)與先查資料再回答。

篇 主題 這篇回答的問題
第 12 篇 機器學習流程 機器學習怎麼從資料學到規律?哪些步驟最容易讓評估分數失真?
第 13 篇 模型怎麼學習 模型說它「學會了」,實際上調整了什麼?又是往哪個方向調?
第 14 篇 鑑別式 AI 分類模型怎麼畫出判斷的邊界?又該用什麼指標評估它?
第 15 篇 神經網路與深度學習 神經網路裡的「神經元」到底在算什麼?為什麼疊很多層就能處理影像和語言?
第 16 篇 大型語言模型怎麼運作 聊天機器人背後的大型語言模型,怎麼「寫」出一段話?為什麼它會一本正經地說錯?
第 17 篇 生成式 AI:嵌入、向量資料庫與 RAG 生成式 AI 的能力從哪些資料來?怎麼讓它先查資料再回答?
第 18 篇 隱私、安全與合規 用資料訓練與使用 AI 時,怎麼保護資料裡的人?

第 19 篇:總整

從問題到上線的每個判斷,都要把前面各篇串起來看。

詳細說明
篇 主題 這篇回答的問題
第 19 篇 總整 把前面各篇串起來,一個 AI 專案從問題到上線要做哪些判斷?

每篇怎麼讀

每篇固定五段,練習先自己想,再看正解與其他說法錯在哪。

詳細說明

每篇固定五段:原理、方法、容易混淆的地方、基礎練習、重點回顧。容易混淆的地方有一張比較表。練習的解析預設收起來,先自己想,再點開。解析會說明正解為什麼對,也逐一說明其他說法錯在哪裡。

遇到實際問題時,先問三件事

先問資料長什麼樣、要回答什麼、有什麼限制,再選方法。

詳細說明
  1. 資料長什麼樣:數值、類別、文字還是影像?有沒有標籤(label),也就是每一筆有沒有已知的正確答案?有沒有時間順序?同一個人有沒有多筆?
  2. 要回答什麼:描述現況、比較差異、預測、找出群組,還是生成內容?
  3. 有什麼限制:要不要向人解釋、要多即時、能不能動用個人資料、資料量多大、哪一種錯誤代價比較高(漏抓還是誤報)?

用一個虛構例子走一次。某電商想知道哪些會員下個月可能流失。資料是每位會員過去一年的購買紀錄,內容是數值,而且依時間排列。每人都有「是否流失」的標籤。流失的人約 5%。行銷團隊要知道原因。

有標籤,要預測的又是會不會流失,所以這是監督式分類(supervised classification),讀第 12、14 篇。流失約 5%。以 100 位會員估算:100 × 0.05 = 5 人流失,100 − 5 = 95 人沒有。模型若全部回答「不流失」,對的有 95 人,準確率是 95 / 100 = 95%。這個分數沒有找到任何即將流失的人,所以要看召回率(recall),也要看精確率(precision),見第 14 篇。資料依時間排列,要用過去預測未來,就得按時間切分,避免資料洩漏(data leakage),見第 12 篇。行銷團隊要知道原因,就先試可解釋的模型,例如邏輯斯迴歸(logistic regression)或決策樹(decision tree),見第 14 篇。

閱讀路線

起點由統計背景決定,iPAS 科目二再對照第 2 到 18 篇。

詳細說明
  • 沒有統計背景:從第 2 篇起照順序讀。
  • 已熟悉統計:從第 5 篇開始。讀到第 9 篇時,回頭對照第 2 到 4 篇。
  • 只想懂 AI 原理:讀第 1、12、13、14、15、16、17 篇。遇到不熟的統計名詞,再回頭查第 2 到 4 篇。

若你在準備 iPAS AI 應用規劃師中級科目二「大數據處理分析與應用」,本系列涵蓋該科官方評鑑範圍,對照如下。範圍以官方最新公告為準。

  • L22101 到 L22103:第 2 到 4 篇
  • L22201 到 L22203:第 5 到 7 篇;程式相關內容見第 8 篇
  • L22301 到 L22303:第 9 到 11 篇
  • L22401:第 12、13 篇
  • L22402:第 14、15 篇
  • L22403:第 16、17 篇
  • L22404:第 18 篇

三、容易混淆的地方

下面六組詞常被當成同一件事。第三欄寫的是你在程式、需求、日誌、儀表板或報表裡會怎麼撞見它。

容易混淆 差別在哪 實際遇到時的線索
AI、機器學習、深度學習 深度學習是機器學習的一種,機器學習是 AI 的一種。AI 也包含不靠資料學習、由人寫規則的系統。 審查程式時只看到人寫的條件規則,沒有從資料訓練的步驟,簡報卻寫著深度學習。
統計、機器學習 統計重在推論與解釋:差異是不是真的、影響有多大。機器學習重在預測新資料。方法有大量重疊,例如迴歸(regression)。 需求寫「這兩組差異算不算成立、影響有多大」,對應第 4 篇。需求寫「新的一筆會是多少」,對應第 12 篇的預測。同一份報表可能兩種都要。
鑑別式、生成式 鑑別式(discriminative)從輸入判斷類別或數值(第 14 篇)。生成式(generative)學資料的分佈,產生新的內容(第 16、17 篇)。 看服務日誌的回傳。回傳一個類別或一個數值,是鑑別式。回傳一段新寫出來的文字,是生成式。
資料多、資料好 資料多但有偏差,偏差不會因為量大而消失(第 9 篇)。 儀表板顯示筆數很大,但紀錄集中在某一個區域、某一個時段,或某一類人幾乎沒有出現。
分數高、模型有用 不平衡資料上,準確率高可能毫無用處。驗證方式有洩漏時,分數會虛高(第 12 篇)。 評估報告只有一個準確率,沒有寫正例占多少,也沒有寫訓練與測試是否按時間切開。
相關、因果 一起變動不代表一個造成另一個(第 9 篇)。相關(correlation)不是因果(causation)。 報表上兩條線同時上升,會議上就有人提案:把甲調高,乙就會跟上。

四、基礎練習

下面四則都是虛構情境。先自己選一個答案,再打開解析。

第 1 題

某團隊的內部教學把 AI、機器學習、深度學習三個詞交替使用,好像可以互換。哪一種關係是對的?

  • (A) 三者是同一件事的不同名稱
  • (B) 深度學習是機器學習的一種,機器學習是 AI 的一種
  • (C) 機器學習包含 AI,深度學習再包含機器學習
  • (D) 深度學習和機器學習是互不相干的兩條路線
看答案與解析

答案:B

深度學習落在機器學習裡面,機器學習又落在 AI 裡面。AI 還包含不靠資料學習、由人寫規則的系統,所以三個詞的範圍不同。

  • (A) 三者不是同一件事的三個名字,範圍一層比一層小。
  • (C) 包含的方向反了:是深度學習屬於機器學習,機器學習屬於 AI。
  • (D) 深度學習是機器學習的一種,不是另一條與機器學習無關的路線。

第 2 題

某電商有每位會員過去一年的購買紀錄,內容是數值,依時間排列,而且每人都有「是否流失」的標籤。流失的人約 5%。行銷團隊想知道下個月誰可能流失,也想知道原因。哪一種做法最合理?

  • (A) 會員很多,用分群整理出幾種類型就好
  • (B) 用生成式 AI 寫出挽留文案,流失的問題就解決了
  • (C) 整體準確率達到 95% 就可以上線
  • (D) 當成監督式分類,按時間切分資料,並看召回率與精確率
看答案與解析

答案:D

已經有「是否流失」的標籤,要預測的是某一位會員會不會流失,所以是監督式分類。資料依時間排列,要用過去預測未來,必須按時間切分,避免資料洩漏。流失約 5%。以 100 位會員估算:100 × 0.05 = 5 人流失,100 − 5 = 95 人沒有,全部猜「不流失」的準確率是 95 / 100 = 95%。這個分數抓不到流失的人,所以要看召回率與精確率。若還要向行銷團隊說明原因,再從這類分類模型裡挑可解釋的,例如邏輯斯迴歸或決策樹(第 14 篇)。那是下一步,不改變這一題的答案。

  • (A) 分群用在沒有標準答案、要找結構的時候(第 10 篇)。這裡已有標籤,要回答的是有沒有流失。
  • (B) 挽留文案沒有回答誰會流失。
  • (C) 全猜「不流失」也有 95%,這個準確率可以完全沒有找到流失的人。

第 3 題

某醫院的模型在本院資料上表現很好,用到另一家醫院時表現大幅下降。最可能的原因是哪一個?

  • (A) 訓練資料和新醫院的資料分佈不同,模型學到的規律不一定適用
  • (B) 模型參數太少
  • (C) 另一家醫院的電腦比較慢
  • (D) 本院的測試集太大
看答案與解析

答案:A

模型在本院表現好,表示它學到的規律貼著本院的資料。另一家醫院的病人族群、儀器或紀錄方式不同,資料分佈就不同,那些規律不一定還在。

  • (B) 參數太少會先影響它在本院資料上的表現。本題是本院好、換一家醫院才變差。
  • (C) 電腦速度改變的是等候時間,不改變預測對不對。
  • (D) 測試集較大,通常讓本院的評估更穩,解釋不了新醫院為什麼失效。

第 4 題

某客服中心把大型語言模型接上客服。它產生一段回答時,本質上在做什麼?

  • (A) 到內建的事實資料庫查出答案
  • (B) 把訓練資料裡最相似的一段原封不動複製出來
  • (C) 依前文計算下一個 token 的機率,逐個挑選接上
  • (D) 先完整理解問題,再用邏輯推導出唯一正確答案
看答案與解析

答案:C

大型語言模型是預測下一個 token 的機率模型。它依前文為下一個 token 分配機率,再逐個挑選、接上,直到組成一段回答。能力與錯誤都來自訓練資料與這個機率機制。

  • (A) 產生下一個 token 時做的是機率計算,不是到一座內建的事實資料庫查條目。系統可以另外設計成先查資料再回答,那是第 17 篇的主題。
  • (B) 它不是把訓練資料裡最相似的一段原封不動複製出來,而是依前文逐個決定下一個 token。
  • (D) 它沒有先推出唯一正確答案這一步。每一步都在候選 token 上計算機率,所以它可能寫得很順,內容仍然是錯的(第 16 篇)。

五、重點回顧

  • 機器學習模型的行為來自訓練資料。規律、偏誤、錯誤與缺漏都會進去;品質差的資料,換演算法也救不回來。
  • 統計處理樣本、雜訊與誤差。判斷準確率是不是運氣、用 A/B 測試比較新舊版本、檢查資料有沒有偏向某些族群,都要用它。大型語言模型同樣是預測下一個 token 的機率模型。
  • 專案鏈是提出問題、收集與清理、儲存與處理、探索與視覺化、建模與評估、上線與監控。前面任一環出錯,後面的分數不可信。隱私與合規從收集資料就貫穿全程。
  • 動手之前先問三件事:資料長什麼樣(含有沒有標籤、有沒有時間順序)、要回答的是描述、比較、預測、找群組還是生成,以及解釋、即時、個人資料、資料量與錯誤代價這些限制。
  • 沒有統計背景就照順序讀。已熟悉統計從第 5 篇讀起,到第 9 篇時回頭對照第 2 到 4 篇。只想懂 AI 原理,讀第 1、12、13、14、15、16、17 篇,統計名詞不熟再查第 2 到 4 篇。
  • 每篇用「容易混淆」的比較表,以及先自己想再打開的解析,檢查自己有沒有把範圍、指標或因果看反。

覺得有幫助? RSS · X · 請我喝杯咖啡

看六個節點的先後,以及每支箭頭把哪一環送進下一環。

資料品質一路影響到上線
1 / 6
出現提出問題的節點
專案從問題一路走到監控;隱私與合規貫穿全程。
  1. 專案這條鏈從問題起頭,後面的資料與模型都是為了回答它。
  2. 規律、偏誤、錯誤與缺漏都在這裡進到模型。品質差的資料,換再好的演算法也救不回來。
  3. 第 6 到 8 篇處理資料放在哪裡。大到一台電腦處理不了時,工作要在這裡拆開。
  4. 資料再多,有些問題也救不了,仍要靠統計判斷;圖表也必須照實呈現才不會誤導。
  5. 模型的行為來自訓練資料;評估時要判斷準確率是不是運氣。
  6. 隱私與合規從第一環就在,不是上線前才補的手續。上線後仍要持續檢查。

三個節點分別對應資料、任務與限制,箭頭規定先問哪一件。

先看資料,再定任務與限制
1 / 3
第一問:資料長什麼樣
資料有標籤與時間順序,會改變預測方式;錯誤代價也要先列清楚。
  1. 有沒有標籤、有沒有時間順序,會改掉後面是不是監督式分類、要不要按時間切分。
  2. 有標籤又要預測會不會流失,任務就定成監督式分類,對應第 12、14 篇。
  3. 行銷團隊要知道原因,就得向人解釋,所以先試邏輯斯迴歸或決策樹。漏抓和誤報的代價也要先分高低。

對照表頭的兩欄,再逐列看讀者類型與對應的篇次。

從熟悉的基礎選閱讀起點
1 / 5
表頭分出讀者與建議路線
統計背景決定前幾篇的順序;只看 AI 原理可沿第 1、12–17 篇前進。
  1. 讀者欄決定你是哪一列,建議路線欄才告訴你從哪一篇開始。
  2. 第 2 到 4 篇才把敘述統計、機率分佈、假設檢定與統計推論補上。
  3. 已熟悉統計就從收集與清理開始。讀到第 9 篇時,回頭對照第 2 到 4 篇。
  4. 只想懂 AI 原理時讀第 1、12、13、14、15、16、17 篇。不熟的統計名詞再查第 2 到 4 篇。
  5. 準備 iPAS AI 應用規劃師中級科目二時,用這一列對照官方評鑑範圍,並以最新公告為準。