本系列第 1 篇|這篇回答:想真正看懂 AI,為什麼要先懂資料與統計?這個系列要怎麼讀? 讀完這篇,你應該能:
- 說出一個 AI 系統從資料到模型到上線的主要環節,以及各環節在本系列哪一篇
- 用三個問題(資料長什麼樣、要回答什麼、有什麼限制)拆解一個實際問題
- 依自己的背景選一條閱讀路線
一、AI 是從資料學出來的
模型會什麼、會錯在哪裡,主要看它學過的資料。
詳細說明
模型會什麼、會錯在哪裡,主要看它學過的資料。要看懂 人工智慧(artificial intelligence,以下稱 AI),得先看懂資料,以及人怎麼在不完整的資料上做判斷。
機器學習(machine learning)模型的行為來自訓練資料(training data)。資料裡有的規律、偏誤(bias)、錯誤與缺漏,都會進到模型。品質差的資料,換再好的演算法(algorithm)也救不回來。英文裡常把這件事說成 garbage in, garbage out:進去的資料差,出來的結果也不會好。
這三個詞不是同一件事。深度學習(deep learning)是機器學習的一種,機器學習是 AI 的一種。AI 裡面也有不靠資料學習、由人寫規則的系統。本系列主要走「從資料學」的這一支,並接到後面的生成式 AI(generative AI)。
統計(statistics)是處理「不確定」的語言。手上通常只有樣本(sample),資料有雜訊(noise),結論有誤差。判斷模型的準確率是不是運氣、用 A/B 測試(A/B test)比較新舊兩個版本誰好、檢查資料有沒有偏向某些族群,用的都是統計。沒有這層判斷,一個分數只是一個數字。
生成式 AI 也不例外。大型語言模型(large language model)本質上是「預測下一個 token 的機率模型」。token 是它這一步準備接上去的那一小段文字。它的能力與錯誤都來自訓練資料與這個機率機制。它怎麼「寫」出一段話、為什麼會說得很順卻說錯,第 16 篇會拆開來看。
一個 AI 專案是一條鏈:提出問題 → 收集與清理資料 → 儲存與處理 → 探索與視覺化 → 建模與評估 → 上線與監控。隱私與合規貫穿全程,不是上線前才補的手續。前面任一環出錯,後面的分數再漂亮也不可信。
每一環在本系列哪一篇,下一節的系列地圖逐篇列出。
二、系列地圖與讀法
第 2 篇到第 18 篇分成四部,第 19 篇做總整。第 1 篇就是你正在讀的導讀。表的第三欄是該篇要回答的問題,可以用它決定現在該不該讀。
第一部:統計基礎
第一部要摘要資料、用機率分佈描述產生過程,並分辨差異是否為運氣。
詳細說明
這一部處理敘述統計(descriptive statistics)、機率分佈(probability distribution)、假設檢定(hypothesis testing)與統計推論(statistical inference)。
| 篇 | 主題 | 這篇回答的問題 |
|---|---|---|
| 第 2 篇 | 敘述統計與資料摘要 | 一組資料要怎麼用幾個數字講清楚?什麼時候平均數會誤導人? |
| 第 3 篇 | 機率分佈 | 資料是怎麼產生的?為什麼同一類現象可以用同一個分佈描述? |
| 第 4 篇 | 假設檢定與統計推論 | 只看到一部分樣本時,怎麼判斷差異是真的還是運氣? |
第二部:資料工程
模型好不好,大半在收集、清理、儲存與拆開工作時就決定了。
詳細說明
這一部處理資料進模型之前的收集與清理(data cleaning)、放在哪裡,以及大到一台電腦處理不了時怎麼拆。
| 篇 | 主題 | 這篇回答的問題 |
|---|---|---|
| 第 5 篇 | 資料收集與清理 | 為什麼模型好不好,大半在資料進模型之前就決定了? |
| 第 6 篇 | 資料儲存與管理 | 資料要放在哪裡?不同儲存方式各自保證什麼? |
| 第 7 篇 | 資料處理技術 | 資料大到一台電腦處理不了時,工作要怎麼拆? |
| 第 8 篇 | Python 與 pandas 讀碼 | 拿到一段 pandas 程式,怎麼看懂它對資料做了什麼? |
第三部:分析方法
資料變多後仍要靠統計並找出結構,圖表也必須照實呈現。
詳細說明
這一部處理資料變多之後統計還能做什麼、沒有標準答案時怎麼找結構,以及圖表怎麼才不會誤導人。
| 篇 | 主題 | 這篇回答的問題 |
|---|---|---|
| 第 9 篇 | 統計在大數據中的應用 | 資料很多時,哪些判斷仍然要靠統計,哪些問題資料再多也救不了? |
| 第 10 篇 | 常見分析方法 | 沒有標準答案的資料,要怎麼找出結構與規律? |
| 第 11 篇 | 資料視覺化 | 怎麼讓圖表照實呈現資料,而不是誤導看圖的人? |
第四部:從機器學習到生成式 AI
從資料學到規律,再走到先查資料再回答,並保護資料裡的人。
詳細說明
這一部從「怎麼學」走到分類、神經網路(neural network)、大型語言模型,再走到嵌入(embedding)、向量資料庫(vector database)與先查資料再回答。
| 篇 | 主題 | 這篇回答的問題 |
|---|---|---|
| 第 12 篇 | 機器學習流程 | 機器學習怎麼從資料學到規律?哪些步驟最容易讓評估分數失真? |
| 第 13 篇 | 模型怎麼學習 | 模型說它「學會了」,實際上調整了什麼?又是往哪個方向調? |
| 第 14 篇 | 鑑別式 AI | 分類模型怎麼畫出判斷的邊界?又該用什麼指標評估它? |
| 第 15 篇 | 神經網路與深度學習 | 神經網路裡的「神經元」到底在算什麼?為什麼疊很多層就能處理影像和語言? |
| 第 16 篇 | 大型語言模型怎麼運作 | 聊天機器人背後的大型語言模型,怎麼「寫」出一段話?為什麼它會一本正經地說錯? |
| 第 17 篇 | 生成式 AI:嵌入、向量資料庫與 RAG | 生成式 AI 的能力從哪些資料來?怎麼讓它先查資料再回答? |
| 第 18 篇 | 隱私、安全與合規 | 用資料訓練與使用 AI 時,怎麼保護資料裡的人? |
第 19 篇:總整
從問題到上線的每個判斷,都要把前面各篇串起來看。
詳細說明
| 篇 | 主題 | 這篇回答的問題 |
|---|---|---|
| 第 19 篇 | 總整 | 把前面各篇串起來,一個 AI 專案從問題到上線要做哪些判斷? |
每篇怎麼讀
每篇固定五段,練習先自己想,再看正解與其他說法錯在哪。
詳細說明
每篇固定五段:原理、方法、容易混淆的地方、基礎練習、重點回顧。容易混淆的地方有一張比較表。練習的解析預設收起來,先自己想,再點開。解析會說明正解為什麼對,也逐一說明其他說法錯在哪裡。
遇到實際問題時,先問三件事
先問資料長什麼樣、要回答什麼、有什麼限制,再選方法。
詳細說明
- 資料長什麼樣:數值、類別、文字還是影像?有沒有標籤(label),也就是每一筆有沒有已知的正確答案?有沒有時間順序?同一個人有沒有多筆?
- 要回答什麼:描述現況、比較差異、預測、找出群組,還是生成內容?
- 有什麼限制:要不要向人解釋、要多即時、能不能動用個人資料、資料量多大、哪一種錯誤代價比較高(漏抓還是誤報)?
用一個虛構例子走一次。某電商想知道哪些會員下個月可能流失。資料是每位會員過去一年的購買紀錄,內容是數值,而且依時間排列。每人都有「是否流失」的標籤。流失的人約 5%。行銷團隊要知道原因。
有標籤,要預測的又是會不會流失,所以這是監督式分類(supervised classification),讀第 12、14 篇。流失約 5%。以 100 位會員估算:100 × 0.05 = 5 人流失,100 − 5 = 95 人沒有。模型若全部回答「不流失」,對的有 95 人,準確率是 95 / 100 = 95%。這個分數沒有找到任何即將流失的人,所以要看召回率(recall),也要看精確率(precision),見第 14 篇。資料依時間排列,要用過去預測未來,就得按時間切分,避免資料洩漏(data leakage),見第 12 篇。行銷團隊要知道原因,就先試可解釋的模型,例如邏輯斯迴歸(logistic regression)或決策樹(decision tree),見第 14 篇。
閱讀路線
起點由統計背景決定,iPAS 科目二再對照第 2 到 18 篇。
詳細說明
- 沒有統計背景:從第 2 篇起照順序讀。
- 已熟悉統計:從第 5 篇開始。讀到第 9 篇時,回頭對照第 2 到 4 篇。
- 只想懂 AI 原理:讀第 1、12、13、14、15、16、17 篇。遇到不熟的統計名詞,再回頭查第 2 到 4 篇。
若你在準備 iPAS AI 應用規劃師中級科目二「大數據處理分析與應用」,本系列涵蓋該科官方評鑑範圍,對照如下。範圍以官方最新公告為準。
- L22101 到 L22103:第 2 到 4 篇
- L22201 到 L22203:第 5 到 7 篇;程式相關內容見第 8 篇
- L22301 到 L22303:第 9 到 11 篇
- L22401:第 12、13 篇
- L22402:第 14、15 篇
- L22403:第 16、17 篇
- L22404:第 18 篇
三、容易混淆的地方
下面六組詞常被當成同一件事。第三欄寫的是你在程式、需求、日誌、儀表板或報表裡會怎麼撞見它。
| 容易混淆 | 差別在哪 | 實際遇到時的線索 |
|---|---|---|
| AI、機器學習、深度學習 | 深度學習是機器學習的一種,機器學習是 AI 的一種。AI 也包含不靠資料學習、由人寫規則的系統。 | 審查程式時只看到人寫的條件規則,沒有從資料訓練的步驟,簡報卻寫著深度學習。 |
| 統計、機器學習 | 統計重在推論與解釋:差異是不是真的、影響有多大。機器學習重在預測新資料。方法有大量重疊,例如迴歸(regression)。 | 需求寫「這兩組差異算不算成立、影響有多大」,對應第 4 篇。需求寫「新的一筆會是多少」,對應第 12 篇的預測。同一份報表可能兩種都要。 |
| 鑑別式、生成式 | 鑑別式(discriminative)從輸入判斷類別或數值(第 14 篇)。生成式(generative)學資料的分佈,產生新的內容(第 16、17 篇)。 | 看服務日誌的回傳。回傳一個類別或一個數值,是鑑別式。回傳一段新寫出來的文字,是生成式。 |
| 資料多、資料好 | 資料多但有偏差,偏差不會因為量大而消失(第 9 篇)。 | 儀表板顯示筆數很大,但紀錄集中在某一個區域、某一個時段,或某一類人幾乎沒有出現。 |
| 分數高、模型有用 | 不平衡資料上,準確率高可能毫無用處。驗證方式有洩漏時,分數會虛高(第 12 篇)。 | 評估報告只有一個準確率,沒有寫正例占多少,也沒有寫訓練與測試是否按時間切開。 |
| 相關、因果 | 一起變動不代表一個造成另一個(第 9 篇)。相關(correlation)不是因果(causation)。 | 報表上兩條線同時上升,會議上就有人提案:把甲調高,乙就會跟上。 |
四、基礎練習
下面四則都是虛構情境。先自己選一個答案,再打開解析。
第 1 題
某團隊的內部教學把 AI、機器學習、深度學習三個詞交替使用,好像可以互換。哪一種關係是對的?
- (A) 三者是同一件事的不同名稱
- (B) 深度學習是機器學習的一種,機器學習是 AI 的一種
- (C) 機器學習包含 AI,深度學習再包含機器學習
- (D) 深度學習和機器學習是互不相干的兩條路線
看答案與解析
答案:B
深度學習落在機器學習裡面,機器學習又落在 AI 裡面。AI 還包含不靠資料學習、由人寫規則的系統,所以三個詞的範圍不同。
- (A) 三者不是同一件事的三個名字,範圍一層比一層小。
- (C) 包含的方向反了:是深度學習屬於機器學習,機器學習屬於 AI。
- (D) 深度學習是機器學習的一種,不是另一條與機器學習無關的路線。
第 2 題
某電商有每位會員過去一年的購買紀錄,內容是數值,依時間排列,而且每人都有「是否流失」的標籤。流失的人約 5%。行銷團隊想知道下個月誰可能流失,也想知道原因。哪一種做法最合理?
- (A) 會員很多,用分群整理出幾種類型就好
- (B) 用生成式 AI 寫出挽留文案,流失的問題就解決了
- (C) 整體準確率達到 95% 就可以上線
- (D) 當成監督式分類,按時間切分資料,並看召回率與精確率
看答案與解析
答案:D
已經有「是否流失」的標籤,要預測的是某一位會員會不會流失,所以是監督式分類。資料依時間排列,要用過去預測未來,必須按時間切分,避免資料洩漏。流失約 5%。以 100 位會員估算:100 × 0.05 = 5 人流失,100 − 5 = 95 人沒有,全部猜「不流失」的準確率是 95 / 100 = 95%。這個分數抓不到流失的人,所以要看召回率與精確率。若還要向行銷團隊說明原因,再從這類分類模型裡挑可解釋的,例如邏輯斯迴歸或決策樹(第 14 篇)。那是下一步,不改變這一題的答案。
- (A) 分群用在沒有標準答案、要找結構的時候(第 10 篇)。這裡已有標籤,要回答的是有沒有流失。
- (B) 挽留文案沒有回答誰會流失。
- (C) 全猜「不流失」也有 95%,這個準確率可以完全沒有找到流失的人。
第 3 題
某醫院的模型在本院資料上表現很好,用到另一家醫院時表現大幅下降。最可能的原因是哪一個?
- (A) 訓練資料和新醫院的資料分佈不同,模型學到的規律不一定適用
- (B) 模型參數太少
- (C) 另一家醫院的電腦比較慢
- (D) 本院的測試集太大
看答案與解析
答案:A
模型在本院表現好,表示它學到的規律貼著本院的資料。另一家醫院的病人族群、儀器或紀錄方式不同,資料分佈就不同,那些規律不一定還在。
- (B) 參數太少會先影響它在本院資料上的表現。本題是本院好、換一家醫院才變差。
- (C) 電腦速度改變的是等候時間,不改變預測對不對。
- (D) 測試集較大,通常讓本院的評估更穩,解釋不了新醫院為什麼失效。
第 4 題
某客服中心把大型語言模型接上客服。它產生一段回答時,本質上在做什麼?
- (A) 到內建的事實資料庫查出答案
- (B) 把訓練資料裡最相似的一段原封不動複製出來
- (C) 依前文計算下一個 token 的機率,逐個挑選接上
- (D) 先完整理解問題,再用邏輯推導出唯一正確答案
看答案與解析
答案:C
大型語言模型是預測下一個 token 的機率模型。它依前文為下一個 token 分配機率,再逐個挑選、接上,直到組成一段回答。能力與錯誤都來自訓練資料與這個機率機制。
- (A) 產生下一個 token 時做的是機率計算,不是到一座內建的事實資料庫查條目。系統可以另外設計成先查資料再回答,那是第 17 篇的主題。
- (B) 它不是把訓練資料裡最相似的一段原封不動複製出來,而是依前文逐個決定下一個 token。
- (D) 它沒有先推出唯一正確答案這一步。每一步都在候選 token 上計算機率,所以它可能寫得很順,內容仍然是錯的(第 16 篇)。
五、重點回顧
- 機器學習模型的行為來自訓練資料。規律、偏誤、錯誤與缺漏都會進去;品質差的資料,換演算法也救不回來。
- 統計處理樣本、雜訊與誤差。判斷準確率是不是運氣、用 A/B 測試比較新舊版本、檢查資料有沒有偏向某些族群,都要用它。大型語言模型同樣是預測下一個 token 的機率模型。
- 專案鏈是提出問題、收集與清理、儲存與處理、探索與視覺化、建模與評估、上線與監控。前面任一環出錯,後面的分數不可信。隱私與合規從收集資料就貫穿全程。
- 動手之前先問三件事:資料長什麼樣(含有沒有標籤、有沒有時間順序)、要回答的是描述、比較、預測、找群組還是生成,以及解釋、即時、個人資料、資料量與錯誤代價這些限制。
- 沒有統計背景就照順序讀。已熟悉統計從第 5 篇讀起,到第 9 篇時回頭對照第 2 到 4 篇。只想懂 AI 原理,讀第 1、12、13、14、15、16、17 篇,統計名詞不熟再查第 2 到 4 篇。
- 每篇用「容易混淆」的比較表,以及先自己想再打開的解析,檢查自己有沒有把範圍、指標或因果看反。