核心路徑 — 建議循序閱讀
- 01 導讀:AI 為什麼建立在資料與統計上 AI 的能力與錯誤都來自資料。這篇說明一個 AI 專案從資料到上線的環節、本系列 19 篇的地圖與閱讀路線,以及遇到實際問題時先問的三件事。
- 02 敘述統計與資料摘要:平均數、四分位距與盒鬚圖 用集中趨勢、離散程度與形狀描述資料,學會判斷何時用中位數與 IQR、如何從盒鬚圖讀出偏態與離群值,並用 Z 分數與變異係數比較不同尺度。
- 03 機率分佈:二項、卜瓦松、常態與中央極限定理 從資料產生方式選分佈:二項、卜瓦松、指數、常態與負二項的使用情境、平均與變異數,以及中央極限定理與標準誤的意義。
- 04 假設檢定與統計推論:p 值、兩類錯誤與檢定選擇 p 值、顯著水準、型一與型二錯誤、檢定力的正確意思,Z、t、配對 t、ANOVA、卡方與無母數檢定的選擇,以及信賴區間與檢定的對應。
- 05 資料收集與清理:缺失值、編碼、縮放與資料洩漏 缺失值的三種機制與處理、離群值判斷、Label 與 One-Hot 與目標編碼、標準化與 Robust Scaling,以及前處理造成的資料洩漏。
- 06 資料儲存與管理:ACID、NoSQL、資料湖與分片 關聯式資料庫與 ACID、四類 NoSQL 與向量資料庫、資料倉儲與資料湖與湖倉、分片與複製、CAP 定理、RDF 三元組與欄式格式。
- 07 資料處理技術:批次、串流、Hadoop、Spark 與邊緣運算 批次與串流處理的差別,HDFS、MapReduce、Spark 惰性求值、Kafka、Flink 視窗與水位線、邊緣運算,以及分散式計算統計量的方法。
- 08 Python 與 pandas 讀碼:看懂程式片段在做什麼 以讀碼角度整理 pandas 的常用寫法:loc 與 iloc、多條件篩選、groupby、merge、melt、Int64、分塊讀取大檔與 seaborn 常用圖。
- 09 統計學在大數據中的應用:抽樣、相關、迴歸與貝氏 資料多仍會有偏誤的原因、抽樣方法、Pearson 與 Spearman 的選擇、迴歸係數與 R²、勝算比、貝氏定理與效果量。
- 10 常見分析方法:分群、關聯規則、降維與時間序列 K-means、DBSCAN 與階層分群,支援度、信賴度、提升度的計算,PCA 與 SVD 的性質,以及時間序列的組成與驗證方式。
進階實戰 — 可跳讀
- 11 資料視覺化:選對圖表並避免誤導 依比較、趨勢、分佈、關係、組成選圖,長條圖基準線、對數刻度、循序與發散配色,以及 Tufte 的資料墨水比與資料密度。
- 12 機器學習流程:資料切分、洩漏、不平衡與漂移 學習類型,訓練、驗證、測試集的角色,過擬合處理,資料洩漏的五種來源,分層與群組交叉驗證,SMOTE 的正確位置,特徵儲存庫與漂移監控。
- 13 模型怎麼學習:損失函數、梯度下降與正則化 模型訓練就是調參數讓損失變小:MSE 與交叉熵、手算梯度下降、學習率太大或太小的後果、mini-batch 與 epoch、L1 與 L2 正則化、提早停止與學習曲線。
- 14 鑑別式 AI:混淆矩陣、ROC 曲線與決策樹 鑑別式與生成式模型的差別,精確率、召回率、F1 的計算與選擇,ROC 與 PR 曲線,吉尼不純度、bagging 與 boosting,迴歸評估指標。
- 15 神經網路與深度學習:神經元、反向傳播與表示學習 一個神經元在算什麼、激活函數為什麼不可少、softmax、反向傳播與梯度消失、Dropout,以及 CNN、RNN、Transformer 與遷移學習各適合什麼資料。
- 16 大型語言模型怎麼運作:token、注意力、脈絡窗口與幻覺 大型語言模型如何一次預測一個 token、注意力與脈絡窗口的作用與限制、溫度與 top-p 取樣的計算,以及幻覺與知識截止的成因和降低方法。
- 17 生成式 AI:嵌入、向量資料庫與 RAG 資料在預訓練、微調與偏好對齊的角色,嵌入與餘弦相似度、向量資料庫與近似最近鄰、RAG 流程與切塊、合成資料的風險。
- 18 隱私保護、安全與合規:去識別化、差分隱私與法規 假名化與匿名化、k-匿名、差分隱私、同態加密、聯邦學習的適用情境,資料安全控制,生成式 AI 的個資風險,個資法、GDPR 與歐盟 AI 法重點。
- 19 總整:用一個案例走完從資料到 AI 的流程 以虛構連鎖藥局的回診預測與客服助理為例,走完問題定義、資料清理、建模評估、A/B 測試、RAG、隱私與上線監控,並附線索與方法對照表與 10 題綜合練習。