本系列第 18 篇|這篇回答:用資料訓練與使用 AI 時,怎麼保護資料裡的人? 讀完這篇,你應該能:
- 依情境選擇隱私強化技術:匿名化、假名化、差分隱私、同態加密、聯邦學習
- 指出傳輸加密、存取控制、稽核、分級與備份各自擋住哪一種風險
- 用台灣個資法的特種個資與目的限制,以及 GDPR、歐盟 AI 法的核心觀念判斷合規要求
一、原理:資料越多,被識別的風險越高
個人資料與準識別符(quasi-identifier)
刪除姓名只去掉直接識別,留下的準識別符仍可能指出特定人。
詳細說明
個人資料是能直接或間接識別特定自然人的資料。直接識別靠單一欄位就夠,例如姓名、身分證號。間接識別靠欄位組合。郵遞區號、生日、性別像拼圖的單片,單獨一片常常對不上人;三片合在一起,就可能鎖定特定人。這類本身不是姓名、卻能協助鎖定個人的欄位,就是準識別符。
刪除姓名只去掉直接識別。欄位留得愈多、分得愈細,準識別符愈容易和別的資料對上,再識別的風險愈高。拿到一批明細時,先檢查這些欄位合在一起會不會指出特定人。
特種個資與特定目的
特種個資原則上不得蒐集、處理或利用,且須限於特定目的。
詳細說明
台灣《個人資料保護法》第 6 條列出的特種個資,包括病歷、醫療、基因、性生活、健康檢查及犯罪前科。原則上不得蒐集、處理或利用,須符合法定例外。醫院之間若要用病歷訓練模型,面對的就是這條原則上的禁止;例外是否成立,要看該次利用是否符合法律所定的例外,不能用合作方便代替。
個人資料的蒐集、處理、利用應有特定目的,並在目的範圍內。某電商為了出貨蒐集地址,用在出貨上,是在原來的目的裡。若改拿去訓練一個與出貨無關的模型,這次利用就超出原本的特定目的,原則上不能直接沿用同一批資料,要先確認是否符合法定例外。
二、去識別化、隱私強化、安全控制與法規核心
遮罩(masking)、泛化(generalization)與抑制(suppression)
遮罩留頭尾,泛化改成較粗範圍,抑制則刪除罕見值或整欄。
詳細說明
遮罩是部分隱藏,例如身分證號顯示成 A12****789,頭尾仍在。泛化是把精確值改成較粗的範圍,例如年齡 34 改成 30–39 歲。抑制是刪除罕見值或整欄。某種準識別符組合若極少出現,留下它就容易把那個人標出來,所以把該值或該欄拿掉。
假名化(pseudonymization)與匿名化(anonymization)
對照表還在就只是假名化,匿名化必須不可逆且無法再識別。
詳細說明
假名化用代號取代識別符。對照表若保留,持有對照表的人就能把代號還原成特定人。在 GDPR(歐盟一般資料保護規則)下,假名化資料仍是個人資料。
匿名化要處理到無法再識別個人,而且不可逆。真正匿名的資料不受 GDPR 規範。只換代號、對照表還在,還原的鑰匙就還在,處理停在假名化。
k-匿名(k-anonymity)
k-匿名檢查同組準識別符筆數 ≥ k,但敏感屬性仍可能洩漏。
詳細說明
k-匿名檢查準識別符。每一筆紀錄在準識別符上至少與 k−1 筆其他紀錄相同,也就是同一組準識別符的筆數 ≥ k。外人至多知道某人落在哪一組,無法把單一筆挑出來。
弱點在敏感屬性。同一組裡若都是同一種疾病,外人挑不出是哪一筆,卻知道這組每一個人的疾病。l-多樣性(l-diversity)等延伸,用來要求同組內的敏感屬性夠分散,避免這種洩漏。
差分隱私(differential privacy)
差分隱私在結果加入雜訊,ε 越小保護越強且結果越不精確。
詳細說明
差分隱私作用在查詢結果或統計量。在結果中加入經校準的雜訊,使任何一個人的資料加入或移除,對結果的影響都很小。適合公開統計資料,又要降低別人從公布數字推回個人的場合。
隱私強度看隱私預算 ε。ε 越小,隱私保護越強,結果越不精確。ε 變大時,結果可以更接近原始統計,隱私保護則變弱。
同態加密(homomorphic encryption)
同態加密直接在加密資料上運算,解密後與明文運算結果相同。
詳細說明
同態加密可直接在加密資料上運算。解密後的結果,與在明文上做同一運算的結果相同。雲端可以代算,卻看不到原始資料。代價是運算量大、速度慢。
聯邦學習(federated learning)與安全多方計算(secure multi-party computation, SMPC)
聯邦學習交出參數或梯度,安全多方計算守住各方輸入。
詳細說明
聯邦學習把訓練留在資料所在處。各機構或裝置在本地訓練,只交換模型參數或梯度給中央彙整,原始資料不匯到同一處。醫院、銀行之間不能共享原始資料、又要共同建模時,這個安排符合限制。
梯度仍可能洩漏部分資訊,常搭配差分隱私或安全彙總(secure aggregation)。
安全多方計算是多方共同計算一個函數,各方看不到彼此的輸入。它的重點是輸入保密地完成共同計算,不必然是在訓練模型。聯邦學習交出的是參數或梯度;安全多方計算守住的是各方的輸入。
傳輸、存取與事後追查
加密管移動中與靜止的資料,存取控制管誰能用,稽核日誌供事後追查。
詳細說明
傳輸中加密(TLS)保護資料在網路上移動的那一段,使傳送過程不被旁人讀取。儲存加密保護靜止的資料,沒有金鑰就讀不到內容。誰可以讀、誰可以改,交給存取控制:以 RBAC(role-based access control)依角色授權,並守最小權限原則,只給完成工作所需的權限。
傳輸加密處理的是移動中的資料。存取控制處理的是誰有權使用已經在系統裡的資料。
稽核日誌記錄何人何時做了什麼,供事後追查。資料分級按敏感程度區分管制強度,特種個資與一般聯絡資料不必用同一套管制。備份與復原處理遺失與毀損,讓資料在故障之後回得來。
生成式 AI的貼上風險
貼上時內容可能被保存或用於訓練,輸出也可能重現個人資料。
詳細說明
員工把客戶資料、原始碼或機密文件貼進公開的生成式 AI 服務時,內容可能被保存,也可能被用於訓練。風險發生在貼上的那一刻。
控制有四層:制定使用政策,寫明哪些資料不准貼;採用企業版或內部部署,並確認資料不用於訓練;用資料外洩防護(data loss prevention, DLP)在貼上或上傳時攔截;用教育訓練讓業務與工程知道客戶名單不屬於「請模型幫忙排版」的材料。
模型也可能記住訓練資料中的個人資料,並在輸出中重現。訓練集裡有沒有個人資料、輸出會不會把記憶內容吐出來,要在上線前檢查。
原則、權利與風險分級
GDPR 以原則與權利約束處理,歐盟 AI 法再按風險分級。
詳細說明
GDPR 的原則包含合法、公平、透明、目的限制、資料最小化、正確性、儲存限制、完整性與機密性、課責。目的限制與第一節的特定目的同一方向:利用停在事先所定的目的裡。資料最小化要求只處理該目的所需的資料。正確性要求資料正確,並能改正錯誤。儲存限制要求保存期間配合目的,不無限期留下。完整性與機密性要求防止資料被不該處理的人處理,也防止遺失或毀損。課責要求能說明這些原則如何被遵守。
當事人權利包含查閱、更正、刪除(被遺忘權)、資料可攜。查閱是看自己的資料,更正是改正錯誤,刪除是要求移除,資料可攜是把自己的資料取走、移轉。高風險處理要做資料保護影響評估(data protection impact assessment, DPIA),在處理之前評估對個人資料保護的影響。最高罰款為 2,000 萬歐元或全球年營業額 4%,取較高者。
歐盟 AI 法(EU AI Act)以風險分級管理 AI 系統。不可接受風險的做法予以禁止。高風險系統承擔嚴格義務。有限風險主要是透明義務,例如告知使用者正在與 AI 互動。最小風險的管制最輕。該法於 2024 年 8 月 1 日生效,各項義務分階段適用,不是生效當天全部開始。
三、容易混淆的地方
五組名稱常一起混淆。先分開三件事:資料有沒有離開原地、保護的對象是明細還是統計結果、要擋的是傳輸途中被讀取還是不該讀的人去讀。
| 容易混淆 | 差別在哪 | 實際遇到時的線索 |
|---|---|---|
| 假名化與匿名化 | 假名化以代號取代識別符,對照表在就可還原,GDPR 下仍是個人資料。匿名化做到無法再識別且不可逆;真正匿名的資料不受 GDPR 規範。 | 資料集保留可還原的對照表時屬假名化;確認不可逆且無法再識別時,才是匿名化。 |
| 差分隱私與同態加密 | 差分隱私對查詢或統計結果加校準雜訊,使任一個人加入或移除的影響都很小;ε 越小保護越強、結果越不精確,適合公開統計。同態加密在密文上運算,解密後與明文運算相同,運算方看不到明文,代價是運算量大、速度慢。 | 公開統計需防止推回個人且以 ε 描述保護時看差分隱私;雲端代算不能看明文、結果又要與明文運算一致時看同態加密。 |
| 聯邦學習與集中式訓練 | 聯邦學習的資料留在本地,中央只收到參數或梯度。集中式訓練要把原始資料送到同一處再訓練。 | 合作需求要求病歷或客戶資料留在機構、中央只收參數或梯度時用聯邦學習;明細已匯到同一個雲端時則是集中式訓練。 |
| k-匿名與差分隱私 | k-匿名作用在明細:同一組準識別符至少 k 筆,單筆無法被挑出;同組敏感屬性全相同時仍會洩漏。差分隱私作用在統計結果,用雜訊限制單一人的影響。 | 釋出的資料表含準識別符、同一組至少 k 筆時看 k-匿名;公布彙總數字並加入雜訊時看差分隱私。 |
| 傳輸中加密與存取控制 | TLS 保護資料在傳送過程中不被旁人讀取。RBAC 與最小權限決定哪些角色可以存取已經到位的資料。 | 安全事件涉及傳輸途中被竊聽時用 TLS;若要限制哪些角色可以打開已到位的檔案,則設定存取控制。 |
做題時先圈出限制句。資料必須留在原地,就排除把明細送走的做法。結果必須與明文運算相同,就排除會加雜訊、會改掉原值的做法。
四、基礎練習
第 1 題
三家醫院希望共同訓練模型,三院的病歷都不能離開本院。若要在這個限制下合作,應採用哪一種做法?
- (A) 把病歷集中到雲端,匿名化之後再開始訓練
- (B) 先對病歷做同態加密,再交給第三方保存
- (C) 採用聯邦學習,病歷留在各院本地訓練,只交換模型參數或梯度
- (D) 將病歷做成 k-匿名後公開下載,供各方訓練
看答案與解析
答案:C
限制是病歷不能離開各院,訓練就要發生在各院本地。聯邦學習只把模型參數或梯度送到中央彙整,原始病歷不出院。
- (A) 病歷集中到雲端時已經離開各院。事後匿名沒有改變資料離開本院這個事實。
- (B) 同態加密處理的是在密文上運算。把密文交給第三方保存,病歷仍然離開本院,而且保存並不是共同訓練。
- (D) k-匿名後公開下載,病歷會離開醫院並對外釋出。k-匿名用在釋出明細,不是用在資料不離院的跨院訓練。
第 2 題
某工廠把薪資計算委託給雲端。雲端需要算出全體員工的薪資總和,而且不能看到任何明文金額;解密之後的總和,必須與在明文上相加的結果相同。應採用哪一種技術?
- (A) 差分隱私:在總和上加入校準雜訊
- (B) 遮罩:金額只顯示頭尾,其餘以符號隱藏
- (C) 假名化:員工編號換成代號後,把資料交給雲端彙總
- (D) 同態加密:雲端直接在密文上計算總和
看答案與解析
答案:D
同態加密可在加密資料上計算總和。解密後的結果與明文相加相同,雲端在計算過程中看不到明文金額。兩個條件一起被滿足。
- (A) 差分隱私會在結果中加入雜訊,總和不會等於明文相加,也不是讓雲端在密文上運算。
- (B) 遮罩藏掉金額的一部分之後,雲端看不到完整明文,也無法把被藏住的數字加回正確總和。
- (C) 假名化替換的是識別符。金額若以明文送出,雲端看得到;它沒有在密文上運算的能力。
第 3 題
某市政府要公開各行政區的統計數字,同時防止他人把公布結果拿去比對、推回個別居民。哪一個做法正確?
- (A) 公布前刪除姓名即可,統計數字就不會再識別到人
- (B) 以差分隱私發布:在統計結果加入經校準的雜訊;隱私預算 ε 越小,隱私保護越強
- (C) 同樣使用差分隱私,但 ε 越大,隱私保護越強
- (D) 改用同態加密來公開這些統計,就不需要處理推回個人的問題
看答案與解析
答案:B
要公開的是統計數字,要防的是從結果推回個人。差分隱私在統計結果加入經校準的雜訊,使任何一個人的資料加入或移除,對結果的影響都很小。ε 越小,隱私保護越強,結果越不精確。
- (A) 只刪除姓名,只去掉直接識別,沒有在統計結果上加入校準雜訊,擋不住以其他欄位比對、推回個人。
- (C) ε 越大,對雜訊的要求越鬆,隱私保護越弱。方向與差分隱私的定義相反。
- (D) 同態加密讓運算發生在密文上,使計算方看不到明文。它沒有把要公開的統計變成難以推回個人的結果。
第 4 題
某電商把客戶身分證號換成隨機代號,並保留代號與身分證號的對照表,必要時可以還原。依 GDPR,下列何者正確?
- (A) 這是假名化;對照表可還原,資料仍屬個人資料
- (B) 這是匿名化;已無法識別,不受 GDPR 規範
- (C) 這是差分隱私;代號等於加在資料上的校準雜訊
- (D) 這是 k-匿名;換成代號後,每筆至少與 k−1 筆相同
看答案與解析
答案:A
身分證號換成隨機代號,同時保留對照表,就是假名化。對照表使代號可以還原到特定人。GDPR 下,假名化資料仍是個人資料。
- (B) 匿名化必須無法再識別,而且不可逆。對照表還在,兩個條件都不成立。
- (C) 差分隱私是在查詢結果或統計量上加入經校準的雜訊,不是把身分證號換成代號。
- (D) k-匿名要求同一組準識別符至少有 k 筆相同紀錄。換掉一個識別符並沒有建立這個分組。
第 5 題
某醫院釋出就醫資料後,接收方手中沒有姓名,仍用郵遞區號、出生日期、性別比對出特定病人。下列判斷何者正確?
- (A) 只要釋出前刪除姓名,這種比對就不會發生
- (B) 傳輸這份資料時使用 TLS,就可以防止這次再識別
- (C) 沒有姓名,就不屬於個人資料風險
- (D) 這三欄是準識別符,組合後造成再識別;應以泛化或抑制達到 k-匿名等保護
看答案與解析
答案:D
郵遞區號、出生日期、性別合在一起仍可能鎖定特定人,屬於準識別符。這次比對就是準識別符組合造成的再識別。釋出前應做泛化,把精確值改成較粗的區間,或做抑制,刪除罕見值或整欄,使每筆紀錄在準識別符上至少與 k−1 筆其他紀錄相同,也就是同一組的筆數 ≥ k。
- (A) 刪除姓名只去掉直接識別。這三個準識別符都還在,比對仍可能發生。
- (B) TLS 保護傳輸過程不被旁人讀取。釋出之後的再識別發生在內容組合,不是發生在傳輸被竊聽。
- (C) 個人資料包含間接識別。準識別符能鎖定特定自然人時,就是個人資料風險。
第 6 題
某電商的業務人員把客戶名單貼進公開的生成式 AI 服務,請它把欄位整理成統一格式。資安單位的判斷,何者正確?
- (A) 業務人員刪掉自己畫面上的對話紀錄後,就沒有外洩風險
- (B) 公開的生成式 AI 服務不會保存任何貼上去的資料
- (C) 這可能造成個人資料外洩;應有使用政策,採用企業版或內部部署並確認資料不用於訓練,同時搭配 DLP 與教育訓練
- (D) 只要改用速度更快的模型,風險就會下降
看答案與解析
答案:C
客戶名單是個人資料。貼進公開的生成式 AI 服務後,內容可能被保存,也可能被用於訓練。控制要一起到位:制定使用政策、採用企業版或內部部署並確認資料不用於訓練、以 DLP 攔截、以及教育訓練。
- (A) 刪掉自己畫面上的對話紀錄,收不回服務端可能已經保存或已經用於訓練的內容。
- (B) 公開的生成式 AI 服務可能保存貼上的資料,也可能拿去訓練。選項所說的「不會保存」與這個風險不符。
- (D) 更換更快的模型,沒有改變資料被貼上公開服務這件事,也沒有補上政策、部署方式、DLP 與教育訓練。
五、重點回顧
- 個人資料包含直接識別與間接識別。郵遞區號、生日、性別這類準識別符組合起來,也可能在沒有姓名時鎖定特定人;欄位愈多、愈細,再識別的風險愈高。
- 病歷、醫療、基因、性生活、健康檢查及犯罪前科是《個人資料保護法》第 6 條的特種個資,原則上不得蒐集、處理或利用,須符合法定例外。蒐集、處理、利用都要有特定目的,並停在目的範圍內。
- 留有對照表、還原得回來的是假名化,在 GDPR 下仍是個人資料。做到無法再識別且不可逆,才是匿名化;真正匿名的資料不受 GDPR 規範。
- 釋出明細、要避免單筆被挑出時,用 k-匿名:每筆在準識別符上至少與 k−1 筆其他紀錄相同;同組敏感屬性若都一樣,仍會洩漏。公開統計、要讓任一個人的加入或移除幾乎不影響結果時,用差分隱私,ε 越小保護越強、結果越不精確。雲端要在看不到明文時得到與明文運算相同的結果,用同態加密,代價是運算量大、速度慢。原始資料不能離開各機構又要共同訓練,用聯邦學習,只交換參數或梯度,並留意梯度仍可能洩漏。
- 傳輸中的資料用 TLS 保護,存放用儲存加密;誰能讀寫由 RBAC 與最小權限原則決定;稽核日誌、資料分級、備份與復原分別負責追查、區分管制強度與故障後復原。客戶資料、原始碼、機密文件貼進公開的生成式 AI,可能被保存或用於訓練,模型也可能在輸出中重現訓練資料裡的個人資料;對策是使用政策、企業版或內部部署並確認不用於訓練、資料外洩防護(DLP)與教育訓練。
- GDPR 以合法、公平、透明、目的限制、資料最小化、正確性、儲存限制、完整性與機密性、課責為原則;當事人有查閱、更正、刪除(被遺忘權)與資料可攜的權利;高風險處理要做資料保護影響評估(DPIA);罰款上限是 2,000 萬歐元或全球年營業額 4%,取較高者。歐盟 AI 法把系統分為不可接受風險(禁止)、高風險(嚴格義務)、有限風險(透明義務,例如告知使用者正在與 AI 互動)與最小風險,2024 年 8 月 1 日生效,義務分階段適用。