跳到主要內容
Lab Grimoire
TW
請喝咖啡
動手實作

隱私保護、安全與合規:去識別化、差分隱私與法規

假名化與匿名化、k-匿名、差分隱私、同態加密、聯邦學習的適用情境,資料安全控制,生成式 AI 的個資風險,個資法、GDPR 與歐盟 AI 法重點。

作者
CY
發表
AI 的資料基礎:從統計到生成式 AI · 第 18/19 篇

本系列第 18 篇|這篇回答:用資料訓練與使用 AI 時,怎麼保護資料裡的人? 讀完這篇,你應該能:

  • 依情境選擇隱私強化技術:匿名化、假名化、差分隱私、同態加密、聯邦學習
  • 指出傳輸加密、存取控制、稽核、分級與備份各自擋住哪一種風險
  • 用台灣個資法的特種個資與目的限制,以及 GDPR、歐盟 AI 法的核心觀念判斷合規要求

一、原理:資料越多,被識別的風險越高

個人資料與準識別符(quasi-identifier)

刪除姓名只去掉直接識別,留下的準識別符仍可能指出特定人。

詳細說明

個人資料是能直接或間接識別特定自然人的資料。直接識別靠單一欄位就夠,例如姓名、身分證號。間接識別靠欄位組合。郵遞區號、生日、性別像拼圖的單片,單獨一片常常對不上人;三片合在一起,就可能鎖定特定人。這類本身不是姓名、卻能協助鎖定個人的欄位,就是準識別符。

刪除姓名只去掉直接識別。欄位留得愈多、分得愈細,準識別符愈容易和別的資料對上,再識別的風險愈高。拿到一批明細時,先檢查這些欄位合在一起會不會指出特定人。

特種個資與特定目的

特種個資原則上不得蒐集、處理或利用,且須限於特定目的。

詳細說明

台灣《個人資料保護法》第 6 條列出的特種個資,包括病歷、醫療、基因、性生活、健康檢查及犯罪前科。原則上不得蒐集、處理或利用,須符合法定例外。醫院之間若要用病歷訓練模型,面對的就是這條原則上的禁止;例外是否成立,要看該次利用是否符合法律所定的例外,不能用合作方便代替。

個人資料的蒐集、處理、利用應有特定目的,並在目的範圍內。某電商為了出貨蒐集地址,用在出貨上,是在原來的目的裡。若改拿去訓練一個與出貨無關的模型,這次利用就超出原本的特定目的,原則上不能直接沿用同一批資料,要先確認是否符合法定例外。

二、去識別化、隱私強化、安全控制與法規核心

遮罩(masking)、泛化(generalization)與抑制(suppression)

遮罩留頭尾,泛化改成較粗範圍,抑制則刪除罕見值或整欄。

詳細說明

遮罩是部分隱藏,例如身分證號顯示成 A12****789,頭尾仍在。泛化是把精確值改成較粗的範圍,例如年齡 34 改成 30–39 歲。抑制是刪除罕見值或整欄。某種準識別符組合若極少出現,留下它就容易把那個人標出來,所以把該值或該欄拿掉。

假名化(pseudonymization)與匿名化(anonymization)

對照表還在就只是假名化,匿名化必須不可逆且無法再識別。

詳細說明

假名化用代號取代識別符。對照表若保留,持有對照表的人就能把代號還原成特定人。在 GDPR(歐盟一般資料保護規則)下,假名化資料仍是個人資料。

匿名化要處理到無法再識別個人,而且不可逆。真正匿名的資料不受 GDPR 規範。只換代號、對照表還在,還原的鑰匙就還在,處理停在假名化。

k-匿名(k-anonymity)

k-匿名檢查同組準識別符筆數 ≥ k,但敏感屬性仍可能洩漏。

詳細說明

k-匿名檢查準識別符。每一筆紀錄在準識別符上至少與 k−1 筆其他紀錄相同,也就是同一組準識別符的筆數 ≥ k。外人至多知道某人落在哪一組,無法把單一筆挑出來。

弱點在敏感屬性。同一組裡若都是同一種疾病,外人挑不出是哪一筆,卻知道這組每一個人的疾病。l-多樣性(l-diversity)等延伸,用來要求同組內的敏感屬性夠分散,避免這種洩漏。

差分隱私(differential privacy)

差分隱私在結果加入雜訊,ε 越小保護越強且結果越不精確。

詳細說明

差分隱私作用在查詢結果或統計量。在結果中加入經校準的雜訊,使任何一個人的資料加入或移除,對結果的影響都很小。適合公開統計資料,又要降低別人從公布數字推回個人的場合。

隱私強度看隱私預算 ε。ε 越小,隱私保護越強,結果越不精確。ε 變大時,結果可以更接近原始統計,隱私保護則變弱。

同態加密(homomorphic encryption)

同態加密直接在加密資料上運算,解密後與明文運算結果相同。

詳細說明

同態加密可直接在加密資料上運算。解密後的結果,與在明文上做同一運算的結果相同。雲端可以代算,卻看不到原始資料。代價是運算量大、速度慢。

聯邦學習(federated learning)與安全多方計算(secure multi-party computation, SMPC)

聯邦學習交出參數或梯度,安全多方計算守住各方輸入。

詳細說明

聯邦學習把訓練留在資料所在處。各機構或裝置在本地訓練,只交換模型參數或梯度給中央彙整,原始資料不匯到同一處。醫院、銀行之間不能共享原始資料、又要共同建模時,這個安排符合限制。

梯度仍可能洩漏部分資訊,常搭配差分隱私或安全彙總(secure aggregation)。

安全多方計算是多方共同計算一個函數,各方看不到彼此的輸入。它的重點是輸入保密地完成共同計算,不必然是在訓練模型。聯邦學習交出的是參數或梯度;安全多方計算守住的是各方的輸入。

傳輸、存取與事後追查

加密管移動中與靜止的資料,存取控制管誰能用,稽核日誌供事後追查。

詳細說明

傳輸中加密(TLS)保護資料在網路上移動的那一段,使傳送過程不被旁人讀取。儲存加密保護靜止的資料,沒有金鑰就讀不到內容。誰可以讀、誰可以改,交給存取控制:以 RBAC(role-based access control)依角色授權,並守最小權限原則,只給完成工作所需的權限。

傳輸加密處理的是移動中的資料。存取控制處理的是誰有權使用已經在系統裡的資料。

稽核日誌記錄何人何時做了什麼,供事後追查。資料分級按敏感程度區分管制強度,特種個資與一般聯絡資料不必用同一套管制。備份與復原處理遺失與毀損,讓資料在故障之後回得來。

生成式 AI的貼上風險

貼上時內容可能被保存或用於訓練,輸出也可能重現個人資料。

詳細說明

員工把客戶資料、原始碼或機密文件貼進公開的生成式 AI 服務時,內容可能被保存,也可能被用於訓練。風險發生在貼上的那一刻。

控制有四層:制定使用政策,寫明哪些資料不准貼;採用企業版或內部部署,並確認資料不用於訓練;用資料外洩防護(data loss prevention, DLP)在貼上或上傳時攔截;用教育訓練讓業務與工程知道客戶名單不屬於「請模型幫忙排版」的材料。

模型也可能記住訓練資料中的個人資料,並在輸出中重現。訓練集裡有沒有個人資料、輸出會不會把記憶內容吐出來,要在上線前檢查。

原則、權利與風險分級

GDPR 以原則與權利約束處理,歐盟 AI 法再按風險分級。

詳細說明

GDPR 的原則包含合法、公平、透明、目的限制、資料最小化、正確性、儲存限制、完整性與機密性、課責。目的限制與第一節的特定目的同一方向:利用停在事先所定的目的裡。資料最小化要求只處理該目的所需的資料。正確性要求資料正確,並能改正錯誤。儲存限制要求保存期間配合目的,不無限期留下。完整性與機密性要求防止資料被不該處理的人處理,也防止遺失或毀損。課責要求能說明這些原則如何被遵守。

當事人權利包含查閱、更正、刪除(被遺忘權)、資料可攜。查閱是看自己的資料,更正是改正錯誤,刪除是要求移除,資料可攜是把自己的資料取走、移轉。高風險處理要做資料保護影響評估(data protection impact assessment, DPIA),在處理之前評估對個人資料保護的影響。最高罰款為 2,000 萬歐元或全球年營業額 4%,取較高者。

歐盟 AI 法(EU AI Act)以風險分級管理 AI 系統。不可接受風險的做法予以禁止。高風險系統承擔嚴格義務。有限風險主要是透明義務,例如告知使用者正在與 AI 互動。最小風險的管制最輕。該法於 2024 年 8 月 1 日生效,各項義務分階段適用,不是生效當天全部開始。

三、容易混淆的地方

五組名稱常一起混淆。先分開三件事:資料有沒有離開原地、保護的對象是明細還是統計結果、要擋的是傳輸途中被讀取還是不該讀的人去讀。

容易混淆 差別在哪 實際遇到時的線索
假名化與匿名化 假名化以代號取代識別符,對照表在就可還原,GDPR 下仍是個人資料。匿名化做到無法再識別且不可逆;真正匿名的資料不受 GDPR 規範。 資料集保留可還原的對照表時屬假名化;確認不可逆且無法再識別時,才是匿名化。
差分隱私與同態加密 差分隱私對查詢或統計結果加校準雜訊,使任一個人加入或移除的影響都很小;ε 越小保護越強、結果越不精確,適合公開統計。同態加密在密文上運算,解密後與明文運算相同,運算方看不到明文,代價是運算量大、速度慢。 公開統計需防止推回個人且以 ε 描述保護時看差分隱私;雲端代算不能看明文、結果又要與明文運算一致時看同態加密。
聯邦學習與集中式訓練 聯邦學習的資料留在本地,中央只收到參數或梯度。集中式訓練要把原始資料送到同一處再訓練。 合作需求要求病歷或客戶資料留在機構、中央只收參數或梯度時用聯邦學習;明細已匯到同一個雲端時則是集中式訓練。
k-匿名與差分隱私 k-匿名作用在明細:同一組準識別符至少 k 筆,單筆無法被挑出;同組敏感屬性全相同時仍會洩漏。差分隱私作用在統計結果,用雜訊限制單一人的影響。 釋出的資料表含準識別符、同一組至少 k 筆時看 k-匿名;公布彙總數字並加入雜訊時看差分隱私。
傳輸中加密與存取控制 TLS 保護資料在傳送過程中不被旁人讀取。RBAC 與最小權限決定哪些角色可以存取已經到位的資料。 安全事件涉及傳輸途中被竊聽時用 TLS;若要限制哪些角色可以打開已到位的檔案,則設定存取控制。

做題時先圈出限制句。資料必須留在原地,就排除把明細送走的做法。結果必須與明文運算相同,就排除會加雜訊、會改掉原值的做法。

四、基礎練習

第 1 題

三家醫院希望共同訓練模型,三院的病歷都不能離開本院。若要在這個限制下合作,應採用哪一種做法?

  • (A) 把病歷集中到雲端,匿名化之後再開始訓練
  • (B) 先對病歷做同態加密,再交給第三方保存
  • (C) 採用聯邦學習,病歷留在各院本地訓練,只交換模型參數或梯度
  • (D) 將病歷做成 k-匿名後公開下載,供各方訓練
看答案與解析

答案:C

限制是病歷不能離開各院,訓練就要發生在各院本地。聯邦學習只把模型參數或梯度送到中央彙整,原始病歷不出院。

  • (A) 病歷集中到雲端時已經離開各院。事後匿名沒有改變資料離開本院這個事實。
  • (B) 同態加密處理的是在密文上運算。把密文交給第三方保存,病歷仍然離開本院,而且保存並不是共同訓練。
  • (D) k-匿名後公開下載,病歷會離開醫院並對外釋出。k-匿名用在釋出明細,不是用在資料不離院的跨院訓練。

第 2 題

某工廠把薪資計算委託給雲端。雲端需要算出全體員工的薪資總和,而且不能看到任何明文金額;解密之後的總和,必須與在明文上相加的結果相同。應採用哪一種技術?

  • (A) 差分隱私:在總和上加入校準雜訊
  • (B) 遮罩:金額只顯示頭尾,其餘以符號隱藏
  • (C) 假名化:員工編號換成代號後,把資料交給雲端彙總
  • (D) 同態加密:雲端直接在密文上計算總和
看答案與解析

答案:D

同態加密可在加密資料上計算總和。解密後的結果與明文相加相同,雲端在計算過程中看不到明文金額。兩個條件一起被滿足。

  • (A) 差分隱私會在結果中加入雜訊,總和不會等於明文相加,也不是讓雲端在密文上運算。
  • (B) 遮罩藏掉金額的一部分之後,雲端看不到完整明文,也無法把被藏住的數字加回正確總和。
  • (C) 假名化替換的是識別符。金額若以明文送出,雲端看得到;它沒有在密文上運算的能力。

第 3 題

某市政府要公開各行政區的統計數字,同時防止他人把公布結果拿去比對、推回個別居民。哪一個做法正確?

  • (A) 公布前刪除姓名即可,統計數字就不會再識別到人
  • (B) 以差分隱私發布:在統計結果加入經校準的雜訊;隱私預算 ε 越小,隱私保護越強
  • (C) 同樣使用差分隱私,但 ε 越大,隱私保護越強
  • (D) 改用同態加密來公開這些統計,就不需要處理推回個人的問題
看答案與解析

答案:B

要公開的是統計數字,要防的是從結果推回個人。差分隱私在統計結果加入經校準的雜訊,使任何一個人的資料加入或移除,對結果的影響都很小。ε 越小,隱私保護越強,結果越不精確。

  • (A) 只刪除姓名,只去掉直接識別,沒有在統計結果上加入校準雜訊,擋不住以其他欄位比對、推回個人。
  • (C) ε 越大,對雜訊的要求越鬆,隱私保護越弱。方向與差分隱私的定義相反。
  • (D) 同態加密讓運算發生在密文上,使計算方看不到明文。它沒有把要公開的統計變成難以推回個人的結果。

第 4 題

某電商把客戶身分證號換成隨機代號,並保留代號與身分證號的對照表,必要時可以還原。依 GDPR,下列何者正確?

  • (A) 這是假名化;對照表可還原,資料仍屬個人資料
  • (B) 這是匿名化;已無法識別,不受 GDPR 規範
  • (C) 這是差分隱私;代號等於加在資料上的校準雜訊
  • (D) 這是 k-匿名;換成代號後,每筆至少與 k−1 筆相同
看答案與解析

答案:A

身分證號換成隨機代號,同時保留對照表,就是假名化。對照表使代號可以還原到特定人。GDPR 下,假名化資料仍是個人資料。

  • (B) 匿名化必須無法再識別,而且不可逆。對照表還在,兩個條件都不成立。
  • (C) 差分隱私是在查詢結果或統計量上加入經校準的雜訊,不是把身分證號換成代號。
  • (D) k-匿名要求同一組準識別符至少有 k 筆相同紀錄。換掉一個識別符並沒有建立這個分組。

第 5 題

某醫院釋出就醫資料後,接收方手中沒有姓名,仍用郵遞區號、出生日期、性別比對出特定病人。下列判斷何者正確?

  • (A) 只要釋出前刪除姓名,這種比對就不會發生
  • (B) 傳輸這份資料時使用 TLS,就可以防止這次再識別
  • (C) 沒有姓名,就不屬於個人資料風險
  • (D) 這三欄是準識別符,組合後造成再識別;應以泛化或抑制達到 k-匿名等保護
看答案與解析

答案:D

郵遞區號、出生日期、性別合在一起仍可能鎖定特定人,屬於準識別符。這次比對就是準識別符組合造成的再識別。釋出前應做泛化,把精確值改成較粗的區間,或做抑制,刪除罕見值或整欄,使每筆紀錄在準識別符上至少與 k−1 筆其他紀錄相同,也就是同一組的筆數 ≥ k。

  • (A) 刪除姓名只去掉直接識別。這三個準識別符都還在,比對仍可能發生。
  • (B) TLS 保護傳輸過程不被旁人讀取。釋出之後的再識別發生在內容組合,不是發生在傳輸被竊聽。
  • (C) 個人資料包含間接識別。準識別符能鎖定特定自然人時,就是個人資料風險。

第 6 題

某電商的業務人員把客戶名單貼進公開的生成式 AI 服務,請它把欄位整理成統一格式。資安單位的判斷,何者正確?

  • (A) 業務人員刪掉自己畫面上的對話紀錄後,就沒有外洩風險
  • (B) 公開的生成式 AI 服務不會保存任何貼上去的資料
  • (C) 這可能造成個人資料外洩;應有使用政策,採用企業版或內部部署並確認資料不用於訓練,同時搭配 DLP 與教育訓練
  • (D) 只要改用速度更快的模型,風險就會下降
看答案與解析

答案:C

客戶名單是個人資料。貼進公開的生成式 AI 服務後,內容可能被保存,也可能被用於訓練。控制要一起到位:制定使用政策、採用企業版或內部部署並確認資料不用於訓練、以 DLP 攔截、以及教育訓練。

  • (A) 刪掉自己畫面上的對話紀錄,收不回服務端可能已經保存或已經用於訓練的內容。
  • (B) 公開的生成式 AI 服務可能保存貼上的資料,也可能拿去訓練。選項所說的「不會保存」與這個風險不符。
  • (D) 更換更快的模型,沒有改變資料被貼上公開服務這件事,也沒有補上政策、部署方式、DLP 與教育訓練。

五、重點回顧

  • 個人資料包含直接識別與間接識別。郵遞區號、生日、性別這類準識別符組合起來,也可能在沒有姓名時鎖定特定人;欄位愈多、愈細,再識別的風險愈高。
  • 病歷、醫療、基因、性生活、健康檢查及犯罪前科是《個人資料保護法》第 6 條的特種個資,原則上不得蒐集、處理或利用,須符合法定例外。蒐集、處理、利用都要有特定目的,並停在目的範圍內。
  • 留有對照表、還原得回來的是假名化,在 GDPR 下仍是個人資料。做到無法再識別且不可逆,才是匿名化;真正匿名的資料不受 GDPR 規範。
  • 釋出明細、要避免單筆被挑出時,用 k-匿名:每筆在準識別符上至少與 k−1 筆其他紀錄相同;同組敏感屬性若都一樣,仍會洩漏。公開統計、要讓任一個人的加入或移除幾乎不影響結果時,用差分隱私,ε 越小保護越強、結果越不精確。雲端要在看不到明文時得到與明文運算相同的結果,用同態加密,代價是運算量大、速度慢。原始資料不能離開各機構又要共同訓練,用聯邦學習,只交換參數或梯度,並留意梯度仍可能洩漏。
  • 傳輸中的資料用 TLS 保護,存放用儲存加密;誰能讀寫由 RBAC 與最小權限原則決定;稽核日誌、資料分級、備份與復原分別負責追查、區分管制強度與故障後復原。客戶資料、原始碼、機密文件貼進公開的生成式 AI,可能被保存或用於訓練,模型也可能在輸出中重現訓練資料裡的個人資料;對策是使用政策、企業版或內部部署並確認不用於訓練、資料外洩防護(DLP)與教育訓練。
  • GDPR 以合法、公平、透明、目的限制、資料最小化、正確性、儲存限制、完整性與機密性、課責為原則;當事人有查閱、更正、刪除(被遺忘權)與資料可攜的權利;高風險處理要做資料保護影響評估(DPIA);罰款上限是 2,000 萬歐元或全球年營業額 4%,取較高者。歐盟 AI 法把系統分為不可接受風險(禁止)、高風險(嚴格義務)、有限風險(透明義務,例如告知使用者正在與 AI 互動)與最小風險,2024 年 8 月 1 日生效,義務分階段適用。

覺得有幫助? RSS · X · 請我喝杯咖啡

由表頭的三個欄位往下讀每一列,再看被框住的組合線索。

準識別符組合可能鎖定個人
1 / 4
第一列同時出現三個欄位
郵遞區號、生日與性別單看未必指認個人,組合後可能形成唯一線索。數值為示意。
  1. 這一列把三個準識別符放在同一筆。單看這一筆,還不知道組合是否只對到一個人。
  2. 少了性別這一欄,兩筆就重疊在同一組。準識別符要合起來看,才知道會不會鎖定特定人。
  3. 這一列的三欄組合沒有和前兩列重疊。組合不同,就可能指向不同的人。
  4. 三片合在一起就可能鎖定特定人。拿到明細時,要先檢查這些準識別符會不會指出特定人。

左右對照原始值與三種處理,身分證號看遮罩,年齡看泛化,兩列的抑制都是刪除。

遮罩、泛化、抑制保留不同資訊
1 / 3
表頭分出原始與三種處理
遮罩留下部分字元,泛化降低精度,抑制則移除罕見值;例子取自文章。
  1. 同一筆原始值旁邊並列遮罩、泛化、抑制,才能比較它們各留下什麼。
  2. 遮罩只隱藏中間字元,頭尾仍在。抑制欄把該值刪除,泛化欄則沒有改成範圍。
  3. 泛化把精確值改成較粗的範圍。抑制同樣刪除該值,因為極少出現的組合容易把人標出來。

兩列各是一組準識別符,橫向三筆都標成同組,用來看筆數是否夠多。

每組至少有 k 筆相同準識別符
1 / 3
表頭列出準識別符組與三筆
同一組準識別符至少出現 k 次,單一紀錄才不易被挑出;k 與筆數為示意。
  1. k-匿名檢查的是準識別符。每一筆要能在組內找到其他相同紀錄,才不會被單獨挑出。
  2. 同一組準識別符的筆數要 ≥ k。外人至多知道某人落在這組,無法把單一筆挑出來。
  3. 兩組都是整列相同,表示組內紀錄在準識別符上彼此相同。筆數達到 ≥ k 時,單一筆就不易被挑出。

先看標成保護強的曲線有多寬,再對照標成結果較準的那一條。

ε 越小,雜訊越寬且保護越強
1 / 2
繪出 ε 小且保護強的曲線
小 ε 加入較寬的雜訊分佈,隱私保護較強但結果較不精確;曲線為示意。
  1. 隱私預算越小,加入的雜訊越寬,任何一個人加入或移除都難以明顯改變結果。
  2. ε 變大時,結果可以更接近原始統計,隱私保護則變弱。兩條曲線的差別就是這個取捨。

沿箭頭走一圈:模型送出、本地訓練、回傳參數、中央彙整,再回到起點。

資料留在本地,只彙整模型參數
1 / 5
中央先送出模型
中央送出模型,各機構本地訓練後回傳參數,由中央彙整;原始資料不集中。
  1. 聯邦學習從中央的模型出發。原始資料不先匯到中央,訓練會留在資料所在處。
  2. 各機構或裝置在本地訓練。醫院、銀行不能共享原始資料時,這個安排仍符合限制。
  3. 離開本地的是模型參數或梯度,不是原始資料。原始資料仍然不匯到同一處。
  4. 中央彙整的是各方的參數或梯度。梯度仍可能洩漏部分資訊,所以常搭配差分隱私或安全彙總。
  5. 箭頭連回中央送出模型,彙整後的模型可以再送出。整段交換的仍是參數或梯度。