模型記憶化導致資料外洩
Data Leakage Through Model Memorization
設計與開發
風險描述
當攻擊者以特定格式的提示反覆測試,成功從模型輸出中取得訓練資料內的真實個人資訊時;系統因組織原認為資料已充分處理,卻未評估模型記憶化風險,事件構成個資外洩並須依法通報,除引發相關利害關係人權益損害外,亦將造成企業合規與營運商譽代價。
框架對照
OWASP Top 10 for LLMLLM02
NIST AI 600-1Data Privacy
MITRE ATLASAML.T0024
ISO/IEC 5338運作與監控
MIT AI Risk RepositoryDomain 2
具體風險處置與實施指引
於訓練階段評估並緩解模型記憶化風險,對含個資的訓練採差分隱私或等效技術; 上線前執行記憶化偵測測試,模擬提示誘出訓練資料的攻擊型態; 於輸出層過濾疑似原文個資的內容,攔截真實個人資訊外流