S0113RS3-T06-S0113-Z · 完整風險編碼

模型逆向重建訓練資料

Model Inversion Reconstructing Training Data

設計與開發
風險描述

當攻擊者針對以敏感影像訓練的模型進行大量查詢,重建出可辨識的近似影像時;系統因組織原認為模型本身不含原始資料,未針對此風險設防,事件構成實質外洩,除引發相關利害關係人權益損害外,亦將造成企業合規與營運商譽代價。

框架對照

OWASP Top 10 for LLMLLM02
NIST AI 600-1Data Privacy
MITRE ATLASAML.T0024
ISO/IEC 5338運作與監控
MIT AI Risk RepositoryDomain 2

具體風險處置與實施指引

對以敏感影像等資料訓練的模型採差分隱私訓練,降低單一樣本可被重建的程度; 於推論介面實施輸出擾動、查詢頻率限制與異常查詢偵測,提高重建攻擊成本; 將模型逆向重建納入上線前紅隊測試項目