影像對抗擾動攻擊
Adversarial Perturbation of Images
驗證與確效
風險描述
當攻擊者對輸入影像加入特製擾動,使檢測系統將應攔截的物件判定為正常時;系統輸出無任何異常提示,人工複核也因擾動不可見而無法察覺,除引發相關利害關係人權益損害外,亦將造成企業合規與營運商譽代價。
框架對照
MITRE ATLASAML.T0043
NIST AI 100-2Evasion
OWASP Top 10 for LLMLLM01
ISO/IEC 5338驗證與確效
MIT AI Risk RepositoryDomain 2
具體風險處置與實施指引
以對抗性訓練強化模型對擾動輸入的韌性; 於輸入端部署擾動偵測與預處理(去噪、壓縮重建),削弱對抗特徵; 對高風險攔截場景建立第二重獨立驗證機制,不以單一模型判定放行