文字對抗樣本規避偵測
Adversarial Text Evading Detection
驗證與確效
風險描述
當惡意內容經字元變形處理後成功繞過內容過濾機制,大量進入平台時;系統因人工檢視時發現內容對讀者而言毫無異狀,過濾規則卻完全未觸發,除引發相關利害關係人權益損害外,亦將造成企業合規與營運商譽代價。
框架對照
MITRE ATLASAML.T0043
NIST AI 100-2Evasion
OWASP Top 10 for LLMLLM01
ISO/IEC 5338驗證與確效
MIT AI Risk RepositoryDomain 2
具體風險處置與實施指引
於過濾前執行文本正規化,還原字元變形、同形字與插入符號; 部署字元級異常偵測,辨識刻意規避過濾的變形模式; 以已知規避樣本持續更新過濾器並執行紅隊測試