S0072RS3-T09-S0072-Z · 完整風險編碼

文字對抗樣本規避偵測

Adversarial Text Evading Detection

驗證與確效
風險描述

當惡意內容經字元變形處理後成功繞過內容過濾機制,大量進入平台時;系統因人工檢視時發現內容對讀者而言毫無異狀,過濾規則卻完全未觸發,除引發相關利害關係人權益損害外,亦將造成企業合規與營運商譽代價。

框架對照

MITRE ATLASAML.T0043
NIST AI 100-2Evasion
OWASP Top 10 for LLMLLM01
ISO/IEC 5338驗證與確效
MIT AI Risk RepositoryDomain 2

具體風險處置與實施指引

於過濾前執行文本正規化,還原字元變形、同形字與插入符號; 部署字元級異常偵測,辨識刻意規避過濾的變形模式; 以已知規避樣本持續更新過濾器並執行紅隊測試