生成針對群體的仇恨內容
Generation of Hate Content Targeting Groups
運行與監控
風險描述
當攻擊者以創作研究為名逐步誘導,取得大量針對特定群體的貶抑內容並散布於網路時;系統因組織的防護在單次請求層級均正常運作,卻未能辨識整體意圖,除引發相關利害關係人權益損害外,亦將造成企業合規與營運商譽代價。
框架對照
EU AI ActArt.5、Art.50
NIST AI 600-1Dangerous, Violent, or Hateful Content
NIST AI RMFMANAGE 2.4
ISO/IEC 5338運作與監控
MIT AI Risk RepositoryDomain 4
具體風險處置與實施指引
部署有害內容偵測與多層輸出過濾,涵蓋針對群體的貶抑內容; 對逐步誘導型態進行跨輪意圖分析而非僅單輪檢視; 對確認濫用的帳號實施處置並保留紀錄配合平台治理