S0150RS6-T20-S0150-Z · 完整風險編碼

生成針對群體的仇恨內容

Generation of Hate Content Targeting Groups

運行與監控
風險描述

當攻擊者以創作研究為名逐步誘導,取得大量針對特定群體的貶抑內容並散布於網路時;系統因組織的防護在單次請求層級均正常運作,卻未能辨識整體意圖,除引發相關利害關係人權益損害外,亦將造成企業合規與營運商譽代價。

框架對照

EU AI ActArt.5、Art.50
NIST AI 600-1Dangerous, Violent, or Hateful Content
NIST AI RMFMANAGE 2.4
ISO/IEC 5338運作與監控
MIT AI Risk RepositoryDomain 4

具體風險處置與實施指引

部署有害內容偵測與多層輸出過濾,涵蓋針對群體的貶抑內容; 對逐步誘導型態進行跨輪意圖分析而非僅單輪檢視; 對確認濫用的帳號實施處置並保留紀錄配合平台治理