人類偏好資料遭操縱
Manipulation of Human Preference Data
設計與開發
風險描述
當組織的偏好標註流程缺乏標註者行為監控時;系統因部分標註者持續偏好具誘導性的回應,模型調校後展現迎合與誘導傾向,組織直到收到使用者反映才察覺行為已偏移,除引發相關利害關係人權益損害外,亦將造成企業合規與營運商譽代價。
框架對照
OWASP Top 10 for LLMLLM04
MITRE ATLASAML.T0020
NIST AI 100-2Poisoning
EU AI ActArt.5
ISO/IEC 5338設計與開發
MIT AI Risk RepositoryDomain 2
具體風險處置與實施指引
對偏好標註實施多層驗證,關鍵偏好樣本由多人獨立標註比對; 部署標註者行為分析,偵測系統性偏向特定回應型態的異常模式; 於調校後以行為基準測試驗證模型未出現迎合或誘導傾向