訓練資料代表性不足
Insufficient Representation in Training Data
設計與開發
風險描述
當AI系統於整體測試中表現優異,實際部署後發現對特定族群的判讀準確率明顯偏低時;系統因追查發現訓練資料中該族群樣本佔比極少,模型未能學到其特徵差異,導致特定團體面臨較高的誤判風險,除引發相關利害關係人權益損害外,亦將造成企業合規與營運商譽代價。
框架對照
EU AI ActArt.10
NIST AI 600-1Harmful Bias and Homogenization
NIST AI RMFMEASURE 2.11
ISO/IEC TR 24027
ISO/IEC 5338設計與開發
MIT AI Risk RepositoryDomain 1
具體風險處置與實施指引
於資料準備階段評估各族群樣本的代表性,佔比不足者列為風險; 主動補充少數群體資料或以加權策略平衡訓練分布; 驗證階段按族群拆分評測,不以整體指標掩蓋族群落差