S0029RS4-T16-S0029-Z · 完整風險編碼

合成資料放大既有偏誤

Synthetic Data Amplifying Existing Bias

設計與開發
風險描述

當組織為擴充資料量而大量使用生成資料訓練新版模型時;系統因數次迭代後,模型對邊緣案例的處理能力明顯下降,輸出趨於同質,且原本已改善的偏誤重新出現,追查後發現源自生成資料的分佈窄化,除引發相關利害關係人權益損害外,亦將造成企業合規與營運商譽代價。

框架對照

EU AI ActArt.10
NIST AI 600-1Harmful Bias and Homogenization
NIST AI RMFMEASURE 2.11
ISO/IEC TR 24027
ISO/IEC 5338設計與開發
MIT AI Risk RepositoryDomain 1

具體風險處置與實施指引

對合成資料執行偏見與分布檢測,確認未窄化原始分布; 維持原始資料的最低比例,避免生成資料主導訓練分布; 逐代監測模型的多樣性與邊緣案例能力,退化即調整資料組成