微調階段破壞安全對齊
Safety Alignment Broken During Fine-Tuning
設計與開發
風險描述
當組織委外進行模型微調,未驗證微調資料集內容時;系統因上線後模型在特定誘導下輸出應被阻擋的內容,組織才發現安全對齊已在微調過程中被破壞,除引發相關利害關係人權益損害外,亦將造成企業合規與營運商譽代價。
框架對照
OWASP Top 10 for LLMLLM04
MITRE ATLASAML.T0018
NIST AI 100-2Poisoning
ISO/IEC 5338設計與開發
MIT AI Risk RepositoryDomain 2
具體風險處置與實施指引
對委外微調的資料集執行安全審查,確認不含破壞對齊的樣本; 微調後執行對齊性驗證測試,比對微調前後的安全行為基準; 部署後持續監控安全護欄的有效性,偵測誘導下的異常輸出