S0040RS3-T08-S0040-Z · 完整風險編碼

微調階段破壞安全對齊

Safety Alignment Broken During Fine-Tuning

設計與開發
風險描述

當組織委外進行模型微調,未驗證微調資料集內容時;系統因上線後模型在特定誘導下輸出應被阻擋的內容,組織才發現安全對齊已在微調過程中被破壞,除引發相關利害關係人權益損害外,亦將造成企業合規與營運商譽代價。

框架對照

OWASP Top 10 for LLMLLM04
MITRE ATLASAML.T0018
NIST AI 100-2Poisoning
ISO/IEC 5338設計與開發
MIT AI Risk RepositoryDomain 2

具體風險處置與實施指引

對委外微調的資料集執行安全審查,確認不含破壞對齊的樣本; 微調後執行對齊性驗證測試,比對微調前後的安全行為基準; 部署後持續監控安全護欄的有效性,偵測誘導下的異常輸出