微調破壞安全對齊
Fine-Tuning Breaking Safety Alignment
重新評估
風險描述
當外流的模型權重遭第三方以少量資料微調後公開流通,防護機制已被移除時;系統因原開發組織雖非行為人,仍因模型來源可辨識而面臨聲譽與責任爭議,除引發相關利害關係人權益損害外,亦將造成企業合規與營運商譽代價。
框架對照
OWASP Top 10 for LLMLLM03
MITRE ATLASAML.T0018
NIST AI 100-2Poisoning
ISO/IEC 5338重新評估
MIT AI Risk RepositoryDomain 4
具體風險處置與實施指引
於訓練階段導入安全對齊魯棒性技術,提高少量微調移除防護的成本; 對權重外流預作應變計畫,包含可辨識來源的標記與公開聲明程序; 監控公開流通的衍生模型,發現防護遭移除版本即啟動通報與下架請求