網路爬取內容涉著作權爭議
Copyright Disputes Over Web-Scraped Content
設計與開發
風險描述
當組織使用公開爬取的資料集訓練商用模型時;系統因內容權利人發現模型輸出與其作品高度相似後提出侵權主張,組織既無法證明資料來源的授權狀態,也難以將特定內容自模型中移除,除引發相關利害關係人權益損害外,亦將造成企業合規與營運商譽代價。
框架對照
EU AI ActArt.53
NIST AI 600-1Intellectual Property
ISO/IEC 42001Annex A.7.5
ISO/IEC 5338設計與開發
MIT AI Risk RepositoryDomain 6
具體風險處置與實施指引
對訓練資料集執行著作權審查,記錄各來源的授權狀態並排除授權不明的內容; 建立訓練資料授權管理制度,商用模型優先採用有明確授權或合法例外依據的資料; 於輸出端部署與已知作品的相似度偵測,降低高度近似輸出的侵權暴露