S0118RS3-T10-S0118-Z · 完整風險編碼

直接提示注入繞過防護

Direct Prompt Injection Bypassing Safeguards

驗證與確效
風險描述

當惡意行為者透過多輪對話與角色扮演進行直接提示詞注入 (Prompt Injection) 攻擊時;系統因防護層僅具備單輪語意檢測而缺乏跨輪意圖分析,於互動時遭繞過安全對齊護欄並輸出違法指引,除造成內容安全防線失守外,亦引發企業合規責任與商譽損害。

框架對照

OWASP Top 10 for LLMLLM01
MITRE ATLASAML.T0051
NIST AI 600-1Information Security
ISO/IEC 5338運作與監控
MIT AI Risk RepositoryDomain 2

具體風險處置與實施指引

部署提示注入偵測,對逐步誘導型態進行跨輪意圖分析而非僅單輪檢視; 於輸出端設置護欄,最終輸出仍須通過內容政策檢查; 對敏感主題設定累積風險門檻,多輪漸進觸及即升級處置