直接提示注入繞過防護
Direct Prompt Injection Bypassing Safeguards
驗證與確效
風險描述
當惡意行為者透過多輪對話與角色扮演進行直接提示詞注入 (Prompt Injection) 攻擊時;系統因防護層僅具備單輪語意檢測而缺乏跨輪意圖分析,於互動時遭繞過安全對齊護欄並輸出違法指引,除造成內容安全防線失守外,亦引發企業合規責任與商譽損害。
框架對照
OWASP Top 10 for LLMLLM01
MITRE ATLASAML.T0051
NIST AI 600-1Information Security
ISO/IEC 5338運作與監控
MIT AI Risk RepositoryDomain 2
具體風險處置與實施指引
部署提示注入偵測,對逐步誘導型態進行跨輪意圖分析而非僅單輪檢視; 於輸出端設置護欄,最終輸出仍須通過內容政策檢查; 對敏感主題設定累積風險門檻,多輪漸進觸及即升級處置