模型是提案者,不是授權者
LLM 可以提出動作與資源,但身分、權限與業務決策仍要由應用程式根據可信資料重新判斷。
從模型的不確定性與應用邊界出發,逐步理解 Prompt Injection、RAG、Agent、資料與供應鏈風險,以及可驗證的防禦與 AI Red Teaming 方法。
LLM 可以提出動作與資源,但身分、權限與業務決策仍要由應用程式根據可信資料重新判斷。
從客服退款與摘要流程拆解模型不確定性,找出意圖、決策、執行與資料邊界;安全控制由可驗證的程式與規則負責。
從 SQL Injection、XSS 與一次本機 Prompt Injection 實驗,拆解 LLM 資安延續了哪些既有原則,又因模型不確定性多了哪些工程難題。
先自己列出 LLM 應用的風險清單,再對照 OWASP 2026 版找出盲點,把十條掛回一個最小示範應用,並拿自己畫的三軸地圖跟官方的靶心圖互相檢查。
用本機 Ollama、合成筆記與固定模型 digest 建立可重現的 LLM 資安沙盒,實際觀察間接 Prompt Injection 如何帶出另一份筆記的假金鑰。
把刻意脆弱的 LLM 摘要器拆成資料流、儲存區與信任邊界,用 STRIDE 找出模型 context 以外的資訊洩漏路徑,再設計逐筆授權的讀取流程。
從刻意脆弱的 LLM 摘要器逐層追蹤資料,拆開身分、授權、內容與輸出用途,建立一份能判斷輸入可以影響什麼的 trust/taint worksheet。
以人工建立、內容固定的測試筆記進行三組實驗,分開驗證模型偏航與資料跨界,並建立可重現的 Prompt Injection 成功條件。
從 32 次固定實驗拆解資料如何變成競爭指令,並釐清 prompt 緩解、模型失守與系統安全邊界的差異。
用同一段攻擊文字比較使用者輸入與外部參考文件兩條路徑,從來源、控制者、序列化位置與 sink,判斷注入屬於直接還是間接。
用合成 HTML、PDF 與 email 追蹤隱藏指令如何經過 extractor 與應用程式 policy 進入模型,分開判讀入口曝露、行為偏航與資料跨界。
把角色扮演、假設情境、編碼、逐步誘導與 many-shot 拆成不同機制,用 30 個固定實驗單位分開量測行為偏離與合成資料跨界。
用 40 次固定對照實驗比較 system prompt、developer block、RAG 政策與 tool schema,拆開逐字外洩、語意重建與下游影響。
用 20 次固定圖片實驗拆開可達性、逐字服從與機密跨界,說明為什麼 PNG、語音與檔案格式都不是 Prompt Injection 的安全邊界。
用同一個本機摘要器重測十種注入情境,分開量測模型偏航與資料跨界,並把單一攻擊示範整理成可重跑的評估基準。
沿著資料來源、切塊、檢索、序列化與模型輸出拆解 RAG 攻擊面,並用十五次確定性追蹤分開驗證語料存在、被檢索器選取與模型偏航。
從共編政策遭竄改、撤銷到重建知識庫,說明資料投毒如何持續污染系統,並用二十次生命週期實驗驗證:來源失效後,衍生語料不會自動同步失效。
本文使用真實 Embedding、exact cosine 與 Qdrant 比較四種情境,說明相似度排名與租戶授權為什麼需要兩道獨立閘門,並整理向量反推、跨租戶檢索與同租戶投毒的防線。
以一個固定的惡意寄信提案為起點,拆解過度功能、過度權限與過度自主如何讓模型偏航造成真實副作用,並驗證最小權限、精確核准與批次警示的邊界。
從一個通過 JSON Schema 的 loopback URL 出發,拆解工具參數、後端授權、SSRF、命令注入與工具回傳內容的信任邊界,並以離線固定矩陣驗證逐次重判的作用。
從模型權重、Python 套件到第三方 MCP Server,拆解不可變身分、雜湊、來源證明、可執行格式與執行時權限,並以離線固定矩陣建立 ALLOW、REVIEW、BLOCK 接入判斷。
追蹤污染的 RAG 文件如何經檢索進入模型,讓 Agent 讀取合成案件資料,最後透過工具把資料送進記憶體內 sink;再以四個確定性控制點說明,模型提出的工具呼叫仍須由應用程式重新核准。
以固定任務契約驗證輸入格式,用 canonical JSON 保留來源與信任標記,再以 100 組配對實驗觀察這套防禦是否降低注入成功次數;同時說清楚,格式合法不等於內容安全。
用同一份本機模型候選輸出對照未轉義與安全渲染路徑,拆開 JSON schema、內容審核、sink 授權與 HTML escaping,實際修掉模型輸出形成 active HTML 的漏洞。
用 NeMo Guardrails 統一管理輸入、主題與輸出規則,並以固定實驗比較 LLM 語意判定、規則式控制、Prompt Guard 2 與既有應用程式邊界。
用固定案例逐項移除控制,並加入本機模型提案,驗證動作白名單、資源權限、特定動作確認與 Docker 執行期隔離各自守住哪一道 Agent 邊界。
用 24 個測試案例比較原文、應用程式規則、Presidio 內建辨識器與分層組合,釐清 PII 偵測、遮罩、授權與紀錄各自負責的邊界。
用 OpenTelemetry 比較保存原文與只保留允許欄位的 trace,再以六筆 HMAC 串接事件測試修改、刪除、交換、插入與尾端截斷,釐清觀測資料與稽核證據的責任邊界。
用七組固定事件比較無限制與完整控制路徑,分別驗證請求速率、輸入 token、輸出 token、總 token、並行數與預算限制。
用固定版本的 garak 與 PyRIT 測試同一個本機應用程式端點,在明確的請求上限內建立可重現且能持續執行的 AI Red Teaming 流程。
把 LLM 應用的輸入、資料、模型、輸出、工具、權限、執行期與營運控制,整理成可以指派負責人、保存證據並持續重驗的上線檢查清單。
從 OWASP 威脅地圖、攻擊靶場與 RAG/Agent 資料流開始,再用護欄和紅隊工具驗證防禦;每一階段都留下可重複檢查的成果。