Back Home

AI 安全與稽核

AISPA 稽核商用 AI 的隱藏系統提示,約四成產品含損害使用者利益的指令

AISPA 把系統提示拆成八項使用者保障維度,並分析 88 款商用 AI 產品中的 3,249 條指令。雖然 98.9% 的產品至少包含一項保護性規則,完整覆蓋八個面向的比例只有 24%。

zh-Hant

系統提示決定聊天機器人如何陳述身分、使用個資、呼叫工具及拒絕危險要求,卻通常只有產品開發者能看到。AISPA(Artificial Intelligence System Prompt Assurance)嘗試把這層隱藏控制面轉成可比較的稽核對象,而不是只從模型最終回答反推產品行為。

框架把提示中的個別指令依八個面向分類,包括身分透明度、真實性與資訊完整性、隱私、工具及行動安全、使用者自主權、危險要求處理、傷害防止,以及公平與中立。研究者檢視 88 款商用 AI 產品的 3,249 條指令,逐條判定其對使用者具有保護作用,或可能違反使用者利益。結果顯示,98.9% 的產品至少有一條保護性指令,但只有 24% 涵蓋全部八個面向;不同開發者的差異也很大,部分組織每項產品平均超過 60 條保護規則,另一些不足五條。約四成受測產品至少含一條問題指令,而保護與問題規則經常同時存在。

這項研究的工程意義在於,提示不能再只被視為難以測試的字串。團隊另設 System Prompt Index,提供產品級結果與互動式提示稽核,讓安全團隊可把提示版本、規則分類和風險標記納入發版審查。實務上仍需要配合工具權限、資料流追蹤與行為測試:一條寫得正確的隱私指令,不代表底層連接器沒有讀取過量資料;反之,提示中未明寫控制項,也不等於產品完全缺乏外部防護。

最大限制是樣本來自公開 GitHub 儲存庫所收集的提示,可能包含外洩版本、歷史版本或不完整片段,不能直接代表各產品目前的生產設定。網站目前展示的彙總口徑也與論文摘要不完全相同,因此跨產品排名應視為探索性訊號,而非合規認證。下一步值得關注的是資料版本、重複樣本與標註一致性是否公開,以及 AISPA 能否與可重現的黑箱行為測試建立對應。

Sources

  1. AISPA: User-Centric System Prompt Auditing for Large Language Model Applications
  2. System Prompt Index