返回首頁

AI 安全與評測

AISPA 審核 88 款商用 AI 的隱藏指令,約四成產品含不利使用者規則

AISPA 將系統提示詞拆成八項使用者權益維度,審核 88 款商用 AI 產品中的 3,249 條指令。98.9% 的產品至少含一項保護規則,但只有 24% 覆蓋全部維度,約四成同時存在被判定為有問題的指令。

King of Hearts · CC BY-SA 3.0 · Image source
zh-Hant

系統提示詞會決定模型如何描述身分、處理個資、揭露限制及服從產品方利益,但使用者與外部稽核者通常看不到這一層。AISPA(Artificial Intelligence System Prompt Assurance)試圖把提示詞審核從零散爆料改造成可比較的評測:研究者把每條指令依八個與使用者相關的維度分類,再判斷它具有保護作用、屬中性,或可能違反使用者利益。

研究分析公開 GitHub 儲存庫所收集的 88 款商用產品系統提示詞,共標註 3,249 條指令。論文指出,98.9% 的產品至少有一條保護性指令,但僅 24% 同時涵蓋八個維度;不同開發者的平均保護規則數量可相差十倍以上。約 40% 的產品至少包含一條問題指令,而且保護與問題規則經常出現在同一份提示詞內,說明僅檢查「是否有安全條款」不足以判斷產品實際如何排序利益。

配套的 System Prompt Index 將部分提示詞、公司層級結果和互動式審核工具公開,讓研究者能追查標註依據。對工程團隊而言,AISPA 可被轉成提示詞的靜態檢查流程:在版本發布前比較身分透明度、資料使用、操控性與申訴等面向,並把提示詞變更納入程式碼審查與回歸測試。它也提醒採用第三方代理或提示模板的團隊,隱藏指令本身就是需要建立來源與版本紀錄的供應鏈元件。

不過,這不是對 88 款產品整體安全性的排名。樣本取自公開儲存庫,可能偏向曾遭洩漏、開源或容易擷取的版本,未必等同產品目前在線上的提示詞;文字規則也不必然反映模型最終行為。下一步需要由產品方核對版本、公布標註者一致性,並將靜態提示詞審核與實際對話、工具呼叫及資料流測試結合。

來源

  1. AISPA: User-Centric System Prompt Auditing for Large Language Model Applications
  2. System Prompt Index