AI 安全與推論系統
ResponseGuard 以單次前向傳播攔截多模態有害回覆,延遲較推理式防護低約 150 倍
ResponseGuard 將多模態回覆審查改寫為二元分類,不生成思考鏈,能在串流期間逐句判斷。作者自測顯示回覆偵測優於 3B 推理式基線,但模型權重、訓練程式與資料切分尚未實際上線。

新提出的 ResponseGuard 挑戰「安全模型也需要逐步推理」的設計。系統以 Qwen3-VL-Embedding-2B 為骨幹,凍結視覺編碼器,再用 LoRA、兩組安全/有害參考向量及小型分類頭,匯集使用者提示、圖片與目前回覆的表示。輸出是單一有害機率,不解碼理由或標籤 token,因此每次檢查只需一次前向傳播;部署端可在每個句子完成後重新評分,超過門檻便中止生成。
作者在同一張 RTX A6000、BF16、暖快取條件下,測得 ResponseGuard-2B 判斷延遲中位數為 67.6 毫秒;GuardReasoner-VL-3B 平均生成約 238 個推理 token,耗時 10.12 秒。多模態回覆有害性測試的加權 F1 分別為 77.31 與 76.56。將推理鏈重新抽樣,只改變 2.5% 的文字判斷及 7.8% 的圖片判斷,鏈長與正確率也幾乎沒有相關,支持部分安全推理可能只是事後解釋。
串流模擬在 0.5 門檻下可於完成前攔下 95% 有害回覆,並隱藏 87.7% 有害文字;代價是 28.5% 正常回覆也被誤停。圖片仍是弱點:推理基線在提示審查整體領先,ResponseGuard 的不確定性亦集中於純圖片案例。更關鍵的是,儲存庫目前只有說明文件,權重、訓練與評估 notebook、串流工具及預處理切分仍標示「coming soon」。工程團隊應等待可執行產物,並以自身語言、圖片類型和可接受誤攔率重新校準,而不能直接採用論文門檻。