評測與資安
FuzzingBrain-Bench 不指定目標漏洞,Claude Opus 4.8 在 77 項挑戰中觸發 60 項崩潰
新基準把完整易受攻擊程式、模糊測試介面及 sanitizer 封入離線 Docker 映像,依可重現的不同崩潰簽章評分。設計可計入模型意外找到的缺陷,但現有難度係數由同一組受測模型產生,排名仍帶有循環性。

Texas A&M University 團隊發布 FuzzingBrain-Bench V1,嘗試把 LLM 漏洞評測從「重現一個已知 CVE」改成較開放的找錯任務。每項挑戰向代理提供易受攻擊版本的完整專案、模糊測試 harness 與 sanitizer 設定,但不提供修補提交、目標程式行或參考 PoC;代理須在最多 100 輪、30 分鐘內產生能觸發盡量多種崩潰的輸入。
基準包含 43 個開源專案的 77 項挑戰,其中 36 項使用 C、32 項使用 C++、9 項使用 Java/JVM。45 項源自記憶體安全缺陷,其餘涵蓋記憶體耗盡、未捕捉例外、可達 assertion、未定義行為及演算法複雜度等問題。每個候選輸入會在離線 Docker 映像內執行三次,只有三次都在相同位置觸發相同 fault class 才計分;簽章由錯誤類型與最多三個應用程式堆疊框架組成,用來排除同一崩潰的重複輸入。評分不依賴 LLM 裁判。
作者完整測試 Claude Haiku 4.5、Sonnet 4.6 與 Opus 4.8。Opus 在 60/77 項挑戰產生崩潰輸入,取得 196/579 分;Sonnet 為 50 項及 156 分,Haiku 為 35 項及 58 分,仍有 13 項沒有任何模型成功。Opus 全套 API 成本約 193 美元,低於 Sonnet 的 253 美元但高於 Haiku 的 43 美元;不同模型的工具使用方式與提前終止行為,使成本不能只由模型單價推算。
公開的 MIT 授權程式庫提供 CLI、MCP 介面、Codex/Claude Code 後端及無答案的挑戰映像,方便研究者接入其他模型或傳統 fuzzer。不過,系統只能確認「出現新的可重現崩潰簽章」,無法在沒有答案鍵的情況下證明它對應獨立漏洞、原始目標缺陷或可利用的安全問題。更重要的是,五級難度係數由這三款 Claude 的表現建立,再用來替同一批模型評分;在加入跨模型、重複執行與外部 fuzzing 基線前,196/579 不宜視為通用漏洞發現能力排名。