代理評測
FluxBench 將晶片代理拉進完整 RTL-to-GDS 流程,同模型架構差距最高達 86%
FluxBench 以統一提示、工具與製程庫測試代理從 RTL 生成一路完成合成、布局繞線及 ECO,而非只評單次程式輸出。作者報告相同基礎模型搭配不同代理框架可出現 86.27% 的效能差距,但商用 EDA 實驗範圍狹窄,論文版本也曾撤回後重發。

一篇近日進入技術社群視野的研究提出 FluxBench,試圖回答 AI 程式代理能否真正完成晶片的 RTL-to-GDS 工作,而不只是生成一段看似合理的 Verilog。評測固定提示、工具環境與 technology library,涵蓋 RTL 生成、依編譯器回饋反覆修補、邏輯合成、placement and routing,以及 Engineering Change Order 自動化;其中既有開源工具鏈,也有以 PicoRV32 為案例的封閉商用 EDA 流程。
核心發現是,基礎模型相同並不會讓代理表現趨同。作者稱不同代理系統架構之間的任務差距最高達 86.27%;在完成度相近的系統中,衡量有效設計改善相對於 token 與執行成本的 Token ROI,最大可差到 105.92 倍。研究中的 FluxEDA 在 PicoRV32 端到端評分最高達 97.94,並宣稱最多比掛載領域 Skill 的 Claude Code 高 8.39 倍。這支持一個重要工程判斷:僅增加提示文件或領域知識,無法替代狀態管理、錯誤恢復、工具回饋解析與階段間上下文傳遞。
不過,這些倍數不能直接外推到先進晶片。論文只涵蓋有限框架、模型與單一封閉工業流程,部分工具和環境也難以由外部研究者完整重現;端到端分數與 Token ROI 仍是作者設計的指標。此外,arXiv 紀錄顯示 v2 曾撤回,v3 於 7 月 23 日重新上傳,引用數字時應以最新版本為準。接下來值得追蹤的是公開 harness、更多 RTL 規模與製程節點,以及代理生成結果能否通過形式驗證、時序收斂和功耗限制,而非只完成工具流程。