返回首頁

推論與評測

AgentX 1.0 以 393 組真實代理軌跡重播百萬 token 推論負載

SemiAnalysis 開放長上下文、多回合及子代理並發的 AgentX,讓推論系統不再只以固定長度提示詞比較吞吐量。資料保留請求時序與 KV-cache 重用形狀,但來源集中於 Claude Code,且量測的是服務系統效率而非程式任務正確率。

Aram Dulyan (User:Aramgutang) · Public domain · Image source
zh-Hant

SemiAnalysis 發布 AgentX 1.0,為 InferenceX 加入可重播的代理式程式工作負載。傳統推論測試通常固定輸入、輸出長度,再量測每秒 token;AgentX 改為重現多回合對話、工具呼叫造成的停頓、子代理突發並發,以及隨歷史累積而升高的 KV-cache 命中。這些因素會同時壓迫 HBM 容量、前綴路由、跨節點 KV 傳輸與 DRAM/SSD 卸載,因而更接近長時間 coding agent 的服務形態。

首批 Apache 2.0 資料包含 393 組匿名化 Claude Code 代理軌跡,共 56,798 個主代理回合、1,697 組子代理展開及 98,827 次模型請求。資料卡統計約 216 億個輸入 token、1.06 億個輸出 token;44% 工作階段至少啟動一個子代理。完整版保留接近百萬 token 的請求,另提供每次請求不超過 256K token 的衍生集,方便測試上下文較短的模型。

重播器以 AIPerf 按原始相對時序發送請求,並掃描不同同時使用者數,量測每使用者輸出速率、首 token 延遲、端到端延遲、每晶片吞吐量、功耗及前綴快取行為。公開儀表板、REST API、設定、執行紀錄和結果處理程式,讓工程師能追查單一資料點的模型、硬件、精度與 serving framework 組合。這比只看峰值 tokens/s 更適合驗證 session-aware routing、分離式 prefill/decode 和階層式 KV cache。

限制也很明確:軌跡主要來自 SemiAnalysis 的 Claude Code 代理流量,不能代表所有研究、瀏覽或企業代理;內容經匿名化並以 64-token KV 區塊保存,其輸入長度是快取區塊估算值,極長上下文可能高估真實 tokenizer 計數。更重要的是,重播器不重新完成原本的程式任務,因此結果只能回答「這套服務系統多快、多省」,不能證明模型寫對程式。後續值得觀察的是其他 harness 的公開軌跡、跨供應商獨立重現,以及快取命中率與真實任務完成時間能否保持一致。

來源

  1. AgentX — InferenceXv3: Does the CUDA Moat Hold Up in Agentic Inferencing?
  2. SemiAnalysisAI/agentx-harness
  3. cc-traces-weka-062126 Dataset Card