返回首頁

推論系統與評測

AgentX 公開長上下文代理推論結果,以真實工作階段形狀取代固定長度壓測

SemiAnalysis 已公開 AgentX 即時結果與完整重播工具,用多回合程式代理軌跡比較 GPU、推論引擎與快取設計。公開語料保留請求長度、共享前綴、停頓及子代理拓撲,但以合成內容取代原始提示與程式碼。

Vladusty · CC0 · Image source
zh-Hant

SemiAnalysis 的 InferenceX 現已上線 AgentX 即時結果,涵蓋 MI355X、GB300/GB200 NVL72、B200、H200、H100 等硬件,以及多款大型開放模型。它要修補傳統推論基準的盲點:固定的 8K 輸入、1K 輸出單回合請求,無法反映程式代理反覆擴張上下文、暫停等待工具、分裂子代理及重用 KV cache 的負載。

AgentX v1.0 語料由自願收集的 Claude Code 工作階段轉換而成,共 393 個 session、135,282 次請求;單次輸入中位數約 142,016 token,輸出中位數僅 444 token。這種「極長 prefill、極短 decode」比例會把瓶頸從純解碼吞吐量推向 prefix cache 命中、KV 容量與卸載、conversation-aware routing、長提示排程及子代理突發流量。另有 256K 版本,會移除超過視窗的請求,方便測試原生上下文較短的伺服器。

基準透過 NVIDIA AIPerf 的 `inferencex-agentx-mvp` 情境重播軌跡,固定原始請求時序、快取預熱、cache busting、完整回應生成與隨機種子。違反規則的執行會留下 `submission_valid: false`,而公開程式碼、工作流程產物及儀表板可追溯至個別測試。這比只公布一個 tokens/s 數字更有利於定位路由器、序列化或外部 KV 層的問題。

限制同樣重要:NVIDIA 文件仍把實作標為 work-in-progress MVP,規格與欄位可能改動;提示文字是合成的,因此保留的是流量結構而非任務語義,也不能衡量模型解題品質。工程師應等待跨團隊重現、能源數據與不同語料版本的敏感度分析,再把排行榜差距轉成採購或容量規劃結論。

來源

  1. InferenceX AgentX live results
  2. AgentX methodology
  3. AgentX Harness repository
  4. InferenceX AgentX MVP Benchmark
  5. SemiAnalysis launches AgentX 1.0 benchmark