返回首頁

模型與代理系統

Sakana Fugu 分拆成本與能力路線,多模型編排改以單一相容 API 提供

Sakana AI 推出 Fugu Max 與 Fugu Ultra v2,分別把多模型編排最佳化為低成本與高能力兩條路線。兩者沿用 OpenAI 相容介面,但官方基準仍混合自有測試與供應商成績,尚不足以證明實際工作負載的成本優勢。

Syced · CC0 · Image source
zh-Hant

Sakana AI 於 9 月 11 日發布 Fugu Max 與 Fugu Ultra v2。它們並非兩組新開放權重,而是同一套學習式編排架構的兩種服務設定:使用者送出一次請求,Fugu 的指揮模型在內部選擇、委派及協調多個專門模型,再整合結果,對外仍呈現為單一模型端點。

Fugu Max 以成本—能力帕累托前緣為目標,擴充可調度的開放權重與專門模型池,包含 NVIDIA Nemotron。定價為每百萬輸入/輸出 token 2/6 美元,快取輸入為 0.25 美元;官方宣稱它在十項測試中的七項改善既有成本—成績前緣,並於 Terminal Bench 2.1、GPQAD、AutomationBench 等六項取得最高綜合分數。Ultra v2 則增加編排深度,面向長推理、軟體工程及結構化視覺任務,定價為5/30美元;超過272K上下文後升至10/45美元。

較值得注意的是,Ultra v2 在 Chartography 得到48.3分,官方對照的 Opus 5與Fable 5分別為27.3與29.5;八項基準中有五項最佳或並列最佳。Sakana 同時說明其訓練截止日為8月28日,模型池不含Fable 5、Fable 5.1或GPT-6 Astra,因此不是直接以最新閉源模型充當子代理。

這項發布把「換更大的基礎模型」之外的另一條擴展路徑產品化:工程團隊可以維持同一 API,按工作負載在成本優先與能力優先間切換,也較容易替換底層供應商。但測試大多由 Sakana 自行執行,SWEFish 更是內部基準;跨模型協作亦天然增加延遲、失敗節點及結果不可重現性。採用者下一步應以完整任務成本、尾延遲、工具副作用與重試率評估,而不能只比較公開的每 token 單價。

來源

  1. Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier
  2. Sakana Fugu Technical Report
  3. Sakana AI、「Fugu Max」「Fugu Ultra v2」をリリース