返回首頁

模型與代理

Muse Spark 1.3 減少代理工具呼叫,最高推理模式仍等待安全測試

Meta 更新 Muse Spark,主攻長週期代理、程式開發及混雜對話中的任務追蹤,內部比較顯示工具呼叫與 token 用量同步下降。模型已進入 Muse Code 與 API,但最高推理模式、開放權重和可重現的完整評測仍未到位。

Kekko 14 at Italian Wikipedia · Public domain · Image source
zh-Hant

Meta 於 9 月 2 日推出 Muse Spark 1.3,現已透過 Muse Code 與 Meta Model API 提供。這次更新並非單純擴大參數或上下文,而是重新訓練模型在多種代理 harness 中執行長週期任務:它能從互相矛盾的來源建立工作上下文、修補計畫缺口,在同一條混雜多項工作的對話中辨認目前指令,也更常在需求不清、遇到阻礙或即將執行不可逆操作時要求使用者確認。

程式工作方面,Meta 表示,相較 Spark 1.2,1.3 在內部工程師比較中約少用 20% 工具呼叫與 25% token,並針對長時間 coding task 加強訓練。若差異能在相同 harness、模型溫度與停止條件下重現,對代理成本與累積失敗率會比單項 benchmark 增分更有意義;每減少一次工具往返,也少一次權限、網路或解析錯誤的機會。

不過官方評測混合自家執行、公開排行榜及競爭者自行公布的最高分,第三方模型也只是「盡力」調校,並非完全對稱比較。OSWorld 版本在 Spark 1.2 與新模型之間亦不一致,內部 IF Index 沒有公開固定題集。Meta 宣稱提示注入抵抗力及不可逆操作判斷改善,但沒有公布獨立攻擊成功率。更值得注意的是,既有推理模式先行上線,`max` 模式仍須完成額外安全測試;承諾中的開放權重也尚未發布。工程團隊下一步應觀察實際 API 價格、延遲、工具錯誤率,以及最高推理模式上線後是否附帶新版安全報告。

來源

  1. Introducing Muse Spark 1.3
  2. Muse Spark 1.3 Multimodal Evaluation Methodology