ホームへ戻る

模型與代理

Muse Spark 1.3、エージェントのツール呼び出しを削減――最高推論モードは安全性テスト待ち

MetaはMuse Sparkを更新し、長期的に動作するエージェント、ソフトウェア開発、複数の話題が混在する会話でのタスク追跡を重点的に強化した。社内比較では、ツール呼び出し回数とtoken使用量がともに減少している。モデルはすでにMuse CodeとAPIで提供されているが、最高推論モード、オープンウェイト、完全に再現可能な評価結果はまだ公開されていない。

Kekko 14 at Italian Wikipedia · Public domain · Image source
zh-Hant

Metaは9月2日、Muse Spark 1.3をリリースした。現在はMuse CodeおよびMeta Model APIを通じて利用できる。今回の更新は、単にパラメータ数やコンテキスト長を拡大したものではない。複数のエージェントハーネスで長期タスクを実行できるよう、モデルを再トレーニングしている。相互に矛盾する情報源から作業コンテキストを構築し、計画の不足を補完できるほか、複数の作業が混在する同一の会話から現在有効な指示を識別できる。また、要件が不明確な場合、障害に直面した場合、あるいは不可逆的な操作を実行しようとする場合には、以前より頻繁にユーザーへ確認を求めるという。

コーディング作業についてMetaは、社内エンジニアによる比較で、1.3はSpark 1.2よりツール呼び出しが約20%、token使用量が約25%少なかったとしている。また、長時間にわたるcoding task向けのトレーニングも強化した。この差が同一のハーネス、モデル温度、停止条件のもとで再現できるなら、単一のbenchmarkにおけるスコア向上よりも、エージェントのコストや累積的な失敗率にとって大きな意味を持つ。ツールとの往復が1回減るたびに、権限、ネットワーク、パースに関するエラーが発生する機会も1回減るためだ。

ただし、公式評価にはMeta独自の測定結果、公開leaderboard、競合各社が公表した最高スコアが混在している。サードパーティモデルの調整も「ベストエフォート」にとどまり、完全に対称な比較ではない。OSWorldのバージョンもSpark 1.2と新モデルで一致しておらず、社内指標のIF Indexには固定された公開問題セットがない。Metaはprompt injectionへの耐性と不可逆的な操作に関する判断能力が向上したと主張しているが、独立評価による攻撃成功率は公表していない。さらに注目すべき点として、既存の推論モードは先行して提供されたものの、`max`モードは追加の安全性テストを完了する必要がある。予告されているオープンウェイトもまだ公開されていない。エンジニアリングチームは今後、実際のAPI料金、レイテンシ、ツールのエラー率に加え、最高推論モードの提供開始時に新たな安全性レポートが添付されるかを確認すべきだ。

出典

  1. Introducing Muse Spark 1.3
  2. Muse Spark 1.3 Multimodal Evaluation Methodology