模型架構與代理工具使用
循環推論で複数ツールの組み合わせを改善、1B LlamaのBFCL平均スコアが21.4から32.9に上昇
同じTransformer層を再利用し、各tokenを生成する前に隠れ状態を反復更新する手法を研究。同一のデータとLoRA設定で循環モデルと通常モデルを比較したところ、改善は並列呼び出しと呼び出し間の依存関係に集中した。一方、単一のAPI呼び出しが中心のAPI-Bankでは、一貫した優位性は見られなかった。

一般的な自己回帰モデルでは、各tokenを生成する際、データは固定深度のTransformerを一度だけ通過する。これに対し、looped language modelは同じパラメータ群を繰り返し使用し、tokenを出力する前に隠れ状態を反復更新する。新たな研究では、この「重みを増やさずに深度を増やす」手法が、エージェントによる関数選択、複数呼び出しの組み合わせ、前のAPIの出力と次の呼び出しの引数との正確な紐付けを改善できるか検証した。
研究チームは、ネイティブな循環アーキテクチャであるOuro-1.4B、Ouro-2.6Bに加え、Llama-3.2-1BとOLMo-2-1Bを循環型に改造したモデルを比較した。統制されたモデルはいずれもHermes function-callingデータ、同一のLoRA rank 32、2 epoch、最大4,096 token、A100 80GBでの学習という条件を使用した。BFCLのSimple、Multiple、Parallel、Parallel-Multipleという4カテゴリーの平均では、通常のSFTを施したLlama-3.2-1Bが21.4だったのに対し、循環版は32.9を記録した。特にParallelカテゴリーでは14.0から31.0へ上昇した。OLMo-2-1Bの平均スコアは39.1から41.8へ小幅に向上した。
前の呼び出しの出力を処理する必要があるNESTfulでは、深度の効果がより明確に表れた。Ouro-2.6BのSFT版は0.371のwin rateを達成し、比較対象に含まれたQwen3-8B-Instructの0.345を上回った。また、モデルを固定したまま循環回数を増やすと、ネストされたワークフローのスコアはおおむね上昇し続けた。各tokenで反復を停止するか判断するadaptive gateも、固定の4回を下回る平均反復回数で、同等のNESTfulスコアを維持できた。
ただし、Ouroには完全に同一の事前学習条件で作られた非循環版が存在しないため、差のすべてをrecurrenceに帰することはできない。また、改造されたモデルは、深くネストされたタスクでは依然としてネイティブ循環モデルに大きく後れを取った。3つのベンチマークはいずれも静的な単一ターンのテストであり、ツールの失敗、再試行、状態のドリフトはまだ扱っていない。今後は、実際のtoken latency、KV cache、メモリコストを測定するとともに、実行可能なマルチターン環境において、adaptive depthがより大きなモデルを直接使用するよりも引き続き費用対効果に優れるかを検証する必要がある。