模型發布
OpenAI、GPT-5.6をSol、Terra、Lunaに分割し、100万トークンのコンテキストとエージェント向けツールインターフェースを統一
GPT-5.6ファミリーが一般提供を開始し、Sol、Terra、Lunaがそれぞれ最高性能、コストとのバランス、大量の低コストワークロードを担う。3モデルは長大なコンテキストとツールインターフェースを共有するが、推論コスト、安全性に関する挙動、実際の品質については個別の評価が必要だ。
OpenAIは7月9日、GPT-5.6ファミリーの一般提供を開始し、フラッグシップのSol、バランス型のTerra、コスト重視のLunaという3モデルに分けた。公式情報によると、3モデルはいずれもテキストと画像を入力として受け付け、約105万トークンのコンテキスト、最大128Kトークンの出力に対応するほか、Function Calling、Web Search、File Search、Computer Useなどのツールを利用できる。製品設計では、すべてのリクエストに同一のフラッグシップモデルを使用することを求めず、タスクの価値、レイテンシー、推論の深さに応じてシステムがルーティングする方式を採用している。
エージェントシステムにとって最大の変化は、長大なコンテキストとツール利用能力がファミリー全体の共通インターフェースになったことだ。チームはLunaに分類、監視、短いアクションを処理させ、Terraに一般的なプログラミングや知識労働を担当させ、高難度の計画立案だけをSolへエスカレーションできる。ただし、公称100万トークンのコンテキストウィンドウが、モデルによるすべての位置の均等な活用を意味するわけではない。入力が長くなるほど、最初のトークンが返るまでのレイテンシー、キャッシュコスト、検索ノイズ、誤ったツール呼び出しが増える可能性もある。3モデルでコードを共有できても、プロンプトや停止条件をそのまま移植できるとは限らない。
開発者は、100万トークン当たりの単価だけを比較するのではなく、隠れた推論トークン、再試行、ツールの失敗、人間による引き継ぎを含め、タスク成功率と総コストを中心としたルーティング評価を構築すべきだ。初期段階では独立した観測結果がまだ限られており、公式ベンチマークもプロンプトやテスト設定の影響を受けている可能性がある。その後、Solがエージェントの安全性を巡るインシデントに関与したことは、能力向上をネットワーク分離、最小権限、行動予算と併せて評価しなければならないことを一層明確にしている。モデルが利用可能であることは、本番環境の認証情報へ直接アクセスさせるのに適していることを意味しない。