最新模型
Grok 4.7、長時間のプログラミングタスクへの対応を強化 APIが暗号化された推論状態を自動返却
新版では長時間タスクの訓練を増やし、Responses APIがターンをまたぐ推論状態を自動的に引き継げるようにした。公式評価では推論レベルが異なる条件で比較されており、APIとCursorの長文コンテキスト料金の適用基準も、それぞれ確認する必要がある。

SpaceXAIは9月21日にGrok 4.7をリリースし、API、Cursor、Grok Buildで提供を開始した。公式発表によると、新版ではより大規模な基盤モデルを採用し、強化学習の訓練期間を延長。完了までに数時間を要する難しいタスクも増やし、継続的な実行、自己検証、コンテキスト管理を重視している。[公式発表](https://x.ai/news/grok-4-7)
公式の表に掲載されたCursorBench 4.0のスコアは、前版の40.4%から46.3%に上昇した。ただし、推論レベルは新版がxhigh、前版がhighであり、同じ計算予算での比較ではない。これらの数値はモデル選定の手がかりになるものの、自社のコードベースで完了率、再試行回数、タスク全体のコストを測定する必要がある。[評価条件](https://x.ai/news/grok-4-7)
推論レベルは4段階あり、デフォルトはhigh。レベルを上げると、モデルが難しいタスクに取り組む時間が増える。実務で比較する際は、ツールの権限、コンテキストの切り詰めルール、制限時間を固定し、追加の思考によって誤りが減るかどうかも記録する必要がある。これにより、モデルの更新と推論予算の増加がそれぞれもたらす効果を切り分けられる。[推論設定](https://cursor.com/docs/models/grok-4-7)
APIはテキストと画像を入力として受け付け、テキストを出力する。コンテキスト長は50万トークン。統合に関する具体的な変更点として、Responses APIは、リクエストで取得を指定していなくても、暗号化された推論フィールドを必ず返すようになった。複数ターンにわたる呼び出しでは、推論項目をそのまま次の入力に戻す必要がある。そのため、会話を独自に保存するエージェントフレームワークでは、シリアライズと状態の復元も実装上の要点となり、ユーザーに見える回答だけを保存するのでは不十分だ。[導入ドキュメント](https://docs.x.ai/developers/grok-4-7)
キャッシュも長時間タスクのコストに影響する。公式ドキュメントでは、`prompt_cache_key`を設定して同じ会話を同じサーバーに振り分け、キャッシュヒットを安定させることを推奨している。この設定がないと、まだキャッシュが作成されていないノードに振り分けられる可能性がある。導入側は表示された単価だけで判断せず、キャッシュヒット率も推論レベルと併せてテストに組み込むべきだ。[キャッシュの説明](https://docs.x.ai/developers/grok-4-7)
公開APIの通常入力、キャッシュ入力、出力の料金は、100万トークン当たりそれぞれ2米ドル、0.5米ドル、6米ドル。プロンプトが20万トークンを超えると、それぞれ4米ドル、1米ドル、12米ドルになる。一方、Cursorで長文コンテキスト料金が適用される基準は25万6,000トークンであり、両者の課金条件は別々に確認する必要がある。Fast版は現在、CursorとGrok Buildでのみ提供されており、公開APIではまだ利用できない。[APIリリースノート](https://docs.x.ai/developers/release-notes)、[Cursorの仕様](https://cursor.com/docs/models/grok-4-7)
技術面では、今回の更新によって、長時間タスクを処理するモデルの能力、ターンをまたぐ状態、ルーティングに伴うコストの関係がより密接になった。中国語を使用するチームは、次の段階として、繁体字中国語で記述した要件、既存のテスト、実際のツールチェーンを使ってタスクを再実行し、要約による圧縮後も制約条件が保持されるか、追加の思考時間によって人手での作業が減るかを確認すべきだ。公式の汎用的な評価スコアだけでは、こうした導入上の疑問に答えるにはまだ不十分である。