模型與開發平台
Claude Opus 5、調整可能な推論強度でコストと性能を両立、クラウド版は100万tokenの入力に対応
AnthropicはClaude Opus 5を発表し、開発者がeffort設定によって推論品質、token使用量、レイテンシーのバランスを調整できるようにした。Google CloudとAWSではすでにマネージド版が提供されているが、「Fable 5に迫る性能を半分のコストで実現」という主張は、現時点では主にベンダーによるテストとタスク単位のコスト試算に基づいている。

AnthropicはClaude Opus 5を発表した。最上位のFable 5と日常的に利用できるコスト水準の中間に位置付けられ、前世代のOpus 4.8と同じAPI価格を維持している。製品上の中核的な変更は、固定されたベンチマークスコアを単純に引き上げたことではなく、呼び出し側がeffort設定を通じてモデルの推論量を調整できるようにした点だ。同一モデルで、低い強度を選んでtoken消費量とレイテンシーを抑えたり、high、xhigh、maxモードを選んでソフトウェアエンジニアリングや知識労働における性能を高めたりできる。これにより、モデルルーターはタスクごとに異なるモデルを切り替えるだけでなく、単一モデル内でも予算に応じた階層化が可能になる。
Anthropicによると、Opus 5はFrontier-Bench v0.1のソフトウェアエンジニアリングタスクで、テスト対象となった他のモデルを上回った。また、1問当たりのコストを抑えながら、Opus 4.8の2倍を超える性能を達成したという。CursorBench 3.2では、max effort設定時のピーク性能がFable 5との差0.5%未満であり、1問当たりのコストは約半分とされる。ただし、これらの数値は特定のエージェントフレームワーク、推論強度、コストモデルを組み合わせた結果であり、あらゆるコードベースや企業ワークフローに直接当てはめることはできない。
デプロイ先は、すでにAnthropic独自のAPIだけに限られていない。Google Cloudのドキュメントに掲載されている`claude-opus-5`は一般提供(GA)されており、テキスト、画像、PDFを受け付ける。入力上限は100万token、出力上限は12万8,000 tokenで、function calling、computer use、web search、prompt caching、memory toolにも対応する。AWSもAmazon BedrockとClaude Platform on AWSで同モデルを提供し、zero data retentionモードを利用できるとしている。大規模なコードベースや長文ドキュメントを扱うチームが実際に測定すべきなのは、公称のcontext windowだけではなく、コンテキストをどれだけ有効に活用できるかという点だ。
エンジニアは今後、各effortレベルについて、成功率、再試行回数、総token数、tail latency、tool callingのエラーを比較し、クラウドごとのリージョン、quota、データ保持設定も確認する必要がある。公式ベンチマークでは競合モデルのすべての設定が完全には開示されておらず、100万tokenの入力に対応していても、モデルがコンテキスト内のあらゆる位置から同じ精度で情報を検索できるとは限らない。自動化された長期実行エージェントを構築する前に、自社のタスクを使った回帰テストと人手による抜き取り確認が依然として必要だ。