返回首頁

模型與開發平台

Claude Opus 5 以可調推理強度換取成本,雲端版本支援百萬 token 輸入

Anthropic 推出 Claude Opus 5,讓開發者以 effort 設定在推理品質、token 用量與延遲之間取捨。Google Cloud 與 AWS 已提供託管版本,但「接近 Fable 5、成本減半」仍主要建立在供應商測試與每任務成本估算上。

Bernou, Claude (b. 16..–d. 17..), Abbot · Public domain · Image source
zh-Hant

Anthropic 發布 Claude Opus 5,定位在最高階 Fable 5 與日常使用成本之間,並維持前代 Opus 4.8 的 API 價格。其核心產品變化不是單純提高固定榜分,而是讓呼叫端透過 effort 設定調節模型投入的推理量;同一模型可在較低強度節省 token 與延遲,或在 high、xhigh、max 模式換取更高的程式工程及知識工作表現。這使模型路由器不必只依任務切換不同模型,也能在單一模型內依預算分級。

Anthropic 稱 Opus 5 在 Frontier-Bench v0.1 的軟體工程任務上,成績超過其他受測模型,並以較低的單題成本取得超過 Opus 4.8 兩倍的表現;在 CursorBench 3.2 的 max effort 設定下,與 Fable 5 峰值相差不到 0.5%,但每題成本約為一半。這些數字描述的是特定代理框架、強度及成本模型的組合,不能直接推導到每個程式庫或企業工作流。

部署面已不只限於 Anthropic 自家 API。Google Cloud 文件列出的 `claude-opus-5` 已達正式可用,接受文字、圖片與 PDF,輸入上限為 100 萬 token、輸出上限 12.8 萬 token,並支援函式呼叫、電腦操作、網路搜尋、提示快取與記憶工具。AWS 也在 Bedrock 與 Claude Platform on AWS 提供模型,並宣稱可用零資料保留模式。對處理大型程式庫或長文件的團隊而言,真正需要量測的是有效上下文利用率,而非只看標稱窗口。

工程師接下來應比較各 effort 層級的成功率、重試次數、總 token、尾端延遲與工具呼叫錯誤,並確認不同雲端的地區、配額及資料保留設定。官方基準未完整揭露所有競品配置,百萬 token 也不保證模型能同等準確地檢索每個位置;在建立自動化長程代理前,仍需以自身任務做回歸測試與人工抽查。

來源

  1. Introducing Claude Opus 5
  2. Claude Opus 5 on Google Cloud
  3. Claude Opus 5 now available on AWS