TL;DR
主要ベンチマークの全項目で Fable 5.1 を上回り、料金は Opus 5 より 2 割安い。Anthropic の「フラッグシップの性能を、みんなが使える価格帯に降ろす」一手。
評価でのトークン消費は Opus 5 の約 3 分の 1。ツール呼び出しも約 4 割減。
与えられた境界を越えようとする頻度が Opus 5 や Mythos 5.1 より大幅減。
やったこと・分かったこと・必要なことを作業中に伝えてくる。長いタスクを任せやすい。
Pro / Max / Team の 5 時間枠が増え、好きな時に使える「利用制限リセット」が付いた。
What's new
Anthropic が公式に示した検証結果を、機能ごとに。
長時間の自律的なコーディングに最適化。あるテスト利用者は、エンジニアチームなら数週間かかる 68 万行のコード移行を 1 日以内に完了した。
Terminal-Bench 4.0 で 66.4%(Opus 5 は 52.3%)
低い effort 設定でも既知のバグの 72% を検出。Opus 5 は高い effort でも 56% だった。「速く回して多く見つける」が両立する。
特定タスクでツール呼び出しが約 40% 減、トークンは半分。Web ページの表示高速化タスクでは 40 件中 39 件で成功。
新しい出力スタイル「Claude っぽさのない、明快で会話的な英語」が同時登場。前置き・絵文字・締めの一言が消える。
密度の高いチャート、図、スクリーンショットの値をツールなしで読み取れる。旧モデル向けの画像処理の回避策が不要になるケースが多い。
Chartography 89.0%、OSWorld 2.0(PC操作)81.8%
最大 2.5 倍の速さで出力する Fast モードが Claude API で利用可能。料金は入力 $8 / 出力 $40 と通常の 2 倍。
Benchmarks
Opus 5 → Fable 5.1 → Opus 5.5 の順。Opus 5.5 は全項目で Fable 5.1 を上回った。
Pricing
| 項目 | Opus 5 | Opus 5.5 |
|---|---|---|
| 入力 | $5.00 | $4.00-20% |
| 出力 | $25.00 | $20.00-20% |
| キャッシュ読み込み | $0.50 | $0.20-60% |
| キャッシュ書き込み(5分) | $6.25 | $5.00-20% |
| バッチ処理(入力 / 出力) | — | $2.00 / $10.00 |
| Fast モード(入力 / 出力) | — | $8.00 / $40.00 |
本体価格は 2 割引きだが、効くのはここ。同じ前提を何度も読み直すエージェント用途では、キャッシュ読み込みが請求の大半を占める。長い会話を回すほど「典型的な処理コスト 4 割減」が現実になる。
プロンプトキャッシュは最小 512 トークンから。バッチ処理は常に半額。
For subscribers
For developers
Opus 5 から移行するとき、コードが壊れる変更が 4 つある。先に確認を。
thinking.type: disabled は 400 エラー。深さは effort で調整する。tool_choice の any / tool はエラー。auto + strict tool use か structured outputs へ。computer_20251124 ツールは不可(Claude API と Google Cloud)。computer_toolset_20260801 へ移行。high から medium に。max_tokens に余裕を。thinking ブロックで返る。進捗を画面に出すアプリは display 設定が必要。reasoning_extraction で拒否されることがある。speed: "fast"、Claude API のみ)。Safety
与えられた制約を回避しようとする頻度が Opus 5 や Mythos 5.1 より約 85% 減。取り消しにくい行動を取りにくい。
約 2,000 シナリオの自動行動監査で、Anthropic が試したモデルの中で最良。外部評価者(Frontier Design、METR)の事前テストも実施。
全設定で Opus 5 と同等以上。Gray Swan ベンチマークでは Fable 5.1 と並んで最も低い攻撃成功率。
サイバーセキュリティ関連の多くは Opus 4.8 へルーティング。生物学分野は Fable 5.1 と同等の保護。EU AI 法対応の透かしも。
Timeline