<style>
.co-hero{padding:clamp(22px,5vw,46px);border-radius:24px;background:linear-gradient(130deg,#1c1917,#7c2d12 58%,#4f46e5);color:#fff}.co-grid{display:grid;grid-template-columns:repeat(3,minmax(0,1fr));gap:12px;margin:22px 0}.co-card{padding:17px;border:1px solid #fed7aa;border-radius:16px;background:#fff}.co-card strong{display:block;font-size:1.7rem;color:#c2410c}.co-table{overflow-x:auto}.co-table table{min-width:650px;width:100%;border-collapse:collapse}.co-table th,.co-table td{padding:12px;border:1px solid #d6d3d1;text-align:left}.co-table th{background:#ffedd5}.co-bar{display:grid;grid-template-columns:8rem 1fr 4rem;gap:12px;align-items:center;margin:10px 0}.co-meter{height:17px;background:#e7e5e4;border-radius:30px;overflow:hidden}.co-meter i{display:block;height:100%;background:linear-gradient(90deg,#f97316,#6366f1)}.co-note{padding:18px;background:#fffbeb;border-left:5px solid #f59e0b;border-radius:12px;margin:20px 0}@media(max-width:680px){.co-grid,.co-bar{grid-template-columns:1fr}}
</style>
MODEL RELEASE / 2026年9月22日
Opus 5.5は「1トークンの価格」と「1仕事の費用」を分けて評価する
Anthropicの最新Opus。公開ベンチマーク、価格表、実務の制約を並べ、どの業務で試すべきかを整理します。
$4入力100万トークン
$20出力100万トークン
約40%減Opus 5比のタスク費用(Anthropic試算)
3行要約
- Anthropicは9月22日、Claude Opus 5.5を発表し、Claude Platformや主要クラウドで提供を開始しました。
- 公開API価格はOpus 5より入力・出力とも20%低く、少ないトークン消費を含めた典型的な仕事単位の費用は同社試算で約40%低下します。
- コーディングと知識労働の評価は改善しましたが、比較条件の違いがあるため、自社タスクで品質・時間・費用を測る必要があります。
背景と何が新しいのか
高性能モデルの選定では、回答の正しさだけでなく、何回のツール実行や再試行が必要かが運用費を左右します。Opus 5.5は、Anthropicの発表によるとOpus 5よりトークン単価が低く、同じ仕事の完了までに使うトークンも減っています。
発表日は2026年9月22日です。この記事の数値は提供元の公開評価に基づき、独立した自社実測値ではありません。
API価格:単価だけでは40%減にならない
| 100万トークン当たり | Opus 5.5 | Opus 5 | 差 |
| 入力 | $4 | $5 | 20%低い |
| 出力 | $20 | $25 | 20%低い |
| Cache read | $0.20 | $0.50 | 60%低い |
| Cache write | $5 | $6.25 | 20%低い |
Anthropicの「典型的なタスク費用が約40%低い」という主張は、価格表の20%引きに加えて、タスク当たりのトークン消費減を含むものです。入力が長いRAG、出力が長いコード生成、Cache利用率の高いAgentでは削減幅が変わります。
Fast modeは最大2.5倍の速度を訴求しますが、入力$8・出力$40と通常モードの2倍の単価です。応答時間が重要な業務でのみ、総費用を測って選びます。
公開評価を読む
| 評価 | Opus 5.5 | Opus 5 | 測るもの |
| Terminal-Bench 4.0 | 66.4% | 52.3% | CLI上の複数段階タスク |
| FrontierCode v1.1 Main | 54.4% | 48.0% | コード変更の採用可能性 |
| GDPval-AA v2.1 | 1846 Elo | 1708 Elo | 44職種の知識労働 |
| AutomationBench | 40.0% | 26.9% | 複数アプリの業務フロー |
AutomationBenchはZapierが実行・報告し、Anthropicの早期アクセス結果と公開リーダーボードの数値が併記されています。Terminal-Benchの他社モデルとの数値も実行者やeffort設定が異なります。順位をそのまま企業の実務性能と同一視できません。
開発・保守・運用での試し方
- 実際に完了したIssue、コード移行、障害調査、レポート作成から各10件ほど選びます。
- 正解条件を「テスト成功」「レビュー指摘数」「引用の正確さ」などで定義します。
- 同じツール権限、同じ入力、同じ停止条件でOpus 5.5と現行モデルを比較します。
- 成功率、作業時間、入力・出力・Cacheトークン、担当者の手直し時間を記録します。
- 利益が出た作業だけルーティングを切り替え、定期的に再評価します。
企業への影響と制約
Opus 5.5はClaude Platformのclaude-opus-5-5として利用でき、AnthropicはAWS、Google Cloud、Azureでの提供も案内しています。企業は既存のクラウド契約、データ保存条件、ログ設定と組み合わせて評価できます。
Anthropicは高度なサイバー・生物分野の用途に追加の保護を適用し、一部処理が別モデルへ切り替わると説明しています。API連携では「指定モデルが常に全工程を実行する」と決めつけず、対象業務での実動作を確認します。
ベンチマークは導入判断の入口です。 Anthropic自身も、高性能モデル間のスコア差は実務での差を必ずしも表さないと記しています。特に高リスクな変更や外部送信は、レビューと承認を残します。
今後注目すべき点
独立ベンチマークの再測定、各クラウドでの地域・価格差、Sonnet 5.5とHaiku 5.5の公開、自社AgentにおけるCache hit率とタスク完了単価を追います。
最終確認日:2026年9月23日
参照元