<style> .hk-hero{padding:clamp(25px,5vw,46px);border-radius:22px;color:#fff;background:linear-gradient(125deg,#2e2d48,#63506f 58%,#b27680)}.hk-hero h2{color:#fff;margin:.35em 0}.hk-kicker{font-size:.79rem;font-weight:800;letter-spacing:.13em;color:#f4cfda}.hk-grid{display:grid;grid-template-columns:repeat(3,minmax(0,1fr));gap:12px;margin:20px 0}.hk-card{padding:18px;border:1px solid #e5d5de;border-radius:13px;background:#fcf5f8}.hk-card strong{display:block;color:#704866;font-size:1.2rem}.hk-table{overflow-x:auto;margin:20px 0}.hk-table table{width:100%;min-width:570px;border-collapse:collapse}.hk-table th,.hk-table td{padding:11px;border:1px solid #e1d2dc;text-align:left;vertical-align:top}.hk-table th{background:#f5eaf1}.hk-flow{display:grid;grid-template-columns:repeat(4,minmax(0,1fr));gap:10px;margin:20px 0}.hk-step{padding:15px;border-radius:10px;border-top:4px solid #b77791;background:#faf0f5}.hk-step b{display:block;color:#7b4868}.hk-note{padding:17px 19px;margin:20px 0;border-left:5px solid #c29346;border-radius:9px;background:#fff8e9}@media(max-width:760px){.hk-grid,.hk-flow{grid-template-columns:1fr}} </style>

AI MODELS / COST ENGINEERING

「小型だから安い」を、条件付きで考える

短文の大量処理と長文入力では単価が違う。Haiku 5.5の実力は、自社の品質・遅延・費用で確かめたい。

3行で要約

  • Anthropicは2026年10月7日、大量・低遅延の処理を狙うClaude Haiku 5.5を発表した。分類、要約、検索補助やサブエージェントを主な用途に挙げる。[1][2]
  • Claude Platformの公表単価は、入力長10万トークン以下なら100万トークン当たり入力$0.10・出力$0.50、10万超では入力$0.50・出力$2.50。長い文脈を使う設計では費用を別に見積もる。[2]
  • Anthropicのベンチマークでは前世代からの改善が示されるが、提供元の評価値である。実運用では正確さ、p95遅延、1件当たり費用、失敗時の再試行を同じデータで比べたい。

背景:モデルを一つに固定しない設計

エージェントでは、主担当のモデルが複雑な判断をし、補助モデルが文書検索や分類など反復的な仕事を受け持つ構成がある。Haiku 5.5はそのような高頻度・コスト重視の処理を意識しているとAnthropicは説明する。今回の発表は、直近の当サイトで扱ったGoogleの業務用エージェントの統治設計とは異なり、個々の処理に割り当てるモデルの選定とコストに焦点を当てる。[1][2]

発表は10月7日付。本記事の掲載日は日本時間10月9日で、発表日を記事公開日と混同しない。

何が新しいのか

AnthropicはHaiku 5.5を同社の小型モデルで最も高速かつ高性能と位置付け、Haiku系で初めて推論のeffort設定(処理にかける計算量の調整)を備えたと説明する。APIモデル名はclaude-haiku-5-5。Claude Platformのほか、Claude.aiやClaude Code、複数のクラウド環境で提供されるとしている。実際の利用可否と料金は契約先・地域・提供経路ごとに確認したい。[1][2]

速度対話や大量の短いタスクに適するという提供元の位置付け
入力長10万トークンを超えると公表単価が切り替わる
品質業務ごとの正答率と失敗時の影響を実測する

技術的なポイント:単価は入力長で変わる

Claude PlatformのHaiku 5.5公表単価(米ドル、2026年10月9日確認)
入力長入力100万トークン出力100万トークン
10万トークン以下$0.10$0.50
10万トークン超$0.50$2.50

トークンはモデルが読む文字列などの単位で、日本語の文字数と一対一ではない。上の表は入力長による単価区分であり、1件の総額ではない。実額は入出力のトークン数、キャッシュ、バッチ処理などで変わる。Anthropicは前世代より平均で約75%安いと説明するが、これは同社の算定条件による主張で、すべてのリクエストに当てはまる割引率ではない。[1][2]

たとえば入力2万・出力2千トークンの短い処理を、表の基本単価だけで概算すると、$0.003/件(入力$0.002+出力$0.001)となる。一方で長文側の単価を使う入力12万・出力2千トークンなら$0.065/件(入力$0.060+出力$0.005)だ。これは編集部の単純計算例であり、実際の請求や他の費用を保証しない。キャッシュ・バッチ適用時は再計算する必要がある。

公式評価値をどう読むか

Anthropic公表のOSWorld 2.1オフライン部分集合では、Haiku 5.5が72.4%、Haiku 4.5が15.7%とされる。Terminal-Bench 4.0ではHaiku 5.5が39.2%、Sonnet 5.5が70.6%。評価対象、設定、実行環境が違えば数字は変わり得るし、OSWorldは実際の社内アプリ操作の成功率ではない。複雑なエージェント開発まで小型モデルだけで置き換えられると判断しない。[1]

実践例:分類・要約のルーティングを試す

1. 業務を分ける定型分類・短い要約と複雑な判断を区別
2. 基準を作る実データを匿名化し、正解例と失敗条件を用意
3. 同条件で測る品質、p95遅延、入出力トークンを記録
4. 段階導入低リスク処理から切替え、人への差し戻しを残す

まず100~200件程度の実際の問い合わせを匿名化し、分類ラベルと人手による正解を用意する。Haiku 5.5と既存モデルに同じプロンプトとデータを送り、誤分類率、未回答率、p95遅延(遅い側5%の境目)、再試行を含む1件当たり費用を比較する。閾値を下回るものは上位モデルまたは人に回す。これは編集上の導入例であり、特定の性能を保証するものではない。

リスクと限界、今後の注目点

小型モデルは短い定型作業に向く場合があっても、複雑なコーディングや長い推論では上位モデルが必要になり得る。長文を投げるだけで入力長の料金区分が変わり、出力や再試行でも費用が増える。モデル更新時にはトークン化や応答傾向が変わるため、同じ評価セットを継続的に走らせたい。

今後は長文入力の利用比率、effort設定ごとの品質と費用、キャッシュ・バッチ適用時の請求額、他社モデルとの独立した比較を追う。公開ベンチマークは候補を絞る材料にとどめ、本番採用は自社データで判断する。

最終確認日:2026年10月9日(日本時間)

参照元

  1. Anthropic公式:Introducing Claude Haiku 5.5 — 発表日、用途、effort設定、ベンチマークと価格説明。
  2. Anthropic公式:Claude Haiku製品ページ — APIモデル名、提供経路、入力長別のClaude Platform単価。

Previous Post Next Post