<style> .xe-hero{padding:clamp(25px,5vw,46px);border-radius:23px;color:#fff;background:linear-gradient(130deg,#102536,#154e69 65%,#2e97aa)}.xe-hero h2{color:#fff;margin:.35em 0}.xe-eyebrow{color:#a4ebf2;font-weight:800;letter-spacing:.13em;font-size:.78rem}.xe-cards{display:grid;grid-template-columns:repeat(3,minmax(0,1fr));gap:12px;margin:22px 0}.xe-card{padding:18px;border:1px solid #b9dce3;background:#edf9fb;border-radius:15px}.xe-card strong{display:block;color:#155e72;font-size:1.35rem}.xe-chart{padding:18px;border:1px solid #c5d9de;border-radius:15px;margin:20px 0}.xe-row{display:grid;grid-template-columns:minmax(95px,1fr) minmax(0,3fr);gap:12px;align-items:center;margin:12px 0}.xe-bars{display:grid;gap:5px}.xe-bar{display:flex;align-items:center;min-height:26px;padding:2px 9px;border-radius:5px;color:#fff;font-size:.82rem;font-weight:700}.xe-bar.amd{background:#57798a}.xe-bar.arm{background:#368e98}.xe-note{padding:17px 19px;margin:20px 0;border-left:5px solid #d39239;border-radius:10px;background:#fff7e9}.xe-flow{display:grid;grid-template-columns:repeat(3,minmax(0,1fr));gap:10px;margin:18px 0}.xe-flow div{padding:15px;border-radius:11px;background:#e7f4f6}.xe-flow b{display:block;color:#126173}.xe-table{overflow:auto;margin:18px 0}.xe-table table{border-collapse:collapse;width:100%;min-width:610px}.xe-table th,.xe-table td{padding:10px;border:1px solid #c4d9de;text-align:left}.xe-table th{background:#e8f4f6}@media(max-width:720px){.xe-cards,.xe-flow{grid-template-columns:1fr}.xe-row{grid-template-columns:1fr;gap:4px}} </style>

CHIPS / AGENT INFRASTRUCTURE

AIの「回答速度」ではなく、仕事の「完了数」を測る

IntelがXeon 6のエージェント処理能力を比較した。注目すべきは倍率だけでなく、推論を取り除いた再生型テストが何を測り、何を測っていないかだ。

3行で要約

  • Intelは2026年10月6日、Xeon 6搭載インスタンスのエージェント処理ベンチマークを公開した。測定自体は同年9月に実施したものだ。[1]
  • 同社測定では、60分間に完了したタスク数が第5世代AMD EPYC搭載機比で1.58~1.66倍、Arm v9.2A搭載機比で4.24~4.57倍だった。[1]
  • ただし、記録済みのエージェント動作を再生し、モデル推論も外部ネットワークも使わないテスト。生成AI全体の速度や導入効果を示す数値ではない。[1]

背景:エージェントではCPUも忙しい

AIエージェントはモデルに質問するだけでなく、ツールを呼び、ファイルを読み書きし、検証環境を起動する。こうした処理はCPU、メモリー、ストレージ、コンテナー管理にも負荷をかける。Intelが今回焦点を当てたのは、モデルの回答品質ではなく、同時に動く作業環境が単位時間でいくつのタスクを終えられるかというシステムの処理量だ。[1]

何が新しいのか

IntelはTerminal-BenchとHarborを用いた再生型の測定結果を公開した。医療、金融、製造の3組の作業例を同じ条件で実行し、Xeon 6、AMD EPYC、Armの各クラウドインスタンスを比較している。Terminal-Bench本体はエージェントの作業能力を測るベンチマークだが、今回のIntel測定は記録した軌跡を再生するCPU基盤向けの派生的な使い方で、通常のモデル・エージェント能力評価とは目的が異なる。[1][2]

24並列隔離された作業環境を同時実行
60分完了タスク数で処理量を比較
推論なし記録済みの動作をローカルで再生

数字の読み方:倍率はIntelによる主張

次の値はIntelが公表したXeon 6搭載機の完了タスク数 ÷ 比較機の完了タスク数。各分野でタスク構成が異なるため、分野間の倍率をそのまま比較して優劣を決めるべきではない。独立機関による追試結果ではない。[1]

Intel公表の相対スループット(60分の完了タスク数)
作業例AMD EPYC比Arm比
医療1.66倍4.50倍
金融1.64倍4.57倍
製造1.58倍4.24倍

技術的なポイント:同じ軌跡を繰り返す

1. 記録Claudeを使った作業の実行軌跡を記録
2. 再生ローカルの代理サーバーが同じ軌跡を返す
3. 集計24並列・60分で完了したタスク数を計測

Intelの記載では、3構成とも48 vCPU、185GBメモリー、Ubuntu 26.04で、Harbor 0.16.1とterminus-2を使用。作業用イメージは事前配置され、各タスクを物理コアに固定した。モデル推論とネットワークを外すことで、生成結果の揺らぎを減らして実行基盤の差を見やすくする設計だ。[1]

開発者・企業への影響と試し方

複数のコーディングエージェントや社内ワークフローを並列運用する場合、LLMの応答時間だけを測っても、サンドボックス起動やツール実行の詰まりは見えない。今回の発表は、完了タスク数を基盤評価に含めるという測定設計の参考になる。一方、調達判断には自社の価格・負荷・セキュリティ条件での測定が必要だ。

  1. 実運用に近いタスクを選び、成功判定・入力データ・並列数を固定する。
  2. 完了タスク数に加え、失敗率、p95完了時間、CPU/メモリー/I/O、1成功タスク当たりの費用を記録する。
  3. LLMを含む本番に近い試験と、推論を固定した基盤試験を分けて実施する。
  4. インスタンスの構成、リージョン、ストレージ、ソフトウェア版を揃え、複数回再測定する。

リスクと限界、今後見るべき点

再生型テストは再現性に優れる反面、ライブのモデル呼び出し、ネットワーク遅延、予期しない分岐を含まない。ベンダー自身がタスクを選び測定しており、比較構成の違いやタスク構成が結果に影響し得る。公開記事には相対倍率と実行条件はあるが、ここから自社ワークロードの絶対処理量を推定してはいけない。[1]

今後は、再現可能な手順・生データ・独立追試に加え、ライブのLLMを含む実ワークフローでの費用対効果を確認したい。特に同じ予算で何件の成功した仕事を終えられるかが、採用判断の核心になる。

最終確認日:2026年10月7日(日本時間)

参照元

  1. Intel「Boosting Agentic AI Throughput with Intel Xeon CPUs」 — 比較結果、構成、測定方法、免責事項。
  2. Terminal-Bench公式リポジトリ — ベンチマークの目的と通常の実行方法。

Previous Post Next Post