AI Tech News
By D.L.

4月のスプリント、5月の一呼吸:最新のAIモデルリリースがインフラ予算に意味するもの

4月のスプリント、5月の一呼吸:最新のAIモデルリリースがインフラ予算に意味するもの

あなたの計画仮説を破壊したリリースサイクル

あなたのインフラチームが3月にAI予算を確定したのであれば、あなたはすでに時代遅れの仮説の中で生きています。4月のリリースサイクルは、コスト対性能比を根本的に変えるモデルの嵐をもたらしました。そして5月のリリースは、それを先立つベロシティよりも重要である一呼吸をもたらしました。

実際に何が起きたかというと:2月下旬から5月28日の間に、主要なラボはGPT-5.4(3月5日)、Gemini 3.1 ProおよびFlash-Lite(2月と3月)、Claude Sonnet 4.6およびOpus 4.6(2月)、そして最も重要なGPT-5.5(4月23日)およびClaude Opus 4.8(5月28日)をリリースしました。これは「リリースに追いつく」ことではありません。これは1四半期で3つの別々の能力の飛躍です。

インフラ計画にとってこれが重要な理由は、現在のデプロイメントのビジネスケースが正にその時に反転した可能性があるからです。

コスト構造の罠:調達会議がなぜ予想外の事態に直面するのか

2025年にAIインフラを承認した多くの組織は、1つの仮説に基づいて行いました:モデル価格はほぼ一定に保つ一方、ハードウェアがテコになるという仮説です。その仮説はあなたの予算調整で問題を引き起こそうとしています。

Gemini 3.1 Proは現在、100万入力トークンあたり2ドル、出力12ドルで最安の旗艦モデルです。これはGPT-5.5(5ドル/30ドル)およびClaude Opus 4.8(5ドル/25ドル)の約2.5倍安いです。しかし、ここに価格表が隠している運用の現実があります。実際の支出はこれらの数字に1対1では動きません。

ほとんどのチームは、AI支出が予想の2〜3倍であることを発見します。なぜなら、トークン価格は全体像を考慮していないからです。プロンプトキャッシングは、Bedrockを経由するサポート対象のClaudeモデルでキャッシュされた入力トークンの約90%割引を提供します。つまり、あるモデルから別のモデルに切り替えると、お金を節約できます—ただし、エンジニアリングチームがすでにキャッシング層を構築していた場合に限ります。構築していない場合、90%割引をテーブルに残しています。

もう1つの罠:バッチAPI価格設定は非リアルタイムワークロードで一律50%割引ですが、ワークロードが遅延非感応で、オンデマンドで実行されている場合、2倍のプレミアムを支払っています。ドキュメント処理、評価実行、バッチ分類は半分の価格で実行されるべきです。DevOpsチームが遅延要件別にワークロードを分割していない場合、それは実際の支出のもう1つの2倍の乗数です。

ハードウェアの現実チェック

モデルを切り替えてトークンコストを節約する前に、あなたが何を持っているかを理解してください。ガートナーは、世界のAI支出が2026年に2.59兆ドル(約39兆円)に達すると予想しており、これは2025年比で47%の増加です。その45%以上がインフラに直接流れます。これはモデルではなく、コンピュートです。

GPU価格だけが支配的なコスト要因ではなく、インフラボトルネック、統合の複雑性、および不十分な容量計画がほとんどのエンタープライズAIコスト超過の原因となります。オンプレミスGPUにCAPEXをコミットした場合、どのモデルを実行することを選択するかに関わらず、そのハードウェアスタックにロックインされています。

ここで5月の一呼吸が戦略的に重要になります。4月のベロシティの後、ラボは静寂に入りました。これは偶然ではありません—これはシグナルです。競合するラボがリリース頻度を遅くするのは、アイデアが枯渇したからではありません。次の能力の飛躍が顧客が即座に吸収できないインフラ変更を必要とするときに遅くなります。

ファイナンスが気付く総所有コスト問題

エンタープライズAIインフラの真の総所有コストは、組織が初期デプロイメントを承認したときに予算化した金額の2〜3倍であることが日常的です。4月のリリースは、それ以前は注意を払っていなかったCFOにその差を見えるようにしたばかりです。

調整に表示される内訳は以下の通りです:

コストレイヤー 初期仮説(予算の%) 実際の支出(予算の%) より高い理由
モデルトークン(推論) 30% 15% より優れたモデル=再試行の削減。ただし実装された場合のみ
GPU/コンピュートインフラ 40% 35% 以前のハードウェアコミットメントにロックイン
ストレージとデータエグレス 10% 20% 高速データアクセス用の高パフォーマンスNVMe、ネットワークエグレス料金
キャッシング、ルーティング、可観測性 5% 15% リクエストルーティング、監視、APIゲートウェイレイヤー
統合と再トレーニング 15% 15% 継続的なモデルライフサイクル管理

1月でプロジェクトを正当化した数学は、トークンコストが低下し、ハードウェア使用率が着実に向上することを前提としていました。4月のリリースはトークンコストの低下をもたらしました(Gemini 3.1 Proは本当に安いです)が、ハードウェア使用率は依然としてあなたのチームが割り当てていない可能性があるエンジニアリングの努力を必要とします。

何が変わった、そしてまだ変わっていないもの

GPT-5.5は最も多用途のオムニモーダル汎用モデルで、最高のエージェンティックCLIスコアを持っています。Claude Opus 4.8はLMArenaの人間の優先度ランキングで第1位にランクされ、最も困難なコーディングベンチマークをリードしています。Gemini 3.1 Proは最も安く、最も統合されています。その差別化はユースケースマッチングにとって重要ですが、インフラフットプリントを根本的に変えません。

実際の変化はより狭いです:2026年春のトレンドは「答える AI」から「物事をこなす AI」への転換です。つまり、プロンプト、オーケストレーション層、可観測性ツール、検証ロジックはすべてリワークが必要です。これはモデルの交換ではありません。これは完全なアプリケーション・ライフサイクルの更新です。

5月の一呼吸が存在するのは、ラボが組織がその転換を吸収するのを待っているからです。6月の別の能力の飛躍は、エンタープライズセグメント全体の採用クロックを破壊したでしょう。代わりに、見える傾向は統合です。組織は4月のリリースを取り、その上にエージェンティック層を構築しており、毎週モデルを交換していません。

インフラチーム向け:夏前に行う必要がある3つの決定

最初:ワークロード分割の監査を実施します。 30日間の分析を実行して、どのリクエストが遅延非感応で、どれがバッチできるかを特定します。現在、それらを分離していない場合は、バッチワークロードを今日のバッチAPI経由で再ルーティングします。これはハードウェアコストがゼロのコード変更です。典型的なボリュームでは、そのセグメントのトークン支出の50%を節約できます。

次に:キャッシング層を検証します。 ほとんどのチームはリクエスト重複排除またはプロンプトキャッシュインフラを構築する前にAPI呼び出しを実装しました。システムが異なるリクエストを通じて同じプロンプトを実行している場合、テーブルにお金を残しています。キャッシング層の構築のROIは、典型的には入力トークンコストの40〜60%節約のための6〜12週間のエンジニアリング努力です。あなたのボリュームの数学を実行します。

3番目:モデル切り替えのコストに対するハードウェアコミットメントをストレステストします。 2026年Q4またはQ1 2027までGPUを契約しています。その間、同じリソースでGemini 3.1 Proを実行でき、GPT-5.5の機能よりも低コストです。チームがそのシナリオをモデル化していない場合、限界的な機能向上のために月に数千ドル過剰支出している可能性があります。

4月のスプリントは本当でした。5月の一呼吸も本当です。どちらもあなたの基本的なインフラ決定を変えません—しかし両方は、あなたの元の予算モデルが不完全であったことを示しています。キャッシングを修正し、ワークロードルーティングを修正してから、実際にどのモデルがあなたのスタックの財政的意味を持つかを知るでしょう。

編集部の観測データ

AIインテリジェンス指数(主要3モデル)

01632476305-1706-0106-0807-0607-1307-2007-2708-0308-10Claude Opus 4.7 (Adaptive Reasoning, Max Effort) — Anthropic: 57 (2026-05-17)Claude Opus 4.8 (Adaptive Reasoning, Max Effort) — Anthropic: 61 (2026-06-01)Claude Opus 4.8 (Adaptive Reasoning, Max Effort) — Anthropic: 61 (2026-06-08)Claude Opus 4.8 (Adaptive Reasoning, Max Effort) — Anthropic: 56 (2026-07-06)Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) — Anthropic: 60 (2026-07-13)Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) — Anthropic: 59.9 (2026-07-20)Claude Opus 5 (Adaptive Reasoning, Max Effort) — Anthropic: 61 (2026-07-27)Claude Opus 5 (Adaptive Reasoning, Max Effort) — Anthropic: 61 (2026-08-03)Claude Opus 5 (Adaptive Reasoning, Max Effort) — Anthropic: 63 (2026-08-10)63GPT-5.5 (xhigh) — OpenAI: 60 (2026-05-17)GPT-5.5 (xhigh) — OpenAI: 60 (2026-06-01)GPT-5.5 (xhigh) — OpenAI: 60 (2026-06-08)GPT-5.5 (xhigh) — OpenAI: 55 (2026-07-06)GPT-5.6 Sol (max) — OpenAI: 59 (2026-07-13)GPT-5.6 Sol (max) — OpenAI: 58.9 (2026-07-20)GPT-5.6 Sol (max) — OpenAI: 59 (2026-07-27)GPT-5.6 Sol (max) — OpenAI: 59 (2026-08-03)GPT-5.6 Sol (max) — OpenAI: 61 (2026-08-10)61Gemini 3.1 Pro Preview — Google DeepMind: 57 (2026-05-17)Gemini 3.1 Pro Preview — Google DeepMind: 57 (2026-06-01)Gemini 3.1 Pro Preview — Google DeepMind: 57 (2026-06-08)Gemini 3.1 Pro Preview — Google DeepMind: 46 (2026-07-06)Gemini 3.5 Flash (high) — Google DeepMind: 55 (2026-07-13)Gemini 3.1 Pro Preview — Google DeepMind: 46 (2026-07-20)Gemini 3.6 Flash (high) — Google DeepMind: 50 (2026-07-27)Gemini 3.6 Flash (high) — Google DeepMind: 50 (2026-08-03)Gemini 3.6 Flash (high) — Google DeepMind: 52 (2026-08-10)52
  • Anthropic
  • OpenAI
  • Google DeepMind

Intelligence Index — Trend

各点にホバーすると、その時点のモデル名(バージョン)が表示されます。

最終更新: 2026-08-10 · 9 データ点 · artificialanalysis.ai

編集部が一次ソースから毎週収集しています。

データセット全体を見る