AI Tech News
By K.T.

2026年7月のリリースの崖:なぜ今、モデルの多様性が生の性能を上回るのか

2026年7月のリリースの崖:なぜ今、モデルの多様性が生の性能を上回るのか

2026年7月のリリースの崖:なぜ今、モデルの多様性が生の性能を上回るのか

これは1つのモデルが勝つという話ではありません。xAIのGrok 4.5は2026年7月8日にリリースされましたが、本当の話はそれより前に始まり、より深い意味を持っていました。AnthropicのClaude Sonnet 5は2026年6月30日に最新のトラッキング対象フロンティアモデルとして現れました。その月の実際のシグナルはそこに存在しており、ヘッドラインのベンチマークではなく、リリースパターンが明らかにするAI競争の変化の方にあります。

収束の崩壊

平均して、新しいAIモデルは3日ごとに登場します。この単純な頻度は、実際に重要なことを隠しています:フロンティアは単一のピークであることを止めています。2026年7月9日には3つのフロンティアラボが動きました。簡潔に言えば、AIは「最高のモデルが勝つ」から「最適なフィットが勝つ」へシフトしています。価格、速度、アクセス、そして日々の使用は、生のモデルスコアと同じくらい重要になりました。

純粋なベンチマークで3つの大型7月リリースを比較すると、勝者は得られません。xAIは2026年7月8日にGrok 4.5を公開リリースし、イーロン・マスクは「Opusクラスのモデルですが、より高速で、トークン効率が高く、低コストです」と説明しています。しかし、Artificial Analysisはそれをインテリジェンスインデックス54で全体の第4位にランクしており、Terminal-Bench 2.1(83.3%)ではフィールドと一致していますが、SWE-Bench Proでは64.7%で後れを取っています。これはパフォーマンスの勝利ではなく、価値のトレードオフです。

6月30日にリリースされたClaude Sonnet 5は、Anthropicの最もエージェント指向のSonnetであり、現在Claudeの無料プランとプロプランのデフォルトモデルです。エージェント指向のコーディングではSWE-Bench Proで63.2%を記録し、Sonnet 4.6の58.1%から上昇し、Opus 4.8の69.2%に急速に接近しています。この動きが重要なのは、導入期のAPIプライシングが2026年8月31日まで1トークンあたり100万個につき$2/$10(約30万円/150万円)で、その後$3/$15(約45万円/225万円)に上昇するためです。この価格の上限は、大規模チームの単位経済を変えます。

規制の抵抗

誰もが最初に言うわけではありません:アクセスゲートは全体的に厳しくなっています。6月2日の行政命令は、連邦政府にフロンティアモデルのリリース前安全審査を30日間与える任意の枠組みを設定しました。これは開発者が連邦評価者に早期プリリリースアクセスを提供し、悪意のある活動を報告し、厳格なセキュリティルールを満たす必要がある可能性があることを意味します。実際には、これはモデルのより強力なバージョンのアクセスが段階的にロールアウトされ、より厳しくなる可能性があります。

Anthropicは、米国政府が6月12日の輸出管理命令を解除した後、その旗艦モデルClaude Fable 5をクラス修正しました。このモデルは約3週間オフラインになっていました。これは脚注ではなく、カナリアです。ロードマップが中断のないモデル利用可能性を前提としている場合、砂の上に構築しています。

本当の分割:タスク適合性が才能を上回る

7月のリリースは4つの異なるユースケースクラスターを明らかにしており、1つのモデルが全部を所有していると思い込むことは、資本が浪費される場所です:

ユースケース モデル 主なトレードオフ 初期コスト
長文形式のコーディング&エージェント作業 Claude Sonnet 5 SWE-Bench Proで63.2%の推論能力 100万トークンあたり$2/$10(導入期)
高速反復&コスト制約 Gemini 3.5 Flash 複雑な推論では速度>精度 低いトークンあたりレート
コーディング効率&トークン経済 Grok 4.5(Cursorで訓練、100万トークンあたり$2/$6で価格設定、50万トークンのコンテキストウィンドウ) ベンチマーク第4位、低レイテンシ 100万トークンあたり$2/$6
マルチモーダルエージェント&大規模コンテキスト Muse Spark 1.1 エージェント作業、コンピュータ使用、100万トークンのコンテキストウィンドウに傾斜 $1.25 / $4.25

そのテーブルが言わないことに気づいてください:「Claude Sonnet 5が勝者です」。代わりに、勝者はルーティングレイヤー—どのクエリをどのモデルに送るか、そしていつエスカレーションするか並列化するかを知っているシステムだと言っています。

この瞬間が信号することと、それをどう読むか

少し視野を広げると、7月のリリースは明確なパターンを示しています。市場は階層に分裂しています。フロンティアモデルはより厳しくゲートされています。Claude Sonnet 5やGPT-5.6 Solのようなミッドティアモデルは、より低い価格でフラグシップレベルのパフォーマンスに近づいています。

このパターンは続くでしょう。その理由はこうです:計算がより安くなり、ベンチマーク距離が圧縮され、アクセスが厳しくなります。ベンチマークが1桁のパーセンテージポイントで分離されており、価格差が3~5倍の場合、運用上の選択は明らかです。本番ワークロードを実行するチームは、モノカルチャーではなく、ミックスでルーティングするでしょう。

新しいアクセスルールはAIがどのようにリリースされるかを変えています。フロンティアモデルの場合、発売へのパスはより厳しく、政府によってより綿密にレビューされる可能性があります。これは、冗長性を今ストレステストすべきことを意味しています—フラグシップモデルが3週間オフラインになったらどうなりますか?Anthropicはすでにあなたのためにその質問に答えました。

これがあなたのチームを意味すること

2026年7月にショッピングをしている場合、その動きは「最高のモデルを選ぶ」ではなく、「スタックを構築する」ことです。カスタマーサービス、営業、内部サポートのためにAIエージェントをデプロイする企業は、どの基盤モデルを使用しているかに関わらず、40~60%の自動化率を見ます。オーケストレーションレイヤー—モデルではなく—がROIを決定します。

2026年6月30日にすべてのClaudeプランのデフォルトモデルになったため、Claude Sonnet 5は、多くのタスク全体で右から使用できるものをテストしたい場合、最初にテストするための最も実用的なモデルです。日常的な推論、コーディング、ツール使用の安全な出発点です。しかし、速度と低コストのテストのためにGemini 3.5 Flashと組み合わせれば、大きな支出なしで幅広さが得られます。

2026年7月のリリースカレンダーは新しい王を生み出しませんでした。エコシステムを生み出しました。今の質問は「どのモデルか」ではなく、「それが問題になるほど迅速に正しいモデルにルーティングできるか」です。

編集部の観測データ

AIインテリジェンス指数(主要3モデル)

01632476305-1706-0106-0807-0607-1307-2007-2708-0308-1008-1708-24Claude Opus 4.7 (Adaptive Reasoning, Max Effort) — Anthropic: 57 (2026-05-17)Claude Opus 4.8 (Adaptive Reasoning, Max Effort) — Anthropic: 61 (2026-06-01)Claude Opus 4.8 (Adaptive Reasoning, Max Effort) — Anthropic: 61 (2026-06-08)Claude Opus 4.8 (Adaptive Reasoning, Max Effort) — Anthropic: 56 (2026-07-06)Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) — Anthropic: 60 (2026-07-13)Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) — Anthropic: 59.9 (2026-07-20)Claude Opus 5 (Adaptive Reasoning, Max Effort) — Anthropic: 61 (2026-07-27)Claude Opus 5 (Adaptive Reasoning, Max Effort) — Anthropic: 61 (2026-08-03)Claude Opus 5 (Adaptive Reasoning, Max Effort) — Anthropic: 63 (2026-08-10)Claude Opus 5 (Adaptive Reasoning, Max Effort) — Anthropic: 63 (2026-08-17)Claude Opus 5 (Adaptive Reasoning, Max Effort) — Anthropic: 63 (2026-08-24)63GPT-5.5 (xhigh) — OpenAI: 60 (2026-05-17)GPT-5.5 (xhigh) — OpenAI: 60 (2026-06-01)GPT-5.5 (xhigh) — OpenAI: 60 (2026-06-08)GPT-5.5 (xhigh) — OpenAI: 55 (2026-07-06)GPT-5.6 Sol (max) — OpenAI: 59 (2026-07-13)GPT-5.6 Sol (max) — OpenAI: 58.9 (2026-07-20)GPT-5.6 Sol (max) — OpenAI: 59 (2026-07-27)GPT-5.6 Sol (max) — OpenAI: 59 (2026-08-03)GPT-5.6 Sol (max) — OpenAI: 61 (2026-08-10)GPT-5.6 Sol (max) — OpenAI: 61 (2026-08-17)GPT-5.6 Sol (max) — OpenAI: 61 (2026-08-24)61Gemini 3.1 Pro Preview — Google DeepMind: 57 (2026-05-17)Gemini 3.1 Pro Preview — Google DeepMind: 57 (2026-06-01)Gemini 3.1 Pro Preview — Google DeepMind: 57 (2026-06-08)Gemini 3.1 Pro Preview — Google DeepMind: 46 (2026-07-06)Gemini 3.5 Flash (high) — Google DeepMind: 55 (2026-07-13)Gemini 3.1 Pro Preview — Google DeepMind: 46 (2026-07-20)Gemini 3.6 Flash (high) — Google DeepMind: 50 (2026-07-27)Gemini 3.6 Flash (high) — Google DeepMind: 50 (2026-08-03)Gemini 3.6 Flash (high) — Google DeepMind: 52 (2026-08-10)Gemini 3.7 Flash (high) — Google DeepMind: 56 (2026-08-17)Gemini 3.7 Flash (high) — Google DeepMind: 56 (2026-08-24)56
  • Anthropic
  • OpenAI
  • Google DeepMind

Intelligence Index — Trend

各点にホバーすると、その時点のモデル名(バージョン)が表示されます。

最終更新: 2026-08-24 · 11 データ点 · artificialanalysis.ai

編集部が一次ソースから毎週収集しています。

データセット全体を見る