AI Tech News
By H.O.

Claude Sonnet 5和夏季更新:本周发布的新内容

Claude Sonnet 5和夏季更新:本周发布的新内容

发布节奏已经改变

Anthropic在2026年6月30日发布的Claude Sonnet 5标志着初夏最重要的前沿模型发布。但它并非孤立存在。过去10天里, Claude Sonnet 5作为最新追踪的前沿模型于2026年6月30日发布 、 GPT-5.6的三个版本——Sol(旗舰版)、Terra(平衡版)和Luna(快速版、经济版)在2026年6月26日预览发布 ,以及 Grok 4.5在6月28日进入私密测试版但尚无公开发布日期 。这很重要,因为 夏季过去曾是AI公告的沉寂期,各大实验室习惯在秋季会议和年底活动时进行重大发布,但这一模式已经改变 。

业务逻辑很直接: 由于数百个企业采购周期按季度安排运行,在7月发布的实验室能够占据Q3预算 。对技术团队而言,这意味着当下做出的决策将影响Q3基础设施支出。

Claude Sonnet 5:你每天实际使用的功能

以下是发布内容: 6月30日发布的Claude Sonnet 5是Anthropic最具代理能力的Sonnet版本,现已成为Claude免费和Pro计划的默认模型 。代码工作的关键指标是: 在代理编程上它在SWE-Bench Pro上达到63.2%,高于Sonnet 4.6的58.1%,并紧追Opus 4.8的69.2%,在知识工作上它实际上超过了Opus 4.8 。

上下文窗口的故事很重要。 它标配支持原生100万令牌上下文窗口 。这不是脚注——它改变了你在不需要提示词工程情况下能做的事。 测试者一致描述了相同的行为:它完成了之前Sonnet版本停滞的复杂多步骤任务,并能自主检查输出 。

定价方面的情况变得有趣。 API推介价格为每百万令牌2美元/10美元,至2026年8月31日为止,之后上升至3美元/15美元 。对于在按任务基准评估Claude与竞争对手的企业团队来说,这很重要。 它在Artificial Analysis的专业写作基准上比Sonnet 4.6(之前为1,643)提升了大约223 GDPval-AA Elo,领先Opus 4.8和GPT-5.5 。

GPT-5.6:只有访问权限列表上的用户才能使用

GPT-5.6是OpenAI的下一代模型系列,在2026年6月26日预览发布:Sol是旗舰版,Terra是平衡的日常模型,Luna是快速、经济的版本。目前你可能无法使用它——这是首个受政府访问限制的美国前沿版本,仅在OpenAI与美国政府分享这些模型和发布计划后,才能通过OpenAI API和Codex供大约20个信任机构使用 。

这里有所不同的是:这不是面向测试者的封闭测试版。 它受政府访问限制,仅在OpenAI与美国政府分享模型和发布计划后,才能供大约20个信任机构使用,计划在"未来几周"实现普遍可用,并且Sol将在7月在Cerebras上以每秒最多750令牌的速度启动 。当它开放时, 公布的定价为Sol每百万令牌5美元/30美元,Terra 2.50美元/15美元,Luna 1美元/6美元 。

需要关注的功能是: Sol在Terminal-Bench 2.1上创造了新的SOTA记录,Terra以2倍更低的成本提供GPT-5.5竞争性能,Luna速度最快且成本最低 。对于不在访问列表上的团队, GPT-5.5仍然是OpenAI的发布旗舰 。

更广泛的模式:成本压缩获胜

在所有发布中, 成本压缩在加速,几乎每个主要实验室本月都发布了更经济的推理选项,顶级模型的成本性能比与12个月前相比大约翻了三倍 。 代理性能是主要竞争战场,实验室在多步骤工具使用、内存管理和规划可靠性上竞争最激烈,这反映了企业需求集中的领域——能够在没有持续人工干预的情况下完成多步骤工作流的AI系统 。

模型 发布日期 关键指标 API定价(输入/输出) 状态
Claude Sonnet 5 2026年6月30日 63.2% SWE-Bench Pro;100万令牌上下文 $2/$10(推介价);8月31日后$3/$15 全面可用
GPT-5.6 Sol/Terra/Luna 2026年6月26日(预览) Sol:新的Terminal-Bench SOTA;Terra:成本降低2倍 Sol:$5/$30;Terra:$2.50/$15;Luna:$1/$6 受限访问(约20个机构)
Grok 4.5 2026年6月28日(私密测试版) 1.5万亿参数;V9基础 尚未公开 仅限私密测试版
Gemini 3.5 Pro 2026年7月(预期) Gemini 3.1 Pro的后继产品 待定 计划全面推出

这对你的团队现在意味着什么

三个行动,按影响力排序:

  • 如果你在生产API中使用Claude: Claude Sonnet 5的定价为推介价每百万令牌2美元/10美元,至2026年8月31日为止,之后上升至3美元/15美元 。如果你的工作量符合Sonnet的规格(代理任务、长上下文推理、写作),在价格上升前锁定成本基线。每百万输入令牌从2美元升至3美元的跳跃在大容量上会迅速累积。
  • 如果你在评估多步骤工作流: 实验室在多步骤工具使用、内存管理和规划可靠性上竞争最激烈 。Sonnet 5在自我修正(检查自己的工作)和持续任务完成上的改进是可衡量的。在10个代表性任务上针对你的当前模型运行它。
  • 如果你在等待GPT-5.6:你还不在访问列表上。今天就基于GPT-5.5或Claude Sonnet 5进行构建;不要等待受限版本而浪费计算能力。当普遍可用推出时(预计几周内),你可以用真实的容量数据评估迁移成本与收益。

前沿的发布周期现在是每月一次。本周发布的内容将在8月过时。但潜在的转变——成本下降速度快于能力增长——意味着你的基础设施决策变得更灵活,而非更受限。为任务而构建,而不是为品牌。在真实容量上进行基准测试。现在锁定成功,在定价再次重置之前。

本站追踪数据

AI 智能指数(三大前沿模型)

01632476305-1706-0106-0807-0607-1307-2007-2708-0308-1008-17Claude Opus 4.7 (Adaptive Reasoning, Max Effort) — Anthropic: 57 (2026-05-17)Claude Opus 4.8 (Adaptive Reasoning, Max Effort) — Anthropic: 61 (2026-06-01)Claude Opus 4.8 (Adaptive Reasoning, Max Effort) — Anthropic: 61 (2026-06-08)Claude Opus 4.8 (Adaptive Reasoning, Max Effort) — Anthropic: 56 (2026-07-06)Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) — Anthropic: 60 (2026-07-13)Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) — Anthropic: 59.9 (2026-07-20)Claude Opus 5 (Adaptive Reasoning, Max Effort) — Anthropic: 61 (2026-07-27)Claude Opus 5 (Adaptive Reasoning, Max Effort) — Anthropic: 61 (2026-08-03)Claude Opus 5 (Adaptive Reasoning, Max Effort) — Anthropic: 63 (2026-08-10)Claude Opus 5 (Adaptive Reasoning, Max Effort) — Anthropic: 63 (2026-08-17)63GPT-5.5 (xhigh) — OpenAI: 60 (2026-05-17)GPT-5.5 (xhigh) — OpenAI: 60 (2026-06-01)GPT-5.5 (xhigh) — OpenAI: 60 (2026-06-08)GPT-5.5 (xhigh) — OpenAI: 55 (2026-07-06)GPT-5.6 Sol (max) — OpenAI: 59 (2026-07-13)GPT-5.6 Sol (max) — OpenAI: 58.9 (2026-07-20)GPT-5.6 Sol (max) — OpenAI: 59 (2026-07-27)GPT-5.6 Sol (max) — OpenAI: 59 (2026-08-03)GPT-5.6 Sol (max) — OpenAI: 61 (2026-08-10)GPT-5.6 Sol (max) — OpenAI: 61 (2026-08-17)61Gemini 3.1 Pro Preview — Google DeepMind: 57 (2026-05-17)Gemini 3.1 Pro Preview — Google DeepMind: 57 (2026-06-01)Gemini 3.1 Pro Preview — Google DeepMind: 57 (2026-06-08)Gemini 3.1 Pro Preview — Google DeepMind: 46 (2026-07-06)Gemini 3.5 Flash (high) — Google DeepMind: 55 (2026-07-13)Gemini 3.1 Pro Preview — Google DeepMind: 46 (2026-07-20)Gemini 3.6 Flash (high) — Google DeepMind: 50 (2026-07-27)Gemini 3.6 Flash (high) — Google DeepMind: 50 (2026-08-03)Gemini 3.6 Flash (high) — Google DeepMind: 52 (2026-08-10)Gemini 3.7 Flash (high) — Google DeepMind: 56 (2026-08-17)56
  • Anthropic
  • OpenAI
  • Google DeepMind

Intelligence Index — Trend

将光标悬停在每个点上,可查看该日期对应的具体模型版本。

最后更新: 2026-08-17 · 10 数据点 · artificialanalysis.ai

由编辑团队每周从一手来源收集。

查看完整数据集