Claude Sonnet 5和夏季更新:本周发布的新内容
发布节奏已经改变
Anthropic在2026年6月30日发布的Claude Sonnet 5标志着初夏最重要的前沿模型发布。但它并非孤立存在。过去10天里, Claude Sonnet 5作为最新追踪的前沿模型于2026年6月30日发布 、 GPT-5.6的三个版本——Sol(旗舰版)、Terra(平衡版)和Luna(快速版、经济版)在2026年6月26日预览发布 ,以及 Grok 4.5在6月28日进入私密测试版但尚无公开发布日期 。这很重要,因为 夏季过去曾是AI公告的沉寂期,各大实验室习惯在秋季会议和年底活动时进行重大发布,但这一模式已经改变 。
业务逻辑很直接: 由于数百个企业采购周期按季度安排运行,在7月发布的实验室能够占据Q3预算 。对技术团队而言,这意味着当下做出的决策将影响Q3基础设施支出。
相关阅读: Claude Sonnet 5的新分词器:为什么你的成本在9月1日增加30% 2026年7月发布崖:为什么模型多样性现在战胜原始性能
Claude Sonnet 5:你每天实际使用的功能
以下是发布内容: 6月30日发布的Claude Sonnet 5是Anthropic最具代理能力的Sonnet版本,现已成为Claude免费和Pro计划的默认模型 。代码工作的关键指标是: 在代理编程上它在SWE-Bench Pro上达到63.2%,高于Sonnet 4.6的58.1%,并紧追Opus 4.8的69.2%,在知识工作上它实际上超过了Opus 4.8 。
上下文窗口的故事很重要。 它标配支持原生100万令牌上下文窗口 。这不是脚注——它改变了你在不需要提示词工程情况下能做的事。 测试者一致描述了相同的行为:它完成了之前Sonnet版本停滞的复杂多步骤任务,并能自主检查输出 。
定价方面的情况变得有趣。 API推介价格为每百万令牌2美元/10美元,至2026年8月31日为止,之后上升至3美元/15美元 。对于在按任务基准评估Claude与竞争对手的企业团队来说,这很重要。 它在Artificial Analysis的专业写作基准上比Sonnet 4.6(之前为1,643)提升了大约223 GDPval-AA Elo,领先Opus 4.8和GPT-5.5 。
GPT-5.6:只有访问权限列表上的用户才能使用
GPT-5.6是OpenAI的下一代模型系列,在2026年6月26日预览发布:Sol是旗舰版,Terra是平衡的日常模型,Luna是快速、经济的版本。目前你可能无法使用它——这是首个受政府访问限制的美国前沿版本,仅在OpenAI与美国政府分享这些模型和发布计划后,才能通过OpenAI API和Codex供大约20个信任机构使用 。
这里有所不同的是:这不是面向测试者的封闭测试版。 它受政府访问限制,仅在OpenAI与美国政府分享模型和发布计划后,才能供大约20个信任机构使用,计划在"未来几周"实现普遍可用,并且Sol将在7月在Cerebras上以每秒最多750令牌的速度启动 。当它开放时, 公布的定价为Sol每百万令牌5美元/30美元,Terra 2.50美元/15美元,Luna 1美元/6美元 。
需要关注的功能是: Sol在Terminal-Bench 2.1上创造了新的SOTA记录,Terra以2倍更低的成本提供GPT-5.5竞争性能,Luna速度最快且成本最低 。对于不在访问列表上的团队, GPT-5.5仍然是OpenAI的发布旗舰 。
更广泛的模式:成本压缩获胜
在所有发布中, 成本压缩在加速,几乎每个主要实验室本月都发布了更经济的推理选项,顶级模型的成本性能比与12个月前相比大约翻了三倍 。 代理性能是主要竞争战场,实验室在多步骤工具使用、内存管理和规划可靠性上竞争最激烈,这反映了企业需求集中的领域——能够在没有持续人工干预的情况下完成多步骤工作流的AI系统 。
| 模型 | 发布日期 | 关键指标 | API定价(输入/输出) | 状态 |
|---|---|---|---|---|
| Claude Sonnet 5 | 2026年6月30日 | 63.2% SWE-Bench Pro;100万令牌上下文 | $2/$10(推介价);8月31日后$3/$15 | 全面可用 |
| GPT-5.6 Sol/Terra/Luna | 2026年6月26日(预览) | Sol:新的Terminal-Bench SOTA;Terra:成本降低2倍 | Sol:$5/$30;Terra:$2.50/$15;Luna:$1/$6 | 受限访问(约20个机构) |
| Grok 4.5 | 2026年6月28日(私密测试版) | 1.5万亿参数;V9基础 | 尚未公开 | 仅限私密测试版 |
| Gemini 3.5 Pro | 2026年7月(预期) | Gemini 3.1 Pro的后继产品 | 待定 | 计划全面推出 |
这对你的团队现在意味着什么
三个行动,按影响力排序:
- 如果你在生产API中使用Claude: Claude Sonnet 5的定价为推介价每百万令牌2美元/10美元,至2026年8月31日为止,之后上升至3美元/15美元 。如果你的工作量符合Sonnet的规格(代理任务、长上下文推理、写作),在价格上升前锁定成本基线。每百万输入令牌从2美元升至3美元的跳跃在大容量上会迅速累积。
- 如果你在评估多步骤工作流: 实验室在多步骤工具使用、内存管理和规划可靠性上竞争最激烈 。Sonnet 5在自我修正(检查自己的工作)和持续任务完成上的改进是可衡量的。在10个代表性任务上针对你的当前模型运行它。
- 如果你在等待GPT-5.6:你还不在访问列表上。今天就基于GPT-5.5或Claude Sonnet 5进行构建;不要等待受限版本而浪费计算能力。当普遍可用推出时(预计几周内),你可以用真实的容量数据评估迁移成本与收益。
前沿的发布周期现在是每月一次。本周发布的内容将在8月过时。但潜在的转变——成本下降速度快于能力增长——意味着你的基础设施决策变得更灵活,而非更受限。为任务而构建,而不是为品牌。在真实容量上进行基准测试。现在锁定成功,在定价再次重置之前。
本站追踪数据
AI 智能指数(三大前沿模型)
- Anthropic
- OpenAI
- Google DeepMind
Intelligence Index — Trend
※ 将光标悬停在每个点上,可查看该日期对应的具体模型版本。
由编辑团队每周从一手来源收集。
查看完整数据集 →