四月冲刺,五月暂停:最新AI模型发布对基础设施预算意味着什么
打破你规划假设的发布周期
如果你的基础设施团队在三月确定了AI预算,那你已经在用过时的假设工作了。四月发布周期带来了一波模型,从根本上改变了成本与性能的比率,而五月的发布则带来了一个停顿,其意义比之前的速度更重要。
这是实际发生的情况:从二月下旬到五月28日,主要实验室发布了GPT-5.4(3月5日)、Gemini 3.1 Pro和Flash-Lite(2月和3月)、Claude Sonnet 4.6和Opus 4.6(2月),以及最重要的GPT-5.5(4月23日)和Claude Opus 4.8(5月28日)。这不是"跟上发布速度"。这是一个季度内的三次独立能力跳跃。
相关阅读: 为什么开源大语言模型现在对商业很重要:等价性背后的经济学和现实检验 2026年6月AI模型发布实际告诉我们什么——以及它们没有告诉我们什么
对基础设施规划来说,这很重要,因为你当前部署的商业案例可能已经反转了。
成本结构陷阱:为什么采购会议会被打得措手不及
大多数在2025年批准AI基础设施的组织都基于一个假设:模型定价相对保持平稳,而硬件成为杠杆。这个假设即将在你的预算核对中造成问题。
Gemini 3.1 Pro现在是最便宜的旗舰产品,输入代币2美元/百万,输出代币12美元,大约比GPT-5.5(5美元/30美元)便宜2.5倍,比Claude Opus 4.8(5美元/25美元)也便宜。但这里有一个操作现实,定价表隐藏了它:你的实际支出不会与这些数字成正比变化。
大多数团队发现他们的AI支出比预期高2-3倍,因为代币价格没有考虑全貌。提示缓存在通过Bedrock支持的Claude模型上缓存输入代币可以降低大约90%的成本,这意味着从一个模型切换到另一个模型可以节省资金——但前提是你的工程团队已经构建了缓存层。如果他们还没有,你就放弃了90%的折扣。
另一个陷阱是:批处理API定价对非实时工作负载提供50%的固定折扣,但如果工作负载不对延迟敏感且按需运行,则需要支付2倍溢价。文档处理、评估运行和批量分类应该以半价运行。如果你的DevOps团队还没有按延迟要求拆分工作负载,那就是实际支出上的另一个2倍乘数。
硬件现实检查
在你为了节省代币成本而切换模型之前,要了解你现在拥有什么。Gartner预期2026年全球AI支出将达到2.59万亿美元,比2025年增长47%,其中超过45%直接进入基础设施。这是计算资源,不是模型。
GPU定价本身不是主要的成本驱动因素;基础设施瓶颈、集成复杂性和规划不足才是导致大多数企业AI成本超支的根源。如果你承诺了本地GPU的资本支出,那么无论你选择在上面运行哪个模型,都被锁定在这个硬件堆栈中。
这是五月暂停在战略上变得重要的地方。在四月的速度之后,实验室陷入了沉寂。这不是意外——这是信号。竞争的实验室不会因为没有想法而降低发布节奏。他们放缓是因为下一次能力跳跃需要客户无法立即吸收的基础设施改变。
财务部门会注意到的总拥有成本问题
企业AI基础设施的真实总拥有成本通常是组织在批准初始部署时预算的两到三倍。四月的发布刚好让之前没注意的首席财务官看到了这个差距。
这是核对表中显示的细分:
| 成本层 | 初始假设(预算占比) | 实际支出(预算占比) | 为什么更高 |
|---|---|---|---|
| 模型代币(推理) | 30% | 15% | 更好的模型=更少重试,但前提是实施到位 |
| GPU/计算基础设施 | 40% | 35% | 被锁定在之前的硬件承诺中 |
| 存储和数据出口 | 10% | 20% | 用于快速数据访问的高性能NVMe;网络出口费用 |
| 缓存、路由、可观测性 | 5% | 15% | 请求路由、监控、API网关层 |
| 集成和重新训练 | 15% | 15% | 持续的模型生命周期管理 |
一月份证明项目合理性的计算假设代币成本会下降,硬件利用率会稳步提高。四月的发布确实带来了代币成本下降(Gemini 3.1 Pro确实更便宜),但硬件利用率仍然需要你的团队可能没有分配的工程工作。
什么改变了,什么还没改变(目前)
GPT-5.5是最多才多艺的全能通用模型,具有最好的代理CLI分数;Claude Opus 4.8在LMArena人类偏好排行榜上排名第一,在最难的编码基准测试中领先;Gemini 3.1 Pro最便宜且集成最好。这种差异对用例匹配很重要,但不会从根本上改变你的基础设施占用。
真正的改变范围更窄:2026年春季的趋势是从"回答问题的AI"向"完成任务的AI"转变。这意味着你的提示、编排层、可观测性工具和验证逻辑都需要重做。这不是模型交换。这是一次完整的应用生命周期刷新。
五月暂停的存在是因为实验室在等待组织吸收这种转变。6月再来一次能力跳跃会打破整个企业段的采用时钟。相反,可见的趋势是整合:组织正在采用四月发布的版本,在其上构建代理层,而不是每周都交换模型。
对你的基础设施团队:夏季前需要做出的三个决定
首先:审计你的工作负载分布。运行30天分析来确定哪些请求对延迟敏感,哪些可以批处理。如果你目前没有分离它们,立即通过批处理API重新路由批处理工作负载。这是一个零硬件成本的代码更改。在典型工作量下,这样可以为该部分节省50%的代币支出。
其次:验证你的缓存层。大多数团队在构建请求去重或提示缓存基础设施之前就实现了API调用。如果你的系统通过不同的请求运行相同的提示,你就在浪费金钱。构建缓存层的ROI通常是6-12周的工程工作,可节省输入代币成本的40-60%。为你的工作量运行计算。
第三:对你的硬件承诺与切换模型的成本进行压力测试。你的GPU合同有效期至2026年第四季度或2027年第一季度。在此期间,你可以用相同的资源运行Gemini 3.1 Pro,成本仅为GPT-5.5的一小部分。如果你的团队还没有对这种情况进行建模,你可能因为边际能力增益而每月超支数千元。
四月的冲刺是真实的。五月的暂停也是真实的。两者都不会改变你的基本基础设施决策——但都告诉你,你最初的预算模型是不完整的。修复缓存、修复工作负载路由,然后你就会知道哪些模型实际上对你的堆栈在经济上有意义。
本站追踪数据
AI 智能指数(三大前沿模型)
- Anthropic
- OpenAI
- Google DeepMind
Intelligence Index — Trend
※ 将光标悬停在每个点上,可查看该日期对应的具体模型版本。
由编辑团队每周从一手来源收集。
查看完整数据集 →