AI 见闻
精选· 重要性 5/5

GPT-5.6降价20%-80%,旗舰智能成本四个月降13倍

Latent Space (Swyx)··约 7 分钟阅读
中文导读

OpenAI通过系统级优化大幅降低推理成本,并发布开放权重模型Inkling-Small和Gemini Robotics 2,推动AI成本与能力边界。

[AINews] GPT-5.6价格下调20%-80%:由于GPT-5.6递归自我优化,GPT-5.4智能的成本在4个月内下降了13倍。蒸馏就是一切!

一年前,我们的一张重要“英雄图表”(最终被Demis采用)得出了一个惊人的观察:在LMSys Elo保持不变的情况下,GPT-4级别的智能在18个月内下降了1000倍。

当时,尚不清楚这些是否是“新手收益”——从未优化到优化、从补全到推理、从密集到MoE,所有低垂的果实都已摘取。又过了18个月,答案似乎是否定的:恒定级别的智能继续急剧降价。昨天,OpenAI发布了关于GPT-5.6如何优化自身服务的研究结果:1. 推理加速。

为了在同一硬件上提供更多token而不牺牲质量,OpenAI专注于几项系统性升级:自我优化:GPT-5.6 Sol被积极用于分析生产流量、调整负载均衡,并自主用OpenAI自己的Triton和Gluon语言重写生产内核。

这种自主内核优化将端到端服务成本降低了20%。

推测解码:改进了自身的草稿模型(通过设计和运行数百个架构实验,测试大小、结构和特征的变化,同时监控投机者训练过程,在出现问题时(包括硬件故障和训练不稳定)自主干预),将token生成效率提高了15%以上。

KV缓存:针对不同工作负载(主要是Codex中的Sol)优化了批处理、分片和缓存管理,以从现有硬件中提取更多推理能力。2. 智能体框架改进。

为了简化Codex和ChatGPT Work等工具中复杂的多步骤任务,OpenAI优化了其Rust编排层,以减少重复计算成本:避免上下文膨胀:工具、技能和插件仅在需要时才会出现(延迟发现),工具输出默认限制为10,000个token,以防止上下文窗口不必要地扩展。

提示词缓存:为避免重复处理相同的指令和历史记录,该框架将所有模型可见的历史记录视为仅追加。这保留了提示词前缀,使系统能够重用先前计算的数据并保持高缓存命中率。今天,他们证明了这不仅仅是理论,宣布对较小模型进行大幅降价,并推出新的2.5倍更快模式。

Sol中的5倍更快模式(尽管不是7月承诺的10倍更快的Cerebras驱动模式):这是一条美丽的帕累托曲线——如果AA的每任务成本反映了现实世界的任务,那么OpenAI甚至击败了DeepSeek、GLM和MiniMax等开放模型,

以及Gemini Flash-Lite等专门便宜且优秀的模型。很好,但真正令人瞠目结舌的是Nicdunz的观察:GPT-5.4完整版在xhigh下得分51,正是Luna max今天的位置。GPT-5.4成本为$2.50/$15;

Luna现在成本为$0.20/$1.20。换句话说,大约四个月后,OpenAI以约十三分之一的token价格出售三月份的完整旗舰智能。

这相当于年化约2000倍,自我们上次观察以来是一个巨大的加速——但你应该对此打折,因为所有公共基准(如AA)都在一定程度上被训练,而Elo则不太容易被直接训练。

虽然领先的中国和美国开放模型(如Poolside的Laguna和Thinky的Inkling)提供完全的控制权和主权,但如果你唯一的目标是成本效益高的非微调智能,你会发现现在很难击败OpenAI。

AI新闻2026年7月29日至7月30日。我们检查了12个subreddits、544个Twitter账号,没有进一步的Discords。AINews网站允许您搜索所有过去的问题。提醒您,AINews现在是Latent Space的一部分。

您可以选择加入/退出电子邮件频率!AI Twitter回顾:OpenAI降价、框架语义和ARC-AGI-3记忆争论。OpenAI削减了GPT-5.6的价格。

6价格激进并添加了更快的Sol层级:OpenAI将GPT-5.6 Luna降价80%,Terra降价20%,同时推出Sol Fast,延迟降低最多2.5倍,价格为标准价格的2倍,且“智能无变化”,据@OpenAIDevs。

下游效应对于智能体工作流尤为显著:ChatGPT应用和Codex CLI中的自动审查正在从GPT-5.4迁移到Luna,OpenAI预计成本降低约10倍。多位观察者(包括@sama、@nicdunz和@kimmonismus)将此视为价格/性能前沿的重大转变。

OpenAI还将降价与“模型、推理栈和智能体框架”的系统级效率改进联系起来,据@OpenAIDevs。ARC-AGI-3重新强调“模型”并非整个系统:最技术性的评估讨论集中在框架设计、记忆保留和上下文压缩上。

François Chollet澄清了ARC的规则:不允许定制的基准特定框架,但如果报告了设置和成本,所有用户可用的通用API功能是可以接受的。

@kimmonismus的详细总结将Opus 5在官方半私有ARC设置上的30.2%与GPT-5.6 Sol在标准框架下的7.8%进行对比,同时指出OpenAI内部使用Responses API保留推理+压缩将Sol的公共集得分提升至38.3%。

@gneubig、@scaling01等人也赞同这一观点:长期评估越来越多地衡量完整的智能体系统——推理保留、截断策略、压缩、工具编排——而不仅仅是基础权重。

Thinking Machines的Inkling-Small和持续的开源权重推动:Inkling-Small将Inkling级能力压缩到更小的活动足迹中:Thinking Machines发布了Inkling-Small,这是一个开放权重、原生多模态MoE模型,

总参数276B,活动参数12B,定位为提供与原始Inkling相当的性能,尺寸约为四分之一。该公司表示,它联合处理音频和图像与文本,并支持在多模态设置中推理期间基于Python的图像检查,据其后续说明。

该发布立即在开放推理栈中落地:vLLM宣布第0天支持,Modal强调单B300部署,LMSYS/SGLang报告了解码吞吐量数据,Unsloth发布了本地运行/GGUF指南。

基准测试表明这是一个异常高效的编码和多模态开放模型:Artificial Analysis将Inkling-Small置于其智能指数40分——与旗舰Inkling相差一分——在Humanity's Last Exam、GPQA Diamond、

CritPt和SciCode上表现优异,尽管在某些智能体任务和事实知识上较弱。社区总结强调,较小的模型在多项编码任务上可以击败或匹配较大的Inkling,包括@kimmonismus和@mervenoyann。

开放权重、多模态输入、部署栈中的1M上下文支持以及12B活动算力的结合,使其成为该批次中实际更重要的开放发布之一。

Google的Gemini Robotics 2和具身智能的加速:Gemini Robotics 2从桌面操作扩展到全身控制和多机器人协调:Google DeepMind发布了Gemini Robotics 2,将其描述为“任何机器人的一个大脑”,演示涵盖全身人形控制、

高级灵巧性和多机器人协作。Google AI补充说,该栈包括Gemini Robotics ER 2,一个高级具身推理模型,可以观察、规划、与VLA模型协调、跟踪进度,并在多分钟任务中从失败步骤中恢复。

演示强调了非平凡的电机任务,如打结、拧灯泡、弯腰捡起物体以及协作车库清理。

实际的故事是异质性和适应性,而不仅仅是更好的演示:技术评论强调,同一个checkpoint控制多种硬件类型,据报道On-Device 2可以适应新的双臂机器人,只需不到200个示例,由@kimmonismus总结。

@Of

原文出处
[AINews] GPT 5.6 price cut by 20%-80%: Cost of GPT 5.4 Intelligence dropped 13x in 4 months due to GPT 5.6 recursive self-optimization

本文为机器翻译辅以 AI 润色,仅供参考。原始事实以原文为准。

相关阅读