AI 见闻
精选· 重要性 5/5

Qwen 3.8 Max与27B开放权重模型发布,主打编码与智能体协作

Latent Space (Swyx)··约 7 分钟阅读
中文导读

阿里巴巴发布Qwen 3.8 Max(2.4T参数)及Qwen 3.8-27B,承诺下周开放权重,在编码、长期智能体任务和多模态推理上表现强劲,与西方顶级闭源模型直接竞争。

[AINews] Qwen 3.8 Max(2.4T)和27B,面向编码与协作的新开放权重模型Qwen强势回归!去年经历Qwen Exodus事件、新管理层接管并推出更多闭源模型API后,外界曾对这个领先开源模型实验室是否会继续发布相关模型产生怀疑。

如今,这种疑虑已烟消云散。Qwen 3.8 Max是一个2.4T参数的巨兽,若非我们已报道过的Kimi K3发布,它本可成为全球最顶尖的开源模型。Qwen在API上提供该模型,定价为每百万token输入2美元、输出6美元,并承诺将开放这两个模型的权重。

关键能力与突破亮点自主长期编码:10天以上无人值守编码:在数周自主运行中,从零构建了一个自我进化的编码工具链。

自主AI研究:从零重建了一篇完整论文的流程(LLM推理的统一数据选择),随后在125小时内自主运行迭代研究循环,发明了一种新的数据选择方法,在基准测试上比原论文高出+2.71分。

竞争性数据科学:在WWW2025多模态对话意图识别挑战赛中与526支人类团队竞争,24小时内进入前13%(超越87%的人类团队)。自主硬件与芯片设计:执行了完整的硅设计流程(GCD/RSA加密加速器),涵盖RTL编辑、仿真、综合及物理布局。

门数从8,298个减少至678个,芯片面积缩减81%,并在500 MHz下实现物理时序收敛。深度现实世界工作与运营:在数百个专业工作流程中展示了生产级输出(如企业法律审查、UI/UX设计、结构工程模型和自动化ETF量化研究)。

在E-Commerce Bench(365天店铺运营模拟)中优于竞品模型,通过持续的博弈论谈判和库存规划,实现了4.16倍回报(余额¥416,252)。多模态智能体与视觉反馈:在规划、编码和GUI交互中集成原生视觉反馈,支持跨平台(桌面、移动端、Web)直接重建应用。

发布Qwen-MM-Plugins,将多模态能力扩展到现有智能体框架。这是开放权重的一大胜利!在今天与Baseten的播客中,我们讨论了在发布时支持这些大规模模型是什么体验。AI新闻2026年7月25日至7月27日。

我们检查了12个subreddits、544条Twitter,没有更多Discord。AINews网站可搜索所有历史期刊。提醒:AINews现已成为Latent Space的一部分。您可以选择接收或退订邮件频率!

AI Twitter回顾头条:Qwen 3.8 Max开放模型发布发生了什么阿里巴巴Qwen宣布Qwen3.8-Max为其新旗舰,并表示开放权重将于下周推出。阿里巴巴推出了Qwen3.

8-Max,称其为“迄今为止能力最强的模型”,描述为2.4T参数模型,专注于编码、长期智能体工作和多模态推理,并明确表示开放权重将于下周发布,同时Qwen3.8-27B也将开放权重 @Alibaba_Qwen发布推文还包含API定价:输入token每百万$2.00,

输出token每百万$6.00,缓存token每百万$0.25 @Alibaba_Qwen阿里巴巴围绕几个核心能力构建了该模型:10天以上的自主编码、500轮以上的芯片设计优化、365天的电商策略,以及原生多模态智能——视觉是执行循环的一部分,

而非仅仅输入通道 @Alibaba_Qwen公司同时在其自有平台和合作伙伴中推广可用性:Qwen Studio、API、Command Code,以及后来的Venice;

基础设施和应用构建者迅速确认了支持计划或集成,包括Baseten、Hermes Agent和Command Code @Alibaba_Qwen @Alibaba_Qwen @baseten @Teknium这一公告是更广泛趋势的一部分:

多位观察者将其描述为中国开放权重前沿现在正与西方顶级闭源模型直接竞争的证据,尤其是在编码、智能体工作流和多模态任务方面 @kimmonismus @matvelloso官方声明与报告规格供应商报告的模型细节和性能声明对于开放权重发布而言异常激进。

阿里巴巴自身的框架:2.

4T总参数 @Alibaba_Qwen长期智能体/协作重点 @Alibaba_Qwen超过10天的自主编码,

并附有公开GitHub轨迹 @Alibaba_Qwen芯片设计优化500+轮 @Alibaba_Qwen365天电商策略执行 @Alibaba_Qwen原生多模态规划循环,

而非仅视觉输入 @Alibaba_Qwen来自ZhihuFrontier的第三方摘要推文补充了更多声称或报告的技术细节:每个token激活95B参数,

意味着MoE激活率约为4%1M token上下文窗口API提供低/中/超高推理努力模式兼容OpenAI和Anthropic协议基准测试声称:

PaperBench 93.0,CoWorkBench 74.8,WideSearch 81.9 @ZhihuFrontierVals AI独立发布了具体的评估/运行时设置:1M token上下文最大输出token 128k在温度0.7下测试,

使用默认top-p/top-k @ValsAI这些数字很重要,因为它们将Qwen3.8-Max置于与其他巨型稀疏开放模型(如Kimi K3和GLM-5.2)相同的部署类别,而非更实用的30B–70B本地层级。

独立评估与排行榜表现该模型立即发布了强劲的第三方结果,尤其是在编码相关、视觉和设计密集领域。Frontend Code Arena:Qwen3.

8-Max以1,668 Elo总分排名第4,仅次于Claude Opus 5 [Max](1,705)和Kimi K3 [Max](1,676),与Claude Opus 5 [High](1,

669)大致持平 @arena在Frontend Code Arena子类别中,

它排名:#2 消费产品#3 品牌与营销、参考设计、游戏、内容创作工具#4 数据与分析#5 模拟 @arenaVision Arena:Qwen3.8-Max以1,305分排名第2,仅落后Claude Fable 5 [High] 13分 @arenaVals Index:

Qwen3.8-Max在开放权重模型中排名第2,

在43个模型中总体第10,得分66.1 @ValsAIVals还报告:在Index上与Claude Opus 4.7持平,66.1对66.1每次测试成本约低2.3倍:$2.68对$6.17 @ValsAIVals的基准具体数字:SWE-bench:87.3%,

领先于GPT-5.5(82.6%)和GLM-5.2(83.3%),但落后于Claude Opus 4.8(89.2%)Terminal-Bench 2.1:67.4,高于Qwen 3.7 Max的61.0 @ValsAIVals还强调了进步速度:

Qwen 3.7 Max = 57.5Qwen 3.8 Max = 66.1约2.5个月内提升8.6分输入/输出价格从$2.50/$7.50降至$2.00/$6.00 @ValsAI还有更多轶事但技术上相关的说法:

一位用户可视化了基准差异,并认为在他们重建的图表上“Opus 4.8大部分被3.8-Max涵盖” @deliprao另一位声称Qwen 3.8在Terminal Bench上超越了Fable 5,

并表示Anthropic现在面临明显压力 @kimmonismus另一条推文称Qwen 3.

8 Max是“最佳目标检测VLM”,涵盖卫星、红外、文档、技术图纸、草图、拥挤场景和小物体,尽管这基于示例而非引用的基准论文 @skalskip92事实与观点事实/直接可归因的声明阿里巴巴宣布Qwen3.8-Max,并表示开放权重将于下周发布;

Qwen3.8-27B也将开放权重 @Alibaba_Qwen阿里巴巴披露API定价:输入$2/输出$6/缓存$0.25每百万token @Alibaba_QwenArena报告Frontend Code Arena排名第4(1,668),

Vision Arena排名第2(1,305) @arena @arenaVals报告Vals Index得分66.1,开放权重模型中排名第2,SWE-bench 87.3%,Terminal-Bench 2.1得分67.4,1M上下文,128k输出,

且每次测试成本低于Opus 4.7 @ValsAI @ValsAI @ValsAIZhihuFrontier声称95B激活参数和协议兼容性;这似乎是二手摘要,而非阿里巴巴原始规格表 @ZhihuFrontier观点

原文出处
[AINews] Qwen 3.8 Max(2.4T) and 27B, new open weights models for Coding and Cowork

本文为机器翻译辅以 AI 润色,仅供参考。原始事实以原文为准。

相关阅读