DeepSeek V4 Flash 0731 在 ARC-AGI 基准测试中取得高分
DeepSeek 发布 V4 Flash 0731 模型,在 ARC-AGI-1 和 ARC-AGI-2 半私有基准测试中分别取得 89.0% 和 61.4% 的分数,且单任务成本极低,展示了高效推理能力。
DeepSeek 发布 V4 Flash 0731 模型,在 ARC-AGI-1 和 ARC-AGI-2 半私有基准测试中分别取得 89.0% 和 61.4% 的分数,且单任务成本极低,展示了高效推理能力。
本文深入解析vLLM这一高吞吐量LLM推理系统的核心组件与高级特性,从分页注意力、连续批处理到多GPU扩展,为理解现代推理引擎提供清晰框架。
本期AI新闻涵盖AMD收购Taalas、Meta的Muse Spark 1.2在基准测试中突破、OpenAI统一ChatGPT模型并推出Agent Plugins标准,以及智能体编排和推理路由成为竞争焦点。
OpenAI宣布取消ChatGPT免费用户的文本聊天限制,并推出新模型GPT-5.6 Luna,同时为付费用户提供升级版Sol模型,提升推理能力并减少事实错误。
Meta推出编码智能体Muse Code及升级版Muse Spark 1.2,后者在代码生成、调试等任务上显著提升,并强调长序列智能体工具调用能力,反映当前模型发展的关键趋势。
乌克兰应用开发商MacPaw与Liquid AI合作,将本地AI模型引入其产品,并计划向开发者开放设备端推理技术,同时为其订阅应用商店SetApp推出AI应用和积分制。
本期AI新闻聚焦推理工程领域关于Megakernels的激烈辩论,并报道Cursor开源其NVL72 MoE训练Megakernel,以及Qwen、NVIDIA、Mistral等多家公司发布新模型,展示推理效率与模型发布的快速演进。
LLM 0.32 是该项目自发布以来最重要的更新,新增推理轨迹显示、服务器端工具支持、内容可寻址日志,并默认使用 GPT-5.6 Luna 模型,标志着 LLM 正演变为一个智能体框架。
阿里巴巴发布Qwen 3.8 Max(2.4T参数)及Qwen 3.8-27B,承诺下周开放权重,在编码、长期智能体任务和多模态推理上表现强劲,与西方顶级闭源模型直接竞争。
Baseten联合创始人详解推理工程:从KV缓存路由到量化误差抵消,揭示推理优化如何成为AI基础设施新战场,并带来20%至200%的性能提升。
DeepSeek发布V4系列最新模型V4-Flash-0731,参数3040亿,智能体能力增强,性价比突出,在基准测试中超越更大模型。
大型推理模型(LRM)在数学竞赛中夺金,但其思维链可能只是表面捷径,未必反映真实推理过程。本文探讨AI推理的有效性与解释性之间的张力。
DeepSeek 发布 V4-Flash 公测,性能大幅提升,并宣布 legacy 模型名称即将停用,同时回顾了从 V2.5 到 V4 的系列升级。
OpenAI通过系统级优化大幅降低推理成本,并发布开放权重模型Inkling-Small和Gemini Robotics 2,推动AI成本与能力边界。
一项实证研究显示,从中国审查模型蒸馏出的美国模型在金融推理上表现优异,但未继承政治审查行为,为模型蒸馏实践提供了重要参考。
OpenAI发现,通过保留推理链和启用压缩两项API设置,GPT-5.6在ARC-AGI-3基准测试上的得分和效率大幅提升,揭示了推理模型的关键优化方向。
OpenAI发布GPT-5.6,在模型、推理和智能体工作流中提升AI效率,实现每美元更多有用智能。
Anthropic研究人员使用Claude Mythos模型,通过60小时连续推理和巧妙提示,发现了HAWK和简化版AES中的数学弱点,展示了AI在密码学前沿研究中的潜力。
AI推理云初创公司General Compute获4亿美元贷款,以推理芯片为抵押,标志着资本从GPU转向更高效的推理基础设施,推动开源模型发展。
OpenAI 推出 GPT-5.6 系列三款模型,以太阳、地球、月球命名,主打性价比分层;同时将 Codex 整合进 ChatGPT Work 桌面应用,向超级应用战略迈出关键一步。
Cognition 发布 SWE-1.7 模型,通过强化学习在多个集群上训练,以极低成本达到接近 GPT-5.5 和 Opus 的智能水平,挑战了“后训练天花板”的假设。
Lilian Weng 发布综述,强调 Harness 工程是递归自我改进的核心,而非直接修改权重;Anthropic、Google 等纷纷推出智能体产品,Meta 发布 Muse 图像/视频模型,Liquid AI 提出 Antidoom 方法减少推理循环失败。
本期 AINews 聚焦 Fable 5 模型发布后的使用指南与社区反应,同时报道腾讯 Hy3 开放权重模型、智能体基准测试、Anthropic 可解释性研究及推理效率进展,展现 AI 领域在模型能力、部署与安全方面的快速演进。
本文探讨开放权重模型 GLM 5.2 如何以极低成本接近前沿模型性能,并分析推理利润率即将崩溃对 AI 行业格局的深远影响。
DeepSeek发布DSpark论文,开源一种推理优化技术,可将大模型生成速度提升60-85%,显著降低推理成本。
AI推理初创公司Baseten在不到半年内估值飙升160%,据报正以130亿美元估值完成15亿美元融资,凸显推理层投资热潮。
研究人员利用OpenAI推理模型分析未确诊的罕见病病例,成功识别出18种新诊断,展示了AI在辅助临床诊断中的潜力。
Z.ai 发布 MIT 许可的开放权重前沿模型 GLM-5.2,在多项编码和智能体基准测试中超越多数闭源模型,并引入 IndexShare 稀疏注意力优化和推理效率改进。
微软CEO Satya Nadella发文阐述以学习循环为核心的AI战略,同时Anthropic的Fable 5模型因美国出口管制被暂停访问,引发业界对模型中立性和可观测性的关注。
Hugging Face 的 Open R1 项目旨在完全开源复现 DeepSeek-R1 的推理能力,已发布多个高质量数据集和训练方案,并完成第一阶段蒸馏任务。
本文介绍如何利用Kolmogorov-Arnold网络(KAN)在FPGA上实现超低延迟推理和在线学习,通过将KAN与查找表神经网络结合,实现高效硬件加速。
Anthropic发布报告称AI已出现递归自我改进的早期迹象,英伟达推出完全开源的Nemotron 3 Ultra模型,OpenAI的ChatGPT月活突破10亿并改进记忆功能,Cloudflare收购VoidZero以强化全栈代理工具链。
Axiom在2025年以满分12/12解决普特南数学考试,其CEO Carina Hong认为形式验证(如Lean证明)是通向AGI的必要条件,能提供更强的强化学习信号和可扩展的高质量训练数据。
微软在Build 2026大会上推出旗舰推理模型MAI-Thinking-1,标志着其摆脱对OpenAI依赖、自主开发AI模型的重要一步。
本文记录了在AMD MI300X上运行DeepSeek-V4-Flash推理时遇到的FP8方言不兼容、注意力内核缺失、HIP图支持等软件问题及修复过程,揭示了AMD旧款加速器在AI软件生态上的短板。
微软将在Build大会上推出MAI-Thinking-1推理模型、Copilot超级应用及Windows 11开发者优化体验,旨在赢回开发者信任并重塑AI战略。
本文是TechCrunch发布的AI术语表,系统解释了AGI、AI智能体、思维链、扩散模型等常见术语,帮助读者理解AI领域的关键概念。
Kog AI发布推理引擎技术预览,在标准数据中心GPU上实现单请求每秒3000个token的解码速度,通过软硬件协同优化突破内存带宽瓶颈,为AI智能体应用带来数量级的延迟改善。
Anthropic发布Claude Opus 4.8,在编码、推理和代理任务上显著超越前代,同时大幅提升诚实度并降低错误率,并引入动态工作流和努力控制等新功能。
平静的一天,但AI与数学交叉领域取得不错成果。
OpenAI的AI模型解决了80年历史的单位距离问题,反驳了离散几何中的一项核心猜想,展示了AI在数学研究中的突破性能力。
3.1 Pro专为那些简单答案不足以应对的任务而设计。
我们最专业的推理模式现已更新,以解决现代科学、研究和工程挑战。
研究论文指出Deep Think在多个领域的影响力日益增长。
Gemini 3 Flash 以极低的成本提供了为速度而构建的前沿智能。
Qwen团队提出组序列策略优化(GSPO)算法,通过序列级优化解决现有RL算法在长时间训练中的不稳定问题,显著提升训练效率与稳定性,并成功应用于Qwen3模型的大规模RL训练。
去年12月,我们推出了探索性模型QVQ-72B-Preview,但它存在很多问题。今天,我们正式发布视觉推理模型QVQ-Max的第一个版本。该模型不仅能“理解”图像和视频中的内容,还能利用这些信息进行分析和推理以提供解决方案。从数学问题到日常问题,从编程代码到艺术创作,QVQ-Max展示了令人印象深刻的能力。
Qwen团队发布QwQ-32B,一个仅32B参数的模型,通过强化学习在数学、编程等任务上达到与671B参数的DeepSeek-R1相当的性能,并集成智能体能力,展示了强化学习在提升大模型智能方面的巨大潜力。
QwQ-Max-Preview 是 Qwen 系列的新模型,基于 Qwen2.5-Max 构建,专注于深度推理、数学、编程、通用领域及智能体相关任务。该预览版展示了强大的推理能力,未来将推出更新并计划以 Apache 2.0 协议开源。
近年来,大型语言模型(LLM)在数学推理方面取得了显著进步,但仍可能犯计算错误或逻辑错误,导致错误结论。此外,即使最终答案正确,这些模型仍可能编造看似合理的推理步骤,其最终答案建立在有缺陷的计算或推导之上,这削弱了LLM推理过程的可靠性和可信度。因此,自动识别推理过程中的错误对其可扩展监督变得日益重要。过程奖励模型(PRM)作为一种有前景的方法,旨在识别并缓解推理过程中的中间错误。在评估方面,以往研究主要依赖响应级Best-of-N(BoN)评估,即根据PRM从N个候选中选择得分最高的响应。今天,我们发布了一个新的最先进PRM,在构建PRM的未来研究中优于现有开源替代方案。