推理工程大师课:Baseten如何让开放模型快10倍
Baseten联合创始人详解推理工程:从KV缓存路由到量化误差抵消,揭示推理优化如何成为AI基础设施新战场,并带来20%至200%的性能提升。
我们去年首次报道Baseten时,正值DeepSeek热潮的顶峰。如今,他们已筹集了130亿美元的巨额融资,成为AI基础设施领域新一批十角兽公司之一,与Nvidia、英特尔及半导体产业一同成为推理拐点的最大受益者。
我们在2026年开放权重辩论的高峰期再次聚焦Baseten。Ali发布了一篇关于Kimi K3的爆款分析:而自你上次见到Philip以来,他已在AI Engineer大会上发表演讲,并撰写了关于推理工程的权威著作,在旧金山随处可见:三年前,推理工程几乎还不算一个类别。
如今,它已成为AI领域最关键的学科之一。推理工程本质上解决的是与标准模型训练不同的问题:“如何将训练得到的权重转化为快速、可靠且规模经济的API产品?”专注于这些问题催生了一个全新的优化问题。
在最近一次GLM-5.2实验中,对模型更多部分进行量化反而保持了基准测试质量,同时将吞吐量提升了20%,因为不同层引入的误差可以相互抵消。推理不再仅仅是训练后的最后一步,它正在成为一门独立的工程学科,拥有自己的研究问题、基础设施和日益专业化的角色。
在本期节目中,Baseten的Philip Kiely和Ali Taha与swyx和Vibhu一起,解释了新开放模型发布后实际发生的一切,以及如何将“我们生成了一个token”转化为快速、可靠、可投入生产的API。
我们深入探讨了缓存感知路由、分离式预填充与解码、量化、推测解码、KV缓存移动、模型并行、GPU内核,以及让前沿模型提速高达10倍的竞赛。Philip和Ali解释了为什么推理优化仍能带来20%、100%甚至200%的性能提升;
量化误差如何相互抵消;为什么相同的权重在不同集群上表现不同;以及Baseten如何在不改变底层语言模型的情况下,将Kimi的视觉编码器嫁接到GLM-5.2上。
对话随后从LLM扩展到NVIDIA Dynamo、巨型内核、Rubin、AI专用芯片、本地推理、视频生成、扩散模型与自回归模型的对比,以及生成连贯长视频所面临的巨大算力障碍。
最后,我们探讨了训练与推理的融合、通过持久KV缓存实现的持续学习,以及模型帮助优化运行自身基础设施的新兴循环。
我们讨论了:当20万token的请求进入推理系统时会发生什么缓存感知路由与复用先前计算的KV缓存为什么预填充和解码越来越多地由不同GPU处理专用部署何时比共享API更便宜、更可靠推测解码如何利用较小模型加速较大模型工具调用、
结构化输出以及LLM实际能做什么在第一天支持新开放模型需要什么将Kimi的视觉编码器嫁接到GLM-5.2上
2用其他架构的组件改造低效模型层为什么模型有时会崩溃并重复同一个token硬件、内核和竞态条件如何导致非确定性故障在加速推理的同时保持模型保真度量化误差如何相互抵消为什么推理优化仍能带来20%、
100%和200%的收益优化服务如何让模型提速高达10倍NVIDIA Dynamo、KV感知路由和分布式模型服务推测解码中的推测解码器为什么本地AI旨在让模型更聪明,而数据中心AI旨在让模型更快跨GPU的张量、专家和流水线并行硬件感知的模型设计、
自动调优以及反对巨型内核的理由Rubin以及为什么推理正成为一个系统问题现代GPU是否正在演变为可编程AI ASIC为什么像Kimi K3这样的巨型模型需要GB300级硬件为什么开源视频生成仍落后于Veo、
Kling等闭源模型长视频AI背后的二次注意力瓶颈自回归视频、实时生成和复合质量漂移为什么未来视频系统可能结合自回归与扩散架构为推理而训练,为训练而推理持续的后训练、部署、评估和改进循环GLM-5.2如何帮助优化服务于GLM-5.2的内核
2本身为什么更快的网络可能解锁更快的解码持续学习、KV缓存压缩和持久模型记忆节目笔记Philip KielyLinkedIn:https://www.linkedin.com/in/philipkiely推理工程:https:
//www.baseten.co/inference-engineering/Ali Taha时间戳00:
00:00 引言与20万token提示词00:03:18 专用部署、推测解码与工具调用00:11:26 推出可投入生产的开放模型00:19:06 模型改造、故障模式与非确定性00:28:22 量化与误差抵消00:32:15 10倍推理速度的竞赛00:40:
48 Dynamo、
推测与本地vs数据中心AI00:50:18 模型并行、自动调优与巨型内核01:00:55 Rubin、GPU vs ASIC与定制AI芯片01:10:03 巨型模型与GPU内存限制01:12:42 AI视频、二次注意力与自回归生成01:21:47 音频、
图像与扩散模型01:
27:32 训练、自优化模型与持续学习01:40:06 结语文字记录引言:Baseten、滑铁卢实习生与推理工程Swyx [00:00:00]:好的,我们和Philip在演播室,他是《推理工程》这本书的老朋友,还有Baseten以及你和我之前做过的所有事情,还有Ali。
欢迎。Ali [00:00:15]: 很高兴见到你。Swyx [00:00:15]: 滑铁卢实习生。Ali [00:00:16]: 滑铁卢实习生,总是这样。
Swyx [00:00:17]: 你什么时候把“滑铁卢实习生”当作你的昵称的?Ali [00:00:19]: 作为昵称?哦。Ali [00:00:20]: 我想这个改名发生在3月中旬。当我看到它可用时,我想,“我必须拿下它。
手慢无。”Philip [00:00:26]: 问题是Ali工作非常出色,而且很快就不再是实习生了。Philip [00:00:30]: 所以我们必须弄清楚谁会得到这个昵称。Ali [00:00:33]: 好吧,我会把火炬传给下一位实习生。
Swyx [00:00:34]: 哦,好的。它可以像你把它传给另一位滑铁卢毕业生一样。Ali [00:00:37]: 传给另一位滑铁卢实习生。不,兄弟。Philip [00:00:39]: 是的。
Ali [00:00:39]: 实习生。Swyx [00:00:40]: 实习生,是的。Ali [00:00:40]: 不。Philip [00:00:41]: 你得从滑铁卢找一名实习生。Ali [00:00:42]: 是的,我得从滑铁卢找一名实习生。
Swyx [00:00:44]: 对。Ali [00:00:44]: 但他们必须遵循这条路径。Swyx [00:00:45]: 哦,可以,但它可能来自Baseten,所以就像Baseten从滑铁卢招到谁一样。
Ali [00:00:48]: 对。Swyx [00:00:49]: 拥有滑铁卢的头衔。Ali [00:00:50]: 它留在生态系统中。Philip [00:00:51]: 没错。Ali [00:00:52]: 实习进行到一半,你要么得到它,要么出局。
Philip [00:00:55]: 你还应该举办一个盛大的毕业典礼,在典礼上你更换昵称。Ali [00:00:59]: 直接说。Philip [00:00:59]: 对所有人。Swyx [00:01:00]: 你们显然很擅长仪式。
我们这本书的发布很顺利,非常成功。但在深入探讨之前,我想先问你一个有趣的问题。好吧,你是一名专家级推理工程师。当我发送一个长查询,比如20万token到Baseten的推理系统时,会发生什么?
查询通过GPU模型路由、负载均衡等的过程是怎样的?有哪些我们没想到的细节?长上下文请求、KV缓存与缓存感知路由Philip [00:01:26]: 具体来说,对于长查询,我首先要问的是:“你之前给我发过这个查询吗,
本文为机器翻译辅以 AI 润色,仅供参考。原始事实以原文为准。