LinkedIn 计划明年不扩张 AI 数据中心,通过效率提升控制成本
LinkedIn 决定本财年不扩大 AI 数据中心投资,通过优化现有 GPU 使用效率来满足增长需求,这在大规模 AI 投资热潮中独树一帜,引发行业对可持续性的思考。
与许多大型科技平台不同,LinkedIn 决定本财年不会大举投资扩张其 AI 数据中心。这家专业社交网络的高管告诉《连线》,公司计划保持 GPU 投资稳定,其计算和存储规模也将维持不变。该支出计划适用于 LinkedIn 上个月开始、明年 6 月结束的财年。
公司表示,之所以能避免在 AI 硬件上大笔支出,是因为过去六个月找到了将现有 GPU 使用效率提高一倍的方法。LinkedIn 的计划仍可能因 AI 硬件需求快速变化而落空,但高管称公司已考虑到内存芯片价格飙升。
LinkedIn 工程首席技术官 Erran Berger 表示:“我们设定的目标之一是,在将更多计算密集型功能投入生产的同时,尽量保持计算规模持平或尽可能接近持平。在当今世界,这是一个相当大胆的声明。
”Berger 和 LinkedIn 基础设施首席技术官 Raghu Hiremagalur 表示,他们希望谨慎支出,新的限制将激励工程团队在开发 LinkedIn 计划推出的众多新生成式 AI 功能时更具创造力。
Berger 认为,效率提升会随时间累积,使 LinkedIn 在未来增加预算时能从数据中心扩张中获得更大收益。Hiremagalur 说:“我真的想强调,对于我们这样规模的公司来说,声称全年不增加存储和计算规模绝非易事,但实现这一目标需要大量工作。
”OpenAI、Meta 和 Google 等公司正四处筹集资金,并通过意想不到的合作来建造、装备和运营装满最新芯片的大型数据中心。劳动力和零部件短缺阻碍了许多项目,许多企业不得不限制用户使用某些 AI 工具。
但人们也越来越质疑对 AI 的持续投资是否可持续。拥有超过 13 亿用户的 LinkedIn 或许是迄今为止通过逆势扩张来公开回应支出担忧的最大企业。
“这对行业来说是令人鼓舞的,”Principal Venture Partners 管理合伙人、服务器制造商 HP 董事会成员 Songyee Yoon 表示,“这表明 AI 正开始从实验转向生产纪律。
获胜的公司将不仅仅是那些在基础设施上投入最多的公司。”
拥有自己的数据中心2016 年微软收购 LinkedIn 几年后,公司曾尝试迁移到母公司的 Azure 云服务,但将庞大的社交网络塞进通用数据中心在经济上不合理。“微软 Azure 增长迅猛,客户需求爆棚,同时 LinkedIn 也飞速增长,”Hiremagalur 说。
2022 年,LinkedIn 全力投入其在俄勒冈州、得克萨斯州和弗吉尼亚州的数据中心。这种所有权让 LinkedIn 对其技术的每个细节拥有巨大控制权,为适应新时代的现实做好了准备。
大约在同一时间,LinkedIn 开始开发基于 AI 的助手,帮助用户撰写消息、寻找工作和招聘候选人。这项努力并不便宜。“我们网站上的每次查询成本都在随时间增加,”Hiremagalur 说,并补充说 LinkedIn 存储的数据量每年翻倍。
“这是不可持续的。”LinkedIn 开始优化 AI 管道的每个阶段的数据中心使用,从训练模型到响应用户查询。Hiremagalur 的团队开发了测量工具来了解各个团队使用了多少计算和存储,然后建立了一个系统,更有效地将项目分配给数据中心的计算机,以减少闲置时间。
“我们在训练方面的 GPU 分配效率和利用率是我见过最好的,”Hiremagalur 说,使用率超过 95%。LinkedIn 还使用蒸馏等技术从较大的 AI 模型训练较小的模型。
对于其职位推荐工具,一个模型从两个更大的模型学习,既能识别相关职位空缺,又能预测哪些用户最可能点击。Berger 表示,较小的模型运营成本更低,但不会牺牲质量。“人们正在发现以前未能成功找到的工作,因为模型很好地理解了他们的愿望,”他说。
用于在用户信息流中选择展示哪些帖子的模型最初运营成本也很高,但 LinkedIn 找到了“一种成本效益合理的方式”来运行它,Berger 说。他提到公司进行了数十项改进,例如简化模型训练、重用早期推荐信息以及更好地平衡 CPU 和 GPU 之间的工作负载。
LinkedIn 甚至重新设计了 Nvidia 处理器上的一些基础软件,使其能够处理超出设计范围的任务,并调整了其他软件,让任务在 CPU 上运行,而不是在更昂贵、更难采购、耗电更多的 Nvidia GPU 上运行。
总体而言,LinkedIn 估计其效率工作在过去 12 个月节省了约 2400 万美元,相当于大约 1100 个 GPU 全年无休运行一年。LinkedIn 高管承认,对于年销售额 180 亿美元的公司来说,这笔节省不算多。
但 Hiremagalur 表示,“工艺”和释放资源带来的“敏捷性”也很重要。工程师可以更快地开展下一个项目并集成更多 AI 功能,而无需增加 LinkedIn 的计算规模。
Berger 认为,LinkedIn 能够在控制成本的同时提供更好的职位和候选人结果,并为微软创造财务回报。“我们应该能够通过部署更大的模型、进行更深入的推理,并且如果可能的话以更低的成本来提供更好的质量,”他说。
尽管支出持平,LinkedIn 的数据中心并未停滞不前。公司已承诺购买新服务器,以便在未来几个月内随着机器老化或故障进行升级。但公司通过提前购买锁定了一些节省。“所有这些硬件的成本都飙升了,”Hiremagalur 说,并指出一些服务器在过去几个月价格翻了三倍。
“这太疯狂了。”LinkedIn 的效率驱动是更广泛趋势的一部分,有时被称为“tokenomics”——更深入地分析使用生成式 AI 工具的成本。
“企业正从‘多买’时代进入‘多做’时代,”帮助企业在咨询公司 Gartner 制定 AI 云策略的 Chirag Dekate 说。“直到现在,口号一直是‘多买多省’。但多买只会增加成本。
”Dekate 表示,他最近看到一些对基础设施控制力不如 LinkedIn 的小企业找到了自己的降本方法。它们清理了未使用的软件并裁员,从比传统提供商更实惠的所谓“neocloud”购买数据中心空间,并为任何给定项目采用成本最低的 AI 模型。
他有些担心,如果 LinkedIn 和其他公司引入太多财务限制,可能会碰壁,因为对更多计算和存储的需求是不可避免的。“在某个时候,必须有所让步,”Dekate 说。“要么你必须在 AI 雄心方面妥协,要么你必须……”