AI 见闻
精选· 重要性 3/5

为智能体AI构建企业级运行环境

MIT Technology Review — AI··Keegan Sheedy, Lucas Melo·约 8 分钟阅读
中文导读

英特尔通过数千次实验总结出企业部署智能体AI的五大实践教训,强调智能体AI是一个系统问题而非单纯的推理问题,并提出了以代理密度、任务延迟等为核心的新监控指标。

赞助为智能体AI构建企业环境企业将通过一个完整的智能体AI环境取得成功,在该环境中,智能体能够大规模地规划、检索、记忆并可靠地行动。由英特尔提供对企业而言,智能体AI的承诺远不止是一个更好的聊天机器人。

它是能够跨人员、业务工作流、数据和系统端到端执行业务任务的软件智能体。最适合运行智能体的平台应具备适当的CPU容量、弹性的数据访问、策略感知的工具使用、可观测性、内存管理,以及可预测地规划和扩展智能体的能力。

为了更好地理解这些依赖关系,英特尔进行了数千次智能体AI工作负载实验。我们的初步发现为企业领导者总结并支持了五个实践教训:- 智能体AI是一个更大的系统问题,而不仅仅是推理问题。- 大多数现有的智能体AI框架是有限的,无法衡量整体系统性能。

- 容量规划应基于每虚拟CPU(vCPU)的智能体密度,而非智能体数量。- 监控智能体任务延迟,而非仅平均CPU利用率。- 托管智能体的系统默认采用横向扩展。对于每智能体计算量更重或存在架构约束的工作负载,则保留纵向扩展。

超越推理:智能体作为工作流自动化智能体AI不仅仅是LLM推理。

其企业价值取决于完整的系统、任务编排、数据访问、工具执行、延迟管理、治理和可扩展的基础设施。智能体是一个目标驱动的自动化企业工作流过程:它规划多步骤任务、调用工具、读取结果,并在失败时重试。因此,企业智能体不仅仅是一个推理问题;

它们是一个系统问题。定义何为良好大多数智能体AI指标侧重于评估所使用的LLM。平台团队还需要知道任务耗时多久、一个集群能支持多少智能体、用户在执行过程结束时的体验如何,以及随着更多智能体同时工作,成本如何变化。

一个更有用的企业视角关注六个指标:- 任务成功率- 每任务成本- 每任务时间- 任务吞吐量- 智能体密度(每vCPU的智能体数)- 延迟这些指标共同回答了企业AI运营者关心的问题:系统是否按预期运行?

系统能维持多少智能体?应如何扩展以支持更多智能体?建立在坚实基础上为了更深入地了解智能体AI工作负载的性能,英特尔扩展了Terminal-Bench,这是一个用于评估AI智能体的开源基准测试框架,具备性能分析、遥测和回放能力。

这使得理解智能体在LLM推理之外的时间消耗成为可能。

该基准测试扩展使用LLM响应的确定性记录-回放,将智能体性能与LLM的变异性分离。LLM响应被记录一次,并在各次运行中完全相同地回放,从而减少运行间差异,为比较提供更可靠的基础。

所使用的Terminal-Bench任务组合故意设计得广泛,包括编译、测试、数据库操作、布尔逻辑、解释、光线追踪、压缩、线性代数、视频转码和机器学习训练。这种多样性使得发现更贴近真实企业环境。

智能体AI的三个维度部署智能体AI应分三个阶段进行:按智能体密度而非数量规划:第一条规模规则是根据可用算力标准化智能体数量。智能体密度(以每vCPU的智能体数衡量)是饱和的主要信号。

例如,如果密度相同,8-vCPU系统上的10个智能体和16-vCPU系统上的20个智能体表现相似。这为架构师提供了一种可移植的方式来比较不同实例大小和处理器代际的容量。正确的密度还取决于业务目标。

交互式副驾驶和面向用户的助手应倾向于较低密度,因为响应时间至关重要。IT工作流等批处理工作负载通常可以运行在更高密度下。这为团队提供了一种围绕服务级别目标和总拥有成本调整集群的实用方法。

智能体AI需要一种新的可观测性形式:平均CPU利用率对于智能体工作负载而言是一个弱的主要性能监控信号。智能体通常在等待模型响应和进行短时计算密集型工作之间交替。由于这种“突发”模式,即使这些突发导致队列并减慢用户体验,平均利用率也可能看起来可接受。

任务延迟(P95)是一个更好的领先指标。它能在平均任务持续时间明显恶化之前,显示工作流何时开始等待。一个实用的运营模型是首先对P95延迟发出警报,然后通过查看持续任务持续时间来确认问题。默认横向扩展:横向扩展增加更多系统,提高总智能体容量;

而纵向扩展为单个系统增加核心或内存,适用于计算突发更重的智能体。我们的测试数据表明,横向扩展通常是更好的默认选择。这与智能体通常半独立且每智能体突发量适中的事实一致,它能提升整体性能、支持高可用性、通常降低成本,并随着平台增长更容易保持目标智能体每vCPU比率。

当智能体需要更重的并行计算、共享状态限制分区、内存局部性重要或存在许可约束时,则进行纵向扩展。考虑业务影响:智能体AI将首先在哪里创造业务价值?

获得生产级结果的组织正在围绕已具有编码规则和可衡量服务级别的工作流包裹自动化层:代码创建、回归测试农场、工单分类、市场分析和安全审查。

因此,智能体AI的理想企业角色不是追求新奇的实验用户,而是负责任的领导者,他们必须缩短周期时间、提高生产力、保护服务质量、执行政策,并在考虑成本的情况下扩大采用。智能体AI的价值在于帮助企业跨团队、系统、数据和流程完成实际工作。

对企业而言,优先事项不仅仅是更好的模型性能;而是创建一个可靠的环境,让AI智能体能够支持业务工作流、提高生产力、在治理要求内运营,并随着采用增长而扩展。在实践中,智能体AI的成功取决于正确的基础设施,以提供一致的结果、管理成本、保持控制,并自信地从试点过渡到生产。

此内容由英特尔制作。并非由MIT Technology Review编辑团队撰写。深度挖掘人工智能一家初创公司声称突破了阻碍LLM的瓶颈Subquadratic现已分享其新模型的更多细节。但一些人仍持怀疑态度。

Anthropic发现了一个隐藏空间,Claude在其中思考概念一项新技术让该公司比以往更深入地探究LLM的奇特工作机制。Claude Science是Anthropic的最新旗舰产品该公司正加倍投入AI用于科学。

Google DeepMind担心当数百万智能体开始交互时会发生什么该公司呼吁更多科学家研究多智能体系统的风险。保持联系获取来自MIT Technology Review的最新更新发现特别优惠、热门故事、即将举办的活动等。

原文出处
Building the enterprise environment for agentic AI

本文为机器翻译辅以 AI 润色,仅供参考。原始事实以原文为准。

相关阅读