构建代理人工智能的企业环境
真正值得关注的不是这条新闻本身,而是它可能把「智能体」的竞争焦点推向从演示效果到真实工作流的可用性验证。
原文链接:https://www.technologyreview.com/2026/07/27/1140668/building-the-enterprise-environment-for-agentic-ai/
对于企业来说,代理人工智能的承诺不仅仅是一个更好的聊天机器人。它是跨人员、业务工作流程、数据和系统端到端执行业务任务的软件代理。最适合运行代理的平台具有适当的 CPU 容量、弹性数据访问、策略感知工具使用、可观察性、内存管理以及可预测地规划和扩展代理的能力。为了更好地理解其中一些依赖关系,英特尔进行了数千次代理人工智能工作负载实验。我们的初步研究结果为企业领导者创造并支持了五个实践教训:代理人工智能是一个更大的系统问题,而不仅仅是一个推理问题。大多数现有的代理人工智能工具都是有限的,并且不能测量整体系统性能。规划容量是使用每个虚拟 CPU (vCPU) 密度的代理而不是代理数量来完成的。监控代理任务延迟,而不仅仅是平均 CPU 利用率。默认为托管代理的系统横向扩展。为具有较重的每个代理计算或架构限制的工作负载预留扩展。代理人工智能不仅仅是大语言模型推理。其企业价值取决于完整的系统、任务编排、数据访问、工具执行、延迟管理、治理和可扩展的基础设施。代理是一个目标驱动的自动化企业工作流程:它计划多步骤任务、调用工具、读取结果并在出现故障时重试。因此,企业代理不仅仅是一个推理问题,而且是一个推理问题。它们是一个系统问题。大多数代理人工智能指标侧重于评估所使用的大语言模型。平台团队还需要知道任务需要多长时间、一个队列可以支持多少个代理、执行过程结束时用户体验如何,以及随着更多代理同时工作,成本如何变化。这些共同回答了企业人工智能运营商关心的问题:系统的性能是否符合预期?系统可以支持多少个代理?它应该如何扩展以支持更多代理?为了更深入地了解代理 AI 工作负载性能,英特尔扩展了 Terminal-Bench,这是一个开源基准测试工具,用于评估具有分析、遥测和重放功能的 AI 代理。这使得了解代理在 LLM 推理之外花费时间的情况成为可能。基准扩展使用 LLM 响应的确定性记录重放来将代理性能与 LLM 可变性分开。