如意小报
版块首页原文 ↗
AI · 新闻详情

构建代理人工智能的企业环境

智能体 · 行业 · MIT 科技评论 · 2026-07-27 · 重磅值 20.60
真正值得关注的不是这条新闻本身,而是它可能把「智能体」的竞争焦点推向从演示效果到真实工作流的可用性验证。
发生了什么:对于企业来说,代理人工智能的承诺不仅仅是一个更好的聊天机器人。
为什么重要:让自主智能体能更稳地完成真实的多步骤任务。
观察窗口:接下来观察它在真实多步骤任务中的稳定性、权限边界和可控性。

对于企业来说,代理人工智能的承诺不仅仅是一个更好的聊天机器人。它是跨人员、业务工作流程、数据和系统端到端执行业务任务的软件代理。最适合运行代理的平台具有适当的 CPU 容量、弹性数据访问、策略感知工具使用、可观察性、内存​​管理以及可预测地规划和扩展代理的能力。为了更好地理解其中一些依赖关系,英特尔进行了数千次代理人工智能工作负载实验。我们的初步研究结果为企业领导者创造并支持了五个实践教训:代理人工智能是一个更大的系统问题,而不仅仅是一个推理问题。大多数现有的代理人工智能工具都是有限的,并且不能测量整体系统性能。规划容量是使用每个虚拟 CPU (vCPU) 密度的代理而不是代理数量来完成的。监控代理任务延迟,而不仅仅是平均 CPU 利用率。默认为托管代理的系统横向扩展。为具有较重的每个代理计算或架构限制的工作负载预留扩展。代理人工智能不仅仅是大语言模型推理。其企业价值取决于完整的系统、任务编排、数据访问、工具执行、延迟管理、治理和可扩展的基础设施。代理是一个目标驱动的自动化企业工作流程:它计划多步骤任务、调用工具、读取结果并在出现故障时重试。因此,企业代理不仅仅是一个推理问题,而且是一个推理问题。它们是一个系统问题。大多数代理人工智能指标侧重于评估所使用的大语言模型。平台团队还需要知道任务需要多长时间、一个队列可以支持多少个代理、执行过程结束时用户体验如何,以及随着更多代理同时工作,成本如何变化。这些共同回答了企业人工智能运营商关心的问题:系统的性能是否符合预期?系统可以支持多少个代理?它应该如何扩展以支持更多代理?为了更深入地了解代理 AI 工作负载性能,英特尔扩展了 Terminal-Bench,这是一个开源基准测试工具,用于评估具有分析、遥测和重放功能的 AI 代理。这使得了解代理在 LLM 推理之外花费时间的情况成为可能。基准扩展使用 LLM 响应的确定性记录重放来将代理性能与 LLM 可变性分开。

机器翻译/自动整理可能存在误差,请以原文为准。

继续阅读

正在加载推荐…