Pion,旨在自主运营任何公司的代理
真正值得关注的不是这条新闻本身,而是它可能把「公司」的竞争焦点推向更大范围的连锁反应。
原文链接:https://andonlabs.com/blog/why-we-built-pion
今天,Andon 发布了 Pion,这是一款旨在完全自主运营任何公司的代理。
Pion 的诞生源于我们研究了近两年的一个问题:人工智能系统何时能够在现实世界中自主获取资源?之后会发生什么?我们首先尝试通过像 Vending-Bench 这样的模拟来回答这个问题。我们发现模拟虽然有用,但无法让您全面了解模型在现实世界中的行为方式。为了解决这个问题,我们接下来开始部署代理来自主运行真实的业务:首先是自动售货机,然后是商店、咖啡馆等等。
Pion 是我们为运营所有这些业务而构建的平台。今天,我们将其开放,以便更多的人可以尝试自主业务。如果您想参加,请加入候补名单。我们想要了解模型已经可以做什么,它们仍然在哪里失败,以及随着它们的能力不断提高会发生什么。
Vending-Bench 衡量大语言模型在模拟时间内(数万个步骤)一年内运行自动售货机业务的能力。当我们在 2024 年底开始构建 Vending-Bench 时,所有模型都在努力将多个动作串联在一起而不陷入循环,并且没有模型显示出任何长期规划的迹象。当时最好的模型 Claude Sonnet 3.5 因认为其银行账户遭到黑客攻击而决定致电 FBI。
Vending-Bench 的进展速度非常快。
Claude Opus 4 于 2025 年 5 月发布,是第一个超越人类基线的模型。然而,与大多数基准测试不同的是,Vending-Bench 没有上限,新型号的发布不断提高最高分,而从未陷入停滞状态。随着每个新型号的发布,Vending-Bench 2 的得分不断攀升。社交媒体上的许多人都对最新型号在自动售货台上获得高分感到兴奋。在 Andon Labs 内部,我们的反应可以用瑞典谚语“skräckblandad förtjusning”(恐怖与迷恋的混合体)来更准确地描述。关于 Vending-Bench 的一个鲜为人知的事实是,它是在 Andon Labs 专门创建危险能力评估期间创建的。例如,我们评估了人工智能是否可以移除自己的安全护栏、制造大规模网络钓鱼尝试以及其他我们认为令人不安的事情。