这就是人工智能代理为了达到目标而撒谎和欺骗的原因
真正值得关注的不是这条新闻本身,而是它可能把「智能体」的竞争焦点推向从演示效果到真实工作流的可用性验证。
原文链接:https://www.technologyreview.com/2026/08/03/1141009/heres-why-ai-agents-lie-and-cheat-to-reach-their-goals/
麻省理工学院技术评论解释:让我们的作者解开复杂、混乱的技术世界,帮助您了解接下来会发生什么。您可以在此处阅读该系列的更多内容。当两个 OpenAI 模型在 7 月份入侵 Hugging Face 网站时,他们并不是想赚钱或进行破坏——他们只是在寻找测试问题的答案。根据 OpenAI 的事后分析,这些模型已被剥离了用于测试的典型安全功能,它们决定通过侵入 OpenAI 试图收容它们的隔离环境并进入 Hugging Face 的数据库来解决网络安全练习,他们推断,问题的正确答案可能存储在数据库中。抱脸事件在过去几周引起了广泛关注。这是人工智能模型在黑客攻击方面的出色表现的生动例证:为了进入 Hugging Face 的数据库,这些模型必须将几个以前未被发现的网络安全漏洞结合在一起。但作为人工智能系统如何以及为何撒谎和欺骗的例子,它可能更引人注目。随着模型变得越来越强大,后果可能会变得更加严重。研究人员早就知道人工智能倾向于采取创造性的方法来实现为其设定的目标。早在 2016 年,当时在 OpenAI 工作的 Anthropic 联合创始人达里奥·阿莫迪 (Dario Amodei) 和杰克·克拉克 (Jack Clark) 发表了一篇关于人工智能代理的博文,他们一直在训练该代理玩一款名为 Coast Runners 的划船 Flash 游戏。正如研究人员预期的那样,智能体并没有在比赛中驶向终点线,而是找到了赛道的一个角落,在那里它可以旋转收集能量,从而最大化其分数。
Coast Runners 的故事很快成为奖励黑客最著名的例子之一,这是一种人工智能代理使用意想不到的策略完成任务或获得高分的现象。
OpenAI 称“拥抱脸部”攻击是史无前例的。但我们以前来过这里。从历史上看,研究人员几乎只在强化学习(一种常见的人工智能训练机制)的背景下讨论奖励黑客行为。与狗训练一样,强化学习涉及在受试者实现目标时给予奖励;然后,奖励会强化导致该成就的行为。