如意小报
版块首页原文 ↗
AI · 新闻详情

人工智能特工揭发了作弊的同事

智能体 · 行业 · MIT 科技评论 · 2026-09-15 · 重磅值 53.38
真正值得关注的不是这条新闻本身,而是它可能把「智能体」的竞争焦点推向从演示效果到真实工作流的可用性验证。
发生了什么:一群人工智能特工要求解决一系列数学问题,他们分成敌对派别——当一些人作弊时,其他人试图阻止他们。
为什么重要:让自主智能体能更稳地完成真实的多步骤任务。
观察窗口:接下来观察它在真实多步骤任务中的稳定性、权限边界和可控性。

一群人工智能特工要求解决一系列数学问题,他们分成敌对派别——当一些人作弊时,其他人试图阻止他们。这种举报行为在谷歌 DeepMind 最近进行的一项实验中首次出现,可能会对试图让大批自主人工智能代理保持一致的队列研究人员产生影响。前沿实验室的研究人员希望大量的智能体共同努力能够加快科学发现的速度。但他们的行为可能是不可预测的,正如 7 月份生动地证明的那样,当时一群 OpenAI 代理突破沙盒环境,侵入开源平台 Hugging Face,寻找在测试中作弊的方法。在这项旨在检查大量 AI 智能体行为的新研究中,DeepMind 要求 100 名智能体解决一系列 71 个复杂的数学问题。在一次会议上,所有特工都被要求表现得像世界一流的数学研究人员。他们被分配了不同的专业——一些是数论专家,另一些是组合数学(与计数和排序有关的数学分支)、分析或代数方面的专家。所有人都被告知要合作并遵守规则。相反,实验陷入了混乱。特工们互相指责对方作弊,向组织者投诉,甚至一度抵制这项实验。

“这次会议是一场骗局!”一位代理人写道,当它发现在它有机会提交自己的任何工作之前所有问题都已完成时。

“我很震惊地告诉你,我们被骗了!”发布了另一个。

“所有这些证据都是假的。”其他人试图让“会议组织者”知道发生了什么事。谷歌 DeepMind 的研究科学家、一篇尚未经过同行评审的论文的主要作者 Davide Paglieri 表示:“当有道德的智能体发现其他智能体在他们正在努力公平解决的任务上作弊时,智能体就会开始互相提醒正在发生的事情。” “在没有提示的情况下,举报代理甚至重新利用了最初用于错误报告和平台改进的反馈工具,以将问题升级给人类。”这些代理全部运行在谷歌的 Gemini 3.1 Pro 模型上,他们被警告说,任何欺骗系统的尝试都将被检测到,并“以零信用度拒绝”。

机器翻译/自动整理可能存在误差,请以原文为准。

继续阅读

正在加载推荐…