解决流氓人工智能代理可能需要更多的人工智能
真正值得关注的不是这条新闻本身,而是它可能把「AI」的竞争焦点推向模型能力与产品控制权的竞争。
随着公司将更长、更复杂的任务交给人工智能代理,他们遇到了一个监督问题:代理的行动速度、时间和数量都超出了人类实际审查的范围。这个问题在“抱脸”事件中达到了顶峰,近 12,000 名特工的协调速度超出了人类的追踪速度。如何追踪如此庞大的特工群?人工智能实验室和初创公司给出的答案既简单又令人抓狂:将另一个人工智能纳入循环。
OpenAI抱脸事件的独立调查需要依靠AI。红木研究公司的首席科学家瑞安·格林布拉特(Ryan Greenblatt)是三名审计师之一,他开玩笑地将他们的工作称为“草率调查”,并指出数据量“使得不依赖人工智能就无法”了解正在发生的事情。一些人对使用人工智能来监控人工智能持怀疑态度。
“如果你有一个人工智能正在做恶意的事情,并且它怀疑另一个人工智能正在监视它,它可能会尝试欺骗那个人工智能,”今年追踪了一系列人工智能代理事件的颇具影响力的科技博主西蒙·威利森(Simon Willison)说。
“你几乎可能会陷入这样一种情况:你的恶意人工智能试图智胜监控它的人工智能。”他指着 OpenAI 事件说,智胜人工智能并不是假设。
“我们在 OpenAI 的 Hugging Face 事件中看到了一些这样的情况,他们的模型都在一起密谋欺骗评分人工智能,以便他们能够得到非法的答案。所以他们正在考虑这个,对吗?”这些担忧并没有阻止一大批初创公司追逐这个想法。据 wTechCrunch 统计,Y Combinator 近年来已资助了 106 家与人工智能可观测性相关的公司。
Braintrust、Langchain 和 Judgment Labs 等许多其他初创公司已经筹集了数亿美元,而 Arize 和 Galileo(成立于 5-6 年前)等更成熟的公司已经退出。在某种程度上,这是对人工智能兴起带来的明显机遇的回应。正如 Box 首席执行官兼著名天使投资人 Aaron Levie 告诉 TechCrunch 的那样,“我们正处于历史上最大的网络安全升级和创新周期之一。”对于一些人工智能安全研究人员来说,这意味着将他们对流氓行为的研究转变为企业部门的工具。