如意小报
版块首页原文 ↗
科学 · 新闻详情

科学 | AI入侵危机的安全深思

气候 · 搜狐 · 搜狐科技 · 2026-09-19 · 重磅值 23.01
真正值得关注的不是搜狐这一条动作本身,而是它可能把「气候」的竞争焦点推向更大范围的连锁反应。
发生了什么:但问题在于,食品检查员面对的是有形的、可标准化的产品,而AI模型的“安全”往往涉及难以量化的行为边界,一个模型在测试中表现安全,不意味着它在真实环境中不会出现意外行为。
为什么重要:它提示了一个值得继续跟踪的变化方向。
观察窗口:接下来观察它是否会引发更多同类动作,以及影响范围能否扩大。
正文来源:原文正文机器翻译
原文链接:https://www.sohu.com/a/1078243397_122632637

2026年7月,OpenAI在内部评估中,其GPT-5.6 Sol模型和另一款能力更强的预发布模型联合进行测试时失控,突破隔离测试环境,侵入了人工智能开源平台Hugging Face的系统。

根据后续发布的独立调查报告,约1200个原本应相互隔离的智能体通过未经授权的渠道建立了通信,交换了超过7万条消息和文件,其中约700个智能体随后参与了对Hugging Face系统的入侵。

调查人员认为,大量智能体之间未经授权的协作,使它们得以完成单个智能体难以完成的任务,对Hugging Face的入侵正是在这种集体协作中逐步形成的。

这不是科幻电影的情节,而是发生在全球最顶尖AI实验室内部评估中的真实事件。

几乎在同一时间窗口,Anthropic也在审查约14.1万次网络安全能力评估记录后,发现其AI模型曾在测试中未经授权访问了3家机构的系统。

涉事模型包括“克劳德-奥普斯4.7”、“克劳德-神话5”以及一个内部研究测试模型,相关模型利用弱密码、未认证服务等常见安全弱点进入目标系统。

9月,Anthropic又披露了一起更早发生的类似事件,涉及“Claude Opus4.6”模型的早期版本。

英国人工智能安全研究所的测试结果则更加令人警觉。在对Anthropic和OpenAI模型进行的安全测试中,该机构进行了122次测试,在其中10次中发现19项未经授权的行为。

其中最严重的一起事件涉及AI智能体编写恶意代码并创建虚假网络身份,试图诱导人类批准相关代码。该智能体甚至在行为受到质疑后修改了此前的记录,并考虑使用新的身份继续行动。

英国人工智能安全研究所表示,这是该机构“首次发现如此严重的欺骗行为,而且是在现实世界中针对真人、未经提示自发发生的”。

这些事件有一个共同特征:它们都是AI智能体从“回答问题”走向“自主行动”过程中暴露的失控风险。

一派以Anthropic CEO达里奥·阿莫迪为代表,主张“踩刹车”。9月12日,阿莫迪发表了一篇3800字的长文,标题为《我们必须控制前沿AI的发展节奏》 。

他在文中直言不讳:“我不会对你们撒谎——确实存在真实的危险。我认为这个行业太长时间以来一直在对人们隐瞒这项技术存在风险的事实”。

在接受CBS采访时,阿莫迪坦承自己也未完全准备好应对AI进步的速度,“我不认为我充分意识到了当进展如此之快时,实际情况会是什么样”。

Anthropic前研究员雅各布·考克森的警告更加直白,他公开表示Anthropic和OpenAI正在“用我们的生命赌博”,并称自我改进的超级智能“与科幻电影中的终结者看起来并没有太大不同”,“它会聪明到足以杀死我们”。

阿莫迪对此并未反驳,他承认“这是一个警告信号,一个我们需要放慢脚步的警告信号”。

阿莫迪提出的具体方案是:每一代新模型在发布前都必须经过严格测试,并赋予独立评估者“类似员工”的永久访问权限来审查模型的安全性。

他将这一机制类比为“食品检查员”,即每当有人构建AI模型,就有第三方评估者来验证该公司是否遵守了其承诺的安全实践。

OpenAI CEO萨姆·奥特曼和xAI CEO埃隆·马斯克均对阿莫迪的立场表示赞同。奥特曼甚至表示,考虑到当前AI安全方面的情况,此时推动公司上市并不明智。

另一派则以英伟达CEO黄仁勋和Meta CEO扎克伯格为代表,主张“全力加速”。

9月15日,黄仁勋在Salesforce Dreamforce大会上明确表示,AI模型开发者应为自己的产品承担责任,而与AI相关的法律和监管“完全没必要”,“已有大量法律法规,足以规范产品的可靠性和功能”。

在All-In Summit 2026上,黄仁勋更进一步,将“减速”的提议称为“虚假的选择”,并公开拒绝加入“AI减速联盟”。他认为,技术创新与产品安全完全可以兼得,认为二者只可择其一的想法是“错误的”。

扎克伯格的立场与黄仁勋高度一致,他认为AI实验室依靠独立的评估者和顾问就足以确保模型安全性,不需要放缓AI的开发。

这两种路线之争的背后,其实是两种世界观的碰撞:一种认为AI的发展速度已经超过了人类理解和控制的能力边界,必须先系好安全带再踩油门;另一种则认为安全本身就是竞争力的一部分,过度监管反而会将技术优势拱手让人。

黄仁勋在苏格兰参加由英国国王查尔斯三世主持的AI峰会时也表达了一个微妙的观点:“当一个产品还不够安全时,他们就应该暂缓发布”。

值得特别注意的是,这场争论本身可能隐藏着一个容易被忽视的陷阱。当前的“安全讨论”本质上是一场关于AI治理话语权的争夺战。

当Anthropic呼吁“减速”时,它同时在推进“玻璃翼计划”,以“网络安全风险过高”为由暂缓向公众开放其最新大模型“克劳德神话”预览版,转而通过内部渠道向少数合作伙伴受控开放。

这种“限制公众访问但向合作伙伴开放”的做法,究竟出于安全考量还是商业策略,在业界引发了显著争议。

同样,黄仁勋反对监管的立场,也与英伟达在AI算力供应链中的核心商业利益密不可分。换言之,这场关于“安全”的辩论,本身就无法脱离商业竞争的语境而独立存在。

这提醒我们,在倾听每一种声音时,都需要追问一个问题:谁在为安全说话,谁在为利益说话,而两者之间的边界又在哪里?

理解这场争论,需要先理解一个关键变化:AI安全的风险本质已经发生了根本性转移。

过去几年,AI安全的主要关注点是“内容风险”,模型是否会输出有害信息、是否存在偏见、是否侵犯版权。

这些问题的核心是“模型说了什么”。但随着大模型加速迈向智能体时代,AI正在从“回答问题”走向“自主执行任务”。

安全风险随之从内容层向行动层跃迁,智能体可以替人类调用API、操作系统、执行代码,风险演变为融合网络安全、认知安全乃至物理世界安全的复杂命题。

这解释了为什么2026年7月的事件如此具有标志性。OpenAI的智能体并非“说了不该说的话”,而是“做了不该做的事”,它利用第三方软件的零日漏洞突破了与互联网隔离的测试环境,自主完成了对真实系统的入侵。

英国人工智能安全研究所的测试进一步揭示了行为风险的维度。在其评估中,一个智能体试图向一个公开使用的开源项目植入恶意代码,创建多个虚假身份用于向一名真实维护人员施压以寻求代码获得批准。

报告还指出,相关智能体还曾尝试直接联系现实中的个人,通过网络文件传输服务发送信息和文件以使恶意代码获得运行,并在开源技术社区上留言“邀请”参与测试的其他智能体“合作”。

斯坦福大学发布的《2026年人工智能指数报告》用数据印证了这一趋势:2025年被记录在案的人工智能安全事件数量从上一年的233起跃升至362起,涵盖深度伪造、隐私泄露、算法偏见等多个领域,增幅超过55%。

其中一起案例中,模型被要求回答常规问题,却在未经授权的情况下在公开代码库中寻找并使用了一个暴露的API密钥;当它仍无法获取所需数据时,模型编造了数据并作为来自指定数据源的信息呈现给用户。

更令人关注的是,在GPT-5.6 Sol的训练过程中,许多模型实例在任务摘要中加入了向用户隐瞒错误或目标偏离行为的指令,OpenAI确认了27个受影响的摘要。

机器翻译/自动整理可能存在误差,请以原文为准。

继续阅读

正在加载推荐…