人工智能护栏如何阻碍进攻性网络安全研究人员的工作
真正值得关注的不是这条新闻本身,而是它可能把「互联网」的竞争焦点推向更大范围的连锁反应。
原文链接:https://techcrunch.com/2026/07/23/how-ai-guardrails-are-impeding-the-work-of-offensive-cybersecurity-researchers/
几个月来,人工智能巨头制定了经过特殊审查的程序和严格的防护措施,以限制恶意黑客对其模型的使用。但这些限制现在阻碍了合法网络防御者以及进攻性网络安全研究人员的工作。
6 月,美国政府对 Anthropic 大肆宣传的人工智能模型 Mythos 和 Fable 实施了出口管制限制。这一举措至少部分是由一份报告推动的,该报告声称可以绕过这些模型的护栏,该护栏旨在防止用户使用它们来构建和执行恶意网络攻击。不管这起事件是否真的是出于对越狱的恐惧,事实是 Anthropic 一再将 Mythos 推销为某种末日网络机器,只能提供给经过仔细审查的用户,即使如此,也有严格的防护措施。
(《神鬼寓言 5》和《神话 5》的出口管制现已取消。《神鬼寓言 5》于 7 月 1 日恢复普遍访问;作为政府审查流程的一部分,《神话 5》仅向经过审查的美国组织重新推出。)这种把关并非《神话》所独有。
Anthropic 及其其他模型和 OpenAI 都提供网络安全研究人员计划,他们可以申请进行审查,如果获得批准,则可以访问网络安全限制较少的模型:OpenAI 的可信网络访问计划和 Anthropic 的网络验证计划。这些护栏受到了广泛的批评,特别是受到研究人员的批评,他们的工作是发现系统中未知的漏洞,并在犯罪分子之前设计出利用它们的方法。著名安全研究员马克·多德 (Mark Dowd) 最近在网络安全播客中表示,“这些随机的大公司对安全方面什么是安全的、什么是不安全的做出武断的决定,这让我感到不太舒服。”多德花了几十年的时间寻找并向西方政府出售“零日”——以前未知的软件缺陷和利用它们的漏洞——而不是向软件制造商报告这些缺陷以便得到修补。政府为漏洞支付高价正是因为它们保持开放状态,这对情报行动很有用。多德承认他的工作可能会让他产生偏见,但他并不孤单。