核破坏恶意软件基准测试大多数前沿人工智能模型
真正值得关注的不是SecurityWeek这一条动作本身,而是它可能把「网络安全」的竞争焦点推向更大范围的连锁反应。
原文链接:https://www.securityweek.com/nuclear-sabotage-malware-benchmark-trips-up-most-frontier-ai-models/
SentinelOne 使用其对最近记录的 Fast16 恶意软件的调查作为测试用例,为前沿人工智能模型建立了所谓的第一个长期逆向工程基准。
SentinelOne 的 SentinelLabs 在 4 月份详细介绍了 Fast16,它是一种 2005 年的 Windows 恶意软件,旨在干扰 LS-DYNA,该工程软件似乎已被伊朗用作其核武器开发计划的一部分。与它之前的臭名昭著的 Stuxnet 类似,Fast16 可能是由美国开发的,用于破坏伊朗的核计划。
SentinelLabs 的研究人员测试了 OpenAI 的 GPT-5.5 和最新的 GPT-5.6 Sol 模型、Z.ai 的 GLM-5.2 和 Anthropic 的 Opus 4.x,看看哪个可以对 Fast16 恶意软件进行彻底调查。
SentinelLabs 的基准测试不是对孤立任务的模型进行评分,而是跟踪模型是否能够在八个升级阶段中维持可信的调查,因为新的证据一再与其先前的结论相矛盾。
GPT-5.6 Sol 是唯一一个完成所有八个阶段的测试模型,在不同的推理努力设置下进行了三个单独的运行。广告。滚动以继续阅读。
GPT-5.5、GLM-5.2 以及 Opus 4.7 和 4.8 产生了可靠的本地分析,但陷入停滞。
GPT-5.5 从未度过初始阶段,而 Opus 模型倾向于在缺陷解决之前就宣布工作已完成。
SentinelLabs 将这种差距归因于其所描述的“项目规模恢复”,而不是技术技能或洞察力。这是模型撤回未经证实的结论、追踪依赖于该结论的下游所有内容、修复根本原因并在余下的调查中进行纠正的能力,而不仅仅是修补直接错误。
SentinelLabs 研究人员得出的结论是,人类监督仍然至关重要,因为即使是 GPT-5.6 Sol 也犯了重大技术错误。研究人员解释说:“高级逆向工程师仍然至关重要。” “即使是最强大的运行也会犯语义错误,接受薄弱的质量控制,并过早地声称准备就绪。我们评估当前作为监督调查机构的最佳用途,由人类分析师定义目标,暴露盲点并保留最终的出版权。” Eduard Kovacs (@EduardKovacs) 是 SecurityWeek 的高级执行编辑。