如意小报
版块首页原文 ↗
科技 · 新闻详情

核破坏恶意软件基准测试大多数前沿人工智能模型

网络安全 · SecurityWeek · Security Week · 2026-07-23 · 重磅值 79.51
真正值得关注的不是SecurityWeek这一条动作本身,而是它可能把「网络安全」的竞争焦点推向更大范围的连锁反应。
发生了什么:SentinelOne 的新基准建立在 Fast16 案例的基础上,显示了哪些人工智能模型可以维持恶意软件调查,哪些不能。
为什么重要:它提示了一个值得继续跟踪的变化方向。
观察窗口:接下来观察它是否会引发更多同类动作,以及影响范围能否扩大。

SentinelOne 使用其对最近记录的 Fast16 恶意软件的调查作为测试用例,为前沿人工智能模型建立了所谓的第一个长期逆向工程基准。

SentinelOne 的 SentinelLabs 在 4 月份详细介绍了 Fast16,它是一种 2005 年的 Windows 恶意软件,旨在干扰 LS-DYNA,该工程软件似乎已被伊朗用作其核武器开发计划的一部分。与它之前的臭名昭著的 Stuxnet 类似,Fast16 可能是由美国开发的,用于破坏伊朗的核计划。

SentinelLabs 的研究人员测试了 OpenAI 的 GPT-5.5 和最新的 GPT-5.6 Sol 模型、Z.ai 的 GLM-5.2 和 Anthropic 的 Opus 4.x,看看哪个可以对 Fast16 恶意软件进行彻底调查。

SentinelLabs 的基准测试不是对孤立任务的模型进行评分,而是跟踪模型是否能够在八个升级阶段中维持可信的调查,因为新的证据一再与其先前的结论相矛盾。

GPT-5.6 Sol 是唯一一个完成所有八个阶段的测试模型,在不同的推理努力设置下进行了三个单独的运行。广告。滚动以继续阅读。

GPT-5.5、GLM-5.2 以及 Opus 4.7 和 4.8 产生了可靠的本地分析,但陷入停滞。

GPT-5.5 从未度过初始阶段,而 Opus 模型倾向于在缺陷解决之前就宣布工作已完成。

SentinelLabs 将这种差距归因于其所描述的“项目规模恢复”,而不是技术技能或洞察力。这是模型撤回未经证实的结论、追踪依赖于该结论的下游所有内容、修复根本原因并在余下的调查中进行纠正的能力,而不仅仅是修补直接错误。

SentinelLabs 研究人员得出的结论是,人类监督仍然至关重要,因为即使是 GPT-5.6 Sol 也犯了重大技术错误。研究人员解释说:“高级逆向工程师仍然至关重要。” “即使是最强大的运行也会犯语义错误,接受薄弱的质量控制,并过早地声称准备就绪。我们评估当前作为监督调查机构的最佳用途,由人类分析师定义目标,暴露盲点并保留最终的出版权。” Eduard Kovacs (@EduardKovacs) 是 SecurityWeek 的高级执行编辑。

机器翻译/自动整理可能存在误差,请以原文为准。

继续阅读

正在加载推荐…