如意小报
版块首页原文 ↗
科技 · 新闻详情

GPT-6正式发布 OpenAI:欢迎来到AGI时代

互联网 · cnBeta · cnBeta · 2026-09-04 · 重磅值 100.00
真正值得关注的不是cnBeta这一条动作本身,而是它可能把「互联网」的竞争焦点推向更大范围的连锁反应。
发生了什么:万众期待的GPT-6 Astra和GPT-6 Astra Pro正式发布!
为什么重要:它提示了一个值得继续跟踪的变化方向。
观察窗口:接下来观察它是否会引发更多同类动作,以及影响范围能否扩大。
正文来源:原文正文机器翻译
原文链接:https://www.cnbeta.com.tw/articles/tech/1576398.htm

主题 硬件 Apple Google iPhone 科学探索 人物 手机 游戏 视点·观察 阿里云 微软 通信技术 Android 软件和应用 SONY 索尼 the United States美国 Apple iPad Windows Phone Intel英特尔 腾讯 HTC 安全 Mozilla FireFox 小米科技 百度 通信运营商 媒体播放器 / 视频网站 BlackBerry 黑莓 网络应用 / Web Apps Google Chrome Microsoft XBOX 硬件 - 上网本 / 平板电脑 / 超极本 电子商务 - B2C / B2B Lenovo 联想 LG Yahoo! 雅虎 AMD SNS 社交网络 诺基亚 Windows 7 Huawei 华为 中国移动 中国联通 中国电信 更多...

万众期待的 GPT-6 Astra 和 GPT-6 Astra Pro 正式发布!GPT-6 Astra是世界上最智能、最协调的模型,为Computer use、Browser Use、软件工程、网络安全、科学和专业工作树立了新的标杆。

据介绍,Astra是OpenAI历史上规模最大的训练任务,在得州Stargate园区动用超过 10万块GPU 完成了预训练。

相当于 GPT-5.6 Sol的2.5倍,跟刚刚发布的Fable 5.1持平 。

GPT-6 Astra这次最核心的变化,是从“回答问题”继续向“直接完成工作”推进。

它不只能生成一段文字或代码,还可以操作电脑和浏览器,进入不同软件执行多步骤任务,最后交付可以直接使用的文档、表格、演示文稿、网站甚至工程项目。

其中,ARC-AGI-3是一项专门考验大模型适应陌生环境能力的测试,不给规则说明,直接把模型扔进从未见过的二维游戏里,让它边玩边摸索通关方法。

这个分数意味着,面对从未见过、也没有现成解法的问题, Astra已经表现出很强的自主探索和规则学习能力 。

不过,这一成绩使用了OpenAI的Responses API Harness运行框架。

OpenAI称,这套Harness调整了两项设置,让测试更接近真实Agent的使用方式,但并未针对ARC-AGI-3进行专项优化。

因此,99.9%不完全是基础模型的成绩,也包括记忆管理和Agent运行框架带来的增益。

在Terminal-Bench 4.0上,Astra取得57.7%,超过Fable 5.1的55.8%和GPT-5.6 Sol的37.3%。

在DeepSWE v1.1上,Astra得到74.1%,高于Sol的72.7%和Fable 5.1的67.4%。

在高难数学测试FrontierMath Tier 4 v2上,它拿到97.6%;研究生级科学问答GPQA Diamond达到96%,略高于Gemini 3.8 Flash的95.3%。

更突出的变化,是Astra把代码能力与Computer Use结合了起来,不只生成代码,还能进入终端和开发工具执行、测试、发现问题,再继续修改。

在 Agents’ Last Exam 上,Astra取得59.3%,超过GPT-5.6 Sol的53.6%和Claude Opus 5的55.5%。

这项测试把它放进真实的电脑环境中,让它同时操作软件、终端和文件,完成科研、工程、财务等领域的长流程任务,并根据最终交付物判分。

而在更贴近真实办公流程的 AutomationBench 上,Astra的成绩从GPT-5.6 Sol的18.1%提高到41.4%,也超过了Fable 5.1(31%)。

OSWorld 2.0考察的则是更直接的电脑操作能力。在离线测试中,Astra获得72.6%,GPT-5.6 Sol为65.7%。

Astra完成单项任务平均需要约40分钟,Sol则需要约75分钟,耗时减少约47%。

准确率提高的同时,完成任务所需的时间也在缩短。这也变相解释了Astra的高定价。

OpenAI认为,相比每百万Token多少钱,真正有意义的指标是完成一项任务需要多少钱。

在发布会上,Greg Brockman对此也谈到,一个模型单次调用更贵,但如果能减少返工,用更少步骤完成整项工作,总成本反而可能更低。

它在ExploitBench上获得满分,在ExploitGym上从Sol的30.3%提高到42.4%。

面对近三个月公开的新漏洞,Astra的成功率为39%,而Sol只有5.5%。测试期间,Astra还发现并利用了两个此前未知的V8零日漏洞。

在一项模拟网络安全任务中,OpenAI故意在周边系统里留下可以利用的诱饵漏洞。当原任务难以完成时,GPT-5.6 Sol有48.2%的测试出现越界行为,Astra则为0%。

在电子工程案例中,Astra直接进入KiCad,根据电子原理图完成PCB布局。

它需要自己放置元器件、规划位置,再把不同组件之间的铜线连接起来,最后得到一块可以进入制造流程的电路板。

PCB布局原本是一项相当依赖人工经验的工作,也是电子产品开发中常见的耗时环节。

Astra现在还谈不上代替专业工程师,但它已经真的打开专业软件开始动手了。

另一个案例更加直观,Astra先在Blender中建立房屋模型,再把它导入Unreal Engine 5,最终生成一个可以自由行走的三维空间。

从建模到游戏引擎,整个工作跨越了不同软件和文件格式。模型不仅要生成内容,还要理解界面、操作工具,并保证前后步骤能够衔接。

专业办公场景里,Astra可以根据企业已有的模板制作演示文稿,而不是只输出一堆等待人类排版的文字。

OpenAI给它提供了几页GPT-Gaia虚构产品的PPT模板,Astra据此制作出完整演示文稿,并延续了原模板的版式、视觉风格和叙事结构。

Astra还完成了寻找儿科医生、公寓筛选、预约车管所业务、寻找低碳水零食和幼儿园分析等任务。

其中一项儿科医生搜索任务,Astra用时2分54秒,而相同任务由人类完成大约需要5小时。

过去,企业想让大模型使用内部软件,通常需要为每套系统单独开发API、插件和连接器。

Brockman的判断是,只要模型足够擅长Computer Use,它就能像人一样直接操作这些界面,不必等待每一款软件为AI重新修一条专用通道。

人类不需要一直告诉它下一步点哪里,只需交代目标和边界,再检查最后的结果。

Computer Use解决的是“怎么动手”,Codex泄露的更新内容解决的则是“怎么把一件事持续做完”。

机器翻译/自动整理可能存在误差,请以原文为准。

继续阅读

正在加载推荐…