如意小报
版块首页原文 ↗
AI · 新闻详情

GPT-5.6自己优化自己实锤了,新的左脚踩右脚已经出现

大模型 · 量子位 · 量子位 · 2026-07-30 · 重磅值 91.32
真正值得关注的不是量子位这一条动作本身,而是它可能把「大模型」的竞争焦点推向能力、成本与开放生态的再平衡。
发生了什么:OpenAI的RSI焚诀,它来了!
为什么重要:模型能力的变化,可能重塑下一批产品的技术底座。
观察窗口:后续要看开放范围、价格策略、真实评测以及开发者是否愿意迁移。
正文来源:原文正文机器翻译
原文链接:https://www.qbitai.com/2026/07/463297.html

据报告透露,GPT-5.6已经被投入OpenAI的真实生产环境,用来分析线上流量、调整请求路由,甚至亲自下场改写底层Kernel、优化推测解码模型。

一套小连招下来,OpenAI的端到端服务成本降低了 20% ,Token生成效率也提升了 15%以上 。

而且,值得一提的是,在披露这套工程的五名作者里,还有大名鼎鼎的Triton之父 Philippe Tillet 。

2021年,OpenAI发布Triton 1.0时,目标还是让不懂CUDA的人也能写出接近专家水平的GPU程序。

五年后,GPT-5.6已经开始用Triton改写自己跑在GPU上的底层代码。

从教人类写Kernel,到让模型给自己改Kernel,味儿确实越来越像RSI了。

让AI进入一个“改进AI”的反馈回路——这一轮能力变强之后,再反过来加速下一轮升级。

当然,GPT-5.6现在还远没有完全实现GPT自动训练下一代GPT的RSI。

但它已经开始参与优化自己的运行环境:模型不仅是被工程师部署和调用的工具,也逐渐变成了改造模型系统本身的工程师。

GPT-5.6会寻找不同机器和服务节点之间的负载不均,并测试新的路由策略,把请求分配到更合适的位置。

GPT-5.6会深入模型的forward pass,寻找可以提前计算、省略或并行执行的部分,再通过Codex改写生产环境中的Triton和Gluon Kernel。

GPT-5.6为自己的draft model设计方案,并自动运行数百次实验,测试不同的模型大小、结构和特征。

在训练过程中,它还会持续监控实验,并在发生硬件故障或训练不稳定时主动介入。

面对短对话、长上下文、代码任务等不同负载,GPT-5.6会自动搜索batching、sharding和KV Cache管理的更优组合。

观察生产系统、寻找瓶颈、提出方案、运行实验、处理故障,再把有效改进部署回承载自己运行的系统。

当然,RSI也没那么快,人类依旧站在圈里,也就是human in the loop。

GPT-5.6虽然开始参与改造自己,但优化目标、工具权限、评测指标,以及代码能否进入生产环境,仍然由人类决定。

假如一个任务需要调用模型30次,每次只额外浪费1秒,累计起来就是30秒。

为此,OpenAI搭建了一层由Rust编写的 Agent Harness ,连接模型、工具和用户环境,专门减少Agent循环里的重复工作。

今天的Agent可以使用大量工具、Skill、插件和自定义MCP,但单个任务通常只需要其中很少一部分。

OpenAI不再一开始就把所有说明书塞进上下文,而是在真正需要时,才向模型展示对应工具。

工具返回的内容默认也被限制在1万Token以内,需要更多时,再由模型主动申请。

Prompt缓存可以复用已经计算过的上下文前缀,但前提是这段前缀必须原样不动。

因此,新的消息和工具结果只会接在上下文末尾,不再插回旧内容;工具保持固定顺序,审批和权限设置则留到执行阶段处理。

可以说,一次循环可能只省一点,但当成千上万只Agent每天循环几十轮,省下来的就不再是一点。

所以,这轮效率优化其实来自两股力量:一边是GPT-5.6开始帮助优化模型;另一边,是人类继续替模型清理运行环境里的重复劳动。

在GPT-5.6内部测试期间,每名活跃研究人员的日均输出Token,超过了GPT-5.5时期峰值的两倍。

过去半年,OpenAI用于内部编程推理的研究算力占比增长了 100倍 ,内部Agent Token用量也增长了约 22倍 。

世界模型有触觉了!50万小时视频,训出首个隐式触觉世界动作模型 2026-07-28

机器翻译/自动整理可能存在误差,请以原文为准。

继续阅读

正在加载推荐…