探索性建模:根据 K 个猜测中的最佳结果进行训练
真正值得关注的不是Hacker News这一条动作本身,而是它可能把「AI」的竞争焦点推向模型能力与产品控制权的竞争。
原文链接:https://alexiglad.github.io/blog/2026/explorative_modeling/
TLDR:我们引入了探索性建模,这是一种生成建模的新范式,当添加到现有生成模型时,它可以充当第三个预训练轴,并且还可以实现端到端生成。增加探索可以单调改善图像、视频和语言方面的现有模型,并且收益随着规模的扩大而增长(数据为 7%→36%,参数为 13%→23%)。具体来说,探索性模型 (XM) 达到了 6.2 倍的样本效率、4.1 倍的 FLOP 效率和 47% 的参数效率。探索还可以扩展泛化,并扩展现有模型的端到端程度。作为端到端生成模型,XM 在控制任务上匹配扩散,推理计算量减少了 256 倍。让我从一个听起来很简单的问题开始。如果我要求模型“生成一只狗”,有多少个正确答案?事实证明,有很多……可能有数十亿甚至更多的图像可以算作狗图像。那么如果我们训练一个神经网络来直接预测狗的图像会发生什么呢?该模型在训练过程中看到了数千只不同的有效狗,最接近所有狗的单个预测是它们的平均值。这就是模型学习输出的内容,数千只狗的平均看起来一点也不像狗,而是棕色的模糊。图 1:训练模型直接预测图像会得到所有图像的平均值,即棕色模糊。这就是为什么直接回归不适用于生成建模。为了具体说明这一点,让我们玩一个游戏。我将向下面的木板投掷飞镖,每个飞镖都会随机落在环上的某个位置。你的任务是猜测我的下一个飞镖会落在哪里,距离越远,你的分数就越差。图 2:我们游戏的飞镖盘。那么你应该猜到哪里呢?事实证明,最小化错误的猜测是棋盘的正中间。
1 我们训练了一个模型来玩这个游戏,果然,它每次都猜测中间(这是这里的最佳预测)!图 3:玩我们游戏的模型(蓝色)猜测棋盘的中间。但这很糟糕……中间几乎从来不是飞镖真正落地的地方。
“最佳”猜测是没有飞镖落到的地方。这是生成建模的核心问题。当预测有许多有效答案时,最好的单个预测是它们的平均值 ,而数据的平均值通常是一个糟糕的答案,看起来与真实数据完全不同。