如意小报
版块首页原文 ↗
AI · 新闻详情

吹爆开源!RunningHub让MiniMax H3满血提速12倍,本地部署照样起飞

综合 · 量子位 · 量子位 · 2026-09-11 · 重磅值 47.12
真正值得关注的不是这条新闻本身,而是它可能把「综合」的竞争焦点推向更大范围的连锁反应。
发生了什么:15秒视频,50秒出片
为什么重要:它提示了一个值得继续跟踪的变化方向。
观察窗口:接下来观察它是否会引发更多同类动作,以及影响范围能否扩大。
正文来源:原文正文机器翻译
原文链接:https://www.qbitai.com/2026/09/487055.html

所以MiniMax前脚刚把H3开源,后脚各种工作流、ComfyUI节点、垂直优化玩法就已经冒了出来。

灵感一上头,创意改起来只要十几秒,下一版都已经在脑子里剪完了,结果屏幕上的这一版还在转……

于是乎,RunningHub干脆给H3踩了脚油门,直接朝着等待时间砍了一刀。

同样生成5秒、1344×768的视频,在4张RTX 6000D上,原始BF16 50步方案耗时 348.8秒,差不多6分钟 。

RunningHub H3 Lightning完整加速之后,只需要 28.7秒 。

好家伙,前后约 12倍提速 ,生成耗时减少约92%,却依旧能保留BF16数值精度。

现在,RunningHub已经把整套玩法放GitHub上开源了,任何创作者都能开箱即用!

不光是5秒视频,就算是15秒、双参考图,RunningHub H3 Lightning依旧能给你猛猛提速。

在8张RTX 6000D环境下,让H3做一个15秒、分辨率768×1344的视频,纯文字生成大约需要48秒、双参考图生成约73秒。

也就是说,一条15秒的图生视频,可以打进 “1分钟出结果” 这个时间尺度了。

而且在RunningHub H3 Lightning这儿,AI加速可不等于质量劣化。

整套加速方案还全程保留BF16满血精度,没有走降精度换速度的“捷径”。

场景放在沙漠,一个女越野摩托车手原地起步,随后高速冲上沙丘,腾空、落地,再接一个大幅甩尾。

先低机位侧面追车,随后绕到正面倒退跟拍,最后让摩托直接从镜头旁边冲过去。

从点击生成到出片的实际用时约为 30s ,人、车、沙尘的运动逻辑挺连贯。

落地的时候车身有明显的下沉和回弹,骑手的重心也跟着往下压了一下,还有尘土的飞扬看着也挺真实。

其实,除了画面质量高之外我最大的感受是,等待间隙我甚至都没刷完一个某音视频……

少年从草地上起身,直接向山坡前方奔跑;金毛也得跟着起来,一边跑一边跳;少年中途还要张开双臂、转身继续跑。

从坐着到起身,再到迈步加速,动作之间有比较明显的衔接;金毛也没有沦为一张跟着人物平移的贴纸,自己完成了起身、奔跑和跳跃。

少年的黄色外套、蓝色裤子、黑色头发这些主要特征一直都在,金毛的体型和毛色也没有跑到后半段突然换了个品种。

当然了,你要是真盯着看也还是能挑出毛病。狗在快速跳跃时,四肢动作偶尔会有点“硬”,但是倒也不会特别出戏。

少年得站起来撑伞,在草地上跑,再突然停下转一圈;金毛继续绕着他跑,还得从旁边跳过去。

之前想改个人物、场景、镜头啥的,动手之前可能会考虑考虑值不值得再等很长时间。

对很多创作者来说,创意落地、试错的时间成本都降低了,也不用因为漫长等待就砍掉很多一闪而过的想法。

那么问题来了, 不降BF16精度,也不开挂顶级数据中心算力,RunningHub抠出来的时间,到底是从哪儿省出来的?

先看看哪里算得太多,再看看哪里算得太慢,最后看看几张GPU之间有没有时间浪费在“互相等”上。

把文字或者图片变成视频需要经过多轮计算,画面才会逐渐从噪声中成形,这个轮次叫生成步数。

原始H3推理默认50步,每一步背后都有一轮实打实的计算,步数越多,GPU自然就得干得越久。

RunningHub做的第一件事,就是引入 自研的RH后训练加速模型 。

简单点说就是让H3经过后训练之后,学会用更少的步数把视频做出来,还得在不丢画质的前提下完成。

同样使用4张RTX 6000D生成5秒视频,换成RH后训练加速模型的9步测试方案之后,时间直接缩短到了43秒。

遇到快速运动、大幅动作这类难任务可以切到8步,快还是稳,咱创作者自己来决定。

RunningHub接着想解决的是,剩下这些必须完成的计算,还有没有地方能继续省时间?

这次一口气上了三个技术组合, SageAttention2、Cache-DiT和torch.compile 。

谁和谁相关、前后画面怎么联系、不同信息怎么共同影响最终结果,这些注意力计算本身就是推理过程中相当吃算力的一环。

视频生成前后多个计算步骤之间存在可以复用的信息,如果有些中间结果已经算过,后面的步骤就没必要每次都从头再来。

能缓存的缓存,能复用的复用,把重复工作减下来,时间自然还能继续往下挤。

最后还有torch.compile,它会对计算过程进行 编译优化 ,让GPU执行这些操作时更加顺畅,减少一些原本零散的调度和执行开销。

当RH后训练加速模型和这些算子、缓存、编译优化叠到一起,该跑快的跑快,该复用的复用,该捋顺的捋顺,刚才压到43秒的生成过程又被继续压到了28.7秒。

但这还没完,H3这种视频模型真跑起来,往往不会只让一张GPU单打独斗。

机器翻译/自动整理可能存在误差,请以原文为准。

继续阅读

正在加载推荐…