吹爆开源!RunningHub让MiniMax H3满血提速12倍,本地部署照样起飞
真正值得关注的不是这条新闻本身,而是它可能把「综合」的竞争焦点推向更大范围的连锁反应。
原文链接:https://www.qbitai.com/2026/09/487055.html
所以MiniMax前脚刚把H3开源,后脚各种工作流、ComfyUI节点、垂直优化玩法就已经冒了出来。
灵感一上头,创意改起来只要十几秒,下一版都已经在脑子里剪完了,结果屏幕上的这一版还在转……
于是乎,RunningHub干脆给H3踩了脚油门,直接朝着等待时间砍了一刀。
同样生成5秒、1344×768的视频,在4张RTX 6000D上,原始BF16 50步方案耗时 348.8秒,差不多6分钟 。
RunningHub H3 Lightning完整加速之后,只需要 28.7秒 。
好家伙,前后约 12倍提速 ,生成耗时减少约92%,却依旧能保留BF16数值精度。
现在,RunningHub已经把整套玩法放GitHub上开源了,任何创作者都能开箱即用!
不光是5秒视频,就算是15秒、双参考图,RunningHub H3 Lightning依旧能给你猛猛提速。
在8张RTX 6000D环境下,让H3做一个15秒、分辨率768×1344的视频,纯文字生成大约需要48秒、双参考图生成约73秒。
也就是说,一条15秒的图生视频,可以打进 “1分钟出结果” 这个时间尺度了。
而且在RunningHub H3 Lightning这儿,AI加速可不等于质量劣化。
整套加速方案还全程保留BF16满血精度,没有走降精度换速度的“捷径”。
场景放在沙漠,一个女越野摩托车手原地起步,随后高速冲上沙丘,腾空、落地,再接一个大幅甩尾。
先低机位侧面追车,随后绕到正面倒退跟拍,最后让摩托直接从镜头旁边冲过去。
从点击生成到出片的实际用时约为 30s ,人、车、沙尘的运动逻辑挺连贯。
落地的时候车身有明显的下沉和回弹,骑手的重心也跟着往下压了一下,还有尘土的飞扬看着也挺真实。
其实,除了画面质量高之外我最大的感受是,等待间隙我甚至都没刷完一个某音视频……
少年从草地上起身,直接向山坡前方奔跑;金毛也得跟着起来,一边跑一边跳;少年中途还要张开双臂、转身继续跑。
从坐着到起身,再到迈步加速,动作之间有比较明显的衔接;金毛也没有沦为一张跟着人物平移的贴纸,自己完成了起身、奔跑和跳跃。
少年的黄色外套、蓝色裤子、黑色头发这些主要特征一直都在,金毛的体型和毛色也没有跑到后半段突然换了个品种。
当然了,你要是真盯着看也还是能挑出毛病。狗在快速跳跃时,四肢动作偶尔会有点“硬”,但是倒也不会特别出戏。
少年得站起来撑伞,在草地上跑,再突然停下转一圈;金毛继续绕着他跑,还得从旁边跳过去。
之前想改个人物、场景、镜头啥的,动手之前可能会考虑考虑值不值得再等很长时间。
对很多创作者来说,创意落地、试错的时间成本都降低了,也不用因为漫长等待就砍掉很多一闪而过的想法。
那么问题来了, 不降BF16精度,也不开挂顶级数据中心算力,RunningHub抠出来的时间,到底是从哪儿省出来的?
先看看哪里算得太多,再看看哪里算得太慢,最后看看几张GPU之间有没有时间浪费在“互相等”上。
把文字或者图片变成视频需要经过多轮计算,画面才会逐渐从噪声中成形,这个轮次叫生成步数。
原始H3推理默认50步,每一步背后都有一轮实打实的计算,步数越多,GPU自然就得干得越久。
RunningHub做的第一件事,就是引入 自研的RH后训练加速模型 。
简单点说就是让H3经过后训练之后,学会用更少的步数把视频做出来,还得在不丢画质的前提下完成。
同样使用4张RTX 6000D生成5秒视频,换成RH后训练加速模型的9步测试方案之后,时间直接缩短到了43秒。
遇到快速运动、大幅动作这类难任务可以切到8步,快还是稳,咱创作者自己来决定。
RunningHub接着想解决的是,剩下这些必须完成的计算,还有没有地方能继续省时间?
这次一口气上了三个技术组合, SageAttention2、Cache-DiT和torch.compile 。
谁和谁相关、前后画面怎么联系、不同信息怎么共同影响最终结果,这些注意力计算本身就是推理过程中相当吃算力的一环。
视频生成前后多个计算步骤之间存在可以复用的信息,如果有些中间结果已经算过,后面的步骤就没必要每次都从头再来。
能缓存的缓存,能复用的复用,把重复工作减下来,时间自然还能继续往下挤。
最后还有torch.compile,它会对计算过程进行 编译优化 ,让GPU执行这些操作时更加顺畅,减少一些原本零散的调度和执行开销。
当RH后训练加速模型和这些算子、缓存、编译优化叠到一起,该跑快的跑快,该复用的复用,该捋顺的捋顺,刚才压到43秒的生成过程又被继续压到了28.7秒。
但这还没完,H3这种视频模型真跑起来,往往不会只让一张GPU单打独斗。