MiniMax H3 是真强也是真火啊。
开源还能打,在 AI 视频圈也算是独一份了。

模型底座强成这样,开发者们自然也闲不住,开始琢磨怎么把它玩得更爽。
所以 MiniMax 前脚刚把 H3 开源,后脚各种工作流、ComfyUI 节点、垂直优化玩法就已经冒了出来。
这不,一站式 AIGC 创作平台RunningHub就盯上了一个大家都特《急急急》的事儿:
让 H3 跑快点。
咋说呢,模型越好用人越忍不住多抽几次,结果一抽一个大等待。
灵感一上头,创意改起来只要十几秒,下一版都已经在脑子里剪完了,结果屏幕上的这一版还在转……

于是乎,RunningHub 干脆给 H3 踩了脚油门,直接朝着等待时间砍了一刀。
同样生成 5 秒、1344 × 768 的视频,在 4 张 RTX 6000D 上,原始 BF16 50 步方案耗时348.8 秒,差不多 6 分钟。
RunningHub H3 Lightning 完整加速之后,只需要28.7 秒。
好家伙,前后约12 倍提速,生成耗时减少约 92%,却依旧能保留 BF16 数值精度。
现在,RunningHub 已经把整套玩法放 GitHub 上开源了,任何创作者都能开箱即用!
(https://github.com/RH-RunningHub/MiniMax-H3-MultiGPU-Lightning/)

快 12 倍的 H3 是啥体验
不光是 5 秒视频,就算是 15 秒、双参考图,RunningHub H3 Lightning 依旧能给你猛猛提速。
在 8 张 RTX 6000D 环境下,让 H3 做一个 15 秒、分辨率 768 × 1344 的视频,纯文字生成大约需要 48 秒、双参考图生成约 73 秒。
也就是说,一条 15 秒的图生视频,可以打进"1 分钟出结果"这个时间尺度了。
而且在 RunningHub H3 Lightning 这儿,AI 加速可不等于质量劣化。
整套加速方案还全程保留 BF16 满血精度,没有走降精度换速度的"捷径"。
一个本来就已经很能打的模型,又被狠狠优化了一波,咱必须得体验一把!

我先试了一个 5 秒、768P 的文生视频,直接来个大动作。
场景放在沙漠,一个女越野摩托车手原地起步,随后高速冲上沙丘,腾空、落地,再接一个大幅甩尾。
嫌这还不够,我又给镜头加了点活儿。
先低机位侧面追车,随后绕到正面倒退跟拍,最后让摩托直接从镜头旁边冲过去。
从点击生成到出片的实际用时约为30s,人、车、沙尘的运动逻辑挺连贯。
落地的时候车身有明显的下沉和回弹,骑手的重心也跟着往下压了一下,还有尘土的飞扬看着也挺真实。
我预设的机位也都安排妥了。
其实,除了画面质量高之外我最大的感受是,等待间隙我甚至都没刷完一个某音视频……
确实是丝滑。
不过 5 秒还是短,咱还得上强度。
再试试 15 秒的图生视频,这次我喂了一张吉卜力风格的参考图。

图片 AI 生成
原本是一人一狗背对着镜头坐在草地上,现在咱让他俩跑起来。
少年从草地上起身,直接向山坡前方奔跑;金毛也得跟着起来,一边跑一边跳;少年中途还要张开双臂、转身继续跑。
镜头从背后推进,再切到侧面跟拍,最后拉远,把整个山谷重新带进画面。
15 秒长视频的生成时间就比较久了,从点击到出片大概88 秒。
从坐着到起身,再到迈步加速,动作之间有比较明显的衔接;金毛也没有沦为一张跟着人物平移的贴纸,自己完成了起身、奔跑和跳跃。
更关键的是,15 秒跑下来,这一人一狗还基本是原来那一人一狗。
少年的黄色外套、蓝色裤子、黑色头发这些主要特征一直都在,金毛的体型和毛色也没有跑到后半段突然换了个品种。
而且镜头转完一圈后,远处的湖泊和夕阳依旧在画面中。
当然了,你要是真盯着看也还是能挑出毛病。狗在快速跳跃时,四肢动作偶尔会有点"硬",但是倒也不会特别出戏。
本来打算收工了,我又突然冒出来一个想法,晴天不要了,给我下雨。
没错咱创作的时候灵感就是嘎嘎跳跃!
少年得站起来撑伞,在草地上跑,再突然停下转一圈;金毛继续绕着他跑,还得从旁边跳过去。
与此同时,原来的远山和湖泊还得留住。
二次创作的时间变短了,也就 50 秒左右,最后画面远处还出现了一抹彩虹~
之前想改个人物、场景、镜头啥的,动手之前可能会考虑考虑值不值得再等很长时间。
现在不用愁了,有了灵感就能快速出片。
对很多创作者来说,创意落地、试错的时间成本都降低了,也不用因为漫长等待就砍掉很多一闪而过的想法。
那么问题来了,不降 BF16 精度,也不开挂顶级数据中心算力,RunningHub 抠出来的时间,到底是从哪儿省出来的?
人人都能用,本地可部署
快,自然是用工程抠出来的,解法是很工整的三刀——
先看看哪里算得太多,再看看哪里算得太慢,最后看看几张 GPU 之间有没有时间浪费在"互相等"上。
第一刀,先从模型本身动手,让 H3 少算一点。
视频生成不是模型看完 Prompt,啪一下就直接把最终画面吐出来。
它需要一轮一轮地把画面"想"出来。
把文字或者图片变成视频需要经过多轮计算,画面才会逐渐从噪声中成形,这个轮次叫生成步数。
原始 H3 推理默认 50 步,每一步背后都有一轮实打实的计算,步数越多,GPU 自然就得干得越久。
RunningHub 做的第一件事,就是引入自研的 RH 后训练加速模型。
简单点说就是让 H3 经过后训练之后,学会用更少的步数把视频做出来,还得在不丢画质的前提下完成。
这一步的效果已经相当明显。
同样使用 4 张 RTX 6000D 生成 5 秒视频,换成 RH 后训练加速模型的 9 步测试方案之后,时间直接缩短到了 43 秒。
第一刀下去,已经提速了 8 倍。
顺便说一句,RunningHub 的推荐配置是默认 4 步;

遇到快速运动、大幅动作这类难任务可以切到 8 步,快还是稳,咱创作者自己来决定。
做到 43 秒,按理说已经挺猛了,但 RunningHub 显然还嫌慢。
模型虽然少算了,可剩下这些必须完成的计算,总不能就这么放着吧。
RunningHub 接着想解决的是,剩下这些必须完成的计算,还有没有地方能继续省时间?
于是第二刀开始往执行层里砍。
这次一口气上了三个技术组合,SageAttention2、Cache-DiT 和 torch.compile。

SageAttention2 盯的是注意力计算。
视频模型每生成一段内容,都需要处理大量画面元素之间的关系。
谁和谁相关、前后画面怎么联系、不同信息怎么共同影响最终结果,这些注意力计算本身就是推理过程中相当吃算力的一环。
SageAttention2 要做的就是让这块核心计算执行得更高效。
Cache-DiT 则开始盯着重复劳动。
视频生成前后多个计算步骤之间存在可以复用的信息,如果有些中间结果已经算过,后面的步骤就没必要每次都从头再来。
能缓存的缓存,能复用的复用,把重复工作减下来,时间自然还能继续往下挤。
最后还有 torch.compile,它会对计算过程进行编译优化,让 GPU 执行这些操作时更加顺畅,减少一些原本零散的调度和执行开销。
当 RH 后训练加速模型和这些算子、缓存、编译优化叠到一起,该跑快的跑快,该复用的复用,该捋顺的捋顺,刚才压到 43 秒的生成过程又被继续压到了 28.7 秒。
但这还没完,H3 这种视频模型真跑起来,往往不会只让一张 GPU 单打独斗。
多张卡一起干活,新的问题就又来了。
卡多,不等于一定快。这和多人一起干活其实挺像的。
八个人当然比一个人手多,可如果任务分配不合适,每个人刚干两下就要停下来等别人递东西,A 等 B,B 等 C,最后时间全耗在互相交接上。
多卡推理也是类似的道理。
GPU 之间需要不断交换数据,而在没有 NVLink 高速互联、主要依靠 PCIe 通信的环境里,卡间通信的成本尤其不能忽略。
RunningHub 这次专门针对这种环境,把不同的多卡并行方式拉出来重新测了一遍,最后选中的组合是TP2+Ulysses4。
TP 负责从张量计算层面拆任务,Ulysses 则进一步从序列维度做并行。
在 8 张 RTX 6000D、PCIe 连接且没有 NVLink 的环境下,TP2+Ulysses4 相比 TP4+Ulysses2,速度快约 12%,同时减少约 14GiB 显存占用。
所以从整体技术路径来看,这套工程栈基本就是沿着推理链路一路抠时间:
RH 后训练加速模型先把需要完成的计算量压下来;
SageAttention2、Cache-DiT 和 torch.compile 继续提高剩余计算的执行效率;
到了多卡层面,再用 TP2+Ulysses4 减少通信和资源上的浪费;
最后,RunningHub 把这些方法全部整合进 SGLang multimodal_gen 推理引擎,由它把模型生成、多卡协同和各种加速组件真正组织到一起。

现在 AI 行业的各种性能数字已经卷得飞起,只要舍得堆顶级 GPU、高速互联和数据中心,把模型跑得飞快并不稀奇。
可真正想本地部署开源视频模型的创作者、工作室和中小团队要问了:
我手里的机器,能不能跑出这个速度?
RunningHub:必须能。
H3 Lightning 特意绕开了"超能力解法",针对的就是无 NVLink 的 PCIe 多卡环境,RTX 6000D 也是公开可购买的专业 GPU 规格。
也就是说,RunningHub 从一开始针对性优化的,就是一种更贴近工作室和企业团队实际部署的多卡环境。
当然了,如果你的预算没上限,用 B300 的卡配合这个方式,出片速度能直接提升至秒级。
从环境安装、模型下载,到服务启动和推理测试,H3 Lightning 整个本地部署流程都公开了。
开发者也可以结合公开的社区加速 LoRA,再配上前面提到的注意力优化、计算缓存和多卡并行,在自己的机器上重新跑一遍。
到底要几张卡、怎么调参数、速度和画质怎么取舍,都可以围绕自己的业务适配。
当然了,有设备的团队可以照着开源方案自己部署;
没有多卡服务器、不想研究环境配置的创作者,直接在 RunningHub 上点开 H3 Lightning 也能用。

顶级算力被垄断,RunningHub 选了创作者够得着的那条路
当一个足够强的开源模型出来之后,围绕它其实会出现很多"二创"。
有人会拿开源底座继续做后训练,把优化后的能力跑在顶级数据中心集群上,再封装成 API 提供给用户。
用户不需要关心背后的 GPU 和工程优化,按调用付费就能直接获得结果,这当然是一种很成熟的商业路径。
另一边,也会有人选择把优化继续留在开源生态里——
开发者自己拥有硬件、自己部署模型,围绕自己的工作流继续改,优化方法又能被下一批开发者拿去复现和迭代。
RunningHub 这次明显更偏向后者。
而且,这已经不是它第一次围着 H3 这么干了。
H3 刚开源的时候,RunningHub 首先做的是接入。
模型出来之后,平台第一时间把它接进来,让创作者不用先研究一大堆部署问题,就可以上手尝试新模型。
随后,它又参与生态共建,把全套 ComfyUI 节点开源。
这一下,开发者能玩的更多了。
有人拿 H3 做电商内容,有人拿去做短剧、漫剧,有人研究声音克隆、动作克隆和音频驱动,还有人继续把自己的玩法封装成新的工作流。
比如,创作者 @魅力创意直接盯上了电商视频。
TA 发布的 MiniMax H3 · 电商多参生视频工作流,只需要把商品、模特、场景一股脑塞进去,再简单说说卖点——
H3 就能自己琢磨人物该在哪儿、商品怎么露出、场景怎么搭,最后直接给你一条完整电商广告。

还有创作者 @艾橘溪整的音频驱动数字人说话唱歌工作流。
上传一张人物图片,再扔进去一段音频,原本静止的人物就能秒变数字人开口营业。
不管是说话还是唱歌,口型和节奏都能同步对上。

还有今年超火的漫剧,创作者 @qwlulnpi 也搬出了新创意。
把分镜图、脚本、音频一次性丢进去就能拿到有画面有声音的完整成片。
多少有点"素材备齐,一把梭哈"的流水线味儿了。

这还只是 RunningHub 上冒出来的一小撮玩法。
自打 H3 上线以来,RunningHub 平台上已经有上千名创作者,围绕它开源了近万条创意工作流。
其实这也是开源模型的乐趣,一个人解决一点问题,最后整个生态能用的东西就越来越多。
而 H3 Lightning 相当于 RunningHub 再进一步,开始把自己积累的工程能力反过来贡献给 H3,直接解决推理效率的问题。
配资界官网
如果只看 RunningHub,一个 AIGC 创作平台突然跑去研究后训练、算子优化和多卡并行,多少有点跨界。
但把它放回母公司海马云过去十多年的技术演进里,这事儿其实顺理成章。
海马云 2014 年成立,过去十多年长期和 GPU、高性能内容打交道。
那个时候,行业面对的问题还不是" AI 大模型怎么推理"。
当时的核心矛盾是游戏、图形、高性能数字内容体量越来越大,如何让这些负载稳定、高速地运行起来。
GPU 容器调度、图形虚拟化、实时流媒体、大规模云渲染,海马云的整套能力体系都是围绕这个目标打磨的。
时至今日,海马云已经在国内建设 60 余个边缘节点,支撑超过 2000 万月活用户的智算服务。

到了生成式 AI 时代,需要被高效调度的计算对象发生了变化。
除了游戏、图形和高性能数字内容,现在还加入了大模型,以及模型驱动的内容生成。
于是海马云面对的命题也随之从「高性能内容怎么跑」,进一步转向了「AI 能力如何调用,又如何高效落地」。
计算对象从云渲染到 AI 推理,但这也恰好让海马云这家原生 AI 公司十余年的技术积累有了更大的发挥场景。
所以 RunningHub 并不算"跨界"做模型加速。
RunningHub H3 Lightning,是海马云「GPU 工程能力」在 AI 时代的一个新落点,补齐的也是开源模型从权重到生产力之间缺失的环节。
过去一年,开源模型越来越多,真正稀缺的是:
谁能在模型开源之后,最快把它接进真实环境、优化到生产可用,再把这些能力持续回馈给社区。
模型开源,RunningHub 平台完成接入,创作者「能直接用」了;
开放 ComfyUI 节点与工作流,创作者「能玩的花样」多了;
而 H3 Lightning 推理优化,则是在模型跑通之后,继续攻克速度、成本与硬件门槛,把单次试玩的内容生成,升级为可稳定复用的批量生产力。
RunningHub 就是这样一个生态反哺者。
元股证券:ygzq.hk咱普通创作者也算是跟着吃上细糠了~
GitHub 仓库:https://github.com/RH-RunningHub/MiniMax-H3-MultiGPU-Lightning/
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
� � 点亮星标 � �
科技前沿进展每日见股票配资平台有没有官方入口
股票配资官网 - 元股证券提示:本文来自互联网,不代表本网站观点。