15秒视频,54秒生成!AI视频创作的“等待焦虑”,被RunningHub这套开源方案治好了

AI视频创作的“等待焦虑”,正被这套开源方案快速化解。

15秒视频,54秒生成!AI视频创作的“等待焦虑”,被RunningHub这套开源方案治好了

H3开源落地遇速度瓶颈,近6分钟生成5秒视频劝退创作者

H3视频生成模型开源后,凭借较强的生成能力迅速获得创作者的关注,但实际部署使用后,生成速度过慢的问题成为落地的核心障碍。智东西在RunningHub的对照测试中,使用配备4张NVIDIA RTX 6000D专业显卡的测试环境,生成一段5秒、1344×768分辨率的视频,采用BF16基础方案需要完成50步生成,耗时348.8秒,接近6分钟。若生成更长的视频、或需要反复调整画面参数迭代内容,等待时间还会进一步拉长,直接拖慢创作节奏,不少创作者因此放弃了本地部署的计划。

多技术叠加实现全链路优化,5秒视频生成耗时直降近90%

针对这一痛点,RunningHub近期推出并开源了H3 Lightning视频生成加速方案,通过四层优化实现全链路提速:

  • 首先引入RH后训练加速模型,将生成步数从50步压缩至9步,用更少的计算轮次完成视频生成,生成耗时先缩短至60秒,速度达到基础方案的5.8倍;
  • 随后叠加SageAttention2注意力计算加速、Cache-DiT中间结果缓存复用、torch.compile计算流程编译优化三项技术,进一步减少重复计算、提升GPU执行效率,5秒视频的生成耗时进一步压缩至28.7秒,相较基础方案整体推理速度提高约12倍,等待时间减少约92%;
  • 针对多卡场景的通信开销问题,RunningHub为无NVLink高速互联的PCIe多卡环境选择了TP2+Ulysses4的并行组合,在8张RTX 6000D的测试中,该组合相比TP4+Ulysses2快约12%,同时减少约14GiB显存占用;
  • 最终所有优化技术被统一整合进SGLang的multimodal_gen推理引擎,由同一套推理流程完成调度和执行。

复杂场景实测表现亮眼,15秒短剧级视频54秒即可生成

为验证加速效果,智东西在RunningHub平台进行了多轮实测。首先测试基础能力:生成一段5秒的流浪猫吃猫粮的视频,平台用时28秒完成生成,整体过程流畅,画面细节完整。随后提高测试难度:将视频时长增加到15秒,生成一段发生在高级餐厅的都市短剧,包含多名角色、台词等复杂元素。最终这段15秒的视频用时约54秒完成,画面整体完成度较高,角色动作衔接自然,人物表情能够配合情节变化,台词、口型与画面基本匹配,声音也较为清晰,具备短剧的成片质感。

全量开源降低使用门槛,普通创作者也可直接调用方案

目前H3 Lightning的相关技术方案和复现说明已经在GitHub公开,有多卡设备的创作者可以参考方案进行本地部署,没有专业设备的普通创作者也可以直接在RunningHub平台上使用该加速能力,无需自行部署即可享受提速后的生成体验,真正解决了从模型开源到实际创作流程的最后一公里问题。