AB
AiBoss站
project

VDN-MiniMax-H3 - OpenVDN 开源的视频生成加速方案

VDN-MiniMax-H3是 OpenVDN 团队开源的视频生成加速方案,基于 MiniMax-H3 改造。模型采用混合注意力架构,局部滑动窗口 Softmax 保留精细细节,远距离线性注...

VDN-MiniMax-H3是什么

VDN-MiniMax-H3是 OpenVDN 团队开源的视频生成加速方案,基于 MiniMax-H3 改造。模型采用混合注意力架构,局部滑动窗口 Softmax 保留精细细节,远距离线性注意力处理长程上下文,再通过 8 步蒸馏大幅压缩去噪步数。模型在 8 张 NVIDIA B200 上,仅需 11.23 秒可生成约 14.4 秒 768p 视频,画质与原始 50 步 Dense H3 近乎无损。

VDN-MiniMax-H3的主要功能

  • 混合注意力架构:将视频注意力拆分为局部 Softmax 分支与远距离线性分支,兼顾精细细节与长程上下文。
  • 8 步极速生成:通过 DMD2 蒸馏将去噪步数从 50 步压缩至 8 步,大幅缩短生成时间。
  • 近乎无损画质:在 11.23 秒生成 14.4 秒视频的同时,视觉质量接近原始 50 步 Dense H3 基线。
  • 三阶段训练适配:采用逐层对齐、端到端分支适配和 LoRA 联合适配,避免随机初始化扰动预训练模型。
  • 分支专用并行:将 Softmax 与线性分支分配到不同 GPU,比标准 Ulysses 并行再降低 13.3% 延迟。

VDN-MiniMax-H3的技术原理

  • 混合注意力架构:VDN 将视频注意力拆分为局部 Softmax 与远距离线性两个互补分支,前者保留精细细节,后者以线性复杂度处理长程上下文,从而替代全量二次方注意力。
  • 局部 Softmax 分支:采用双向滑动窗口,每 5 帧为一组关注邻近块,并引入首尾帧作为边界锚点,仅增加 3.57% 注意力密度即可维持全局时序一致性。
  • Video Delta Attention:将传统逐 token 的 Delta Rule 升级为逐帧联合求解,通过正规方程让所有空间 token 共同决定新状态,天然非扩张且能自适应 token 相关性,无需硬性帧大小缩放。
  • 文本双分支注入:Softmax 分支中文本对每帧全局可见;线性分支则在初始化时将文本一次性写入双向状态,避免重复计算。
  • 门控融合机制:两条分支输出尺度不同,各自配备内容相关的 Sigmoid 门控与独立输出投影后再合并;Softmax 门控在训练前两阶段保持冻结,防止优化器通过压低原分支来降低损失。
  • 三阶段训练适配:逐层对齐线性分支,再端到端联合优化所有混合模块,最后通过 QKVO LoRA 与线性分支共同微调,全程冻结预训练主干,确保生成质量不崩坏。

微信关注回复“开源”,加入AI开源项目交流群

如何使用VDN-MiniMax-H3

  • 环境准备:克隆 GitHub 仓库后创建 Python 3.12 环境,安装 PyTorch 2.13.0 及项目依赖。
  • 下载模型:通过 ModelScope 下载 OpenVDN/vdn-minimax-h3 权重到本地 ckpts 目录。
  • 运行官方示例:执行 scripts/inference/8nfe_tuned_fp8.sh 即可用单卡生成示例视频。
  • 多卡推理:根据硬件选择 8nfe_tuned_fp8_ulysses_h200.shb200.sh 脚本在 8 卡上运行。
  • 自定义提示词:用 encode_prompt.py 调用 Qwen3-VL-32B 将文本编码为 .pt 特征文件,再传入 infer.py 生成视频。

VDN-MiniMax-H3的核心优势

  • 极速生成:8 步蒸馏配合混合注意力,在 8 张 B200 上仅需 11.23 秒即可生成约 14.4 秒 768p 视频,较原始模型加速 74.5 倍。
  • 近乎无损画质:视觉细节、主体一致性与指令遵循能力接近 50 步 Dense H3 基线,显著优于 4 步 FastH3。
  • 混合注意力架构:局部 Softmax 保留精细时序细节,远距离线性注意力以线性复杂度处理长程上下文,兼顾质量与效率。
  • 帧级联合求解(VDA):将逐 token 更新升级为逐帧联合优化,天然非扩张且自适应 token 相关性,无需硬性缩放。
  • 分阶段平稳适配:通过逐层对齐、端到端分支适配与 LoRA 联合微调三阶段训练,避免随机初始化扰动预训练模型。
  • 分支专用并行:将 Softmax 与 VDA 分支分配到不同 GPU 执行,比标准 Ulysses 并行再降低 13.3% 延迟。

VDN-MiniMax-H3的项目地址

  • 项目官网:https://openvdn.github.io/
  • GitHub仓库:https://github.com/OpenVDN/vdn-minimax-h3
  • HuggingFace模型库:https://huggingface.co/OpenVDN/vdn-minimax-h3

VDN-MiniMax-H3的同类竞品对比

对比维度 VDN-MiniMax-H3 Sparse VideoGen2 (SVG2)
核心思路 用混合注意力(局部 Softmax + 远距离线性 VDA)替代全量二次方注意力,结合少步蒸馏 训练无关的稀疏注意力框架,通过语义感知排列识别关键 token 并重新排序以提升 GPU 计算效率
技术路线 架构改造 + 三阶段训练适配(A1/A2/B)+ 8 步 DMD2 蒸馏 语义 k-means 聚类 + top-p 动态预算控制 + 定制稀疏注意力内核,无需重新训练
加速比 74.5×(对比单 GPU Dense H3 基线),10.7×(对比 8 GPU 基线) 2.30×(HunyuanVideo),1.89×(Wan 2.1)
生成速度 11.23 秒生成 14.4 秒 768p 视频(8×B200,8 NFE) 约 13 分钟生成 5 秒视频(H100,稀疏化后)
画质表现 近乎无损,视觉细节与指令遵循接近 50 步 Dense H3 PSNR 高达 30(HunyuanVideo)/ 26(Wan 2.1),在相同稀疏率下优于其他稀疏方法
适用模型 专用于 MiniMax H3 改造 通用框架,即插即用于 HunyuanVideo、Wan 2.1 等多种 DiT 模型
训练成本 需要三阶段训练(逐层对齐 → 端到端适配 → LoRA 联合微调) 零训练成本,直接应用于预训练模型推理

VDN-MiniMax-H3的应用场景

  • 实时交互式视频创作:8 步极速生成使创作者能够实时调整提示词并即时预览结果,大幅缩短创意迭代周期。
  • 广告营销素材批量生产:电商与品牌方可快速生成多版本产品展示视频、动态海报,满足节日大促等高频素材需求。
  • 影视预演与动态分镜:导演和制片团队可在正式拍摄前快速生成分镜动画,验证镜头语言、场景调度与叙事节奏。
  • 游戏动态内容生成:为开放世界游戏或虚拟社交平台实时生成 NPC 动画、环境过场与玩家个性化剧情片段。
  • 社交媒体短视频工业化生产:MCN 机构与自媒体创作者可低成本、高并发地产出剧情短片、虚拟角色 Vlog 等短视频内容。