AB
AiBoss站
project

MAGI-2-preview - Sand.ai 开源的多模态视频生成模型

MAGI-2-preview 是 Sand.ai 开源的全球首个千亿参数 MoE 多模态视频生成模型,总参数 114B、激活仅 6B。模型延续单流架构,将文本、视频、音频统一纳入同一 T...

MAGI-2-preview是什么

MAGI-2-preview 是 Sand.ai 开源的全球首个千亿参数 MoE 多模态视频生成模型,总参数 114B、激活仅 6B。模型延续单流架构,将文本、视频、音频统一纳入同一 Transformer 联合建模,实现原生多模态生成,在 AA 视频生成榜单排名第六。模型代码与预训练权重已开放,验证视频生成领域高效 Scaling 新路径。

MAGI-2-preview的主要功能

  • 多模态视频生成:支持文本、图像、视频到视频的生成,并原生融合音频理解。
  • MoE 稀疏激活:114B 总参数中仅激活 6B,大幅降低推理成本。
  • 单流统一架构:摒弃传统的 cross-attention 拼接方式,从第一层起即对画面与声音共同建模。
  • 高效 Scaling:针对视频生成场景重构 MoE 通信与训练稳定性,解决超长序列下的跨卡通信瓶颈。

MAGI-2-preview的技术原理

  • MoE 混合专家架构:模型总容量达 114B,单次前向传播仅激活 6B 参数,实现容量与计算解耦。
  • 单流 Transformer:文本、视频、音频 token 从输入层即进入同一 Transformer,通过自注意力直接交换跨模态信息,相比多塔拼接架构更利于捕捉音画同步细节。
  • 分布式通信优化:针对视频超长序列特性,重构了专家并行中的 token 路由与通信策略,降低跨 GPU 数据传输开销。
  • 训练稳定性方案:动态路由、专家负载均衡与多模态数据联合训练的三重稳定性保障机制。

微信关注回复“开源”,加入AI开源项目交流群

如何使用MAGI-2-preview

  • 环境准备:克隆 GitHub 仓库 SandAI-org/MAGI-2-preview,按 README 配置依赖。
  • 下载权重:从 GitHub Releases 获取预训练权重。
  • 运行推理:修改配置文件与脚本参数,支持 t2v / i2v / v2v 三种模式,参考 MAGI-1 的 run.sh 格式执行。
  • 硬件要求:具体配置待官方文档更新,建议参考 MAGI-1 的 24B 多卡 H100 或 4.5B 单卡 24GB VRAM 方案。

MAGI-2-preview的核心优势

  • 开源可商用:模型采用 Apache 2.0 协议,预训练权重与推理代码完全开放。
  • 千亿 MoE 首创:全球首个成功开源的千亿级 MoE 视频生成模型,验证视频领域 Scaling 新路径。
  • 低成本高容量:6B 激活参数即可驱动 114B 模型,推理成本远低于同规模稠密模型。
  • 原生多模态:单流架构让音视频在模型底层即深度融合,避免后期对齐带来的延迟与质量损失。

MAGI-2-preview的项目地址

  • 项目官网:https://sand.ai/blog/magi-2-preview
  • GitHub仓库:https://github.com/SandAI-org/MAGI-2-preview
  • HuggingFace模型库:https://huggingface.co/sand-ai/MAGI-2-preview

MAGI-2-preview的同类竞品对比

对比维度 MAGI-2-preview Wan2.7-Video
开发团队 Sand.ai 阿里通义实验室
架构 MoE + 单流自回归 Transformer 3D DiT + MoE + 流匹配
总参数 114B 270B(14B 系列)
激活参数 6B 140B
生成范式 自回归 扩散(流匹配)
多模态 原生音视频联合建模(单流统一) 文本/图像/视频/音频全模态输入
视频时长 未明确(延续 MAGI-1 流式能力) 2-15 秒
分辨率 未明确 720P / 1080P
开源协议 Apache 2.0(可商用) 开源(权重开放)
核心能力 高效 Scaling、原生多模态视频生成 视频编辑、参考生视频、运镜控制、表情驱动
榜单表现 AA 视频生成榜第六 DesignArena V2V 榜首
编辑能力 未明确 一句话修改视频、风格迁移、局部替换

MAGI-2-preview的应用场景

  • 长视频广告与短剧:MoE 大容量支持复杂叙事建模,可生成分钟级连贯剧情视频。
  • 多模态影视预演:原生音频理解能力实现配音、音效与画面的同步生成与编辑。
  • AI 视频学术研究:开源千亿级视频 MoE 权重为学术界提供可复现的 Scaling 基线。
  • 企业私有化部署:模型基于Apache 2.0 协议支持金融、医疗等敏感行业构建私有视频生成能力。
  • 实时流媒体生成:稀疏激活降低推理成本,可支撑低延迟的实时视频生成与直播场景。