project
MAGI-2-preview - Sand.ai 开源的多模态视频生成模型
MAGI-2-preview 是 Sand.ai 开源的全球首个千亿参数 MoE 多模态视频生成模型,总参数 114B、激活仅 6B。模型延续单流架构,将文本、视频、音频统一纳入同一 T...
MAGI-2-preview是什么
MAGI-2-preview 是 Sand.ai 开源的全球首个千亿参数 MoE 多模态视频生成模型,总参数 114B、激活仅 6B。模型延续单流架构,将文本、视频、音频统一纳入同一 Transformer 联合建模,实现原生多模态生成,在 AA 视频生成榜单排名第六。模型代码与预训练权重已开放,验证视频生成领域高效 Scaling 新路径。
MAGI-2-preview的主要功能
- 多模态视频生成:支持文本、图像、视频到视频的生成,并原生融合音频理解。
- MoE 稀疏激活:114B 总参数中仅激活 6B,大幅降低推理成本。
- 单流统一架构:摒弃传统的 cross-attention 拼接方式,从第一层起即对画面与声音共同建模。
- 高效 Scaling:针对视频生成场景重构 MoE 通信与训练稳定性,解决超长序列下的跨卡通信瓶颈。
MAGI-2-preview的技术原理
- MoE 混合专家架构:模型总容量达 114B,单次前向传播仅激活 6B 参数,实现容量与计算解耦。
- 单流 Transformer:文本、视频、音频 token 从输入层即进入同一 Transformer,通过自注意力直接交换跨模态信息,相比多塔拼接架构更利于捕捉音画同步细节。
- 分布式通信优化:针对视频超长序列特性,重构了专家并行中的 token 路由与通信策略,降低跨 GPU 数据传输开销。
- 训练稳定性方案:动态路由、专家负载均衡与多模态数据联合训练的三重稳定性保障机制。
微信关注回复“开源”,加入AI开源项目交流群
如何使用MAGI-2-preview
- 环境准备:克隆 GitHub 仓库
SandAI-org/MAGI-2-preview,按 README 配置依赖。 - 下载权重:从 GitHub Releases 获取预训练权重。
- 运行推理:修改配置文件与脚本参数,支持
t2v/i2v/v2v三种模式,参考 MAGI-1 的run.sh格式执行。 - 硬件要求:具体配置待官方文档更新,建议参考 MAGI-1 的 24B 多卡 H100 或 4.5B 单卡 24GB VRAM 方案。
MAGI-2-preview的核心优势
- 开源可商用:模型采用 Apache 2.0 协议,预训练权重与推理代码完全开放。
- 千亿 MoE 首创:全球首个成功开源的千亿级 MoE 视频生成模型,验证视频领域 Scaling 新路径。
- 低成本高容量:6B 激活参数即可驱动 114B 模型,推理成本远低于同规模稠密模型。
- 原生多模态:单流架构让音视频在模型底层即深度融合,避免后期对齐带来的延迟与质量损失。
MAGI-2-preview的项目地址
- 项目官网:https://sand.ai/blog/magi-2-preview
- GitHub仓库:https://github.com/SandAI-org/MAGI-2-preview
- HuggingFace模型库:https://huggingface.co/sand-ai/MAGI-2-preview
MAGI-2-preview的同类竞品对比
| 对比维度 | MAGI-2-preview | Wan2.7-Video |
|---|---|---|
| 开发团队 | Sand.ai | 阿里通义实验室 |
| 架构 | MoE + 单流自回归 Transformer | 3D DiT + MoE + 流匹配 |
| 总参数 | 114B | 270B(14B 系列) |
| 激活参数 | 6B | 140B |
| 生成范式 | 自回归 | 扩散(流匹配) |
| 多模态 | 原生音视频联合建模(单流统一) | 文本/图像/视频/音频全模态输入 |
| 视频时长 | 未明确(延续 MAGI-1 流式能力) | 2-15 秒 |
| 分辨率 | 未明确 | 720P / 1080P |
| 开源协议 | Apache 2.0(可商用) | 开源(权重开放) |
| 核心能力 | 高效 Scaling、原生多模态视频生成 | 视频编辑、参考生视频、运镜控制、表情驱动 |
| 榜单表现 | AA 视频生成榜第六 | DesignArena V2V 榜首 |
| 编辑能力 | 未明确 | 一句话修改视频、风格迁移、局部替换 |
MAGI-2-preview的应用场景
-
长视频广告与短剧:MoE 大容量支持复杂叙事建模,可生成分钟级连贯剧情视频。
-
多模态影视预演:原生音频理解能力实现配音、音效与画面的同步生成与编辑。
-
AI 视频学术研究:开源千亿级视频 MoE 权重为学术界提供可复现的 Scaling 基线。
-
企业私有化部署:模型基于Apache 2.0 协议支持金融、医疗等敏感行业构建私有视频生成能力。
-
实时流媒体生成:稀疏激活降低推理成本,可支撑低延迟的实时视频生成与直播场景。