AB
AiBoss站
project

HOMIE - 香港科技大学开源的数字人视频生成框架

HOMIE 是香港科技大学开源的数字人视频生成框架,基于 Wan2.1-T2V-14B 骨干网络并集成 Qwen3-VL 多模态大模型。框架能统一处理数字人+商品+Logo+文字四要素,...

HOMIE是什么

HOMIE 是香港科技大学开源的数字人视频生成框架,基于 Wan2.1-T2V-14B 骨干网络并集成 Qwen3-VL 多模态大模型。框架能统一处理数字人+商品+Logo+文字四要素,精准解决人-物交互、品牌贴牌、OCR文字保真和多视角一致性四大难题。模型训练仅需 5.5K 步/约 1 万 A100 小时,OCR 准确率比开源最强模型提升 38.7%,支持 480P 单卡到 720P 多卡推理,大幅降低电商带货、虚拟主播等场景的视频制作门槛。

HOMIE的主要功能

  • 人-物交互视频个性化:支持多个人物与多种物体同时出现在同一视频中,保持每个主体的外观一致性,并实现自然、合理的交互动作(如手持、展示、传递商品等)。
  • Logo / 抽象概念精准贴附:用多模态大模型(MLLM)的语义推理能力,自动将品牌Logo等抽象概念贴附到语义最相关的物体上,无需在提示词中显式描述位置关系。
  • OCR 文字高保真生成:配合 OCR 参考图,确保产品包装、标签上的文字在生成视频中清晰可读、不模糊、不串字,解决 AI 视频生成中”文字糊成一团”的痛点。
  • 多视角一致性生成:给定同一物体的多视角参考图,当物体在视频中发生旋转或运动时,能保持一致的外观和细节,适用于手办、3D模型、玩偶等展示场景。

HOMIE的技术原理

  • 整体架构: 阿里 Wan2.1-T2V-14B 的 DiT 为骨干,引入 Qwen3-VL-2B-Thinking 作为视觉理解模块,配合 UmT5 文本编码器和 VAE 视觉编码器,形成”文本+多模态语义+视觉”三路并行的生成架构。
  • MLLM 集成策略: 在不破坏原有文生视频对齐关系、不产生昂贵重对齐成本的前提下,将多模态大模型的语义推理能力注入 DiT,使模型能自动理解参考图像之间的潜在关系。
  • 全局多模态自注意力引导(GMG): 在 DiT 的自注意力层中,将 MLLM 提取的语义特征与 VAE 视觉 token 进行全局对齐,通过投影、池化和仿射变换,让生成过程中的每个视频 token 都能”看到”参考图的全局语义信息。
  • 模态-参考嵌入(MRE): 为 MLLM 特征 token 和 VAE 视觉 token 分别赋予模态嵌入,为不同参考图像赋予独立参考嵌入,并将同一主体的多视角/OCR 参考图 token 关联起来,避免信息混淆。
  • 三阶段渐进训练: 单主体 480P→ 多主体 480P→ 高清 720P,总计仅 5.5K 步完成训练,远低于同类方法的数万步。

微信关注回复“开源”,加入AI开源项目交流群

如何使用HOMIE

  • 环境准备:从 GitHub 克隆 HOMIE 代码仓库到本地并完成环境依赖安装。
  • 权重下载:从 HuggingFace 下载官方发布的预训练权重到指定模型目录。
  • 素材准备:准备参考图像,包括人物照片、商品图、Logo 图或 OCR 文字图等多主体素材。
  • 提示词编写:编写文本提示词,准确描述目标视频中人物与物体之间的交互动作和场景。
  • 运行推理:运行推理脚本,HOMIE 会自动融合多模态参考信息并生成个性化视频。
  • 分辨率选择:单卡 GPU 可直接生成 832×480 分辨率视频,多卡 FSDP 可扩展至 720P 高清输出。

HOMIE的核心优势

  • 统一框架:一个框架同时处理人-物交互、Logo 贴牌、OCR 文字保真和多视角一致性四大任务,无需为不同场景切换不同模型。
  • 训练高效:仅需 5.5K 步 / 约 1 万 A100 小时即可完成训练,成本远低于同类方法通常所需的 3–4 万步。
  • MLLM 无损集成:在不牺牲文本编码器可控性、不产生昂贵重对齐成本的前提下,将多模态大模型的语义推理能力注入视频生成管线。
  • 质量领先:OCR 准确率相对提升 38.7%,多视角一致性提升 8.2%,40 人用户研究中 64.7% 将整体质量票选为第一。
  • 推理灵活:支持 480P 单卡到 720P 多卡推理,并可输出 1280×720 竖屏视频,直接适配直播带货与短视频制作。

HOMIE的项目地址

  • 项目官网:https://yiyangcai.github.io/homie-page.github.io
  • GitHub仓库:https://github.com/YIYANGCAI/HOMIE
  • HuggingFace模型库:https://huggingface.co/yychai/homie-r2v-wan2.1
  • arXiv技术论文:https://arxiv.org/pdf/2607.18217

HOMIE的同类竞品对比

对比维度 HOMIE SkyReels-V3
发布方 香港科技大学 昆仑万维
骨干网络 Wan2.1-T2V-14B 自研视频模型
MLLM 集成 Qwen3-VL-2B,保留文本编码器无损注入 集成 MLLM,但替换文本编码器
OCR 准确率 0.452(开源最高) 0.326
多视角一致性 (DINOrec) 0.685 0.654
主体一致性 (Face-Sim) 0.786 0.751
Logo 细节保真 能忠实渲染 Logo 细节 Logo 位置正确但细节易模糊
训练成本 5.5K 步 / ~1 万 A100 小时 未公开,推测远高于 HOMIE
开源协议 Apache 2.0(可商用) 开源可商用

HOMIE的应用场景

  • 电商直播带货:生成指定数字人手持指定商品做指定动作的带货视频,支持 1280×720 竖屏输出,直接适配短视频平台。
  • 品牌广告制作:自动将品牌 Logo 贴附到语义相关的产品上,无需在提示词中显式指定位置关系。
  • 虚拟主播 / 数字人:保持数字人身份一致的同时,与多种商品进行自然交互。
  • 产品多视角展示:给定手办、3D 模型或玩偶的多视角参考图,生成旋转展示视频,各角度外观保持一致。
  • 包装文字保真:配合 OCR 参考图,确保产品包装、标签上的文字在视频中清晰可读,适用于食品、化妆品、保健品等需要展示成分/说明的场景。