AB
AiBoss站
project

TalkLikeYou - 中科院自动化所开源的实时数字人框架

TalkLikeYou 是中科院自动化所开源的实时数字人框架,给一张照片和一段音频,能让照片里的人开口说话,嘴部动作能模仿指定真人的说话习惯。

TalkLikeYou是什么

TalkLikeYou 是中科院自动化所开源的实时数字人框架,给一张照片和一段音频,能让照片里的人开口说话,嘴部动作能模仿指定真人的说话习惯。TalkLikeYou通过运动空间建模和一步采样实现实时生成,支持预设编号或参考视频来定制习惯,提出专用指标量化模仿相似度,代码权重全部开源。

TalkLikeYou的主要功能

  • 照片说话:上传一张人像照片和一段音频,可生成人物开口说话的视频。
  • 习惯模仿:可模仿指定真人的嘴部说话习惯,通过预设编号或4秒参考视频指定。
  • 实时生成:采用一步采样技术,生成速度达32.43 FPS,支持实时流式输出。
  • 视频配音:可替换视频中人物的嘴部动作,保留原有头部动作和时序,适合多语言配音。
  • 对话数字人:接入大模型和语音识别合成后,可实现实时对话交互的数字分身。
  • 风格化驱动:支持驱动素描、油画、动漫、3D角色等非真人风格的人像。

TalkLikeYou的技术原理

  • 运动空间建模:不同于直接在像素空间生成图像,TalkLikeYou 先将照片解析为运动参数,在这组轻量数字上学习和生成说话动作,由渲染器合成回视频,兼顾速度与身份稳定性。
  • 一步 Flow Matching 采样:用 Flow Matching 学习从噪声到目标的直线路径,配合重参数化直接预测干净的运动序列,一步采样可达到接近 50 步的唇同步质量,实现 32.43 FPS 的实时速度。
  • 统一习惯空间:构建可插值的低维习惯向量空间,将数据集中真人的嘴部运动统计压缩为 one-hot 编码,参考视频则通过习惯提取器编码进同一空间,两种入口可自由切换甚至插值混合。
  • 两阶段训练策略:先在 380 人规模的 HDTF 上用 one-hot 编码学习”什么是习惯”,再在大规模 CelebV-HQ 上改用参考视频训练泛化能力,周期性回放 one-hot 数据防止遗忘,使习惯相似度从 0.33 提升至 0.64。
  • PLAD 评估指标:将嘴部运动投影到张嘴幅度、嘴唇收拢、嘴唇拉宽三个发音轴,用分布直方图对比参考人计算相似度,首次为”说话习惯像不像”提供量化标准。

微信关注回复“开源”,加入AI开源项目交流群

如何使用TalkLikeYou

  • 环境准备:用 Linux 系统,安装 Python 3.10 + CUDA 12.1 + FFmpeg,确保 NVIDIA 显卡显存至少 12GB。
  • 下载代码:从 GitHub 克隆 TalkLikeYou 主仓库。
  • 安装依赖:运行 conda env create -f environment.yaml 创建环境并激活,或自行安装 CUDA 版 PyTorch 后执行 pip install -r requirements.txt。
  • 下载权重:通过 Hugging Face 命令 hf download doubi-killer/TalkLikeYou 将模型权重下载到仓库根目录。
  • 准备素材:准备一张人像照片(或视频)和一段音频,输入视频需为 25 FPS。
  • 运行推理:执行 python -m talklikeyou --source 照片 --audio 音频 --person-id 192 --sampling-steps 1 生成视频,换 --person-id 即换说话习惯。
  • 自定义习惯:将 --person-id 替换为 --habit-reference 指向一段至少 100 帧的参考视频,即可模仿该视频中人物的说话习惯。
  • 视频配音:将 --source 指向视频文件并添加 --pose-mode source,只替换嘴部动作并保留原始头动。

TalkLikeYou的核心优势

  • 说话习惯专属模仿:业内首个将个人嘴部说话习惯作为一等公民建模的开源框架,可通过编号或视频指定,摆脱”千人一面”的平均嘴。
  • 实时速度快:一步 Flow Matching 采样实现 32.43 FPS,比图像扩散路线的 Sonic快近百倍,且单张 RTX 3090 显存占用不足 4GB。
  • 画质与同步兼优:FID 7.71 不到第二名三分之一,Sync-C 8.73 全场最高,兼顾唇部同步与画面质量。
  • 习惯相似度领先:PLAD 指标习惯相似度 0.62,显著高于 MimicTalk(0.48)、PC-Talk(0.39)等竞品。
  • 两入口灵活定制:支持官方预设编号零成本切换风格,支持任意参考视频现学,可插值创造新习惯。

TalkLikeYou的项目地址

  • 项目官网:https://bq-wang0511.github.io/TalkLikeYou/
  • GitHub仓库:https://github.com/BQ-Wang0511/TalkLikeYou
  • HuggingFace模型库:https://huggingface.co/doubi-killer/TalkLikeYou
  • arXiv技术论文:https://arxiv.org/pdf/2610.06658

TalkLikeYou的同类竞品对比

对比维度 TalkLikeYou(中科院自动化所) SoulX-LiveAct(Soul AI Lab)
核心定位 实时说话头生成 + 个人说话习惯模仿 实时数字人 + 小时级长时稳定生成
技术路线 运动空间两阶段(轻量参数 + 渲染) 自回归扩散(AR Diffusion),像素级生成
核心技术 一步 Flow Matching、统一习惯空间、两阶段训练 Neighbor Forcing(同扩散步对齐相邻帧)、ConvKV Memory(恒定显存)
生成速度 32.43 FPS 20 FPS(双卡 H100/H200)
端到端延迟 未明确披露(流式缓冲可调) 0.94 秒
时长上限 片段级生成(无长时优化) 小时级甚至无限时长,显存恒定
说话习惯 支持(编号 / 参考视频 / 插值) 不建模个人嘴部习惯
动作范围 仅嘴部 + 头部姿态 全身动作,表情、手势、情绪均可控(比心、捂脸、大笑)
驱动方式 音频驱动(照片/视频) 图像 + 音频 + 文本指令驱动

TalkLikeYou的应用场景

  • 虚拟主播/直播带货:低成本打造具有个人说话习惯的虚拟主播,4GB 显存可本地实时运行,无需真人出镜。
  • 多语言视频配音:替换视频中人物的嘴部动作并保留原有头动时序,让译制片或出海内容的口型与目标语言自然匹配。
  • 数字分身/虚拟客服:结合大模型与语音合成构建实时对话分身,应用于在线客服、智能导览等需要”面对面”交互的场景。
  • 个性化教育/培训:为教师或培训师创建专属数字形象,复刻其独特的说话风格,用于录制课程或远程教学。