project
LTX-2.5 - LTX 开源的 AI 视频生成基础模型
LTX-2.5 是 LTX 开源的 AI 视频生成基础模型,拥有 22B 参数,发布即开放权重。模型支持原生多镜头生成、4K HDR 与 RAW/EXR 专业工作流,可同步生成音频,具...
LTX-2.5是什么
LTX-2.5 是 LTX 开源的 AI 视频生成基础模型,拥有 22B 参数,发布即开放权重。模型支持原生多镜头生成、4K HDR 与 RAW/EXR 专业工作流,可同步生成音频,具备精确视频编辑能力。在闭源模型日益高价化的当下,LTX-2.5 以开放生态策略为 AI 视频领域提供专业级的开源替代方案。
LTX-2.5的主要功能
- 原生多镜头生成:单次生成即可输出多个不同机位和景别的连续镜头,在镜头切换间保持角色形象、环境氛围、光线条件和声音的高度一致,解决 AI 剧情创作中镜头连续性的核心痛点。
- 扩散保真渲染:根据场景复杂度自适应分配渲染算力,复杂动态镜头获得更多计算资源,静态或简单场景则自动节省,在保障画质的同时提升整体效率。
- 精确视频编辑:在保留原始实拍素材运动轨迹与空间结构的基础上,进行高精度的风格改写、场景重绘与角色替换,实现”实拍骨架 + AI 风格化覆膜”的可控创作。
- 自动时长预测:内置 Duration Head 模块,读取提示词中的动作描述后自动判断最合适的片段长度,无需创作者反复试验。
- 专业级输出格式:支持原生 4K HDR、RAW 与 EXR 无损格式输出,可直接接入专业影视调色、特效合成与后期剪辑管线。
- 同步音频生成:通过独立 Audio VAE 模块,为视频同步生成匹配的声音轨道。
- IC-LoRA 精确控制:提供 Canny 边缘、Depth 深度、Pose 姿态三种参考视频控制模式,让生成结果严格遵循参考素材的构图、空间结构或人物动作。
LTX-2.5的技术原理
- Gemma 4 12B 文本编码器:Lightricks 专为 LTX 定制的大语言模型编码器,能够完整保留复杂长提示中的多主体关系、动作细节、光照描述和镜头方向,不会因提示变长而丢失子句信息。
- Prompt Enhancer:一个轻量级辅助模型,自动将用户输入的简短提示扩展为详细的电影级指令,降低提示词工程门槛,且计算开销极低。
- Diffusion Video Decoder:替代传统 VAE 解码器的新架构,专门针对快速运动场景优化,显著减少画面涂抹和伪影,使人脸更清晰、文字更可读。
- Audio VAE:独立的音频潜空间编码器,负责将视频内容映射为匹配的音频表征,实现画面与声音的同步生成。
- Diffusion Fidelity Rendering:采用”先结构后细节”的两阶段渲染策略。第一阶段在 8× 时间压缩的潜空间中构建运动、构图和镜头框架,并自适应生成高保真关键帧;第二阶段从结构和关键帧共同扩散渲染出最终视频,以像素级精度解析纹理、材质和面部细节。
- Duration Head:部署在扩散过程之前的预测模块,通过理解提示词中的动作语义,自动推断并输出最合适的视频时长,使模型具备对叙事节奏的初步感知能力。
微信关注回复“开源”,加入AI开源项目交流群
如何使用LTX-2.5
-
选择路径:决定使用 API 云服务或 ComfyUI 本地部署。
-
API 接入:在 LTX 官网申请 API Key,选择 Fast或 Pro档位调用接口。
-
安装节点:本地部署需更新 ComfyUI 至最新版,并通过 Manager 安装
ComfyUI-LTXVideo节点包。 -
下载模型:在 ComfyUI 模板浏览器搜索 “LTX-2.5″,选择对应工作流后一键下载所有模型文件。
-
配置参数:设置宽高为 32 的倍数、帧数为 1+8 的倍数、帧率 24/25/48/50fps,基础分辨率设为目标的一半以启用 2× 放大。
-
撰写提示词:用一段连贯散文描述镜头景别、场景光照、角色动作、相机运动和音频,避免标签堆叠或权重语法。
-
执行生成:点击运行,文生视频直接出片,图生视频需上传首帧,首尾帧模式需上传首帧与尾帧。
-
精确控制:进阶用户可加载 Canny、Depth 或 Pose 模式的 IC-LoRA,接入参考视频实现构图或动作锁定。
-
模型选择:快速迭代用 distilled 模型,最终出片用完整 dev 模型以获得更细腻的细节。
LTX-2.5的核心优势
- 叙事连贯性:原生 Multishot 多镜头生成能力,单次输出可保持角色形象、环境氛围、光线条件和声音的高度一致,从根本上解决 AI 剧情创作中镜头连续性的最大痛点。
- 可控性跃升:精确视频编辑保留原始实拍素材的运动轨迹与空间结构,配合 Canny/Depth/Pose 三种 IC-LoRA 控制模式,实现从”盲目抽卡”到”实拍骨架 + AI 风格化覆膜”的可控生产转变。
- 工业级工作流:原生 RAW/HDR/EXR 输出可直接接入专业调色、特效合成与后期剪辑管线,无需压缩转码,满足影视工业对无损素材的刚性需求。
- 自适应效率:Diffusion Fidelity Rendering 技术按场景复杂度动态分配渲染算力,复杂动态镜头精细渲染、静态简单场景自动节省资源,在保障像素级画质的同时提升整体生成效率。
LTX-2.5的项目地址
- 项目官网:https://ltx.io/model/ltx-2-5
- HuggingFace模型库:https://huggingface.co/Lightricks/LTX-2.5
LTX-2.5的同类竞品对比
| 对比维度 | LTX-2.5 | Minimax H3 |
|---|---|---|
| 出品方 | Lightricks(以色列) | MiniMax(中国) |
| 发布时间 | 2026 年 8 月 | 2026 年 8 月 |
| 开放程度 | 22B 权重完全开源,可本地部署与微调 | 权重部分区域开放(排除美/英/欧/韩),不支持本地微调 |
| 参数规模 | 22B(公开) | 未公开 |
| 最大分辨率 | 4K (3840×2160) | 2K(固定) |
| 最大时长 | 20 秒 | 10 秒 |
| 原生多镜头 | 支持 | 不支持 |
| 同步音频 | 支持 | 未开放 |
| 输入模式 | 文本 / 图像 / 音频 | 文本 / 图像 |
| 输出格式 | 4K HDR、RAW、EXR 无损 | 常规压缩格式 |
| 可控性 | 精确视频编辑 + IC-LoRA(Canny/Depth/Pose) | 主要依赖提示词驱动 |
LTX-2.5的应用场景
- 专业影视后期:原生 4K HDR、RAW 与 EXR 无损输出可直接接入调色、特效合成与剪辑管线,满足院线及流媒体级别的后期制作需求,无需忍受压缩 MP4 的调色噩梦。
- AI 短剧与漫剧:Multishot 多镜头生成一次性输出连贯叙事分镜,精确视频编辑支持”真人实拍动作骨架 + AI 角色替换与风格化覆膜”,从根本上解决镜头连续性与动作可控性两大死穴。
- 广告与品牌内容:快速迭代高质量商业视频,利用 Prompt Enhancer 降低提示词工程门槛,Distilled 模型支持快速预览,完整模型输出最终成片,兼顾效率与品质。
- 物理 AI 与机器人:Physical AI Checkpoint 为具身智能团队提供世界模型基础,帮助机器人系统感知物理世界和运动规律,超越纯内容创作范畴。