project
LingBot-World 2.0 - 蚂蚁灵波科技开源的实时交互世界模型
LingBot-World 2.0 是蚂蚁灵波科技开源的实时交互世界模型,能像游戏一样被实时游玩。游戏支持移动、攻击、施法、跳跃等操作及雨雪等环境事件,可小时级连续...
LingBot-World 2.0是什么
LingBot-World 2.0 是蚂蚁灵波科技开源的实时交互世界模型,能像游戏一样被实时游玩。游戏支持移动、攻击、施法、跳跃等操作及雨雪等环境事件,可小时级连续生成画面不漂移,高配下可达720P/60FPS。目前模型已开源14B及1.3B Small、Bidirectional、Causal Pretrain 四个版本,可用于游戏、具身智能模拟与交互数据生成。
LingBot-World 2.0的主要功能
-
实时交互探索:模型以 720P / 60FPS、亚秒级延迟实时生成可自由行走、转视角的开放世界。
-
多样化角色动作:支持攻击、射箭、施法、射击、跳跃、滑翔等丰富操作。
-
环境事件驱动:可响应下雪、下雨等文本驱动的动态世界事件。
-
小时级长时程生成:长时间游玩画面保持一致,不漂移、不崩坏。
-
智能体协作操控:内置”玩家 Agent + 导演 Agent”,分别负责角色行为规划与场景元素合成。
-
多人共享世界:支持多人同时沉浸于同一生成世界,协作塑造场景。
-
具身智能模拟:从游戏世界延伸到机器人模拟、未来状态预测与交互数据生成。
-
轻量化本地部署:1.3B Small 版可在消费级单卡 GPU 上实时运行。
LingBot-World 2.0的技术原理
-
因果预训练范式:通过精心设计的因果预训练(Causal Pretrain)达成无上限的交互时程,同时维持输出质量长期一致,这是长时程不漂移的核心。
-
实时蒸馏:从基座模型蒸馏出实时变体(Bidirectional 模型作为高质量蒸馏源),保证推理速度足以驱动 720P/60FPS 视频流。
-
动作条件视觉动力学:从第一人称、合成及网络海量视频中学习”动作-画面”条件动态,使模型能将操作和事件忠实落地为视觉变化。
-
双智能体架构:首创 Agentic Harness——Pilot Agent 规划执行角色行为,Director Agent 随场景推进合成新环境元素,实现 Agent 驱动与用户干预的结合。
-
大小模型协同:14B 主模型搭配 1.3B 轻量模型,兼顾效果与单卡可部署性,降低研究复现门槛。
微信关注回复“开源”,加入AI开源项目交流群
如何使用LingBot-World 2.0
-
无限交互时程:因果预训练范式让模型可小时级连续生成且画面长期不漂移,突破传统视频模型的时长瓶颈。
-
实时流畅体验:蒸馏出的实时变体支持 720P / 60FPS、亚秒级延迟,真正达到”可玩”的交互水准。
-
交互元素丰富:覆盖攻击、射箭、施法、射击等多样动作及文本驱动的雨雪等环境事件,互动维度大幅扩展。
-
首创双智能体架构:Pilot Agent 负责角色行为规划、Director Agent 负责动态合成场景元素,Agent 驱动与用户干预并行不悖。
-
多人协作共享:支持多用户同时进入同一生成世界,一人游玩、一人导演,改变传统单机生成模式。
-
部署门槛低:1.3B Small 版仅需消费级单卡 GPU 即可实时运行,个人开发者也能本地复现。
LingBot-World 2.0的核心优势
-
超长时程:因果预训练支持小时级连续生成,画面长期不漂移。
-
实时可玩:蒸馏实时变体实现 720P/60FPS、亚秒级交互延迟。
-
交互丰富:覆盖攻击、射箭、施法、射击等动作及文本驱动的环境事件。
-
双 Agent 架构:Pilot Agent 规划角色行为,Director Agent 动态合成场景。
-
多人协作:支持多用户共享同一生成世界,一人游玩一人导演。
-
低门槛部署:1.3B Small 版消费级单卡 GPU 即可本地实时运行。
-
场景多元:从游戏世界延伸到机器人模拟、未来预测与交互数据生成。
LingBot-World 2.0的项目地址
- 项目官网:https://technology.robbyant.com/lingbot-world-v2
- GitHub仓库:https://github.com/robbyant/lingbot-world-v2
- HuggingFace模型库:https://huggingface.co/robbyant/lingbot-world-v2-14b-causal-fast
- arXiv技术论文:https://arxiv.org/pdf/2607.07534
LingBot-World 2.0的同类竞品对比
| 维度 | LingBot-World 2.0(蚂蚁灵波) | Genie 3 (Google DeepMind) |
|---|---|---|
| 出品方 | 蚂蚁集团灵波科技(Robbyant) | Google DeepMind |
| 实时规格 | 720P / 60FPS,亚秒级控制延迟 | 720p / 24fps,实时响应 |
| 一致性时长 | 小时级连续生成不漂移 | 约 1 分钟画面一致性 |
| 交互方式 | 攻击、射箭、施法、射击等动作 + 文本事件 + 双人协作(玩家/导演) | 键盘/鼠标控制角色移动、交互物体、指令生成物体 |
| 多人协作 | 支持多人共享同一生成世界 | 暂不支持 |
| 技术路线 | 因果预训练 + 实时蒸馏 + Pilot/Director 双 Agent 架构 | 自回归扩散模型 + 可扩展潜空间(1.5T 参数) |
| 开放程度 | 完全开源:代码 + 14B/1.3B 四款权重 + 技术报告 | 闭源,仅通过 Gemini Ultra 订阅体验;Project Genie 已开放游戏原型测试邀请 |
LingBot-World 2.0的应用场景
-
AI 游戏开发:作为实时生成式游戏引擎,根据玩家操作动态生成关卡、场景与事件,降低 3A 级内容生产成本。
-
影视与虚拟拍摄预演:导演用文本指令实时搭建并漫游虚拟场景,快速预览镜头与氛围,大幅压缩前期置景和改稿周期。
-
具身智能训练场:为机器人提供高仿真、可交互的模拟环境,训练感知、决策与长时程交互能力,减少真机试错成本。
-
VR/AR 与数字文旅:生成可无限探索的沉浸式虚拟空间,应用于虚拟展览、文旅导览和多人协同的元宇宙体验。
-
交互式教育与培训:构建可操作的虚拟实验、应急演练和历史场景,学习者在”可玩的世界”中获得比看视频更深入的沉浸训练。