AB
AiBoss站
快讯

Odyssey 发布生成式世界模型 Odyssey-3,开放免费研究预览

美国加州 AI 公司 Odyssey 推出世界模型 Odyssey-3 的公开研究预览,可由文本提示实时生成可交互环境。官方称其在物理基准测试中取得领先成绩,但相关纪录的测试方式存在争议,且成绩由公司自行提交。

核心事实

据 the-decoder.com 报道,总部位于美国加州的 AI 公司 Odyssey 已推出其世界模型 Odyssey-3 的公开研究预览版。用户可通过文本提示生成可交互环境,并实时在其中探索;演示支持第一人称与第三人称视角切换,可触发事件并观察模型实时响应。免费在线演示基于 Odyssey-3 Flash 运行,开发者可申请 API 访问权限。

据该公司介绍,Odyssey-3 基于自回归扩散 Transformer,依据此前帧与用户操作持续生成新视频帧,训练数据包括带事件描述的互联网视频、配有键鼠输入的电子游戏录像以及模拟物理交互。官方基准提交显示,基础模型为 140 亿参数,生成 832 × 480 像素视频;Odyssey-3 Pro 支持 1280 × 720 像素。

背景与影响

Odyssey 由 Oliver Cameron 与 Jeff Hawke 于 2023 年创立,两人于 9 月 15 日首次公布该模型,方向涵盖机器人、自动驾驶与电子游戏。公司称,同一世界模型可搭配专用控制器,用于机械臂、无人机与游戏角色控制;在演示中,基于 Odyssey-3 的 AI 可自主游玩 GTA V,并有控制器在约两小时游戏录像训练后迁移至另一款游戏。Odyssey 还表示正与瑞士机器人公司 Flexion 合作开发人形机器人控制器。世界模型赛道竞争激烈,Google DeepMind 的 Genie 3 与 Fei-Fei Li 创办的 World Labs 均在推进类似技术。

限制与来源

需注意,官方宣称的物理基准成绩附有重要前提。据报 Odyssey-3 Pro 在 Physics-IQ Verified 的视频到视频基准上取得 66.1 分,但该成绩来自单次测试运行,且使用筛选方法从每个任务的八个生成视频中挑选一个;基准规则要求四次运行并报告标准差,该纪录未达此标准。不使用筛选方法时,四次运行平均为 63.37 分。两项结果均出现在官方排行榜上,但由 Odyssey 自行提交。WorldMark 基准上的排名同样基于公司自评。机器人、无人机与自主系统等应用仍需进一步开发。上述功能、可用范围与访问方式可能变化,请以 Odyssey 官网当前信息为准。