快讯
Reka AI 发布全能模型 Rho-1 研究预览版,单一网络处理文本图像视频与机器人控制
Reka AI 发布 Rho-1 研究预览版,这是一个 190 亿参数的全能模型,可在同一个神经网络中处理并生成文本、图像、视频与机器人控制动作,无需调用外部模型或工具。
核心事实
据 the-decoder.com 报道,Reka AI 已发布全能模型 Rho-1 的研究预览版。该模型拥有 190 亿参数,可在同一个神经网络中处理并生成文本、图像、视频以及机器人控制动作。
报道称,与多数将任务分派给专用模型的 AI 系统不同,Rho-1 把所有模态都作为 token 放进同一个共享上下文窗口中运行,不依赖工具调用或外部模型。该模型可实时生成连续视频,并在不重启的情况下即时响应新指令;用于预测摄像头图像的同一套权重也用于驱动机器人运动。
背景与影响
为绕开机器人训练数据稀缺的问题,Reka AI 构建了一个逆向动力学模型,从普通互联网视频中提取控制信号。报道称,Rho-1 的训练使用了 320 块 H100 GPU,历时约三个月。
Reka AI 在多模态 AI 领域并非新入局者。报道提到,该公司曾于 2024 年 4 月推出多模态语言模型 Reka Core,在基准测试中与 GPT-4、Claude 3 和 Gemini Ultra 竞争。此次发布也被认为契合当前 AI 研究向所谓「世界模型」推进的整体趋势。
限制与来源
需要说明的是,上述信息来自科技媒体 the-decoder.com 的报道,Rho-1 目前仅为研究预览版,其功能范围、可用地区、访问方式与许可条款尚未获官方完整确认,具体请以 Reka AI 官网当前信息为准。本文未对模型性能、定价或商用可用性作任何判断。