AB
AiBoss站
快讯

生数发布Motus2世界模型,探索机器人自我进化

生数科技发布世界模型Motus2,将行动、预测与评估三种能力放入同一模型形成闭环,并加入触觉与记忆模块,探索机器人递归自我改进(RSI)。团队称相关能力仍处早期阶段。

生数发布Motus2世界模型,探索机器人自我进化

据量子位报道,生数科技发布世界模型Motus2,在前代Motus基础上把行动、预测、评估三种能力放进同一个模型:世界动作模型生成动作,条件动作世界模型预测动作后果,价值模型对结果打分。三者形成“生成动作→预测后果→评估结果→更新策略”的闭环,团队称这是对递归自我改进(RSI)的一次初步探索。模型还新增轻量级触觉专家模块与记忆机制,并已部署在单手22自由度的Sharpa Wave、单手20自由度的WUJI Hand 2等平台,展示拧灯泡、翻书、多指操作等任务。

背景与影响

传统机器人策略模型学习的是“看到A就做B”的统计关联,环境变化后容易失效。Motus2采用Action-first信息流,先由当前观测生成动作,再预测后果、评估结果,避免提前“偷看”未来画面。推理阶段用Best-of-N规划挑选候选动作,训练阶段将打分转化为策略更新信号,团队称之为基于模型的强化学习,且只更新动作相关参数。数据方面,团队构建约13万小时人类第一视角Ego数据体系,分单目视频预训练、双目与人类动作数据、机器人领域适配三步。团队称,在同样微调流程下,仅用人类Ego数据预训练的模型五项真机任务平均成功率为51%,加入机器人中间训练后升至84%。

限制与来源

需要说明的是,这里的“自进化”指利用模型自身的预测和价值反馈持续改进策略,并不意味着机器人已能在开放环境无限自主学习。团队也承认,触觉数据在不同机器人本体间迁移仍困难,长任务预测可靠性、长期记忆效率与开放世界持续学习均待探索。上述成功率等数据来自团队自述,尚未获官方之外的独立确认;模型能力、支持平台与可用范围请以生数科技官网及项目主页当前信息为准。本文素材来自量子位报道,项目主页与论文链接见原文。