AB
AiBoss站
快讯

HSImul3R 发布:首个可仿真人–场景交互重建框架,让人类视频成为机器人技能来源

大晓机器人联合南洋理工大学 S-Lab、上海人工智能实验室发布人–场景交互重建框架 HSImul3R,被 ECCV 2026 接收。该框架将重力稳定性、真实接触与交互稳定性纳入重建标准,并支持单目视频输入,团队称其为首个面向非标定稀疏视角的稳定可仿真重建框架。

核心事实

据量子位转载内容,大晓机器人联合南洋理工大学 S-Lab、上海人工智能实验室发布人–场景交互重建研究 HSImul3R。该成果已被计算机视觉会议 ECCV 2026 接收。团队称其为首个面向非标定稀疏视角输入、实现稳定可仿真(Simulation-Ready)人–场景交互重建的框架,并进一步支持单目视频输入。

方法上,HSImul3R 提出物理闭环(Physics-in-the-Loop)双向优化框架:一方面通过面向场景的强化学习优化人体运动,使其物理可行并与当前场景稳定交互;另一方面通过直接仿真奖励优化(DSRO),利用仿真反馈反向优化三维场景。团队同时构建了面向人–场景交互的 HSIBench,用于检验重建结果能否在物理仿真中稳定交互。

背景与影响

传统三维重建多以几何准确、姿态还原和视觉对齐为主要标准,回答的是“重建得像不像”。但机器人面对的是由重力、碰撞、摩擦与接触共同决定的物理世界,视觉上可信的场景进入仿真器后可能失效,例如椅子结构缺失无法站稳,或人体与物体穿模。

据该内容,HSImul3R 在 Easy、Medium、Hard 三档任务中的交互稳定率分别为 53.68%、30.56% 和 13.92%,高于 HSfM 的 10.52%、4.50% 和 2.66%;人–场景三维穿模率从 69.51% 降至 22.90%。团队还将优化后的人体动作迁移至 Unitree G1 人形机器人,贯通从日常图像/视频到真实机器人执行的链路。若该路线成立,互联网上规模庞大的人类行为视频可能不再只是视觉数据,而有望成为机器人学习物理技能的来源之一。

限制与来源

上述数据与结论均来自发布方提供的材料,尚未获独立第三方验证。该路线据报仍处于早期阶段,复杂交互、多物体场景和动态环境存在大量挑战。相关代码、论文与项目页面信息请以官方渠道当前公布内容为准。本文不构成任何投资或采购建议。

来源:量子位(www.qbitai.com)转载内容,原文由大晓机器人提供。