大晓机器人开源3D双手形状重建模型ACE-Ego-Hand
盖世具身智能获悉 近日,大晓机器人联合香港中文大学多媒体实验室、南洋理工大学、上海交通大学等机构,开源了面向第一视角视频的 3D 双手形状重建模型 ACE-Ego-Hand,并已产出约5000小时训练数据。
ACE-Ego-Hand首次将视频生成模型作为ACE-Ego-Hand编码器,实现端到端训练,只需对整段视频进行一次分析,就能直接输出双手的姿态、形状和 3D 位置。
不仅如此,与此前依赖逐帧检测、窗口式时序回归或多步骤扩散采样的手部模型相比,ACE-Ego-Hand 将视频扩散模型改造成几何编码器,单次前馈恢复连续的双手 3D 轨迹:降低了推理延迟和误差累积,使模型能够利用完整视频片段中的上下文信息恢复被遮挡或暂时离开视野的手形轨迹。
图片来源:大晓机器人
传统视频扩散模型通常需要经过多步去噪采样,逐步生成中间视频或像素结果,再从生成结果中估计手部姿态。这种流程不仅计算成本高,也会增加生成误差向后续姿态估计传播的风险。
ACE-Ego-Hand 去掉了这一多步骤去噪过程,不再将视频扩散模型作为像素空间的生成器使用,而是将其改造成确定性的几何编码器。输入视频经过 VAE 压缩后,模型直接在干净潜变量上进行一次前向传播,并从视频扩散 Transformer 的中间层读取时空特征。随后,这些特征被直接送入双向时空解码器,由模型端到端地输出双手姿态、形状、可见性和 3D 空间位置。
据悉,在单张 A100 GPU 上,ACE-Ego-Hand 达到约 63.1 fps,约为 ViDiHand 高精度配置下的 33 倍效率,为大规模处理产线第一视角操作视频提供了效率基础。
ACE-Ego-Hand 另一核心创新是在手部被遮挡或离开视野后,推理恢复其运动轨迹。
这一能力来自模型的双向时空推理机制。传统因果模型主要根据过去帧预测当前结果,手部离开画面后只能进行单向外推,容易产生漂移。ACE-Ego-Hand 则对整段视频进行联合分析,不使用因果掩码,因此处理某个时刻时,可以同时利用手部消失前和重新出现后的信息。
手部消失前的画面能够提供运动起点、速度和方向,手部重新出现后的画面则提供运动终点和姿态约束。模型通过前后两侧的信息共同推断中间的不可见区间,从而保持手部身份和轨迹连续。
ACE-Ego-Hand 的另一项关键能力,是在测试阶段无需显式输入相机内参,仅通过头戴式第一视角视频,即可恢复手部在相机坐标系下的度量 3D 位置。此外,ACE-Ego-Hand支持原生鱼眼超广角输入,面对鱼眼图像显著的径向畸变,模型无需提前标定相机、做图像去畸变,直接从畸变画面预测像素到三维空间的观测射线,完成手部度量 3D 位置恢复。模型不仅判断“手在画面中的哪里”,还进一步估计“手距离相机多远”,实现从二维定位到度量 3D 运动恢复的扩展。
对于产业而言,ACE-Ego-Hand 的价值不只是提升单帧手部姿态识别精度,而是将第一视角视频转化为连续、稳定且具有度量尺度的双手 3D 轨迹。它可以服务于产线操作数据采集、机器人示教、人工装配过程分析、灵巧手动作重定向和模仿学习数据构建等场景。尤其是在手部经常被工件遮挡、暂时离开画面以及相机快速运动的真实环境中,模型能够减少轨迹中断和手部丢失,为机器人从人类操作视频中学习完整动作过程提供数据基础。
来源:第一电动网
作者:盖世汽车
本文地址:
以上内容转载自盖世汽车,目的在于传播更多信息,转载内容并不代表第一电动网(www.d1ev.com)立场。
文中图片源自互联网,如有侵权请联系admin@d1ev.com删除。

