您好,欢迎访问深圳晨昏线科技有限公司官网!

深圳晨昏线科技有限公司

您当前所在位置: 主页 > 新闻动态 > 企业新闻

不用机器人也能“教”机器人:UMI 通用操作接口深度解读

发布日期:2025-11-12  浏览次数:

UMI(Universal Manipulation Interface)把“人类自然演示 → 机器人可部署策略”的链路打通:带着一把配有 GoPro+IMU 的手持夹爪去真实场景录几段演示,就能训练出在不同机器人上零样本部署的通用策略,覆盖动态、双臂、精密、长时序等难任务。本文从创新点、方案优势、输入输出、模型架构、数据处理(精简版)、实验结果、原理小结、工程实践建议几方面进行解读。




创新点抓核心

1. 手持式数据采集设备:低成本、可携带的手持夹爪(广角摄像头+IMU+侧镜),无需机器人即可录制高精度 6DoF 操作数据。

2. 隐式立体视觉:侧置镜面带来“多视角”信息,单摄像头也能有深度线索

3. 延迟匹配(Latency Matching):在推理时显式补偿感知与执行延迟,动态任务不再“不同步”。

4. 相对轨迹动作空间:使用相对 SE(3) 轨迹而非绝对坐标/增量动作,跨机器人可复用

5. 硬件无关策略接口:基于 Diffusion Policy 建模多模态动作分布,对人类演示拟合更稳、泛化更强

image.png




方案优势对比看价值

· 不占机器人:采集阶段无需真机,外场成本直线下降。

· 跨硬件强:同一策略直接跑在 UR5、Franka 等不同平台,几乎零微调。

· 动作更“丰富”:不仅抓取,还能动态抛掷、双臂协同、精密与长时序

· 效率更高:手持演示直观、低延迟,采集吞吐约为传统 teleop 的

· 输入更通用GoPro 鱼眼 + IMU 的稳健视觉-惯性,不依赖外部标定或 MoCap。




输入 / 输出怎么喂 & 产出啥

输入(Observation)

· RGB 图像(鱼眼)

· 末端执行器相对姿态序列(6DoF)

· 夹爪宽度(连续)

· 可选:双臂相对姿态(inter-gripper)

输出(Action)

· 一段时间的相对 EE 位姿轨迹

· 夹爪开合宽度(连续)

时间同步由延迟匹配模块统一处理,训练分布 = 执行分布








模型架构

image.png

1) 视觉编码器 / 观测管线

· 输入是一段同步后的图像 + 相对 EE 位姿 + 夹爪宽度序列;图像来自腕部鱼眼并叠加“镜面数字反射”的多视角内容,保证足够上下文与深度线索。

· 视觉主干采用 CLIP / ViTViT-B/16 或 ViT-L/14),在复杂场景(液体/软体/遮挡/光照变化)上更稳。

2) 动作解码器(Diffusion Policy)

· 策略输出一段时间的相对 EE 轨迹序列与连续夹爪开合,天然适配“延迟补偿 + 执行跟踪”的控制闭环。

· Diffusion Policy 对人类演示的多模态动作分布拟合更稳;接口与算法解耦,ACT 等可替换。

3) 延迟与同步模块(Inference-time Matching)

· 观测侧:以相机为“最高延迟源”做时序对齐;相机 10–20 Hz,EE/夹爪线性插值;双臂级联软同步。

· 执行侧:按各硬件延迟提前下发命令;丢弃过时动作;最终使“计划时间”与“到达时间”一致。

· 收益:关节速度曲线更平滑、抛掷释放时机准确、动态动作稳定。

4) 动作空间表示(Relative SE(3) + 连续夹爪)

· 相对 SE(3) 作为动作与本体表征,减少全局坐标依赖与误差积累;移动底座不致退化。

· 连续夹爪扩大可完成任务集(如抛掷释放、软指力控制),显著优于二值开合。

5) 策略接口通用化(对硬件“去耦合”)

· 时延差异用延迟匹配解决;本体差异用相对表征 + 共享地图坐标解决。

· 结果:同一策略可跨平台零/微调部署




数据处理

· 采集与对齐:从 GoPro 提取视频 + IMU,按时间戳对齐成统一时间线。

· 建图与定位:以视觉-惯性 SLAM 生成场景地图,离线优化后导出相机/夹爪轨迹

· 标定与锚定:检测 ArUco/AprilTag,将 SLAM 坐标锚定到任务坐标系,并统计夹爪开合范围

· 轨迹标准化:统一为相对 SE(3) 轨迹 + 连续开合;双臂补充两夹爪相对位姿

· 数据集打包:生成任务计划与索引(如 dataset_plan),划分训练/验证,直接供策略学习。

落盘产物速记map_atlas(地图)、camera_trajectory(轨迹)、tx_slam_tag(坐标变换)、gripper_range(夹爪范围)、dataset_plan(训练清单)。




实验结果

任务

类型

成功率

关键考验

Cup Arrangement

单臂、精密

100%(UR5)/ 90%(Franka)

深度线索、动作多模态

Dynamic Tossing

动态抛掷

87.5%

延迟匹配 + 时序精度

Bimanual Cloth Folding

双臂协同

70%

互感知与同步抓取

Dish Washing

长时序

70%

液体/软体、语义鲁棒性

image.png

更多亮点

· 跨域泛化:未见过的咖啡馆桌面与水流台面,综合成功率约 72%,说明in-the-wild 数据”显著提升泛化。

· 采集效率UMI 采集吞吐在静态/精密任务上约为传统遥操作 ;在动态类任务上遥操作常失效。

· SLAM 精度:轨迹平均误差 < 1 cm / 4°,满足高精度动作重建。




为什么它行得通?

· 观测对齐:手持与部署均为腕部视角,极小化“人-机观测差”。

· 动作可迁移相对轨迹抹平绝对坐标/基座依赖,天然跨硬件。

· 时序稳延迟匹配把训练-推理的时间基准“拉齐”,动态任务不抖不飘。




工程实践建议上手就能用

1. 先做采集规范:固定镜面位置、统一相机参数;演示刻意覆盖多物体/多背景/多光照

2. 双臂必加“相对姿态”:没有 inter-gripper 相对位姿,协同动作极易“错拍子”。

3. 部署先标延迟:相机、控制器、夹爪延迟分别测量并写入推理补偿;否则动态类性能会大幅打折。




结语

UMI 把“外场数据采集 零样本部署”这条路走通:一把手持夹爪 + 一颗鱼眼相机 + 一套延迟与相对轨迹范式,即可把人类自然演示转成跨平台可用的机器人策略。对想把机器人快速带进真实世界的团队而言,这是成本友好、工程可落地的路径。


X

截屏,微信识别二维码

微信号:weixin88888

(点击微信号复制,添加好友)

打开微信

微信号已复制,请打开微信添加咨询详情!