具身智能新手名词表English

端到端

End-to-EndE2E入门必知

用一个模型从原始传感器输入直接输出控制指令,中间不拆成人工设计的模块。

传统机器人系统是模块化流水线:感知模块识别物体和位姿,规划模块算路径,控制模块跟踪轨迹,各模块单独设计、单独调参,彼此通过人定义的接口(如物体坐标)传递信息。端到端则把整条链路交给一个神经网络,从相机图像、本体状态等原始输入直接输出关节位置或力矩指令,用同一个目标整体训练。机器人领域的代表性早期工作是 Levine、Finn 等人的深度视觉运动策略(2015 年预印本、2016 年发表),用约 9.2 万参数的卷积网络把图像直接映射成电机力矩。好处是少了人工设计,误差不会在模块间层层传递,性能能随数据增长;代价是需要大量数据,出了错难以定位原因。如今的 VLA 大多被称为端到端模型。

例子Levine 等人让 PR2 机器人的策略网络直接读取原始相机图像(外加关节角等机器人自身状态)、输出各关节电机力矩,学会了拧瓶盖、把衣架挂到衣杆上等任务,测试时没有单独的物体检测或位姿估计模块。

也叫
端到端模型、End-to-End Model、端到端学习、End-to-End Learning
相关
视觉运动策略、视觉-语言-动作模型、分层架构、感知-规划-行动范式、模仿学习、端到端视觉运动策略(引导策略搜索)
来源
End-to-End Training of Deep Visuomotor Policies (arXiv 1504.00702)

在完整名词表里查看 →