长程任务
Long-horizon Task入门必知要连续完成多个子步骤、持续较长时间才能达成目标的任务。
长程任务指要连续执行很多步、跨越多个子目标的任务,比如「收拾餐桌」要依次收盘子、倒残渣、放进水槽。难点主要有三个:一是误差累积,前一步的小偏差让后面的状态越来越偏离训练数据;二是成功信号往往到最后才出现,很难判断中间哪步做错;三是要记住做过什么、决定下一步做什么。基准 CALVIN(2021)把 34 种子任务串成每条 5 个指令的序列来评测,论文中的模仿学习基线在同环境训练测试时,连做 1 个的成功率约 49%,连做 5 个只有 0.08%。常见对策有分层架构(上层大模型拆任务、下层策略执行原子技能)、记忆模块和失败恢复。
例子「收拾餐桌」:依次把盘子、杯子放进收纳箱,把纸巾扔进垃圾桶,最后擦桌面,任何一步失败整体都算没完成。
- 也叫
- 长时序任务、长视野任务、长周期任务、多阶段任务
- 相关
- 原子技能、分层架构、复合误差、失败恢复、具身记忆、CALVIN
- 来源
- CALVIN: A Benchmark for Language-Conditioned Policy Learning for Long-Horizon Robot Manipulation Tasks (arXiv:2112.03227)