离线到在线强化学习
Offline-to-Online Reinforcement LearningO2O RL进阶先用现成数据做离线强化学习打底,再让机器人上线交互继续提升。
离线到在线强化学习分两步:先用已有数据(人类演示、历史日志、旧策略的轨迹)做离线强化学习,得到一个不必从零探索的初始策略和价值函数;再让智能体与真实环境交互收集新数据,在线微调。好处是省掉大量危险又昂贵的随机探索,这对真机尤其重要。难点在两段的衔接:离线阶段为防止高估而刻意保守,价值尺度往往不准,切到在线后性能常先掉一截。代表方法有 AWAC(2020)、校准 Q 学习 Cal-QL(2023),以及把离线数据直接混进在线回放池、从头训练的 RLPD(2023)。SERL、HIL-SERL 等真机强化学习系统和 π*0.6 的 RECAP 都沿用了这一思路。
例子SERL 以 RLPD 为核心算法,先放入 20 条用 SpaceMouse 遥操作采集的演示,再在真机上在线训练,平均 25–50 分钟就学会 PCB 板装配、线缆布线等任务。
- 也叫
- 离线-在线强化学习、Offline-to-Online Fine-tuning
- 相关
- 离线强化学习、在线强化学习、利用先验数据的强化学习、校准 Q 学习、真机强化学习、SERL
- 来源
- Nakamoto et al. 2023: Cal-QL: Calibrated Offline RL Pre-Training for Efficient Online Fine-Tuning
Ball et al. 2023: Efficient Online Reinforcement Learning with Offline Data (RLPD)
Luo et al. 2024: SERL: A Software Suite for Sample-Efficient Robotic Reinforcement Learning