具身智能新手名词表English

10训练与学习方法

模型怎么学出来:模仿学习、强化学习、预训练和微调,以及让它更稳的技巧。 · 203 条

  1. 10.1学习范式总览5
  2. 10.2训练基本功25
  3. 10.3损失函数与训练目标13
  4. 10.4模仿学习7
  5. 10.5强化学习核心概念20
  6. 10.6强化学习经典算法22
  7. 10.7奖励从哪来17
  8. 10.8离线强化学习13
  9. 10.9预训练与表征学习24
  10. 10.10微调与后训练25
  11. 10.11从仿真到真机23
  12. 10.12推理时提升与快速适应9

10.1学习范式总览

数据备好后,先认识几种基本学法:有答案、没答案、自造答案、照示范、靠奖励。

10.2训练基本功

不管哪种学法,训练都是算损失、求梯度、更新参数,还要防过拟合、保稳定。

10.3损失函数与训练目标

把上一节的损失函数展开讲:回归、分类、序列预测和扩散生成各用什么目标。

10.4模仿学习

套用前面的监督训练照人类示范学动作,并看它为什么会越走越偏。

10.5强化学习核心概念

示范之外的第二条路是靠奖励试错,先掌握奖励、回报、价值这些基本概念。

10.6强化学习经典算法

把上一节的概念落成具体算法:从策略梯度、PPO 到 DQN、SAC。

10.7奖励从哪来

算法有了还得给对奖励:手写、从示范或模型学出来,以及奖励稀疏时怎么办。

10.8离线强化学习

前面的算法都要边交互边学,这一节改为只用现成数据学策略,再接上在线微调。

10.9预训练与表征学习

从强化学习转到大模型路线:先在海量多源数据上预训练、学出通用表征。

10.10微调与后训练

预训练完再适配具体任务:微调、监督和强化学习后训练,以及防遗忘和蒸馏。

10.11从仿真到真机

落到机器人上:仿真里大规模练、迁到真机,再在真机上靠试错和人工纠正接着学。

10.12推理时提升与快速适应

训练收尾后,不改或少改权重也能变强:推理时多算,或快速适应新任务。

在完整名词表里查看 →