辅助损失 / 辅助任务
Auxiliary Loss / Auxiliary Task进阶主训练目标之外额外加的预测任务和损失项,帮模型学到更好的特征。
辅助任务是指在主训练目标(比如输出动作、最大化奖励)之外,让同一个网络再做一些相关预测,每个预测对应一项辅助损失,按权重加进总损失一起优化。它们和主任务共用骨干网络(负责提取特征的主干部分),多出来的监督信号能让特征学得更快、更稳;推理时这些额外分支通常直接丢掉。强化学习里奖励稀疏、学习信号弱,辅助任务尤其有用:DeepMind 2016 年的 UNREAL 智能体加了像素控制、奖励预测、价值回放三类辅助任务,在 3D 迷宫 Labyrinth 上学习速度约快 10 倍。机器人模仿学习和 VLA 里也常让模型顺带预测未来画面、物体位置或子任务文字。辅助损失权重过大会和主任务争抢模型容量,需要调节。
例子DeepMind 2016 年的导航智能体在 3D 迷宫里学找目标时,同一网络还要预测画面深度、判断自己是否回到了走过的位置(回环分类);这两项辅助损失明显提升了导航表现。
- 也叫
- 辅助目标、Auxiliary Objective
- 相关
- 损失函数、表征学习、多任务学习、强化学习、稀疏奖励、骨干网络
- 来源
- Reinforcement Learning with Unsupervised Auxiliary Tasks (UNREAL, arXiv 1611.05397)
Learning to Navigate in Complex Environments (arXiv 1611.03673)