10训练与学习方法
模型怎么学出来:模仿学习、强化学习、预训练和微调,以及让它更稳的技巧。 · 203 条
- 10.1学习范式总览5
- 10.2训练基本功25
- 10.3损失函数与训练目标13
- 10.4模仿学习7
- 10.5强化学习核心概念20
- 10.6强化学习经典算法22
- 10.7奖励从哪来17
- 10.8离线强化学习13
- 10.9预训练与表征学习24
- 10.10微调与后训练25
- 10.11从仿真到真机23
- 10.12推理时提升与快速适应9
10.1学习范式总览
数据备好后,先认识几种基本学法:有答案、没答案、自造答案、照示范、靠奖励。
10.2训练基本功
不管哪种学法,训练都是算损失、求梯度、更新参数,还要防过拟合、保稳定。
- 训练集 / 验证集 / 测试集Training / Validation / Test Set把数据分成三份:一份用来学,一份用来调参挑模型,一份留到最后检验。
- 真值Ground Truth被当作「标准答案」的真实数据,用来训练和评估模型。
- 损失函数Loss Function把模型预测和正确答案的差距算成一个数,训练就是不断把它调小。
- 梯度下降Gradient Descent沿损失函数梯度的反方向一步步调参数,让损失越来越小的优化方法。
- 反向传播Backpropagation用链式法则从输出往回逐层算梯度,是训练神经网络的核心算法。
- 优化器Optimizer根据梯度决定每一步如何更新模型参数的算法,如 SGD、Adam、AdamW。
- AdamW 优化器AdamW (Adam with Decoupled Weight Decay)把权重衰减从梯度更新里拆出来单独做的 Adam,训练大模型最常用的优化器之一。
- 超参数Hyperparameter训练开始前由人设定、不靠训练学出来的配置,比如学习率、批大小。
- 学习率Learning Rate梯度下降每次更新参数时迈出的步子大小,是最关键的超参数之一。
- 学习率调度(预热与余弦退火)Learning Rate Schedule (Warmup / Cosine Decay)让学习率随训练步数变化:先预热升上去,再按余弦曲线慢慢降下来。
- 批大小Batch Size每更新一次参数时,一起送进模型计算的样本数量。
- 训练轮次Epoch模型把整个训练集完整看过一遍,称为一个 epoch。
- 收敛Convergence继续训练时损失或回报几乎不再变化,模型进入稳定状态。
- 检查点Checkpoint训练中途或结束时保存下来的模型参数文件,加载后可推理或接着训练。
- 炼丹 / 调参(黑话)"Alchemy" (Slang for Model Training / Hyperparameter Tuning)中文圈对训练模型、反复试超参数的戏称,指主要靠经验和试错出结果。
- 随机种子与可复现性Random Seed & Reproducibility固定随机数起点让实验能重跑,并用多个种子检验结果是不是靠运气。
- 过拟合Overfitting模型把训练数据记得太死,换到没见过的新数据上就表现变差。
- 欠拟合Underfitting模型太弱或训练不够,连训练数据里的规律都没学会。
- 正则化Regularization训练时加约束或惩罚,防止模型死记训练数据,提升在新数据上的表现。
- 随机失活Dropout训练时随机「关掉」一部分神经元,防止网络死记训练数据的正则化方法。
- 早停Early Stopping验证集表现不再变好时就停止训练,取表现最好的那一版模型。
- 梯度消失 / 梯度爆炸Vanishing / Exploding Gradients反向传播时梯度逐层连乘后变得极小或极大,导致深层网络难以训练。
- 梯度裁剪Gradient Clipping梯度太大时按比例缩小到阈值以内,防止一步更新把模型带崩。
- 梯度阻断Stop-Gradient前向照常计算,反向传播时不让梯度从某个量往回传。
- 指数移动平均Exponential Moving Average对历史值按指数衰减加权求平均,常用来得到更平滑稳定的模型权重。
10.3损失函数与训练目标
把上一节的损失函数展开讲:回归、分类、序列预测和扩散生成各用什么目标。
- 均方误差Mean Squared Error预测值与真值之差的平方再取平均,是最常用的回归损失。
- L1 损失L1 Loss用预测值与真值之差的绝对值来计算误差的损失函数。
- 交叉熵Cross-Entropy衡量模型预测的概率分布离正确答案有多远,是分类任务最常用的损失。
- 最大似然估计 / 负对数似然Maximum Likelihood Estimation / Negative Log-Likelihood找一组参数让观测数据出现的概率最大;取负对数后就成了要最小化的损失。
- KL 散度Kullback-Leibler Divergence衡量一个概率分布偏离另一个分布有多远的量,而且不对称。
- 下一个 token 预测Next-Token Prediction根据前面所有 token,预测序列里下一个 token 的训练目标。
- 教师强制Teacher Forcing训练序列模型时每一步都喂真实的上一步,而不是模型自己的预测。
- 自强制Self Forcing训练时就让视频模型接着自己生成的画面往下生成,消除训练与推理的差异。
- 证据下界Evidence Lower Bound数据对数似然的一个可计算下界,VAE 和扩散模型都靠最大化它来训练。
- 去噪损失Denoising Loss (Diffusion Loss)扩散模型的训练目标:给干净数据加噪,让网络预测出加进去的噪声。
- 分数匹配Score Matching (Score Function)训练网络估计数据分布对数密度的梯度(分数),不必算归一化常数。
- 流匹配损失Flow Matching Loss让网络预测从噪声指向真实数据的速度方向,用均方误差来训练。
- 辅助损失 / 辅助任务Auxiliary Loss / Auxiliary Task主训练目标之外额外加的预测任务和损失项,帮模型学到更好的特征。
10.4模仿学习
套用前面的监督训练照人类示范学动作,并看它为什么会越走越偏。
- 行为克隆Behavior Cloning把专家演示当标注数据,用监督学习直接学「看到什么就做什么」。
- 复合误差Compounding Error模仿策略每步的小偏差不断叠加,把机器人带进没见过的状态而失败。
- DAgger(数据集聚合)Dataset Aggregation让策略自己去跑,专家为它走到的状态补标正确动作,合并数据后重训。
- 因果混淆Causal Confusion (Causal Misidentification)模仿学习把和专家动作相关、但不是原因的线索当成依据,部署时出错。
- 动作与状态归一化Action / State Normalization训练前把各维动作和本体状态缩放到统一范围,推理后再换算回真实数值。
- 目标条件模仿学习Goal-Conditioned Behavior Cloning把要达成的目标和当前观测一起输入策略的行为克隆。
- 从观测中模仿学习Imitation from Observation只看到示范的状态或视频、没有动作标签,也要学会模仿的一类方法。
10.5强化学习核心概念
示范之外的第二条路是靠奖励试错,先掌握奖励、回报、价值这些基本概念。
- 马尔可夫决策过程Markov Decision Process描述智能体看状态、做动作、拿奖励、进入新状态这一循环的标准数学框架。
- 奖励函数Reward Function强化学习里给智能体每一步行为打分的规则,告诉它什么算做得好。
- 回报Return从某一时刻起往后所有奖励(通常打折扣)加起来的总和。
- 折扣因子Discount Factor强化学习里给未来奖励打折的系数,决定智能体多看重长远回报。
- 探索与利用Exploration vs. Exploitation在「试新动作找更好办法」和「用已知最好的动作拿奖励」之间做权衡。
- 信用分配Credit Assignment最终拿到奖励或惩罚时,判断之前哪些动作该记功、哪些该担责。
- 价值函数Value Function估计「从当前状态出发、按某策略做下去,未来总共能拿多少奖励」的函数。
- 贝尔曼方程Bellman Equation把一个状态的价值拆成「眼前奖励 + 下一状态打折后的价值」的递推式。
- Q 函数Q-Function (Action-Value Function)在某状态先做某个动作、之后按策略行动,能拿到的期望回报。
- 优势函数Advantage Function衡量某个动作比按当前策略的平均水平好多少,等于 Q 值减 V 值。
- 策略迭代 / 价值迭代Policy Iteration / Value Iteration (Dynamic Programming)环境模型已知时,反复更新价值或策略来求最优策略的两种经典动态规划算法。
- 蒙特卡洛方法(蒙特卡洛回报)Monte Carlo Methods (Monte Carlo Return)靠大量随机采样求平均来估算;在强化学习里指用整局实际回报来估价值。
- 时序差分学习Temporal Difference Learning用「这一步奖励 + 下一状态的估计价值」来更新当前价值估计的方法。
- 自举Bootstrapping (in RL)用自己对下一状态价值的当前估计,来更新当前状态的价值估计。
- 样本效率Sample Efficiency学到同样水平要消耗多少数据或环境交互,用得越少效率越高。
- 无模型强化学习Model-Free Reinforcement Learning不学环境模型,直接从试错数据里学策略或价值函数的强化学习。
- 基于模型的强化学习Model-Based Reinforcement Learning先学一个能预测环境反应的模型,再靠它规划或「想象」来训练策略。
- 想象中学习Learning in Imagination (World-Model-Based RL)先学一个世界模型,再让策略在模型「想象」出的轨迹里训练。
- 同策略On-Policy只用当前策略自己刚采集的数据来更新,旧数据用完即弃。
- 异策略Off-Policy用来学习的数据可以来自别的策略,不必由当前策略亲自采集。
10.6强化学习经典算法
把上一节的概念落成具体算法:从策略梯度、PPO 到 DQN、SAC。
- 策略梯度Policy Gradient直接求期望回报对策略参数的梯度,沿梯度方向改进策略的方法。
- REINFORCE 算法REINFORCE最早的策略梯度算法:按整条轨迹的回报,调高带来高回报的动作的概率。
- 广义优势估计Generalized Advantage Estimation把多步时序差分误差按 λ 指数加权相加,来估计优势函数。
- 重要性采样Importance Sampling用一个分布采的样本,乘上两分布的概率比作权重,估计另一个分布下的期望。
- 信赖域策略优化Trust Region Policy Optimization每次更新都限制新旧策略差异(KL 散度)的策略梯度算法,PPO 的前身。
- 近端策略优化Proximal Policy OptimizationOpenAI 2017 年提出的强化学习算法,限制每次策略更新幅度,稳定好用。
- 组相对策略优化Group Relative Policy Optimization对同一输入采样一组结果,用组内相对得分代替价值网络的强化学习算法。
- Q 学习Q-Learning用「即时奖励 + 下一状态最大 Q 值」反复修正 Q 值的经典无模型强化学习算法。
- 深度 Q 网络Deep Q-Network用深度神经网络估计每个动作长期价值(Q 值)的强化学习算法。
- 经验回放Experience Replay (Replay Buffer)把智能体过去的交互数据存进缓冲区,训练时随机抽出来重复利用。
- 目标网络Target Network主网络的一个慢更新副本,专门用来算训练目标,让 Q 学习更稳定。
- Q 值高估Overestimation BiasQ 学习取最大值时把估计噪声一起放大,导致动作价值被系统性高估。
- 分布式价值函数Distributional Value Function不只预测平均回报,而是预测未来回报完整概率分布的价值函数。
- 确定性策略 / 随机策略Deterministic vs. Stochastic Policy确定性策略同一状态总给同一动作;随机策略给出动作的概率分布再采样。
- 深度确定性策略梯度Deep Deterministic Policy Gradient把 DQN 扩展到连续动作的演员-评论家算法,策略直接输出一个确定动作。
- 双延迟深度确定性策略梯度Twin Delayed Deep Deterministic Policy Gradient在 DDPG 上加三处改进、专门抑制 Q 值高估的连续动作强化学习算法。
- 软演员-评论家Soft Actor-Critic在追求高回报的同时鼓励动作保持随机的异策略强化学习算法。
- 熵正则化Entropy Regularization在训练目标里加一项策略熵的奖励,鼓励策略保持随机、多做探索。
- 熵坍缩 / 模式坍缩Entropy Collapse / Mode Collapse模型输出的多样性塌缩,只会给出少数几种答案或动作。
- 更新-数据比Update-to-Data Ratio每采集一步环境数据做几次梯度更新;越高越省数据,也越费算力。
- 多智能体强化学习Multi-Agent Reinforcement Learning多个智能体在同一环境里同时学习,彼此合作或竞争的强化学习。
- 自博弈Self-Play让智能体和自己(或自己的历史版本)对战,从胜负中不断变强。
10.7奖励从哪来
算法有了还得给对奖励:手写、从示范或模型学出来,以及奖励稀疏时怎么办。
- 稀疏奖励Sparse Reward只在完成任务等少数时刻给奖励,其余时间奖励都是 0。
- 稠密奖励Dense Reward几乎每一步都给反馈、告诉智能体离目标更近还是更远的奖励设计。
- 奖励塑形Reward Shaping在任务原始奖励之外加上中间引导分,让智能体更快学会任务。
- 奖励工程Reward Engineering为强化学习设计和调试奖励函数,让机器人学到真正想要的行为。
- 奖励黑客Reward Hacking智能体钻奖励函数的漏洞拿高分,却没完成设计者真正想要的任务。
- 逆强化学习Inverse Reinforcement Learning从专家的示范行为反推出它背后在优化的奖励函数。
- 生成对抗模仿学习Generative Adversarial Imitation Learning用判别器区分专家动作和策略动作,逼着策略学得像专家的模仿学习方法。
- 对抗运动先验Adversarial Motion Priors用判别器评判动作像不像动捕数据,把「像不像」当奖励来学自然动作。
- 奖励模型Reward Model训练出来的打分网络,给一段行为或结果打出「做得好不好」的奖励分。
- 进度奖励模型Progress Reward Model看当前画面判断任务完成了几成,并把这个进度当作奖励的模型。
- 成功检测器Success Detector判断机器人这一回合有没有把任务做成的模型,常用来给强化学习发奖励。
- VLM 作奖励模型VLM-as-Reward (Vision-Language Models as Reward Models)让视觉语言模型看画面、对照任务描述,给机器人的表现打奖励分
- 内在奖励Intrinsic Motivation (Curiosity-Driven Exploration)智能体自己给「新奇、预测不准」的状态发奖励,以此驱动探索。
- 无监督技能发现Unsupervised Skill Discovery不给任务奖励,让智能体自己练出一组彼此可区分的技能,留给后续任务调用。
- 目标条件强化学习Goal-Conditioned Reinforcement Learning策略和价值函数都把目标当输入,一个模型学会到达多种目标的强化学习。
- 后见之明经验回放Hindsight Experience Replay把没达成的尝试改标成达成了实际到达的目标,让稀疏奖励也能学起来。
- 分层强化学习Hierarchical Reinforcement Learning把决策拆成高层定子目标、低层执行具体动作的多层强化学习。
10.8离线强化学习
前面的算法都要边交互边学,这一节改为只用现成数据学策略,再接上在线微调。
- 在线强化学习Online Reinforcement Learning边与环境交互边学习,训练中不断用最新策略采集新数据。
- 离线强化学习Offline Reinforcement Learning只用事先收集好的固定数据集训练策略,训练中不再与环境交互。
- 外推误差Extrapolation Error (OOD Actions in Offline RL)离线强化学习中,Q 网络给数据里没出现过的动作乱估值而产生的误差。
- 策略约束Policy Constraint (Behavior Regularization)离线强化学习里,限制新策略不要偏离数据中行为策略太远的一类方法。
- 保守 Q 学习Conservative Q-Learning刻意压低数据集外动作的 Q 值,让离线强化学习不被虚高的估计带偏。
- 隐式 Q 学习Implicit Q-Learning只用数据集里已有的动作估值、从不查询没见过动作的离线强化学习算法。
- 优势加权回归Advantage-Weighted Regression按动作优势大小加权做模仿学习,优势越大越被模仿的强化学习算法。
- 回报条件化Return Conditioning把「想拿多少回报」当输入给策略,让它照着目标回报去行动。
- 优势条件化Advantage Conditioning训练时告诉策略每个动作「好不好」,部署时只让它生成「好」的动作。
- 离线到在线强化学习Offline-to-Online Reinforcement Learning先用现成数据做离线强化学习打底,再让机器人上线交互继续提升。
- 校准 Q 学习Calibrated Q-Learning给保守 Q 学习加「校准」约束,让离线预训练后能平滑转入在线微调。
- 利用先验数据的强化学习Reinforcement Learning with Prior Data在线强化学习时把离线数据和新采数据各取一半混合训练的简单高效方法。
- 动作分块强化学习Q-Chunking (Reinforcement Learning with Action Chunking)策略和 Q 函数都以「一段连续动作」为单位来做强化学习。
10.9预训练与表征学习
从强化学习转到大模型路线:先在海量多源数据上预训练、学出通用表征。
- 预训练Pre-training先在海量通用数据上训练出一个基础模型,之后再针对具体任务去适配。
- 下游任务Downstream Task预训练模型最终要拿去解决的具体任务,通常还要在它上面做适配或微调。
- 迁移学习Transfer Learning把在一个任务或领域学到的知识,拿来帮助学习另一个相关任务。
- 从零训练Training from Scratch参数随机初始化、不借用任何预训练权重,直接在目标数据上训练模型。
- 缩放定律Scaling Law模型效果随参数量、数据量、算力增加而按幂律稳定提升的经验规律。
- 骨化(模型骨化)Ossification模型权重像「僵住」一样,继续喂数据也吸收不了新信息的现象。
- 分布式训练(数据并行 / 模型并行)Distributed Training (Data / Model Parallelism)把一次训练拆到多张 GPU 或多台机器上同时算,以训更大的模型和更多数据。
- 混合精度训练Mixed-Precision Training大部分计算用 16 位浮点数、关键部分保留 32 位,省显存又提速的训练方式。
- 梯度累积Gradient Accumulation连续算几个小批次的梯度先攒着,再统一更新一次参数,模拟大批量训练。
- 梯度检查点(激活重计算)Gradient Checkpointing (Activation Recomputation)前向时少存中间激活,反向时再重算一遍,用计算换显存。
- 表征学习Representation Learning让模型自动从原始数据里学出好用的特征向量,而不是靠人工设计特征。
- 对比学习Contrastive Learning让相似样本的表示靠近、不相似样本的表示远离,从无标签数据里学特征。
- InfoNCE 损失InfoNCE Loss让模型在一堆候选里认出唯一「正样本」的对比学习损失函数。
- 时间对比学习Time-Contrastive Networks从视频自监督学表征:同一时刻的多视角拉近,相邻不同时刻推远。
- 掩码自编码器Masked Autoencoder遮住图像的大部分小块再让模型补回来,以此自监督学习视觉特征。
- 触觉表征学习Tactile Representation Learning把触觉传感器读数编码成通用特征,供滑移检测、插拔等下游任务复用。
- 表征对齐Representation Alignment (REPA-style)训练时让模型中间层特征去对齐一个现成预训练编码器的特征。
- 模态对齐Modality Alignment (Alignment Pre-training Stage)把图像等新模态的特征映射到语言模型能读懂的表示空间里。
- 人类视频预训练Pretraining on Human Videos先用大量人类做事的视频预训练机器人模型,再用少量机器人数据微调。
- 潜在动作预训练Latent Action Pretraining从没有动作标签的视频里提取「潜在动作」,用它来预训练机器人模型。
- 多任务学习Multi-Task Learning让一个模型同时学多个相关任务,共享知识、互相帮忙。
- 协同训练Co-training把目标机器人数据和其他来源的数据按比例混在一起,训练同一个模型。
- 正迁移 / 负迁移Positive / Negative Transfer引入其他任务或数据后,目标任务变好叫正迁移,变差叫负迁移。
- 中训练Mid-training夹在预训练和后训练之间的一轮训练,用更有针对性的数据补特定能力。
10.10微调与后训练
预训练完再适配具体任务:微调、监督和强化学习后训练,以及防遗忘和蒸馏。
- 后训练Post-training预训练之后的训练阶段,用精选数据或强化学习把基础模型调成好用的样子。
- 微调Fine-tuning在已训练好的模型上,用新任务的少量数据继续训练,让它更擅长这件事。
- 全参数微调Full Fine-Tuning微调时更新预训练模型的全部参数,而不是只训练其中一小部分。
- 冻结骨干网络Backbone Freezing训练时固定预训练骨干网络的参数不更新,只训练新加上去的部分。
- 参数高效微调Parameter-Efficient Fine-Tuning冻结大模型的大部分参数,只训练极少量新增或选定的参数来适配新任务。
- 低秩适配Low-Rank Adaptation冻结大模型原有权重,只训练旁路插入的两个小矩阵来完成微调。
- 适配器Adapter在冻结的大模型层间插入小模块,只训练这些小模块来适配新任务。
- 提示微调 / 软提示Prompt Tuning / Soft Prompt冻结整个模型,只训练拼在输入前面的一小段可学习向量来适配任务。
- 监督微调Supervised Fine-Tuning用「输入—标准答案」成对数据,在预训练模型上继续做有监督训练。
- 指令微调Instruction Tuning用「指令—回答」格式的多任务数据微调模型,让它学会听指令办事。
- 拒绝采样微调 / 过滤式行为克隆Rejection Sampling Fine-Tuning / Filtered Behavior Cloning让模型多试几次,只留下成功或高分的结果,再拿来做监督训练。
- 冷启动Cold Start (SFT Cold-start before RL)强化学习之前,先用少量高质量示范做监督微调,给模型一个像样的起点。
- 强化学习微调Reinforcement Fine-Tuning (RL Fine-Tuning)在预训练或监督微调过的模型上,再用奖励信号做强化学习来提升能力。
- 基于人类反馈的强化学习Reinforcement Learning from Human Feedback让人比较模型输出的好坏,据此训练奖励模型,再用强化学习按人的偏好优化模型。
- 直接偏好优化Direct Preference Optimization不训练奖励模型、不跑强化学习,直接用「好/坏」成对样本对齐模型的方法。
- 基于可验证奖励的强化学习Reinforcement Learning with Verifiable Rewards用程序能自动判对错的结果当奖励,对模型做强化学习训练。
- KL 正则化KL Regularization (KL Penalty)在训练目标里加 KL 散度惩罚,不让新策略偏离参考策略太远。
- 灾难性遗忘Catastrophic Forgetting神经网络学了新任务后,旧任务上的能力大幅下降甚至丢失的现象。
- 持续学习Continual Learning让模型按顺序学新任务、新数据,同时不忘掉以前学会的东西。
- 知识隔离Knowledge Insulation训练 VLA 时切断动作专家回传给 VLM 骨干的梯度,保护预训练知识。
- 模型合并Model Merging (Weight Interpolation)不再训练,直接把几个同源模型的参数按比例加权,合成一个新模型。
- 知识蒸馏Knowledge Distillation让小的学生模型去模仿大的教师模型的输出,把能力压缩进小模型。
- 策略蒸馏Policy Distillation让一个学生策略模仿一个或多个训好的老师策略,把本事压缩或合并进来。
- 在线策略蒸馏On-Policy Distillation学生模型自己生成轨迹,老师在这些轨迹的每一步上打分纠正的蒸馏方法。
- 扩散步数蒸馏Diffusion Step Distillation (e.g., Distribution Matching Distillation)把要去噪几十上百步的扩散模型,压成一步或几步就能出结果的学生模型。
10.11从仿真到真机
落到机器人上:仿真里大规模练、迁到真机,再在真机上靠试错和人工纠正接着学。
- 大规模并行强化学习Massively Parallel Reinforcement Learning在一张 GPU 上同时跑成千上万个仿真环境采数据,几分钟就能训出运控策略。
- Actor-Learner 分离架构Actor-Learner Architecture (Distributed RL)把「与环境交互采数据」和「更新网络参数」拆给不同进程或机器并行执行。
- 基于群体的训练Population-Based Training同时训练一群模型,边训练边让差的复制好的权重,并随机调整超参数。
- 课程学习Curriculum Learning先让模型学简单的样本或任务,再逐步加大难度的训练策略。
- 地形课程Terrain Curriculum腿足强化学习中,按机器人表现把它逐步送上更难地形的训练安排。
- 提前终止Early Termination训练中一旦出现摔倒等失败状态,就立刻结束本回合并重置环境。
- 参考状态初始化Reference State Initialization动作模仿训练时,每回合从参考动作的随机时刻开始,而不总从第一帧开始。
- 数据增强Data Augmentation对已有训练数据做随机变换生成新样本,让模型见过更多变化。
- 对称性增强(镜像损失)Symmetry Augmentation (Mirror Loss)利用机器人左右对称,把数据镜像一份或加一项损失,让策略动作左右一致。
- 领域自适应Domain Adaptation让在一种数据分布(源域)上训好的模型,到另一种分布(目标域)上也好用。
- 特权信息Privileged Information只在训练时能拿到、部署时拿不到的额外信息,如仿真里的真实地形和摩擦系数。
- 非对称演员-评论家Asymmetric Actor-Critic评论家看仿真里的完整状态,演员只看真机上也能拿到的观测。
- 教师-学生蒸馏Teacher-Student Distillation先训练能看到特权信息的教师策略,再让只用真实传感器的学生去模仿它。
- 真机强化学习Real-World Reinforcement Learning让机器人直接在真实环境里试错学习,而不是只在仿真里训练。
- 无重置强化学习Reset-Free Reinforcement Learning不靠人一次次把环境复位,让机器人在连续交互中自己学。
- 安全强化学习Safe Reinforcement Learning在最大化奖励的同时,保证训练和部署过程中不违反安全约束。
- 残差强化学习Residual Reinforcement Learning保留一个现成的基础控制器,只用强化学习学它输出上的修正量。
- 噪声空间策略引导Noise-Space Policy Steering不改扩散策略的权重,只用强化学习挑选它的输入噪声,从而改变输出动作。
- 人在回路Human-in-the-Loop让人参与到机器人训练或运行的循环中,实时纠正、接管或给反馈。
- 交互式模仿学习Interactive Imitation Learning机器人边执行、人边纠正,用这些反馈在线改进策略的模仿学习。
- 人工门控 DAggerHuman-Gated DAgger机器人快出错时由人接管纠正,只收集接管片段来迭代训练的 DAgger 变体。
- 机群学习 / 部署中学习Fleet Learning (Learning While Deploying)让一批已部署的机器人边干活边采数据,共同持续改进同一个策略。
- 自我提升Self-improvement机器人用自己练习产生的数据反复训练自己,越练越强,少靠人工。
10.12推理时提升与快速适应
训练收尾后,不改或少改权重也能变强:推理时多算,或快速适应新任务。
- 免训练Training-free不更新任何模型参数,直接组合现成模型或算法来完成新任务。
- 推理时计算Inference-Time Compute (Test-Time Scaling)模型不变,推理时多花算力(多采样、多思考)来换更好的结果。
- 最优 N 采样Best-of-N Sampling一次采样 N 个候选输出,用打分器挑出分数最高的那个去执行。
- 价值引导采样Value-Guided Sampling先从策略采样多个候选动作,再用价值函数打分,挑最好的执行。
- 测试时训练Test-Time Training部署时拿到新数据,先用它做几步自监督更新,再用更新后的模型输出。
- 上下文学习In-Context Learning不改模型参数,只靠输入里给的几个示例就学会做新任务。
- 元学习Meta-Learning让模型在大量任务上练出「快速学会新任务」的能力,而不只学会某一个任务。
- 元强化学习Meta Reinforcement Learning在大量相似任务上训练,让智能体遇到新任务时只需少量试错就能适应。
- 单样本模仿学习One-shot Imitation Learning只给机器人看一次新任务的演示,它就能在新情况下照着完成。