拒绝采样微调 / 过滤式行为克隆
Rejection Sampling Fine-Tuning / Filtered Behavior Cloning进阶让模型多试几次,只留下成功或高分的结果,再拿来做监督训练。
两个名字说的是同一类做法:先让现有模型针对任务生成多个结果,用答案检查、成功检测或回报排序把差的丢掉(「拒绝」),只把好的样本当训练数据做监督微调或行为克隆。大模型领域常引用 Yuan 等人 2023 年的论文,用它扩充数学推理数据;2021 年的决策 Transformer 论文里也有「只克隆回报前 X% 数据」的百分位行为克隆(%BC)作对照。它实现简单、训练稳定,缺点是失败样本里的信息被直接扔掉。机器人里常用来只保留成功的自主轨迹,或像字节 GR-RL 那样用学到的任务进度函数筛掉演示中没推进任务的片段。注意缩写 RFT 也常指强化学习微调。
例子Yuan 等人让多个模型对 GSM8K 数学题反复作答,只保留答案正确的推理过程加入训练集,LLaMA-7B 的准确率从普通监督微调的 35.9% 提高到 49.3%。
- 也叫
- RFT(拒绝采样微调)、Filtered BC、百分位行为克隆、Percentile Behavior Cloning (%BC)、成功过滤行为克隆
- 相关
- 行为克隆、监督微调、自我提升、最优 N 采样、次优演示、优势条件化
- 来源
- Yuan et al. 2023: Scaling Relationship on Learning Mathematical Reasoning with Large Language Models
Chen et al. 2021: Decision Transformer: Reinforcement Learning via Sequence Modeling
Li et al. 2025: GR-RL: Going Dexterous and Precise for Long-Horizon Robotic Manipulation - 信息截至
- 2025-12