具身智能新手名词表English

优势条件化

Advantage Conditioning进阶

训练时告诉策略每个动作「好不好」,部署时只让它生成「好」的动作。

优势条件化把强化学习变成带条件的监督学习:先训练价值函数,算出数据中每个动作的优势(比平均水平好多少),再把优势或其二值化结果作为额外输入交给策略,照常做模仿学习。这样好、坏数据都能用来训练,推理时把条件设成「好」,策略就偏向输出高优势动作。它与按回报条件化的决策 Transformer 思路相近,也和 Frans 等人 2025 年提出的 CFGRL(把扩散模型的无分类器引导视作策略改进)相通。Physical Intelligence 2025 年 11 月发布的 π*0.6 用它构成 RECAP 方法:按阈值把优势二值化,以文本「Advantage: positive / negative」输入策略,训练时随机去掉该条件,推理时设为 positive,或用无分类器引导进一步放大改进。

例子π*0.6 用 RECAP 训练后,能在真实家庭里叠衣服、稳定组装纸箱、用专业咖啡机做意式咖啡;论文称在部分最难的任务上吞吐量提高到两倍以上,失败率大约减半。

也叫
优势条件策略、Advantage-Conditioned Policy、优势条件化策略
相关
RECAP、π*0.6、优势函数、回报条件化、无分类器引导、优势加权回归
来源
π*0.6: a VLA That Learns From Experience (RECAP, arXiv 2511.14759)
Diffusion Guidance Is a Controllable Policy Improvement Operator (CFGRL, arXiv 2505.23458)
信息截至
2025-11

在完整名词表里查看 →