具身智能新手名词表English

冷启动

Cold Start (SFT Cold-start before RL)常用

强化学习之前,先用少量高质量示范做监督微调,给模型一个像样的起点。

冷启动在大模型和 VLA 训练里指:正式做强化学习之前,先用少量高质量数据做监督微调(SFT,直接拿标准答案训练),得到一个基本会做任务的初始模型。这个说法因 DeepSeek-R1(2025 年 1 月)流行:纯 RL 训出的 R1-Zero 可读性差、多语言混杂,于是先用数千条长思维链数据微调再做 RL。原因是强化学习靠试错,初始模型几乎从不成功时拿不到奖励信号,训练慢且不稳。具身领域的对应做法是先用演示数据做行为克隆得到基础策略,再到仿真或真机上做 RL 微调。推荐系统里的「冷启动」指新用户没有历史数据,是另一回事。

例子SimpleVLA-RL(2025)先对每个任务只用 1 条演示做 SFT,LIBERO-Long 成功率为 17.3%;以此为起点做强化学习后升到 91.7%。

也叫
冷启动数据、冷启动微调、Cold-start SFT、Cold-start Data
相关
监督微调、强化学习微调、行为克隆、后训练、稀疏奖励、SimpleVLA-RL
来源
DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning (arXiv 2501.12948)
SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning (arXiv 2509.09674)
信息截至
2025-09

在完整名词表里查看 →