数据泄漏 / 测试集污染
Data Leakage / Test-set Contamination进阶测试时才该有的信息在训练中被模型提前看到,导致评测分数虚高。
数据泄漏指模型训练时接触到了测试或部署时本不该有的信息,于是离线评测好看、真用起来很差。IBM 把它分为目标泄漏(特征里夹带预测时拿不到的「答案」)和训练-测试污染(测试数据混进训练,或划分前用全部数据做归一化等预处理)。机器人学习里常见的情形有:按帧而非按整条轨迹划分训练集和验证集;在仿真基准上用与测试几乎相同的场景和初始状态训练;大模型预训练语料混进评测题。LIBERO-PRO 发现,原版 LIBERO 上成功率超 90% 的 VLA,换物体、改初始位置或指令后可降到 0,说明它们主要在背训练集。对策是按轨迹、场景划分数据,并在分布外设置下评测。
例子把一条 30 秒演示的所有帧随机打散后再划分训练集和验证集,验证集上的动作误差会很低,因为模型几乎见过每一帧的相邻帧;改成按整条轨迹划分后,误差才能反映真实的泛化能力。
- 也叫
- Data Leakage、Train-Test Contamination、测试集泄漏、数据污染
- 相关
- 训练集 / 验证集 / 测试集、过拟合、分布外、LIBERO-PRO、基准饱和、刷榜
- 来源
- What is Data Leakage in Machine Learning?(IBM)
LIBERO-PRO: Towards Robust and Fair Evaluation of Vision-Language-Action Models Beyond Memorization (arXiv 2510.03827) - 信息截至
- 2026-05