具身智能新手名词表English

字节对编码

Byte-Pair EncodingBPE进阶

反复合并最常见的相邻符号对来构建子词词表的分词算法

字节对编码最早由 Philip Gage 在 1994 年作为文本压缩算法提出;2016 年 Sennrich 等人把它用到神经机器翻译的分词上(ACL 2016),之后成为 GPT 等大语言模型分词器的主流方案。做法是:从单个字符或字节开始,统计语料里出现次数最多的相邻符号对,把它合并成一个新符号加入词表,重复直到词表达到设定大小。这样常见词是一个 token,罕见词拆成几个子词,既不会遇到词表外的词,序列也不会像逐字符切分那样长。字节级 BPE 先把文本转成 UTF-8 字节再合并,任何文本都能编码。在具身领域,Physical Intelligence 的 FAST 动作分词器也用 BPE 压缩动作序列。

例子FAST 先对每个动作维度做离散余弦变换,按比例缩放取整后展平,再训练 BPE(论文默认缩放 10、词表 1024),把一段动作压成较短的 token 序列给 VLA 自回归预测。

也叫
字节级 BPE、Byte-level BPE
相关
分词器、token(词元)、动作分词器、离散余弦变换、π0-FAST、大语言模型
来源
Neural Machine Translation of Rare Words with Subword Units (arXiv 1508.07909)
FAST: Efficient Action Tokenization for Vision-Language-Action Models (arXiv 2501.09747)
Byte-pair encoding - Wikipedia

在完整名词表里查看 →