具身智能新手名词表English

分词器

Tokenizer常用

把文字、图像或动作切成 token 并换成整数编号的预处理模块。

分词器是模型前面的预处理模块:把输入切成一个个 token(词元,模型处理的最小单位),再按一张固定的词表换成整数编号;模型输出编号后也靠它还原成文字。大语言模型多用子词算法,例如 BPE(字节对编码,反复合并最常相邻出现的字符对),常见词保留成一个 token,生僻词拆成几段,GPT-2 的词表有 50257 个 token。在具身智能里这个词被推广了:视频分词器把视频压成 token,动作分词器把连续的关节动作变成离散 token,让语言模型能像说话一样输出动作。怎么分词决定了序列有多长、模型能表示什么,是 VLA 设计里的关键选择。

例子OpenVLA 把每一维动作分成 256 个区间,并直接占用 Llama 分词器里 256 个最少用到的 token 来代表这些区间,于是一步 7 维动作就变成 7 个 token。

也叫
tokenizer、词元化器、词表
相关
token(词元)、字节对编码、动作分词器、视频分词器、视觉 token、分箱离散化
来源
Hugging Face Transformers Docs: Tokenization algorithms
OpenVLA: An Open-Source Vision-Language-Action Model (arXiv 2406.09246)

在完整名词表里查看 →