token(词元)
Token入门必知模型处理数据的基本单位,文字、图像小块、动作都能切成 token。
Token 是 Transformer 类模型读入和输出的基本单位。文本先由分词器(tokenizer)切成词或子词片段,每个片段在词表里有一个编号,再转成向量(嵌入)送进模型;大语言模型的训练目标就是预测下一个 token。英文里一个 token 常是一个词或词的一部分,一个汉字可能对应一个 token,也可能被拆开或与相邻字合并,取决于分词器。这个概念后来推广到其他模态:ViT 把图片切成 16×16 像素的小块,每块算一个视觉 token;RT-2 和 OpenVLA 把每个动作维度离散成 256 档,每档对应一个 token,让语言模型像写字一样输出动作。上下文长度按 token 数计算,推理耗时也随 token 数增加。
例子OpenVLA 把 Llama 分词器里最少用的 256 个 token 改作动作档位,一个 7 维动作(位置、姿态、夹爪开合)就输出 7 个 token。
- 也叫
- 词元、token、标记
- 相关
- 分词器、嵌入向量、视觉 token、动作分词器、下一个 token 预测、上下文长度
- 来源
- Tokenizers (Hugging Face LLM Course, Chapter 2)
OpenVLA: An Open-Source Vision-Language-Action Model (arXiv:2406.09246)
An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale (ViT, arXiv:2010.11929)