用 Hugging Face Tokenizers 做快速分词
加载预训练 tokenizer,完成 encode / decode,并查看 token 数量。
基于 Transformers Docs 整理 · Tokenizers · 官方资料
分词决定模型实际看到的输入。调试截断、计费和 prompt 长度时都要会查 token。
这篇用 transformers 加载 fast tokenizer,完成一轮 encode/decode。
加载并编码一段文本
AutoTokenizer
python
from transformers import AutoTokenizer
tokenizer = AutoTokenizer.from_pretrained("bert-base-uncased")
encoded = tokenizer("Hello tokenizers")
print(encoded)
print(tokenizer.convert_ids_to_tokens(encoded["input_ids"]))
print(tokenizer.decode(encoded["input_ids"]))最容易踩的坑
和模型词表不匹配
tokenizer 必须与要跑的模型同家族;不要混用无关 checkpoint。