TodayAI

用 Hugging Face Tokenizers 做快速分词

加载预训练 tokenizer,完成 encode / decode,并查看 token 数量。

基于 Transformers Docs 整理 · Tokenizers · 官方资料

分词决定模型实际看到的输入。调试截断、计费和 prompt 长度时都要会查 token。

这篇用 transformers 加载 fast tokenizer,完成一轮 encode/decode。

加载并编码一段文本

AutoTokenizer

python
from transformers import AutoTokenizer

tokenizer = AutoTokenizer.from_pretrained("bert-base-uncased")
encoded = tokenizer("Hello tokenizers")
print(encoded)
print(tokenizer.convert_ids_to_tokens(encoded["input_ids"]))
print(tokenizer.decode(encoded["input_ids"]))

最容易踩的坑

和模型词表不匹配

tokenizer 必须与要跑的模型同家族;不要混用无关 checkpoint。

官方资料

Transformers DocsTokenizers