把文本切成模型可处理 token 的工具。
分词器像拆乐高:再大的城堡,也得先拆成一块块标准积木,AI 才数得清、拼得动。
写提示词、读长文档时,决定塞得下多少、花多少钱。
TokenToken 是分词器切出的基本单位,也是模型读写的颗粒度。
BPEBPE 是常见子词切分算法,常用来构建分词器。
LLM大模型先经过分词器编码,才能读入文本。
Context-window分词方式会改变 token 数,进而影响可塞文本量。