分词速度限制整体推理吞吐的现象。
分词瓶颈就是地铁安检口:站台列车再能装,包一个个过机,也把人堵住。
常见于高并发和长输入,会拖慢首字响应与吞吐。
Tokenizer分词器负责切文本,慢了就形成入口堵点。
Token文本先变成 Token,模型才会继续计算。
TPS分词跟不上时,TPS 会被前处理拖低。
Inference Engine推理引擎再快,也可能被分词入口卡住。