AI Rookies

Tokenization bottleneck — 分词瓶颈

事实

分词速度限制整体推理吞吐的现象。

人话

分词瓶颈就是地铁安检口:站台列车再能装,包一个个过机,也把人堵住。

常见于高并发和长输入,会拖慢首字响应与吞吐。

相关概念

Tokenizer
分词器负责切文本,慢了就形成入口堵点。

Token
文本先变成 Token,模型才会继续计算。

TPS
分词跟不上时,TPS 会被前处理拖低。

Inference Engine
推理引擎再快,也可能被分词入口卡住。