衡量模型推理生成速度的常用指标。
同样一道题,有的 AI 输出快得像嘴皮子开挂,有的还在字斟句酌;TPS 量的就是这口条速度。
它直接影响聊天等待感和补全流畅度,也常拿来比较推理服务性能。
Token
TPS 的计数单位就是 token,数的是每秒吐出多少个。
Inference
TPS 主要用来衡量模型在推理阶段的生成速度。
Continuous batching
Continuous batching 能减少空转,常让 TPS 表现更高。
GPU
GPU 算力和带宽会直接影响 TPS 上限。