AI Rookies

Tail Latency — 尾延迟

事实

衡量最慢少数请求响应时间的指标。

人话

春运抢票,别人已进站,你还困在加载圈;这批最慢乘客的等待,就是尾延迟。

它决定高峰期少数用户会不会一直转圈,是在线推理的关键体验指标。

相关概念

Continuous batching
动态拼批会改变慢请求的等待时间,从而影响尾延迟。

Inference engine
推理引擎除了追求平均速度,也要控制最慢请求的响应。

Tokens/s
平均生成速度高,不代表少数请求不会长时间卡住。