衡量最慢少数请求响应时间的指标。
春运抢票,别人已进站,你还困在加载圈;这批最慢乘客的等待,就是尾延迟。
它决定高峰期少数用户会不会一直转圈,是在线推理的关键体验指标。
Continuous batching动态拼批会改变慢请求的等待时间,从而影响尾延迟。
Inference engine推理引擎除了追求平均速度,也要控制最慢请求的响应。
Tokens/s平均生成速度高,不代表少数请求不会长时间卡住。