从请求发出到模型生成第一个词元的耗时。
首词延迟像演出开场前的黑屏:第一句台词迟迟不来,后面演得再快也吊人胃口。
它决定聊天和代码助手多久不再显示“正在思考”。
Prefill预填充要先处理完整输入,通常主导首词等待时间。
Inference engine推理引擎的优化会直接影响首词出现得有多快。
Continuous batching动态拼批改变请求排队方式,也会影响首词延迟。