让请求在运行中持续并入同批处理的调度方式。
它像早高峰拼车:不等坐满才发,新乘客随时上,空座马上补。
它常用于大模型在线推理,让 GPU 少空等、服务更扛流量。
Inferencecontinuous batching 主要用于推理阶段,解决请求怎么一起跑更划算。
GPU它能减少 GPU 等活的时间,让算力利用更紧凑。
Token因为回答是一段段往外吐,所以新请求能在生成过程中并入。
LLM它最常见于 LLM 在线服务,尤其是多人同时请求时。