AI Rookies

Continuous batching — 连续批处理(Continuous Batching)

事实

让请求在运行中持续并入同批处理的调度方式。

人话

它像早高峰拼车:不等坐满才发,新乘客随时上,空座马上补。

它常用于大模型在线推理,让 GPU 少空等、服务更扛流量。

相关概念

Inference
continuous batching 主要用于推理阶段,解决请求怎么一起跑更划算。

GPU
它能减少 GPU 等活的时间,让算力利用更紧凑。

Token
因为回答是一段段往外吐,所以新请求能在生成过程中并入。

LLM
它最常见于 LLM 在线服务,尤其是多人同时请求时。