负责高效运行大语言模型生成任务的软件系统。
推理引擎像外卖店后厨:你点一句话,它调火候、排队伍,尽快把答案炒出来。
它决定模型上线后的速度、成本和稳定性,常见于聊天机器人和企业部署。
Inference
LLM inference engine 就是把模型推理真正组织并运行起来的软件层。
Continuous batching
Continuous batching 是推理引擎常用的提速办法,用来减少等待和空转。
GPU
推理引擎需要调度 GPU 算力,尽量让生成过程更快更稳。
VRAM
VRAM 容量会限制推理引擎能装下多大模型,以及并发开多高。