模型接收输入后生成输出的运行过程。
推理像餐厅真正开始出菜,训练是备料,你点单后厨房才开火。
每次聊天、生成图片、调用模型,背后都在消耗算力和时间。
LLMInference 是 LLM 利用已学能力响应请求的阶段。
TokenInference 会按 Token 读取输入,并逐步生成输出。
GPUGPU 性能直接影响 Inference 的速度和成本。
APIAPI 将 Inference 封装成应用可调用的能力。