AI Rookies

Inference — 推理(运行)

事实

模型接收输入后生成输出的运行过程。

人话

推理像餐厅真正开始出菜,训练是备料,你点单后厨房才开火。

每次聊天、生成图片、调用模型,背后都在消耗算力和时间。

相关概念

LLM
Inference 是 LLM 利用已学能力响应请求的阶段。

Token
Inference 会按 Token 读取输入,并逐步生成输出。

GPU
GPU 性能直接影响 Inference 的速度和成本。

API
API 将 Inference 封装成应用可调用的能力。