AI Rookies

Multi-GPU inference — 多 GPU 推理

事实

使用多块 GPU 协同执行模型推理。

人话

多卡推理像龙舟队划船:一人划不动大船,多人同频才跑得快。

用于云端和企业部署,让大模型装得下、答得快。

相关概念

GPU
多卡推理把一次推理分给多块 GPU 协同完成。

Model Parallelism
模型并行是多卡推理常见的拆分方式。

Inference Engine
推理引擎负责调度多卡计算和通信。

VRAM
多卡常用来凑显存,装下单卡放不下的模型。