使用多块 GPU 协同执行模型推理。
多卡推理像龙舟队划船:一人划不动大船,多人同频才跑得快。
用于云端和企业部署,让大模型装得下、答得快。
GPU多卡推理把一次推理分给多块 GPU 协同完成。
Model Parallelism模型并行是多卡推理常见的拆分方式。
Inference Engine推理引擎负责调度多卡计算和通信。
VRAM多卡常用来凑显存,装下单卡放不下的模型。