把一个模型拆到多块设备上协同计算的方法。
模型并行像搬家请兄弟分扛大衣柜:一人扛不动,就拆开大家抬。
它让超大模型能在多 GPU 上训练和推理,但通信会拖后腿。
GPUModel parallelism 会把模型切分后放到多张 GPU 上一起算。
VRAM当单卡 VRAM 放不下整个模型时,常用它来分摊容量压力。
Model-offloading两者都在解决装不下的问题,只是一个拆多卡,一个往别处挪。
Inference超大模型做 Inference 时,也常靠它才能顺利运行。