AI Rookies

Offloading — 模型卸载

事实

把部分模型数据临时挪到别的硬件存放。

人话

模型卸载像小户型收纳:GPU 放不下,就把不常用的先塞进储物间,现用现搬。

它常用于本地跑大模型,省显存,但会拖慢速度。

相关概念

VRAM
Offloading 常在显存不够时,把部分模型数据挪到别处。

Local-LLM
它能让本地设备有机会运行原本塞不下的大模型。

Quantization
Quantization 是压缩体积,Offloading 是挪存放位置,常一起用。

Inference
Offloading 多发生在推理阶段,用速度换取可运行性。