把部分模型数据临时挪到别的硬件存放。
模型卸载像小户型收纳:GPU 放不下,就把不常用的先塞进储物间,现用现搬。
它常用于本地跑大模型,省显存,但会拖慢速度。
VRAMOffloading 常在显存不够时,把部分模型数据挪到别处。
Local-LLM它能让本地设备有机会运行原本塞不下的大模型。
QuantizationQuantization 是压缩体积,Offloading 是挪存放位置,常一起用。
InferenceOffloading 多发生在推理阶段,用速度换取可运行性。