按需换入换出模型权重以节省显存的技术。
模型分页像在小书桌上读大部头:桌面只摊正在读的几页,读完换下一叠,整本书轮着上桌。
让大模型挤进小显存,常用于本地部署和推理服务。
Model Offloading模型分页是更细粒度的权重换入换出。
VRAM它用时间换空间,缓解显存不够用。
Inference Engine推理引擎负责安排何时加载哪一页。
Unified Memory统一内存可让页面在不同内存间搬运。