AI Rookies

Model Paging — 模型分页

事实

按需换入换出模型权重以节省显存的技术。

人话

模型分页像在小书桌上读大部头:桌面只摊正在读的几页,读完换下一叠,整本书轮着上桌。

让大模型挤进小显存,常用于本地部署和推理服务。

相关概念

Model Offloading
模型分页是更细粒度的权重换入换出。

VRAM
它用时间换空间,缓解显存不够用。

Inference Engine
推理引擎负责安排何时加载哪一页。

Unified Memory
统一内存可让页面在不同内存间搬运。