AI Rookies

Model Compression — Model Compression|模型压缩

事实

在尽量少掉效果的前提下,把模型变小变轻。

人话

模型压缩像搬家塞行李箱:衣服卷一卷、盒子拆一拆,箱子小了,东西还尽量别落下。

常用于端侧和本地部署,让模型更省显存、跑得更快。

相关概念

Quantization
量化是模型压缩最常见、最实用的做法之一。

Distillation
蒸馏常用来把大模型能力装进更小模型里。

Local-LLM
模型压缩能让本地模型更容易在设备上跑起来。

VRAM
模型越小,运行时通常占用的显存也越少。