在尽量少掉效果的前提下,把模型变小变轻。
模型压缩像搬家塞行李箱:衣服卷一卷、盒子拆一拆,箱子小了,东西还尽量别落下。
常用于端侧和本地部署,让模型更省显存、跑得更快。
Quantization量化是模型压缩最常见、最实用的做法之一。
Distillation蒸馏常用来把大模型能力装进更小模型里。
Local-LLM模型压缩能让本地模型更容易在设备上跑起来。
VRAM模型越小,运行时通常占用的显存也越少。