把模型数值压缩成更低精度的处理方法。
量化像搬家前把大棉被塞进真空袋,体积小了,保暖大多还在。
它让模型更省显存、跑得更快,常用于本地部署和推理加速。
Parameter量化会把参数从高精度表示压缩成更低精度表示。
GPU量化能减少显存占用,让同样的 GPU 跑得更轻松。
Local-LLM量化是本地部署大模型时最常见的瘦身办法之一。
Inference量化主要发生在推理部署阶段,用来换取更低成本和更高速度。