AI Rookies

Quantization — 量化

事实

把模型数值压缩成更低精度的处理方法。

人话

量化像搬家前把大棉被塞进真空袋,体积小了,保暖大多还在。

它让模型更省显存、跑得更快,常用于本地部署和推理加速。

相关概念

Parameter
量化会把参数从高精度表示压缩成更低精度表示。

GPU
量化能减少显存占用,让同样的 GPU 跑得更轻松。

Local-LLM
量化是本地部署大模型时最常见的瘦身办法之一。

Inference
量化主要发生在推理部署阶段,用来换取更低成本和更高速度。