在训练中模拟低比特计算的量化优化方法。
像拳手平时绑沙袋练出拳,真到上台卸下来,动作更稳,不会一量化就打飘。
常用于模型量化前后衔接,减少掉点,适合端侧部署和省显存。
Quantization它是在训练时先适应量化,好让量化后少掉点。
Fine-tuning它常基于现成模型补训一轮,不必从头训练。
VRAM它服务于更低比特部署,间接缓解显存压力。