GPU 用来存放模型和计算数据的高速内存。
显存这东西,像厨房台面:地方大,锅碗瓢盆都摆得开;地方小,再会做饭也得手忙脚乱腾地方。
它决定模型能否顺畅运行,常见于本地部署、训练和推理。
GPU显存是 GPU 干活时最贴身的内存,很多算力限制本质上也是显存限制。
Quantization量化会压缩模型所占空间,常被用来降低显存需求。
Local-LLM本地部署大模型时,显存大小常决定你能跑多大的模型。
Parameter模型参数越多,加载和计算时通常就越占显存。