参数规模较小、资源需求更低的语言模型。
别拿它跟大模型比块头,它更像楼下便利店:货品不全,但近、快、随到随取,应急特别顶用。
常跑在本地设备或轻量服务里,适合低延迟、低成本的日常任务。
LLM它和大语言模型同类,但更轻、更省资源。
Local-LLM小模型更适合本地部署,设备要求没那么高。
Quantization量化能进一步压缩它,降低运行门槛。
Distillation蒸馏常用来把大模型能力迁到小模型上。