AI Rookies

Llama.cpp — 本地大语言模型推理框架

事实

一个让大模型在本地设备高效运行的开源推理项目。

人话

本来得包场机房的大模型,被 llama.cpp 练成地铁通勤党:塞进笔记本,也能低调开工。

常用来本地跑模型、离线聊天和私有部署,省云端成本,但更吃设备性能。

相关概念

Local-LLM
它是很多本地大模型方案的核心运行底座。

GGUF
它常加载 GGUF 格式的模型文件来本地推理。

Quantization
量化能减小模型体积,帮它跑进普通设备。

Ollama
Ollama 常把它作为底层执行引擎之一。