一个让大模型在本地设备高效运行的开源推理项目。
本来得包场机房的大模型,被 llama.cpp 练成地铁通勤党:塞进笔记本,也能低调开工。
常用来本地跑模型、离线聊天和私有部署,省云端成本,但更吃设备性能。
Local-LLM它是很多本地大模型方案的核心运行底座。
GGUF它常加载 GGUF 格式的模型文件来本地推理。
Quantization量化能减小模型体积,帮它跑进普通设备。
OllamaOllama 常把它作为底层执行引擎之一。