llama.cpp 是构建于 ggml 之上的开源大模型推理项目,以 GGUF 为主要模型格式,让量化后的大语言模型能够利用 CPU、GPU 及系统内存,在普通个人电脑和消费级硬件上本地运行。
记录 llama.cpp 的平台特性、GGUF 模型来源与安装方式,并梳理 llama cli、llama serve、llama-completion 和 GBNF Grammar 的定位与适用场景。