OZ
oceanz.site
首页文章速查工具探索关于
🇨🇳简体中文🇺🇸英文
速查表llama.cpp

llama.cpp

llama.cpp 是构建于 ggml 之上的开源大模型推理项目,以 GGUF 为主要模型格式,让量化后的大语言模型能够利用 CPU、GPU 及系统内存,在普通个人电脑和消费级硬件上本地运行。

1 项内容
llama.cppGitHubggmlggml-org at Hugging Face

概览

记录 llama.cpp 的平台特性、GGUF 模型来源与安装方式,并梳理 llama cli、llama serve、llama-completion 和 GBNF Grammar 的定位与适用场景。

  • llama.cpp 对 Apple Silicon 支持较好,可通过 ARM NEON、Accelerate 和 Metal 分别利用 CPU 向量计算、数学运算与 GPU 加速。
  • 日常使用主要关注 llama cli 和 llama serve:前者用于在终端中直接运行和测试模型,后者用于提供 Web UI、HTTP API 及长期运行的推理服务。
  • 除了 llama.cpp 官方整理的模型合集,还可以从 Hugging Face 获取大量 GGUF 模型,并根据硬件可用内存选择合适的量化版本。
关于·
联系·
隐私政策·
使用与版权

始于好奇,归于积累,成于分享

与 AI 共同创作,包括不限于:CursorChatGPTChatGPTGeminiGrokClaudeCodexCodexClaude CodeClaude CodeDeepSeek等。

Powered by curiosity. © 2026 oceanz.site. 版权所有。