文章目录

1. llama.cpp 简介
llama.cpp 是使用纯 C/C++ 实现的大语言模型(LLM)推理引擎,由保加利亚软件工程师 Georgi Gerganov 于 2023 年 3 月创建。最初是作为一个周末项目,目标是在 MacBook 上运行 Meta 的 LLaMA 模型,无需 Python、PyTorch 或 CUDA 依赖。如今,它已成为全球最受欢迎的本地 LLM 推理框架之一,截至 2026 年中,GitHub Stars 突破 11.7 万,拥有超过 700 位贡献者和近 2 万个 fork。
2026 年 2 月,Gerganov 与核心团队成员(Xuan-Son Nguyen、Aleksander Grygier)加入 Hugging Face 成为全职员工,llama.cpp 仓库也从 ggerganov/llama.cpp 迁移至 ggml-org/llama.cpp,但项目始终保持 100% 开源(MIT 许可证)和完全的技术自主权。llama.cpp 是 Ollama、LM Studio、GPT4All、LocalAI 等数十个知名本地 AI 工具的底层推理引擎,生态影响力极其广泛。
llama.cpp 的核心目标是以最低的设置成本在各种硬件上实现最先进的 LLM 推理性能——无论是在本地还是在云端。其核心特色包括:
- 零依赖:纯 C/C++ 实现,无需 Python、PyTorch 等环境,下载即可运行
- 广泛硬件支持:Apple Silicon(ARM NEON、Accelerate、Metal)、NVIDIA GPU(CUDA)、AMD GPU(HIP)、Intel GPU(SYCL、OpenVINO)、Vulkan、WebGPU 等
- 灵活量化:支持 1.5 位至 8 位整数量化,显著降低内存占用和提升推理速度
- CPU+GPU 混合推理
- OpenAI API 兼容服务:通过
llama-server 一键启动与 OpenAI API 兼容的 HTTP 服务 - 庞大模型生态:支持 LLaMA、Mistral、Qwen、Deepseek、Gemma、Phi 等近百种模型架构的 GGUF 格式
2. b10068 版本亮点
llama.cpp 采用持续构建(build number)版本号体系,b10068 发布于 2026-07-18,主要包含以下更新:
- DFlash 注入 K/V 缓存旋转:修复了在使用 K/V 量化时,DFlash 注意力机制中注入的 K/V 缓存需要旋转的问题,提升了量化场景下的推理正确性。
本整合包选用 llama-b10068-bin-win-cuda-12.4-x64.zip,适用于 Windows x64 系统,使用 NVIDIA CUDA 12.4 后端进行 GPU 加速推理。
环境要求:需安装 NVIDIA CUDA Toolkit 12.4 或更新版本,并配备支持 CUDA 的 NVIDIA 显卡(计算能力 ≥ 5.0,推荐 GTX 10 系列及以上)。若未安装 CUDA 或使用非 NVIDIA 显卡,请改用 CPU 版本或 Vulkan 版本。
3. 获取安装包
如果访问 GitHub 不便,安装包及中文文档:https://hanshuixin.org/go/223T(内含 llama-b10068-bin-win-cuda-12.4-x64.zip、README 中英对照、发布说明中英对照和 LICENSE)。
Windows安装llama.cpp-b10068(llama-b10068-bin-win-cuda-12.4-x64).zip├── llama-b10068-bin-win-cuda-12.4-x64.zip ← 官方预编译包(解压后为各工具 .exe)├── Windows安装llama.cpp-b10068(llama-b10068-bin-win-cuda-12.4-x64).pdf├── README/│ ├── README.md│ └── README-中文版.md├── 发布说明/│ ├── RELEASE-NOTES.md│ └── RELEASE-NOTES-中文版.md└── LICENSE
适用显卡:本整合包内为 CUDA 版本,仅适用于 NVIDIA 显卡(GTX 10 系列及以上,计算能力 ≥ 5.0)。若您使用 AMD 显卡,请选用 HIP(Radeon)版本;若使用 Intel 显卡,请选用 SYCL 或 OpenVINO 版本;若无独立显卡或使用其他品牌,请选用 CPU 或 Vulkan 版本。
4. 快速开始
将整合包根目录中的 llama-b10068-bin-win-cuda-12.4-x64.zip 解压到任意目录,即可得到以下命令行工具:
| |
|---|
llama-cli.exe | |
llama-server.exe | |
llama-perplexity.exe | |
llama-bench.exe | |
llama-simple.exe | |
解压后,打开命令提示符(cmd)或 PowerShell,进入解压目录,执行以下常用命令:
# 使用本地 GGUF 模型文件进行对话llama-cli -m my_model.gguf# 直接从 Hugging Face 下载并运行模型llama-cli -hf ggml-org/gemma-3-1b-it-GGUF# 启动 OpenAI 兼容 API 服务(默认端口 8080)llama-server -m my_model.gguf --port 8080# 启动服务并支持多用户并行请求llama-server -m my_model.gguf -c 16384 -np 4# 使用推测解码加速推理llama-server -m model.gguf -md draft.gguf# 运行性能基准测试llama-bench -m my_model.gguf# 使用自定义语法约束 JSON 输出llama-cli -m my_model.gguf -n 256 --grammar-file grammars/json.gbnf
提示:模型文件(.gguf 格式)可从 Hugging Face GGUF 模型库 获取。也可通过 -hf 参数直接从 Hugging Face 下载。