CPUGGUF本地部署量化 本地部署模型

llama.cpp(CPU/边缘推理) b5000+

llama.cpp系列 · Georgi Gerganov 等 · 2023-03发布

开源支持本地部署国内可直连有免费额度

模型介绍

C/C++ 编写的轻量推理引擎,支持纯 CPU 与量化(GGUF)推理,可在无显卡的笔记本、树莓派上运行大模型,是端侧部署核心。

模型基础信息

模型系列llama.cpp系列
开发机构Georgi Gerganov 等
发布时间2023-03
参数规模-
上下文窗口-
模型类型推理引擎 / 工具
中文能力待评估
使用方式网页体验 / API调用 / 本地部署

免费额度与收费政策

完全免费开源

免费规则详情

llama.cpp 完全开源免费,可自由商用。

收费标准简介

免费;纯 CPU 即可运行,无显卡也能使用。

模型能力介绍

✅ 核心优势

  • 纯 C/C++ 实现,无显卡也能跑大模型
  • GGUF 量化格式体积小(4bit 约省 75%)
  • 支持树莓派
  • 笔记本等低配设备
  • 生态完善(LM Studio / Ollama 均基于 GGUF)

⚠️ 短板与局限

  • 速度较 GPU 推理慢
  • 需手动下载 GGUF 模型文件
  • 配置对新手有一定门槛

🎯 适用场景

  • 无显卡设备的本地推理
  • 隐私敏感的边缘 / 端侧部署
  • 量化模型测试与调优
  • 低成本实验环境

模型使用教程

本章节整理 llama.cpp(CPU/边缘推理) 的在线体验、API调用、本地部署全套入门教程,快速上手使用该模型。

  • 特点:纯 C++、无需 GPU、GGUF 量化格式(4bit 体积缩小约 75%)。
  • 适合:无显卡机器、隐私要求高的本地场景。
  • 配合工具:LM Studio、Ollama 底层均用到 GGUF 生态。

编译(Windows 用 CMake 或直接下载 release 版 llama-cli.exe)。

git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make

Windows 用户:直接下载 GitHub Releases 的预编译包,或使用 llama-b4399-bin-win-* 版本。

下载 GGUF 模型(如 Qwen2.5-7B-Instruct-GGUF,Q4_K_M 量化)。

./llama-cli -m ./models/qwen2.5-7b-q4_k_m.gguf \
  -p "你好,请自我介绍" \
  -n 128 -t 8

以服务方式启动(OpenAI 兼容):

./llama-server -m ./models/qwen2.5-7b-q4_k_m.gguf --port 8080
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make

下载 GGUF 模型(Q4_K_M 量化):

HF_ENDPOINT=https://hf-mirror.com huggingface-cli download Qwen/Qwen2.5-7B-Instruct-GGUF --local-dir ./gguf

命令行对话:

./llama-cli -m ./gguf/qwen2.5-7b-instruct-q4_k_m.gguf -p "你好,请自我介绍" -n 128 -t 8

以服务方式启动(OpenAI 兼容,端口 8080):

./llama-server -m ./gguf/qwen2.5-7b-instruct-q4_k_m.gguf --port 8080

💡 使用小技巧

常用启动:./llama-cli -m ./models/qwen2.5-7b-q4_k_m.gguf -p "你好" -n 128

优先选 Q4_K_M 量化,质量与体积平衡最好。

❓ 常见问题 FAQ

Q1:纯 CPU 能跑多大模型?

A1:7B 量化后约 5GB 内存即可流畅对话,速度取决于内存带宽。

Q2:怎么找 GGUF 模型?

A2:在 Hugging Face 搜索模型名 + GGUF,选 Q4_K_M 版本。

访问备注与注意事项