ExLlama开源推理量化 本地部署模型

ExLlamaV2 ExLlamaV2

ExLlamaV系列 · turboderp · 2023-10发布

开源支持本地部署国内可直连有免费额度长上下文

模型介绍

ExLlamaV2 是高性能本地推理引擎,专精 GPTQ/EXL2 量化,单 A100 可跑 70B 级模型,速度与显存表现强。

模型基础信息

模型系列ExLlamaV系列
开发机构turboderp
发布时间2023-10
参数规模推理引擎(GPTQ/EXL2 量化)
上下文窗口上下文可配
模型类型本地推理引擎
中文能力良好
使用方式网页体验 / API调用 / 本地部署

免费额度与收费政策

开源免费

免费规则详情

MIT 完全免费。

收费标准简介

完全免费。

模型能力介绍

✅ 核心优势

  • EXL2 高效
  • 70B 单卡可跑
  • 速度快
  • MIT

⚠️ 短板与局限

  • 仅量化格式
  • 需 NVIDIA 卡
  • 文档较技术

🎯 适用场景

  • 本地大模型
  • 量化推理
  • 单卡跑 70B
  • 研究

模型使用教程

本章节整理 ExLlamaV2 的在线体验、API调用、本地部署全套入门教程,快速上手使用该模型。

  • 本地工具,安装后即可使用。
  • 支持对接主流模型与本地推理引擎。

启动服务后按提示操作即可。

export HF_ENDPOINT=https://hf-mirror.com

模型权重通过 HuggingFace 镜像或 ModelScope 下载。

提供 HTTP API:

curl http://localhost:PORT/v1/chat/completions -H "Content-Type: application/json" -d '{"model":"default","messages":[{"role":"user","content":"你好"}]}'

ExLlamaV2 是面向 GPTQ/EXL2 量化模型的高效推理引擎,支持上下文缓存加速。

  1. 安装:

pip install exllamav2

  1. 下载 EXL2 量化权重(如 TheBloke/*-EXL2)后启动测试:

python -m exllamav2.test_inference -m ./模型目录 -p "你好,介绍一下你自己。"

  1. 起 OpenAI 兼容服务:

python -m exllamav2.server -m ./模型目录 --port 5000

Tips:EXL2 格式压缩比/速度均衡;4KB/8K 上下文缓存可显著提升重复对话速度。

💡 使用小技巧

需要 EXL2/GPTQ 权重。

❓ 常见问题 FAQ

Q1:ExLlamaV2 特点?\nA1:量化推理快。

访问备注与注意事项