ExLlama开源推理量化 本地部署模型
ExLlamaV2 ExLlamaV2
ExLlamaV系列 · turboderp · 2023-10发布
模型介绍
ExLlamaV2 是高性能本地推理引擎,专精 GPTQ/EXL2 量化,单 A100 可跑 70B 级模型,速度与显存表现强。
模型基础信息
模型系列ExLlamaV系列
开发机构turboderp
发布时间2023-10
参数规模推理引擎(GPTQ/EXL2 量化)
上下文窗口上下文可配
模型类型本地推理引擎
中文能力良好
使用方式网页体验 / API调用 / 本地部署
免费额度与收费政策
开源免费
免费规则详情
MIT 完全免费。
收费标准简介
完全免费。
模型能力介绍
✅ 核心优势
- EXL2 高效
- 70B 单卡可跑
- 速度快
- MIT
⚠️ 短板与局限
- 仅量化格式
- 需 NVIDIA 卡
- 文档较技术
🎯 适用场景
- 本地大模型
- 量化推理
- 单卡跑 70B
- 研究
模型使用教程
本章节整理 ExLlamaV2 的在线体验、API调用、本地部署全套入门教程,快速上手使用该模型。
- 本地工具,安装后即可使用。
- 支持对接主流模型与本地推理引擎。
启动服务后按提示操作即可。
export HF_ENDPOINT=https://hf-mirror.com
模型权重通过 HuggingFace 镜像或 ModelScope 下载。
提供 HTTP API:
curl http://localhost:PORT/v1/chat/completions -H "Content-Type: application/json" -d '{"model":"default","messages":[{"role":"user","content":"你好"}]}'
ExLlamaV2 是面向 GPTQ/EXL2 量化模型的高效推理引擎,支持上下文缓存加速。
- 安装:
pip install exllamav2
- 下载 EXL2 量化权重(如 TheBloke/*-EXL2)后启动测试:
python -m exllamav2.test_inference -m ./模型目录 -p "你好,介绍一下你自己。"
- 起 OpenAI 兼容服务:
python -m exllamav2.server -m ./模型目录 --port 5000
Tips:EXL2 格式压缩比/速度均衡;4KB/8K 上下文缓存可显著提升重复对话速度。
💡 使用小技巧
需要 EXL2/GPTQ 权重。
❓ 常见问题 FAQ
Q1:ExLlamaV2 特点?\nA1:量化推理快。
访问备注与注意事项
- 需 NVIDIA GPU
Aitishiku.com