LMDeploy LMDeploy 0.6
LMDeploy系列 · 上海人工智能实验室 · 2023-07发布
模型介绍
LMDeploy 是国产高性能推理框架,服务 Qwen、InternLM、Llama 等,INT4/8 量化与多模态支持,OpenAI 兼容。
模型基础信息
免费额度与收费政策
免费规则详情
Apache-2.0 免费。
收费标准简介
完全免费。
模型能力介绍
✅ 核心优势
- 国产友好
- 量化强
- 多模态
- OpenAI 兼容
⚠️ 短板与局限
- 生态小于 vLLM
- 需配置
- 文档一般
🎯 适用场景
- 国产模型部署
- 量化推理
- 本地服务
- 研究
模型使用教程
本章节整理 LMDeploy 的在线体验、API调用、本地部署全套入门教程,快速上手使用该模型。
- 本地工具,安装后即可使用。
- 支持对接主流模型与本地推理引擎。
启动服务后按提示操作即可。
export HF_ENDPOINT=https://hf-mirror.com
模型权重通过 HuggingFace 镜像或 ModelScope 下载。
提供 HTTP API:
curl http://localhost:PORT/v1/chat/completions -H "Content-Type: application/json" -d '{"model":"default","messages":[{"role":"user","content":"你好"}]}'
LMDeploy 是面向国产模型(InternLM/Qwen 系)优化的推理框架,吞吐高、量化省显存。
- 安装:
pip install lmdeploy
- 起服务:
lmdeploy serve internlm/internlm2_5-7b-chat
- 或启动多模态推理(VLM):
lmdeploy serve qwen2.5-vl-7b-instruct
- 波浪号量化(w4a16)可显著降低显存:
lmdeploy lite auto_awq /path/model --work-dir ./w4a16
Tips:默认端口 23333(/v1/chat/completions);对 InternLM/vLLM 格式兼容好。
💡 使用小技巧
配 Qwen/InternLM 最佳。
❓ 常见问题 FAQ
Q1:LMDeploy 特点?\nA1:国产推理框架。
访问备注与注意事项
- 国内直连安装
Aitishiku.com