DeepSeekMoE中文开源 开源模型

DeepSeek-V2 2

DeepSeek系列 · 深度求索 · 2024-05发布

开源支持本地部署国内可直连有免费额度长上下文代码专用

模型介绍

DeepSeek-V2 以 MLA(多头潜在注意力)架构开源,MoE 高效推理、中文优秀,训练成本极具竞争力,V3 的前身。

模型基础信息

模型系列DeepSeek系列
开发机构深度求索
发布时间2024-05
参数规模236B(MoE,激活 21B)
上下文窗口128K
模型类型文本
中文能力优秀
使用方式网页体验 / API调用 / 本地部署

免费额度与收费政策

开源 API 低价

免费规则详情

权重开源可商用;官方 API 超低价。

收费标准简介

本地免费;API 约 ¥1 / 百万 token。

模型能力介绍

✅ 核心优势

  • MLA 高效
  • 中文优�
  • PI 极便宜
  • 开源

⚠️ 短板与局限

  • 生态较 V3 老
  • 大模型需高显存
  • 部分能力落后

🎯 适用场景

  • 中文任务
  • 低成本 API
  • 开源基座
  • 研究

模型使用教程

本章节整理 DeepSeek-V2 的在线体验、API调用、本地部署全套入门教程,快速上手使用该模型。

  • 本地体验:ollama run deepseek-v2 或 Transformers / vLLM 加载。
  • 云端:HF 托管模型可在线体验。
ollama run deepseek-v2 "用中文介绍一下DeepSeek-V2"
HF_ENDPOINT=https://hf-mirror.com huggingface-cli download 深度求索/DeepSeek-V2 --local-dir ./deepseek-v2

或 ModelScope 国内直连下载。

from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained('深度求索/DeepSeek-V2')
tok = AutoTokenizer.from_pretrained('深度求索/DeepSeek-V2')
code = tok.apply_chat_template([{'role':'user','content':'你好'}], tokenize=False)
print(model.generate(**tok(code, return_tensors='pt')))

DeepSeek-V2 是 236B 的 MoE 模型,激活仅 21B,本地可用 16B 开源版(DeepSeek-V2-Lite)验证,全量需多卡。

  1. Lite 版用 vLLM 一条命令:

pip install vllm && vllm serve deepseek-ai/DeepSeek-V2-Lite --trust-remote-code --port 8000

  1. transformers 直连推理:

python -c "from transformers import AutoModelForCausalLM, AutoTokenizer; m=AutoModelForCausalLM.from_pretrained('deepseek-ai/DeepSeek-V2-Lite', trust_remote_code=True, torch_dtype='float16').cuda(); t=AutoTokenizer.from_pretrained('deepseek-ai/DeepSeek-V2-Lite', trust_remote_code=True); print(t.decode(m.generate(t('你好', return_tensors='pt').to('cuda'), max_new_tokens=64)[0], skip_special_tokens=True))"

  1. 全量 236B 需 8×A100,配置同官方 README。

Tips:Lite 16B 约 32GB 显存,4bit 可降至 16GB;MoE 推理吞吐高,适合多用户。

💡 使用小技巧

API 便宜到白菜价。

❓ 常见问题 FAQ

Q1:V2 和 V3 区别?\nA1:V3 更强,V2 是前身。

访问备注与注意事项