DeepSeek-V2 2
DeepSeek系列 · 深度求索 · 2024-05发布
模型介绍
DeepSeek-V2 以 MLA(多头潜在注意力)架构开源,MoE 高效推理、中文优秀,训练成本极具竞争力,V3 的前身。
模型基础信息
免费额度与收费政策
免费规则详情
权重开源可商用;官方 API 超低价。
收费标准简介
本地免费;API 约 ¥1 / 百万 token。
模型能力介绍
✅ 核心优势
- MLA 高效
- 中文优�
- PI 极便宜
- 开源
⚠️ 短板与局限
- 生态较 V3 老
- 大模型需高显存
- 部分能力落后
🎯 适用场景
- 中文任务
- 低成本 API
- 开源基座
- 研究
模型使用教程
本章节整理 DeepSeek-V2 的在线体验、API调用、本地部署全套入门教程,快速上手使用该模型。
- 本地体验:
ollama run deepseek-v2或 Transformers / vLLM 加载。 - 云端:HF 托管模型可在线体验。
ollama run deepseek-v2 "用中文介绍一下DeepSeek-V2"
HF_ENDPOINT=https://hf-mirror.com huggingface-cli download 深度求索/DeepSeek-V2 --local-dir ./deepseek-v2
或 ModelScope 国内直连下载。
from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained('深度求索/DeepSeek-V2')
tok = AutoTokenizer.from_pretrained('深度求索/DeepSeek-V2')
code = tok.apply_chat_template([{'role':'user','content':'你好'}], tokenize=False)
print(model.generate(**tok(code, return_tensors='pt')))
DeepSeek-V2 是 236B 的 MoE 模型,激活仅 21B,本地可用 16B 开源版(DeepSeek-V2-Lite)验证,全量需多卡。
- Lite 版用 vLLM 一条命令:
pip install vllm && vllm serve deepseek-ai/DeepSeek-V2-Lite --trust-remote-code --port 8000
- transformers 直连推理:
python -c "from transformers import AutoModelForCausalLM, AutoTokenizer; m=AutoModelForCausalLM.from_pretrained('deepseek-ai/DeepSeek-V2-Lite', trust_remote_code=True, torch_dtype='float16').cuda(); t=AutoTokenizer.from_pretrained('deepseek-ai/DeepSeek-V2-Lite', trust_remote_code=True); print(t.decode(m.generate(t('你好', return_tensors='pt').to('cuda'), max_new_tokens=64)[0], skip_special_tokens=True))"
- 全量 236B 需 8×A100,配置同官方 README。
Tips:Lite 16B 约 32GB 显存,4bit 可降至 16GB;MoE 推理吞吐高,适合多用户。
💡 使用小技巧
API 便宜到白菜价。
❓ 常见问题 FAQ
Q1:V2 和 V3 区别?\nA1:V3 更强,V2 是前身。
访问备注与注意事项
- 权重 hf-mirror 可下
Aitishiku.com