中文开源智谱视觉 多模态模型

CogVLM(开源视觉) CogVLM2

CogVLM系列 · 智谱(THUDM) · 2023-10发布

开源支持本地部署多模态国内可直连有免费额度

模型介绍

智谱开源 CogVLM 视觉语言模型,17B 参数在视觉问答与理解上表现优秀,中文图文理解强。

模型基础信息

模型系列CogVLM系列
开发机构智谱(THUDM)
发布时间2023-10
参数规模17B
上下文窗口图文理解
模型类型多模态(视觉+文本)
中文能力优秀
使用方式网页体验 / API调用 / 本地部署

免费额度与收费政策

开源免费

免费规则详情

开源可商用(遵守许可)。

收费标准简介

本地零成本。

模型能力介绍

✅ 核心优势

  • 图文理解强
  • 中文好
  • 开源
  • 视觉问答

⚠️ 短板与局限

  • 17B 需显卡
  • 生态较小
  • 长视频不支持

🎯 适用场景

  • 视觉问答
  • OCR
  • 图表理解
  • 多模态研究

模型使用教程

本章节整理 CogVLM(开源视觉) 的在线体验、API调用、本地部署全套入门教程,快速上手使用该模型。

上传图片/表格/文档,进行视觉问答、OCR 与图表理解。

# 多模态输入:图片 base64 + 文本问题

注册 智谱(THUDM) 账号获取 API Key。

export API_KEY=sk-xxxx
curl  -F image=@test.png -F prompt="图片里有什么?"

CogVLM 17B 全精度约需 40GB 显存,量化后 16-24GB 可跑。

  1. 安装依赖:pip install transformers==4.37.2 accelerate sentencepiece torchvision
  2. 下载权重(THUDM/cogvlm2-llama3-chat-19B,hf-mirror 可下),加载:

python -c "from transformers import AutoModelForCausalLM, LlamaTokenizer; m=AutoModelForCausalLM.from_pretrained('THUDM/cogvlm2-llama3-chat-19B', trust_remote_code=True, torch_dtype='float16').cuda(); t=LlamaTokenizer.from_pretrained('THUDM/cogvlm2-llama3-chat-19B', trust_remote_code=True); print(m.chat(t,'这是什么?',[Image.open('x.jpg')]))"

  1. 大显存可用 vLLM 起 OpenAI 兼容服务,供业务对接。

Tips:官方 demo 脚本 basic_demo.py 可交互对话;显存紧张用 load_in_4bit。

💡 使用小技巧

中文视觉理解不错。

❓ 常见问题 FAQ

Q1:CogVLM 用途?\nA1:图文理解与 VQA。

访问备注与注意事项