中文开源浦语视觉 多模态模型

InternVL(开源视觉) InternVL 2.5

InternVL系列 · 上海人工智能实验室 · 2023-12发布

开源支持本地部署多模态国内可直连有免费额度长上下文代码专用

模型介绍

InternVL 是开源视觉语言模型,中文视觉问答与图文理解强,多尺寸覆盖,学术与商用皆可。

模型基础信息

模型系列InternVL系列
开发机构上海人工智能实验室
发布时间2023-12
参数规模2B ~ 40B
上下文窗口多模态长上下文
模型类型多模态(视觉+文本)
中文能力优秀
使用方式网页体验 / API调用 / 本地部署

免费额度与收费政策

开源免费

免费规则详情

MIT 许可可商用。

收费标准简介

本地零成本。

模型能力介绍

✅ 核心优势

  • 中文视觉强
  • 多尺寸
  • 图文理解好
  • MIT

⚠️ 短板与局限

  • 视频理解弱于新模型
  • 生态较新
  • 需显卡

🎯 适用场景

  • 视觉问答
  • OCR
  • 文档理解
  • 多模态 Agent

模型使用教程

本章节整理 InternVL(开源视觉) 的在线体验、API调用、本地部署全套入门教程,快速上手使用该模型。

上传图片/表格/文档,进行视觉问答、OCR 与图表理解。

# 多模态输入:图片 base64 + 文本问题

注册 上海人工智能实验室 账号获取 API Key。

export API_KEY=sk-xxxx
curl  -F image=@test.png -F prompt="图片里有什么?"

InternVL 提供多种尺寸,推荐从 InternVL2-8B 起步(约 12GB 显存)。

  1. 安装依赖:pip install "transformers>=4.37.2" torchvision einops timm
  2. 用 transformers 直接推理(权重 hf-mirror 可下):

python -c "from transformers import AutoModel, AutoTokenizer; m=AutoModel.from_pretrained('OpenGVLab/InternVL2-8B', trust_remote_code=True).cuda(); t=AutoTokenizer.from_pretrained('OpenGVLab/InternVL2-8B', trust_remote_code=True); print(m.chat(t, '描述这张图', [Image.open('x.jpg')]))"

  1. 大显存场景可用 LMDeploy/vLLM 部署成 OpenAI 兼容 API:

vllm serve OpenGVLab/InternVL2-8B --trust-remote-code

Tips:中文图文问答/OCR 直接信任 remote_code 即可,无需额外训练。

💡 使用小技巧

中文图文理解开源首选。

❓ 常见问题 FAQ

Q1:InternVL 强在哪?\nA1:中文视觉语言。

访问备注与注意事项