InternVL书生多模态视觉 开源模型

InternVL 2.5 2.5

InternVL系列 · 上海人工智能实验室 · 2025-01发布

开源支持本地部署多模态国内可直连有免费额度长上下文

模型介绍

书生开源视觉多模态模型 InternVL 2.5,覆盖 1B~78B 全尺寸,MIT 许可,图文理解与 OCR 能力领先开源阵营。

模型基础信息

模型系列InternVL系列
开发机构上海人工智能实验室
发布时间2025-01
参数规模1B - 78B
上下文窗口128K
模型类型多模态(图像)
中文能力优秀
使用方式网页体验 / API调用 / 本地部署

免费额度与收费政策

开源免费

免费规则详情

MIT 自由商用。

收费标准简介

本地零成本。

模型能力介绍

✅ 核心优势

  • 视觉顶尖
  • 中文
  • MIT
  • 全尺寸

⚠️ 短板与局限

  • 衍生模型多需选型

🎯 适用场景

  • OCR
  • 图文
  • 医图
  • 文档

模型使用教程

本章节整理 InternVL 2.5 的在线体验、API调用、本地部署全套入门教程,快速上手使用该模型。

  • 本地体验:ollama run internvl-2-5 或 Transformers / vLLM 加载。
  • 云端:HF 托管模型可在线体验。
ollama run internvl-2-5 "用中文介绍一下InternVL 2.5"
HF_ENDPOINT=https://hf-mirror.com huggingface-cli download 上海人工智能实验室/InternVL 2.5 --local-dir ./internvl-2-5

或 ModelScope 国内直连下载。

from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained('上海人工智能实验室/InternVL 2.5')
tok = AutoTokenizer.from_pretrained('上海人工智能实验室/InternVL 2.5')
code = tok.apply_chat_template([{'role':'user','content':'你好'}], tokenize=False)
print(model.generate(**tok(code, return_tensors='pt')))

InternVL 2.5 是书生开源视觉多模态(1B~78B,MIT),OCR 与图文理解领先开源,端侧可跑小尺寸。

  1. transformers 加载:

pip install -U transformers

python -c "from transformers import AutoModelForCausalLM, AutoTokenizer; m=AutoModelForCausalLM.from_pretrained('OpenGVLab/InternVL2_5-8B', torch_dtype='float16', trust_remote_code=True).cuda(); t=AutoTokenizer.from_pretrained('OpenGVLab/InternVL2_5-8B', trust_remote_code=True)"

  1. vLLM 服务化(支持视觉):

pip install vllm && vllm serve OpenGVLab/InternVL2_5-8B --trust-remote-code --port 8000

  1. 低显存用 2B/4B 小尺寸或 AWQ 量化。

Tips:8B 约 16GB 显存;OCR、医图、文档理解是强项。

💡 使用小技巧

视觉任务国产首选。

❓ 常见问题 FAQ

Q1:InternVL 强项?\nA1:视觉理解与 OCR。

访问备注与注意事项