UW-Madison开源视觉视频理解 多模态模型
LLaVA-OneVision OneVision
LLaVA系列 · UW-Madison · 2024-08发布
模型介绍
LLaVA 家族的多模态视觉语言模型,能处理图像、视频与表格等多模态内容,是开源视觉对话的代表。
模型基础信息
模型系列LLaVA系列
开发机构UW-Madison
发布时间2024-08
参数规模7B
上下文窗口未公开
模型类型多模态(视觉 + 文本)
中文能力良好
使用方式网页体验 / 本地部署
免费额度与收费政策
按量付费 订阅
模型能力介绍
✅ 核心优势
- 多模态统�
- 7B 可部署
- 开源
⚠️ 短板与局限
- 推理细节有限
🎯 适用场景
- 图片/视频问答
- 视觉助手
模型使用教程
本章节整理 LLaVA-OneVision 的在线体验、API调用、本地部署全套入门教程,快速上手使用该模型。
暂无内容,可前往官方文档查看。
该模型支持本地部署,教程整理中,敬请期待。
Aitishiku.com