AI MODELS DIRECTORY

AI 模型大全

收录各大开源模型、闭源大模型(国内/ 海外)、本地部署模型与多模态模型

全部 132 开源模型 107 闭源大模型·国内 90 闭源大模型·海外 80 本地部署模型 35 多模态模型 132
MiniCPM 4
面壁智能
开源·多模态 国内

面壁智能的全模态端侧模型,4B 参数可处理文本、图像与音频,主打单卡可运行的多模态 Agent 平台。

参数:4B(全模态) 👁 5
Video-LLaVA
Peking University
开源·多模态 海外

面向视频理解的开源多模态模型,可对视频进行问答与摘要,统一了图像与视频指令。

参数:7B 👁 5
LLaVA-OneVision
UW-Madison
开源·多模态 海外

LLaVA 家族的多模态视觉语言模型,能处理图像、视频与表格等多模态内容,是开源视觉对话的代表。

参数:7B 👁 5
CogVLM 2
智谱AI / 清华
开源·多模态 国内

智谱与清华联合开源的视觉语言模型,支持高清图像理解与文档 OCR,中文场景适配良好。

参数:19B 👁 4
InternVL 2
上海人工智能实验室
开源·多模态 国内

上海 AI Lab 与商汤的开源多模态视觉语言模型,开源榜上视觉理解能力最强的系列之一,可本地部署。

参数:1B 至 76B 多尺寸 👁 5
Segment Anything 2
Meta
开源·多模态 海外

SAM 2 扩展至视频分割,支持在视频中持续跟踪分割目标,API 沿用 SAM 交互方式。

参数:小/大/最大 👁 4
Segment Anything
Meta
开源·多模态 海外

Meta 发布的图像分割基础模型,可通过点选或文本在任意图像中分割目标,无需额外训练。

参数:viT-B / viT-H 👁 4
MiniOmni
阿里巴巴
开源·多模态 国内

阿里开源的全模态模型,仅 2.8B 参数即可同时处理文本、图像与音频,端到端实时语音对话,主打轻量与开源。

参数:2.8B(视觉 + 语音 + 理解) 👁 4
Kokoro TTS
Hexgrad
开源·多模态 海外

Kokoro 是目前参数量最小但质量极高的开源 TTS 模型,82M 参数即可输出自然语音,可 CPU 一键部署。

参数:82M 👁 4
Cartesia
Cartesia
开源·多模态 海外

Cartesia 的低延迟实时语音模型,延迟低至 40ms,支持开源权重,适合语音交互与 Agent。

参数:开源语音模型 Sonic 👁 7
MusicGen-2
Meta
开源·多模态 海外

Meta 开源的音频生成模型,可按文本描述生成旋律与配乐,支持续写与旋律条件生成。

参数:300M / 1.5B / 3.3B 👁 5
Whisper Large
OpenAI
开源·多模态 海外

OpenAI 开源的语音识别模型,跨 99 种语言,鲁棒性与准确率达到业界标杆,是本地语音转文字的主流选择。

参数:1.55B 👁 4
Mochi 1
Genmo
开源·多模态 海外

Genmo 发布的开放权重视频生成模型,10B 参数,在开源视频模型中质量领先,可本地部署。

参数:10B 👁 6
Stable Diffusion
Stability AI
开源·多模态 海外

Stability AI 发布的开源文生图模型,带起整个开源 AI 绘画生态,可本地部署并衍生海量社区模型。

参数:0.9B / 1B 等 👁 4
Meta SAM 3D
Meta AI
开源·多模态

Meta 开源 SAM 3D,单张 2D 图像即可生成 3D 模型,已集成到 Instagram/Facebook 的 View in Room 功能实现商品 3D 预览,Apache-2.0 开源。

参数:开源(未公开) 上下文:单图转 3D 👁 4
通义万相 Wan2.5
阿里巴巴
开源·多模态 国内

阿里开源通义万相 2.5,文生视频与图像全能,中文理解优秀,Apache-2.0 开源可本地部署,是国内开源视频模型代表。

参数:14B(扩散) 上下文:文生视频/图 👁 4
FLUX.2
Black Forest Labs
开源·多模态 海外

Black Forest Labs 新一代文生图模型 FLUX.2,构图与文本渲染能力再提升,开源版本可本地部署,闭源 API 效果最佳。

参数:约 8B(扩散) 上下文:文生图 👁 4
MiniCPM-Octoius
面壁智能(OpenBMB)
开源·多模态 国内

面壁开源的 MiniCPM-Octoius,首个开源全模态模型,支持文字、图像、音频、视频输入输出,端侧可跑。

参数:8B 上下文:64K 👁 6
Phi-3.5-vision
Microsoft
开源·多模态

微软 Phi-3.5-vision 是多模态小模型,4.2B 参数,128K 上下文,图像理解与视频理解兼顾,MIT 商用自由。

参数:4.2B 上下文:128K 👁 4
Stable Video 3D
Stability AI
开源·多模态

Stable Video 3D 从单张图生成 3D 环绕视频(novel view synthesis),为 3D 重建与摄影测量提供素材。

参数:~2B 上下文:图生 3D 视频 👁 8

共 132 个 AI 模型