AI MODELS DIRECTORY

AI 模型大全

收录各大开源模型、闭源大模型(国内/ 海外)、本地部署模型与多模态模型

全部 132 开源模型 107 闭源大模型·国内 90 闭源大模型·海外 80 本地部署模型 35 多模态模型 132
Stable Diffusion XL
Stability AI
开源·多模态

Stability AI 的高分辨率文生图模型,图像质量与细节较 SD 1.5 大幅提升,生态最成熟(LoRA/ControlNet 海量),本地可免费商用。

参数:3.5B 上下文:文生图 / 图生图 👁 4
DeepSeek-VL2
深度求索
开源·多模态

深度求索开源的多模态大模型,MoE 架构高效推理,在文档图表理解、OCR 与视觉问答上表现优秀,中文与视觉结合能力强。

参数:4.5B(MoE)~ 27B 上下文:32K 👁 4
MusicGen(音乐生成)
Meta(FAIR)
开源·多模态

Meta 开源的音乐生成模型,输入描述与风格可生成带旋律/伴奏的音频片段,支持文本/旋律双提示,本地可运行,研究友好。

参数:300M ~ 3.3B 上下文:文本生成音乐 👁 2
Stable Video Diffusion(视频)
Stability AI
开源·多模态

Stability AI 开源的图像生成视频模型,输入一张图片即可生成短视频,研究友好,可与 Stable Diffusion 生态结合做动态内容。

参数:1.1B / 2.1B 上下文:图生视频 👁 2
Whisper(语音识别)
OpenAI
开源·多模态

OpenAI 开源的语音识别模型,支持 99 种语言的转写与翻译,含弱监督多语言训练,可本地运行,是主流开源 ASR 方案,社区优化版更快。

参数:39M ~ 1.5B 上下文:30s 音频窗口 👁 5
Wanxiang 万象(视频)
阿里巴巴通义实验室
开源·多模态 国内

阿里通义实验室开源的视频生成模型 Wan2.1,支持文生视频、图生视频与视频编辑,Apache-2.0 开源,云端也提供「万象」视频生成服务。

参数:14B 上下文:文生视频 · 图生视频 👁 5
Flux
Black Forest Labs
开源·多模态 海外

Black Forest Labs(原 Stable Diffusion 团队)推出的文生图模型,直出图质量与文字渲染、人手细节业界领先,Schnell 版开源、dev 版本也开放权重。

参数:12B 上下文:文生图 👁 4
MiniCPM-V(端侧多模态)
OpenBMB / 面壁智能
开源·多模态

面壁智能推出的端侧多模态模型,8B 参数即可在手机/消费级显卡上运行,支持图像、视频理解与 OCR,中文能力强。

参数:8B 上下文:8K 👁 8
Stable Diffusion(文生图)
Stability AI
开源·多模态

最流行的开源文生图模型,SD 3 采用扩散 Transformer 架构,文字渲染与人体结构显著提升,可通过 Diffusers 或 ComfyUI 本地生成高质量图像。

参数:0.6B ~ 8B 上下文:- 👁 5
CLIP(图文对齐模型)
OpenAI
开源·多模态

OpenAI 开源的图文对齐模型,将图片与文本映射到同一向量空间,可用于以文搜图、图搜图、图像分类与多模态检索系统。

参数:ViT-B/32 等 上下文:77 token 👁 3
LLaVA(开源多模态)
UW-Madison / Microsoft
开源·多模态

开源视觉指令跟随模型的开山之作,架构简洁(视觉编码器+LLM),在图像问答、描述与推理上表现出色,生态与衍生模型众多。

参数:7B / 13B / 34B 上下文:8K 👁 3
Qwen2.5-VL(开源视觉模型)
阿里巴巴通义千问
开源·多模态

通义千问开源视觉语言模型,支持图像理解、视频理解与视觉定位,72B 版本能力对标闭源多模态旗舰,Apache-2.0 可商用。

参数:3B / 7B / 72B 上下文:128K 👁 3
Rodin
Deemos
多模态 海外

Deemos 的 Rodin 3D 模型生成器,专业面向角色模型与游戏美术,生成质量在 3D 社区广受好评。

参数:闭源(未公开) 👁 2
Tripo 3D
VAST
多模态 海外

VAST 的 Tripo 系列 3D 生成模型,文本或图像生成 3D 网格,速度达到分钟级,主打游戏与设计资产生成。

参数:闭源(未公开) 👁 3
Cartesia
Cartesia
多模态 海外

Cartesia 的云端语音 API,基于其低延迟 Sonic 引擎,面向实时语音产品。

参数:闭源(未公开) 👁 2
讯飞语音合成
科大讯飞
多模态 国内

科大讯飞的在线语音合成服务,中文音色业界领先,覆盖上百种音色与方言。

参数:闭源(未公开) 👁 2
TTS-1
OpenAI
多模态 海外

OpenAI 的官方文本转语音模型,支持多种音色和输出格式,是 TTS-1-hd 的基础版本。

参数:闭源(未公开) 👁 2
Flutter TTS
字节跳动
多模态 国内

字节跳动的拟人语音合成模型,中文发音自然,用于火山引擎 TTS 服务。

参数:闭源(未公开) 👁 2
Suno V4
Suno
多模态 海外

Suno 第四代音乐生成模型,支持带人声的完整歌曲创作,风格覆盖流行、民谣、电子等,是当下的音乐 AI 标杆。

参数:闭源(未公开) 👁 2
ElevenLabs V3
ElevenLabs
多模态 海外

ElevenLabs 第三大语音模型,在语音逼真度与可控性上再次升级,支持强化语音与多风格。

参数:闭源(未公开) 👁 4

共 132 个 AI 模型