AI MODELS DIRECTORY

AI 模型大全

收录各大开源模型、闭源大模型(国内/ 海外)、本地部署模型与多模态模型

全部 132 开源模型 107 闭源大模型·国内 90 闭源大模型·海外 80 本地部署模型 35 多模态模型 132
ElevenLabs V2
ElevenLabs
多模态 海外

ElevenLabs 第二代语音合成引擎,合成语音极其接近真人,支持多语言与情感表达,是第一梯队的 TTS 服务。

参数:闭源(未公开) 👁 4
GPT-4o Audio
OpenAI
多模态 海外

GPT-4o 的原生音频能力,实现接近实时的语音对话,理解语气与情感,是 Agent 与语音助手的新范式。

参数:闭源(未公开) 👁 4
混元 3D
腾讯
多模态 国内

腾讯混元 3D 模型,支持文本或图像生成 3D 模型,面向建模与游戏美术场景,开放平台可直接使用。

参数:闭源(未公开) 👁 3
可灵 3D
快手
多模态 国内

快手可灵的三维生成能力,可从单张图像生成 3D 模型,服务游戏与设计行业。

参数:闭源(未公开) 👁 3
Haiper
Haiper
多模态 海外

Haiper 的视频生成模型,从图生视频起家,提供专业的视频创作工具,支持多模态输入。

参数:闭源(未公开) 👁 2
Genmo
Genmo
多模态 海外

Genmo 的视频创作平台,提供 Mochi 系列模型的云端生成体验。

参数:闭源(未公开) 👁 3
Luma Ray2
Luma AI
多模态 海外

Luma AI 的视频生成模型,主打真实感与相机运动质感,曾爆火的“黏土/Sora 风格”均出自其 Hallucination 模型。

参数:闭源(未公开) 👁 3
Runway Gen-2
Runway
多模态 海外

Runway 第二代视频生成模型,是商用文生视频的早期代表,开创了文本/图像转视频的创作工具。

参数:闭源(未公开) 👁 3
Veo 2
Google
多模态 海外

Google DeepMind 的旗舰视频生成模型,支持最高 8 秒 1080p 视频,物理运动与镜头语言逼真。

参数:闭源(未公开) 👁 3
Sora 2
OpenAI
多模态 海外

OpenAI 新一代视频生成模型,在物理一致性、角色一致性与多镜头叙事上大幅提升,可通过 Sora 订阅放平台使用。

参数:闭源(未公开) 👁 3
Krea
Krea
多模态 海外

Krea 的实时图像生成与增强平台模型,主打“边画边生成”的实时反馈与放大增强功能。

参数:闭源(未公开) 👁 2
Playground
Playground AI
多模态 海外

Playground V3 是基于 Flux 训练的专用文生图模型,主打设计行业的高质量图像与易于使用。

参数:闭源(未公开) 👁 3
Seedream 3
字节跳动
多模态 海外

字节 Seedream 系列文生图模型,支持文生图、图生图与精细编辑,中文提示词理解优秀。

参数:闭源(未公开) 👁 3
Nano Banana
Google
多模态 海外

Google Gemini 2.5 Flash Image 的系列模型,支持精确、高质量的新一代文生图与多轮图像编辑,号称“极速且极稳”。

参数:闭源(未公开) 👁 3
Recraft
Recraft
多模态 海外

面向设计团队的文生图模型,支持矢量图与品牌风格一致化生成,适合图标、插画与 UI 素材。

参数:闭源(未公开) 👁 2
FLUX Pro
Black Forest Labs
多模态 海外

Black Forest Labs 的商用文生图旗舰,基于其 FLUX 开源模型的商用版本,图像质量与细节对标 Midjourney。

参数:闭源(未公开) 👁 4
Imagen 3
Google
多模态 海外

Google DeepMind 的文生图模型,图像细节与光影表现一流,文本理解精确,通过 Gemini API 开放。

参数:闭源(未公开) 👁 3
DALL·E 3
OpenAI
多模态 海外

第三代文生图模型,与 ChatGPT 深度集成,可直接在对话中按需生成高质量图像,语义与文字渲染大幅提升。

参数:闭源(未公开) 👁 3
DALL·E 2
OpenAI
多模态 海外

第二代文生图模型,在写实度与分辨率上大幅提升,支持图像修复与编辑,是最早规模化多模态 API 之一。

参数:闭源(未公开) 👁 3
DALL·E
OpenAI
多模态 海外

OpenAI 于 2021 年推出的文生图模型,开创了文本生成图像的商业先河,可将自然语言描述转化为图片。

参数:闭源(未公开) 👁 2

共 132 个 AI 模型