AI MODELS DIRECTORY
AI 模型大全
收录各大开源模型、闭源大模型(国内/ 海外)、本地部署模型与多模态模型
ElevenLabs 第二代语音合成引擎,合成语音极其接近真人,支持多语言与情感表达,是第一梯队的 TTS 服务。
GPT-4o 的原生音频能力,实现接近实时的语音对话,理解语气与情感,是 Agent 与语音助手的新范式。
腾讯混元 3D 模型,支持文本或图像生成 3D 模型,面向建模与游戏美术场景,开放平台可直接使用。
快手可灵的三维生成能力,可从单张图像生成 3D 模型,服务游戏与设计行业。
Haiper 的视频生成模型,从图生视频起家,提供专业的视频创作工具,支持多模态输入。
Genmo 的视频创作平台,提供 Mochi 系列模型的云端生成体验。
Luma AI 的视频生成模型,主打真实感与相机运动质感,曾爆火的“黏土/Sora 风格”均出自其 Hallucination 模型。
Runway 第二代视频生成模型,是商用文生视频的早期代表,开创了文本/图像转视频的创作工具。
Google DeepMind 的旗舰视频生成模型,支持最高 8 秒 1080p 视频,物理运动与镜头语言逼真。
OpenAI 新一代视频生成模型,在物理一致性、角色一致性与多镜头叙事上大幅提升,可通过 Sora 订阅放平台使用。
Krea 的实时图像生成与增强平台模型,主打“边画边生成”的实时反馈与放大增强功能。
Playground V3 是基于 Flux 训练的专用文生图模型,主打设计行业的高质量图像与易于使用。
字节 Seedream 系列文生图模型,支持文生图、图生图与精细编辑,中文提示词理解优秀。
Google Gemini 2.5 Flash Image 的系列模型,支持精确、高质量的新一代文生图与多轮图像编辑,号称“极速且极稳”。
面向设计团队的文生图模型,支持矢量图与品牌风格一致化生成,适合图标、插画与 UI 素材。
Black Forest Labs 的商用文生图旗舰,基于其 FLUX 开源模型的商用版本,图像质量与细节对标 Midjourney。
Google DeepMind 的文生图模型,图像细节与光影表现一流,文本理解精确,通过 Gemini API 开放。
第三代文生图模型,与 ChatGPT 深度集成,可直接在对话中按需生成高质量图像,语义与文字渲染大幅提升。
第二代文生图模型,在写实度与分辨率上大幅提升,支持图像修复与编辑,是最早规模化多模态 API 之一。
OpenAI 于 2021 年推出的文生图模型,开创了文本生成图像的商业先河,可将自然语言描述转化为图片。
共 132 个 AI 模型
Aitishiku.com