AI MODELS DIRECTORY
AI 模型大全
收录各大开源模型、闭源大模型(国内/ 海外)、本地部署模型与多模态模型
面壁智能的全模态端侧模型,4B 参数可处理文本、图像与音频,主打单卡可运行的多模态 Agent 平台。
面向视频理解的开源多模态模型,可对视频进行问答与摘要,统一了图像与视频指令。
LLaVA 家族的多模态视觉语言模型,能处理图像、视频与表格等多模态内容,是开源视觉对话的代表。
智谱与清华联合开源的视觉语言模型,支持高清图像理解与文档 OCR,中文场景适配良好。
上海 AI Lab 与商汤的开源多模态视觉语言模型,开源榜上视觉理解能力最强的系列之一,可本地部署。
SAM 2 扩展至视频分割,支持在视频中持续跟踪分割目标,API 沿用 SAM 交互方式。
Meta 发布的图像分割基础模型,可通过点选或文本在任意图像中分割目标,无需额外训练。
阿里开源的全模态模型,仅 2.8B 参数即可同时处理文本、图像与音频,端到端实时语音对话,主打轻量与开源。
Kokoro 是目前参数量最小但质量极高的开源 TTS 模型,82M 参数即可输出自然语音,可 CPU 一键部署。
Cartesia 的低延迟实时语音模型,延迟低至 40ms,支持开源权重,适合语音交互与 Agent。
Meta 开源的音频生成模型,可按文本描述生成旋律与配乐,支持续写与旋律条件生成。
OpenAI 开源的语音识别模型,跨 99 种语言,鲁棒性与准确率达到业界标杆,是本地语音转文字的主流选择。
Genmo 发布的开放权重视频生成模型,10B 参数,在开源视频模型中质量领先,可本地部署。
Stability AI 发布的开源文生图模型,带起整个开源 AI 绘画生态,可本地部署并衍生海量社区模型。
Meta 开源 SAM 3D,单张 2D 图像即可生成 3D 模型,已集成到 Instagram/Facebook 的 View in Room 功能实现商品 3D 预览,Apache-2.0 开源。
阿里开源通义万相 2.5,文生视频与图像全能,中文理解优秀,Apache-2.0 开源可本地部署,是国内开源视频模型代表。
Black Forest Labs 新一代文生图模型 FLUX.2,构图与文本渲染能力再提升,开源版本可本地部署,闭源 API 效果最佳。
面壁开源的 MiniCPM-Octoius,首个开源全模态模型,支持文字、图像、音频、视频输入输出,端侧可跑。
微软 Phi-3.5-vision 是多模态小模型,4.2B 参数,128K 上下文,图像理解与视频理解兼顾,MIT 商用自由。
Stable Video 3D 从单张图生成 3D 环绕视频(novel view synthesis),为 3D 重建与摄影测量提供素材。
共 132 个 AI 模型
Aitishiku.com