Stability图生视频开源研究 多模态模型

Stable Video Diffusion(视频) Img2Vid-XT

Stable Video Diffusion系列 · Stability AI · 2023-11发布

开源支持本地部署多模态国内可直连有免费额度

模型介绍

Stability AI 开源的图像生成视频模型,输入一张图片即可生成短视频,研究友好,可与 Stable Diffusion 生态结合做动态内容。

模型基础信息

模型系列Stable Video Diffusion系列
开发机构Stability AI
发布时间2023-11
参数规模1.1B / 2.1B
上下文窗口图生视频
模型类型图生视频
中文能力一般
使用方式网页体验 / API调用 / 本地部署

免费额度与收费政策

开源(研究许可)

免费规则详情

社区许可,非商业/研究用途为主(商用需授权)。

收费标准简介

本地免费;云端按量付费。

模型能力介绍

✅ 核心优势

  • 开源的图生视频方案
  • 生成平滑 motion
  • 可与 SD 生态结合
  • 社区工作流成熟

⚠️ 短板与局限

  • 研究许可(商用受限)
  • 生成时长较短
  • 需要较强显卡

🎯 适用场景

  • 图像动态化实验
  • 短视频素材
  • 研究项目
  • ComfyUI 工作流

模型使用教程

本章节整理 Stable Video Diffusion(视频) 的在线体验、API调用、本地部署全套入门教程,快速上手使用该模型。

  • 用法:输入一张图片 → 生成一段短视频(约 2-4 秒)。
  • 场景:动态海报、表情、研究 Demo。
  • 平台:ComfyUI / Hugging Face Space。
HF_ENDPOINT=https://hf-mirror.com huggingface-cli download stabilityai/stable-video-diffusion-img2vid-xt --local-dir ./svd

Hugging Face 上提供了 Gradio 在线 Demo;本地可用 diffusers / ComfyUI 调用。

  1. 安装 ComfyUI 及 SVD 相关节点。
  2. 加载「Stable Video Diffusion」(Img2Vid)工作流。
  3. 上传图片生成视频。

diffusers 方式:

from diffusers import StableVideoDiffusionPipeline
pipe = StableVideoDiffusionPipeline.from_pretrained("stabilityai/stable-video-diffusion-img2vid-xt", torch_dtype="float16").to("cuda")

💡 使用小技巧

在 ComfyUI 中直接使用 SVD 节点。

清晰输入图效果更好。

❓ 常见问题 FAQ

Q1:能商用吗?

A1:需注意社区许可,商用需授权/换用商业版。

Q2:怎么用最方便?

A2:ComfyUI 工作流。

访问备注与注意事项