多模态开源扩散模型文生图 多模态模型

Stable Diffusion(文生图) 3.5

Stable Diffusion系列 · Stability AI · 2024-06发布

开源支持本地部署多模态国内可直连有免费额度

模型介绍

最流行的开源文生图模型,SD 3 采用扩散 Transformer 架构,文字渲染与人体结构显著提升,可通过 Diffusers 或 ComfyUI 本地生成高质量图像。

模型基础信息

模型系列Stable Diffusion系列
开发机构Stability AI
发布时间2024-06
参数规模0.6B ~ 8B
上下文窗口-
模型类型多模态(文本生图)
中文能力待评估
使用方式网页体验 / API调用 / 本地部署

免费额度与收费政策

开源免费

免费规则详情

权重开源免费商用(3.5 Large 部分版本遵循 Stability 非商用许可,以官方为准)。

收费标准简介

本地运行零成本;官方 API 按张计费。

模型能力介绍

✅ 核心优势

  • 文本生成图像质量高,细节与排版优�
  • 多尺寸输出,摄影级写实风格
  • 生态兼容 ComfyUI / A1111
  • 社区微调模型丰富

⚠️ 短板与局限

  • 生成速度与分辨率受限于显卡
  • 中文提示词支持一般,建议用英文
  • 角色与指定人物一致性仍偏弱

🎯 适用场景

  • 产品海报与概念设计
  • 电商配图与素材生成
  • 游戏插画与角色概念
  • 视觉创意工作流(ComfyUI)

模型使用教程

本章节整理 Stable Diffusion(文生图) 的在线体验、API调用、本地部署全套入门教程,快速上手使用该模型。

  • SD 3 Medium (2B):文字渲染准确,8GB 显存可运行。
  • SDXL:生态最成熟,LoRA/Lycoris 插件丰富,适合写真与创作。
  • 常用工具:ComfyUI(节点式,可扩展)、Automatic1111 WebUI(入门简单)。
  • 工作流:写好提示词(含风格/镜头/光线)→ 采样(20~30 步)→ 可选图生图/ControlNet 精修。

提示词示例:a cute cat, cyberpunk style, neon lights, masterpiece, best quality

pip install diffusers transformers accelerate

下载模型(Hugging Face,stabilityai/stable-diffusion-3-medium,需同意协议):

HF_ENDPOINT=https://hf-mirror.com huggingface-cli download stabilityai/stable-diffusion-3-medium --local-dir ./sd3
from diffusers import StableDiffusion3Pipeline
import torch

pipe = StableDiffusion3Pipeline.from_pretrained("./sd3", torch_dtype=torch.float16).to("cuda")
img = pipe("a cozy reading room, warm light, oil painting style", num_inference_steps=28).images[0]
img.save("room.png")
  1. 安装 ComfyUI 桌面版或手动安装(git clone ComfyUI 仓库)。
  2. 下载 SD3.5 权重(.safetensors)放入 ComfyUI/models/checkpoints/
  3. 启动 ComfyUI:
cd ComfyUI
python main.py
  1. 浏览器打开 http://127.0.0.1:8188,加载 SD3.5 工作流,填写提示词即可出图。

命令行方式(diffusers):

from diffusers import StableDiffusion3Pipeline
pipe = StableDiffusion3Pipeline.from_pretrained("stabilityai/stable-diffusion-3.5-medium", torch_dtype="auto").to("cuda")
img = pipe("a cute cat, photorealistic, studio lighting").images[0]
img.save("cat.png")

💡 使用小技巧

提示词建议用英文描述,风格词(photorealistic、cinematic)效果更稳。

配合 ComfyUI 工作流可批量出图并接入 Lora 自定义风格。

❓ 常见问题 FAQ

Q1:在哪里用最方便?

A1:网页版(Stability AI 平台)、Discord、ComfyUI 或 A1111 均可。

Q2:配置要求高吗?

A2:本地建议 8GB+ 显存;配置一般可走官方 API 按张付费。

访问备注与注意事项