Stable Diffusion web UI:基于 Gradio 的扩散模型图像生成界面

人工智能 2026-09-20 6 阅读

为 Stable Diffusion 提供浏览器图形界面,把文生图、图生图、修复与放大等操作集中到可交互的网页中,降低使用门槛。

这个工具是什么

Stable Diffusion web UI 是 AUTOMATIC1111 维护的开源项目,用 Gradio 库为 Stable Diffusion 实现网页界面,主要语言为 Python,采用 AGPL-3.0 许可证。它把扩散模型的推理流程封装成表单式操作,用户无需编写代码即可完成图像生成与编辑。README 列出 txt2img、img2img、Outpainting、Inpainting、Color Sketch、Prompt Matrix、Upscale 等模式,并集成 GFPGAN、CodeFormer、RealESRGAN、ESRGAN、SwinIR、Swin2SR、LDSR 等修复与放大组件。项目还提供一键安装运行脚本,但仍需自行安装 Python 与 git。

核心能力

  • 提供 txt2img 与 img2img 两种基础生成模式,并支持 Outpainting、Inpainting 与 Color Sketch 等编辑操作
  • 支持 Attention 语法、Prompt Matrix、Prompt Editing、Composable-Diffusion 与 Negative prompt 等提示词控制方式
  • Extras 标签集成 GFPGAN、CodeFormer、RealESRGAN、ESRGAN、SwinIR、Swin2SR、LDSR 等修复与放大工具
  • 生成参数随图像保存,可拖回 PNG Info 标签还原,并支持 X/Y/Z plot、Loopback、Checkpoint Merger 等实验功能

科研中的典型用法

  • 用 txt2img 按提示词批量生成图像,并通过 X/Y/Z plot 对比不同参数组合下的输出差异
  • 用 img2img 配合 Inpainting、Outpainting 对已有图像做局部重绘或向外扩展,用于素材修补与构图延展
  • 用 Extras 中的 GFPGAN、CodeFormer 修复人脸,或用 RealESRGAN、ESRGAN、SwinIR 等对图像做超分辨率放大

快速上手

需先安装 Python 与 git,再克隆仓库并运行一键启动脚本(Linux/macOS 为 webui.sh,Windows 为 webui-user.bat)。首次运行会自动下载依赖与模型,随后在浏览器打开本地地址即可使用。README 提到 4GB 显存可运行,也有 2GB 可用的报告;可在设置页调整默认值,启用 --allow-code 后可从界面运行任意 Python 代码。

生态与相近工具

同领域还有 ComfyUI、InvokeAI、Fooocus 等基于扩散模型的界面,以及 diffusers 等库。Stable Diffusion web UI 的特点是功能覆盖面广、社区扩展脚本多,适合需要大量参数调节与批量实验的用户;若偏好节点式流程或更轻量的交互,可考虑其他方案。README 提到可通过 Custom Scripts 接入社区扩展。

项目信息


本文属于《学科研究工具知识库 · 人工智能》第 2 篇(按 GitHub 星标排序)。收录标准:该学科公开可获取的开源研究工具,星标与活跃度为主要参考,不代表对其性能或适用性的背书;选型前请结合自身场景评估。

评论 共 0 条

暂无评论

微信小程序

微信扫一扫体验

立即
投稿

微信公众账号

微信扫一扫加关注

发表
评论
返回
顶部