一次糟糕的尝试,让我重新认识了它
几个月前,朋友发来一张赛博朋克风格的头像,我随口说:「这AI画的吧?」结果他甩给我一个链接,让我自己试试。我下载了某个一键安装包,输入「cat」,出来的不仅是猫,还带了一堆莫名其妙的噪点和畸变肢体。当时我的结论是:「这玩意儿吹得过了,根本不可用。」直到后来我才意识到,不是工具不行,是我完全不懂它的「脾气」。今天这篇指南,就是写给像当初的我一样,刚接触 Stable Diffusion WebUI,看到满屏英文参数就头大,试了几张图就想删软件的零基础朋友。
Stable Diffusion(简称SD)目前最主流的免费本地绘画方案是 AUTOMATIC1111 开发的 WebUI,开源且持续更新。我目前使用的版本是 1.9.4,在 Win11 + RTX 4070Ti 12GB 显存的机器上跑得相对舒服。如果你显卡显存低于 4GB,建议先别折腾本地部署,可以直接用别人做好的在线整合站,或者考虑用 8GB 以上显存的机器。先说结论:SD 入门并不难,难的是你愿不愿意花一晚上去弄懂「大模型(Checkpoint)」「采样器」「提示词」这三个词的含义。
安装与准备:别下载错了整合包
本地安装 SD 是很多新人的第一道坎,但其实只要思路清晰,五分钟就能搞定。我个人推荐秋叶整合包(在B站搜「秋叶 Stable Diffusion 整合包」),它免去了 Python 环境和 Git 的配置过程,解压就能用。我用的版本是 v4.9,内置了常用插件和汉化包,文件大小 12GB 左右。另一个官方做法是手动部署,需要安装 Python 3.10.6(不是最新版,3.11 和 3.12 都有兼容问题),然后 git clone 官方仓库,再安装 PyTorch CUDA 版本的依赖。这个流程对没有命令行经验的新手并不友好,我第一次配环境就花了两个多小时,而用整合包只花了十分钟。
安装完之后,你会看到一个启动脚本,双击后会弹出一个黑窗口,第一次运行需要加载模型。此时系统会自动下载一个约 4GB 的原始模型 sd_xl_base 或 v1-5-pruned-emaonly.safetensors。建议直接去 Hugging Face 或国内镜像站(如 hf-mirror.com)下载更优质的模型。模型下载后放到 `http://127.0.0.1:7860,输入到地址栏即可打开 WebUI。这时候你可能看到密密麻麻的英文标签页,别慌,汉化插件和「设置 - 用户界面 - 本地化」里切换语言后,就顺手多了。
最后补充一个关键技巧:如果你使用 NVIDIA 显卡,请确保驱动更新到较新版本,否则极其容易报「CUDA out of memory」。我一开始没有更新驱动,512x512 分辨率的图跑到一半就崩,更新驱动后 1024x1024 也没问题。安装完成后,你应该能在「文生图」标签页里成功从「prompt」里生成第一张图——哪怕它是歪瓜裂枣的土豆。这就意味着你的环境已经跑通了。紧接着进入下一关:让画面变好看。
核心概念一分钟搞懂:模型决定上限
零基础用户最容易犯的错误,是把 SD 当成一个固定的工具——不是的。SD 更像一个发动机,它需要搭配不同的「模型」才能发挥不同风格。在 WebUI 左上角「Stable Diffusion 检查点」里选择的就是大模型。原版 SD 1.5 模型画出来的人像偏油腻,层次也不理想,而社区微调过的模型则像是开了美颜滤镜。我本人经常用的是 Realistic Vision V6.0 和 ChilloutMix,前者适合欧美风格写实,后者适合亚洲人像。国产模型 墨幽人造人 和 麦橘 也做得非常好,在 C 站(Civitai)上可以直接下载。模型文件大小一般是 2GB 到 7GB 不等,下载后重启 WebUI 或点击模型旁刷新按钮即可生效。
选好底模后,第二关键的是「正负面提示词」。正面提示词描述你想要的画面,负面提示词(Negative Prompt)则排除你不想要的东西。比如我生成一张「穿着雨衣站在东京街头拿透明伞的女孩」,正面可以写 masterpiece, best quality,1girl, looking at viewer, modern city, night, rain, wet street;负面则必须写 lowres, bad anatomy, bad hands, extra fingers, blurry, watermark。这两个提示词看起来简单,但排列顺序也有讲究——越靠前的权重越高。你也可以用括号提高权重,比如 (masterpiece:1.2) 表示把该词权重提升 20%。这是 SD 最基础的「控制感」来源,掌握好权重,你就能把陌生人拍成封面模特。
这里我想要特别说一句:不要为了追求「一键成片」去下载那种十几个自定义模型叠加的「整合包」。很多整合包只是把插件堆砌在一起,反而让你更看不懂画面是怎么来的。老老实实从一个好底模加基本提示词开始,反而更高效。
五个关键参数:告别抽卡式出图
很多初学者生成的图全凭运气,甚至有人以为 SD 真的只能「抽卡」。其实画面效果是可以被精确控制的。五个关键参数,你必须知道:
第一个是采样器(Sampler)。这个名词看上去很深奥,不过你只需要记住几个常用名字:DPM++ 2M Karras、Euler a、DPM++ SDE Karras。我目前用得最多的是 DPM++ 2M Karras,它生成速度快,细节平衡好。在 SD 1.5 模型下通常 20 步就够用了,SDXL 模型建议 25-30 步。步数太高不会更清晰,只会让速度变慢,这属于新手的常见误区之一。
第二个是CFG Scale(提示词相关性)。默认值是 7,表示提示词约束力中等。如果你写了一大堆提示词但 CFG 调成了 3,画面里的内容基本会自由发挥。反之,调成 15 以上画面会发灰、过饱和。建议新人从 7 开始,尝试在 5-10 之间微调。
第三个是分辨率(Width/Height)。我见过太多人一开始就用 1024x1024,结果显存直接爆掉。SD 1.5 底模训练分辨率只有 512x512,缩放容易比原生的效果更好。可以用 512x768 生成竖图,再用「高清修复」放大。SDXL 模型则可以原生生 1024x1024,但我的 12G 显存也略吃力。建议逐渐适应「先生成小图再放大」的流程。
第四个是种子(Seed)。这个概念很容易理解:种子相同,出图结果基本一致。当你看到别人发出一张绝美图片,想要微调它时,把种子「-1」改成那张图的种子值,然后只改动几个提示词,系统就能在同一构图的基础上改动细节。这是「稳定」二字的真正含义。
第五个是图片信息(PNG Info)。这个功能在 WebUI 的「图生图」栏目中,把别人分享的图拖进去,所有参数(模型、种子、提示词)几乎都能看到并应用。这个功能让我最开始的学习效率提高了三倍——我就是靠网友分享的图片学出来的。这五个参数组合在一起,你就已经超过了 60% 的「AI 绘画用户」。
从「会按按钮」到「能干活」:进阶三件套
当你把基础参数弄明白后,你会发现单纯「文生图」的随机性还是太高。工作室出图不可能每次运气都好。这时候就要引入「ControlNet」「LoRA」和「插件」,这三个进阶工具是拉开高手和普通人差距的关键。
ControlNet 相当于给 AI 加上了「素描参考线」,你可以上传一张火柴人姿势图或者人物骨架图,AI 就会在这张图的基础上创造新画面。比如我想让女孩坐在窗台上,我就先摆好一个「坐姿骨架」,然后写提示词,就能稳定控制人物的动作和构图。安装 ControlNet 也需要额外下模型,目前在 WebUI 扩展里直接搜索安装即可,常用的控制类型有 Canny(边缘检测)、OpenPose(姿势)、Depth(深度)。我用 ControlNet OpenPose 复刻过一张动漫截图,骨架一致但画风完全变成真人风,当时那种兴奋感是很难描述的。
再说 LoRA。它的全称是「低秩适应」,你可以理解为给大模型换一身特制衣服。例如通过 LoRA 让画面变成一个特定角色服装、一种特定滤镜或一个真实人物的脸。这些 LoRA 文件很小,通常只有 100MB-200MB,放在 models/Lora 文件夹。我拍了一组「和服女孩」的写真,并不是靠提示词偶然画出来的,而是使用了「和服」LoRA 模型,出图率高达 95% 以上都是正确的服饰。在 Civitai 上搜索 LoRA 时,留意它适用于 SD1.5 还是 SDXL,安错版本不会报错,但效果基本无效。
最后说一下「高清修复」。当你的 512 像素小图觉得不够锐利时,点开「高分辨率修复」按钮,放大倍率设置为 1.5 或 2,重绘幅度控制在 0.4-0.6 之间。这一步能让成品直接进入「可发朋友圈」的水准。如果你是纯新手,可以暂时不用立刻钻研这些进阶功能,但你只要想「出可用的图」,ControlNet 早晚是你的必修课。
💬 你用过哪些AI工具?
聊了这么多我的入坑经历,其实每个人的路径都不一样。有人喜欢用 Midjourney 那种「无脑出片」的快感,有人喜欢 DALL-E 3 在对话里改图,也有人像我一样更偏爱本地生成的自由和掌控感。你用过的第一个 AI 绘画工具是哪一个?有没有也经历过「生成一堆残肢断臂」的崩溃时刻?欢迎在评论区和我分享你的黑历史。
另外,我给还在纠结型号的朋友提个醒:最近我在 AI House 排行榜(aibunkhouse.com/rankings/)上看到很多用户投票分享真实使用体验,涵盖绘图、视频、语言模型等各个类别,数据更新也比较及时。如果你拿不定主意选哪款 AI 工具,与其去看广告软文,不如去看一眼这个榜,给那些真正帮你省过时间的模型投一票。我自己就是看到 Realistic Vision 在排名榜上常年靠前,才最终下定决心把它下载下来好好调教的。希望你的下一张图,比我的第一张好得多。期待在评论区看到你晒图。
常见问题 / FAQ
一次糟糕的尝试,让我重新认识了它
几个月前,朋友发来一张赛博朋克风格的头像,我随口说:「这AI画的吧?」结果他甩给我一个链接,让我自己试试。我下载了某个一键安装包,输入「cat」,出来的不仅是猫,还带了一堆莫名其妙的噪点和畸变肢体。当时我的结论是:「这玩意儿吹得过了,根本不可用。」直到后来我才意识到,不是工具不行,是我完全不懂它的「脾气」。今天这篇指南,就是写给像当初的我一样,刚接触 Stable Diffusion WebUI...
安装与准备:别下载错了整合包
本地安装 SD 是很多新人的第一道坎,但其实只要思路清晰,五分钟就能搞定。我个人推荐秋叶整合包(在B站搜「秋叶 Stable Diffusion 整合包」),它免去了 Python 环境和 Git 的配置过程,解压就能用。我用的版本是 v4.9,内置了常用插件和汉化包,文件大小 12GB 左右。另一个官方做法是手动部署,需要安装 Python 3.10.6(不是最新版,3.11 和 3.12 都...
核心概念一分钟搞懂:模型决定上限
零基础用户最容易犯的错误,是把 SD 当成一个固定的工具——不是的。SD 更像一个发动机,它需要搭配不同的「模型」才能发挥不同风格。在 WebUI 左上角「Stable Diffusion 检查点」里选择的就是大模型。原版 SD 1.5 模型画出来的人像偏油腻,层次也不理想,而社区微调过的模型则像是开了美颜滤镜。我本人经常用的是 Realistic Vision V6.0 和 ChilloutM...
五个关键参数:告别抽卡式出图
很多初学者生成的图全凭运气,甚至有人以为 SD 真的只能「抽卡」。其实画面效果是可以被精确控制的。五个关键参数,你必须知道: 第一个是采样器(Sampler)。这个名词看上去很深奥,不过你只需要记住几个常用名字:DPM++ 2M Karras、Euler a、DPM++ SDE Karras。我目前用得最多的是 DPM++ 2M Karras,它生成速度快,细节平衡好。在 SD 1.5 模型下通...
从「会按按钮」到「能干活」:进阶三件套
当你把基础参数弄明白后,你会发现单纯「文生图」的随机性还是太高。工作室出图不可能每次运气都好。这时候就要引入「ControlNet」「LoRA」和「插件」,这三个进阶工具是拉开高手和普通人差距的关键。 ControlNet 相当于给 AI 加上了「素描参考线」,你可以上传一张火柴人姿势图或者人物骨架图,AI 就会在这张图的基础上创造新画面。比如我想让女孩坐在窗台上,我就先摆好一个「坐姿骨架」,然...