Stable Diffusion 原理与实战:从DDPM到ControlNet可控生成
Stable Diffusion 原理与实战从DDPM到ControlNet可控生成一、引言2022年 Stable Diffusion 的发布引爆了 AI 图像生成革命。从 DDPM 扩散模型到 Stable Diffusion 的潜空间设计再到 ControlNet/IP-Adapter 的可控生成技术演进之快令人目不暇接。本文将从头推导扩散模型数学原理实现完整的 SD 推理管道并深入 LoRA/DreamBooth/ControlNet 三大可控技术。二、扩散模型数学原理2.1 前向扩散过程importtorchimportnumpyasnpimportmatplotlib.pyplotaspltdefforward_diffusion(x_0,beta,t): 前向扩散q(x_t | x_0) N(x_t; sqrt(ᾱ_t)·x_0, (1-ᾱ_t)·I) 从原始图像 x_0 逐步添加噪声得到 x_t # β 是每个时间步的噪声方差alphas1-beta alpha_barstorch.cumprod(alphas,dim0)# ᾱ_t ∏ α_s# 第t步的累积因子sqrt_alpha_bar_ttorch.sqrt(alpha_bars[t])sqrt_one_minus_alpha_bar_ttorch.sqrt(1-alpha_bars[t])# 采样噪声noisetorch.randn_like(x_0)# q(x_t | x_0)x_tsqrt_alpha_bar_t*x_0sqrt_one_minus_alpha_bar_t*noisereturnx_t,noise2.2 反向去噪过程defreverse_diffusion(model,x_t,t,beta,alpha_bars): 反向去噪p_θ(x_{t-1} | x_t) N(x_{t-1}; μ_θ(x_t,t), σ_t²·I) 模型预测噪声 ε_θ(x_t, t)然后通过以下公式恢复 x_{t-1} x_{t-1} 1/√α_t · (x_t - β_t/√(1-ᾱ_t) · ε_θ(x_t,t)) σ_t·z alpha_t1-beta[t]# 模型预测噪声predicted_noisemodel(x_t,t)# 计算均值coeff11.0/torch.sqrt(alpha_t)coeff2beta[t]/torch.sqrt(1-alpha_bars[t])meancoeff1*(x_t-coeff2*predicted_noise)# 添加随机噪声t1时ift1:noisetorch.randn_like(x_t)sigma_ttorch.sqrt(beta[t])else:noise0sigma_t0x_prevmeansigma_t*noisereturnx_prevdefddpm_sampling(model,img_size,timesteps1000):完整 DDPM 采样从纯噪声生成图像model.eval()# 从 N(0, I) 开始x_ttorch.randn(1,3,img_size,img_size)# 预计算 beta 调度betalinear_beta_schedule(timesteps)alpha1-beta alpha_barstorch.cumprod(alpha,dim0)# 从 T 到 1 逐步去噪fortinreversed(range(1,timesteps)):withtorch.no_grad():x_treverse_diffusion(model,x_t,t,beta,alpha_bars)ift%1000:print(fSampling step{timesteps-t}/{timesteps})# 最终图像t0returnx_t2.3 DDPM vs DDIMDDIM 以更少步数实现更快采样defddim_sampling(model,x_t,timesteps50,eta0.0):DDIM 快速采样只需要 50 步fortinreversed(range(1,timesteps1)):t_tensortorch.tensor([t]).long()# 预测噪声epsmodel(x_t,t_tensor)# DDIM 更新公式alpha_bar_talpha_bars[t]alpha_bar_prevalpha_bars[t-1]ift1else1.0# 预测原始图像 x_0pred_x0(x_t-torch.sqrt(1-alpha_bar_t)*eps)/torch.sqrt(alpha_bar_t)# DDIM 方向directiontorch.sqrt(1-alpha_bar_prev-sigma_t**2)*eps# 更新x_ttorch.sqrt(alpha_bar_prev)*pred_x0directionsigma_t*torch.randn_like(x_t)returnx_t三、Stable Diffusion 架构3.1 潜空间扩散Latent DiffusionSD 的核心创新在压缩的潜空间而非像素空间做扩散。fromdiffusersimportStableDiffusionPipelineimporttorch# 加载 SD 1.5pipeStableDiffusionPipeline.from_pretrained(runwayml/stable-diffusion-v1-5,torch_dtypetorch.float16,safety_checkerNone,)pipepipe.to(cuda)# 生成图像prompta serene lake at sunset, mountains in background, photorealisticnegative_promptblurry, low quality, distortedimagepipe(promptprompt,negative_promptnegative_prompt,num_inference_steps30,# DDIM步数guidance_scale7.5,# CFG引导强度width512,height512,generatortorch.Generator(cuda).manual_seed(42),).images[0]image.save(generated.png)3.2 SDXL 高清生成fromdiffusersimportStableDiffusionXLPipeline pipeStableDiffusionXLPipeline.from_pretrained(stabilityai/stable-diffusion-xl-base-1.0,torch_dtypetorch.float16,variantfp16,use_safetensorsTrue,)pipepipe.to(cuda)imagepipe(promptprofessional product photography of a futuristic smartwatch, studio lighting, 8k,negative_prompttext, watermark, low quality,num_inference_steps40,guidance_scale7.5,height1024,width1024,).images[0]四、LoRA 微调风格/角色定制fromdiffusersimportStableDiffusionPipelineimporttorch# 加载基础模型 LoRA权重pipeStableDiffusionPipeline.from_pretrained(runwayml/stable-diffusion-v1-5,torch_dtypetorch.float16).to(cuda)# 加载角色 LoRApipe.load_lora_weights(path/to/character_lora.safetensors)pipe.fuse_lora(lora_scale0.8)# 融合LoRAscale控制强度# 生成角色图像imagepipe(promptcharacter_name sitting in a coffee shop, detailed illustration,negative_promptbad anatomy, extra limbs,num_inference_steps30,guidance_scale7.0,).images[0]# 切换 LoRApipe.unfuse_lora()pipe.load_lora_weights(path/to/style_lora.safetensors)LoRA 训练脚本fromdiffusersimportStableDiffusionPipelinefrompeftimportLoraConfig,get_peft_modelimporttorch# 1. 准备训练数据10-20张图片 描述文本training_data[{image:person1.jpg,caption:a photo of sks person, portrait},{image:person2.jpg,caption:a photo of sks person, standing},# ...]# 2. LoRA 配置lora_configLoraConfig(r8,# LoRA秩lora_alpha16,target_modules[to_q,to_k,to_v,to_out.0],# 注意力层lora_dropout0.1,)# 3. 训练fromdiffusersimportDPMSolverMultistepScheduler pipe.schedulerDPMSolverMultistepScheduler.from_config(pipe.scheduler.config)forepochinrange(num_epochs):forbatchindataloader:# 编码图像到潜空间latentspipe.vae.encode(batch[image]).latent_dist.sample()latentslatents*pipe.vae.config.scaling_factor# 添加噪声noisetorch.randn_like(latents)timestepstorch.randint(0,pipe.scheduler.num_train_timesteps,(latents.shape[0],))noisy_latentspipe.scheduler.add_noise(latents,noise,timesteps)# 编码文本text_embedspipe.text_encoder(batch[caption])[0]# 预测噪声noise_predpipe.unet(noisy_latents,timesteps,text_embeds).sample# MSE 损失losstorch.nn.functional.mse_loss(noise_pred,noise)optimizer.zero_grad()loss.backward()optimizer.step()五、DreamBooth主体定制fromdiffusersimportStableDiffusionPipelinefromdiffusersimportDreamBoothTrainer,DreamBoothConfigclassDreamBoothTrainer:DreamBooth用少量图片学习新概念def__init__(self,instance_images_dir,class_images_dirNone):self.instance_dirinstance_images_dir# 3-5张目标图片self.class_dirclass_images_dir# 先验保留图片deftrain(self,instance_prompta photo of sks dog,class_prompta photo of a dog):训练步骤# 1. 先验保留损失Preservation Loss# L E[||ε - ε_θ(x_t, c_instance)||²]# λ · E[||ε - ε_θ(x_t, c_class)||²]# 2. 文本编码器微调# 为 sks 学习新的 token embedding# 3. UNet 微调# 同时更新 UNet 权重或仅更新注意力层passdefgenerate(self,pipe,prompt):使用训练好的 DreamBooth 生成pipe.load_dreambooth_lora(trained_model)returnpipe(prompt).images[0]# 使用 HuggingFace diffusers 的 DreamBoothfromdiffusersimportDiffusionPipeline pipeDiffusionPipeline.from_pretrained(sd-dreambooth-library/dog-sks)imagepipe(a photo of sks dog in a bucket).images[0]六、ControlNet可控生成6.1 各种控制条件fromdiffusersimportStableDiffusionControlNetPipeline,ControlNetModelfromdiffusers.utilsimportload_imagefromPILimportImageimportcv2importnumpyasnp# 加载 ControlNet 模型controlnets{canny:ControlNetModel.from_pretrained(lllyasviel/sd-controlnet-canny),depth:ControlNetModel.from_pretrained(lllyasviel/sd-controlnet-depth),pose:ControlNetModel.from_pretrained(lllyasviel/sd-controlnet-openpose),scribble:ControlNetModel.from_pretrained(lllyasviel/sd-controlnet-scribble),seg:ControlNetModel.from_pretrained(lllyasviel/sd-controlnet-seg),ip2p:ControlNetModel.from_pretrained(lllyasviel/sd-controlnet-ip2p),}# Canny 边缘控制pipeStableDiffusionControlNetPipeline.from_pretrained(runwayml/stable-diffusion-v1-5,controlnetcontrolnets[canny],torch_dtypetorch.float16).to(cuda)# 准备控制图像input_imageload_image(sketch.png).convert(RGB)canny_imagenp.array(input_image)canny_imagecv2.Canny(canny_image,100,200)canny_imagecanny_image[:,:,None]canny_imagenp.concatenate([canny_image,canny_image,canny_image],axis2)canny_imageImage.fromarray(canny_image)# 生成imagepipe(prompta beautiful house on a hill, detailed, 8k,imagecanny_image,num_inference_steps20,controlnet_conditioning_scale0.8,# 控制强度).images[0]6.2 多重 ControlNetfromdiffusersimportStableDiffusionControlNetPipeline# 同时使用 Canny Depthcontrolnet_cannyControlNetModel.from_pretrained(lllyasviel/sd-controlnet-canny)controlnet_depthControlNetModel.from_pretrained(lllyasviel/sd-controlnet-depth)pipeStableDiffusionControlNetPipeline.from_pretrained(runwayml/stable-diffusion-v1-5,controlnet[controlnet_canny,controlnet_depth],# 多个ControlNet!torch_dtypetorch.float16).to(cuda)imagepipe(prompta modern office interior,image[canny_image,depth_image],controlnet_conditioning_scale[0.7,0.5],).images[0]6.3 IP-Adapter参考图风格迁移fromdiffusersimportStableDiffusionPipelinefromdiffusersimportIPAdapter pipeStableDiffusionPipeline.from_pretrained(runwayml/stable-diffusion-v1-5,torch_dtypetorch.float16).to(cuda)# 加载 IP-Adapterpipe.load_ip_adapter(h94/IP-Adapter,subfoldermodels,weight_nameip-adapter-plus_sd15.safetensors)# 参考图风格来源style_imageload_image(van_gogh_style.jpg)imagepipe(prompta city street at night,ip_adapter_imagestyle_image,ip_adapter_scale0.6,# 风格强度num_inference_steps30,).images[0]七、推理优化importtorch# 1. xFormers 加速2-3xpipe.enable_xformers_memory_efficient_attention()# 2. FP16 推理pipepipe.to(dtypetorch.float16)# 3. CPU Offload降低显存pipe.enable_model_cpu_offload()# 4. VAE 切片pipe.enable_vae_slicing()# 5. 注意力切片pipe.enable_attention_slicing()# 6. Token Merging (ToMe) 加速importtomesd tomesd.apply_patch(pipe,ratio0.5)# 减少50% token# 性能数据 (512×512, RTX 3090):# 默认: ~4s, 8.5GB VRAM# xFormers: ~1.5s, 6.2GB VRAM# ToMe 0.5: ~1.0s, 5.5GB VRAM八、总结Stable Diffusion 技术栈全景DDPM→DDIM从 1000 步到 50 步采样Latent Diffusion在压缩潜空间工作效率革命LoRA10 张图即可定制风格/角色DreamBooth学习全新概念3-5张图ControlNet边缘/深度/姿态… 精确控制IP-Adapter参考图风格迁移xFormers/ToMe推理加速 2-3x

相关新闻

ZenlessZoneZero-OneDragon:三步实现绝区零高效自动游戏体验

ZenlessZoneZero-OneDragon:三步实现绝区零高效自动游戏体验

ZenlessZoneZero-OneDragon:三步实现绝区零高效自动游戏体验 【免费下载链接】ZenlessZoneZero-OneDragon 绝区零 一条龙 | 全自动 | 自动闪避 | 自动每日 | 自动空洞 | 支持手柄 项目地址: https://gitcode.com/gh_mirrors/ze/ZenlessZoneZero-OneDragon 你…

2026/7/25 0:48:56 阅读更多 →
免费开源AMD Ryzen调试神器:5个核心技巧彻底释放处理器潜能

免费开源AMD Ryzen调试神器:5个核心技巧彻底释放处理器潜能

免费开源AMD Ryzen调试神器:5个核心技巧彻底释放处理器潜能 【免费下载链接】SMUDebugTool A dedicated tool to help write/read various parameters of Ryzen-based systems, such as manual overclock, SMU, PCI, CPUID, MSR and Power Table. 项目地址: https…

2026/7/25 0:48:56 阅读更多 →
AI模型推理能力“暗榜”首次公开:中小团队不敢说的真相——哪些模型在A10/A100上实际跑不满50%算力?

AI模型推理能力“暗榜”首次公开:中小团队不敢说的真相——哪些模型在A10/A100上实际跑不满50%算力?

更多请点击: https://kaifayun.com 第一章:AI模型推理能力“暗榜”发布背景与行业影响 近年来,大模型性能评估长期聚焦于训练规模、参数量与通用基准(如MMLU、BIG-Bench)得分,却普遍忽视真实生产环境中最关…

2026/7/25 0:48:56 阅读更多 →

最新新闻

反馈让模糊变清晰。

反馈让模糊变清晰。

很多人生困惑,不是因为没有答案,而是因为缺少现实反馈。没有反馈时: 你只能猜。 有反馈后: 你开始知道。第一层:什么叫“模糊”? 人生中很多问题都是模糊的: “我适合做什么?”“我有…

2026/7/25 0:57:57 阅读更多 →
困难不是人生的错误。

困难不是人生的错误。

困难不是证明人生出了问题,而是生命系统在成长过程中遇到的真实反馈。很多人面对困难时,会产生一个隐藏判断:“如果我的人生是正确的,就不应该这么痛苦。”但这个假设本身可能就是错误的。第一层:为什么人会认为困难是…

2026/7/25 0:57:57 阅读更多 →
在现实限制中,主动设计自己的下一步。

在现实限制中,主动设计自己的下一步。

成熟的人生,不是等待拥有完美条件后再开始,而是在已有条件下,创造下一步可能。 很多人的困境: 不是没有路。 而是认为: “等条件好了,我才能开始。” 但现实很少给人: 完美时间。 完美资源…

2026/7/25 0:57:57 阅读更多 →
三步实现微信聊天记录永久保存:开源工具助你重获数据主权

三步实现微信聊天记录永久保存:开源工具助你重获数据主权

三步实现微信聊天记录永久保存:开源工具助你重获数据主权 【免费下载链接】WeChatExporter 一个可以快速导出、查看你的微信聊天记录的工具 项目地址: https://gitcode.com/gh_mirrors/wec/WeChatExporter 在数字时代,我们的聊天记录不仅是简单的…

2026/7/25 0:55:57 阅读更多 →
为什么 DCD 分配向量表时,函数地址要加 1(LSB=1)?

为什么 DCD 分配向量表时,函数地址要加 1(LSB=1)?

难度:★★ 本文首发于我的嵌入式技术号「OneChan」,未经授权禁止转载。 打开任何一个 Cortex-M3 的启动文件,查看向量表,你会看到类似这样的代码: __Vectors DCD __initial_sp ; 0x00000000:栈顶DCD Reset_Handler ; 0x00000004:复位入口…

2026/7/25 0:54:57 阅读更多 →
Chrome滚动截图终极指南:如何一键保存完整网页内容

Chrome滚动截图终极指南:如何一键保存完整网页内容

Chrome滚动截图终极指南:如何一键保存完整网页内容 【免费下载链接】full-page-screen-capture-chrome-extension One-click full page screen captures in Google Chrome 项目地址: https://gitcode.com/gh_mirrors/fu/full-page-screen-capture-chrome-extensio…

2026/7/25 0:54:57 阅读更多 →

日新闻

突破文档下载限制:kill-doc让你看到的都能保存

突破文档下载限制:kill-doc让你看到的都能保存

突破文档下载限制:kill-doc让你看到的都能保存 【免费下载链接】kill-doc 看到经常有小伙伴们需要下载一些免费文档,但是相关网站浏览体验不好各种广告,各种登录验证,需要很多步骤才能下载文档,该脚本就是为了解决您的…

2026/7/25 0:00:35 阅读更多 →
C++ string类模拟实现:从深拷贝到内存管理的完整指南

C++ string类模拟实现:从深拷贝到内存管理的完整指南

1. 项目概述:为什么我们要“手撕”string类?在C的学习道路上,尤其是从C语言过渡到C的“初阶”阶段,string类绝对是一个绕不开的核心。标准库里的std::string用起来太方便了,、find、substr,几个操作符和函数…

2026/7/25 0:00:35 阅读更多 →
三角洲寻宝鼠工具:高效文件搜索与资源管理实战指南

三角洲寻宝鼠工具:高效文件搜索与资源管理实战指南

1. 先搞清楚“三角洲寻宝鼠”到底是什么工具从名称来看,“三角洲寻宝鼠”更像是一个资源查找或文件检索类工具,而不是游戏或娱乐软件。这类工具的核心价值在于帮助用户快速定位特定资源,比如文档、图片、压缩包或特定格式的文件。如果你经常需…

2026/7/25 0:00:35 阅读更多 →

周新闻

Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…

2026/7/24 3:59:20 阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/24 1:23:39 阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击: https://intelliparadigm.com 第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/24 18:52:18 阅读更多 →

月新闻