Diffusers库的初识及使用

diffusers库的目标是：

将扩散模型（diffusion models）集中到一个单一且长期维护的项目中
以公众可访问的方式复现高影响力的机器学习系统，如DALLE、Imagen等
让开发人员可以很容易地使用API进行模型训练或者使用现有模型进行推理

diffusers的核心分成三个组件：

Pipelines: 高层类，以一种用户友好的方式，基于流行的扩散模型快速生成样本
Models：训练新扩散模型的流行架构，如UNet
Schedulers：推理场景下基于噪声生成图像或训练场景下基于噪声生成带噪图像的各种技术

diffusers的安装

pip install diffusers

先看推理

导入Pipeline，from_pretrained()加载模型，可以是本地模型，或从the Hugging Face Hub自动下载。

from diffusers import StableDiffusionPipeline

image_pipe = StableDiffusionPipeline.from_pretrained("CompVis/stable-diffusion-v1-4")

# 加载本地模型：

# image_pipe = StableDiffusionPipeline.from_pretrained("./models/Stablediffusion/stable-diffusion-v1-4")

image_pipe.to("cuda")

prompt = "a photograph of an astronaut riding a horse"

pipe_out = image_pipe(prompt)

image = pipe_out.images[0]

# you can save the image with

# image.save(f"astronaut_rides_horse.png")

我们查看下image_pipe的内容：

StableDiffusionPipeline {

  "_class_name": "StableDiffusionPipeline",

  "_diffusers_version": "0.10.2",

  "feature_extractor": [

    "transformers",

    "CLIPFeatureExtractor"

  ],

  "requires_safety_checker": true,

  "safety_checker": [

    "stable_diffusion",

    "StableDiffusionSafetyChecker"

  ],

  "scheduler": [

    "diffusers",

    "PNDMScheduler"

  ],

  "text_encoder": [

    "transformers",

    "CLIPTextModel"

  ],

  "tokenizer": [

    "transformers",

    "CLIPTokenizer"

  ],

  "unet": [

    "diffusers",

    "UNet2DConditionModel"

  ],

  "vae": [

    "diffusers",

    "AutoencoderKL"

  ]

}

查看Images的结构：

StableDiffusionPipelineOutput(

images=[<PIL.Image.Image image mode=RGB size=512x512 at 0x1A14BDD7730>],

nsfw_content_detected=[False])

由此，可以看到pipe_out的包含两部分，第一部分就是生成的图片列表，如果只有一张图片，则pipe_out.images[0]即可取出目标图像。

如果我们要一次生成多张图像呢？只需要修改prompt的list长度即可，代码如下。

from diffusers import StableDiffusionPipeline

image_pipe = StableDiffusionPipeline.from_pretrained("CompVis/stable-diffusion-v1-4")

image_pipe.to("cuda")

prompt = ["a photograph of an astronaut riding a horse"] * 3

out_images = image_pipe(prompt).images

for i, out_image in enumerate(out_images):

    out_image.save("astronaut_rides_horse" + str(i) + ".png")

在使用image_pipe生成图像时，默认是float32精度的，若本地现在不足，可能会报Out of memory的错误，此时，可以通过加载float16精度的模型来解决。

Note: If you are limited by GPU memory and have less than 10GB of GPU RAM available, please make sure to load the StableDiffusionPipeline in float16 precision instead of the default float32 precision as done above.

You can do so by loading the weights from the fp16 branch and by telling diffusers to expect the weights to be in float16 precision:
image_pipe = StableDiffusionPipeline.from_pretrained("CompVis/stable-diffusion-v1-4", revision="fp16", torch_dtype=torch.float16)

对于每个PipeLine都有一些特定的配置，如StableDiffusionPipeline除了必要的prompt参数，还可以配置如下参数：

num_inference_steps: int = 50
guidance_scale: float = 7.5
generator: Optional[torch.Generator] = None
等等

示例：如果你想要每次得到的结果均一致，可以设置每次的种子都一样

generator = torch.Generator("cuda").manual_seed(1024)

prompt = ["a photograph of an astronaut riding a horse"] * 3

out_images = image_pipe(prompt, generator=generator).images

再看训练

Diffusers库的初识及使用的更多相关文章

ECharts（Enterprise Charts 商业产品图表库）初识
一.简介大数据时代,重新定义图表的时候到了,所以随之ECharts就随之出现了. ECharts(Enterprise Charts 商业产品图表库) 是基于Canvas的,纯Javascript ...
2_认识STM32库
2_认识STM32库 STM32库是由ST公司针对STM32提供的函数接口API,开发者可以调用这些函数接口来配置STM32的寄存器,使得开发人员得以脱离最底层的寄存器操作,开发快速. 库是架设在寄存 ...
python之路--MySQL数据库初识
一 . MySQL安装 # 下载MySQL地址 https://dev.mysql.com/downloads # 要选稳定的,不要选最新的,稳定的就是半年以上没有出现过bug 现在5.6.43为绝大 ...
python--MySQL数据库初识
一 . MySQL安装 # 下载MySQL地址 https://dev.mysql.com/downloads # 要选稳定的,不要选最新的,稳定的就是半年以上没有出现过bug 现在5.6.43为绝大 ...
浅谈 jQuery 核心架构设计
jQuery对于大家而言并不陌生,因此关于它是什么以及它的作用,在这里我就不多言了,而本篇文章的目的是想通过对源码简单的分析来讨论 jQuery 的核心架构设计,以及jQuery 是如何利用javas ...
浅析 jQuery 内部架构设计
jQuery 对于大家而言并不陌生,因此关于它是什么以及它的作用,在这里我就不多言了,而本篇文章的目的是想通过对源码简单的分析来讨论 jQuery 的内部架构设计,以及 jQuery 是如何利用Jav ...
boost的下载和安装(windows版)
1 简介 boost是一个准C++标准库,相当于STL的延续和扩充,它的设计理念和STL比较接近,都是利用泛型让复用达到最大化. boost主要包含以下几个大类: 字符串及文本处理.容器.迭代器(it ...
第9章初识STM32固件库
第9章初识STM32固件库全套200集视频教程和1000页PDF教程请到秉火论坛下载:www.firebbs.cn 野火视频教程优酷观看网址:http://i.youku.com/fire ...
第9章初识STM32固件库—零死角玩转STM32-F429系列
第9章初识STM32固件库全套200集视频教程和1000页PDF教程请到秉火论坛下载:www.firebbs.cn 野火视频教程优酷观看网址:http://i.youku.com/fire ...
第9章初识HAL固件库
本章参考资料:<STM32F76xxx参考手册>.<STM32F7xx规格书>.<Cortex-M3权威指南>, STM32 HAL库帮助文档:<STM32F ...

随机推荐

基于.NetCore开发博客项目 StarBlog - (20) 图片显示优化
前言我的服务器带宽比较高,博客部署在上面访问的时候几乎没感觉有加载延迟,就没做图片这块的优化,不过最近有小伙伴说博客的图片加载比较慢,那就来把图片优化完善一下吧~ 目前有两个地方需要完善图片瀑布流 ...
win7修改开机动画
开机动画的修改首先win7的过场动画是存在于C:\Windows\System32\bootres.dll ,而修改过程动画就需要修改这个dll,我不会改,所以只能用工具美化大师,软媒魔方里面的一个 ...
关于urllib.request解析网站不能decode
原因不能decode,无论以gbk还utf8都无法正常解码,这个原因是因为网页被gzip压缩了,需要解压缩解决办法 import urllib.request import gzip url = ...
log4j漏洞原理
一.前置知识 1.JNDI接口 JNDI即Java Naming and Directory Interface(JAVA命名和目录接口),它提供一个目录系统,并将服务名称与对象关联起来,从而使得开发 ...
【Linux】个人笔记本安装Centos并开放22端口供外网连接
〇.参考资料一.配置及安装内容 (一)配置 [today]低配笔记本(装centos):4+500G 个人电脑(装三个节点的虚拟机集群环境):8+628G (二)所装软件 Linux系统(可选cen ...
MySQL数据结构(索引)
目录一:MySQL索引与慢查询优化 1.什么是索引? 2.索引类型分类介绍 3.不同的存储引擎支持的索引类型也不一样二:索引的数据结构 1.二叉树(每个节点只能分两个叉) 2.数据结构(B树) 3 ...
A_A01_001 KEIL4-KEIL5软件安装
@ 目录一.软件下载二.交流学习三.防止电脑误删文件操作步骤四.KEIL4安装五.KEIL5安装六.注意事项一.软件下载 KEIL4/KEIL5网盘链接戳它跳转提取码:omni 二. ...
Vm无法连接到虚拟机，请确保您有权限运行该程序、访问该程序使用的所有目录以及访问所有临时文件目录，未能将管道连接到虚拟机：所有的管道范例都在使用中解决方法
可能是杀掉进程导致解决办法: 1.首先杀掉所有VM打头的任务. 2.删掉所有lck文件 3.VM文件夹内有一串很长的数字命名的文件夹或文件,删掉 4.发现被VMware-vmx.exe占用 5.打开 ...
Vue element 自定义表单验证(验证手机号)
<el-form :model="ruleForm" status-icon :rules="rules" ref="ruleForm" ...
启动springboot项目报错Unable to start embedded Tomcat
1.问题描述最近在学习springcloud的时候,在父工程下新建一个model后,引入dashboard相关依赖后启动报错 2.产生原因产生原因有可能就是pom.xml中下载的jar包版本冲突 ...