大家好,今天我们来说一下秋叶大佬的训练劳尔模型的整合包工具 sd 春呐,他的这个整合包呢,跟我们之前讲的这个扣呀 ss gui 的这个训练训练参数呢?训练源码和模型 是一模一样的,只不过这是秋叶大佬进行了一下整合和优化,还有中文化,也就算是中文化的版本。那么我昨天试着用这个秋叶的这个版本呢,训练了一个模型,我是找了圣斗士的图片素材来训练一个模型, 训练好的模型呢,只有三十六兆,但是也可以用了。训练完成的模型是这个后面不带编号的这个模型,将这个模型呢复制到 stable diffusion 里面来,我们去使用这个 lower 模型,因为这个我们训练这个模型是 是二次元,是动漫的吗?所以说在 sleeper defusion 里面 check point 这个模型,你要选择一个二次元动漫的一个模型去给他生成。一开始呢,导入这个模型会发现我们生成的图片这种已经花掉了,模糊不清楚了,这是由于我们训练 过泥河的原因。过泥河的话,我们就把这个 lora 的这个权重呢,从一给它降到降低一点零点六到零点八,可以偏向于我们这个 lora, 但不至于过泥河。你设置为零点四到零点五的话,它是偏向于拆个 pose 模型,而仅仅加了一点这个 lora 的元素。 后面呢,我把这个权重给他降低,降到零点六以下,零点零点四到零点六,我们看一下结果, 那么这个输出结果呢,就能保持保持好我们这个画面的完整性,还能够加上圣斗士的这种铠甲元素, 就生成的模型质量上来说,秋叶大佬的这一款工具呢,和我们之前用 koya s s g u i 的这个工具去训练出来 模型,结果呢,其实是一模一样的,没有没有说谁好谁坏,只不过秋叶这个是更利于偏向于新手,而且不需要原码安装,直接解压缩就能用。那么他的这个安装包呢, 我已经上传到我的网盘里面了啊,也分享给大家,可以去下载了,大家可以去直接去找雀跃大佬的 这个下载地址,也是可以的。那么之前呢,我出过八戒以下现存宝马训练的安装与操作步骤这个详解,那么讲的就是我们这个 扣一 s s g u i 的这个训练教程。那么之后呢,又出了一个 local licurice loha 训练模型的这个方法都是八界显存以下的训练,所以说我们这个秋叶大佬的这个整合包呢,其实也是低显存可以训练的,也是八界以下的。他这个操作非常简单, 我来给大家就是讲一下他这个操作,我们下载好他这个压缩包之后解压缩,你用国内加速更新或者是强制更新都可以,这个看你有没有魔法了,如果你有魔法的话,你也可以用国内加速啊, 但是同时呢,你又能用这个强制更新点一下,这强制更新呢就开始更新一些库,更新完成之后, 我们点击这个启动脚本就可以直接一键启动了。一开始我们启动界面是来到这个界面训练通用模型,这一边你要设置一下通用模型呢,就是用来训练罗拉模型的基础模型, 它存放在 s d 杠 models 这个文言夹里面,你可以去你之前的 stable diffusion 的这些模型里面呢,去找到你的这个 v 一点五或者是 v 二点一的这些基础模型。 行,去给他复制到我们的这个文件夹里面,然后呢将这个模型基础模型的模型名字呢给他粘贴到这里面就可以了。那么下面这个数据及设置呢?也就是放在这个 trin 这个文件夹里面,我们来看一下,在这个 trin 文件夹里面, 这个你可以新建一个文件夹,我的比如说这是我自己创建的一个文件夹,然后里面放图片的数据集,名字呢也有讲究。嗯,在里面再创建一个文件夹,然后前面要打上一个数字,后面横杠,然后后面跟名字, 前面这个一百呢,什么意思呢?比如说我们这里面有十六张图片,那么前面这个一百就是将我们这个十六张图片呢,训练一百次就是一百,乘以十六就是一千六,那么一千六呢?再乘以我们这个训练相关参数,最大训练轮数十, 那么一千六再乘以十,也就是总共要训练一万六千步,训练一万六千步呢,大概需要四个小时,我是十二 g 的现存训练了四四个小时。那么来说一下这个正则化数据路径,这个是用来存放你的正则化。什么是正则化? 就是在之前的啊,训练 lora 的,训练 lora 分类图片的时候给大家讲过,这里面是放分类图片级的啊,如果大家不知道分类图片级是怎么来训练设置的,可以去看我前面的视频 lora 分类训练,那么下面呢是一个分辨率五幺二乘五幺二的,如果你现存 很低的话,设置成五幺二乘五幺二的,中等的话设置为七六八乘七六八的,高档的话你可以设置为幺幺零二四乘幺零二四。好,下面这个保存设置呢,这个我们要起我们的 logo 模型最终生成的文件, 这是输出目录,输出目录保持默认,你不要变啊,因为这个也不影响你。然后下面是这个每几轮保存一次,他是每二轮保持保存一次,那么输出的这些模型的结果呢?就是二四六八啊,每过二保存一次,但是呢总共他要保 我总共他保存五个模型,这个保存五个模型呢,也是你自己可以设置,你想保存十个就保存十个,想保存一百个就保存一百个。 好,下面这个相关参确认相关参数,这个十呢,一般我们也是保持默认不动,如果你这个设置设置为二十呢,一千六乘以二十,你就三万二了,三万两千步了,你就再加四个小时 pc 大小啊。如果你显卡非常好的话,也可以设置为二,显卡一般设置为一。学习率,这个默认保持不要动,因为他这个学习率呢啊,跟我们之前 在 step 第六任这个学习率显示的方式不一样哈,因为我们之前显示的方式都是零点几,都是数字,他这个啊不知道代表什么,大家可以去学习一下秋叶的这个参数的这个概念,这个保持默认不变啊,这些都是保持默认不变的,大家可以看他下面的这些中文解释吗? 这些中文解释一般都能看得懂啊,忘了给大家说那个数据级是怎么来训,数据级是怎么来产生的? 数据级是在这个 wd 一点四这个标签器里面,这个标签器里面我们把这个数据级目录呢,也就是我们这个 trend 这个文件夹里面这个目录 路径给他复制一下,给他复制到这里面。下面呢参数我们保持不变啊,我们直接点启动就能够生成这些数据及文档了啊,我们还回到新手,这里面这些可调的参数也是比较少 啊,我们就可以保存一下我们的这些参数,也可以读取我们刚才保存的参数,也可以删除进行管理。下面呢我们直接点击直接开始训练,就可以直接开始训练我们的模型了,如果你对参数比较了解的话,你可以选择专家模式、 自然模式,这里面可调的参数更多,更为细节一些。那么既然我们是用 ai 啊,当然是让他更简单更好,我们更希望呢是 用一键导入别人设置好的参数去进行训练,因为我们自己去设置参数参数的话,我们对概每个参数的概念并不清楚啊,也不知道生成的结果会怎样,那这里面呢还有一些参数讲解,大家如果想学的话,可以去学习一下这些参数讲解 好了,那么今天呢,关于这个秋叶版的这个低配版 lower 训练的整错包呢,就给大家分享到这里,如果大家觉得有用,那么请为我点击关注加三连,我们下期 ai 课程再见!
粉丝1.8万获赞11.0万

coffee u i v 十中文整合包迎来史诗级大更新,这一次的更新简直是零基础小白的究极福音,为什么?因为作者直接在软件里给你硬塞了整整三百多个开箱即用的神级模板!这是什么概念?不管你是想搞全网爆火的创意短视频、 震撼眼球的电影级 c g 大 片,还是做专业的电商换装,它全包了。以前你要懂代码,懂逻辑,痛苦地去连那几百个像蜘蛛网一样的复杂节点,一不小心就满屏报错。但现在,这些全部被大佬完美封装到了巅峰状态。 你的操作步骤被极度简化到了什么程度?就只有三步,下载、解压、双击启动。进去之后,你什么底层逻辑都不用懂,敲个喜欢的模板,敲几个字就能当一个动动手指的无情抽卡机器,几秒钟跑出惊艳全网的大作。 hello, 大家好,本期视频我们将结合前面所学的内容,用 mimicmotion 来做一个 ai 视频风格转换。最后我们再结合 ipadder 看看效果如何吧。那么首先我们先打开康复 ui, 接下来我们先拖动节点,腾出位置搜索 load image, 这边我们加载我们需要的参考图像,然后再搜索 image resize, 最后调整相关参数。 接着我们把 layton 拖出来,接上 ve 编码,随后将 ve 编码的输入和 image resize 的 图像输出连接。随后我们用 anything everywhere 来加载我们的 vb 模型,将我们的 ve 发散到全局。 然后就是选择我们的大模型,我们开始编辑我们的提示词,这里我们的提示词要尽量和参考图像保持一致, 然后将采样步数修改成二十五, c f g 值设置成七。采样器我们选择 d p, n 加加二 m。 调度方式我们选择 kars。 接着我们再将底诺降噪的数值改成零点五。这里我们先稍微整理一下工作流,方便后续的工作流加入。进来的时候不会过于杂乱。 好的图像已经成功生成了。接着我们在塞巴儿侧边栏里面搜索 mimic motion, 随后将所有相关的节点拖出来。 当然我们也可以用常规的方法搜索并加载这些 mimic motion 的 节点,只不过那样子比较繁琐费时。好的,那么接下来我们将这些 mimic motion 的 组建连接。 随后我们搜索 load video。 这边我们用到的节点是 video helper, 如果还没有的小伙伴可以去自定义节点安装里下载。接着我们将 image resize 复制一份过来。这么做的目的是为了让我们的参考视频与参考图像规范化,不然有时候会有 resolution 相关报错。 接着我们加载 video combine 用于预览视频,这里我们将帧数改成三十。视频格式我们设置成 h 二六四。 随后将文件名称改为 mimic pose。 然后我们再复制一份 video clip 版用于预览最终效果视频,这里我们将文件名改成 mimic motion。 左斜杠 mean, 好 的结果已经出来了。对比原视频,我们可以看到人物的外观以及动作是非常贴合的,并且我们在原视频的基础上进行了动画化的处理。 那么接下来我更换一下参考视频与参考图像。当然提示词部分我们也需要进行修改。这边我替换完参考人物图像以及参考视频之后,我们先来对其进行一个分组整理,同样的这边也进行分组整理 好,那么这边的话我们先起用组控制器,然后把 mimic motion 给忽略。这个组控制器呢是来自于 easy use 节点的。之后我们再搜索 ipadada advance。 好 的,那么接下来的话,我们加载 ipadada 的 模型, 然后 ipad adapter 的 模型输入,我们连接到 checkpoint 加载器,接着我们再搜索 load image, 然后再搜索 preimage for completion, 接着我们再搜索 upper for more noise。 然后将类型选择的是内容重组,模糊值设置成十,然后再加载 generation 模型。 这里的话记得我们选择的是这个 b 七九 k 后缀的,然后再把这个权重设置成一点二。好的,接下来的话,我们在 ipad 加载器这里设置成标准, 将 ipad 等模型输出连接到 k 材料器内。随后我们设置一个真实性的大模型,这里我选择的是麦吉的 realistic 真实系列。我们这边来编辑一下文本。好的,接下来我们开始生成。效果还行,但是我们可以生成多几次,筛选出最佳的效果。 我们可以看到这个人物感觉比例有点奇怪,是吧?那么这边的话我们可以用到 openpos 来绑定他的人物骨骼。首先呢,这边我们先给 ipad dev 先新建个群组吧,以防他会混淆。 然后我们改变一下他组别的颜色,这个图像生成模块的话,我们随便换个颜色吧。然后的话我们来加载我们的 ctrl 内的模块,那么接下来的话,我们将 ipad 的 ctrl 内模块给腾出位置。 好的,那么这边的话我们先搜索 control net, 选择 apply control net once, 然后我们再搜索 dw post 18 meter, 随后来一个加载 control net 模型节点。这边的话我们选择的是 open post。 好 的,我们将 deliverer 自带域处理器的图像输入和我们的参考图像连接。随后我们按住 alt 键复制一份 control net 应用 加载器也一样复制一份下来。这边的话,我们加载器的模型选择的是 soft h 搜索节点 soft h 选择这个 h a d soft h lines。 这边同样的把 h a d 的 这个图像输入和我们的参考图像连接。 好的,那么接下来的话,我们将 ctrl 内的应用给串联在一起,正面条件连正面条件,负面条件连负面条件。 同样的,我们把第一个 ctrl n 的 正面条件给连到正面提示词文本框内,负面条件的话就是负面提示词文本框。随后我们将第二个 ctrl n 的 正面条件输出连接到 k 传感器上。 然后我们再把第二个,也就是这个 soft edge 模块的 ctrl n 的 强度改成零点五,随后开始生成。我们可以看到现在这个人物的姿态是变得正常了很多,以及他整个身体的比例。这边同样的,我们为了得到更好的效果,可以多生成几张。 好的,我觉得这张还不错。那么接下来的话,我们就开启 mimicmotion 模块,随后再次开始生成。 生成完毕后,我们可以看到效果还是非常不错的,怎么说也是还原了参考人物的部分特征吧。那么这里我把 mimicmotion 转会和参考视频做一个对比,大家认为哪一个效果更好呢?好,那么一张就是关于控制 ui 基础课程的全部内容。

兄弟们,这次真的是核弹级更新,他就是 stable fusion 满血包,这波更新简直是对 ai 小 白的神之一手, 不用担心本地电脑带不动或者折腾半天一直报错了,这个包已经帮大家最难的安装和环境配置搞定了,真正的解压即用原声,支持全中文界面,支持中文提示词,新手直接闭眼入,最狠的是只需要把大白话敲进去,点击生成,一键搞定。 满血包是什么味道呢?搞创作的,尝尝咸淡。我将会从纹身图图生图开始,教 你生成静态图片,将静态图片转换成会动的视频,真的的从零开始,手把手为范教学。那么我们看这个纹身图工作流可以看到它主要包含了几部分,我们来数一下,第一部分就是我们的 click 加载器,第二部分就是我们的 click 文本编码器,第三部分就是我们的 k 采集器, 第四部分呢,就是空闲的第五份 v a e 解码,对吧?第六部分就是我们的,也就是我们最后输出图像的地方。那么我们一个一个部分的来看,我们先看我们的 control 加载器,我们 control 加载器的作用就在于它可以加载我们的大模型。 大模型?那么大模型是一个什么样的东西?我们任何的 ai 绘画都是需要大模型去驱动的。我们举个例子,如果说我们把这一整套工作流比作一个人的话,那么我们的大模型就相当于我们人的脑子,对吗?我们需要这个脑子才可以去控制我们人的行为,也就是控制这个工作流去进行运作。 那么既然说到人脑,其实我们知道在现实生活中,每个人的人脑他都是不一样的,也就是说我们的大模型其实也是不一样的,有一些大模型呢,可以绘画动漫风格,有一些大模型可以绘画真人风格,有一些大模型呢又可以绘画室内的装修风格, 这个就是我们大模型的作用,它总管着我们的一个风格的一个绘画方向。比如说我在这里选择一款动漫大模型, 说真人大模型,我们选择这个呃,麦菊 v 七模型,大家可以看到哎,我们把它选择一下,这个丘根夹气,大家还可以看到它有三个点,对吧?它有三个点,一个是模型点,一个是颗粒点,一个是 ve 点,那么我们从下往上看,这个 ve 点的作用是什么呢? 那么说到这个 ve, 我 们就不得不提到我们大模型的一个训练了,在训练大模型的时候,是不是要先准备一个炉子,然后往这个炉子里面去丢入一些图片,比如说动物的图片,人物的图片,或者说花花草草的图片,我们把它丢进去,但是你丢入这些图片呢 时候呢?我们需要知道的是,我们必须给这个图片进行打标,打标是什么意思?就是我们得把这个图片里面有的内容通过文字的形式 把它呈现出来,比如说一只小狗,那么这只小狗的外貌怎么样呢?或者说它的场景里面有一些什么内容,都得用一个文本的形式把它呈现出来,然后把这张图像和文本一起打包投进这个炉子里面。当我们投入的照片和打标的这个文本够多的时候, 那么这个大模型它就会自己去学习这里面的一些内容,学习完之后它就变成了我们这一个具有偏向性的大模型了,我们也可以把这个大模型完全只投入动漫的,呃,这个图片,那么它就会变成动漫大模型,或者说我们只投入真实场景的图片,那么它就变成真实的大模型,那么这个就是我们大模型的一个训练的一个过程。 那么我们刚刚说我们投入去的图片它是什么图片?是不是只有我们人类能看得懂的图片?那么计算机能不能看得懂? 当然是看不懂的啊,我们这个 ai 绘画的过程,其实它就是在计算机里面去进行操作的,对不对?所以说我们任何的数据最后都会变成计算机的信息,所以我们需要把人类能够看得懂的语言变成计算机能够看得懂的语言,所以我们就需要这个 ve 去对我们这个模型里面的图片进行作用, 我们把这里面所有的图片编码成为计算机的语言之后,我们就再把这些语言进行分配传输,然后最后由这些语言进行重组,变成一张人类又看得懂的图片,对吧?所以我们的 v e 把里面的图片进行一个解析,解析完之后它变成了许多许多的信息,然后通过我们这个模型点给它传到 k 测量器,看到没?我们可以把它先断开,然后给它连拆, 对吧?给它传到 k 测量器,然后可以看到它有颗粒点,这颗粒点其实是我们可以说它是条件点,你也可以把它叫做条件点, 把条件分成很多种嘛,我们后面说到了 ctrl 键,它也是条件点的一部分,但是我们这里姑且先把它当做是一个文本点,它这个文本点它可以提取我们所有照片当中收到打标里面的图片的一个文字信息,提取到之后把它继续往下传,从而到我们的可以文本编码器。那么我们的可编辑代码器的作用是什么呢? 当我们去用吉梦或者可林的时候,你会发现我们在输入一串文字之后啊,它会生成一个图片,对吧?那么这个可立本本本编码器,也就是我们输入文字的地方,比如说我在这里输入 a cap, 我 在这里输入一只猫啊,输一只猫之后,然后点击执行,我们看一下, 我们可以看到它是不是生成了一只猫出来。那么这个可立本本本编码器,它为什么叫做编码器呢?也是一样的,我们输入了 a cap, 是 人类的语言,对吧?我们需要把它进行编码,编码成为计算机的语言,那么计算机才能够读得懂。那么有同学会问了,为什么我这里的 play 文本编码器它有两个,那是因为我们 comfort ui 或者说 disable 一个特殊性,它会给我们用户配置一个负面条件,也就是说上面这个我们可以把它叫做正面条件, 也就是说通过这个文本我们可以输入我们想要的东西,那么负面条件我们自然也就输入我们不想要的东西。然后这个科页文本编码器呢,就是来输入我们的正负面条件了。我们再来看一下我们的 k 采集器,我们会发现 k 采集器它是最后的一个信息处理中心,有没有发现 什么叫信息处理中心?我们会发现我们的通过这个正面条件和负面条件输入了这个我们想要的东西之后,哎,把它编码成为计算机的语言,他会传到 k 采集器里面,对吧?我们大模型里面被编码完的图像信息也会传到我们的 k 采集器里面,然后我们 k 采集器里面现在有几份信息, 是不是有两份?第一份信息是我们大模型里面所有的图像信息,第二部分的信息是我们的这个正负面条件的文本信息在里面, 通过我们的文本信息跟图像信息进行比对之后,那么我们的 ai 就 知道我们要生成什么样的东西,比如说这里面我们刚刚说到图片可能会训练一些人,一些猫,一些狗进去,对吧?那么我们如何精准的让它生成猫,那么就通过信息比对了,通过跟我们文本的信息比对,把它比对完之后,它自然就会出现猫的图片。 ok, 我 们继续往下看,这个空篮子的作用是什么? 空篮子的作用其实它就相当于一个白色的纸,那么这张白色的纸就叫做昆仑藤, 这张空调呢?宽高我们是可以去设置的,我们可以看一下,它可以设置成为五幺二乘五幺二,对吧?五幺二乘五幺二,你也可以设置成七六八乘七六八,那么它的画布就会更大一点,当然你也可以设置成五幺二乘七六八,也就是说它会变成一个竖平的一个画布,那么它画出来的东西它自然也就是竖平的,我们可以看一下, 哎,是不是竖平了,对吧?你也可以把它变成横平的,也是可以的。然后这里还有一个 p 次大小,我们可以把它画成二,那么它一次性就可以画两张图片出来。好,我们可以看到是不是一次性画两张图片出来,所以这个 p 次大小主要是拿来管理我们的。呃,图片的推也增张数的,就是如果你是二,它就出现两张,如果是 c, 那 就是三张,这样子,以此类推过去。 好,我们再来看一下 k 传感器里面的一些参数。第一个是这个随机种,这个随机种是什么东西呢?其实他就是我们这一个图像的身份证,我们的这一个图像。哎,每一张图像生成出来,他都会有一个不同的随机种的数字代码,我们可以看一下, 比如说我又生成了一张,可以看到随机种是改变了,对吧?所以说一个随机种一般来说是对应一张图片的,那么我们后面看一下运行后操作这一个栏目,它是拿来干嘛的?我们可以点开,它里面有固定,增加、减少随机,对吧?如果我们填写的是固定呢?我们再跑一张,可以发现我们这个随机种它是不进行改变的。有没有发现 好?我们再点多几次,你会发现它没反应了,我们点击直行的时候,它已经没反应了,对吧?为什么没反应?就是因为我们把它的随机种固定了,那么这个随机种它就是 对着我们这一张图像的,对吧?所以他不会进行改变,他也不会进行再一次的跑图,因为这张图片他已经怎么样生成完成了,对吧?我们也可以选择增加和减少,那如果你选择了增加的话,你会发现后面这个数值他会加一,变成了九,看到没有?好,我们再点一下,现在变成了七十,对吧? 好,第七十张会发现他出现了人,我们可以继续往后跑,可以看一下他又加了一,他又变成了不一样的,还是那那句话,他就是一个随机种,对应了怎么样一张图片。当然了, 这个随机种的增加减少,你可以自己去调,我们一般把它调为随机啊和固定,我们用的是最多的,然后是步数,步数就是说我们画这张图像的用了几步,比如说我们人类去画一张图像,可能我们需要画五十下才能把这张图片画出来,对吧? 按道理来说,我们这个步数越高,那么我们画的图像所具有的细节也就越多。当然了,这也并不是完全的,如果说我给他一百步,但是我画完这个图像,其实我只需要二十步,那么你是不是又形成另外一个词语,画蛇添足?对, 所以说并不是说你步数越高越好,那么这个步数的高低主要看我们的大模型的选择,比如说我选择一点五的大模型,那么我自然这里的步数我选择二十步,他就是可以的。如果说我选择 plus 模型,对吧? plus 模型训练参数很多嘛,那么我步数选择十步,那么我也可以画出一个很好的照片, 对吧?那么就步数就看大家自己去调了,我们一般来说最好就是不超过五十步,为什么?因为如果说你超过了五十步,其实呢,它没有什么太大的效果,甚至说会让你的图片进行一个崩坏,对吧?而且会更加耗费你电脑的一个配置的显存,所以说我们一般定为二十步就好了。然后这个 c f g 的 话, c f g 是 什么意思?它的全称叫做,呃,条件引导,也就是说这个 c f g 越高,它跟我们这个哎提示词越贴近,如果我把 c f g 改为零,大家可以看一下,我们去跑一下,哎,可以发现它出现了一个什么女生,对吧?跟猫有没有任何关系?没有任何的关系,如果我们调成了一, 可以再跑一下,二是不出现一只猫啊,但这只猫它怎么样?太过于抽象了,对吧?就是说, 呃,一这个参数对于我们一点五的模型来说,它太低了,它贴合不了我们这个正面提示词想要的一个内容,所以,呃,一般来说我们这个一点五的这个模型啊,一点五大模型,我们一般这里我们选择是呃七左右,七到八左右,它就会出现一个比较好的, 比较好的图像可以看到。然后另外一点呢,我们需要知道的是, c f g 其实对我们画面的饱和度有一定的控制,如果说你的 c f g 太高的话,对于这个模型来说,那么它可能会出现过拟合化的一个效果,比如说我这里调成二十,我们看下会有什么效果 好,可以看到它锐化是不是特别的严重,以及饱和度非常的高,对吧?如果说你用的不是一点五的吗?大模型用的是叉 l 的 大模型或者 plus 模型的话,你会发现一个很严重的问题,就是它的锐化太高了, 或者说饱和度太过于严重了,那么出现的画面也就会变得很抽象,对吧?所以我们的这一个一点五的大模型,我们一般调为是八, 如果是叉幺的大模型的话,我们一般是五到六之间,而 plus 一 般我们把它调为一,也就会发现有一个规律,大家有没有发现,你越强的大模型, c f g 相对来说就越低,对吧?然后彩样器和调度器,我们可以看一下, 彩样器和调度器不同的选择呢,对,我们图像的生成也是不一样的,不一样的彩样器啊,它出图的质量也就不一样,那么我这里呢,主要就是,呃,用的最多的就是 d p r m, d p r m 是 一个效果比较好的一个彩样器,或者说 d p m 也不错,这两个都不错,这个我推荐你们直接使用,这我就不过多的讲解,因为这个东西比较麻烦。 然后调度器呢,我们一般选择 k 这个开头的啊,这也是一个比较好的调度器,大家测试出来的一个比较好的,我们可以看一下, 可以看到效果是不是更好,比起刚刚的这个 u r 的 时候,呃, u r 这一个彩样器呢,它其实更适合于生成动漫的那个风格,但是我们选择的是真实大模型嘛,对吧?真实大模型,所以我们这里用 d d p m 和 k 这个传感器出来的出路效果就非常的不错,我们可以看一下, 哎,对吧?是不是更加的真实,感觉好。最后就是一个 v e 解码,那么我们在这里 k 彩样器刚刚说我们会进行一个信息比对,对不对?那么信息比对完了之后, 我们是不是需要把计算机的信息给它释放出来,变成我们人类能够看得懂的语言才可以,对吧?那么这个 ve 解码就是能够把我们计算机的信息给释放出来了, 然后把它转换成我们人类可以看得懂的语言。所以说我们最前面这个 ve 我 们可以把它叫做什么 ve 编码啊? ve 编码,通过这个 ve 可以 编码我们远大模型里面有的图像,就人类看得懂图像信息,把它变成计算机的语言,然后变成计算机的语言之后呢?通过在 k 才能器里面进行一个信息比对完之后,然 然后让计算机知道我们想要什么样的内容,最后把图片生成出来,就在这里通过造点的一个回收啊造点一个反扩散把我们这个图像生成出来,生成出来之后通过 v e 解码,怎么样?把它解码成为我们人类看得懂的图像信息,就完成了我们一整个纹身图的一个工作流。 纹身图工作流其实也是非常简单,它跟我们纹身图工作流不一样的地方是它少了一个空纹理,对吧?它多了一个 ve 编码以及我们的加载图像,当然了这里还有一个图像按像素缩放,这一个我们待会再讲。我们大模型在训练的时候是不是注入了非常多人类看得懂的图片,那是人类的语言,那计算机能不能看得懂? 当然是看不懂的,那既然计算机看不懂我们的图片,那么我们的图片就需要经过我们这一个透片加载器里面的 ve 去进行怎么样进行编码,对吧?最后传输给我们的 k 采集器进行使用,这样子我们的计算机,也就是我们这个 ai 的 流程才能够跑得动,才能够跑出我们想要的图片。 那么既然是图生图的工作流,也就是说我们是需要用图片去生成图片的,而不是像我们纹身图工作流一样,直接是无中生有。那么既然我们是需要用图片生成图片,那我们是不是需要上传一张图片,所以我们需要一个新的节点加载图像节点。但是我们上传这张图片之后呢,你会发现这个图片它是什么?什么图片 是我们人类看得懂的语言这个图片,那么我们也同样需要对这张图片进行一个编码,把人类看得懂的语言变成计算机所看得懂的语言,所以我们就会用到这个 v a e 编码这个节点。那么有同学就会问了,我们为什么不能直接用直撇加载器里面的这个 v a e? 这就要讲到我们去训练这个模型的时候,这张图片它不一定存在于我们这个大模型里面,就是训练的时候,那么我们在不一定的情况下,我们就需要保证它在接下来的工作的过程中呢,是能被编码到的,所以我们需要加载一个 v b 编码进来, 我们直接把图片,我们可以先把这个图像按像素缩放给它删掉,我们可以直接把图片给到我们的 v a e 编码这么一个节点,然后给到它之后呢,你会发现它编码的信息是通过 link 点传给我们的 k 转来词,那么我们上节课纹身图的时候,我们的 com link 是 不是传到了这个 link 点,我们现在变成了 v a e 编码的这个 link 传到了 k 长器这里面。那么我们上节课有说到我们的空栏杆相当于一张白色画布,对不对?那么我们进行作画的时候,我们是不是需要一张白色画布进行使用?那么我们图深图也是一样的,我们也需要一张画布,但是这张画布不再是空白画布,而是我们这张上传的图像,它把我们上传的图像换成了一张画布去使用, 所以这个栏点点上传到 k 长器,那么我们就可以知道我们上传的这张图像的大小跟我们的画布大小应该是一致的,对不对? 那么还有一点我们需要注意的是,既然是用图像生成图像,那么我们这一个上传的图像它是不是具有一定的参考性?那么待会我们进行图生图的时候, 我们要达到的目的应该是我们生成的图像跟我们的原图具有一定的相似度,但是又跟原图有不一样的地方,所以我们这个 k 函数里面的参数就有一定的讲究了。比如说这个降到我们能不能调到一不行?为什么不行?因为我们上节课纹身图的时候,我们用的是空的完全的白色画布, 我们的降噪需要为一,对吧?如果降噪不为一的话,他会有降噪不完全的一个效果,这是对于空画布来说的,但是现在是我们的图深图,对吧? 现在是我们的图深图,那么画布里面已经有了内容了,我们需不需要再把降噪调为一?是不需要的,如果我们把降噪调为一的话,那么他就会把我们上传的这张图像当做一张白色画布来使用,只不过这张白色画布的尺寸是跟我们上传的图像是一样的。那 如果我们把降噪调到零点五,也就是说我们待会让他画画的时候,不要完全去改变我们画面的一个内容,也就是说你要有百分之五十的参考到我这个画面,所以这个降噪 我们就不能调到一,然后这里的降噪也会变成我们所说的重绘弧度,也就是说你这里的降噪的指数越低,那么跟我们原图的样子越像最后的出图效果。如果说这个降噪越高,那么他跟我们的原图的样子越不像最后的出图效果。那 知道了里面的一些逻辑之后,我们就可以尝试的去跑一下这个工作流。比如说我这里的模型换成动漫的一个模型,但是呢我这个上传的人物是一个真人,那么它会发生什么效果呢?我提示词只输入一个女孩子的提示词,然后去跑一下这工作流。 five minutes later, 好, 我们发现刚刚我们去进行跑图的时候,它的速度非常的慢,这是为什么?是因为我们上传的图像它的大小具有两千乘以两千的一个宽高比, 那么两千乘以两千的也就是差不多达到我们的二 k 图片了,它的大小是非常的大的,对于我们 ai 这个工作来说呢,它的负荷也需要非常的大,那么我的本电脑用的是三零六零的显卡,所以说对我的本电脑显卡的负担是比较大的,所以它跑的是比较慢的。那么我有什么方法可以解决这个问题呢?就是我们刚刚说的像素按系数缩放那个节点, 图像按像素缩放这么一个节点,我们可以先把图像给它连过来,连到这个节点上,然后我们再把这一个输出的图像连到我们的 v e 编码,然后这里有个像素数量,我们可以把它调成零点二五,也就是说我们的两千乘以两千,经过这个节点的时候,要再乘以零点二五,那就会变成多少,大家可以自己去思考一下。 然后我们把它降到零点二五的大小。之后呢我们再来跑一下,看一下它的速度。好,现在速度是不是非常的快了? 好,我们可以看到最后跑出来的图像呢,跟我们的原图是非常相似的,只不过他的画风改变了,对吧?为什么他的画风改变了?因为画风现在是由我们的大模型去掌控的,但是我们上宽一张图像去对他进行图生图,最后的结果就是他会在参考我们原图的基础上,又去配合这个大模型的画风进行一个生图,就得到了我们一个风格转化的效果。 我们可以继续尝试调节一下我们的降噪,比如说我们把降噪调到零点八,看一下效果,有没有发现这一个图片跟我们原图就变得不那么相像了,但是构图什么的都还是比较一致的,是因为我们的降噪调高了,那么它需要重绘的部分也就越多,那么我们再把它调到零点三 好,调到零点三的时候是不是更加的贴近我们的原图,现在我们可以把它调到零点一 好,有没有发现基本上就跟我们这个原图比较相似啊?只不过还带着大模型的一些风格在里面,也就是偏向于动漫的那一种质感,对吧? 那么我们的图生图就是这么的简单。当然了,讲完了图生图,我们需要讲一个局部重绘,那么局部重绘的工作流我们该怎么去搭建呢?其实局部重绘也是要让我们上传一张图像,然后在这张图像的基础上进行部分的修改,因为我们的图生图跟局部重绘来对比的话,图生图是不是对整张图片的风格进行修改, 但是我们局部重绘就可以对某一部分进行修改,所以我们需要用到一个新的节点,叫做设置 london 照波遮罩。我们需要对我们这一张图片的局部进行修改,那么我们就需要让 ai 知道我们这个局部到底是在什么地方,比如说他的眼睛,或者说他的头发部分,对吧?所以我们需要设置 london 照波遮罩这么一个节点,去 输入遮罩部分,这个遮罩部分也就是我们加载图像这里有的遮罩部分,我们可以可以给它连进来,连进来之后呢,这里的 v a e 编码我们不能直接上传给 k 堂器,我们应该先把这个编码完的 lincoln 给到我们这个设置 lincoln 照波遮罩这里。为什么? 因为我们这个 v e 编码对我们这整张图像进行编码完之后,它有我们整张图像的信息,我们把整张图像信息给到我们的设置 lincoln 照波遮罩之后,然后跟我们的遮罩信息进行匹配,两两重合之下,他就知道需要重绘的部分应该是哪里,然后最后我们再把 lincoln 上传, 就达到我们局部重绘的一个效果。然后呢我们需要对这个遮罩进行一定的处理,我们怎么样处理出来这个遮罩呢?我们左键点击选中这个加载图像这么一个节点,然后右键右键之后在遮罩编辑器中打开,可以看到吧,选择选择一下,我们把他的头发简单的进行一下涂抹。啊, 好,涂抹完之后呢,我们简单在提示词这里写一下,比如说我想让他头发变成红色的,我就打红色头发这么一个提示词给他,然后点击生成就可以。 我们可以看到效果是不是非常的不明显,为什么?因为我们刚刚的降噪这里还是零点一,那么他会急剧的去参考我这个原图,基本上不发生变化,如果我把它调零点五,我们看下效果好,红色的部分是不是已经出来了?只不过我们这个模型用的什么模型?用的是我们一点五的模型的动漫模型,对吧?所以他有一点点这种动漫质感很正常,如果你想让他变得更红一点,我们就可以再往上调调零点八, 好,可以看到现在效果已经变得非常的不错了,对吧?只不过我们看一下这个边边的地方,他可能融合的不是很好,为什么呢?是因为我们这个遮罩部分啊,涂的有点太过于潦草了,其实你可以涂的更加的精细一点,可能效果会更好一点,或者说你降一下这个降噪的数量,比如说把它降一点七,好,这样子就更贴近原图了,对吧?跟我们的原图融合的更好,那么这个就是我们的局部融会。

家人们,核弹级更新来了!秋叶大佬全新 comfy 懒人整合包来了,简直是小白神器!不用折腾 python 环境,不用愁节点报错,全部提前配置好,双击就能启动全套汉画界面,零基础也能闭眼玩,还内置三百三十七套爆款大神工作流拉图就能一键生成,无套路全打包 创作的验验牌开始教学。 hello, 小 伙伴们大家好!我们将深入探索纹身图的奥秘以及提示词的语法规则,让你在使用 ctrl u i 时能够更加得心应手地创作出 理想的图像。那么我们正式开始吧!工作流程解析,首先,当我们输入正向和负向提示词后轮本编码器中的 clip 模型会将提示词转化为特征向量传递给 k 参照器。 这时候有个疑问,文本编码器 clip 模型是从哪里来的呢?我们可以看到它来自于 checkpoint 加载器,主要用于加载各种大模型。不同的大模型有不同的内置 clip 模型,而不同的大模型之间 clip 模型也可能会 有所差异。接下来, checkpoint 加载器输出会经过 ve 模型, ve 解码的作用是将经过降噪后的图像从浅空间解码为我们肉眼可见的像素空间图像。 让我们做个实验,如果我们断开 v a e 模型的连接,试图生成图像会出现错误提示,显示缺少 v a e 输入,只有重新连接 v a e 模型,图像才能 成功生成。另外,记住生成图像的快捷键 ctrl 加 enter, 这个快捷键非常实用。此外,生成图像的宽度和高度尺寸可以通过空 latin 节点来调 调整控制。比如说我们将高度调成七百六十八,注意这个数值一定是八的倍数,宽度也一样。至于批次的话,则是控制单次生成的图片数量。比如说我们设置成二好,我们按 control 加 enter 开始生成。图片生成后,我们是不是可以看到它的比例 已经成功变成了竖屏的比例,并且它依次生成了两张图像?接下来让我们一同学习提示词的相关语法。首先是书写规范,无论是正向提 诗词还是副象提示词,都必须使用英文以及英文标点符号,否则系统可能会出现识别错误。比如我们输入 one girl, garden 和 yellow dress 黄色的裙子,使用快捷键 ctrl 加 enter 生成,就能得到一个穿着黄色裙子在花园中漫步的女孩图 片。但如果我们使用中文输入一个女孩花园以及黄色的裙子生成的图片,虽然都有女孩,但黄色裙子和花园却未能很好的呈现出来。那么接下来是 提示词权重。什么是提示词权重呢?简单来说,权重就是某个提示词在生成图像中的影响力,权重越高,该提示词在画面中的占比越大。例如输入 one girl 权重一点二,而 garden 权重零点八十,生成的图像会更加突出 one girl 的 部分。那我们有什么技巧调整权重呢?比如中 括号代表零点九倍权重,降低该提示词的重要性。小括号代表一点一倍权重,增加该提示词的比重。大括号代表一点零五倍权重。用于微调权重,还可以通过快捷键调整权重。将光标移到某个提示 词上,按住 ctrl 加上箭头增加权重, ctrl 加下箭头减少权重,不过权重不能过高,否则图片会过敏, 进行失真。接下来是短句与长句,提示词长度与起手势。我相信不少小伙伴都有这么一个疑问,为什么我写提示词的时候一定是一个一个词这样去拼写,而不是用一句话去描述我们想要生成的内容呢?虽然两者都可以,但短句更能准确表达生成意图, 且便于调整权重。使用短句时可以通过按顺序调整关键词的权重,从而优化生成效果。提示词的数量也非常重要,过长的提示词可能会影响图像生成的准确性, 那么我们最好把提示词控制在什么数量之内会效果最佳呢?经过众多 a i g c 玩家的经验以及研究表明,提示词控制在七十五个之内是效果最精准的。超过了七十五个提示词的话,可能会对提示词的识别 不精准,整体的表现会降低。在 stable diffusion 各个大模型训练的过程中,会加入许多的比如四 k、 八 k 或者 masterpiece 各种各样高质量的图形去训练。当我们输入提示词的时候,比如输入四 k masterpiece 就 可以使我们生成的图像更加的精美。反向提示词的话就相反,比如我们输入模糊,就 我们不想要模糊,那么相当于也是会让图片变得更加的清晰。在输入提示词时,顺序也会影响生成的效果。在一组提示词中,越靠前的提示词权重会有所增加。所以我们在书写提示词时尽量按照以下格式。首先是提升画质的词汇,例如 masterpiece, high quality, high detail。 接着是描述主体,例如 one girl。 然后描述环境或背景,例如 garden, snow。 最后可以加入 laura 的 触发词或其他模型的提示词。为了避免多个提示词相互干扰,可以使用 break 命令来隔开它们,尤其是避免颜色污染。若要融合多个提示词,可以使用大写的 end 或 符号,也可以使用书写风格不同的关键词,从而创造出新的组合效果。比如我们写 one girl, cat 这边我们可以看到生成了一张女孩和猫的图片。好的,现在我们在 one girl 和 cat 之间添加上 and 注意这里的 any 必须 是大写。这边我们可以看到生成了一张猫娘的图片。这个 any 作用就是将两个提示词融合在一起。我们还可以通过调整迭代步数,精确控制生成过程中的每个阶段。格式为 提示词一,提示词二权重数值。权重是指提示词一的权重。当权重数值大于一时,单位为采用迭代步数。当权重数值小于一时,单位为采用迭代步数。百分 比。例如,想要前百分之三十生成 forest, 倾向后百分之七十生成 one girl, 只需要输入 forest, one girl 零点三, 其中零点三代表百分之三十的比例。当采用迭代步数为三十时,表示前九步用于生成与 forest 相关的内容,后面二十一步用于生成与 one girl 相关的内容。在介绍图生图的工作流之前,我们先来讲讲什么是图生图。在我们使用图生图功能时,我们一般使用一张图片与一组 关键词共同作为输入生成的图像,这样受到这两个输入的共同调节作用,比如使用下面这张初级草图以及一段指令作为输入图,升图功能会将其转化成一张完成度较高的图 片。图。升图基于 stable diffusion 模型,将输入的原始图片转化为模型能够理解的潜在空间表示,再结合用户输入的提示词在潜在空间中进行有针对性的修改和优化。最后将修改后的潜在表示转换回图像空间,生成新的图片。 同时选择合适的模型很重要,不同模型对不同类型的图片生成效果各异。接下来我们回到 confui 中,我们先加载一个默认工作流,随后将 call latent 给删去。接着我们点击 latent 拖出来,选择 v a e 编码,那么我们就成功加载了 v a e 编码器。接着我们将 v a e 编码器的 v a e 输入连接到 checkpoint 加载器的 v a e 输出上。随后我们将图像节点给拖出来,选择加载图像 load image。 这边我们上传我们需要的参考图像,这边我上传的是一个戴着蓝色帽子的小姐姐。接下来我们要编辑一下提示词,这边我们可以接一个 w 一 四反推提示词节点,方便我们获取图片精确的描述提示词,然后将我们的正向颗粒文本编码器转换成输入。接着把 w 一 四反推提示词 的自辅串端接到输入端的文本处,副向提示词一般输入模糊、最差质量、低质量、低分辨率水印等。现在我们来到到采暖器这里,可以看到这边有个降噪,我们将该值修改成零点六,对于降噪值,零点三到零点五之间属于安全的重回幅度区 区间,而零点五到零点七则赋予了 ai 更多的想象与发挥的空间。那么低于零点三或者高于零点七,图像都有可能会发生扭曲变形。那么这边我们取个中间值,将数值设置成零点六,生成一张图片试一下。这边我们可以看到生成的真实人像跟目前给到的图像, 无论是帽子还是服饰都是很相似的。那么我们把数值调成零点四五,再生成一张,来看一下效果是不是又更好一些。如果你觉得图片不太满意,那么我们可以多生成几张,直到得到你满意的图片为止。接下来我们讲一下什么是高清修复,比如说我们现在生成的这张图片我们非常满意,那么我们怎么 增加它的分辨率以及图片的细节呢?我们回到 k 彩样器,我们先将种子值选择固定模式,双击界面的空白处输入 upscale, 然后我们选择 latent 按系数缩放,我们将该节点的 latent 输入 连接到 k 彩样器的 later 输出上。随后我们按住 alt 键,点击 k 彩样器拖出来,那么我们就复制了一份相同的 k 彩样器。我们将这个 latent 按系数缩放的 latent 输出节点 连接到我们新建的 k 彩样器的编辑输入中。最后我们将文本编码器的条件输出分别连到 k 彩样器的正面条件以及负面条件上。模型也是一样,我们回到 checkpoint 加载器,将模型连接到我们新建的 k 彩样器上。随后我们回到新建的 k 彩样器中,我们将步数设置成二十五步, f g 值五就可以,彩样器和调度器默认就可以。接下来我们新建一个 ve 解码器,随后我们将 ve 解码器的 ve 输入端连接到 checkpoint 加载器的 ve 输出上,接着我们新建一个预览图像节点,最后开始生成。好,现在我们可以看到生成的结果,五官是和原图非常相近的, 我们再来对比一下图片的细节,放大之后我们可以看到右边,也就是我们新生经过高清处理后的图片细节要比原图多很多,图片还是比较清晰的好。这时有的小伙伴可能会说,这还不够清晰,那怎么办?别着急,我们还有高清修复的方法,接下来我们将进行第二重高清修复,我们搜索 s d upscale, 就是 这 sd 放大,接下来我们将这些节点一个一个的连上。首先是图像,我们连接的是这个 v a e 解码之后的图像输出,接着模型我们还是老样子,连接的是 checkpoint 加载器的模型输出,接下来是正负相条件好,我们连接 v a e 模型,接下来点击这里 选择我们的放大模型。四 x ultra, 这个放大模型是我试用下来效果最好的。最后我们加载一个预览图像节点,我们点击开始生成,图片已经生成出来了,我们可以放在一起对比一下效果,这张图的分辨率已经达到了二 k 的 清晰度,我们可以看到细节都还是不错的。然后我们再来和第一次放大的图 片来进行对比一下,差异还是非常大的,这时有的小伙伴可能会说,觉得这张图清晰度还不够,那怎么办?别着急,我们还有最后一重放大之后, 也就构成了所谓的三重放大,这边我们搜索 upscale, 接着选择这个图像,通过模型放大,这个节点非常简单,只有两个输入以及一个输出。图像的话,我们连接到 s d 放大之后的图 放大模型,这边我们同样选择的是该模型,随后我们加载一个预览图像节点,好,我们可以看到最终生成图像已经出炉,我们来欣赏一下它的效果到底怎样?这是一张达到四 k 的 图像了,清晰度非常的夸张,发丝都看得见,完全没有那种模糊马赛克的感觉。我们再来对比第一张,小伙伴们觉得怎么样呢?图升图 以及三重放大的效果,这是我们的原图,然后这是我们图升图之后,这是第三重放大。

ai 界的史诗级软件登场了,有这样一款软件,你可以叫它 stable fusion, 也可以简称 sd。 不 用自己摸索,我已经花费两个半月精心制作了一套 sd 教程,完全免费教会你,不用你花一分钱。而且为了让大家更方便使用我们的 sd, 我还将其强大的六十六个必备模型全部都放在整合包里了。全程你只需做个轻松的旁观者,只需三个步骤,下载、解压、双击打开,像开启宝藏大门一样轻松。不用安装复杂的插件,也不必为配置环境而烦恼不已,就连使用教程我都为你配置妥当。 真正做到零门槛,哪怕你对 ai 一 无所知,在 s t 面前也能瞬间化身 ai 达人。如果你渴望,会制出惊世骇俗的艺术画作,打造火爆全网的创意绘画。 在 sd 的 世界里,通通只需一个简单的点击动作。而 sd 作为全球 ai 爱好者顶礼膜拜的存在,最全面的功能、最丰富的生态和最贴近生产力的设计,成为免费开源 ai 软件中的王者。相关的模型插件我都已经打包好了,直接暗号开启你的创作之旅吧!

你这个阶级的人会极力阻止你刷到这条视频,因为他们不想让你知道 ai 已经发展成这个样子了。生成图片免费,生成视频依旧免费,它就是地表最强 ai 生产工具秋叶 comui 中文版。 和那些花米还要排队的工具不同,它无需联网,没有审查限制,也没有按次按月计费的套路,最低支持一千零六十显卡。做设计,做电商,做漫剧都是一键直达。感兴趣的同学抱走不屑,话不多说,开始教学。 那么欢迎来到我的康菲 u i 零基础从入门到精通系列的第三节课,本节课呢,我们将围绕千问 ed 啊,就是千问编辑模型来展开一个图深图的工作流搭建啊。那么这节课的工作流它有什么作用呢?首先,它可以呃建立角色资产库, 进行双图或者三图的编辑,风格转会,动作姿态的编辑,还有服装的更换。呃,特别是这个角色资产库的建立啊,生成这个角色三式图是一种极具实战意义的使用方式啊, 三式图可以用于 ai 视频生成时保持角色的一致性。好,那我们先来讲一下本节课要用到的模型的安装方法。 同样的,我们本节课用到的模型啊,我都已经放在百度网盘里面了,可以根据我们这节课用到的来选择啊。 我们找到第三节课的千万 ed 图升图的这个文件夹,然后模型啊,工作流我也放在这里了,模型啊,把这里的整个文件夹都给下载下来。好吧,我们可以看到是四个文件夹, 安装方式和上一期也是一样的。我们将啊,我们打开会事启动器的启动页面,点击根目录, 然后我们在根目录下找到啊 models 文件夹,点开,然后选中啊这四个文件夹,就是下载下来的四个文件夹,直接拖动到 models 啊,跟目录底下的 models 文件夹的空白处公开手,然后进行文件覆盖就可以了,就可以完成模型安装了。 ok, 那 我们来到工作流的这个搭建页面,我们可以大致的看一下它的呃结构。 我这里呢主要就分成了三个区,模型加载区,提示值输入区,批量区,还有图片输入区,然后这边是这个跑出来图片的展示。啊,好,那我们现在就开始演示怎么去搭建这个工作流。 好,那我们先新建一个空白工作流。 ok, 好, 双击。我们一样是先从 k 采样器开始搭建啊,我们先需要有一个呃核心的生图工具,那就是这个 k 采样器 跟昨天的搭建思路是一样的。呃, k 传感器有了之后,我们需要有一个支持它升图的模型,我们给它拉出来,但是跟上期不一样的是,我们这期不选择 unit 加载器了,我们选择 我们选择 diffusion model loader 的 这个这个加载器。这个加载器呢,它跟 这个加载器,它跟昨天用到的 unit 加载器其实它的作用是一样的,只不过 diffusion model launcher 的 这个加载器,它的架构更新啊,要适配我们这节课要用到的这个新模型。接着往往下看啊, k 传感器下面是正负面条件, 我们需要拉出来给他一个文本编码器。啊,那我们这次用到的是千问编辑的这个模型啊,我们的文本编码也要用这个千问千问编辑的专用这个文本编码框啊, 我们正负面条件都需要一个文本编码框拉出来, 我们看文本编码框上面需要连接 clip 和 v a e 啊,那我们一样拉出来,我们加载 clip, 同样的,后面条件的文本编码框也需要连接加载 clip。 还有 ve 啊, ve 也要连接出来,我们加载 ve。 我 们这个工作流本质它是图声图嘛,那既然是图声图的话啊,图声图的工作流本质上就是你提供一张图片给机器,然后机器它会参考你的这张图片去进行一个图片的重绘, 那么我们这里就要引入一个新的节点,那就是啊,加载图像,我们需要把图片上传到这个节点,然后通过这个节点将图像输入到文本编码框中, 那我们可以看到这个文本编码框这里,它是可以支持输入三张图像的啊,我们给,所以说我们可以给加载图像复制多两张出来。 ok, 我 们将三个加载图像的节点都给它们连接上。 呃,正负面的这个两个文本编码器啊,都需要连啊, 好,然后这这里的 v e 也要连上,我们还需要在这个模型加载器和 k 采集器之间啊,再加上一个节点啊,我们也是一个新的节点啊,我们叫 laura, laura 加载器啊,仅模型我们只需要加载模型就行了,我们给它连上 啊,这个 ruler 的 作用是什么呢?我们一会再讲好吧。啊,还有就是还要再加上一个裁样算法。 呃,这个裁样算法的话,我们上节课也是有说过的啊,裁样算法的作用就相当于是一定程度上左右这个 k 裁样器的绘画方式啊,然后再加上一个 c f g 归一化, 那么 c f g 归一化的作用是什么呢?就是,呃,当你的 c f g 值调得很高的时候啊,它会让你生出来的图片出现色彩溢出的情况, 或者对比度非常高,会炸图啊,那我们 c f g 归一化加上这个节点的话,会有效的防止这个情况的发生。 ok, 那 我们这边的这个像模型区域啊,模型区块还有彩样区块啊, 就搭建好了,我们给它分类一下,我们 ctrl g 这里的话就是模型加载区,这里就是提示值 输入区,然后这里是彩样区,彩样区这边还没有完全搭建好啊,我们就先不框,我们说了这个 k 彩样器,它是一个相当于是绘画的机器吧,它需要一个画布,我们给它拉出来啊, 我们还是选择这个控雷塔图像,还是第三去设置它的画布大小,然后出图码,我们需要用 ve 编码啊, ve 解码好吧, ve 连接过来,然后图像预览, 然后还可以保存一下,可以保存到本地啊。好,我们再把这个加载图像给它分好类,要做图像输入, 那么裁样区的话也搭完了,我也给它分好类。好,那我们还差就是,呃,选择正确的模型啊,我们这里的话大模型选择千问编辑的啊,是千问 image edit 二五幺幺的这个模型 ok 啊,然后还有 laura, laura, 我 们这里选择千万编辑 lightning 四部的这个 four steps 这个啊, laura 模型,然后 clip 的 话,我们这里选择千万二点五的啊,千万三的这个是用不了的,我们要选择千万二点五的,好吧。 然后还有 veve 的 话,我们一样是选择千万 image 的 ve 模型展示一下。那我们现在来讲一下这个 laura 的 作用是什么?这个 laura 作用其实是提速的作用,那它为什么能实现提速的作用呢?其实,呃,比如说这个大模型啊,它假说它有,假如它有二十亿的传输量, 那如果不放 lora 的 话,那这二十亿的参数它会在运行的时候全部流入这个 k 采集器里面啊,无论是用的上还是用不上的参数,它都会流进 k 采集器里面,这样的话它跑图的话会花费很长时间,因为它参数量太大了。那么这个 lora 加载器的作用就相当于啊, 给它设置了一个过滤条件,组合条件呢,它就可以经过这个 laura 加载器被输入到 k 传感器,不符合条件呢,它就会保留下来,那么就相当于流入 k 传感器的参数量就没有那么大,从而达到一个提速的效果啊。 然后这里的话,我们可以看这个啊,这个 log 加载器上面的这个千万的模型名称啊,这里有一个四步啊, four steps 就是 四步的意思啊,那我们这里的啊, k 传感器也要调整对应的步数,调成四。 那么刚刚说过 c f g 值如果调太高的话,会出现那种啊,对比度非常高啊,或者说色彩易出的那种炸图现象,所以说我们要给它调低点,调成 c f g 为一就可以了。 然后,哎,然后我还有还有点差点忘记调了,我们再加载 clip, 这里啊,这里的类型我们得给它调成千万 image。 好,那我们这个工作流搭建呢,也是完成了啊,那我们来看一下这个工作流它可以怎么使用,比如说我现在想让图片中的这个女生啊,改变一下她的这个动作姿势,我只需要用到一张图,那么我就选中这两张图片啊,按住 ctrl 可以 多选, 我们使用 ctrl 加 b 的 快捷键将它们先关闭掉。啊,我们只需要用这一张图片,那我们就来到啊正向提示词这里输入,将图像一中的占着镜头 微笑就可以了啊,就这样就可以了,那负面提示词的话可填可不填啊,因为千万编辑的它这个模型训练质量本身就挺高的,就算你不填负面提示词,它跑出来的质量也不会很差,除非你有明确的 啊,不想让图片中出现的内容的话,就可以往这上面填东西啊。那我们现在我没什么特别的要求,我就不填了,那我们现在来运行一下看看效果。 我现在看到这个 k 传感器这里啊好像有些异常啊,然后我检查了一下,发现这里的彩样算法我们放错节点了。啊,我们修正一下啊, 我们这里的彩样算法呢,应该是放这个 aura flow 的 这个我们换成 s d 三的彩样算法了啊,是,这就会出现异常,那我们重新修改一下啊, 好,我们再把这个移位调成三,我们再去运行一下。好,这次采暖器它是正常工作了啊。好的,那运行结果也是出来了,我们把原图拉过来看一下 好了,可以看到啊,比心了,眼睛也是看着镜头了,然后也对着微,也对着镜头微笑了啊。 这边是完完全全的按照我们的提示词进行了一个图像编辑,但是呢,我们可以看到我们上传的图片比例啊,它是一个竖图,但是生成出来的图像它是一比一的这个宽高啊,原因是这里的空位特我们没有调整它的宽高,那么它默认就是一比一的, 那我们这里的话就可以引入一个新的节点,我们给他这个图像拉过来。先 我们引入一个图像缩放,按我看一下 按边, ok, 我 们可以用这个节点啊,这个节点的作用是什么呢?比方说我想让它缩放到一二八零, 当图像经过这个节点之后,它的高就会被缩放成一二八零,因为这个尺寸是按照它的最长边来算的,这里的最长边显然是它的高嘛, 这图片的高是二幺三三,那么经过这个节点之后,它的高就变成一二八零,但是它的宽度也会按照比例进行啊缩短。好吧,最终它的这个进行缩放之后的图片宽高比也是一样不变的。然后我们再来一个节点 获取图像尺寸,就这个这个节点的作用是什么呢? 顾名思义嘛,就是获取这个图像的经过这个节点处理之后的这个图像尺寸,我们将宽度和高度同步到这个 comlayton 这里。好吧,那我们之后就不需要手动的去调整这个 comlayton 的 大小了, 它跑出来的图片就跟我们的啊输入的图片它的宽高比例是一样的,我们运行一下看看效果,好的这个图片结果也是跑出来了啊,我们再把图片原图拉过来看一下, 这个宽高笔也是十分相近的了哈。啊,那像是其他的玩法呢,我们来看一下这里已经跑出来的这个效果了,如果你想让它生成角色三式图的话,那你也是只需要啊开启一个节点 啊,你可以跟其实上面直接输入啊,生成胡一中女生的角色三式图,分别为正视图, 测试图和背式图就可以了,但是你要注意,你要将他的这个图像尺寸啊调成啊横图啊,十六比九的这种比例会比较好一点,不然的话他会, 不然图片是会崩的,他因为因为竖图的话,他是很难塞的下三式图的啊,比例就会变得非常奇怪。 那如果你想实现图片转绘的话,那也是一样的,在文本编码器这里直接输入你想转绘的风格就可以了啊,只要这个千万编辑它有训练到的那种,呃,绘画风格的话应该是都可以转绘的, 然后的话就是像是啊换衣服啊,或者说两个女生拥抱在一起啊,也是一样的,你只需要把图片上传到这个家的图像,需要几张就上传几张图片,最多三张图片,然后把你的提示词要求说清楚就可以运行了。 好吧,那么这就是这节课的千万编辑的一个图升图工作流搭建, 我们这节课的话,这个工作流就到此为止。下节课的话,我们会讲一下这个基于 joycaption 的 一个啊提示词反推的工作流 进行喜图操作啊,这个喜图有什么用呢?我们下一期会做讲解啊,那么同样的下一期用到的模型啊或者工作流我也会啊,同步到我们的网盘中。

全新升级的 cfu i 九点五持续秉持开源免费的初心,将画面品质优化作为本次更新的核心方向,凭借出色的成像效果,受到广大设计人员和内容创作者的一致认可。 软件面向所有用户免费开放,完整解锁全部创作功能,不存在付费项目与权限限制,支持本地独立运行。所有作品与工程文件都保存在个人设备中,隐私和素材安全更有保障,同时运行过程不受网络影响,渲染过程稳定流畅, 软件自带丰富的预设流程。那么该如何使用呢?首先将我们的 v 九点五整合包下载到电脑上, 下载好之后,用鼠标右键点击这个压缩包,在弹出的菜单里选择解压软件进行解压。这里有一个非常重要的点,请一定要将文件解压到一个没有中文的目录下,也就是你的硬盘路径里不能出现中文字符,以免后续运行出现报错, 静静等待解压完成就好。解压完成后,咱们就可以准备打开了,在解压出的主目录里找到并双击那个粉色头像的会式启动器图标,双击打开后,电脑会首先为你弹出一个图形化的秋叶启动器控制台, 在这个界面里,我强烈建议大家先点开左侧的高级设置看一眼,确保系统已经准确识别,并且选中英伟达独立显卡。确认无误后,点击右下角的一键启动按钮, 点击之后,后台会弹出一个黑色的代码窗口,开始狂飙数据。这期间,系统正在为你自动唤醒底层环境,并加载内置的五十多个精选插件,大家只需要耐心等待几秒到几十秒,他就会自动唤醒你的电脑默认浏览器,直接把你带入 comui 节点操作区。 当浏览器成功弹出带有网格和各种连线的深色界面时,恭喜大家,你已经正式推开了 ai 创作的大门。咱们这个 v 九点五整合包最大的魅力就在于把复杂留给底层,把简单教给你, 你完全不需要从零开始去学习怎么连线,直接在界面里点击加载预设好的最基础纹身图工作流,咱们来简单跑个测试看看效果。 你只需要找到一个在上方的文本框,输入你想描绘的画面,比如简单敲上一句一个女孩毛衣白色背景,然后在下方文本框里填上如模糊、低质量、畸形之类的排雷词汇。 接着点击界面上的运行按钮,这时候你会看到屏幕上的节点开始依次亮起绿色的光效。得益于咱们非九点五底层强大的环境优化,仅仅几秒钟的功夫,一张光影细腻、质感拉满的美女照片就会在最终的图像节点里生成出来, 整个过程丝滑流畅,完全不需要你懂任何深奥的代码原理。当然,这种基础的纹身图仅仅是个热身。 咱们这个 v 九点五整合包真正的核心资产是里面为大家精心预制的两百多个大师级精品工作流。这些工作流的特点可以用四个字来概括,那就是开箱即用。 以前大家在网上找工作流,最怕的就是导入进去后满屏飘红,告诉你缺这个节点,少那个插件,折腾半天都跑不通。而在咱们的整合包里,几十个核心插件早就为你配置的明明白白, 不管你是想做高清的图声图,局部重绘,还是想玩点高级的 ai 换脸,数字人,对口型,甚至是去挑战目前最前沿的视频生成模型,这里面都有现成的模板供你直接调用, 那么你赶紧去自己动手试试吧!喽!以上的小伙伴们大家好,我是你们的大鱼老师,那么欢迎来到我的二零二六最新康复 ui 基础系列课堂的第二课,那么从本节课开始呢,我们就要正式的开始学习我们工作流的搭建。 那么首先呢,来到了我们会试的一个启动器,那么在上节课呢,我是告诉大家要先把版本更新到最新,对吧?那么大悦老师这里呢,是已经更新到了最新的版本了,然后更新到最新版本之后呢,我们只需要点击 一键启动即可,那我们再稍等一会,这一个就可以启动完成了。那么等东西启动完之后呢,我们就可以看到它已经进入到了我们 comforion 的 一个操作页面了,对吧?那么由于我更新了呢,可以看到这个界面跟我们上节课的云服务器里面讲的就是一模一样的,如果你还是喜欢比较 low 的 二点零版本的话,我们可以把这里设置一下, 当然我这里就不进行设置了。然后我们的第二步呢,既然是要从我们在的 image 特否的一个纹身图开始讲,我们就需要把他纹身图的工作流给他拖拽进来。哇,这里呢,可以看到大宇老师是已经给大家准备好了在的 image 特否的一个实体工作流,我们给他放置起来, 那放置进来之后我们可以看到,哎,这工作流其实还是蛮简单的。把工作流放置进来之后呢,我们可以看到他这里是需要加载模型的,他这里模型呢,主要由三个节点进行加载, 一个是 unid 加载器加载我们的模型,一个是 cleveland 加载器加载我们的文本编码模型,另外一个呢是 ve 加载器加载我们的 ve 模型,但是我们把它点击一下就会发现,哎,这里没有任何的显示,对吧?甚至我们点击一下箭头,现在再点它,它已经没有反应了, 那么这一个 cleveland 模型也是一样的,那么这个就代表了一件事,就是把你一个 comforion 的 整合包里面并没有放置对应的模型,那么我们现在要做的就是去把模型下载下来,然 然后再把它放置到一个对应的位置。首先我们先要去下载模型,那么我们就要来到我们的模型下载网站,那么这里呢,表示是推荐你们去使用摩达社区, 然后摩达社区呢,它是属于阿里巴巴进行一个开发的网站,那么这个网站呢,其实是对标外网的哈根 face 的 一个网站呢,那么在这个网站里面,我们可以直接在上面任务栏这里 页旁边有一个模型库,我们可以点击一下,然后等它加载出来之后呢,那可以在这个搜索栏这里去搜索 set image turbo, 也就是我们要用到的模型,给它点 击一下,而我们可以看到这里有非常多关于 set image turbo 的 模型,对吧?我们到底该选择哪一个呢?那么我们这里可以看到其实第一个这一个照相 set image turbo, 它属于一个在训练的大模型,我们先不 不对这个进行使用,我们使用的只用它最初的版本就可以,我们找到 comfort u i o r g 的 这一个官网键,然后把它点击进去,都在这里,我们可以看到这里有模型介绍及模型文件,我们选择模型文件, 然后这里可以看到这里有五个文件,而第一个呢,是属于一个文件夹,我们可以把它点进去,然后在文件夹里面它又有四个文件夹。第一个是 diffusion model, 也就是我们的大模型,那么对应回我们 comforion 里面的这一个呢,就应该是对应的 unad 加载器。第二个 laura 呢,它属于一个小模型, 那么小模型呢,对应我们 comforion 主页呢,就应该是 laura 加载器这一个,然后在下面这一个 tag in code 就 应该是我们的文本 模型,也就是我们的 clone 加载器里面要用到的模型。然后 ve 呢,就是我们最后 ve 要用到的一个模型。然后呢,我们这里先把 future model 打开,然后你可以去下载这个模型,可以看到这个模型需要 十二点三一 g b 的 一个内存,对吧?那么有十二点三一 g b 的 一个内存,那么就运行这个模型 d 的 显存至少就要十二 g b 以上。所以我上节课说到了,如果你是本地部署的同学呢,最好的显存至少就要十二 g b 以上。所以我上节课说到了,如果你是本地部署的同学呢,最好的显存就有十二 g b, 这里呢我是把四个模型都已经下载好了,可以看一下, 我们现在要一一的把它放在 in 的 地方,我们可以点击一下这一个文件夹哦,这里呢它就会显示出来几个一个文件,对吧?首先我们先把这一个 that image turbo b f 幺六,也就是 我们的 unet 模型 diffusion model 模型这一个文件夹里面的模型,它剪切出来,剪切出来之后呢,我们再去到我们的或 ui 的 这一个文件夹里面,也是我们上节课去解压过的那个文件夹里面,然后点击我们的 comfui a k i v 幺点六,然后这里呢找到我们这里面有一个 comfui 的 文件夹,点击进来, 然后往下滑动,找到一个 model 文件夹,我们放置模型的一个文件夹,然后 model 文件夹里面你会发现它有特别多的文件夹,对吧?各种各样不一样的名字。那么首先呢,我们就对应在 摩达社区里面,下载模型的时候,我们需要把这个模型放到 diffusion model 这一个文件夹里面,然后我们就去找看一下有没有 diffusion model 啊,有的,对吧?在这里那么我们就把刚刚的模型给他复制进来,复制进来完成之后呢,他第一个模型就放置成功了,然后我们再回去操作第二个模型, 那么我们第二个模型呢,就是这一个千万三四 d 的 模型,那么这一个呢,是属于我们的 clear 的 模型,我们可以看一下我们这一个 clear 的 模型应该放在哪个文件夹里面,我们依然回到我们的摩达社区,对吧?那么 clear 的 模型呢?这里对应它,这里的文件夹就是 testin code 的 这一个文件夹,可以点开看一下, 确实是我们全网三的,对吧?然后我们再回到我们的那一个 cover ui 的 这一个文件夹里面,然后返回到上一集的 model 文件夹,我们找到 ted in call 的 这一个文件夹,可以看到吧?在这里我们点击进来,然后再把模型给它放进进来,以此类推呢?我们再次回到我们的下载主页这里, 然后把 a e 的 这一个模型也给他剪切一下,我们这一个 a e 模型属于什么模型呢?我们也可以回到我们 red image turbo 这 后,可以看一下,它是属于我们的 ve 模型,对吧?我们就把它放到 ve 里面,那么同样的返回到上一集的这一个 model 文件夹里面,到我们的 ve 哦,把它放进进去,最后一个呢,就剩下一个罗拉模型呢?我们只需要 再一次的把这一个剪切一下哦,返回上一集 model, 然后导到我们的罗拉,可以看到吗?在这里我们把它粘贴进去,那么这样子呢,我们就把所有的模型都配置完成了,那么模型配置完成之后呢,我们就回到我们 的 for ui 的 一个操作页面,我们该怎么样去加载这一个模型呢?我们刚刚把模型放进来,我们点击它可以看到还是没有反应,对吧?那么我们就需要刷新一下这个页面,我们只需要按住键盘的 ctrl 键,然后再和 r 键,它就可以重新刷新我们这一个网页,我们再稍微等待一下啊,刷新完成之后呢, 我们就可以在这里面模型加载出来了,首先是我们的 lala 加载器里面的模型,看到,哎,刚刚的模型出来了,对吧?我们把它加载一下。 una 加载器也一样的,刚刚的模型也加进来了,把它加载一下可莉的模型,哦,我们的 ve 模型,那么全部加载完之后呢,我们就可以尝试一下去跑一下这张图片, 看一下能不能把图片给他跑出来啊。这里呢我们就只需要点击一下运行即可,然后我们稍微等待一下,这里我们需要说到的是,当你首次去跑这工作的时候,他所用的时间是会比较久的啊, 为什么会比较久呢?因为我们需要去加载这些模型,所以他要用的时间会稍微久一点,我们就需要稍微的再去等待,然后我们就发现图片是跑出来了,那么图片既然能跑出来,就证明这个模型配置放置的没有任何的问题, 既然它的模型加载已经没有任何的问题了,那么我们就来看一下它这些呃节点的一个使用,它这一个节点的使用其实也是非常的简单,我们可以简单的把它拆成几部分,第一部分属于模型加载部分,就像我们刚才说的一样,可以把 unad 加载器, clive 加载器以及 v a e 加载器单独给它提取出来,然后把它们在一个框里面,那么这个放在一个框里面要怎么去放呢?我们只需要按住 ctrl 键,然后就可以多选,多选完之后,然后右键右键就有一个并入到框,哎, 我们就可以看到它就放在一个框里面了,对吧?然后是我们的罗朗模型,那么这个属于一个小模型,我们就把它放在外面过了呢,就是我们两个 clip 的 文本编码器,那么 clip 的 文本编码器的作用是什么呢?其实就是拿来书写我们想要它生成的一个内容,当然了这里背绿色框和红色框,对吧?那么绿色框 书写的就是我们想要的东西,红色框呢,书写的就是我们的 k 长器, 然后再过后呢就是我们的一个 v a 解码,然后现在我们再来一一看它的一个效果。首先呢,我们的 unit 加载器的作用是什么?其实就是拿来加载我们的大模型,那么这个大模型里面呢,拥有非常多的一个图片训练级,以及图片打标的训练级。那么什么是图片训练级呢?就是我们要去训练一个模型的时候, 我们会不断地往里面投入图片,当我们图片位的够多的时候,那么它对于世界观就会更好了。 that image turbo 呢,它是一个有六十亿参数的一个模型,所以它的一个数量还是蛮大的。它的打标数是什么意思呢?就是我们每次投入的图片,我们都需要在图 旁边进行打标。之后我投入了一张小女孩的图片,对吧?这个小女孩是红色头发色的衣服,绿色眼睛。我在这张图片旁边呢,就要需要用文字去描述这个小女孩的外观,是有一个红色头发的小女孩,对吧?他有一个绿色的眼睛,黄色头发, 因为我们得告诉 ai, 哎,他这一个片的特征因为他自己看不懂,所以我们得教他。那么这个就是我们训练模型的一个过程,也是我们打标的一个过程,所以这一个 u 内加载器里面含有的大模型呢,它就有非常多的一个文字参数以及图片参数。 那么这个 cleveland 加载器的模型为什么我们需要它呢?因为我们输入给 cleveland 文本编码器的这些文字属于什么语言?是不是属于我们人类看得懂的语言? 但是 ai 总体来说还是计算机来的,对吧?那么计算机看不看得懂?我们人类看得懂语言,他肯定看不懂,对吧?因为他需要在识别我们这些语言的时候,他需要把语言转换为数字。那么 cleveland 加载器里面的 cleveland 这个模型呢?他就可以把我们的文本转化成为数字的一个信息, 那么 v a e 的 作用是什么呢? v a e 就是 它可以把我们大模型里面的图片信息以及打标的文字信息也转换成 计算机看得懂的语言。那么我们会发现我们这里的 unad 加载器里面加载的模型里面的图像信息以及文字信息,那么我们可列的文本编码器里面的图像信息,最后被编码为数字信息之后,都要传向哪里?是不是都要传向我们的 k 长器, 那么在 k 程序里面呢,他就会进行一个信息匹配,那么在这个信息匹配呢,他就会先读取我们里面的这个我们输入的文本信息,他就知道,哦,原来我们需要的是一个人的手,对吧?拿着一张照片,那么这个照片里面有什么内容? 然后背景是怎么样的,对吧?只要他在一一的去匹配我们大模型已经有的一些图片信息,他就在这里面图片信息一样,他就知道,哦,原来我要生成的,根据他这一个提示词去生成的图片,我应该采取哪些数据,对吧? 猫耳朵应该长什么样?哎,这个人的这个裙子应该长什么样?这背景应该长什么样?然后一一把信息采取完之后呢?他就会把信息给到我们的 coin, 那 么这里的 coin 其实就相当于我们 人类在进行作画的时候的一个画布,可以明白了,对吧?然后他会根据这些信息在这个画布里面进行作画,然后这个作画他画的大小是多少呢?这里就是我们设置了 宽高,就是幺零二四乘以幺零二四,那么这个画布给他的也就是幺零二四乘以幺零二四,那么他就在这个画布之内进行作画,然后画完这个画之后,他再次返回给我们的 k 函数, 然后再给到我们的 v a e 解码。那么为什么需要用到这里的 v a e 解码呢?因为前面这有个 v a e 加载器,这里的 v a e 加载器其实属于一个 v a e 编码的一个范畴,它会把我们所有的一个信息量匹配完之后,转化到空闲客里面,作画的时候,我们这个 v a e 是 需要在这空闲客里面进行压缩空间的。 那么什么是压缩空间呢?就是我们原先在这一整套工作流里面,你会发现,如果我们直接用幺零二四乘以幺零二四的尺寸给这个工作流这一个 ai 进行作画的话,其实对他来说这一个参数量是太大了,对吧? 那么越大的参数量,他主要运用的算力也就越多,那么他主要占用的 gpu 显存也越多,那么我们这个作者就想出一个方法,他用一个 ve 的 模型,把我们幺零二四乘以幺零二四的这一个图像点, 它在空内存里面先压缩到六十四乘以六十四,那么我们的 ai 就 在六十四乘以六十四这个大小里面进行一个作画,然后画完之后,最后再由 v a 一 解码给它释放到幺零二四乘以幺零二四,再给我们呈现出来,就可以看到又是我们人类看到的一个语言了,这是一张图片, 是不是非常的简单易懂,对吧?那么这里还有另外一个,这里为什么会有一个罗拉模型呢?那么这个罗拉模型其实它属于一个呃再生的一个小模型,那么这个小模型呢?其实它是不属于这工作流的,但是我们的摩达社区里面,它确实让我们把这个罗拉模型也下了下来。那么这个罗拉模型呢?我给同学们试了试了一下,它主要的作用是增加我们图 片的一个细节用的。那么这一个 logo 模型它到底是怎么样起效果呢?我们简单的用两个框去给大家做一个比喻,比如说我先新建一个框,然后把这个框给它放大一点,然后我们再建一个框, 那么这个框呢?就这么小,那么这前面这个呢就属于大模型,也就是我们这里 unit 加满器加的 de future model, 那 么我们这里就用 unit 去代表, 那么下面这一个小模型呢,就相当于我们这一个 loala 模型,对吧?那么这个 loala 模型是怎么起效果的呢?我们会发现我们这个 uni 的 模型后面的线是连接给我们的 loala 加载器的,对吧?也就是说我们这个 uni 模型去加载我们的图片信息以及打标信息的时候,我们要去到 k 长器这里的信息 处理中心的时候,我们是不是要先经过罗拉加矮器,对吧?那么我们既然要先经过罗拉加矮器,那么这个罗拉加矮器就可以在这里面做手脚了。什么手脚呢?就是我们可以看到罗拉其实它属于一个非常小的一个体量,我们的 unit 属于一个非常大的一个体量,对吧? 我们的 unit 里面有非常多的信息,在它经过我们罗拉的时候,那么我们罗拉的通道就变窄了,有没有发现,对吧?那么通道变窄了,那么所经过的信息就会变少, 但是这个变少的这一个信息就要由谁决定,由我们 lora 决定。我们这个 lora 里面练的模型是怎么样的,那么它经过的信息就应该是怎么样的。比如说我们这一个 lora, 现在这一个不是增加细节的一个 lora, 而是一个动漫模型,对吧?好,它现在属于一个动漫模型,那么我们这个 u n, 比如说它现在属于一个混合模型, 那么混合模型是什么意思呢?就说这个模型里面,他既有真实图片的参数,也有动漫图片的参数,那么当我们这一个 u n 的 模型里面的信息经过 rola 的 时候,那么 rola 由于是动漫模型,他就会优先把 动漫模型的信息留下来,然后把真实的信息给他去掉,或者说给他冻结住,那么我们留向 k 长期里面的这些信息呢?更多的就是动漫模型的信息,那么他主要就是起到一个缩小通道,以 及哎冻结住前面大量的信息的一个效果。可以这么简单的一个理解,虽然说大衣老师可能讲的不准确,但是他的基本逻辑大概就是这样子,那么我们这里也可以看到这里还有一个 模型彩样算法,对吧?那么这个东西是什么呢?就是我们可以用这一个模型彩样算法里面的偏移值去让我们这里面的信息变得更加活跃,那么这个活跃是什么意思呢?我们可以把这个活跃给他说成是一个自由度,也就是说通过这个模型彩样算法这一个节点之后的所有信息,再来到我们 k 彩样器 在进行深图的时候,它的自由度会更大,那么它生成的图片会更加具有不确定性,那么这一个不确定性呢,其实是可以为我们图片增加光彩的。那么还有另外一个功能呢,就是它能够使深图的时候更加的稳定,不会使它混乱,或者说生成多手多脚的一个情况,那么这就是我们模型采用算法的一个 功能了。那么这里最后呢我们再看一下我们 k 函数器里面有的一些参数,然后 k 函数器里面我们可以看到这里有种子数,对吧?种子数其实对应的就是我们的图片,我们每一张图片呢都会有一个对应的种子数, 那么相当于它的一个身份证吧,然后就有一个运行后的操作,运行后操作呢我们可以固定,那么就可以固定上面这个整数,那么整数一个固定的话,其实这张图片它就基本上永远都不变了,然后我们也可以随机,我们一般都是选择随机的,那么这张整数始终都在改变,那么这张图片你就会一直的改变,就会起到一个抽卡的一个效果。 然后这里呢 red image turbo 他 是用九步,他就可以把这张图片给大家画出来了, 那么有一些模型呢,可能需要用到二十步,那么另外呢这一个 c f g 是 什么意思呢? c f g 就是 对于我们这一个提示词的一个参考程度,那么由于我们在的 image turbo 是 一个非常厉害的模型,所以我们的 c f g 调低就可以了,调 到一,那么就能起到一个很好的一个效果,那么这个也是官方给的一个参数,我们一般不去变它,然后我们的彩样器和调度器呢?呃,这个我们去设置它,它都会影响到我们图片的一个输出效果, 但是哪一个出图效果会更好呢?这个就要同学们自己去探索了,但是官方的给的是 u 罗加新跑的一个模式,这个我们一般也可以不去改变它,然后降噪是什么意思呢?那么降噪这里我们就要说到一个概念了,就是我们的这个深图模型其实是属于一个 扩散模型,那么扩散模型是什么意思呢?就是我们这个工作流在生成图片的时候,其实它是属于一个反扩散的一个过程。那么什么是反扩散?我们再举个例子, 比如说,哎,我这里现在属于一个红蓝毯,对吧?也就是我们的白色画布,那么在这个白色画布里面呢,它并不像我们人类世界的白色画布,它完全是白色的, 那么这个白色画布里面它有许许多多的藻点,那么这些藻点主要是由红色、蓝色、黄色、绿色这些颜色组成,对吧?但是这些粒子一个一个灶点的粒子,它分布是不均匀的,那么在分布不均匀的情况呢,我们就需要把它变得均匀。 那么在这一个扩散模型,也就是这一个 unit 模型 red image turbo 这一个模型里面,在运行的时候呢,它就会把这些 散乱在这个画布里面的这些粒子给它进行一个收缩,那么从一个松散的状态变成一个聚拢的一个状态,那么它在收缩的时候呢,你就会发现有一些颜色的粒子,它就会叠加,就会叠加出它原来没有的一种颜色,然后它越叠加越多呢,它就可以在这些地方把它处理成为一个一个的色块, 然后这些色块拼接起来之后呢,就是我们现在看到了一个图片了,比如说,哎,他在这里聚集了很多其他颜色的,然后组成了这个蓝色,他在这里呢又聚集了很多颜色,组成了我们的一个什么,组成了我们的一个肉色,对 吧?那么通过这种组合的方式呢,我们就把它叫做反扩散,就是把扩散在外的一些散段粒子给他聚集,就叫反扩散,对吧?所以我们就做扩散模型,那么这个降噪呢,也就是代表了我们要去掉一些没用的噪点,留下来再把它聚拢的一个过程, 如果说这个降噪幅度比较低的话,我们可以看一下它的一个效果,那么我们就可以很明显的看到它这些色块是不是乱七八糟的,那么就是一个没有聚拢完 的一个效果。那么在降噪零点五的时候,所以我们这个降噪呢,把它调为一属于一个纹身图最好的一个效果。那么简单的讲完这个基础之后呢,我再带大家来搭建一下工作流,那么基本上这工作流我们看一眼之后基本上就熟悉了,那么首先我们就要三个模型加载,对吧?那么第一个就是我们的 un 的 模型加载器 去加载我们的大模型,也就是有很多训练参数的一个大模型。第二个呢就需要我们颗粒的加载器,用来识别我们后面要填写的提示词,对吧?然后再来一个 ve 加载器, 用于压缩我们空扔它的一个空间。那么有了这三个模型之后呢,我们就可以通过拖拽的方式把其他的节点给他召唤出来,比如说 六加载器后面跟随的应该是我们的文本编码器,也就是说我们输入提示词的一个地方,对吧?那么文本编码器呢?我们有两个分成了正面条件和负面条件,所以说我们还需要再从这里拉出来一条线放掉,然后作为我们的负面条件。 然后我们的 unit 加载器呢,我们可以拉出来一条线给它放掉,可以看到它直接转接的就是我们的 k 长器了,对吧?但是 k 长器中间还少了两个其他的一个增加效果的节点,那么一个呢属于我们的罗拉模型加载,我们可以把它复制过来,那么另外一个呢,属于我们的模型彩样算法,对吧? 那么这里呢,我们就把我们的 unit 加载器的点先给他在 k 长器这里断开,先让他经过我们的路由加载器,让他留下我们需要的一些细节信息,然后再给到我们的模型渲染算法,增大他的一个活力,然后最后再给到我们的 k 长器,让他进行一个信息的匹配, 那么这里的信息匹配呢?他是跟谁匹配?是不是跟我们输入的文本进行匹配?所以我们也需要把文本连接到 k 长器里面去,那么我们在进行作画的时候呢,我们也需要给他一个白色画布,就需要一个空人头, 那么空间腾有了之后呢?我们最后需要怎么样在这里画完画之后,画完画之后,我们是不是要把里面的这一个空间给它释放出来,那么释放出来呢?我们就需要用到 ve 解码,然后我们把这个空间解码出来,然后我们要解码它呢,我们也需要用到前面的这一个 ve 加载器里面加载的 ve 的 一个功能,给它进行一个释放 好,然后最后再来一个保存图像或者预览图像,就可以把这工作流搭建出来了,是不是非常的简单?那么这里的底层逻辑你弄懂之后呢?哎,也是非常有益于你后面的一些工作流的搭建的。那么我们这节课的内容有那么多,如果小伙伴们觉得大卫老师讲的不错的话,不要忘记一键删人哦,我们下期再见,拜拜。

这次真的是王炸级更新,六月二十九日, comfy u r 又推出了微食满血包,这波更新简直是对 ai 小 白的神之一手,不用担心本地电脑带不动或者折腾半天一直报错了。这个包已经帮大家把最难的安装和环境配置搞定了,真正能做到解压即用 原声支持全中文界面,新手直接闭眼入。最狠的是,它直接内置了市面上最主流的三百多套大神级爆款工作流, 只需要把大白话敲进去,点击生成,一键搞定。满血包是什么味道呢?六百七十八,尝尝咸淡。那今天呢,我将带大家深入了解目前非常火爆的 one future x 视频生成模型,无论是镜头流畅度、画面自信还是细节还原度都非常惊艳,非常轻松就能够实现电影级别的使 用细节以及提示词断写技巧等方面给出参考建议。 同时呢,我也整理了详细的图案教程,那包括模型的下载、安装、工作流预览参数建议、效果演示等等一系列的细节内容。从我测试的效果来看呢,我感觉他的一个质量还是非常的高的,是可以达到电影级的一些实时镜头的效果。 那比如说这个视频呢,就是老师最后生成出来的一个效果,我这里呢是设置成四十一帧,然后呢帧率是八,所以呢,合成出来之后大概是一个五秒的镜头可以看一下, 我们可以从这个画面当中看到这个人物、环境、光影等要素高度协调,那角色的面部表情呢,也是很自然,服装细节饱满,还有他的发丝、布料、纹理等等,他表现的都是非常的优秀的,也是接近于实时动画的一些质感标准。那虽然说我们这个视频帧率只有八帧,但是呢镜头的运动 流畅度还是很具备一些电影感的,运动的方向呢,也是可以把这个视频 帧率调高一些,那视频长度呢,弄到五到十秒钟都是没有问题的。那么我们接下来再看到第二个是另外一个纹身视频的一个效果, 这个效果呢就是啊两个草莓然后掉入到牛奶杯当中的一个画面,我可以看到他的一个流畅度还是挺高的,而且呢就是在这个牛奶建出来的这个动态上面还是把握的相当的好。那我在这里啊给大家看一下, 这里呢我是上传了一张啊女孩子的一个图片,然后最后呢他生成出来的效果是这样的, 其实动作呢还是比较流畅的啊,我这里题的词写的会比较简单一些,是指一个女人在床上翻身的一个动作。那么同学们看到这里是不是就想要问怎么去下载这个模型了,对不对?那我在这里呢其实也把这些模型都放在我的网盘当中了,那有需要的小伙伴呢,可以在我的评论 区进行留言,那我会逐一回复分享给到你们,到时候呢大家就直接打开,然后呢下载对应的一个大模型,那下载完毕之后,我们就放到这个目录 文件夹当中。好,我们打开这个 com 里外当中的一个呃个目录,然后呢找到这个 models 大 模型呢,我们就统一放到这个 diffusion models 里面,我们可以在这里呢命名一个文件夹,就是 one fusion s 的 一个文件夹, 然后呢在这里面呢就托录老师给到大家的两个大模型,那像其中这个 image 就 代表着图声视频的一个大模型,那在旁边这个啊有这个 test 就是 代表着纹身视频的一个大模型,然后呢放到这个文字夹当中就没有问题了。好,那我们再回到这个 models 当中, 找到这个配套的一个 v i e, 那 在这里呢也是需要有这个 one 二点一的一个 v i e 的, 它直接放到这个文件夹当中就没问题了。接下来还有就是后面的两个 flip 加载器,就是需要放置这个 u 开头的一个模型, 其次呢还有一个视觉加载器,也就是这个文件也是放到这个路径当中就能够进行使用了。那么除此之外呢,还有一些是这个 guf 版本的,那这个呢是需要我们进行额外的安装的,那我们可以来到这个网址当中,然后呢找到这个位置,就可以找到这样子的一个下载按钮, 点开进来之后呢在这里就能够进行下载了。而且如果说我们用了量化过的 guf 模型之后呢,我们在有限的十六 g 显存内,其实也可以跑到我们接近八十多帧,或者说一百帧的一个数量,所以说如果用 guf 的 话呢,我们的低显存也是可以尝试去 使用的。那么重点来了,就是关于模型当中提示词的一个输入,还有以及一些重要的参数,那就比如说我的这一段提示词哈,那老师呢给大家看一下这个翻译哈, 这个呢其实就是四 k 电影级的画质,然后女主贴墙,喘息等等,那这个提示词和书写呢,一般就是主体加环境加氛围,还有一些画质的提示词,像这个呢,其实我们也可以让豆包或者说 gdp 去帮我们书写题词,那提问的方法其实很简单,我们也可以直接向他进行, 请问我先要制作一个怎样一个画面镜头,请你为我想一段一百字左右的一个视频的词,像这些呢,他就会啊,去书写我们镜头的一个推进啊等等啊,就是一些动态的提示词,我们就可以直接把这个提示给复制下来,放到空格当中,直接点击运行就可以了。好,那么我们可以看一下这里呢,我用到的是这个 纹身视频的模型,那视频比例呢,是一个十六比九的状态,然后呢宽高比在这里可以进行调节,我这个视频呢,其实就是一零二四乘五七六的一个宽高比, 那视频长度呢?是在这里啊,四十一帧,那帧率呢是八帧每秒,然后在旁边这里呢,就是我们的一个模型加载器了,大家把模型放到自己对应的一个文件夹,就能够直接进行生成了。好,我们可以看一下这个雨夜霓虹浸湿了五十下,然后滤度, 贴墙,喘息,还有远处的警车等等,像这些画面效果呢,在视频当中都有体现出来了。那喜欢那些涂色视频的同学呢,也可以用一下这个,这个搭建起来呢,也是跟刚才的这个工作流是很像的。那本期内容分享到这里了,谢谢大家,那我们下期再见,拜拜。

求求你,别再给那些高价 ai 工具交智商税了!二零二六年巨强零元生产力秋叶版康菲 u i v 十正式巅峰更新,别只听免费二字!看完这三个真实案例,你就知道他现在的性能有多离谱。 ai 视频生成,平民显卡也能出大片,以前跑一段 ai 视频, 动不动就爆表,卡顿闪退,普通人根本玩不起。现在 v 八内核深度优化,哪怕你用的是八 g 显存的平民显卡,也能丝滑渲染电影级大片,渲染速度直接比老版本翻一倍,效率拉满不拖沓。商业写真本地生成,成本归零,别再花大价钱用云端软件了!秋叶版自带全中文界面,无需复杂配置,一键解压就能用。 从电商模特图到个人摄影写真,全部分地无限次生成,不用充值不用付费,彻底告别隐形消费,成本直接归零!环境一键直达,小白也能轻松上手。以前装 ai 工具折腾半天,装环境配插件,新手直接劝退。现在秋月版直接集成派送三点一三和配套库, 你只需要解压文件,点击启动,剩下的所有操作他全帮你搞定!简单到连我奶奶都能一键开启 ai 自由!重点来了!这款能打又能省的 ai 工具,全程免费,无任何套路!想真正实现 ai 自由,不花一分钱解锁高升卡币!安装包我已经给大家整理好了!

七月最新的秋叶康 p u i 整合包已经更新了,不用配置复杂的环境,只需三步开箱即用,一拿到整合包,二解压缩,三,双击打开, 支持 win mac 和 a 卡,最低一千零六十,显卡现存八 gb 即可本地部署运行。这个最新版本无需积分,不用排队,破线生成无任何限制, 想生成什么就生成什么。这次更新可谓是诚意满满,内置五百大模型工作流模板,不管你是想生成当下最火的这种 ai 漫剧,还是设计师需要的电商产品详情页,甚至连这种 3 d 建模渲染 通通都能在本地运行生成,还没试式的老规矩,直接抄作业,现在开始教学。那么欢迎来到我的二零二六最新 comfy 基础系列课堂的第二课, 那么从本节课开始呢,我们就将正式的开始学习我们工作流的搭建。那么首先呢,来到了我们会士的一个启动器,那么在上节课呢,我是告诉大家要先把版本更新到最新,对吧?那么大宇老师这里呢,是已经更新到了最新的版本了,然后更新到最新版本之后呢,我们只需要点击一键启动即可, 那我们再稍等一会儿,这一个就可以启动完成了。那么等启动器启动完之后呢,我们就可以看到它已经进入到了我们 comfy ui 的 一个操作页面了,对吧?那么由于我更新了,你可以看到这一个界面跟我们上节课在云服务器里面讲的就是一模一样的。 如果你还是喜欢比较 note 二点零版本的话,我们可以把这里设置一下,我这里就不进行设置了,然后我们的第二步呢, 既然是要从我们 zimh turbo 的 一个纹身图开始讲,我们就需要把它纹身图的工作流给它拖拽进来,这里呢可以看到大宇老师是已经给大家准备好了在 zimh turbo 的 一个视力工作流, 我们给它放置起来,那放置进来之后我们可以看到,哎,这工作流其实还是蛮简单的。把工作流放置进来之后呢,我们可以看到它这里是需要加载模型的,它这里模型呢主要由三个节点进行加载,一个是 cleve 加载器加载我们的文本编码模型, 另外一个呢是 v a e 加载器加载我们的 v a e 模型,但是我们把它点击一下就会发现,哎,这里没有任何的显示,对吧?甚至我们点击一下箭头,现在再点它,它已经没有反应了, 那么这一个 clip 的 模型也是一样的,那么这个就代表了一件事,就是玩你一个 comfyui 的 整合包里面并没有放置对应的模型,那么我们现在要做的就是去把模型下载下来,然后再把它放置到一个对应的位置。 首先我们先要去下载模型,那么我们就要来到我们的模型下载网站,那么这里呢,大鱼老师是推荐你们去使用摩达社区,然后摩达社区呢,它是属于阿里巴巴进行一个开发的网站,那么这个网站呢,其实是对标外网的 hack and face 的 一个网站的, 那么在这个网站里面,我们可以直接在上面任务栏这里首页旁边有一个模型库,我们可以点击一下,然后等它加载出来之后呢,我们可以在这个搜索栏这里去搜索 zimagertribble, 也就是我们要用到的模型,给它点击一下,那我们可以看到这里有非常多关于 zimagertribble 的 模型,对吧?我们到底该选择哪一个呢? 那么我们这里可以看到其实第一个这一个照相 z image turbo, 它属于一个在训练的大模型,我们先不对这个进行使用,我们使用的只用它最基础的版本就可以。我们找到 comfy u i o g 的 这一个官网街,然后把它点击进去,就在这里我们可以看到这里有模型介绍以及模型文件, 我们选择模型文件,然后这里可以看到这里有五个文件,那第一个呢是属于一个文件夹,我们可以把它点进去,然后在文件夹里面它又有四个文件夹。第一个是 diffusion model, 也就是我们的大模型,那么对应为我们 comfyui 里面的这一个呢,就应该是对应的 unit 加载器。 第二个 laura 呢,它属于一个小模型,那么小模型呢,对应我们 comfyui 主页呢,就应该是 laura 加载器这一个, 然后在下面这一个 textencoders 就 应该是我们的文本模型,也就是我们的 clip 的 加载器里面要用到的模型。然后 ve 呢,就是我们最后 ve 要用到的一个模型, 然后呢我们这里先把 diffusion model 打开,然后你可以去下载这个模型,可以看到这个模型需要十二点三一 gb 的 一个内存,对吧?那么有十二点三一 gb 的 一个内存, 那么就运行这个模型的显存至少就要十二 gb 以上,所以我上节课说到了,如果你是本地部署的同学呢,最好的显存就有十二 gb, 这里呢我是把四个模型都已经下载好了,可以看一下,我现在要一一的把它放在 in 的 地方,我们可以点击一下这一个文件夹哦,这里呢它就会显示出来几个一个文件,对吧? 首先我们先把这一个 z image turbo bf 十六,也就是我们的 unity 的 模型 diffusion mode 的 模型,这一个文件夹里面的模型它剪切出来,剪切出来之后呢,我们再去到我们的 comfy ui 的 这一个文件夹里,也就是我们上节课去解压过的那个文件夹里面, 然后点击我们的 comfy ui a 开 v 一 点六,然后这里呢找到我们这里面有一个 comfy ui 的 文件夹,点击进来, 然后往下滑动,找到一个 model 文件夹,我们放置模型的一个文件夹,然后 model 文件夹里面你会发现它有特别多的文件夹,对吧?各种各样不一样的名字。 那么首先呢,我们就对应在摩达社区里面下载模型的时候,我们需要把这个模型放到 diffusion model 这一个文件夹里面, 然后我们就去找看一下有没有 diffusion model, 哦,有的,对吧?在这里那么我们就把刚刚的模型给它复制进来,复制进来完成之后呢,它第一个模型就放置成功了,然后我们再回去操作第二个模型,那么我们第二个模型呢,就是这一个千问三四 d 的 模型, 那么这一个呢,是属于我们的 clip 的 模型,我们可以看一下我们这一个 clip 模型应该放在哪个文件夹里面,我们依然回到我们的摩搭社区,对吧? 那么 click 模型呢?这里对应它,这里的文件夹就是 textencoders 这一个文件夹,可以点击看一下,确实是我们的前文删了,对吧?然后我们再回到我们的那一个 comfyui 的 这一个文件夹里面,我们找到 textencoders 这一个文件夹,可以看到吧, 在这里我们点击进来,然后再把模型给它放进进来,以此类推呢?我们再次回到我们的下载主页这里,然后把 vae 的 这一个模型也给它剪切一下。 我们这一个 ve 模型属于什么模型呢?我们也可以回到我们 z image turbo 这里哦,可以看一下它是属于我们的 ve 模型,对吧?我们就把它放到 ve 里面, 那么同样的返回到上一集的这一个 model 文件夹里面,到我们的 ve, 然后把它放进去。最后一个呢,就剩下一个 lora 模型了,我们只需要再一次地把这一个剪切一下哦,返回上一级 model, 然后导到我们的 lora, 可以看到吧,我们就把所有的模型都配置完成了,那么模型配置完成之后呢,我们就回到我们的 comfyui 的 一个操作页面, 我们该怎么样去加载这个模型呢?我们刚刚把模型放进来,我们点击它可以看到还是没有反应,对吧?那么我们就需要刷新一下这个页面, 我们只需要按住键盘的 ctrl 键,然后再和 r 键,它就可以重新刷新我们这一个网页,我们再稍微等待一下,刷新完成之后呢,我们就可以在这里面模型加载出来了,首先是我们的 lora 加载器里面的模型,看到,欸,刚刚的模型出来了,对吧? 我们把它加载一下。 unity 加载器也一样的,刚刚的模型也加载进来了,把它加载一下。 clip 模型啊,我们的 ve 模型。那么全部加载完之后呢,我们就可以尝试一下去跑一下这张图片,看一下能不能把图片给它跑出来啊。这里呢我们就只需要点击一下运行即可,然后我们稍微等待一下。 这里我们需要说到的是,当你首次去跑这个工作流的时候,它所用的时间是会比较久呢,因为我们需要去加载这些模型,所以它要用的时间会稍微久一点, 我们就需要稍微的再去等待,然后我们就发现图片是跑出来了,那么图片既然能跑出来,就证明这个模型配置放置的没有任何的问题,对吧?既然他的模型加载已经没有任何的问题了,那么我们就来看一下他这些呃节点的一个使用,他这一个节点的使用其实也是非常的简单, 我们可以简单地把它拆成几部分,第一部分属于模型加载部分,就像我们刚刚说的一样,可以把 unit 的 加载器, clip 加载器以及 v a e 加载器单独给它提取出来,然后把它们放在一个框里面。那么这个放在一个框里面要怎么去放呢?我们只需要按住 ctrl 键,然后就可以多选, 勾选完之后,然后右键右键就有一个并入到框,哎,我们就可以看到它就放在一个框里面了,对吧?然后是我们的 laura 模型,那么这个属于一个小模型,我们就把它放在外面晃呢,就是我们两个 clip 的 文本编码器,那么 clip 的 文本编码器的作用是什么呢?其实就是拿来书写我们想要它生成的一个内容, 当然了这里为绿色框和红色框,对吧?那么绿色框书写的就是我们想要的东西,红色框呢,书写的就是我们不想要的东西,也就是我们的负面提示词。那么过后呢就是我们的 konlan, 再过后呢就是我们的 k 彩样器,然后再过后呢就是我们的一个 ve 解码, 然后现在我们再来一一看它的一个效果。首先呢,我们的 unit 加载器的作用是什么?其实就是拿来加载我们的大模型,那么这个大模型里面呢,拥有非常多的一个图片训练级,以及图片打标的训练级。 那么什么是图片训练级呢?就是我们要去训练一个模型的时候,我们会不断地往里面投入图片,当我们图片喂得够多的时候,那么它对于世界观就会更好了。 zimd turbo 呢,它是一个有六十亿参数的一个模型,所以它的一个数量还是蛮大的, 他的打标数是什么意思呢?就是我们每次投入的图片,我们都需要在图片旁边进行打标。之后我投入了一张小女孩的图片,对吧?这个小女孩是红色的头发,红色的衣服,绿色的眼睛。我在这张图片旁边呢,就要需要用文字去描述这个小女孩的外观,是有一个红着头发的小女孩,对吧? 它有一个绿色的眼睛,黄色头发,因为我们得告诉 a i a 它这一个片的特征,因为它自己看不懂,所以我们得教它。那么这个就是我们训练模型的一个过程,也是我们打标的一个过程,所以这一个 unit 加载器里面含有的大模型呢,它就有非常多的一个文字参数以及图片参数。 那么这一个 clip 的 加载器的模型,为什么我们需要它呢?因为我们输入给 clip 的 文本编码器的这些文字属于什么语言?是不是属于我们人类看得懂的语言?但是 ai 总体来说还是计算机来的,对吧? 那么计算机看不看得懂,我们人类看得懂语言,它肯定看不懂,对吧?因为它需要在识别我们这些语言的时候,它需要把语言转换为数字。那么 clip 加载器里面的 clip 这个模型呢?它就可以把我们的文本转化成为数字的一个信息。 那么 ve 的 作用是什么呢? ve 就是 它可以把我们大模型里面的图片信息以及打标的文字信息也转换成计算机看得懂的语言。 那么我们会发现我们这里的 unit 的 加载器里面加载的模型里面的图像信息以及文字信息,那么我们 clip 的 文本编码器里面的图像信息,最后被编码为数字信息之后,都要传向哪里?是不是都要传向我们的 k 裁样器,对吧? 那么在 k 采集器里面呢,他就会进行一个信息匹配,那么在这个信息匹配呢,他就会先读取我们里面的这个我们输入的文本信息,他就知道,哦,原来我们需要的是一个人的手,对吧?拿着一张照片,那么这个照片里面有什么内容?然后背景是怎么样的,对吧?然后他再一一的去匹配 我们大模型已经有的一些图片信息,他就在这里面图片进行一些采样,他就知道,哦,原来我要生成的,根据他这个提示词去生成的图片,我应该采取哪些数据,对吧? 这个猫耳朵应该长什么样?哎?这个人的这个裙子应该长什么样?这背景应该长什么样?然后一一把信息采取完之后呢?他就会把信息给到我们的 ken layten, 那 么这里的 ken layten 其实就相当于我们人类在进行作画的时候的一个画布,可以明白啊,对吧? 然后他会根据这些信息在这个画布里面进行作画,然后这个作画他画的大小是多少呢?这里就是我们设置的了宽高就是一千零二十四乘以一千零二十四,那么这个画布给他的也就是一千零二十四乘以一千零二十四, 那么它就在这个画布之内进行作画,然后画完这个画之后,它再次返回给我们的 k 彩样器,然后再给到我们的 ve 解码。 那么为什么需要用到这里的 ve 解码呢?因为前面这里有个 ve 加载器,这里的 ve 加载器其实属于一个 ve 编码的一个范畴, 它会把我们所有的一个信息量匹配完之后,转化到空内存里面,作画的时候,我们这个 ve 是 需要在这空内存里面进行压缩空间的。那么什么是压缩空间呢?就是我们原先在这一整套工作流里面,你会发现如果我们直接用一千零二十四乘以一千零二十四的尺寸给这个工作流这一个 ai 进行作画的话, 其实对它来说这一个参数量是太大了,对吧?那么越大的参数量,它所要运用的算力也就越多,那么它所要占用的 gpu 显存也越多, 那么我们这个作者就想出一个方法,他用一个 v a e 的 模型,把我们一千零二十四乘以一千零二十四的这一个图像,他在 comulate 里面先压缩到六十四乘以六十四, 那么我们的 ai 就 在六十四乘以六十四这个大小里面进行一个作画,然后画完之后,最后再由 v a e 解码给它释放到一千零二十四乘一千零二十四,再给我们呈现出来,又是我们人类看到的语言了,这是一张图片,是非常的简单易懂,对吧? 那么这里还有另外一个再生的一个小模型,那么这个小模型呢,其实他是不属于这个工作流的,但是我们的摩擦社区里面,他确实让我们把这个 lara 模型也下了下来。那么这个 lara 模型呢,我给同学们试了一下,它主要的作用是增加我们图片的一个细节用的, 那么这个 lowra 模型它到底是怎么样起效果呢?我们简单的用两个框去给大家做一个比喻,比如说我先新建一个框,然后把这个框给它放大一点,然后我们再建一个框,那么这个框呢?就这么小,那么这前面这个呢就属于大模型,也就是我们这里 unit 加载器加载的 diffusion model, 那 么我们这里就用 unit 去代表,那么下面这一个小模型呢?就相当于我们这一个 lowra 模型,对吧? 那么这个 lora 模型是怎么起效果呢?我们会发现我们这个 unit 的 模型后面的线是连接给我们的 lora 加载器的,对吧?也就是说我们这个 unit 模型去加载我们的图片信息 以及打标信息的时候,我们要去到 k 采集器这里的信息处理中心的时候,我们是不是要先经过 lora 加载器,对吧?那么我们既然要先经过 lora 加载器,那么这个 lora 加载器就可以在这里面做手脚了。什么手脚呢?就是我们可以看到 lora 其实它属于一个非常小的一个体量,我们的 unit 属于一个非常大的一个体量,对吧?我们的 unit 里面有非常多的信息,在它经过我们 lora 的 时候,那么我们 lora 的 通道就变窄了,有没有发现,对吧? 那么通道变窄了,那么所经过的信息就会变少,但是这个变少的这一个信息就要由谁决定,由我们 lora 决定我们这个 lora 里面练的模型是怎么样的,那么它经过的信息就应该是怎么样的。 比如说我们这一个 lora, 现在这一个不是增加细节的一个 lora, 而是一个动漫模型,对吧?好,它现在属于一个动漫模型,那么我们这一个 unit, 比如说它现在属于一个混合模型,那么混合模型是什么意思呢?就是说这个模型里面它既有真实图片的参数,也有动漫图片的参数, 那么当我们这一个 unit 的 模型里面的信息经过 lora 的 时候,那么 lora 由于是动漫模型的信息留下来,然后把真实的信息给它去掉,或者说给它冻结住, 那么我们流向 k 采集器里面的这些信息呢?更多的就是动漫模型的信息,那么最后它在生成图片的时候就会更加的动画化,可以明白吧这个 lora 模型其效果,那么它主要就是起到一个缩小通道, 以及哎冻结住前面大量的信息的一个效果,可以这么简单的一个理解,虽然说大卫老师可能讲的不准确,但是他的基本逻辑大概就是这样子,那么我们这里也可以看到这里还有一个模型参照算法,对吧?那么这个东西是什么呢?就是我们可以用这一个模型参照算法里面的偏移值去让我们这里面的信息变得更加活跃, 那么这个活跃是什么意思呢?我们可以把这个活跃给他说成是一个自由度,也就是说通过这个模型彩样算法这一个节点之后的所有信息,再来到我们 k 彩样器再进行深图的时候,他的自由度会更大,那么他生成的图片会更加具有不确定性, 那么这个不确定性呢,其实是可以为我们图片增加光彩的。那么还有另外一功能呢,就是他能够使深图的时候更加的稳定,不会使他混乱,或者说生成多手多脚的一个情况,那么这就是我们模型彩样算法的一个功能了。 那么这里最后呢我们再看一下我们 k 彩样器里面有的一些参数,然后 k 彩样器里面我们可以看到这里有种子数,对吧?种子数其实对应的就是我们的图片都会有一个对应的种子数,那么相当于他的一个身份证吧, 然后这有一个运行后的操作,运行后操作呢我们可以固定,那么就可以固定上面这个总个数,其实这张图片他就基本上永远的不变了,然后我们也可以随机,我们一般都是选择随机的,那么这张图片也就会一直的改变,就会起到一个抽卡的一个效果, 然后这有一个步数,那么步数呢就是我们绘画的一个步骤,那么这里呢 z m g turbo, 它是用九步,它就可以把这张图片给它画出来了, 那么有一些模型呢,可能需要用到二十步,那么另外呢这一个 c f g 是 什么意思呢? c f g 就是 对于我们这一个提示词的一个参考程度, 那么由于我们的 c f g 调低就可以了,调到一,那么就能起到一个很好的一个效果,那么这个也是官方给的一个参数,我们一般不去变它, 然后我们的彩样器和调度器呢,有这个我们去设置它,它都会影响到我们图片的一个输出效果,但是哪一个出图效果会更好呢?这个就要同学们自己去探索了, 但是官方呢给的是 ula 加 simple 的 一个模式,这个我们一般也可以不去改变它,然后降噪是什么意思呢?那么降噪这里我们就要说到一个概念了,就是我们的这个深图模型其实是属于一个扩散模型的时候,其实它是属于一个反扩散的一个过程。 那么什么是反扩散?我们再举个例子,比如说,哎,我这里现在属于一个空 later, 对 吧?也就是我们的白色画布,那么在这个白色画布里面呢,它并不像我们人类世界的白色画布,它完全是白色的,那么这个白色画布里面它有许许多多的灶点,那么这些灶点主要是由哎红色、蓝色、黄色、绿色这些颜色组成,对吧? 但是这些粒子一个一个灶点的粒子,它分布是不均的,那么在分布不均匀的情况呢,我们就需要把它变得均匀。 那么在这一个扩散模型,也就是这一个 unit 的 模型,在 z image turbo 这一个模型里面,在运行的时候呢,它就会把这些散乱在这个画布里面的这些粒子给它进行一个收缩,那么从一个松散的状态变成一个聚拢的一个状态, 那么它在收缩的时候呢,你就会发现有一些颜色的粒子,它就会叠加,就会叠加出它原来没有的一种颜色,然后它越叠加越多呢,它就可以在这些地方把它处理成为一个一个一个色块,然后这些色块拼接起来之后呢,就是我们现在看到的一个图片了, 比如说哎,他在这里聚集了很多其他颜色的,然后组成了这一个蓝色,他在这里呢又聚集了很多颜色,组成了我们的一个什么,组成了我们的一个肉色,对吧? 那么通过这种组合的方式呢,我们就把它叫做反扩散,就是把扩散在外的一些散乱粒子给他聚集,就叫反扩散,对吧?所以我们叫做扩散模型。那么这个降噪呢,也就是代表了我们要去掉一些没用的噪点,然后把有用的噪点留下来,再把它聚拢的一个过程。 如果说这个降噪幅度比较低的话,我们可以看一下它的一个效果,那么我们就可以很明显的看到它这些色块是不是乱七八糟的,那么就是一个没有聚拢完的一个效果。那么在降噪零点五的时候,所以我们这个降噪呢,把它调为一属于一个纹身图最好的一个效果。 那么简单的讲完这个基础之后呢,我再带大家来搭建一下工作流,那么基本上这工作流我们看一眼之后基本上就熟悉了。那么首先我们就要三个模型加载,对吧?那么第一个就是我们的 unit 模型加载器去加载我们的大模型,也就是有很多训练参数的一个大模型。 第二个呢就需要我们 clip 的 加载器,用来识别我们后面要填写的提示词,对吧?然后再来一个 v a e 加载器,用于压缩我们 comlatent 的 一个空间。 那么有了这三个模型之后呢,我们就可以通过拖拽的方式把其他的节点给它召唤出来,比如说可控加载器,后面跟随的应该是我们的文本编码器,也就是说我们输入提示词的一个地方,对吧? 那么文本编码器呢?我们有两个分成了正面条件和负面条件,所以说我们还需要再从这里拉出来一条线放掉,作为我们的负面条件。然后我们的 unix 加载器呢,我们可以拉出来一条线给它放掉, 可以看到他直接转接的就是我们的 k 彩样器了,对吧?但是 k 彩样器中间还少了两个其他的一个增加效果的节点,那么一个呢,属于我们的 lora 模型加载,我们可以把它复制过来,那么另外一个呢,属于我们的模型彩样算法,对吧? 那么这里呢,我们就把我们的 unit 加载器的点先给他在 k 彩样器这里断开,先让他经过我们的 lora 加载器,让他留下我们需要的一些细节信息,然后再给到我们的模型彩样算法,增大他的一个火力, 然后最后再给到我们的 k 采集器,让它进行一个信息的匹配,那么这里的信息匹配呢?它是跟谁匹配?是不是跟我们输入的文本进行匹配?所以我们也需要把文本连接到 k 采集器里面去, 那么分别把正负面条件连接进来,那么我们在进行作画的时候呢,我们也需要给它一个白色画布,就需要一个空 latent, 那啊空内存有了之后呢?我们最后需要怎么样在这里画完画之后,画完画之后,我们是不是要把里面的这一个空间给它释放出来,那么释放出来呢?我们就需要用到 ve 解码,然后我们把这个空间解码出来,然后我们要解码它呢,我们也需要用到前面的这一个 ve 加载器里面加载的 ve 的 一个功能,给它进行一个释放好, 然后最后再来一个保存图像或者预览图像,就可以把这个工作流搭建出来了,是不是非常的简单?那么这里的底层逻辑你弄懂之后呢?哎,也是非常有益于你后面的一些工作流的搭建的,那么我们这节课的内容也就那么多,如果小伙伴们觉得大宇老师讲的不错的话,不要忘记一键三连哦,我们下期再见,拜拜!