粉丝196获赞1262

嗨,来,过来我这里,今天学 ltx 二点三图声视频。今天我们来搭建这个图声视频工作流,这个是原图 双击,在这个对话框输入 unit, 它有两个加载器, 这两个加载器是什么意思?一个它只能加载 g g u f 的 模型,比如这个后缀是 g g u f 的, 另一个加载器,它只能加载后缀是 saturn 的 这个模型,它这里是没有 g g u f 选择的, 这里是有 gguf 选择的。我们先按双击空白处输入双 clip, 还有一个双 clip, 再最后方输入双红。 如果你显存小,就用这个 gguf 的, 如果你显存够,就用这个 unik 的, 它们是一块的, 那么他们两个模型生成的视频有什么区别?我们现在看一下。左边是 seven 生成的视频,右边是 g g u f 生成的视频, 可以看一下对比。嗨,过来我这里,我们今天学 l t x 二点三图生视频。我们现在在看 g g u f 的。 嗨,过来我这里,我们今天学 l t x 二点三图生视频。两个其实差别都不大。 clip 加载器加载的是这个 clip, 如果用 g g v f 的 加载 clip 也是一样的。有了 unit 加载器和 clip 加载器,我们还需要两个 ve 加载器,双击空白处,输入 ve 加载, 选择这个 ve 加载程序, ctrl 加 c 加 v, 复制两分,选择加载 ve。 我们在这个可立普后面还有一个线,把它拖出来,选择文本编码器 粘贴复制一份,把这个线连接好。如果你想使用 g g u f 的, 用 shift 这个线把它连接到下面这个加载器上, 再再使用下面这个 g g v f 的 加载器,再把这个模型拖出来,这里输入权重,选择这个权重洛拉,这个洛拉可以一次性加载很多个, 比如这里可以加载好几个洛拉, 也是一样的。如果你想使用上面这个加载器, shift, 选中上面这个连接点就好了,一定要按,一定要按住 shift, 如果你直接拉是拉不住的,按住 shift。 现在我们加载两个洛拉, 这是第一个洛拉,这是第二个洛拉,它们的权重设置零点五就好了。 这两个 luna 有 什么用呢?第一个 luna 的 lincoln 是 代表图像的一致性,就这个。第二个 vb vr, 这代表它训练的极。 第三个这个 lv, 这代表它是为图跟视频专门训练的模型。第四个三九零 k, 这个是训练步数。第四个 r 三十二,这个越小越好,这个全程是让镜头更加丝滑。这两个文本编码器 是输入正面提示和负面提示词的,负面提示词可以输入,这个正面的提示词是根据你的图片生视频所要的提示词再去输入。当你输入好提示词之后,他这个权重可以选一,可以选零点五,他们有什么区别? 可以看一下左边这个是权重一,右边是权重零点五。 嗨,过来我这里,我们今天学 ltx 二点三图升视频, 来看一下零点五的嗨,过来我这里,我们今天学 ltx 二点三图生视频,他们两个还是有很明显的区别的,如果权重调高了,他这个视频我们今天学。看到没?我们今天,我们今天他这个脸部,脸部有残影, 我们今天学,嗯,那一秒的时候有个残影,我们今天学,所以说这个权重 不用调这么高,调,零点五就差不多了,我们在权重罗拉这里有个模型,点击模型缺口,在这个地方输入 a s 键,选择这个注意力补丁 a z 的 节点, 这个是加速,我们选择自动就好了。在这个注意力补丁这里有个模型,来点击它,这里速度,还有 ps, 选择这个分块激活,如果你是八 g 显存,这里分块就填四,下面就填二零四八, 这里方块越大,占用显存的越低的计算时间都会越长,这个维度域值就是更加的压低显存。如果你是十二 g, 你 就填二域值,这里就填四零九六。 我们在注意力固定模式这里有个模型,戳出来,输入基础的高度, 选择这个基础雕刻器,这个雕刻器我们选择这个,然后步数四步和八步就行了。那四步跟十二步有什么区别?这是跑两个步数,左边是四步,右边是十二步, 看一下四步,嗨过来我这里,我们今天学 l t x 二点三图升视频,再看一下十二步, 嗨过来我这里,我们今天学 lx 二点三图生视频,它这个画质真是很有区别的,像这个脸部, 但是生图的时间是有区别的,步数越高,生图的时间越长,一般这里设置八步就好了。 在这个文本编码器的有个条件,点击条件拖出来,输入 l t s b, 选择这个条件,设置上面这个是正向条件,下面是负面条件,把它连接好, 然后在方块激活这个节点,这里有个模型,拨出来 lts。 二,选择这个标准化注意力引导, 把两个负面条件连接上,这个节点是专门连接负面条件的,如果你搜索不到这个名字,就可以在这里输入 nig, 这里有个一样的节点, 然后这些基础参数保持不变,然后点击模型 l t s 二选这个彩样,预览 这个的作用。就在你运行视频的时候,它会出现一个框框,这个框框是以低分辨率的形式出现,可以让你看到这个模型,它在运行到一定程度的时候出现,可以让你看到这个模型。插槽输入自定义, 选择这个自定义彩铅器,如果你不用这个模型就可以给它删除掉, 这里要说的是种子,种子可以随便填一个,这里选择固定 cf 橘子就是参考你的提示词, 一般是一到三,有什么区别呢?当你用了这个与彩铅结点,它在自定义彩铅器这里会出现一个框框, 这个就是预览框框,如果你觉得这个模型截的词跑的不对,就可以把它取消掉重新跑,如果是屏蔽了这个节点,那么你在运行的时候, 传感器这里他就不会出现这个预览图像。现在我们看一下对比 cf 居值三的和 cf 居值一的,现在我们看三的嗨过来我这里,我们今天学 i p x 二点三图升视频, 现在看一的嗨,过来我这里。我们今天学 ltx 趣点三图声视频,这个就是其实你的 cf 剧值越高,它会参考其实越多。现在我们连接一个正面条件,一个负面条件, 把这个正面条件连接,负面条件连接,还有基础调度器的复苏连接上, 在这个输出口拖出来,输入 l t s v 音频,选择这个音频分离, 在这个音频这里拖出来,输入 l t s v 音频,选择这个音频解码,再点击它的画面,拖出来,输入 ve, 选择这个 ve 解码分块。这四个参数只用调这个时间尺寸,调到最大, 调到最大就是一次性解码,如果你分批解码,它中间会产生闪烁,在 ve 解码分块这里点击它的图像,在这个对号框这里输入创建视频, 选择这个节点,把这个音频连接上视频输入口这里点击它,这里有个保存视频 视频格式,这里选择 a p 四编码,选择这个,这个就是视频的名字。我们在可立普文本编码器后面双击空白处输入加载,选择加载图像 这里选择你要加载的图像,在图像这里拖出来,输入图层工具,选择这个图层工具一二, 在这个试验模式这里选择裁剪,在这个倍数这里选择三十二。若放置边长,选择最长边,你是八 g, 就 输入这个,如果你是十六 g, 就 输入幺二八零, 这是它的宽度和高度,我们点击它的宽度,这里输入空 l t 叉,选择这个,再把这个高度连接到 下面,这个是时长,时长就是秒数,我们在下面这里输入整数量,粘贴复制一份,双击它的名字,输入帧率 这里输入秒数帧率这里填二十五秒数,这里减五,点击它的值,拖出来,输入简易运算, 粘贴复制一份。上面的值连接到 a, 下面的值连接到 b, 下面的值连接到 a, 不要连错了。上面的值这里输入 a, 下面的值,这里输入 a。 乘 b 加一,都可以把下面这个整数连接到时长这里,在条件设置这里还有一个帧率, 我们把上面这个减一运算的符点连接到帧率上,不要连错了,不要连在下面这个连接上面,这个给他改个名吧。一二,把一的符点连接到设置条件的帧率这里, 然后在缩放这里有个图像,拖出来,输入预处理, 选择这个预处理,预处理这里输入十八,下面的空 laten, 这里还有个 laten 节点,拖出来,输入 fps 视频,选择这个, 将图像转为视频,把这个图像连接上这个默认参数保持不动,再点击这个插槽。 l t s v 合并, 选择合并为视频,在合并为视频这里还有一个音频内存,拖出来这里输入 l t s v 音频,选择音频控内存有个帧数和一个帧率,把它放到这里, 把上面的一连接到帧率,把下面的二连接到帧数。现在我们就连接这个 ve, 这是 audio ve, 视频的是 video ve, 找到两个 ve, 下面是 audio, 把它连接到音频 video, 把它连接到视频, 这样任意的连接完成。 嗯,这还有个帧率没连接,把一的符号点连接到它的帧率,我们现在输入正面体式尺,我们测试一下这个体式尺是否能用。点击运行,现在我们搭建好后,伸头把视频看一下, 恭喜自己搭建完成。 ltx 二点三图声视频 工作流运行成功,没有问题,这个是提示词,如果你提示词写错误的话,他生成的视频是不好的。

如何用 coffee ui 等开源软件完成一部 ai 短剧的制作?大家好,我是程序,欢迎来到第九期。今天我们详细讲解一下 ltx 二点三的工作流,包括纹身视频、头身视频、音乐声视频和手尾帧等, 同时讲解它对电脑配置的要求,必要插件和工作流优化等内容。内容比较长,请大家先点赞、收藏加关注。好,现在我们来到 coffee ui 的 界面, 还是一样,我们依然是选择官方的工作流。首先我们点击左边的模板,然后点进来以后找到视频。好,第一排最右边这个是他的图声视频,这个是他的音乐声视频,再往下拉,这是纹身视频, 这边这个是首尾针。那么今天我们主要以这个音乐声视频来详细讲解一下,我们点击它的工作流,大家看到左边这里是它的模型文件,包括 check point, 其实这个是颗粒布,这个是他的一个放大模型,他的工作流是采用双彩样,下面这是他的模型文件存放地址。好,我们现在看到这个工作流,他把 所有的工作流全部隐藏了,那么我们只需要把它进行解压出来,先把它拖到边上去,然后在这里右键选择解包工作流,这个时候才是他的整个工作流的真面目。好,我们现在看一下,这是他的一个图像加载区域,这个是他的音频加载区域, 这里整个是他的模型文件加载区域,毕竟他是有音频的,所以说他要比我们平常的工作流要复杂一些。这里可以输入我们的提示词, 这里设置我们的尺寸,包括这是这里是帧数,这里是时长,但是呢他这个工作流啊还是需要改造一下才能用,那么我就不展示我们的改造过程,我们直接展示我们改造结果。好,这就是我们改造的结果。 大家可以看到这个红色的节点要么是替换的,要么是增加的,比如说第一个,第一个这个是我们的音频裁剪,比如说我们输入一整段的音乐,他长达四分钟,实际上我们的视频也只能出二十秒或者三十秒,那么这个裁切工具就特别有意思,比如说我这一段视频结束时间是五十三秒, 那么下一段视频我们可以从五十二秒开始,然后再跑二十秒,然后以此类推,直到把我们这个四分钟的音频全部给他跑完。然后这个节点是预览,是用来展示我们当前所裁切的这个部分,然后这个节点就是图像压缩的节点,它这个节点还是比较好用的。 再来到上面是两个 lra, 第一个 lra 是 vbvr, 它是一个奖励, lra 对 我们视频生成这个动作是有很好的引导作用。然后后面这个 lra 是 一位大佬所开发的,它是专门解决我们 ltx 二点三 在生成视频,当在讲中文的时候,他有可能出现字幕,而且字幕还是乱码,那么这个解决方案有三个。第一个方案就是我们所有的提示词可以用英文来写,再加上我们叫仙侠的这个 lo ra, 然后再加上 k j 的 这个强制负面提示词, 因为我们这个工作流它的 c f g 值是一,所以在当 c f g 为一的时候,它的负面提示词是不生效的,我们加这个节点是强制它负面提示词生效。所以说我们一共用三种方案去解决它带字幕的问题,这里是模型加载区域,然后这里是 参数区域。这两天我在测试过程中,我发现我们尽量用幺二八零乘七二零的这个尺寸去生成我们的视频,这样的话能够保证我们的视频画面不会崩,当它的尺寸越高,它的效果越好。 然后这里是我们的彩样器,我是选择这个 c f g 的, 好像效果还是比较好的。现在我们来看一下之前我测试的时候生成的一段 mv, 就是 这个视频,它是直出七二零 p 的, 我没有进行任何的再次放大,大家先看一下它的效果, 这是一个二十秒的视频,效果还是很不错的。这个二十秒的视频用时是十分钟,过一点六百三十四秒,那么上一段生成他的结束时间是五十三秒,那么我们再生成下一段二十秒的视频,我们可以在这里把它写成五十二, 这里设成一分十二秒,刚好二十秒。那么当我们把整个视频伸出来,我们剪辑的时候,实际上我们要把它的原声关闭,用我们自己加载的原声,这样的话我们能够保证我们的音效不被污染,但是我们可以听一下我们这个原声效果怎么样。好,我们把它拉到三十三秒,然后我们听一下原声的效果是怎么样的, 非常不错,我们原声效果要比他刚才输出的效果是怎么样的,我们再对比下他刚才输出的效果, 音质确实有污染。现在我们在生成下一段的时候,我们再添加一个加速节点,双击,然后这里输入 set 好, 我们添加这个节点,这就是我们之前安装的 set 的 touch 二点二,他对我们的视频加速也是有效果的,但是我之前为什么不用呢?因为我的配置还是够的,所以说任何加速他都有可能对本身的画质有所影响。所以说我之前是没有添加,但是现在为了提速,我们可以尝试用它一下, 然后我们可以选择 cedar tension f p 十六库达的这个,然后我们把线给它连上,它就连到这里, 就连到这里,这样的话我们的连接生效。对了,我们这里还有一个非常重要的节点,就是这个东西,它这个节点就非常厉害了,尤其在这个工作流程链路生成过程中, 当工作里有完成某一段工作的时候,把它的这个模型文件和它所占用的内存显存全部给它卸载掉,然后再进入下一阶段的一个工作,这样的话减少我们的电脑负荷,甚至如果没有它可能到下一段,比如说这个 ve 在 解码分块的时候 有可能就爆掉显存或者爆掉内存。好,现在我们开始运行,看我们加了这个散热器以后,它的运行是多长。在它生成过程中,我来给大家介绍一下我们的内存和显存占用情况。大家可以看到这个内存已经爆到五十三 g, 而它的显存也只是二十二 g, 如果大家内存和显存不够高的情况下,可以适当降低它的分辨率,比如说这里可以设置九六零乘五四四,整个生成完成以后再进行一次高清放大,实际上目前我们直出的七二零 p 也是需要再一次进行放大,发达到幺零八零 p, 然后我们才可以用 好。在它的生成过程中,我们介绍一下它对我们的电脑配置的要求。它这个 f p 八的模型文件接近二十七个 g, 如果选存 小于二十四 g, 基本上是没有办法跑的,但它专门有一个针对五零系显卡的,只有二十个 g, 那 么那个模型文件我们的 十六 g 显存也是能跑的。其实内存我感觉至少要有个六十四 g, 要不然这么多模型文件根本加载不下。那么当我们显存比较低,比如说十六 g 或者十二 g 的 时候,那我们可以选择它的这个 g g u f 量化模型, 只需要在对应的位置输入它的 g g f 模型文件,然后把它的线给它连上,把这个加载器和替换掉就可以了。 包括下面这个克里普加载器也一样,我们可以选择 g g f, 但是无论显存多大,我觉得内存都应该超过三十二 g, 这样的话跑它应该没有什么压力,包括我目前跑这个工作流,我的六十四 g 内存也是勉强够用,如果我去跑三十秒的视频,可能也会包内存 好。生成完毕,我们看到是五百七十六秒,看来加了这个三者胎神,他只是提升了一分钟,比原来六百三十四秒提升了不到六十秒。我们现在看一下它的效果,这是紧接着前面一段音频的,后续的二十秒我们听一下, 大家可以看到我们这个是没有字幕和乱码的,看来我们的策略是行之有效的。好,接下来我们讲一下我们的核心的插件,要想运行这个 ltx 二点三,有几个插件是必须要安装的,我们点开 manager。 好, 现在看一下我们所有安装过的, 这里输入一下 l t x。 好, 这两个插件是必须要安装的, l t x video, 再加上它的这个插件,然后再看一下,我们还会遇到像电脑显存较低的情况下,要用到 g g u f, 这个必须要安装,还有这个 layer style 也是需要安装,包括 k g n l 子。 好,基本上就这些,那么现在这个音乐生成视频我们基本上都讲完了。 ok, 接着我们去看纹身视频,还是一样点模板视频。这里,好,这是我们的纹身视频,我们先把它的这个工作流解压出来,我们直接按照他的默认提示词。好,我们点击运行。好,生成结束,我们看一下效果,用时一百七十秒,不到三分钟, 挺不错,那么我们这样找豆包给我们一段提示词,把时间设置成十秒,它的时间在这里。十,好,我们现在得到了一组提示词,直接给它粘贴进来, 但是生成之前我们这还要加个东西,就是这个东西是防止它报现存给它连接上,然后我们开始运行。 这个工作里,我目前除了他没有进行任何改造,实际上我只是演示给大家看一下效果,这里面要改造无非就是给他夹老软,再就是限制他在输出的时候有这个中文的乱码字幕。这里还有一个细节啊, 当我们直接托官方的,无论是图声视频还是纹身视频,或者是这个音乐转视频的工作流,他不能够直接使用,我们要用的时候,我们要在这里把这个帧率的这根线给他连到这个 b 点上,然后我们的工作流就正常了。 好,出来了一个十秒的视频,我们现在看一下它的效果。 还可以,因为没有加这个 v b v r 这个奖励老软,所以说它的效果好像不是很好。 好,接下来我们看一下我们的图示视频,还是在模板里面找,这是图示视频,我们点进去一样给他工作流程解压出来时间,我们设十秒吧, 加载一张图片,随便输入一段提示词,一个男人在说话,这是他要说的话,然后我们点击生成。好,生成结束,用时是二百八十五秒,我们再看一下它的效果。大家好,我是陈旭,我们是博主的 ai 扎势产, 因为是十秒的视频,我给的话术太短了,然后导致他的语言混乱。好,我们又重新给他写了一些话术,再次运行一下。好,这就结束,我们再听一下它的效果。大家好,我是陈旭,一个 ai 形象,我还有一个搭档,他叫希然, 他这次是动作夸张,还有字幕,不过整体效果还不错,因为他脸一直没有崩,环境也没有崩。好,现在还有一个工作流没有讲,就是我们的首尾针,工作流好,点进来。好,我随便加载了两张图片提示词,我们改一下,他端着咖啡走到窗前, 一样工作流我们就不去更改了,直接用他试乘,这里有做一个十秒吧,五秒太短了。好,试乘完毕,我们看下效果, 这是在没有加任何奖励 lara 情况下跑成这样的一个状态,我觉得也还能接受,而且我们的提示词特别简单,什么都没有,那么真正要跑出好的视频还是需要在提示词下功夫 好。我们今天一共介绍了 ltx 二点三的四套工作流,第一个是纹身视频,第二个是图腾视频,第三个是音乐声震视频,第四个是首尾针视频, 而且他的能力是可以做到三十秒左右的一个视频主要是看我们的电脑配置,其实如果内存够大,我估计跑个一分钟视频应该也是问题不大。然后接下来就是我们的小浅层,用户可以选择把它两个替换成 g g f, 然后再就是我们的生成字幕的一个限制,再加上我们的一些奖励 l r, 让他动作更加连贯 和更加符合逻辑。然后再就是一些细节上的调整,比如加上一些我们清华村的一个节点,还有包括可以裁剪音频的一些小的节点,这些东西都很有用的。我们整个 coffee ui 的 全流程到这里也基本上讲完了。 接下来每一期我会给大家做一些具体的,包括视频呀,包括音频呀,包括图片的一些效果,然后给大家展示,那么今天的演示就到这里感谢大家观看,我们下期见。

哈喽,各位同学大家好,欢迎来到数字折叠,那我们之前的本地 ai 视频生成的课程用到的大模型都是万二点二, 但是万二点二的话呢,他就只能到二点二了,他有二点五,二点六也不会给大家本地开源使用了,是要去做一个线上的收费的。就在大家认为这个开源模型将要进入到一个停滞不前的阶段的时候, 咱们的 l t x 啊,这一家以色列的公司给大家开源了二点三的视频生成模型,那 这个模型相比较于万二点二,它有一个比较大的优势啊,它是可以音画同出的,也就是说我们可以出来一个完整的带有声音的 画面的视频,不用我们后期再去重新给它对口型做这个音频的一个合成了,非常的方便,也比较符合现在的一个 ai 的 视频生成的一个趋势吧。那么我们如何去使用它?对于电脑的要求是什么样子的?我们如何在本地成功的去部署它,那这节课我们就要给大家去讲了。 那首先我们来看一下啊,我使用这个 ltx 二点三制作的一个小效果吧, put your hands on the arm here open your legs not too much there you'll see why i like that very much do you want me back? ok, 那 大概就是这样的一个效果,我们可以看到它的分辨率是很高的啊,我在后期对它进行一个放大,但是我们一次就可以直出一二八零乘以七二零分辨率的视频, 并且的话呢,我们这个视频的帧数率是支持二十四帧或者二十五帧每秒的,它的时长也可以达到十秒甚至以上,对显存的要求也没有那么大,我使用的是 四零八零十六 g 的 显存,然后六十四 g 的 内存就可以跑这个效果了。那如果你的电脑比我还好,我相信它可以在一分钟之内就可以跑出一个五秒钟的视频。 如果你是十二 g 的 这个显卡的话,你可以试一下,因为我没有试过啊。那如果你的内存比较低的话,你也可以设置一个虚拟内存,这样子就会让我们的这个跑起来没有那么大的内存的压力。 那我们看完效果之后,我们来看一下怎么样一步一步的把这个效果给它复刻出来。那我们第一节课讲的就是工作流的部署, 如果你从来没有使用过 comui 的 话,你还需要先去下载我们的 comui, 然后再去给制作我们的 ltx 的 模型的工作流。 如果你不想去折腾啊,你不想一遍一遍的又配置环境,又要用这个代码去调配拍摄的各种模块,还要自己去下载工作流,安装插件,然后优化节点, 解决报错,这是所有的非程序员出身的人来去使用本地 ai 的 时候遇到的问题。那么我们数字折叠给大家提供了一套完整的开箱即用的软件,就是 comui 的 整合包,加上我们的这样一个 e f studio 的 工作流操作工具。如果你是我们输入折叠的会员的话,你可以用我们这个工具,如果你不是会员的话,你可以直接用我们的 comu i 自己去部署这个工作流。那么我们来看一下一步一步的一个操作过程。 首先的话呢,我们的 comui 整合包是可以在我们的网站上去下载的,我们首先可以进入到课程这个页面,在我们的课程页面里,我们点进来这个 ltx 二点三的课程的主页,在课程主页里面我们可以看到这边有一个这个配置链接, 首先第一步你就去点击这个 comui 的 整合包,把这个 comui 整合包下载下来,我们现在使用到的是这个零点一六点四的版本, 里边的环境是库达十三加拓十二点九,也就是说你首先要去升级你的这个显卡驱动,能够支持我们的库达十三,然后呢再去安装我们提供的库达十三点幺的这个库达驱动, 那么我们这个详细的部署的视频是在这里的,你可以到这里去下载部署一下,只不过我们这里边是十二点八,你只需要把我们的库达变成一个十三点一就可以了,如果你不是三维用户的话呢,那个侯蒂尼的安装你也可以自动的给忽略掉啊,就前期先去适配一下这个库达环境, 然后下一步的话就是安装我们的整合包,然后把它解压出来,放到指定的位置,就可以把这个软件打开了,下面给大家去看一下如何去打开咱们的这个软件啊?在你没有安装 cd 的 情况下呢,你进入到我们的 comfui 里面, 然后双击我们这个英伟达 gpu 的 bat 脚本命令,就可以把我们的 comfui 给启动起来了, 在启动的时候的话呢,大家可以再继续去下载第二个东西,就是我们的 d f studio, 我 把所有的工作流都配置好放到里面了,那这个 d f studio 的 下载链接的话,也可以直接去打开它 到这里去下载就行了。那它的一个部署的话呢,你可以看我这边这一个县城文学的课程, 这个课程上面的话呢,我们的第二节有一个部署的教程,你只要把这两个东西部署完,后面你就非常开心的去玩我们的 comu i 在 本地可以零成本的去制作各种 ai 的 一个效果了啊,这是我们的一个前期的部署, 如果你是老用户的话啊,你可能之前已经安装了我们的这一个数字折叠的 comui 整合包了,只不过你的整合包目前不是十六点四或者不是扩大幺三的系统,你就根据我们的下面这个部署教程去重新的升级一遍就可以了,你就不用再去安装其他的环境了,只需要去替换一下里面的这样的一个 is embedded, 还有我们的这个插件,还有我们的本体就可以了。那替换完之后,再把你老版本里面的你之前下载的囤积的一些大模型给它直接剪贴到我们新版本的模型文件夹里面去就可以了,这是一个比较方便,不用折腾环境的升级方式。 那现在我们看到 comui 已经打开了,那我们就直接进入到咱们的 df studio 里面去吧,我们打开我们的控制软件。 好的,现在这个控制软件我们就已经打开了啊。首先我们点击这个视频生成,里面我这边提供了有三个 l t x 二点三的工作流,分别是音画同出的图声视频,还有音画同出的文声视频, 在这个声音生成里面还有一个自定义音频的一个 l t x 二点三的图声视频的这个工作流,这三个工作流是我们要用到的, 我们今天先要给大家去讲的是这个 l t x 二点三图声视频,就这个咱们的工作流,那在去使用之前,你要下载 l t x 二点三的模型啊,我们可以直接点击查看介绍, 我们进入到这个介绍页面,我们可以看到这边有一个模型下载的链接,看到没有,你直接点击模型下载链接这边我就提供了我们的这个三个工作流共用的 一个模型,就一套模型系统吧,它的一个文件的路径我也给大家在这里梳理出来了,比如说在 models 里面,然后 different models 里面下载这一个可立普里面下载这一个 ve 下载这俩,是吧?还有放大模型,然后你就直接可以点击这个百度网盘啊,我们这个模型都是 开源的,免费分享的,在别的地方下也是可以的,没有关系的啊,那我们进入到这里面去之后的话呢,那我们就可以看到了啊,这个可立普文件夹,什么 different model 文件夹,给大家说一个技巧,我这个文件夹的名字啊,比如说可立普,就是在我们的这个 comui 的 model 文件夹里面,我们找到 model, 这里面也有一个可立普啊,你就放到同一个文件夹里面去就好了,就把它下载到这里面, 那相同的,就比如说是我们这个 latent app skill model, 那 你就找到我们 comui model 文件夹里面的相同的 latent app skill model 文件夹,然后把它给下载下来就可以了, 按照我的这个方式把这里面所有的模型下载下来,就可以使用它了。那我们首先的话点击使用该工作流,我们在使用的时候可以先创建一个工程,如果你有新的工程就直接打开就行了,比如说我们就放在我们的 l t x 二里面吧,然后这个名称的话,我们就叫做演示吧。 ok, 我 们创建一个演示的工作流,创建好之后呢,我们就选择这个图声视频的工作流,点击使用工作流就可以了。 然后我们可以先创建一个图像,那这个是我们默认的图像,那我就生成一个新的图像吧。比如说我们在工作流里面,我们选择另外一个工作流,图像生成的工作流,我们使用的是 z 妹子的这个纹身图,我们选择它就可以了。 然后我们这个图像我们创建一个古风女孩吧,一个穿着汉服的女生吧,这个的话是可以支持中文的,我们输入一个穿着古风汉服的中国女人 站在院子里,上半身特写, 就这样吧。然后我们的分辨率可以给到一二八零三七二零稍微小一点嘛。那我们这个保存路径的话,也可以放到我们自动创建的这个资产里面,你可以自己写一个文件夹,比如说叫做古风 这边的话呢,我们改变一下他的保存的前缀也行,让我们刷新一下历史记录,这个时候我们就可以执行了。那这个任意美指纹身图也是需要去部署模型的,我们之前已经部署过了,你可以看一下我之前的课程,我们点击一下执行就可以了。 好的,现在我们已经生成了,我们来看一下整个质量还是可以的啊,非常有这种古装剧的感觉。然后我把提示词的上半身特写去掉了啊,改成了面带微笑,因为只有上半身特写,他的面部没有那么完整, 那我就把它改一下,优化一下。那我们就可以点击一下标记啊,把这个图像给它标记出来,作为我们的一个图生视频的手帧图的使用用途。那下一步的话呢,我们就切换到 lts 二点三的图层视频工作流,把这个手帧图切换成为我们刚才的这个 mark 出来的图像就是它了。然后提词词应该怎么写呢?提词词其实是有一些要求的,那这个 l t s 二点三的这个提词词的格式,我们提供了一个反推工作流,就是说你把一些必要的条件给到它,把图像给到它, 它就能够给你一个适合 l t s 二点三出视频的这样的一个题词词啊。不是说你随便去写,可能随便去写出来的效果并没有那么好,那我们可以再去选择一个工作流,你看我们有了这个十六六软件之后,你就不用到处去部署工作流了,你就直接在这里面去选就行了。 那我们可以看一下,在文字生成里面有两个反推的工作流,另外一个是二点三反推的官方版, 这个是之前 lts 二的反推提词词,它的提词词是比较的完整,就是把画面也描述出来了。那这个是官方的 k z 流给到了一个提词词的反推方法,这个可能会更简洁一点,那我们就用这个官方版的,我们点击使用工作流, 如果你没有部署这个反推模型的话,你也可以查看介绍一下,看一下需要去下载什么模型。其实这个工作流里面所用到的那个模型跟我们二点三这个大模型是一样的,用到的是它里面的可立破模型,所以你就不用下载任何的模型了,直接点击使用就可以了。 那我们把刚才的那个图像给到他,就比如说这个图像,然后他的这个前置条件是有一定的格式的,比如说前面这一句是不用管的,就是让这个图像变成一个流畅的动作,然后这个主题你要改一下,动作你要改一下,场景你要改一下,如果自己改的话比较麻烦啊,你可以直接 ctrl 键加 c 键复制一下,然后我们可以进入到 excel gpt 里面去啊,那我们就进入到这里面来,然后把这个题词给到它,就是这个反推的格式,说修改一下这个这个内容 要求,然后我们就可以把下面的这些题目给到它,就是 subject 啊。这个主题是什么呢?一个女女人对着镜头打招呼, 然后再把我们下一个这个 action 再复制过来。说什么呢?说这个女人走到 镜头前,微笑着说,是吧?一日不见,如三秋兮, 这应该是一个文言文啊,就这样子,一日不见如三秋兮。 ok, 然后我们再去回车,然后这个盛世描述一下啊,盛世就是一个呃,古代的院落里, 这里就会触发他对环境或者声音的一些描述,然后点击给我们的这个大模型,他就可以把我们的题词给优化了,我们来看一下,他自动就去写了。 他给了两个版本啊,第一个版本的话他把台词也变成英文了。啊,这个我们要中文的,这个叫什么呀?呃,一日不见如三秋兮,我们复制一下,可以来去看一下啊, 粘贴是吧,让图像以流畅的运动变得生动起来啊。一个女人面对着镜头,然后微笑的说这个样子。好的,那我们就可以把这个反推的指令复制到我们的工作流里面去, ctrl 键加微键啊,如果大家觉得比较麻烦,可能更喜欢做在线的,但是我觉得,呃,如果你想要简单一键的东西可能就没有那么准确,如果你想要省钱,想要做的更专业,你还是要稍微的呃,用一些流程来去规划一下。 那这个最大制服就是说他反推出来有最大的一个反推提示词的长度啊,但是一般情况下是不会超过一零二四的,你就算给到一零二四,他可能反推到几百个就停止了啊。那我们这个路径也可以改一下, 他会给你一个提示词文档的,你后面可以发给别人,也可以自己去学习使用。那我们可以给到这个反推的文件夹里面去就可以了,这个就叫古风吧,然后我们就开始执行就可以了。 好的,我们现在已经反推完成了,我们可以看到这个提示词在我们的右边展示栏里面也展示出来了,我们可以直接 ctrl 键加 c 键,我们回到这个翻译软件里面来看一下, ok, 就 这样子的,你可以看到它又把我们这个中文给它翻译成英文了,这个我们到时候再翻译过来就可以了。 风格他先定义了,然后再定义动作。女人慢慢走向镜头,热情的微笑着,用舒缓的声音说,啊,什么什么柔和的中国传统音乐,然后与鸟儿的呃声音和远处的喷泉融为一体啊,就非常的详细吧。那我们就回到这个这边来, 然后呢我们就把咱们的这个题词给它粘贴过来,只不过你把这个他翻推出来的这个拼音再改一下啊,一日不见如三秋夕, 如三秋兮。好的,现在应该没有问题了,种子值可以随机一下啊。注意,这个是我们刚才那个音化同出的工作流,这个,这个是反推的工作流啊,他俩你不要弄混了啊,先去反推出提示词来,然后再给到我们的工作流, 然后时长五秒,五秒应该可以了,就默认五秒,帧率二十五帧每秒,然后宽度一二八零乘七二零。保存设置,这里就是你保存在我们的 alt put 里面的这个文件夹里面的。这个后面的文件夹和前缀啊,我们就叫做克拉斯演示吧, 这个不是一个绝对路径,大家注意啊,现在我们刷新一下工作流没有问题就开始执行了,那执行之前的话呢,建议大家可以到我们的 comui 里面啊,你可以去清理一下这个内存,清理一下缓存, 如果你再执行多个工作流之后,你再去执行新的工作流,它的内存来不及卸载,会造成这个 comu i 的 卡顿。建议大家可以多去点一下这里,然后保证我们的这个 gpu 还有我们的内存要干净一点,现在没问题之后,我们就开始点击执行,等待它的一个视频的生成吧。 ok, 那 我们这个已经生成了,我们来看一下啊,一日不见如三秋夕, 是不是还是可以的呀?而且我们可以发现啊,咱们的这个嘴型也能对上声音也是这种比较标准的普通话,美中不足的就是有字幕,这个字幕在中文的发音下是比较通常出现的,所以我们后面的课程当中用英文就不会有这个问题了 啊。再然后的话呢,我们接下来要做的这个效果,并不是说光用这个工作流,我们还会用到其他的工作流,像瑞米克斯呀, 像这个 client 啊等等的,所以我们接下来会利用这个大的 ltx 框架,然后再加入其他的辅助模型来去制作。那这节课的话呢,大家只要把它给部署上就可以了,那么我们也可以对它进行接下来的一个放大高清叉撑的处理,我们都会详细的去讲解的, 那下一节课我们再见。拜拜。

今天我们搭建这个 lts 二点三扫尾增工作流双击空白的画面,这里输入 u n e t。 这有两个加热器, 一个是 nik 加载器,一个是 g g u f 加载器,他们两个用的 clip 是 不一样的,双击空白处输入双 clip, 下面的 g g u f 输入双重 clip。 如果你要使用瑞特加载器的模型,这个 f p 八亮化版,那么你一定要使用它这个加载器装克利普加载器,那么在克利普这里你就要选用这个克利普 和这个克利普,两个克利普选完之后,在类型这里选择这个 lts 的 me。 如果你要用 guf 模型,一个 q 四,一个 q 六, q 四的版本是更低的显存 在这个 g g u f 这里,它的 clip 是 这个 选择这两个 clip 类型选择这个,所以你要用上面的 unik 模型,这要搭配它的 clip。 你用下面的 u g u f 模型,要搭配它的 clip, 两个使用是不一样的。我们可以在 clip 这个节点这里点击它的模型下载个 clip, 我 们编码器复制一份 这个编码器,上面是正向提示词,正向提示词下面是负面提示词,可以在负面提示词这里随便选几个 正向提示词,这里就根据你的图片去写就好了。然后我们连接的是这个 g g u f 模型的, 如果你想使用上面 unique 模型的话,就把这两个 clip 模型的线按 ctrl 键点击它之后点击到上面的 clip 就 好了。现在我们在这个节点点击它的模型,输入权重洛 拉加载器,这个加载器能一次性加载好几个洛拉,加载好两个洛拉之后, 可以设置它的值,如果你找不到这个权重洛拉加载器,你就可以在上面输入洛拉,选择这个洛拉加载器,剪模型,粘贴,复制一份,把上面线连到下面就 ok 了。 去加载它的洛拉,上面是这个洛拉,下面加载这个洛拉。 这两个 logo 有 强度设置,跟这个是一样的,一般就零点五,这个一或者零点五都行,像这样设置模型,连接 logo, 再连接下一个 logo, 再连接下一个,这样连接后深层的图像是没有问题的, 可以调他们的参数,不一样的参数生成的视频是不一样的,我们先把这个零点五调成一,这个调成二,生成好视频,我们看一下, 它是跟上一个是有区别的,上一个我们这个调的是零点五,这个调的是一,这个 logo 是 保持视频自信,这个是转场 logo, 根据自己需要去调就好了。如果没有这个节点就加载这个。 如果你的显存是五零系或者四零系,那么可以使用这个 unik 加加器的节点,使用这个模型和这个颗粒谷,它的生成速度会比 g g u f 快。 g g u f 它生成的时间是五分钟, uniq 它生成的时间是三分钟,那这个节点可以用也可以不用。但是如果你是低显存,八 g 显存,我是建议你用这个 g g u f 的, 在加载这个节点,在这个节点后面拖出来 lts, 选择这个更快激活。如果你是八 g 显存,这里就填四,下面填二零四八。如果你是十六 g 或者十二 g, 就 填二,这里填四零九六。 如果你不使用这个补丁,就直接在这里拖出来,滚入基础, 选择这个基础调度器,要把这个给删掉也行,如果你使用这个就在模型这里做出来,在调度器这里我们选择这个步数这里选择八步,这个八步和降噪值有什么区别?这个是八步降噪仪运行出来的视频, 我们现在测试十二步降噪,零点五点击运行,运行完了之后我们可以看一下左边是手针,右边是尾针, 这个降噪的强度我们可以理解为原图的保留强度,如果这是一是保留全部的原图,如果是零点五是保留一部分步数的,调整时候让画面更优质, 但是会增加深层的时间,一般是八步就合适了。我们在可立普文本编码器这里有个条件,点击条件,输入 l t s 条件,选这个条件,设置 正向条件连接正向,负向条件连接负向,在这个负面条件这里拖出来是 l t s。 二,选择这个标准化注意力引导,把负面条件连接上这个节点,就是连接负面条件的节点, 把这个模型连接上,在这个模型这里。 lts 彩样,选择这个彩样预览,这个的作用就是你在运行的时候开彩样器这里下面会有一个预览图像, 你可以用也可以不用。在这个预览图像这里有个模型被拖出来,输入制定彩样器, 如果你不使用这个节点,就在注意引导这里模型拖出来,选择是一样的,再给它删掉是一样的 这个字。精灵采药器有正面条件,负面条件, 把这个条件设置的正面条件和负面条件连接上 这个基础调度器,它有一个绿色的点,这点引采暖器也有一个绿色的点,把绿色点相连,它只能连接绿色的点,你去连接别的点,它是连接不上的,是对应的。 采暖器这里拖出来,选择开采暖器,选择选择这个采暖器 是电影采样器,这里还有一个输出口,我们输入 lts 音频,选择这个音频,视频分离 来一个画面,画面拖出来输入 ve, 我 们选这个 ve 剪码分块,这些都不用调整,把时间尺寸调整成最大,这个最大和默认六十四还有什么区别? 我们现在可以测试一下。把这个最大设置完后,我们可以看一下, 它中间会有闪,就在这里它中间会闪了一下,如果把这个分块解码调到最高, 它就不会出现这种情况,因为分块解码调到最高,它会一次性把这个降噪图片运行完成,你分小块运行,它会出现闪烁,我们可以在分块解码这里六十四选择最高,在图像这里戳出来输入选择锁影, 在缩影值这里零冒号减这里可以输入数字,我建议输入十,这个十代表的是时针, 比如这个视频我在后面输了十,就说这个视频运行完了之后,我会把后面的时针给裁剪掉,我看视频最后 它是定格住的,它和我们的原图保持着一致,如果不要这个节点把它屏蔽掉,那么运行运行完成之后,我们看一下这个视频, 可以看到在最后一针的时候很明显的卡顿崩坏的效果,所以说这个可以打开,如果你察觉不到的话,就不用管它, 一般输入十就好了。图像这里拖出来,这里输入创建, 有个创建视频,创建视频,有个视频,视频,这里选择保存视频格式,选择 mp 四, 上面是名字,在模型加载器的下方,这里输入 ve 加载,选择这个 ve 加载程序,上面这个是音频,下面这个输入视频, 在这个程序的下方输入加载,选择加载图像,图像有一个叉槽,这里输入第二,选这个图层工具框高笔缩放。第二, 在四英子里,我们选择裁剪倍数,输入三十二,缩放至边长,我们选择最长边,倍速幺二八零,这里有个图像插槽,点击图像插槽, 点击 s 视频,选择这个选择这个将图像转为视频的节点,它这有个一,我们选择这个二,然后增加一份,返回这里点一, 然后这里有个图像插槽,凸出来垂直缩放,选择这个图像缩放。缩放方法,这里选择这个固定宽高笔这里选择裁剪边数,这里除以三十二, 这里还有一个图像插槽,戳出来就是加在图像,可以看到这是一,这是二,那么这个代表手针,这个就代表尾针,所以说我们在这里要输入手针的图片, 那么这里要输入尾针的图片,输入完成之后,把它的宽和高连接上, 上面的宽比下面的宽比下面的高,然后在手针这里它的宽拨出来。悟空 lts 对 着这个重力显示屏,它的宽度和高度连接上, 现在连接它的时长在空白的地方数整数长量 复制一份,上面这个是帧数,上面这个是秒数。 帧数这里输入二十五秒数,这里输入五秒,因为我们要控制好多个节点,所以把它规划一下,在这个值这里,这里输入剪映预算 减一位数,复制一份。下面这个值连接到 a, 上面这个值连接到 b 到,我指这里输入 a, 然后下面指这里输入这个 a 乘 b, 加一, 下面这个输入成秒数,下面是帧率,把秒数的整数连接到时长。把 lincoln 连接到这个画面的 lincoln 上, 这个图像短视频有个 later, 点击它这里输入 ltsv 合并,选择合并为视频,这有个音频 later, 音频内存拖出来 ltsv 音频,选择音频空内存,音频空内存一个 v e, 一个帧数一个帧率, 把它移动到下面,把上面的帧率连接到帧率下面这个秒数连接到帧数,最后还有个 v a e, 这个,这个是音频 v a e, 这个视频 v a e。 把这两个连接上音频的连接,这是视频。 把这个合并为视频的 laten 拖上去,连接到自定义裁剪器这里, laten 连接上,把那个自定义裁剪器的种子,随便输入几个数字,然后选择固定 cf 句子一或者二都行。 自定义裁剪器这里一个音频分离。把音频这里拖出来,入 ltsv 音频的 v e 解码,把这个音频连接到创建视频这里现在有个视频 v e 和音频 v e 没有连接。 把这个音频连接上这个视频连接上创建视频这里还有个帧率, 这个 b a e 不 用连接,因为你可以不用它也行,这有个帧率,这个帧率。把帧率的浮点连接上, 再检查一下工作流,检查到没问题之后,在正向提示这里输入你的提示值,尽量输入中文,来测试一下这个工作流是否能运行, 运行成功,看一下用时三分钟,这是手针,这个是尾针,看一下这个视频,声音和画面都没有问题。

你现在看到的这些视频全都是四零九零显卡运行 ltx 二点三大模型生成的。 你可曾在雪山上救过一只狐狸?你是那只白狐,我是那只酱板鸭的妹妹。 女士们,先生们,今天做客的嘉宾是当红榨子鸡、小龙虾。 现在我们来看一下 lts 二点三到底升级了哪些地方。第一,依旧开源,配合四零九零显卡就可以尽情的在自己的电脑上运行它。 第二,大幅度的提高了九比十六竖版视频的生成质量,因为我们的手机屏幕是九比十六竖版,所以对移动端的视频更加友好。 第三,画面更清晰,台词配音更准确,配乐和音效更好听。第四,更懂你写的提示词,无论你写的提示词多么的复杂,它都懂你。第五,视频文本渲染更准确。比如你想生成一个 logo 的 视频,它就能准确地把 logo 的 字母写到视频里。 comfui 第一时间就对 lts 二点三进行了支持。现在呢,我就带大家去搭建一下 lts 二点三的 comfui 工作流。在 runnyhub, 我 搭建了四个与 ltx 二点三相关的工作流,我们一个一个的来,先看第一个, 点击运行工作流,你就可以跟着我学起来了。整个工作流你看起来很复杂,但其实需要你配置的参数很少。 首先你要看这个节点,是个开关,开启表示纹身视频,关闭表示涂声视频很明显现在是开启状态,也就是纹身视频 现在来到工作流的左上角,其中 log in mid 节点我们不用管,因为现在选择的是纹身视频模式,我们只要看提示词就可以了。我在这里写的是标志性的电影制片厂的厂头,以航拍镜头扫过雄伟的雪山峰顶,刺破棉絮般的云层,开始 时值黄昏,天空渲染着身子与金色渐变等等等等。这里有一个站位符叫做 replace name, 我 用 test replace 节点负责把这个站位符找到,然后在下面输入你的电影工作室的名字,比如我写的是 emw studio test replace 节点就会把这个站位符替换成你输入的工作室名字了。 下面就是一些常规参数的设置了, length 表示视频总帧数,现在我们设置的视频帧率是二十四帧每秒,然后根据这个公式,总帧数等于二十四乘以秒数加一。因此我想生成八秒的视频,带入公式就能得到幺九三。 一般支持生成十秒以内的视频啊。当然,如果你的显存足够的大,你也可以尝试十五秒时长。 vs 和 hit 表示生成视频的宽和高, 其他参数不用动,包括模型加载,你就用默认的配置就可以了。点击运行,等待两分钟,你就能得到一段运镜效果还不错的 logo 展示视频了。 第二个 ltx 二点三,生成电影公司厂标视频工作流,其中文声视频开关,这里选择的是关闭状态,也就是说这是一个图声视频工作流。那么此时在 lud 编辑节点上传视频的手帧画面,作为视频的开头, 我设计了一款我们工作室的厂标,我直接上传到了这里,然后输入提示词,中景构图,开场画面精准呈现。这张金色厂标, 橘色短毛毛,穿着灰色针织衫,端坐中央,神情威严镇定啊等等等等,写的很详细,其他的参数跟刚才介绍的一模一样,我就没有改,直接点击生成,等待一会你就能得到一段特效相当不错的电影公司厂标视频了。 到这里你有没有发现我写的提示词都很复杂,因为 ltx 二点三这个模型对提示词的要求很严格,你写的提示词需要包含以下几点,生成出来的视频的效果才会好。第一,需要确定镜头的构图, 最好是使用电影术语进行描述你想要的风格。第二,描述视频氛围,比如视频光线、色彩风格以及你要表达的情感。 第三描述动作,将主角的动作按照时间顺序写出来,尽量的自然流畅。第四,确定运镜,说清楚镜头何时切换,包括镜头移动后的主角状态。 第五描述配音,请使用清晰的文案,描述出视频的环境,音、音乐、音频以及主角对话。对于主角对话,请将台词放在引号内,并注明你希望主角要使用的中文还是英文以及其他语言,还有口音等等等等。 讲了这么多,我相信大家已经蒙了,没关系,接下来我就来讲如何在康复 ui 中使用千万三点五来帮你写 ltx 二点三的提示词。现在来看第三个工作流, ltx 二点三配合千万三点五生成宠物播客视频。 整个工作流我只做了一处改变,就是把原来负责写提示词的节点直接删掉了,取而代之的是添加了一个千万三点五大模型节点。 首先我把 ltx 二点三大模型的提示词拷写规则给到了它,然后呢,我只需要把我想生成的剧情用大白话跟它讲一下就可以了,你看,我就是这么写的, 我想生成一个八秒时长的呃,具有皮克斯动画风格的宠物播客视频主持人是一个柯基犬,嘉宾是一个小龙虾。主持人先面对镜头介绍本期来的嘉宾 ladies and gentlemen, 今天做客的嘉宾是当哄炸子鸡小龙虾 现在确实很火啊小龙虾。然后镜头转到可爱的 q 版红色小龙虾,小龙虾面对镜头腼腆的微笑,示意你给我生成出中文提示词,只要最终的提示词结果到这里,大白话就说完了。 然后你看一下经过千万三点五处理之后给你写的标准提示词版本,尤其你来看一下他写的这个运镜镜头脚本,那叫一个专业,是不是写的特别的好,根本就不用再愁怎么去写好 ltx 二点三的提示词了, 其他的都不要动。你来看一下视频效果是不是特别的 q, 特别的可爱。 然后我们来看一下第四个工作流,使用 ltx 二点三配合千万三点五生成武打电影视频。在这里我把纹身视频的开关关掉了,然后在 log 隐秘之节点上传了一张武侠电影的配图。 紧接着我跟千万三点五说,将输入的图片作为起始帧,生成一个八秒的武侠电影片段。 男主和女主的口音是经典的武侠片里的中文配音,那种感觉。女主问,你可曾在雪山上救过一只狐狸?男主回复你是那只狐狸。 此时女主掏出一只特别大的酱板鸭指向男主,然后生气的回复道,我是那只酱板鸭的妹妹。 之后千万三点五就会把你的大白话写成一个很详细且符合 ltx 二点三大模型规则的提示词。再次感叹一下,写的是真好这个提示词,然后你再等个两分钟,就会得到一段对话效果特别棒的武打电影片段了。 最后我们总结一下啊,第一, ltx 二点三这个大模型开源,它可以部署在本地运行,配合四零九零显卡就能跑。第二,生成的视频效果和配音都很不错。 第三,使用千万三点五可以帮你写出很棒的提示词,且符合 ltx 二点三的规则。 最后,有个地方需要注意一下啊,他对中文的文字渲染能力还是不足的,需要继续提升。如果本期视频对你有所帮助,请点赞收藏,支持一下,这里是电磁波 studio, 我 们下期视频见!

hello, 各位小伙伴们,中伙伴们,大伙伴们,大家好,今天我们要给大家分享的是 ltx 二点三 i c edit insert 视频去模糊视频高清修复视频去水印视频去字幕的项目。首先来到我们的 ltx 二 i c edit insert github 项目的一个介绍,以及安装和使用 i c edit 视频去模糊高清修复去水印、去字幕,需要使用到的提示词也在这里有展示。这边是我们 l t s 二点三 i c edit 需要使用到的模型的哈根 face, 这边是我们的一个工作流 和我们使用这个工作流运行 i c edit 项目的模型,对视频进行视频去水印、去字幕以及高清修复和一个视频生成和一个结果的对比。 好,我们简单的来看一下我们整个工作流,这一块是我们的一个视频处理区域,这一块是我们的一个模型加载区域,这一块是我们的一个提示词区 域,这边是我们的一个采样区域。首先我们在这里上传我们的一个视频,视频来到我们的视频处理区域,对视频进行一个初设的缩放,这里是对我们的一个 v i e 编码局部重绘,这边是我们的视频图像 尺寸的一个调整,调整之后转换为遮罩传入我们的一个局部成会。嗯,节点这边是获取我们的一个参考图像,参考图像我们获取的是视频第一帧进行一个图像压缩,图像压缩传入到我们的一个,这边 l t s 图像生成视频的一个节点里面来。这个 v i e 编码局部成会,它实际上是产生我们的一个局部成会遮罩的一个 空间,然后传入我们的一个图像,生成视频的一个节点,转化为浅空间。 latent 传入 l t s ad video i c laura 的 一个条件处理器,最终 latent 传入我们的 裁样器。这里的话是我们的一个模型加载模型加载的话,这边是加载我们 l t s 二点三的一个模型,以及它的文本编码器,以及它的文本编码模型。 这边有四个 logo, 四个 logo 的 话像我一般呢会把去模糊和视频高清放大进行同时使用,把去字幕和去水印进行同时使用,这样的效果可能会好一点点。然后这边看一下我们的一个视频的一个最终结果,我们是上下进行对比, 这是原视频相对来说看起来是比较模糊的,然后我们进行了一个视频高清放大之后,看一下它的效果,确实它的效果非常的好。这边的话是我们的一个视频去字幕和去字幕去掉之后, 嗯,你会发现我们的视频它的字幕和水印都消失了,所以它的去字幕和去水印效果也是非常的不错。 当然我们这个工作流是以视频的第一针作为我们的一个参考图像,对我们的一个视频进行最终的一个重绘。在我们的一个最终结果视频当中,你会发现他的第一针还是我们原视频的第一针,所以说我们在这里可以用这个获取图像批次,将我们的第一针给 去掉,那么他最终就会生成一个去掉第一针的一个视频就不会有。呃,第一针还是留有水印和字幕, 第一针它的一个修复效果不好这样的一个结果,当然了,我们之前也在 one animate 视频去水印的工作流中也有介绍,我们可以先在这里把这个参考图像对它进行一个单独的字幕去除和水印的一个去除直接传到我们这边 l t s 视 图像生成视频的节点里面来,他所生成的视频最后第一帧就会出现屏幕和水印,图像修复和高清放大也是一样。好,我们今天的分享就到这里,喜欢的小伙伴们中伙伴们大伙伴们,给我们来个一箭三连,感谢大家的支持与关注。

今天这一期视频给大家来讲一下 ltx 二点三,也就是之前说的老同学二点三纹身视频的初级进阶工作流和徒身视频,初级进阶工作流,后期还会有中级进阶和高级进阶的工作流。 首先我们让工作流运行起来,然后给大家讲解一下这个工作流的注意事项。 第一个注意事项就是左上角的模型选择,模型的话,现在视频里演示的工作流都是 g g u f 的 工作流,等视频拍完了以后,我后期会补全 f p 八的工作流。 模型选择要注意的主要是三个地方,第一个地方就是可莉布的选择,一定是双可莉布选择,而且是不一样的,大家一定要对照工作流利的模型去对照选择。第二个就是 lora, lora 的 话选择的话 lora 很多,千万不要选错,哪怕是差一个字母,可能差一个版本都不太一样。 还有一个就是视频 ve 和音频 ve, 这里很多人容易选错,视频就是 video, 音频就是 audio, 一定不要选错。模型分配数量的话,一般建议大家选择四十八层,那么我来看一下任务管理器, 在选择了四十八层以后的话,像我现在生成一个一二八零乘以七二零的视频的话,他模型只用到了一个一二八零乘以七二零的显存就可以跑这个工作流, 八 g 的 话估计有点吃力了。然后再来看一下这个 c g eight 式的加速档位,这里的话主要还是之前我们自己跑的那个, 然后我们进到这个子节点的选项里去看一下,其实这个左上角的节点包,大家点击右上角的箭头就可以进到子节点里面去,比如说你没有安装方块节点,或者说你没有安装 c、 j、 t 的 加速节点,你可以把这两个节点删掉,删掉的话就可以正常运行了。 再来看一下下面,下面就是视频参数的设置,分辨率、帧数帧率,现在像我的话跑了一个二十四帧十秒的视频,那就是二百四十帧加一帧二百四十一帧 过来的提示词,这些就没什么好讲的了,因为在基础工作流都讲过了。这里还有一点要讲的就是 在基础工作流里面,我们使用了两步测量器,普通测量完了以后再进行一个放大测量。在最新的初级进阶工作流里面,我删除掉了放大模型,直接使用原始的模型进行八步生成,八步生成完了以后直接就输出了,没有进行一个压缩生成,也没有进行一个后期的放大。 然后再来说一下这个彩样器,在新的工作流里面,我使用的彩样器是我写的一个自定义彩样器,是小白工具箱的自定义彩样器。我在官方的节点上增加了一个缓存清理, 大家可以选择单次缓存清理或者双次,一般推荐选择单词就可以了,因为我们在后面还增加了一个 ve 的 解码崩溃节点,这个节点也是小白工具箱的一个节点,这个节点厉害之处就在于 它增加了一个卸载显存模型的功能,大家跑任何图声视频或者纹身视频的时候勾选这个,在解码阶段就不会卡那么久,也不会容易导致显存崩溃。 至于上面的方块参数,大家一定要根据自己的显存大小去选择,重叠的话,大家设置完了以后去看一下跑出来的视频,如果说有画面闪烁,那么就增加时间的重叠,如果有 那种小方块或者小横线,那么就增加空间的重叠。至于上面两个风快的大小,根据大家在跑的运行的过程中观察自己的显存,像我的话现在风快就有点偏小了,只使用了十点九 g 的 显存在跑,那么正常来说的话,我二十四 g 的 显存的话就有点用的少了, 在这里应该增大一点,但是这个是演示工作流,我就不调节了。现在我们来看一下这个刚刚生成的一个视频, 机智罗 ltx 二点三进阶工作流,这个就是刚刚跑成的视频,大家可以看到上面没有字幕也没有闪烁,这就是这个初步进阶工作流进行了几点改动以后的效果,对比之前那个基础工作流的话,效果好了很多。 同样徒生视频的工作流也是一样,唯一的区别就是说我们需要上传一张图片,把图片输入进去进行生成。那么现在看一下生成的效果, 大家可以看到画面清晰,没有闪烁,也没有乱码的字幕啊。至于这个人唱歌难听的话,这个我也没办法,因为这个是 生成的音乐就是这样,大家凑合着看吧。最后再来讲一下模型的安装和工作流的安装, 等你们从网盘下载了模型文件夹和工作流文件夹以后,首先你要把它放置到 comuc 里面去,如果你在使用小白工具箱的话就非常简单,我们首先进入模型目录,把里面所有的东西复制全选,一定是要全选,你剪辑也可以,复制也可以,然后点击这里的模型目录, 然后就进入到了 comui 的 模型目录,在模型目录里面,你右击粘贴进去,这时候如果提醒你已经有同名的文件是否需要覆盖的话,一般推荐你是去覆盖它的,因为新的文件肯定更匹配这个工作流。 然后工作流的话,我们同样复制工作流,在机制启动器左边的工作流管理点开,然后右上角的本地工作流找到你要放置的地方粘贴进去就可以了。粘贴完了以后, 回到页面 f 五刷新一下,这时候无论是模型或者工作流都可以在这里面进行加载了,那么今天的视频演示就到这里了。


看看这个人工智能视频。我用 ltx 二点三在孔飞外生成了这个只用了八 gb。 在 八 gb 显存的 gpu 上运行 ltx 二点三通常会导致内存溢出而崩溃。但今天我将向您展示确切的补丁和设置,以便安全地运行它。 为了证明它有效,我们将实时监控性能监视器,让大家看到显存安全的保持在八 gb 以下。 现在这个工作流非常简单易用,我没把它搞复杂。这次我保持了简单,那么我们就来配置它。首先,我们需要添加几个简单的命令,以激进模式运行康复 ui 来节省内存。 通常你只需输入 python y p y 即可启动,但今天我们要加入 loverran。 接下来,我们需要添加 reserve v r e m 一 百零二。那这个有什么用?它为 windows 保留了一到二 g b 的 内存,因此你的电脑不会崩溃。 今天我的测试所用显卡拥有三十二 gb 现存,因此我输入 reserve v r a m 二十四,为 comfy ui 留出恰好八 gb 的 使用空间。接下来,我们需要修复缓存, 添加缓存规则时以降低缓存内存占用。最后,添加预览方法 test, 以创建非常清亮级的图像预览。 但如果之后人出现内存不足错误,只需将此选项改为预览方法,那以节省更多显存。 如果你使用的是便携版的 copy ui, 不 必担心,只需右键点击你的 run nvi d i a g p ubed 文件,选择编辑,并在 m p y 后粘贴这些完全相同的命令。现在让我们看看这些模型。 首先,我使用蒸馏版的一点一 q 四 k m 模型,这节省了海量显存,因为我们无需加载额外的 lo r a 文件。 接下来,我们进入双 c l i p 加载器。我加载了 jama 三 g g u f 文件。那我为什么特意要用 g g u f 版本呢?因为这将一个庞大的人工智能模型压缩到了仅六点一四 g b p s。 这正是我们强制它在低显存中运行的方法。之后,我加载 ldx 二点三文本投影文件,大小约为二点三一 gb。 总之,这些模型的总量约为二十三 gb。 我还为此工作留添加了一个低显存补丁组。我们将加载好的模型传入 stage attention, memory efficient attention 和 chunk feed forward 补丁。这些节点直观重要,因为它们能在视频主动生成过程中降低峰值显存占用。 我们节省了显存,但也必须阻止人工智能生成错误的解剖结构。因此,我们使用了 l t x n a g 节点。 那这个有什么用?这能让你的负面提示词效果更强。它让人工智能在你说不要坏手,不要奇怪文字和不要伪影时听从指令。 这个简单的节点能让您的最终视频看起来更好。接下来我们看看提示词部分。 我在这里添加了一个旁路组。你可以手动输入正常的提示词。但是如果你想使用提示词中记呢?因此我添加了一个提示词中记选项。您可以根据需求在手动提示词与提示词中记之间轻松切换。 提示字准备好后,我们需要设定视频尺寸。看看我这里的笔记,上面有推荐的分辨率。我知道有些人使用自定义分辨率节点,但每个额外节点都会浪费你有限的显存, 因此我保持简单并以纯文本形式写入该值。我只是手动输入了这些数字。对于八 gb 显存的 gpu, 我 强烈建议从四百八十乘八百三十二的分辨率开始, 我将其精确设置为每秒二十四帧,共十秒。如果之后还需要节省更多显存,你可以调低这个值。现在是我的秘诀。 我将视频生成分成了两个阶段,第一遍执行前六个步骤,之后第二遍再做两步。 那我们为什么要这么做?因为如果你的显存较低,就要确保第一遍能安全运行再往下进行。因此,我强烈建议你先跳过第二遍处理和超分器。 所以让我们现场测试。第一遍,我会点击运行,并打开性能监视器, 密切观察图标。加载 texencore 的 模型仅需约三点七 gb 显存。 当进入提示词部分时,大约占用五点六 gb。 现在进入第一遍,显存飙升。目前生成这段视频正好需要八点一 gb。 生成前六步仅需约四十四秒。完成后你会看到显存回落至约三点六 gb。 第一遍效果很棒,但我们还得把视频做完。因此我将启动第二遍并再次点击运行。 因为我们之前使用了正确的缓存设置,所以它不会从头开始。它正好从第一遍结束的地方开始。在第二遍中,它再次占用大约八 gb 的 显存。 最后这两个步骤仅需十五秒,意味着完整视频恰好耗时一分钟即可完成。 现在我们已经得到了一段很棒的视频,但如果你想把它放大以提升画质呢?所以让我展示一下当我起用内置放大部分时会发生什么。 观察性能监视器 v r a m 超过八 g b, 并一路飙升至约十四 g b。 它仍可在八 g b g b u 上运行,且不会失败。但由于它占用大量内存,完成视频制作将耗费很长时间,因此我采用了一种更优的方法, 别用内置的放大功能。先下载生成的视频,然后将该视频重新加载到 comfy ui 中,并使用 rtx video resolution 节点。 那这个有什么用?它安全地放大您的视频,你甚至可以将它设置为超高质量。而显存占用仅需大约三到四 gb, 生成大约需要三十秒。这对低显存电脑非常友好,因为你不必等待长达十四 gb 的 内存监控。 现在我们节省了显存,并安全的提升了视频分辨率。现在让我们看看这个工作流能带来更多什么样的结果。这是第一个例子,一个女孩正在唱歌,运镜非常逼真,画质惊人。 我在大约一分钟内生成了整个场景。那复杂的物理呢? 那复杂的物理效果呢?所以这是我创建的另一个场景。一位老人正坐着抽烟,此时,一列火车驶过车站, 仔细观察物理效果。当火车经过时,风确实把它的烟雾吹向那个方向。如果仔细观察,会发现一个非常微小的物理问题,但又肉眼去看,整体效果看起来棒极了。 如果你想学习如何制作更棒的人工智能视频,现在就点击屏幕上的视频,我将向你展示下一个秘密,那里见,拜拜!

大伙好啊,呃,最近呢,这个 k 神的仓库当中哈,更新了一个 ltx 二点三的 laura, 这个 laura 哈,大家看叫这个 oni nft 哈,这么个 laura, 然后它有这么些作用啊,第一个强化这个画面质感与音质哈,然后强化动作连贯性和提示词的遵从度哈,那我们也测一下呃,请出我们几个老演员哈,第一个女孩对着镜头跳舞,然后镜头拉远啊,我们看一下 啊,先说一下啊,最左侧是 ltx 二点三一点一原版啊,然后,呃,中间这个是 lua 强度为一, 右侧这个是 lua 强度为二的效果哈,它官方推荐这个 lua 的 强度呢,最好是二。然后呢,我一也测一下,大家看一下效果啊。首先原版是把镜头拉远的时候,人物会显得模糊,然后啊, lua 强度为一的时候,大家看好这个质感有一些提升,大家能看出来,对吧? 然后呢,再看一下罗拉强度为二的时候是吧,大家看这个质感有明显的提升,对吧?而且镜头拉远的时候,大家也能发现,是吧,崩的没那么明显了,对吧?这个我们再加上后期的补针和放大,应该是能修复的哈, 是吧,我们再往下看啊,老演员了啊,女孩对着镜头开心的跳好吗?看一下啊,首先最左边原版是吧,跳的时候大家看是吧?五官有点模糊了,罗大强都为一的时候是吧,这个五官啊,崩的没那么严重 对吧?然后再看一下多少强度为二的,这个这个真实感和画面的质量明显就上来了,大家能发现吧,好吧,然后他也说好这个音质有所提升,那么怎么提升的,大家可以看一下,首先看原版,大家能听出来是吧,他那个电子音比较重哈,然后直接看 中间这个 lowra 强度为一的时候,也有那些电子音是吧,而且呢,呃,感觉能稍微强一丢丢哈。再看 lowra 强度为二的这个版本 怎么样,各位是不是柔了不少啊?然后再说一下下边哈,就是这个 lowra, 我 感觉哈,它对这个二次元动漫的效果一般哈,大家看哈原版 lowra 强度为一, lowra 强度为二的时候是吧,总体上变化不大哈, 然后再往下看哈,这个是女孩对着镜头往前跑步哈,然后呢, 大家看一下哈,对着镜头往前跑步,镜头拉远,这个我就感觉哈,就是各位就是都不是 特别明显哈,就是感觉这个 lora 哈,对这个真人或者 cg 风的啊,这种画面哈,啊,提升的还是比较大的,大家能看出来是吧?第一个是吧,这个 lora 强度为二的时候,这个质感明显就上来了,再加上这个, 大家应该能感觉出来是吧?呃,所以呢,这个 logo 还是推荐啊,大家用一下了,效果我感觉是不错的啊。然后强度推荐呢,就是二。

and then i'm going to go, ahead and 优雅始于相信自己, 优雅始于相信自己。

l t x 二点三在 l t x 二的基础上做了很多的提升,比方说画面的细节,习字词的遵循,音频更干净,以及去除莫名的字幕等等。 那这个视频将分享 ltx 二点三所有常用的工作流,包括纹身视频、图生视频。 let's go making some great videos with ltx 二点三,首尾真生视频 以及使用音频来驱动生成视频。那此外还将介绍这些工作流三种不同的安装的方法。 首先看第一个工作流,就是文声视频和图声视频的二合一的工作流,那在这里有这个使用的手册。 第一步就是通过这个开关来切换纹身视频还是图生视频,如果说是这里打开,那就是纹身视频关闭的话就是图生视频。第二步就是输入你要生成的宽度,高度, 时长以及它的帧率。第三步就是写上这个提示词,然后点击运行就可以了。 比方说我们在这里使用这个徒生视频,就是这个跑车在追逐的一段 t 字词,点击运行,这样它就会生成一段汽车追逐的视频。 当然你也可以通过在这里和这里调整这个随机种 来进行抽卡。第二种就是图声视频,在这里关闭,这里上传一张图片,在这里再写上这个提示词,然后点击运行。 let's go making some great videos with ltx 二点三, 然后我们再来看第二个工作流,就是首尾帧的,这里也有使用手册,那首先在这里上传一张首帧的图片,在这里上传一张尾帧的图片, 在这里写上提示词,在这里写上需要生成的宽度,高度以及时长,这里还有它的帧率,这个就是一个洗发水的广告,点击运行就可以了。 然后我们再来看第三个就是通过音频来驱动生成视频, 他也是包括纹身视频和图声视频,也是通过这个开关来切换,是纹身视频还是图声视频, 不一样的点是这里多了一个上传视频的地方,让我们这里上传了一首歌,叫取为了自由的你在这里使用图声视频,在这里写上就是一个男人在唱歌,点击运行。 还有一种方式就是使用图声视频把它给关闭,再用这个音频去驱动其词不变,这里上传一张图片,点击运行,这样就可以了。 这个就是 ltx 二点三这三种常用的工作流, 这些工作流基本上就满足了绝大多数场景了。然后我们现在再来看一下这个工作流是怎么安装的。首先我们要准备一个 comui 的 整合包或者是纯净包,如果说你不是最新的话,在这里双击这个 app 的 comui, 把它升级到最新版就可以了。 那我们先看一下这个是纯净包,这里插件都还没有安装,这个工作流文件也都是空的,那我们来看一下第一种安装方法就是通过康维尔管理大师一键安装,那我们现在以这个音频驱动工作流为例, 点击进去点击一键安装,点击开始安装,那康菲尔管理大师就会自动完成这个工作流需要的所有的,比方说工作流文件、插件节点以及需要的依赖等等, 都会把这些所有的依赖全部自动安装完毕,你只要等它完成就可以了,可以看到已经完成了,我们重启康菲尔,然后点击启动, 那启动完以后,在这个工作流里面就可以看到这个康复腰管理大师的这个文件夹,下面就有一个 ltx 二点三音频驱动文或图声视频工作流,点击进去 可以看到所有的节点都是不缺的,都是正常的,根据这个使用手册,按照刚才视频开头的使用的方法点击运行就可以了,那这是一种方法, 那还有一种方法是使用工作流分析功能,我们现在把这些插件全都给删了,进入到康菲尔搅拌站里,点击这个模型广场,在这里就有这个 ltx 二点三模型和工作流,点击进去点击下载, 点击确认下载,这个是免费下载的,在这个网盘里就会有这个两个部分,第一个就是需要的所有的模型, 第二个部分是刚才演示的这三个工作流,然后你把这个 modus 直接复制到你的康复 ui modus, 那 里面就是覆盖你的康复 ui modus。 启动之后把这个工作流给拖进去,我们现在启动一下,因为我们没有安装节点,所以说可以看到这里 是很多节点,我们进入这个工作流分析,把这个工作流直接拖进来 音频驱动文或者是图声视频的工作流,点击开始分析,这样的话他就会分析出这个工作流需要的所有的插件,然后我们找到这种未安装的,点击自动安装,点击开始安装,他就会自动完成 这个插件的安装以及他的依赖的安装,然后这种看到这种未安装的,点击自动安装,点击开始安装,然后我们继续安装, 开始安装,那安装完以后再回来工作台,我们重启一下这个康复圈,可以看到刚才的这个缺失的节点,就这里第一次打开的时候,这节点都是缺失的,这样这些节点全都补上了,按照这个使用手册 视频开头的那种操作方法,点击这个运行就可以了。那还有第三种跟第二种差不太多,先把你这个 modus 覆盖你自己的 comui modus, 再把这个工作流拖到你的 comui 里面,手动去补这个需要的节点 再启动就可以了。这个就是 ltx 二点三所有的常用的节点再启动就可以了,这个就是 ltx 二点三所有的安装和使用的方法。


今天我想展示一下如何在我的八 g b 显存上使用 union control。 首先,你需要去 hugging face 下载 laura, 我 会把这个链接放在描述里。接下来你需要获取工作流。本教程中我将使用 d w 后处理, 所以让我们去 comfyui 看看工作流。我已经跑过了这个。 我刚向大家展示我在该工作流中做了哪些更改。因为我使用的是 g g u f, 所以 我在这里替换了节点加载器,并采用了蒸馏板的一点一点。这已经改善了很多。 你可以看看我之前的视频,了解什么比上一代模型更好。接下来你需要在这里加载 low run。 另外,我想在这里展示一下我正在使用的 v 一 点一放大器,它能解决视频末尾出现意外标志的问题。 现在让我展示你上传参考视频的位置。 我也想指出一点,这里的预览并不完全等同于实际输出的效果。这就是我把预览放在这里的原因。让我运行这个。 好的,大家可以看到这里。我现在让系列从这个帧开始,而在结尾处,这里有三个帧没关系,但你可以看到这里在末尾显示超过三帧。 别依赖这里的预览,务必确保在针处精确裁剪。但这里也有个问题,就像这里有三针,我不想要这三针。如果我到这里长度是八十一针, 所以如果我想把三针减到七十八,但它没变,又回到了八十一。这么做肯定有原因,所以不管怎样,那放点东西也无妨。 好的,你可以在这里更改输出分辨率和时长。目前我还没用它。我只是从预览视频中获取时长 帧数设置在此处。现在来讲,音频部分。这是开场视频。我只是从参考视频中获取原始音频,所以这里是从输入视频。我说真, 对于自定义音频,我选择了否。在这种情况下,你必须确保输出的视频使用了所选的音频。 在其他情况下,我们必须选择其他内容。我还想告诉大家一件事,即使这里我没用音频,也得填点东西进去, 否则它会因找不到而失败。所以即使不用,也得填点什么。 最后,你还需要一张参考图片,所以基本上这是一种起始图像,他不必与参考视频的起始图像完全一致。在这种情况下,你可以看到在我的参考视频中几乎看不到左边那个男人的脸, 但我只想定义左边的人,所以我把图片弄成这个样子,所以确保脸部在这里清晰可见。所以他不必与第一张图像的姿势完全匹配,但应非常接近视频。 你可以用你喜欢的图像编辑器来完成这个操作。我用 nano banana 完成了这个,并用 q n 二五一一进行了微调。以上就是我开场视频的整个工作流程。 接下来我想展示另一个视频。这次我用了一些不同的东西, 所以基本上你可以看到这是 y m c a 的 舞蹈。正如你所见,这里有很多空白区域, 所以我不想让电脑在空白区域浪费时间。这就是我在画面中添加裁剪图像的原因。另外,你也能看到这跳的是 y m c a 舞,但 c 的 位置在错了那边。 这就是我为何添加图像翻转的原因。而且因为我裁剪了图像,我的视频分辨率变得非常低。为了获得更准确的姿态,我将此值改为了零点六,默认值是零点五。 我希望我能调高一点,因为我也想捕捉手部动作,如果分辨率太低,动作捕捉就没有细节, 所以让我展示一下 d w 姿态。 好的,搞定了。生成这个不到五分钟。幸运的是,它不必每次都生成这个,所以如果你多次运行它,应该只生成一次。 如你所见,这里的分辨率不是特别高,所以有时你会看到他做出了握拳的动作,而到了最后,你会发现结果显示的是指向手指的样子, 因此骨骼的细节并没有完全传递到最终结果中。你可以调高这个数值,默认是零点五,但很快会占满我八 gb 显存的内存。 所以如果我把这个调高,我就得降低输出分辨率。你可以调整它,在两者之间找到平衡。 另外,我想展示的是,因为参考视频使用了 y m c a 这首歌,所以我不想用原声,以避免内容 id 匹配。我把这个设为 force, 还有自定义音频文件,基本就是这个,所以我也不想这么做。 基本上,我希望 ltx 生成音频,且有一件重要的事是,你必须确保不在选中该音频选项。 你必须选择音频输出才能获取 ltx 生成的音频。呃,我觉得这就是我的第二个视频工作流的全部内容了。我马上给你看视频。 我想,关于使用 d w post 配合 u n 恐稠 o r a 进行 l t x 二点三视频到视频的转换就到这里了,希望你享受这个视频。如果你喜欢的话,请给我点个赞,感谢观看,再见 啊!还有更多视频要看,或者你可以订阅,这样我们就不会错过未来的任何视频了。

今天给大家分享的是 mt 叉的二点三的一个 全套的视频生成工作没有,先看一下效果,我先简单介绍,等一下再详细的介绍简单的使用方法。看一下这个途胜视频, 这次它完全支持这个竖屏的一个视频生成了,而且生成出来的文物基本上都不会崩了,结构也都很正常。 然后我这里边总共有四个工作没有,第一个是纹身视频的一个工作没有看一下效果,然后这边我都是利用提示词自动扩写,你只要简单的写一个提示词,他就会利用他这个规则规范自动 扩写,写出更适合把你的提示词优化,更适合视频生成,比如一些运镜啊,或者电影的画面效果之类的, 这个是都加上这种提示式自动扩写,看一下效果,目前生成的都不会崩,所以效果基本上,嗯,勉强可用。 然后底下这个是图圣视频,一张图底下是首尾真视频,两张图进去这边就没用到两张图, 没用到这个节点,这边设置每张图,然后第一张是在第一针,第二张是最后一针,负一就是最后一针,区别就是在这其他节点一样,跟上面一样, 然后最后面一个是增加一个中间针,或者更多都行,节点也是没用到这个这边选择三张图线, 当然他可以更多,但是更多没什么意义,他这最长也就二十秒最佳,虽然他可以生成到三十秒。 等一下我再详细介绍这个一个一个的使用方法。先介绍一下,我这边用的是端老云的在线镜像,大家不限本地步数,现即开即用,就点开我的在线镜像,我现在用的就是在线镜像, 你看到我能用,你们也就能用,而且这个工作没有,我是放在这 mt 三 x 二点零,二点三 点开就全套,四个都在,当然我这里边还有其他外边这些是最主流的一些工作没有,比如这个 声音生成或者语音刻文,或者语音设计生成音乐都在这里边。点开全套,还有 fox 二的单图编辑或者多图编辑或者刻文音 模型编辑都在这里边,全套都有,还有 mt 叉二点零的,还有呃千万二五幺二或者这一枚全套都是全套,还有二五幺幺的效果最佳编辑模型。 外面这些就是残忍的一些模型,里边是分为视频,图像,语音,这个就是以往的一些视频, 以往的一些工作,没有图像的人一边就有三百个工作没有,也都是比较残忍的一些工作没有。 语音类也是以往的一些呃声音刻文或者纹身音生成音乐提取纹身等等常用的工作类。视频类也是以往的一些工作类都在这里边,比如视频生成或者视频内容移除 等等,还有表情控制,不过现在用的话一般用最外边的这些就可以了。屏幕视频生成有万二点一的数字纹或者万二点二的,或者 然后 t 叉二点零的,最新的都在最外边,直接用最外边的即可。让我这在线镜像有一个优点,就是我这每一个工作都有对应的视频教程和笔记,这样子就可以呃现学现用, 而且所有的工作友都在一个 control ui 中,你就可以自由的组合,用这所有的工作友去自由组合适合自己的一个工作友,这样子就方便使用,不用 在几个 control ui 中倒来倒去,这样子直接在一个 control ui 中就可以集合所有的组合了。 然后嫌本地不熟的人可以点开我的笔记,点开导航上的 comui 教程,他就会跳转到工作流的位置,跟镜像一样分三类,视频,图片,语音。 这个工作流放在视频类里边,跟工作流名称一样。第一个就是 点开里边有安装教程,再点开里边有需要下载的模型及链接,还有截图还有安装位置,全部都有,按照这个去下载部署即可。 然后这底下是一些使用技巧,在下面就是里边工作栏的一个截图,所有的截图都能看清上面的参数,有时候就不需要打开文件,直接双击打开图像看参数即可。 这是四个工作栏的截图,还有简单的示意使用。 最下面就是公众号下载笔记,就适合呃本地部署的人去使用,每个公众号都对应的一个笔记,还有视频教程,这样子就方便学习或者查看。 好了。回到这一个,首先第一个是纹身视频,最大它是支持到三十秒,不过一般 我们采用的话就五秒到十秒,文件的话只知道二十秒。我这里边用的模型就是用最大的四十几 g 的 那个模型,因为效果最好,而且呃这个加速的一些节点我都去掉,因为 如果想要效果最好的话,就不需要那些加速的节点,所以以质量为最好质量的一个大件效果我就去掉了那些加速的一些节点,目前这个就是他质量最佳的一个效果嘛。 然后这最大的模型是几具,生成十秒大概需要三分钟到五分钟。 这边是最大的模型,我用的全套都是 kg 的 模型,整套这边用的是呃四十几 g 的, 当然我也有 f p 八的,但是这个效果不好,所以用最好的就行了。 好,其他就是一个官方默认的一个呃,采样,二次采样放大,这就是普通的一个公众官方的公众号, 然后这边我是直接连接到这最外边控制就方便控制 视频尺寸,高度,宽度,还有时长多少秒,十秒。呃,四针基本上就不用改了,底下是用了一个千万三的一个大模型去反推提示词, 有时候写提示词很费劲,还要写应景的效果,或者画面的色彩等等等等,构图等等。 有有,这个自动反推就方便了,你简单的写一下提示词,当然这边最好是用英文,除了对白可以用中文,其他最好都是用英文,这样子他就可以把你简单的一个提示词重新优化的更适合这个视频模型的一个规范, 最后再输出去生成,生成的效果就会更佳一点。就不用自己去写什么运镜啊什么之类的,通通按这个 i i 自己去优化。这边有有怎么设定这个 i i? 你鼠标移上去的时候会显示让他控制什么视频美学的融合或者动态的控制等等,那他反正就是全自动的去扩写,从你只要写一个大概就可以了。 这个是纹身视频的部分,下面是一个土生视频,其实一样也是四十 g g, 最大的 不同的地方就是把这个图片输入进去,这个节点不一样而已,多了一个图片的输入,其他都一样, 然后二次放大也是这个节点有一个图片输入的,然后这边就需要图像反反推,所以图像没截到这个节点在这个节点上面。这样子你只要写一下简单的一个提示词,然后 加上他这个图像反退提示词,他自己去结合,最终生成一个呃提示词加图像反退提示词的结合提交,就不用自己手动去写这个图图像的反退提示词了, 只要写一个大概的提示字就可以了。深层的效果也目前看是爱,爱感已经没那么强了,很写实, 基本上人物崩坏的可能性基本上就没有了,所以这个就非常完美。还有一个是收尾针,这个就跟上面不同的是这个节点 他可以控制树木的图形,然后这边有个负一是指最后一针, 因为他只有两张图片,所以第一张就第一针,零针就是一针的意思,开头这个护翼就是最后一针的意思,就不用自己去写多少针,那个最后一针是多少针,这边有 不懂的话可以看这个呃注示那边都有写这个设置的一些使用说明, 因为他是头尾正,所以这这边二次采用的时候,这个参数跟这边必须是一样的, 这样子他二次采用的话就跟第一次是一模一样的,然后这边 图像反推的话是反推两张图这边有个不一样的地方,就用这个节点把图片 两张合并成左右的图形,然后提交给呃图形反退,这样子他就可以结合这两张图,加上你的提示词,再去结合优化出来最终的提示词提交, 这样子我们就不用写这个图像。反推,呃,收尾帧的图像怎么反推?提示词都按 i 自己去写就行了,你只要写 大概就行了,最终的效果也是很完美。看一下效果, 他这个说中文的时候,有时候会出现中文万马的一个字幕,这个抽卡即可,多省省几时他就没有了。 如果你用纹身图的话,他基本上都有万马,所以你先解决这个,呃,出现中文字幕的时候 避免解决,出现中文字幕的时候最好就是用这种头围针或者用徒生视频,他就会减少出现中文字幕,如果说英文的话,他就不会出现字幕,就是目前说中文的时候会出现,所以这个用凑卡就可以解决了。 最后一个是呃,首尾针加中箭针,这个跟上面不一样的地方是二次采药,因为他是多土,所以二次采药的时候,呃这个只输入第一张土线, 把第一张土线连接到这二次采药,放大这里就可以了。因为如果你把 二次采药也跟前面一样的话,我试过了,他会乱七八糟,所以,呃输入第一张图片到二次采药,放大这个这一步就可以了。第一次采药的话,输入这三个图片, 第一,第一章,第二章,第三章,这边选选择三章就可以了,当然如果你多章的话,你就选择对应的章数,不懂设置的话,看这个注解点开就有了。然后这边第一针设为零,就是首针, 呃,第三章设设为负一,就是最后一针,中间的话,你就大概设置一个中间的整数,比如九十或者一百都行, 其他都一样。呃,这边图像反推就不是三张合并让他去反推,我试过了,三张合并成一张图,让他反推的话会写的乱七八糟,所以这边图像反推选第一张或者选你觉得 比较好,全是这个画面效果的一张,一张图给他反推就可以就可以了。然后这边也是简单的写一下提示式,让他 按这个千万上,自己去油画结合图线生成最终的提示式提交,这样子效果就 更完美了。因为其他我都测试过了,如果三张结合起来按他反推的话,那他提示词就乱七八糟,所以这边反推提示图像反推提示时只要选一张呃,比较有代表性的给他就可以了。 跟这个收尾针不一样,收尾针他是比较具体,所以 我们可以把文章图合并起来给他,然后告诉他这是收尾帧图线。这里边的提示是不一样的,就是给爱爱下达的任务是不一样的,这边写的是收尾帧过度, 所以提交文章图片让他参考左边和右边的图线写提示,写收尾帧的提示词, 但是底下这个是因为多图,所以。嗯,他并不是收一张图线,按左到右的一个图线过渡,写太多图的话,他写出来就乱七八糟,所以这边就只选一张效果最佳。因为我已经测试过 看大海边 这个门面,他目前就不会崩坏,而且文物的结构啊,什么不会说,有时候肚子伸出一只手啊什么之类的,目前这个算是。呃,能院,但是清晰度不会很高, 而且太高了,我看他生成出来画面的结构都不对了,所以。嗯,他目前还不支持太高分辨率,就九六五效果最佳。我这边默认设置输出基本上都是九六五 啊。我这主要是测试他现在支持的竖屏,横屏就不用介绍了,他本来就支持最新这个模型,就是真正支持了竖屏,所以我展示的话就都是竖屏,你想要横屏的话,只要把这个 参数对调一下就可以了,宽设成高,高设成宽就可以了。好了,这期就介绍到这,大家自己去玩吧。