大家好,我们在使用 animate def 做纹身视频的时候啊,有没有发现一个问题,通过文字很难精准的控制物体的运动路径。同时我们还发现 animate def 的 nora range, 他的幅度相对有限。而一个视频场面呢,之所以震撼啊,除了他的内容精彩以外,更重要的一个因素啊,是他的愿进的范围和广度。一个场景通过大范围的动态镜头的展现啊, 还能带来更深远的视觉冲击,就像一首诗,黄河远上白云间,一时同看蛟龙戏,浑厚感人,能感受出磅礴壮阔的景象。那这种视频呢,只有通过大范围的动态镜头 能展现出来。而我们目前接触的几种视频处理方式啊,包括 svd 图声视频、 animate def、 纹身视频、灵活视频、运镜技术、 motioncoul, 他们各有优势和缺点,比如, 比如 svd 可以快速的将图片转为视频,非常方便,但动态效果不可控,同时产生的视频啊,最多也只有二十五帧。艾尼米特地府纹身视频呢,生成的视频比较精致和丝滑,但愿景效果很一般,更多的是在固定的镜头下人物的动作啊,或者换装。模型 ctrl 拥有灵活的愿景技术, 支持预售的物体和相机的运动路径,同时还提供了在线的运动路径的绘制。但遗憾的是,他只能生成二百五十六乘二百五十六像素的视频,这么低像素的视频几乎无法使用的。那我想如果将模型 ctrl 技术结合 animated def, 那是不是可以做一个运镜,很灵活,同时还能达到精致的视频画面呢?其实我今天的教程就是通过模型 ctrl 加上 animate def 设计的工作流,整个工作流可以支持长视频生成,里面包含了模型 ctrl 纹身、视频 涂鸦吸出控制纹身视频,视频真纹视频高清放大人物,细化面部,细化视频人物换脸,当然这个公众牛啊,一斤三零后会免费送给大家的套路,我从来没有说免费,肯定会免费, 没有说免费也不要强求,那我们先一起来看看整个公主牛的原理,然后我再单独给大家详细的讲解整个公主牛的细节。这本是通过一个模型 ctrl 制作一个二百五十六乘二百五十六的运镜食品, 然后通过加载这个视频,通过涂鸦与处理器处理成涂鸦图片,这里是通过 m a d f 涂鸦系数控制生成一个五幺二乘五幺二的视频, 记得对视频进行请空间放大一点六倍,这边就是对视频人物进行一个细化修复,然后再进行一个面部修复,最后对视频进行一个补针,如果需要换脸,还提供了换脸组,这个就是整个工作里的原理和流程。接下来我将给大家详 详细的讲解每一部分的参数和使用方法。这部分是模型 ctrl 技术,模型 ctrl 技术可以很灵活的运用运镜来生成视频,不单单可以控制运镜,还可以控制物体的运动路径,还可以控制物体的运动路线, 同时还提供了很多预制的运动轨迹供我们使用。当然了,如果你对预制的运动路线不满意,还提供了在线的绘制路线的方式,可以说对于我们制作视频用劲是相当灵活了,但有一个缺点就是只能生成二百五十六乘二百五十六像素的视频。他的安装呢,也比较简单,通过空腹 ui 管理器 安装节点搜索模型 ctrl, 找到空腹 ui 模型 ctrl 进行安装,然后需要下载一个模型 ctrl 大模型,用模型 ctrl 点 p t h 的文件,放到我们切个抛音的文件夹就可以正常使用了。这里就是加载我们下载的模型 ctrl 模型,这时候就是设置成我们生成视频一共多少帧作为演示啊。 这边设置的十六针,大家可以根据自己的需求和电脑性能去设置调整,帧数越多,对电脑的显存要求越高。这边是一个模型 ctrl 的条件,条件里面可以设置证明提示词, 我们希望视频的画面,我这里写了一个女孩站在大树下,蓝色的天空,白色的云朵,草原。注意啊,无需写任何质量词,英语本身只生成一个二百五十六乘二百五十六的像素视频, 娘子的意义不大。同时这里还需要连接两个轨迹预设,一个就是镜头的轨迹预设。镜头轨迹预设还是挺多的,这些符号啊都是英文首字母 u 就是 up, 向上运动 d 就是 down, 向下运动 l 就是 left, 向左运动 r 就是 right, 向右运动 o 就是 room out。 拉远箭头后面就是一些拉远镜头的速度, run the r i 就是镜头围绕中心向右旋转,同时拉近镜头 run r i 九 时,镜头围绕中心向右旋转九十度,同时拉近镜头视频 a c w 六十,相机逆时针旋转六十度,视频 c w 六十,相机顺时针旋转六十度 i 呢就是 room in 拉近镜头,下面是一些拉近镜头的速度,下面继续看物体轨迹的预设。这里包含了四种不同曲线运动, carav, 一二三四以及水平运动 horizen, 还有三种震动下坡就像铃铛在风中震动。这里的证书设置啊,需要和上面的证书相同,这里可以选择我们控制镜头还是控制物体,以及两者都控制, 正常两者都需要控制的上下文重叠越大,视频越稳定。不过我这里只需要一个大致的运动视频,可以不设置是零就好了。这边是模型 ctrl 的采样器,步数呢,在前期测试的时候可以调整为十,可以快速的生成视频,看一下运动效果是不是我们满意的。当满意以后啊,可以 增加了五十步就生成稍微精致的视频。这里的轨迹工具我不建议使用,不太稳定,如果确实需要用的话,呃,可以去模型 ctrl 在 get up 官网查看一些详细说明。 这样我们就可以通过模型 ctrl 生成一个二百五十六乘二百五十六的远近视频。那接下来我们需要加载这个视频,因为模型 ctrl 的采样和我们后面的采样照顶生成方式不同,不能直接将图片直接接过去的, 所以我们需要加载这个模型 ctrl 生成的视频,通过加载视频节点加载进去。那这个加载视频节点呢?我在前面的课程中叫 animeter lcm 视频转会完整版,那一节课做了一个详细的说明,这边我就不讲了啊,可以到我的主页查看这个视频, 然后我们将提取的图片进行一个放大,因为原来的视频只有二百五十六乘二百五十六的,那这样我们可以放大到五百一十二乘以五百一十二的,然后通过涂鸦预出 处理器生成涂鸦图像。那为什么要生成涂鸦图像呢?我们接着往下看,来到我们整个工作里的最核心的地方,通过涂鸦吸收控制生成视频。什么是涂鸦吸收控制呢?说白了,它是一种 ctrl letter 模型。在 mtd 发布 sd 幺五 v 三版本的时候啊, 同时还发布了两 ctrl。 net 模型,一个是 rgb 系数控制模型,还有一个就是涂鸦系数控制模型。可能知道的同学不多,当时只关系卫扇动态模型了。其实涂鸦系数控制模型呢,作为一种 ctrl。 net 模型, 可以对涂鸦图片的基本结构进行一个提取,然后让我们生成视频,获得更多的运动方式。这就解释了我上一步为什么要通过涂鸦与处理器生成涂鸦的原因呢?这里需要注意一点啊,这个模型加载需要特殊的 spareshow ctrl 加载器节点,这个加载器呢,在我们高级 ctrl。 net 插件中,如果找不到这个节点, 我们将高级 ctrl。 net 插件进行更新。同时我还需要提醒很多同学,在使用 ctrl。 net 应用的时候啊,拿着别人的工作流去蹭视频,原始数据是跑通了,然后很多时候就想让视频更长一点, 提高了增速,一跑就报错。那很大的原因啊,就是你没有用这个高级 ctrl 的应用节点。注意,长视频一定要用高级 ctrl 的应用,不是官方原声的 ctrl 的应用括号高级。那接下来我们来看整个 animate 地府纹身视频, 我这里加载了一个麦爵 v 六 s 幺五大模型,这里可以根据自己的喜好啊去选择我们的大模型,同样的肯定把停止层负二层 connect 呢,就是我们的视频的像素大小, 建议先做五幺二乘五幺二的 p 四大小呢就是我们整个视频的帧数,需要和前面的 motionco 的视频帧数对应。呃,这里单独加载一个八十四万的 v a e。 接下来 就是我们的正面提示词和负面提示词,正面提示词可以直接用 motion ctrl 里的提示词加上质量词就可以了。接着看 animate 地府里面的设置,我这里通过一个简单的健忘模式加载了一个 v 三动态模型。注意,这里只能使用 v 三动态模型, 因为涂鸦系数控制目前只支持 v 三模型。然后连接一个动态扩散上下文选项。同时这里通过一个 freenoys 进行一个视频真文,这些参数呢,我都在 animeter lcm 视频转会文整版进行了一个详细的讲解, 想要更多学习这些参数知识的呀,可以到我的主页去找找。然后就是通过 freel 进行一个图片质量增强,进行动态视频采样,这样就会得到一个五幺二乘五幺二的初始运镜视频。这个时候视频我们不要去看细节, 如果对整个画面的动态和愿景还算满意的话,就可以进行下一步了。如果不满意,比方说一些色彩方面的问题, 那可以通过修改参数进行调整,直到满意为止。最后进行下一步,下一步就是一个请空间视频放大操作,这里很简单,主要就是在这个难腾的吸收收放里面,我们可以根据自己的电脑性能进行放大设置,电脑性能好的可以放大两倍,性能一般的话就放一点二到一点五倍,这样会得到一个高清视频。 当然这里面还有很多细节方面存在问题,比如衣服会有一些变化,手部细节问题,面部就不用说了,肯定不行, 毕竟面部在远镜头是非常小,那百分之九十九是扭曲的。所以接下来的步骤就是一个西化修复过程,这里首先进行一个人物西化,对人物整体进行一个西化修复。这个西化修复呢属于 inpect 插进的功能, 这里通过一个简易赛格检测动态扩散,注意不是普通的赛格检测,在对视频进行细化修复的时候啊,必须用这个带 有动态扩散的赛格检测,通过 bb box 检测人物的框,然后再通过 sam 检测人物的赛格,将检测到的赛格给到赛格细化动态扩散。同样这里也需要用到这个带有动态扩散的细化接点, 相照设置在零点六到零点八左右,然后就将修复好的人物 seg 粘贴到原来的图片上,这样就可以得到一个新的视频。警察视频的时候,这个时候面部还不要管警察整个身体有没有达到自己的需求, 如果不满意,可以通过调整种子或其他参数重新细化修复,直到满意为止。接下来就开始单独去修复面部,这里主要就是将三个模型混成纸,检测面部的其他和修复身体是一样的操作, 这样我们就可以得到一个完善的视频了,最后就可以通过视频补针,补一些过渡针,让整个视频看上去更流畅一些。如果需要将这个人物的面部混成自己想要的人物, 面部后面还增加了一个换领的流程,如果不需要直接通过 rg 开关关闭就可以了。整个工作流每个组我都通过 rg 开关可以快速的启用或者关闭,方便大家在运行的时候啊去选择运行的模块,最后给大家留下了工作流,需要的话就免费去取。好了,今天的课程就讲到这里,我们下期见。
粉丝2615获赞1.0万

这一次,我对我个人的这个 anymate def 的工作流做了更新,增加了生成的权重啊,可以看出来,几乎完全脱离了原视频。这个背景的话,源自 redat 上面的一个用户。对于初次生成的视频,我对他进行了补针之外呢,还对他进行了颜色校正, 使用了一个颜色校正的节点。在我长期的实践当中发现呢,使用 iding paddif, 只要引入了 conchinet, 它的画面就会泛黄,几乎是无解的。我不知道为什么没有人去提这个问题。这个工作流的话我不做分享,但是我还是可以去提供一些思路,尤其是对于背景控制的这一块。 我用了 ta ctrl net 加 ta 去控制这个背景,包括我用的模型呢,还是 v 三模型。无论是任何的模型,在 stable diffusion 当中都离不开反向扩散。你只要进 行了反向扩散,随机性永远存在。不要在这个地方去纠结什么绝对控制。看一看基本原理吧。未来的话肯定是在视频上面的。 如果图片方面对你来说不是刚需的话,肯定是要转战视频的了。这个视频当然不仅仅只包含 anymate def, 也包含 svd, 以及将要更新的 svd, 以及最近这个新出的这个妞啊。

相信很快的话,在抖音上跳舞的小姐姐就不用自己去拍视频了,就直接通过一张图片,然后替换这个姿势就可以生成这个视频。 哈喽大家好,我是黄小鱼,今天呢,我们来聊一下这个阿里巴巴团队最近发表的一个图像生成视频的新模型, 而他这个模型最大的特点的话,就是能够生成这个丝滑流畅不闪烁的视频。 就是如果我们之前想要去生成这个视频的话,一般采用的方式就是 enemydeaf 加 com 的生成这个视频。下面呢,我来展示一下我之前采用这种方式去生成的一个视频,看到没有,我们虽然能感觉到他动作上是一致的,但 但是他每一针他都在变化,所以呢,他这个视频都在一直在闪烁,所以观感上就不是很好。当然还有另外一种方式,就是这个 stable dfu 型,官方最近推出的这个 stable video 这个模型,但是呢,他生成出来这个视频,我们依旧能感觉到他不是很自然,总感觉哪里怪怪的。就算他放在这个官网上展示的这些视频都是这样的,那么可想而知我们用户生成的这个视频, 那么他效果肯定会降低很多,看到没,他一直就在跳动。而如果我们有了这样的一个模型之后呢,看到没,他这个生成的视频,人物是保持高度的一致的,就不会闪烁了。所以相信很快的话,在抖音上跳舞的小姐姐就不用自己去 拍视频了,就直接通过一张图片,然后替换这个姿势就可以生成这个视频。还有的话就是这个服装模特看到没,也不用去拍视频了,直接找好一张图,那么他自己会生成这个视频, 下面呢我们来简单聊一下他这个实践的方法,当然呢我是非专业人员,下面呢大家简单听一下这边的话,这个是参考的图像,下面呢是一个控制姿势的图像系列, 而这个参考的图像呢,经过这个 ve 提起得到一个图像数据,然后这个姿势图像序列呢,经过这个姿势的引导器,然后驾照之后呢,同样也得到一个数据,共同作为这个空间注意力机制,就是灰色的这一个, 然后空间注意力机制再加上这个文本编码器,就是 c r i p 提取到的这个语意特征,就是这个语意特征,然后生成这个交叉的控注意力机制,最终生成这个时间维度的注意力机制,经过这个 反复迭代进行这个降噪之后呢,最终经过这个 v e 解码得到这个图像系列,也就是一个视频,这个就是他实现的一个基本的原理,相信很快的话我们就能够在这个 com ui 当中, 还有的话就是这个 stereo d f u 型 web u i 当中使用上这样的一个模型。然后这边的话是它的一些论文,还有的话它相关的一些视频,还有的话就是相关的一些代码,大家如果想要呢,可以到 他这个相关的一些网站上去下载,或者的话直接私信或者评论区评论一下,我发给大家,然后今天就给大家说到这,大家玩早点休息。