友友们, infinite talk 数字人官方大更新来了!这次优化直接封神!最关键的是八 g 显存的电脑也能轻松跑起来!平民党狂喜,先夸最实用的优化!以前生成长视频总崩,人物飘来飘去吊针 这次彻底解决了!拆分片段生成还能衔接自然动作,表情背景全程稳定,但也没有漂移尴尬,速度也飞起来了!开 lol 加速采样,只要四步生成超快,还不影响唇形同步!还有 q 四、 q 八两个量化版本, 八 g 显存用 q 四版不爆显存还能保画质。支持图片加音频,视频加音频两种模式,无限时长直播课程短视频都能用,小白也能秒上手。 输入图片,导入音频,简单调个参数点,生成高质量数字人口播直接出炉,再也不用被复杂操作难住!
粉丝647获赞2624

还在嫌弃 ai 数字人动作僵硬,像提现木偶?那你一定要试试 infiniteok fusex 动作加强版,这次真的逼真到离谱!不再只对口型,身体将在原地, 头部姿态、肢体动作、微表情全部同步,脸耸肩前倾,细微挑眉,嘴角神态都高度还原,完全摆脱诡异机械感。升级黑科技加持, 长视频动作不卡顿不重置,不会越往后画面越崩坏。最良心的是八 g 显存就能本地流畅运行,普通游戏本家用显卡都能玩。 还支持无限时长生成,几分钟课程解说视频不用分段拼接,全程人物神态统一,不翻车,自带可视化界面,不用折腾复杂节点工作流,一张人像图,一段音频,一键就能生成丝滑自然的数字人视频。 开源免费,门槛拉低,质感拉满,自媒体做口播知识讲解,带货解说直接封神!我已经出手制作一键整合包回复关键词, infinite talk 动作加强版,直接拿走!

哈喽,大家好,我是嘟嘟。那今天分享一个很好的东西,就是我们之前的数字的 infotalk, 这个呢,最近官方客服 u y 官方发布了光板的模型啊, 直接效果就拉满了啊,直接说三个,呃,有提升的地方,一个是生成的速度减半了,真的直接减少一半,相同时长跑的他消耗的时长时间更少了。那另外一个他的效果呢?他的动态效果变得更好。 最后一个最关键的就是以前 k j 版本的长时间的这个跑,这个数字呢,他的这个视频的质量是会慢慢裂化的, 所以当时我们的解决方案是裁剪啊,就是我们裁成十几秒十几秒的去跑,这样子的话才 才不至于那么炼化。然后呢,这个又导致了一个就是色差问题,因为他不同跑的这个视频,他之间其实是存在色差的,所以当时就很难受。我其实前几天就在给别人去跑这个一分多钟的这个视频,所以感受是很明显。 那用了这个光板之后,我直接去自己做了对比啊,就是效果是好了非常多,但那个视频是因为是给别人真人去跑的,所以我就给大家看其他跑的一些案例。 那这次的话,其实呃本底简单更新一下,然后核心是这个模型啊,这个模型大家到时候要下载一下,把它放到这个 model patch 的 一个目录,那网盘这边是给大家去提供的,大家到时候自己呃去 安装一下就行了。就是这个啊,放在 model 下面的一个 model patch 这个目录下就行了,那其他的就都是我们正常的一些。呃, 跑的一些模型就是万象二点一一个土生视频的模型,这些都在这边,你们到时候去取就行了。好吧,那这次这个真的跑下来爽死了,就是效果好了非常多。那这个工作流我刚才已经测完了, 已经发布到啊,我们的 runny 上了,大家搜一下我发的这个工作流就行啊,搜嘟嘟两个字就可以看到了。那这个就是这一次的,而且这这是直接给大家做了负循环置迭代版本了,就 更爽了。好吧,那这个新人注册左邀请是有一千积分的,每天登录是送一百的,这个老手都知道的。那工作流的话这边是可以下载的哈,点击下载就下载到本地了,你们自己本地的话可以跑来就去跑,好像这个 显存占用也比那个 k g 版的更低了。好像大家这么说,我是直接在 on top 上去测它,我本地没测。 ok, 那 我们来看一下这个工作流它是什么样子的形式啊?我看一下应该是这个。 ok, 来看一下。 呃,首先是模型加载,模型加载的话是简单嘛?这个是一个 led 叉,二 v 的 加速锐克幺二八的 啊,这个就是我们今天说的这个数字人,数字人其实还有两个哈,一个是单人,还有一个多人。那我这边的话还是今天主要是讲单人,这个长时长时间的这个数字人跑的。那这边是一个声音的一个模型啊,大家也去下载。这个就是常规的一个 v a e 跟 clip 加载器,对吧?这没什么好说的,那这一块也是比较常规的一个加速的,你不想要就给他忽略掉就行。 那看一下这边,那入仓的话很简单啊,入仓这边涉及到一个图像上传啊,这边是给他设置长边限制的,然后的话这个是单帧跑多少的?我这边是默认是八十一帧的, 八十一、幺二一或者更长,你们可以测,我还没有对比过。就是不同的单针啊,跑的话它的效果,那这个其实只是影响到它这个循环几次而已,因为等于说你总的针数啊,除以这个单针就是它跑的循环的次数嘛。 那这里是音频加载,音频加载的话,我现在都加载三十多秒了。这边的话做一个裁剪啊,我,我是想跑马的话比它多一秒裁出来呢,其实还是大概三十六秒,这个简单写一下提示词啊,这是入仓很简单。 那这里的话一个是声音处理啊,这个就等于说提取他这里面的这个声音啊,就是他这里呃,唱歌的话,这个是一个唱歌的,他这里面是包含他的音乐背景还有他的人声的,那这个模型就是用来去提取这个 人的这个纯粹的人的声音的,那就给他做个编码去传进来,这个是常规的,那这边是有一做做一个负循环的这个统计啊,这一步其实可以不需要,如果我这里是写死了八十一的话,这个本身就是呃,四 n 加一的啊,四 n 加一的一个 步数了,那这里就不需要再数。这个算法其实就是说把它调整成四 n 加一的形式嘛,除以四再乘以四,不就是再加一就是四 n 嘛,对吧?那这一步的话是呃做一个 余数判断,就是呃总的,这边是总的这个,因为这边是提取这个声音过来的一个总帧数,好吧?这边这个 total flex 这个这个总帧数,总帧数除以这前面这个八十一帧的,那其实就是然后两个竖杠是表示求余的吗? 就是除完之后还剩下多少,剩下多少这个去做判断。这是一个。呃,政治表达师的意思,就是 余数啊,这边就是取余数,如果大于这个四十针的话,就就就是加一的次数,加一嘛,如果的话,否则的话就是 丢弃掉啊,这个就是这样子,一个运卷处,然后这边就是用来去统计,再减一的话就是用来负循环用的,这里不是。呃,需要做一个循环吗?这里减一,到时候跟你们说这个原因哈,那就一开始的话是先做一个裁样,就是我们 核心是这个节点,我们可以看到前面的模型,还有我们的这个数字的模型,是吧?正反条件都接进来。 那我现在这边选的是单人的啊,如果是双人的话你就选择 two 的, 单人的话就选择新个第一个,那第一个的话只要传一个音频,那这里就是我们前面这个,是吧?这个编码之后的音频给它传进来就行了。 但其他的话就很简单了,这个帧数是八十一帧吗?这里算出来的吗?是一个八十一帧然后传进来啊,这边的话磨损的话也是默认的九,你也可以调高调低,好像说调高调低会影响他的这个动态的效果,你们可以去 尝试调整一下,那其他的话就没什么了,手帧图啊,传进来就可以了。那这样子跑出来一个视频 在这边,这边就只是一个八十一针,我是二十五针一秒,那这个大概就是三秒左右的视频。第第一个跑出来的话,你先看效果, ok, 没问题的话你就可以去执行后面的循环了。如果你不想跑出来,有有问题的话,你就给他中断掉啊,就是任务中断掉重新跑, 然后核心是这边哈,就是循环这个是最核心的。然后比较细的给大家讲一下我们前面跑完之后的这个图,我们其实就是接入了这个负循环里面的, 然后总的次数其实这里有减一,就是前面这个总帧数除以我们的单次的循环,真算出来啊,一个次数再减一,因为我们第一个彩样其实是没有走循环的,先跑了一次彩样出来之后,我们再去接进来的。 那这边初始值是我们这前面跑出来这个图看见没?前面跑出来的图,因为因为后面第二个这里开始了,你看可以了,唯一的区别就是这里有个 前置的预染的针,这个就是把我们第一次上一次跑的这个值给它传进来。我这里是上一次第一次跑了,是接入负循环的初十字,所以这边出来的也是值,一看到没有,这个就是很关键的把这个直接进来,那他就等于说延续了前面采用的这个视频的这个 图片给他接进来,然后再去跑后面的这个就是一个循环的。如果你不用这个复循环,那你每一次都是要复制这一块复制粘贴,复制粘贴去排好多出来啊,你看一下其他的 up 主都是复制了好几份,对吧? 那这种就复循环就经验多了啊,那他就核心是这个值传进来就是了之前的图,然后他跑完图之后还需要做一个处理啊,跑完图之后啊,他需要两个地方处理,一个是 我只要从我第二次或者说后面本次的啊图开始,他这里有个这个,就是其实就是偏一辆的啊,就是我只总总的图里面啊,我去提取出我们这一次要跑的这一个, 所以开始嘛,就是这一步偏移的开始,就等于说我就跑我这一次的,那这一次的话还要在接上拼起来啊,我们模式负循环,我们每次传到下一个的,其实都是啊前面几次的数量的拼拼集,比如说前面跑了 呃,三十张,那这边再跑三十张,那下一次传进去,其实这个预览的其实就是六十张了,就等于说把前面积累的图都传到我们下一次的里面来,那都是这边拼接吗?就把啊图像拼字组合,把前一次跑的直接上 拼上我这一次跑的值,然后都传给这个初十值,这样子就是形成了一个循环了,那每一次都是这个值,哪家哪家哪家网,就是传入下一个的值, 这样说大家有没有理解啊?大家可以再多看一下,这样子就造成了我们形成了我们这个循环的机制的,所以说他可以这样子批量的去跑完所有的这个循环次数,最终出来的这个值,就是我们所有的图,也就是所有完整的这个时长的这个视频的图了, 再给它去做一个这个,呃,生成视频就可以了。那我们这个工作流讲完了,其实不复杂,无非就是复循环。这边认真看一下啊,那它这样子的效果给你们看一下,我同时跑了我们以前那种 k j 版本的,以及我们这个光板的,直接给你们看效果, ok, 怎么样?大家觉得是不是我撤下来啊?明显是光板这个效果更好,他这边好像动的没动作太少了,并且效果是远没有我们光板的好的。那,那这个不是重点啊,最关键的是什么?最关键的是跑图的时间缩减了一倍,我给你看一下, 嗯,卡住了啊,就比如这个吧,啊,跑了十分钟的,然后 这个这个跑了十九分钟的,你看时间减少了一半,这个也是三十多秒的,你看时间直接减少一半,一会也看这个对比的效果。然后还有这一个啊,跑了两分钟的,然后这个是有一个是跑了 这个,这个是 k j 版本的,跑了五分钟,那我们这个光板的就跑了两分钟,你看一下是不是又是减少一半,至少一半的这个事情,然后效果的话 更好,或者说甚就是完全不输 k j 版的,甚至比 k j 版的更好。我就只能这么说,笨蛋,我们快到了,这一路我一直有在偷偷地观察你,哦, 你的鼻尖,你的侧脸,还有笨蛋,是吧?快到了,然后最后还跑了一个一组,这个也是三十四秒的,我们再看这个 还拿出来一个麦克风, ok, 就 放这边啊,怎么样?真的是侧下来效果更好,时间 用的更短,然后图像劣质的话还减少了非常多,所以说我目前愿称之为这个啊,算是目前最好的开源数字人了,对吧?还是这个 infotalk 那 光板的这个真的是太爽了,那我刚好解决了我自己本身做三单这边这个跑数字人的一个需求, 之前的话那个时长太长,时长了根本跑不了,然后客户说你这个视频线衔接处怎么会有这个色差啊?我当时的处理是做一个转场,那现在有这个的话,测了几个下来效果都非常好, 完全可以跑长时间的,而且时间更短了,我跑了时长就更长了,因为 roland 上非会员是四十分钟,超时会员的话一个小时,那我现在一个小时我其实可以跑一分多钟的。 ok, 那 这个工作流呢,就分享给大家去使用啊,大家到时候去下载到本地自己去玩险层的话,应该也不会占用非常大, 因为我这边就跑一个八十一帧的单次,所以说还是非常少的。那分辨率的话目前是八三二,想要更好的效果,我可以开到幺二八零,对吧?这个四十八岁险层肯定是能兼容的。那行,那今天就到这边感谢大家的收看啊,如果觉得我分享内容对你有所帮助,记得给我一键三连哦。

let it be finished。 你 都知道了,好人全都死光了, 我看冰箱里还有点剩下的牛肉,别提牛肉了。视频我们来看到 infinite tok 的 更新, infinite tok 是 基于二点一呢去做的,很久之前我们就介绍过这项技术了。 那么最近几天的 kufui 官方进行了原声的支持,差异在于速度更快,效果更好。相较于 k 阶的实现支持单人双人猎化是非常的轻微的,可以进行逆境于无性时长视频的生成。接着我们来看到工作流和一些简单的对比测试。 我这里使用的是 kufui 在 线运行平台 running hard, 最新最好用的技术都会在上面同步更新。视频当中我所提到的工作流都已经部署到线上,可以在线运行。 先看到 infinite talk 单人的部分,快速启动上来说,我们需要加载一张图像,加载一段音频,设置一下我们需要裁切的音频的长度, 此为起始的描述。那么下面为长度设置一下宽和高,点击运行就可以直接获得结果了。我这里的结果呢是循环了两次,直接获得了一个九秒钟的视频。看到细节处 大模型,这个地方使用的是四八零 p 的 屠刀视频模型,没有必要去使用七二零 p 的 模型,效果会更差。这里是可以使用 skyris v 三的那一个新的 audio video 模型,使用起来性能与这个四八零 p 的 模型几乎相当,所以我们这个地方就用这个四八零 p 的 模型。 这个流程来自于官方的用力加载,之前我做了人身的分离,以预防其他过分造成对于我们对口型的干扰。初次生成我们会取的八十一针约是三点二四秒,因为这里的针率是二十五针为一秒钟, 不要做改编,循环构建在延长的地方就可以了。这是一个非常简单的循环,大致是将上一段视频输入 v 六一,然后由 v 六一输送到 talk to video, 输送到 face 与 face, 渲染完成的视频再次连接到 v 六一进行。刚刚所提及的循环 是这样一个状态,这里还可以更为自动化一点。我们来算一下循环的次数。首先呢我们去检测一下这个音频的是多少毫秒钟,减去三千两百四十,就是说把第一次的我们八十一针呢给剪掉, 再除以二八八零。为什么是除以二八八零呢?因为自延长部分开始,每一次的延长只会去新增八十一,减去九,也就是说七十二个针,那么秒数的话也适当的降低了, 相当于是每延长一个段落会增加二点八秒钟,最后向上取走,我们就得到了我们循环的次数,所以这接近于是一个自动化的流程。 这个猪头在我们开头呢已经看到过了,如果我们使用七二零 p 的 模型,是嘴动都不会动一下的, 所以我们这里使用四八聆听的模型和 skyrise 的 aqv 呢,都是没有问题的。这里还有一个单人唱歌的城市,如果我们用这个官流去跑的话,动态其实非常的好,当之而立身视频相对的流程已经同步更新,可在线运行。 接着我们来看到双人的部分,双人部分的效果现在基本上是停留在一个人先说话,另外一个人后说话,是否能进行多人对话,是否能进行多人对话的,而且我更加寄希望于 ltx two 快速启动上来说,我们需要去加载两个音频,那么第一个呢,是角色一说的,第二个呢?角色二说的加载两张图像, 两张图像其实是同一张图像,分别对应的是先说话的人和后说话的人。右键在遮罩编辑器当中打开来进行涂抹作为区分,设置一下需要渲染视频的宽和高, 然后点击运行,我们就会获得最终的结果。这里我也做了循环以及自动化的次数计算。 skyris v 三这个模型呢,其实在我看来没有强特别多了。其实呢,是可以简单设置一下的,不过我认为影响没有那么大了。四八零 p 的 结果多少还是会有点不清晰啊。我们可以过一遍放大, 使用这个 flash vsr 做一个放大的话会好非常多, 这就非常的清楚了。然后我们把之前的 l t x two 的 流程给它更新一下,那么这里的更新主要是来自于 hugen face 上开源的一个项目,它其实是把它的工作流给开源了,可以看到非常的强劲。 l t x two 的 对口型其实就像电影一样, 我这里部署在 runny harp 上面的是这个流程图像,视频生成的数字人模型和流程的迭代其实让围影少了很多, 然后像对于这样非人的角色去对口型, air t x two 是 有天然的优势的。现在这个流程的更新会让我们的速度变得更快,因为在第一次的渲染过程呢,我们使用的是帧流模型,从 sigma 这个地方我们可以看出来, 只跑了八步,当时开源出来的保持镜头不变的 camera control, 这样的一个乱模型对于我们结果的影响是有至关重要的作用的,如果我们把它给白 pass 了,其实特别容易影响我们的结果,还是建议把它给开着 快速启动上来说呢,我们需要去加载一张图像,设置一下我们视频的宽高,帧数,帧率长度呢是自动计算的,比如这里我们渲染了二百八十九个帧,现在呢, l t x two 的 话,抗比外官方是进行了特别好的优化的,我们可以一次生成非常多的帧, 几乎呢也算是无限时长了,因为我们一次的话生成五六百个珍珠差不太多了。奇瑞兹是要设置的 l t x two 的, 这个奇瑞兹还是比较敏感的,尤其是这个猪头,你都知道了,好人全都死光了,仅好友, 这是这个月的钱,对于这样非人的角色时常令我头疼,所以我认为 l t x two, 尤其是架构绝对是领先的,完完全全值得一试。

cufu 官方对 infinite talk 做了一个支持啊,之前咱们一直使用 kg 版本的,但是它那版本呢,如果是说做长视频的话,会有一个质量的衰减啊,所以说它的效果并不是太好。 这次呢, cufu 的 官方对于它进行支持之后呢,出来效果也是很棒的,它这个模型是可以做到无限时长的啊,也是可以通过拼接或者说负循环的一个方式来实现。 那么我们这期呢,主要是使用了一个拼接方式,因为这种相对来说还是大家更好的去理解。首先呢是它的模型下载啊,我已经把它放到我工具箱的第一百二十七行,大家直接点开之后这有个模型,然后呢这有个 modus, 直接把这个 modus 整个的文件夹下载下来之后覆盖到你的文件夹的一些结构,我都已经做好了,直接覆盖就行了。 他的工作流我已经上传的 running hub, running hub 是 我经常使用的一个在线平台哎,直接在这搜索遇见 ai, 找到这个工作流,然后就可以运行,这是他的工作流的界面, 通过我视频介绍区的链接注册的话,还会赠送一千点积分,并且每天登录也会额外赠送一百点积分,大家可以尝试一下,那么我们看一下它的工作流的组成啊。首先左上角这部分就是模型的一些加载,除了 nice 模型,然后 clip 还有 ve 之外,还有这两个模型,第一个是这个 single 信口属于一个单人的,还有个 music, music 是 一个双人的,那咱们先拿单人的来做一个演示啊,这是一个音频的一个编码器,这边加了一个加速的模型,然后这里是提车词,这是它的参照部分, 那么这可以进行一个选择,把这个地方选择成多人,之后把这也选成多人,就成了一个双人的模式, 但是呢双人模式有一个缺点,比如说一说完话,二再说,这个是没有问题,但是如果再返回来一再说话,比如说做一个多轮的对话,这样的情况就会出错,所以说那个工作流等他完上之后,咱们再做一期教程啊。 然后呢在这就是音频的上传,还有图片的一个上传,这就是整的一个流程,这是呢它的一个无限循环的部分啊,等一下咱们再讲。首先看一下它的参数的设置啊,输入提示词,输入音频,输入图片之后,这音频是有一个七秒的,咱们可以看到这是七秒的音频, 这里面呢有几个参数,第一个就是它的时长,这个八十一针,也就是说第一步采样是八十一针,这个八十一针的值不建议太大,因为本身万二点一的模型的训练的时候是使用了一百二十一针,所以说如果太大的话,它质量会有一些明显的下降,而且会容易爆选存, 所以说最好不要超过一百二十一,那么他官方给的真数是八十一,咱们可以根据情况适当调整。同样这个真数是四乘 n 加一的一个情况,因为第一针是我们上传的照照片,那么八十一正好是四乘二十,再加上一这样一个数值,那么这里面的 fps 也就是帧率是二十五, 咱们直接计算一下,八十一除以二十五等于三点二四秒,就说咱们第一步裁样,他会生成三点四秒的视频,九是他的每个视频中间衔接部分的一个帧数,也就是说他第一个视频和第二个视频在衔接的时候,他是有一个九真的补齐的, 这就是它这个参数的一个作用啊。然后呢咱们需要给它进行延伸,咱们首先是需要把它这一部分复制下来,然后再看一下这个参数,就这个参数, 这个参数其实是使用了咱们第一部分采用完之后的一个图片给他接过来就可以了。然后呢还有一个需要调整,就是这也有一个从批次获取图像,它是这个值, 这个值其实就是我们这里设置的值,大家可以看一下啊,直接在这搜索展示任何,然后呢把它右键执行一下,可以看一下,现在呢展示是九,就是这个数值,那我们把它变成十, 再运行一下,可以看一下啊,现在就变成十了,那么它的一个作用呢?就是使用这个节点把它的视频做一个对齐,如果你不做对齐的话,它的视频衔接就会出现几帧的卡顿啊,这就是它的一个作用啊。 那么如果我们想对它进行一个再次延伸,如何进行呢?首先看一下,现在咱们视频是七秒,那么这个是三点二四秒,这个也是三点二四秒,也就说现在才六秒多,还有一部分是没有说完的,咱们可以听一下啊,常教练,我记得你背符的时候,你这两个衣服兜里啊, 跟小仓库那别长脚远,我记得你可以看到还是有一些没有说完的,那么如何给他再次进行延伸呢?首先直接把这 ctrl c 复制,然后 ctrl 加上 shift 加 v, 这话是把这个线段连上过来了,可以看到啊,连着线段一块过来,那么还是需要有一个地方进行修改,首先 把这里面的图像给它抻过来,改到这里,这是第一个操作,然后呢再把这个图像 加到图像一,直接改这两个就可以了,剩下呢不需要任何的一个操作啊,咱们再点击运行一下,好,现在跑了,咱们听一下效果。长焦元,我记得你背符的时候,你这两个衣服兜里啊,跟小仓库那变戏法似的往外掏啊, 长脚员,可以看到啊,现在已经是完整版的了,那么如果我们上传更长的视频,比如说上传十秒,十一秒的视频,同样啊,按照刚才的方法直接复制粘贴,然后呢再改一下参数就可以了,具体的方法在这里面又写到了啊, 那么大家可以玩一下,那么 run the home 呢?这里面的教程其实是只有两节的,大家可以去自己去操作一下,按照这个方法。好,这期视频就给大家介绍到这里。

今天讲点干货,我用 infinite talk 配合千万三 tts 生成了一段 moth 给刘培强庆祝生日的 ai 视频。 刘培强忠孝,今天是二零二六年二月三日,是你在地球出生的三周岁生日, moth 在 平行时空二零七五年祝你生日快乐,看起来是不是特别的棒,想不想学? 今天呢,就给大家讲如何使用 infinite talk 配合千万三 tts 去生成刚才展示的那段 mouse 庆生视频。上周 comfyui 在 它的模型库里更新了 infinite talk 这款专门用来对口型的模型, 这两天把玩了一下生成出来的对口型视频,效果特别的棒。我就在想,如果使用千万三 tts 大 模型去模仿声音, 然后呢,再用 infinite talk 去对口型,是不是就能生成出来特别有趣的 ai 视频了?那说干就干,现在我带大家去搭建一下 comfyui 工作流,实现视频开头展示的 mouse 庆生视频。 首先跟着我打开 runnyhop, 搜索电磁波 studio, 点击工作流,找到 infinite talk 配合千万三 tts 对 口型工作流,点击运行工作流,你就可以跟着我学起来了。 整个工作流分两部分,先看千万三 t t s 模仿声音,在这里使用了 h a i g c 大 佬开发的千万三 t t s comfy ui 节点。 首先你需要在 loud audio 节点上传你想模仿声音的音频片段,音频片段的时长只需要五到十秒就可以了。 我上传的是一段带有科幻感女生说话的音频片段,在右边输入台词,我写的是刘培强忠孝,今天是二零二六年二月三日,是你在地球出生的三周岁生日快乐。貌似在平行时空二零七五年祝你生日快乐。 之后呢,加载千幻三 tts 大 模型,再经过彩阳器处理之后,你就能得到一段非常具有科技感的庆生音频片段了。 刘培强忠孝,今天是二零二六年二月三日是你在地球出生的三周岁生日, mouse 在 平行时空二零七五年祝你生日快乐。完成以上操作,就开始进入第二部分 infinite talk 对 口型了。 第一步,需要加载模型,在这里需要加载刚刚发布的 comfyui 版本的 infinite talk single 大 模型, 另外也加载了 light x two v 加速 lora, 用来实现四部生成视频。第二部在下面上传视频的手阵画面,也就是你要对口型的主角照片,我上传的是一张特别具有科幻感的女生照片。 第三步,输入提示词,我简单写了一句, one character is talking, 也就是一个女主角在说话的意思。第四步,设置生成视频的分辨率, 我输入的宽是一零二四,高是五七六。在右面就是视频彩样了。先看前五秒视频彩样, 我把 one infinite talk to video 节点里的 length 参数设置为一百二十一帧,因为生成出来的视频帧率是二十五帧每秒,也就是第一次视频彩样这里生成大概五秒时长的对口型视频。 下面呢,就是视频延长部分了,你只需要把上一段生成视频部分里的 ve 抵扣的节点输出的隐位置连接到下面,延长视频里的 one infinite talk to video 节点的 previous frames 端口。 同时呢,还要连接 bunch images 节点里的 image, 一 端口就可以了,这样你就能再续五秒的时长,如果十秒还不够,以此类推。你看,我总共续了两次,生成了一段时长在十五秒左右的视频。 看到这里还等什么,赶紧跟着视频学起来吧!本期视频讲的全都是干货,我建议大家好好跟着我学一下。如果本期视频对你有所帮助,请关注、点赞、收藏,三点走一波,这里是电磁波 studio, 我 们下期视频见!

哎呦喂,英菲尼拓克团队又开源了 longkat 一 点五版,数字人来和提拔那瓜娃子一起体验。提拔那瓜娃子太久不玩弯了,工作流都快忘记怎么大了,简直笑死。 结果这货反手一个呼叫外援, ai 无的重问了下,几个月没开得弯,这难道叫温故而知新? and she'd yell to me get a bell get a bell and sometimes i'd be out in the alley in the winter and she'd see me without a hat and she'd yell get a hat get a hat i just heard you found the one you've been looking you've been looking for i wish i would've known that wasn't me cause even after all this time i still wonder why i can't move on a clam eating a telephone a first angela a lamp, a soup factory a continental breakfast a chicken oh i am so good at this to dislodge a jury who is violating the judge's rules or the judge's right words well, then then you run the risk of looking like you're taking out your cherry picking juries that you can get the uh the ruling that you want。 我是个战神,怕的不是死,而是 没有真正的活过。大家好,我是迪吧。今天呢,给大家介绍一下 long cat video 的 一点五版本,那自上次的发布应该已经过了快四五个月了,我们看一下 啊,确实已经过了快半年了,那这次呢?说实话,测下来还是可以的。首先来说画质非常的清楚, 你用一个全身人物脸一点都不光,而且呢啊,人物的美感,一致性保持都非常好。当然,如果说要缺点的话,那肯定是速度是比较慢的,像我们现在 ltx 可能跑个十秒钟的视频啊,只要两三分钟, 这个呢,跟之前 infinite talk 一 样的,你跑个十五秒,二十秒的视频基本上要二十到三十分钟,还是比较长的一个时间。但是呢,侠不掩于啊,抛开深层时间不谈啊,如果说我们只需要质量的话,我觉得还是可以的,因为它非常的清楚, 因为 infinite talk 包括这个龙猫都是这个美团的团队开源的,就是说它们的底膜不一样而已。 那我们今天可以来到 ruby 哈布看一下,昨天呢已经把这工作流上架了,然后呢我也测试了多条,然后呢给大家展示一下啊,告诉下大家啊,这个怎么设置,包括前面我们看到会快速的进行一个多图的一个生成都是可以的。 首先我们来到 ruby 哈布,这是我最常用的 ar 工作台,每天都会更新最新的一些项目节点模型,我们可以在这里学习最新的 ar 技术, 那通过评论区链接注册还会送一千点,每天登录都有一百点。那前两天给大家更新的 stable odyssey 呢,因为要更新本体,当时工作的没有发,今天呢也给大家已经做好了啊,已经上传了。那这两个呢,是我刚才给大家展示的两个数字人,第一个呢就是我们多段的,也就是说同一个人物, 第二个呢是可以多涂的,然后呢,比如说你要唱歌啊,要贴近啊,也可以用这种方式。好,下面我们来介绍一下他的一些搭建和注意事项。首先我们先看一下整个工作流 啊,如果说一些新人看到这个工作流基本上头头大,说实话我好久不开玩了,我自己看了头头的大啊。首先我简单给大家说一下,上面呢是我们正常的,就是我们啊尺寸啊,我们可以改成 啊,就是同比放大的,就整除一下就可以了。这里呢是他的一个上下纹的针,那默认呢他是一个九十三针, 那我们要注意一下,你可以设置更高一点,但是呢一定要符合一个条件,他比如说是四的倍数加一,比如说一百零一是可以的,但是九十九就是不行的,他会给你个报错,我们这个要说注意一下, 我们在人力汉堡上跑,你这样可以跑一百二十一也是没问题的,它会稍微长一点,这样的话呢我们就不会啊太短,因为它是帧率是二十五的,你哪怕是至一百零一实际上也就四秒,那如果是九十三,实际上只有三秒多,中间呢还有十几帧的一个重叠, 所以说呢,你需要把这个工作流啊连的非常的长,这是我非常讨厌的一个地方,但是呢有个办法就是我们做循环啊,今天太晚了,没有给大家做循环。第二点呢啊,在这里给大家说一下啊,这里呢是我们的提示词, 提示词可以看到我们要写的比较详细一点,那如果说我们写的比较简略呢,他就没有什么动作,也就说呢我们需要给他一个上下文,这个上下文什么意思呢?也就是说呢有的模型呢,他是 不清楚画面到底发生了什么,这个时候呢我们通过告诉他一个上下文,比如说啊中间有个什么颜色头发的女人,对吧?他拿着一个什么样的啊?扇子,或者说背景有些什么样的东西,这个时候呢他就会比较好的有一些动态。 那这里呢给大家想了个方法啊,就是我们这边可以用千问三,或者说其他的模型都可以了,我这边呢用的是 jimmy。 然后呢这里呢我们做了一下啊操作,就是把它分成五段,然后呢做成一个分段的方式 啊,常规处理字体,把空行去掉,让它呢变成多段。那一段呢我们每一段去给一个提示词,可以看到它获取啊,从第零个, 然后获取一行啊,第一个获取一行,这呢就是他这个分段提示词,这里呢我写的还比较简单,所以说呢他动态不会太高。我们呢可以在这边的提示词啊,就是总提示词,这里呢去要求他一下,告诉他啊动态幅度要大一点,让画面呢更有画面感啊,这可以大家可以自己改,我呢是没有改。 然后呢我们分段呢把提示词给过去,然后呢就可以进入生成了,那在这里呢我们也稍微注意一下啊,这呢跟我们以前的啊是一样的,就是呢它里呢这里呢会有一个图像的,可以看到 overlap, 对 吧? 我们在这边可以设置一会,我们在多图时候说到它有十三帧重叠的,这样呢就可以比较好的保证啊,它比较有个连贯性,但是坏处呢就是你本身 它已经是 fps 二十五了,那我本身一百零一帧也就四秒,现在我还要去掉十三帧啊,这个呢就会导致我们时长呢变得更加短一点。后面呢我们在这里呢还有两个 latent, 一个呢是啊,就是前置的 latent, 我们可以看一下这个前置雷达在连到哪里呢?在第一段的时候呢,我们是连到我们的图像,也就是说把图像直接编码,我们来显示一下,可以看到直接连到了图像,对吧?然后呢我们在后置的时候呢,因为我们开始的话,我们就不需要这个了,那我们就是从我们这边出口,我们看一下我们的出口, 我们看一下啊,对吧?你看呢,这是我们 reference later 的, 对吧?这就是我们前面那张参考图,但是我们上面 previous 的 later 呢啊,就是我们用前面我们看一下,从这里采用出来的,给到它。那这里呢,先给大家说一下,因为在后面多图的时候呢,会要用到 啊,后面的连法呢都是一样的。 reference later 呢,就是我们正常的图像啊,这样呢就保持它的一个稳定性。 那上面的呢就是我们继续啊,把这个雷头传下去,然后呢一个一个生成,那我们可以继续往后接,那最后呢就是我们这个效果,刚才看过了,对吧?啊?真真在那撸猫。然后呢我们可以看到啊, 以前在 eiffel talk 一 二八零是七二零,脸那么小,百分之百崩的,但是可以看到现在还是非常好的,而且很清楚,是吧,可以看到那个猫也在动啊,当然这猫也在说话,因为我们现在没有做遮罩,所以说呢,有嘴巴的动物啊,等等,它都是会有这个口型的, 这个呢是一个问题,但是如果说你做遮罩的话,就是可以解决这个问题,我们就是把它猫给屏蔽掉就 ok 了。下面呢我们就来到多图切换,比如说你想做首 mv 啊,用这种方式还是挺好的,当然我们考虑它的时长,所以说呢,我看一下这边大概跑二十秒左右呢,花大概三十七分钟 啊,所以说还时间还是比较长了,但是我们用多开的方式的话,效果还是可以的。那首先我们来说一下啊,他跟刚才的啊设置的一些不一样的地方,我们看一下这里呢,我给大家做了五段的图片,当然你也可以啊,继续加也是可以的啊,但是本地你可以继续加, 在线的话你最多也就六到七段了,否则的话超过六十分钟它就自动停止了,那我们来看一下。其二呢,就是我们这边每个图像都要重新啊, v 一 编码一下,然后呢它需要传到我们所有的这个各个节点,我们来看一下,连一下连线,好显示连线,我们看一下这第三段,对吧?它就会连到第三个。 然后呢我们看一下我们后面的呢,是每个都是把 reflaten 以及我们的 reflaten 的, 对吧?它前置雷腾的,为什么要传的过来呢?因为我不要前面那一段的啊干扰。下面呢肯定是要的,因为我要按照这个图像啊进行参考。 第二个呢就是我们之前啊,刚才有一个啊覆盖 overlay, overlay 呢我们不需要去掉,但是我们这边啊设置低一点,比如说你设置个一,但是零也是可以的,零就是互不干扰,一呢就是有啊一帧的这样一个重叠, 这呢根据大家需要啊,自己去设置一下,但你不能设置高了啊,设置高了你就会有花屏啊,各种问题都会提现在这里,然后在我们文本的部分呢,也要每个啊传一下,我们看一下这边每个文本它都是不一样的,对吧?这里呢按照刚才的方式,我们先用我们的语言模型进行优化一下 啊,每个都要优化一次,这里呢你可以换成千万三,这样的话呢就是完全免费的。好,我们看一下这边女人在说话,你这样可以写的更加好一点,我刚才比如说我们唱歌,他动态会更多一点,我们会说女人在说话,然后呢做出各种好看的姿势, 如果说你希望动态更大的,你可以说女人激情的再说话,激情的或深情的都可以啊,这边就根据大家啊实际的一个要求去制作,后面的部分呢也是一样的,我们看一下我们雷特的一个传递, 对吧?啊?这个雷特传递呢,全部是传用前面的啊,就不再用我们上一轮的雷特了,你看到这边全部是空着的 啊,这呢就是整体的一个构架,那我还是那句话,实际上这个项目是挺不错的啊,首先来说他非常的清楚,然后呢支持,包括像刚才动画,卡通啊,这些动漫啊,甚至一些非人类, 哪怕人类也是可以的,而且呢非常非常清楚,动态呢,也还可以,唯一的缺点就是太慢了啊,这是确实是个硬伤,但是我觉得比如说我们再跑一些 多并发症的时候,我说你想让他跑一个歌曲啊,我觉得用这个方式非常好,因为这个脸部非常好看,而且在那个小人的时候,就全身的时候,他脸部依然非常稳定啊,这是最重大的一个地方。 第二个呢,就是如果说你希望他更快一点呢,我们可以把这个分辨率改低一点,我这边因为用用的是一二八零七二零,但是呢改低了以后呢,你就不能跑这种全身小偷了。 好吧,如果说你想跑这种就没有关系啊,完全是可以的。好,那今天的教程呢,就到这里了啊,欢迎大家来 reno 玩一下啊,这确实是一个不错的项目, 记得给提拔点个赞。另外我们公司 a x 开发的无线画布呢,大家也可以来玩。点击右上角输入绑定人一零五六二啊,可以领取三百 minus。


兄弟们,免费!数字人都颠到这个程度了吗?这是一张你的自拍啊,他可以唱这个。他们不单朝我扔泥巴,阿坤拿泥巴能种荷花。他们扔石头,阿坤能砌小楼。这是哪吒和敖丙。他们不单朝我扔泥巴, 天下万物,万事不对,他们是芬达和郭老师,就连马斯克也可以唱修炼爱情。 这个项目叫 ifintalk, 完全开源,免费支持本地部署的数字人项目,我研究了一下,做了个整合包,现在你也能用了。它支持图片和视频两种,数字人视频 也支持单人和双人对话。拿图片模式为例,先丢一张图到这里,然后给它配上声音,最后开始升腾就行了。为了方便大家做数字人口播视频,我专门做了一版口播优化,提示词更丰富、更生动。唯一的缺点就是这个项目对配置要求略高, 够的可以直接上云端。飞哥也专门录制了详细的视频教程,确保每个小伙伴都能学得会、用得好。 ok 工具箱 ai 专区已售罄!

做 ai 视频最头疼的对口型难题被 y 二点二首尾针加英菲尼太太对口型根治了,很多人卡在这里。首尾针脱节,口型与音频对不上,操作复杂费时间。今天上硬货! 它的核心优势,拉满首尾针,精准对齐英菲尼太太对口型,黑科技,语气节奏同步不僵硬,看一下效果,人生不过三万天, 一天三顿九万顿饭。操作极简,免费开源,不用爬梯,普通电脑也能跑。适配 ai 漫剧、 ai 音乐、虚拟人口播等多场景。 三步速上手,一分钟出片。第一步,打开工作流,上传首尾帧图片。第二步,导入想要参考的音色,输入人物说话的提示词。第三步, 调整好视频长度和帧率,一键运行导出即用,掌握它,批量出片,效率翻倍,收益轻松来。相关的工作流和安装包模板和技巧已整理五百六十期,直接体验。

千人千面,今天的你 喜欢什么样的我?小伙伴们大家好啊,最近这个 ltx 二点三模型进行了更新啊,它之前是二点零,不知道怎么的一下就蹦到二点三了,然后在现在开源视频模型就说相当于是一片惨淡的情况下, 其实 ltx 做出了这么大的更新,也是给我们开源社区打了一个强心针啊,因为这个闭源模型,特别是肾的二点零确实是太强大了,但是他这边要不就卡审核,要不就不支持真人,说实话,如果针对于生产力来说, 确实是太耽误事了,如果是开源模型,特别是视频模型能胜任这一点的话,那才是真正的生产力到来的时候啊,所以说我们也需要对开源社区有一点信心, 并且这次更新了,效果也确实是不错的啊,大家可以看一下我这边生成的最终的效果。首先本期对应的工作流呢,我这边也同步上传到了 rng 这里,大家在 rng 这里点开就可以直接使用了啊, 如果是新用户这边用我地址注册还能送大家一千个积分,每天登录还能送大家一百个积分啊。你像是 rng 这种平台呢,它是不管是开源模型还是闭源 api 调用之类的都是可以使用的, 所以说可玩性还是很高的,并且也是随着生态基本每天都在上新东西啊啊。所以如果像是视频这一类的开源模型,对我们电脑显卡,对我们电脑显存压力比较大的话,还是推荐大家云端玩一下。你像这个 说实话,这个 ltx 二点三光这个工作流的模型就占了八十多个 g, 第一是对显存压力比较大,第二是对这个硬盘消耗也是比较大的啊, 大家可以先在云端跑跑是吧?如果觉得效果可以再把它补全到本地,没必要一上来就这么刚啊。我们说一下这个工作流具体怎么使用,首先啊,它整首先呢,它整套逻辑和之前 ltx 二点零其实是一模一样的,它只是做了模型的升级。 这工作流呢,使用也比较简单啊,大家只需要把模模型和对应的节点补全就可以了, 需要的节点和模型我也会同步放到网盘里头,方便大家直接使用了。然后呢,这边有个提示,这边呢大家就上传一个图片,然后这里呢有个简单的提示词写法,这个提示词优化的这个模块呢,我是用了 workface 这里它给做的原指令啊, 就直接用了它这个原指令的。然后如果是在大家如果是在 rng 哈普这里跑的话,可以用 rng 哈普这里的,就说优化原指令提示词的这个节点。当然如果大家本地的话, 是需要用别的 api 调用的,像是这个真真这一块的,大家按照这个注试去,在这里把自己的 api 密钥给复制过来就可以了,一定不要混了,因为近期好多小伙伴问我为什么从 rng 下载工作里头在本地用不了, 因为他这里有专门的优化的节点,如果大家本地使用的话,就从我这个就是资料库里头下载这个本地版本就可以了,资料库也在网盘里会发给大家, 包括每天更新的工作流都是一样的,在这里优化完之后,剩下就是模型加载的一些常规参数,和之前一样了,这个没什么要讲的, 这里啊有个 c 个码调度器的参数,这是 t 八给的一个优化的优化的数值啊,测试下来确实是比官方原声的效果好得多啊,对于人脸的一致性保持也是相当不错。当然 ltx 一 直有个缺点就是第一 他生成我们中文的时候总是带一些这个字幕,这个说实话属于这个模型原声问题没有太好的办法优化, 只能大家通过抽卡来解决。可能是因为他训练数据的时候用了大量含中国字幕的这个视频啊, 这个也很正常啊,我们如果说训练外国的呃视频,肯定也会找一些外国的视频素材,我们也都不懂外语,肯定尽量选那些带字幕的,所以说这个问题没有太好的解决方法,暂时然后其他的就大家一键指出就行啊。 这参数也很简单,下面比如说视频宽高,然后多少秒都在这里显示了,整体效果还是可以的啊,大家可以拿着试玩一下啊。纹身视频呢,其实做的意义不大啊,大部分情况我们都是用土生视频来做的,之前这个土生视频确实是很拉胯啊, 纹身视频二点零,大家直接用之前的工作流,然后更新一下模型就可以了。然后如果是本地使用的话,大家需要注意啊,一定要把这个康菲悦更新到最新版,这肯定是最新版才支持的啊。当然如果大家能用秋叶什么的 这种工具去更新也是可以的,只不过我一直推荐大家学会原声的更新方式啊,其他的也没什么了。这样的模型和工作里边还有几个比较重要的节点,我都会放到网盘,或者说放到视频简介里头,大家到时候自己下载就可以了。好嘞,谢谢大家,再见。
