粉丝932获赞8.0万
![#ai主播 #ai 如何接入so-vits-svc?用什么版本?4.1版为什么会报错?运行哪个程序?在哪下载?
项目地址:https://github.com/Ikaros-521/AI-Vtuber
相关整合/半整合包发布 https://github.com/Ikaros-521/AI-Vtuber/releases/
夸克网盘:https://pan.quark.cn/s/e6755e65dc05
阿里云盘:https://www.aliyundrive.com/s/JRWomhcpeN9
我训练好的4.0的模型:https://github.com/Ikaros-521/so-vits-svc/releases
4.0的旧版本整合包在网盘
羽毛佬视频:【AI翻唱/SoVITS 4.1】手把手教你老婆唱歌给你听~无需配置环境的本地训练/推理教程[懒人整合包]
https://www.bilibili.com/video/BV1H24y187Ko
羽毛佬笔记:https://www.yuque.com/umoubuton/ueupp5
网盘资源大概更新会慢一步,尽量优先GitHub
合集:https://space.bilibili.com/3709626/channel/collectiondetail?sid=1422512
如有bug,欢迎issue](https://p3-pc-sign.douyinpic.com/image-cut-tos-priv/c938e04c79e895207bcc981544b62c4b~tplv-dy-resize-origshort-autoq-75:330.jpeg?lk3s=138a59ce&x-expires=2102677200&x-signature=LisTPaYKlsSbl4Pf%2BSuVb5j0Qmw%3D&from=327834062&s=PackSourceEnum_AWEME_DETAIL&se=false&sc=cover&biz_tag=pcweb_cover&l=202608212136558AE1C143DB0E7DE58244)
ok, 欢迎大家收看本期视频,那么这期视频来讲一下所有 v i t s s v c 的一个相当的配置,其实我之前是讲过的,讲过一次了,在刚接入这个所有 v i t s s v c 的时候,我已经讲过一次了, 大家可以直接去看这个,那我现在是再讲一次,因为是有些版本问题,当时是没有讲到。 ok, 那其实我这个文档其实是有写了,但如果赶时间的话,我现在就给大家讲一下,如果你是四点一的版本,你可以直接看这边 faq 他们的使用过程,这边有一个报错,因为相关的项目的报错,我基本上都会写在这边 报错,这边有一个这个 a p i 的这个运行的时候的会报一个错,四点一的版本 你需要修改一下这个代码,三十八行这边是传餐啊,接收参数少了一个,就是这个问题。 ok, 那我们先来展开讲一讲,搜索 bics cc, 重新讲一讲一遍啊,再完整一点, 补充下来,官方仓库 word 模型以及使用教程 好,以及修改的内容模型和配置文件。这边也再次的强调了一下这个四点一版本的问题。 ok, 那我们实际来演示一下, 我们两个都演示一下,我们先试看一下四点零旧版本, 这版本现在是没有下载了,我自己是把那个就传了一遍。我们启动的是这个 fast api, 这个脚本是我自己写的,给大家看一下里面的内容。 大家需要注意的是,你这边启动 web ui 的时候,这边它其实是有写相关的命令的,你要看它的 web ui 这边是使用这个 work emv 下面的 python 去运行的,然后我们这边 fast api 发送也是使用这个 python, 然后直接运行这个可以了。那么在运行之前我们先配置一下我们的这个 模型和一个配置文件啊,用用 mitis, 用 miss 的吧,然后在下面 model name 我这边写两个,其实把前面就删了就是了。 嗯,模型地址, logs 四四 k 一卡的一个模型,那么这个模型一般你训练的时候都会生成在这个路径,所以说你训练的时候 啊,但那万一你没训练,你没有训练的话,你就自己创建他。这模型是在的 logs 四四 k 下面,你放这边,那你放别地方,你路径改一下也可以啊,无所谓。然后模型这个名字, ok, 路径写好,然后配置文件是在 config 下面有一个 e 卡的点 jason 可以看一下,它里面有 speaker, 这边是 e 卡,那么 一刻之后要填到我们配置文件里面了。 ok, 那么这个两个都配置好之后,我们就运行我们的, 我就用脚本运行,那么我们的 v i t s 啊,不是搜 v i t s s v c 运行还是比较慢的,我们稍微等待一下, 那么同样四点一也是一样的处理啊,这些不用,这是刚才说的,刚才在最开始已经说过一遍了,就是一样的,只不过他有个代码在新版本的包里面是写错了,所以导致, 导致这个有用户在运行 plask a p i for song 的时候 会报错。哎,我前面是不是读错了,算了,我们这边同样也是这个配置好,这边没配 哦,这边是我训练我新训练的模型,所以说刚训练出来的他是这样子的,然后看下 config 吧,他这 config 训练之后,他就是保持在 config 里面的。 ok, 对上也是一样的, 看一下启动怎么样了。 ok, 启动成功了,看一下运行的这个地址,幺二四七点零点零点一,冒号一一四五, 这个是我们的本地的一个服务啊,这个其实你本地 api 本地的一个 ip 地址,就是局网内也是可以访问的啊。另外的话,我们这边是开了一个 vits faster, faster 在这边做 t t s ok, 那么两个都开好之后,我们运行我们的 g i 哦,已经运行过了,这是一个新的 bug, 就是我们的 gi 运行之后,他有个线程,其实是没有删干净啊,他挂在后台了,所以说导致我们这个监听啊,监听,监听不上了,这个 map server, 所以说我们需要手动的去结束一下这个 python 的这个进程, 然后我们重新运行。 ok, 运行成功,我们配置一下 银河神,用 vits fast, 那用其他的也行啊,用 fast 测试比较快,然后的话往下翻搜 vits vc 启动是配置路径,这边应该要改一下了,我现在是移到 e 盘去了, 没改成一坛的。这个康菲一个死。这个路径。对的啊,端口 ip, 端口说话人音调夹的默认就可以了。 ok, 保存一下, 保存成功,看一下这边搜 mits 啊,已经运行好了,我们直接运行啊,那我们用 mitits 就是看不出效果,因为我们这个, 我们这个啊啊,我们这个两个都是一卡的。没事,我们直接看输出结果,放大一点 啊,你好, 看下日志。你好,可以看到我们这边是 fast 的输出结果,这边就是这个 搜 v i t s s v c, 在调研后,它是有一个这个 will two way 的一个请求啊,这请求是反应的,返回了一个两百,也是没有任何的报错信息。 ok, 我们是合成成功了,不过是有点慢,第一次有点慢,我们看第二次,你知道什么?第二次很快了。 ok, 那就是我们四点零的版本,我们看一下四点一的,那四点一我们刚刚也看到了配置文件和这个模型 也是配置好了,我们也是还刚才说的那个代码需要改一下,就是这个 flask api for 送这边往上翻三十八行这一块,这个 这个传餐少了一个,我们随便加一个就行了,他反正这边没有用到,随便加一个变量在这边就可以了。 ok, 补上,这个我们可以运行了,我们还是到出来运行这边,同样也是看一下这边 y b y 它这个原来是怎么运行的, 也是这个也是这个命令啊。 ok, 我这边好像没有写那个,我们刚好直接趁这个机会我们先复制一下,趁这个机会直接写一下吧。启动,直接叫启动 a p i 吧,简单点,反正也我自己用啊。 然后把这个编辑一下,复制一下这个 flask 的文件名替换一下,这个前面的这个 eq 就不要了。 ok, 保存 变形, 我们现在就直接盯着他来看,把这个也开起来,这样的话我们可以看到他们的动静了, 如果长时间没有运行的话,可以回车几下,可能卡住了, 哎,应该没有别的漏奖的地方吧,我们顺便在直播间出发一下也可以啊。啊,先不说了啊,待会报错了,哎,可以看到给大家看下报错是什么报告,你好,现在是没有 a 片,还没有那个 就有报错啊, can the connect to host 无法连接到我们这个主机啊,这边报了一个错, ok, 这边开起来了, 我们再来一次,这边看合成啊,这边有一个开始的一个日志 数出了二百 站好,没有声音。 四点一可能还是有点问题啊,但大致是没留神,我记得之前是测试成功有声音的,我记得第一次是没没声音,第二次就有声音了,反正也挺奇怪的,我再来一个,你好,有了,有了,第一局没声音啊, 你叫什么名字啊? ok, 那么我们四点一也测试完毕了,那我们最后再来讲一下 在哪下载,当然一般你既然知道这个的话,你肯定知道在哪下载,我们直接在 b 站搜搜 b i t s s b c, 然后就可以看到羽毛佬的整个 包了,再加一个整合包,你们老四点一整合包,他其实是有这个。再来简介文档,文档进来默认是首页,我们点 crosscass, 然后这边右侧目录下面下载完整版,有 google 和百度云的这个网判,这个就是新版的,下载一下 sene, ok 搞定。 那么这就是我们的搜 v i t s s v c 四点零和四点一的相关的一个接入的一个讲解, 那么希望大家在使用的时候能理解一下, 你也不要把这个其他的模型啊乱七八糟的,别的地方的模型考过来就乱用啊,他们有的模型是不兼容的, 那 v i t s 和所有 v t s c c 也是不一样的,你们不是要随便一个模型弄过来就就往上一搞啊,就不能用,不能用。 ok, 那么本期视频就到此说,我们下期视频 name, 拜拜。

水友们好,今天这个视频要给大家分享一下使用 sovi ts 克隆自己声音的操作实践。这个项目功能非常强大,不仅可以简单几步就训练自己的身体,也可以用来训练 aimo 不知名歌手,让自己的二次元虚拟老婆开口唱歌也是没问题的。 开始之前,咱们先看看这个项目的效果,我这里使用了上一期关于 lanching 部署的视频中一段音频为例,那么咱们先听下原声的效果吧。 项目包含几种使用模式,可以使用基本的 ai 模型对话功能,和 chat g l m 没有什么区别。知识库问答模式里,我们可以创建自己的知识库,并且上传知识库文档,或 接下来的是用我自己原声训练的模型效果。 项目包含几种使用模式,可以使用基本的 ai 模型对话功能,和 chat glm 没有什么区别。 知识库问答模式里,我们可以创建自己的知识库,并且上传知识库文档或文件夹,支持的文件包括 text、 word 文档以及 pdf 文档等格式。 我自己实测的效果还是挺不错的。那么接下来我将分享一下这次模型训练的全部过程,希望能对感兴趣的水友有帮助哦。 sovits 的项目整合包请自行到传送门下载,请务必谨慎使用哈,不要用作任何侵害他人权益的 事物,稍有不慎可能要进去踩缝纫机的,哈哈。开始训练之前,我们需要准备一些声音数据集,这里我直接使用的是自己的口播录音素材,拿着文稿朗读,录制了大概十分钟左右的音频资料。 有了音频资料之后,我们首先对这些音频素材做一些处理,我使用的是一个名为格式工厂的格式转换工具,这是我很常用的一款工具软件,处理图片、音频、视频格式转换非常的方便。 这里我们要对音频数据做一下分割处理,如果你有多段较长的音频素材的话,我建议先使用格式工厂的音频合并功能,先把所有音频合并成 一个音频,再做切分,这样的话切分好的音频会在同一个文件夹里,操作起来比较方便。 项目训练所使用的音频格式是 wav, 所以我们需要把音频转换成 wav 格式,在格式工厂中选择转换 wav 格式,导入刚合并好的音频文件,在转换之前设置一下音频分割。 根据 sovits 项目文档的介绍,建议分割的音频长度在十到十五秒之间,我这里选择将音频分割成固定长度十五秒,当然也可以根据自己的电脑性能情况定。 等待工具处理一会,我们就得到了若干个切分好的音频文件了。这里需要特别说明一下,训练数据的质量非常之重要啊,尽量让音频数据不要有杂音、 回声以及背景音。我在训练这个模型的时候,第一次制作的音频数据集就不太好混,响音太强,导致最后训练出来的模型效果带有大量噪音,完全不能使用。 音频数据及处理完成之后,接下来我们就可以启动项目开始模型训练了。 sovits 项目有组织一直更新,再次感谢大佬们无私的奉献,项目整合包请水友们自行准备哦! 我们在项目整合包里启动项目,稍微等待一会会在浏览器里自动打开项目站点, 这个本地部署的项目可以提供模型的推理以及训练,还有一些有趣的小工具供我们使用。我们可以先打开训练模块,稍后我们将会在这个页面中 进行模型的训练。现在我们可以把前面制作的音频数据集放到项目文件夹里了。首先在项目目录下找到 data set 下划线 roll 文件夹,我们的训练数据集就放在这个文件夹里。根据我们自己的需要创建一个文件夹, 我这里按照自己的名字命名了一个文件夹,然后把刚才制作的音频数据集拷贝到这个文件中。 我们回到项目站点,在训练页面点击识别数据集,系统会自动识别数据文件夹并显示到网页上。数据集后面的配置可以直接使用默认的就可以了。点击数据预处理,这里可能会等待一段时间,如果你制作的数据集比较大的话,就耐心等待, 等到处理进度达到百分之一百就可以了。 数据预处理完成之后,接下来我们需要再设置一些配置项, 配置的信息自己查看参数说明就可以,这里我觉得只有批量大小,这个参数必须根据你电脑的配置做设置。我的显卡是八 g 显存的,默认参数带不动显存会溢出,所以这里我调整成了四,大家根据自己设备的情况配置就可以了, 其他参数基本可以不动。需要提醒一下的是保留模型,这个参数默认是只保留十个模型,我这里就发现训练一下午, 结果前面训练的模型就被删了,这里可以给他设置成零,这样就不删除模型,慢慢挑选效果好的模型,哈哈。配置完成之后,点击写入配置文件,这样就完成参数配置处理了。 接下来就可以开始模型的训练了。项目提供了两种方式,一个是从头开始,另外一种方式是继续上一次训练的进度。这个功能我就觉得特别的好,电脑不行时间来凑。 开始训练项目会弹出一个训练进度的监视窗口,我们可以不用管它,让电脑自行训练,直到你不想再继续训练为止。当我们不想继续训练的时候,按照键盘上的 control 加 c 就可以中断训练了。 结束训练之后,我们可以在项目目录下找到 logs 文件夹,训练过程所产生的模型文件以及训练日志都可以在这个文件夹下找到。我们可以打开训练日志,查看模型的训练的一些数值。 根据作者的说法,模型生成日志中 los 的值越小,则表明模型效果越好,所以并不一定是训练的次数越多越好。在日志里找到 los 最小的模型,大概率就是效果最好的吧。 我们回到项目站点,在推理界面中选择一个合适的模型,并加载模型文件。项目将读取选择的模型,并显示说话的角色。加载成 成功之后,我们就可以测试一下训练的模型效果了,只需要拖入一段原始的音频文件,再设置转换参数就可以了。这里要注意放入的音频文件要求去掉背景音乐之类的环境音,否则转换的效果不好的。 至于参数设置这部分需要注意一下自动 f 零预测这个选项,如果放的是唱歌的音频就不要勾选了,得到的输出结果有点鬼畜,哈哈,其余参数自己查看参数说明就可以了。 以上所介绍的流程就是我自己实际操作这个项目的一些经验了,关于 ai 唱歌这部分,我也做过训练实操了,这个过程的一些经验也分享给各位水友。主要就是不同数据级对 ai 唱歌的效果影响吧,一是 使用干声口播的音频数据集训练出来的模型效果。二是使用干声唱歌的音频数据集训练出来的模型效果。我这里表达一下我自己实际训练的感受。 我使用了刚说的两种数据集分别训练同等步数的模型,最终实测效果是使用唱歌数据集的模型在唱歌场景下的表现要比口播数据极强很多,特别是在低音和高音的表现上,远比口播数据集训练的模型要流畅。 接下来我在播放两段不同模型所合成的 ai 唱歌的效果,大家可以看看实测的效果差异。首先播放的是使用口播语音数据级的模型效果, 现在播放的是使用本人唱歌语音数据级的模型效果。 总结一下这次的分享内容,首先就是分享了关于 sovits 这个项目使用流程的实操经验。 第二个针对不同数据级的模型对 ai 唱歌方面的表现进行差异对比, 希望这些实操经验能对水友们有帮助,感谢你的一剑三连,好了,今天给大家分享的内容就到这里了,再见。

ai 孙燕姿火遍全网,以 b 站为例,由孙燕姿翻唱的各种歌曲都异常火爆,不过由 ai 孙燕姿生成的歌曲过于真实,导致互联网上出现了很多反对的声音,因为此类型的歌曲很可能会导致侵权行为。 不过,由于针对此类音乐的版权法规还未出台, ai 孙燕姿音乐仍然可以在 b 站 youtube 平台播放。 ai 孙燕姿的制作主要使用了 sovics svc, 这是一个开源的人生克隆项目,由 b 站的羽毛部团开发。 so with 可以通过输入人生样本训练模型并模拟某个人的音色。现在我就为大家演示一下操作流程。在开始前,你应该准备一 一张支持 code 现存六至以上的英伟达显卡,以及 windows 十及以上的操作系统。今天所用到的工具和数据及小微已经整理完成, 感兴趣的同学可以通过电子邮件联系小微获取百度网盘下载地址。值得注意的是,为了尊重音乐创作者的版权,请大家不要在未经授权的情况下制作音乐或者商业化使用。 第一步,下载最新版的 solids svc 四点零整合包,完成下载后解压文件即可启动 webui。 第二步,准备高清的声音素材,用于 ai 学习。值得注意的是,为了获得最好的音色, 大家应该使用无损的人物原声作为训练素材。如果你有歌手的 cd 唱片,则可以提取音轨并保存为 flac、 alac wave 等格式的文件, 或者直接下载 flac 格式的音乐。第三步,使用专用软件提取人声。 进入 google 搜索在线人声提取词条,选择第一个搜索结果 vocal remover 从本地上传一个音乐文件, 等待几秒钟后,系统就会完成人声音乐的分离,把分离后的文件下载到本地即可。如果你觉得处理的音频不够清晰,也可以使用专业开源的 ultimate vocal remover 工具,也叫做 u v 二五,完成最佳的人声提取。 uvr 同时支持 windows 和 macos 系统,大家可以点击下方链接,在 uvr 官网或 gap up 下载最新的版本, 下载并安装最新的 uvr 五点五版本,点击 select input, 从本地上传需要分离人生的歌曲。 select output, 选择输出的目录即可。 在此我建议大家选择位格式输出,选择三二零 k 的音质。关于其他的参数设置,大家可以参考右侧对照图,按照这个方法上传尽可能多的歌曲,并完成人生分离。 如果提取出的人声有杂音,也可以使用 adobe audition 或者 r x 十 adio editor 完成降噪处理。第四步,切割音频 一般来讲, vivo 格式的歌曲文件往往在三到五分钟之间,文件容量也比较大。 而在训练模型的时候,我们则需要把一个歌曲分割为十秒左右的文件,以保证模型训练的速度和质量。点击下方链接,进入该放,选择下载这个名为音频切片机的开源工具, 完成下载后,运行 audio slicer, 把分离后的音频文件重命名,建议英文和数字组合,然后批量导入分离后的人生文件。设置好输出路径,点击 start 按钮,完成音频的批量分割。 把分割后的文件夹复制到 so with the data set raw 文件夹中。第五步,训练模型完成了前期的准备工 工作,我们就可以开始训练模型了。打开 webui, 选择训练,点击识别数据及参数,保持默认值,点击写入配置文件,点击从头开始训练即可开始训练模型,点击下方数据预处理,开始训练模型。 根据显卡的性能不同,该过程会持续一定的时间。第六步,模型推理,点击刷新模型,选择一个训练好的模型,然后选择配置文件,最后点击加载模型。在此小薇选择一个训练了两万步的模型。 下一步,上传一段不带背景的人生,在此小薇使用 so 二生成一段简短的歌曲, 然后使用 vocal remover 工具完成人声和背景音乐的分离, 下载人声并上传到 service, 点击转换按钮,等待少许时间试听一下效果。 现在我们就完成了今天的操作,今天用到的工具请联系小微获取。最后再使用 sovis 的时候,一定要严格按照版权法规定,不要做出侵权的行为。今天的视频就结束了,感谢大家的观看,欢迎大家点赞、订阅、转发本频道, 如果你有任何问题可以在视频下方留言或者联系小微,欢迎大家收看本频道的其他节目,再见!

你们听过派盟翻唱吗?我们的爱就像是流行落沙,哈哈哈,本派盟能够唱歌还是要归功于这个级数。做 vc, 做 vc 我相信你一定或多或少听说过。他实际上是一个简写,他的全称是这样的,我就不读了, 不妨从其中的谓词开始讲起。同样的,规则也是一个简称,我们可以把它理解成采用了对抗学习、念分推断等级数的文本转语音模型,它属于一种声超式模型,真诚式模型是个什么东西呀?我们知道图像、文本、 语音等数据都是对已经存在的复杂分布进行采样的到的,采样的方式不同,所得到的样本质量也有所不同。就比如说一个照相机,用全画幅和中画幅相机所拍到的照片,他们的相片质量并不相同而生成。我们 可以直观的理解,会通过某种手段直接生成为我们要得到的样本。跳过了对复杂分布进行采样的过程,我们可以通过这个图式来理解。简单的正态分布进行随机采样后得到了的维度的香料,他可以通过矩阵的形式来表示,而这个香料经过剑南瑞特的作用之后, 变成了一个高维度的下量。这个高维度的下量可以理解为复杂分布进行随机采药后的样本,也就是常见的二字 角色的声音,就比如哭泣猫的声音。以上就是生长式模型的简单原理,目前主流的生长式模型有三种,分别是尬 vi、 符录这三种,而我们所提到的位置的主题结构就是一颗 一模型,我们可以叫他变分子、变马七,他的大着思维框架,我们可以用这个图来表示,我们知道一段语音和一张 图像,我们都可以从中提取可观测的信息,并通过编码器停列为隐形变量,然后通过解码器输出可见信息。那么如果我们能够针对文本和语音分别构造词编码器,让他们通过引编量建立等项关系,然后交换他们的解码器, 那就可以实现文版导语音的转化了。这就是 vc 这个模型的大致原理。说完了 vc 这个模型,我们来看看 sowitssy, 实际上 sowissyswissi 是在 wiss 的基础上进行的, 他将最终的解码器转换为了害发干,并且利用造福特威塞内容编码器提取人声信息,确保在转换的时候保留原音频的音乐内容,并将其转换为目标歌手的声音特征。简单的来说,搜 作为此, svc 就是将原歌曲的音色转换为目标歌手的音色,转换出的歌曲的细节部分还是要原歌手唱出。怎样啊?你是不是对这个模型有所了解了呢?相关的模型文件我会在粉丝群分享出来。

我飞上了今天, 未来会怎样? 幸福。幸福只是一种传说,我永远都找不到 怀抱。这样的要求算不算很高? 有你做的人呢?你们好不好? 世界是如此的小, 换一方。
![[oeasy]so-vits人声唱歌音色转化_人工智能歌手_深度学习 #深度学习 #实战 #人工智能](https://p3-pc-sign.douyinpic.com/image-cut-tos-priv/e332fdc2e0cf22c27e7ee835a9a987e8~tplv-dy-resize-origshort-autoq-75:330.jpeg?lk3s=138a59ce&x-expires=2102677200&x-signature=fpH7QV7htV2ETrj3qOF74zDdL%2Bs%3D&from=327834062&s=PackSourceEnum_AWEME_DETAIL&se=false&sc=cover&biz_tag=pcweb_cover&l=202608212136558AE1C143DB0E7DE58244)
好,我们这次来玩点什么呢?我们先听这么一首歌,这首歌呢是东方不败风云再起的一个插曲,叫笑红尘,是那个沧海一声笑的姊妹片 话的声音。 然后我们用这么一个东西呢,就可以把一个呃音乐里面有人声,有背景音的东西分解成两个东西, 哎,要不然呢,你要是要这个 instrumental only, 就是要要 bgm 啊,但是不要人声。 vocal only 呢,就是只要人声, 但是不要 bgm, 然后分分分开之后呢?是这种效果 会的太早。 怎么样把陈淑华的纯人声变成这个这个 oo 的纯人声呢?是需要用到这样一种东西,叫做深度学习。我们可以看到这块呢,有这么一个这个 sovis, sovis 这么一个 仓库,然后这个仓库呢就很活跃,很活跃,而且呢就是有很多的分支,有很多各种各样贡献者,挺好用东西。然后我们可以到这个扣的位置, gpu, gpu 就是显卡,去搜这个 sovics, sovics, 但是他没搜到,是吧?搜位这块我们搜到一个欧喷喷啊,欧喷喷,他,他建立了这么一个这么一个镜像,当然还有其他的各种各样的镜像,那么我们其实可以选择一个镜像,哎,那我们选择谁呢?选择这个镜像,选择这个镜像, 选择镜像之后呢,他就告诉我们这个安全声明,然后呢他呢是有一个仓库地址,这个这个仓库地址其实就是就是这个这个仓库的一个一个版本 中的一个版本,然后他有个底膜地址,底膜就是一个基础的模型的地址,然后他就会有这么一个镜像文件,哎,那什么是镜像文件呢?镜像文件就是就是他会装一个类似于 linux 的系统,然后把这个相关的环境都装好, 然后你就不用去呃设置,比如说你是用 gpu 啊还是用 cpu 啊?你的那个拍 touch 是 gpu 版的还是拍 c 这个 cpu 版的?不用,这他都给你设置好了。然后呢我们就可以在 otodl 就是自动呃深度学习里面去创建这个容器。然后呢你需要租用一个就是 gpu 的机器,就是一个帮助文件,这个帮助文件,那这个呢就是他的流程,流程的方法。那么 那么呃他做了一个什么事呢?首先他把这个 souit 这个这个仓库放到了 otodl 的 tempo 里面,所谓的叹号呢就是执行。然后是一个外部命令,就是你这些东西都可以 在一个终端里去自己做这些东西啊,比如说我们可以 l s 啊,所以为什么我们要学习 them, 学习 python, 学习 linux, 这都是 这是一个根本环境,这个是个根本环境,然后一路一路下一步,这个就是,呃,我们可以看得清楚一点,我呢是下了三个视频文件, 这视视频文件呢就是 oez 的电路教程,电路教程有一个特点,就是它的那个 bgm 音量比较小,不像不像 ps 那些音量特别大,所以它相对来说就是比较容易得到人的干声。 然后呢用 f f m p g 去得到这个纯音频,然后下了一个 aud audio slicer audio 就是音频 slicer 呢是切片, 他就是把音频切片了,因为他有一个要求,他的要求就是就是要把这个音频呢切的比较小角色的名字,然后把他们都放进来了,放进来之后呢就放这么一个文件的位置, 然后呢我们就可以对这个数据集进行预处理,预处理,然后就就就这么运行这些东西,这么运行这些东西,这个东西就是这个训练过程,当你当你执行这条之后呢,他就会 靠啊一直执行,一一直执行,然后就开始训练,最终呢你生成了模型之后就需要推理,然后你要在这,哎,我就把这个这个终端呢就把它停了,停了之后呢就可以再开一个终端, 然后去运行这么一句话,运行这么一句话就是用拍子三去运行这个这个 py 文件,然后呢我们嗯使用的是这个模型,然后呢我们使用的是这个配置,然后我们使用的是这个 这个名字,对吧?然后他的这个原始音频呢,在这我要把他这个原始音频呢上传到这个若若 弱里面,把这个东西上传到弱里面,然后就根据这个东西和模型最终生成一个你这个模型的这种这种唱歌的声音, 红尘多可笑,痴情最无量啊。我看到一些类似的作品,有还原这个马三立大师,还有刘宝瑞大师就都挺有 意思了,哎,那这次呢我们就分享到这里,我在这个领域呢,还是一个,呃,入门入门者,刚刚刚刚有一点点了解,有不懂的呢,大家多指教。有什么好玩的呢?也希望大家跟我多分享,哎,然后 也希望大家能有机会去看看这个我在这个蓝桥上放的这个 python, 那 linux 和 wem 之类的教程。好,这次就这样,谢谢大家,再见。