大家好,本次针对素材的转写和标注添加了一个功能,就是可以采用阿里达摩院开园的 finance 来进行转写。 funny sr 支持标点符号识别、低语音识别、音频视觉语音识别等功能。我们先看看之前的转写软件 whisper, 可以看到 whisper 对中文的泛化并不是很理想,很多地方需要修改,标注也不是很全,虽然可以使用 large v 三模型,但是对于现存的要求更高。 现在我们换成阿里的双击 audio 底线 transcribe 底线 all, 一点 bad 进行阿里 finance 来进行转写, 可以看到几乎不用修改,标注也很全。 来对比一下,左侧是 whisper, 右侧是 ali finesse, 同时在新的整合包里,如果忘了拷贝底膜, 程序会自动提示。 现在我们来到二点三的新整合包, 同样双击 audio 底线 transcribe 底线 all, 一点 bat 进行 ali finance 来进行专写。由于二点三支持三域,所以需要选择对应的语言,这里选择英语, 可以看到阿里 finance 对于英语的识别效果也是很不错的,丝毫不亚于 whisper 如此。对于大样本数剧集来说,新的阿里的转写和标注可以帮我们大幅度提高效率,感谢您的观看,这里是刘月的技术博客。
粉丝449获赞3633


ok, 欢迎,打算本期视频,那么这期视频我们就来讲一下更新内容,当然前面有一些更新内容,比如说本地布达库的一个动态变量的一个最佳,但是我觉得这个内容量太少了,就单独做一期视频了。 呃,看情况吧,那么我们这次来讲一下 v i t s。 的一个新增内容, birt v i t s 二。 那么想必玩这个 tts 圈的啊,观众应该是非常了解的,那么这个波尔特 vsts 二的话,其实在效果上是有很大的一个提升, 那么我们直接警证题如何去使用,那么其实我们这个 bird b i t s r 也是配合我们的 v i t s single a p i 去使用,然后这边文档里面也是写了,如果你使用 bird b i t s。 二的话,其实你还是需要配合一下 bird v s t s。 二的一个整合包,因为它里面是有一些模型在整合包里面的,因为它这个 bir。 呃,这个 v i t s simple e p i。 的这个整合包里面是不默认现在这个模型的, 你需要从这个整个包里面把模型拷贝进去,补全这个模型,然后再去使用,然后同样也是配置 config 文件里面,把这个 模型和配置文件放进去。需要注意的是,这个模型和配置文件必须得放在 vits simple api 的 birth vits 二目录下面才能正常地加载执行。那么以及后面的一些东西,其实都是大家可以直接看的一个相关的一个 问题描述,那么有问题的话,你也可以直接在官方的仓库的营秀里面提问题,或者说在我这边提也没事,我会帮你转转接到那个官方的这个仓库, ok, 那么我们这边就开始测试吧,连接一下 man 啊,其实不急的,用这命的,我们先把看一下吧,啊, vip 的 simple a p i。 下载完之后解压,解压完之后啊,我们把我们的 模型拷贝到 birt v i t s。 二下面,一个是这个距零的 p d h 和一个 config, 那么这个两个模型的话,其实就是用的训练底膜 整合包的一个训练的一个底膜,我们可以找到 b 站上提供的一些 bird v i t s。 二的一个整合包,然后在这个整合包内部,嗯,预训练模型就这,模型就在这, 好,一个是配置文件,在 configs 下面拷贝到我们这个路径下,然后模型就有了,另外的话就是一个, 哎,是在哪来着?这个这里面,这里面的这几个模型是需要在在这在哪来着, 哎,啊,在这吧,对,这个路径下面,把这个几个大文件的这个 模型拷贝进去, ok, 这是缺失的一些文件,缺什么就补什么。嗯,这两步做步骤都做完之后的话,我们再回到上上面这里找到我们的 config, 点 p y, 打开,然后往下翻,找到我们的这个 model list, 在里面配置上我们的 bird v i t s 二的一个两个路径。 ok, 配置完成之后保存,关闭,运行 start, 点 bet, 开启我们的 a p i。 那么我们这边以聊天模式来进行一个测试。另外我们这边 gy 是优化了一下这个宽度,因为这边如果你这样的话,可能会防误触啊,这边滚轮会误触,这边预留一个宽度给你 应用滚轮,这样你就不容易误出了。我们以聊天模式保存一下,因为 b 站的一个 要扫码比较麻烦啊,然后这边的话用起来是没有任何的报错的,这边是正常的加载了, 然后端口是二三四五六。 ok, 那么我们这边啊,刚才忘记切了,切到 vits, 然后往下翻,那么在 vits 里面其实是可以选择 burt vit 二, vits 二的,然后一些, 呃,配置文件路径,这个其实是不影响的,无所谓, pass 掉,然后有 ip api 端口,这个是需要的。说好人的 id 很关键啊,还有一个语言默认就自动自动识 这边啊,剩下的是什么?这配置大家都懂啊,速度什么的,噪声之类的,然后就默认啊。说话人 id 的话其实对。看一下这个,看下 config config 的 jason 看错了,虽然两个是同一文件。 看一下 off 的配置文件上号人就很多的。 谁是谁?谁是谁 啊?算我们就默认零吧,到时候改完之后,到时候有些人模型可能太大了就不好看,那我们就默认零,这个说话人,嗯,划算 也行。 ok, 引进我们的聊天页吧。这边居然还没改啊,这会改, 我们顺便测一下这个谷歌 a p i 的一个录音功能, i like you, 请复读我的对话。 主人说,请复读我的对话。回,主人,请复读我的对话。 okay, 我们再来一句, 你觉得我的声音效果如何呢? 谷歌的识别有这么慢吗?我记得以前挺快的呀,今天怎么有点慢。 主人收到,你觉得我的声音效果如何呢?回复,主人,你觉得我的声音效果如何呢? ok, 那么这就是我们的 bart b s s 二的一个接入的一个演示, 大家有兴趣的话可以去尝试一下,那么本次这个视频演示就到此结束,我们下期视频再见, bye bye!
