粉丝689获赞1880

好的,给兄弟们录一下这个项目的详细视频教学啊,快速的过一遍,希望每一个拿到整合包的都能尽快的去上手。这是它的一个官方仓库,它是由小米开源的 omni voice 一个 ai 语音克隆项目,刚推出来时间不久,现在也非常火,根据官方的宣传呢,它是支持六百多种语言, 有语音克隆和语音设计这么两个核心功能,而且推理的速度非常快。这个仓库呢,我们不需要多看,因为咱们整理了一个懒人用的一件整合包, 刚拿到你手里的话呢,它是一个压缩包的形式,解压之后就是这样一个目录结构,你不需要懂什么编程代码,也不需要在你的电脑上安装什么编程环境啊,拿来就能用。但是呢,唯一一个需要你注意的地方就是你存放这个整合包的,呃,这个路径下呢,就是这个整整体的路径下面不要有中文 啊,英文或者是数字都可以。一般的 ai 项目呢,基本上都是小白,报错的话,基本上百分之九十九都是这么一个问题,注意这个就可以了。然后现在我们直接启动双击,这个时候你的电脑上会出现这么一个 cmd 命令行,如果觉得烦呢,你也可以把它最小化一下,但是千万不要点叉号关闭, 我们耐心的等这个进度跑完呢,你的电脑浏览器就会自己打开咱们的这么一个整合包的一个 ui。 他的核心功能主要是音色克隆和音色设计,我也是根据官方的啊,他的一个核心介绍来做的,整体上是比较简洁的,我们一个一个看。 首先音色克隆的话呢,这边是提供音色样本的地方,就是你想用谁的声音,就比如说我们用这个非常经典的四川芬达老师 听一下原声,他们不单朝我扔泥巴,阿坤拿泥巴能种荷花,他们扔石头,阿坤能接啥?好,非常纯正的味道。 呃,这个参考音频呢,有两个需要注意的地方,一个是不要太长,三到十秒就可以了,还有一个就是干净清晰,基本上不要有那种非常嘈杂的背景音,他直接关系到你后面推理的质量。下面是参考音频的文本,就是上面这段音频,他说了什么话,我们把它复制过来, 这里需要注意,如果是有错别字,你要去修正,如果是断句不准确,你也需要去改过来。呃,如果说你复制的文案呢,他是那种像诗一样的文案,就是一行一句,这个时候呢,我们可以点这个转自然段,他会把换行符换成这样的标点符号,用来正确的断句。 右边是合成内容,就是你想让你克隆的这个声音,说什么话,就举例是郭老师的这一段,下面是不用管的,如果说你需要去补充一些风格语气或者语速偏好,你可以去填进去,我们点击开始生成, 这个速度还是非常快的,听下效果,天下万物万事,所有的矛盾,所有的纠纷都是由于逞能二字引起来的。好,这个味道非常正啊,非常正。 下面就是一些参数和是个文本技巧,基本上呢,这些包括下面的高级参数,默认一般就好了啊,最多就是你可能觉得想要配语速快一点,可以在这里去给他加速。 然后第二个是音色设计,这个也是分成两个模块,一个是自动音色,他会以一种非常均衡的参数去让你快速的去试听效果,但是可能正常多的还是这个手动设计偏多一些。 我们还把郭老师的这段台词复制过来,然后呢?呃,下面这个语言是自己去识别的,我们输入的是中文音色属性,就是你去自定义去 diy 的 一个地方 啊,年龄你也可以自己去选,音调的话自己去选。然后风格这种耳语我还没有测试,他可能是那种,呃,声音偏小的吧,然后这种是英文口音,仅对英文文本生效。然后咱们去选这个中文的方言,他这个一个亮点可能说的是这个方言吧,我们选这个河南话,开始生成 天下万物,万事,所有的矛盾,所有的纠纷都是由于逞能二字引起来的。嗯,有那味。然后我们再选一段四川话,这种比较有特色的,可以试一下 天下万物,万事,所有的矛盾,所有的纠纷都是由于逞能二字引起来的。我觉得这个差点意思。有没有四川的兄弟听一下,我感觉这个不太对,然后听一下有没有山西话啊?有, 天下万物,万事,所有的矛盾,所有的纠纷都是由于成能二字引起来的。 其实讲真啊,我觉得这个方言可能还需要去优化一下,但是咱们用这种项目呢,一般都是用音色克隆,可能很多小伙伴他去做一些啊自媒体的项目,或者是呃,平常有些配音的需求,一般来说的话就是给一段样本的音频,给到文本,然后再去把他需要说的台词给 填进去,一般都是这样,去快速的去克隆,快速的去生成。当然了,咱们用这种项目呢,一定要,呃,这个,这个遵守法律法规,对吧?包括有一些版权上的一些风险之类的。有一些小伙伴他可能更多是自己去录视频的时候用自己的声音,他可能不方便说话或者是干嘛的, 用这种技术可以让自己省点力吗?或者是有更多更多提高创作效率的这么一个需求,其他的暂时没有。如果说,呃,有一些其他的意见或者是建议的话,也可以在我的这个抖音或者其他的媒体上去找到我。 ok, 基本上就这些,祝大家用的愉快,拜拜。

别划走,这就是你要找的刚发布的小米 omios 下载教程已搞定,本地部署支持六百多种语言,国内方言和少数民族语言都含盖,支持手机、平板、电脑。下面快速分享给大家。 首先点右下角分享键分享复制链接,复制成功后我们打开这个蓝色小鸟,没有的话就去安装一个,打开后会弹出一个资源包,点立即查看,如果没有弹出,就在这里搜索月白精选,然后打开这个文件夹,找到这个软件保存下载就可以用了。

随风,你一天又在研究啥新玩意?启禀陛下,我在研究声音克隆,哦,又出新模型了, omni voice 支持六百多种语言。 suifeng, what new stuff? are you researching again? today your majesty i am researching voice cloning oh another new model came out omni voice supporting over six string languages。 哈喽,大家好,今天给大家带来的是声音克隆的信波形叫 omni voice, 那么这个工作流的话呢?哦,我已经发在荣耀哈弗网站上了,大家打开荣耀哈弗网站啊,在这个搜索 ai 随风啊,可以找到我发布的这些工作流啊,在我的个人中心里面已经发布了这两个工作流。有两个工作流啊, 先给大家说一下,一个是声音的设计,一个是声音的克隆。我们先看一下声音的设计啊,声音的设计的话,就是你可以去设计一种音色啊,设计一种音色, 那我们来听一下。随风,你一天又在研究啥新玩意?启禀陛下,我在研究声音克隆。哦,又出新模型了, omni voice 支持六块多种语言,这个地方呢,是设计一个音色, 设计一个音色,比如说你是四川话,其他其他方言都是支持的,还有很多的方言都是支持的啊啊,然后,然后有这个音色之后啊,有了这个音色之后啊,我们就可以去来做声音的克隆啊,声音的克隆的话使用啊,我们来看一下啊 啊,使用的话比较简单啊,比如说我们要做一个对话的啊,做一个对话的,那你就在这写上啊, speaker 一, speaker 二啊,这个两个人对话,双人对话,然后这个地方是加载第一个人的音频,比如说他的音色是这样子的句子是何等身份,他的女儿怎能为妾 啊?然后第二个人呢,是一个女生的音色系,不会因为被深埋地下就失去生命力,他总会在某个时机破土而出,寻求阳光梦想这东西 好了。然后呢,后面这个地方啊,是可以去设置他那个你出的音色的这个音频啊,如果你选择自动啊,他就会根据你的音色来产出啊,如果说你想产出其他语种啊,那我们在下面再说 好的这个接触,这接触过来之后啊,点击运行就可以了,这个非常非常的简单啊,这个模型的能力还是比较强的啊,速度也很快啊,速度也很快,我们看一下这个基本上这个十多秒的音频,也就用时不到八秒,八秒钟啊,不到八秒钟 啊,然后如果说你要用用这个英文的啊,你就把这个词改成英文啊,改成英文啊,然后这个在这个地方选择一下啊,选择选择英文, 当然你如果有其他语种,比如说日语,其他语种啊,你要去做这个其他语种,你可以选择这个其他语语言啊,我们这地方给大家演示一下英语啊,主要是因为啊,我们现在做海外漫剧啊,有可能会涉及到一个配音,那么现在我们有更多的一个工具啊,来使用它 啊,这个前面的,其实在这个 index 七 d s 二这个之后啊,这个千万三点五 啊,还有这个龙猫的啊,还有好几个啊,音频的模型啊,这个呢是最新出来的一个啊,最新出来的一个 啊,效果也还是不错,大家可以去来啊,用起来啊,大家可以去用起来,然后结合到我们这个做海外漫剧啊,做海外漫剧包括解说漫剧啊,需要配音的时候啊,需要配音的时候啊,你就可以用到用它的单独来配音啊,单独来配音, 这个配音的话和我们去这个 ltx 二点二点三生成的音画同步的这个视频,它没有不冲突啊,不冲突,因为你毕竟啊 ltx 二点三生成的这个音频啊,它可能,呃,它 前面一个音频的音色和后面一个音频的音色它没有一个关联的关系啊,它现在目前还固定不了,但是它有个好处,它能够去 把人物的口型给它对起来,这一点我们就就有好处了。你说比如说英文的,他把英文的口型给对好了,然后你配音单独来做啊,单独来做当然就可以,当然我们在万象里面本身也有这个,已经内置了这个 in the x t s v 二这个模型啊,去声音克隆也是可以的啊,只不过呢现在呢,随着时间的发展啊,这个有更新的模型,更好的 这个克隆模型啊,我们也可以去采用啊,可以可以去采用,而且速度也很快啊,大家可以去用起来啊,我这个地方已经发布在这个热点项目网站上了啊,有两个,一个是一个是声音设计啊,一个是声音克隆啊,大家打开热点网站搜 ai 随风就可以找到啊。

看好了,上面新发布的这个 omni os 可以 克隆超六百多种语种,还有朋友不知道如何去下载,接下来我来教大家。首先点击咱们视频右下角小箭头,点击分享或者复制链接,找到属于自带的应用商店,去下载这个软件,并且打开它, 点允许粘贴,下方会弹出一个文件夹,如果没有弹出的话,我们可以在上方打字搜索出出资源,四个字,点下方立即查看。先点进去点软件资源,五点 omni os, 我 们进行一个保存就可以去下载啦。

看好了,像这个小米新发布的新的语音生成模型 omis 还有很多朋友呢,不知道在哪里去下载的,今天呢,我就来教一下大家。首先呢,点击本视频右下角分享链接,复制链接, 然后呢去打开这个,没有的话自带的软件商店安装一个这个,去打开它,它这里会弹出一个文件包,美团搜索框去输入畅游分享四个字,点击立即查看,去打开这个畅游分享下载, 打开其他资源包大合集,打开其他资源二去找到这个 omis, 去保存过就可以去下载安装啦。

哇塞,全网火爆的这一个小米最新发布的语音生成模型啊, only voice 啊,安卓苹果免费的下载教程,我给你们找到了, 复制这里分享链接复制成功,我们打开蓝色小鸟,没有下载的话,应用三点下载,打开可能会跳转一个文件夹,如果没有跳转,我们在这里搜索妮妮的梦,点击软件资源取消全选,我们勾选这一个保存去下载就 ok 了。

看好了,小米新发布的 omni voice 可以 克隆超六百多余种,还有很多朋友不知道在哪里下载,接下来我一个视频教给你们,首先点开我视频右下角的小箭头,点击分享或者复制链接,然后打开咱们手机自带的应用商店,下载这个小蓝鸟,并且打开它点允许粘贴,下方会弹出一个文件夹,如果没有弹出这个文件夹的话, 咱们可以在这里搜索搜索资源物,找到 omni voice, 点击保存,然后下角就可以了。

这期呢给大家介绍一个语音克隆的模型,叫做 omni wolf, 这是 k 二团队研发的一个,这个 k 二呢是小米旗下的一个团队,咱们先看一下它的特点啊。首先支持六百多种语言, 其中包括了十二种方言,这个就是它可以定制说话者的属性,包括姓名、年龄、口音、方言、耳语等等。 第三个就是他的推理速度是非常快的,目前来说这个模型应该是推理速度最快的一个,也就导致了他对于显存的要求是非常低的,基本上六 g 就 够用了,就能跑动了。看一下他的功能啊,这是他的 gethelp 的 项目页。 第一个就是语音克隆,上传一段三到十秒的参考语音就可以给他进行克隆,这里面提到了一点,为了更好的效果,可以把数字一二三转换成 one hundred twenty three。 第二步呢就是声音设计,支持的属性包括性别、年龄、高音风格、口语以及方言。 第三个就是非语音表达与发音控制,这非语音符号就是一些大笑啊,停顿呀,咳嗽啊,乱七八糟的这一些。 第二个就是声音控制,如果是多音字的话,可以使用带声调的拼音来进行控制,比如说这批物资打折出售就严重折本了,再也经不起折腾了,可以使用这种拼音加上声调 来控制。还有就是英语的发音控制,因为在英语里面其实也是有这种一字多音的,比如说这个 b a s s, 他 如果读 b s 的 话,他就是鲈鱼的意思,不同的音他有不同的意思, 所以说它可以使用一种叫做 c u m 发音词典这个的方式来控制它的意思以及读音。 然后这些呢有一点是需要注意一下,就是它对于 transformer 这个包的要求比较高,是需要五点三,可以给大家看一下,我这是升级到了五点三点零, 他必须要升级在五点三点零以上才可以的,因为他的模型在音频处理方面依赖于一个模型,这个模型的一个功能是在五点零点三之后添加到 transformers 模型中的,那么这就会产生一个问题,如果你升级完之后,可能会对你之前的模型或者说之前的插件有影响, 用这个 transformers 其实是非常重要的一个包,很多模型很多插件都是会用到的,所以说你们在升级的时候一定要注意把这个 python 文件夹备份一下啊,比如说复制出来一份, 避免产生不必要的麻烦啊,这也是非常重要的一个点,如果你觉得比较麻烦的话,我把它上传到了 runhelp, 大家可以在这在线使用一下, 如果大家的电脑配置不高,可以尝试一下这个网站,这里面的工作流模型是非常全的,而且也不需要你去担心环境的问题,用起来呢也非常方便,而且每天都会赠送一些免费的积分。 好,下面看一下它的模型的下载。首先就是官方出的这些模型,需要下载两个,一个是 models, 一个是 comfis 啊,这两个模型下载之后呢,是放到 models 默认模式,然后再有一个默认模式。 第二个呢是大写的啊,这个一定要标准,然后把脸放过来就可以了,这个模型呢是三十二精度的,还有一个比较小的十六精度的是在这里 啊,这两个把这个 models 还有空飞置下载下来,然后它的路径是这样的, models omini volks, 然后在 omini volks b f 十六把它两个放进来。 除了这两个呢,还有一个模型是需要下载,就是 whisper, 这个呢是一个语音识别的模型,它官方提供了两个推荐,一个是 launcher with santa bell, 一个是 medium, 当然呢,其他的也可以使用啊,这个看你自己选择了。把它下载之后放到 models 啊,这会有个 audio encoders, 然后放到对应的两个目录就可以了。同样是下载 modus 还有空飞纸这两个文件,以上这几个模型我会把它的下载地址放到评论区,大家直接下载 modus 文件夹,然后覆盖到你之前的 modus 文件夹下就可以了, 里面的文件结构我都已经做好了。然后这些呢,有一点是需要注意一下,就是他对于 transform 这个包的要求比较高,是需要五点三,可以给大家看一下,我这是升级到了五点三点零, 他必须要升级在五点三点零以上才可以的,因为他的模型在音频处理方面依赖于一个模型,这个模型的一个功能是在五点零点三之后添加到 transformers 模型中的,那么这就会产生一个问题,如果你升级完之后,可能会对你之前的模型或者说之前的插件有影响, 用这个 transformers 其实是非常重要的一个包,很多模型,很多插件都是会用到的,所以说你们在升级的时候一定要注意把这个 python 文件夹备份一下啊,比如说复制出来一份, 避免产生不必要的麻烦啊,这也是非常重要的一个点,咱们一起来看一下它这几个工作流啊。首先这里面呢是一个参数,它里面采用的一些参数都在这里面指出来了,大家可以直接看一下。然后这边上传音频,加载一下它的 whisper, 直接就可以语音进行克隆, 这里面看一下它的提示词,因为和这个字是一个多音字,所以说通过 he 再加上二声来进行标注,下面这个和稀泥的和同样是拼音,加上四声来进行标注,咱们听一下它出来的效果啊。 我说魏和尚,你成天光想着吃肉,还当什么和尚去和稀泥吧, 这就是语音克隆的一个效果,咱们再看一下语音克隆长音频,同样的是加载一段音频,然后再加上这个 whisper, 使用的是这个 long phone 的 彩样。我等修炼者原本就是逆天行事,有各种磨难是正常之事,只要破茧而出就是了,与人斗有什么意思, 与天斗才其乐无穷的。这个呢就是可以克隆比较长的语言,和这个其实功能上是有一些一样的。 然后第三个就是语音设计,这里面呢也给出了语音设计的一些参数,还有书写的格式,咱们可以看一下了,上面呢是语音的内容,下面呢是对语音设计的一些要求,这里面有中文还有英文的一些设计要求,以及正确的书法师利, 还有常见的一些错误啊,大家可以看一下,那么咱们听一下他这个出来的效果,使用的是男青年 高音石家庄话,石家庄有名国际庄,正宗安徽牛肉板面,香得能当城市名片,吃完一碗力气大到能徒手拉货车,这劲装的人自己都怕。 其实大家可以听出来的,这一些逗号以及停顿其实并没有按我们要求来,这也是他模型的一个缺点啊,好多停顿的地方他都是按照模型来的,并没有按照我们的题词要求。 然后呢再看一下多人对话,多人对话,上传两段音频,然后呢然后给它格式进行一个修改就可以了, 它的格式呢是这样的, speaker 一, 然后中括号括起来,再加上个冒号,这就是它的格式,所以说我们在这里面给它进行了个替换,首先是写上人物,然后呢再进行一个提示词的替换,这样的话就比较方便一些, 咱们看一下出来的效果。魏和尚,你说山本一木这小子今天是不是栽在这里了?这意大利炮真不是吃素的,二营长真厉害,哈哈哈,给二营长赏个鸡腿 也可以听出来啊,他的停顿也是有问题的啊,比如说你说上面没一幕,他在这停顿了一下,所以说这就是这个模型目前的一个情况,他的优点呢确实是非常厉害啊,他的生成速度是非常快,而且效果呢也是很不错的,但是他这个停顿确实是有些差些意思, 剩下的大家可以尝试一下模型呢,到时候在视频的剪辑区直接自己下载就可以了啊,这期视频就到这里。