哈喽,小伙伴们大家好啊,今天给大家介绍一下前问刚开园的一个 t t s。 的 项目,我们直接进入主题看一下工作流,他这次的话发布了好几个模型了, 我们这边来看一下,第一个是一点七 b 的 一个音频设计模型啊,他就是根据用户提供的描述机型语音设计,然后第二个的话就是一个制定音的音频模型。第三个就是一个基础的模型, 他同时还有个零点六 b 的 一个制定音模型跟那个基础模型。我们看一下这边三个工作流, 第一个的话就是一个音色克隆,他加载就是一个基础的模型,你可以加载一点七 b 或者零点六 b。 我 这边实测了一下,整个本地占用显存的话只有六 g 左右,配置要求非常低,而且运行速度非常快。我们这边看一下节点, 整个节点都非常简单,整个流程就是加载一个音频,然后这个音频的话接入这个参考音频,然后他这边还要同时提取你这边参考音频的这个文字,给到这个参考文本双参考,他才能克隆音色,跟我们那个 tts 不 一样了。 然后我这边对比了几个案例,我挑两个给你们听一下。世人修行所求不外乎长生一生,死其天地,可是纵观古今又有谁也能做到? 这是凡人修经传紫林的音色。这边重新润色了一下他这个台词,然后我们直接听一下 t t s。 二的效果, 所谓胜者为王,不过是天意弄人,纵有绝代风华,难逃黄土一匹。好,我们再回到谦问的 t t s 看一眼,所谓胜者为王,不过是天意弄人,纵有绝代风华,难逃黄土一头,凭什么那些高高在上的现 啊?再听一下原音色,可是纵观古今,只有谁也能做到。然后我在这边给你们对比一下男生的,我这边选举莫大夫的一个语音, 成王败寇自有天定,人生苦短,终归尘土。然后我们看一下他深层的, 历史的彼处定格了胜负,岁月的封杀掩埋了众生。这个是 t t s。 二的啊,我们再看一下前问的历史的彼处定格了胜负,岁月的封杀掩埋了众生。当先人们在星海间肆意驰骋时,凡人的世界却如同一口幽深的井。 嗯,怎么说呢,整个语气情绪方面的话,确实还是 b 站的这个 t t s。 二更强。 t t s。 的 话还是有点比较像那种机器人, 就是听不出语言情绪,但是它音色克隆呢,还是可以,就是情绪的话表达稍微差一点。但是它有个最大好处,它要求的配置非常低, 比这个 tds 二配置要求更低,而且速度更快,差不多同样生成一个这一段音频, tds 二的话是花费了将近两分钟的时间, 前文的 t t s。 的 话差不多不到一分钟五十秒就相差了接近一倍的时间。好,这边注意一下这边这个音频的翻译节点,这个是我上期视频讲到的木啦这个音乐生存器,它这个一个节点是翻译歌词用的,这边也可以直接把它当成一个翻译文本。 然后我们再看一下下面这个定制声音的,这个定制声音的话就是加载这个 voice。 第三,然后它根据用户提供的描述进行语音设计, 这边会多一个提示词,像这个 t t s r, 这边这个框写他的情绪,也可以按官方他这种描述语音描述,什么明亮啊,略带个性的年轻女性声音,这样子描述都可以,我们直接试听一下。 凭什么那些高高在上的仙人能御风而行,逍遥长生?我等凡人就何该如井底枯啊,永世不得亏见那浩瀚苍穹。 我这边是没有给阿田提示,是大概效果就是这样子,然后最下面这边的话就是有预设好几个音色,就是我们这边列表看到的这几个,然后其中的话,这个艾瑞克的是支持一个四川方言的,然后我们这边 r h 目前还有个报错,等温总更新啊,我们直接看一下本地跑的效果, 这边我就选了这个艾瑞克,然后写一个四川话就行了,还是同样上面这个台词,我们试听一下, 不过是天意龙人,纵有绝代风华,难逃黄土一魄,凭什么那些高高在上的仙人能御风而行,逍遥长生? 我等凡人就何该入井的哭啊,永世不得亏欠那浩瀚苍穹。呃,有没有试穿的朋友感觉这个味道正不正?反正我一个外地的听起来感觉是有那个味道,然后模型跟截顶,我有上传到我的跨客网盘, 我们来到网盘看一下,在康复 ui models, 点进来,这边有个千问的 tts 这个目录下载下来,整个丢到你康复 ui 这个 model 这个目录,然后重新回来,找到节点, 这个就是这个作者的节点,直接下载解压,放到你的卡斯特目录下,就是直接放到这个目录。好,我们总结一下千文 t t s 的 优劣啊。千文 t t s 的 话,它优点的话就在于它整个对硬件资源的占用比较低,而且速度比较快,同时支持一个 方言,而且它支持的语言的话是非常多的,基本上都是包含了我们主流的语言。 t p s。 二的话就是对一个人生的情绪复刻是非常好的,然后它是支持一个双人的一个对话的。好,今天的工作流分享就到这边,喜欢的记得一键三连,我们下期再见。
粉丝3021获赞17.4万

大家好,这个视频给大家分享一个千万三 tds 整合包。我们进入到软件目录,这里有六个启动选项,我们看一看有什么区别。贝子模型是声音克隆, carter voice 是 自定义音色,这里有介绍。通过用户指令对目标音色进行风格控制。 waste time 是 设计音色,这里也有介绍,根据用户提供的描述进行音色设计。 我们启动 base 模型, 使用一点七 b 的 启动,启动之后耐心等待一会儿,稍后浏览器会弹出一个窗口, 这里上传参考音频。 好,大家听一听这个音色,愿你的每次流泪都是喜极而泣。 好,我把文字输入输入到这里,这里也可以不输入参考音频文本,选择这个就可以不输入,但提示效果有限。 好,这里我先输入,然后需要合成的文本,我这里复制一段 目标语言,自动点击生成。我们看一看。显存利用率不到八 g, 显存关闭, 点击播放。你说在不联系的日子里,是在积累思念,还是逐渐遗忘那些断了联系的人?这里我选择中文,然后重新生成。 你说在不联系的日子里,是在积累思念。有电流声,我们换一个音频, 我们再听一听这个音音频此的话为你流过的眼泪,以及所有失去意义的万语千言。我们输入参考文本, 点击生成。点击播放。你说在不联系的日子里,是在积累思念,还是逐渐遗忘那些断了联系的人,到底是被时间带走了,还是被悄悄藏进了心里的某个角落? 有人说不联系就是在慢慢忘记。我们重新返回,上传刚才的音频,再测试一下,点击播放这个音频, 愿你的每次流泪都是喜极而泣,愿你。然后把这个参考文本放进去,再测试一遍,然后文字也改一下,点击生成,再测试一下效果。 有人说不联系,就是在慢慢忘记,像退潮后的沙滩,所有的脚印,所有的痕迹。啊,这个不行 啊,应该是不稳定,我们看一看这个功能,这个是可以保存音色,我们上传这个音频,然后输入参考文本, 点击保存音色文件,然后点击下载, 把这个音色文件放到软件目录,这个是我以前生成的,删除,这个是保存音色文件,这个是上传音色文件,然后合成文本,我们我把这个删除,上传音色文件, 然后这里输入要合成的文本, 然后选择,然后自动点击生成, 点击播放。上传参考音频和参考文本,选择是否使用 usx vector only 模式后,保存为可附用的音色文件,这个视频就演示到这里整合包下载地址,大家可以到这里下载。

本期讲千问团队刚刚开源的千问三 tts 语音合成大模型,你只需要上传两字的经典语录音频,该吃吃该喝喝,遇事别往心里搁。然后呢,输入一段小说, 我写的是末日来临之前,我到超市囤了一堆货的经典小说片段,点击运行,你就能得到一段模仿梁子说话的音频了。末日来临之前,我到超市囤了一千个鸡骨架、六百斤干豆腐卷大葱、 两百个麻辣鸭头、三百斤老醋花生、两百斤五谷酸辣鸡爪、一百斤甜辣鸭肠、四百斤酱牛肉、五百斤山东大拌菜、六百斤卤猪蹄,味真足! 除了模仿梁子说话,还可以设计一款属于自己的语音,比如我跟千问三 tts 大 漠星说,生成的语音要体现撒娇稚嫩的萝莉女声, 音调偏高且起伏明显,营造出粘人做作又刻意卖萌的听觉效果。 然后呢,继续输入刚才的寒冬末日小说文本,点击运行,你就能得到一段音频文件了。末日来临之前,我到超市囤了一千个鸡骨架、六百斤干豆腐卷大葱、两百个麻辣鸭头、 三百斤老醋花生、两百斤五谷酸辣鸡爪、一百斤甜辣鸭肠、四百斤酱牛肉、五百斤山东大拌菜、六百斤卤猪蹄。 糟糕,忘记囤啤酒了,听起来是不是还不错?千万三 t t s 是 千万团队开源的大模型,它支持模仿声音、设计语音以及自定义声音。 h a i j c。 大 佬在第一时间就把千万三 t t s 大 模型集成到了 comfy ui 节点,具体的节点安装说明大佬在这里写的非常详细,我就不进行赘述了, 现在呢,我带大家去搭建一下 cf ui 工作流,去体验一下千万三 tts 大 模型的魅力。首先,打开 runnyhabar, 搜索我的名字,电磁波 studio, 点击工作流,找到千万三 tts 语音大模型工作流,点击运行工作流,你就可以跟着我学起来了。 我们先看声音设计工作流,在千万三 tts 模型加载千万三 tts 一 点七 b voice design 大 模型。然后呢,在千万三 tts 声音设计节点里,第一个文本框写一段小说的文本, 我写的是寒冬末日来临的小说片段。在第二个文本框写你想设计声音的具体描述。比如,我写的是体现撒娇稚嫩的萝莉女生, 音调偏高且起伏明显,营造出粘人做作又刻意卖萌的听觉效果。这里呢,支持各国语言,我选择的是中文,点击运行,等待几秒,你就能得到一段稚嫩撒娇的萝莉女生的音频了。 另一个是模仿声音的工作流。首先,你需要在 live audio 节点上传你想要模仿声音的音频片段。 我上传的是梁子的经典语录,该吃吃该喝喝,遇事别往心里搁。使用 audio clip 截点,截取前十一秒音频片段。同时呢,在第一个文本框输入小说段落。 在第二个文本框输入刚才上传梁字的经典语录文本。然后呢,在千万三 tts 模型加载节点里加载千万三 tts 一 点七 b vs 大 模型。同时呢,在千万三 tts 声音模仿节点这里,选择中文, 点击运行,你就能得到一段梁字在读小说的音频文件了。看到这里,还等什么,赶紧跟着视频学起来吧! 千万三 tds 大 冒险可以用的地方很多,比如朗读小说,这个领域就是刚需。如果本期视频对你有所帮助,请关注、点赞、收藏,三连走一波!这里是电子报 studio, 我 们下期视频见!

ok, 阿里刚刚开源了地表最强的声音克隆模型千问三 tts, 只需要三秒素材就能实现声音克隆,而且还能做方言,直接给你们看实测效果。今个俺教恁几个河南方言啊,中不中 恁说的可真都认了,俺不中嘞,你那算啥子,有个事情多盯了我两眼,我就一坨子,打不他卵米子就过了两年, 你们那些都不算,有个司机给我嘴巴嚼,我就给他灌了瓶硫酸喝下去,苦了六年。比圣因克隆更厉害的是,他这回还开放了九个音色,你可以写一些复杂的情绪提示词来让他呈现对应的情绪效果啊。 周末我不想加班啊,我想去迪士尼,想吃肯德基。周末我不想加班啊, 我想去迪士尼,想吃肯德基。如果你需要用 ai 来做一些情感比较丰富的配音解说,这个绝对是目前天花板级别的存在。

我们先来看一段视频, the moonlight is quite exquisite tonight isn't it, but i find the look in your eyes far more intriguing than the view outside, don't look away just yet since you've come this far why not sit down and finish this glass of wine with me hmm。 那在这段视频里边,我们需要关注呢,其实并不是视频本身,而是声音的部分,大家有没有发现这个声音呢,非常有特点,那整体的魅惑感呢,是比较强的,当然我设计这样一个声音呢,没有别的意思,只是给大家引入一个非常棒的声音的模型, 也就是千问三 tts。 那 千问三 tts 不是 一个简单的模型,第一个叫做声音设计, 第二个就是声音的自定义,第三个呢才是声音的克隆。那在这个视频当中呢,我们会用七个场景来给大家详细的介绍每个模型的具体的用法,以及你在使用的过程当中呢需要注意的一些问题。那关于千问三 t t s 呢,我们应用的场景呢,主要有两个, 第一个呢就是我们使用原版的模型,然后以外部 u i 的 形式,然后来进行声音的相关操作。另外很多开源机的大佬也进行了 control ui 的 扩展,所以说呢,你现在已经可以在 control ui 当中使用千问三 t t s 的 所有的功能。那在图片生成和视频生成领域,我们最怕的呢就是环境报错和显卡带不动。 其实呢,只要思路打开,云端运行才是一个最高效的解决方法。那 running app 是 我一直在用的一个在线的工作平台,因为只要有新的模型和新的扩展出现,它都会第一时间跟进,那大家现在看到的是千文三 tts 在 github 上的页面。那首先呢,我们先来看一下关于这个模型你应该了解的一些基本情况。 那这个模型呢,目前有两个系列,第一个呢是一点七 b 的 零点六 b 呢,一般是使用于流式的工作场景,也 也就是说你需要对语音进行实时的处理。而一点七 b 的 模型呢比较大,那处理的时间呢也比较长,是在离线情况下进行使用,那生成的语音质量呢会更高一些。那另外呢,它是一个标准的多语言的模型, 那目前主流的语言呢,它都是支持的。下面呢我简单说一下它的安装,那千万三 t t s 的 安装呢,是非常简单的。首先呢我们建议大家扩大的版本呢是十二点八, 这个呢并不是千万 tts 的 要求啊,而是它里边用到的一个优化的模型,也就是大家比较熟悉的 flash attention。 那 我们看一下这儿有一段表述,它提到了它强烈建议使用酷的十二点八的版本 来获得更好的性能。那一旦我们确定了酷的版本,那对于很多相关组建的版本呢,就都有要求了。 首先呢是 padouch, padouch 要支持十二点八的话呢,你最低应该在二点八以上。那目前我们在官网看到的 padouch 的 版本推荐的是二点一零,而我们推荐的 python 版本呢是三点一二。 所以说呢,基础环境的要求呢,大家一定要注意。那安装的话其实比较简单的,那首先呢,我们可以使用 python pep, 然后直接来安装千问 t t s。 另外就像我们刚才提到的,大家需要安装 flash attention 相应的命令,在这个地方如果你的内存小于九十六 g 呢,我们希望大家设置一下并行工作的数量啊,我们 把最大值呢给它设置成四,安装的过程呢应该没有什么问题啊,一般呢我们那个 flash attention 安装的时间呢会稍微长一点,下边呢就是模型的下载, 模型下载呢可以放在任何的位置,官方呢是放在了一个叫千问的文件夹下边儿,那下载的地址呢?有两种可选,如果大家是在中国大陆的用户呢,可以在摩塔社区,也就是 model scope 进行下载, 那如果是国外的用户,可以在包包脸上进行下载,一旦所有的模型下载完之后,你就可以使用千问三 t t s。 使用的方式呢有很多,比方说代码推理,当然这我们推荐大家的呢还是使用 webui 的 形式,大家可以看到在这儿呢有三个命令,这三个命令的话呢,唯一不同的就是加载的模型是不一样的,第一个呢叫做 custom voice, 第二个呢我们叫做 voice design, 第三个呢叫 base。 我 们先来看声音的设计, 好,大家现在看到的就是声音设计的主界面,那它支持多国语言啊,所以说呢,我们也会使用各种各样的语言来给大家做一些测试。那大家现在看到的是一个中文的情况,在左侧呢,我们需要有三种信息的输入,第一个呢就是待合成的文本,第二个就是语种, 语种的话呢,我们建议大家选择凹凸,大家需要注意的就是音色的描述,大家可以在它的官网上看到,控制类型呢,其实有很多,比方说呢声学属性控制,另外呢我们也可以控制它的年龄属性, 再往下边就是声音的变化啊,他这叫渐变控制,另外的话呢就是拟人感,再往下边就是设定角色的背景信息。那在这呢,我们建议大家使用这样的一种描述方法,也就是直接描述声音,那我们会通过性别、 音高语速、音量、清晰度、流畅度、口音、音色,质感、情绪语调和性格啊这样几个维度来描述这个声音,那比方说我现在描述了一个御姐音,它属于中低音区,而且呢略带沙哑, 会有相应的松弛感。我们来听一下生成的效果。今晚的夜色确实不错,不过比起窗外的风景,我倒是对你现在的眼神更感兴趣, 别急着移开视线,既然都走到这一步了,不如坐下来陪我喝完这杯酒如何 大家听一下啊,整个的声音的表达和你对音色的描述呢,是非常契合的。第二个呢,我们来测试一下英文的语音设计,整体的内容和我们刚才看到的是一样的。下边呢,我们看一下英文生成的一个效果。 the moonlight is quite exquisite tonight isn't it, but i find the look in your eyes far more intriguing than the view outside, don't look away just yet since you've come this far why not sit down and finish this glass of wine with me hmm。 大家可以听到啊,整体的效果也是不错的。在这呢,我们提醒大家啊,在使用这个的时候呢,有一定的技巧,建议大家 使用的形式应该是这个样子的,你把这个语音呢分成短句,那我们再来听一下。 the moonlight is quite exquisite tonight isn't it, but i find the look in your eyes far more intriguing than the view outside, don't look away just yet since you've come this far why not sit down and finish this glass of wine with me。 嗯,大家可以听到啊,整个的声音的表达呢,会更有质感,那这就是我们看到的第一个啊,叫做声音的设计。下面呢,我们看一下声音的克隆。声音的克隆呢,有两个最主要的功能,第一个呢,就是直接克隆声音,我们来听一下这有一段参考音频。 hi, everybody anaya thank you for that beautiful introduction i could not be prouder of everything you've done in your time with the obama foundation。 这是奥巴马的一段声音,那下边呢,我们就两种选择了, 第一种呢,就是我们需要把这个参考音频对应的文本给它添到这,当然呢,也可以不添,如果你不添的话,你就需要勾选一下这个, 那这个什么意思呢?就是我们会使用一个向量啊,来代表说话人的这个音色。对于声音克隆的效果呢,它是非常有限的,那我们可以测试一下,现在呢,我就没有添这个参考文本,下边我们听一下生成的效果。 the moonlight is quite exquisite tonight isn't it, but i find the look in your eyes far more intriguing than the view outside。 大家可以听出来啊,就是它有奥巴马的一些音色的特征,并不是特别的像, 那如果你想达到一个完美的声音克隆的效果的话呢,建议大家这样去处理,这个跟刚才唯一不同的就是我把这的勾选给去掉了,而我这添入了这段音频对应的参考文本, 那其他内容呢?没有任何的变化,我们来开始生成的效果啊。 the moonlight is quite exquisite tonight isn't it, but i find the look in your eyes far more intriguing than the view outside don't look away just yet since you've come this far why not sit down and finish this glass of wine with me hmm。 大家可以听到啊,整个声音的效果呢,就非常具有辨识度了。呃,那除此之外,在剩音克隆当中呢,还有一个非常重要的功能叫做保存和加载音色, 因为我们在克隆的时候老是去上传一段音频,然后上传它的参考文本,这个太麻烦了。所以说呢,这有这样的一个功能,我们使用起来之后呢,可以把它保存成一个音色文件,今后再进行语音克隆的时候,直接选择这个音色文件就可以了,看一下具体的操作步骤。 首先呢,跟声音克隆一样,我们上传一个参考音频,然后书写一下它对应的参考文本。然后呢在这我们直接啊选择 c o s file, 那 我们把这个音色文件给它下载下来。下边呢,我们需要上传这个音色文件,这个就是我们刚才保存的这个, 然后直接输入待合成的文本语种,选择自动检测,然后我们点生成就可以得到右侧的这个效果。那我们可以听一下, the moonlight is quite exquisite tonight isn't it, but i find the look in your eyes far more intriguing than the view outside。 大家可以听到跟刚才呢生成的效果是很像的, 那如果我们使用加载音色的这种功能的话呢,在我们日常使用这个功能的时候呢,就会变得非常的简单,那声音克隆呢,有一个大坑啊,大家一定要注意,那我们看下这个坑是什么? 同样是声音克隆,现在这个参考音频呢是我的一段声音,下边呢我这有一个带合成的文本,大家注意这段文本最大的特点就是第一它是英文的, 第二个就是这里边有很多的数字,那这个模型呢,它的泛化能力和鲁棒性呢,都非常的强,所以说呢,作为跨语种的声音克隆呢是没有问题的,但是在处理 数字的时候有一些 bug, 那 我们听一下最终生成的效果是什么样的。 the time is exactly 两点四十五分 a o m i'm waiting for you at 三十一点二三 degrees north and 一 二一点四七 remember the transaction amount is seven y 五千六百 dollars。 我 们就 不细听了啊,你会发现这段音频呢是不能听的,所以说当你进行这种中英文的跨语种的克隆的时候呢,要注意数字的情况, 不是每次都出错,但是出错的概率非常的大,大家可以自己尝试一下,那这是我在测试的时候感触最深的它的一个 bug, 或者叫它的一个坑。那最后呢,我们再来看一下,叫做 customers, 也就是声音的自定义啊,这个呢其实是对已有音色的一些变化, 这里边呢内置了很多的说话人,每一个人物擅长的语言是不一样的,在这呢,我选择了一个中文的 speaker 代合成的文本啊,我们就随便写了一点,然后呢我的声音描述是以极度悲伤的语气把上面的文本呢给它 读出来。好,我们听一下这个效果,就算你自己不想知,你也得考虑考虑别人的感受吧, 我们这些朋友的感受你不在乎,无所谓,那你家人呢?那这就是大家听到的效果,我觉得呢也是非常棒的。刚才大家看到的就是使用原版的 y b u i 展示的效果, 那在 copy u i 里边,大部分功能是可以复现的,但是呢,也不是所有的功能啊,比方说保存音色的那个功能呢,是没有实现的,那我们看一下啊,我把三个功能呢放到了一个工作流里边, 那在使用这个功能的时候呢,大家需要安装一个扩展,扩展的选择呢其实有很多,那在我这呢选择的是 h a i j c 研发的一个千问 t t s 的 扩展,那大家现在看到的就是这个扩展在 github 上的页面, 整体的安装呢也是比较简单的,我们需要下载对应的模型,那关于模型下载完之后啊,应该存放的目录,它在这呢也有非常详细的一个描述。 下边呢我们就来看一下具体的功能。第一个呢,我们叫做声音设计,那这儿呢,我们需要加载一个 voice design 的 模型,然后经过声音设计的节点,这个节点呢同样上边呢是我们要说的这个合成文本,下边呢是对声音的描述,那我们来听一下效果。 the moonlight is quite exquisite tonight isn't it, but i find the look in your eyes far more intriguing than the view outside, don't look away just yet since you've come this far why not sit down and finish this glass of wine with me。 这是声音设计的一个效果啊, 声音克隆呢,我们要加载的东西就多一些,首先模型呢,我们用的是一点七 b 的 base, 然后呢,我们需要加载一个参考的声音,这儿呢,同样是奥巴马的那个声音,那再往下面呢,就是声音的参考文本以及我们要合成的文本,那我们可以听一下这个效果。 the moonlight is quite exquisite tonight isn't it, but i find the look in your eyes far more intriguing than the view outside。 大家听一下啊,非常的像。再往下边就是我们说的自定义声音,这个我们需要加载 custom voice 这个模型,然后我们在这个节点里边需要输入一下我们要合成的文本。另外呢,就是对于声音的一个描述。 好,我们来看下最终产生的效果,就算你自己不想治,你也得考虑考虑别人的感受吧,那我们可以毫不夸张地讲,千伏三 t t s 是 我目前见到的功能最多, 然后生成质量呢也比较好的模型之一。另外非常重要的,这是一个完全开源的模型,而且呢,同时支持实时状态的声音处理和离线状态的声音处理。 那所以说呢,这个模型呢,就非常良心了,建议大家呢自己试一下。好,今天呢,我们就说这么多,关注我,做一个懂爱的人。

语音生成领域又开源了一款王炸的产品,支持本地部署,免费无限生成,配置要求低,生成速度快。功能呢包括三秒极速声音克隆,自定义音色设计,多语言生成和情绪控制等等。下面呢我们来实际操作一下。好,首先呢我们来到文档里面啊,我们直接打开这个官方的开源地址,直接打开。 好,在这里面呢就是有关于这个项目的开源的一个介绍。最上面的模型的名称千问三 tts, 下面的这个目录里面呢,就是这个呃,模型的一个架构,还有安装的一个方法,如何在本地电脑去进行安装。 下面呢还有使用的一个技巧,包括自定义语音生成,如何去设计这个其实词,还有声音克隆的一个操作的步骤。然后具体如何去使用呢?我们来到最上面 看到这个,对吧?这个名称的下面有一个啊哈根 face, 就是 拥抱脸演示,我们打开这个,点击一下打开这个地址, 好,这个呢就是官方,就是网页版的,就它已经给你去部署好了,直接去使用就可以了。然后具体如何去使用呢?我们来到这个地址里面啊,我们来翻译一下,这个好,可以看到它一共是三个功能,包括语音设计,然后声音的克隆, 然后还有 tts, 这个分别是什么意思啊?语音设计是什么意思呢?就是你使用这个中文的提示词,比如说你想要什么样,什么样的声音,是什么性别的,然后说话的节奏怎么样啊?是什么样的一个感觉,就通过提示词来描述 它,就可以给你生成对应的这个声音,这个呢?呃,我这个文档里面有一个演示,大家等会来看一下。然后这个声音克隆就很简单啊,你去上传一段原始的音频,对吧?填上你要生成的文本,直接点击生成就可以了。然后 t t s 呢,就是它使用它内置的音色, 大家可以看到在这个扬声器这里啊,有大概有七八种这个它内置的音色,这个呢就是 tts, 并且呢这里还可以去改变它这个情绪,你想要这个开心一点的或者悲伤一点的,在这里去进行一个提示词的一个控制。 然后具体的这个效果怎么样呢?啊?我之前已经进行了一个完整的测试,我这里啊就不再给大家去生成了,大家直接看我这个文档。然后首,首先是声音克隆,这个效果怎么样呢?我是跟这个 index tds, 也就是 b 站开元的一个呃,开元的一个项目来进行个对比。先给大家说结论, 声音克隆目前来说还是 index t t s。 二、这个效果是最好的,大家可以听一下这个原始的声音,说书唱戏劝人方,三条大路走中央。善恶到头终有报,人间正道是沧桑。然后这个是纤维三 t t s。 克隆的效果, 千问三 t t s 全家桶开源上线,全面支持音色克隆、音色创造和超高质量拟人化语音生成。然后这个是 in x t t s。 二、 千问三 t t s 全家桶开源上线,全面支持音色克隆、音色创造和超高质量拟人化语音生成。好,第二个呢是哪吒的声音,先听一下原声, 又不能出门,又没人陪我玩,您天天不是忙着斩妖就是除魔,今儿能见着您都是三生有幸。然后千问三,千问三 tts 全家桶开源上线,全面,这个呢就是完全就不像了,这个完全是有问题的,就不再去听了,然后 index, 千问三 tts 全家桶开源上线,全面支持音色克隆、音色创造和超高质量拟人化语音生成。 所以说它这个呃 index, tds 二呢,它克隆的这个声音呢,会更像一点,而且它是更稳定的好,包括千问三,在生成这个中英混合文本的时候,它会呃出现很多的问题,所以说如果你是声音克隆,还是推荐大家使用这个 index, 然后下面呢再来看一下另外的两个功能好,这两个功能呢,是我非常推荐大家去使用的,这个质量非常的好,而且它的一个上限啊,就是它的一个上限会非常的高 啊,其中一个呢就是声音的设计,这个什么意思?就是你通过提示词,通过中文的提示词去描述你想要的声音的效果,比如说我这里有一个 呃,提示词,就是体现温婉的治愈的女声,音,调适中柔和,营造出温暖的治愈人心的这个感觉,对吧?只要只需要通过提示词,然后具体使用的方法呢,就是我们来到这个,这个语音的设计,对吧?在这个语音的描述里面,你就直接复制这个中文就可以了,使用中文, 然后上面呢去填上你要合成的文本。好,我们来听一下这个效果,这个效果是非常好的,千问三 t t s 全家桶开源上线,全面支持音色克隆、音色创造和超高质量女人化语音生成,好,第二个呢是成熟沉稳的大叔的男生。 千问三 t t s 全家桶开源上线,全面支持音色克隆、音色创造和超高质量拟人化语音生成。好,下面呢是一个呃青年的,青少年的感觉。 千问三 t t s 全家桶开源上线,全面支持音色克隆、音色创造和超高质量拟人化语音生成。最后啊,再来一个呃烟嗓的,就是慵懒感觉的一个女生 前吻。三 tts 全家同开源上线,全面支持音色克隆、音色创造和超高质量拟人化语音生成,好,可以听到啊,这个它是非常符合这个歌词的,而且它这个声音的质量,包括停顿这个情绪的一个还原 啊,我感觉来说还是非常好的,而且我在生成的时候啊,我没有去抽卡,直接一遍就可以生成,这都是一次性生成的 啊,所以说这个功能是非常有帮助的。最后呢,我们再来看一下 t t s 就是 它内置的这个声音,它内置的这个声音的质量呢,同样非常的高啊,你这个使用方式也非常简单啊,直接去填上中文,选一个这个人物,其他的不用去填,直接点击生成。 好,我给大家来具体的来听一下,其中呢有三个是没有办法生成中文的,我这里啊都进行了一个标注,大家就不要去用了。好,上面呢这个效果来听一下。千问三 tts 全家桶开源上线,全面支持音色克隆、音色创造和超高质量拟人化语音生成。 好,这个呢是北京,北京方言的千万三 t t s 全家桶开源上线,全面支持音色克隆、音色创造和超高质量拟人化语音生成,然后再听一个女性的一个声音。 千万三 t t s 全家桶开源上线,全面支持音色克隆、音色创造和超高质量拟人化语音生成。 如果你有这个配音的方面的一个需求的啊,大家可以去试一下,或者你不想去安装,直接使用这个在线版的,然后如果需要去克隆声音的,还是用这个 index tds。 二、这个版本我们之前也分享过完整的安装包啊。好,这个呢,就是今天我要分享的一个内容啊。好,如果大家有 ai 方面的一个需求啊,可以点个关注。

混蛋,有种出去单挑,你很会打吗?会打有个屁用啊,出来混要有势力,要讲背景。 你哪个道上的?我叫阿杰,你不喜欢叫的话你就叫我太子。好,我承受得起。原来是小瘪三, 大家好,今天给大家带来的是这个千万三的 tts, 我 们先来简单的看一下这个功能,第一个是内置的几个角色的音色,你可以直接让他说话。 第二个是声音设计啊,你可以描述这个音色,比如说一个什么少年,然后他就会生成差不多的音色,你可以多生成几个,然后选。 最后就是声音克隆,在我们刚才声音设计了之后,我们可以把那个设计好的声音给他放在这个克隆里面,然后让他说不同的话,这就是整体的一个工作流程,我们可以看一下具体的功能 啊,我把它做了一个微不断的一个优化,这样子看起来比较简洁美观好看。他一共分为三个功能,第一个是官方训练的几个角色,嗯,比方说,我们大家好,我是丁真, 我是高保真专业配音角色,他内置了非常多,我们可以随便选一个再听一下。大家好,我是丁真,我是高保真专业配音角色。我们选择合适的音色之后,可以直接输入文字,例如我可以直接输入这个, 然后语气也可以选,比如说愤怒,然后点击生成内置高保真角色, 然后他这个就会比较奇怪,因为他是先念的英文,就以老外的这个语气来念中文就很奇怪。如果我们反过来的话,内置高保真角色 custom voice 好, 真的很明显的听出来这种区别,他是先调用的这个中文的去读,读完了之后再去读英文。然后我们看下面这个种子, 这个随机种子是可以锁定一部分的,这个音色我们每次生成之后默认是锁定种子的状态,你下一次去改它还是使用的这个种子,它就不会有太大的变化。 如果你觉得这个声音不太好听,就可以点随机内置高保真角色 custom voice, 好,这现在听起来这个声音就比较阳光一点,比刚才的阳光,我们可以再随机一次内置高保真角色 custom voice。 好, 这次听起来就比较温柔,如果你觉得这个不不错的话,你就不要动这个 c 的 值,你就下次就直接改这个指令就好了,就可以深沉,这个语气不是特别可控,但是你可以试一下。 然后我们看第二个功能就是语音设计,就是你可以设计一个自己的想要的一个声线,比方说我们还是用这个好,我们使用声音沧桑的老年人可以试一下定制声线 voice design, 好 就很,就声音就很低,我们可以试试看这个声音洪亮的青年男子定制声线 voice design 啊,听起来就很高亢。然后我们就要是觉得这个还不错的话,我们就点击这里下载好,等待一下他就会下载成功。需要说明的是,定制声线这个是没有办法锁定种子的,也就是你每一次生成都是一个随机的状态,所以你要是遇到喜欢的就把它下载下来。 呃,然后这个测试的样本你最好是设计一个比较呃丰富一点的,这样子便于我们后面的处理,假如说我现在下载了,我觉得这个声音还不错,然后我就可以到这个声音克隆里面去上传,然后复刻。比方说我们现在就用,就用现在的案例, 你点一下,跟着我左手右手一个慢动作,右手左手慢动作重播,这个就是克声音克隆出来的, 那我们可以上传这个重新上传一个音频,也可以直接用这个声音,可以试试看好,点击执行上传声音进行复刻。 zero shot clone 啊,这个基本上就很像了,比如说我们刚才深沉的那个声音,再测试一下啊,这个参考台词,我们上传一下, 点击克隆上传声音进行复刻。 zero shot clone, 这就是刚才我们设计的一个比较高亢的声音,然后操作逻辑就是我们先设计一个语音, 然后比较满意的,再到克隆里面去复刻他的,让他说一些台词。但是他有个缺点就是在克隆里面是没有办法调整情绪的,不过千万说后面会更新一个带情绪控制的声音克隆,所以我们就等待一下就好了。 现在给大家介绍一下部署方法,也非常简单,我上传到网盘有两个压缩包,然后我们把它全部解压到这个文件夹就可以了,这个千万是这个模型文件,这两个都全部解压到这个文件夹,然后点击启动程序就可以了, 我们稍微等待一下。好,现在这个占用的是七千的端口,然后七千端口就可以看到,这已经加载好了。 大家好,我是丁真,我是高保真,专业配音角色 本地部署,这个是比较方便,因为所有的环境依赖全部都打包进来了。呃,直接一键运行,适合基础比较弱一点的小白,然后直接点启动就可以运行,但是缺点也比较多,就是文件比较大,然后下载也挺麻烦的。 然后我这里再准备了一个 github 的 一个版本,呃,适合这种有一定基础的一些同学用。 我们打开这个之后,可以看到这个里面有非常多的指令创建这个康大的环境,还有激活之类的,包括从 model scope 上拉取这个。呃,模型,我们直接在终端运行,从上到下挨个去运行创建, 然后等所有环境创建完了之后,我们点击这个激活运行康大,然后激活这个环境之后就可以看到运行成功了。好,我们现在介绍第三种方法。 呃,通过多克的部署,先把这个多克的这个依赖和这个部署文件全部都放好了,然后我们直接终端打开,打开这个指令,复制这个多克的 直接粘贴就好了,他就会拉取,然后需要一点网络环境,然后我们直接拉取, 这里就已经成功运行在机前端口了。然后多克的好处就是它适合生产端使用, 它是长期挂载的,就不需要像我们使用的这个整合包或者是康达,你每次要用的时候你要去激活一下。 呃,然后平时要把那个命令行关了,它这个就就比较好,它是可以一直挂载在后面的,如果选择的是 gpu 挂载,它会吃满你的显存,然后所以我选择的这个是 cpu 挂载, 他这里就不会占用你的显存,他是直接运行的时候使用 cpu 运行,我测试了一下,速度是跟 gpu 差不多快的,好,我们看到已经运行成功了,我们刷新一下,好,就可以看到这个已经运行成功了, 他就会一直长期挂载在这个刀口上面,想用的时候就可以直接用。然后我们是来说一下这三个的优缺点,首先整合包比较适合大部分人, 他也不用去解决环境问题。然后第二个是 conda 适合,适合有一定的 ai 使用基础的人,他可以去定制他自己的一些环境啊之类的东西,比如说他有多显卡呀,他可以想切换在哪一张显卡上都可以。 呃,然后第三种就是多克,多克的话就是比较稳定,适合需要长期挂载,然后生产环境使用啊,今天内容就到这里了,谢谢大家。

各位小伙伴们,这个就是千问三 tts 生成的语音内容,你们觉得怎么样? 大家好,这个就是千问三 tts 生成的语音克隆内容,大家听一下感觉怎么样?哥哥你回来了,人家等了你好久好久了,要抱抱。大家好噻,这个就是千问三 tts 生成的四川话语音内容, 大家听听看巴适不巴适?哈喽,小伙伴们大家好,那么视频开头的这几条语音呢, 都是由我们阿里新开源的这个千问三 t t s 模型生成的,他也算是补齐了阿里这个模型生态的千问模型生态的一个呃缺口哈,就是这个 t t s 模型的一个缺失, 那么他这个特点呢?我玩了一下啊,第一个感觉就是非常快啊,他生成的速度非常快,那我们呃生成一段语音呢,大概也就十几秒啊,大概七八秒的语音,他也就十几秒就能生成了。 还有呢,他的功能是有些特点的哈,那么第一个特点就是他可以对这个声音进行一个设计,那所谓的设计就是说你可以用提示词去 控制你这个语音的内容啊,就比如我们一开始的御姐音和萝莉音都是通过这个提示词去控制的,而且他支持中文的提示词啊。 那么第二呢,就是说他能够有一些方言啊,他比如说,呃,目前应该是就两个方言,我们看一下他的表,给了一个表啊,就是他设定的几个角色,固定的预设的角色啊, 那么有两个,一个是北京方言呢,一个是四川方言呢,还有呢就是这个模型它支持了十种语言啊,就是中文、英文、日语、韩语、德语、法语、俄语、葡萄牙语、西班牙语和意大利语啊, 基本就是把那个我们常见的一些语种都包含了,那么我也拿它跟这个 index t t s 二做了个简单对比啊。大家好,这个就是 index t t s 二生成的语音克隆内容, 大家听一下感觉怎么样?大家好,这个就是千问三 t t s 生成的语音克隆内容,大家听一下感觉怎么样?那么 index t t s 二呢?现在就是 我们知道的话,它只支持这个一个克隆哈,支持一个克隆,但是它支持一个双人对话的这样一个,还有这个情绪控制啊,这个其实是 index tts 二的这样一个特征啊,它的一个优势啊。呃,但是其他的,比如说像其他语种,还有这个,呃, 这个声音设计这个还是差,就是跟这个千问三这个 tts 有 些区别的。 那么这个模型在克隆的时候呢,大家要注意一下啊,就是说他最好是能接入一个这个参考的词哈,就是说我们这段语音他对应的这个文字内容最好是接过来。那么这里我就用了一个 whisper 这个模型去做了这样一个处理啊,让它自动去进行一个识别。 那么派派大佬的他的节点呢?是可以不用这个参考语音的参考文字的,但是说,呃,那个我前台用不了,对吧? 那么我也试了尝试让它里边的一些其他的声音,就是在这个预选里边呢,让它去生成的方言。那么在 tst 里输入方言其实是不可以的啊,那比如说我选择这个 v v i, 他本身就是一个明亮略带锋芒的年轻女性声音,那么他母语是中文,那么他说出来的话就没有四川口音啊,就没有四川,四川口音,那么如果说四川口音的话,那只有这个 eric eric 才可以哈,我们在这可以选择这个 eric, 那么这就这样一个模型的一个介绍啊,关于这个节点呢,其实有呃,几个大佬都做了啊,我现在用的这个是这个 h a i g c 这个大佬呢,也是我们那个咱们群里边一位大佬, 那么派派大佬他也做了一个,但是我这边装的话,可能跟我环境这边有一点小冲突啊,那么现在我这边还用不了,我只能先用这个 h a i g c 大 佬,这个节点,他这边的话其实也有一个代码有点问题啊, 就是在这个第四百五十四行这边呢,这个它漏了一串代码哈,就是如果不写这个 speaker 等于 speaker, 那 么在你运行这个预选声音的这个时候呢,它会报一个错啊,就是检查不到一个 speaker, 那 么这里我们可以自己加一个啊,自己加上一个 speaker 等于 speaker 就 可以了。那么我已经把这个节点改好了,然后也放到网盘了,大家可以直接拿我这个节点去 放到你的这个节点文件夹里就可以了。对应的模型其实也不大啊,对应的模型的话,我们只要下载十几个 g 就 可以了啊,它包含了很多啊,一个一点七 b 的, 一点七 b 包含了一个基本模型,一个 呃,定制模型,还有一个声音设计模型,还有一个 token lighter, 这个啊,十二赫兹的这样一个模型,一个 base, 还有一个这个 定制声音的,那么这个工作流使用的时候呢,我们对应不同的任务要选择不同的模型哈,比如说我们这声音克隆的话,我们需要选择 bass 模型啊,一点七 b 的 或者是零点六 b 的 bass 模型。 那么如果你要做这种声音设计呢?它会有专门这个 weiss design 这个模型哈,那么如果你要定这个预选声音的话,那它就用这个啊, custom weiss 这个模型哈,它要选择对应的模型才行。 那么这就是这样一个新技术的一个玩法啊,我感觉其实效果很不错啊,效果确实挺好的啊,就特别是一些方言,还有这种对这个声音的一个描述啊,就是体式词来控制它,效果还是挺好的。 ok, 那 么这个也简单给大家分享到这里啊,那么工作流呢,我也准备上到 running hiphop, 大家可以在线上去体验一下啊。好,就这样,拜拜。

大家好,我是 kei 千万团队呢,最近开源了千万三 tds, 这次开源特别值得关注,他们开源了五个模型,功能非常丰富,而且呢这些性能也相当不错, 目前是支持十种主流的语言,端到端合成延迟非常低,它有自研的千万三 tds 分 词器,然后呢,它还采用离散多码本 lm 架构,单模型呢,可以同时兼容流式与非流式, 我们可以通过自然语言指令呢,驱动指令生成非常灵活。这块呢,也非常像我之前介绍过的 jammin 三 tts 支持的十种语言是这些,这次呢是分一点七 b 模型和零点六 b 模型。 一点七 b 模型里面呢,又分三个,其中呢有啊声音设计,它是可以根据用户输入描述进行音色的创造,那么 voice 呢,它是支持九个精品音色的风格控制, 而 base 模型这次呢,主要是用于因色克隆。零点六 b 模型的话,我们会看到它会缺少指令控制,真色千万三 t t s 在 因色克隆、创造、控制等方面 均达到了 s o t a。 性能官方介绍呢,说啊 voic design 呢,在指令循行和生成表现力超过了 minimax, voic design 闭元模型 大幅领先其他的开源模型。在音色控制方面,它的词错率比较低,可以保持音色的风格控制能力,并且它的长语音生产能力比较好, 一次性合成十分钟语音中的啊,措辞率是比较低的,它的音色克隆能力呢,是超过 mini max 和 c 的 tds, c 的 tds 是 豆包的 tds, 在 多语言方面的话也是非常出色,并且在跨语种音色克隆方面 超过 cosy voice 三,这些是性能对比表,数值越低说明这个模型表现越好。阿里自研的分词器呢?是啊,非常值得关注的,它在 p e s q, 这是客观语音质量评估指标 上达到了三点多分,而满分呢,是四点五分。 s t o i 呢,这是衡量语音的清晰度和理解度,越接近一说明它的指标越好。在 utmos 方面满分五分、四分呢。以上就代表高质量的语音, 还有一个很重要的指标是说话人相似度,它是衡量合成语音与原始说话人声音的相似程度, 越接近于一,说明它的性能就会越好。这次千万三 t t s 开源的九个音色呢,覆盖了多种性别、年龄和语种, 如果我们想要让它生成普通话的时候,最好是选这三个音色。重点来看一下如何通过自然语言描述精准控制千万三 t t s 的 语音生成效果。先看音色创造, 我们可以通过调节声学属性来控制声学属性呢,比如说音高、语速、音量、清晰度、流畅度、口音、音色、质感、情绪、语调,还有性格, 也可以通过年龄,年龄的话基本上一给出来啊,对声音的控制力度是有很大影响的。而且它还有一个很特别的是渐变控制, 你可以啊,促使让他平稳,后面呢,是让他变得激动。通过语速渐变、音量渐变、情绪渐变或者是语调渐变,还可以让他有拟能感。 比如说我们提示里面提示他有笑声、叹气、停顿、语气词或者口语化。或者呢,也可以基于角色设定和背景故事生成符合人物形象的语音,这里有一个参考 角色的姓名、身份背景、外貌特征、性格特质、人生信条。非常好的音色可以持久存储,支持多轮次多角色 长篇章的对话生成。在音色控制方面呢,我们可以通过单属性进行控制,比如说情感音量,语速音调, 也可以是多属性控制,组合控制,复杂表达,风格融合,也可以单人多语化同音音色可以流畅切换不同的语音,保持音色的一致性。音色克隆方面,仅需三秒参考就可以快速克隆任意的音色, 支持跨语种克隆与复杂文本,刚刚也提到它的跨语种克隆是非常强的,而且呢它是支持复杂文本,混合语言,特殊符号和生僻字, 大家可以好好的考考它。现在来介绍一下怎么使用它,最简单呢就是根据千万三它的博文里面有提到 hackinface demo 或者是摩达的 demo, 在 这里呢我们可以选择音色设计克隆, 还有啊自定义的语音。如果你要在本地运行,那就来到 gitlab, 这次呢是安装还是非常方便的,我们可以新建一个空岛环境, 然后激活它。之后呢再安装依赖官方的文档,里面详细介绍了 python 包怎么去使用,还可以先设计语音呢再克隆。官方呢还展示了一个啊 web ui 演示,只需要安装千万 tds 软件包, 并且运行千万 tds demo, 可以 通过以下的命令呢来获取帮助,要启动演示的话,你可以运行以下的命令,你也可以将它的 port 呢改一下,改成比如说八零零幺八零零二, 可以让它同时来运行 wifi, 运行之后呢,就会出现这样的三个页面, 官方介绍的安装呢,主要面向的是由英伟达显卡的用户,作为 mac 用户呢,可以通过 m l x 社区 呃下载它的模型并且进行运行。不过我在昨天尝试的时候呢,遇到了多个问题。 来到 m l s audio 的 仓库呢,可以看到它提交了关于千万斯安 t d s 的 多个修复。如果你在使用千万斯安 t d s 的 时候用了呃, m l s 的 版本,使用过程中遇到了问题的话,那可以参考我这里的做法。 我呢是将默认的库达然后改成了 m p s, 并且将原来的注意力机制改成了 s d p a。 修改了之后,运行千万三 t d s demo help 的 话,还是可以看到它有嗯,多个输出, 比如说我们可以看到它的注意力有哪些,它的 type, 还有它最大支持的 token 数 温度啊, top k。 修改好脚本之后,就可以通过命令呢去运行它。这份文档呢,我会放在星球里呃,有兴趣的话可以了解一下。最后给大家看一下我使用千万三 t t x 生成的一些 demo, 它在声音克隆、音色设计、风格控制方面是非常优秀的, 绝对是开源的 s o t a 非常推荐大家体验一下。 好啦,小宝贝,被子盖好了吗?今天呀,月亮姐姐要给你讲一个小星星找妈妈的故事。从前呢,在很远很远的天上住着一颗小星星,它呀,是天空中最小最小的那一颗,亮晶晶的,就像你眼睛里闪闪的光。 有一天晚上呢,小星星一不小心从云朵坐的小床上滚了下来。咕噜噜咕噜噜, 他滚呀滚,滚到了一片软绵绵的棉花云上。妈妈,妈妈在哪里呀?小星星眨了眨眼睛,四周都是白白的云,好安静呀。 我没回复他,但老兄我懂音乐这东西吧,他不至于你,他只是陪着你,就像今晚,我陪着你们,你们也陪着我,挺好的。 好,接下来这首送给所有还不想睡的人,窗户开一点点,让风进来。嗯,各位夜猫子还醒着呢。现在是凌晨一点四十七分, 外面好像下雨了,你们那呢?刚才放的那首是 chadbacker 的 almost blue, 有个听众给我发消息说他失恋第三天,单曲循环了一整晚。 我没回复他,但老兄我懂音乐这东西吧,他不至于你,他只是 陪着你,就像今晚我陪着你们,你们也陪着我。 挺好的啊,我告诉我的电脑,我需要一点休息,结果它现在居然拒绝开机了。 i told my computer, i needed a little break and now, it's literally refusing to turn。 onཕ དང ཁོ གང ནས ཟོག གི ཞི མོ མི གདའ དེ ཡོད ད ལ ཧོང ཐོག ནས སྐྱིད པོ ཞིག ལ ནོར ཁྱོ ཧེ ས ར ཆ དང ཁོམ པའི མཐོ བ དེ སྦྱོང བྱེད སྒོ ཞིག ལྟ དགོས མ རེད དེ ནི ཡིད ཆེས ང ཡང ཁྱོད གཅིག གཅིག ལ ཁོ བོ ཧ ལས འོ 好啦,小宝贝,被子盖好了吗? 今天呀,月亮姐姐要给你讲一个小星星找妈妈的故事。从前呢,在很远很远的天上,住着一颗小星星, 他呀,是天空中最小最小的那一颗,亮晶晶的,就像你眼睛里闪闪的光。 有一天晚上呢,小星星一不小心从云朵座的小床上滚了下来。咕噜噜咕噜噜,他滚呀滚,滚到了一片软绵绵的棉花云上。 妈妈,妈妈在哪里呀?小星星眨了眨眼睛,四周都是白白的云,好安静呀! 哎,现在双方都不敢动,都在蹲草丛。经济完全五五开,谁先手谁就可能失误。这个心理博弈太顶了 啊!等等等等!蓝色方动了,他们选择开龙逼团,红色方 t p 绕后,来了来了来了,技能全交控制接上了,但是拿掉不掉,治疗拉起来了,闪现追残血,残血还剩一丝,这个收割 能不能拿到?拿到了!一穿四绝地翻盘,你敢信吗?我的天呐,这就是电竞,这就是为什么我们爱这个游戏。恭喜 ts 战队拿下总冠军!兄弟们,我现在手都在抖,这场比赛会被记住很久很久。 牛郎恋刘娘,刘娘念牛郎,牛郎连连恋刘娘,刘娘连连念牛郎郎恋娘来娘念郎。这是对 t t s。 吐字清晰度的极致考验,即使在嘈杂的 background 中,声音也应保持 stable。 哪怕遇到萨痛痛这种叠字结构,也要保持雨流的 smooth, 不要出现明显的机械切割感。 腊梅是冬日的风骨,是岁末的清欢。鳞霜而开,傲雪而放,那淡淡的香,不喧嚣,不浓烈,却能穿透岁月寒凉。

最近爆火的千万三 tts 模型在这几天也进行了开源,此模型支持稳定有情感且可持续输出,是一个集语音克隆、语音设计、 超高质量拟人生化语音生成三大模型为一体的文本转语音工具,支持中文、日文、韩文、英文等多国语言配音,非常强大。我也给大家提供的完整且免费的离线整合包,接下来就给大家分享和演示一下 千万三 t t s 离线整合包,它的体积一共是二十五点二 g b, 支持在温系统进行运行,需要电脑有六 g b 显存以上。 打开这一个文件夹,里面有一个 run 点 bat 的 文件,双击或者是以管理员身份运行,它就可以在我们的电脑上进行打开。首次运行需要我们等待一下,按一下 n t 键, 等待它进行启动以及加载模型。加载完成以后,在这里面有一个这样的链接地址,我们可以将这一个链接地址复制到浏览器进行打开,同时它自己也会跳转打开到我们的浏览器上。打开后这一款工具整合包,它里面是没有任何广告植入的,一共是集成的三种模型,比如语音设计、 语音克隆以及语音合成。我们可以使用这三个模型对我们来进行一个文字转语音操作,或者是对声音进行克隆。首先以语音设计这一个来给大家进行演示,在这一个文本框内输入我们的需要合成语音的文本, 比如这里面他内置的文本语言,我们可以选择中文、英文、日语等等其他国家不同的语言,我们这里就选择中文语音的话,可以根据我们自己需要的一个语气进行描述,点击使用,查看任务管理器,点击性能,再点击 gpu, 可以 看到我们的 gpu 基本上是跑满的。 生成好以后的语音,在这里面可以直接进行预览和试听。它在最上面的抽屉里等等,抽屉是空的, 不可能,这绝对不可能,我肯定是我放在那里的这个声音,它是流露出了这一种难以置信的语气,同时也有一丝恐慌。这一个语音描述和这一个深沉的语音,它的效果基本上都是匹配的,同时它还支持声音克隆,我们可以选择导入参考音频,或者是点击录制的按钮, 录制我们麦克风的声音,现在我对我自己的声音进行录制,接下来对它进行克隆,点击停止,我们在目标文本框输入我们自己需要生成的目标文本,我们可以选择不同国家的语言,以及选择不同的模型大小模型一点七 b, 它的效果比零点六 b 肯定会好。 点击克隆语音生成好以后的语音,在这里面也可以对它进行预览和试听,同时也可以点击下载的按钮,对它保存到我们的电脑本地。怎么样? 大家好,我给大家分享和他这一个效果生成,相对于 index t t s, 他的克隆声音效果会稍微差一点,但是没有关系,这一款语音工具他还支持语音合成,这一个效果我觉得非常强。在这里面输入我们自己需要合成的文本, 选择不同的发音人,这里面有着非常多的一些不同人物的声音,在这里面还可以输入自己的风格、语气等等,然后点击生成语音,生成好的语音点击试听。您好,欢迎使用文本转语音系统,这是我们文本转语音功能的演示, 可以看到这一个声音非常的清澈,而且这一个声音也不算很虚假。这款工具还是非常不错的,尤其他是一个完全免费的离线整合包工具,就给大家演示到这,谢谢各位收看。

你们以为我会哭吗?不,那些亮的刺眼的东西往往需要别人配合。我们来看到 q 问三 tds 的 更新,那么这绝对是属于第一梯队的语言大模型, 支持主流等十多种语言,可以加载声音进行音色的克隆,自定义声音,内涵九种稳定的高准的声音,日式或是输入文本。我们可以设计一个声音最最近也是最强的更新呢,就能够进行多人的对话。 并且 q 问三 t t s 是 属于流势友好这一类的模型,它的生成速度接近于实时生成,非常的快。如果说我这里是生成了接近于两分四十七秒的音频,那么生成的速度呢?大致也是耗时两分多钟,二人认为足以作为 index t t s two 的 替代产品, 并且与我们 air t x 二的音频加图片生成视频呢,结合在一块更是无敌。我要做一点事情,那是全人类都,我究竟要做什么, 我现在还不知道,但这必定是惊天动地之事。我喜欢珍珠的原因很简单,它不抢戏,珍珠不需要,它就安安静静的待着。接着我们看到工作流,我这里使用的是全球最大的在线 com 娱乐娱乐 running heart, 也是康有为爱好者们最常用的在线工作台,最近最好的技术都在同步更新,工作流也可以在线运行。 先看到大家可能比较关注的音频克隆和多人对话的部分声音克隆,那么这个地方呢,是加载的音频,然后克隆其音色,这是这个月的钱。这里是一个语音片段,我们加载 audio 直接连过去,作为参考音频加载模型,这是必要的选项。 设置一下我们想说的话,在声音直接进入之前,我们可以进行人声的分离。这里做人声的分离是因为我们有的时候加的音频,比如说是有 bgm 的, 或者说背景比较嘈杂,我们分离以下应当能获得更好的结果。 我们可以使用这个节点来对我们加载的声音进行反推,作为我们下方的参考文本。这里我建议添加参考文本,尤其是做了自动化的反推之后。生成完成之后呢,我们就出结果了。我究竟要做什么 我现在还不知道,但这必定是惊天动地之事。我们可以听到非常的接近于我们的参考音频了。这里我还做了其他部分的测试,可以简单的听一下。人生不过是一个行走的影子,一个在舞台上指手划脚的拙劣的灵人, 登场片刻就在无声无息中悄然退下。视频相对的流程已经同步更新,可在线运行。我们来看到多人的部分,在多人的部分这个地方呢,我们可以进行多人的对话, 这里的结果和使用方式我认为都是强于 index t t s two 的。 在多人对话当中呢,我这里加载了三个音频, 三个音频显而易见的对应了三个角色,可以更改名称,我这里就保持默认。在 voice clone prom 这个地方呢,我保持前面的一贯的作风,做了人生的分离和文本的反推。 下面的角色二十三呢,亦是同理。输送进去之后呢,我们就得写题日词了。题日词这个地方,就比如说御姐小林,旁白冒号 说什么样的话,没有什么特别的难度,如果我们是有剧本的情况之下,更是简单了, 生成完了之后就出了一个两分四十七秒的音频,这一次的生成我用普通模式跑,只跑了二分二十五秒钟,这里确实是体现出它的优势了,足够的快了,我们简单的去听一下。那你卧底任务是什么? 混进怪兽群里,偷走他们的能量核心。能量核心在哪?小卖部冰柜里叫冰红茶,我们来看到自定义声音,自定义声音很简单,这个地方有九个预设点,一个预设输入我们的提示词就可以生成结果。 声音设计,我们多一个输入框,在这里设计一下。这大概是一个什么样的人,这其实都非常的好理解了。 如果我们想在本地运行,推荐使用的插件是这个插件功能的支持是比较的全面的, 模型是可以自动下载的,因为是阿里自家的平台,所以整个模型都是可以在摩塔社区上免翻墙下载的,在插件当中做成自动下载的话更为的顺畅。 有了音频我们可以加载进来,用 l t s two 对 口型,这个刘德华之前已经分享过了,并且上传到 runnyhop 上面呢,还未见实质性的更新,所以我们依然采用这个流程。

兄弟们,就在刚刚千万开源它的语音克隆大模型困三 tts, 它不但可以直接输入声音描述,无需参考音频就可以生成你想要的声音,包括情感描述、年龄、方言等内容,当然也可以千万使用参考声音的模型都是支持的,最良心的是用零点六 b 的 模型显通只占用六 g 左右, 这里我们可以听一下它生成的效果。你好,我是 serena。 你 好,这是 cosy tts 的 语音合成测试,关注小赵玩 ai, 获取更多有意思的 ai 产品。你好,这是昆伟 tts 的 语音合成测试, 关注小赵玩 ai, 获取更多有意思的 ai 成品。可以听出来效果还是可以的。有了这个本地语音克隆,创造神器,三秒创造你的商用配音。这里本地整个包和云端资源体验地址我都已经为你们准备好了,兄弟们给我点个关注,点个赞,我发给你们!

好啦,小宝贝,被子盖好了吗?今天呀,月亮姐姐要给你讲一个小星星找妈妈的故事。从前呢,在很远很远的天上,住着一颗小星星,它呀,是天空中最小最小的那一颗,亮晶晶的,就像你眼睛里闪闪的光。 有一天晚上呢,小星星一不小心从云朵坐的小床上滚了下来,咕噜噜咕噜噜, 他滚呀滚,滚到了一片软绵绵的棉花云上。妈妈,妈妈在哪里呀?小星星眨了眨眼睛,四周都是白白的云,好安静呀。 我没回复他,但老兄我懂音乐这东西吧,他不至于你,他只是陪着你,就像今晚,我陪着你们,你们也陪着我,挺好的。 好,接下来这首送给所有还不想睡的人。窗户开一点点,让风进来。嗯, 各位夜猫子还醒着呢。现在是凌晨一点四十七分, 外面好像下雨了,你们那呢?刚才放的那首是 chad becker 的 almost blue, 有个听众给我发消息说他失恋第三天,单曲循环了一整晚。 我没回复他,但老兄我懂音乐这东西吧,他不至于你,他只是 陪着你,就像今晚,我陪着你们,你们也陪着我。 挺好的啊,我告诉我的电脑,我需要一点休息,结果它现在居然拒绝开机了。 i told my computer, i needed a little break and now, it's literally refusing to turn。 onཕར ལྟ ཁོ གང ནས ཟོག གི ཞི མོ མི བལྟ ནས བསྡད ཡོད ད ལ ཧོང ཐོག ནས ཇུས གཏོགས སུ ལ ནོར ཁྱོ ཤེས ས རེད ཆ ལྟ ཁོམ པའི ཐོག ལ དེ ཅང ཤེས གོ ཞིབ ལྟ དགོས མ རེད དེ ནས 一件 ན ཨ ཡེ ཁྱོད ཅི ཞིག ལ ཁོ བོ ཧ ནས འོ。好啦,小宝贝,被子盖好了吗?今天呀,月亮姐姐要给你讲一个小星星找妈妈的故事。 从前呢,在很远很远的天上,住着一颗小星星, 他呀,是天空中最小最小的那一颗,亮晶晶的,就像你眼睛里闪闪的光。 有一天晚上呢,小星星一不小心从云朵座的小床上滚了下来。咕噜噜咕噜噜,他滚呀滚,滚到了一片软绵绵的棉花云上。 妈妈,妈妈在哪里呀?小星星眨了眨眼睛,四周都是白白的云,好安静呀! 哎,现在双方都不敢动,都在蹲草丛。经济完全五五开,谁先手谁就可能失误。这个心理博弈太顶了啊!等等等等!蓝色方动了,他们选择开龙 b 团,红色方 t p 绕后。 来了来了来了,技能全交控制接上了,但是拿掉不掉,治疗拉起来了,闪现追残血,残血还剩一丝,这个收割 能不能拿到?拿到了!一穿四绝地翻盘,你敢信吗?我的天呐,这就是电竞,这就是为什么我们爱这个游戏。恭喜 ts 战队拿下总冠军!兄弟们,我现在手都在抖,这场比赛会被记住很久很久。 牛郎恋刘娘,刘娘念牛郎,牛郎连连恋刘娘,刘娘连连念牛郎郎恋娘来娘念郎。这是对 tts 吐字清晰度的极致考验,即使在嘈杂的 background 中,声音也应保持 stable, 哪怕遇到萨痛痛这种叠字结构,也要保持雨流的 smooth, 不要出现明显的机械切割感。 腊梅是冬日的风骨,是岁末的清欢。鳞霜而开,傲雪而放,那淡淡的香,不喧嚣,不浓烈,却能穿透岁月寒凉。

秋哥哥要去桂花习师傅就为敬酒八哥,呦西,花花姑娘死了死了的你的黄金又带又带。大家好,这期我们讲一下这个千万三的 tts, 最新阿里开源的这个千万三 tts, 它有三个功能啊,一个是声音克隆,还有一个是语音设计,再就是一个预选角色,就是他内置的一些角色。这里的 大家也可以去 linuxhop 这个平台去玩一下,用我下面那个链接注册的话,有一千 r h b 可以 玩,每天登录的话也有一百 r h b 可以 玩,跑个三四次应该是没问题的啊。 这个工作流的话,我也上传到软底号的上面了,大家可以去上面玩一下,就是有一个这个预设节点,这个这个好像应该是有点问题,这个平台上面大家可以先玩这两个,我们看一下这个千万山的官网,他介绍 他现在有一个有一点七 b 的 模型和零点六 b 的 模型, 这个后面加了一个灯饰,这里就是一个印刷创造的卡斯托姆,就是一个可以自己设计,自己写文字,然后设计他的风格啊,语气啊这些。最后一个 face 就是 一个克隆的 这个地方,首先大家玩玩的话要安装一嗨嗨 g c 大 脑的一个节点啊, 它这个节点和我本地的整合包有点冲突啊,因为它这个是 free 加速的, 我把它改成了这个 s d p a 的, 这也牺牲了一些速度啊,大家如果能装上的话,最好还是装上这个,因为这个速度是真的快,一般克隆的话也就十几秒就出来了,这 s d p a 速度还是有点慢的。 首先就是克隆这一块啊,声音克隆的话,只要你把自己想要的音色或者角色这个放进来就好了,然后经过克隆 这里这个这里这一块是一个语音转成文字的一个节点啊,因为上如果看过那个数字人那一期的话,应该都知道有这个节点, 这就是我加了一个替换的,如果这这个键你装不上的话,就装这个,这个是那个唱歌的后面接的一个节点,也是可以把语音转成文字的。如果你实在都装不上的话,那你只有把它断开,然后自己手动写你这个 他他说的一些话的文本,然后你把它写在这里面,大家看一下这个演示啊,麻袋巴嘎,你的什么在干活呦,西花姑娘死啦死啦滴,你滴皇军优待优 效果还是可以的。其实最好玩的就是声音设计这一块啊,声音这一设计这一块的话, 你可以根据自己想要的语速感觉,然后把它写在里面写出来,大家听一下。皇上啊,臣妾一片真血可朝日月,为何您尽信那毒妇缠言将我打入冷宫, 这心比血还凉啊。这这一块是应该是最好的,你可以根据自己的设计,然后出来适应它,官方上面也放了很多例子,大家也可以 把这些复制在上面,然后再生成出来,你可以照着这上面写,也可以,反正 ai 很 方便你,你自己想要什么感觉的话,你也可以在上面写在上面,它上面还有很多的,它这里有一块,这个 excel 附用这一块, 他这里有个旁白,这里他有多角色的,可以弄那种小说吧,有声小说,但是他他会把旁白 还有小林这些名字这些都都念出来,不知道是不是节点的问题啊?我本店生成的话,他会把这个带出来。 再就是这个内置声音这一块,内置声音这一块的话,他这里是内置的一些人物的说话的,有中文、英语啊,日语、韩语这些,还有一个四川的方言,北京话 这块其实没什么讲的,但是有一块可以模仿这个日本人说话的,大家听一下 去过可有几国画这四五九月君姐你的名吧? 这个这个还是很好玩的啊,这就是模型这一块啊,模型这一块的话,我放了这两个节点,一个是这个唱歌里面那个节点把它拉过来的,再就是这个 嗨 g g c, 嗨 g c 大 佬的一个节点,如果大家没有那个加速的话,就把这个直接把它替换到这个就好了,别的其实都没什么了。如果觉得大家觉得这期不错的话,麻烦关注三连一下,拜拜。

一年干完了,请问您今年存下了多少钱呢?没存到什么钱,为什么呢?哎,老板上周就跑路了,电话还关机,我们一分钱都要不到啊,哈哈哈。二月即将来临,这是一个国产模型集体发力的时间点,请问团队按耐不住率先发力了。 一月二十二日,千问三 tts 正式上线。说实话,这不仅是一次更新,更是对自家兄弟 hos 三的一次背刺, 在各项指标上几乎是全方位碾压。这次一共发布了一点七币和零点六币两个版本,通常情况下,大家无脑充一点七币即可。零点六币那个小体量只适合对速度有极致要求的场景。下。 一点七 b 包含了三个模型, face 模型,负责音色克隆。 voice design 类似于纹身图,根据你的描述,无终生有创造音色。还有一个 custom voice, 这玩意儿稍微有点鸡肋,目前只能对官方定义的九种音色进行风格微调。 它的基础能力相当能打,支持十种主流语言和多种中文方言生成,延迟甚至被压缩到了惊人的九十七毫秒。 功能上,音色克隆是看家本领,官方宣称最低只需要三秒钟的参考音频就能搞定。 这里我重点强调一下对话领域的指令编写,这感觉像极了纹身图似的 pound。 想要生成完美的声音,你得像导演一样控制角色场景、光照。风格对应到语音里就是音高、语速、年龄、流利度、口音,甚至是质感。 年龄和性别是一个非常有用的参数,能决定深层结果的整体方向。流利度通常包括连贯程度、停顿是否自然、是否口语化。口音指地区口音、外语口音特征以及口音强度, 有意识的去调节这些参数,才能让深层结果无限逼近的理想状态。最让人震撼的是,纤维三 tts 在 绝大多数测试级上都达到了 soft 水平。 注意,这不是在开源圈子里自嗨,而是把所有闭源模型拉一起打了一架。在十一太子测试中,他的词错误率最低,相似度最高。在多语言评估中相似度最高。 虽然说在自定义声音任务上没人干过 mini max 和 gm 八 pro, 但在声音设计任务 instagram tts 衣服上,他依然拿到了最高分。这就很有意思了,是骡子是马,咱得拉出来遛遛。 第一站,咱们先去哈根 space space 广场看看白嫖的效果。先看声音克隆,流程很简单,上传参考音频,右边填入文本,下面点击生成按钮。生成结果的具体评估咱们后面再聊。 重点看看功能啊, voice design 设计音色这一块不需要参考音频,全靠一张嘴描述。但我实测下来,你是一位有十年经验的资深产品经理,曾在多家知名互联网公司工作。 你擅长用户研究、需求分析、产品设计和项目管理,效果和描述的偏差稍微有点大。 我明明要的是个粗犷大汉,还给我生成个中性声音,完全没有那种颗粒感。接下来上强度,咱们直接进入今天的重头戏, 多模型音色克隆大乱斗。今天我找来了市面上最热门的几位选手,前卫三 t t s cosy voice 三 vox c p m 一 点五 g m t t s。 还有一个比较倔强的音带子 t t s。 二、 为了公平起见,前四个模型我写了一段代码,统一跑 index tts。 二、因为版本冲突,我单独给它部署。评测分为四轮,短剧、长剧和两轮长难剧。首先用我自己的声音做样本。第一轮是短剧测试, 这里有个小插曲, g m t t s。 在 面对常参考音频时直接罢工,生成的音频前面有一大段空白,我把音频截断后再生成才能恢复正常。而 cosy voice 三更是交汇始终提示算子错误,也许是某些库存在冲突, 而且参考音频的长度不能超过三十秒,所以这一轮咱们先忽略它。这四轮测试中成为三 t t s or c p m 一 点五 in the t t s two 都输入一分钟长度的音频,而 cosy voice 三和 g m t t s 则是三十秒长度的音频。大家戴好耳机,测试正式开始。先听参考音频 logo 的 发布。桌面端 agent 的 竞赛可以说是翻开了新篇章,购入玩家纷纷入局,杰月星辰也在近期掏出了自家的桌面 agent 产品,谁让他们家在网页端的搜索做得挺深入,支持自定义网站来源, 一大波生存音频就要来了。你以为你赢了,其实你只是没输!真正的胜利是在喧嚣里保持清醒。 咦,你瞅什么?噗噗眨一眼,放了剑,哎呀 你,你以为你赢了,其实你只是没输!真正的胜利是在喧嚣里保持清醒。 你以为你赢了,其实你只是没输。真正的胜利是在喧嚣里保持清醒。你以为你赢了,其实你只是没输。真正的胜利是在喧嚣里保持清醒。 在这个短剧案例里,你觉得谁的还原度最高?第二轮数字长难剧测试文本是,今天是二零二六年一月二十六日,后面省略。 今天是二零二六年一月二十六日下午四点四十七分,我把三点一四一五九和一百二十八千克这两个数字反复念清楚。一一二三一三六减一。 今天是二零二六年一月二十六日下午四点四十七分,我把三点一四一五九和一百二十八千克这两个数字反复念清楚。 今天是二零二六年一月二十六日下午四点四十七分,我把三点一四一五九和一百二十八千克这两个数字反复念清楚。 今天是二零二六年一月二十六日下午四点四十七分,我把三点一四一五九和一百二十八千赫这两个数字反复念清楚。这一轮能明显听出各家模型在咬字清晰度上的差别。第三轮,地狱级难度的绕口令。 黑化肥发灰会挥发,灰化肥挥发会发,会挥化会,会挥发的更快,灰化肥挥发会发黑的更黑,你说黑化肥该不该挥发?我说灰化肥也会挥发,挥发来挥发去黑的更黑,灰的更灰。 pick 不一一普啊,洗澡澡啊,不打,不懂的不要你打,别骂我,我泼你。为啥我去那都撒泼胆,我 speed。 黑化肥发灰会挥发,灰化肥挥发会发黑,黑化肥发灰会挥发的更快,黑化肥会发,会发黑的更黑。说黑化肥该不该挥发?我说灰化肥也会挥发,挥发来挥发去黑的更黑,灰的更灰。 黑化肥发灰会挥发,灰化肥挥发的更快,灰化肥挥发。我说灰化肥也会挥发,挥发来挥发去黑的更黑,灰的更灰, 黑化肥发挥会挥发,灰化肥挥发会发黑,黑化肥发挥会发的更快。灰化肥灰发灰,发灰,发黑的更黑,你说黑化肥该不该挥发?我说灰化肥也会挥发,挥发来挥发去黑的更黑,灰的更灰。 这轮翻车现场比较惨烈,轻微三 t t s。 在 灰化肥挥发后面就读错了,错了大概九到十个字。基于 m t t s 的 错误更多,甚至突然发生了变性,拼空多出了一个女生。这就有点惊悚了。 vox c p m。 既然达成了完美表现,令人惊叹。 index t t s。 有 一点小错误,影响不大。第四轮普通常句测试。 这件事说起来不复杂,我先把问题写下来,再按步骤一点点验证,发现真正出错的地方往往不是最显眼的那一步。等我把所有细节对齐,才明白,不识庐山真面目,只缘身在此山中。所以我习惯在最后再从头读一遍,确认没有遗漏。 这件事说起来不复杂,我先把问题写下来,再按步骤一点点验证,发现真正出错的地方往往不是最显眼的那一步。等我把所有细节对齐,才明白,不识庐山真面目, 只原生在此山中。所以我习惯在最后再从头读一遍,确认没有遗漏。 这件事说起来不复杂,我想把问题写下来,再按步骤一点点验证,发现真正出错的地方往往不是最显眼的那一步。等我把所有细节对齐, 才明白,不识庐山真面目,只缘身在此山中。所以我习惯在最后再从头读一遍,确认没有遗漏。 这件事说起来不复杂,我先把问题写下来,再按步骤一点点验证,发现真正出错的地方,往往不是最显眼的那一步。等我把所有细节对齐,才明白,不识庐山真面目,只缘身在此山中。所以我习惯在最后再从头读一遍,确认没有遗漏。 听完这一圈,不知道大家心里有没有底了。为了避免样本单一,我又从 ins t t s 库中找了几个网络片段,饱含不同的音色和风格。片段一,马保国老师的声音, 呃,朋友们好啊,我是阜阳学院太乙门掌门人马保国。刚才有个朋友问我,马老师,发生什么事了?我说怎么回事? 接下来是模型深层效果。这件事说起来不复杂,我先把问题写下来,再按步骤一点点验证,发现真正出错的地方,往往不是最显眼的那一步。 等我把所有细节对齐,才明白,不识庐山真面目,只缘身在此山中。所以我习惯在最后再从头读一遍,确认没有遗漏。 这件事说起来不复杂,我先把问题写下来,再让步骤一点点验证,发现真正出错的地方,往往不是最显眼的那一步。等我把所有细节对齐,才明白,不识庐山真面目,只缘身在此山中。所以我习惯在最后再从头读一遍,确认没有遗漏。 这件事说起来不复杂,我先把问题写下来,再按步骤一点点验证,发现真正出错的地方,往往不是最显眼的那一步。等我把所有细节对齐,才明白,不识庐山真面目,只缘身在此山中。 所以我习惯在最后再从头读一遍,确认没有遗漏。这件事说起来不复杂,我先把问题写下来,再按步骤一点点验证,发现真正出错的地方,往往不是最显眼的那一步。等我把所有细节对齐, 才明白,不识庐山真面目,只缘身在此山中。所以我习惯在最后再从头读一遍,确认没有遗漏。 片段二,参考音频没了。哎,我在外面看不是六分钟了吗? p 二还有哦哦,有个时机演示啊,在这里说。那来吧,看一下时机哦, 生存效果。这件事说起来不复杂,我先把问题写下来,再按步骤一点点验证,发现真正出错的地方,往往不是最显眼的那一步。 等我把所有细节对齐,才明白,不识庐山真面目,只缘身在此山中。所以我习惯在最后再从头读一遍,确认没有遗漏 啊。这件事说起来不复杂,我先把问题写下来,再按步骤一点点验证,发现真正出错的地方,往往不是最显眼的那一步。 等我把所有细节对齐,才明白,不识庐山真面目,只缘身在此山中。所以我习惯在最后再从头读一遍,确认没有遗漏。 这件事说起来不复杂,我先把问题写下来,再按步骤一点点验证,发现真正出错的地方,往往不是最显眼的那一步。等我把所有细节对齐,才明白,不识庐山真面目,只缘身在此山中。 所以我习惯在最后再从头读一遍,确认没有遗漏。这件事说起来不复杂, 我先把问题写下来,再按步骤一点点验证,发现真正出错的地方,往往不是最显眼的那一步。等我把所有细节对齐,才明白,不识庐山真面目,只缘身在此山中。所以我习惯在最后再从头读一遍,确认没有遗漏。片段三参考音频 当年真府获罪,所有奴仆全部充公便卖,要不是我家买了他给他口饭吃,现在早就饿死街头了。后面是深沉效果。 这件事说起来不复杂,我先把问题写下来,再按步骤一点点验证,发现真正出错的地方,往往不是最显眼的那一步。当我把所有细节对齐,才明白,不识庐山真面目,只缘身在此山中。 所以我习惯在最后再从头读一遍,确认没有遗漏。这件事说起来不复杂,我先把问题写下来,再按步骤一点点验证,发现真正出错的地方,往往不是最显眼的那一步。 等我把所有细节对齐,才明白,不识庐山真面目,只缘身在此山中。所以我习惯在最后再从头读一遍,确认没有遗漏。 这件事说起来不复杂,我先把问题写下来,再按步骤一点点验证,发现真正出错的地方,往往不是最显眼的那一步。 等我把所有细节对齐,才明白,不识庐山真面目,只缘身在此山中。所以我习惯在最后再从头读一遍,确认没有遗漏。 这件事说起来不复杂,我先把问题写下来,再按步骤一点点验证,发现真正出错的地方往往不是最显眼的那一步。等我把所有细节对齐,才明白,不识庐山真面目,只缘身在此山中。 所以我习惯在最后再从头读一遍,确认没有遗漏一下。目前的开源 t t s 确实已经进化到了一个相当可用的水平。 千万三 tds 虽然在排行榜上大杀四方,号称拳打闭元,脚踢同行,但实际体验下来并没有宣传中那种断层式的领先, 反倒是 voxcm 一 点五给了我一个巨大的惊喜,是错误率几乎为零,与参考音频的相似度极高,是真正最接近闭元的模型。关注我,带你理解 ai, 享受生活。

凌晨一点打印时还亮着灯,实习生李默在复印资料,门被推开了,还没走啊,苏总监马马上就好,他指尖若有若无,略过他领口, 午夜加班算特殊工时哦。预知后事如何,请听下回分解。哈喽,大家好,我是香酥幻想。今天这期视频给大家带来千问三 tts 合集,到目前为止,我发过的视频里面就差一个文本转语音的工作流,那刚好今天咱们把它补齐。 在这里首先感谢千文的开源,大家可以看一下这个模型支持的语言特别多,中文、英语、日语、韩语等等,而且它的这个模型容量也很小,一点七 b 的 模型它容量就在四点二三 g 这样,所以说这个模型啊,这工作流八 g 显存就可以畅玩了。 其次感谢派派大佬开发的这个节点,大家记得给他点个 star 啊。那我们回到工作流那首先就是语音克隆,这块,语音克隆很简单,在这里上传你的参考音频,经过这个节点在这里出来结果, 那这个节点需要注意的地方就在这这里输入的是你的参考音频转成的文字,写在这里,这里我是用手敲的, 因为我的环境的问题,我装那个语音转文本的那个插件老是报错,所以我就没有装了。然后你这里要是不写的话,你可以把这个开关打开, 就是他单纯的参考你这个声音的音色去生成,但是这样的话效果会差一些,我试过,所以在这大家最好还是输入一下,或者就装那个 whisper 的 插件。 那这个工作流我也部署到 rng 汉堡了, rng 汉堡也是我平时常用的在线云平台,他的模型更新速度非常快,像这个模型刚出来这边就已经能用了,包括这个派派大佬的这个节点,那像在这里就不用手动去输入了,他通过这个节点把你的参考音频转成文字输入到这 就 ok 了啊,这个大家注意一下就行了。那下来就是这个预设角色的文本转语音,他这里面是内置了这么些角色的,大家可以看一下, 在这可以选他每个角色都有说明对应的语种啊之类的,你看这个小东,他是北京话,所以我这边试了一下,大家可以听听。嘿,您猜怎么着?昨个碰见一新北京,跟我掰着半天,什么豆汁必须配胶圈, 这感觉还行吧。那这个节点顾名思义啊,就是用预设的角色去完成这个文本转语音,你在这里选择好了你的角色之后,可以在这写提示词,控制 控制他的一个情绪啊,各方面的东西,然后在这的输出,那下来就是这个声音定制啊,声音定制是先锋 tts 的 一大特点,也是一大亮点, 就是你可以通过写提示词的方式来生成你自己想要的一个音色,那比如说在这里我写的是性感妩媚的御姐音,大家可以听一下这个声音呦, 这位小哥,我看你不像是本地人啊,那这个提示词大家可以自己写,也可以通过大模型来生成,我这里用的是提示词小助手,我试了一下这个智普四点六 跟这个我本地部署的这个前文三都可以,如果用提示词小助手的话,就在这里设置规则管理器,里面提示词优化规则,你这添加一个,那就是这个大家可以看一下, 然后把这一段提示词给它放进去保存,保存完了之后 刷新一下 f 五,刷新一下这个页面,在预设这里就可以选了,那个提示词我也放到这里了,大家到时候根据自己的需求去用就行了,用提示词小助手,或者说前文三,或者用其他的 api 都可以啊。那最后一个就是属于重量级的,大家可以看一下 多人对话文本转语音,那他这里输入的类型,你可以直接上传,你生成好的语音,大家可以看一下,在这上传音频,那跟前面还是一样啊, 这里输入的内容就是你这个音频所说的话,把它输入到这儿,这里选择模型,正常咱们选一点七 b 的, 一般显存都能跑得动, 大家可以跟 rung 这边我部署好的对比一下,你看就这样的也是一样,跟上面的通过这个节点把你的语音转成文字传到这里,那本地这边我是手动输入的,大家也看到了啊, 这边接的三个声音,下面两个是直接上传的,那第一个是定制的,也就是说你可以在这直接定制, 然后在这里输入,你看在这里我写的是二十四岁的男性实习生巴拉巴拉巴拉什么,然后他经过这个大模型的反推,他在这里生成的就这个音色,因为我想要这样的声音,然后在这里可以直接定制这一句,还是一样,就是他说的这句话的内容, 然后经过这边传进去,然后咱们在这里需要注意的就是把这个角色名字写上,对应你后面的这些文字, 你看里末苏线,然后旁白就用这种格式来写,这边对一对应好,然后这边生成了就 ok 了。所以说我们通过这个节点,那这个模型的可玩性就大大增强了,我们可以去做一些有声书啊之类的,那这个节点这边最多可以支持八个角色 啊。还有一个注意的点就是你不管是你克隆也好,或者说这里要用的也好,比如说你上传的音频是英文的,那你在这就要输入英文的,如果是中文的,你就这输入中文, 那工作流需要注意的东西也就这些,其他的也就没什么了。咱们再看一下网盘吧,同样今天网盘也很简单啊,就是两个文件,大家把这个模型下下来之后,整个文件夹放到你的 model 文件夹里就可以了。好的,那今天的视频就先到这里,我是乡村幻想,咱们下期再见。