大家好,我是旺财,今天给大家介绍一款很有意思的开源语音合成工具 voicebox, 它最大的特点是完全在本地运行,所有的模型、文本、声音数据都保存在你自己的电脑硬盘里,不需要上传到任何云端服务器,这对重视隐私的创作者来说是个很大的优势。 首次使用时需要下载 ai 模型文件,这个模型体积不小,下载时间取决于你的网速,下载完成后就可以离线使用了,之后不再需要联网。它的高精度声音克隆功能很有意思,你只需要提供一段三到三十秒的清晰人声录音。软件能在两分钟内训练出专属声音档案。 它不仅能保留原因的情感特征和说话节奏,还支持添加人物设定描述,让声音更贴合特定角色。软件内置了多种主流语音合成引擎,包括宽三双对齐、 chatbox 等,支持中英文等三十多种语言。 输入文本时,部分引擎支持插入笑声、咳嗽、叹气等语气字标签,让人声更自然。配音软件常有字数限制,但 voicebox 支持单次提交最多五万字。遇到超长文本,它会在后台自动按句子分割生成,然后平滑拼接,直接满足长视频与有声书的制作需求。 它还自带八种专业音频处理参数,变调、混响、延迟等,可以在界面内直接预览调整左侧的多轨道时间线编辑器类似专业音频剪辑软件,可以把不同角色声音拖到不同轨道上,轻松台版对白或播客节目。 voicebox 使用 rasp 的 语言开发,体积小,内存占用低,最关键的是它支持照用显卡加速生成,真正实现了零成本、高频次的配音能力。总结一下,本地部署隐私安全、声音克隆、精准多引擎,支持长文本处理,专业后期编辑。 对于内容创作者来说,这是一个值得尝试的语音合成方案。如果你对这款工具感兴趣,可以在开源社区搜索了解。注意,使用任何软件都要从。
粉丝8641获赞2.7万

大家好,我是小周,今天给大家分享一个本地声音克隆的 ai 工具,叫做 voicebox, 目前呢在 github 上的一个点赞数呢是十三点四 k。 好,那么这个项目呢,可以给我们带来哪些东西?或者说呢,我们可以如何去操作,使得我们的项目呢,给我们提供一些价值?首先呢,如果说我们是这种学生人群,简历里面没有一个合适的项目的同学呢,可以考虑呢通过 voicebox 去做一个小项目,比如说个人播客生成器,或者说 ai 配音工具之类的。当然呢,你有其他更好的想法呢,那是最好不过了,可以通过 借助 voicebox 的 一些能力去实现一个业务。然后呢,可以写到我们的这个简历里面,它是可以本地运行的,所以呢,对我们的这种设备要求呢,我们通常都是可以达到的啊,不像呃,很多这种大模型这种 项目我们本地是跑不了的,而这个 voicebox 呢,我们本地是可以跑起来,并且呢可以去这种操作的去体验的啊,这是没问题的。好,第二个呢,如果说哦,我们是本身已经参加工作了,如果说我们涉及到这种声音控能方面的一些业务,那么呢,我们可以通过 voicebox 呢 去实现我们的业务,把它部署成我们的一个服务。然后呢,通过接口的方式去调用我们这样的服务去实现我们的一个业务,这呢是 voicebox 我 们可以如何去 通过它来体现价值的一个问题。当然呢,如果说我们本身就是从事这种 ai 相关的,这大模型相关,或者模型训练相关的,如果说对 ai 比较熟悉的同学呢,那么可以把 voicebox 这个项目本身 你去作为自己的一个项目经验也好,然后说去二开也好啊,那都是我们自己如何去操作的一个问题了。文档呢,老朱整理了一个简单的一个文档啊,这个文档呢,主要就是代理的设置。首先呢,我们看到 windows 的 安装 在 dapp 上呢,有提供 o s 和 windows 以及多克相关的部署方式。而我们这个开源项目呢,虽然说本地可以运行,但是上呢,它是需要下载模型的,下载模型之后呢,那么就可以本地运行了,所以下载模型这个事情 本身呢,我们需要去设置这一个叫做 onkinface 的 国内代理,因为如果说不设置代理呢,我们这个模型呢,我们下载不下来啊,所以呢,我们 文档呢主要是,呃这两个内容,呃,一个呢是 windows 下的一个代理的设置,第二个呢就是 linux 下的代理设置。好,接下来我们来看一下我们这个 voicebox 的 一个 运行效果。我们在 windows 下去安装了啊,安装之后呢,他是这么一个界面,首页呢长这样子,这里呢,我们已经提前去运行那些内容啊。首先第一步我们需要去创建这一个音频,要创建音频是什么呢?要创建这种参考音频, 所以呢创建参考音频在这块可以去上传 upload, 上传这块呢,老周试了没成功,的确呢,我们没办法上传成功啊,就会报错,这个呢,没有纠结啊。第二个呢,我们通过录音的方式,通过录音之后呢是创建成功了,创建成功之后呢, 要把我们这一个参考的文本给它填进来,当然呢我们这里可以编辑一下啊,我们随便拿一个编辑一下, 直接录制一个参考音频创建啊,在这呢点击这一个开始录制,最多应该是三十秒左右,录制完成之后呢,我们点击停止,停止之后呢,首先在这里可以去 做语音识别啊,把我们刚才录制的这段音频,把它的文本呢识别出来啊,当然我们这里需要去选这个语言呢,我们刚才没选这个语言, 选完语音应该选选语言啊,不然的话识别出来是有问题的啊,然后呢再去识别, 识别出来之后呢,我们自己去自行校对一下,有问题呢我们就去啊创建这一个配置,创建完配置之后呢,我们就能够在首页列表里面呢去展示他了,这么个逻辑,这呢啊,老周存了两个,一个是老周自己的,一个是我们听老师的啊,那么我们可以看一下我们 之前啊通过文本去识别的啊,这个湖南铃声信息科技有限公司,专注于工程师职业提升的在线教育机构,为技术提升穿针引线。好,这是以老周的这一个声音去克隆的啊,第二个湖南铃声信息科技有限公司, 第二个呢是听老师的声音呢,去克隆的啊,专注于工程师职业提升的在线教育机构,为技术提升穿针引线。 好,等下呢,通过这种参考音频加文本的方式啊,去提供一个模板给到我们的这一个 voicebox, 然后呢 再提供相对应的这个文本,让它去帮我们去识别啊,这里呢识别过程会比较久,因为毕竟是自己的 pc 机啊,所以识别过程比较久。在这里呢,我们可以选择不同的模型,当然不同的模型它可能支持的语言是不一样的。在 voicebox 的 文档里面呢,是有去描述的, 比如说这一个千问三 tds, 它是支持十种语言,比如说这一个它就只支持英语。 这里还有个什么 chatbox, 它是支持二十三种语言啊等等。这呢,根据我们实际的情况呢,去选择这样的模型就行了。好,这是关于音频的创建,创建完成之后,我们可以在这里去选择,是吧?首先选择对应的配置, 然后呢输入对应的文字,比如说今天天气很好,然后选择语言,选择模型,然后点击生成,那么呢,在这个位置呢,会显示我们这个正在生成中,下一个部分呢,就是我们这个, 这里有一个 stories, 那 stories 呢,就是我们去生成一个对话,比如这里打工人啊,摸鱼聊外卖的这一个对话,今天天气很好, 好,这边呢,生成出来了啊,好,这呢,老朱,生成的对话就是根据不同的这个人设啊,不同的人声,我们去生成,然后呢给它拼成一个视频,比如我们这直接播,救命啊, 我外卖纠结症又犯了,这家黄焖鸡,昨天吃着咸那家麻辣烫,上次菜没洗干净,你说我今天到底吃啥啊?别问我我刚在吃什么。 这个哲学命题上浪费了二十分钟,最后选了昨天的猪脚饭,主打一个不出错的摆烂。 oh, i'm stuck again this braised chicken was too salty yesterday and that spicy hot pot had dirty veggies last time why is choosing take out harder than finishing my work report don't ask me i spent hours minutes over this philosophical question and just ordered the same pork knuckle rice as yesterday playing is safe with zero effort basically。 好,这呢就是我们刚才啊看到的就说我们可以去创建一个呀对话,然后呢可以通过对话的方式呢把它给拼接起来啊,一起播放。好,这里是 stories, 这块 voice 是 我们刚才创建的配置,还有一个呢是特效,这呢 有提供一些特效选项,我们可以呢通过特效选项呢去改变我们的这一个场景或者环境,比如说我们这随便选一个预览,今天天气很好今天天气很好今天天气很好 今天天气很好,这呢就是具体的一个特效。下一块呢这里是这种音频播放渠道,这不管的啊, 还有个就是模型,模型呢,我们就在这里呢点击下载就行了,自行去点击下载。最后呢就是设置这块呢,它有一个 service url, 这块我们值得注意一下啊, service url 呢,我们可以通过接口的方式去访问,它在我们这一个 app 上呢有去做一个具体的描述,我们怎么样去 访问对应的 a p i? 当然呢我们也可以通过这一个地址加上 document, 它这一个 a p i 呢都包含我们整理生成对应的文档啊,我们直接呢去按照具体的规范去调用就可以了。 好,这呢就是我们今天给大家推荐的这个项目,叫做 voicebox, 一 键三连加关注,支持老周。

如果你只把 voicebox 当成一个开源语音克隆工具,那已经有点过时了。它现在想做的是把文字变声音,声音变文字,还有 ai agent 开口说话,全部放进你自己的电脑里。 voicebox 是 一个本地运行的开源 ai 语音工作室, 目前 github 大 约二五 k star。 它最像是把 eleven labs 和 whisper flow。 你 两边能力合到一个应用里,一边你给它几秒参考音频,它就能克隆声音,再用七套 tts 引擎生成二十三种语言的语音。 另一边,你按住快捷键说话,它可以把内容转成文字,直接贴近当前输入框。真正有意思的是,第三层它还带 m c p 服务,任何支持 m c p 的 a 检测都可以反过来调用。它用你自己的克隆声音把结果念出来。这样一来,语音输入、语音输出和 a 键的反馈就不是三套分散工具,而是一条本地壁环。它 适合做配音、播客、草稿、语音笔记,也适合已经在用本地 agent 的 人。把屏幕里的 ai 变成真的会开口的助手,代价也很明确,模型要下载到本地硬件,性能和兼容性会直接影响体验,而且它还在快速更新,稳定性不一定像成熟云服务那么省心。所以, voicebox 最值得关注的不只是又一个语音克隆工具,而是它在把 ai 语音这件事,从一个单点功能做成一套本地工作流。

家人们得注意了,声音克隆技术又突破了!迈特艾近期公布了第一个深层式语音模型,真的超夸张超离谱!他只需要两秒钟的语音样本,就可以完美克隆你的声音, 甚至可以让有语言障碍的人开口说话。听听效果吧! look brown fox jumps over the lazy dog 你能分清真假吗?他还支持语种转换,目前支持六国语言。强大的噪音消除功能,哪怕以后录音过程中被打断,再也不用重新录制了。 以及夸张的音频内容编辑,他可以随意更改你音频里的说话内容。真的是离谱!妈妈给离谱开门,离谱到家了呀!还能直接把别人的录音替换成你的声音,这个也挺夸张的。多样化语音生成也是个很惊艳的功能, 相当于把你变成了一个诗人或者演说家,让你的声音变得独特而富有表现力。现在 wes box 生成的语音必须用特定的音频分类器才可以区分增加。我是 ai 创客 kc, 提醒您,在这个眼见耳听都不一定维持的 as 的多了解一些 ai 技术,才能更好的防范。

全新开源工具 voicebox 正式发布,基于快三 tts 原声桌面端,实现仅需三秒音频即可克隆任意声音,支持百分之一百本的运行。 该工具能够精准处理复杂情感表达与多语言切换,完全开源,免费,操作便捷,无需联网,克隆效果自然逼真,为语音创作与个性化合成提供高效安全的全新方案。

大家好,今天带来的是语音克隆开源软件 voicebox, 不 用代码,新手易懂,本地运行,完全安全,并且支持 linux, windows、 macos。 用完我直接给大佬跪了,喵, 那如何下载软件呢?进入 github 搜索 voicebox, 下载你电脑对应的版本,打开后一共有三种办法,准备音频、上传自己准备好的文件录取电脑播放的声音,录取你说的话,小声 b b 一下。 有的软件只能上传,一点都不方便喵,它准备了七个 tds 模型,简单理解就是用文本生成对话的 ai, 我 觉得都差不多。选择千问爱国喵,这里就是生成页面了,下面分别是语言模型、特殊效果,大家快去试试吧!

康到爆,这个是目前最火的开源语音合成项目之一,本地离线可用,名字叫做 voicebox, 在 github 上斩获二点五万 stars。 它主要解决目前主流云端配音服务价格昂贵、按字数持续扣费, 以及个人的商业数据必须上传到云端服务器,从而产生隐私泄露风险的问题。这款软件相当于在本地电脑部署了一个专业的配音工作室。依次打开,点击右边第六个图标,把 ai 模型下载一下,这里可能下载会比较慢。软件的核心功能分为三个模块, 首先是高精度声音克隆,只需上传或直接录制一段三到三十秒的清晰人声。软件能在两分钟内训练出一个专属的声音档案。它能保留原音的情感特征和说话节奏,并支持为该声音添加人物设定描述,让发音更贴合特定角色。 其次是多引擎文本转语音,软件内置了包括宽三 chatterbox 在 内的多种主流语音合成引擎,支持中英文等二十多种语言。 输入文本时,部分引擎支持直接插入如笑声、咳嗽、叹气等特定语气词标签,让生成的人声更自然。针对配音软件常见的字数限制痛点,它支持单次提交最多五万字的长文本。遇到超长文本时,它会在后台自动按句子分割生成, 然后再进行平滑拼接,直接满足长视频与有声书的制作需求。第三是音频后期与多轨编辑,它自带了变调、混响、延迟等八种专业音频处理参数,可以直接在界面内预览调整。同时,软件左侧提供了一个类似专业音频剪辑软件的多轨道时间线编辑器 也可以将不同角色的声音拖拽到不同轨道上,直接排版对白或播客节目。在运行环境方面,这款软件使用 ras 语言构建,体积小且内存占用低, 最关键的是,它的所有模型输入文本和声音数据百分之一百保存在你的本地硬盘中,并支持调用电脑显卡进行加速生成,直接满足内容创作者对声音隐私保护与零成本高频配音的刚性需求。

一天一个开源项目,今天看 voicebox。 如果你想要一个本地优先开源,还能自己换模型和换声音的 eleven lux 替代品,那这个项目最近很值得看。 voicebox 的 定位不是一个单点 tts demo, 而是一整套声音工作台。你可以克隆声音,生成语音套后期效果,还能用时间线去编排多角色内容。它为什么这两天值得讲? 第一,它现在还在高频更新,最新版本刚到零点四点零。第二,它不是只包一个模型,而是把 quan 三 t t s lux、 t t s chatterbox、 tada 这些不同引擎统一进同一个本地工作流理。第三,它强调本地运行,隐私和素材都尽量留在自己机器上。 所以这期最值得看的点不是某一个配音按钮,而是它把开源语音生成做成了一个真正可操作的 studio, 你 既能把它当创作工具,也能把它当语音应用的本地后端参考。 如果你最近正想给视频播客、角色对白或者 ai 产品接一个更可控的声音层, voicebox 是 个很适合上手体感的项目。

这段音乐和对话太真实了,但竟然是 ai 丛林创造的,它怎么学会像大师一样构思和谱写声音的? 这就是 audio lm winsbox。 这类声音的生成是大模型的魔力,它们不再是简单的转换器,而是变成了声音的编织机和作曲家。 看,这些大模型的本质,是对原始音频的分布进行建模,他们学会了声音在时间上如何引进的深层规律,给一个开头,他就能像续写故事一样,生成在风格、语义和听感上都连贯的后续声音。无论是音乐、语音还是音效。 所以他不是从库里找碎片来拼,而是真正在脑补和创造全新的、合理的声波。这需要他对声音有超级深的理解。 他们的强大在于通用性和创造性,不仅能生成长篇连贯的高质量音频,还能根据各种提示文本声音进行编辑,风格迁移补全,实现零样本学习。这需要模型掌握及其通用和丰富的升学与语意知识。 这简直是一个全能的声音创响引擎,从作曲、配音到修复,无所不能。我看到了奥迪由 l m voicebox 这类模型,标志着 ai 对 声音的掌控从复制与模仿迈向了真正的理解与创造。 没错,它们是音频 ai 领域的 gpt, 时刻预示着一个声音可以像文字、图像一样被智能生成和编辑的全新时代,将彻底改变音乐、娱乐、通信的形态。更多内容欢迎关注与书讲 ai。

磨蹭十年,备受期待的模块化手机终于不是停留在概念和众筹阶段的空想。深圳华强北凭借其强大的供应链实力,将这款黑科技产品量产落地, 轻薄便携,能轻松塞进裤兜,彻底打破了人们对模块化手机的固有认知。这款手机厚度仅四点九毫米,比传闻中的 iphone air 还要薄,却有着变形金刚般的强大实力,一秒就能切换形态,化身续航怪兽、卫星终端甚至影像王者。 机身背面的一排磁吸触点正是它的核心秘密,让不同功能模块实现无缝衔接,适配各种场景需求。出门旅游随手一吸就能添加五千毫安电池模块,续航不够就再叠加一块,轻松实现一万毫安超长续航,彻底告别电量焦虑。 野外探险时搭配卫星通讯模块,即便身处无信号区,也能精准发送定位,保障出行安全。广场舞阿姨配上哈曼卡顿同级别扬声器模块,音量足以炸翻全场,氛围感拉满。 摄影发烧友则可接入一英寸大底潜望镜模块,光学变焦能力直接碾压主流直板旗舰,随手就能拍出专业级大片。 有人直言,这分明就是多年前谷歌的 projectara 项目翻版,但当年这个看似前景无限的项目最终折戟沉沙,不仅接口松动体验不佳,模块定价更是高的离谱,再加上缺乏强大的供应链支撑,最终只能无奈夭折。如今,华强北彻底解决了这些痛点, 深圳一家小厂凭借精湛工艺,将磁吸触点的良品率做到了百分之九十九点九九,彻底杜绝接口松动问题。更关键的是,各类功能模块定价亲民, 从一杯奶茶钱到一顿火锅钱不等,让普通用户也能轻松负担。其实,这背后藏着一套被忽视的逻辑,主流手机厂商并不愿意推行模块化,因为一旦用户只需花五十块升级续航,两百块升级影像,就没人愿意花八千块更换,整机, 厂商的高额利润将大幅缩水。时代正在改变,未来的手机或许不再是买一台,而是拼一台。每个人都能根据自己的需求搭建专属的随身装备库,这样兼具实用性、性价比与创新性的模块化技术,你会愿意为他买单吗?评论区聊聊你的看法,关注我,了解最新科技!

都说十个丰田车主,九个都在用这个不起眼的小配件,开过丰田的人都知道,丰田全新车型都没有自动升窗功能,万一忘记关车窗,小则丢失财物。如果赶上下雨或者下雪变成水泡车,那就麻烦大了,所以这是我们众多丰田车友安装它的主要原因。装上这个模块之后, 熄火下车,关好车门,四门车窗会自动上升,而且保留原车防夹手功能。安装非常简单,找到我们主驾驶下方这个白色的接口, 直接对插上去就行,无损安装,不用破线,也不用打孔,只需启动车辆,二十种隐藏功能就能被激活。 熄火、下车、关门,四个车窗会自动上升,还能实现解锁鸣笛、亮大灯,方便停车场和夜间找车。熄火后有大灯延时关闭,照亮回家的路。停车挂 d 档,车门自动落锁。 停车挂 p 档,四个车门自动解锁,方便所有乘客向下车。有些配置挂倒档还会自动双闪,提醒周围的行人和车辆。方向盘为回正提醒 疲劳驾驶提醒。长按钥匙解锁键,四个车窗自动打开。长按钥匙锁车键,四个车窗自动上升。 还有未锁车提醒等二十几种隐藏功能,建议所有的丰田车主都给它安装上,让你的爱车从低配秒变高配用车,安全性直接拉满。现在有两个版本可选,拍标准版我直接给你发升级版,同款链接我已放在视频左下角,所有丰田车友都可以安排上。

哈喽大家,今天给大家分享一个大疆纳诺的神仙功能,语音控制,平时如果说想拍一个第一视角,或者说你在高速放坡的时候不方便把手离开车把去按这个录制按钮的时候,这个语音功能就非常实用了, 其实我之前也知道这个功能,但是一直没怎么把它用好。语音控制功能在我们下滑这个菜单界面可以看到这里有一个小人张着嘴巴说话的图标,我们点进去, 然后这个按钮给它打开,我们向下滑就可以看到它这里是有四个指令的,比如我们说开始录像, 他就已经开始录制了,并且会有一个低声提示音,我们说结束录像,哦不对,是停止录像,结束了停止,老是说混,一定要说,对啊,开始停止录像录像,然后还有可以拍张照片, 还可以关闭相机,你看就很方便对不对? 但是我们骑行的过程中,一般是这两个分开来使用,这个揣在骑行服口袋里,这个吸在衣服的胸前,对不对?那么当这个图传模块它处于待机或者没有电源显示的状态下, 我们这个相机模块我说语音指令的时候,它是没有反应的,你们注意看,注意听 我说开始录像他是没有反应的,那么小技巧来了,我们需要在一般我们按这个是开始录像,对,我们现在需要长按他,把这个相机模块给他变成一个待机状态, 它会有滴滴滴三声提示音,这个地方前面它是有个绿色的指示灯的,但是我这里贴了一个散热片,所以这里就看不到,但是你听三声三声指示音也知道它已经是处于一个待机状态, 当他处于待机状态的时候,你就可以继续进行语音控制,他录像拍照啥的,你们感受一下,开始录像他会有一声低,我说停止录像,两声低,拍张照片 滴一下,关闭相机是四声滴滴滴滴,我们把它进入,再进入待机状态。长按这个一般的录一般是我们用来进行录制或拍照的这个按钮它本身机身就只有一个按钮,也不会搞错啥的,就是长按它三秒以上, 它会有滴滴滴三声,它就进入了待机状态,待机状态我们就进行,可以进行语音指令了,就很方便。 ok, 这就是今天的小技巧,还没有试过的朋友赶紧去试试,觉得有用别忘记了点赞、关注、分享给你那个爱汽车的朋友,我们下期再见!拜拜!

只需要简单一插一套彻底颠覆奥迪车机的华为鸿蒙最新款系统,他来了!功能强大到你不敢想象!打开天窗,打开车窗,温度最低。打开座椅通风,天窗已打开,车窗已打开,温度已最低。 在附近给我找一个最近的奥迪四 s 店,我要做保养!为您找到北京安阳、伟业等附近的奥迪四 s 店。需要导航吗?导航,第一个出发,全程十一公里。北京今天的尾号限行是多少?二零二六年五月十三日星期三 北京本地及外地机动车尾号限行规则如下,限行尾号四和九,尾号为字母的,按零号管理。给我来一点最近好听的流行音乐 怎么样?智不智能?好不好用?不要再每年花好几千买奥迪原车流量了, 直接搞这个 ai 小 盒子,车窗、天窗、空调、导航、听歌、问问题、看电影、动动嘴,全部轻松操控!而且重点是,它不需要连手机就能使用!因为这个 ai 系统直接给你的老车机做了一次迭代升级,比你买的手机盒子更高、 更稳定、更便捷!只需一次升级,就能让你奥迪的车机不再过时!评论区留下车型年份,让我看看你的爱车能不能搞它!