兄弟们今天给大家带来一个全网手册,塞瑞刚发的新品塞瑞 nova pro mini, 中文名叫钱,它作为一款旗舰级耳机,我们还是要给到该有的开箱仪式感,所以我们先来看一下它的开箱视频。 整体的这个耳机质感还是非常在线,我这次拿到的是白色,其实它一共有三个配色,我觉得深蓝色那个颜色也是很好看的。这个耳机的一些详细参数我就不念了,我想给兄弟们分享的就是我这两周用这个耳机打游戏的整体的体验感受是什么。 那先说结论,相比 nova 七二代,欧米尼的声音质感确实是有提升的,我用一个比喻来去形容,这种提升大概就是 nova 七二代感觉就像二 k 显示器,然后欧米尼像四 k 显示器。 当然不是说二 k 就 不能看,而是四 k 的 细节干净度、品质感呈现的这种品质感会更明显。怎么去用游戏里面的感受去表达这几个词?就是枪声、脚步,包括环境声的边界感会更明显。这就是我说的二 k 到四 k 的 感觉, 不是那种翻天覆地,但你能够感受的到他的这个声音更高级。欧米尼的提升在于他不是单纯的把脚步声放大,而是把整个声音关系做的更清楚,尤其是复杂场景下的枪声、脚步、环境声同时出现的时候, 迷你给到我的感觉就是更稳,声音反馈会更明确。刚好前几天我在直播的时候也是用这个耳机打了一段游戏的素材,然后当时有很多的兄弟都在现场,我们一起来看一下,我们是从行政楼出来,然后水泥厂去抢那个新红曼德尔砖,那里一共是三队人,然后我上楼,大家可以看一下, 注意脚步声的反馈,然后注意在复杂交火的时候我对这个声音方向的判断,以及提前枪, 看到没有,就是我能够先枪把这个位置锁准。接下来就是这个耳机对比 nova 七二代的分数的变化,我们一起可以看一下。 在第五部分就是麦克风和降噪上面,这个耳机是明显有提升的,首先欧米丽是带有主动降噪的,然后麦克风也有一定的降噪能力,但欧米丽的主动降噪你不能把它跟苹果耳机的那种主动降噪画等号,他没有打到,那么他没有那么强,他只能说让你带上去,哎,感觉外面安静了一些。 然后欧迷你依然跟 ide 一 样的,它可以最多同时支持四台设备同时使用,对于我这样子的玩家,这个功能还是很有用的。我觉得欧迷你它更像是一个桌面音频中输, 你不需要来回的切换设备,也不需要一直摘下耳机,这一点我觉得是它和普通无线游戏耳机拉开差距的地方。我在用它的这两周里面,我是同时连接了游戏电脑、推流机、电脑、 手机,它可以让我不摘耳机的情况下同时处理这三台设备上面的所有声音,而且一点都不突兀。另外就是一个无线游戏耳机特别重要的点就是续航,这个耳机依然是塞瑞最经典的可拆卸电池的这种设计, 这样子的设计可以让你完全没有续航焦虑,而且这次它在这块电池上面是做了续航的提升,三块电池可以达到三十个小时的使用时长。 所以这个耳机适合谁?不适合谁?我觉得预算如果到了四千,然后想买一只高端无线耳机的人肯定是适合的。然后主玩三角洲 pop 机这类 fps 游戏,同时又想要更好声音质感的人。还有就是跟我一样桌面设备很多经常电脑、手机主机、直播设备一起用的人。 最后就是那种不想折腾声卡小尾巴各种器材,就想一只耳机解决大部分场景的兄弟,然后他不适合谁嘞?我觉得如果你只是想花一些低预算听脚步, 那它不是最划算的,或者是你只是想要一个普通的无线游戏耳机,我觉得其实 nova 七二代已经很够用了。还有就是如果只追求最强主动降噪的兄弟,那它不是专门为降噪而生的,这个耳机 它就是让降噪让你的环境声变得更安静。两周的深度体验完之后,我最终的结论就是, nova pro 迷你,它最打动我的地方不是哪些参数,而是整体的体验感更好。 如果你的预算是两千内,那么 nova 七二代依然还是值得考虑的。但是如果你的预算到了四五千,然后并且想要更高端更完整更省心的无线游戏耳机体验,那欧米尼 可以重点关注。肯定有很多兄弟又会问,那它跟 e l t 比怎么样?在整个声音反馈和声音质感上面,我没有听出来它跟 e l t 很 大的差距。说实话, 耳机就是这个样子的,就是你一百块到五百块的耳机,那是一分价钱一分货,但是你越往上就是两毛价钱一分货。当然我还是要提醒兄弟们,如果你买了这个耳机,买回去以后不要去调 eq, 就 原声使用,原声使用我测过,信我, 我用了很多的塞瑞 g g 平台上面的 eq 去打游戏,我都觉得不如它的这个原声用的最爽。欧米尼给到的这个声音基站是全新的,它上面也可以很便捷的去调一些功能, 我建议大家调几个关键的参数和功能就 ok 了,不要去调其他的, ok, 今天这一期首发测评就到这里了,之后我还会陆续的去更新这个耳机的体验。最后就是如果有兄弟不太会设置赛季的基站,或者是不太会调赛季的声音,你们可以来私信我。
粉丝1.9万获赞39.2万

谷歌的欧米尼视频生成模型上线了,我们可以在这个 flow 平台上进行体验,同时 flow 平台也上线了很多的视频和图片编辑小工具, 那么本期视频我就给大家测试体验一下欧米尼模型还有这些小工具。首先我进行测试的时候,模型只开放了 fresh 模型, 目前最高能生成七二零 p 十秒的视频,每个视频消耗三十个点数, umi pro 会员一共有一千个 ai 点数,而且我在使用的时候,它的首帧参考功能还没有上线,所以我就简单测试了几个纹身视频的例子, i will send you back to the dark abyss。 好,提示词所要求的东西都有,但是动作,电影质感还有音效都差很多,可以看一下 c 带是二点零的, 而且在 flow 这个平台,我们可以在下面这里输入提示词,直接对视频进行二次编辑。比如我直接输入一条金枪鱼跳上船,我们来看一下效果, i will send you back to the dark abyss。 他 这添加的内容太生硬了,几乎是不可用的。当然有可能他是 fresh 模型的原因。我们再多看几个例子, 这条视频的话,飞机驾驶是还不错,女主的紧张感和节奏也还行,但最后飞机仪表盘反向了,而且多了一个人。下一个我们试一下著名 ip 加想象力 why won't this stupid code work? 暂停一下,这里电脑里表现的内容太棒了,连代码的说尽都像那么回事。 i refuse to do this? 直接切镜头换风格 anymore why won't 他 这条真人路飞生成的其实挺棒的,这是就中间莫名其妙多出来一个动漫风格的镜头,下一个是变形金刚的镜头, 这个表现就太差了,别说跟 c 站十二点零比了,连快乐马都比不过。 下面是一个著名 ip 加动漫风格, anya will defeat all the villains, 这个表现其实还算可以了,介于 first 和 cds 二点零完全体之间, 下一个是香港电影。如果记忆是一个管头,我希望他永远不回国。起 这个案例就表现的很差了,无论是中文音还是镜头都不符合要求。如果记忆是一个罐头,我希望它永远不会过期。来一个九比十六的变身镜头, 那就再来一次, 感觉能比快乐马好上一些,但是这种动作和特效还是 c 大 师您的拿手好, 再试一下科幻镜头, 这个表现太拉胯了,完全没有电影质感,比快乐马都差远。 总结一下就是 omni, 它的表现肯定是不如 cds 二点零的,但它毕竟还是 flash 模型,不知道它有没有正式版,如果有正式版还是未来可期的。它还有一个优点就是足够的便宜,性价比还是很高的,目前生产速度也快,而且目前还 现那些著名的 ip。 今天除了欧莫尼这个更新之外, pro 这个平台还上线了巨多的图像编辑和视频编辑小工具, 我也帮大家测试了一下,总结一下就是很鸡肋,就是看起来很厉害,实际上就是一些常见的开源项目整合而成的图像和视频编辑工具, 比如说编辑文字动画的呀,还有说像什么手绘转图片,从各个仕图和角度去查看原始的图片,这个就是千问的技术吧,我记得还有什么视频跟随音乐动起来,这样的就适合整活。 还有一个是上传三 d 模型,然后再转化为二 d 平面图片, 它的视频小工具还有一个印象比较深刻的是一个抽帧加抠图加重叠的技术, 其他的图像小工具的话,要不然就见太多了,要不然就完全没什么意义。总结一下的话就是 omni 未来可期,图像工具的话作用不大。 那么以上就是 jimmy 在 本次 flow 上的更新的测试结果了,我个人是比较失望的。好,如果本期视频对你有帮助的话,麻烦帮我点个赞。

dance 二点零这次终于有对手了!谷歌刚刚发布的视频模型 omni 到底行不行,我们一试便知。先来看 omni 强在哪里?首先是视频编辑能力, omni 能够在改变画面元素的同时,保持角色和场景的一致性,比如把现实中的雕塑变成泡泡,一触即破, 把自拍里的镜子变成液态,让人碰到就变成终结者。或者是把小提琴手从音乐厅挪到草地上,再变换一个拍摄角度,不过他好像忘记把琴带出门了,真是尴尬。其次是物理引擎更加精准,那说人话就是重力、速度和碰撞之类的效果更加真实。 另外,奥尼也拥有了全能参考的能力,除了能够参考图像、视频和音频合成最终效果之外呢,还能给视频加上指定的特效包装。正为我的动销同事捏一把汗, 那接下来我们看看同框对比 omni 和 c dance 二点零谁的效果更好呢?实测下来, omni 的 物理效果确实更加优秀啊,画面风格也更加丰富多变,但中文能力就远远不如国产模型 c dance 了,这些有机材料就能自醒发光,而且 c dance 的 人物位置更加稳定,画面更有影视风格。 目前这面的 omni flash 模型已经正式上线,不过每天只能生成三条视频,你觉得 omni 能够和 c dance 一 战吗?来评论区咱们接着聊。

olymix 如果真跑通,先被影响的可能不是视频模型圈,而是电商口播和广告素材外包。看完你就懂他为什么盯上的是广告里最难批量做的那类视频。人要出镜,货要互动,嘴型要对上,动作还得跟着姿势走。很多模型能把画面做漂亮,但一碰到人拿东西说话, 稳定性就开始掉。奥密兽想吃下的,正是这块最难量产也最值成本的内容。它不是单一生成,而是想把参考图、音频动作文本一起控制。这对电商口播种草展示虚拟带货价值就很直接了。他们甚至还单独做了一个专门评测这类任务的基准,这说明他们不只是放几个 demo, 而是在认真做一条新赛道。但现在也别吹太满,代码还没开,仓库写得很清楚,还在内部审核阶段,所以它更像一个很对路的研究成果, 还不是马上能接商单的生产工具。如果后面开源后稳定性真顶住,先被压价的可能就是一批清量广告素材和口播外包。你觉得这类模型先该写的会是电商广告团队,还是虚拟人口播团队?

哈喽,早上好,现在是早上的七点,其实我五点钟就起来了,因为今天欧迷你上线,我就想看一下我的账号能不能有幸的去使用上它。在拍这个视频之前我已经嗯简单的探索了一下了, 所以现在的话呢,可以给大家拍一个视频。首先我准备了一段大概十五秒的一个脚本,脚本里面是包含了创意,然后就设计元素,因为早上试的时候呢啊,放了一个真人参考图上去是不过审的,那么我就把这个形象人物形象的 这些描啊特征我都用文字去让 ai 给我描述出来了。我试过有大概两个渠道是可以用上欧迷你的,详细的话我就视频里面不能讲了,你们自己看就好了。然后,呃,然后的话选择十秒,竖屏参数都是一样,然后把这个内容放上去,我们点开始 一次就呃生成两个哈,这一边是 c 档是二点零的,同样的 c 档是二点零,我们选十五秒,这边可以选十五秒哈,哦, ok, 呃,然后欧米尼这边的效果已经出来了,我们看一下哈,唤醒你的不该是喧嚣,而是对深度的渴望,掌管你的种熟时区 deep moment 咖啡。 然后这一次,呃,点进去之后呢,是要有一个像进度条的一样的东西,就是我可以随意拖动,随意拖动到每一帧的一个地方,然后刚刚我尝试一下这个,这个挺有趣的,就是我拖动到男主角的这个地方,然后跟他说把男主角的衣服改成黄色,其他 五遍,然后直接发送给他。这个就有点像我们在啊制作制图的时候啊,对话框的一个形式,告诉他我在哪里修改修改什么地方,然后就跟我昨天发的一个前三是很相似的,哎,你看他就把这个男主角的衣服改成黄色了。这时候我们回去看一看, c 档是二点零的,还在排队。好,现在 c 档是二点零的效果也出来了,我们看一下哈。 唤醒你的不该是喧嚣,而是对深度的渴望,掌管你的专属时区, deep moment 咖啡, 专注每一滴。然后两个模型对比下来的话, c 档子二点零的运镜还是比较优秀的。然后欧米尼的话呢,它就是中规中矩的一个感觉,在实际应用上面的话呢,它的效果也已经不错了。 呃,今天演示的这个还相对比较简单的,动作幅度小,场景简单。呃,那么在后面的话,还会在实际应用上面去看一下动作幅度大,场景切换的比较丰富的情况下,它的一个表现是怎么样。 讲的再好,实际应用上面的体验感是非常重要的。那么在后面的一个广告片的时候,我也会融入到,如果使用 omini 的 话,它的效果会是怎么样?那么我们下期见啦,拜拜。

兄弟们,沉寂已久的谷歌终于来炸街了,就在刚刚结束的谷歌 i o 大 会上,发布了天花乱坠的各种 ai 产品,但真正重点就两个,一个是独一档的多模态能力和超强的 ag 能力。 先来看个最狠的,谷歌发布了全新的世界模型 jimmy nike omni。 你 可以将任何形态的文件作为输入,比如文字、视频、图片、音频一起发给他。 jimmy nike omni 能以任何你要求的形式输出给你, 从此 p 视频就像 p 图一样简单。但如果说 omni 是 无敌的感官,那么同时发布的 jimmy nike 三点五 flash 就是 专为代码和 ag 的 优化的, 它的输出速度达到了同类前沿模型的四倍,每秒狂飙一千五百个 token。 谷歌在现场用全新的 ai 开发平台 anti gravity 二点零展示了它有多逆天。 杰米奈三点五 flash 仅仅持续工作了十二个小时,就从零首写出了一个完整的操作系统内核。它在开发时,后台自动派生出了九十三个 ai 子代理,总 token 成本低于一千美元。而同类型的任务如果交给人类团队,至少需要数月的时间。 更硬核的是这个首出的操作系统,既然能直接加载毁灭战士 doom, 现场就玩起来了。 随后谷歌顺势推出了 gemini spark, 你 可以理解,它是谷歌为你远程部署了一台七乘二十四小时,搭载了 gemini 全套能力的服务器。它能跨越应用,直接打通各种第三方软件。你只要给他一个目标,他自己就能拆解,步骤全自动帮你搞定。 比如自动检查信用卡账单里的隐藏订阅费,把货一记录整理成文档,然后群发等等。最后还有压轴亮相的谷歌智能眼镜,戴上它, jimmy 奶就变成了你现实世界里的专属管家。路过咖啡店,眼镜自动识别,你只要动动嘴, ai 就 把咖啡给你点, 还能实时 ai 导航和同城传译。从这次 ai 大 会上看得出,谷歌正在疯狂地将 ai 模型的能力产品化,毕竟用户真正需要的是能解决问题的产品,而不是 ai 模型本身。第二呢,谷歌之前明显在多模态发力过猛,在 ag 能力方面有点落后于 antropics 和 open ai, 现在眼看 ag 大 爆发,所以他就奋起直追。但即便是刚刚发布的 gmi 三点五 flash, 也依然和这两个头部公司的模型有差距。那么 gmi 三点五 pro 会不会惊艳全场呢?大家可以期待一下。好了,我是阿朱,关注我,让我们一起在 ai 潮头冲浪!

jamn 欧米尼翻车了!就在昨天的 google i o 大 会上,全新的视频模型 jamn 欧米尼正式亮相发布之中呢,所有人都期待他能够创作出超越现有视频模型的作品啊,但现实似乎并没有按照大家想象的方向发展,就连 jamn 欧米尼一直强调的真实世界物理规律,在 cds 面前也毫无还手之力。 无论是画面、构图、分镜,还是单纯的生成效果,都显得一塌糊涂啊。讯息能力似乎与 cds 完全不是一个级别, 但詹姆尼真的很差吗?其实也不完全是啊,在连续编辑上,他的表现反而更加出色。以这段视频为例,将画面中的小提琴手所处的场景更换为草地,人物的动作、神态、表情都完整的保留了下来。 将手中的小提琴给去掉之后呢,仍然能够看出前后非常高的一致性。再看这段发布会上演示过的案例啊,经过欧米尼的多轮编辑后呢,人物会根据不同的设定做出不同的反应, 同时保留出真实的物理效果。由此可见, java omni 并不是专门用来做精美短视频的模型啊,更像是视频版的 nano banana, 它可以精准的根据用户指令修改视频,而不是单纯的创作虚拟型作品。 所以,如果你想通过 ai 一 键成片啊,我想 cds 仍然是现在的第一首选。但如果你追求可控编辑、灵活修改,那么 java omni 无疑更加值得尝试。 比 cds 那 种令人惊讶的视觉效果, jimmy 欧尼更像一个可控的视频工作站,你可以反复修改,局部调整,灵活性远高于 cds, 换句话说,欧尼的价值比生成画质本身更加突出。目前你就可以在 jimmy flow 里进行体验了,赶快试试吧!这是我还推荐第五百四十一个神器,关注我,解锁更多硬核 ai 工具。

cunes 二点零终于迎来真正的对手了!就在今天凌晨 google i o 大 会上, google 直接摔出了王炸全新的 jimmy 欧米妮视频模型,号称能从任何输入生成任何输出。我第一时间冲进去实测了,给大家来说点最干的。首先是欧米妮最牛的地方,对话式视频编辑 可以一句话改变视频里的任何东西,而且全程保持角色和场景的一致性。比如把现实中的雕塑变成泡泡,一触就破。把自拍里的镜人变成液态人,一碰就变成了终结者。甚至能把小提琴手从音乐厅直接挪到草地上,再换个拍摄角度。唯一的小 bug 就是 他好像忘了把小提琴一起带过去。 其次是物理引擎真的封神了,重力、速度、碰撞这些效果比现在所有的 ai 视频模型都要真实。而且它还支持全能参考,除了文字、图片、视频、音频,还能直接给视频加指定的特效包装。真为我的动校同事捏了一把汗,那和 cds 二点零比,到底谁更强?实测下来,欧米的物理效果确实更优秀, 画面风格也更多变,但中文能力就被国产模型 cds 吊打了。而且 cds 的 人物位置更稳定,画面也更有电影感。目前 gemini omni flash 已经正式上线,不够 google ai pro 的 用户每天只能生成三条视频。你觉得 google 这一波能打败字节吗?来评论区来聊聊你的看法。

哈喽,兄弟们,昨晚通宵看了谷歌 i o 大 会,现场演示是天花乱坠,从模型到 agent 再到硬件,全线 ai 产品轮番上阵,看得我那叫一个心潮澎湃。结果实测之后就一句话,大部分都挺拉垮的。 omni 是 这次发布会重磅首推的演示效果相当炸裂。官方定位很明确,万物皆可生成的第一步,代表着在世界理解多模态和编辑能力上的一次全面飞跃,人物细节、风格、 环境角度全都能随意切换。听上去视频模型的新标杆好像就这么立起来了。 其次是 jamming, 三点五, flash 主打一个快高效能打复杂任务,多模态也不在话下,而且官方特别强调他的 agent 能力,在个人 agent 助理和全新的 anti gravity 二点零中都主推三点五,要的就是性能和速度的那个平衡点,吹的都很猛,但到底行不行,还得上手册。 听发布会的同时,我第一时间打开了 gemini, omni 已经上线了,这个版本应该是 omni。 flash 拿前两周做的慢剧提示词测一下,他们家首尾帧要在提示词里写明给大家看一下,这是首帧,这是尾帧续章里祁昌云来凌虚城开奶茶铺的那一段, 等了差不多五分钟,速度还可以直接上,结果 那就开个奶茶铺,大翻车,场景一致性全崩,细节缩水,两档衣服跟原图差了十万八千里,运镜拉胯。最后的配音我差点笑没再放一遍。你们听 开个奶茶铺,对比一下我之前用 cds 做的视频提示词,一个字没改,一轮直出没抽卡, 那就开个奶茶铺, 这个差距就一目了然了吧,而且我用的是 c dance two fast, 再给他一次机会,换个正脸图,输入仍然跟 c dance two 完全一样,节省时间。直接看成片 回到其梦里,对比一下 c dance 的 出品, 首帧,双方表现都很好,中间部分 omni 未能理解提示词中的雷劫,而到了尾帧再次出现了场景偏移。详见屏幕。对比之下, c dance 准确遵循了首尾帧及提示词中的天雷滚滚。 本轮 omni 的 表现略有改善,但首尾帧一致性不足,实用价值有限。 中文视频我感觉奥尼是真不行,正准备测一下英文的时候,屏幕上直接提示额度不够了,大家看,我一个月二十美金买的 pro 订阅就跑了两视频,五小时的额度直接见底了。谷哥你这是搞啥呢?离了大谱了。 得了,就剩这点额度了,给大家测一下 flash 三点五吧。先确认一下,现在用的是新版的 flash 模型,没有问题。第一道题,咱们来测测新版 flash 的 中文,我让他用王家卫的风格写个黑咖啡文案,这个输出速度比 deepsea v 四 flash 慢多了。 我真的读了三遍,只能说太尴尬了啊。抄的几句不说了,我读下这句,零点零一公分,那是我们之间最近的距离。等等,你看看文理,我们是谁啊?这句话有点太不合适了吧, 谷歌这个蒸馏技术是不是把情商也给蒸发了?从二点五时代起, gemini pro 一 直负责我的创意写作,中文一直能打,可是最近这两代 flash 在 这道题上都翻车了, 大家对比一下,左边是三点一,老 flash 跑同一道题的输出,一上来就王家卫说特别僵硬,那最后一句更是让人读不懂他在说什么。然而今天右边的三点五 flash 又刷新了我的认知, 我就不信邪了,它到底强在哪?都说 svg 是 大模型视觉能力的一道坎,因为它逼着 ai 左手写代码,右手还得有审美。那就让三点五先出一个造型精致的 svg。 机器人是可以当吉祥物的那种,要求有点高,我们直接打开扩展思考模式, 提示词我打在屏幕上了,需要的可以截屏。扩展模式花了不少时间,我们直接快进,看结果效果还行,方方正正的。机器人要求的组建细节都到位了, 可惜金属质感和微妙的光晕没画出来,做吉祥物还是差了点意思。再看老版 flash 生成的整体感觉还是比新版弱一些,基本全是线条拼出来的。但话说回来,新版三倍的价格有点不值, pro 就 不用比了,虽然做不到惊艳,但光泽感强太多。 最后用真实世界的复杂任务测一下 flash。 三点五,谷歌这次重磅发了 antigravity, 二点零,我升级好,打开那一刻真的蒙了。看屏幕,他说升级后就剩 agent 的 工作台了, ide 得单独下个 app, 我 当时火就上来了,虽然 agent 和 ide 我 都用,但你不声不响搞成两个也太莫名其妙了吧。 只能收拾一下心情,打开一个一直想重构的工程。上周用老版本 jimmy flash 写的这个项目我不怎么满意,今天刚好让升级版出马,修一修自己之前挖的坑。 这个页面并不简单, remotion 和 three js 做的三 d 短视频编辑器配了十套模板,但模板实现的很套路,随便看两个,第一个三 d 效果平庸,文字对比度不足。 第二个质量还行,就是风格不够。赛博交互逻辑也有不少坑。滚个模板列表全页跟着动,还加了一堆没有实际意义的元素。 打开升级后的反重力,选择新版 flash 模型,思考强度选 high, 在 升级后仅剩的输入框窗口里,让它全面重构刚才这个页面以及所有相关代码。我的要求是更新 u i u x, 优化已有的视频模板,并新增十个不同的模板, 每个视频效果都要做到最佳。目测这个重构速度比老版本的 flash 快 了一到两倍,但是达不到官方宣传的十二倍提速。 三分钟后,重构结束,来打开验一下这个重构后的版本,把排版整个重写了一遍,模板加到了二十个标题,文字全都调过,还新增了模板搜索栏,左侧列表滚动终于独立了。 打开第一个模板,看看配色,这次合理多了,光效也能看清楚,动效马马虎虎吧。再看第二个框线,换成了绿色,但好像就没做更多优化了。下面看新加的模板, 选这个运动实时遥测做的挺好,足球场上有球员轨迹,中央的圆圈有点抢戏,运动方向需要调一下。 最后看个分子料理装盘,配色很赞,中央旋转的菜品标签让人眼前一亮,那些大波纹似乎想表达味道,有点用力过猛。改下标题看看, 没问题,功能正常,小节一下,新版 flash 三点五在反重力加持下提速很明显,能力也增强了,但代价呢?额度消耗是之前的三倍多,刚才这个重构五小时额度的四分之一没了,你算算五小时满打满算只能干十二分钟。 对比升级前老板 flash 几乎无限的额度,大伙啥感受?评论区说说看。 i o 大 会我每年都看,二点五发布后 jammin 就 成为我的主力模型之一, 但这次的翻车程度恐怕仅次于一点零发布的灾难现场。你们可能会在其他地方看到清一色的异美之词,我敢说没实际跑过的探击生物退役指南,喜欢就点个关注,下期见。

ai 视频行业可能又要变天了!有人在 google gemini app 里发现了一个泄露出来的新视频模型, gemini omni。 关键的是,这个模型看起来并不是传统意义上的纹身视频,而是聊天式 ai 视频编辑。 x 上已经有人放出了早期 demo, 比如说其中一个案例提示词是教授在黑板上讲三角函数 omni 生成的视频,黑板上的数学公式居然全程保持一致,而对比 s d 二生成的却是象形文字。 更夸张的是,只需要一句话就可以对视频进行实时编辑,比如说把意大利面换成奶油浓汤,甚至是可以去除视频水印,而不是重新生成整个视频。 你可以直接把天空改成阴天,或者是只去掉这个路人,或者是说只换背景。现在有很多人开始把 omni 叫做视频版 nano 本纳纳, google 这次可能真的在做视频级 ai 编辑器,一旦这个方向成熟,短视频行业可能会彻底改变逻辑, 以后很多视频可能不是重新拍摄或者是重新生成,而是拍完之后直接 ai 改。还有几天 google i o 大 会就要开始了,如果这次欧米尼正式发布, ai 视频行业真的有可能要进入下一个阶段了。

谷歌最新的视频生成模型 omni flash 已经上线了,现在你在 flower 里面已经可以使用它了,那么它最后生成出来的效果到底怎么样?能不能撼动 c 但是二点零的王座? 我们一起来看一下。现在 flower 里面也是支持自定义角色形象了,你可以通过 nano banana 直接生成一个角色的形象,并且可以给他选定与和自定义语音啊。那么比较有意思的地方呢,是它这个有个角色个性的动作啊,它的这个文本呢,就会帮助模型去 呃决定这个角色的这个行为啊。好,那我们废话不多说,我们就来直接测试一下 omni flash 的 这个能力啊。首先我在 type n 里找到了一些案例啊,我用相同的提示词和相同图片去生成这个案例中的这种视频,接下来我就放出前后对比啊, for the empire we will not be defeated。 可以看到跟国内的模型对比其实现在还是有差距的啊,那么谷歌到底是不是在憋个大的,它的 v u 四能不能让它重返这个视频生成的宝座啊?那么这个就是后话了啊。关注我,带你看更多 ai 测试!

你现在就该关心困三五 omni 的 实时打断和音色克隆,因为用户最后会不会长期用一个模型,记住的往往不是分数,而是手感。 三五 omni 中文解读,你以为卖点是参数,其实真正会改变习惯的是实时打断和音色克隆。参数更像发布会语言,但实时打断这种能力才更像你每天会不会继续用它的理由,因为一旦你可以自然打断,它还能接住你, 人机对话的摩擦就会突然下降很多。再加上音色克隆和多语种这种模型影响的就不只是炫技,而是语音产品 创作工作流和跨语种协助。所以这次真正值得盯的不是参数表,而是交互手感。开始怎么改习惯?

大家好,爱折腾的 ai 逗逼又出现了!今天介绍的是小米全新开源的 omni voice 文本转语音 tts 模型。 omni voice 是 一个最先进的零样本多语言, tts 模型支持六百多种语言, 它基于一种新颖的扩散语言模型架构,能够生成高质量的语音,具有更优越的推理速度,支持语音克隆和语音设计,可以分配的说话者属性、性别、年龄、音高、方言、口音、俄语等来控制声音。 皇上请三思,皇后娘娘都是为了万岁爷着想。 皇上的面色未变,宛如雕塑般静止,他的眼中闪过一丝动人的温度。 详细的介绍可进入 gitup 官方页面了解。 在整合包项目,点击运行文件模型,加载完后进入 web ui 界面。 在语言克隆界面里,语种选择提供了超六百个世界,语言默认自动就可以了,会根据输入的文字自动匹配相应的语言生成。设置里有生成语音速度和推理步数, c、 f、 g 等设置。 点击声音设计界面,有选择生成语音的各种配置,性别、年龄、音调、风格、中文方言等,可以根据设定的配置生成相对的声音,自行选择就可以了。 复制一段文字,粘贴到待合成文本框里,然后点击生成。生成的速度太快了, 他从这趟无常之课中懂得失去是一种奇怪的充实,绝望清空了就会变成对生命无止境的渴望。试试中文方言,选择桂林话, 调整一下语音速度, 点击生成。 他从这堂无常之课中懂得失去是一种奇怪的充实,绝望清空了就会变成对生命无止境的渴望。来到语音克隆界面,把合成文本粘贴进去, 参考音频还是我们熟悉的置顶, 希望我在二十岁的时候能够好好的去挑战一些 同样调整一下生成语音的速度,推理步数拉到五十步, 点击生成任务管理器,看到显存占用不到八 g, 当然 cpu 也可以运行哦。听一下克隆生成的音频吧!他从这堂无常之课中懂得 失去是一种奇怪的充实,绝望清空了就会变成对生命无止境的渴望。大家说像不像呢? 再粘贴一段文字到合成文本输入, 把参考声音换成杰伦的, 八秒钟就生成杰伦的语音了。 他从这堂无常之课中懂得,失去是一种奇怪的充实,绝望清空了就会变成对生命无止境的渴望。 不必羡慕别人的繁花似锦,每个人都有自己的生长节奏和花期,静待花开,各自芬芳。你的美好从来都不会缺席。深沉的语音文件保存到 app 文件夹,方便大家管理 他从这堂无常之课中懂得失去是一种奇怪的充实,绝望清空了就会变成对生命无止境的渴望。 这是小米最新 only voice 文本转语音 t t s 模型本地运行演示的视频整合包,已经上传网盘,想要折腾的小伙伴可以下载折腾一下。我是一个爱折腾各种开源 ai 项目的逗比。折腾不易,请动动你的小手,点赞三连,关注一下。 好了,今天的视频就到这了,我们下次再见,拜拜!