就在五月十九日,本周二,谷歌在 i o 开发者大会上火力全开,交出了一份扎实的 ai 打卷,绝对的主角是全新的 gemini 三点五系列模型。其中三点五 flash 版本主打极速和性价比, 在成本大幅降低的同时依然保持了高智商,它将直接成为谷歌生态的默认模型,而更强大的 pro 版下个月就会向公众开放。除了模型本身的升级,谷歌这次还带来了两个非常酷的新伙伴。第一个是通用 ai 管家 germanicspark, 它不再是个只懂聊天的机器人,而是能跨 app 帮你打理数字生活,直接带你执行任务。 第二个是能模拟现实物理规律的世界模型 gemini omni, 你 不仅能用它生成高质量视频,还能像个导演一样用一句大白话直接修改视频里的动作和角色。 此外,经典的谷歌搜索框也迎来了二十五年来的最大改版,现在它能轻松处理你长篇大论的复杂提问,还能帮你做日程规划。开发者们也迎来了全新的代码生成平台 anti gravity。 可以说,谷歌这次是真的把 ai 全面揉进了我们的日常细节里。这么多新功能,你最想先体验哪一个呢?
粉丝229获赞2425

谷歌刚刚发布了 jimmy 三点五 plus, 同时还把他们的编程工具 antigravity 升级了二点零,那这次就很明显了,谷歌的话这次是要全面提升它的这个抠点能力。之前不管是在 coi 还是 ide 还有模型, 其实给我的感觉就表现很一般,那这一次的话,这个模型最大的亮点官方说就是它的这一个速度啊,是前模型的四倍, 所以这一期我们就测一个最关键的问题,这么快的速度,它整个的一个代码质量会不会缩水?那我直接会拿两道真实的一个编程任务,把它和 cloud op 四点七, gpt 五点五放到同样的项目里面,同样提示时看它大家的一个表现情况。那下面的话,我们大概去扫一下它官方改出来的一个奔驰 mark 评分哈, 在编程方面的话,主要就看这一个 terminal, 奔驰二点一,还有这一个 sw 一 奔驰 pro, 从这个评分看的话,这一个 jimmy 三点五 plus 这个评分还是可以的哈,但是基于我之前对于谷歌模型实测的结果来看,就是评分不代表一切,因为之前就感觉它在这个编程方面挺拉的,这次我们就看整个的一个三点五 plus 表现到底怎么样。那这一次的话,我们的整个测试题目哈,就是沿用之前测试 cloud of 四点七,还有就是 gpt 五点五的两道真实的一个编程任务。第一个的话就是我们这一个 skills agent 嘛,需要把它从一个 c o i 做成一个 web ui。 第二个的话是希望他从一个已有的比较复杂一个项目里面把这个认证登录给它迁移过来,这一块也比较复杂,需要支持啊, get 谷歌,然后还要做一个落地页。好,我们来看一下这两个实测项目哈,左边的话,就我刚刚说的这一个 skill is a 镜头嘛,第二个的话就我们图片生成 a 镜头,那这次的话,我们是用了这个 anti gravity 它的一个 c o i 终端工具, 整体这一块呢,它的交互的话是跟呃卡扣的很像,那我这边测试下来,他的速度是真的快,相当相当的快,他说四倍,一点都没夸张。 那大家看一下它这个交互的一个情况啊,其实还是感觉挺挺好的。这个交互,那至于整个模型的能力怎么样,那这两个任务我这边实测下来,它都没有一次性的去完成,它或多或少都有一些小问题。那同样的这个提示值,在同样的项目,我给到了 gpt 五点五 以及 calloff 四点七,它都是能够一次性完成的,不管这两边哪一个项目都可以完成。但是 gmail 三点五 plus 它除了快,但它其实还是会有一些或多或少的 bug 嘛。好,我们来看一下它整体的一个表现情况。 好,我们来看一下这个是 jimmy 三点五 plus 帮我们完成的 skus agent 的 一个 ui 界面嘛,它可以去执行一些操作,比如说我给他一篇文章,可以让他帮我们去总结,它就会去加载这个的 skus。 就 我之前有一期视频 专门讲了这个 skills 的 一个工作原理嘛,那这是它完成的一个效果,整体上 ui 这块还 ok, 那 这边的话是 g p d 五点五给我们完成的,左边也是有我们的一个的一些 skills 是 哪一些?那右边的话就是它整个的一个操作的一个过程嘛。怎么说它这个 ui 的 一个结果的话,我觉得就是呃 g p d 五点五的会好一些。 那关于图片生成这个项目,让它去做一个落地页,以及让它去做一个就是谷歌 get 五的认证登录嘛,那这块它也是完成的,但是不是一次对话完成的。 u i 这块的话就是谷歌还是可以的,就是相较于 g p t 五点五的话,我觉得还是会好一些,就 u i 这块的话,我们还是优先选择就是谷歌的模型嘛。 好,下面我们来看下整体这个评分结果哈,那这个评分的话,还是跟之前一样,我们是把所有的模型生成代码通敏之后,然后改到模型去做 review。 那 这边的话 g p t 五点五是要胜出的,它的分会高一些。 第二个的话就是 cloudoff 四点七会辞职,那 gpt 三点五 plus 的 话,它整体评分效果会低一些,也就是它除了快,那代码质量上的话是会差一些。那这边的话也有些解决方案,比如说你可以用 cloudoff 四点七做设计,或者 gpt 五点五做设计,然后再用呃 jimmy 三点五 plus 去做执行。 那这块儿它还不是还发布了这个 anti graphic 二点零嘛。那这个 id 的 话,你就把它等同于 codex 吧,跟 codex 一 模一样。那我这边的话 现在还登录不进去,不知道啥问题。好,下面我们来进行一个总结。那这次他的整个编码水平的话,就是速度上确实是领先很多,但是在交付的一个结果上来看的话,跟国外两家模型还是有差别,尤其是在一些复杂项目里面,他还是会有偷懒的情况。 如果你是需要去做一些原型啊,或者做一些 u i 啊,我觉得这个 jimmy 三点五 plus 真的 是有比较有吸引力,因为它整个速度比较快,而且它的价格也比较便宜。那如果你是需要一些复杂的项目啊,多文件呀,那阶阶段我还是更推荐大家使用 g p d 五点五,在 codex 里面 你运行起来也非常的快。扣袋子这个 app 我 强烈推荐给大家用,我已经最近用了一个多月了,真的非常非常的好用, card 的 话就是封号真的特别严重,我已经放弃了。 ok, 那 这就是这期视频所有内容了,如果大家觉得这期视频做的不错,可以跟我一箭双雕,我是阿江,我们下期见,拜拜。

谷歌正式宣布推出 gemini 三点五 flash 模型,一分钟快速了解!谷歌宣布推出 gemini 三点五 flash 模型,这是谷歌迄今为止最快、最有效的模型。谷歌表示,从今天起,谷歌的 gemini 三点五 flash 将向全球所有用户开放,并且免费使用, 用户可以在模型下拉菜单中选择三点五 flash 进行体验。这次 gemini 主要更新是从回答问题的聊天助手升级成能主动帮你完成任务的智能体。 一、更强模型推出 gemini 三点五 flash, 更快,适合编码和智能体。任务二,视频能力升级。 gemini omni flash 支持用文字、图片、视频生成和修改视 频。三、更像智能体新增 spark, 可二十四杠。七、后台处理任务。四、更主动的日常助手 daily brave, 能结合 gmail 日历等生成每日简报。在 ai 智能体方面,谷歌将推出 gemini spark。 谷 哥介绍称, geminis park 是 全天候个人 ai 代理,能够帮助管理数字生活,并在指令下代执行任务。 geminis park 本周面向受信任的测试人员推出,下周将面向美国谷歌 ai ultra 定位用户推出测试版。

大家好,今天早上,呃, google 开了他们的 i o 大 会,然后也正式推出了 gemini 三点五 flash 的 新的模型,然后我们现在来快速测一下,看它的能力怎么样。 这第一个我要它创建一个 ppt, 然后大概是一个呃客服的一个系统,然后要六页 ppt, 然后它们的字体要清晰啊,然后要每个问题有一个,呃自己的一个,嗯, 要产品要有一个,然后问题有一个,价格有一个,然后啊,等等最后的一些一个流程吧。然后他根据我的需求呢,先制定了一个计划啊,这是他的计划,然后我可可以继续,我们看一下怎么样,这个地方需要跑,那我就继续。 好,这个结果出来了哈,就是就是他做的 ppt, 感觉这个审美还是非常在线,比这个 codex 我 感觉强不少, 就是字体啊,或者是它的这个选择的颜色,还有这个动画设计啊啊,都是挺不错的啊,觉得可以,我们干第二个测试吧。第二个测试的话, 我跟他说要一个这种啊大览图,然后需要有这个产品的一些按,按不同的进行分类,然后他也是啊,搞了一个这个计划 啊,主题啊,字体啊,然后它的画面啊,它的这个整个结构啊,它应该怎么样去去设计,然后它的边框啊,它主要的画板等等,就是它自己有一个有计划以及验证,这都差不多,跟 codex 跟 cloud code, 我 们待会儿看一眼 效果用,哎,好了,第二个也做好了,我们去看一下啊,这是它的一个整体的状态, 都还有各个的一些详细的数据 面框, 根据这个自动进行一个变化,然后它的,哇,感觉这个完全没问题啊。就是这个,我的 u i 还是很能打,前端确实比这个 open i 强不少。我感觉再看一下第三个,三个我要它做一个小游戏吧,看它能不能做。 对,这边同样是有一个,先有计划,然后让你继续啊。 对,这个就是在浏览器里面做一个小游戏,然后就是这个用来收集一些啊 token, 然后用你的键盘去控制上下左右啊,然后重启啊等等,看看行不行。 对啊,这边还是反复地出现这个,而且你点一它不好使,你必须点 submit。 这个是就是他们新的这个 啊, i d e anti gravity 就 反重力。我觉得这个设计还是一个是抄了 codex 二,一个抄的还不好啊,挺挺值得被吐槽的我觉得。 而且他们,呃,我看他们最新的这个就是这个叫 anti gravity, 它另外有一个,如果你想要看它具体代码,就像以前的 i d e 一 样,它把它原本的那个名字改成了 i, 就是 把这个新的,把这个名字 啊做成了新版的 anti gravity, 但是原本的那个就叫做 anti gravity i d e 就 重新改了一下名字啊,也是让人挺摸不着头脑。嗯,有点奇怪。 嗯,看起来也好了,我们去看一眼啊,这是这个游戏的一个页面,我们看看他,是他说哎呦,它是有音效的哇,这个怎么?嗯啊,要接住 a p i, 然后接住接住绿的这个意思吗? 对,那就是要避开对不对?嗯啊对, 让我自己死一下嘛。会重启只有一次 ok 啊,最后得分,然后重启 ok, 还挺有趣的,就是整个没什么问题,音效也很好,然后动作也很连贯,不错不错,达到了这个要求。好,我们现在再看另外一个测试吧,就是一个三 d 的 模型,看它行不行。 三 d 模型啊,相当于要用那个 three d j s 去创建一个,然后是一个旋转的,同样有一个计划,然后让它执行, 同样的我们继续 使让它进行跑这个脚本, 然后这要是做完了,我们可以看一下,哎,中间有遇到一个错误,然后我修复了一下,我们可以看一下啊,工作了十九秒,然后它就生成 三 d 的 for harvard 的, 上面 这个有三点五。 有点看不明白哦,这个是什么东西? ok, ok, 相当于你把鼠标放在上面,它会显示各个模型的一些细节,它感觉整个是一个,它在晃动,现在我点上去之后,它在来回的晃动,也看不清楚,然后这个下边可能会显示一些这个,呃, 基本的东西,就是不动,拉不动,这个有一点点拉垮了,效果不太好,有点,有点不太行。 先看一下他们这个评分的一个标准,他们就今天早上刚刚发布的这个三点五哦,他们在扣顶上,是这边,是啊,七十六点二,然后仅次于这个五点五,然后比这个四点七还要高哦, 然后比之前的 pro 是 他们的轻量级模型啊,他说比他之前三点一的这个 pro 版本还要高哦, 然后就是这种就是 agent 的 能力, agent 能力也是远远的超过了前两个。就是这种啊,也超过了 opus 四点七,仅次于这个五点五,然后 看一下,就总的来说还是像这种打这个中的都是啊,搜塔就相当于是最高分的,感觉 从评分上来看是很优秀的,但是在网上其实已经很多人出现吐槽,就是实际上生生产用起来就是不如啊,首先不如五点五也不如这个啊, opus 四点七哈,这个是大家的一个目前来看测评的一个结果 啊,所以我这边测评主要是看一下前端是不是还是一样能打。因为啊, jennifer 来说他们的一直设计这一块啊,是比那个呃周鹏 i 要好一点点。总的来说就是啊,我的个人体验就是 啊 gemini 这个三点五 flash 我 觉得一般般,就是我如果你要问我日常啊,工作或者是生活,又会用这个啊来作为我的主力模型吗?我觉得答案就还是不会,就是我本来现在用的也不多,因为啊,它在逻辑推理啊以及这种 agantatic 的 能力上还是 明显的弱于 open i 跟这个 cloud。 所以 啊,我会持续关注吧,因为他们下个月应该会推出他们的三点五 pro 啊,那会是他们的旗舰模型,也希望到时候他们能够啊奋起直追啊,这样就是不要被他们两个另外两家落下太多,有机会大家也可以去试一试。

这么耐,三点五来了,谷歌官方说这是一个全能大模型,感兴趣的可以去试试,试完之后感受怎么样?欢迎打在评论区哦!但今天咱们不聊评测,聊一个更有意思的问题。 大家还记不记得,二零一七年,谷歌的团队发表了一篇论文,叫 attention is all your need, 提出了 transformers 框架。今天你听到的所有的大模型, chatbtcloud, 包括谷歌自己的 gemini, 你 曾用的都是这个东西。可以说,没有谷歌这篇论文,就没有今天这轮 ai 浪潮。 但问题来了,那谷歌作为点火的人,为什么没有第一个举着火把冲出去?答案其实很残酷,就一个字,钱。谷歌靠什么赚钱? 搜索广告?二零二三年,光搜索广告就干了一千七百五十亿美元,占了谷歌总营收的一半以上。而搜索广告这个生意,编辑成本极低,数据中心建好之后,每多处理一次搜索请求,几乎不用花钱,但每一次点击都能收钱, 这可能是人类历史上最赚钱的商业模式之一。然后你再看 ai 搜索是什么情况?传统搜索处理一次请求大概花零点三美分,能挣四点五美分。 ai 搜索呢? 处理一次请求要花三到三十美分,但收入反而只有二点五到三点五美分,成本高了十倍甚至上百倍,收入还更低了。你要是谷歌的管理层,你做不做? 做了,等于主动拿一个成本更高、利润更薄的东西去冲击自己最赚钱的业务。所以二三年的三月份,微软直接把 gpt 四塞进了并搜索谷歌,却拖到了八月份才推出 sge, 慢了将近半年,这半年不是技术追不上,是利益格局挡在那。 这个事让我想到一个经典的案例,柯达一九七五年数码相机就是柯达自己发明的,但胶卷行业太赚钱了,推数码等于革自己的命,结果一直犹豫,最后被数码浪潮彻底淘汰了。 你看这两件事是不是有点像?而且谷歌内部其实一直在纠结,一手把杰姆奶团队做大,投入上百亿美元搞大模型,另一手又调搜索算法,压低 ai 生成内容的曝光率, 左手创新,右手防守,相互打下。因为越大的集团越追求稳定性,新事物对上面的人来说意味着风险和不确定性。宁可守住一个确定能赚钱的平台,也不愿赌一个可能更大但也有可能翻车的未来。不是做不到,是不敢做。 但话说回来,谷歌毕竟不是克他,他有钱有人,有几十年积累下来的数据,二五年谷歌做了一个关键动作,把 gemini 和用户的谷歌搜索历史打通了,你的搜索记录、 youtube 观看记录,甚至几秒内容, gemini 都能参考给你做深度个性化的回复, 这一点 omi 做不到,因为他没有搜索生态。到了 jimmy 三发布的时候,已经有不少评测者感叹说他的前端代码能力、网页复刻能力非常强,三轮对话就能做出一个完整的小游戏。我当时呢,也是 jimmy 的 忠实用户,确实很好用, 到三点一 pro 上线已经变成了妥妥的第一踢腿,所以 jimmy 三点五确实值得我们期待。好,回到最开始那个问题,船大就真的不好调头了,我觉得准确的说,是不是船大的问题,是只有一台发动机的问题。 搜索广告,这台发动机太强了,强到舍不得换,但当这台发动机开始减速,骨骼被迫启动了第二台。最后送大家两句话,如果你是创业者,别怕巨头,他们的惯性就是你的机会,巨头看不上或者还没有注意到的市场,如果你在大公司内部,也要保持思考,看好机会,我们下期见。

便宜半速度四倍,同价位档 arena 排名第一, google 这新模型直接刷新性价比,它叫 gemini 三点五 flash, deepmind 新家族首发, google 亲自盖章代理和编程最强扣的 arena 前端榜单一千五百零七分,同价位的所有模型分数都没它高。第一名 更狠的是,单代涨了七十分,四项主流基准全面打过自家上一代的 gemini 三点一 pro 月季反杀速度是其他前沿模型的四倍,质量却没掉档,从此不用在快和聪明之间选一个, 成本更夸张,官方说做同样的活,他要的钱不到其他同级模型的一半。而瑞纳这份不是刷题刷出来的,是真实用户每天拿它搭 html 和 react 网站打出来的票, 演示更离谱,配合 anti gravity 架子,他六小时啃完 alpha zero 那 篇论文,顺手写出一款能玩的游戏。更骚的是,他开两个子代理,一个负责造,一个负责玩,边玩边改自己的代码,六十秒能给一个结账流程生成好几套 u x 方案。 mccore 银行让他读一百多页文件,秒抓重点。 企业那边已经动起来, shopify 拿它预测全球商家业绩, salesforce 把它装进 agentforce 自动跑流程 rap, 用它识别复杂发票。 zero 全自动对账报税 data bricks 让它盯数据找异常。更反预期的是,你可能早就在用它 gemini app 和 google 搜索的 ai 模式,默认模型就是它。 彩蛋更强的三点五 pro 下个月也来, google 内部已经在用,普通人很快能上手。总结一句话,便宜一半,快四倍,同价位党冠军,想试就打开 gemini app 开口聊就行。更多最新 ai 知识分享,关注我,下期见。

上班了各位,昨天晚上谷歌又发布了 drive my 三点五 plus, 还有 anti gravity 二点零竞争真的是进入白热化了。 coldest 昨天晚上赶紧重置了一下额度。

如果只看标题, gemini 三点五好像只是一次常规模型升级,但这场发布会真正想讲的,是 google 要把 ai 变成整个产品生态的操作层。先看 gemini 三点五 flash, 它不是只给聊天提速,而是在为智能体代码任务和长流程执行做准备。 官方反复强调三件事,速度、成本、还有行动能力,所以参考片里说的一年省十亿。重点不是噱头,当企业每天都在调用模型,模型便宜一点,速度快一点,最后都会变成真金白银。 第二个重点是 java spark, 你 可以把它理解成一个云端智能体入口,用户不用自己准备电脑环境,也不用手动拼工具,直接用对话安排持续性任务,比如整理信息、跟进流程、定期处理机械化工作,关掉电脑以后也能继续跑。 这个方向不新,但 google 的 优势很现实, chrome、 gmail、 地图、 youtube、 支付、搜索这些入口本来就在他手里,别的智能体需要到处接工具, google 更像是把自家的工具直接串起来。第三个重点是 gemini, 它的卖点不是只会生成视频, 而是让输入和输出都走向全模态,文本、图片、音频、视频都可以参与进来,生成结果也不止限于一种形式。官方演示里改视频、换风格、合成角色都可以放在同一个流程里做, 这意味着以后创作可能不用在八个 ai 工具之间来回切。再看开发者测 anti gravity, 二点零也被拉到台前演示,重点不是补一段代码,而是让多个智能体一起推进复杂项目,写代码、开浏览器、跑测试、修问题、再验证,开始变成一个壁画。 所以 google 这次真正发布的不是一个孤立模型,它是在给整个 google 宇宙做一次 ai 版本升级。 搜索、地图、邮箱、视频浏览器都会慢慢变成能对话、能记住上下文、能帮你完成动作的界面。 jamming i 三点五最值得关注的不是单向跑分,而是模型能力、工具入口、执行成本和生态数据被放到了一张桌子上。 如果 google 真能把这些东西打通, ai 就 不再只是网页里的聊天框,它会变成你打开浏览器、地图、邮箱和创作工具时默认就存在的操作层。这才是这场发布会真正值得盯住的地方。关注我继续用普通人听得懂的方式,拆解 ai 产品和开发效率的新变化。

gemini 三点五 flash 发布三天变美国大豆包,这不是什么野鸡 ai, 这是谷歌三天前才在 i o 大 会上吹上天的 gemini 三点五 flash, 官方说它速度是一重一线 ai 的 四倍,性能远超自家前代旗舰,二十四小时不到就开始降至现在全网统一评价。快是真的快,蠢是真的蠢,它唯一的优点就是更快的告诉你错误答案。 有人让他写个护肤科普,肩带三点五开始犯病,直接给你输出几十行,死死死。 有人让他算三百加一百四等于多少,他一本正经的告诉你,等于四百六啊。很多人说这是谷歌的服务器,顶不住偷偷砍算。我翻了几百条开发者社区的贴子。第一个真相,他的默认是 high 档位, 而三点五 flyx 官方写的是 medium, 但实际逆向出来的却是 low。 为了达到二百八十九 tok 每秒的恐怖速度,他把所有能省的步骤都省了, 深度推理砍了,逻辑较验砍了,甚至连最基本的算术计算都懒得调用工具。第二个真相,它涨价了三倍,还更费 tok。 上一代三 flyx 的 每百万输出是 tok 零点五美元,输出九美元。 更坑的是,为了完成同样的任务,他会在后台进行更多无效的自我修正,导致 token 的 消耗量平均上涨了百分之四十。第三个真相,发布会吹的 computer use 功能上线直接没了,官方连个解释都没有,好像从来没提过这事一样。 那谷歌为什么要这么做?答案很简单,下个月要发布三点五 pro 了。这是谷歌玩了无数次的老套路,先发布一个吹上天的阉歌版,让所有人来测试,把流量炒起来,等大家骂他笨的时候,再推出一个真正好用的 pro 版,让你心甘情愿掏钱。而且他还故意把旧的 flash 模型下架, 要么用轻的更贵的 flash, 要么等更贵的 pro。 也许从某种角度来说,人家这是精准的商业算计,用一个阉割版模型吸引了全球流量,还涨了价,顺便为下个 pro 版铺路。大模型的军备竞赛早就变味了,现在比的不是谁更聪明,而是谁能把用户当韭菜割的最舒服。

前几天 google 开发者大会发布了专门的三点五 flash, 那 么我也是第一时间用我的 google ultra 的 账号来试试。先说 google 这次产品做的真是一坨屎,很多朋友也看到两个客户端有点懵逼, anti gravity, 我 先简称它为反重力,是 google 编码的客户端,但是是有两个客户端的,分别是反重力二点零和反重力 ide, 那 么一个更像是 vs code 的 串口,一个更简洁。 google 真的 有时候不太注意用户的体验,也没有很好的告诉消费者两个的端口的区别,有些朋友可能找不到这个端口,反正先不管怎么样,先试试 jammer 三点五 flash 的 能力。老规矩,让他帮我们先做一张天气卡,我们来看看到底效果如何。 那么整体效果还是不错,我认为整体的前段能力还是很强的,天气卡的能力比 deepsea v 四要强上一点,感觉差不多能比肩质朴五点一。但是后端很多朋友反映 jamming 的 能力依旧是有问题,而且有嘴硬,幻觉率非常非常高, 那么并不作为大家的优先使用模型。我个人感觉的话, jamming 三点五 flash 也是闹麻了对吧?更像美国豆包。 好来看 api 的 价格,虽然 java 三点五 flash 没有开源,但是可以根据 tpu 的 显存待宽,推理速度可以反推,估计也就是二百五到四百币的 me 或者 flash 模型,但是这个价格太离谱了。 为什么说离谱呢?因为你看 api 的 价格,输入比 vs flash 贵十倍,输出比 vs flash 贵三十倍,那么按照 tpu 反推的话, java 的 利率在百分之九十以上, 那我相信这个价格大家肯定会选择 tpc, 也有朋友说 google 内部有很大的问题,比如说 google cloud 肯定是觉得 tpu 资源卖给竞争对手是非常赚钱的生意,而 jammer 肯定是倾向于把这个 tpu 资源给客户,以确保这个 jammerc 端用户的粘性,所以这种情况是既要又要。我感觉导致 jammerc 三点五 plus 拉完了。感觉这次 jammerc 三点五 plus 就是 感觉它们内部步调不一样,做的也是前后不一致。 这次发布的欧曼奈视频模型如何?我们一起来测试一下能不能和 cds 二点零持平了。不过这次发布的欧曼奈的视频模型跟 cds 二点零完全没办法比,不管是可操作性还是整体镜头的一致性,还是各方面。当然它价格很便宜,可能价格不如这个 cds 的 十分之一,但是做的确实也很拉。 我不知道有后期他会不会去优化这个模型,让这个有更多可编辑的选项,比如声音,包括视频的流畅度有一个更好的提升。 我个人感觉欧慕莱视频模型仿佛面向的不像是这种 c 端客户,不像是这种用户消费者的这种体验的感觉,它更像是面向一个 b 端用户的 样板,他做的不完善,可能后续如果面向 c 端客户把 omnit 视频模型整合进去,我觉得可能会体验感会更强一点,包括 jimmy 三点五 flash, 可能他去把这个产品优化一些,我觉得可能对 c 端的用户会更好一点,包括他自家的编码的客户端都有两个,自己也搞不清楚。 那希望六月份的 gemini 三点五 pro 能带给我们不一样的惊喜,这次 gemini 三点五 flash 确实拉了个大呢,不知道下次 gemini 三点五 pro 能不能重现 gemini 二点五发布时候的那种惊艳感觉呢? ok, 我 们下期再见。

先看效果, 你看到的这个就是我新打磨的测试机,注意这个演示使用了 g b g p u 渲染了超过一万个粒子,做出来这个火山喷发的效果。这次呢,这面那三点五 flash 能看出来演示效果已经相当接近三点一 pro, 当然呢,它的价格也是非常接近三点一 pro 了,直接比之前 flash 发了三倍。不过需要注意的是,这个测试呢, 在三点五 flash 并不能一次性写,对,它写的 shader 是 有 bug 的, 我修了一次它才能显示。所以目前来看, flash light 会逐渐取代之前 flash 的 位置,而 flash 更有可能是主打一百万上下文以内,不去设置阶梯定价,承接 pro 这部分溢出的用户评测,稍后我会放出。

五月十九号二十号,四十八小时之内,谷歌和阿里各甩出一个王炸。谷歌的 gemini 三五系列 pro 版本参数据说干到十万亿级别。 flash 版本输出速度两百八十 tokin 每秒,是 gpt 五五和 cloud ops 探险兵的四倍,注意是四倍。 还顺手丢了个视频生成模型逻辑推理知识储备指令遵循全面升级。 平头哥还配套发了迅推一体的 ai 芯片。这节奏已经不是卷了,是各方都在抢窗口期。 deepsea v 四刚炸完场, open ai 融了一千二百二十亿, antropica 拿了谷歌四百亿 x ai 甩出谷歌二二零二六年大模型赛道,跑得慢就是死。最狠的是价格战, gemini 三点五 flash 定价每百万 tokin 才一五美元,当模型能力都够用的时候,便宜才是王道。你觉得这场 ai 军备竞赛最后谁能笑到最后?

谷歌昨天刚发的 gemini 三点五 flash, 转眼就被抄了,属于大模型的五二零。没想到是这画风,王剑王硬碰硬,阿里直接把新魔王 quinn 三点七 max 整出来了,跑分超过 gemini 三点五 flash, 登顶国产旗舰。我来给开发者划重点。 这次 quinn 三点七 max 最吸引我的不只是在 arina 全球大模型盲测总榜中,超过了 kimi、 k 二点六、 deepsea v 四 pro 等这些国产猛将, 位列国产模型第一。而是它越来越像一个能长期干活的 agent 了。你们看这个,它去优化一个陌生硬件 kernel, 没有文档辅助,自己连续跑了三十五小时,过程中完成一千一百五十八次工具调用, 四百三十二次评估,自主写代码、改 bug、 调架构,最后性能直接做到十倍加速。还有一个特别 ai 原著名的方向是,它开始越来越像全站工程 agent, 比如一句提示词,它就能直接生成完整交互式 web 应用,不是简单网页, 而是包括推点、 j s 三 d 场景、 canvas 动画、页面布局、前端交互这一整套东西。办公场景也能多智能体协助。比如它可以直接读取高校论文格式规范, 然后调用 office 各类工具,自主修复一篇排版混乱的论文标题、样式、目录页编辑、参考文献,全流程自动完成。 你会发现,今年很多大模型都在往同一个方向走,不再只是回答问题,而是开始真正接管工作流。像宽眼三点七 max 所代表的这种方向,能持久作战,能稳定调用工具,能在跨越千百步的长周期任务中自己推进,很可能就是限阶段智能体最核心的样子。