google 昨天发布了 gmail 三 flash 官方直接放了一个炸裂的 use case, 你 录了一段音频去讲一个概念, ai 呢,会识别你的知识盲区,然后生成定制的一个 quizz 来考你 每道题呢,还会给你一个详细解释,我立刻去实测一遍。所以呢,我将用三分钟带你去看我是怎么背 ai 啊,去教做人的。 这功能呢,基于的就是费曼学习法,流程就三步,第一步我们去用录音去讲概念。第二步呢,就是 ai 去诊断盲区,精准去找出你哪里是没有去讲清楚。 第三步就是定制 quiz 去答题,针对你的一个拨落点去出题。 ok, 那 现在我就用一个第一性原理,这个被撩烂的一个概念来进行一个实战。现在呢,我就打开我的一个手机的语音录音助手,然后按下录音, 我开始去讲啊,第一性原理就是马斯克常说的思维方式,不要用类比,要回归基础,用最基础的一个真理出发。 ok, 好, 录完了,我感觉呢,自己也讲的挺流畅的。然后马斯克的案例啊,也说的比较清楚, 但真的是懂了吗?我就让 ai 去给我去判断一下。 ok, 那 我就把我手机里面的录音去上传电脑,然后这样从电脑上上传到 jimmy, 等几秒, ai 的 一个诊断就出来了。首先 ai 给我的一个盲区依旧是逻辑跳跃,我漏掉了一个最核心的一步, 你看, ai 说的是你的描述是原材料很便宜,所以自己造,所以成功了。你把发现原材料便宜,直接等同于能够去做出便宜的一个火箭,中间其实漏掉了一个最痛苦最核心的一步叫做重构。 我看这个心里想,我靠,好像确实啊,我只说了他决定自己去造,但没有去说怎么造。你看,知道面粉便宜呢,并不代表你能够去做出米其林餐厅的那个面包。 ok, 我 们看, ai 区给我指出的第二个盲区,叫做概念源头缺失。马斯克呢,他不是一个发明者。 ai 说呢,第一性原理最早的是源于在古希腊哲学家亚里斯多德,后来被物理学家广泛去使用, 如果不去理解它物理学上的一个必然性这一层含义,你很容易把它理解为仅仅是一个省钱秘籍。 这里呢,我人也少了,我一直以为这是马斯克发明的一个思维方式,原来呢,他也只是一个步道者。 ok, ai 给我指出来的第三个盲区就是对类比思维的误解,我把它给妖魔化了。你看 ai 说的, 你说不要类比,但人类百分之九十五的时间都在去类比,因为审脑子效率高低性原理呢,是一种高耗能反人性的一个思考方式,你需要明白什么时候该去用,什么时候呢不该去用。 这个确确实实扎心了,我根本就没有去想过类比思维,其实大部分时间呢,都是对的,只是在某些场景上不适用。 所以你看,我以为啊,我自己讲的挺好的,但 ai 一 分析呢,全是漏洞。这个就是菲曼学习法的一个威力,逼着你去讲出来,才能够真正暴露你的一个伪知识。接下来我让 ai 针对我的盲区啊,也自动生成了五道测验题,包含了从概念理解到实际应用到思维陷阱的一个全方位考场。 你看, ai 给我出了五道题啊, spacex 火箭的拆解步骤,类比思维和低信原理的本质区别,外卖配送模式创新的底层思考,特斯拉生产线的教训和局限,以及职业转型中的能力重构方法。 这题目呢,可不是随机的,而是 ai 根据我前面的学习内容精准去生成的,既检验了我是不是真的去懂这核心逻辑,又测试我到底能不能灵活的应用到新的场景。你看,实验结果也出来了,五题五个正确啊,准确率是百分之百。 ai 呢,也立即生成了个性化的学习报告,包含了强项和落项分析,它能让我去查看、总结,了解我已经熟悉掌握和有待加强的内容。 以及呢,继续学习。工具自动生成抽论卡。这种呢,适合快速的复习和掌握重要概念和学习指南。这种呢,适合深入学习。而且 ai 之后也说,你已经从背诵例子进化到了一个理解逻辑。 所以你看到没,五分钟前我只会去讲马斯克的故事。现在呢,我不仅知道什么时候该用,怎么去用,为什么能用,还通过 ai 生成的测试啊,验证了我自己真的是学会了,这就是飞马学习法加觉美达的一个威力。最后呢,你还能让他去生成一个可式化的信息图,让你更容易更轻松搞懂定性原理。 所以说,为什么这是学习神器呢?你看,传统学习呢,就是看文章,记案例,感觉懂了,实际上也只是去记住了故事。 管你去用 gmail 三 flash 啊,你录音去讲一遍, ai 精准的去找出你的逻辑漏洞,概念误解、认知盲区,然后定制 quiz, 让你真正的去理解底层逻辑。全程呢,也就三分钟而已,你的学习闭环就完完整整的完成了。 所以你看,利用好一手信息源,掌握好最新的 ai 工具和玩法,学习东西能够让你去事半功倍。 最后也希望大家点赞收藏关注一下江学长,也欢迎呢加入江学长 ai 学习圈,我将持续为大家带来一手的 ai 工具使用技巧和心得,以及一手 ai 信息员。 ok, 我 们下期再见!
粉丝23.8万获赞87.0万

谷歌刚刚发布了 jimmy 三点五 plus, 同时还把他们的编程工具 antigravity 升级了二点零,那这次就很明显了,谷歌的话这次是要全面提升它的这个抠点能力。之前不管是在 coi 还是 ide 还有模型, 其实给我的感觉就表现很一般,那这一次的话,这个模型最大的亮点官方说就是它的这一个速度啊,是前模型的四倍, 所以这一期我们就测一个最关键的问题,这么快的速度,它整个的一个代码质量会不会缩水?那我直接会拿两道真实的一个编程任务,把它和 cloud op 四点七, gpt 五点五放到同样的项目里面,同样提示时看它大家的一个表现情况。那下面的话,我们大概去扫一下它官方改出来的一个奔驰 mark 评分哈, 在编程方面的话,主要就看这一个 terminal, 奔驰二点一,还有这一个 sw 一 奔驰 pro, 从这个评分看的话,这一个 jimmy 三点五 plus 这个评分还是可以的哈,但是基于我之前对于谷歌模型实测的结果来看,就是评分不代表一切,因为之前就感觉它在这个编程方面挺拉的,这次我们就看整个的一个三点五 plus 表现到底怎么样。那这一次的话,我们的整个测试题目哈,就是沿用之前测试 cloud of 四点七,还有就是 gpt 五点五的两道真实的一个编程任务。第一个的话就是我们这一个 skills agent 嘛,需要把它从一个 c o i 做成一个 web ui。 第二个的话是希望他从一个已有的比较复杂一个项目里面把这个认证登录给它迁移过来,这一块也比较复杂,需要支持啊, get 谷歌,然后还要做一个落地页。好,我们来看一下这两个实测项目哈,左边的话,就我刚刚说的这一个 skill is a 镜头嘛,第二个的话就我们图片生成 a 镜头,那这次的话,我们是用了这个 anti gravity 它的一个 c o i 终端工具, 整体这一块呢,它的交互的话是跟呃卡扣的很像,那我这边测试下来,他的速度是真的快,相当相当的快,他说四倍,一点都没夸张。 那大家看一下它这个交互的一个情况啊,其实还是感觉挺挺好的。这个交互,那至于整个模型的能力怎么样,那这两个任务我这边实测下来,它都没有一次性的去完成,它或多或少都有一些小问题。那同样的这个提示值,在同样的项目,我给到了 gpt 五点五 以及 calloff 四点七,它都是能够一次性完成的,不管这两边哪一个项目都可以完成。但是 gmail 三点五 plus 它除了快,但它其实还是会有一些或多或少的 bug 嘛。好,我们来看一下它整体的一个表现情况。 好,我们来看一下这个是 jimmy 三点五 plus 帮我们完成的 skus agent 的 一个 ui 界面嘛,它可以去执行一些操作,比如说我给他一篇文章,可以让他帮我们去总结,它就会去加载这个的 skus。 就 我之前有一期视频 专门讲了这个 skills 的 一个工作原理嘛,那这是它完成的一个效果,整体上 ui 这块还 ok, 那 这边的话是 g p d 五点五给我们完成的,左边也是有我们的一个的一些 skills 是 哪一些?那右边的话就是它整个的一个操作的一个过程嘛。怎么说它这个 ui 的 一个结果的话,我觉得就是呃 g p d 五点五的会好一些。 那关于图片生成这个项目,让它去做一个落地页,以及让它去做一个就是谷歌 get 五的认证登录嘛,那这块它也是完成的,但是不是一次对话完成的。 u i 这块的话就是谷歌还是可以的,就是相较于 g p t 五点五的话,我觉得还是会好一些,就 u i 这块的话,我们还是优先选择就是谷歌的模型嘛。 好,下面我们来看下整体这个评分结果哈,那这个评分的话,还是跟之前一样,我们是把所有的模型生成代码通敏之后,然后改到模型去做 review。 那 这边的话 g p t 五点五是要胜出的,它的分会高一些。 第二个的话就是 cloudoff 四点七会辞职,那 gpt 三点五 plus 的 话,它整体评分效果会低一些,也就是它除了快,那代码质量上的话是会差一些。那这边的话也有些解决方案,比如说你可以用 cloudoff 四点七做设计,或者 gpt 五点五做设计,然后再用呃 jimmy 三点五 plus 去做执行。 那这块儿它还不是还发布了这个 anti graphic 二点零嘛。那这个 id 的 话,你就把它等同于 codex 吧,跟 codex 一 模一样。那我这边的话 现在还登录不进去,不知道啥问题。好,下面我们来进行一个总结。那这次他的整个编码水平的话,就是速度上确实是领先很多,但是在交付的一个结果上来看的话,跟国外两家模型还是有差别,尤其是在一些复杂项目里面,他还是会有偷懒的情况。 如果你是需要去做一些原型啊,或者做一些 u i 啊,我觉得这个 jimmy 三点五 plus 真的 是有比较有吸引力,因为它整个速度比较快,而且它的价格也比较便宜。那如果你是需要一些复杂的项目啊,多文件呀,那阶阶段我还是更推荐大家使用 g p d 五点五,在 codex 里面 你运行起来也非常的快。扣袋子这个 app 我 强烈推荐给大家用,我已经最近用了一个多月了,真的非常非常的好用, card 的 话就是封号真的特别严重,我已经放弃了。 ok, 那 这就是这期视频所有内容了,如果大家觉得这期视频做的不错,可以跟我一箭双雕,我是阿江,我们下期见,拜拜。

好,各位书博大家好啊,上期视频呢,很多同学对这个技术路线图感兴趣,对吧?然后这期视频呢,刚好出一些教程,教大家怎么去画这样的一些呃项目级别的,或者是顶台上的一些呃汇报的路线图,其实不需要用,大家用到非常多的提示词,大家只需要用这个技巧,用我这里学到的这个 图生图的方法就 ok 啊。我们这个提示词的话,大家用这套提示词就 ok 啊,比如说我们把这个提示词你看给它粘贴到这个 gmail 啊,或者是我们用 gpt 这个页面啊,在这里选择这个 nonono 二的绘图模型,把提示词先粘贴一下,然后我们再 上传一个类似的参考图就 ok 啊,我们在这个页面啊上传这个参考图,然后我们可以同时来对比一下,上传一些,比如说这种图片啊,这种图片有点类似于文科方向上的一些技术线图,我们就把它上传到这个 模型接口,然后呢,大家只需要替换啊,替换一下咱们的这个研究方向,这个地方给大家替换一下, ok, 然后我们直接点击发送啊,我们在 gmail 这个入页口这里一定要选这个 cking 或者 pro 模型,点一下这个香蕉,然后我们同时也点击发送, 然后我们只要等待他出图就可以啊,所以,好的, ok, 出图完毕啊,大家看这个就是啊 number one 的 二给我们啊出的一个插图,然后我们再回到这个 jimmy 的 入口里面,大家可以看到这个图片也已经生成完毕了,我们等待他加载输出一个技术线图就 ok 啊, 来,大家看,这个就是他给我们生成的一个技术性的模板,而且他会给我们呃自动添加一些关于这个学科相符合的一些元素,像这个卷积和这个啊,神经网络等等相关。然后大家如果想要这个图片编辑的话也很简单,大家把这个图片啊,你看给他存到这个本地之后, 然后嘞我们可以给他保存到本地。好的下载之后呢,我们可以看到这个地方会有一个 啊识文改字,然后我们这个地方点一下无痕改字,然后加载之后呢大家可以看这个里面的一些文字字体,我们都可以进行编辑,比如说法治研究啊, abc, 对 吧?然后我们点一下确认,这个时候呢就可以达到我们上一期, 上一期视频中的一个效果,对吧?就是上一期想要编辑里面的一些文字啊元素啊啊,还有这个里面的一些字体啊,拖拉呀。

专买新模型三点五 flash 不 再只是简单的聊天模型,而是在往完整的 ai 系统方向引进,可以写代码,做网页小游戏,自动的查资料,汇总成报告一个概念,我们可以通过理解物理世界生成视频,我总结了八个 id, 还有各种给力的场景和用法,其实词和你有可能忽略到的新入口,我也都放进了视频出发。 首先是模型,按照我们以往的认知, flash 一 直是便宜轻量,够用就行,秀实力的呢,一般都是 pro, 但这次不一样了,在编程 agent、 工具调用这些干活的场景里,它不仅超过了上一代 pro, 速度还提升到了四倍。当然,这里说的是执行能力,不代表它就是那个聪明的。 但也正因为如此,一个趋势呢,就变得很明显了,速度加执行力正在超过单纯的智力。所以这次 flash 呢,直接被推上了默认的默型,那我们又该从哪里能够用到呢?还是我们的老朋友 a s 丢丢, 那在这里就能看到这次它更新的所有的模型,那你要是不去选它,然后直接来问它的话,它默认的呢,就是三点五 flash, 还有就是网页,它呢,每天也会有少量的额度。 nano 不, nano pro note, 酷狗 im 音乐生成 v 五,三点一呢,也更新成了 omni, 而这些联动呢,在网页里才 能玩得到。好,我们先来看一下它的思维怎么样,那我在这里问它一个问题,八米长的竹竿是否能通过高四米,宽三米的门? ok, 他这个速度确实是很快,那我们来看一下他的回答怎么样?说在二维几何条件下,不考虑竹竿的厚度是可以穿过这个门的,那他还在这里用钩股定律给我算了一下,说最后通关的办法呢,是利用三维空间 可以斜着划过去,考虑的方向还是挺全面的,不过这次更新影响比较大的呢,是卡哇斯网页 ui 生成,那这是一句简单的提示词,那我让他给我做一个闯关小游戏, ok, 那 他现在是已经出来了,那我们现在打开他,哎,这个画风倒是很贴切,这些按钮呢,也是在的,那我用键盘来控制他的方向, 哎,是可以的,那由此我们就可以发散思维来做网页科普。现在呢,他在这里是出了两个思考等级标准和扩展,在标准下,他的回答速度呢,会比较快一些,大多数的问题都是够用的, 如果需要处理长篇复杂的问题,那这个扩展他的推理步骤呢,会比较多一点,当然回答的相对来说会比较慢一些。那这次我们就用扩展功能来做一个汽车网站, 那在这里给出我的提示词,然后我们来看一下,这个配色很高级啊,算是保持了专门来前端一贯的审美水准,包括我再去滑动他,他呢也会有这种互动特效,还有这里的企业文化车型的一个展示, 他还不是一个空壳,哎,那我再进一步的去查看一下,哎,是不可以的了,不过用来做一个小小的 demo 草图的一个交互算是够用的了。 而且我发现最近 prompt 工程师这个词特别的火,那我呢,也做了一个科普的页面,来讲解 prompt 到底是怎么来影响结果的,还是一样的步骤,那给出我的简单提示词,那他现在是给了我一个可交互的网页了,那我在这里输入写一句夸人的话, 他回答的是你很优秀,那我在这边再给他一个带有身份情绪的题日词, ok。 哎,他给我的就是这样的一个回答, so, 跟我们归机朋友聊天的时候,题日词的信息呢,还是比较重要的,那除此之外,我们还可以换个场景来做教学知识互动,比如物理的电路图,那我先选好卡哇斯,给出我的题日词,那我们来试用一下 那这里的电路电阻,然后我还可以在这个地方来控制它的电压,那其他的位置呢?我也是可以在这里随意的去更改的,就很好的让我直观的感受到了。 那其次就是 db research, 他 不是更聪明了,而是会自己的去完成任务列。之前是你们一个问题,他回答一段内容,然后就结束了, 而现在我再给他一个调研的主题,那他一开始还是遵循他原本的一个优点,先让我们确认方向,然后我们 觉得 ok, 然后让他开始调查,你看他现在就会按照我们的话题方向开始去一个板块,一个板块去分析。而这些信息的出处点呢,也是给我逐个的展示出来了,整个来看的话,他会把总结的内容都融进来了, 你看公式表格这些我想要知道的那些点,那我也可以根据我想要了解的板块,在这里直接跳到对应的位置,包括他把那些网页的技能按钮也搬到了这里来,那根据这次调研出网页, 我信息图导出可用的文档都是很方便了,也省去我再把内容复制到文档里,然后再给他导一次了。 其实要说视觉方面冲击力比较大呢,就是专门的欧曼奈,号称可以任意形式输入视频方式输出图片文本,大家都见怪不怪了,那我这次用手机拍了一段遛狗的视频,然后我们发给他输入我的提示词,我们来看一下,他自动给我补了光影,调了色彩,那我再给他换几种风格,换个环境, 而且你有没有发现他这里的固定元素现在都是没有崩的,那我还可以在这里多轮的去进行编辑,每加上一条新的指令呢,他就会再继续上一条的指令,继续给我更改,这跟直接给剪辑式沟通有什么区别?那我再测试一下他的音频输入,我先上传我需要用的素材,然后让他按照这个音频的节奏给我生成画面。 哎,他给我回复暂时是不支持的,有点小翻车了。接下来就是理解物理世界能力,这也是欧姆莱重新定义的一点,我只给他我的提示词,让他大概去做一个中小学物理课堂历学演示的一个场景,他这个小球受重力自由的滚落,连续完成撞击 动能的这个传递,这种一系列的连锁反应也严格遵循了这种重力弹跳动能守恒的物理公式,就能够感受出来他是在理解世界的这个运行方式。那下次我们再去做教学案例的时候,就可以给他一个概念, 简短的一个话语,它就不只是给我生成了一个像视频的东西,而是运用它的知识把概念做成了讲解视频。 today, we'll explore acid base neutralization watch the color change as the base is added they react to form water and salt。 除了放在明面上的这种视频方式,我还发现了一个类似于分身功能的视频制作方法。通过几秒钟的个人视频,那他这个人物呢,就做好了,有点类似于骚扰的味了, 不过需要切换到规定的语言,你才能看到那个入口。那说到视频就绕不开 ai 造假了,所以他们也把三分 id 往前推了一步,就是 ai 内容隐形水印,是写进图像、视频、音频里的隐形记号,当然我们肉眼呢是看不到的,通过工具就可以判断出它到底是不是 ai 生成的。 除了类似的技术,在网页端呢,也更新了几个小亮点,那首先就是开启了个性化的功能,你给专卖提出要求,比如回答问题的时候要概括要点,回答内容过长的时候要给我分条列出,他呢就会根据你的规定来和你沟通。在回答专业的问题上就不再像聊天了,我也不用再去另外的自己总结一遍了。 了解过 i o 大 会的也能感受的到,谷歌这次想做的是一个智能的全家桶,那网页呢,也出了一个可以把其他工具关联进来的入口,你像邮件、硬盘、日历、文档,在各个方面来了解你,在工作中呢,也会给你更进一步。不过 统一事件深农还有一个就是个性化的开关,根据你和他的聊天越来越多,他呢就会了解你的喜好,记住你的习惯,模仿你的思考方式来服务于你。 当然这也是要通过我们和归机朋友长时间的磨合来达到一个效果。不过随着这次更新出来了一个记忆导入,这个有点难吧,这个怎么导入啊?人家连步骤都列出来了, 怎么来提取记忆在哪里进行一个输入?其次就是自动干活的能力,定时给你发送你设置好的那些问题,随时掌握你关注的各种事项。那在之前我们基本上只能在 ai 编程工具来实现,那现在我们可以打开定时操作, 新建一个,然后填好我的要求,然后时间给他规定好。看默认的话还是在桌面生态里边去展示。如果你连接了外部的生态,那有些任务呢,也可以输出到你的邮件里。整体看下来,这次根本就不是在更新某一个功能,他是把所有能力一点一点缩到一个地方一个入口。 所以问题不在于他多了什么能力,而在于他正在让我去别的地方,这件事情变得没有那么重要了。好了,喜欢这个内容的朋友,我们下次见。

open code 是 近期热度最高的 ai 编程工具,它的最大优势是有开箱即用的免费模型,通过简单配置,还能免费接入 gemine 三 pro、 cloud、 四点五、 opus 等顶级编程模型。 open code 可以 看作是一个开原版的 cloud code, 几乎具备了 cloud code 的 一切功能,而且对中国用户友好,不 会遇到 cloud code 里面限速、封号等一系列麻烦的事情。在 open code 里面有几个可以免费使用的主流模型,非常适合小白上手, ai 编程可以随便造随便玩,还可以用它练习 agent, skills, mcp, sub agent 等高级特性。本期视频是一个 open code 的 完整教程, 主要介绍 open code 的 四种形态,对比其他 ai 编程工具的亮点,还有我们要重点介绍欧买 open code 的 这个超强插件,还有等等的一系列高级用法。 open code 的 有四种形态,分别是命令行、桌面、客户端插件,最后是云端运行环境。我们先来看命令行,这里我准备用第二种方式,也就是 note j s 的 方式来安装。 我们先来到 note g s 的 首页,在这里根据自己的操作系统下载对应的安装包,把 note g s 安装一下。接下来我们复制 n p m 的 安装命令,我们打开一个终端窗口,把安装命令粘贴进来回车,这样就安装完成。输入命令, open code 就 可以直接启动了,进入这个页面打个招呼, 这样就完全配置成功了,非常简单。接下来我们来看客户端版的安装,在这个页面点击下载客户端,然后一路点击下一步完成安装。打开以后选择一个文件夹作为项目文件夹就可以直接开始使用了。 open code 的 客户端并不是一个完整的 ide, 它只有基础的对话框功能,而 而且目前处于贝塔测试版,我试用下来 bug 还是比较多的。所以本期视频我们主要还是以命令行版本为例进行操作。接下来我们来看插件版的安装。使用插件版的 open code 的 前提是需要先把命令行版的安装好,这里我以 vs code 为例,我们打开 vs code, 在 左侧的 extensions 搜索 open code, 然后我们找到这个 open code 插件,点击安装。安装好了以后,我们按快捷键 ctrl shift 加 p, 打开命令面板,敲这个命令, open open code 回车,这样就以插件的形式打开了 open code, 它可以自动关联左侧窗口打开的代码文件。然后我们还可以选中一些代码,点击快捷键, ctrl alt 加 k, 把这些代码直接快捷地粘贴到 open code 的 聊天窗口里面, 这就是插件的全部功能了。最后一个云端运行环境,我们放到视频的最后面再看 open code 最棒的是内置了一些免费的模型,我们敲命令来到软件进来以后,输入命令斜杠 models, 后面带 free 标记的都是一些可以免费使用的模型,特别是 g l m 四点七,还有下面的 mini max 二点一, 编程能力都非常的不错,零配置开箱即用,输入需求就可以直接编程了,很适合新手用它们来练习 ai 编程。接下来我要推荐一个插件叫 open code 的 anti gravity os。 anti gravity 是 谷歌推出的一个 ai 编程的 ide, 它里面十分慷慨地提供了 jimi、 nike 三 pro 还有 cloud opus 四点五这两个顶级的 ai 编程模型,我们可以借助这个插件把这两个顶级模型免费地接入 open code 里面使用,在它的 get up 首页有安装方式, 最简单的就是把这一句提示词复制下来,然后我们来到 open code 粘贴进来开始,这样 ai 就 能自动帮我们完成安装,这里耐心等待一会,这样插件就安装完成了。接下来我们复制这个命令,然后我们打开一个新的命令行窗口,执行这个登录命令。 这里的模型供应商选择谷歌,选这个 anti gravity 的 登录方式 project id, 这里直接回车,这里登录一下自己的谷歌账户, 点击登录,然后把生成的这个 u r l 粘贴进命令行回车,选择 n 回车,这样就配置完成了。我们重启一下 open code 的 斜杠 models, 在 模型选择里面我们就可以选到 jimmy nine 三 pro 还有 cloud opus。 四点五这样打个招呼成功给到了输出就配置完成了。接下来我们把另外一个好用的编程模型 gbt code 也接入到 open code 的 里面。就在前几天, open a i 跟 open code 的 官宣进行了合作, 我们可以直接在 open code 里面使用 chad gpt codex 的 编程套餐。首先我们需要在 chad gpt 的 官网获取一个至少是 plus 以上级别的套餐,在这期视频里面详细的介绍了订阅方法。我们来到 open code 输入这个命令斜杠 connect 回车,这里选到 open ai, 选择 gbt pro, 在 浏览器里打开这个链接,选择继续,这样就登录完成了。然后我们回到 open code 输入命令斜杠 models, 这样就可以选到 chat gbt 的 几个模型了,除了上面这几种接入 ai 的 方式,输入斜杠 connect 命令,可以查找到七十五种 ai 的 接入方式, 几乎囊括了所有的模型供应商。比如我们可以找到 open root, 这里需要我们填写一个 open root 的 api key, 我 们来到 open root 的 官网,点击 get api key 创建一个, 把这个可以复制一下,填写到 open code 的 里面,回车一个 open root 就 能接入市面上几乎所有类型的大模型,而且国内用户也可以很方便的获取额度,可以说我们只要接入了 open root, 就 可以使用几乎一切的大模型。 我找了一个之前常用的经典测试案例来测试一下这里 open code 的 表现有几个亮点。首先在开始之前,他会反向询问我一些问题,比如说只是要代码样例,还是一个完整可以运行的程序,有哪些功能是必须实现的,调用哪个 jimmy 模型,然后环境变量是怎么保存的, 在动手之前他会把所有的需求细节询问清楚,这点非常的不错。然后他列出了一个详细的开发计划,并且分步骤完成,每完成一步都会标记出完成。 第二个亮点就是命令行版的代码比对界面,我觉得是所有命令行类的编程工具里面做的最好的,整个编程过程没有出现错误,也没有出现过需要代码返工的场景,一次性就完成了这个需求的开发。这里我使用的编程模型是 gpt 五点二 codex, 我是通过登录我的 chat gbt plus 订阅的账号把 codex 模型接入进来的,我觉得它在 open code 里面的表现跟使用原生的 codex c l i 的 表现几乎是一致的。 open code 在 底层对各种编程模型都进行了很多工程上的优化,还是很不错的。 喷扣的里面重点突出了一个叫做 session 的 概念。我们每次跟 ai 开启的一个新的对话,就是一个全新的 session, session 可以 后台运行,而且可以多个 session 并行运行,比如这是我们刚才生成的你画我猜的游戏网站,这里我想增加两个功能, 首先我想让画笔可以调整颜色。第二个功能我想增加一个计时器,如果作画超过二十秒,游戏就失败了。我们先输入第一个需求,增加一个计时器,在第一次落笔的时候进行计时,如果超过二十秒,游戏就失败了。开始 在这个任务的执行过程中,我们可以输入 new 命令,创建一个新的 section, 然后开始我们的第二个需求,第二个需求是画笔可以调节颜色。我们输入命令斜杠 sections, 就可以看到我们触发的 session 前面一个打转的符号,表示它正在后台运行。这样我们就创建了两个 session, 让两个需求并行开发,还可以在两个 session 之间互相切换,查看它们的执行状态。好,这样就完成了, 我们可以调整画笔颜色,然后我们开始作画的时候,右上角也出现了一个倒计时,我们成功利用了 session 功能,并行地完成了两个需求的开发。输入斜杠 share 命令, 可以把这个 session 的 对话记录分享成一个网页,网页的地址已经复制进了粘贴版,我们把地址粘贴进浏览器, 就可以看到这个 session 里面跟 ai 的 对话记录,包括它是怎么进行文件修改的?有了这个历史记录以后,我们就可以很方便的把我们的编程过程跟其他的用户进行分享。输入命令 on share 就 可以取消分享, 之前的链接也就变得不可用了。输入命令斜杠 export 就 可以把对话记录导出成一个文件。刚才我又进行了两次对话,先让它把画笔默认改成红色,然后把这个提示删除。 open code 还有一个亮点功能,就是它的时间线,或者说是检查点。我们输入命令斜杠 time line 回车可以看到这个 session 里面的跟 ai 的 对话记录,我们可以选择任意一次的对话记录,选择这个 reward 功能, 把代码跟聊天内容一起回退到这次对话之前的状态,我们可以回到这个时间点再重新进行修改。 在上期视频里面,我们介绍了 agent skills 的 基础概念以及其目录结构,我们可以把 skill 理解成带目录的说明书。每个文件夹都对应一个 skill, 也就是一个技能包。 把一个 cloud code 中的 skill 迁移到 open code 里面非常的简单,我们只需要把目录里面的点 cloud 替换成点 open code 就 可以了。 在上期视频里面,我们一共创建了三个 skills 文件夹,把这三个 skills 迁移到 opencode 里面也非常的简单。我们来到 opencode 的 项目文件夹,新建一个叫做点 opencode 的 文件夹, 进来以后再新建一个 skills 文件夹,然后就可以把这三个技能直接复制进来,这样我们的项目就拥有了那三个技能。我们右键在终端打开,输入 opencode, 启动起来。我问他你有哪些 skills? 这里给出了完整回答,当我们有需要的时候,它就会调用这些 skills 进行工作。接下来我们来看 m c p。 的 配置方法。 open code 里面有两种 m c p, 我 们在文档里面可以找到一个是 local 的 方式, 也就是通过本地命令来执行。还有一个 remote 的 方式,也就是远程调用。我们先以这个 set cn 为例来把它配置一下。我们先来到 open code 的 配置文件夹,用户你的用户名 点 configure, 然后 open code 找到这个配置文件。 open code 点 jason, 来到文档站,这里把 m c p 的 这一段复制一下,粘贴过来。我先把这些多余的逗号去掉,这里填写上 m c p 的 名字,这里我就叫做 set c n 类型的话是本地,然 然后 command 这里填写命令 n p x, 后面是 shift c n, 把这一段复制过来。最后这里还有一个 m c p, 我 们打个逗号,添加上 enable, 表示启动下面没有环境变量,这样一个本地的 m c p 就 配置完成了。接下来我们再看一个远程调用的案例, 我们就以这个 context 七 m c p server 为例。我们回到 opencode 的 文档站,在下面找到这个远程调用的案例,把这一段复制一下,打个逗号,粘贴到配置文件里面来。这里类型是 remote 远程调用 url, 我 们把 context 七的 url 复制一下,粘贴过来。 在 hide 里面我们填上 context 七的这一串粘贴过来,这里它需要一个 apikey, 我 们可以来到 context 七的官网创建 apikey, 把这个可以复制一下,填写到配置文件里面, 把这个 m c p 的 名字改成 contact。 四七,我们重启一下 open code, 输入命令斜线 m c p, 就 可以看到我们刚才配置的两个 m c p, 这就是本地,还有远程调用两种 m c p 的 配置方式。 oh my open code 是 open code 上一个最火的编程插件,它本质上就是一系列的工具加 m c p 加编程 agent 的 组合捆绑包。比如在工具方面,它集成了 l s p 高级版,可以通过编程语言的语法和语义,帮助 ai 快 速理解和定位代码。 a s t 工具可以通过代码的语法术进行关联搜索。 open 工具借助多模态大模型的视觉能力,帮助理解图片还有 pdf 等信息,还有像 delegate task, background task 这些 agent 任务分配和后台调度工具。插件还内置了三个 mcp server web search 用于网络搜索, context 用于获取最新的文档。 group app 用来在 github 仓库快速搜索代码。 插件还内置了七大编程智能体,分别是希奇福斯,它是主智能体,用来规划和调度任务,先知用来做架构设计、代码评审等等。图书管理员用来查阅文献,探索者用来进行网络搜索。还有前端工程师、 文档编辑者,还有多模态等等。插件给每个智能体都分配了一个最适合他工作的大模型,比如前端工程师使用前端能力最强的 jimmy 三 pro 模型,主 agent 使用的是 cloud opus 四点五,据说这是作者花了两万四千美元的 token, 找到最适合的 ai 编程团队。 好,我们把这个插件安装一下,在它的 github 首页,这里有一段提示词,就是 install 开头的这一段,我们把它整个复制下来,我们回到 open code, 把这段提示词粘贴过来。开始安装的时候,插件会询问我几个问题, 他先问我有没有可洛的订阅,这个我是没有的,我有 gbt plus 订阅,用 gbt 去替代可洛的模型,然后问我有没有拆的 gbt 订阅,这里我选择 yes jimmy 订阅,有, 最后选择确认。过了一会,插件成功完成了安装。安装完成以后,我们来到 c 盘用户你的用户名点 config, 然后 open code 的 这个文件夹,在这里面有一个欧买 open code 的 配置文件,这里定义的是欧买 open code 的 七大智能体所用的模型,我们可以根据自己的需要来进行调节。 这里我把希希福斯的模型换成 g b t 五点二,剩下几个的模型都是作者的推荐配置了。然后我们重启一下 open code 的, 我们进来以后看到它显示的默认智能体就是希希福斯。 这个插件主要有几种用法,首先我们可以敲 at, 然后挑选一个智能体给我们干活。还有一个用法就是输入这个魔法词 u l w, 也就是 ultra work。 输入这个魔法词以后,不买 open code 就 会尽可能地调用它的一切潜能,把任务分配给几个智能体,并且并行运行, 由这个主智能体西西福斯进行居中调度。这里他询问我要什么样的网页,我们大体填一下需求,然后开始 我们看到他把任务拆分成了一个 to do list, 然后同时开启了三个后台任务并行执行,然后他对这些后台任务进行疯狂的调度。我们耐心的等待一会,等了几分钟, auto work 模式运行完毕,我们来启动起来看一下效果。一个宠物商店的应用看起来还真是不错, 界面看起来就很清新,它在没有图片素材的情况下,还尽量地用 emoji 给我们配了一些图,整个网站的交互还有动画逻辑看起来都是不错的。如果你有 gbt、 cloud 等几个顶尖模型的订阅,不妨来试一试。这个插件可以综合地调度各个领域最强的模型,完成一个很不错的编程任务。 购买 open 扣的还有一个重要玩法就是我们输入这个命令斜杠 raf 路虎就是拉尔夫循环,这个模式可以强制 ai 长时间的循环,对一个非常难的任务进行持续工作。 比如我可以要求它使用 springboard 四的最新标准重构整个项目,然后直到所有的测试用力都通过,它可以循环连续运行好几个小时,直到最终的任务完成。 刚才我们介绍了命令行、桌面板还有插件等运行环境。接下来我们看云端运行环境,这里我以 github 举例, 它的主要功能是当我们在 github 上面输入斜杠 open code, open code 就 可以在 github 云端进行工作,比如可以为我们解释问题,自动修复问题,并且创建 pr 等等。这里有一个安装方式,我们来试一下。首先第一步,先把项目上传到 github 上面, 这里还是刚才那个宠物商店的应用,点击这里的 south control public 是 branch, 这里我选择 public, 把这个项目变成一个 gitap 上面的公开仓库,点击右下角的 open on gitap, 这样我们的代码就成功上传过来了。接下来我们来到代码文件夹,把这个安装命令复制一下,粘贴过来执行。点击 install, 选择一个模型替工商,这里只能用 api 选择一个模型。然后还有两步需要操作,首先要把项目里这个文件提交到 gitap 上面,它已经准备好了这个配置文件, 我们先把它提交上去,接下来它需要把这两个环境变量填到项目里面,我们来到项目的 sightings, 然后下面的 secret and variables 这里找到 actions, 在 这里的 repository secrets, 我 们把第一个 key 的 名字复制一下,粘贴过来,对应的密钥可以在谷歌的 as studio 创建一个,这样填写过来保存。 接下来第二个 key 复制过来,还是填写相同的密钥,这样填写好了两个密钥。比如某个用户可能会在一处里提一个 bug, 说顶部导航栏 find ipad 跟 adopt null 功能重复, 应该去掉这个 find ipad 就是 这两个功能重复。在这个项目里面就可以直接斜杠 open code, 调出 open code 的 功能, 让 opencode 把这个 bug 修复一下,我们提交这个评论。然后我们来到项目的 actions 里面,可以看到这里有一个 action 就 正在执行了,这个就是 opencode 的 工作流,它现在正在 gitlab 的 云端运行,帮我们来修复这个问题。任务运行完成,我们来到 pullrequest 这里 就可以看到一个代码合并请求。在 file changes 这里可以看到它对代码成功进行了修改,我们只需要点击这个默认设置按钮,就把 open code 这次修改合并到了我们的代码仓库,这样这个一束就成功完成,并且关闭了。 接下来我们再介绍 open code 的 几个其他的重要功能,这些功能其实在之前的 cloud code 还有 codex 的 视频里面已经进行过介绍了,这里我们再快速的过一下。 首先第一个命令斜杠 inate, 这个命令可以让 ai 通读整个项目文件夹,然后把它学到的关于整个项目的知识生成一个 agents 点 m d 文件,这个文件就作为整个项目的系统提示词,可以帮助 ai 快 速地了解项目下一个重要命令。斜杠 compact 用来压缩之前对话的上下文,把之前的对话提炼成一个简洁的摘药来释放模型的上下文窗口。除了这些内置的斜线命令以外,我们也可以创建自己的命令。我们来到 opencode 的 配置文件夹,在这里面可以新建一个 com 的 文件夹,在 这里面就可以以 markdown 文件的形式来定义自定义命令。比如这里我创建一个自定义命令,叫做运行测试,我把官网上这一段样例复制过来粘贴进来,我们可以指定它是 build 或者 play 模式下面的命令,在下面的描述里面写清楚这个命令是做什么用的。 配置完自定义命令,我们可以在 open code 里面斜线,然后是命令的名字,这样就可以运行我们的自定义命令。下一个功能可以定制智能体, opencode 里面预设了 plan 跟 build 两种智能体,我们也可以创建新的。我们来到 opencode 的 配置文件夹,在这里面可以新建一个 agent 文件夹,比如这里我想新建一个 code review 的 智能体,让我新建一个 markdown 文件,在这个智能体的文件里面填上描述类型,它是一个主智能体还是 sub agent? sub agent 的 意思就是它可以由主智能体调度在后台执行,然后填上一个模型,后面是它的描述,就是这个智能体主要做什么事情。 定义好了以后,如果以后 ai 可能需要 review 代码的时候,它就会自动调用起这个 sub agent, 并且在后台运行,帮我们自动完成工作。 我们除了可以把一个智能体定义为 sub agent, 也可以定义为 primary, 也就是主智能体。定义成主智能体以后,我们可以按 tab 键直接显示地切换到这个智能体进行工作,而 sub agent 只能在后台由 ai 自动调度执行。好,这就是本期视频的全部内容了,感谢大家点赞支持,我们下期再见!

谷歌的视频模型终于更新了,前段时间谷歌发布了 gemini omni flush, 官方放出狠话, can create anything from any input。 那 到底有没有这么牛呢?今天我们就从五个方向来对比, omni flush、 cds 二点零和可零三点零。 最后我还整理了三个平台的价格,来看看谁的性价比最高。先来简单了解一下 omni flush, 它主打的是视频编辑能力,也就是你可以直接上传一个已经存在的视频,然后通过提示词去修改它,它就可以在原视频的基础上做内容编辑。 第一个方向,场景迁移,我想把这个视频的背景变成暴风雪的场景。 gemini omni flush 目前有两种使用方式,第一种是在 gemini 里通过对话调用,打开 gemini 上传要修改的视频,这里一定要选择三点五 flush 版本,这样就可以调用到 omni flush 模型。车窗外确实出现了被雪覆盖的森林景观,但整体的暴风雪元素有些偏弱,视觉冲击感不够强烈。 不过原视频中有一个细节测试点,就是车的后视镜会反射出窗外的景观,这一点 omni 做的还不错,后视镜里的景色也是同步变化的,没有出现明显的穿帮。我们再来看 cds 二点零这个视频,我觉得基本没有问题, 窗外暴风雪的效果非常明显,后视镜里的反射也没有出错,美中不足的是窗外景色移动的速度相比原视频来说稍微有点慢,但这个问题不影响城边质量,可零这条问题就比较多了,人物的胡子发生了变化,和原视频相比多出了一截窗外景色移动的非常缓慢,基本没有暴风雪的感觉,后视镜里的反射也比较糊,看不清到底是啥。 我们单独对比一下 omni 和 cds, 能明显看出来, omni 做出来的人物会更平滑一点,没有 cds 那 么真实。再来看第二个案例,这是一个在火车上自拍的视频, 这个案例的难点是背景运动非常快,旁边还不断有其他火车出现,而且男人的头发一直在被风吹动。这次我们用第二种方式,也就是用 flow 制 作。进入 flow 之后,你会发现它的 u i 迎来了全面改版,左右两侧的控制栏跟之前的提示词框完全不一样,如果你想换回老版本,直接关闭这个和新增加的智能体就行。这个智能体后面有机会我再单独讲。模型选择 omni flush, 这里会有一些视频长度选项,但如果你已经上传了视频,它会自动按照原视频长度来处理。 我希望把火车外面的景色变成沙漠,并且要有骆驼队伍和仙人掌。先看 omni flush, 人物脸上突然出现了阳光晒到的效果,问题是在前面几秒场景里其实没有明显的遮挡雾, 所以这一块的光线逻辑有点问题。另外,原视频因为是雾天,天上的电线时隐时现, omni 强行保留了电线,但在晴天背景下没有处理好边缘,导致电线的穿帮非常明显。 c 蛋子这条我觉得处理的更聪明,它没有强行改变火车轨道,并且把沙漠的天气处理成了阴天,这样一来,不仅巧妙的隐藏了原视频中穿帮的电线,整片沙漠的光感也收敛的非常自然。可怜这条基本没有太多评价的必要了啊。 火车几乎没有在动,骆驼也是非常明显的 ai 骆驼整体画面缺乏真实感。从这两个案例来看,场景迁移这局 cds 二点零表现最稳定, omni flush 紧随其后,虽然有细节瑕疵,但重塑能力依然在线。第二个方向,物理交互这个测试灵感是从谷歌官方文档里看到的,然后我做了一点进阶。我录了一段自己手掌张开并转动的视频, 同时提供了一张三 d 建筑的参考图,让 ai 在 我手里做出全息投影的物理交互。 omni flush 这个视频表现得非常不错,它不仅还原了原视频里的手部动作,还完美复刻了参考图里的三 d 建筑结构。 c 弹子是对原视频做了一个放大裁剪,小臂有一部分是缺失的,而且原视频里手部有转动, c 弹子是把手固定在原地。 全息投影的精细度也远不如 omni 细腻,和原图对比一下也不是特别像。可玲这条视频虽然保持了原视频里手部的位置和转动,但全息投影做的实在是太差了,而且还加了一些莫名其妙的手部描边,画面完全不过关。 第二个案例,我想让这个玩偶悬浮起来并且旋转。我同时提供了视频和小玩偶的角色表 omni flash, 我 觉得做的非常好。玩偶顺畅地从地面升空并开始转动。虽然旋转不是完整的三百六十度,但是在旋转过程中没有发生任何形变,角色特征牢牢锁死。 cactus 也做到了让小玩偶先悬浮起来再旋转,但问题是它在旋转过程中有明显的形变,已经转过去的脸突然又回到了正面,而且 cactus 没有很好的保持和原视频同步启动前面几秒整个画面是静止的,有一个明显延迟。 可怜这条我觉得完全没有理解我的提示词啊,玩偶直接生硬的飘在空中,完全没有旋转。而且这个小玩偶非常假,像是直接把角色表里的图片抠出来贴上去的,甚至还有没处理好的白边。从这两个案例可以看出来,在物理交互这一块, omni flash 确实是最稳定的,它能理解比较复杂的物理关系,也能把参考图、原视频动作和新增元素结合的比较自然。 三个方向角色转换这个案例也是在谷歌官方案例的基础上做了进阶。我手持手机对着镜子录制了一段视频,用手指点击镜面。我的需求是在手点击镜子的一瞬间,整个画面变成三 d 像素风格。 omni flash 在 一致性上有瑕疵,比如我的手机壳、衣服、墙上的牙刷和擦手布都没有保持一致, 而且在点击镜子的时候,手的位置相比原视频也发生了一些未移。但是从真人变成三 d 像素风格的转换效果来看,我觉得它不是突然切换,而是有一个扩散的转变过程。 黑袋子对原视频的一致性保持的非常好,但问题是它没有做出真正的转变过程,画面是突然变成三 d 像素风格的,而且只是人物变了,场景并没有参与转变,能看出来它理解了我的意思,但没有完全做到我的要求。可玲在这个案例上再一次没有理解我的需求,上来就直接把原视频变成了全像素风格, 根本没有执行点击后转化的条件触发指令。第二个案例,我录了一段特意加了手部动作的视频,我只能根据这个女生的外貌特点写了一个长题词。 可以看到,在动作和背景上, omni flush 基本上没有问题,但人物看起来比较假,不管是肤感、光线效果还是整体质感,都会有前面提到的问题。太平滑了,这种平滑感会让整个视频看起来不够真实。 c 蛋子很好地用这个女生替换了我的形象,中间遗漏了一个握拳动作,背景里柜子有明显的倾斜。除了这两点之外,我觉得整体效果还是非常不错的,尤其是人物的真实感,比 omni flush 更好。可灵这个人物有严重变形,嘴部也很糊, 非常不自然。不过在动作迁移上,它做的其实还不错,但背景里的 taylor 唱片还有我的唱片机都有形变。角色转换这一局比较难评价, omni flash 和 cds 更有优势。 omni flash 更擅长风格转化,尤其是这种从真人转换成三 d 像素风格的扩散效果,完成度真的很高。 cds 更擅长真实人物替换,人物质感更自然,但它们也都有明显的问题。 所以这一局我觉得 omni flash 和 cds 可以 打平第四个方向,动作控制,哼哼。 omeley flash 这个打斗非常缓慢,完全没有打斗的爆发力。两个人像是在公园里推太极,但他又搭配了非常痛苦的表情,所以看起来有点搞笑 啊啊啊啊啊啊啊! c 弹子这一条的速度、爆发力,拳拳到肉的打击感全部在线,配的音效和运镜都非常不错。 可 玲这条比 omni flash 更差,不仅没有打击感,音效也很奇怪,人物中间还出现了闪现,导致最后变成一个人对着镜子自嗨。 第二个案例的原视频里,是一个明显不会打球的女生在拍球,步伐和运球动作都显得非常局促。我需要 ai 将这个动作完美复刻到一个男生的身上,以此来测试模型对不协调微动作的捕捉能力。 omni flush 自动把动作给美化了,男生运球相对流畅,完全没有了原视频那种局促感。 并且为了让运球看起来更顺,原视频里的一些动作也被省略掉了。 c 弹子复刻动作没有任何问题,步伐、手势的局促感抓得很准,唯一的问题是画面产生了过度锐化,导致男生的脸部看起来有点失真。 可灵这条我觉得是三个里面最好的,不管是男生的真实皮肤质感,还是那种局促不协调的步伐和运球动作可灵,都做到了几乎百分百的动态复刻。这条视频基本没有什么可挑剔的,但这一局我们主要看的是整体动作控制能力, 尤其是在复杂打斗视频这一块, c dance 的 表现依然是最强的,所以动作控制这一局 c dance 获胜。第五个方向,故事版转视频能力我做了一张健身腰带的故事版,来测试三个模型的串联和图文理解能力。 硬拉训练腰部承受的压力很大,所以我一直用这款肩肾护腰带,正称发力更安心、贴合舒适,训练更方性。肩肾护腰带,硬拉训练的稳定支撑 omni 故事版的画面分镜顺序完全正确,但暴露了谷歌的老问题。 第一,只要涉及中文语境,它的人物很容易变成亚意,外貌和原图人物的一致性保持的比较差。第二,它的中文配音能听出来有外国人说中文的口音,而且吐字不够清晰。第三,最后的海报展示里面的中文小字 icon 和原图都不一致。 硬拉训练腰部承受的压力很大,所以我一直用这款健身护腰带,稳定支撑,发力更安心,贴合舒适,训练更放心。 c 蛋子这条视频我觉得非常不错,故事版顺序没有乱,系腰带的动作没有出错,硬拉动作也非常规范,人物动作和产品使用场景是连贯的。最后的海报展示虽然没有对应的中文小字,但挨框是正确的,产品细节的方向也基本保持住了。更重要的是,他的中文配音完全没有问题, 字清楚,语气也比较自然。 c 蛋的这条基本做到了,人物动作、产品和配音都在一个完整的逻辑里,所以我觉得这条是相对完美的视频。硬拉训练腰部承受的压力很大,所以我一直用这款健身护腰带, 稳定支撑,发力更安心、贴合舒适,训练更放心。可怜的问题就比较大了,一上来他单手拎着杠铃, 就是一个不符合逻辑的画面,女生嘴部非常模糊,不自然,更大的问题是画面里出现了故事版里的气泡文字,还有一些动漫式的表现效果。这说明可玲没有完全理解故事版,只是参考,而不是要把故事版元素原封不动放进视频里,而且还缺失了故事版第四个画面。最后海报文字也是乱七八糟。整体来说,这是一条比较差的视频, 而且我还要补充一下,这一条已经是生成很多次之后效果最好的视频。给大家看看另外两条可令生成的故事版视频。硬拉训练腰部承受的压力很大,所以我一直用这款健身护腰带,稳定支撑发力更安心,贴合舒适训练更放心。 硬拉训练腰部承受的压力很大,所以我一直用这款健身护腰带,稳定支撑,发力更安心,贴合舒适,训练更放心。 可以看到这三个视频都出现了动漫式的表现效果。后面两个视频还有一个共同问题,故事版反复出现在画面里,并且最后的海报文字也都是不稳定的, 所以故事版这一局 c 世代毫无疑问获胜,它对分镜顺序、人物动作、中文配音和产品逻辑的理解都更稳。最后我们来看一下三个平台的价格,这个表格只计算谷歌 flow 平台的积分消耗,如果你是 pro 会员,并且在 gmail 上制作视频的话,一天最多可以制作五个视频。现 先看图声视频,整体来看, omni flash 是 最便宜的,因为它的一零八零 p 重塑是免费的, cds 二点零 vip 和可零三点零的价格会根据分辨率不同对应不同的积分消耗,所以图声视频里, omni flash 最便宜,其次是可零三点零,最后是 cds 二点零 vip。 再看视频升视频,我们统一按最高十秒来计算。谷歌的 omni flash 不 管你上传的是多少秒的视频,都是二十积分,但 cds 二点零 vip 和可零三点零是按秒计算积分消耗的。所以如果统一按十秒来算每秒成本, omni flash 依然是最便宜的。从 从价格角度来看, omni flash 的 优势非常明显,便宜而且生成速度也快。如果你的需求是修改视频内容,比如改变视觉风格,替换角色,增加元素,做一些局部的视频编辑,它是一个非常不错的模型。 但它也有三个明显问题,第一,如果你是 pro 会员,你做的视频都会带水印,只有 auto 会员不带水印。第二,真人素材限制比较多,有些人物参考图不能直接使用。第三,视频质量还没有达到目前顶级 ai 视频模型的效果,尤其是人物真实感、动作强度、复杂分镜和中文内容这几块,它和 cds 二点零还是有差距的。 不过 omni flash 毕竟是轻量版本,现在已经能做到这种程度了。后面谷歌可能会推出 omni 进阶版,我们可以期待一下。今天的视频就先到这里了,记得关注冲破新一叉 ai 测评,我是专业的,那我们下期再见!

每天推荐一款强大的 ai 工具,今天我们要讲的是 gemini! gemini 三点五 flash 真的 太全面了,它可以做图片、做视频、 写代码、做小游戏、做音乐、做网页,三 d 交互动画, 不仅可以一键生成 ppt 大 纲,甚至可以手势控制,完全不在话下。还有你的专属 ai 知识库 notebook am, 能直接链接整个骨骼生态,所有的提示词我都打包在文档里了,有需要的可以自取,我是学智,带你看懂 ai, 用好 ai, 我 们直接上干货, 这就是 jimmy 的 官网。简单来说, jimmy 的 不是一个模型,而是一套生态。你在网页里和 app 对 话的那个助手就是 jimmy, 他 就像大脑一样负责你的文字代码推理,然后指挥下面这些专用的模型一起干活。而这个香蕉图标是谷歌最新的图像生成编辑模型, none of it, none of it two。 一句话,深图对话,改图,做海报,做封面,甚至图片里的中文也很稳定。上面这些图片是官方的预设,我们选择一张上传我们的照片,输入提示词,我们点击生成,可以看到面部信息保存的还是比较好的,清晰度也不错,就是有点特写镜头的感觉。我要把它换成中景, 这里的扩图表现还不错,用它来做一张海报标题,用学知的 a i 世界输入提示词,我们点击生成,这里可以看到 number 不, number 是 通过对话的形式来改图和深图的,它最高支持四 k 的 图像输出和多种比例的调节。这些预设大家都可以尝试一下,操作非常简单。好的,接下来给大家分享一下我开张这张图的制作方法, 同理,我们上传图片,这是我写的提示词,给大家参考一下,这里我们可以把它直接导到 vivo 三点一里面,直接做视频就可以了。 m 六三点一是谷歌的视频生成模型,它最高支持四 k 二十四帧的视频输出,同时呢它支持横竖屏的切换,四条视频的同时生成,它的预设输出分装格式是 mp 四,支持八秒高质量视频,还能原声生成音频, 知道这些规则以后可以开始操作。这些都是我用 vivo 三点一做的,都是网上经常出现的 ai 视频,我们看看效果。我们来演示一下胶囊庇护所的制作方法,这里我们用的是纹身视频功能,我们打开 flow, 输入这段提示词,这里用的全都是大白话,但是他会帮你主动的去分析,生成更丰富的画面。我们来点击生成, 我们再来研究一下开场的视频效果是怎么做的,我们点击上传图片,然后输入这段提示词,然后点击生成。对于这种复杂的视频,我们很难做到一次性就过,所以我们要进行多轮的抽卡,不过它的质量还是蛮高的, 按照刚才的方法,我们多生成几个角度的视频剪辑在一起就得到了这个 可以说从现在开始,你工作的一部分价值会被这种超级 ai 工具所替代, 但如果你用的好的话,它可以让你一个人就是一个团队。好了,以上就是本期的所有内容,如果本期内容对你有所启发的话,记得点赞关注,下期带来更多解密的干货。

先给兄弟们看一下我们用智能体做出来的视频的流量,我自己看完都愣了一下,这个是我们一个才起不久的账号,才跑到第十个视频流量就已经跑到几万了,这个是数据,兄弟们可以看一下。 今天就聊聊我是如何用这摩尼三来做出一个靠谱的智能体。先点赞收藏这块强调一下啊,限阶段这摩尼三还是最强的工具,但是整体使用下来还是这摩尼三是最靠谱, 输出内容是最实用的。说实话,一开始我在用 ai 的 时候也跟个无头苍蝇一样,每次搭建智能体,在那个对话框里面输入几十个字的题文字,比如平时我们结合自己的行业,因为我们是做流量的,你现在是一个短视频 专家,帮我想想怎么做视频,并且做出大 这种提示词,要么就是回答的驴唇不对马嘴,要么就是回答的多少是差点意思, 前十条视频发出来根本就没有效果,我就在想这个 ai 也没有说的那么牛逼吗?是不是我自己还不太会用 ai? 后来我一犯懒,想到一个反常识的办法,后来发现这是一条正确使用折磨你来搭建智能体的捷径。这招特别适合咱们那些想用 ai 智能体 自己的行业赋能,但又会天天聊不到点子上,问不出来自己想要的答案,那些兄弟们我是怎么做的呢?给大家看一下。第一步我也没直接建智能 体,太麻烦,我就打开这个 pro 的 模型,这个模型目前是能力最强的,其他几个普通模型比 pro 的 这个逻辑思维还有这个思考深度要稍微差一些,然后就可以跟他聊了。比如你可以说我想做个新号搞流量,但我不知道怎么弄。 注意啊,这块不要着急要结果,你就跟他多聊上一会,把你想做的方向,把你的困惑全部 都聊清楚,这是他出的内容。这块我只是给兄弟们做一个示范,当你觉得跟他们聊完,他们能给出你的答案,让你感觉 ai 讲的东西还是靠谱,还是有点实用价值的时候,你就可以这样说了,既然你已 经懂了万物,万物,万物皆是此物。 把这段命令发给他之后,你看他会直接给你甩出来一个超级专业的指令,像这样,而且还带有一定的代码,这个逻辑就通了呀,人家肯定是比我们更懂怎么 指挥人家来干活了,对吧?最后一步最简单了,我们直接把这段他自己写的提示词点这里有个复制按钮,然后粘贴到。在这块我们创建一个智能体,点击新建名字这块的话,你可以随便起一个叫流量, 然后说明这块其实不重要的,最重要的是指令这块,把刚才他给你输出的指令复制进来,然后点击这块保存 这个智能体看,正在创建当中。看现在就创建好了,已创建名为流量大师的智能体就可以开始对话了,到这一步就算完事了。用我这个偷懒的办法做出来的流量大师,那才是真正的懂你。我就是靠这种偷懒的办法,把新号的第十条视频做出了这种几万的这种播放量。大家如果也想用正 你给自己搞一个流量大师的话,真的建议试试这招,咱评论区一块聊聊,看看你的智能体给你带来了多少意外之喜。

买一亿 token, 从一百三十五元到六万八千零四十元不等,但问题是, token 到底是什么?它如何变成账单上的数字?一亿 token 梦干啥?这篇文章从本质消耗到价格,给你把账清。 token 到底是什么?很多人把 token 等同于汉字或单词,其实不是。 token 是 大模型理解语言的最小计算单位。模型眼里,文本不是连续的句子,而是一堆被拆分好的积木。你问的每一句话,发的每段文字,都会被先切成 token, 再送入模型处理。 不同模型的切法不一样。英文模型多用 bpe 算法,把单词拆成更短的片段,压缩性强。中文模型则偏向单字或词组分词,更贴近我们的表达习惯。简单理解,一个 token 大 约对应一到两个汉字,但这只是估算 精确技术,要看模型内部算法。为什么按 token 计费?因为它能精确度量、算力消耗、输入提问要算,输出回答也要算。每多一千个 token, 对 应的 gpu 运行时间、电费、人力成本都是限性增加的。 对开发者和企业来说, token 是 最直观、最可控的成本单位。你可以把 token 看作 ai 世界的度量横。没有 token, 模型无法量化你输入的内容,也无法给出公平的价格。 日常任务到底消耗多少 token? 不 同人、不同场景, token 消耗天差地别。下面按使用人群分级,给你一个可直接套用的计算。每天写五封邮件,翻译两篇短文,偶尔问几个问题,属于轻度用户。 这类场景 token 消耗很低,每天大约两千 token。 如果你只做这些,一亿 token 够你用整整五十年。中度办公与内容创作,每天写代码、处理文档、整理会议纪要、批量写稿,属于中度用户,日均消耗大约五万 token。 一 亿 token 大 约能用两年。 自媒体创作者日更一到两篇长文,每篇两千到三千字,单次生成约三千 token。 加上批量修改标题优化,多轮对话, 全天消耗可能落在三万到六万 token 区间。重度企业场景,比如企业级 ai 客服智能知识库内部 agent 系统,一个中型客服系统,每天一万轮对话,每轮平均两百 token 就是 两百万 token。 如果再加上自动回访、语义解锁、总结分析,消耗量可能到一千万到两千万 token, 每天 一亿 token, 对 这类公司来说,大约只能撑五天到十天。专业高消耗任务编程 agent 代码生成,项目级开发科研模拟一个完整的小项目, agent 可能要反复写代码,调试解释逻辑,单次任务消耗可达一百万 token, 代码审查一次也可能消耗五万 token。 所以 你看到的是一个问题,一句话,但模型背后可能是成百上千次的内部计算和 token 消耗。二零二六年最新价格,一亿 token 到底值多少钱?以下价格按二零二六年三月行情第一超清量模型梯队,这些是个人用户、中小业务的首选。性价比拉满。 genuine flashlight 一 百三十元每一 token。 通一千问一百四十元每一 token。 gpt 五一百六十二元每一 token。 deepsea, 两百四十八元每一 token。 选择这一档,个人日常办公足够用五年以上。对中小公司来说,月度 a p i 成本几乎不会成为负担。第二,终端模型梯队。适合中小企业日常业务、中等复杂度任务。 gpt 五 mini 八百一十元每一 token。 kimi k 二,九百九十元每一 token。 gemini are flash, 一 千零八元每一 token。 这一档在逻辑推理、内容结构化、代码生成上比轻量模型更稳,同时价格可控, 很多公司把百分之八十的非核心业务放在这一档。第三,旗舰模型梯队。企业级核心应用的主力配置, g p t 五,四千零五十元每一 token germany r pro, 四千零五十元每一 token。 cloudsonnet, 四,六千四百八十元每一 token。 它们的上下文窗口大,推理能力强,长文本处理稳定,适合知识库、科研分析、多模态内容生成等关键业务。第四,顶级推理模型梯队。这是 ai 产业的塔尖。 cloud opus 四,三万两千四百元每亿 token gpt 五 pro 六万八千零四十元每亿 token。 主要用于尖端科研、金融量化、高端代码开发、复杂系统仿真,普通场景很少用到,但它们能完成普通模型无法完成的深度推理。从一百三十五元到六万八千零四十元,一亿 token 的 价格差距超过五百倍。为什么差这么多? 因为能力、算力、成本、战略目标完全不同。价格差背后的真相是,基础能力、廉价化模型、基础能力,文本理解、内容生成、基本问答已经成为标准化商品,技术成熟,竞争激烈,所以超轻量模型能把成本压到百元级别。顶尖推理、稀缺化 数学推导、跨领域深度分析、高精度代码生成仍然需要千亿参数、海量数据、高端 gpu 集群,这些资源,成本居高不下,导致顶级模型价格无法下降。二零二六年的 ai 市场很清晰,基础能力像矿泉水便宜且可替代 顶级推理,像黄金仍然稀缺且昂贵。另外,输出比输入贵三到十倍,大部分模型输出 token 价格是输入的三到十倍。 输入是你说的话,输出是模型生成的内容,生成过程更复杂,成本更高。如果你在做长文本创作、报告生成、故事写作,要特别注意这一点,一篇五千字报告,输出可能比输入贵十倍。 a 阵时代消耗暴增,怎么省 token? 三个方向七成成本可压缩。第一,提示词精简, 把永长指令改成简短要点,比如,请详细、全面、系统的分析问题,并给出创新、实用的方案,约一百五十 toc 优化成分析问题,并提供三个实用方案,约四十 toc, 节省超过七成。 删除废话,保留核心动词和名词,不要用形容词堆句子。第二,模型分级,使用简单任务用轻量模型,复杂任务用终端,关键业务采用旗舰,这叫模型路由,是企业降低成本的最有效手段。 第三,缓存上下文压缩 r a g 缓存重复问题,命中率可达三成,成本低十倍。定期压缩对话历史可节省五成到七成。用剪缩增强生成替代长提示词指剪缩最相关内容,节省三成到七成。总结下, token 是 ai 世界的通用计量单位,是你和模型之间的成本桥梁。 日常使用它藏在每一句话里,企业使用它体现在每天的账单上。二零二六年,一亿 token 从一百三十五元到六万八千零四十元不等,背后是能力、成本战略的分层。 看懂 token, 就 能看懂 ai 时代的价格逻辑,也能在数亿元的产业中找到最适合自己的性价比区间。 ai 不是 遥远的技术,它正在变成每一个人、每一个公司都要掌握的工具,而 token 就是 你打开工具大门的钥匙。

这次我们飞到了美国硅谷,不仅亲眼见证了模型发布大佬未谈的震撼时刻,还体验用 jimmy 新模型做了一个三 d 互动游戏。大家好,现在我就在酷狗爱优大会的现场,感谢抖音科技和酷狗的邀请。未来一年, ai 朝哪个方向发展?看这场大会就够了。现场欢呼声最大的时刻就是 jimmy 三点五的更新了。 这次发布的呢,是 flash 版本,最大的特点呢,就一个字,快!如果再加上谷歌新一代 tpu 八 i 模型的输出速度呢,可以达到恐怖的每秒一千五百头啃。 现场演示中呢,代码几乎像流水一样成片涌出来,瞬间呢,就做好了一个小游戏。但是为啥这次谷歌非要强调快呢?根据放出的榜单, gemini 三点五 flash 比较突出的能力是智能体和多肽。 当时呢,我就有个疑惑,谷歌放出这样一个模型,是因为模型训练真的达到瓶颈了吗?不过很快, google io 呢用一场全面的展示回答了这个问题,这背后呢,是一家拥有五十多亿用户的科技巨头面临的选择。智能体时代,谷歌想要成为什么 这次的发布会呢?谷歌把 ai 塞到了各种各样的地方,比如谷歌地图。现在呢,你可以直接通过问问题的方式找自己想去哪里,还有谷歌搜索这个老本行,可以说呢,迎来了前所未有的大更新。现在呢,你可以通过图片、文件、视频等等各种方式搜东西。 ai 不 光会帮你找,还会自己写代码,做成图表或者演示动画,把那些看着就头大的数据理论啊,变成可直观界面。 就连电商这块呢,也全面接入 gemni 以后呢,你可以在整个谷歌生态里随时随地买东西,而这一切的终极形态,是一个叫 gemni spark 的 东西,可以看作谷歌版的龙虾,它是一个打通了谷歌全家桶,在谷歌云上二十四小时待命的智能体。比如你想约一波聚会,它自己会在邮箱里检查消息,提醒回复, 在谷歌表格里整理名单,在谷歌云盘里找到社区守则,还会自己做一份宣传 ppt。 到这呢,我觉得就不难理解谷歌这次在 gemni 三点五 fly 上的选择了。 前面这一连串的核心呢,要运转起来,都离不开最核心的动力源 java 模型。而要跑通这样一个庞大的商业生态呢?五个不需要能解除世界级难题的超级 ai, 而是需要一个够快的,能处理好各种日常事物的模型。 三点五 flash 的 智能体和多媒体上的技能点呢,应该也是为了这件事点的,因为够快, jimmy 呢,能无感的融入谷歌浏览器、地图、邮箱、电商等等各种地方。在这些场景下呢,每次回复快一点,可能比模型能力再强一点要重要的多。不过作为开发者,我更关心的还是新模型拿来写代码到底怎么样。 前段时间沙雕人格测试 spti 特别火,我们就想做一个三 d 互动版的人格测试,看看不同性格的人都会怎么做选择。 比如这是一个有红蓝两个门的房间,中间站着一个 npc, 旁白提示你走蓝色的门, npc 呢,提示你走红色的门。那你会怎么选呢?是果断的走蓝门,还是在两个门前犹犹豫豫或者干脆掉头回去呢?我们想构建这样一个个面临不同选择的场景,在后台搜集玩家的行为数据,最后给出一个沙雕人格评价, 像我自己第一次玩一通乱点的,居然解锁了赛博疯子人格,属实有点崩不住了。至于游戏具体是怎么做出来的,谷哥就帮上大忙了。 在概念验证阶段,我们在网页版 java 上尝试快速搭建一个基础场景,在前端设计这块 java 模型的异域审美确实是相当不错。很快,一个小小精致的房间概念就设计出来了。接下来呢,我们转到了 google cloud, 用 app builder 进行下一步的开发。在这里,谷歌智能体会帮我们把完整的游戏前后端都搭建起来。 在发给智能体的提示词里,我们需要写上刚才设计的场景概念、完整的游戏流程、需要采集的玩家行为等等。然后呢,就要等着 jimmy 自己设计游戏架构,把这些文件一个个都实现。第一版游戏跑出来之后呢,我们还可以对每个房间做更细致的调整, google cloud 会自动帮我们保存每个版本的更新,跑崩了随时可以回到之前的状态。最后呢,这个 app 可以 在 google cloud 上一键部署,从本地程序变成一个大家都能访问的网页, 体验下来。谷歌的开发者生态呢,现在也算是彻底拥抱智能体了。这样一个包含多重分支,一大堆三 d 场景的小游戏开发,从设计到部署,咱们基本上只需要在旁边指指点点。 其实在谷歌 i o 大 会现场,其他开发者呢,也带来了各种各样的技术展示,比如能直接在网页渲染三 d 模型的卡拉斯接口、基于 java 的 小机器人等等。 此外还有谷歌和中国智能眼镜品牌 x ray 合作打造的 ar 眼镜 project aura, 我 现场体验了一下,它有两个 oled 显示屏,可以把三 d 窗口各种模型渲染到屏幕上,也可以通过眼镜直接和占位来交互。我们还抓到了 x ray 联合创始人吴克坚,和他交流了一下 ar 眼镜接下来会怎么发展。我觉得整个做 x r 这个行业的,大家的愿景一定是说最终要打破这个显示屏的边界,因为它本来就不应该是一个有边界的东西,你的视野、人看到的东西,就是你的交互的界面,真实的这个物理世界就是你的交互的。这样的一个 一个一个 deck 啊,所有的东西都是叠加和呈现在整个这个你作为看到的世界上面的这个,这是我相信我们做 x r 这个行业的人,所有人都在 chas 的 东西。 总的来说呢,我觉得这次 google l 的 关键词是整合,往前倒一年,各家大模型公司还在拼奔驰 mark、 拼参数、拼谁先放出最震撼的 demo? 但谷歌这次展示的逻辑呢?完全不同。这试图回答一个更实际的问题,当 ai 发展到了如今这个阶段,到底该怎么走进普通人的日常生活? 要做到这一点,谷歌需要让创作者、艺术家、开发者以及其他各行各业的人都参与到 ai 演化的进程中来。我觉得如今的谷歌是在设想那个 ai 成为一切生活基础的世界会是什么样的, 然后反过来倒推,我们如今需要什么样的模型和基础设施?无论是速度更快的 jimmy, 三点五 flash 智能体化的开发者工具,还是 ai 眼镜这样的智能硬件,如今的谷歌正在为智能体时代的全面到来做好准备。 就像 google deepmind 的 联合创始人和 ceo davis 在 访谈中说的, the next generation that's going to grow up, ai native and i think for the next ten years at least and it's hard to see beyond that they're going to be super powered as long as they're technically trained enough, and then they bring creativity and sort of taste and judgment these kinds of skills to the table i think that's going to be the next era。 我 想呢,这个未来可能离我们没有那么遥远了。 这次我飞了十二个半小时来到姑姑园区,带大家看第一手的信息。大家要是觉得不错的话呢,可以来抖音精选 app 上给我们点个赞。后面呢,我们多做一些这种直击海外现场的内容,我是林毅,咱们下个视频见。

朋友们,今天凌晨,谷歌扔出了一枚深水炸弹。就在刚刚结束的 google i o 二零二六大会上,谷歌宣布推出 gemini 三点五 flash 模型,并且向全球所有用户免费开放。这不是阉割版,不是试用版,而是谷歌宣称的迄今为止最快、最有效的模型。 它可以接受任何形式的输入文字、图片、音频、视频,用户甚至可以用自然语言直接编辑视频。谷歌在现场算了一笔账,对于头部企业来说,如果把大部分工作负债切换到 flash 系列模型,每年节省的成本可能高达十亿美元级别。免费开放多模态视频编辑,年省十亿, 这不仅是模型升级,这是全球 ai 巨头在用极致性价比重构竞争格局。很多人可能对三点五 flash 这个命名没概念,我帮你翻译一下。 第一,速度快得离谱。谷歌表示, g m 三点五 flash 在 输出令牌速度上是其他前沿模型的四倍,而在优化平台上的版本,速度还能再提升到十二倍。什么概念?你以前问 ai 一个问题,等三秒才有回复,现在一秒不到答案就出来了。第二,性能不降反升。你可能会想,速度快是不是牺牲了智能? 恰恰相反, gemini 三点五 flash 在 多项精准测试中,超越了四到五个月前的旗舰模型。在代理式 ai 能力、代码编辑、多模态理解等关键维度上,三点五 flash 都达到了前沿级别的水平。用谷歌的话说,性能是旗舰级,成本只有三分之一到一半。第三,真正的多模态来了。 gemini 三点五 flash 可以 接受任何形式的输入文本、图片、音频、视频。更炸裂的是,用户可以用自然语言直接编辑视频。你说把这段视频中的夕阳调亮一点, ai 立刻执行, 不像是模型升级,更像是人机交互方式的彻底重构。第二部分,谷歌的阳谋,用极致性价比打一场价格战。很多人问谷歌为什么要免费开放,低价收费?难道做慈善?答案很简单,抢市场、抢用户、抢生态。第一, ai 的 竞争已经从参数竞赛转向成本竞赛。谷歌现场算了一笔账, 目前头部企业每天在谷歌云上处理海量 token, 如果把大部分工作负债切换到 flash 系列模型,每年节省的成本是十亿美元级别。 对于正在烧钱搞 ai 的 企业来说,成本就是生死线,谁能在保证性能的前提下把价格压到最低,谁就能抢走对手的客户。第二,谷歌要用免费圈住十亿用户。 gemini 应用的月活用户已经超过九亿,一年前这个数字只有四亿。谷歌搜索 ai 模式的月活用户也在一年内突破了十亿。策略很清晰,用免费的 flash 模型留住 c 端用户,用低价的 a p i 吸引弊端开发者。当所有人都习惯了 gemini 生态,谷歌的 ai 收入就会像当年的搜索广告一样源源不断。 第三,谷歌有降维打击的底气。自研芯片,谷歌使用的是自研 p p u, 而不是像其他厂商那样采购英伟达 g p u。 自研芯片意味着更低的单位算力成本、更高的利率。二零二六年,谷歌预计资本支出将达到一千八百亿至一千九百亿美元,六倍于二零二二年的三百一十亿美元。 这种不计成本的投入,就是在为未来五年的 ai 算力霸主地位铺路。谷歌 ai 大 模型升级,最直接的受益者不仅是谷歌自己,还有整条 ai 算力产业链,大模型训练和推理需要海量算力。 杰米尼三点五 flash 的 免费开放,意味着全球用户的使用量将暴增,直接拉动 ai 服务器需求。据产业链消息,谷歌 tpu 机柜总数量预计将从二零二六年的约六万柜,快速成长到二零二七年的约十点五万柜,年增幅高达百分之七十五。工业复联 ai 服务器代工龙头,深度绑定英伟达、谷歌等大客户直接受益。 互电股份 ai 服务器 pcb 核心供应商、 pcb、 数据中心等领域的订单持续增长,大模型参数越大,数据传输需求越高。 光模块是 ai 算力集群的神经系统中继续创全球光模块龙头。一点六 t 光模块已批量交付。谷歌 gemini 流量增长将直接拉动八百 g 一 点六 t 需求。 天福通信一点六 t 光引擎规模量产,深度绑定海外头部大客户业。三点五 flash 的 免费开放受益于 ai 数据中心互联需求。 gemini 三点五 flash 的 一大亮点是端侧轻量化,让更多中低端设备也能流畅运行本地 ai 功能。瑞生科技向 ai 手机 x 二可穿戴设备输出光波导、高端散热系统等感知方案。康奈特光学、夸克 ai 眼镜独家镜片供应商受益于 ai 端侧设备放量。当然,话要说回来, 第一, gemini 三点五 flash 的 免费策略可能会引发整个 ai 行业的价格战,如果竞争对手被迫跟进降价,整个行业的利率可能被压缩。 第二,谷歌 tpu 供应链相关标的近期已有较大涨幅,工业复联中继续创等估值处于历史高位,短期追高需谨慎。第三,谷歌的资本支出虽然庞大,但能否持续产生回报,还需要看 ai 应用的商业化落地节奏。 总之, gemini 三点五 flash 免费开放是谷歌在 ai 成本占中的一次亮剑,它的意义不亚于当年安卓系统免费开放。 用极致性价比抢下生态入口,再用生态反捕算力投入工业复联在造服务器中继续创。在铺光模块,天府通信在生产光引擎,瑞生科技在布局端测硬件。当谷歌用十亿用户、万亿 toker 向全球宣告 ai 不 再是奢侈品时,中国算力产业链上的卖产人正在闷声发大财,这个赛道的故事正在翻开新的一章。 好,这个话题就聊到这。以上内容和提到的公司是基于公开信息的逻辑梳理与产业推演,不构成任何投资建议。市场有风险,投资需谨慎。

上了这个 openclaw 之后,大家发现虽然 claw 的 系列模型它的性能最为突出,但是它的速度和它的价值也是非常的昂贵。那个时候 timi k 二点五也是被很多开发者拿来当做它的备选。 一个有趣的现象是就我们后台会发现,因为很多的用户都在拿 timi 二点五去执行的小龙虾,那龙虾大家都知道它有的机制叫心跳,它默认的时候是在整点的时候会做一次唤醒 他这个时候就会触发一次这个对模型的呼叫,那因为基本上大家这开发者他不去改这个默认的配置,所以就会发现一个现象,每个整点的时候他对我们的服务器都会产生一次 bug, 这现在就有非常的规律。那所有的这些其实都预示着目前不仅对模型的智能要求越来越高,同时对模型他的上下文的要求也是提出了越来越高的这个指标。 左边是我们这个啊,右左边是我们的潘总的预言,他在年初的时候就预言 pos 要涨价,那现在大家也是发现很多的 这个如 pos 定 plan 他 们都都会遇到了这样的限额问题,包括昨天出的卡奥德的 四点七,大家发现它 thinking 的 过程会更长的 thinking 时间,会产生更多的头肯,为了让它的性能更好,这个过程本身就会让你的计费,你花的钱就会更多。 对综合来看,整个不管是你的任务的复杂度,还是模型本身的推理的过程,他都导致了一个结果,现在偷看越来越贵,越来越难抢。有网友就就说他现在去抢这个 tony plan 的 这个包,就像他去抢演唱会的门票一样, 可见是年初的预言,但现在基本上已经被大家都默认了,这样有那么多的要求,就会导致现在大家对 计算能力有提出的供不应求,现性注意力就可以从根本上去帮助我们有机会解决这个问题。