粉丝288获赞387

今天凌晨,谷歌 i o 二零二六如期而至,随即宣布 gemini omni、 gemini three point five、 flash 等等一系列新产品。 这是什么?硅谷年夜饭?算粒满汉全席。媒体老师也非常懂事,标题直接起飞,谷歌亲手淘汰谷歌 视频版 nano banana, 全能 ai 创作引擎,全场最大的 c 位,毫无悬念给了 gemini omni。 这玩意号称是真正的全能大模型,能吃进任何形式的输入,拉出任何形式的内容。文本、图片、音频、视频,只要你敢喂,他就敢接, 而且首发支持视频输出,江湖人称视频版 nano banana。 你 看这个排面,劈柴哥和哈萨比斯同台登场,大招跟不要钱一样往外扔。他们说 omni 不是 在简单拼接素材, 他是在理解物理世界。以前的 ai 画个物理现象,重力和动能常常让牛顿想从苹果树下爬起来打人。但阿米不一样,哈萨比斯说他实现了阶跃变化, 氨基酸折叠都能给你干成科学准确的定格动画。甚至你拿个手机自拍,手心里画个圈,他就能立刻给你生成一个黑洞。看起来这不仅仅是降维打击,这简直是从四维空间扔了二象薄, 画面太美,数据太狂,狂到让人觉得好莱坞明天就得集体去送外卖。但这还不够刺激,发布会的另一个高潮是 jammer 三点五 flash。 只要你懂点行,你就知道现在的大模型卷速度卷到了什么地步。 三点五 flash 在 精准测试里,把自家前代旗舰 jammer 三点一 pro 按在地上疯狂摩擦,更离谱的是,它的输出速度直接翻倍,对比 gpt 五点五和 opus 四点七,速度快了四倍有余。这什么概念? 你这边的提示词刚敲完回车,他那边的答案已经糊你脸上了。天下武功,唯快不破, ai 界直接来了个闪电侠。 这还没完,谷歌还顺手倒出了一箩筐的重磅炸弹。 anti gravity 二点零桌面应用直接进化成 agent 的 开发平台。 james park, 七乘二十四小时在线的赛博打工仔。不需要五险一金,不需要情绪价值,只要服务器不断电,它就能给你打工到宇宙热季。 顺带把 jimmy 也改版了,代号 neuralexpressive, 改成算力计费。你以为他在做慈善,其实他在教你什么叫资本的洋谋。 甚至连搞了二十五年的谷歌搜索都迎来了史诗级升级。接入三点五 flash 智能搜索框,自动生成小程序。这一套组合拳打下来,干货密度堪称历年之最。大场发力,寸草不生。 那你说这东西真的这么神吗?往往打榜数据越炸裂,发布会的 ppt 越精美,里面的水分往往就越能养活一太平洋的鱼。 我怀着激动颤抖的心,拿着号称能改变世界的 omni 进行了实测。这需求可太真实了。毕竟咱们干自媒体的,天天盯着各种 ai 视频工具找灵感,就指望他们能帮着出大片,但结果给我看笑了。哎, 硅谷的公关稿还是太保守了。这哪里是改变世界,这简直是重新定义了拉胯。宣传片里是好莱坞质感,随手一划就能变黑洞。小提琴手在雪山和赛博朋克之间无缝切换。物理逻辑严丝合缝。 到了我这呢,我输入几段简单的指令,生成出来的视频,当场给我整出了工伤。说好的理解世界呢?服务员你好, 我想要一杯客了!好的,没问题!这一刻,我都怕他给我念出一段大悲咒来超度我的显卡。那些在发布会上惊艳全场的连贯性记忆力和物理法则,在实测面前碎的渣都不剩。 这不叫接月变化,这叫当场火化。网上的各路媒体还在疯狂吹捧热搜,通稿满天飞,但和实际效果一比,简直是截然不同的两个平行宇宙,那还能说啥了?看完这场魔幻的体验,我算是彻底清醒了。 现在的 ai 圈有一种极其不健康的畸形风气,只要打榜厉害,只要 ppt 做的炫,就能吹成天神下凡。 巨头们在台上拿着特供版的 demo 疯狂秀肌肉,底下的信徒们跟着无脑狂欢。 ai 好 不好用?只有我们这些一个个坐在电脑前疯狂敲着键盘,试图用它来铲除实际价值的用户给出的真实反馈才算数, 你数据再炸裂到了用户手里,变成了一坨赛博垃圾,那他就是毫无价值!请这些 ai 公司收起你们的滤镜吧!面对用户的实测反馈,少吹点牛,多打磨点细节,这才是对技术真正的尊重。这里是起点世界,聚焦最新 ai 资讯,我们下期视频不见不散!

谷歌这次彻底炸场了,谷歌 i o 发布会上,二十二条 ai 更新一口气全砸出来,其中有一条是谷歌搜索二十五年来最大的变更, 不是小修小补,是从根子上把搜索这件事重新定义了。我帮你把二十二条全部拆完,有几个进展真的让我头皮发麻。先说第一条,也是最炸的一条,谷歌搜索框变了,以后你搜东西不是输关键词了, 是直接像跟 chat gpt 对 话一样,打一段话,还能上传图片视频文件塞进去当背景。而且这个 ai 模式现在已经在变成默认选项了,听听他们自己怎么说的。 just googling things you now use this just like you would use chat gpt or google gemini it allows you to expand what you type in and on top of that? 你 以为谷歌就是个搜索框,其实他现在要做的事情是把整个互联网变成你的私人助理。这不是功能更新,这是产品逻辑的重写。 第二条,新模型, gemini 三点五 flash 来了!这个 flash 本来是谷歌家的快但不强的便宜货,但这一次,三点五 flash 直接把三点一 pro 给打败了。什么概念?就是原来的旗舰被新出的经济版给踩在脚下了,而且速度是竞品的四倍。听下原话, well, 3.5 flash is faster than the other frontier model so if you want a fast model。 更猛的还在后面,三点五 pro 下个月发布,谷歌直接放话,性能要超过 cloud 和 chat gpt 的 最强模型,放不放的出来,我们走着瞧,但这个底气是真的硬。第三条进展,信息代理人把谷歌快讯彻底重做了, 以前那个谷歌快讯有多少人真的在用?现在用顶级大模型驱动二十四小时监控,只有真正符合你设定条件的内容才会推给你,告别垃圾提醒, 这才是信息管理该有的样子。第四条,搜索预定功能大升级以后,你搜个餐厅,搜个维修服务,直接告诉他价格时间地点,你想要啥氛围,他给你列好选项,附上预定链接,甚至可以替你直接打电话给商家听听这段。 also call businesses on your behalf so if you're doing things like let's say you want someone to do home repairs for you well, this will call different services and try to book that for you google 替你打电话预约维修工人这个功能我测试到的。那天我会第一时间出视频,因为这玩意如果真的靠谱,很多中介服务可能要哭了。 第五条,生成式视觉答案搜索结果不只是网页链接了,它能给你生成交互图标、数据面板,甚至直接帮你搭一个迷你 app。 比如你搜帮我做个健身计划, 它直接给你生成一个可以打卡追踪的小工具,搜索引擎变成了 app 生成器。这个思路真的是降维打击。第六条, gemini omni 视频生成模型,不是图片转视频那种,是从头生成,可以追加 prompt 持续编辑的那种。第七条, gemini sparks, 一个跨全部 google 应用的个人 ai 助理 gmail 日历 box 全打通,这周对 ai o 川用户开放。第八条,每日简报功能,每天早上自动从你邮件和日历里提炼重点,帮你规划当天。 as it comes from your gmail, your calendar any summarized things that you might have missed here suggest what to do next so these are things i already do。 这个功能 chad gpt 和 cloud 其实已经能做了,但 google 这套是直接原声接进去的,不用你折腾连接器。对于重度 google 生态用户,这就是降维碾压。 第九条 universal cart 万能购物车,你在谷歌搜的商品可以跑到 youtube gmail gemini 里继续跟着你,价格降了提醒你缺货了提醒你想买的时候在哪个 app 都能结账。第十条 gmail live 直接跟你的邮件儿说话,问他航班几点,有没有回复,他开口告诉你答案。 第十一条 docs live, 你 说话,他帮你整理成文档草稿,还会自动调取 drive 里的相关内容填充上下文。 第十二条 google keeps 加入语音笔记,说完自动整理清楚。第十三条 gmail ai 收件箱排序,重要邮件自动置顶,紧急的单独提出来,再也不会漏掉真正重要的东西。 第十四条 google picks 独立图片创作和编辑平台,底层是 emoji 模型。第十五条 google flow 大 更新, gemini 视频生成模型接入,做创意内容的人有福了。 any type of creative work, google flow is definitely worth a look and there you have flow music so with the omni model。 第十六条 full music 模拟模型还能生成音乐,安卓和 ios 都要上线。第十七条 youtube 搜索框升级 ask youtube 以后,搜视频不是输关键词,是直接输问题。它给你视频里对应时间节点的精准答案,直接跳到那一秒,这对做教程类视频的人是个危机,也是个警醒。 第十八条安卓界面更新第十九条 android halo ai 助理在后台干活时,给你实时显示它在做什么的界面,就像叫外卖,能看司机在哪,以后 ai 替你办事,你也能盯着它。 第二十条, android gravity 二点零上一代就已经是顶级的 ai 编程平台了,这次二点零版本到底强到哪里?我会专门出视频测好二十二条更新全部到位。 你知道最可怕的是什么吗?这不是谷歌在跟进 ai, 这是谷歌用自己二十五年积累的入口优势,把搜索、邮件、文档、购物、视频全部 ai 化,它不需要你换 ipad, 它在你已经用了十几年的地方,悄悄把底层全换掉了。这波谷歌是真的急了还是 chat tpt 吗?弹幕告诉我。

哇,酷狗新模型憨爆了啊!好吧,也拉爆了! siri 君花了五天烧了八亿头坑!一分钟带你吃透酷狗新发布的大模型!一句话总结,有憨有啦!先说炸场的 omni, 首个全模态大模型 omni 憨到什么程度呢?拯救废片,再也不用反复抽卡了! 他其实是一个顶级缝合怪可灵的参考视频模仿生成,或者是参考图首尾帧故事版,他全都能用。但是他对运动和物理规律这块非常拉, 所以除了运动,其他方面还是可以使用的。他最好的优点是不用排队。 再说第二个主角, jimmy 三点五 flash, flash 版就是入门版,它的速度和精度居然比上一代的 pro 版还要高,它还有支持一个 a 准的模式,就像小龙虾,它现在就可以自己在云服务器上拆任务,自己干活。那么意味着你可以用 jimmy 三点五 flash 去 去掉奥米尼,自己去照视频,剪视频,改视频,发文案。但是他拉的地方在于价格,基础版的价格居然比 pro 版的还要贵!将雪下在房间里,在刚刚的视频上修改了,去除雪,放一群鸡进来,鸡换成一群模特在拯救。 把模特去掉,房间里有瀑布!

朋友们,昨天的谷歌 i o 大 会你们看了吗?我早上起来刷他的新闻,好像没什么波澜啊,但是有另一个新闻,然后我一下就清醒了, codex 的 额度又重置了警感信,而且 sam 奥特曼的推写的特别漫不经心, 让我隐约觉得谷歌这场大会肯定是有点料的。所以我用了一早上,仔仔细细看完了,也分析了,果然让我发现了三条重要的线索。当然,我还是建议大家完整的看一下这场发布会,我觉得料特别多,然后再结合我给的三条线索,看看你们有没有收获。 这场大会简而言之,没有什么创新,但是非常的务实,他发了很多东西, google omni, 一个可以从任意输入到任意输出的世界模型 gimna, 三点五 flash, 质量超越了三点一 pro, 当然价格也差不多,速度飞快。还有一个全面向 codex 的 ui 靠拢的 anti gravity, 二点零, 一个和 ospec 命名完全一致的 managed agents api, 一个叫做 german spark 的 谷歌版小龙虾,还有七十二小时在后台帮你搜索的 google search agent。 最后还有一个不知道多少场都已经发布过的仅有语音版的智能眼镜。因为都是产品发布会啊,所以就信息特别的零散, 但是呢,我是能看到有几个非常清晰的大方向的。我先说第一条啊, gemini omni, 这是一个号称能从任意输入产生任意输出的世界模型, 虽然看大家测试的结果啊,视频生成效果比不上 cds 二点零,但是如果从 word model 的 角度看,它可能还真的有点特殊意义。你想象这么一个画面啊,就你站在一条河边,左边有一条断掉的独木桥,地上有一根木棍, 上方呢,垂下来一根细细的藤蔓,右边还有一条破了洞的小船。这如果是真实世界,你打算要怎么去过河? 所以,不管你选择哪条路,我相信你在你的脑海里一定都会闪过每一条路径的预演画面。但是如果是未来的机器人呢?也是一样,他应该不只能看见这些东西,他必须在脑子里先模拟走断桥的时候会不会塌, 木棍能不能当支撑,藤腕能不能承重,破船漏水的速度够不够撑到对岸。如果未来我们要进入一个机器人时代,我们就必须有一个阶段,需要一个模型来生成符合物理世界规则的内容,让机器人去学习。这就叫 word model。 在一个给定的物理体系里,不是要画的像,而是要符合规则。前两天我看了一个演讲,是英伟达的金饭在红杉资本分享会上的一个演讲,他讲了一个很关键的路线,叫 real to seem to real 什么意思呢?就是先把真实世界扫描进来,变成一个可交互的仿真环境,然后在仿真里大规模生成变化的内容,训练机器人的策略,最后再把训练好的能力迁移回真实的机器人。这其实就是在复制大语言模型的成功路径啊。 大元模型是预测下一个 token, 而在机器人世界,要预测的是物理世界的下一个状态。未来真正关键的就是能不能把真实的世界变成可训练、可推力、可交互的模拟世界。 这就是为什么我觉得 omni 这条线非常重要?如果 jamming omni 真的 能做到任意输入到任意输出,并且能保证物理的一致性,那它就不是普通的视频模型了,而是迈向巨深智能训练闭环的关键基础设施。 它的价值就远不止发布会上那些整活的视频。当然,我的设想的场景还太遥远了。只是举个例子,我用 c 氮二点零是完全没法过河的, 但是我用了 gpt image 二,它就能想象出多种场景,并且推演出最符合逻辑的过河方式。虽然这不是视频,但似乎有那么点味道了。 于是我又用了一张迷宫的图交给他,他也能正确生成走出迷宫的路径。我用了很多视频模型都去尝试,答案不意外,没有任何一个能做到。 很可惜啊, api 还没开放,我无法访问 gemini omni。 但是如果它能做到,那它的价值就不可小觑了,就不应该再把它和 cds 做比较,而是把它放在更重要的位置去看。所以,这就是第一条线索,谷歌很可能向世界模型迈出了一大步。 那第二条线索呢?是我看到了交互方式正在飞速的演进。你们还记得吗?去年这个时候,大部分的人应该已经开始从科斯转到 cloud code 的 这种终端交互的形式了吧。 但是我相信现在很多人的主力应该已经切换到 codex 的 桌面版了吧?为什么呢?因为命令行输出的文字界面里,大部分其实都是我们不关心也看不懂的信息。 但桌面版它的右边就可以弹浏览器啊,也可以弹 preview 啊,可以有更丰富的表达和交互。 anti gravity 现在就是在走向这种眼镜,它把以前的 id 已经藏起来了,给了一个和 codex 基本上差不多的一个工作台。 它不再强调你去点目录,读文件,手动改代码,它强调的是 agent first。 谷歌用了一个词叫 mission control。 这句话很准确啊,未来的 agent 的 控制面不是让你盯着代码细节的,而是让你看清更多的 agent 的 状态,谁在做网站,谁在做素材,谁在规划架构,哪个任务需要批准,哪个任务可以接管,哪个 agent 跑偏要暂停,这才是桌面版 codex anti gravity 这类界面真正适合做的事儿 就是变成一个多 agent 的 状态,面板和指挥台。我们现在再来看 ai studio 的 一个 demo, 它是一个电台演示的 demo。 谷歌说了一句很关键的话,这句话的中文含义是生成式的 u x。 举个例子就是 ai 在 运行过程中生成小组件来和人类交互。 前段不是有一种讨论在说让 ai 生成 html 比生成 markdown 更好,因为人类很快就能看懂网页,而看 markdown 就 很费劲。说就是这个道理。 u i 和 u x 的 作用现在变了,它们不再是为人类的体验服务了,而是让人类更快的去确认结果。那为什么不用更加动态更丰富的表现来提高人类的效率呢?所以相信我, generative u x 由 ai 实时生成的交互在未来的几个月十分重要。我不知道是几个月啊,因为实在是发展的太快了。而后面的语音部分更加精彩了,这是谷歌的拿手好戏。谷歌的实时语音我不知道大家用过没,非常强, 演示者直接用语音,让 antigravity 去微调 gem 四音频模型,能听懂 lara 这种专业词。 agent 接着生成实现计划,写代码,跑训练。这不是语音输入法,这也不是 tts, 不是 asr, 这是语音直接指挥 agent 端到端的语音。 如果再结合发布会后面提到的 x r 眼镜,把航班、酒店、旅行信息用特殊的卡片实时显示到眼镜前,那就让这条路线更清楚了。 现在是 codex 式的控制台,还有输入框,未来会不会直接是语音输入了?会不会连电脑屏幕也不需要了?手表、眼镜、手机是不是都是可以交互可以确认结果的设备?那我现在正在做的多一阵系统正在策划做语音的部分。 我每年暑假都会带女儿去三亚冲浪,如果能在路上用语音麦克风来输入车机的屏幕来确认工作结果,让 agent 随时都在家里的服务器里干活,这是我非常向往的场景,我现在正在为他努力,而且我也相信这就是未来的 agent 的 交付方式。 所以一个核心的洞察就是,如果要做产品,绝对不能再停留于 chat 这样的交互了,我们脑洞应该开的更大一点,想的更远一点。 那第三条线索就是谷歌也搞了一个 open crawl, 而且可以多 a 着呢,和谷歌最擅长的搜索一起交互。 openclaw 当时最吸引人的就是它通过心跳或者说定时任务,可以二十四小时不间断地干活。要知道真实世界的行动是不是都是信息驱动的,比如说金融信息、地缘政治,还有突发的信息都会影响我们的决策,所以谷歌做了一件很务实的事, 他把搜索能力塞进了能七成二十四小时后台运行的 agent 里。谷歌在发布会上把它叫 search agents, 他 们不是等你搜索,而是你设好目标,他们就在后台一直盯着。 这里的重点不只是持久,他甚至还可以同时有多个 a 阵的为你服务,时刻盯着不同维度的信息源。而且他有多 a 阵的来解决信号产生时的动作。我们不再是搜索一个答案了,而是 a 阵时刻发现我们想要的答案,然后把方案做好。给我们 发布会里举了几个例子,比如说你关注某类生物科技的股票,他就会接入实时的金融数据库, 市场一动就会给你综合的更新。如果你在找房,他就会扫全网社交平台和论坛,如果你喜欢球鞋,他就会盯着运动员联名的发售动态。这个功能叫 germanspark, 更像是一个入口,而 search agent 是 一个触发器,多 agent 提供了解决方案, 所以这一整套就串起来了。那顺便提一句, gmail api 里也出现了一个 managed agents, 看我前几期视频,应该听着很耳熟吧,最早是 onslap 提出的,现在谷歌也复刻了一套, 一个 api 调用就能拉起无数个带沙箱环境的云端 agents。 这说明谷歌啊,不只是想让 agent 来陪你聊天儿,它是在补执行层面的东西。 这就是第三条线索。我认为很快云端随时待命的大量 agent 呢,都不会是稀奇的事了。而发生什么样的信号,产生什么样的行动,依然需要我们去定义。 我很感慨啊,前不久我还在思考什么样是一个好的架构,一转眼人家成熟的方案已经摆在眼前了。所以总结一下,如果只是从产品看,这些都没啥新意,不是谷歌独创的。但是如果按这三条线索看,就会发现他在顺应一些时代的方向, 世界模型的方向,交互方式的进化,云端二十四小时不停歇的多 agent, 而这些越来越强大,越来越成熟的基础设施,怎么样才能进入我们的生活,这依然是最难的问题。 谷歌的大部分服务我都无法访问,我相信你们肯定也是一样,但用不了。谷歌不是重点,重点是国产玩家有没有在做同样的事,他们能不能追上。 所以呢,下一期我想继续顺着这个线索聊,我们怎么样国产变得更好。好了,以上就是本期的全部内容了,谢谢大家。

刚看完 google 的 二零二六发布会,我觉得整个发布会最核心的一件事情就是 google 已经不满足于 ai 聊天了,它现在做的事情是 ai 操作系统。这次发布会的三个重点, jimmy 三点五、 flash、 jimmy spark、 jimmy omni。 这三个产品代表着 google 对 未来的三个判断。 第一, ai 未来最重要的不是会聊天,而是能不能真的帮我们干活。所以针对三点五,这次优化的不是参数,重点是它的 ag 的 能力、工具调用能力、执行任务能力以及代码能力。简单的逻辑就是 google 让 ai 从聊天机器人变成了数字员工。 第二个, germany spark, 这个东西很关键,因为它代表着 ai 从你打开它才工作,变成了它从后台持续帮你工作,比如你整理邮件、跟踪消息、进行任务, 这些意味着 ai 进入 always online, always 一 整的时代。第三个, germany omni, 它更像 google 的 未来布局,它开始让 ai 同时理解文字、图片、视频、语音, 甚至是这个真实的世界。简单地说, ai 开始从理解语言升级为理解世界。而 google 这次最大的优势其实不是模型,而是生态,因为它手里有啥搜索,安卓、 gmail、 youtube、 chrome 等等这些超级的入口, google 在 做 a 诊的,比其他公司更容易落地。这次大会还有个特别重要的信号, google 开始全面 ai 化搜索,未来用户将不会再搜索网页,而是直接问 ai。 这也意味着 未来互联网最大的流量入口直接从搜索框变成了 ai 答案,而 google 现在正在抢占这个位置。

我觉得 google 奥尼更新之后最神奇的功能之一就是可以直接修改视频里的指定元素。下面进入到实操环节,这是我在网上找到的一个可乐的 tpc 广告,那我们想把这个可乐的瓶子换成,比如说百事可乐,那我们该怎么办呢? 其实很简单,我们就把这段视频直接上传给乌米尼,然后就用大白话和他沟通,然后大家可以看一下效果,基本上所有的转场运镜,包括产品没有任何的问题。 再看另一个例子,这段视频是我用 c dance 跑费的一条画面里多生成了一只手。以前遇到这种情况,我们可能只能重新抽卡, 但现在其实有了一个更直接的解决方案,我们把这段视频上传给欧米尼,然后告诉他去掉视频里拿荧光棒的那只手,可以看到最终效果非常好,基本能修掉这类穿帮问题,也能明显降低反复抽卡的概。

不敢相信,昨晚谷歌搞了个大乌龙,在宣传自家 antigravity 的 时候,居然展示了一个文件夹,名为 codex, 这下可把 openai 的 人乐坏了,连 codex 的 负责人都在推特上说不敢相信,不可思议, 这说明啥?原来谷歌自己的工程师也知道自家的 jamal 就是 路边一条,自己都不用是吧? 除此之外,新发布的这个 antigravity 二点零,看看这界面,这侧边栏,这交互模式,这整个外貌和 u i u 叉,这不妥妥的抄袭 codex 吗?但是功能又没有人家做的多,简直就是一个初级版的 codex。 好 在新版本的 jamila flash 三点五看起来还不错,速度挺快的,性价比也不差。 看来谷歌的算力还是很够的,不愧是基础设施最强大的 ai 公司。但是现在人家 open ai 和 astropik 正打得激烈,一个在拉高智能体的智能水平,一个在卷各种日常操作,但谷歌你就端了个这么东西出来, 所以这 jimmy 奶没人用不是也很正常吗?我也不是在这里说风凉话,我也是 jimmy 奶的老订阅用户,但我已经很久没有使用 jimmy 奶了。 问答水平比不上 gpt, 智能题水平比不上 cologne, 典型要啥没啥,但啥都有一点让大家记得, jamal 还是上次 nala bla 展现出来的水平, 但是现在人家 gpt 画图的水平很明显已经反超了呀,你这发布会就发布了个三点五, flash pro 也不知道长到哪去了。所以问题来了,到底是谁还在用 jamal?

我实在太后悔来谷歌 i o 二零二六了,因为我发现我过去很多事没干成的借口一个都没了。比如说我梦想是拍一部电影,放在过去想想就行了啊,剧本、拍摄、剪辑、配乐、宣发,每一部都能把人选对。所以以前很多梦想死的特别体面。不是我不想干,是条件不允许。 但这次谷歌 i o。 供下来,我有点尴尬,因为它好像在一层一层告诉你,条件不允许。句话,以后可能越来越不好用了, 你说你没预算,拍不了大片。好,新升级的 jimmy 现在可以先帮你把脑子里的画面画出来,你可以生成一段视频,还能继续对话修改这个人物,保留这个镜头,别动背景,换掉风格,换掉其他部分重新来。以前你要把一个画面画出来,得找人,找场地、找设备。现在第一步可能变成,你先把脑子里那个画面说清楚, 好画面有了,可你总不能变成,你先把脑子里那个画面说清楚,好画面有了,可你总不能变成了电动车,可还行。 这时候 flow 就 很关键,它不只是生成视频,而是让你开始控制镜头视角和连续性。比如你给他一张自行车图,他可以生成不同的角度。所以 flow 更像是 ai 时代的导演工作台。你不是只让 ai 给你一个结果,你 开始调度它,换机位,换角度,换景,别换节奏。好画面能动了,镜头也有了,可电影不能是末片吧,没有声音,所有高级感都得打五折。 以前配乐也很麻烦,要找版权翻曲库,找制作人,但 flow music 让我感觉音乐也开始变成可以对话修改的创作主键,你可以说,这里更燃一点,这里更梦幻一点,古典再重一点,更像科幻片。这就不是简单生成一首歌了, 而是 ai 开始帮你补上情绪。因为很多时候,一部片子真正让人起鸡皮疙瘩,不是画面本身,而是画面和音乐撞到一起的那一秒。 好预告片有了,配乐也有了,可你总得宣传吧?过去做宣发,又是另一套系统,广告公司、物料制作平台适配,听着就投的。 但 jamie 让我看到的是,广告也可能变成 ai 原声的。它不是提前拍好一条广告,让所有人看同一个版本,而是可以根据产品卖点、场景和上下文,生成更贴合当下内容环境的视频广告。换句话说,未来你做的不只是一条宣传片,而是一套可以不断变化的广告。表达 好宣传有了,那如果我还想做点电影衍生呢?比如互动官网、小型游戏,或者让观众提前探索的电影世界呢?放到过去,这基本是大 ip 才敢想的事。但 project jenny 开始把这个想象往前推了一步, 你可以移动,可以转视角,可以在里面走,最后连网站和界面也在变 flatter 这类 g i u i 的 方向,让我感觉未来界面可能不是写死的。 你要做电影官网、角色页、预约页、互动页面,它可能都能根据你的内容和用户意图动态生成。它不是在展示几个孤立的 ai 工具,它是在告诉你一个想法,从脑子里冒出来,到变成能看、能听、能传播,甚至能互动的作品。过去那些很贵很难卡点的环节,正在被 ai 一 点点打通, 这些看起来像魔法的东西背后其实是谷歌用模型平台和开发工具给开发者铺的一条更短的路。所以来了谷歌 i o 二零二六,我感觉自己以后不能再装怀才不遇了。而最后只剩下一个问题,我脑子里那个东西到底值不值得被做出来?

google i o 二零二六这次信息量真的很大。如果只用一句话总结, google 正在把 ai 从聊天机器人推进到搜索工作流、创作工具、系统界面甚至交易基础设施里。先看模型,这次最核心的是 gemini 三点五 flash 和 gemini on the flash。 gemini 三点五 flash 主打清量高效,但能力明显增强,尤其是编码 agent 和工具调用。 官方给到的重点是输出速度约快四倍上下文,达到一百万 token, 并且已经成为 gemini app 和 search ai mode 的 默认模型。 另外一个是 gemini omni flash, 它更偏多模态创作,从任意输入生成任意内容,尤其覆盖视频生成和编辑, 比如保留视频里的某一片段,只修改其他部分。这说明 google 正在把更强的小模型和更完整的多模态能力直接推到产品一线。第二部分是 gemini。 产品本身, gemini 做了全新设计,网页端和移动端都换上了新的蓝色渐变视角,工具入口也被合并进了一个加号模型选择器,新增了标准和扩展思维水平,设置里也能看到当前使用量和每周限额。 同时, ask max 和 ask youtube 开始支持自然语言对话,以后不只是搜关键词,而是可以直接问复杂问题。 ask youtube 还能给出视频概览、片段定位和连续追问。 dos lab 和 gemini lab 也在加强,边说边写。 gemini 自动整理文档,你说到一半改主意,它也能自动修正。 notebook lm 则可以生成电影级视频概览,还新增多种信息图风格,支持 epec 和导出 pptf。 也就是说, gemini 正在从聊天助手扩展成个人信息和内容处理入口。第三部分是 agent 系统, intigravity 二点零升级为独立桌面应用, cli 和 sdk 同步上线,还支持原声语音。 google 也宣布,在六月十八日后, gemini cli 和 gemini co 的 assist id 一 扩展,将停止对 pro 和 ultra 用户服务,开发者需要迁移到 intigravity cli 现场 demo 也很夸张,九十三个 sub agents 并行跑,十二小时内完成一点五万次模型请求处理,二十六亿 token, 总成本不到一千美元,搭建出一个可运行的操作系统。 还有 gemini spark, 一个云端七分之二十四运行的个人 ai agent, 可以 自动处理 docs、 gmail、 sheets、 slice 等任务。 android halo 则像是给 agent 准备的系统,己主界面能显示 spark 正在做什么,做到哪一步,是否需要确认这里的信号很明确, agent 不 再只是一个功能点,而是在变成完整的工作系统。 第四部分是视觉生成, google pics 变成 workspace 里的图像创作和编辑工具,支持局部修改图中文字编辑、多语言翻译,并且所有输出都会自动加 simid 水印。 内置是 google 的 ai ui 设计工具,可以实时语音写作,边说边改 ui, 还能导出代码,甚至直接发布到 notify, 并和 antigravity 打通。 google flow 继续升级创意工作室,接入 gemini omni, 可以 保留表演动作,只改变环境和特效,还支持十六段不同机位的视频生成,大规模场景修改。 full tools 和 full music since id 则是 google 的 ai 内容溯源技术,已经覆盖超过一千亿张图片和视频,以及六万年音频。 chrome 里右键或圈选搜索就能检查内容是否由 ai 生成。第五部分是 google 搜索。 ai 模拟越火已经突破十亿,而且上线以来每个季度查询量都翻一倍,底层模型也升级到了 gemini 三点五。 谷歌说这是二十五年来最大一次搜索升级,搜索框被重做,支持文本、图片、文件、视频等多模态输入。 b i 会帮你理解问题,补全真正想问的内容。 b i overviews 和 b i m o 会自然衔接,搜索结果页会变得更像对话式追问。 search agents 还能在后台长期盯任务,并主动推送结果。更关键的是, agent coding 进搜索 搜索可以实时搭建定制交互界面,比如直接生成一个能拖拽参数的可适化页面,背后由 anti gravity 驱动,让 gemini 三点五 flash 实时写代码、跑代码、回嵌结果,并且今年夏天对所有用户免费开放。 这意味着 search 正在从信息解锁入口,变成一个能理解、推理并执行任务的 ai 操作层。 第六部分是 agent 电商。 google 推出了 ucp, 也就是 universal commerce protocol, 被定位成 agent 电商时代的 http, shopify etc wafer、 target walmart 之外, amazon metacercast、 salesforce stripe 也加入了技术委员会。 还有 a p r agent payments protocol, 专门解决 agent 代买时的授权和风险问题。它有三道护栏,具体品牌、具体商品、支付金额上限。每笔交易都有可追溯、可防篡改的数字授权记录。 universal card 则可以跨 search、 gemini、 youtube 和 gmail 收集商品,自动找折扣、查价格、历史比对银行卡权益,还能补货提醒和跨商品兼容性检查。 这部分最有价值的不是单个购物车功能,而是 google 正在搭建 agent 加交易的底层协议和入口。 第七部分是硬件和科研。 android x 二智能眼镜继续推进,显示眼镜会继续扩大测试首款音频眼镜预计今年秋天发布。 gentle monster 和 warby parker 负责外观设计,三星负责硬件,并且支持 ios 和 android。 现场展示了导航点、咖啡拍照和卡通话处理等场景。 第八代 tpu 也来了, google 首次采用双芯片路线, tpu 八 t 用于训练, tpu 八 i 用于推理, tpu 八 t 原始算力接近上一代三倍, jackson pathways 可以 把训练扩展到全球超过一百万颗 tpu。 tpu 八癌则重点降低延迟,现场推理生成速度接近每秒一千五百。 tokyo ai 科研方面, gemini for science weathernext、 isometric labs 和 code mender 都有更新,分别指向科学发现、天气预报、 ai 制药和自动修复代码安全漏洞。最后总结一下,这次 google i o 二零二六释放的最大信号不是某一个产品更新,而是平台化 模型继续往前推, agent 成为新主线, search 和电商工具 x r t p u 和科研也都被纳入同一套 ai 平台里。 所以如果要给这场发布会找一个关键词,那就是 google 正在把 ai 从模型能力推进到产品界面、执行系统和商业基础设施。

hello, 朋友们,今天讲一下 google a s studio 怎么去调整节目的三点零 pro 的 参数,这里面的参数呢,具体会是什么含义?我推荐大家看到结束补充一下对 ai 模型的一些基础认知,用其他 ai 的 时候呢,也能够去快速上手。首先就是进入 google a s studio 的 网站, 我们选择 gemini 三 pro preview, 参数调整就在右侧,我们一个一个去看。第一个就是模型选择,这里可以去选择不同的模型,下面有详细介绍它的扩展消耗是怎么计算的。 这次我们选择就是 gemini 三 pro preview。 第二个呢, system instructions, 这个重点要讲一下,你可以把它理解成是在 ai 的 脑子里面去植入一个人设芯片, 通常呢是用来去定义角色的一个身份,语气输出格式,以及必须遵守的一个硬性规则,让他知道自己是谁,该怎么去说话,什么能做,什么不能去做。 那在这里设定好了 ai 的 人设以后,你就不需要每人对话都提醒他你是一个健身教练,就算后面你会去说你现在是个厨师, ai 坚持自己是一个健身教练, 也不会因为上下文太长忘记自己的身份,大概就是这样,但是这里的提示词啊,一定要记到精简。如果你去给 ai 一个几千字超级详细的人设,那么你后面聊天的时候每说一句话, ai 都要去先读一遍,这几千字的人设比较消耗。 token, 这个在 jamming 的 官网上也可以进行设置,对应的叫 get。 第三个是 api key, no api key 说明你现在用的是 google 提供的免费额度。第四个叫做 temperature 系统默认的温度是一啊, google 官方的开发者指南也提到使用 gmail 三,强烈建议是去保持默认值, 因为 gmail 三 pro 引入了叫 thinking 思维链的一个机制, ai 在 生成最终的答案前,内部有一套严密的逻辑推导路径。我尝试过将温度去调高,结果呢,输出的是一堆乱码,使用之前的版本也可以去调整温度,调低温度,你可以适合去做数学计算,代码生成等需要精确答案的任务。 调高温度呢,适合你去做多个不同的创业方案,比如说写故事,诗歌等艺术创作,还有头脑风暴阶段。第五个呢,是 media solution, 这个控制的是 ai 识别你上传的图片、 pdf 等内容的一个理解程度。选择 raw, ai 只能去识别基础内容,但是选择 media, ai 能识别上传文件的更多细节。 选择 high 呢, ai 能识别复杂内容,比如说像图片中的小字识别复杂的一个图标,但是 token 消耗量会非常大,如果你没有特殊要求,那就用 default 让 ai 自己去判断。第六个叫做 thinking level gemini 三 pro 具备了先思考后作答的能力,在回答前先在后台进行一连串的一个逻辑推理。 thinking level 呢,就是控制这个推理过程,要想多久,想多深的一个参数,遇到难题的时候调成 high, 可以 去深度推理,处理简单任务。调成 low, 可以 去节省时间和算力。这个默认是 high, 因为你既然用上了杰米兰三 pro, 那 就用 high, 看它到底有多聪明。 但是如果不涉及到复杂的数学代码或者逻辑的内容,日常闲聊,我还是建议你可以先设成肉,七个是 tools, 主要有几个,一个是 structured outputs, 让 ai 以特定的格式去输出内容,日常聊天写文不用开。如果你是开发者,那就需要去开启。 第二个 code execution, 让 ai 自己去运行代码来得出答案,涉及到计算数据处理的时候就开启, 提高回答准确率,因为纯元模型对这些方面的内容容易是算错的。日常聊天的时候,你的纯文本任务也不需要去开。第三个方形 colin, 让 ai 调用外部工具或者 api, 日常使用呢也不用开。第四个 ground in with google search。 开启。这个 ai 会实时去搜索最新信息,因为 gemite 三的训练数据是二五年的一月份。第五个 url context, 让 ai 读去链接的网页内容后再去回答。建议呢,也可以去开启。 最后一个是高级设置 safety settings, 这个开启 ai 就 会很保守,稍微敏感的一点的话题就会去拒绝回答。如果你关掉呢, ai 就 会比较敢说,但可能会输出争议的内容,默认你可以是去把它关闭的。第二个叫做 s stop sequence, 这什么意思?这个只可以去设定一个或者特定的词, ai 在 输出内容的时候,当看到有这个词的出现,它就会立即停止生成。你可以防止 ai 自言自语太久,或者防止它开始扮演用户的角色来说话,正常使用你可以不用去管。第三个叫做 up pause, 这个是 ai 回答的一个字数,上限 六五五三六头衔,相当于大约是数万个汉字或者几十页代码,已经是一个很大的数字了。 第四个叫套屁,这个控制 ai 回答的一个多样化和创造力,默认也是零点九五, ai 的 回答会更丰富,更像真人,更有创意。 如果是零点一呢? ai 的 回答就比较死板了,像机器人,但是很准确,适合法律解读这种。像 temperature、 套屁这些设置不只是 jamie 有 chat、 gpt、 cloud 等也都能看到。这些参数是 ai 大 元模型的通用设置,遵循相同的一个底层逻辑。 ok, 那 今天对于 jam 的 三 pro 各个参数的一个分析以及解释就在这里,如果大家感兴趣,或者说大家想学更多 ai 知识呢,也欢迎点赞、关注、收藏一下。

大家好,今天咱们来聊点硬核的,我们要直接切入一份极其犀利的行业观察,带你从一位资深开发者的视角深入八一八科技巨头谷歌在 ai 策略上究竟正在面临着怎样的一场信任危机。 抛开那些表面的产品 bug 不 谈,我们将客观的梳理这份尖锐的批评,看看这些代码和更新日期背后到底藏着什么深层落迹。说实话,这不仅仅是谷歌一家的阵痛,更是整个科居行业在 ai 狂飙时代的一个真实缩影。 咱们先来看看这个数字,五十三万七千。没错,这是居民 youtube 科技博主 at the sale 拥有的粉丝数。很多人可能会觉得,坐拥这么庞大的粉丝群,在圈子里肯定有绝对的话语权,想批评谁就批评谁。 但实际上呢?面对谷歌这样的科技巨无霸,他这次站出来公开发声,绝对不是为了蹭热度,而是实打实的冒着巨大的个人风险。 他自己也坦言其实心里挺害怕的,你想想,他的身家性命,也就是他最核心的生计来源,可全都绑在谷歌旗下的 youtube 平台上。要知道,在过去,谷歌确实曾经因为他批评某些产品,就对他的视频限流,甚至直接影响过他的收入。 在这个算法决定生死的时代,惹怒平台的母公司简直就是一种自杀行为。但他这次依然决定打破沉默,究竟是什么让他觉得这番话哪怕顶着被打压的压力也非说不可呢? 问题的核心就在于, ceo 认为这次的性质已经彻底变了,大家对早期 ai 产品的各种 bug 其实是相当宽容的,所以这根本不是谷歌又匆匆忙忙搞砸了一款 ai 产品这么简单。 真正让人倒吸一口凉气的,是,骨骼正在亲手摧毁开发者对他们仅存的那点信任。失去信任,对于一个高度依赖开发者生态构建起来的帝国来说,简直就是在掘自己的根基。那么让我们进入第一部分曾经的羁绊, 在风波彻底爆发之前,为什么开发者们还愿意留在这个生态里坚守呢? 其实信任这东西,从来不是因为巨头发布的产品第一天就完美无瑕,关键在于人。谷歌内部曾经有一批极其认真负责的开源倡导者,比如 dimitri、 jack 和 gal, 他们可没有高高在上的坐在办公室里发公关稿,而是真的扎进了最前线的开发者社区。他们会主动发私信帮你揪出代码里的错误,真心实意的接纳那种很尖锐的批评,还会耐着性子给大家解释产品的长远规划。 对于一线开发者来说,这种被真正倾听、被平等对待的感觉太珍贵了,他让你觉得你不仅只是个用户,你更是这个生态的合伙人。正是因为有了这种直接又透明的沟通, 开发者们当时心里是很有底的。只要大家还在互相倾听,互相反馈,大家就坚信像 jammin i c l i 这样的重点项目走来正确的路上,就算当下的版本有点糙,大家也愿意给时间,因为你每天都能看到它在变好。 这种人与人之间建立起来的信任,可以说是当时谷歌最硬的互层合。但是好景不长,我们来看看第二部分,一场失败的演示,这份辛辛苦苦攒下来的信任是怎么瞬间崩塌的? 转折点猝不及防地来了,在谷歌官方发布的 anti gravity 二点零演示视频里,发生了一件极其荒谬的事。 在一个本该代表谷歌最高技术水平的官方画面里,谢进的开发者竟然发现工作区里赫然躺着一个叫 codex 的 文件夹。稍微懂点行的人都知道,这可是竞争对手的核心产品名啊, 在这么重磅的官方发表会上,直接把竞争对手的痕迹漏出来,这种低级失误不仅让人大跌眼睛,更是让所有对这款产品抱有期待的开发者感到一阵挫恶。 面对这种级别的公关灾难,薛傲的评价可以说是一针见血,毫不留情。他直接开喷,你们抄的太明显了,甚至连掩饰视频里都藏不住。这句愤怒的话背后,其实是开发者深深的无力感和失望。 这种极其敷衍、完全不走心的发布,让大家深切地感受到,高层根本没有用心对待自己的核心产品。你想,如果一家公司连面向全球的门面功夫都懒得检查,谁还能指望他们去用心打磨底层的枯燥代码呢? 事情怎么会变成这样?这就引出了我们要聊的第三部分,内部政治。所有的矛头最终都指向了谷歌那糟糕的内部动态。 谷歌当下的内部权力交接,可以说是充满了令人心寒的戏剧性。为了在 ai 竞赛里弯道超车,高层走了一条捷径,直接花重金把买来的微软创始人空降到 anti gravity 项目里。不仅如此,还给了他们绝对的控制权。 可代价是什么?代价就是那些常年扎根社区,像 dimitri 和 jack 那 样一点一滴为谷歌攒下口碑的实干家,被无情的边缘化了。 这种为 kpi 论和空降高管主导的戏码传递了一个极其危险的信号,扎实作实的人得不到重用,搞资本运作的反而成了老大。这种劣币驱逐良币的操作,直接点燃了开发这群体最强烈的怒火。 而且这份跑习还指出了一个更让人窒息的系统性顽疾。现在的谷歌仿佛中了一个魔咒,每当有个团队历经千辛万苦,眼看着要把一个有潜力的项目做成了核心人员,往往就被内耗逼走了。 或者呢,这个项目会因为各种复杂的部门利益博弈,直接被生硬的塞给另一个完全不懂行的政治派系。似乎没有任何一个实干团队,被允许在一个不打扰的环境里,踏踏实实的把一件产品打磨到底, 所有的心血最后全变成了别人履历上的筹码。这也就引出了我们今天的第四部分资源的筹码,这也就引出了我们今天的第四部分资源的诅咒。一个什么偏偏就做不好产品了呢? 咱们平心而论,看看谷歌手里攥着的这把牌,世界上最具深度的 ai 基础模型, 深不见底的资金储备,强大到傲视群雄的 tpu 算力集群,常年霸榜的顶尖研究团队,外加覆盖全球几十亿用户的生态, 不管是钱、硬件还是技术,他们都是当之无愧的巨无霸,手里拿着初创公司做梦都不敢想的所有王炸。 然而,就是这样一个坐拥天下资源的帝国,却换来了 feel。 最悲哀的一句评价,谷歌已经失去了在乎产品的能力。这句话特别炸心,为什么呢?因为这根本不是说谷歌的高管儿主观上不想把产品做好,谁不想赢啊,对吧? 可怕的是,那种庞大臃肿、到处充斥的 kpi 考核和跨部门内耗的官僚体制,导致他们从系统底层已经无法去真正在乎。一个禅变了,做个决策要层层审批,搞个创新要平衡各种利益。在这里,体制的僵化彻底彻底地战胜了创新的意愿? 这就完美解释了为什么现在开发者生态里正在上演一场奇特的大迁徙。 ceo 就 直言不讳地说,作为一个多年的谷歌生态开发者,他现在居然更愿意把信任票投给像科 sir 这样的初创工具。 原因其实极其纯粹,哪怕科 sir 的 算力和资金连谷歌的九牛一毛都算不上,但人家展现出了一家真正懂开发者痛点,真正在乎每次代码提交体验的姿态。反观拿着一手好牌的谷歌,却总是交出不及格的答卷。 开发者们离开,不是因为你不够强,而是因为你不再用心了。所以最后这就留下了一个极其讽刺但也无比现实的问题, 当一个科技巨头垄断了世界上最顶级的资源、最聪明的人才时,为什么他反而净生生地把那些曾经最愿意为他彻夜写代码、最愿意支持他的开发者们推到了对立面? 这到底是巨头无可救药的傲慢,是庞大体制必然的僵化,还是大企业逃不掉的宿命。在 ai 技术狂飙突进的今天,失去了开发者,是不是就等于交出了未来的门票?这个问题值得咱们每一个人好好琢磨琢磨。 感谢收看今天的深度解析,希望能为你观察 ai 行业的变局提供一点不一样的视角,我们下期再见!

昨晚看完了 google i o 大 会啊,有惊喜,也有令人感到费解的地方。毛总呢,就用这一条视频,带你纵观 ai 界的科技。春晚到底发布了什么? hello, show line and hello to everyone watching from around the world。 那 众所周知啊,过去这半年, ai 圈的主角基本不是 google。 一博到那之后啊, google 已经好久没有封神之作了。而 openai 和 cloud 呢,一直在抢节奏,咱们国内还有一堆视频模型在狂卷,而 google 就 好像一直没太有动静。但你要真的熟悉 google, 会知道它经常是这个节奏,平时看起来呢,慢半拍。到了 i o 大 会啊,一口气把攒的东西全倒出来。 这次也是。首先这场发布会最重要的就是发布了 german 三点五 flash。 但我呢,就不太关心 german 三点五 flash 的 排名是多少,也不关心它四倍速度的性能。真正值得跟大家聊的是, google 终于开始把 ai 从聊天框里拖出来,塞回它最擅长的地方。你,比如搜索地图、优香文档、 youtube 浏览器 以及安卓系统,这才是 google 最可怕的地方。那 google 搜索迎来二五年最大改版,以前搜索呢,是输入关键词找网页。现在你可以输入一整段需求,甚至用图片、视频文件、 chrome 标签页做输入。更关键的是,设置 a 阵,可以二十四小时帮你盯信息,比如租房、价格、球鞋发售服务预定。 搜索正在从找答案变成替你推进任务。很多工作作业是先做一个超级聪明的 app, 然后想办法让你天天打开它。而 google 不 一样, google 手机里本来就有一堆你每天不得不用的入口,你要查东西,就要用 google 搜索,你要看视频,就要上 youtube, 你 要导航,就要打开 maps, 在 你的手机里还有安卓系统。 所以这次杰木奈给我的感觉不是在说,你赶紧来用杰木奈吧,而是杰木奈会出现在你经过的每一个地方。这点就挺有意思。 姑姑说这是搜索框二五年来最大的一次升级,我觉得这个说法不算夸张。那过去搜索是什么?你输入关键词,姑姑给你网页,你自己点,自己看,自己筛选,自己判断。而现在它变成了什么,你丢给他一个复杂任务,那他要先理解,再拆解,然后再帮你查,最后再持续跟踪,甚至生成一个临时界面给你用, 就不太像搜索了,这更像一个任务入口。那我甚至觉得, google 这次真正想守住的不是搜索市场,而是发掘出 ai 真正的入口。你今天想订餐、想买票、想查房子,想做旅行攻略,想对比产品,想写一个方案。有些事情的第一步, 以前可能是打开搜索框,那未来 google 希望这第一步还是它,只不过搜索框后面不再只是网页,而是一整套 a 阵在替你行动啊。当然呢,这点跟我们国内的安卓用户暂时关系确实也不大,但我们依然能管中窥豹,看到一些 ai 生态的雏形。 当然,除此之外,这次大会好像也没有其他特别值得回味的点。比如 german 欧米尼发布前期待很高,听起来像是任何输入就能生成任何东西。当然这个概念很漂亮,尤其对短视频、 ai、 漫剧、广告、分镜这些人来说,想象空间很大。但从目前一些体验反馈来看,看起来就是一个视频编辑模型, 能融合很多元素改变视频的内容,那这点在视频模型里已经不是新鲜的东西,而且整体生成的效果跟 cds 二点零还有着不小的差距。但我看中文科技圈好像都在夸这个有多强,这点我觉得多少有点莫名其妙的尬吹了。 那还有 google 的 智能眼镜,从现场演示的场景来看,智能眼镜已经可以实现自动搜索并且支付下单。一杯咖啡只是展示了基于安卓系统下和一起组成了 google a 阵能力的新入口。 当然 google 最大的优势真的就是入口和场景能力。那在国内我能想到的最佳场景,像是在微信这样的 app 里,有社交,有搜索,有视频号的短视频内容,还有公众号的深度内容,那如果再有 ai 加持,传统搜索和电商的格局就会发生巨大的改变。 但这一切还要基于有一个折磨的这样的聪明大脑。那国产模型要继续加油了,期待我们也能拥有真正的智能生活。

今天给大家分享一点干货,什么是谷歌独立站?这个呢是我在 grog 上面给大家找到的一个关于谷歌独立站的一个解读。 好,谷歌独立站是什么呢?是中国的跨境电商和外贸圈的一个行业俗语,不是官方的术语, 而是从业者自然形成的一个叫法。这个 grog 已经非常好地把这个 谷歌独立站这个词啊进行了一个总结,然后它拆解了以后是什么呢?谷歌指的是就是 google 搜索引擎和广告体系,然后独立站呢,是自己的自建站的 independent website, 然后呢, 他是把它是依靠什么呢?依靠谷歌的流量,然后再加上自建站的一个品牌啊,组合在一起的。这个不是一任何一个官方的说法,然后我们用马六斯做了一个报告,然后呢这个报告大家可以看一下, 谷歌独立站这一说法并非指由谷歌公司直接创建或者运营的网站,而是指什么呢? 拥有独立域名、服务器和网站程序,且主要的流量。还有呢,运营策略来源于依赖于谷歌的搜索引擎的这种独立网站,所以它其实是一个模糊的一个概念,而不是任何一个官方的一个说法。 好吧,那么有很多的人,特别是刚开始做外贸的人,他觉得啊,我开始做谷歌独立站了这个东西,大家觉得这个说法准确吗?欢迎大家在评论区和我一起讨论。

跨境电商独立站上线一个月了,谷歌搜索域名都找不到,别着急的买流量,你可能连搜索引擎的名片都没有给定,这 张名片呢,就是独立站 su 的 地基叫做站点地图,也就叫 set map。 通俗点讲呢, set map 就是 一个 xml 格式的文档,它不是给用户看的,而是给谷歌的蜘蛛专门准备的,它详细标记了你全站的 url, 产品更新频率和权重优先级没有它呢,谷歌蜘蛛抓去你的页面的时候,就像进了迷宫一样,那谷歌搜入的 速度自然就慢了。为什么二零二六年它比以前更重要呢?因为现在是 g e o 就是 深层式引擎优化时代,涉及 g b t 或者是 jamming 这种 ai 搜索引擎,抓取数据极度地依赖结构化信息。 setmap 做好了就是在给大模型喂精粮,据优优化呢,做得好,你的产品才能在 ai 答案里面优先被推荐。避坑警告就是很多人会把测试液啊残留液也塞进地图里面,这会严重的分散蜘蛛的注意力,不仅不能加速收入,还会拉低你站点的权重。想知道如何生成一个满分的地图吗?在浏览器里面输入你的域名,加上 setmap xml, 能够打开的话,在评论区扣站点地图,我发一份独立站 seo 避坑清单给你。

今天凌晨, google i o 二零二六正式开幕,信息量巨大,我帮大家划重点。首先是两个新模型, gmail, 一 款说是什么都能输入、什么都能输出的视频模型,你在纸上画个圈,写句话,它就能直接生成特效视频, 不满意还能一句话精准修改。另一个是 gemini, 三点五 flash, 速度比同类模型快四倍, google 用它十二小时就造出了一个操作系统内核成本还不到一千美元。 其次是 ai 智能体 gemini spark, 它运行在云端,关掉手机电脑,也能在后台帮你处理邮件、管理日程,跨应用执行任务,是真正的全天候 ai 助手。 硬件方面, google 带来了搭载摄像头的 ai 眼镜,今年秋季发布,戴上它说一句话,手机上的 gmail 就 能自动帮你下单查信息。不过这些高级功能基本都需要付费订阅。 google 的 信号很明确, ai 时代,免费午餐正在减少,付费 ai 可能会像手机套餐一样,成为生活中的刚需。以上就是本次 googleio 的 核心看点,我们下期见。

兄弟们,酷狗大格局啊!酷狗被子这次更新直接把 ai 视频创作免费的送给了所有人,一起来看看它到底更新了什么吧!第一, v u 三点一高质量视频生成,所有人能够完全免费使用,不用订阅就能够直接生成高清视频,这波白嫖属实是太香了。第二, larry。 三, ai 自动配乐,虽然是 pro ultra 或者说是 work space 用户专享, 根据画面风格生成原创的音乐,从三十秒的短视频到完整的三分钟 bgm, 全程跟视频节奏完美同步。 第三, ai 头像全面进化,但同样是针对付费用户,不再是死板的说话头,现在能够跟上传的物体互动,比如拿着产品演示,放进自定义的场景,随便更换衣服,换背景,人物语音和身份全程保持一致。第四, chrome 扩展新功能,一键屏幕录制,录制完之后能够直接拖进 bios 编辑,最后还能一个一键直达 youtube 呢, 流程全在浏览器里面搞定,而且是零门槛,普通人现在真的是能够在几分钟内利用 ai 生成视频加原创配乐的专业内容了。视频编辑门槛被酷狗一脚踹平,你们要去试试吗?关注我,一起在 ai 时代进步!