a i。 视频生成的王炸 v o 四很快就要发布了,据说是五月二十号,而且呢,融合了纳诺不纳呢啊,手里边一千万年筐签的 c d s。 二点零,经受住上次 happy house 的 考验, 据说是为了应对上次的 happy house 的 发布,给我们准备了 c d s。 二点五,但是 happy house 完全不能打,就看这次 v o 能不能打了,如果 v o 能打,很有可能我们就拿到了 c d s。 二点五。
粉丝5.6万获赞24.2万

凌晨一点,谷歌总算发布了 vivo 四模型,这是继 open ai 把 sorry 关停掉,马爸爸的 happy house 彻底拉完以后,总算可以真正能够跟自己的 c 档四二点零硬掰手腕的视频大模型。先看一下对比视频,如果你想要买真正的驼奶粉, 就买风车牧场的这款有机驼奶粉,它来自新疆伊犁的将军谷,通过了五百七十项农残。要怎么样,至少我认为现在两个模型可以五五开了。我相信自己迟迟没发布的 c 档四二点五,因为有 vivo 四的压力,会很快的发布,咱们拭目以待啊。 果然市场是需要充分竞争的,火力全开吧,打得越惨烈越好。现在 c 档三点零一家独大的日子总算结束了,天下苦二点零九蚁。

一分钟掌握今日全球 ai 圈大事!一、 sorry 已死,谷歌当立!谷歌 i o 大 会开幕在即, vivo 四提前曝光视频版 banana 封神! 无论最终叫 vivo 四还是 gemini omni, 这次泄露已足够震撼,绝不仅仅是参数的微调,更像是一场关于蓄势权的底层革命。谷歌 i o 当天答案即将揭晓,而整个行业将重新洗牌。二、全球最强 ai 猛兽要出笼了! 被 anthropic 视为太危险的绝密大模型 my thoughts 尽在谷歌云悄悄解禁, cmu 最新实测爆出他在真实漏洞公房中断层碾压 gpt 五点五 三作为唯一一家长期公开自己聊天模型 system prompt 的 头部 ai 实验室, anthropic 记出 cloud 四点七的同时,照例公开了 cloud 四点七的讯话手册,也就是那份系统提示词,暴露了 cloud 隐藏的二十三个工具,包含信息获取、文件操作、生活服务、社交通讯记忆与上下文平台连接、交互辅助、交互辅助、交互辅助八大场景。

视频生成领域即将迎来大的一个地震啊!谷歌 v u 四今晚正式发布,三大核心功能曝光, 多机位的电影级运镜自动生成,九秒的七二零 p 的 多场景镜头切换呢,媲美真人导演的一个运镜效果啊! 生化同步,自带环境音效, ai 生成 bgm 角色的口型呢,也能精准匹配。那字节跳动呢,也准备同步推出 c 弹词二点一的一个版本, 生成质量呢,能提高百分之二十左右。两大巨头呢,转期发布啊,那 c 单词目前呢,是垄断了百分之八十的 ai 视频生成的一个市场,价格呢,也一涨再涨,不知道这一次谷歌的 v u 四能否抗衡一二呢?

北京时间今天凌晨,刚刚结束的谷歌 i o 大 会上,谷歌发布了多款极具颠覆性的产品。大会一开场,谷歌蒂姆曼创始人,也是诺贝尔奖得主哈萨比斯就宣布谷歌最新多媒体模型 jamna omni 来了。 jamna omni 是 一个很懂物理学的世界模型, 给一段原始视频,它就能直接改变环境视角。由于它能很好的理解物理世界的运作规律,因此能让 ai 生成的视频内容完美的符合重力以及动能规律。 紧接着,谷歌 ceo 劈柴就带来了专为智能体运作设计的模型 jimmy 三点五 flash, 它在编程和现实世界任务解决能力上都有大幅提升。模型的速度速度极快,能达到同类前沿模型的四倍,且成本极低。 为了应对越来越难识破的高质量 ai 深度伪造视频,谷歌在三年前就开始悄悄为超过一千亿张 ai 图像和视频打上了不可见的水印,以便能轻易识别内容是否为 ai 生成。谷歌本次宣布全面开放这个内容验证的能力,不论在 gemini 或者 chrome 浏览器,都能使用这个功能辨别内容是否是 ai 生成的。 硬件层面,谷歌联合三星打造了一款智能音频眼镜,安卓 s r 预计今年秋季就要发售。除此之外,为了应对越来越频繁出现的极端天气,谷歌开发的全球天气预报 ai 模型 weather next, 它能够精准模拟预测极端复杂的动态天气系统。 相比传统天气预报系统,它的预测速度更快,准确率也更高。从懂物理规律的世界模型,再到贴在耳边的 ai 眼镜,谷歌不只是在发产品,而是想把整个世界重塑成一个巨大的智能体网路。

天呐,科技圈又有大事情了!就在今天凌晨,谷歌直接掀了桌子,他们发布了 gemini 三五 flash 模型。这不仅仅是一次更新,这是谷歌向全世界扔下的一颗超级核弹, 它比对手快四倍,成本低到尘埃里。最关键的是,它免费了。别眨眼,这玩意能干的事,可能会彻底颠覆你对人工智能的认知。以前的 ai, 你 问他话,他得思考两秒,像个老学究。 现在的 gemini 三点五 flash, 每秒输出两百八十九个 token, 这是什么概念?它的速度是 gpt 五点五和 cloud opus 四点七的整整四倍。你话音刚落,它答案都写完了。 这种零延迟的快感,就像从拨号上网直接穿越到了五 g 时代,丝滑到让你觉得以前的 ai 都是帕金森。最炸裂的功能来了,多模态编辑。以前你想剪个视频,得学 p r a e 头发掉光。现在你只需要对着屏幕说,把这段视频里那只狗换成猫,背景音乐换成摇滚, 它搞定。无论是文本、图像、音频还是视频,它全都能听懂并直接修改。这哪里是 ai? 这简直是把你脑子里的画面直接具象化的神笔马良。谷歌这次为什么敢免费?因为技术太狠了。他们用了蒸馏加稀疏化技术, 就像是把一头大象压缩进了一只蚊子的身体里,体积小了,但力气一点没减,这让它的运行成本比主流竞品低了十五到二十倍。成本低到谷歌根本不在乎这点电费, 他们要的是让全世界都上瘾。谷歌不止想要一个聊天机器人,他们想要的是 germany spark, 一个全天候的 ai 代理,他能帮你回邮件、管账单,甚至代表你去买东西。未来的场景是,你还没醒, 你的 ai 管家已经帮你处理了五十封邮件,订好了早饭,甚至帮你抢到了演唱会的票。谷歌这一招免费加极速, 直接给 open vi 和 anthropic 来了个釜底抽薪。当最顶级的 ai 变成像空气和水一样免费的基础设施时,真正的战争才刚刚开始。对于咱们普通人来说,这绝对是天大的好事。以后拼的不是谁有 ai, 而是谁会用 ai。

就在刚刚五月二十号凌晨一点的时候,谷歌的开发者大会正式的开始直播,那肯定有很多朋友没有看这个直播,我只能说各位真是有先见之明,整个直播时长有两个多小时, 又臭又长,直接给我看历劫了。信息密度呢可以说是非常的小,就是发布了一个全新的模型三点五 flash, 其余的其他功能呢都是接入的这个模型,各种乱七八糟,内容呢都加了在一起,大会的后半段呢,直接变成了现场直播带货,我看完就是一句话,真是闹闹又麻麻 闹马。我们首先看一下大会的第一个部分,就是 gmail 模型家族,整场都在讲这个, gmail ai 发布了 gmail 三点五 flash, 它的定位呢是前沿智能模型和 agent 执行力合二为一的旗舰快速模型,头跟的输出速度呢是其他旗舰模型的四倍, 非常的夸张,而且在编程 agent 的 多模态基础上,超过了 gmail 三点一 pro 就是 一个 flash 模型,超过了三点一 pro 模型,这个就意味着这次模型呢是小而快,听起来非常的不错, 但是我不禁要问,那么代价是什么?没错,它的价格也赶上了 pro, 上一代的 pro 模型呢,每输入百万, token 呢是二美元,输出是十二美元。这次的三点五 flash, 它的输入是一点五美元,输出是九美元, 其实非常接近了,在他们直播中有这样一张图,说是用了九十三个 agent, 输出了二十六亿的 token, 总共金额小于一千美元啊,我先保持一下质疑, 这次价格涨的确实有点多,这还只是 flash 模型三点五 pro 呢,预计在下个月,也就是六月上线,那你想想吧,那个价格肯定会更高呀。那第二个呢,就是 jimmy 欧姆尼全新系列,目前用的也是三点五模型,核心定位呢是推理能力加创作能力融合首发的 jimmy 欧姆尼 flash 接受图片、音频、视频文本的输入,也可以输出生成视频,还可以创建我们自己的声音生成的视频呢,让他说话的声音就是我们自己的。 你可以理解为把视频生成模型,图片生成模型全都融到了一块,缝合怪奇美拉。另外顺带一提,它的内容检测能力呢,从 jimmy nike 的 app 版扩展到了搜索和谷歌浏览器中,也就是说,当你看到一个图片,你不知道它的真伪,那么你可以把这张图片发给他,问问他是否由 ai 生成 它可以进行判定。这个怎么说呢,就我体感下来,其他的生成模型我都能认出它是 ai, 唯独 g p t 的 那个确实是有点真假难分,你不会针对的 g p t 吧?那山姆就有话说了,你不是我的兄弟,你是个路人。 接下来就是重头戏,谷歌的 a i d e 反重力二点零上线了,全新独立的设计啊,真是不愧是谷歌啊。从这个设计页面上呢,我就看到了无数个神支持了 doa 盾,并且速度非常的快,而且如果你是新开通的,或者以前就是 o 叉用户,还会送你 一百套的额度,那去领吧。什么意思?下一个更新的是全新的设计语言,几乎是全平台桌面版、手机版以及网页端都进行了更新,变得非常优雅,动画非常丝滑,同时引用了全新的字体,不过对于阅读中文来说好像不是特别方便, 只是阅读英文的时候看起来确实很优雅。每天的额度呢,也改成了卡尔的那种限额五小时刷新,直到达到周限额 结束了,也就是说,如果你是 pro 用户,可能用一会就没有了这个额度。下一个 jimmy spark, 二十四小时全天候, agent 直接运行在云端,在手机上,电脑上拿起来就直接控制它使 用的模型呢是 jimmy, 三点五,可以实时监控我们的信用卡账单,追踪邮件,自动整理笔记,制作文档。这个几乎就是一个 agent 的 平台的标配了,它本身就是一个超级 mcp 客户端,接的非常多。这个时候可能有朋友说了,哎,这个不是小龙虾吗?是吗? 目前这个我们用不了,你是 plus 用户, pro 用户都用不了,你必须得是 air ultra 用户。二百五十美啊,不对,现在降价了,是二百美元一个月。但是这个计划对我个人吸引力不是特别大,再下去沉淀沉淀吧,我们看下一个谷歌搜索 三十年以来最大的更新,在二五年年底的时候呢,谷歌浏览器就推出了 ai 模式,那现在呢?把这个 ai 的 模型换成了 gmail。 三点五, 我们输入的越长,搜索框越会主动的进行扩展,因为它是内置在浏览器上,主要还是为了搜索嘛。当你一个很简单的问题,他就会给你回复很短的内容,但是当你长篇大论的跟他讨论的时候,他就会开始进行深度思考 啊。 deep think, 也就说类似可绕的那种,判断你的意图,以及你这个问题的复杂程度,他自己来决定给你回复多少。另外这样一个浏览器也有 agent 了,二十四小时全天监控。我们提一个问题, agent 在 后台跨博克新闻社媒以及谷歌的实时数据 持续监控,也就说你可以让他实时帮你监控一些内容。那这个监控的功能呢?我个人认为可以用在理财的方面,比如说黄金的金价,实时给你追踪一些股票的价格,实时的给你发送。 不过这个功能呢,暂未发布,夏季向 ai pro 凹叉用户开放下一个 mini app。 这个功能是在我们搜索的时候,那一个非常长的任务,它会自动给我们生成看板,或者是生成网页,生成一个小应用,我们可以直接快速的跟它交互,那比如说我问一个太阳 长什么样子,那它呢?就会生成一个类似网页,或者是一个三 d 的, 我们可交互,可以拖动旋转。这个太阳演示看下来呢,还是非常有意思的,但是仍未发布, 发布时间是未来几个月。 ai pro ultra 美国地区的用户可以使用,也就说你不在美国,或者你是免费用户,那么你都是用不了的,太可恶了,他不是我们的兄弟,他是路,厉害。最后还有几个我快速给大家过一下,因为我个人感觉非常的无聊,一个是全网通用购物车, 让 ai 帮我们去购物,去比价美国豆包啊,真是实至名归啊。还有一个呢,是给油管准备的 ask youtube, 可以 直接处理复杂的查询和后续的追问,其实跟 grog 差不多, grog 呢,是可以读取 x 平台的所有推文,那这个 youtube 呢,自然是可以读取油管上的所有视频,以结构化交互形式呈现。这个呢,现在已经可以用了,局限于 youtube 会员的美国用户啊,注意你得是会员哦。 最后呢,就是他们的带货环节,首先是他们的安卓 x r 啊,智能眼镜,想当年我也买了一个小米的异样眼镜,老傻了。我 目前呢是两个版本,一个是带屏幕的,一个不带屏幕的,只不过带屏幕的还没有发,各位感兴趣可以去看一看。大概 就这么多内容,如果各位非常闲的话也可以去看看。这个直播还是蛮催眠的。那以上呢,就是本期视频的全部内容了,如果你对上述我们提到的这些内容某 某一部分你感兴趣,可以在弹幕里留言,我们可能会单独出一些视频来测试,或者是解读一下。各位记得点赞,不点赞的话你就不是我的兄。 ok, 最后祝各位玩的愉快,我是段峰,我们下期再见!拜拜!

今年谷歌 i o 大 会有哪些看点?对国内的产业又有哪些影响?我们一个视频说清楚。首先是 token 方面,到了二零二六年,现在的月度处理量已经飙到了三千两百 t, 单平台的 token 日处理量都超过一百 t 了, e p i 每分钟处理一百九十一亿 token, 这个消耗速度确实是有点吓人。顺着这个 token 的 消耗,它们模型的迭代也挺有意思。这次发布的是 jimmy 三点五的中监态系列产品, 偏推理方向,那个 gemini 三点五 flash 版本的性能直接超越了三点一 pro, 速度比其他 sota 模型快了四倍。然后 gemini 三点五 pro 预计是在二零二六年六月发布,听说是要在 coding 和 coding agent 领域有比较强的加强。 还有一个很关键的动作就是谷歌首次在推进 world model, 也就是世界模型。紧接着他们还发布了原生全固态模型 gemini omni, 整合了图像、视频还有世界模型这些技术。这可以说是谷歌 ai 体系的核心,贯穿系统。说白了,这就标志着谷歌的 ai 愿景正在从组织全球信息转向模拟并代理物理世界。说到代理, 他们这次明显在聚焦 code agent 和 agent 的 生态。谷歌推出了一个叫 universal commerce protocol, 也就是 u c p 的 协议,摆明了是对标 andropic 的 m c p 协议。然后他们还发布了一个 agent 产品,叫 spa r k, 这个东西可以在谷歌云上七成二十四小时运行,目前它只支持谷歌自有的工具, 不过后续也会接入第三方工具。整体看下来,未来的 agent 将会把搜索引擎从一个单纯的信息入口,直接升级成交易和任务的执行平台。 你看,在搜索和电商业务的升级上,这个逻辑就体现得很明显。搜索端那边,他们推出了由 gemini 三点五驱动的 ai overviews 智能搜索框,支持上传图文和视频,还能开启对话式搜索, 甚至还能代替用户去和商家沟通。这种主动代理功能,电商端也是个大动作,他们推出了 universal cart, 也就是通用购物车,能支持跨平台的商品聚合、 ai 自动追踪、降价,还有补货提醒这些 a 政功能。其实前面提到的那个 u c p 协议,已经接入了 shopify 等主流平台,甚至还支持酒店预定等服务。 他把 a p i 支付协议打通了,用户可以通过 agent 进行有限额的信用卡消费,基本上就把发现、决策到支付的全链路闭环给做成了硬件和端测。他们也没落下,这次宣布了和三星合作, 基于交通平台去开发 ai 眼镜,这里面的产品包含了带显示功能和语音交互的两类。就在二零二六年秋天,他们会先推出语音交互款,功能上支持听音乐、拍照、通话以及调用手机 app 等, 未来还会继续向 ar 智能眼镜的方向去发展。当然,这背后全靠算力在撑着。谷歌此前已经公告过,二零二六年的资本开支是在一千八百到一千九百亿美金,它们第八代 tpu 的 算力比前一代直接提升了三倍。这次第八代 tpu 分 成了两款,一款是八 t 训练芯片, 专门用于大规模预训练,支持跨数据中心训练,能完成超百万卡集群的部署。光模块标配一点六 t, 另一款是八 i 推理芯片,这是谷歌历史上首款推理专用的芯片,特别强调低延时,最大能支持一千一百五十二张八 i 芯片的集群互联。而且你会发现 谷歌的 tpu 正在从自用转向外公。他们和黑石成立了 e t u cloud 的 合作公司,黑石出使就投入了五十亿美元, 目标是在二零二七年上线五百兆瓦的数据中心容量,来提供谷歌的 tpu 算力服务,整个投资预计会达到两百五十亿美元。关于 tpu 的 出货量,预期他们二零二五年出货量还不到两百万张,二零二六年预计就会有大约四百万张, 二零二七年预计能达到一千万张,到了二零二八年预计会达到两千万到三千万张。既然芯片出货量上去了,集群和网络架构肯定也得跟着升级。它们的最小 pod 的 计算单元提到了九千六百张卡,同时还首次推出了可以商用的 scale out 网络, 最大支持三万四千四百张卡的集群训练。这么一来,光模块的用量就大幅提升了,训练端和推理端都在加单,同时 ocs 交换器的用量也在提升, 训练端和推理端都有明显的增配需求。聊到这,咱们来看看整个产业链上那些正在受益的公司。光模块产业链这边,你可以重点看看谷歌的光模块供应商, 像中际旭创、力迅精密、联特科技,还有美股的 f i n i s a r。 上游的光芯片供应商里面有原结科技的厂商,比如光库科技、德克利福金科技、藤井科技、 海泰星光也都值得留意。再往深了看,半导体产业链的变化也很大。 t p u 制造相关的有台积电,他们负责了 t p u 的 全部流片和 koloss 封装。还有博通 作为 t p u 核心设计供应商,和谷歌签订了长期协议,一直到二零三一年,同时还供应数据中心网络组建。联发科也参与了部分的 t p u 设计。存储相关的有美光、海力士、三星, 随着 tpu 出货和 token 消耗的增长,它们 hbm 和 dram 的 需求都在跟进。而且随着视频和图片生成以及 agent 任务结果的存储需求增长, enfinash 的 需求也在动。 pcb 相关的有沪电股份、深南电路、彭鼎控股、圣虹科技、广核科技、东山精密,它们都是 tpu 回到 gpu 主板的核心供应商。服务器和交换机组装这边有天弘科技,负责服务器和交换机组装,力迅精密和东山精密则负责光模块组装。 甚至连数据中心基建产业链都在变。受这种百万卡集群和跨数据中心合作需求的影响, d c i 也就是数据中心互联的前景挺广阔的,像诺基亚电力企业,还有数据中心厂商都卷在里面。最后就是应用端产业链了, ai 营销里面有一点,天下、汇量科技、蓝色光标, ai 电商里面有值得买。焦点科技,视频深层领域则有中文在线、昆仑万维这些,大家伙都在跟着。

谷歌即将推出的 vivo 四,居然号称吊打 solo 二,对于用 ai 做内容的商家来说,这个不是八卦,这是你能不能抓住下一波内容产的情报。我们先看现在的 vivo 三点一和 solo 二的对比,毫无疑问,那一定是 solo 二要更强。 solo 二能够生成更长更具有电影感的片段, 而且可以做到十五到二十五秒,物理感更真实,音画同步更强,连对话都更贴嘴型。但 vivo 三点一这边呢?八秒钟就到头,镜头一切换,人物可能就会变形,提示词的遵守度偶尔也会摆烂。自从 siri 问世, 很多人说 vivo 三点一的真实感和物理感已经开始过时了。还有人吐槽谷歌的体量太大,不够灵活。但最近 vivo 四的内部测试传闻一直在往外冒, 店内消息有人说在本月底会发布,还有匿名爆料,直接喊话会远超骚扰,但消息来源好像都不太靠谱。所以今天我们把所有泄露的功能全都扒出来,看一下新的 vivo 四的传闻到底强在哪,有可能对我们会有什么帮助。首先,第一个,十五到三十五秒长片段的生成,这是大家最期待的升级。 vivo 三点一目前只有八秒,如果 vivo 四真的推到十五到三十秒追上或者超过骚扰啊,那它就从镜头生成器变成了广告生成器。八秒钟讲不了故事,讲不了卖点、猎物,但三十秒足够你跑完开头的钩子到上升,展示细节特写,对比,成交一整段文案。第二, 多机位多角度同时生成,输入一次提示词,同一个场景直接给你多个机位的角度,全身半身细节走到侧面走动,对影视人来说是更便捷,对服装人来说太重要了,这叫一件衣服一次生成,直接拿到完整的可剪辑素材包, 它的难度也很高。同一时刻的空间关系,光线、人物的一致性以及多个视角都正确的一个产品。一致性对于 ai 生成来说是非常困难的,做的好,这是一个核弹,做不好,那就完全是一个血统。第三,生成过程中实时编辑。 传闻说 vivo 四能让你生成的时候就直接改镜头,调整光线,实时预览,从生成后的祈祷变成现场的共创。 如果说真的能做到这一点,那你迭代的效率会直接起飞,不用等它生成完了,渲染完了之后发现错了再重新来,而是边生成边把方向直接掰回来。但我也直说,这应该不太现实,因为这对算力、延迟、预览的质量以及交互页面的要求都非常高,更像是后面的 v 六甚至 v 七才有可能出现的能力。 只是关于这个的传闻比较多,所以我们必须列出来。然后第四,就是声音克隆,加头像以及人物的插入。比如说跟 solo 二一样,把你自己的形象放到视频里面,上传一张脸或者说一段视频,然后再给出一段声音样本,你就能以虚拟的自己 出现在真实的视频当中。这件事情对店铺,对 ip, 对 品牌代言人几乎是必备的,你可以不用自己每天真人出镜, 你的 ai 形象依旧可以稳定露面。声音的克隆同样也很重要,要自然有情绪,而不是那种充满机器味的录音。第五,时间一致性,角色稳定性大幅提升, 这是所有创作者的痛点。人物光线、镜头需要全程的稳定, vivo 三经常会出现人物的脸部扭曲,以及时间从白天跳到晚上,或者说物体中途消失的情况。在很多情况下,只要分成多段视频, 三的角色一致性仍然是很差的,需要混合工作流使用以及需要大量的人工修补,对于服装的投放更加直接。如果说你的内容产出不稳定,角色的一致性无法保持,那你的素材就不敢放量,你的素材不敢放量,那你永远都跑不起来。 第六,更强的提示词理解与遵守能力。 vivo 三有的时候还是会摆烂的,比如说你给了他一堆指令,但是他可能只参考到了前面两三条,那后面的他可能自动忽略掉。传闻说 vivo 四可能把提示词拆分成结构化的小任务,从而显著提升对于指令的遵循度。 第七,更强的音频同步加环境音的搭配。 vivo 三点一已经能够做基础的音频同步了,比如说像脚步声,还有关门的声音,但对话的节奏环境音还是很差。传闻 vivo 四会更自然回声会随着空间变化,户外的风声,室内的闷声以及其他的环境音, 会更加追平 siri 的 体验。对于带货种草视频来说,这个就是像不像真人拍的关键的一点。第八, vivo 四和 jimmy 三点零的结合。用 jimmy 作为大脑,你只需要写一句指令,做一个三十秒的女裤视频,卖点是显瘦、垂感、不起球、百搭以及镜头要快。最后一句话附上用户下单的理由。 jimmy 会自动生成分镜表, 写好卖点提示词,然后直接出成片,这才是谷歌最有可能的隐藏优势。生态组合拳用 jimmy 三点零 pro, 再加上最强的深读模型 nano banana pro, 再加上新出的 vivo 四,这三个如果能连在一起形成一条流水线的话,那它的技能一定是比我们想象中要更加夸张。 那我们也要注意现实的约束,比如说更长的视频一定是等于更高的成本。如果 vivo 四直接把时长拉到三十秒,算力消耗就一定会是 vivo 三的四倍, 这样独立创作者的门槛就会被拉高,定价太贵,就会变成只有专业工作室能玩得起,而 solo 二仍然可以靠更便宜的价格占据主流市场。 讲完爆料出来的功能,那我们再来看一下 vivo 四大概什么时候会来。按照推断, vivo 二的问世时间是二四年的十二月, vivo 三是二五年的五月,中间都隔了五个月。如果谷歌保持这个节奏, vivo 四其实应该已经官宣了,所以很可能发布就在年底, 现在已经十二月中旬了。如果 vivo 四真的能够做到上述这么多功能的话,那它绝对是一个大惊喜。 如果他做不到,只是一个噱头的话,也仍然值得我们关注,因为不管是谁输谁赢,受益者其实都是我们。 ai 竞赛可以让两边指数级变强。一年前, ai 视频还只是一个玩具,但今天我们已经在讨论三十秒和二十秒的区别,以及多机位实时编辑,甚至把 ai 视频完全用做商业化。 如果再过十二个月,你甚至有可能会分不清它和专业相机的差别。到那个时候,无论是从成本、速度还是质量上,手工制作的内容在 ai 生产的内容面前都将不堪一击。我是牧童,目前正专注于用 ai 制作服装内容,如果说你也对这方面感兴趣的话,可以点个关注,我们下期视频再见。

兄弟们,沉寂已久的谷歌终于来炸街了,就在刚刚结束的谷歌 i o 大 会上,发布了天花乱坠的各种 ai 产品,但真正重点就两个,一个是独一档的多模态能力和超强的 ag 能力。 先来看个最狠的,谷歌发布了全新的世界模型 jimmy nike omni。 你 可以将任何形态的文件作为输入,比如文字、视频、图片、音频一起发给他。 jimmy nike omni 能以任何你要求的形式输出给你, 从此 p 视频就像 p 图一样简单。但如果说 omni 是 无敌的感官,那么同时发布的 jimmy nike 三点五 flash 就是 专为代码和 ag 的 优化的, 它的输出速度达到了同类前沿模型的四倍,每秒狂飙一千五百个 token。 谷歌在现场用全新的 ai 开发平台 anti gravity 二点零展示了它有多逆天。 杰米奈三点五 flash 仅仅持续工作了十二个小时,就从零首写出了一个完整的操作系统内核。它在开发时,后台自动派生出了九十三个 ai 子代理,总 token 成本低于一千美元。而同类型的任务如果交给人类团队,至少需要数月的时间。 更硬核的是这个首出的操作系统,既然能直接加载毁灭战士 doom, 现场就玩起来了。 随后谷歌顺势推出了 gemini spark, 你 可以理解,它是谷歌为你远程部署了一台七乘二十四小时,搭载了 gemini 全套能力的服务器。它能跨越应用,直接打通各种第三方软件。你只要给他一个目标,他自己就能拆解,步骤全自动帮你搞定。 比如自动检查信用卡账单里的隐藏订阅费,把货一记录整理成文档,然后群发等等。最后还有压轴亮相的谷歌智能眼镜,戴上它, jimmy 奶就变成了你现实世界里的专属管家。路过咖啡店,眼镜自动识别,你只要动动嘴, ai 就 把咖啡给你点, 还能实时 ai 导航和同城传译。从这次 ai 大 会上看得出,谷歌正在疯狂地将 ai 模型的能力产品化,毕竟用户真正需要的是能解决问题的产品,而不是 ai 模型本身。第二呢,谷歌之前明显在多模态发力过猛,在 ag 能力方面有点落后于 antropics 和 open ai, 现在眼看 ag 大 爆发,所以他就奋起直追。但即便是刚刚发布的 gmi 三点五 flash, 也依然和这两个头部公司的模型有差距。那么 gmi 三点五 pro 会不会惊艳全场呢?大家可以期待一下。好了,我是阿朱,关注我,让我们一起在 ai 潮头冲浪!

看来好莱坞打不过就要加入了, ai 视频终于迎来 c dance 的 重磅挑战,谷歌即将激出最新的 ai 视频生成模型 where for。 看到视频的最后呢,我会展示一个所有想做视频的人都能受益的案例。首先, where for 在 视频输出的能力上全面追平 c dance, 终于有人能把现在视频生成价格高、速度慢的问题解决一下了。 而且呢,已经有人开发出了针对电商广告和各类市场内容团队非常有潜力的玩法,只需要通过一个商品视频和无限多的模特视频,就可以完成更多的内容组合式创新,这将是对内容生产释放的重大利好消息。 之前 luoma 等模型吹过的牛,现在也被 will for 实现了。只需要通过自然语言就可以完成视频编辑。例如直接提出把盘子里的意面换成南瓜汤模型就能针对局部内容进行修改而保持其他部分不变。即使是这种飘忽不定的水印,它都可以去掉。过去这类需求往往需要非常复杂的调整, 而如今正被转化为口喷的编辑方式。这次谷歌呢,不仅是占频 cds 这么简单,还在解决一个所有不会做视频的人的痛点。我只有一个想法,但是我不是专业人士,如何转化成视频呢?比如为给他一段乔布斯生平的故事,让其生成不需要你操心,就可以直接生成长达三十五秒的视频。 也就是说, vivo 不 只是生成看起来像的画面,而是能够围绕某个主题组织出更符合常识和语境的内容。这类任务都体现出他试图把视频生成和知识理解结合起来, 对于所有想做视频自媒体的人来说,这会是一个很值得关注的方向。所以通过这次 vivo 的 更新,我预测未来的 ai 视频模型将会成为每一个故事讲述者的智能导演,而你只需要一个好的想法。

gemini 三月五日深夜重磅发布,谷歌 i o 二零二六大会召开,火力全开,把攒了半年的大招一口气全部亮了出来,明星产品 gemini omni 正式亮相。作为一个真正全能的大模型, omni 可以 接收任意形式的输入,生成任意形式内容, 并且首发支持视频输出,堪称视频版 nano banana。 另一个重磅 gemini three point five flash, 在 几乎所有的精准测试中,三点五 flash 都实现了对自家前代旗舰 gemini 三点一 pro 的 碾压,输出速度也直接翻倍,对比 g p t 五点五和 opus 四点七更是快了四倍有余。 更强的三点五 pro 则会在下个月发布。此外,还有一大批重磅产品 anti gravity 二点零从 i d e 进化为 agent 开发平台 geminis bar 个人 ai 助理,全时云端运行。 gemini a p p 改版代号 neural expressive, 改为算力计费 ai ultra 订阅计划新增一百美元版本,最高档从二百五十降至二百美元。搜索二五年最大升级,接入三点五 flash, 新增智能搜索框,自动生成 mini 应用。

五月十九日,谷歌 i o 二零二六开发者大会正式开幕,现场发布多项颠覆性科技,核心亮点直指 ai 与硬件生态,引发全球科技圈高度关注。本次大会以 ai 无处不在为主题,集中展示谷歌在大模型、 智能硬件、操作系统等领域的最新成果,多项技术直接对标行业性能,直接对标股, 在复杂问题解决、多模态理解上实现质的飞跃。同时,发布安逸多模态版本,融合视觉语音代码能力,能轻松处理图文识别、语音交互、代码生成等任务,实用性显著提升。硬件方面,代号金猪的 android x 二智能眼镜首次公开 定价三百七十九到四百九十九美元,主打实时语音交互、全息投影功能,支持与手机、电脑无缝联动,日常导航、翻译、信息查询可直接投射眼前。 此外,谷歌还推出全新 ai 操作系统阿鲁尼的 mo apps, 适配 pc 与安卓设备,主打 ai 原生体验,有望颠覆传统 pc 生态。对普通人而言,这些技术将快速融入日常。 java 四点零让 ai 助手更聪明, 能精准处理工作、生活各类需求。 ai 眼镜解放双手,出行办公更便捷。新系统让设备运行更流畅, ai 功能全面下沉。谷歌此次发力,将进一步推动 ai 普及,让智能生活离我们更近。

谷歌终于急了,刚刚三代 pchy 亲自发文官宣,在安卓的大会 i o 特别版上,谷歌亮出了真正的杀手锏, gemini intelligence。 虽然大家关注的是自动填表和 rambler 语音办公,但背后隐藏的那个大招,才是真正让视频博主们睡不着觉的,那就是一次 vo 四架构的视频生成能力, 这意味着谷歌终于要在 ai 视频上狠狠干一仗了。过去这一年,谷歌其实很尴尬,很多人觉得它技术很强,论文很多,算力很强。但问题是, ai 时代最重要的东西不是你有多强,而是谁先抢走用户。这一点,谷歌其实有点落后了。 聊天机器人领域,谷歌被 openai 抢走了第一波流量,后来又被 antropica 抢走了很多高端用户心智。现在很多程序员和深度用户提到代码和长文本能力,第一反应甚至已经不是 gemini, 而是 cloud。 这对谷歌来说很危险, 因为谷歌过去最强的能力就是信息入口搜索,但 ai 正在改变一切,用户不再先搜索,而是先问 ai。 这意味着谷歌原本最赚钱的业务正在被慢慢侵蚀, 所以谷歌必须找到新的入口,而视频就是最重要的一张牌。为什么?因为未来的互联网越来越视频化,占用用户时间最多的就是视频,谁控制视频生成能力,谁就可能控制下一代内容入口。 问题是,视频这块,谷歌也不占优势。中国这边,字节跳动已经靠 cds 二点零打出了碾压级的产品实力。 cds 二点零强在哪?第一,懂创作、懂镜头、懂流量,支持文字、图片、音频、视频四模态混合输入,能复刻构图、运镜、特写,像真正的导演一样讲故事。第二,全链路工作流闭环 写文案生成视频局部重绘,角色替换,音频同步,一条线搞定,直接对接剪映,创作者拿来就能量产。第三,平民化价格加高效率,出片快,成本低, 普通博主也能天天用得起。这就是字节的生态打法,模型加产品加流量形成闭环,牢牢占据 c 端创作心智。而这次 gemini 或者说 vo 四,明显是带着任务来的,它不跟 cds 比花活,而是死磕工业级硬核能力, 重点就是文字生成逻辑。我测试了一个地狱难度的场景,一个教授在黑板前边推导公式边讲解。过去很多模型一写字就露馅儿, 公式会乱,字会飘,但这次谷歌的版本,黑板上的推导稳如泰山,文字连贯性极强。这说明谷歌在做一件事, 不是让视频更好看,而是让视频更可用。它瞄准的是企业级生产力、市场课程、 ppt 代码演示、产品,讲解这些能赚钱、能商用的硬核场景,更关键的是价格占底牌。 谷歌有自研的 tpu, 全球最强的算力基础设施,一旦它认真下场,视频生成成本可能直接砍半,甚至降低百分之八十。 当做视频变得像打字一样便宜,整个行业都会被重塑。现在市场格局已经很清楚, cds 二点零是消费端之王,占领短视频自媒体内容创作靠体验、生态和流量取胜。 gemini 是 产业端巨兽,靠技术算力低价强攻企业教育办公弊端。商用市场, 一个抓 c 端流量,一个吃 b 端利润,双雄争霸的时代正式到来,对行业的影响会是颠覆性的。一、创作门槛归零,普通人也能批量出专业级视频 内容,产能爆炸。二、商业模式重构,广告、教育、媒体、影视全行业降本增效,优胜劣汰。三、入口之争白热化,视频将成 ai 交互核心,谁赢视频,谁赢下一代互联网。 所以 thunder pitch i 这次官宣不仅仅是几个新功能,而是谷歌要从底层瓦解对手的护城河。这场战争不再是能不能做视频,而是谁能定义视频的生产方式。我用同一个提示词测了这两个模型,你觉得谁更强?评论区告诉我,想看对比原片留言视频。

谷歌凌晨的这场发布会,可能会改变你下半辈子的工资。谷歌今天的发布会有点狠,狠到什么程度?他们造了一个 ai, 能一晚上把一台电脑从零到一造出来,花的钱比你下顿馆子还要少。具体狠到什么程度?九十三个 ai 同时干活, 干了十二个小时,总共花费不到七千块人民币,造出了一个能用的电脑操作系统。七千块钱,在北京、上海,甚至连一个程序员的半个月的工资都不够。 你可能觉得这跟我没关系,那你就大错特错了。这意味着,以后老板请一个程序员的钱,可以请一百个 ai, 这些 ai 不 睡觉、不抱怨,不交五险一金,不会跳槽。而且不光是程序员,今天谷歌还发布了一个东西,叫 gemina spark, 号称你的二十四小时的私人助理,帮你回邮件、订机票、做 ppt、 买东西比价,甚至连主板和 gpu 不 兼容,它都能提醒你,以前你给老板打工,以后这个 ai 只给你打工。 谷歌这次没有拿最强的模型出来,而是发布了一个叫 jammin 三点五 flash 的 平价版,性能九十分,价格只有别人一半,速度还快四倍。所以,今天凌晨的这场发布会,真正的信号只有一个, ai 不 再是一个工具了,它在变成了基础设施。就像二零一零年的移动互联网,两千年的电脑,现在谁不开始用?三年后会跟今天不会用微信支付的人一样, 不是被淘汰,是被这个时代直接绕了过去。接下来,我会每天给你拆进一个 ai 工具的真实用法,让你不花一分钱的学费,也能跟上这波 ai 的 浪潮。