我刚刚从英伟达北京的办公室出来,真的几乎是一瞬间就理解为什么漂亮他不敢卖 red ruby 给我们,也理解为什么我们对 h 二百就是不表态,更理解国内的模型大厂们为什么馋达子都馋哭了。真的,现场我亲眼看到他们直接掩饰 ruby, blackwell 和 hooper 这三个系列跑同 同样的任务,那个效果出来的时候,那个瞬间一下就通了。 oppo 已经是过去式了,那未来的两到三年属于 robin? 好, 这一期基于我现场的学习跟理解,保姆级的给大家拆解英伟达最新的 vr robin ai 工厂。注意啊,是 ai 工厂哦,不是 nv link 七十二的机柜。那在展开讲之前,我先给大漂亮提个建议,真的,自信一点, 不要慌,微软 robin 都已经开始交付了,你拿两袋钱的来敷衍我干嘛呢?也建议国内啊,如果你想要买 h 系列,可以提出一种配货方式,你要让我买 h 系列,那你给我配点 b 系列。 真的,你们知道微软的,他们在讲那个每一页啊,不管是它的性能,功耗,食言还是吞吐,就各种数据,横着拉竖着拉,都是三倍十倍。我突然就理解就今天国内的模型跟 g t 啊 cloud 它们之间的代差来自哪里,而 g p t 五点六,它是基于 blackwell 的, 已经让大家感受到一种很变态的能力了。如果它在基于 virubin 在 加速迭代,你就说国内的模型它们慌不慌吧?好,那这一套 virubin pod 到底长什么样?上图, 七类芯片,五种服务器机柜,四十台机柜依次排开。虽然啊,这四十柜的炮的它目前还是个参考架构,没有落地,但是我们反过来看它未来两年它在全球怎么落地,挑战在哪里?其实会是达子乃至整个达链的机会,因为真的没那么容易。 从这里开始你会发现,因为达,它已经从用系统思维来定义产品开始,来到用系统工程去落地 ai 工厂了, 所以它们不再只聚焦 gpu, 聚焦库的。因为你看这一排机柜,除了微软的机柜以外,旁边的这四类机柜是同样重要的。但是我还是要从最核心的微软机柜讲起。 我来现场本来是准备好跟他们的最新的微软合影的,哪怕是模型,其实我也可以,结果现场最牛的只有 a 一 百,所以我选择了跟二零零六年的一款 gpu 合影。那回到主题, 这一台单柜七十二颗 root 屏 gpu 加三十六颗 ver cpu, 相比 blackwell, 它的升级我们不能只看参数,要看它背后到底升级了什么,这非常关键。 首先,最新的 hbm 四内存待会提升了二点七五倍,从八 tb 每秒升级到了二十二 tb 每秒,可以更快的读取数据,减少等待,同时支持更高的泵发率,这是非常适合今天的多 agent 同时泵发的。那这只能算是 s k 和 美光的实力。那英伟达你贡献了什么?一个是它升级了第三代的 transform 引擎,通过自适应的压缩让更多的训练后训练,包括推理可以用 f p 四精度,换句话说就是更少的显存占用,更高的通信效率和更低的功耗的方式来提升计算能力,让 f p 四的推理峰值达到了五十 p flops 时比两百的二点五倍。第二个升级点就是老朋友 n v link 升级到了第六代,增强了 g p u 之间的通信,宽带从一点八 tb 每秒升级到了三点六 tb 每秒,这一点对于 m o e 这种多专家模型架构非常 重要,因为 token 你 要在各个 g p u 之间要穿梭,这个通信速度其实决定了下一个 g p u 它要等待多久。通过 h b m 宽带、 f p c 优化和 n v link 的 互联能力这三项,其实本上解决的还是网络问题、通信问题、宽带问题。 虽然它每一项均衡的提高了两到三倍,让单科 rubin 的 推理是 blackwell 的 五倍,训练是 blackwell 的 三点五倍。看起来啊,这是倍数的提升,但本质上是单位 token 产出的效率带来的,单位 token 成本的降低,更省钱,更快,效率更高了。所以未来几年的关键词是什么?连接、 通信和存力,怎么存储数据?一个 ai 工厂里到底需要哪几类存储?哎,借这个机会一口气给你们讲清楚。尼维达把 ai 工厂里面的存储从 从调用的紧迫程度分为了 g 一 到 g 四,正在生成 token 的 时候,马上要用的数据也要放在 gpu 的 hbm 里,这就是 g 一, 也就是最热最热的数据。而很快还会用的,我 把它放到 g 二,也就是 cpu 的 dram 系统内存里,而短期可能会用,但是我又不确定的这种数据呢?放在 g 三 本地的 s s t, 这是温数据,而长期要保存的冷数据就进入到了 g 四的共享存储里面。但问题在今天, agent 和超长推理它产生的 k v catch, 也就是上下文缓存越来越大,那 k v catch 它直接关系到记忆能力,而记忆能力关系到什么?模型,是不是真的智能?是不是真的懂你?它非 非常重要,但是它非常占内存,那怎么办呢? hbm 和 dm, 它的容量是有限的,而且你会看到今天 hbm 四相较于 hbm 三 e, 它的容量其实没有增加,它增加的是宽带。那 g 三的这个 ssd, 它一般呢只能支持 单个节点,它不适合大规模的跨节点去共享。而 g 四这一层就是冷数据用的文件存储,它虽然容量很大,但是它访问的时延非常高,就是非常慢。所以因为大家在 g 三和 g 四之间增加了一个 g 三点五, 就是 c m x 用共享闪存集中去存放的一些,规模巨大,需要反复调用,但是又没必要一直站着 h b m 的 k v k 在 实际用的时候怎么做?通过英伟达的 demo, 提前把马上要用的这些数据从 g 三点五送回到 g 一 和 g 二,你也感受不到它那种延迟。相当于在 g p u 的 高速内存和传统存储之间增加了一个大容量高带宽的扩展存储机柜,来支撑更长的上下文和更多的 agent 的 并发症。其实因为它没有一味地在 g p u 上面去堆 h b m 四,因为一块芯片,它周围的先进封装面积是有限的,功耗和散热也有物理极限,它们在主动根据业务的需求去做存储的分层,所以专门增加了这一台基于 bluefield 四的 s t x 构建的存储 机柜。这个存储机柜用在哪里?懂了吗? h b m 虽然是现在的焦点,但是像 agent 也好,推理也好,各种场景,你怎么解决?这个温数据的 反复调用才是解决模型记忆问题的关键。敲重点,不是说 h b m 不 重要,而是你上升到一个 ai 工厂的时候,全职思维去思考,你怎么把不同类型的宝贵的存利用在最合适的地方,是更高效更经济的。 好啦,思路一打开,既然可以扩展存储,那 agent 要大量调用工具,执行代码和运行 agent 的 杀伤的时候,我也可以扩展额外的 ver c p u 机柜啊。这一台金灿灿的 ver c p u 是 专门为 agent 设置的。那如果你有大规模的推理场景的时候,比如说超低时延的这种 to c 的 语音交互啊,实时翻译啊,或者代码助手等等,你也可以扩展一个这个是基于 grog 三的 l p u 机柜啊。但是这里我很好奇, 你的 l p u 怎么跟你的 g p u 去配合呢?你可以理解啊, robin 的 g p u 就 像一个阅读和飞行能力很强的人,他主要负责的是 prefer, 就是 快速地读完几百页的材料,然后理解了前后的关系,做好笔记了,然后就进入到 decore 的 环节啊, robin 和 l p u 就 会协同来计算 l p u 像一个反应特别快的人,重点负责把 tock 输出的这个食言给你压下来。其实业呢,一直有一种说法, ai 定制芯片才是终点,但是你发现没有,达斯已经在用系统能力主动应对 a c 的冲击,通过这套系统,它能把 c p u g p u l p u d p u 编排和协调起来。那如果跑通了未来第三方的 asic, 只要接入的接口和软件适配,你也能够接入到英伟达定义的系统里面。五个机柜里面最关键的也是最容易被忽视的一个机柜,就是这个 spectrum 六的 spx。 网络贵,今天网络的重要性被极大的忽视了,你们最关心的 c p o 就 用在这里,简单说就是把硅光引擎直接跟交换芯片封装在一起,把走线缩短到 最短的距离,那这样你的电信号的损耗小了,功耗低了,你的通信效率就更高了。这个是 c p o 重点解决的问题,但关键的难度在于封装怎么对齐这些光互联器件,你的光纤盒跟光信号怎么对齐? 这么大的力气封装在一起?不用插拔了,它其实适用的是这种大规模计算的时候网络的稳定性,否则损失很严重。但是如果你是小型服 务器,你还是可以用光模块就插拔式的光模块的。其实在我看来, c p u 本质上它是一种极致的协调艺术,它其实不是什么新路线,只是因为大家用可见的订单作为号召能力,让产业链按照我打字 我的路线协同来配合,才把 c p o 量产出来了。所以能够协同起来,推向量产,才是 c p o 的 核心含金量。那跟华为掏定律的 n p o 有 什么差别?一句话来总 结, n p o 它是近充装,就光引擎靠近计算主芯片,但它还是独立的封装。而 c p o 呢,是共封装,就光引擎跟主芯片是封在一起的。 那华为的 high one n p o 用在超级点的内部去结合领取,把几千颗 n p o 像一台计算机一样工作,他做的是 scale up, 就是 向上扩展,要的就是速度。而英伟达的 c p o 搞集群,用的就是让 ai 工厂里的这五种不同的机柜能够协调地跑起来。他做的是 scale out, 这个时候通信要够稳,才能把它们连起来,跑起来。不管是 n p o 还是 c p o, 其实条条大路通罗马,都是要让网络更快更稳。所以你们知道今天网络的重要性了吧?朋友们,那除了超节点和集群,这些其实都是几米几十米的连接,那今天网络更大的挑战 是要把不同的集群连在一起,就公里级的高速连接,叫 scale across。 比如说怎么把乌兰察布的多个 ai 工厂连起来,它也能够覆盖均匀,减少抖动。这一层的挑战就是算网 协同了。懂行的朋友们啊,可以在评论区聊一聊啊,怎么算网协同?好了,到这里我们需要算一笔账,那英伟达的 v i o b 的 pad, 四十个机柜,它能够带来六万匹的峰值算力,那我们按照一个 几瓦的 vr 路由器中心来估算,整体投资可能会接近五百亿美元。所以今天真的要卡在这个超级 ai 工业技术设施面前的是你得先跑通一个 pod, 就是 四十个机柜跑出了效果,你 比如推动了模型的迭代和应用全面开花,恐怕在今天才能够去继续推动几瓦级的这种规模化的 vr 饼的 ai 工厂的扩张。我其实真实的感受到啊,因为大家从最早他做 g p u 到把库大生态建起来,再到今天的 ai 工厂的定义,它已经构建起了一条我认为更新的、 更强的竞争优势,就是用极致的供应链号召能力,编制了一条属于他自己的全战能力。不要觉得这很容易啊,你想一个人干十件事其实没有那么难,但是你要让全球各个领域最优秀的公司,大到 s k 海力士台机电,小到光通信领域的像 cohen 这些数百个优秀的伙伴,围绕你的技术路线去投入,去引进,其实是更难的一种全战能力。就我们经常讲抠打护城河,事实上因为他自己比较讨厌壁垒和护城河这类词啊。 虽然库大它不是开源软件,但是它能不断做大,依靠的是让越来越多的开发者、供应链和伙伴都愿意接入这套系统,那因为它真正厉害的地方是一边它掌握了技术, 一边他又掌握了系统定义,一边他还能让更多优秀的人在这套体系里面去投入。他编织了一张我认为是无形的网,把每个角色放进了那个网上的坐标里,而不是一条护城河啊,把我们隔开。所以我是能理解,因为呢,他现在卖不到中国的那种无奈, 我也非常理解,深藏它暂时也进入不了全球市场的那种无奈。这不单单是产能问题,但是我觉得也许有一天能够伴随全球的产能不再受限制的时候,可能大家又能够自由的交流起来了。 但是我比较遗憾的其实是,今天 ai 还没有为人类社会创造核心竞争力,重重壁垒已经先竖起来了,所以这次 w i c 非常期待全球共建共治,能够有一些实质性的框架出来 去推动 ai 真正的先把竞争力提起来再说,比如在科研领域,在一些生物医疗材料研究上面搞出大动静再说。你们怎么看呢?评论区可以聊聊。
粉丝63.3万获赞482.9万

起因是主播发现大部分人根本不会使用 a b i key, 比如如何把 deepsea 接入 cloud code, 接入 kodaks, 接入 koser, 或者接入国产的车 e、 通用林麻等等。又或者拿到了中转站的 a b i key, 怎么接入到你想要的任意平台, 如初一 q order、 open code 等等。也就是说绝大部分人都不会使用 api。 因此主播这次准备教你底层原理,可以自己配齐 api 接入任意平台。 如果主播有错误,欢迎大家评论区指正。本视频分为原理篇、势利篇和实战篇。我们先从原理篇开始,我会教你配齐 api 的 三要素, 以及市面上主流的两套接口协议。再来一个 deep seek 接入 tv 的 例子。接下来就是实战篇,包含了中转战、接入车衣、接入 cloud、 最新的 long cat、 接入车衣 codex 等等。 ok, 欢迎进入原理篇。我们先来讲讲接入 api 的 三要素,一下非常重要, 接入 api 无非就是确定 base u r l、 api key、 妈刀 id。 我 们先来解析一下这些名词都是什么意思。 base u r l 就是 api 的 服务地址, 这个最重要,必须填写正确的 base u r l 才可以正确获取模型。调用 api api key, 这个非常简单,我会教你如何申请 api key。 模型 id 这个顾名思义就是模型的名称, 如 deep c 杠 v、 四杠 pro, 一个字母都不能错,否则配置失败。我们先来一个简单的例子, 如车 e 的 自定义接入模型的界面可以看到,我们必须把三要素填写正确,才可以接入我们的模型。这里面的自定义请求地址就是我们要填写的 u r 六 模型 id 就是 我们要填写的模型名称 apikey 就 不多介绍了。这个时候有人会问主播怎么解放图片, 我连这个页面怎么打开都不知道。不要急,目前正在讲解原理,还不涉及操作,因此图文比视频更清晰。接下来到习战片,主播会用视频演戏,回到原理上来,因此配齐自定义模型的核心三要素系 vs 地景 模型名称和 api 密钥。而当你拿到 api 密钥,这里已经有两个已经确定,即模型名称和 api 密钥。也就是说,我们只用寄到 u r l 地址就可以正确配置模型了。 但是这里就是最难的地方,因为官方接口文档给你的 url 地址一般都是不正确的。例如我们来看 deepseek 的 官方 api 文档,可以看出官方已经给出了 apikey 和模型 id 及 deepseek 杠 v 四杠 pro, 但是 url 地址却给出了两个, 我们如何选择?还有一个很严重的问题,例如我们看第一个地址其实是不能直接用的,我们必须在地址末尾手动加项 v 一, 这就是配置 u r l 地址的难点,我们一个一个讲解。首先我们先来讲解为什么 deepsea 官网上会出现两个 u r l 地址, 我们到底要接入哪一个?我们先来介绍 open ai 兼容协议,这个用的多,简单来说就是 open ai 率先定义了一个行业规范, 他们写了一套最标准的代码,你们要想用我的模型,就必须按照我的代码配置我需要的参数。由于 open ai 太火了,后面的很多厂商发展 ai, 为了快速扩大市场,觉得沿用 open ai 的 行业规范, 这样一个 open ai 用多的人再转到如通意、临马、字节跳动等等,会非常的方便。因此由 open ai 定义的行业规范就叫 open ai 兼容协议。市面上几乎所有的大模型厂家都提供了 open ai 格式的 url 地址, 形成了一个完整的形态,只有一个抢向例外,它就是最公平、最不会争流、最尊重中国用户、最不会瞎分、最不会制造焦虑、最不会圈钱、最赚不回成本价的 ant hr opic 公司。它们没有兼容 open ai, 而是自己创建了一套独立的协议, 因此也叫 ant hr opic 兼容协议。目前绝大多数厂家都对这两种协议进行了兼容。 这就是为什么我们看到 deepseek 提供了两个 url 地址,就是为了同时兼容 openai 协议和 antriopik 协议。由于协议不同,因此 url 地址自然不同。我们先来了解如何填写 openai 协议的 url 地址。我们提供的 url 地址必须写完整的 url 地址, 也就是图片的最下面的那串长地址。但是例如叉 e, 大 部分情况下我们只用填写如图所示的短地址, 这是因为,例如 q e q order c c s switch。 当你填写完短地址之后,它会在你的地址后面自动拼接一部分地址,从而达到最终填写的是完整的 u r l 地址。例如图片系列中下面就有提示要填写兼容 open ai 的 服务端点地址, chat completion 会自动填充到你所填写地址后面,因此我们只用以 ve 结尾即可。这里面有两个关键点,第一个就是 ve 到底要不要写。 川 e 是 给出了拼接的规则,如在地址后面拼接 chat completion, 但是某些其他的厂家可能并不是这个规则,同时也没有给出这个规则,这个时候我们可以选择自己手动填写完整的 ur 地址,最为保险。 还有细心的官就已经注意到了这个 v 一 到底是什么。我们通过查看 deepseek 的 官方文档发现官方并没有给出 v 一 作为结尾的 u r l 地址, 也就是说我们不能直接复制官方的地址,意系在官方的地址后面手动加向 v 一, 或者自己填写完整的 u r l 地址才可以接入模型。我们再来解决两个关键概念, 一个是 v 一, 一个是完整的 u r l 地址。我们先来说简单的,什么是 open ai 的 完整 u r l 地址,就是拿到官方的地址后面加上 v e chat completion, 这个是固定的,如 deep six six 的 open ai 格式的完整 u r l 地址,如图, 就是在官方提供的 base u r l 地址后面填写 v e chat completion, 即完整的 u r l 地址。我们再来说说第二个问题, 既然大部分情况下我们都要填写这个 v 一, 为什么官方提供的 u r l 地址不直接把以 v e 结尾的地址给我们呢?这部分是作为拓甲内容,感兴趣可以了解,也可以直接跳过 直接结论, open ai 格式必须在官方给的 u r l 地址后面加上 v e。 首先这个 v e 代表的是版本号, 未来可能会出现 v 二,到时候就要在后面填写 v 二,而不是 v 一。 第二,把 v 一 加到基础 ur 料其实是不合理的,但是 open ai 采用了这种不合理的设计,属于是历史遗留问题。 第三,我们之前说过,国内的大部分厂家会提供 open ai 和 a n 三 arpik 对 应的地址, 因此把 v e 加入 base u r l 是 无法区分到底是 open ai 还是 a n star epic。 还有最重要的问题就是,例如 try e 是 在你填写的的纠后面给你加 try compile it i s, 因此你需要自己写 v e, 但是有些厂家会在后面拼写 v e, 这个时候你要是再把 v e 写下,相当于写了两遍 v e, 地址自然就错了。所以大部分厂家选择提供的 u r l 地址不带 v e, 是 要用户自己去判断 要不要把末尾的 ve 写下,可能 codex 不 用写,可能 open code 的 要写,这就需要自己判断了。不过最好的做法还是直接写下完整的 u r l 地址。最后我们对原理篇做一个总结,完整 u r l 地址就是在官方的 u r l 地址后面加向固定的路径, 三要素分别是, u r 幺地址、模型名称、 api key ok, 原理篇到此结束,接下来我们进入系列篇和实践篇,我会通过多个不同的例子教你如何查看官方的 api 文档,从而确定怎么接入 api。 这样以后出现任何一个新模型,你都可以不用在网上搜教程,因为方法是通用的,授人以鱼不如授人以鱼,你不再仅仅是会把 deepsea 接入 codex, 而不会接入 cloud code。 明天出了一个新的 i t o 的, 又要往下搜教程。本视频帮你从底层原理出发,让你明白所有的接发都是大同小异。如果原理片看不明白,可以继续看犀利片,我们通过操作来辅助理解。

面试官问你,公司大模型 api 响应慢得像乌龟爬,首次延迟直接飙到三秒以上,你怎么优化? 这时候如果你脱口而出加显卡堆算力,或者换个小点的模型,那这场面试大概率就凉了。因为这种回答只停留在教科书式的死记硬背,根本没摸到大模型自回归深层的工程本质。 你连 transform 推理过程中, prefill 阶段是计算受限,低扣的阶段是 i o 仿存,密集型瓶颈都没搞清楚,面试官怎么敢让你去动公司一个月几十万流水的 ai 生产环境?大家好,我是阿星,点赞收藏加关注, 想系统学大模型,同学后台可以随时找我。大场面试考这道题根本不是看你知不知道加显卡, 而是考你在有限硬件资源下对延迟吞吐和 qps 做系统级权衡的思维能力。想在面试官面前展示出真正的工程体感,建议先点赞关注加收藏,免得后面需要的时候找不到了。想破局, 我们先用政教思维把大模型 api 的 延迟一层层拨开。真实延迟由四部分构成,第一,网络传输,这个通过边缘部署就能解决,不是主要矛盾。第二,请求排队时间并发一高,排队直接血崩。 第三, prefill 预填充阶段的延迟。这时候模型在吃里的输入 prompt 自注意力机制的复杂度跟输入长度的平方成正比,输入越长,矩阵乘法算得越慢,这是典型的计算密集型瓶颈。 第四,也是最折磨人的低蔑的逐次生成阶段。延迟大模型是自回归生成的, 每蹦出一个 token, 都要把几百亿参数和之前所有的键值缓存 k v cash 从显存里重新读写一遍, 这就导致 gpu 的 算力根本跑不满,显存贷宽被实时卡住,变成了车头车尾的 i o 访存密集型瓶颈。搞懂了底层逻辑,接下来就要给面试官展示你的大厂工程落地能力。别慌,直接记出从前端到内核的四道防线,多层协同策略。 第一道防线,请求策与接入层优化,告诉前端流势响应是标配,必须让用户先看到第一个字,同时后端起用连续批处理,也就是 continuous batching。 传统的批处理,就像坐公交车,必须等一车人全都写完了,到终点站了才能一起下车, 而连续批处理变成了流水线,地铁哪个请求处理完了,直接下车释放资源,新来的请求随时插队上车,吞吐量直接拉满。第二道防线,内核与内存管理。 这是真正拉开身价的地方,为什么并发症上不去?因为 k v cash 在 显存里东一块西一块,内存碎片化太严重。我们直接上配置的 attention, 也就是分页注意力机制,把显存像操作系统一样分成虚拟的物理块,哪里有空间就往哪里塞。再配合快表做智能影视印刷,直接实现显存零碎片化。第三道防线,计算内核与算子融合,矩阵乘法,慢 直接把 flash attention 这个算法甩出来,通过 sram 高速缓存和算子融合,把显存读写次数砍掉一大半,再配合 int 四或 fp 八低精度量化推理,把原本庞大的权重瘦身访存压力瞬间减半。听起来很复杂,是不是? 其实用大白话解释大模型推理,就像一位顶级大厨带了一群传菜的打工人, prefill 阶段相当于大厨在看菜单,研究菜谱, 虽然费脑子,但只要看一次就行。而 dico 的 阶段,就像大厨把菜炒好了,传菜员每次却只能拿一个小盘子抠抠搜搜递一次,端一盘菜。 我们搞的 flash attention 和配置的 attention, 本质上不是去催大厨炒的更快,而是给传菜员换上高速传送带,把他们之前乱跑的路线规范化, 让显存贷宽的利用率达到极限。把这一整套覆盖请求接入缓存内核硬件的全链路防线完整讲出来,面试官心里会暗暗给你加分。这轮基本稳了, 我把大模型面试八股和二零二六年学习路线图、视频学习文档都打包好了,想要的话就在评论区吱一声,我挨个发。最后,大厂二星再给你留一道大厂架构岗的深水区 思考题在极长上下文,比如十万 token 以上的高并发症场景下配置的 attention 带来的页面置换开销 和频繁切换 lora 带来的吞吐量血崩工程上该怎么权衡?真正有过落地经验的大佬,欢迎把你的方案发在评论区,我们评论区见真章。

五分钟你可能连厕所都上不完,但是这次我们要用五分钟来运行这个英伟达的模型。屏幕前的你尽管放心,我已经把该踩过的坑都已经踩过了, 你只要按照下面的步骤去做就可以了。上期视频我们深入体验了一下英伟达最新的模型 lockheed nc 三 b, 很多观众老爷呢反映这个模型安装难度还是较高的,那么今天我就把这个模型的安装和部署掰开如碎了给各位观众老爷们送到嘴里去啊,跟他没关系。 部署一共分为六个步骤。第一步,安装驱动。首先你需要准备一张英伟达的四零系或者五零系显卡, 当然三零系应该也是可以的,只不过我手上没有三零系的显卡用来测试,所以在这里就不给大家写保证书了。 cpu 无所谓,无论是英特尔还是 amd, 根据你的喜好选择就行, 只要确保好安装最基础的驱动就行。这里指的是电脑商家让你安装的那个驱动。紧接着输入 nvidia s m i, 查看你的扩展版本,只要不低于十二点四就可以。第二步,安装 cuda 虚拟环境,一路点击下一步就行。安装好之后配置环境变量,这里将三个路径都配置在环境变量中。 重启电脑,打开命令提示符,输入这个指令,这里表示创建一个名为 nv 的 python 三点一零虚拟环境,后面的所有提示都选择 y 就 可以了。第三步,推理代码,在完成后的代码结构长这个样子,不对的话,检查是不是给他的仓库下错了。第四步,下载权重文件, 还是打开命令提示符,输入这两个命令来激活刚刚创建好的虚拟环境。为了加速下载,使用这个指令来配置镜像,紧接着输入这个指令来安装摩搭社区的依赖。安装好之后,输入这个指令来下载模型文件,这个模型文件它稍微有点大,能不能五分钟拉完 就看你的网速了。第五步,安装推理代码的依赖。由于这个模型的原声呢是运行在 linux 上面的,所以就需要去掉一些 windows 上面无法安装的库以及暂时用不到的训练代码。打开这个文件夹,找到 pyproject 文件,删掉我标记出来的这几个依赖库,紧接着安装最重要的可以调用显卡算力的三个库, 这三个库建议在镜像上面安装。运行这个指令来安装本地的依赖库。执行成功后,输入这个指令来安装剩下的依赖。第六步,新建一个 python 文件,输入这几行代码,把原始模型地址切换为。第四步,下载好的本地路径,再 添加一张要识别的照片。在命令提示符中输入这个指令,打开任务管理器,查看现存是不是被占用,通常情况下会占用八 g 币以上,等待几秒钟就会输出目标的坐标框了。 稍微加工一下就是上期节目中展现的那个样子了。正常走完这六个步骤以后,绝大部分人都是可以成功的,如果失败了,就检查驱动版本城市降级一下,或者检查一下 py touch 是 不是装成了 cpu 的 版本。本地 ai 部署这条路难免会遇到大大小小的问题,只 要你跟着教程一步一步走,相信屏幕前的你也可以成功部署更多的 ai 模型。好了,时间也不早了,我们这期视频到这里就结束了,我们下期视频见,拜拜。

面试官问,在高病发场景下,引白顶、召回和重排的延迟怎么优化?面试者全员哑火, 现在招人根本不在乎你会不会掉 a p i。 面试官真正关心的是你解决复杂工程问题的能力。很多小白对大模型商业化有种浪漫幻想,觉得用 red 把企业的 word ppt 喂给 ai, 用 agent 当管家,做好规划就能让 ai 自动写前后端做游戏。 面试官问,这样的理解对吗?这是把 demo 当成了现实,现在的 agent 不是 万能魔法,盲目让它自动写代码,大概率会生成一堆无法维护的史山。 真正的 agent 落地定位是确定流程的自动化执行者。面试官不在乎你借了几个工具,而在乎你懂不懂底层逻辑,能不能兜住系统崩溃的底线。 比如你能否将非 l l m 环节向量解锁、重排工具调度的延迟压缩到两百毫秒以内,这才是区分普通开发者和优秀系统工程师的试金石。 有人吐槽,老板就给一天时间,能把 pdf 直接丢进去跑通就不错了,还谈什么优化?面试官问,工期紧和架构烂是两码事。真正的高手在一天工期的压力下,懂得做批 f 解析和解锁。但架构设计必须留有扩展口, 比如把剪辑模块抽象成接口,今天接简单的向量剪辑,明天有时间了无缝切换到带重排的混合剪辑。工期紧不是写史山代码的借口,预埋优化空间才是资深工程师的价值。 还有人问,多路剪辑关键词图像量描述、向量加 re rank 重排算高级吗?面试官说,这不算高级,这是生产级 reg 的 及格线, 单靠一个 embedding 找 top key, 在 海量标书面前,准确率根本没法看。在这个及格线之上,真正的优化是采用两阶段,重排双塔粗排加 cross 减 encode 金牌平衡延迟是 query 改写与羽翼缓存降低成本 是懂分词器原理和 bpe 机制,而不是只会掉包。当你说精通 reeg, 你 需要准备好回答多路招回、向量缩影选型和重排蒸馏的细节。接下来我分享几个从零到一,搭建企业级 a 件的框架踩过的深坑,这都是生产环境真金白银砸出来的经验。 第一坑, a 件的函数调用死循环泥涨,把 a 件的从玩具变成生产级工具,稳定性是最大挑战。 当外部 api 报错时,如果缺乏引导, agent 极易无限重试拖垮服务。我们的解法是引入状态机模型控制流转,设置指数退币重试策略,在 prompt 中强化错误处理逻辑,并引入降级与人工干预机制,保证系统不崩。 第二坑,流势推理的内存泄露幽灵高病发场景下,用户中途断开连接后台的异步生成器和回调函数没有被正确释放,导致服务内存持续飙升。 解决这个问题的关键在于精细化的生命周期管理。必须使用 a sync with 上下文管理器,确保在客户端断开时调用 a close 释放资源,同时建立监控和超时处理逻辑,防止僵尸连接耗尽内存。第三坑,异步工具调用的死锁陷阱。 当 agent 需要协调多个异步工具调用时,如果对病发模型理解不深,一个慢速 api 就 会堵塞事件循环,导致死锁。 解决这个问题的核心在于深入理解并发模型,善用 asink 杠 await 现代语法,避免回调地域,强制使用 asink 点 wait for 为每个异步操作设置超时, 严格控制携程并发度。大模型应用开发早已过了,写个 demo 就 能拿高新的红利期。懂底层原理,能兜底系统稳定性,会做架构权衡,这才是你在面试和职场中真正的核心壁垒。

市值五万亿美元,全球第一!英伟达用了三十三年,站上了加速计算的顶峰,但是未来他的发展方向又是什么?他的神话还能继续吗? 昨天啊,英伟达发了一篇新闻稿,题目很直接,就叫英伟达和日本将把全站人工智能和机器人技术带入各行各业。 关键词, ai、 机器人。日本各行各业,简洁却足够震撼,因为他曝光了英伟达未来的全球战略布局。 咱们先回顾一下黄仁勋这次的仿制形成,都见了谁?干了什么啊?这次黄仁勋的仿制形成,可以说就是一次全站 ai 加机器人的巡演,几乎把整个日本的产业链和生态圈都给串起来了。 开发者和实验室在 build 克拉斯项目现场,他见证了日本开发者用开放模型和英伟达的平台造出的机器人爪子抓取物体,并且互动展示了 ai 如何从软件走向物理世界。 制造业和机器人巨头,他跟富士通、川崎重工、方纳科、安川的各位 ceo 共进午餐。这些公司是全球工厂的幕后操盘手,他们现在正在用英伟达的平台把实体 ai 带进生产线。 供应链领袖在东京神田的一家居酒屋,他跟来自十六家顶级供应链公司的三十多位高管聚餐,包含了半导体设备、存储器材料和电子原件,讨论如何让日本的世界级供应链成为 ai 国家战略的支持。 政府层面,他跟日本产经大臣赤泽良共同启动了物理人工智能创意。这是一个国家级的项目, 结合制造业数据和全球技术力量,开发面向机器人、数字、孪生和夺目态 ai 的 开放基础模型、创业与生态系统在 hot 八方圆,他与初创企业、合作伙伴、政府官员和媒体一起展示了从创业到国家政策的完整链条 文化游戏。在秋月园,他跟释迦庆祝了合作第三十周年。从最早的街机途经芯片到今天的 rtx spark 平台,游戏与 ai 的 交互既是怀旧,也是新纪元的开端。 所以整体来看,黄教主这次访日的关键词就是实验室、工厂、供应链、政府、创业文化。他几乎把日本的 ai 全生态都走了一遍,从技术到产业,从政策到文化,形成了一次完整的 ai 加机器人的国家巡演。 那么,日本在发展 ai 技术和机器人技术上到底有什么优势呢?精密传感器和执行器,日本企业在超声波传感器、力矩传感器、高精度减速器这些核心零部件上积累的相当深厚,这些是 ai 机器人需要的高质量物理书、 制造工业知识。在汽车、电子制造等领域,日本企业已经积累了好几十年的工业 no, 他 们可以把这些隐形的操作经验转化为 ai 可学习的模型。 安全认证体系,日本拥有严格的工业安全标准和成熟的第三方认证机构, ios、 幺三八四九、 iec 六幺五零八等等等等,这些就让日本在人机合作的安全方面具备了差异化优势。更重要的是,日本政府现在已经把发展机器人定成了国家战略 计划,投入一万亿日元的资金支持到二零四零年要在十八个行业部署超过一千万个 ai 机器人,那美国的优势是在算法和数据,而日本的优势呢,就是在硬件和制造, 日本正在把所谓的精益制造与 ai 进化相融合,用这个在新的全球竞争中找到一个新的制高点。 那么说到这了,英伟达未来的全球战略布局也就很清晰了,美国是核心研发基地,掌握底层技术,并且呢,提供基础设施支撑,是英伟达的发动机,不但推出新一代的算力和工具,进行 gpu 架构、扩展平台、 ai 框架和软硬一体化的产品研发, 并且构建电力、核电数据中心、太空数据中心这些 ai 基础设施。台湾是 ic 产业链的核心,台机电、红海这些代工厂给英伟达提供先进制成的芯片制造能力,这是英伟达的造新工厂,来保证每一代硬件能够顺应地。 韩国是以内存为主的 i c 辅助产业基地,三星 s、 凯力士这些企业提供高内存处理器, hbm、 drayon 等关键部件是英美达的燃料谷,为 gpu 等硬件的高速迭代提供高速数据流支持。 日本不造芯,而是落地,也就是 ai 的 物理实现。日本的优势在机器人,在制造业,在精密传感器和安全认证体系。英伟达在日本推动 ai 从虚拟走向物理世界, 把 gpu 和平台的算力真正嵌入机器人工厂、供应链以及游戏还有文化。 换句话说,美国是发动机技术源头,台湾是引擎制造,韩国是存储支撑,而日本是应用场景的时间长,英伟达把这四个区域串起来,就形成了一个完整的全球 ai 加硬件再加应用生态的闭环。 英伟达的全球战略很清晰,美国研发、台湾造芯、韩国共存、日本落地,这四个节点就构成了一条完整的新的 ai 产业链。 经过了四年的发展,现在 ai 技术的发展路径其实已经很清晰了,可以拆解成三层。第一层是大模型,它是智能的脑,负责语言理解、推理和生成。 这些模型的本质是参数、规模和训练。数据的爆炸式增长背后依赖的是不断迭代的模型框架和高效的优化算法。 第二层是算力和硬件生态,这是智能的心脏和血管, gpu 提供并行计算能力, hbm 保证高速数据流服务器集群。通过 nvlink 和 infinibun 互联,把成天上半张 gpu 连成一个完整的算力整体 库的是软件层的接口,驱动开发者在硬件上实现深度学习框架。这里的关键词是软硬件协同、芯片架构、存储带宽、互联协议、编程工具链,形成了一个完整的算力站。第三层就是物理 ai 了, 机器人、自动驾驶、智能工厂、医疗设备,把大模型和算力转化成动作触觉和物理交互,这里涉及传感器和多模态的结合。 日本的优势就在这一层,精密制造传感器集成产业链,能让 ai 真正落地到物理世界。 所以未来啊, ai 不是 单点突破,而是要三层合奏,大冒险的脑、 gpu 和内存的心脏与血管,机器人和工厂的手和脚。 美国、台湾、韩国、日本,这四个节点就构成了一个完整的产业链。英伟达的全球战略布局就是要把这个链条拉直,让智能从虚拟走向现实。 之前的三十三年,可以说英伟达只做了一件事,就是一直在寻找能让计算落地的场景,从游戏图形加速到挖矿再到 ai 计算推理。而现在,英伟达为了下一个三十年又开始了布局,主题就是物理 ai 所有的爆发都源于长期的积累,与其多样化发展,不如把一件事做专做精,做到极致。 在这如此的深挖解读英伟达的战略发展布局,不只是为了看清他的未来,更是为了让大家看清一家顶级技术企业生存发展的底层逻辑。用了三十三年,英伟达把算力推到了顶点,未来三十年,他又要让算力真正地落进物理世界。 那么最后的问题就是,我们现在走到了第几层? ai 技术又到底给我们带来了什么?

一个数字就能看懂大模型行业最大的变量, api 调用成本二十个月降了两百六十六倍,这对整个行业的竞争逻辑是一场地震。 这份华西证券二零二五年的行业深度报告,试图回答大模型从稍前竞赛到价值落地,谁能真正跑通, 先看赛道有多大。二零二四年,全球大模型市场规模已有两百八十亿美元,到二零二六年预计冲到四百一十四亿。但更猛的是中国, 中国大模型市场二零二四年两百九十四亿元,预计二零二六年突破七百亿,复合增速超过百分之五十。这已经不止是风口,而是结构性增长。光看市场大小不够,得看增长的发动机。真正的变量是效率。 deep sec 二一的训练成本只有五百五十七万美金,大约是 gpt 四 turbo 的 十分之一,但能力却几乎持平, 效率带来的效果立竿见影。中国开源模型的全球 api 调用份额从二零二四年底的百分之一点二,一年里最高飙到百分之三十。这意味着,全球每三次 api 调用,就有一次跑的是中国模型。 而上游算力环节,一场静默的切换也在发生。国产 ai 芯片的市场份额已冲到百分之四十一,英伟达的份额从百分之九十五降到了百分之五十五。 产业链的上中下游受益天差地别,上游算力最稀缺,最确定中游大模型厂商还在价格战中血拼,下游应用层,谁抓住行业数据,谁就有真壁垒。 竞争格局也在快速分化,头部互联网公司全站能力碾压中间的技术突破型企业,必须尽快找到商业化出口,而第三梯队的创业公司,未来一两年将面临最残酷的洗牌。 那么,哪种商业模式真的能赚到钱?看一组毛利率。智普的 b 端私有化部署,毛利率稳定在百分之五十以上, mini max 的 b 端服务毛利率做到百分之六十九点四,而它的 c 端消费应用只有百分之四点七,差距一目了然。除了文本,多模态正在打开新的天花板。 二零二四年,中国多模态大模型市场规模一百五十六亿,预计到二零三零年将逼近千亿,复合增速超百分之六十五。这就是大模型从能说会道向看懂世界的跨越。更值得关注的是端测。二零二六年,中国端测 ai 市场规模预计达到八千六百六十一亿元, ai 手机出货量将突破四点七亿部。大模型正在从云端走向每个人的口袋。 我们拆一个具体案例,智普 ai 这家清华背景的公司,二零二五年营收做到了七个多亿,其中 api 平台收入暴增三十倍, a r r 冲到十七亿元,它的平台已经进入了常态化生产部署。 但智普真正硬核的地方在这。 glm 五,全程基于华为升腾芯片完成训练,是目前极少数完全实现国产算力独立的前沿大模型。这意味着出口管制这道锁被撬开了一条缝。另一条路是国际化。 mini max 四年做到海外收入占比超百分之七十,二零二五年营收七千九百万美元, a r r 突破一点五亿美元。它的秘诀是极致参数效率和 agent 编程能力,而且 mini max 的 运营效率提升飞快,毛利率从二零二三年的负百分之二十五,一路拉到二零二五年的百分之二十五。 公司百分之三十的日常任务,百分之八十的新增代码,现在都由自己的模型完成。直接比一下绝活智普 g l m 五,科学推理百分之八十六,数学百分之九十五点七。 mini max m 二点五,编程百分之八十点二,开源最高,一个强在知识可能性,一个猛在 agent 编程路线不同,但都在证明不可替代性才是未来。 当然,这个行业也有必须直视的风险,研发投入向无底洞质朴,二零二五年研发费用已烧到三十二亿,亏损还在扩大,而算力管制一升级或者价格战持续失陷,都可能让逻辑直接失效。 所以看大模型行业,盯紧三个指标就够了。效率取现怎么走?国产算力份额能不能继续升?低端付费渗透率什么时候爆发?那些融资数字只是噪音。 以上为公开资料整理与逻辑梳理,非投资建议下期我们拆解国产算历练的确定性机会。芯片、服务器、数据中心,到底该看什么数据?关注我,别掉队。

面试官问, agent 并发调用好几个大模型, api 超时和取消,怎么处理才不出事?这问题一问,我就知道他考的不是你配个贪冒的参数,而是高病发下对资源控制和快速失败的工程嗅觉。咱们直接还原场景, 你的 agent 接到任务,同时调了三个 l l m, 一个做分析,一个润色,一个事实核实,或者是竞述场景。同题,丢给三个模型,谁先返回用谁, 无论哪种,你都要同时面对三路请求。这时超时和取消不再是单一路径,而是树状结构处理不好,最大的坑就是假超时和资源泄露。 你设整体超时三秒,时间一到,主逻辑返回错误。但那三个正在跑的 api 停了吗?大概率没有,他们还在后台空跑,占着连接池,消耗付费 token, 造成携程或现程泄露。 所以第一个核心点超时必须具备传播性,也就是要管理一棵取消树,绝对不能简单干等,必须有一个向下传递的取消信号,比如 context 或 cancellation token。 正确做法是创建待超时的根上下文,给每个并发子调用派生子上下文,当总超时触发或拿到结果,想提前终止取消根上下文,信号会向多米诺骨牌自动穿透到每个子调用。 第二个核心点子调用得听话,必须配合池话与流逝截断光发取消信号没用。大模型通常是流逝返回底层网络库,如果堵塞在读取流上,信号是切不断的。 所以不仅要传上下文,还得显示监听取消事件一旦触发,立刻硬掐 t c p 连接。另外,在落地时不能摞起现成,必须用携程池配合带超时的信号量来管控并发池子框死上线,防止打爆下游信号量,确保请求不无限排队。 这两者配合上下文取消链,基本能彻底杜绝资源泄露和集连失败。第三个点,部分失败与降级策略 并发条,三个模型两个回来,一个超时,是全人报错,还是先给用户看看?如果是必须汇总的场景,整体失败。如果是竞速,第一个返回,立刻取消另外两个。 但这还不够,核心是要定义好每个调用的优先级和降级策略,千万不能只靠重试。如果某模型连续超时,你的 agent 每次都要傻等三秒,必须加熔断器,连续失败直接熔断走降级大模型重试不仅翻倍扣 token, 还会引发血崩。 所以你看,处理病发调用的超时和取消,本质上是在管理一棵取消树。携程池是地基,跟超时是树干,取消信号就是秋风,秋风一吹,必须保证每一片叶子,哪怕底层堵塞的 tcp 流都被扫干净。 把这些讲透,你传递给面试官的信息就很明确,你不仅会调 api, 更懂在分布式协调下,让系统干净利落,快速失败且无残留,这才是工程里真正值钱的地方。

fast api 一 并发就卡,先别急着挂 s q l, 先看是不是每个请求都在重新连接。 postgrad s q l 举个例子, get agent 四十二,只是查一个 agent, 如果写在接口里,每次请求都要从零连接数据库网络,建立身份认证,分配连接资源。 s q l 还没执行请求,已经在等了, 并发一多,这些键连动作堆在一起,接口就卡。我的做法,应用启动时创建一次 s k 幺 mali engine, 它管理连接池,不是一条数据库连接。每个请求有自己的 session, 查库时从池里借一条空闲连接,用完关闭 session 连接,归还下个请求,继续附用池里的连接,不用重新登录数据库 连接池不是缓存,它不缓存 agent 数据,它附用数据库连接池子全忙仍会排队再查慢 s q 幺长事务和池大小。我是三贝,关注我,分享更多 agent 的 后端知识。

英伟达又被卡住了!据 some analysis 消息,英伟达的下一代 ai 机架系统可能要推迟到二零二八年。下一代 ai 服务器卡在了更底层的 cpb 上面。 cpb 你 可以理解成 ai 服务器里的高速公路, gpu, cpu 内存、电源都要靠它连接,电要从这里走,数据也要从这里跑。但是问题是,下一代 ai 服务器太猛了,芯片更密集,功耗更高,数据传输更快。原来的公路扛不住这么大的流量了。关注我,咱不整虚的,只讲最值钱的 ai 前沿资讯与思维认知。

英伟达七月八号发布了一篇官方文章,内容是 lanchen 针对 nemo tron 三 ultra 优化了 deep agents 的 运行框架,结果是这个模型在相关批准中取得了开放模型最高准确率、在业务任务层面接近得分最高的币源模型。 同时单次运行的推力成本只有领先币源模型的大约十分之一。值得注意的是,这次性能提升没有冲击训练模型, 人权调整的是模型外面的系统,包括 system prompt、 工具描述和中间件。官方技术博课里有一个很具体的例子,内蒙创在读一个长文件时,只读取了第一页,就误以为文件已经结束,所以任务失败了。 工程团队没有重新训练模型,只是在中间件里增加了一条如果一次读刚好达到行书上限,文件可能还有后续需要继续翻页的提示词。 调整以后,这组读取文件的测试从零比三提升到了三比三,整体积分分数也从九十四分提高到了九十六分。这个例子说明,有些时候 ai 完不成任务,不一定是模型不够聪明,而是工具没有把环境状态表达清楚,或者整个工作流程没有设计好。 这就拉出了两条完全不同的 ai 发展路线。过去行业提高 ai 能力主要依靠训练模型增加更多数据,或者针对任务重新微调,发现模型不够强,就换一个更强同时也更贵的模型。 英伟达这次展示的路线是先不改模型,而是先改造模型工作的环境,就像一个员工没有完成任务,过去的解决办法是换一个能力更强的人上来,现在则是先检查岗位说明是否清楚工具是否好用,工作流程是否存在断点。 这意味着,未来企业衡量 ai 的 标准可能不再只是模型跑分,而是这套系统能不能以更低的成本稳定完成真实业务。这里面也能看出英伟达的商业目的。 在基础模型竞争中, open ai、 android 和 google 掌握着最强闭源模型。英伟达虽然提供训练和推理所需的芯片,但它并不能直接控制模型入口,所以英伟达正在搭建另一套位置。 nemo chun 提供开放模型, land chain deep agents 负责模型编排, open shell 负责 agent 执行任务时的安全环境 联盟 call, 再把这些组建包装成一套企业可以部署、修改和治理的参考方案。英伟达不一定非要拥有市场上最强的模型,只要越来越多企业开始部署自己的 ag, 模型的推理、工具的调用、安全执行和持续评估, 这都会产生新的基础设施需求。换句话说, openai 想让企业离不开它的模型,英伟达想让各种模型都离不开它所参与构建的基础设施。 这也解释了一个看起来有些矛盾的现象,英伟达表面上在推动开放模型,帮助企业减少对闭源模型的依赖,但如果这些开放模型最终运行在英伟达优化的芯片、软件和安全环境中,开放模型越普及, 英伟达的生态反而可能越大。对整个 ai 赛道来说,这条信息意味着竞争可能正在进入下一个阶段。上一阶段比的是谁更能训练出更强的模型嘛?下一阶段比的可能是谁把模型工具、数据评估和运行环境组织成一套真正有效的生产系统。 但这里也要注意,所谓十分之一成本业务能力接近,都是英伟达在特定链签批准下给出的结果。不能直接理解成开放模型已经全面追平闭源模型。真正值得关注的信号是,过去被认为只能靠更强模型解决的问题,现在开始有一部分可以通过系统工程解决。 而这条新路线,可能正是英伟达从断利供应商进一步走向企业 ai 平台的关键一步。 ok, 以上是对英伟达官方信息和行业逻辑的解读。 ai 不 迷路,节食不陪你走 ai 路!

为什么现在的 api 几乎都返回 jsoun? 很多人以为 jsoun 天生最强,但其实它是靠清量、解析快和生态才成为主流的。要搞清楚,关键要看 jsoun 比 xml 轻在哪里,解析为什么更快,生态怎么铺开的,以及何时还得用 xml。 看完你就能回答为什么 api 几乎都返回 jsoun 以及何时反而该用 xml? 那 先看 xml 比 xml 轻量在哪。 因为 js o n 比 x m l 更清亮、更易读,而且 java script 原生支持,所以现在 api 几乎都返回 js o n, 但这只是表面原因,更深层的是生态和工程效率的胜利。 很多人以为 js o n 天生就是最优秀的数据格式,其实它最初只是 java script 里一个简单的数据记法,之后能流行起来,完全是因为它正好踩中了 web 开发最核心的需求。 打个比方, xml 像一份公文,每个信息都要用开闭标签包起来,而 j s o n 更像一张便签,只写关键内容就行。那同样一段数据, j s o n 到底是怎么做到更短更干净的? 我们来看同一段数据,比如一个用户对象有名字、年龄、爱好用 x m l 表达,需要 user 标签包起来,里面每个字段都有开闭标签,比如 name 是 张三字段,名只出现一次, x m l 里标签名至少出现两次数据一多重复的字节就上去了。而且 j s o n 用中括号表示数组比 x m l 的 嵌套子标签直观得多。这种简洁不仅让体积变小,阅读起来也像看一组建制队,直接对应了程序里的对象结构。 那解析更快,是不是就因为体积小了?这只是一方面, j s o n 的 语法结构本身还让它解析起来更快。 解析 j s o n 为什么比 x m l 快, 体积小肯定有帮助,但更关键的是, j s o n 的 语法定义极其简单,只有六种值类型,对象、数组、字母串数字、布尔闹。 解析器从第一个字母就知道接下来要处理什么。遇到花括号键对象中,括号键数组几乎不需要回溯,而 xml 复杂得多,它要区分标签属性、命名、空间、注视 c data 实体引用,而且还得验证标签是否正确。嵌套闭合。 很多 xml 解析还需要加载整个文档,构建一个 d o m 数,内存开销大。而 g s o n 可以 流式解析,一边读一边生成对象。这样一对比, g s o n 解析就像是在高速公路上开车, xml 则像是在市区里等红绿灯。 既然解析快,那为什么所有语言都愿意内置支持 g s o n? 这背后是更重要的生态逻辑。 jsoun 能成为几乎所有编程语言的标准配置,根本原因在于它的数据模型太通用了,对象、数组和几种基本类型,这正是现代编程语言的核心抽象。 jsoun 里的数据直接就能映射成语言里的字典和列表,不需要像 xml 那 样,还得用一个叫绑定或者映射的中间层。再加上 web 的 推动, javascript 在 浏览器里天然支持前后端统一格式开发效率直接拉满。 当 node js 和 restful api 流行起来, js o n 就 成了默认选项,所有语言如果不原生支持,就等于自外于这个生态。但话说回来, js o n 是 不是在所有场景都是最好的?其实不是,有些地方 xml 依然不可替代, 什么时候你反而该选 xml? 举个真实的例子,金融行业的交易报文,那种数据要求及其严格,每个字段都必须有明确的定义、类型、约束和验证规则,而且传输双方往往要用一个标准化的文档格式来保证理解一致。这时候 xml schema 和命名空间的价值就体现出来了。 jsoun 虽然能传数据,但缺乏原生的强类型和强制验证能力。再比如文档标记, word 文档的底层格式需要在一个段落里穿插着,告诉程序哪里加粗哪里变红,这种混合内容 jsoun 就 很难表达。 还有需要做数据转换和长期存储的场景, xml 有 xslt 这些成熟工具,所以 jsn 不是 万能药,它在需要严格复杂文档化交换的领域并不如 xml。 理解了这些边界,我们再回头看 web, 最终选择 jsn 最根本的取舍是什么? 最根本的取舍其实就是 web 选择了简单和效率,牺牲了严格和自描述。 web 开发追求快速迭代,前后端分离,数据结构通常不复杂,而且大部分场景里,开发者最需要的就是把数据库里的记录原样传给前端, js o n 刚好满足这个需求。它没有任何多余的设计,上来就是数据所见及所得。 xml 本来想解决更多问题,比如数据发布、可扩展标记,但这些能力反而成了负担。这背后其实是一个挺朴素的道理,技术世界里没有绝对的好坏,只有适合场景的才是最好的。 下次当你理所当然地用 js o n 时,可以想一想,你要的究竟是轻快还是严谨。理解了这种取舍,你就真正懂了数据格式的选择。

黄仁勋自己都说了, ai 真正吃掉红利的,是在白菜价算利之上做出杀手级应用的人。他在暗示一件事,卖铲子的最终干不过挖到金的。上一期我们说到,大模型正在变成基础设施, 模型层竞争迟早消失。但今天所有人砸进去的钱,绝大部分不是砸在模型上,是砸在算力上。那问题来了,模型成塌了,算力层还能撑住吗?先看这组数字大漂亮的星际之门,计划四年投五千亿美元, 谷歌一年资本支出一千八百到一千九百亿,法国一千零九十亿欧元搞欧洲版星际之门,印度信使集团三百亿美元建全球最大数据中心,沙特五十亿。 光是这些头部项目加起来,就轻松超过万亿美元。这个场面你见过吗?这个场景跟二零零零年全世界疯狂扑光纤光缆的时候一模一样。互联网需要贷款,贷款不够用,谁有贷款谁赢。 后来全球光纤产量集中释放,宽带从稀缺变过剩,价格暴跌百分之九十,铺光缆的公司倒了一片。但真正讽刺的是,谷歌、亚马逊、 facebook。 今天最赚钱的互联网巨头,恰恰是在宽带白菜价之后才起飞的。因为宽带便宜了,创新的成本门槛就低了。算力正在走同一条路。斯科的 cto 说,产量跟上需求至少需要两年, 二零二七年底之前不会好转,但二零二七年之后呢? hbm 扩产、国产、算力适配、推理效率优化三条线,同时在降本, 快思慢想。研究院的田丰判断,三到五年内,算力成本急剧降低。当算力从稀缺便过剩的那天到来,英伟达的命运就是当年基益的命运。 g e 是 干什么的?卖发电机的爱迪生时代,美度电极贵,发电机是稀缺战略物资, g e 是 最值钱的公司。但电网普及之后,发电变成了公共事业,发电机的溢价消失了。最终赢家不是卖发电机的,是用电的人。用电造出了冰箱、电视、电脑、互联网, 英伟达就是 ai 时代的基因。黄仁勋卖的是 ai 发电机,当算力电力化变成像水电一样的公共设施,英伟达的垄断溢价会崩塌。不是他做错了什么,是时代变了。黄仁勋自己都说了, ai 是 五层蛋糕,能源芯片、基础设施、模型、应用最上层的应用环节,提供最大的经济红利。 他在暗示一件是卖铲子的,最终干不过挖到金的。但算力过剩不会让算力公司死,会让他变成基础设施运营商,向国家电网体量巨大,但利率平庸。真正吃掉红利的,是在白菜加算力之上做出杀手级应用的人。 那这个人是谁?上一期我留了个问题, ai 时代吃掉模型的会是什么?答案是一个 agent 分 发层,一个足够聪明、足够便宜、无处不在的 ai 助手,成了你和所有模型之间的唯一界面。当模型变成水,算力变成电,真正值钱的是那个帮你拧水龙头,帮你擦插座的东西。 它不生产水,也不发电,但它决定你用谁的水谁的电。这个东西就是我们第三期要讲的超级 agent。 它不是导致一家独大这么简单,它要做这事情,是让前面所有的竞争都变成它的后台,过路费生意。

大家好,最近应该都更新了英伟达的新驱动和 app 了,我的 cpu 是 要缩位缩的,一三九零零 k, 显卡是五零七零 t, 分 辨率是四 k 一 二零 h g 刷新率的电视这几天尝试了各种模型和档位切换,为了追求高帧数,一直用的是官方推荐针对四 k 优化的 l 模型加超级性能。但是玩着玩着发现新模型有一些问题, 比如这里的阳光粒子新模型, m 性能和 l 超级性能明显,颗粒更大,噪点严重,还不如 k 模型的超级性能柔和,更不能和 d l a a 比了, 放大了应该能明显看出区别。 准备好前方高能 新模型,这里树叶的闪烁比较严重, dl a a 作为标杆,就连 k 模型超级性能都比 m 和 l 模型好,真是树欲静而风不止啊,笑死了。 最后大家看顶上的帧数,追求高帧数和画面稳定性,还是选 k 模型加超级性能吧, m 和 l 等后续版本更新修复了再测。那么你会怎么选呢?如果能帮到你的话,顺手点个关注吧, 谢谢大家的点赞和关注!