粉丝9.9万获赞27.4万

当所有人还在盼着英特尔能在红绿大战里当一条鲶鱼的时候,没想到这条鱼不游了,直接沉底了。据威利尤克尔的最新确认,英特尔第三代游戏独显正式取消,至于下一代的 x 一 四架构显卡,前途也一片漆黑。注意,这还不是缩减投入的体面说法, 而是整个部门全部重组,去搞数据中心 ai 芯片。要知道,英特尔最早在一九九八年就做过独立显卡,但当时英伟达已经跑了三年, a t i 更是已经做了十一年。结果英特尔直接退厂二十多年,直到二零二二年才重新进厂。 你看这二十五年里,他在桌面读写市场的份额从来没突破过百分之一。百分之一是什么概念?在 steam 每月的硬件调查里,这个占比甚至排不进前十页。 更扎心的是技术层面,当老黄的 d l s s 三点五和苏妈的 f s r 三都已经让中低端卡跑出旗舰帧数的时候,英特尔的 s s 连主流三 a 大 作的适配名单都没凑齐。 你看高端市场 r k 七七零,连 r t x 四零七零的尾灯都看不见,中低端市场又被对手的上一代库存卡疯狂压价,这不是困兽之斗,是英特尔烧了三年前后终于发现这个牌桌它根本上不了。 所以现在英特尔的选择很明确,砍掉游戏独险,保住核潜老本行,把真金白银全部压住到数据中心和企业级市场。这不是战略转型,是断壁求生。烧掉几十亿美元后,终于承认没有生态护城河,没有核心技术壁垒,再大的巨头在游戏显卡这个战场上也只能被扫地出门。

你见过能理解物理世界的芯片吗?英伟达刚刚预告将发布让世界前所未见的 ai 算力怪兽, 这不仅是性能的飞跃,更可能是一场改变人机交互规则的技术革命。当地时间二月十八日,英伟达创始人兼 ceo 黄仁勋在接受媒体采访时,为即将于三月十五日在美国圣荷赛举行的 gtc 二零二六大会进行重磅预热。 他明确表示,将在大会上揭晓世界前所未见的全新芯片。这一预告迅速点燃了全球科技界与资本市场的关注, 因为作为 ai 算力领域的绝对领导者,英伟达的每一次重大架构革新都直接定义了未来数年 ai 基础设施的发展方向。黄仁勋坦言,研发这些芯片并非易事, 因为所有技术都已逼近物理极限。但他对由英伟达与 s k。 海力士内存工程师组成的团队充满信心,认为没有什么是不可能的。 此次大会的核心主题将聚焦 ai 基础设施尽在的新时代,预示着英伟达将展示其超越当前竞争维度的下一代技术布局。尽管黄仁勋尚未透露具体细节,但结合其前所未见的描述,英伟达已公开的路线图及行业分析,市场普遍认为新品可能指向两个主要方向, rubin 系列的深度衍生芯片在 c e s 二零二六上,英伟达已正式发布 vivo rubin ai 平台六款芯片进入全面量产。 此次可能发布该系列中更特殊或此前曝光的型号,例如专为特定推理场景优化的 rubin c p x。 这类芯片将在 rubin 以大幅提升的能效基础上,针对延迟、内存待宽等推理瓶颈进行极致优化,下一代 fanman 架构的提前揭晓,这是目前业界更为关注且认为更具革命性的猜测。按照英伟达一年一架构的节奏, fanman 原预计在二零二八年登场, 但激烈的市场竞争和 ai 技术路线的快速演进可能促使英伟达提前展示其核心蓝图。 fenman 被普遍视为专为下一代 ai 世界模型而设计的架构, 其目标不仅是算得更快,更是让 ai 能理解并预测物理世界的运行规律,这将是真正意义上的范式转变。 综合来看,发布 robin 衍生芯片是稳健的迭代,而哪怕只是前瞻性的展示 fanman 架构的愿景与技术路径,都更符合前所未见的震撼性表述, 并对整个产业生态产生深远影响。如果英伟达此次真的指向 fanman 架构,那么我们将目睹的不仅是一次芯片升级,更是英伟达为未来十年 ai 发展铺路的基石。要理解它的革命性,需要将其致于英伟达清晰的三代架构眼镜逻辑中。 首先是 blackwell 时代解决能不能训练出来,核心任务是提供近乎恐怖的浮点算力和高宽带内存支撑万亿参数大模型的训练, 其标志是庞大的芯片面积和极高的单体性能。其次是即将到来的 rupee 时代解决能不能大规模部署, 重点从训练转向推理,追求极致的单位功耗性能和推理能效,目标是让 ai 在 工厂、医院、自动驾驶等真实场景中稳定、高效、经济的运行。 最后是 fanmen 时代解决能不能理解物理世界,其使命是服务于世界模型。这种 ai 不 仅处理文本和图像,更需要在内部构建物理规律的模拟器,以预测如果推开这扇门,后面的物体会如何运动。 这对芯片的实时计算、数据存取延迟和系统可能性提出了指数级更高的要求。为应对世界模型的苛刻需求, fanmen 预计将在多个层面实现颠覆性创新。 一、核心突破三 d 堆叠集成 lpu 融合通用与专用芯片优势这是 fanmen 最核心的改革。传统 gpu 在 应对语音对话、实时决策等低延迟推理任务时,会因内存访问瓶颈而产生延迟。 而像 grootq 这样的公司,其 lpu 通过确定性执行架构和全 sram 设计,在此类任务上实现了惊人的低延迟。 fan 的 策略不是与之对抗,而是融合。它预计将采用台积电最先进的 soc 三 d 堆叠技术,将专为优化推理而设计的 lpu 单元直接堆叠在通用 gpu 计算核心之上。 这相当于给一个强大的通用大脑嫁接了一个专精快速反射的专用神经。从其结果是,单张芯片既能保持英伟达在训练和 c u d a 生态上的绝对优势,又在关键推理场景上获得媲美甚至超越专用芯片的低延迟性能,实现一卡通吃。二、 工艺与设计 a 十六制成与背面供电突破物理极限 fineman 有 望采用台积电下一代的 a 一 六工艺,这不仅是晶体管尺寸的微缩,更将集成背面供电技术。 传统芯片的供电和信号线都在正面抢地盘,限制了布线密度。背面供电将电源网络移至芯片背面,为正面释放出宝贵空间,这正是实现高密度三 d 堆叠互联的关键前提。 应对存储墙随着制成先进到两纳米以下, s r a m 单元的微缩已几乎停滞在先进逻辑芯片上。直接集成大容量 s r a m, 成本极高、面积效率低。 finim 的 三 d 堆叠方案,将大容量 s r a m 用相对成熟的工艺制成独立的芯片层,再与主计算芯片堆叠,完美规避了这一问题,以高性价比实现了海量片上缓存。三、 系统级飞跃迈向一兆瓦机柜基础设施面临重构。飞猛的性能飞跃伴随着惊人的功耗,市场预测其最高系统配置的机柜功耗可能逼进一兆瓦。 这相当于一个小型工厂的用电量被压缩进一个机柜里,这将彻底改变数据中心的基础设施。 夜冷从可选变刚需,风冷散热已完全无法应对,高效冷板舍或浸没式夜冷将成为唯一选择,带动整个散热产业链升级,电力配送成为核心瓶颈,数据中心对高压配电、高效电源模块的需求将急剧增长, 电力电子产业将直接受益。总结而言, finman 架构代表的是一种全新的芯片设计哲学。在摩尔定律逼近物理极限的后时代,通过系统级的三 d 堆叠易购整合与先进封装,将通用计算的灵活性与专用计算的极致效率融为一体。 它不仅是英伟达巩固其 ai 王座的技术利器,更是其为 ai 理解物理世界这一宏大趋势所搭建的底层算力基座,三月的 gtc 大 会,我们或许将窥见这个未来的第一缕曙光。

彻底炸了!尤伟达最近直接取消了显卡的建议零售价,连给厂商的控价补贴也砍掉了,这意味着以后显卡卖多少钱全看渠道和商家们的良心了,价格呢,恐怕要彻底失控。以前好歹还有个官方建议价做个参考,现在连表面功夫也不做了, 直接放手不管,这样下去,恐怕连五零六零这种卡都有可能被炒上天。以后买显卡既没底价也没上线市场,完全由渠道和 囤货的人说了算。作为兄弟们这个行业的老学长,确实挺担心的,普通玩家以后想安心配台电脑会不会越来越难了呢?希望大家还是理性看待,多做功课,别急着跟风,我们一起冷静观察,总能找到合适的入手时机。我是阿润,陪兄弟们一起选电脑不踩坑!


最近 youtube 科技博主爆料,因为他将停止 opp 补贴计划这条消息,目前虽然官方没有明确的发布相关的公告,但已经通过合作伙伴渠道明确的传达, 多家权威的科技媒体均以页内消息源确认了这一消息的真实性,目前市场价格走势也印证了官方补贴的消失。 我们首先来说一下什么是 opp, 简单来说,这就是英伟大为了解决显卡价格长期高于官方建议零售价的这么一个问题,向合作伙伴提供一种补贴金。 opp 计划的运营呢,非常直接,他分两步,第一,先卖合作伙伴,显卡品牌必须承诺至少有一定的比例显卡以官方建议零售价出售,而不是随意的涨价。 第二步,后步,如果卖出的这些原价显卡,英伟达会根据显卡的芯片和显存的实际生产成本,返还一定比例的现金补贴给合作伙伴。这样做就是为了抵消高昂的显存成本等因素,让合作伙伴不至于亏本。 作为我们普通人,通俗的理解就是英伟大取消了建议零售价,英伟大这样的行为就会导致板卡商低价补贴消失,再加上显存的成本上涨,直接导致终端零售价失去锚点, 返卡上将获得完全的定价权,可将成本上涨直接转嫁到中端市场。聊到这里,大家会不会有个疑问,理论上来说,显存的成本上涨就大方的告知消费者,因为显存上涨,我的建议零售价也就上调, 让消费者知晓,这样做的话不就是更有利于市场品牌的成型吗?其实这个问题从商业角度上来看,当前的做法对英伟大更有利,至少有两个因素,第一,避免显存价格波动剧烈的冲击, 因为现在显存的价格波动导致频繁的调整,建议零售价会给消费者造成价格不稳定的负面影响,不如让灵活的市场定价来消化成本。第二,转移矛盾聚焦点。 终止 opp 以后,定价全交给了板卡商和零售商,最终的市场高价会更多地表现为渠道商加价的行为,而非英伟达官方大幅的提价,这样呢,有助于维护英伟达的品牌形象。 所以,英伟大这个决策的逻辑而并非是为了市场诚信,而是出于利润保护和商业风险转移的现实考虑。对此,你们有什么看法呢?好了,关注我,带你用不一样的视角看世间烟火百态!

这期视频聊一下 lpu 啊,先科普一个基础概念,就是 ar 大 模型推理过程,可以拆解为两个特性完全不同的阶段,一个是 preview 阶段和 decode 阶段。 preview 阶段呢,我们把它叫做预填充阶段,上下文阶段或叫理解环节, 就像我们人类阅读理解这个动作,它主要的任务是把我们输入的问题描述啊,就是我们常说的提示词 prompt。 预填充阶段呢,就是把我们输入的提示词生成 kv 缓存的过程,这个阶段计算量会比较大。那么 decode 的 阶段呢?我们叫它解码阶段或者生成环节, 就像我们人类在理解问题之后啊,一个字一个字的在纸上写出答案。解码阶段呢,主要任务是基于上一个阶段生成的 k v 缓存足字生成答案。 这里的输出的每一个字啊,就是我们常说到的一个 token。 这两个阶段各有什么特性呢? prefer 阶段需要很高的算力,但是对内存贷款要求就没那么高。 那么 decore 的 阶段呢,需要很高的内存贷宽,但是算力需求呢,又相对较低。那整个推理过程如果全部都使用通用 gpu 的 话,会造成什么情况?就是在 prefer 阶段, hbm 的 高贷宽内存就会被浪费,因为这个阶段主要任务就是计算嘛。 那么在 dico 的 阶段呢,算力又相对被闲置了一部分,所以两个阶段都有对应的算力,或者是存储资源被浪费了。英伟达呢,针对这个问题,就推出了专用的 gpu 芯片加通用 gpu 的 解决方案,这个专用芯片就是计算性能很强的 c p x 搭配的是 d d r 内存, c p x 就是 用于应对 prefill 阶段的高算力、低存储待宽的场景。所以在 ru 饼架构中,由于 c p x 的 加入,就分成了三个版本。第一个版本就是传统的 g p u 版本,依然全是 g p u, 那 这个呢?主要用于模型训练。第二个版本就是 c p x 集成版本,就是在计算抽屉内增加了 c p x 机柜版,就是两个传统 g p u 机柜加一个 c p x 专用机柜。 如果客户选择的版本中加入了 c p x 选项,那就可以在保证推理性能的同时呢降低硬件成本。因为如果客户是推理业务居多的话, c p x 就 可以替代价格更高的传统 gpu 来完成 prefil 阶段的任务。所以这就是英伟达官宣的 rubin 系列 能使推理成本降低百分之七十的一个重要因素。好了,我们知道 cps 是 应对 prefill 阶段的降本增效,那下面轮到 lpu 了。什么是 lpu? 我 们先来念一段解释。 lpu 是 语言处理单元的首字母缩写,就是 language processing unit。 它是英伟达收购 google 之后,基于 google 的 核心技术推出的一款专用推理芯片,专注于 ai 带模型实时推理任务,尤其是 decode 环节。看见没? lpu 是 应对 decode 环节的, polyfill 有 cpx, decode 有 lpu。 所以知道为什么达哥要收购 colco 的 这个技术和人才了吧。两只翅膀配齐了,整个推理流程不就得起飞了吗?大家以前都叫着英伟达的 gpu 训练强推理呢,不如其他专用芯片性价比高,这么一来不就补齐推理场景的短板了吗? 这就是英伟达打造的训练用 gpu 推理,可选 cpx 加 lpu 的 全站方案。 lpu 和 gpu 的 对比细节大家估计也不感兴趣,就不展开讲了,我们做个比喻好吧, gpu 就 好像一列高铁, lpu 呢,就好像一辆 f 一 赛车级别的出租车,各种推理任务,我们就把它比作乘客。高铁和 f 一 都跑得很快对吧?区别在于高铁一次能运很多乘客,但是发车时间不灵活,它是固定的嘛, 不是我们想走就能随时走的。而 f 一 出租车呢,一次只能运送少量的乘客,但是随叫随到啊,响应非常及时。 另外, lpu 和 cpx 一 样,也不搭配 hbm, 而且使用的是算存一体架构的芯片设计方案, 用的是 sm, 所以 宽带更高,比 hbm 还快十倍,这也是达子为了将来能摆脱 hbm 限制的战略备份方案。好了,说完优点,我们也来分析一下 lpu 可能存在的局限性。第一个呢,就是 lpu 的 成本也很高, 就是 sram 存储密度比较低,价格呢也贵,而且要几百个芯片串联才能跑大模型, 就是硬件成本高嘛。第二个呢,就是通用性比较差, lpu 是 专用芯片,仅针对大模型推理,尤其是 扣的环节的优化,所以未来 ai 技术方向如果发生重大变化的话, lpu 就 可能面临风险。你在某个特定场景是优化到了极致,那朴实性肯定就没有传统的 gpu 好 了,对吧?而且 lpu 用的是 sram, 容量不会很大,所以不适合跑超大规模的模型。 还有一个是想要充分发挥 lpu 的 性能化,需要专业人员协助进行深度优化,这点就像谷歌 tpu 啊,模型调优需要制造商全面协助,这点呢,也进一步限制了 lpu 的 适用场景。 第三个就是散热难度, sram 用多了,散热就是大问题嘛。这里我纯粹个人猜测一下, lpu 如果落地,那液冷的使用场景是不是又多了一个?好了,分析一下 lpu 对 产业的影响。 第一个对 pcb 产业呢,肯定是明确是正向的, lpu 硬件结构需要单机柜内容量更多,板卡内部传输数据呢,更依赖 pcb, 而且对 pcb 提出了更厚、更大层数更高的需求,这将拉动高端 pcb 比如高多层板的需求。那请问高多层板哪加强? 第二个, l p u 带来的并非都是纯粹的市场增量,更多的是对原有 g p u 方案在特定场景下的替代,它不是创造了全新的需求啊,所以实际销量和市场需求占比还有待观察。但是有点不可忽略的地方呢,是 多家投行和机构啊,它的研报预测未来推理市场将占据 ar 算力的主要份额,所以说市场总量是越来越大的。但是 lpu 能占据的推理市场份额目前还无法准确评估,但是 lpu 拉动 sram 存储的需求,这点应该没有疑问吧? 好,第三个,供应链尚未定型,目前呢,供应链处于初步筛选和测试阶段,网上传的那些进入供应链的确切消息有没有老铁能告诉我哪几家是确定了的? 谁和你们说的 lpu? 介绍完毕,最后聊一下达子的 gpu 加 cpx 加 lpu 这么强悍,那谷歌 tpu 怎么办呀? 谷歌的团队内部呢,其实早就有准备了,那只是在等一个比较合适的机会吧,把技术拿出来匹配到某一代的 tpu 产品上。面对各种新技术的竞争啊,谷歌通常有两个选择,要么等技术落地成熟, 直接用别人的好方案,要么自己从头研发一个对标的。之前视频我聊 c p u 的 时候呢,也说过 c e s p, 大 厂对于新技术的态度都是类似的,就这两个选项嘛。所以谷歌的一贯作风啊,它大概率是选第二条路自己干, 这样才能把核心技术抓在自己手里,对吧,不被别人卡脖子,这也是符合他从芯片到模型全站制研的战略。好了,这期视频有点长哦,大家点赞收藏慢慢消化,拜拜。

天塌了!英伟达原计划二七年量产的六零系显卡推迟,原因就是因为显存潜能不足,英伟达现在把重心放到了利润更高的 ai 市场,六零系显卡起码要推迟到二八年甚至二九年。未来三年内,五零系显卡可能都是最新款, 并且原定于今年发布的新显卡也全部取消,整个二六年也没有新显卡能用了,游戏玩家这下彻底被抛弃了, 所以现在最好老老实实去入手五零系显卡吧,刚好现在还有显卡多重补贴可用,直接给大家看酒包的战绩,下面就来教大家如何拿下。首先我们打开东哥,进入首页搜索零补贴六六六, 先领取一个显卡,无门槛叠加大鹅包子,再继续搜索领券,六三零里面还有显卡专属的平台,补贴可叠加。最后再搜索学生优惠三五零,学生党还能再额外使用教育补贴,全部操作完,就能每每拿下新显卡了。

最近刷到很多人说英伟达突然断供了自动驾驶芯片,国内厂商要哭了,标题一个比一个吓人。 事情的起因是英伟达的供应商发布了通知,因为 l p d d r 四内存全球短缺,英伟达将提前终止多款接踵千兆四 ai 芯片的供应,包括 tx 二啊、泽威尔系列, 也就是很多自动驾驶、工业机器人、无人机厂商用了五到六年的标配芯片, 这些型号已经被标记为不可取消、不可退货,最后下单期限就在今年七月,之后就全面停产了。很多人慌,慌了,我们的自动驾驶怎么办?机器人设备不就停摆了吗?其实没必要慌,这并不是针对中国的断供制裁,而是老产品的提前退役。 tx 二这玩意都是五至八年前的老款芯片,原本就到了生命周期末期,这次是因为内存供应短缺,不得不提前停产。新一代的 orange 索尔系列还在正常供应,只是很多中小厂商还在用老款方案。 真正受影响的是那些长期依赖英伟达开发版,没做国产替代的中小团队。很多工业机器人、边缘 ai 设备从研发到量产全靠接诊平台,现在突然断供,确实会面临供应链紧张、价格上涨的短期征途。 但换个角度来看,这恰恰是国产边缘 ai 芯片的黄金机会。以前很多厂商觉得英伟达的芯片好用,生态成熟,就懒得更换国产方案, 哪怕知道有被卡脖子的风险,也抱着能用一天是一天的心态。现在断供来了,大家才突然发现,原来我们早就有能打的国产替代了。 国产的方案、性能、接口、生态都已经成熟很多,甚至能直接兼容英伟达的开发环境,不用大规模改设计。 以前大家不选,不是因为不好用,而是没动力换,现在动力来了,国产芯片的市场空间一下就打开了。国产替代不只是替代,更是超越。很多国产芯片已经用上了更先进的 l p d d r 五内存 更新的架构啊,不仅解决了内存短期的问题,性能和稳定性甚至比老款英伟达芯片更强,价格还更优势。 以前我们总说国产芯片要弯道超车,很多时候,市场的惯性和用户的依赖让我们很难真正突破, 这是因为它的提前停产,反而给了国产芯片一个破局点,让大家看到,没有谁是不可替代的。我们自己的技术其实早就准备好了, 短期来看确实会有阵痛,很多厂商要紧急切换方案,重新测试、调整供应链。但长期来看,这是中国边缘 ai 产业百货对外依赖、实现自主可控的关键一步。我是陆小乖,我们继续分享前沿动态。