用 cursor 和 compiled 写代码,你每花一块钱,有九毛八都被浪费了。有人晒出六周 cursor 账单,六百三十八美元,最贵一次请求烧了六百八十万 tokens。 为什么?因为 ai 编程工具底层还在用 grab 思路,先全网扫描整个代码库,再让大模型逐条过滤。本质上是搜索方式太原始, grab 只能做文本匹配,搜不出语义, 所以 ai 不 得不把所有可能相关的代码全塞进上下文,让大模型当过滤器用。今天 hn 首页的三步换了个思路,用十六米参数的静态嵌入模型做羽翼解锁锁影。一个仓库只要两百五十毫秒,查询一点五毫秒纯 cpu 就 能跑,不需要 gpu, 解锁质量跟代码专用 transformer 一 样,但 token 用量直接砍掉百分之九十八。它已经支持 mcp 协议, cloud code、 cursor codex 都能直接接。 但这事真正值得想的是,如果仅仅换一个搜索引擎就能省百分之九十八的 token, 那 ai 编程工具链里还有多少这种低效环节?我是叶哥,专注 ai 编程效率, sample 这个项目我会持续跟进,关注我后续深度拆解它的技术原理。
粉丝1974获赞1.4万

字节放大招,我用了一周 cursor 和 tree, 告诉你真实差距。先说结论, cursor 是 付费王者, tree 是 免费黑码, cursor 每月二十刀, tree 目前完全免费。钱差这么多,体验差多少? 第一个,代码补全, cursor 的 补全更快更准,特别是理解你项目上下文这块, tree 稍慢,但日常使用够用。 第二个,聊天助手, cursor 可以 读你整个项目, tree 只能读当前文件,这里差距明显。第三个,价格, cursor 要钱, tree 免费白嫖。说实话,如果你有钱,要做大项目, cursor 依然是大哥。 但如果你只是想写个小工具,做个副业,项目 tree 免费版完全够用。我是实用主义者,我选 tree。 你们用的是哪款? curser 派还是 tree 派?评论区 battle 一下,觉得有用就点个赞,关注不走丢,下期我要做个骚操作,用 ai 直接生成一整个 app, 猜猜用了多久?

我估计顶多一两年以后豆包绝对会收费。我现在才明白,其实豆包是亏钱的,比如你跟豆包对话就在消耗拓客本来应该收费, 只是现豆包在补贴而已,其背后的就是流量啊,他有点像中移动的那个流量费用电话费一样,这是个巨大的产业。拓客你可以理解为就是就。你问豆包明天深圳天气怎么样,十个字嘛,等于大概差不多就五个拓客,现在一百万个拓客才卖八块左右,但海外卖的贵 托肯,还有低级托肯,跟高级托肯他们价格差七八倍。我还以为说我说我问豆包这个消耗是低级托肯,他不,他这个是。呃,那个推理,这是消耗的高级托肯 其实很昂贵的,我一个朋友在广州,原来做算力设备的,最近他就在做托肯的中介,他就找很多那个云计算中心去采购这个托肯,然后再卖个腾讯,他还组建了个队伍去给工程师打电话,说我这里有便宜的托肯,因为现在那些大公司卖的贵,就是刚刚盈利第一个月,他说他能赚六十万。我仔细了解了一下, 这个确实是成立的,但我认为这属于巨头的生意,未来就属于那种大的云计算中心,大的托管工厂。因为托管又分种类,比如 deepsea 的 托管跟那个豆包的托管都不一样, kimi 也不一样,开源闭源也不一样,还有高级和低级差好多倍呢。但是我们俩这个趋势是在我第一 是听说他妈卖托可能挣钱,你买一台那个 b 三百的服务器,大概六百万一台,两年半就能收回成本,这个回报很高了好不好?这个托肯真的,我也正在研究,但我确实看到我周围这个小兄弟本来是亏损的,现在一个月他公司有四五十号人,第一次叫做到 卖托肯,一个月利润六十万。而中国托肯出海也是个大买卖,我现在我们是叫做跨境电商,把商品卖到全球去,未来就是卖托肯,因为中国是电力便宜啊。你看像那个智普的托肯吊链已经是排在全球第一了,全球大模型消耗托肯链,中国占六成,美国只占四成。 全球除了中美之外哪里还有大模型?你听说非洲什么日本啊,日韩啊,哪里搞出来这个大模型?我们已经习以为常了,但我在那些地方没人才, 也没有这个技术,说托肯出海是个好牛逼的生意,你不就是把无形的商品卖到全球去吗?哎,这是国家支持的,这跟那个挖那个什么比特币的矿还不一样。但托肯出海这个是好大的买卖,我最近也在看,在研究,我第一次看到有人倒卖托肯挣钱的。

我们今天这个视频来讲, ai 的 coding 套餐现在到底应该怎么买,买哪一些,然后怎么样安排会比较合理呢?最近半年啊,我们知道 ai 的 coding 套餐完全都变了,海外这些主流工具啊,都在收紧。比如说像 github 的 co pilot, 砍掉了 opus 模型,停止了注册,六月一号全面开始按量计费。 比如说像 cloud 增加了身份验证,还一度把 cloud code 从二十元的套餐里面去拿掉。比如说像 curser 和 winsolef 呢,也早就从二十元的套餐里面去拿掉。比如说像 curser 和 winsolef 呢,也早就从暗四变成了暗量计费,可以说整个行业都在大涨。 我自己现在呢,每个月订阅的套餐总金额超过三千块钱人民币,然后每个月消耗的大概几十亿的 token, 真正的这个 token 使用量的价值啊,我估计超过这个两万元人民币,并且还在快速的增长。三个月前呢,我录过一条类似的视频,那个时候跟大家说的是,我每个月大概会用三亿 token 左右, 像短短三个月过去呢,已经翻了十几倍,实在太快了,根本就不够用。所以我跟大家关心的问题其实也是一样的,就是现在这些 token 套餐到底该怎么买,买 哪一些,怎么样安排会比较合理呢?我自己大量使用之后啊,其实结论很简单,就是不同的强度买法不一样,比如说轻度用户,你就买顺手的。中度用户呢,买性价比,重度用户啊,要买灵活性,越重度啊,就越不要把模型跟工具绑死。 具体是什么意思呢?我来跟大家展开说一说。先来说一下我的这个判断框架,就以前选扣进套餐啊,看三件事情,第一件事情呢,就是模型聪不聪明,第二个呢就是速度快不快,第三个呢就是额度给的够不够, 现在呢,这三件事情还不够了,还要加。第四件事情就是模型跟工具能不能分开。我们知道啊,模型呢,负责智力这个整体的能力,然后工具呢,也就是现在比较流行的说法, harness engineering, 负责上下文的管理啊,智能体的编排啊,其实跟模型同样的重要,这两件事情啊,你最好不要一对一的绑死,让你的模型呢,可以接入任何的工具,比如说你喜欢 cloud 的 模型, 当然可以买 cloud max 的 套餐,然后只在 cloud code 里面用,这样呢,性价比最高。但是呢,如果你买的是通用的 cloud a p i 接口,那你就可以在别的地方也用上 cloud 的 模型,比如说接入你的 open code, 接入你的小龙虾,接入你的这个 pi agent, 或者是任何你自己写的这个脚本啊,智能体等等,不一定非要用 cloud 的, 自己的产品,反过来也是一样,就是你的工具啊,最好能接任意的这个模型。 cloud code 是 现在最火的,这个智能体 现在迭代速度也很快,经常支持一些新功能,新的工具的调用方式。但这些新功能啊,经常是围绕 cloud 的 自家模型 跟自家的这个 api 来设计的。如果我用这个国产的模型去接新版的这 cloud 扣的,经常会遇到两类问题,要么就是缓存失效,然后成本跟延迟大幅度的上升。要么就是新模型的特性啊,接不上 agent 呢,有时候看起来突然会变得笨笨的,这个是为什么呢?就是 astropica 啊,其实就在用套餐来补 here cloud code 锁住开发者在自己的生态里面,目的呢,是获得宝贵的这种用户的使用数据,以后呢,可以用来做训练的。这个技术的数据模型跟工具绑定的太死啊,你就只能跟着它的节奏,我在里面走,我自己呢,现在也在降低对 cloud code 的 依赖,比如说平时写代码的任务啊,会更多的交给 open code, joy 的 这样的工, 非代码类的任务啊,一律都交给这个 pi agent, 因为 ai coding 是 整个行业里面变化最快的一个赛道,模型在变,工具也在变,大家现在呢,可能觉得灵活性啊,是一个可有可无的东西,但是如果你用 agent 用的越来越多啊,这个灵活性绝对是一种必要的风险控制。 接下来呢,我们就来分别讨论一下海外的套餐跟国内套餐。我们先来说海外的,然后来看这个 copilot。 四月二十日啊, github 宣布 pro 套餐呢,砍掉了 opus, 然后并且暂停了新用户的注册。一周后呢,又官宣说六月一日,所有的 copilot 套餐全面转向 usage based billing。 什么意思呢?就是 完全按量付费,十刀的套餐呢,只能用十刀的使用量,三十九刀的套餐呢,也只能用三十九刀的使用量,完全没有任何套餐的这种优惠。 copilot pro 这个也从以前很高的,这性价比啊,现在基本就归零了。然后呢,我们再来看这 koser 跟 winserve, 它们都是编程的 ide, 你 买它们的套餐本质上就是锁定对应的工具了, koser 去年就从按次付费改成了二十刀额度的按量付费。最近啊, koser s d k 也开放了,但同样也是这个按 token 消耗来计费, enzo f 呢,从十五美元涨到了二十美元,超额的部分也是按官方价格计费。不过二十刀的套餐实测下来呢,大概会给到两百刀的。这个额度确实算比较大方的了。如果你用科斯经常显示说额度不足,那我就非常推荐转到无音色 f 了。这些工具呢,其实都很好用,但你越依赖他们的这个专属 agent 自动化的流程, 你的迁移成本以后就会越来越高。然后我们最熟悉的现在最紧俏的 kyc 要求身份认证,相当于呢,在定向了,清退中国的用户, 国内用户直接订阅的被封号的风险非常高。那通过中转站是不是就可以了呢?其实啊,中转站那就水就更深了,可能参假模型,可能跑路或者卖用户的数据很多很多,这些歪门邪道的,这个玩法真是防不胜防的。 而且目前的国内中转站,我使用下来,完全就是一个劣币驱除良币的一个趋势,越来越烂,这些风险都太高了,我其实是不太推荐的。那海外收紧之后,国产的扣紧套餐到底怎么样呢? 国产的 q 型套餐我觉得有个好处,就是大部分啊,都是通过 a p i 的 形式,没有锁定的工具。不过问题就是啊,国产的套餐如果按照模型强,速度快,额度足,这个过一遍的话,没有一个是全满足要求的。 比如说第一个 g l m 模型强,吐字慢,而且抢不到。我自己呢,就是订阅用户 g l m 五点一啊,能力在国产里面算是很强的了,但高峰期呢,只有十到十五的头肯每秒,下午跟晚上呢,慢到你真的限额都跑不完。 kimi k 二点六呢,能力是不错,但也涨价了。 k 二点六相比 k 二点五啊,单价大概涨了百分之二十左右。 后台的额度不透明,主观体验上给的额度呢,我觉得也不是太多。 mini max 呢,我觉得额度也够,然后速度也够,但模型能力呢,我觉得就 稍微低了一档。如果你玩小龙虾,跑一些日常的新任务啊,我觉得 mini max 是 非常合适。最近刚出的这个 deepsea v 四 pro 啊,能力很强,吐字也很快。 五月呢,有二点五折的这个活动,性价比非常的高,但活动结束之后,如果官方还是不提供这个套餐的选项,价格呢就比较一般了。不过 deepsea 官方透露下半年会部署大量的国产算力,我觉得这点呢,非常值得大家去期待一下。海外跟国产都评价完之后啊。最后呢,我想给大家一个我的推荐方案,如果你是这个轻度用户, 周只是让 ai 改改脚本啊,写个文档啊,那完全就不用折腾这个所谓的 a p i 接口,像 cursor, winsole, 国产的 tree 啊, coder 啊, cody 啊,哪个顺手你就用哪个就行了,完全没有关系。然后如果你是中度用户,跟重度用户的话, 我就推荐看看 gbt plus 或者 gbt 的 pro。 gbt 官方呢,允许你把 codex 使用的 a p i 接入到其他工具里面,方法叫做 os。 实际上呢,和通用的 a p i 没有区别,最新的 g p t 五点五也能这样用,二十刀的套餐大概能跑出两百到四百刀的这 a p i 等价的这个额度,我自己订阅的是两百刀的这个 pro 套餐,每个月将近能用到接近八千刀的额度,给的实在太多了,再加上这个 codex 啊,本身现在也是 t 零级别的工具, 所以这个套餐我是现在目前觉得非常能打的套餐。当然,如果你预算不高的话,我就推荐 opencode, 千问、 minimax 这些主流的这个国产模型,都能用十刀就能跑出六十刀的 a p i 额度,它给的呢是通用的 a p i, 也不限于 opencode 的 自己使用,并且承诺不保留使用数据,隐私方面我觉得做得更好。 winsolef 呢,虽然额度也给的很高,二十刀大概能有两百刀的使用量,但它的模型啊,只能在 winsolef 内部使用, 而且 winsole 的 agent 能力啊,明显就不如 codex 这个这样的工具了。不过呢,最后要提醒大家一句,不管是叉 g p t 还是 opencode 的 go 套餐,套餐额度呢始终在持续的调整,只是现在的额度还算厚道,计费呢也相对透明。最后呢,再来跟大家讲一下我的一些感悟,因为 ai code 的 套餐啊,涨价越来越高,然后一直都还没停。 我自己这半年最大的感受就是今天觉得性价比很高的套餐,过两个月呢,可能就砍额度了,改规则了。所以我现在选套餐不止看当下够不够用,还会想说,如果他涨价了,我能不能平滑的切换到别的方案工具跟模型分开,本质上就是给自己留一条这样的后路。好了,今天视频就到这里了,我是迪总,黑心李超,我们下次见。

哎,师傅,你们这是干嘛?对啊,不是说不限量嘛,怎么把菜都撤了?不是不限量嘛,我们还没吃够呢。 二零二六年四月, ai 编程工具的收费逻辑开始发生一次明显转向。过去。大家熟悉的是包月制,交几十块钱 copilot、 cursor、 cloud code 随便用,但在 a 阵子时代,这套账越来越算不平。 四月下旬, github、 antropic、 微软 cursor 接连释放信号,核心意思很一致,无限量或者近似无限量的 coding plan 正在退出主舞台, 取而代之的是更接近 token 请求量、优先级和算力配额的混合计费。为什么突然变了?原因其实不复杂, a 站的太能烧 token 了。以前 ai 写代码主要是补全几行,消耗可能只是几十到几百 token。 现在一次 a 站任务可能要读仓库、搜文件、改代码、跑测试、调用工具, 一个长绘画跑下来几十万甚至上百万 token 并不稀奇。对用户来说,二十美元包月很香,但对厂商来说,重度用户的实际算力成本可能远远超过订阅费。 所以你看到的不是某一家突然涨价,而是整个行业在重新定价 agent 的 能力。海外这边, cursor 把套餐拆成 pro proplus ultra, 本质是把无线拆成阶梯。 antropic 也在 cloud code 上测试更细的用量控制,企业版和个人版边界越来越清楚, github copilot 也在把高级请求、模型消耗和后续 token 计费绑定得更紧。国内厂商其实也在同一条路上, 阿里云百联、腾讯云、混元这类 coding plan 早期用低价吸引开发者测试,但很快就出现限量抢购、套餐调整和转向按量计费的趋势? kimi 这类产品表面上还是订阅套餐, 但实际也会通过额度、频率和优先级管理算力。 deepstack 更直接从 a b i 开始就按 token 计费,用低单价教育市场。所以未来更可能不是纯包月,也不是纯按量,而是订阅加 token 包加超额计费。 轻度用户可能会更便宜,因为不用替重度用户分摊成本。重度用户则要开始关心账单上下文、长度、缓存、附用和模型选择这件事对开发者最大的提醒是, 以后会写 prompt 还不够,还要会管理成本。能用小模型的地方不一定非要上最贵的大模型,能附用上下文的地方就不要每次把整个项目重新塞进去。 callin plan 完成了它的历史任务,用低价让大家养成 ai 编程习惯,但 agent 把用量拉爆之后,自助餐模式很难继续补贴。自助餐结束了,点菜时代开始了。靠 ai 写代码这件事大概率回不去了,但怎么用得更聪明才刚刚开始。

二零二六年五月,通信行业迎来一场静悄悄的革命。中国电信和中国移动相距推出偷看套餐,一块钱就能买到几十万偷看额度,打破跨平台壁垒,实现一号通用,这背后是整个算力产业链的大洗牌。本期我们聚焦八家核心受益公司,逐一拆解。 运营商正在经历身份的根本性转变。过去卖的是流量,按 gb 收费,本质上只是流量管道。现在卖的是 token, 按算力收费,正式转型为智能供应商。 今年五月,中国电信和移动相近市商用 tucker 套餐一块前几十万 tucker 跨平台壁垒被打破,这场变格有多快?中国日军 tucker 掉用量二零二四年初只有一千亿次,到二零二六年三月已飙升至一百四十万亿次,两年增长了一千四百倍。 token 以实质性成为 ai 时代的硬通货。 token 产业链分三层,上游是生产底座, ai 芯片、服务器。数据中心作为算力源头,中间是传输通道,八百 g 和一点六 t 光模块成为基础设施。 下游是制造中枢纽。智算集群和 token 工厂大规模落地,三层环环相扣,每层都有核心玩家。 第一家,数据港批发行数据中心,算力房东, token 工厂必须建在数据中心之上,公司在建工程十二点五一亿,是净利润的九倍。深度联动上海电信,确定性很强,但从房东向算力服务商转型,节奏偏慢,弹性偏弱。 第二家,天福通信光模块,上游核心零件供应商,纯粹的卖产人,营收五十一点六三亿,净利润增长百分之五十,增收又增利。无论下游如何洗牌,精密零件需求永远存在, 处于更上游,确定性极高。第三家,浪潮信息,国内 ai 服务器龙头,市占率超百分之五十,营收一千六百四十七亿,增长百分之四十三,最大痛点是增收不增利, gpu 外财导致定价权弱,面临全站新玩家竞争, 确定性强但弹性打折。第四家,新益盛国产光模块老二高弹性增长。标地,营收九十五点三二亿,增长百分之两百三十六点九, 深度绑定中美算力巨头八百 g 向一点六 t 升级,坚决体量不及龙头,但增速更快,正处量价齐生的绝佳窗口。第五家,工业复联,全球最大 ai 服务器代工厂, 营收九千零二十八亿,净利润三百五十二亿,净资产回报率百分之二十一点六六,深度绑定英伟达与华为,量大且不可替代,但受制于上游芯片,缺乏极致超额收益。第六家中继续创 八百 g 光模块全球出货第一,创业版首个万亿市值公司,营收三百八十二亿,增长百分之六十,毛利率百分之四十二点六一,处于 token 分 发硬件的最核心咽喉位置,盈利质量极高。第七家,含五 g 国产 ai 芯片旗帜,营收六十四点九七亿,猛增百分之四百五十三,实现上市以来首次盈利。出口管制下,国产芯片从被选项变为唯一解,运营商全面布局芯片,从适用进入标配裁准政策与需求双风口。 第八家,红杏电子,本轮行情最纯标定,算力从零到一的极致弹性在首,算力订单五十一点六亿,落地国内首个真正意义的偷看工厂,自建算力模式理论毛利率可达百分之六十。打通能源到芯片、算力模型应用全链路。 把这八家放到坐标系里看,纵轴是弹性,横轴是产业链位置。右上角是含五 g 和红杏电子,高弹性加核心, 中间是中继续创核心,异盛高确定性加高弹性。左下角是天福通信和数据港,稳健防守。越靠近核心造偷看爆发力越强。时代的集结号已经吹响。 从流量管道到算力引擎的跨越,不仅是通信行业的华丽转身,更是整条科技产业链的彻底重塑。在这个万物皆可偷看的前夜,硬核算力基建将迎来史无前例的价值重估。开卷有才,我们下期再。

很多人最近在用 gpt 五点五 cortex 或咳嗽的时候,都会有一种感觉, token 消耗特别离谱, 甚至一次任务几十万 token 就 没有了,复杂一点,直接上百万。呃,很多人会疑惑,我明明只问了一句话,为什么会这么贵?其实你看到的只是表面回复,那真正消耗 token 的 东西在后面, 我积累咳嗽某一个时间段使用的用量,有些任务的话是几十万, 有些任务的话就是上百万了。可以从这张图看出来,就是一次任务耗费的头肯还是蛮多的。 那以前的大模型更像 chatbot, 你 问一句,他答一句。但现在的 ai 编程模型,尤其是 g b t 五点五啊, cloud code 啊, course 啊,已经越来越像 agentic workflow。 呃,也就是它不只是直接回答,而是在后面 有思考,有扫描工程,调工具,写代码,呃,有测试,有反思,有重试,最后才给你结果,这是完整的一个流程。 呃,我们先来说第一个吧。嗯, reasoning。 很多人低估了 reasoning 的 token 消耗,因为你看到的是一句回复,但模型内部可能已经思考了很多轮。比如 你让它修复一个复杂的 bug, 它会分析日制,猜测原因,排除错误路径,对比多个方案,规划修改步骤,这些过程都会消耗 token。 而且,而 reid 零越强, token 往往越贵,这也是为什么 gpt 五点五比传统的叉模型贵很多的 原因。第二个核心就是呃工具的调用。呃,现在很多 ai 编程工具已经不是单纯聊天了,他们会呃读取文件,搜索代码、 grip diff, 跑测试,看日制。呃,你以为只是帮我修一个 bug, 实际上后面已经扫描了几十个文件,而且这些都会进入上下文。这是 ai 工具调用的一个 workflow, 可能是长这样子的。 嗯,还有一个很多人没有意识到的东西, hide and context。 很多 ai 工具会偷偷塞大量上下文,比如,嗯, system prompt, roles agents, reporters, summary 文件加载历史对话工具的输出, 虽然你没有看到,但模型其实全看到了。所以真正进入模型的 context, 呃,可能远远比你想象的要大得多。 所以 ai 编程可能会越来越贵。并不是因为模型回答字数变多,而是 ai 正从 chat 变成真正的 工程执行系统,它开始主动分析,主动规划,主动调用工具。呃,主动执行流程。本质上,你不是再买一次回答,而是再买一次工具执行过程。 最后做个总结吧,就是真正废 token 的 地方不是回复本身,而是 reasoning planning to use context engineering agent workflow。 未来 ai 编程一定会越来越强, 但同时 token 的 成本也会越来越重要。如何控制 context? 如何拆任务?如何减少无效推理,会变成新的工程能力?嗯, ok, 这里是 context 的 工程实践。下一期我们继续聊,为什么大仓库加全量上下文会让 ai 编程直接失控?

tiktok 宣布六月一日起抠拍了,全面改为 token 按量计费,按实际消耗算力结算,个人与企业各版本订阅原价不变,订阅费用将兑换专属算力额度,额度用尽,可额外付费,适配高阶复杂编码任务需求。 ai 编程工具越下 a 阵,成本就越难被固定。订阅费覆盖,常规代码补全无需消耗算力额度,聊天、云端、智能代理等高级功能会扣减额度。 同时,官方彻底取消了低配备用免费模型,企业用户将获赠现实算力额度,支持团队额度共享与预算管控, 还可提前查看新模式预估账单成本。新版代码审批会双重消耗算力与运行时长。 ai 编程工具全面转向按量计费,重度功能按需收费,使用越多成本越高。

最近豆包也扛不住了,日烧一百二十万亿,头肯免费, ai 终于开始收费了。五月四号,豆包在 app store 悄然更新了付费方案,直接上了热搜,三档标准版、加强版、专业版,最贵的一年要大几千。评论区直接炸了,豆包笨,还收费,冲上了热搜第一。 你知道豆包每天烧多少 token 吗?一百二十万亿,三个月前还是六十万亿,直接翻了一倍。每一个免费用户背后都是自己在倒贴算力。你说他不想免费吗?他是烧不起了。不光是豆包,你看 open i 已经在接广告了,国 国内其他大模型也在陆续收载。免费额度本质就一句话,透支越来越贵,免费的午餐已经吃完了,谁先完成收费闭环,谁就能把算利投给真正有需求的用户。对普通用户来说,聊聊天够用了,免费版照样能用。但对企业合作项目的人来说,透支成本正在变成一笔 不得不算的账。怎么用,用多少,怎么降本?这些很多人还没有想过。如果你也在用透支做业务,可以评论区聊一聊。

紧随上海电信,中国移动上海公司推出了一块钱四十万 tucker 的 套餐,相比较于上海电信一元二十五万 tucker 低了百分之三十六,显示出了中国移动的成本优势。 移动运营商推出 tucker 套餐,打通了算力收费和话费支付之间的通道,提高了算力支付的便利性,为后续的三百余款大模型收费变现打好了基础。 并且也能鼓励一些没有支付渠道的微型创新个体推出更多能实际应用落地的服务,这些套餐服务呀,能够加速 ai 的 繁荣发展。

昨天,科 sir 悄悄放出了一个推荐优惠,新用户首月百分之五十订阅 pro 计划十美元,首月原价二十美元, pro 加计划三十美元,首月原价六十。 pro 呢,是一百,原价是二百,这是通过推荐链接获得的优惠,不是公开促销,所以很多人还不知道 为什么这件事值得说。第一,编程工具的门槛正在快速下降。年前 cursor pro 要二十,每个月很多人还在犹豫值不值,现在首月十美元,相当于一杯咖啡钱至一个月 试错成本降到这个程度,意味着 ai 编程工具正在从专业工具变成大众消费品。第二, cursor 在 抢用户, tiktok 呢,也是十美元起,每个月起步,学成免费。 curser 现在首月也是十起步,而且功能更强,多文件编辑 agent 的 模式,自研 composer 模型, 两家在抢同一个市场。程序员的第二,大脑,谁抢到用户,谁就定义了 ai 编程的标准工作流。第三,这是入坑的最佳窗口。 如果你一直在观望, ai 编程工具,现在是最好的时机,十美元试一个月,足够你判断 ai 编程到底能不能帮你提效。 curser 到底值不值,如果值,续费,如果不值,只亏十美元。 给程序员三个建议啊。第一,别再观望了,这个窗口错过就没有了,推荐优惠随时可能结束,十美元试一个月是最划算的入场券。 第二,试的时候别只玩补全。 curser 的 核心能力是多文件编辑和 agent 的 模式,让它帮你重构一个模块,写一个完整功能,处理一个复杂的 bug, 这才是 ai 编程的真正价值。 第三,关注 composer 模型,这是 composer 自然的编程模型,比 gpt 便宜十倍,而且专门为代码优化。如果 composer 跑通了,你的场景未来成本只会越来越低。该编程不是会不会取代程序员的问题, 是你能不能跟上的问题。十美元入场试试看评论区聊一聊你用 composer 了吗?体验怎么样?

agent 死了吗?最近网上流传着一种言论,你看,豆包都开始收费了, token 太贵了,根本不是生产力开发, agent 已经死路一条了。 豆包五月四日上线六十八,两百五百三档付费订阅。智普年内三次上调 api 价格累计百分之六十,加腾讯云 ai 算力涨百分之三十四。 免费时代结束的标题铺天盖地,这些结论简直太逆天。前面我们讲过 token 的 计费原理, 这期来讲讲 token 到底会越来越便宜还是越来越贵?先说结论, token 会越来越便宜,便宜到你几乎忘掉它的存在。你眼前看到的涨价,是需求爆发期的供需脉冲, 不是供给侧成本结构的变化把时间拉长。 token 的 价格曲线是过去十五年所有计算资源里跌得最猛的, 比 pc 时代的 cpu、 互联网时代的贷款、云时代的存储都猛。下面挨个猜,你付的每一块钱 token 费大致流向这七处, 硬件折旧、 gpu 七 p u 升腾这类芯片的折旧内存带宽 hbm 显存 l l m 推理的真正瓶颈。网络互联多卡携同的 nvlink infiniteband 电力散热一台巴卡 h 一 零零满载十到十二千瓦,训练成本摊销,一次训练几百万到上亿美元,要靠 token 收回来。软件研发运为人也是成本,最后还有利润空间。 那这些成本都有哪些降价空间呢?硬件折旧实际寿命远超账面。会计上, gpu 折旧通常按三到五年算,但工程上完全不是这回事。 a 一 百是二零二零年的卡,二零二六年大量推理集群还在跑, 尤其是跑量化后的中小模型,当你把折旧周期从三年拉到六年,单 token 摊到的硬件成本直接砍半。 新一代芯片 h 两百 b 两百,国产生腾的单位算力成本还在每代降百分之三十到百分之五十。再叠加专用 a s i c tpu trinitium 自研芯片,头部厂商自己跑自己的模型, 成本可以比租 gpu 低百分之三十到百分之六十。内存待宽。产能扩张期不是结构性短缺, hpm 现在是 gpu 节点里最紧缺的东西,但这是件产能的问题,不是造不出来的问题。 s k。 海力是三星美光的 h p m。 潜能,从二零二四年开始就在指数级扩张。 h p m 三 e。 量产 h p m 四在路上,这种短缺历史上反复上演,内存、 闪存、面板都经历过,规律都是十八到二十四个月后才能赶上价格回落,甚至倒挂。网络互联全群里铜缆互联的工号, 成本距离限制都到瓶颈了。 c p o。 供风装光学和归光在二零二六年开始,规模商用单位贷款的工号和成本能降一半以上, nvidia、 博通、华为都在压这条路,再过两年,万卡集群的网络 成本结构会被全光重写。最后,算法方面才是降本的真正大头,前面三项都是硬件维度的降本, 加起来一年顶多二到三倍,真正的杠杆在算法上单一突破就能五到十倍降本,而且每隔几个月就有新的稀疏末,越做越极致。 deepsea v 四 pro, 总参数一点六 t, 每个 token 只激活四九币,相当于雇了一点六万亿的团队,每次开会只叫百分之三的人。 v 四 flash 更狠,二八四币总参数只激活一三币, 性能反而超过 v 三点二的三七币。激活混合压缩注意力 v 四的 csa 加 hca 架构 em 上下文下推理, flops 只要 v 三点二的百分之二十七, kvcash 占用只剩百分之十长上下文从 o n 平方这个圆锥里被解放出来了。 量化 f p 十六 f p 八 f p 四每降一档,显存待宽算力需求几乎减半,质量损失控制在百分之一到百分之二以内。 black 我 原声 f p 四上线之后,量化红利还能再吃一波蒸馏。用大模型训小模型 agent 里很多子任务,根本不需要 pro 级别 flash 甚至 nano 就 够预测解码小模型先拆大模型批量验证, 速度直接二到三倍。这些算法红利远没出尽。 epec ai 的 研究,达到 gpt 四同等能力的 token 价格每年下降九倍到九百倍,中位数五十倍每年,这个速度硬件根本贡献不出来,主要就是算法在跑。 v 四一发 flash 把输入价格压到零点一四美元每百万。 token 就是 最新一次算法红利转化成价格的例子。系统工程同卡同模型成本能差十倍。 持续批处理 continuous batching, 把单条请求时百分之十的 gpu 利用率拉到百分之八十。 prompt catching 让缓存命中 的输入只要正常价的百分之十到百分之二十,欲填充和解码分离,让吞吐再翻倍。 v l l m s g 浪 tenor tail l m 每个月都在迭代训练,摊销分母在指数爆炸 豆包譬如过 token 调用量从二零二四年五月的一千两百亿涨到二零二五年九月的三十万亿,一年半涨两百五十倍, 训练成本固定调用量翻两百五十倍,单 token 摊到的训练成本就是原来的两百五十分之一。最后还有市场竞争,会把利润空间挤干到一个合理的范围。 那短期为什么有人在涨价?如果长期是降价,为什么?二零二六年我们看到豆包收费质朴,涨价 第一,需求爆发太快, reasoning 模型出来后,单次请求的 token 消耗涨了十到一百倍。 a n t 一 上线,一个用户一天烧的 token 顶过去一个月 gpu 扩产要十八到二十四个月,供给跟不上。 第二,前期补贴退潮,三点四,五亿月活的豆包每天烧的算力钱以千万计,免费换用户的阶段过去了,开始算账,但算账不等于涨价到不可用。豆包基础版还是免费的 付费,当对标的是 chat gptplus 那 种生产历订阅。第三, c 端订阅涨价不等于 t 肯单价涨价,订阅再涨是因为人均用量爆炸, 但 api 的 token 单价整个二零二五到二零二六都在持续下行。 gpt 四发布时六十美元,百万输出 token, gpt 五点四,现在十美元, 三年降六倍,而且是更强的模型四,所以 agent 死了吗?恰恰相反, token 越便宜, agent 才越成立。 一次聊天烧一千个 token, 一个 agent 跑一个完整任务可能要烧一百万 g p t 四时代一百万 token 要三十六美元,没人愿意为一个任务付这个钱。今天同样能力的一百万 token 只要几毛钱, agent 就 开始有商业价值了, 明年再降一个数量级普及就开始,那些喊 agent 已死的人看的是当下账单上的数字,没看见数字下面那条陡峭的曲线。 token 不是 房地产,越紧缺越贵, token 是 计算资源,越普及越便宜,它最后会变成你下载一首歌,不会去想流量费用一次搜索,不会去想服务器成本,一样 便宜到忘掉它的存在。到那时候我们就该讨论下一个问题了, token 都不要钱了,谁来定义任务才是最值钱的事。

现在咳嗽有一个重大更新啊,以前买二十块的 pro 版它是可以无限使用的,用那个奥特模式,现在的话奥特模式它也是按量收费了。然后我根据后台的这个用量账单然后对比了一下, 因为一开始我以为是国产模型最便宜,但是现在我计算下来的话其实是用这个 gm 的 三 flash 它是最便宜的, 换算成人民币的话一百万 tiktok 杰曼特三 flash 它只要九毛钱,但是我们国产的 deepsea 的 话要要两块六,差了快三倍。然后其实最贵的是 cloud code office 这个模型。

四川联通首先开通了一个托肯套餐,每个月十五块钱起,他和流量套餐一样啊,作为这个电信的新的套餐业务来源啊,标志着托肯的使用量将会 逐步的增加,也就是说,在托肯的最后的终端,消费者购买这一块已经打通 啊,受此消息的政策应该说是啊,这这个政策的影响之后嘞,今天的中国电信一度风涨停,虽然说只涨停了五秒钟,但也是涨停了啊,然后联通更涨, 中国移动更涨,那么这个板块是利好三大运营商的啊,那么今天的行情还好吧, 明天看。呃,一般来说,周二才能是这一周的关键时期,明天选择方向,加油!

豆包开始收钱了,标准版六十八元每月,加强版两百元每月,专业版五百元每月。那你知道他收的钱是按什么算的吗? token, ai, 跟你聊天他也得吃饭,他的饭就是 token。 token 就是 企业用 ai 时,你问的问题和他给的答案被切成碎片的总和。为什么要算 token? 三句话,一、算成本, token 就是 你家的电表用多少度交多少钱。二控预算,不同业务各吃多少 token 账才能算清。三、定价格,你要按 token 收费,总得先知道自己成本吧。别扯什么技术指标, token 就是 成本核算和定价的基础。 token 到底怎么算?你问 ai 一 句话,被切成的碎片等于输入 token, ai 写一段答案,被切成的碎片等于输出, token 总消耗等于输入加输出。就像家里水表进水加出水等于用水量。 为什么写长文更贵? ai 每写一个字都要把前面所有字重算一遍,写五千字算五千遍,输出越长消耗越大,钱越多。懂数据?为什么打架?一家公司为什么会出现二十二万亿?十二点八六万亿,一百二十万亿三个数字?因为三个不同口径的水表, 官方日均一百二十万亿,全市场总消耗,个人加企业等于整个小区一天的总用水量 十二点八六万亿,仅某家引擎的企业付费月消耗,基于公开数据估的,等于你家一个月的用水量。二十二万亿很可能是国外某聚合平台一周的全球数据,根本不是那家引擎的,等于隔壁小区一周的用水量, 几个数字不是一个量级,一个范围,一个时间段直接比大小,就像拿整个小区的月用水量跟你家一天的用水量比,完全不搭界。查水表的时候先反问一句,您看的是小区总水表还是您自家的水表?口径不同,答案当然不一样。 那到底豆包收的算不算贵?写一篇五千字的报告大概几千到上万 token。 如果你月花五百块买专业版,天天写长文搞报告可能比请个助理还划算,但你只是偶尔聊聊天问天气,写个文案免费版够你用了。

我赚够三千万就收手,祝你后如轮转一百万,你还年轻,三千万不够,三亿三亿就一辈子不抽了,不过够不够看自己,如果到时候你觉得不想做了,就过来找我一块钓钓鱼好,放小枪, 阿总投降吧,外面全是警察,什么?我才不怕妹妹。我赚够三千万就收手,祝你后日轮转一百万利 你还年轻,三千万不够,三亿三亿就一辈子不愁了,不过够不够看自己,如果到时候你觉得不想做了,就过来找我一块钓钓鱼好,放下枪, 阿总投降吧,外面全是警察,什么?我才不怕妹妹我转够三千万就收手,祝你后如轮转,一百万, 你还年轻,三千万不够,三亿三亿就一辈子不愁了,不过够不够看自己,如果到时候你觉得不想做了,就过来找我一块钓钓鱼好,放下枪, 阿总,投降吧,外面全是警察,什么?我才不怕妹妹!