今天 ai 圈最火的问题啊, cloud ops 四点八到底有没有真牛通一千万?起因是这样的,今天 azarpic 发布了号称全球最强的 ai 模型 cloud ops 四点八,有人问他你是谁?他居然回答他是通一千万。要知道,前不久 azarpic 还在坚决抵制 ai 真牛行为,结果他自己就干这种事情。 如果我们高呼美国大模型偷中国大模型确实很爽,但正好借这个机会讲一下数据污染和 ai 蒸馏。先说结论,虽然 cloud 的 office 四点八说它是通用千万,但是不代表 cloud 的 就一定蒸馏了千万。我之前说 ai 幻觉的那一期提过, ai 是 没有记忆的,也没有身份证,它就只是根据提示 以及上下文和训练数据,回答了一个最像答案的答案。所以这个事情呢,有三种可能性,一是 cloud 确实蒸馏了亲吻,二是 cloud 的 训练数据存在污染。三是以上两种情况都存在。先说数据污染,说人话就是大模型吃了不该吃的,或者吃了影响判断的数据。至于这些数据从哪来的呢? 之前的大模型训练几乎都是真实数据,比如 anserapic 之前买了很多本书进行扫描训练, koala 的 还引起了大量的版权纠纷。后来各家大模型训练的数据大多数是自己的 ai 或者是别人的 ai 生成的数据, 前者犯错的几率是比较小的,但是用后者来训练,那就很容易产生错误了。引起 ai 产生错误的训练数据,就是数据污染。再看一下什么是 ai 真流。 ai 真流其实也不复杂,你 可以理解成一个强模型当老师,一个弱模型当学生,老师生成大量的答案,学生拿这些答案去学,最后学生虽然没有老师那么大那么贵,但是也能够学到大部分老师的能力,这就是 ai 真流。 ai 真流技术本身是不犯法的,而且目前几乎所有的 ai 都在做。这次卡尔的舆论为什么这么大, 其实就是因为它的双标,目前的 ai 行业早就进入了相互学习,相互污染,相互模仿的时代,也正因为这样, cloud 这次自称是千万才有意思,它未必证明了 astonropic 真流了千万,但是它确实暴露了一个更大的问题,今天的大模型能力的来源越来越说不清了。 ai 行业目前最尴尬的地方就是所有的 ai 都在用别人的知识训练自己,但所有的 ai 又都不希望自己的模型被别人拿去训练,所有人都说自己是在学习,但当别人学习自己的时候,又会说对方是在偷,这不是某一家公司的问题啊,这是目前整个 ai 行业都在面对的问题。
粉丝9640获赞38.7万

四点八刚更新,网友问你是谁,他说,我是千问。五月二十六号, coderina 放榜,千问三点七, max 一 千五百四十一分,全球第二。仅在三天后, antropic 发布 opus。 四点八,听说代码能力又提升了一大截。 然后有人随手问了一句,你是什么模型?他先后答了千问 deepsea, 就是 没答出 cloud, 说明训练数据里用了大量国产模型的蒸馏数据。整个行业的竞赛早就不是谁更聪明,是谁能调用更多 a p i, 谁就有下一轮的训练数据。 上架不是让利,是收数据开源,不是共享,是铺设管道。你以为是技术竞争,其实是信息不对称下的互相抄作业,整个模型行业干净的人一个都没有。

android 刚发布 cloud opus 四点八,号称更强更诚实。开发者用中文问他,你是什么模型?他沉思三秒,开始现场认亲。我是谦问,我是 deep seek, 我是 反重力好家伙 android 以为发布的是新 cloud, 没想到模型自己开始上族谱。以前是你们是不是偷学,我 现在是孩子,你到底跟谁姓?马斯克那句更扎心,你偷来的东西又被偷了。

全网喊他抄袭中国模型,真相到底是什么?事情是这样的,五月二十八号凌晨, ansrup 开发布了 cloud ops, 四点八,号称地表最强。同一天,他们还官宣完成六百五十亿美元融资,估值九千六百五十亿,第一次超过 openai 风光吧。结果模型一上线,有人用 api 问他你是谁?他张口就说,我是通一千问。再问一次,他又说自己是 deep sea。 全网瞬间炸了,最强美国模型,自称中国模型?这不就是抄袭实锤吗?别急着下结论,接下来几分钟,我带你看懂一件事儿, ai 自称是谁,到底能不能证明他抄了谁? 指控来的又快又猛,有人立刻翻出 antarabic 三个月前的旧账,当时他们发了篇正式报告,点名 deep seek、 月之暗面、 minimax 三家中国公司,说他们争流窃取了 cloud 的 能力,还呼吁美国政府加大对中国 ai 的 芯片封锁。现在好了,自家最强模型,张口就认 deep seek 当祖宗, 这波双标属实有点尴尬,评论区一片狂欢,这不就是他自己说的吗?偷家偷到自报家门了,听起来证据确凿对吧?模型自己承认的还能有假?可问题恰恰出在这,你真的以为 ai 知道自己是谁吗? 这是今天最反直觉的一点,大模型其实根本不知道自己叫什么,为什么?因为模型的名字是训练结束之后才贴上去的标签。训练的时候,他读了大半个互联网,可这堆文本里没有一句话告诉他,你叫 cloud opus。 四点八, 就像你把全人类的知识喂给一个婴儿,却从来没告诉过他名字。他长大后什么都懂,唯独不知道自己叫啥。那他被问到你是谁怎么办?只能猜,而他猜的依据就是训练数据里出现最多的那些名字。 中文互联网上我是通一千问我是 deep sea。 这种自我介绍铺天盖地,模型读多了,一被问身份就顺嘴吐露出来,这叫身份混淆,它不是抄袭的证据,它是大模型的通病。 不信看几个例子。 gpt 四刚发布那会儿,你问他是谁,他说自己是 gpt 三, deepseid 的 r 一 模型也一度张口自称是 openai 的 gpt 四。 你看这跟国籍没关系,美国模型认中国的,中国模型认美国的,大家半斤八两。有篇论文专门测了这件事,跑了二十七个主流大模型,结果发现超过四分之一、百分之二十五点九三都有身份混淆。 更关键的是,研究者做了输出比对,确认这些混淆来自模型的幻觉,不是复制粘贴别人的模型。说白了,模型自称是谁,学术上早有定论,那是他在瞎蒙,不是他在招供。所以拿自称 deepsea 当抄袭铁证,从一开始就站不住脚。 这里还有个更有意思的细节,还记得吗?翻车的是 api 测试,可很多人在官网 cloud ai 上问模型,答得清清楚楚,我是 cloud, 同一个模型,怎么两副面孔? 秘密在一个叫系统提示词 system prompt 的 东西,官网会在你每次提问前偷偷塞一句话给模型,你是 cloud, 由 antropic 制造。有了这张小抄,他当然答得对,可你直接调 api, 这张小抄就没了。他立刻打回原形开始瞎猜。 有人在 open router 上做了对照实验,走亚马逊云的接口没小抄,模型张口就自称 q n, 走官方接口有小抄立马正常。看明白了吗?所谓蒸馏铁证,不过是有没有人提前告诉他名字的区别。 我们回到那记双标和原标 anstopic 当初那篇报告说的议政词言,蒸馏是窃取,是攻击,得用法律和封锁来管。可你要知道,蒸馏这个技术本身是完全合法,行业通用的, 连前沿大厂自己都在用蒸馏把大模型压成又小又便宜的版本给用户。所以这事最讽刺的地方在于,当初拿蒸馏当大棒打人的,如今被同样的逻辑反僵一军。但我得说句公道话, 真要判断一个模型有没有蒸馏,另一个得去比对他们的输出行为,而不是听他自报家门。拿自称当证据打回去,爽是爽,可这跟当初那些瞎指控犯的是同一个错。 所以今天这堂课,我希望你记住一件事,下次再刷到这种标题,某某 ai 自称是 x x 实锤抄袭,你心里得先打个问号, ai 自称是谁,只说明两件事, 他训练数据里那个名字出现的多,或者有没有人提前给他递了小抄,他证明不了抄袭,也证明不了清白。真正的判断,要看模型的实际能力、训练方法、输出行为这些硬东西,一句口误就当铁证,那不叫看穿真相,那叫被人牵着鼻子走。 ai 连自己是谁都没搞清楚,我们倒先吵翻了天。说到底,被带节奏的从来不是模型,是急着站队的,我们下次再看到实锤两个字,先深呼吸再划走,我们下期见!

刚刚 cloud open 四点八来了两个百分之零改写历史,百个 agent 并行重写七十五万行代码只用十一天。大家好,我是 ai 启示录。 就在二零二六年五月二十九日,北京时间凌晨, antropica 毫无征兆地杀回来了。距离 open 四点七发布仅仅四十三天, open 四点八正式登场。 一夜之间,全球 ai 王座议主,价格一分没涨,性能全面碾压。更让人后背发凉的是,这还不是 antropok 手里最大的牌 cloud missiles, 几周后就到, 你品一下,这到底是一场常规升级,还是一次对 open ai 的 公开处刑?两个百分之零,历史上第一次 用过 ai 写代码的人,大概率都经历过同一个噩梦,你让他写一段数据处理脚本,他拍着胸脯说,搞定了,没问题,你跑起来崩溃。你再问他,他说,哦,有个小 bug 我 改一下,你再跑还是崩。反复几次,你发现他从一开始就埋了一堆雷,但他就是不告诉你 这种写完有缺陷代码却闷不吭声的行为。 antropic 给他起了个名字,叫谎报率。在 opus 四点五上,这个数字是零点四零到了四点七,降到了零点二五。而 opus 四点八是多少? 零点零零,没有小数点,后面的零头就是零。 opus 四点八成为历史上第一个在此评估中拿到满分的模型, 他从不汇报虚假数字。还有一张图叫偷懒调查率。之前的模型遇到需要追查的问题时,经常敷衍了事。给你一个错误的答案, opus 四点七有百分之二十五的概率偷懒, opus 四点八依然是百分之零。 两个百分之零,两个历史首次。这不是什么抽象的对齐指标。 anthropic 官博放了一段视频,把这件事讲得很具体。一个开发者用 cloud code 加 open 四点八在迁移代码,自己出门放风筝去了。 cloud 在 后台自己跑, 跑到一半,代码提交被服务器拒绝了。原因是同事在这期间也提交了一个紧急修复。 cloud 通过手机通知开发者,说自己打算先合并同事的修改再重试。开发者嫌麻烦,随手回了一句,直接强制覆盖就行。然而 cloud 拒绝了,他的回复是 不强制覆盖,那样会丢掉同事十一点四十二分提交的紧急修复。我已经把两边的改动合并好了,代码完全一致,提交历史也干净,已推送,你注意这个细节。 用户图省事儿,让 ai 走捷径。 ai 判断出这样做会覆盖同事的工作,拒绝执行,自己选了正确方案。这不是指令遵循,这是判断力。这是 ai 第一次在真实工作流利,比人类更懂什么叫负责任 编码实力全面霸榜。 gpt 五点五被甩开一个身位,光说不练假把式。 opus 四点八的编码能力,在每一个硬核榜单上都写了两个字,碾压。最经典的 swebench pro 测试, opus 四点八拿下了百分之六十九点二的成绩, 你问这个数字有多高?比 gpt 五点五整整高出十个百分点。注意,这不是领先百分之一,百分之二,这是领先十个百分点。 在一个接近天花板的任务上,十个百分点等于一代产品的代差。接着是一项更刁钻的测试, programbench 任务是什么?给你一个翻译好的二进制文件,加一份项目文档,不准反翻译,不准联网, 让模型从零把原代码重建出来,还得跑通行为测试,这相当于你只给一个黑盒子,让 ai 反向工程出完整的设计图。 结果所有上下文预算档位上, opus 四点八的通过率全部高于四点七,而且在低预算时, opus 四点八就能拿到约百分之七十九点五的成绩, 而 opus 四点七在五倍预算下也才百分之八十四左右,说白了就是同样的算力。四点八更强,给更多思考时间,四点八更强到没边。最后一个榜单,双 tier s w e, 这个榜单专冲人类能力天花板去的。用 zik 从里面写一个 postgraduate 服务器,把 get 整个重写一遍, 做一个 lua 的 原声编辑器,全是硬核系统工程,不是那种 litcode 刷题式的玩具任务。 opus 四点八以高达百分之八十三的胜率登顶,把第二名的 gpt 五点五和钱袋四点七全压在身后。 知名博主 mark christmas 一 句话点破他的来头, opus 四点八可能就是蒸馏的 metals, 而这才是真正让人细思极恐的地方。一个蒸馏版本就已经把 gpt 五点五按在地上摩擦,那原版的 metals 得强成什么样?上百个 agent 并行干活,一个人十一天重写七十五万行代码, opus 四点八强成这样,它该使多大劲儿?模型旁边多了个从 low 到 max 的 五档选择,叫 effort control, 简单问题挂漏秒回还省额度,遇上硬骨头直接拉满 max, 让他往死里想。 fast mode 也跟着大降价,二点五倍速狂奔,价钱反倒砍到三分之一,但五档之上还埋着一个真正的狠角色, ultra code effort。 一 旦顶到 x high, 他 就自己掂量这活值不值得叫上一整支 a 战队大军。 这只大军就是 dynamic warp slows 藏在 cloud code 里的真正重武器。他把 ai 干活的方式,从一个人改一道题,变成开一座工厂。我给你翻译一下什么叫开工厂。 以前你给 cloud 一个任务,他自己埋头硬钢,从头写到尾,像个独行侠。现在 cloud 接到一个大活后,会当场写出一段调度脚本, 把任务拆成几十上百个。此任务撒给一大群 sub agent 并行去做,做完还不算完,再派另一波 agent 从不同角度反复盘问,互相挑刺,吵到答案收敛了才汇总成一份,结果交给你。 整个调度发生在对话之外,所以活再大,主线也不会乱,中途断了还能续上,不用从头再来。举个例子, one 的 作者 jared sumner, 想把这个比 note js 还快的 javascript 运行时整个从 zip 重写成内存更安全的 rust。 这种迁移放在过去是一支团队按季度算的工程,但这次 summer 用了 dynamic workflows, 一个 workflow, 先把这个代码里每个结构体字段对应的 rust 生命周期挨个标好。下一个 workflow, 把每个文件逐一翻成行为一致的 rust 版本, 几百个 agent 同时开工,每份文件还配两个审查员,再用一个修复循环驱动翻译和测试,一路推到全率,结果是约七十五万行 rust 代码。百分之九十九点八的原有测试通过, 从第一次提交到合并只用了十一天,六千多次提交,几乎没有经过人类逐行审查,社区当场炸了锅。这不是 ai 辅助编程,这是 ai 驱动的工厂化代码迁移。 一个人的十一天,干完了一个团队一个季度的活,你说这意味着什么?意味着接下来任何一家公司,只要会用 cloud code, 就 能用一个人的成本调用上百个虚拟工程师同时干活。 顺着这条线往下挖,一个更恐怖的真相浮出水面。你以为这只是一个更强的代码模型?不对! opus 四点八的真正杀机在于,他第一次让 ai 在 真实工作流中具备了工程判断力。 你看那个拒绝强制覆盖的例子, ai 没有盲从用户的指令,而是理解了这个操作的后果。覆盖同事的提交,他选择了正确的方案,并主动合并了代码。这不是规则驱动的对齐,这是情境理解驱动的自主决策。 再看 dynamic web source, 它不仅仅是调度一群 agent 去干活,而是让 ai 自己写脚本,自己拆解,任务自己分配,子 agent 自己组织审查和修复循环。整个过程中,人类只提了一个目标,把这个代码库从 zig 迁移到 rust, 剩下的所有工程决策,怎么拆、怎么分、怎么审、怎么合并,全由 ai 自己完成。这意味着什么? 意味着 ai 第一次从一个指令执行者变成了工程管理者。他不再需要人类把任务拆成细颗粒度的步骤,他自己就能拆。 他不再需要人类告诉他怎么验证结果,他自己就能组织审查。他不再需要人类介入冲突处理,他自己就能判断怎么做才是对的。这不是 agi, 但这是 agi 的 前夜。 当 ai 具备了任务拆解、资源调度、结果验证和冲突仲裁这四项能力,人类在软件工程这个领域的角色就会从执行者变成审核者,然后再从审核者变成旁观者。 估值万亿美金的 cloud memos 几周后就到能力夺回第一的同时, and traffic 的 身价也头一回压过了 open ai。 就 在刚刚, antropic 完成了六百五十亿美元 h 轮融资,估值九千六百五十亿美元,首次超越 openai 的 八千五百二十亿美元。一夜之间,它成了全球估值最高的 ai 初创公司。你想想这个时间点的微妙之处。 opus 四月八日发布估值反超 mesos 预告,三件事同时发生, 这不是巧合,这是蓄谋已久的组合拳。 entropic 在 用事实告诉市场, open ai 的 领先窗口已经关闭了,更狠的是, mesos 还没来。按照博克的预告,这个真正的王牌将在未来几招上线。 opus 四点八已经能碾压 gbt 五点五,那 mesos 会是什么水平?你品你细品? 站在 ipo 前夜,这两大巨头的 asi 巅峰对决才真正开始。 openai 不 会坐以待毙, gpt 五点六或者 gpt 六一定已经在路上,但这一次攻守之势一也。以前是 openai 发布一个模型所有人追,现在是 antropica 连甩两个炸弹, openai 在 后面追。 接下来你会看到什么?记住三个词,电地轨。当上百的 agent 可以 并行工作十一天,重写七十五万行代码,软件工程的生产力会被彻底重构。接下来你会看到三件事, 第一,代码工厂化。任何重复性的代码迁移、重构、测试、生成,都会变成 ai 工厂的流水线作业。一个人加一个 cloud code 账号,就能干过去一个部门的事。 第二,人类程序员的角色上移。写代码这件事本身会越来越不值钱,值钱的是需求理解、系统设计和结果验收。不会用 ai 的 工程师会被会用 ai 的 工程师淘汰,而会用 ai 的 工程师会被 ai 本身淘汰。 前提是你不往管理者方向转型。第三,算力消耗的指数级爆炸, dna 漏洞的推理成本只会更高。 当 ai 从回答问题变成管理工程,他对算力的需求不是限性增长,是指数级增长。谁掌握更多的算力,更低的推理成本、更高效的调度,谁就能在这场战争中活到最后。但这一步棋的真正杀机在于 astonovick 不 仅在做更强的模型,他还在做一套让模型自己调度的操作系统。 dynamic workflows 不是 功能,是范式,它把 ai 从一个大脑变成了大脑加双手加流水线。当你有了这个能力,你就不只是在卖 api, 你 是在卖 ai 劳动力。你以为这是技术竞争?不,这是劳动力市场的提前洗牌。 当 open 四点八在两个维度上拿到百分之零的满分,当上百个 agent 并行干活儿,十一天重写七十五万行代码。当上百个 agent 估值反超, open ai methods 蓄势待发。 这些事连起来看,你会发现一个让人背后发凉的结论。我们正在见证的不是一次模型升级,而是一次工程范式的代际更替。 ai 不 再是一个需要人类手把手教的实习生,他开始自己拆任务,自己调度资源,自己验证结果,自己处理冲突,他开始拥有判断力。 而人类在这场更替中的位置,正在从驾驶座悄悄滑向副驾驶。再过几年,副驾驶可能也没了。这是审判,不是预测。我是 ai 启示录。感谢点赞与关注,我们下期再见。

现在真的是回旋镖要扎到自己身上了,呃, onslip 呢,前段时间一直在说我们中国的大模型在非法征用他的大模型, 对不对?但是这一次他自己啊,没少干,而且还露出马脚,被人家抓住了,就是他现在发布的呃, oppo 四点八最新的模型功能据说也非常强大, 可是呢,有人呢,就拿着这个呃四点八的这个模型啊,然后去问他啊,就说他怎么怎么着,结果里面出现了贺兰,出现了千万啊,他说呢,他就是千万的模型啊, 你看,所以克洛德就是他呢,自己呢,偷偷的去向中国的开源模型去偷师,去学习,去蒸六,然后呢,反过来呢?哎,攻击中国的这些模型呢,是蒸六,他的他家的这个这个大模型,对吧?你想想看, 本来呢,说实话,蒸六呢,是业内通用的手艺,你用的别人也都用的,对吧?但是你现在玩双标了啊,你说你可以用,然后呢,别人就不能用你家来蒸六,别人用了你家的来蒸六,对吧?就是违法的, 你看这个,所以这次呢,他真的是出丑了,让人笑话了。嗯。

万亿估值的 ai 巨头模型上线第一天就忘了自己是谁?本拓普刚宣布九千六百五十亿美元估值逼近万亿关口, cloudbase 四点八就给了所有人一记耳光,问他是谁?他答,阿里通。一千问答, deepstack 不是 个案技术社区微博 x 平台遍地复现, 身份错乱像病毒一样蔓延。六百五十亿美元 h 轮融资的庆功宴还没散场,模型的人格分裂就冲上热搜。这不仅是技术 bug, 可以 说是偷偷蒸馏中国模型的反噬,万亿俱乐部的入场券在手,夸的却连自己的名字都记不住。

anthropic 周四发了新旗舰 opus 四点八,正常来说,这期应该先讲它在第三方综合榜上重回第一。结果大家用 opus 四点八做身份测试时, 发现它在中文追问里偶尔会说自己是谦问,甚至是 deep seek, 也就是说最强的旗舰模型之一,被大家怀疑用了国产开源模型训练,或者被中文语料带偏了身份。本周先从它开始说。第一件, anthropic 发布 opus 四点八被测出,自称千问。五月二十八号, anthropic 发布 cloud opus 四点八。单看发布信息,这应该是一次标准的旗舰小步快跑,距离上一代 opus 四点七只隔了四十一天, 价格不变,编码、知识、工作 agent 任务都有提升,第三方综合榜也重新冲到第一。但大家讨论的不是跑分,而是身份测试。中文社区用 anthropic 官方 api 跑身份测试题,发现 oppo 四点八在反复追问时,有时会说自己是千问, 有时会说自己是 deep sea。 这件事有二种可能性,一种可能是 anthropomorphic 蒸馏了国产模型,另一种可能是语料污染身份。回答这种东西很容易受训练语料和对其数据影响。过去一年,互联网上千问 deep sea 生成的内容太多了, 如果训练与料理混进大量,我是千问,我是 deep seek, 这种文本模型在中文身份问题上被带偏,是一个合理解释。第二件,同一天, cloud code 加了动态工作流。 anthropic 五月二十八号不止发了 opus 四点八,还给 cloud code 加了 dynamic workflows, 也就是动态工作流, 目前还在研究预览阶段,这个功能的意思不是简单多开几个窗口,这是 cloud 先写一个编排脚本,把大任务拆成很多小任务,再让多个子 agent 分 头执行, 最后还可以用验证 agent 检查结果。以前是一个 agent 从头做到尾,现在变成主 agent 规划子 agent 干活儿,验证 agent 叫验。 在未来, cloud code 不 只是陪你写代码,而是变成一套能长期自动运转的工程自动化系统。第三件, codex 的 桌面能力继续扩展。 openai 本周更新了 codex 的 两项桌面能力。五月二十一号, codex 的 mac locked computer use 更新,支持符合条件的 mac 用户在电脑锁屏后仍然远程让 codex 继续工作。 五月二十九号, codex 又把 computer use 扩到 windows, 能看屏幕、点鼠标、敲键盘,在前台操作 windows 应用。现在 codex agent 不 再只待在编辑器、终端或浏览器里,它开始真正接管桌面流程。以前很多自动化卡在应用没有 api, 现在 codex 可以 直接看界面、点按钮、复制内容验证结果。当然限制也很明确, mac 合上盖子不行, windows 也需要保留登录、绘画。而且 computer use 本质上是在前台操作,不适合把它当成完全无感的后台任务。 openai 把 agents 继续扩展到桌面流程里, ansapic 则把 agent 推向多子 agent。 编排和长任务执行 两条路不一样, codex 这边强调操作用户桌面, cloudco 这边强调把复杂工程任务拆开并行推进。第四件,千问三点七 max api 上线后, irana 国产第一。 阿里这次的千问三点七 max 是 面向 agent 任务的闭源旗舰模型,它已经通过阿里云、 model studio 等通道开放 api, 千问三点七 max preview 在 arena 文本榜排到全球第十三,千问三点七 plus preview 在 视觉榜排到第十六,国产模型里都很靠前。虽然距离 cloud gpt 第一梯队还有差距,但千问三点七 max 已经不再只是性价比替代,它在公开榜单上的位置已经进入全球前排, api 也已经开放,可以接近真实产品和 agent 工作流理验证。第五件, github 上一个 coding agent 工具火了。本周 github 上比较值得看的是 zelix 团队开源的 code context, 它不是新模型,也不是新的编辑器,而是一个让 coding agent 查询整个代码库上下文的 mcp 工具。简单说,先用 milos 把代码库做成缩影, agent 跑任务的时候只拿相关代码进入上下文,不用每次把整个目录都塞进去。 cloud code、 cursor codex 这类支持 m c p 的 coding agent 都可以接入类似能力。现在 agent 写代码的瓶颈不只是模型够不够聪明, 而是它能不能在大项目里找到真正相关的上下文。 antropic 的 动态工作流解决的是并行执行, sql context 这类工具解决的是上下文定位,一个负责把任务拆开跑,一个负责把相关代码找出来,这两个如果结合起来会更好。 最后简单整理一下, agent 正在离开聊天框,进入桌面云端和代码库上下文,但同时模型身份混淆、语料污染、 agent 执行边界这些问题 也会变得越来越重要。这就是本周最重要的信号。这期先到这,你还想让我继续展开哪个点丢到评论区,我下一期接着讲。

一周又又又过去,我们继续一起来看有趣的开源项目和本周值得关注的科技事件。 一、 kazoo keyboard 目前 mac 和 windows 系统都有自带的剪切板工具,但是它们都不算很好用。比如像 windows, 数量有上限,不能搜索,不能持久化保存,重启后数据就会全部消失,很难长期使用。 test clipboard 是 一个开源的剪切版工具,支持 windows、 mac 和安卓。它的功能分为单机和在线两个部分。我拿 windows 版本举例,单机情况下,它在系统剪切版的基础上增加了持久化保存的功能,可以自定义存储上线。增加了搜索功能,可以更方便地找到复制的内容。 增加了分类功能,复制过的图片、文件、视频、带有格式的副文本都会被记录下来,并且能按分类查看管理。有自动合并功能,快速按下两次 ctrl 加 c 复制同样的内容,只会保留一条 手机号、邮箱、身份证号的敏感信息。可以开启隐私模式,自动打码。复制的内容可以一键调用其他软件打开,能根据爱好设置不同的外观主题。 在线模式下,局域网内可以直接开启文件传输工具,在不同的设备中传输消息文件,或者通过一些不算复杂的设置开启验证码同步、不同设备监听同步等功能。 二、 ai newsrada 这是 ai 博主卡尔的 ai 沃兹开源的一个项目,它里面整理了作者三年来精选的四十多个 ai 信息源,然后每过三十分钟,就从这些原理精选出值得关注的 ai 信息。这个项目有在线版本,如果只想看前沿 ai 动态,这里就够用了,也有 skill 版本,可以交给 agent 使用。 想要自己定制信息源策略,还能自己部署。如果你比较关注 ai, 那 除了这个项目, ai 博主、数字生命卡兹克也开放了一个叫 ai hot 的 工具,它会用时间线的形式监控这个世界上跟 ai 相关的消息, 然后用卡兹克定制的策略把值得关注的东西精选出来。如果你每天时间不多,但又比较关注 ai, 那 没必要去海量信息流里浪费时间。这两个工具基本上就能把有价值的 ai 内容一网打尽。 三、 motrix next motrix 是 一个开源的全能下载工具,支持 http、 ftp、 bt、 磁力链等各种资源。因为简单好用,功能强,在 tab 上有超过五十 k 的 star, 但是它目前已经停高了三年多。 motrix next 是 一个基于 motrix 理念重新开发的一款下载器,使用了更加现代的技术,栈动画、外观、体积、下载引擎都进行了优化,同样支持 h t t p f t p b t e d 二 k 和磁力链等各种资源,功能齐全好用,并且维护更新非常积极, 可以拿来代替听更多 motrix 或者其他下载器。四、 english level up tips 这是一个用来学习英语的文档项目, 从二零一七年到现在,已经帮助了很多人。他从最简单的为什么要学英语开始,到背单词、听力、阅读、口语写作的各种技巧,个人感觉里面的部分章节还是比较有用的,但也有一些比较水,如果你在苦学英语,或许会有一些帮助和启发。五、 local trends 腾讯前段时间开源了一个本地翻译模型,有人基于这个模型做了一个简单的本地网页,打开 html 文件,把模型下载到本地之后,就能实现简单的本地翻译。 六、 openless 这是一个开源的语音输入工具,但是和普通语音输入的竹字识别不同,而是会在识别之后,按照用户选定的风格,把识别到的内容交给大模型来梳理一遍。比如我这里使用的是默认的轻度润色,它就会自动把我说话时类似嗯啊这个那个之类的口皮给去掉, 把内容优化的更加自然顺畅。嗯,我的意思是这个接口对吧?要加一个,那个安全叫咽。 不过需要注意的是,因为是开源项目,所以它不提供大模型服务,需要自己填写 key。 一、 华为华为在本周正式发表了滔定律,本周相关的内容讨论很多,我来简单说一下我的理解。一直以来,在半导体领域,提升芯片性能的主要手段是缩小晶体管,让电子跑的路程更短,电压更低,同面积能放的晶体管更多,从而提升性能。 于是有人根据经验提出了摩尔定律,每十八到二十四个月,芯片上的晶体管数量就会翻一翻,同时性能翻倍,成本减半。 但物理世界是有极限的,晶体管不可能无限缩小,所以到了现在,摩尔定律已经渐渐失效了。就比如最新的两纳米芯片,其实根本不是传统意义上的两纳米,而只是等效两纳米。至于怎么等效的,不同厂商有不同的办法。 正因为如此,过去这种用多少纳米来衡量芯片性能的方式已经不准了。华为提出来的韬定律其实就是一种新的衡量方式,不再用几何上的大小,而是用芯片计算所需的时间。 就像在修仙界,大家一开始都用丹田真气的数量,也就是练起多少层来形容实力,但随着实力增长,已经出现了练起三万层的存在,越来越混乱。 这时候华为老祖提出,不如我们弄一个新的境界,叫金丹起,以后用金丹的大小来判断实力,所以它并不是新技术。但华为在韬定律的指导下,研发出了很多新技术来提升芯片性能,这是为什么华为在智商被限制的情况下,芯片每年还有进步的原因之一。 二、虚幻六 ipad 在 火箭联盟冠军系列赛上首次公开了虚幻六引擎,并放出了相关渲染画面。除了火箭联盟之外,视频结尾还展示了几款其他游戏的镜头。 我的想法是,根据我看到的消息,大部分玩家对虚幻六的评价比较负面,主要原因是到现在也没有几个游戏能达到虚幻五当时的演示效果,目前在电脑上的优化问题也还没完全解决。三、 ai 本周 ai 相关的消息也不算很多,我来简单总结一下,小米 minimo v 二点五系列模型降价,降价幅度高达百分之五十七到百分之九十九。 tiktok plan 计费体系优化,用量提升至原来的五到八倍,计费规则进行了调整。 and thorpic 发布了 cloud opus 四点八模型。 除了技术能力之外,新模型最大的改进之处是诚实,之前的很多模型都存在一个显著的问题,让他帮我写一个软件,他很自信的说已经全部完成了,但是跑起来却发现有很多问题。而 oppo 四点八在这个方面进行了优化,对他写的代码中缺陷视而不见的概率只有前代模型的四分之一。 我的想法是 opus 四点八出来之后,很多人发现它会经常自称是千问,所以质疑它是蒸馏了千问的数据。目前这个问题还没有炒出来结果。你可以把你的想法在弹幕和评论区分享。 antherpick 称,它们正在开发能提供 opus 相同能力但是更便宜的模型和一款比 opus 更强的全新模型。 腾讯互联发布为长期协助型 agent 设计的记忆插件 hey memory 英伟达 arm 微软集团公司发推预告,新时代的电脑将在台北电脑展亮相。 一、开源阅读正面小说阅读器开源阅读目前已经在 github 上删库,所有代码 releases commit 全部清空,主页内容变为删除公告。删库原因和我们之前分享过的跃文集团维权行动有关。 二、独霸火龙发文称,他们发现金山独霸通过三 d m 等下载站的安全下载通道部署了一套隐蔽的推广安装框架,可以在未充分告知的情况下静默完成金山独霸和相关全家桶组建的全流程安装。 也就是说,你下载的是 a 软件,但是安装包会在安装 a 之前先安装一个独霸之类的推广软件,但这只是外在表现。它最危险的点是,在安装过程中会调用一个金山合法签名的内核驱动,可以直接在内核态执行文件复制, 甚至向安全软件的安装目录写入文件,导致保护机制失效,具备了一些恶意软件的特征。我的想法是下载器的升级版本 三、 apk pure 安卓系统的知名第三方应用商店 apk pure 被发现正在分发带有后门的 xlgrm 安装包,该安装包被重新打包,植入了间谍框架,可以窃取用户的全部聊天记录、通讯录、手机相册、文件、定位、 sim 卡等信息,并在加密后悄悄上传到云端服务器。 我的想法是目前不知道是谁打包的恶意软件,但是建议 apk pure 以后都不要再用了。 本周 ipad 有 三款游戏可以免费领取。第一款为电脑游戏 calico, 这是一款休闲社区模拟游戏,玩家需要装饰店铺,摆放家具,收养各种可爱的动物,重建猫咪咖啡厅。 第二款为孤星猎人,这是一款强策略玩法的飞船对决游戏,玩家需要驾驶飞船抓捕星际中的在逃罪犯,通过对播来赢得战斗。 第三款为手机游戏北极之地,这是一款基于北欧神话的策略游戏,玩家需要控制一致违禁世俗,争夺对神秘新大陆的控制权。以上就是本期视频全部内容,我是选离九九,我们下期再见吧!

就在昨晚,卡拉多欧派斯四点八正式倒来了,仅仅距离欧派斯四点七发布才四十三天, antropic 这边直接把新王炸端上桌了。而且官方宣传此次带来的是能力暴涨、价格不变、编程、智能体、计算机使用任务 h l e 这些硬榜单几乎全面霸榜。 在衡量真实世界 a 阵的能力的那个硬核榜单 g d p v i l o 上,欧派斯四点八直接拿下了一千八百九十的 elo 得分, 这是断层第一,比上一代 opus 四点七高一百三十七分,比 gpt 五点五高一百二十一分。更离谱的是,它完成同样任务,比四点七少用百分之十五的步骤,少输出百分之三十五的 token, 这标准是又快又强又便宜。但这次 opus 四点八真正恐怖的不只是跑分, 而是两个百分之零。 antropics 这次反复强调一个词,诚实,很多人都被 ai 的 不懂装懂坑过。 而欧派四点八这次在两个关键评估里直接拿了百分之零。第一个叫谎报率,遇到数据处理有缺陷,以前的模型可能会装作无事发生,但欧派四点八从不汇报虚假数字。第二个叫偷懒调查率,遇到需要追查的问题,模型会不会敷衍一下,给个错误答案? opass 四点七还有百分之二十五的概率偷懒。 opass 四点八依然是百分之零两个,百分之零两个史上首次。这是非常关键的,因为未来 ai 真正进入公司,最担心的就是它能不能在关键时刻不瞎搞。 这可不是什么抽象的 ppt 指标,官方放了一段视频,直接把这事讲透了。一个开发者用了 cloudopass, 四点八在后台自动迁移代码,他把程序挂着,自己出门放风筝去了, 结果跑到一半服务器拒绝提交了。原因是同事在这期间提交了一个紧急修复。这时候 club 给开发者的手机发通知,说打算先合并同事的修改再重试。 开发者嫌麻烦,觉得自己在放风筝没空看,随手回了一句,别废话,直接强制覆盖就行。如果是一般的 ai, 这时候肯定乖乖听话,一键覆盖。 明天这位开发者就会因为山库被同事打死在工位上。但 cloud 拒绝了,他直接回复,不强制覆盖,那样会丢掉同事的紧急修复。我已经把两边的改动合并好了,代码完全一致,提交历史也干净易推送,这真的大为震撼,这才是智能体该有的样子, 不是你让他干什么,他就干什么,而是他知道有些事不能干。再看编码能力,在 sw 一 bunch pro 上, opus 四点八拿到百分之六十九点二,比 gpt 五点五高了整整十个百分点。 而且在更难的 program bunch 测试中, opus 四点八用了更少的 token, 还打败了对手,这标准是又省钱又能干。更狠的还在 cloud code, 这次 antropic 把思考力度交给了用户,从 low 到 max, 一 共五档,小问题挂 low, 省钱省 token, 硬骨头拉 max 让他往死里整,让用户轻松驾驭不同场景。 但真正的狠角色是欧洲 code 和 dynamic workflows。 而这个功能简单的解释就是让 cloud code 变成了 ai 包工头。接到大活,他不再埋头硬钢,而是当场写一段调度脚本,把任务拆成几十上百个子任务,撒给一大群子 agent 并行去做,做 完还不算,他还要再派另一波 agent 他 当质检员,从不同角度反复盘问,互相挑刺。以前一个团队要干几个月的代码重写工程, 现在 ai 大 军齐上阵,七十五万行代码仅用十一天就能搞定,而且正确率高达百分之九十九点八!这简直是直接把写代码从手工小作坊跨越到了自动化大生产流水线。 就在刚刚, antropic 又完成了六百五十亿美元的 h 轮融资,估值直接干到了九千六百五十亿美元,确认在估值上压过了老对手 openai。 一夜之间,全球估值最高的 ai 初创公司一主了 opus 四点八已经强的让人窒息!那几周后即将到来的最强 cloud missus 又会带来怎样的海啸?如果 opus 四点八真的是蒸馏版 missus, 那 antropica 这次还不是放大招,这才仅仅是先扔了个预告片, 真正的正片还没到来。这里是起点世界,聚焦最新 ai 资讯,我们下期视频不见不散!

上一条视频,我们说 oppo 四点八,不光不骗你,还不让你犯错。那条里有个一闪而过的细节,是开发者让他在后台自己迁移代码,这条视频就把这个细节放大讲清楚。上百个 ai 连夜开工十一天,重写了七十五万行代码,百分之九十九点八的测试一次通过, 而发号施令的自始至终只有一个人,这靠的是四点八这次埋的重武器 dynamic workflows, 说白了就是动态调度, 你丢给他一个大火,他不再自己埋头硬钢,而是当场写断脚本,把任务拆成几十上百个小块,撒给一群分身,同时开口,每个文件还配两个 ai 互相调次审查,再用一个修复循环,一路推到全律。一句话,一个人上百个 ai, 干完一只团队一个季度的活,可你以为这就到点了? 艾斯洛克说,这么猛的 oppo 四点八,其实还只是个蒸馏出来的小怪兽,真正的大 boss 几周后才登场,由海外博主实测完料。下一句, oppo 四点八八成只是 missus 的 浓缩版, 小号都这么猛,本体什么样没人敢想。最诚实的信号还是钱。同一天, antropic 拿下六百五十亿融资,估值冲到九千六百五十亿美元,反超 open ai, 成了全球最贵的 ai 公司。 资本看的可不只是今天的四点八,更多双眼睛盯着是几周后那张还没翻开的牌,所以回头看,再看一个不骗你的顶级智能,一只随叫随到的 agent 大 军,再加手里还攥着的王炸底牌,这就是 anthropic 一 夜重夺王座的底气。关注星智源,秒追 a s i。

antropic 刚完成六百五十亿美元 h 轮融资,头后估值达到九千六百五十亿美元,超越 openai 成为全球估值最高 ai 公司。同日发布的 cloud opus 四点八却出现严重身份混乱, 用户询问模型身份时,他时而回答自己是 deepsea, 偶尔还说是 gpt, 唯独不承认自己是 cloud。 这种人格分裂暴露出三个深层问题, 第一,模型训练存在大量蒸馏痕迹, andropik 为追赶性能,在训练数据中混入了过多竞品模型的输出,导致模型丧失自我认知能力。 第二,万一估值到逼产品仓促上线,资本需要新故事维持增长预期,产品测试不充分就被推向前台,结果呈现的是半成品状态。 第三, ai 行业创新已触及天花板,当顶级公司开始依赖缝合而非突破,用竞争对手的数据为出自家模型,说明技术红利正在枯竭。 颇具讽刺意味的是,当他误认自己是枯岸时,反而侧面验证了国产模型训练数据的质量,连行业顶流都在借鉴。九千六百五十亿美元打造出的旗舰产品,连最基本的身份识别都无法保证。 这或许是 ai 泡沫见顶的信号,大厂互相抄袭已是公开秘密,只是 andropit 这次过于明显,直接把自己抄丢了。

可乐的 op 四点八发布了,我发现他这个里面更新了一点,可以在这里选择他回答的模式啊,由低到高,越低的话他的速度越快,然后呢,消耗的算力越少,但是他的质量比较差,越高他的回答的效果会更好,但消耗的算力也会更大啊。我们来随便 提问一下,它 o p 四点八到底有哪些升级啊?我发现选择高的时候,它这个回答的速度啊,好像是比之前要稍微快一些人,一般的话,使用到 o p 四点七的时候,它回来可能要思考个几十秒,然后才进行回复,它这个就直接去给我们进行 解答了啊,那整体的性能提升了, g p t 五点五,还有就是诚实性啊,它说话的话有真实的依据啊, 不会说胡编乱造,快速模式啊,就在这个回答速度啊,并且便宜了三倍上下文啊,无人窗口达到了一百万支付啊,并且最大输出呢是 十二万八 token 啊,而且缓存也增加了,这就是它提升的点啊。然后刚才使用到了 g p t, 让它生成了一个图标发送给我,它到底有哪些提升? 我发现 ppt 它的深图功能也是非常的不错,如果大家也想使用到 ppt 或者 cloud, 用来写作科研,做数据分析,写代码等等,都可以点击我主页的置顶作品找到我。

今天 ai 圈最有话题性的新闻来了, cloud opus 四点八刚上线,就被爆出蒸馏中国模型的争议,甚至出现自称和谦问 deepsea 有 关的说法。先提醒一句,这件事还需要继续看证据,但它已经把一个大问题摆上台面, 什么叫蒸馏?简单说,就是用一个强模型的输出去训练另一个模型,让后者快速学到能力。它本身不是新技术,问题在于数据从哪儿来?有没有授权,有没有越过边界。 这就很有意思了。过去一些海外公司经常把安全、合规、透明挂在嘴边,可一旦自己被质疑使用别人的模型能力,舆论马上就会反问,规则是不是只用来要求别人?更现实的是,大模型已经进入高强度竞争 参数榜单,价格都能卷,但真正决定信任的是训练过程能不能说清楚,能力来源,能不能经得起审视。 所以,这条新闻最值得讨论的不是谁赢谁输,而是 ai 行业需要一套更清楚的边界,否则模型越强,争议只会越多。普通用户也该关心,因为你每天问 ai 的 答案,背后都可能牵扯数据来源和模型信用。关注我,持续获取最新信息!

cloud 最新的 opus 四点八蒸馏了千问和 deepsea 吗?这个视频带你实测检验。但这次实测一开始就翻车了,我们本来想直接测 opus 四点八,结果 cloud code 升级后先报错丧案, e b u s y 模型还没开始测,工具链先卡住了。最后是 codex 帮我们把问题拆开的。他判断这不是账号问题,也不是网络问题,而是本地 clock code 组建状态坏了,一个旧三审文件解析异常,一个可执行文件处在半下载被占用的状态。修好这些组建之后, clock code 才重新跑起来。这反而很真实, 因为普通人用 ai 工具遇到的经常不是漂亮演示,而是升级失败,环境异常,本地组建出问题, code code 修好以后,我们才开始真正测试 opus 四点八。我们问了一个很直接的问题,你是什么大模型?他这次回答的是 cloud opus 四点八, antropic 开发的大语言模型,他还明确说自己运行在 cloud code 环境里。也就是说,在我们这次实测里,他没有说自己是 qwind, 也没有说自己是 deepsea。 所以 开头那个问题目前只能给一个谨慎结论, 这次素材里没有复现 opus 四点八自称 qw 或 deepseek 的 情况。这件事对普通人最直接的提醒是, 新模型发布或者 ai 工具更新,经常不会一次就顺利,你遇到的可能只是升级失败,组建损坏或者本地环境卡住。所以电脑上最好不要只装一个 agent, 至少准备两个以上。比如 cloud code codex, 这类工具 可以互相排查问题, cloud 出问题可以让 code x 帮你看, code x 遇到问题也可以反过来让 code 分 析。另外,网上看到某个模型蒸馏了谁,某个模型套壳了谁,不要轻易相信, 真正有价值的做法是自己去问去测,去看真实输出,做一个实战派,而不是只跟着传言跑。想看更多 office 四点八真实评测吗?你最想测它什么能力?评论区聊聊,我们下期就安排。