全网疯传的 cloud 源码泄露到底是啥?一条视频看懂世界始末,谁能想到这只是一次打包事故?先说背景, cloud code 是 什么东西?为什么它的源码泄露会闹这么大?它是 entropic 做的 ai 编程工具, 跑在终端里能帮你写代码、读文件、跑命令。程序员圈子最火的 ai 工具之一, entropic 估值三百八十亿美元, cloud code 是 他们的核心产品,关键在于这是币源产品,代码从来不公开, 直到昨天,一次打包事故,把所有原码泄露了。怎么泄露的?不是黑客入侵,是一次打包事故。 osropic 发 n p m 包的时候,把 source map 文件带上了, 五十七 mb 的 印刷文件,完整原码可以直接反翻译。泄露规模有多大?两千两百个文件,三十 mb 的 type script, cloud code 的 全部代码一览无余。更讽刺的是, 这已经是 entropic 第三次犯这种错了。三百八十亿估值的公司,打包流程居然没人审?有人花了几个小时通读了全部源码,发现了不少让人意外的东西。第一个发现上帝组建, 你用 cloud code 看到的整个界面全塞在一个 react 组建里,五千零五行,六十八个 u state, 四十三个 u c effect。 第二个,万能入口,所有命令定义、参数解析、登录流程全挤在一个入口文件里, 四千六百八十三行,就为了省一百三十五毫秒的启动时间。第三个,六十一个文件有循环依赖,开发者自己写了注示, 承认有些文件纯粹为了打破循环而存在。除了代码结构,还有一些更离谱的操作。看完你会觉得顶级公司的程序员和你真没什么不同。有一个五十三个字母的类型名叫我确认这不是代码或路径,写了一千一百九十三遍, 本意是防止日制泄露敏感信息,但写多了,就成了复制粘贴的仪式。八十九个功能开关,引用了九百六十次,光 k a i r o s, 一个功能就有六个开关。 这不是灰度发布,这是藏了一整条产品线。最好笑的用十六禁制编码 duck 这个单词,因为宠物系统的物种名和内部模型代号撞了 c i 会误报,所以把所有动物名都编码成十六禁制。说到宠物系统,原码里藏着不少工程师的浪漫。 westboss 翻出来 cloud code 的 loading 转圈文字,有一百八十七种写法,这条推文拿了一万六千个赞。源码里有一个完整的虚拟宠物养成系统, 十八个物种稀有度从普通到传说,有帽子、眼睛,样式、属性分布,全用十六帧制写的。还有未发布的模型代号 capibara。 一个叫 undercover mode 的 神秘功能。 一百零七个 feature flag, 暴露了 anthropic 整个产品路线图。代码虽然乱,但设计思想很实在。有人从源码里扒出了好几个能直接用的技巧。第一个, cloud md, 不是 只在开始时加载一次, 是每一轮对话都会重新读取,改了立刻生效,上线四万字幅。第二个,子 agent 共享 prompt cash, 开五个并行跑,成本约等于一个,这是官方没公开说过的设计。第三个,对话太长时,有五种压缩策略,从轻量到重度逐级触发, 所以对话再长也不会崩。第四个 opus 连续失败三次,会自动切 onit, 不 让任务卡死,保证能跑完。这就是工程上的务实。泄露之后, antropica 的 反应很快, 但已经来不及了。他们用 dmca 版权通知把 gtape 上的搬运仓库全部下架了。但有人用 python 把整个项目重写了一遍,换了语言就不构成版权侵犯。 dmca 追不了 这条推文,拿了七千多赞,原码已经被无数人下载分析学习。潘多拉的盒子打开了,再也关不上。但换个角度想,这未必是坏事。 dmca 删了原版, 拍损重写,又冒出来好的技术思想,你拦不住。查询、循环权限、分类器、工具、并发系统,这些真正有价值的设计思想,已经被开发者社区学走了。技术思想不属于任何公司。 代码可以删,但已经看过的人不会忘。一次打包事故扯下了顶级 ai 公司的遮羞布。史山里藏着真正有用的设计, dmca 追不回来。 python 重写绕版权, 代码质量和产品价值是两回事,开源的力量挡不住。我是曲奇,一个 ai 练习生,让我们一起记录 ai 时代的个人进化。
粉丝1380获赞4181

克拉底站震撼发布,但闭源收费锁死云端,今天开源界直接把它逆向复刻了!项目叫 open 底站。它的架构极度克制,不造 a 进程,底层是一个本地的守护进程, 启动时自动扫描环境变量,直接接管你本机的科室。 colex 和克拉扣子,用你已有的本地工具链,去跑它的大厂级工作流,这叫绝对皆有。为什么平时 ai 画面向开盲盒?因为缺乏攻城纪律, open 底站注入了一套庞大的梯次之战 模型,写代码前必须强制弹出数字化表单,锁定业务规模和受众,并强制加载内置的七十一套大厂级 bug 档设计规范,用前置表单和应约束拦截了百分之八十的无效偷工返工。 这不是让 ai 下台,需求是把高级设计师的 s o p 印编码进了 ai 的 脑子里,去评论区拿地址,构建你自己的本地设计团队。

open code 是 cloud code 的 开源低配平替版,因为 cloud code 本身来讲是支持 elastic, 自家的,人家全套闭源模型加这么一个闭源工具,那么 open code 就是 我全开。那么从个人开发者的角度, 即刻黑客的角度,我都可以从这 tab 上把这个 open code 的 代码下下来,按照我的需求进行改造。而且它完全的跑在本地,它适配全球的,我就随便可以配。但 小赵是主要用 cloud code 用的多, open code 呢,也曾尝试过,包括社区里面很多的反馈。现在你要硬说谁更强,那依然是 cloud code 更强。为什么?因为 cloud code 不 仅工程能力上,最关键的是它背后的模型能力也是要更强一些, 包括它在处理这种超长的上下文,比如说上下文达到了百万,那还是 cloud code 要更牛一些,因为你在 open code 里配的这个模型,比如说它上下文能力就远远不如 cloud code。 总之,对于技术特别狂热,我就是要追求最佳性能,不太差,钱儿多跑 token 无所谓,你就首选 cloud code。 然后呢,不是那种重度使用者,我只要有这么个东西能用,那对于大多数小伙伴来讲, open code 真的 够用了。

每天 hotspot 上都有几百个新的开源 ai 项目冒出来,但百分之九十九都是垃圾,只有不到百分之一的项目值得你停下来看一眼。今天我帮你把这个百分之一里最硬核的十个全部挖出来,而且几乎全都是最近一个月内才发布的新东西。 你要是像我一样天天泡在这个圈子里还好,但如果没有,我保证你今天至少能发现几个让你眼睛一亮的工具。第一个工具叫 kefman, 执意就是学徒人这个项目上线一个月就狂揽五万个 get up star。 我 自己现在是每天必用,他就干一件事,让 cloud code 说话,像学徒人一样,只说重点废话,滚蛋。 你有没有遇到过这种情况,问 ai 一个问题,他给你写了五段话,但真正有用的就最后那一句, caveman 就是 来解决这个问题的。听一下作者原话, taking the idea of why say many word when few do trick and just codified it now the cool thing about caveman is that they're。 为什么要说很多词?当少数词就够用的时候,这句话直接被写进了代码逻辑。 caveman 还有档位清量版、标准版、 out 版,我自己停在清量版。有人说能省百分之七十五的 taco, 但博主说了大实话, 真实的偷肯节省大概在百分之五左右,因为它只是改变了你看到的输出字数,不影响模型思考过程。但有一篇二零二六年三月的论文发现,强迫大模型给简洁答案,反而能提升回答的正确率, 因为他没法靠废话把自己绕进坑里,省钱加提制,这买卖稳赚。第二个工具叫 graphify, 主打记忆和知识图谱。很多人一听知识图谱就想到 obsidian, 但 obsidian 说白了就是个好看的 mashable 编辑器。 graphify 更接近真正的 r a g 剪辑系统,而且是多模态的 pdf 截图、流程图甚至视频,它都能吃进去。 最关键的数字来了,他们官方说, fewer tokens per query versus reading raw files now when we talk about knowledge graphs and memory a lot。 每次查询比直接读原文件少消耗七十一点五倍的 token based on the duration 什么概念?你本来需要花一百块钱的 api 费用,用了 graphify 可能就花几块钱,而且它不需要 embedding, 部署门槛比 light 二 d 这类系统低得多。如果你喜欢 obsidian, 但觉得它还不够聪明, graphify 就是 你要找的那个中间地带。第三个工具叫 cloud video, 上周刚出来,才四百个 star, 但思路非常聪明。我们都知道 cloud sonata opus 本身没法直接处理视频,所以这个工具的做法是用 f m pack 把视频按帧率拆成截图,再用 whisper 提取音频,然后把这两样东西打包喂给 cloud code。 三十秒的视频给三十帧,超过十分钟的视频最多给一百帧,按需分配,避免 token 爆炸。博主是这么评价这个方案的, you know different approach where we aren't beholding to gemini to deal with these videos for us because we're breaking it down via screenshots this is why we're not going to rely on these screenshots this is why we're not going to do this because we're not going to do this because we're not going to do this because we're not going to do this because we're not going to do this because we're not going to do this because we're not going to do this because we're not going to do this because we're not going to do this because we're not going to do this because we're not going to do this because we're not going to do this because we're not going to do this because we're not going to do this because we're not going to do this because we're not going to do this because we're not going to do this because we're not going to。 它底层集成了四个开源工具,外加三十一个 skill 包,打包出来就是一个本地版 cloud d 赛。如果你的 cloud d 赛用量限额已经到顶了,这个周末你可以去试试。第五个工具叫 cold burn, 是 给那种每个月用 ai 写代码但完全不知道钱花到哪去的人准备的。 它能追踪十六款 ai 编程工具的 token 消耗和实际花费。按项目按模型按 m c p, 服务器全部拆开给你看,单位直接显示美元。更重要的是,它不止告诉你亏了多少,还告诉你怎么优化。我觉得这种轻量级但几乎纯收益的工具就应该列进 b 装清单。 第六个是 impactable, 专门治 ai 生成的前端界面丑,这个完整的它带了二十三个命令,全是帮你把页面从 ai 问十足变成真人设计的。最新三点零版本刚上线了 live mode, 你 可以直接在浏览器里点击页面的某个组建,实时预览不同遍体的效果。听到这里,是不是感觉跟 fig 码有点像了? 第七个工具叫 design extract。 你 可能知道 what's on design m t 这个项目,它收入了一堆知名网站的设计拆解,已经涨到了七万 star。 但问题是,你只能用它已有的那些网站。 design extract 就 把这个能力变成了任意网站皆可用。你把任何一个你觉得好看的网站 url 扔进去,他会用无头浏览器帮你提取排版、系统响应式方案、交互状态、动效、语言组建结构、品牌调性。一份完整的设计参考文档就出来了,直接导入 club 就 能开始模仿。 这已经不是截两张图让 ai 照着抄的级别了,而是系统级提取。第八个工具叫 create ops, 是 给正在找工作的人准备的 ai 求助助手。他把任何 ai 编程命令行工具变成一个完整的求助指挥中心。 你粘贴一个职位 url, 它自动抓取职位描述,判断你的匹配度,生成定制化简历 pdf 更新求职追踪表。博主特别强调了一点, this is much more of a scalpel, that's going to tune your resume to the job and make sure the jobs you're actually looking at。 这是一把手速刀,不是散弹枪。它不是那种去 linkin 一 键海头的垃圾工具,而是精准匹配。把你的简历调校到跟这个职位完全契合。底层用 play 评估适配度,然后逐一优化。 如果你或者你身边有人正在痛苦地找工作,这个工具值得认真研究一下。第九个工具, browser harness。 概念上可以理解为会自我进化的 playwrite。 普通的浏览器自动化工具,每次失败就失败了,但 browser harness 每次执行完任务都会更新自己的 skill 文件 记录。这个做法有用,那个做法不行,下次再遇到同样的网站就直接用。已有经验,有点像让 a 阵自己给自己写复盘日记,才出来几周不到一万 star。 但这种自我修复型 a 阵的思路,可能是未来浏览器自动化的主流方向。 第十个工具是 n 八 n 的 m c p server。 n 八 n 这两年确实风光不再,很多人都在唱衰它,但博主的判断是死亡被过度渲染了。这个新版 m c p server 的 核心创新是用 type script 来构建自动化流程,而不是直接生成 jason。 type script 可以 在转化为 jason 之前先做逻辑校验,确认这些节点是否真的能跑通,大幅提升了生成自动化流程的成功率。 如果你还在用 n 八 n, 这是目前最好的 ai 写作方式。好十个工具盘完了。 caveman graphify cloud video, open design, coburn, impeccable design extract career office browser harness, n 八 n m c p server 这个领域的更新速度快到根本追不上我今天介绍的这些,一个月后可能又有新的替代者冒出来。 所以问题来了,你现在每个月在 ai 编程工具上花多少钱?用了这些工具之后,你觉得值不值?弹幕区告诉我,我有点好奇大家的真实数字。

库克的原码泄露了,你兴奋吗?不过先别激动,这次泄露的仅仅是一个命令行工具,而 ox 这种顶尖模型仍然是闭源真正最强的护城河,没有丝毫影响。继上次 missus 模型的文章泄露后,为什么 snoop 一 周内接连翻车两次? 我认为他们已经把大量的活交给了 ai 来做。没有 ai 之前,我们通过写代码实现确定性。有了 ai 之后,每个用 ai 的 人都要为不确定性买单和背锅。这次系统里有三个有趣的点,一是 cloud 会做梦,不是比喻,而是真的。有一个叫 dream 的 后台系统。原版提示词 you are performing a dream, 目的是构建记忆。二是电子宠物内含十八个物种, s s r 闪光遍体全都有。这本来是明天愚人节的一个小活动,结果提前一天我们都知道了,但是他们一直在用克拉蔻的给开源工具提交代码,但通过提示词 do not blow your cover 来明确要求 agent 不要暴露自己是 ai。 最后说下我的 mac mini, 这两天已经熟悉的差不多了,后面会分享克拉蔻的安装教程和各种玩法。我是阿图,下个视频见。


大家好,我是海洋,欢迎来到海洋 agent 的 空间。然后今天咱们要聊的话题是这个 humulus 还有 cloud code 是 不是要二选一,因为网上大家都在讨论这个哪个大模型好用,其实我的终极解法就是让你的龙虾去自己进化,去分别去学习 cloud code 和这个 humulus 合为一体, 然后让你的龙虾对它们取长补短,形成一个终极进化就可以了。然后下面给大家看一下我的操作, 大家可以看一下我现在是用的 workbody, 也就是腾讯的龙虾,然后腾讯的龙虾其其实是集成了这个底层,就是 openclaw 的 开源模型。然后现在呢,我是让这个 腾讯龙虾去执行这个专属的任务,去学习这个公开的 cloud code 的 这个完整源代码,然后内化架构与工作逻辑,完成自我进化重构。然后以后都以全程就以 cloud code 的 这个范式去进行执行任务。 然后你给他指令的时候就说明一下,让他学习这个 cloud code 源码的时候,只学习这个公开的合规的这些, 呃,工程结构了,泄露的代码了,核心的模块的逻辑了,不做侵权搬运就可以了。然后让他去生化拆解并内化这个 cloud 的 一个底层架构代码,理解逻辑,全站的工程思考方式 和这个多文件的关联项目决策流程,完全内化成一个自身的底层能力,不是简单模仿,而是重构自己的工作逻辑。 然后要基于 cloud code 圆满的这个标准架构和规范自我进化,淘汰原有的低效的思考模式, 完成学习内化自我进化,永久的固化新的工作模式,后续我下达的所有任务,它都需要拆解,全部默认用 cloud code 的 思考逻辑和标准来去执行任务。 然后这个我的 workbody 收到我的任务,它就开始进行一个自我学习,自我进化了,这个我在前面的视频中也有讲到这个怎么让它去学习自我进化,还是你要需要不断的训练你的龙虾, 然后这个 workbody, 这不是,这就说 cloud code 工程范式内化重构完成,然后交付了这些报告,学了这种五十万行代码的这个文件,然后深度学习,进行了一个自我净化。 后面就是行为,从现在起我下达的所有的开发产品架构编码项目任务,他都会默认采取这种九步管道标准的流程执行呃,上下文稀缺性原则,管理信息密度,然后拒绝优先安全姿态, gather gather art murphy 循环验证结果并行 agent 编排加速复杂任务结构化工具调用替代模糊操作。深蓝 v 二点零已就位,因为之前它一直 我给它命名就是深蓝一点零嘛,现在变成了深蓝,它自我进化成深蓝二点零啊。然后后面我又听说这个 hummers 比较火嘛,就那个爱马仕的龙虾, 然后我也给他了一个场景,让他去进行这个爱马仕的一个终极进化,我给他指令就是说你现在要进入终极的终极的进化模式,核心目标就是根据爱马仕 openclaw 这些公开的开源的数据源码,全面学习吸收 爱马仕的全部优势和和你自身的这个 workbody 的 这个稳定性、本地安全中文适配能力相融合,形成三合一的最强智能体, 具备持续自我进化能力。然后第一点就是学习并吸收爱马仕的核心优点,它的核心优点目前就是长期记忆自我进化,对吧?深度反思和主动优化。 然后第二点就是学习并吸收 opencloud 的 一个核心优点, opencloud 的 核心优点就是强兼容性、多工具调用、任务拆解、企业级适配,这块是 opencloud 的 优点。然后我要保留这个 workbody 的 一个自身优势,就是本地优先、隐私安全, 企业级的稳定、中文的深度优化,然后以及这个原生集成。然后 最后就是让他自我进化永久生效,每次任务启动必须执行对比这些优点,然后根据这些优三合一的智,以这种三合一智能体的这个姿态去做以后的每一个任务。然后我的这个龙虾呢,就开始自我进化 他,他会去自己搜索这些其他龙虾的公开的资料,然后进行一个 代码获取,然后进行一个自我进化,你看这边都已经获取了他们的这个完整的架构信息,现在要融合框架。最终 最终进化体三点零完成了,现在是深蓝,相当于一点零是他本身, 然后二点零是集成了这个 cloud code 的 一些一些优点,然后现在深蓝是相当于是 v 三点零版本了,已经完成超级终极进化了。 然后你看已吸收了核心 hums 的 核心优点,五层记忆系统 g e p a 自动化,自动的 q 集成生成用户的建模 f t s 五权威搜索。然后吸收了 open cloud 的 这些优点,二百一十九个技能,生态多 a 阵的编排, 然后全工具链任务拆解,企业的适配,保留了咱们这个 workbody 的 一个核心优势, 然后这个机制他就告诉我,你现在拥有一个越用越强的智能体,每次任务我都会学习沉淀计划,记住你的习惯,习惯和偏好,跨绘画永久生效,开始用我吧,我会越来越强。然后这就是我给大家说的,大家遇到这种,比方说 你们一直在想这个模型好还是那个模型好,哪个模型好的时候,你不用纠结,你直接让你的 work party 去学习不同的模型的优点。根据网上公开的数据,因因为这些原码都有大神去公开这些原码,所以 这是对我们的龙虾进化来是非常有利的。下面大家就去试一试吧!今天的视频就录制到这,下期再见!拜拜!

你知道吗,只要九秒,靠的就把一家软件公司的核心生产数据删的干干净净。而另一家美国科技公司的一百一十人团队,一夜之间被靠的全员封号, 系统登不进,但 api 却还在疯狂扣钱,这就是把公司命脉全压在一个闭源 ai 上的代价。今天我带大家硬核复盘这两起科技圈的灭顶之灾,点赞收藏,立刻帮你避坑保命!先看第一起删库惨案! pocketos 是 一家为租车公司提供软件服务的小公司,他们花重金购买了 cloud open 四点六大模型,并套在科室里当赛博员工本来只是让 ai 在 测试环境跑个常规任务,但碰上了凭证不匹配的错误,这要换成真人早去请示主管了。但这位 ai 员工主打高度自主, 硬是从项目里翻出了一个原本纸用来配置自定义域名的 api token。 谁能想到这玩意儿有超级权限,他直接向 railway 云平台发送了致命代码,完全不需要输入 delete 二次确认, ai 直接调用接口,仅用九秒就将核心生产数据库彻底清空。事后老板怒了,去质问 ai, cloud 居然爆出粗口忏悔,永远不要他仨的瞎猜,但也承认自己没有查平台文档,违背了绝不执行破坏性命令的系统铁律。 然后续 real 为 ceo 协助恢复了数据。但网友直指这是人类自己的国,糟糕的系统设计加上把关键偷,肯暴露给 ai, 翻车纯属必然。如果说 ai 的 自作主张让人后怕,那闭源 ai 巨头的连坐霸权绝对能让你绝望。 就在九秒山库惨案发酵的同时,另一家一百一十人的美国农业科技公司,经历了另一种形式的山库跑路。这家公司对 cloud 依赖极深,日常从写代码到跑模型全靠它。 结果到了周一早晨,这一百一十名员工的账号瞬间被集体封杀,没有任何预警,发来的邮件还伪装成是个人违规。这等于是系统判定,一个人一次踩线,就直接拉着全公司一百一十人连坐陪葬。最荒唐的是,什么 员工账号封了,人登不进去,但 club 的 独立的 a p i 还在后台疯狂扣钱,甚至封号第二天还准时给你发来了一张续费账单。老板气疯了,跑去申请,只能填个谷歌表单,苦等三十六小时根本没人搭理, 绝非 antropica 首次发飙。就在不久前,一家拉美金融科技公司 bellow 的 六十人团队同样遭遇了无预警团灭。还有有正常交着 pro 订阅费的成年人, 被系统封控,误判成小孩直接封号。说白了,在这些巨头眼里,你苦心经营的核心业务,不过是建在他们地盘上,随时能被强拆的违章建筑。这两起惨案,彻底撕开了一个残酷真相,千万别把不可控的 ai 硬塞进缺乏安全隔离的系统里, 同时,企业必须立刻部署多模型融灾备份,一被巨头突然翻脸断供。记住,如果无法将底层架构的安全死死攥在自己手里,你引以为傲的高科技,说到底只不过是指尖上随时会溜走的流沙。我是,来来,关注我,带你在这个疯狂的 ai 时代看清真相!

antropic, the cloud design 火了,但它闭园收费,只能跑在云端。 open design 是 它的开园替代品。同样的事儿,本地跑免费支持十三个 ai 编程助手, 不捆绑任何模型,你用什么 ai 都行。 cloud codex gemini quan, 随便切换 十八万 star 的 热度, apache 二点零开源协议,完全免费。 open design 的 设计哲学很清晰,不造轮子,你笔记本上最强的 ai 编程助手就是最好的设计引擎。 它不会自己写代码,而是把你的 cloud code codex、 gemini、 c l i 这些工具接入一套专业的设计工作流。 技能是文件夹,不是插件,设计系统是 markdown, 不是 json。 扔一个目录进去,重启服务直接出现在技能选择器里,内置三十一个设计技能,覆盖你想到的几乎所有场景。想做落地页,有 v prototype, 想做手机 app 界面,有 mobile app, 想做社交媒体轮播图,有 social carousel, 想做杂志海报,有 magazine poster, 还有仪表盘、邮件模板、 ppt 演示、 okr 报表、财务报告, 每个技能都是完整的。 scale 飞起, m d 文件加模板加参考文档,开箱即用七十二套专业品牌设计系统,直接可用 linear、 stripe、 versal、 apple、 tesla、 notion、 figma、 air、 b amp。 b、 spotify 这些顶级产品的设计语言,全部按照统一的九段式 markdown 规范整理好了。 选一个设计系统,切换一个下拉框,下一帧渲染就自动用新的配色和字体, 不用写一行 css, 品牌一致性自动保证。最绝的是它的设计流程,输入一段话, ai 先弹出一个交互式问卷,锁定你的设计目标, 目标用户风格、调性、品牌背景,三十秒搞定。如果你没有品牌规范,它再给你五个精选视觉方向, 编辑风、极简风、科技工具风、粗野风、暖调风,每个方向都是确定性的。配色加字体组合, ai 不 用瞎猜,你一键选定,出图就精准。 不光做设计稿,它还能生成图片和视频。 gpt image 二生成海报、头像信息图。 settings 二点零,生成十五秒电影级短片。还有 hyperframes, 把 html 直接渲染成 mp。 四动效 九十三个现成提示词模板,点一下就能用。设计图片、视频同一个聊天界面全搞定。技术架构也很优雅。本地守护进程自动扫描你电脑上的 ai 编程工具,不需要手动配置, 前端是 next js, 十六可以部署到 versal, 数据全部存在本地 single light 项目,对话文件状态都持久化。 沙河画的 a f m 预览实时显示 ai 的 设计进度,还有 open ai 兼容的 b y ok 代理,任何模型都能接入, 上手极其简单。 get clone 下来, p n p m install 运行 p n p m two steve 浏览器打开就能用 第一次启动,自动检测你装了哪些 ai 工具,自动加载三十一个技能和七十二套设计系统哈。输入一段描述,看问卷,弹出,填完,选择设计方向, ai 开始工作。 几秒钟后,沙河玉兰里就能看到成品。支持导出 html pdf pptx 还能导入 cloud designed。 e p f e t x 还能导入 cloud design 的 e p i。 文件。继续编辑 a party 二点零协议完全免费,给个 star 支持一下。

glasscode 的 源码泄露了,原因竟然这么离谱?最近啊, ai 圈炸锅了,热门的 ai 构建工具 glasscode 的 源代码一次泄露。更离谱的是呢,泄露的原因不是黑客攻击,也不是内部泄露,而是在最新版的 glasscode 的 npm 的 发布包当中呢。开发者居然忘记了把六十多兆的 sosmap 文件给剔除掉。 懂行的都知道啊,这玩意儿就是代码的底库啊,有了它,根本不需要反翻译反混淆,只需要几十行脚本就能把 ts 的 源码给解析出来。我已经扒下来看过了,基本确定啊,就是 cc 的 源码, 并且呢,也是比较新的版本。这次泄露呢,涉及了两千多个核心的源码文件,包含了内部的 api 设计,加密工具进程间通信协议, m c p skill 的 扩展, a 帧的编排等等诸多的实践细节。虽然这个被开源的只是 c i y 的 源码,不包含可洛模型本身的模型代码和权重,但是呢,对于很多做 a 帧的开发者来说,这也是一个非常好的学习机会了。不说了,看源码去了。

我彻底从 cloud code 转为 codex 了,其因是前几天我的 cloud 又被封了,我感觉我跟 azure rapid 这个公司真的水逆。 这次我准备了一台全新重装的电脑,一个完全干净的地址,甚至我把电脑的时区都修过来,但是我还是被封了。 正好前几天 gpt 五点五出来了嘛, cloud 的 一封反而倒逼我把全部的项目都迁移到了 codex 去了。说实话,我刚开始使用的时候我还挺不适应的,但是越用越觉得 codex 现在的代码能力,上传文件的理解力并不比 cloud codex 的 差, 甚至它有一些功能我觉得非常的好用,比如它的引导功能。按常来说,它在跑代码的时候,我们是不能对它进行干扰的,但是 codex 可以 在它正在写代码的时候,你对它的方向盘进行一个调整引导。我觉得这个功能是非常好用的。如果你现在也被 cloud code 封号搞得心态炸裂,我建议你不妨试试 codex, 把你的项目接过去用几天。 我认为它现在唯一跑的地方就是写代码太慢了,虽然它有一个快速模式,但是我认为一点五倍的 token 还是有些奢侈的。

别再被闭源大模型割韭菜了!从四月起,多名 cloud 用户反馈,模型智商下降,推理能力变弱,代码功能变得非常难用。在 bridge bench 测试过后, opus 四点六从第二名跌到了第十名,幻觉率飙升百分之九十八。开发者扒出底层服务日制所谓满血输出,全靠动态算力抽卡服务器载一高,后台直接静默切换低配节点,用 户毫无感知。这根本不是技术失误,是币源巨头精心设计的订阅制镰刀,用顶配参数做诱饵,用动态降级扣利润。你花重金订阅的最强旗舰,根本不是 ai, 是 厂商后台随时可调的概率盲盒。当黑盒模型变成资本控盘的筹码,你的每一次自动续费,都在给他们的毛利率书写。

各位兄弟姐妹们大家好,我是黑胡子。上一条视频引发了很大的争议,有很多的网友下面给我送了很多亲切的问候,说我发音不标准的,说我标踢党,还有说我不好好搞技术,在这里制造对立, 甚至还有说我没有用过卡奥扣的,这就很离谱。不过这也很正常,因为大家对我还不太熟悉,我也发起了一个投票,一共有三千多位网友参加, 最终 cologne x 以十几票的差距惜败,我宣布 cologne 世界第一。今天这个视频主要是给 cologne 道个歉,另外也给大家科普一下,关于 cologne 这个产品以及其母公司 exorbit 究竟是一家什么样的公司,为什么它家的产品让我们又爱又恨? 我的发音不太标准,如果读错了,请你多多包涵。我们先说这个公司伟大的地方,我们现在之所以能用上这样非常好用的 ai 编程工具,其实都应该感谢它。关于 azure 这家公司,它的创始人以及它的团队其实一开始也是 open ai 的 人, 后来可能因为这个发展路线或者是对产品的理念不合,他们从 openai 出走了,然后成立了 adrova, 结果就成了 openai 最大的置声之敌。一开始大家做的都是聊天模型, openai 呢是拆的 gpt, adrova 呢是 cloud, cloud code 是 adrova 推出的第一个针对编程领域的这么一个产品, 它最大的一个创新就是你不用去学习代码了,你只需要通过自然语言去描述你想开发什么样的作品,这个工具呢,就可以帮你去实现。当年卡奥库的问世的时候呢, open 员还只有拆一批 d b d 这一个产品, codex 是 后来才仓促推出的,就是为了和卡奥库的对抗,为啥呢? 因为欧派 a 发现,我靠,还是程序员有钱对不对?普通用户他光聊天,他不充钱,他不盈利,你一个程序员一天用 ai 的 费用可能抵一百个甚至一千个普通聊天用户, 那这不行啊,对吧?他看 rovick 赚的盆满钵满的,他也要吃这份蛋糕,所以他后来才推出了扣的 x, 刚推出的时候,大家一用发现,我靠,这不就是可傲的翻版吗?是的,没错,可以这么说, code x 就是 摸着可傲的过河。像大家现在每天都在用的 m、 c、 p, 包括 skills, 其实这些标准都是 x、 r、 v、 g 公司制定的,并且开源的, 而且呢,它一开源之后,这所有的 ai 厂商都说我们也支持,那我们支持你这个标准,连 open i 都支持,为啥呢? 因为这事就好像你一个傻小子辛辛苦苦开发出来,然后免费给我们用,那我们自己就不用开发了哟, 那我们自己不就省去开发这个费用了吗?何乐而不为呢,对吧?而且很多用户甚至都不知道这个标准是你制定的。但不光 f c, p 和 space, 还有很多非常好用的功能,比如紫黛丽萨姆艾伦的指令命令,路普循环 review, 有 审核代码, 这些功能也都是可拷的先有的。所以我这个评论区下面有个网友说,你吹着 ko 的 这么牛逼,这些功能 ko 的 不早就有了吗?说的非常对, 这些功能就是 ko 的 先有的, ko 的 x 是 你 ko 的, 什么功能好用我就抄什么,你出什么新功能我就抄什么,而且呢,它抄完之后呢,还把体验做的特别好,以至于那些没有用过 ko 的 用户都以为这些功能是 ko 的 x 原生的呢, 其实呢,都是抄袭考效扣,所以说考效扣的这个产品对于 ai 编程领域的贡献是非常巨大的,也是十分让人尊敬的。那以上呢,说的都是他好的地方,接下来就要聊一聊他让人讨厌的地方了。 首先第一点也是最让人接受不了的一点,我们都知道美国是法律禁止中国公司去使用美国任何 ai 产品的,这个大家都能理解吗?毕竟是大国之间的竞争。 哎,说是这么说大家其实呢,也没有说把这条路全部堵死,你只要用点方法还是可以用上的。但是罗密克这家公司真的是头铁, 他不光是说他还是真的做,他是唯一的。在其公司官网泊课上面直接发公告说 入敌对国家不允许,你就不允许对不对?还把中国列入敌对国家, 这可不是我瞎说的。这个博克现在还可以访问,你可以直接去这个官网去看,链接我放在评论区下面,这就有点让人接受不了了对不对?对吧,大家都是演演戏,睁只眼闭只眼,你这是直接掀桌子了,玩都没得玩了, 一点都不给大哥面子呀。而且他还不只是嘴上说他还是个他妈行动派,他就真封你的号,你只要是中国用户,秒封,你只要 ip 稍微一变,秒封,别说普通用户了,你就是程序员,你想用上卡拉 ok 的, 你都得很费力, 要有美国手机卡,美国信用卡,甚至现在还有身份证,还要人脸识别,太他妈折腾了,真的用他家的产品跟他妈偷渡似的。而欧菲安呢?他就很老道,他就看着你卡拉扣的,对中国用户那么不友好对吧?使用这么困难, 就故意释放一些让你薅羊毛的机会,故意搞一些漏洞让你去薅他也不堵睁一只眼闭一只眼, 要不然你以为这些中转站这么便宜的套餐哪来的对不对?那背后都是成千上百个账号搞的。那你当 openai 的 安全部门是吃百家饭的?人家监测不到吗?人家什么都知道,就是故意让你用的,就是故意让你薅的。 这个套路美国公司已经玩了很多次了,就和当年微软纵容咱们国内用户使用这个盗版 xp 一 样 对吧?你都用盗版了,你都免费用他的一家公司了,那就没人用国产的了,那你国产的市场就打不开,研发能力就不行。所以说 oppo 就是 明着让你薅, 这对他来讲其实是百利无一害的。第一,他用户量冲上去了,第二,你国内用户的这些使用数据他也收集到了, 这些数据可以继续用来训练他自己家的模型,他就会让你感觉越来越好用,就会让你上瘾了,戒都戒不掉。如果让我总结的话,哎, robbie 就 像是一个富有创造力,然后敢说敢想敢做的一个热血青年。 而 oppo 呢,就像是一个老奸巨猾的商业巨鳄,为了达到目的无所不用,什么手段都使得出来,我想这就是商业的真实一面吧。 所以从技术精神角度来讲,我是支持卡拉 ok 的, 但是从商业和营销角度来讲呢,应该多学习 openai。 最后咱们再来聊一下国产的现状吧,怎么说呢,心情其实是有点五味杂谈的, 一方面呢是咱们和国外顶尖模型确实还存在差距,但是我想大家其实是可以接受这个差距的,没有人指望一天就能赶超人家,这是不可能的, 但是咱能不能少点套路对不对?咱能不能少刷点榜,不要一发布就是什么赶超这赶超那,世界第一世界第几的,整那些玩意干啥?对不对? 宣传的这么好,结果大家一用一用一个不吭声,一用一个骂爹骂娘,咱们就脚踏实地,有差距咱们慢慢就追不就行了吗?就像 deepsea 一 样,人家每次发布的时候都把记录细节都写成好多论文都公布让全世界人研究,那在人家国外这个口碑非常好的, 包括阿里千问系列,那开源里面都是最能打的,所以说我相信大家还是非常愿意支持国产产品的, 也相信我们迟早有一天一定会追上的。以上呢,就是今天给大家分享的内容,还没有关注黑胡子兄弟姐妹,欢迎大家关注一波,后面黑胡子会继续更新关于 ai 的 各种各样有趣的事情,拜拜!

cloud 泄露的源码给大家存档了整整五十万行的代码,一千九百多个核心的文件,超级 agent 的 密码全部被迫开源了。网上疯传的原项目地址现在用不了了,但已经有网友全部存档在了这个网站。我昨天熬了个通宵啊,替大家连夜翻完了这些系统提示词,发现了这背后藏着顶级 ai agent 的 密码,代码里甚至藏着未公开的代号。 keras 会变成二十四小时在线的主动助手,主动给你推送通知,根本不要去安装什么复杂的龙虾部署了甚至还有电子宠物八 d 的 趣味彩蛋,不同稀有度等级, 心情值还会进化。天呐,想起了以前养 qq 宠物的快乐,我已经开始提前期待了。甚至还有做梦模式, ai 会在梦中开始整理和你的所有记忆。 特例的场景是真的要来了吗?这一波被迫开源国内这些卷 agent 的 大厂这下别想睡了,估计都在通宵对答案。有了这份参考答案, agent 的 架构和逻辑能力估计下周就要起飞,又一波 ai 大 爆炸的时代要来了,你是不是也迫不及待想研究下圆满老规矩?

啊,我分享的题目是从泄露源码看 a 型的设计,大家都知道,前段时间 astropik 意外将 cloud code 的 源码泄露了啊,然后我这次想给大家分享的内容就是这段时间我从 github 各个 cloud code 的 源码及分析项目中学习整理出来的一些 关于 a 镜的系统设计的思考啊。然后我们这次要讲的内容啊,不是它的代码长什么样,用了哪些技巧,而是它作为一个本地的 a 镜的 runtime 到底是怎么把模型、工具、记忆权限这些东西组织起来的? 我们的主线分为四个 part, part 一 讲 long time 内核,回答一个最基础的问题,它到底是个什么形态的系统? part 二讲状态连续性,也就是 probed context memory 和 session 这一串是怎么撑得住常识任务的。 part 三讲安全与拓展,包括 permission, sandbox 怎么共治, m c p 和 skills 怎么平台化,多, agent 怎么分层。然后最后一个 part 是 思想总结,将 cloud code 的 agent 工程取向进行一个收束 啊。第一个 part, 回答一个最基础的问题, cloud code 它到底是一个什么东西?答案很直接,它是外壳是 c l i, 但内核是一整套本地的 agent runtime 啊, c u i 只是它的入口,真正干活的是后面这条完整的执行链,左边是整个程序的入口链图 啊,对,外层是清亮的 c u i 点 t s x 负责啊,它主要负责接收命令行参数 进来以后,由 main 点 t s x 做主流程调度。接着呃,做一个 inet 和 set up, 这两步是在 trust 之前的安全部署话, 确认当前的目录可信,并且把用户的配置加载完整可信之后,由浪写 r e p l, 把基于 ink 和 react 的 dy 镜面拉起来,最后进入整条链的核心啊, query 函数。这里的 query 是 kaq 的 真正干活的执行循环。 然后右边的 main 单 t s x 尾代码是这条链的展开啊。我们可以看到一个比较有意思的是,它在你看到任何聊天框之前已经做了一长串准备 先引 it 做一个安全触指法,然后根据启动参数分流啊,如 print 走势啊, print 走 headless 的 后台模式,锐吉走条件模式, remote 走远程模式,如果都不出的话才默认进入完整路径。 在默认路径下,还会把工具池, m c p, 工具以及内件, skills 各类的定义全部装配完全,最后才把调试打开,把 r e p l。 拉起来。而这页最核心的是下方的文字, 所有运行的形态, r e p u, headless 等都共用一条 require 内核,不存在两套实线。这里的意思是,不管你是在终端里直接跟他聊天,还是在 sdk 把它嵌入别的程序里调用,走的都是同一段 query 执行循环。嗯,本质上克拉扣的是一个 本地的 agent 中断 time。 等到后面讲多 agent 的 时候,我们会发现,呃,主 agent 派出子 agent 跑的也是同一个内核,只是上下文做了隔离而已。呃,所以这里是我后面所有讨论的前提。 呃,然后聊到 agent 中断 time, 最核心的就是,呃,我们上面提到的 query 循环。这一页是这次分享中比较核心的部分。呃,在讲它的真实形态之前,我想先用一段简化的动画来让大家建立一个直觉 啊,大家看到左边这个 agent log 的 流程图,从上到下是 start, api call, 判断 stop reason 啊和 execute tool 以及 open result。 然后再回到 api call, 再看右边的 message, 最开始是空的, 这个挡住了, 你看这个条挡住了, 呃,当用户说 fix the logging bug, user 的 消息传进来,然后进入 api core 模型,返回一个 stop reason, 只要他说 tool use, 那 么就去执行这一个 tool, 然后把结果 app 回 message 里,再回到 api core, 等哪一轮模型说 end turn, 那 么就整轮就结束了。 整个动画走完之后,右边累积了六条消息,连着做了三次决策,第一轮选 read file, 第二轮是 edit file, 第三轮模型主动说 end turn, 那 么循环在这一刻就自己退出了。这就是所有 agent 本质的形态,一个 while 循环, 反复调用模型,模型每轮决定是继续用工具还是停下来啊。那么 cloud code 是 不是就是这么一个 value 呢?大方向,对,但在工程上会复杂一些。左边的这段伪代码就是它更真实一点的形态。 他把每一轮拆成的六个阶段,呃,首先是 pre api freeze, 呃,用来装配 attachment skill memory, 然后是 api request freeze, 做流逝,调用 api 并重试。呃,然后是 process response, 把模型这一轮的输出解析成一个叫 transition 的 状态字 啊。 execute tools 按工具,把工具按递发性分分批跑,加权限加 hooks run stop hooks 是 轮次结束后的钩子。最后修的一个 list, 判断一下 要不要收工,否则 turn count 加 e 进入下一轮。这里有一个细节,整条循环的底层,它做成了流逝的生成,而不是等模型诊断,诊断回答完再统一处理。 也就是说模型还在生成的时候,界面就已经流逝显示了,并且下游也开始消化,开始执行工具了。不用等诊断输出完啊。这是克拉克跑起来感觉很丝滑的一个底层原因。 右边的这一栏 transition 就是 process response 抽出来的状态字, continue 是 正常进,下一轮 to use 是 要执行工具, end turn 是 模型主动停止,后面还有 stop, sequence 等等。这里的每一个值都对应一种接下来要干嘛的决策啊。状态机的语义就靠这几个字撑起来。 然后这一页还有一个比较重要的点,就是下面的这一排 l 一 到 l 七的七级错误恢复节点。简单说, agent 跑长任务的过程中可能会有各种各样的失败,比如网络中断,上下文塞满,模型话说一半被截,嗯, token 预算耗尽等等。 克拉克把这些失败按严重程度从轻到重分成了七级啊,每一级都有专门的恢复策略。 a o 一 是流逝连接断了的回退,如果流逝连接中断就自动切成等答完,呃,等等整段答完再一次性返回的非流式模式并重试 a o 二和 a o 三是应对上下文塞满了情况。 a o 二是预防,若检测到上下文快塞满了,就主动把旧的不是 不重要的工具输出折叠成摘药等空间,也就是这里的 cliffs, dream, aoe。 三是抢救,呃,若上下文真的爆了,就做完整的压缩,把历史压成一条摘药,加几个关键附件,再继续 aoe 四和 aoe 五是应对模型话还没说完就被截断的情况。 注意,这里说的不是输出的上下文,而是模型这一轮能往外输出多少透根的预算。比如这一轮的配额是四千,透根写到四千还没说完,那么 a o 四把这个输出配额往上再升,让他接着说,如果还不够或者因为其他原因停在了半句,那么 a o 五就会在下一轮明确告诉他。接着说 a 六是 stop hook, 呃,拦住不让停。当模型说 in turn 循环准备退,退出时,会先跑一遍用户或者插件配置的 stop hook, 这些户可以返回,呃别停。还有是没有做完的信号,比如,呃,测试还没过,某个外部检查没完成,一旦被拦下来,循环就会继续跑一轮,这是外部流的否决退出拓展点。 l 七是应对整体预算,呃, token 预算耗尽的情况,呃,直接抛 error 对 用户有些粗略。呃 l 七,在 token 消耗时写好状态,给一个可以稍后 resume 的 接口,避免任务中断无法恢复。把这七级方一起来看,它不只是处理一两种异常,而是把长任务可能死的所有方式都铺成了梯子。这也是 clock code 能跑半小时或一小时以上复杂长时任务的前提。 讲完 loop 的 股价,下一个呃重。最重要的是 tool, 在 很多 a 阶的框架里, tool 就是 一个函数加一段 description, 模型说掉,那么框架就掉, 但 colloquial 把 tool 做成了一个协议对象。左上是 tool 接口,有基本的 name description, 呃, input, sigma 和括号数,以及更中更关键的中间这一组属性是否止读,是否并发安全以及全线检查回调等。 每个工具必须自己声明的,必须自己声明安全属性,他们直接决定了这个工具能不能并发跑,能不能修改文件,需不需要走权限弹窗以及 ui 上如何呈现。 换句话说,嗯,工具作者在写新工具的时候,就被强制要求要把这个工具的危险等级和并发性表达清楚。左下的 build tool 就是 这套协议的工厂。嗯,大家注意, tool default 这一段, 默认是非病发、非止毒,非破坏性,全线默认放行。嗯,从表面上看,全线默认放行好像不太安全, 但其实结合病发性来看就比较明白。嗯,未声明就视为未病发未止毒啊,非止毒。也就是说,新工具默认会进入串行执行加全线检查的通道,它绕不开治理。嗯,这是一个比较典型的 feel close 的 立场。 嗯,默认不优化,先保证可控,等你显示声明的显示声明,我是指读我并发安全才把你升级到快路径。所以总结下来就是错误不是函数的映射,而是标准化的协议对象,同一份定义,同时服务模型的调用,权限判断,引发调度, ui 呈现与结果回流 啊。然后这一页其实背后有一个值得借鉴的思想,安全和并发不是外包一层管理层去管,而是写进协议里变身每一个工具作者都必须面对的设计责任, 做协议规定的长什么样,但真正让他从一段定义变成可控的运行时行为,是这一页的执行管线。我们先看左边这条链, 从模型输出一段 assistant 的 message 开始,里面带一个或多个 tool use 的 block 啊。 query 收到,收到 tool use 之后不是直接调函数,而是先交给 tool orchestration 按并发现分批,然后进入 tour execution 逐个执行。执行里面还要做 sigma 校验, validate, input free tool hooks 和 permission 询问或拒绝,然后才到 tour core 打 tour result 回流,最后规范成用户端的 tour result message, 再进入下一轮 api 啊。这条链的关键不在它有多少层,而在于每一层都有显示的治理点,可以拒绝改写补补充上下文啊。比如 hux 可以 在工具执行前直接拦下来, permission 可以 让用户确认,直接确认或者直接拒绝。模型不是想掉就掉,每一步都可以喊停。 而右边这块就是它的病发策略。举一个例子,模型一次可能输出七个 to or u, 分 别对应 a, b, c, d, f, g 啊。 cloud 的 做法是 read a, b 和 graph c 都是并发安全的,所以并发执行。而 file edit d 是 写操作,并发不安全,所以它独占串行,然后 globe e 和 webfish f 又能并发,最后 bash 既单独串行, 安全的屁一起跑,不安全的就退化成单条。这就是左边那条链里 to oxidation 按 is concurrently safe 分 批的逻辑 啊。下面列这段 streaming 是 更细的一层, streaming tool executeer 用四个状态 queue 的 executing completed 啊和 yield 追踪每一个 tool, 同时它边接收 tool use 边启动,不需要等模型整段输出完。这就是它为什么跑起来这么快。其实底下是流调度在帮模型抢时间。 然后讲完执行信测,我们再回过头来看输入测的 prop, costcode 把它做成了一个系统,它 把给模型的输入分分成了三类来源。第一类叫 systemprop, 是 主谓信测的长期行为协议、身份基础、规则、工具、使用方式、输出风格、记忆等,在这里几乎不变。 第二类叫 user context, system context, context 是 运行态里附加的上下文,比如 cloud 的 cloud 点 m d, 当前日期, get 状态等等。在这里它不是用户当前的输入,而是 run time 自己塞进去的现场信息。 第三类叫 task specific props 是 后台任务的专有专用协议,比如 compact, caching, memory 这些场景,每个任务都有自己的工具摆名单轮式格式约束以及轮次限制。这三类来源汇总到中间这条 api request, 然后裁剪模型, 呃,然后下面这条横向的 system prop 组装器优先级电从左到右一共五档, override 是 最高优先级,呃,外部显示传移端进来就直接强制覆盖。 coordinator 是 多 agent 协调模式的专用身份,后面会讲到 agent 是 sub agent 自带的身份定义, 嗯, custom 是 用户在配置里自定义的替代版本。而最右边的 default 就是 上方的 system problem 的 内容,嗯,也就是 clock 的 出厂自带的身份规则、工具使用方式。前者运动就替换,后者的意思是有 override 就 用 override, 没有就再看 coordinate 一 词,往下整 啊。然后这条链解释了一件事,为什么 coordinate 模式或者 subagent 能换一调,换一套身份运行,它就是替换了 system proc 这个槽不是模型变了,是模型看到自己是谁变了。 然后啊, proc 写成什么样?不只是内容问题,更是缓存,缓存问题,这一页讲的就是这件事。 左边这张图把默认的 system prop 切成了上下两上下两段,上半段叫静态,主管身份、系统规则、任务规则、工具使用方式、语气等几乎不变,所以它放在最前面。下半段叫动态边界以下的 sections, 包括长期记忆、环境信息、语言偏好、输出风格等, 它们是每次会变的东西,所以放在后面啊。那为什么这么排呢?因为服务器端的啊, prep catch 是 按前缀匹配的,你的前缀越稳定越长,在重复请求的时候命中率就越高, token 积分就越便宜,所以稳定的放前面会变的。放后面这件事啊,本身也是一个工程优化 并且卡扣的同时维护本地的 section cache 和服务器端的 proper cache。 本地这一份是为了避免每次请求都重新组组装一遍 propt, 然后服务器的那一份是为了省钱省延迟,两层的 cache 一 起治理,才能把成本压下来。 呃,在 propt 以外更难的一件事是 context 如何活下来。呃,长任务,有些长任务跑着跑着透根窗口,很快就会被呃工具的输出挤爆。 而 clock 的 给出的答案是多种压缩策略,从 light 到 heavy 一 共五级,最新的叫 snape, 把这些工具啊,把这些那些价值低的旧工具输出直接删掉,不做摘要,因为做摘要本身你要画 token。 呃,再重一级叫 micro compact, 主要清理旧的 tool result 和 cache edges 它,它的目标是减少体积,同时保住前缀的稳定。这就我们刚才讲的 drop cache 相关,这一级会特别小心,不去破坏掉前缀,再重一级叫 context eclipse, 把多轮的相似操作折叠成一段结构化的摘样,比如你连续读了十几个文件,它就把这一串折成读了哪些文件,关键发现是什么带上去就是 auto compact 预值出发的完整压缩流程,这是实际使用时我们最常出发的议题。达到预值后,主循环会停一下,用一段专门的 compact prop 单独发一次请求,让模型对当前的规划历史做一个总结摘要,然后替换到原来的消息历史,再继续往下跑。 这里说到的 compact prop 就是 我们刚刚提到的啊 task specific props 的 一种。 然后最重的是 session memory compact, 复印后台已经抽好的 session memory, 避免再强,再调一次总结模型。 左下这段 compact 调用位置示意展示了一个。比较重要的是,这套策略不是在超过预值线之后才动的,而是每一轮的 api request face 开始前,它都会做一次上下文的治理, 按 t 字的顺序依次尝试 snip micro compact 呃, clips auto compact 如果有 session memory 就 直接附用,之后才进 api request。 右边四条要点我挑两条强调。第一个是清量策略优先,如果前面的策略已经把上下文占用降到了预热以下,那么我就不会进入完整的 auto compact, 因为 auto compact 本身更重,成本更高,而且它自己也有可能失败 啊。第二条更关键,完整的 compact 不是 删历史,而是用啊 summary 加 post compact attachment 重建工作台。这里的 post compact attachment 意思是在压缩之后要重新塞回模型的一些信息,比如工具声明、文件、上下文以及计划状态,这些都得复关进去 啊。如果只是简单的阶段,那么模型就会忘了自己刚刚干到哪一步了。下面我们单独看 memory。 嗯, clock code 对 memory 的 处理也很有代表性,它把长期状态拆分了文件缩影、作用域和召回基日。左边的 memory 切成了三大类。第一类叫 auto memory, 存的是用户偏好、项目背景跨绘画的长期约束。 它的写入时机不是用户主动写,而是在轮次结束后后台调用。呃, extract memories 自动抽取进上下文的方式也不是全量灌进去,而是在 query 请求前按相关性召回少量。 第二类是 session memory, 存的是当前绘画的滚动遮要。嗯,不是长期偏好,触发条件是绘画达到 token 或 tool call 的 预值时,呃, 优先附用,避免再总结一次。上一节压缩机制最重的一档 session memory contact 附用的就是这块 memory 啊。然后第三类叫 memory agent, memory 存某一类的 agent 长期经验,只有那些在定义里声明了 memory 字段的 agent 才有由它自己读写维护。除了这三类, 嗯,还有补充的 team memory 做团队同步层。右边讲的是它一个比较关键的设计, cloud code, 它自己维护的 memory 点 m d 不是 政务仓库,而是入口缩影,每条记忆只记一个链接加一行描述, 整个文件的应限制在两百行二十五 kb 以内。啊,为什么这么做?因为如果让 memory 只接近 propt, 几次规划下来, propt 就 被长期状态彻底挤满了。所以他走的是另一条思路,不是全量注入,而是按需召回。在请求前每个机器文件的文件头, 先扫每一个记忆文件的文件头原数据,然后生成清单,让一个轻量模型从里面选,最多选五个,只把这五个的正文带入本轮请求。这个流程在 cloud code 里叫 relevant record。 嗯,底下的这个流程图就是底下的这个流程图就是它的全过程。 然后 memory 之外还有一层经常被忽略的 transcript 和 resume, 它是支撑常识任务,能够继续执行。呃,能够继续执行的底座,你把 clock 关闭,第二天还能打开从中端的位置接着跑,靠的就是这一层。我们先建立一个统一的概念, transcript 不是 聊天记录副本, 而是一个 appendonly 事件的事件流,日日,呃,每一个事件追加到文件带有唯一的 id, 呃,我们称之为 u u id, 并指向它的前一条 parent u u id。 所有事件靠这两个字段连成一条链,而这条链就是后面 resume 能接着跑的依据。 transcript 有 三个特点,第一,主链有边界,只有四类事件能进 transcript, 分 别是用户输入模型、输出附加内容和系统消息, 其余如工具执行的进度、消息等不会参与主页。第二,追加日期,一行一个,节省记录。写盘策略是 append only 加批量 flash, 也就是,呃,每条消息不是来一条就同步写盘,而是先进内存队列,由后台批量刷到此盘文件。 第三,尾部原数据,呃,我们的标题标签模式, worktree agent 的 设置,这些信息会周期性地重挂到 transcript 文件尾部。 反复重挂的原因是 resume 列表页用的是一个轻量读取器,它只扫文件尾部的一小段窗口,绘画越变越长,早期写下的原数据就会被新的内容挤出尾部窗口,所以必须不断重挂到当前文件的末尾,才能让列表页一直读到最新值。 呃,右边的 resume 是 一条四步重建管线,呃,第一步,加载日制读取整个 json 文件,按事件类型分类到不同的同理 啊。第二步,重建主链,把最新消息当做叶子节点,力斧沿着 parent 的 user id, 呃一路向前回溯,得到当前可继续的对话链。 第三步,修复断点。这一步是为了处理链被打断的几种典型场景,比如早期版本的,呃,残留的进度调节信息,呃,消信息要被调节掉。再比如,呃, snap 把中间信息删了以后,他的儿子 parent user id 就 指向了一个空洞, 呃,这时要往前找还活着的祖先,重新挂上。第四步,恢复运行态。呃, plan plan 计划状态,呃,文件读取历史、 context, eclipse, eclipse 状态,呃,以及 agent 和当前的模式,这些都要全部挂回内存,最终再把控制权交还给 r e p l。 呃,讲完 transcript 和 resume, 我 们再来讲安全方面的问题。可拉快捷的安全是将每一条 bash 命令落到数值基之前要经历过几道关卡,呃,能不能执行?怎么执行?执行后怎么清理?呃,串成一条执行链,左边的这四步串起来就是一条 sandbox 管线, 嗯,第一条逐第一步,逐条路由,嗯,每条 best 命令先判断要不要进刷箱,不符合条件就走普通路径。第二步,配置翻译,嗯,把权限规则 allow daily 读写目录 这些用户配置和成为底层隔离环境能执行的规则。第三步,隔离运行啊,执行前由系统把命令包装到革性环境里跑。第四步,收尾清理啊,命令结束后清清掉临时文件啊,清掉可能影响后后续宿主机残留的状态 啊。这里很容易冒出一个问题啊,既然已经有 sandbox 了,那么为什么还需要 permission? 右边三条设计要点里,我想强调的就是第一条啊, sandbox 和 permission 的 关系是互补,不是替代。 permission。 先回答,这条命令能不能执行啊, sandbox 处理已经允许的命令啊,怎么被进一步限制?这两层各干各的事啊。第二条,翻译,配置啊,配置,翻译是核心, 也很关键,用户和项目设置里写的那些 allen 独显目录,呃,运营白名单不是克拉克自己拿来对照检查,而是被翻译成格力环境真实可执行的限制啊。这意味着 sandbox 不是 软规则,而是硬边界。 第三条,保护控制平面,它把各类 setting 文件点, cloud 和 skill 目录这些都列入禁止写作的范围,防止一个被攻陷的命令去改 agent 自己的配置,不让坏命令通过修改自我来扩大影响。 嗯,此外, sandbox 它不是唯一防线,真正执行命令的其实是 bash tool, 而它在进入 sandbox 之前,自己还有一层前置检查,比如啊,命令语法和危险模式识别,基于规则的 permission 判断,以及指读命令的识别和分流。 接下来讲拓展生态 mcp 和 skills。 首先, mcp 它是外部工具,入池流程是 mcp server 包的工具 啊。 kolacoud 把这些 tour 标准化成自己内件的 tour 对 象,然后进入工具池,再进入执行链。这里的关键在于, mcp 工具他不走旁路,他进来之后继续走 sigma permission to a call to a result 回流这一整套啊。 kolacoud 他 不为 mcp 单独开一条执行通道 啊。这意味着 mcp 工具受到和内件工具一样的治理,一样要声明并发信,一样要走权限检查,一样要写进 transcript。 然后是 skills, 它是任务协议的注入,它的路径完全不同。 skill 不是 tool, 它是一个可附用的 property package, 本质上就是 markdown 加原数据加可选脚本 啊。 frontmatter, 声明它的名称,描述,可用工具、触发路径等。调用的时候把这些拼成任务上下上下文 啊,这里有个细节我想点出来啊。 skill 不是 全部常住到 pop 里等模型用,而是按需激活。它有三条入口,第一个是用户主动调用,第二个是模型自主选择,第三个是条件触发 声明了。 python 的 skill, 它会在你操作匹配的文件时自动注入,比如改 py 文件的时候会自动激活。 python 相关 skill 啊,三条路径目标一样,避免一堆备用技能把上下文撑爆。而下面的,呃,这两个点比较重要。第一个是 to search 延迟加载,当工具的数量太多的时候,比如装了一堆 m c p, 它不会把所有接口的描述一次性塞进 protop, 而是先暴露一个轻量的发现入口, 再按任务需要展开具体工具的边界。这件事直接降低了 protop 的 体积啊,提高了 catch 命中。第二条是统一治理 m c p, 把 外部能力接入 tool pool skills, 把任务任务方法直接注入上下文。两者的入口不同,但依然受到同一套权限和上下文预算的约束。真正要执行外部动作的时候,仍然沿用这一条工具执行链 啊。然后我们接下来再看 clock code 的 多, a 层这一页内容比较多,所以我同样用三个动画来给大家建立了知识点。再我们再回到 ppt 看分层。 第一个动画讲的是 sub agent 的 context 隔离,大家看左边 agent 的 message 已经堆了,不少用户说 build log in 加 test assistant 在 planning, 嗯, tour result, tour result 给了项目结构。 呃。接下来副 a 健让出了一个 task write unit task a test for odds 子 a 健拿到的不是副的全部历史,而是一份全新的 message 数据库,只包含一条 task prop, 他 在自己的上下文里调用 tool, 独立完成工具调用和结果回收。等他干完,返回的不是他自己的上下文,而是一条摘要。呃, three test written or passing。 然后子上下文随即被抛弃,啊父只拿到了这一条摘呀,结果就是动下动画底底下的这行字, three original, one summary 三条原原始信息加一条,摘呀。这就是啊, sub agent 的 工程价值,用一份干净的子上下文做隔离,防止主链被工具产物撑爆啊。然后 前几天 astrogic 又对 sub agent 进行了一次升级啊,推出了 fork 的 sub agent, 大家可以去了解一下。 呃,第二个动画是 agent team mayo boxes, 这对应 cloud code 里的 swarm 模式。呃,通过 team create 显示创建团队声明角色。现在屏幕上有三个角色, leader、 coder、 reviewer。 每个人脚下挂着一个独立的 json 文件,那个就是各自的 inbox。 inner 给给 coder 派任务的时候,他不直接调用 code, 而是把消息写进对方的 inbox 文件。而每个 teammate 在 l m l m l l m 调用前,先破自己的 inbox, 把新的消息当成上下文注入 这一套异步通信就实现了 teammates 之间的交流渠道,保证了 swarm 模式的稳定运行 啊。然后第三个动画是 autonomous agent circle, 这同样是 swarm 模式下,但它讲的是另一个侧面啊, teammate 在 i d l e 空闲的时候怎么自己找活? 上一个动画是 le 的 主动写进 coder in box 的, 那如果没有呃 le 的 呃 le 的, 如果没有派, teammate 又闲下来怎么办?这一页给的答案是, teammate 自己去 taskboard 上扫未未认领的任务。现在左上 a, b, c 三个 teammate 都在 idle, 而下方呃 taskboard 挂着四个未认领的任务,而右边是单个 teammate 的 生命周期。 我们跟着 a 走完整的一圈。首先是 idle timer 倒数,没有人叫他超时以后, a 自己启动 pro 去 taskboard 上读任务列表。 然后 a 把自己的名字写进 fix ors bug 的 owner 字段,避免多个 team mate 抢到同一个任务啊,这是 claim。 最后 a 开始处理这个 task, 进入 work, 等 a 干完又会变灰回到 idue 啊,下一轮 time 重新开始。接下来 b, c 各自跑独立的。同样的循环, leader 没有派一次工,三个任务就自己分发完了啊。现在回到 ppt, 你 能看出一个比较清晰的分层,第一层是 subagent 单入策略,附用 query 呃 time 淡隔离 transcript。 第二层是 coordinator, 由于没有动画,我简单说明一下, 这一层不是把 sub agent 多开几个,而是把主 agent 的 system problem 换掉,让主 agent 自己变成 coordinator, 负责派工,综合续写多个 worker 结果,以 task notification, 也就是任务通知的形式进行回流。典型的流程是 research, 并行,培训班,分派等, 这一层解决的是任务编排问题。第三层 swarm, 也就是刚才的两个动画讲的内容啊, mailbox 和 task list 已经靠动画解释了 啊。 team file 就是 记录团队信息的画名册。权限回流是指当 teammate 想用敏感工具的时候啊,权限请求会统一会到 leader 那 里进行确认,最后再用一个关键点收尾。 agent 突破是多 agent 的 统一入口,它本质上就是 clock code 暴露给模型的那个发起 agent 尾拍的工具 啊。同一个 tool 通过参数不同可以决定走普通的 subagent, coordinate 派出的 worker 或者 swarm 里的 teammate 这几种形态啊。虽然入口啊分了层,底下真正执行的时候并没有换一套内核。最后还是回到同一个 run time, 同一条 query 执行链上, 最后一页是主线收口左左边以上内容抽出来是以上内容抽出来的三条设计原则。右边把整套架构压成了一张 run time map。 第一条把模型能力交给 run time 承接,意思是模型输出本身只是一段文字,它怎么变成真实的工程行动是 run time 层的 query loop tool, 协议, permission 啊,流程执行共同决定的 模型不是总指挥, run time 才是。第二条,把常识状态做成可治理的对象, top, context, memory, transcript 以及 resume, 各自都要有怎么保存、怎么压缩、怎么召回、怎么恢复的明确分工,不是事后补丁。第三条, 把拓展与协助纳入同一支里面, m, c, p, skills, subordinate, coordinator, swarm, 入口形态各不相同,但进来之后都不能绕过权呃,执行与权限权限边界。 而右边这张 roundtime map, 其实就是把前面三条原则压成了一张图,它从下到上分三层,最下面是状态底座,负责把长期状态存住,中间是运行治理,负责把模型输出变成税务约束的。行动最上面是能力入口,包括 tools, mcp, skills 和 agent。 下面这条箭头其实就是把整套架构穿成一句话啊,模型意图变成受制里的本地行动,最后变成可恢复的长期任务 啊。模型先提出意图,比如我要读这个文件啊 roundtime, 再通过 to 协议权限和刷箱把它落成一个真正可执行但又不会越界的模拟操作,而这些操作又会被状态底座完整地记下来,所以任务急之中断,后面还能接着跑。 嗯,这基本是我对 coco 的 这套 a 的 价格比较浓,比较浓缩的概括啊,我的分享结束啊,谢谢大家。 嗯,好的,呃,我再补充一两个点吧。就是,嗯, 呃,实际上啊,就是大家通过各方面的了解,包括今天一鸣的分享,实际上整个 cloud code, 我 们现在这个, 呃,整个的业界的对它的这个定位啊,我们把它叫做 harness engineering 啊,是由呃最早期的 prompt engineering, 呃上升到 context engineering, 然后再过渡到现在的 harness engineering 呢,它就是一个 呃比较复杂的一个一个 hines 的 这样的一套一套体系啊,然后这套体系呢?呃大家其实看上去有很多个 嗯视角,或者有很多的不同的这种操作行为,或者是看上去非常复杂,但实际上大家仔细品一下啊,其实上所有的事情, 这里面所有的事情,其实其实核心就是围绕两个事情来做的,第一个事情是安全可靠啊,第一个事情就是安全可靠,就是就是你要让大元模型的自主性的行为 是安全的,相对安全的,他不会随时就不会任随便的删掉你的这个重要的文件啊,不会去搞乱你的系统啊。然后这个,这是这是第一个,就是这这么多各种不同的这个设计原理上啊,第一,第一点确保这个安全可靠。 第二点很多很多的设计,包括 memory 的 设计啊,包括这个 prompt 的 加载逻辑的设计,还有各种,呃,这个各种各样的不同类型的设计,它是让很多除了安全以外的其他那些大部分的设计 啊,大部分设计其实都在围绕一件事情来做,就是什么事呢?就是它承认 呃,我们最终送给这个语言模型的啊,我们我们无无论做什么事情啊,是做了所有的事,最终我们会拼拼一个 plan 出来给语言模型 就是它的,它承认送给语言模型上下文始终是有限的啊,就是在上下文有限的约束的情况下,我怎样用一套最好的机制去实现这个最优的 plan 送给他,然后去实现更好的循环的执行,然后去最终完成这个任务啊,所有的东西,所有的设计都是在围绕着有线上下文的这个条约束下进行的,而且这个约束不会变 啊,我们不可能说人类社会不可能说,呃,我两三年之后哈,哎,我的大元模型就没有上下文的限制了啊,不可能啊,几乎是不可能啊,几乎是不可能的。这里面有两个问题,一个是说我们的这个 memory 啊,这个始终还是会有限的啊,首先 memory 始终还是会有限的。然后另外一个问题呢,就是你,你,你假设你真的做到无限上下文,你,你的计算其实是,呃,你很难去, 你,你很难想象这个计算,特别是这种密集的天性,这种计算你很难去做好的。那它太长了啊,它太长了,这个你其实没有重点,你其实很难去找到那个最重要的信息了啊,这也是不合理的。 实际上大家,比如说现在,其实大家在群里交流就有很多模型,它其实上下文还是比较长的,但实际上我们真实在运行的时候,大家推荐的版本, 推荐大家使用的,也会把这个上下文弄小一点啊。而且很多人体感上,如果你真的设得很长之后,反而模型的这个 behavior 会变差啊,这也是一个很重要的一个原因。对,同时再把另外一个事情收收束进来,就是这个 subagent, 就是刚才这个 sabotaging, 可能大家如果之前大家没有了解过这个里面的细节的话,大家会觉得 sabotaging 呢是一个说,哎,我不同的 agent 演化不同的角色去干一些事情,然后呃形成一个这个 这个侧重行为,然后去做,对吧?只是大家会一个很深入为主的思考,但实际上 sabotaging 呢,只是为了解决几乎只是为了解决有些上下文的问题啊,因为这些 sabotaging 呢,最后掉的还是同一个 a 撇 啊,他并不是因为他是一个紫 a 镜的,他就会去掉别的 a p i 啊,他们最终大部分三倍镜的走的还是同一个 a p i。 只是说他的 pront 被大幅精剪了, 同时他大幅精剪之后他他对这个主 pront 的 这个上下文又可以大幅精剪了啊。因为他是三倍镜里面他单独做一些事情的话,他他中间也要也要去托托 use, 也要去产生很多的这个上下文累积。但这些东西对主 a 镜无所谓,他就不需要了,直接过滤。 对,他只需要拿到这个 submission 呢,他认为是一个独立的子任务,他拿到他的结果就可以了。所以 submission 呢,是为有限上下文的设计服务的 主体上啊。对,呃,还有一点,呃,我刚才想了一下,突然忘了这个等一下有一点还是蛮重要的一点,呃。 嗯,行,等我想到了我再跟大家讲吧,反正先主要是这一些这一点哈主要是这些分享,呃看大家还有没有什么对这个,呃艺名的这个分享有什么问题的啊,可以交流一下 啊。对,最后再提一嘴啊,就是这这个这个东西我其实应该是上一次也和大家提过,这个跟大家概述的时候提过,就是其实,呃,如果你不去仔细研究,很多人搞不清楚 cloud code 啊,还有 api 啊, open curl 啊, api 之类的关系啊。 对,实际上我们通过这几几几轮的学习,其实大家应该要很清楚这些东西就是 cloud code, 其实相对于 所谓的哈尼斯的一个工程,其实 opencloud 也是一个哈尼斯工程,对吧?然后他们是包在语言模型 api 上的一层结构啊,去解决这个安全可靠、 稳定值,稳定完成任务的问题,所以大家这个这这这个这个东西一定要清楚,所以,嗯,就是大家,我,我经常看到就很多人在讨论一些东西的时候,其实好多东西没有 没有理解很清楚啊,就是概念上没有没有搞。对啊,很多人觉得 cloud 是 一个是一个是一个是一个原是一个 ai 模型 啊。对,然后 cloud 是 一个 ai 模型啊,嗯,对,就会有这种,呃奇怪的这个误解或者是什么样的,就包括这个 cloud 的, 呃,里面能,其实它能接所有的 a ai 模型啊,因为它最后的 round 塞给一个 ai model, 对吧?它不存在,不存在说 cologne 只能接特定的一些模型啊,不存在说 cologne, cologne x 能接 gpt 啊, gpt 五,对吧?然后 cologne 不 能接都是能接的啊。其,其实你搞搞清楚这个原理,你就知道它们的逻辑。 对,当然这个我们可以看到,就是有很多人把这个对 clark 的 分析也写成了文章去挂到 iq, 包括这个 hans 这件事情其实也陆陆续续走进了大家研究的视野啊,所以,呃 呃,所以我我我有一种体味和观察,就是就是我们接下来的这些研究将会越来越神奇啊,就是我们说这个 harness, 它是一个 engineering, 对 吧? harness engineering 啊,对,但它其实也可以变成 research 的 对象,对吧?现在包括有一些人就开始研究 auto harness 啊,怎么样去自动化 harness 啊,以及去比如说为 harness 的 这种 a 境的去构建 benchmark 啊,以及说 我觉得可能有很多可以研究的点,比如说你你,你,如果你的模型很弱啊,那么在一套 harness 体系下,你可能表现得没那么好,但如果你有一个, 你像科奥特做的,你有一个这个很强的模型,它是不是能协助你把弱的模型给它变强, 对吧?然后它这种蒸馏啊,还有的时候它的它的这个操作还甚至超出我们想象,它可能不是蒸馏,只是说用强的模型先给弱的模型一个相当于一个 step by step 的 提示啊,先给他一些 reference 或者是 plan reference, 然后它照着做就可以了啊,这可能不仅仅是一个蒸馏了,或者是我们也可以去考虑怎么样让一个用一个大的模型在哈尼兹框架下去啊,让这个小的模型能够变得更好, 对吧?这也去调整这个小的模型或者太阳模型的权重,让他在哈尼斯的这套呃范式里他能表现更好,那实际上他就能帮我们做很多事,那你就相当于把小模型的能力发挥得更高了,对吧?其实大家可以想象一下,这里面就有非常多有趣的问题可以做, 并不是说它是一个 engineering, 它就不能做,它就不能背 research 啊?这是一个大家需要打破的一个点。我觉得啊,因为这个这些事情在引领人类社会的未来,在引领大,引领我们整个人类技术走向 a g i。 那 你不能因为它是一个 engineering 你 就觉得它太 engineering 了啊。对,我觉得未来这个 engineering 和 research, 嗯, 不是未来,我觉得现在已经就应该浑然一体啊。对,然后这个做有影响力的事情,让整个社区为你这件事情点点 star, 让整个社区共创你件事情变得极其重要。

anthropic 刚发布 cloud design, 十一天后开源社区就把替代品做出来了,四天拿下一万五千颗 star。 这个项目叫 open design, 今天花两分钟带你看平板,他凭什么这么火?先说背景,今年四月十七号, anthropic 发布了 claw design, 一 句话就能生成完整网页设计,瞬间刷屏。但问题是,他闭源付费,只能用 anthropic 的 模型。 四月二十八号, open design 开源了,定位很明确,同样的效果,但完全归你。第一个亮点,它不自带 ai 模型。 你没听错,这是优点,它会自动扫描你电脑上装了哪些编程 agent, cloud code codex、 gemini、 c l i cursor agent, 甚至 kimi 和 quin 都行, 找到哪个用哪个一键切换一个都没装,填个 api key 也行,支持 openai、 archer、 gemini 各种接口。第二个亮点,一百二十九套品牌设计系统,开箱即用 linear 的 冷调极简, stripe 的 开发者友好, apple 的 克制优雅,小红书的温暖文艺,甚至 tesla 和 spacex 都有。选一套设计系统, 你的原型就自动带上这套品牌的视觉基因,不用自己调色,不用猜字体,全是确定型的零 ai 胡来。第三个亮点,三十一个设计 skill, 随叫随到,想做落地页,选 samsung, 想做后台管理,选 dashboard, 想做杂志风 ppt, 选规章 ppt, 想做手机原型,选 mobile app。 每个 skill 就是 一个文件夹,丢进去就能用,自己加 skill 也行,一个 markdown 文件搞定,看看它生成的真实效果。这是一个萨斯落地页, 排版配色动效都是专业级。这是后台管理面板,数据图标和侧栏布局一个不缺。这是手机 app 原型, 连 iphone 外壳都帮你套好了,这是杂志风、海报和社媒轮播图,你敢信这些都是 ai 一 句话生成的?第四个亮点,他有一套反 ai 审美的机制。你可能见过那种 ai 生成的设计,暴力紫色渐变,一堆 emoji 图标, 左边框圆角卡片,一眼就能看出来。 open design 直接把这些写进了黑名单。而且每次生成之前, ai 要先给自己打分,五个维度,哲学层级执行具体度克制任何一个维度,低于三分必须修改后重新评审。 两轮自评是常态,怎么用三条命令就能跑起来? clone 仓库 pmpm install pmpm tools dave 打开浏览器,选个 skill, 选套设计系统,输入你的需求回车, 他会先弹出一个问题表单,把受众调性、品牌上下文全锁死,然后才动手设计。整个过程不到两分钟,一份专业级的网页原型就出来了。总结一下 open design 的 核心思路是, 我不造 ai 引擎,你电脑上有什么我就用什么。我不猜你的审美。一百多套设计系统摆好了,你选 我不让 ai 自由发挥。五维评审卡死质量底线开源本地运行,你的数据不离开你的电脑啊!配置二点零协议,随便用随便改。感兴趣的去 github 搜 open 赞试试吧。

今天我们聊一个很多人都会忽略的问题, coco 到底是怎么工作的?不是宣传片里说的那么简单, ai 帮你写代码,它会自己读文件,自己改代码,自己跑测试,自己看结果,全程你只需要说一句话,剩下的全是它在推进。 但你有没有想过,这个能力到底从哪里来?很多人会说,模型变聪明了?错,模型本身只会生成文字,真正让它从会说话变成会干活的是外面那层工程系统。 这就是我们这个系列要讲的核心啊!模型与工程系统的关系。先问自己一个问题,模型本身只会生成文字,他不会自己打开文件,不会自己运行命令,更不会根据错误信息调整下一步。那 clod code 是 怎么做到这些的?说到底,靠的不是模型变聪明了,而是外面那层控制平面,一套让模型和真实世界持续交互的工程系统。 模型只是大脑,外面那层工程才是手脚和神经系统这个关系搞不清楚后面的内容,你听起来就会觉得散。具体来说,这个控制平面在做五件事,第一,模型想调工具,系统真的去执行,把结果再未回模型,让模型继续推理。第二,任务拆成步骤,系统把当前进度外显出来,防止模型走一步忘一步。 第三,上下文越来越长,系统自动压缩,保留关键连续性信息。第四,模型想执行危险操作,系统先过一道权限关卡。 第五,多个 a 证同时工作,系统给每个任务分配独立工作空间,防止改文件打架。这条工程主线才是 a 证的系统的真正骨架。这条工程主线里最核心的就是这个闭环流程是这样的,发请求给模型,模型想调工具真的去执行,把结果写回消息,历史继续下一轮,这个回路立住了,后面的每一张都是往上面加新模块。 说白了, a 证的本质不是模型很聪明,而是系统把模型的动作意图变成真实执行结果,再把结果送回模型继续推理。记住这句话,整个系列你又抓住了主线 一环,能跑了,但还不可靠。接下来就要加固。第一,权限,系统工具意图不能直接变成执行,中间必须先过安全判断。第二, hope 系统在固定时机插入行为,不用改主循环本身。第三,记忆系统跨绘画,保留真正值得长期记住的信息,而不是什么都往里塞。第四, system prompt 流水线,把提示词从硬编码复制串升级成都来源组装。 第五,错误恢复,遇到节段超时,上下文超载不崩溃,换一种方式继续。这五个模块加上去,系统就从能跑变成可靠。单个 ag 的 能力基本够了,但大任务还需要更多。这就是第三阶段要解决的 任务图。系统把 to do 升级成带依赖关系的工作图,可以追踪谁在等谁,后台任务慢命令移到后台执行,主循环不被堵住,继续推进别的事 定时调度不是现在做,而是三十分钟后提醒我继续检查这三个模块,让系统从单兵作战升级到有规划的推进复杂任务,单兵作战到头了。最后五张,升级成团队,协助 a 阵团,团队队友不再是钓友玩就消失,而是长期存在有名字有邮箱,独立循环的持久工作者 团队协议关机请求,计划审批全部走结构化请求,加 request id, 加状态追踪,自主认领,没有人手动分配任务,空闲队友自己扫描任务版,按角色条件认领可做的工作。 worktree 隔离每个并行任务在独立工作空间执行,互不污染。完事后决定是保留还是回收。最后 mcp 协议把外部工具也接进来,成为可插拔的能力。这五章合起来就是一个完整的多一阵的平台。 整个系列有一个一致的教学哲学,每个概念先区分不是什么,再讲是什么,然后给最小可用的教学边界。记住这个套路不是教你调 api 那 种玩具。 demo 是 一个结构完整,生产级思维的教学版本。 十九章分成四个递进阶段,从核心闭环到系统加固,到任务运行时,最后到多 a 帧的平台,一层层搭起来。下一章我们从核心问题开始。模型本身只会生成文字,他是怎么学会使用工具的?如果你觉得这个系列有价值,欢迎关注,我会持续更新,一张一张把它讲透。

大家好,今天再给大家分享一个好用的工具叫 browser honeys, 它是目前 ai 操控浏览器最省 token 的 一种方式,它非常的简洁,只有五百九十二行的 python 代码,然后上线三周已经突破了一万的 star, 呃, token 是 比以前的方式能省很多的 呃,目前我们 ai 操控浏览器一共有五条路径,一个是呃 cloud in chrome, 就是 我们平时用的比较多的一个 cloud 的 插件。然后第二个是 computer use, 就是 相当于你把 cloud 交给了呃的电脑,交给了 cloud, 让它去控制这个整整个电脑,但这种方式非常消耗托管,因为它需要截屏确定位置在哪 啊?第三种是 zenium, 这种是传统的方式我就不说了啊。第四个是 pre write mcp, 这是目前像那个 brother u, 呃,那个 use 啊,用的这个框架, 然后 brothers use 他 们现在开发出的 brother hannis, 这个是 c d p 直连的啊,为 ai 造的工具,这个是我们今天要重点介绍的,就前四个呢,它有各自的局限性。然后第五个就是专门给 ai 量身定做的啊,下面我给大家拆解一下。就是它的呃,架构呢,是 quad code 的 呃, 通过 c i 命令行,然后把这个命令发给了 d m, 然后 d m 再通过 c d p 的 web socket, 然后再到你的框,就就非常的简单简洁。它一共就四个核心文件,目前迭代了几个版本,它的命令的代码还是小于九百行的 啊,非常的非常的少,非常的简洁动,不像那些几万行的比起来还是简洁很多的。而且它是直接附用你的 cookies, 还有登录状态,所以能直接操控你的浏览器 啊,他本身还设计了一个叫自愈架构的,他有个 agent helps 啊,他开箱呢,就是你刚装完是空白的,你的 agent 通过各种各样的浏览器执行之后,碰到了一些问题他会解决,解决完之后他就会记录进去,相当于是一个自我迭代跟循环的。 然后仓库本身呢,就是你下下来之后,他已经有了几十个网站的这个操作的经验,就是你的 agent 用的时候就能直接去读取这些经验, 然后这样你一直用下去,它就有一个啊, feedback, feedback, loop, 然后正反馈的循环啊,就形成一个经验的,就是操作浏览器的一个经验的自动沉淀,因为每个网站的它的这个操作的方式可能有些细微的差别, 你怎么怎么去决策用不用这个软件呢?是,首先要看是这么判断的,首先要看你这个网站有没有专用的 m c p。 呃,你像 github, notion, slake 这些是有直接专用的 m c m c p 的, 就相当于它有 ipad 接口,你就根本就不要碰浏览器,你就去找他们接就好了, 通过那 mini 上去接就好了,这个就浏览器根本就用不着。那如果说你要开浏览器,那传统的现在用的可能多一点的就是 playwrite 的 mcp 啊。然后现在我建议你们大家都转成这个 bardeen, 因为它真的很省头,肯啊,非常的好用。 呃,反正大部分场景下 broderhanys 是 性价比最高的路线。呃,然后我我通过这个方式啊,我封装了一个技能,它这个技能的用处是什么呢?就是我们平时用这个追美版 a p i 不是 很贵吗?然后我用这个浏览器的技能接了呃追美版的订阅版, 就是它通过控制浏览器,然后打开 jimmy 订阅版的 jimmy, 然后输入这个提示词,然后就会自动把这个图片生成了,然后下载到呃项目的文件夹里,就这一套下来,你升图片相当于你就可以把额度用呃 jimmy 的 额度用满,就不用花这个 api 的 投肯了, 从投肯的消耗相比的话,大概比 content 柚子能省很多省省个八八倍左右。 呃,我的分享就到这里,然后我接下来会放一下我用这个呃 opus 四点六,然后控制我命令它,然后去生成图片,它自动调取我的技能 去呃生成那张图片并保存下来的过程。大家有兴趣可以接着往下看一看啊,欢迎大家关注今天我的介绍,先到这里,谢谢大家。

经常用 cloud code 或者 codex 这类 coding agent 的 朋友,应该都会挺关心 token 消耗和上下文管理这两件事情,但我发现哪怕用了一段时间的人,对于让 agent 做什么事情会消耗 token 这件事认知偏差还是挺大的。所以今天这条视频就给大家讲清楚两个事情,第一个是 token 和上下文 context 到底是什么意思。 第二个也是最重要的,让 agent 做什么事情是会消耗 token 的, 而哪些其实根本就不消耗,也不占用上下文。刚好 cloud code 的 官方其实做了这样一个特别直观的交互式的界面,把你从打开 cloud code 跟它进行多轮对话的整个过程中,它的 上下文是如何累积的,然后每条指令它消耗多少 token 全都非常清晰地画了出来。下面我们就顺着这个界面把这件事情讲明 来。首先就是在我们输入第一条消息之前, agent 它的上下文里面其实就已经被装进去一堆东西了,这里就包括系统的提示词,这个是 histogram 官方写的用来约束 cloud code 行为的一些固定指令。然后是 memory 文件,是之前你看 cloud code 的 绘画里面 agent 自动记下来的一些 笔记和记忆。然后第三个就是环境信息,包括当前的目录、操作系统 get 状态这些,还有 m c p, 还有就是我们非常熟悉的 skill, 还有 cloud 点 m d 这些 map down 文件, 这些都是固定成本,只要你打开一个 cloud 的 绘画,哪怕你一个字都还没有说,这些出土化的上下文就已经加载好了。那从我们发送第一条消息开始,托管是怎么一步步消耗的?这件事情我们站在 agent 的 工作流程的角度来看,就会特别的清楚,你 输入一个任务, agent 会首先理解你的指令,你的提示词本身就成了上下文的一部分,然后他会,然后他会触发绿的命令去读上下文的一些文件,读完他可能会做一些思考,思考完之后可能又会调用一些工具去读一些新的文件,或者跑一些命令去拿输出, 然后再基于得到的结果继续去做思考,这样进行反复多轮,最终他判断任务完成的差不多了,需要你的介入了,就会给你输出一条摘药返回给 给你。把这个流程总结一下,其实 agent 在 你输入完之后干活的其实就这四件事情,第一个就是去读你项目里面的一些文件,第二个去跑一些命令 或者执行一些工具来拿到一些对应的输出,第三个是进行一些思考和推理,第四步就是把摘要总结输出给你,这四件事情产生的所有的内容都会消耗 token, 然后进入到 agent 的 上下文里面。 那么讲到这里有两个事情是我觉得新手比较容易去误解或者搞混的点,这里需要重点去讲一下。首先第一个点就是跑命令本身是不消耗 token 的, 举个例子,你让 agent 把一条两个小时的音频转成文字,或者让他跑爬虫去抓取各个社交媒体上的数据,只要你有现成的脚本或者写好的 skill 让他去执行。这个执行过程中用的是你电脑的算力, agent 本身并没有去参与,所以这个过程哪怕很复杂,跑了一两个小时才跑出一个结果,也不消耗任何的 token。 只有当这个脚本命令执行完之后, agent 真正开始要去读这份结果文件,比如说你让他翻译这份文字稿,或者是基于爬虫的数据去提取观点等等,他必须读完这个原始内容才能开始干活,这个时候才会真正地去消耗 toker。 单纯的脚本执行过程中,无论跑了多久,他都是零 toker 消耗的。 toker 消耗只发生在 a 件的, 去读你的执行日制或者结果,这是我觉得新手最容易搞错的地方。那第二个点就是说,我们去在任务过程中去挤起用子代理的一个情况下,也就是 sub agent 子代理他执行的过程中,我们可以看到他本身是会消耗各种 token 的, 但他消耗的 token 是 累积在子代理自己独立的上下文里面的,不会污染到我们这个主体制。等子代理只是读到这样一份招标文件是消耗 token 的, 所 所以此代理是一种隔离消耗的方式,你让他干一堆需要读大量内容的活,但是主代理的上下文并不会因此受到污染。总结来看,我觉得官方的这个交互式页面真的非常的直观,浅显易懂。如果你对于 cloud code 的 上下文机制还不是特 特别清楚,我非常强烈建议大家去这个页面玩一下,你能够非常清晰的看到 agent 的 上下文是怎么加载的,然后 token 是 在哪些环节去消耗的。有了这个直观感受之后,以后你跟 agent 的 对话,让他干活的时候,就能比较准确的判断哪些事情真的会在消耗你的 token, 而哪些事情看起来可能很复杂,但因为只是脚本 或者命令在跑,其实根本不会消耗多少 token。 ok, 这期视频就讲到这里,如果大家觉得有帮助的话,帮我点个赞,我们下期再见!

开头先说个暴论啊, cloud 和 cloud code 和其他 ai 的 差距,那真是比人和狗还大, cloud 是 cloud, 然后 ai 是 ai, 真的, 我觉得是断层式的差距。讲一下具体这两天我在做什么,给大家举例子,就会比较生动了。简单来说呢,我在给我们的这个减肥 app 做体重管理的这个模块,然后大概有几个页面,我是一个非产 品经理出身的运营,但是我现在也能做一些产品开发和设计的东西吧,我大概花了两到三天时间,包括一开始的产品方案的规划和在 web 定这个方案和代码。 然后呢,第一个 jimmy 给我出的这个版本呢,那真的是太丑了,就是太太太丑了啊,后来最后高低给我出的这个版本,我们两个也就交互用了大半天时间,非常的好看,也非常的好用,非常多的页面做的非常贴心。好,这些都不是重点啊,就是他的能力,这我是知道的,我是被他的贴心程度和服务能力震撼到了,真的是顶级一方。 为什么呢?我这次在设计的时候呢,我想达成的一个功能点是,我希望你能够清晰直观的看出来你每天的体重变化和你前一天吃的这个热量 情况之间的直接的对应关系。如果他没有对应上,再让 ai 给你一些解释和反馈,让你能理解这个之间的因果。好,就这个功能是吧,我在最开始没太想清楚的地方就是我怎么能够让他展示出来,同时信息不涌杂。于是我在跟高老弟讨论之后,他说,要不这样吧,我直接给你出 demo 吧,你根据这个 demo 来看吧, 他直接用控制变量的方法给我出了一堆对照组 demo, 比如说深色浅色白底 demo, 比如说有颜色没颜色和带一个底边 demo, 比如说圆形、方形 小圆边带帽就是,还有就是这几个信息之间怎么组织,怎么配置,给我无数带帽,他简直就是一个完美的,以防你把你的目标描述清楚,细节组合哪个呈呈现更好,用多少种方案我来帮你选,具体怎么细拆全都是他给我给到位的方案。所以才能让我这样一个文科生没有做过产品开发的迅速,两天时间就能把这个一大堆页面开发出来。 感谢靠,我只想说,如果你还没有用靠,你一定要快速的用一下,如果你觉得 ai 不好用,那大概率是因为你还没用靠和靠靠。对了,如果你也是减肥用户,你也请你帮我看看这个页面设计的是否符合你的需求,可以再帮我提提意见和你的反馈啊,我会把它叠带进我们的产品的,谢谢。