全网科普一下这几个单词怎么念?最简单的, chat gpt 来 read after me chat gpt。 第二个啊,这个很多人会读错, jamie lime jamie lime 第三个很多人会读错, cloud 我 之前也读成 cloud no cloud cloud。 好 吧,虽然它的中文发音是克劳德,但是它的英文读法叫 cloud。 第四个,这个比较简单, grog grog 你 会练了吗?
粉丝7648获赞6.0万

给你看三个你用上就能超越别人十倍的秘密。第一个,也是 cloud 跟其他 ai 拉开最大差距的地方, 别的 ai 回答你问题啊,给你的是一大段文字,而 cloud 可以 直接在对话框里给你渲染出精美的格式化的卡片。比如说,你让他对比三个方案,他不是写三段话让你慢慢去读啊,而是直接给你画出一个三栏的对比卡片,重点标记出颜色,哪个好哪个差, 扫一眼你就都知道了。还有像这种信息卡片,数据面板,对比图,全部都所见即所得啊,不管是你研究还是学习还是做报告的时候,都非常有用。 第二个,当你需求说的不太清楚的时候啊,别的 ai 就 开始瞎猜了, cloud 不 会,他会主动弹出选项来采访你,并且直接给你规划好三个选项,如果都没有,你也可以自己输入。这真的就像一个专业的顾问在帮你把需求理清楚再开始干活。 第三个呢,是 cloud 可以 直接给你成品啊,你让它做数据分析,并且加背景色的 excel, 它可以给你一个带公式,带条件格式下载就能用的表格。 你让它出份报告,它可以给你一个带目录,带图标,设计精美的 word 文档出来啊,就是成品,不用你再去排版了。这三个能力加在一起啊,现在没有任何一家 ai 可以 做到。我把 cloud 从入门到高阶的所有的玩法,都整理成了一份完整的指南,评论区扣 cloud。

很多人买了 cloud 订阅,结果在 qq 里还是要另外付钱,充了会员还是报错钱花了,问题没解决。这是因为你搞混了两件事,订阅和 api。 订阅就是你在官网买的会员,只能在官网对话框里用, 相当于堂食。 api 是 给工具和软件调用的接口,相当于外卖接口。但 sir 小 龙虾用的都是这 两个是完全独立的。买了订阅不等于有 api 额度,一个管聊天,一个管工具,分开充值,分开计费,是在官网聊天不接工具的,买订阅够了要接 sir 小 龙虾还有自己开发的, 必须买 api。 记住一个原则,聊天用订阅开发用 api。

这是一期教你如何正确并且省钱使用 cloud code 的 视频,关注我时间长的朋友应该都知道,我是 cloud code 的 死忠粉,作为一个每天使用八个小时,并且用 cloud code 变现了几千块钱的用户,今天我将跟大家分享几个帮助大家省钱而且提高效率的隐藏命令,也许你从入门到精通就差这几个隐藏命令了, ok, 话不多说,我们直接开搞。首先就是 model ops plan, 大家熟知的我们都是通过 model 进行切换嘛。 但是这个命令对于二十美金的 pro 用户来说实在是太友好了,因为它会自动地在你进行一些复杂推理和写计划的时候使用最强的 ops 模型,然后在执行的过程中使用第一档的 sonata 模型,这个就能帮助 pro 用户显著地节省头肯, 你的一倍头肯,能用到三倍头肯的效果。第二个就在命令行输入 remote control, 就是 我们在养龙虾的时候终极梦想,就是我们躺在床上,然后让 ai 自己写代码,那么这个命令就能很好地帮你实现。这一点能够通过手机来操控 cloud code, 你 只需要在对话框里面打斜杠 r c, 它就会生成一个网页, 你用手机打开这个网页的时候,你的整个 cloud code 就 会在你手机上同步,这个功能是让你的手机变成遥控器,远程的遥控 cloud code, 我 只能说憨爆了。第三个命令行是斜杠 export, 它会把我们所有的对话上下文打包成一个 m d 文档。如果没记错的话,我觉得 cloud code 的 上下文窗口应该只有两百 k, 经常出现那种你跟他聊着聊着上下文窗口满了,你需要开一个新窗口的问题, 那么这个命令就能很好地帮助模型去知道啊他现在做到哪一步了,他接下来要做什么?此外,你可以导出到其他的 ai 产品嘛,比如说 codex 上面,然后你继续搞。最后我想讲的这个不是命令行,但是如果你要想在你睡觉的时候让模型继续帮你工作,那么就一定要勾选上这个 permission, 它叫 bypass permission。 我 们是不是很多人在使用 cloud code 的 时候,一会儿一个弹窗,一会儿一个弹窗,你要点击去确认这些权限,但是你选择 bypass permission 的 模式之后,它自己就会去执行所有的命令了。其实我今天本身还是很想讲一个,就是 agent team, 你 一个人怎么去组建一个 agent 军团去帮你干活? 我经常搞十几个 agent 同时并行的帮我完成任务,这种感觉实在是太爽了。但是因为这个篇幅比较长,而且今天时间有限,可能讲不完,所以说大家如果想听的话,可以在评论区里面提需求,如果想听的人多了,我们下期直接安排上,那么我是 holland, 关注我,带你分享更多 ai 变现和省钱玩法。

很多人一开始用 cloud code, 其实有个困惑,就是你的这个对话记录,你提的问题,还有他的回答,有一些是对于你来说很有价值的,以后可能会去查它,但是呢,这个 cloud code 因为是在终端里运行命令行的,它默认没有显示出来这个历史记录, 像这个 girl, 还有 gbt, 还有豆包这种,它是有这个历史对话记录的,因为这些东西它是在这个网页里很方便的,可以查。那 cloud code 这边就是个命令行界面啊,然后这是你问的问题,然后他回答, 然后你把这个终端呢,你关掉,关掉之后它就没了,下次就是一个新的了。那其实 cloud code 提供了一个 reload 这个命令, reload 这个命令, 那这里呢,你就可以看到,他可以把你的历史对话包括他的回答都列出来,那这里有一个设置,有一个搜索底下是最近的一个对话, ctrl a, 那 么可以列出来更多的所有你的历史对话。可以用光标切换某一个历史对话,找到你想要看的那个,然后空格就可以回到原来的这个对话状态,这个其实很重要啊,这样呢, 你同样一个问题问好了之后可以随时回来查,不用再去同样的问题重复问他了。一个是给你自己省 token, 因为这个东西要米的,还可以省公共资源。你一个问题重复问没有意思,浪费他的算力,然后还浪费你的 token 啊,这个其实是一个很好的功能,只是很多人可能还不知道。

你跟 cloud 说一句,中文不的钱是英文的一点六五倍,硬币与用户在 cloud 上更惨,三点一一倍。这不只是技术问题,是 entropic 一 家刻意的政策选择,把分词税收成了行业第一名。你说什么元?用谁家模型决定你付多少 ai 钱。这是有名字叫分词税。 token tax 大 模型,读你的话,不是一个字一个字读, 切成 token 读。英语常用词在词表里大都有自己的位置,一个词一个 token 就 装下中文,印第语阿拉伯语没那个待遇,一个字常常要花好几个 token 才能凑出来。印第语缅甸语更狠,连字母都拆成字节碎片塞。所以同样的意思,英语用户花一个 token, 中文用户得花一点五二 这三个。而 ai 公司的账单是按 token 数算钱的。一句今天天气怎么样,和一句 house 的 价格不一样,差的钱看不见,但每天都在被收。四月十六号, antropica 的 cloud op 四联系上线,第一次正式承认,这次承认的有点晚,它前一代 open 四点六,是全行业把中文用户收的最狠的一个, 看这个税被收到什么地步。中文用户在格式上每写一段文档,要比英文用户多付百分之六十五,一个月账单从一万变一万六,多出来的钱没换来更聪明的回答,只换来同一个回答。 缅甸有种少数民族文字叫胆文,被收的更夸张,十五倍模型连这种字都没见过,干脆按字节硬拆,一个字母拆三四个头啃,跟阿斯基时代以前一样原始, 同样写一篇三千字的报告,英语用户花一杯咖啡的钱,短文用户得花一顿火锅。这不是新鲜剧情,是老剧本。从业三十年前,短信时代, gsm 编码一百六十字,一条只支持拉丁字母,中文短信切到 ucsr 一 条只能写七十字。 我到家了,这四个字付的钱是英语的二点三倍。运营商收了二十多年,这次轮到 ai 了,你以为只是付的多?还有看不见的 token 多?百分之六十五,意味着上下文窗口你只能用大约六层。同样, cloud 的 英文用户塞得下三十万字代码,中文用户塞 不到二十万。你买的不是同一个产品?还没完, ai 一个 token, 一个 token, 往外蹦字,阿拉伯与用户等回答的时间是英语的二点五倍。同样问个问题,你还在喝第二口茶,英文用户回答都看完了,这次猜到底奔驰税不? 不是技术中立,是基础设施在替全世界定关税,但不是所有公司都这么收。同一句中文听比上零点八一倍,比英文还便宜。微软零点八五, deepsea 零点八七, jimmy 零点九八,几乎打平,连 open li i 都做到一点一五, polo 一 点六五。这家公司多少有点奇葩,大家都领教过。硬币与用户在 cloud 上要付三倍多,是 jimmy 同款用户的差不多三倍。同一种语言,同一段话,因为你选的是 cloud, 多交一倍多的钱,全行业平均一点四九倍,按错币加拉到二点零七, 比第二名还高百分之十八。这是把行业第一做成了反义词。收税最狠那家是行业里最贵那家是天天讲 ai 安全那家嘴上喊安全第一,干起来收费第一。这不是工程问题, bpe 算法是公开的,尺表大小是自己定的,训练数据是自己挑的, timi 能做成零点八一倍, antoolepic 拿同一篇论文 当圣经做成一点六倍,不是技术不行,是没把中文用户当回事。而且这种事在历史上也不是第一次。从 g s m 编码到 g b 二三一二 big 五 shift j s 编码战争,再到中文输入法。对的,快捷键盘,别扭了二十年。 美初一代新基础设施,最先享受红利的永远是写他的那波人。奔驰税只是这个老规矩在 ai 时代换的新名字, sms 那 一代运营商收了二十年,没人退过这一代,你换个模型就能换个税率。下次有人跟你说 ai 让世界变平,记得问一句,是哪种语言的世界,哪家公司的世界?常回基地看看,谢谢。

家人们刚刚看到 cloud 支持了一个新的功能,在对话里面可以支持交互式的 ui, 让我们看看到底是什么功能,以及它是怎么实现的吧。 在对话框中输入你的问题,它可以根据你的问题生成对应的 ui, 帮助你快速地理解你问题中的概念,甚至还能够生成一些按钮,帮助你继续去追问问题。 我非常好奇他们这个 u i 是 怎么做到的,于是我问了他这个问题,原来他们是新增了一个 soviet 工具,本质上就是生成了一段 html 代码,再把这个代码通过工具发送给前端,前端 再通过 ipham 炫长出这个 html 代码。接着我继续追问 soviet 这个工具,可以看到这个工具总共有四个参数,一个是 是否已经阅读了工具的使用说明书,第二个就是说这个前端 ui 的 这个标题名,第三个就是渲染期间的加载文案。最后的就是这个前端 ui 的 代码。 比较有意思的是这个阅读说明书的工具,它能够保证 ai 在 画不同的图的时候能够遵循它们的 ui 规范,比如颜色、布局、字体等等。最后我们可以简单看一下这个查看说明书的工具, 其实很简单,无非是对不同的以外主见,分门别类的写了一个说明书,让 ai 在 画的时候能够去参考。今天的分享就到这里,我个人认为在 ai 时代,友好的人际交互非常重要,希望今天的分享能够给你带来一点启发。

家人们谁懂啊?你们有没有遇到过用 vsco 的 的 c c 插件连 mimo v 二点五 pro 时发图片模型却识别不了的情况? 后来翻官方文档才发现原来图片功能只对 mimo v 二点五和 mimo v 二安利,这俩模型开放, pro 版本压根没着权限。 不过借鉴这个博主给 cloud 装而易得,有隐秘值技能,不用画模型也能识图。对话框输入安装 skill skill 网址,在评论区获得 所有弹窗,按 es 确认,等待安装完成。安装完成后,按视频打开配置文件地址,将 off token 替换你的 api key, 一 切就绪后,复制图片地址对话框,输入图片地址理解图片, 可以看到 cloud 已经使用 sq 识图了, 模型居然说这是喜羊羊,真的绷不住了,哈哈,所以建议大家还是谨慎使用。你们有没有遇到类似的翻车现场评论区分享一下呗!

用考核 code 啊,最烦的一件事情是什么?你交代他一个任务,转身去倒杯水,大家发现他还停在那里等着你确认。改个文件要问你,装个工具要问你,连建个文件夹都要问你,那其实不是没有办法,是你还不知道。考核 code 啊,有六种权限模式, 那选对了他就不烦你了。那第一种, default 默认模式,每一步都要你确认,最安全,但也最打乱节奏。第二种, accept edit 模式,工作目录里的文件编辑啊,全部都自动批准, 但终端命令还是会问你。第三种, plan 模式,那 cloud 只读不写,先帮你规划不动你的代码。第四种, auto 模式,背后有个 ai 安全分类器,实时把关,安全的放行,危险拦截,不需要你逐个确认。第五种, don't ask 模式, 默认拒绝所有操作,只执行你提前加入白名单的工具,那适合需要精细控制的场景。第六种, by pass 模式,那用这个命令可以启动,跳过所有的提示,只建议在格力环境里面用。那还有很多人问我啊,为什么 shift 加 table 找不到 auto 和 don't ask 的 模式, 那 dosask 啊,只能启动式加参数进入,那 auto 呢?需要先跑这个命令来解锁,而且 pro 账户用不了,需要 max 以上的订阅计划。那最后啊,一句话来,选,模式默认用 default, 改代码用 accept edits 看方案用 plan, 智能全自动,用 auto 精细控制啊,用 dosask, 完全不打断啊,用 bypass。 那 你觉得可拉库的最烦人的事情是什么?欢迎在评论区分享。

你没有看错,我正在 cloud 的 聊天框里面玩魂斗罗游戏。可能有人觉得这有什么了不起,我通过 web coding 分 分钟也能做出一个游戏出来,然后在浏览器或者通过 app 测运行。但是这里我想强调的是,这个游戏的运行环境不是在浏览器或者 app 里, 而是在 ai 聊天框里,也就是看到的这个 cloud 聊天框里。所以接下来我想聊一聊在聊天框里玩游戏这个事情是怎么实现的,以及这种方式对未来的产品交互可能会产生什么样的冲击。 这个视频的思路来源于 hack news 的 一篇文章的讨论,这篇文章讲述了在 ai 聊天框里玩 doom 游戏的场景, 引起了大家的广泛讨论。 doom 是 一款经典的射击游戏,我照猫画虎实现了在 ai 聊天框里玩魂斗罗游戏。这里多提一句 heckle news, 我 视频当中的不少灵感都来自于 heckle news。 heckle news 聚集了一些顶级的程序员和科技从业者, 这帮人对技术都较为敏感。如果一个问题能在 hack news 上引发讨论,就说明他在社区当中其实是有一定价值的。所以接下来我们探讨下在 ai 聊天框里玩魂斗罗是如何实现的。 从文章的标题看,我相信你也能猜得到我这个视频讲的是 m c p, 大 概率是通过 m c p 的, 应该是有一个普遍的认知的一个后端服务接口,通过提供的请求参数返回对应的 jason 数据。 但是这里我想表达的是,当下 m c p 不 只是返回 jason 数据,它还能返回渲染交互式界面,比如游戏地图三 d 场景。看到这里你可能会有些疑问,因为一开始的时候 m c p 官方文档是没有这些能力的, 那这些能力是什么时候添加的呢? m c p 返回渲染界面的能力其实是在今年年初的时候正式发布的, 由 astropik 和 open ai 共同制定标准,而这个能力官方称之为 mcp app。 接下来我们就看一下通过 mcp app 实现的魂斗罗游戏的整个流程应该是什么样子 的。另外多提一嘴,这个 mcp 的 测试代码我也放到下面评论区了,感兴趣的话你也可以把玩下。当我在 ai 聊天框里输入启动魂斗罗时, agent 比如说这里的 cloud 会把我当前的输入以及当前提供的 mcp 工具一并发送给大模型, 大模型解析我的需求,确认可用的 m c p 工具。然后 cloud 决定通过 create game session, 请求 m c p server 创建游戏绘画,生成一个 jason 的 返回数据。这里面最主要的一个字段是 inline resource, ui 这个字段的返回值是以 ui 冒号斜杠斜杠开头的一个链接。 cloud 看到这个 url 后,会取 mcp 服务器请求对应的 html 资源,然后内联渲染在对话框里。而针对 ui 冒号斜杠斜杠这样的链接,通过内联渲染在对话框里,是 mcp app 定义的规范,当下向 cloud chat gpt 已经实现了这个规范。 这也是为什么我这个魂斗罗可以直接显示在对话里,而不是通过什么浏览器或者弹窗显示。而我在真正游戏的过程当中,交互基本是 m c p 服务或者这个打包的静态游戏资源及 ui 冒号斜杠斜杠进行交互, 所以在这个过程当中,大模型几乎是不参与的。准确地说,当按下电脑上的方向键时,输入事件,直接发送给打包的静态 java script 资源,然后通过 canva 实时刷新这个内联画面显示给我看。 最后,多聊聊这个视频的目的绝对不是简单的玩游戏哈,我就是想证明 m c p a p p 的 能力,它逐渐把传统在浏览器上的交互或者 a p p 的 交互挪到 ai 聊天框里面去。说到这里,咱们不妨再往前想一想,这里的想象空间会很大, 如果这样一个超级大的聊天工具,它镶嵌了各式各样的交互能力,那岂不就是一个新的流量入口?后续我们和其他产品的交互的事情,都可以通过这个聊天工具去完成。我觉得这个点未来真的可能会实现。从近期 open ai 和 ansaurpik 的 动作来看,它们显然正在往这个方向去尝试。

你有没有想过,让 cloud 不 仅会写代码,还能直接帮你打开应用,点击按钮、看屏幕、截图、验证? 这还只是冰山一角,翻译、运行、端到端测试、调试、布局、驱动、模拟器、操控没有 api 的 g u i 软件,十几项能力一口气全给你。这就是 cloud code computer use 功能,它让 cloud 真正能够动手用你的电脑。 简单来说, computer use 让 cloud 接管你的屏幕,它能编辑一个 swift 应用,启动它点击每一个控件,然后截图,把结果告诉你,而所有这些都在你写代码的同一个对话框里完成,不用切换工具,不用离开终端。 那它能帮你做什么呢?有四类典型场景,第一,构建和验证原生应用。让 cloud 写一个 macos 菜单栏应用,它会自动翻译、启动,点击控件验证,你完全不用打开。第二,端到端 ui 测试, 指着一个 electron 应用说测试注册流程,它就会打开应用,点击按钮截图,每一步连 play right 都不用配。第三,调试视觉和布局问题 告诉它,弹窗在小窗口被裁掉了,它会调整窗口大小,重现问题,截图改 css, 然后验证修复。第四,驱动只有图形界面的工具, ios 模拟器、硬件控制面板,没有 api 的 专有软件,它都能直接操作 这四个场景,你可以直观的看到他们是怎么运作的。你看,从写代码、翻译、启动应用,到模拟用户点击截图验证每一步,再到调整窗口大小,重现 bug, 改完再验证。 最后是驱动模拟器,像用鼠标键盘一样操作,整个流程都在同一个对话窗口里完成,你看到的每一个步骤都是克拉的,自己动手完成的, 不过 cloud 不 会一上来就用 computer use, 它有一个明确的优先级,有 mcp 服务器优先用 mcp 命令,行任务用 bash, 浏览器任务用 cloud in chrome。 只有以上都不适用它才会动用 computer use。 控制屏幕是最广泛也最慢的手段,留给其他工具够不到的地方, 要起用它很简单,在 cloud code 里输入斜杠 mcp, 找到 computer use 这个内置 mcp 服务器开启就行, 但起用不等于放开所有权限。 cloud 第一次需要控制某个应用时,终端会弹出审批提示,提示里会显示它想控制哪些应用,需要哪些额外权限。你可以选择允许此绘画或者拒绝, 而且不同应用的控制级别也不同。浏览器和交易平台是仅查看终端和 ide, 是 仅点击其他应用才是完全控制。像 finder 终端、 system settings 这种高风险应用,授权时还会出现额外的哨兵警告,让你知道自己在批准什么。 我们具体来看这三个控制级别,仅查看浏览器交易平台。 cloud 只能看到屏幕内容,不能操作仅点击终端和 ide。 cloud 可以 点击按钮执行命令,但不能随意移动鼠标或截屏, 完全控制其他所有应用,相当于你把自己的键盘鼠标交给了 cloud。 对 于终端 find 系统设置这些高风险应用,系统会弹出哨兵警告,明确告诉你它等同于 shell 访问,能读写任何文件,能更改系统设置,让你清楚地知道风险。 来看三个常用的实战工作流,翻译验证,改完代码后,让 cloud 一 次性翻译启动,打开设置窗口验证控件,最后截图给你看附线布局 bug, 让他把窗口调到最窄,截图损坏状态,然后直接读相关的样式表。驱动 ios 模拟器,不用写 x c test, 直接说。打开模拟器,点击引导页,它就像你用鼠标一样操作。一句话总结, computer use 让 cloud 从只会写代码变成了能自己动手 写代码。翻译、运行、验证一条龙搞定。记住两个安全要点,同一时间只能一个绘画控制电脑,并且按 excel 存存,随时可以中断。关注我们,持续获取实用技巧,让你的开发更高效。

当你一不小心给 cloud desktop 接了第三方 a p i, 结果发现它居然不能联网。别急,十秒解决。打开 cloud desktop, 点 developer configure third party inference, 左边切到 sandbox and workspace, 找到 allowed egress hosts, 点 allow all 保存重启,重新打开对话框,让它搜个网页直接通了。快去试试吧。

很多人不是不会用克劳德抠门,而是根本不会管他的上下文。你有没有发现,跟克劳德抠俄或扣 ducks 聊到后面,他经常不是更聪明了,反而越来越飘? 很多人会怪模型不稳定,但说白了,更大的概率是你把它的 context 对 坏了。我今天在 x 上看到克劳德扣团队塔里克写的一篇帖子,看完我就一个感受,这篇讲得很透,他讲的不是模型有多强,而是一个更实际的问题,为什么 e m context 很 强,但也很容易把自己聊废? 先说人话,什么叫 context? 上下文就是模型这一轮能同时看到的全部信息。 这里面不只是你的最后一句话,还包括系统提示词、聊天记录工具调用工具输出,还有他读过的文件, 这些东西加起来才叫 context pane, 也就是他当前脑子里真正装着的东西。克劳德扣的现在有一百万托肯,也就是一爱姆康泰克斯特,听起来很棒,对吧? 但这篇文章最值钱的一点就在这,大不代表你可以乱塞,更不代表他会一直保持同样聪明。 因为上下文一旦越来越长,模型的注意力就会被贪薄纠信息、杂信息、无关信息会开始干扰当前任务。 作者用了一个很关键的词叫 context, 你 可以把它理解成上下文开始变质,开始腐烂。它不是突然不会了,而是它脑子里垃圾越来越多,真正关键的信息被你自己埋掉了。文章里提到它们观察到大概在三百 k 到四百 k 头坑左右,就可能出现一定程度的 context 了。 这个不是死规则,但已经足够说明一个问题,上下文窗口大,是让你更从容,不是让你更放飞。这个是我自己特别有共鸣,因为平时开发太容易这样一个绘画里,查接口、翻日制、改 s q l, 顺手修握拧,你以为这是高校附庸,其实很多时候, 这叫把四件事塞进同一个脑子里,然后指望它一直判断精准。所以这篇文章里有一句,我特别认同, 每一轮对话结束都是一个分叉口,你不是只能继续聊,你每次都得做选择,是继续还是瑞恩德?还是克尔,还是康派克特?还是紫黛丽? 先记住最重要的一条,你开始一个新任务,最好就开一个新绘画,别老想着在旧绘画上,你刚刚还在修登陆,下一秒又去搞导出报表,这已经不是连续工作了,这是两个任务,别装作他们是一件事。然后是因为你。很多人喜欢在后面补一句,你错了。 但更好的做法,往往是退回到他还没走外的那个节点,因为源于外内的价值。不是纠正一句话, 而是把错误分支整个从上下纹理砍掉,别让它继续污染后面的推理。再说 come park 这个功能很多人知道,但你一定要记住,它本质上就是摘药,而且还是有损,有损压缩,也就是说哪些内容保留,哪些内容丢掉, 不是你说了算,是模型替你做选择,所以他有时候会要爱。最后一个特别好用的是紫代理,别什么中间过程都往主绘画里灌,能外包的就外包给全新 comtex 的 新 a j 项链,结果读别的代码库总结实现方式,或者根据归片更写文章这种任务,你最后其实只想要坑 q 村结论。 所以看完整篇文章,我自己的结论就一句, e m context 不是 让你无限续杯的,它是给会管理的人用的。以后你再觉得 ai 越聊越笨,先别急着怪模型,先看看是不是你自己先把它的上下文位坏了。

最近 ai 圈有个变化很有意思, codex 的 热度突然反超了 astropic, 而且更戏剧性的是,就在两周前,它还是被压着打的那个。这个数据当然本身不一定代表全部真相,毕竟来自第三方机构,而不是官方数据,更接近市场热度的一种指标。但即便打了个折,这个拐体也太陡峭了。我最近两个礼拜都在频繁使用 codex, 今天就跟大家聊聊我的体感,以及网上讲的范式之争是什么意思。技术人员管它叫做 harness, 框架设计就是在底层的模型外面掏一层壳,这个壳决定了你跟 ai 是 怎么打交道的。大家都知道掏 code 有 三个入口吗? chat、 cooke 和 code, 用户按照需要来选择聊天讨论方案。做应用呢,可以用 chat, 但不能读取你本地电脑的文件。 cowalk 呢,是可以调用电脑里的文件,更像是 agent 把活干完直接交到你手里,比如整理文件、编辑素材、写代码等。你有一份很清晰的产品需求,那就选 code, 不 啰嗦,让它直接写代码做应用。 一个很强的资深程序员思维。我有过几次,本来在 chat 里聊需求,发现要扣定个工具,但又要批量改写文件,这时候就只能去 cowalk 那 边处理文件了,再回 chat 继续沟通。 colex 就 不分这么细,不管你有什么事,都在一个对话框里说需求, 他把聊天抠点和读取本地文件都放在一起了。它就像一只大龙虾,我相信大部分人刚开始用都会很兴奋,因为它很省事。它的哈尼斯价格,在这一点上我觉得是赢得大部分人心的,在开封前少了一步,我到底要推开哪一扇门的思考? 人都是很懒的,就像有个传闻, open ai 说他要做手机嘛,但也许不一定叫手机,但这是个专题,这个专题里面没有 app, 你 只要对着这个专题说需求,他就自己在后台分发任务,我相信这一天会到来。但至于是 open ai 做出来的,还是其他人做出来倒不一定。 技术圈给的概念说法是,模型具备了自主路径推理和工具调用的能力。我的体感是,他像一个会主动想事儿的人,自带很多技能, 不像 open claw 要去养龙虾啊,教会他很多技能之后才能干活。 codex 呢,不用养,你说完目标,他自己会挑合适的技能去做,等着拿结果就行,反正不好你就跟他提意见。比起 codex, 我 用 codex 的 时间要长很多,应该有好几个月了吧。 纯粹我个人体验。论智商, codex 模型比 cloud 要逊色一些,但 codex 调用本地电脑的能力和组织技能能力,那真的是很强。 当然,也有个很奇怪的事啊,我发现 codex 在 不同对话框能力还不一样,选超高智能的时候,时长反而效果没那么好。有两次我开了超高能力调用 hyperframe 去自动剪辑视频,效果一般,换了个对话框,降低了智能,反而轻松搞定。 我还没有摸透它模型的套路,目前觉得开新对话框就像开盲盒,有时是大学生,有时是小学生。我们普通人到底要怎么选合适自己的 a 针呢?除了看哪个模型更聪明,还要挑选哪一种哈密斯更方便你干活。如果你工作流程很清晰,喜欢专业工具,专业式 cloud 那 一套会让你很舒服。如果任务的步骤很繁琐,不仅要调用本地文件,用不同工具去做的话,那 codex 这种一个对话框搞定所有事情的设计会很方便。

你在 color code 里打了一句 hello, 他 回了一句,有什么能帮你的一个词进去一句话出来,但你有没有想过,就这么一句话,到底消耗了多少 token? 答案是接近三万个。今天我们把这个请求拆开来看看这三万个 token 到底花在哪里了。 我用的工具叫 cloud trace, 作者是 mario zachner。 用过 opencloud 的 同学都应该知道, opencloud 的 底层 agent 框架叫 pi, 就是 他写的。整个框架只有四个工具系统提示词,不到一千个 token 就 能跑起一个完整的 coding agent。 这期视频就是参考它的这一篇叫 cc history tracking clock code, system prompt and tool change 的 文章。它用 monkey catch 做了 monkey patch, 劫持了 clock code 的 命令行里的这个 fetch 函数,这样就能拦截 clock code 的 发给 andorope 服务器的所有请求和返回值。基于这个研究,它做了两个工具,第一个叫 cchistory, 它是一个网站,能对比任意两个 cloud code 版本之间系统提示词和工具定义的变化。同样的提示词上周好好的,这周就不听话了,所以去 hecc history 一 查,就知道 asterisk 改了什么。第二个就是我们今天用的 cloud trace c c history, 它能告诉你改了什么,那么 cloud trace 它能告诉你现在发了什么,它会拦截 cloud code 跟 asterisk 服务器之间所有的 api 流量,然后记录下来的生成一个 html 文件,浏览器打开就能看。 用法很简单,只要你把平时用的 cloud 命令替换成 cloud trace, 然后后面加 include all request 的 参数,记录所有的请求,然后这就开始这个 cloud 了,你正常用就行,比如说 hello, ok, 你 用完以后直接退出就行了,它会生成这个 html, 然后你看这就是 cloud code 和 elastic 服务器所有的通信的这个这个记录。然后比如说我们要看的其实实际应该是这个 message, 对吧?你看,这就是你发的 hello, 现在来看发给 api 的 这个 post 的 请求吧。我把刚才 html 文件里的数据保存成了这个 json 文件,我们按照字段出现的顺序从上往下看, 第一个字段是这个 messages, 对 吧?里面只有一条 user 消息,你以为你发过去的是 hello 这五个字母,其实打开一看,你的消息被包成了六个 content block, 前五个 block 全是 clock code 注入的这个 system reminder 标签。 第一个一大坨就是你装载的这个 hooks 完整配置,比如说我的我用的那个 superpowers, 所以 coco 的 会有这个 superpowers 的 这 hook, 如果你没用就不会有这个。比如说,呃,你看到了这个 cchistory 里面这部分就没有的 ok, 这个就不是系统自带的注入了。 那么第二个是这个延迟加载的这个这个工具清单,比如说我看到 cchistory, 你看这里会比较明显一点,然后这个里面只列了这个工具名,它没有完整的定义。为什么要这样呢?因为每个工具它的完整定义可能有几千个字母,那么全塞进去太占头坑了。所以 coco 只告诉模型你有这些工具可以用,等模型真的需要这个工具了,那么你再用这个 to search 这个工具来加载完整的定义。然后第三个 是我的这个 m c p 服务器的使用指南,告诉模型怎么调用我配置的 m c p 工具,比如说我唯一使用的就是这个 contact seven 文档的 m c p, 平时有什么工具查不到怎么用了?那么 clockoco 就 会去 contact seven m c p 查一下这个怎么用。第四个是一大坨啊,这里是我所有可用的 skills 完整列表,比如说我用 cc history 看得比较明显一点,比如你看这里常用的这个 simplify, 对 吧?我们写代码的时候经常用的。然后还有比如说呃 review, 这里生成一个 pr 都在这里了,对吧? 然后往下看。第五个,这个就是我的 cloud 点 md 文件,你在项目里写的所有的指令,然后项目结构说明,写作的规则,工具偏好, cloud code 的 原封不动的都会塞进这段消息里面。所以模型之所以会知道我的项目规范,都是因为每次对话里都在这里待着,最后一个 block 才是我的 hello, 你看,只有这个 block 上面标注了这个 cash control, 设定成一小时过期,前面那五个注的 block 都没有标。这意味着 clockcode 把我的实际输入当做缓存的切割点,你的输入之前的内容都可以被缓存附用,你的输入本身每次都会重新发, 那我们做一个小小的总结,那么 color code 发出的请求里面,第一个 user 数据块里面就包含了所有 color code 的 自动注入的上下文,关于用户的,比如说 hook 的 配置,对吧?然后这些延迟加载的工具清单, m c p 的 配置,然后所有可用的 skills, 还有你自己定义的这些 color code md, 对 吧?最后是你的输入的这个提示词, 那我们接着往下面看 system 字段,那么这个就是系统的提示词,是 anthropomorphic 写的,它会告诉模型你是谁,你该怎么做。它不是一整段文字,而是一个序组。比如说里面有四个文本块,第一块很短,是计费头,它记录了你的 cloud code 版本号和入口的类型。那么第二块只有一句话 叫 you are cloud code anthropomorphic official c o i for cloud, 这就是 cloud 的 身份定义。然后第三块有一大坨,我们切到 c c history 看啊, 你看这就是核心的这个规则里面它有好几个章节,比如说这里的 system, 它定义了运行的环境,然后 doing tasks, 它会告诉他怎么去做任务。然后这里还有 executing actions with care, 它规定了,比如说哪些操作需要谨慎,比如删文件啊, force push 这些需要给你确认。 然后比如说 using your tools, 它规定了,比如说 graph 就 不用用 bash 里的 graph 了,用 read, 不要用 cat。 然后这里 toon 和 style 是 要求短句,还有比如说不要用 emoji。 我 们继续往下看第四块,它比第三块还要长, 比如里面看它这里面说了这个输出的格式用什么规则,然后还有比如说绘画级别这个指引,然后还有比如说自动记忆, 那就比如,比如说规定了有哪种记忆类型,比如 user, 这是身份和偏好。然后第二个是,比如用户给他的反馈, 然后还有比如说什么不用记,还有比如说怎么记,你看这么大一段全是定义的记忆系统,说明 cloud code 在 这一块的内置功能已经很强大了。 再往下看,还有当前的环境信息,比如说你的呃 excel 类型,然后你的工作目录全在里面。这四块加起来这么多提示词,你说的每一句话,这些提示词都会跟着一起发过去。接下来我们总结一下请求里的第二部分系统提示词,第一个是它的计费头,第二个是 call 的 自己的身份说明, 第三个是他的行为准则是怎么做事情的。第四部分很大一部分是关于他是怎么处理这个记忆还有环境的这个说明。接着我们看这个下面的 tos 字段, coco 给模型定义了十个工具,比如这个 agent 就是 用来给 sub agent 派发任务的。 然后往下看,比如说还有这个 bash 命令,光 bash 这一个命令的说明,超过一万多个字母,里面详细写了什么时候该用 bash, 什么时候不该用,然后比如说什么时候创建这个的提交,对吧?然后还有比如说怎么去提交一个 pr, 然后继续往下看。还有比如说 edit 的 命令是修改文件的,然后 grab 是 搜索文件的内容,然后比如说还有 read 读文件, 还有比如说像什么 schedule wake up 呀,然后还有比如说什么这个 to search 啊,你可能都没注意过,每个工具它都带完整的参数定义和使用说明,这些说明也是模型上下文的一部分,也占 token 最后两个小字段,这里的 thinking 设置成了 adaptive, 意思就是模型自己决定要不要启动深度推理, 然后有一个 output config, 有 个 effort 字段,这里是 x high, effort 控制的是模型的推理深度,从 low 一 直到 x high, 一 共五档。 x high 就是 现在 clock code 的 目前的默认值,每次对话都是用的最高推理档位。你在提示词里用 extra think, 实际上就是触发这个 x high。 ok, 这里简单总结一下请求里的最后两个部分, tos 是 所有 clock code 自带的工具定义,然后啊, effort 是 决定最高推理的档位。 ok, 请求我们介绍完了,我们现在看看 cloud 的 返回,它的 api 返回不是一整坨 json, 而是一串叫 sse 事件流的东西。 sse 全称 server sent events, 就是 服务器一条一条地往客户端推数据。我们来顺序来过一遍, 第一个事件叫 message start, 返回了消息的基本信息,比如模型的名称, id, 还有 token 的 用量。然后紧接着是 content block start, 它开启了一个 ping, 就是 心跳保持连接用的。接下来是两个 content block 标塔 啊,这就是模型实际输出的文字。第一个 delta 是 hello, 然后第二个是 how can i help you today? 你 在终端里看到的竹字打印的效果就是这些 delta 一个一个推过来的,然后然后是 content block stop, 这个文本快结束了,然后啊, content block delta 带了一个 stop reason, 叫 end term, 意思就是模型主动结束了回复。 最后一个 message start 里面这个 usage 字段,这里是最值得细看的一块。 比如说 input token 是 六,所以你的 hello 加上格式标记,一共就六个 token。 但是 cash creation input tokens 是 一万四。这一万四是什么?是这次新写入缓存的内容,你的部分的系统提示词和工具的定义被写进了一个小时有效的缓存里, 然后这里的 cash read input tokens, 所以 是一万六,这一万六是从已有的缓存里读的,所以上一次对话已经缓存了一部分系统提示词,对此直接复用了。所以你觉得自己只发了五个字,但实际上模型实际处理的上下文是六加一万四加一万六,一共是三万一千个 token。 好消息是缓存读取比正常输入便宜九成,所以不是每次都从头赚钱。这是为什么 cologold 的 连续对话时费费用不会限行增长, ok, 所以 这就是一句 hello 背后所有的全部真相。 cologold 给 entourage 后台服务器的所有通讯内容, 他的请求,还有他的回复都在这里了。下次如果你觉得 cologold 的 行为奇怪,或者头肯烧的特别快,不要瞎猜了,用 cologold 看一下他到底发了什么,收了什么就都清楚了。

兄弟们,这是一个非常实用的 offsite 插件, cloud 的 offsite, 它实现了 cloud ai 和 offsite 的 一个深度集成,让 cloud 可以 直接访问你的笔记库,进行智能的对话,包括一些总结或者是知识的关联和笔记生成都是可以的, 非常大程度的提升了 offsite 作为第二大脑的使用体验,适合重度笔记的使用的用户,有需要的可以关注试用一下。

很多朋友都知道 cloud 非常的强,但是还不知道如何去使用到今天来给分享一个非常简单的方法,这个里面都能使用到官网的最新的 o p 四点七,三万四点六等等这些模型啊,我们来看一下, 这个里面我放了多个官网的 max 和 team 账号,都可以去任意的选择使用,并且上面还为你贴心了选择了 samsung 每三小时有三十五次, o p s 每三小时是十次啊,都可以去任意的选择使用的,如果大家也想使用的话,都可以点击我主页的置顶作品找到我直接使用。

大家好,我是小新,在之前的分享中呢,很多朋友分不清楚 cloud code 跟 cloud 的 模型的区别,本期视频主要讲了他们之间的 区别,以及我们平常会让 cloud code 跑的一个任务,比如说竞品分析,那么这个词进来之后, cloud code 跟模型分别都会做什么事情?以这个东西为例,去解释一下这次钓鱼当中都发生了什么。 那么简单来说呢, cloud ops 呀, sorry 太酷,他们就是大脑,然后它本质呢就是参数,它在人这个力当中,它就是它的手脚去执行各种东西,那我们只有脑子,没有东西去执行是不行的,我们只去执行,但没有聪明脑子也是不行的,这就是他们之间的一个关系。 我们具体来看呢,当我们去使用 cloud code, 跟他一个任务说帮我做一下进理分析,会发生什么事情呢? 那么首先呢,可拷的这个软件进来之后,他会去加载可拷的 m d, 比如说你让他说话风格一定是说中文的模型,也可以让他的风格是简洁的,或者说让他不要省 token, 把东西说得很详细, 在这里面会定义很多静态的一些对 v a 上的一些定义,就像对他的要求一样,然后这个时候会加载在 memory, 比如说你之前跨绘画的时候,是不是之前就已经让他做过类似的镜比分析,那么之前我们在镜像的过程中,别的镜品是什么?然后提到了镜品这两个字是什么,以及我们的产品是什么。 然后就是 color code, 它自己定义的三四十种吧。预加载的兔子一些工具可以供后面的模型去看我们到底用哪些兔子, 然后他会把这些东西全都打包好,作为一个上下文,是 cloud code 的 这个软件做这个事情,打包成上下文,连着用户的这次请求进行分析,一块打包给模型 好了。这些东西给了脑子之后呢?那我们脑子可以是 cloud 自己的 office 仓库 sonata, 也可以是你自己配的任何模型,比如 kimi 啥的。当然其他的模型它在训练过程中呢,可 不是按照这些兔子去训练的,所以说它实际的适配咱们也不好说,因为它闭源的吗?我们也不好说它是不是像格奥五一样去适配那么好,我是想表达模型在训练过程中 可能会把对这些工具的使用作为训练的一部分,那么如果说一些其他的大模型,他们不是可乐扣子加的话,他可能就没有经过这些训练,不知道可乐扣这些兔子是干嘛的,会造成一些效果上的损失,这个我不好说。 然后我们所有上下文打包好了模型之后,模型会去 thinking, 这个东西我们平常在时他们现在都已经见到过了, 他会去想正品是什么呢?他会去分析这个 memory 之前有没有做过类似的这个东西,之前是怎么做的,他会去看哪些工具要去调用。他想完这些事情之后呢?会在这个例子当中,他可能会去发出一条明确的指令,是 to 柚子, 比如说去 web search 一下,那就相当于有一个工具叫 web search, 就是 去网络上搜索,然后模型发出这样一条指令,说是我们现在要去进行一个工具的调用了,那这工具是 web search 模型思考之后发出了这样一条指令,然后这个指令由 colocole 这个软件去做,然后去 web search 去网上查到这个东西之后未回给 模型,模型理解完之后去生成,生成完之后他再让 colocole 保存到一个,比如说 report 报告这样一个里, 然后给我们去看,这就是整个过程。这个过程中格奥扣这个软件以及格奥他的模型, oppo、 彩酷搜内他们之间是怎么协同的,以及我们正常的一次请求进来之后到反馈结果都发生了什么,希望这条视频能够帮助大家去理解这些东西。我是小新,关注我带你进宝典。