玩 agent 一 年,我终于搞明白了三件事。事情是这样的,大概一年前,我第一次看到有人用 coco 自动写完一整个项目,全程没有人工干预,代码自己跑起来, bug 自己修,连测试都自己跑完了,我当时就愣住了。然后我花了大概三秒钟,就决定要把这玩意搞明白。这一年里,我踩了一堆坑,也摸清楚了一些规律。 今天想把我觉得最重要的三个底层概念,用最直白的话聊一遍。不是什么高深的东西,但如果你刚开始玩 agent, 或者玩了一段时间,但总觉得差点什么,我觉得这篇文章应该对你有用。 我自己也不确定讲的全不全,但我已经毫无保留了。先说背景,聊聊 ai 这一年到底发生了什么。说真的, ai 进化的速度比我预想的快太多了。两年前,大家用 ai 干的最多的事是帮我写一封邮件,帮我改改。这段话说到底还是一个很高级的文字工具,你问他,他打 你就这样。但大概从去年开始,有个东西悄悄变了,变的是 agent, 也就是我们说的智能体,普通的 ai 聊天工具。就像一个很聪明的顾问,你问他这个项目应该怎么做,他给你一份计划书,然后等你自己去执行, a 准不一样,他会直接帮你做。你说帮我把这份报告整理成 ppt, 他 不是给你一个步骤清单,而是真的一步步把 ppt 做出来,出了问题自己想办法解决,直到你看到成品。这个区别听着好像就是多干了一步,但实际上是质变。就像你雇了一个助手,之前那个助手很厉害, 但你每件事都得亲自交代清楚才行。现在这个助手,你只需要说我要开会,你帮我准备,他自己就知道要去查日程,约人、整理资料、发通知。 ai 从辅助工具变成了数字员工,真的不是夸张。那问题来了,这个数字员工要怎么用?用起来有什么坑?我的体感是,搞明白以下三件事,你基本上就能把 agent 玩明白了。第一件事, api 这块是绕不过去的, cloud code 是 目前我用过的 agent 工具里综合体验最好的,没有之一。它背后跑的是 antropica 自家最顶尖的模型, 能力非常强,用起来顺手,自主解决问题的能力也很稳定。但他有一个问题贵,如果你每天大量用,光模型的费用就能把你吓到。对于很多人,尤其是个人用户或者小团队来说,长期跑下来有点吃不消,所以就出现了一个很自然的需求。有没有便宜一点但效果也还不错的替代品?当然是有的,现在国产模型里有几个很能打,性价比极高,某些任务下效果跟顶尖模型差不多, 价格可能只有十分之一甚至更低。问题是怎么让 code code 这类工具去调用别家的模型,这就是 api 要解决的事。 api 这个词你可能听过,全称是 application programming interface 应用程序接口,听着很技术,但它做的事情其实很简单,就是两个系统之间的对话通道。打个比方, 你去餐厅,服务员是你和厨房之间的 api, 你 跟服务员说我要一份红烧肉,服务员把这个需求传给厨房,厨房做好了再通过服务员端给你。 你不需要知道厨房是怎么运作的,你只需要跟服务员对话就行。 ai 模型的 api 也是一样,它就是一个通道,让不同的应用和不同的模型之间可以互相讲话。 每家 ai 公司都会给自己的模型开放 api。 你 注册账号拿到 apikey, 可以 理解成一把专属的钥匙,然后在你用的工具里填进去,工具就能通过这个通道去调用对应的模型了。这个配置方法因工具不同会有一点差异,有的在设置面板里直接改,有的需要去编辑配置文件。对于刚入门的朋友,我推荐去 github 上找一些开源项目, 比如 c c switch, 它把主流模型都整合进去了,切换起来会方便很多。理解了 api, 你 就理解了为什么 agent 可以 不绑死在一个模型上。 工具是工具,模型是模型,中间的连接就靠 api 这个底层逻辑搞明白了之后,很多事情就想得通了。第二件事, m c p 协议这个词最近越来越常听到,但很多人还是一头雾水,我来帮你拆解一下。先说痛点,光有模型 agent 能干的事其实没那么多。举个最简单的例子,你让 agent 帮你调研一个话题, 他没办法直接联网搜索,也没办法打开你发给他的网址,更没办法看你桌面上那张图片。为啥?因为大模型本身就是一个文字处理器,它能处理你输入给他的文字,但他不能主动去外部世界取数据。 你如果懂一些技术,当然可以自己写代码,把网页内容抓下来,转成文字再喂给模型。但这对大多数人来说太麻烦了,而且每次都要重新搞 m c p 协议,就是为了解决这个问题存在的。 m c p 全称 model context protocol 模型上下文协议,它相当于 ai 界各家厂商共同商定的一套万能接口标准,有点像 usb 接口,不管你是什么品牌的手机,只要接口统一,充电器就都能用。 m c p 的 工作方式挺优雅的,分三步走。第一步, m c p 工具主动自我介绍。你想象一下,有一个 m c p 工具,专门负责联网搜索, 他一上线就主动给 agent 发了一份清单,上面写着,我能做这些事。联网搜索,抓取网页正文,返回结构化结果,这份清单 agent 就 记住了。第二步, agent 接到任务后,自动匹配工具,你让 agent 帮你搜索最新的 ai 创业公司融资情况。 agent 一 看,哦,这需要联网。然后他按照 m c b 协议统一的格式,把这个需求打包发给那个搜索工具。 第三步, m c p 工具去外部世界干活,然后翻译成模型能看懂的格式送回来。 m c p 工具跑出去真的在互联网上搜索,把找到的网页内容抓回来,把那些乱七八糟的 html 代码处理掉,整理成干净的结构化文本,直接送进 agent 的 对话上下文里, 整个过程你完全不需要操心。这玩意厉害的地方在于,它把 ai 能干的事的上限直接拉高了一个量级。联网搜索,读取网页、识别图片、操控浏览器、调用各种第三方服务。理论上只要有对应的 m c p 工具编辑的都能做。你去 github 搜 m c p, 能找到很多开源的工具,基本上常见的需求都有现成的,不需要自己从头开发, 我自己这一年用下来感受最深的一点是 m c p。 把 agent 从一个只能在信息里游泳的大脑,变成了一个能伸手去外部世界取物品再拿回来的身体,这个差别真的很大。第三件事, skill。 这个可能是三个里面最容易被忽视,但长期来看影响最大的一个。我来先说说我踩过的坑。刚开始玩 agent 的 时候,我每次用都要重新跟他解释一大堆背景信息, 比如我在做什么类型的内容,用什么风格写作,目标用户是谁,有哪些格式要求,每次都要写,有时候一段提示词就七八百字,打起来就很烦,更费时间。然后这些信息还要送进模型,每次都是一大块 token, 算下来成本不小。 后来我意识到这是个结构性问题,不是用法问题。如果你的某些任务是高频的,有固定流程的,每次都从头交 agent, 是 一件非常低效的事,不管是时间成本还是金钱成本,都在白白消耗。 skill 就是 解这道题的答案。简单来说, skill 是 针对某类高频任务预先写好的标准流程, 你把这个流程封装成一个固定的模块,每次处理同类任务的时候,直接调用这个模块就行,不需要重新解释,不需要重新写提示词。 举个具体的例子,你经常要把客户的原始需求整理成项目。 brief, 这个流程其实是固定的,需要提取哪些信息,用什么格式输出哪些细节,必须确认。这套流程只需要写一次,封装成 skill 之后,每次直接调用 agent 就 知道该怎么干了。 skill 的 价值有两层,一层是效率,不用每次写签字提示词,任务可以快速启动。另一层是成本,塞进模型的 token 少了,账单能差出一截。 这玩意玩熟了之后,有点像给 agent 装了一套专属的肌肉记忆。你的 agent 不 再是一个什么都知道但什么都要你现场教的通才,而是在你的核心工作场景上极度熟练的专家。回到最开始的那个问题, ai 成了数字员工之后,我们怎么用好它?我现在的答案是, api 解决了接入谁的问题, mcp 解决了能干什么的问题, skill 解决了干的好不好,值不值的问题。这三件事不是互相独立的,他们其实是同一套系统的三个层次,底层是接入,中间是能力,上层是效率。三层都想清楚了,你的 a 卷才能真正跑起来,不只是能用,而是好用,而且越用越顺手。我花了一年才把这个弄明白。说实话,走了挺多弯路的,现在分享出来, 希望你能少踩一点坑,永远对世界保持好奇。以上,既然看到这里了,如果觉得不错,随手点个赞吧。谢谢你,看到这里,我们下次再见。
粉丝2480获赞1.6万

什么是 agent? 什么是 m c p, 什么是 skill? 还有再再说说什么是 open club, 把这个东西讲完,大家应该就能对这个知识点有一个更深的了解了。首先第一个 什么是大模型,咱们得先说大模型,它就是一个可以对话的一个大脑,你跟他说话,他就能回复消息。但是有一个问题,他没有记忆,你跟大模型说一句话,你说你好,再跟他说我是谁,他不知道, 但也就是大漠星,他没有记忆,你说一个消息,他其实底层是一个 transom 架构,他经过神经网络一层一层的去计算,最终通过概率给你算出来他要回复什么东西,所以说他那个东西是有幻觉的,通过概率给你算出来一个东西给你回复了,你说我是小周,你再问我是谁,他不知道,你这 ai 没有记忆可不行了。 所以说大家为了让 ai 有 记忆可以聊天,大家就制造了一个聊天机器人,就叫 bot, 那 这个 bot 能干什么呢?就是我跟他说,我说我是小周, bot 接到我是小周,然后他会跟大模型去交流,他作为一个中间人跟大模型交流, 然后他告诉大模型这个人叫小周,然后我再说我是谁,我跟那个 bot 说我是谁的时候,这个 bot 他 会把我是小周,然后大模型的回复,然后这我是谁一起发给 大模型,也就说大模型拿到不是我是谁,而是之前的所有聊天记录,大模型都看到了,然后他再回,那这个聊天机器人他的作用呢?就是让这个大模型看上去有记忆了,这是聊天机器人,那聊天机器人的功能还是很弱,对吧?就比如说我想让他帮我关电脑, 帮我执行一段程序,帮我查询今天的天气,它也不行。所以说这个时候就聊天机器人的基础上,又扩展出了一个东西,叫 agent, 叫智能体。智能体可以干什么呢?智能体,大家记住啊,智,一句话就知道智能体可以调用工具,这东西就是智能体。 那什么是工具呢?就比如说这里有一个函数,有一行代码,这行代码可以 get weather, 可以 获取天气信息,获取获取日历信息。今天是几号?这个大模型是不知道的,大模型他知道的东西就是基于他训练的结果。 我二零二五年五月一号训练,这个大模型结束。那大模型二零二五年五月一号之前的东西,他训练过的,知道五月一号之后的事,他啥也不知道,他没训练,所以你问他,你说今天天气怎么样?他不知道今天是几号,大模型他不知道,但是 agent 他 知道。 a 针呢?可以调一个工具 get 外的,我获取到今天的天气,然后我再告诉大模型,大模型再分析,然后再给我回复,也就说这个 a 针呢?是什么呢? a 针它是可以调用工具的一个程序,它可以通过调用工具让大模型知道更多的事,这个就是 a 针的。 然后大家发现 a 针不知道天气,我得怎么办呢?我得调用一些接口,比如说高德有天气信息的接口, 我得调这个接口啊,然后还有什么饭店的接口,旅游景区的接口,什么时候卖票的接口,他得调很多接口。那这个这样的话, 所有的互联网服务平台,比如说天气的呀,景区的呀,卖票的呀,全得开放接口,然后这个 a 证他得调所有接口才能实现这个功能,那 a 证他也麻烦,那个第三方平台,那个天气的第三方平台也麻烦,然后这个接口怎么调参数都很麻烦。其中有一个执行方案,就是说我定义一个协议, 就说你这个 agent 调这个第三方平台的接口数据的时候,你别像以前那么调接口,你你咱谈个协议,你只要两边都遵守这个协议,我就可以去拿你的数据了,我就可以拿天气数据,拿时间数据,拿各种景区的数据都能拿了。 那这个协议叫什么的呢?就叫模型上下文协议,所以这个协议就叫 mcp, 所以 大家知道什么是 mcp 了吧?它就是协议,对吧?我调接口为了更方便的调接口,开发了一个协议,叫 mcp, 所以 大家知道什么是 mcp 了? mcp 就是 让 agent 可以 更方便的调用工具, 简单吗? mcp 就是 为了让 agent 调用工具,然后把调用工具的信息给大模型,让大模型可以回复,懂了吧?这是 mcp。 什么叫 skill 呢? 没点关注,点个关注,我讲的很细,跟大家说没点关注,点个关注。然后我这边有个 ai 学习专栏,大家可以加一下,我这边还有 ai 交流群,感兴趣的小伙伴可以加一下。然后我接着说什么是 skill? skill 最早就是咱先说这个调用工具, 等于说调用工具有什么弊端吧,如果你想让这个 agent 调用工具的话,你得先把这个工具的所有的说明书什么的参数配置全都给这个 agent 告诉他,然后他比如说你跟他说我,我,我跟那个 agent 说,我说你好,他收到的就是你好吗?不是 他,除了这他,他给这个大媒体人发的,除了这个你好,他还会把我这个 a 帧呢,可以调什么工具,什么乱七八糟的呀,这各种各种这个工具的参数啊,这些信息全都给大媒体人发过去,这就很麻烦, 东西很多,所以呢,为了让这个提升这个性能吧,当然也不只是为了提升这个性能,咱就说性能,为了提升这个性能吧, hlp 公司就发布了一个叫 a n 的 skill 的 东西, a n 的 skill 的 话,他可以定义一个工作流,定一个文档,一个 markdown 文件, 然后这样的话它只要在文件上面写一个原数据,写两行,对吧?当用户在干什么的时候调用这个 skill, 那 下面细节就不用不用给大模型了, 那这样我一个 a 针呢,就可以接很多的 skill, 我 只要看它那个原数据,它能干啥,我需要的时候我再调它里面的东西,这样呢性能就能得到一定的提升。而且用这个 skill 的 时候会大家发现更好的一点,就是 skill 可以 写很多很多东西, 比如说你想做一个知识库,你可以放在 skill 里面,你可以有定一个工作流,你可以放在 skill 里面,很多事都可以放在 skill 里面,这样 skill 就 火出圈了。 也就说 skill 它是一套文档,文档规定了这个事怎么干,然后大模型就会按照这个流程去干事,做事就就就完事了。 所以刚才说的 m c p 是 什么?是调用工具更方便,工具是什么呢?就是查询天气这些工具。然后呢? skill 呢? skill 是 可以让规定 你做这件事,调用哪些工具,执行哪些标准,它是做了一个更更广的一个规范,也就说一个 skill 可以 调很多 m c p 可以 调很多的工具,这是 skill 的 作用, 也就是说大家会发现 skill 能力强了,是吧? skill 可以 作为文档,它可以做知识库。 skill 可以 定义工作流,它可以做很多事, skill 可以 调很多的工具, skill 也可以调 m c p, 这是 skill 的 能力。 然后大家就会发现,那 sku 是 不是太强大了呀?对吧?它是不是可以操作浏览器啊,可以写代码啊,做简历啊,所有的工作流,甚至取代什么扣子,以前那种传统的工作人形式全都取代了,那所以这 sku 实在是太好用了吧? 确实好用,确实好用,它太好用了。然后呢,就出现了很多的工具全都接入了这个 skill, 包括浏览器, tree products, 所有的 ai 工具, ai 开发工具都接入了这个 skill, 就 大家都能用 skill 了。然后又出现了一个东西也接入了这个 skill, 就是 open claw, 也就是说因为 skill 可以 做很多事, open claw 它不需要做这些事, open claw 只需要可以调 skill, 它就可以做所有 skill 的 事。也就是 open klo 是 什么呢?它就是一个智能体,智能体的能力不依赖于它智能体本身,而依赖于它接入了哪些 skill。 这也就是说,为什么大家用 不用担心 open klo 以后能力会不会变强变弱什么的,你不需要关注它有什么能力, open klo 也没什么能力,它的能力全部一托于 skill 生态。 所以有个网站叫 cloud 号吧,里面有很多 skill 嘛。大家如果想扩展自己 opencloud 的 能力的话,你就直接下载 skill 就 ok 了,你就可以让你的 opencloud 去做各种各样的事了。因为 skill 可以 做,所以 opencloud 就 可以做, 这就是大模型 agent skill mcp 和 opencloud 的 关系。我不知道我讲的透不透彻。讲的透彻,点个赞支持一下。

操作系统级 ai 助手终于来了,它就是 marvis, 一个更懂你的 ai 助手。今天这期视频就带大家一起实测一下 marvis 究竟好不好用。首先需要来到官网,按照流程指引将 marvis 装进你的电脑。完成后第一步,先登录自己的账号, 当前是支持微信以 qq 两种登录方式。上来以后,我们先来询问一下他会做些什么?可以看到本地电脑的文件整理,系统的一些基础操作,包括应用的安装和卸载通通都可以实现。 我们先给他下达一个卸载指令,看看他能不能去执行这个操作。首先他会判断这是一个什么类型的操作,然后再去派发给对应的 a 证,同时也可以在旁边的办公室去观察当前 a 证的执行状况,在执行操作前也会进行二次确认是否需要卸载当前应用。 ok, 可以 看到已完成卸载操作。那如果我们让他自己再安装一个最新版的应用,能不能安装?答案是,当然可以。 这里他会询问是需要安装 windows 版本还是手机 app 版本,如果和手机 marvis 已经连接,也可以选择手机版, 安装完成后就可以正常登录。我们再来让他帮忙检查一下电脑 c 盘的文件占用情况,可以看到他依然会先判断这是一个什么操作类型,再去将执行任务派发给对应的 agent, 最终输出执行结果。除此之外呢, 还可以在 mars 里面看到我们电脑本地的应用以及文档、图片文件,授权读取本地文件以后就可以进行体验。不愧是操作系统级 ai 助手,谁能拒绝这么能干的呢?

什么是 intent? 什么是 m c p? 什么又是 skill? 还有再说说什么是 open close? 把这些东西全部讲完,大家应该就能对 ai 知识点有了更深的了解。首先,我们说大模型,它就像一个只会对话的大脑,你问它就答, 但天生呢,没有记忆,而且内容是概率生成的,很容易出现幻觉,事后你再问之前的信息,它完全不记得了。 为了解决没有记忆的问题,我们做出了聊天机器人 bot, 他 充当中间人的角色,保存所有聊天记录,然后再传给大模型,让大模型看起来拥有了上下文的记忆。 可 bot 呢?依旧局限,没法查天气控制设备运行程序,于是就有 nint 的 智能体。记住一句话, nint 的 核心就是能够调用外部工具, 大模型只知道训练截止目前的信息、实时天气日期、网络数据完全不懂。而 agent 呢,可以主动地调用天气接口、各类工具,获取实时数据,然后再传给大模型整理回答。 但一个个对接第三方接口,调试参数特别麻烦。行业就统一了一套通用的规则协议,就是 m c p 模型生产文协议。简单来说, m c p 就是 规范,让 agent 更简单统一的调用各类工具与接口。接着是 skill 技能, 之前 n 的 调用工具,要把所有的参数、详细规则全部发给大模型,信息复杂,效率很低。 sku 呢?用文档规范好固定的工作流程,出发条件, 只传给大模型精简的原数据,不用传出大量细节。 sku 可以 对接多个 mcp 工具,既能存知识库,再定义工作流,还能批量调用,更乐意能力大幅提升 ai 执行效率。 最后是 open klo, 它本身没有很强的原生能力,本质上也是一个智能体,所有的功能全部依附于 skill 生态平台,有海量的现成的 skill, 只要下载接入 open klo, 就 能拥有相对应的全部能力。总结下逻辑, 大模型是对话大脑, bot 是 让 ai 拥有记忆。 enter 学会调用工具 i m c p, 简化工具,调用协议 skill 能规范流程,拓展全部能力。 open klo 是 一托所有的 skill, 实现无限功能。 这就是大模型 agent skill m c p 和 open code 之间的关系。觉得六哥讲得透彻的点个赞支持一下。

最近特别火的 agent、 mcp、 skill、 open claw、 rag 大 模型到底是啥意思?今天一次性讲明白。先给大家举个例子,你把自己想象成一个老板,想搞一家完全不用人动手的全自动化的公司,这个时候你是不是需要一个全能的执行者?他不只是动动脑子,他还能统筹安排落地执行。 这里先澄清一个关键,真正管事的做决策的,那背后的核心,他是大模型,相当于我们人的大脑。咱们说的 agent, 也就是智能体,就是这个大脑的执行者的化身,他能听懂你想干啥,把你交代的环拆成一个一个的小任务,定好详细的执行步骤, 再指挥后续动作的落地。当然,他一定会借助各种各样的工具,相当于带着大脑的指令干活的统治者。准确的说,大模型是核心的大脑, agent, 他 是大脑的执行主体,是能自主决策、调度任务的智能执行者。那 skill 又是什么呢? 其实就是这个 agent 就是 执行者,他手里的硬本事是他自带的一些本地知识,标准化的能力能让他把活干的更漂亮。不只是凑合着完成 agent, 他 具有的硬本事可真不少哦。 比如说怎么写周报,怎么整理电脑里的文件,怎么打开浏览器查东西,怎么发邮件,怎么做内容的生成和发布,他可以写前后端的代码, 这些相对比较固定的流程,不用我们反复琢磨的一些标准化的动作和常规工作,每一个都可以是一个 skill。 简单说, skill 就是 agent 的 基本功,是它能落地执行任务的基础。接下来是 m c p, 它的全称 model context protocol 模型上下文协议。咱们还是举个例子,在没有 m c p 之前,你想让 ai 帮你干活。比如说你让 ai 查你的非书表格,非书文档,你要专门写一套代码去适配非书。你要让 ai 读你百度网盘里的文件,你要重新写一套去适配百度网盘。 你想用 ai 去高德地图查路线,或者给你的微信发消息,你每一个都得单独写一套代码。想让 ai 在 淘宝、京东给你下个单写套代码适配电商。所以你看,每连一个工具都要重新开发,重新适配, 正在重复的造轮子。现在有了 m c p 统一标准的协议了,它就像 ai 界的通用 usb 数据线,什么飞书、百度网盘、高德、微信、支付宝、京东,全按 m c p 的 标准插上去就行。那 ai 不 用学每一家的方言,一套标准接口适配所有的工具,不用写任何额外的适配代码了, 就实现了一次适配,多平台通用。在这里就是万物互联。那 red 又是什么呢?他翻译过来是解锁增强生成,其实核心就是让 ai 具备查资料的能力。 你像我们传统的 ai, 当生成内容的时候,可能会因为知识的不足,他就胡编乱造,产生幻觉。 red, 他 会先通过互联网,然后我们自有的知识库进行信息的查询,然后基于这些已有的内容再重新生成,那提供的信息他一定是更可靠的。 最 lag 的 本质是什么呢?为 ai 增加了搜索引擎的功能,类似于我们写论文,你先去图书馆查资料。最后我们说 openclot, 它到底是个啥?如果说大魔行驶大脑 agent 是 统筹的执行者,那 openclot 就是 承载这两者的一个躯体, 它是一个开源的、可以自己托管的 ai agent 网关。简单点说,你可以把它下载下来,安装在我们自己的电脑或者是服务器上,它就是一个能让 ai 跑起来的运行环境。 open code 里边已经自带了 agent 的 核心执行逻辑,它能通过我们刚才说的这个 mcp 协议 去调用各种现成的 skill。 而它所有的核心决策,比如说我怎么拆分任务啊?我先执行哪个呀?遇到错误之后怎么换其他方法呀?它其实背后都是靠接入的大模型,但可以再通俗一点, open color 就 像一个开箱即用的数字员工套装,哪怕你不是技术大神,你只要简单设置一下,说出你的最终目标,就能把 大模型 agent、 mcp、 skill、 rank 等等整合起来,拥有一个能够自动帮你干活的 ai 助手,你不用自己写代码搞开发。最后总结一下,大模型是核心的大脑,负责思考、做决策 agent, 它是统筹的执行者,像一个核心高管, 承载大脑的指令,拆分任务、定步骤、指挥执行 skill。 agent 的 基本功内置了标准化动作帮, 让你把具体的活给干了。 m c p 通用接口相当于通用的 usb 数据线,帮着 ai 去连接各种外部工具,不需要重复适配。 open call 躯体加运行环境,把大脑执行者、基本功、通用接口都整合到一起,让咱们普通人能轻松用上。

大家好,我是你们的老朋友汤姆。最近公司掀起了一股龙虾热,身边慢慢有越来越多的同事开始用腾讯的 workbody 小 龙虾协助办公了,但是问题也随之而来,软件装上了群里聊起来全都是 agent、 clio、 skills、 mcp 这些词, 很多小伙伴听完啊一头雾水,感觉自己像一个局外人,但是不要慌,今天我会花两分钟的时间,用最通俗的方式,一次性给你讲明白这五个词到底是什么意思。那么我们先来讲第一个词, 就是智能体 a 键。我们先说 a 键啊,中文名就叫智能体。那么用一句话说呢,他不是一个只是陪你聊天的一个机器人,而是一个能替你干活的一个人。 以前的 ai 啊,你问他一句,他答一句,就像客服一样,那么智能体就不一样,你跟他说,帮我把桌面上所有的发票整理成一个报销表,他会自己先找到发票,再提取金额日期,最后生成一张 excel 表。那么整个过程呢,你是不需要参与, 他会自己规划,自己执行,最后把结果交给你的,就像你给同事派活一样,只需要输入指令就行。 那么我们来讲第二个词,就叫 c l i。 c l i 全名也叫命令行界面,这听起来是不是非常的技术,其实呢,你可以把它理解成你和电脑之间最原始的对话方式。那么平时我们点鼠标划屏幕,这叫一个图形界面, 而 c l i 呢,就是你直接打字,告诉电脑要干什么,比如输入,打开某个文件夹,它没有图标,没有按钮,就一个黑底白字的一个窗口,但它比鼠标运行的要快得多得多。 那么 workbody 小 龙虾呢,内部就是通过 c l i 来驱动电脑执行任务的,只不过这层东西呢,你是不用碰的, workbody 会自己帮您包好, ok。 那 么第三个呢,就是 claw 这个词,那么 claw 本意就是爪子和钳子,这里就特指的是 workbody 的 一个远程的一个控制功能。那么这是什么意思呢?就是你假如人在外面,不在工位上面,你只用掏出手机发条消息, 然后家里的电脑啊或者办公室的电脑就会自动帮你干活。比如你通勤的路上,突然领导要一份文件,你掏出手机在企业微信上发一句,帮我把地盘的项目周表转成 pdf 发给我。 work buddy 呢,就自动能在电脑上跑完所有的一个操作,然后把成品回传到你的手机上面, 那么手机变遥控器,电脑再加自动跑 cloud, 就是 这层的一个遥控的一个能力。那么第四个呢,就是 skills, skills 也就是我们所说的一个技能包啊,就是你可以把 workbody 理解成一部手机, skills 就是 你手机里面的 app 了。 那么 workbody 出厂时呢,它会自带的一些基础功能,但是如果说你想让它会做 ppt 封面,会生成海报,会把 pdf 转成 word, 那那么这些额外能力呢,就是要靠安装 skills 来进行实现的,而且不需要你会编程,你只需要看到对自己合适的一个技能包啊,点一下它就会一键自动安装了,那么 workbody 呢,就立刻多了一项新的本领。 目前呢,官方和社区啊,已经有了好几十个技能包啊,覆盖了日常的办公等等绝大多数的一个场景。那么第五个词呢,就是 m c p, m c p 全称就叫 model contacts protocol, 名字非常的绕啊,但是理解就非常的简单,你就把它想象成 ai 世界里面的, 呃, usb c 接口,以前手机充电口啊,电脑接口啊,显示器接口啊都不是一样的,现在 usb c 接口啊,一个口就可以全部搞定了。那么 m c p 呢,就是 ai 的 一个 usb c 接口,也就是说一个标准协议, 它可以让 workbody 能跟你们公司的 crm 数据库、飞书、钉钉等各种系统直接进行一个对话,比如说你想把 crm 里面的客户数据拉出来, 结合数据库里的销售金额生成报告发到飞书。那么以前这条指令是没有办法执行的,因为 workbody 听不懂这些系统的话,但是有了 mcp 这个插件的话,它就像掌握了多门的一个语言啊,能够直接跟这些系统进行一个对接,一条指令就可以跑通全流程。 那么 mcp 可以 让 workbody 从一个封闭的桌面工具,变成能够跟公司所有的数字系统无缝衔接的一个超级连接器。 那么我们讲到最后,我们来复习一遍啊,那么 a 卷智能体呢?这个东西呢,就是能够替你干活的 ai 同事。 c l i 呢,就是电脑底层的文字对话方式,你这个就不用管了啊, curl 就是 手机遥控电脑去干活, skills 就是 技能包,就像手机里的 app 一 样,随时安装一个新的能力。 m c p 就是 连接外部系统的一个万能插头。那么这五个词搞明白了,你就能跟身边的技术同事无障碍交流 work buddy 了。 那么如果你觉得这期视频有用的话,转发给你身边同样被这些术语搞蒙的一个同事,我们下期再见。

大家好,我是麦冬。今天我们来聊一个很多人问过的问题, promise 能不能对接 obsidian? 答案是可以的,而且配置非常简单。在正式开始之前,我们先简单介绍一下 obsidian。 obsidian 是 一个本地流行的 markdown 笔记软件, 所有笔记都是以 dmd 文件的形式存在你的电脑上,不依赖云端。它最大的特点呢是双向链接,你可以把笔记之间相互关联起来,形成自己的知识网络。很多人用它来做读书笔记、项目管理以及个人的知识库。 因为数据全在本地,所以天然适合跟 harmless 这种本地 a 境的进行对接。并且呢, harmless 安装好了之后,自带了 obsidian 的 skill, 你 不需要装任何 obsidian 的 插件,你只需要告诉 harmless 你 的 void 在 哪,它就能直接读写你的笔记,读笔记,搜笔记,建笔记,改笔记,它全部都能做。 那么具体怎么配呢?首先第一步,你需要找到你的 obsidian void 的 路径, void 就是 obsidian 里面笔记库的意思, 其实它就是你电脑上的一个文件夹,所有笔记都存在里面。在你第一次安装 obsidian 的 时候,它会让你配置这么一个文件夹作为它的笔记库。如果你不确定你的 word 在 哪也没关系,我们打开 obsidian, 将鼠标移动到左下角,稍等片刻,它就会悬浮显示出你当前的笔记库路径。比如我的就是在 d 盘下的 obsidian 文件夹。好,下面我们打开 hermes, 给大家演示一下如何让 hermes 连接上你本地的 obsidian。 我们打开 harmony 的 聊天界面,只需要跟他说一句话,帮我把 opposite void pass 设置成杠 m n t 杠 d 杠 abc, 写到你的点音频文件里面。这边有一点需要注意,因为今天演示是以 windows 电脑为例给大家做讲解的。 windows 电脑上有一点需要注意一下,大多数情况下,我们的 harmony 是 跑在 w s l 里面的,它是没有办法直接识别 windows 的 路径的,所以我们需要将 windows 的 路径转换成 w s l 的 格式, 就是把盘符改成斜杠 m n t 斜杠盘符的小写,比如说我的地盘 obsidian, 对 应过来就是斜杠 m n t 斜杠 d, 再斜杠 obsidian, 好, 直接按下回车, hermes 会自动打开它的环境变量文件,并且把这行配置加进去,你不需要自己去找文件,手动编辑让它自己去搞定就可以了。配置完成之后, ctrl 加 c, 关闭当前绘画,然后重新运行。 hermes 打开一个新绘画就可以测试了。 我们先来试一下,我们跟 hermes 说帮我搜一下 word 里面关于 document 的 笔记, 可以看到它直接列出了所有包含 docker 关键词的笔记、文件名和匹配内容。这个搜索是基于文件内容的权威搜索,并不仅仅是文件名,所以搜索还是相对比较准确的。下面我们再试一个帮我写一篇 docker fire 编辑指南的笔记,存到 void 里面 好了, hermes 跟我们说已经写好了,下面我们打开 ocd 看一下, 可以看到这边已经多了一篇 docker fire 编辑指南,并且 hermes 自动帮我们将它跟之前的两篇笔记关联到了一起,点开关系图谱也可以看到。 好了,今天的演示到这边就要结束了,最后还有一个小 tips 要提醒一下大家, hermes 操作 obsidian, 它是不需要 obsidian 本身在运行的,因为它是直接读写文件系统的,跟 obsidian 的 app 是 没有关系的,所以你关注 obsidian 也完全没有任何问题。 大家平时都在用什么工具管理自己的知识体系呢?欢迎在评论区聊聊。工具会变,但方法更重要。我是麦冬,下期继续。

最近我在招聘 hr 工程师,面了不少来自腾讯字节这些大厂的后人。我发现一个很有意思的现象,很多人简历上都写着自己做过 agent。 但我深入一问,发现他们做的其实不是复杂的 agent, 而是 l l m 应用。 比如什么意图识别问题分流知识互问答、单轮工具调用这些当然也有价值,但是它们和真正的 agent 工程中间,其实差了一大截。为什么呢?因为 l l m 应用本质上是你问一句模型答一句,但 agent 不是 回答问题, agent 是 帮你完成任务。 真正的 agent, 一定不是简单掉一次大模型接口,它要有任务拆解,要有 agent loop, 要能够调用工具,要能够根据执行结果继续调整,还得有状态管理、错误恢复验证机制,甚至还得有人工介入和评测体系。 所以我面试的时候啊,经常会追问几个问题,你的 agent 有 没有 loop? 有 没有工具调用?有没有 trace? 任务失败了怎么恢复?任务做到一半状态怎么保存?怎么判断它是真的完成了任务? 很多候选人呢,一听到这些问题啊,就答不上来,这说明什么呢?说明现在很多大厂的业务啊,其实还停留在 l l m 应用阶段, 不是大厂候选人的能力不行,而是他们没有真实复杂 agent 的 项目环境。所以,现在看 agent 工程师啊,不能只看大厂背景,也不能只看简历上有没有写 agent, 真正要看的是他有没有 agent 工程思维。什么叫 agent 工程思维呢?一句话, 它不是把大模型啊,当成一个接口来调用,而是把大模型当成一个可以调用工具,会执行任务,能持续迭代的工程系统来设计,这个才是 agent 工程师和普通 l l m 应用工程师的一个最大区别。 所以我想给转 agent 工程师的朋友啊一个建议,不要只做聊天的机器人知识库问答这种 demo, 你 至少要自己做一个小型的 agent harness, 里面要有任务循环工具调用上下文管理 状态记录,执行日制失败,从事和结果的评测。哪怕这个项目不大呀,只要你能把它讲清楚,就比很多简历上写着大厂 agent 的 项目的人呢更有竞争力。因为未来真正稀缺的不是会调模型接口的人,而是能够把 agent 做成稳定工程系统的人。

agent 早就不陌生了,不过它的下个形态是什么呢?单纯从名字上看,其实我们人文划分了这么三个阶段,第一阶段就是自 menace 开始,往后的 cloud code codex 以及国内的 workbody tree 等等,都可以称为纯 agent 的 形态。 后来呢, open claw 小 龙虾开始兴起,掀起了一股龙虾热,各种 claw 产品层出不穷,可以成为给 agent 套了一层漂亮外衣的 claw 时代。 但 cloud 类型的产品,我觉得吧,始终有个问题就是它的主角是 agent, 所有的包装都是为了让这个 agent 的 更好用,而不是设置一个全新的形态,让 agent 仅仅是底层的辅助,而不是主角。就 像 windows 刚刚出现的时候,它不是让命令行更好用,而是重新用一个新的视角来定义人和机器的交互关系,还是有本质的区别的。当然,有这种彻底的革新可能还十分遥远,不过我最近看到了一款产品,体现了这一趋势。腾讯的 mars 打开它之后,除了常用的 a 阵对话、定时任务、技能广场外,还有个变化还是挺有特色的,就是本地知识库。 在这里呢,你可以看到所有的应用软件可以打开卸载查看。 windows 上有这个视图还是挺实用的,也可以浏览自己的电脑常用的,对文件的操作都支持,不用再切出这个应用了。 由于呢还建立了缩影,所以这里的搜索速度也会非常快。并且它还专门建立了文档和图库两个专门的 type, 在获得你的授权后,就可以为这些文件建立羽翼级别的缩影,融合进 ai 羽翼搜索的范畴。虽然现在的功能还不算多,但这让我第一次感受到,这款产品就不再是以 agent 为核心,而是以人操作电脑的习惯为核心,这个感觉呢,就有点那味了。 接下来我说几个我日常的场景。我平时创作的时候,有非常多的文档,比如说我的每期视频、素材、图片、论文、 pdf 等等。 有的时候我想找一个东西,总是想不起来它在哪一期了,这时候就可以用到刚刚说的 marvis 知识库,比如这里可以看到所有散落在各处的论文,这里有所有图片,用大模型理解分类的整理结果,还可以直接用自然语言描述的方法来搜图,比如说我搜 transformer, 哎,你看一下就定位到了 transformer 这张架构图, 而图片的名字中是不包含 transformer 这个信息的。我也可以直接在聊天框中让它根据电脑中的文档做上下文信息,整个电脑就是个大知识库。 比如说有个有趣的实验,就让它根据我的电脑判断一下我是什么样的人,大家也可以试一试。由于这是我和我对象共用的电脑,这就不全展示了,普通的 agent 任务当然也不在话下。 比如说 windows, 我 好多年没有用了,但是我最近有个切实的需求,就是日常仍然用 mac 电脑,然后有些需要四零九零的任务,就想交给我的 windows 去运行。 这个时候我就可以让 marvis 帮我给 windows 开启 s s h。 那 如果我自己操作的话,可能要敲各种命令,设密码、防火墙啊等等,我连 windows 命令好像都快忘了咋开了,这呢就会很头大,而 marvis 就 可以直接帮我搞定。 开好之后呢,我在 mac 电脑上就可以直接用 vs code 的 远程 ssh 下,就很方便了。比如说我跑一下卡帕西大神的这个迷你 gbt 二的训练代码,分别用 gpu、 cpu 以及 mac 的 mps 三种设备来运行。哎,这样对比起来是不是就非常明显了? 还有个平时的痛点就是,其实很多电脑上的小任务根本就不需要云端大模型的算力,本地小模型就足够了。在之前可能需要欧拉玛或者 lm state 跑个本地模型,然后用 cloud code 改个配置,连上去还是挺有门槛的。 那 marvis 这回直接内置了这个能力,直接在这里就可以切换成隐私模式,他呢,会下载一个本地模型,并自动运行好,那接下来的所有任务就可以全都本地化了。当然,这里的效率模式也是端云协调的模式,它会自动判断什么任务用云端算力,什么时候用本地算力,非常贴心。 那在处理任务的时候, marvis 还有个工作室画面,一堆分工不同的牛马员工马不停蹄的服务,还是挺搞笑的。 你可以看到, mars 内置了功能,不同的 agent 来协同完成任务。总之,这种以人的视角为主题,以系统级的 agent 的 助手为目标的产品, 不同于往日在 agent 的 上面单纯套壳套功能。呃,等未来有越来越多的系统级的能力被打通,被 api 被 c r i 化,变得更让 agent 一 读之后,这种产品形态就会变得越来越好用, 说不定到后面你就会感知不到它的存在。那这就彻底和系统融为一体了啊。当然,从目前的功能来看,有些地方还是比较割裂的,比如说上面的 ai 对 话和这个知识库里的内容其实并没有完美的融为一体,但是我觉得这个方向是正确的,非常期待 marvis 再接下来的版本迭代吧。

collab code 它是可以接入 deepsea 的, 因为我有 collab pro 的 订阅,所以我没有接。除了 collab code 以外,包括什么龙虾呀?还有包括什么 hermes 啊,都是垃圾,强烈呼吁大家不要用。我们现在来讲一下为什么有三个维度是非常重要的。第一个维度就是 工具,你手里有一个写 ppt 的 a 帧呢, a 帧呢,有能力去使用 ppt 这个软件去帮你写。那第二个呢?就是,嗯,我们叫它这个这个循环吧,循环机制就是 a 帧呢,与这个我们普通的大模型最不同的一点就是它能够调用工具,所以带来的一个好处就是它第一步要响 想完之后他能做,因为他能调用工具,所以他做完之后他是有一个验证环节的,他是能回去验证的。第三个呢,我认为就是这个记忆,就是我们一直在说的这些养龙虾,所谓养就是在培养他的记忆,其实问题就出现在这个这记忆这块,记忆这块目前是 是明显的一个短板,也是 a 阵的最大的问题,就比如咱们日常用的这个这种 deepsea, 对 于 deepsea 来说啊,就是因为他本身是一个 chatbot, 他 是一个就是问答的机器人,所以你说一句他回一句,你说一句 也他回一句,他是怎么处理记忆的呢?无非就是把这个,把这些上下文都记住。但是我们转到这个 a 阵他来说,比如我们拿这个 open open klo 举例,也就是龙虾,你问一句他,他要先想,想完之后他要做 专周,他要验证,验证之后他还要反推,然后最后,最后,最后这些东西就是由于这个循环机制导致的,所以就导致他的上下温会非常长,他有点像一个吃播一样,就是每天都在吃东西,每天都在吃东西,最终有一天会把自己吃死,就是梁子一样,未来越来越大。梁子现在 虽然火着呢,但也快了, a 阵他呢,虽然现在很火,但是其实他也是一个比较初级的,他早晚有一天会接单升级,所以目前来说学这些 a 阵,他呀,养龙虾呀,没有任何的意义。

大家好,我是分享,最近很多人问我, m c p 是 什么? skill 是 什么? a 技能又是什么?那说实话啊,这些概念啊,听起来很专业,但其实用大白话也能讲明白。 今天我就从大模型开始,一层层的给大家分享清楚。第一个大模型是什么?其实你可以把大模型理解成一个超级大脑,那这个大脑他读过全世界的书, 看过全网的文章,那记住了非常多的海量的知识。你问他问题呢?他能回答,那让他写代码呢?他也能写,但是呢, 要注意啊,他只是一个大脑,他没有手,没有脚,他不能帮你干活。那第二个聊天机器人是什么呢?那聊天机器人就是给我们的大模型套上了一个聊天的界面,你在 呃这个对话框里输入问题啊,他在对话框里给你回复问题,像我们现在熟悉的切切特、 gpt、 豆包这些啊,他们都是聊天机器人。但是 问题来了啊,他还是只能聊天,不能帮你干活。那比方说你让这个,你让聊天机器人帮你发邮件,那他只能告诉你怎么样发邮件,但是他发不了邮件, 对不对?那为什么呢?因为他没有工具,没有权限,他只能动嘴。第三个 skill, 什么是 skill 呢? skill 就是 给大模型装技能,比方说你给他装了一个发邮件的 skill, 它就真的可以帮你发邮件了。那如果你装一个查询数据库的 skill, 那 它真的可以帮你去查询数据了。 那 skill 就 像给大脑装了一双手,让它不光能说,还能干。 m c p 是 什么呢? m c p 是 模型上下文协议,听起来可能很专业是吧?其实它就是一个协议接口啊,什么意思呢?就是你让 ai 操作你的数据库,数据库的 skill, 那你让 ai 操作你的文件,文件抓取的 skill, 如果想让 ai 帮你发邮件,你得给它装一个发邮件的 skill。 问题来了啊,就是每一个工具都要单独装一个 skill, 太麻烦了。 那 mcp 就是 解决这个麻烦问题的 mcp, 它定义了一套标准,让 ai 可以 直接连各种工具和服务。那比如我们刚才所提到的数据库文件 啊,邮件,那这些啊,只要支持 m c p 协议,那 ai 都可以直接调用的, 我们可以把 m c p 理解成一个啊,万能的插座,那以前啊,这个工具都需要单独连线啊,现在只需要就是把所有的工具插到这个万能的插座上, ai 就 可以直接用了。 那第五个啊, a 进它, a 进它是什么呢?其实 a 进它大家都比较熟悉哈, a 进它就是智能体 啊,就是能自己干活的 ai。 我 们前面提到的这个 skill 和 mcp, 它们都是给 ai 装工具,但装了工具以后,你还得告诉它怎么用,对不对?那 a 进它就不一样了,它能自己规划,自己执行,自己纠错,那 你给他一个目标,他就可以自己拆解成任务,那自己调用工具,自己完成。那比如你现在告诉 agent 智能题啊,你帮我做一个项目管理系统, 那他就会自己做需求分析,自己做技术选型,自己写代码测试啊,部署,那中间出现问题了,他会自己发现,那自己来改,那你只需要关注关键节点,确认一下,那其他的活他都可以帮你做。 那我朋友的公司啊,他就用 agent, 基本上现在就是半年零代码交付,一个人就可以干三个人的活。总结一下啊,就是大模型是大脑只能动嘴,那聊天机器人呢,是给大脑套了一个聊天的窗口, 然后只能也只能动嘴。那 skill 呢,是给大脑装技能,让他能动手。 m c p 是 万能插座,让大脑能连接各种工具。 agent 就是 智能体能,自己干活的,大脑给他目标,他自己就可以搞定。从大模型到 agent, 本质上是 ai, 从只能说 到能干活的一个进化。那我是分享,做了十七年的程序员,现在正在学习如何用 ai 做艺人公司。如果这篇文章对你有帮助,欢迎点赞关注,我会持续的分享 ai 工具的实战经验。

这条视频讲 codex a subagent, 小 白也能听懂的版本。它不是一个新软件,也不是神秘功能,而是 codex 处理复杂任务的一种用法, 你会看到它什么时候该用,什么时候别用,以及怎么用它。 review 一个真实项目,先给 subagent 下一个最朴素的定义。一个复杂任务,你可以让 codex 拆成几块,分别交给几个子代理并行处理。 每个子代理跑在自己的 agent thread 里,最后只把结论交回主线成汇总。官方术语听起来会正式一点。 sub agent workflow 指同时跑多个并行代理在汇总。 sub agent 是 被派出去做某件事的代理, agent, thread 则是每个代理自己的线程,你可以在 cli 里查看和切换。 sub agent 主要解决两件事,第一, context 被污染,读文件跑命令看报错,猜原因,全塞进主线城,后面判断就容易乱。 第二,该病型的事被串行,做安全测试风格可维护性本来可以同时看,却被一个代理从头查到尾。判断要不要开 sub agent。 可以 先问一个问题,任务能不能拆成几块?互不依赖的小事, 能拆就适合试,拆不开就别硬上。任务很小,子任务紧咬在一起,写入范围重叠,或者你自己都还没想清楚怎么拆,这些情况开了反而添乱。不适合的情况也要记住,任务本身很小,没必要开多个代理。 几个子任务互相咬的很紧,并行也不省时间。最危险的是多个代理同时改同一篇文件,这时候省下来的时间很可能被冲突和反攻吃掉。 真正适合练手的场景大多是 rate heavy, 比如大型代码库探索 pr, 多维 review 几个 bug 方向, b 型排查,长文档和长日制分块分析。官方也建议新手起步时先选探索测试、 treeash 和总结这类任务。 codex 默认不会主动开 sub agent, 你 要在 prompt 里讲清楚。常见说法包括 spawn two agents, delegate this work in parallel use one agent per point。 中文直接说启动三个 sub agent, 分 别检查安全测试和可维护性也可以。如果拿来 review pr, 可以 直接用这个模板,一个 sub agent 检查潜在 bug, 一个检查测试覆盖,一个检查代码质量和可维护性, 最后要求主线程等三个都完成后再输出高风险、中风险可选优化,以及建议优先修什么。 这个模板真正值钱的不是文字本身,而是里面的控制点。每个子代理的职责不重叠,避免大家都泛泛 review 一 遍,明确等全部完成再汇总,可以避免主代理拿着半成品就下结论。最后加一句,优先修什么,可以把排序工作也交给主县城。 接下来用 ship ready 这个小项目做例子,它是一个 s s landing page audit 的 mvp, 后端 api 在 s r c app 点 js, 审计规则和 rewrite 在 s r c audit 点 js, 存储是 s r c store 点 js, 前端是 publ i c 斜杠 app 点 js。 代码量不大,正好适合演示怎么稳妥的开 sub agent。 在这个项目里,最稳的开法不是让三个 agent 一 起改代码,而是启动三个 read only sub agent runtime risk agent 看运行风险 q a coverage agent 看测试缺口, architecture agent 看模块边界, 所有子弹里都不要改文件,等全部完成后,主线程再决定要不要修。三个结论里, round time risk agent 最有价值。他发现 handle request 里 in sync 路由没有 await, 外层 try catch 接不住 a sync handler 抛出的错。 这种 bug 在 happy pass 测试里不容易暴露,但线上可能表现成请求挂住或者 unhandle rejection qa coverage agent 的 结论也很实用。 他没有泛泛说测试不够,而是列出 invalid json 未付费 share 过早 follow up。 若 brief 绕过 rewrite 这些副路径, 这些用力不一定都要立刻补,但摆在面前,主县城就能快速挑出最该锁住的状态流。 architecture agent 的 结论最容易让人冲动, 他说 src app 点 js 可以 拆成 page extract checks brief 和 rewrite 几块 判断没错,但这次目标是写测试加修 bug, 不是 重构 auditing, 所以 这部分建议最后先记下来,不立刻动。三个 sub agent 的 优先级其实不一样, round time risks 想让你先修服务端 qa coverage 想让你先补测试, architecture 想让你先理边界。主县城不能给三票打平均分,而是要挑确定性高、改动小、能被测试所注的事情先做,最后真正落地的改动其实很克制, 异步路由统一加 await, 让外层错误处理生效。 rewrite 必须 brief ready 才能解锁, follow up 增加还没提交 brief 和非法字段校验。 read json 加 body size 限制 invalid json 返回四百,最后补 note test 回归测试。 这个案例最有意思的一课是两个代理的结论拼在了一起, round time risk agent 告诉你哪里坏了。 q a coverage agent 告诉你怎么用副路径测试把它锁住, 这就是 sub agent 真正的价值,不是替主线城做决定,而是把几个方向的结论同时端上桌。跑起来之后也要会管理 agent thread codex c l i 里可以用 slash agent 查看和切换线程,如果某个子任务偏离方向,可以让 codex 停掉那个负责性能分析的 sub agent 跑完的线程,也可以让它关闭已经完成的 agent threads。 给新手的练手顺序,不建议一上来就五个 agent 一 起改权。项目先并行阅读,让多个 sub agent 各自理解不同模块,再并行 review, 把 bug 安全测试,可维护性分头看。 第三步是单写,多审一个代理或主线成改代码,其他子代理做 review, 最后才是小范围并行修改。 下一次让 codex review pr, 你 可以直接从这个短 prompt 开始。请使用三个 sub agent 并行检查,当前 pr, 一个看 bug, 一个,看测试一个看可维护性, 等全部完成后,按风险等级汇总给我。就这几句话,已经够你完成第一次 sub agent 练习。 最后记住, sub agent 不是 替主线城做决定,他真正干的活是把几个方向的判断同时端到桌面上,让主线城更快做取舍。新手先从 rate heavy 的 探索和 review 开始,等你能清楚拆分任务,再尝试让多个代理并行改代码。

飞书以后可能不是给人用的,而是给 agent 用的。最近飞书 c l i 项目在 github 上已经破万新了,它可以让 agent 直接操作飞书, 即时通讯、办公三件套、多维表格、知识库、会议记录,包含大部分飞书场景。这个视频我就给大家分享怎么给 agent 接入飞书 c l i。 在 这之前,我想先说说 为什么要让 agent 用 c l i, 这要从 c l i 是 什么说起。 c l i 全称 command line interface, 简单来说就是你在终端,也就是这个小黑框里敲一行命令,让一段程序跑起来的方式。 比如这行 group 命令,就是在 readme 文档里搜出包含非书的行。那为什么要把这种工具给 agent 用?因为 ai 训练时看过几百万条 group get ker 这种 c r i 命令,它的特点就是输入是文本,输出也是文本,而且格式固定,正好是 ai 擅长处理的结构化内容。 但光有 c r i 就 够了嘛, ai 见过的是 grape gate 这样常见的 ai 命令,而非输。 ai 是 最近的开源项目,且不说 ai 训练时根本没见过,就算见过,关于它的用法讨论加起来也是个零头。 这就意味着 ai 很 难记住它有什么命令参数,怎么填,什么场景,该用哪个,只能限用限试错。而且每开启一次新对话, ai 又是从零开始,这些试错又得重来一遍,那怎么办? skill 就 派上用场了。飞书 c r i 配套的 skill 就是 一份完整的飞书操作手册。 ai 接到任务,扫一眼所有 skill 的 描述部分,比如处理会议场景, 就会先匹配到会议 skill 的 描述,然后才会把下面详细的流程读进来,这也就是 skill 的 渐进式批录机制,用到哪个才去看,每 没用到的基本不占 token, 不 像 m c p 会预先把所有工具说明塞进系统提示词里,而且 skill 里不只是命令说明,还有 agent 在 飞书使用过程中踩过的坑,走通的流程。也就是说 skill 加 c l i 才让 ai agent 成为读过工作手册的员 工。那接下来我们就看一下怎么安装飞书。 c i i 里已经写好了给 ai agent 准备的安装步骤,不管你用的是什么 agent, cloud code codex, open cloud hermes, 都可以直接让 ai 读取 read me 里 ai agent 安装的部分。 不过我在安装的时候遇到了两个坑,一个是在安装过程中会遇到命令权限的问题,我们可以再打开一个终端,加上 soso 来执行这条命令,然后需要输入电脑的登录密码,安装好后再回到之前的对话里,继续后面的流。 接下来会提示让我们配置凭证,复制这个网址到浏览器里点击创建就可以了。然后是登录认证一样的复制网址,下面这里可以勾选上,然后点击开通并授权 c i i 就 安装好。第二个坑是 skill 的 问题, 因为之前的权限问题, a 证的执行一键安装的步骤被打断了,本来是会自动安装 skill 的, 而我们之前手动输的 solo 命令只是安装了 c l i, 所以 这里我们需要提示 a 证根据文档安装 lock c l i skill, 不 然会缺少操作飞书的 skill。 这里我们尝试创建一个飞 书日历的 skill, 打开飞书日历看一下,这里已经成功为我们添加了一个例会日程, 那我们还可以让 ai 整理五条 ai 新闻,并且给我推送了飞书消息。 a 阵搜索之后,就通过飞书机器人给我们推送了新闻。再来看看飞书文档,我让他调研了一下英伟达消费级显卡的产品信息和价格,这里也是直接帮我们做好了飞书文档,每个产品的配置和价格都做出来了, 接着让他把价格整理成了非书表格,也是没什么问题。最后我让他把调研信息整理成多维表格,价格部分做成仪表盘,他按照产品型号做成了多维表格,仪 表盘里的格式化图标很清晰的就能看到各产品的价格对比。整体看下来,每个场景都触发了 skill 的 调用,不需要人工干预就完成了所有的非书操作。 遇见以后,越来越多的工具都会向 agent 敞开,让 agent 看懂比让人看懂更重要。以上就是全部内容,记得一键三连!

最近是不是经常听到 ai agent 这个词?拆开看, ai 是 人工智能, agent 是 代理,连起来就是人工智能代理。你可以把它想象成一个助理或者是秘书,那它能干什么?打个比方,你只用说一句,帮我定下周五去上海出差的行程。酒店要预算内评分最高的, ai agent 接到指令后, 自己会去查航班,比价格、筛酒店,最后把方案推荐给你。确认。在客服编程、金融分析这些领域,他会不知疲倦且毫无负面情绪的替代你干活。他是如何做到的? 可以简单分为三步,感知、规划、执行。他先听懂你的需求,然后把定行程这个大任务拆分成订机票、订酒店、排日程等小步骤, 接着自动去掉取日历、发邮件,用支付工具来搞定。要是中间卡住了,他还会自己纠错重来。 不用你操心。他的核心是大语言模型,相当于他的大脑,负责理解问题,推理方案。但光有脑子不够,工程师还给他装了手和脚,接入记忆系统,记住你的偏好,连上工具箱,去上网搜索操作软件,外加一套反思机制来,边做边学。 说白了就是大模型加工具加流程。再看未来, ai agent 会变得更自主、更协助。以后可能会出现一群 agent, 像团队一样分工。你的私人 agent 直接去和别人的 agent 对 接干活,他们甚至还能走进物理世界, 操控机器人变成聚深智能。商业的前景也非常广,企业流程自动化、个人超级助理都可能催生出新的平台。有人说 agent 会颠覆传统软件,以后我们可能不再一个一个点开 app, 而是直接吩咐 agent, 像当年的 app store 诞生一样,一个全新的生态正在拉开序幕。


来看一下秋之关于这个飞书接入 a i a 证的一个办公工作流。首先飞书的话,它是现在特别流行的这个办公软件,然后现在它不是像 w p s 那 样就是说接入一些 ai 的 功能,而是说真的去 发展它的一个 agent 的 工具,让它能够自动地去做这个工作。那 alie 的 话是它的原声。 ai 助手模式的话,有伙伴版和专业版,专业版就要收钱嘛, 核心的用法呢就是每日巡逻,什么叫每日巡逻?就用这个 ai 助手的话,它能够每天去自动汇总工作。怎么汇总工作呢?它能够把你在飞书里面的所有的一个数据啊,各个群的一个 消息在里面汇总你的一个工作去排优先级代办自动化,或者是说生成一些周报,就是你跟他说你要生成这周的一个周报,给一些提示词,他能够自己去 呃处理数据,就是基于这个非书里面的工作流流的一个串联。 群聊的 bug 自动去录入啊多维表格,然后触发开发群的通知,这个是怎么实现的呢?就群聊的一个 bug 的 话,他就说啊对,在群聊里面会反映,对于 呃某些应用的一个 bug, 像之前的话都要去人工的去录入,但是现在你只要给给它指令,那它定时,比如说每隔半个小时,每隔一个小时就会就能够到这个群聊里面去找到 bug, 然后自动去录入多维表格,而且录入 你可以给他一定的规则,积累到一定量的时候去发到这个开发群里面个人分身,个人分身呢,就是根据,也是根据这个非书里面的信息去分析你的一个决策风格,生成个人的说明,个人的一个简短的一个说明,我是一个什么, 嗯,就比如说架构设计师啊,这样子的个人说明卡,便以便于新人快速地了解团队。那对于这个 alie 专业版的话,它就有独立的工作台,它就像是这个什么, 有点像是这个内置的一个 cloud code 啊。嗯,有独立的工作台,长内容的处理,策划, ppt 的 制作都可以,文档润色修改,拓展能力的话,它就可以联网内置,它有内置一些官方的一个 skill, 那 些 skill 都比较好用,但是如果说你自己 自己,嗯,还想要其他的话,可以去自定义的上传,主动去学习一些新的玩法。 妙达的话,它是一个 coding agent, 它是一个就是编程的一个 agent, 这前面的话,它就是一个原声助手,它有点像是 cloud code, 这里的话是一个 coding agent。 模式的话是有灵感模式的话是清淡应用的开发模式。前后端那个项目优势的话,能够打通非输多维表格,低代码开端 开发,然后无代码的话去搭建应用。比如说就是秋之团队的话,有有用用,用这个 coding agent 的 话,做了一个课后资料的一个网页,可以去搭一个小的一个网页啊,还有这种,呃,邀请码的开发系统自动权限的一个控制 多维表格 agent, 这个就特别厉害了,因为飞书的多维表格的话是它的一个一大特色,核心能力的话,它能用自然的语言搭系统。行 c r m 这个 c r m 的 话就是客户关系管理。 customer relationship management, 客户关系管理,以客户为中心,那客户的一个数据管理,销售去自动化营销自动化客户服务,支持数据图表和报表, 那那就二零二六年的 ar ai 加 crm 的 一个发展方向, ai agent, 然后重构一些工作流,比如说自动去生成邮件、短信、社交媒体的一个营销文案,会议结束后能够生成这个什么寄要代办, 而基于这个客户的一个历史数据来形成一个什么个性化的一个解决的方案,就可以是销售预测和洞察, 那它主要的一个岗位的话, c r m 的 实施的顾问,运营的专员,成功的经理,然后产品的一个经理,数据分析师必备的一个技能的话,它就是 客户管理,对吧?客户管理的一个系统,主流的 c r m 的 操作, excel 的 一个表格,然后软的技能还有一些加分项, 那就说它这这个 agent 多维表格的话,我之前就有学过,那它其实首先你要去理解它每个字段,每个字段就是一条信息,一条数据,你可以给它加不同维度的一个属性, 然后根据这个不同的属性又可以去给他进行筛选,但是就是你怎么去给他设计这个系统,设计这个属性的话就已经比较难了,所以他核心的能力是什么?就是你告诉 agent 你 的需求,它能够自动地帮你去设置这个多个维度,就自然语言去搭系统,含 c r m, 自动地去建这个表格,仪表盘工作流日常的用法,能够让这个什么数据可示化表格问题排查结构,梳理优化案例的话,比如说项目管理系统, 项目管理系统里面有任务追踪、 bug 统计、排气自动化的一个提醒。还有一个特别重要的是这个飞书 c l i, 它就是什么意思? c l i 的 话是一个 文,就是一个文本命令行工具,文本命令行工具,简单的来说就是不用鼠标去点击图标,而是直接用这个什么, 嗯,就是输入命令,然后去操作这个电脑作用的话,能够让外部的这个 agent 调用飞书的操作,一键安装创建机器人场景的话就是用 cloud code, 你 cloud code 你 就说你用的是 cloud code。 但是接入这个飞书 c l i 的 话,就能够处理未读的发票会议,既要转任务,然后录音斗的话,就是飞书有自己的录音斗,给它转成代办 阿里激活的一个福利,前一一万名的话就是三十次不限难度的一个伙伴。任务计费的方式, 个人版的话是六十九,一个月有一千的额,额度按任务难度扣费,推荐企业版的话更划算。核心的价值, agent, 他 就是为办公的一等公民是什么意思?就是飞书的话,他让这个 agent 这个智能体去真正的去处理我们的工作,而不是只是像,嗯,就是之前的 ai 一 样,就问答式的,那能够串联琐碎的工作,提升单人或者是小团体的一个效率。