我是个美国佬,求大家帮我弄个微信。前段时间,一条这样的中文推文火了,发推的人叫 hunter bond, 一个地地道道的美国人。 hunter 专门为 deepsea 整了个开源的 agent 项目,叫 deepsea tui, 这项目直接冲上了 github 热搜第一, 成了五月初 ai 圈最火的仔之一。而开发者 hunter 差点因为注册不下来微信措施,联系上中国大本营的机会。好在网友十分给力,解决了这个最大的问题。 其实吧, deepsea v 四一推出,立马因为便宜大碗又好用,成了开源编程界的心头好。但就像 gpt 有 codex cloud 有 cloud code, deepsea 一 直缺少一个能让他发挥最强实力的编程专舞。 hunter 就是 看准了这点,开发出了 deepsea t u i, 让 deepsea 在 开发场景有了趁手的兵器。我们也靠关系采访到了 hunter 老哥,发现他的爆火不止靠中国网友的推动, 这背后是一个带着一腔热血,正在用 ai 改写梦想和命运的普通人。因为和大伙们混熟了,拳友们都习惯叫他金鱼老。 为啥用中文搞宣发?金鱼老告诉我们,我做的既然是 deep six 项目,为什么要用英文宣传?要找同号,当然得去金鱼兄弟最多的地方。而和现在许多 webcoder 开发者一样, 云龙也并不是科班出身,但经验却相当丰富。在这个项目以前,他给 mini max、 英伟达也做过类似的 agent 的 工具,还尝试过把一些科研论文变成大伙们都能用的工具。靠着这些经验积累, deepsea t y 一 推出就 圈粉了不少开发者,比如界面清晰简洁,操作流畅,最贴心的是,它会实时显示任务 token 消耗、总花费、缓存命中率和耗时,让人心里有底,编程表现也强得可怕。有网友用其他工具做项目,再拿 deepsea tui 复查,居然发现不少没被注意到的 bug。 但为啥 deepsea tui 能这么神?金玉老告诉我们,是因为这产品就是为 deepsea tui 量身打造,做了不少的优化。像是 deepsea tui 引入了 deepsea tui 的 填空神器,让 模型写代码的时候不用从头读到尾,直接在中间缺啥补啥,这个功能对修改 excel 的 bug 尤其好用。另外,他还提到, deepsea v 四上下文堆得越充分,越容易进入超神状态,所以 deepsea t u i 充分利用了这个特点,即使项目有几十上百万行 a j, 也能把之前看过的信息记在脑子里, 使结果更准确,也更省 token。 但做的太好,有时候也是一种麻烦。社交媒体上不少人开始怀疑, cloud code 之前原码刚泄露,它不会是套壳抄袭的吧? 对于这一点,就应老坚决地否认了。 deepsea tui 早在一月就已经开始开发,主要是基于我以前做过的项目,并没有使用 cloud code 的 泄露代码。虽然我也出于好奇看过其中的记忆系统设计,但 deepsea tui 主要参考的对象其实是 codex。 说了这么多,难道它就没有什么缺点吗?当然有!大伙反应最严重的问题之一是 d p c t u i 的 缓存命中率要比 cloud wallet 低很多,这导致它比较烧钱。这确实是金玉老的国初心是好的,只不过执行坏了。 d p c v 四虽然有一百万超长上下文,但它怀疑上下文积累太多, 模型性能反而会下降。所以它灵机移动,设计了一个上下温容量调节系统,每隔一百二十八 k token, 模型就要重新思考结果。模型输出有时候确实更好了,但对用户来说就得花更多的钱了。不过大伙儿别担心,金玉老目前已经修复了这个 bug。 而尽管有这些小问题,项目还是持续升温。五一后短短几天, github 又增加了上万颗星, deepsea 官方也把它列入了推荐的 a 件的列表。 在微信群,金鹰老也一直很活跃,虽然语言上有些障碍,但他每天都和大家交流模型使用经验和技术细节。他说这一切就像做梦一样。去年一月才认识 deepsea, 没想到现在成了大家口中的金鱼兄弟。他的下一步计划是把 deepsea tv 逐步扩展成支持桌面端和移动端的 ai 工具台。 实际上,金鹰老是一个专业又不专业的开发者,甚至到现在他说他也搞不懂为什么 deepsea tv 在 一些场景下会表现得那么好,项目里用的一些技术也是他第一次接触学习。 这不妨碍他从一个八竿子打不着的外行变成全球爆款开源项目的创作者。从某种程度上,金玉老印证了,这的确是一个任何人都可以凭借创意和热情实现梦想的时代。
粉丝59.3万获赞260.7万

什么是 agent? 什么是 m c p, 什么是 skill? 还有再再说说什么是 open club, 把这个东西讲完,大家应该就能对这个知识点有一个更深的了解了。首先第一个 什么是大模型,咱们得先说大模型,它就是一个可以对话的一个大脑,你跟他说话,他就能回复消息。但是有一个问题,他没有记忆,你跟大模型说一句话,你说你好,再跟他说我是谁,他不知道, 但也就是大漠星,他没有记忆,你说一个消息,他其实底层是一个 transom 架构,他经过神经网络一层一层的去计算,最终通过概率给你算出来他要回复什么东西,所以说他那个东西是有幻觉的,通过概率给你算出来一个东西给你回复了,你说我是小周,你再问我是谁,他不知道,你这 ai 没有记忆可不行了。 所以说大家为了让 ai 有 记忆可以聊天,大家就制造了一个聊天机器人,就叫 bot, 那 这个 bot 能干什么呢?就是我跟他说,我说我是小周, bot 接到我是小周,然后他会跟大模型去交流,他作为一个中间人跟大模型交流, 然后他告诉大模型这个人叫小周,然后我再说我是谁,我跟那个 bot 说我是谁的时候,这个 bot 他 会把我是小周,然后大模型的回复,然后这我是谁一起发给 大模型,也就说大模型拿到不是我是谁,而是之前的所有聊天记录,大模型都看到了,然后他再回,那这个聊天机器人他的作用呢?就是让这个大模型看上去有记忆了,这是聊天机器人,那聊天机器人的功能还是很弱,对吧?就比如说我想让他帮我关电脑, 帮我执行一段程序,帮我查询今天的天气,它也不行。所以说这个时候就聊天机器人的基础上,又扩展出了一个东西,叫 agent, 叫智能体。智能体可以干什么呢?智能体,大家记住啊,智,一句话就知道智能体可以调用工具,这东西就是智能体。 那什么是工具呢?就比如说这里有一个函数,有一行代码,这行代码可以 get weather, 可以 获取天气信息,获取获取日历信息。今天是几号?这个大模型是不知道的,大模型他知道的东西就是基于他训练的结果。 我二零二五年五月一号训练,这个大模型结束。那大模型二零二五年五月一号之前的东西,他训练过的,知道五月一号之后的事,他啥也不知道,他没训练,所以你问他,你说今天天气怎么样?他不知道今天是几号,大模型他不知道,但是 agent 他 知道。 a 针呢?可以调一个工具 get 外的,我获取到今天的天气,然后我再告诉大模型,大模型再分析,然后再给我回复,也就说这个 a 针呢?是什么呢? a 针它是可以调用工具的一个程序,它可以通过调用工具让大模型知道更多的事,这个就是 a 针的。 然后大家发现 a 针不知道天气,我得怎么办呢?我得调用一些接口,比如说高德有天气信息的接口, 我得调这个接口啊,然后还有什么饭店的接口,旅游景区的接口,什么时候卖票的接口,他得调很多接口。那这个这样的话, 所有的互联网服务平台,比如说天气的呀,景区的呀,卖票的呀,全得开放接口,然后这个 a 证他得调所有接口才能实现这个功能,那 a 证他也麻烦,那个第三方平台,那个天气的第三方平台也麻烦,然后这个接口怎么调参数都很麻烦。其中有一个执行方案,就是说我定义一个协议, 就说你这个 agent 调这个第三方平台的接口数据的时候,你别像以前那么调接口,你你咱谈个协议,你只要两边都遵守这个协议,我就可以去拿你的数据了,我就可以拿天气数据,拿时间数据,拿各种景区的数据都能拿了。 那这个协议叫什么的呢?就叫模型上下文协议,所以这个协议就叫 mcp, 所以 大家知道什么是 mcp 了吧?它就是协议,对吧?我调接口为了更方便的调接口,开发了一个协议,叫 mcp, 所以 大家知道什么是 mcp 了? mcp 就是 让 agent 可以 更方便的调用工具, 简单吗? mcp 就是 为了让 agent 调用工具,然后把调用工具的信息给大模型,让大模型可以回复,懂了吧?这是 mcp。 什么叫 skill 呢? 没点关注,点个关注,我讲的很细,跟大家说没点关注,点个关注。然后我这边有个 ai 学习专栏,大家可以加一下,我这边还有 ai 交流群,感兴趣的小伙伴可以加一下。然后我接着说什么是 skill? skill 最早就是咱先说这个调用工具, 等于说调用工具有什么弊端吧,如果你想让这个 agent 调用工具的话,你得先把这个工具的所有的说明书什么的参数配置全都给这个 agent 告诉他,然后他比如说你跟他说我,我,我跟那个 agent 说,我说你好,他收到的就是你好吗?不是 他,除了这他,他给这个大媒体人发的,除了这个你好,他还会把我这个 a 帧呢,可以调什么工具,什么乱七八糟的呀,这各种各种这个工具的参数啊,这些信息全都给大媒体人发过去,这就很麻烦, 东西很多,所以呢,为了让这个提升这个性能吧,当然也不只是为了提升这个性能,咱就说性能,为了提升这个性能吧, hlp 公司就发布了一个叫 a n 的 skill 的 东西, a n 的 skill 的 话,他可以定义一个工作流,定一个文档,一个 markdown 文件, 然后这样的话它只要在文件上面写一个原数据,写两行,对吧?当用户在干什么的时候调用这个 skill, 那 下面细节就不用不用给大模型了, 那这样我一个 a 针呢,就可以接很多的 skill, 我 只要看它那个原数据,它能干啥,我需要的时候我再调它里面的东西,这样呢性能就能得到一定的提升。而且用这个 skill 的 时候会大家发现更好的一点,就是 skill 可以 写很多很多东西, 比如说你想做一个知识库,你可以放在 skill 里面,你可以有定一个工作流,你可以放在 skill 里面,很多事都可以放在 skill 里面,这样 skill 就 火出圈了。 也就说 skill 它是一套文档,文档规定了这个事怎么干,然后大模型就会按照这个流程去干事,做事就就就完事了。 所以刚才说的 m c p 是 什么?是调用工具更方便,工具是什么呢?就是查询天气这些工具。然后呢? skill 呢? skill 是 可以让规定 你做这件事,调用哪些工具,执行哪些标准,它是做了一个更更广的一个规范,也就说一个 skill 可以 调很多 m c p 可以 调很多的工具,这是 skill 的 作用, 也就是说大家会发现 skill 能力强了,是吧? skill 可以 作为文档,它可以做知识库。 skill 可以 定义工作流,它可以做很多事, skill 可以 调很多的工具, skill 也可以调 m c p, 这是 skill 的 能力。 然后大家就会发现,那 sku 是 不是太强大了呀?对吧?它是不是可以操作浏览器啊,可以写代码啊,做简历啊,所有的工作流,甚至取代什么扣子,以前那种传统的工作人形式全都取代了,那所以这 sku 实在是太好用了吧? 确实好用,确实好用,它太好用了。然后呢,就出现了很多的工具全都接入了这个 skill, 包括浏览器, tree products, 所有的 ai 工具, ai 开发工具都接入了这个 skill, 就 大家都能用 skill 了。然后又出现了一个东西也接入了这个 skill, 就是 open claw, 也就是说因为 skill 可以 做很多事, open claw 它不需要做这些事, open claw 只需要可以调 skill, 它就可以做所有 skill 的 事。也就是 open klo 是 什么呢?它就是一个智能体,智能体的能力不依赖于它智能体本身,而依赖于它接入了哪些 skill。 这也就是说,为什么大家用 不用担心 open klo 以后能力会不会变强变弱什么的,你不需要关注它有什么能力, open klo 也没什么能力,它的能力全部一托于 skill 生态。 所以有个网站叫 cloud 号吧,里面有很多 skill 嘛。大家如果想扩展自己 opencloud 的 能力的话,你就直接下载 skill 就 ok 了,你就可以让你的 opencloud 去做各种各样的事了。因为 skill 可以 做,所以 opencloud 就 可以做, 这就是大模型 agent skill mcp 和 opencloud 的 关系。我不知道我讲的透不透彻。讲的透彻,点个赞支持一下。

别再纠结是 codex 还是 cloud code 了,我在实测了数十个 agent 之后,发现真正决定生产力上限的不仅仅是 agent 工具,还有你手里的 skill 配置。如果你的 skill 没配对,换再强的 agent 也是在浪费时间。 所以我根据实际开发场景和我的日常使用,筛选出了这四组最核心的顶级 skill, 包含了原能力扩展、工程化开发、前端设计和内容创作。 它们完全不挑平台,不管你以后切换到哪个 agent 装上都能用。先讲最根本的两把钥匙,我称为原 skill。 你 可以把它理解成让 ai 自我进化的能力,它不负责具体的活,而是专门用来扩展 agent 的 能力边界的。不管你用 ai 做什么,这都是你第一天就应该打好的地基。 第一个是 skill creator, 来自 antropic 官方。如果你想把一套成熟的工作流变成一个新的 skill, 便于后续调用,那么选它就对了。 以前想自己做个 skill 特别麻烦,得先去研究半天复杂的格式,不然可能写出来的 skill 还会报错。就算写出来了,使用效果也不一定尽如人意。但现在有了它,你不需要去研究什么复杂的格式,也不用手动改文件, 你只需要像给同事交代工作一样,用大白话把你的流程说一遍,或者直接把你的操作手册丢给他,他就会自动帮你起草、测试、反复迭代。在你自己完全不用看开发文档的情况下,一分钟就能写出一个既标准又好用的 skill。 安装和使用方式也很简单,在安装完成后, 只需要在 agent 里选中 skill creator, 然后输入你的需求,和它一步步地进行沟通就好。建议直接局安装,这样无论你在哪个项目里,都可以随时进行调用。第二个是 find skills, 大家千万别把它当成一个普通的搜索插件, 觉得还得自己手动去查。真正的用法是你直接给 agent 派任务就行了。比如你让他帮你做个 ui 设计,要是他发现自己不会,他就会自动把你的需求拆解成 ui 抵赞你这种关键词,然后自己去全网搬救兵。他在后台连接的是 skill 点 s h 这个平台,他会自己查看哪个 skill 安装量大,哪个作者靠谱, 然后挑出最好的那个供你进行选择。在你选择好之后,它还能直接一行命令帮你安装上 skill。 creator 是 让它能自己造工具,而 find skills 是 让它能去外面找现成的,这两个配合使用,一定能大大提升你的 agent 的 工作效率。接下来是针对具体场景的 skill。 先说软件开发, 我选了这三个, superpowers, j stack 和一个前端大神的 skill, 它们针对的场景略有区别,但核心都在解决同一个问题,就是终结那种看似逻辑闭环,实则无法落地的代码幻觉,帮你守住工程底线。第一个 superpowers, 他的杀手锏在于他把测试驱动开发这套严苛的工程标准,直接变成了 agent 必须遵守的硬规则。其实很多人刚开始用 ai 编程,最容易上手的场景就是让他写测试,而 superpowers 顺着这个逻辑直接把开发流程给正规化了,他 会强制 agent 进入一套标准的红绿重构循环,先写一个必然失败的测试,证明功能还没实现,然后写最少量的代码,让它变绿,最后再进行优化, 而且它非常稳。 agent 写完之后,它会自动开启两轮内部审计,一轮看代码,实现跟你的需求对不对的上。另一轮则专门盯着代码的质量挑毛病。这种慢思考的模式能帮你抓出很多隐藏的边界问题。 虽然看起来多花了一点点时间,但因为它第一遍就能把代码写到八十分以上,省掉了后面无数次反复抵 bug 的 时间,长期来看反而更省头肯也更省钱。它的整个工作流程大致如下, 首先他会拉着你做头脑风暴,把需求细节彻底磨清楚,先出一份整体的设计文档。然后他会把大任务拆成一个个几分钟就能搞定的小碎活儿,每个活儿都有明确的验证标准。接着就是让紫 a j 特自己去跑, 他自己写,自己查,严禁跳步,你只要在旁边关键节点确认一下就行。最后等测试全部通过了,他会把选项丢给你,是直接合并代码,还是先留着分支,或者觉得不行直接丢掉?第二个是 j stack, 作者是 y c 的 总裁 gary 谭。如果你还不知道 y c 是 什么,简单说,它就是全球最牛的创业孵化器,像 airbnb、 dropbox 这种巨头都是它孵化出来的。所以这位大佬出的工具,骨子里带的就是那种硅谷创业者的实战基因。这个工具有一点不同, 它不是那种功能单一的 skill, 而是在 agent 里内置了二十三个不同的专家角色,从 ceo、 设计师到发布工程师,你都可以通过斜杠命令直接调用,这相当于给 agent 配齐了一整支团队,让他不再是单兵作战。为什么要搞这么多角色? 因为真正做商业系统,代码行数不值钱,能跑通才值钱。有了这群专家帮你交叉审计, agent 就 能在不同的专业视角下, 把你揪出那些隐藏极深的问题。我来向你介绍一下它的实战流程。首先,在你动手写第一行代码之前,先跑一下 office hours 命令。这就是 yc 最出名的灵魂拷问。 ai 不 会立刻写代码,而是像个严厉导师一样, 反问你六个最尖锐的问题,把不靠谱的假设先掐死。接着可以用 plan ceo review 命令,让 agent 站在 ceo 的 高度审视计划,看看有没有更优解。到了代码复合阶段, review 命令就是你的资深工程师,他不光找小 bug, 更盯着那些 c i 能过,但一上线就可能爆炸的工程隐患。另一个具有实战特色的是 q a 命令,以前 a 阵呢,只能在代码里纸上谈兵,但这个命令是真的,会打开浏览器,像真人测试员一样去点击验证, 直接把 bug 抓出来修掉。最后活干完了,直接执行 shift 命令,它会自动同步跑测试、推代码、开 pr。 整套发布动作一气呵成。该瑞坦统计过,二零二六年,它的代码产出是二零一三年的二百四十倍。这不是说 ai 写的代码行数多就是厉害,而是同样的需求, 他一个人现在能顶一支小团队在干活,这就是角色分工带来的本质变化。第三个是一套前端大神 mod, 自己日常工作用的 skill, 作者是 typescript 的 布道者,如果你平时前端开发比较多,那么可以试试这个。 这套工具重点解决的是人与 agent 之间沟通对不起的问题。 mark 总结过,如果没有好的引导规则, agent 写代码很容易陷入几种困境。首先是理解偏差, agent 可能根本没听懂你需要什么,或者写得太啰嗦,废话很多。然后是执行失败,好不容易写出来的代码,结果发现根本跑不通。最后是架构隐患, 虽然代码能跑,但因为缺乏整体规划,后期维护起来会非常痛苦。所以他的这套 skill 核心逻辑很简单,宁可在前期多花几分钟对其需求, 也不要在后期花几个小时去处理这套低质量的代码。具体到这套 skill 里面的指令,我建议你重点关注这几个。首先是 graeme 系列的命令,这就是刚才提到的拷问模式,当你提了一个模糊的需求,比如说想加个登录功能,他不会马上动手,而 是会回过头来不停地拷问你细节。可能问完之后,他发现你真正想要的是 sso 环境下的多租户登录,这就把隐患消灭在开工之前了。接着是 tree 命令,也就是 aure 分 诊,他会帮你把所有的任务都过一遍, 分清楚轻重缓急,确保你不是在修一些细枝末节的小 bug, 而忽视了真正堵塞进度的核心问题。最后还有一个 improve 命令,这是代码库的架构急救包, 你可以每隔几天就跑一次,让 agent 站在大局的视角审视你的代码库,找出那些以后可能会越来越难改的地方,并给出重构的建议。接下来是前端页面设计,这是最开始编程 agent 出来时,他做的最差的一个领域之一。 agent 化 u i 出来的永远都是那些固定的套路, 固定的字体,蓝紫色的渐变背景、圆角卡片、特定的按钮样式。你在网上看到的那些 ai 生成的界面,十个里面有十二个长的都一样。解决这个问题的 skill 有 两个,第一个是 frontend design, afropic 官方出品。如果你受够了那种千篇一律的 ai 审美, 那它就是你的救星。以前的 ai 画 ui, 一 眼看过去全是圆角卡片加紫色渐变,就像是在共用一套廉价的模板。 而 front and design 的 核心是帮你洗掉这些 ai 位。它不是机械的套用组建,而是根据你的产品调性去推敲更有质感的纹理,或者尝试那种更有呼吸感的非对称布局。比如你给他提一个具体的风格要求,想要一个杂志感带点硬核感的页面,他给出的方案里, 字体的比例和模块间的留白都会处理的很到位。有了这种对视觉细节的把控,你的 ui 就 从一眼 ai 变成了真正意义上的耐看。 第二个是 u i u x pro max。 如果说前面的工具是帮你找灵感,那这个就是直接帮你配了一个设计总监。它的特点在于,它不是在靠直觉画图,而是把专业设计的那些条条框框全部变成了底层的逻辑。比如你要做一个金融或者医疗类的界面,它会非常明确地告诉你 什么样的配色能体现安全感,什么样的字体更显专业。他甚至还会给你列出一份避坑指南,直接点出哪些设计在商业场景里是绝对不能碰的。之所以能这么专业,是因为他后台内置了一百六十多个行业的深度规则, 不管你遇到多冷门的业务,他都能拿出一套成体系的方案,从交互细节到动效走位,都给你安排的明明白白。 而且它有一个很实在的功能,就是能帮你生成一套可以持久化附用的设计系统。有了这套规范,你下次再开发新项目, 直接把文件丢给 agent 就 能用,不用每次都从零开始打磨风格。而且它的上手门槛很低,无论是装插件还是用命令行,都能快速跑起来。 这两款工具的分工也很明确, front and 底钻负责把画面画得出彩,而 u i u x pro max 负责把产品做的更专业。有了它们, ai 的 输出就再也不会有那种廉价感了。最后一类,内容创作。如果你用 agent 做内容创作,那这组宝玉老师的 skill 我 一定要强力推荐给你。 它首先解决的就是内容本身的高质量产出,比如它能帮你生成一张极具审美,完全不输专业设计师的封面图,或者把一大段枯燥的文字直接变成一张高信息密度的格式化信息图。 在内容做漂亮之后,他还会顺手帮你搞定后面那些讨厌的碎活,比如说转格式、做排版,最后还能直接一键发布到各个平台,他把从生产到发布的全流程都打通了,有了它,你就能真正实现生产和发布一体化,把所有的精力都集中在打磨好内容上。 宝玉老师的这套工具箱里包含了十几个好用的 skill, 我 这里简单带大家看几个。首先是用于生成封面图的 cover image skill, 它最强的地方在于有一套五维控制系统,从构图类型、色调方案、渲染风格到文字排版和情绪基调, 全都能精准调优。这七十七种预设组合,能让封面彻底告别开盲盒的随机感,每一张出来的效果都像是为你的文章量身定制的专业设计。 如果你平时觉得画逻辑图、架构图很头疼,那这个信息图相关的 skill 绝对是神器。它内置了二十一种专业的信息布局,像分析原因的鱼骨图、做转化的漏斗图、梳理层级的金字塔图应有尽有。更聪明的是, 它能自动读懂你文案里的逻辑结构,直接推荐最合适的布局方案。以前要在设计软件里磨半天的信息大图, 现在只需要几秒钟就能产出出版级的可量化成果。如果你经营小红书,那么可以使用小红书 image skill, 它能将长文章自动拆解为一到十张卡通风格的轮播卡片。通过内置的十一种视觉风格和八种排版模式, 如对比、清单、流程等,可以快速生成符合平台排版习惯的图文内容。针对排版环节, 这个 markdown to html 的 skill 解决的是一个非常具体的痛点,那就是在微信公众号这种不支持 markdown 的 平台上,如何保留精致的排版。它内置了多套公众号主题,能自动处理代码、高量和数学公式。 最实用的一点是,它能把文中的普通外链自动转为文末的底部引用,彻底解决了公众号里链接打不开或者被截断的尴尬。如果你平时还有翻译文章或者精读外文资料的需求,那这个翻译 skill 就 派上用场了。 他最强的地方在于提供了一个正式出版级的模式,这个模式不是直接进行翻译,而是会走分析、翻译、校正再到润色这整整四步的流程。 而且他有一个非常人性化的功能,就是能让你指定你的读者是谁。比如你告诉他你的读者是资深开发者,他就会自动省略掉那些庸愚的解释, 翻译出来的语气读起来就像是真正的圈内人写的。最后,当你把内容全部准备妥当,可以通过发布微信或者发布微博这两个 skill 来实现一键跨平台分发。 它区分了不同的分发逻辑,你可以发长文形式的文章,也可以选择只发几张图片配一段摘药的贴图模式。它把那些复杂的后台操作全都变成了 agent 里面的一行指令, 从本地草稿到最终发布,整套流程都可以在 agent 里面直接闭环完成。今天分享的这些 skill 只是个开始,其实最关键的是大家要根据自己的工作流程和使用场景,去打磨出真正适合自己的 skill。 如果觉得视频对你有帮助,别忘了点赞和订阅,我是俊旺,我们下期再见!

今天来唠一唠,如果要是想干这个 ai 应用或者是 ai 的 开发的,这个都需要会一点啥呢?我这方面确实没啥了解啊,所以说我就找来了我身边的大神啊,就是通过三个问题来给大家一个大概的了解吧。啊, 那你首先先做一个自我介绍。大家好,我是栀子的同事,我其实是一个后台开发,但是最近一直在研究 ai 落地的相关的技术吧,所以主要还是看栀子有啥问题想问。我就是 先问第一个问题吧,就是现在我们如果只学一个 java 呀,或者只学一个前端,就你感觉还够用吗?其实从以前来说都不太够用,因为你现在看到市场上的招聘,那全都是全站的一个开发嘛,然后特别是 ai 来了之后,你不仅要写前端,后端你可能连测试和运维都要干了,所以如果你单纯只 学一个 java 或者 python, 或者是前前端的 real, 肯定也是不够用的,你可能都要有设计,就即使你不要,你不要了解很深,你也是要有一个全面的认知, 是一个项目的从零到一的落地的每个流程你可能都要略知一二,但也确实在我感觉就是啥呢,在 ai 时代就是人少活就变多了。 那我想问第二个问题,就是你看咱们学了这么多东西是吧?啊,我头就很大呀,就我天天背八股文,我还要写一些算法题啥的。那你说我,我现在还用整这么细完了,我是不是只会用就行了呀,你说 其实我也很讨厌刷算法题被骂过人吧。就是,但是呢,但是呢,如果你是想进大厂的话,据我了解啊,现在除了可能除了阿里有些部门是考察 web 扣顶之外, 呃,像别的大厂可能还是以立扣还是一个必选项吧,就如果想进还是得刷算法题,但是我个人认为现在性价比不高。也根据我自己的观察吧,就二六年上半年的时候,其实大家对考察算法题的兴趣也不大了,就主要还是要深挖吧。就二六年上半年的时候,其实大家对考察的会比较深一点,但是 传统的八国文还是会问的,包括像我们做后端的话,有一些什么中间件啊,然后有一些啊,场景题啊,可能以后会更加偏向于一些系统架构设计的一些题目, 但是如果你想要一个拿到一个比较好的 offer 的 话,可能还是得刷,虽然是很痛苦,但是我就感觉就是碰上一个好项目真的很不容易,就像咱们天天就写那老破登山改茬,我都写烦了, 就感觉挺恶心的。这所以说就第三个问题吧,就是说就是现在有这些 ai 这些新岗位啊,就相较于传统开发来说吧,就我们还需要再多学一点啥呢啊,就在能够了解到什么程度呢? 你要知道我们现在像 ai 港的开发语言不是很重要,包括 java, python, 这都无所谓,是最最重要的可能就是你要去了解 ai 应用相关的一些内容,可能会更加有助于在二十年找到一份心仪的工作。就比如说, 呃,我要了解 ai 的 对话的一个逻辑啊,包括 ai 的 知识库的一个增删改查,包括啊剪辑呀,向量化啊,召回啊之类的一些东西。首先你得是会用 ai 工具,其次你得去了解每一个 ai 工具的原理。就比如我举个例子吧,可能在二六年的话,面试官可能会问你很多什么 啊,一个 ai 对 话的一个从零到一的设计是怎么样的?就比如说防身扣啊,一些你爱的一些范式啊,一些内容,这些可能需要了解,但是你其实并不需要了解的特别的深,因为没有人是专家,因为,对吧,从二零年开始才慢慢火起来,但是确实,但是很多的很多的组建就是你起码要知道别人问那你,你要,你要能打出来, 然后你还要去明白这个坑在哪,就是你的基础选型,你的理由是什么?所以这回回到刚刚的问题上,其实这还是要深挖项目,就是你可能就需要去做一个 ai 应用相关的一些项目,你才有东西去跟面试官聊,不然最后可能还会回归到刷散发的地步。其实你可能你学的东西可能比面试官还懂 啊,是吧,其实很多时候是这样的,因为面试官他并不需要面试,嗯,所以他只需要做自己业务,万一他的业务跟 ai, 他 可能刚开始转 ai 应用了之后整个公司刚开始写 ai 应用相关的东西, 那你肯定肯定是比面试官还多,确实,所以说我感觉还是要选很多技术的。行吧,那最后就不知道大家还想看点啥,想看我俩的多唠点啥的,再有机会再继续唠啊。

很多人以为 ai、 agent 和 skill 是 一个东西,其实完全不是。 agent 像员工, skill 像员工会的技能。没有 skill 的 agent 就 像一个满嘴战略但不会干活的领导。 比如 agent 负责我要完成一个市场分析,但真正干活的是 skill, 查数据,读 excel, 做 pp, 发邮件,全是 skill 在 执行。所以现在 ai 最卷的已经不是谁更聪明,而是谁的 skill 更多。以前的大模型,像聊天网友,什么都懂, 但真正干活的时候,现在不一样了。未来最强的可能不是 ai 替代人,而是每个人身边都有一个 ai 搭档。关注我,下期更精彩!

二零二六年, ai 的 竞争将不再是大模型,而是 agent。 ai agent 正在经历从问答到行动的范式转移。 agent 它不是聊天机器人,而是能够自主交付工程的数字员工。要驾驭这支 ai 的 队伍呢,我们需要看懂三层逻辑。第一, agent 它的实现的底层原理。第二部分是如何从零到一去搭建我们的 agent 的 团队。第三,如何让 ai 的 杠杆,也就是 agent 的 部分放大我们的核心竞争力。我们先讲第一部分 底层原理, agent 进化的过程当中呢,有三大核心支柱,那为了驾驭这支 ai 军队呢?我们需要先去看懂支撑它进化的这三根支柱是什么。 第一呢,是协同进化的能力。以前 ai 它是单打独斗,但 manta gbt 的 这一篇论文告诉我们, ai 它可以像人类的公司一样去运作, 它把标准作业的程序,也就是 s o p 写进了 ai 的 代码里。想象一下,你呃提出了一个需求,不需要操心,那 ai 它的内部会自动去分化出产品经理、架构师、程序员, 它们之间互相去评审,互相去纠错。这种多智能体协助,让 ai 从写一段话变成了交付一个工程。第二,工具的使用能力。 react 论文解决了一个非常核心的痛点, ai 别再瞎编了,他让 ai 先学会思考,再去解锁啊,也就是搜索信息,然后再去执行行动。 agent 他 不再是人类的复读机,他知道什么时候应该去查最新的网页,查实时的财报,什么时候应该去掉我们的私人日程表。 这种推理与行动之间的深度的结合,真的让 ai 具备了解决现实世界的能力。 第三是终身学习的进化。 voyager 这篇论文,它让 ai 在 我的世界这个游戏里面,它像人类一样可以自主去探索。哎, 它不靠暴力刷题,而是靠技能库,靠迭代反馈。它今天去学会了,在这个游戏里面去挖矿,就会把代码存进库里,明天造房子的时候,它就会自动调用这项能力。 这也就意味着, agent 它绝对不是出场即巅峰,而是能够越用越聪明。它会根据你的啊,反馈你的业务习惯,进行自我净化。第二部分,实战指南 听懂了原理,那到底怎么才能落地呢?下面我以自媒体运营 agent 实现为例,带大家一起走一遍实战的步骤。第一步,多角色分工与 sop 的 固化。 不要试图让一个 agent 搞定一切,你需要把业务去拆成一个流水线,我们的自媒体的运营团队,呃,至少我们可以把它拆成三个 agent 的 岗位。第一个,热点的挖掘员,他负责盯着全网的热搜,按照你的审美去筛选出爆款的选题。第二个,视觉导演, 他会负责去把选择题做具象化,生成高点击的提示词、图片和视频。第三个, agent 文案架构师,他严格执行你的 s o p, 比如说黄金三秒、钩子、反转逻辑和评论区预埋等等。 你拆解的又深度,决定了 agent 它交付的精度和准确。第二步,引入左手打右手的频审博弈机制。为什么你用的 ai, 它老是胡言乱语呢?因为它没有复盘机制。 例如说,当 agent 文案架构师写完一个初稿哈,给到我们的时候,我们不要直接把它发出去,先发给 agent 审核员,让他站在叼钻读者的角度去挑刺儿,沟子够不够响,语气会不会像 ai 逻辑判断会不会有断层?会不会有事实错误 文案? agent 必须根据反馈进行自我修正,直到审核。通过这种对抗性的频审,能把我们的内容爆款率提升百分之三十以上。第三步,建立可附用的爆款技能库。 不要让你的 agent 每次都从零开始,我们要学会把成功的经验或者是失败的经验代码化。例如,我们昨天用 agent 写出了一篇涨粉一千加的报文,那我们需要引导他把这篇文案的排版风格、报点节奏封装成一个工具函数去存进技能库。 下次再写类似的选择题,他会直接解锁这个成功模板进行复用,而不是啊,盲目的去推理,去探索啊。这个是二零二六年我们最核心的一项资产之一,你的 agent 的 团队会随着你的实战复盘变得越来越懂你。 第三部分,成长洞察在 agent 爆发的这一年呢,我越来越感知到执行力在变得廉价,而定义问题的能力将成为核心的竞争力。 奥尔宝典里也曾提到过,把自己产品化,利用杠杆去放大它的价值。在我看来, agent 是 实现这个目标的核心的非常重要的杠杆之一。当 agent 能够自主完成百分之八十的执行工作的时候,那剩下的百分之二十,也就是我们对问题的深度洞察,我们拆解的任务、 底层逻辑,以及我们作为人不可复制的审美决策,才是我们的终极的竞争力和护城河。我们去学 agent 不是 为了去卷代码,而是学会如何像架构师一样去思考,去拆解。如果你对于 ai, 对 于自我成长和商业认知感兴趣,欢迎关注我的频道。

面试官根本不会看你会不会掉 a p i, 他 们张口就是 a 整的机制, r a g 召回率听着是不是很头大?其实大可不必,从底层的 toc 处理到外部的工具调用,再到智能体,逻辑非常清晰。今天我就带你们把这些技术名词一次性拆解清楚,帮你建立起一套完整的 ai 技术世界观。 视频内容可以分为五个部分。首先我们会从最基础的 l m 和 token 开始,搞清楚 ai 到底是怎么把人类的语言变成他听得懂的数字,就是所有技术的起点。接着我们看一下记忆和信息加工,也就是 context 和 r a g, ai 记性不好怎么办?怎么让他像人一样拥有短期记忆,还能够随时的去翻阅这个百科全书,这里面的 r g 技术就是关键。 然后我会带你拆解 prompt, 教你怎么通过精准的指令,让 ai 从胡说八道变成言听计从。 当然,光会聊天还没有用,还得能干实事。所以第四部分呢,我会重点讲一下怎么给 ai 装上眼睛和耳朵,又怎么让它通过 m c p 协议去调用各种工具,这是现在大场面是最喜欢的加分项。 最后,我们看看怎么通过 agent 和 skill, 让 ai 从一个被动的物纳机器进化成能自己拆解任务、自主规划流程的超级助手。好,我们直接开始聊一聊最底层的这两个概念。 首先我们要先搞清楚 l m, 也就是大圆模型,它的心脏到底是什么?大家看这一张复杂的流程图,不就是 transform 架构?其实呢,我们不需要把这整个架构研究透,你只需要知道,现在市面上几乎所有的大模型底层引擎都是它。 这个架构最早是 google 在 二零一七年提出来的。那篇论文非常有名啊,叫做 attention is all you need。 很 有意思的是,虽然这个火种是 google 点的,但是真正把火烧遍全球 的是 openai 的 gpt 三点五。那这个大模型到底是怎么工作的呢?其实它的原理非常非常朴素,我们看这张图,它本质上是在玩文字接龙游戏。 你看,比如我们问他,你喜欢什么水果模型?接到这个问题,经过内部的一通运算,并不会把整个句子吐出来,而是先预测下一个概率最高的词。比如说他先吐出一个我字,那关键点来了, 他吐出了我之后不会停下来,而是会把我这个字给抓回来,追加到刚才的那个输入,后面变成你喜欢吃什么水果,我然后拿着这个新句子再去预测下一个词,比如喜欢, 接着再把喜欢塞回去,继续预测,直到他觉得话说完了,输出一个特殊的一个结束符号,整个回答才算结束。所以我们看到的流逝,输出一个字一个字往外蹦,其实就是因为他就是这么一个词一个词算出来的。 但是这里有个问题啊,我们人类输入的是文字大模型,他真的能看懂吗?其实是不能的,大模型本质上是一个巨大的数学函数,里面跑的都是矩阵计算,他只认识数字,压根就不认识我们人话。 所以呢,在人类和模型之间,必须要有一个翻译官。那这就引出了 token 和 tokenizer 的 概念, tokenizer 负责两件事,编码和解码。编码呢,就是把我们的文字变成数字,而解码就是把模型算出来的数字变回文字。 我们来看一下这个工作流拆解。首先看左边的蓝色区域,这就是编码的过程,那我们输入你喜欢什么水果这句话时, tokenizer 会先做一个动作,叫做切分, 它把句子给切碎,变成了你喜欢什么水果。这四个小块注意看啊,这里的每一个小块就是一个 token, 紧接着它会进入印刷环节,因为模型只认识数字,所以 tokenizer 会给每一个 token 发一个身份证号, 你看图里面你变成了 id 一 零二,喜欢变成了 id 四五零,这样一来,原本的一句话在模型的眼里就变成了一串数字列表,有了这一串数字之后,可以送进中间这一个绿色的区域,也就是模型运算的核心了。 在这里 l m 进行复杂的矩阵运算,最后预测出下一个最可能的数字,比如说这里的抽根 id 二零三,这时候就轮到右边的紫色区域发挥作用了,这就是解码。 模型吐出来的是冷冰冰的数字二百零三,但是用户看不懂啊,所以呢, tokenizer 要再一次出场,拿着这个数字去查表,把它翻译回人类能看懂的文字就是西瓜 来看,这里有个小提示啊,解码的时候呢,是不需要切分的,因为模型每次只吐出一个结果, tokenizer 只需要一对一的把它还原成文字就行了。 这就是为什么我们说 token 是 大模型处理文本的最小单元,它不仅是输入时的碎片,也是输出时的积木。最后呢,我们得纠正一个常见的误区,很多人觉得 token 就是 词,其实不是的, token 是 模型自己学会的一套文本切分规则, 它和词并不是一对一的关系。那怎么换算呢?大家看,我这里写了一个比例,平均来讲,一个 token 大 约等于呃零点七五个英文单词,或者是一点五到两个汉字。所以如果下次有人跟你说这个模型,这是多少多少 token, 你 就大概能心里有数,这到底能装下多少字了? 好,搞懂了 l m 和 token, 我 们就有了最基础的砖块。那现在有个新问题,模型每次回答完就忘了,怎么才能让它记住之前的对话呢?这就引出了下一个词, context, 也就是上下文。再看标题,叫做大模型的临时记忆体。 其实啊,大模型呢,它本质上还是个数学函数,它自己是没有记忆的,那为什么我们觉得它能记住呢?这中间的秘密就在于,每次我们发新消息的时候, 背后的程序会自动把我们之前的整段对话历史给找出来,连同新问题一起打包发给大模型。所以啊, context 其实就是模型每次处理任务时接收到的一个所有信息的总和。你看右边这个图, 这里面装的东西还真不少啊,有开发者在后台设定的 system prompt, 也就是系统提示词,有我们之前的对话历史,有当前用户的问题,甚至还有工具列表和正在生成的 token, 你可以把它想象成模型的临时工作台,每次干活之前都要把相关的资料啊,之前的进度啊,还有当前的任务,全都摊在这个台子上面,它才能开始工作。 那这个工作台能放多少东西呢?这就彻底到了 context window 上下文窗口。 context window 代表了 context 能容纳的最大 token 数量,比如说 gpt 五点四,它的窗口是一百零五万, cloud oppo 四点六是一百万, 就听起来很大。但是呢,如果我们要让模型读一本上千页的手册,它还是会遇到麻烦。左边这个图就展示了痛点,如果你把整本手册全塞进去, 不仅成本很高,还可能会撑爆窗口。那怎么办呢?这就要用到 r g 技术,也就是解锁增强生成。 你看这里的解决方案, r g 就 像一个聪明的图书管理员,他不会把整本书都扔给模型,而是先从书里找出和用户问题最相关的几个片段,只把这些片段发送给模型。这样一来,既突破了窗口的限制,又大大降低了成本。 好,说完了 context, 我 们再来看一下 prompt 提示词。 prompt 其实就是我们给模型的具体问题或指令。再看这张图, 左边的模糊输入式,帮我写一首诗,模型可能会随机猜你的意图,结果可能是古诗、现代诗,甚至是打油诗。 而右边的精准输入五言绝句、秋天落叶悲凉风格,就直接说出了模型的生成范围,让它能更准确地理解我们的意图。这其实就是 prompt engineering, 也就是提示词工程的核心。把话说清楚。 不过现在学的模型能力越来越强,即使你的提示词稍微含糊一点,它也能猜个八九不离十。所以现在这个领域的热度,已经不如从前了。 接下来呢,我们再细分一下 prompt 两种类型, user prompt 和 system prompt。 首先, user prompt 就是 用户在对话框里输入的具体任务需求,比如说三加五等于几,这就是 user prompt。 而 system prompt 是 开发者在后台影视配置的,用来设定模型的人设和做事规则。比如说,你是耐心的老师,不可以直接给出答案,需要引导学生思考,把这两者结合起来,模型就能既守住规则,又能完成任务了。 比如说这个案例,用户问三加五等于几,模型因为有 system 约束,就不会给出答案八,而是会引导用户思考,你有三个,苹果又拿了五个回来,一共有几个数?一数, 这样以来,模型的输出就既符合规则,又满足了用户需求。好了,刚才我们讲了模型怎么思考和记忆,但其实还有一个很现实的问题,它其实是被关在一个黑盒子里,对外面的世界是一无所知的。 我这里写了大模型的致命缺点,他其实只是一个文字接龙游戏。我们刚才说过了,他的知识库停留在训练截止时间,你问他长沙天气怎么样,他还真回答不了,因为他连今天是几号都不知道。 那我们怎么让他睁眼看世界呢?这就得靠 tool, 也就是工具。 tool 其实本质上就是一个函数,你看右边这个图,它就像是给这个被关在黑盒子里的大脑插了一根管子,通到外面,输入参数,调用外部接口,然后把真实数据拿回来。 有了 tool, 模型就能感知甚至影响物理世界了。但是这里呢,其实有个特别容易误解的地方,我们一定要看清楚这一张完整的调用列录图。 很多人以为调用工具是模型自己去调的,其实不是啊,大家看,中间这个黄色的柱子叫做平台,你可以把它理解成传话筒或者是手脚。 流程是这样的,用户问今天长沙天气怎么样?平台会把问题传给大模型,同时告诉他,你手里有个查天气的工具,可以用大模型一琢磨,我没有实时数据啊,但是我有工具。行,那我就决定调用这个工具。 关键来了,那模型自己并不会真的去调接口,他唯一的能力是输出文本,所以他会输出一段特定的文本指令,告诉平台我要用这个工具,参数是长沙。这时候平台接到指令,他才是真正动手的那个。 他去调用天气工具,拿到原始数据,最后平台把数据再扔回给那模型,那模型就负责把冷冰冰的数据翻译成人话,比如说今天天气晴,二十六度, 代金由平台展示给用户。所以啊,总结一下,画模型是负责动嘴做决策,平台是负责动手去执行。说到这里,又有新问题了,现在市面上平台这么多, open ai 有 open ai 的 标准, antisploopy 的 规矩, google 也有自己的一套。 那就导致了开发者特别痛苦,开发一个天气工具,得为这三个平台写三遍代码,就像左边这个图,插头都不一样,乱套了。 于是呢,就有了 m c p, 全称,叫做模型上下文协议。这名字听起来挺学术的,其实他就想做一件事,成为 ai 界的 type c 接口, 不管你是什么平台,也不管你是哪个工具,只要大家都遵守 m c p 这个标准,开发者只需要写一次代码,就能在所有平台上无缝调用。 对于开发者来说,这意味着终于不用重复造轮子了,效率直接起飞。好工具让模型有了手脚,能连接外部世界了。那再进一步,如果任务特别复杂,需要他自己去动脑子,分步骤去完成呢?这就到了我们最后的主角, agent, 也就是智能体。 大家可以先看一下这个循环。 agent 的 核心就是拥有了自主规划和执行的能力,比如说这里有一个复杂需求,嗯,帮我查一下天气,如果不下雨的话呢?帮我找一下附近的公园, 这可不是简单的一句话就能解决的。 agent 得自己拆解任务,那思考过程可能是这样的,首先他得知道我在哪,所以第一步是调用定位工具,拿到经纬度, 然后拿到这个经纬度之后呢,去调用天气工具,查一下有没有下雨,发现没有下雨,那下一步就是调用地图工具,找附近的公园。 最后把所有信息综合起来,给出最终答案。这个思考、规划、执行、观察的循环就是 agent 的 灵魂, 他不再是被动的回答一个问题,而是向一个真正的助手,能主动把一个大任务拆解成小任务,一步步去完成。好,我们接着往下聊。刚才说了, agent 能自己干活,但是怎么保证他干活的方式符合我们的习惯呢? 比如说下雨要提醒带伞,摆板要整齐,语言风格也要确定一下,总不能每次都重复交代一遍吧,这时候就得靠 agent skill, 你 可以把它理解成是 agent 的 专属行为说明书,它的原理其实也很简单,就是一份存在本地的 markdown 文档, 预先告诉 agent 该怎么行事,比如说文档里面可能会写清楚,嗯,原数据层定义的是 agent 的 身份,比如说他是一个出门助手,是负责查天气和提建议。然后呢,指令层 规定具体的执行步骤,比如说先查天气,再根据天气呢判断,带什么,下雨要带伞,大风要带外套,太阳呢你得穿一个防晒衣,还要规定输出格式要求。最后总结一句话,并且列个清单, 有了这份说明书, agent 就 能按我们的习惯干活,并且是按需读取,还能节省 token。 好 了,最后我们就把前面聊的所有内容给串起来,从下往上的看一下这个全景图。最底层是结构层,也就是核心引擎 lm 和 token, 这是处理数据的最基本单元。 往上是容器层,这里面装了 context window, 负责记忆加工,还有 prompt, 负责意图控制以及 rnd 技术,是负责外挂知识库。再往上呢是桥梁层,这里就是 mcp, 它负责能力拓展,让 agent 能够连接各种各样的工具。 最顶层是编排层,这里呢就是 agent, 它像一个自主大脑,负责探索、规划和执行,而 agent skill 就是 给这个大脑的定制行为指南。 这就是我们这期视频要讲的 ai 底层技术全景,从最基础的引擎到记忆,到连接外部世界,再到自主规划,一层一层构成。我们今天看到的智能题, 希望今天讲的这些能帮你把之前零散的知识点都串起来以后,再看到 ai 相关的产品或技术,心里都有一个清晰的框架。我们下期再见。

什么是 intent? 什么是 m c p? 什么又是 skill? 还有再说说什么是 open close? 把这些东西全部讲完,大家应该就能对 ai 知识点有了更深的了解。首先,我们说大模型,它就像一个只会对话的大脑,你问它就答, 但天生呢,没有记忆,而且内容是概率生成的,很容易出现幻觉,事后你再问之前的信息,它完全不记得了。 为了解决没有记忆的问题,我们做出了聊天机器人 bot, 他 充当中间人的角色,保存所有聊天记录,然后再传给大模型,让大模型看起来拥有了上下文的记忆。 可 bot 呢?依旧局限,没法查天气控制设备运行程序,于是就有 nint 的 智能体。记住一句话, nint 的 核心就是能够调用外部工具, 大模型只知道训练截止目前的信息、实时天气日期、网络数据完全不懂。而 agent 呢,可以主动地调用天气接口、各类工具,获取实时数据,然后再传给大模型整理回答。 但一个个对接第三方接口,调试参数特别麻烦。行业就统一了一套通用的规则协议,就是 m c p 模型生产文协议。简单来说, m c p 就是 规范,让 agent 更简单统一的调用各类工具与接口。接着是 skill 技能, 之前 n 的 调用工具,要把所有的参数、详细规则全部发给大模型,信息复杂,效率很低。 sku 呢?用文档规范好固定的工作流程,出发条件, 只传给大模型精简的原数据,不用传出大量细节。 sku 可以 对接多个 mcp 工具,既能存知识库,再定义工作流,还能批量调用,更乐意能力大幅提升 ai 执行效率。 最后是 open klo, 它本身没有很强的原生能力,本质上也是一个智能体,所有的功能全部依附于 skill 生态平台,有海量的现成的 skill, 只要下载接入 open klo, 就 能拥有相对应的全部能力。总结下逻辑, 大模型是对话大脑, bot 是 让 ai 拥有记忆。 enter 学会调用工具 i m c p, 简化工具,调用协议 skill 能规范流程,拓展全部能力。 open klo 是 一托所有的 skill, 实现无限功能。 这就是大模型 agent skill m c p 和 open code 之间的关系。觉得六哥讲得透彻的点个赞支持一下。

hello, 可以 听见吗?好,今天我们来讲学会 asent 只需要一天或者九个小时,而且是完全零基础。嗯,写这个教程呢,就是想告诉大家, asent 其实非常的简单,而且有很多同学跟着这个教程找到了相关的实习,现在呢给开源给大家。 嗯,我们来看一下这个教程吧。这个教程呢总共有九个部分,前八个部分呢就是讲我们的九个小时的学习,最后一个部分呢就是讲我们的实战,实战这里大家可以找一些自己想要的项目,也可以看一下我推荐的这些, 这里呢我也会给大家写一些需要阅读什么,然后阅读的一个时长。好,我们来看一下第一个,第一个呢就是要拥有自己的 atk 编程语言,任选一种会基本语法就行,然后我这里会写为什么不用这个,然后可以用哪些? 然后第二部分呢,就是实现 agent, 因为我们大家最终的目标就是为了到一个 agent 能够联网搜索,运行命令行文件编辑,然后这里有一些步骤,还有我的总结,嗯,然后就是 it 基础, 这里呢只需要阅读一个小时,这里呢就是要实现我们的哦 m c p style, 这里需要阅读时长大概一个小时。这里提醒一下大家,这个蓝色的字体是可以点击直接跳转的,然后实现 context memory, 然后这里大概就只需要阅读一分钟,然后这里提醒大家一定要看一下 vlog。 好,这一部分呢就是我们最重要的一个部分,阅读和理解派,因为欧拼可乐项目的底层就是派,然后顺便提一下,这个派有七个包,然后分别是这些, 然后其中呢这三个包提醒一下大家一定要看,其他的大家可以不看好,最后一步呢,就是把我们的派改成自己的欧拼可乐, 然后这里就已经是我们学习的最后一步了,然后就是我们的实战了, 这里呢我会推荐一些比较容易上手的项目,快速开始,然后学习顺序整完这些大家都可以去找实习了。 嗯,好,今天的课程就讲到这里,第一次讲不太好,感谢大家的观看。

你有没有发现,身边的所有人都在聊 agent, 聊 m c p, 聊 function call, 聊大模型,你听了一堆的概念,却没人告诉你这些东西到底是怎么串在一起的?今天我就用一个最简单的方式跟你讲透。 agent 的 本质就是一句话,在大模型的输入端和输出端去做文章。 在讲 agent 之前,我得帮你把 l l m 大 模型这个东西去去魅。很多人觉得 g p t cloud 这些大模型很神,能聊天,能写代码,能写诗,但是如果你把它们的底裤拔掉,你会发现一个非常残酷的事实, l l m 从头到尾就只有一个本事,就是你往里输入一段文字,他往外吐一段文字,就这一个本事,他不知道今天是几号,不会查资料,不会帮你订外卖,也不会播放音乐,他就是一个极其聪明的大脑,是一个文字接龙机器。 你不能因为他会说人话,就觉得他有手有脚。那 agent 是 什么呢? agent 就是 在这个文字接龙机器的外面包了两层东西,一层是在输入侧,一层是在输出侧。咱们就一个一个地说,先说输入侧, 大模型要回答的好,首先输入得够好,但是仅靠用户的输入,天生就有三块短板。第一块短板呢,是大模型,他不知道现在发生的事,比如说你问他昨天人民币的汇率是多少,他的训练数据可能是截止到半年前,他不知道他怎么办。 agent 在 他回答问题之前,就会先去跑去搜索一下相关的事情。比如说利用搜索引擎,或者在你公司的知识库里面查一圈儿,把查到的最新的资料,注意这一段资料还是一段文字,把它去塞到大模型的输入里,大模型看到你的这些输入,就知道怎么去回答你了,那这个技术呢,就叫 read 连锁增强生成,说白了就四个字,开卷考试,你没背过的内容,我先把资料递到你眼前,你再去回答。第二块短板呢,是大模型,它不记事, l l m, 它本身没有记忆,你每次问它,它都是第一次看到,你想象一下这个场景,你再跟 ai 说,哎,帮我用英文写一封邮件,去邀请一下客户开会,它写好了,然后你又来一句,再加一句,提醒他们带电脑。 没有记忆的大模型,他会愣住,哎,家在哪里,什么会议,哪个客户,他给忘了,所以 agent 就 给他封装了一个小本子,一个记事本,每次对话的上下文都记到这个小本子上,那下一次去提问的时候,会自动地把这些上下文拼进到输入里面去,这个就是记忆系统。 记忆呢,一般分为两种,一个是短时记忆,就是刚才聊了什么,把这些聊天的一些记录再次塞到啊模型的输入当中。另一种呢,是常识记忆, 比如说用户的一些啊,操作习惯等等。那关键的信息呢,需要存储到数据库里面,那每次聊天的时候,能够自动的从这个数据库调出来,然后加入到这个输入里去。所以不论是短时记忆也好,它其实最终都是作为一段文字来拼接到你你这个大模型的一个输入当中去。 第三块短板呢,就是说输入窗口有上限,你不能无穷无尽地往大模型的输入里塞,所以输入侧还有一个隐藏的一个产品问题,就是说怎么从海量的信息去选出最相关的几段才塞进去,这本身就是一个产品设计的一个好坏的问题,做得好的 agent 和做的差的 agent, 差距往往就是在这里。 所以说输入册的底层逻辑总结起来就是一句话,大模型是一个需要投喂的一个东西,你喂给他什么料,他就出什么活,你喂的他料越好,越全越精准,那他给出来的结果就越来越精准。 但是呢,光有输入侧的增强远远不够,为什么?因为大模型只会输出文字,可用户要的呢?是行动。你对着智能音箱说,帮我把客厅的灯打开,如果只有大模型呢?他会怎么回答?他会给你回一段文字。他说好的,你可以在手机的 app 上找到客厅灯的开关,或者是说走到墙边去按一下开关, 但结果是什么灯没有自动亮起来,你还需要自己去进行一定的操作,这不是用户想要的,用户想要的是说我说了一句话,灯亮了,你不应该告诉我怎么开灯,你应该直接把灯给我打开。 那怎么让大模型从光说不练变成说干就干呢?这就引出了 function call 函数调用。开发者在后台提前定义好一个函数,比如说 control light 这个控制开关的这样的一个操作, 用户说把客厅的灯打开,大模型呢?再回复你一句,好的,马上开的同时会输出一个结构化的一个指令,就是说去调用 control light 这一个函数。注意,它输出的不是一段人类的语言,而是一个程序能够直接读懂的一种 json 数据 agent 代码,拿到这个数据之后,直接去调用智能家居的 api。 啪,灯亮了,用户感知到的就是说了一句话,哎,灯亮了,中间的 jason 解析 api 调用,用户是完全看不到的。那 function call 的 本质是什么呢?就是说让大模型输出指定,而不是描述它把人类语言变成了机器能执行的行动。 但是这还不够,又出现了一个新的问题,就是假如说你的 agent 接了十个工具,有定酒店的,有发邮件的,有控制灯光的等等等等, 那每接一个,你都得手写一份函数调用,去告诉大模型这个工具长什么样,而且每个公司的写法可能还不一样,换了个模型可能又得改一遍。 所以说就有了 m c p。 那 model context protocol, 这是一个 astrotropic, 推了一个开放的一个标准,就可以把它理解成就是我们的 usb type c 的 这样接口啊。 以前每个工具呢,都有自己的接口,你需要为每一个工具去单独写适配的代码,这样的话就会很麻烦,而且不规范。那 m c p 呢?统一了这样的一个接口的规范工具方,按照 m c p 的 标准去暴露自己的能力, agent 呢,启动的时候就会自动地发现。哦,你有这些工具啊,参数是这样的,我知道了。 那最酷的场景是什么呢?一个 agent 接入了 m c p 生态,你跟他说,哎,帮我查一下这个月的服务器性能数据,跟上周做了一个对比,如果有异常的情况下,把这个钉钉群里也发一个报警,他会自己去调用数据库查数据,调用分析工具去做对比,调用钉钉工具去发消息, 一个指令,三个动作,全程不需要人来干预。好,我们从头串一遍。大模型呢,就是一个文字接龙的一个引擎,你输入文字,他输出文字。 那 agent 呢,就是在这一个大模型的内核外面做了两件事情。第一个是输入册,用 rag 去解决知识过时的问题,用记忆系统去解决上下文丢失的问题,帮大模型拿到它需要的所有的素材。那输出册呢,是用 function call, 让大模型不仅能说话,而且能干事。 用 m c p 呢,把工具的一个对接进行标准化,像 usb type c 这样即插即用。所以公式呢,就是说 agent 等于大模型加输入增强,加输出增强。 如果你是一个想转行 ai 产品经理的朋友,我给你三个实际的建议,第一,你不需要会写方式,靠着代码,但你要会设计工具清单,你的产品需要给大模型装什么能力, 每个能力什么时候调用参数,怎么设计才合理。第二呢,看懂任何一个 ai 产品,就去问两个问题,他的输入单做了什么增强,输出端做了什么增强?问完这两个问题,百分之九十的 ai 产品架构你都能看懂。 第三呢,就是说未来的竞争壁垒不是模型本身,因为模型大家都能调,竞争的壁垒是你输入输出回路的设计,谁回路设计的好,更聪明,更流畅,谁的产品体验就会更好。如果你觉得今天有收获,麻烦点个关注 ai 产品经理的核心认知,包括所必须了解的相关知识,我一个视频一个视频的给你讲解出来,咱们下期见。

大家好,我是分享,最近很多人问我, m c p 是 什么? skill 是 什么? a 技能又是什么?那说实话啊,这些概念啊,听起来很专业,但其实用大白话也能讲明白。 今天我就从大模型开始,一层层的给大家分享清楚。第一个大模型是什么?其实你可以把大模型理解成一个超级大脑,那这个大脑他读过全世界的书, 看过全网的文章,那记住了非常多的海量的知识。你问他问题呢?他能回答,那让他写代码呢?他也能写,但是呢, 要注意啊,他只是一个大脑,他没有手,没有脚,他不能帮你干活。那第二个聊天机器人是什么呢?那聊天机器人就是给我们的大模型套上了一个聊天的界面,你在 呃这个对话框里输入问题啊,他在对话框里给你回复问题,像我们现在熟悉的切切特、 gpt、 豆包这些啊,他们都是聊天机器人。但是 问题来了啊,他还是只能聊天,不能帮你干活。那比方说你让这个,你让聊天机器人帮你发邮件,那他只能告诉你怎么样发邮件,但是他发不了邮件, 对不对?那为什么呢?因为他没有工具,没有权限,他只能动嘴。第三个 skill, 什么是 skill 呢? skill 就是 给大模型装技能,比方说你给他装了一个发邮件的 skill, 它就真的可以帮你发邮件了。那如果你装一个查询数据库的 skill, 那 它真的可以帮你去查询数据了。 那 skill 就 像给大脑装了一双手,让它不光能说,还能干。 m c p 是 什么呢? m c p 是 模型上下文协议,听起来可能很专业是吧?其实它就是一个协议接口啊,什么意思呢?就是你让 ai 操作你的数据库,数据库的 skill, 那你让 ai 操作你的文件,文件抓取的 skill, 如果想让 ai 帮你发邮件,你得给它装一个发邮件的 skill。 问题来了啊,就是每一个工具都要单独装一个 skill, 太麻烦了。 那 mcp 就是 解决这个麻烦问题的 mcp, 它定义了一套标准,让 ai 可以 直接连各种工具和服务。那比如我们刚才所提到的数据库文件 啊,邮件,那这些啊,只要支持 m c p 协议,那 ai 都可以直接调用的, 我们可以把 m c p 理解成一个啊,万能的插座,那以前啊,这个工具都需要单独连线啊,现在只需要就是把所有的工具插到这个万能的插座上, ai 就 可以直接用了。 那第五个啊, a 进它, a 进它是什么呢?其实 a 进它大家都比较熟悉哈, a 进它就是智能体 啊,就是能自己干活的 ai。 我 们前面提到的这个 skill 和 mcp, 它们都是给 ai 装工具,但装了工具以后,你还得告诉它怎么用,对不对?那 a 进它就不一样了,它能自己规划,自己执行,自己纠错,那 你给他一个目标,他就可以自己拆解成任务,那自己调用工具,自己完成。那比如你现在告诉 agent 智能题啊,你帮我做一个项目管理系统, 那他就会自己做需求分析,自己做技术选型,自己写代码测试啊,部署,那中间出现问题了,他会自己发现,那自己来改,那你只需要关注关键节点,确认一下,那其他的活他都可以帮你做。 那我朋友的公司啊,他就用 agent, 基本上现在就是半年零代码交付,一个人就可以干三个人的活。总结一下啊,就是大模型是大脑只能动嘴,那聊天机器人呢,是给大脑套了一个聊天的窗口, 然后只能也只能动嘴。那 skill 呢,是给大脑装技能,让他能动手。 m c p 是 万能插座,让大脑能连接各种工具。 agent 就是 智能体能,自己干活的,大脑给他目标,他自己就可以搞定。从大模型到 agent, 本质上是 ai, 从只能说 到能干活的一个进化。那我是分享,做了十七年的程序员,现在正在学习如何用 ai 做艺人公司。如果这篇文章对你有帮助,欢迎点赞关注,我会持续的分享 ai 工具的实战经验。

这是一期地毯式 codex 教程,如果你还在焦虑谁谁谁又用 codex 做出了什么无敌的应用或者自动化给自己干活了,那你务必看完本期教程,带你最全面的了解 codex 是 什么,它能干什么,并跟我一起实操完成。从 codex 下载 安装到个人网站、文档制作视频动效,自制工具等等等等,全面了解 codex 这个目前为止最强大最全面的个人 a 政策。 codex 的 界面现在我们来到了 codex 的 主界面,这个对话框你肯定很熟悉,对吧?但是你可以看到左边的这个边栏,就可以看到很多不一样的地方。 首先是上半部分,点击这里你可以快速创建一个新的对话框,快速完成一段与 codex 的 对话。这个搜索你可以同时使用 command g 来调出,快速搜索,你与它进行或者对话等等。现在你可以看到技能和插件这两个板块,这里可以说是 codex 的 一大精髓所在。再过来说, codex 是 一个集合了 chatbot, d e 浏览器,自动化工具等等等等的一个大一统的工作台,所以你可以给他安装插件, skill 以及创建自动化任务。这里的插件市场可以让你来随时扩展更多的功能。比方说这里的 computer use 和 browse use 在 我们后半部分的教程中就会用到这两个功能。 再往下看,可以看到项目和对话两个分栏。在项目中你可以点击添加新项目来将你创建好的文件夹给添加进来。在你创建好的文件夹右侧点击开始对话,你就可以创建出一个新的对话框,那么之后你们对话所有产出或者修改的文件,就会在这个文件夹中进行。 正常情况下, ai 如果直接操作电脑,风险会非常高。所以 codex 使用的是沙盒的逻辑,它相当于给 ai 开了一个单独的隔离小型开发环境,它可以在里面读代码,改代码,运行命令,执行测试,但默认是不能随便控制系统的。 在对话这里,你可以选择默认权限、自动审查、完全访问权限三种权限类型,让 codex 来执行还是非常安全的。再往下看,还有一个对话栏, 常用来进行一些临时产生的问题,当我用完,我就会点击右侧的这个归档按钮,把它给归档,那你也可以在设置你归档对话里面去给他找回来。 回到对话框,你可以在对话框中输入任意的问题,或者要执行的操作,比如帮我整理桌面上的这个文件夹里的发票,并统计这些发票总金额是多少,然后统计在一张 excel 表格中,你看很快他就跑完了。 现在我们来使用 codex 制作一个个人网站,首先在桌面上新建一个我网站的文件夹,然后回到 codex, 进入文件夹,点击这个加号,打开计划模式,这样 codex 就 会根据你给的需求,先开始计划他接下来要做些什么,等他计划完成了,他会给你一份详细的执行方案, 然后点击执行,这样就可以去干别的事情。一杯茶的功夫,你就可以等待你的网站。你可以点击右上角调出一个终端, 把它给你的命令复制一下,回车运行,你就可以在 codex 里面预览这个网站的效果,我们点击展开面板。哎,对了,你看 codex 还自带一个浏览器,你可以在 codex 里面直接查看以及批注,这样你就不用回去再想想怎么描述我是要修改什么地方。 文档与 ppt, 那 除了做网页,我现在更高频的用途是用它来做文档。比如说平时很多人会写策划案,汇报 ppt 视频脚本,以前是用 gpt 生成文字,再到 word, 再复制到 ppt 里面,最终再自己排版。但是 codex 现在已经把这些东西都串起来了。比如说我现在告诉他 使用 html ppt 这个 skill 帮我制作一个宠物账号的商业方案,要求包含市场分析、账号定位、内容模型、变现方式,以及未来三个月的执行计划,并生成一个科技感高级风格的网页 ppt。 然后你看到他就会开始创建文件,生成文案,设计页面,制作动画,自动排版。最后给你一个直接可以演示的网址。尤其是你看像我一样要录制这种口播视频的,我这样的 ppt 就是 用 qq 词直接帮我生成的,他做出来东西天然就很适合录屏。 这个时候顺便介绍一下 qq 词另一个非常好用的功能,分叉非常适合这种,你做到一半突然想要尝试一个新的风格, 或者要尝试两种内容的时候,点一下分叉按钮,这个时候不用重开一个新绘画,重新解释项目背景,他会直接分叉当前的上下文。你可以在分叉县城里面大胆做实验,如果效果不好,直接回到原来的主线就可以了。如果效果更好,就可以沿着这个分叉继续来进行开发视频动效。 说到做视频, codex 最近还上线了一个非常强的插件,由黑正推出的 hyperframes, 你 只需要输入一句话的描述,就可以自动生成带动效排版转场。三 d 视觉的高级动效视频,可以说是完全填补了原来视频模型不适合生成精确的带文字、带数据的动效视频的孔雀。 比如说,你可以直接说帮我根据这个养猪场的年报生成一段科技企业的汇报视频,他就会直接调用前端库来生成一段带数据、带图标的动效视频。 skill 与自动化任务普通的 ai 只能回答问题,但是通过 skill, 你 可以把你工作多年的经验或者流程打包交给 codex 自动去跑。比如说你完全可以使用 at skill creator 来描述你的需求,每天自动抓取某个平台的热门视频, 分析标题,提取高赞评论并整理成 excel, 最后生成第二天的选择题。我自己做了一个急梦,排队的 skill, 如果你有批量使用 cds 的 需求,使用我这个 skill, 它就会在晚上帮你批量提交视频生成的任务,自动检查生成出来的视频并保存到本地。 类似这样的 skill 还有非常多,这个部分就留给你们自己去探索。 computer news 这个是我觉得最近 q 版有这个功能,目前只有 mac 版有这个功能, 它运行起来的时候,它就会像一个真人一样看屏幕,移动鼠标,点击按钮,输入文字,打开软件,切换窗口,使用第三方 app。 以前很多的自动化必须要通过写脚本,调接口,配 sdk, 研究文档。但是现在即使某个软件没有开放 a p i, 很多事情扣代码,直接看着屏幕自己就去操作了,你懂这种方式有多震撼吗?最后的总结 可以看到, codex 提供的内容已经非常非常多了,我这里要下一个爆论就是这一类 agent, 他 绝对不会仅限于编程开发等等, 你已经不能简单的给他定义成工具了,但是你也别太焦虑,拥抱 ai, 先从每天自己最烦最重复最浪费时间的小事开始。 比如说整理文档,改革式做表格,生成封面,做网页,写脚本,做汇报,批量修改内容。当这些事情真正开始被 ai 接管的时候,你自己的潜力或许才刚刚被开发出来。

我们最近被迫开发了一个做外贸设媒的 a 针的,为什么说是被迫呢?因为我们现在遇到一个很典型的问题,就是我们现在手里的品和员工的匹配已经非常的稳定了,这是什么意思?就是说你如果想加一个新品,就必须要加一个人, 但加人这个事在我们团队是有门槛的,我们不是说缺人才招人,我们是当增长能达到五倍人效的时候才允许加人。 但问题是现在我这几个月增长已经没有那么明显了,所以如果说要继续靠家人来解决问题的话,那么人效一定会被摊薄,所以这个时候破局的点可能就剩一个了。就是 ai, 不是 说继续去堆人,而是说用 ai 来解放我们做内容同学的时间, 我们做的这个工作台简单演示一下吧,它是由 gpt 五点五来驱动的,主要解决了外贸社媒的一个非常核心的问题,就是你迟迟动不了手。这个迟迟动不了手,它不是说因为你不会发帖,而是因为你根本不知道该发什么, 而且这个不知道发什么,他其实也有很多维度,第一可能是你不了解当地人的阅读习惯,第二是你不了解目标市场的一个文化属性。第三是你没有足够多的样本和互动数据,所以很多人在做海外设备的时候,你看他发的又多又密,但就是没什么效果。 其实原因很简单,就是你发的那条内容本质上还是给中国人看的,你用中国人卖货的逻辑去打一个完全不同文化背景下的一个用户,你肯定是打不动的。 所以很多外贸内容的问题,往往不是说文案不够努力,而是内容视角从一开始就是错的。你脑子里如果只有卖货,只有参数,只有价格,就是说我们的工厂有多强,没没什么用。 海外用户真正关心什么?他为什么会停下来?他为什么会评论?他为什么会信任一个完全陌生的品牌? 所以这些东西你如果不在目标地区生活,或者说你没有足够的数据样本是很难去凭感觉判断的,但 g p t 可以 帮我们补上这一个部分。我们也抓了一些垂类数据,包括 x 领英 facebook 上的几千条帖子,几千条评论, 我们让 aj 对 这些内容做了分析和学习,他现在可以判断什么样的内容更容易被当地人接受,然后什么样的表达更像是本地人在说话,什么样的互动动作更适合当前这个账号的阶段,以及我们发布的内容大概能处在这个流量池的什么位置, 我们还可以在这里,在这个工作台这设置,这个品类现在处于一个什么时间节点,比如我是刚起号啊,还是准备要测爆款?是要做新人建设,还是要做产品教育?现在这些信息都会影响 a 人的判断,就是他会判断当前最适合发什么内容, 以及做什么样的交互动作。它更像是一个海外设媒的内容决策平台,它有本地人的样本数据啊,也有平台热铁的数据,再加上 gpt 五点五的推理能力和内容能力,如果铁子需要配图的话,也可以直接用 m h two 直接生成图片, 理论上它现在已经也可以实现,就是自动操作,已经登录账号这个浏览器去自动发帖。 但是实话实说,这个环节目前不是特别的稳定,所以我们现在还是采用一个半自动的方式,人工直接复制粘贴,这样更稳,也更适合现在这个测试阶段。所以我就在想一件事,你说要不要找一个新品,完全交给 ai 去跑海外设备连续测一个月, 在这一个月里,我们尽量不做人工干预,账号怎么搭,内容怎么发,互动怎么做,节奏怎么安排,全都让 agent 他 按照他的判断来跑, 看看在一个真实的品上,他到底能不能跑出结果。哎,如果有网友能看到这的话,如果你手上也正好有自己说了算的品的话,我觉得我们可以合作测试一下, 不管你是什么身份,什么餐馆也好,厂长也好,负责人也好,其实都可以。但有一个前提就是这个品你得说了能算数, 我们可以按这个 agent 的 要求,让他需要什么素材就提供什么素材,然后我们团队来解决这个账号、独立站啊、网络啊这些基础运营的问题, 你负责出品和素材,我们负责让这个 agent 跑一个月的海外社媒也不收什么钱,我们就当做一次真实的产品内测。我们也想看一看就是一个 ai agent 的 在真实外贸产品上到底能做到什么程度。 如果你有自己说了算的产品,并且愿意拿出来测试的话,你可以联系我,我们这次就只招一个品吧,就是想做一个真实的产品测试,测试一下。 当这个海外设媒不需要再靠人去硬想硬发应对数量,而是交给一个懂样本、懂平台、懂文化差异的 agent 来跑的时候,他到底能不能带来新的增量?我们可以合作测试玩一下。

哈喽,可以听得到吗?好,今天我们学 intent 只需要一天九个小时,而且是完全零基础的,写这个教程就是想告诉大家, intent 其实非常简单,并且已经有很多同学通过这个教程找到了实习,然后现在这个教程给大家开源出来,还有项目地址。然后整个教程主要分为九个部分, 其实前面八步都是我们现在讲的这个九个小时,剩下的项目实战就是自己去挑,自己去选,或者我给你推荐的一些合适的东西,你看一下怎么去学。然后前面这里每一步我都会写阅读这个东西,这些东西大概需要多长时间?然后第一步是这个 api, 这里的编程语言随便选一个, 然后这里会有一些步骤,你可能需要去学什么东西,为什么不用这些东西?然后第二步实现 int, 因为我们最终目标是要到一个 int, 能够在互联网上实现正常的运行和 搜索,这里也有一些具体的步骤和总结。然后下一步就是 int 基础,它大概需要一个小时的时间,这里有一些链接,像这种蓝色的字 题都是链接可以跳转的啊。然后下一步就是这个拖了,阅读需要一个小时,实现这个 cohost library, 这个只需要一分钟的时间,去看一些 vlog 就 行了。然后再下一步也就是最重要的一部分就是这个派,因为 open class 项目底层 就是派,所以我们一定一定要看这个 vlog。 然后这里也有提到这个派,然后大概有七个部分,其中只需要看这几个,其他呢?不需要看 整个路线的最后一个部分就是怎么把这个派改成你的 open clone, 然后这里有 get clone。 然后最后一个部分就是项目实战,这里会推荐一些比如说可以快速上手的项目,适合理解 intent 原理的,然后 快速开始的项目,然后学习顺序是哪些,整完这些就可以去找实习了。好,今天就到这了,感谢观看,再见。

核心名词去解释 talking, i n g, engine、 m c p 这些词是什么意思呢?我们在刷短视频的时候呢,通常能看到这几个词,但从来没有任何一个博主给我们去好好的解释过。那么今天看完这个视频,我保证你可以跟任何一个人去讲清楚这五个词。 我们通常以为在和 ai 对 话,它像我们读书的时候呢,一个字一个字去理解,对吧?但事实并非如此,当你去输入一段话, ai 做的第一件事就是把你的话拆解成一个一个它能理解的最小单元,我们称之为积木。 这个过程呢是一切的起点,也就是我们今天要讲的第一个词, talking。 那 么 talking 它到底是什么呢?简单来说, talking 就是 ai 为了理解你,把你的话拆成一块一块的积木,像我们一样去理解完整的句子的,而是通过一套算法将文本分解成最小的一单元。对中文而言呢,一个汉字大概相当于一到两个 talking, 可以说 talking 就是 ai 去理解世界的基础。理解了 talking, 那 么你就会明白 ai 是 怎么收费的。你用的 ai 的 每一分钱,其实都是你按照你消费的 talking 来计算的,无论是你的提问还是人家的回答,最后都会被转化成 talking。 talking 越多,花费的费用就越多, 同时每一个模型的都有一个上下文的窗口的上限,决定了他每一次能够记住你多少信息。如果 talking 你 完了,会怎么样呢?想象一下, ai 的 工作台就像一张桌子,大小是有限的,当你不断的去往上放东西,桌子满了,那么最早放上去的东西就会被挤掉,所以这就是为什么在 ai 长时间的对话中会失忆,他不是笨,而是他的脑子已经放不下了。 ok, 我 们现在已经知道了 ai 是 如何将文字拆解成积木的,但光累积成积木还不够,它还得理解每一个积木是什么意思,对吧?接下来就是我们讲的第二个概念, ig。 我 们都知道 ai 的 知识的,它是有截止日期的, 而且他还喜欢一本正经的去胡说八道。 i n g 的 技术呢,就是为了让你去理解这两个难题,你可以把它理解成让 ai 在 回答问题之前,先去一个指定的图书馆里去翻书,然后根据找到的资料来回答你,就像开卷考试一样啊, i n g 的 工作流程也是非常的清晰的,分成四步,首先第一步呢就是你提出的一个问题, 第二步呢就是系统利用啊绑定的技术去知识库里面去查找最相关的资料。接着呢就是把这些资料和你的问题拼接到一块,形成一个新的指令,然后 ai 就 根据这些资料去生成一个答案。每一步啊,它其实都不复杂,但组合起来就非常的聪 明, i n g 的 实际效果呢,也是非常显著的。那对于企业来说呢, i n g 可以 将内部海量的文档就变成一个智能问答系统,让 ai 给出的就不再是通用型的废话,而是你的企业的专属答案,可以说 i n g 是 ai 应用的落地基石。讲完了 ai g, 我 们再看 agent, 如果普通的 ai 它就只是会说,那么 ig 呢,就是会做,它不再是一个只会聊天的大脑,而是一个拥有大脑和手脚的完整实体,能够自主的去理解任务,规划步骤,并调用工具去完成,这是 ai 从嘴炮到一个实践的飞跃。 ig 的 工作模式呢,也是可以概括成四个环节,感知、规划、调用和纠错。首先呢,它能够感知你的需求, 然后呢,它能够规划出任何任务的去步骤。接着呢,它能调用各种工具去执行这些步骤。最后呢,它还会检出结果,如果错了呢,就会重新来 it 的 应用呢,价值呢,就在于它的效率是有非常巨大的一个提升的。那么之前呢,过去人工几个小时才能去完成的一个工作呢?比如说写报告,做市场分析, 他们就用几分钟的时间就能搞定,那么可以说是会做事的 ai 才是最大的生产力,对不对?最后呢,我们来谈谈 m c p 需要调用的工具。 但在过去的每个 ai 平台,调用的工具方式都不一样,就像每个电器呢,都有自己的插头和插座,非常的混乱。 m c p 呢,就是为了这个问题而产生的,它相当于 ai 世界的一个 usb 接口,一个统一的标准,让 ai 可以 被任何的一个 ai 工具轻松地调用。它的本质呢,就是说是基于 m c p, 比如说变得非常清楚。第一步呢,开发者只需要去按照 m c p 的 规范把 工具包去装一下,变成一个标准的 m c p 的 服务区。支持 m c p 的 ai 平台就会自动地在网络上发现这些可用的工具,然后 ide 会使用统一的指令去调用。他们根本就不用关心公司的底层是什么语言,而是什么样的框架去写的? m c p 的 发展呢,也非常的迅速, 从二四年呢,一直到二六年年初,基本上所有的主流平台的 ai 都开始支持了这种速度呢,表明了同一标准是行业的共识啊。现在呢,我们把这五个 概念也串起来看,他们并不是孤立的,而是构成了一套完整的流水线。从 talking 能读懂你的字,再到 abandon 去理解你的意思,再到 ing 去查找资料, agent 去规划执行,最后通过 m c p 去调用工具。当然,我们要意识到这套系统还不完美,比如说 ing 的 技术可能依赖于高质量的知识库,对吧?否则呢,就是垃圾进垃圾出啊。 编辑的在复杂任务中呢,可能会一步错,步步错。那么关于怎么样让 ai 彻底地去落地到你的企业,我们准备了一套完整的方案,里面不仅有各个行业通用的 ai 智能体,还有关于企业 ai 落地的核心框架是什么,甚至包含你的 ai 为什么不能够落地,对吧?该怎么样去破局?破局?破局的思路是什么? 怎么样去让 ai 投位行业对吧?超过三十个维度的综合经验数据,包括未来五年企业 ai 智能体落地的布局路线图是什么样子的?我们呢,这边有一个文档,需要的可以说一下。