好了,大家,国产版 codex 它真的来了,那就在八月十三号, deepsafe 发布了自己的 agent 系统 deepsafe harness, 它能够自己操作电脑组织规划调用插件,让 deepsafe 有 了更完整的形态, 从单纯的模型变身为了你的干活搭子。那同样呢,是 deepsafe v 四模型,在自家的 harness 上用和在 codex work body 上面用,实际费用投肯消耗、响应速度和交付结果上又会有什么差异呢? 今天不讲大道理,只用两个非常简单的案例带大家快速的横屏对比一下,没想到最后的结果还蛮意外的。记得点赞关注收藏,我们现在开始。 好,那在开始之前呢,我先带你完成 harness 安装,我们先打开这个官网。 deepsea harness 的 理念就是一切接插件,好,在它的旁边就有官方的路径,但如果说你搞不清楚啊,你也可以像我一样,直接把这个链接发给 codex 或 walkbody, 让 agent 直接帮你安装了。这就是 deepsea harness 的 界面,现在它默认是一个网页的形态。那在开始这边需要输入 api key, 那 需要大家呢,在 deepsea api 的 官网注册一个, ok, 这样就好了,是不是很简单? 第一个任务呢,先简单一点,主要对比一下它们在基础编程上的效率,复刻一下 floppy bird, 需要遵循小鸟重力下落的动效。移动关卡的设计选手一呢就是我们的 deepsea harness。 ok, 你 可以在这里看到它每一行非常清晰的思考 逻辑,你就可以看到每一次调用工具的这个记录,非常非常的透明。 ok, 我 们看一下最终的回复,在这里按照提示词先给到了一份开发计划,包括了界面的结构啊,样式啊,逻辑细节。好的,那我们打开他的小游戏, 先看这个界面,那复刻了原版蓝色天空的这个场景,上面的小云朵呢,还会跟着一起飘动,很可爱。好,我们点击鼠标直接开始, 嘿嘿嘿嘿。哎哎哎哦哦啊哦,好吧,那整个反应呢,还是比较灵敏的,小鸟在这过程当中的运动轨迹也是 ok 的。 那游戏的关卡这边也没有穿帮的情况,可以正常的通过,没有问题。它的用时一共是四分二十一秒, 这边费用一共是两毛一分,缓存率动密是高达百分之九十。第二位选手, codex, 我 这边已经通过 c c switch 把 codex 默认的 gpt 模型切换成了 deepsea 和 v 四 pro 的 这个模型, 它基本上是不会展开这个思考链路的,让用户觉得这个页面更加的简单。好,可以看到它的回复,这边 也是遵循了提示词,给到了开发计划。好,我们再看一下它的游戏界面,我还蛮喜欢的,复古青色的色调,设计上没有刚刚那些黑边,所以看起来色调更加统一,更加的舒服。 ok, 我 们开始试一下。 呃,然后这个小鸟它真的太可爱了,像一个小鸡蛋一样。那这个游戏呢,其实会因为速度会比刚刚的 deepsea 要更顺畅一些,轻轻松松就手拿十几分了。 ok, 那 这个小戏其实它在完成度上也是没有问题的,那这边呢,是用了六分十二秒,稍微慢一点点,然后费用这边呢是三毛八分。接下来是我们的第三位选手 walkbody, 那 这边我也是接入了自己的 v 四 pro 模型,那这样的话方便我后续记录它的这个消耗和费用。 我发出去了提示词之后, walkbody 是 起用了它自己的这个计划模式,可以在这个右边呢直接的去做一个预览,有一个内置的浏览器,这就是一个相对成熟的产品,它的好处了,尽可能把你需要用的全都安排上。它的这个初识界面相对是 比较简单的,是一个动态的效果,然后他顶部这边不知道为什么有一个红色 tab。 好, 我们来测试一下。这个背景滚动速度非常的快,但是柱子一出现的时候,感觉这个速度又突然慢下来了。 好,那活不过两分呢,就 game over 了。重新开始这个文字按钮,它没有居中感觉 workbody 它在细节的打磨上还是少了一点点,有会有一些小小的 bug。 好, 那 workbody 在 用时上面呢,只有惊人的一分六秒, 而且只花了一毛五分,没有想到是这轮速度最快的 agent。 好 的,那我们简单的小结一下, deepsea harness 速度呢?比较快, 整体完成度是 ok 中等的。那 codex 完成的小游戏视觉我觉得会更好一些,但在成本和耗时上相对都更高一些。那 walkbody 它就是速度极快,但是你可以看到它整体完成度会稍微差一点,在验收和校准的环节做的还是不够好。 那第二个任务呢?我们难度升级一下,我要办一场线下 ai 大 会。那需要 agent 这边帮我整理这么多的活动资料, 包括方案啊,预算啊,差不多有五十多份的文件,先要帮我整理一下,再统一的把有效的信息放在交付区这样的一个文件夹里,汇总这些信息,输出一份活动宣传的 ppt。 ok, 那 在 deepsea harness 呢,它首先识别出来了,这个任务确实比较复杂,所以呢,自己调用了任务规划的这个功能,这里看到它在一个一个的读取五十多份的本地文件啊,然后最终呢 看一下它这里的交付结果,然后这里呢分别用资料、交份件,设计资产,还有待确认事项和 ppt, 把整个活动筹备的信息呢整理非常清楚, 那在资料区这边呢,还开了九个小文件在执行的交付区,这里也基于前面的资料对应做了整理,我觉得整理真的超级细心哎。 提示,此里呢还有个任务,就是整理出需要确认的信息,可以看到这里给到了待确认已确认以及可能会影响活动的核心要素, 写的非常的详细,还帮我们写好推荐的方案,就是前后都帮你想好了。那我们最后看一下 ppt, 这里每一页的 ppt, 不 得不说信息密度很高哎,但是确实这个配色呢,是有一点普通啦,全部都是用黑色这个色系, 因为我还没有额外给 deepsea harness 装任何的插件。尽管如此,我觉得呢,这份 ppt 还是能够用上的,就稍微把这个黑色底色调整一下。在这一次的任务里头,一共用时呢,正好是二十分钟,呃,一共花了七毛七分, 这一次的缓存命中率呢,是高达百分之九十九。接下来我们看一下第二位选手表现怎么样? codex 呢,依然非常的神秘,他在前端这边三四分钟,一直都是显示正在思考,然后突然一下子全部输出了。 那我们看一下他输出的这一份文件夹哦,他只分了两类,就是资料区和执行区,也 算是比较清晰了,他在命名上面没有 deepsea harness 那 么的清晰和有秩序。在待确认的信息这边他写的非常的精炼,就是有一种那种非常干练的同时。那我们看一下最后他交付的这个 ppt, 那 这个页面的样像跟第一位选手还是蛮像的, 他们都没有主动地额外调用其他的技能,甚至是没有图形的排版,呃,有点简陋了。我们看一下这一次 codex 的 用时呢,是十三分钟,但这次他花了一块两毛八, 这个跑下来的 token 消耗跟费用还是蛮高的。那最后我们看第三位选手 workbody。 好 的,可以看到呢,他整理资料的方式哦,跟前两个都非常的不一样,他是直接按照类型去做划分的。那第一层呢, 就拆了将近七个类别,整体拆分的是不是有点太碎了?比如说像,呃,对外的物料这边呢,其实它也算是一个执行的文件,它好,我们再看一下需要我们确认的这个信息,它为什么是放在这个证据和冲突说明这个文件夹里, 这个这个分类是有点奇怪啊,但我们看一下它具体写的是什么好,要确认的是设备、观众和直播。 ok, 我 们来看一下 ppt, 那这一套 ppt 呢,视觉就舒服了很多,就至少不是全都是黑色,那它整体配色呢,比较的均匀,而且呢,你是可以在它的内置浏览器里 打开一个在线 ppt, 随时的编辑,你看,像这样子,我可以随时编辑它的文字。那这也是 workbody 融合了自家生态,自家软件一个非常便利的优势了。用时上面, workbody 只有惊人的七分二十八秒呵,而且只花了四毛九分, 哇哦,效率真的很高诶。在第二个比较复杂的任务整理上面, deepsea harness 它用时最长,但是慢耕出细活嘛,它整体整理的也是最详尽的 codex 啊,还是稳定发挥,但是它的使用成本和 token 的 消耗还是最多的。那 workbody 呢,我是没有想到它的时间和成本都是最优的, 而且背靠着自家的一些生态产品, ppt 交付的质量也还不错。那通过这两个案例,你会发现,同样是 deepsea v 四 pro 的 模型装在三个不同的身体上面跑出来的结果真的有一点不一样。不过呢,在今天测的这三个 agent 里面, codex 和 workbody 属于是非常成熟的一个封装好的 agent 的 产品。但是我接下来的这个 deepsea harness, 我 还没有给它装任何额外的插件,你可以理解为它现在就是一个逻辑,但是你其实是可以给它随意地去加装你需要的插件。 那在 github 上面已经有好几百个文件整理啊,数据分析的插件了。那这种一切皆插件的设计呢,把选择权和创造力都交给了使用者, 也就是说,你今天看到的是他最开始的起点,非常期待年终的时候,他会进化到一个什么样的形态。好的,那如果这期视频帮助到你的话呢?记得点赞、关注、收藏,我们下期见!
粉丝4.2万获赞21.5万

对比 codex 和 cloud code 的 这三个 agent 的 区别,从本质上来说,它们都有桌面端, ai agent 都可以读写你的文件,甚至控制你的电脑完成各种操作。 但三者之间还是有不少差异。首先是开源, hermes 完全开源,而 codex 和 cloud code 都属于各自公司的闭源产品。 再说模型支持,目前 codex 和 clockcode 都更倾向于使用自家模型,如果想要更换其他模型,通常需要额外配置一些工具,比如 cc、 switch。 而且不少朋友实际体验下来会发现,切到 deep sec 之后,整体效果有时候会出现比较明显的下降。 hermes 就 没有这个问题,模型上可以随意切换,不用被模型生态绑定,也不用为了换模型重新折腾一遍。 接下来,记忆体系是 hermes 的 特色, code 和 clock code 目前主要还是依靠手动 md 记忆文件加上自动记忆,需要的时候会以上下文的方式把这些内容注入进去。 而 hermes 增加了,当它解决完一个复杂问题之后,会自学习记住你的操作习惯和偏好,自己创建 skill 技能来提升效率, 下次遇到类似任务直接调用,会慢慢学会你是怎么做事的。而也正是因为有长期记忆的存在, hermes 还有一个非常有意思的概念, profile。 你 可以把它理解成多个独立的 ai 智能体,每个 profile 都有自己的记忆技能、人格和上下文。我们可以创建多个 profile, 它们彼此完全隔离。对于长期使用 agent 的 人来说, profile 真的 是一个非常实用的设计。 当然,在使用体验上, hermes 还是桌面端新人,刚发布时一直不少问题,所以从发布到现在也在快速迭代。 hermes 桌面版本质上其实就是终端 c l i 版本套了一层图形界面,两者共享一个后端。 而 clockcode 在 这里给我的感觉还是更偏向专业开发者。 codex 则属于完成度非常高的,有 computer use, 浏览器操控等等都已经做得相当成熟。而 hermes 目前 computer use 只在 mac 上有官方支持。 所以我的结论很简单,如果你已经在稳定使用 codex 或 clock code, 不 建议第一时间切过来。但如果你是第一次接触 ai agent, 或者想找一个门槛低成本也不高的方案,那么 hermes 桌面版确实是一个不错的选择。 很多时候一个月会员的钱就够你用 deep 跑很久了,而且不用担心账号被封或者订阅限制的问题。

那很多人把这个沃克布里吹上天啊,我们今天继续来看 colis 如何虐杀这个沃克布里啊,同样的,我就拿我女儿特别喜欢的一个绘本系列的小兔子自杀啊,来看沃克布里和 colis 他 们分别效果如何,我对比下,结论很明显,这个沃克布里除了时间就是做事情的这个,这个时间很快,其他一无是处, 视频完成了,然后这个啊,扣链子划了十八分钟啊,接下来我们看成品效果不同啊,这个是我和玻璃写的啊,大家看一下,真的,我仔细看了一下这个故事,真的是一点可东西都没有,然后再看一下这个设计,哎呀,真的比很多公众号小编的这个设计水平都差。我们 再来看一下这个扣链子做的,不仅故事非常的吸引啊,同时你看,这才叫设计,这才叫艺术啊,各位,这才是能让小朋友能够身临其境读下去的这个绘本呀,我和玻璃写的,什么玩意?垃圾!

codex 最近更新了新功能,它现在可以直接操控你的 chrome 浏览器了。对比 computer use, 它不会抢你的鼠标,因为它是在后台运行的。配置只要四步。第一步,先更新 codex, 点击设置,点击电脑操控,安装着 chrome 插件, 好点击打开,添加扩展程序,这样就配置好了。在用的时候记得要输入杠 prom, 再加上你的问题,他就在后台帮你操作你的浏览器工作了,同时还能开好几个标签页并行地去跑任务。我让他帮我整理一下我的 note 库,他目前已经在开始工作了。

二零二六年, ai 智能体,也就是我们常说的 ai agent, 一下子就火了,你随便一搜就能看到各种各样的产品,比如 deepsea harness, 腾讯的 work buddy, 一个叫 hermes agent 的, 还有 open ai 的 codex, 乍一看它们好像 都差不多都是能自己干活的 ai 吗?那我们是不是只要比比谁更聪明就行了?他们四个其实代表了四种完全不同的发展路线。今天咱们最重要的任务就不是给他们排个一二三四,而是要把这四家的底细都摸清楚,他们各自到底在解决什么问题,最厉害的地方在哪,又分别适合什么样的人去用?咱们一个一个来看。 先说 deepsea harness, 这个名字里的 harness, 翻译过来有点像智能体的运行底座或者框架。你可以这么理解,一个大模型就像一个聪明的大脑,它会思考,会说话,但是它光有大脑是没法帮你完成一个现实世界里的具体任务的。它得有手有脚, 得有工具,得有记忆,得有个工作台。这个 harness 就是 给他提供身体操作系统和工作环境的那一整套东西。 deepsea harness 最核心的设计理念叫 everything is a plugging, 翻译过来就是一切接插件,你用哪个大语言模型可以换?你需要它用什么工具 可以换?它的记忆系统、存储方式、任务调度方法,甚至是用户界面全都可以换。开发者就像搭积木一样,用配置的方式,任务调度方法,甚至是用户界面全都可以换。开发者就像搭积木一样用配置的代码。这就带来了几个非常突出的优点, 一,开放性和可组合性超级强。比如说一家公司想搞一套自己的内部智能体,又不想被某一家模型公司给绑架,那就可以把不同公司的模型都接近这个 harness 里。遇到复杂的推理任务,就调用能力最强的那个模型。遇到普通的整理任务, 就用一个成本更低的模型,甚至处理一些敏感数据,可以直接用部署在自己服务器上的本地模型,这就非常灵活了。第二, 它的运行过程非常透明,它会详细记录下模型每一步都看到了什么,系统给了它什么指令,它调用了什么工具,又派出了哪个小助手去干活,整个任务过程可以被恢复、搜索、分叉和重放。这一点对开发者来说太重要了。 因为 ai 智能体最让人头疼的一个问题就是,它要是做错了事,你根本不知道它为什么错。有了这份完整的黑匣子,飞行记录、调试、评估和审计就都有了依据。第三,它不止提供一种固定的工作模式,它有标准模式,适合绝大多数任务,有代码模式, 让模型直接写程序来组织复杂的工具调用。还有最小模式只保留最核心的功能,方便测试模型最原始的智能体能力。甚至还有一个 creator 模式,专门用来设计新的插件和智能体模板。 当然,缺点也很明显, deepsix 哈密斯更像是一个基础设施,一个给专业人士用的工具包,而不是咱们普通人下载下来就能直接当办公助手用的模型。怎么选,工具怎么接,权限怎么配, 数据怎么存,这些都得你自己来负责。而且它目前还处在开发者预览阶段,接口和插件生态都还在快速变化。所以它最大的价值不是让你马上扔掉现在的 ai 助手,而是为那些有开发能力的企业或者团队提供了一套可控可扩展的 agent 底盘。好说完了需要自己动手组装的底盘,我们再来看一个已经组装好,加满油随时能开的整车。腾讯的 work buddy。 如果说 deepsea carnes 是 给开发者准备的乐高积木,那 workbody 就是 一辆已经组装好的、设计好所有细节的汽车。它的核心目标非常明确,就是让普通的职场人用一句大白话,就能把一个相对完整的工作任务交给 ai 去完成。 workbody 强调的是全场景办公、多专家协助和开箱即用。你可以用它来搜集资料、做市场调研、分析表格、生成 ppt、 写内容、整理文件,甚至写点代码。你只需要告诉他你的目标, 他会自己先去理解,然后把任务拆解,再调用不同领域的专家并行处理,最后把结果交到你手上,你还可以检查和修改。沃克巴蒂最大的优点首先就是使用门槛极低,你完全不需要懂什么 python 编程 tool 容器、 a p m 密钥、向量数据库这些听起来就头大的词,安装好之后 直接就能用。这对大多数人来说太重要了,因为真正决定生产力的往往不是理论上限有多高,而是一个工具能不能在十分钟内就开始帮你创造价值。第二个优点是它对中文办公和国内生态的适配特别好,它覆盖了 windows 和 macos 系统,还打通了桌面端主流的 即时通讯工具和微信小程序。无论是写中文报告、做 ppt、 处理 excel, 还是跟国内企业的沟通场景, workbody 的 产品设计都更贴近我们的日常办公习惯。第三个优点是,它把复杂的多智能体协助 包装成了一个用户能听懂的概念,叫专家团队。你不需要自己去设计什么研究 agent、 数据 agent、 写作 agent, 你 只需要描述你的最终目标, 系统会自动帮你组织不同角色的专家来协助。这种把复杂技术藏在产品界面背后的设计,大大降低了用户的理解成本。 当然,成品化也意味着你失去了一部分底层的控制权,你很难像用开源框架那样完全掌握它内部的每一个运行细节。它的透明度、可定制程度和模型选择的自由度通常是不如 dypcarnice 或者我们接下来要说的 hermes agent 的。 而且,对于一些特别复杂的代码仓库,严格的软件测试任务, workbody 也未必比那些更专业的编码 agent 有 优势。所以, workbody 最适合的是谁呢?就是那些希望马上提升办公效率,但又不愿意投入大量时间去研究、部署和配置系统的人。它的竞争力不在于某一项底层技术有多么领先,而在于它把模型工具、专家文件和办公入口 整合成了一个可以直接上手用的产品。接下来我们聊聊一个很有意思的 agent, 叫做 hermes agent, 它是由一个叫 non research 的 团队开发的。这个 agent 最核心的理念跟前面两个都不太一样,他认为一个真正有价值的智能体,不应该每次跟你对话都像第一次见面,而应该在长期的使用中慢慢形成记忆, 掌握你的工作习惯,并且把成功的经验沉淀成可以反复使用的技能。 hermes 最大的特点就是闭环学习,它有一套长期记忆系统,可以保存你的个人偏好、项目背景和过去的经验。它还有一个技能系统,可以把一个多步骤的复杂流程保存成一个可以一键调用的 skill, 也就是技能。以后再遇到类似的任务,它就不必重新摸索了,而是可以直接调用已经形成的工作方法。打个比方,这就有点像一个实习生,刚来的时候什么都不会, 但你在带他的过程中他会犯错,你会纠正他,慢慢的,他学会了怎么做报告,怎么分析数据,下次再让他做类似的工作,他就能直接上手,甚至做的又快又好。 hermes 就是 这样,如果他在执行任务时走了弯路,最后找到了正确的方法,或者你纠正了他的做法,他可以把这些经验写进他的技能库里。所以, 赫米斯的价值是会随着你使用它的时间增长而增长的。它不是简单地记住聊天内容,而是在尝试把过去的经验转化为程序化、可附用的工作流程。 hermes 的 第二个优点是模型自由度很高,它可以连接 openai、 cloud、 gemini、 deep seek、 千问等各种云端模型,甚至你本地的模型也行。你的长期记忆技能和工作入口是属于 hymes 这个员工本身的,而不是绑定在某一个特定的大模型上,也就是说,你可以随时给这个员工换个大脑,但他已经学会的工作方法还在。第三个优点是,它适合 长期在线运行,你可以把它部署在自己的电脑上或者云端的服务器里,甚至可以通过 telegram、 discord、 slack、 whatsapp、 飞书、 企业微信这些渠道跟他交互。这意味着,就算你人不在电脑前,也可以通过手机给他发个任务,让云端的 agent 继续帮你工作。他还内置了定时任务和子 agent 的 能力,特别适合用来做周期性的报告资料搜集这类长期自动化任务。 不过,关于 hermes 的 自清化,这里有一个非常重要的澄清,他通常不是自己重新训练那个大语言模型,也不是说用了一段时间之后,模型本身的神经网络权重就自动改变了。他所谓的成长主要发生在记忆技能和系统提示这些层面上。 还有一个叫 self evolution, 也就是自我进化的项目,会利用执行轨迹和评估数据来生成和优化技能和提示词,但并不是在修改模型本身,这更接近于是工作流程和提示系统的迭代,而不是模型的重新训练。这种机制 既是他的优势,也带来了风险。你想想,如果一个 agent 总结了错误的经验,他也可能把这个错误写进他的记忆里。如果某一次偶然的特殊情况被他误认为是普遍规律,那这个错误的流程就可能在以后被反复调用。所以, hermes 提供了记忆写入和技能写入的审批机制。比较稳妥的做法 是让 agent 先提出修改建议,然后由人来查看差异并批准,而不是让他完全不受控制地修改自己。这也给我们一个很重要的启发,一个 ai 的 自我改进不能只看他有没有评估回滚、 审批和安全边界,没有验证机制的自我学习可能只是让他在更有信心地重复错误。最后,我们来看看 openai 的 codex。 很多人对 codex 的 印象可能还停留在他是一个编码助手,但现在他已经发展成一个由桌面端、命令行、 i d e 插件和云端环境组成的完整体系了。严格来说, openai 把那些通用的研究报告、表格、 ppt 和文件交付等功能更多地放在了 chat gptwork 里,而 codex 仍然以代码、项目、工具和工程执行为核心,当然, 这两者的能力正在越来越多的共享。 codex 最大的优点是它特别强调做完并验证,而不仅仅是给你一些建议。它可以读取你整个项目的文件,搜索代码,修改多个文件运行命令、执行测试、查看报错信息,然后根据测试结果继续修复问题。 最后交付给你的不只是以几段视力代码,而是一个完整的修改招标文件差异对比测试结果以及可以审查的最终成果。第二个优点是它的修改招标文件差异对比测试结果以及可以审查的最终成果。第二个优点是它的 codex 可以直接使用你电脑上已经装好的翻译器、测试工具和项目依赖。而云端的 codex 可以 为不同的任务建立隔离的环境,让多个任务在后台并行运行。任务完成后,你可以清楚地看到它都改了些什么,可以要求它继续调整,或者直接把修改提交到你的代码仓库。 第三个优点是它的权限和安全边界做得比较成熟。 codex 通过杀伤来限制它对文件和网络的访问,在执行一些高风险命令或者跨越权限边界的时候会向你请求批准。 这种设计可能会让操作显得有点谨慎,但对于一个能够真实修改文件运行程序和连接外部工具的智能体来说,这种谨慎本身就是可信的重要组成部分。 第四个优点是它把编码研究和文件交付连接了起来。在 chat gptwork 这个更大的环境里,同一套能力还可以用来生成和检查文档、表格、 ppt、 pdf 网站和数据分析结果。这意味着一个复杂的任务可以从资料搜集开始,经过分析和程序处理, 最后形成可以直接使用的文件,整个流程都可以在一个环境里完成。当然, codex 的 局限也很清楚,它主要围绕 open ai 自家的模型和 chat gpt 服务来运行。模型的自由度不如 hermes 或者 deepsea harness。 它虽然也支持技能记忆和项目规则,但不会把自动修改自己作为最核心的卖点。它的取向更加保守,宁可让流程可审查、可验证,也不轻易让 a 阵自行改变长期规则。好了,现在我们把这四个智能体放在一起,就能得到一个非常清晰的结论了。如果你的目标是开发一个自己的 a 阵的产品,那 deepstack harness 最有吸引力,因为它开放模块化,运行过程可追溯。如果你的目标是普通办公人员,想马上提高效率,那 work 吧里最方便,因为它把复杂的技术包装成了开箱即用的成品。如果你的目标是培养一个能长期在线,逐渐熟悉你个人工作方式的智能体,那 hermes 最有特色。如果你的目标是完成复杂的代码工具执行 需要严格验证的专业任务,那 codex 的 综合完成度更高。你看,它们代表的其实是四条完全不同的路线。 deepsea harness 追求的是架构上的自由, workbody 追求的是使用的便利, hermes 追求的是长期的成长,而 codex 追求的是可靠的交付。聊到这里,还有三点特别值得我们进一步思考。第一, 未来 agent 的 竞争绝对不会只发生在模型层面。模型当然很重要,它决定了智力的上限,但真正决定这个智能体能不能稳定落地完成实际工作的,是模型之外的那个哈尼斯,也就是它的运行底座。它能用什么工具,能访问哪些文件,怎么记忆、 怎么调度任务出错了能不能恢复,以及我们作为使用者能不能看清他到底都做了什么,这些才是关键。第二,我们刚才聊到的所谓自动化,绝对不能脱离一个有效的评估系统,一个 a 阵能够修改自己的技能,并不等于他一定会变得更好。真正有效的自我改进,至少需要完整的执行记录、 客观的测试数据,效果、比较机智、必要的人类审批以及出错了能回滚的方案。否则,他可能只是在更有信心地把你最初交给他的那个错误一遍又一遍地固化下来。第三,最好的 agent 不 一定是最自主的 agent。 对 于很多低风险的、重复性的任务,高程度的自动化确实能节省大量时间。但是 当涉及到付款、删除文件、发布公开内容、修改正式代码或者处理敏感数据这些关键操作时,一个能够暂停下来向你解释情况并等待你确认的 agent, 它的价值其实远远高于一个完全自主、从不请示的 agent。 一个成熟的智能体系统,不是要取消人的判断,而是要把人的判断 集中到那些最关键的节点上。最后,我们来总结一下今天的内容。 deepsea carnes 最适合作为构建自有 agent 系统的开放底座。腾讯的 workbody 最省事,适合想直接进入日常办公场景的用户。 hermes agent 最像一个会积累记忆和技能的长期 ai 员工,而 open ai 的 codex 则最擅长把复杂的专业工作真正做完,并进行严格的验证。所以 下次你在选择的时候,不要只问谁最强,而要问自己三个更具体的问题。第一,我需要的是一个成品工具,还是一个可以自己开发的框架?第二,我更看重的是计时的效率提升,还是长期的成长和陪伴。第三,我是否需要掌握对模型、数据 权限和运行环境的控制权?当你把这三个问题想清楚之后,这四者之间的选择就一点都不模糊了。他们不是简单的谁替代谁的关系,而是分别服务于不同层级、不同需求的未来。更常见的情况 可能也不是某一个超级 agent 包揽所有工作,而是像今天聊到的成品办公 agent、 专业工程 agent、 长期个人 agent 和企业自建底座,它们相互配合,共同组成一个真正好用的 ai 工作系统。

这个插件可以在 codex 上用内嵌浏览器做 codex image 二的生图。无线画布,打开画布,选择 ai 图片,确定图片比例,在对话框选择 skill coot 输入生成一张拉面的广告图。 完成以后,生成的结果会在之前跨好的 ai 图片中展示,然后可以把不满意的地方标记出来,比如去掉底部文字,筷子抬高,汤的颜色淡一些。 牛肉放的太多了,标记后直接丢给 codex, 让它按照标记好的内容重新修改, 修改好的结果会放在同一画布,更好地去对比,用标记的方式去修改内容会提高图片的准确率。大家觉得这个 skill 怎么样?

对比 codex 和 hermes 哪个更好用?有什么区别?为啥两个都装了反而更乱?因为你压根儿没搞清楚它俩的分工, 谁来接需求?谁来做交付?谁又来做沉淀?这期视频我不测评到底哪个工具更强,直接拿我短视频工作流这个例子来告诉你, codex、 hermes 非书知识库究竟怎么样来配合我们?先不要着急去对比功能,先来说一下它们的定位。 codex 它是一个专业深度来解决问题的技术骨干,而 hermes 则是事无巨细为你服务的贴心助理。我们再来说一下它们的相同点。首先呢,它们都是能够执行任务的 ai agent, 能够理解任务并且调用工具。用一句话来概括就是,它俩都可以直接帮你干活。那 我们再来看一下它们的不同点,我会分为这六大板块,跟大家讲清楚它们有什么不同,哪一个更加适合你。首先, codex 是 open ai 公司旗下的闭源产品,是表偏开发代码项目执行类的。而 huma 呢,是完全开源的产品,它的定位呢,更像是一个会自我进化的贴身助理。那既然产品定位本身不同,所以它们的工作单位肯定是不一样的。 codex 呢,它更像一个 i 人,它的工作单位是固定的项目文件夹,而 codex 更像一个艺人,是一个满屋子跑的私人助理。它可以同时联通你的微信飞书浏览器。既然单位性质不一样,那上班的入口也肯定是不同的。 codex 啊,它更适合坐在电脑前,打开一个绘画,进入一个项目,然后开始深度的工作。那 codex 它更适合从不同的入口被叫起来,可以是桌面端,也可以是在任意的地方通过你的手机去联通。那大概了解了它们的工作性质, 接下来我们聊点专业的,它们的模型也是不一样的,之前 codex 只能用 open ai 自家叉 t g p t 的 模型,而 hermes 的 产品定位 就注定了它不会绑定任何的一个单一模型,有两百多种的大元模型,支持你随意的切换。那它们的记忆方式也是不同的, codex 呢,是依赖于文件夹的绘画, hermes 具有分层记忆系统,所以你在微信上告诉他你的喜好,他在飞书上也能想得起来。这就是为什么 hermes 会越用越聪明,越用越懂你的原因。那 我们接下来再看一下稳定性, codex 呢,肯定会更加的成熟。所以说当你面临一些比较复杂的问题,毫无质疑交给 codex, 那 和 mercedes 呢,则是和多平台的来统计。用久了,它就像跟了你很多年的贴身助理一样,你的一举一动它都懂。它俩绝对不是寄生于核生量的关系,而一定是一加一大于二的效果。它俩各自的分工是不同的, 避免各干各的,比较分散。这个时候就要接入非书知识库这个大本营了,三者结合,形成一个完美的自动化闭环。那接下来我们就来说一下这套系统是怎么闭环的。那我就拿短视频创作这个工作流来举个例子,大概分为创作前、创作中、创作后三个阶段。第一步,创作前, hermes 呢,负责灵感的捕捉。就比如说,可能我在吃麻辣烫的时候突然想到一个选择题,我只需要打开我的非书,告诉 hermes 我 有一个什么样的创作了。这个时候用到的就是 codex 第一部文稿内容的生产,比如说像写大纲、逐字稿、分镜标题,都可以用 codex 来帮我进行。 codex 写完之后呢,会放回我的非书文档里边儿,我再去做修改,因为真正决定内容质量的究竟 还是人。那在视频录制完成之后,像动效的剪辑这一块儿可以交给 codex。 那 最后一步,在视频发布之后呢,要进行一个数据的回填,像播放亮点、赞,评论、用户的人群、涨粉的数据,这些 agent 再来分析这个数据, 对于下一次视频做一个参考。好啦,视频的最后我想要说的是,不管用哪一个 agent, 用起来才是更为关键的,可以加入我的群。

你能看到我在看什么吗? yes, i want to show you how to create? 能。你在看 heli 的 happen 教程,用 ai 数字人加 happen 做完整视频以后,可能不用一直坐在电脑面前打字,你开口 code 就 开始干活。你打开屏幕,它还能看到你正在看什么东西。 hello, hello, 在 呢,想聊点什么?你可以告诉我你能做什么吗?就是你这个实时语音功能,今天的更新。 好的,直接相关更新是实时语音,现在接近了桌面版的 codex。 你 可以直接说需求,打断我改方向,追问进度,也可以让我协调正在跑的任务。比如你边说边改一段文案,让我去查。这两天的日报,就是选举日报,请你给我选五个出来。 点是 office c i, 让 ai 直接读改和生成 word, excel, ppt, 优先拍 office c i 的 十四个交付结果,然后用 hammock 做前后对比。你能看到我在看什么吗?能看到我的页面吗? 能看到你还在 x 行业。上面是一条刺绣网页效果的贴子,下面是关于 codex 实时语音的贴子,这个效果你能帮我复刻出来吗?我想做一个类似的,我先看一下克星星, 可以能做成一个几条鱼,会游动,带水波和跟随效果的网页动效,不用原子的素材。你要我现在就开始做个小样吗?嗯,大概需要花费多长时间?我确认下攻击再答复你。 小样,大概二三十分钟,要调到适合直接录视频,大概一小时。我在看 youtube, 你 能看到我在看什么吗?内容, okay and now this is me in the flesh, i built an i vision of myself handed it a script and let it introduce this video for me and in this episode of type of brain for beginners i wanna show you how to create。 能。你再看黑镇的 have friends 教程,用 ai 数字人加 have friends 做完整视频,现在在讲用一个提示词生成数字人片段,再放进已经设计好的 have friends 分 镜。

同样的提示词,同样调用 remotion, codex 和 work buddy 差距有多大?我分别做了一次实测, work buddy 完成任务用了三十八分零一秒生成了一条约六秒的动画。深色机械背景搭配金属文字,科幻感很强,但画面元素偏多,信息层级稍显杂乱。 codex 只用了六分二十九秒,成片约五点五秒。它采用浅色科技风标题倒计时和四个 skill 图标,分区明确,整体更干净,也更像可以直接商用的产品。动效 速度方面, codex 大 约快了五点九倍,所以这次测试中, work buddy 的 视觉冲击力更强。但综合生成速度、信息表达和完成度, codex 的 表现更加成熟。 这也说明,真正拉开 ai 工具差距的,不只是能不能调用 emotion, 而是谁能更快更准确地把需求变成成片。

那么根据最新的价格表来计算,涨价之后每天的账单应该在四十到五十之间。如果极端一点,比如说你在高峰时期用,那么一天一百块是非常有可能的。 tbc v 四 pro 正式版的这波操作呢,已经拉完了,属于从哪个角度都圆不回的那种。 目前我们能看到的这个零八一三版本的 api 呢,属于是薛定谔的正式版,有人说他回退了,有人说没有。如果是正式版的话呢,下午我把 v 四 pro 接到了 codex 里面跑,我之前的开放世界 prompt 就是 我有一个两千多行的 prompt 文件,专门用来测试不同模型的, 可以先看看运行时的效果,然后我又让 gbt 五点六索拉娜给代码和视觉效果打分,可以看到它还不如 glm 五点二,属于模型里面垫底的存在。 那如果不是正式版,那就更有意思了,这就代表着 dpc 的 官方也承认这个版本不及预期,然后回滚了。所以到底是发错模型了,还是有别的原因,这个我们可以等后面官方的解释。 但还有另外一件事情,那就是 deepsea 的 涨价规则已经确定了,我这边做了两张图,可以直观的看到涨幅的变化。 就我之前做过测试啊, deepsea v 四 pro 每天一亿 token 的 话呢,差不多是十块钱。那么根据最新的价格表来计算,涨价之后每天的账单应该在四十到五十之间。 如果极端一点,比如说你在高峰时期用,那么一天一百块是非常有可能的,这个价格甚至比 facebook 还贵,真的,毕竟一个月三千块真的可以随便用 facebook? 然后最好笑的是一堆营销号或者是跟风的人在凌晨 ds 官方刚发声明的时候啊,自己用都没用就跟着官方的指标吹起来了,什么超过 os, 某些领域持平 facebook? 所以 说围观群众也要擦亮了眼睛,不要被人带到沟里去了。

首先从界面上我们来对比一下两个 agent, 左边是 zcode, 右边是 codex, 那 乍一看它们的界面就像男神姐妹一样,呃,没有太大的差别,界面都很简洁,在它的左侧工作区域里面,呃,手都有 新建任务搜索技能,这里 codex 有 插件还有自动化,那么在下面是它们具体的项目的文件夹,可以在这个项目的文件夹下面建立不同的任务, 那 codex 也是一样的。那么我们具体来看一下技能,这款 zcode 的 有自己的内置的技能,以及你可以从外部导入或者是下载一些技能给到它。 那 codex 呢?这边会有丰富的插件系统,它本身在它的系统里面就内置了 open, a, r 以及其他的插件工具,这里可以创建一些自动化的工作任务。这块目前 zcode 的 还没有, 那么我们来具体看一下它们的设置界面。首先看一下 zcode 的 在它的常规设置里面,主要是界面主题语言这些常规的设置。 第二个是代码预览,那么第三个区域是它的模型设置, zcode 的是可以接第三方的 api, 可以 用第三方的 token。 我 这里连接的是火山引擎,火山引擎我定的套餐里面有 g, l, m, kimi, mini, max 和 deepsafe, 我 都添加到这个模型里面去了, 所以我在选择的时候是可以选择多个模型的。那技能这一块是 zcode 的是内置了一些技能,也有一些是我之前下载的,以及从其他的 ai 里面导入到它的技能里面。 它也有 mcp 服务器,还有它的插件管理系统。 zcode 的 它自己带的一些插件其实比较少,有些需要你自己去下载,这是它的命令行锁影库, 那这是我最近用 zcode 的 使用统计,在引导里面,第一个是点进去以后是正式开始使用 zcode 的, 那么它第二个比较特殊的功能就是它的数据迁移导向, 在这里你是可以把你之前的文件夹里面的一些对话任务或者一些信息,你选中以后,可以导入到 zcode 的 里面,同时你也可以导入这个文件夹里面所涉及的 skill 以及 mcp, 那么这里如果有命令的话,可以从外部的 a 帧导入命令, a 帧就是,嗯,你所选中的这些文件夹里面有哪些 a 帧,这个记忆文件都可以导进来,那么把这些都选中以后,可以选择迁移这里我就不重复迁移了,因为之前我已经迁移过了。这块是 zcode 可以 跟其他的 agent 相连产生连接的。一个点下来我们再看一下 codex, 那 么我们打开 codex 的 设置,这里是可以看到 codex 的 使用量的,那我现在因为 codex 的 使用量已经用满了,所以这里是显示是用量为零, 那么我们进入到它的个人设置界面,第一块都是常规的设置,这里是有它的一些权限设置, 包括一些界面的位置,编辑器等等。第二块是个人资料,那么第三块是外观,包括一些主题的颜色, 选区等等。那配置这块,这里是可以第自定义它的 config。 那 codex 现在也支持第三方的模型配置,主要就是通过这里进行配置。 后期我会出一期如何给 codex 配置,我们除了 open io 的 模型以外的第三方的模型,大家可以关注一下,这里是一些个性化的设置,可以设置它跟你聊天的语气,亲和的,务实的,包括这里可以有一些自定义的指令, 然后这里是它的一些记忆的设置。那 codex 目前是有比较丰富的宠物声带,你可以在这个界面里面来唤醒 codex 的 宠物,也可以建一个自己的宠物,那这款还是挺有意思的。这里是一些快捷键, 那么这里会有一些使用计费的情况,这里是应用的快照,你可以在屏幕里面截屏后发给 codex, 会跟它做一些互动的交流,那 codex 在 多模态这块的交互还是非常流畅的, 那么这是浏览器,包括 codex 现在是在获取相应权限的情况下,是可以控制你电脑上的其他程序,那么有钩子连接 get 环境工作数。总的来说, codex 的 整个的工具生态其实是比较全面的, 那在对初步的界面进行对比完之后,接下来我们来具体的问题来看一看它们的反应情况。 那我们说起这个侧边栏,为了省时间,其实我之前已经对这个对话进行了测试。首先我让他用一句话介绍了一下自己,那 zcode 和 codex 的 一句话介绍都比较简洁,都突出了他们的编程的技能。 那后面我又问了一下他们最擅长什么, zcode 的 他主要分了几类,那么他一句话总结就是把软件工程任务从说清楚需求到 代码跑起来,并验证是他比较擅长的事,也就是他可以实现从需求到整体任务的完成,交付的一个全链条的任务的完成, code 的 擅长把他说的是把模糊的需求落实到可执行的工程结果,可以读懂代码定位问题, 他也是强调把关键取舍讲清楚,其实他俩的擅长的工作都差不多,就是把一个需求变成可实现的工程成果。 接下来我问了第三个相对复杂的一些问题,就是让他们帮我做一个深度的 ai 产业链研究,主要用于分析当下的股票投资决策。那这个问题我同时给到他们,首先 products 它在十一分三十七秒完成了这个报告的拷写, 那我们来看一下他的报告,这个报告从整体的框架可读性,包括结论,包括他的推理 都是比较不错的。针对产业链的研究,第一个是给了核心的判断,是结论先行的一个框架模式。 那么一句话,他的对 a i a 产业链的总结就是当前产业链不是单一科技主题,而是一个资本开支、先进制造、能源和软件商业化共同驱动的一个投资周期。接下来他从后旋池、漏斗、产业链分层和利润池、核心标的研究、 最高优先级以及一些风险风控方面,包括最下一步的研究路径,以及它的一些数据来源,都给了一些比较详细的描述。总体来看,它的这个投资研究报告其实不亚于一个初级研究员的水平, 这是 zq 的 深度调研的结果,它是花了将近三十分钟的时间,其实等的时间是比较久的,刚开始它也是给了一个执行的摘药。 首先是一句话的结论,包括五大核心判断,那这一点跟 codex 的 报告其实有点像它的整个框架,这里 dico 的 研究报告给了一个确定性与弹性的配置矩阵, 它是从产业链的上中下游来分析的。第一部分是上游的硬件,给了一些全球产业链上的一些标的,国外的包括国内的一些标的公司。第二个是 ai 的 基础设施,三部分是它的中游就是大模型云计算,包括从海外的大模型公司和国内的大模型公司来进行分析。接 下来分析了云计算平台数据标注,那第四部分是介绍了它的下游应用终端以及机器人这一块,而第五部分是投资的视角,六部分给的是投资建议,他这里强调了是仅供参考。最后他给了一份完整的标的清单, 那这个就是威蔻的关于 ai 产业链研究的报告,花了将近半个小时的时间,总体来说 它们的研究成果我觉得水平起码是可以达到初级研究员及其以上的水平。那从使用体验上来说,目前 codex 它的生态可能更多,它的多肽处理能力可能更强, coco 的 目前的这整个生态可能还在进一步完善当中。那具体这两个工具用起来怎么样,大家可以自己来试一下。那从国产模型替代来说,我觉得智普 coco 的 这款 a 键的工,一款非常好的 替代 codex 的 一个产品。如果说现在很多朋友用不了 codex, 那 我觉得 zcode 的是一个非常好的替代产品,而且它的模型推理能力也很强,有些并不亚于 codex, 大家可以自己在使用体验一下。好,今天的分享就到这了,欢迎大家点赞、关注、支持一波。

decap 哈尼斯真的太强了!我已经用哈尼斯和其他几个智能体做了对比,放在视频最后,大家可以参考一下。 哈尼斯发布不到一天的时间,在 github 上已经有八十五点七万的星星了,那哈尼斯到底是什么呢?简单来说就是国产的 codex 还完全开源免费,它比 codex 还要强的可怕, 模型可以换,工具可以换, skill 可以 换,就连 ui 和 age 的 能力都可以换。用官方的一句话就是一切接插件听起来是不是感觉特别牛, 更牛的是他的命中缓存率直接可以干到百分之一百,这是多么恐怖的存在。就好比你在两家不同的外卖平台上点了同一家店,同样的饭才刚刚送到你的手里。 同样,我用 webcording 和 hansel 做了一个对比,但还是 dicoise 和 hansel 做出来的东西更仔细,更贴合实际。 hansel 安装教程我已经放在主页下方的群里面了, 如果对 dicoise 和 hansel 有 困惑的地方,评论区打一个困惑,我会统一回复,我是阿凡,咱们下期见。

我做了一个用于快速产出可量化竞品分析报告的 skill, 它可以在十分钟内帮你做出这样一份 html 版可量化的竞品分析报告,你也可以选择同步输出其他格式的文档。 屏幕上展示的是我用这个 skill 做的微信读书竞品分析报告,大家可以看一下效果,它有招标结论,有竞品选择与原因、市场格局与用户心智定位对比、核心能力评分矩阵、核心功能矩阵、关键任务路径对比、 商业化定价与变现模式增长、运营 ai 能力的对比,还有最后会附上关键洞察机会、风险、行动建议以及可追溯的来源列表。具体报告包含的维度和内容呢,可以比我这更短或者更加丰富,取决于你最初设定的报告的目的,以及你选择的一些分析维度等等。 国人用 ai 做竞品分析的时候,有一个误区,就是一上来就只说帮我分析一下某某竞品,这样很容易得到一份很全但不知道能用来干什么的报告。而竞品分析的本质,其实是用外部的参照帮助自己做业务决策。无论你是做产品功能的规划、用户体验优化、运营增长,还是说商业化或者战略判断, 最终一定是要落到具体的决策和行动的,所以一开始就要明确需求,也就说你做这份竞品分析报告的目的。一份好的竞品分析报告至少要完成三层,第一层是试层,也就是竞品做了什么,效果怎么样,证据是什么。第二层是解释他为什么这么做,服务于什么目标。第三层是行动,也就是我们应该跟进差异化还是延后,或者说放弃 行动的优先级是怎么样的?为了更方便小白使用呢?我就把这一套做竞品分析的方法论流程注意事项做成了。这个 skill 他不会一上来就直接帮你开始写报告,而是会先问你几个关键问题来明确你的需求和使用场景。比如说分析什么产品目标是什么,给谁看,竞品名单要怎么确定重点维度是什么,最后要什么样的格式。问完这一系列问题以后呢,他会先生成一张 check list, 也就是分析的任务卡, 再生成报告的框架。等你确认完没有问题之后,他才会正式的开始帮你查资料,写报告。 然后它会把一些结构化的内容转换成格式化的,比如说热力表、雷达图、综合排行和行动优先级的看板,这样的报告就更适合分享和汇报 前。这个呢是这个 skill 的 第一版本,已经开源放到了 github 上,欢迎大家试用,有什么问题和建议可以提出来我来修改。如果需要我总结的竞品分析方法论的 pdf 完整文档和这个 skill 的 后续更新版本呢,可以在评论区留言和关注我。

我的妈呀,家人们感觉之前文献都白读了,发现一个超级超级牛的一个工具,他能帮你找文献,然后找最近高频出现的一些方法呀,或者是一些研究团队呀,目前存在争议的问题。然后还有包括如果你想要去进行一个对比分析论文的一个总结,然后 读完的整个文件夹的所有的一个总结啊,笔记的总结都可以去解决,就相当于是能解决你的全部的科研问题,真的真的超级超级牛,一定一定要去试试。就比如说举个例子,如果你有一个课题,你可以直接就是把你生成一个文档,我们可以来看一下这个文档,这个文档超级清晰, 就是你问的这个研究的一个所有的内容都在这个地方,比如说一些经典的文献,然后刚刚有说给出一个文献的一个原链接,我们可以看到它的原链接都在这个地方,而且它的主要一个贡献也会放在这个地方。然后你如果想直接去进行一个查看的话,我们点击这个原文, 我们就能直接看到这个原文。然后如果要是要去进行一个精读,或者是笔记的一些功能的一个制作的话,我们可以直接点击这个下载,然后直接导入到 skyray 的 里面去进行一个阅读,导入之后我们可以看到它这个原文,它这个如果去进行精读的话,这个阅读重点就知道这种研究目标,然后研究方法,然后一些比如说这种主要结论创新点,全部用不同颜色都给你标注出来,标注的非常清晰,我们点击之后能够快速跳转到原文去进行查看,可以看到原文也是标注出来的, 然后如果想要去高亮笔记的话,直接去进行一个高亮,直接去进行一个高亮笔记就可以了,非常非常的方便,看到它的原文的对照式分析也非常非常的清楚。然后像这种文献里面这种图标或者是某些公式,其实是非常 是非常重要的。如果你想看不懂,或者想要去让问 ai 一 些,或者是想要问 ai 一 些问题,直接点击右上角这个 ai 解释的这个功能,你记完之后呢,我们可以看到它这个 ai 会快速的去给你解释它这个图标的这个一个意思,然后它整体的目标里面讲的是什么样的内容,讲的也非常非常清楚,你有不懂的直接在这个地方去跟他进行对话就行了。然后你也可以去让他总结论文呀,梳理论文大纲,就相当于是所有的一个精读都可以在这个地方进行一个操作,非常非常的一个方便。 我们可以看到他生成的这些内容,就是我们刚刚需要的这些内容,比如说近近年高清出现的这些方法,然后主流的方法有哪些,微调的每个方向都有哪些,都会给你解释的很清楚,而且他这个表格你是可以导出去进行一个使用的,非常非常的方便。然后当你把这些东西弄出来之后,其实是一个比较宽泛的一些内容,你肯定还要去更加精细化你的一个研究主题。 然后你可以把上面给出来的那些中数的一些文献,然后告诉他用什么样的一个相关性去进行一个筛选,筛选出来比较重要的十篇,然后去进行一个总结和对比,然后我们看到他会告诉你这个总结的这个一个整体的一个逻辑的一个结构,然后建议 读的一个顺序,然后来看一下它这个总结的一个效果,就可以看到它这个总结的这个对比,然后什么样的一个类型,然后它的原文链接它论文是什么,然后然后每一篇都进行一个文件的一个精读,比如说研究目标数据结果是什么,局限性什么都非常非常的一个清楚,就是很详细很详细包,当然这个也是可以直接去进行一个导图使用的。 然后刚说了其实也可以对文件夹去进行一个分析,就是你读完的这些文件夹,你可以让他直接帮你整理这些所有的一个内容,就是相当于是你的一个助手,能够帮你解决全部的事情。就是找文件、读文件一直到写,然后一直到最 一个整体的一个规划,一个流程,包括你要如果,包括如果要是去给老师去进行一个汇报呀之类的,都是可以帮你解决的,真的真的超级超级牛,一定要去试试这个工具。

今天给大家来分享一下,我实际在开发的时候都在使用哪些模型,对你应该是比较有启发,尤其是对新人。这个呢是我的 qdax 账号,那实际上我的 qdax 账号呢?我有好几个, 这是我其中一个。那么现在呢,我使用 qdax 的 时候啊,其实是很少的。 呃,其实很少,那这些模型有新发布的五点六等等。呃,现在其实我使用国产模型比较多, 比如说 deepsea, kimi, k 三呢,我使用它们会比较多。呃,因为我接入工具的时候会非更加的灵活,比如说接入 open code 啊,接入,呃 vs code 啊,接入 tree 啊,接入 curser 啊,会更加的灵活。本身的话呢,我也要进行, 要参与到编码,有的时候要参与到编码。所以呢,我在实际使用的时候,我觉得咱国产模型其实已经挺不错了,已经是可以了,完全可以覆盖我的需求,而且国产模型使用上会更快一点,价格呢也更便宜一点。 所以实际上我有扣代词啊,我有 cloud code 啊,但是目前我用的用的其实是不多。其实是不多啊,基本上还是以国产模型为主,所以现在网上有很多人在聊这个, 在聊这个啊,扣带子啊,这样那样那样这样啊,呃,可能有的人是没有办法使用,那么我觉得呢,也不用说非得用这个,用这个扣带子,你像我他我现在基本都不用。 呃,国产模型其实绝大多数你的应用啊,你写小程序也好,写手机 app 也好,写 uni app 也好,写 swift 也好,写 flat 也好,其实是可以的。那出在出的问题呢,可能就是你本身 这个,嗯,操作的逻辑问题,跟 ai 的 一些对话的方式,你不要期待的,我有一个提示词,让他就能产生很奇妙的事情,这个是概率是非常低的,而且很容易出错。所以大家呢,其实可以使用国产模型,比如说你像这块我就使用 kimi、 k 三,是吧? 那这里边的话,我也可以使用 deepsea, 对 吧?我觉得国产模型其实非常棒,然后有的时候要编码的时候呢,我就可以使用咱们国产的这个软件叫 tree, 它也很方便。这个软件在没有 ai 之前我就在使用,我觉得挺好,现在据统计也有几百万人在使用,其实很好,大家呢,也不用非得 啊,宠洋媚外,然后这非得要用这些国外的,呃,其实是差不太多的,有一些那账号他是为了给你, 有一些是有一些其他的原因啊。对,所以大家可以使用国产,然后下个月可能是 deepsea 的 最新版,可能又要发布了,那个时候国产模型又是锦上添花, 对,就是这样一个概念啊。所以大家在使用模型的时候,现在来讲开发工具、大模型,嗯, 都可以使用,就国产模型没有问题。然后你使用,比如说像我使用 open code 命令行中专,我使用 open code 的 开源的,免费的,是吧?非常方便,非常自由啊。嗯,好,这这就是我的,我的一个分享啊。

对比一下 codex、 cloud code, harness 这三个 agent 到底有什么区别?先说一下它们的共同点,首先它们都是有手有脚的 ai 工具,只不过有的可以做更精细的活,有的就只能达到搬砖的效果。其次,它们都是桌面端的 ai agent, 都可以读写你的电脑文件,甚至操作你的电脑去完成各种各样的骚操作。然后重点来了,我们对比一下它们之间的区别。先说是否开源, powers 完全开源,而 codex 和 cloud code 都属于各自公司的产品, 是不对外开源的。再说模型支持,目前 codex、 cloud code 都更倾向于使用自家的模型, 其实说白了就是专为自家的模型设计而研发的。如果想要外接其他的模型,那么就必须要去接入一些开源的工具来实现,比如 codex 加加 cc, switch 之类的。当我们用这两个 agent 实现国产大模型对接的时候,又会发现 整体效果是大打折扣的。这里面呢,就是两个原因,一方面国产大模型确实比不上这两个世界顶尖级的, 另外一方面呢,就是外接国产大模型的这些开源工具。在国产大模型和这两个 agent 之间的路由转换 其实并没有很顺畅,翻译的不是那么准确。 harmis 呢,就不存在这个问题,模型上是随意切换, 它就类似于 opencll, 什么模型都能接,不被生态所绑定,不用为了更换模型去折腾很多的配置。最后再说一下它们之间的记忆体系, max 和 cloud code 目前主要还是依靠 md 的 记忆文件,然后再加上自己本身的自动记忆,需要的时候会以上下文的方式,然后把这些东西全部都注入进去。而 harvis 呢,在这方面就比较优秀了,当他解决完一个比较复杂的问题之后,他会自己学习并记住你的操作习惯 和偏好,自己创建技能来提升效率。当下次再遇到类似的任务,就可以直接调用,慢慢去学习你的做事风格,你的思维逻辑。也正因为如此啊, harmes 还有一个非常有意思的概念, portfolio, 你 可以把它理解成多个独立的 ai 智能体, 每个 portfolio 都有自己的记技能,上下文之类的,而且我们还可以创建多个 portfolio, 并且让它们之间彼此完全隔离。 对长期使用 aint 的 人来说, profile 真的 是一个非常非常好用的设计。当然在使用体验上啊, harman s 还是一个桌面端的新人啊,跟 codex、 color code 比起来,使用效果还是稍微有一些勉强的。 而 codex 呢,已经是属于完成度非常高的 aint, 特别是有了 computer user 之后,真的是如鱼得水,各方面的能力都很强。 color code 更倾向于专业的开发者,很多人去使用 color code 其实真的很难去发挥出它的真正优势。 那么最后总结一下这三个 agent, 我 觉得其实可以给它们分成三个级别,体验级、完整级和专业级。也就是说, harmony 相当于体验级, codex 相当于完整级,而 cloud code 就 相当于专业级了。那么这样一划分,这三个 agent 到底该怎么选的问题其实就迎刃而解了。看最后这张图。

二零二六扣的已经可以做美妆对比带货视频了,崩不住了。这还是我认可的 c 级教程,前后对比拍法思路我又行了,做带货视频两步搞定。一,安装 skill。 第二,把这段提示词和参考的 tk 链接产品图片就给你,这么简单看效果, not this again why does this always happen? 美妆前后对比展示使用效果立竿见影,爆款脚本很妥, tk 运营们可以放个一百年小长假了。