先说结论, webcoding 不是 让你变成程序员,而是让有想法就能做出来这件事 门槛降到了零。大家好,今天这期视频聊一下 webcoding, 因为我最近一直在开发软件,并且完全抛弃过去手写代码的方式。 webcoding 这个词是 ai 圈大神 andridge capacity 在 二零二五年初提出来的,它的原话是这么说的, 我完全不碰代码,我只负责描述我要什么,然后点全部接受。翻译成人话就是, 以前你写代码是一行一行敲,现在你只需要用中文告诉 ai 你 想做什么, ai 帮你全部写好。我举个例子,你说帮我用 next js 编辑一个登录页面,支持手机号登录风格,参考苹果官网, ai 就 能直接给你生成一个能跑的登录页面,你不需要知道里面是什么逻辑,你只需要感受这个效果对不对,好不好用,凭感觉编程歪不到了就行。 但很多人听到这里就会误解,以为 web coding 就是 什么都不用学,其实不是,它真正改变的是开发方式。同样做一个简单网页,过去的古法编程需要先学编程语法,自己做项目分析,自己写代码, 收答案,查文档,考验完整的软件编程能力。而 web coding 是 用自然语言跟 ai 提需求和 ai 协助解决问题,考验的是需求表达和结果判断能力。一句话总结,以前是人写机器跑,现在是人想 ai 写人来判断。 再介绍一下 web coding 在 实际开发中的真实流程,第一步,和 ai 聊想法,这个产品是干什么的,给谁用,解决什么问题。第二步,把聊天内容沉淀成需求,哪些功能是必须的,哪些以后再做。 第三步,拆解任务,把一个大需求拆成一个个小功能。第四步,设计 ui 页面长什么样,参考哪些产品。第五步,确定技术方案,用什么框架,数据怎么存。第六步,让 ai 写代码。第七步,运行测试,修 bug, 持续优化。你会发现,真正的软件开发 从来都不只是写代码,而是在不断地思考、表达、验证和迭代。那小白应该怎么开始呢?如果你完全不懂编程,千万不要一上来就做网站、小程序 app。 真正适合普通人的路线是一步一步,从最简单的 skill 开始。 比如先给本地 agent 写 skill, 自动总结文章,批量整理文件,自动生成文案、管理代办事项。先体验一下什么叫把一句话变成功能。第二阶段,做一个运行在本地的网页,比如 番茄钟记账工具、 total list 工具、字幕生成工具。当你第一次打开浏览器 看到本地页面跑起来的时候,那种成就感真的很强,因为从这一刻开始,你已经不是单存在和 ai 聊天, 而是在创造属于自己的产品。第三阶段,再进一步,学习代码部署、域名解析、数据库登录、注册、支付系统,把原来只有自己能用的小工具,变成别人也能使用的网站或者 app。 最后,我还是想给大家泼一盆冷水, web coding 不 等于你什么都不了解就能开发出大家都能使用的软件。 ai 可以 帮你提高效率,但不能替代你的判断。你还是需要补充一些基础知识, 比如基础的工程知识,基础的编程语言知识,基础的前后端协助原理、不同场景下的产品设计能力,以及最重要的调试和排查问题的能力。 ai 能帮你写代码,但无法替你理解代码。 web coding 降低的是软件开发的入门门槛,而不是学习门槛,它让不会的人开始做,让会的人做得更快。好的最后总结一下, web coding 就是 用自然语言描述需求,让 ai 帮你写代码, 它不会让你一夜变成程序员,但它确实给了每个人一种超能力,有想法就能做出来。但是要想让代码真正运行到生产环境,还需要了解编程的基础知识和完整的软件工程流程。 如果你已经开始尝试 web coding, 评论区聊聊你做了什么产品,踩了哪些坑。关注我 ai, 分享实战技巧,我们下期见!
粉丝1.5万获赞2.4万

大家好,我是大叔,只说真话,只做实在事,只给干货。你有没有这种经历? ai 能写代码,能写文案,能分析数据,但你让它打开浏览器,截个图发给你,它就卡住了。 因为 ai 从设计上就只有自然语言这一条交互通道,它能看到你的文字,但看不到你的屏幕,更操作不了你的鼠标和键盘。我是大叔大,不断实测,持续分享,一起用好 ai。 这期聊聊 opencloud bridge, 让 agent 长出一双真正能操作 mac 电脑的手。先说说痛点在哪?现在的 ai 确实强,能读懂上下文,能自动写代码,能处理文档。但有一件事,几乎所有模型都做不了,就是直接操作操作系统桌面。 你想让 ai 帮你截图,点按钮、填表单、拖文件到指定位置,它做不到。因为从架构设计上, ai 和大模型就没有操作系统的交互通道。 open claw 通过 pickpocketbridge 这个方案给 agent 装上一双机械手,在 l l m 和操作系统之间架了一座桥 以后,你对 agent 说,帮我截个图发群里,他自己就能完成,全自动,不需要你动手。 pika bu bridge 的 核心架构是主机加客户端模式, openclaw 在 本地启动一个 unix socket 服务,充当 bridge host。 pika bu c i i 作为客户端,通过这个 socket 驱动 ui 自动化。最关键的设计决策是,他直接附用了 openclaw 已经授予的 tcc 权限,也就是屏幕录制和辅助功能,不用用户重新授权。 除了 pick up boo bridge 还有两条桌面控制路径,三条互不冲突。 codex computer use 走的是 codex 插件机制,在 codex 模式下独占总线, core driver mcp 直接注册为标准 mcp 服务, 适合封装成可编程接口对接其他系统。想用通用 macos 自动化,选 pick up boo bridge codex 模式,依赖原声插件就选 computer use, 需要标准 m c p 接口,选 car driver m c p 配置。过程非常简单,两个步骤就够了。第一步,打开 l x r s app 的 偏好设置,找到 enable peekaboo bridge 开关,打开它, 开启后 openclaw 自动启动本地 unix socket 服务。第二步,安装 peekaboo c o i, 在 终端里输入 openclaw skills install peekaboo, 这个命令会从 skill 仓库拉取客户端。装好之后, peekaboo c o i 会自动发现可用主机,优先顺序是 peekaboo 完整版,然后是 cloud app, 最后是 opencloud 的 清量代理,可以用 pick up bridge status 杠杆 verbus 查看当前活跃主机和 socket 路径。桥接通了以后, agent 获得的能力。覆盖 macos 桌面交互的八个完整维度。第一个是截图,支持全屏截图、指定窗口截图和菜单栏区域截图。第二个是点击, 支持按元素 id 定位、按屏幕坐标定位和按查询表达式定位。第三个是打字输入,支持普通文本输入,也支持 command 加 c 复制、 command 加微扔贴、回车发送这些控制键组合。第四个是窗口管理,可以对任意应用窗口执行关闭、最小化移动位置、 调整尺寸和聚焦操作。第五个是菜单,系统支持读取应用菜单层级结构,触发包括状态栏菜单在内的任意菜单项。第六个是 doc 栏控制, 支持启动应用,触发右键菜单、隐藏窗口和列出运行中的进程。第七个是对话框处理,支持按钮点击文本,输入文件选择和关闭。第八个是拖拽, 支持元素之间、屏幕区域之间和 dock 图标之间的拖放。所有命令都支持杠杠 jason 或杠 j 参数输出结构化数据,把这些能力串起来,就是一个标准的操作闭环。第一步跑 peekaboo permissions 确认 tcc 权限已授予。 第二步跑 peekaboo list apps 刚刚推送,查看当前运行中的应用列表,确认目标应用已启动,接下来适合新操作用 peekaboo c 刚刚 annotation 刚刚 pass 对 当前屏幕截一张带自动标注的图, 每个可交互的 ui 元素都会自动分配为一编号按钮标为 b 一, b 二,输入框标为 t 一, t 二,复选框标为 c 一, 拿到编号之后用 peekaboo click 刚刚 on 加编号, bridge host 会定位并触发点击, 需要输入的话用 pick up book type 加文本内容,再加杠杠 return 自动回车提交。配合 opencloud agent 调度能力,你只需要用自然语言说一句, 把这个设计稿网页截图用预览标注修改意见,导出成评选报告, agent 就 会自动打开浏览器,全屏截图,启动预览工具,标注修改位置,导出为 pdf 跨浏览器预览和文稿三个应用无缝衔接。最后总结四个核心要点,第一,架构层面, openclaw 作为 peekaboo bridge 主机,通过 unix socket 在 本地提供服务,监听并执行来自客户端的结构化自动化指令。 第二,权限附用,直接使用 open core 已授权的 tcc 权限,省去从副授权流程。第三,配置极简,开开关装 skill, 自动发现,两步完成,零门槛。第四,操作模型 c 截图标注做视觉感知,拿到元素编号, click 精准点击触发动作, type 键盘输入,完成交互。三步闭环,实现从看到点的完整自动化循环 agent, 从此能看能点能打字。 mac os 全自动化从理论变成了现实, openclaw 在 国内越来越实用, mac os 自动化只是第一步。感谢观看,我是大叔大,后续会持续更新,下期见。

怎么让 cloud code 超长时间运行一个任务?智普的 glm 五点二终于发布了,这次主打的是百万上下文和长时辰任务能力榜单,编程能力依旧是国产模型第一,开源模型第一, 主流机准实测接近 cloud ops 四点八。但是我有些听腻了,为了测试它的能力,我用它将全网爆火的 openclaw 用 python 翻译了一遍,做了个 python 版的 openclaw, 结果让我有些头皮发麻。 openclaw 有 四十多万行 type script 的 代码,十多个核心模块儿, 而我用 g o m 五点二配合 cloud code 连续跑了十三小时写出来的 python 版,完美还原了大部分核心能力, 能网页聊天、使用 m c p 工具安装和运行各种 skill, 比如生成图片、获取网站内容到本地, 可以说小小龙虾直接拿捏。整个过程从模块拆解、方案设计,到代码开发、测试验证,全都由 ai 完成,体感上已经做到了指哪打哪。这就意味着国内的 ai 已经具备稳定长时间跑大规模工程的能力了。 后续同类大规模项目,比如公司里那些某山项目,我都可以用它来做代码重构、跨模块接口开发, 甚至排查各种疑难杂 bug。 以后我想做什么功能,我完全可以扔给他一个代码仓库,让他调研某个功能,然后加到我的项目里。我知道很多朋友其实还一直认为 ai 写的代码只能做小玩具,但过去半年,我确实没再手动写过一行代码了。 所以接下来这个视频,我会把工程上用 cloud code 的 长时辰跑大规模项目的方法完整分享出来。那么看之前你点赞了吗?关注了吗?谢谢!怎么实现长时辰任务? 想让 ai 长时辰工作,本质上就是写个无限循环,跑多个任务。大模型只要判断任务没完成,那就继续跑。 注意,这里的关键词是循环和多任务,这个循环的能力在最新 clodou 的 版本里,可以通过 loop 或 go 命令实现。而任务则需要我们根据需求做好拆解,如果拆的不够清楚,验收条件模糊,那模型会很容易提前判定任务完成。 所以我们需要维护一张清晰的任务清单,只要每个任务都拆的足够细,验收条件足够清晰, ai 就 能照着清单持续执行,不至于跑一半就提前收工。这个拆任务清单的能力可以通过 superpowers 加一些提示词来完成。 拆出来的任务会在每一轮对话中结合历史聊天记录工具、执行日记、系统提示词。这些东西拼在一起发给大模型, 这些拼起来发给大模型的内容统称上下文。而大模型一次最多能接受的上下文长度就是所谓的上下文窗口 agent。 长时间运行的过程中,上下文会越来越长,一旦超出上下文窗口,就需要压缩或丢弃信息, 这就导致很多模型跑的时间一长,就会偏离一开始定下的目标。所以长时间跑大规模任务需要有大的上下文窗口。于是今天百万上下文窗口几乎就成了当前业界标配。 但很多模型虽然标称支持百万上下文,但实际跑起来你会发现,上下文一旦变长,模型就会开始忽略一些信息,也就是常说的 lost in the middle, 体感上就是标着百万,但实际能用到的却没那么多。而智普最近发布的 glm 五点二在底层注意力上做了非常多的优化, 主打的就是真能干活的百万上下文。所以接下来我会拿 openclaw 这个四十多万行的大项目实测下它的执行效果。大概的流程是,我会先用 ai 读取 openclaw 项目源码, 将它拆成多个功能模块,再根据多个功能模块拆成多个任务和一张清单列表,使用 go 命令不断获取清单上的任务,做完一个就更新列表状态,直到全部完成。过程中用到的提示词以及 g l m 五点二的接入方法,我都给大家整理好放到文档里了。 规划需求,我们先在项目中将 open call 的 原码拉到本地,输入这段提示词进行需求规划。 这段提示词会让 openclore 启动多个 agent, 把整个代码库翻一遍,然后整理出代码仓库的多层架构, 里面会列出每层架构里的组建模块,从低到高,依赖关系一清二楚。之后, cloud code 就 会不断通过对话跟我们确认一些方案细节,比如 agent loop 怎么实现,怎么对接大模型、 http 框架用哪种等等。 接着产出一个完整的迁移清单,确认后就会开始生成对应的模块设计文档。比如 agent loop 想改用 long chain, 可以 直接让 ai 调整。确认后, ai 会根据模块生成三十多个 spec 文件, 里面会列出 openclore 的 架构定位、基础站选型、需要迁移的模块等信息。对于四十多万行的大规模项目, g o m 五点二能做到这么清晰的梳理架构已经让我很惊喜了。同样的提示词,我用上下文窗口为二百 k 的 g o m 五点一试了下,在这一步就会因为上下文长度过大导致报错。不管是压缩上下文还是其他什么操作,都没法继续跑这个任务了。 虽然他已经很努力将任务拆成是四个字 a 阵在跑了,但这类超大规模项目确实还是有些为难他了。 拆解任务确认没问题后,接下来再输入下面这段提示词, ai 会根据 spec 里的功能要求拆解代码功能,再按功能点要求拆解任务,生成代码执行计划。注意,这里的每个任务都要求 ai 描述清楚需求点,给出准出标准和验证方法。 glm 五点二就会按模块生成大量计划任务。最终 ai 产出了四百四十三个任务。每个任务的功能力度都非常细,比如在 agent 核心这部分会细到怎么进行压缩、摘药等细节设计。同时,上面的提示词还会生成一个管理这四百四十三个任务处理进度的文件 循环执行需求和开发任务都定下来了,接下来就是让 ai 一 步步执行任务,使用 cloud code 的 go 命令,这个命令会让模型自己一轮一轮往下干,每一轮干完,独立的评估模型会检查这次达没达标,没达标就带着反馈进入下一轮,直到你在 go 里设的那个目标彻底做完,它才会停 在我们这个场景里。可以这么使用 go 命令,让 ai 每次都从进度文件里获取没完成的任务,每盖完一个任务就更新进度文件,下一轮继续重复这个流程,这样就算中途断了也能接着跑,不用从头再来。并且我还在提示,此里要求每次写完功能都进行一轮代码提交。 这里有两个点需要注意下,首先是我把提示词都压缩成了一行,因为 go 命令会把提示词塞进 cloud code 的 hok jason 里,待换行,容易触发格式报错。其次是记得按 shift 加 tab 键把执行权限切到 bypass permissions on, 这样能减少很多不必要的权限确认弹窗, 不然 ai 每写个文件都会停下来问你要一次确认,半夜挂着跑,没人点确认,他就卡在那干等了。执行够命令之后, ai 就 会进入超长时间的工作,现在我们就可以出门遛弯了。 效果展示,整个过程跑了十三个小时。接下来就是验收环节,我们没法指望 ai 一 次性就把所有事做到完美,肯定还有要调整的地方,所以如果觉得哪里有问题要改,直接在聊天框里让 ai 做修改就行。我能明显感受到 glm 五点二的指令遵循能力明显变强了不少, 绝大部分调整都是一遍过。比如修问题的时候,我发现龙虾会不断重复执行历史对话内容,导致重复跑。任务反馈给 g o m 五点二后一次修复就完成了。之前用其他模型时常遇到的,不要乱改我的代码,你还是没理解我的意思,这次一次都没出现。 最后来看下效果,我们以网页聊天页面的形式接入了 python 版的 openclock。 因为之前我测试的时候给他命名着小白虾,以及让他叫我老板,所以他现在回答我的时候能记得这些信息,同时说话也挺俏皮,说明灵魂和记忆模块都是正常工作的。 问他上海闵行区的天气和今天的日期注意,他能回答出天气,却回答不出日期,是因为我给他安装了天气的 m c p 插件,没有安装日期插件,然后让他生成一张写实风格的女生照片,他也能调用我提前安装好的 skill 完成, 再让他将这个 glm 五点一的技术文章下载到本地文件,他也能调用工具完成写入说明。网页访问和本地文件读写能力都是好的。 整个开发过程完整走了一遍,需求分析、任务拆解、开发测试,这些流程跟我们平时做真实项目时一模一样。开头的那句话,我已经半年没手写过代码了,就是靠的这套流程。一个四十多万行代码的项目,从拆解到开发工作量极大,但现在只靠 glm 五点二就完成了开发, 配合上 talking plan 的 价格,我只能说确实行,非要说有什么缺点的话,就是 g l m 五点二依然是文本模型,所以页面审美会差一些,同时也没法直接丢张截图让它修问题,期待下个版本能出个多模态。 现在大家通了吗?好了,如果你觉得这期视频对你有帮助,记得转发给你拿不成器的兄弟,文字版的笔记见评论区,这里是小白的 bug, 我 们聚焦一切可能影响人类历史进程的技术,如果你感兴趣,记得关注我们,下期见!嘟嘟嘟嘟嘟嘟嘟嘟嘟嘟。

opencore 的 格式化配置,零代码搭建专属 ai 业务规则 opencore 的 格式化配置就是不用敲一行代码,全程通过图形界面, 用点击勾选、填数字的方式给 opencore 设定行为逻辑,它能帮我们把业务需求转化为 ai。 能理解的规则 主要集中在三个方面,第一个,设置触发条件,告诉 open core 在 什么情况下你要开始工作。这些条件不需要写代码,只需要在界面上找到对应的选项,勾选条件类型,填写具体数值或内容,就能完成设置。第二个, 定义审批流程,这对于需要多环节协助的工作来说特别实用。整个流程的先后顺序、审批人、触发节点都可以通过拖拽、勾选来调整,全程可视化, 哪怕是复杂的多环节审批,也能轻松配置。第三个配置,数据自断的映射关系,就是让 open call 知道不同数据之间怎么对应。比如我们接入了客户管理系统和合同系统, 就可以配置客户名称,对应合同中的甲方名称、客户联系方式自动同步到合同备注栏,不用手动复制粘贴, ai 会根据我们配置的应设规则 自动完成数据同步。这一步同样不需要代码,只需要在界面上选择对应的字段建立关联即可。这里要强调一个关键,这种格式化配置和我们之前说的基础设置不一样, 它真正嵌入了我们自己的业务规则。每个人、每个企业的工作流程都不同,有的合同审批简单,有的复杂,有的需要关注金额,有的需要关注客户等级。 open call 的 格式化配置还有一个很大的优势,灵活调整。比如我们后期业务调整, 需要把五十万的审批域值改成八十万,不需要修改任何代码,只需要回到配置界面, 找到对应的条件,修改数字保存即可生效。如果需要新增一个审批环节,也只需要拖拽新增节点,选择审批人就能快速完成调整。下面以企业合同自动审批为完整场 景,从头到尾演示 open q r 格式化配置的全流程。从进入界面设置触发条件定义、多级审批、配置数据同步到最后测试生效,每一步都通过界面点选完成, 完全不用写代码。进入格式化配置后台,登录已部署好 opencore 的 云服务器管里面板,找到规则引擎 格式化流程配置入口,点击新建流程,命名为公司合同自动审批规则选择场景,合同管理。第一步,设置触发条件,告诉 ai 什么时候启动目标,合同金额大于等于五十万,自动走高级合伙人审批。 五十万部门经理审批,在左侧触发模块中拖拽文件,上传数据提交到化部中央,点击该模块,在右侧面板设置触发来源合同上传系统。触发条件,合同金额判断逻辑大于等于数值五十万。 条件名称,合同金额超五十万,再添加一条并行条件,合同金额五零零零零零,命名为普通合同审批。第二步,定义审批流程, 拖拽搭建审批链,分支案金额大于等于五十万。高级流程从左侧审批节点拖拽单人审批模块,连接到超五十万条件出口配置该节点审批人 senior partner 高级合伙人审批,实现二十四小时审批通过后自动发送合同至财务部备案。再拖拽通知模块,设置通知对象,合同提交人财务负责人通知方式,企业微信加邮件 内容,合同合同名称已通过高级合伙人审批分之币金额五十万普通流程同样拖拽单人审批 连接到普通合同条件,配置审批人部门经理审批,实现十二小时超时处理,自动提醒 加升级至总监,连接规划模块,自动标记为已审批并同步至合同库。第三步,配置数据自断映,设自动同步信息,让 open call 自动提取 对应回填数据进入字断映设面板,设置来源,合同表单目标审批系统客户名称合同甲方合同金额审批金额预值提交人审批通知人合同编号审批单编号开启自动填充以后上传合同, 所有字段自动匹配。第四步,设置异常与驳回规则,添加条件判断,若超时未审批, 自动升级审批层级配置,驳回通知内容,合同合同名称被驳回原因,驳回意见请修改后重新提交。第五步,保存起用并测试全流程点击右上角保存流程起用测试。上传一份六十万合同, 系统自动触发高级合伙人审批并发送通知。上传一份三十万合同,自动分配给部门经理,同步自断并规范查看日制,所有步骤触发审批通知都有记录,可追溯后期修改,全程可示化。 想把五十万改成八十万,直接点开触发模块,改数字保存即可。想加一级总监审批,拖拽一个审批节点,插入流程连线即可。想改通知内容, 直接编辑通知模块的文本模板,整个过程就是拖模块、点配置、填数值,连流程测生效,完全是搭积木,和拍甚代码没有任何关系,业务人员自己就能完成专属规则配置。

如果你身边有人真的在用 codex, cloud, code, hermes、 open claw, 甚至已经在用他们做事,我建议你珍惜这种人,不是因为他们一定多厉害,而是这种人身上的特质很少见。他们愿意接触新,愿意研究,愿意去测,也愿意把工具变成结果。 这种人通常都有几个共同点,认知不低,执行力强,信息整合能力强,探索欲也很旺盛。你跟这样的人待久了,不是他非要教你什么,而是你的信息密度、思维方式、做事节奏都会慢慢被拉上去。 人和人之间的差距,很多时候不是努力差出来的,你身边的人就是你的信息环境,你每天听什么、看什么、聊什么,最后都会变成你的一部分。所以一定要靠近那些愿意探索新东西的人, 他们不是在跟风,他们是在提前和未来打交道。你离这样的人越近,你被拉上去的概率就越高。


给大家看一下不会代码的人怎么用 openclaw 生成游戏,并可以持续优化。一开始我在 openclaw 里输入生成一个贪吃蛇的游戏,以网页版的形式保存在我电脑桌面上, 大致两分钟游戏就好了。在电脑桌面上打开是这样子的, 游戏存在一个明显的不足,就是速度太快了,玩不了。 于是我进行优化,对 openclaw 打文字说把速度降为原来百分之五十的同时,加上蛇吃苹果的生效。这一次生成的时间比较长,大致三分多钟才好。在电脑桌面上点击后是这样子的, 大家看速度慢下来了,同时加上生效了。从目前应用情况来看, openclaw 最大的突破就是完全不会代码的人通过文字表达就能生成相应的软件了,以后有想法的人将不再受限于编程技能了。

还在折腾 open 科奥部署版本不对,依赖报错,端口冲突敲满屏,代码依旧启动失败,小白直接劝退,对接模型,密钥调试权限,适配插件设置后台运行, 全套操作繁琐复杂,浪费大量时间精力。本地部署会留存全部配置与密钥数据,电脑共用,换机重装极易造成隐私和 a p i 额度被盗风险。 传统部署绑定单台设备,换机重装系统全部作废。自定义设置,无法留存复用,告别繁琐部署 u 盘定制版 open call, 无需代码部署,无需适配环境,无需调试,依赖 windows macos 全平台兼容,叉机直接启动,新手离门槛上手,随时随地开启 ai 智能体, 全程 u 盘独立运行,电脑本地零缓存零配置零密钥残留,内置加密防护机制, api 密钥自定义配置,全部加密封存于 u 盘, 彻底杜绝隐私泄露。额度被盗,恶意篡改风险。 支持全维度自定义设置主流大模型,自由切换插件,随心安装 智能体技能,自定义调试额度,精准管控界面个性化设置,所有定制配置,永久封存 u 盘,不随设备更改丢失。 专属你的私人 ai 工作站,小巧便携,随身携带,告别一机绑定,限制 所有设备即插即用,无需重复部署调试,一次定制终身附用,高效解锁 ai 办公创作运维全场景, 拒绝无效折腾 u 盘版 opencloud, 解决所有部署痛点,新手小白,资深玩家都能用的专属便携 ai 智能体。

大家好,今天我们将一同深入探索智普 ai 当前最强的旗舰模型。 glm 五点一作为全球最强的开源大模型,它凭借其卓越的代码能力、强大的 agent 能力和超长上下文处理能力, 重新定义了开源模型的技术高度。接下来我们将全面解析这款强大的模型。本次分享将分为五个部分,首先,我们将了解 glm 五点一的基本情况,接着我们会重点介绍其核心参数,之后我们将深入探讨它的核心功能。第四部分,我们将分析用户体验。 最后,我们将客观评价其优势与挑战。首先, g o m 五点一是智普 ai 目前最强的全能旗舰模型,被誉为全球最强的开源大模型,它的综合能力已经达到甚至超越了国际顶级的闭源模型。 最关键的是,它采用了 ipad 二点零协议开源,并且允许免费商用,这对于推动 ai 技术的普及和创新具有里程碑式的意义。 glm 五点一的核心参数非常出色,它采用了先进的 mve 架构,拥有七四五 b 的 总参数,能够在需要时调动大量专家知识。它拥有两百 k 的 超长上下文窗口,这意味着它可以支持长达八小时的连续工作, 处理非常复杂的长城任务。在核心功能方面, glm 五点一的代码能力是其最大亮点。在权威的软件工程评测中,它的得分全球第一, 超越了所有主流模型。它能够进行长达八小时的不间断开发,完成一个完整的项目。同时,它的 agent 能力也非常强大,能够自主完成复杂的任务。除了代码和 agents, glm 五点一的长文本和推理能力也同样卓越,它的两百 k 上下文窗口让它能够一次性处理海量信息,比如几十万行的代码库,在各项推理评测中,它的表现也达到了世界顶尖水平,与 gpt 五点四不相上下。在用户体验方面, glm 五点一的长城任务处理能力非常出色,能够像一个真正的专家一样,从头到尾完成一个复杂的项目。更重要的是,它的成本效益极高,推理成本仅为国际顶级模型的三分之一,并且开源免费商用,这为企业节省了大量的成本。 最后,我们来总结一下 g o m 五点一的优劣势,它的优势非常突出,全球最强的开源性能,免费商用,代码和 agent 能力全球第一,是被国产芯片以及极高的性价比。当然,作为一个开源模型,它的生态建设还需要时间, 并且部署和微调对技术能力有一定要求,但总体来看,它的优势远远大于挑战。 g o m 五点一无疑是国产 ai 的 骄傲,它凭借其强大的性能和开放的姿态,为全球 ai 开发者和企业提供而一个前所未有的强大工具。希望今天的解析能帮助大家更好地了解这款优秀的模型,感谢大家的聆听!

让 ai 写代码之前,你有没有想过一个问题,他写的方案真的靠谱吗?问题出在这同一个模型,既写方案又给自己打分,他怎么可能主动挑自己的毛病?这就是为什么你的项目总是上线就崩。 real me codex 这个 skill 解决的就是这个问题。他把写方案和审方案拆成两步,第一步,让模型先把需求问到骨子里,边界条件失败,分支数据库约束, 全线路径一个都不放过。第二步,把方案交给另一个模型,按代码审查的方式,一轮一轮找漏洞,默认最多跑五轮, 直到主要风险被压出来。重点是不是修了,就算要看是不是假修复,说明写了,但逻辑没接上,这种最要命。你写代码会先做方案审查吗?还是直接干评论区?聊聊你的习惯。

今天,我们将继续探索 open core 的 强大技能生态。这次我们将深入解析五个非常独特且功能强大的技能,它们分别专注于代码审查、商业智能语音转写、浏览器 自动化和加密文档处理。将为您展示 openclaw 如何在更多专业领域发挥巨大价值。首先我们将了解 code reviewer, 一个能自动审查代码的 ai 专家。接着是 stripe it, 它能帮你分析支付数据。然后是 whisper local, 一个本地运行的语音转写工具。之后我们会介绍 playwrite, 一个强大的浏览器自动化引擎。最后是 encrypted pdf reader, 一个能安全解密 pdf 的 技能。先来看第一个技能 code reviewer, 这是一个开发者的好帮手,它能在你提交代码时,自动帮你检查代码中可能存在的 bug、 风格问题或安全漏洞,并给出修改建议。这不仅能提升代码质量,还能大大加快开发流程。第二个技能是 stripe, 如果你使用 stripe 收款, 这个技能将非常有用。它能连接你的 stripe 账户,帮你实时查询收入、订阅用户等关键数据。你可以随时问他昨天的收入是多少,他会立刻给你答案,让你轻松掌握业务状况。 第三个技能是 whisper local, 这是一个注重隐私的语音转写工具,它完全在你的本地电脑上运行,不需要上传任何音频到云端,非常安全。无论是会议录音还是采访音频,它都能帮你准确地转写成文字, 而且完全免费。第四个技能是 playrite, 这个技能非常强大,它给了 ai 一个真正的浏览器环境,你可以命令它帮你登录网站、填写表单、抓取数据,甚至完成复杂的购物任务。它就像一个不知疲倦的网页操作专家,能够处理各种动态网站。最后一个技能是 encrypted pdf reader, 你 是否经常收到加密的 pdf 文件而 ai 无法读取?这个技能解决了这个问题,你只需提供密码,它就能在本地安全地解密 pdf 并提取内容,然后进行摘要或分析,非常方便。以上就是本次关于 open call 五个独特技能的全部介绍,这些技能展示了 ai 在 代码审查、商业分析、语音处理、网页自动化和文档解密等多个专业领域的巨大潜力。

大家好,前几期跟大家讲了一下这个 honeycomb 的 一个软件,那我们现在详细的给大家介绍一下 honeycomb 的 一个使用。我们先从它的一个设置开始, honey 口的设置在上面左上角有个齿轮状的地方,就跟很多的系统都是一样的。点开设置,我们首先进入的是一个助手界面,在助手界面你可以自定义你的一个助手啊,在这边点击添加就行了啊,它是有四个预设的一个助手,一个助手是更富有情感的, 这种呢就适合日常你跟他聊聊天。呃,这个是初使的一个助手,更更加均衡,它就叫 hana 口, 还有一个更加理性的呃,这种助手呢就适合帮你做一些代码,或者说呃日常办工艺办公的就可能比较合适。还有一种是空,是仅仅呃他是 他的所有的包括身份简介跟他的意思都是空的,就相当于需要你自己去给他一个定义,那这边你也可以自定义你的一个助手的名,这里我就没改,就直接叫哈纳口,我觉得挺好听的, 你可以选择它的模型,你可以点开之后在这边选择一个它的模型都是可以的啊,我这边使用的是 miui 的 v 二点五 pro。 这边身份简介其实你是可以自己改的,如果你觉得原本的 hanako 的 一个身份简介跟意识并不符合你的想法,你可以在这边进行更改。 身份简介是简短的描述助手是谁,他擅长什么,在意识界其实他的人格啊,比如说这里的哈纳口,你是一个有温度的存在,而不是冷冰冰的工具,还有他的一些日常的说话的语气都是可以进行更改的啊,就是一个记忆,这也就是告诉你的助手 他一定要记住的东西,你可以手动的进行编辑,或者说啊,日常跟他聊天中也可以跟他说,你帮我把这个东西记住,写入你的记忆。我之前有关龙虾的课程也讲过这些东西啊,其实也是一样的,但是这个东西更为方便,这对那种 可能不太会编程的朋友来说,这个可能是比较方便的,是在经验这个你的助手他学会的一些技能也是可以在这边的,当然这边作者也提醒了他是默认式关闭状态,开启后助手可能会自动的总结工作经验,并不断的 开奖,但是有污染上下文的风险。但是我认为对我日常的使用来说,我觉得开可能使用的比较好一点,因为这个是我用的一个演示 honda 考,所以说他这边没有经验。最后就是工具, 工具,这他原本是没有开启的啊,反正我下过来是没有开启的啊,我是个人比较推荐点开浏览器,定时任务以及安装技能这几个公啊。当然后面如果您有 配置连接飞刷,连接 qq, 连接微信啊,你也可以在这边多开一些技能,都是没关系的,后面我也会教大家如何去让你的微信飞书 qq 去连接到你的 honey 口啊,这是它的一个助手功能。

很多人问我,用什么 ai 工具写代码最好? excel 机密里谁最强?为了测评这三种全球顶尖模型,我写了一个生成个人网站的 still, 内容大概是这样的,同样的,指定三款顶级 ai, 一个经验,一个稳当,还有一个,只能说他尽力了。三款 ai 建网站的真实差距,今天一字看明白,为了公平,我输入了相同频率词,一个字不改。先看 cloud, 生成速度很快, 出来的页面说实话有点经验,而且他直接给了你一个可执行的 h t m 文件,双击就能跑,零配置打开即用,体验非常顺畅。 再看 excel, 布局工整,深色模式切换逻辑清晰,代码结构也很规范。和可乐的一样,他也支持直接下载文件运行,该有的功能模块都有,属于那种中规中矩,少点惊喜的类型,和可乐生成的内容丰富度上还是有点差距的。 最后一个就是机迷你,和前面两个比起来,差距主要体现在以下两个地方,第一, 他不提供可执行文件的下载,他需要你手动复制代码,自己将文件保存才能运行。虽然只多了十几秒的操作,但和前两个一键搞定比起来,确实没那么方便。第二个,生成的页面的功能有点生硬,页面锚点无效, 页面模块缺失,和 cloud 的 gpt 放在一起对比,明显能感觉到它生成的效果。对 skill 的 理解还不够到位,所以结论很清晰, cloud 的 设计感和体验感都拉满,适合追求视觉效果的人。 k 的 gpt 稳定可靠不出错,适合想要更稳妥方案的人。 机密里能用,但细节和辨别度还有待提升,到这里大家心里应该有答案了吧,在养龙虾的时候,选择合适的模型可以事半功倍,还有什么疑问评论区告诉我,下期见,记得点赞关注哦!

大家好,我是兔兔,欢迎来到我的频道,真的是好久不见,差不多一周的时间了,我都没有发视频,因为 上个星期我就在家研究 open call, 都没怎么出门。这个时间呢,说长不长,但是 也不算很短了哈,要问我在这个过程中有什么进展,有什么发现?我想先分享一个截止目前为止 最大的感受。我好像终于理解什么叫技术超能力了,作为一个完全不会写代码的普通人,现在我可以让 ai 来帮我写程序,部署服务、调试硬件,甚至操控远程设备。 而以前一些脑中的奇奇怪怪的想法也有落地的可能了,真的是一个一个做出来了,最夸张的是,他已经从软件层过渡到了物理层。 我知道这么说有点虚,有点玄乎,但这确确实实是我最近一段时间来的一个真实的感受。那么在具体分享我用 oppo cloud 做了什么之前,我想简单的分享一下我在这上面投入的硬件软件的成本。 先讲一讲硬件成本,我在分享初次体验 opencloud 那 期视频当中就有提到过,我在去年底其实就买了一台六十四 g 版本的 mac mini 四 pro, 当时本来就是想拿来跑一些本地大模型研究研究 ai, 然 那阵子呢,处于超级新手期,都还在想怎么样去利用好这台设备,结果没过多久, overclock 就 出来了,这个真的就是巧了哈,硬件层面来讲就属于遥遥领先了。 那这个 overclock 其实已经经历过三次更名了,问世的时候真的是超火爆,很多人就到底用什么设备去装,也是掀起了不少的讨论, 都说可以不用 mac mini, 用其他的设备,那我呢,刚好手上有一台,最开始就用的是 mac mini 嘛。然后在过去一周呢,我其实也尝试过用三种不同类型的设备都去试装体验了一下。 首先我试了用 zmar broad, 它的系统是 zmar o s, 能不能装?当然能,它的应用市场都自带了,更新的非常快,我就试了一下,结果发现这种被动散热的设计呢,就会导致它在运行的时候 非常烫。其实目前呢,清迈还处于没有到夏季最热的时候,但是我感受到那个机器烫的程度到什么程度,可以煎蛋了。我很担心长期这个样子使用,所以这种散热压力就会导致在运行 open club 就 有一点卡卡的。 其次是我的一台小主机,华硕 n u c 十四 pro, 那 这台小主机的硬件性能是很强的,跑起来是绰绰有余,但是呢,我是把它放在国内的,是远程控制的这么一种状态, 结果就遇到了网络环境的问题,在调试方面呢,挺麻烦的。后来呢,家人还跟我反馈说这台机器他的风噪声很大,就呼呼作响吧。然后我在网上也没有搜到很好的那种散热配件, 所以目前呢,就是一种因为网络因为风扇使用不畅的一种状况。 最后是十三寸的 macbook pro i 五的 cpu, 这是我的第一台 macbook pro, 大 概七年前买的吧,就一直舍不得出掉,留作备用了。 它的架构其实和 mac mini 已经完全不同了,性能放今天来讲也属于比较差了,跑 open cloud 可以, 但是相同的 cloud 的 模型,我就发现它这个反应速度确实要慢很多,然后在高负荷的情况下呢,风扇噪音也是明显很多,不过还是可以用的。 那其实我用的三种不同形态的设备都可以装,所以我也意识到 openclaw 它对硬件没有那么挑,要求没有那么高,但是如果有性能更强的 cpu, 更大的内存支持, 那么在运行上来讲就会更加的流畅,更加的高效。好像有点在说废话嘞, 那说完硬件层面,我还想小小的补充一下,就是我基于语音输入和识别去购买了两个小配件,一个是麦克风,还有一个是快捷键键盘。麦克风也是看别人推荐的,效果还行, 之前长期跟 ai 对 话,我就发现我打字的速度跟不上,会降低效率,然后我就开始用语音输入的内置的麦克风, 但是周边环境的噪音多一点的话,会影响识别的精准度,而且因为有一段距离,所以我的声音会需要比较大,说久了之后嗓子有点疼。 后来我就用了这种放在嘴边的麦克风,识别效果有一点点提升。当然我觉得这个也不是最关键的,还是要配合语音输入法和 ai 校准这个样子呢。出来的大段文本准确率是比较高了的,因为我有的时候说我可能 口述的时候会有重复的习惯啊,或者有一些口语化的表达,那这样一套组合下来,其实识别的准确率真的就很高,我基本上不用改的。 而快捷键机械键盘的作用非常简单,主要是想减少高频操作情况下对笔记本键盘的损耗,然后就试了一下,还可以,手感还不错。 还有就是买了 esp 三二设备,这个设备挺有意思的,但是在这里我要先卖个小关子,因为之后分享我用 openclaw 做了什么的时候,我就会重点分享一下它, 再来聊一聊软件方面的投入,也就是各大 ai 的 订阅。其实在这个方面我算了一下,这个支出还挺大的, 就是三家我都有在用。关于这三个 ai, 简单说一说截止目前为止我的一个使用感受。 club 的, 我最早用的是二十美金的那一档,然后上个月不是做了一个升了吗项目吗?当时就触发限额了,我一咬牙,升级升级成了一百元那一档, 就想着说之后肯定很够用了,结果没想到我要制作炒股的一个项目的时候呢, 又触发限额了,这个托肯真的很贵啊。所以我也在 open cloud 上面做了一些优化,比如把一些不太重要的工作丢给其他的便宜模型,比如我把项链模型部署到本地,再比如定期重置对话,以及设置 cloud 的 上限。其实截止目前为止,我的主力 ai 就是 cloud 的。 可能视频前朋友会有一个小小的疑问,市面上那么多 ai 还有平替的,你为什么就选 cloud 的 呢? 我觉得可能是使用习惯,一开始我的工具制作还有一些小开发都是用的它,而且随着我投入使用的比例的增加, 我发现它收集我更多数据之后,好像比其他 ai 确实更懂我一点,更能 get 到我说的意思。所以目前呢,属于一种比较依赖的状态。当然后续如果有比较好的平替,我是二十美金的那一档, 但说实话,最近我的使用率真的是降低了很多,所以一度我都想要去把它停掉了,但是又觉得在泰国这边,在手机端 app 使用的时候,它的通话和语音 响应速度比较快,体验是比较好的,所以这一点呢,让我至今都有点犹豫。但是如果一定要去砍我的 ai 订阅之初,我第一个应该会选择把它刷下去, 然后是积木莱,目前也是 pro 版,之前打折的时候我就直接年付了这个积木莱用下来呢,我真的觉得它是目前所有 ai 当中 性价比很高很高的了,就是它既可以编程,又可以处理长文,还可以升图。目前来讲,我其实对它的各项表现还是比较满意的,但它有点挑 ip, 偶尔连接不上。 而国产大魔星我当然也用过,之前 deepsea 出来的时候我就想要体验一下嘛,充了一百多,结果用了好久好久,现在都还有六十多。以及我上周体验的 kimi, 我 就当时看很多人都说它挺好用的,所以就充了一个 kimi co 的 七天乐, 差不多五块钱,超级便宜的,就想着说短时间作为编程助手来体验,看一看表现还是不错的。但是七天时间一到,他就要强制给我升级成四十五块钱包月的套餐了, 他问都不问我洗得好,我最后一刻发现了停止了,真的是有点迷哈这操作。目前我的 ai 订阅就是这些了,这个开销其实不低,可能就是学习的成本,学习的代价了。只能说期待未来 ai 越来越普及,关于 ai 的 基建、算力都有所提升之后,它的价格就能够降下来。所以呢,我现在为了对得起投入的这个学习成本,我给自己定了一个小目标,每天至少要用百分之八十的量, 如果当天我的用量没有达到,那就是我对于 ai 的 研究开发还不够。除了订阅,我还买断了 mac whisper 这个软件, 因为这个软件它支持设置本地的模型来进行校对,所以现在我的语音识别和校对都是本地的,体验很不错,安全性也挺高的,识别速度真的挺快的。因为现在放了个话筒在嘴边,所以我给俩洗碗都不可以,就可以一直叽里呱啦的说个不停。 手机上暂时用的 tablets, 一个月内是免费体验之后就要付费了。它的输入准确率是非常不错的,接近于手打了,但是我始终不太喜欢它后台常驻的这种方式。还有就是我想要 减少一些在 ai 软件方面的支出,所以呢,我就用 ai 去做了一个山寨版的,虽然说体验没有这个 typeface 好, 用时也更长,但是免费啊。 那么总体算下来,硬件和软件的投入确实不少,但还是那句话嘛,对我个人而言,我认为它是我的一个必要的学习支出。 那其实也有很多比较精深的方案,就比如说硬件层面完全可以去买 mac mini 的 基础款,比如说订阅, ai 的 订阅也可以去找一些平替,甚至现在也有一些免费的方案都可以,对吧? 只是说这个呢,就看个人的选择需要跟喜好嘛。那我现阶段并不是说因为投入了这么多,所以我要取得一个很及时的现金回报, 而是我想要去学习,想要去学会这一个技能,就是我觉得目前还处于一种会,但是也没有说用的很好的这么一个程度, 所以接下来呢,短期需要功课的目标就是真正的把它用到位之后再说,完完全全的掌握, 毕竟这对于我们所有人而言呢,其实都还是一项比较陌生的技能,而且现在 ai 的 门槛确实也是越来越低了嘛,未来我相信这个 学习的难度也会越来越低,整个花费也会越来越小的。对了,还想分享一个之前发生在我身上的糗事,就是我放心的让 open class 去同步我的视频到我的群里边儿,结果 我可能没弄好吗?肯定是没弄好,他一晚上推送了几十次,而我睡着了, 后来都是群友来提醒我的尴尬。所以想说的是,在享受 ai 带来便利的同时, 我们也要对一些基础的技术有所了解,就是不必要成为大佬,也不必要成为这方面的专家。但是呢,也不能纯做甩手掌柜,多一点了解,在用 ai 的 时候就会更加的安心,也就更能去防范一些安全风险,技术问题。 ok, 那 么本期的分享呢,就到这里,欢迎视频前的朋友在评论区留言讨论,大家相互交流,看看我们下期见。

现在 a g 的 工具这么多,到底怎么选?首先说明一下,都二零二六年了,写代码工具和干活工具早已经合并了。 先看国外三 g 头三个角度,账号好不好拿,能力强不强,性价比高不高。 cloud code 能力最强,长任务复杂,工程天花板,但是账号最难拿, 请求额度,五小时滚动窗口, codex 绑定,像 gpt 门槛也不低。 open 五小时滚动窗口,复杂任务烧得特别快。 cursor 最好拿,可以切换 cloud gpt, 但日常 auto 模式不算额度,大部分场景够用。 我自己日常写文案,做视频,写代码,部署运维全部用 ctrl 的 auto, 完全没有 token 效率。真正复杂的代码任务在上 copy 和 g p d 开源 agent 的 销接,微信飞书做自动化,爱马仕 hermes 会自动化存代码,开 open code。 国内写代码退退字节的 ai i d e a g 的 全号免费,非 it 刚入门,推沃格米 啊,说说人话,能在电脑上干活,遥控远程指挥,做个官网也够用,不用折腾。总结,日常 cross auto 复杂任务, cloud gpt 程序员选萃,零门槛上手,我可巴蒂。

大的来了,兄弟们,别再让你德邦科尔只会说不会做了。想把他从人工智障调教成最强员工,关键在于解锁 skill 技能系统。下面这六个进阶神技 skill 将彻底释放他的真正潜力。神技 skill creator, 让每个人成为 i 架构师,告别代码恐惧症。这是一个创造技能的技能, 只需像吩咐实习生一样对他说需求,他就能在几秒内深层逻辑严密、结构完整的 skill。 md 的 文件,从提问者到开发者,只差这一个,神迹神迹二, table 四,拔掉 ai 的 幻觉网线,专治各种一本正经胡说八道。欧本科二,本地知识库有盲区,普通联网搜索被 icu 垃圾信息淹没。 tiffany 这次装为 ai 代理设计的深度搜索引擎,实现姓袁家权与实时锁影。当刊写二零二六年 q 二最新 ai 政策分析时,他能精准抓取官网与权威刊动态,并不可追溯链接。这是从娱乐玩具到商业三摩的分水岭。神技三, superpower 是 给龙虾装上项目经理的大脑, 源自 ai 闷头下干偏离需求的绝症。普通 ai 是 硬打机器,装上 super powers 的 open claw 则是统筹专家工作机制,先对其后执行。接到策划产品、发布会这类复杂任务时,它会先确认预算规模调性,再自动生成代办清单,引导推进。对着 ai 干瞪眼的无力感彻底消失。 神迹四, skywalker 你 的私人数字保镖,防止开原社区后门惨案 opencar 强大在于生态,风险也在于生态。安装未知技能前务必起用 skywalker。 它通过静态度量与全线评级, 扫描可疑代码与月权请求,坚持一百下载量加三个月存活期的筛选标准,从源头杜绝密钥变控机燃料。神迹五, opencar cars up 特麦瑟,极致抠门的省钱大师,月省一台手机钱不止一杯咖啡,高频使用最怕月底账单 opencall cost up 麦瑟是你的 ai 财务总监,核心是上下文智能压缩与记忆裁剪, 它能自动修剪,无关闲聊并预估调用费用。长文档分析中,推理成本直降百分之三十到六十,高价模型决策,低价模型执行,这是 ai 时代的降本增效。神迹神迹六, a 政多 case 特从单兵作战到集团军冲锋, 把 openk 二裂变成复仇者联盟,一个人活成一支队伍。 a 阵,沃尔克斯瑞特让你后台同时指挥多名不同人设、不同专长的 ai 特工。 实战中, a 阵特意逻辑型清洗数据 a 阵 b, 创业型,转载报告 a 阵 c 审核型,查漏补缺,你只需下达总指令,后台自行分工汇总。 openk 二不再是聊天框,而是自动化生产线,最后这六个神技构成完整闭环,装好这套组合,全里的效率指数级飙升。好了,兄弟们还有什么想了解的评论区告诉我,咱们下期见!


你是不是一天能刷到好几次 cloud code codex、 open cloud 这些东西啊?但到现在还是搞不清楚自己应该用哪个来干嘛?今天呢,我就来帮大家搞清楚三件事,这些东西到底是什么,它们之间有什么区别,以及你应该用哪个。 那前面提到这几个呢,其实都属于一类东西啊,业界呢,叫桌面智能体。我感觉从去年底开始啊,这些工具的存在感突然就变强了,然后随着欧本口号的爆火啊,正式出圈。但慢慢发现啊,原来 ai 呢,不只是能回答问题的,他还能直接帮你做事。 那以前大家用 ai 啊,你让他写个文档,你还得自己复制出来,然后自己粘贴到 word 里面,或者是其他地方,然后你还得去调整格式和排版。 而桌面智能体呢,不一样,他之所以叫桌面,就是因为他直接装在你的电脑上,能直接去操作你的电脑,帮你去创建文档,读你的本地资料,上网帮你查东西,把结果整理好,直接保存到你电脑里,不用再来回复制粘贴了。搞清楚了概念,我们直接进入正题,这么多智能体,到底怎么选? 网上呢?大家说法都不一样,每个人喜好也不一样,但实际上我用下来的感受呢,是不用去纠结哪个能力强。对于大部分人来说啊,基本都够用,主要看你现在用 a 压到哪个程度了。所以呢,我就根据上手难易度啊,把这些智能体分成了三档,大家可以自己对号入座。 d 档,自动档,代表是 tree solo 版 workbody 的 日常办公模式, codework 这些这几个呢,已经我们产品化了,它们会把一些常见的办公能力基本都包装好,比如 tree solo, 首页直接列好了四个能力,告诉你能干些什么,那 workbody 呢?上面一排也全都是现成的能力, 你甚至不用想说我应该怎么跟 ai 去提问,选一个你想做的事,点进去就可以了。这个呢,就像自动挡的车啊,它门槛是很低的,你进去就知道它能干什么,点一下就可以用,也不用去懂任何的技术。 当然了,我觉得灵活性上的会差一些。但如果你之前完全没有接触过桌面智能体啊,那先从这一档开始用啊,会更容易上手,毕竟能真的用起来比什么都重要。 那第二档呢,是手动挡,你用了一段时间自动挡之后啊,就会发现一个问题,比如他给你列好了文档、数据调研这些能力啊,但你工作里呢,总会碰到一些他没覆盖到的事情,比如说你想搭一个产品原型,或者是你想写一个脚本,帮你去监控数据变化,这里比较定制的事情呢,自动挡就没那么擅长了, 这个时候就需要手动挡。代表呢,就是大名鼎鼎的 codex 和 cloud code, 他 们呢,本来是给程序员设计的 coding agent, 主要是用来写代码的,但后来大家发现,原来产品经理、运营设计师一样能用,而且用的还挺好的。 那你想搭圆形的话呢,他就直接帮你写出一整套可以交互点击的页面,连前端代码都直接搞定了。那同时呢,他也可以去写文档,也能做数据分析,说白了就是说上手门槛有点高。 具体呢,表现在它没有那么多,就是做好的功能你都得靠自己去搭,比如这类 coding agent, 它它就是没什么产品思维的。那我作为去产品经理,想去用它写好需求文档,就得提前把自己的工作方法写成 skill 交给他。 然后大家肯定很关心 codex 和 cloud code 选哪个更好,那我们先从难一度开始说啊。那对新手来说呢, codex 订阅会相对容易一些,量也比较足,而且呢,已经有一个很完善的格式化界面了,用起来其实挺简单的, 那 cloud code 呢,就会稍微难一些,订阅难度众所周知对吧?那如果没法订阅,你想用 cloud code 去搭配其他模型用呢?你就只能在终端里就是那个黑黑的命令行里面去用它,没有界面,然后还得准备自己的 api, 然后还要学会自己怎么去换模型,确实挺复杂的。 那从效果上来说啊,我自己用了下来的感受呢,是 codex 主打一个稳,就你给他一个任务吧,他理解,基本上不会出什么大问题,该做什么不该做什么分的很清楚啊,幻觉也很少,不太会编造东西, 特别是做技术方案的时候呢,他会像一个严谨的架构师一样去帮你调研技术的可能性,考虑到各种的情况, 那我拿它做圆形弹幕的时候,感受就特别明显。就你跟他说一个页面上的某个功能要怎么调整一下,他基本上呢,一次性改对,不用去反复纠正。 但 codex 呢,就是比较一板一眼,他不太会自己发挥啊,审美也不太行,就如果直接用它做出来的东西啊,就很素,可能有点拿不出手,需要额外的设计规范或者是 skill 给他指导一下才能做好。 那 cloud code 呢,它更有创造力一些,整体视觉设计水平啊,会比 codex 好 不少,做出来的东西更好看。写文档我觉得也是略胜一筹的,就每次让它写竞品分析或者是需求文档的时候,它出来的东西都会结构比较清晰,然后整个行文呢,不会太啰嗦,也不会太简略。 另外, cloud code 它的整个 skill 生态是比较成熟的,毕竟 skill 就是 他们提出来的嘛。所以我一般写 skill 呢,肯定还是会用它的。 但有一个需要注意的点就是我觉得 cloud 的 幻觉会比 codex 严重,就他会偷偷给我预设一些前提啊,比如我和他讨论一个功能,他就直接编出一句,呃,我们的用户已经怎么怎么样了,但其实我根本就没有说过,然后他会根据自己的脑补再往下分析,就会有点容易跑偏,这一点一定要注意。 当然了,用到后面呢,你就会发现成年人根本就不需要做选择,可以两个都用嘛,我自己现在就是这么干的。不同的事情呢,哪个适合就去用哪个。 第三档越野模式啊,代表的就是 open car 和 amos 越野车,什么特点啊?就是自由度高,什么路都可以跑,适合去探索一些未知的地方。 我觉得呢,它特别的地方是开始像一个私人助理了,就用起来吧,很有活人感,因为他们都有一套记忆机制和自我成长机制。就你平时关注哪些领域,喜欢看什么内容,然后习惯什么样的工作方式啊,他都能慢慢记住, 那时间长了以后呢,你就会发现他会越来越懂你,可以按你的思维模式去帮你思考。所以欧本卡就是适合那种没有标准答案的工作,比如说找选择题,整理新闻、收集信息啊,这些活呢,不一定有很明确的执行路径,你就让他自己去发挥。 但反过来说,他就没有适合那种特别严谨的任务,因为他自由度越高吧,稳定性往往就越低。同样一个任务啊,这次可能给你个惊喜,下次他可能就跑偏了。 这个呢,就对使用者的要求会比较高啊,你得描述清楚你具体想要什么,然后呢,花十千去给他加一些约束,这样才能保证啊,产出的效果相对稳定。所以越野模式啊,更适合对桌面 agent 已经有一定经验之后再来玩。 说完怎么选?再来说说我自己是怎么搭配使用的,比如说写复杂文档或者做新的 skill 呢?我会用 cloud code。 那 做圆形 demo 或者是 web coding 啊,我会优先用 codex。 那调研,找小题,还有其他发散性任务啊,我会交给 open claw, 然后用久了,我就会发现,我自己做的那套 skill 呢,不管是什么写需求文档的,还是画圆形的,那在 code x 里能用,在于 cloud code 里也能用。 那我自己整理的这一套知识库啊,包括项目方案,学习资料、产品方法论这些,不管是哪个 a 卷,它都能帮我去读取和修改。这个呢,就是桌面智能体的另一个优势,因为这些沉淀下来的东西呢,它都在我们自己的电脑里。 a 卷它只是一个工具啊,你想换可以随时换。 那接下来视频啊,我也会和大家去分享我自己做 skill, 然后搭建知识库的一些经验,和大家一起把 ai 玩得更溜。 最后呢,回到怎么选 agent 这个问题上,我觉得一个你能真正用起来的 agent 呢?比一个更强,但你用不太明白的有用太多了,也别纠结选哪个更好,先选一个你现在就能驾驭住的。等你真正用起来之后呢,你自然就知道自己下一步需要什么了。 那现在大家已经开始用桌面 agent 了吗?欢迎来聊聊,你觉得用起来怎么样?我是吃土,带你用产品视角看懂 ai。

这哥们学过编程?感觉,哎,没学过。一个学英语的人怎么能懂这些呢?这简直不可思议,快叫罗老师来 项目过程中, superpower 去重新读,去下面代码库,有必要吗?有必要。第一个,在你真正开始下手之前,永远让 ai 去做一圈行业最佳实践调查。第二个,当他给你诊断完 bug 之后,你永远问他走一遍代码库里边的关键节点,确保你不是幻觉。 第三个,就是永远用善用计划模式,这三个东西会大幅收敛模型的动作。你不要看我天天吹 opus 四点七有多好用,四点七照样漂移,照样幻觉,用这几个方式给它收敛。 感觉 harness 在 比较长的一段时间内都很必要。 harness 非常有必要,尤其是在 to be 的 场景之下,尤为有必要。因为如果你想让 agent 稳定持续地输出一些东西,输出工作结果,可预测,可审计,可追溯, harness 尤为重要。 当然,随着模型基座能力的逐渐提升, harness 的 工程量会逐渐降低,这是毫无疑问的。也就是说,模型内质内收的能力越多越强, harness 的 重要性和意义就越低。但是这里边永远有一个前沿模型和主流模型的区别吧。 没有盈利模式这些都搞龙虾干嘛?你说的是大家套壳虾是吧?虾本身不挣钱,把虾搞好了之后,烧你的 token, 拿你的数据赚钱。如果他拿了你的数据,如果他一直不管你要钱,那就很简单。他在看你的数据, 如果说他最后跟你要钱了,那就很简单,他想卖 token。 判断这个很简单,因为用 agent 是 烧流量的非常高效的方式,你随便在模型当中问个你好,那对不起几千一万就出去了,你跟他聊天你得聊多久?能聊一百万? token 澄清过的需求做到后面发现不对只能退到重做吗? 你说的太虚了。首先第一点,如果你有一个很神秘的 bug, 永远解决不掉,那么以我的经验来看,它就不是一个 bug, 应该是你的架构漂移了,要重构了。 没有什么 bug 是 一百万上下文解决不了的,如果解决不了,一定是架构问题。我刚才的模逻辑是在最强模型最强 a 阵的前提下,如果还这样,那兄弟就是你的架构问题。 现在架构师是不是单纯比程序员吃香了?我觉得不完全是,在架构师这个角度理解来说,我讲过架构师是开方子的,你觉得一个架构师对于架构和范式和模型的积累多还是 ai 多?在万亿级参数以上, ai 理解的架构一定比你清楚。 为什么人类的架构师会比 ai 更厉害,因为人才能够更加全面的理解业务场景,当你在做某种业务的时候,一定有 a 架构 b 架构,两者很接近,都能解决同样的问题。但是一个好的架构师往往能够清楚的告诉你说,为什么一定选这个而不选另外一个,因为这个架构你未来会遇到什么样的问题, 你的拓展性在哪里?你越来越要挑战哪里,而这个架构可以满足这些。而你如果用去 ai 去帮你选架构,有没有可能选的对?可以,但是你会发现对于个人的要求很高,对于提问那个人要求很高,你能不能把你的业务讲清楚,能不能把你未来的想法讲清楚,把你当下要做的事情讲清楚, 把当下需求、未来需求可拓展性和变化路径全部都描述清楚,让 ai 的 去帮你选技术站,帮你选架构,他也能帮你得出结论。但是往往这对于提问的人要求很高,而兄弟们,你觉着真正能掌握到这个水平提问的人有多少呢?所以我觉得架构师今天依旧有价值啊。

opencloud 官方的 skill 库里隐藏了三款强大且有意思的 skill, 包含 ai 选股和 ai 完全操控电脑等功能。今天就将这三款宝藏 skill 一 次性分享给你。第一个叫 desktop control 桌面操控,它能用代码精确操控你的鼠标和键盘, 鼠标可以瞬间移动到屏幕任意坐标,也可以模拟人类轨迹。平滑滑动键盘既能执行各种快捷键组合。 除了基本的点击和拖拽,它还能截屏,用图像识别寻找屏幕上的元素,甚至管理窗口的激活最小化。最实用的是它的安全机制,只要把鼠标甩到角落, 就能立刻终止所有自动化,让你放心用它去处理重复的办公操作、文件整理或跨软件的工作流。并且以上 go 都可以直接前往 club hub 下载,如果不会下载,可以打开七二四 club hub 下载,它可以辅助你的龙虾完成 六、一键安装,非常方便。第二个是股市透视镜 stock analysis, 他 把专业级的金融数据整合成一个简单的命令,基于压户 finance 的 实时数据,从收益 惊喜、基本面、分析师情绪、历史表现、市场背景、行业地位、动量趋势和余薪热度这八个维度,给出一只股票或加密货币的综合判断。他能帮你扫描当前最热门的币种 股票,也能提前秀出并购传闻、内部交易这类早期信号,并给出影响力评分。你可以给持仓设置价格目标和止损线,一旦买卖信号变化就会自动提醒。还能管理多个投资组合,筛 选高股息的安全标地。对于平时想快速判断投资价值的人来说,它就像随身带着一个数据团队。最后一个压轴的是浏览器管家 plr, 它基于 plr 驱动 chrome、 five fox 等主流浏览器,让你用指令完成网页上的任何操作。你可以让它打开某个网址,点击页面上的按钮,再输入框里填写内容,从下拉菜单,选择选项。也可以直接执行 java script 提取表格数据或截图。它支持无头模式,在后台静默运行,不会干扰你正常用电脑,而且默认限制了文件系统访问 不受信任的域名,安全边界很清晰,凡是需要在网页里反复点来点去的重复劳动,比如登录、装熟具、批量填表单、做自动化测试,都可以交给他,一气呵成。

面试官问,有人说 open cloud 只是把现有 agent 能力做了工程化整合,没有核心技术创新,请谈谈你的观点。哎,各位同学听到这个问题千万别慌,这可是现在大模型架构师面试里的深水区题目。 面试官其实不是在考 open cloud 的 代码怎么写,它是在考你对 agent 进化逻辑的底层思考。大家好,我是移速 好,大家先看屏幕上这张架构图,我们先定个调子。客观来说,这个说法有一定道理。 open cloud 确实没有做底层模型,算法层面的升级,核心就是工程化方向的创新,但大家不能就此否定它的价值。 就像很多同行提到的,工程创新也是正经创新。提示词,优化架构整合这类能力和模型研发没有高低之分,极致的工程整合本身就是一种硬核突破。为什么这么说?咱们顺着这张图往下拉,大家看标题栏,这叫架构总览。 我们先看第一层 l e 交互接入层。在这里我要问大家一个问题,为什么 open cloud 这么火?是因为它的模型更聪明吗?并不是。其实单纯实现工具调用、智能交互,哪怕把相关权限开放给豆包、元宝这类常用 app, 也能做出类似基础效果。 它真正的优势是把 a 键的深度对接进的企微、飞书、钉钉这些办公软件完成了接入体验的革新。 以前我们用 agent 得专门打开独立页面,适配专属客户端,流程繁琐。现在使用起来就像和朋友聊天一样简单。这种标准化、轻量化的去中心化接入方式,把 agent 从实验室场景真正落地到日常办公生产中。低损耗的交互体验,也是 agent 走向普惠使用、 实现规模化推广的关键。好,重点来了,大家往这看,这是 open cloud 目前最硬核,也是大家一定要掌握的新知识点。 agent skills 技能机制。 我想问问大家,以前我们给 ai 配置工具调用,是不是要编写复杂的? jason schemer, 是 不是稍微错一个标点,一处格式模型就无法正常识别调用? opencloud 提出了很实用的优化思路,采用 skill md 范式,让技能配置从小众技术变成大众生产力。它不再要求开发者死守严苛的格式代码,而是可以用 markdown 这类易读的形式编写技能说明书文档里整合了指令、原数据, 还有配套的执行与异常处理逻辑,这里也要理清一点,把零散提示词梳理成标准化文档,可附用组建,本身就是提示工程与工程化能力的体现。传统接送格式更多是机器读取的固定参数,而 skill md 相当于给模型一份清晰的逻辑指南,能让模型自主理解并使用复杂工具,还能自主处理运行异常。 同时它支持原数据懒加载,不用一次性加载全部技能,只有匹配到对应需求时才精准唤醒,大幅优化运行性能, 把零散的提示词工具能力做成可标准化、可管理的组建,这实打实就是工程层面的创新,但是能力越强,风险就越大。大家看中间这层 l 二核心调度层,如果一个 agent 拥有了操作邮箱、处理文件,甚至对接资金流程这类真实权限, 一旦模型产生幻觉或者被恶意诱导,后果不堪设想,这也是面试官最喜欢追问的难点。 opencloud 没有单纯依靠模型自我约束,而是用工程手段搭建了严密的防护体系。 它引入了 he 头人在回路机制,涉及删文件、资金操作等高危动作,都会在聊天窗口弹出确认请求,必须人工确认后才会执行,同时配套独立沙箱运行环境,哪怕模型被诱导做出异常操作,也会被容器权限牢牢限制,完全无法越界。 人在回路沙箱技术并非它独有,但能把这类安全能力和 agent 调度深度融合,做成开箱即用的标准能力,就是企业落地最需要的价值。 这种从环境隔离到人工干预的立体防御,也是企业级 agent 敢正式商业化落地的核心保障。 还有一个行业普遍痛点, agent 运行过程中容易失忆、涨,任务一旦中断就无法继续。 opencloud 整合了向量库和 action log 执行回溯能力,它不只是简单保存聊天记录,还会完整记录 agent 每一步的思考逻辑与执行动作, 对思维和执行过程做持久化可追溯处理,才让复杂电路任务能够稳定跑完,出问题也能快速排查,这也是纯 c 端 app 不 会重点打磨的工业级能力。 最后,我们来总结一下,如果面试官这么问,你一定要用这套思维框架作答。第一, open class 的 创新不在底层算法与模型,核心是打造出一套 agent 对 接现实业务的完整工程体系,用标准化规则约束 ai 行为,补齐落地短板。 第二,他依靠 skill md 大 幅降低技能开发门槛,让提示工程工具配置变得简单可控,也助力搭建起良性的插件生态。 第三,他从架构根源解决了 agent 落地两大核心难题,一是安全合规的权限边界,二是长任务运行的状态一致性。 同学们一定要记住,在 ai 时代,单纯比拼模型能力已经越来越同质化,能把大模型能力无缝融入现有工作流,同时管好权限,守住安全,保障稳定运行。这种系统化的工程整合能力, 本身就是当下含金量极高的硬核技术,整合不是简单堆砌,落地创新同样值得重视。那么,下次再见了!