粉丝9.6万获赞198.4万

比起 opencloudex 可能才更适合普通人使用,能操作电脑做文档、表格、 ppt, 还能生成图片,执行自动化任务,逐渐从编程 agent 走向桌面 ai 助手。那今天这个视频我就给大家带来 codex 保姆级教程。先到 codex 的 下载页点击下载 macos, 下载好后打开安装包, 直接把文件拖进去就可以了。打开 codex, 它的界面很像网页版的 ai 聊天界面,主要可以分为三块,右边这里就是和 ai 对 话的地方。左上角的四个功能,第一个就是开启一个新的 ai 对 话搜索,可以通过标题来找到之前的对话内容, 剩下的插件和自动化功能我会在后面详细讲解。左下角这里是两种和 ai 写作的方式,一种是项目方式,一种是对话方式。 项目方式更适合去做一些长期积累的任务,比如沉淀知识库、做工作流、写代码。有两种方式使用项目,一个是创建新项目,默认会在文稿目录下创建一个项目文件夹,也可以使用你现有的文件夹作为项目, 所有后续的 a 阵子操作都会默认在项目文件夹下进行。第二种对话方式,就像我们平常使用网页版 ai, 可以 临时去做一些任务,比如偶尔查一查信息什么的, 那我们这里就可以新建一个项目,我们也可以在三个点这里给项目改名,在聊天框左下角就可以看到他已经进入了刚才新建的项目文件夹。下聊天框这里的加号, 我们就可以上传图片或者文件给 ai 这里我们还可以开启计划模式,这个模式是不让 ai 直接改动文件,而是先生成一份计划,我们看完没有问题以后才会执行。 权限,这里 codex 有 三种权限,第一种默认权限,就是只能访问项目文件夹下的文件,如果涉及到其他文件或者网络访问,就会弹出审核框让我们去批准。第二种是自动审查,就是 codex 会自动放行低风险操作,高风险操作才会需要人工审核。 最后一种就是给 codex 所有的电脑权限,很方便使用。右边这里我们可以选择模型的推理强度,复杂人物可以选择更高的推理强度。 模型这里我们可以切换多个叉 t b t 模型最后的速度就是可以加快模型的输出速度,不过会消耗更多的 token。 这里直接让 ai 写一个单 html 的 个人播客网站,但我们可能有新的想法,想要加进去就可以直接进行引导, 比如我这里补充整体色彩风格要用孟菲斯风格,还可以继续补充,要用一个板块式,个人作品展示用滑动式般的呈现。我们直接点击这里的引导, codex 就 会在下次执行工具调用后 插入我们新的要求,很适合补充提示词或者纠正方向,不用中断对话,让他帮我们再写一个手工艺的电商网站。使用 react, 那可以看到两个任务就并行执行了,属于转圈的状态, codex 当前步骤完成后就会显示为一个小蓝点。 看完基本使用,我们来看一看一些好用的特性。先来看一下插件功能,插件就是用来帮助 codex 操作各种工具的, 比如 computer use 和 browser use 就是 让 codex 操作你的电脑和它的内置浏览器,下面这两个就可以操作表格和 ppt, 那 往下翻我们还可以看到操作邮箱 canvas 设计软件的,我们点开一个就可以看到。这个插件其实由外部服务调用和技能组成, 那有的插件本身也是一个技能,后面也会给大家演示怎么使用插件。技能这里大家应该就不陌生了,技能就是工作流程的一个分装,如果有不懂的朋友可以看一下我之前讲 agent skill 的 视频, 如果你是以现有文件夹的方式创建项目的,也会把里面的技能同步过来。接下来我们就来看一下 computer use 这个插件, 它是利用 macos 的 屏幕录制和无障碍辅助数,让 codex 既能看到画面,又能精准点击。 这里我让他打开扫雷通关简单模式,这个半透明小光标就是 codex 操作所使用的,不会占用你的鼠标。一开始他尝试标记地雷的时候,发现标记失败了,很有意思的是,他换了一种玩法, 直接打开安全格,然后就是一路门店,推理出所有可能的安全位,直接通关。我就在想,如果以后模型的推理速度和输出速度再快一点,那我们干游戏就只需要用 ai 就 可以了。 下面我们看一下办公三件套和作图插件,这里我让他调研一下英伟达显卡的发布和价格信息,并让他制作成 word 文档, 然后配图。这里他很快先把配图制作出来了,整个过程一共用了十六分钟,第一次用的时候他会自动安装相关运行环境,制作完成后,他还会截图进行复查,发现可以打磨的地方还会进行二次修改。我们打开文档来看一下 发布信息和价格表都出来了,而且还贴心的配了图,最后还有产品线解读和购买建议。然后我让他在这个基础上把价格表整理成 excel, 同样的他在处理过程也会不断修正错误,花了五分钟时间做好。 来看一下表格,所有信息都正确写进来了,唯一有个瑕疵是溢价,这一栏应该是百分比,它这里用的是小数,不过这些都可以通过细化提示词去解决。下面继续让它根据文档做 ppt 分 格,参考苹果信息层级不超过三层。 他做完第一版以后,又对我的信息层级这个要求进行复查。我们来看一下 ppt 整体布局还是很舒服的,满足了我对信息层级的要求,没有堆满字,而且风格也是沿用了英伟达的配色。最后我们来说一下自动化功能, 它就相当于一个定时任务。右上角这里我们可以新建任务模板里有一些关于代码的任务模板。下面这里你可以选择在哪个项目文件夹下进行, 并且设定定时时间,有每小时、每天、每个工作日或者每周。也可以自定义规则,我们可以直接粘贴这个规则,让 ai 帮我们改成任意时间,比如这里就让它改成每周二和每周四的十三点执行。那 那我们在这里也可以让它执行已有的工作流程,比如这里,我之前是用 cloud code 做的,在 cloud 点 md 里已经写好了完整的自动拉取推文的流程,那直接让 codex 执行就可以了,很顺利地帮我完成了定时任务。那以上就是全部教程了,如果对你有帮助的话,记得一键三连。

codex 是 我过去几个月高频使用的 ai 助手之一,我用它做研究,写文档、做 ppt, 整理内容灵感,做网页原型。上个视频讲了 codex 基础,这期视频讲一个今年很值得先搞懂的 ai 概念 skill, 因为它决定了 codex 到底只是陪你聊天,还是能按你的工作方式反复干活。简单理解一份可以重复使用的工作说明书, 你可以把某类任务的流程规则、检查标准提前写进去,下次再让 codex 做类似的事,他就不用每次重新听你解释一遍。比如你经常让 codex 做网页,你不想每次都重复说页面不要太 ai 味,不要蓝紫配色, 这些都可以写进一个设计类 skill 里。以后你只要让 codex 用这个 skill 检查页面,他就会按那套规则去看代码、改样式,再告诉你改了哪里。 这就是 skill 最实用的地方。把你反复说的要求变成一套固定流程,那么在哪里看和怎么用 skill, 可以 去 codex 的 侧边栏这个入口里看,里面会有一个 skill 子页面, 已经添加或创建过的 skill 会出现在这个列表里。使用的时候,通常可以在聊天里输入 skill 名称,或者用斜杠跳出来。比如你有一个 find skill, 就 可以直接斜杠选中,帮我找一个适合做 ppt 的 skill, codex 就 会按 skill 里的流程去跑。那怎么创建 skill? 有 两种方法, 第一种最简单直接这样说,请创建一个 skill 以后,我给你一个网页项目时,你要先检查移动端排版按钮样式、文字层级、颜色是否太乱,最后输出修改文件和检查结果。这种叫 prompt skill, 但我更推荐第二种,先把流程跑通,再把流程固化成 skill。 举个我刚实测的例子,我想做一种白板手绘风讲解图,我先给他一个参考图,让 codex 按我的要求生成讲解图 第一版如果不满意我就继续改,比如少一点黄色纸张质感画面更像课堂白板。等到有一版我觉得可以附用,我再说。把它固化成一个 skill, 这时候 codex 会反推刚才的流程,它会把这次反复调整出来的规则写进一个 skill。 md, 这样下次我再用白板手绘讲解图, 就不用重新解释一遍审美和结构,直接调用这个 skill 就 行。如果你想让 codex 使用 skill creator, 它会按更标准的格式帮你生成可附用 skill。 我是 ai 知识派,我们下期见。

那本期给大家分享一下我是如何用 codex 实现用 ai 来去做一个账号自动化运营的这个过程。除了录视频这个事情以外,那其实还有很多的 运营的一些琐碎的事情,比如说我要去看我的账号数据,视频录完了我还要写封面标题等等,这些琐碎的工作其实很多,它不是光是录制一个这么简单的事情, 现在我的流程是可以这么做的。我现在是用 ai 的 这个 computer use 这个功能,直接去我的创作者中心帮我去把所有的账号拉出来,在本地上分析,分析完以后它会沉淀出几个特定的文档,这个文档呢就是我的这个 粉丝的文档,账号定位的文档,内容策略的文档。那基于这几个文档, ai 就 会去读取了这几个固定的文档以后,去帮我搜索相关的同行的一些对标的文档以后,去帮我搜索相关的内容, ai 就 会一个一个介绍一下。 每一次我视频拍完结束以后导出字幕,它就可以基于我的这套方法论,帮我批量的自动化的把我的视频的封面标题、描述标签全部搞出来。那也就说现在的主要是它在于你 内容我们已经拍摄好以后的那些环节,那内容的生产前面还是主要是由你自己来想的,不是内容生产前面数据分析它会给我选 dj, 它会跟根据你的账号定位去帮我们来看一下实际的效果就好。那你看 在这里我跟他讲我用了那个 codex 里面 computer use, 他 可以操纵我的浏览器嘛?然后去访问我的这些账户,我让他去分析一下,呃,跟我相关的一些对标账号,然后他是优先读取了我四个 m d 的 文档,嗯,这个文档里面是有我的粉丝画像的,呃,有我的所有的账号的策略定位,我的爆款的复盘, 以及我的选题方向的这几个定位,这是我之前就会有一个引导对话,我这边就跟他讲,我说我发现这些内容太过时了, 你要去重新帮我把这些内容梳理出来,他本来已经准备在做了,最后发现他读的内容太旧了,你就改了他的方向。对,我先去帮你更新你的这些账号定位,对,我要去更新,这个时候我就跟他说,我说你去读去账号吧,你看他在这里面先读了五十一条小红书的内容, 又去读了所有抖音的数据内容,那小红书的所有的明细,然后抖音的所有明细他自己全部读完了以后存在本地,基于这些内容 他开始来做重要的判断,他这几个判断内容是自己判断的,还是你给他自己判断?他根据我的数据分析了我的账号内容,爆款的内容梳理出来的, 那他总结了以后,我说好,那你居然已经调研完了。我说你去把我之前的粉丝画像,账号策略,你去更新一轮,他就叭叭叭叭叭叭更新了一轮最新的内容,所以这是他最后给我的一批我的一些材料,基于这些材料以后,他才会帮我去做这件事情,根据我账号的策略定位, 去帮我寻找跟我匹配的账号的数据。好,注意到小细节,这边这个选题推荐这个 skill 是 你自己写的还是你外面找一个?是我跟他之前合作沟通出来,就是你刚才这生成的一些整套 skill 形容一个,对,是的, 这个里面他就会拿了我很拿到了很多的标题数据。嗯,然后他就给出了所有我这个像内容的爆款的一些封面的建议,然后包括他还给我了一些我能做的选举的建议,都是爆款的选举建议。嗯,好。然后这些内容我跟他讲,我说你要去思考一下你怎么样去更新到现有的 skills 里面。对, 你看他就告诉我直接可以写进 skills 里面的一些规则。好,然后我们看一下我怎么使用的。嗯,然后当我这边输入案例包装,它就自动去调用我的 skills, 然后它的 skills 都是关联在一起的,然后当我把我的字幕给他以后,它就会自动唤起它的一个写作的一个 skills, 然后来去把我这个整个包装发布的内容给它写出来啊,包括标签,包括里面的封面。然后呢?有了封面以后,这个时候他会说他去调用封面 skills 来处理这个图,他就做了好多,你俩玩起来啊,然后他就做了很多不同的图,它还会自动去生成, 因为我还有别的平台,所以它就会生成不同尺寸的图片,你看生成各种尺寸的这个图片给我,生成完了以后,它其实是标题描述标签都是有的,我直接复制就结束了。对,这就是一个全的流程,其实这套方法论 就是最重要的,其实它是不断进化,不断迭代之后。现在不是有那个 codex, 不是 有那个定时功能吗?比如说每个礼拜五去 check 我 所有的视频数据,然后去自动化更新我的相关的一些策略。写作啊,对,写作 skill 更更新过去以后,我每次用到都是新的,就它可以跟着我的账号一同成长,我觉得这个是很牛的。然后再比如说你看这这次的内容生成完了以后,我发现有些过程是可以调优的啊,这个时候我就跟让它去 思思考一下他学到了哪些经验,然后将这些经验告诉我,然后我来判断这哪些经验可以沉淀为 skills, 然后这样的话他下一次就不需要我再教他了,你看他会整理出一批,然后呢?我确认过了以后,他会说他更新了 skills, 他 整理了哪一节步骤,所以我的 skills 是 越来越能够符合我的要求的, 而且再加上 image two 这个深普能力来了以后,封面指出的概率非常高了,我几乎很少去调了。那现在你的就是整个工作流程里面,哪些是 ai 帮你做,哪些还需要你人来做?呃,现在目前我在坚持真人拍摄,然后包括其实选集主要还是我们自己来,就是视频剪辑完了以后,我们直接字幕出来了以后, 视频的封面啊,描述、包装、标签,各个平台的封面的差异,全部都是 ai 在 做的啊,你就露了一个前面就是拍摄前面的啊,就说选题的大纲的准备,嗯,对,选举其实我们自己在准备,但是选题大纲我们会让它来梳理 一下。对,其实我先把我自己,因为我们有的时候内容会需要很多配套的一些材料,比如说我今天要讲 q d s, 嗯, q d s 背后很多一些功能背景,它会帮我收集很多资料。准备好或者这样子,然后呢继续接资料,然后一个大纲, 然后呢?大纲我确认好后再去输出一个 ppt 大 纲, ppt 大 纲里每一页需要画什么,嗯,然后时候再用,再用 ppt skill, 它会帮我做 ppt, ok, 这样子。 嗯,所以这是我们拍摄之前的一些准备。对,其实下次我们可以分享一下拍摄前的一些内容准备,对,这个是我们拍摄完以后数据输出,对,运营数据输出盘,对对对,是,然后最后一个想讲的就是我的整套方法论并不能让我的所有的内容都成为爆款, 是因为去不断地才根据我现有的数据去给我提供建议,也就说他其实是跟我一起成长的。嗯,所以他并不能让我一个 偏账号小白的人立刻成为一个每天爆款的大牛,他只是能不断地基于我现在的重复工作帮我去减少跟我的工作量,就是他没办法取代你的经验。对,他也可以取代你的流程。对,是的,所以他不能让我立刻就变成一个大牛啊。对, ai, 现在时代就是这样,就是成为你能力的杠杆。 对,他是我能力的最上限,所以这个就是我们今天想要分享的,然后包括这一期准备了哪些 skills, 到时候我会变成一个文件,然后放在我们的那个群文件里,大家可以去参考一下。好,那本期视频就这样,拜拜。

我们都知道,我们在 gbt 可以 实现通过生成一张图片的各个元素来实现它的 psd 分 层, 但是呢,通过这样的生成方式生成的元素最多不超过十个,而且它的文字是不可编辑的。这时候大家不妨试一下用 codex 来完成这些操作。 codex 它不仅仅是一款为编程而服务的 agent, 那 同时也能帮我们实现很多工作的自动化。 而且就在本月月初, codex 它的每日安装量已经超过了 cloud code。 另外 codex 本身已经支持了 gpt emoji 二点零的图片生成, 所以今天我们就试一下在 codex 上来实现它对图片的 psd 分 层。我们上传一张和之前一样的图片, 为了方便呢,我们这里选完全访问权限,对于这样偏简单的,我们自然选择中就可以了。跟 gbt 客户端一样,我们只要输入好提示词,然后按发送键就可以让它执行。当然这个提示词我可能要求比较严格,写的比较多, 所以比较长一点。好的一共花了十六分钟,他就给我生成了一个 psd 文件。在整个过程,他其实就是对各个元素进行重新生成,并对其中的文字进行一个 ocr 识别。 在我们的 ps 中呢,我们可以看到它不仅把这些元素分开了,而且把各个文字都转化成了一种可编辑的状态。当然它字体做不到百分之一百还原,但好在它的字体是可以进行编辑和修改其中的具体内容, 而且字体外的图层它同样是分割好可移动的。我们再看一个马克杯的例子,同样是用这一套提示词,当然它这里中断了一次,因为它生成的跟原图差距过大,所以我让它继续生成好,这就是最终生成的 psd 文件。 你看到元素可以移动,文字可以编辑,没什么问题。我们在利用 emoji 是 二点零制作这样的图片。除了文字的问题之外,我们还会遇到一个问题,就是它的图片通常就是生成一 k 的 图, 如果我们想打印图片或者要更高分辨率的图片的话,如果它值出的一 k 图片完全没有办法满足我们。但是它用 api 能生成四 k 的 图片,但是呢,这个 api 一 是要额外收费,而且 它和我们要拆分的过程相背。所以我建议大家在编辑好图片之后,可以通过以下两个方式进行放大。第一种方法,我们可以通过 comfy 里的 c 的 vr 这个模型,把我们一 k 的 图片放大到四 k。 工作流也非常的简单,我这里大概花了一百二十秒, 大家也可以看一下它跟原图的对比,放大效果还行,没有改变太多原图的细节。 如果你完全不会使用 comui 的 话,你也可以用谷歌它的 nano pro, 我 们在这个 ai studio, 我 们可以选择这个 nano pro。 右边这里我们也简单设置一下。首先把画质调到四 k 温度的话,调成零到零点二之间比较好。最下面这个参数呢,我们也给他调成零点五。同时我们输入以下提示词,一分钟后我们也可以得到一张四 k 放大的图片了。 我们也可以看下对比效果,虽然变清晰了,但是比 s d vr 它的重绘幅度稍微大那么一些,但是整体的细节大多数没有改变,可以勉强接受吧。这就是整个在 codex 来实现 p s t。 分 层加上高清放大的 一些基本方法。当然你可以通过 codex 来实现一些更高难度,更精确的 p s t。 分 层和 自动化工作流。我这里只是抛砖引玉一下,你可以把梯子十优化的更好。总之,以后 codex 无论是在编程还是说像这种图像自动化处理流程,都会变成必不可少的工具。我们本期利用 codex 如何将 图片进行 psd 分 层以及 image 二点零图片放大的方法就介绍到这,有关于具体的提示词,还有空 v i 的 工作礼物会放在视频剪辑的下方。 好,如果你觉得本期视频对你有所帮助的话,欢迎帮我点一个赞,我们下期再见!

前两天发的 cloud 指挥 codex 干活的视频火了,评论区两级分化,有人说这套架构确实提效明显,也有人说纯玩具卵用没有。 今天我们就一步步把这套写作系统搭起来,建议先点个赞,关注加收藏。我的态度很简单,没有调查就没有发言权,跑一遍再下结论。 好,先说清楚这套架构到底有什么好处呢?第一,在复杂编码场景下,极大降低 cloud token 消耗。 cloud 最贵,但我们不让他写一行代码,只让他当甲方领导,当项目经理,分析需求、拆分任务、验收结果,最费钱的代码实现全部交给别人来做。第二,实现监工效果。 cloud 充当甲方领导和项目经理,负责规划和验收。 codex 是 后端开发,负责服务端代码编辑和单元测试。 gemini 是 前端工程师, 担任代码审查和安全审计。第三, codex 和 gemini 成本几乎为零,量大管保。结论就是 cloud 出脑子, codex 和 gemini 出力气,钱花在刀刃上, 真正花钱的只有 cloud 做决策那一小部分。在开始之前,你需要确保三样东西都装好了,分别是 cloud code、 codex client 和 gemini client, 执行视频中的三个查看版本的命令,如果都有版本号输出,那环境就没问题,没装好的先暂停视频去装一下。 第四,也是很多人漏掉的一步,理解整个工具链的使用顺序。这三层是有先后关系的。第一层 cloud md 是 规则层, cloud 启动时自动读取,里面定义了协助、规范和角色分工。 第二层, superpowers 是 能力层,提供标准化的规划、审查、调试流程。第三层, c、 c、 b 是 通信层,让 cloud 能通过 ask、 pen、 ping 指挥 codex 和 gemini。 第五,在 cloud md 里写好协作规范。接下来看我本地的文件。首先定义了 cloud 是 架构师、项目经理, codex 是 后端开发, gemini 是 前端开发,这是最基础的角色分工,简单明了 降级机制,明确了异常情况下的接管规则。接着明确了协助方式,使用 superpowers 进行任务设计,通过 c c b 相关命令指派任务。 同时还定义了 linus 三问以及 get 代码提交规范等。这些规则 cloud 启动时会自动读取,不需要每次手动告诉他。你只要把规则写好, cloud 就 会严格按照规则来执行 好。接下来我们进入 cloud 执行视频中的命令,进行 superpowers 插件安装,执行视频中的两条 plugin 命令就可以出现, successfully 就 证明安装成功。 安装完成后, cloud 就 具备了标准化的规划、审查、调试能力,这些能力后面实战中会用到,非常关键。接着要安装终端附用器。 ccb 是 依靠终端附用实现多个模型之间的通信, linux 和 mac 用户安装 tmax 即可, windows 用户需要安装 winterm 或者使用 wsl。 本教程以 tmax 为例,安装方法很简单,一条命令就搞定,执行命令后,我们进入新的终端环境。第八,安装 ccb, 全称 cloud code bridge, 这是让三个 ai 互相通信的桥接器。注意, ccb 是 社区开源项目。特别感谢 bfi 幺二三作者的贡献,它不是官方内置功能。 ccb 依赖 python 三点一零以上版本,安装前先确认你的 python 版本没问题。 python 版本确认无误后,我们执行 git clone 下载 ccb 项目,下载完成后 cd 到项目目录, linux 和 mac 用户执行 install h install 命令, windows 用户用 powershell 执行安装脚本,安装过程中 c c b 会自动配置通信组建,并在 cloud md 里注册 ask、 pinned、 ping 这些命令,等安装脚本跑完就可以使用了。你可以看到终端输出了安装成功的提示信息,整个安装过程非常顺畅,基本不会遇到什么问题。 好总结一下安装步骤,第一步,编辑局域, cloud md 定义协助规则。第二步,安装 superpowers, 提供标准化工作流程。第三步,下载安装 ccb, 打通多模型通信。三步走完,整套系统就搭好了。接下来我们进入实战环节,执行 ccb、 codex、 gemini、 cloud 命令,启动协助系统。 第二部分, cloud 是 项目经理,只动嘴不动手, codex 和 gemini 是 干活的,成本几乎为零,这就是省钱的核心逻辑。 cloud 现在开始下发任务,我们用一个真实案例实现用户注册功能需求如视频所示, cloud 调用 superpowers 开始收集用户需求,制定开发计划,可以看到它在分析需求,确认技术栈,设计系统架构,整个过程完全自动化,不需要人工干预。我们简单看一下 cloud 生成的计划, 规划的非常清晰, gemini 和 codex 的 分工非常明确,甚至还详细列出了项目的文件、架构、接口文档、验收标准等内容,这就是 superpowers 规划能力的价值,省去了大量的沟通成本。 cloud 把规划好的后端任务通过 ccb 发送给了 codex, 你 看画面上, codex 收到命令后,立刻开始疯狂扣顶,速度非常快,文件在不断滚动, 可以看到 cloud 已经获取到 codex 正在执行任务的状态。与此同时,他又通过 ccb 给 gemini 下达了前端开发任务, 两个模型现在是并行工作的,互不干扰,效率拉满。 gemini 收到了任务。你看,任务里面明确列出了前端开发功能、验收清单、注意事项等内容。任务描述非常详细, 这就是 cloud 作为项目经理的价值,把需求拆得清清楚楚。两个打工人正在努力完成需求,我们稍等一下,看看他们的执行结果。 cloud 为了更精确地掌握开发进度,建立了三个 task, 用于跟踪前后端开发及代码审查任务。你看,它自动创建了任务列表,标注了负责人和当前状态,这就是项目经理该干的事情,实时监控进度,确保项目按计划推进。 这时候, cloud 发现 gemini 只是确认了任务,而并没有真正开始执行。随后, cloud 重新将任务委派给 gemini, 催他赶紧开工,你看这个监工效果是不是很到位。另一边, cloud 跟踪到 codex 已经完成了开发和测试工作。接着 cloud 去查看 gemini 的 执行进度,结果发现 gemini 还是只确认了任务,没有动手, 这已经触发了降级规则。于是 cloud 果断让 codex 接管前端开发。这也是这套架构的另一个特色,无需让用户去处理这种特殊情况, 只需要把任务交给 cloud, cloud 就 会根据 cloud md 里定义的降级规则自行安排处理,直到完成项目要求。整个过程完全自动化。 codex 此时正在飞速编写前端代码,一个人干两个人的活。这里我们跳过执行过程,直接看最终结果。 完美 codex 已经完成了前端开发工作,但是由于我们在掩饰中故意让 gemini 不 可用,所以 cloud 只能亲自开展代码审查工作。他调用了 superpowers 的 审查能力, cloud 完成了代码审查,出具了详细的 review 报告。接下来他开始创建 git 提交。我们来看一下 cloud 做的 review 报告, 报告内容非常清晰,详细总结了前后端代码的完成度、安全审查结果是否存在潜在漏洞,以及整个写作过程的总结和验收标准的达成情况,质量相当高。 好,我们来做一个总结, c c b 加 superpowers 这套架构的核心特点是灵活高效,节省 token, 合理分工。 cloud 只做最关键的决策和验收,所有编码工作全部委派出去, 降级机制保证了系统的容错能力,任何一个模型出问题都不会影响项目的正常推进。多 ai 写作的关键不是模型数量,而是统一输出和统一验收。建议先用 cloud 加 codex, 两个模型跑通一个完整流程,稳了再加 gemini。 下一期我们讲 crcd 与自动化,把今天搭的这套工作流接入,持续集成流水线。点赞关注不迷路,我们下期见!

这是一条 codex 从零到一完整的新手入门教程。如果你之前完全没用过 codex, 或者只是听说过,但不知道它到底能干什么, 怎么装,怎么用,那这条视频你就可以收藏了。我会按照一个新手真正上手的顺序,带你从 codex 试什么,讲到安装、使用、主界面、怎么操作、基础功能和进阶技巧、 skills 插件、浏览器终端和自动化任务等等,让这个目前全球最顶级的 a 阵的工具真正为你所用,创造价值。 我也会把整个流程整理成文档,打一句 codex, 方便对照,一边看一边选。你可以先把它理解成一个装在电脑里的 ai 工作助手,他不是单纯陪你聊天的工具,而是可以进到一个具体的工作文件夹,帮你读取文件、修改内容、运行命令、调用工具,甚至按步骤完成复杂任务。 举个最简单的例子,像 chat、 gpt、 豆包这一类工具,更像是你问他答,你自己去做。比如你想做一个网页,他通常只会给你一段代码,接下来你还要自己复制代码、创建文件、运行、检查报错等等。而 codex 是 你问他,他理解他还做,他会从零到一帮你创建好这个网页。 目前最适合新手小白的上手方式呢,是桌面端 app, 我 们可以直接在官网开始,根据你的系统选版本, windows 或者 mac os 都可以。安装之后有两种登录方式,一种是官方 chad gpt 账号登录,另一种是用 apikey, 可以 是官方的,也可以用中转站。两种方式各有利弊。综合来看,还是建议第一种,直接官方账号登录, 省心省事。对于 codex 的 界面,新手可以先关注三个核心区域,最左侧是一些常见功能入口和聊天记录管理区,你可以理解为导航栏加历史记录。这里需要重点讲一下对话和项目的区别。对话最好理解就是普通聊天嘛,你甚至可以把它直接理解为 chat、 gpt 或者豆包, 适合随便问一些小问题,帮你写文案、查资料之类的。它不跟具体的文件夹绑定,而项目就涉及到了具体的生成式任务,比如 如飞哥之前开发的工具箱网站,飞剪一触即达这种软件,他们有大量的编程代码文件,就需要一个专用的项目文件夹。你在这里可以新建空白项目,也可以打开现有文件夹,直接选择路径,或者直接把文件夹拖进来也行。鼠标悬停在项目名上,也能看到这个文件夹在电脑中的 底位置。而对于重要的常用的项目和对话,右键就可以置顶,方便快速切换和查看。左侧下方还有设置入口,在设置里你可以修改 codex 的 使用偏好、外观和配置等等。其中个性化需要重点说一下, 如你想给他一个全局指令,就在自定义这里直接写,比如他要怎么称呼你,固定用中文回答问题,设定一些底线原则或者开发习惯,设置完之后对所有项目都会生效,相当于让这个员工摸清楚你这个老板的脾气,投你所好。这里还有一个很有意思的小功能,叫桌面宠物, 他提供了很多默认的宠物形象,你也可以根据自己的喜好让他帮你创建一个,比如我这个就是给了一张参考图,让他自己做出来的,他会实时显示当前任务的一些简单状态,还是挺好玩的。 在首页设置这里还能看到剩余用量,你可以清晰的看到五小时用量和一周用量,做到心中有数。中间这块就是你和 codex 的 主要沟通区域。首先是这个加号里面有两个非常重要的功能,一个是计划模式, 比如你让他开发一个个人博客网站,不要上来就直接让他干,而是让他先列出计划。相当于你给员工一个项目,得先让他出方案,看看他打算怎么做,这样能有效减少返工,既省精力又省 tokyo。 看啊,他会主动问我们这些具体细节,我们按选项敲定,不满意的或者他没提到的就补充一下,让他重新规划, 这才是一个合格的领导该干的事。而目标模式就更厉害了,刚上线的新功能就是你给他设定一个目标,越具体越好,他会自己拆解分析。执行审查,有一种不达目的不罢休的意思,这样就避免了一个很烦的问题,执行一个任务的时候,他每完成一步就要停下来问你。 比如我正在跑的一个很复杂的大项目,目前已经连续跑了三十多个小时,如果正常一步一步改的话,我可能要好几天才能做完这些进度。右边这个权限设置呢,分成三档,默认是最保守的,像是联网修改文件都需要你的授权,自动审查会开放一部分权限,关键节点还需要你把控。 而完全访问就是最激进的,它几乎可以完全操控你的电脑,创建文件、删文件、跑命令,全都自己干。新手,我不建议一上来就开完全访问,刚开始用默认或者自动审查更稳,等你确认这个项目没问题,也知道它要做什么,再考虑给更高权限。我自己是在非常熟悉项目和流程的情况下才会开完全访问。 右边这里还可以切换模型,选模型版本、智能程度和推理速度。如果不是特别复杂的任务呢?不建议开超高,因为它有可能会出现过度思考,而导致你花了更多的 token, 反而干的不好。 这是血淋淋的实战经验教训,一般来说默认高就可以了。这个麦克风是语音输入,但是体验目前并不是很丝滑,我们可以直接用语音输入法。 codex 还有一个和普通聊天很不一样的地方,任务可以排队,他正在执行的时候,你可以继续补充,要求这些新消息会一个一个排在后面,等他处理完当前步骤之后继续执行。比如他正在做网页,你可以接着说,页面再简洁一些,按钮换成黑色,先不要做登录功能等等。 而如果你忽然发现他理解错了你的意思,或者做了一半有点跑偏了,可以直接选择引导,强行把方向盘掰回来。所以用 codex 的 时候不一定要追求第一条提示词写的特别完美,你可以边看他做边补 充,边纠正边引导。真正好用的方式是把他当成一个正在干活的助手,而不是一个只负责回答问题的聊天框。这个思维一定要转变过来。 最右侧的区域目前包括三个功能,侧边聊天就是当前任务的一个临时讨论区。因为有时候 codex 正在执行一个主任务,但你中途想问点小问题,或者单独讨论某 个细节,就可以用它,它不会打断主对话的节奏。浏览器主要是 codex 打开网页查资料测试页面,比如你做了一个网站,可以让他直接打开本地页面,帮你检查布局按钮、交互有没有问题。如果你对某个地方不满意,还可以让他直接打开本地页面,帮你检查布局按钮、交互有没有问题。如果你对某个地方不满意,还可以让他直接打哪的感觉, 口头描述半天要精准的多。终端的话呢,其实你不需要了解太多,因为它主要是给 codex 执行命令用的。到这里,其实你已经看到了 codex 最核心的几种能力,它可以进入项目,读取和修改本地文件,可以用计划模式先想清楚怎么做,可以通过浏览器查资料测试网页,也可以通过终端运行命令检查结果。 所以 codex 真正厉害的地方不是某一个单独按钮,而是它能把这些能力组合起来,帮你完成一个完整任务。理解了这一点,后面的 skill 插件和自动化任务就很好懂了。 因为前面这些能力呢,解决的是 codex 自己怎么干活的问题。但如果你想让他干的更稳定,更像一个熟悉你习惯的助手,就需要用到 skill。 如果你想让他连接更多外部工具,就要用到插件。 这里很多新手分不清 skill 和插件,其实用一句话就能记住, skill 是 方法,插件是工具。 skill 可以 理解成一套可以附用的工作流,或者说给 codex 的 一份工作方法说明书。比如一家公司做项目,通常都有一套标准流程,第一步做什么,第二步做什么,输出格式是什么,有哪些注意事项,哪些地方不能乱改。 这些东西如果每次都重新告诉 ai 一 遍就很麻烦,而且 ai 它还可能每次理解的不一样。所以更好的方式是把这套工作流程固定沉淀成一个 skill。 这样 codex 下次遇到同类任务时,就不用像一个新员工一样重新摸索,而是直接按照你写的流程和标准来做。 比如我自己的飞鸽工具箱里就有很多专属 skill。 比如把好用的软件保存入库到本地,同步到我正在做商单推广的几个云盘,生成下载链接,再同步到正式站,这些流程全都是固定的。 我把它们写成 skill 之后, codex 就 可以按这套流程稳定执行,不会每次都跑偏。再比如,你经常写短视频文案,也可以让 codex 帮你做一个短视频文案 skill, 把你之前写过的大量文案喂给他,让他总结你的开头风格、结构、习惯语言表达、结尾方式,然后形成一个专属文案助手 后,再写类似内容的时候, codex 就 会优先按照这套方法来。插件就不一样了,插件更像是给 codex 装上外部工具,解决的是它能不能操作某个平台,处理某种文件,连接某个服务。 比如浏览器插件,可以让 codex 打开网页查资料、测试页面表格插件可以让它处理 excel、 ppt 插件可以让它生成演示文稿。 gmail 插件可以让它整理游戏, camera 插件可以把生成的内容导入到设计工具里继续编辑,所以不要把他们想的太复杂。 skill 解决,怎么做插件解决用什么工具做?一个是工作流程,一个是工具能力。 codex 目前已经集成了很多实用的插件和 skill, 我 也整理了几个比较常用的,大家可以截图保存,后面自己试试看。 最后我们再来看一个比较进阶但非常有想象力的功能,自动化任务。你可以先理解成让 codex 在 固定的时间、固定的项目里自动帮你做一件事,但它和普通题型软件不一样,它们最多告诉你该干什么了。 而 codex 的 自动化任务是真的可以帮你执行一整套流程。比如你是做内容创作的,你可以让他定期帮你收集某个领域的热门选择题,整理成标题、角度、参考链接和可以拍摄的脚本。而飞哥最常用的就是每天固定时间设置一个今日任务清单,划掉昨天已经做完的,生成当天新的任务, 就像一个机器人一样按清单执行。这也是为啥有人说我效率那么高,一个人干八个人的事情。除了 ai 的 强大助力之外,任务规划本身也非常重要。所以自动化任务真正厉害的地方不是定时提醒,而是定时让 ai 按你的要求去干活。 最后再补充一个很多人会关心的问题, codex 能不能在手机上用?据我所知有三种方式,最早大家都是用 happy 这种开源项目,它可以连接 codex cloud code, 电脑上开个任务就能通过手机和 agent 的 沟通,但始终不太方便,相当于只是给你安排了一个传话筒。 而 codex 的 mac 版本最近更新了手机端的入口, chat gpt app 里面就有 codex 可以 完整读取你的聊天记录。在手机里聊天和电脑端的消息是完全同步的,本质上是远程链接,相当于把你的电脑版正在跑的 codex 搬到了手机里。而最近我发现了一种非常爽的方式,就是网易的优优远程, 出门的时候手机直接远程连电脑,操作起来很方便,最关键的是你能同时测试它的改动,这就相当于把你整个电脑都装进了手机,所以功能最完整。 好,最后我们来个回顾,总结一下你都学了什么。如果你是第一次接触 codex, 其实今天不用记住所有按钮,也不用一上来就研究特别复杂的自动化和插件,你只要先记住这条主线就够了。第一, codex 不是 普通聊天工具,它更像是一个能进入你电脑工作区的 ai 助手。第二,临时问问题,用普 对话,真正要处理文件、项目代码、文档就用项目。第三,复杂任务不要直接让它开干,先用计划模式让它列方案,如果是一个长期目标,再考虑用目标模式让它持续推进。第四, skill 是 方法,插件是工具。 skill 负责告诉 codex 怎么做事儿,插件负责让 codex 连接浏览器、表格、 ppt 邮箱这些外部工具。第五,自动化任务不是简单提醒,而是让 codex 在 固定时间按照你设定好的流程自动干活儿。 所以新手今天先做三件事就够了。第一,安装并登录 codex 桌面端。第二,建立你的第一个项目,找一个真实的小任务试一下,比如整理一个文件夹,总结几篇文案,或者生成一个简单网页。第三,让 codex 帮你写一份自己的 agents, 点 m d 就是 我们刚才提到的个性化。现在你让他自己干,把你的 称呼、语言、习惯、输出格式、工作偏好都写进去。当你把这三件事跑通之后,你就不只是会用一个 ai 工具了,而是开始拥有一个真正属于你自己的 ai 工作站。祝你越来越牛逼!

好的,我们今天给大家带来的是 codex 的 完整教程,那 codex 呢?是 openai 的 一款编程工具,很多人看到编程就已经被劝退了啊,但是不用担心,我们今天这个视频呢就会教给你,因为我自己其实也不会写代码,但它却是我近期使用最多的 ai 产品,甚至让我觉得自己变得厉害了很多。 首先我们来讲一下它跟一般的 ai 产品有什么区别,那它最核心的区别呢?就是能够控制你的电脑去完成很多的任务,这里面有一些关键原因我没有办法在视频里面说,我就放在评论区了,你们可以看一下和其他工具主要的区别是其他工具更像是助手,它会告诉你去怎么做,但你实际还是要你自己做, 但 codex 他 知道怎么做,他告诉你他会怎么做,然后他就自己把它给做掉。那所以今天这个视频呢,我们会分成四个部分,首先我们会讲一下这个工具在哪里去使用。第二呢,我们去讲整个产品的界面跟功能都有哪些,哪些是需要重点需要知道的。然后是我们作为 没有技术背景同学,该怎么样去跟 codex 沟通跟交流。最后就是整个场景,我会带大家一起去尝试做几个场景,如果看完这个视频你真的去尝试去做了,那我的这个视频目标就达成了。首先我们先说一下去哪里使用,如果你已经是下载 gbt 的 用户的话,我们就来到下载 gbt, 然后在它的左侧去点击 codex, 进入到这个页面之后,我们选择中间的版本,或者你也可以直接谷歌搜索 codex, 在 第一个网站里去点击这个页面,进入后下载到对应你电脑的版本。 在一开始呢,他可能会需要你去创建一个文件夹,那这边呢,我们直接在桌面上创建一个以你名字的文件夹就可以了。好的,然后我们来讲一下它的界面和它的功能,从大体上来看,其实它的整个产品界面跟我们一般用的 ai 工具还是很像的。 在左侧是往期的聊天历史跟部分的功能,右侧是 ai 沟通的工作界面。那什么是项目跟现成呢? projects and thread, 那 这是两个基础的变身概念,你可以把项目理解成是一个大的文件夹,现成理解成一次次的对话, 就跟一般的 ai 产品一样,就每一次我们聊天的内容,就好比是一个新的县城啊,那假设以做网站为例,那这个时候呢,我们就开了一个新的项目,这个项目就叫做网站。那在这个网站的文件夹里,它的县城可能是什么?可能就是 像首页啊,产品页,关于我们这些不同的页面,我们把它分开来,它就是不同的县城。你只需要理解说不同的项目,你要建新的文件夹,在那个文件夹里面去针对性的做不同的任务。在右侧底部 这边就是跟 ai 沟通的地方啊,这边可以上传照片文件,选择对应的模型,我们这边默认去选择 gbt。 五点四推理的强度的话,就按照中来执行。那特别复杂的项目,比如说 app 啊,或者说一些后端的产品,你可以在 啊网上选,但也要注意,就你的 token 的 消耗也会对应的提高下方的本地,它代表的是它会在 你的电脑上运行啊,然后就是权限,那我这边是建议全部打开,这样他就可以完整的去操控你的电脑。那在这个县城里面右下角会显示背景信息的窗口,也就是上下文的记忆,就你可以把它理解为每一个窗口 他能记住多少你聊过的东西,那如果这边显示了百分之三十六的记忆,那剩下的百分之六十四 就是他还能记住的部分,那当你持续在这个窗口去聊天,他会把这些记忆进行压缩,所以你还能继续聊,只不过记忆不会像之前的一样准确, 所以还是建议大家不同的任务开启不同的县城去处理。我们这边不会具体去讲 skills 跟自动化很多篇代码部分的,大家可以先不用看,它并不会影响你的正常使用。在讲完了大致的功能跟界面之后呢,我们再来说一下使用 codex, 尤其是非技术同学你需要注意的点。 呃,首先就是 codex, 它更多是用来执行的,它不是用来聊天的。其次就是在这个产品当中,你给的信息越清楚,它的执行会越准确。最后就是尽量去在它执行完之后去问一下它,你到底改了什么这种方式呢?就可以来判断 它的一个逻辑,然后可以更好的去让它工作。那在使用 codex 的 时候呢,你会经常看到这种指令叫 run 什么什么什么? 它是什么意思?它就是一个简单的终端指令,它指的是 codex 正在用你的电脑进行操作,完成他想要的任务。 终端是什么呢?你可以把它理解为是一个代码在跟你电脑沟通的一种方式,那平时我们用电脑其实都是用图形交互,就比如说我在用鼠标啊,在滑,在点击,但其实在电脑之间,它是可以用代码的形式更快的沟通,但只不过我们不会,那现在就相当于 你可以用大白话去跟 codex 沟通,而 codex 直接通过代码语言和你的电脑进行交互。那最后呢,我们再来看几个实际的案例,大家手把手的一起来操作一下。首先在开始之前呢,我们先确认一下你已经创建了一个文件夹 啊,然后打开一个新的县城啊,在这个文件夹的框的下方呢,我们去把这个权限给全部打开,将模型切换到五点四,我们的第一个场景就是让 codex 去全面的检查一下你电脑的性能啊,看看有什么地方可以优化的。 直接在对话框里输入,帮我全面检查电脑的性能,看一下有没有什么优化的地方。你在自己做这个案例的时候,重点可以关注一下 codex 是 怎么执行的,并且一步步的分析你电脑性能, 然后呢,你让他去进一步的帮你完成这个操作。第二个场景呢,就是我们让 codex 直接去帮我们整理一下桌面啊,因为现在的桌面全是各种视频啊,图片还有文件夹,那我希望他可以把视频归类到一起,然后图片也归类,我们就直接在对话框输入, 帮我整理桌面,因为现在太乱了啊,把不同的文件进行归类。最后一个场景就是如果我们看了上一期的教程,就是我们谷歌 stitch, 你 可以看一下这是做讲怎么做网站跟做交互的,那我们现在呢就直接让 codex 把这个页面给做出来 啊,直接先来到 stitch 的 这个页面,然后把我们这个首页的代码给复制,然后回到 codex, 把代码粘贴给他,让他把这个前端的页面给直接做出来, 然后这边就是它生成的一个前端页面,是完全根据我们的设计稿来做的。然后还有一种做法呢,就是你可以再一次的把 stitch 里面的设计文件去导入到 figma, 然后在 figma 里面做最后的调整,之后再导出 把这个链接给到 codex, 就 codex 可能会更加的喜欢用这种方式,直接用 figma 的 链接啊,做出来的效果也是一样的。那今天呢,我们就完整的过了一下整个 codex 的 使用方式,那不出意外他们会在近期做一次更加大的更新, 到那个时候呢,我会再去补充一次教程。还没有关注同学记得点赞关注。还有就是大家有什么好的反馈跟需求也可以跟我提,我是瑞哥,那我们下一期再见,拜拜。

如果你最近也给你的 codex 或者 clockwork 装 skills, 很 容易掉进一个坑,就是你被推荐了几十个甚至上百个 skills, 但是真正开工的时候还是不知道该选哪一个。所以说这一期呢,我也不做大而全的清单,也不讲复杂的安装, 我只按普通小白最容易遇到的六类任务去挑六个 skills。 新手先认识这些就够用的一些 skills, 它们能够分别帮你去解决任务,先问清楚想法,先变方案,知识库能调用,重复流程能沉淀网页结果能验证和各种文件都能够转化成 ai 好 读的这种材料。 ok, 大家好,我是 fred, 专注从普通小白的视角去分享怎么从零开始用 ai 和 web coding 提升自己的生活和工作效率。 那第一个 skill 就是 大家已经耳熟能详的东西啊,就是 using superpowers, 就 它的核心作用是能够让 ai 在 开始做事之前先停下来,把任务问清楚。 就很多时候很多人用 ai 的 痛点不是说 ai 不 会写,而是它太快开始写了,就是你一句话发给他,他可能马上能够给到结果,结果做完了之后才发现说你的目标边界格式和验收的方式都不对。 那这个 skill 所做的事情就是让 ai 先理解任务再计划,最后再验证。所以说它特别适合那种长任务,包括你的需求模糊的时候,以及你经常让 ai 做完又返工的这种场景,那这个 skill 那 就非常适合。 第二个是我非常常用的 skill, 就是 brainstorming, 就 它解决的就是想法,当你还没有想清楚的时候,可能就着急开做的这种问题, 很多人找 ai 去做东西,一上来就说,哎,帮我做一个网页,哎,帮我写一个方案。但其实当你的目标用户,你的内容重点,你的功能边界都没有定的时候,那这就体现了 brainstorming 的 价值, 它会让 ai 先跟你把想法聊清楚,再给两到三个不同的方案,并说明每个方案的一个取舍。比如说你要做一个内容栏目,一个页面,一个工具,一个产品的 demo, 它会先问清楚做给谁看,解决什么问题,哪些功能要不要做, 然后再把你的模糊的想法整理成可执行的这种设计。所以说它适合新项目开头,包括内容策划的开头或者功能设计的开头。 第三个也是我经常会用的一个 skills, 就是 obsidian skills, 就 如果你在用 obsidian, 或者你有大量的笔记资料网页的这种摘要,那这个我觉得就非常值得去收录啊, 就它不是简单地帮你去多存一些笔记,而是让 obsidian 里面的这种 markdown 的 文本,这种 bases 或者 canvas, 或者你的网页资料能够变成 ai 可以 重新组织的这种工作材料 就很多人的知识库最大的问题就是资料一直在往往往里面堆啊,然后真正写文章的时候,做研究的时候,包括你复盘项目的时候,就很难够重新再调动出来用。 所以说这个是会更适合内容创作者、研究型的岗位和那种顾问啊,或者长期的学习者,他的价值能够帮你把长期积累的变成一个可持续输入的一个资产。 第四个我相信是一个所有人都一定会用到一个 skills 啊,就是 skill creator, 它的作用就是帮你去生产你的 skills, 那 它解决的是你的一些重复流程的问题,比如说呢,你每周都会让 ai 写周报,那每次都要重新去讲格式、口吻,保留字段,或者一些审核的一些标准, 或者你反复让 ai 去帮你整理资料,改一些发布的文案,或者检查网页,那这些事情如果我每次都重新解释,去写一些 prompt, 写一些提示词,那本质上就是没有把这些 流程给沉淀下来。那 skill creator 的 价值就是帮你把每一次的对话变成一个可附用的 skills, 它适合做一些固定的格式,然后重复的流程,以及你希望以后能够把自己和团队都能够稳定使用的任务沉淀下来。 第五个呢,是 pay write, 其实它不是一个 skills 啊,就它更像是一个呃,浏览器自动化的能力 就是它可以让 ai 真正地去打开网页,去读取里面的页面的状态,点击按钮,包括说填写表单,截图,检查做网页或者落地页这种后台表单产品 demo 的 时候呢,这个非常非常有用啊,就因为很多时候 你只看代码是看不出来的,比如说按钮点不了,或者文字溢出,或者移动端变形,对吧?或者表单提交失败,这些都是要真正打开浏览器才知道。所以说 playwrite 的 价值就是让 ai 不 只是生成结果,还能帮你验收结果。 最后一个呢,就是 mock it down, 它的作用是能够把各种文件转成 ai 更好读的 mock down 的 这种文本,比如说把 pdf, 你 的 word, ppt, excel, 甚至网页 html, 一 些 csv 或者 jason 图片甚至音频, 都可以转成结构化的文本。为什么这个重要呢?就因为很多时候 ai 总结不准,其实并不是它模型弱啊,而是输入的这种文件结构太乱。比如说文件里面有表格,有分页,有图片,有格式, 那 ai 直接读就很容易漏掉一些重点。所以先用 markdown 这个 skills 把材料变干净,再去总结提取和改写,那结果通常就会变得稳定很多。 所以说呢,这六个 skills, 你 可以把它们理解成 using superpowers, 帮你先问清楚。 brainstorming 帮你用好知识库。 skill creator 能够帮你沉淀重复的流程, 而 playwrite 能够帮你去验证网证网页的结果,或者帮你去爬取一些网页的数据。而 markdown 能够帮你把文件变成 ai 好 读的这种材料。所以说你也不用一口气全装啊,也可以一开始呃,慢慢的一个一个去选,先知道它们分别能帮你做什么,后面可能遇到一些 对应的问题,然后再去用一些对应的 skills。 ok, 我是 fred, 后面我会持续帮你去猜普通人怎么把这些能力用进自己的真实的工作流。 ok, 评论交流你现在最想解决的一个 ai 问题,我会在评论区里面去回复,我们下期再见。

前两天我做过一期视频,用同样的 prompt, 同样的真实项目任务实测,对比了 cloud ops 四点六和 gpt 五点三 codex 那 期视频做完之后,评论区有人问 国产模型能不能也拉进来比一下,这次机会来了,这一期视频我要做两件事情,第一个,把上期那两道编程题原封不动的丢给 mini max m 二点五,看看它在同一张考卷上能拿多少分。 第二个的话,我有一个自己一直在用的自媒体 agent 的 项目,之前跑的是 mini max m 二点一,这一次直接升级到 mini max m 二点五,看看他在真实的一个生产电路里面升级到底带来了什么。看过我视频的人都知道哈,我做评测比较关注模型,他在一个真实任务里面的一个表现。 好,我们正式进入编程实测环节,我直接附用之前的两道题, prompt 一 字不改。第一道题的话,是把一个项目里面完整的一个认证用户体系 直接迁移到我有一个图片生成的一个 agent 的 项目里面去,同时再让它做一个落地页,需要考验它对于另外一个项目的一个代码理解能力,架构适配能力以及一些工程规范。 那第二个项目的话,我以本地有一个 skills agent, 之前是做的是终端 ui 的 一个部分,那这一次的话,我希望把它升级成外部 ui, 并且它要保留 string 工具调用流逝输出的一个完整链路,这个就考验它的一个全栈开发能力,以及它的 sse 流逝输出,还有 ui 方面的一些交互。 上期的成绩是 cloud op 四点六和 gpt 五点三勾代码各赢一局,那这一次我们把 mini max m 二点五加进来,看一看它的结果怎么样? 好,开始测试,两个一起弄,可以看到右边这个它识别到我们要做的是一个全单元 y, 它去加载的那个 front designer 这个 skill, 那左边这个项目的话,他发现他是需要去探索已有的项目,去找到那边是怎么做 get up 登录,怎么做谷歌邮箱登录的。先去探索嘛,先去开 saf 界面的探索, 可以看到他这边已经构建成功了,现在在进行一些后端跟前端的验证,整体这个过程测试下来的话,他会遇到一些变异问题,他也自己去修复了。待会等他测试完之后,我们来看一下他跟 cloud 四点六以及 gpt 五点三 codex 同样的代码,同样的提示词完成了一个效果怎么样? 那左边的话先让他一直跑,左边这个任务要重一些,可以看到这个地方他说项目已经启动了,然后他还专门创建了一个简单的启动脚本,来方便我后续去使用。之前我在测试 mini max m 二点一的时候, 有一些开发任务,前端后端写完之后,我需要手工让他去给我写一个 start 点 s h 的 脚本,这一次让你可以看到他在这个过程他自己去发现的这个行为,这一点点赞。现在他说已经完成了,我们现在开始去测试一下 这个就是他把那个终端 ui 变成了一个外部 ui 的 一个版本啊,可以看到左边他已经把我们已有的一些 skill 加载出来了,这个是没有问题的,下面我们来测试一下,给他一个任务,看他能不能去做到加载对应的 skill, 然后工具调用 simi 以及流逝输出都没有问题。好,我们开始 这个申请的过程,看起来没有问题,加载技能也还行,那看他执行命令 ok, 他 也调了对应的工具,只不过这里的这个图标他刚刚是有些问题的,这个状态是有些问题,有个小 bug。 那 整体的话,这一个过程其实已经把我们终端 u i 想要展示的东西已经展示出来,只不过有些小瑕疵。那之前那期视频的话, 也测了 cloud op 四点六跟 gpt 五点三 codex 嘛,左边是 cloud 的 模型,右边是 gpt, 当时我是把票投给了 gpt, 不 管它是从 ui 交互还是它整个功能交互上,明显 gpt 五点三 codex 要优要好一些。我们也可以来测试一下,直接给他一个链接吧,看他怎么怎么搞。 他也在申请,他也在加载技能,那明显能看到 gpt 五点三 codex, 他 做错做的要好一点,对不对? 好,下面我们开始去看他做的那个用户认证那个项目,那做用户认证迁移这个项目的话,其实比我们刚刚看到的任务其实要复杂一些,因为 他需要从另外一个项目去探索,找到想要的东西。其次他还得在这个项目里面去,在各种代码里面去找到他要在哪个地方去修改,前段是要修改哪些,后段是需要修改哪些,所以整体上他的复杂度要高一些。也可以看到他其实并没有一次性去完成这个任务,中间也报错了,我也跟他去沟通交流了, 那最终的话是跟他对话了三轮,他才把这个任务完成了。那这个任务在之前 op 四点六以及五点三 codex 测试的时候,他们是能一次性通过, 跑的时候没有问题,项目也能起起来。那 mini max m 二点五这边的话是有一些问题,我对话了三轮,然后把这个任务搞定了,我们来看一下他的一个表现。 好,我们先看左边,左边是之前 call 四点六写的落地页嘛, 光看 ui 其实没什么难度,因为这个项目主要是考察他去另外一个项目里面把后端代码找到,把对应的数据库找到,找到了之后再放到另外一个项目里面。所以说整体是需要看它的代码实现的功能,比如说这个 get up 登录可不可以,谷歌登录可不可以, 以及它的代码实现的怎么样,因为涉及到登录嘛,肯定安全性这些要考验。下面我们来看一下 mini max m 二点五它这个 ui 写的还可以的,比这两可能稍微会好一点, 那它的这一个谷歌登录跟 get up 登录的话也是 ok 的。 好,我们来试一下它这个谷歌登录 好,可以看到它,其实谷歌登录是 ok 的, 那我这个其实就是一个纹身图的一个 a 帧嘛,那它整体完成度啊,也还可以,但它不是一轮完成的,它中间有一些包的导入错误,还有些细节性的问题没有做的很到位。好,我们来一个整体的一个评分对比。 关于这个纹身图的 a 帧的项目的话, call 的 off 四点六表现优异一些,得分是八点二,那 gpt 五点三 codex 它因为漏了一些功能,所以说它评分要低一些,但是它的整个代码价格、工程规范是这三个模型里面完成的最好的。 那 mini max m 二点五这边它的得分就稍微要差一点,整个的功能完成度还 ok, ui 的 话会比它俩会好一点,但是它的代码架构跟工程规范会偏弱一些。好,下面我们开始做 agent 的 实测,把 mini max m 二点五放到 我已有的一个真实 agent 的 项目里面去,它是做自媒体视频拆解的,之前接的是 mini max m 二点一,这一次升级了, 我们重点看三件事情,第一个是速度,第二个是他的一个拆解深度,第三个的话是表达一个真实感。好,我们现在准备两个窗口,左边的话我准备用来测试 mini max m 二点一,右边的话我们测试 mini max m 二点五。 好,我这边找了一期我之前做 skill 原理讲解的视频,我们同时去点击看左边跟右边他的一个整体的一个速度以及拆解的深度,再看他的一个其他的表现。开始好,这边有点慢,但没关系,我们来看一下, 我们把这个展开,这个也展开,从这个可以看得到,它其实右边会稍微快一些哈,但是这个先不管,因为这个部分的话是跟 a 镜头没有关系,去做语音转,文字是本地的一些模型去转,等他把这些字幕内容提取到之后,我们再看他们的一个速度。 好,现在开始了,大家能明显感觉到吗? mini max m 二点五的是不是快的特别多? 这边已经做完了,这边就是还在,还在做, 那在速度这一块,他现在提升真的非常的明显,特别快,那他最终输出这个结果,我们要怎么去做评测呢?到底是左边的好还是右边的好? 我不能以我主观的去选择哦,右边好,左边好。所以说我找了两个模型去做评测,我们把任务给到它以及它的产出字幕内容全部给到两个模型,第一个是恰当的 gpt, 第二个是谷歌的界面,来去看这两个模型到底哪一个分析的这一个深度, 以及他的一个真实感更强,最终得出的结果。我们来讲一下,那整体的一个结果的话是 m 二点五肯定是提升的蛮多的,第一个是速度变快了,第二个是他拆解的更稀了,第三个的话是他的一个真实感更强了。好,下面我们来做一个总结。 一句话的话就是当前我们这个任务的评测的话,在编程这一块 codex 要领先一些,那 off 四点六要辞职, mini max m 二点五的话更适合做一些速度优先以及你追求性价比的快速落地的一个场景。好,这就是这期视频的全部内容了,熬了一个通宵做的,如果觉得这期视频做的不错了,记得给我一箭三连,大家拜拜。拜拜。

这临近过年,我们的国产模型真的太猛了。前面我做过两期视频,用同样的 prom, 同样的真实项目任务实测,对比了 cloud office 四点六, gpt 五点三、 codex mini max 二点五。 那期视频做完之后,评论区就有人让我测试一下质朴新发布的模型 gom 五,咱也是加班加点的干出来了,而且据可靠消息,过两天还有 deepsea 微视版本的发布,到时候也给大家带来一期真实项目的一个编程实测。 求一个一箭三连不过分吧?在这里要插播一下,当我准备去测 gm 五的时候,我去官网去订阅它的 cooling plan, 直接受庆了,就我的套餐买不到。哇,那如果按 ipa 计费的,我目前也没有找到。他们可以用 insulate 的 一个协议来测试 gm 五, 所以我就用了 ppl 他 们家的去测试,他们是非官方首发部署的 gm 五,一个开源模型的一个权重,那兼容安斯罗比的一个协议接到可拉扣的里面也非常方便,因为我之前的评测的话,都是用可拉扣的去做的嘛。所以说为了保证公平公正,我们也是用同样的 工具方的编程任务去做实测。好,我们先去创建个 api k, 这里我就写 gm 五 确认,点击复制好,我们开始进入真实项目的一个编程实测环节,也是同样的 prompt。 哈,那第一个任务的话,是把 我们另外一个项目里面完整的一个用户认证体系,包括邮箱、谷歌认证登录、 github 登录迁移到我有一个新的图片生成 a 级的项目里面,同时让它去做一个落地页, 需要考验它的一个代码理解能力,架构适配能力,一个工程规范。这个任务还算比较复杂,之前用 mini max m 二点五去测的时候,它花了三轮对话才完成的,那 op 四点六跟 gpt 五点三 colex 的 话,它们一轮对话就完成了。 那第二个任务的话是我本地有一个 skills agent, 它是一个终端 ui 交互的,我们把它做成一个外部聊天页面,让它保留 syncing 工具,调用流逝输出。这个任务主要考验它全站开发, 流势输出以及 u i u x 的 一个交互能力。之前测试的话, off 四点六跟 g p d 五点三 codex 他 们一人赢了一局,那下面我们就开始做 g o m 五的一个测试。 这两个项目现在都是开启了一个沙杯进者的模式去探索已有的代码。那右边的话,它弹出来一个让我选择想用的框架以及 u i 主键库,我就按我一个常用的方式去选好,它提示已经成功了。 好,我们打开了他给我们写的这个 y y, 哈,他把这个 skills 是 放在右边的,就展示我已有的一些项目,来测试一下它可用吗? 好,我们开始让他去总结这篇文章,看一下他有没有去做到加载这个 skills, 然后加载完了之后去执行一些脚本去做爬虫,然后再去做总结。可以看到这边他已经加载到这一个 skills 了,下面去执行一些命令 总结出来了哈。整体的话完成度还可以的,就是他这个 ui 上稍微会差一点点,相较于那个 gbt 五点三 codex 的 话,这个完成的没有 gbt 的 好。 左边这个窗口就是 cloud off 四点六写的,这个 ui 上确实会差一些。右边的话是 gbt 五点三 codex 写的,当时我是把票投给了他,那么同时去可以看一下刚刚那个任务,他们俩其实都没什么太大问题,不是特别难,后端也就 thinking, 然后做工具调用, 可以看到都是 ok 的, 没有什么太大的问题。好,下面我们去看一下那一个纹身图 agent 用户认证体系那块它完成的怎么样了? 可以看到它这个已经完成了哈,可以看到这个代码它已经写完了,我们先看它能不能一次性去启动,之前 mini max m 二点五这一块是没有做到一次性启动,我们先开新开一个窗口去测一下。好,我们可以看到 g m 五的话,它目前启动是没有什么问题啊,我们再看一下它实际的一个表现, 我们看一下它整个 ui 表现哈, ui 还行,那我们看它的那个认证功能可不可以用。我们先试谷歌登录,谷歌登录的话,它这块放了一个小 bug 啊,它把那个毁掉的端口弄错了,我们改一下。好,我们继续。 好吧,登录失败了,这边还是有些问题,你看到它登录的时候认证失败了,应该是数据库的表结构那块有点问题,从这么看的话, gbt 五点三 codex 跟 op 四点六还是要猛一些哈,就是它们没有这些问题。 好,我们再来选择谷歌登录,刚让它修复了一下, 好,他终于可以了。哎,有个问题,他登录成功之后没有回,没有进到我们的那个主页面,登录成功之后没有进到我们 agent 里面, 这个算第二轮对话吧,看他第二轮对话能不能搞定好,我们点击登录选择谷歌, 他还是没有修复成功,他还是要再刷新一下,看没有再刷新一下,进来再给他描述一下吧。现在还有个小问题,当我们认证之后,他先跳转了到首页,我再刷新页面,他才进到了 a 镜的里面。 在他这是第三轮了,就证明他在这个方面其实跟 mini max m 二点五差不太多,他们俩再点登录。 我靠,跟这个问题杠上了,他还是修复不了啊,还是有问题,你能不能好好深入去修改一下,去思考一下。 这是我们第四次对话,让他去修改这一个小问题哈,这个表现呢,就有一点不是特别好了,我们再来,如果他再再进不去,我就不撤了,这个就默认他四轮吧。 好,我放弃了。这个问题我不测了,他修他,我跟他一直对话,他修不了。我们之前测 gbt 五点三跟 colorof 四都是一轮。 ok, 我 们下面来看一下评分,整体的一个打分标准是第一个,我人为的去检测他们的一个功能完整性以及 ui 的 一些情况。那代码架构,工程规范,我都是把他们所有的代码给到 gbt 五点三, codeof 四点六,让他们分别去 review, 然后去打分。 它现在结果是这样子的, off 四点六,在第一个项目用户认证里面,它是表现最好的,它在功能完整度以及 ui 落地上是表现的比较好,并且是一轮就完成任务了。但是它的代码架构跟工程规范会有一些小问题, gpt 五点三扣贷 x 的 话,它的代码架构以及工程规范会比它好,而且是这四个模型里面最好的。那它的功能完整度呢?因为它漏了一个谷歌登录的一个前端,所以说这个评分稍微低一点,那它 ui 落地页的话也会稍差一些。 上一期视频测试 mini max m 二点五这一边的话,他是花了三轮对话去完成了这个任务。那智普这边的话,刚刚你也看到了,其实四轮对话完下来之后,他还有一些小问题,所以说评分的话,他俩其实差不太多吧,我个人感觉哈, 我们来看第二个,把这个 skills agent 做成一个外部 ui, 那 这个项目的话就是 gpt 五点三 codex, 它在业务完成上逻辑错误控制以及 ui 代码质量工程实现都是最好的。那剩下这三个的话,大家表现的都差不多吧,大家有优势的地方也有他劣势的地方。 好,下面我们开始进入 agent 的 实测环节,把 gm 五模型接入到我这一个真实的一个 agent 的 项目里面去,它是做自媒体视频拆解的, 主要需要去看他的一个速度,拆解深度以及表达一个真实感。那整个 a 型的工作内容的话,就是先去下载视频,做音频提取,转文字,然后去做内容的结构化分析,爆款元素的提取,最终输出一个拆解报告。好,我们下面开始吧。好,右边也完了, 我们来简单看一下哈,他们两边格式上会有一些差异。在拆解上我们看他这个结构拆解这块,他这个时间出其实是有问题的,他做的不对,因为我这个是十二分钟的,他是做了 十四分钟到十五分钟,那 g m 五这边的话,它也有讲一个时间戳吧。啊对,你看它有二十分钟,还有三十到三十五分钟都来了,所以说我感觉它在整个 a 帧的表现里面不是特别好啊,它这个拆解的深度也不太够,我感觉相较于昨天我测那个 mini max m 二点五的话会稍微差一些。 好,我们下面总结一下。把 gm 五接到这一个自媒体视频拆解的 a 帧里面,它的一个表现情况哈,整体上的话速度偏慢,就响应速度不算快,可能跟当前用户量大有关系,因为都知道它这个套餐都卖的受庆了。第二个的话,它的拆解深度的话相较于 mini max m 二点五会有一些稍稍不足。 第三个的话,它的一个真实感稍微偏弱一些啊,这是整体的一个表现情况。好,下面我们进入整个的一个总结环节,在编程方面的话,一句话,在我的这一个测试项目里面, gbt 五点三 codex 表现最好,比 off 四点六会好一些。 glm 五跟 mini max 它们的体感接近,都是开源的嘛,并且它们的成本非常低,所以说 对于一个高性价比的一些开发任务的话,我觉得这两模型都非常不错。好,这就是这一期视频的所有内容了,如果你觉得这期视频做的不错,一定记得给我一键三连哦。那下一期视频的话大概率是做 deepsea 微四,有可能是在过年那一天发布,我猜测哈,据可靠消息。好,那视频就到这里了,大家拜拜拜拜拜拜拜拜。

今天是实习的第一百零三天,就是最近那个 gpt, 五点五刚出来没几天,然后我在公司已经杀疯了,就是公司买的是中转站的拓客,他价格大概是官网的五分之一, 然后我也就不心疼了,我就用了我总共笔记本加上一个外接显示屏,总共两台两个屏幕,然后我开了六个窗口,就是每个窗口他都会运行一个酷 max, 然后 这六个 max 他 每一个都在完成独自的人,独自个例的任务,就是,呃,一个是下模下数据集,然后一个处理数据集,然后一个是训练模型,然后一个是评估模型,然后下来还有的是写文档,然后包括做 ppt, 全部让他干。我一下午就是有种做完你的做你的做你的做你的那种感觉,就是 一直在敲需求,然后按回车,敲需求按回车,一天都在干这个,刚开始其实用的用的蛮爽的,因为效率真的高,我一个人基本上就是同时干四到五个人的活, 然后但是我越用越焦虑,就是也不是他不好用,是,是他太好用了,属于 ai 代替人类干活,他不是五年,十年后他,他就现在 我一个实习生,我,我能同时顶着四五个人干,那,那公司肯定就不需要那么多人了呀。然后再回看各行各业,我知道很多行业的人他都还没有,就是听说过,但是还没有开始使用这个工具, 我觉得大家也不能说一定要是转行做算法或怎么样,但起码开始用吧,我觉得接受 ai 给你带来的震撼。

这是一期地毯式 codex 教程,如果你还在焦虑谁谁谁又用 codex 做出了什么无敌的应用或者自动化给自己干活了,那你务必看完本期教程,带你最全面的了解 codex 是 什么,它能干什么,并跟我一起实操完成。从 codex 下载 安装到个人网站、文档制作视频动效,自制工具等等等等,全面了解 codex 这个目前为止最强大最全面的个人 a 政策。 codex 的 界面现在我们来到了 codex 的 主界面,这个对话框你肯定很熟悉,对吧?但是你可以看到左边的这个边栏,就可以看到很多不一样的地方。 首先是上半部分,点击这里你可以快速创建一个新的对话框,快速完成一段与 codex 的 对话。这个搜索你可以同时使用 command g 来调出,快速搜索,你与它进行或者对话等等。现在你可以看到技能和插件这两个板块,这里可以说是 codex 的 一大精髓所在。再过来说, codex 是 一个集合了 chatbot, d e 浏览器,自动化工具等等等等的一个大一统的工作台,所以你可以给他安装插件, skill 以及创建自动化任务。这里的插件市场可以让你来随时扩展更多的功能。比方说这里的 computer use 和 browse use 在 我们后半部分的教程中就会用到这两个功能。 再往下看,可以看到项目和对话两个分栏。在项目中你可以点击添加新项目来将你创建好的文件夹给添加进来。在你创建好的文件夹右侧点击开始对话,你就可以创建出一个新的对话框,那么之后你们对话所有产出或者修改的文件,就会在这个文件夹中进行。 正常情况下, ai 如果直接操作电脑,风险会非常高。所以 codex 使用的是沙盒的逻辑,它相当于给 ai 开了一个单独的隔离小型开发环境,它可以在里面读代码,改代码,运行命令,执行测试,但默认是不能随便控制系统的。 在对话这里,你可以选择默认权限、自动审查、完全访问权限三种权限类型,让 codex 来执行还是非常安全的。再往下看,还有一个对话栏, 常用来进行一些临时产生的问题,当我用完,我就会点击右侧的这个归档按钮,把它给归档,那你也可以在设置你归档对话里面去给他找回来。 回到对话框,你可以在对话框中输入任意的问题,或者要执行的操作,比如帮我整理桌面上的这个文件夹里的发票,并统计这些发票总金额是多少,然后统计在一张 excel 表格中,你看很快他就跑完了。 现在我们来使用 codex 制作一个个人网站,首先在桌面上新建一个我网站的文件夹,然后回到 codex, 进入文件夹,点击这个加号,打开计划模式,这样 codex 就 会根据你给的需求,先开始计划他接下来要做些什么,等他计划完成了,他会给你一份详细的执行方案, 然后点击执行,这样就可以去干别的事情。一杯茶的功夫,你就可以等待你的网站。你可以点击右上角调出一个终端, 把它给你的命令复制一下,回车运行,你就可以在 codex 里面预览这个网站的效果,我们点击展开面板。哎,对了,你看 codex 还自带一个浏览器,你可以在 codex 里面直接查看以及批注,这样你就不用回去再想想怎么描述我是要修改什么地方。 文档与 ppt, 那 除了做网页,我现在更高频的用途是用它来做文档。比如说平时很多人会写策划案,汇报 ppt 视频脚本,以前是用 gpt 生成文字,再到 word, 再复制到 ppt 里面,最终再自己排版。但是 codex 现在已经把这些东西都串起来了。比如说我现在告诉他 使用 html ppt 这个 skill 帮我制作一个宠物账号的商业方案,要求包含市场分析、账号定位、内容模型、变现方式,以及未来三个月的执行计划,并生成一个科技感高级风格的网页 ppt。 然后你看到他就会开始创建文件,生成文案,设计页面,制作动画,自动排版。最后给你一个直接可以演示的网址。尤其是你看像我一样要录制这种口播视频的,我这样的 ppt 就是 用 qq 词直接帮我生成的,他做出来东西天然就很适合录屏。 这个时候顺便介绍一下 qq 词另一个非常好用的功能,分叉非常适合这种,你做到一半突然想要尝试一个新的风格, 或者要尝试两种内容的时候,点一下分叉按钮,这个时候不用重开一个新绘画,重新解释项目背景,他会直接分叉当前的上下文。你可以在分叉县城里面大胆做实验,如果效果不好,直接回到原来的主线就可以了。如果效果更好,就可以沿着这个分叉继续来进行开发视频动效。 说到做视频, codex 最近还上线了一个非常强的插件,由黑正推出的 hyperframes, 你 只需要输入一句话的描述,就可以自动生成带动效排版转场。三 d 视觉的高级动效视频,可以说是完全填补了原来视频模型不适合生成精确的带文字、带数据的动效视频的孔雀。 比如说,你可以直接说帮我根据这个养猪场的年报生成一段科技企业的汇报视频,他就会直接调用前端库来生成一段带数据、带图标的动效视频。 skill 与自动化任务普通的 ai 只能回答问题,但是通过 skill, 你 可以把你工作多年的经验或者流程打包交给 codex 自动去跑。比如说你完全可以使用 at skill creator 来描述你的需求,每天自动抓取某个平台的热门视频, 分析标题,提取高赞评论并整理成 excel, 最后生成第二天的选择题。我自己做了一个急梦,排队的 skill, 如果你有批量使用 cds 的 需求,使用我这个 skill, 它就会在晚上帮你批量提交视频生成的任务,自动检查生成出来的视频并保存到本地。 类似这样的 skill 还有非常多,这个部分就留给你们自己去探索。 computer news 这个是我觉得最近 q 版有这个功能,目前只有 mac 版有这个功能, 它运行起来的时候,它就会像一个真人一样看屏幕,移动鼠标,点击按钮,输入文字,打开软件,切换窗口,使用第三方 app。 以前很多的自动化必须要通过写脚本,调接口,配 sdk, 研究文档。但是现在即使某个软件没有开放 a p i, 很多事情扣代码,直接看着屏幕自己就去操作了,你懂这种方式有多震撼吗?最后的总结 可以看到, codex 提供的内容已经非常非常多了,我这里要下一个爆论就是这一类 agent, 他 绝对不会仅限于编程开发等等, 你已经不能简单的给他定义成工具了,但是你也别太焦虑,拥抱 ai, 先从每天自己最烦最重复最浪费时间的小事开始。 比如说整理文档,改革式做表格,生成封面,做网页,写脚本,做汇报,批量修改内容。当这些事情真正开始被 ai 接管的时候,你自己的潜力或许才刚刚被开发出来。

十个理想车主,九个不知道你的理想大灯啊,居然还会眨眼睛!每次上车前,大灯自己来个自检,扫一圈儿,仪式感直接拉满, 比百万豪车还带劲!不用改装,不用刷机,只用一个任务大师代码,就能免费解锁豪车同款大灯自检!想学会的兄弟,抓紧把关注点好,不然划走就再也找不到了!打开车机,任务大师选择循环任务,输入这组数字,增加大灯自检自动化任务 保存设置就全部搞定!设置完有多牛?每次解锁车辆,打开车门的那一瞬间,大灯就会自动做一个帅气的检查动作, 缓缓扫描,灵动律动,就像大灯啊在给你打招呼一样,仪式感直接拉满,这种被重视的感觉,谁用谁知道,你学会了吗?

刚用 codex 做了一个桌宠,大家认得出来是谁吗?然后还当然还做了另外几个, 他会在桌面给你汇报任务进度。怎么生成呢?很简单,我们只要输入这个 hatchpad 指定,然后呢他就开始给你做图片,然后你按 改到你最满意为止,然后他最后给你生成各种动作的逐帧动画。

好的朋友们大家好,今天我想给大家推荐一个我认为阶阶段 ai 做 ppt 最强的一个实践方式,就是用 codex 再加它里面内置的 image generation 的 这个 skill, 也就是去调用它背后的 image 二模型,再加上 codex 里面的一个 presentation 的 插件, 这三者的一个组合,我认为是当下 ai 做 ppt 的 最强的一个组合和实践。为什么我会这么说呢?我给大家拆解一下。首先第一点, codex 它是作为一个总导演, 一个项目经理的一个角色,他负责去理解你要做什么样的 ppt, 然后他去拆解任务,去决定什么时候用 emoji 二,什么时候用 presentation, 他 也负责整个的文件的管理,素材的管理。第二个 emoji 二呢,我们都知道它是现在最好的闭源的一个深图大模型, 而且它对中文的一个支持非常的厉害,所以它承担的自然是最核心的一个视觉素材的一个生产,包括图片背景以及里面的一个素材。但是它产出的只是一个图片的一个素材, 并不是一个完整的一个演示文稿。很多人可能单独用页面 g r, 它也能生成连续的很多页的一个图片的一个 ppt, 但是这并不是我们真正想要的,所以我们就会引出最后一个 presentation 插件,它负责作版式,放置文字、图片、图表渲染、预览,检查页面的效果, 然后最终导出一个可编辑的 ppt x 的 一个 ppt 文件,所以它们三者连在一起,一个完整的一个制作 ppt 的 一个系统。好的,接下来我就简单的演示一下,其实非常简单,我就以我正在做的这个视频为例,我们想要介绍 ppt 的 这一套系统,让它去做一个 ppt。 我首先跟他说,请按照这个内容做一个八页左右的 ppt, 你 可以先去生成每一页的一个大纲和内容,然后给我预览,预览完成之后,等我提示下一步,你再进行下一步的执行。 好的,这一步,为什么我们不直接让他去做一个完整的 ppt? 虽然他也可以直接去做,但是我想展示的是,其实中间的这些环节,我们也可以通过人为的去把控和一些调整,来达到我们最终想要的一个效果。因为如果你直接让他去跑,能得到的效果不一定是你想要的。好的,现在让我们来看一下,他已经设计好了整个 ppt 的 一个框架, 大纲和里面的内容,包括主线第一页封面标题、副标题页面的一个内容, 还有视觉建议,这里我们大致看了一下,我觉得是没有问题的。好,接下来我们第二步,我们确认好这个内容和大纲之后,如果你觉得这里有问题,你可以跟他说,让他帮你改, 改到满意之后,我们这里就可以跟他说。好的,现在可以调用 image generation 这个 skill 去生产十句的图片的视觉效果,你可以给我三套的视觉风格,每一张图片就浓缩了这八张图片, 然后一张图片里面代表一个视觉风格。好的,接下来这一步,我不是让他给我一张图,一张 ppt 这样输出,因为这样很浪费时间,也很慢,而且可能只是一个单一的视觉风格,万一得到这个风格不是我们想要的,就比较浪费时间,所以我这里采用的一个步骤就是让他把八页 ppt 全部浓缩在一张图里面, 一米九二模型完全有能力做到这一点的,就是一张图里面包含这么多的信息量,然后我可以一次性让他给我三张,且三张的视觉风格不一样,这样我就可以去挑选出一个我认为适合的视觉风格。好的,这边我们看到他已经生成好了,一共给了我们三种不同风格的一个 ppt 缩略图。 第一个是一个比较常规的简约干净的一个 ppt, 第三个是一个非常好看手写风格的一个视觉效果,这三个其实都不错,这个时候就看你喜欢哪一种。这里我就选择第一种常规的简单干净的这种扁平风格。 这里我们检查好里面的一个大概内容,以及确定好我们的视觉风格之后,接下来有两种路径可以选择。第一种比较简单的,如果你不需要编辑这里面的元素文字,你觉得它生成的这个已经够好,你已经可以用了。那么很简单,你直接让 emoji 把这里面的这八张图直接按照图片的格式去生成出来, 最多你可以让他帮你转成一个 pdf, 这样就很快,相当于直接是八个图片去展示好。这是第一种,这种比较简单也很快,但是这不是我今天想真正介绍的,因为这样就没有用上我们刚刚说的 presentation 的 那个插件。我们如果想要得到真正的可编辑的,可拖动每一个元素的这个 pptx 的 文档, 接下来我们就需要调用 imageg 的 所有的元素素材、图片,然后把它们以 png 的 格式生成, 然后再由 presentation 插件去排版排布,然后导出成一个 ppt x 文档。好,接下来让我们就告诉他,请按第一种风格去生成 ppt, 我 需要你把里面的每一个视觉元素、图片、文字都按照 png 的 格式去生成,然后调用 presentation 插件去 制作成一个真正的 ppt x 文档。好的,就这么简单的一句话,这一步可能需要花费的时间会久一点,因为 emoji 它要去生成里面的各种各样不同的元素。好的,这里跑了十分钟,它也是跑完了。我们这边来看一下,可以看到它现在已经生成了一个完整的八页的 ppt 的 内容。我们先简单看一下,内容 基本上都是正确的,它按照这种模式输出出来的。这是一个 ppt x 的 文档,它的每一个元素都是可以去进行编辑的。好的,那么这个就是一个完整的一套用 ai 去生成一个可编辑元素的这么一个 ppt 文件的最佳实践。如果大家有认为更好的一些方法,也可以在评论区分享。

如果你正在使用 cloud code, 却还没装这些 skill, 那 你可能只用了它百分之三十的能力。今天分享七个最值得安装的 skill, 尤其是最后一个,能让 cloud code 从能用的 ai 直接变成懂行的队友。第一个,社区最火的全能 skill superpowers, 它不是单个技能,而是一整套开发全流程 buff, 包含项目规划、代码编辑、 code review 等十几个子技能,能帮你梳理需求、拆分任务、系统化调试,程序员必装,省超多梳理时间。 第二个,文档处理神器, pdf, 它能直接读取、合并、拆分。 pdf 还支持 ocr 扫描件识别,写代码间隙处理文档,不用切换软件, 不管看技术文档还是办公文件都好用。第三个,去 ai 位神器 whoman the zh, 它能把此外综上所述,这类生硬表达换成接地气的人话,写项目文档、副业文案都能少一点模板位, 不容易被看出是 ai 生成。第四个,大项目救星, planning with files, 大 型项目经常中途打断,回来 ai 就 往上下闻。这个 skill 会持久化项目规划,画绘画不丢进度, 特别适合碎片化时间开发。第五个,前端颜值救星, fronten design, 它让 cloud code 写的前端不再是 ai 烂活,而是带着专业设计规范,后端程序员也能做出好看规范。 第六个,代码质量守护神 code review, 它会派多个子 a 证,并行审查代码、找 bug、 查安全漏洞、优化代码规范,每个问题都带知性度评分, 赶项目时不用逐行排查,能大幅减少代码出错率。第七个,压轴神器,也是最能提升体验的 skill creator, 前面六个不够用,它能让你自己定制 skill, 把自己的开发习惯、 重复性工作封装成专属功能,彻底让 ai 适配你的需求。这就是让 cloud code 变成懂行队友的关键。 这七个 skill 覆盖开发全流程文档处理前端优化代码质量,还有能自定义的压咒技能,装完之后你会发现 cloud code 的 能力直接翻倍!收藏起来直接去 skill 商店搜英文名就能安装。关注我,带你了解更多 skill 使用技巧!

微软是真不让人活了,刚扔出来一个七币小模型,居然能控制电脑替你干活, get up, 上三天干到五千 star, 每天分享一个网站,今天分享的是, 别看体积小,本事是真大,直接接管你的鼠标键盘,自动执行日常网络任务,比如收集资料,整理成文档,批量填写表格、全网购物笔架等等。 说白了就是给你白送一个不烧 token 的 ai 牛马,让他自己点,自己查自己填,你只管验收。最离谱的是他只有七币,部署起来轻的离谱 地不用复杂安装,不需要 a p i, 本地直接跑。主打的就是开箱即用。以前总觉得能干活的 ai 都得堆显卡烧钱配环境,这次微软直接把这些门槛全踩平了。那么问题来了,假如这玩意儿到你手里,你最想拿它干啥?评论区扔出来,看看谁的脑洞最骚!

codex 刚上线了一款神级插件 codex chrome, 让 ai 像人一样操作浏览器,先看效果。我给他安排的任务是帮我在某音和小某书上搜索关于 openclaw 的 作品,各平台各找五个点赞高的,每个作品收集五条热门评论,然后通过这些评论整理出大家对这个话题关心什么。他会先分析任务, 然后呢,开始调用 chrome, 这时候 chrome 就 会出现一个独立的标签页组,然后他就在这个标签页组里自己运行,我可以自己继续干别的事情,相互不打扰。他先打开某音,搜索关键词,然后找到相关视频, 并且按点赞进行排序,点进去之后看内容和评论,然后一个接一个。 之后呢,他再切换到小某书,用同样的方式找到相关的笔记和评论。最后他把不同平台的信息整合到一起, 然后给我整理出一份结果,这样就为我省去了大量的搜索提取。然后整理的这个时间用了几天。我认为 codex chrome 最适合的事情是,你本来可以人工完成,但是非常重复,非常耗时间的网页查询、整理对比和初步分析。 或者如果你们公司有一些内部系统,比如 o a 啊 e r p 财务软件,你平时要经常去填一些表单,日报报销什么的,你就可以让他去帮你去批量的填写。我看网上有人说安装不成功,这里有两点需要注意, 第一,你的 codex 和 chrome 的 版本要更新到最新。第二, chrome 的 商店里需要有 codex, 有 些区域不支持,比如欧洲,你换一个支持的区域就可以了。关注我,我是持续分享 ai 提效工具和方法的小伟。