大家好,今天 openclaw 最新版本正式发布,五大重磅更新带你体验全新升级!本次更新有五大亮点,包括图片生成、 deepseek v 四系列支持以及实时语音能力提升等方面。 亮点一,图片生成能力大升级 gpt image 二,通过 codex oof 直接调用,无需额外配置 key。 亮点二, deepseek v 四系列上线 v 四 flash 加 v 四 pro 双版本可选, v 四 flash 成为新用户入门默认模型,思维链逻辑优化工具,调用更丝滑。亮点三,实时语音能力全面提升, talk 语音通话、 google meet 均可使用,实时语音循环。亮点四,浏览器自动化更强大了,支持坐标精准点击默认操作超时延长至六十秒。无头模式可单独配置标签页附用,不怕崩。亮点五, google meet 正式接入 个人 google 账号,一键登录自动入会,可以实现会议记录、出勤报告实时导出、会议中随时语音提问、 ai 实时回答等功能,立即升级体验新功能运行命令 openclaw update, 遇到问题联系田老师。
粉丝279获赞1446

给大家对比看一下 open color 以及呃爱马仕还有 context 三个平台的生图的能力的区别。我先把它们大模型全部切换成了 gbt 杠,五点五现都是五点五的大模型。然后来看一下, 这个是我的海报原图,这是我们自己独创了一个体系的原图,这是原图,大家先记一下。然后我们先看到 context, 我 把同样的图片以及指令分别给到了三个平台, 这是我的龙虾,然后这个西姆森,这个是我的呃爱马仕,然后我们先看 爱马仕吧,刚好到这,我把图片发给他之后,我说你帮我把图片优化一下,关于什么什么行业变现体系的,你自己匹配风格。三个平台提示词跟图片都一模一样,没有任何的区别,然后他自己去工作,然后 没有收到响应,然后重试,然后后来又出来了,出来这样这样一张图片,我感觉说实话一一般,很一般,太素了。然后到对到这个 callix 吧, callix, 同样的提示词,同样的图片给到他之后,他给我生成了一张, 大概用了两分钟时间,然后出来一张图片,我说实话,我觉得还行,还行,比我原版的这个图片好看。这原版, 然后这是生成出来的图片,我觉得还可以。他这张图生成出来之后,我的爱马仕跟龙虾还没有出第一张图,然后我说你推翻现在的排版设计,完全重新设计高级一点, 然后他自己给了我两版的图片,大家再看一下我的这个图片,还可以吧,一版比一版好看,我觉得还行,他自己主动的给我做了两版,然后去增加了小图标,然后重新去简单排版了一下,我觉得这个还可以。然后他在爱马仕的已经看过了,对吧?这是原版的图, 爱马仕的爱马仕的在这里这样一对比看,是不是有点太素了?然后再看一下龙虾的,他娘的,我给他同样的指令, 我先不硬拆图理细节,再按什么六六六,给你重新做一版,更像刚才工具抽风了。六六六给你重新做一版,不走那条失败好了吗?无法生存就重试挂了,我的龙虾挂了。 这三个平台的生徒都是用同样的一个大模型。嗯?有谁知道为啥呀?啥原因呀?

如果你有一个 chat gpt pro 账号,我有个好消息要告诉你,你可以在 open cola 中使用 chat gpt pro 账号。 方法是添加 codex 模型,而且非常简单,我们只需要运行两个命令就可以完成了。正如你所看到的,我只是添加了我的 chat gpt pro 账号,就成功把 open a i codex 模型加进来了。接下来我会一步步教你怎么做。现在这个流程非常简单,我们只需要两个命令,只需在你运行 open cola 的 终端里输入第一个命令。 我也会把这个命令放到屏幕说明区,顺便按下回车键。现在它会引导你完成导入流程,但我们不需要修改任何数值, 我们只是要追加我们想要的新配置,所以按左键,然后选择 yes i understand, 然后选择快速启动 quick start。 然后在这里我们直接使用现有的默认值。非常重要,我们不想更改任何东西。我们只是想在 open class 上追加一个新模型,所以我选择保留现有值。然后这里非常重要, 你会看到它给了你一个 u r l, 它提示你在本地浏览器打开这个 u r o l, 所以 我要复制这个 u r l, 然后粘贴进去并按回车。接下来会要求你登录你的 openai 账号,所以我现在进行登录。登录后,你需要确认你想用 g p t 登录 codex, 所以我点击继续,然后会打开一个非常奇怪的页面,但不用担心,一切都是正常。你唯一需要做的就是复制地址栏里的 url, 然后回到运行 openclot 终端,按照提示操作粘贴重定向 url, 我 就粘贴进去并按回车, 这样基本上就选定了配置。现在这里我不改任何东西,因为我不想新增 bot。 我 选择不,因为我只想处理 chat gpt 配置。 按回车键,然后我将重新启动网关。重启网关非常重要,因为这样网关才能识别你新增的模型。但这里我选择稍后再做, 因为我们还需要运行扫描命令。接下来我们要运行的扫描命令是这个,我也会把命令放到说明区,然后按回车。这个命令会覆盖配置, 并添加 openai codex 作为默认模型。所以现在技术上, openai codex chat gpt pro 账号已经在使用中。为了测试它是否工作,我在终端里输入 opencloud ui, 打开界面, 然后你会看到下面显示 agent main open ai codex。 我 也可以问他,嘿,你当前使用的默认模型是什么? 然后你会看到他回答,是的,我当前使用的默认模型是 open ai codex gpt five point three codex。 就 这样, open ai 已经添加, 你基本上可以免费使用,因为你有 gpt pro 账号。如果你有任何问题或遇到困难,在评论区留言,我非常乐意帮助你。如果您觉得视频有帮助,请点赞并订阅。已查看更多类似内容,感谢观看,下个视频见再。

这期讲一个很实用的炼录, openclaw 和 hermes 怎么通过 openclay 附用 gpt 网页版 check gpt 的 图片生成能力,重点不是直接调图片 api, 而是先把 chrome browser bridge 打通。 很多人会遇到这个问题,自己在叉 g p t 点 com 上能生成图片,但 hermes、 open core 或者普通终端里的模型调用却不能直接附用这份能力。原因很简单, api 能力不等于网页登录态能力。 第一步,下载 open c l i 浏览器插件,去 jacqueline opencly 的 github releases 页面下载最新版本的 opencly extension 压缩包。 第二步,在 chrome 里加载扩展,因为这条链路不是纯 h t t p 接口调用,而是要靠浏览器插件和 browser bridge 去控制已登录的 check gpt 页面。 第三步,安装本地 c l i, 并验证连接只有 openclean c l i、 chrome 插件、 browser bridge 以及已登录的 gpt plus 绘画都正常,后面才能稳定生图。 先打开 open c l i 的 github releases 页面,也就是 jacqueline slash opencly releases, 找到最新版本下载通常叫 opencly extension v 版本号点 zip 的 浏览器扩展文件,这个插件是后面控制 chrome 的 关键。 下载完成后,把这个 zip 文件解压到本地文件夹。注意, chrome 加载时不是选择 zip, 而是选择解压后的 extension 文件夹,这个地方选错,后面 bridge 就 接不上。接下来打开 chrome, 在 地址栏输入 chrome 冒号双斜杠 extensions 斜杠,然后回车。 这里要用已经登录 check gptplus 的 chrome 或 chromeium, 因为真正拥有声图权限的是网页里的账号登录台。 在扩展管理页面右上角把开发者模式打开,这个开关不开就看不到加载已解压迫展程序的按钮,也就没办法把 opencube 的 浏览器桥接插件装进去, 然后点击左上角的加载已解压的扩展程序,弹出目录,选择后选中第一步解压出来的 extension 文件夹到这里,浏览器测的 browser bridge 才算有了入口。 插件装好以后,还需要安装本地 open c l i 环境。打开终端,运行 m p m install minus g at jacqueline slash opencly opencly 在 这里不是正式图片 a p i s d k, 而是把你手工操作叉 g p t 网页变成终端命令自动完成, 最后运行 opencooker。 如果输出里出现 browser bridge connected, 说明 chrome 插件和本地 open c l i 已经正确连接,后续就可以由 opencooker 控制浏览器打开已登录的 chat gpt 页面,输入 prompt, 点击发送,等待图片生成,再把 png 保存到本地。 这里最容易卡住的点有三个,第一,不要把 gptplus 网页生图当成正式图片 a p i。 第二,只装 openclip 和插件还不够,浏览器里必须已经登录具备权限的 check gptplus 账号。 第三,所有操作前先跑 doctor 确认 browser bridge 真的 连上了。 总结一下这条方案的价值是,用户已经有 gpt 网页能升图,但 hermes 和 open cool 不 能直接调用这份网页登录态能力, 所以我们用 open 可以 接管浏览器附用已登录的 chat gpt 绘画模拟输入提示词,点击发送等待图片生成,保存本地 png, 最后再按需要发回 file 或其他平台。

我让 gbt 五点四自动剪辑了,先看成片。 哈哈哈,不愧是 opencore 创始人,加入了 openai, 现在在 codex 里面直接对着窗口下指令,它就能像小龙虾一样操控你的电脑。因为它原声内置了小龙虾的能力。我实测了一波,功能,体验上 跟 opencore 基本上一致,但是能力和稳定性却要比龙虾强不少。因为它原声内置了最新的 gbt 五点四模型。 刚才你们看到的成片是我让他读取我电脑上本地 vlog 的 素材,他自动判别了素材的高光时刻,然后自己编写了一个剪辑脚本,并且在后台直接帮你剪好了。所以以后可能剪辑软件都不需要打开了,真的就是动动嘴皮子就把片子给剪了。但且不说成片质量如何, 起码他现在能理解咱们素材的内容了。相信大冒险能力,再迭代几次,剪辑的效果肯定能和人工不相上下。主要是 ai 剪辑是真的快啊,而且不知疲倦的帮你修改,你们可以自己去试一试。

g p t 五点四更新了没几天啊,我终于跑通了,可以用 ai 来做全自动的设计工作流,说白了就可以做到全程用嘴啊,你给我建个专家里面,给我放个点 p e n 设计文件,让我们来开始做什么设计。 当然它对我来说最重要的是可以实现半自动,每一个过程在中间我可以手动的去改,比如说我删掉两个字啊,或者我把这行字挪到这里来啊,哎,或者,哎,这个图片我觉得它裁的不合适,我再把它多裁一点。 那么我们平时在用的 g b t g m 机梦这些东西呢?它是全自动,能做一个设计,它有几个问题啊,一个是它不能去修改,不行你就重新来。但是我这种半自动的,说白了就像一个人坐在旁边帮你用设计软件做东西,你想什么时候停下来,你就停下来,你想什么时候回到上一步就回到上一步, 你想把它推开,你自己上,哎,你也可以自己去挪动一个小图片,去加两行字都没有问题,就它整个工作流主要是用 gpt。 五点四啊,在 codex 里面实现的, 那么调用这个 pencil mcp, 哎,我们就把 pencil 的 设计软件在旁边打开,你这边,呃,数字也行啊,用嘴也行啊,那边的设计软件就开始自动的动,当然这个东西它早就有了,但现在为什么开始好用呢? 一个原因是 gpt 升级了,但更重要的原因是我做了两个 skill。 那 这两个 skill 目前没有开源啊,你在 get 上根本就搜不到啊,因为是我自己做的,那还在实验,也许未来会开源,那我第一个 skill 叫做 graphic abstract skill, 那 这个东西是干嘛的呢?它是把我一篇古早的一篇论文啊,怎么来做版式啊,怎么来做对齐,怎么来做 icon。 然后呢,我把那篇论文 固化到这个 skill 里面,哎,他就来指导我的 ai。 我 们会发现,我们用很多 ai 全自动做东西的时候,他对,尤其是对于这种文字的排版呀,对齐呀,然后呢,图标的大小呀,包括这种标题的层级啊,他用的很难看,我们现在用很多 ai 工具,做海报也好,做些设计也好,你就最多放几个大标题,因为他不会排版, 那么我的那条论文是刚好是解决这些文字排版,对齐等等的问题,所以我才固化了这么一个 skill。 那 我的文字的排版,还有各个设计区域的对齐啊,啊,空间的间距啊,这东西全部都解决掉了。 那么我还做了一个 skill 呢,叫做 visual extraction skill, 那 它是干嘛的呢?它就是设计师的眼睛。但是我的这个 skill 呢,哎,就可以把整个图片网格化,然后通过 ai 识别, 我就指哪切哪,哎,比如说有个戒指在图片呢,比如上方靠左的位置,哎,我就能刚好把它切下来。 我有一堆图片啊,这些图片里面全都有一个戒指,但位置都不一样。但是我现在只想,哎,给我切出来一个圆形的蒙版,里面是个戒指,我可以批量的切一千张图,你想以前这个手工是很困难的, 现在呢,用了我这个 skill 呢,哎,它就等于长眼睛了,哎,它通过这种网格化的智能识别,它就可以指哪切哪,当然,凡是具体坐标的识别,它都能干,它能准确地指到你想指的东西, 当然就靠嘴,就比如说我用嘴说,哎,你给我来个箭头来指下这个眼镜啊,上面写一个圆形眼镜,它这种非常准确的全自动的,哎,一个箭头指到这个眼镜,那么有了我这两个 skill, 再加上 g b t 五点四,哎,又上 codex, 再加上这个 pencil m c p, 哇, 这个全自动的设计工作流就来了,但目前呢,还是需要我的沉淀,就等于说我还得不停的做设计,让它自我学习,因为我是让我的每个 skill 都加入了自我学习跟迭代这个功能。一个是我每个星期每个月可以手动复盘,那更重要的是,我已经把它固化到这个 skill 里面去了, 在很多时候,它会自动激活,它会提醒我,哎,今天你要不要复盘一下,我们要不要升级一下我们的 skill, 它就会自动来打怪升级。 其实我是用一个核心 skill, 下面有一堆 skill, 包括这个设计 skill 呀,剪辑 skill 呀,呃,它是 designer m c p 呀,就各种玩意儿都是用一个总控的 skill 来控制它们。 所以这种 skills 呢,它们就有点像就现在我们大家比较火的这个 open globe, 就 像小龙虾一样,但这些小龙虾它们不可控,哎,所以我就不用。就目前而言啊,就你想稳稳的去跑一个设计工作,我觉得 skill 这种 固化的比较安全的东西还是比较靠谱。如果你想用到我的这个 ai 工作流呢,估计可能你得等一等啊,因为我还得让它自我学习一下啊,也许哪一天就在 get 开源了。如果你感兴趣啊,可以在评论区蹲一蹲。

干货来了,兄弟们,今天给大家分享一下 gpt image 二生图模型提示词怎么写效果最好。下面整理了三个核心要点,今天一次说清楚。第一套公式,主体加场景加风格加画面比例。 比如一只穿西装的柴犬站在月球上,电影质感十六比九,别只说画只狗,要给足信息。第二,说清楚,不要什么,加一句,不要模糊,不要水印,不要多余文字, ai 最怕含糊,禁止向写进去,翻车率降低一半。 第三,把形容词换成画面,不要说好看,要说柔光高细节紧身,不要说未来感,要说霓虹灯金属材质赛博朋克。 ai 认识图像词,不认识感觉词。最后记住结构锁底,排除干扰词,换画面,拿一条提示词去试试,效果马上不一样。好了,兄弟们还想知道更多技巧,关注我,下期再见!

大的来了,兄弟们,最近 emoji 二点零生图模型真是杀疯了,好多人用 emoji 二点零随便敲几个字就能直接甩出光影构图细节全在线的电影级高清大作,连零基础小白都能原地告别手残期。 但真正上手后才发现,随手打字深沉的图,不是脸奔成抽象化,就是细节糊成一锅粥。这真不是模型不够强,而是你的提示词塞得太乱或者不够精准, 所以神图和废片之间往往就隔着一套标准的提示词。那这种时候,咱只需要一个提示词插件就能彻底搞定,那么本期内容就手把手带大家玩转 promptify 提示词生成插件。首先我们打开浏览器,搜索对应的网址,下载离线安装包,把它解压到外面的普通文件夹里, 然后回到浏览器,点开扩展程序,进入管理扩展程序,打开开发者模式,选择加载已解压的扩展程序,找到刚刚解压出来的文件夹,点确定,然后给它打开就能直接用了。 之后再来看看效果。我们在网页端挑一张想要的参考图,右键点击唤起插件,立刻就能看到两种提示词模式,普通版和 json 版。这里我强推 json 版,因为它能把光影、视角、镜头、风格给你全部分理解析出来,细节还原度能干到百分之九十九 点一下生成。等它跑完,把得到的提示词完整复制出来之后,我们点击图片生成,选择模型, g p t mate two 点零,最后点击生成,即可获得一张超逼真的质感大片。好了,兄弟们赶紧上手去试试吧,还有什么问题直接甩评论区,咱们下期见!

说真的,每次看到别人用 image 二点零秀图,我心态就崩一次,明明自己怎么弄都是乱码,失败到麻了,快把耐心耗光。你是不是也跟我一样? 别担心,本期视频就手把手教你获取 image 二的最强提示词。解决这些问题,我们需要先下载一个插件,打开浏览器搜索这个网页,进去后找到 promptify, 找到后点击下载离线安装包。 下载完成后,我们打开文件所在的地方,把这个文件解压一下,记得解压到我们能找到的地方。接着打开浏览器,点击右边的管理扩展, 每个浏览器的具体位置不一样,我这里使用的是 chrome 浏览器。进去后先点击右上角开启开发者模式,开启后点击左上角的加载已解压的扩展程序,选择我们刚刚解压的插件文件夹,直接点击确定即可。最后再教大家如何使用 image 二, 我们打开这个扩展后,随便右键点击一个图片,选择使用 promptify 生成提示词,随便选择一个生成,生成后点击使用提示词生成图片, 就会弹出生成图片的选项,我们选择 image 二点零即可,这样就能使用 image 二进行生成了。以上就是本期视频的全部内容了,大家学会使用 image 二了吗?

玩龙虾终于不用再花钱了,你看,我配了两个模型,一个是 gpt 的 五点三,一个是 gpt 三。我的主模型用的是 gpt 五点三啊,因为这个的配额呢,是走的这个方式啊, 免费的时长配额,然后从这选 gpt。 然后第二个模型的话呢,是 gpt 三啊,这个模型 主打的是响应快,低延时,然后调用的方式是 a p i d k, 这样的话呢,就比较方便。一个主要免费用来日常沟通啊。然后另外一个的话,因为 gmail 的 话,他写文案各方面的话我比较喜欢,所以特殊情况之下我用 gmail。 总之订阅了 gpt 的 话呢,就直接不用再花钱了。太好了,想要了解的朋友呢跟我说,我教你。

就在前几天, openai 正式发布了 gpd 五点四,我们熟悉的 ai top one 又回来了。 openai 这次把过去几个版本里分散的推力编程和原声电脑控制能力整合到了同一个模型,是全球首个具有原声电脑操控能力的 ai 模型。 gpd 五点四最核心的突破是 native computer use 原生计算机控制能力。那什么是原生计算机控制能力呢?最近火爆全网的 opencloud 你 一定听说过,全网用 ai 的 人几乎都在养龙虾。 opencloud 的 核心能力就是让 ai 能接管你的电脑,浏览器,自己打开,自己点击,自己查资料,自己发邮件, ai 二十四小时替你干活。而这次 jbd 五点四做的正是同一件事情, openai 直接把这个能力内置进了 jbd 五点四,不需要额外的插件,不需要折腾配置,直接打开就能用。 简单来说就是 g b d 五点四终于长出了双手,能接管虚拟鼠标和键盘,去操作你电脑里的各种软件,帮你查收邮件,安排日历、写代码、做任务。在衡量电脑操作能力的 os word 测试里,人类的平均成功率是百分之七十二点四,而 g b d 五点四跑出了百分之七十五,这是 ai 历史上第一次在这个领域赢了人类。 除了原声操控呢,这次还有三个炸裂的点。第一个是上下文窗口扩展到了一百万 token, 是 上一代 codax 模型的二点五倍。这意味着你可以一次性把十家竞品公司过去三年的财报、几百页的行业深度报告全部扔给他,他能瞬间完成跨文档的交叉对比。 第二,引入了全新的动态推理机制。这次对应推出了 thinking 和 pro 两个版本。面对复杂任务的时候呢,它不再是直接给你一个盲盒结果,而是会先列出一份想尽的执行计划。在它生成的过程中呢,你可以随时打断要求它中途修正方向。第三个,也是用户最关心的 大幅压降幻觉。跟五点二版本比呢, gdp 五点四整体的出错率降低了百分之三十三。在 gdp 测试的时候呢,它的得分从百分之七十点九飙升到了百分之八十三。 尤其在投行建模复杂的电子表格分析这类对精度要求极其高的任务上,他的表现已经达到了专业分析师的水准。另外,对于开发者来说,他还加入了一个叫 to research 的 新机制, 在不降至的前提下,减少百分之四十七的图腾消耗,兼顾了性能和成本。看完最新版本的 gpd 五点四,我最大的感受就是,这次不仅仅是一次模型的迭代,而是整个 ai 行业正在从对话工具向自主智能体 agent 的 转型,而 gpd 五点四是一个转型里目前走得最远的一步。

the gbt 五点四正在接管我的电脑啊,发邮件看一下这个操作路径啊,完全的接管电脑,他的技术路径是像人一样识别这个屏幕,然后做出像人一样的操作。这是五点四,这是他的后台啊,一句话就可以搞定他在关键性的操作,他会做一个截图,然后去识别再去操作。

太可怕了,太可怕了,我根本睡不着,给你看个东西,给你们演示东西,各位全程自主操作,我没有去动任何东西,完全没有加速。 你看电脑完全自主操作,自主拖拽东西,自主动鼠标,自主打字。你看以后只要一句话,你就可以让他主动控制你的电脑,而不是像之前一样 打代码,然后帮你做个什么东西,它是完全可以看见你的屏幕,然后给你打字,跟你操作没有任何区别,真正的自动化来了。

充分利用 openglue 的 几个特点呢,可以让你在几天之内快速对一个行业做调研。年初横空出世的 openglue 呢,绝对是做行业调研的这个大杀器啊,而且呢,能够做到像以前 gbd 这种聊天的 ai 完全做不到的程度。 不管你是做行业研究,选创业赛道,做 ip 方向定位,还是做营销策划,选择职业方向等等吧,几乎所有跟商业活动相关的事情呢,都用得上。先问大家一个问题啊,想进入一个行业,一个新行业,最痛苦的事情是什么? 不是找不到资料啊,恰恰相反,今天这个时代呢,资料太多了。麦肯锡的报告,三十六课的分析、行业老兵的博客,竞品的产品页。现在呢,你找到这些报告了?下载到电脑上,正经微作。你读了二十份报告, 结果呢,你发现每一份给你的图都不太一样,哪些数据是真的,哪些趋势呢?是噪音?谁才是这个赛道上真正的玩家?你靠人脑呢,去慢慢比对消化。三个月后呢,你可能才拼出一张粗略的行业的认知地图。我们以前做 pe 投资啊,费了很大的功夫呢,在行业研究上面 去消化这些东西,形成一套全举的认知呢,可以说是耗时耗力的。但在今天这个杰作之下,三个月呢,其实是个奢侈品,利用 openglue 这样的工具,完全可以把整个时间呢压缩到几。 比如说目前我自己呢,已经用它来监控 ai 领域的 hackleux、 osopik、 open ai、 curza 等官网的文章或者是帖子,一有更新马上处理。它起的呢,比我还早啊,几个定时任务,每天早上准时推到我的手机上。另外呢,我也监控了 ai 技术产品创投方向的十多个播客,一旦有更新,就会触发后续的一系列的任务,比如说转路,早上一睁眼呢,就是顶 移播课最热乎的精选的信息。我也翻了一下,海外的社区啊,目前前沿的玩家大都把它做成了行业调研的机器,而且用到的恰恰是 openclip 跟叉 g p t 啊 cloud 最不一样的那几个功能,不是聊得好,是能动手,能定时,能记住。具体怎么做到呢?下面来给大家详细讲一下。第一个 ufireclip 呢,批量抓取网页,让它自己去读 一个行业,大多数人做行业调研还是一篇一篇手动去读的。那你读到第三份报告的时候呢?第一份的关键数据大概率已经模糊了,而第三份和第一份报告在同一个问题上说的话,可能完全是矛盾的。比如说,一个说市场规模是五百亿,一个呢说是一千二百亿。 做过行业研究的都知道啊,倒不是说他在乱说,一般呢都是统计口径,他们不一样,这些细节你不对着去看,根本发现不了。 openclaw 跟普通聊天 ai 的 最大区别之一,就是它能真正访问网页和你本地的那些文件。具体来说, openclaw 呢,它内置了 firecrow, 作为 webfurniture 这样一个搜索工具的 phoneback, 也就 备份它不仅能把任何网页呢抓下来,而且非常关键的是呢,它可以去掉里面的广告啊,脚本、导航栏这一些噪音,只留下干净的正纹,然后转化为 markdown 格式。这有啥好处呢?明显啊,第一个就是省掉了大量的这种无关的上下纹,省了 token, 那 就省了钱。另外呢,把网页 html 这种转化成了 markdown, 它更适合 ai 去读。 我以前的视频呢,讲过哪些语法格式是 ai 更喜欢的。而且呢,它不仅仅是一页一页这种慢慢爬,最大的处理速度,它可以达到每分钟一千页。 ok, 具体操作呢,是这样的,你告诉 opencloud 呢,帮我把某某行业的这些二十来个网站的核心页面呢爬下来,它会通过 firecloud 呢批量的抓取,转成干净 macdunk 文本,存到你本地的硬盘上,然后它可以直接读这些文件,因为 firecloud 呢,有完整的本地文件的读写的权限,同时比对多份报告的数据,哪些呢?是共识?哪些呢?是分歧?哪些呢?是 彼此矛盾的。当然,这一些呢,只是最简化的情况,因为实际操作的时候呢,页面的结构啊,可能差别很大,有的人需要特殊处理,如果你需要更深入的话,他还能写一段 python 脚本来跑结构化的分析,提取每份报告里面的公司名, 融资金额预测。然后呢,自动生成对比表格,因为 openclip 呢,可以执行代码,这些事情呢,他自己就能做。有做投资研究的用户呢,在博课里面写了他自己的做法,把几十份宣传稿位给 openclip, 程序化提取 评级变动目标价,核心逻辑,风险因素,然后自动交叉比对多家券商的观点。还有做旅游 sars 的 创业者呢,更狠啊,让 agent 自动抓取七千两百多份竞品的用户评论做交叉分析,这东西手动做的,你不得找 三个实习生干了两周,你想一下,这跟在叉 g b d 里面说,帮我分析一下这个行业的区别,那么 g b d 呢,只能基于它训练数据里面的旧信息给你一个概数, opencloud 呢,是真的跑出去抓回来,回本地跑代码以及做分析,而且所有的数据呢,都在你自己的硬盘上,研究敏感行业竞品情报什么这些东西呢?除了请求大模型这一环啊, 其他的环节呢,数据根本不过云端,这个用法可以迁移到任何行业。你想搞懂新能源领域,给他十几个行业的网站让他去抓。想搞懂机器人赛道呢,让他把 c b n site, crunchbase 几个相关头条号呢全部过一遍。做行业研究的一个窍门就是找出矛盾点,因为那些不同报告之间矛盾的地方,往往就是这个行业 真正值得深挖的地方。第二个方法,业行 core mailing, 搭一个你自己行业情报日报。前面呢,说的是一次性的这种集中的调研,但是摸透一个行业,它不是一锤子买卖啊,你需要持续的跟踪。传统方式呢,大家都试过定一堆的 newsletter, 然后关注一堆的公众号,每天手动呢刷行业网站。问题呢,是这样做性价比 太低了,你定了二十个信源,每天推两百条信息,真正有价值的可能也就五条,但是呢,你得花一个小时筛选,其实百分之九十时间都是在点击切换这些无效的工作上面。那这个场景上, opencloud 呢,有一个 cbd 和 cloud 完全不具备的能力,就是 cloud 定时任务。 opencloud 的 getaway 网关里面呢,内置了一个持久化的调度器,你可以给它设定一个定时任务啊,比如说,每天早上八点,自动执行一段指令,然后呢,把结果推送到你的 telegram, 或者是 备注,那任务配置会集中在本地的 jobs 点 jason 这个文件里面,设置的门槛呢,低到只需要这一行, mini 好, 就这一行。每天早上八点, opencrew 呢,会自动醒来,用 excel 做语域搜索,用 firecrew 呢,抓取相关网页,提取正文,然后呢,去重评分,生成摘药,最后推送到你的 telegram。 定时任务是跑在一个隔离的 section 里面,因此呢,它不会打断你正在进行的其他的对话。 有个具体案例呢,搭建一个 tech news digest, 一 次性接入了一百多个信源,按标题相似度去重对每条信息呢,做质量打分,只推送高分内容。整个搭建时间呢,一个小时到两个小时。一般来说,搭建完之后呢,你的早晨 呢,会变成这样的,起床,打开 telegram, 一 份定制化的行业简报已经在哪了?谁融资了?什么政策呢?变了?哪个技术突破了?谁说了什么值得注意的话?说白了, gbd 和 cloud 呢,有主动出击的能力,你睡着了,他还能帮你盯着行业 动态。那这是架构层面的差异,不是 prompt 写的好不好的问题了。这个玩法呢,其实它呢,这个迁移空间就很大,做教育的,改成教育行业情报的日报,做医疗的,跟踪各地政策更新,做跨境电商的,监控海外的市场 动向。以前得雇一个人专门盯,现在呢,一行 crow 呢,命令搞定,每个行业都可以做一个 crow, 后面呢,你完全可以用来做一些下游的动作,比如说吸引同行。这个想象空间,大家应该能 get 到。第三个用法, markdown, 加多渠道追问,找出你自己的行业认知。前两个用法呢,解决的是 获取信息,但调研行业还有另一层,你需要建立认知框架。什么意思呢?就是你听到一条行业新闻,能在几秒钟之内判断这事重不重要,会影响谁,跟你 有什么关系?这种判断力呢,通常要在行业里面泡好几年才能长出来。那这里就要说到 openglue 呢,最关键的一个设计呢,就是它的双层记忆 存在你硬盘上的 macdown 文件里面啊,路径在这个 workspace 文件夹里面,它里面呢,有一个 memory 点, md 存长期记忆,然后呢,小写的这个 memory 文件夹下面呢,还有按日期命名的日制文件,记录每天重要的对话。那这些就是普通的 md 的 文件,你用一般的记事本呢, 就能打开看,那这个有什么好处呢?就你今天在网页端跟 openclip 呢聊了新能源行业的整体格局,它自动识别,重点记在了本地文件里面。明 明天呢,你在地铁上用飞书接着问某个新闻领域的技术路线,同一份记忆,跨设备跨平台无缝衔接。后天你回到电脑前面,追问两个竞品的差别,那他全记得,不用每次重新交代背景呢?这个呢,跟 g b d 的 这种记忆呢,完全是两码事。 g b d 的 记忆呢,它在云端不透明啊,一般来说你也控制不了它记了什么,然后它忘了什么。 open clue 的 记忆 就是你硬盘上的文件,你甚至呢,可以手动编辑它,觉得它记错了一些你从线下交流得来的行业洞察,直接写进去, 想用 get 做版本管理,追踪你的认知是怎么一步一步建立起来的?完全可以啊。更狠的是呢,还有一个心跳机制, openclip 呢,每三十分钟左右会主动检查一次你的 heartbeat 点 m d 这个文件,你可以在里面呢写上行业调研的代办事项,比如说跟踪某某公司的新产品发布,或关注某某领域的政策动向,它会主动检 查这些条目。有进展呢,会主动通知你,不需要你每次去问了。那说白了,经过一两周的这种持续的政策动向,它会主动通知你,你的目录里面会长出一个属于你自己的行业知识库, 记住了你问过的核心的问题,搜过的核心的信息,做过的核心的分析。这个积累是 g b d 呢,给不了的,因为 g b d、 zip 这类 ai 聊天,每次开心对话,相当于它失意重来。一两周追问下来,你对这个行业的认知密度呢?能 超过很多在行业里面待了半年,但是却从来没有做过这种系统性梳理的人。好了,以上三个用法,想要发挥最大的威力,得三步串起来用。先用 firecrew 批量抓取行业资料,做交叉比对。 然后呢,用银行 call 命令搭建情报日报,每天自动更新,会送到 tergram 或者是飞书,不遗漏重要的变化。最后呢,通过持续的追问,积累 markdown 记忆,对感兴趣的方向呢,不断地深挖,让你的行业认知像滚雪球一样呢,越来越厚, 那以前呢,我们需要三个月才能达到的行业熟悉度,现在几天就能有个七八成了。最后呢,这个提示词,你现在呢,就可以丢给 openclock 呢,试试 这两条命令,一个是集中火力调研,一个是每天帮你盯着看,你会发现呢,摸透一个陌生行业,这件事情跟以前完全不是一个速度了。

讲一讲这个我们大模型的一个底层原理,最近这个刚才梁山跟我说这个龙虾,是吧?大家都知道这个事情了吧?对吧?现在特别火,是吧?那就是 ai 肯定是我们将来未来必须要这个全面应用的一个东西,但是为了更好的去把 ai 这个事情用好呢? 然后我们有必要去了解一下 ai 的 底层原理,所以我花了很长的时间,几十个小时的时间去研究这个 ai 的 底层原理。所以今天呢,我用简单的道理呢,给大家讲一讲这个 就是我们所谓的 ai 的 大模型,它的这个原理和它当初怎么诞生的这个训练过程是什么?主要是想给你们讲清楚这个事情啊, 所以呢,你看我们今天的课程的题目叫 l l m, 这就是大语言模型 large language model, 大 语言模型的一个整个的训练过程。那这个模型它是个很抽象的词,你怎么去理解它呢?你就把它想成一个婴儿的脑子, 脑子肯定是一个智能的东西,对不对?但是婴儿的脑子他是空白的,他里边是什么都没有,但是他你不能否认他是一个智能的东西,所以你把这个模型本身想成想成的是一个智能的东西。 我们现在就这样讲一下,这个这个空白的这个这个智能的东西怎么通过训练让他能产生,真正变成婴儿,长大了像我们成人一样能做这种,是吧?能理解人说话的意思到底是怎么回事? 那为什么是大语言模型呢?你看现在有那种你们经常在用的咱们电商常用的纹身图身视频,这叫视频模型和这个什么图纹模型,是不是那语言是最基础的,所以智慧的最底层的东西?首先是语言,所以你看第一个出来的模型是什么呢?也是语言模型嘛,对吧?后来纹身图啊,视频都是后来图, 对不对?所以我们今天呢就给大家讲一下,以这个 g p t 为例,讲一下这个大圆模型是怎么训练的。总共的训练分四个步骤,第一个步骤叫预训练 free chain, 我 要给大家解释。第二个叫有监督下的微调, supervised fine tuning 微调,你就简单一下讲,记住叫微调。第三个叫 reward model, 就是 奖励模型,第四个叫 ppo, 它这个叫强化模型。后面我给大家仔细的去解释它是什么东西啊?记不住没关系啊,记不住没关系。 好,我们先来看一下刚才那几个几个词的一个大概的一个示意啊,四步训练流程就像培养一个从零开始的一个大概的一个示意啊,四步训练流程,就像培养一个从零开始的一个示意啊,四步训练流程就是预训练 print chain, 他在干什么事情呢?他相当于让这个空白的大脑,这个婴儿学会语言,就做这个事情, 要海量的这个,这个文字学习,哎,这个,这个让他自己去不断的学习,不断的学习,他是在一种自监督状态下学习的,就是就是人为没有干涉他,只管给他书,给他看了很多很多的书,就相当于这么一个道理,呃,就像你把他举个例子来讲的话,就是我们一个员工在图书馆 大量的在看书,不停的看,就在做个事,做这个事情他是最花时间最花钱的一个工作啊,你看一个一个小孩是吧?从生下来到成人读,他娘的多少学一年学呀?十几年加上大学得,呃, 二十几岁才大学毕业,读十几年学是不是?就是那你说他工作吗?他也没输出什么东西,就是做这个最复杂的事情,是这个最麻烦,他不到不一定复杂,最麻烦。 然后第二步你会看书了,这个但是还不行,就是他没办法做任务,就是你告诉他什么事情他都没办法做,他只是能知道你是干什么,所以要做有监督下的微调 啊。但是有些东西微调呢,相当于在做一些问答,就我告诉你什么,哎,你知道答案,我告诉你一个问题,你回回答一个答案,大概是在做这样的一个过程啊,后面给大家详细解释啊,你就怎么理解呢?相当于师傅带着徒弟去做真实案例,你看你们新来的这个, 呃,刚来的小白员工是吧?运营你们是怎么着呢?你看我做就完了吗?我告诉你是这样的标题该怎么写,哎,然后我告诉你,你就看着我就行了,你按照我的示范就是你给他做示范,对吧?第三步要奖励模型。 reward model 这个是什么意思呢?就相当于这个你光自己看书做这个东西,还还有有答案,有问题,有答案还不够, 来了一个师傅或者说裁判啊,这个这个这个这个要要,我们就是说自学不够,要找出这么一个师傅来,就这个事情本身是在训练出一个师傅来啊,就叫这个奖励模型,有了师傅以后,师傅带着徒弟 去做,再去做任务叫做强化学习,就是师傅给徒弟打分,换句话说是这么说,徒弟做,哎,师傅给你打分,你看你们不也是这么做的吗?是吧?哎,你们的这个组员做一个比如说详情页,或者做个什么广告, 你告诉他你这行还是不行,你总归有个判断嘛?你是打满分啊?还是还是九十分?还是不及格,对不对?最终你会他一个结果,就大概会经过这四个一个步骤。那么后面呢?我们给大家一个一个详细去讲解它的一个过程,你们就你们就大概知道这个大圆模型是怎么回事了。