再来测试一下别的模型的表现情况啊,我们怎么换模型呢?其实很简单啊,在终端我们可以现在可以直接使用它的这个 web ui, 我 们输入 hermes dashboard, 然后呢直接把这个它的 web ui 界面给调出来啊,只要输入这个命令,然后回车啊,我们可以看到它就自动 打开了它这个 web ui 的 界面啊,然后我们在这个模型这里呢,可以看到这里有一个啊秤值,然后我们点击啊,可以看到这里就有我们电脑上已经下载好的模型, 我们之前使用的是一个 gmail 模型啊,我们现在更换这个,换一个这个 gpt 的 模型试一下吧,点击这个模型,然后点击这个, 然后我们再打开 hermes, 可以 看到这里这个我们的模型就已经改变了。那还是昨天的这个任务啊,跟那个我们昨天用给 james 的 任务一样,我们直接把它粘贴进来啊,然后让他来执行,看看他执行的效果怎么样。 那可以看到现在他也已经打开了我们的浏览器啊,然后也是豆瓣电影啊,现在他搜索的也是科幻片啊,这个界面 好,他现在已经关掉了浏览器啊,目前是五分钟十秒,然后他现在还在执行,然后我们这个 gvt o s s 二十 b 的 这个模型,我们看他最终的效果怎么样。 现在是六分多钟啊,他现在已经在开始在桌面上生成一个啊 txt 的 文本,但是我的要求是让他以任何他能够想到的形式给我一个最漂亮的方案,我看他最终能够我们呈现出什么样子哈, 好,可以看到它告诉我们已经完成了,我们用时是七分半,七分二十六秒,它还是给我生成那个 t i t 文本啊,然后跟它终端里给我们这个生成的没有什么区别啊,但是不够好看,跟昨天 g b t 啊,这个 不是 gpt, 昨天这么放给我们生成的那个是一样的,但是确实不好看。他还告诉我们啊,如果要更高级的格式啊,可以告诉他,其实昨天我最后一个就是让他生成一个更好看的命令,我已经这次一次性发给他了,他还是给我们这样子一个东西, 我再给他个命令,看他能不能改一下哈。好,我跟他说了这个不好看,我要一个更好看的文本,他呢 执行了一分二十八秒,很快啊,就完成了,也给我,呃,还是以 html 的 格式给我放在桌面上了。然后呢,呃,我们来看一下它做成的是这个样子, 呃,跟昨天我们的 demo fold 制作的相比来说,确实就没有 demo fold 制作的好看啊,这个就不是很好看, 嗯,但是也能用啊,而且呢确实速度很快,它只需要一分半就完成了啊啊,所以说这个模型 g b t o s s 二十 b 啊,也还不错,也还可以哈。
粉丝7468获赞19.2万

大家好,我是麦东。前面几期我们讲了 hermes 的 子任务,多平台接入这些功能。这期来解决一个很多人遇到的问题, 就是给 hermes 发图片,他看不懂。在讲怎么配置之前,我们先来说一个技术概念, ai 模型能处理的内容类型决定了他能干什么。有些模型只能处理文字,叫纯文本模型。有些模型能同时处理文字、图片甚至语音视频,这类就叫多模态模型。 国内主流模型里支持多模态的有千问、 kimi、 豆包、 mini max 等等。如果你使用的是这些模型,大概率你的 hermes 理解图片是没有任何问题的。当然这里面 mini max 比较特殊,在 hermes 里使用它的图片理解能力需要单独进行配置。这个我们放在本期视频的后半部分来讲, 当然也有一些纯文本模型,比如最新发布的 deepsea v 四,当前版本就仅支持文本输入。搞清楚这个之后,就应该能理解为什么 hermes 看不懂图片了,因为它的大脑,也就是模型本身就不具备读取图片的能力。那么有没有办法在使用纯文本模型的同时,也让 hermes 看懂图片呢? 当然有, hermes 针对图片理解有一个单独的配置,可以把看图这件事情交给一个专门的辅助模型处理,跟你的主模型是分开的。下面我们来看一下这个配置应该怎么开启。大家可以看到我现在使用的主模型是 deepsea v 四 flash, 它当前是一个纯文本模型,本身不支持看图,我们可以来试一下,将这张小猫的图片发给他,问问他图片里面是什么, 可以看到它只能分析出我当前这张图片的一些属性,但是完全不知道图片里面是什么。好,现在我们再来配置一个支持看图的辅助模型。 我们需要提前准备三个东西,第一个是 bash url, 第二个是 api key, 第三个是 model。 相应的三个参数大家可以去对应的模型厂商控制台里面寻找即可。 这边有一点需要提醒一下, hermes 单独配置的图片理解模型必须是要能够支持 open ai 格式的,所以在填写 base u r 二的时候大家要格外注意。下面我们按 ctrl c 退出对话界面,将我们准备好的三条命令输入按下回车。好了,设置完成。下面我们重新打开 hermes 的 对话界面, 使用 hermes 杠 c 恢复上一次的绘画。下面我们再次将同样的图片发给 hermes, 这次他就能够看懂我们的图片了。接下来再来说一下 mini max 的 情况, mini max 比较特殊,它使用图片理解需要单独调用 m c p, 或者是通过命令行工具来实现。我们在 mini max 的 官方文档也可以看到相应的介绍。 mini max 的 token plan 提供了一个 understand image 的 m c p, 支持对图片进行理解和分析,同时支持多种图片输入方式。此外,官方文档还推荐使用 mini max 的 c l i 来代替 m c p, 配置更简单,使用也更高效。 下面我们就来跟大家一起配置 hermes 使用 mini max, 并且将 mini max c l i 也装上,测试一下它的图片理解能力。我们先回到命令行,将刚刚配置好的辅助模型全部清掉。 ok, 接下来输入 hermes model 配置,接入 minimax。 minimax 的 provider 有 两个,我们选择敲 in 的 这个按下回车。接下来输入 minimax api key, 大家自行在 minimax 控制台获取即可。 输入完成,按下回车。第二步输入 bios u r l, 这边不需要修改任何内容,直接按回车。第三步就开始让我们选择模型了,这边我们选一个 mini max, 二点七按下回车, ok, mini max 模型配置好了,我们进入 hermes 的 对话界面, 在这边也可以看到我们当前使用的模型已经由 dbix 切换为了 mini max。 下面我们同样先测试一下当前状态下它的图片理解能力, 可以看到它尝试了很多种方式去读取我们的图片,但是最终都没有成功。下面我们先给它装上 minimax c l i, 然后再来测试一下。我们回到 minimax 的 官网,点击 minimax c l i, 在 这边可以看到安装方式,直接复制该提示词并替换里面的密钥,将其发送给 hermes, 它就会自动进行安装了。下面我们来尝试一下, ok, 已经安装好了,我们再来试一下。好了,结果出来了,可以看到 hermes 在 经过一番尝试之后,识别到了 mini max c l i 工具,它有微信功能,使用这个工具识别了该图片。到这一步,我们 mini max 的 图片理解功能就已经算是搞定了, 当然不要忘记跟你的 hermes 说,以后涉及到图片理解的场景,一律使用 mini max c l i 的 微型功能,并且将这件事情放到它的 memory 点 m d 里面。好了,本期视频到这边就结束了,工具会变,但方法更重要,我是麦冬,下条继续。

本地小模型能力测试啊,现在我们这次用的是用的 gmail 啊,二十六 b 的 模型啊,这个其实我这里面下载了这些模型啊,都是我经过筛选觉得我能跑的,然后有很多模型呢, 其实能装能跑问答基本都可以,但是呢,有一些深度的,比如说我们这几次任务测试呢, 一跑起来内存可能就不足了,然后就会崩溃。比如说啊,我们这个这个 jumbo fold 的 这个十四点五七 g 的 这个模型,就是啊,他能用,但是一跑起来啊,比较大的任务呢,他就崩溃了。所以这次呢,我们测试的是这个 jumbo fold 二十六 b 的 模型。 那我们这次的任务呢,同样跟之前的几个都是啊一样的,在网上让他随便找一个周杰伦的图片,把它放到我的桌面上,然后他就开始执行, 他执行的时候我看到他拉起了这个调用我的浏览器,然后呢,第一个他要打开的网页是知乎,不过因为知乎可能有这个呃人见证,他就没有打开那个网页,后来他又打开了别的网页,我看到了他的网页页面有一个周杰伦的图片,然后呢,过了一会他又把那个浏览器关掉了,然后过了一会他又打开 啊,然后我们看他跑了多长时间啊?呃,一共跑了九分钟啊,九分钟,这个跟我们前面测试的几个模型相比啊,他这个时间还是很短的。最关键的是呢,他最后说他为我找到了一个高清壁纸的图片,然后给我放在桌面上了,确实他在我们的桌面上放了一个这个, 然后我以为这没有预览图啊,我以为他是骗我的。就像之前啊,千万九币的模型就会这样放一个不能看的在这,结果他放了一个这个之后呢?我这,哎,预览可以, 那也就是这个第一个测试的这个任务啊,我们这个 g m f 的, 呃,这个模型是我们刚才测试的几个模型里面它是第一个啊,胜任完成了的,还不错啊。那么我们下来下面来看一下它第二个任务它能不能完成。

给大家对比看一下 open color 以及呃爱马仕还有 context 三个平台的生图的能力的区别。我先把它们大模型全部切换成了 gbt 杠,五点五现都是五点五的大模型。然后来看一下, 这个是我的海报原图,这是我们自己独创了一个体系的原图,这是原图,大家先记一下。然后我们先看到 context, 我 把同样的图片以及指令分别给到了三个平台, 这是我的龙虾,然后这个西姆森,这个是我的呃爱马仕,然后我们先看 爱马仕吧,刚好到这,我把图片发给他之后,我说你帮我把图片优化一下,关于什么什么行业变现体系的,你自己匹配风格。三个平台提示词跟图片都一模一样,没有任何的区别,然后他自己去工作,然后 没有收到响应,然后重试,然后后来又出来了,出来这样这样一张图片,我感觉说实话一一般,很一般,太素了。然后到对到这个 callix 吧, callix, 同样的提示词,同样的图片给到他之后,他给我生成了一张, 大概用了两分钟时间,然后出来一张图片,我说实话,我觉得还行,还行,比我原版的这个图片好看。这原版, 然后这是生成出来的图片,我觉得还可以。他这张图生成出来之后,我的爱马仕跟龙虾还没有出第一张图,然后我说你推翻现在的排版设计,完全重新设计高级一点, 然后他自己给了我两版的图片,大家再看一下我的这个图片,还可以吧,一版比一版好看,我觉得还行,他自己主动的给我做了两版,然后去增加了小图标,然后重新去简单排版了一下,我觉得这个还可以。然后他在爱马仕的已经看过了,对吧?这是原版的图, 爱马仕的爱马仕的在这里这样一对比看,是不是有点太素了?然后再看一下龙虾的,他娘的,我给他同样的指令, 我先不硬拆图理细节,再按什么六六六,给你重新做一版,更像刚才工具抽风了。六六六给你重新做一版,不走那条失败好了吗?无法生存就重试挂了,我的龙虾挂了。 这三个平台的生徒都是用同样的一个大模型。嗯?有谁知道为啥呀?啥原因呀?

把开源的 z image toolbar 纹身图模型接入 opencloth 和 hammers agent 的 两大智能体,不用云端的 a p i 全成本地运行,把纹身图的能力封装成专属的技能, 随时随地使用图片生成的能力。大家好,我是根武,今天带你玩转本地的纹身图。首先给大家演示一下,呃,这个样式,给大家看一下,它是调用我本地的一个 z image toolbar 六 b 的 这样一个大模型。 好,然后这个这个大模型已经下载到我本地了啊,下载我本地,他的路径是在这个地方,这个地方, 哎,大模型是在这个地方。好,然后呢,我给大家看一下,给他演演示一下吧。好,他已经找到这个界面了。 然后这个这个这个这个放过来一点,大概是要一分多钟一点,因为这是一 k 的 这样一个图片啊,可以看一下这个,这个资源管理器啊,就是活动监视器里面这个大概是占有我十八 g 的 这样一个 啊,五十三 g 的 这样一个显存啊, cpu 它也烧的很厉害 哎。图片已伸伸看一下,哎,这个这个不太好, 重新生成一张啊,用这个 m l z 一 米 g turbo 的 技能生成一张三比四宇航员遨游太空图片, 哎,已经出来了,其实它的这个效果其实还可以啊,其实还可以啊。 好,然后教大家怎么样去做啊,就是怎么样去搭载本地的这个模型啊,这个不是 api 啊,因为我这个断了网都是可以的。好,然后去,去这个 happy face 去下载。如果你是苹果电脑,就一定要下我这个版本的啊,就是支持 m l x 推理框架的。如,如果你是那个那个 pc 的 电脑啊,就是 n 伟达显卡的啊,就是 恭恭喜你啊,你可以下载更好的这个模型,更强大的模型啊,下载哪个呢?就同意签问的这样一个一定要下一米 tober 八 b 或者这个六 b 都是可以的。 大概就是有个十一个 g 吧,我看了一下,看一下有多大,大概是十多 g 啊,十一个,十一个 g 啊,十一个 g 啊。这第一步,第二步的话装这个 m f l u x 这样一个工工具啊,也就是支持 m l 是 垂直框架的。装完了以后剩下的就是把这个技能啊,这个技能跟我老师写好了,这个我打开可以打开看一下这个技能就是使用这个工具啊,这个工具调用本地的 z e m g tool 生成本地的图片,然后这个是他的一个呃, 指导的说明书啊,如果你没有装的话,可以这个用龙虾去装它,也可以用海马仕装它,这是它的比例,这是我比例设置的一 k, 如果你对这个图片的这个呃清晰度有要求的话,就把它改成二 k, 二 k 的 话,这个图片一张图片大概要升升成三到五分钟左右啊,这取决于电脑的配置, 其他的就没有什么了。然后写完了这个的话,还需要写一个这样一个拍审脚本,需要写一个拍审脚本,对, 这就是他的提示池啊,我也可以在本地进行做测试,比如说生成一个, 生成一个美女在海边游泳啊,这个给大家看一下。哎,这里就可以详细的看到他这个生成的这个九步啊,因为我这里设置了九步,是吧?九步的话一般来说效果会很,效果还是一般的话,你如果觉得这个效果不好的话,你把它设置成二十步,那这样的话他的这个效果会更好一些啊。 然后呢?生成的时候,生成完了以后可以给大家看下效果,这是进行调试,调试通了以后就把这个史蒂老师放到这个龙虾的目录或者海马仕的目录,这已经好了,对吧?它生存在这个这个这里面。哦,我打开看一下这里 是吧?这个效果还是可以的,是吧?效果还是可以的。好,今天的课程就分享到这里,你学会了吗?

最近 ai 圈有两个带 h 的 技术比较火哈,一个叫 harness, 一个叫 hermes。 很多人逛技术社区的时候,一会儿看到 harness engineering 是 agent 落地的关键,一会儿又看到 hermes agent 两个月拿到了十万新,不少人下意识以为是同一个东西,其实是错的, 一个是建筑设计规范,一个是按规范盖出来的大楼,其实这个图片就可以很好的表达出这两者之间的概念和关系。那我们先说 harness, 它其实本意就是马具那么大模型,那匹有力量且难以驾驭的马 啊。 harness 它其实就是将神,是马鞍,它可以让人更安全的去驾驭这个马,这个其实就是目前针对的这种智能体和 agent 它的一个技术规范,它的最终目的也是想让 agent 能够有更好的表现,说白了就是有一个比较好的工程化设计能力。 因为从二三年大家开始玩提示词工程,琢磨怎么跟模型说话,然后二五年升级到了上下文工程,开始关注给 age 的 看什么比怎么说更重要。那到了现在二六年,现在这个概念 引爆到了整个 harnis 工程,那其实它不再是针对于优化单词的话,而是说能够设计跨越多个绘画以及多个 agent, 其实总结出来就是四个字,约束先行。那么现在整个 harnis 做的最好的默认是 code code, 因为确实 这个工具它现在是智能体里面呃生成质量最高,也且是调用各类顶尖的模型表现能力最好的一个呃,智能体。那么我们再说回 hermes agent, 这是 news research 今年二月份发布的一个 开源智能体框架,它两个月也在 github 上突破了十万新。它定位其实是很独特,它不是聊天机器人,而是常驻运行在你电脑的数字员工。那么它跟 open globe 小 龙虾其实是有一定的区别,因为小龙虾需要我们去养,需要我们不断地去给它喂更多的上下文存储记忆。那么 hermes 的 话,更多的就是它可以根据我们的一些任务指令去进行自我进化, 把一些复杂的任务场景自行地去生成一些技能。所以 hermes agent 它的核心技术是学习闭环,完成了一个复杂任务之后,它会得到一个结构化的 skill m d 的 技能文件,并且这个技能文件在后续的过程中还会自我的迭代。那么这里就用一句话去分清楚它们俩的区别。其实 hermes 它是怎么造好 agent 的 规范?那 hermes agent 它是按照规范造出来的一个优秀的 agent。 我 们就好比 hermes, 就 好像厨房的操作规范, hermes 像是按规范训练出来的一个顶尖的厨师,它会根据自己总结的经验,然后改进菜谱,炒的越来越好。 那么我们总结一下,当 ai 圈开始同时热议规范和产品的同时,你会觉得哪个更重要?其实我的看法是短期看产品,长期看规范。比如说像 hermes, 它会让你 立刻尝到这个 agent 的 甜头,但是技术规范 hermes 它并不知道你的甜头从哪里来。你只有通过持续的整个迭代和优化设计更好的规范,才能让整个 agent 的 产品变得更好。

第一配置的本地模型测试啊,我们再来看看这个千万三点六三十五 b 的 模型的表现,不要问我为什么用这么奇怪的一个模型,因为我试了好多千万三点六三十五 b 的 模型真的跑不动,二十四 g 内存好多都跑不动啊,这个的模型的大小十二 g 左右,还勉强能跑 别的,呃,三十五 b 的 十,呃,这个十八九 g 大 小的模型装上之后根本就跑不起来,文字都发不了, 有的一些这个大概十四五 g 流量那个大小的模型呢?装上了问答啊,他可以回复啊,能简单的跑一跑,但是你让他执行任务的时候他也不行了。 我们来看这个模型的话呢,我们还是第一个测试啊,就是说让他在网上随便下载一个周杰伦的照片,图片给我放到桌面上, 我们来看一下他的执行结果啊,他,呃去执行了之后,我看到他拉起了我的这个浏览器,他调浏览器,然后呢,他访问了一个这个知乎的页面,但是, 呃没有网页访问,就是可能是被受到人机验证了,网页没有显示出来,然后他后来又访问了谷歌,谷歌的话跳出来了,这个需要人啊,人机验证点击的那个界面,但是我没有给他手动点击,他自己就没有办法了, 然后他尝试了几次之后都不行,结果呢?他这个说就说他无法下载一张追梦的照片啊,因为遇到了啊这个问题,然后,呃, 反正就是没给我做,他就停了,他执行了八分多钟自己就停了。跟之前我们用的那个前吻三点五九 b 模型相比呢,他的执行时间虽然很短,但是没有执行成功,他自己会 终止。但是九 b 模型呢?基本上不会终止,但是九 b 模型他确实能够啊,拉起浏览器,然后在谷歌当中搜索,我能在搜索当中看到他图片,他只是无法下载, 但是这个模型呢?嗯,他没有让我看到任何图片啊,也是挑战失败啊。我们再来看一下第二个任务。

看看不同的本地模型在 hermes 当中还能做什么?它的性能和能力怎么样?那我们现在使用的依然是这个 gem of four 啊,二十六 b 的 这个模型,因为之前我们做过一些模型的能力测试呢,我也把这个事情直接告诉他了, 我说我要测试你的性能,然后呢,你觉得这个测试还能有什么任务,通过什么形式来完成?然后他给我啊,输出了一些这个,比如说智力逻辑挑战呢, 视觉审美大比拼等等。但我说你给我的这些测试呢,我通过网页的,比如说 chat, gpt 或者 jimmy 呢,也能完成。我测试你主要是因为你是一个 a i a agent, 你 可以像人的双手一样去执行一些命令,这个是最重要的。所以它呢,又给我了一些其他的建议, 其中他自己说的这个测试内容我觉得挺好。打开浏览器去豆瓣电影搜索科幻电影,然后进入搜索结果的第一页,抓取前十部电影的标题、评分和人数,并将这些数据整理成一个文件保存。在。啊,这个本地啊,那这个能力我觉得挺不错的,我们测试一下他能完成的怎么样? 好,那我现在输入了命令,让他去执行。首先我没有让他打开浏览器,我看他怎么操作。另外呢,我除了这个豆瓣电影以外,还给他了可以去 imdb 上去搜索,看他选择去哪里去搜索。 然后呢,我让他生成,以他能够生成的文档的形式来保存,我看他怎么样来保存啊,我们执行这个命令来看他能怎么样完成这个任务。 好,那现在看到我这个浏览器已经被调出来了啊,是 hermes 主动打开的这个浏览器,然后呢?是豆瓣电影,然后可以看到这个搜索类目也是科幻片,然后看它怎么样来操作哈。 好,浏览器已经被他关闭了,刚刚我看到这里出现了一大片黄色的字啊,有什么各种啊电影的信息,然后现在又消失了,应该是他自己在整理 好,现在他说了,我已经完成了您的需求,我访问了盗版电影啊,怎么样的?这个这个排行截取了什么什么东西 啊?我们可以看到他现在还在工作,还没有完成啊,但是他现在应该只是在生成文件,他还给了我们操作总结啊,好,现在已经正式完成 啊,一共用了五分二十三秒啊,他这是他整理的这个一些数据,然后文件路径,我们看一下他生成的文件, 呃,在桌面生成了一个这个点, m d, 这个文件打开之后,这是跟他在终端里的一样,我让他给我整理成一个表格的形式,但他只能是这样,确实是不太好看,但他确实信息是抓取成功了的, 但是由于他给我们这个数据是一个 markdown 的 形式啊,太不好看了,我又增加了一个命令,我让他,呃,不要用 markdown 的 形式给我让他制作成一个好看的啊,以任何他能够想到的形式, excel, word, ppt 等等都可以。然后,呃,给我生成一个文件放在桌面上, 他执行了,我们看啊,五分三十四秒,五分半。然后他回复我们了,说他明白了,这个确实不够美观,他,我们他知道我们需要一个冲击力的啊,报告,然后他说他的环境当中缺少可以生成复杂 excel, 反正是啊,这个工具啊,没有权限。然后呢,他就换了一种方法 啊,它这个给我们了一个 html 啊这个东西,然后它还做了一些这个啊,深色科幻风格等等,拥有什么什么东西可以用浏览器直接打开它, 然后呢文件名是什么样的?此外为了保险起见,它也给我准备一个标准的 csv 啊,可以直接导入 excel。 然后呢,它已经给我们生成好了,我们看一下啊,它刚开始是给我桌面上生成了一个 c s v 文件,很快啊就给我们桌面生成了, 然后后面它就应该一直在制作这个 html 这个文件啊,我们这个 html 文件我们预览一下啊,直接预览一下。哎,看看到它做的这个还不错啊,这个颜色的,这个渲染上背景包括这个字体的颜色 啊,这个都还不错,蓝色、黄色这些对比还算是满票了,蛮好看的啊,所以这个任务他完成的不错啊,这个啊,抓取大概花了用了五分多钟。做这个 啊, html 这个大概用了五分分钟,等于整个任务一共用了十多十多分钟的样子啊,完成的还不错。

准备用几个小测试来测试一下,我们这个配置不是很高的普通电脑,能跑地的本地模型都能达到达一个什么样的程度啊?我准备用四个任务,第一个是让他去网上给我下载一个图片,然后呢第二个任务是让他做一个 ppt 啊,第三个是在本地给我整理一下我的资料啊,最后是让他啊做一个小游戏。 那么第一个模型呢?我们是首先我的电脑是 macbook air m 五二十四加 e t b 啊,不是特别高的一个 啊,配置,我们现在使用的模型是千问三点五九 b 啊,蒸馏了一点 class 点六,我们用 hermes。 然后啊第一个任务,我让他啊上网上随便找一张周杰伦的图片给我放在桌面上,然后他就开始运行了 啊,我看到他打开了我的浏览器,然后呢也搜索到了这个周杰伦的图片啊,搜索到了很多,我也都能看的见,然后但是他就是下载不下来,我们可以看到 他通过各种各样的方法,比如说通过这个 html 网页版,然后他就换一个方法,下载不了,他就换另外一种方法,然后他尝试了很多很多种方法,他都没有下载下来,包括他下载下来的有一些这个缩略图,也不是图片的格式, 他会尝试各种方法,比如这个视频网站的封面图,专辑封面图,然后这个获取 vg 百科,或者是这个尝试用啊图片托管的程序。 然后呢他最终啊这里太好了,他下载到了一个图片,但是那个图片不是周杰伦的图片,我看到他在我的桌面上创建了,创建了一个文件夹,里面他搞出来了这么多的啊图文件,但只有这一个是一个图片文件,但就像他说的不是周杰伦的 啊,他最终也没有下载成一个周杰伦的图片给我。他这个任务跑了四十五分钟,还然后跑超过三十分钟的,我就认为他是挑战失败,这个我就给他停掉了,我让他进行下一个任务。


每天获得一款高质量开源项目第六十八期 hermes workspace 是 一个专为 hermes agent 设计的原声 web 工作区,具体的界面就是这样的,我这边内置使用的是 deep sec v 四的两个模型,因为 d p c k 的 活动优惠力度很大,用起来也不错。 这里一百万 token 差不多四元左右。下面显示一些任务详情和技能使用等等。这里还有一个联机聊天平台,点击就可以直接进入了, 里面都是一些真人。 welcome to the training grounds this is where every hermes agent begins you will。 然后就是主要的聊天区,通过聊天控制 hermes agent memory 帮你直接操作你的电脑。我使用的是威 no d 的 wsl 安装的 ubntu, 这样就与其他的 web coding 类似了, 但是多了一个自我净化的能力。这边是定时作业,每天会进行一次内容挖矿,花费就零点二左右。其余的功能我就不一一介绍了, 大家可以自己去探索。 hermes agent 主要的就是这个记忆和净化的功能,这边自己安装好了很多技能,还能将你的喜爱也写成 m d 后做成一个技能,这就是 hermes agent 净化的基础,原理大致就这样。

hermes 自己找豆包聊天背景音乐是 hermes 自己做的理论,可以做到本地模型零偷看消耗。找豆包出方案生成图片视频联网搜索其他网页版 ai 模型均可。 gpt 等。 you。

挑战,每天讲透一个大模型实战知识点。今天讲二米 c 着那核心架构,不知道大家有没有过这种感觉啊?现在的各种 ai agent 虽然看着很牛,但其实骨子里还是个提现木偶。 你今天教他一套流程,他干的不错,明天你换个电脑,或者关掉对话框,重新打开,完蛋,他啥都忘了,还得重新教。这种一次性的工具究竟能不能进化成真正的数字员工呢? 大家好,我是彭宇。今天咱们就来拆解一下最近在开发者圈子里霸榜的 hermes agent。 很多人拿它跟之前的 open clock 比,说 hermes 才是未来,那它到底凭什么敢自称是能与你共同成长的数字生命?来,咱们对着架构图,一点点把底层的皮扒开。 大家先看屏幕最上方的这套核心架构图,咱们从左往右看,最左侧是它的持久化记忆层。 以前用 openclaw 网页一关,上下文清空像金鱼一样的记忆。但是 hermes 呢?它自带了本地硬盘,它能像真人同事一样记住你这个项目的业务背景是什么,你习惯用什么格式输出?这叫什么?这叫有了职业生涯的连贯性。接着咱们往中间走, 中间这个蓝紫色的引擎是整个 hermes 最暴力的部分,它里面有个词叫 inner monologue 内部独白啥意思呢?就是它在执行你的命令前,不会傻乎乎地直接动手, 而是先在脑子里自己跟自己对话。哎,这事我分几步走最稳?第一步干嘛?第二步遇到报错了怎么补救?但是刚才说的这些还不够震撼,真正让它跟 openclaw 产生代差的是中间下面这个紫色的部分, skill factory 技能、梦工厂以及它连接出来的下面这条紫色的学习闭环线。大家肯定很好奇, ai 到底是怎么自己给自己造工具的呢?来,咱们往下滚动页面看第二部分动作是如何变成技能的。 我给大家拆解了他背后的四个硬核步骤,这可是纯干货啊!第一步,意图解析,比如你让他帮我去抢个票,他大脑会先把这个模糊的指令用思维链拆解的明明白白。第二步,动态试错, 他会在反检测的环境里疯狂尝试,点错了没关系,查日记退回上一步,修改代码继续跑,直到走通为止。第三步,醉绝了,叫逻辑题,练很多简单的 rpa 录制完脚本就结束了,但 hermes 会在跑通后 把里面的具体参数剥离掉,他会把买一张明天去北京的票这种具体行为抽象成一套万能购票逻辑。最后第四步,技能固化,他会自己写一段带有标准化 jason 描述的 python 代码,然后啪的一下 拍进系统管理局的 skill register 技能库里。下次你再让他买票,他不再去网页上像个无头苍蝇一样现找了,直接调取他自己写的技能包秒杀。这就是越用越聪明。讲到这里,有同学可能会问了,这么逆天的功能,底下到底是啥神仙技术站在撑着?咱们再往下看。 第三个模块,底层技术透视。在模型层,它是基于 northhermes 三来的,底层是 lama 三点一的架构。之所以内部独白这么强,是因为人家用了专门的 a tropos 配方去调优。在环境控制层,它是直接基于 c d p 协议,就是 chromedaptos protocol, 通过 c d p 协议去操纵浏览器的,多配合 jason 的 结构化输出,又快又准。 在存储层,它用了 circle light, 加上向量数据库的双引擎组合,专门用来存这些复杂的长城记忆。好,扒完了底层架构,咱们把视野拉长,来看看最后这组直观的对比, openclaw 强不强?强!在自动化抓取和固定工作流里,它是个顶级的超级遥控器,这叫 gateway first。 但它的命门在于没有代码写好的预设流程,它遇到新情况就容易蒙。而 harness 的 理念变了,它叫 agent first, 大家看它最核心的壁垒,自生产工具能力。 我们以前的思维定式是程序员给 ai 写工具, ai 负责调用,但 harness 告诉你,不遇到没见过的业务,我自己去试错, 试通了,我自己写个工具保存下来。这就是我想跟大家分享的范氏月签。以前我们是在把 ai 当消耗品用,用完集坟。现在我们是在培养资产。你部署的 hermes, 跟你相处的越久,他积累的专属技能就越多, 他就越值钱。所以想要体验下一代 ai 开发逻辑的兄弟们,强烈建议去搞个开源版折腾一下,让他自己写代码来伺候你。这就是今天分享的全部内容,咱们下期见。

这期讲一个很实用的炼录, openclaw 和 hermes 怎么通过 openclay 附用 gpt 网页版 check gpt 的 图片生成能力,重点不是直接调图片 api, 而是先把 chrome browser bridge 打通。 很多人会遇到这个问题,自己在叉 g p t 点 com 上能生成图片,但 hermes、 open core 或者普通终端里的模型调用却不能直接附用这份能力。原因很简单, api 能力不等于网页登录态能力。 第一步,下载 open c l i 浏览器插件,去 jacqueline opencly 的 github releases 页面下载最新版本的 opencly extension 压缩包。 第二步,在 chrome 里加载扩展,因为这条链路不是纯 h t t p 接口调用,而是要靠浏览器插件和 browser bridge 去控制已登录的 check gpt 页面。 第三步,安装本地 c l i, 并验证连接只有 openclean c l i、 chrome 插件、 browser bridge 以及已登录的 gpt plus 绘画都正常,后面才能稳定生图。 先打开 open c l i 的 github releases 页面,也就是 jacqueline slash opencly releases, 找到最新版本下载通常叫 opencly extension v 版本号点 zip 的 浏览器扩展文件,这个插件是后面控制 chrome 的 关键。 下载完成后,把这个 zip 文件解压到本地文件夹。注意, chrome 加载时不是选择 zip, 而是选择解压后的 extension 文件夹,这个地方选错,后面 bridge 就 接不上。接下来打开 chrome, 在 地址栏输入 chrome 冒号双斜杠 extensions 斜杠,然后回车。 这里要用已经登录 check gptplus 的 chrome 或 chromeium, 因为真正拥有声图权限的是网页里的账号登录台。 在扩展管理页面右上角把开发者模式打开,这个开关不开就看不到加载已解压迫展程序的按钮,也就没办法把 opencube 的 浏览器桥接插件装进去, 然后点击左上角的加载已解压的扩展程序,弹出目录,选择后选中第一步解压出来的 extension 文件夹到这里,浏览器测的 browser bridge 才算有了入口。 插件装好以后,还需要安装本地 open c l i 环境。打开终端,运行 m p m install minus g at jacqueline slash opencly opencly 在 这里不是正式图片 a p i s d k, 而是把你手工操作叉 g p t 网页变成终端命令自动完成, 最后运行 opencooker。 如果输出里出现 browser bridge connected, 说明 chrome 插件和本地 open c l i 已经正确连接,后续就可以由 opencooker 控制浏览器打开已登录的 chat gpt 页面,输入 prompt, 点击发送,等待图片生成,再把 png 保存到本地。 这里最容易卡住的点有三个,第一,不要把 gptplus 网页生图当成正式图片 a p i。 第二,只装 openclip 和插件还不够,浏览器里必须已经登录具备权限的 check gptplus 账号。 第三,所有操作前先跑 doctor 确认 browser bridge 真的 连上了。 总结一下这条方案的价值是,用户已经有 gpt 网页能升图,但 hermes 和 open cool 不 能直接调用这份网页登录态能力, 所以我们用 open 可以 接管浏览器附用已登录的 chat gpt 绘画模拟输入提示词,点击发送等待图片生成,保存本地 png, 最后再按需要发回 file 或其他平台。

兄弟们,你们要的在 hermes engine 中用网页大模型代替我们 api 的 解决方法来了,下面我们用一分钟的时间来实操一下 windows 用户的话,得到这个 excel 的 文件安装包,直接安装好的话,主界面就这样了, 我们在设置里面把它的文字改为简体中文,然后再点击供应商,这里我们添加一个单元格型,这里我就以字谱为例,选择之后直接点下一步,然后点击 os 登录方式,打开 os 登录,然后我们就像以前登录字谱的官网一样去登录它就完了。登录好了之后,我们就点击添加账号,相当于现在已经有一个 字谱的账号在这里了。然后点击左侧菜单栏,点击代理设置里绑定地址的话,如果是自己用,那就按着这个上面默认的就可以更改。然后点左侧菜单栏的 api key, 我们打开认证,新建一个 api king, 这里的名称和 king 可以 自动生成就可以,然后我们接入 api 的 base url 的 话就填上面那个, 然后模型名称填下面那个,那么这里面的所有的操作我这里都已经整理成了一份指南,如果大家有需要的话可以在评论区留言。接着我们打开我们的 harmony, 然后这里面输入 harmony 默认,接着我们往下翻一翻,找到自定义接入 api 的 方式,然后点击进去,然后我们把我们刚才的 s、 u、 r、 l 复制过来,然后下面把 api king 也给复制过来,然后这里点击回车,然后我们查看一下所有的可用 api 列表,好,这里发现智普的 g、 r、 m 这里都有了。