如果你也是 ai 的 开发者,对 ai 感兴趣,想要尝试开发的人,那这一次的这个章节将会对你非常受用。因为这是根据我自己的经验,然后通过打造产品,然后不断试错, 总结出了一些产品思维上的逻辑教程,以及具体的提示词的一个架构。网上有一些教程视频,可能感觉你看完了之后就觉得自己都会了,但实际上不是 纯扯淡,因为你自己没有实际去测试过,或者你没有自己实际去操演过,你是不知道你的那个东西能给你整出来个什么花活的。所以这一次基本上就是一个实战一样的教程,可以给你展示一下是 我们是如何用工程性的 ai 架构思维去判断可能你在打造产品时遇到的一些问题,这个月又花了一些时间去做这样的东西 还是我们的找工作的最能提的。我先讲一下上次搭建的内容,主要分为三个板块,最开始的想法非常简单,就是从不同的工作平台上抓取到平台的信息, 这里是用这个 playwrite 来抓取它的输出,结果我用一个 json 的 形式来给它保存。为什么一定要用这个 file 的 形式,是 因为它相当于是一个标准的格式化的输出结构,这样会使你的单元模型产出的东西更精准。 或者是当它传递到下一个 agent, 就是 下一个这个工作流的时候,它能进行稳定的输出,这样就会导致它格式不会散掉。这里面我们为什么要用到这个窗口的原因是因为如果我随便点开了一个网站这里,比如说 我们点开这个网站,我们就得在我们自己的界面进行这个抓取,因为说白了这个是人家的界面,基本上就是这样的一个区别,这就是一开始搭建这个工作流的核心。但是 后来我发现有两个很大的问题,说白了你在这个平台上去哦派就是你去申请的工作的时候, 你点开之后是他们独有的一个页面,这时候如果你要是想只抓到比如说他们的这种 email 这种个人的关键信息是比较困难的。说白了我在这个我找不到他 email 的 网站,我还是得一个一个填,那其实跟我自己找是 没有任何区别的。能不能让 ai 抓取?比如说这个网站所有的信息 它自动去分析,或者它自动给你点 apply 直接提交。假如说我点 apply, ai 的 所有动作都是自己完成,它自己给我点 continue, 下一页 fill out, 就是 填完 continue, 这样就只能这样弄。但是这样弄就涉及到了一个什么问题, 它的安全隐患问题,各个平台就专门仿一手,你让 ai 来自动帮你填,你一旦它这个规律就是你填的规律特别快,它检测到不是人为的那个操作的时候,它就会自动封锁你的账号,所以在安全上有隐患。这就是为什么我要接着去改良我个 a 阵它的原因,因为实际上它现在是 word 不 了了,但是这个功能的抓取可以, 你们可以用我抓取的软件,我给它现在保存成一个插件的形式了,可以去收集网站上的信息,如果你们要是有需求,其实我也可以直接发给你们,或者我直接放在那个 github 上, 我把它做成了一个插件的形式,是在这儿,就假如说你这个插件,你装到这个 google 的 这个叫 extension 的 这个东西里,每次当你点这个插件的时候,就在我的网页里,比如说我用这个插件, 因为我现在不是在我自己的这个网站上,所以我不确定现在他能不能使用,比如说点一个,他说还是得在我自己的这个页面使用,不能在官方的页面使用。这也就是为什么我要用本地端来去执行。差不多我这个插件基本扫描我的本地端网站之后, 就能提取当前页面的一些关键信息,这个也是可以平常日常用的。你搜集一些资料的时候,我们新的思路就是要想清楚怎样解决。其实不是怎样解决这个问题,是 如果你把它放到一个产品的视角来讲,就是如何打造,如何让 ai 去帮你投简历,收简历,准备 offer 的 一个过程。 所以其实我自己人脑里我先是画了一张思维导图的形式,尝试看看我如果要是平常去干这个东西,我是要经历哪一步, 如果要是 ai 完成, ai 会经历哪一步?这就是我一开始的产品搭建过程。我以我自己画了一个思维导图的形式,因为我喜欢在 use 的 我的产品之前,我去进行一个逻辑梳理。我一开始的分析就比较简单,我的这个简历,我简历要干嘛?是不得找到对应的公司。 我讲到对应公司,我查了一下,他是需要 pass, 需要通过一个测试的,这个测试就是你电脑器就自动给你筛掉的这么一个测试,这个测试过了,你才有机会让他这个高贵的这个家伙让你, 你去请他过目两眼,他有可能大概两秒看什么玩意就给你扔了,但是你得先到这一步,你这一步他看了之后觉得那小伙子有前途,他才会到 interview 的 这个阶段,大体是这个阶段。于是我的想法就是,首先得有一个本身的简历,你第一个工作流的搭建应该怎么搭建?是不是你找到对应的公司?根据你自己的简历,或者你要你想找什么公司,是不是得先给你找着这个公司?我第一个他干的事就是帮你找到对口的。 当我找了这个对口的公司之后要干嘛?我目的是不是得 pass 这个 test, 所以怎么 pass 这个 test? 是 不是我得去思考一下他们要招什么人?所以我这个 agent 的 目的主要是帮我做一些背景调查,看一下这个公司的 culture fit, 它的文化的接受程度上,包括他们公司是怎么样的一个 vision? 他 们是想要一个机器人,想要个老牛马来跟你干活来?还是说是要一个具有创新思考,会用 ai 的 人 去做一些这样的背景调查?你再去整改你的简历,会有效很多吧,因为首先你就过不了这个,于是他就是我的数据情报家,我把我分析的数据情报我转给他,是吧?这哥们是干嘛的? a、 j、 c 是 干嘛的?说我把所有的这些情报转化我全给他, 只要他完成一个 mission, 就是 什么让他来完成这个 test, 他的使命就完成了。他确保最后给我得出一个概率是基于他的 a 跟 b 的 culture fit 的 企业文化和所有信息的匹配,以及他的要求和我的简历 来去思考能不能 pass, 这个的 pass 概率是多大?在这里进行一个东西,我在它内部还加了一个对抗性的推理,生成两板,如果要是 看看生成同样逻辑内生成的两板,哪个通过这个得出的总概率更高? 再通过我的个人性格,我的个人的习惯去写一个 cover letter 寒暄的客套话。就比如说你发简历的时候,你不得发一段文字吗?你说各位爷爷奶奶收留我对不对?发一段寒暄的这个话就到了 a j d 这时候我是一个什么想法,我却把我的简历能 pass 了,那这时候 他负责当一个什么?他负责当面试我的那个人,然后来去判断我这个简历能不能入的了他的法眼,相当于他是考官。那我怎么来逼我的这个角色?我是通过对其 a 跟 b, 其实主要 对其他的抓到的信息,因为他抓到所有公司的情报了,公司的情报生成 a 跟 d 这个小人, 这个小人拿到了公司的企业文化的偏好性融合,再包括这个企业大概率是怎么招人。在学习一些,这里写的是 youtube 的 一些专门有奖 hr 是 怎么评判你的简历的,类似的播客,或者是或者在领英上领聘 和 reddit 这些平台的一些专门干这个的 hr 的 机构和公司,他们有的讲的一些干货进行数据的录入,就相当于为给他这一段数据,让他去扮演这个角色来判断我这个简历是这个值是一坨,还是 觉得你有点东西差不多这样?最后我的想法是把这个生成的判断,比如说他要是给出的测试是 fail, 我 这里就要给一个 feedback 是 哪不行, 因为这里的 feedback 如果有人碰到不行的就说明什么,说明这个职业不适合我。那 a 任 a 一 开始干的事就错了,因为 a 任 a 一 开始干的就是适合我的事。 我当时是想着如果他要是不过我,就把我的简历重新打给 a 跟 c, 根据他判断我不过的点,再去改改写我的简历。 但是后来我通过测试,我发现这本身就是一个逻辑错误,因为假如说你测试没通过,可能是因为你技能没达到,那即使让他再改,也不能胡编乱造一个技能给你安到这个简历上, 对吧?这就是后来测试才发现这个逻辑错误。这个 a j e 说白了就是一个实时录入你数据的,比如说你一天投个二三十个,他就及时更新你的这个数据状态,假如说是 hr 伤伤脸了还是怎么着还是没,就是那还反映这个实时状态, 大体就是这么一个模式,这一开始的产品搭建思路,我说这搭建完,我的天呐,那简直小天才又来了,但是 后来才发现这个简直错的都是,具体错的有多都是。我一会给你看一下,他给我矫正后的逻辑就会更清晰一点。我把所有的这个逻辑跟 ai 说了一下, 就让他给我干活,但是你再让他给你干活之前,你是不是得用自然语言说你怎么帮我干活?我得把我这个思维导图描述成一个 稍微专业点,话说让他给我干稍微专业点活。所以这时候一个非常重要的技能就来了,叫 front engineering, 就是 你的提示词工程。 这里面我其实整理了四套其实工程的架构,如果你们要感性,可以私信我发给你们,或者我直接就放到我的 guitar 上,你们要想看就这登就行了。有的人说 guitar 怎么弄,在哪下?我的天呢,我说你你你可别,你就在这听响就行了,你也不用知道了,我看一下 在哪来着,是我的战略计划。对,这是我的四套架构,我可以给你打开一个 basic 的 架构,这个也是我实战一点点调出来的。一开始架构没有那么完善,我可以简单给你们看一下,具体我会出一个专门的章节来去讲 这个价格为什么这么贱,以及你在平常使用,比如说拆的 gpt 也好, cloud 也好,你怎么去输入你的 problem? 因为这是最关键一个环节,假如你输的,你说今晚吃啥?或者输一些很没有结构或者很大的东西,其实你自己的 ai 你 在使的时候就降智了。比如这个, 你得首先思考这个任务本质是什么,你给它进行一个分类,失败的代价是什么?气约用的模型是什么? 能做不能做什么比能做什么更重要。你要设计它的边界是非常重要的。大体一个架构,你怎么去验证你的这个结果?而且因不同任务, 你所设计的提示词的模型还不一样吗?这个可以专门讲大体,我就讲一下它生成的东西是什么就行。我先找一下之前生成的这个东西,因为我是已经放进就跑完了,我之前可能会把我自己在跑的这个过程我会录下来,但是我这次就没录,我就提前跑了。因为我现在 a 阵的 a, 我 想再重新搭建一下,所以之后也可以看一下我在跑的时候的一个视频。我的思路是先让一个 a 阵能跑通,假如说 我先让 a 阵 b 能跑通,然后 a 阵 b, 我 输入测试一下,我发现 b 能用,我 take, 我 说我打个勾,我再去搭建 a 阵 c 嘛, c, c 就 要结合于 a 跟 b 的 改造词来生成,就是结合 b 的 结果来生成对应的东西。因为 我们这个架构里比较清晰的是 b 分 析的市场分析,这个信息要录入到 c c 再来给我生成。所以 b 生成完了之后, b 要保留一个最终的是 json 的 形式,这时候给到 它,或者假如说你不用这次 file 的 形式也可以,你,你只是一个 一个,那叫什么 samurai, 中文是什么 samurai, 那 叫总结,这事闹得母语都忘了,我看一下你 b c 完了之后产出的是 d d, 我 们是模拟面试官的角色,所以它又重新要调用到 b 的 一个生成内容吗? 基本上就是这样的一个格式,他完整的运行了一遍,我确定这个结构搭建完毕,我完整的运行了一遍,他产出的结果是这样,我们先看一下我输入了什么,这个我说是这家公司,我说 以下是这家公司的内容是什么?这个内容其实应该是 a 阵的 a 找到,然后 a 阵的 a 输给 a 阵 b, 但是其实我一开始不搭建 a 阵, a 对 我的整个操作一点影响都没有, 我随便复制粘贴任何一段,比如说这个招聘网站的上的信息给 b, 是 不是 b 都能跑? 所以这为什么做的先后顺序是先做 b, c, d, 最后再来做 a? 这个顺序也是你需要思考的。差不多是这样, b 给出的结果是是觉得你有百分之七十五的 match, 相当于是你通过那个 a t s 的 这个概率是多少? c 给你进行一个量身的定做,发现你过这个 test 的, 最终给你得出了一个概率是百分之八十。 d 最终给出了一个结论是可以 pass 它,差不多生成的这个结果就是这样的。 但是你会发现一个问题是,我一开始想让 b 给我干的是什么?一开始想让 b 给我干的是生成所有的有关于这个工作,公司的内部信息和他们的一个文化背景, 通过调取这个不同的资料来进行一个 summer, 就是 来进行一个总结。 b 默认给我生成了这个东西,传到了 c, c 帮我重新定制了一个简历,觉得比较契合。这个简历我是之前拿到了,是一个 pdf 版本的,相当于把我的简历自己又重写了一遍,但是我发现那个简历一股 ai 味儿。 d 模拟的是这个面试官的一个作用,但这时候他给出的一个结果是什么?百分之七十 pass。 因为其实假如说你拿到了这个公司的数据, b 给你总结出了这个 samurai, 你 拿到公司的所有数据,你自己什么样你是知道的, 所以你可以自己来判断你 pass 的 概率是多少。所以 a 跟 d 的 设计不应该是来判断我能不能去 pass 这个 hr, 而是应该通过 a 跟 b 给到的这些数据来进行一个私人定制,就是说 你应该去补足哪项技能,给一个 study plan, 因为这就区分到了一个最关键的点,就是你用 ai 跟真人的一个区别,真人是用来执行你的决策权的,你像 b 干的就是决策全会更多在这里面,那决策权需要你来干,你来判断你是该投还是不该投,这就需要人来干。但是如果你要是涉及到具体的这些 samr, 那 是不是 ai 就 可以给你系统性的整理? 这时候应该用 ai 来干,所以我们 a 帧 d 的 方向就错了,我们混淆了人跟 ai 之间的这个区别,边界性就混淆了,因为不是所有事情都适合 ai 来干的。 a 帧 c 的 问题是它给我生成一堆东西,但是我并不是很想要那些东西, 而且它怎么改?我不学到新东西,我再往里加,那不胡来吗? 所以他其实也没有用。他真正有用的点是什么?给生成一个具体的一个框架, 这个框架可以帮助你如何去制定你自己的简历。按照他们 hr 比较喜欢的这个模板, 这是应该他来干的一个活,而不是他就直接给我生成。他最应该给我干的是生成一个框架,这个币币还有点用,那还可以。 那那行,这里又涉及到一个成本的计算问题,就因为我用的都是这个 cloud 的 api, 相当于是 api 你 连接到这个语言模型,因为假如说我使用的时候,或者其他人使用的时候,不一定都在 cloud 的 这一个环境里跑,有可能在我其他的环境中去运行, 所以这时候就需要调用 api, 你 是知道的,它 api 它的价钱是比较贵的。这么一个流程我当时跑完了之后是 bcd 就 跑一个, 他花了我三毛,已经非常贵了。因为假如说你要是真使你头几个哭出哭出哭出你,你三个快一块了,那,那就非常恐怖。而且他跑了五分钟,跑一个,你自己打开官网,你投差不多也就五分钟, 那基本什么忙也没帮上,还贴了点钱。所以如果要是涉及到非常复杂的决策, 比如说在这里面什么是复杂的决策,就先拿错的举例,你要是模拟面试官这种很多元大量的信息进行整合的时候,既需要推理又需要判断, 这时候你可以调用这种比较厉害的模型,你可以用 cloud, 但是其他的假如说你就生成一个具体的东西,比如说你让他给你弄个 samurai 这种,你用个两个小模型,比如说 什么千问或者 deepsea 都是可以的。但是你使用不同的 api 模型,在结构上又有不同,所以那可能又是需要考虑的其他工程问题。在串联你所有的 agent 之间会发生一个什么 工程性的问题,差不多就这样。我还想说的一个问题是,其实这个 mini test 在 测测之前就已经发现了有一部分问题是什么,我已经调试过了, 你 a 帧跟 a 帧之间进行关联,比如说他的信息给他,这种情况又会涉及到很多的 架构工程问题,所以其实有的你可能看了很多的那些理论,但是你具体涉及到哪些问题,你要是不通过这种实践去发现,你是不可能说是理解他这个 ai 的 工程问题,只是只有你干了你才知道问题在哪。 我们来看一下我整理的在我这个 project 里会遇到哪些对应的工程问题,我麦是不没了吧吧? ok, 在 哪呢?我们来看一下这个就会涉及到一哪些具体的工程性问题。一是上下游就会污染, 这个指的是什么?假如说我这个 b 给到的这个东西, b 最终是采取了一个打分制,通过反馈这个东西给到 c, 但是 c 就 认为这个动这个 b 给的信息就是公里,这就很恐怖, 因为 b 说白了也是你大语言模型给出来的一个答案,那这个答案不一定是一定是对的,但是 c 要是默认他是对的,那到 d, d 就 默认 c 跟 b 都是对的, 那可能源头源头错了,那跟着剩下的所有的 a 阵的是不都是白白毛啊? 这个就问题就比较严重,上下游污染的这个东西,这个比较形象,就跟水一样,所以我们当时我已经跟他聊过,对于你源头就进行一个 assumption, 假设如果要是你做,比如说做五次 test, 四次都是这个 confidence, 就是 给出的这个值, 那他就可以去被继承,他的东西就可以给 c 式,反之是不他自己内部就要重新跑一下再做吗?这就是应对这个东西,你们相互之间写作的时候, 你要给他的一个架构,在他的系统里面给他输一个,你在自己默认去做一个这样的 test 来保证这个输出。但是如果你给的这个 front 太重,就是假如说可能人家我并没有, 我是一个比较简单的任务,然后你让我去做的更多,然后导致了我消耗的 token 更多,成本增加,那也是问题吗?所以这些很多东西就是你,你只有一次一次不断的试错,然后一次一次的检验,你才能知道你到底是哪出了问题, 否则就是纯纯在那白日做梦。这个差不多就是这样,然后具体挑几个比较清晰,简单易懂的去展示一下,剩下的可能我就单独再出一个具体的这个案例来讲,我看这个可不可以讲一下这个东西就是我之前涉及到的就是 你,你怎么去分辨什哪些事是人来做,哪些事是 ai 来做?这个是非常关键的。就比如说如果在我的设定里, c 生成的 cover letter 就是 剩 c 生成的寒暄的话 非常的假,然后这时候呢,一收到的信息是直接就给他发了,那这时候你 hr 看到之后会不会发现不是这人有个错的,再给人名打错了, 那,那糟了,这辈子应该是这个也不,也不用再多投了,然后自己都不知道自己怎么死的。所以就是这种假如说你在发送之前,你再检验一下内容的质量,是不只能人来做呀?所以这这时候涉及到的这个 自动发送就一定不对的吗?就肯定不能让他来自动,然后他的意思就是肯定他的意,他的更改方案就不适用于这次我做的 project 吗?他的意思是说比较简单的那些话时候你就就别发了。要是然后呢,假如说你衡量 简单与不简单,你再在他的系统内部里进行一个打分制吗?对吧?其实你看刚才 b 我 并没有要求到让他打分制吧,但是他最终给出的结果还是一个打分制。 ai 一 开始在给他们设置的时候,就相当于是学生教 老师教学生一样吗?就是假如说具体的工程性问题,就让他们打个分,对自己的回复满意度是多少?从零到一百差不多,就这样,相当于让你自己给自己做一个小考试,就就就提到了一个我认为最关键的点,是这个谝媚的这个效应,我一开始就犯了这个 问题,因为正如我提到我一开始通过这个思维导图来编制的我整个架构,但是呢, 我这个架构本身就是错的,但是你你如果要是不通过测试的话,你是不知道他哪有问题吗?而且呢,我已经跟 ai 进行过一个初步交流了,我说这个架构你可能认为哪有问题,然后呢?他说没问题,然后你就干就完了,然后这不干,然后出问题了,我说那每一个判断有的只能用的重心根本不对,然后还有的呢?可能我们需要用其他的方法, 那为什么你不能总结出来一套呢?我我我可能就会这么想,那是什么问题呢?是因为他根本就没往那方面想,你给出他这一个架构,他只会分析这个架构具体干的活有没有问题,他觉得 make sense, 假如说你这个人干这个挺清晰,这个人干这个,这个人干这个每一个都很清晰,他就会觉得没有问题。我们可能 在聊着聊的过程中会偏离一开始的这个主干道吗?这时候其实也就涉及到了你怎么去问这个 ai, 让它及时给你矫正回来吗?这其实说白了也是这个 放他一只妮儿硬的活,所以这个是非常重要的。我这里就就再提到一遍,这个东西大体上是这样,然后所以我们最终的 product 的 整改方案就变成了什么呢?原点方向是 a 抓取 b, summer c 生成新的简历,然后现在改成了一个什么,就是因为我在回顾的时候,我发现这个 a 阵 a 甚至都要改,因为 a 出现了一个什么问题, a 是 你在那个网站平台抓取到合适,就是适合你, 就匹配你目前状态的这个岗位嘛,但是本身就错了,比如说 seek 这种平台,而是很多不同的方案,你其实更应该探讨的是不同的 opportunity 去翻的 job, 而不是怎么样在平台上找到合适的工作。就是他把 所有的搜索范围一下变窄了吗?然后我才发现,这我就突然想到,所以这有些东西就是可能你改着改着你才知道方向在哪,所以他更应该成为的一个形式是 opportunity。 opportunity 就是 啊,这才应该是 a 真 a 一 开始干的目标,而不是机械性的从网站里找哪个 fit 要的是你如何去行使你决策权的层面, a 跟 b 就 应该变成什么呢?就应该变成 d 做的是决策,但是决策是需要人来的,所以 d 应该改成我觉得这家公司差不多可以,或者这家公司 哪些方面我没做到,我来制定一个 study plan 去 fit, 我 的 job requirement 就是 我的这个工作的这个前提条件,然后 c 变成什么? c 变成了简历模板, 然后具体简历怎么制定是不可以根据 b 来制定,就是他们的企业文化是不可以根据这个来,然后再根据你原本的这个简历, 结合 c 的 专业模式, ai 为重,是吧?用你自己的话术参数一遍这个才是最合理的,因为一开始的目的应该就是让你的这个转化率提高,但是 弄着弄着就变成了,怎样让他效率最高吗?但是后来发现呢?如果你要是想使他效率更高,一是你会发,发现就是风控的问题,就是风险有问题。二是你会发现这会导致你很多的投递变得并不精准。 三是你没法让 ai 来代替你的决策权,对吧?他只是给一个大概的方向,他怎么知道?然后还有一个比较重要的点是 pipeline 和 agent 的 区别,这个这个的本质区别是,如果我要是使用 agent 的 话, 我更倾向于是一个动态的,假如说我进行市场观察, 然后呢,它每天市场的数据都在更新,这时候我要用 agent, 因为我能每次在使用这个大语言模型的时候,比如说我用 api, 就是 从那个用那个钥匙去连接,我能及时更新到动态变化 现有的数据,然后根据实时的语言模型来给出我反馈决策。但是 pieplan 是 什么呢? 他是给定了具体的 prompt 是 什么,我给他一个规范,然后呢他给我产出结果,所以呢,他的结构会更具体,更整齐,错误率会更低。 它由于是即时生成的,它每次结构都是不一样,所以它的数据处理可能会比较松散,但是它能更新实时数据,但是它的数据或者它生成的内容永远都是定死的。这个观点是,也是我在打造这个召北 a 阵,他比如说你每次我这个 a 阵 b, 我 干的是不是就是一个固定的事?就是我找了这个页面 summarize, 对 吧?这是一个固定的事, 那你要是用 a 阵,他每次都用他来调动一个动态的事,那你这里的成本是不是就会直线上升?这是其一。其二是你每次输出的结构都不一样,那就会导致在用的时候那肯定变化就比较多呀?但是这只需要一个 一个固定的一个产出结果,所以这些都是这个只有自己一点点测才知道的一些信息。然后后面就是我的一些这个工程结构,然后的话大体上就是这,这就是通过一次实践 就是展开了很多的东西吧,可以说就是包括你产品的打造,你需要怎么样的去判断边界,就比如说你什么时候, 什么时候是应该人来判断,什么时候应该 ai 来自己弄,对吧?这是其一。其二是什么时候用这个 plan, 什么时候用 agent, 对 吧? 还有就是什么时候你去用具体的提示词工程,对吧?根据不同的任务,你是不是还分具体的提示工词工程?你 a 阵的架构是不是又是一个问题?就是 就是真给你们展示,比如说你们两个 a 阵有不同的提示模板吗?然后上下有污染这种问题, a 阵 a 阵触及之间又有问题,然后这个问题你怎么做呢?你还得用一个新的 test 对 吧?而不是说, 哦原来歪不抠腚这么简单,我随便讲两句话给我出货了,你说这事闹的,那人人都是这个老老 dear 了,那我的天呐,那确确实那这个学了十几年二十几年的那程序员那真是 那那那真是哭死了。所以这些架构的东西还是比较重要的,但是别就在那听,光在那听又又长脑子了, i can do all things 就 像过去的我一样,我的天呐,然后后来发现这个 what a fucking joke, 然后具体这一个更新的更新的 architecture 我 还会再跑遍做测试,但是你实践之后得出来的这个对于系统性 ai, ai 的 理解,不管是题日词的理解,还是工程架构的理解, 还是成本问题的理解,还有产品思维搭建的理解,是不全都是一次刷新,所以这个多干多干,然后没别的,基本就是这次的分享,我人这个这个脑型,我的天呐,一点形象没有。
粉丝185获赞1623

一条视频教会你扣子工作流搭建的完整视频,本视频共计三十七分钟。在百度里头我们去搜索扣子两个字,我们搜到第一个就是我们把这个功能拉到最右侧,我们可以看到这个有三个功能,一个是扣子空间,是扣子 推出来的通用智能题,扣子编程对应的之前呢扣子的开发的平台,他这个名字改掉了对这个扣子的罗盘,那我们主要是用到扣子编程,也就是扣子开发平台。第二个功能好,我们直接打开扣子编程好, 点进去之后,我们直接就来到了什么扣子开发平台的一个界面,我们直接在这个页面,我们直接打开左侧这个菜单,资源库这个菜单。 好,在这里大家可以看到这都是我们之前创建好的一些工这个工作流的一些列表,当然这里边不单单有这个工作流,你还可以有这个插件,包括知识库,这个提示词以及数据库等等,总之是各种各样的资源全部在这个资源库里边。 好,那我们接下来我们就在资源库页面的右上角,这有一个资源的按钮,我们直接点击把它打开,这里边有各种各样的,你可以创建插件,工作流、对话流等等知识库。好,在这里我们是创建一个工作流。好,我们直接点击它。 好,那在创建之前给他起个名字。好,那我们今天就给大家以自媒体这个行业为例,这个名字没有什么特别的要求,比如说我们就用汉语拼音,有些朋友说我这个英文不太好,那就用汉语拼音,你看我就起的是自媒体这三个字的这个拼音。好, 没问题,我们加一个工作流。好,这个名字就大概就这样就行了啊,当然不能,不能是中文的好,工作流的描述,你这个工作流是干什么的,你就用你的大白话把它说清楚,说清楚就可以了。好,在这里我们的工作流就是我们想根据用户输入的主题, 也就是说用户输入什么主题,我们来去生成相应的文案,因为我们是做自媒体的内容啊,以及这个图片和什么 和相应的这个视频。好,那我们是今天去做生成自媒体素材内容的这么一个工作流。好,那这样我们的名称跟描述就写好了。之后我们直接点击右下角确认的按钮,我们直接点击右下角确认的按钮。好, 来到这一步,来,咱们直播间的各位朋友有没有问题?这样我们就直接进入到了对创建搭建这个工作流的页面这个界面了。好,大家可以看到这里有有,只有开始和结束这两个默认的一个节点, 到这步我相信大家应该都没有问题。来,大家有没有问题,我们把我这个工作流,大家可能不太好理解,你就把它想象成咱们工厂的流水线。好,我们去扮演工厂的厂长, 你要做的任务是什么?来,去招人,雇这个员工来为你去干活。把人雇进来之后,你要给他培训,再去给他分配任务, 你这些招进来的员工都是你的 ai 的 员工,让 ai 来为我们来进行干嘛?帮我们来自动化的去干活,替我们去干活。既然是这样,那我们就可以根据我们的今天的这个需求是什么? 首先我们去要去创建一个什么,对,创建一个这个我们是讲根据这个主题,我们根据这个主题去生成相应的什么 文案、图片以及视频。好,那我们就去先去添加一个什么帮我们去写文案的这么一个员工, ai 的 员工,好,那我们 大家可能去想到写文案,是不是我们要去添加这个,比如像大模型 deepsea, 我 们就把大模型的节点添加进来, 这个大模型的节点就是帮我们去生成文字的内容,也就是我们今天的一号员工,我们来给他稍微编排一下,改个名字,点击这个三个点,在这重命名一下,他就是今天的一号员工。把,我们是干嘛的?把,我们去 对写文案的生成文案。好,我们先不着急来对他进行一个配置,作为厂长,我们先把所需要的岗位,这个员工我们都先招进来。 好,那我们接下来我们要去招什么?我们是不是要招第二个我们的员工就帮我们去生成图片了,那怎么去招?我们在一号跟结束的节点这个连线的中间,我们这他是不是有一个加号的按钮? 我们点击这个加号的按钮。好,他是不是又弹出这个界面了?那这个你可以把它想象成就是一个工具箱扣子给我们提供的各种各样的工具模块节点都在这个工具箱里边。好,那我们往下滑,我们既然要去升图片,我们在这里是不是有一个图像生成的 这个功能?好,我们直接把这个图像生成对这个节点来给他添加进来,那他就是我们今天的什么,相当于是我们二号机器人的一个员工,就是我们的,我们同样给他改个名字,他就是我们的今天招进的二号员工,好,那就是帮我们去生成图片, 那接下来我们是吧?我们第三个需求是什么来的?我们第三个需求有了这个文案,有了这个图片,第三个是我们要去生成一个视频,最终的视频。所以在我们二号员工跟结束的节点中间,我们再去干嘛?再去添加一个员工,帮我们专门去生成视频。好,我们直接点击加号按钮, 又弹出这个界面了,所以大家看到没有,你,你,你如果只需要去添加各种要去加,去添加 ai 的 员工帮你去干活,你都是需要跟这个界面去打交道,这里边有各种各样的, 我们都可以认为它是,你认为它是工具也好,或者说功能模块也好,我们 ai 的 员工,好,那在这里我们就找到在音频视频处理这个区域。好,这有个生成视频的这么一个员工,我们把它添加进来。好,点击你的鼠标左键。好, 那这样我们就把他加进来了,我们就给他改个名字。好,我们继续,这个就是我们的三号。等员工。好,帮我们去生成什么生成视频的。 好,那到这你作为厂长觉得就是我们的这个人今天着齐了。好,接下来你要干嘛了?对,接下来你要去对他进行培训,分配任务,给他 进行一个执行,帮你去完成最终的一个任务,这样我们整个的工作流他就可以帮我们去自动干活了,我们最终为了达到这么一个目的,最终的目的就是能够帮我们自动干活,帮我们去自动去根据用户的主题去写完啊,生成图片,生成相应的视频。 那接下来我们就要对他来进行训培训,就跟我们这个公司招人之后,给他培训之后才能上岗一样的道理。好,那我首先我们就来对我们的第一个 爱的员工来进一个培训,我们选中打开它之后,这是它的整个大模型的一个配置界面,我们简单的来看一下,大家都知道大模型是什么?大模型,包括我们今天的搭的智能体工作流来,大家有知道的吗?有不知道的扣零好不好?知道的扣一, 那我就快速的去过一下给大家。大模型是什么?大模型就是我们用的这个像豆包、 d、 p、 c, 什么 k 密,包括大漂亮的 g、 b、 t, 这个都属于大模型。 那大模型它主要的工作主要是帮我们干嘛?帮我们去生成文字的一些内容,比如说你去写个文案,写个短视频脚本啊,去写个报告,写个总结,它主要是帮我们去做文字方面的一些工作。好,那我们的智能体是什么?智能体 它就不一样了,智能体你可以把它想象成既有这个大脑,又有这个手和脚,那大脑就是我们刚刚说的大模型,就可以充当为它的大脑, 那手和脚就能帮助我们来把这些具体的一些问题进行落地。比如说你要去写一个,生成一个具体的 ppt, 或者说需要剪辑某些视频,或者你要生成一个表格文件,什么 word 文件,像类似的这种的好, 那我们就可以通过这样的一个智能体来帮我们去实现,帮我们去生成这样类似的一个文件。当然我只是捡了一些简单的一些例子,当然他智能可以帮我们做很多事情,而且在各行各业,在各种各种场景都可以帮我们去完成相应的一些解决,我们完成相应的一些工作,帮我们解决一些问题。 说到大模型智能体,那工作流又是什么?工作流,我刚才说了工作流,我们现在搭建的就是工作流,工作流就是你的业务的核心逻辑,都是搭在工作流里边, 有了这个工作流,你好比是什么?就是帮助咱们的智能体去实现一个具体去解决这个问题。来去就说为什么 大家总说大模型不能去落地,他能给你很好的创意,给你很好的一些点子,但是你要想让他去生成,比如说某一个文件, ppt 文件他是不是做不到?或者说把你想生成某一个 某一个 word 文件等等,是不是做不到?他只能把你先生成文字的内容?好,你要生成 ppt 文件这种的好,那就需要我们干嘛对第三方的一个去搭建这样的一个工作流来实现。 好,那以上给大家就是简单的介绍了一下这个智能体大模型,包括工作流的它的概念,那我们还是回归到我们的正题这块,我们的这个大模型的一个配置,那我们在这里其实大家 来看这里边有很多模型的选择,豆包的,包括 deepsea 的 豆包的,大家都知道豆包的也是我们自结旗下的,扣子就是自结旗下的,它是一个生态的系统。好,那我们如果选用, 比如说你要豆包,其实我们用豆包一点五三十二 k 这个 pro 三十二 k, 它这个啊其实挺好用的,而且它的速度很快,我一般演示都会去用它。好,如果你想想写的更好一点的一些文案,你可以用一些深度思考的一些这个模型,像豆包的一点六这种的深度思考,或者说 deepsafe 有 r 一 的模型, 都是一些深度思考的一些模型,包括第四个 v 三点一这种的都是深度思考的。好,那我们就用这个一点五 pro 三十二 k 足够用了。好,那接下来我们再去配置一下这个输入。好,输入是什么呢?大家注意看好输入,包括还有这个输出, 我们添加的这些模块与这些节点,所有的 ai 的 这些员工啊,都有输入和输出,看到没有?好,包括我们的三号员工也是有输入输出,所以我们的每一个 ai 的 员工啊,输入和输出是 共同的一个特点。好,那大家可能对于输入输出啊,没有学过基础的,或者说没有搞过这些可能不太好理解。确实,那我们怎么去理解他。好, 我在这给大家举个简单的例子,比如说我们把输入这里,我们就把它想象成是输入的这个材料通过我们加工, 加工之后输出的是什么,输出的就是他的一个成品。那我们在这里,比如你现在要做一个蛋糕,我们在这里输入的蛋糕的这个原材料,包括有这个蛋糕的批子,什么牛奶、奶酪,还有水果等等,这些就属于我输入的这个变量,你就把这个变量 底座是我要输入的一个原材料,因为你去想这个变量不太好理解。好,那我们输出的是什么?输出的就是我这个蛋糕做出来一个这个蛋糕。好, 我相信大家这样答案应该就很好理解了。那我们在这里输入的就是什么,我们打开我们的这个小齿轮配置按钮,然后在这里开始这个节点,有一个,你会看到有一个 input 输这个变量。 好,当然这个音符的变量就是我们开始节点的这个变量,你可以给他改个名字,咱们刚才忘了改名字,这个名字是可以改的, 你可以用汉语拼音,比如说我这里是接收到用户输入的这个主题,对不对?好,那这个主题我给他改了一个汉语拼的名字,这不是英文单词,就是主题汉语拼音。好,我们又回到一号员工,我们再去打开输入的配置,再开始这个节点,你就会看到是不是不是有一个主题的变量? 好,那我们直接把它配置进来,点击你的鼠标左键,把这个变量的名字,我们同样可以改成汉语拼音这个主题。没关系,我们不懂英文也可以去学,因为很多确实英文基础不好。他说你这个能不能写,其实这个名字真的没有那么重要,你哪怕就写一个 a 也行,能理解吗?你就写一个 a、 a、 b、 c、 d 都可以,你只要说你能够知道它是代表什么意思就可以了。那我们现在有了输入的主题,因为我们现在就一个,对不对?就一个主题,就是用户输入的这个主题我们已经配置好了,当然如果你有多个这个变量,也就是说你要输入多个原材料的时候,你就可以呢 添加多个这个变量,答案能理解好,当然我们现在就一个,接下来我们就来到了我们的提示词的一个书写, 我们就来到了一个提示词的书写好,那提示词在这里我想跟大家说一下,非常重要。如果你说整个的我们工作流这些工作模块,大模型这个节点可以说是所有这个模块里头最重要的,对不对? 大模型就是我们用的 deepsea 豆包好,那我们的提示词可以说是重中之重,为什么?因为你看你不管你在用这个 deepsea, 也要用豆包也好,你在平时在网页当去用,或者说你下载到手机里的 app 去用的时候,你是不是要去提问 好?你提的这个问题其实就是在写这个提示词,也就是说你你提问的这个好坏,你也就说你写这个提示词的好坏,决定了什么?决定了这些大模型,决定了 deepsea 也好,豆包也好,给你输出的一个答案的质量的高低好坏, 大家能理解。所以那有些朋友就说我用 deepsea, 用豆包舀,或者说用用用,用国外的那些也好,我为什么同样的这个大模型,我为什么有的别人为什么能输出很好的一个结果?我用起来为什么总感觉它傻傻的,或者说不好用? 你要去审视一下是不是你写的这个问题,写的这个提示词,提问的这个问题不是很好,所以对不对? 所以他给你出来的结果也就天差地别了,这个就差距非常大,模型是一样的模型,但是你提问的好坏这个非常重要。好,那接下来我来带着大家去简单的手搓一个提示词。 首先你写这个提示词,你可以给他先定一个角色,你是谁?你扮演一个什么角色好,要干什么?要干什么?好,达到什么目的? 整个有什么要求?好,把这个两点写清楚就可以了。这个其实就是对大家去提问的一个简单的一个要求,当然有时候你,你扮演什么角色都可以忽略掉。好,那比如我现在跟大家去说一下,比如说我现在告诉大家,你是一个告诉大魔镜,你是一个优秀的 文案写作专家。好,你需要帮我去用户输入的主题,是不是用户输的主题?帮我 根据用户输入的主机去写生成文案。什么生成文案和什么?对,和,我们需要生成图片,但是是不是大模型不能直接给你生成图片?打 excel 包括这个,他能给你生成图片吗?不能吧?好,那我们再生成图片,我们需要让大模型生成。什么 生成叫做帮我去生成图片的描述提示词,对不对?好,提示词好,和什么?和我们对吧? 三号员工,我们需要的是什么?视频的什么动作提示词好,视频的动作提示词 好,他,对吧?你,你们就记住大模型,他可以帮你生成各种文字的内容,各种文字的内容,对吧?好,就是你,你去让他帮你去做。好,那这里你看我这么一句话,是不是 这么一句话,是不是交代了你是谁?然后呢?要干什么?帮我去干什么,对吧?说,说的很清楚,就通过这一句大白话就可以了。好,我把他删掉,那在这里,其实这个题的词他就能够帮你去做这件事了。 已经可以了,但是有些有些同学这个也太简单了吧,对吧?太简单了。好,然后有些同学说,我能不能让他优化一下变得更好呢?当然可以。好,怎么去做?怎么去做。 各位啊,很简单,很简单。来,我们稍微看一下,我往这边挪一点。好,你们可以看到,其实扣子给我们已经提供了,在这里是不是有一个这个什么? 有一个什么,对吧?在这最右侧有一个按钮,叫做可以优化这个提示词。可以优化。好,我们直接点击这个按钮,自动优化提示词,他就会针对我们写的这段什么这段提示词来进行一个优化。好, 你看我们就点击第一个。好,我们稍微等一下,你看。所以大家你看到没有?你需要做到的就是把你这个想要干什么表达清楚了,你不会优化,没有关系,交给 ai, 让 ai 帮你去优化,帮你去写。 已经写完了,大家看没有?我们来看一下他优化的一个结果。好,这个就是角色,你是一位,对吧?专业的多类型内容生成专家,看到没有?他帮我改了, 我刚才说的是文案生成专家,为什么他现在改掉了呢?你看他把我就优化了。多内容生成专家,因为他不光光是帮我们去写文案,他还要帮我们去生成提示词,对不对?生成图片的那个描述提示词和和什么?和视频的动作提示词,对吧?好, 你看没有,根据用户书的这个具体主题精准生成文案、图片提示词以及视频的动作提示词,对吧?擅长结合不同的场景需求来调整内容的这个风格和细节。好,这就是一个角色比我写的好,对吧?优化的比我写的好,对吧?好,来,技能,你看 三个技能应该对应的就是文案生成,第二个技能在哪?图片的一个提示词生成,对吧?在这里,然后呢?第三个是什么?视频的动作提示词?这么长,看到没有?好,最后是限制好, 我觉得写的非常不错啊,我们直接点击你,你觉得不错,你直接只需要去点击这个替换的按钮,好,他就会帮你,对吧?把原来的那个替换掉用,对吧?用他帮你生成的一个提示词,看到没有?我们两句话,人家给我优化生成了这么长的一段提示词,够不够专业?各位, 所以大家一定要擅长利用 ai 帮你去做事,对吧?你只需要把你的需求提出来,用大白话讲,讲清楚,一定要讲清楚,好,让 ai 帮你去优化,大家一定要擅长去做这件事,对,好, 没问题吧?好,那我们这个第一个,大家看到我们的这个系统提示词,我们就写完了。好,那用户提示词又是什么呢?用户提示词其实很简单,其实就是这个用书的这个变量,也就是我们输入的这个原材料,对吧?输入这个原材料,你把它写进去,写到哪呢?写到这里, 好,怎么写?摁住键盘的 shift 键,在键盘的左下角,左下角,好,然后打出大括号,它就会自动弹出这个变量,然后呢,你去点击左键,好,这样我们就引用成功了,就引用成功了,当然我们还要跟大家说一下, 其实用户的这个提示词,你可以把这个变量这个主题可以放到系统提示里边,这个是都是可以的,对吧?都是没有问题的,你这里用户提示词可以是空的,当然我们放到这里我们这样写是一个比较规范的标准的一个写法。好吧? 好,那我们这样就整个的我们的这个提示词就配置完了。好,接下来我们整个大模型的配置还没有完,还没有完。好,我们对,我们来到了我们的什么? 对,输出这部分,输出这部分。好,你既然,对吧?你,你输入有了中间加工,其实提着词就是来去帮你加工的,对吧?帮你去加工的整个过程就是提着词的一个能力。好,最后输出的结果是在哪?在这你要把你加工, 对吧?把这个原材料加工之后的一个成品产品输出出来。好在这大家是不是这样的话,是不是就通俗易懂了?我相信大家应该就能够很好的去理解这件事了。好,我们怎么输出呢? 大家记住,你看我们这里边是不是有三个不同的技能,也就是三个不同的任务,所以你输出的结果他一定是三个,哪三个呢?文案 对吧?然后这个是什么图片提示词,这个是什么视频的动作提示词。好,是不是这三个?那因此我们输出的结果他也是三个,他也是三个。好,我们点击这个加号的按钮, 我们点击这个加号的按钮,来再去添加两个变量。好,是不是添加了一共三个输出的一个变量,三个一个输出的变量, 好吧?好,来,我们来给他进行一个命名,这个名字输入变量其实也是跟你的输入那个名字输入输入变量去写输入变量,这个名字的规则是一样的,对吧?英文的字母或者是什么, 对,或者是这个汉语拼音就可以,好,那我们第一个就写文案,大家发现没有?我全是写的什么,我全是写的这个,这个,这个汉语拼音,汉语拼音,所以大家这个不要担心说我不懂英文,能不能去学,可以,对吧?没问题吧? ok, 好, 来,然后呢我们备注一下啊,点开这个箭头按钮,我们在这里要去添加一个备注什么呢?这就是我们的文案, 然后呢在这我们去写一个什么呢?第二个输出的边上就是我们的什么图片提示词,图片, 对吧?图片提示词,好,那这个就是我们的图片提示词,对吧?图片提示词,好。第三个就是我们的视频,对吧?我们照样还是写的是汉语拼音,好,那这个就是我们的视频提示词, ok, 好,到这里我们的三个输出变量我们就搞定了,就搞定了整个整个我们一号员工大模型这个员工我们就配置完了,一号员工我们就培训完了,我们花了将近半个小时的时间在这个上面, 为什么?因为我我们觉得整个的工作流的搭建,智能体的搭建,其实我们最需要去研究的,最需要琢磨的就是大模型,我们应该花更多的这个精力在上面去好好研究它, 对吧?因为你们很多的结果都是跟他的输出的结果是相关的,对吧?你后面比如说你的提示词,你生成的图片的好坏,包括生成视频的好坏,都是跟你的大模型输出的这个结果息息相关, 大家能理解吧?对吧?因为你,你,你后面不管生成图片是根据你的这个提示词,对吧?你提示词生成的好坏,对吧?决定了你视频生成的一个好坏, 大家能理解了吧?所以你看没有他,他这个他的这个重要性不言而喻,所以我们花的时间就比较久一点,我们讲的细一点,让大家能够更清楚, 来,我们继续,那我们现在有了,对吧?一号这个大模型的这个员工,有了一号大模型的这个员工之后,接下来我们来进行,对吧?我们,对吧?第二个员工就是我们的这个生成图片,生成图片 我们直接打开选中我们的二号员工,我们来对他来进一个配置,来对他进一个配置。好,大家会发现,那我们的二号员工就是我们的生图的,首先我们去选择我们的生图模型,首先我们去选择我们的生图模型。 啊,那我们的这个深图模型,那个墨雨,墨雨,墨雨爱这个伙伴,刚才我说这个大模型这块能,这个就把你刚才没有看到,能理解吧,对吧?就是你,你这么长的这一段话怎么来的?应该能理解了吧? 点这个自动优化提示词帮你去转化的,你,你首先得得要把你那个,对吧?你想干什么表达清楚了,说明白了,然后呢去优化一下就可以了,好吧?来, 好,那我们首先去选择一个生图的模型,那在这里呢?这里头这个模型跟我们这个刚刚一号员工的那个大圆模型就不太一样了,刚刚是 deepsea 豆包是什么?对,是帮我们去生成文字类的这些模型,对不对? 好,那我们在这里这一个是什么?这个是帮我们去生成这个图片的生成图片的,所以这些都是生图的模型,我这里我一般就是用这个通用 pro, 我 一般比较喜欢用通用 pro, 一个是它生成的效果 还非常不错,而且它的性价比非常好,价,价格比较低,对吧?好,我们就选用它,然后呢我们再去这个选一个比例,我们就选一个九比十六吧,对吧?这种竖屏的一个比例,如果你要选横屏的,你要选横屏,你就,你就用这个十六比九,用十六比九,好吗?对, 好,我们这里选择一个九比十六,然后呢把生成的这个质量拉高一点,拉高一点。好,好, 对,拉的越高,你生成的这个图片质量肯定会越高,肯定会越高,对吧?当然你生成那个时间也会也会变长, 好吧,好,那在这里呢,我们继续往下配置参考图,这里我们没有用到,我们没有参考图,就是说什么呢?就是说你添加就把根据你你的这个图片来去生成另外一张图片,就是图身图的一个功能,我们这里没有用到,我们用的是什么纹身图,对吧? 好,通过输入的文字来去生成图片,所以我们在这里输入这块,对吧?我们要添加一个什么?点击这个加号的按钮去添加一个, 对吧?添加这么一个变量,那这个变量就是我刚刚说的,对吧?输入的这个原材料,对吧?输入的这个原材料,我们来对它进行一个配置,我们来对它进行一个配置。好,怎么配? 很简单,点击这个小齿轮的按钮,点击这个小齿轮的按钮,好,我们对吧?可以看到开始和几这个一号员工,我们直接打开我们的一号员工的什么这个, 对吧?你可以看到有三个输出的这个输出的这个这个变量,一个是什么文案,然后第二个是图片的提示词,对吧?第三个是什么视频的这个动作提示词。好,来大家这个跟我互动一下,来,我们这里需要配置哪个? 需要配置哪个?可以在公屏上打出来配置哪个,是不是配置第二个呀?图片的提示, ok, 好, 我们直接选中我们的二号,这样我们就拿到了这个,对吧?拿到了这个图片提示词, 我们直接在这里进行一个引用,在正向提示词这里进行一个引用。好,怎么引用?好?摁住 shift 键, 然后呢?是不是就打弹出这个大括号了,摁住 shift 键打这个大括号,就会弹出这个变量。好,我们把这个对吧弹出的这个图片这个给他引用到这里,点击左键,好,那我们就这里就拿到了,对吧?就拿到了这个图片的提着词, 好,然后他就可以,对吧按着这个提着词,根据这个对吧给到大模型,让大模型按着这个提着词去生成图片了,就生成图片了。好, 到这里来到这里咱们的整个的深图的配置就搞定了,我们继续,我们来对我们的三号员工,帮我们深视频的这个员工来进行一个什么呢?来进一个配置了。好,大家可以看到这个就是我们的这个深视频的一个员工,对吧? 你会发现三号的这个圆框有两个,一个是什么?一个是这个两个一个是纹身视频,一个是图身视频,对吧?好,纹身视频什么意思?顾名思义,通过文字的描述,对吧?来直接去生成视频,好,那它的优点就是因为 文字描述他都是比较什么比较随意,就比较有创意,对吧?比较有创意,所以他能够生成一些非常有创意的一些视频,对吧?非常这个天马行空的一些这个视频,这是他的一个优点,但是他的缺点是什么呢?他的缺点就是你可能需要通过大量的什么,大量的这个抽卡, 对吧?然后呢他会,对吧?因为因为什么呢?因为你生成这个你的文字的描述,他一定是这样的,他他 不稳定,对吧?好,对,你的这个文字的这个要求就会比较高,提示词的这个要求就会比较高。好,那我们的这个第二个图声视频呢?图声视频是干嘛的? 对,图声视频就是通过图片去生成这个相应的一个视频,那他就相对比较稳定,不需要你大量的抽卡,对不对?好,那我们尤其对于我们的这个新手,对吧?初学者来说,我们一般我们就直接选用图声视频, 这样的话会减少你大量的一个抽卡,对吧?它的概率就会大大提高。好,那我们选图中视频,我们来对它简单的一个配置。好,首先你看这是什么视频的生成模型, 对吧?我们直接打开它,好,这个模型又跟我们之前的那个又不太一样了,跟 deepsea 跟豆包,对吧?那是大语言模型,我们的二号员工是什么呢?生成图片,我们选择的那叫什么?那叫生图的模型。好,这里我们选择的是什么?我们选择的叫做视频生成模型,对吧?好,那它这个就简单,就两个, 就两个你需要做的,对吧?你就选其中一个,那这个是 light, 对 吧? light 模型,这个是什么? pro 模型,那这个就是 相对便宜点,对吧?那这个就是贵一点,深层的效果会比它好一点,这里我选择这个便宜点的。好,主要是给大家去演示啊,然后分辨率三个分辨率最高的幺零八零 p, 现在目前这块它最高就幺零八零 p, 然后四八零,对吧?七二零。好, 然后时常是一个只有两个,一个是五秒的,生成五秒的一个视频还有一个十秒的。好,来讲到这里呢,我给大家看一下我们官方升视频这个插件的这个成本是多少?然后大家自己去生成视频的时候,大家心里也有个数啊,你们去看一下他的一个升视频的一个成本还是比较, 对吧?高的生成幺零八零 p, 五秒钟的一个视频, light 模型是二十五万的一个 talk, 相当于多少呢?相当于是两块五,那 pro 模型相当于多少?三百六千三千六百个字样点就相当于三块六, 好吧,这是他的一个生成视频的一个成本。好,那我们现在选的这个,对吧?最低的这个要要求的一个最低的一个大概的成本是在五毛钱左右,五毛钱左右。 好,那我们这个就选完了之后我们来配置这个参考图片啊,参考图片,参考图片在这里呢,来,大家注意看我们的手帧图片,我们点开这个小齿轮的配置按钮,我们,对吧?我们去选择一下我们的二号员工,二号员工是什么呢?在这,对吧? 对,这个 date 就是 存的什么放的就是我们的这个,这个,这个,这个图片图片,对吧?好,我们把它配置给他。好,那这里呢?伪真跟参考图,对吧?咱没有,因为咱们就一个二号员工申图的,对吧? 好,所以我们这里没关系,我们这里可以不用去配,他,照样可以生成视频。当然如果你想进一个控制想生成的整个视频的这个生成的一个 结果,是按照你手针跟尾针去生成的一个这样的一个结果,你需要去这么控制的吗?你需要给他一个尾针的图片,对吧?那我们在这里有个手针就可以去生成了,让他让他去去根据自己的一个 大模型生成这个视视,生成视频,生成模型自己去发挥去生成,好吧?好,那 我们这个图片就配置完了,接下来我们要添加输入,这个输入是什么?对,输入的就是我们的视频的这个动作,也就是我们常说的运镜,你要让这个图片怎么动起来,怎么动?好,所以我们在这里添加一个输入,输入的就是我们说的什么运镜动作,提示词在哪? 从哪去拿,是不是我们的一号员工,对吧?我们的一号员工这里都有三个变量,前面两个我们已经用过了,对吧?一个是写文案的,一个是帮我们去生成图片体式词的。好,第三个是什么? 第三个就是我们需要的这个视频的动作体式词,也就是我们的这个运镜,对吧?让图片怎么去动?变成一个视频,好,我们去把它进一个配置。 ok, 好,我们点击左键给它进一个配置。好,那这样我们就拿到了什么?拿到了这个运镜,拿到了这个视频提示词,然后我们在哪?好,我们在哪?我们在这个提示词这个部分,我们在提示词这个部分, 我们直接把它引用进来。怎么引用?摁住 shift 键打出大括号,它就会自动弹出这个变量。好,我们把它引用到这里。好, ok, 把它引用到这里。好,这样我们就拿到了,我们就拿到了这个视频的这个动作提示词。好,他就会干嘛?就会结合这个图片给到这个生成视频的这个模型,帮我们去生成视频了, 帮我们去生成视频这个就是他整个配置的这些这些参数我们就配置完了,好吧?输出,输出这里我们不要配,不用配置了,输出他这有一个默认的固定的一个什么微丢的一个输出,他就是输出的是一个视频的一个 ui 地址,对吧?你点开他,你点开他就是你的这个视频了。 好,那这样我们整个的视频我们三号就配置完了。好,来,大家有问题,我们先跑一下吧,跑的过程当中我给大家回答一下大家的问题,好不好?来,因为跑正好需要这个工作,需要这个时间,我们正好边边边跑这个工作流,边给 边这个回答一下大家的问题。来结束的这个节点我们来配置一下,我们去比如说你要输出这个一号的这个文案,对吧? 然后呢你还可以输出其他的一些这个,比如说这个图片,你想输入出来,或者说最后的一个视频,你想输入视频这个微调,就是这个这个地址,视频的这个地址,好,这样我们整个的这个工作流就生成完了,就就就就就搭建完了啊,就搭建完了,好吧?好,我们搭建了,我们搭建了 快一个小时了,当然你如果真的自己去搭的话,可能五分钟,对吧?十分钟就搞定了,那我们主要给大家,对吧? 把中间的一些细节给大家讲的非常细。好,我们直接点击这个试运行来打给我一个主题,给我一个主题,我们让他,我们来跑一跑,对吧?我们搭了半天的工作轮,我们来跑一跑,看一下效果。然后呢对跑的过程当中我来给大家回答一下大家的问题, 大家有问题的可以把你们问题打在公屏上,我一会来给大家统一的去回复一下,来给我一个主题,有没有的?我们去生成一下看下结果。大家给我一个主题,有没有主题,随便随便,因为我们这个,我们这个不调不调,没有,是吧?没有,我自己写了一个,比如说这个 跳舞的古代,好,我们我们就这样,我们直接点击视频,行,我们来跑一下,好,跑的过程当中,然后大家这个我来回答一下大家的问题, 好,我们来看一下是不是一个一个,这个我写的是一个跳舞的女女子,对吧?这是一个跳舞的女子一个场景,他怎么为什么是这样的一个场景呢? 他一定是根据我的提词词走的,我们来看看一下他的提词词是什么就知道了。在这里是不是根据你的提词词去走的? 风格是国风,写实的风,对吧?主体一位穿着红色古装翩翩起舞的古代女子,对吧?场景是在古代的庭院中,石桌旁边,周围有盛开的花朵和随风摇曳的柳枝,是不是这个场景 是吧?好细节,女子的发丝随风飘动,群摆这个,这个飞扬。好,这是细节的一个描述啊。你再去看这张图片,是不是按照我们的提示词去生成的,没问题吧?一定是这样的,一定是这样的, 我们再来看一下视频。好,视频在哪?在这,我们再去看一下,点击他,然后呢去播放一下,看一下效果。五秒钟的,五秒钟的一个视频帮我们切了三个,三到四个这个分镜头,三到四个分镜头,所以 你看没有,他一定是根据你的这个运镜走的。视频的,这个提示词在哪?我们再去看一下。呃,他这个确实有点多了,在哪?在这 四个镜头跟我说的没错了,四个镜头,其实你这里可以给他限制一下,在你生成视频动作提置词的时候,你就说跟他说,对吧?五秒钟的这个视频,你就帮我生成两个分镜就行了,因为四个分镜明显的感觉到这个,你说五秒钟的这个切的太快了,大家能理解吧, 对吧?切的太快了,所以我们五秒钟要两个镜头就行了,两个镜头足够了,这个四个镜头就太快了,你看第一个镜头对吧?你看一下他运镜怎么走的?推,镜头从古代庭院大门推进,展现整个庭院的景色,最后聚焦在跳舞的这个女子身上, 是不是?大家回忆一下,是这样的,好。然后呢?镜头二是平移镜头跟女子这个舞动,展示他全身的一个动作和优美的舞姿,对吧?好。第三个镜头是固定的镜头,拍摄女子灵动的眼神和精致的妆容,对吧?好。第五四个镜头是 镜头拉远了,展示女子和周围环境的一个融合,最后定格的一个画面,画面定格好,我们来再看一下这个视频,对吧?我们再来看一下这个视频的一个效果,你们再去结合他的一个刚才的一个运镜,是不是?是不是按照我们的这个运镜啊?这这个四个运镜去生成的,你们去看一下,你看 是吧?特写,然后拉远定格,对吧?没,没问题吧?虽然他很快,他的这个效果很快,因为他就是这样吗?我他四个镜头吗?切的太快了,但是他是完全遵循什么? 遵循我们的这个提示词去生成的,对吧?生成自媒体这个素材内容的一个完整的,对吧?完整的一个工作流就答完了,大家不要看他简单,你把这几个模块学明白了,你后面做很多的一些这个这个自媒体生成自媒体内容的,其实 说白了什么呢?你就可以举一反三了,对吧?你就可以拿它来举一反三,或者说拿它来照猫画虎了。你把这个搭完了之后,你可以延伸出做很多很多其他的一些这个这些这些内容,可以的,好吧?比如说你在这个基础上, 对吧?你要,你要去加声音,加字幕,对吧?加其他各种什么元素可以了?好,这个视频,这个整个的工作流就给大家讲到这。

哈喽,大家好,我是抖音短视频脚本生成网站的管理员,因为这次我们上线的六点零版本更新特别巨大,所以我得专独的录一期视频,来给大家讲一下我们都更新什么内容。首先最明显的就是我们的对标账号换成对标视频, 因为之前的对标账号因为抖音官方的限制过于严格了,所以导致我们一些稍微小一点的账号,我们获取到信息都是错误的,要么要获取不到信息,导致这个功能现在是处于一个半废弃的状态,所以后面我们就直接移除了这个功能,切换成了全新的对标视频, 这是个全新页面,我们从上往下看,最醒目的就是这个,我们现在因为可以对标视频,所以说我们就增加了抖音视频的解析和下载的功能。好,我们来看一下具体如何使用,比如说我们想使用这个视频,我们只需要复制这个视频的链接, 粘贴到我们的输入框,点击解析和下载,我们稍等一下。好,我们现在弹出来之后有两个重要的弹框,第一个有两个重要的按钮,第一个按钮这个按钮是点击我们就可以把视频下载到本地,这就可以解决大家下视频的问题,而且我们下载下来的视频是完全没有任何水印的, 来看一下,你看这就是我是完全没有任何水印的一个视频啊,这样子大家就可以节约一个找下载短视频的这么一个工具了。第二个也是我们这个网站的优良传统啊,我们可以对这个视频进行特别深度的分析和拆解,我们来看一下这个 分析都有能分析出一点什么东西啊?我们稍等一下,然后他现在已经开始输出内容了,我们来看一下都能输出些什么内容。首先是一个视频概述,这是这零零后与 与餐饮创业者的个人 vlog, 是 探店品宣品牌视频,这是概述。这边还有台词, 有视觉的画面,就是用什么画面,包括暖光灯快速切换主要画面场景,包括拍摄手法,包括音乐音效,包括结构和节奏,你看我这个普通话 标签,还有包括创意的创作的建议,非常完整的一个视频的拆解,我们这个视频拆解可以精准到台词,可以精准到分镜表,是非常非常厉害的 视频拆解能力,目前没有任何一个智能体可以做到像我们一样如此详细的视频级别的拆解。 ok, 当然拆解了之后,那我们肯定要用,那我们拆解了之后,我们在这边会显示已分析,我们就保留在了我们的网站后台,那我们怎么使用?我们就在 脚本生成页面,因为我们去掉了对标账号,所以我们把同样的模块切换成了对标视频,用法其实非常简单,一模一样,我们打勾我们就可以直接使用。我们这边也切换成了对标视频,通过这个滑杆可以去调整,你去参考这条对标视频的一个比例, 和之前用对标账号是一模一样的,无非就是之前的数据是错误的,是不好的,而这次的数据是非常非常的详细,详细到连台词都能给你写出来, 这就是我们这个的最大更新,以后大家可以放弃掉所有的别人家的什么收费的下载,什么看一堆广告才能下载,在我们的网站就可以达到下载。 而且我们看这上面写的字不止不仅支持抖音,还支持大部分的国内平台,我们都可以进行截屏下载,所以如果说大家看到好的视频 不一定是抖音平台的,其他平台一样可以做到。这就是我们的六点零版本最大的一个更新,当然我们还做了很多的小更新,包括我们这个灵感按钮变得重过了,这个灵感按钮变得更可爱了,包括点击进去之后,我们点击生成, 因为之前很多人跟我说这个灵感生成的时间太长了,这个是因为我们需要在海量的知识中去做减举, 所以会比较长。那现在我们设置为我们是一个一个的输出,虽然说时长是一样的,但是大家可以快速的去看到第一条、第二条、第三量,这是一种流势输出,使用体验会更好,这也是花了很多的时间才能做到这样的一个效果,这是一个小的改进。 第三个改进就是我们对所有的大模型的输出内容又再次做了一次优化,输出的效果会更好。我们来看一下我们输出的效果, 我们点击比如使用这个内容,因为之前很多人就吐槽输出的内容太多太杂,其实很多内容用不到,所以说我们在 ai 输出之后, 精简了大量的内容,只保留最核心的东西,这上面内容是一模一样的。我们来看一下这个中脚本,我们只保留最最重要的东西,去掉大部分无用的输出内容,我们只保留第一个就是视频主题和核心观点 内容的结构文案脚本,因为有一个用户说他想要一个发布文案,甚至我们后面还增加了发布文案的功能,大家发短视频的时候,只要直接添加发布的文案就可以直接发布,这样子来讲就会更好用。这就是我们完整的 六点零,也是我们上线之后最大的一个版本更新的主要内容,其实主要的更新点就是一个下载能把视频下载下来。第二个可以解析,可以精确到具体的台词,具体的视频的风格手法,音乐结构标签和创作建议, 非常的精致,所以说之后大家写脚本效效果就会越来越好。之后我们会更新全新的功能, 欢迎大家多多关注,谢谢!对了,提一点,如果说大家想要联系我使用,可以私信我,如果说大家使用我这个网址了之后,如果说还想联系我,我们在这个通告栏里面,我们这边写了我的 这个就不能说,大家自己上网站上看就好了,需要可以加我,如果有好的方法,好的这个方案或者说出现什么 bug 给我提,我会给大家一定的奖励。好,我们就下次再见。

给大家介绍阿里的一篇专门训练智能体大模型的论文,他讲了一下只有八 b 的 一个小模型,那么他的工具调用能力也能超过二三五 b 的 通一千万三的这个模型,那么他这个论文里面用了一个叫双数据飞轮的这样一个设计,让 八 b 或者三十 b active 三 b 的 这个模型也能达到非常好的这样一个性能,那么他训练的成本大概需要十万条数据。他在这个论文里面给我们介绍了一下, 我们介绍这篇论文主要是给大家想了解一下它是怎么做到的,那为什么小模型也能做智能体,那么双数据飞轮它到底在做什么事?我们今天主要是这个三个问题,给大家来介绍一下这样一个模型。那首先我们还是先看一下它的问题的一个背景,在这个问题背景里面,它主要还是给大家介绍了目前工业界部署的这些 大模型,这种前沿的闭延模型,这个导致这个大模型去 要用智能体,它成本非常高。即使我们用这些开源的解决方案,像通一千万二三五 b 的 这个模型去帮他去做这种开源的模型,做智能体的替代方案。但是对于如果你要服务这个数以百万计的用户来讲, 那么这个计算成本依然是非常难以承受的。那么它最大的几个问题,第一个成本太高了,每调一次 gbt 五,它的成本可以是服务几千次的这个小模型的调用。第二个大模型延迟太长,而且第三个有很多任务,其实是不需要这么强的这个模型的,它是不需要 他这篇论文主要是给我们介绍了目前的这样的一个解决方案,他在论文里面也讲了一下他们的主要的贡献,就三个贡献。第一个专门针对工具调用,他训练了一个小模型,目前他也是在通一千份系列上面八币和三十币的这个两个模型性能非常好,达到了这个大模型的能力。 第二个他是提出了一种叫双数据飞轮的这种训练方式,那么我们会给大家来介绍一种叫双数据飞轮的这种训练方式,那么我们会给大家来介绍一种叫模型的能力。 第三个它主要是针对这个智能体的这样一个调用,通过叫推理强化和智能体强化两种强 化学习的方式去训练这种小模型,能够达到这个智能体模型的这样一个能力。好,首先我们看一下它的方法论,方法论的它的整体架构,我们给大家看一下。首先它先做了一个叫推理的这样的一个强化学习,推理强化学习它的输入的数据源主要是三种,一个是欧米诺,一个是 to wiki pop q a, 还有 hot pot q a, 它主要是三个数据,通过三个数据的推理,它去找到这个小模型,它错误的这样的一些样本,收集一些错误推理的样本, 因因为它们这些数据样本里面有问题,也有正确答案的,如果这个模型推理出来,它跟正确答案不一样,那么它第一步就达拿到了这些推理的样本,通过这个推理的样本,通过 自我的 instruct 扩展添加一些约束条件和概念,他这个里面也讲了通过一个叫角色的注入,重写他的场景 去实现这样的一个训练的数据,训练数据也要通过一致性的过滤,他推理三次的一致性必须是一致的,确认为一个比较难的一个样本,所以他把一个错误的这样的一个样本 怎么转化成一个可以训练的比较难的这样一个样本,所以他这个方法还是比较好。那么他为什么要去训练这个推理 r l? 就 本质上来讲,我们在智能体的这样的一个模型当中,他非常重要的,他是要去根据他的 实际的场景要观测,要去看它到底要调用哪些工具,它这个推理能力要非常强的,所以它刚开始它就在训练这个模型的最基础的推理能力,你怎么根根据实际的场景能够正确的去找到你这个问题是怎么来解决的?这个是一个基础能力,这是第一部分。 那么第二部分它主要是训练智能体的 r l。 而本质上来讲训练什么,它主要去训练这个工具调用的能力,它就是根据不同的场景 去如何去准确地去调用这个工具,那么你看看它是怎么来训练的。那么第一部分它称之为线性的一个工作流,假设你这个模型的调用是 abc, 就是 query、 booking、 confirm 这个三种方式,它是没有分支的,那么它是一个主干道,你要去推理它, 看看他这个过程当中他要调什么样的工具,怎么样来使用,这个是一个没有分支的这样的一个 workflow, 他 首先要会调用贵了之后,他对这个行为数进行扩展,他跟你们讲了,他要对这个行为数进行扩展,他主要是在这个分支里面要增加一些 条件,或者是说一些扩展的一些东西。比如说他在查询他这个机票的时候,他会发现这个机票已经销售没了,那么这个时候他就要去搜索,比如说高铁票,或者是搜索附近的机场,如果他这个机票是有,那么他就走正常的 booking 的 这样的一个订阅的这样一个操作,所以他是 进一步的去提升他这个 workflow 的 执行的难度,那么这个还不够,他只是只是迭代了一次,那么他还需要继续再迭代,他要根据这个分支去反推,比如说他这里面说这个航班已经受请,或者是说我今天晚上必须到,他要根据这种情况要进行反推,他分支应该是怎么来处理? 可以把这个分支搞得更复杂,它等于是这样一一轮的,最后它还要做这种叫对抗生成,对抗生成它会根据实际的这样的一个情况,只说它这个里面讲学术办公室已经确认它,它要根据这样的一个生成对抗式的这样一个更复杂的 workflow, 它会有更多的这样一个分支 取这个工具的调用,它可以是慢慢的在这种复杂的情况下,模型也会学会复杂的这种工具的调用。这个是第二步,就是智能体工具,调用的就是智能体的强化学习,这一步也是非常重要,所以这张图 我们就称之为叫双数据飞轮的这样一个训练方式,这个训练方式在我之前那些其他论文当中是没有看到过的,一般我们认为强化学习只只要学习工具的调用方式就行了,把他原来调错的怎么告诉他怎么调对就行了,一般是这样的,但是这种方式他有一个弊,弊端就是你生成的这个数据生成会很麻烦, 它这种方式通过什么?通过已知的这样的一些数据,通过自我的这样的一个数据的行为数的扩展和分支的反推对抗的生成四个阶段去生成更复杂的工具的调用的 workflow 的 这种方式,产生更多的分分支,让模型去学会在复杂的情况下,你到底怎么样去调用这些工具啊? 这个是这个论文里面最有最有价值的这一部分,我们再来看看它的实验数据的解读这一部分,那你可以看到它是用公开的这个 g a u 杠二的半曲和 b f c l 杠 v 四的这样一个多轮的工具调用的这个两个评测,评测主要是在不同的领域,比如说在航空电信 retail 是 零售不同的领域里面它到底调用的能力,你可以看到它经过强化学习的八 b 的 这个模型和三十 b active 三 b 的 这个模型,它的能力是要超过达到甚至要超过原来的这些基础模型,它这个能力还是非常强的, 就算是通一千分三十二币的这个模型也达不到他最后的这个能力,这个也是一样的,四十七币这个平均得分是四十七分,这个是五十点二分,这个还是非常厉害。那这个两个模型里面我们会发现三十币的模型跟八币的模型能力是比较接近,那他是经过了一轮,三轮,你可以看到经过三轮的这种方式, 这个八臂的蜂纤维三八臂的这个模型他基本上要达到三十臂的能力。他在其他的工业的一些评测里面,你也可以看到他的也是不错,性能也是不错的,包括他消耗的时间也会更少,显著下显著下降,跟他原来的模型比起来,他的调用的时间也会更少。好, 那么我们再总结一下他的模型,他的这篇论文跟我们讲了,主要是证明了这个小模型也能做智能体,而且八 b 的 模型他也能达到四十七点四分,能力也会非常强。双数据飞人的关键是自动生成训练的数据,解决数据稀缺性的这样一个问题。 另外他通过两种强化学习的互补推理强化和智能体的强化学习,形成这个模型的一个完整的这样一个能力,这个是一个非常重要的一个,这篇论文里面讲的非常重要的一个方法论,那么他在这个里面训练的细节,他也是用 g r p o 的 这个算法,因为我们给大家介绍的会比较多,所以我们也不跟大家多讲了,这 也是 deep sea 原来发明的这样的一个强化学习的方法,在训练方法上面他没有太多的技巧,所以这篇论文可以跟我们讲一个最后的一个道理是什么?小木星不是不行,关键就是你要找对训练的方法,训训练的方法核心是要找到你这个数据是怎么合成出来的,这是关键,所以他这次论文里面讲的 双数数据飞轮的这样的一个训练小模型的一个方法,是一个非常重要的,它的训练方式也是用 g r p u 的 这种方式去进行训练。好,今天我们这样一篇论文就给大家就介绍到这儿,它这篇论文也提供了相应的一些 模型,我们可以看到它在它跟 face 上面,它提供了这些训练完成的模型,包括合成的数据,包括它也在 github 上面提供了这些合成 这些数据的这些代码,包括训练的模式,他基本上都提供了,你可以看到他这个里面数据合成他也是一样,他只是分了 两步方式,如果大家有兴趣也可以去看一下。这个项目应该来讲我觉得也是比较有价值的,特别是在企业级里面,我们要调用各种各样的企业级自己的这些工具,那么你怎么让这个小模型也具备这样一个能力?这个就这个方法,这个论文里面介绍的双数据飞轮的这个方法就会非常重要。好,那么今天我们这样一篇论文就给大家介绍到这。

装了 cloud 桌面端,但又用不起来,我猜你们八成是卡在这几个问题上的。今天一条视频我给你们讲的明明白白, 建议点赞关注加收藏,防止以后找不到哦!大家好,我是 win 好。 问题一,搜外部网址的时候直接报错,提示无法访问,这是为什么?这是最常见的问题,原因是 cloud 桌面端默认所指的外部网址的访问。 解决这个问题很简单,点击 developer, 点击 configure free party inference 侧边栏点击 sandbox and workspace, 然后找到 allow egress hose, 点击 allow all 保存重启,再进入对话框,然后你就发现可以访问外部的网址了。问题二,上传图片的时候 a i 完全读不 懂,这不是靠的桌面端的问题,是你用的模型不支持多模态,你得换一个能读的懂图的模型,国产模型里面通一千万字谱,还有 kimi 这几个都是支持识图的 deepseek 的 v 四,它的多模态已经在飞度测试了,相信在不久的将来可以用上。问题三, skills 到底怎么在 co work 上面用 skills, 你 们可以理解成为 ai 的 快捷指令,把你常用的提示词、流程打包成模板,然后一键调用,不用每次都重新写。那么在桌面端怎么使用 skill 呢?很简单,第一步, 添加 skill, 点击对挂框旁边的加号,选择 manager skills, 进入 skill 的 管理页,然后点击页面里的加号,选择 create skill, 然后点击 upload a skill, 把你从 skill 网站上下载好的压缩包拖进来, 它就会添加成功。第二步,使用 skill, 回到对话框,直接输入一个斜杠,会弹出你装好的 skill 列表,选中你要用的那个 skill, 再补上具体的提示词发送就可以使用了。第三步,删除 skill 还是进到 manage skill 的 页面,找到要删除的那个 skill, 点击右上角的那三个点,然后选中 uninstall, 就 可以卸 载干净了。这就是 skill 的 具体使用过程。问题是 cooke 模式和 co 的是开发模式, co work 默认跑在沙箱里面, skills 和 co 模式是隔离的,不会改坏你的电脑,写文档,做表格,处理图片这些小活 直接用 co work 来做。 co 的 模式直接跑在本地权限大,写代码,跑指令,提 gift, 相当于是 call co c i i 的 格式化操作台和 c i i 都是共用一套 skills 和配置的。办公选 co work, 写代码选 co 的 问题五,开了开发者模式,怎么退回正常登录模式呢? 如果你之前为了接第三方 a p i 开的开发者模式,现在想切回 entropic 的 账号登录,点击 app 左下角,然后点击 sign out, 等待 app 重启,重启后点击 sign into entropic, 就 可以切到账号登录了。点击 continue with gateway, 就 可以回到选择 gateway 和登录的页面。问题六,想同时配置不同厂商的模型怎么办?还是进入到我们的 configue free party inference, 点击 new configuration 命名之后还是和之前同样的操作。当你把这些问题都搞懂之后,靠的桌面端用起来就会丝滑 无比。想用 ai 提效,但又受不了靠的和 gpt 太贵,那几十块的国产大模型加靠的桌面端就是你最好的选 择,直接让你的办公效率翻倍。不会接靠的桌面端的话,可以翻我上一期的视频,后面我还会持续更新更多靠的桌面端的教程,关注我,不要错过。

给你们看一个非常恶心但又非常炸裂的东西,比如说我们随便找一个爆款视频分享复制好,首先我们打开电脑上的口播智能体, 打开智能视频学习视频链接,把刚才我们这个文案给复制粘贴进去,做一个一键仿写,我们一键生成语音, 一键生成口播视频,这边给大家一键生成标题关键词,最后自动生成字幕和 bgm, 大家看一下效果。 有没有一种东西,它不像芯片,光刻机什么的我们都知道,显而易见的被卡脖子这东西平时我们习以为常,可某天突然反应过来,最后生成完之后就是发布视频的发布,我们选一个登录好的视频号,然后点发布 来一键发布自己贴封面,封面已更新,直接视频描述,你看都是自己写的,键盘都没有动,都是自己在写。点发布,这边是发布中,你看这边发布已完成,看到没?就这么牛,我是不是把那些麦克的全部给得罪了?

现在我可以确定的是,未来不是高精尖的设计人员基本上全部失业。我现在给你们看一下,现在还没发布我们做的智能体生成出来的图片到底是一个什么效果?你们现在看见的这些图片并不是所谓的高级的设计人员, 包括所谓的高级的这个,这个有多少年经验的人,这就是我们公司最不懂 ai 的 人,用我们的这个智能体其中的一个模块设计出来的图片,而且也不会像网上说的那样,你得弄一一百多字的关键词,或者如何如何的这套东西,它就能设计。类似于这种东西, 包括电商的主图,包括你设计名片,设计这些东西,甚至于你跟你老婆或者你跟你老公的婚纱照,你都不用真实的去拍,你就把你俩的全身照片投上去,然后就会合成,你说吧,你想去哪都没有任何问题,而且极度高清,极度清晰,极度符合你的要求, 提示词你就正常说就行,我还不建议你太多。然后有的人又说了,你这个事豆包就能实现这个事,什么就能实现没有任何问题,同样的提示词,甚至你的提示词更多, 你看看它最后实现的结果是不是一样的,你现在可以把我展示出来这些图片,然后你去豆包设计,设计完之后你看它来的质感,设计感,包括所有的东西 一样不一样。你单说做图片的功能,现在基本上只要是行业从业者都能做到。现在所有的 ai 在 应用玩的是什么?玩的是谁做的更精, 谁做的更细,谁做的更屌。就好像有人说,英哥我选它到底能干嘛?最简单一个道理,你就这些东西,抛开编程,你挂到海鲜市场,十块钱做一张图片没有任何问题吧?就很便宜很便宜了吧?你现在就网上随便一找都得五十一百张,你就十块二十一张,设计的一定没有你好, 也一定没有你快,基本上十秒一个,十秒一个,他没事在家干干,简直一个月弄个三千两千的都不是问题吧?这就是为嘛我一直在强调,就大伙一定对 ai 有 一个正确的认知, 而不是说你能做图我也能做,你能做程序我也能做,最后真的是否能商用?真的最后是否能达到你要的效果?其实这个是最关键的一个问题,就好像摩托车比赛一样,你骑个狗屁兔子,他骑个张学摩托,就 这俩都能跑,但是你觉得结果会一样吗?但是趁现在百分之九十九的人还停留在枸杞兔子的那个阶段,如果你骑上张学摩托了,你们俩的起点可能是一样的,但你俩的终点一定不一样。

这是一期地毯式 codex 教程,如果你还在焦虑谁谁谁又用 codex 做出了什么无敌的应用或者自动化给自己干活了,那你务必看完本期教程,带你最全面的了解 codex 是 什么,它能干什么,并跟我一起实操完成。从 codex 下载 安装到个人网站、文档制作视频动效,自制工具等等等等,全面了解 codex 这个目前为止最强大最全面的个人 a 政策。 codex 的 界面现在我们来到了 codex 的 主界面,这个对话框你肯定很熟悉,对吧?但是你可以看到左边的这个边栏,就可以看到很多不一样的地方。 首先是上半部分,点击这里你可以快速创建一个新的对话框,快速完成一段与 codex 的 对话。这个搜索你可以同时使用 command g 来调出,快速搜索,你与它进行或者对话等等。现在你可以看到技能和插件这两个板块,这里可以说是 codex 的 一大精髓所在。再过来说, codex 是 一个集合了 chatbot, d e 浏览器,自动化工具等等等等的一个大一统的工作台,所以你可以给他安装插件, skill 以及创建自动化任务。这里的插件市场可以让你来随时扩展更多的功能。比方说这里的 computer use 和 browse use 在 我们后半部分的教程中就会用到这两个功能。 再往下看,可以看到项目和对话两个分栏。在项目中你可以点击添加新项目来将你创建好的文件夹给添加进来。在你创建好的文件夹右侧点击开始对话,你就可以创建出一个新的对话框,那么之后你们对话所有产出或者修改的文件,就会在这个文件夹中进行。 正常情况下, ai 如果直接操作电脑,风险会非常高。所以 codex 使用的是沙盒的逻辑,它相当于给 ai 开了一个单独的隔离小型开发环境,它可以在里面读代码,改代码,运行命令,执行测试,但默认是不能随便控制系统的。 在对话这里,你可以选择默认权限、自动审查、完全访问权限三种权限类型,让 codex 来执行还是非常安全的。再往下看,还有一个对话栏, 常用来进行一些临时产生的问题,当我用完,我就会点击右侧的这个归档按钮,把它给归档,那你也可以在设置你归档对话里面去给他找回来。 回到对话框,你可以在对话框中输入任意的问题,或者要执行的操作,比如帮我整理桌面上的这个文件夹里的发票,并统计这些发票总金额是多少,然后统计在一张 excel 表格中,你看很快他就跑完了。 现在我们来使用 codex 制作一个个人网站,首先在桌面上新建一个我网站的文件夹,然后回到 codex, 进入文件夹,点击这个加号,打开计划模式,这样 codex 就 会根据你给的需求,先开始计划他接下来要做些什么,等他计划完成了,他会给你一份详细的执行方案, 然后点击执行,这样就可以去干别的事情。一杯茶的功夫,你就可以等待你的网站。你可以点击右上角调出一个终端, 把它给你的命令复制一下,回车运行,你就可以在 codex 里面预览这个网站的效果,我们点击展开面板。哎,对了,你看 codex 还自带一个浏览器,你可以在 codex 里面直接查看以及批注,这样你就不用回去再想想怎么描述我是要修改什么地方。 文档与 ppt, 那 除了做网页,我现在更高频的用途是用它来做文档。比如说平时很多人会写策划案,汇报 ppt 视频脚本,以前是用 gpt 生成文字,再到 word, 再复制到 ppt 里面,最终再自己排版。但是 codex 现在已经把这些东西都串起来了。比如说我现在告诉他 使用 html ppt 这个 skill 帮我制作一个宠物账号的商业方案,要求包含市场分析、账号定位、内容模型、变现方式,以及未来三个月的执行计划,并生成一个科技感高级风格的网页 ppt。 然后你看到他就会开始创建文件,生成文案,设计页面,制作动画,自动排版。最后给你一个直接可以演示的网址。尤其是你看像我一样要录制这种口播视频的,我这样的 ppt 就是 用 qq 词直接帮我生成的,他做出来东西天然就很适合录屏。 这个时候顺便介绍一下 qq 词另一个非常好用的功能,分叉非常适合这种,你做到一半突然想要尝试一个新的风格, 或者要尝试两种内容的时候,点一下分叉按钮,这个时候不用重开一个新绘画,重新解释项目背景,他会直接分叉当前的上下文。你可以在分叉县城里面大胆做实验,如果效果不好,直接回到原来的主线就可以了。如果效果更好,就可以沿着这个分叉继续来进行开发视频动效。 说到做视频, codex 最近还上线了一个非常强的插件,由黑正推出的 hyperframes, 你 只需要输入一句话的描述,就可以自动生成带动效排版转场。三 d 视觉的高级动效视频,可以说是完全填补了原来视频模型不适合生成精确的带文字、带数据的动效视频的孔雀。 比如说,你可以直接说帮我根据这个养猪场的年报生成一段科技企业的汇报视频,他就会直接调用前端库来生成一段带数据、带图标的动效视频。 skill 与自动化任务普通的 ai 只能回答问题,但是通过 skill, 你 可以把你工作多年的经验或者流程打包交给 codex 自动去跑。比如说你完全可以使用 at skill creator 来描述你的需求,每天自动抓取某个平台的热门视频, 分析标题,提取高赞评论并整理成 excel, 最后生成第二天的选择题。我自己做了一个急梦,排队的 skill, 如果你有批量使用 cds 的 需求,使用我这个 skill, 它就会在晚上帮你批量提交视频生成的任务,自动检查生成出来的视频并保存到本地。 类似这样的 skill 还有非常多,这个部分就留给你们自己去探索。 computer news 这个是我觉得最近 q 版有这个功能,目前只有 mac 版有这个功能, 它运行起来的时候,它就会像一个真人一样看屏幕,移动鼠标,点击按钮,输入文字,打开软件,切换窗口,使用第三方 app。 以前很多的自动化必须要通过写脚本,调接口,配 sdk, 研究文档。但是现在即使某个软件没有开放 a p i, 很多事情扣代码,直接看着屏幕自己就去操作了,你懂这种方式有多震撼吗?最后的总结 可以看到, codex 提供的内容已经非常非常多了,我这里要下一个爆论就是这一类 agent, 他 绝对不会仅限于编程开发等等, 你已经不能简单的给他定义成工具了,但是你也别太焦虑,拥抱 ai, 先从每天自己最烦最重复最浪费时间的小事开始。 比如说整理文档,改革式做表格,生成封面,做网页,写脚本,做汇报,批量修改内容。当这些事情真正开始被 ai 接管的时候,你自己的潜力或许才刚刚被开发出来。

好多朋友朋友问我这个智能手表封面,这个中华人民共和国这个图是怎么弄的?给你们上教程。 设置表盘和桌面表盘,这里边没有喜欢的 换自定义华为健康,然后扫码, 然后打开往下滑相册表盘 这个图片是怎么弄的啊?哎?点加号选择,然后在相册里边找到提前保存好的照片,点对勾 调整好这个大小都可以调保存,这就保存到这里了。然后 你也可以选颜色,然后字体样式、时间,现在显示顶部,把它换在底部,然后设定为当前保标盘, 这就设置完成了。这就已经设置完成了,学会了没?

装好了靠的桌面端,但又对着屏幕发呆,那么这七个隐藏技巧,哪怕你是纯小白,看完也能直接起飞!建议点赞收藏加关注,防止以后找不到哦!大家好,我是冰好!技巧一,进入软件,直接在对话框里敲这段指令斜杠, set up, call work, 就会像一个老手一样带你选职业装插件配工具,傻瓜式的操作,五分钟帮你全部搞定。个别插件报错的话,直接跳过就好了,完全不影响你的后续使用。技巧二,靠的桌面端,满屏的英文看不懂,是不是真的很崩溃? 别慌,我自己歪着抠等了一个汉化神器,安装之后,菜单栏点一下,一键汉化重启,靠的直接变成中文,想切回去,只需要点击恢复原版就可以恢复到汉化前的版本了。 画画之后还可以随意切换其他语言。这个 app 只改变你的 app 语言,不会动你 call 的 任何配置文件,快捷省心。技巧三,别让 ai 再乱翻你的电脑了, 看见输入框下面这个工作区按钮没有?点击它旋转你现在的项目文件夹,这等于给 call 的 划定了一个圈圈外的隐私文件,它绝对不碰! 切记,千万别把整个电脑硬盘给全选了!技巧是,一堆文件直接扔给靠的,他绝对是懵逼的。聪明人的做法就是点击加号,或者直接把对应的文件拖进去。 比如说我扔一份,销售一笑给他付上去,然后说按月汇总,找到下滑最大的三个品类,指定上下文,不仅省创意,干活还贼精准。 技巧五,这个功能百分之九十的新手都会漏掉。打开设置里的 global instruction, 在 这里写一句,所有的回复必须用中文,之后不管你怎么问他,他都会用中文来回你。以后你的回复格式、口吻、风格全都可以放在这里,收益极其夸张。 技巧六,嫌,每次都要重新调教,太麻烦。设置里面把 memory 的 记忆功能打开,你随便提一句,我是做电商的,多用转化率分析,下次新对话他直接按你的习惯来, 用的越久他就越了解你,简直就是专属的神仙助理啊!最后一个技巧,如果你经常找不到你的历史绘画,在侧边栏点击 vivo 会打开一个完整的任务列表,在这里你可以多选绘画,一键存档, 在这里也可以看到你之前存档的绘画信息。重要的绘画可以点他们侧边的三个点,点击固定,直接置顶,下次直接就能找到。完成了任务,想把绘画从侧边栏删除, 直接点击存档,就会保存到你的任务列表里面。学会了这七条技巧,那么你对靠的桌面端的使用就算正式出师了,我会持续更新更多靠的桌面端的进阶玩法,不想错过的话,赶紧点个关注吧!

奇怪,这块岩石的纹理太规则了,像是人工打磨过的。张总,会不会是月球早期火山活动形成的警报检测到未知能量变动,与图十八号失去联系, 通讯信号中断。局长,我们的阿尔特维斯七号也在附近,正在靠近目标。 十万年了,第一个吵醒我的竟然是这么个铁疙瘩。

大家好,我叫田家怀,今天给大家展示一下我的杰作。呃,你们看这是一个普通的垃圾桶吧,那你们看好了 啊,你说啥也没动?对啊,这怎么没有动呢?嗯?什么情况?哈?这就是我的感应垃圾桶 啊,它是什么原理呢?为什么会想知道秘密吗?想呀,那就看它后边呵。哇哦,好高科技的样子呀。其实其实 其实它的大脑全都在智慧核心和扩展版的这个地方。 看他上面这俩小眼睛吗?嗯,看到了, 这个白色的是一直发射那个红外传红外线的,然后这个黑色是接收的那个红外线的,然后他的名字叫红外距离传感器。嗯, 然后接着他他的数据会从这个连接线一直到这个智慧 扩展版的这个地方。不对,智慧核心的这个地方,然后接着 再从这个地方一直传到六,就 p 一 的那个接口处的那个连接线,一直把数据传到舵机的这个地方。舵机是什么呀?舵机就是这个小 那小箱子啊,这叫,然后接着这个是那个剁剁杆,嗯,然后他上边有绳子,绳子一直连,就这个绳子叫硬绳,嗯,他可以移动,就他可以变形, 然后接着他他会连到这个地方,就这个像锤子似的,嗯,正过来就是像锤子。嗯,然后接着 给你们看一下他距离。啊,原来是这个叫什么度七,就会转到零度, 然后拉动绳子,然后一直动力传到这个像锤子的这个地方,然后接着他是用双面胶粘拉粘起来的,然后接着他就会打开盖子。咱们来试一下啊, 我要比大小,如果要是谁大谁就不会扔掉, 如果是小的话那就会扔掉,咱们来比一下,你为什么要扔掉?高度还没它高呢, 所以,所以我要把它这扔啊,扔掉在垃圾桶里啊,明白了,大的装不进去吧是不是?对啊,装不进去啊。 那你今天这个就演示完了?等会啊,我还没表演完呢。嗯, 哇哦,哇,还挺能挺能装。嗯,容量挺大的。 那我很好奇他,怎么,他是怎么什么东西控制的?那个叫什么?这个,这个叫什么杆来着?托杆,舵杆是吗?是什么东西控制的他呀? 你是写代码了是吗?对哦,那写的什么代码呀? 打开 pad 在 核桃边城上就可以看到了啊,那你呢?我知道了,那你写的代码是关于就是。呃,他是,他是九十度或者是零度对吗?对哦,是这么一个代码呀。好,我给你看一下,科技是真神奇。 哦,原来是核桃边城啊, 我看你写的代码是什么呀, 就这个是吗?对哦,就这个,原来如此,好了,你让你今。