粉丝2496获赞1.5万

今天我想用一套可以直接在团队跑起来的方法,讲清楚一件事,为什么同样用 ai 写代码,有的人在堆垃圾系统,有的人却在稳定交付?差别不在模型,而在流程。一是什么?从对话写代码到工程化流水线?很多人现在写代码是这样的 一个需求,问 ai 生成代码修改,再问再改,看起来很快,但结果通常是,代码能好,架构是断,系统是不可维护的。问题本质不是 ai 不 够聪明,而是你没有一条确定的生产流程。真正的方式是反过来,先定规范,再出方案,再拆任务,最后执行交付。这背后对应一套工具体系, expected 负责规范和设计, superpowers 负责执行和约束, openspec 负责存量系统引进, b m a d 负责多角色协调。二、为什么不做工程化 ai 必然失控?你在使用 ai 时,一定遇到过三种情况,刚定的规则, ai, 下一个就忘了。刚做好的结构,下一次生成就会推翻同一个需求,每次代码风格都不一样。问题不在模型, 而在缺少约束系统。 ai 天然有三个特性,容易遗忘、容易扩展过度、容易上下文漂移。所以必须用工程方式管住它,不是靠更好的提示词,而是靠更强的流程约束。 三、怎么做一套可以直接落地的完整流程?下面这套流程可以直接在团队执行。第一步,项目出手话先做出手话, specify in it 系统会生成一个目录点, s, p, e, c, f, y 斜杠。这个目录的意义很关键,它不是存代码,而是存工程记忆。里面建议固定三个文件, spec dot mb, plan dot mb, tasks dot mb。 第二步,定义需求输入命令 specit specify。 后面跟业务描述。例如,实现用户注册接口。这一步只做四件事,用户怎么用?输入输出是什么?边界条件是什么?验收标准是什么?这一阶段有一个硬约束,任何人都不能写代码。第三步,生成技术方案, 执行 spikit 计划。这一阶段关注的是结构,而不是实现输出,必须明确涉及哪些文件,数据结构怎么设计接口如何拆分,有哪些风险点。这一阶段的核心作用是锁定边界,防止 ai 扩散实现范围。第四步,任务拆解,执行 spikit tasks。 这一阶段非常关键, ai 会生成任务列表,要求必须满足三个条件,每个任务五分钟内可完成。每个任务只涉及一个文件,每个任务可独立验证。设立创建 control。 定义有二类型, 实现 create view 方法、编辑单元测试。这个阶段的本质是把一个功能拆成很多小动作。第五步,执行阶段进入执行阶段后,规则完全改变, 每次只执行一个任务。例如执行 task 点 md 中第一个任务,同时必须满足四条规则,先写测试,再写代码,只改当前文件,不允许扩展功能。执行过程中禁止做三件事,不能重新设计,不能跳任务,不能修改非任务文件。这里的核心控制逻辑是让 ai 不 做判断,只做执行。 第六步,隔离执行环境,每个功能建议使用独立分支, get work tree, add feature x x x。 这样做的原因很简单,上下文越长, ai 越容易失控。 第七步,代码审批执行完后必须做 review, 调用 request in code review 输出要求严重问题,一般问题优化。建议,这一阶段的意义是让 ai 同时具备开发能力加审计能力。第八步,规章 执行 openspec archive 作用是把本次规范和代码绑定,避免文档和代码脱节。四、工具组合建议不同场景直接这样选。新项目从零到一 specit 加 superpowers, 老系统改造 openspec 加 superpowers, 强监管行业 b m a d 多角色体系,个人快速开发,轻量任务流。 五、本质变化是什么? ai 编程真正的变化不是工具升级,而是开发方式从人控制代码变成规则控制, ai 从随机生成 变成可预测交付。 ai 编程的分水岭不是你会不会写提示词,而是你有没有一套工程化流程。当代码不再靠灵感生成,而是靠流程驱动时,系统才真正开始稳定运行, ai 才真正开始变成生产力。

然后刚才提了这个规范,我,我可以把这个我用我试用了两个工具的规范的这个截图跟大家做个分享,就是我用了这个叫做 superpowers 这个这个事件 先首先跟大家做一个对齐吧,就是就是 ai 为什么代码总是跑偏呢?就是不是 ai 不 够聪明,是缺乏约束,就是缺乏我们用规范来约束它这个整个的一个工作流程,其实真的大部分军事项目来说的话,靠谱比聪明更重要的多。 而 superpower 的 话它定了几个流程呢?第一个是头脑风暴,第二个是设计确认,第三是实现计划执行、开发代码审查,它把整个开发的过程把它提炼成了这几个典型的这个工作步骤啊。 我这里先先安装了这个我我使用的工具是 cloud 扣的,然后先把这个这个插件,它是用的 cloud 扣的一个插件先注册,然后安装,安装了之后我大家可以看到我首先给它做的是一个头脑风暴, 同样方法就是相当于我跟他交流我要做一个什么东西,他会问我一些问题啊?就像那个苏格拉底式的形式,你是不是做成这样啊?你是不是这样他就会跟你反复交流多少次,把这个需求澄清好对齐,好让他再写计划,再写成,把分解成再进行执行。 我比如说我跟他说我想做一个代办事项的应用,代办事项的应用,他他就这样的对应的技能 skill 啊,然后他就帮我分析了,然后就问我,你是想做外部应用还是桌面应用 还是手机应用啊?我就告诉他我要做外部应用,你看这个对话的方式是不是跟我们平时日常工作是很像啊?比如有人给你安排工作,你想做一个软件,其实这个背后的信息量是很大的,就是如果不清楚这个东西,做出来东西就是有可能是 风扭牛马,不急的,是吧?那种就会有不同的这个反沟通,我就跟他说外部应用,然后他又问我, 有些内容是可能用格式化的方式来展现更清晰啊,可以展示界面布局、设计图,颜色方案对比, 想不想问我想不想在浏览器中边看边讨论?我跟他说想,然后他又巴拉巴拉又又问我做了些什么,然后直接就给我启动一个浏览器的网页了,你看, 然后我就通过这个网页就能打开,实时看到我做的这个东西。然后接下来他又跟我说, 浏览其中展示有三种风,三种布局风格啊,然后 a 是 极简菜单栏,二是侧边栏的导航,三是看门式 啊,他就根据他的模型之前学习的经验,他就来让我做选择题啊,到底是怎么布局的,然后我就选了侧边栏的导航的布局, 然后他就跟着我的指令开始做了啊,写下面下面的东西,但是这个过程他现在还是没有开始写代码了, 然后他又问我,这个风格视觉的风格是简约的,深色的还是活泼的啊?然后我给他选了一个叫柔和自然的啊。接下来然后大家又问我需要些什么功能 啊? a、 b、 c, d, 我 我选,我都要,我就把所有功能都都写上去了 啊,他积极跟我说,因为这个应用它有数据存储嘛,是吧?数据存储,到底这个数据是存到云端还是本地,还是还是在哪里?我就给他说直接存本地就行了啊,不需要上云端,这样我就不用搭一个服务器,我就选了,然后接下来他又 他就跟我确认一下,我选择了侧边栏,如何自然功能呢?还有哪些?然后选择本地,还有跟我做了一个前期的一个确认啊,确认了之后他就开始跟我做方案了啊,技术,技术站选了哪些技术 啊?然后技术还把数据模型都给我设计设计出来了,然后他问我整体这个设计方案是不是符合你的,然后我大概看了一下大差不差,我们 符合,我就回复了符合,然后他就开始给我写了一个这个设计方案的 md 文件啊,但是我去看这个 md 文件的时候,我发现有的那个技术需要调整一下,因为它用的是 react 的 这个技术 啊,这个不符合公司的这个整体的技术要求啊。我们是用的 view 嘛,所以我就手动去改了一下这个文件啊,改了一下,打开打,我把它改成 view 三了, view 三了, 那 vivo 三零。然后我其实啊,我手动去改了,我说我手动去改了这个文件,然后他他识别到了,他识别到了之后,让我感到很很惊讶的是 他把相关联的这个,我技术技术这个把,只是这个技术语言改了一下,他把相关联的功能他都给我给我找出来了啊,你看, 然后他说你想用这个这个,然后他的存储的方案就要变了,原来 view 的 话它是,它是原来 react 的 话,它的状态管理是是 react context 这种方,但是 react 的 话它它肯定那个存储是是不能用的,那它就还提示我是不是换一个这个存储方案,然后我就说换换一种,我接着它就把相关的技术文档给我重新调整了,可以看到。 然后下面就是就是一些确认的操作啊,一些确认的,我跟确认了最后他这个这个询问的这过程,确认方案的过程,确认完了之后,他就开始写计划了, 把刚才这些确认的方案进行了计划的一个拆解, 但是计划了拆,拆解了之后我发现有一个一个比较比较恼火的地方,就是用着用着我那个 token 没有吧? 我用的是那个 mini max 的 这个 token, 之前是注册了之后送了十五块钱,然后我用了就没有了,我还这个任务还没做完,然后我想继续做,那怎么办呢?我又去充了钱,我又去充了十块钱啊,我又充了十块钱, 充钱十块钱,然后充完之后我又回来跟他说,那继继续啊,继续干活啊,那他他就继续 搞,搞完之后啊,他就把这个计划插进成了十二个任务啊,十二个任务, 然后十个任务,他就依次执行这个任务,嗯,当然这过程中会有些让我确认的一些东西啊,放进一些文件, 然后把任每个任务就不详细讲了, 然后他把那个任务任务做完之后,他才自动进行构建测试一遍啊,这个就算开发完成了, 但开发完之后让我去检查,让我去检查,我就打开网页把它看看,但是我发现一个 bug 啊,就是 这一个左边的这个这个分类啊,我新建了一个分类,我是想建三个分类,叫做工作,生活还有学习这三个分类,但是我建了之后,但是只显示了第一个字,我发现它又出现了一个 bug, 然后我就我就跟他说,我就跟他说侧边栏的分类显示只显示了一个字啊,我希望最多显示四个字,然后超过了字用省略号替代,然后鼠标移到上面时候提示完整的名称。 嗯,我跟他说,但是他就就已他说已修改,他修改了些代码,然后我就看了 还是还是没有实现,但是这个功能都还没开发完,这个钱又没了,而且这个太,所以这个太费头狠了,这个十十块钱,所以这个现在 ai 编程就是 ai, 它每每次你跟输入的字, 还有他每次回复你的都是要花钱的。这个确实这个成本有点高啊,所以为什么之前有的人说每每年要给这个 ai 编程的专项预算呢?所以我刚充了十块钱又没了。 那没办法,为了节约钱嘛,我就只能在我本地上,本地上那个用那个 code code 来来跑自己的模型了啊,但是我把本地的那个欧莱曼的模型跑起来之后调用还调用不了,我发现后来调用不了, 虽然我用了那个叫 light am 的 那个做代理呢,还是调用不了啊。他,他可能是 用不了,所以我就用了那个换了一个工具叫 opencode 的 啊,这个是 cloudcode 的 平替版,相当于因为 cloudcode 它是这个收费的嘛,它它这个模型,所以有个开源的这个 opencode 的 平替版。 这个工具有个好处就是它可以直接选免费的模型,我发现就是它能直接选 kmi 那 个 mini max 的 二点五的那个模那个模型,然后切换了模型之后我又跟他说一遍这个问题,啊啊, 这次它已经很快就给我修好了,虽然这个现在这个 mini max 已经出二点七了,但是二点五的模型还是可以能把这个问题给我解决,还是免费的,挺好啊。 然后我跟他说这个问题之后他还提提示我,他他我提示我怎么去找这个问题啊?他问我, 你是在哪里看到的保存结果啊?让我去看一看这个值有没有保存上,这个提示很好,然后我我就去那去看了一下,确实是 它只保存了第一个字,它 name 只保存了第一个字,然后另外一个字保存到另外一个字上去了,就 color 那 个字上去了啊,颜色那个字上去了啊, 嗯,它给我提提示很好,然后然后我就我就把我找到的这个问题再告诉他,更精准的告诉他,我说你, 我说你,我说我说你,你,我看了一下 local storage 那 那个字啊,然后第二个字是保存的 color 字那种,我把我通过这个提示他的话,他一下就把问题找到了,一下就给我修复了,就完美解决了。嗯,这个 这两个字就完美完美显示出来啊,这个就是我我我亲自这个实验做的,这个通过这个啊, sdd 的 这个这种规范驱动的开发的这个一个具体的工具来试,来试的一个一个项目实验的项目 可以看到就是他整个整个流程是是有些繁琐是吧?可能有的人觉得这个太麻烦了,我们一步步跟他沟通,没有这种一句话的,这个这种这种来的直接来的来的来的爽, 其实这个是虽然我们在前面跟他做交流花的时间,但是就可以避免很多这种反攻的情况啊。前面其实是是值得的,前面投入的时间, 因为如果你只是跟他出模糊的需求,你让大魔仙给你拆盲盒,你开的也是盲盒,你后面你做的东西也达不到你的要求,有可能你中途跟他来回很多遍啊,很多遍都还达不到你要求, 导致你跟他说了很多话,很多话之后,他那个上限已经超过了他,到时候你把前面你跟他说的话忘了,会出现这个问题啊。这,这就是我的一个具体的一个经验的感受,一个分享。

大家好,这一节不讲指令怎么敲?讲我们在一次真实测试里的体感规范驱动到底解决什么,不解决什么,以及大模型最容易把你带偏的地方。 第一块看加不加仓库维基,比如 report wiki 对 生成稿的冲击,同样走规范驱动,只要多挂一层和仓库一致的文档规格里对现状的理解,改什么影响谁,技术怎么卡,参考谁,会一起变准。 下面用五张对照图,把五件事分别落到画面上。第一张对照是需求背景,左边往往还是一句话级描述,右边会把已有语义基础、工作室页面模型和换灯片结构对齐写进同一段,后面实现才不容易,各说各话。 第二张是修改能力,左边可能还是暂无能力变更的占位画,右边会写出工作室模块、工具集以及用户界面和流逝生成边界的具体条目。第三张是影响范围,左边几条业务要点,右边会落到具体前端文件控制器、对象存储、绘画模型和网关策略一条条进表。 第四张是技术约束,左边容易泛泛讲智能体框架,右边会扣住启动器名字、健全路径、草稿、上下文、过滤器和工具构造方式。第五张是参考上下文表格,多几行维基接口,文档和架构设计模型就少几次凭感觉发明接口, 流程还在,但起点很测试画面上是我们当时的一句话,需求大意,闪稿要演示文稿导入导出后台智能体用技能解析信息密度极低,却指望直接得到接近定稿的规格和设计,于是会反复对照心理内板实现,发现大量不是想要的,这是输入太薄时的正常摩擦,不是流程失灵。 这一页画的是同一条链,从提意、规格、设计、任务实现到检查,变得是中间产物可审可对比差异,不是把魔法变短,检查这一环,往往就是和心里期望反复对齐的地方。 所以中间那句感慨,规范驱动的中段,很像分为编程,只不过对象从代码换成了文档,轮数未必变少。千万不要以为跑完几条看起来很轻的指令,就自动解决从需求到代码的全链路, 这一页对比旧习惯和新习惯,以前是对着集成开发环境和差异改实现,现在很大一部分是对着题案、规格和设计文档来回改流程图再漂亮也不替代你把边界说清楚。 回到改规格、改设计时,模型仍会理解,偏还会擅自帮你优化架构。要像审代码一样,审文档、读产物,对照期望不对就改文档再跑。 这里引用实践复盘的大意,模型会顺手替你全面展开很多选项。有时只想简单实现,也要多轮对话。需求尽量写清楚,写成文档。测试里只用一句话开题,后面多轮对齐是必然的 功能,落下去之后,页面上会出现演示文稿相关能力,但故事没完。导入解析、跑通不等于产品交互。已经对了,规格里要写清何时解析绑定哪条生成链路。 又一轮典型坑按钮有了,体验却不对,只能回到规格和设计再对齐。前面的检查和审核必须认真,别指望一句话需求加几条指令扛住全链路,要把规格和设计当成汇进仓库的代码来审,收束成五条,实战心态,上下文先行,把文档当代码审,承 认文档向氛围编程,警惕顺手优化交互写进规格,避免最后再炒一板。

四种驱动如果各讲各的,很容易像四套术语课,真正有用的是把它们串成一条开发流水线。 用户管理系统如果只做 t、 d、 d 代码可能对,但边界乱,只做 d、 d、 d 不 写测试,模型再漂亮也容易漏。所以最后这一集,就讲怎么把 d、 d、 d、 s、 d、 d、 b、 d、 d、 t、 d、 d 真正串起来,顺手也讲怎么让 ai 按这个顺序干活。 你会发现, ai 时代最稀缺的不是生成能力,而是把生成能力训成流程的能力。拿用户管理系统来说,最顺的顺序是先用滴滴滴拆账户认证授权,再用 sdd 定接口,再用 bdd 写场景,最后用 tdd 推实现。 这四步刚好分别回答四个问题,业务怎么分?接口怎么定?用户怎么用?代码怎么算过顺序?一旦反过来,比如先让 ai 写代码,后面每一步基本都在返工。如果让 ai 参与,我更建议把它当四个工位,不是一个全能实习生。 第一轮让他当架构师拆领域,第二轮当接口设计师写规格,第三轮当产品和测试,把场景写清,第四轮再当开发。按 tdd 实现。 ai 不是 不会响,而是你不给他供应,他就只能边拆边补。 最常见的坑有三个,把 d、 d、 d 当名词游戏,把 b、 d、 d 写成空话,把 t、 d、 d 变成代码,写完之后再补测试。还有一个 ai 时代的新误区,就是看它第一版能跑,就以为方法不重要,其实越会生成,越需要方法压住方向。 真正有效的方法只有一句,该先定的先定清,再让 ai 往下实现四级。讲到这里,你应该记住一件事, d、 d、 d 定边界, s、 d、 d 定契约, b, d, d 定行为 t, d, d 定实现这四个不是互斥,是接力以后团队之间拉开差距的不只是会不会用 ai, 而是会不会用方法把 ai 训成流程。

不知道大家有没有同感,自从发现敲代码越来越廉价之后,很多技术团队不仅没有变得轻松,反而陷入了另一种极端的焦虑,疯狂迷信基建,为了管住,动不动就跑偏了大模型,现在全网都在教你打造一套高大上的 ai harness, 也就是所谓的智能体控制台的驾驭工程。大家好,这里是 ai 减法第五期。 今天我得泼一盆冷水,除非你们团队是要从零去搭建一套专属的 agent, 那 确实有必要自己做一套 harness。 但如果你们的业务仅仅是想用成熟的智能体工具来写代码,那试图去首搓一套 harness, 完全是在浪费研发资源,甚至会把团队拖入泥潭。这期视频,我们把被神话的 harness 扒得干干净净,讲透它和最近爆火的 dear flow、 二点零、 superpowers, 以及我们推行的 s、 d、 d 之间到底有什么本质的区别。想要看透 harness, 你 得先看看到底是谁在带火它。 openai cloud 团队、 kusher 团队,大家发现了吗? 只有这些真正去封装大模型,调用、从零打造底层运行环境的大厂,才会去死磕 narnis。 因为他们要解决的是海量并发的吞吐量、长时间执行导致的状态丢失,以及多智能体的底层调度问题。他们口中的 harness, 本质上 就是给大模型造一个稳定安全的物理沙箱。搞懂了这个,最近评论区里很多朋友的困惑就迎刃而解了。有人问我们这套基于 openspec 的 s、 d、 d 开发流程跟字节开源的 dear flow 二点零有什么区别?区别非常大, airflo 二点零是一个真正的底层 harness 框架,它提供的是底层隔离的 docker 运行容器,它是用来造高速公路的。而我们做 s、 d、 d 规范驱动,根本不碰底层控制代码。 我们在做的是工作流治理与上下轮工程,因为像 cursor 本身就已经是一套极其强大的黑盒 harness, 我 们要做的是在别人现成的 harness 上制定交规,开车上路,千万不要搞混了自己的生态位去重复造轮子,那同样是用来约束 ai 写代码, s d、 d 和前阵子很火的 superpowers 框架又有什么差异呢?很多团队在真实项目实战中发现, superpowers 走的是认知枷锁和微操路线,他强制 ai 拿到任务后必须先脑爆再写详细计划,然后强制走测试驱动开发听起来很美好,但很多人最终弃用了它。 为什么?因为它太繁琐太重了。它带来了极大的流程摩擦力,严重消耗 token 和时间不说,还极其容易让 ai 在 一堆冗长的反思规矩里丢掉真实的业务目标。而我们推行的 s、 d、 d 走的是轻量级气约路线。我们不强制微操 ai 的 每一步思考过程,我们只用 propose、 spec、 design、 tasks 这四个产物当做具体的施工图纸来划定边界。并且这里要注意一个核心细节,这四个文档并不是一股脑塞给 ai 完事的。 我们真正写入 cursor rules 里面的,是团队提炼出来的底层开发铁律,比如严禁跨层调用。当 ai 的 潜意识里刻着不可违背的团队铁律,眼睛里又看着精准的架构施工图,它自然就能一次性产出高质量代码。所以,别再被市面上各种复杂的 harness 架构图搞焦虑了。在代码越来越廉价的时代,你的核心护城河绝不是去首搓一个底层环境,而是如何精准的拆解需求,如何提炼团队的开发规范,在别人建好的 harness 游乐场里,玩一场驾驭复杂系统的游戏,这才是真正的 ai 减法。如果你在团队落地中有什么困惑,欢迎在评论区留言探讨,我们下期见!

如何快速的建立公司的流程和体系?第一步,建立公司的组织结构和识别过程。第二步,根据这些过程识别过程中的风险。第三步,根据这些风险识别的结果,建立每个过程的流程,输出程序文件。第四步,按照程序文件执行。 第五步,通过内审检查流程的符合性。最后一步啊,经过年度评选,总结流程体系的有效期。 老师傅说,这不叫快,怎么叫快呢?天下武功,唯快不破,找到同行业的龙头企业,挖他们的人才,拿到他们的流程文件。第一步,不是执行,是精简, 挑选那些最重要的流程,开始演练,再经典,直接拿到流程,直接经典执行的感觉实在是太美妙了。那没人。

今天跟大家分享一下程序员失业演进史,哦,不对,口误了,不好意思,是 ai coding 演进史。 ai coding 其实已经演进四个时代了,很多人以为现在只是 ai 编程工具更强了,比如 coser, 比如 clone code, 但实际上程序员的角色已经变了四次了。 今天我用三分钟带你看懂 ai 拷钉眼镜。第一个时代就是古法编程时代,那时候程序员的一天是什么呢?从接到需求,到打开 ide, 再到自己一行一行敲, 那卡住了怎么办呢?卡住就去谷歌搜,或者 stack overflow, 或者 c s, d n, 然后复制粘贴,调试修 bug。 那 个时代程序员最重要的能力是记 api, 是 查资料,是调 bug。 那个时代程序员就是在和代码打交道。后来 chat gbt 出现了,程序员第一次发现原来代码还能问出来,于是程序员开始问 ai 复制代码,粘贴进 ide, 再把报错贴回到 ai, 你 会发现,这时候程序员的角色还是 cv 工程师。在第二个时代, 人类其实就是拆的 gpt 和 ide 之间的数据线。这个时代,程序员开始和 ai 打交道。后来真正恐怖的事情出现了, ai 开始进入到 ide 了,程序员不需要复制了,不需要粘贴了, ai 可以 直接读整个的项目文,它也可以直接自己修改多个文件,它能自己跑测试, 他能自己修 bug。 这时候 ai 他 不是一个工具了,他更像是一个初级的工程师。但是问题也出现了,由于 ai 写代码太快,没人能看懂 ai 写的代码,他也超过了人类检查代码的速度。 还有一个更重要的问题就是程序员的意图藏在了与这些 ai 工具的对话聊天记录里,这些聊天记录他不会跟着项目走,所以就导致同一个需求,不同的人问, ai 会给他不同的实现和不同的风格,这时候系统越来越没有人能真正理解。 这时候 ai 编程开始进入第四个时代, ssd 时代,它的中文名就叫做规范驱动开发这个 ssd 它核心是什么呢?核心就是代码,是事实, space 是 意图。在过去的时代, ai 负责生产代码,但是生产代码的意图散落在 agent 的 聊天记录里面, 这是一个根本问题。所以 ssd 如果让我用一句话来定义的话, space 它是原代码,代码只是 space 的 翻译产物,你怎么理解呢?所以程序员开始他不再直接定义代码了, 也就是说我们在时代二他让 ai 去生成代码,时代三让 ai 去如何写代码,这时候咱们都不要了,这时候程序员是去定义如何写代码的时候的约束,如何建模系统,如何去 控制系统的演化。咱们可以从工作方式的对比来看,在之前三个时代, 程序员会根据需求来写代码,无论是自己写也好,或者说是让 ai agent 写也好,这时候程序员还是在控制如何写代码。 但是在 sdd 时代来了一个需求,咱们首先会把这个需求翻译成意图,然后再根据这个意图生成出 如何写代码的计划,再根据这个如何写代码的计划生成出写代码的任务,然后再把这个任务给到编程 agent, 让他去实现代码。 你可以看到现在程序员的任务就是编辑 space 意图,剩下的 plan 啦, task 啦, code 啦,全都是 ai 去做。这就是咱们所说的定义,约束建模,系统控制演化。所以你看,古法时代, 程序员是和代码打交道。对话时代,程序员是和 ai 假打交道, agent 时代是程序员和 ai 一 块和代码打交道。 sdd 时代就是程序员和需求打交道, ait 程序员和代码打交道, 程序员不再直接控制代码。所以这四个时代的本质变化是从程序员写所有代码到程序员开始定义系统的一个意图。 ai 实现代码 相当于程序员之从之前写代码变成了现在写意图,这个意图就是 ai 时代程序员的代码。这下你了解 ai 抠定的眼镜尺了吗?

传统的电商设计需要平面加摄影,但是 a i g c 设计只需要一张产品图,再加上一米二解决我们的视觉设计。 c d s 二零解决我们的摄影需求,也可以把两者合二为一搭建我们的直播间。这款耳机采用了混合主动降噪技术,具体是把一张产品图片 生成我们的三式图,我们的换背景,抠背景以及我们的多角度产品特写,再加上正面跟背面以及我们产品的打光,包括是吧我们 截我们产品的 logo 提示词,做一个 daisy man 的 电商的详情页设计,那以及我们根据一张详情页设计 生成一个多角度的资源位。根据我们的一张产品图加我们的 cs 二点零可以生成我们的一个三百六十度环绕展示产品的一个摄影,那以及我们针对不同的人群,比如说办公 以及游戏场景,以及在图书馆读书的一个幺零八零 p 的 生成,那以及根据我们这个详情页生成一个简单的动效。 当然我们也可以把 cs 二点零跟我们的 image 二结合起来,生成我们的直播间的一个场景的搭建,以及我们的效果展示, 以及最终让你做完这么多,你怎么交付?你也点这边的一键分享,就把你的体格式跟使用的模型给分享。当然你也可以选择上传我们的成品, 不包含我们的题词词进行分享。像这些用 image 二做设计以及通过 cds 二点零做摄影,都是用了一款国产 ai 阵的平台 live tv 来实现的。 只需要简单三步,你也可以生成同款题词词加我们的素材以及一些使用技巧,加本期的原文件给整合到这个文档笔记里面了, 那我们开始我们本期的一个全流程,那我是我们的古法设计师阿凯,带你们开启我们的 a i t c 时代。所以的话强烈建议大家先创建一个项目, 点击创建,你这边可以选一些,比如说一些模板什么的,或者你是一个小白,你可以直接点别人创建好的一个,比如说全流程什么的,因为它里面会包含提示词,查看制作过程,可以看到别人的提示词, 是一个非常好的学习借鉴的方式。但如果你是一个,比如说公司项目,你最好还是自己创建,我们直接点,比如说我们的先点个创建图片,选择你的产品的图片,那基本上就直接看我自己做好的项目,作为简单的一个教大家怎么去使用。那本节教程一共分三个部分啊,首先是我们的视觉设计这块 主要用了什么?用了一个是它呃逆步 tv 自带的一些黑科技 agent, 比如说 首先第一个是多角度,就是你点击多角度,他就会生成相机生成就是比如这是俯视的,对吧?然后这是它背面的效果,然后以及打光这个光源朝向,对吧? 你也可以,如果你不太懂这种打光,你可以直接点击上传什么图片,然后根据啊根据图片效果进行一个打光以及进行替换背景,你可以点进这边的呃抠图,它就会生成这种呃 t n g 的 图片, 然后接下来你就输入关键词,对吧?以这个图片作为电图,然后添加产品背景,专业的什么什么特写,然后选择我们的音乐加二模型,就能生成这种替换背景。 那以及我们的稍微复杂一点的就是加上我们的产品 logo 以及我们这个风格,就是是一个比较长的一个 类似于 design mind 的, 就是一个固定风格的提示词,这风格是一个提示词,就是我现在的提示词分两个部分,一个是 就是 design mind 的 就是设计风格,就这种暗色的设计风格,一种是我对它的一些额外条件是简约刻制、时尚留白感强,突出产品的质感跟形象, 那就生成了一个这样的一个电商详情页,那这个就是我用传统的方式,比如说这是图片一,这是我们图片二,生成一个电商详情页就生成这种的 他风格不太可控,需要抽卡,而这种我们把分下来的就能控制他的风格。那以上就是我们的页面值部分, 那接下来的话就是我们的 cs 二点零的部分,这也是非常简单,就是我们根据这个图片,我们产品图片加上我们这种简单的提示词, 产品三百六十度环绕匀速精华,用题词生成的。当然如果你不太会写这种题词,你也可以选择我们的镜头跟随啊,就是你可以啊用镜这边开始选他有个介绍,这都是有介绍,什么相声弹弦,可以选你的镜头 以及添加首尾针对,或者你给一些参考什么的都可以。那可以看到这种成本是相对而言比较低的,可以根据我们的客户,比如是用办公场景,是这种适合推销给白领的广告,以及这种适合在图书馆看书的,那以及给游戏玩家的广告相应的设计做个简单的动效, 那这就是我们的 c s 二点零,极速的提升我们的摄影能力,以及我们把两者相结合, 我们搭建我们的直播间,通过我们的一个 design mind, 就是 把我们的提示词风格给固定,固定这种房间的提示词,再加上我们一些我们的自己的要求,耳机该怎么放? 弄个支架直起耳机,而不是凭空悬浮,生成我们的一个直播间的场景,在这个场景上我们以这个图作为店,这张图片就让我们的音乐键生成我们的手机的一个直播的一个 u i 界面, 看一下这个,我们想要搭建这个直播间效果如何?那这边出现一个小问题,就是 ai 这边生成两个,他不太理解这关系,那我们通过我们的局部重绘把这个地方给消掉了, 但消掉之后他又是不太聪明,就导致这两个耳机都没了,那我们只能再放一张图片,把这个这个耳机加上去就可以了。得到我们直播间的一个预览, 那如果我们想看效果怎么办?就用我们的 cts 二点零,这是我们的一个预览效果啊,这款耳机采用了混合主动降噪技术,降噪视觉设计,以及做我们的 ai 短片,以及搭建我们直播间的一个流程啊,欢迎大家的点赞留言啊,那我们下期再见。

大家好,这里是广州管家婆今天带大家来到我们最近在做的一个项目现场,这是一个贸易型公司的仓库,通过管家婆 wis 系统实现一个扫码出入库的需求。 现在可以看到我们将整个仓库分成了两个区域,这边的话是一个到货区,另外一边则是一个发货区。到货区的话,比如我们刚入库的一个货物核验完成后,我们就把它放到这边来,其实也是相当于一个储货区来的。 这边发货区的话其实也相当一个拣货区,我们会把一些大箱的货物拆发之后放到一个指定的库位里,这样方便我们的仓储人员在处理一些微小订单的时候快速的拣货以及发货。 这边可以看到我们都是做了一个库位的绑定的,当我们的订单来源时,餐馆人员只需在指定的库位里面拿出所需要的物品,然后进行一个扫码识别,轻点确认了数量之后做一个出库的动作,那么我们的一个发货动作就完成了,同时也可以保证我们一个库存的准确性。 好了,以上就是我们一个实施的大概情况了,你们仓库是不是也在用扫码输入库呢?欢迎在评论区一起交流哦!

一定要形成自己的 sop 流畅。二零二六年五月九号,先左拉伸,先上向下拉伸,拉完之后拉这边,向下向下拉。这样子这样子这样子拉这样子拉这样子拉这样子 拉这样子拉这样子拉这样子拉这样子拉这样子拉伸结束了, 五分零八秒,一个平板撑,做完之后,他妈流汗了,太消耗体能了,这就叫有效的热身运动。别看平板撑五分钟已经到体能的极限了,记录一下啊, 省力斯斯功力干,那就完了。分享一个极致的自驱力的一个顶级的方法论啊!做任何事情都要做成一套体系啊,一定要形成自己的 s o p 流程。我的健身流程体系就是三步,第一步 拉伸,第二步有氧,就是跑步,十到十三公里的时速跑二十分钟,大概跑三到五公里,有氧结束之后,无氧跑步结束。 你走,别走七八健身结束。

hello, 朋友们大家好,今天教大家如何快速又便捷的去搭建一套 s d one 的 环境。那在开始之前的话,我们先来介绍一下,如果搭建一套 s d one 环境所需要的最小设备是哪些?我们先来看一下总部,总部的话,我们是需要一台一 g 杠一的网关和一台 nv 二, 那我们的分支的话也很简单,同样需要一台一 g 的 网关,然后呢准备一个 p o e 交换机以及我们的摄像头, p o e 交换机摄像头。 肯定有朋友会问,为什么都会在旁边去摆放一个家用路由器呢?因为我们所在的环境里边是需要两条贷款,一条是一条是总部,一条是分支, 但是呢环境里边只有一条贷款,所以这个家用路由器的话就是我的第二条贷款,我用手机热点去无限中继他,然后就可以给我的创造一个分支的条件。以上呢就是我们搭建 sd one 环境所需要的所有设备。 好的朋友们,接下来我们来搭建一下 s d one 总部的环境,那给所有设备通电以后的话,我们把 nvr 直接连接到一 g 的 烂零口上面,那准备好这一切,我们就可以掏出你的手机,打开锐 a p p, 那 进到这一页面呢,直接点击扫一扫,然后扫描设备上的二维码, 然后先给他去命名,比如说这个是咱们总部,那我们就叫 sd one 总,对吧?然后添加到新网络,输入你的 wifi 名称,他没有,但是你要去输一下一二三,简单一点哈,密码就少一二三四五六七八 这块比较重要了,就是这个设备的登录密码是你项目的管理密码,所以我们可以设置一个自己比较常用的密码。好,我这边会有一个常用的密码,点击进去就好了。对,点击进去之后呢,然后确定 你的网络他就正在去上线了。那在就这一步之前,其实咱们是有连了外网的哈,选择通用场景,或者你是企业办公,有权企业办公,如下所示,咱们整个项目就已经上网成功了,总部的网络到这就可以调试结束。 ok, 我 们完成总部的环境之后的话,接下来我们来搭建一下分支的。首先来介绍一下分支的环境构成,那我这个路由器的话是充当外网带宽的,所以它是一个无线中继连接到我的 e g 杠 e 的 万零口上面。 那其次的话,烂领口去下连我的 pove 交换机,然后我的 pove 交换机呢?连的我的 pove 的 摄像头。以上呢就是我们所有的环境连接介绍,接下来还是拿出我们的手机去打开 vip 进行联网操作。 好的朋友们,我们先来解决一下咱们的宽带问题,我们首先连接这个路由器散发出来的一个无线信号零三一七哈,然后连接完成之后的话,打开你的浏览器, 然后在浏览器里边直接输入你要去网的 ip 地址,那咱们这个设备的管理 ip 地址是幺九二点幺六八点幺幺零点幺,直接前往哎,就会登录到路由器的配置界面,点击开始配置。 因为咱们的腕口上它是没有插任何的外网线的,所以会弹出一个无线中继的信号选项,那我们直接选它,它会默认去扫描周边所有能够被连接的无线信号, 哎,留您的 iphone 找到了,然后输密码的话,就是咱们热点的密码就 ok 了。 将 wifi 密码设置为设备的管理密码,这一步呢主要是为了简化操作,我们直接默认确定就 ok。 然后点击下一步,我们需要开启智能 wifi 吗?不需要哈,就直接关闭它,就开始直接下发配置, 配置完成之后的话,咱们的外网环境也就 ok 了。那接下来我们只需要去对我们 sd one 的 环境去做一个基本的操作就好。如果你是有外网带宽的情况下,其实完全可以忽略这一步,直接把外网带宽插到我们 e g 的 万零口上就 ok。 接下来我们打开如意 app, 我 们还是扫一扫哈,然后手机摄像头对准我们的网关,我们这个是分支嘛,所以讲做 s d one 分 支分就可以了,添加到新网络一样哈。 wifi 名称我们就是 s d one 分他这个可能是你的那个就是项目的名称,一二三四五六七八。中国人密码还是跟之前一样,你设置一个你常用的密码,然后确保他能够被记住就 ok 了。 好,编辑一下,确定他就会去创建。对设备进行一个上线,还是选择场景好,确定通用场景就好了。 那肯定有眼尖的朋友发现说,那交换机怎么没有上线呢?没关系哈,我们可以点击工作台,点击添加设备,直接扫码上线给它,哎,就会识别出来 p o e 交换,然后确定就 ok 啦。 打开网络详情哎,他就会这会有个大验证,因为上线需要一定的时间,那我们等待他上线整个分支环境到这的话我们就已经大通了,那接下来我们要做的就是什么呢?将分支的这个摄像头的画面传回到总部的大屏上面,跟我一起去看看吧。 好的,两边的环境我们都准备就绪了,那接下来的话就是说把两边 s d one 总部和 s d one 分 支给它连接在一起,然后打进行打通,我们要做的是什么呢?首先去登录我们的洛克 mac 语音平台, 搜索哈,弹出的第一个官方有官方标识的,这个就是咱们的官方的型号,然后登录控制台, 控制台的这个密码和咱们睿翼 app 的 密码是同名通用的,直接登录就好了。登录完成之后,我们可以在项目界面看到分支和总部的两个操作,那么点击服务选择 sd one, 然后在这边的话测试点击这个小脚标,然后创建新的 sd one 组,然后我的这个是 sd one 的 睿翼测试嘛,对吧?六六六,确定 选择组网方式,总分我们一般都是总分组网哈,如果没有特别要求的情况下,选择总部所网关所在项目,那直接选择总部就好了,然后点击下一步,默认这边是不变的哈,直接创建组网,他就会进行业务下发的配置, 这个下发成功之后的话,我们就可以在总部的 o v r 上去看到分支的监控画面,我们可以看一下单监控大屏 变成正常之后的话,它就是能够被完全看到连接中哈,它这个连接中变成正常之后,我们整个通路就会打通了,大概需要三到五分钟的时间,但整个配置是已经 ok 的。 好的,接下来的话我们就在总部的 nvr 上去添加我们分支的摄像头就可以了,点击我们的主菜单,然后进入通道配置自定义添加。 添加方式的话就是咱们常见的 ip 地址,这边的 ip 通道地址的话指的是咱们的摄像头的 ip 地址,我们可以从哪获取呢?就从 s d one 分 支的它的终端管理处可以看到它的 ip, 也可以从它上联的设备里边以外的界面也可以查到。哈,那我们分支只有一个摄像头,它的地址是幺九二点幺六八点 幺幺幺点三,哎,端口我们就常用的八零端口就可以,用户名是 o 的 命哈, a d m i n i n, 然后密码呢是一二三四五六,哎, 通道数咱们就一路,然后确定,哎,这边就添加成功了,然后我们取消,进入到这里边,可以看到它这个是处于离线设备正在连接中,我们退出。哎, 我们分支的摄像头画面已经出现了。以上呢就是我们整个 sd one 搭建的所有步骤,那你有没有学会,是不是很简单?欢迎大家有任何问题随时跟我探讨,我们今天内容就到此结束,拜拜。

花了一天的时间就使用 carson 完成了全流程自动化一线微调智能体的一个网站搭建,并顺利跑通。 前面我不是说参加了公司组织的一个 ai 竞赛测试赛吗?然后以这个主题进行了一个报名。今天就使用 carson 分 步骤使用题词来构建系统,包括刚开始的架构搭建、节点搭建、每个节点的具体功能填充、本 模型的适配、前端页面的设计美化等等提示。最后构建出来了这样一个系统,支持用户通过自然语言提出微调需求,系统自动化分析硬件环境,自动从本地模型库中选出合适的基座模型人工确认, 同时自动构建数据集也是需要人工确认并调整的。然后根据微调经验库,自动微调、自动保存模型、自动调用模型自动打包分享,全流程无需互联网。同时系统还支持用户自己上传微调经验,自己上传本地的一些模型。 但是这个系统还是有很多需要优化的地方,毕竟这还是使用了一天时间就完成了搭建。然后里面需要优化的地方,我目前来看的话,主要有,第一个使用的一个微调经验,知识库里面那些微调经验我感觉不够准确。 第二个就是构建的一个数据集,我觉得还需要进一步的一个确认,毕竟数据的质量才是决定微调模型的一个上下线的。然后第三个是我觉得在模型微调好之后进行推理部署,并且进行试用的时候还不够便捷,大家觉得这个系统的一个前景,市场前景如何?

一个全网两千万人看过的 python 知识库搭建教程,真的可以成为你的最强第二大脑,只用大模型加 opposite, 三分钟就可以打造你的专属知识库,关键它还能进行自我的进化。它解决了我们做知识管理时最大的痛点,想找文章时,关键词记不起来 的地方也特别的分散,因为你获取信息的平台不一样,把它们重新整理到一起实在是太浪费时间了, 而我们大多数人都懒得花时间去整理,所以最后他们都存到收藏家里吃灰了。那 capacity 的 这套方法,它不仅可以自动化的存储笔记,生成格式化图标,当数据积累到一定程度的时候,你还可以对它进行提问,它会自动解锁答案, 并且能够定期根据艾宾豪斯的遗忘曲线帮你一起复习。最重要的是,他能够根据你的提问不断的进行一个自我的更新, 简直憨爆了!现在呢,我们就一起来拆解一下可编程这套方法的底层逻辑,三分钟教你手把手搭建适合任何领域的专属知识库。 我们先来看输入段啊,就是你通过网页看到的知识,或者你之前收藏的内容,会转成 markdown 的 形式,存到初使的一个文件夹当中,然后大模型会进行翻译,提取核心的概念, 按主题进行分类,再存到另一个新的文件夹当中。并且他会对知识进行一个链接,帮你找到每个知识之间的一个关联。接下来就是查询知识库的内容,如果之后你想问什么问题,他就会自动读取新的文件夹里的相关文章摘要, 并且整合信息给出答案。在这个回答过程中, ai 会选举优秀回答,对知识库进行更新迭代,让回答和内容更丰满。之后还会通过定时的健康检查和查漏补缺,帮你自动化完善。你的知识库就属于老永逸了。 那逻辑讲完了,现在我们来具体实操。首先是工具的准备,这个是基础必备的。第一项就是 obsidian, 它是核心的笔记软件,用来查看管理,自动生成的知识库,免费版就够用。第二个就是它的一个插件叫 obsidian webclipper, 它能够一键把网页简藏成 markdown 格式,就像是这样,它有 title, 有 source, 有 description, 它会把所有的内容给你进行一个摘要,存到你的知识库当中。那第三个就是大模型,你需要去找一个支持查文本多模态, 能盗用 c、 l、 i 和本地文件的模型,比如 cloud code 啊, cursor 啊, codex 啊, tree 啊都可以。那工具准备好了,下面我们就一起来看一下实操步骤。第一步,数据的摄入, 需要你去收集原始资料,在你的 obsidian 中建立文件夹,分两个子目录,第一个子目录叫 ro, 第二个子目录叫 wiki row, 这个目录呢,它去放一些原始的素材,比如说你的论文、 pdf 啊,网页文章啊等等的。 第二个 wiki 文件夹呢,它是一个空文件夹,就是留给大模型自动生成整理后的内容。那这个时候呢,如果你有网页资料,你就可以用 obsidian 的 webclipper 一键捡藏网页,并且下载相关的图片到本地,以便大模型的引用。那第二步呢,你就需要给大模型去下达一个指令,读取 raw 文件夹中的所有文件,为每类资料写摘要,提取核心概念, 按主题进行分类,生成带双向链接的 markdown 文章,存到 wiki 文件夹当中。那大模型呢,就会阅读理解我们的原始资料, 然后自动去创建分类,按照分类创建所有数据的摘要,并且建立双向链接,把所有的知识都串联起来,就像是这样,他会把所有知识中相关的点进行一个串联,然后把它们用线连接起来。这样的话,如果你去找 一个知识点,他就会给你罗列所有涉及到这个知识点相关的内容。这个内容呢,可以是 markdown 文件,也可以是更美观的一个换灯片啊,图标等等, 可识画程度很高。第三步呢,当你的知识点到达一定规模,比如一百篇文章或者四十万字的时候,你就可以向大模型进行一个提问, 它会整合数据库的知识,给你做综合性的精准回答,基本不太会出现幻觉。当我们持续的在和 ai 进行对话,并且得到反馈的时候, ai 也会把优秀的回答更新迭代,自动存储规档, 这样我们的知识库也会被打磨的越来越好,从而形成知识的一个复利。那最后一步第四步就是定期让大模型检查知识库,可以用心跳模式让 ai 定时检查你的数据库,修正矛盾信息,补全缺失和发现新关联, 这样你的数据库就能够自动化查了,补缺越用越好。那如果你觉得这个知识库系列有用呢?欢迎一键三连,接下来我也会出这个知识库的后续内容,还有每日 ai 解决难题的系列,欢迎各位有股东一起参与。

新手零到一,独立站搭建全流程,一个视频讲透,跟着做,直接落地全程二十一步,记好别漏!第一步,产品定位第二步,注册域名第三步,选进站工具 第四步,购买服务器第五步,域名解析绑定第六步,搭建网站框架第七步,选模板第八步,做产品页第九步,写博克第十步,优化着陆页第十一步,测试网站第十二部 su 基础优化第十三步,连接站长工具第十四步,搭建信任体系最后六步,收尾 第十六步,开通邮件营销第十七步,投放广告第十八步,上线数据分析工具第十九步,搭建客户渠道第二十步,测试订单全流程第二十一步,持续优化迭代。新手从零到一,跟着这二十一步走,独立站轻松搭建完成。

我给 callix 发了一条命令啊,生成我这篇文章需要的全部图片。不到十分钟,这个文件夹里就已经装满了深深好的图片了。如果说你也需要给文章配图的话,那今天的内容就赶紧的要放进你的收藏夹了。 你写公众号发小红书吗?插图你是怎么做的呢?打开某个生图平台的网页,发送这样的一条提示词,等上几十秒,他吐出来四张照片。小姐姐,挺好看的哈,不过四张图根本他不是一个人本。 那你想的是早上画面呢?明显就是傍晚。今天呢,我们就从零开始,全程都用 callix, 你 用别的大模型也可以哈,配合 obsidian 这个笔记软件,让你的文章配图变成一个固定的工作流。以前两个小时的工作量,以后呢,就是一句话的事,准备好了没?那咱们就直接发车。 今天的工作流呢,主要用到两个工具, callix 和 obsidian。 不要划走啊,不需要懂编程,全程都是说人话,真的是 有手就行。总的逻辑呢是,在 obsidian 里面,你已经写好了一篇 markdown 格式的文章,这个格式呢,是目前公认的 与大模型沟通最好的。我们要做的呢,就是让 codex 来帮你读取文章的内容,分析配合文章需要哪些场景,再让它自己来生成提示词,自己生图,一条龙服务。等你用顺了这套工作流之后呢,麻麻再也不用担心你的出图了。实现这一套流程呢,拢共就是四步,阅读、理解、场景、设计其 词、出图。那咱们就从第一步开始配图。最烦的事呢,就是大模型出图啊,老是抽卡,你要的是早上,出来的是下午,你讲的是夏天,出来的是冬装。花了大力气去改提示词啊,这一轮 ok 了,那下一篇呢,又得重新搞这个呢,是因为你没有积累 图片呢,是要服务于内容的哈,所以说,第一步呢,要从文章开始。这篇文章是讲啥的呀?我们的林芝夏小姐姐五一去了成都见老朋友,这是他的一篇心情日记,自然呢,会有很多的自拍照,美食照,风景照。所以说呢,第一件事是要让大模型 读懂这篇文章。我的提示词是这么写的,注意看哈,提示词里的第一行呢,是把这篇邮寄按给 context, 先体会下文章的内容,人物的关系,时间线和情绪节奏,然后帮我来判断哈,这篇文章如果要配插图的话,需要哪些画面,每张图大概放在什么位置, 要解决什么问题?有没有人物一致性的要求?在同一个文件夹里面新建一份配图项目总控笔记,把你的判断整理进去,并作为我们接下来沟通的参考哈,他仔细的阅读理解了这篇文章,他发现呢,这篇文章是 篇生活化篇心情记录的邮寄。他给我的第一轮判断呢,就是说这篇文章要体现整个旅途的过程,比如说呢,出发前的行李箱,机场,成都接机,景点,餐厅,酒店等等这么一些画面。同时呢,他还提醒我哈, 这种游记里面的人物会多次的出现,所以说人物一致性的问题要考虑到。而且他认为啊,我说的建一份项目总控笔记是很有必要的,这份笔记呢,会作为整套配图工作的说明书,当然哈, 你自己甚至啊都不需要读,这本来也是给大模型看的。这个呢,就是我喜欢用 codex 配合 obsidian 的 原因了哈,它不是只在对话框里给你一段回答, 他会真的进入你的笔记库,把这些判断写成一份可以持续迭代的文件。当然呢,第一轮哈,往往不会特别的满意。那我会继续的追问他了, 你刚才的这些场景是不是有点像旅行相册了呀?公众号里面真的需要这么多的图吗?他会重新的收敛一遍,把那些指示好看但不服务于正文的画面给删掉。而且呢,还让他加上了一些画面中不要出现的东西, 比如说不要冬装,不要过度精修,不要把串串化成了高档火锅等等吧。这几轮来回之后啊,项目总共笔记才算是能用了。 这个过程呢,重点不是哪一句提示词最重要,重点呢,是要让你让大模型先读懂文章,再让他给你一个判断,然后呢,继续追问,收敛不约束,这个呢,才像是真的在干活。大模型读懂了你的文章,我们的总控笔记就写好了,现在就到了第二步了。场景设计 这里要包括两块了,一个是人物,一个是场景。人物当然很重要哈,你成都你就玩一天,逛街的时候你不可能换几套衣服几套发型吧,场景呢,也是一样的哈,必须得符合实际的情况。 五一是夏天吗?你就不能穿着羽绒服吧,吃的是串串,你画面就不能搞成了川菜?而我们先说人物,如果是一个正规的作品啊,人物会非常的讲究,需要在开始之前呢,就要确认全部的人设,包括年龄、发型、穿搭、脸部气质、拍摄风格、常见表情,不要出现的画面 等等等等。比如说,我就不希望主角变成网红锥子脸或者是广告模特的样子,他应该就像你身边的一个真实的人。照片呢,像是手机随手拍出来的。 我就这么跟 callix 讲了哈。读取这篇邮寄和项目总共这两份笔记。这个时候你先不要写具体的场景题词,新建一份人物一致性备忘录,用来约束后续所有的人物出镜图片。这份备忘录要包括 主角灵芝下的人物特征、穿搭、发型、拍摄风格、禁止出现的风格,以及配角阿乔的基础特征。请特别注意,这个不是人物小传,不要给我搞什么文学化的描述, 我要的是直接可以给深图模型使用的视觉信息。最后呢,请给出主角和配角的标准照,三式图,深沉建议,方便后面做图深图的参考。很快啊, codex 生成了这一篇备忘录。这份笔记啊,清楚的写到了主角大概二十八岁,黑色中长发, 米白色轻薄外套,浅蓝牛仔裤,真实手机摄影,自然光,生活化构图,不要澎湃,不要商业广告感。更重要的是啊,他会写清楚后面凡是林芝下本人出镜的图片,都要参考这张标准图。由于文章里还有一位配角阿乔哈, codex 还很贴心的把 阿乔的特征也写到了这一份备忘录里。注意哈,不要让大模型写什么美女啊,氛围感呐,高级感啊,这样的一些词,听起来高大上,但是对生图模型来说呀,非常容易跑偏, 他可能就会把人物往什么影楼大片的方向去带。显然呢,不符合邻家小姐姐的人设了。咱们要的是能执行的信息,能量化的信息才是稳定性的来源。 人设定了,咱们就要考虑场景了,与人物设计类似哈,还是跟 context 先沟通,确认这篇文章需要多少个关键画面,每个画面放在哪里?每个画面服务正文的哪一个段落 的提示词是这么写的,请继续的读这么一篇邮寄和总控笔记和人物一致性备忘录。现在需要你帮我新建一份配图场景清单,不要写生图提示词。这一步呢,咱们只做场景设计,每个场景要包含编号、对应正文的位置、 图片的用途,是否有人物出镜、生成方式,必须出现的元素,禁止出现的元素,建议的文件名等等等等。请控制图片数量,不要每一段都给我配图公众号,它不是相册啊。图片是要服务于阅读节奏的,很快啊。 copy 生成了一份配图场景清单 笔记清单会很细,像图的编号,正文的位置、画面用途、生成方式,必须出现什么建议文件名等等。 比如说机场图要体现出发和疲惫。茶馆图呢,要体现成都的小巷和下午的自然。光吃串串的时候呢,就要像玉林路边的小店,你不能搞成什么高级餐厅了,我们来简单的盘点一下哈。到这呢,除了刚才林志祥的邮寄之外啊, 我们一共有了三份笔记了,分别用来让大模型知道文章讲什么,主角长什么样,每张图应该怎么服务于正文?你看哈,我说不难吧,全程呢,没有一点需要,你在 obsidian 里面写东西的时候更没有什么编程,都是自然语言,跟 context 讲就行了。对了哈,如果你不喜欢打字的话呢, 试试 typeface, 谁用谁知道。 ok, 到这呢,咱们才可以开始准备正式的写题词了。 虽然还没有开始写提示词啊,但是我们出图的工作已经完成了一大部分了,上面的所有一切是写好提示词的。提示词 如果一开始就用大模型来写二十条提示词哈,他会写的很热闹,但是大概率啊,伸出来图片你都用不了,因为他并没有想清楚一样的办法。我在 callix 的 对括号里头按他的那几份刚才的笔记,我让他根据要求准备开始生成正式的提示词。我是这么说的, 请读取配图项目总控、人物一致性备忘录和场景清单。现在呢,你 需要新建一份提示词物料包。注意哈,这份笔记不是直接拿去批量出图的正式版,它是一个准备稿结构呢,分成三个部分。第一个部分是写全区,要求包括画面风格、照片质感、比例、色彩真实、手机摄影不要澎湃不, 不要商业广告感,不要过度磨皮,不要让人物换衣服。第二个部分呢,写人物的原型提示词主角长什么样,生成一个标准照和三式图。这一步呢,只做人,不做场景, 因为后面所有的人物出境图都要参考这些原型。第三部分呢,是每个具体场景的提示词,每个场景必须保留编号正文的提示词和输出文件名等等。如果是图生图的话呢, 而且场景变化和动作就不需要在每一条里面反复的长篇描述人物是谁了,人物信息呢,是会放在局要求里,通过标准照路径来引用。你看哈,这些提示词咱们讲的非常的详细啊,你不把任务拆清楚, 大模型就会把所有东西混在一起,越写上下文越乱。所以说呢,提示词物料包必须要包括两层,上层呢是大局要求管统一风格的,下层呢是具体的要求人物原型,管一致性,具体场景呢,管每一张图该干什么, 两层三个东西不要搅到了一起来。我们先看人物原型图哈,如果有问题呢,你就持续让他改 定下来之后啊,咱们就应该先生成主角和配角的人物原型图了,这些是一会正式的图生图的参考物料,很简单哈,你让 codex 按照人物原型的要求 生成两个人物的三式图,就这么一句话。这个呢,就是林芝夏和阿乔的原型图了,人物的发型、衣服、年龄感基本上比较稳定,这个角度来看呢, 认得出是同一个人。等到主角配角的原型图都定稿之后啊,咱们提示词的部分就可以进入最后一步了,我要让 codex 生成一份提示词正视版。这一份正视版呢,要非常的干净,不要保留前面那些讨论的过程, 只保留全剧要求和每一个场景的具体提示词。说白了哈,这份东西呢,才是最终给 image 二点零看的,他就会直接照着他出图了,他读到的是执行文件, 是一份聊天记录。恭喜哈,提示词咱们终于写完了,有没有发现大模型有时候是很笨的哈,他不是一句话就能拿到结果,没有关系啊,他又不会累,又不会生气,达不到要求的时候呢,咱们就跟他多拉扯几轮,总会得到你想要的结果。 到这哈,我们已经完成了百分之九十五以上的工作了。 codex 现在本来就可以直接驱动 emoji 二点零这个最近特别火的 open 的 香蕉刚出道的时候啊, 还要火爆。只要你的提示词写的足够的好,出图就不用操心了。这条视频呢,是我们专门对他做过的一个测评,有兴趣的小伙伴呢可以去看一看哈。 磨刀不误砍柴工,平时出图不满意啊,就是没有花什么心思磨刀。好了,我把提示词的正式版笔记艾特给了高黛斯,来帮我按照这条笔记中的提示词,用你的 emg 二点零大模型生成全部场景的图片。就是这么简单,你的大局要求里面有整体风格的要求, 有人物原型图的存放路径,不管是图身图还是纹身图,每一个画面都有非常详细的要求,这样的话,大模型就不会出错了。图片不少,可以伸个懒腰,咱休息一下哈。不一会呢,你在聊天记录里面和出图的文件夹里头就可以看到这些深沉的图片了,有没有成就感啊? 检查一下哈,大部分的图片都是可用的,偶尔呢可能出现几张不太满意的。没关系啊,咱笔记里不是有编号吗?还是很简单,你就这么说哈, a 零三, a 零九 b 幺五,咱不满意重 新生成。这个时候呢,不用你重新描述一遍那张插管图,还是那张机场图,直接讲编号就完事了。 gmail 会回到那份提示词笔记,按照原来的要求重新来跑对应的图片。这个就是为什么前面要把任务拆清楚,你前面拆的越清楚,后面的反攻呢,就会越轻松。 感谢你能看到这里啊,真的很简单哈,只要你的逻辑清晰一点,完全可以自己来搭这套系统。只要把文章准备好,他就可以帮你拆场景,写题词, 生成图片,按编号返工。公众号配图啊,小红书图文呢,产品体验文章啊,都用得上。或者是做 ppt 封面,课程配图,视频分镜等等啊,都可以。当你能够把你的全部的任务拆解清楚,用一种管件式的方式来跟大模型来写作。把你的判断放进笔记, 大模型就能沿着你的判断来干活。它不再是临时给你一个结果了,而是参与了一整条的生产线。当然哈,可以把这些流程整理成可以附用的 skill, 不知道你有没有兴趣哈。好了,希望今天内容呢,能够真正的帮到你。这期里面所有的提示词文档,我都会打包好,评论区自取。