那么呢,你就可能会想问,这个 ai 呢,它为啥会越聊越笨?它前面可能还蛮聪明的,但是你聊到后面,它就开始不停地重复自己的观点,抓不住重点, 或者说你前面刚给他改完的东西呢,他又改回去了。你可能觉得,哦,这就是模型不行,那就换一个更好的模型呗。但是你可能换了一个更好的模型,他依旧是还是有这样的情况出现。 那么这个问题本质上呢,不是出在模型上,是因为他的这个工作记忆不够了,或者说就是出在这个上下文管理的方式上。 看右边这张图啊,这个用 cloud 桌面端的朋友们应该很熟悉了,你把右下角这个小圆圈点开呢,上面就会出现几个进入条。最上面这个呢就是我们今天的主题,这个目前本 section 的 context window 有 多少被占据了? 能看到这个截图上面是百分之八十三,这个就是 ai 的 工作记忆,也意味着它此刻呢,能同时拿在手上想的东西已经塞到了百分之八十三,等它塞满了,它就会开始变笨。 那么今天呢,就是一件事儿,咱们讲清楚上下文,它不是一个仓库的概念,它是工作记忆,如果你能把上下文当做记忆去管好呢,这个 ai 就 不会是越来越笨。 接下来这个半个小时呢,我会拆成三件事讲。第一件事呢,就是他为啥会越来越笨?这里面会有一些实验数据去支撑,然后你学会了呢,你就能去预判到,差不多这个 ai 啥时候会开始变得不靠谱。 第二点呢,就是我们的这个真正的开始做一个项目,这个材料应该怎么去喂进去,然后什么时候该重新开一个新的 session? 第三点呢,就是怎么让 ai 去彻底记住你的规矩,下一次再做这个类似的活的时候呢,他就完完全全会按正确的方式去跑,不用重头再教。 在正式开始前呢,可以给大家做几道题,也是一个小测试,讲的是今天的一些主题,大家可以测测看自己对这些知识的了解程度如何, 里面有涉及到不少产品经理在用 agent 的 时候会遇到的一些坑,然后每一道题下面也附了一些小贴士,最后还有一些处方的卡片,大家可以看一看这个一些 知识呢,对目前的整体的这个工作流是否能起到一些效用。然后在储房卡的最下面呢,也有一些参考文献是来自于比如说 astropic 的 博课呀,还有一些呃指点也可以,大家有兴趣的话可以去做一些课后阅读。 那我们就先开始讲吧,首先呢,你要去做一个项目,做一个大活,在正式开始去描述你的这个东西的时候呢,官方给的建议呢,是让这个 agent 先对你进行一定的采访, 这个不是玄学,是 astrapp 官方给的一个 best practice, 原话差不多是你要用提问的工具去详细的去采访你 让这个 a h 专挖一些你可能没想到的一些问题,直到问到整个项目没有疑点了,再开始你就让他把完整的啊,你们总结的需求呢,写进一个 spec 文档, 然后关键的一步呢,就是你要让他去新开一个绘画,然后拿着你们总结的那个 speck 让他去干活这个新开的原因呢?是你们采访的来回讨论呢,可能会呃产生一些错误的上下文,然后对执行来说是一个噪音,然后你新开的绘画呢,上下文就会比较干净。 为什么说要让他采访比你直接开始要好呢?是因为你的需求呢?可能只是覆盖着你想要的,比如说你直接说一句话啊,帮我去出一个什么什么功能的方案,这个东西你让 ai 去写的话,他只能猜着写, 可能写出来一大堆不对的地方,但是如果你是不停的啊,去让他采访你,你可能得在三个选项中做选择,或者说他给你多选题,你就考虑到哦,还有这些视角,你被逼着去全部答完一遍以后,他这个需求才能比较完整的去呈现出来。 我现在的 cloud 就是 把这个固定到了我的工作流里,平时我就是每次去提出一个新的点子,或者说问他一个问题,呃,他都会直接使用这个采访工具,先给我去来几个选择题,确认我的这个需求到底是啥,然后他才会开始干活。 然后呢,我们明确了 spec 需求之后呢,可能就是要开始给他喂一些资料,比如说你去做什么精品调研,你可能会给他喂些 pdf 呀,或者直接把网址粘贴给他, 那么我们就得讲到这个喂料的姿势,这个呢,也就是咱们比较熟悉的概念这个 toolchain 了。我们这里讲 toolchain 呢,不是因为它这个啊,费用的问题,是因为 toolchain 其实是同时管着两件事,一件事呢,就是你每轮让它要重新阅读多少东西。 第二件事呢,就是这些东西会占据掉他多少的注意力。第一点呢,是影响了我们的花费的钱,第二点呢,就是影响他产出的质量。然后后者是我们今天演讲主要这个思考的地方, 你可以去把一个模型想成一个刚进会议室的同事,你可能是已经在桌上堆积了很多材料,他是可能是全都看到了,但是你这个桌上堆的材料越厚越多,不相关的材料呢,他真正能同时拿来判断的就越少。 isoopedia 官方的博客是说的很直接,这个模型是有一个 attention budget, 也就是注意力预算,你每多一个 token 呢,都是在花这一笔预算。因此呢,我们确实是需要在意你给的东西它要占据多少个 token。 我 们这里为什么要拿两百 k 当成一个标尺?是因为你们一般日常工作呢,一个认真的绘画会占据几十 k 到一两百 k, 这就是比较常用的一个危险区,所以说可能比较适合做一个百分比。比如说你一听五万图,可你可能没什么感觉,但是如果你说,哦,这已经吃掉了你一次对话的四分之一的脑容量哦,你就知道它在积压什么了。 大家看一下这个价目表,首先呢,就是先看最中间的这个站的窗口这一块,它就是这份材料吃掉了它多少的工作记忆。比如说你五十字的一句话 啊,对这个窗口来说是忽略不计,但是你往上走,你去给到 pdf 可能就占据了一半。 然后你在网上给他发这个全量的一个大报告呢,就直接是撑爆了。如果你让他去扒一个近别的官网呢,这是一个很不可控的事情,可能一口气就会把整个 session 的 这个呃,所有的脑容量全都占满, 所以你很多时候不太清楚它,嗯,吸收资料会花费的多少脑容量,你可能就直接把,比如说做精品调研的时候,你把这个 pdf 啊,七八张产品的截图啊,还有一个行业报告,一股脑全都扔进去, 然后就去问说,帮我总结一下这个机会在哪里?那可能一下子就是大几十万的 toon, 这个绘画直接就变钝了,这个模型就搭的又空又泛,你还以为是哦,模型不行,换一个更好的。这具体呢,我们先讲一下,为什么有些东西它会花那么多的 toon, 首先就是这个 pdf, pdf 呢,它贵是因为它是有一个双份计费的机制在那里,一般官方呢,它是会按照每一页占据的文本和它的页面的图像双份计费, 你基本上一页,比如说大约是两千多凸坑,你以为你贴的只是里面的文字,但事实上是这个 ai 还会阅读后面的背着的一幅图。 所以这个大文件呢,如果你要上传几百页的 pdf 啊,建议哈,虽然知道大家可能不会这么去做,但是建议呢,是先去转成一个纯文本,这一步呢,通常会省掉快一半的吐客量。然后这个截图呢,也是一个隐形大户, 这是因为你一张全屏的截图呢,可能就是意味着让他多读一页半的 pdf。 你 比如说做个竞品,你随便的去截十张产品的图片, 呃,相对来说呢,就是十五张 pdf 的 量,所以这个平常你要是能复制文字呢,就不要去截图。然后,呃,这个官网,官网它为什么是又贵又不可控呢? 是因为你不知道一个网站 html 它基本上是占据几万还是几十万的图腾,很可能一口气呢就把整个绘画都压死了。 这里呢建议的方式呢是你跟 agent 去明确你要一个竞品官网的信息,希望他用子 agent 去挖,只返回那些要点回来。 最后呢,还有一个最容易忽视的机制,就是这个绘画时无状态的,也就是说他每一轮你跟他对话,他都会把前面的所有内容都重新读一遍。 所以真正烧钱的不是你一次性上传了一个大文件,而是你之前上传过一个大文件,然后他在绘画里再被反复的去阅读。 比如说你上传了一个五万字左右的 token 的 这个访谈记录,它这个读了十轮,那累积起来呢,就是重读了五十五万的 token, 它每一轮是真的得带着些东西去做思考的。 第二点呢,就是我们讲一些理论,这样也能更好地让大家理解它这个背后的注意力运转的机制。首先呢,就是这个注意力稀释的问题, 不知道你有没有过一种情况,就是让 ai 帮你去分析,比如说一周的一户对话,然后他最开始归类的还蛮准的,但是往后走他就是开始重复前面的结论啊,你已经纠正过的一些理论呢,他又给你犯了回来,然后你问他 a, 他 开始给你回答 b, 你以为哦,可能是这个 ai 累了,但事实上是它的这个注意力被稀释到用不了了,这个 attention budget 它不是说是有点累,这种比喻是它一次思考里能分给所有的内容。关系的注意力是有限的,比如说最开始 你跟它的上下文长度只有 n 个 toon 的 时候,它要计算的这个关系呢是呃, n n n 平方级别,就是还能判断它谁和谁有关。但是如果你的 toon 上涨了两倍呢?它其实是要处理约四倍左右的关系,然后你给它上传了十倍的 toon 的 这个使用量呢? 那基本上重点就已经全部被这个噪音给淹没了。所以说你材料长了,他丢的不是字面的内容,而是他没有办法去整理哪几件事情是最重要的,彼此之间是怎么个约束关系这种结构感。 所以说 astropics 说这个大窗口解决的是呃放得下的问题。你可能在一个 session 里聊了很久哦,他放得下更多内容了,但是并不能让这个聊天被 ai 看得清。第二个理论呢,就是这个上下文是位置,是有地形的, 这是斯坦福的一个经典实验,如果你要上传同一条关键信息的话,尽量是放在开头或者结尾,这个准确度差不多是百分之七十到七十五,但是如果你放在中间的话,这个准确度就掉到了百分之五十五。 这是因为这个上下纹,他不是一个平面的状态,他是有一个地形,他两端呢是高地,然后中间是低谷 啊,落在我们的身上的话,就是,比如说你有一长段的需求需要提给 ai, 然后你中间呢是有个很关键的约束,比如说哦,你这个需求不能改变以前的某个功能, 这个如果重点你夹在第二段的中间的话,它大概率就会漏掉,这是因为你把它放在了这个大模型的盲区,你尽量在开头或者结尾提及。 第三点呢,就是我们换一个更贵的模型,为什么不行?呃,这个是有家公司专门做了一个实验来回答这个问题,他找了目前十八家主流的模型,什么 cloud 呀, gbt 呀, jimmy 呀,千问呀,全都在呃实验,然后为了同一批资料, 从一万字一路加到十万字左右,然后每加一轮就考他一遍,看他能不能答得准问题,然后发现就是没有例外啊, 这个材料越喂越多呢,它这个准确率呢,是掉了百分之二十到百分之五十。所以说这不是真的,不是一个换一个更贵的模型就能解决的问题,而是上下文管理是需要优化的。味精是多少呢?是我们能够去进行的一些改变。 第四点呢,就是这个 ai 回答的退化比你想的要更早。很多人以为是这个上下文快满了才会出问题,但事实上是大约四千个 token 左右呢,它就已经有这个位置。相应的问题就是你回答要放在前后才能让它记得更牢。 然后差不多三十二 token, 也就是大约两万字中文,它就已经有比较明显的退化了。 也就是比如说你日常是重度使用这个 ai 的 话,你就经常能感受到这个 session 进行到一一定的地步,它就开始说话前言后语不搭,会说效果变差。还有一件事呢,就是工具装多了也是会占据预算,比如说你给他挂了一堆 m c p, 或者上传了很多 skill, 实测呢是你十九个工具还能把事情做对,但是你给到第四十六个工具的时候可能就直接失效了,所以在上三十个 skill 的 时候,你就应该警惕这件事了。整体要讲的这一块呢,就是实际上的这个有效的上下文窗口呢,是圆形 顺丰快递来电喂,你好,放门口就好。谢谢啊。 这里实际上要讲的事情呢,就是啊,这个有效的上塞文窗口呢,是远小于这个名义上的上塞文窗口的。 这里呢,也就给大家一些未料的 s o p 就是 刚讲的。首先呢,这个大 pdf 呢,建议是先转成本,然后如果你有特别大的文件呢,就不要硬塞,尽量去让这个紫 a j 的 去读,然后只把结论带回给我们的主裁审, 并且引用一些页码。然后真正的问题就是你需要把一些重要的一些事情写在开头或者结尾,不要放在最中间。然后如果你会反复使用的材料的话,哎,那确实是没办法,你得知道说它确实会在绘画中反复被调用。 以及呢,如果你要换一个话题了,尽量就是把 spec 抽出来,呃,然后去填给新的话题,这样就能比较好的进行一个继承。 第四点呢,这个改着改着他 a 政的失意了,有没有什么办法把他拽回来呢?那为什么会越纠越错这件事情发生呢?是因为当你去和这个 ai 反复的去聊天,嗯,纠正想法的时候呢,他这个错误的路径也是会留在上下文里的。 这举个例子呢,就是之前有个实验,让 jamie 去玩宝可梦,然后最早期呢,是有一个幻觉放进了这个目标清单里,后面这几千步呢,依旧是围绕着这个错目标在打转, 所以说不要去想着纠正他,这个错误的路径是留在了上下文里,他就是会有这个错误的东西成为他参考的背景。 建议呢,就是依旧是按时,你警惕一下哦,这个上写文战绩差不多了,就带着他的总结的 spec 文档转战一个新的 session, 不要去练战了。 然后剩下一点就是不知道大家平常用什么 ai 啊?我平常用的是 cloud 和 codex 比较多啊,咱们到底选哪个好呢?其实它们各有各的优缺点,还是可以按照它们各自的优缺点去在工作上进行一个分工。 比如说呢,这个 cloud 是 可能沉淀会更省事,然后升任务的话也是给 cloud 比较好,毕竟它现在飞波舞特别强啊,能做很长流程的东西。 然后一些日常的一些小事呢,可以是交给这个 codex, 目前是经过一个统计,蒙皮呢是百分之六十七认为 cloud 的 产出更干净,但是日常使用中呢,百分之六十五的人是更加常选 codex。 我 举个例子哈,这边左右是呃,分别经过 cloud 和 codex 产出的一段文字一样的内容, 他左边这个呢,是我当时写需求文档的时候让他做的总结,他就是会有很多的箭头啊,很精炼的去把很长的一段信息表达出来, 可能比较适合我去看,然后了解说哦,目前发生了什么?但是如果我要是拿给技术去讲解我的需求是什么?显然他不是特别的呃,通人性啊。相对来说呢,你看右边这个文案, 它就很直白哎,旧流程是什么样子,新流程是什么样子,就很适合让大家去了解目前情况是什么。 所以说,我平常会倾向于是先去用 codex 去想些事情,然后想清楚了需要更强的分析成功把这个方法沉淀下来的时候,我再会去把总结内容扔给这个 cloud。 当然,因为我这个用的都是自己本地的文件夹,所以说它们记忆还是同步的。呃,然后呢,你这个 cloud 把事情干完了以后呢,我还是会习惯再切成 codex, 把事情更加通人性地表达出来。 总结来说呢,就是我认为 cloud 更适合把一件事情去想明白,但是 codex 能够把事情去讲清楚。 还有一件事呢,就是建议大家一定要把最新同步的一些口径,及时的让 a h 同步进他的 skill 啊,或者他的各种记忆的 md 里面。 因为他这个普通的文件呀,并不是一个长久的纯属记忆的手段,你也不能天天指望着一个这个上下文哦,你觉得我和他聊了很久天,他有了我这么多记忆,我就一直和他聊下去哦,他一定会记得所有的,以后我 和这一个活相关的,我都去找这个上下文去解决。反正这个 cloud 呀, code 呀,会帮我压缩记忆,让我依旧能够在这同一个 session 里不停地工作。 像咱今天讲的这个上下文呢,是有直线的,它会带着一些错误的记忆,不停地反复。 嗯,它真正比较好的方式呢,是带着一个比较经验的 back 转战。因此呢,建议大家正常的工作流呢,就是呃先跟它沟通,然后把你累积下来的一些东西转到这个 skill 里面,或者 md 里面,然后带着积累的东西转战一个新的 session, 不要在一个一个这个 session 带着你长久的真实的记忆的 session 里面长期的聊赛去理解,你们可能是练就,但是这个方式可能不一定能产出最好质量的活。 然后我跟大家讲讲,一般来说,整个呃你的工作里, ai 它的 tool 主要消耗在哪里? 我这边分为了写和读我日常工作流,比如说可能不少是去写周报呀,日报呀,各种分析呀,还有 skill 开发。在这里呢,大家能看到哈, 在真正的 ai 去写,其实平均下来都没有占据到百分之一,但是让 ai 去读我的各种文档,去读它各种数据呢,它占据的 一直都是高于百分之九十九的 toon 量。所以说 ai 它的大部分 toon 其实都是花在了它读,而不是花在它写。 如果你能比较好的去给它灌输一些知识,用更加的比如说呃省 toon 的 方式的话,那你的 session 能更加的持久,能够跟它进行更多的工作,让它的质量保持在一个比较优的水准。 在最后呢,我也给大家献上我的一些改进。首先比如说周报,我是在呃 了解这个 token 之前呢,我经常就是每一次开新对话呢,发现他有些错误,我就不停的和他反复反复,然后好不容易把一个正确的工作流沉淀下来。在一个赛事里呢,我之后可能就会一直的努力在这个新赛事,在这个呃前面正确的这个赛事里干活, 但是它依旧会导致呃不停地纠正,不停地呃引用以前错误的记忆。但是现在呢,我就比较明确了,我会更新我的 skill md, 把一切正确的一些方法都是更新在这个精炼的 md 里面,然后每一次都开一个新赛事,让它干一些新的活,呃,留神新的活, 然后出报告呢。我以前可能是呃经常会不停地纠正啊,发现实在是他写写字儿太 ai 味了,这个 cloud 压根儿不能用哎,我就可能手写了。但是现在呢,我可能就是会在 codex 和 cloud 之间流转,我把这个 cloud 的 总结一些活扔给 codex, 让 codex 去进行一些文案上的优化,然后有些大材料呢,我现在就不会是直接全都甩到主主绘画里面去,我会让它调用子 a 键,让它只是用子 a 键读,读完了以后把结论返回给我的主裁审,再进行一些操作。 这样呢,以前就是可能我们需要两到三个人去手工去不停做一些日常的统计,很耗时,但现在呢,基本上我每天设一个 task, 它自动化就能产出了,然后我只用去做一个验证的货。 好啦,这就是结尾啦,大家可能呃没有,不知道大家记住了多少,然后具体的很多的一些,呃, takeaway 呢,大家可以去点开我们前面的那个二维码,做一下那个测试, 后面呢,有附上不少的一些结论,以及啊一些具体的参考资料。今天的这个演讲就到这里,谢谢大家。
粉丝21获赞236

现在有很多朋友问我就是 cologold 怎么样接入本地的大模型?今天给大家说一下本地大模型是怎么接入的?然后有两种的方式,第一种方式是通过 cc switch, 这个之前的视频也给大家说过 cc switch 怎么使用的。 然后第二种方式就是我们通过欧莱玛装了本地大模型之后,直接呃对接我们的,通过 setting jason 的 文件直接对接我们的 cologold 的 文件。先说第一种方式,通过 cc switch 来对接本地大模型, 我这边的 cc switch, 因为我之前是通过对接了三种方式,第一个是我是用了 deep seek 的 deep seek, 然后第二个就是用了字节的火山方舟 coding plan, 然后第三呃那个 cloud official 我 没用,因为我没买它官方的 a p i。 然后第四个就是本机的 alama 模型,我也安装了这三种方式都跑通了。先一一给大家说一下,呃, 先说怎么样对接本地大模型吗?然后本地大模型其实非常简单,就是大家在这边添加一个新的供应商,然后新的供应商之后,这里面的填写方式像我这样填就可以了,就比如呃我们的供应商名称随便填一个欧拉玛,然后这边呃上面的标志也可以随便选一个, 因为我这边随便选一个,他就是欧拉玛。然后呃官网的链接,因为我们欧拉玛是本地的模型,这边是填空的,什么都不用填,这个 api k 的 话也不用不需要随便填,大家只要填欧拉玛就行了,你随便设置一个就行了。然后另外就这边比较关键,这边就是需要填写一个本地的端口,然后这个端口是什么意思呢?也给大家说一下。 它这个 http 就是 指的是本地服务,然后 local house 就是 我们自己的电脑嘛,它始终指向我们本地的 ip, 一 二七点零点零点零点零一嘛, 然后这个一一一四三四,它就相当于我们本地的端口号嘛,就是我们奥拉玛呃,本地运营大,本地大模型的工具,它是默认这个端口的,所以就是当我们安装奥拉玛之后,会提供一个 api 服务来监听这个端口,所以我们这边要设置呃,在 cc switch 里面要设置这个东西,就它的是请求地址, 这个就是像这样原声的填就可以了,认证自盾也是这个。然后另外这个这边模型的话,就是我们本地安装的模型,你要看一下我们本地安装了哪些模型,比如我这边就是运行了奥拉玛里斯,这边可以看一下,比如运行这个,他这边就我我之前安装了四个模型啊,就是千问三点五九 b 的 千问斯,呃,伽马寺那个 e 四 b, 然后还有干妈四三十一 b 以及干妈四 e two b。 因为我的只有一个独立显卡,就是八 g 的 显存,所以我只能一般是用切分三点五和 e two b 的。 然后这边的设置就是直接把你需要设置的模型,比如复制两过来就行了,然后底下这个东西就会自动生效, 保存好之后就行了,然后我这边就会在使用中给大家看一下效果。我这边就刚问他们,我是他什么大模型,他其实就是干妈四 deep 呃,谷歌 deep money 的, 然后我们可以切换模型的,就是我刚这边安装了是千万三三点五九币和干妈四 e two b 嘛,然后这边就可以选择嘛,你可以选择不同的模型, 我这边就可以切换到切切换三点五九 b 这边之所以能切换是因为我这边只设置了这两个模型,你看只设置这个,当然我这个也可以设置一四那个一一一 four b 都可以, 这是本地大棚型的设置,这是呃,我觉得通过 c c c v 是 最方便的,我们也可以切换到 deepsea, 我 这边切换到 deepsea, 然后就可以很方便的从本地切换到云端了。我就说你好, 它这边是因为呃切换模型之后需要重启一下 cloud, 我 们重启一下就行。 比如我这边重启一下,它就会呃启 用我们的 dips pro, 很 方便的一键切换。然后这个前面就是我之前装的 cloud mail 那 个插件,就它每次启动它都会查取呃最近五十次的 通话内容,就是回忆一下我们之前的那个记忆,这个我就记个记忆插件,非常好用,它是自动自动启动的,然后它上面有你的新增功能啊,还是重构啊,还是改变,它都会给你标出来你之前做了什么样的东西。 我觉得这个非常好用,然后比如它当前它就会告诉呃 vr obv observation 在 这个端口就相当于在这个端口,这就跟我们刚刚那个呃奥奥拉玛端口不一样了。 然后给大家说一下,就是呃关其他的大模型厂商他们的 apis 怎么对接的,其实也很简单,就是我们的 a, 我 拿 deepsea 举个例子,这边顺便说一下,比如 deepsea 这边,他的 u i 只需要填 u i l 啊,就是我们的 u i l 就是 open i 或者 osrogic, 因为 cloud code osrogic 吗?我们只需要复制这个链接,把它填到这就行。然后 apikey 就是 我们自己设置的,这边主模型的话就是 v s pro flash 三点二、三点三点二都可以, 因为马,因为那个三点二后面不是要七月二十号要弃用了吗?就是之前的 chat 和 reason, 一个是 syncing, 一个 on syncing 的 模式,在里面 ipikey 只要设置一下就行了。 然后还有一种方式就是通过线上的,这个我觉得是同样的道理啊,大家就是相当于之前的那个接收文档,就是它这边也会写好的,就是主要就是这个,呃, 这个 anastropic base u i l 给它填好就行了。然后这个这个 token 也是随便填的。然后这个模型就是我们刚设置的那些模型,其实是一个道理,这边就不细说了。

如何利用 hotcode 在 短时间内成为一个还不错的面试官?最近我也是在不停的面人招人,他自己的日常工作比较繁忙,我就探索出来了一套 能利用 code code 节省我百分之六十的面试准备时间的一套流程。今天就给你分享一下,主要分为四个步骤,第一个步骤是提示词,提示词强烈推荐大家一定要用 千万的电脑版的语音输入,这个时候你就会发现你的 web coding 的 效率大大的提升了,你会想跟 ai 说很多很多东西。那第一步 作为一个面试官,提示词是什么呢?你要跟他说你现在是什么样的角色,你要想招到一个什么样的人,你要对这个人有一个清晰的画像,比如说我要招一个主动性特别强的人,语言等等技术等等。 你要有一个大概的一个能力的模型,然后你要说你的面试结构,你想大概是什么样子的, 开始是比如说自我介绍后面是什么硬技能的问题,然后软技能的问题,最后在一些 basic 的 问题等等,然后你再跟他说一些额外的要求,以及你大概写一下每个板块你想用的问的什么样的问题。那当你给他输入这些之后, 第二步就是等给你的回答,然后你会发现他会给你第一版,这个第一版大概他已经完成了百分之六十你想要的东西,那怎么样能让这个东西进一步生化成为你更加想要的东西呢?第三步我会 根据第二步的内容,让他去搜索目前网络上 top five 跟他的问题 match 的 答案,跟他自己生成的答案作比较,以免生成 ai 的 这种错误的有误导性的答案,保证答案的真实性。 那这样的话我有大概三十到四十个问题,就节省了我将近四到五个小时搜索的时间。那到了最后一步,第四步, 那 ai 给你的这个文件,比如说我当时要的是一个 excel 的 文件,那这个排版上面肯定有一些你觉得还不够满意的地方,你可以把它进一步按按照你的要求让它去更改这个 excel 的 排版。最后的最后 很重要的一步就是你让 card code 把这个你跟他对话的不断优化的所有过程,让他生成一个 skill。 那 你以后如果是需要面试不一样的角色 你,你就可以让他根据你生成的新的画像,新的能力模型,按照你这样的优化过程生成一个类似的面试提纲,是不是省了很多时间呢?

然后这个老哥做了一个很疯狂的事情,他就把这篇文章喂给 claude, 然后让 claude 用 auto research 对 大家好。我今天看到一个非常疯狂的新闻,就有一个叫 dan woods 的, 他成功在自己的 macbook pro 上面, 那是 msi max 芯片啊,在自己的电脑上面跑通了最新的千万三点五,三百九十七 b 的 那个模型,就那个模型本身要求的内存是有两百零九 g, 但他在自己的电脑本地端跑起了这个模型, 而且可以达到五点五个 token per second 还是很慢,但就你知道这件事情结果上就很疯狂,而且他做的过程更疯狂,他是直接把一篇论文丢给 cloud, 让 cloud 去实现那篇论文里面的思路,然后把这个事情做出来。 为什么能做到这个事情呢?就是因为你知道那个千问三点五,它是一个 mixture of expert 模型,就是混合专家模型 m o e, 所以 说 m o e 模型里面它有很多个专家模型, 然后一个 token 进来的时候,它只会激活某些专家。做推理的时候,一个 token 进一个 m o e 模型,它就有某些权重会被激活,然后有一些权重是不激活。二三年苹果发一篇文章叫 l m in a flash, 这篇文章就是说如果有一些权重不激活,那你为什么不干脆把那些权重放到 s s d 上面去?然后你只是在一个 token 需要推理的时候,你把那些会被激活的专家模型的权重拉到你的内存里面, 然后呢,你不需要他们的时候,你再把他们丢回 ssd, 就 这么一个简单的思路,那因为推理的过程中还有一个特点,就是 token 之间会有比较高的相关性嘛,所以通常来讲会被激活的那些专家模型,他们也是比较相同的。 你一个这样模型的权重读进你的内存里面呢,你还不用很快的把它释放,因为下一个 token 可能还会需要到这些。那总体就是说,由于你可以把一些权重放到 ssd 里面,所以你的内存不需要放那么多的权重。因此即便是一个猜测量很大的模型,你也可以把它大部分放到 ssd 上面,然后小部分放到内存上面。 这个是那篇文章的思路啊思路。然后这个老哥做了一个很疯狂的事情,把这篇文章喂给 claud, 然后让 cloud 用 auto research。 auto research 是 最近 angelica party 开园的一个项目,这个项目简而言之呢,就是说你可以给 ai 一个目标,然后在这个过程中呢, ai 会自动地去探索路径。怎么去达到这个目标?那通常它是被用在神经网络的训练上面,比如说 ai 可能会自己发现一些新的呃网络结构, 比如说它会改变某几个层的顺序,然后使得你在 auto research 的 这个层的顺序会更好。那这个哥们呢,他也是用 auto research 的 这个范式, 他 ai 自己想办法去把千万三点五呃三九七 b 这个模型通过苹果的那篇论文给出来的方法论, 不断地进行各种尝试,最终让他能够在他的 macbook 上跑起来。那,那这个过程中 clock code 就 不断地尝试嘛。最后他一共写了五千多行的 objective c 加加, 他写的那个 object c 加加是为了呃完成刚才我讲的说从 ssd 搬权重放到内存,然后再把一些内存上的权重丢回 ssd 上,这个过程用 object c 加加做这个就会更快,这全部都靠自己发现的路径。 还有一个呢,就是靠发现了可以对权重进行量化,所以说本来可能是三十二 bit 的 权重,最后把它量化到了四 bit。 那 量化完这个权重呢?他又写了一千多行的 metal shader 的 代码,就是说能够把这个四 bit 的 权重再解压回一个正常格式。因为苹果自带的 mlx, 它只能处理三十二 bit 或者十六 bit 的 格式,它处理不了四 bit, 于是靠着自己造轮子,造了一个能处理四 bit 的 一个 shader。 这件事情也非常离谱, 在写了一堆 object c 加加代码,写了一堆 metal shade, 还有一些其他的杂七杂八的代码之后呢, called 成功地把一个千万三点五三九七 b 的 模型在一个 macbook 上跑起来,而且它最终每秒钟可以突出五点五个 token, 不 算慢了。你要知道这是一个三百九十七 b 的 模型, 这哥们呢,就把它做研究的整个过程全部都开源了,就传到 excel 上面,大家如果有兴趣的话可以去看一下,我觉得这个非常惊艳。两个 takeaway, 一个就是今年的 ai 的 执行能力跟前几年是完全不一样。从二零二五年十二月开始, angelcare 自己讲,他已经不用手写代码,没有银行代码是自己写。 然后第二个声音就是说,从 idea 的 产生到落地的这个速度,几乎你现在可以说用光速来听。 就这哥们,他什么都没做,他只把一篇文章喂给了 ai, 让 ai 自己去 auto research, 然后 ai 就 auto research 出来。我觉得今年大家一定要做的一个事情,就是说如果你想要做一个什么事情,直接让 ai 去做,然后呢?如果你想不到好的方法,你可以让 ai 去读论文, 就你把一篇好的论文喂给 ai, ai 一定能给你找到一个好的方法。你相当于有两个杠杆,一个是一个执行力的杠杆, ai 可以 不知疲倦的为你解决问题。另一个你还有知识共同体的杠杆, 就是太多人把他们的研究成果公开了,这里面只要少部分是有质量的,把这些东西拿给 ai, 让 ai 去做,你就可能在一个周末做出一件之前大家完全不敢想象的事情。那今天就跟大家分享到这里,我要去玩一下这个项目了,拜拜。

我也想用口袋也是扣了扣子,奈何我不会安装,咋整?没想到第一步就难住了这么多人。 好了,不整虚的,今天直接教你一个最简单的办法,先下载安装一个国内的 ai 准则,比如 word、 板碟、吹握等等都可以,他们都是同类的东西,都是可以帮你干活的那种,粗活嫩活细活都能帮你干。打开官网下载安装就行了,就跟你下载安装微信是一样的。 装好之后呢,跟他说一句话,帮我安装 codex a p p codex c l m。 我是 一个纯 ai 小 白,完全不懂得你全程帮我管理就行,需要我授权的地方让我点一下就行。好了,就这一句话,不需要太多,接下来所有的事情就交给他来干,包括下载安装、配置环境,输入命令行处理报错等等。 你只需要在他问你要不要继续的时候点一下鼠标就行了。很多人被卡住了,其实在我看来并不是完全不会弄,我觉得主要是两方面原因,一是好奇心不够,你只是知道有这么多东西也想试用一下,但是一碰到点问题呢,就卡住了,不愿意去想办法解决。 但是如果你的好奇心足够重,一定会想知道为什么别人天天说他好,他好在哪里, 而是你的需求不够强烈,你只是有那么一点点想试用这个产品,并不是非常强烈的需要。如果你真的很想让他来帮你处理工作上的问题和员工的效率, 那你一定会想尽一切办法来向他安装好。说到这里,我忍不住多说两句,我觉得做任何事情都是一样的,不要一碰到点问题就卡在那里不动了, 多问问自己内心真实的想法,希望达到什么样的目标,然后呢?通过这个目标呢?反向去问自己往前多走一步,遇到问题就解决问题,不要选择逃避。

你在豆包千问上使用的这些智能体,在七月十五号之后就要关了,所有的参数啊, n 记录啊这些都要没有。有意思的就是在国内把这类能记住你的功能的关掉的同时,大洋彼岸对面的 astrobic, 他们的应用团队在今年六月份呢,在伦敦 ai 大 会上面讲,主题是智能,它不会自动生长。第五十个任务跟第一个任务其实是一样的, ai 它不会长记性。就这件事,真正我要提醒你的是,你把 ai 用好的能力 不该寄生于某个平台和某一个功能之上,他说下线就下线,真正不会被下下,真正不会被下架的是你自己管理上下文的能力。怎么练呢?我今天给你们三个办法。第一个,一诗一绘画,别在同一个对话框里干八件事,你前脚跟他说让他写辞职信,后脚你让他写文案, 嗯,他会把这种情绪带过去,然后你还觉得他特别阴阳怪气。换个任务就开一个新的对话。第二个呢,固定的东西就要放在固定的地方,你是谁,你做什么,什么风格啊这些不变的放进项目,或者说自己指定里面,让他每次自动带上这个, 我自己在卡子里面专门建了一个项目,然后把这些东西全部丢进去,每次呢,他自动会带着,就不用我重复的去递交些事情了, 临时的活才丢到单独的对话框里面。第三个,聊长了就清空,重开一个对话,拖太久 他会被里面过时的信息给带偏了,开始犯迷糊。这时候别硬撑了,开个新的,把有用过的结论复制进去就可以了。我平时用 cloud, 也用 qqpt, 但这三个功能在所有的 ai 上都通用的平台的功能会变,说下线就下线,这些习惯练出来之后呢,才是真正下不了架的东西了。

open a i 的 高管狂抽 astonic 的 脸。 open a i 的 高管最近讲了一句非常有意思的话,他说 kimi k 三是一款非常好的模型,它的性能不能简单地用真牛来形容。这句话虽然是在讲 kimi, 但是实际上它就把 astonic 在 过去几个月讲的故事给它拆穿了。为什么呢?因 因为 kimi k 三和千万三点八发布之后,有一个事实已经越来越明显了,那就是现在第一梯队的大模型之间可能还有强弱,但是不存在绝对的代差,也就是现在基本上看不到掐着 g p c 四那种领先其他大模型好几代的那种情况出现了。 kimi k 三和千万三点八整体可能还弱于 f 五或者 g p c 五点六,但是这四款模型之间的差距,从 你能做,我完全不能做,变成了这个任务你的成功率会高一点,但是我也能做,而且我更便宜,包括 g p d 五点六。它比 five 五发布的其实更晚,但是依然没有实现全面的领先 five 五。这其实也从侧面证明了大模型的能力,想再往前进一步,难度会越来越大, 各个 ai 之间的差距反而会越来越小。反观 arcep, 过去的一段时间啊,一直在强调中国的模型,真牛 cloud 啊,批量注册账号,绕过访问限制,甚至还把这件事情上升到国家安全和产业竞争,这些指控不一定全部都没有依据。但是真牛本身它就是 ai 行业普遍的一个技术路线, cloud 自己也蒸馏过其他的 ai 产品,现在的情况就很有意思了。 open ai 自己的战略负责人都承认, kimi 的 能力不能只用蒸馏来解释,那就意味着国产模型不是说只会抄作业,它们的背后一定还有自己的技术路线在。 所以我的观点一直都是, astonropik 不 断地强调蒸馏。 open ai 的 高管又开始讨论中国的开源模型的成本, 开源模型的安全和监管问题,本质上都是闭源模型开始着急了。闭源模型真正着急的不是说今天的 kimi 或者说千万在某一个榜单上超过了自己,而是 kimi 这些开源的 ai 证明了 可以用百分之五闭元模型的价格就能够达到百分之九十五闭元模型的能力,这个是 open ai 和 sarpik 这些闭元模型不能接受的。所以 kimi k 三和千万三点八发布,真正意味的不是说中国的 ai 已经全面超过美国 ai 了,而是目前前沿的 ai 大 模型正在从少数公司的独家能力变成越来越标准化的技术设施了。 闭元模型真正害怕的不是说某一个 ai 赢了它一次,而是以后大家再也不相信只有 open ai 和 astra pic, 或者说只有闭元模型才能做出最强的人工智能了。

最近很多人问我,为什么玩 cloud code 的 老玩家,最后都悄悄把模型换成了 deep seek。 明明 cloud 三点七 opus 那 么强,为什么反而推荐用 deep seek? 今天这个视频我就把技术原理给你讲透,听完你就知道为什么这是目前最香的组合。 先说清楚 cloud code 是 什么?这是 entropic 官方推出的命令行 ai 编程助手,你可以理解成一个住在你终端里的超级程序员,能直接读你的项目、改代码、跑命令、提交 git, 完全不用你手动复制粘贴。 它用的是 entropic 自家的 messages api 协议,这是 cloud 生态的标准接口。 再看 deep seek, deep seek 是 国内深度球所推出的大模型,代码能力极强, v 三版本在各种编程评测上跟 cloud 三点七 opus 打得有来有回。关键是它的 api 不 仅便宜,速度快,国内直连不用搭梯子,而且 它完美兼容了 andropic 的 messages api 协议。这就是整个故事的核心。为什么 deep seek 能适配 cloud code? 核心就四个字,协议兼容。 cloud code 发请求走的是斜杠 v 一 斜杠。 messages 接口用的是 anfropic 规定的请求和响应格式,而 deep seek 直接在自家 api 里实现了一套一模一样的接口,路径一样,参数一样,返回格式也一样。 我们来看具体怎么兼容。请求头里, cloud code 会带 x api key 和 entropic version, deep seek 的 接口也认这两个头,只是把 api key 换成 deep seek 的 就行。 请求体里 model 字段、 messages、 簇 max、 下划线、 tokens、 temperature 这些参数。 deep seek 全支持字段名和数据结构完全一致。 最关键的是流式输出, cloud code 依赖服务端推送事件来实时显示打字效果,也就是 sse。 不 仅支持流式,连返回的事件格式都跟 antropic 一 模一样, message 下划线 start, content 下划线 block 下划线 start content 下划线 block 下划线 delta, message 下划线 stop。 每个事件类型、每个字段结构都对得上。 再看工具调用,这是 cloud code 的 核心能力。 cloud 调用工具时,用的是 tool 下划线 use 类型的 content, block 返回结果用 tool 下划线 result。 deep seek 完全实现了这套逻辑,包括工具定义、格式参数传递、多工具并行调用、工具调用 id。 这些细节 deep seek 都做了兼容。 那配置有多简单?说出来你可能不信,就两步。第一步,把 cloud code 的 andropic 下划线 base 下划线 url 环境变量改成 deepseek 的 接口地址。 第二步,把 andropic 下划线 api 下划线 p 换成你从 deepseek 控制台申请的 p 就 这么多,不用改代码,不用装插件,启动就能用。 为什么我最推荐这个组合?原因有四个,第一,性价比爆炸, cloud opus 贵不说,还得搭梯子。 dixic 的 价格只有它的几十分之一,还经常送免费额度。第二,速度快,国内直连没有延迟,长代码生成不会断流。 第三,中文好理解,中文需求和注视比 cloud 还到位。第四,代码能力真的强,日常写代码改报完全够用。 当然,我也得说句实在话,它不是没有缺点,在超长上下文推理、极端复杂的系统架构设计上, deepsea 跟最顶级的 cloud 三点七 opus 还是有一点点差距。 但是这一点点差距,对百分之九十九的普通开发者来说,你日常写代码、做项目、改 bug 根本感知不到,而便宜、快、稳这三个优点你每次用都能感受到。 最后给大家几个使用建议,第一,模型名选 deepsixchat, 这是 v 三版本代码能力最强。 第二, max 下划线 tokens 可以 设大一点,比如八千一百九十二,或者一万六千三百八十四,让它一次多写点。 第三,如果遇到工具调用,偶尔抽风重启一下 cloud code 就 好,这是小问题。第四,关注 deep seek 更新,它们家迭代速度很快,兼容性只会越来越好。 所以总结一下, deepsea 能适配 cloud code, 根本原因是它老老实实做了 andropic messages api 的 全协议兼容,不是那种半调子的兼容,是从请求头到流逝响应,从工具调用到错误处理,全套都对齐了, 再加上便宜快,文中文好这几个优点,这就是为什么现在老玩家都在偷偷用这个组合。别再死磕官方 cloud 了,试试 deep seek cloud code, 你 会回来谢我的。

最简单的方式使用 cloud。 第一步呢,先别急着让 ai 开工,把你的想法先丢给 cloud, 然后呢,明确的告诉他,不要直接给方案,先一个问题一个问题的反复的问我,直到啊你完全理解我要做什么。 这个动作呢,就是反向的提问,他能够把一句啊很模糊的想法问成一个清晰的产品需求。第二步就是当这个 cloud 啊已经问得很清楚以后, 让它输出一份 p r d 文档,也就是啊,产品需求文档里面呢,要写清楚目标的用户核心的功能,页面的流程,数据结构、边界的条件,再让它呢顺手生成一组界面或者配图的提示词,后面做页面和素材的时候会更稳。第三步呢,把这一份 p r d 的 文档啊拖进去, 然后输入一个目标,比如啊杠 go follow prd, 意思就是让它围绕着这个需求文档啊持续地推进,而不是你一步一步地盯着它写,这样你的工作就从不断地催 ai 做下一步,变成了先定义清楚目标再回来啊验收结果。想用 ai 做 app 或者网站的呢,可以试试这个方法。

嘿,我是俊,二点四万亿参数直比 cloudfob 五弱。千问三点八刚露面,阿里就扔出了两个最炸的数字,但先别急着把它封成世界第二,因为今天我们看到的更像一张预告片,不是一份完整成绩单。先说已经确认的千问,三点八, max preview 已经进入阿里 token plan、 qdr 和 qdr work, 阿里云官方文档也已经列出这个模型,可以配合网页搜索、代码解释器、网页抓取和图像搜索等工具。千问还宣布,正式版和开放权重即将到来。还有一个容易混淆的点,预览版已经能体验,不等于正式版已经发布,更不等于开放权重已经落地。现在能测的是在线入口,尚未交付的是完整权重。第二个确认 是二点四 t, 也就是二点四万亿总参数。参数可以理解成一家公司的总编制人数更多,理论上能容纳更多能力。但公司有十万人,不代表每次开会十万人都到场。现在阿里没有公布激活餐数量,也没有完整模型卡,所以我们还不知道他每次推理实际调动多少参数,速度、成本和稳定性又是什么水平。 争议最大的是仅次于 cloud 飞豹五。这句话来自千问自己的官方定位,不是独立榜单给出的结论。到目前为止,公开信息里没有千问三点八的完整斑斓 mark 表,也没有第三方同条件复测。换句话说,厂家说这辆车赛道第二,但圈速、能耗和耐久测试还没交齐,那它是不是不值得期待? 恰恰相反,一个两万四千亿参数,面向多模态计划开放权重的中国模型,如果最终真能把代码 agent 图像理解和长任务做稳,影响会很大。它可能同时冲击币源模型的能力上限, 也把开放模型能做到什么往前推,但可能不等于已经普通用户现在可以做三件事,第一,把它当预览版测试,不要直接替换生产流程。第二,用同一组真实任务比较谦问三点八, facebook 五和你正在用的模型记录成功率、耗时重试次数和总成本。第三,等三张答卷,公开 benchmark 完整模型卡和开放权重日期。所以我的判断是,千问三点八,已经成功抢走了注意力,但还没有拿到世界第二的证书。二点四,万亿证明它够大,真正决定它能不能站住的是可复合的成绩和稳定交付。关注我,分享更多 ai 使用心得。


抖音号被拉黑了怎么办?首先找另外一个抖音号来搜索拉黑你抖音号的号,从这个号里面拖出他 他的关注或者粉丝的任意一个号,然后再用拉黑的抖音号来搜索他的关注或者粉丝的任意一个号,从这个号里面拖出拉黑你抖音号的号,将他也拉黑,轻松搞定。
