我朋友刚刚发布了全新的 g p t 五点六,起名名字 so, terra, luna, 这次呢,都是按照天文学给 命名的超大杯, so 呢,是直接对标 missiles 大 杯, terra 应该是跟上一代的旗舰水平差不多,就是五点五差不多,价格呢,却只有一半,应该做了蒸馏中杯的 luna, 相对平民百,每百万头肯输入只需要一刀,应该是价格做了大规模的优化,量大环保。 因为五点六呢,暂时只降约二十家受信合作伙伴开放 a p i 和核电访问,普通用户呢,短期是无缘体验,但官方说法是未来几周之内会逐步开放。 so 的 定价呢,目前看是跟 mitsui 差不多的,比 mitsui 略便宜一点,输入是五美元,输出呢是三十美元每百万 token。 那 它的优势呢,是在编程生物网络安全,比如说目前他们衡量的 ai 编程能力的一个基础, terminal batch 二点一,上 gpt 五点六 so, 再其次呢才是 called mitsui 基本上前十名都被 g p t 和 cloud 干绝。这个排行榜上,五点六 so ultra 的 分数呢,是九十一点九分,对于来说, cloud 的 opus 四点八只有七十八点九,而 jamaica 四点一 pro 只有百分之七十点七。在有关网络安全的 exploit batch 上面, g p t 五点六 so 的 表现也非常出色,几乎打平了 mister preview, 但是消耗 token 呢,只是 mister preview 的 三 之一。在生物学方面, openai 跑了一个专门做长链条基因组学和定量生物学的分析能力基础基因 bench v 一 so 仅用了很少的头壳就完爆了上一代的 g p t 五点五医疗领域同样涨幅很猛, health bench professional 上, so 拿到了六十点五分,比 g p t。 五点五高出了八点七分。除模型以外呢, openai 则也推出两种推理模式,一种呢,叫 max, 就是给所有更多的时间思考,让推理链条更长,可以说是一个整体模式。第二种叫 auto, 在 这种模式下呢, auto 不 再是单一模型的独立思考,而是会自动拆分复杂任务,启动一组,指智能体做并行并做总结。 所以呢, auto 呢,这个其实不能算是单一模型了,应该算是智能体模式。所以呢,看来 g p t 也学会了 open router 和复古的方式,就是用多个模型来超越 midos。 所以 max 呢,可以理解是让一个人想得更久。 archiver 呢,是召集一个团队来做。同样值得注意的是, archiver 呢,他并不是用多个 gpt 或者 good idea, 而是模型自己完成任务的拆解和调配,开发商只需要提出需求,所以他呢,是部分的把 agent activation 的 能力呢,训练到了模型里面,成为了大致上的。目前的 sota 的 成绩呢,就是用 archiver 模式。 当然了, g p 五点六并不是完全没有副作用,在外部的机构 mit 上的 so 的 在测试中的考试漏洞作弊减出值呢,是异常高,高到 mit 团队呢,直接放弃出分。我们现在的解释是任务执着度增强的副作用这个模块。也可能也是为什么目前 g p t 没有直接公布五点六的原因,而是要等几周时间的安全。对, 那我稍微分享一下,虽然现在 g p t。 五点六跟 missus 包括 fable 是 遥遥领先其他的模型的,但是能看到很明显的一个趋势就是 agencic 的 trees 数据用来做模型的训练已经变成了大家下一步的零重点,谁有更多的 codex 和谁有更多的 harness 数据,谁就有可能训练出下一代的 优势模型。类似的逻辑呢,其实最近 matea 推出的一款液化版的千玺四百九十七币也用同样的自增油的方式实现了 oppo 四点八的水平。 对,其实在哈士奇驾驶下呢,其实模型的升级对于 s t 模型的 s f t 蒸馏的依赖呢,其实是在下降,这点呢,我后面会专门出一期视频分享,不依赖于对 s t 模型蒸馏的模型的训练方式。
粉丝4.7万获赞36.3万

上次我发布了 codex 教学视频,不少小伙伴反映没有办法订阅叉 gpt, 所以 根本用不了。确实啊,订阅叉 gpt 的 门槛不低,不过换个思路,其实并不一定非得要用 openide 的 模型。今天这期视频我就给大家演示一下如何使用国产模型来驱动 codex。 全程不需要使用 openide 的 账号,我以 deepseek 为例,但原理是相通的, g l m kimi 等等都可以照着做完。看完这期视频呢,就可以举一反三。好话不多说,让我们现在开始。 我们需要打开 openide 的 页面,然后点击这个按钮来下载 codex。 下载完成了之后,我们按照正常的方法来安装 codex 就 可以了, 安装好了之后, codex 会提示我们登录它。呃, codex 呢,一共是给了我们两个登录选项,第一个是使用叉 g p d 账号登录,第二个呢是使用其他方法登录。不过如果你点进去的话,就会发现,这所谓的其他方法其实就是使用 openai 的 api key。 因此无论使用这两种方法中的哪一种方法,你都需要有一个 open n a 的 账号。这个呢,其实也就是难倒大部分的地方了,我们今天就是要绕开它,所以呢,我们先把 codex 给关掉,等后面配置好了之后,我们再打开它。 下面我们来申请使用 deepseek 的 api key。 首先我们打开 deepseek 的 用量页面,如果你从来没有充过值,那这里面的余额显示的应该就是零, 这个时候你需要点击去充值,充够五块钱基本就够了。充完了之后,我们进入到 api keys 页面,然后点击这里面的创建 api key, 这里我们需要给 api key 输入个名字,我这里就叫做 default 就 好了。输完了之后,我们点击创建按钮来创建这个 api key, 然后 deepseek 就 会把 apikey 展示给我们看。需要注意的是, deepseek 后面再也不会给你展示这个 apikey 了,所以我们需要把它给复制下来,然后找个地方存一下,存完了之后,我们点击关闭按钮,把它给关掉。 啊,那这样的话, deepseek 这边我们就配置好了,下面我们来处理一下 cc switch。 cc switch 是 什么呢?简单来说,它能够帮助我们配置 codex, 让它去调用第三方的模型。下面我就来演示一下如何安装和设置 cc switch, 好 让 codex 成功用上我们刚才创建的 deepsafe api key。 首先我们打开 cc switch 的 官方网站,点击这里面的免费下载 之后呢,我们就会被引导到对应的 github releases 页面,我们把页面往下拖,一直拖到这里面的 assets 部分, 然后我们点击这里面的 show all twenty one assets 之后,我们就可以看到所有可用的下载选项了。呃,你可以根据你的需要下载,比如说如果你用的是 windows 的 话,那你大概率要选的就是这个。呃,我这里用的是 macos, 所以呢我要选择这个选项。 下载完了之后,我们打开对应的文件夹,然后呢再点击对应的文件。呃,安装过程呢,也跟普通软件一样,像我就直接拖进去就好了。安装完成了之后,让我们打开 cc switch, 进来之后, cc switch 会给我们显示出两个配置来,这两个配置其实跟我们都没什么关系,所以不用管它,我们需要新增一个配置,让我们点击右上角的加号按钮,然后我们就在这个预设供应商里面选择 deepseek, 再把页面往下拖,在这里面呢,粘贴上我们刚才复制好的 apikey, 然后再点击右下角的添加按钮,这样我们一个新的配置就创建好了,就是这个地方了。 之后我们要做的事情就是启用它,让我们把鼠标移到这个配置上面,点击这个启用按钮。注意啊,此时 c c switch 给我们提了一个警告,说是此供应商使用 openai chat 接口格式,需要路由服务才能够正常使用,请先启动路由。 呃,那这是什么意思呢?具体说来啊,就是 codex 使用的是一种叫做 responses 的 接口格式,而 deepsea 或者说是大部分的模型供应商只提供一种叫做 chat completion 的 格式,两者互不兼容, 因此我们就需要使用 c c switch 的 路由功能,在这两种格式之间做转换。这个路由功能呢,会把 codex 发给模型的请求转换为模型所需要的 chat completion 格式, 也会把模型发给 codex 的 响应转换为 codex 所需要的 responses 格式,这样的话,即使格式不同, codex 和 deepsafe 之间也可以互相交流了。下面就让我们来打开这个路由功能, 首先点击上面的齿轮图标,来到设置页面,然后再点击这里面的路由,再点击这里面的本地路由,然后把这个开关打开, 这个其实就是在主页面里面显示这个格式转换的路由开关了,这样的话我们后续开启这个开关就会方便很多。然后我们返回,可以看到开关已经显示在屏幕上面了, 我们剩下的任务呢,就是直接点击它开启,开启了之后一切就准备完毕了,我们来打开 codex, 你 看我们直接进来了,没有要求登录 openair 的 账号,让我们随便发一个消息试一下, 看起来也很正常。不过吧,这里面其实有个问题, deep seek 呢?其实是有两个模型的,分别是叫做 deep seek vs flesh 和 deep seek vs pro。 那 我们现在用的到底是哪一个模型呢? codex 这里面好像是看不出来啊,它只是把模型标志成了 custom。 要确认具体用的是哪一个模型,我们得回到 c c switch 里面来看一下。进入到 c c switch 之后,我们点击这里面的编辑按钮,然后往下拖,这里面呢,有这么一行话,从这一行可以看出, codex 目前所使用的模型是 deepsea v 四 flash。 那假如说我们想把模型切换成 deepsea v 四 pro 的 话,该怎么办呢?一般来说啊,其实 codex 里面是可以做模型切换的,大致呢应该就是在这个位置了。 不过你看这里面呢, codex 既不显示当前所使用的是哪个模型,也不提供模型切换按钮,感觉就像是一个 bug。 不 过我也说不清楚这是 cc switch 的 问题还是 codex 的 问题, 也许等你看到这期视频的时候,这个问题已经被修好了。如果你还是遇到同样的情况,这里面有一个临时的解决办法。 不过这里先说一句,这个办法需要一个叉 gpt 账号,当然我知道很多人就是因为没有账号才来看这期视频的,没关系,如果你没有叉 gpt 账号的话,可以先跳过这段,后面呢,我会演示一个完全不需要账号的办法。好,如果你有叉 gpt 账号的话,可以点击这里面的 settings, 然后再点击 logout 登出。 登出之后呢, codex 会提示重新登录,这里面我们选择第一项登录,具体登录过程呢,我就不演示了。登录完成了之后,我们再进入到 codex, 就 能够看到我们现在所使用的模型列表了,我们还能够在 flash 和 pro 两个模型之间任意切换。 虽然我们刚才登录的时候使用的是 openid 的 账号,但登录好了之后,实际显示和使用的依然是 deepsea 的 模型,这步登录只是用来绕开那个 bug 的。 这个方法确实是能够行得通的,不过呢,它有些问题,我相信很多人就是因为没有 open a 的 账号才转去使用第三方模型的,所以呢,这个方法对于他们来说肯定是用不上了, 而且这个办法也不是一直有效,比如说当你重启 cc switch 和 codex 之后呢,它就会失效,模型呢,会重新变成 custom, 还得重新登录一遍,其实挺麻烦的, 考虑到大部分人写代码的时候呢,只会用到一个固定的模型,所以一个更简单的办法呢,就是在 c switch 里面把默认模型改成固定的模型,比如说我们就可以把它改成 deepsea v。 四 pro 以后所有的对话都用这个模型。 具体来说,我们就是要回到 c c switch 这里,然后点击编辑按钮。在这里面呢,我们就需要把默认的模型改成 deepsea v 四 pro。 不 过说实话,我看了一圈,目前 c c switch 好 像并没有提供直接切换模型的选项,不知道是不是我有所遗漏啊,但我发现可以用一个小技巧来实现这个功能。 我们可以在这里面找到模型映设这一栏,然后把里面的 deepsea v 四 flash 这一项给删掉。删完之后我们就剩 pro 这一项了,我们再点击保存,然后我们再回到编辑这个页面看一下, 可以看到这里面的 model 就 变成了 pro 这个模型了。这个时候呢,还没完,我们还需要重启 c c switch 和 codex 之后才能够生效。我们可以先关掉 c c switch, 然后呢回到 codex 这边,把 codex 也给关掉, 全部都关掉之后,我们再重新打开 c c switch, 然后再打开 codex, 这个时候呢,我们的模型应该就改成 pro 模型了,我们可以打开 codex 的 配置文件验证一下。我用的是 macos 配置文件呢,是放在用户目录下面的,点 codex config, 点 tomo 这个文件, 你看这个就是我们目前所使用的默认模型了,就是 deepsea vise pro。 我 们可以回到 codex 这里验证一下我们的这个模型是否可用,让我们来新建一个绘画,然后随便输入个请求, 可以看到 codex 正常回复了。当然如果你想彻底的确认是否是 pro 模型的话,可以去 deepsea 后台查一下,不过这大概率是没什么问题的。 最后还是希望你看到这期视频的时候,这个问题已经被修复了,省得再折腾这么一大堆步骤。好,这期视频就到这里了,我是马克,我们下期再见,拜拜。

刚刚知道从大家每天用的 windows 系统里面就可以直接访问 chat gpt 最新的五点零大模型,大家跟我一起来操作。先打开 windows 电脑的浏览器,然后这个右上角有三个点,我们装安装一下这个 扩展的插件,一一 p s i d e r 我这里显示的是已经安装过了啊,如果没安装过的可以把它点击安装上,安装上了之后怎么运用这个呢?我们可以从这个浏览器的这个地方看到它的我们刚才安装的扩展, 看,这是我们刚才装的有各种大模型,我们把它双击点出来,哎,这里是不是有个很小小一点点的, 我们从这里把它打,把这个拉开,看到没有,这个微软自带的这个 ai 就 可以用了。我们从这里可以选择各种大模型,从 gpt 五点零 到各种,你看有对话的呀,图片的呀,其他的 gpt 四点零啊,五点零、五点二都可以用,是不是很香?只要用心观察,总能发现很多有趣的东西,那我们用起来吧。

给大家分享一下我最近自己用 gpt 搭建的一个 trading agent 的 一个选股模型。首先先来给大家看一下,这是我本月的一个收益最大的,回测的话差不多在三四个点左右吧,然后是跑赢大盘四十五个点左右, 在这里的话啊,你可以进行 a 股和美股的一个选择啊,我就选择我们的大 a 了,数据的来源的话,我是连接了东方财富的 啊,这边的话我们就我最近我就直接输一个最近比较火的股吧啊,这里你可以选日期,就选今天, 分析师你可以从多个方面进行给他一个分析啊,他这边你点了之后他会出现一个 模型啊,你可以自己选,有 g、 p、 t, 有 deepsea, 我 一般习惯用这个混合的一个模型,这边直接点分析就可以了啊,他这边就会开始给你进行一个分析啊,这边我已经做好了一个,就直接来看一下结果吧。啊,这边啊他有这个投资建议, 他其实主要是好几个模型进行一个多空的一个辩论啊,就是有多头分析师也有空投的一个分析师,你如果想看那个辩论的话,这边都能点开来看,还有一些市场的报告,这些都能看到全部的过程的。

这下终于搞定了,怎么把 gbt 生成图片变成可以在 ps 里面编辑的 psd 文件呢?那首先我们打开这个 gbt 的 五点五模型的 cking, 然后呢我这里我是做了一张这个海报的风格迁移图,可以看到它的整体效果是还不错的。 然后呢使用这个提示词,那你看经过两分二十六秒的等待,他就把这张图片拆分成不同的 元素,其实呢这里他也出了一点小差错,最后给我生成了一个 t 的 文件,那么再把提示词再给他强化一下,最终还是生成了这个 psd 的 文件。我们在 ps 里面看一下他生成的文件,其实目前这个版本他生成的还是有点小瑕疵,可以看到跟成品还是有一点点小区别, 那么可以遇见下一个版本的话,一定会优化的更好的,其实现在已经做到了这个步骤,牛。

在 gpt 这次更新 gpt 五点五 instand, 表面看只是一次模型升级,但我觉得它真正重要的地方不是又换了一个版本号,而是 openai 在 强化大多数人每天真正会用到的那个默认体验。官方 release notice 里说 gpt 五点五 instand 是 在 gpt 里面最常用的模型。这次重点提升的不是炫技术推理,而是几件很日常的事。 你让他帮你做决定,他要更懂你的真实目标,你多轮补充条件,反驳他改需求,他要更能跟上上下文。你让他做计划,研究选项,比较产品, 查本地商家,他要把信息组织的更顺,而不是给你一堆模板答案。这就有意思了,因为普通用户感受到 ai 有 没有变强,很多时候不是看奔驰 mark, 而是看三件事,第一,我少解释几遍了吗? 第二,他有没有记住我前面说过的限制?第三,他给出的建议能不能直接拿来用三 三六课和 e o 把这件事解读成 oki, 稳住 c 端基本盘。我觉得这个角度可以讲,现在行业里都在讲 agent codex 自动执行任务,但 q gpt 最大的护城河仍然是每天有无数普通人打开它问问题。所以默认模型变好,其实是在抢一个很现实的位置。当你要写文章、改简历、查 bug、 整理资料时,你第一反应还会不会打开 qgpt 边界也要说清楚。官方确认的是 gbt 五点五英寸的更新、默认体验提升和部分旧模型退场安排。 至于媒体说的免费全面开放,具体推送节奏还是要以 openai 官方显示为准。更准确的说法是窃 gbt 正在把最普通、最高频、最容易被替换的聊天体验重新做后, 你现在用切记笔记最烦的点是什么?是他不懂你的真实需求?还是多说两轮就开始忘事?如果你想看这种不吹牛的 ai 更新拆解,记得点赞、关注、转发一下,我们下条继续讲源头信息。

周末在家没事用七 s g p t 在 本地搭建了一个专属知识库。现在我的工作文档、学习笔记、行业资料全部塞进去,想查什么直接问,秒给答案。但说实话,我一直不太敢用网页版 ai 处理重要文件,隐私性没有保障。所以我花了两小时在电脑部署了一套专属大模型,知识库, 数据全在本地,安全感拉满。其实代码并不复杂,流程很清晰,环境安装跑通,模型构建。所以我把完整文档整理成了小白也能看懂的保姆级教程。关键步骤,手把手教,照着做,你就能在电脑部署大模型,搭建一个专属的知识库。如果你也想学习的话,直接带回家吧!

今天跟大家认真聊一个事儿, colex 接入国产大模型到底值不值得折腾? 先跟大家科普一下 colex 到底是什么? colex 是 open a r 推出的 a r 编程模型,基于 gpt 系列训练而来,专门针对代码开发场景优化,早年也是 get 哈普 co polarant 的 核心技术底座,它原声适配、 口碑和表现都比较出色的底座就是 open air 自家的车载 gpt。 codex 的 原生优化逻辑是围绕 gpt 做的,适配度会更高。从设计初衷来说,它并不是为 deepsafe 这样的国产大模型打造的。 但现在网上有很多博主在教大家用 codex 加加,或者通过 cc switch 改配置,把 codex 接入国产大模型,比如接 deepsafe。 很多人就问了,那既然都用上 deepsafe 了,为啥不直接用 deepsafe 官网呢?我也好奇,所以说我专门替大家实测了一下。 我下了一个 codex, 加加,按照流程配了国产大模型,用的就是 deepx 的 秘钥,还自己充钱。测了一下,配置好之后,我直接用 codex 自带的浏览器技能,想让他帮我分析一下亚马逊美国站某个品类的新品销量靠前的产品, 看看它到底能不能落地解决实际问题。结果呢,我个人体验下来并不理想,它的输出表现和我直接用 deepx 官网版本差异不大, 更偏向完成任务流程,没能达到我预期的效果,没办法直接帮我把工作落地。 更出乎我意料的是,就只做了这么一次分析,我充的额度消耗速度很快,我个人单次测试下来消耗成本比我平时用 check 的 gpt 付费版还要高一些。 所以啊,网上博主说的接入国产大模型省钱又好用。仅从我个人实测来看,我不太推荐大家花时间去安装折腾。而且还有一个很麻烦的点, 一旦你按教程改了配置,装好了这个修改的版本,后续想切回原版的设置就能还原的,得把相关修改的文件全部清理干净,操作比较繁琐一点。 最后的结论就是,如果你想用 codex, 优先用拆的 gpt 原版的适配方案,不要图省市去接入第三方改配的国产大模型,我个人体验下来差距很明显, 成本也未必更低。这坑我已经帮大家踩过了,大家可以参考我的体验再决定要不要去尝试。

欢迎来到集物君的零基础 codex 系列教程,这是第零期。跟其他教程不一样的是,我不会一上来就告诉你怎么安装 codex, 而是先告诉你为什么我建议你使用 codex 而不是 cloud code 或者其他 ai 助手。 不卖关子,我先直接告诉你结论,因为我认为 codex 是 目前最适合普通人最好上手的 ai 助手。为什么这值得单独讲一期?因为你现在去搜 ai 助手,会发现能打的工具不止一个。目前最火的就有 codex 和 cloud code, 以及前段时间爆火的小龙虾。 这三个我都深度使用过,能力都非常强,而且也各有各的死忠粉。但如果现在你是个纯小白,那我建议你还是先从 codex 开始入门 ai agent。 我 们先说小龙虾。小龙虾爆火的时候,最赚钱的不是用小龙虾去干嘛,而是帮别人安装小龙虾。就这一条,就可以劝退百分之九十的小白,你需要自己配置各种环境,很多人熬夜捣鼓几天,最后连小龙虾的你好都没有见到。 如果你尝试自己安装过小龙虾,那你一定懂我上面说的感受。即使你能力很强,真的装上了,但是又会因为某次更新或是不小心让小龙虾自己修改了某个配置,导致小龙虾直接瘫痪。 这样几次来回的折腾,但凡是个普通人,肯定就对 ai agent 劝退了。小龙虾是败在了安装和维护上。那 cloud code 呢?它装起来是简单一些,可它的门槛只是换了个地方。 cloud code 是 个彻头彻尾的终端工具,你想用它,就得先打开那个黑乎乎的命令行窗口, 一行一行敲命令跟他交流,光是这个界面就够劝退一批人了。而且他没有免费版,你要么按月订阅掏钱,要么自己去弄一个叫 apikey 的 东西填进去他才搭理你。 所以你发现没有,这两个工具,一个卡在安装维护,一个卡在终端和收费。但他们其实是同一个毛病,都没搞清楚,就先被这些东西挡在了门外, 这不该是你入门该有的样子,好收回 codex, 它最不一样的地方就是专门给不想碰终端不想折腾的人留了一条路。你装上 codex 就 会发现,乍一看它好像跟你平时经常用的豆包或者 deepsafe 没有什么区别。 也是有一个聊天框,你在上面跟 ai 直接聊天就行,所以刚上手你会觉得跟用豆包好像也没有什么区别,就不会有那种对未知事物的恐惧感。当然他也不只是个聊天框, 你跟豆包聊天,他顶多动动嘴给你出出主意,而扣贷 x 能直接动手操作你的电脑,帮你真正的干活。而且更让人安心的是,他干活的过程你看得明明白白,你让他改点东西,他改了哪里会清清楚楚标给你看,你点一下就能确认或者撤销, 完全不怕他乱来。你看下载就能用,像聊天一样上手,还不花钱,这就是我说他最适合普通人的原因。 而且从 codex 入门,你还不用担心走进死胡同,因为他不止桌面 app 这一个入口,你现在是新手,就用桌面 app 点点鼠标,以后你会用 vs code 的 这类编辑器了,他有插件,再往后你真想进终端了,他也有命令行版本, 你从最简单的地方上手,一路往上走,工具不用换,学过的东西全都能接着用。 所以入门选工具,第一位要考虑的从来不是谁最强,而是谁能让你先走进门,先跑起来。我不是说 cloud code 和小龙虾不好,等你成了熟手,他们都很值得回头玩,他们只是不该是你的第一个。而 codex 能让你用最短的时间真正搞明白一件事, ai agent 到底是什么,他能怎么帮到你?把这件事跑通了,你再去挑战别的一点都不迟。好的,不知道我的讲解有没有让你心动?心动不如行动,下一期我就手把手教你怎么用上 codex。 记得关注我。 使用过小龙虾或者 cloud code 的 小伙伴是因为什么原因被劝退的,可以在评论区分析你的体验。我是季吴军,我们下期见!

今天来给大家避一个坑啊,直接给大家看一下是怎么回事,建议大家不要轻易去使用这个数据源这个功能就是这个确定 gpt 的 其他的大模型应该也有 啊。原来想的说,嗯,这边可以直接上传文档,然后,哎, ai 的 回答就是基于文档去回答,那是一个个人的小型智库吧,对吧,但比较方便。 然后使用了一段时间之后啊,也就是今天我把这份文档做了个更新,新加了一些内容,并且把这个文档格式转换成了 ai 更加容易懂的 md 文档。 那更新完之后,我就把这个旧文档删掉了,那按正常的逻辑来说,后续的回答肯定是基于这份新的文档去回答的吧。 但是可笑的一幕发生了,后面所有的回答,即使我把这份旧的文档删除了,他也没有去引用新的文档回他,而是仍然使用旧的文档去回他的。 那你说这个,哼,多恐怖是吧?我的旧文档都删掉了,而且我指定了我还在那个对话框里面告诉 ai 说要寄予这份文档去回答,他还是没有按照这份文档去回答的。 那后来我就去问确的 gpt, 然后官方给出的回答也是确实会存在这种情况,因为旧的文档他还会存在于上下文的记忆当中, 也就是说他的回答还是会基于上下文的记忆中去回答,不会基于新文档去回答。然后给的解决方案是什么呢? 要么就是新建一个对话框,但是新建对话框之后发现还是解决不了。还有就是要么就是把项目删了,重新新建一个项目,我现在就是重新新建的项目。 那新建项目的后果,那像我们个人使用还无所谓,是吧?但是如果是公司的项目呢?公司的一个小应用也好,那你要重新新建个项目的话,那之前的所谓的工作就白费了, 是吧?所以,嗯,这个这种功能还是少用吧。如果要搭建 智知识库的话,还是去找专门的那种知识库的 ai 应用去做更好一点,设置 gpt 还是始终更适合用来做对话助手。

上一期我们把微调拆开了,通用模型通过少量标注数据就能适配到特定任务上。到了第二十二期,问题自然往下走。微调有一个隐藏前提,模型得先知道任务是什么。 一个只会续写文本的预训练模型,到底是怎么学会听懂人话,执行指令的?这一期要拆解的概念叫指令微调, 它正是 chat g p t 这类产品能回答你的问题,而不是继续写你的句子的关键转折点。先从一个最直观的对比开始。假设你有一个刚完成预训练的大语言模型,你问他,请用一句话总结光核作用的过程,预训练模型会怎么回答? 他不会总结,他会续写,因为他在预训练阶段见过的所有数据都是给定一段文字,预测下一个 token。 他 看到你的问题, 最自然的反应是接着往下写。光核作用是植物利用光能的过程,同时释放氧气。此外,光核作用还涉及,甚至可能越写越长,变成一篇科普文章。他根本不知道你要的是总结,他只知道续写。这不是他笨,而 是他的训练目标决定的。预训练阶段模型唯一被训练去做的事就是预测下一个词。再换一个问题试试。请判断以下说法是否正确,地球绕着太阳转,预训练模型会怎么回答?他可能续写?是的,这是正确的。 地球绕太阳公转的周期是它仍然在续写,而不是在判断。这就是预训练模型的行为模式。无论你给它什么,它都当成一个需要续写的半截句子。而指令微调后的模型,面对总结光和作用,会回答,光和作用是植物利用光能、 水和二氧化碳制造有机物并释放氧气的过程。面对判断地球绕太阳,会回答正确,干净利落,直接完成任务。这两种回答的差距就是预训练模型和 chat gpt 之间那个最关键的鸿沟。预训练给了模型语言能力、知识储备和逻辑推理的底子, 但没给他任务意识。他不知道什么时候该总结,什么时候该翻译,什么时候该判断对错。指令微调干的就是这件事。用大量指令回答成对的数据教会模型,当你看到一段疑情总结,请翻译请判断开头的文字时,你要做的不是续写,而是完成这个任务。具体怎么做呢?指令微调的数据格式 和预训练语料有本质区别。预训练阶段数据是连续文本,中国的首都是。模型的任务永远是预测下一个词, 而指令微调阶段,数据变成了结构化格式。指令,请将以下句子翻译成英文输入,今天天气很好。输出, the weather is nice today。 或者指令,请判断以下句子的情感倾向 输入,这家餐厅的菜太难吃了。输出负面模型要学的不是难吃后面接什么,而是当指令要求判断情感时,输出应该是什么。这个转变看似简单,但它彻底改变了模型的行为模式。预训练模型是一个文字接龙高手,你给他开头,他顺着往下接,接的还很流畅。 指令微调后的模型是一个任务执行者,你给他一个指令,他先理解这个指令要求什么类型的输出,然后尝试完成这个任务。训练过程本身并不复杂,把指令和期望回答拼接成一段训练文本, 用和预训练类似的方式让模型去学习给定指令生成正确回答这个应设关系。但因为指令覆盖了翻译、摘要、问答、分类、代码生成、推理等多种任务类型,模型学到的不只是某类任务怎么做,而是任务这个概念本身。更关键的是,指令微调带来了一个预训练模型不具备的能力。 样本泛化模型在训练时没见过写一首关于秋天的五言绝句这种具体指令,但因为他学过写诗、翻译、总结、分类、问答、代码生成等成百上千种任务的指令格式, 他能把遵循指令这个原能力泛化到全新的任务上去。换句话说,指令微调教会的不是某一项技能,而是学会执行任务这件事本身。这也是为什么同一个指令微调模型 既能写代码,又能做翻译,还能写周报。他学到的是理解任务并按格式输出这个通用行为,而不是某个具体任务的知识。 flan 和 instruct gpt 这两项里程碑式的工作正是这个方向上的关键突破。他们证明了用足够多样化的指令级训练模型就能获得遵循指令的通用能力。 flan 用了超过六十个 nlp 任务来构造指令数据, instruct gpt 则用人类标注员写的指令回答对来训练。两者路径不同, 但指向同一个结论,指令的多样化远比单一任务的深度更重要。这里有一个关键区分,指令微调不等于普通微调,普通微调是让模型适应特定领域,用医疗数据微调模型学会医学知识,用法律数据微调,模型学会法律术语。 但指令微调的目的不是注入知识,而是改变行为,教会模型什么叫执行任务。所以指令微调通常使用大量多样化的任务覆盖、翻译、招标、问答、分类、代码生成等,而不是单一领域的深度数据。 你可以这样理解,普通微调是让模型学一门专业课。指令微调是让模型学会上课,学会听懂老师的指令,并按要求完成作业,不管这门课是什么内容。 这也是为什么指令微调的数据量通常不需要特别大,几万到几十万条高质量指令回答对,就足以让模型建立起任务理解的行为模式。 常见的误区有三个,第一个认为指令微调就是写提示词训练不是的,指令微调是真实的训练过程,会更新模型的参数,和推理时写提示词完全不同。提示词是给已训练好的模型看的,指令微调是在训练阶段改变模型本身。第二个认为指令微调后的模型能完美执行所有指令。实际上, 指令微调只是让模型学会了尝试执行,他仍然会犯错,会编造,会误解、含糊。指令指令微调解决的是会不会做任务,不是做的好不好。第三个误区也是最容易混淆的,把指令微调和 r l h f 当成一回事。指令微调是监督学习,用的是指令标准答案对, r l h f 是 强化学习,用的是人类偏好排序。指令微调让模型会做任务, r l h f 让模型做得好 和人类偏好,两者是前后衔接的两个阶段,不是同一个东西把他们搞混,就像把学会开车和学会安全驾驶当成一回事,前者是技术能力,后者是在前者基础上的偏好优化。回到开头的问题,指令微调到底改变了什么? 他没有让模型变聪明,也没有让模型学到新的事实知识。他只做了一件事,在模型已经具备的语言能力之上,加上了一层任务理解的接口。预训练给了模型知识和语言能力。指令微调给了模型听话的能力,而能不能听话,恰恰是 ai 从实验室工具变成大众产品的那个分水岭。 没有指令微调,大模型只是一个博学的自动补全工具。有了指令微调,他才变成了一个你可以对话,可以委托任务的助手。 一个思考题留给你。如果指令微调只是让模型学会了遵循指令的格式,那为什么有些指令他执行的好,有些却一塌糊涂?提示,答案不在指令微调本身,而在上一期讲过的那个概念里,微调数据的选择和覆盖范围。

第零四期 github ai 保障项目今天讲 open web ui。 如果上一期奥拉玛是把大模型跑在本地电脑里,那 open web ui 就是 给本地 ai 装一个像 chat gpt 一 样的网页界面。这个项目现在已经超过一百四十三 k star, 它解决的问题很直接,很多人把模型跑起来之后,下一步马上卡住,怎么聊天?怎么管理多个模型?怎么上传资料?怎么做知识库问答? open web ui 就是 为这些场景准备的, 你可以把它理解成一个开源的 ai 聊天工作台,它可以连接欧拉玛,也可以接入兼容 open ai 接口的模型服务。 这样你不需要一直面对命令行,而是可以用网页界面创建对话,切换模型,管理提示词,上传文档,做本地知识库解锁。对普通人来说,它的价值不是炫技,而是把本地大模型变得真正可用。因为很多 ai 项目最难的地方不是第一次跑起来, 而是每天能不能顺手使用。如果没有好用界面,本地 ai 很 容易变成一个只会安装不会使用的收藏夹项目。 open web ui 的 爆点就在这里, 它把技术底座变成了看得见、点得动,能反复使用的工具。你可以用它做三类事情,第一,本地聊天,让欧拉玛里的模型像网页 ai 一 样直接对话。第二,资料问答, 把文档放进去,让模型围绕资料回答问题。第三,个人 ai 工作台,把提示词、模型、知识库和日常任务放到一个界面里管理。但也要提醒新手,不要一上来就想搭特别复杂的系统,先跑通一条最小链路,欧拉玛启动模型, open web ui 连接模型,完成一次本地问答,这条链路跑通以后再去接知识库自动化流程和 agent。 第零四期结论 open web ui 不是 模型本身,它是让本地 ai 真正好用起来的网页工作台。下一期我们继续找一个适合普通人收藏的 ai 项目。

上一集我们拆开了拆字 form, 也看见了大模型每生成一个 tock, 都要把整条路线重新跑一遍,再拆下一个。但知道他怎么工作,还不等于知道他怎么出生。一个只会拆下一个 tock 的 模型,为什么最后会变成叉子? gpt 会 回答问题,会写代码,还知道有哪些事情不能乱说。你可能以为工程师先做出一个空白大脑,再把知识一条一条装进去,最后写几条规则,他就成了软件助手。制作过程完全不是这样。 大模型不是一次训练到位的,它更像一块经过多少工序的材料。先把文字切成积木,再用含量接龙,练出一个具有模型,然后用人的示范教他怎么回答,用人的偏好教他怎么回答更好。最后再从该表里一个多看,一个多,看的出了答案。这一整条生产线,咱练出了你今天看到的其他的。 gpt 生态链的第一站不是定义文字,而是切文字。因为大模型不只定义字和词,它只收到一串编号,每个编号背后对应一块文明积木,这块积木就叫 took。 这些积木不是按字典切的,常见的组合会被看成一整块。首先的词可能被看成好几块,你可以把 b、 p、 e 写成一个积木工厂, 哪个组合经常一起出现,工厂就优先给他做一个新模具。所以同一个词有多少个字,不等于模型要处理多少步,中英文数字代码和一目级都有可能被切出完全不同的结果。这也是为什么大模型按 took 计算, 这样为窗口,也按投影计算模型。后面所有训练都是在这些节目上发生的,有着切法切下来才能的数据、网页、图书、百科、论文和代码会被装进一个巨大的原料仓。但原始互联网并不是知识宝库, 里面还有广告、乱码、整容内容、垃圾页面、隐私和有害内容。所以训练前最不切的工作,往往也是最重要的工作。去虫、去广告,过滤低重要内容,再决定代码多语言和不同领域各占多少,模型最后长成什么样,从这一步就开始被决定了。 数据洗干净以后,真正的育训店开始了。他玩的游戏朴素的有点离谱,给模型一段前文,让他猜下一个同款,猜完和英文对比,猜错了就反向传播,把数据拧一点,然后继续下一题。这个游戏最聪明的地方是,几乎不需要人类出答案。床前明月光后面是什么? 代码这一行下面是什么,你就画的下一个图案是什么?标准答案早就藏在原文里。互联网每一段文本都可以自动变成练习题,一两道金融题答案就不会什么。再把它放在海量文本上,再用成绩上面张券卡,就会重复猜对答案,给参数,再猜同一个小动作,跑上上一次, 事情就开始不一样了。因为想把下一个 top 猜准,只记住几个词,永远不够。模型在 model, 语法在分清上下文。在技术世界里,哪些东西经常一直出现,包括代码上的学会结构和逻辑。表面上他在做接龙,实际上他被迫压缩背后文美的规律。更像一个学生只忍在一张小抄, 却要面对紧贴教材,永远根本抄不下。他只能提炼规律,所以模型能写出网上没有的句子,不是因为他提前背过答案,而是因为他学会了怎么去做的。像预训练结束以后,一个结构模型出炉了。他已经装下大众语言规律和世界知识, 但执手的他还不是热心助手,他更像一台不学的接龙机器。你问他中国的首都是哪里,他可能不会直接回答北京,而是接着写。这是小学二年级的一道题,因为他从头到尾学到的动作只有续写。他有知识,却还不懂。你在提问, 我应该回答这个约定。于是第三站开始了进度微调,也就是 s f t。 人类写出一批问题和理想回答,用模型照着示范, 基于训练用户说什么,这首歌应该怎么接,系统要求应该放在哪里,才开始学会改编格式和角色。这里有一个很重要的区别,模型的大部分知识已经在育训营里形成了, s f t。 的 视力数量相对少的多,它主要不是重新教知识,而是把一个只会续写的模型,让一个知道该怎么回答的模型。但会有回答还不等于回答的好。问一个问题可以有很多种答案,哪个更具体, 哪个更诚实,哪个真正帮得上忙。很多时候,没有唯一标准,只有到了经典路线里的 r l h f。 这是人不需要从头到尾先迈自我答案。 模型先生成几个版本,标注员只需要排一个顺序,哪个更好,哪个更差。大量排序会训练出一个奖励模型,再让大模型朝更容易得到高分的方向调整。人类的偏好就这样慢慢斜进模型的行为,但对其不创一颗道德观观,它是在击鼓力量之间找平衡, 既要有用,也要诚实,还要尽量无害。只追求让用户满意。模型可能开始讨好,只追求决不出错,他就可能什么都不敢说。我们说的分寸感,其实是一套训练出来的取舍。经过一系列 sft 和批号对齐,这个模型终于变成了聊天助手。但你很快发现另一个现象, 同一个问题问两次,答案经常不一样。这不是他临时改变了知识,而是生成答案时还有最后一道工序。模型每次准备输出一个 top, 肯 不会只得到一个标准答案,他会给所有获选投款打分,这个可能性高一点,那个低一点,最后得到一张概率表,生成过程要做的事就从这张表里跳出。一个最简单的做法是永远选概率最高的那个,这样比较稳定,但也容易重复和僵硬。 另一种做法是按概率抽签,高概率的词更容易被抽中,低概率的词也保留一点机会。所以同类问题可以沿不同的 token 一 路长成不同的答案。但 pr 学做的事,不是给模型增加知识,而是调整这张概率表的对比度。温度低,高概率后续更集中,回答通常更稳。温度高,概率分布更平。 冷门后旋更容易被抽中,回答会更活,也更容易跑偏。 topk 和 topp 是 在冲天前先缩小后旋范围, topk 只留下排名靠前那几个, topp 留下累积概率够高的一足, 后面那条很长的地盖尾巴会被先剪掉。所以生成不是单纯追求随机,而是在稳定和变化之间控制风险。在这里,他目前的生产线已经拼起来了,他为什么还要把参数、数据和算力阅读越大?因为研究者发现,在研究范围内,这三样东西按合适方式增加 模型预测下一道坑的平均错误会沿着一条相当稳定的曲线下滑,这就是 skyline loss。 不 过大力出奇迹不等于这把参数多大,参数多了,数据也得跟上战力还得分的当同样的训练,预算配比不同,最后的效果也会差很多。 你的错误可以比较平缓的预测某一种能力什么时候突然变好,却没有那么容易预测。有些所谓涌现,现在可能和品味方法有关。现在我们把第三阶段串起来,文本先被先人 token 还能,文本再变成金融练习必须得把规律押进去的模型。 sft 教他怎么当助手,点名拼号教他怎么回答更合适, 才要决定每一步去推选哪个 token。 在 这个方式可以去一边打下 gpt 不是 其中某一步骤,它是整成生产线共同作用的结果。所以以后你再看到一个大模型,不要只问它有多少参数,你可以问四个更经济真相的问题,它出过什么数据? 它怎么被调成助手?它生成时怎么推选下一个 token? 它的参数、数据和算力有没有背平?这就是大模型篇最重要的一句话。 gpt 不是 被写出来的,它是从万一次金融里找出能力,再被人类一步一步调教成助手。

叉 gpt 五点六的更新意味着什么?重点不是更强了多少,而是 openai 开始把模型做成一套产品矩阵。这次预览的 gpt 五点六新家族大致分成三个方向,一个是偏最强能力的,一个是偏成本平衡的,还有一个是偏速度和效率的。 说白了,以后不再是只拼一个最强模型,而是根据不同场景给你不同定位的模型。对普通用户来说,这次最直接的变化其实是 gbt 五点五继续主导, gbt 四点五下线,语音听写模型也升级了。 所以这次更新表面上看是模型迭代,本质上是在给下一代 chat gpt 和 agent 工作有铺路。