准备用几个小测试来测试一下,我们这个配置不是很高的普通电脑,能跑地的本地模型都能达到达一个什么样的程度啊?我准备用四个任务,第一个是让他去网上给我下载一个图片,然后呢第二个任务是让他做一个 ppt 啊,第三个是在本地给我整理一下我的资料啊,最后是让他啊做一个小游戏。 那么第一个模型呢?我们是首先我的电脑是 macbook air m 五二十四加 e t b 啊,不是特别高的一个 啊,配置,我们现在使用的模型是千问三点五九 b 啊,蒸馏了一点 class 点六,我们用 hermes。 然后啊第一个任务,我让他啊上网上随便找一张周杰伦的图片给我放在桌面上,然后他就开始运行了 啊,我看到他打开了我的浏览器,然后呢也搜索到了这个周杰伦的图片啊,搜索到了很多,我也都能看的见,然后但是他就是下载不下来,我们可以看到 他通过各种各样的方法,比如说通过这个 html 网页版,然后他就换一个方法,下载不了,他就换另外一种方法,然后他尝试了很多很多种方法,他都没有下载下来,包括他下载下来的有一些这个缩略图,也不是图片的格式, 他会尝试各种方法,比如这个视频网站的封面图,专辑封面图,然后这个获取 vg 百科,或者是这个尝试用啊图片托管的程序。 然后呢他最终啊这里太好了,他下载到了一个图片,但是那个图片不是周杰伦的图片,我看到他在我的桌面上创建了,创建了一个文件夹,里面他搞出来了这么多的啊图文件,但只有这一个是一个图片文件,但就像他说的不是周杰伦的 啊,他最终也没有下载成一个周杰伦的图片给我。他这个任务跑了四十五分钟,还然后跑超过三十分钟的,我就认为他是挑战失败,这个我就给他停掉了,我让他进行下一个任务。
粉丝7453获赞19.1万

本地小模型能力测试啊,现在我们这次用的是用的 gmail 啊,二十六 b 的 模型啊,这个其实我这里面下载了这些模型啊,都是我经过筛选觉得我能跑的,然后有很多模型呢, 其实能装能跑问答基本都可以,但是呢,有一些深度的,比如说我们这几次任务测试呢, 一跑起来内存可能就不足了,然后就会崩溃。比如说啊,我们这个这个 jumbo fold 的 这个十四点五七 g 的 这个模型,就是啊,他能用,但是一跑起来啊,比较大的任务呢,他就崩溃了。所以这次呢,我们测试的是这个 jumbo fold 二十六 b 的 模型。 那我们这次的任务呢,同样跟之前的几个都是啊一样的,在网上让他随便找一个周杰伦的图片,把它放到我的桌面上,然后他就开始执行, 他执行的时候我看到他拉起了这个调用我的浏览器,然后呢,第一个他要打开的网页是知乎,不过因为知乎可能有这个呃人见证,他就没有打开那个网页,后来他又打开了别的网页,我看到了他的网页页面有一个周杰伦的图片,然后呢,过了一会他又把那个浏览器关掉了,然后过了一会他又打开 啊,然后我们看他跑了多长时间啊?呃,一共跑了九分钟啊,九分钟,这个跟我们前面测试的几个模型相比啊,他这个时间还是很短的。最关键的是呢,他最后说他为我找到了一个高清壁纸的图片,然后给我放在桌面上了,确实他在我们的桌面上放了一个这个, 然后我以为这没有预览图啊,我以为他是骗我的。就像之前啊,千万九币的模型就会这样放一个不能看的在这,结果他放了一个这个之后呢?我这,哎,预览可以, 那也就是这个第一个测试的这个任务啊,我们这个 g m f 的, 呃,这个模型是我们刚才测试的几个模型里面它是第一个啊,胜任完成了的,还不错啊。那么我们下来下面来看一下它第二个任务它能不能完成。

现在有很多朋友问我就是 cologold 怎么样接入本地的大模型?今天给大家说一下本地大模型是怎么接入的?然后有两种的方式,第一种方式是通过 cc switch, 这个之前的视频也给大家说过 cc switch 怎么使用的。 然后第二种方式就是我们通过欧莱玛装了本地大模型之后,直接呃对接我们的,通过 setting jason 的 文件直接对接我们的 cologold 的 文件。先说第一种方式,通过 cc switch 来对接本地大模型, 我这边的 cc switch, 因为我之前是通过对接了三种方式,第一个是我是用了 deep seek 的 deep seek, 然后第二个就是用了字节的火山方舟 coding plan, 然后第三呃那个 cloud official 我 没用,因为我没买它官方的 a p i。 然后第四个就是本机的 alama 模型,我也安装了这三种方式都跑通了。先一一给大家说一下,呃, 先说怎么样对接本地大模型吗?然后本地大模型其实非常简单,就是大家在这边添加一个新的供应商,然后新的供应商之后,这里面的填写方式像我这样填就可以了,就比如呃我们的供应商名称随便填一个欧拉玛,然后这边呃上面的标志也可以随便选一个, 因为我这边随便选一个,他就是欧拉玛。然后呃官网的链接,因为我们欧拉玛是本地的模型,这边是填空的,什么都不用填,这个 api k 的 话也不用不需要随便填,大家只要填欧拉玛就行了,你随便设置一个就行了。然后另外就这边比较关键,这边就是需要填写一个本地的端口,然后这个端口是什么意思呢?也给大家说一下。 它这个 http 就是 指的是本地服务,然后 local house 就是 我们自己的电脑嘛,它始终指向我们本地的 ip, 一 二七点零点零点零点零一嘛, 然后这个一一一四三四,它就相当于我们本地的端口号嘛,就是我们奥拉玛呃,本地运营大,本地大模型的工具,它是默认这个端口的,所以就是当我们安装奥拉玛之后,会提供一个 api 服务来监听这个端口,所以我们这边要设置呃,在 cc switch 里面要设置这个东西,就它的是请求地址, 这个就是像这样原声的填就可以了,认证自盾也是这个。然后另外这个这边模型的话,就是我们本地安装的模型,你要看一下我们本地安装了哪些模型,比如我这边就是运行了奥拉玛里斯,这边可以看一下,比如运行这个,他这边就我我之前安装了四个模型啊,就是千问三点五九 b 的 千问斯,呃,伽马寺那个 e 四 b, 然后还有干妈四三十一 b 以及干妈四 e two b。 因为我的只有一个独立显卡,就是八 g 的 显存,所以我只能一般是用切分三点五和 e two b 的。 然后这边的设置就是直接把你需要设置的模型,比如复制两过来就行了,然后底下这个东西就会自动生效, 保存好之后就行了,然后我这边就会在使用中给大家看一下效果。我这边就刚问他们,我是他什么大模型,他其实就是干妈四 deep 呃,谷歌 deep money 的, 然后我们可以切换模型的,就是我刚这边安装了是千万三三点五九币和干妈四 e two b 嘛,然后这边就可以选择嘛,你可以选择不同的模型, 我这边就可以切换到切切换三点五九 b 这边之所以能切换是因为我这边只设置了这两个模型,你看只设置这个,当然我这个也可以设置一四那个一一一 four b 都可以, 这是本地大棚型的设置,这是呃,我觉得通过 c c c v 是 最方便的,我们也可以切换到 deepsea, 我 这边切换到 deepsea, 然后就可以很方便的从本地切换到云端了。我就说你好, 它这边是因为呃切换模型之后需要重启一下 cloud, 我 们重启一下就行。 比如我这边重启一下,它就会呃启 用我们的 dips pro, 很 方便的一键切换。然后这个前面就是我之前装的 cloud mail 那 个插件,就它每次启动它都会查取呃最近五十次的 通话内容,就是回忆一下我们之前的那个记忆,这个我就记个记忆插件,非常好用,它是自动自动启动的,然后它上面有你的新增功能啊,还是重构啊,还是改变,它都会给你标出来你之前做了什么样的东西。 我觉得这个非常好用,然后比如它当前它就会告诉呃 vr obv observation 在 这个端口就相当于在这个端口,这就跟我们刚刚那个呃奥奥拉玛端口不一样了。 然后给大家说一下,就是呃关其他的大模型厂商他们的 apis 怎么对接的,其实也很简单,就是我们的 a, 我 拿 deepsea 举个例子,这边顺便说一下,比如 deepsea 这边,他的 u i 只需要填 u i l 啊,就是我们的 u i l 就是 open i 或者 osrogic, 因为 cloud code osrogic 吗?我们只需要复制这个链接,把它填到这就行。然后 apikey 就是 我们自己设置的,这边主模型的话就是 v s pro flash 三点二、三点三点二都可以, 因为马,因为那个三点二后面不是要七月二十号要弃用了吗?就是之前的 chat 和 reason, 一个是 syncing, 一个 on syncing 的 模式,在里面 ipikey 只要设置一下就行了。 然后还有一种方式就是通过线上的,这个我觉得是同样的道理啊,大家就是相当于之前的那个接收文档,就是它这边也会写好的,就是主要就是这个,呃, 这个 anastropic base u i l 给它填好就行了。然后这个这个 token 也是随便填的。然后这个模型就是我们刚设置的那些模型,其实是一个道理,这边就不细说了。

看到大模型发布时那对扳指 mark, 你 知道它们各自测什么吗?大家好,我是 ai 学习的老张,这些扳指 mark 可以 分五个维度来理解,今天一次讲清楚。第一个维度,代码工程能力 s w e。 扳指 verified, 把 ai 当程序员扔进真实开源项目,让他自己读一学,改代码,跑单元测试,真修好 bug 才算分。目前最强是 deepsea v 四 pro, s w e 编程 pro 更难,平均一个补丁要改一百行以上,跨多个文件。第二个维度,综合知识加推理 j p q a damon 是 博士级生物物理化学考题,连网搜都搜不到答案。 h l e 被称为人类最后一卷前沿模型,现在才过百分之四十 k m k 二点六。目前最强 m m l u pro 是 研究生综合考试,带思维链才能多提百分之二十的分。第三个维度,数学推理 ai m e 是 高中数学奥赛级别,每道题需要五到十步推理,现在顶级 l l m 已经能做到百分之九十五,是 ai 数学能力飞速进步最直接的证据。 h m m t 比 ai m e。 还难一挡,只刷 ai m e, 不 刷 h m t。 的 模型,要警惕。 第四个维度, a 镇的实战 terminal bench 在 真实 linux 公端里跑工程任务 编辑、 linux 内核配 tls 证书调试并发 bug, 全是真实场景。这类 benchmark 才是 ai 能不能真正上手用的核心标准。 最后一个建议看榜单,别只盯一个数字编程强不代表数学好,数学好不代表 agent 能用。 hle 和 terminal bench 这类新 benchmark 才是接下来真正的分水岭。

今天跟大家聊一下关于本地跑大模型这件事情啊,其实我觉得在现在目前这个阶段,本地跑大模型它的实际的用途并不是很高,非必要的情况下,我觉得还是接外部的 api 就 比较好 啊。我是通过了真金白银来得出的这个结论,因为我前段时间我的苹果 m 四十六 g 五幺二那个 都已经给我用满了,然后呢?我就想一次性换个好一点的吧,我就换一个内存大一点的。现在跑大模型不是要大内存吗?我直接买了那个一百二十八 g m 三 max 芯片的这个 mac pro, 然后结果发现用它来跑杰玛这些呃大模型的时候,其实它对话的速度还是很快,但是如果你把它接入到可拉扣的或者这种呃 a 阵盘里面, 他那个速度是你难以想象的那种慢啊。他手头跟加载要超超,不过差不多四分钟。我问他一个你好,他回答我要花四分钟,这什么概念? 那后面会稍微快一点,然后整个机子呢?就非常的烫啊,非常的烫,你要知道可以,这可是 m 三 max 的 芯片,一百二十八 g 的 大内存,然后有四百 g 的 这种内存贷款, 他还是很卡,然后这台机器本身的价格要两万多块钱,那你想如果我买一个普通一点的,对吧?我把这个多出来的,比如说我买一台一万多块钱的 macbook, 然后我去把这个钱你去充 gpt, 你 去充呃, deepsea, 你 充 cloud, 你 能够充几年?你能够充好几年哦。

兄弟们的嘴是真严啊,这个玩本地模型,除了这个机器配置的要求,对于这个网络要求,还有这个模型大小,下载的这个速度也要求很高 啊。下载一个画图的一个模型工具吧,工具,然后里面正在下载一个 ltx 模型, 然后这是好像是六个里面的第一个,这第一个是二十四 g, 已经下了快两个小时了,这个还算是快的,然后像 v、 m、 l 这个, 这个芝麻这个也是二十一 g, 然后欧拉玛的那个千万三点六二十七 b, 那 个模型好像也是二十多 g, 这个有点下不动啊。

我们在安装了一个本地部署大模型之后啊,会发现他可能没有那么聪明,比较笨,那么这个时候我们可以给他添加非常多常用的功能,比如说像这个插件呢,是让他去 读取本地的一个文档,帮他去分析啊,像这个插件呢,是可能获取本地的一些天气啊,这个插件呢是让他去联网搜索的,所以说在大模型的基座上,你想要加什么功能都可以自己定制的,我们来测试一下。比如说我们让大模型这种格式点击上传 这个文档呢,是我们测试的 a 一 百显卡和 h 一 百显卡的一些参数,那么这个时候我的需求是让他根据这个参数去给客户推荐应该买什么显卡好, 这个时候他就会很快的给出一些答案了。像这种场景呢,因为很多我们企业内部的数据是隐私,不太方便上传到线上, 如果你上传给线上的 ai 的 话,相当于你企业的东西所有人都知道了,但是我们做本地部署的话,就可以很方便的内部去使用,而且功能跟你线上用的 ai 基本是一模一样的,而且非常省头盔。像我们这一个问题,总共产生了就四千多个头盔, 如果你每天大量的使用,可能一天几百万个,上千万个头等都会有,长期使用下来负担还是蛮高的。而本地部署呢,就没有这个困扰了,它是无限你想怎么用怎么用的,关于你的业务应该部署什么模型,然后怎么样去搭建一些插件啊,工作流啊,智能体啊,我们可以聊聊。

二七 b 干翻三九七 b 巨无霸 p 五文三点六。二七 b 今天开源了,直接说结论,这是二七 b 的 dance 多模态模型,在 swb 版本测试上把上一代三九七 b 的 大哥干翻了, 小了整整十五倍,反手一巴掌。为啥说这个尺寸是甜点? fpe 八炼化版只要二十七 gb 现存单卡 l 四零 s 或者 a 六千 a 档就够跑,门槛直接砍一半。 这次两个核心卖点, ajax coding, real world 编码直接对标 cloud。 四点五, open terminalbench 打平 t h r n k i n g preservation 多轮对话,保留历史思考,上下文代码叠代,再也不用每轮重新想一遍部署用 v l l m 加上 reasoning per se q o n 三就行。显存不够直接把模型名换成 f p 八版, 其他参数一毛一样。显存需求腰斩权重在 h f 和 model scope 都有,稍用随便用,阿里这波是真卷出来。

全球最新 ai 模型排行前五。 top 五, deepsea 为三点二,国产开源性价比之王,搭载 d s a 稀疏注意力,代码生成准确率百分之八十三点三,轻量化普通电脑也能流畅跑脚本,编辑、数据分析全覆盖,数学解析能力也大幅升级,本地部署低成本首选。 top 四, kimi k 二点五 pro 超长上下文领域绝对王者,百万字代码库,一键解析老旧项目重构实力,天花板,逻辑连贯,理解深度极强, 精准捕捉跨文件关联,大幅降低二次开发成本。 top 三, gmail 三点一 pro, 谷歌多模态旗舰模型,综合推理能力 非常均衡,运行成本只有同行一半。实图写代码,前端设计全能截图布局,快速生成逻辑多场景适配,稳定又高效。 top 二 g p t 五点四,继承 codex 全部编程基因,自带原声电脑操控能力,全链路自动化落地交付代码严谨适配全品类框架,商用项目 杂推理都没压力,生态完善兼容性拉满。 top 一, cloud opus 四点七,断层登顶的 rena 三大盲测榜单,是目前全球 ai 领域的综合加编程双料天花板,核心实力堪称恐怖。所以 bose 验证通过率百分之八十点八, a g i 抽象推理得分百分之九十四点零,稳居全球第一。高阶场景表现几乎无解。他的超长文本理解、多层级代码架构拆解、自主纠错优化能力做到极致,还兼顾企业级安全合规,不管是从零搭建完整项目,还是接手混乱旧代码重 构,都能给出令人安心的解决方案。想一站式体验顶级 ai 吗?我做了一款 ai 集合工具箱,它能自动检测运行环境,一键部署,一键安装,全程不需要复杂配置,新手零门槛 开箱就能使用。 cloud 口的新用户可享体验额度,日常使用也能持续获取额度,轻松玩转全球顶尖 ai。 关注我,安装教程我都整理好了,想要直接拿去用。

我们装好这种本地部署大模型之后呢,发现他能力很弱啊,比如说线上的豆包,他又能看天气,又能联网,他又能看你的表格,但是传统的大模型没有这个功能,所以说我们会在这里给他添加很多的技能,比如说这个技能呢是让他去看电脑上面的文档,那这个技能呢是查看天气 啊,这个技能呢是去联网等等。比如说我们来演示一下去看企业内部的文档,这个是我们做的一个聊天窗口,然后在这里上传一个文档。比如说这个是我们一张显卡的测试报告,然后让他出一个方案给客户, 那这个时候呢,他就会根据我们这张显卡的测试报告去分析给客户,可以看到他这里是有自动的,再去写代码去 分析这个报告。这样的话呢我们很方便的就可以分析企业内部的一些比较私密的数据了,因为很多我们行业只有你家有数据,但是其他同行没有。这个时候呢,如果说你把这个数据传给线上的一些 ai 去解读的话,那么相当于你的数据所有人都知道了。那么你的本地模型需要怎么搭建?需要什么技能?我们可以聊一聊。

先说结论,本地模型,做重复确定的任务,云端模型,做不确定的任务探索。二十七币或者三十五币的量化模型是你的本地部署的最佳选择。大家好,这期视频主要介绍在 mac studio 上应该选择什么样的本地模型。 在哈根 face 网站上,你可以下载各种 l、 l、 m 模型,但是我们应该如何选择呢?先讲一个最核心的概念,现在的大模型基本可以分为两类,第一类,瞪死模型,也就是筹密模型。第二类, m o e 模型,也就是专家混合模型。 以千万三点五二十七币为例,这是一个典型的瞪死模型。特点是每一次推理,所有参数 都会参与计算,你可以理解为每次思考都是整个大脑一起工作。优点是稳定,一致性强,缺点是非常吃内存和算力。千万三点六三十五 b a 三 b 则是一个 mo 一 模型, 它的特点是每次只激活一小部分参数。虽然它是一个三十五 b 的 模型,但每次只用三 b 参数在计算,可以理解为多个专家按需调用,而不是同时在工作。优点是更高效,更省资源。缺点是有时候不稳定, 一次性稍差。一句话,瞪死是全脑思考, m o e 是 按需调用。对于我来说,我使用的 mac studio 是 m r ultra 六十四 g。 考虑到模型的加载上下文 k v cat 的 占用,我常用的模型是 千万三点五二十七 b 四比特模型和千万三点六三十五 b a 三 b 模型,以及它们对应的各种变体。其中千万三点五二十七 b 四比特。这是个定时模型,非常适合执行各类确定性的 a 检测任务,比如定时完成网页数据的抓取, 视频字幕的下载,周报的生成、图片生成的调用。而千问三点六三十五 b a 三 b 四比特模型其实也非常适合各种 agent 任务, 但它的速度更快,更适合需要快速输出长文本的场景,比如写工作笔记,各种文案实时的交互。还有一种本地模型,千问三 code next, 这是一个八十 b 的 专门经过编程优化的本地 mo 模型, 其编程性能基本达到 cloudsonnet 四点五水平。但是考虑到模型权重和上下文,实际使用中硬件配置最好是两百五十六 g 内存的 max studio。 而我如果需要进行编程,则会选择云端模型,比如 mini max 二点七或者 g l m 五点一。下面介绍一下模型的各种变体,在哈根 face 上可以看到各种第三方微调的量化模型, 带有各种各样的尾椎。先说量化,原始模型基本都是十六位的模型权重,为了优化性能,降低模型占据的内存 以及提高输出 token 的 速度,通常会进行量化处理,比如量化为八比特、六比特,甚至二比特量化有不同的方法,包括 a w q 量化、 o q 量化、 t q 量化,有的是针对模型本身量化,有的是针对 k v cat 缓存量化。再说蒸馏,带有 tiered 伪劣的模型就是蒸馏模型,可以理解为用一个更强的老师模型去教一个差一点的学生模型。比如这个千问三点六三十五 b a 三 b cloud 四点六 os reasoning distilled 模型,它是怎么出来的呢?我们知道 cloud 四点六 os 是 一个推理能力特别强的模型, 每次进行推理的时候都会先思考,先产生一个很长的思维链,然后再执行任务输出结果。于是有第三方模型团队收集整理了几万条甚至十几万条推理思维链,用来交千万三点六三十五币这个基础模型。 于是这个蒸馏出来的新模型也就有了很强的推理能力。需要注意的是,原生的千万模型是多模态的模型, 支持文本和图像的输入。但是很多版本的蒸馏模型会关闭图片处理功能,变成纯文本模型。 而伸手者代表模型去掉了对其限制,不再过滤敏感内容。而 n s f w t lost safe for work 表示会包含不适合公开场所的内容。这些模型遍体大多经过破解,并且使用了很多额外的数据,经过微调训练出来的, 可以根据需要以及网上的评测选择自己想要的模型。但网上的评分只能作为参考,因为测试环境、硬件配置都有很大的差异,还是需要在本地,在你的硬件上实际测试才行。 当用户给大模型输入消息,主要经历两个阶段,预填充 prefer 和解码 decode。 预填充就是模型先独立 输入的内容,把所有输入转成 token, 然后建立上下文理解。这一阶段决定的是首字言辞,也就是当你发送消息后,要等多久才开始出字。这个阶段输入信息 是可以高度并行处理的, gpu 是 可以把输入 token 并行放入矩阵运算,这个阶段的瓶颈是 gpu 的 运算能力,相同模型 gpu 运算能力越强, 越填充速度也就越快。而解码阶段就是输出答案阶段是模型开始一个 token, 一个 token 的 生成内容,但注意这里只能是串行输出,因为每生成一个新 token, 都要把它拼回已有的序列才能计算,然后继续输出下一个 token。 这个阶段的输出瓶颈变成了内存待宽 memory bond。 总结一下,预填充阶段 gpu 可以 变形处理,因此每个输入 token 的 消耗时间要短很多,平静在于 gpu 性能。而解码阶段 gpu 只能串行输出 token, 因此单个输出 token 消耗的时间要比输入慢 五到十倍,其瓶颈在于内存待宽。所以你会发现大模型公司 a p i 收费标准里输出 token 要比输入 token 贵五到十倍。也会发现 mac studio ultra 的 输出 token 的 速度要高于其他 mac 设备,这是因为前者内存带框是八百 g, 而 mac mini 的 内存带框只有三百 g。 虽然单个输入 token 的 输入率 要高于单个输出的 token 速度,但真实的应用场景中,往往是输入的 token 数量远远高于输出的 token 数量。比如本地模型最大输入 token 甚至可以达到一百万 token, 而模型输出的 token 量基本只需要几千就足够。为了能够加快处理,预填充的 prefill 会用到一个叫 k v cat 的 功能。因为实际的在与 大语言模型多轮对话中,有很多输入内容是重复的,比如 agent m d, so m d, mary m d, 历史绘画记录等,因此可以把这些相同内容都缓存起来,在下一轮对话时就可以直接拿来使用,而不用重复计算。所以 手势输入的时候,由于 kvatch 还是空的,所有的输入都需要计算一遍,生成 kvatch 这个手势构建时间会很慢,但是下一轮对话时,由于 kvatch 中已经有了前面的内容预填充, prefill 就 会读取缓存, 此计算新增部分速度一下子就快了起来。 kvatch 分 为热缓存和冷缓存,前者将数据保存在内存中速度快,后者将数据存储在 ssd 固态硬盘中,容量高。所以实际使用 agent 完成任务的过程中,除了加载大圆模型的权重会 消耗内存,更重要的是进行上下文的缓存也会消耗大量的内存,否则就会出现模型虽然可以加载,但是一调用 agent 工具就会很慢的情况,就是因为内存太小,没有进行 kvatch 的 热缓 存导致。以我的 mac studio 设备为例,虽然总内存有六十四 g, 完全可以加载更大的八位三十五 b 模型,但考虑到上下文的 k v cat 热缓存也需要大量的内存,所以最好将模型变为四位的三十五 b 模型,这样在处理实际任务时就会有很快的输出速度,而不会出现卡顿的情况。 除了通过量化 k v k 来提升推理速度外,现在又多了一些新的技术,比如 spec prefill、 turbo、 quant deflesh, 这些可以下个视频再进行介绍。最后总结一下,由于 g p u 算力、内存大小、内存带宽的限制, 本地最适合跑的模型就是二十七 b 或三十五 b 的 量化模型,使用它们完成每天重复的确定性的任务已经完全足够。关注我 ai, 分享实战技巧,我们下期见!

你调用的是本地大模型,效果怎么样?一般做点简单的事情是没有什么问题的,不要做太复杂的,因为他处理能力确实有限啊。什么删个目录啊,建个文件,看一下本机的运行效率等等这些简单的问题, 包括什么?发个邮件,收个邮件,查个东西都没问题啊。但是不要做什么深度思考的一些东西, 因为他很傻,他很聪明,但他很傻。这怎么来说呢?听起来这句话有点互斥。那确实是他很聪明,但是他很傻,可以吗?这个答案配合本地大模型,可以省一些模型接口的费用。然后呢,把可以把一些简单的模型看怎么来交给本地的模型来做,这样不就省钱了吗?

那前两天我新买的 maxi archer 呢,刚到货啊,内存九十六 g 的, 这两天呢我是在装软件还有模型,今天呢去测试了一下。 那第一个的话呢是谷歌的 jam 啊,三十一 b 的。 第二个的话是纤维三点六三十五 b 的 啊,它是一个 mv 型的,就是稀疏模型的。第三个的话是纤维三点六二十七 b, 它是稠密型的。 那我刚刚呢就是跑了一下吸收型的啊,从结果来看的话还是挺满意的。这个 tucker 的 话,大家可以看一下,他的一个输出非常快,大概每秒的话七十三点五九个 tucker 还是蛮快的。 然后内存呢?我看一下啊,因为下午也是接了 open core, open core 帮我去调一下内存啊,他这边看到就是物理内存的话总共九十六 g, 使用了八十七点六 g 啊,大概还有八点四 g 的 余量。 其中呢就是主要的话是 im studio 有 三个模型,第一个是 j 码二十四点二,第二个是 m o e 的 千万十七点九,这个是网红模型啊。第三个的话是千万重叠型模型,二十九点二 g。 然后奥本可乐话其实占的比较少,大概四百多兆,所以呢就是说模型的话吃掉了大部分的内存, 奥本可乐其实在提示提醒我,然后把这个模型呢可以保删掉一个,保留两个。这样子 啊,这是今天一个测试情况啊,后面的话我会再测试一下其他的模型,包括那个筹密型的模型,去测试一下,看最高能够跑多少亿的参数。好,接着今天的分享。

这几天有小伙伴反馈用千万三点六呃,追买四,用了一段时间,大模型的响应就越来越慢,然后 agent 开始失忆,紧接着 tos 调用异常,最后直接卡死。 这种情况啊,大部分是不是模型不行,而是常对话的 token 爆了。大家好,我是根谷,今天教大家用一套本地的模型配置方法, 简单的调教好参数,从根源上控制头肯的消耗,让你的本地模型能稳定长时间运行。为什么你的这个长对话会爆头肯呢?不是你的模型不行啊,是上下文被撑爆了,是因为第一个就是每轮对话 都会追加上下文。 n 轮对话以后啊,这个系统提示加全部的历史,最后的新提问,头肯只会呈指数级的增加, 可以大家用一个公式去计算。二十人对话的话大概是会到五万,这个头肯直接会超限,所以说还有第二的话,就是你的兔耳是会输出炸弹,因为 m c p 啊,就是模型上下文的协议,他默认的是我这里配置的,默认是五万这个头肯,所以说一次就能占满上下文,这个地方我们可以通过配置文件去解决。 第三块就是 memory 无限堆积,因为有些人他用的是这个 skills 啊,特别是那些比较好的 skills, 他 会把所有的记忆体给你塞到上下文,所以说你的任务越长,他 token 累积越来越多。第四块就是 cost 啊, cost 这样一个隐形的消耗,也就是反思 是推理这个玩意,也是也是大量吃透根,却不产生直接的价值啊。解决的思路就是用四种方法去防止他的这个透根膨胀,第一个就自动的压缩这个历史对话,第二的话就控制这个拓式的输出长度,第三就是防止这个曼曼的无限堆积,最后就长时间稳定的运行。我们通过限制的轮数,包括这个最大的透根的 的限制,包括关闭这个这样一个 cost 啊,好,然后呢,我这里给大家举的例子就是我用的是这个呃 呃,这个 j m 四二十六 b a 四 b 的 it, 它是 f b 这样一个十六位的一个全量模型,大概是消耗我的内存,应该是二十六乘以四,大概是八十 g 左右,八十 g 以内的这样一个显存啊,其实这个模型已经非常强大了。首先我找到这样一个配置文件,这个配置文件就是在加载目录下 hammers config yum yum 这样一个文件,这个文件的话首先我要输,找到这个模型啊,我这里有三个模型,一个是 j 满四,一个是千问,还有一个是这个 gpt, 是 吧?这个模型为什么我设置六五五三六啊?这个你,你不设置这么多,你这个你这个嗨马斯就运行不起来,正常情况下我们应该设置一万二千个头啃, 所以说这第一步是骗这个 hammer 的 啊,这个倒没关系啊,好,这个是第一个配配置,第二的话就是在这个 a 检测里面有个叫 master, 默认的话,这个系统默认的话它是二十轮,二十轮其实有点大了,然后我们每轮配置的这样一个是这个就是最大的头啃啊,就是一万二,一万四都是可以的,如果他的这个 这个模型的参数最大的这个上下文累计到二十五万的时候,它就会爆头壳,所以说你一次性一万四的话,大概是要十次接近十次啊,就会把它撑爆,当然你说其实每次都没这么大,大概是几百个头壳嘛,所以说大概是两两百人左右,那它才会爆是吧? 所以说 max 的 pro mode 设置为一万二到一万四都是可以的,千万不要设置为两万三万啊,这个就会出问题的。那是第一个,第一个地方, 第二的话就是这个刚刚说的这个没有价值的东西,卡斯特,怎么怎么卡斯特了,这个玩意得给你关掉它去啊。这个这个玩意,这个玩意很恶心啊,就是我之前是没关掉他比较好。这个头肯 啊,就这个玩意,这个 enable, 把它变成 force, 默认他是 true 啊,这个没什么卵用啊。这个。然后第三个是最最关键的,就上下为压缩,如果这个系统发现我快要达到这个二十五万的时候,它会自动启动压缩,我们这个预值默认的是零点三或零点五都可以。当达到一万十二万的时候,它自动的启动压缩, 然后这个一个这个目标这个率的话默认的是三零点三,我们把它设置为零点一八,还有这个轮数我们设置为六轮,那就不要设置为二十轮,二十轮的话有点有,有点太长了,对吧? 好,这个地方这个配置是最最关键的。第三个就是我们把这个记忆体关掉,因为我这里用到了一个样式,就是我记忆体其实其实可以看的跟古老师的上一堂课啊,就是设文件啊,慢慢的这个文件去做记忆体配置,先不要在这里去弄啊,这个把它关掉,甚至你是自己去外接一个存储,这个,这个这个数据库都是可以的,把它关掉啊。 第三块就是这个拓式的 alt put, 这个也很恶心,因为你肯定是用了一些这个,呃,外外部的样式吗?对吧?他这个这个这个 输出他五万,那五万就直接把你五万还是五十万吧,应该默认的是个十百千五万,五万也太大了,因为设置为一万二千吧,对吧?五万的话你杀差不多三到四次调用这个工具的样式,你这个你这个内存啊,你这个透坑就承包了。好,你设置完了以后,这个 hammer 你 重启一下,就是 hammer, 是 吧?然后重启一下, 哎,这个就是可以了,对吧?好,可以了。以后我要假设我要做一个这样一个比较长的任务和一个比较比较复杂的任务,就是我用这样一个样式查询最近三天的 ai 新闻啊。它之前我没有做这个配置的话,它很快,大概是一两分钟它就会, 他就会承包。你可以看一下这里,我这里有一个这个 hammer 式的这样一个,是吧?然后到仪表盘里面,我把它变大一点,啊,这个你看到吗?他请求过来了,是吧?一个请求我可以把它放到这里来,是吧?哎,他已经调用了这个这个样式, 大概会到百分之七八十的时候,他就会输出这样一个新闻,是吧?他第二轮已经出来了,大概是 现在是六百七十四个头款,美版也是非常快。我,我这个这个电脑应该非常快,给大家看一下我的显存消耗,我这里显存消耗的话应该是,哎,五十七个 g 是 吧?接近六十个 g 了,六六十个 g 的 显存,所以说大家显存低的话还是玩不起这个追满四,那只能去老老实实的去用这个,呃, 千万三点六是吧?他当超出这个上下文的话,他就会去进行压缩啊,进行压缩, 如果不进行压缩的话,基本上这个就卡到这里就会死掉,基本上就会死掉。好,然后再回到这个这个 ppt 来。 好,这里也就是告诉二数人是非常大,大概率就叫爆,是吧?所以说我们设置为一万二千是比较合适的。还有地方去设置是这个玩意,这个地方有一个这个全局的设置,这个地方在 这个地方也需要设置一下啊,这个三万二千最大的上下网窗口,还有这个最大拓展,这里设置为四千多就好了,就这个是那个 ml, 是 这个,这个推力框架的配置啊。好,然后其他的地方这个都说了,是吧?压缩,这个把它关掉是吧?然后这个也关掉是吧?然后具体把它关掉。 有些人说我这个这里关掉了,会不会让他这个失忆啊?我觉得不会啊,因为你的失忆核心不是他核心的是我们的三个文件是吧?一个售文件,一个是 mami 的 文件,还有一个优者文件,这你可以翻一翻跟我老师的前面的课程,这个也是一定要一定要去设置的,这个不要设置太大,不要设置太太大, 最后就是在这里面的完整的这个地方,大家可以截图保存啊,把这些,这是针对 jama 四的这样一个二十六 b 的 模型的配置啊?就是我尝试调了很多次这样一个配置,像是比较好的,比较好的啊,其他的地方就应该没有什么了, 哎。然后这个地方可以大家看一下,刚刚这个东西它已经出来了,是吧?这是查到最近三天的这样一个新闻,它其实里面大概耗了也是有几万个 token 了,对吧?几万个 token 这堂课就分享到这里,你学会了吗?

本地小模型能力测试第二个测试,我们看这个 demo 啊,这个二十六 b 它这个模型完成的怎么样?我们这个任务呢是做一个八页的 ppt 啊,主题是未来照亮现实, ai 引领科技。把这个 ppt 文件呢放到桌面上,然后它就开始运行了, 他的这个跑的速度是非常快的,三分四十五秒就跑完了,比我们之前那两个模型都快。然后他也给我在桌面上放了 ppt 的 文件了,而且之前那两个模型除了放了这个 ppt 的 文件之后呢,他还有好几个 别的这个乱七八糟的文件也放在桌面上,而这一次跑的这个,他只是给我放了一个 ppt 的 文件,没有其他多余的文件,我们来看一下,但是他做的这个 ppt 确实比较啊 糟糕啊,就是一个白色的背景加一个文字,第一页啊,是第二页,第三页,第四页啊,第五页,第六页,第七页,第八页。虽然他做出来了,但是他 做的不好看,可以是说我们这三次三个模型的测试,他做的是最差的,但是确实跑的很快啊,也也也还行吧。我们接下来看看第三个任务他完成的怎么样。