大家好啊,今天就是来录制一下本地部署大模型到底用哪一种方式是最合适的?也不能说最合适啊,就是看一下它们的一个性能对比啊,有三个软件,一个呢是欧拉玛,一个是拉玛 c p p, 还有一个呢是 l m studio, 来第一个第一个,我们先来看这个欧拉玛啊,看下欧拉玛, ok, 呃,我们全部用同一种模型啊,同一个模型,而且用它的同一个量化的版本来看一下我自己本地,呃,欧拉玛的话是部署了,就是部署了这个千万三点六三十五 b 的 这个模型, 然后可以看一下,嗯,我拉玛他,呃,三点六三十五币的话,他其实也是一个量化版本,他的量化版本也是啊,啊,斯比特啊,斯比特的一个量化版本啊 q 四杠 k 杠 m 啊这个量化版本, 然后那个 i m studio, 还有拉玛 c p p 啊,我们现在我现在自己本地的话也全部都在那个哈克 face 和那个摩塔设计区上面去下载了同一个量化版本,可以看一下我的这个 i m 模型啊, 嗯,看也是使用的是千万三点六三十五 b 啊,哎,呃,杠 s m b 啊,杠 u d 啊, q 四杠 k 杠 m 啊,都是用的斯比特的一个量化版本啊,它们大小基本都是一个,呃,将近是二十三 g 的 一个大小,嗯,来先看一下第一个是欧拉玛,欧拉玛 看一下,再看看一下这里的一个显存啊,现在我现在呢就先用欧拉玛去做个对话啊, 看一下我的内存占用,嗯,相当于它从一点九 g 就 直接两 g 直接涨到了二十七 g, 这个模型本本身的这个,呃,那个文件大小的话来给你看一下, 看一下这个文件本身大小将近只有只有二十三 g, 但实际它在使用这个 gpu 进行推理的时候呢,它直接给我飙到了二十七点二 g 啊,就相当于直接占了我将近二十五个 g 啊,二十五点三个 g 的, 呃,线存,这是欧拉玛 用的,来,我们把这个欧拉玛给直接退掉,把这个线存给释放掉,看一下线存直接就降下来了,嗯, 现在已经是一点六 g 啊,一点六 g, ok, 嗯,再来起一个,再来再起一个,拉马 c p p, 拉马 c p p 啊, ok, 用拉马 c p p 啊,这儿我准备了,准准备好了它这个命令啊, 再看,哦,刚忘忘记说了,忘记忘记说,欧拉玛,呃,我使用的是同一种量化模型,而且它们所有这三种模型它使用的上下文的长度都使用的是三十二 k 啊,幺零二四去乘以上三十二算出来的这个杠 c 三二七六八啊,这个值啊, 这里指定了一些参数啊,这个杠 m 呢,就是我的模型的位置啊,是 g u g g u f 的 格式的,然后端口是,呃,八零八零啊,然后这个商家文的长度呢,是三十二 k 啊,三十二 k, 然后呢,这是这个用 g p u 加速啊,嗯,就是全部使用 g p u 计计算, ok, 来,起一下, 现在用的是拉马 c p p, 看一下它,呃,现在还没有启动,稍等一下, ok, 嗯,这个,呃,拉曼 c p p 已经起来了,也用的是同一种模型,看一下它内存占用啊,相当于我是由将近一点九 g 到了这个二十三点四 g 啊,就是说我将近是占了是二十一点四 g 的 一个线从啊, 我指定的端口是八零八零啊,直接访问八零八零啊, ok, 嗯嗯,用的也是这个千分三点六三十五 b 高 a 三 b q 四量化版本啊。嗯啊,来最简单的 看一下,看一下它,它的输输出的速度啊。嗯,看到了没有? 它显存占用的话就只有,呃,相当于是二十一点五 g 左右的一个显存占用,然后看它的输出 top, 嗯, 的思考就不说了,总看它的输出 top, 其实是一百零八点就相当于一百零八个 top 每秒,这个速度非常快,就明显会比欧拉玛节省将近四个多 g 的 显存,明显要比欧拉玛节省四个多 g 的 显存,很明显,非常明显。嗯, ok, 嗯,然后呢,这里就先停下,停下这个拉马 c p p, 然后再再使用最后一种啊,就是那个 airm 四丢丢,嗯,看一下它,血尘已经释放出来了。嗯, 血尘已经释放出来了。看,服务已经停掉了服务已经停掉了, ok, 再使用最后一种 airm 四丢丢来看一下, ok, 嗯,使用 airm 四丢丢啊,现在看一下。 来看,它现在开始默认加载我之前的模型,看一下显存占用 也是二十三点四 g, 看到了没有?嗯, 看一下它的这个输出显存占用。 im studio 和这个拉曼 c p p 啊,是完全一致的,然后它 token token 的 输出速度也是这将近是一百零一个 token 每秒,非常明显啊,就是,如果说是完全一个新手小白,你自己本地要玩这个 i 模型,你可以用这个欧拉玛 啊,它主要是现在生态做的不错,但其实它的这个输出性能上什么的要比啊,就是 elm studio 和拉玛 c p p 差非常多。那把显存给释放掉,释放掉?刚刚应该是,呃,没有把这个拉玛去看一下它的一个输出啊,输出的话重新可以去启动去看一下啊, 最简单的来做一个测试啊, 看到了没有?飙升到二十七点一 g 的 显存就明显要比啊,就拉满 cpb 和 iphone 四九九啊,直接这是将近多了四个 g 的 显存, 这个我之前我就就是从哪一个版本开始更新以后的话我就发现了啊,发现就是它占用显存就明显增大了,本身我们正常的一个模型的话啊,模型比如说它是一个六 g 的 模型,你实际要使用将近十 g 的 显存才能跑得起来,就明显要比 我们的这个模型的文件要大很多。那它到底用到哪里啊?这个算理到底用在哪里?也不明白。 token 的 输出的速度,因为它这里没有任何的计算啊,所以也看不出来啊,这个拉玛其实 不太建议用啊,真的是不太建议用啊,就是说啊,因为如果你真的要上服务器啊什么的话,完全是要用这个 v r m 和这个啊,那个 s v g long 啊这些。现在用这个奥拉玛确实不太行啊,它速度还有这个推体速度还显存占用明显大了非常多。 ok, ok 啊,那就到这里啊,有什么问题的话可以私信我啊,私信我啊,我可以做。
粉丝833获赞904

啊啊! 之前有小伙伴问 lm studio 是 否支持小龙虾 open club 以及如何配置,这次就简单做一期视频,教大家如何设置,也是超简单的,如果你还不会的话,跟我一步一步操作即可,这也适合新装小龙虾的配置哦。 首先自然是确保你已经下载了你要用的模型,这里我就用千问三点五三十五币作为例子,大家可以看到我已经加载好了。然后只需要来到小龙虾这里,直接运行 opencloud on board, 这样我们就可以配置新的模型了。 小龙虾还是比较智能的,它会识别到你已经有配置,这里我们只需要改动一下模型,所以我们选 update values。 然后就是熟悉的配置页面了, 我们选 custom provider, 这里默认会出现奥拉玛的本地服务器地址。我们则要来到 lm studio, 点击 server settings 这里我们关闭 require authentication, 并且打开 serve on local network。 此时右侧就可以看到 url 从之前的幺二七点零点零点幺变成了你本机的 ip 地址, 这样部署在非本机的服务也可以调用 lm studio api 了。如果你的小龙虾是部署在本机的,那就不用打开 servelocal network 这个选项,保持幺二七点零点零点幺的 ip 地址即可。由于我的龙虾是在其他设备上部署 的,所以我这里需要把本地的 lm studio api 地址暴露给他们,我们点击这里复制,然后删掉奥拉玛的地址并粘贴上去。这里注意, 我们要加上一个斜杠 v 一 再按回车。然后这里我们就选 paste api。 但是由于我们之前关闭了 require authentication, 即不需要 api, 所以 我们这里随便打个一二三四即可。 这里我们可以选 open ai compatible, 即 open ai 兼容 api, 不 过 i o m studio 也支持了 osraplay 兼容 api, 你 也可以尝试拥有。这里我们就选 open ai 兼容 api 了哈。这里我们输入模型的 id 名字即可。我们回到 i o m studio, 这里就是模型 id 了,我们复制下来,在输入的时候需要加上模型的提供商,由于这个模型是昂尔斯的,所以我们打上昂尔斯斜杠,再粘贴上去。按回车之后,我们就会看到龙虾说 verification successful, 即验证成功, 这里直接回车,然后他会让我们给模型一个别名,我们就不起了,直接回车。 下面我们可以全部按跳过,因为我都配过了。最后重启小龙虾的路由就大功告成了。打开 t u i 后, 此时我们就可以看到 l m studio 已经接到龙虾来的请求了,然后这里也显示正在使用千问三点五三十五 b 的 模型,然后龙虾也回复了内容怎么样,你学会了吗?

大家好,我是根谷,今天是 open core 第六堂课啊,本地模型配置的 lm studio 片和微软的这样一个开发了这个,呃,本地大模型管理的工具啊。首先祝大家二六年, 呃,新年快乐,明天就过年了,建议大家先去看欧拉玛篇,因为欧拉玛篇会的话,这篇就非常容易了。非常容易了,那首先给大家看一下我这个那个 bug 啊,就是这就是 open core 的 一个官网,我前天好像提了个 bug 啊,就在这个英雄里面给他开了个 bug, 我 看看 这个 bug 其实就是 l m 十丢丢的一个 bug, 就是 在它重启的时候,它会失去了这个通信链接,我待会怎么证明我是它是一个 bug 啊,我把各个的环境啊,还有我怎么操作的选择的模型啊,最后配置文件都截图都分享出来了,现在还没有人回复我, 好,我是怎么做的呢?就是首先你要打开 i m 四丢丢点 ai, 这是微软的一个官网,你去下载啊,你如果你是 windows 电脑,它自动的,就会自动的给你到 windows 的 电脑那个那个,呃,安装的这个软件啊,你把它下下就好了,下下来以后就会出现一个这样子的 i m 四丢丢啊,这个就是你的一个那个, 呃,就比欧拉玛复杂多了,因为这个他不是面向开发者的,但是我感觉,呃,用这个也是挺不错的,他有海量的这样一个模型,让你去下载,我这里面下了一个千万三的一个模型。千万三的一个模型,呃,正常的就是在这个地方,比如说 给我讲个笑话,那这个非常容易啊,就不需要去给大家演示,你直接下一个模型,它都是界面的管理,你在这里下一下就好了,点它下载它就能下载,下载了好了以后在这个地方就能够选模模型,选到了模型以后,在这里你就把它去装入这个模型了,就是去加载这个模型,这个模型在这里, 在这个地方千万三星,那就就这个,就在这个地方。然后呃,我说这这个这里,这是他开发文档,然后这个地方他有几个端点,就是他有几套的去对接 api 调用,你首先去这里设置里面把这个, 呃网络这个服务供应,这个服务网络中提供服务,把它打开之前是默认关闭的,你把它打开就好了,那这个端口也不要去改,就用它的一二三四,那这个比较好记一些,比较好记一些。 配置好了以后,配置好了以后就点一下它就关了。嗯,首先这个地方 state 需要,需要开启这个服务啊,需要开启这个服务,开启这个服务完以后就是输入这个啊,就是 ceo 啊,然后这个 我这样就跟它对接了,你看吧,我的,我的 h t t p local house, 一 二三四五,对吧?一二三四 api v e chat, 并且你还是可以用这个 open ai com compatible 这样一个呃 协议进行对接,那你 pos 的 请求就是唯一,呃,你,你是 boss, 它自动的会跟你拼接啊,那我这里就用这个客请求和它对接好了,剩下的就是我用客请求去把它塞到呃这个 open core 里面去。那怎么做呢? 也是在这里啊,就是我因为它这个网站啊,它这个网站不像欧拉玛,它自动的里面,呃,跟它做了 open open clone 这样一个对接啊,大家看到上海课就知道这里微软的 i m studio 并没有对这个小龙虾进行做对接,那没有做对接也是没问题的,我们就直接在这个这里去做配置啊。就是我首先是 open clone 是 吧? clone 有 一个叫 daisy board 的 啊,不是 daisy board 的 on board, on board 的 一个 insode 这样一个地方,我重新进行配置啊,重新进行配置的话是 yes 啊,然后 click start, 然后我要更新其中的一个字,这里选选第二或选第一都是可以的,我去更新它,对吧?到了这个地方 一定要选 custom pro i 的, 因为因为你这里没有没有那个 lm studio, 它都是模型在线的。我们是需要 http 请求,这个 http 请求就是呃, local house 的 一二七点一这里,这个地方就是一定是一二三四。 好,这个地方一定是写一二三四。我,我需要把这个呃日字给清掉,待会可以看一下我,我这个 open core 已经会怎么和它连通的哈。如果你这个地方假设我,我写错了,我这个地方假设有个什么 a a 啊,这是瞎写的,他就会报错啊。这个 api key 没关系,因为他我没开通那个,我没有去开健全这个地方我没有去开这个要求健全,所以说这个 api 你 写写不写 api key 都可以的。 这个时候就是 open ai controllable, 和这里是一模一样的,看到吧,哎,回车好, mod id 非常重要,你不能瞎写,这个 mod id 就 在这里,你看把它粘出来就好了。对 啊,他都告诉了你啊,就 local horse 的 一一一一 charnel 就 一二三四啊,这个它比那个小龙虾啊,不是比小龙虾,比那个欧拉玛要做的好啊的地方,就它各个地方都出来,哎,你看, 呃,其实它已经连通了,但是你这边唯一 a a a a, 它应该是唯一,你看到了吗? 所以说他就报错,报到错,对吧?然后这里有个端点 id, 这个端点 id 让他默认给就好了。啊,这个,这个这个名字啊,然后这就是错了,错了的话你就得重新填过,所以说他没有返回的机会,就是我,我现在 就是你只要按 esc 退出重新来过,所以说这里那我快速的演示一遍就是正确的应该怎么做。 yes, click start 第一个, 然后选这个 customwide 的, 哎,这个地方他又默认的,就就写一二三四就好了。呃呃。你说有些人为什么不加 api 呢?你看我这个地方为什么有 api? api 是 它的另外一套这个接口服务啊,是这个, 这里有一个 api 点微,但是一般来说是没有 api 的, 所以说这个就是没问题了,一定是这样子的,微一它后面会自动的跟你加陌陌的啊和那个例子 box 啊,然后这个就回车啊, 一定是要选择这个 openair compatible, 哎,然后这个 mod id 不 能瞎写啊。就是你,你这里,呃用的是什么 mod 就是 用什么 mod, 哎,你如果可以换的,就是在在在在这个地方换啊,就是在这个 my mod 里面,我这里只有一个,你可以选,你可以选 好,然后这个地方我,对了,以后你看,哎,这个地方他就补报错了,全绿了,看到没有,哎,这个地方全绿了,我给他全通了,全通了,那全通了就赶紧去启动一下,那就是 skip, 因为我之前都装了,也不要去装他的 skill 式,也也不需要装他 fuk 式啊, 直接就启动这个网关是吧?因此多领啊, get 位首位,然后让它浏览器打开,那这样就通了,其实它配置起来其实是比那个欧拉玛要简单,为什么呢?这微软还是做的可以的。但是呢,但是呢,这个 open core 竟然和它 内部的就是那个,我感觉它很多没有去做兼容到这一步就已经通了啊,你学会了吗?

hello, 大家好啊,今天我们来测试一下这个切分三点六二十七 b 的 这个模型,这个重密模型它的性能测试到底就性能到底是什么样子的, 呃,也是从这我们本地去部署的这几个软件,然后来逐步的去测试啊,呃,考虑到对内存的占用啊,就是我们先从这些呃占用内存的这些软件,呃,逐步去测试,从这个先从欧拉玛,然后再从这个 lm studio, 然后这个 lm app, 然后还有这个最后的这个 vlm 啊, 这样的一个测试顺序啊。首先来第一个就是欧拉玛,呃,欧拉玛我自己本地的话也已经下载了,下载了,然后,呃,我们可以看一下这个 看一下啊,千万三点六二七 b 这个模型呢,它只有十七 g 左右的一个大小,嗯,也可以看一下,我自己现在初识内存是零点八 g 啊, ok 啊,这几种模型这几种软件我都通,因为他都支持这个 open i 的 这个标准格式吗?就已经全部到接入到 chris 丢丢里面了啊。然后呢,先从欧拉玛开始啊,欧拉玛开始我这边已经准备好了,就是,呃,三点六二七 b 的 这个模型啊,呃啊,对,忘了说一句啊,就是可以看一下,呃,欧拉玛 啊,他所有的这个就是这几个软件啊,他所有的上下文一定都是保持三十二 k 的 一个上下文啊, ok 啊,来先测试欧拉玛,嗯, 看一下显存占用啊, 十七 g 的 大小,除过我基础是零点八 g 的 显存占用外,相当于占用了将近二十三个 g, 二十三点呃,二 g 的 显存,但模型文件本质上只有十七 g 啊, 二十五个 tiktok 每秒,然后再来测试一下。 思考了挺长时间呢,二十六个逃客每秒啊,几乎就是这个数字, ok, 对, 欧拉曼,我们就先把它的内存呃显存给直接释放掉,把欧拉曼直接给退掉了,退掉,然后看一下, ok, 欧拉曼已经退掉了,看一下我的显存啊,显存已经回到这个零点八零点九,这,这这样子啊, 零点八 g 显存已经只有零点八 g 了,奥拉玛,就这边已经结束掉,大概就是二十五个 token 左右啊,然后来看一下这个,呃, l lms 丢丢啊, lms 丢丢看一下, 嗯,看它显存占用啊,是从零点八 g 到了十七点四,它显存占用就相当于将近十六点六啊,就十六点六 g 的 显存占用 二十八个 token 每秒,再来一下啊, ok, 还是二二十八个透坑每秒, ok 啊,然后再把这个 i m 四六六也退掉。退掉,然后看一下,看一下显存已经释放出来了,又回到了零点八 g 啊, 然后再来看一下这个 i m 四 i m 这个那个什么啊,浪漫 c p p 啊,看一下浪漫 c p p 的 这个显存占用, ok, 也起的是这个二十七 b 这个重密模型啊, ok, 啊,已经启动结束了,看一下它的显存是由零点八 g 啊,直接到了十九点一啊,相信占了是十八点三 g 的 一个显存啊,来看一下啊, 二十八个透刻每秒,嗯, 再来一下,再来一下, ok, 呃,它和这个这个 i m studio 啊,本质上都是一样的啊,其实都是这个二十八颗头克每秒, ok, 那 我们把这个 i m studio 这这个,呃,不是拉萨 c p p 也结束掉,把我们的显存给释放出来, ok, 最后来试一下这个,呃,试一下这个 v i m 啊,这个就只能从这个零零五四子系统里面去试测试了。 ok, 这是,呃, ws 的 这个 linux 系统啊。啊,这边我也准备好命令啊,呃,先要去进一下这个虚拟环境啊,这个是专门起了一个 python 的 一个虚拟环境啊, 然后因为要去把它的默认的这个下载的这个路径啊,要设成这个,呃,摩塔社区啊,要不然的话它会从 happyface 去下载啊,就会非常慢啊,当然这个模型我已经下载了。 然后呢,啊,来,我们起一下这个二七 b 的 啊,这个我起的是这个 a w q 这个格式的这个模型文件稍微就是大一点,是二十一点八八 g 啊。 ok, 在 启动当中啊, 显从已经占用了二十一点一, 还在往过升 二十三点五的显存占用了。用 v i m 的 话,其实它对内存的占用也非常高啊,因为我自己相当于是在这个 w g r s l 的 这个子系统下面,嗯, linux 子系统下面, 所以它是既需要起这个子系统又要起这个啊, v i m 还要运行模型啊,所以它内存占用是非常大占用了我大概现在,呃,试着让它起起一下,让我看一下。 呃,现在已经占了二十五二十六个 g 的 内存了。二十六个 g 的 内存了, 还没有起起来,还在起 啊,启动这个过程都已经把我的显存已经给爆了。 显存爆了,已经占了我的内存啊,已经占了十四点几个 g 了啊, 启动的时候会特别慢啊,启动之后的话,其实只是模型占用的显存来说没有这么大啊,但是相对于其他的,呃,本地部署的方式的话,对显存占用来说的话就已经算很大了。 看一下啊,他只是有这么一段啊,就有有这么一段时间是对显存还有内存占用非常大。 ok 啊,现在已经起起来了,看一下它最终的一个显存占用的是二十九点一啊,是二十九点一 g 的 一个显存。 ok, 那 现在我们来测试一下啊, 二十九个偷克每秒啊,再来一下啊。 ok 啊,二十九个偷克每秒。 ok, 那 今天呢这个测试呢就到这里,之后的话会出就是出一些这个通过啊,使用到这个 turbocom 或者是 deflunch 的 这种 啊,一个是对于啊推理的加速,一个呢是对于啊显存的压缩啊,到时候看一下有没有。

hello 啊,大家好,是这样的,就是有一些小伙伴啊,就问一下,一直在私信问这个 cherry studio 啊这个软件,就说我接入了本地这么多种模型啊,然后用的这个工具是什么啊?可以说一下就是叫 cherry studio 啊, cherry studio 啊,然后它的官网的地址呢?就是啊, cherry 杠 i i 点 com 啊,就这个地址,然后具体是怎么接入的 啊?可以大概讲一下,是这样子啊,就首先你下载了这个软件,然后安装以后呢,就是在设置左下角左下角这个设置里面设置里面,然后有看到了就这么多种啊,各各个这个模型的平台,然后你也可以自定义自己去添加啊, 比如啊,比如像我的这个 l m, 呃,那个什么拉玛 c p p, 还有这个这个 v i m, 还有就是这个拉玛斯,呃,这个拉玛斯丢丢,不是啊,就是拉玛 c p p, 还有这个 v i m 是 我自己添加的啊,这是怎么添加的?其实呢就是我们所有接入 ai 的 一个过程呢,都是 呃主要呢就是一个基础的 u l, 然后提供商呢是名字自己起的,比如说你自己起一个什么什么 deep, deepsea, 或者说什么超算互联网啊 等等等等。然后你使用的模型提供商的这个标准的话,基本这现在目前主流的就几种方式嘛,一种就是 这个 astopic 下的啊,或者说呃就 open i 的 这种标准格式啊,但是默认基本情况下都是呃这个 open i 的 这种标准格式啊,你看然后点击确定,然后,然后就添加了这么一个,添加了以后呢,就是一呢就是要添一下那个 base u l 啊,就是访问模型 的一个接口地址啊,接口地址可以看一下拉马 c p p。 我 本地的,那就是啊,默认端口是幺二七点零点零点幺点八零八零,然后 v 一, 然后后面就插这个,它默认会加这个这这个接口的这个地址啊,然后它是一个标准的一个 接口啊接口,其实这个接口就是呃有一些参数啊,就说你用了什么,这用了哪个模型啊?模型的 id 是 什么,然后去给你做输出。 呃,像我们自己如果是本地部署的模型的话,它其实是不需要这个 ipi k 的 啊,不需要 ipi k, 但是如果说你是要使用这个 模型厂商呢?比如说千万呀啊, deepsea 呀,或者说呃豆包呀,或者说呃那个 check gpt 啊等等等等,它就会也有个基础的 ipi k 的 那个密钥啊,就这俩就可以了。然后每次接入接入了以后 啊,这样子的话,就是接入你把这几项基础值填完了以后,就就就就接入了,接入了以后的话,那就是正常的聊天助手里面的 聊天助手,你就添加个助手,有默认的这是什么助手啊?或者说其他的这些就 chris 丢丢里面这已经提供了很多啊,其实就是相当于给了一个系统角色,系统角色他的默认的一个人物背景啊, 然后啊接入我正常添加了这几个。我当时测试的啊,就是本地的模型啊,都用的是自己起的另一个名字啊,拉曼 cpb 啊什么的,比如说拉曼 cpb, 我 用拉曼 cpb 去测试的时候,那我在这里我就可以去选我自己接入的模型,你看我自己接入了拉曼 cpb 啊, airm, studio v i m, 还有欧拉玛啊,还有这个钱瑞艾艾啊,就这几种,这几种,然后呢,你在这就可以去选 这里的话,你就可以选对应的这游戏那个模型厂商,以及他对应的模型等等等等。还有就是 chris 丢丢,他有几个好用的地方,就是他其实在这里是接入了,呃,这儿 叫什么?叫小程序啊,就是小程序这个菜单栏里面,相当于接入了目前主流的这个大部分的这个 ai 的 厂家啊, deepsea 呀,豆包呀,拆 jp 千问啊,就 还有腾讯的元宝等等,他都是就像我们正常的在移动端啊,去接入的那些豆包啊什么的,都是一样的啊,平常的豆包,然后他就接入了啊,然后就这样可以正常的去聊天啊,他其实就相当于接入这个豆包网页版一样啊,像这个啊, deepsea 啊, ok 啊,这不就 deepsea 就 这里可以接入很多很多啊,就是叉 s 九九,就是目前是用起来会比较方便, 这就是啊,这个接入的过程,大家有什么问题的话随时都可以留言,我们随时沟通。


大家好,这次我们一起来学习一下如何使用语料库和 reg。 这个是豆包做的 ppt, 就是 说现在很多大模型 知识库只能停留在最后训练完的那段时间,特别是本地的大模型,知道的东西很少。另外在我们搞科研的时候,需要给 ai 喂大量的专业知识, 还有一些需要保密的场景,需要我们本地部署大模型,但本地模型知识体系有限,以及要解决 ai 会乱编和幻觉的问题。基于这些原因,我们需要一个语料库来给 ai 投喂大量的论文来满足自己的需求。 github 上有很多专门处理语料库的开源项目, 像 d t、 y 之类的,这里我选择使用 rockfloor, 这个是 ai 生成的 ppt, 大家有兴趣可以了解一下。总的来说就是 rockfloor 可以 处理很多类型的文件, txt, pdf, jason 等等。另外, rockfloor 还使用了 deepdoor c 项目 ocr, 这方面很不错。这个是 rockfloor 做的底层优化,专门针对数据做切片和所以, 然后它还能帮你指出在哪篇文章,哪段话被引用,并且还能像 ctrl y 那 样拉自动化工作流。为了让 reg flow 跑起来,我们需要准备一些工具。 docker 是 一个容器,里面有一个轻量化虚拟机,运行的一个 linux 来跑各种应用。 我们的 reg flow, 还有数据库等等都运行在 docker 中。当然,除了 reg flow 以外,其他的 circle 等一些工具可以部署在物理机上,也方便解偶来分布式部署,降低对单台机器性能的要求。 然后因为我单台电脑性能有限或者操作麻烦的问题,我多准备了欧拉拉玛和 i m s 六六来方便使用,这个是一些推荐的配置,一般来说能流畅跑 win 十和 win 十一的硬件应该没有太大问题。首先我们去 docker 官网下载 docker 桌面版, 这里选择 windows amd 六十四点击下载。然后我们右键以管理员身份运行。 部分情况下会报错,只是因为 docker 做了权限限制原因,这里可以对 c 盘的 program files 文件夹赋予目前登录账号读写执行权限来解决,我直接对全盘赋予权限。 然后我们需要开启 windows 的 虚拟化设置和下载 wsl, 毕竟 docker 中许多项目需要跑在 linux 上, 这里开启虚拟化平台,支持和试用 linux 的 windows 子系统都要打开。 然后使用 wsl install 命令安装 wsl, 如果出现报错,六十秒内点击键盘即可正常下载。 然后在 lm studio 官网下载 lm。 另外在 github 上下载欧拉玛。 lm studio 和欧拉玛的作用是让我们的本地模型能够运行起来,并向 ragfloor 提供 api 接口调用。 现在我们开始部署 rock flow, 这里直接 git clone 下载 rock flow 源码项目。 如果网络原因无法 git clone, 可以 直接在 github 上下载 zip 解压之后进入到 rock flow 跟目录中,再进入 docker 目录执行命令。 这里需要先将我们之前下载好的 docker desktop 打开,挂在 docker 服务在后台, 然后执行 docker compose, 这样按照执行脚本自动下载各种依赖来运行 rack flow。 如果下载失败,建议设置代理来下载。 我们执行 docker compose。 实际上执行这几个脚本, 这个脚本能看到相关的软件版本和配置需求,还有端口号,执行 docker compose 之后, docker 会自动下载相关依赖。另外这个配置文件存在很多预定义的变量,我们可以在同级目录下的 emv 找到, 这里我们可以看到下载的 regular flow 镜像的配置,可以看到此时 regular flow 是 不带 embedding 的。 当然我这里也不需要下载,直接在欧拉玛上部署。这里我手动破了每一个依赖来运行, 不直接使用脚本安装,大家可以参考一下。在部署大模型之前,我们需要理解两个概念,大家可以参考一下 ai 的 回答。总的来说就是 l m 是 用来对话 处理文字上下文,然后输出自然语言。平常我们使用的大模型一般是这种, embedding 是 将输入的文字转换为计算机,方便存储和理解的向量有点像限速,这里我们使用 lm studio 来部署 lm 大 模型,大模型的话我使用 q one 三点五, 然后记得在后台开启服务,让其他程序可以通过 api 来调用。 embedding 的 话,直接在 cmd 使用欧拉玛来破一个模型名字,如图所示。 list 查看下载下来的模型。现在我们豆可阿依赖配置好了, lm 和 embedding 都有了,而 lm 跑在 lm studio 的 进程中, embedding 跑在 lm studio 也行。然后我们回到 redflow 的 根目录中,进入 doc 目录, 重新执行 docker compose 命令来启动 ragflow。 这里需要注册账号,密码可以随便填。 点击右上角为 ragflow 添加本地大模型。 右侧搜索 openai ipi compatible, 我 们需要找到兼容 openai 的 ipi 调用格式,然后输入 i o m studio 的 i o m 模型服务的端口号和 api 接口, 主要模型名字端口号需要与 i o m 服务一致,接口选择与 open ai 兼容。 这里模型类型选择 chat, api key 空或者随便填 token, 可以 根据自己需求来配置, 然后添加 i o m 模型即可。接下来是添加 embedding 模型, 下拉找到欧拉玛,如果 docker 安装了 embedding, 可以 使用这个 url。 这里我没有在 docker 中安装,直接在物理机上使用欧拉玛来运行 embedding。 此时的 reg flow 处于 docker 网段中,我们需要向外寻找容器之外的 物理机上的 ip 地址。 c m d 中输入 ip c o n figure, 找到本地 ip 地址,这里将 u i l 的 ip 地址改成本机在局域网中的 ip 地址,而非容器内部 linux 的 ip。 现在我们 l m 和 embedding 都添加成功了。下面我们尝试使用一下语料库, 然后创建知识库。 这里可以根据自己需求来选择。 这里我上传一个 tst 文本格式的文件来测试一下, 这里记得要点击解析才能被锁影。 然后在右边可以根据自己需求来配置并选择一个知识库。 现在我们输入文案来尝试是否成功。实际上这个项目我也没有用过,不知道怎么去用,刚才试了几次,也不能够提取出知识库的内容, 这次我开了深度思考,不知道是不是成功了。这里两千零二十六好像原文出现过, 然后 m i a 照影,原文好像也有。 最后就是文章所引,能指出内容出处。

大家好,我是 vivi。 这几天 cloud 的 圈子炸了,官方突然强制向 kyc 抓脸,这无疑是雪上加霜,所以我们必须有一些备用的方案。今天给大家介绍一个本地模型无限续费的方法,现在我们看到的就是用一句话做出来的登录效果。 首先第一步,我们下载 lm studio, 有 人会问这个跟欧拉玛有什么区别,相比之下他对新人会更友好,全格式化操作。 第二步,我们在这里选择杰克隆的模型,模型分为两种,一种是二十七 b, 一 种是九 b 的, 设置于我们本地显卡的显存这里我们只能选九 b 的, 如果你的显卡是 是三十二 g 显存或者二十四 g 的, 你可以考虑选择二十七 b 的 模型。下载好之后,我们在这里直接点加载, 然后进入到聊天的窗口,给他去输一些指令和一些提示词,去做一些简单的测试。我的显卡是四六六零十六 g 显存的显卡,在我本地测试大概有六十个托克,每秒相对已经足够使用了。 第三步,就非常的重要,在这里我们要设置我们的模型,能够通过 api 来访问,在设置里面设置一个端口号,设置一个我们访问的 key, 然后在右边的 logo 里面把我们的上下文设置到最大。第四步,我们要测试我们的 api 是 不是正常的工作, 我们事先准备好了一个调用的脚本,然后再直接在 c m d 里面去调用,看他是否能正常返回,返回的托肯大概有多少。第五步,正式测试 cloud code, 先把环境变量设置好, 环境变量设置的内容我会放在评论区,然后打开一个 cmd, 进入到我们的一个工作空间,然后启动 color code, 在 这里我们可以看到 color code 的 前面的模型名称已经变了,变成了我们设置好的模型名称。 我们进行第一个卡扣的测试,直接问你是什么模型,他就会告诉你他是一个 can run 的 一个九 b v 三的模型。然后我们再问他你能做什么, 他会告诉你他会软件工程代码审查分析,问题诊断,架构设计等等。最后让他做一个炫酷的登录页面,看一下他是否足够聪明,他的设计是否能够满足我们的要求。 经过漫长的等待,大概花了五分钟,一十九秒终于做出来了,我们可以看这个效果还是不错的,如果我们把它当成一个应急的或者一个备选方,也是一个很不错的小帮手,谢谢大家。

最近我在 macbook airm 五上直接用 lm studio 本地跑了一个很有意思的大模型,叫 coopers, 三点五到九 b v 三 guf。 先说结论,这套组合真的比我预期里更实用。在我这台 macbook airm 五二十,实际上本地运行时平均速度大概能到三十到六十 token 四 s。 这个速度放在轻量本地部署里其实已经非常顺手了,无论是日常问答、代码辅助,还是做一些本地推理测试,整体体验都挺流畅。那这个模型为什么值得说一下呢?因为 coco 是 三点五到九 b v 三 gu 并不是一个全新的顶模,它本质上是分三点五九 b 的 一个微调版本, 但它的优化方向不是简单堆参数,而是更偏推理效率。根据模型页面给出的信息,它的平均推理长度是减少了的。也就是说,同样一个问题,他不会像有些模型那样,动不动就拉很长的思维链,输出很多看起来努力但不一定高效的内容。 更关键的是,虽然推理长度变短了,他的推理效率反而提升了百分之三十一点七。这一点我觉得非常重要,因为本地跑模型真正稀缺的不是会不会响,而是能不能用更少的托肯更快,给出更靠谱的结果。还有一个我觉得特别关键的升级点, opps, 三点五到九 b v 三 guf。 相比前面的 v 一 v 二,现在已经可以撩逗使用 m c p 和 skills 技能了。这件事看起来像是一个功能点,但实际上他会直接决定这个模 模型是能聊天还是能干活。因为一旦能调 m c p 和 skills, 它就不只是停留在本地对话层面了,而是可以进一步接工具,接能力,接工作流,比如调用外部服务执行任务,连接更复杂的本地或在线能力。这对于真正想把本地模型接入生产力场景的人来说 是一个质变。如果你手上也是 macbook airm 五二十四 g 这个配置,我的建议其实很直接, q 四和 q 六版本都可以装。

大家好,这期我们聊一个在本地跑大语言模型时绕不开的工具, lm studio。 如果你想在电脑上像用 chat gpt 一 样跑开源模型,又不想折腾服务器,它会把你从下载模型到对话再到本地 api 这一整条链路串起来。 接下来我从它是什么讲到安装场景和优缺点。先说定位, lm studio 是 一个桌面端的本地大语言模型运行平台,你也可以把它理解成带图形界面的本地 chat gpt。 它提供模型管理、对话窗口,还能做 prompt 和 agent 实验 核心就一句话,让普通人也能在本地跑模型,而不是只靠云端 api。 那 为什么很多人要本地跑? 现实里有四条硬需求,第一,数据隐私推理发生在本机,敏感内容不必出镜。第二,零偷看成本,反复试用和跑长文本,不会像按量计费那样心疼。第三,离线可用,没网也能跑,适合内网或封闭环境。 第四,模型自由享用, lama、 mstraw、 mix、 straw 还是 gemma? 由你选,不被平台绑死。功能上, lm studio 几块最常用,一是内置模型库,类似应用商店,一键下载,省去你自己吧 hugging face。 二是本地推理引擎底层类似 luma cpp, 支持 cpu 和 gpu, 也支持量化显存,不够也能玩小模型。三是 chat 界面多轮对话,上下文 system prompt 都能配。 四是重点, local server 可以 开 openai 兼容的本地端点,地址一般是 local host 一 千二百三十四。五是高级参数, temperature, top key, max tokens 上下文长度,方便你做 prompt 调优和小型 agent 试验, 上手流程很清晰。去了 studio ai 下载,支持 mac os、 windows 或 linux, 打开后在 discover 里搜模型并下载,再到 local models 里 load 选 cpu 或 gpu, 然后进 chat 就 能开聊。 进阶一步是打开 local server 点 start, 这样你就能在代码里把 base url 指到本地,用拍放 lan chain open web ui 去接,相当于把本地模型伪装成 open ai api。 典型场景四条,一是替代云端做日常聊天与写作。二是做模型对比和 prompt 实验的开发测试环境。 三是结合 lanchin、 autogen 或各类 agent 搭一个不出网的助手。四是企业里做私有化试点,数据不出内网,金融、医疗、政务这类场景会特别在意这一点。常被拿来对比的是 alma 粗暴总结, lm studio 的 图形界面和可视化更强,更像给人类用的 id。 alma 更偏命令行与自动化脚本,开发者友好度也很高, 新手想点点鼠标就把事办了,可以优先 lm studio, 如果要把模型服务嵌进流水线容器里,自动化很多人会更顺手用 alma, 两者都能开兼容。 api 选型看团队习惯, 优,缺点也要坦诚。优点是开箱即用, ui 友好,生态模型多,还能本地开 api。 缺点是性能天花板。在你的硬件上,大模型跑不动就是跑不动, gpu 调度和极致推理不一定比专业服务器框架强,它更偏个人与中小团队,不适合超大规模在线生产,认清边界就很好用。 最后收个尾, l m studio 代表的是本地 ai, 这条趋势模型可以下沉到终端,数据可以留 private。 一 句话,它是本地大模型时代非常好用的桌面入口, 想学大模型做应用或搭本地助手都值得从它开始试一下。如果你喜欢这类工具,像长视频,欢迎点赞、收藏、评论区留言,我们下期再见!

hello, 大家好啊,今天呢,来做一下这个 vm 的 一个本地部署的一个性能测试啊。呃,首先得说明一点啊,因为 vm 它本身更适合于服务器啊,就是我们常用在 linux 系统下面, 或者说啊 mac 或者说其他的啊,所以呢,是我在这个 windows 上面的话,我们只能在这个 wsl 下面的这个 linux 子系统下面去做这个测试啊。 其次呢,就是,呃,就是 v r m 它对 j j u f 这种格式的这个这个模型文件呢的支持不是不是特别友好,现在呢,官方还在优化啊,这个有官方的说明啊,所以我们本机这次采用测试的话,是只能是使用这个呃,千分之三点六杠三十五 b 杠 a 三 b a w q 的 这种版本,它也是一个斯比特的一个量化版本啊,就是 对于 vmm 来说的话,它支持是更友好啊。然后呢,呃,接下来就看直接看,直接启动一下来测试一下,这是在 vmm 下面的就是,呃,这是在这个 wcl 的 这个利用四子系统里面啊,然后直接去啊起一下这个,通过 vmm 去起一下这个 iwq 这个版本啊, 可以说说一下这个参数啊,先关注一下这个,我这里也是用的是 gpu 去加速啊,已经设到了零点九,然后 max 就是 上下文的这个速度的话,也设到了三十二 k 啊,和我前上一期的视频保持一致啊。嗯, 然后啊,要说一点,这个模型文件呢,稍微大一点啊,它是二十五点四九 g 啊,就首先得保证我自己的显存能吃得下,嗯,我自己的显存是三十二 g 啊,就是吃这个还是可以的,勉强可以啊,来我们启动测试一下, 稍等一下,这个服务器上面这个部署其实会启动的稍微慢一点, 启动服务这一块的话稍微慢一点啊,如果大家不想看完,就可以把这一段跳过,然后待会可以看直接看这个结果。看一下,看一下我这个 gpu 的 这个显存已经加载起来了,嗯,还在启动当中啊, 因为我这个 windows 系统下面就已经装安装了库达了啊,已经装安装了库达,所以在这个 linux 系统下面其实就不需要去安装, 它可以直通我 windows 系统的这这个库达,然后进行这个硬件加速啊,启动的过程稍微有一点啊, 看一下库达, ok 啊, ok, 呃,现在就已经提起来了,看一下它现在显存的一个占用啊,就已经是二十九点五这样,所以就是 v r m, 它其实更适合于服务器去部署。就是如果说你也是公司或者小团队啊, 然后小公司啊都可以用 v r m 去提一起,它主要的一点一个特点呢,是定发的性能高啊,然后我这个的话也是因为,呃,它也是默认支持 open i 的 这种标准的格式啊,标准格式,然后呢就直接接入这个 chris studio 了, 接入 cherry studio 这个是怎么接入的?这个可以大概看一下在这里啊,就是在是 cherry studio 里面模型里面,你自己就是自己添加一个厂商,比如说这我就添加个 v l 啊, v l m 啊, 然后呢采用的也是 open ipi 啊,那个 open i 的 这个格式,看一下我这儿也就已经接入来了啊。呃,刚刚他默认我采用的端口呢,是八千的一个端口啊,八千的端口,嗯,已经接近来了,这个也用的是这个 i w q 这个斯比特的一个量贩版本啊,然后现在来测试一下,测试一下看它。这个是我接入的,看 这里呢是千分三点六啊,三十五 b a 三 b a w q v r 呢,就是已经是这个格式,来可以给大家看一下啊。嗯, 看一下,这个请求已经发到这啊,现在这已经在输出了,看一下写成 ok 啊,来看一下。这次的话测试将近是一个八十五个通孔每秒, 继续再试一下, 看看速度会有没有提升啊什么的啊。九十几个 token, 九十三个 token 每秒。 所以 vrm 的 话,就是如果你是公司或者小团队,或者是说你自己本地有这种较大一点的这种 mini mac 啊,或者说就是那种小型那种服务器啊,服务器的物理机啊,你可以考虑这个做 vrm 安装。还有就是如果说你是单人的情况下, 你其实用呃拉玛 c p p 或者说 r m studio 就 可以了啊,没有必要完全就是用这个 vm, 如果说是公司小团队的话,你可以考虑用 vm 去啊,部署这个模型,因为它的病发能力会有强一些,当然就是你用的人越多,它占用的显存眼就越大啊。 ok, 就是 这样子, 可以看一下,我在这儿 studio 里面其实有接这个看一下,这个是 lm 的 studio 啊, lm studio 啊,你看可以看一下。呃,也部署的是这个,就是这个这个 这个这这个这个什么这个量化版本啊,也是这个 q 四的这个量化版本啊,就是我昨天上一个视频测试的是一百一十三个通关每秒,然后呢?之前也有做这个测试,这个是接入的是欧拉玛的,这个就用欧拉玛去部署的,然后它这个速度就稍微确实是慢一点,现在是八十五个通关每秒,就 这几个部署的模型。首先是我自己的本地啊,本地这个血橙刚好能吃得下的,然后能部署的啊,效果就是这样子啊,可以大家看一下。 ok, 那 就到这里啊,如果有什么问题随时都可以私信我们,随时都可以沟通,好吧?

ai 做 ppt 最强大的工具 gemini 一 条视频教会你用 gemini 做 ppt 的 五种方式,每种方式有什么优缺点、具体步骤、怎么操作?一条视频全部给你讲清楚。 一、 notebook lm 一 键直出 ppt 当你手上已经有一份长文档或者资料包,需要快速做成 ppt 的 时候,最省事的方式就是直接用 notebook lm。 notbook lm 是 谷歌的一款智能笔记工具,可以直接调用 nano bana 模型,一键生成图文并茂的 ppt。 操作也很简单,在 notebook lm 里新建一个笔记本,然后把你要用到的资料上传进去。 资料可以是 pdf, 网页链接或者文本内容都可以上传。完成后,在右侧的 studio 面板里选择演示文稿, 这里它提供了两种不同的演示格式。如果你想尽可能保留原始资料内容,可以选择详细演示文稿生成的信息密度会更高,内容也会更完整。如果你更看重展示效果,想让页面更简洁直观,就可以选择演示。用焕灯片,它会帮你提炼重点,做出更适合展示的版本。这里还可以选择输出语言和 ppt 长度, 也可以按照你的需求设定 ppt 的 受众风格和重点。比如我这里选详细演示文稿语言选简体中文,时常保持默认,描述部分可以先不填,让 notebook lm 自由发挥,然 然后直接点生成。等个几分钟,一份排版精美、内容详实的 ppt 就 出来了。每一页的配图都是通过 nano banana 模型生成的,图文高度匹配,整体风格也非常统一。生成之后,你还可以点击演示文稿右侧的三点菜单,进行重命名、分享、删除或者直接下载,非常方便。 二、 gemini canvas notebook i'm 生成的 ppt 本质上是图片,做好之后是没办法精修的,但如果你想要的是一份可以自由调整文字、图片、排版细节的 ppt, 那 更合适的方式就是直接用 gemini 的 canvas 功能。 通过 gemini canvas 生成的内容可以直接导入到 google slides, 也就是谷歌幻腾片里,后面不管是精修排版还是修改内容都会更方便。先进入 gemini 官网,在工具栏里找到 canvas, 进入之后,你同样可以先上传资料文件,然后把你对这份 ppt 的 要求直接告诉 gemini, 比如主题是什么,想做成什么风格,面向什么人群,重点讲哪些内容,接着点击发送就可以了。等几分钟之后,一份完整的 ppt 内容就会生成出来。 因为 gemini 主要是通过 html 格式制作的 ppt, 所以 gemini 修改起来也会非常方便和精准。如果你觉得某一页逻辑不够清楚,或者排版风格、内容重点还想再改,直接把修改意见继续发给 gemini, 它就会按照你的要求往下调整。如果你想自己手动修改,也可以直接点击导出到谷歌换灯片。 导出之后,你就可以像平时做 ppt 一 样,自由修改里面的文字、图片、版式和细节,等全部改完之后,再点击左上角的文件选择下载,就可以把这份 ppt 保存到本地了。三、 google slides 一 键美化 ppt 如果你已经有了一份 ppt 出稿,不管是自己做的,还是前面通过 notebook lm 或 canvas 生成的内容没问题, 但看起来不够惊艳,缺少一点视觉冲击力,那你可以试试 google slides 里的一键美化功能,这个功能专门用来优化 ppt 的 视觉效果,帮你把普通页面变得更有设计感。操作也很简单,先把你的 ppt 导入到 google slides 里, 然后选中你想优化的那一页,再点击下面的美化此换灯片,点完之后,右侧会弹出一个处理界面,等大概半分钟,美化后的页面就出来了。和原来的页面相比,美化后的排版会更完整,视觉效果也会更精致。如果你觉得效果不错,直接点击作为新换灯片插入,就可以把它放进你的屏。 如果你只是想优化其中某一张配图,也可以直接选中这张图片,然后点击编辑图片,接着把你的修改要求直接写进去发送给他。等图片处理完成之后,再点击替换,就可以把新的图片替换到原来的页面里。 如果你的 ppt 内容本身是步骤流程,对比结构或者数据关系比较多,那你还可以直接用信息图这个功能把你的需求写清楚就行。比如主题是什么?想突出哪些重点?风格?偏科技感还是极简?还是商务配色?有没有偏好?页面大致怎么排版?描述的越具体, 生成效果就越接近你想要的样子。生成之后可以先预览,不满意就继续调整,满意了再选择插入当前页面,或者作为新的一页加进去。 不过要注意,这些功能调用的是 nano banana 模型,美化后的内容是以图片形式导入的,所以没办法直接编辑文字和细节。四、 google sheets 图标联动到 ppt 如果你的 ppt 里要放很多数据表格或者图表,那更省事的一种做法就是先把 excel 上传到 google sheets, 也就是谷歌表格里,再把里面的图标直接联动到 google slides。 很多人做数据型 ppt 的 时候,习惯先在表格里把图做好, 然后截图粘到 ppt 里,这样当然也能用,但只要后面数据一变,你就得重新截图,重新替换,来回折腾会特别麻烦。在谷歌生态里,这件事会简单很多, 你可以先把 excel 上传到 google sheets 里,然后在上方工具栏找到 gemini, 选择生成图标。 gemini 会根据你表格里的数据,自动帮你生成对应的图标, 确认没问题之后,直接点击插入,就可以把图标放到表格里。接着再回到 google slides, 点击插入,选择图标,再选择来自表格,找到你刚刚用到的那份表格, 选中需要插入的图标,点击导入就可以了。导入的时候,系统会问你要不要保留和表格的链接,这里建议保留,因为这样后面只要瑞士里的原始数据更新了, ppt 里的图标也可以一键同步更新, 不用再手动替换。如果你的 ppt 里有大量图标,这个联动功能在后期统一修改的时候会特别省事。像行业分析、季度汇报、项目复盘这类 ppt 数据本身就是核心内容,用这种方式做起来会顺手很多。五、勾个位置,把 ppt 直接变成视频 如果你已经做好了一份 ppt, 接下来还想进一步把它做成视频,那谷歌生态里还有一个很好用的工具,就是 google 位置。它的作用很简单,就是可以直接基于你的 ppt 页面继续往下制作成一条完整的视频内容。 操作也很简单,先在 ppt 里点击右侧的视频转换按钮,然后选择你想转换成视频的那些页面。选好之后,系统就会自动进入 google 位置。 进入之后,你可以继续在右侧工具栏里完善这条视频的内容。比如你可以直接添加虚拟形象 ai 旁白字幕,也可以根据你的内容继续调整整体表达方式。 如果你还想把某些画面做的更丰富一点,也可以直接通过 view 来生成对应的视频内容,加到整条视频里,让你的 ppt 内容变得更加生动。等全部制作完成之后,点击左上角的文件,再选择下载,就可以把它导出成 mp。 四、视频保存下来。不过这里也有几个限制,如果你使用的是 ai 旁白功能, 整条视频的生成时长上限是十分钟,在开启 ai 功能的情况下,每个视频最多大概支持四十五张 ppt。 另外,导入的时候也有一些内容是不支持的,比如艺术字和视频文件,这些内容在转换前最好先提前处理一下。以上就是用 gemini 生态做 ppt 的 五种方式, 最后简单总结一下,如果你手上有现成资料,想最快出一版 ppt, 就 用 notebook lm。 如果你想做一份需要精修的 ppt, 就 用 gemini canvas。 如果你已经有初稿,只是页面不够好看,就使用 google slides 的 一键美化。如果你做的是汇报型、数据型 ppt, 可以 使用 google sheets 和 slides 联动。最后,你做完 ppt 还想继续做成视频,那就直接使用 google 位置。

有一个朋友问,呃,三零八零二十 g 或者二十四 g 的 一个单显卡能不能够运行?呃,先问三点五,那我就三点六啊,二十七 b 的 一个模型 q 四 k m, 然后他想要一百五十 k 的 上下文,我们来帮他测试一下。我现在两个显卡带两个四 k 显示器啊,我们可以看到这边用管理器中,呃,专用的 gpu 内存,是 看到吗?二点四 g, 好, 我们现在设置参数,那么上下文拉到一百五十 k, 嗯,对的,然后其他都是这样的一个 q sum, 然后这边默认应该是不勾选的 好参数都。呃,它要单并发,那我直接给它改成单并发吧。好,现在我们看这边计算下来是需要 三十三 g 的 一个显存,那么如果你的显存有四十 g, 它应该是全在显存里,如果你的显存只有二十 g 或二十四 g, 那 么多余的显存它就会到内存里。我们现在加载, 嗯,我这个硬盘比较拉垮,我们稍微等一下。 那待会其实我们可以看一下这个好,加载成功,打开聊天状态 向它来运行。然后,嗯,二十七米的速度不是很快,我们看一下它的一个显存占用情况是这样,在这边两张卡。 呃,首先我们看到这个温度啊,温度,大家看到这个四十四度和四十八度温度是不高的,因为它里面的显卡并没有真的一直在高峰运行,再加上我们的一个扇风扇和 水里面散的其实是完全把热量都散发出来了,但你机箱里面的可能有点高,然后显出这种情况是一个是十七 g, 一个是十三 g, 加起来就是确实有三十 g 多一点了,所以 现在看下来,你一张单卡三零八零或者一张单卡三零九零二十四 g 肯定是不够了,看一下速度, 他还没回答完,然后等他回来,我们可以看下速度。另外我们可以再测试一下 其他的一个,把,把那个换成 q v, 换成类型,量化类型给他改成 q 八啊,他的战力会更小一点。 好,中上了,马上结束了,我们看下速度,三十三 top 每秒。 ok, 那 我们先来退出,点错,因为按钮太小,然后我觉得我们可以看一下。首先看一下 如果只有二十四 g 线存或者二十 g 线存能开多大的上下文,因为它这个,你点这个 load mode, 这里面的这个这一块,它基本上是准确的啊。我们比如把它调到 一块一百 k, 一 百 k 是 二十八 g, 好 吧,那么也就是说二十四 g 呢?还是不行,那么我们把它调到 八十 k, 八十 k 还不够,你只能把它调到六六六十五 k 吧。 好,这个时候差不多了,所以实际上你这里可能只能开个六十 k。 就是 如果你是三零九零二十四 g 的 话,你还要注意,你不能把那个二十四 g 全用完,因为万一你有一些其他任务,呃,需要用到一定显存,你就会爆显存,这样一下就会慢下来,我们加载一下,测试一下, 下载成功。呃,一张卡是三点四 g, 一 张卡是十点五 g, 加起来嘛,就是数学比较好的同学已经比我更快的算出来,就是已经达到二十四 g, 但这里面有两个四根显示器的功劳, 所以基本上就是说二零三零九年二十四季,呃,如果你不去调整这个 k v 的 缓冲量化类型,你的一个显存就是只能够拉到六十 k, 那 么如果是三零八打开的话,那就更低了。 呃,那么现在我们把这个 k v 的 缓冲类型调整一下,我们先把上下文改回一百五十 k, 然后把这两个打开,开开 q 八, 里面有更多的设置,我们先测试 q 八吧。啊,经过 q 八量化的测试,它认为二十五 g 就 可以了,那我们跑一下,试一试。 success 没有? ok, successful, 我 们看一下。呃,为什么线都占满了呢? 我是不是忘记退出了?果然,我刚刚开了两个模型,所以他占满了,我们重新测试。 好的,现在重新测试。 因为我刚开了两个模型,所以他两个模型并行,前段是直接占满了。好的,现在开了一个模型,在 q 八的一个 kb 混合类型下,第一个显卡占用的是 十三点八 g, 也就十四 g 吧。第二个是十一点五 g, 嗯,加起来是差不多有二十六 g, 所以 就是说三零九零在开启这个 q 八量化的时候,你是可以去至少接近呃,一百五十 k 的 伤害,但是我们看一下它的速度啊。 嗯, 综合来说,速度呢,不要太大的影响 啊,它里面废话比较多,我们就等着看一下速度啊。 其实你如果用三五 b m o e 的 模型的话,它的速度就会开快很多, 还是差不多的速度。嗯,那这就是说我们有一个结论基本上出来了,如果你是三零九零二四 g 的 单卡,你能很勉强的去跑一个一百五十 k 的 伤害, 当然我没有去考虑到其他的那个技术啊,然后我这边的话还还可以再测试一下。如果我是把这个上海门拉满,然后我通过这个 两个 q 八的一个设置,我的四十 g 线头够不够把这个上下门拉满,先把原来的模型退了。好,上下门拉满。 q 八 q 八 好,成功拉满了以后,我们看第一张卡是占用了十七个 g, 第二张卡是占用了十三个 g, 也就是说 还富裕了很多。但是如果我们把毛巾带进去,我如果不开这个漏了它这里有个四十四个 g, 我 可以开过来测试一下。 好的,第一张卡好占满了,第二张卡几乎占满。几乎占满,那也没有到内存里去。我们不知道,但是我们可以测试一下 processing promote。 为什么在 processing promote? 因为它之前我们有很长的上下文,它要去先看一看上下文, 我看一下后来的日子。 promote or c 型 dong。 呃,四型的头喷用了多久? 哎,这看不出来,就这样吧,还弹够快吧。好,我们可以看到速度似乎没有爆料, 看一下占用的一个情况,显存的占用没有继续上升,因此我们可以呃,再次判断它的速度还是可以的, 因为我没有做那种,就是回答好直接让你看数据。那种测试用的量不够真实啊,我们都是原生的,真实测试二十五头可以。呃,速度有所下降, 具体的原因呢?我这边还是不太确定,我也不知道是不是啊。目前看来应该是没有报险钱,我们只能这么判断,因为报了险钱以后,它的速度是非常慢的。 好了,我们用,我们下次再测试吧。好吧,今天的这个测试视频不要搞的太长。好,谢谢大家。那我们的结论就是单卡的话,个人用户是 比较难用的,除非你把上下文调的很低,但是如果你把上下文调的很低,你本地模型其实只能聊天,干不了什么活,对吧?你接入一个 agent, 你 一个这个 六十 k 的 一个上下文,你接入 agent, 不好意思,你上来问一个,你好,他就有八十 k 的 一个提示词需要你去处理,然后你发现你那个根本就用不了, 所以我们建议大家还是个人用户的话。呃,最起码要三十二级的一个内存好吗?谢谢大家。

朋友们,呃,今天给大家介绍一下我基于通用千问三十四币,呃,还有 l m studio, 呃,再加 docker, 呃,然后呢?利用 r a g floor 搭建的一个汽车本地知识库哈。 嗯,目前的话就是大模型的本地步数很火吗?嗯,但是呢,呃,我们也知道哈,就是你要本地步数,大模型的话,对电脑的的这个要求配置很高啊,一般来说哈,就是显存肯定是电脑的这个独立显卡的显存最好是不能低于十六 g 内存的话啊, 就是三十二 g 起步吧,大家可以看一下我这个三十二 g 的 内存,你看现在 都差不多占到了百分之七十多啊,百分之七八十很很常见的,呃,其实就是,嗯,搭建本地大模型的这个成本其实很高哈, 嗯,比如说像我这个五零七零太的这个显卡,这个主机反正都是过万的,但是很多人因为我这个还只是算是个入门级的,就是比如说你要买啊,像这个,呃,四零九零魔改四十八 g 的 显卡,这一个显卡两万八,然后呢? 像五零五零九零 d 三十二 g 一个显卡也是两万多,两万四左右,其实本地这是部署这些,嗯,大模型的配置其实,呃要求挺高的,一点都不便宜。但是很多人呢,嗯,就是部署完了之后就去秀啊,我这个东西能一秒能保跑多少个 tokens 啊?是跑托克斯,然后呢?跑,跑完之后呢?其实没什么意义,就是你,你一定要部署本地大模型,你一定要把它用起来。呃,我为什么要部署这个 r e g flow 本地知识库呢?呃,是因为,呃,我这边啊,你看一下啊, 因为我做这个汽车自媒体啊,然后呢,我现在在聊这个,做这个代驾说车,像代驾说车啊,目前已经出了有两百多期作品了,我们可以看下作品哈。 呃,比如说我聊这个奔驰 gl e 四五零的朋友们,我今天把大家看一辆奔驰的 gl e 四五零哈,二零二五款,这个是二零二四年买的车啊,因为那个奔驰 gl e 四五零二五款,它是有前期跟后期嘛,这个有点不一样, 当时我开了有两点六公里的市区段啊,跟大家分享一下驾驶感受啊。第一,呃,这个车的话就是在市区开,感觉那几排悬挂很舒适啊,因为是带空悬的,动力肯定是没得说嘛,你在市区就不可能就是油门踩的很深 啊,反正我觉得在市区开的话啊,动力肯定是足够的啊,因为这个车是二点五 t 的 直列六缸发动机嘛。第二点的话就是这个车的话是带那个柏林之声音响的,应该是小柏林,车主也比较喜欢听歌嘛,呃,当时我们在车上听了几种不同,这种 对,我会分享每辆车的一个就是驾驶感受。然后呢,包括像底盘滤震啊,动力啊,转向啊,呃,隔音啊,包括音响的音质啊,甚至有时候也会跟车主聊聊这个车的买多少钱啊,包括有时候车主也会聊 自己的车二手值多少钱啊。这些时间长了之后的话,我可能就是有很多细节我可能可能就会记不住了,所以呢,我需要就是用这个,呃,本地知识库,我把它记出来,就是把它存起来,方便我以后查给大家看一下啊 啊,像我这个啊,像我这个搭建那个本本地知识库,这里面其实放的就是我刚才播的那个视频的那个口播啊,我把你给他看一下啊, 因为我做视频我是用那个呃,就是剪映剪做的嘛,然后我剪映它支持那个字幕导出,比如说导出为 txt 格式的,我导出之后呢,我把它上传到这个知识库里面, 上车完了之后它是可以做一个就是向量化的,这个就分块会把它数据向量化。向量化是什么意思呢?就是它会把这个嗯数据它拆成一块一块一块的。然后呢?呃,我想比如说我想问这个车的驾驶感受的时候,我直接问它就可以了。比如说, 呃奔驰 gl 四五零开起来 怎么样?因为他把这个呃就是我一整个的一个口播的那个字幕,他拆成一段一段的,然后我问他的时候,他很快你看就出来了 啊,他就你看他就说动力悬挂啊、音响啊啊使用空间啊,这样就可以了。这样的话,呃后面我想比如说车友问到了什么什么车的驾驶感受啊?我只要问一下大模型啊,他就很快的把一些细节就给我,呃,就是,嗯给我列出来了, 嗯,然后可以帮我快速的回忆啊,当时开这个车怎么怎么样啊?这样的话就不容易把一些细节漏掉啊。这样子,然后我给大家讲一下这个背后的一个运行原理是什么哈?呃,第一个啊,它这个就是你先把 把这个东西就把这个呃口播文案你传上去,传上去的话它会做一个向量化处理,向量化处理的话它是用到了一个叫做,呃 text embending b g e 杠 m 三,这是我们中国的一个模型啊,这是一个,就像你可以理解为是一个啊,就是,嗯,你把它就,你可以理解为是一个输入吧,输入用的模型, 然后输出用的模型的话,就是我问的时候输出用的模型,这个是用的是千问的,千问三十四币,就阿里的通讯千问三十四币啊,十四币是什么意思哈?就是一百四十亿的参数, 嗯,比如说我们跑本地的 r a g 知识库,一百四十亿参数就够了。其实,嗯,比如说更大参数,比如二十七 b 啊,还有什么三十五 b 的 吧,还有什么七零 b 啊,嗯,特别有些特别大的,你其实不一定用得上啊。当然啊,你电脑配置越高,可能是 就是那那另说,但是一般来说,像我这个代驾说车口播的话,它也就是那那另说,但是一般来说,像我这个代驾说车口播的话,它也就是千万的千万三十四 b 够用了啊, 好,呃,就是啊,这是我用到了两个这个就模型哈,看到了哈,然后软件是这个 i m studio, 这个,这个的话是在 windows 下面运行的啊,因为它有这个,你看它有这个库,你想下载什么模型啊?你直接直接就给它加载就可以了。 然后这是一个还用到了这个叫做 docker, 因为我的电脑是 windows 的 系统嘛, 然后呢? windows 系统,因为这个 docker 这个东西是 linux 的, 然后呢?它相对是个模拟器啊,然后呢?啊,就是就是,我就,我可以开了这个之后我可以在 windows 下面运行。呃,这个 linux 啊,这样子 本地部署啊, ai 这些,嗯,确实很火啊,但是你一定要就是找对你的一个应用场景啊,其实,嗯,就是很多很多事情没有那么复杂,你一定要找到你的应用场景,然后你持续做啊,这样的话啊,这些硬件投入才有价值, 我给大家看一下啊。 呃,我的话为什么我有这个备份,这个就是知识库的这种习惯呢?是因为我之前就有备份资料的习惯。给大家看一下啊,这个吧。 啊,比如说自媒体的资料我会备份啊,然后呢?包括,呃,就是我会定期把手机的照片视频备份到电脑啊,因为有这个习惯的话,我是保存了最近呃,十二年的手机的。主要的啊,手机相机的照片和视频吧,看一下啊, 比如这个,看这个,这个是二零一三年的,我们看下详细信息 啊,一三年七月份拍的,然后呢我们随便再拉一个哈,比如说这个啊,这个的话是 看一下啊,这个是 呃,一四年的照片。是啊, ok, 那 就分享这里吧,谢谢大家,拜拜。