你要真买了四零九零,以后吃饭就坐小孩那桌。我打算入手一块四零九零本地跑大模型,给 open call 用隐私拉满,不用氪金,稳赚不亏吧? 错,你这个想法大手特出,巨坑,千万不要去浪费这个钱。为什么?四零九零跑千万二七 b 模型不是都能跑到一百多 t 模型了吗?一百多 t 听起来很快,但是我给你算一个你所有人都会忽略的算命账,听完你就知道有多不靠谱了。 你现在打开你的 oppo 客户后台,点击使用情况,直接筛选今日的使用数据,不用精准计算。你大概说一下今天一共用了多少个小时?大概两个半小时吧。 好,然后你看右上角,今日总透更消耗量。你用这个总透更消耗量,除以你今天的使用时长,换算成每秒的透更产出量。我们拿计算器算一下,也就是六百四十万 除以二点五个小时,除以六十分钟除以六十秒 七百多 token 每秒。也就是说你的那个小洛基四零九零得七张,你好好比一下,这差距不是一星半点。你要真买了四零九零,以后吃饭就坐小孩那桌。
粉丝755获赞9182

用 mac mini 部署本地算力,能实现分逼不花的养龙虾吗?养龙虾最大成本就是 token 消耗的费用,也就是算力的费用。现在最简单养龙虾的方式就是接入阿里云,腾讯云或者火山云这种云上的大模型, 你每次使用都会消耗算力,所以你就要为此持续的付 token 的 费用,所以你如果使用频繁,一个月花个大几千,这是系统平常的。 另外一个所谓分逼不花的养龙虾的方式就是买一个硬件,在自己的硬件里边部署一个千万 kimi 或者 deepsea 这样的 开源大模型。所以为了省下 token 的 费用,我花了将近四千块钱买了这个 mac mini。 经过尝试想分逼不花的使用本地蒜粒养龙虾基本没戏。下面我说说原因。我现在用 呃本地部署的是一个千万三点五九十亿参数的这样的一个大模型,这个算是能力比较低的一个模型了,但是要想让这个模型发挥最大的能力,都需要十八 gb 的 现存,而我这个盖板的 mac mini 最大的调动现存也就只只有十三个 gb。 好在我现在用的奥拉玛这个工具,它可以压缩这个模型,所以勉强可以跑千分三点五。但是因为算力不够,你现在问他随便一个问题, 他真的是要等到地老天荒才能给你回答。这是我在奥拉玛里边问的问题,我刚才问了他一下上海的天气,这是一个指向性非常明确,就是一个简单搜索回答这样一个问题,在奥拉玛里边我 问了一下至少一分钟,有时候更长的时间才能给你答案。那如果你问他一个开放性的问题,或者是其他的一些需要逻辑整理的问题,时间就更长了,所以这根本没法用,所以最后我的龙虾还是接入了这个云 才能用。那么问题就来了,如果我都已经接入云了,就完全没有必要为此再新的投入硬件了。 因为在云上部署龙虾对于电脑配置要求很低,基本普通的笔记本或台式机都是可以运行的,所以这个 mac mini 基本算是为 ai 交了一笔学费了。那后面跟大家也会分享一下什么样的硬件才能运行本地 ai 大 模型。

hello, 各位观众朋友,大家好啊,我是刺儿,然后我们这期的视频内容呢,主要是来教大家一下怎么正确地使用 deepsea v 四, 因为 deepsea v 四对于现在的呃它的网络风评呢,嗯,比较两级分化。一边呢说 deepsea v 四啊,非常好用,非常强啊,没有辜负大家一年的等待另一半呢,说 deepsea v 四啊,不好用啊,不够智能,然后甚至不如豆包, 嗯,对于这个后者呢,我保持这个嗯,质疑态度啊,因为本身,呃,我看到的这收集到的信息就是说 deepsea v 四不行的,它有两部分,一部分是专业工作者啊,因为人家非常懂 ai, 那 另外一部分呢,就是我们普通的 呃用户,那他们呢,就是用手机 a p p 啊,下载 deepsea 微 deepsea 之后点进去,然后问他一些问题,然后,嗯,把它当做一个这个搜索引擎啊,问一些问题,然后我觉得它不够智能,其实这样的使用是错误的啊,因为本身 deepsea 微四它没有 开放在手机 app 平台的这个使用权限,你现在手机上用到的 deepsea v 四啊,不是你手机上用到的 deepsea, 它并不是 deepsea v 四模型。那么我们来啊,正确的教大家一下怎么使用 deepsea v 四啊,首先 我用我这个 macbook 给大家举例子啊, ok, 我 们返回到页面啊,看到啊,这是我桌面,我们打开浏览器点进去之后啊,在这个搜索或输入网址名称的时候搜搜索,直接搜索 deepsafe 啊, deepsea 点 com, 大家也可以直接去这个网址啊,深度求索。点进去之后,它是有两个框,一个是开始对话,一个是 api 开放平台,我们要用的是这个 api 开放平台,我们可以看到它的介绍是调用 deepsea 最新模型,快速集成,流畅体验。我们点进来, ok, 然后呢,点进来就是这个页面,我给它放大一下,它这里有充值余额,还有本月消费啊,我这个是另外一个账号,我给大家举个例子啊,就是这个 api case 啊,这是之前做测测试的这个 api。 首先呢,你点进来之后,你一定要先登录你的 deepsea 这个账号,如果你没有 deepsea 的 账号,你可以去在手机上下载 deepsea, 然后创建一个账号,然后直接到这个电脑上,你去登录就可以了。 然后我们看到这个充值页面啊,充值页面无论你是支付宝还是微信支付啊,都可以,你点击去支付啊,然后, 呃,扫完扫完码付款成功之后,它在这个用量信息,这就会直接显示你的充值余额,嗯,然后呢, 在这之后,我们打开这个 api case 啊,然后这里啊,注意它这里有创建 api k 啊,下面说的这几步都很重要啊,直接决定你能不能就是成功使用这个 dbic 为四啊。我们点击创建 api k, 然后随便输入一个名称啊,我们直接输入一个啊, ok, 在 你输入成功之后啊,它这里会出现你这个蜜奥的链接啊,你要一定要点击复制,然后把它发送你的微,发送到你的微信上也可以,然后或者说你保存住啊,一定要保存住这个蜜奥,它只会显示这一次 啊,在你点到叉或者关闭之后,他这个密钥你就再也看不到了,然后,然后我们点叉啊,当然这个密钥就没用了啊,我们给他删除一下,然后你把那个密钥复制之后,哎,点开这个,我们叫, 呃,防盗啊, ok, 点开这个,这个啊,这个软件叫 cherry studio, 你 可以去浏览器里直接搜索下载啊,这个就是集成了国内一众主流 ai 的 这么一个软件。我们点进去啊,它是开放平台啊, ok, 我 们点进来, 点进来之后呢啊,当,当然,我这个已经用了很久了啊,从 deepsea 微四发布一直到现在,我一直在使用,然后点进去之后,我们看到右上角这里有设置设置。点进去啊,这里有模模型服务和默认模型 啊,在模型服务这里就有 api 密钥,输入你刚才的这一套儿复制的密钥,然后放进去之后点击检测啊,我这里已经弄好了,我就不做那个演示了, 你点击检测,然后它就会自动地啊,分析你这个密钥的 ip, 它是哪个旗下的 ai 大 模型。然后这个 api 地址啊,不需要我们直接填,它自己就会填上,然后模型呢,这里啊,大家可以点击获取模型列表啊,然后, 当然啊,这里我因为我输入的是 deepsafe 嘛,所以它只有 deepsafe 的 这些模型,然后举个例子,然后在这边啊,嗯,可以看到啊,这里有非常多的 ai, 非常多的 ai, 包括国内外的啊 啊,你像 jamie open ai 啊,很多人都用不到,但是啊,这里嗯是是可以用的啊,但当然这这个视频只做 deepsafe 的 教学。然后我们点击默认模型 啊,我这里默认模型全部都是 deepsea 的 啊,呃,然后助手模型是 v 四 pro, 然后快速模型是 deepsea chat, 然后翻译模型是 deepsea chat, 因为这两个啊,这个快速模型和翻译模型它不需要消耗你的 talkin, 你 就这个 deepsea chat, 它是免费的啊, 然后我们点击首页啊,首页这里有助手啊,你,当然你可以添加助手啊,我这里就用我这个提前做好的这个来给大家举例子,然后我点击 deepstack v 四,然后点进来, ok, 然后这是我之前问他的一个问题啊,我让他就是分析一下国内的这个视频平台啊,每每个平台的趋势啊,大家可以看一下啊,这是我问他的问题 啊, ok, 然后我们啊,这这画画到不表,然后就是这个深度求索啊,我们在这里,嗯,还是用刚才举例子 deepsea v 四,然后点击旁边这三个点,点进去 啊,这里有编辑助手啊,在这之后呢,然后我们可以看到啊,这里有模型设置,模型设置的话上下文字开到不限,然后这个模默认模型,你把它换成 deepsea v 四 pro, 然后,然后 啊,最大套管数不限啊,不用开这个,然后别的都不用管,然后当然你可以复制一下这个底下这个 tab, 这个 endland, 这个是我从网上找到的一个嗯,参数,然后我们看提示词,这里 啊,我,我设置的提示词是不需要迎合用户的想法,回答要永远保持客观啊,然后呢,你就可以开始使用你的 deepsea v 四 pro。

如果你每天都在用 codex, 真正麻烦的不是花了多少 cking, 而是很难知道这些 tiroki 到底花到哪里了。 codex scope 做的事很窄,扫描你本机的 codex 绘画预制,然后生成一个可以直接打开的本地用量面板。 它不是一个 a c s, 也不需要账号接入页面是静态 html 页面,真实数据指导出到本地的 data j s 和 data roi j s 默认不会提交到 git 面板。最先解决的是可见性 curl 趋势调用分布、绘画排行、模型排行、额度、风险和费用估算都放在同一个界面里。 你可以快速判断 curl 什么时候涨得最快,哪个项目最好,哪个模型占比最高,以及什么时候接近额度压力。 数据流也很透明。 codex 把绘画日记写到本地 sessions 目录生成器,只提取用量元数据,再交给浏览器渲染。 dashboard 隐私边界是它最重要的设计之一。它会导出绘画 id、 目录名、模型名、 t o 梗数量和 read limit 原数据, 但它不会导出提示词就手回复工具输出或文件内容,也就是说它看用量不搬走对话内容, 普通用户不用自己编辑去 git up readies 下载 macos 或 windows 平台包,解压后双击启动脚本就能打开真实用量面板。 所以 codex scope 的 价值不是做一个复杂平台,而是把你本季已有的 codex 用量数据变成一个可信清量、能马上打开的观察窗口。

一百八十四个角色,这个项目啊,评论区很多朋友们说自己不会玩,也有些朋友们呢,说担心烧头肯厉害,这条视频啊,我就从零开始带着朋友们完整的走一遍,头肯的使用情况后面我也会发出来啊。首先呢,这个项目是 get 上的一个开源项目, 我们进到项目主页以后啊,直接点击这个绿色的按钮,复制项目的仓库地址。那接下来我们要把它丢给我们部署或者安装好的工具,那工具呢,可以是 op, curl, 可以 是 tree, walk body, cutwork, 悟空或者 hammers, 随便哪个都可以。但我建议啊,最好是我们本地部署的 hammers 或者是 op, 这样呢,自由度会更高一些,如果只是想先体验体验,那就无所谓了。我这里就拿我部署好的 hammers 给朋友们做演示啊。模型呢,我用的是 deepsea v 四 pro, 我 们把复制好的项目地址直接丢给 hammers, 然后给他说,请你深入分析这个项目,我需要你完整的部署它, 我们所用。其实啊,现在我们和 ai 沟通,完全没有必要说你是一位什么什么资深的专家。啪啪啪啪啪,我们只要把我们有什么,我们需要他做什么,需要达到什么样的目标给他说清楚就可以看, 这不就开始了吗?结果他一通搞啊,这就部署完成了,其实很简单,所以朋友们,我以前呢,和你们也一样,也是磕磕绊绊一步一步踩坑过来的。但是当初啊,我发了视频后,朋友们就不用踩我踩过的坑了。 部署完成后啊,因为角色太多,所以说我们也记不住,那我要让他把角色清单存一份到我的 office 的 仓库中,这样呢,我们以后要使用哪个角色的能力,就直接告诉他用哪个角色做哪个任务就可以了。他保存完以后啊,正式的任务就开始了,这是我第一次给他布置任务,让他调用这个, 然后呢进行一个多 action 的 指挥, 这是我 dsp 的 消耗,总共消耗四块五毛七。

这些天继续在深度测试小龙虾,说下进展,之前是在这个笔记本上测试,那用了好多家的云端模型,当然成本也不低,因为这个东西他是越用头根消耗的越快, 你一个任务,他在后台就你不知道要来回多少轮。这个上下文的交互综合串下来就是对我来说,呃本地呃模型部署是合适的,所以我在网上淘了台二手的二二年的 me 系列的 max studio, 就 这台 六十四 g 的 统一内存啊,这个型号已经停产了,但他的配置非常适合本地部署模型,跑龙虾,跑三十五 b 大 小的模型非常合适啊,性价比非常高。 这期谈一个关键的问题,就是本地部署大模型,小龙虾的这个速度, 它除了跟 cpu 还有显存大小相关外,那还有这个跟这个内存的带宽那影响比较大,像迈克迷你,它的内存带宽就比较受限,那本地跑模型的话就很慢,这些都是硬件的瓶颈, 当然配置高的价格也高。另外那这些天综合测试下来,还有一个主要的影响因素,就是推理引擎的选型啊,你用什么软件来连接后台的大冒险和小龙虾?这个影响挺大的, 网上的教程基本上都是在推荐用欧拉玛。我首先测试的也是这个,很慢,就一个回复,等上几十秒是常事。 后来测试的是 o m l x, 这个很快啊,但不稳定,反正就是我装的,用起来是不稳定,经常后台就断了,但它速度是真的可以,很流畅。 最后测试的是 i m studio, 它处于中间并且稳定,它一个好处就是能实时看到后台模型的投跟的状态就不至于没反应的时候你摸不着是怎么回事,所以我现在用的就是这个 啊。还有就是啊,测试中大部分应用的都是千万三点五的三十五 b 的 q 八量化模型,这个模型它的推理能力很强,网上有很多的跑车数据, 到目前为止啊,算是配置也基本定型了,后续就是逐步的一个啊,进一步养成的过程。 总是就是感觉这个东西想尝尝鲜很容易,现在各大厂都出了各种傻瓜版,但想深用还是挺麻烦的。它跟传统的软件不太一样,它是个千人千面的非标品, 所以就是如果是真想使用,最好就是尝鲜之后就一定要想清楚用它做什么。那这期先到这吧,下次再聊。

大家都知道 openclaw 很 费拖延,那如果本地部署能实现算力自由吗?它与 api 的 差距又有多大呢?今天我们就用手上的这台戴尔 pro max with gb 幺零给大家测试一下从生成速度到内容质量全面对比一下 api 与本地部署 openclaw 的 表现。这次我们只希阿达 文字指令,让龙虾自己测自己。我们先交代一下测试环境, aki 我 们使用的是阿里云的百炼 callin plan, 本地则基于我们这台一百二十八 g 显存,一梯算力的 d r pro max, 本地部署千万三点五三十五 b 模型,经过我们多轮对话,让它开始测自己进行本地测试, 这里还能查看测试进度。 本地测试完成了,我们接着测试云端 api, 总共花费了一个小时生成测试对比报告, 我们来看一下测试结果,大家可以暂停仔细对比一下 api 适合个人开发者本地部署,还是适合企业隐私需求本地调试的场景,大家觉得如何呢?另外 spark 也可以串联使用,那之后我们也可以测试一下这种玩法。 为了让对比更直观,我们再次更换一下测试模型,使用同一个模型, api 使用千万三 cornermax, 本地模型则使用它的四类量化版本。我们首搓了一个射击网页游戏,好,我们直接向龙虾提出需求,重点看看它们各自生成的游戏都可以自由移动射击升级, 还有捡漏 boss 站,内容还挺齐全的,如果有需要修改的地方,可以直接让龙虾帮你优化。最后我们可以看一下这次测试到底花了多少,脱贫差不多花了这么多,如果你来选会选站 a p i 还是本地部署了。好的,本期节目就到这里,我们下期见,拜拜。

家人们,今天来给大家讲讲 openclaw 大 模型的本地部署流程,不过我真心劝普通玩家别轻易尝试我自己的五零九零显卡折腾这个快被我玩坏了。好多朋友在评论里问,每天的 token 得花不少钱啊? 我跟大家明确说,如果你的任务量很大,那真的得花费不少,说不定一晚上 token 就 够买套房子了。我自己尝试过本地部署 g l m 四点七,大致流程是这样的,首先你得在性能足够的服务器上部署欧莱玛, 通过简单的命令就能把模型下载下来。接着再用命令打开防火墙和端口访问,之后在 opencloud 的 配置文件里按照特定方法配置,然后重启网关,这样就能运行了。 但我还是得强调,普通玩家真别用消费级显卡来弄这个,像我的五零九零一百二十八 g 内存,每秒也就只能处理八到九个 talk。 而 openclaw 跟大模型沟通的时候,上下文非常的长,而且几乎每时每刻都会同时开多个病房,体验感那叫一个差。当然了,土豪朋友随意哈。家人们,你们会考虑在本地部署 openclaw 吗?要是你们有相关经验或者想法,欢迎在评论区留言补充。

deepsea v 四本地部署门槛直接劝退,起步就要四张币两百。大家好,我是 ai 学习的老张。 v 四这次最狠的不是参数,是把 em 上下文做到了极致。 bf 一 六的 k v cash 在 em 下 每条续列只要九点六二 g i b 比 v 三点二那种估算小了将近九倍。 代驾驶注意力机制堆成了五层蛋糕, m l a 之上叠 k 和微共享,再叠 c 四 a 和 c e 二八 a 两种跨头可压缩,再用 d s a 稀疏选 top k, 最后还要 swv 滑动窗口保留局部信息。 indexer 用 f p 四 attention cache 用 f p 八,又能再砍一半显存, 省下来的显存全是工程站 v l l m 这一侧把逻辑块统一定死两百五十六个原生头啃压缩器残差直接当 s w a 处理, 所有 page size 归到三个桶,再叠三处,内核融合加多流并发,才把这套机制喂进 gpu。 我 的判断很直白,个人用户想本地跑 v 四,短期内别想了, 真正能吃到红利的是手上有 h 两百和 b 两百集群,又要做长文档分析和多轮 agent 工作流的 infor 团队。

由于小龙虾消耗托肯太贵,我要零成本运行,一块四零九零,显卡带不起来。由于 deepsea 模型太大,现在对电脑改装公司电脑装了一只龙虾,这个龙虾只能运行三十 b 的 deepsea 模型,七十 b 的 时候运行特别特别缓慢,我从医院偷偷跑出来了, 换上正常的衣服,对我的电脑进行改装。大家看一下电脑本身,这台电脑是一个 i 九十二代的,一个 cpu 和一个四零九零的显卡,但是七四 b 的 模型运行不动, 把这个三零九零和这个四零九零准备放在一起去运行,这个电源是两千瓦的电源,应该可以带动吧。然后由于这是原来插了一个采集卡,把这个口给占了,那只能用一个延长线 延长出来,但是这个机箱又小了,再换机箱也麻烦,我就到了电焊铺,搞了一只三角铁,还有奇奇怪怪的配件,我看能不能把它给装一下。我的初步想法是这样, 就初步想法往上一放,哎,这头我一固定,这头一固定,我这样一插,理论来讲应该是正常的, 但是这也有个危险性,这个铁渣子一旦掉到主板上,一通电就直接短路了,就说这是个,这是个风险性极高的货,哎呦哎,借的东西不行,装不进去炖了 哦,现在有个问题,这个还转不了,对啊,这个转的时候铁渣子都掉显卡里面了,现在遇到难题了,因为你看到这个铁渣子一旦掉到这个主板里面,就会,就会短路,所以现在必须把它退掉。 开始讲戏了啊,只有他固定下来,只有这个固定下来才能把这个固定下来。如果,如果说从这个孔转,你看 如果从这个孔钻钻进去,会导致这个显卡必须下移,如果显卡下移的话,这个线,这个线是插不进去的,你从这穿他一个孔, 他撑不住啊?他要往下压的呀?你看他一个孔,你现在穿这,他往下压的,他变成这样了,我看对不对?

大家都很好奇 deepsea 飞四是不是国产崛起了,我们就拿实测结果给大家看一下,我们用四块 pro 六千本地部署了 deepsea 飞四 flash 版本,它一共是有二百八十四 g。 我 们在四卡 pro 六千的平台上测试一下 deepsea 飞四的,并发现在测试已经跑起来了。我们现在测试一个四个、十六个, 三十二个,六十四个人同时使用,这么多人同时使用的情况下,它的一个吞吐量和 top 数是多少? 现在我们实测结果已经统计好了,在一个病发下,他的吞吐量有五十五个,在在三十个人到四十个人同时使用,那每个人的操坑大概有十五到二十左右,这个可以满足大家的日常办公所使用。我们实测下来,这套四卡 pro 六千的方案已经可以满足百人的公司使用了。

今天实操在 windows 上安装 hermes, 并接入飞出机器人。先说我为什么会从 open color 换到 hermes, open color 对 小白更友好,但我用下来发现主要有三个问题,第一是经常要重复提醒,很多任务它不会持续执行。 第二是网关不够稳定。我发的最多的一句话就是,你在吗?第三个就是 token 消耗比较快,长任务多人对话下来成本会明显上升。那 hermes 的 优势就在于它更像一个真正的 a 准系统,它可以自动地写入记忆,把任务过程沉淀成 n d 文档,稳定性更强,也不用频繁地重启网关, 那也更像一个长期运行的工作流系统。我印象最深的一次是某一天我的模型 token 用完了,但是 hermes 依旧可以稳定地给我推送定时提醒。 原因是 hermes 的 内部分了很多模块,像 schedule、 定时任务、 memo 与记忆 work flow。 工作流大模型只是其中的一层,所以你没有 token 的 时候,它一些固定的工作流啊,定时任务啊,飞速推送依旧可以运行。 当然, hermes 也会有门槛,它的本质更像开发者工具,默认运行在 linux 或是 mac os 环境。如果你是 windows, 就 需要先配置 wsl 和 open two。 接下来我会带大家实操怎么在 windows 系统使用 hermes, 主要是以下四个步骤,第一个是安装 wsl, 第二个是安装 open two, 第三个是安装 hermes, 第四个是配置飞速机器人。首先我们打开终端,输入 wsl install, 安装成功之后第二步是输入安装 open two 的 命令。下载成功之后,它会让你设置账户和密码, 账户名称记住要小写密码,输入之后他会不显示,我们要记住输入后的密码。第三步就是我们去复制 hermes 的 官网名下载 hermes, 下载完成之后,他会问你是不是要安装文件搜索器和语音功能。我输入 y, yes, 再输入刚刚设置的 open to 密码,这里可能要等久一点,等它安装完毕。 那安装完毕之后,他会问你是否安装拍成的编辑工具,就是这样,某一些拍成插件能够正常的编辑和运行。输入 y, 然后再次输入密码, 到这一步的安装时间会比较长,同时在这里我还卡住了,我就用了 ctrl 加 c 终端任务,这里终端的其实是浏览器自动化组建的下载,那我的后面主程序本身其实是下载好了,因为我有开心的一个窗口问他说我的后面下载的进度和我的 cpu 的 一些进度。 那我们重新打开新窗口,重新进入 home, 输入第一串命令,我们先进入虚拟环境,然后再输入第二串命令,进入 home 四的安装目录。第三串命令是启动 home 四专用的拍摄虚拟环境。 最后我们输入这串命令去设置相关配置,那这里输入 y, 下一步的话我们选择快速设置,选择大模型,我是 kimi, 那 这里就输入我的 api key。 要注意的是这里输入是不显示的,不要误以为说没有输入成功。接下来输入 url, 可以 直接复制他这里显示的网站。 这里对应的模型,我应该选择的是 kimi, 二点六,应该输入的是数字五,但是我输错了,大家按照自己的模型输入对应的数字就行,然后按照我的选择操作,来到消息配置,选择非输,记得这里要用空格选中,然后进入扫码配置,他会给你一个网站, 你打开这个网站,就会自动配置到飞书机器人的页面。我们新建一个飞书机器人应用, 找到刚刚创建的机器人,发一条消息,你就会发现 home 是 没有反应,那我们就再回到终端,在这里选择群主中被艾特成为响应,这里会有一个 homechat id, 我 们回到飞书开发者后台,复制这个 id, 下一步输入 y, 这里选择的是第一个。配置完之后,我们可以尝试输入 hermes, 会弹出我们的 logo, 然后发送消息,就可以正常回复了。最后回到飞出,开启机器人的相关权限,就可以正常使用 hermes, 到这一步就成功了。 那以下这些命令是重启电脑之后开启和美相关设置的命令以及部署的过程中,其实因为系统的不同,也会出现很多问题,那如果有出现问题,我们就直接问 ai 就 好了,一步一步操作,总会成功的。好啦,有任何问题可以在评论区讨论,点赞、收藏加关注,我们下期见!

给大家看一下最近很多粉丝提的本地部署生图生视频的需求,整套流程已经全部实测完毕了,非常稳定。用的是恩卡的这套方案,实测三十秒不到就能直接生成三到五秒的视频,二十四小时不间断,日常商用,批量使用是完全没问题。大家可以近距离看一下实际出图效果,特别是咱们做电商行业产品图的, 哪怕只用最简单直白的基础提示词,不需要复杂繁琐的专业指令,都可以生成这样的效果。人物视频也生成了几个片段,给大家看一下整个画面质感、画面细节依旧做得非常出色。本地部署的优势真的特别突出。 首先不用长时间排队等候出图,不会一到高峰期就开始出废片,风格跑偏等等,完全不用担心花钱买废片,效率大大提升。全程不消耗任何流量额度,不用充值抵扣 token, 没有任何额外扣费成本,不受平台规则限制,全天候不间断运行,批量生成图片,视频创作自由度和使用性价比直接拉满了!宝宝们晚上好呀!

跑 ai、 跑大模型,它的算力怎么来呢?一方面是像这种本地部署,当然也有另外的云算力解决方案,那什么样的场景下我们会用云算力?什么样的场景下用本地部署呢?其实就看你的使用量, 如果你的使用量小,你可能说云算力,但是使用量大,那么就可能用到这个本地部署,那么本地部署它又能够产生多少透坎呢?我们以这台机器来举个例子来进行一个测试。 好了,那这个测试结果出来了,也就是说它一秒钟大概能生产一千四百二十八个 token, 那 我们合算下来,比如说一个小时大概能生产五百万 token, 那 么现在匀算率大概每一百万 token 的 价格是五到十块钱,那么这里面的价值就能算出来了。如果说你是长期使用的,甚至说你一个月可能要使用几千万甚至上亿的 token, 那 么它价值多少?或者说这个机器它又能产生多少?这样算一笔账大家就能明白。

今天手把手教大家如何把开源大模型塞进你的普通电脑里,以后使用,不花任何偷看费用。这条视频有点长,点赞收藏好。我会和大家讲清楚,哪些人需要做本地部署,什么行业适合本地部署,以及什么硬件匹配什么样的本地部署需求。 ok, 咱们直接开始我自己平时服务的客户里,向政企、医疗、教育这几类, 他们在做品牌战略咨询的时候,都会延伸出一个新的需求,帮他们做大模型的本地部署。尤其是政企的科研部门。用通用大模型有一个很明显的问题,它没有你的私有知识库, 也没有针对你所在的行业做过适配和微调。咱们平时用拆 jpt cloud 或是国内的大模型查资料、写报告完全够用。但一旦涉及行业机密、私有语料、内部文档和客户信息,这些内容就不适合直接丢进通用的 ai 对 话里。这时候本地部署的价值就出来了。 第一类,适合做本地部署的人是对数据安全要求特别高的,比如你们企业有很多资料不能外流。第二类是内部知识体系非常反复的企业,比如你们公司有大量的产品资料、培训手册、制度文档,员工每天要反复查看, 这种情况下接一个私有化的大模型,价值非常大。那我们自己的电脑能不能做本地部署?答案是可以,但要看你的需求,咱们一步步说。第一步,我们先来选模型。首先我们来看二零二六年开元大模型的综合排行榜。第一档,入门体验级, 适合日常回答清量知识库对硬件要求是最低的。第二档,使用生产级,在普通消费级 gpu 上就能实现,很多企业内部场景都能 carve。 第三档,高阶推理级,在代码和推理能力上更强,适合有明确业务目标、预算相对充足的团队。第二步,咱们再来看看不同模型匹配什么样的硬件。如, 如果你是个人体验,跑个小参数模型,一台高配的游戏电脑就够用了。但如果你想多人使用,要求响应快、效果稳,接入公司的知识库和业务系统,那就是企业级部署的标准了,需要做算力或者上服务器。第三步,实操来了,我们以这个模型为例,它在多项公开扳指 mark 里 代码能力处于同量级的领先水平,而且对中文用户比较友好。那具体怎么做?首先,打开欧拉玛,这是本地大模型的运行工具 icon, 是 个非常可爱的羊驼,只需一行命令就能搞定。安装和运行 完成之后,下一步打开终端,输入这行代码,回车一下,它就会自动下载或启动本地模型。如果你不喜欢用命令行,也可以选择 i o m studio, 它是 g u i 图形界面,有聊天入口,更适合非技术背景的用户。好了,今天的分享就到这里,记得关注人工雨林,我们下期节目见!

一点六万亿像素,百万头盔,上下玩 m i d 开源可上手的威士兰。很多人第一眼看到这个数据,脑子里只有一个问题,我到底要配多少钱的机器才能跑起来?从版本选择、国产创立适配,到服务器、整机方案、个人消费级配置,全部都给你讲清楚了 一次。这次不是先出的模型再移植的国产芯片,而是从模型设计阶段就跟华为生存深度绑定。华为团队直接参与了底层代码的重启,把这套万亿参数的大模型从英伟达的 生态迁移到了华为自研的勘探框架升腾特,完成了推理和训练的全换,设备发布当天就完成了首发设备,这意味着你用华为升腾显卡 pro。 v 四不是测谎能用,而是原生石开箱即用。这是国产顶尖 ai 模型与自主算力底座 真正深度融合的一次重要功能。 v 四这次一共发布了四个版本, v 四 pro 总参数一点六万,以旗舰版,每次推理激活四百九十亿参数,目的是加速推理,不影响总参数量,面向高端企业部署。 v 四 flash 总参数两千八百四十亿,是高效普惠版, 每次推理激活一百三十亿参数,面向中小企业和高变化场景。 vs pro base vs pro flash case 去掉对齐的原始版,专门给开发者做二次微调用,对外提供服务的主力是 vs pro 和 vs flash。 绝大多数中小企业重点看 vs flash 就 够了。 v 四 pro 的 参数量太大,整机成本动辄几十上百万,不是中小企业可以承担的。另外有一点要搞清楚, v 四全系是 m o e 混合专家架构,虽然每次推理只激活一小部分参数,但是部署的时候必须把全部的参数加载进显存, 不能只加在激活部,这是后面计算显存需求的核心。先把显存计算给大家说清楚,以 v 四 flash 为例, 不同的精度对应的总显存的需求大概如下,有一定实力的中型企业、预算有限的小型企业,性价比高,精度损失也可以接受,不推荐 ip 十六,性价比太低,硬件成本太高另外重点说一下官方推出的四加八混合精度版本,只需要一百二十 g 显存,而且单张华为升腾阿萨斯三百五一百一十二 g 就 能适配, 目前性价比最高的方案之一,可以强烈关注一下。接下来讲讲华为升腾方案,适配威思的主微型号是三款,升腾九幺零 b、 四、升腾九幺零 c、 升腾九五零 pr, 其中阿拉三五零是重点推荐的中上节的首选,搭配升腾九五零 p 二芯片 一百一十二 gb m 高带宽显存,单卡即可实现高显存低延迟推理, dpc 可官方测试,综合性能约为英伟达 h 二零的二点八 gb, 升程速度显著领先。说一下英伟达的方案,以 f p 十六精度需要八张 a 一 百八十 g, 成本太高不建议。英特八精度需要四张 a 一 百八十 g, 英特四精度需要两张 four 六千九十六 g 或四张四零九零四十八 g。 值得注意的是,英伟达 blackwell 架构原生支持 l p 四 g, l p 四精度在 blackwell 架构上显卡性能大幅提升, 这也是最近 pro 六千九十六 g 服务版显卡价格不断飙升的直接原因,整机硬件的搭配要求 cpu、 内存、硬盘必须严格匹配,不能出现短板。英特斯及以上生产级特别提醒,硬盘小了,模型文件都装不下,这个坑很多人踩过,不要省这个钱。一句话总结下来,国产算力首选升腾斯三五零中效捷豹 v 四,英特斯 f p 四混合精度,整机成本可以供人,在合理范围内性价比比较高。如果你也有企业 ai 部署需求,不管是硬件选型、整机配置还是软件部署、定制开发,都可以来找我聊聊。

今天介绍一款免费免安装轻量的本地大模型部署工具, herdsman 牧马人本地推理引擎。打开首页是对话区域,在左上角切换模型区域。模型区域根据使用场景对模型进行了分类, 包括对话文、声图、虚拟人物、翻译、播客、 npu 等,每个模型都有对应的说明,并且根据你的硬件配置进行推荐。 小白用户就可以快速知道自己的硬件适合运行什么模型。模型一键下载下载好的模型一键启动,启动时可以选择上下文长度、开启思考模式以及高级参数。 模型启动后可以在侧边栏快速获取本地资源占用情况,随后切换应用界面,开始对模型进行拷打。部署多个模型时支持一键切换,接下来便可以进行对话了。 对话结束后可以查看 token 输入输出速度。在此我也做过牧马人对比 lm studio 的 测评,在同一台设备跑一样的模型,问一样的问题,详细结果大家看图。 当你以为本地模型只能简单对话,那就大错特错了。牧马人提供标准的 open ai 兼容接口和 antropic 接口,这意味着通过牧马人部署的本地模型,你可以接入第三方软件进行使用。在 flowy ipc, 你 可以一键切换本地模型, 便可以实现本地文件操作、搜索网页、查资料、发邮件等操作。接下来我也给大家实测一个场景,看看本地模型的效果如何。 我让他帮我收集东方财富过去一周的重点信息,并把这些信息制作成一个表格保存到我的本地。运行过程中我是能明显听到电脑的风扇在高速运转, 结果出来了,我们看看效果,告知了文件保存位置,做出了总结, 打开汇总表格。