大家好,上一次我们通过这个 mimo 对 一个视频脚本的这个音频进行了生成,那么今天我们把整个演示视频吧,加上这个 呃后期的一些制作好,看看它的剪辑的一些效果如何。呃,由于这个 mimo 它最多只能上传 二十兆以内的一个视频文档,所以我把原先的这个视频讲解拆成了两个呃,视频。那么我们先把第一个视频输入啊,然后要求他对这个视频进行 一些后期的处理,比如像转场呀,拼接呀,字幕啊,配音啊等等啊,那他其实很快的,很快渗出完了这样一个剪辑弯的视频,然后呢,我们继续,对吧?进行第二个 剪辑的,这个剪辑视频的一些后期处理啊的后面也生成很快,那最后就是要求他把这两个视频进行一个合并, 最后合并完的效果给大家也看一下,呈现一下,我已经下载下来了啊,然后我们来看一下整个的效果。 大家好,今天来看一下个小米的咩木,我写,嗯,它字幕已经配上去了,但是部分的英文它像这个咩木虫,它没有识别出来啊。 tds 哥,绞破本视频吧。然后第二段视频脚本的这个文档全部丢给他,他其实也已经,请问这里是孤事电弹所吗?他其实也已经拼接好了,对吧?江远的吧, 整体效果还是不错的啊,就是说在剪辑上他把字幕转场包括配音其实都已经完成了啊,整体的完整性还是可以的。
粉丝88获赞1395

虽然 open club 大 火,但是它的本地部署实在是太难了,今天感受一下小米咪魔 club, 它是云端部署的小龙虾,看一下它能够为我们做到什么样一个效果。我刚刚点击的立即创建就获得了这个龙虾助手。 雷总还是很大方的,每次进入都有一小时的免费体验时间。先简单的让他汇总一下新闻资讯, 可以看到他已经自动在调用工具去执行我这个命令了,会将不同的资讯做好。领域的划分,目前看起来还是非常清晰简洁的, 这些对于 ai 来说已经见怪不怪了,我们看一下小龙虾助理能为我们做些其他什么事情。 目前从他的描述来看,他能做的还是挺全面的,如果我想做一个自己的网站,但是又不想动手的时候,就可以把这个任务交给小龙虾。 大概三分钟左右,他就给我交作业啦,我只告诉了他一个行业,并没有给他提网站的具体要求,他就按照自己的理解给我做了这样一个规划,并且把写好的代码打包保存成一个文件, 找到对应名称的文件夹,我们就可以在里面直接预览这个网站做的好不好看。粉丝朋友们可以在评论区留言, 瑕疵肯定是会有的,但这毕竟是机器人在三分钟之内就写出来的网站, 在效率这一块他真是没的说。接下来让他做一个简单的小游戏,看他能做成什么样的效果。当他写完之后,我们依旧在文件夹里面去找到这个名称的文件。 贪吃蛇作为一个非常经典的游戏,他把基本功能都写出来了,但是没有游戏结束的判定,这也是他的一个漏洞。接下来再给他安排一个设计的工作, 我给的内容是非常模糊的,但是他会根据我的主题去拓展,去延伸。 作为 ai 来说,他的图做的算不错了,因为他在这么多文字里面没有乱码的出现,只能说这个风格。

朋友们,这是我现在用的电脑,四零九零四十八 g, 二百五十六 g 的 内存,现成撕裂者,我用它构注了一套智能中书。但是呢,我今天要教你们怎么样用一个很低的配置来构注一套同样的系统。可怜的只有三百 g 的 硬盘, 三十二 g 的 内存,一台英特尔 i 五的 cpu, 配上这张四零六零太十六 g 的 显卡,我今天开始教大家如何在这套比较垃圾老的配置上部署一整套 ai 智能中书。 这是一个艺人公司超级个体如何最大化利用 ai 杠杆的视频。在上期我介绍了我自己的 ai 超级智能中书,以及我怎么样用各种模型的组合来解决复杂的问题。而今天开始,我要教大家 如何用一个入门级的显卡,哪怕你只有八 g 的 显存,你也能完成这一整套的配。刚才都看到了,我这台机器配置比较垃圾, i 五八四零零三十二 g 的 ddr 四内存,然后一共两块盘,二五六的系统盘,三百 g 的 数据盘。这一套配置大概就是三千出头的样子。 你需要准备这样的一块 u 盘,把它格式化成 wintoy 的 系统,然后配置上非牛 o s 的 镜像。 如果你不知道 wintoy 和 finn o s 到底是什么,那我建议大家去搜索一下,教程特别多,而且特别简单。我之前视频也告诉过大家,如果你要想利用好 ai, 你 就一定要从构注一个 linux 系统开始。 但实际上所有的 nas 都是 linux 系统,所以我就选择了 finn o s 这个系统,它是一个基于 devin 十二的 linux 系统。好了,现在这个界面已经开始安装了,五分钟后就能完成,它会提供一个网页的配置, 开箱即用,最简单最好装的 linux。 当然这个你是需要作为服务器的,你还是需要另外一台,无论是 mac 也好, windows 也好,需要做终端来使用这些服务。 那么今天这一期呢,是构注 ai 中书的第一部分,我们将完成 fanui os 的 安装和配置, opencloud 的 一键安装,当然我们还得装一个 cloud 的 扣子。我发现好多朋友到现在还没有装好它, 那么这次我就直接给你喂饭了,而且我们还要配置一个谷歌刚刚发布的 jam 四的本地多模态模型。最后啊,我要给小龙虾配置一个基于本地的搜索引擎,这样你的小龙虾的功能就起火了, 你们就知道四零六零态真正的实力了,这是一个含金量很高的教程啊,而且绝对是被饭级的,希望大家能看。本期所有的内容都在我的 github 里边,你们只需要按照提示一步一步地复制粘贴,就可以完整地复刻。 完成了这些配置,你们绝对就是一个龙虾达人,而且绝对跑赢百分之九十九的人,所以拜托耐心看完这个视频, ok, 非牛 o s 已经装好,让我们开始今天的教程好了,用了五分钟不到,把它装好了,现在开始配置啊, 比如说我这个就叫 open 可乐,密码就随便自行选择吧,好保存,先创建一个存储空间,用这个我就用这块盘创建 a c k 就 行了啊。好了,这是完成了,第一步,创建了存储空间,然后我们赶快把 docker 配置好, 我们放在存储空间一好了, docker 服务已经启动了,这是第二步。第三步,我们要把我们的用户把它 s s h 打开啊,它默认是开着的。太好了,在这个位置啊,系统设置 s s a, 把这个打开。好, 我们现在试一下啊,打开一个终端,幺五二,好像对, ok, 好 的,好,我们现在到应用中心,你看它现在有一个 openclaw 就 直接安装了,我也装在存储空间一,它会自动装 notegs。 我 们现在配这个模型啊, kimi 吧,验证信息保存。 哦,好,我现在去 openclaw 点 s h 的 模板, 你在这把你的 token 和 base ui 模型一填,你就可以直接用它来启动 cloud。 如果你经常看我视频,我就是这样用的,然后这是一个一键脚本,但是我决定还是手动给你们过一遍。怎么安装。我们看一下这个 readme 啊,就按这个一步一步来, 非牛一般不会给你创建目录。我习惯是有一个 home 的, 所以我们就这么执行一下,看一下,看一下,对不对?这是这,这个是验证的啊, 看这这个就就已经可以了。好,我们接着来。这肯定没有装这个驱动的,所以不用过了,我们来执行这个这条命令,这是一些编辑驱动时候的一些前置的东西。好了,这是我应该刚才装过了, 接下来我们就装这个驱动,直接把这一段,不是,这是英伟达的库达,然后这个是驱动,这两个是特别关键的,这两个如果装装不成就不行,我们用这个来装吧,他要下载一个这个包,这个包挺大的,三三四个 g。 好 了,库达装完了,我们现在装驱动 这一步,你已经领先了一半的人,很多人基本到这一步就放弃了。 two thousand years later, 好 了,现在驱动应该是已经装好了, 我们现在把这个复制一下,这个就是你每次登录上来的时候,他需要有一个酷大 home, 然后配置这个东西。好了,现在应该有了吧,看,现在我们识别到了四零六零 t, 对 吧?十六 g, 对, 我们还需要把这个 bios profile 搞一下, 现在走到这里超过百分之九十的人了,我们继续安装啊。 uv, 这是个 python 包的管理工具,我们就直接装就行了。 下一个是这个 cloud code, 这个很重要啊,这个就是很多朋友在配置 cloud code 的 时候,想配置国产模拟,但是发现它需要登录,是因为你少了这个文件里的这个配置。 好了,现在是安装 cloud code, ok, 装好了,看一下这个文件,看这个有他有的就没有问题啊。 接下来要装的这个东西,我认为是整个本地 ai 生态最为低估的一个工具,它叫 harbor, 一 句话概括就是一条命令拉起整个 ai 的 技术站。什么意思呢?你跑本地某,你得装推理引擎,你得装搜索引擎,你得装聊天键。面对不对 这些东西之间的配置和互联,真正折腾过的人就知道特别的痛苦。但是呢, harbor 帮你把这些全部都打包好了, 九十多个 a b i 服务,你只需要一条 hibble 这个命令就能全部都部署好。而且最厉害的是它给你全配置好了,这些全部都是互联的。比如说你配置了一个搜索引擎,这时候你打开一个聊天界面,它用的就是这个搜索引擎, 或者说你配置了一个新模型,打开聊天界面用的就是这个新模,它不需要你手动改配置,不需要你修改网络,不需要你懂 docker, mini, 不 需要你懂 linux, harbor app 一 句话就完事了,更重要的是你可以用小龙虾来命令它帮你部署。所以后面我的教程还会利用 harbor 来讲一些场景。 这个 harbor 神器啊,朋友们先直接装,把它先装好,它有个 doctor mini, 它可以自检, 然后我们现在看一下,他自检就是告诉我们你哪些没做,看,我们现在还有这一步没做。还有这个刀克,刀克现在需要用这个,需要把用户加到这个刀克组里。 ok, dock 我 们复制好了,这一箱已经过了。然后就是 nvidia 的 这个 container 二 kit, 这个我们在飞牛上装,给大家说一下,这是容器,它要使用 gpu, 它必须要用这个东西。嗯,好了,是吧? 好了,我们现在再 doctor 一下。好,这个不用管这个,如果你是一个 amd 的 gpu, 你 需要管,我们现在目前是四零六零菜,这个就叉,无所谓。好,我们这步做完了, 我们看一下这个,测试一下这个吧,对吧?哎,看这个,这个出来就说明容器里执行这个命令也能成功,那就说明可以用 gpu 了, 咱们继续部署本地模型。哎,这个就厉害了,看阿伯肯瑞克告诉大家这个是干什么的,这个就是我让他下载一个摩搭上的一个的 e 四 b, 这是个八 b 模型,就是四 b 激活。 好像是是八 b 模型吧,反正这个模型四零六零泰坦跑的不错,然后他用的是 q 四 km 的, 然后同时让它启动一个拉玛 c p p 的 容器,我们来看一下啊,见证奇迹了,它要先拉一些它需要的一些容器镜像,看它现在把欧拉玛,拉玛点 c p p 还有 open web ui 全部拉下来了。 所以这一步走完之后,你就拥有了一个本地 ai 了,用四零六零泰跑起来速度也不慢。我们在执行哈堡 up 拉玛点 c p 的 时候,出了一个这个问题, 这个可能是因为他下载没有下载成功,我们再试一下啊,哎,看这就好了。嗯,我们复制一下这个,这个地址我们要改成本级地址,应该是幺五二,对吧?看,拉玛点 c p p, 这是他已经配置好的模型,他现在占了五点七个 g 的 现存, 试一下,跟他讲个故事,你看这速度可以吧,七十 t 作为一个十六 g 的 四零六零太,我觉得这个就已经很好了。然后大家记住啊,这是他的拉马点 cpb 的 端口, 三三八三幺,就是它这个 harvard。 呃,是 library 点 c p p 的 地址,在这个 script 目录里,就我刚才说的 cloud 点 s h 点 template 的 模板 啊,你用 mv 把它移动到后目录下,并且改成你们喜欢的名字。接下来大家就只需要把刚刚的拉玛点 c p p 的 地址端口和模型名复制进去,随便给一个 key, 然后把 cloud 点 s h 改一下可执行权限,就可以通过这个脚本来启动 cloud code 了。 看见没有,这个模型已经超过了百分之九十九的人。 你现在不仅在一个非牛 nars 上装好了英伟达的驱动,部署了本地模型,你现在还把 cloud code 配好了,我们现在在本地配置了一个 cloud code 的 一个启动的命令,然后还有一个呃拉玛典 c p p 让你可以直接去使用。 我们现在要去搞一下 openclaw 这个三三八三幺,教大家怎么去搞这个 openclaw。 我 把这个模型名复制一下,看 openclaw 打开添加模型服务,这里拉到最下的自定义 open a 兼容 拉玛 c p p 吧,好不好?我们定一个八三幺是吧?然后模型名称我们添加一下,保存一下,它就自动去刷新了。 我们把 openclaw 刷新一下,就看到小龙虾有了刚刚配置的模型,到此为止,我们的小龙虾就完全可以通过本地模型来驱动了, 大家可以用本地模型来摸索小龙虾的功能,完全不需要担心偷根,消耗速度也不慢。但是需要注意的是,这个本地模型智商比较低,要是让它做编码任务的话,我觉得还是不太现实的。 好了,接下来我们需要给小龙虾配置一个本地的搜索引擎,这里我用了 sirx n g, 它是一个圆搜索引擎,可以集成多个搜索, 我们用 harbor up sirx n g 就 可以一键部署,并且它会自动配置好一些默认的搜索引擎,装好之后,你把它地址告诉 open claw, open claw 就 具备了本地的搜索功能了。 好了,到这里我们就完成了今天所有的任务,我们今天做的就是构建 ai 中书的地基和架子。有了英伟达的驱动啊,后面的事都会变得非常简单。在后续的视频里,我会以具体的场景来入手,告诉大家到底应该用什么样的模型来组合,到底能解决什么样的问题, 保证你们今天搭这套环境没有白搭。所以如果大家感兴趣,拜托把你们折腾好的截图发到评论区,也给其他没有折腾好的朋友给一点信心。好了,以上就是本期全部的内容了,我们下期见。

mini max h 三现在已经正式开源,本期视频将免费分享 mini max h 三模型以及对应的工作流,同时会详细讲解三大工作流的核心参数和实际使用方法。为了方便大家快速体验, h 三工作流也已经在云端部署, 不想配置本地环境的小伙伴也可以直接在线运行体验。另外针对想要深入学习 kufui 本地部署的同学, h 三整合包也已经上传到小黄瓜的 kufui 星球, 一键安装直接运行,包含完整环境配置以及插件模型等。本期视频主要分为三部分,第一部分,云端工作流效果展示,快速体验 mini max h 三的视频生成效果。第二部分,三大工作流详细解析,包含文声视频工作流,图声视频工作流, 参考生视频工作流,详细讲解每个节点作用关键参数设置以及实际使用流程。第三部分,本地部署教程以及模型下载方式,帮助大家在自己的设备上完成 mini max h 三的安装和运行。 那么接下来我们直接开始体验 mini max h 三的强大视频生成能力。哈喽,大家好, mini max h 三呢已经开源了,现在我们就先来看一下在云端这个工作流运行的一个效果哈,那么这个呢,是纹身视频的一个结果,使用的是 comu 官方的一个案例,我们来看一下。 好的,那么这个视频呢,一共十五秒,后面的几秒呢?基本上是差不多的哈,在这个案例里面, 大家可以看到视频的动效是非常足的,而且文字呢没有毁坏,并且音频呢也是直接生成的,这个音效的效果也是非常好哈,我们可以再听一下。 那么同时我在自己电脑上也跑了几个案例,我们可以来看一下。 这个案例呢,一共七秒钟啊,动态效果非常的足,但是视频的画面稍微有点模糊,但这个模糊呢,是因为我们使用的分辨率比较低啊,假如说本地我们能跑二 k 的 分辨率,那么质量可能会更高,但是对我们电脑的硬件要求会更高,生成时间呢也会偏久。 现在我这里正在本地跑的一个是两百万像素值的一个分辨率哈,那么我们等它生成完,可以看一下它的效果, 我们先继续来看哈,那么我们再来看一下,这个是图声视频的工作流效果哈,那么工作流当中呢,上传了一张图片, 就是这样风格的,这张图片呢是用 crayon 二本地完成生成的,提示词我们写的就是角色正在进行敲击键盘的操作,然后突然呢整个画面开始变得扭曲,然后他穿越到了超级玛丽当中哈,也是一个游戏,那么我们可以看一下效果。 好的,我们可以重点看一下哈,这个视频的生成,他是具有前后的一个关联的,那么比如当前我们这个角色,他是一个绿色的头发, 对吧?那么在穿越过去之后呢,这一个角色也是按照他的形象去进行的复制,也就是绿色的头发,这种效果啊,可以看到,而且整体画面的动态效果是非常足的哈, 好的,那么这个效果呢,跟我们首张图片的一致性是完全保持一致的哈,大家可以看到。那么接下来呢,我们再来看最后一个工作流,这个是参考图完成视频生成的,那么同时它也支持参考视频和参考音频的一个输入哈, 最多支持九张的混合输入,包含图片,音频,然后以及对应的视频。那么这个工作流里面我做了一个简单的测试,也就是上传了两个之前我制作好的封面,让他根据封面给我去制作一个片头的视频剪辑,也就是模仿视频剪辑的效果,而不是通过剪辑的软件,是直接生成的哈, 我们可以看一下效果哈, 好的还是工作流有一点点的模糊啊,生成的视频有一点模糊,这个是因为低分辨率的情况, 如果说我们跑高分辨率效果会更好,但是目前呢,还没有出现 light 叉二 v 这样的一些加速蒸馏的 low 二模型,所以说呢,我们只能在较高的步数完成视频的生成, 如果说在跑高分辨率的话,那么一个案例的测试可能要用到三四十分钟的时间,那时间就太久了,所以说等到后续如果说出现蒸馏的 low 二模型之后,我们在本地是可以完成较低的时间,然后以及高分辨率的视频生成的哈,那么这个效果也是很不错的。接下来呢,我们就详细讲解一下这三个工作流的使用方式啊。 首先是纹身视频工作流的用法,那么如果说大家没有本地的硬件去支持你进行运行的话,大家可以直接在云端进行使用,云端的工作流呢,我们也完成了一个部署,大家可以直接点击即用哈, 那么本地的话也要学习工作流的一个用法,云端的话也要学习工作流的用法,所以说接下来三个工作流的讲解大家一定要详细听哈。首先纹身视频的工作流跟我们之前的纹身图基本上类似啊,差不多,那么工作流的核心用法我们先看前面 是模型的加载,云端的话,模型已经提供了,大家不需要修改这里的内容。本地的话,大家下载完模型放到整合包里之后呢,可以自己去进行模型的一个选择,所以说前面大家按照工作流里面的名称一个一个的去进行模型的选择哈,那么下面的话是进行分辨率以及生成视频时长的一个设置。 最前面有个 duration 节点啊,这个指的是视频的持续时间,也就是你总视频的时长,这里如果说给到十五秒的话,后面会接一个数学计算的公式,会根据你生成视频的时长计算生成视频的总帧数,然后传到工作流当中。所以说这个节点大家不要去修改它的内容, 直接把它放到这个位置就可以了,好吧,主要就是在前面设置视频的时长,那么建议的话,大家可以先通过较低的秒数,比如说四秒,然后八秒, 十五秒去进行视频的生成啊,然后后面是一个 resolution selector, 这个节点就是去设置我们视频的分辨率,但是呢,它并不是像我们之前一样直接去输入长和宽, 而是呢通过设置我们的长宽比以及总像素值去完成一个设置哈,那么我们可以看一下这个节点的用法哈, 比如说这个节点我们设置的总像素数量是零点四,那么是百万的单位啊,相当于是零点四百万的像素值,那么也就是四十万啊,我们可以看一下把这个 y 和 h, 我 们可以展示一下,用一个竖 any 节点哈,运行一下哈, 可以看到,如果说我们设置的是零点四百万的像素点,以十六比九的分辨率,那么最终得到的就是长和宽是八六四乘以四八零的分辨率,这个在较低显存上面是比较好的。 如果说想要提高,比如说我们给到一百万的像素值,那么十六比九的分辨率,它就会自适应的去调整,调整到幺三七六乘以七六八的分辨率,好吧,那么这个节点就是这样的一个原理, 而且长宽比是严格控制为三十二的倍数的,这个会影响到我们 mini max h 三这个模型生成视频的质量,所以说这一点呢,大家一定不要去修改它,好吧,长宽都要是三十二的倍数,最好就是通过这个节点去完成它自适应的分辨率设置哈, 好吧,如果我们自己设置的话,可能会改变其中的值,导致生成视频受到影响哈,那么最高的话他可以支持到二 k 哈,也就是二五六零乘以幺四四零的分辨率啊, 好吧,那么这样的话对电脑的要求可能比较高,那么设置完我们生成视频的时长,设置完我们的分辨率之后呢,大家就可以在这里去设置你生成视频的 提示词,如果是文声视频的话,在这个 image to video 节点当中呢,不需要连首尾针哈, first 和 last 指的是我们的首尾针,直接写提示词就可以,关于提示词的缀写,我们有一个文章,也就是 minimax 官方给我们提供的提示词指南哈,好吧, 那么在当前这个页面当中啊,下面可以看到,那么我们也可以把这个网址直接交给比如说像豆包一样的 agent, 或者说 chat gpt, 让他们帮我们分析和完成提示词的章节,比如说我把这里面的所有内容复制哈,复制之后直接发送给豆包,然后说 学习这个提示词的写法,然后说我想生成一个动漫视频,请你给我提示词,就这样,如果说你要求的更多,比如说视频当中的角色是怎么样的,或者说画面是怎么动的,都可以在这样写,都可以在这里然后告诉他,让他帮你写出既符合官方要求又满足你要求的提示词,好吧, 这是我们提示词的一个写法啊,然后前面这里我们设置完之后,就可以直接点击运行了,运行完之后就能够拿到我们最终的一个视频,好吧,这个工作流我们已经做好了适配,大家不需要配置就可以直接使用哈。文声视频主要就是时长,分辨率以及提示词的书写,其他的内容大家自行去进行调整。 那么接下来我们看一下图声视频的工作流哈,图声视频的工作流使用方式和文声视频基本类似,只是多一个图片的输入哈,在当前工作流当中,如果说我们输入手帧的话,也就是 first frame 就可以完成我们图片提示词到视频生成的一个过程,最终呢是会带有音频的,下面同理是设置我们生成视频的持续时间以及我们总视频的分辨率就可以了,这里设置完之后,直接点击运行就可以拿到最终的结果。如果说大家想要制作首尾帧的视频, 那么可以在当前手帧的工作流当中再加入一个节点,叫做 load image 节点哈,然后加载完 load image 节点之后,可以直接把 image 连到这个 last frame, 也就是最终输入的这张图片当中哈,也就参数当中, 然后就可以完成我们首尾帧视频工作流的一个搭建好吧,那么这个对比于图声视频,它的难度并不是很高哈,所以说大家呢可以自行进行操作,选择自己合适的环境。提示词的写法呢?还是按照我们刚才讲的内容可以自己写,也可以让 agent 帮你去写。 那么这里用到的模型呢是 fl to v 好 吧,也就是首尾帧 first last frame to video 哈,然后前面我们纹身视频用到的也是 first last to video audio 哈,好吧,这就是首尾帧。那么最后一个呢,就是我们的参考到视频生成的工作流哈, 那这个工作流当中前面用到的大家可以看到这个模型叫做 reference to video audio 哈,那么这个呢就是参考,所以说模型供给我们发布出来了两个,一个是参考到视频的生成,一个呢是文声视频,图声视频的模型好吧,那么这里面的一个核心节点就是 mini max h 三 reference to video 节点哈,那么就就是参考到视频生成的节点,该节点当中它是可以自适应的去完成 图片的一个增加,或者说音频和视频的一个增加,比如说当前这个工作流当中,我们给了参考图一和参考图二两个,对吧?最多它可以支持九张图片的输入。如果说大家想要接入其他的图片,那么依然可以自行创建一些节点叫做 load image 节点, 然后呢把这个 image 连接到这个 reference 二当中,好吧,那么它下面呢就会自动地给我们再增加,比如说这里有个 reference 三,我们就可以再复制一下这个图片连接到三,那么这里可以看到又增加了 reference 四,然后我们就可以再复制,然后再把第四图进行一个传入, 好吧,它会自适应的根据你输入的图片自动添加额外的参数,那么这里没有的话,大家就可以把它删掉哈。同理呢,这里的视频输入,我们也可以通过 load video 节点哈 去加载我们对应的视频,然后把 video 呢连接到我们这里的 video 输入当中哈,比如说这里我们用 load video 节点 上传我们的视频,然后可以把视频的所有帧,也就是这个 image 连接到这个 reference video 当中,好吧,那么同理 video 它也会自适应地进行一个增加,那么 audio 的 话,我们就可以使用 load audio 节点去完成我们音频的一个输入,然后直接进行一个连接, 好吧,那视频大家要注意一点哈,也就是参考视频我们传来的是图片的序列啊,并不是你的原始视频内容。如果说大家用 cf ui 官方的节点叫做 load video 哈,去完成视频的加载,那么你还需要通过一个节点 叫做 get video components, 好 吧,也就获取视频的一个信息哈,包含 images, 也就是图片的帧序列,包含 audio, 也就是音频还有 fps 的, 然后可以把这个 image 再连过来, 好吧,连到 video 这个序列当中哈,那最多呢,这个节点可以支持九个混合输入,也就是带音频,带视频,带图片,一共九个参数的输入 你的视频当中呢,也是可以带有音频的,好吧,那么前面的模型选择还是按照我们工作流提供的去进行选择,全部输入完之后呢,大家可以看到下面会有一个参数的设置,跟我们刚才讲过的差不多, 在这个节点当中呢,去设置分辨率,然后设置你的总像素值,然后呢再去设置生成视频的持续时长, 然后再通过提示词去完成各个素材之间的一个配合。建议大家可以通过 image 一, image 二这样的形式去完成提示词的书写啊,包括 video 一 这样的啊和 audio 一 这样去通过占位的形式完成提示词的拷写哈, 然后可以详细的写一下它的动态,好吧,动态效果,那么这个提示词的主要写法呢?还是参考我们刚才的那个网址哈, 那么剩下的内容就是直接点击运行,完成最终视频的一个获取了,好吧,那这个呢,就是参考到视频生成的工作流, 那么这三个工作流里面的详细参数呢,我们大概讲解到这里,那后续我会继续测试在不同的分辨率以及不同的帧率的情况下,可以得到的视频的质量效果到底如何,然后以及我们怎样才能获得最高质量的一个视频制作的结果,然后并且包含一些加速的效果哈, 那么接下来呢,我们看一下本地使用以及安装的一个方式啊,大家还需要进行一个操作,就是更新 comfyui, 然后如果大家用的是便携包的话,这里会有一个 update, 然后大家双击这个 update comfyui, 它就可以自动地给你拉取 comfyui 最新的一些信息, 拉取完之后呢,还会同步的给你更新对应的工作流好吧,然后以及对应的环境包,那么这个过程大家要保证网络没问题。更新完毕之后呢,大家就可以直接启动康复 u i 了哈,因为模型已经获得了康复 u i 官方的支持,所以我们不需要安装过多的额外插件,那这里呢,我就把它关掉,因为我本地已经启动过了。 那么我们再来看一下我本地刚才设置的一个高分辨率视频,生成了大概八秒钟的视频,我们来看一下效果, 好吧,可以看到效果非常不错啊,把它下载一下,那么我们看一下本地生成的时间吧,好吧, 那么这里以两百万的像素值为例,我加载的模型呢是 int 八,好吧,就是模型本质,然后包括我们的 clip 模型,都是 int 八的量化方式哈, 然后八秒钟的视频,两百万的像素值,我一共生成了二十分钟左右哈,那如果说是一百万的像素值,我们生成的时间大概是在六分钟左右,如果说我们生成的是零点四百万,也就是八三二乘以四八零的分辨率,那么一个视频的生成大概是在四分钟左右, 那么这个工作流我是加了 second attention 去完成加速的哈,这个节点大家如果安装了 kj nos 插件就可以使用,本地的话,我们可以用这个节点完成加速,云端的话大家就不建议加速了哈。好吧,那么接下来呢,我们就本地来跑一下,看看我们的显存占用,好吧, 显存占用相对来说还是比较高的哈,这里呢,我就直接跑一个图声视频的案例吧。好吧,我们以这张图片为例哈,然后我让特邦呢帮我写个提示词, 好的,那么这里呢,我给豆包说一下我的想法,让他根据这张图片呢给我写一个提示词,同时提示词按照我们刚才给他的那个提示词指南去进行书写哈。好的,那么我们把这个直接复制哈,然后放在本地,那么我们来生成一个大概 就十五秒的视频吧,好吧,然后呢,这个节点我用上派奇三个 attention 啊,用了这个节点之后呢,我这生成时间大概是在四分钟左右,不用这个节点,我的生成时间大概是在八分钟左右,好吧,有接近一倍的性能提升,所以说本地的话大家可以用一下,但是呢,它需要你安装有三个 attention 那 个环境包哈, 那么这里呢,我把本地的康复 u i 的 显存和内存都做一下卸载,然后再重新运行啊,点击运行之后呢,我们可以看一下我电脑这里的一个显存状态啊,开始逐步的去完成模型的加载啊,可以看到我这里的显存,然后以及共享内存都在逐步的上升,那么这里呢,已经开始进入到生成的阶段, 总计占用了大概七十 g 的 一个容量啊,好吧,那么如果说大家显存不足的话,它是会自动完成显存和内存之间的一个交换的, 所以说不用太过于担心我这里显示的一个数值啊,因为我的显存以及共享显存都比较多,所以说他就尽可能的把这些都占满, 好吧,就不会调用到我共享内存了,如果说大家显存内存不足,他会调用共享内存的,好吧,你也是能正常的跑的。那么再来看一下我们生成的时间啊,这里正在完成我们视频的生成,目前已经跑了一步了,我把它拉到最下面, 可以看到这里我的生成时间呢,四步用了三十八秒啊,一共二十五步,最后预计是三分十五秒,加上前面已经跑过的四十七秒,也就是接近四分钟的时间完成十五秒视频的一个生成啊,那么这个呢,还是在没有进行蒸馏的情况下, 如果说后续有蒸馏的模型,那么我们可能大概六步就完成了这个视频的制作,那么六步的话也就是一分钟左右哈,好吧,一分钟左右完成视频的生成,并且是十五秒左右,而且动态效果非常足,这个提升已经非常大了, 所以说呢,我们可以再期待一下后续开源社区的一个蒸馏和加速,我们可以再来看一下提示词的内容哈,然后我让豆包帮我写的提示词呢,就是视频中的这个人物正在弹琴,然后旁边逐渐卷起大风,人物的裙摆随风飘动, 然后人物的表情变得坚定,随后呢就是脚下开始出现一些光照的路,逐渐进行生长,然后人物就踩着这些光照的路飞向天空哈,那这个呢就是我们视频的内容,一共十五秒,我们可以等待它生成完毕,看看结果哈。 好的,这里一共用了四分零四秒完成了视频的生成哈,现在正在完成解码,解码的时候我们可以看一下内存的一个占用哈,解码的时候内存的占用峰值到了一百零八 g 左右哈, 所以说大家一定要在自己的电脑上设置虚拟内存,不然的话大部分的电脑他的内存是不足的啊,大家可能只有三十二或者说六十八 g 左右,对吧?那么你要设置一百 g 的 虚拟内存啊,建议。好吧,那这里我们完成了视频的生成,来看看最终的一个效果。 好的,那么可以听到啊,就是整个背景音乐非常的干净,而且跟画面也是吻合的啊,也是符合我们提示词的内容,逐步的上升哈,这个效果是很不错的。 好的,那么今天这期视频呢,我们就先讲到这里。

就是它这个有点几乎就用了几秒钟就已经把整个代码都生成,然后帮我做出了这款游戏,并且呢我还可以尽情的玩游玩,并且它和现实版的特别像。 hello, 大家好,你现在看到的就是小米 miimo 即将推出的 ultra speed 模型, 现在呢我也通过了它的内测申请,相较于之前的这个二点五 pro 的 普通模型是非常非常强的,我们一起来看一看它到底能有多快。这里做一个对比演示,让它们做同一个演示模型 ultra 仅花费十二秒,而普通模型则需要六分钟。让我们来实测一下 它这个跑代码的速度,大家可以看到是相较于之前的就是有一个飞速的进步, 那这里呢会显示实时 token 的 使用量哦,它已经做好了,在官方的介绍里,据说它十秒钟就可以写出一个贪吃蛇的代码,今天我给他做一个升级,让他模仿一下我的世界。这款游戏 花费三十七秒就已经初步成型,它旁边还有玩法提示功能,可以说该有的都有了。我们现在呢来玩一下雾,这个效果还是非常惊艳的 哦,自己生成代码就可以直接有这样一个肌底,我觉得已经非常非常好了,虽然它侧面是洞明的, 嗯,但是我觉得这个可能是跟我的指令太简单有关。那我们现在回到主页面去修改一下它的指令,让它自动解锁错误,我们重新的去生成。 好,我们已经进来了,发现它真的变了,和刚才就完全不是一个世界的了,现在没有任何模型错误,而且它的这个方框和左右键应该是都可以用的,对, 然后可以再重新的生成方块。我大概看了一下他的这个模型的地图还是非常完整的,有沙漠呀、森林啊,还有海洋,都是非常健全的。 现在给我的感受就是有点逆天,因为我整个过程就用了两句话去生成和修改它,然后就能生成这样一个模仿我的世界还原度这么高的一个游戏。 随后我还生成了几个 ppt 视频,小游戏,都能够在十秒之内生成。你们说这个模型最终会定价多少?

项目辛辛苦苦 vip coding 出来了,你知道该让它上线了,可项目要怎么上线,第一步该干什么?很多人心里一点数都没有。一天一个 vip coding 小 技巧,今天讲从项目只有你自己能打开,到它真正具备上线条件,这一路到底该怎么走?其实我部署片的排序本身就是按这条路来的,一期接一期 连起来就是项目部署上线的整条线。可大家是一期一期零散看的,单看每节好像都懂,真要自己从头走一遍,谁先谁后,哪件必须提前,照样心里没数。所以这一篇 我就把这条线从头到尾给你捋一遍。因为要讲的东西比较多,我拆成上下两篇,上篇讲上线之前手续什么时候交地基什么时候定代码,上线前怎么体检,下篇讲上线那刻河之后,部署方式怎么选,怎么把项目安全地推上去,推上去之后怎么管住它。 一、第一步先定这个项目给谁用,你让 ai 把项目跑起来的时候,它会给你一个地址,一般长这样, local host 冒号三千, 或者幺二七点零点零点幺,冒号三千,你在浏览器里输进去,项目就出来了,看着跟正式网站没两样,但这个地址只有你这台电脑打得开。因为 local host 和幺二七点零点零点幺指的都不是某一台具体的机器,而是我自己这台。所以你把它发给朋友,它输进去, 浏览器找的是他自己的电脑,当然什么都没有。从这儿往外是一层层放大的,先是同一个网络里的设备,再是公司内部这个圈子,最后是外面任何人都能打开,最后这层才叫公网。这里插一句,因为有人会踩。网上有种叫内网穿透的工具,能临时给你这个本地地址,生成一个外网能打开的链接,发给朋友看一眼,确实能开, 但那个只能叫掩饰,不叫上线。链接是临时的,你电脑一关就没了,速度也不由你控制。你要是拿它当上线,等于把自己的笔记本变成了全世界的服务器,家里网一断,产品就没了。 部署上线要解决的就是把项目从我自己能打开挪到外面的真实用户,能稳定访问。这件事之所以要第一个定,是因为它决定后面所有事的规模,只给公司内部几个人用,很多手续和风险都用不着操心。可只要是给外面的真实用户用, 服务器、域名、备案、安全,一件都躲不掉,而他还牵着紧接着的一步要给外面的人用,你就得有一台一直在线的机器来跑项目。 服务器你就理解成一台永远开着永远联网,放在大厂机房里,有专人二十四小时看护的电脑,自己那台笔记本顶不了,他会关机,会断网,也没有一个稳定的对外地址。而这台机器你打算放在哪,还决定了一件更要紧的事, 你上线之前必须先去办哪几样手续。第二步,要等别人审的手续,最先交出去。上线前的事其实分两种,一种是你自己能推的,比如地基怎么定,代码怎么测,你想快就能快。 另一种是交上去就只能等别人审的,比如备案软注。后面这种才是真正决定你哪天能上线的东西,所以它必须第一个启动,而要不要办是接着上一步一路推下来的。用户在哪,决定你的服务器放哪,服务器放哪,才决定要不要备案。服务器在我国大陆又要用域名对外提供服务,那就得先办 icp 备案, 也就是大家平时说的网站备案,它审的不是你网站做得好不好,是几样东西,对不对得上这个域名是不是你在这家云厂商买的? 你这个主体个人还是公司身份,是不是真的?说白了就是给这个名字、这台机器、这个人,三者之间做一次实名登记,这事得人工核对,所以他没法快,也没法绕。而不办的后果很直接,云厂商会把没备案的域名直接拦掉,用户根本打不开。备案要等多久?短的几天,长的两三个星期, 第一次办通常更慢。所以正确的做法是,你一买好服务器,确定要用域名对外提供服务,就先把备案提上去,让他在后台审,你这边接着开发。这里有个常见的误会,不少人觉得我不做网站,只做小程序,只做 app, 那 就不用买域名了,这是错的。 小程序和 app 要连你自己的后端,那个后端接口按规定也得挂在已备案的域名下面平台才认。而域名这边有两处会卡你的时间。 第一,在大陆的域名商买域名,通常要做实名认证,认证不通过,后面想备案根本走不了。第二,域名买回来,它还连不上你的服务器,你得亲手把这两样签到一起。 这一步叫解析,具体就是在域名商后台加一条记录,把你服务器的公网 ip 填进去,这种记录叫 a 记录,以后 ai 让你去加一条 a 记录,说的就是这件事。而解析不一定马上生效,有时几分钟,有时要等上几个小时, 这个要等。很多人以为是自己配错了,其实是机制决定的。全世界的人访问一个域名,不可能每次都跑去问一遍他的老家, 老家就是你刚才配解析的那个地方,那里记着这个名字到底指向哪台机器,所以从你家路由器到你的宽带运营商,一路上都存了一份这个名字对应哪台机器的小抄,直接照着小抄回答,你这份小抄有到期时间,没到期他就一直照旧打。这个到期时间是有名字的,叫 t t l, 在 你配解析的那个页面上就能看见, 通常是六百秒这种,这个数你记着有用,以后你要换服务器,就提前把它调小,等新的生效以后再调回来切换,那天的等待时间会短很多。你改完解析只是把老家那份改了, 路上这些小抄还是旧的,得等他们各自到期重新去问一次。所以会出现一个很坑人的现象,你自己这边已经能打开了,换到你朋友那边还是打不开,就跟开头那个只有你能打开不是一回事。那次是地址,指指你自己这台机器, 这次是解析已经改好了,只是路上的小抄还没到期,这时候你要做的是安心等待,而不是回去把解析反复改一遍,越改越乱。 app 和小程序也各有自己的备案,上安卓应用市场, app 备案号和软注都绕不开,软注更要趁早,最快也得小半个月到一个月,走普通流程,或者中途被要求补材料拖上两三个月很常见。你把这几件的时间摊在一起算一下,就知道为什么他们必须最先扔出去。备案短的几天,长的两三个星期,软注小半个月到两三个月, app 备案还要在排上,应用市场还有一轮审核,这些时间你一天都审不掉。因为它不取决于你,取决于对面什么时候看到你这份材料,而它们能不能和你的开发同时跑,才是你唯一能决定的事。 还有一个动作比这些都更早,就是给产品起名,因为备案要用这个名字,软注要用上架,应用市场要用,注册商标也要用,这几处的名字还得对得上。 所以起名的时候就先去应用商店和商标网站搜一遍,看有没有重名,有没有近似的,发现有,哪怕只差一个字,也直接换一个,别硬上,等手续全办出去了,再想改名,等于推倒重来。三、第三步,三个地基趁手续在审的时候拍办,手续交出去了,接下来是你自己能推的这条线。 第一件事不是写代码,是先把三个地基定下来。这三个决定有个共同点, ai 图省事时给你的默认做法恰好都是错的那一边,而它们全是越晚改越贵。上线以后再动,等于把地基重铺一遍。第一个地基数据库用哪种?它常会给你用 sqlite, 特点是整个数据库就是一个文件, 要是你做的只是个小工具,没有用户系统,用它问题不大。可你的产品如果要多人同时用,它就撑不住了。那这个撑不住到底是撑不住什么? 它整个库就是一个文件,往里写东西的时候得先把这个文件锁上,同一时刻只允许一个人写,你一个人测,永远发现不了问题。几十个人同时提交,后面的就得排队,排不上的直接报错,用户看到的就是提交失败, 你在自己电脑上却怎么都复现不出来。这就是它最坑的地方,它不是不能用,是人少的时候一切正常,等你真有人用了才开始出问题。而且它还有两处天生的短板, 给不了不同的人,不同的账号和权限,也没法让另一台机器连过来用它。所以你以后想把数据库单独拆出去,或者加第二台服务器,它根本没这个能力。结论很简单,要做的是带用户系统的正经产品。 一开始就让 ai 用 my sql 或者 posgrid sql。 这里单独提出来讲,是因为很多人临上线了让我看他的代码,我一看数据库竟然是 sql lite。 所以 这里我建议你也先回头问问你的 ai。 第二个地基数据库放在哪台机器上?默认情况下,很多人都会把程序和数据库全塞在同一台服务器上,挤在一起会带来两个后果,越往后越难受。 第一,同生共死,这台机器要是没了程序,不怕重新部署一遍就有了。要命的是,涉及到真金白银的数据,很多时候是再找不回来的。第二,互相拖后腿,他们抢的是同一份内存,同一块硬盘。程序那边一忙,数据库跟着变慢,数据库在跑,备份网站也跟着卡, 一个出问题,另一个一起被拖下水。你查半天还分不清到底是谁的毛病,想拆出去有两种做法,自己再备一台机器装数据库,或者直接用云厂商托管的那种数据库,你不想自己维护 托管的那种通常更省心。安装监控、自动备份厂商都替你做了。要是你现在就打算先让程序和数据库混着跑,那有一条最低要求,必须做到,让 ai 帮你配好自动备份,把备份存到这台服务器之外,还要真的做一次恢复验证,不然备份文件和数据库躺在同一台机器上, 机器一出事,备份也一起没。第三个 dj, 图片和视频这些文件放在哪儿?如果你的项目会有大量图片因视频,别让它们堆在自己服务器的硬盘上, 一开始就放到对象存储里去,就是云厂商专门用来存文件的那种服务。你把文件传上去,他给你一个网址,你自己的服务器上只留这个网址在自己硬盘上,会在三个地方咬你。一是搬不动,你哪天换服务器或者加第二台机器分担压力,文件还躺在旧的那台上,新机器看不见, 用户那边就是一片打不开的图。二是备份被称爆,数据库本身可能只有几百兆,图片视频动不动几十个 g 混在一起备份就从几分钟一次变成根本没法定期做。三是贷宽全走你自己,每个用户看图看视频,流量都从你这台机器出去,几个人同时看正常的页面,请求也跟着卡。 还有一种更要命的做法,你得专门叮嘱 ai 别干,把图片本身塞进数据库的字段里,那会让数据库迅速膨胀,查询变慢,备份彻底没法做,数据库里只该存那条链接,文件本身放到对象存储去。四、第四步,上线前的体检顺序不能换,地基定了,代码也写完了,可它还不能直接往上推。 上线前,代码这边还有三件事,而且顺序是固定的。第一件,你自己先把每个功能从头到尾走一遍,这叫功能闭环。走的时候盯住三点,一是别只看有没有反应页面谈个成功太容易了,你得回到数据里看那条记录是不是真写对了。二是专门走歪路,故意为它错东西, 不登录就操作金额填成负数,把订单号改成别人的必填项留空,这时候你要的不是它能用,是它能拦住你, 拦不住就是个口子。三是如果发现问题,让 ai 改完之后,这次没碰到的地方也要回头点一点。因为 ai 改东西很爱顺手动一动,你没让它动的地方,或者为了让这处能跑,把公用的那段逻辑改了,结果这个功能好了,另一个上周还好好的功能悄悄坏了,而你根本想不到去点它。所以每次改完之前能用的那几条主流程,你都得再走一遍。 而你不看代码,也有办法知道该重点走哪几条,改完就追一句,这次改动动了哪些公共的地方,可能连带影响哪些。原来已经做好的功能列出来,我要重新测试一遍。它列出来的那几条,就是你这次重新测试的重点。第二件,指挥 ai 再查一遍, 这一遍功能要查,但重中之重是安全。说到这里,有些人就会觉得麻烦了,既然都要 ai 查,那为什么不能反过来先让 ai 查,因为你自己没走通就说不清要他查什么,他查完你也判断不了查的全不全。功能这边一句话带过,让他优先测,一出错就会动到钱权限关键数据的地方,再把这些检查存成能一条命令重跑的测试。 以后每次改完都追问一句,所有测试虫跑了吗?而这一遍最重要的是测试安全问题。你之前自己走的那一遍,是当好人在页面上点,可真想搞你的人根本不走你的页面,他用工具绕开页面,直接对着后端发请求,你在页面上做的那些限制对他一点用都没有。 所以你得让 ai 换个身份,别当那个帮你写功能的助手了,让他当攻击者。把你的每个接口一个个试探一遍,拿别人的订单号能不能查到别人的数据,普通账号能不能调,管理员才能用的功能,提交的时候偷偷多塞一个字段,把价格改成零认不认,登录接口能不能被人无限次地刷等等。 只要是你程序中的关键功能、关键设计,具体每一类怎么问,发现问题以后按什么顺序处理。我之前专门做过一整期视频,就叫 web coding 项目上线前的全方位安全审计提示词都能直接抄,这里就不重复了,但上线前你一定去看一遍,这儿只留一条纪律, ai 查出问题先让它列清单,别让它顺手就改, 一边查一边改特别容易,为了堵一个小洞,把好好的功能改坏,最后你连它动了什么都不知道。第三件,让 ai 把那些任务做完就没用,却一直处在项目里的代码清掉,我给他起了个名字,叫墓碑。代码里面最危险的是临时测试接口,它们往往没有权限校验,跟着上了线就是个明晃晃的口子, 别人能直接拿它操作。你的数据清理之所以必须排在最后,是因为要等功能写完,测试通过,你自己也用过,确认没问题才动手删,删早了反而耽误事,交代的时候还要说清楚正式的测试代码。还有,你有意留在关键功能上,准备上线后排查问题用的运行日期都不许一起删,那是你上线以后排查问题的保护网 图,省事。甩一句把测试和日期都清了,等于亲手把它拆了。所以这件事的话得这么说,把项目里的临时接口、调试用的路由、写死的测试账号和演示数据全列出来, 先别动,列成清单等我确认。关键是先列出来,别直接删,你要是让他一次性删干净,他就会顺手把有用的东西一起带走,你还不知道少了什么。这三件走完,还剩最后一道关,把所有该查的项汇成一张总清单,临上线前从头到尾过一遍。那张清单本身有十来项,如果感兴趣的,可以往前翻一翻, 这里只把最要紧的一条拎出来。开发和上线必须是两套环境,因为环境不分开,你让 ai 试错的每一下,动的都是真实用户和真实数据。那两套环境到底是怎么分的?很多人第一反应是把代码复制两份,这是错的。 真正的做法是,代码只有一份,靠代码外面的一份配置来决定它连哪个数据库,用哪把密钥对外是哪个地址,所以切换环境切的是那份配置,不是改代码。同一份代码在你电脑上连测试库,在服务器上连正视库,需要各用各的, 主要是四样,第一,数据库,你本地那个库可以随便清空重建正式库一条都不能乱动。第二,各种密钥,支付短信、 ai 接口,尽量用测试用的那一套, 别拿正式密钥在本地反复试,试的每一条短信,每一次调用都在真花钱。第三,对外地址本地就是开头说的那串 local host, 线上是你的正式域名,两边不能在代码里固定成同一个。 第四,调试开关,这一条最容易漏,开发的时候程序出错,会给你一个很详细的报错页面,好排查。这个页面要是跟着上了线,外人访问出错时就能看到你的文件路径,用了什么框架,有时候连数据库信息都印在上面,那等于把你家的结构图贴在门口, 所以正式环境必须把它关掉,只往日制里记,不往页面上显示。还有一条同样重要那份生产环境的配置,不进代码仓库,它只待在服务器上。这条我得说重一点,那份配置里装的是数据库密码、支付密钥、短信密钥,等于你项目的一整串钥匙,它一旦跟着代码被推到公开的仓库上,就不是可能被人看到的问题了。 网上有专门的程序,全天在扫这种文件,几分钟就能扫到你,而且你后面把它删掉也没用。仓库的历史记录里还留着技术站不一样,配置文件的名称和位置也不一样,所以别自己猜。上线前追这一句, 我这个项目的配置文件是哪个?它有没有被排除在提交之外?历史提交里有没有传过密钥?这是上线前最便宜的一次检查。五、最后上线前这一路就是两条线拧在一起, 一条要等别人审的,越早交越好,晚交一天就是白等一天。 你自己能推的,先拍三个地基,再让代码过,体检顺序反了都要返工。而这两条线上的四步,其实没有一步是要你会写代码的,定给谁用,什么时候交手续,数据库用哪种放哪,上线前查哪几项,全是决定,不 是技术。而这些决定 ai 不 会替你做,它只会按默认的最省事的那条路往下走。所以真正卡住大多数人的,从来不是不会敲命令,是没人告诉过它这些事有先后,也没人告诉过它做错了,什么时候会疼。编到这里就完了,下篇讲后半段几种部署方式,到底怎么选,怎么把项目安全地推上去,以及推上去之后怎么管住它。 问你一句,你上线前是照着一张清单一项项过,还是代码写完就直接往服务器上传评论区聊聊我自己。上线前会过一张体检清单,从环境分开、密钥、墓碑代码到回归一项项打勾,想要的可以留言部署流程。

朋友们晚上好,这期不用怀疑是针对超级小白的,什么叫超级小白?就是你连这个软件都还没有安装,然后教你们如何安装我的安装包啊,这里,到时候你们会在我的粉丝群里获得这个 压缩包,长这样叫 comui comui windows 什么一个一个便携包,你只需要右键啊,把它解压解压出来,然后就变成这样了,它现在就长这个样子了。长这样之后,你只需要点 run 什么 new 这个啊, 点这个啊, gpu bet 啊,点击这个文件,你就可以打开你的 comfuly 了,你就会来到这个页面了啊,等会你的后台会有一个这个东西,你看我这现在正在跑着啊,然后这套东西需要的配置啊,最低八 g 就 可以跑 十二 g 或者十六 g, 能跑的速度更快一点啊,也就说三乘六零都能玩的一个一个,一个一个模型啊,一个模型。然后来到这个页面之后呢,这就是一开始来到你们那个页面不是长这样,是长这样啊,可能是空白的啊。空白之后呢,你只需要点左边这个模板,点了左边模板之后呢?哎, 他现在放在最前面的这三个就全都是 mini max h 三的,一个图声视频,一个文声视频,他们分别就长这个样子啊, 同声视频的啊,这个是参考声视频的,这个是纯文本声视频的啊。这么三个。然后你们的模型需要下载到什么位置呢?到时候在我的网盘领取了模型之后,要下载到这个位置, 进到这个文件夹里之后, ctrl u i, 这边有个 models, 对 应的和网盘上的名称是一样的啊,一个是 d f model 是 吧?一个是 text 的。 这个还有个叫 ve 的 啊,把模型我在网盘怎么放的,你就需要怎么放,把它们放对位置。你放对位置之后啊,点一下 r 刷新之后你这个模型就会被加载出来了,加载完之后你就可以直接跑视频了啊?直接就可以跑视频了啊?就这么简单,下课。

我们这期来盘一下如果想私有部署 deep seek 为四,需要什么样的硬件。本期我们对比了多种有代表性的硬件部署方案,价格从几千到几十万不等。我们会从 deep seek 这个模型的架构,以及它推理的每个阶段,对硬件的需求,每种硬件的长处和瓶颈等角度去真实分析, 用真实的案例去评估哪种方案更适合你。内容全都来自真实的硬件测试,内容有点长,不感兴趣的可以划走了。 deepsea v 四 flash 有 二千八百四十亿总参数,每次激活一百三十亿,下载体积大约一百六十 gb, 这个体积能进工作站,但装得下不等于跑得快,实际运行还要给上下文缓存、工作区和并发留空间。顺序很简单,先看斯卡 rtx, 再看 mac 双 dj x spark 和 amd halo, 最后用 dj x station。 gb 三百收尾, 看完就能按原始权重还是量化,单人使用还是多人服务,直接选架构。猫 e 每次只调用一部分专家,所以每次只激活一百三十亿,但全部专家权重仍要常驻。 真正决定速度的是算力、内存待宽和互联。 prefill 是 模型依次读完提示词,很多 token 可以 并行算,所以它主要看 gpu 算力,模型跨卡以后还要看通信吞吐,算力越强,长提示词的首字等待越短。 draco 是 模型开始逐字回答,低病发时它会反复读取当前用到的权重,所以更看本地内存待宽。只要模型跨卡或跨机器,连延迟也会进入每一层测速只在同一份权重,同一种量化,同样的 context 和并发症比较输入和输出速度要分开看, 网上有些成绩测的是零七三一 api 版不能直接当成本地权重实测。先看四张 rtx pro 六千 blackwell, 这是现在最直接的高性能 coda 自主方案,每张卡九十六 gb 显存,四张合计三百八十四 gb 原始权重,装下以后还能给上下文缓存和并发留出空间。 每张卡的显存贷宽是一点七九二 tb 每秒, prefill 算力强, dico 的 卡内贷宽也强,问题出在四张卡之间。 rtx pro 六千没有 nv link, 主要走 pci 阵,五卡内读权重很快,但专家路由一旦跨卡 pci 可能让 gpu 等数据。三百八十四 gb 也是四个独立显存池,不是一块儿相干大内存 代价同样明显。四张卡的功率上限合计二点四千瓦,光 gpu 大 约五点三万美元,整机供电、散热和高速网络另算, 所以四卡 rtx 解决了容量和算力,却留下了拓扑功耗和运维,下一步自然是把四块显存变成一块大内存。 max studio m 三 ultra 最高有五百一十二 gb 统一内存, cpu 和 gpu 共用一个内存池,不需要把权重切到四张卡上。 内存带宽八百一十九 gb 每秒,整机最大连续功率四百八十瓦容量,噪音和供电都比斯卡工作站轻松。但 mac 的 相对短板就是 prefill, 八百一十九 gb 每秒是内存带宽,不是低精度矩阵算力。 prefill 还要看 gpu 计算能力和 v 四的专用内核。在缺少 v 四优化内核时, mac 的 长提示词首次等待不会占优势。 deco 的 宽带更友好,所以 mac 更像一台装得下低并发生成有潜力的单机,而不是一台高吞吐 prefill 服务器, 这里是架构判断,目前没有同协议 v 四实测可以把它写成确定速度,它也不适合横向扩展,时机闭义太慢。 thunderbolt 也不是现成的 m o e 分 布式互联, mac 消除了多卡拓扑,却把风险转到了 prefill 和软件适配。如果既想保留 cuda, 又不想维护私卡服务器,就需要把 cuda 也缩进一台小盒子。 一台 d g x spark 有 一百二十八 gb 统一内存,装不下大约一百六十 gb 的 原始权重,要跑这份权重至少要两台,两台合计二百五十六 gb, 但仍是两个独立内存池,每台本地带宽二百七十三 gb 每秒,两台之间用 connect x 七的二百 gb 每秒链路连接, 理论限速大约二十五 gb 每秒。它的优势是 cud 容器和高速网卡已经配好部署,比四卡自阻击省心。 prefill 能利用 blackwell 算力,但跨机通信仍会影响首次等待, decode 则同时受二百七十三 gb 每秒本地宽带和跨机延迟限制。 两台官方售价合计大约九千四百美元。它确实把 cuda 服务器缩到了桌面,但代价是原始权重必须跨两台机器。讲完 spark, 正好看 amd halo, 两者都是一百二十八 gb 统一内存,小核目标也很像,但路线相反, spark 保留更大和二百 gb 每秒网络, halo 用更低的价格和功耗,再用量化换容量。 amd ryzen amx plus 三九五的 halo 盒子同样有一百二十八 gb 统一内存,本地带宽二百五十六 gb 每秒,自带十 gb e, 功耗一百二十瓦,售价大约四千美元, 单机装不下原始权重,但 amd 已经给出 v 四的 ds 四量化方案,大约八十一 gb 或九十七 gb 的 版本可以放进一台大约一百五十三 gb 的 q 四版本,要两台用流水线并行切开。这条路线很明确,单机用更激进的量化换来低价格、低功耗和简单部署, 代价是模型质量、 prefill、 算力、 r o c m。 软件成熟度都要按量化版本重新验证。二百五十六 g b 每秒的宽带也决定了它更适合轻负荷,不是追求最快响应的机器 双击。更大的问题是网络时机。 b e 的 理论限速只有一点,二五 g b 每秒,和本地二百五十六 g b 每秒差了两个数量级。 rcl 是 通信库,不会把十 g b e 变快。 md 已经有双 hello 十 g b e 加 rcl 的 官方案例,但跑的是另一个模型,它证明软件链能工作,不代表 v 四在这条链路上会快。 v 四双击方案用流水线并行,能减少逐层来回通信,但两段模型仍要顺序交接,结果 如果外接一百 g b e 或二百 g b e r o c e, 理论带宽会好很多,但网卡怎么接?能不能走? g p o direct r d m a v 四运行时怎么配,目前还没有完整验证,所以高速 r o c e 可以 研究,不能当成开箱即用的标准方案。 helo 和 spark 到这里就分清了, spark 花更多钱保 c u d a 和二百 g b 每秒网络双击装原始权重, helo 用更少的钱和电跑量化版,但十 g b e 是 双击硬瓶颈,两类小核都必须做取舍, 要把容量、算力、宽带互联和软件一次补齐,只剩最后一种架构,前面每台机器都补了一个洞,又留下一个洞。 d g x station gb 三百的思路就是不再做这些妥协。 它有七百四十八 gb 相关内存,其中二百五十二 gb 是 hbm 三 e 宽带,七点一 tb 每秒,另外四百九十六 gb 是 系统内存。 b 四原始权重可以完整放进 hbm, 两部分内存通过九百 gb 每秒的 nv link, c 二 c 相连,对外还有八百 gb 每秒的 connect x 八。它的 perf 算力是这些方案里最强的一档,长提示词和高并发更有优势。 decode 可以 直接利用 hbm 高代宽,也没有四卡 pci 和双机十 g b e 那 种明显断点。 cuda nccl 和容器工具链也更完整。 它的瓶颈不再架构,而在采购一千六百瓦功率,预算接近企业设备的体积,以及官网询价,它能放在办公室,但不是普通个人工作站,所以 d g x station 是 这条固式线的终点。四卡 r t x 的 算力, mac 的 相干大内存, spark 的 cuda 小 型化和 halo 的 桌面形态它都想保留,代价是企业级预算,最后按工作载选,不按产品名字选,要保留原始权重要成熟。 cuda 也能处理供电、散热和 pci e 拓扑。选四张 rtx pro 六千, 要单机大内存,安静和低维护,主要做低病发生成,可以研究 mac, 但先确认 v 四内核和正确性别把八百一十九 gb 每秒内存带宽当成 prefill。 算力要紧凑的 c u d a 环境,又希望尽量保留原始权重。选双 d g x spark, 它的代价是本地宽带和跨级延迟, 要把价格和工号压低,并且接受二次量化。 amd halo 是 最具体的桌面路线,单机最简单,双机先解决实际利益需要长期服务,高并发和最少的架构妥协,而且预算不是主要限制才看低 gx station gb 三百。

可以给大家对比看一下,这个是原版的纹身视频生出来的效果, 因为是为了验证我们这个视频模型的能力,所以我的提示词会写的比较复杂,就包含了有很多的运镜,还有些镜头的转换。像最后的这个甩镜头的这个效果也是一种验证。这个是加了 t e 的, 可以看到前面的整体是差不多的,不过最后甩镜头的一个展现它已经没有了。这个是加了 t e 和 shift attention 之后, 其实跟 t e 的 那个差不多。接着我后面是为了验证途胜视频,就加入了首尾针,这个是加了 t e 的 效果, 可以看到它的空间感其实是有一些问题的。然后这个是原版的, 原版的切近,还有一些空间逻辑,就比加了 t e 之后要效果好不少。 所以如果是为了质量的话,我建议还是不要加 t e。 如果你的运镜没有那么复杂,只是一些比较简单的镜头切换的话,那么我觉得你加了 t e 的 话,它是可以极大的提升我们的生产效率的。 此外官方还开源了它的 skill, 它主要效果是让我们写出更优质的提词词,因为这个模型还是很吃提词词的质量的。如果不知道怎么用的话,大家可以去问问豆包或者 deepsea。 嗯,当然如果你自己有一些 agent 的 软件,比如说 codex 啊, cursor 啊什么之类的, 那就可以直接让他们去安装,然后进行使用。然后也为了方便某些朋友,觉得这样比较麻烦,那我自己也简单的做了一个网页, 因为我也只买了一个最低配的云服务器,所以我直接把它挂到了自己的官网下面,那么大家可以自己进入这个网址,这里可以自己配置你的 api key, 如果你没有的话也想尝试一下。我自己也默认配置了一个 mini max 的 api key, 不 过我这个 key 其实主要是供我自己个人使用的, 所以我限制了每人每天就顶多使用两次,然后总的使用上限现在是一百次,超过了可能就用不了了。所以如果你想自己用的话,你可以自己来配置一下。我的网页是不会存储你配置的 api key, 所以 说也不用担心它会泄露到其他地方去。配置完成之后,它会在你自己的浏览器里面生成一个配置文件, 然后直接调用它去进行一个生成。如果是图生视频呢?如果是文生视频,你就可以直接在这里输入你的视频内容的描述。如果是图生视频,你就可以在这里点击上传文件, 主要是上传图片,最多支持传六张,然后这里同时要输入你对整个视频的一个内容的描述,然后点击生成题的词,后面他就会根据你配置的大模型,或者说用默认大模型去按照 这里的 skill 来跑出它的题词。下面是多图参考生成视频模型加载是一样的,只不过把这个加载的顶模要换成这个 ref 二五一的, 我这里也加入了 t speed 的 节点分辨率的设置,跟我们前面是一样的,也是宽高比,然后像素这些大家都不用改。然后这里是上传你的图像,它这边支持上传很多张图片的,比如说你连接一张图片之后,它就会增加一个字段,就像这样 还可以参考视频,还有音频,参考视频和音频的这个我还没有尝试,大家如果有事的话可以在评论区里面说一下它的效果怎么样,我这边验证的话还是用的我上一个视频用的一些素材,可以直接跟上一期讲的 ltxmsr 里面的一个参考声控视频进行一个对比, 后面就是正常的彩样,还有解码,这个没啥区别。第二次的书写的话,你可以直接学习他的 skill 该怎么写,或者直接通过我这个网站来进行生成也可以。那么大家也可以看一下这个生成视频效果的一个对比。哎, 今天怎么样?现在的孩子们太难教了,真心累, 快下班了,真累,孩子们也太难教了。 目前的效果对比的话,我感觉 h 三还是有比较大的优势, ltx 的 话它还是比较容易出现脸崩的情况的,但是 h 三有个比较明显的问题,就是它生成的这个视频会有一点点模糊,那么最好的方式就是我们生成了这个分辨率之后,我们再进行一个超分放大, 有一些稍微放大的工作流,或者直接用那种视频放大的工具也是比较合适的,这样的话就可以达到一个能够去正常使用的一个效果。那么今天的分享就讲到这,感谢大家收看。

二十万 ai 爱好者通过我之前的视频学习了怎么用 ai 快 速搭建网站,部署上线网站,连接数据库,实现用户的登录。那么今天我们就来打通 ai 编程上优化网站的最后一环,也就是接通支付,接通支付意味着我们可以实现 web 扣定网站的营收了,听起来就很激动吧,主播这段时间实现下来,发现确实没有我一开始想象中那么简单, 但是没有关系,这个视频我手把手带大家做一遍,应该可以给大家简化不少流程,少走一些弯路。那么我们现在开始吧,这次我们还是选择之前的相亲定位测评的这个工具,用户在测完题想要获取报告的时候,之前不是直接出报告吗?那么我们想要在这个获取报告的时候加入一个支付 解锁才能够获取报告的功能,应该怎么加呢?接下来我来跟大家说一说。主播用的是 c p, 首先我们要申请一下渠道,一般来说它需要一天的审核时间,并且在这里我们也可以看到对应的开发文档以及代码 demo, 这些是我们之后需要用到的,我们审核通过之后,这个 api 安全就能够测试我们的支付效果了。 那主要测下来当然是没有问题的啦,所以接下来我就下载 demo 的 node js 的 格式,以及把这个开发文档给它存下来, 这个时候我们就可以开始和我们的扣袋子对话了。我首先跟他说帮我看一下这个项目是不是已经实现了支付功能,然后扔给他一个已经实现支付功能的项目。接下来告诉他说,我要在我自己的这个网站里面也加上支付功能生成测评报告的时候,展示你已经打败了多少的人,详细的报告需要支付二点九九才能解锁。然后我提 供给他刚才我们看到的这个开发文档,还有对应的代码 demo, 也就是 note 版本的。刚才下载下来 demo 总结一下,除了我们想要实现的效果,我们要准备三样东西,第一是已经实现了支付功能的一个项目的案例,第二是这个支付平台的开发文档,第三是这个平台提供的代码,有了这三样东西就能够让他帮我干好活。 另外我还额外告诫了他一下,如果你要去调整 superbase 数据库,或者说呃部署到麦秀的话,就让他直接操作,这样就能够避免开发过程当中由于后端或者部署的时候遇到卡点扣带就停下来不动了。 其实他还是非常聪明且严谨的,他会在右边的这个内置浏览器里面自动的网页化操作,帮我们点点点去测试我们这个支付的流程究竟有没有真实的打通。 最后他说支付需求已经按照我们的技术架构接通了,并且他把线上部署和解锁流程都已经验证过了,这次目标已经完成了。 nice, 接下来我们在新的浏览器里面测试一下这个支付的跳转,我们可以看到他已经成功了,真的可以接通支付了。 然后我们在 com 浏览器里面再试一下,呃,会发现他就报错了。嗯,这个时候我觉得还是挺奇怪的,但是没有关系,我们可以把现象告诉 codex, 让他帮我们重新排查一下, 排查完之后我们直接按照他的方案修改就可以了。最后他完美给出了我们想要的效果,我们这个支付可算是打通了。 接下来扣带器又给了我们一些优化的建议,但是我现在暂时不优化,因为我对支付这个流程感觉还是一知半解,所以我让他帮我总结一下,一个网站要接通支付原理是什么,要打通什么环节。然后我是一个编程小白,请用大白话的方式告诉我技术原理,并且给我生成示意图。好,我们来看一下这个示意图, 就是在用户点击支付的时候,网站后端是会创建订单的,然后,嗯,平台才会生成支付的这个二维码,嗯,在用户完成支付的时候,嗯,平台支付又会回掉这个信息,嗯,到这个服务器,也就是后端这边,然后这个网站就能够解锁内容了。 大家有没有记得我之前和 codex 说,你可以直接去调用我的这个 superbase 或者 vasa? 之前的视频有说过, superbase 管的是后端 for sale, 它其实是把这个网站真正的上线,上线了之后它才能和支付平台去联动。 所以你看 codex 也是一个很好的学习工具,它可以图门并茂地帮我们把一些技术上的原理解释清楚。可完了这个硬骨头,我们就可以去推广我们的网站了。怎么样?是不是非常激动,跃跃欲试了? 只有当我们的产品真正推向市场的时候,才能验证它究竟有没有实际价值。这边流程跑下来,我们也对开发一个真正落地的商业化网站有经验、有概念了,那么在之后的视频当中,我也会继续学习和分享其他类型软件的开发和营收方式,例如小程序、 app、 网页插件,甚至我们也可以探索一下怎么在海外赚美刀。

八月份,社长最期待的一款 agent 终于要来了,没错,它就是 deepsea harness。 大家知道目前市面上最火的两款 agent 工具是什么吗? open ai 的 codex 和 anastropic 的 cloud code, 这两个工具直接让 open ai 和 anastropic 的 模型跟其他家形成了代差。 cloud code 的 年化收入已经来到了二十五亿美元,这个数字是什么概念呢?一个工具一年挣二十五亿美金,比很多公司的全年营收都高好多倍了。 社长,说实话,对于 cloud code 和 cortex 这两款工具真的是又爱又恨,爱在什么地方呢?确实是好东西啊,代码能力强, a 阵的调度流畅,写代码改 bug, 做项目效率提升了不止一个档次。用过的朋友都知道,一旦用上了,这 真的很爽,你就再也回不去了,对吧?那个代码生成的质量和速度确实服气。然而恨也是确实恨,梯子不稳定,动不动断联,账号注册门槛高的要命,支付方式各种折腾,价格还贵的很,你想好好写个代码,结果一半时间都在对付网络,对付账号,对付支付汇率,一换算, 每个月掏出去的钱真不少,抵押还跟坐过山车似的,安全漏洞一堆。关键它还针对我们国内 ip 地址,使用它,指不定哪天账号就被封了,用吧憋屈,不用吧,又确实离不开,就是这种被拿捏的感觉特难受。现在 deepsea harness 要出来了,国内直接就能用,网络稳,支付方便,价格还便宜,这个被拿捏的感觉 总算可以松一口气了。那么 deepsea harness 到底是什么呢?它是可以平替 codex 和 clockcode 的 智能体,可能很多人都好奇, 我们都有了大模型了,这智能体到底是干嘛的?大模型和 agent 到底有什么区别?社长给你打个比方你就明白了,大模型就像一个超级聪明的脑子,你问他什么问题,他都能给你答上来,但他只能动嘴动不了手。你跟他说帮我写个网站,他能给你洋洋洒洒写一堆代码,但代码怎么部署, 怎么运行,出了问题怎么调试,他就管不着了,你得自己复制粘贴,自己运行,自己改 bug。 agent 就 不一样了, agent 等于脑子加上手脚。 你跟他说帮我写个网站,他不光是生成代码,他自己能调用工具,能执行命令,能部署环境,能调试错误,遇到问题了还能自己想办法解决,直到把整个事情做完交付给你。说白了,大模型是想 a 阵的,是想完还能干。 harness 就是 dbisc 自研的 a 阵的工具,模型负责理解需求推理和生成方案。 harness 负责调度上下文工具任务状态,把模型能力放在真实环境里,完成从理解需求到交付代码的完整闭环。 harness 和模型手脑并用,配合起来才能真正把事情做成。那 harness 出来了之后, 用什么模型最适配呢?当然是自家的模型对吧?模型和工具本来就是一家人,配合起来肯定比外来的顺畅得多。所以你看,七月三十一日下午, deepsea 在 a p i 文档更新日期里低调地挂出了一则通知, v 四 flash 正式版上线公测。为什么说低调呢?因 因为连 a p p 和网页端都暂时体验不到,目前只开放 a p i, 但这件事本身一点都不低调。 deepsea v 四 flash 零七三幺,这个正式版总参数两千八百四十亿,激活参数一百三十亿,结构跟预览版保持一致。但重新做了后训练, a 阵的能力大幅增强。 tmi 奔驰二点一,得分八十二点七, stargame 得分七十六点七,智能体代码能力已经逼进了头部闭源模型的水平。他前脚刚发布 v 四 flash 正式版第二天就是八月一日, harness 团队负责人崔天意就在叉平台发布招募信息,面向全球征集内测用户。你说他们不是商量好了的, 反正社长不信。造物帖发出去之后,短时间内吸引了数十名全球开发者报名。八月十一日, deepsea harness 公众号完成注册,这是 deepsea 首次为 harness 单独设立官方发布阵地。所以你看,这摆明了就是模型先铺好底子, a 阵的紧接着跟上这个节奏。你们细品, 那对于我们普通用户来说意味着什么呢?最直接的好处就是,你不用再爬梯子去用 cloud code 或者 codex 了,国内直接就能用。而且 deepsea 的 调用成本大概是 esoteric 顶级模型的百分之一。社长自己算过一笔账,如果你是重度用户,一个月随便省下几千块钱是没问题的。 当然,社长也得提醒大家一句,八月六日, dbse 发了公告,计划整体上调 a p i 定价,所以想薅羊毛的朋友趁早,等价格真的涨上去了再后悔,那就来不及了。那么问题来了,线上 a p i 要什么电脑配置呢?不需要配置,你只需要能联网,有个浏览器就能用。 a p i 调用是云端跑的 算,立在 deepsea 那 边,你这边就是个终端,不管是台式机还是笔记本,只要能上网就行。说白了就是你用的设备只要能打开网页就足够用了。但如果你想要 talking 自由或者本地数据不出网的,那就要考虑开源本地部署方案了。 社长接下来就跟大家说说 v 四 flash 正式版本地部署这件事,能不能本地部署呢?能,但门槛真的不低, f p 十六精度的原始模型,光权重文件就要占大几百个 g, 翻译成人话就是 想跑满血版,你至少得有大几百 g 的 显存。所以社长这里推荐 f p 四 f p 八的混合版本。但即使是这样,模型权重本身的显存占用也要超过一百六十 g。 很多朋友看到这个数字可能就有点懵,别急,还是有办法的。方案一, mac 用户有福了,那个写 radis 的 大神 atryse 专门给 v 四 flash 写了个 d s 四, 就几千行 c 代码,一台一百二十八 g, 一, 一百二十八 g 统一内存的 m 四 max 就 能够得着 q 四 k m 版本一百六十一 g 就 需要一百九十二 g 以上的 mac 了。你看,不用几十万的专业服务器,一台 mac 就 能搞定,这个性价比是不是瞬间就上来了?不过 mac 方案只适合个人用户自己玩儿,没有做并发症,别想着拿它当团队服务器就行。 放二,桌面 ai 超算 d g x spark 英伟达的桌面 ai 超算一百二十八 g 统一内存版本可以直接跑满血版。 v 四 flash farmerwalk 那 台一百九十二 g 内存的主机也能跑,开箱就能用,不用自己折腾。硬件单台基本只够单人用,但两台 d g x spark 通过 r o c e 组网之后,三到四人并发还是可以的,但想要再大的并发数就是奢望了,毕竟它是内存当显存用的方案。 方案三,专业显卡方案 v 四 flash 的 f p 四加 f p 八混合版本模型权重约一百六十 g, 两张九十六 g 显卡合计一百九十二 g, 刚好够用。但它并发能力是三个方案里最强的,毕竟是专业卡, 拥堵量比前两个高不少,但成本不低,一张卡就十来万了,适合预算充足,对性能有更高要求的企业用户。那普通用户到底要不要折腾本地部署呢?社长给大家一个实在的建议,如果你就是写写文档,做做计划书,不涉及什么秘密,在线 a p i 就 挺好的,完全不需要折腾。如果你是企业,数据敏感,对安全有要求, 或者调用量特别大,用 api 不 划算,那本地部署就值得考虑了。如果你还没有明确需求,单纯好奇,完全没有必要配机器本地部署。如果你也有 ai 本地部署需求,不管是硬件配置搭配还是软件的部署调试开发,都可以来找社长聊聊。

今天呢,老林来给大家讲一个模型的部署实测,怎么回事呢?我有一台啊,五零六零 t 十六 g 的 主机,之前的主力模型呢,一直是千万三点六三十五 b a 三 b, 但是最近啊,要跑几个长任务, 这个三十五 b 的 m o e 嘛,总感觉差点意思,于是呢,就想试一试社区里挺火的那个 turnery bunsai 二十七 b, 据说啊,它部署占用不到八 g, 还能跑二五六 k 的 上下文,精度呢,也保持的很不错,这个不得好好研究研究吗? 先来简单介绍一下这个模型是什么?这个 ternary bonsai 二十七 b 啊,是 prisma ml 上个月刚刚发布的模型,机座呢是阿里的千万三点六二十七 b, 要知道这个三点六二十七 b 原本 q 四量化以后还要十七 g, 我 这台机器上跑不起来,延长了很长时间了。但是这一次啊, prisma ml 团队啊,用了一个叫三值量化的技术,它呢,把模型里面几乎所有的权重从十六位的负点数压成了三个值,负一零和一 整个模型两百七十亿个参数,每个参数呢,只用三个值来表示,再配上每一百二十八个权重啊,共享一个缩放因子。最终呢,五十四 g 的 全精度模型可以压到七点二 g b, 而且啊,根据他们官方的数据,三值量化后的模型在测试当中的成绩跟他们全金柱的模型啊相差无几,数学上的测试呢,几乎无损,而 j s n 八 k 甚至比全精度还高了一点。 但是光说不练假把式啊,赶紧下载下来试一试,刚开始就踩坑了,这个特瑞版的二比的权重啊,需要 prisma ml 的 拉玛 c p p fork 来跑,用主线拉玛 c p p 跑的话呢,扩大的后端啊,只能跑在 cpu 上,而社区流传的那个奥拉玛一句话部署的命令也没有用。 所以啊,还是得仔细看说明,根据官网的说明啊,可靠的部署路径啊,应该是这样,第一步,克隆 prism ml 的 拉玛 c p p fork, 里面呢包含了它的三值内核。第二部,翻译五零七的显卡啊,必须要指定 blackwell 架构的 sm 幺二零,否则呢,可能会报难以排查的一些错误。 第三步,下载权重,这次下载的呢,是它的二比特量化版。第四步就是启动好啦,模型跑起来啦,看一下实际的显存占用, 果然只有七币,这个呢,算是成功了一半。接下去测一下它的基础性能,先用工具跑了一下八 k 到六十四 k 的 输出啊,基本都在四十一到四十三 t 每秒,但是呢,一百二十八 k 和二百五十六 k 啊,就完全拉跨了,这还不如我的三十五币呢。 看了一下日制啊,就显存爆了,怎么办呢?压缩 k v k 去试试,其中参数里面加了 k v 电话,再测一百二十八 k 和二百五十六 k 的 输出啊,也能稳定在四十多 k 以上,非常好。这性能可以的,这里也得测呀, 那么官方的机准啊,用的是云端 to get ai 服务上的完整数据机。我在本地呢,没有办法一比一的复刻,但是可以用 mini 机跑一个量级的 sanity check, 跑,同样的题记,同样的指标,看看本地测试跟官方的数字啊,有多大的差距, 我呢,让他跑了六十道题的测试集,包含了数学代码和中文,结果成绩呢,数学二十五道题全对代码十二道题也全对中文呢,二十题对了十九题,推理代码和中文的能力几乎跟全精度基作失底。这个版本的二比特量化听起来挺吓人的, 但是测试成绩跟二十七 b 的 全精度啊,差距其实很小。到这里是不是觉得这个模型很神啊,别着急,他还是翻车了,翻在哪了呢?翻在了那道经典的洗车问题上, 他洋洋洒洒的给我分析了半天,最后告诉我还是要走着过去。虽然通过参数和提示式的微调啊,最后还是让他回答正确,但是这还是暴露出了这个模型的一个能力盲区,就是目的已经的理解, 他呢,能把题目分析的很漂亮,但是很容易把我要做什么当做一个普通的选项来权衡,忘了我要做的这件事情啊,本身就是目的是硬约束。再回看当时官方的测试数据啊,他的复杂指令遵循掉了九点五分,正好呢,也印证了这一点。来,我们总结一下 这个模型的优点呢,很明显,极致的压缩和系统的占用,让那些中小显存的显卡都可以轻松的驾驭, 而二百五十六 k 的 上下文加上四十头克每秒的输出啊,也可以满足绝大部分的需要,并且它的整体智力水平啊,在现在看下来至少保留了百分之九十以上。 缺点呢,就是它现在的环境兼容性一般。目前啊,只有伊比特版本已经合并进了主线的拉马 c p p, 它的三十版的扩大后端呢,还在审核中,目前啊,还必须用 fork。 再有就是它的复杂,多部指定的理解和执行能力啊,还是弱项,所以呢,它并不适合做生产级的多部一定的场景,或者呢是那些需要绝对高精度的场景。但是啊,对于我现在这种状况,目前还是比较满意的, 等我再用一段时间看看有什么新的发现再来跟大家分享。我是老林,关注我评论区聊聊吧。

部署 web 服务是不是一定要一堆复杂平台?先不用,我们用一个静态目录和 python 自带的 h t t p 服务,把前面学过的目录、进程、端口、 curl 和日制串成一条完整流程, 先创建站点目录 madeir p site public c d, 到它再放一个 index 点 html。 部署的第一原则是先准备清楚服务要暴露哪一份文件。 python 自带一个很适合本地实验的服务, python 三, mhtp server 八千,它会在当前目录启动一个进程监听八千端口把文件作为 http 响应,返回 命令,后面的语可以让它进入后台。用 jobs 或 psfc。 python 三,找到进程说明服务不是一个抽象按钮,而是一个正在运行的程序。实力 用 s s, l, t, n p grab 八千看端口是否监听。监听在幺二七点零点零点幺时只有本机能访问监听,在零点零点零点零时可能对更多网卡开放范围要看清楚。 core h t t p 冒号斜杠斜杠一二七点零点零点幺八千会把首页内容拿回来。收到 html 说明服务端口和路径至少打通了。 core i 可以 只看响应头和状态码 请求通常会在终端打印访问网址。你看到 get 二百,说明客户端请求到了,服务也返回成功,遇到四百零四就回到目录和文件名检查 服务。监听地址和端口是配置的一部分,开发环境可以直绑定本机,避免把实验服务暴露到局域网。准备对外开放前,先确认防火墙和访问范围, 把启动命令写成 start, 点 s h 就 能减少手工输入脚本里固定目录端口和解释器,运行前检查目录存在失败时给出明确提示, 实验结束要知道怎么停,先用 jobs 或 ps 找 pid, 再用 t o 发送正常的结束信号。确认端口消失后,说明进程已经退出。 这个小部署串起五件事,目录是内容,进程是服务,端口是入口, q r o 是 验证,预制是证据。每一步都能单独检查,所以不会靠猜。 现在创建一个 site, 目录,放入 index 点 html, 启动 pi, 放三 mhtp server 八千,再用 curl 和 sss 验证,最后安全停止进程。把你本机返回的状态码写在评论区。 linux 基础路线先到这里。

这两天这个 deepsea hunters 非常火啊,所以说我也对它比较感兴趣,我就试了一下, 咱先说一下我的感受吧,我感觉这个东西吧,它就相当于是一个可拆卸的积木啊,因为它官方说嘛,支持插件化的操作。那么相对于之前,比如说什么龙虾了, club code 了,它们可能就是一个 做好的一个汽车,然后给你了,但是这个东西呢,它可以改装啊,我觉得还挺有意思的啊,我一直用的是微信的那个智能体, 但是它只能说是我去跟它交互,然后去做二次开发比较困难。然后这个 d p c honda 四呢,它的安装呢也非常的简单 啊,就两条命令,通过 n p m 我 们就可以安装成功,然后启动它的时候呢就是 d s s web, 然后我们就可以在本地起一个幺二七零零零零一的一个 web 端,然后这边是我和他的聊天记录, 感觉他的操作还是非常好的啊,但是我觉得只在本地这样去跑,这样去用其实还是不太方便。我觉得更实用的方法呢,就是我把这个 dsp 它呢去装到服务器上去, 然后呢我通过微信,然后可以去控制这个 a 制程呢,帮我去干活,我觉得这个东西是非常有用的, 所以说接下来的话,我就把这个 dsp 格式呢就部署到了这个阿里云的服务器上去。但是如果这个时候我们采用这个 dss web 的 话,那这样的话是不可以的,因为它是一个本地的一个 web 端,所以需要借助他给的另外的一个命令,叫做 helllance 的 一个单任务的一个操作, 然后我使用的是企业微信,然后通过企业微信,然后接入这个机器人,大家可以看到现在的话,这是一个群啊,现在只有我和机器人。呃,比如说我艾特我的机器人,你看啊点这个 在你的工作目录帮我创建一个文件夹,叫张一一, 好发给他之后,然后呢他就会到我的服务器上的工作目录,然后去创建这个文件夹。好,这样的话就可以了,那么我们查看一下,我就不到服务器去查看,然后我们依然调用这个机器人, 帮我查看一下你工作目录上所有的文件和文件夹, 我直接发给他就可以了,包括我们可以让他去修改我们的部署的网站的源代码,然后让他重新帮我们去部署,这都是可以的,也就是说你这个服务器完全不需要登录了,完全可以通过这个机器人帮你搞定一切内容。 好,大家可以看到,对吧?这就是所有的东西还是比较强大的啊。 大家可以安装一个企业微信,然后添加一个智能机器人,然后把我们的这个 dsp 格式呢去接到我们这个机器人当中,然后你看我就可以通过企业微信,然后去向呃这个 a 政的去发命令,然后让他去帮我干活。 同时呢如果公司有很多人的话,可以建一个群,然后是有任务是有什么样的活,然后可以艾特这个机器人帮我们去干活。 不知道大家有没有去使用这个 deepsea hunters 呢?然后您在使用的过程中有哪些新奇的发现,还有或者是您遇到什么样的问题可以分享出来,我们一起交流交流。