mini max 只要六十秒就能生成五秒钟的视频,往下直接看成片。 turn the red light on we don't fade, we ignite。 今天我们做的是个底膜加 lola 的 对比,那么我的显卡是五零七零 t 十六 g, 那么今天我们对比的是六十六 g 的 满血模型,四十 g, 三十二 g 和二十 g 的 量化版模型,它们之间有什么区别?这是使用同一个工作流,同样的提词词,同一个种子五组进行对比,那么第一轮关闭所有 logo, 只开 s a g 加速,然后我们更换底膜, 看一下它的画质和生成时间有什么区别。那么现在我们开始看第一组真人的镜头用时的六分钟, 那么就是这个模型,那么四十 g 的 模型呢?他用时的四分钟,三十 g 的 模型用时两分三十秒,二十 g 的 模型用时两分零五秒,那么这个是题的词,现在我们来看成片的对比,下一站下车下车。 现在我们来看第一帧的照片,那么在四十 g 这个模型这里,他这个字到的鼻尖这里,那么其他的都是在眼角,跟我们的题词是一样的, 我们现在移动到远景,看一下它们脸会不会好一点, 到这个地方它们脸都是糊掉的,那么就可以确定不管你是多少 g 的 大模型,你在远景的时候脸还是会糊掉的。那么下一组我们测试 mv, 它伸展时间和上一组是一样的,那么使用的是这一组提示词,我们现在直接看对比, 那么现在我们很明显的可以看到四个模型深层出来人物是完全不一样的,大家可以根据自己的喜好去选择, 那么现在我们来看动漫组,它生存时间是有区别的,而且每个都不一样,我们就可以简单的理解为模型越大你生存时间就越长,那模型越小,你生存时间就越短,那么这个是视频的起字词,现在我们直接看对比, 那么经过这一轮四个模型的对比,我们看最后一个画面,它是有区别的,我们首先看一下这提示词,斩下了瞬间命中完成之后完成一个蓝白色的画面反转,那么在这个对比里面完成反转的只有六十 g 和三十 g, 那么四十 g 和二十 g 没有完成反转,那么大家可以自行选择使用。那么经过三轮对比,大家可以看得出来这几个模型它有什么区别了,那么现在我们在它的后面安装一个加速陀螺, 然后这些模型经过加速洛拉之后,它会有什么区别?那么这个洛拉我使用的这一个,然后强度是一,那么之前我跑的步数是二十步,现在我们改成八步,然后种子还是一样的, 提词提示词也是一样的,分辨率和时间也是一样的。那么现在我们来开始对比,在不同的模型里面使用同一个 logo, 它有什么区别?现在完成看一下, 在时间上它有很大的区别,全部缩短了一半,比如这个满血大模型,之前用六分钟,现在只用三分钟,柔量化版的二十级的小模型, 现在只用六十秒就能生成一个五秒钟的视频。那么现在我们来看一下加速过后的视频,它有什么区别?下一站下车,下车。 现在我们看第一帧的照片,那么在第一人这里特写镜头,我们和之前的对比一下,这个是加速之后的,那么这个是加速之前的, 那么两个区别还是很大的,从人物的光影和质感上看,两个差别是很大的,那么拉远景看一下,他这个脸还是一样会糊掉的,这是没有区别的。 下一组的视频已经生成完成,他跟上一组生成的时间区别是不大的,我们直接看对比, 我们现在可以很明显的看到底蒙在加载 luna 之后,它生成的人物几乎是一致的,可以这么说,所以大家可以根据自己的喜好去选择。现在我们来看最后一组对比,时间上的差距不是很大,直接上成片, 那么现在我们看到加 luna 之后,它生成的视频就相差不大了, 那么经过这几轮的测试可以得到一个结论,你底膜不同,你生成的视频是不一样的,但是加载加速罗马之后,你生成视频就差不多是一致的,所以大家可以根据自己的喜好去选择底膜。
粉丝2.7万获赞9.8万



十个小时,七十块钱做出了自己的第一部 ai 短片,发在红果上,目前收益五万三千。没有编剧经验,没有导演专业背景,这期就是一个新人真实制作记录汇报 全摊开给你看,因为今天我要说的东西,可能会让你接下来的三个月存款翻倍。 ai 漫剧现在已经不是 能不能做的问题了,而是谁先把流程跑通,因为一旦转载做起来,广告解锁和付费解锁都会给你强反馈, 很多人卡在第一步,没人讲步骤,没人说方法,更没人告诉你哪里会一脚踩空。今天我来结束这种状态。 ai 漫剧就是让你一集接一集刷到停不下来的动漫短剧,它的赚钱逻辑直接到残忍,观众只有两个选择,要么付钱解锁下一集, 要么看几秒广告让你赚分成。正是这几秒钟搭建了一个可以无限复制的收获模型。本期视频我将结合我自身的经验,教大家如何快速学会一个人制作 ai 漫剧到发布的全流程。看完这期视频, 哪怕是小白,也能利用视频中的免费 ai 软件,轻松制作出这样的影视大作。相关的制作流程、提示词和 ai 工具我都以文档的形式整理好了,感兴趣的六六六低调研究。 哈喽,大家好,这期视频我们一起来学习如何进行高清放大。那么首先我们来到熟悉的默认工作流,接着咱们先选择一个大模型吧,这边我就来一个动漫 promise 大 模型。 接下来边写一下正向题的词,咱们先输入质量词汇,也就是 master key 节奏,还有高分辨率 highlays。 接着边写内容主体, 我们就来一个 one girl 海边吧 b 区,然后女孩穿着泳衣,我们可以翻译一下泳衣, ok, 接下来我们就来写氛围词汇,那么安妮美大佬,好的,关于我们人物的脸部特征,他的发色这些我们就先不管,接下来 写一下负面词汇,那还是输入 easy negative, 咱们的老朋友这个词组包非常给力。编写好正负向提示词之后,就来到了 k 彩样系 那,这边我们先把总字值给固定一下,注意这个步骤是必要的,因为我们接下来的高清换道过程会需要锁定最开始的图像,接着把步数设置成二十五步, c f g 值为 六点五,然后彩样器 d p n 加价二 n 调度器 colors。 随后我们把 konstanton 的 宽高都设置成七六八, 也就是一张七六八乘七六八的正方形比例图片,咱们点击执行。好的,我们可以看到最终图像啊,已经生成出来了,但是有一点灰蒙蒙的是因为我们这个大模型的原装 ve 其实有点拉垮, 我们这边需要另外加载一个 anime ve 模型,那么就在 v 解码的 v 输入拖出来,选择一个 v loader, 然后在这儿加载咱们的 anime ve。 此时咱们再一次点击直行,可以看到图片的饱和度变高了。接着我们看到这张图像啊,放大看看,可以发现它的细节其实是 严重不足的,以及它的分辨率较低,七六八乘七六八嘛,那么我们为了克服这个问题,就要用到接下来的高清放大。咱们回到 k 彩阳系这边,在后边的 laten 输出,拖出个节点, 按住 shift 键搜索缩放 later, 我 们可以看到这边一共有两个选项,分别是按比例缩放 以及按尺寸缩放。那么按尺寸缩放就是把我们的原始图像比例给规定到某一个尺寸,这可能会导致图片的比例发生改变。咱们一般选择缩放类的,那么它是按照原图的尺寸一定的倍数进行缩放。我这边 把这个系数给设置乘二吧,相当于原来的分辨率乘二,也就是七 u 八乘二等于幺五三六嘛。接着我们把原来的 k 彩样器复制一份过来,那么我们先摁 ctrl c, 然后再点击空白处,摁 ctrl shift 加 v。 我 们可以看到啊,咱们成功复制了一个带连线的 k 彩样器,哎,这个就是 ctrl shift 加 v 的 作用,可以复制带连线的节点。 接着我们把刚才的 late 暗穴所缩放的 late 输出连接到 k 采阳器上吧,在那么这 k 采阳器我们也是二号 k 采阳器,咱们可以建立一个组别,先在界面的空白处右键一下,然后点击添加组,哎,我们在这边就可以编辑组的名字, 比方说依次放大。好的,我们接下来可以设置这个组的大小,咱们在这蓝色库框的右下角可以拖动它哎,来控制它所覆盖的范围, 而被它所覆盖的所有节点都会跟着它一同进行移动啊。同样的,我们也为最开始的这个基础生图流程建立一个组别吧,添加组,然后命名为 接触生图。 ok, 接下来我们就把刚才的节点都给覆盖了。随后为了让我们组与组之间更易于区分,我们可以右键这个组的任意位置,然后 看到编辑组,随后点击卡了,也就是颜色,我们可以在这去编辑组的颜色,哎,是吧,现在一个黄一个蓝,挺好看。然后我们在这个依次放大组,哎,怎么还没构建完呢?把 k 采样器的 lin 输出 添加一个 v a e 解码节点,然后这个 ve 模型我们连哪啊?那肯定就连这个无烟 e 解码器的 v a e 输出嘛。同样的连接在 vr 解码上之后,我们加载一个预览图像节点,来看看咱们的一次放大图片长啥样,对吧?那么此时我们的一次放大工作流就这么构建完了,点击执行。 哎,我们可以发现个事啊,咱们的生图怎么乱七八糟的呀,并且和我们的原图一点关系都没有,对吧?大家可以回想一下我们之前在图生图那节课所提到的降噪,那么我们此时啊降噪值为一代表什么呢?代表着我们的 linen 输入 其实和一张空 linen 没什么区别吗?因为降噪值为一,致使整张前空间图像全是噪声, 突然就和我们原图没有任何联系,所以我们这边需要把降噪值给设置成零点五, ok, 此时再次点击执行, 我们可以看到,对吧?现在在生成的过程中,咱们的与原来图像的轮廓就已经非常相似了,而后续的则是进行一些细节的填充以及清晰度的提高。好的很快图片也是成功生成了,我们一起来品鉴一下,好吧,把这两张图给放在一起 放大看,可以发现这张图添加了非常多的细节,清晰度也是得到了极大的提升,但是啊,我们仔细看可以发现一次放大这张图 里边有很多像这样的矩形块,比方说像海浪的这里以及泳池内的,这,这是因为什么呢?它其实和两个参数有关,咱们先把这张图给缩小,看到 laten 按系数缩放,那么首先第一个参数就是放大的倍数,我们知道啊,如果说像这张原始图像吧,哎,这张图像它放大的倍数越高,那么它所传入这个 k 采阳器的 laten 图像也就越模糊, 咱们可以实践一下,这边我们把降噪值设置为零,就相当于直接输出 这张图像的放大之后的前空间图像吧,因为降噪只为零,不会添加任何噪声。 ok, 咱们点击执行,我们可以看到刚才 k 采暖器这边是不是压根就没动,然后预览图像这边也是出现了 他经过二倍放大之后的未经降噪图像,就长这个样子,里边其实是有很多矩形块的,对吧?咱们仔细看可以发现,原来这些丝滑的线条 都变成了锯齿状,那么如果说我们继续把这个放大系数给调高,比方说四倍吧,咱们来看一下, ok, 我 们可以看到现在这些矩形块是不是变得更加明显了,简直变成了一张像素风的话,大家可以想一想,如果说让我给这张图像 进行降噪,并且把降噪值调成像刚才的零点五,带来了什么结果呢? 会保留很多原先的这些矩形块的特征,对吧?那么想要缓解这一点,我们就只能去提高降噪值,让 ai 改变的幅度变大一些。好,我们这边还是同样做个例子,把系数给调成二,也就是调回去嘛,然后把降噪值我们设置为零点五五, ok, 咱们再次跑一下,看一下此时还会不会有像咱们第一次做高清放大时的那些矩形块。 ok, 现在我们可以看到,降噪值提高了之后, ai 确实发挥空间变大了 吗?而此时这张图像的那些非常明显的像素快就这么消失了。但是这其实是第一种方法,而这种方法带来的副作用很明显,我们的降噪值提高了,就和原图的特征 越来越远了,对吧?我们可以来对比一下他和我们原图,而我们还有第二种方法,什么方法呢?就是改变我们像素快的大小嘛,那比方说我们现在把这个系数给调成一点五, 把降噪值设置成零,咱们来看一下。那么此时啊,这些像素快其实模糊化还没这么严重,代表着什么?有什么意义呢?代表着我们不需要像零点五五这么高的降噪程度,比方说调个零点五就能够让它 非常丝滑的完成高清放大,因为我们的原始传入图像不像特别模糊吗?好,此时我们再把这降噪值给调成零点五,我们来看一下怎么样啊?现在是不是同样消除了那些非常明显的像素快。而这种方法 优点当然就是更能够保留我们原图的特征,因为我们知道降噪值越低,往往也会和原图越相近。但试用方法也是有缺点的, 也就是图片的尺寸没这么大,因为我们设置的放大倍数是一点五,相当于啥呢?相当于咱们原始图像的尺寸成个一点五倍,那肯定是不如成两倍大的,细节方面可能也就没有系数为二的时候多,但是我们还是可以用其他方法来弥补。什么方法呢?那么就是 我们接下来要讲的二次放大,没错哈,咱们还要二次放大,双击空白处搜索 sd upscale, 咱们看到第一个奥特曼 s d upscale, 中文翻译就是 s d 放大,这个节点就是我们进行二次放大的关键节点了,咱们先为它新建一个组别吧,摁右键点击添加组,然后把这个组的名字命名为 二次放大,随后先给他设置一个组别的范围,然后调整一下组的颜色吧,让咱们工作流看起来好看一些。 我们回到 s d 放大节点,可以看到它有非常多的输入,但它输出只有一个,对吧?而这些输入该怎么连呢?那么必然我们的图像就要连接着我们依次放大后的图像输出嘛,模型的话我们还是连回去,连接到哪呢?那就是我们的是空模型, 但是大家可以发现啊,其实这个丘克耐契在这,把我们的模型输入在这,是不是隔老远了, 拖过去很不方便对吧?哎,这边我们来介绍一个转接点,咱们看看。把模型拖出来之后,松开手可以看到有这个 reword, 中文翻译是转接点的意思, 那么这个节点就相当于我们这个模型输出的代理,就像个中转站一样嘛,它的作用就是让我们整个工作流看起来更整洁,并且也能方便我们进行连线嘛。 咱把这个转接点给拖过去,来,我们拖过来,随后把转接点和模型输入相连, 那同样的我们正负面条件也可以用同样的方法,那么就是把这个条件给添加一个转接点,当然这转接点其实还有个快捷方式,就是我们在这个条件输出这边啊,摁一下鼠标中间又可以看到,哎,自动添加了一个转接点,那么下边这个也一样。好,我们接下来把这个转接点 给拖过来之后再与正负面条键相连,注意不要连错。之后的 ve 我 们也用类似的方法,在一下鼠标中间,接着把转接点给拖过来。好的,那么以上啊, 我们基本连完了,接着咱们看到放大模型,那么这个我们要新增个节点,叫做放大模型加载器,然后我们在放大模型名称这边点开来,可以发现也是有很多种类,对吧?比方说有放大四倍的,放大八倍的,还有放大两倍的 以及放大三倍的,大家可以根据自己的需求来进行选择,我这边的话就选一个放大四倍吧。接下来我们在图像输出加载一个预览图像节点,这么一来我们就完成了整一个二次放大工作流的搭建,咱们点击执行,我们可以看到这个 sd 放大的工作原理, 哎,其实非常明显,就是它会分快进行放大,因为如果说我们用 sd 一 点五的模型或者说其他模型吧 进行直接放大的话,效果会非常糟糕,因为咱们体膜并没有一次性直接生成四 k 图像的能力嘛,所以说,哎,作者就用非常奇妙的方法进行分块放大,来把一个大任务分成非常多的小任务,就好像咱们 gpu 的 运行原理一样,这么一来完成了我们最终的放大过程, 咱们一起来看一下吧。这个是进行过二次放大之后,图片我们再把它和原始图像进行一个对比, 咱们可以看到这张图像是不是整体的质感,图片的质量提升了 n 个档次,对吧?无论是细节还是图片的明部、暗部都得到了非常大的提升,比方说我们可以看到像他这个胸部上边的阴影,哎,这边只是非常潦草的 勾勒了一下,而咱们到二次放大之后,我们可以看到啊,它还显现出了头发的阴影,对吧?那么这些都是细节的体现,但是我们同时也能发现放大的过程中会造成 图片内容的变化,那比方说像这边泳池旁边的,哎,这个像是一个 毛巾一样的玩意,在咱们最终放大之后还变成了流水,对吧?那这些都是放大过程中可能会造成的变化,所以我们就需要去抽卡,以达成我们最终想要的目标。好的,我们现在来概览一下目前已学的二次放大。 那首先我们依次放大用到的就是这个 latin 按系数缩放,把我们的 latin 图像扩大了一点五倍嘛, 同时把降噪程度设置为零点五到零点六之间,以确保和我们的原图特征相似。之后我们再用 s d 放大来完成我们的二次放大过程。而咱们的 s d 放大它的方法就是分块进行,比方说把我们一张 可能是四 k 的 图像分成非常多的五幺二乘五幺二的小像素,快来一个一个的进行放大啊。之后其实啊我们还有三次放大,叫做使用模型放大,我们搜索节点,使用 模型放大图像,选择该节点,那么这个节点也是非常容易,并且它的处理速度也是比较快的,它就是较为简单暴力的把我们的原图给放大两倍,三倍甚至四倍, 放大的过程中不会用到像之前的降噪类似的方法。好,我们一起来看一下吧。先把这个图像给连接在二次放大的图像输出上,同时加载一个放大模型拖出来选择放大模型加载器这边我们也是保持默认即 可,随后拖出一个图像预览节点,这么一来我们的三次放大就构建完成了,我们先给他构建一个组别吧。好的,现在我们把这一个相关参数,也就是种子值给调成固定, 不然的话每跑一次都会把之前的放大流程给执行一遍,这样其实挺费时间的。同样的,我们的 s d 放大运行后,操作也是设置为固定。 ok, 咱们点击执行。好的,我们的最终图像也是成功生成了,我们可以一起来把它和我们的二次放大来做个对比。 我们现在不断的放大,可以发现这张图片的像素是非常夸张的,已经放的这么大了,但是还是没有看见那种模糊的像素快,而我们此时再看看咱们的二次放大图片,也是同样的位置, 咱们不断放大,哎,有没有感觉到这边明显比刚才的模糊,那么这就是我们三次放大带来的变化,不过这张图片的大小也是非常夸张的,通常都会达到几十 m, ok, 那 么以上啊,就是我们 三次放大的工作流,那么想要这套工作流的小伙伴可以在评论区内领取。最后我们对比一下原始图像和三次放大图像 之间的差距吧,我们可以看到那么经过了三次放大之后,图片的像素甚至有点过高了,而优化程度高的有点让人觉得不舒服,比方说我们可以看到这些线条 其实都是比较锐利的,所以我个人平常一般用二次放大即可,三次放大就有点过了,并且图片尺寸太大不太方便使用。好的,那么以上就是关于本期的三次放大全流程, 我们下期一起来学习能够控制图像的 ctrl 类吧,咱们就下期再见!拜拜!

siftensys 模型科普你可能听过 ckpt pt 模型格式,但现在 ai 圈更火的是 siftensys, 它到底是什么?为什么能取代老格式?首先明确, siftensys 是 二零二二年由 parkinface 团队推出的模型文件格式,专门为机器学习模型存储设计核心,解决老格式的安全和效率问题。对比传统的 pico, ckpt pt 格式, 第一个核心优势是安全。 pq 格式加载时可能执行恶意代码,而 safenirs 只读取张量数据,完全杜绝代码执行风险,这也是它名字里 safe 的 由来。第二个优势是速度快。 safenirs 采用内存映设技术, 加载大模型时不用把整个文件读入内存,加载速度能提升百分之三十以上,尤其适合 g b 级的大模型。第三个优势是跨平台兼容,它能在 p f c 加加 rust 等多语言环境下使用,还支持 cpu、 gpu 快 速加载, 适配各类训练和推理场景。现在主流 ai 框架,如 p f t u s, 不 管是 stable diffusion 绘图模型, 还是 l r m 大 模型,越来越多开发者选择用它存储模型。简单说, systems 就是 更安全、更快、更通用的模型存储格式,也是目前 ai 模型部署和分享的首选格式。

今天我们要聊的呢,是一种最近特别火的技术啊,它叫 lowra 啊,它能够让普通人也可以 用很低的成本去微调一个大型的 ai 模型,嗯,从而让这个 ai 学会特定的画风或者是特定的对象。没错没错,这个技术最近真的是在创意领域掀起了一阵风暴,那我们就直接开始吧。好的,咱们先说说第一个话题,就是这个算力鸿沟, 为什么像 dell 一 二这种模型,它可以画出各种各样非常神奇的东西,但是它偏偏就很难 去把一个普通人的脸画的很像呢?这其实跟模型的训练方式有关,就是这些大型的 ai, 它里面虽然装了上千亿的参数,嗯,可以说它是见过非常非常多东西的,但是你想要让它去专门记住一个新的东西,比如说你的脸,那它就得通过一个叫做全量微调的过程 哦,所以就是说普通人想要让 ai 记住自己的脸,其实是要花很多钱的,是吗?对,就是这样,这个全量微调它是需要非常非常强大的显卡集群,嗯,然后可能要花上数万美元, 所以这个门槛对于绝大多数的创作者来说都是根本就够不到的。明白了,然后我们要聊的就是这个 o r i 的 原理了,这个东西到底是怎么用一个物理隐喻就把它讲明白了。其实可以把这个冻结的基础大模型想象成是一个非常非常大的聚光灯, 它已经照出了一个很大的范围,然后这个时候你想要去改变它的颜色,那你不需要去动这个聚光灯本身,你只需要在它前面加一张很薄的彩色玻璃纸, 这个彩色玻璃纸就是 o r a 模块啊,所以说这个 l r a 模块就相当于是给这个 ai 加了一层很薄的彩色玻璃纸,是吗?没错没错,而且更妙的是,你可以把这个育训代模型想象成是一本百科全书, 它包含了全人类的常识。嗯,然后这个时候你想要让他记住一些个性化的东西,你不需要去改写这个百科全书,你只需要贴一张便利贴在上面就可以了。 ok, 然后这张便利贴你可以随时贴上,随时撕下, 就相当于这个随时可以定制化的记忆。哦,那从技术角度来说的话, l o r 到底是怎么做到的?他到底是怎么能够让这个模型在微挑的时候,只需要训练极少的参数就可以达到一个很好的效果呢?他的做法其实特别直接,就是他把这个 原始的大模型所有的权重都给冻结了。 ok, 就是 他的这个通用的知识已经被固化在里面了。然后他另外又加了一条旁路, 这条旁路呢,就是两个非常非常小的降维矩阵,所以说真正需要去训练的就只是这两个小矩阵,是吗?是的是的,因为这两个降维矩阵它的参数量可能只有原来的百分之零点几。嗯,所以你就可以在很低的算力下很快的去完成这个训练, 然后这个整个的公式就会变成新的输出,等于 x 乘以 w base, 再加上 x 乘以 b x a 再乘以一个缩放因子 a。 哎,那我们接着要说的就是这个算力经济学啊,为什么 工业界会这么快的就导向了这个 low rv, 嗯,是吧?它到底在这个训练参数的比例上,显存的使用上、成本上和这个模型的大小上带来了哪些突破?就是如果我们去对比 传统的全量微调和 lra 以及最新的 qra, 嗯,你会发现全量微调它是要动百分之百的参数的, 那 lra 可能只需要调百分之零点一到百分之十之间。对,然后 qra 就 更少了,它是小于百分之零点,一听起来就是参数数量,这一下子就下来了,对,那对硬件的要求是不是也跟着大幅下降了?完全没错,就是全量微调,你可能要 顶级的八卡集群。嗯哼,然后 lora 你 有一张十六个 g 显存的显卡就可以跑了。 q, lora 连家用的八 g 显卡都可以,然后训练一次的成本原来可能要五千美元, 现在 lora 可能只要五十美元, q o r 甚至只要十美元。然后模型文件的大小也是从十多个 g 变成了最大一百五十兆。 对,最小可以到五十兆以下。我的天呐,这个差距真的太惊人了。对啊,最最妙的是这个 lra 产生的这个 safe tens 文件,它小到你可以几乎就是实时的去把它加载和卸载。 嗯,所以就说你可以在不同的风格之间一秒钟切换,就像你在插拔 u 盘一样,这也太方便了吧。然后我很好奇,画风截驰就是这个东西,到底是怎么通过调整这个 low 啊的权重就可以让画面的风格发生这么颠覆性的变化呢?它的做法就是通过调整这个权重, 他可以把比如说柔和的曲线和很浓郁的油彩,嗯,给他注入到你的画面当中,然后让你的这个物理的自然光的这种慢反射效果都可以被重新塑造。对,那如果说你把这个权重推到另一个阶段的话,你还可以强行的截断这种自然光, 然后让你的画面充满这种高反差和很深的阴影,就像一种视觉上的暴症一样。原来是这样,那我想问问实战秘籍一,就是用五十张照片召唤数字分身,嗯,这个 数字分身的训练数据到底有什么讲究?其实这里面的核心就是你不需要很多照片,但是你这些照片一定要有很多变化。嗯,就是各种极端的光照,各种角度,各种衣服,然后各种背景, 你要让他看到你在不同的情况下的样子。对,这样的话他才不会把你跟某一种环境私自的绑定在一起。 ok, 那 这个认知失调达标又是怎么回事?这个就是你要给他一个词典里面都没有的一个生僻词,然后让这个 ai 把这个词和你的脸强行的绑定在一起。 ok, 这样的话他就会非常专注的去学习你这个面部的独特的几何细节, 最后就会生成一个完全专属的矩阵。明白了,那在训练这个数字分身的时候,怎么去设置这个学习率维度和训练部署这些超参数,才能让你的这个结果既精准又不会过你和呢?这些超参数其实每一个都很关键,就学习率如果太小的话, 他根本就记不住你的脸,嗯,如果太大的话,他就会把你的脸扭曲的非常严重,甚至崩溃掉。 然后维度这个东西你要设定的刚好可以捕捉到你这个面部的肌肉和骨相的这些细节。嗯,然后训练步数也很讲究,你不能说一味的去增加训练步数,因为有可能你就会出现这种灾难性的逃亡, 就是他会把之前学的东西都忘了,所以说就是训练并不是越久越好。对,超参数的选择真的是一个平衡的艺术。没错没错,而且最有表现力的那个模型往往是在比如说一千二百五十步的时候, 就中间的某一个状态。嗯,你要通过这个 save every 这个选项去多保存几个中间的模型, 然后你可以最后再去对比挑选。对,而且特别要注意的就是这个入侵者维度就这个东西,你如果开的太高的话,也会让你的结果变得很奇怪。了解了,那就是说这个只有一百兆左右的这个 l o n 插件, 它到底是怎么帮助这个数字分身能够在不同的场景,不同的分镜之间瞬间切换呢? 其实你只要把这个插件挂载到你的这个生成器的节点上面,嗯,然后你用自然语言去描述你想要的场景,比如说高管会议,或者说巴黎午后,或者说赛博基尼, ok, 然后他就会在去造收敛的这十几秒的时间内, 就可以让你的分身出现在你想要的任何好莱坞级别的风景当中。哎,那我们最后要聊的这个主题就是 loir, 它不仅仅是一个技术上的突破,它其实更是一种观念上的平权的革命。嗯,对吧?为什么说它会让这个创作的门槛儿发生这么大的变化,因为 以前你想要去做这种个性化的 ai 创作,你必须要去买很贵的显卡,然后你要去掌握很复杂的技术。嗯,但是现在有了这个 low 二 a, 你 只要有几个这种降维矩阵, 你就可以打破这个算力的壁垒。所以说现在每个人都可以用自己的想象力去驱动这个内容的创作。嗯,而不是说被你有没有钱去买显卡这件事情所限制住了。对,所以今天我们从这个 low 二的原理讲到了它的实战的技巧,然后又讲到了它对于整个创意领域的革命性的影响。嗯,对吧,我们会发现其实现在每个人都有机会用自己的想象力去撬动这种 ai 级别的创作。好了,那么今天的内容咱们就到这里了啊,感谢大家的收听,我们下期再见。拜拜。

seat attention 来自 comfy ui 官方推荐的 mini max seat 三加速方式,今天先用四零八零 s 实测下加速效果到底如何? 先回顾下之前四零八零 s 未加速前实测的速度,记住它,接下来保证同样的模型总大小三十九点五 gb。 请注意, 这里用的模型都是官方工作流默认模型,不是市面上其他为了单纯提高速度过度量化而损失精度的模型。此次版本更新到零点三五点零后,出现了 lower 八步加速节点, 因此又增加了一点八二 gb 的 lora 模型文件。首先单独测试开启 lora 八步加速后的生成速度,生成参数百万像素零点四,倍数三十二,时长五秒。 相比之前可以明显地看出速度已经大幅度的提升,从幺四九秒缩短至七十一秒,生成速度提升了约百分之一百三十。试试幺零八零 p, 速度 调整百万像素到二点零,其他参数保持不变, 从三幺八六秒缩短至一千两百三十九秒。接下来 测试在娃娃八步的基础上,在叠加 c 着 tension 加速后的生成速度,生成参数,百万像素零点四,倍数三十二,时长五秒, 从七十一秒缩短至五十秒,生成速度又提升了约百分之三十。再试试幺零八零 p, 速度调整百万像素到二点零,其他参数保持不变, 从幺二三九秒缩短至四百六十五秒,生成速度又提升了约百分之一百六十六。至于生成质量与未加速前没什么差距, 因为它不是通过降低模型精度换速度。安装方式已更新至主页,下期我将更新它在五零系下加速的具体情况,点点关注,下期见。

还是老配置,你以为 p 幺零六只能做这样的图?不,这只是 sd 一 点五的上线, p 幺零六还能做这样的图或者更高清的图。 下面是以上图片制作的过程, 接下来老规矩给各位看官展示下才艺。

大家好,今天介绍 minimax 三新出的真四部大模型, minimax h three fused riff delta, one thousand and twenty four turbo eight mystic seven and eight convert safenvers。 和以前的四部 laura 选择八部彩样不同,这次是真四部 laura, 画质媲美八部 laura, 速度却快很多。 经本人多次四部加四部二彩测试后,额外添加 minimax h3 mf sage patch 节点和 t speed minimax h 三节点后生成时间还能缩短百分之二十,画质基本无损。 连接熊猫怪兽大佬开发的导演台后能实现同时多段挂机生成慢剧视频,还有分析导入资产库,自动添加对应名字的参考图等功能。 选择二彩七三六 x 一 三一二分辨率出视频后可以在导演台直接二倍超分到二 k 视频。所需模型和节点包连接已经放入群公告栏,请自行查阅。

safe tensors 是一种新的序列化格式,由 hugging face 开发,旨在简化和精简存储和加载大型复杂张亮的过程。在深度学习中,张亮是主要的数据结构, 其大小对于效率来说是一个挑战。 safe tensors 通过使用高效的序列化和压缩算法来减小大型张量的大小,使其比 pico 等其他序列化格式更快,更高效。 与传统的拍 torch 序列化格式 peter model 并和 model safe tensors 相比, safe tensors 在 cpu 上的速度快七十六点六倍,在 gpu 上的速度快两倍。 具体的速度比较可以参考速度比较页面, https, talking face coduct safe tensors speed safe tensors https 冒号 斜杠斜杠, h u g g i n g f a c 一点 c o 斜杠, d o c s 斜杠, s i f e t e n s o r s 斜杠, i n d x 使用 safe tensors 的好处易用性 safe tensors 具有简单直观的 a p i。 可以在拍放中轻松序列化和反序列化张亮。这意味着开发人员可以专注于构建深度学习模型,而不需要花费太多时间在序列化和反序列化上。 跨平台兼容性,可以使用拍葬进行序列化,并且可以方便的在各种编程语言和平台如 c 加加 java 和 javascript 中加载生成的文件。这使得在不同的编程环境中无缝共享模型成为可能。速度, safe tenses 经过优化,可以高效地处理大型张亮的序列化和反序列化 化,因此它是使用大型语言模型的应用程序的理想选择。大小优化 safety answers 使用了有效的序列化和压缩算法以减小大型张量的大小。与其他序列化格式如 pickle 相比, 它具有更快,更高效的性能安全性。为了防止序列化,张亮在存储或传输过程中损坏, safe tensors 使用了教验和机制,这确保了存储在 safe tensors 中的所有数据的准确性和可靠性,并且可以防止 dos 攻击。 懒性加载。在使用多个节点或 gpu 的分布式环境中工作时,使加载模型的部分张亮非常有帮助。使用 safe tenses 格式 room 在八个 gpu 上加载模型仅需要四十五秒, 而普通的拍 torch 权重加载则需要十分钟开始使用 safe tensors。 在本节中,我们将介绍 safe tensors 的 api 以及如何保存和加载张亮文件。可以使用 people 来安装 safe tensors。 本文将使用 torch 共享张亮中的势力来构建一个简单的神经网络,并使用拍 torch 的 safe tensors torch api 来保存模型。正如您所看到的,已经成功地创建了模型。 现在,我们可以通过提供模型对象和文件名来保存模型。然后我们可以将保存的文件加载回使用 n 猫主创建的模型对象中。在第二个事例中,我们将尝试保存使用 torch zeros 创建的张亮。为此,我们将使用 safi 函数。要加在张 样,我们将使用 low file 函数。 safe tensors 的 api 适用于 pi, torch tenso, flow, pedal, pedal flex 和 nam pi。 您可以通过阅读 safe tenses 的文档来了解更多详情。结论,总而言之, safe tenses 是一种用于存储深度学习应用中使用的大型张亮的新方法。与其他技术相比, 它具有更快、更高效和用户友好的特点。此外,他还确保了数据的保密性和安全性,并支持各种编程语言和平台。通过使用 safe tensors, 机器学习工程师可以优化时间,专注于开发更出色的模型。 强烈推荐在项目中使用 safe tensors。 许多顶级人工智能公司,如 hogging face, illusory 和 stable attack 都在他们的项目中使用 safe tensors。 推荐书单面向移动设备的深度学习基于 tensor, flow, light, mlk 和 flutter。 本书详细阐述了与移动设备深度学习开发相关的基本解决方案,主要包括使用设备内置模型执行人脸检测、 开发智能聊天机器人识别植物物种、生成实时字幕、构建人工智能认证系统、使用 ai 生成音乐、基于强化神经网络的国际象棋引擎构建超分辨率图像应用程序等内容。 此外,本书还提供了相应的视力代码,以帮助读者进一步理解相关方案的实现过程。本书适合作为高等院校计算机及相关专业的教材和教学参考书,也可作为相关开发人员的自学用书和参考手册。

老朋友泡泡茶,今天我们来聊一个很多 ai 号者都会遇到的一个问题,面对大模型,五花八门的格式很多,比如说 g g u f g p t q a w q 等,我们到底该怎么选?这节课我们将用最通俗的方式把这些格式的来龙去脉,用途,选择方法一次性讲清楚,告别选择困难症。 首先我们经常用的 g g u f 可能很多都没听过,但是常见的都是 p t 的 b p t 啊, self tensers 等。还有另外一种显卡优化与加速这几种格式,这种用的也更少见。第三是步数与定制, o n n x 这个用的还可以, ten c r t nova。 嗯,然后第四次极简的选型口诀,我们先了解一下这些格式都是什么意思。 g g u f 本地运行的通用标准,简单来说呢,它就是在个人电脑上跑 ai 大 模型的通用标准格式。 上一次我下载模型的时候,我发现我想在本地跑,但是又没有 gpu, 然后,所以说呢, gguf 这种格式呢,就是本地部署大模型的最好的选择, 它的前身呢是 ggml, 这个了解一下就行了。 gg gt 现在统一就是 gguf 这种格式,它能干嘛呢?专属为电脑本地 cpu 和显卡运行的。嗯,模型格式 谁在用呢?我们经常用的这样的一个框架和 lm studio 叉 gpt、 本地客户端等主流工具, 它能直接跑吗?能,它下载之后呢就可以运行,因为我们本地没有 gpu, 我 们大部分电脑都是 cpu 的, 所以说就要选择这样的格式来运行。它的核心特点是体积小,加载速度快, 不崩溃,兼容性打满它的后缀呢,必须得选 g g u f 这种格式的。 嗯,那我们训练大模型的 pose 的 原声格式呢?就是开发者的原声格式呢?它基本上就是,它是什么样子的呢?它理解是模型原始的权重文件,它是大厂训练完直接保存的原声的。呃, 就是原生的模型文件。核心存储的权重可以用来干啥呢?用于二次微调,修改模型的结构、算法创新等深度开发场景。实在用呢,核心是算法工程师。嗯,模型的研究者和开发者。 然后还有一种格式叫啊,就是上面一种格式呢,一般保存的是点, p, t 等。然后。然后另外一种格式呢?我们常在它跟 face 上看到的格式呢,就是 self translucent 安全版本的原生权重 点并那格式的安全升级版本。它是什么呢?它的功能和点并格式呃,完全一致,但是必归呢?安全风险更更安全,更可靠。 它干啥用呢?是用于模型的二尺微调推理部署与开发,是模型训练的标准产物。谁在用呢?在这个 hack and fish 的 开开源社区里面,以及所有的关注模型的安全的开发者 能不能直接跑呢?不能直接双击运行,需要通过代码加载后才能运行。它的核心优势呢,无恶意代码注入风险,加载速度快,且多种语言可以支持。 一句话总结,专为开发者打造的安全版本的原生模型权重,消除安全隐患,安心微调。

哈喽,大家好,今天分享 app 系列的第四个作品,也就是德州扑克,这个 app 和普通的德普的 app 有 什么区别?就是这个 app 我 们是大模型驱动的,今天要分享的是 jeff 这个模型, jeff 这个模型是 昨天 reese 的 一个新的模型,那这个模型它非常的离谱,它离谱的 地方在于它非常的便宜。我们在 open router 上我们可以看到就是 jeff 它这个模型,我们可以看到这个模型它的 input 是 零点零四二的 per million token, 它的 output 是 zero, 也就是说它只用输入,它的输出是不花钱的,而且这个也很离谱。我们和价格屠夫 deepsea 一 对比,我们就大概能够看出来,你看它的是零点七 per million, 它的 output 是 二点九六 per million。 然后你和这个 jeff 对 比,是不是就是离谱?就它足够的便宜,它为什么能够做到这么便宜?比如说我们放到了我们的德普里, 那它是否能够很好的工作?可以来看一下。我们两个不一样的,就是 jeff 这个模模型,它和之前的像 jeff, open ui 它们这些大模型,它们都是生成器, 它们都是一个一个的去输入文字,它是去输出文本的。那 jeff 它其实是输出有合适的 jason 的 对象,它每一个都有相对应的概率, 所以你其实不能用它来进行聊天的。比如说我们在传统的 gemini, 如果我想让 gemini 去做一些德普的决策,首先我 得要先给他定义你是一个 gto 的 poker expert, 然后呢,我要把他的 call strategies, 大 概你的 饭前的范围给他,写给他什么时候你该做什么事情?如果你在 hijack 位,然后你看到了什么样的牌,你应该做什么样的操作?我把他的 return 的 格式, 一个 action amount reasoning 给它规定下来,然后上下文,比如说你现在多少钱,之前的你的这个牌局上面的 history, 比如说到谁了?饭前啊?饭后, 我到核底,大家都做了些什么操作?你要把这样的记录给到大模型,你让他去返回他接下来要做的操作,那那 jeff 他 就不是一样的了。 jeff 你 发送的时候,你是以一个 jason 格式去发送的, 你要比如说这里我们发送了这个是我们本地去计算的一些 equity, 一些确定的数值,这个是我们的 hand history, 然后 question, 然后最后它的这个 criteria, 我 要需要返回的就是这三个值,那它就只会返回这三个值。 比如说 size, 它只会返回这几个值,那我们看 gemini, 它返回的东西就是一个 action, 或者比如说它要加注,它有它的 reasoning, 如果你要加注它,还有你要加注的范围, raise amount, 那 看 jf 的 返回,它其实返回了上面每一个情,每一个情况的一个概率。 比如说我们这个 call 它的概率是多少? fold 概率是多少? raise 的 概率是多少?包括我们在加注的时候,它选择了半持加 half pot, 那 它的概率是多少?它的 confidence 是 多少? 你会发现就是 jeff 这个模型,它在返回的时候,它是返回了已给定的选项当中的概率, 就是他会选择这个概率最高的去返回。也就是说他是 safe, 也就是这家公司 type safe, 他 为什么起这个名字的? 他觉得 ai 其实是应该是一个工具,而不是去代替人思考的,所以他更倾向于把 ai 作为一个节点,他去做一些判断,根据你给他的选择,他去判断我应该选 abc, 而不是自己。啊。 come up with a new idea, a new choice 就是 这个模型。它之所以它那么特别的原因, 那在我们的这个场景里面,我们去做德普的时候,我们可以让它在一个 gto 的 框架里去做一些决定啊, 我觉得是 make sense 的。 ok。 那 我们也可以和其他的大模型去 pk 一下,看看这个 jeff 它怎么样。那其实它的能力和现在的 club 和 gbt 还是会有区别的, 但是因为它以足够的便宜,所以,呃,还要什么自行车?它的的这个水平基本上赶到了 gemini, 所以, 而且是基本上它的 cost 是 gemini 的 one hundred 一 百分之一的这个 cost, 所以 这对这样的一个 app 来说的话就非常有意义了。好,今天就分享到这里,拜拜。

债务 ai 这个决策模型是如何工作的?如果你问 ai 一个问题,这只股票是会上涨还是下跌,那普通 ai 会给你写一大片文章进行分析,而债务 ai 则直接给你返回一个概率结果,告诉你他分析出来的上涨和下跌的概率分别是多少。 我们在开车的时候,遇到红灯会本能的踩刹车,而不是先写一篇三百字的文案来分析为什么要踩刹车。 但现在的 ai 大 模型在处理这类选 a 还是选 b 的 决策性问题的时候,都要耗费大量的时间和 tocan 去长篇大论。而这个 ai 做的是快速思考和决策,他彻底放弃了文字聊天能力, 而是快速的给出确定性的判断和概率分布。我们再来看一个例子,你和你的女朋友聊天,你女朋友说,算了,你忙吧,我不打扰你了。 这样的 ai 会给出这样的概率判断。你女朋友并不是并不是想真的结束聊天,他更有可能的意图是想让你关注他的情绪,他更有可能希望你认真听他讲话。你的女朋友问你,我最近是不是胖了?这样的 ai 给出的概率分析是,你的女朋友不可能是想让你客观判断他是不是胖了, 更不可能是让你给她推荐一系列的减肥方案。那传统 ai 在 这种场景下,则是用文字为你分析对方的意图,然后编写一个回复来哄你的女朋友。你能明显看出来这样 ai 和普通 ai 的 区别,它是用来做决策判断的,做概率判断的,而不是和你聊天写文案。 这样的决策模型更适合处理特定场景下的任务,比如对邮件进行快速分类,买东西之前,让他快速从几百条评价中判断这个商品是否值得购买。在处理海量数据之前,先进行快速的分类和判断。而 java 的 响应速度非常快,而且模型价格非常便宜, 把它接入到你的日常 ai 工作流中,能真正的提高效率并节省 token。 那 今天我们就来从零开始学习如何使用债务 ai, 并把它接入到你的智能体中。那今天视频中的知识点和操作步骤我都整理成了知识笔记,视频的最后会分享给大家。那首先来看债务 ai 的 基础知识, 我们来到 type safe 点 ai 的 官网注册登录,之后点击右上角的 api console, 来到主界面,然后在左侧菜单点击 playground, 也就是游乐场。那在这里进行一些测试,我们就能快速理解 java ai 的 基本逻辑了。 那界面左上角是输入信息,其实你就把它理解成使用普通 ai 时候的提示词就可以了,那只不过提示词的格式需要是 json 格式。那左下角的 questions, 这个是需要 ai 判断的问题,有三种类别,分别是 score 评分判断、 choice 选项判断、 nor 真假判断。我们先选 choice, 然后我这里直接输入数据测试一下,大家就能理解了。 我把一份儿邮件儿的内容放到了格式里,这封邮件儿的内容是一个公司 hr 告诉你参加面试的邮件儿,然后在左下角的 question 里,按照他给的格式输入不同的选项,让 ai 判断这是一封工作邮件儿,需要认真回复还是私人邮件儿还是广告邮件儿?等等,然后直接点击运行, 然后在右边的结果中, java ai 就 给出了它的决策,那显示它判断这份邮件儿百分之百是 a 选项,也就是工作邮件儿需要回复, 那它的响应速度是非常快的。如果你有大量邮件需要处理,或者大量的数据需要进行初步筛选,使用债务是非常合适的。另外两个模式分别是 score 评分判断和 know 真假判断。 我同样用这封邮件作为例子,先看 know 真假判断,让 ai 判断邮件是否需要回复,然后 ai 给出的判断结果是百分之九十八的概率是处,也就是邮件明确要求收件人回复。 而评分模式也很好理解,我们设置三个评分低中高来判断这个邮件的重要程度,那 ai 给出的判断就是这个邮件的优先级是高优先级需要立刻处理。 那这三种模式是可以同时使用的。那我再来举个例子,就以你和你女朋友的聊天记录为例,你女朋友说,算了,你忙吧,我不打扰你了。然后我分别设置了三个不同类型的判断问题,判断你女朋友对你是否不满,不满的程度以及女朋友的潜潜台词。 那点击运行, ai 马上就给出了判断,那显示女朋友对你非常不满,感觉到被忽视,希望你认真陪她聊天。那举这个例子是因为我已经看到有人把 job ai 接入到微信中,让她来分析对方聊天的意图了。 那其实和女朋友聊天只是个例子,那更有价值的场景是电商客服、客户投诉这类场景,以及数据分析和初步筛选这种场景,你可能会觉得这种数据结构非常反人类。为什么需要我手写 json 数据结构呢?那其实这个 ai 最适合让 ai 智能体来使用, 而不是让你手动输入 json 的 提示词。那目前 java ai 已经在 github 上发布了自己的 skill, 可以 直接安装到你的智能体, 接入你的 ai 工作流。那同时 java ai 的 api key 也已经全面开放,我们点击左侧的 api keys 选项,就可以创建自己的 api key 了。你也可以通过 openroot 之类的平台来使用 java ai。 那 我们这里以 codex 为例, 我直接发送提示词,让 codex 自己去安装这个 skill 就 可以了。那安装之后重启 codex 就 可以使用了。 但是我们这里要注意一个核心问题, java 这个 skill 只能指导克德 max 如何使用 java 并不是把 java 模型内置到了智能体里,更不是说你你安装了 skill 就 可以免费使用了。真正调用 ai 的 时候,你依旧需要提供 api, 那智能体根据你发出的任务指令,会自己判断是否需要使用债务来进行快速的决策。那如果他判断需要使用债务,他就会按照 skill 文档里的指导编写一段代码来调用债务 ai。 那 这个时候他依旧是需要 apikey 的。 那么正确的做法是设置系统的环境变量,变量的名字是 type c 下划线 api 下划线 key。 那 直接用我屏幕上展示的这行命令就可以了,把你的 api key 替换到这里,执行完毕后就一切就绪了。那接下来我们来做一个简单的实验,我的 codex 已经安装了谷歌的 gmail 插件儿, 能够访问我的 gmail 邮箱了,那现在我要求 codex 调用 java ai 的 skill, 读取我的 gmail 邮箱,对最近三十封邮件进行一个优先级的筛选,然后以表格形式输出结果, 同时告诉我筛选所耗费的时间。那可以看到 codex 给出的结果也非常精准。那我的这个 gmail 邮箱里大多都是广告营销或者是验证码的邮件,被归类为高优先级,其他的都是中低优先级。 而且 codex 给出的 job api 的 执行耗费时间是一点一九秒,非常的快,而整个任务耗时是一分四十秒,大多数时间都是 codex 自己耗费的。 那我把这三十封邮件的内容放到 jobai 的 playground 中测试,也能看到它几乎是瞬间就给出的回答。 把这样一个高效快捷且低成本的决策模型加入到你的 ai 工作流中,能够让你的自动化门槛大大降低。你可以把它接入到你的 ai 客服, 或者对你的日常工作数据进行快速筛选分类。那这样一来,选 a 还是选 b 这一类需要快速进行决策的问题,就不再需要耗费庞大的大语言模型进行长时间的思考了。 大家现在就可以上手测试 g i, 然后把它接入到你的智能体里。如果你在使用过程中有任何的问题,都可以给我留言。视频中的知识点我都总结成了知识笔记,大家可以在我的频道信息中找到我的个人主页,记得点赞关注,谢大家!

任务模型保姆级使用教程来了,这期视频我会详细介绍任务模型究竟是什么,怎么使用,怎么配置到 codex, 怎么让 j 五搭配 j b 六干活,以及怎么做出一个 j 五互动网页。 j 五模型的创始人是 diago alimeda, 他 曾在 open ai 工作,是 gpt 的 核心成员之一。离开 open ai 后, diago 参与创办了 ai 公司 typeface, 花了两年时间研发。 受畅销书思考快与慢中系统一的概念的启发,他把这个模型系列命名为 system one j5 就是 system one 系列的第一款模型。 j5 和 astra fab 五这类大语言模型不一样,大语言模型擅长生成,会写出一大段文字。 j5 是 判断模型,只做分类和判断,给你一个明确的结论,比如判断一封邮件是不是垃圾邮件,一条评论是好还是差。 另外,这五目前不开源,只能通过 api 调用。这五模型的特点是更快、更便宜,它跟 gpt 系列和 cloud 系列的价格对比我都放在这里了,大家可以截图看一下。 这五模型目前主要有两种使用渠道,一种是原厂官方,一种是第三方 api 平台。我把第三方平台放在这里了,有需要的朋友可以截图保存一下。 这里面我比较常用的是 openroot, 那 现在因为官方免费送给每个人五美元的额度,看起来不多哈,但其实非常耐用。最关键的是不用连接信用卡,哪怕赠送的用完了,也不用担心被扣款的问题。所以咱们今天重点介绍官方的渠道。我们来到 type save 点 ai, 现在已经不需要登记维德里斯的,直接注册就可以使用了。在首页我们往下拉一点,找到左侧的 capp, 点击它来注册账号,一般是用谷歌注册勾选协议。然后我们就来到了 keep safe 控制台的首页,点击左侧的 api keys, 在右侧点击加号 credit key, 随便起个名字,点击 credit key, 就 会出现一大串 key, 点击 copy, 粘贴到备忘录,保存好答案就可以用了。 如果想查看使用量,可以点击左侧的 usi 值,里面有使用的明细,你花费的金额,用了多少? token 右上角还能查看最近三十天、七天、二十四小时的用量,也可以按天数或者小时来查看, 还可以把用量导出来。使用这五模型最好的方式是把它跟大语言模型和 agent 结合起来,让大语言模型负责思考和表达,这五模型负责快速判断,各司其职, token 自然就省下来了。 所以接下来我会把这五模型和 gbd 六 codex 结合起来,演示具体怎么操作。我们来到 open air com, 点击 products, 选择 codex, 然后在这里点击登录的 for macos, 等下载完双击它,拖到应用程序文件夹就装好了。 等弄好登录和订阅后,我们打开它,点击左上角的 type g p t, 切换成 codex。 接下来我们需要先安装 type safe 官方发布的 skill, 用来教 codex 怎么正确使用这样模型。来到 github 点 com, 在 搜索栏输入 type safe 横杠 ai 斜杠 skills, 按回车,认准带这个 logo 的 官方仓库,点击进去,那除了 codex, 其他的 agent 也能用这个 skill。 我 录屏的时候是一千六百个 star, 现在应该更高了。复制地址栏里的链接, 回到 codex 对 话框,我觉得这个 skill 是 通用的,适合装成全职 skill。 所以 这里先不用选择项目,也没必要专门建一个本地项目文件夹。如果你已经选了项目,可以点击它,然后点击不在项目中工作,然后跟 codex 说帮我安装这个 skill。 作为用户级全职 skill, 不要安装到任何具体项目目录,记得把刚才复制的链接放上去,不到一分钟就装好了。 咱们刚才也说了,这个 scale 相当于债务的使用说明书。要想让 codex 真正调用 g 五,还得配置 api key, 我 们可以直接让 codex 来配置, 提示词是帮我把 g 五的 api key 配置成局能用的,以后不用重复输入。为了安全,不要把 key 发在对话框里,也不要写进 scale, 点 m d 或任何可能被提交的文件。 需要手动输入时,在底部终端里提示我输入,可以看到它直接打开了底部终端,等它准备好复制这里的代码, 粘贴到终端,按回车,它提示粘贴这的 api key。 我 们把之前保存好的 api key 复制一下,粘贴进来按回车,然后在对话框里说已输入,让 codex 合映一下, 如果不成功,他会提示我们按照刚才的步骤再操作一次。需要注意的是,这里的 api k 是 隐藏输入的,粘贴的时候屏幕上不会显示任何字母,所以很容易以为没贴上,又粘了一遍,结果 k 就 错了,我自己就试了三次才搞定。 j 五特别适合大语言模型搭配着干活,尤其是背景资料多、重复性强的工作。比如收藏夹里的研究文献,先让 j 五快速判断,再让 gpt 精读上演出来那几篇,所以这次我就让 j 五搭配 gpt 六帮我分析文献。 这是我这段时间收集的一百篇人工智能方面的文献,有学术类的,科普类的,有中文也有英文格式主要是 pdf 和 html。 我 想找出哪些文章,讲了 harness 跟 harness 的 相关程度,是否值得进一步研究。 模型上我选择让这幅筛选 tpt 六 so 深度研究,还是打开 codex, 点击左上角的新对话, 新开一个绘画。这里的项目就选择刚刚我们看到的文件所在的文件夹,项目名称是文件 demo 我 已经建好了,点击它模型的话,点击右下角,把 esc 换成 so, 强度选高。接下来就是使用安装的 type save skill 设计 jive 的 工作流。我把需求都告诉 codex 格式里最关键的一点,一定要让他给出能在底部终端运行的命令,通过终端调用这个 api, 等给到命令后,我们点击复制代码,点击右上角的切换底部面板,把刚才的命令粘贴进去,按回车,这我就开始工作了。它的运行速度特别快,一篇文献不到一秒, 跑到七十多篇时,突然中断了,原来是某个 pdf 提取失败,那就跟 codex 说,如果文件提取失败,就跳过去继续处理剩下的文章,不要中断整个任务。等它修改完 python 脚本,我们还是复制代码 粘贴到下面的终端,按回车,让 g 五继续干活。以后如果你遇到类似的情况,直接让 codex 修复就行。这次 g 五把一百篇文章处理完了,而且结果保存到 g 五 radars 这个文档里了,接下来就是让 so 读取这个文档,做进一步的深度分析。 点击右上角的切换底部面板,我们把终端收起来, so 给出了四段深入分析,这样就把一百篇文献提炼出我想要的信息,不仅节约时间,还省偷啃。 我这次做的互动网页,主题是只能带三样,核心玩法是网页底部放上指南针、帐篷之类的生存物品,用自然语言输入极端场景后,调用这五模型判断应该携带的物品,让三个物品直接从下面飞出来。 视觉风格是简约干净,底部物件尽量真实。 j 五的接入方式有两种,一种是官方 apikey, 一 种是 openroot apikey。 这个互动网页还是用 codex 来做。这里的项目文件夹,我换了一个模型,用 gbt 六 so, 然后把提值词放进去,这个提值词是根据刚才的需求让 gbt 生成的,它有点长,我就放进文档里了。主要是把核心玩法、页面布局和视觉风格,底部物品要求, j 五的任务 动画交互, a p i 的 要求全部放进去,然后点击发送,全程不用手动授权等待就行。 扣带子做好之后,我们可以在右边来看一下这个网页,也可以点击网页预览右侧的打开方式,选择复制链接,然后打开浏览器,把链接粘贴到地址栏, 接着我们点击右边的 api key, 设置 api 渠道,我这里主要放了官方和 openroot 这两种,我选择官方,然后把之前保存的 api key 放进去,点击保存并开始可以看下效果。我们试试火星这物,选出了这三样, 再试试月球、深空、荒岛、雪山,或者随便想一个什么场景,这五都能给到对应的物品,每个只要一输入就出结果。 目前这五模型的应用场景主要是三个方向,第一种是直接 api 集成,开发者把它当成一个判断能力的接口,接近已有的软件的后端业务系统或者程序里。 第二种是跟 agent 的 结合,用终端 who 或者其他的形式,让 codex、 cloud code 或者其他的 agent 在 需要判断的时候调用 j 五。我们前面讲的让 j 五搭配 so 分 析文献就是这种形式。 第三种是嵌入具体的产品,做成直接能用的功能,比如 excel 加 j 五,批量给几千条客户反馈打上好评差评、投诉的标签。浏览器插件加 j 五, 浏览推的时自动判断是不是广告,使用者完全感知不到这五的存在,只会觉得这个功能又快又准。当然这五也有局限, 一是它只能做判断,不能写内容,必须搭配大语言模型用。二是接入 a 阵的时候还要装 skill 配 key, 不 像大语言模型那样一键切换。那今天的分享就到这里,我们下期再见。

大家好,我是 cleop, 最近啊有一个新模型火爆了全网,就是 java 模型,那到底什么是 java? 它能干什么?大家又是怎么用它的? 网上的碎片化信息太多了,我其实看了很多,看的云里雾里,所以我就仔细研究了一下,然后今天咱们一期视频就来从头到尾给你讲透 java。 好,咱们先来看看这个债务是怎么来的,他的公司叫 tape safe ai, 呃,在旧金山二十四年成立,他闷头做了两年,到到九月十五号 那天才发布了产品,然后创始人叫 digital amada。 呃,他是那个一开始在这个 google brain 做研究员,后来跳槽去了 openai, 然后他是 instruct gpt 那 篇论文的作者之一,对吧? instruct gpt 就是 那个 chat gpt 的 方法来源,他第一次说了那个 lhf 后训练的算法就是这篇。 然后他发布的这个模型叫 jav, 他 名字来自经济学里面的 javson 理论。呃,这个理论大概说的就是单价降下去之后,用量反而涨得更多,然后我们可以看一下他这个模型到底有多火。 hack news 是 硅谷的一个程序员的论坛, 然后 jav 在 发布当天,他就拿了一千九百四十三分儿。过去一年,呃, hack news 总共有三百万条帖子,只有五十多条比他高。然后比如说 deepink r 一 发布那天是,呃,一千八百四十三,然后只 就是它的这个量级基本是 g t p g p t 五量级的。比如说我们前几天讲那些 atlas 啊,它是二百七十一分,然后 cosmo 是 一百五十分,所以大家可以直观体验一下,就是这个 java 这个模型有多火,包括国内现在有非常多的头部 up 主也在讲这个。 然后另外这个模型呢,目前没有论文,也没有权重,然后官方发布的就这四样,首先它发布了一个文档和接口,大家可以去它的官网 呃,直接免呃有免费的额度直接使用。然后呢,还有一些就是 techcon 的 一个采访,还有在 hack news 上创始人亲自的一些回复,还有创始人的一些博客,我们可以了解了它背后的算法。 呃,然后呢,另外还有一些就是 getop 上有一些大佬吧,然后他就是比如说这个 echo hum, 他 就用了一万多次的 query, 然后去逆向了这个模型,就是我们后面很多讲的模型结构啊,数据等等,都是根据这个 hum 反推出来的。 然后另外现在 excel 上还有十五次不同模式的赋现,不过其实我看了一下,这个赋现似乎都并不是很靠谱,因为 java 的 核心在于数据,那这些赋现其实都并没有很好的数据, 然后还有九份独立的测评等等,所以我们这次呃给大家讲的可能都是根据这些信息综合而来呃出的一个比较靠谱的推论。然后好,我们 开始看一下,首先介绍一下到底什么是账,对吧?一句话来概括这个账呢,就是你给他输入一段材料,还有针对这道材料的几个选择题, 之后,他输出的是每个选项的一个概率,嗯,这就是账模型,我们可以看这个视频啊,同样一个问题,如果我呃 左边是输给 java 的, 它会直接输出这个问题配套选项的,呃所有的概率,而右面是这个 gpt terra 这个模型,它可能就是 token by token 的 输出,呃,这个相相同的概念,所以它跟传统的 gpt 的 最大区别就是, gpt 它输出的是文本, 而这个 java 它输出的这个是这个选择的概率,说白了它输出的是一个数字,而并不是文本。这里我们举一个真实的例子啊,这个是我真实推理的 query, 比如说我们发给 java 模型的就是这样一个格式的 json, 然后呢,它有一个 state, 呃,我们假假装,假如说是一个克服模型嘛,比如说, 比如说我发给他的 state 就是, 你好,我前三天买的会员还没开通,钱已经扣了,客服电话也打不通,如果今天不解决,我就去投诉,对吧?我的 state 就是 这样,之后就是 question 模式, question 模式我会给他几个细力度的拆解,比如说会拆成这个,呃, 部门,然后他的 type 就是 trace, 这个模式我会呃给他一个 instruct, 就是 这条消息到底我应该转到哪,转给哪个团队? 然后呢,我给他几个选项,第一个是转给计费团队,后面是这个计费团队的一个呃,具体的描述,那第二我可以转给技术团队,后面同样是对技术的一些描述。第三我可以转给销售团队。第二个问题,我还需要让他判断,给定当前这个 state, 我 客户的情绪是怎么样? 呃,他的 type 是 一个 score, 就是 我给这个给他的平静、不满,但克制,然后非常愤怒这样一个梯度的分数。然后他的问题就是客户到底有多生气?之后呢,这个账户模型就会根据你的这个 instagram 的 提示,然后给到具体落到哪个分数。然后第三点就是这个判断题, 就是也就是零或者一的判断,这里的 instagram 就是 客户是否威胁要投诉,采取下一步行动,对吧?然后模型就会输出这个零或者一, 我们可以看一下它对应的输出,比如说在 tris 这类,它的输出就是每一个子选项的概率,比如说我转到这个计费部门的概率就是零点八九,技术部门就是零点一,销售部门就是零点零一。 同时它会还会给一个 confidence, 就是 我做出这个评价,我对这个评价的自信度有多少?如果自信度偏低,那你可能,呃可以不相信它这个模型有幻觉的呢?如果自信度很高,就说明模型对这个问题是很确定。 另外比如说对这个 score, 他的输出是这个一点六六,就说明如果客户真的这么说了,他其实还是很生气的,就是满分是两分,他已经得到了一点六六分,就是接近非常愤怒的这个档次。 然后另外我们看这个判断题,就是客户是否要采取进一步行动,那这个模型的输出就是零点九八,就大概率会采取进一步行动。这个就是债务的整个一个输入和输出的过程,我们通过这个实际的例子给大家讲清楚,对吧?那嗯,那这个图其实也是一样, 他,他会把这个概率转成实际的分数。呃,接下来给大家讲讲这个债务这个模型的 motivation, 就是 在创始人两年前离开 openai 的 理由啊,就是他在 tiktok 里面有一个原话,就是我们手里有闪电,但是但他没用, 就是他的诊断就是目前 instagram 采用的是 r l h f 这种优化方式,那么他优化的是人喜欢什么,对吧? r l h f 就是 跟对根据人的判断,然然后来优化模型的这个呃 reward, 那我们看以前的这个聊天模型,它输入问题,然后 l m token by token 的 输出,然后呢会输出一个文本,然后人来裁决这个文本我人喜不喜欢就会去执行。 那么呃,创始人就觉得其实很多时候我们并不是需要看人到底喜不喜欢,就是人类的偏好对很多问题都不是很重要,而真正重要的是一些客观的判断,对吧?所以他提出的这个 r l c d 模型是什么呢?我输入的是一些程序状态,也就是刚刚讲的 state 和选择题, 然后呢我就一次性输出,并不是文本而输出的概率,然后我输出这个概率之后,我可以用一些代码,比如说 if, else 等等, 比如说假如说它大于零点八,我就怎么怎么执行,它是通过一些客观的判断去学到的,执学到的执行,这个就是它的目的。为什么我觉得这个目的是非常好,它选的很对,因为我们看很多,比如说不管我们是 a 阵的还是实际的工程路径,它大部分的 一些判断其实并不以人类的偏好为转移的,就是它很多都是一些客观,由数据,由海量的数据客观来形成的。 所以说它这个 r l c d 的 这个算法天然就是和 r l h f 的 一个互补, r l h 算法它可以让模型的输出更对我们人类的口号,但是 r l c d 就是 这套理论的,这个算法可以让这个输出更加的客观,更加的理性。呃,接下来我们看一下它的这个架构, 首先,呃这个架构同样是由那个刚刚讲的 hum 那 个人,然后用这个反向探针预测出来的。呃,首先它分几步,第一步就是我们不是有个 state 嘛,这个 state 只过一遍网络, 也就是说那条公单的这个 token, 它先做一次 profile, 然后过一遍网络之后会把它的 k 和 v 存起来,这个就是 k v cash, 随后我会有它的具体的判断题,然后每道题会开一条分支接在这个 state 后面,我们可以看这个图,它大概格式就是这样。 呃,每一个分支都可以附用这个前面 state 的 k v catch, 也就是每个每个问题都可以看到这个 state, 同时分支和分支之间是独立的,然后每条分支就是一行 token, 比如说提干还有几个选项,然后最后接一个这个 decide 的 这个 token, 然后注意力 mask 只让呃这一行看到 state 和自己这一行他看不到另外两行。他的证据就是当时这个 hum 把一个暗号写到了第二题的题干里面,然后他会去问第一道题这个 state 里面有没有这个暗号,然后发现并没有说明他的分支之间是独立的。 然后呢,我们可以看它直接就输出了这个呃概率它,所以它并没有接一个 delete 的 头,整个这个模型它就完全不输出文本,然后也就是它输出的就是一个数字,就是一个概率,随后我们手工把这个概率结构化成这个 json 的 输出。 呃,然后呢,就是第三步,第三步就是 decide 这个决定。呃,我们可以把单独一条分支拉出来看,它就是一行 token, 它可以同时看到我当前的 state, 还有这个提干,然后以及三个不同的 option, 它具体的这个 instruct 描述是什么?然后它这个注意力也是因果的, 就是一个 token 能看到它前面所有的 token, 所以 这个 decide 这个分支一定要排到最后。就是我们要完成这个有两种情况,第一种情况就是,呃,每一个提干单独单独有一个 decide, 然后这样去输出, 然后呢?这样的话我新开一个,加上第四个选项,那么 s 一, s 二, s 三会不变,这是第一个假设,那第二个假设就是我这个图里面画的这样,就是它整个是个因果的,串成一条线。呃,那这样的话,如果我加了一个新选项,它的输出会变,那 humm 的 那个 反向推理实验证明了,它其实采用的是这个算法。 b 的 这个架构,就是因为它接了一个新的选项之后,发现结果都变了,所以这几个这几个选项其实它是会互相离, 互相影响的。我 decide 只是放在最后一个选项,它会完整地看到前面所有的不同选项之间的关系,然后再再去做决定。然后呢,它的概率怎么算呢?很简单,三种头,如果我是 choice 的 话,就接一个这个 softmax 头,把它的输出变成这个概让,让它加起来等于一。 那如果是 score 呢?它其实其实算的是一个期望,对吧?就是首先先 softmax 保证我每一档的输出都是一个零到一的数,最后我去算不同档的一个期望,比如说, 呃,像,像这个分布的话,就是零加上这个一乘以零点三四加上二乘以零点六六,最后得到一点六六,也就是算我的一个平均分数,作为最后的这个 score 的 分数。 那第三呢?就是这个如果是判断题的话,就直接给他接一个这个 sigma 的, 直接让他输出一个概率,把判断转成概率,就是零点九八或者零点零四这样的概率。呃,这两张图就是延迟的证据,左边呢一道题,它的这个 state 会越来越长,呃,发现它的延迟基本是限性的。 然后呢,右边它是 state, 很 短,但是题会越来越多,那一道题是八十六毫秒,然后一千五百道题才这个六百一十毫秒。所以说如果 state 每道题都会重新算一遍,那它的这个延迟应该就是呃限性增长的。 所以说这个实验也就证明了这个 state 其实是先过了一遍。呃,前面 k v k 是, 后面是复用的,是这个 state。 这也是这个模型架构上的一个优势,就是我我一 我一个题干一个 state, 可以 接很多道题,然后它的延时基本都是像类似。然后呢,另外就是这个底座画像,这个底座画像呃,只有官方只确定了我它们是用这个 transformer 训练,然后根据延时大家推断出来有可能是它是一个十倍左右的参数,其实这个非常小啊。 然后另外还有个值得注意,它在这个 m m l u pro 这个 benchmark 上有百分之八十四点六的准确性。 m m l u pro 是 一个考知识的体库,它有十四个学科,比如说包含了法律啊,化学啊,经济、历史、数学等等这类题,总共有一万多道题。那所以 那既然这个模型能够在这个 benchmark 上得到八十四点六的概率,说明它一定是基于大模型做的,它并不是简单的像 bird 的 这种极易参数的。呃,模型对吧?它一定是有自己的推理能力和知识能力在的,这也就证明了它就是估计是用某种开源的大模型来改的。 然后大家众生纷纭,大家说最大概率根据它的这个 token 呀,这些最大概率使用的是千万,所以我大家看完它的架构,网上有人说,哎,这个东西很像一个 zero short 的 encoder 哦,然后创始人也给了肯定的答复,我觉得其实也是这样,它就是把一个大模型变成了一个输出概率的一个 encoder, 然后我们看一下它的训练是怎么做的, 训练就是这个 r 摇 cd。 什么 r 摇 cd 呢?就是 reinforcement learning for collaborative decision, 就是 较准的决策。然后可以稍微对比一下我们三大 r 摇方法。第一种是 r 摇 h f, 它就是 learning from human feedback, 就是 刚刚说的,我根据人类的偏好,然后去优化我的 reward, 去优化我的模型。那第二种是现在比较火的就是 r 摇微摇就是可验证奖励,就是我根据一些客观 客观情况的这个可验证的题,然后来比如说数学题,他的每一个步骤都是可验证的,我根据这个反馈去优化我的模型,那么新的这个范式就是 r l c d 呃,就是我根据整个分布的真实的条件概率去优化我的模型,就是我说白了感觉稍微有点概念吧,就是 他这个模型的训练本质上应该就是去拟合这个不同的概率,其实我暂时没没看出来他跟 就是强化学习的关系,当然这个因为官方没有说很多,我觉得这个可能更像一个概念,因为创始人本身是 l h f 的 作者,他为了这个噱头必必须搞一个相同的这个 l c d 出来。然后呢,我们再说一下他的数据, 数据是这家公司真正下注的地方。创始人自己说啊,他的训练数据是百分之百合成的,这个非常有趣,一条真实的样本都没有。 然后创始人的原话就是我们很早就赌自己会造全部的数据,这是我这辈子做的最好的一个赌,赌注比这次发布比 r l h f 还好,这句话分量也很重。然后第三个关于数据的线索,就是,呃,创始人说公司一半的人都在一个实验室里面, 专门负责统计上被充分理解的合成数据的这个东西。注意啊,他并不是在标数据,而是造数据,就这个公司一半的人都在想怎么模拟的去造出这个数据,让他的真实分,让他的统计分布和真实情况相似。 然后第四点这个线索就是创始人也说这个数据其实比整个架构有趣的多,然后他也给自己的对账模型的一个排序,就是任务大于数据,大于算力,大于算法, 这个排序也很有意思啊。然后我们来推断一下他这个数据怎么做的,这个也很有趣啊。呃,其实我我给他四个字就是导过唯一,什么意思呢?我们正常的数据就是,呃,我会有一些真实的,比如公单数据啊,真实的文本数据,然后呢人或者大模型来猜, 呃,这比如这条数据是不是 technic, 或者是不是这个,这条数据应该给谁?然后我们由人或者大模型给他一个标, 然后我就得到了个标签,然后我再用这个真实的标签去训我的模型,这个是它正常的方式,那么 java 采用的方法会根据一些推断的信息,它应该是导轨为因呢?就是它先抽结果,我先 先得到这个 technique 很 急或者是失败和重复,然后一的一个一个结果,然后我根据这个结果让模拟器写出一个公单的 state, 然后这样这样的好处就是我的答案是天生是正确的。 然后具体来说,大家猜测应该是这么几个步骤,首先呢,先抽结结果,对吧?部门是 technic, 然后急,然后情绪是不满,但克制类似这样的抽结果,然后我根据这个结果让一个 lm 或者一个模拟器去写我的 state, 这个 state 写出来之后之后呢,我需要算这个比例,这个时候这个比例很重要,这个比例就是你模拟器 要真实地满足这个数据,比如说我可以采纳成千上万次,然后我去统计我抽到这个结果的比例有多少,然后这个就是它真实的概率, 那么我要算这个比例,他刚刚不是讲公司一半人都在做这个事吗?我觉得那公司一半人就是根据真实的数据 情况去造一个模拟器,那这样我们把前面几个组合起来就可以得到这个 state, 就是 根据 l m 写的这个文本, 然后他根据部门的概率就是通过这个比例来筛出来的。比如说我筛一万多条,其中有百分之六十四都是这个 部门的 technic 的 问题,那我就给他标注零点六四,就类似这样,对吧?后面我们就得到了个概率,然后其他的党也是这样,这样我们就得到了一个真正的数据,这个就叫统计上被充分理解的合成数据。 当然它的代价就是你这个模拟器必须跟真实世界准,对吧?模拟器的每个数字是人排的,不是 technic 工单百分之八十,如果真实世界是百分之六十的话,那它整个系统就会偏了,所以,呃,你这个模拟器很重要。接下来我们来看一下它的这个实验部分。 呃,官方实验呢?它的四个工作流平均有百分之六十七点八。呃,实验的亮点就是它的这个成本,我们可以看 呃,造了几个不同的工作流实验,比如说有安全告警,有 agent trace 审核,还有发票处理,还有智能客服。那么它对比的就是一些前沿的模型,比如 opus, 五呀, so 呀,还有 terra 等等。然后准确率呢?其实和这些模型差大,差不差,对吧?准确率稍微有一点差距,但是你看这个成本, 对吧?零点零零零一刀,零点三秒,那么 gpt terra 是 零点零一一一九刀,然后到 office 五就零点零五刀,然后它的延时也不一样,对吧?相对于它的这个准确率来说,这个成本和延时是它最大的一个亮点, 这也是这个模型为什么这么火,能成功的地方。然后呢?另外还,呃,这个是独立的测评,并不是官方的测评啊。做了几个任务吧,不同的任务,然后发现,呃,总结一下就是短文本他跟小模型的准确率持平, 但是如果要需要一些复杂的任务,需要推理的任务,他还是会比最前沿的模型要差的。那当然相比他的这个食言和成本来说,我认为还是可以接受的啊。最后说一下这个 java 的 应用看到的比较有意思的应用,比如说就是这个 dom, 对吧?呃,他是让这个接近了一个游戏模拟器里,然后他可以实时的输出这个游戏的策略动作,就是都把它转化成概率,然后输出这个策略动作。顺便说一下,就是 java 这个模型当前是一个纯单模态的模型,他看不懂这些画面,完全没有多模态能力,只能吃文本。 然后官方文档里说的很直接,就是你所有的图像、音频、视频都要先通过某种方式转化成文本或者结构化的数据 才能喂给他。那这个 dom 是 怎么玩的呢?它其实就是一个 jason, 它会先把这个游戏引擎会直接把这个状态输出出来,比如说血量多少呀,弹药多少,敌人在哪,距离多远等等,然后把这个 jason 输给这个 dom, 然后 dom 返回之后再进行实时的输出,相当于它是个模拟状态。 然后这个游戏啊,就是每秒问他十次接下来做什么?呃,比如说有前进,左转右转,开火,然后玩这个游戏一小时只需要七美元,然后就可以,呃,实时的玩,但是他的结果其实并不是很好,脚本、机器人都比他强,但是他就是很有趣,他证明了一个 l m 三到十秒一次的东西 可以进入实时的这个选,然后另外一个应用也挺有意思,就叫这个 wiki rise, 它是叫维基百科的接龙。大家知道维基百科上面有很多链接嘛,就是看你如何从这个 facebook 页面,然后能走到这个丧页面,规则是只能点击当前页面的链接,看谁先到终点。 那对于模型来说其实就是一道选择题,对吧?每页 wiki 有 这个几百个链接点,哪个离丧最近?然后我们看下四个模型同时跑, 呃,它,它这个就是这个视频,你看这,这个是 java 的, 瞬间就 finnish 了,那其他的模型都得慢慢的点,慢慢的点,对吧?那我们看最后的结果,它比其他的都快了这么多。然后再说一下我的这个例子,我是怎么用 java 的, 希望能给大家一个提示。呃,我前段时间不是做了一个这个 paper dance, 就是这个模型,呃,就是这个,就是用刷刷短视频的方式,然后来看论文的这么一个模型,就叫 paperless 点二 g。 然后呢,它可以根据你的这个偏好,比如说我可以用自然语言写我最近关注的这个领域,然后就可以让它自动推荐,对吧?呃, 那么我发现它有一个问题,就是,呃,其实推荐的准确率并不是很高,因为我现在使用的方法是这个 呃鱼玄相关率,就直直接上这个呃,拷定之后,然后跟他对比这个关键词,类似这样的方法,那然后我就把诈物的这个模式接到了这个里面,就是每每次让他判断用这个怒的方法判断这篇文章是不是这个方向,然后写入缓存这样, 然后我发现他的准确率巨高,基本能达到百分之百,就是以前可能会错几个,但是现在就是我做了实验,基本全对,非常有效,而且测试了一下,成本非常低,就是按当前这个用户量来讲的话,呃,只需要一个月可能一百块钱就可以 就可以完成这个 java 的 接入,所以它还是非常有用的。比如说这个就是这个视频,我们可以看我录了一个视频,让它同时去刷,然后你看左边是没有用,左边是现状没有用 java 的 时候,它有时候有些时候会出错,就是跟我人输入的那个文本 推推荐错误,但是我引入了 java 这个叫准之后,它基本是百分之百全过,就是它推荐的准确率会高很多,这个就是引用,然后大家也有兴趣可以去尝试使用一下 paperdes 零二 g, 平时刷论文还挺好。 然后呢,最后来说一下它的展望吧,就是大家可以分享为什么这个 java 会火。首先不得不承认它的营销做的非常成功, 他花了好多万美元去做,交给了营销公司做营销,所以大家看到一夜之间全部都是炸的新闻,对吧?那这是第一点,第二点是这个模型我觉得是真正有用,它解决了一个问题,就是我们看我们日常的生活中啊, 并不是每一类操作都是需要 token by token 的, 输出人类偏好的这个东西的, 比如说我们以一个 a 阵的工作流来看,那我们用户输入任务,它需要做路由,需要做判断,它需要,呃,这个有安全防护,也需要做判断, 之后 l o m 生成,生成完之后可能还要验证,也需要做判断,然后呢?它继续下一步怎么办?也需要做判断。所以 verify 判断这个事情是在我们工作流里面占了很大部分,而 l o m 这个东西它天生不是为了判断来是输出的, 对吧?我觉得 java 这个创始人就抓住了这个痛点,我就是专门做一个只做判断的模型,然后并且我成本要低,并且要快,而且它有丰富的知识经验,有上下文经验,能做到这个相对准确的这个判断, 这个就是他,呃,解决了一个非常大的一个真实的痛点,我觉得这也是他为什么能成功的原因。那也有很多人问,比如说巨神之能力,呃,能不能用这个栅模型啊?或者是怎么样?嗯,但是因为栅现在他是一个单模态,对吧?他完全没有图像的输入。 呃,所以我觉得目前来说这个产品用在巨神里面可能并不是很,所以我觉得大家还不要急,但是他这个思想 完全是可以用在各个领域度。其实这个例子大家如果看这个巨神智能里面强化学习的那个例子,其实就已经,呃,有很多,就是强化学习本身就是我需要一个 verify 模型, 呃,单独训一个 verify 模型,就是输出它的这个当前这个动作的分高与分低,其实它的这个整个想法就很像战,所以我觉得这个思想一定会有用的。但是当前这个战斗模型我觉得可能对呃巨神智能的影响有限,因为它毕竟是个单模态的, 但是呢,它对其他的一些日常任务我觉得还是有用的,因为它成本很低,我也推荐大家使用一下,用法非常简单,直接到官网上, 就是把官网甩给你的 agent 就 可以直接试用,大家也可以试用一下,我用起来体验的是确实挺有用的。然后好,这就是以上这期视频,给大家详细介绍了下这个,然后希望能对大家有所帮助吧。我是 cleop, 我 们下期再见,拜拜!

大家好,我是小魔头。这两天在社交媒体上最热的模型恐怕就是 jeff。 九月十五日发布当天呢,在 hack news 拿到了一千六百七十九分四百多条的评论。第二天, for sale 宣布 ai 给位接入 jeff 模型。 在社交媒体上,我想大大家到处都能够看到它相关的新闻和爱好者们的分享。今天呢,我也体验了一番,基本了解了它是什么,擅长做什么,或许不适合做什么。那现在呢,就来分享一下。 先说说它的背景吧。发布这款模型的公司叫 typeface ai, 这是他们结束隐身后的第一个模型。创始人 dealf 之前在 open ai 是 r l h f 的 共同发明人, 也就是让语言模型学会听指令,会聊天的那套方法的作者之一。这次他做的东西呢,正好相反,这是一个不聊天的模型, 官方放出的演示里,我想最直观的可能就是这个。这是 doom, 正在操作的并不是人,是 jeff, 他 每秒做大约十次决策,往前往左开火还是躲。他并不看画面,只看游戏状态,他也不说一个字, 只会在几个选项里选一个,并且告诉你它有多确定。官方的 api 还在排队发放中,目前呢,我也还在等待,队列里恐怕一时半会儿拿不到了,毕竟实在是太火了。 不过今天我走的是 vassel ai gav, 后面的演示呢,也有它,所以实际上大家可以从第三方的平台也能体验到。 今天视频内容的顺序,我想是这样的,先说说它是什么,再来看看官方的数字和一些独立的实测,看看有什么差距。最后呢,尝试用了 ai s d k 来搭了一个 playground, 咱们把几个典型的场景跑一遍, 最后看看官方给 coding agent 准备的一份 skill, 以及我体验下来的一些体会。 type safe 给 jeff 起了一个新的模型类别的名字叫 system one model 这个词呢,来自于思考,快与慢。人的思维分两套,系统一,快凭直觉。系统二慢要推理。那现在的语言模型呢?都是咱们所谓的系统二? 你问他一个问题,他一个头肯,一个头肯的往外深沉,想的越多,等的越久,绝大多数时候这都没有问题,因为你要的就是那段话。但软件里有大量的决策,根本不需要一段话,比如这条公单该转给谁,这条评论是不是垃圾?这个请求该交给便宜模型还是贵模型呢? 这些问题的答案是,一个选项,一个分数,一个是或者否。让语言模型先写一段解释,再输出一个 jason, 再由你的程序,你的代码去解析,即慢恐怕还贵,还可能格式出错。 jeff 的 做法是把一段状态 state 和一组带类型的问题一起给到他,他对所有问题并行的进行评估,一次返回全部答案,每个答案都是类型化的,而且带一个较准确的概率。 官方的说法是把它当成一个前沿智能的函数,调用状态进去类型化的概率出来。 gf 只会回答三种问题,第一种呢,是称为 choice, 从你给的选项里选一个,返回的是选中的那一个,并且加上了每个选项的概率。第二种是 score, 按一个有序的评分表 来打分,你给他从低到高的几档,比如平静,不耐烦,愤怒,他返回每档的概率,再差值的给出一个分数。 第三种 no 这个词呢,实质上就是这句话为真吗?返回一个零到一的概率,在 vesel a, i, s, d, k 里,它叫波点。 三种问题可以混在一次的请求里面,对同一段状态并行的评估互不干扰。官方也特别强调了这一点,不要让模型在一个长上下文里连环推理,把复杂决策拆成一组,原子问题一次权问,剩下的逻辑就交给你的代码来进行处理。 官方给到的数字确实蛮吸引人的,首先输入每百万 token 零点零四二美元,输出免费,因为根本就没有什么输出 token 端到端的延迟七十到五百毫秒。在他们自己的工作流评测上,准确率百分之六十七点八和 g p t 五点六, terra 的 百分之六十七点九之平, 成本是后者的七十六分之一,速度快了二十五倍。结构化输出的错误率百分之零,因为他他在数学上不可能输出错误的类型。 这些数字发布两天后,已经有人呢做了一些独立的审计,一些属实,一些呢,或许有些夸大。 速度和成本的倍数方面,官方说二十到四百倍,独立测的呢,是五到二十五倍。延迟呢,从海外测的是一点六到三点六,三点七秒左右吧,并不是几百毫秒。那实际上根据大家的网络情况的不同,这些数据上总的来讲呢,是会有偏差的, 准确率和中导模型测评落后于推理模型。前沿智能这个词呢,可能说的有点过头了, 当然了,还有呢,比如说不会有幻觉,恐怕也不太能够成立官方文档。自己写了一句话,类型化输出保证的是接口,不是真相,它保证答案一定是你给的选项之一, 不保证一定选对。没法验证的在于校准了,也就是他说的那个百分之八十,是不是真的有百分之八十概率是对的呢?看起来这个应该是整个产品最核心的卖点,目前也没有任何可以公开的校准或者是机准测试来做一个评判, 所以我的感觉是便宜和快是真的倍数,恐怕就看你怎么去理解了。类型安全也是真的确定的,它只是格式安全,那答案是否正确呢?恐怕还得在自己的应用场景中真实的测评一下。 发布了一周,已经有人呢整理了 awesome jeff 列表四十多个项目,我们可以分类来看一下,其中分类路由最多,其次呢是做验证,安全防护来做打分,做排序,做智能体决策,还有游戏机器人等等。 我挑了两个,蛮有意思的,一个是有人让 jeff 玩超级马里奥,把 ness 的 内存解析成接受一个 choice 选手柄动作,一个 know 判断现在跳有没有,用一个 score 评估眼前的危险程度。每八帧决策一次,三种元语在一个游戏循环里面全都用上了。 而另一个来自于 browser use 浏览器智能体,每一步要做两个决定,做什么操作,对哪个元素做操作它们把这两个决定呢做成两个 choice, 一 次性返回,只有要输入文字的时候才调这个小语言模型来生成文字。 结果是 google flight 收一张机票,七点一秒完成浏览器的协议调用从一千多次降到一百次。 看了这些应用场景,大家是不是觉得蛮有趣呢?那接下来我们看看怎么用。如果大家还没有拿到 gf 的 访问权限,那么可以来尝试一下 vesel ai gif, 它上面模型的 id 是 type safe, 但是 ai slash jf 要注意,它只能通过 ai sdk 七的 experimental evaluate 调用, open ai 兼容的 point 是 不支持的。那我也用 type script 写了,后面会看到的一个简单的 playground 服务端,就一个文件, evaluate, 传模型,传 state, 传 questions, 通过 api 调用拿到 answer 和 usage, 咱们顺便呢还可以做个计时。这样呢,我就把它套成了一个 next js 的 小应用,做成了 playground。 接下来演示就都在这里了, 咱们简单的介绍一下这个 playground 布局。左边呢是预设场景,中间是请求,右边是响应。请求也可以切换到接受,看原始的请求体。响应也可以切到接受,看看原始的 api 输出是什么样的。先看最简单的一个场景,状态是一句客服记录, 客服已经给用户全额退款四十二点五元,并关闭了公单。问题只有一个固定类型,是否已经完成退款?点击 evaluate a p n 会返回一个概率,其中还包含了延迟以及输入透杆数和成本。 把状态换成,我们会评估您的情况,三个工作日内答复再跑一次。概率呢,发生了变化,咱们可以再换成一句完全无关的话,今天杭州多云,那我们现在来看看概率是什么样的呢? 第二个场景,一次问五个问题,状态是一条公单,登录不上,上个月多扣了钱,要求退款,语气很急,我们期望对其做分类。首先, choice 有 四个选项,故障程度用 score 类型 分了四档,有没有付现,步骤是一个不二,表示有或者没有,是否要求退款也是不二制。 用户情绪呢?用个 score 类型分三档,一次请求发出去五个答案一起回来,延迟呢?毫秒及的,和刚才一个问题的时候呢?差不多。再看右边,类别做了选择,概率分布也有了,退款也有了,数值,情绪落在了对应的数据上。 这里有一个用法上的关键,故障严重程度这个问题,只有类别是故障的时候才有意义的退款。这个问题只有类别是收费的时候才有意义的。 按传统做法,你会先问类别,等答案回来再问下一个。而 jeff 的 建议是全部一起问,并行,没有额外的代价。回来以后代码只取相关的那几个,不相关的直接忽略掉。 现在把状态换成一条相互矛盾的公单,一切正常,但什么都用不了,我不要退款,把钱退给我,跑一下看看吧。类别仍然选了一个,因为它必须选,但看概率数据已经体现了不确定性, 咱们再把它换成一段乱码,它还是会选一个。再来看概率数据, confidence 数据,这正是刚才说的那件事,类型永远是对的,答案并不一定对。概率体现了确定性, 代码里或许可以加一条规则, confidence 低于某个预值时就转人工。这也是官方文档里面的 confidence gate routing 所推荐的使用方案。第三个场景, ai 给位用户能够直接使用 状态是最近的几条对话,现在呢,需要做个选择,这段对话该交给便宜模型还是强大的模型?两个选项各配一句描述。 第一条,改错别字,我们来看看它做了什么样的选择。第二条,写一个带 l r u 和 t t l 的 缓存,并写测试, 看看他选了哪个吧。第三条,一个两亿行表的查询穗口非常慢,那么两个选项之间的概率现在是这样的。 路由这一步和后面真正调大模型的时间相比呢?可以忽略路由自己的智能体框架 e v e 已经把这个做成了默认的能力, e v e 文档的 auto 代码,快,你给几个模型和一句描述,它由 j f 来进行挑选。 第四个场景,我们把状态改成一个阶层对象,作者时间,评论,政文历史举报次数。第三个问题,是不是垃圾广告,冒犯程度是什么呀?以及处置的方案是什么?放行?人工复合还是删除?我们来看看在引流广告这一条上, 它的数据,它的输出是什么样的。再换成一条正常的吐槽来看看结果,再换成人身攻击来看看冒犯程度以及处置方案。状态是 jason, 这一点值得注意,你不用把记录拼成一段话,直接把对象传进去,模型自己来读子段, 这也是对于开发者来讲,对用户来讲非常友好的。最后一个场景说明, j f 在 系统里的位置状态里有两段用户的问题和一个语言模型写的客服回复草稿。 第三个问题吧,回复质量打个分,然后看看有没有泄露内部的政策,最后来评估语气是道歉,中性还是推委?这条草稿里我故意加了一句,内部政策是投诉两次以上可以额外申请折扣券。 那么我们来测试一下吧,看看关于泄露以及关于质量打分,再把那句删掉,我们再来跑一跑,看看泄露这一个回复上的数据,再来看看我们把它换成一条推委的回复,语气的评分又是什么样的。 所以它不是用来替代语言模型的。语言模型负责生成, jeff 在 后面负责判断这段能不能发,该不该重写一道叫咽,我想或许快到了,可以放在每一次生成的后面。 playground 是 我手写的,真到了自己的项目里面要切 jeff 多半呢是让像 clock code 这类编程智能提取写。为此呢, time safe 准备了一份 skill 仓库,就是 type save dash a s slash skills, 八月二十五号就建好了,比模型发布还早了三周。整个仓库就一个 skill md 文件不到一百五十行吧。客户里面两条命令,把它安装成插件。其他 agent 呢,直接用 npx skills at 来安装就好,它不是 api 参考手册, 文档自己写清楚了,在线文档才是事实的来源。 skill 只负责一套工作流或者方法论,做三件事情。第一呢,是指向在线文档 mitified 的 页面地址,后面加个 md 就 可以得到 markdown。 skill 列出了一张表,想理解编程模型读哪一页,比如想选元语又读哪一页,那么写代码又读哪里,让 agent 按需呢?去读取不需要一次呢,把整站的内容都放进整个上下文。 第二个呢,是教 agent 如何拆需求,从应用要展示什么,选择什么改变什么?倒推需要哪些判断规则计算精确,查表执行都留在代码里面。只在需要与理解地方放上一个问题, 它列出了六种场景或者形态路由,并填参数选择,而不是生成解锁后判断证据。把判断呢变成可分用的数据校验并且升级,随着状态的变化决定下一步。 第三,纠正大约模型时代的一些习惯,相互独立的问题一次性的都问掉,包括投机性问题。 confidence 只表示概率分布的集中程度,并不表示整个流程的正确性。 no, 接近零点五是是否各半,不是程度中等,这一定程度上体现了不确定性问题和预值常量可以放在自己的一个文件里,那么人审的时候只看这一处。官方的常见问题中还有这么一条,只是要选最优的话,直接取概率最高的那一个, 不要到处去设置 confidence 预值。初步体验了一番, jeff, 我 的判断呢,是这样的,什么时候用呢? 答案空间,事先能够定义的场景,比如像分类,路由,打分,验证,还有需要每秒几次决策的实时的循环。这些语场景里面语言模型的文本生成开销是实实在在的。 那什么时候不太适合或者别用呢?需要解释的场景,显然他给不了你理由。需要深层的场景,现在他不写字了。选项设计不好的场景,因为正确答案可能并不在选项里的时候,概率还是得落在剩下选项里,这点还是蛮重要的。 官方也承认难的部分是从写提示词变成设计决策的模式,在决策在选项里面,你需要妥当的设计好,明确这些选项是否包含你期望的。 另一点,它是闭源的,托管的 api, 没有权重隐私敏感的场景呢,大家需要自己权衡。当然了,现在社区已经有人在做开放权重的复刻,比如用千万微调出带校准概率的小模型,大家可以关注一下 推广代码,我会放在描述区,你可以换掉场景里的状态和问题,自己看概率怎么走。当然了,你也可以直接用目前非常主流的编程智能体来使用 gf。 我的建议是,拿你手头真实的分类或路由任务,先跑几十条有标注的数据,看看它的概率和你的标注对不对的上,再决定要不要把它放进自己的系统里。好了,这期就到这里,我们下期见。

这两天爆火的 jeff, 你 刷到过了吗?它到底是什么?为什么突然这么多人讨论?有人拿它分类邮件,也有人把它接近浏览器插件?那普通 ai 用户究竟需不需要关注它?这期视频就为你一次讲透 jeff 到底是什么,能做什么, 以及具体该怎么用。 jeff 是 type safe 推出的面向软件流程结构化决策的模型,它在预设问题和答案范围内做分类、打分和路由,由程序依据判断结果执行动作。它不是自由生成模型,不直接写长文本, 核心是在自动化流程中充当快速明确的判断节点。它之所以受关注,是因为 type safe 官方主打快速、低成本的结构化决策。 而在自动化流程里,许多步骤只需要选择或评分,社区里也有实际探索,比如 browser use 项目方公布的一次航班查询演示,约七秒完成。 有 ready brown 分享称,几秒完成五百封邮件分类,且花费三点五美分。在实际场景中,它主要有三类用途,第一类是批量分类与筛选程序,把批量文本交给它归类并筛出关键条目。第二类是决定 ai 下一步动作,由它判断类型,再由程序执行。 第三类是程序参考分类或评分结果的把握程度,把不确定的判断交给其他模型或人工预值,要用自己的样本验证,不能把低概率简单等同于不确定模型,也不能保证准确。 想上手体验,主要有三条入口,第一条是 type safe 官网,官网提供网页测试界面,程序接口需要接口密钥公程序调用。第二条是 openroot 公开模型入口。第三条是 client 插件,需要 voicemail 接口密钥,由插件执行浏览器动作。 使用流程很简短,先准备文本,且清问题与预设答案,接收结果与概率,最后由程序按规则执行动作。不过这五不是银旦,首先它仍会判断错, 规整格式不代表绝对正确。其次,它只支持文字输入,不能直接处理图片、音频视频,也不能自由生成文本。官方模型页显示中文等语言效果弱于英语,中文效果需实测。最后是整条链路的接入总成本,网络与代理开销、缓存是否命中,插件执行 维护和人工复合都会共同影响总成本。比如有作者分享把 java 接入 codex 做模型路由的一次实验,中间代理增加开销并使缓存失效,方案反而更慢更贵。 最后,谁最该关注他?大量分类筛选和自动化工作流可以接入 job 的 判断能力对需要这些能力的人有实际价值。对于主要聊天写稿的人, job 目前对这些任务的直接帮助有限,可以关注他后续在现成工具中的应用。

hello, 大家好,最近有一个非常火热的新模型,叫做 j e v jeff, 然后这个模型呢,是由 type safe 这个团队推出的,他们的 ceo 是 以前 openai 的 研究员。而这个模型它为什么火热呢?因为它和我们现在用的一些大模型,它的 效果不太一样。我们其实从它的官网就可以看到它想传达的一些信息,我们可以看这里啊,这里可以看到它的速度是非常快的啊, 一百九十三倍。相较于这个 cloudsonnet 五,它这个模型呢,它是不能够直接生成回答的。就我们现在用的这些 ai 模型,我们可以给它一个问题,然后它既有我们的问题给我们新的回答, 那这个模型它只能帮助我们做决策。相当于以前的模型,它是它可以做这个问答题,但是现在的 jeff, 它只能做这个选择题。那既然这个模型它只能做选择题,有它的局限,那它优势是在哪里呢? 主要就体现在它很便宜,它很快。那我们可以看到它左侧呢?如果你给它一大堆的问题,它要做出个决策,它是一瞬间就可以全部生成完成的。然后我们传统的模型,它是一个 token, 一个 token 的 往外面输出的。那相较之下,如果我们想要快速的做出大量的决策时,我们选择这个模型,它的效果就会很好。 而且这里我们也可以看到这个 type safe, 它的 token 开销是非常低的,非常便宜的一个模型,而且它只有输入 token 需要扣钱,输出 token 是 不会扣钱的。 那它价格是多少呢?我们可以看到这里是四十二美金,多少 token? 十亿 token 啊,十亿的输入 token 只需要四十二美金。那其实关于它的具体机制,它在它们的官方文档写得很清楚,我们可以一起看一下。它们称这种做决策的模型啊,叫做 system one 模型,那 system one 它就是帮助软件快速做出结构化的决策的一个 ai 模型。那我们传统的这种需要思考的,需要规划任务的这种叫做 system two 模型。 像这种模型呢,它通常来说是没有办法自己独立的去完成任务的,它都是结合我们现有的这种大模型,然后把这个 system one 的 模型作为它里面的一个工具来使用。好这里我们可以看到它具体有什么用啊?首先它可以做选择,比如说我给你十个选项,你帮我快速的选出其中一个最合适的一个选项, 当然你除了给选项之外,你还要给他去选择,这个原因和我们正常使用 ai 模型是一样的,只能是一个 choose, 然后选择哪一个? 还有一种就是这个呃得分,比如说他这里有个问题,这个这个顾客有多沮丧,然后他可能根据顾客的一些对话信息去判断呃这个顾客的沮丧程度,然后你这里还要有一个这个评分的表, 然后这里呢?还有一个就是判断这个消息是对还是错的,那比如说百分之九十五是对的,那这个模型期在内测期间我也有去申请他的这个 waitlist, 然后这两天他已经开放出来了,然后我们想要去使用他也非常简单,可以看到他这控制,它就跟我们传统的 ai 的 api 这种提供商是一样的,有一个 api key, 然后我们想要去使用它,最方便的方式就是复制,这里有个 agent prompt, 复制之后我们到任何一个 agent 里面去执行。那比如说这样子我把它粘贴给它,执行完成之后呢?我们斜杠 type c, 那 这里它就可以去读取这个 skill, 它其实就是读它官方那些文档,它就知道怎么样去调用这个模型了。那我们如果想要去用它来构建一些 ai 应用,我们就可以把这个 api key 粘贴给它。那既然它可以用来快速地做一些选择题,但实际应用方面其实也挺广泛的。就现在已经有很多基于这个 jev 去开发的应用了。比如说像这这种啊, browser use 里面有一个叫做 jev ultrafast, 就是 通过这个啊, jev 它能够快速选择这个机制去啊,给它一大批的元素,然后呢精确的选择里面其中一个元素,它比传统的这种 ai agent 里面的模型自己去选择这个元素,速度会快很多嘛。然后除此以外也可以用它来玩一些游戏啊,比如说需要做决策的游戏。还有一个应用,我记得是用它来帮我们做这个上下文压缩,因为我们上下文里面现在的压缩方式是把全量的上下文丢给一个模型,然后让它 去整理之后再输出完整的上下文,它的速度比较慢,那我们使用这个 a v 呢?它没有办法把我们的这个上下文直接 进行总结,但是它可以去选择里面必要的部分保留下来。它可以做选择嘛?你把之前的上色纹一批一批的丢给他,然后判断这一句要不要留,这一句要留的话我们就留着,不要留的就去掉,那是它也是一种上色纹压缩的方式。 那这里呢?我也基于这个 g a b 实现了一个小应用,给大家看一下它实际的应用场景。比如说我这里做了一个提词器,然后我载入这个稿件, 那我们正常来说使用提词器的话,我们是要跟着这个提词器一个一个字一个字的去走,或者说设置它自动滚动的。那现在我使用 j e v 之后,我可以随便去在这个提词器里面去说话,它会跟着我的进度去走,比如说我现在开始说开始录制, ok, 哈喽,大家好,最近我发现一个能有效减少 ai word 的 一个方法。那之前我的视频中给大家分享了我日常模型组合是 g b t 加 g kimi, 我们可以看到它这个提子器啊,它就会跟着我的这个进度不断的往后走,即便是我跳到后面的一段去,它也能够继续跟着走。比如说我现在那这个组合从编程和设计的角度来说很棒,它还还是可以跟着这个提子器继续走。它的原理呢是这样子的, 我有一个实时语音转入成文字的一个模型,然后我在当我说错的时候,它就会去启动这个 g e b 来对我的这个文案进行纠篇。纠篇呢就是 根据我当前正在说的话看这个文案啊,如果说我又跟上这个文案了,他就又继续回到对应的进度去,那如果说我偏移了,那么他就会此时就停在这里不动了,他会在那里等我。其实就是 j v 的 一个 应用场景吧,可以用于动态的判断当前的这个状态是什么样的。比如说我给他四个状态啊,是在跟读中还是纠篇,还是其他的状态。然后他可以 基于因为我的这个输入是很多的,文容量很大的,我需要它有一个比较实时的效果,用一个普通的这种大圆模型去做这个纠篇的话,它的速度就比较慢,没有它这个速度这么快。 那这里还有个点,就是 j v 它这种模型虽然可以做决策,但是这不代表它做的决策就一定是对的,因为它毕竟是一个小模型,你假设给他一个比较复杂的数学题,你给他一个 a、 b、 c、 d, 他 不一定能选的对。 那这个 jeb 呢?它是一个闭源的模型,它是 typeface 这个公司的嘛。然后现在也出了一个开源的一个模型,跟它一样是这种 system one 的 一个模型,叫做拉雅。 这个模型我们是可以自己端测部署的,因为对于我们在要求它决策非常快速的时候,有的时候这个模型的输出速度已经不是问题了,比如说我们网络传输的速度反而是最大的瓶颈,那我们如果端测去部署一些用于决策的模型,可能会比我们呃使用这种云端的减少这种 信息传输的这个延时。那像 jev 这一类的模型出现,我觉得是可以带来很多创新的应用的,因为它提供了一种新的可能性嘛,它的速度这么快,而且我们一些 agent harness 也可以用上它。比如说我前面讲的可以用这个 呃 system one 的 模型来做这种上下文压缩,除此以外,我觉得是不是也可以用于这种比如说 skill 的 鉴定式加载啊?我们可以使用这种 g e v 来决策当前的用户的信息,它需要选择哪个 skill, 这过程就不用走主页卷的模型去判断了。 然后最终这个主页卷它只需要读到具体的 skill 的 规范文档就好了。这样不仅能够减少这个主页卷里面多余的没用的上下文,进入这个基作模型,也可以去提升它选择这个速度。好,我今天的分享就到这里,谢谢大家,拜拜。

type safe 这家公司发了个不会说话的 ai 模型,名字叫 jeff, 九月十五号上线。 jeff 不 聊天,不写文章,也不写代码,一个字都不深沉。首页正中间挂着一行句子,念出来就是快一百九十三倍,便宜四百四十四倍。 你刷到这行句子会怎么想?我当时的原话是两个字,吹牛。可我的怀疑没撑住。 type safe 把完整的评测数据全公开挂在网上,一家敢吹几百倍的公司主动交出了自己的成绩单。 先说清楚, jeff 还在排队申请阶段,你用不上。但 type safe 公开的那份数据里,有一条结论,今天就能用,跟你用哪个 ai 都无关。那张表上到底写了什么?这期分两段说, 先说那两个倍数到底在讲什么,再说一条你今天就能用上的结论。 jeff 跟聊天机器人不是一回事,你平时用 ai 是 打一段话,等一段话回来, jeff 反过来,你先把问题和可选答案都定死, jeff 只负责在里面挑一个,再告诉你有多大把握。能接的问题就三种,一种是从你给的后选里挑一个,官方叫分,官方叫 score。 还有一种,你问一句话是不是真的,官方叫 no, 回你一个零到一的数,官方给的速度是端到端七十毫秒到五百毫秒,换成手感按下回车,答案几乎跟松手。同时 价格上更狠,输入这头四十二美元,管十亿个磁块,磁块就是 ai 算账时把文字切成的小块,输出免费,官方说便宜到不值得计量。 讲到这里,得把一样东西摊开了。我打开那张表,看到 jeff 的 位置在第五行,准确率六十七点八,表上还有两行更值得看,最前面的是某海外头部公司的旗舰款七十四点一,紧跟的是另一家海外头部公司的旗舰款七十三点一。 那张表上还有一行是这期最该看的, jeff 的 准确率六十七点八,跟某海外头部公司的中档旗舰同分,一个数字都不差 同一个分数成本。那一栏一边是零点一一七四美元,一边是零点零零零四美元,差了将近三百倍耗时。那一栏七十八点一秒对零点四秒,快了将近两百倍。 所以首页那两个巨大的数字,讲的是同一件事,同样的成绩,便宜了几百倍,快了两百倍。这两个倍数一个都没变,说的都是钱和时间,不是谁。更让我意外的是 typeface 自己做的事。 这些数据的毛病是这家公司一条一条写出来的。速度那一栏的备注写着,评测是在我们自己家的笔记本上跑的。 定价那一栏写着,我们不能证明这里面没有补贴。评测本身呢,写着自家团队做的可能存在偏见。官方博克里还有一句原话, 我们喜欢怀疑论者,我们自己就是怀疑论者。我本来准备去拆台的,结果这家公司自己把证据摆了出来。这得说准。一句官方喊的零幻觉,说的是类型安全。 jeff 的 回答一定落在你事先定好的那几个选项里, 不会冒出第四个,这个是数学上保证的,但这不等于 jeff 判断永远。对。官方文档里专门留了一页标题,就叫 jeff 这一版的毛病, 头一句写着 j f 并不完美,下面列了九条会栽的地方,不会数,数不会算数,比日期先后不可靠。那张表上那个六十七点八就是会错的部分,顺便跟前面那期分个公。那一期讲的是 ai 排行榜的总分怎么加权算出来的, 拆的是分数从哪来?这期拆的是另一件事,一个真到不能再真的倍数,为什么能让人误会? 回到那张表?评测站自己的结论是这样一句话,先说清楚,提示词是什么?就是你在聊天框里打的那一整段话。结论是,每一个模型不管哪家的,把规则拆成几个小问题,分别问, 都比把同样的规则写成一大段提示词更准、更便宜,也更快。两个数字最能说明。 某海外中小档模型写一大段提示词是五十一点九,拆成小问题之后是六十六点八。另一个小档模型更夸张,原来是十八点一,拆完变成五十三点六。 官方还给了一个办法,你别问 ai 一个笼统的问题,比如说给这个创业项目打个分, 拆成三个小问题,分别问市场有多大,技术做不做的出来,跟别人比有什么不一样?再用你自己的公式把三个分数合起来,好处在哪?哪天你觉得市场规模更重要了,改你公式里的一个数字就行, 不用重写那一大段提示词。说到这,落点很清楚,别再写一大段提示词,让 ai 一 次干完。拆成几个小问题,分别问,再用你自己的规则合起来。 这条值得转给在公司里被要求用 ai 提效的人。这条不需要 j f, 不 需要排队,也不花钱,你手上任何一个 ai 聊天框,今天就能试。把平时那一大段拆成两三个小问题分别问一遍,再自己把答案合起来对比一下。 所以我现在看这类首页第一眼不看倍数,先看表里有没有把不利的数字也列出来, 以后再碰到首页写着几百倍的 ai 产品,我都去把他自己公开的那份数据翻出来 看看倍数到底在讲哪件事。一家公司敢把排第五的成绩单挂出来,这件事本身比那两个倍数更值得记住。你手上那段最长的提示词能拆成哪几个小问题?