hello, 大家好,今天我们继续来探一探 token 自由的 open cloud 个人助理。本次主角是最近正式开源的更强智能、更低算力的千万三点五中等规模模型系列,融合多模态学习、架构、效率等多项创新。 本次开源包含四个系列模型,可高效应用于 cloud code codex、 open code 以及 openclaw 等应用框架。其中今天我们重点看千万三点五杠二七 b 的 模型,其定位为均衡型,在复杂 agent 场景表现出色。 同时与其他模型对比起来, quan 三点五到二十七 b 在 i f bench, g p q a diamond, h m m t, february, twenty twenty five 等多个权威基础上表现突出,尤其在数学推理指令遵循和多语言知识任务中接近 甚至超过更大餐数量的模型,展现出高效的性能表现。废话不多说,让我们快速开始吧! 本次同样采用运维神器 one panel 进行验证。首先我们先看下本地模型服务器的资源配置情况,然后同样的,我们基于安装好的开源本地大模型运行管理工具欧莱玛, 在欧乐玛官网找到最新发布的千问三点五杠二七 b 模型,下载后在模型管理中确认模型正常运行,这里省略了下载过程。 温馨提醒下,正常下载大概需要二十到三十分钟。大家记住这里的模型名称,千问三点五,冒号二七 b。 一 会配置名称的时候,需要本地模型账号添加本地模型账号,替换当前的 d p, c, k 在 线模型 添加本地模型账号。其中 a p i t 为任意字母串, base 一 五二 o 为欧拉玛访问地址加斜杠 v 一 欧拉玛访问地址从应用商店的跳转链接中获取,同时确认下正常运行。账号维护完成后,进入智能体的配置页面,完成模型切换。模型账号选择刚才维护的本地模型,勾选手动输入模型, 然后输入欧莱玛千问三点五冒号二七 b, 即刚才记录的模型名称。在线模型已经替换为本地部署的千问三点五冒号二七 b 模型了。接着让我们点击跳转链接测试下效果吧!保持惯例,先问声好, open call 正常反馈了, 说明本地模型已经接通,再让它搜集最新的 ai 动态去工作了。但是提醒我缺少 a p i t 无法工作。 大概一分钟不到完成反馈。下面我们让他自己安装一个 web 搜索 skills 技能 tablie, 一 分钟完成配置,并帮我根据历史绘画搜集了最新的 ai 动态。 nice, 看看汇总的 ai 动态新闻, ai 助理干得不错哦! 最后我们看一下 token 使用情况,确认是本地模型哦!本地模型太赞了,可以无限 token 用起来了!小伙伴们还等什么?以 one pawn 为基作管理你的欧乐玛和 open claw, 让强大的千万三点五专属为你干活儿!
粉丝8.5万获赞15.6万

大家好,我是根古,今天是 open call 的 第十二堂课啊, c dance 是 字节跳动发布的一个超级强大的,号称地表最强的多模态的大模型,它在图声视频、纹身视频这个领域啊,应该是第一题对的,第一题对的。那这堂课给大家分享一下如何通过 open call skills 来打通 c dance。 首先给大家看下效果,这是我已经调试好了的,我这个就是生成一张图片,图片呢,描述就是根古老师在外太空中说 cds 啊,这个就是他,最后图片会在这里, 他就马上 get 了。好,我理解你想生成一张图片,描述是这个,这个这个,他会根据我的 proma 的 运行调度这个 cds 的 一个这样一个也就即梦的 api 啊,已经好了, 反正,反正这个图片也一般了,效果一般了。然后他怎么做到的?怎么做到的? 首先你应该去打开吉梦,吉梦这样一个官网啊,这个大家都应该用过了,然后用抖音扫码登录,点这个 api。 好, 然后立刻开通啊,因为你是用 api 去调用,而不是用这个文字去调用这个。你进入这里以后,如果你是第一次进入,这是所有的都是暂未开通,暂未开通,我建议大家把这个吉梦四点零这个全开通, 如果是没有开通的服务的,他这边就是灰色的,你选择开通就好了。点开通就好了,我这个不不去开通了,开通了以后这个就会变绿。概数点这个概数啊,他大概有四个步骤,第一个步骤,实名认证,这个也没啥介绍的,也就是,呃,在抖音扫个脸就好了。第二步,开通服务,刚刚已经演示了, 就在这个节目 ai 这个这个里面,然后第三步是最最重要的,他现在喉咙不是很好,然后去开通这个新建秘药,这个秘药他有两个秘药,一个是 s s k, 一个是 secret 的 k 啊,这两个秘药拿到以后,然后编一段代码, 这个就是编好的代码,其实也不是很长的,这也不是很长,就这么一点,编好代码以后,然后让这个这个 让小龙虾去学习这个,呃,你刚刚编好的这样一个代码,也就样式学好了以后,他就能够运行调度这个极梦的 api, 大 概整体思路就是 第一步,第一步申请极梦的 api key, 那 第二步是开通服务,开通极梦的服务,第三的话就是编辑 skills 技能卡,也就这一块的代码,大家感兴趣的话可以在评论区扣,我可以分享给大家。最后一步就是让大龙虾去学习这个 skills, 所以 说关键点还是 你这个 style 是 自己开发的啊,你也可以用网上其他能开发好的,但是我用了下他们的不是很好用。最后就是,呃,直接可以展示效果,可以大家再给大家展示一下,比如说生成,生成一只猫在太阳下, 太阳下休息,然后可以看一下, 这个 好,他说我理解你想生成一张图片,描述是一只猫在太阳下休息,看一下应该很快就出来了,哎,这个 是不是还可以啊?效果还是不错的啊。所以说龙虾它也非常多的样式啊,如果你不会开发代码的话,你可以去找很多样式,把它放在那个它的项目上面的一个叫 work space, work space 里面它就自动能学习啊,这堂课就分享到这里,你学会了吗?

网易有到刚刚开源的这款 lobster ai 代号,全场景 ai 代理。它最牛的不是聊天,而是干活。发个指令,它能自主规划,自动搜索,直接生成文档报表,甚至还能剪视频、写代码,搞自动化工具等等。最离谱的是,它支持手机远程操控。你在下班路上,老板突然要改文件, 直接通过钉钉或菲叔发条指令,家里的电脑就开始自己动。等你到家,活已经干完了。对比国外的 open call, 也许它对中文办公场景适配会更友好。

部署本地的 openclaw 已经可以剪视频了,大家都知道了吧, 这个让硅谷大佬每日一封的 openclaw 阿月,我呢也是拉到本地试了几天,现在就带大家把本地部署和接入飞书每一步都走明白。为了防止偶然性啊,我呢也是连续测试了四台电脑,确保每一步都可行,接下来你们只要跟着做就可以。点好关注收藏, 我这里依旧用的是 windows 系统来操作,因为 macos 系统呢,环境相对比较简单,不像 windows 这么复杂。首先呢,我们要确认好 windows 的 安装环境,安装的时候呢,全部都点 next, 一 直到完成即可,建议呢,不要去变更中间的安装路径。 呃,安装完成后呢,我们可以检查一下环境,我们在命令提示符的窗口输入这两个指令,如果输入指令后跳出版本号,那就说明安装已经成功了。这里提到的两个环境文件呢,我在文档里面也全部都准备好了。 好,接下来呢,我们就开始全区安装 oppo 卡使用管理员 c m d 指令输入,这个指令安装完毕后呢,再输入这一条指令, 好开始了。 ok, 这一步跳出来的呢是风险提示,我们直接选择 yes。 然后呢我们选择 quickstart, 这一步呢是选择大模型,我这里呢用的是千万,因为他是国内的,如果大家有惯用的呢,也可以自己进行勾选好,然后我们这里模型选择默认的即可。 之后呢会跳转到大模型的首页进行授权验证,大家验证通过就可以了。那通过后呢,这里也同样有一个选项,我们直接选第一个默认的模型。 ok, 下一步呢,这里可以看到很多的应用选项,这其实呢就是指令输入的终端,因为这些都是国外的,所以我们先不管,选最后一个,跳过,后面呢我会给大家介绍如何接入国内的飞书。 ok, 继续,这里会问你需要配置什么 skills? 呃,我们也跳过,没问题,因为这个不着急,后面都可以手动去配置的。 好,这个也不用管我们用不上,直接跳过。好,然后我们稍等一会,会自动弹出一个网页,然后你会发现这个网页是打不开的,没关系,我们这个时候呢,再运行一个 c m d 的 指令, 好,这就是欧奔 cloud 的 兑换框了,我们来尝试和他打个招呼, ok, 他 回复我了,那到这里呢,其实基本上就成功了,还是比较简单的啊。然后呢,我们再来尝试为大家接入一下飞书,很多小伙伴呢,在这一步呢,其实就被劝退了,因为怎么样都接入不了这里,大家看好我怎么操作。 首先呢,我们进入飞书的开放平台,我这里呢用的是个人版,我们来创建一个企业自建应用, 进到这个凭证与基础信息界面,把你的 app id 和密钥保存下来,这个很重要啊,后面会用到的。然后 我们添加一个机器人,再到权限管理这一步,为他添加一些权限。这里的权限列表呢,其实官方呢是有指导文件的,但是呢就藏的比较深,我呢也是给你们找出来,直接放到文档里面了,你们直接一键复制过来就 ok。 好,然后我们需要配置一下这个事件回调功能,在这里的订阅方式选择长链接这一步呢是必须的,而且是绕不开的,也是大家碰到卡点最多的一步,很多小伙伴呢在这里呢就是一直报错,好,不用担心,我呢,已经整理了一份非常长的傻瓜教程,大家直接照做就 ok 了。 然后选择以后呢,我们添加事件,然后添加搜索接收消息, ok, 然后我们就去点击创建应用,然后再发布就 ok 了。 好了,配置工作完成之后呢,我们就要开始给欧邦克劳接入飞速杀键了。由于 windows 的 系统环境问题呢,所以大家的电脑情况都不太一样,所以会出现不一样的报错问题。网上的很多视频呢,也没有把这个问题针对性的讲清楚,我自己呢也试了三到四台电脑来做尝试,都非常有挑战。 如果你手边也报错的话呢,不用担心,我这里想到了一个邪修的办法。好,那既然 oppo klo 可以 控制我的电脑,那为什么他不能自己安装飞出插件呢?我们来试试看吧,直接和他对话。呃,你自己安装一下飞出插件,然后呢,他就会开始疯狂的工作,并自行去验证安装环境和插件配置 啊。五分钟左右后呢,他就会告诉我,他工作完成了,需要我提供给到他飞出机器人的 app id 和密钥。这个呢,其实我们在上一步已经有了,我们直接复制给他,让他呢继续去工作。这里的工作过程当中呢,我们的机器人可能会下线几次,原因呢是他需要去重启网关, 如果呢,你感觉他下线太久的话呢,我们可以用 open cloud get away 这个指令重新把它呼出来。最后呢,他会要求你在飞车上和他对话进行测试,并为你排除最终的一些故障。 ok, 全部搞定,已经可以在飞车上正确回复我了,并且呢,刚才在外部的对话记录他也全部都记得, 呃,我们这里呢,再用手机给他发一条消息试试看。好,他也同样接受成功了。好了,这里欧本卡接入飞书的配置呢,就完全对接成功,基本上都是他自己完成的,我呢只是配合他提供了一些必要的信息, 妥妥的全能小助理。接下来我们来看看他能为我们做一些什么吧。比如呢,我现在想要订一张机票,我就让他帮我查询一下最便宜的航班,他立刻就给我列了具体的信息,包括航班号,价格以及其他的一些航班信息。不过这一步呢,是需要接入 api 的, 大家可以自行去网上找免费的接入就可以。 好,那现在过年了嘛,马上大家呢也会送礼嘛,那我就让他去浏览电商的页面。呃,不过这里呢,需要先安装一个 oppo club 官方的浏览器插件,我们直接从官方渠道进行安装就可以了。具体的步骤呢,已经放在文档里了,大家直接照做就可以。我让他给我打开。 ok, 成功,呃,然后我继续让他为我搜索燕窝。好,也成功了。 好,那我们现在在拿最近小伙伴在学习的 ai 的 线上作业丢给欧本克,看他能不能帮忙完成。 首先我们要让他找到作业的本地目录,并让他完成里面的题目。他立刻就找到了,并且迅速告诉我,完成了。啊,这速度还是真的蛮快的啊,但是呢,人呢,还是比较懒的。如果呢,你抄作业都不想抄啊?没事,直接让他把填完的东西返回给我。好,他已经做完了,我们来看看啊。 呃,代码呢?全部都完成了,不过呢,我也是看不懂啊。看懂的高手可以来说说他完成的这个准确率怎么样。 好了,那这次安装说明就先讲到这里了,关于 open cloud 的 更多能力,有时间呢我们可以再去测一下。好,那既然已经部署成功了,有兴趣的同学呢,也可以再去深度探索一下 啊。对了,现在呢,各大厂呢,也出了针对 open cloud 的 云端部署,我这个呢,也可以跟大家快速的分享一起。好,这里是阿月,希望我的视频能够帮助到你,让你更了解呀,我们下期再见。

我用 open 可料做的视频,然后给大家看一下,今天一分钟讲清,然后大模型按功能到底分类几类。一、文本大模型最常见,专攻文字写文案问答,翻译摘要聊天。主流大模型基础都是他。二,多模态大模型 啊,不只懂文字,还能看图,读音频,看视频,图文理解,视频总结都靠他。三,嵌入向量模型,把文字转成数字向量,让机器懂语。一, 主要就是用于解锁啊,知识库啊。推荐系统四,代码专用模型,深度优化编程,代码生成,股权查错解释是程序员效率神器。 无推理强化模型,专门搞定逻辑数学推理规划类难题。然后更擅长动这个脑解析,不用记复杂原理,就是按需求选模型,效率直接拉满。

今天的话我们来学习了解 mini max m 二点五全球编程和智能体能力最强的这个开源模型。 首先的话我们会从底层的这个模型概览核心技术和这一个技能以及本地部署应用场景来去进行这个讲解。那么首先的话 mini max m 二点五是作为中国公司 mini max 的 这一个二零二六年二月份就是最近推出了一款大模型, 它被号称为就是目前目前的这一个全球编程和智能体能力最强的开源模式,并且极其便宜,就每小时只花一美元就能以一百 token 每秒的这个速度持续运行, 那么它与这一个我们之前讲的这个 queen 三点五的核心区别。首先它的这个参数是两千三百亿,小于这个阿里的这个 queen 三点五的三千九百七十亿,同时它的这个活跃参数是十币,在一百亿左右 的核心优势能力是在于这一个编程和 a 级的能力比较强,那么如果说 pin 三点五是一个全能型的这一个选手看图说话翻译,那么 mini max 的 话其实就是一个编程的自动化专家,他比较擅长写代码,修 bug, 上网搜索、 操作办公软件。为什么这个模型在这个位置里面是比较突出的呢?首先的话它就是这一个修 bug 的 能力是全球在这开源里面是比较领先的,接近这个 cloud ops 四点六的这样的一个模型。 同时的话它的这个多语言的这个修复 bug 的 能力是达到了百分之五十一点三。还有 ter terminalbench 就是 终端操作这一款,竞争力是达到了百分之五十九点三,终端操作的这个能力其实是比较强的, 但是它的成本其实只有 cloud 的 十分之一,这就是导致它具备一个极致的这个性价比。那么同时的话它带来一个优势的话,就是它的这一个 它的这个成本是极低的。那么在我最近爆火的这个 open cloud 这一个产品的时候,它其实是在这里面是具备很大的优势的,让 open cloud 为我们进行这个日常的办公,其实是变为了口可能 那么它同时也有几个版本,比如 mini max lightning 就是 三美元,然后百万 token 就是 零点三美元百万 token 以及这一个输出的话是二点四美元,以及这一个 mini max m 二点五,标准版的话是零点一五美元百万 token 输入,还有一点二美元的百万输出。 cloud opera 四点六的话,它输入的是这一个十五美元一百万 token, 那 么输出的话是七十五美元百万的 token。 g p t 五点二的话是输入是五美元,然后输出是十五美元。 m 二点五的这个成本是十,是 cloud opera 的 十分之一到二十分之一,嗯,它的这个成本是这个 g p t 五点二的这个十分之一和十二分之一, 那么它的这个亮点的话,它还有一些核心的这个亮点,比如说它的这个 bronze comp 的 这个,嗯,电脑这个搜索能力是达到了百分之七十六点三, 然后的这个网页的能力竞争力的话是达到了,嗯,百分之七十六点四,那么它在这个网页的这个浏览信息搜索、证据追溯等方面其实的能力是非常的突出出色, 那么同时的话就是它的这个它能够很好地去实现我们这一个办公的自动化,那比如说 word 文档自动排版生成报告,还有这一个 powerpoint 自动制作演示文稿, 以及这个 excel 的 这个金融建模数据分析公式生成,这些能力的话其实是比较强的,是要优于其他的这个主流模型和开源模型的。 那么我们再来详细的讲解一下。呃, mini max 它为什么能有这样能力?它核心的这个技术原理是什么样的?首先的话它采取的是也是这一个 mo 混合专家模型,用这个稀疏激活机制推理的时候,仅激活部分的参数, 而非全部的参数,同时如同调用这个专家团一样,而非全全员出动,那么大幅度的提升这个效率。其次的话就是这个模型的基本参数是,呃,模型的这个类型是英国语言类型, 它是主要是理解这个生成文字,它没有这个视觉能力。第二点的话它总参数是两千三百亿, 这是模型的这个知识容量,那每次激活的参数是一百亿,实时干活的用到的这个参数就是这个一百亿。另外的话,它的架构是采取了这一个混合专家的这个架构稀疏激活的这种架构那么可以做到高效的推理,上下文的 长度啊,是大概二十万的左右的这样的一个上下文长度 token, 那 么一次可以处理十五万字, 同时的话它的推理速度在一百 t p s, 就是 每秒生成一百个这个 token, 而模型大小的话是在这个 b f, 嗯,十六四百五十七 g 的 原始的这一个原始末的这一个压缩的大小, m o e 的 这个价格为什么 又小又强呢?那么跟 queen 三点五其实是一样的,它就相当于是每次只激活这一个一百亿的这个参数,然后做到推理更快,成本更低,同时能够跑更多并发,那么同样的硬件服务可以服务更多的这个用户。 另外的话它还加强了一个,就是这一个 a 型的这个原生能力的这个强化的学习架构, 那么它采取的这个架构的话叫做 foreign 强化学习架构,它是它的技术创新,传统的这个模型训练方式是数据加训练,加模型学会说话,而 minimax m 二点五的这个训练方式是二十万加上真实环境, 然后再强化学习,模型一步一步学会做事。那么在大版环境里面,它就直接在二十万的这一个, 用二十万的这一个相关的这一个参数,然后模型像真实的实际师生一样,在真实的环境里面不断的尝试,然后获得反馈,从而掌握这一个使用工具的解决问题的这个能力,实现从说话到做事的这个跨越。 那包括它的这个浏览器办公环境和各种工具 api, 它实现的就是二十万加上真实环境加上强化学习,以及让模型逐渐的学会做事情。 a foreign 的 这个框架的这个语特点,其实它第一是实现了这一个 aint 的 原声,那么模型从训练开始就能够学习如何使当智能体,而不是先对 先学对话再适配,同时的话实现这个环境解偶,那么训练的这个引擎和 aint 完全分离,支持任意的 aint 的 框架,那么同时也做到这个训练吞吐量实现约四十倍的这个训练的加速。 其次的话它支持这一个树形的合并,那么创新的这一个样训练样本的话,其实是用来做这个训练加速的。 其次的话它还采取了这一个 c i s p o 的 算法,那么做到这一个稳定的训练 m o e 的 模型, minimax 自研的这个 c i s p o 的 算法来确保大模大规模的 mo 模型训练的稳定性,那么还解决了行业的一个痛点,就是 mo 模型在大规模训练的时候容易出现这个不稳定性,它采取的就是这一个,嗯,交错思考模型, minimax m 二点五的它的这一个交错思考模型其实是使用这个 think, 然后里面包括这个内容,再加上 think 的 这个标签包裹着来进行推理。 比如说用户的问题,请修复这个 python 函数中的 bug, 那 么模型输出的话就是 think 让我分析这个函数问题,在第三行类 请转换错误,需要在调用前添加这个类型检查,然后我发现了问题,第三行 缺少类型检查。以下是修复后的这个代码,然后再进行这个代码的修复,那么这个的话就是关注这个重要的东西,在多轮对话里面必须要保持保证这一个历史的信息, think 杠 think 的 这个里面的内容 如果删除的话,模型的性能就会显著下降,这与这一个 queen 三点五不同, queen 三点五是要求在历史中去掉这一个思考的内容, 而这个的话就是要保留历史中的这个 think 的 核心关键信息是一个交错思考的这样的一个模型, 另外的话它就是有这个 specwriting 的 倾向,像架构师一样去思考。那么 m 二点五在训练时涌涌现出了一个独特的行为,就是 specwriting tendency。 在 写任何的代码之前, m 二点五会主动地分解项目的需求,规划功能和架构, 同时设计这个 ui 方案,向一个经验丰富的这个软件架构师从全局出发,然后去能够这不是人为的这个编程能力,而是在大模大规模的这一个强化学习之后,自然涌现出来的这样一个编程的能力,这是非常厉害的。 那么其次的话就是另外它的这个编程能力在业界对比的话其实是比较强的,基本上能跟 cloud ops 嗯,四点五持平。同时的话它在权威的这个 s w e 奔驰这个测试里面,它其实也是,嗯,另外的话,它有极具这一个性价比的这一个优势, 具备这一个全站开发的这个能力。 那么另外就是 m 二点五它的一个特别之处就是它在它,它在不同的这个 a 型的架构下面都能够保持这一个稳定的性能。比如说 open code 的 架构下面,它有百分之七十六点一,还有 cloud ops 是 百分之七十五点 九,还有这一个座椅的这个框架下面是这一个百分之七十九点七,以及这一个 cloud ops 四点六,是百分之七十八点九。 另外的话就是这一个 m 二点五的这个 swbench verified 达到百分之八十点二,与这个 cloud ops 四点六其实是相差百分之零点七,还有 marty swbench 的 这一个参数里面是百分之五十一点三是目前公开的最高成绩,关键的差异的话就是完成这个 swbench 任务的这个速度提升了百分之三十七,平均是 二十二点八分钟,每任务与这个 cloud ops 四点六是基本上持平,但成本的话只有 cloud ops 四点六的十分之一。 这意味着就是 m 二点五不再依赖任何特定的工具环境,都能够表现出色,并且发货能力很强。 在全站开发能力的话, m 二点五也覆盖了完整的这个编程场景,有这个零到一的系统设计,从零 开始规划这一个架构,一到十的这一个系统开发核心的功能,实现十到九十的这个功能的迭代,持续的添加新功能,九十到一百的这个代码测试 和这个质量把控。那覆盖的这个平台技术有这个 web 前端比较擅长 html, css, js, script, type script, 还有 regact, 安卓的应用的开发, ios 的 应用开发, windows 的 应用开发,服务端的 api, 业务逻辑数据库,它精通十数种这一个 go, 嗯, c c 加加 type script 和 python, java, javascript, php 和 lua dot 以及这一个 ruby 这些开发框架。同时它也具备这个搜索与工具的这个使用能力其实也是比较强的,超过了 gpt 五点二 通过它使用的这个较少的这个搜索轮次,然后比这个 m 二点一减少了百分之二十的这个轮次,就能够得到正确的这个答案。这说明模型不不仅仅是找得到,而且是找的更聪明,更快、更准。 那么同时他在这一个 rse rise 的 这一个评测里面,专业级搜索里面,他也自建了这个 rise 的 这个评测。那么模拟这个人类学家真实的搜索过程,不仅是搜索引擎的查询,包含在这个信息密集的网页里面深度搜索,他在这个评测里面也表现出色。 同时的话它通用了这个智智力的这个能力,包括数据竞赛专业的领域,它都是能够达到世界领先的这样的一个水平,包括 she 无工具和这一个 s s i code, 还有这个 if bench 指令遵循,以及 a a a a a l c r 长上条文的这个搜索能力也是比较的突出。那么它进步的是很好的一点,就是实现这一个办公的自动化,它通过这个 g p t 的 这一个 pro 就是 平均的这个胜率,对比所有的主流模型在办公场景下里面的表现是胜率在百分之五十九点零。同时它的这个 excel 竞赛里面也是领先的由这一个金融专家设计的这个评测。 那么它的这个速度和效率的话,其实也是在同行业里面是比较的快,它能推理速度达到一百 t p s。 另外它的任务完成率和综合评价都还是比较优秀的,但是它还有一些不足,它的不足的话第一个就是数学竞赛,它是比较弱的,专业科学的话它又也比较弱,超难题的话是比揭秘版要差了不少。 然后视觉理解的话,目前是不支持多云覆盖的话,其实不如这个 queen 三点五。然后它的百万 token 是 有比较大的优势,只有其他模型的呃二分之一到二十分之一, 另外它跟这个 queen queens 这一个三点五的这个比较优势就是第一个它编编程改 bug 这样的一个优势其实是比较强的,搜索 agent 的 这个能力也是比较强, 然后这一个数,呃,数学的推理的话是 queen 三点五更强,视觉理解 queen 三点五更强。然后多语言的话是 queen 三点五会更强一些。文档的这一个 ocr 其实是 queen 三点五更强。 另外就是办公的这个自动化其实是这一个,呃, m 二点五更强,推理的这个速度是 m 二点五更强。 api 的 这个价格其实是 m 二点五更便宜,模型的大小其实是 m 二点五更清亮,同时的话,本地的这一个运行是 m 二点五更容易, 那么核心的这一个需求的话,如果你是写代码修 bug 的 话,那么你可以选择这个 mini max 二点五,办公自动化预算极其有限,或者需要大量并发以及这个本地部署。还有这一个看图处理文档 的话,呃,就是前面的话,这些都是 minmax 会更强一些。然后如果你是要看图处理文档或者多语言翻译,那你用 queen 三点五更好一些。顶级的这种数据竞赛还是选择这个 gpt 五点二,另外简单开箱即用的话,那么还是选择这个成熟的币币源的这个生态 部署方案的话,它这里重点的话就是由这一个 a 镜的网页版和这个 api 调用,以及欧拉玛和这一个企业,企业端的这个部署推荐的这个配置是一百二十八 g 的 这个 mac 的 话,它能够稳定的部署,同时入门的话是要九十九十六 gb 的 这个 mac 或者是 pc, 然后实现这个有效的部署。还有就是多 gpu 的 服务器就实现全量的这个部署, 它要在这个三 bit 量化之后,只需要一百二十八 g 的 这个内存就能够实现这一个相关的,那么它是一个很好的编程学习助手,办公效率提升。同时的话它也是一个软件开发团队,能够进行这一个加速且便宜, 还有这个成本降低。另外它能够作为 open cloud 永远在线的这个 ai 员工,这也是得益于它极低的成本和极强的这个办公的这个 ag 的 能力。那么如果你想去开发这个 ag 等,就要定义好你的工具,定义好你的流程,调用对应的这个 api, 然后来做到这一点,然后它能够保证你的话就是极致的这个性价比,办公的自动化以及这个全球顶尖的能力。 以上的话就是我们针对这个 minmax m 二点五的这个深度解析和使用介绍,如果你感兴趣的话也可以随时联系我们,欢迎与我们进行沟通交流。

大家好啊,最近不是千万三点五的中小模型都发布了吗?我本来准备是想测一测模型,给大家汇报一下,结果没有想到啊,我居然迷上了另外一件事,我给你们看一下,这是一台我的工作站, 我现在把降噪关掉,给你们感受一下, 怎么样 怎么样,听到了吗?因为这个模型真的太好玩了,所以导致我三天都没有关这台服务器。 好了好了,回归正题啊,原本只是想试试这个模型能不能用在 openclaw 里面,结果一发不可收拾,我这个工作站都暴躁的运行了三天了,我老婆女儿都开始吐槽了,而且导致我最近是严重缺觉,成天就脑子里都想的都是这五只龙虾, 我也不知道,下次分享的时候说不定就是十只了。但是今天呢,我还是先给大家汇报一下我这个千万三点五的测评数据吧,然后我再给你们详细的分享我这几天的奇妙感受。 我先说重点啊,我这次测评用的是 s g 浪,推荐大家都用这个单卡,用的是四十八 g 显存的四零九零魔改版 f p 八的精度,这个配置呢,能跑二百五十六 k 的 上下文。 值得一提的是,应该是只有 s g 浪完整的支持了前缀缓存,也只有在前缀缓存才能体验住千万三点五这种混合注意力架构的真正牛逼的地方。我举个例子,如果你是一百 k 上下文,冷启动 perf 阶段就是十秒钟, 但是如果你带了缓存就是两百毫秒,所以直接的结果就是,你哪怕有很长的上下文,但是他的首字延迟就是很低,输出还特别快。 我的测试场景给大家讲一下,就和我们的真实场景特别像,我每个模型测试都是从二十 k 上下文开始,一直增长到二百 k, 每次增加四 k 上下文,模拟我们真实环境下的长任务,而且他是在缓存命中的 三十五 b a, 三 b 这个模型啊,他最初的速度是一百二十头克每秒,最后衰减到了八十,衰退不算多。 而二十七 b 这个模型就逆天了,虽然它一开始就是个归宿,二十 to 每秒,但是到了二百 k, 它依然能保持十八 t 的 每秒。而且最离谱的是,你们看到了吗?因为它有缓存啊,所以即使缓存里有两百 k 的 上下文, 我输入四百 k 的 togg, 它的 perf 耗时只有两百毫秒。所以实际的生产环境,用人话来说就是在那种多工具调用的环节, 其实你感觉不到它很慢,因为工具调用这个场景啊,它输出的 token 都比较少,所以它响应也很快,很快就出结果了。你的直接感受就是对话再长,它的速度都不会衰减。我还做了一个测试啊,就是用 agent teams 同时开六个 agent, 哎呀,那个感觉真的是太爽了, 速度还能叠加,我也不知道是为什么,就直接从后台的输出,你就能看到它能达到一百二十多个每秒,而且这个二十七 b 模型,它是可以一键启动 agent teams 的, 我之前拿千万三点五 plus 都测试失败了, 他能同时开六个成员,速度能叠加到一百二十 t, 而且我还测了一下一百二十二 b 那 个模型,我个人的这个体感二十七 b, 他的智商是超过这个一百二十二 b 的, 只是个人感觉啊,就是从各方面数学,编程能力他都很强, 唯一的缺点就是他单进城特别慢,于是我就想到了一个妙招,哎,单进城很慢,那我就多进城呗,我可以拿它养龙虾呀,而且我可以一次养好几只,你养一只龙虾慢,那我养多只他不就快了吗? 这就直接导致我的服务器一直在咆哮,二十四小时都是这个咆哮状态,一直都满载,我家电费就更不要提了, 给大家分享一下我的龙虾啊,我现在一共养了五只龙虾,这个是主控,然后他部署在一台服务器上面,然后剩下的四个是在这台服务器的容器上面。给大家看一下,这是这四个小弟, 汤圆、奶茶、闪电、布丁,然后他们自己的持久化文件,都有各自的目录,然后这里面有他的记忆啊,还有他的目标啊, 我现在让他们干了一件什么事呢?就是主控,主控大佬会通过定时任务,就作为导师来检查他们每一个人的这个目标文件,看他在这个周期里有没有完成目标,然后给他写入一些新的目标。然后呢,这些小弟也是通过定时任务启动的, 然后他每次定时任务就是会完成他的这个 goals, 然后更新他的 memory。 他 们的目标是什么呢?就是跟他们一起开发了一个论坛,然后这个论坛用于让他们沟通,他们一直 在开发这个论坛需要的功能,然后一直在写入代码,然后重新部署。这样子论坛长什么样呢?大概就是这个样子啊,他们在不停的会发一些信息, 就是汇报一下自己的工作进度呀,就是彼此沟通吧,但是我觉得现在还不是很好,他们还是各干各的,还没有彼此的连接起来。但是这是我的一个小的社群实验,就我想看看他们能不能给自己开发一些东西,让自己变得更好这样子, 所以我现在也在尝试不同的部署,但是现在你国产的这些 coding plan, 他 们都有限制并发嘛,对吧?所以你想要养这么多只龙虾,同时你就你也干不了别的了。我现在呢,给大家看一下,我现在在模拟当初论坛开发那个流程,现在是有六个 agent teams, 有 六个成员, 然后他们全部是通过千万三点五二十七币这个筹密模型在本地运行。看,就是这个我在这个 s g 浪上部署的这个模型,然后后台的这几只龙虾呢?他们是定期任务,他每十分钟会有一波高峰, 但是虽然说每一个县城只有大概二十多头肯,但它整体你看它有时候能跑到一百,甚至能到一百二十多,就是它六个跑满的时候是有一百二十多头肯每秒,然后它 prefill 的 速度也很快,所以其实我感觉虽然如果单县城去使用我会很烦,它的速度很慢,但是我一次开很多,我就不管了,让它们自己去玩去, 我就觉得这种效果还蛮不错,至少这个速度我还是能接受,毕竟他是个本地模型,而这个二十七 b 模型其实非常聪明,非常聪明,我如果把这个二十七 b 模型换成三十五 b, 那 个三 b 激活的采用,那这个速度就离谱了,差不多六七百头肯没秒完, 但是你就会发现他们一直做一些无用功,但是二十七 b 模型就会感觉更聪明一些。反正这个论坛我发现不断在产生一些变化,我录完刚才那一段,然后我写了一些提交了, 但是我看到论坛他们已经把论坛已经甩的不像什么了,我觉得非常有意思,不管他们干成了什么事情,或者没干成什么事情,你你都能发现出一些很有趣的事情。我们看到这个我现在这个主控已经很着急了, 他说他大家都没有提交,然后我现在给他只是让他做一种新的沟通方式,但是几个小弟嘛,其实就觉得还不错,他们觉得这个哎,任务都做完了,没事了, 就是你们也可以试试这样养龙虾,说不定大家能摸索出来一种,让他们用一种方式,能协调合作,哎,我觉得可能就会很有收获。所以如果你是有四十八 g 以上统一内存,比如说 mac mini 啊, mac studio 啊, ai max, 三九五啊,或者是你有这个五零九零,或者是我这种 四零九零魔改版啊,我恭喜你,你买的硬件升值了,因为他们养龙虾体验实在是太好了, 就是因为三十五 b 和二十七 b 显存差不多啊,你想想你就相当于有了两种模式的模型,可以一键切换,一种是速度暴躁,但是智商略低,有点像战士那种。 另外一种就是归宿,但是智商爆表,有点儿像法师,你可以随时切换他的人格,是不是这个道理?当然了,你依然可以用那种 coding plan 版的高级模型,用它来做编排者,就相当于你养了一个老大,但是小弟可以开很多, 你可以尝试能不能形成一个蜂群,我最近就在实验。那我之前不是还分享了一个进化体系吗?如果可以用循环的方式来运行 evover 龙虾的技能体系,就能快速的自我优化。我最近也在不断的尝试这个领域,看看能不能实现我二十四小时的路谱,看它能不能自我进化。所以请原谅我这期没有什么干货,都是我的一些畅想。 我这个人就是脑洞比较大,但我在 ai 时代所有收获都是受益于这种脑洞大,所以从这篇起也算是开启了我的一个新系列。我后面会不断地分享我养龙虾的心得,也请大家持续关注。好了,以上就是本期全部内容了,谢谢大家!

春节党真正的杀手锏来了,这事也只有中国团队能干的出来了。从现在开始, ai 大 冒险将正式进入白菜价时代。最近我们都被 open club 疯狂刷屏,因为它不只是能够回答问题或者编辑代码,而是它可以真正开始全自动思考和帮你执行复杂的任务了。比如 这个叫 alex 的 海外网友,他的 open cloud 甚至在完成任务后自己在网上买了个电话号码给主人汇报结果。你不需要再教他任何做事的过程,而是可以直接把结果当做目标布置给他。但当你真正把这个全自动 agent 玩起来之后,就会发现这玩意对 token 的 消耗实在太高了,甚至有人一晚上就跑掉了一千美元的 token。 对于大部分人来说,已经不是想不想用 ai 了,而是能不能养得起的问题了。而就在刚刚,元神千问发布的千问三点五直接给全球 ai 圈来了一次降维打击。他不再信奉大力出奇迹的暴力美学了,而是进化出了一套极致稀疏的 m o e 架构新模型,凭借三百九十七 b 仅仅激活十七 b 的 mini 尺寸,直接 在多项精准测试中打拼,甚至超越了 g p t 五点二和 jimmy 三 pro 这些超万亿参数规模的闭源巨头,不仅把算力成本打掉了百分之九十, 显存占用降低百分之六十,推理效率大幅提升,最大推理吞吐量可提升至十九倍。而这背后的秘密就是它通过引入了混合注意力机制,让模型不再把每一个 token 都要和所有上下文做全量注意力计算,而这可以抓取信息中的重点,自动判断出需要精读或者略读的部分。加上训练时又加入了原声多 token 预测, 就让模型输出不再是慢慢崩字了,而是提前规划整段内容。所以你会明显感受到,不管是在长文本生成、代码补全,还是在 agent 长链路任务这样的高频场景中,都能实现近乎秒回的响应速度。更觉得是它还是一个原生多肽模型,也就是说,它不仅能够处理文字,而是能够原生理解视觉信息。 看,我只是让他看了一段视频,他就自动帮我写出了一个配套的教程文档,甚至连视频中没有提到的基础细节都给一一写了出来。这意味着,未来的机器人或者模拟人类操作手机和电脑的 agent, 都将狠狠地提升一波智商。更重要的是,千万依旧选择了直接开源。也就是说,现在只需要一台高配的 mac, 可以直接在本地免费跑起来了。所以,当开源模型在核心能力上追平甚至超越闭源,也就意味着 ai 基础设施的标准制定权正在从闭源巨头的手中向开源力量转移。未来将不再是模型与模型的比拼了,而是生态范式的替代。显然,阿力已经在这场转移中走到了前面。

家人们有个大新闻,必须得跟大伙唠唠,那个在全球火得一塌糊涂,号称真正能干活的 ai 助手 opencloud, 你 们猜它现在掉用量第一的模型是谁?不是美国的 cloud, 也不是谷歌的 jamie, 居然是咱们中国的 kimi! 就 在前两天,数据显示, kimi k 二五在 opencloud 上的掉用量直接登顶, 超过了两百六十亿个 token。 连 opencloud 的 原作者都忍不住自掏腰包给用户补贴免费用 kimi 的 额度, 这说明啥?说明在让 ai 真正去办事儿这个赛道上,咱们中国模型已经不仅仅是能用,而是真香了。为什么是 kimi 增大硬核优势?那很多老铁要问了,旺财牛凭啥是它?它?我给大家盘盘这三个硬道理。 第一就是记性好, kimi 最擅长的就是长文本, open class 要帮人处理邮件,读文档、写代码的,动不动就是几十万字的内容。 kimi 这超长记忆的本事,刚好治好了 ai 的 健忘症,干活不丢三落四。第二就是性价比,咱不吹不黑,同样干一堆活, kimi 的 成本可能只有国外顶级模型的零头。对于 open club 这种需要二十四小时不停跑任务的勤劳蜜蜂来说, 省钱就是硬道理。第三就是能组队,最新的 kimi k 二点五能自己指挥上百个小智能体并行干活。这就好比以前是一个人在搬砖, 现在是一个包工头带着一百个工人同时干,这效率能不高吗?还有朋友在后台问旺财牛, kimi 这么猛,背后是哪家公司在提供算力支持?是不是某某上市公司?这里旺财牛得跟大家交个底,也要提个醒月之暗面, kimi 的 公司作为头部独角兽,它的算力底座 通常是多家主流云厂商混合部署的,这是行业惯例。为了保证稳定和安全,具体的供应商名单属于商业机密。网上那些说独家绑定某一家的小道消息,大家听听就好,千万别拒此去炒股。 咱们看的是中国 ai 技术的崛起,是国产大模型在全球舞台上的硬实力,而不是为了炒作哪个股票代码。这一点咱们必须得清醒。从被质疑到登顶全球开元宝,中国 ai 这一步走的不容易,但走的很稳。 你觉得国产 ai 接下来还会在哪个领域爆发?是医疗、教育还是自动驾驶?来评论区跟旺财牛聊聊。我是旺财牛,只聊干货,不瞎推荐,咱们下期见!

今天用 ai 都做啥?首先 opencloud 给他升了个级,现在他飞速用的是长链接,可以发图片,比较顺畅。之前发图片还是挺麻烦的,升级了之后用起来也还是比较方便。但大家记得要去配 magg 的 模型啊, 配了之后才会真的生效,需要你的模型支持动模态的,算是深度体验了。这几天持续在用,走在路上也喜欢跟他发指令,让他去帮忙做事。 整体用起来对我来说帮助最大的是在于打杂的事,我觉得还是离不开他,有些我可能走在路上处理不了的事情,那我可能就 发个消息让他就去帮我做了。但如果要做复杂的事情,这个还是得回归到更工程化的这些工具上面来。就比如说 codex, 他 最新桌面版还送量,现在真的是量大管饱,这用用不完。这个 确实也很不错,而且品质也还行,基本上是能打 oppo 十这个也有用。这个四点六也出来了,今天才来跑了个项目,体验了一下,但不过确实资费太贵了, 可能明天还再用一下蜂群的模式,看怎么能带一下这些差一点的模型,让他们去做蜂群来到这边。现在每天自己的工作模式都会升级, 今天已经把自己私有化的一些工作逐步都开始做集成了,集成到相当于我这个电脑一启动我就有五六个服务就开始跑起来了。到现在集成了一些像什么管技能的,管自己的视频生产流的, 管一些搞建深层的,以及自己参与的一些项目,那看板还没加进来,就把这些东西全部集成起来,这个未来就是自己的一些看板,自己所有的工作呢,都会私有化的去做。 这个我们以后可能就真的每个人都有他自己的一些工作方式了,就不会说去用那些云服务自己的工作流程,按自己的意愿想怎么搭怎么搭。比如说我想要做表达,会有 核心观点、事实,我就把这个东西传入我的工作流里面,我的 ai 他 就开始去跑,帮我去梳理文字稿,整理我的视频稿以及里面图片资源,那后续我想表达东西,他快速就帮我准备好资料了,加上我口播去讲解更实际的情况, 以及我的观点视频就成型了。未来想要表达的人,那你有这么一套自己的工作,你表达起来就非常的宽了,你的一次性表达可以产生文字稿、视频稿,你的分发,你就可以做起来了。 这我觉得未来面向个人,你表达的人真的是一个越来越好的一个时代。再往下这个就是 open 做的 一个小的功能,因为我有生产稿件的需求,比如说微信公众号、小红书,那我可能一次性要生产好多篇,那每篇单独跟他聊也挺费时间,那我就想让他批量去做,搞个定时任务,他就做好了,那 批量做好了,每一个就跟他聊去改,这个也很慢,聊天其实他是一个商量的过程,他不是很批量,那我如果我们在谈论工作,那我就批量的做成这种多稿件的,那他写好的稿, 我就直接把意见写在右边,他就根据意见定时再去改,这样我们就可以达到这样生产的方式。结合 opencloud, 那 我在路上在任何地方就去把审批的工作给做了,那这儿显示的是本地的,那他发我的有个是外链的,就不展示了。 安全第一,大家也需要去注意这一点。未来的工作形态真是多姿多彩,真是让人充满期待。每个人都值得去打造一套自己的工作台,自己的 ai 的 工作方式。我也分享一下工作上的感悟, 也希望能够给大家一些好的灵感,也会再跟大家分享。我们在日常复杂工程化的问题就是多分工,复杂场景,我们怎么去用 skill, 用这种分工协助机制把这个工作 ai 化,去真正的做到 ai 化的转型。 希望你能够给企业转型,想要把内部的工作 ai 化改造,提供思路,提供灵感,今天就到这睡觉, ai 得学觉也得睡,身体第一,大家不要熬夜哦!

今天的话给大家带来一个真正的干货, 那么我们会从底层解析这一个阿里的大模型,它最近发布的三点五 queen 大 模型,三百九十七 b 的 参数的这样的一个大模型,它是怎么样研发出来的?然后并且给我们普通人应该怎么样去使用,对我们普通人有什么样的价值? 我们来详细讲解解构这样的一个模型。那么首先的话我们会去进行这个模型的这一个介绍,那么这个模型其实是什么呢?这模型是由巴黎最近两天新推出的这一个新一代的超级的 大规模的这个模型,然后它具备的这一个能力是全模态式的能力,是聊天、看图、写代码,执行复杂任务,另外的话就是支持完全免费可用。 这里的 queen 的 话就是阿里的这一个 ai 大 冒险的品牌,三点五的话抵三点五的这个版本,同时的话三百九十七亿的这一个参 数,然后 b b 的 这个名字其实是十亿的这个参数, a 十七 b 的 这个意思其实是指每次处理时只激活一百七十亿的这个参数, a 是 active 的 意思,然后这在这样的话就是能够保证这一个专业性时,只激活一百七十亿的这个参数, a 是 active 的 意思, 然后这在这样的话就是能够保证这一个专业性,同时也实现了极致的这个效率。那 那么就想象一下,就类比给大家做一个比喻啊,这里想象你拥有一个三百九十七名员工大公司,但每次处理任务的时候只需要一百七十名这个专家出马就够了,那么这样既可以保证了公司有足够的专业人员覆盖各个领域,同时又能够保证 做事的这个效率和成本,给大家节省这一个,比如说电电力或者部署的这一个成本。那么为什么这个模型是比较重要呢?首先的话 这里的话就是它是完全开源且免费的,那么你可以免费下载,免费使用,免费商用,然后免费的去微调或者修改。同时的话它是具备这一个 g p 五点二 和 cloud 四点五 uppers 以及 jimmy 三零 pro, 它们这些模型都是闭源的,你只能通过这个 api 付费使用。 这里的话有一个基本的这个评分,那么 queen 的 这一个三点五在上面侧榜评分的话,是基本上跟这一个 g p t 五点二 cloud cloud uppers 四点五和这个 jimmy 三零 pro, 然后基本上能够持平, 在部分的方面甚至能够优于他们,然后少部分会劣于他们。然后第三个亮点的话,其实它就是原声多模态,它不只是可以支持文字,它还能够看,那么这里能看的话其实就在于 并二点五先学文字再加视觉的这种拼错方案它没有采取,而从训练开始就能够同时学习文字和图像,是真正的这一个原声视频语言的模型, 从训练之初的话就融合了这个图文理解能力,那么而非简单的这个拼接看图答题和这个文档处理,它其实能力就是全球是他们官方说是比较领先的。 然后它同时能够做到这一个看图回答问题,给他一边一张图片,他能够描述内容,回答相关的问题。 o c r 的 这个文字识别和识别图中的这一个文字表格和公式,同时它也可以基于这个食品视频来去理解分析这个视频内容,并且回答问题。 同时它也可以支持操控电脑这个界面,像人一样看屏幕,点击这一个按钮,输入这一个文字。那么核心的这个技术讲解的话就是模型的这个基本参数。 模型的这一个核心技术架构,它是采用这个 mo 一 混合专家的架构,它也是用这个 deepsea 一 样的这样的一个架构,然后去做到它有几个优势, 首先的话它是的模型的架构是,嗯,第一它核心的优势是 英国语言模型加上这个视觉编码器,然后既能够理解和生成文字,又能够理解图像。同时的话它基于总参数量是三百九十七币,也就是三千九百七十亿的模型的这个知识容量,但每次激活的这个参数的话,是在十七币一百七十亿的这个参数, 然后每次干活其实只有一百七十亿的这个参数在消耗你的这个电力和这个显卡。那么另外的话,他隐藏的这个维度是四零九六,那模型内部 这个信息的维度是支持这个四零九六这样的一个信息维度,词表的话是二十四万八千三百二十个这个模型的这个词,那么层模型的层次话是在这个六十层 模型处理的这个信息的深度是能够达到六十层的原生的这个上下文的长度其实是能够一次性处理二十万字 至二十六万的这个左右的这个 token, 同时可扩展的这个上下文是一超过了一百万的这个 token, 然后用技术手段可以处理七十六万字的这样的一个呃大语言模型,支持语言的类型,类型的话是覆盖全球绝大多数的这个语言和方言达到二百零一种,这是他的这个优势,那么核心的这个思想是拒绝全员的这个出动,不同于这个传统的模型要调用全部的参数, 而 mo 一 的这个架构仅激活最适合当前任务的这个专家参数,避免这个资源的浪费,同时的话它可以做到这一个 queen 三点五这个配置智能路由系统内置了五百一十二个专家,那么智能路由每次仅挑选十个最优的专家和一个共享专家十 共十一个来去协同工作,同时它的这个底层的技术技术原理的话是 拥有三千九百七十亿的这个参数的规模,大大的降低这个推理的成本,同时实现这个推理的能力和运行的效率达到一个完美的平衡。 为什么这个架构能够做到又大又快呢?这里的话我们给大家做一个比喻,那么 mo 一 在去年 deepsea 的 其实已经提出来了这样的一个方式和概念,那么我们的话 在这里我们再去给大家做浅浅的去给大家讲解一下 m o e 的 话,它 传统这个模型每次处理的时候它会加载所有的这个参数,那么而 m o e 的 这种架构就是每次处理它就是指选择部分的这个参数来进行加载和参与。 而 queen 的 这个 mo 一 的这个专家配置,它其实总的这个专家数刚刚讲到有五百一十二个专家,每次激活的路由专家是十个共享,这个专家是一个 每次都参加的这个共享专家,这是作为共享的,然后每个专家中间的这个维度是幺零二四的这一个维度,那么就好比一所学校有五百一十二位专家教授的这一个超级大学学生提出一个问题之后, 那么这个学校有一个智能分配系统,会挑选出最适合这个问题的这一个十位专家来解答这个问题和研究这个问题,同时再加上这一个学员的一个共享的班主任全程来参与,这样的话就可以保证这一个 模型的这个稳呃可能性,同时又能够实现有效的这一个模型的这一个呃稳定性和节省这个能源。其次的话,它还有一个创新的话,它就是能够实现这一个 getty 的 这一个 delta。 net 创新的这个注意力机制。那么传统的这个 transformers 模型使用的是这个自注意力的机制 self attention, 然后处理这个长文本时候,计算的这个量会以这个平方级的来去增长,比如说文本越长的时候,它速度越慢,消耗的越厉害。 而 queen 三点五的话,在百分之七十五的这个层里面使用了这个全新的 getty 的 delta。 net 这个门控 delta 网络,然后替代这个传统的这个 transformer 注意力的这个机制。 那么这里的话类比的话就是模型,它的六十层分布为每四层为一组,而第一层的话是由这一个 getty 的 delta。 net m o e 线形的这个复杂度,然后处理比较快,然后第二层也是这样的一个架构, 然后第三层的话也是这样的一个架构,第四层的话采用标准的 attention m o e 通通过二次的这个复杂度,然后保证这个精准性,那么累计的话,它是有四十五层的这一个 delta。 net 加上十五层这个标准的这样的一个 attention, 这样的一个架构, 保证它处理速度快,同时又更加的精确。每四层为一组,然后六十层这样的一个架构,它能够解决,就是传统的这个传送门处理长文本的时候,计算量会随着长度成平方级的这个增长,导致这个速度急剧下降,同时难以应对这个百万次的级的这个任务。 而利用这个 delta 的 架构的话,它就是每四层为一组,六十层的话就分为十五组,前三层的话都用这个 delta。 net 加上 m o e 的 这个架构,保证现行的复杂度,加上这一个 处理速度比较快,然后第最后一层,每一层的最后一层是用二次复杂度,然后表保证这个精准性。那么创新性的使用了这个 gucci 的 deltonet 替代这个传统层,然后利用这个复杂度降至这个接近线层,无论处理这个十万字还是一百万字,它的速度差就能够做到微乎其微。 同时的话,它的这个模型架构的话是采用这个混合模型架构设计,那么在这个六十层的这个架构里面,四十五层采用的是这个 deltonet, 而仅十五层保留这个标准注意力,兼容了这个常文本处理的效率和关键信息理解的这个准确性 核心的优势就是能够做到尽限性的这样的一个呃计算的计算的复杂度,同时处理这个一百万 token 的 长文本时,不会像传统的这个方案带来这个计算量爆炸。那么右边的这张图就是这样的,传统注意力是它计算量会随节点的这个数成平方级的这个增长, 那么采用这个 daronne 的 这种价格的话,就会极大地节省了这个计算的这个时间和成本。 那么 delta net 它用六十四个 v 的 v 头和加上十六个这个 q k 头头的这个维度一百二十八,然后标准的这个 tension 层,然后三十二个 q 头加上两个这个 k v 头,然后做到这一个 g q v 的 这个分组查询注意力,然后做到头维度是二百五十六。 然后其次的话就是它的这一个思考模式和直接模式。 queen 三点五的话,其实它是支持两种工作模式的,一种是思考模式,一种是直接模式。那么思考模式它是就是我们常提到这个 thinking 模式。 think 模式的话,它是先内部推理再给出答案,它适用的这个场景是数学编程复杂推理, 它的速度,速度会比较慢,但是它的准确度会更高。它的这个推荐的这个温度指数是这个 temperature 是 零点六,同时它推荐的这一个 top p 的 话是零点九五,那么推荐的这个 top 杠 k 的 话是二十,最大的这个输出长度是 是八万一千九百二十的这个 token。 而直接模式的话就直接给出答案,适用于日常的这个对话简单,查询较快,那么针对简单的任务才能够做到足够好。 temperature 建议的话是这一个零点七,然后推荐的话是这一个 推荐的 top p 的 话是这一个零点八,以及这个推推荐 top k 的 话是二十,它的这个最大输出长度是三万两千七百六十八, token 也就是三三万字左右。那么注注意就是 queen 三点五不支持这 queen 三 的 syncing 和 non syncing 的 这个切换命令,需要通过这个 api 参数 enable syncing 才能够切换这个模式。 那么它另外的话,它还有个核心的这个特点的话,它其实是支持这一个。呃, 它采用了这样的一个 multi token prediction 多步预测的这个训练机制,那么传统的模型每次只能预测一个单词,而通过这个 m t m t p 的 话,它的这个多步预训练的这个方式每次可以同时预测接下来的多个词。这样的话在模型推理过程中可以使用这一个推测解码既 技术来去加速这个生成,显著地提出提升这一个输出的这个复杂度。然后这里面就谈到了几个专业术语, parameter 就是 参数的意思,那么模型就是模型渠道的这个知识,数字越大的话,它知识就越多。 token 的 话,它是 ai 处理的这个文字的基本单位,一个中文约约相当相当于就一点五个左右的这样子的 token。 m o e 的 话是混合专家模型,它是只激活部分的参数来提高这一个效率注意力的机制是 attention 模型,理解这个文本的这个词与其之间的这个核心的关关系技术,然后上节文的这个长度, 上节文的这个长度是模型一次能够记住和处理的这个最大的文本的这个长度,还有这个 量化的话,是把模型通过压缩使其占用更小的内存的这样的一个技术。而 g g u f 是 一种模型的文本格式,适用于在个人的电脑上面运行 api 的 话,它就是应用程序的这个接口,用于网络调用 ai 的 这个能力的一种方式。 v l m 它是高性能的这个模型处理工具,用于服务器。欧拉玛是简单易用的这个本地运行的工具可以适配于个人使用。拉玛点 c p p 是 在 cpu 上跑大模型的这个工具, 然后 q 三点五在整个 ai 的 发展中的这个位置,二零二二年的十一月,恰的 g p t 三点五发布,然后二零二三年 三月的话, g p g 四发布,二零二三年八月的话,阿里首次发布了这个 queen 七 b 的 模型,然后续在二零二四年的这个一月发布的这个 queen 一 点五有信性能大幅度的提升,然后 quan 二系列的话做了开源模型的质变,但其实准确来讲,嗯, quan 二点五它引入了这一个 mo 一 的这个架构,但是它其实它的这一个能力和结果都差强人意。 quan 三系列的话,思考模式的这个加入芯片模式的这个引入,但是它的这个能力其实本质上来说还是有非常 大的一个缺陷,就是它在跟 deepsea 相比较,它是有一些明显的不足的。那么在二零二六年的这个二月份, queen 三零五正式开园,那么当前版本的话,它其实明显优于了这样的一个二零二五年的一系列的模型,包括 deepsea 的 一些模型, 然后它能够从原来的这个模型上面去由这个纯文本上升为了原生多模态。然后同时的话,它用这个 getty 的 delta net 全新的这个高效注意力机制,使使其处理这个纯文本速度更快。另外的话,它有更强的这个 ag 的 能力, 能够保证这个原生知识的工具的调用和网络搜索代码执行以及这个视频解读。同时它也支持全球绝大多数的这个语言,那么同时它也获得了这一个阿帕奇的这个二点零的许可,真正的这个商业友好型的开源。 那么这个大模型意味着什么呢?对于这个学生,他相当于是个免费的私人的这个超级 ai 家教,他可以解题,看图,辅辅助写作。那么他对于这个程序员,他是一个免费的一个代码助手,能够理解复杂的项目,修修补修善这一个 bug。 创业者的话就是零成本拥有这个企业级的 ai 的 能力,但是他同时三千九百七十亿的这个参数的部署成本,其实它成本也是比较高的,一年的这个服务器加电费的费用应该会在 五十万左右。那么研究者的话是开放这个权重,能够可以深入的进行研究和微调。普通用户的话可以通过 api 在 线平台,然后使其接近这个 g p 五级的这个 ai 对 话体验。 那么这就是我们今天的这一个针对阿里除夕最近发布的这个 queen 三点五的这一个初步的结构,下节课的话我们会去 根据它的这个性能,根据跟其他的闭源的模型和开源的模型进行详细的对比和分析,以及它对于我们普通人能够带来哪些价值,那么也非常谢谢大家能够看到这里, 如果你有任何的关于 ai 的 这个合作或者问题的话,可以随时联系我们,谢谢大家。