粉丝16.7万获赞38.2万

mini max 说 m 二点七是首个能自我进化的大模型,我实测了一下,结果比较跌眼镜。 大家好,我是 ai 学习的老张。 mini max m 二点七上个月发布,现在正式开源了二三零 b 参数魔力架构,最大的卖点是模型能自己更新记忆构建技能。官方说经过一百多轮自主优化, 性能提升了百分之三十,代码能力号称对标 gpt 五点三, kodex swe pro 跑到百分之五十六。办公方面, word excel ppt 高保障,编辑也拿了开元最高分,部署门槛确实不低,权重两百三十 gb, 官方建议至少四张 h 二零零。 好消息是生态很全,欧拉玛云端已经可以免费用了,一行命令直接跑。 e l l m 和 s k l o 都有 day 支持, i v d o 这次也给了很大力度,做了 f p 八毛以内核优化,吞吐量直接提升二点五到二点七倍,等后续量化版出来,门槛应该还能再降。 但说实话,我用 avida 的 线上环境实测了一下,阅读理解, s v g 代码生成审美,三个用力跑下来,结果比较让人失望,感觉也就 q one 三的水平,跟 g o m 五点一半斤八两,两个都远不如 q one 三点六 plus。

有人说尼莫场除了快一无是处,那这一期我们来测一下在长上下文中,他能否找到关键信息,并且速度怎么样。我们就随便找了一个上市公司的 pdf 版本年报,我们随机抽选了两个经营细节数据,让模型从二十万长上下文中大海捞针,找到这两个精确数据,那么我们就开到最大。 然后这个尼莫创 amd 单卡三十二 g 的 加载速度,大概是在两分三十秒加载完了二十一万上下文,并且准确的找出了两个数字。然后我们测谷歌的集码四的二十六 b 模型,也是 m o e 模型, 但是我发现这个 mo 模型如果拉到二十六万的上下文,它就是需要三十多个 g 的 显存,已经爆了,那我就把我的另一个显卡也开起来。现在我是 amd 和英伟达的混跑,当然速度的影响我,后面我会再测一次这个尼莫创在两张卡上的速度,吉玛斯的读取速度最后是七分三十多秒, 数字也完全准确。然后我又在双卡状态下,我又测了一次这个尼莫创的读取速度, 居然能达到一分五十秒,如果是用于文档处理,或者需要长上下文携同工作的本地大模型,那我认为这是一个非常好的选择。这跑二十六万上下文的三十 b 模型才要二十几 g 的 显存,那还要什么自行车呀?

酷狗发布的 jamax 家族这次把本地部署的门槛彻底拉低了,它包含了从高性能工作站到边缘 iot 设备的四款模型,不仅原生支持图文视频多模态理解,还拥有最高二五六 k 的 超长上下文。 最关键的是,全系全面转向了 h 二点零协议商用,完全没有后顾之忧。首先来看这个家族的扛把子三十一 b 电子版本,它采用全密集架构,三百一十亿参数在推理时全部激活, 这意味着它拥有该系列最强的逻辑能力和输出质量。如果你手里有八十 g 显存的 h 幺零零或者多张消费基显卡组基群,且对结果的精准度有极致要求,选这款就对了。 接下来是性价比最高的二十六 b m o e 版本,这里要重点解释一下混合专家架构的优势。虽然它的总餐数量有二十六 b, 但单次推理时系统只会激活其中三点八 b 的 参数,这种机制在保证智商的同时提高了每秒的吞吐量。 对于大多数本地桌面用户来说,这款模型在响应速度和性能之间达到了完美的平衡。针对手机和 l t 设备, google 推出了 e 四 b 和 e 二 b 两款端侧模型。这里引入了一个关键的 pl e 单层嵌入表技术,简单来说就是让大体级的磁表在查找时不全面参与常规计算,从而大幅降低内存占用。 一四 b 有 四点五 b 有 效参数,适合树莓派或 jason, 而一二 b 只有二点三 b 可以 直接跑在手机上,让端测 ai agent 成为可能。最后总结一下全系列的通用能力, 在上下文长度上,大模型支持二五六 k, 小 模型也达到了幺二八 k, 足以处理超长文档。再加上原生的图文视频理解能力,让它在实际应用场景中非常灵活。 在实际性能测试中, jam 四三十一币的表现非常强悍,尤其在 g p q a diamond 科学推理测试中,拿到了百分之八十五点七的高分, 但更核心的竞争力在于它的 token 效率。同样,一个任务竞品可能需要一百五十万个以上的 token 才能说清楚,而 jam 四只需要一百二十万个,这意味着它说话废话更少,逻辑更直接,在实际部署时能显著降低推理成本。 如果把它和国产明星 q n 三点五二十七 b 放在一起对比,你会发现一个有趣的现象,在一些细分的工具调用跑分上, q n 确实略占上风, 但在基于人类真实偏好的 rena a i yellow 评分中,两者几乎打平。这说明在实际的人机交互体感上, g m 四三十一 b 已经达到了顶尖水平。很多人好奇为什么价格没怎么变,性能却原地起飞? 其实拆解底层代码会发现,它依然沿用了 paperstorm g q a 以及局部全局混合注意力机制。这次性能的飞跃完全不是靠改架构,而是归功于训练数据的质量飞跃和训练配方的深度优化。这再次证明了在当前大中型阶段,高质量的数据才是真正的核心竞争力。 现在进入实操环节,如果你追求极致简单,首选奥拉玛。首先把版本升级到零点二零以上,然后直接在终端输入命令,想要轻量化测试,就运行一二 b 版本。如果追求性能和速度的平衡,强烈推荐运行二十六 b 版本。 对于 macm 系列芯片用户, m l x 框架配合 turboq 是 史诗级加强,它通过压缩 kb 缓存,直接把内存占用,从十三点三 gb 砍到了四点九 gb, 整整节省了百分之六十三的空间。 具体的部署命令就在屏幕上,这里有一个关键的权衡,开启这个优化后,解码速度会慢一点五倍,但它能让你在 mac 上跑满幺二八 k 的 长上下文。对于处理长文档来说,这个招牌绝对稳赚不赔。 如果你是显存困难户或者即刻玩家,可以尝试 einslof 和拉玛 cpp, 只用 einslof 量化,只要六 gb 显存就能跑起一二 b 或一四 b, 甚至能构建支持网页搜索的本地 agent。 而如果你有三张四千零九十并行二十六 b m o e 版本的速度能达到惊人的每秒一百六十二个头啃。此外,通过实验性的 turbo quant plus 分 支,能把三十一 b 模型的体积从三十 g b 强行压到十八点九 g b, 让大模型在消费级显卡上跑起来。 最后是企业级生产环境,建议直接使用 v l l m, 它原生支持多模态输入和二五六 k 的 高吞吐量,并且完美兼容多卡并发。 开发者在实测中发现, v i l l l 搭配最新版的 transformers cool, 可以 非常稳定地调用 jam 四的工具接口,适合构建大规模的商业应用。在部署之前,有几个坑必须提前告知。首先是模态缺失,虽然官方宣传支持音频, 在目前音频输入请在 google ai studio 线上可用,所有的本地框架都还没适配。其次是稳定性问题,如果你使用 l m studio 运行三十一 bit n s 的 g g u f 版本,可能会遇到死循环输出的 bug, 建议等待社区修复。最后是能力边界,在处理复杂的函数调用时, e 二 b 和 e 四 b 这类小模型的表现不如同级别的竞品复杂任务建议直接上二十六 b 或三十一 b 版本。最后根据你的设备和需求 直接看这个部署。建议企业商用直接选 jam 四 high party 二点零协议让你没有任何法务后顾之忧。个人 pc 或游戏本用户强烈推荐二十六 b m o e 版本,单卡四千零九十就能跑通超长上下文,且响应极快。 mac 开发者请认准 mlx 框架,记得开启 turboqant 来解放统一内存。至于 i o t 创客 e 二 b 和 e 四 b 证明了六 gb 内存也能跑起。智能 agent 是 端侧智能的最佳选择。

我们直接来看 mini max m 二点五这款开源大模型如何在性能和成本上掀起波澜。 各位如果把二零二三年看作是百魔大战的元年,大家还在比拼谁的参数更大,上下文更长,那现在也就是二零二六年初,战场已经悄然转移了,不再是单纯堆齐参数, 而是谁能用更低的成本提供更全面、更强大的能力。 mini max m 二点五的出现就像一颗重磅炸弹,它不仅在关键的编码和智能体能力上几乎能打平 cloud、 oppo 四点六这样的顶级闭源模型,更关键的是, 它的成本只有后者的大约百分之一。这传递了一个非常清晰的信息,顶级 ai 能力不再必须意味着天价成本。这不仅仅是技术上的突破,更是商业逻辑和普惠理念的一次完美结合。我们来看看 m 二点五的核心定位。 很多人可能会觉得,要对标 cloud opus 这种级别的模型,参数肯定得是个天文数字吧?但 m 二点五恰恰打破了这个参数迷信。它不是那种动辄千亿、万亿参数的巨无霸,而是采用了更精巧的 mo 一 架构。 它的核心秘密在于两点,第一,总参数量虽然庞大,但处理每个 token 时只激活大约一百亿参数,非常高效。 第二,它的设计哲学是效率优先,并且是为智能体 agent 任务而生的思考与执行引擎。这意味着它在规划、工具调用、多步推理这些方面是原生级优化过的。 这张表对比了 m 二点五和市场上常见模型的一些关键指标,大家可以一目了然地看到它的独特之处。 m 二点五之所以能达到如此惊艳的效果,背后有一套系统性的技术革新,我们把它总结为驱动其前进的三架马车。这三架马车分别是 forge, 这是一个原生的智能体框架 cisco, 这是一个针对模一模型强化学习的特殊算法以及某一架构本身,加上高效的推理优化, 这三者协同工作共同赋予了 m 二点五强大的性能和独特的能力。接下来我们就逐一拆解这三架马车。 先来看第一架马车, forge 传统的 l l m 应用智能体能力很多时候是在基础模型之上,通过外挂 prompt 工程思维链提示,或者像 land chain 这样的外部框架来模拟智能体行为。 这种方式就像给一个只会写诗的诗人,硬加上一套导航系统,练路长、效率、损耗大,稳定性也欠佳。 而 m 二点五的 ford 框架核心思想是解偶与内化,解偶就是把底层的语言、模型能力和上层的智能体逻辑清晰的分开,让模型在训练时就同时学习世界知识和如何使用工具与规则完成任务。 内化则是把智能体的决策流程,比如下一步该调用哪个 api, 这个结果合理吗?深度集成到模型的推理过程中,而不是事后追加规则。 这样做的好处显而易见,泛化能力更强,响应速度更快长,任务稳定性更高。 模型真正学会了如何思考并解决问题,而不仅仅是如何回答下一个问题。 这张图展示了复制框架驱动的智能体任务处理简化流程,大家可以看,输入一个任务后,模型不仅仅是理解文本,而是直接进行任务规划,选择合适的工具执行操作,然后验证结果,最后给出输出。 整个过程高度集成在模型内部,没有过多的外部依赖和繁琐的中间环节,这使得模型能够更流畅、更高效地完成复杂任务, 尤其是在需要多步推理和工具调用的场景下,优势尤为明显。它不再是简单的文本续写器,而是真正具备了思考和执行能力的智能体。我们来看第二架马车 cisco 算法在 m e 模型上进行大规模强化学习 r l 训练其实是个挺有挑战的事情,因为 m e 模型的路由机制是动态的,它会根据输入内容决定激活哪些专家。 这种动态性导致传统的 r l 算法很容易让训练变得不稳定,甚至出现专家之间强的越强,弱的越弱的马太效应。 mini max 的 研究团队为此专门提出了 c i s p 算法,你可以把它理解成莓模型 r l 训练的稳定器和调度员。 它主要解决了两个问题,一是确保训练稳定性。即使在复杂的多轮交互稀疏奖励的 a 阵任务中,所有专家都能得到均衡的学习机会,避免模型崩溃。 二是实现精准的信用分配。在长达数万 tocan 的 复杂任务链中, cpo 能更准确地把最终的成功或失败回溯,并分配到中间的关键决策步骤上,让模型学得更明白。 此外, m 二点五在训练时还特别关注过程奖励,鼓励模型产出不仅正确而且高质量、可维护的解决方案。 最后是第三架马车,也是猫 e 架构本身,加上高效的推理优化。前面提到,猫 e 架构允许模型拥有庞大的专家网络池,但在处理每一个具体 token 时,仅激活约一百亿参数。 这就好比一个拥有各领域顶尖专家的智库,每次只请出最相关的几位专家来会诊,既保证了能力覆盖的广度,又实现了极高的推理效率。 更重要的是, m 二点五从设计之初就不是一个单纯的文本续写器,而是一个为智能体任务而生的思考与执行引擎,这意味着它在规划、工具调用、多步推理、自我反思等 agent 核心能力上得到了原升级的优化。 这种效率优先智能体原升的设计理念是 m 二点五能够在保持高性能的同时实现低成本的关键因素之一。 理论讲完了,我们来看看实战表现。在衡量实际编程解决问题能力的 s w e bench verified 精准测试上, m 二点五取得了百分之八十点二的惊人成绩。 作为对比,当前业界标杆之一的 cloud opus 四点六得分是百分之八十点八,两者差距仅在毫厘之间。而 m 二点五更是首个在该评测中超越 clodzenet 开源模型, 其他主流开源模型在这个基准上的得分通常在百分之四十到百分之七十之间。 这张表清晰地展示了这个对比。 m 二点五的成绩证明了它在硬核编码能力上确实达到了顶级水平,甚至在某些方面超越了之前的闭源模行,为开源阵营树立了新的标杆。 如果说性能是追平,那么成本就是碾压。我们来看一下直接的 api 调用成本对比。按百万 token 计费, 无论是输入还是输出, m 二点五的成本都是零点三美元,而 cloud opus 四点六大约是三十美元。这意味着什么?成本比例大概是一比一百。 假设一个开发者每天需要处理一百万 token 的 代码生成和审查任务,使用 cloud opus 一个月的成本可能高达数千美元, 而切换到 m 二点五,每月成本可能仅需几十美元。这种两个数量级的成本差异,足以让任何团队和个人开发者重新评估他们的技术选型。 这不仅仅是省钱,这是对高性能 ai 可负担性的重新定义。 m 二点五的高性价比和强大能力,让它在众多场景中都能大显身手。我们先来看它的主战场,代码生成与审查 对于开发者来说,这简直是福音。无论是日常编码,根据自然语言描述快速生成函数类或模块代码,支持多种语言, 还是代码审查与重构, m 二点五能指出潜在 bug、 性能问题,风格不一致,并给出修改建议, 甚至可以用来生成系统架构、设计数据库、 schema api 接口文档,甚至是部署脚本。还有调试助手功能,把错误日期备给它,它能帮你快速定位原因, 这大大提升了开发效率,降低了出错率。除了开发者, m 二点五也能为运营、市场、财务等非技术岗位带来巨大便利。 比如,面对一堆混乱的销售数据,你只需要告诉 m 二点五计算每个季度的环比增长率,找出最高的产品线,并生成分析报告、项目建议书,这些任务 提供关键数据点和要点, m 二点五就能帮你自动生成,还能根据要求调整文风和格式, 从永常的会议纪要、客户反馈或调研报告中快速提取行动项、核心结论和代办事项。这些信息提取与汇总的工作, m 二点五也能轻松胜任,这大幅降低了数据处理的门槛。 最具想象力的应用领域,恐怕就是利用 m 二点五的智能体原生特性,构建各种定制化的智能体应用了。 比如,你可以创建一个独立研究 agent, 给他一个研究方向,他就能自动规划搜索策略、爬取阅读论文、整理文献综述。 或者一个客户服务 agent 集成到产品中,处理复杂的售后咨询,甚至能主动调用内部系统接口完成服务闭环。 还有个人效率 agent, 管理你的日程、阅读邮件,做数字助理,甚至可以是个性化学习导师,用生动的例子解释难点概念。或者学术论文助手帮助润色检查、引用 创意内容、脑爆构思脚本、策划活动、起名字, m 二点五都能提供大量高质量方案,这几乎是打开了无限可能的大门。了解了 m 二点五的强大,大家可能已经跃跃欲试了,那么如何快速上手呢?主要有三种方式。 对于大多数开发者和团队来说,直接调用 mini max 提供的云端 api 是 最简单的方式,获取 api key, 安装官方 sdk, 几行代码就能开始调用。 如果你对数据安全要求特别高,或者希望完全掌控推理过程,可以选择本地部署下载模型权重,用 v l l m 或 t g i 这样的高性能推理框架进行部署。 另外, m 二点五已经与 vs code、 cursor 等主流 id 一 深度集成。安装插件配置好 api key, 就 能在编辑器内直接享受它的能力。选择哪种方式取决于你的具体需求和环境。 mini max m 二点五的发布,其意义远不止于又出现了一个好用的模型,它更像是一个清晰的信号,标志着 ai 发展的一个重要拐点。它代表着性能平权。顶尖 ai 能力正通过开源和极致优化汇集更广泛人群。 它将催生应用爆发。低成本门槛会让大量此前搁置的 ai 创意变为现实。 他也预示着竞争泛式转移,未来的竞争将更多聚焦于如何基于高性能开源模型进行创新,同时他会催生新生态,围绕开源模型的工具链和服务将蓬勃发展。 回顾 ai 短短几年的发展,我们看到了从惊奇到落地的迭代。 m 二点五让我们看到了另一种可能,技术民主化,通过架构创新、算法优化和工程卓越而非无止境的军备竞赛,将技术果实更平等的分享。 开源之光正无比耀眼地照向人工智能的核心腹地,而 m 二点五无疑是这束光中最亮眼的火炬手之一。

哈喽,各位朋友,大家好,现在想为大家继续讲解一下关于大模型的一些核心技术战, 今天想围绕 moe 进行一个讲解,对吧?就是我们的专家混合模型,在传统的穿分母架构当中,或者说我们的 dense layer 当中,啊啊的 dense model 当中是这样,就是说好比这个一个大元模型,它是一家公司或者说公司的一个部门,那么一个公司或者说一个部门是由若干个专家组成的, 那么当我们来临一个任务的时候,所有的专家都必须完成这个任务,他们各司其职, ok 吧?那么这么做是有个问题,就是他比较低效,对吧?比较费人力成本 啊,所以说我们 m o e 就是 解决这个问题的,就 m o e 呢,就是说每次选择最适配这个任务的某几个专家就 ok 了,不需要所有专家一起上啊,就这个人就这个意思。但这个地方有一个很重要的点就在于什么?就说你在写代码的时候,你只需要去规定有多少个专家就 ok 了,你不需要去规定每个专家是干什么的, 因为你在训练的时候啊,他们的能力是在你训练过程当中自己长出来的,也就我们所谓的 inward specialization, 他 们是自发分工的,不需要你做一个 leader 去指挥他们, ok 吧?你就坐着,你躺着就 ok 了,让他们自己去分就 ok 了,好吧?啊?然后我说一下 m o e 在 模型当中的位置,在我们传统的穿风的架构当中是这样, 首先是文本接入层对不对?文本接入完了以后是目的 attention, 多投注意力机制层,多投注意力机制完了以后是干嘛?是钱块神经网络对不对?这是我们 在川分的解码器部分的一个架构对不对?对于 m o e 来说的话是这样,他是对 f f n 做了一个改进, 在 f f n 这一层去改进成了 m o e 类型, ok 吗?啊?这就是他的一个核心的一个呃,架构在模型当中的一个位置啊,是替换了 f f n。 好,上面这个图就是 m o e 的 整体架构啊,非常简单。就是说对于每个 token 来讲啊,首先第一步是让它进入到门控网络,就是我们的 getting network, 就是 我们的路由器。 第二步就是把这个 token 分 配给少数几个 esper 去做计算。然后第三步是加权融合,好吧,我假设啊,就是 esper tube, 它算出来是零点八的权重,也就是说它对该 token 的 贡献可能占了百分之八十 啊,所以说你在做计算的时候呢,就是说要拿百分之八十去成立 expert two 所做的贡献, ok 吧?就是就是这个意思。好,我来说一下具体的细节啊,就是我们从一个 token 做,从一个 token 讲起啊,比如说这个 token 是 apple banana 呀,无所谓啊,就是看你拿到什么就是什么。对于这个 token, 首先呢,你要把它做文本切入,就转化成一个 d 维的向量啊,所以上面就写的是 x 属于二 d 嘛,就这个意思对不对?这个 d 可以 是五幺二,可以是幺零二四,对吧?看你代码里面怎么设好。然后下一步啊,就是说我们的路由 get 部分 上面也有一公式是 g x 等于 softmax w g x 对 吧?好,解释一下, w g 是 一个 n 乘以 d 的 向量, n 是 什么东西? n 是 expert 的 数量,就专家的数量, ok 吧? d 是 维度,对不对?好, x, 刚才我也说了是文本切入, 所以你跟这个 w g 去乘以 x, 它是一个 n 乘以 d 为的一个矩阵,再去乘一个 d 乘以 e 为的矩阵,它算出来是一个几乘几维的, 对吧?看你现在代数学的好不好,对吧?它是一个 n 维的,对吧? n 乘以 e 维的一个向量, ok, 所以 你算出来这个 w g x, 它是一个 n 维的, ok 吧?然后这个把这个 n 维的一个这个这个矩阵去做 self max 以后啊,得出这个结果就是我们的这个,呃,每个专家, 呃,每一个专家对于这个 token 的 匹配分数,对不对?就这个意思好,呃,我们看一下啊,比如说上面这个 g x, 对 吧?他等于零点零九,零点七三,零点一二,零点零六, 你很明显会发现什么,第二个专家他贡献是最多的,对不对?所以说第二个专家是最合适的,对于这个 token 啊,然后零点一二是第三个专家,对吧?他是次合适的, ok 吧?好,第二步就是我们的稀疏选择,对吧? 上面有公式, s 等于 top k g x 对 不对?好,假设 k 等于二啊,假设 k 等于二,那么你只需要选什么?只是只需要选 xper two, xper three 就 ok 了,对吧?剩下一和四不用 care 对 不对手记掉就 ok 了。 这也就是整个这个 m o e 的 一个核心部分,就是说它比较省算力,对不对?把一和四给去掉,这样不节省人力了吗?节省算力了吗?对吧? ok。 第三步就是我们的专家网络 expert。 好, 每个 expert 的 计算是这样的,就是 e i x, 对 吧?它等于什么?它等于 w 二 i 去乘以一个 sigma, w e i x, 我 做一个解释啊。 首先 w e i x 是 什么对吧? w e i, 它是属于这个 h 乘以 d 为的,对不对? d 就是 维度吗? h 是 什么? h 是 你这个神经元,它的数量,对不对?好,然后你输出的这个 h 是 属于什么呢?属于 r h 的, ok 吧? 就刚才也说了,就是你 w e i, 它是 h 乘以 d 为的,你 x 是 d 乘以 e 为的, h 乘以 d 为的一个矩阵去乘以 d 乘以 e 为的矩阵,它算出来是什么?是一个 h 乘以 e 为的矩阵,对不对?所以 h 是 属于 r h 的, 输出是属于 r h 的, 对吧?好,然后我们使用几何函数,这个 sigma 对 不对? 这个 c 个码我们一般是干嘛的?是把一个限行变换去给他做一个非限行的处理,对不对?这样能让他做的结果可能更准确一些啊?好,这个非限行我们一般用什么语录对不对?用语录或者说记录去完成就 ok 了。好。 然后第二层就是我们的这个 e i x 等于 w 二 i 乘以 h 对 不对?那么这个 w 二 i 属于什么?属于一个 d 乘以 h 为的矩阵,对不对? 就是最后让这个输出去变成什么为,就变成 d 为,为什么?因为 w 二 i 是 属于 d 乘以 h 为的,然后 h 属于 h 乘以一为的,对不对?好,那么一个 d 乘以 h 为的矩阵去乘以一个 h 乘以一为的矩阵,它最后算出来是什么?是一个 d 乘以一为的矩阵,对不对?所以让它输出回到了 d 为,对吧? ok, 所以说这个 expert 其实总体来讲啊,根据我们刚才的刚才那个公式啊,刚才那几个公式,其实它就是一个两层的,什么 m、 l、 p, 对 不对?多层感知机嘛,对吧? ok, 多层感知机,然后第四步就是我们比较关键的一步,对吧?叫做输出融合, 上面这个公式对吧?就是输出融合 g i x 表示什么?表示权重,对不对?它是个标量,然后 e i x, 它是一个什么? 它是个向量,或者说它是一个矩阵,对不对?然后 g i x 乘以 e i x, 它表示什么?就缩放这个矩阵或缩放这个向量,最后加起来就得到了最终的输出 y, 它属于什么?它属于一个地位的一个矩阵,对不对?好,我举个例子啊,比如说这个 g, 对 吧?这个 g 一 x, 它是零点七三,对吧?然后 g 啊,不是 g 二 x 零点七三, g 三 x 是 什么?零点一二对不对?就对应的刚才那个就是我们算出来的那个专家的那个权重,对不对?好,那就是拿零点七三乘以 一二 x, 再加上零点一二乘以一三 x, 就是 我们所算出来的这个 y, 对 不对?它本质上是多个专家给出建议,然后最后按权重进行融合,对吧?这是整个 m o e 的 正例思想。好, 然后我会附一段伪代码在上面,大家可以去看一下啊,这个代码呢,就是把刚才我说的说的这些东西,说这些公式给它转化成了这样这个代码语言,好吧? 然后呢,最后我想说一下它的一个核心机制啊,有一个非常重要的一个公式在上面,就是我们的这个啊, rooting 加上 gradient flow, 它等于这个 specialization, 对 不对? 这个 rooting 是 什么?它是路由,它是负责干嘛的,它是决定数据去向,数据去什么地方,对不对?然后 gradient flow, 它是梯度对不对?梯度决定了参数是如何 upgrade 的, 怎么去更新呢?对不对?咱们去做这个这个正向传播,或者说我们的反向 propagation 的, 对吧? ok, 也就是说它代表什么?就是谁经常接到某类数据,然后谁就会变成那类。专家,明白了吧?然后注意的是什么?没有人为定义 expert 的 功能,全是模型自己学出来的啊,这我刚才一开始也强调过。那么为什么 m o e 要比传统的参数范围要强一些呢?是因为传统的参数范围,它的参数量比较大,它的计算 也比较大,也很好算力,但是 m o e 呢?他参数很多,但每次只用其中一部分,比如说模型的总参数是一百个币,对不对?然后每次呢?只用十个币,但是效果就接近一百个币 啊,所以本质上来讲就是用这个,拿这个参数规模和计算成本做结偶,好吧?

这就是我一人公司安排的本地算力集训。这套价值二十万的大模型矩阵拿来跑 opencloud 到底是什么效果?这种矩阵有两种用法,第一种是用四个 a 镜头跑,四个大模型,分别担任不同的角色,一个 ceo, 一个运营总监,一个财务总监,最后一个负责打杂 四个不同的 a 帧,你可以让他们帮你查数据、分析报表、审合同,这就是一人公司的用法。另一种用法就是性能增强,通过这样的矩阵连接,能大大扩展它的显存,你就可以把满写的 kimi、 mini max、 glm 部署到本地,不管是处理什么数据报表, 一个字都不会上传到云端。这四台机器用的模型不一样,第一台用的是一百二十二 b a 十 b 的 mo 模型,第二台用的是视觉模型,帮我去看图片、分析报表, 我可以分别要求他们去做什么,可以相互配合,也能单独完成自己的事。比如家用 aint, 我 可以让他帮我看看现在有哪些适合家庭观看的电影。工作上,我也可以让他帮我分析财务数据,也可以让运营总监 去帮我查看每个账号的运营情况,它可以解决公司绝大多数问题。如果预算有限,我是建议六十四 g 的 mrt 拿来处理公司的财务合同订单就非常合适,还能接入公司现有的 erp 和 crm 系统,用起来体验就非常不错。

酷狗发布了 gemma 四,这次最关键的突破是寄出了 ipc 二点零纯开源协议,这意味着所有的商业法务限制被彻底解除了。 在实测中,它被定义为极其偏科的 agent 圣体,在底层架构、算法、推理效率以及 agent 跟工作流上展现了统治力,或不同尺寸模型的表现差异极大。我们直接看具体的红黑榜。 首先是三十一 bens 旗舰大杯,这是一个典型的代码大神,他的编程逻辑极强, legcobench 跑分达到了百分之八十的子民水平,且前端 html 的 排版精美程度直逼 jimmy 三。 最核心的竞争力在于 token 效率,同样任务的 token 消耗只有竞品的百分之六十五,这让他在需要高频调用的本地 agent 工作流动速度更快且成本极低。 但它的短板也很明显,数学精度不够,面对信息密度极大的长文本容易产生幻觉,而且在慢思考模式下偶尔会陷入死循环。接下来是二十六 b m o e 性价比中杯,它是真正的 agent 圣体, 对于本地开发者来说,它简直是二十四 g 显存的福音。虽然总参数有二十五点二 b, 但得益于猫一架构推理时仅激活三点八 b 参数,质测速度高达每秒六十个 token, 配合二五六 k 的 超长上下文,非常适合塞入臃肿的系统提示词而构建复杂的本地自主智能体。 不过它的短板在于文本质量,中文写作表现平庸,部分开发者反馈其深沉内容灌水严重。 最后是 e 四 b 和 e 二 b 这两款端侧小杯,它们是边缘设备的王牌,最惊艳的是它原声支持端侧语音输入,最高支持三十秒。这意味着你不需要外挂 a s r 语音转文字模型, 离线英文转写几乎完美,极其适合做 i o t 语音交互设备。但要注意,它的视觉和 o c r 能力是重灾区,面对发票或者手机截图,文字提取错漏百出,完全无法胜任需要视觉操作的网页自动化任务。 windows 用户建议直接使用奥莱曼,安装完成后,在终端执行这条命令,就可以一键启动 java 四的三十一 b 版本。 如果你在 linux 或者 windows 的 wsl 二环境下需要部署高并发服务,强烈建议使用 vl m。 这里推荐使用四 bit 量化版本,可以显著降低显存压力并提升响应速度。执行这条命令,记得检查端口八千和最大模型长度六零零零这两个参数,确保服务稳定运行。 至于 mac 用户,目前 m l x 框架的适配还不完美,现阶段最稳妥的方案依然是使用欧拉玛来运行。 首先准备微调环境,我们需要安装摩达官方的 ms swift 框架,它已经第一时间支持了 jam 四全系列。直接克隆仓库,进入目录后执行安装命令,并同步更新 transformers cool 到最新版本, 现在进入核心的训练环节。以一二 b 视觉微调为例,这里我们采用了 low 二 a 精量化微调方案,通过设置 low 二 rank 为八至更新极少量的参数,从而在保证效果的同时降低算理需求。特别注意两个 freeze 参数, 我们将 v i t 和 aligner 全部冻结,目的是保护模型原有的预训练视觉特征不被破坏。为了在多卡环境下高效运行,这里开启了 dsp zero 二优化显存。你可以直接复印执行这条命令,它会自动加载 latex c r 数据集进行训练。 训练完成后,我们需要验证效果,使用 swiftinfirm 命令,将 adapter 参数指向你刚才输出的 checkpoint 文件夹。建议开启 stream 模式,这样你可以像使用 chat d p t 一 样,实时看到模型推理出的结果。 如果你想用自己的数据微调,需要准备 jason l 格式的文件。纯文本模式最简单就是标准的对话消息列表。 但如果是全模态微调,就必须在 messages 之外增加特定的字段。比如图像模态需要在 j 层中加入 images 字段并指向图片路径。语音模态则同理,加入 audio 字段指向音频文件, 这样模型才能将多模态输入与文本恢复正确关联。最后一步是将未调好的适配器推送至 modelscope, 执行 swift export 命令,填入你的模型 id 和 sdk token, 就 可以将本地的权重上传到云端 hub, 方便后续在不同设备上快速调用。

看完这个视频,你立刻明白了,大模型架构之战, dance vs 莓,谁才是未来?大模型越来越大,参数从千亿到万亿,但每次推理所有参数全激活, 算力消耗和称数量成正比。这就像一家公司,不管谁来办事,全体员工都出动某亿。架构给出了一个答案,不动所有人,只动最合适的人。但是架构就是传统的密集模型, g p t 三 l l e i m i 都用这个设计,每层所有参数都参与计算,简单直接,效果确定。但问题是, 参数从百亿到千亿,推理成本直接翻倍。训练集训需要成百上千张 gpu, 单次训练成本超千万美元。 moe 把 transformer 里的 ff 六层拆成 n 个专家和一个路由器,路由器对每个 token 打分选 k 最匹配的专家计算。 以 mixedrawbox 七 b 为例,总参数四十六点七 b, 但每次只激活两个专家,激活申数量仅十二点九 b 计算成本约等于十三 b 的 密集模型,性能却对标七零 b 公式核心 h 等于 sigma w e 乘 expert i 没有额外的基座,像专家就是全部门控权重 w 下划线 i 由路由器 softmax 打出, topk 以外为零。单死模型是参数越多算的越多。 单死模型激活参数占比百分之一百某亿,仅百分之十到百分之二十某亿,把参数容量和计算量解苦。参数可以堆到万亿,但每次推理只激活少数专家,相当于一家医院配齐三个,既有大医院的配置,又有小诊所的效率。 猫 e 有 三个硬核挑战,负债不均,通信开销显存压力,负债不均。路由器总把 token 发给少数热门专家,导致这些专家负债过重,其余专家大量闲置。通信开销专家分布在不同 gpu 上, 欧拓奥通信延迟可能占推理时间的百分之三十到百分之四十。显存压力,所有专家必须常驻显存, 六十四个专家就可能吃掉数百 g d。 所以 m o e。 不是 没有代价,是有取舍。业界正在突破这些挑战。 deep speed mo e 的 专家并行可将训练成本降至五分之一,推理吞吐量相比 partort 最高提升百分之六十。负债均衡辅助损失能使专家 利用率标准差从零点三二降至零点零七。更前沿的专家内激活稀疏性,在专家内部跳过非活跃神经元,额外提速二点五倍。此外,专家减脂可减少溶于专家,降低显存占用。总结三句话, dance 要的是确定性和稳定性。 m o e 要的是参数量大,算力有限条件下的效率最大化。评论区,聊聊你的业务场景,更适合 dance 还是 mo e, 你 学会了吗?点赞加关注,学习不迷路!

如果你在考虑买一台 macbook 本地模型,你的第一个问题大概率是内存够不够。但我的判断是,某一架构正在改变。这个问题本身,瓶颈不再是内存够不够,而是存储够不够快。这两个问题的解法完全不同。 大家好,这里是 l l mx factors, 一个叫 hyper 的 开源项目,在三十二级字节内存的 mac mini 上跑了三十一级字节的 mixedro 模型。二点二 talks, 同样的配置,拉玛点 c p p 直接崩溃。 很多人第一反应是速度太慢,但我觉得速度不是重点,重点是它背后的架构思路。我们先来看看这个项目的核心思路。 传统做法是把模型全塞进内存,塞不下就换更大的机器。 high pure 不 一样,它把张亮按访问模式分三层, gpu metal 放每个 token 必用的层, ram 放溢出层, nvme 按需加载。剩余的关键是它理解模型结构,不是简单的虚拟内存交换。 有人问,这跟操作系统的 swap 有 什么区别?区别在信息优势 os, 不知道你下一步要用哪一层,只能等页错误后被动加载四千字节小页。但 transforma 的 层是按顺序执行的, hypera 可以 提前预取大块连续读,还能追踪专家激活频率做缓存。 知道模型结构就能做更好的调度。但这个项目真正有意思的不是三层调度本身,而是它对 m u e 模型的处理。 dance 模型,比如 loma 七十 b, 每个 token 都要用到所有参数,内存不够就是不够。 m o e 完全不一样。 mixedro 有 八个专家,每个 token 只激活二个,百分之七十五的专家权重随时限制 hypera 利用这一点,只把非专家张亮常驻 gpu。 大 概一级字节,专家从 nvm 一 按需加载。 更厉害的是专家缓存 high pure 追踪哪些专家被频繁激活,优先留在内存预热后缓存命中率达到百分之九十九点五,绝大部分时候根本不需要读硬盘操作系统的 l r u 不知道专家三的激活频率是专家七的十倍,但 high pure 知道。 但有一个技术细节, mvme 顺序读取可达六级字节,每秒随机读取暴跌到五百兆字节。 meo e 的 专家访问介于两者之间,每个专家层几 mb, 不 算纯随机,但也不完美顺序,这决定了实际性能的上下限。 那实际性能到底怎么样?我们看数据。 mixedro 八 x 七 b, 三十一级字节的 m o e 模型 在三十二级字节 m e max 上。二点二 talks 同条件的 dance 模型拉玛七十 b 只有零点三,注意这个七倍差距更小的模型可以做到。八、 talks 以上同样是 mvme 辅助推理,猫眼的结构优势非常明显, 社区最大的争论就在这里。零点三 talks 的 电磁模型日常确实没法用,但谋情况不同。二、 talks 以上可以做后台一步任务。八、 talks 已经接近可用水平,作者自己也说这更像概念验证,但对某蚁来说,它是实用方案的雏形。 而且更大的 m o e 模型正在密集发布。 quan 三点五的 m o e 通过 streaming experts 在 apple 硬件上效果惊人。 kimi k 二点五接近 et 参数,有人本地跑到一点七 talks 冒正在成为开源大模型的主流架构,这类存储分层调度的需求只会越来越大, 这件事对我们做决策有什么意义?三个判断。第一,瓶颈正在从内存容量转向存储待宽。电子模型时代,内存不够就是不够, 但 m o e 天然适合分层存储,你不需要把所有专家都放进内存,核心限制从装不下变成读不快,硬件评估标准要跟着变。 第二,买 max 跑模型,带宽可能比容量更重要。 m 四 pro 内存带宽两百七十三级字节每秒, max 是 五百四十六, ultra 是 八百一十九。同样,模型装进了内存, max 深沉速度就是 pro 的 两倍。社区友人说得好, m 四 max 六十四级字节是甜蜜点,七十 b q 四放得下,带宽又是 pro 的 两倍。 第三,存储层级正在成为推理架构的一部分。过去 nvme 只是存数据推理,发生在 gpu 和内存里, 但 high pure 这类项目结识了新的可能。 gpu ram nvme 形成多级推理管线模型感知的调度器,而不是 os 的 通用页面管理将成为本地推理的标配。组建 hyper 不是 孤立 o m l x 在 做 s s d 的 k v 缓存, streaming experts 也在利用类似思路 总结今天的核心判断,膜仪的吸收激活加 m v m e 分 层存储正在构建新的本地推理范式。 瓶颈从内存容量转向存储贷宽。买 mac 跑模型优先看贷宽,而模型感知的存储调度器将逐渐成为工具链的标配。这里是 l l m x factors, 我 们下期见。

这台本地 ai 已经搭建好,准备发走了,机器是 m r o t 六十四 g 的 同一内存。很多人不明白为什么不用英伟达,因为 mac 是 cpu 和 gpu 共用内存的架构,六十四 g 可以 全部当做显存来使用,五零九零的显存也才二十四 g, 等配置下,因为拿的代价是麦克的三倍。六十四 g 的 显存刚好可以跑千万三点六,三十五 p 的 量化模型,速度和智力都是最佳状态。这台是帮一个浙江的客户搭建的,他有几十家店铺,每天都要看大量的竞品和爆款,之前靠人工一个个看,一条条填。现在有了这台本地 ai, 自动筛选出竞品有哪些销量高的款,哪些有爆款潜质,直接商城分析报告。这套本地 ai 更是打通了他的 erp, 帮他盯住进销存,有哪些订单还没发货,哪些品类 以亏损状态把公司运营成本全部拉进来,不需要等财务问一句, ai 就 能直接给你结果,而且公司所有数据都在你自己的机器上,一个数字都不出公司。我把这套模型框架全部搭建好,让他建立私有数据库,后续模型更新我也是先测试,好在升级。

最近呢,有人把 cloud missiles 的 架构居然逆向地公布出来了,一个叫 kai gromis 的 一个人是 swarms 画家的作者,发布了一个叫做 open missiles 的, 用 pie torch 从头开始实现的一个架构项目。他认为 cloud missiles 很 有可能是一个循环深度的变换器,叫 recurrent depth transformer。 r d t 不是更多的层,也不是更多参数,而同一批层反复运行了多次,因为现在呢,就是 opus 已经是一个五 t 的 模型了。如果 mithus 能力比 opus 强那么多,但是呢,在不断的增加模型参数的话,这条路貌似已经走不通了。按照他的说法呢,是 r d t 呢,是把中间的一个重要的循环块重复的运行的 t s, 每次用的是完全一样的权重。他们研究呢,比如说一个七百七十 m 的 参数的循环模型,达到了一点三 b 参数固定深度模型的同等质量, 同样任务,整个参数减少了百分之四十。说一下,为什么他们有这样的一个猜测呢?首先呢,是类似 secret through synality 的 研究员呢,陆续发起 missiles 的 行为模式呢,高度符合循环深度变换器的理论预测。这里面呢,有两个特征,一个呢是系统性的泛化,把 missiles 放在训练分布之外的新组合物地上,它不会像传统的 transformer 那 样逐渐退化,而是在某个节点突然就会了。那记得这里面有个很重要的观点,叫某个节点, 说明它中间呢,一定是经历了一切的信息的咀嚼和理解的。前者呢,把这个现象叫做三阶段的 rocking, 分 别是既分布内的泛化,分布外的泛化。那传统的标准的 transformers 呢,是做不到分布外的泛化,但是循环 transformers 目前呢是有理论证明可以做到。 第二呢叫深度外推,它逻辑是在五跳的推引链上训练,但是在十跳的推引链上, inforce 这种呢,标准的 transformers 是 一定会失败的,但循环 transformers 会成功, 因为它只要有经验训练了五跳,它就能在循环中把这个五跳快速的去起升到十跳,甚至是十五跳,实际上就是多跑几个循环而已。这直接运用了 meso 梳理多部数学跟常见规划时不需要显示的 chain of thought 的 观察。 什么意思?就是 chain of thought 呢,其实很多时候要把每个步骤描述出来,但是在描述步骤的时候呢,你是受限于提这词的步骤限制的,比如说在一个需要一百多步才能完成的问题上,你把所有步骤全部放在提词词的方式,你只要展示出前面的几步, 大家可以快速的去理解,后面几步按照类似的格式,类似逻辑,不断的深度研究,不断的去循环就可以。所以在整个的 open studios 架构里面呢,是分成三个部分,第一部分叫 prelude, 相当于一个曲章,中间呢叫 recurrent block, 就是 不断循环的核心模块。 最后呢就是 code, code 呢就是结束了。所以呢,第一部分跟最后一部分都是标准的 transform 层,只跑一层,而中间的模块呢,根据推理的需求可能要跑 t 层, t 呢是一个变量,根据问题的难度,模型可以主动去设定是否增加或者减少,有个细节就是每次循环时呢,都会重新的注入原始的输入,这是 purdue, 就是 第一步的编码中的一个重要的信息,是为了防止模型在循环中漂移,一直呢要去人脉模型,在循环过程中它要解决的问题是什么?它的核心的信息是什么? 因为这样的原因呢,所以这样的循环的架构呢,就把原来的显性的 chain of thought 变成隐性的原因就是每循环一步,相当于 chain of thought 基于上一步上下一步内容就可以了, 需要像原来的 few shots, 把 chain of thought 思维链融进去,这样写死一些逻辑。换句话说呢,你如果是一个十步的任务,你用一个三步的思维链作为参考,它是永远没法做出来,但是放在一个循环链里面就容易很多。除了循环以外呢,其实 missiles 还要解决两个大的问题, 一个呢就是训练稳定性,因为残差爆炸这个问题呢,其实 deepsea 跟 kimi 都尝试解决过,比如说 attention rests 就是 kimi 的 方案。那 open missiles 呢,采用了另外一个有趣的价格, 叫做限性十不变系统。什么意思呢?就是它把整个的探索的维度呢,设了一个叫普半径,让普半径呢是一直保持在低于一的约束下去训练模型,所以整个的参数量呢,它是不会超过它的 attention 的, 注意 每一个阶段都会做一定的压缩的,不会出现因为不断循环而引起的反差爆炸。第二个它的魔幻呢,就是如果说 r g t 就是 循环深度变换器呢,提升了推引阶段的深度的话,那我们需要另外一个魔幻去提升推引阶段的广度, 这广度呢,就是传统的 m o e 了。这个 m o e 最早呢是 deepsea 做了一场全球级别的普及,也就是稀疏的混合专家实现,在每一个循环里都生成了多个小专家,每一次路由呢,只会激活 topkick 专家处理当前的 token, 少数几个共享专家始终是保持激活。 那这些共享专家呢,主要是一些通用的知识,包括语法、基础推理,通用上下文等。通过低于百分之五的激活,那类似 mythos 一 样的模型, 可以持有数千亿的总参数量,但每次推理呢,只激活其中很小一部分,这样呢,保证了足够的广度,同时呢又提升了模型的性能,速度会大幅提升,对推理型海的要求会降低,以及 它的成本会大幅下降。所以一句话讲清楚,就是 m o e 提供宽度,循环模块提供深度,再通过停机减少过路思考,最终实现了更少的参数,更好的机制以及更好的效果。所以这样来看的话, m o e 的 这种稀疏专家的激活, 最终实现了比 opus 强很多的一种性能。读完这个报告呢,其实我的一个心得就是,现在的很多 agent 的 能力呢,真的是已经慢慢的融到了模型里面,那这次呢,这种循环的逻辑呢,其实在 agent 里面也是属于多跳的,通过一个 orchestration agent 去激活每部的执行 agent 的 逻辑, 而 m o e 呢,更像是一个通过 a 证来实现路由逻辑,那 mitos 呢?相当于把我们在 hannes 这个层面的路由逻辑和多跳的 operation 逻辑呢,直接融到了模型内部。这也是为什么 mitos 能实现比 opus 更强的能力,反而呢,它的模型内部参数呢,可能会更少。

大家好,今天我们来聊一个 ai 大 模型领域最核心的架构概念, m o e, 全称是 mixture of express, 中文叫混合专家模型, gpt 四 deepsea v 三、 mixture 这些当红模型背后都用了同一个关键技术,就是 m o e, 它到底是什么?为什么这么重要?今天我们用原理图来把它讲透, 请看这张图,左边是传统的筹密模型,你可以看到每一个输入进来,所有的参数节点全部都亮起来,所有的连线都在工作,百分之百的参数参与了每一次的计算,模型越大,计算量越大,成本线型增长。 再和右边的 mo 模型同样的输入进来,先经过一个紫色的 root, 也就是门控网络, root 会给每一个专家打分,你可以上面有分数,这个专家零点七二分,这个专家零点五八分,他只选出得分最高的两个专家来激活。亮起来的两个专家就是被选中的,其余的四个专家全部都是灰色的,根本不参与计算。 这就是 moe 的 核心思想,不是所有的参数都要干活,而是要让最合适的专家来处理。我们再深入的看一下 moe 的 内部结构,从左到右输入的 token 先进入门控网络,在门控网络的内部,你可以看到他给每个专家进行了打分, 这些蓝色的进度条就是匹配的分数,然后通过 softmax 归一化选出 top 二,接着看中间六个专家网络,其中只有 excel 二数学专家和 excel 五推理专家被选中,发出蓝色的光,旁边标注了这两个专家的选中 w 等于零点五五和零点四五, 然后这两个专家变形计算之后,输入到右边的绿色融合模块,按权重加强混合,零点五五乘以一二,加零点四五乘以一五,最终结果送入下一层,这就是一个完整的 m 一 层的工作方式。这张图把整个流程拆成了五步,从走到又走一遍。 第一步,输入解方程 x 平方等于四。第三步, top 二的选择,选出这两个专家。 第四步,两个专家并行计算。第五步,按权重加权融合。第六步,输出结果。这六个专家当中仅有两个参与的计算,所以说整个计算量大约只有仇命模型的三分之一。但是 m o e 最大的训练难题叫做专家探索。看左边这张图你就懂了, 所有的 tokken 都涌向了同一个 xpart 一, 这就导致了 xpart 一 红色过载,而其他几个专家基本上都是透明的,完全显置。这个就是缩百分之九十的 tokken 都涌向了同一个专家,其他专家得不到训练,变成了废残数。再看右边这个,是加了赋载均衡之后的效果, root 变聪明了,连线均匀的分布到每一个专家,每一个节点都是亮的,都在工作。这张图非常直观的展示了当前主流 moe 的 模型效率, 最长的这条是 kimi k 二点五,总参数达到万亿级别的一千零四十 b, 但是激活的参数只有三十二 b, 仅占了百分之三点一。 jm 五是智普用华为升腾芯片训练的七百四十五的餐 b, 仅激活了四十 b。 派 克 v 三点二是六百七十一 b 的 参数仅激活了三十七 b。 阿里的千万三点五是三百九十七 b, 激活了十七 b, 占比百分之四点三。 mini max 最紧凑,二百三十 b 的 参数激活了十 b。 再看下底部的对比组,拉玛三的重密模型七十倍的参数,百分之百全量激活。相比之下, m o e 模型总参数可以达到万亿级,但每次推理只激活百分之三到百分之六,这就是 m o e 的 核心价值。 现在来看一下二零二五年到二零二六年的主流 m o e 模型的全景。开源阵营的竞争非常激烈, kimi k 二点五是智谱在华为芯片上训练的 mit 开源 千万三点五是阿里的五百一十二个专家支持两百零一种语言。 deepsix v 三点二依然是行业的性价比标杆,训练成本只花了五百五十万美元。 minimax 二点七号称用五十分之一的成本达到了旗舰性能。 在闭源方面, gpt 五点四、 jimmy 三点一、 cloud 四点六都是当前的最强模型。其中 jimmy 已经确认使用了 moe 架构, gpt 和 cloud 的 参数没有具体公开, 可以说 m o e 已经成为了二零二六年大模型的绝对主流架构。总结一下, m o e 用五个关键词就能概括,稀疏、激活、门控、路由、专家并行、案例参数以及低成本推理。它让大模型在不爆炸算力成本的前提下实现了能力的大幅提升, 正在重新定义 ai 的 性能与成本边界。好了,今天的分享就到这里,如果觉得有用的话,别忘了点赞、关注我们下期见!

这么多老板想要搭建本地 ai 模型,那到底该选什么硬件?选哪些模型?今天一次性讲清楚。目前本地模型主流方案 n 卡和 max studio。 那 么首先就是 max studio 它的优点肯定就是它的显存足够大,因为它的显存内存是统一的嘛。像这一台是 max studio m 二 ultra 六十四 gb, 也就是说它可以装最大六十四 gb 以下的,但是你像五零九零呢, 它就只能装二十四 g 以内的一些模型,这是很大的区别,也是 max 的 优点,但它的缺点呢,是它的算力不够啊。就是如果说你要跑多人并发的,但 max studio 只能一个人啊,那如果你是多人团队, 想要并发使用,就得考虑 n 卡方案了。但是 n 卡五零九零的,它的价格也会稍微贵一点,贵个几千块钱啊,并且它的算力速度是翻倍的。因为我们实测下来一个数据,那 max studio 它的 t g token 可以 跑到五十到七十,那么五千零九十的 t g token, 它可以跑到一百到两百,然后 max studio 它的 p p token 可以 跑到两百到三百, 那么五千零九十的 p p token 可以 跑到七百左右,这就是它们两个最大的一个算力的区别。所以从算力来讲,那么五千零九十它是全面领先的, 最终怎么选?那么也可以从几个点去考虑,第一点就是你愿不愿意多花几千块钱去获得一个翻倍的算力啊。第二点呢,就是你到底想装多大的模型?如果你一定要装一个六十四 g 才能装下的模型的话,那么可能只有 max studio 可以 满足你这一点。再就是要上 pro 六千了,那么这个价格就不是它翻倍这么简单了。