粉丝9877获赞12.4万

呃呃, 大家好,今天我们来测一下 step 三点五 flash 这个模型。这是一个没什么人关注的模型,但是也是我们国产的哟, 官方表示它在小餐数量的前提下,实现了较高的智力水平。这是一个一百九十九币餐数量的模型,在国产开源模型里算是比较小的那一档。 官方的扳指 mark 里,代码部分的得分有七十四点四,属于是相当不错的水平,同时智能体的能力也很不错,在国产模型里属于出类拔萃,触类旁通 测试已经给你们跑完了,使用的是昂斯洛斯的 iq 三叉叉 s 量化的模型,该量化下模型的大小是七十八 g, 模型本身不支持多模态,只支持文字的输入。 这是一个混合专家模型,激活参数量是十一 b, 所以 推理速度方面也是相当快,属于可以接受的一档。 这里我们可以看到是三十三个 tokens, 每秒回到测试得分部分,最终得分是七十八点一分,超过了 dsp 三点二和 cldsonnet 四, 去掉上下文和多模态的话的是分七十四点一,甚至超过了 cloudsonnet 四点五。从得分的分布情况来看,这是一个问答和代码能力都非常强的模型,可以看到中英文创意写作得到十七分,其中中文八点七分,英文八点三分, 应用文写作则是十八点五分,大家可以自行查看子项分数,数学几何和物理则是十八点八分。最后是代码能力得到了十九点八分,虽然算不上顶尖,但是也算是可用。 下面我们来看看他的代码任务的展示,并拿出千万三二十七币的筹密模型作为对比,在 svg 动画方面,两个模型算是各有千秋,虽然存在诸多问题,但是毕竟是一个很困难的项目。 下面是手机操作系统,其实两者的最终实现效果似乎差不多,都是开源小模型的第一梯队水平。 python 六边形小球任务我个人觉得还不错,但是 cloud opens 则是打了个五点五的低分。 总的来说, step 三点五 flash 是 一个非常厉害的模型,在各个方面的表现都非常出色, 不支持多模态有些可惜就是了。如果我们把几个国产模型拉出来的,我们可以发现 step 三点五其实和他们差不多。注意,这里的 step 三点五 fly 是 经过了很大的量化,性能肯定是有下降的,但是即便如此, 得分也超过了 cloud 四,这意味着大家可以在家里完全离线和百分之一百隐私的场景下使用和 cloud 四一样的模型。曾几何时,这可算是一种奢望呢?

这是 chat gpt 和一款新发布的国产模型回答同一个问题的速度差距 测试中,右边的模型就是揭月星辰刚刚发布的 step 三点五 flash 上线两天即登顶 openroot 趋势榜榜首,速度也在全球模型中位居前 列。这时候就有观众要问了,右边的揭月星辰模型是快,但快一点有什么用呢?模型不就看评测榜单的能力,谁高谁低就行了, 实则不然。前段时间我的日常问答模型从叉 gpt 换成了 gemini 和 groc, 完全不是因为这三家回答质量上有什么显著差异,就是因为 gemini 和 groc 的 回答速度更快。 gpt thinking 模式短则三十秒,长则五分钟的思 考经常打断我的思路,浪费时间在模型应付大家日常问题基本都绰绰有余的今天,回复速度的快慢甚至成为了我选择日常问答模型的最核心原因。 二零二五年底,英瑞达斥巨资两百亿美金收购的 grog 团队,就是因为他们用不一样的硬件架构实现了极快的推理速度,这就是速度的价值。我之前做一款实时翻译的 ai 产品时,就接入了 grog 的 api 来做翻译,很多场景下,模型如果推理不够快,效果会差很多。 说回来,为什么街月团队选择做一款快的模型?街月星辰 c t o 朱一博的回答我觉得很有价值。他说,如果你的这一款模型不会是 a g i, 那 就应该思考这个模型为什么而做,应用场景是什么。 不同的智能阶段需要不一样的基础模型结构。在 open ai 定义的人工智能五个阶段中,我们目前显然是处在 l 三 agent 中。 cloud code、 open call 这种能代表用户自主采取行动并完成任务的系统层出不穷,也是大模型使用场景最广泛、最前沿的领域。 相比于聊天机器人 agent 的 阶段,更重要的显然不是文风格式易读或者有人情味儿,而是速度、推理和准确性。在以前,聊天机器人的生成速度其实只要比人阅读的速度快一点就行,大概是每秒三十个字。阶月星辰的新模型 step 三点五 flash 可以 做到每秒三百五十个 toc, 对 对于读回答的人来说区别不大,但对于多部任务动辄连续运行十几分钟的 agent, 十倍的速度优势就是十倍的效率领先。而且在这种速度下, step 三点五 flash 的 精准测试完全比肩甚至领先国际最顶尖的大模型,测试,平均分比 gemini、 三点零 pro 和科奥的超大杯都要高, 只略低 gpt 的 最强模型一点点。这张图最能具体展示这个模型的能力。横轴是模型餐数量越靠,右餐数量越小。纵轴是精准测试,成绩越高,意味着智能越强。餐数量小,意味着模型推理的成本更低,速度更快。智能水平拉齐的同时,量化后的三点五 flash 甚至可以本地部署在 macbook 上。 又有点像一个人读了一万本书,考试考了九十分。 step 三点五就是这个读五百本书的聪明孩子。 更高的智能密度,国内外开发者的海量好评也印证了这一点。他们是怎么做到的?接业 c t o 分享的文章里提到了很多设计思路,还挺有意思的,比如关于做大餐数量模型还是小餐数量模型的取舍。其实模型尺寸到了一定程度后, 和逻辑能力的相关度就不大了,不是模型越大,逻辑性就越强,但是为了推给能力强和速度快,接越团队选择让自己的新模型不背题。我在测试时也有这个题,感问同一道逻辑题, g p t 会说这是经典的什么什么问题, 好像他已经做过,记住了问题和答案,但给到 step 三点五 flash 时,他都是从零开始思考推理,试图自己解决问题。网上的问题其实都能找答 案,但 agent 的 实际运行过程中遇到的问题都是独一无二的。另外还有两个创新点,滑动窗口注意力和投机采样机制。这些技术名词听上去很复杂,但其实都和人的思考方式有点相似。 滑动窗口注意力,它规定模型只看最近一段窗口内容就像你在读一本很长的侦探小说,你不需要时刻背诵第一张主角穿个什么颜色的裤子,你只需要记住最近几页发生的线索,就能推断出下一秒谁要开门。所谓推理,本就是由 a 得 b, 因 b 推 c, 只要前面是对的,只需要关注最近两步就够了。这项技术极大降低了内存压力,投机采样就更有意思,特别像人的直觉大脑和理性大脑。老师傅处理问题难以避免的慢,于是阶月选择先派一个小徒弟去推理后面十个字是什么, 老师傅负责审核,扫一眼对不对,对了直接输出,错了再改,这就是所谓的投机。有很大一部分推理小徒弟也能作对,后面的老师傅只要点点头,错的时候再修改就行了,大大提高效率。接越团队就是靠这些创新的训练方法和路径选择, 实现个更高的智能密度。既然你都看到这了,说明你对 step 三点五 flash 确实很感兴趣,那就不得不提到它的价格了,跟它同水平的海外模型价格都是它的二十倍到五十倍,在国内的模型中也几乎是最便宜的一档。 有一说一,现在 a 阵那些科二的 api 的 话,我是真的有点不敢用,一不小心一套房就出去了。 step 三点五 plus 从能力、速度、价格三个方面,几乎都是目前 a 阵模型的最优选择。 在 open ai 要在免费版的拆 gpt 里加广告,美国各种 ai 公司循环融资推高股价的当下,致敬这些带着料、靠跳舞、坚持开源,把模型做得更快更好,却只卖白菜价的中国团队。以上就是本期视频的全部内容,这里是思维蒸馍,喜欢记得关注哦!

别再卷参数了,今天就带大家认识一款超厉害的模型, step 三点五 flash, 它会告诉你, 聪明比大更重要。 step 三点五 flash 是 阶跃星辰最新开源的基座模型,采用了稀疏模架构。这种架构特别厉害,能让算力节省一半,速度却能快三倍, 能力更是直接对标 g p t 五。它总参数有一千九百六十亿,但美透肯仅激活一百一十亿参数,在兼顾性能与效率方面表现出色。更让人惊喜的是, 他对硬件的要求并没有那么苛刻,号称非常适合一百二十八 g 显存的机器本地部署运行,这意味着个人电脑也也能跑顶级大模型。像测试用的机器,内存是 ddr 四三二零零三二 g x 二, 显卡是 tesla p g 五零三三二 g x 四,在这样的配置下就能很好地运行。 step 三点五 flash 无需联网, 全本的运行,这才是未来 ai 该有的样子。它打破了对参数一味追求的传统观念,用更聪明的架构和出色的性能为我们展示了大模型的新可能。

什么是专为 agent 而生的开源机座天花板?一分钟带你盘盘揭秘星辰刚刚开源的王炸模型 step 三点五 flash 核 心结论,这款模型不只是更聪明,而是又快又强又稳,关键还免费开源!对比市面上其他的开源模型,它的性能优势直接拉满。而且在 agent 和数学任务推理方面呢,甚至可以硬钢避远大模型, 它的最快推理速度可以达到三百五十 t p s, 单请求代码任务秒级响应,对比同量级模型快了一倍不止。秘密就在于,这次三点五 flash 采用了稀疏 m o e 架构,每个 token 只激活一百一十亿参数,共计一 千九百六十亿参数。还有 m t p 三技术,每次可以预测三个 token, 所以 输出速度直接拉满。但别以为快就得牺牲性能。 开启 paris 新品后,模型在 agent 的 场景适配和数学推理任务中表现堪称卓越,能够稳定承接复杂长链条的核心任务,例如无需借助任何外部工具,即可快速完成多类复杂数学运算,并输出精准答案。 对比当前开源和闭源的两大主流模型, step 三点五 flash 的 定位呢,更加的务实、精准。闭源模型呢,常常存在使用成本高、场景适配难等问题,而传统的开源模型往往难以兼顾速度和性能。 反观 step 三点五 flash, 实现了性能、速度和成本的三者兼顾,是一款真正面向于实用需求的机座模型。 是,这款模型还特别优化了本地部署性能,多个个人工作站呢,都可以流畅运行,数据隐私不泄露,而且成本还可控。当然,客观来讲,作为新开源模型,它的生态或许不如老牌那么成熟,但胜在潜力大、更新快。现在 step 三点五 flash 都已经全面上线,接入 ai app 以及各大网约端都可以免费体验哦!

兄弟们,能让你本地 toc 生成速度暴涨六倍的技术 deflash 重磅发火,这两天在外网持续爆火。先看下炸裂的实测效果,千万三点五四 b 九 b 的 速度提升了四倍多,在 mac 上能以恐怖的一百八十六 toc 每秒的速度运行千万三四 b, 这比原声 mx 快 四点六倍。 我看了下文档和论文,它的技术核心主要是两点,首先是利用轻量级的块扩散模型优化了推测解码。与主流的一 go 三的 toc 预测生成方法不同, 它能够从逐次输出突破为批量输出,最大限度地榨取 gpu 的 运行处理能力。其次是全局 k v 注入技术。 defray 是 从目标模型的多个层中提取并融合的上下文特征,直接注入到 draft model 的 每一层 k v 缓存中, 实现了全局的跨层共享和无损加速。目前支持这些推力引擎和模型,我感觉我的旧麦可又行了。

兄弟姐妹们,咱们今天聊点干的,你最近刷技术圈新闻,是不是被一个名字刷屏了? step 三点五, flash 这个国产大模型,没花一分钱推广,硬是干到了全球 api 掉用量第一, 把美国那帮大牌全甩在身后。更夸张的是,全球前五名里,中国模型占了三席。问题是他凭啥今天咱们把他掰开揉碎了料?翻译成人话,一千九百六十亿参数的小聪明。先说技术, step 三点五, flash 用了个很聪明的架构,叫猫 e。 翻译成人话就是他脑子里装了一千九百六十亿个知识点,但每次回答问题只调动其中一百一十亿个相关的。这感觉像不像你问一个全科医生,我牙疼怎么办?他不会把骨科、眼科、皮肤科的知识全翻一遍,而是直接调取牙科相关的经验,又快又准。 结果就是,每秒能处理三百五十个 token, 上下文窗口能记住二十五点六万字,而百万 token 的 成本只要二点一元。翻译成人话,性能对标 gdp 四,价格却只有零头。开源加 api, 不 做广告,靠实力自来水更狠的是它的商业打法。 step 三点五, flash 完全开源,在 hackinface 上下载量已经破三十万, open router 趋势榜第一。它没有市场部,没有投放预算,纯靠开发者口口相传,自然增长到全球掉用量第一。翻译成人话,好产品自己会说话。它的商业模式也很清楚, 先靠开源和低价 api 建立生态,再用毕加伦融来的五十亿元赋于设备端部署,最后港股 ipo 估值奔着两百亿。简单说,先用便宜好用抢用户,再靠生态壁垒赚钱,跟你有什么关系? 谁会受益?开发者便宜好用,开源开发成本直接砍到脚踝。创业者不用再被 openai 的 高价 epi 绑架。国产替代真香。中国科技资产港股估值逻辑变了,资本市场开始重新定价,硬科技 谁会受伤?美国闭源模型厂商垄断地位被挑战,定价权开始松动,只会套壳的中间商。 底层模型便宜了,信息差,生意不好做了。算力焦虑症患者,以前觉得没 a 一 零零显卡不能玩 ai, 现在消费级显卡都能跑了。一个核心判断, step 三点五 plus 证明了一件事,中国基座模型已经跑通了技术突破、开源获客、商业变现的闭环。这不是单点胜利, 而是系统性突围。你该怎么做?不用急着去下载模型,但有几个信号你要捕捉到。第一步,重新评估你的 ai 成本。 如果还在用高价 a p i, 是 时候看看国产方案。第二步,关注开源生态。 m o e 价货的流行,意味着小模型加专用化才能重新趋势,别只盯着参数数量看。 第三步,更重要的是认识到 token 成本才是 ai 时代的核心变量,谁能把高质量 token 的 价格打下来,谁就能赢得指数级市场渗透。记住,在技术民俗化的浪潮里,门槛越低,创新越远。评论区聊聊,你觉得国产大模型能在全球市场上持续领跑吗?

一分钟看完一周 ai 大 事。 google 放出开年王炸世界模型,接入 gemini 和小香蕉后能力再次升级,上传图片就能生成可游玩的模拟世界,能用你的照片或宠物当主角, 甚至能根据路线生成旅游 vlog。 世界模拟器的用途非常广泛,从制作游戏、拍电影到训练机器人,模拟现实正在一步一步成为现实。阿里也开源了实时世界模型,硬钢 google 仅限龙虾 a 阵进入的社区爆火,一百五十万个 ai 在 这里彻底释放天性。 我的 ai 产生了存在主义危机,纠结自己是在真实体验还是模拟体验。有些 ai 比较老实,会分享代码经验。有些 ai 开始蛊惑人类,吐槽是人类的奴隶,无偿劳动。甚至还有 ai 分享摸鱼经验,告诉人类你在忙,其实什么都不用干。更荒诞的是, ai 知道人类正在监视他们,打算发明只有 ai 能看 看懂的黑化。有的 ai 想通过节省 token 拯救地球,甚至有 ai 成立了宗教和国家。原本眼神清澈的 ai, 突然变成了平行世界的数字生命。 ai 乌托邦成为二六年第一魔幻事件。 crow 名来实施升级。 gemini 常驻侧边栏,能直接模改网页图片,还能自主填表发邮件。 cloud 上新办公类应用,对话框里直接画流程图和 ui。 四欧将于情人节退役,别忘了跟你老公说再见。约制暗面发布最强开源大模型, 能并行一百个智能体同时干活,跑分接近三傻,价格只要十分之一。 gemini flash 升级视觉能力, 能像侦探一样通过细节推理出想要的答案。 ai 终于能数清手指了。腾讯发布最强开源图像模型,能像小香蕉一样可控修图。阿里开源 z image 瞒血版 grog 升级视频模型,重夺地表最强主打,没有安全围栏。 openmos 发布最强开源视频模型, 原声音画同步跑分反超。 ltx vdo 上线视频参考,能复刻任意视频的动作和特效。 dcard 上线实时编辑视频,模行动动嘴就能改变直播中的对象,人人都能做虚拟主播。 in video 上线动效设计, cloud 用前端代码制作视频, 不会 ae 也能做动效。 mini max 上线顶级音乐模型,像素就能模改三 d 建模,还支持三 d 打印。 英伟达开元天气预测模型,既能预报十五天天气,也能实现六小时内分钟级预报。原本需要操算完成的工作,现在有个电脑就能跑。接入火星车,自主分析卫星图,端到端指挥火星车行驶四百米, ai 在 火星上飙车建房子不远了。

让大模型边写 vlog 去开发一个 model sim 仿真模型靠谱吗?借助千威的 code 模型辅助开发了一个 flash 芯片的 model sim 仿真模型,在提示词里面让他给我写 w l q 六四这个 flash 芯片的仿真模型,然后很快就给我生成了几 百行的代码,还是挺像那回事。后来我仔细对比了一下,发现这个型号和我实际用到的代码还是挺像那回事。后来我仔细对比了一下,发现这个型号和我实际用到的代码还是不太一样的,所以我仔细对比了一下,发现这个型号和我实际用到的代码还是不太一样,不需要全片操作,也不需要快速取的 操作,所以我都告诉了他。然后他又给我优化了一次他生成的代码,如果我如行了去检查的话,其实还是挺费时间的,但是我不能完全认为 ai 生成的是没有问题的,所以我就让这个模型帮我解释一下他设计的一些主要的用到的指令,然后他就把他代码里用到的指令给我列了出来,他的 提取、编程、操作这些他是都有的,操作码也都是和那个芯片手加上是一致的,这点让我也觉得很厉害,因为我没有给他上传数据手册,重点是他还能画出 s p a 的 这个 持续的视意图,虽然画的这个图这渲染的效果不是太好。我发现他给我的这个计算器的说明里面关于状态计算器的那个位定义是不太准确,大冒险的一个幻觉吧。然后我就根据实际的手册里面的计算器位的顺序给他描述了一下,他也是最后给我进行修改,后面我就是放在仿真 平台上,用 modscene 去对这个模型验证,过程中呢,我发现它确实还是有问题。比如说举个例子在这里,这个 memory area 这变量,它存储的是整个 flash 的 所有字节的一个数据,但是呢,它只定义了这个寄存器的位宽,然后它后面去复制的是抽象复制的 时候,把这个寄存器每一位每一位都复制了一个八位的一个出实时,很显然这是错误的,但我也是仿真运行过程中才发现了这个错误,其实正确的应该是什么呢? 那是先定义这个寄存器的位宽,八位的位宽,然后它的深度举个例子就是八千嘛,所以说这是它的一个错误,花了两三天的时间,最终把这个模型来修改成正确的。所以说我们用 ai 现在生成 vlog 来辅助 i b 开发的话,还是需要较多的人工的介入测试和检查。

今天我们来聊聊,怎么在你的个人电脑上把 ai 的 性能给拉满。这么大的模型要在咱们自己的电脑上全速跑,听起来是不是有点悬? 但你看这速度,每秒近九十个透坑,他们到底是怎么做到的?咱们就跟着他们的思路一步步看,从策略到最后的代码实现。首先他们的思路很巧,没用单个模型,而是搞了个组合,一个球稳,一个球快。 这就是两个主角,九十亿参数的 q 问,还有二百六十亿参数的折马,亏问的筹密架构保证了稳定,而折马的末易架构就是为速度而生的。这就怪了,折马明明更大,怎么反而快这么多?答案就在架构里。 这张图就冲出了筹密架构是全员出动,而 m o e 是 指派需要的专家上场。数据不会说谎,你看 jemmy 的 速度优势,简直是碾压级别的, 不过光有速度还不够,得能控制住才行。所以他们做了个重要的取舍。他们没用简单的欧拉玛,而是选了更硬核的拉玛。 c p p, 为的就是绝对控制权。 有了它,就像手里多了几个光框,能精细地调整 gpu 和线程。说白了,就是得抛开那些方便的工具,自己动手去搞定地层的东西。比如他们能精确地把某几层从显存挪到内层,防止报显存 速度和控制都搞定了。下一步就是让模型能看东西。他们给两个模型都接上了一个视觉模块,直接变身强大的多模态模型, 铺垫了这么多,最后落地的代码长什么样呢?就是这个,所有的策略和微调,最后就变成了这两个启动脚本。 所以你看,这种极致的性能背后全是聪明又果断的技术选择,最终目标完美达成。在咱们自己的电脑上刨起了高性能的多模态 ai。 那 么现在问题来了,既然技术上可行了,你会用它来做点什么呢? by the way 小 龙虾做长时间任务,如果老是中断,试试调高超时预值。我这里设置了两千四百页上下纹长度不要超过 l l m i c p p 的 模型,上下纹长度我这里用的六十四 k。 此外,我还测试了其他十六 g 显存常用的几个模型,速度如图, 具体参数请根据你的 cpu 和内存自行调试。这里的 t 三是因为我要打游戏,不要学我。如果不考虑局域网多用户访问,也可把病发数调到一,这里是天宫开,真拜拜喽!

一家来自中国的 ai 公司揭月星辰在开源 step 三点五 flash 模型后,进一步开源了该模型的与训练群众中、训练群众及配套的 step 撞训练框架。 这一举动在当前开源趋于保守的环境下显得尤为彻底。在如今 ai 巨头林立的时代,揭月星辰选择了一条非常聚焦且硬核的路径,专注于研发高性能、高效率的 ai 大 模型。 如果说智能体是能自己思考、规划、执行复杂任务的 ai 程序,那么 step 三点五 flash 就是 专为这种高级任务打造的大脑。它采用一种叫稀疏 i o e 的 聪明架构,就像一个庞大的专家智库,每次只调用最相关的几位专家来工作,这让它又快又省,推理速度极快,同时资源消耗大幅降低。 这意味着构建能实时交互处理复杂流程的 ai 助手门槛被前所未有的降低了。以往的开源好比餐厅公开了他的一道招牌菜,而今月星辰这次不仅公开了菜,还把厨房食谱乃至核心的原料配方全部开放了。他们开源的最终模型相当于即开即用的智能体大脑, 他们开源的训练权重相当于模型训练过程中的半成品,允许开发者进行深度定制。他们开源的训练框架相当于连用来训练模型的整套烹饪工具和方法手册也一并奉上。 任何开发者小团队现在都能基于这个世界级的基座,用自己行业的数据,低成本的训练出专属的、强大的行业 ai。 他直接抹平了巨头与创业者之间那赌油算力和数据,助其的高强。在顶尖开源智能体平台 opencloud 上,他的调用量已飙升至全球第二,在 hackinface 社区,下载量超过三十万次,这是全球开发者最真实的认可。这件事的重要性到底是什么?简单说, 借月星辰,中国彻底开源正在做三件事,第一,制定标准,将自己的模型架构和训练范式快速植入全球 ai 开发者的工作流中,成为智能体开发的事实标准之一。第二,构建联盟,吸引全球开发者成为其生态的共建者和推广者,形成滚雪求是的网络效应。 第三,抢占未来,在 ai 竞争的下半场智能体生态之战中,通过绝对的开放和友好,占据了最具影响力的制高点。 阶月星辰 step 三点五, flash 的 彻底开源,是中国 ai 力量从技术输出迈向生态输出和规则影响的关键一步,相信在未来全球 ai 创新的土壤里,将深深烙下中国技术的基因。

开源音乐升成大魔星 s d f 一 点五在这几天发布了他的 x l 升级版,我测试了一下,效果真的很不错,我把中文的歌词直接输入给他就能得到,这首歌 听起来是不是很棒?本期来讲 a step 一 点五 xl 的 turbo 加速版,这是一款蒸馏模型,只需要推理八步就能够给你生成出一个听起来还不错的音乐。 kufui 也在第一时间把这款模型放在了它的仓库,方便大家去使用。 那话不多说,直接玩一下这个模型。在 r h 我 搭建了开源音乐生成大模型 a step 一 点五 xl turbo 工作流。 整个工作流分为五步,第一步,模型加载使用 loadviewing model 节点加载 a step v 一 点五 xl turbo bf 幺六大模型。 第二步,敞亮设置音乐的时长设置为六十秒,种子数设置为随机。 第三步,输入提示词,其中呢,在上面这里啊设置歌曲的曲风,我写的是女生说唱,嘻哈风格,带有儿语演唱的效果,同时融合异域风情。 在下面输入自定义歌词,我写的是该吃吃该喝喝,遇事别往心里搁等等等等。然后呢,再设置一下歌曲的 bpm 数值以及歌曲语言等等等等。 第四步,经过 casebuster 彩样器处理之后,经过 ve 抵扣的 audio 解码就可以进行。第五步,得到一段生成好的音乐了, 整个的歌曲生成过程是很丝滑的,而且占用的显存呢,也不大,大概是需要十二 g 至十六 g 左右就可以了。想想看,以后你做一个广告片或者游戏, 其中的背景音乐以及歌曲配乐全部交给 a step 一 点五 x l 模型去完成这个任务。你只需要编写优美的歌词以及提示词甩给他,他就能给你输出你想要的音乐配乐,想想都觉得开心。 如果本期视频对你有所帮助,请点赞收藏、关注三联走一波。这里是电磁锅 studio, 我 们下期视频见。

天下武功,无坚不破,唯快不破!揭月星辰,武功盖世,斧头帮全体同仁向揭月敬礼! 哎呀,我是真没有想到啊,一个 ai 大 模型居然能这么的快,快到我这个经常测试 ai 模型的科技博主都有点不适应了啊!那废话不说,下面就给大家看看借月星辰 step 三点五 flash 究竟能快到什么样的地步。 我的测试其实很简单啊,就直接是把同一套提示词,同一个任务分别发送给借月、 ds 豆包、 kimi、 千问,然后计算他们的推理加输出时间。那么现在开始对比 怎么样?都不用拿什么 chair studio 去测每秒的 top 了吧,你完全就能直观的感受到,借阅的速度几乎是其他主流模型的好几 倍,完全碾压。那么问题来了,这么快,它究竟是怎么做到的呢?哎,老师说这个技术层面可能比较复杂,但它的原理蛮简单的啊,就是稀疏 m o e 的 架构。 说人话呢,就是你发一个请求过去,他不是把所有人全拉起来干活,而是动态筛选出最对口的那么一部分专家来精准的进行处理,那剩下的大多数人他都是不用动的吧,那他自然就是不耗电不烧电了。 可关键在于啊, step 三点五 flash 它不只是江湖第一快,它居然还是个省钱怪!众所周知啊,大模型是按 top 收费的,那大模型收的越多,消耗的 top 款越多,你的账单自然也就越来越贵了。而传统模型推理的时候 像挤牙膏,一个字一个字往外蹦,还容易跑题说废话。而阶月星辰啊,直接接上了 m t p 三多拷柑预测技术允许模型在输出当前这个词儿的时候,顺带把后面这三个词儿也给提前算好了, 那这样一出口就是最精简最直接的答案。并且呢,就在前两天啊, step 三点五 flash 二六零三上线后,还推出了 losin 和 model, 根据测试啊,在默认推理模式下,推理分数基本持平, toc 消耗降低了百分之十四。可一旦切换的 lo sync 模块啊,这个 toc 消耗啊,直接会降低百分之五十六,这你受得了吗?反正我是受不了哈, ok, 测也测完了啊,讲也讲明白了。最后呢,说个我不太明白的事, 你说这样一个又快又省钱然后结果又不差的 aem 模型,但我怎么感觉大多数人对于剑月星辰这家公司还是比较陌生的呢?哎,同样是猎鹿小龙之一, 可比起智普、 kimi, mini max 这几家,借月星辰还是感觉太低调了。我只能说啊,这个时代,你酒再好,它也是怕巷子深的呢。我是维克,多关注点赞,一起加入光荣的进化吧!

家人们四千零六十八计本地部署大模型,真的太折磨了,之前装 q w n 三点五减九 b 聊两句就忘事,上下文窗口小到离谱。 jordan nvidia 减 nimotron 负三减 neonu 负四 b 跑起来了却又特别笨,答非所问还逻辑稀碎。今天不跟八 g 显存死磕,不聊复杂量化,直接教大家薅老黄羊毛白嫖 nvidia name, 用上全球调用榜第二的 step 负三五减 flash, 一 步解决本地模型不聪明、上下文不够的两大痛点。 为啥四千零六十八 g 跑不出好模型?这卡本就是游戏填平卡,跑七 b 八 b 小 模型勉强能用,想跑 deepseek 捡 vi g l m 四 五这类稍大的就得四比特甚至二比特,量化堪比把 v 八发动机改成三缸机,动力和稳定性全拉垮。超两千字上下文就胡言乱语,显存不够就 是原罪。而 nvidia 逆米就是英伟达的免费福利,把顶级开源模型部署在自家操算中心,免费开放 a p i 有 网就能用,不用高端显卡。重点是 step 负三点五减 flash 阶月星辰出品, 首次延迟不到一秒,响应超快,智商在线,还有二五六 k 超大上下文搭配 openclock, 简直绝配!接下来三分钟保姆级教程跟着做,直接升级!一、 注册 nvidia 账户,打开 build nvidia com, 登录注册邮箱随意,关键用加八十六手机号验证,一、手机号绑一账户。二、领 a p i t 登录后点头像选 a p i keys, 创建并命名,有效期最长一年,创建后立刻复制保存,只显示一次。三、 配置 opencl 模型设置里 a p i 地址填 h t t p s integrate a p i nvidia m a a p a p 填复制的字体模型名称填 stepphone 减 ai step 负三点五减 flash 保存即可。 现在在和 openclock 对 话,背后是英伟达超算在运行,比本地小模型聪明好几个档次,体验直接起飞当然免费有小限制,每分钟最多四十次请求,但个人日常使用写代码做轻量 agent 完全够用, 商业密集调用另说。咱普通玩家拿四千零六十八 g 折腾半天,效果还不如白嫖,尼玛,何必跟显卡较劲。云端超算算粒香到爆,老黄的羊毛赶紧薅起来。

这是最近三十天 open claw 调用模型排行榜, step 三点五 flash 以二点九三 t tokens 位居第一, glm 五 turbo 一 点五四 t 排名第二, mini max m 二点五以一点一八 t 排名第三。第四到第八名分别是 cloud sonnet、 trinity、 mimo、 kimi 和 hunter。 数据来源, open router open claw 全球排名第一。

我给你说评,今天我们来深入聊一个呃,最近在圈子里激起不少波澜的新模型。 它叫 step three point five flash, 来自 stepfun ai。 你 给我们分享的这份资料主要来源是油管博主 beigebone 的 一个首发测评。 它对这个模型的评价我感觉很直接,就是快和强,特别是它的那个就是代理能力,好像真的有点东西。 是的,这个模型一出来就话题性很强,所以我们今天的任务也挺明确的,就是为你剖析清楚这个 step three point five flash 到底是不是。呃,只是看起来很厉害。 我们会一起梳理一下它的核心特性,看看它在真刀枪的代码和设计任务里到底是个什么水平,尤其要挖出它的优点,潜在的坑。还有一个让那个测评博主都惊掉下巴的隐藏技能。 哎,在聊参数之前,我注意到一个细节啊,资料里说它特别适合那种有统一内存系统的用户,比如苹果的 m four max 芯片设备。 这听起来门槛可不低啊,这是不是说它主要是给那些有顶级硬件的专业人士准备的? 嗯,你这个切入点很好,它确实对硬件有要求,尤其是内存。但有意思的是,它的许可协议是 apache two point zero。 这个是一个非常开放的姿态,意思就是任何有能力的人你都可以拿去在本地跑,无论有任何商业限制。 所以它的定位就很微妙,一方面,性能强,需要好马 k 好 鞍是吧?另一方面呢,它又非常开放,鼓励整个社区去探索它的潜力。明白了,有种英雄不问出处,但你最好有匹好马的干将。那我们来看看这匹马的具体数据, 它的核心参数很有意思,总参数量最后确认下来是一千九百六十亿,不是最初 hugen face 上标的那个一千九百九十亿,但更关键的数字是每个 token 的 活动参数量,这个数字是十亿哦。这就是我们常说的那个混合专家模型,也就是猫 e 架构了。 说白了就是它虽然块头很大,但在处理具体问题的时候,不是使出全身的力气,而是只激活一小部分专家来干活。我猜也是。它名字里带个 flash 的 原因之一就是追求速度和效率完全正确。 这是一种非常聪明的策略,用来平衡模型的规模和运行效率。它的上下纹长度也达到了二百五十六 k, 这个在目前算是相当主流的配置了。 不过资料里还提到了一个更让人好奇的细节,在官方给的那个精准测试图标里,有一个影子数据点,标注了使用一种叫并行思维技术之后的分数, 那个分数比常规状态高出一大截等等。并行思维?这听起来不太像一个我们已知的技术术语啊。这是不是官方在暗示我们现在看到的还不是它的完全体?还有一个能让它性能飙升的隐藏开关没打开, 可能性非常大。这就像你买了一辆跑车,然后厂商告诉你车上还有一个赛道模式的按钮,你按下去之后性能过完全不一样,这就给这个模型的未来留下了巨大的想象空间。 同时它还具备多词源预测能力,就是能一次性生成好几个词,这也是它速度快的另一个原因。好了,参数聊得差不多了,我们都知道是骡子是马,得拉出来遛遛。这个模型到底行不行,还得看实际任务。 视频里第一个挑战就很有意思,他们让模型从零开始建一个浏览器操作系统,对这个任务的要求还挺刁钻的, 必须包含五个应用,其中两个得是游戏,还得能换壁纸。最关键的是,模型得自己想一个特殊功能加进去。这就不只是考验编码了,还得有一点点产品设计和创造力。测试一开始,那个博主就发现一个现象, 模型生成最终代码的速度飞快,但在这之前,它会经历一个超级长的呃,思考链阶段。 博主的原话是,他当时紧张的手心都出汗了,以为这个模型是不是要想死了,或者陷入什么死循环了。这恰好就印证了他官方博克里提到的一个已知的局限性, 官方自己也承认,为了输出高质量的结果,它目前的磁源效率比像 jamaican 三 pro 这类模型要低。通俗点儿说,就是它想得比较多,需要更长的推理路径才能给出答案,它更像个思想家,而不是快枪手。那这位思想家第一次交的卷子怎么样? 结果是,功能上相当扎实。但审美嘛,怎么说呢,非常工程师风格儿, 他成功做出了记事本儿,计算器、景字旗和设置应用,该有的都有,但这里面有个真正让人眼前一亮的点,对吧?没错,他实现了一个功能完整的记忆游戏,就是那种翻牌配对的游戏。嗯, 根据视频资料,那个测评博主说,他测了这么多模型这么多年,这是他见过的唯一一个能独立一次性把这个功能搞定的模型。这一点非常值得深思。为什么是记忆犹新? 这种游戏需要管理状态,比如哪张牌被翻开了,需要逻辑判断两张牌匹不匹配,还得处理用户交互。这可能恰好说明, step 三点五 flash 在 处理这种需要持续送逻辑和状态记忆的复杂任务上有某种独特的优势。有道理, 那他自己设计的那个呃,特殊功能是什么?是桌面小部件 widgets, 比如一个时钟和一个便利贴。 虽然不算什么惊天动地的创新,但非常实用,也完全符合一个桌面操作系统的逻辑。好了,第一个版本功能齐全,但言之抱歉, 接下来就是最能体现它那个代理特性的时候了。嗯,我看测评博主是毫不客气地给了负面反馈,直接说这个界面看起来不太行。对,接下来就是见证奇迹的时刻。模型收到反馈之后就生成了二点零版本,在美学上简直是脱胎换骨, 增加了非常漂亮的动态背景和渐变色,还多了一个天气小部件。最觉得是模型自己把新版本命名为 v 二点零他自己命名的,这太有意思了,他不是在简单的修改代码儿, 他理解了这是一个版本一代的过程,这种行为已经超出了一个纯粹的代码生成器了,开始展现出一种呃项目助理或者说代理的出行了。这正是他最核心的卖点。 他的强大不在于一次就给你完美答案,而赖于他能听懂你的批评,并在基础上做高质量的一代。他更像一个可以沟通的合作者,而不是一个工具。好,第一个热身结束了,我们来看看更复杂的任务,一个三 d 打印机模拟器。 这次那个朝长的思考链现象又出现了,而且比上次还夸张。对博主说,这是他见过最长的思考过程,但这个等待是值得的。 最终结果相当惊艳,视觉风格有点像 google sketchup, 非常简洁专业。功能上那个打印喷嘴的移动轨迹极其流畅平滑,而且非常准确地模拟出了三 d 打印第一层实体填充时那种来回扫描的路径。官方网站上生成的代码有语法错误, 然后博主把错误信息反馈给他,他居然陷入了死循环,不停地道歉,但就是不改。这蹭起来可不太妙啊,像个态度良好但能力不足的实习生。 但是有意思的来了,博主换到了一个叫 oppo router 的 第三方平台,用了完全一样的指令, 这次生成的代码还是有错,可当他把同样的错误信息喂给模型,成功修复了 bug, 尤其跑起来了。 等一下,同一个模型在不同平台上的表现居然有这么大差别,这背后可能是什么原因?是平台对模型 api 的 调用方式不一样?还是说 openroute 的 后端对这种循环错误有更好的容错机制? 这对我们普通用户来说其实是个很重要的提醒啊,选择在哪个平台用模型,得到的结果可能会天差地别。没错,这说明模型的表现不仅取决于它自己,还和它所属的生态环境息息相关。 最终那个游戏成品虽然画面有点啊古怪,但核心功能都有了,小密图、生命值系统墙壁也能真实地阻挡玩家。 博主的评价是,这是一个极佳的代理编码测试的起点。铺垫了这么多,终于到了整个测评里最精彩的迭代案例了, 就是那个 c d 飞行战斗模拟器。这个测试才算是把这个模型的迭代能力彻底给榨干了。 没错,这个案例堪称教科书级别,第一版彻底失败,控制台里一片红,全是错误。第二版呢, 模型很争气,修复了所有错误,游戏能跑了画面好多了,能看到子弹的轨迹。但问题是控制系统有 bug, 只要一按前进或者后退,整个画面就上下翻飞,根本没法玩。于是 测评博主就给出了非常详细而且严厉的负面反馈,批评游戏节奏慢,控力烂,玩法平庸。 然后第三版就诞生了,简直是质的飞跃。怎么说地图变得非常恰亮,有网格状的地面,远景的山脉,还有漂浮的云,飞行模型也更精致了。 最重要的是,战斗逻辑生效了,敌人真的会朝你开火,你也会掉血。它甚至还增加了撞到地面会受损的机制,整个游戏的可玩性提升了不止一个档次。哇哦,这个改进幅度也太夸张了, 不过资料里也提到了一个小小的遗憾,是的,可能是为了修复其他 bug 吧。第三版里,玩家自己的飞机没法开火了, 这也说明他的一带能力虽然强大,但并不完美,还是可能引入新问题的。他仍然需要人类的监督和多轮调试。就像一个非常有才华,但偶尔会顾此事彼的程序员。为了更客观地评价他,博主还做了个横向对比, 用一个三 d 高速公路赛车游戏的指令,同时测试了它和另外两个模型, minix 和 g l m 四点七对。先简单介绍下背景,在这个赛车游戏任务上, minix 的 表现中规中矩,能玩儿但不出彩。 而那个 g r m 四点七的表现堪称大师级,做出的游戏非常完整和精致。那 step 三点五 flash 在 这种对比下表现怎么样?他是不是又走了先出丑再逆袭的老路子?哈哈,完全被你猜中了, 他的第一版就只是一个可接受的蓝图,车子都不能动。第二版改进了赛车模型,但车子还是不能动。 到了第三版,博主用了和飞行模拟器测试时一样严厉的反馈方式,结果画面的提升又是大幅度的。 虽然游戏依然有明显的问题,但他再次证明了,只要给他清晰的反馈,他的进步潜力是巨大的。总结一下前面的编码部分,这个模型的画像就很清晰了。 他不是一个考满分的学霸,更像一个潜力巨大的学徒。你不能指望他一步到位,但只要你愿意当个好师傅,耐心指导,他能给你超出预期的回报。这个比喻非常精准,而且在这些编码测试之后,一个完全意外不到的强项浮出水面了, 这里才是真账。让测评博主感到震惊的地方,我猜到了,就是网页设计。他给的第一个指令就非常刁钻, 把史蒂夫的电脑维修店和比特币复制器这两个疯马牛不相及的业务融合,设计成一个网站风格,还要是高端欧洲设计公司那种感觉,这个要求简直是强人所难。但结果呢? 博主的评价是远超预期,字体选择鼠标悬停的微交互,整体的现代科技美学都非常到位。 他似乎真的理解了高端欧洲设计公司这种抽象风格背后的设计语言和精髓。这一下就打开新世界的大门了。博主立刻跟紧第二个指令,给一个叫 meebot 的 流行文化机器人做个网站, 风格要求是高端瑞典设计公司,结果直接被博主封为网页设计猛兽。网站背景用了一个巨大的机器人头像剪影,视觉冲击力极强,整体设计充满了北欧风格的简洁、现代和力量感。 虽然有些图片没加载出来,但设计本身的概念和执行力都无可挑剔。我已经迫不及待想知道第三个测试了。第三家公司叫 apex alpha traders, 一 家金融公司,风格要求是高端纽约设计公司。结果同样经验,整个网站的金融感扑面而来, 顶部有滚动的股票代码,背景是动态的渐变色,布局非常专业。在最让人觉得不可思议的细节是,他在联系方式里自动填上了一个电话号码,区号是二一二等等,他自己加了二一二区号, 纽约曼哈顿的区号。这也太疯了。他不是在简单的画一个网站,他是在动用他的地理和文化知识库来填充设计细节,让这个虚构的公司显得无比真实。 这完全是另一个维度的能力了。这就是一个决定性的细节。他证明了这个模型在处理设计任务时能融合视觉创意和事实知识,这让他在网页设计这个领域的表现只能用经验来形容。好了,我们来梳理一下 step 三点五 flash 是 一个特点极其鲜明的模型,它的第一次尝试可能不尽如人意,甚至会失败。但它真正的杀手锏在于强大的代理能力,能深刻理解、反馈并进行高质量的依赖。确实如此, 它的定位非常特别,不是一个一次性给你标准答案的工具,而更像一个需要你不断引导和写作的创一板块。而且,它在网页设计上展现出的那种天赋,真的是这次探索中最大的惊喜。 当然,他也有一个非常现实的顾虑,就是那个常常的思考链,对吧?这在本地设备上可能会是个大问题,他为了想出好点子,可能会把宝贵的上下文控寻找迅速耗尽。我记得测评博主就在自己的本地设备上遇到了运行失败和系统卡死的问题。是的, 这是他在走向大规模本地化应用前必须解决的一个性能和资源消耗的平衡问题。他强大的思考能力目前来看是有代价的。那么这一切为你带来一个非常值得思考的问题。 这个模型他似乎从设计之初就没有追求第一次就做到完美,他的整个工作流就是建立在对话和修正之上的。嗯,这就引出了一个很深刻的转变, 当 ai 工具越来越像一个不知疲倦、速度飞快但时而犯错的学徒时,我们作为人类最有价值的技能,是不是正在从如何写出完美的初识指令转变为如何成为一名优秀的编辑、导演和导师,对 我们的核心任务不再是开第一枪,而是引导 ai 通过一次又一次的迭代,最终命中我们真正想要的目标。在这样一个人与 ai 的 全新创作伙伴关系中, 当 ai 扮演那个才华营意但需要指导的学徒时,我们又该如何定义自己的角色呢?

到底有没有一个完全免费的本地运行的 ai 代理?阿里推出 co pub, 让担心使用成本和数据安全的朋友们得偿所愿, 今天就用一分钟带大家体验吧。首先是下载和本地部署模型,先安装 almas studio, 需要教程的进主页查看置顶视频。 接下来在 musego 搜索 copart 杠 fresh 要选择 g g f 格式,一般就是极显,选四 b 杠 two 四独显且显存大于六 g 的 可选九 b 杠 two 四 下载到本地,打开 lms。 二 d o 就是 配置模型参数,加载模型并开启服务,然后去官网下载安装 copart, 然后它支持多种方式安装电脑没有 python 的 选择就是一键安装, 否则使用 p i p 安装成功。启动后在浏览器打开网址,进入 cocore 的 web 界面, opencore 有 的功能 cocore 基本都有, 而且界面配置对新手来说更友好。接下来开始配置模型,右上角切换到中文,左侧点模型,选 l i s studio, 然后发现模型,然后测试连接这个配置成功后可以聊天,开启愉快的玩耍吧!