报道,大帅近期 ai 圈最大黑马直接炸场,全球 a 站领域顶流 open call, 也就是大家说的小龙虾,直接把默认模型换成了咱们国产的 deepsea 微次 f l a s h, 彻底抛弃 g p t call 这波真的是降维打击,性价比风神 g p t 五点五,每百万输出 token 要三十美元,而 deepsea 微次 f l a s h 仅需零点三美元,成本直接差的一百倍!关键它绝非廉价凑数两千八百四十亿,总参数一百三十亿,激活参数 百万级超长上下门实战 a 阵任务性能完全对标顶级闭源模型。更炸裂的是,模型发布当天,华为、韩五 g、 百度、阿里等八家国产 ai 芯片巨头同步完成原生全量适配, 零等待无缝落地。这直接打破了国产 ai 模型强缺芯片、芯片好缺适配的死循环,彻底摆脱英美打卡脖子困境。加上 m i t 免费商用协议,妥妥激活整条国产 ai 产业链,属于是官道超车的顶级名场面。
粉丝3.6万获赞219.0万

这 v 四本来都便宜到这个价格了,然后再做把活动 flash 降到零点二元每百万 token。 但是实际上现在这个世界上 token 的 价格极其割裂,贵的 token 对 面的五点五和 opus 四点七,那百万 token 输出能干到上百美元的都有。 所以兄弟们,两条线重新走起来了啊, general 普类的推 token 在 变便宜,垂类的 token 在 变贵,这是完全不同的两条路线。那有些人想问了,为什么 v 四出来啊,我们这边两家上市的大冒险公司这几天噼里啪啦房倒屋塌了, 因为他们在前一段时间至少过去一个月,其实走的是克劳德的路线,也就是说做好的 token, 贵的 token, 然后涨价扣定 plan, 这样的话带给市场一个很好的预期, token 以后能卖很多钱,所以就带来了溢价的上涨。那现在 v 四再次拿起价格屠夫的刀,肯定是多少有点误伤友军了。但是目的都是一样的, 我们最终要用便宜的 token 冲向全世界,让对面觉得我比你好,百分之五十,我难道就不能卖一百倍的价格吗?那看来是不行了啊,说白了不是 token 贵不贵的问题,这是值不值的问题。 你 open ai 年收入二百五十亿美元 and so pick 在 前段时间超越之后,按照三百亿美元算了啊,这个东西它就是必须维持这个价格,因为它的估值顶住了,它的 toc 降不下去。兄弟们,汽油分九二九五九八一百,以后 toc 也要分,只要扔给 a 阵子的超级巨大的任务,那就都由我们 v 四来支撑了不喽。

同样掉一次 api, cloud 要一百八十块, gbt 要一百零八块。 deepsea 今天出了个模型,两块钱。这次最炸裂的是价格, v 四 flash 的 输出定价每百万 token 只要两块钱。 cloud ops 四点六呢?一百八十块, gbt 五点四, 一百零八块。同样跑一百万 token 的 输出, cloud 一 百八, gbt 一 百零八, deepsea 两块。关键是 flash 的 性能并没有缩太多水,各项 benchmark 只 只比旗舰模型 v 四 pro 低一到三个点,而且缓存命中的话, flash 输入价格只要两毛, pro 也才一块。编程能力这次是真的强, code forces 评分三千二百零六, gbt 五点四是三千一百六十八, gami 三点一是三千零五十二。 v 四 pro 排第一, live codebench 九十三点五, 也是第一。 swbench 是 very fed, 就是 让 ai 去修真实的 github 一 数。 v 四 pro 拿了八十点六,和 cloud os 四点六的八十点八基本持平, 是开源模型第一次在编程上全面打赢闭源。再说上下文窗口, v 四两个模型全部默认支持一百万 toc, 上下文大约三百万字, 什么概念?一个中型项目的全部源代码一次性丢进去它都能读完。以前各家长善压文都是高级功能,要加钱, deepsea 直接给你当默认。它用了一个叫 dsa 稀疏注意力的新架构, 长文本的算力消耗比上一代 v 三降了一大截,你看这个曲线对比就知道了。打开 chat 点 deepsafe 点 com, 专家模式就是 v 四 pro, 即时模式就是 v 四。 flash api 也已经上线了,改一下 model name 就 行。

玩了一天的 deepsea 威斯烧了三千万的 token, 只花了十块钱,这也太香了。虽然威斯 flash 这么便宜,但效果一点不拉。接到 c c 后,我先让他给我的虚机装了个小龙虾,十分钟搞定。然后我就研究更加清亮的 china, 然后发现小龙虾也支持 open web ui 了,顺手也让威斯 flash 给我部署搞定了。 用这个 y b u i 可以 直接让小龙虾并行跑多个任务,不需要折腾创建一堆机器人了。每次对话后,他还会预测你的请求在我这的命中率还挺高。爱马仕也让他通过 s s h 装在另一台蓄积里了。我后续会分享爱马仕的使用体验。你使用 vs flash 了吗?评论区说下你的感受,我是阿图,下个视频见。

今天来给大家算笔账,就是本地模型,他就是一个大坑,上次发了一个本地部署大模型的一个视频,引起大家讨论,发现大家对本地部署大模型这件事情还非常感兴趣的,但是我想说的是,你可以感兴趣,但你不要特别感兴趣。好吧,我给你算笔账你就知道了。 假如说你是一个 ai 的 爱好者,你一不小心花了三万六千元买一部最新的 m max, 一 百二十八 g 两 tb 的 十四寸的 macbook, 然后准备去跑大模型了,然后你部署了一个最新的 deepsea v 四 flash 的 量化版本, ok, 你 的产出到底是多少呢? 首先这个量化版本一下子会干掉你,一百多 g 的 内存可以与 m max 芯片超强的带宽,那你基本上可以达到一个八十多个每秒的速度,这已经相当的快了这本地部署的环境啊。 然后我们再来算一下,一天二十四小时八万六千四百秒不间断连续运行,能够产出多少头肯呢?答案是六百九十一万头肯。 那这七百万的头肯市值是多少呢?我们按 deepsea v 四 fly 是 按百分之九十的缓存命中的这个量来算,大概一百万是两块钱的,你七百万就剩十四块钱, 所以你花三万六千块钱去买这台电脑,然后本地部署,让他在本地跑这个大模型,他一天的产出就是十四块钱,你要回本的话,就需要需要多少钱? 需要七年零一个月,怎么样?回本还是蛮快的吧。 所以最后的结论是,你的数据如果有绝对的隐私需求,或者是私有化的需求的话,就当我没说过,如果没有这种需求,不要去跑本地模型啦,解 a p i 吧。

最近 dspv 四不是发布了吗?也有很多兄弟啊,问佳琪相关的解决方案怎么样了?那佳琪这边也已经开始测试了,目前单台九幺零 b 模组的服务器可以完全跑满 dspv 四 flash 版本,如果佳琪测试到五百平方的情况下,能达到每个平方二十四 tokens, 其他像八卡的五零九零,八卡的 pro 六千六千 d 我 们也已经在准备加紧测试中,不过也有兄弟问,选哪个版本部署比较好啊?佳琪觉得不用犹豫,直接冲 flash 版本就好了。 flash 版呢,只需要四到八卡的中高端 gpu 就 可以部署了,是当前性价比最优的选择,同时兼顾了性能与落地,硬件的门槛呢会比较低,对比 v 四 pro 版本的话, 落地的成本可以降低五到八倍。 v 四 pro 只适合那种需要极致需求的企业。 fresh 版呢,不管是做企业的知识库,智能客服还是代码辅助啊, 这个能力呢,已经完全够用了。那么我们这边呢,巴卡的五零九零和巴卡的 rtx pro 六千 d 的 测试数据这两天呢也会出来,到时候第一时间啊会分享给到大家,想要了解具体方案的兄弟呢,可以滴滴加起咨询哦。

性价比最高的这个模型出现了,就是新上线的这个 deepsea v 四 flash 啊, flash 版本, flash 呢?它现在呢?它有几大优点啊?第一呢,就是超长的上下文,长达一兆呀, 平常的咱们模型都是两百 k, 对 吧?然后有两百五十六 k 的 这个 deepsea 四啊, 一兆啊,一 m 啊,一千 k 的 这个超长上下纹。另外就是它的性价比, 我觉得是目前最高的 v 四 flash 版本就是它不是最便宜的,但是性价比是最高的,两块钱百万头啃。第三个优点呢,就是它速度非常快啊,整体还是不错,但是这个 deepsea 目前它有一个问题啊,我看它这个幻觉可能会有时候会有一点, 所以还是得再验证验证吧。威斯弗莱斯速度非常快,我觉得这是它的最大的一个特点,还有它非常便宜,大概就是这样。

美国的那个小龙虾正式宣布把默认模型换成了咱们中国的 deepsea v 四 flesh。 没错啊,没听错啊,就是那个美国人自己做的全球 agent 领域的标杆产品。现在打开它,默认跑的不是 gpt, 不是 cloud, 是 咱们国产的大模型。为什么呢? 因为够便宜啊,而且性能也没差多少。我给大家算笔账, openai 刚出的 gpt 五点五,每百万输出 toon 要三十美元,而 deepsea v 四 flash 的 定价是多少呢?两块钱 人民币,折合成美元才零点三美元,差了整整一百倍。这不是什么一分钱一分货的便宜货。 v 四 flash 总参数两千八百四十亿,激活一百三十亿,全系标配一百万 toon 上下文推理能力在 max 模式下几乎追平 pro 版本。 美国人自己测了,用它做 ag 的 任务,效果跟之前用的顶级币源模型没什么区别,但成本砍到了百分之一, 你换任何一个脑子正常的,都会毫不犹豫的把它设成默认吧。商业社会就是这么现实,谁能提供差不多的产品,价格最便宜一百倍,你就别说一百倍了,你就是两倍三倍的, 谁都得换呀。但真正让整个行业震动的还不是这个。就在四月二十四号 deepsea v 四发布的当天, 华为、升腾、韩五 g、 海光信息、摩尔县城、木兮股份、百度、昆仑星、阿里平头哥、真武、天树至星,整整八家国产 ai 芯片厂商全部完成了原声适配,这叫得零级适配? 模型发布当天芯片就能跑,而且是全量部署,不是什么阉割版、测试版,这在全球 ai 产业史上是头一回。 以前是什么样呢?英伟达出个新显卡,或者 open ai 出个新模型,其他厂商得花好几个月甚至半年时间去调试,去适配, 有时候等你适配完了,下一代产品都出来了。这次不一样, deepsea 提前跟这八家国产芯片厂商深度协同,从底层算子开始,一起做全链路优化。模型发布的那一刻,所有国产芯片都能直接跑,而且跑得很好。比如华为、深腾九五零 pr 跟 v 四深度优化之后,单卡推理性能达到了英伟达 h 二零的二点八七倍,推理速度直接提升了三十五倍。韩五 g 的 m l u 五九零多模态推理性能较上代提升了三倍。海关的 d、 c、 u 也完成了全量适配,给开发者提供了一条完全不用依赖英伟达的部署路径。 这意味着什么呢?意味着我们终于有了一个完整的、可以闭环的国产 ai 生态。以前我们说国产芯片,总有人说啊,能跑是能跑,但没有好模型适配啊。 那说国产大模型呢?又有人说,模型是不错,但只能在英伟达的卡上跑。现在这个死循环被打破了, 从芯片到模型,到服务器到云服务,整条链现在都能国产化了。而且不是某一家单打独斗,是八家芯片厂商集体战队,华为、百度、阿里这些科技巨头全部入局,形成了一个生态矩阵。 高盛最近还出了一份报告,说的特别到位,他们说 deepsea v 四的发布意义远不止于一个大模型的技术突破,也不止是 npu 和 gpu 的 国产化那么简单,它真正带动的是整个 ai 产业链的国产化。 你想啊,以前所有的 ai 应用,不管是国内的还是国外的,最终都得绕到英伟达的卡上去。英伟达说涨价就涨价,说断供就断供,整个行业的命脉都捏在别人手里。 现在不一样了,有了 v 四这个性能足够强、价格足够便宜的开源模型,再加上八家国产芯片的全面适配,以 后企业部署 ai 服务就有了一个完全自主可控的选择。而且这个选择在成本上比英伟达方案低得多呀,就会产生一个连锁反应,越来越多的企业会选择国产算力,国产芯片的订单就会越来越多,产量上去了,成本就会进一步下降,然后又会吸引更多的企业进来,这是一个正向循环。 而且 deepsea 用的是 mit 开源协议,企业可以免费商用,这就大大降低了 ai 应用的门槛。以前很多中小企业用不起 ai, 现在用 vs flash, 成本几乎可以忽略不计。 你看,从最底层的芯片,到中间的大模型,再到上层的应用,整个产业链现在都活了,这才是真正的竞争力,不是靠某一个技术单点的突破,而是靠整个生态的成熟。

deepseek 刚刚发布的 v 四版本,这绝对是国产 ai 史上极具里程碑意义的一次发布。错,我刚看到这个消息的时候,直接从沙发上弹起来了,这价格杀的也太狠了吧,简直是掀桌子级别的革命啊! 你先别急着激动,咱们先把技术参数掰开揉碎了说。这次 deepsea 搞了个双版本矩阵, v 四 pro 是 一点六万亿,总参数四九 b 激活参数属于旗舰款。 v 四 flash 是 二八四 b, 总参数一三 b, 激活参数主打性价比。 这俩版本直接覆盖了从超高性能到极致成本的全场景。哎,老灯,你说的这个激活参数跟总参数到底有啥区别啊?我听着有点懵。 我给你打个比方,总参数就像你家里的所有藏书,激活参数就是你当下正在翻的那几本书,之前很多大模型,总参数看着吓人,但实际能用的不多,就像你买了一屋子书,但是每次只看一页。 deepsea 这次把激活参数利用率提上来了,相当于你一次能看一整本书,效率自然就上去了。 哦,原来是这么回事,那这次的三大核心突破,最厉害的应该是那个百万 token 上下文吧,据说能一次性处理整本三体。 错了,百万 token 是 什么概念?就是一百万字的文本,相当于把三体三部加起来一次性喂给 ai, 它能从头读到尾,不遗忘任何细节, 而且推理效率提升不是一点点。 v 四 pro 的 flops 需求比 v 三点二降低了百分之七十三, kvatch 只需要原来的百分之十, flash 版本更夸张,分别压到了百分之十和百分之七,这意味着什么?意味着同样的算力能处理更多的任务,成本直接打骨折, 这也太夸张了吧,那 agent 能力跃升呢?我听说它的代码能力已经是开源最佳了,对 agnic coding 评测拿到了开源第一,内部使用体验比 sony 四点五还好,交付质量接近 opus 四点六的非思考模式。 这说明什么?说明 deepsea 现在不仅能做简单的文本生成,还能像个专业程序员一样写代码解决复杂问题,而且质量还很高。 那最让我惊喜的是,它全面适配了华为的深腾九五零 p r 芯片,从 q d 转向了 c a n n 框架,单卡算力是英伟达 h 二零的二点八七倍。这是不是意味着咱们国产 ai 终于摆脱了对英伟达的依赖? 可以这么说,之前咱们很多 ai 公司都被英伟达掐脖子,芯片一涨价,整个行业都跟着难受。现在 deepsea 全面适配国产算力相当于打通了从底层芯片到上层应用的全栈生态, 而且升腾九五零 pr 的 单卡算力比 h 二零还高,这就给了国产 ai 一个翻身的机会。 说到价格,这次才是真的杀疯了。 vs flash 输入每百万 token 才一块钱,是 gpt 五的七十二分之一。 cloud opus 四点六的六十五分之一,缓存命中之后, flash 版本才两毛钱, pro 版本一块钱,这价格简直是白送啊! 你算一笔账就知道了,之前个人开发者用 gpt 五月成本大概是一千七百二十八块钱,现在用 vs flash 月成本只有九十六块钱,降幅百分之九十四点四,相当于原来买一杯奶茶的钱,现在能买十八杯,这对开发者来说简直是天降福音。 那这么便宜的价格会不会影响 ai 的 质量啊?毕竟一分钱一分货嘛。你这个问题问得好,但是这次 deepsea 的 策略是开源加低价加高性能,它的 flash 版本虽然参数少,但通过 dsa 稀疏注意力和 miuno 优化器把效率提上来了,质量并没有打折扣。 而且它的 pro 版本性能对标顶级模型,但价格只有他们的几十分之一,这就形成了一个碾压级的优势。那产业影响呢?我听说阿里、自洁、腾讯这些巨头已经下单了几十万颗深腾九五零 p r 芯片。 没错,这些巨头都不傻,看到国产 ai 起来了,肯定要抢先布局。几十万颗芯片意味着什么?意味着他们要把自己的 ai 业务迁移到国产算力平台上, 这就给了国产 ai 生态一个爆发的机会。而且 deepsea 的 开源策略让更多的中小开发者能用上高性能的 ai 模型,这会催生更多的 ai 应用,可能会引爆 ai 应用的寒武纪大爆发。 那你觉得这次 deepsea v 四发布,是不是意味着中国 ai 从追赶者变成了引领者?可以这么说, 之前咱们一直在跟在 open ui 后面跑,现在 deepsea 在 性能、成本、生态上都实现了反超,这就给了咱们一个引领全球 ai 发展的机会。而且它的价格革命会让 ai 普绘化,让更多的人能用上 ai, 这会加速 ai 的 普及和应用。 那对于普通开发者和企业来说,现在应该怎么做呢?我给你几个建议。首先赶紧去体验 deepsea v 四, 不管是 pro 还是 flash 版本,都值得一试。其次,把自己的 ai 应用迁移到国产算力平台上,不仅成本低,而且不受制于人。最后,抓住这次价格革命的机会,大胆创新,开发更多的 ai 应用,说不定下一个爆款就出自你手里。 老邓,你说的这些我都记下了,但我还有个问题,这次 deepsea 的 技术创新,比如 dsa 稀疏注意力、 mhc 流行约束超连接和 muun 优化器,这些到底有啥用啊?能不能用大白话给我解释一下? 没问题 d s a。 稀疏注意力就是在处理文本的时候,只关注重要的部分,忽略不重要的部分,这样就能减少计算量,提高效率。就像你看一篇文章,只看标题和重点段落,不用一字一句的读。 mhc 流行约束超连接是解决超大规模 moe 训练的不稳定性问题,相当于给训练过程加了个安全带,让它不会轻易翻车。模养优化器是加速训练收敛的,就像你开车上高速,用了涡轮增压,速度更快,而且更稳定。 哦,原来是这么回事,那你觉得这次 deepsea v 四发布对全球 ai 格局会有什么影响? 我觉得会打破 openai 一 家独大的局面。之前 openai 凭借 gpt 系列垄断了高端 ai 市场,现在 deepsea 用低价高性能的产品直接冲击了它的市场份额。 而且咱们国产 ai 的 崛起,会让全球 ai 市场从单级走向多级,这对整个行业来说是好事,能促进竞争和创新。 那你对 dpike 的 未来有什么期待?我希望他能继续保持这种技术创新和价格亲民的策略,把 ai 普绘化进行到底。同时我也希望他能带领国产 ai 生态一起发展,让更多的国产 ai 公司能用上高性能的模型和算力,最终实现中国 ai 的 全面崛起。 说得好,老邓,我觉得这次 deepsea v 四发布,不仅是国产 ai 的 一个里程碑,更是全球 ai 发展的一个转折点,它让我们看到国产 ai 不 仅能追上,还能超越。 没错,这次发布确实意义重大,它让我们知道,只要咱们肯投入、肯创新,就能在全球 ai 竞争中占据一席之地。而且它的价格革命会让 ai 从少数人的奢侈品变成多数人的必需品,这会改变整个世界。 好了,今天咱们就聊到这里,如果你对 deepsea v 四感兴趣,不妨去体验一下,说不定会有不一样的收获。

同一个任务,一个模型花了五十块,另一个只花了十块,你猜谁效果更好?朋友们, deep seek v 四终于发布了,这次没有炸裂,但有一条很清晰的信息, deep seek 重回一线了。今天我用五件事帮你快速搞懂这个模型。 第一件是性能定位, deepseek v 四是万亿参数的猫腻架构,对标海外旗舰模型,按官方说法还差三到六个月,但放在国产和开元模型里,它已经是领先的了,跟 g o m 五点一、 kimi 二点六比略好一点,但拉不开差距。第二件是百万上下文, 这次最重磅的更新就是原生支持一百万 token 的 上下文长度,之前在国内开源领域是没有的,连 cloud 都得顶配版才行,现在 deepsea 把它做成了标配,这对于 agent 的 时代来说是太重要的基建了。第三件事,价格看着贵,其实便宜。 flash 版本输入一元,输出两元,每百万 token 缓存命中只要两毛。我实测同一个任务, glm 五点一花了五十块, v 四 pro 只花了十块。更离谱的是, flash 版价格比 pro 便宜十二倍, 但普通任务的表现几乎没有差别,我甚至把 flash 当 pro 用了一整天都没发现,后来改回来重跑,结果也没太大区别。所以,如果你做普通任务, flash 可能是当前性价比最高的选择, 而且现在到五月五号之前还在打折,只要原价的四分之一。第四件事, agent 能力真的强。这次 v 四在工具调用、世界知识、中文写作、竞赛、编程和数学方面提升都很大, 尤其是代码能力,内部评测说优于 sonnet 四点五,交付质量接近 opus 四点六,建议大家把它接到 cloud code log chat、 hermes 这类 agent 工具里去用。 不过实测下来有个小问题,国产模型对 skill 的 主动判断和调用普遍有点弱,经常需要手动提示才会用。 v 四也有这种情况。另外它还适配了华为升腾芯片,在国产芯片上也能跑了。 第五件事,行业格局不是一次发布就能改变的,很多人期待 v 四拳打闭圆,碾压开圆,震撼世界。但说实话, 没有人能在又难又长又不确定的事情上每次都四两拨千斤。格局的变化是积累出来的, 现在中国 ai 已经不是纯粹跟随的阶段了。 deepsea 的 发布结尾写了一句话,我觉得特别好,不幼于玉,不孔于匪,率道而行。 这个态度跟当初 v 三和 r 一 一模一样。所以整体建议大家去用用,尤其是接入 agent 的 工具,如果懒得切换或者不用 agent, 也不用太纠结,差不了太多。

就在上周, ai 圈上演了一场戏剧性的价格碰撞, open ai 悄悄上线 g p t。 五点五 api, 定价冲到了天价。这个天价为每百万投坑,输出一百八十美元。 几乎同一时间,大洋彼岸的 deepsea 扔出了震撼弹, v 四 f l a s h 版本登场,输出定价仅为二元人民币,折合美元不到零点三。 openai 的 逻辑很微妙,他们暗示 g p t。 五点五虽然单价贵,但更聪明,完成任务消耗的 token 更少。这套说辞像极了奢侈品店的贵姐,虽然包贵,但背得久,折算下来每天只要几块钱。逻辑勉强说得通,但信不信由你。 deepseek 这边就更野了一点,六万亿参数的 pro 版,加上轻量级 flash 版权重直接开源,全系标配一百万 token, 超长上下文,技术报告随便看,代码随便拿,商务也不设限。 这就像集市摊主旁边人卖天价,他摆出来卖三块钱,还大方地说随便拿随便用。那么问题来了,谁赢了这场定价战?但这个问题本身可能就不对,这两个东西比的根本不是同一件事。 g p t。 五点五像穿西装打领带的销售总监,走奢侈品路线, 告诉你,这价格值,用得少,但用得精。主打一个省心服务,这是卖解决方案,不是卖工具。 deepsea v 四更像穿拖鞋来的技术宅,往桌上扔份技术报告,代码都给你了,想省钱就自己折腾。一个在卖服务,一个在给工具, 这是商业模式的根本差异,也是市场定位的清晰分野。作为普通打工人,我用不上一点六万亿参数,也付不起一百八十美元的天价。但这场碰撞让我思考更深层的问题。这一年, ai 圈风起云涌,大厂涨价、模型店贵、开源周期,我们这些普通用户一直在担心 ai 会不会越来越用不起。 今天这两条消息撞在一起,像个预示性的答案。愚人的走精英特工路线,开源的走农村包围城市,两个方向同时加速。未来的 ai 世界,可能不是用不用得起的问题,而是选择哪种生存。

这期是给南京某高校定制用单卡五零九零私有化部署 deepsea v 四 flash, 还兼顾 c m g 油藏数值模拟的应用工作站。这里模型部署采用的是 k transformers 单卡五零九零方案,搭配两颗 a m d 枭龙九五六五 共一百四十四核心两百八十八现成,既能加速摩尔推理,又能完美匹配并行求解。外加二十四根三十二 g d d r 五内存条共七百六十八 g 内存容量, 支撑长上下文和千万级网格计算。而 tx 五零九零三十二 g 显卡单卡显存足够承载激活专家与 kv 缓存, 配合大内存做权重卸载。 blackboard 架构原声支持 f p 四 f p 八低精度浮点硬件加速,可充分发挥量化模型的计算效率。这款工作站适合中小企业、实验科研机构部署应用,性价比高。

天呢, deepsea 微四这个版本正式全网发布了,而且呢同步推出了它的 pro 和 flash 这两个核心的版本, 包括我们自己蘑菇云这个团队在内,我相信很多这种有私有化大模型部署需求的企业单位啊机构,我相信现在都在考虑要不要立刻马上迁移到 deepsea 微四这个版本,或者呢,就是至少要拿来测试试用一下对不对?但是你要明白,只要涉及到私有模型的这种迁移, 首先绕不开的核心问题就一定是硬件能不能适配新的设备,应该怎么选型的问题,因为只有这个硬件匹配到位了,才能够把 deepsea v 四的真实的性能,核心的优势完全发挥出来。 大家应该都还记得前段时间 openclaw 特别火的时候,一些人在自己的私有的小算力上使用的时候,他的只能回答问题但不能干活的那个尴尬的局面,大家应该还历历在目。所以 今天这条视频我就尝试给大家讲讲清楚, v 四的 pro 版本和 flash 版本应该分别适配什么样的硬件规格,显存的标准,以及落地部署的真实的预算的价格区间,给所有的准备迁移测试私有化模型的同行做一份实打实的落地参考。 首先我先来说一下 deepsea v 四 pro 这个版本,这个版本其实是这次发布的旗舰满配版,应该是一个妥妥的工业级的大模型, 拥有一点六万亿的参数级别,因为是 m o e 架构,也就是混合专家模型,他每次激活的模型的量呢,大概是四百九十亿激活参数, 所以呢,这就决定了他根本没法用这种普通的一些消费级显卡。硬件的门槛是非常明确的,你必须要选用服务器级别的配置,因为他对显存有非常高的要求, 比如说英伟达的阵营,它的最低标配我预计就得是 a 一 百啊这种八十 g 显卡的这种,这个八十 g 显存的显卡三卡起步,或者呢就是 h 一 百八十 g 显存的两到三卡起步。 国产算力这边对标的是升腾九五零的多卡基群,或者是韩五 g 的 m l u 五九零的这个基群。因为核心硬件的标准呢,单卡显存必须得做到八十 g 以上,低显存普通的服务器就完全会带不动的,因为他的一点六万亿的参数,激活四百九十亿参数,这个量对显存太迟显存了。 下面我给大家来算算成本,也就是帮大家做做预算。按目查,目前我查了以下的行情价格, a 一 百八十 g 的 单卡啊,这种价格在十一万到十三万人民币之间,三张卡这种入门的配置,光显卡我感觉就待应该是三十三到三十九万人民币了。 h 一 百八十 g 的 单卡是十九万双卡起步的话就是三十八万以上,如果再算上,你得搭配一个机筐,再有一些机房的运维供电、散热配套,整体的解决方案下来,我觉得最低也得五十万起步, 应该是属于一个企业级的入门的价格,这个大家就自己基于自己的数能力和需求来计算。接下来我再讲一下这个 v 四的 flash, 这个版本也是这次性价比最高,行业迁移价值最大的版本, 很多人容易理解错,总觉得这个 flash 版本是不是就是一个缩水的低配版本,其实我的理解完全不是的,它的核心,这次 deepsea v 四最大的核心亮点,我认为这个 flash 也好, pro 也好,其实都具备是一样的,也就是一百万 token 的 超长上下文窗口, 换算下来就是将近百万字的长文本处理能力,也就是一本红楼梦,直接进去他就直接能学习明白了。 过往的主流模型,其实普通的只有十万级的这种上下文窗口,也就是幺二八 k 这个左右,这次呢是一兆,所以说百万级就给我们未来很多的这种依赖于长文本的场景会带来非常好的体验。这块后面我会详细讲一下 flash 版本的硬件门槛,我先说一下它,其实硬件它是大幅下降的,是中小机构、垂直行业,甚至一些个人的,即刻是能够使用起来落地部署的一个比较好的选择。 企业部署呢,我算了一下,单张的 a 一 百八十 g, 升腾九幺零 b 以及升腾九五零单卡都能稳定运行。如果你是一个个人小团队、工作室本地私有化部署,消费级的这种显卡其实也是够用的。比如说 rtx 的 四零九零二十四 g, 因为我们其实就用的是这种消费级的,我们大概有八张消费级的卡, 两张卡就能够稳定运行,单卡能跑通,就能够让这个百万 token 的 这种长文本的这种上下文就能够非常流畅的运行了。如果是从这个预算来看,这个 flash 版本一张 rtx 的 四零九零二十四 g 的 显卡,目前的市场价格大概在一万八到两万二, 所以说小成本就能搭建起本地化 c 优化模型了。如果是企业轻量化部署,整体预算我觉得也就是在二十万以内,所以说对比 pro 那 个版本,我觉得还是性价比非常高的啊,可以来尝试一下,我们自己肯定会马上就要迁移的。 最后我再说下 deepsea 微四的适用场景,因为这个版本我觉得它最大的亮点一个是 a janty 就 做了一些场景的智能化优化,但是另一个我觉得核心就是它的上下文窗口翻了将近十倍跟以前, 所以我觉得非常适合这种长文本海量文档垂直行业的四化知识库建设这种场景。这也是我非常建议各类机构优先迁移重点测试的这种领域。像比如医疗机构,他需要长期沉淀海量的病例诊疗的方案,医学文献、律师事务所、会计师事务所里边有的这种合同卷宗、审计的提稿文书等等, 以及还有大量的这种政企单位,对不对?你们都需要文山会会海是不是归党海量的政策文件,历史档案、项目资料。所以呢,这类行业我觉得是覆盖面非常广的,这些行业都有大量的长篇幅的、连续的文档的处理的刚需。 之前受到大模型上下文的这个影响啊,所以呢,只能把文档进行 red 进行拆分,进行碎片化的问答体验,有时候经常就切块,切的会不准。 而这次的 deepsea 微四呢,它全系百万级的超长上下文,我认为对这个场景应该是一个非常好的一个解决,大家可以尝试体验一下。 我觉得一次性加载这整套的档案,整本的卷宗,批量的病例,做完整的关联,智能的问答资料的汇总,我觉得对于它的精准度,对于那个幻觉的避免等等都是非常好的一个解决,我的我的感觉大家可以尝试一下。 最后呢,我做一个总结,如果你是大型的央企、大厂、科研单位,要做核心,高算力、高复杂度,任务预算充足,那就是 v 四 pro。 如果你是医疗机构、律所事务所、中小企业机构,对这种长文本处理这个海量知识库的私优化, 我觉得那你就不用上那些 pro 的 这种比较重的了,你就 flash 这个版本性价比是非常高的。好了,罗立巴赫,说了这么多啊,希望对你有用。也欢迎对这个话题感兴趣的朋友们,咱们小窗多多交流,拜拜。

这其实给上海某企业部署 d p c v 四 flash 模型与生物科研计算定制服务器,模型精度大小在 i n t 八处理器搭配双路 amd 枭龙九六五四一百九十二核心三八四现成锐屏三点七 g 匹配声信与分子模拟等并行负债六十四 g d d 二五四千八百兆赫兹内存条一共八根, 五百一十二 g 的 内存容量满足模型 em 上下文的刚需。四张英伟达 rtx pro 六千服务器版总显存三百八十四 gb pro 六千原声,支持 f p 四精度完美匹配 v 四 flash 的 em 上下文混合注意力与量化推力需求, 后期还能满足多卡扩展需求,整机适合中小企业实验机构部署应用,性价比高。

就在昨天,二零二六年四月二十四日, deepseek 推出年度王炸 v 四版本正式发布。这是全球 ai 圈今年最重磅的一颗炸弹,让所有竞争对手都倒吸一口凉气。先看参数, v 四最大参数量达到一点六万亿 tokens, 上下门窗口直接拉到一百万 tokens, 这意味着什么? 相当于一次能处理整本书籍级别的内容,复杂推理能力前所未有。架构层面, v 四采用猫混合专家模型,配合稀疏注毅力机制 dsa, 大 幅降低计算和显存需求,性能更强,消耗却更省。这是一次底层技术的全面升级。 这次 deepseek 同时推出两个版本, v 四 pro 配备完整的一点六万亿参数,支持复杂推理的专家模式。而 v 四 flash 则以两千八百四十亿参数支撑快速模式,专注处理简单任务,两种模式任你切换。 最狠的还是价格, v 四的 api 成本低至主流竞品的百分之一一折价格,顶级性能,这个定价直接掀桌子了,让整个行业都睡不着觉。 deepseek 一 直坚持开源路线, v 四的代码能力在开源领域全球领先,开发者可以自由使用模改,企业可以低成本部署开源基因,贯彻到底。 这次 v 四还有一个重大转变,训练框架从英伟达迁移到了华为升腾,这是国产 ai 和国产芯片的深度联姻,也让 deepseek 成为首个完全适配升腾生态的大模型。 v 四发布背后, deep seek 在 二零二六年四月中旬正式打开对外融资窗口,核心人才曾被字节腾讯高薪挖角,融资资金将用于训练更大模型和招募顶尖人才。 ai 竞争本质是人才战争。 v 四的发布让整个行业震动,智普 mini max 提前错峰发布算法团队闻 deep seek 色变,闻风而动。业内人士直言,不发影响股价,发了性能不如也影响股价。整个行业都在找应对策略。 deepseek 从理想主义的技术乌托邦,正在变成重视产品和商业化的务实公司,内部已组建数十人产品团队,探索 a 阵等新形态。从追赶者到引领者, deepseek 正在重写全球 ai 竞争格局。 ai 时代,中国力量正在定义规则。

两块 h 二零九十六 g 显存,本地跑 deep sec v 四 flash 能跑通吗?大家好,我是 ai 学习的老张, flash 版权重一百六十 g, 原始 zf 传感器接近一百四十九 g, amd 全军覆没,消费级级美达也不配门槛,先把一半人劝退,我用 v o o m 官方刀客镜像 deep sec v 四 gun c u 一 二九启动, 按默认配置一起就 o o m 连续翻车好几次,最终生效的脚本是这套,开 f p 八 k v cash 起用专家并行一批,单卡权重压到七十七点六级, likes model line 砍到七 k, gpu memory utilization 拉到零点九五,再叠 in force eager 才算是稳住了。两百五十六个专家分两路,每张卡被一百二十八个 kb cache 只剩九点二九 g, 病发能力三点七二倍, 撑死也就四路同时跑,说性能思考模式,打开平均八点三三 toc 每秒,慢得让人怀疑这是不是 h 二十。把 d p 改成 t p, 再关掉 inforce, 速度直接翻倍到二十,最猛的是关闭思考,单轮生成能飙到七十多。我的判断很直接,两张 h 二十跑 flash 是 省着跑,不是爽快跑。 flash 这个名字本地部署这边是真不 flash, 要的是体验,老老实实充 api。

今天带大家来完整的走一遍 openclo 的 安装流程,以及怎么配置 dipstick v 四 flash 这个模型,并且这个模型的性价比很高。首先我们往下看, 它分成安装 mac 版和 windows 版, mac 版用这个脚本, windows 版用这个脚本,因为我这边是 mac 版本,所以我这边使用这个脚本。打开终端,直接复制这个命令回车 我等他。安装在大家电脑上的话,可能这个过程要十几分钟,因为流程比较慢。如果是 mac 版本的话,你一定要先安装 home button, 没有这个的话,后面的人是下不去的。你只要安装了这个之后,下面的流程都是可以自动化的,那只要等就行,如果你的网比较差的话,可能等个二十分钟也有可能, 但慢慢等就行。这个时候你的电脑可能会 cpu 开始百分之百的风扇冒起来,这都是正常的现象,只要等就行了,大概等二十分钟,最多不会超过三十分钟。这时候你可以去干点其他事情,让我们回来吧,已经可以开始我们手动进入了, 在这个地方直接选 yes, 这里选择快速开始,这边直接选择使用现有的值,但如果你刚刚那个地方直接安装过的话,你要选择 reset, 然后 deep sync, 选择这边要输入 api key。 api key 怎么来呢? 你要打开这个网站,三 w deep sync 点 com, 选择这个 api 开放平台,点进去你要完成注册登录,实名认证充值之后你点这个 api key, 点这个地方 这个名字就随便输入,我这叫奔 call, 我 这个地方一定要复制哦,要不然看不到了。复制要回来粘贴到这里等一下, 因为这里每一个步骤都是要联网的,网又在境外,所以比较慢。这个地方直接选择保全,当时这边选择飞书,这边选择选择默认的,这一个会出现一个二维码,这个时候你用你的手机飞出去扫掉它 扫码,扫码之后它会出现一个立即创建,这手机上会出现一个立即创建,你点击一下有审批通过之后,这边选择这个第一个默认的,等它自动走下面的流程。 这个地方是否去配置这个技能选择 no, 这个地方也跳过,怎么跳过呢?这个地方有技巧,不要直接回车,先按空格选中它,然后再回车。这个地方你可以选择重启, 等待他重启完成,这时候我们只要等待即可,然后他会出现三个选项,他一直告诉你是要在终端里面使用还是在网页上面使用,我建议大家在网页上面打开吧。 第二个会车他就会打开这个网站,大家只要默默等待即可,因为他第一次打开的时候会很慢,你可能就等个三分钟, 对,大家先等着好了,图片这个页面的时候就说明基本上你已经成功了百分之九。这个时候你可以发一句问题问问他,等待他的回复。这个时候可能因为我们第一次问的话,他后台要配置很多乱七八糟东西,也可能会比较慢,等就可以好了,他终于回复完了, 一般来讲讲是第一次比较慢,之后都会比较快,所以我们这个再回答第二次的时候,一般就没有第一次那么慢的离谱了啊。 你看他已经回复了,这个时候大家可以拿出手机钉钉给付付,手机钉钉是被手机飞叔,给飞叔发个消息给飞叔基研,我这边用我的手机给大家演示一下,这个时候我们只要非给他发消息,他这边会突然出现这个又有个 emoji 表情在敲键盘的那种, 那种 emoji, 他 就会回复,你看我们再发一句话给他,你看他立刻会出现一个这种 emoji 表情,那就说明一切正常了, 证明他在思考,他在回复你。 ok, 那 截止到这个时候,这个教程就完成了,我们既完成了这个网页上使用这个 open clone, 又可以在手机上、手机飞书上使用 open clone。