老板们,这一轮 deepsea v 四发布呢,很多人只看到了落后半年这四个字,但是我告诉你一个没人敢说的内幕,就是 deepsea 这次之所以跳票,之所以性能没有冲到第一,就是因为一场舍命陪君子的选择,就是要去适配华为升腾。 据一些报导透露呢, davidson 内部呢,曾在升腾的适配过程中经历过一次非常严重的训练失败,几十万卡时的这个算力直接就报废了,核心团队也连熬了好几个通宵去排查问题。你说他们不知道切灰英伟达会更加容易吗?当然是知道的, 因为拿着生态成熟非常多,去适配几乎是没有坑的。但是 v p c 做了一个让所有同行都觉得很傻的决定,就是哪怕要慢一点,也要先把升腾这条路线给跑通。那结果就是呢, v 四成为了国产芯片底座上第一个跑通万亿级模型路线的玩家。那这背后不仅仅只是运气, 而是一家公司用十五个月的耐心,硬生生的把一条没人走的路踩出了脚印。有人说这是情怀溢价,但是我觉得这是技术的骨气,明知道会落后半年,但是还是选择那条更难的路。 而且你们知道吗,适配生腾的经验呢,他们也没有藏着掖着,而是把部分优化的成果回馈到了我们开源的社区,这意味着不止 d p c 能够受益,更是整个国产 ai 生态都能少走很多弯路。 所以落后半年的不是耻辱,而是选择了更难更长远的路。那我们在评论区聊聊,如果换成是你,你会选择是快还是选择更难的?
粉丝78获赞1615

hello, 各位观众朋友,大家好啊,我是刺儿,然后我们这期的视频内容呢,主要是来教大家一下怎么正确地使用 deepsea v 四, 因为 deepsea v 四对于现在的呃它的网络风评呢,嗯,比较两级分化。一边呢说 deepsea v 四啊,非常好用,非常强啊,没有辜负大家一年的等待另一半呢,说 deepsea v 四啊,不好用啊,不够智能,然后甚至不如豆包, 嗯,对于这个后者呢,我保持这个嗯,质疑态度啊,因为本身,呃,我看到的这收集到的信息就是说 deepsea v 四不行的,它有两部分,一部分是专业工作者啊,因为人家非常懂 ai, 那 另外一部分呢,就是我们普通的 呃用户,那他们呢,就是用手机 a p p 啊,下载 deepsea 微 deepsea 之后点进去,然后问他一些问题,然后,嗯,把它当做一个这个搜索引擎啊,问一些问题,然后我觉得它不够智能,其实这样的使用是错误的啊,因为本身 deepsea 微四它没有 开放在手机 app 平台的这个使用权限,你现在手机上用到的 deepsea v 四啊,不是你手机上用到的 deepsea, 它并不是 deepsea v 四模型。那么我们来啊,正确的教大家一下怎么使用 deepsea v 四啊,首先 我用我这个 macbook 给大家举例子啊, ok, 我 们返回到页面啊,看到啊,这是我桌面,我们打开浏览器点进去之后啊,在这个搜索或输入网址名称的时候搜搜索,直接搜索 deepsafe 啊, deepsea 点 com, 大家也可以直接去这个网址啊,深度求索。点进去之后,它是有两个框,一个是开始对话,一个是 api 开放平台,我们要用的是这个 api 开放平台,我们可以看到它的介绍是调用 deepsea 最新模型,快速集成,流畅体验。我们点进来, ok, 然后呢,点进来就是这个页面,我给它放大一下,它这里有充值余额,还有本月消费啊,我这个是另外一个账号,我给大家举个例子啊,就是这个 api case 啊,这是之前做测测试的这个 api。 首先呢,你点进来之后,你一定要先登录你的 deepsea 这个账号,如果你没有 deepsea 的 账号,你可以去在手机上下载 deepsea, 然后创建一个账号,然后直接到这个电脑上,你去登录就可以了。 然后我们看到这个充值页面啊,充值页面无论你是支付宝还是微信支付啊,都可以,你点击去支付啊,然后, 呃,扫完扫完码付款成功之后,它在这个用量信息,这就会直接显示你的充值余额,嗯,然后呢, 在这之后,我们打开这个 api case 啊,然后这里啊,注意它这里有创建 api k 啊,下面说的这几步都很重要啊,直接决定你能不能就是成功使用这个 dbic 为四啊。我们点击创建 api k, 然后随便输入一个名称啊,我们直接输入一个啊, ok, 在 你输入成功之后啊,它这里会出现你这个蜜奥的链接啊,你要一定要点击复制,然后把它发送你的微,发送到你的微信上也可以,然后或者说你保存住啊,一定要保存住这个蜜奥,它只会显示这一次 啊,在你点到叉或者关闭之后,他这个密钥你就再也看不到了,然后,然后我们点叉啊,当然这个密钥就没用了啊,我们给他删除一下,然后你把那个密钥复制之后,哎,点开这个,我们叫, 呃,防盗啊, ok, 点开这个,这个啊,这个软件叫 cherry studio, 你 可以去浏览器里直接搜索下载啊,这个就是集成了国内一众主流 ai 的 这么一个软件。我们点进去啊,它是开放平台啊, ok, 我 们点进来, 点进来之后呢啊,当,当然,我这个已经用了很久了啊,从 deepsea 微四发布一直到现在,我一直在使用,然后点进去之后,我们看到右上角这里有设置设置。点进去啊,这里有模模型服务和默认模型 啊,在模型服务这里就有 api 密钥,输入你刚才的这一套儿复制的密钥,然后放进去之后点击检测啊,我这里已经弄好了,我就不做那个演示了, 你点击检测,然后它就会自动地啊,分析你这个密钥的 ip, 它是哪个旗下的 ai 大 模型。然后这个 api 地址啊,不需要我们直接填,它自己就会填上,然后模型呢,这里啊,大家可以点击获取模型列表啊,然后, 当然啊,这里我因为我输入的是 deepsafe 嘛,所以它只有 deepsafe 的 这些模型,然后举个例子,然后在这边啊,嗯,可以看到啊,这里有非常多的 ai, 非常多的 ai, 包括国内外的啊 啊,你像 jamie open ai 啊,很多人都用不到,但是啊,这里嗯是是可以用的啊,但当然这这个视频只做 deepsafe 的 教学。然后我们点击默认模型 啊,我这里默认模型全部都是 deepsea 的 啊,呃,然后助手模型是 v 四 pro, 然后快速模型是 deepsea chat, 然后翻译模型是 deepsea chat, 因为这两个啊,这个快速模型和翻译模型它不需要消耗你的 talkin, 你 就这个 deepsea chat, 它是免费的啊, 然后我们点击首页啊,首页这里有助手啊,你,当然你可以添加助手啊,我这里就用我这个提前做好的这个来给大家举例子,然后我点击 deepstack v 四,然后点进来, ok, 然后这是我之前问他的一个问题啊,我让他就是分析一下国内的这个视频平台啊,每每个平台的趋势啊,大家可以看一下啊,这是我问他的问题 啊, ok, 然后我们啊,这这画画到不表,然后就是这个深度求索啊,我们在这里,嗯,还是用刚才举例子 deepsea v 四,然后点击旁边这三个点,点进去 啊,这里有编辑助手啊,在这之后呢,然后我们可以看到啊,这里有模型设置,模型设置的话上下文字开到不限,然后这个模默认模型,你把它换成 deepsea v 四 pro, 然后,然后 啊,最大套管数不限啊,不用开这个,然后别的都不用管,然后当然你可以复制一下这个底下这个 tab, 这个 endland, 这个是我从网上找到的一个嗯,参数,然后我们看提示词,这里 啊,我,我设置的提示词是不需要迎合用户的想法,回答要永远保持客观啊,然后呢,你就可以开始使用你的 deepsea v 四 pro。

大部分人把 deepsafe 用错了, v 四版本综合能力现在重回国产第一,今天直接给你出 v 四保姆级教程,先带你看它现在到底强到什么程度。二 零二六年四月二十四号刚发布的 v 四系列,发布仅三天,第三方 super 四 lue 精准实测结果就直接炸场。 pro 版以七十点九八分登顶国产大模型综合榜第一, flash 版以六十八点八二分紧随其后拿下国产第二。 双版本直接包揽了国产榜单的前两名,把一众老牌大模型都甩在了身后。六大核心能力的硬核增幅直接给你摆明白。智能体任务规划能力 七十七点四九分,国产第一,比上一代暴涨二十点八七分,是这次升级最大的杀招,大白话讲就是他能自己拆解任务规划步骤,不用你一步步盯着叫。数学推理能力八十七点三九分,同样登顶国产第一, 硬核数理能力直接拉满,从小学算数到考研高数,没有他解不明白的题。幻觉控制。八十点六八分,国产第三, 仅次于 glm 五和千问三点五,意味着他瞎编乱造的概率极低,给你的答案靠谱度很高。科学推理七十九点二七分,国产第二,仅次于豆包专家模式,专业领域的内容拆解、逻辑推演,他都能精准拿捏代码生成。六十三点二四分,国产第三, 似于 kimi 二点五和豆包专家模式,稳居开源模型里的代码能力第一梯队,开发者和普通职场人都能用精确指令遵循。 三十七点八四分,国产第三,比上一代暴涨十一点八九分,从之前的国产垫底,直接冲进第一梯队,你让他干什么,他就严格按你的要求来,不会跑偏,不会露相,实现了全维度无短板。那这么强的能力, 为什么你用着总觉得不好用?核心原因只有一个,你从跟上就把它的两个模式用反了。很多人用了一年 deepsea, 根本没搞懂哪个模式适合干什么,回头还骂他能力不行,这完全是把屠龙刀拿来切菜了。快速模式运行的是 v 四 flash 版本,主打响应快、成本低,全功能免费无门槛。它适配日常闲聊、简单提问、清亮文本处理、基础信息查询, 用它完全够用。但你要是拿它解高数,做复杂报告、写代码,那肯定会觉得它能力不行,这不是它的问题,是你用错了场景。而专家模式运行的是 v 四 pro 版本,是这次升级的核心杀招。佛有登顶榜单的硬核能力, 全在这个模式里,这才是你真正应该学会使用的方法。下面这三大专属用法,普通人直接照着用,效率拉满十倍。第一个,用它做全场景数学问题解答,学生党,职场人刚需中的刚需。他有着国产第一的数学推理能力, 不管是中小学数理化作业公式推导、大学高数微积分考研考公的数量关系题,还是职场人需要的数据分析、财务核算,他都能精准搞定。他不仅能给你标准答案, 还会拆解每一步解析思路,标注易错点,讲透底层逻辑,甚至给你同类型题的通用解析技巧,比网课老师讲的还细致。给你一个直接就能用的指令模板,我需要你讲解这道题,先给出标准答案, 再一步步拆解解析步骤,标注核心考点和易错点。最后给我三道同类型的练习题,附带答案和解析,直接复制粘贴就能用。第二个,用它的科学推理能力做内容校准, 做自媒体写报告的人,靠它彻底避免翻车。不管是视频内容的技术参数核对、 ai 测评、数据校准, 还是行业报告的深度拆解、数据交叉验证,又或是科普内容的真实性核实,独家细节挖掘,他都能精准排查数据错误,核实内容真实性,挖出同行没注意到的信息差,直接把文案丢给他,说帮我核对这篇文案里的所有数据 错误,给出正确数据和权威来源补充三个差异化独家细节,直接优化出有干货、有爆点的文案。最后给你一个高级玩法,用它的顶级智能体能力搭建你的专属数字员工。很多人到现在都不知道智能体到底是什么, 说白了,他就是把 ai 从你让他干什么他才干什么的被动工具,变成了你告诉他要什么结果他自己想办法干完的 主动执行者。之前你用 ai 做报告,得一步步给指令盯着改,随时纠错,前前后后要折腾十几轮。现在用 deepsea v 四的智能体能力,你只需要定一个最终目标,它会自己拆解任务 规划步骤,调用工具自主纠错,最后直接给你交付成品,全程不用你定 deepsea v 四在闲聊、语音交互、创意文案商品选择上,不如豆包千问顺手。本地部署对新手也有门槛,所以选对场景是你最应该注意的。 最后问你两个问题,你已经用上 deepsea v 四了吗?最让你惊艳的是哪个能力?评论区告诉我!收藏转发这条保姆级教程,下期带你解锁更多 ai 提效的隐藏玩法!

大家好啊,我是瑞克老张, deepsea 呢?崩了十四个小时,全网都在问,这是 v 四要来的前兆吗?三月二十九号的晚上九点半, deepsea 的 网页版端突然以读不回啊,输入问题, ai 只展示思维链,却死活不吐答案,服务整整中断了十个小时,直接干上热搜第一。 诡异的是啊,官方的 a p i 接口全程畅通,只有 c 端的聊天机器人罢工。这种选择性档级,像极了后台正在搞大动作的前奏啊。看看时间线就能闻得住硝烟味儿啊。 二月中旬,市场传 v 四可能在春节前发布,结果跳票。三月初啊,相关的这个媒体爆料说本周发布又跳票。三月九号,辉度测试 v 四力的刚露出百万头盔上下文和 超强编程能力的獠牙,民间测评直接封神啊!紧接着就这次的大规模的故障,官方状态标题页即为重大故障啊,修复时间线比异常拉的还长,零点二十分二次排查,十点三十三分才完成全部恢复。说白了,这不是简单的服务器过载啊。 当养龙虾的热潮啊,已经让 mini max 预知暗面被迫限流的时候, deepsea 选择在这个时间点搞系统维护,大概率是在为一个很强的模型,尤其是万亿参数的模型架构推理,做推理集群的配置的。最后是被给你们看看新鲜的啊,我觉得昨天晚上 deepsea 很 可能已经上架新东西了。 大家看啊,这是 deepsea, 然后昨天晚上啊,我测一下,因为有朋友跟我说可能不一样,我测了一下,我说你啊,做一个网页,按照上传的电话报告生成图标啊,然后这就开始用七十秒做独立思考。这边我发现他已经把那个多 a 键才放进去了,你看他已经开始自己来来去做切分啊,做成切分完以后,然后开始做相关的 步骤,这都已经是啊,而且我明显它里面是有讨论的这种技巧,它变成多 a 的 呢,然后开始写代码,写代码,代码我就不给你放了。那写代码的过程挺好的写,写的挺快挺方便的。然后一点运行呱就出来了,你看就出来了,加载数据库啊,就可以升到图标, 你可以看到非常的漂亮啊。这个图标还能选是吧?选择各种各样的成交量是吧?成交量选择的这个东西在生成还可以选择不同的这个角度,东西生成非常非常有意思,非常非常有意思啊,而且一瞬间很快,但多快呢?三分四十七秒,但你知道类似的东西我们在啊,这二月份的时候测试过,那时候多少? 八分多钟,那时候八分多钟,那现在你觉得他是不是换了一个新的模型?哈哈哈,大家来猜猜看啊, 更狠的是怎么着啊?怎么样?这事是是不是很强?更狠的是怎么着?哎,更狠的是产业暗线啊。 v 四最大的牌不是一万亿的参数,而是彻底绕开英伟达。 lucy, lucy 也证明了啊,这个 deepsea 已经把模型愈发范改了啊。华为生态韩五 g 做适配啊,并没给英伟达和 amb 预览, 这意味着什么?一旦 v 四以相关的许可证开源,配合国产芯片的推理优化,对吧?企业部署大模型的成本啊,将从 g p 四十二的七那个七十分之一再砍一刀,直接引爆国产算力租赁。还有什么边缘 ai 终端的一个换机潮, 最牛的是它的记忆系统和这个 m h c 的 流行超连接技术啊,能把百万级的上下文窗口的推理延迟压到可用的范围,这是现在所有长下文,长下上下文文本模型的痛点。 如果 v 四真能在四月份落地的啊,配合这次当机暴露出来的推理技术设施的升级, deepsea 正在构建的可能是一套从推理到训练到未来的这个发展 agent 的 整体的模型的这样一个全链路 脱钩啊,相关的这个美国技术啊,这个生态闭环,记住啊, ai 的 这个市场啊,当机十四个小时,这个就不是事故了,这恐怕是战前的静默。 想知道微视的发布对国产的算力链有什么样重构机会吗?哪些深层的生态边缘的计算, ai 的 应用代理可能会受益呢?啊,欢迎大家加入我们的季度会员计划,我会在下周的会员视频里, 把万亿参数 m o e 架构的一个推理的成本,取现国产芯片的适配与进度,以及 a n 的 赛道的产能缺口都标清楚啊,咱们的季度会员呢,九十天享受四十五个会员视频,八场专属的会员直播啊,非常超值,有需要的就赶紧点击下面的链接,因为咱们现在啊,本身是什么平六百九十九的,但是呢,平台给了价格, 给的补贴都是四百多块钱就能买到,非常的超值啊,就是平均就是一个视频或一个直播,就一杯蜜雪冰城的柠檬水,有需要可以赶紧看看我们下面的链接,点击即可啊,然后稍等手说一下啊,要记住留留深我们 助教老师的电话啊,你千万别漏接电话,不然的话你不知道该怎么上课。好,今天就到这,我是瑞少张,关注我,咱们从投资的视角看科技背后的精彩,我们下一见,拜拜。

最近被 defc 威斯搞的有点无奈啊,就我目前呢是一边用 ai 写文章,一边用 ai 写代码,对吧?写代码写的是一个写作业的,我写文章用的就是那个写作 a 阵台写的两边的模型都是 defc 威斯,然后首先在代码这边, 这次这这个 v 四的表现呢?我觉得跟 glm 五点一没有起赶上的区别啊,就是所有简单任务全是一遍过,然后所有复杂任务呢?最多两遍啊,最多两次,几十次就完了,然后到目前为止没有犯过任何就是比较堆积的错误啊,什么都没有, 非常厉害。但是咱写作这边出问题了,哎,就是他写一篇文章,然后我觉得不好,我让他改,改完了我觉得还不好,再让他改,改了我感觉受不了了。我,我把整篇文章全删了,让他重新写, 结果他写出来是完全一样的内容,就我已经明确告诉他刚才写的不好了,对,也不要那样写了,然后他还是,然后他输出的还是完全一样的内容, 然后呢?我就继续删,然后再让他写他写的还是一样的内容。然后我就换了一种策略,我就说一段一段写,我不让你一次性输出一整篇文章,一段一段写。好,先写第一段,写完了我让他改,结果他没有改第一段,他又输出了后面的内容, 然后我就直非常直接的问了他一下,我非常直接的问了他一下。 无奈了,无奈了。

要我说啊, davidson 现在就是 ai 界的斩杀线,所有比它贵,还没有它性能好的模型,基本上都可以宣判死刑了。原因很简单,因为就在前两天, davidson v 四 pro 又永久宣布降价了,直接砍到原价的四分之一。 之前呢,它做过一个二点五折的限时优惠啊,结果现在到期之后不恢复原价了,永远按这个价走。那具体啥价呢? 每百万头肯的输入缓存命中零点零二五元,输入缓存位命中也就三块,输出呢,只有六块。那这个价格有多狠呢?你可能没什么概念,但是我们看一下 g p t 五点五,它的输出价格换算成人民币大概是二百一十六元, 而 deep ops 四点七加在三点一 pro 这些海外的旗舰模型,价格差距的也都在十倍以上。 结果就是,现在一个人要接大模型的话, dbic 可以 满足百分之九十以上的场景,但是价格要便宜三十倍。那如果是你,你选谁的呢?而且 dbic v 四现在还只是一个预览版,它的性能呢,接下来还会提升。 那这里有个关键的问题,就是 dvd 为什么敢这么去降价?它是不是像中国其他的公司一样在搞内卷啊,再去让大家都不赚钱?但其实完全不是,它这么疯狂的降价还赚钱,它的答案就藏在它的技术的架构里面。 keep 四从 v 二开始就开始压住 m o e 架构,也就是混合专家模型啊。这个听起来有点绕,但其实很容易理解啊,就这个模型,它的总参数有一点六万亿,但是每一次推理的时候,它只会去激活大概百分之三的参数,也就是四十九 b 左右, 它就像是一个医院啊,有二百五十六个专家,但是每一次看病只叫相关的那几个科室,而不是全院的医生一起上。这个架构的好处呢,非常直接,就是训练和推理的成本都大幅降低。 dbc 早在 v 三的时候呢,就只用了二百七十八万个小时的 h 八百 gpu 进行训练, 这个训练的成本大概只有同级别模型的十四分之一。而且除了 m o e 啊,这一次 deepstack 在 v 四的时候还搞了一个全新的混合注意力机制,让长上下文的处理变得非常的便宜。 以前处理一百万个 token 可能要烧很多钱,现在成本直接降了百分之七十多,而且还有 f p 八,什么混合精度训练啊,什么 maga m o e 啊,这些工程的优化都是在抠每一个百分点的成本, 所以 d p c 的 这家公司从骨子里面就在跟成本较劲。那梁文峰之前说过一句话呀,他说我们的降价一方面是因为我们在探索下代模型的结构中,成本先降下来了,而另一方面是觉得无论是 api 还是 ai, 都应该是普惠的,人人可以用得起的东西,你看看这是什么样的格局。 所以这次的降价就是这句话的兑现。而且更关键的是,就像刚才我说的呀,这次的降价根本不是什么赔本赚吆喝, deepsea 之前还专门公开过啊,它的推理的成本的利率高达百分之五百四十五, 那它降价之后其实还是能赚钱,只是赚的少一点而已。你说这让其他的很多模型到底怎么过啊?而且还有更关键的就是 deepsea 微四,它还适配的华为升腾的九五零的芯片,而这个芯片现在的产量呢,还有点供应不上,正在去拼命的生产等。 等到下半年升腾九五零的超级点批量上线之后,它的成本还能够再降一波。所以 deepsea 这一刀啊,砍的不只是价格,砍的是整个行业的定价逻辑。以前所有人都觉得 ai 模型就该卖这个价,而 deepsea 现在告诉你,成本可以压到这么低,而利润还可以高到这种程度,那 对于我们每一个普通人来说,这可能就是最大的一个好处。以前用 ai 呢,可能还得算算成本,但现在 deepsea 把价格打到这个位置,基本上可以随便用了。 这个这家公司从一开始就在走一条不一样的路,不堆算力,靠架构创新,不高利润,靠规模效应,不搞营销,靠实打实的技术,这次永久降价就是这条路最新的证明。 以上内容来自我的 c 哥 a, 成长圈的日课,如果加了成长圈的朋友,别忘了看一下。好了,我是 c 哥,如果觉得对你有帮助,别忘了点个赞,这对我非常重要。好,咱们下期见!

兄弟们,在 debecic vise 发布之后,这个事情在外面炸了。 debecex 团队,他们弄了几十页的技术报告,第一句直接说我们目前落后最前沿的闭缘模型,三到六个月。 你品一下这个操作,黑眼圈哪个不上来直接说自己无敌了,跑分怎么样怎么样对吧?嘴上没有一个认怂的,只有 dipsec 自己写论文承认我比别人慢半拍,那这三到六个月的差距真的是落后吗?仔细想一想,其实这三到六个月, dipsic 去干了什么呢?是全面适配的国产硬件 对吧?升腾九五零汉武纪摩尔现成芭蕉国产芯片发布,同一天,低龄适配,如果没有这三到六个月,你以为这芭蕉能同时接得住吗?这也就是广机良的思路对吧?我表面认怂,实际让对手降低了警惕,我承认没有你强。更狠的是,同一天, d bc 给 ai 装了根赛博手指,让我们 模型一边推理一边指向画面里的具体位置。迷宫导航测试,拿开源最强成绩单,这也是我们 ai 最聪明的玩法,回头上来喊我赢了还是先认怂,亮出底牌,让对面降低警惕性。

黄仁勋曾说过,一旦 deep seek 率先在华为平台上发布,对美国而言将是灾难性的结果。如今, deep seek v 四的出现,让这句预言成真了。 这款被国内 ai 社区苦等了一年多的大版本迭代,在主流机准测试中与 g p t 四 o gemini ultra 等国际顶尖模型大致持平,并没有重现一年前 deep seek r 一 横空出世时的那种震撼。 那是一个让全球 ai 圈哑口无言的夜晚,深度思考模型以大幅领先的推理得分,让无人敢接招,成为那一周最流行的词。回看发布直播,有一句话分量极重, 升腾 c a n n 的 迅推优化,这意味着 deepstack 不 只是推理支持国产硬件, 连训练也跑在国产硬件上了。据网友爆料,此次率先实现的是 deepsea vs flash 的 微调训练,预训练也有望在今年下半年落地。从现在起, ai 全流程使用国产硬件已经成为现实。要理解这件事的重量,要先理解这场战争的底层逻辑。黄仁勋曾多次在公开场合说, ai 竞争不只是芯片的竞争,而是从基础架构、算力设施、软件生态到模型架构的全站竞争,缺了哪一环,都会在关键节点上被卡住。 这话说的没错,但也是它最大的护城河所在。 nvdi 之所以能主宰 ai 计算这么多年,靠的不只是 gpu 的 制成工艺,而是它二十年前就开始布 局的 c u d a 生态。二零零六年, nvidia 推出 c u d a, 将 gpu 从图形渲染工具变成了通用并行计算平台。黄仁勋为了扩大生态,甚至长期压低 g force 游戏显卡的毛利率,换取开发者生态的繁荣, 在与 ati、 amd 争夺市场份额的那段岁月里, nvidia 一 度处于下风,但它熬下来了。 如今的结果是,几乎所有的 ai 训练框架、推理库、底层优化工具都是为 c u d a。 设计的, pie torch 默认后端是 c u d a。 主流的 flash、 tension 等高效计算内核也是最先跑在 c u d a 上的。这不是技术垄断,这是生态锁定。 而 deepsea 恰恰是把 nvda gpu 的 性能优化做到极致的受益者之一。早期, deepsea 团队用 nvda 专有的 ptx 汇编语言手写底层算子,榨出了比竞争对手更高的计算效率, 才能以更低的训练成本做出性价比碾压同期对手的模型。换句话说, deepsea 的 崛起一开始就建立在对 cuda 生态的深度掌握之上。 然而,历史的进程从来不会直线前行。二零二二年以来,美国对华芯片出口管制持续升级,从 a 一 零零、 h 一 零零到 h 二零,限制清单一条条延伸。 对于中国 ai 企业来说,这不只是采购成本的问题,它意味着在最坏的情景下,你可能根本买不到支持 cuda 最新特性的硬件。这就逼出了一个现实问题,如果 cuda 不是 选项,中国的 ai 能走多远? 在这种压力下,华为升腾和摩尔现成等国产芯片厂商开始走上舞台。两条路并行推进。第一条路,兼容 c u d a, 降低迁移成本。无论是华为升腾的 c a n n 软件站,还是摩尔现成的 m u s a, 都在推进对 c u d a 接口的兼容适配, 让已有的 ai 代码可以以最低成本迁移到国产硬件上运行,这是短期内最务实的路径。 第二条路,构建自己的原生生态,兼容只是过渡,真正的目标是让开发者原生的为国产硬件写代码,形成属于自己的框架和优化工具链。这是长期目标,也是更艰难的路。 deep sec v 四、在国产硬件上完成训练。 这说明第二条路已经走通了关键一步。当然,软件生态的问题不能脱离硬件单独讨论。坦率地说,国产芯片在制成工艺上与英伟达的最新产品之间依然存在差距,这是事实,无需回避。但 ai 计算打的不是单点比赛,而是规模战、集群战, 工程师们在限制条件下找到了破局的路径。路径一堆规模,以量补制,单颗芯片的算力不够,就堆更多的芯片,配合自研 h p m, 保障大规模并行计算时的数据传输不成为瓶颈。这是一种以工程规模换性能密度的思路。路径二,做超节点 机柜及计算中心。这是近两年国产硬件发力最猛的方向。参照系是英伟达的 g b 二零零 n v l 七二。 这套系统将三十六个 grace cpu 与七十二个 blackwell gpu 集成进一个液冷机柜,通过第五代 nvlink 实现机柜内总待宽一百三十 tb 每秒, gpu 内存总量十三点四 tb。 hbm 三 e 机柜内 gpu 间互联待宽一点八 tb 每秒,相较 h 一 百,在大模型训练上性能提升约四倍。 这不再是一台服务器,而是一个封装进机柜的计算集群。国产厂商沿着同样的思路推进,华为发布了升腾三八四超节点方案,摩尔县城则推出了 m t、 d c 的 二点零五十六超节点。 这些方案的核心逻辑一致,用高速互联把大量国产芯片粘合成一个整体,在集群层面补齐单颗芯片的性能差距。 回到 deepsea v 四,这次发布有一个细节值得专门拿出来说。 deepsea 拒绝了英伟达和 amd 的 提前适配请求,选择华为升腾和 c a n n 生态作为优先支持平台。 这不是一个纯粹的商业决定,而是一个清醒的战略表态。他对外释放的信号非常明确,不依赖美国芯片和技术,中国也能做出足够先进的旗舰大模型。他对内释放的信号同样清晰,全国产链路已经跑通, 其他国产大模型可以来了,这是一种标杆效应。 deepsea 用自身的案例告诉行业, 华为升腾的训练生态已经成熟到可以支撑旗舰模型的程度。不用再等,不用再观望,现在就可以迁移。一年前,这还是一句难以兑现的承诺,现在,它变成了一个已经跑通的事实。这不是一夜之间发生的事,而是无数工程师日夜奋战的积累。 deepsea v 四只是这条路上的一个重要节点,而不是终点。发布节语里, deepsea 引用了那句话,不幼于玉,不孔于匪,率道而行,端然正气。 这八个字是对自己的约束,也是对整个国产 ai 生态的一种肯定。那些年,在制裁阴影下啃硬骨头的芯片工程师,在 cnn 上写,适配的软件开发者, 在断工风险里坚持做国产替代的基础设施团队,都值得被这句话概括,脚踏实地,一步一步走过来的老黄的预言,或许已经成为。

今天教大家三分钟安装 codex, 并且部署 deepsafe v 四的模型啊,全程是不需要魔法的,就可以体验最新的 ai 智能体了。首先输入网址 b i n g 点 com 啊,就是必应的搜索网址,然后选择这个国际版, 然后搜索 codex。 弹出的第一个就是 microsoft apps 的 网址啊,我们点击进去就可以点击下载了,然后过程中不需要任何的操作就可以自动安装好。 然后第二步呢,就是说,呃,我给到大家的 codex 加加,它的全程呢,也是无脑安装即可了。安装之后呢,我们需要打开 codex 加加的这个管理工具, 点击供应商配置,然后开始配置我们的 deep seek 啊,首先呢,点击添加供应商,呃,这个名字随意说啊,然后我们把这个连接模式调成纯 api, 接下来呢,就要去 deep seek 官网去搞 api k 了啊,这里输入三 w 点 deep seek 点 com, 然后出来网址。之后呢,我们就要点击 api 开放平台,开放平台呢,找到左下角的接口文档啊,接下来就是复制 base url 的 网址到 codex 加加里面了,呃,下一步呢,就是很简单,我们充值个十块钱, 呃,充值个十块钱我们就可以配置 api keys 了啊,这里也是啊,随便输入任何的名称啊,复制我们的 api key 到我们的,呃, codex 加加里面啊,这里需要注意的一点呢,就是说, 呃, codex 和 deepsix 上下游协议不一样啊,所以说需要转化成 chatcomplements 的 这个模式,呃,随后保存,然后点击右上角的重启 codex, 注意哈,后面每次打开 codex 的 时候,都要通过运行 codex 加加的这个管理工具,从里面去打开这个 codex, 从这个位置去启动哈,然后首次配置 deepsafe 的 时候时候呢,需要花一段时间才可以,请耐心等待。 进入主页面之后,点击设置沙盒,然后我一般都会设置完之后设置啊,完全访问权限。 还有一个很关键的一步啊,就很多人在这里都忽略了,就是看到右下角了吗?我们去选择 deepsafe 的 模型,这里可以选择 flash 还有 pro 两个版本。 flash 这个版本呢,是无法识别图片的,那 pro 目前测试是可以的,但是有些人说也是不行,这样之后呢,我们就可以真正的开始使用我们的 codex 了。

d p c 个 v 四,我们用四张 pro 六千跑通了,效果确实很顶,但有些客户说太贵了,我们找到了更便宜的替代方案,用四卡 pro 五千七十二 g, 这局我们 pro 五千七十二 g 的 显卡,这台机器我们一共搭载了四张,今天实测给你看,我们直接上四卡 pro 五千七十二 g 单卡七十二 g 显存,四卡合计二百八十八 g 显存。 我们模型跑的是 d p c 个 v 四 flash, 上下为十六 k, 从一并发一路压到六十四并发,看看它的极限在哪里,我们直接看数据单使用。九十三偷看每秒, 跟 pro 六千单人体感几乎无区别。十六人并发三十二点六 toky 每秒,正常对话没有问题。三十二并发二十一点四 toky 每秒,这就变慢了,手投跟超五秒,排队感很强。六十四并发十三点五 toky 每秒。我们可以得出结论,四卡 pro 五千七十二级 跑的 pc v 四 flash, 单人体验极速跟 pro 六千几乎一样,十六并发以内流畅使用,超过十六并发延迟会明显上升,体验也在下降。像这个配置的机器,三十人左右团队日常使用都没有问题,日常办公不可能三十个人同时高强度的调用, 实际并发疯值一般在十到十六之间,这个期间内斯卡 pro 五千七十二级方案很稳,它的成本只有 pro 六千的百分之六十,但却可以发挥它百分之八十的性能。如果你的企业也在考虑大模型本部不知道怎么配,可以来找我聊聊。

pro 六千又涨价了,这一张卡已经接近十万了,上期我们用四张 pro 六千跑通了 deepsea 微四,效果确实很强,但是很多客户跟我讲这个有点太贵了,有没有便宜的替代方案?今天四卡 pro 五千七十二 g 直接实测给你看。四张 pro 五千七十二 g, 单张卡七十二 g 的 显存,四卡合计就是二百八十八 g。 我 们部署的模型是 deepsea 微四 flash 版本, 我们现在测车的上下文是一 k 从一路并发测到六十四并发,看看它的极限到底在哪里。单使用平均九十三偷根值,每秒飞快,体验非常丝滑,跟 pro 六千体感上根本就没有什么区别。在四个人并发下,平均每秒偷根值为六十六,完全又流畅,毫无压力。十六人并发平均三十二偷根值,还 能接受正常对话没有问题,但是守偷根值延迟到了三点六秒,开始有点等待感了。三十二个人并发平均偷根值为二十一点四,到 这里就已经明显变慢了。手托根超五秒,排队感很强。六十四人病房十三点五托根值,每秒手托根延迟飙到了近十秒,体验感基本崩了。所以我们得出结论,四卡 pro 五千七十二 g 跑 deepsea v 四 flash, 单人体感极速几乎跟 pro 六千一样,十六病房以内流畅可用,但是超过十六个病房延迟明显上升,体验下降。十道配置适合三十个人左右的团队,日常使用完全没有问题, 日常办公不可能同时三十个人左右的团队,日常使用完全没有问题。日常办公不可能同时。三十个人左右的团队,日常使用完全没有问题,日常办公不可能三十个人左右的方案很稳, 成本比 pro 六千方案直接砍了一大截,但核心体验没有打折,预算有限,又想本地部署 deepsea 微四的,这就是目前性价比最高的路线。 pro 六千涨价,不代表部署不了大模型,斯卡 pro 五千七十二级成本降下来了,效果照样能打。 想了解具体配置和报价,评论区留言,我帮你按需配置,不花冤枉钱。如果你的企业也在考虑大模型本地部署,不知道怎么配置,欢迎来找我聊聊。

今天我们再给大家介绍一下那个开源的 k transformer 的 这个项目,前三周发布了零点六点二,在这个版本里面,它最主要是原生支持了这个 deepsea v 四 flash 的 模型,这个模型因为也是 deepsea 的 一个 非常重要的一个模型,它上下文达到了一兆,那么性能也是非常不错的。 k transformer 这个项目我们一直是给大家介绍的,它主要是用一些比较少量的一个 gpu, 再加上 c p u 内存的这样一个混合推理的方式去支持。那目前我跑了一下,基本上也已经跑通了,给大家来介绍一下这个项目。首先我们给大家看一下这个项目,我还是用 rtx 四零九零四块 gpu 去跑这样一个 d p v 四 flash 的 这样一个版本,它目前每秒钟大概 是在二十个透坑左右,二十二个透坑是最高的,差不多是这样的一个情况,应该来讲性能还是能够接受,当然它主要是并发症不能太多,如果你并发症多,它可能性能不一定好。这个是我们测了一下它的 ck, 也是可以顺利的跑通,应该没有太大的问题。 那我们给大家来介绍一下它是怎么来运行的。在 k transformer 里面,它提供了这样的一个文档,它这个文档主要是去支持五零九零的这样一个例子,它是官方是用 rtx 五零九零一块 gpu 去跑的,内存要大于二百五十六 g, 它是这样的一个情况,那我目前是用了 rtx 四零九零,给大家看一下 rtx 四零九零对 memory 的 话呢,我们是也用了蛮多的,用了江百二二百五十六,虚拟内存的话,将近用到三百三十三百四十左右,基本上内存要用到至少一百 一百六十一 g 吧,它这显示的是那这样的一个情况,这个是它的环境,当然我们也测了一下,那个 rtx 四零九零也是能够支持的,它是用了一块也能跑,我们是用了四块性能会更好一些,它是等于是这样, 然后你的 c p u 的 话呢,要必须要支持这个叫 avx 五幺二,那一般的话老的这个英特尔的 c p u 应该也是能够支持,按照那个存储空间的话呢,要三百四十 g b, 它等于是这样,那你还是按照它这个去去进行安装,先安装的就是先要翻译的是 k t pro 这样的一个东西的这个目的, 然后编辑完了之后的话呢,再要安装 s g line, 就是 安装,然后呢你要去更新它的库达和 flash, 英菲尔的这样一个酷,因为它这个酷要必须要大于零点六点九这个版本,默认安装的话呢是零点六点三,这个一定要更新一下,否则是跑不起来的。 另外的话呢,你要做一个降级,因为目前的话 s g line 它 deepsea 用的还是 transformer 的 这个 v 四的版本,所以你要把它给降下来,降到四点五七点一这个版本, 它目前还那个 v 四 flash, 它还不兼容这个 v 五的这样的 transformer 这个库,所以你还是要把它降一下。降完之后的话,你还要安装一下这个库,这个库是主要是 v 四 flash 或者 dk v 四,它的一些算子,它都是依赖于这个 i o land 的 这样一个库的,这个是比较重要的。好, 那么安装完了之后的话,那基本上就可以了,然后你要下载权重,下载权重,下载权重完了之后的话,你就可以去运行,当然在运行的过程当中,这两个指令是比较重要的,这两个变量你要跑 deepseek v 四的这个 model 叫二二六零四,然后 要把这个指定一下它这个,然后它才能正常的跑起来,它这个,那么跑完的话呢,基本上我看了一下解码,基本上四块 r t x 四零九零的话呢,也是在二十个二十多个托肯左右,差不多是这样。好,那么应该来讲 k transformer 这个开源库的话呢,对我们一些 就是消费级别的这个 gpu 还是比较友好的,特别是买不起一些高端的,像 r t x pro 这个六千的这些 gpu 福气来讲还是不错的。所以像我们原来有些企业买的 rtx 四零九零四十八 g 的, 应该跑起来会更好一些啊,这个好,那么今天的话呢,我们这样的一个视频就给大家就介绍一下,就是我们在有些怎么跑乞丐版的 dpc vs flash 的 这个版本。好,那么今天我们这样一个视频就给大家介绍到这。

此时此刻,历史正在被写下,就连英伟达创始人黄仁勋都清楚承认,这是美国在全球人工智能领域的灾难性打击。 deepthink v 四刚一发布, 就直接把华为生成写进了硬件验证清单的最前烈,态度决绝,一定要看到最后,近期,又一个 deepthink 时刻重磅登场。如果说一年前大模型刚破圈时,国内新片厂还在手忙脚乱做紧急适配,那么这一次,中国大模型已经实现了真正的出厂及高配。 再也不看海外巨头的脸色,整个中国 ai 产业正在以决绝的姿态,整体性的从英伟达扩大生态,全面向本土自主可控的硬件矩阵大迁徙,彻底打破垄断。在此,官方技术报告里提到了一个特别硬核的词儿,心魔血统。很多人看不懂,相关专家打了个绝妙的比方,这就像汽车的原厂设计, 不是大模型做好了再去找芯片对接口,而是从画第一张代码草图开始,模型和芯片的研发团队就坐在同一个办公室里死磕,深度绑定,同步推进。站在国家产业安全的视角看,有句话说的太对,在别人的墙基上砌房子,地基再高也只是沙滩上的城堡。 只有这种深度的心魔血统,才能彻底甩掉对单一海外巨头卡伯兹的恐惧,真正把 ai 主权把握在自己手里。此刻我们必须明确一点,这从来不是蒂普森克一家公司的胜利,而是以整条国产 ai 产业链百花齐放背后藏着三层核心逻辑, 每一层都彰显中国 ai 的 底气。首先看机械层的多链适配,这一次除了华为升腾事件超节点全系列支持, 国内至少有八家硬核 a r 芯片厂同步官宣适配。从大模型的机模五虎到芯片界的 g、 p、 u 四小龙,一套完全独立于美方体系的国产算力加国产模型,商业生态 已经彻底跑通了,系统性、安全性的量产可行性,再也不是单点突破,而是全面开花。其次,看成本与安全的双重结欧,过去全行业都不得不接受高昂的海外硬点议价, 被卡脖子时更是束手无策。而现在,通过本土产业链携手创新,中国企业第一次在 ai 领域走出了艰巨成本优势与安全保障的中国路径。互联网上半场,我们经历过缺心少魂的痛点,被卡脖子的无奈, 但在 ai 下半场,这个核心底座我们自己说了算。最后看客观存在的长跑带叉、保持清醒也是我们的必修课。必须客观看到,目前国产算力的优势主要集中在推理测,在更核心的训练测,我们依然需要漫长而艰难的爬坡。 diffin v 四虽然在开源领域独步天下,但对比全球最顶级的避远模型,依然存在技术代差。正如 diffin 自己所说,通用人工智能是一场比拼耐力的长期出行马拉松。点赞、收藏、看透中国 ai 反沙的底层逻辑!

朋友们啊,我这个月断断续续的用了十亿透坑的 deepsea 微四,正好前几天 deepsea 宣布永久降价,也就是现在的二五折,我就给大家分享一下这个月我的使用感受。 首先第一个呢,就是 deepsea 的 缓存命中真的是特别的离谱,基本上一个绘画的缓存命中都能达到百分之九十五以上,甚至用一些方法可以达到百分之九十九以上。具体的方法我们下期来讲,所以它的调用费用真的是差了很多倍, 但光比价格可不行。 dipsic vs pro 的 能力虽然是位于国产大模型的第一梯队,但和国外的模型还是有一段距离要走的。 第二个就是它的上下纹长度有一兆,对比之前我使用的一些上下纹长度只有几百 k 的 大模型来说,真的是疏忽太多了,不用频繁地压缩上下纹导致细节缺失,基本上我的一些任务都能在一个上下纹窗口里完成。 第三个就是 deepsea, 它并不是一个多模态模型,没有图像识别能力就有点难受,但其实解决方法还是比较简单,接一个其他的 mcp 就 可以了,但对比 gpt 那 些多模态模型来讲,效果肯定是没有那么好。然后再给大家一个建议,就是最好不要来回的切换 flash 和 pro 模型, 一些专门适配了 deepsafe 的 agent, 比如 reasonix, 内置了随时切换模型的功能,我实测了一下,来回切换模型之后,缓存命中会降低。总之 deepsafe 真的 是算性价比比较高的大模型了,给我们提供了一个价格比较低但能力也不够的选择,还是很推荐大家来接入试一试的。

很多人都在问 deepsea v 四到底强不强?我今天不吹参数,不看跑分,也不复读发布会我直接告诉你, 普通人到底该不该用。因为现在很多 ai 发布最大的问题不是不够强,而是你看完一堆宣传,最后根本不知道它能不能真正帮你干活。而 d e e p s e k v 四这次最关键的其实只有五件事。第一件事, 它不是那种一夜图榜的模型,你别指望它刚发布就把所有顶级闭源 ai 按在地上打,但重点是它重新回到了第一梯队。什么意思?以前很多国产模型最大的问题是不稳定,有时候很强,有时候像失忆。 但这次 deepsea v 四明显开始往稳定生产工具走了,这很重要,因为真正能进入工作流的 ai, 不 一定是最炸裂的,而是你敢长期依赖的。第二件事,这次真正被低估的不是跑分,而是百万级上下文。 很多人还把 ai 当聊天机器人,但现在已经进入智能体时代了, ai 不是 陪你聊天,而是开始帮你读文档、拆任务、调用工具,连续执行。这时候上下问一短,问题就来了,任务做到一半直接断篇,前面说过的话,后面全忘。 所以 deepsea 这次把长上下文做起来,本质上是在铺 ai 工作流的基础设施,你现在可能感觉不到,但未来所有自动化协作 ai agent、 长链路任务都会越来越依赖这个能力。第三件事,很多人看模型只盯着 api 价格, 什么一百万偷啃多少钱,但真正做项目的人都知道,单价根本不是重点,重点是同一个任务, 你到底要改几轮?有些模型虽然便宜,但你改十次他都理解不了,最后头肯越烧越多。真正该算的不是调用成本,而是任务完成成本。 这也是为什么有时候贵模型反而更省钱。第四件事,很多普通用户最容易犯一个错误,所有任务都开最强模型,其实完全没必要。如果你只是写文案、做总结、整理数学、 多步骤任务、 pro 版本,差距就会慢慢出来。真正聪明的玩法,不是无脑上最贵,而是普通任务用快的关键,任务在用强的,这才是 ai 时代真正省钱的方法。第五件事, 也是最关键的一件事。 deepsea v 四真正值得测的,根本不是网页聊天框,而是智能体工具,比如代码助手、自动整理资料、知识库问答、 pdf 报告生成、自动化工作流。因为只有到了真实流程里,你才能真正感受到长上下文 工具调用、中文表达能力到底有没有价值。但这里我要提醒一句,很多人现在对 ai 最大的误解就是觉得模型升级以后就能全自动驾驶,其实并没有。复杂任务里, ai 依然不一定会主动选最合适的工具, skill 插件、外部调用很多时候还是需要你自己判断,所以它更像什么,像一个效率极高的协作者,而不是一个完全不需要人类的大脑。最后说一句, 这次 deepsea v 四真正重要的可能不是超越了谁,而是它在持续开源,持续降低门槛,持续推进国产 ai 生态。 这意味着国产 ai 开始从跟随慢慢进入,共同探索下一代智能。如果你平时经常写内容、读长文档、做代码、搭 agent、 跑工作流。我建议你认真试一下, 不是为了追热点,而是看看它到底能不能让你的任务更快完成。但如果你只是偶尔聊天,也不用焦虑,你不会因为没有某个模型就错过一个亿。记住一句话,模型排名只是参考,能不能进入你的工作流才是真正的关键。我是 ai 知识博主麦克飞 k, 后面我会继续用普通人的视角拆 ai 模型,拆 ai 工具,拆 ai 工作流。别迷信单个模型,真正的红利永远属于会把 ai 放进流程里的人。

友们,最近那个 deep sync 是 不是发布了吗?我用了一段时间,真的很省呢,你们看一下我用的情况啊,我五月份大概就用了,没用没用几天啊,只用了这个十多块钱, 十多块钱我们看一下九百多次吧,我们看一下 token 量啊, token 量是一亿多, 一亿八,我们看一下最牛逼的这个缓存命中率看一下。一,你看这这一填用了一点二亿,缓存命中率是一点一,八亿, 未命中的是八百万,是不是很高?非常高。看这第二天缓存命中率是三千万,未命中率是一百多,这一天缓存命中率是两千万,未,未命中的是 五十多万,对吧?还这一天命中的是五十多万,对吧?还这一天命中的是八十万, 所以这个位命中率是非常少的,所以用这个用 agent 去使用这个 deep sync, 是 非常非常省的一个逻辑啊,非常好。然后我们看一下。

deepsea v 四终于发布了,官方号称有些项目可以和贵它几十倍的模型掰掰手腕参数量直接翻到一点六体尺寸比上一代大了一倍还多,国模最大上下纹长度也一步到位,拉到了一百万,对齐了目前最顶级的水平。 那么这个小鲸鱼实际体验如何?能满足我们对它的期待吗?这个视频带你看完 deepsea v 四,也聊聊我作为一个 ai 开发者对它的看法。 自从 deepsea r 一 发布震惊全世界,直到今年三月,他的网页端好像一点变化都没有,一直是这两个按钮。与之相比,别人都在突飞猛进,甚至还出现了大量 deepsea 已经泯然众人已的论调, 但在水面下其实是另一方光景。过去这一年, deepsea 发表了近十篇重量级论文,其中一篇拿了 acl 最佳论文奖,一篇发在了 nature 上。他把训练大模型的成本砍掉了一大半。 他给推理流程装了一道筛子,把识别人名、匹配短语这种不用动脑的活直接过滤掉,让算力集中在真正难的问题上。两个月之前,我们还会问 deep seek 为什么要这么轴,难道是他不想要用户了吗?现在知道了,这些科研回报全在 v 四里面展现了。 我认为 deep seek v 四这次对开元世界最大的贡献就是推理效率的突破。 再说这个特性,之前我要交代一个背景,不知我们全世界都在进入算力短缺。 amd 的 ceo 在 今年 ces 上给了一组数字,二零二二年,全球 ai 算力大约一 zeta flop, 到二零二五年已经飙到了一百多个,而未来五年还需要再翻一百倍, 整个 ai 行业在一瞬间就进入了算力地狱。原因还要从前几年说起。那时候 ai 大 模型主要是聊天, 你问一句,他答一句。他很会说话,但也只会说话,说出来的话还不一定靠谱。幻觉不断很难说,除了麦克变现和情感陪伴之外,他还有多少生产力。于是有人就想, ai 光说不做的状态,什么时候能突破? 时间来到二零二四年下半年,几个团队几乎同时摸到了一条路。与其让模型一口气给你一个答案,不如让他把任务拆开,一步一步想,每一步给他一个手,也就是调用工具的能力,想查数据就去查,想改文件就去改, 想处理数据就自己写一串代码。这个循环一旦跑起来,模型能做的事一下子多了不止一个量级。这种想一步做一步的循环叫做 react loop。 而基于这个循环运转起来的系统就叫 agent。 去年年底, agent 彻底爆发了。 curser 让 ai 写出不错的代码, open ai 直接给你电脑配了第二个小鼠标。 大模型从一个只有嘴的聊天对象,变成了有手有脚的助手。这种助手让一个叫 peter levos 的 独立开发者,从 idea 到年入百万美元,只用了十七天。 他让 anthropic 每发布一个新功能,就有一批软件公司的股价跟着跳水。最神奇的是,大名鼎鼎的龙虾 openclaw, 就是 peter stamburger 一个人开发的,期间没有手写一行代码, 这一点我自己感受最深。我从毕业开始就做文字工作,几乎没有写过代码,但今年靠着 ai 编程,边做边学, 我真做出了一个自己的 agent 产品,并且受到了一些社区小伙伴的喜欢。因此,要让 agent 自主操作现实世界的机械,也不过是时间问题。所有人都觉得 agi 就是 这条路了, 但代价呢?代价是算力消耗爆炸。以前一轮对话可能几百个 token 就 结束了,现在根据调研机构的数据, agent 的 token 消耗量是原来的五到五十倍,无论是厂商、机构还是数据中心,都面临着算力荒。 而这个局面刚好撞上了一家公司的基因。 deepsea 做量化基金出身,骨子里的逻辑就是用最少的资源撬动最大的收益,再加上众所周知的原因,芯片受限,所以他不得不在有限的硬件条件下把效率做到极致。 v 四身上处处都是这种思路的体现。 大语言模型内部有很多专家模块, v 三有两百五十六个专家,每次派八个上场。 v 四把专家池扩大到三百八十四个,但每次只派六个上场的反而更少了。 他用了一套新的注意力机制,让模型在处理长文本的时候大幅减少计算量。他还换了一种更高效的训练方法,只要传统方案大概一半的计算量就能到同样的效果。所有设计都指向同一个方向, 保持模型的聪明度。但是用更少的算力,这种效率优势反映到价格上有多夸张呢? v 四的小模型 flash 版输出只要两块钱一百万, toc 同级别的海外模型少说也要几十块。大模型 pro 版二十四块,对面报价一百出头,同等实际性能下差距能有五到二十倍,而且据说等下半年华为升腾芯片大规模部署之后,价格还会进一步往下压。 从各方测评和我自己的体感来看,大号的 pro 版已经超过了 cloudsonnet 四点五,接近当前最强模型的水平。有意思的是,去年芯片受限还只是中国公司的特殊处境,海外厂商并不缺算力。 没想到今年 agent 一 来,全世界都在抢算力, deepsea 被逼出来的这套打法,反而成了全行业最需要的解题思路。而这些公开的科研成果,接下来大概率会被越来越多的大模型公司借鉴。 翻开 v 四的更新,说明,你很难不注意到一件事,编程能力占了最大的篇幅。 其实不只是 deepsea, 你 去看今年任何一家大模型的更新日制,排在最前面的几乎都是编程,恨不得把跑分贴到你脸上。可是编程跟我们大多数人有什么关系? 关系还挺大的。举个例子,这是我开发的 agent, 如果不把过程中的工具调用隐藏掉,它输出的原文就是这样的回答,夹杂在各种工具指令和格式之间。比如这里是网络搜索,以防 ai 幻觉编一个答案糊弄你。比如说,这里是调用另一个 agent 来审查结果。 然后这里又是先看看你写的 skill, 保证接下来的工作和你对齐。这些日常场景里不被看见的代码输出,保证了能被看见内容的质量。之前 deepsea 在 这方面其实表现不差, 但和今年的尖子生比,还是有点不够看的。一四在这个方向上下了很大功夫,是去年科研成果的极大成,拿两个硬指标来说,算法编程的 code forces 评分一四,达到了三千两百零六,超过了 cloud ops 四点六和 gpt 五点四。实际软件工程的 swe verified 也做到了八十点六,和最强的几家几乎齐平。虽说跑分这件事并不完全代表实际体验,但我个人用下来感受和前沿大模型差不了多少。我尝试了一个我自己做的复杂的写作 skill, 找方向,打草稿,写大纲,他执行的都很不错,在过程中问别的 a 振特时系统报了错, 他也自己尝试了别的办法,让流程顺利的推进了下去,聪明程度确实提高了。 如果你这几个月打开 deepsafe 官网,问他是什么模型,他会藏着不说,但有一件事他特别主动 给你强调,他能装下一部三体有一百万上下文。上下文长度是过去 deepsafe 最大的短板,这个概念指的是模型一次能看到的信息量,以前只有聊天内容几千字绰绰有余,但在 agent 的 时代,各种代码信息以及格式全部被塞了进去,一 一百二十八 k 很 快就捉襟见肘。主流模型都已经两百 k 起步,头部玩家做到了一百万,但是贼贵。 在过去,很多人不用 deepsea, 很 大一部分原因就是上下文太短了,并不是因为他真的不够强,特别是在创意写作这块,他一直挺能打的。这次 v 四直接拉到 em, 让人垢病的短版,现在变成长版了。更夸张的是输出长度, 光单次输出上线就有三百八十四 k, 一 轮就可以把黑暗森林复苏一遍还有余。 最后这个更新我觉得也很重要。 v 四的大模型和小模型是同时推出的,小号模型保持了大部分的能力,但是价格便宜到让人没法理解。做 a 阵的开发之后,我有一个很深的感受,很多任务根本不需要大尺寸的模型,摘要、翻译、格式整理 这些活需要的是一个够快够稳的小模型,这样下来可以在保持同样智力的情况下,显著减少运行的成本。当然, v 四也有明显的缺口,最大的一个它依然是纯文本模型,现在主流模型基本都能处理图片、语音甚至视频, v 四在这块还是零,我觉得如果加上多模态的话,最后实际体验肯定还会好很多。 回看前面聊的这四件事,有一个共同点,全是底层能力。 deep sea 的 精力全花在造引擎上,开源出来让开发者拿去造自己的车。这次视频调研过程中,我从论文和一些公开报导里看到了几个有意思的细节。 维斯论文里引用了 kimi 团队做过验证的优化器,而 kimi 的 k 二也用了 deepsea 早期提出的注意力架构。两家开源产品在各自的核心技术上互相借鉴,互相致谢。这种开放在拼命卷的行业里不常见,但它确实在发生,而且结果也是好的,让更多人用上了 更强大更便宜的模型。这种氛围也延伸到了同行之间的互动。论文评测部分直接写了一句, k 二点六和 g l m 五点一的 api 太忙了没法返回结果,所以留空。智普看到后回了一句,哥们你想要的话,高速度账号安排上, 论文本身的写法也挺特别,致谢。只有一句话,评测部分坦诚,写了哪些地方还落后?闭源模型三到六个月不卑不亢的 看完这些,我觉得这个团队是知行合一的,说开源 mit 协议拿去用,说长期主义就扎在科研里,半年不吭声,外面传了好几轮,遇到问题了被超越了,小鲸鱼不语,只是一味跳票,然后发论文 面对蒸馏人才流失这些非议, deepsea 选择沉默,然后在某个周五端出模型并引用,寻子 不幼于玉,不孔于匪,率道而行,端然正己。而我觉得最适合他的是墨子的一句话,夫爱人者,人必从而爱之。利人者,人必从而利之。