deepsea v 四发布后,官方发了一段意味深长的话,结尾引用了寻子明句,不幼于狱,不孔于匪,率道而行,端然正极。外界普遍读出两层意思,一是回应导向华为的争议,二是不想被融资传闻绑架。从技术引示到两百亿估值一百五十天里, deepsea 被推到了国内 ai 最中心的位置 风口浪尖上,他们没解释太多,指引了一句古人的话,剩下的交给时间。你觉得官方这句话是想表达什么意思。
粉丝1.6万获赞22.5万


不幼于玉,不孔于匪,率道而行,端然正己。这是 deep sea v 四在官方公众号发布文章中的最后一段,也是令我印象深刻的一句话。我看到这句话的时候呢,肃然起敬。 这句话啊,出自战国时期儒家经典的荀子非十二子,用大白话解释一下,就是不被赞誉所诱惑,也不因诽谤而恐 惧,始终遵循呢道义行事,端正自身,不被外界一切所动摇。我觉得描述 deep sea 再好不过,在 ai formal 情绪冲刺的时代啊,能够进 静下心来搞工程技术突破,这就很不容易了。这个视频呢,我想跟大家来解读一下。 deepsea v 四不会太技术,会先讨论一下 deepsea v 四的基本情况,也会讨论大家关心的华为升腾芯片用在什么地方,我们也使用一下 deepsea v 跟 cloud skill 能不能兼容。那么话不多说, 我们直接开始。先来看一组数字啊, deepsea v 四呢,分成两个版本,一个是 flash 版本,也可以理解为是一个经济的版本,两千八百四十亿的总参数, 一伙呢,一百三十亿,这些数字是什么概念呢?你可以把它想象成一个团队,那 pro 呢,就是一个一流的专家团,那 flash 呢,就是高校的突击队。你现在去官网呢?如果你使用的 instant 就是 快速给你处理,回答呢,它调用的就是 flash 的 模型,如果选择的是专家的模式,它调用的就是 pro 的 模型。 这两个模型最大的亮点,他们都能够一口气读完一百万的 tok 的 上下文,相当于呢,把三体的三部曲从头看到尾,然后回答以 关于其中任何一个细节的问题。然后 v 四也做了一个特别聪明的动作,就是它把整本书压缩成高度浓缩的栽秧锁影,只要在需要的时候去精读对应的段落。这样一来呢,同样是百万字的上下文, v 四 pro 的 计算量呢,也只有前代 v 三点二的百分之二十七,这个显卡占用呢,也只有百分之十。 v 四 flash 呢,那就更狠了,计算呢,只有前代的百分之十,显卡占用只占百分之七,也就是说呢,它既读的又多又快,还不怎么费显卡。这是怎么做到的呢? 背后其实就我们这边提到了三大神技,第一个神技啊,我们叫做混合注意力机制,简单来说就是精读加贩毒。那 v 四内部呢,也有两种阅读模式交替工作,也就是这个 c s a 和 h c a 分 别对应精读和贩毒模式。打个比方呢,你现在有一百万本书的超大图书, 然后你是其中的管理员,有人就会跑过来问你,比如说一九八四年洛杉矶奥运会女排决赛,中国队的助攻手是谁?传统的做法,你就是把一百万本书全部搬出来,或者说你用图书馆的解锁系统看看哪一个是可能相关的,一夜一夜翻,干到天荒地老。那 v 四的这个 c s a 清读模式它是怎么做呢?它是先把每四本书呢合成一本 摘要册,然后再快速扫描所有摘要册目录,立刻锁定其中三本,比如说体育、排球,一九八四相关的 书籍,这种三类型的书籍,把它抽出来,然后答案就可以很快的找到了。那么如果用 h c a 这个贩毒的模式呢,它其实就是把每一百二十本书,这边一百二十本有可能不是一百二十,蛮真实啊,这边是给大家举例子,把一百二十本书呢,就会合成一个主题的卡片,然后快速先扫一下所有的卡片, 万一发现呢,一九八四的时代周刊核电本有提到过这个比赛呢,他就会把它纳入后续这样精读,加上贩毒的这个交替进行,就 可以保证全面又准确。这就像不像你考试的之前呢,你去快速通过目录来找重点,先复习老师提过的考试的重点,然后呢也会把握一下全书的这个脉络,这就是 t p c 的 第一大神技叫混合注意力机制,分别有精读和泛读两种。那么第二个呢,叫流行约束超连接,是不是很难理解?它叫 简单来说呢,就是给一个大楼六十一层的大楼装上了真空的管道。 v 四的 pro 呢,有六十一层深啊,参数有一点六万亿。你可以想象着一座六十一层的摩天大楼,然后每一层呢,它都在处理各种各样的信息,然后向上传递,普通的做法就是直接坐电梯,然后一层一层往上走,对吧?文件呢,有可能在过程中呢被风吹上了, 或者到顶层呢,这个信息都乱。流行约束超连接这个技术呢,等于在大楼中央装了一个真空管道系统,然后文件呢,可以封进 这个标准胶囊里面,里面磁力导轨呢,可以保证不翻滚不丢失。那么无论从哪一层发出呢,到顶层呢,可以保证几乎完好无损的这个信息,这就要让再生的这个网络呢,都能平稳的进行训。 第三个呢,叫做 m u o n 的 这个优化器啊,那么所有的大模型啊,都需要用到优化去去降低 loss, 相当于健身教练帮你去调整动作。行业默认的教练叫做 adam, 这是在 machine learning 时代就非常流行的优化器了,它是给每个参数呢去调一个固定的幅度,但参数之间呢,互相影响,调完这个可能另外一个又歪了,所以呢,你就不断地进 行念经,那 m u o n 就 相当于一个智能私教,这个新教练呢,他就聪明多了,他确保你调整所有的动作的方向呢,彼此垂直或 不干扰,就像这个图一样,这样训练呢,就可以保证又快又稳。那 v 四就用到了这个 m u o n 的 训练优化器,训练一点六万亿的参数,就等同一个教练同时指导了一百万个动作进行协调优化,这样呢,去保证我们这个优化平稳的进行。 接下来聊聊大家关心的问题啊,华为深腾和英伟达的 g p u 到底谁干了什么活?那这可能是大家最八卦的问题了。先说结论,预训练阶段,也就是从零开始把模型喂大的这个阶段,虽然文中没有明确表明,但 大概率还是用的英伟达的 g p u。 这个没有办法,目前超大规模的训练呢,成熟度最高的还是库打的生态。但是在推理优化这个环节呢,华为生成的 n p u 真正证明了自己达到了生产级的验证。 deepsea 的 论文里面有一句话特别有意思, 说我们在英伟达 g p u 和华为生成的 n p u 上两套平台上呢,都验证了推理加速方案,那什么方案呢?它叫做 maga m o e, 细力度专家并行。你先别管这个名字叫什么呀, 就是它能让推理速度呢提升一点到一点七倍,延迟敏感的场景呢,最高能达到一点九六倍。在大模型的推理场景中啊,第一次获得这么权威的实战认证,也是国产 ai 芯片值得骄傲的一件事情呢, 不是象征性的跑一跑,而是真正生产级的验证。那么再具体一点呢,华为的升腾九五零超节点呢,已经完成了对 v 四的深度适配。下半年大家觉得 v 四 pro 的 a p i 价格会比较高,但是因为现在算力还不够。 值得一提的是,除了华为的生产以外,国产的像韩五 g 啊,海关木兮,还有魔幻城等等的国产芯片呢,也完成了对 deepsea v 四的适配。所以你看,虽然御系列的城墙呢,还在英伟达的手里,但是在推理这 条线上的裂缝已经有些明显了,也难怪老黄呢,前段时间的播客采访,希特跳脚,那这个表格呢,展示了一下各个阶段里面具体用的一些技术,像预训练阶段,就是刚我们说的还是主要用的 gpu, 那 后训练阶段呢,就是 gpu 再加上它的深层呢,在文中提到了它用于 flash 版的一个续训练的适配,然后 做了一下这个序训练也是被作为微调。那推理服务呢,在双平台都做了验证,未来推理呢,还进行扩容。 deepsea 呢,也在文中呢,基于 v 四的训练和推理实践呢,向芯片的硬件厂商呢,提出了非常具体的改进方向,分别有四条,涉及一些通信啊,激活函数的一些东西, 属实共创生态的典范。 deepsea 微四啊,不只是会聊天,它是真正会干活的。所以 deepsea 在 后训练阶段里,专门给 deepsea 这个 v 四塞进了几百万条真实的 agent 的 交互轨迹,让他去学会像人一样使用工具,打开浏览器去收集信息啊,调用计算器啊,操作文件系统啊,甚至去调用多个 a p i m 完成一些跨领域的任务。举一个直观例子,你可以跟 v 四 pro 说,把我文件夹里面所有的 pdf 转成文本,或者说找出对应的段落,整 理成 excel, 发我邮箱等等。这当然也是现在大冒险发展的一个方向,就是 agentic task。 关于 deepsea v 四的 benchmark, 我 不想说太多跑分 的内容。 deepsea 这篇报告里面有一个非常值得称赞的地方,就是他们不止展示了这个编程 bug 的 成绩,还专门测试了四类真实世界任务,并附上了与竞品的对比,比如说跟 cloud open 四或者说 jimmy 三点一 pro 进行了对比。这四类任务是哪四类任务呢?第一个是中文的写作,还有第二个是搜索,第三个是百里任务,最后是 coding agent 就 进行了代码的测试。从例子中可以看出来,他们在他们自己的量化团队做了测试,包括呢,写作啊, ppt 或输入代码 说我们来看看中文写作好了,在功能性写作上面呢,他有说 g b c v 四呢,在大多数情况下都是比 jimmy 三点一更好的,而且在创意写作上也是比三点一更好的,但是在复杂和多人写作上呢,他们也承认还是略逊于这个 cloud open 四点五的。那针对于搜索呢,如果你没有开启思考模式呢, 它就是用的 r a g 的 技术,但是如果你开启了思考模式呢,它就会启动 a g t search。 然后也说下百里任务啊,百里任务呢,其实就是一个内部评测器,它去模拟真实职场的使用场景,比如说写报告啊,分析数据啊,查找邮件啊,整理会议纪要等等。 这里面 deepsea 呢,也展示一下他们输出的一些内容,包括比如说 ugc 传播,社交裂变,还有 deepsea 内部搞电话投资,有分波段投资,拆解和资源配置等等。值得一提的是啊,这个白领任务呢,在中文白领任务上面做一下测试。 deepsea v 四 pro max 呢, 是比 opus 四点六 max 表现是更好的,这也被认为呢最实用的一些能力维度。关于 vip coding 这方面呢,邀请了大概八十五位专业的开发者在真实工作中进行盲测。那么其中有百分之五十二的同学呢,觉得 deepsea v 四 pro 呢,已经可以当他们主力编码模型了, 体验优于 cloudsonnet 四点五。那 deepsea 这一次罕见的克制呢,在公告里面也主动承认了,跟币源最强模型的思考模式呢,还是有差距,那这种实事求是的态度,本身就是一种自 信。最后说一下价格啊,这也是 deepsea 一 贯的价格屠夫的风格。 v 四 flash 呢,输出价格每百万 token 呢,只要两块钱,那 v 四 pro 呢,输出要二十四块。相比之下呢, gbt 五点四, cloud open 四点六呢,差不多都要贵五十倍左右。最后做一下总结啊,总结几个常问的一些问题。第一个是 v 四训练全部用了生成的芯片吗?这个是不是的预 系列呢?大概还是用了 n v i g p u? 那 推理车呢?升腾已经可以对标,那库达生态有没被取代呢?短期内还是不会被取代的,但推理车这个壁垒呢,已经被突破了。什么叫 magma o e? 这个就是一个细腻度专家的模型,它可以使整个计算通信执 行呢,加速一点五到一点九六倍,能在我电脑上跑吗?啊,这个模型太大了,在电脑上基本上跑不起来了,但如果你电脑足够强的话, flash 版本是可以尝试部署的。 v 四是最终版吗?目前发布的呢,只是预览版,那之后呢,有完整版对外发布。最后呢,我们来测试一下调用 skill 的 能力,看看是否能够很好地兼容 skill。 我 们可以在 cc switch 里面装上和开启这个 deep seek, 就像我这样的,然后打开 cloud。 我 们先来试试官方的一个 from and design skill, 我 们可以斜杠输入,找到 from and design, 然后输入这么一个任务, prompt。 据当前目录下,这个 deepsea v 四的 pdf 呢,就是 deepsea 出的这个技术报告,我让他去生成一个解读这个技术报告的 html 文章,然后面向 普通大众。 ok, 去,我们先看一下它能否加载这个 skill 啊,它已经完成了这个 pdf 的 阅读,它转化成了这个 txt 文件,然后整个阅读了这篇文章。之后呢,它就开始创建这个 html 文件。 ok, 结果已经生成出来了,它做了一下总结,说采用了深色科技风格,然后大概啵啵说了一堆,我们直接来看这个效果吧。点开哦, 这个还是挺有 feel 的, 它也调用了这个前端的一个 from end 的 skill, 然后去生成了啊整个这个文章的结构。因为我经常用这个 from end design 的 skill 呢,所以我知道大家风格其实它是非常尊崇这个啊 cloud skill 的 风格的, 从这个角度来说,它可以适配我们已有的这个 skill, 这样的话就会方便很多了。我自己也测过呢,你也可以用这个 superpower, 因为开发的时候我经常用这个 superpower 的 这个 skill, 然后用这个 skill 呢去做一些 开发,它相当于一个 harness skill 级别。之前我的视频也有分享,也可以用在这个 deep seek 的 模型当中。总结下来就是 deep seek 也可以适配于我们不同的 cloud 已有这些 skill。 ok, 本期视频就到这里了,如果你觉得还不错呢,欢迎点赞、收藏和关注,我们下期再。

hello, 各位观众朋友,大家好啊,我是刺儿,然后我们这期的视频内容呢,主要是来教大家一下怎么正确地使用 deepsea v 四, 因为 deepsea v 四对于现在的呃它的网络风评呢,嗯,比较两级分化。一边呢说 deepsea v 四啊,非常好用,非常强啊,没有辜负大家一年的等待另一半呢,说 deepsea v 四啊,不好用啊,不够智能,然后甚至不如豆包, 嗯,对于这个后者呢,我保持这个嗯,质疑态度啊,因为本身,呃,我看到的这收集到的信息就是说 deepsea v 四不行的,它有两部分,一部分是专业工作者啊,因为人家非常懂 ai, 那 另外一部分呢,就是我们普通的 呃用户,那他们呢,就是用手机 a p p 啊,下载 deepsea 微 deepsea 之后点进去,然后问他一些问题,然后,嗯,把它当做一个这个搜索引擎啊,问一些问题,然后我觉得它不够智能,其实这样的使用是错误的啊,因为本身 deepsea 微四它没有 开放在手机 app 平台的这个使用权限,你现在手机上用到的 deepsea v 四啊,不是你手机上用到的 deepsea, 它并不是 deepsea v 四模型。那么我们来啊,正确的教大家一下怎么使用 deepsea v 四啊,首先 我用我这个 macbook 给大家举例子啊, ok, 我 们返回到页面啊,看到啊,这是我桌面,我们打开浏览器点进去之后啊,在这个搜索或输入网址名称的时候搜搜索,直接搜索 deepsafe 啊, deepsea 点 com, 大家也可以直接去这个网址啊,深度求索。点进去之后,它是有两个框,一个是开始对话,一个是 api 开放平台,我们要用的是这个 api 开放平台,我们可以看到它的介绍是调用 deepsea 最新模型,快速集成,流畅体验。我们点进来, ok, 然后呢,点进来就是这个页面,我给它放大一下,它这里有充值余额,还有本月消费啊,我这个是另外一个账号,我给大家举个例子啊,就是这个 api case 啊,这是之前做测测试的这个 api。 首先呢,你点进来之后,你一定要先登录你的 deepsea 这个账号,如果你没有 deepsea 的 账号,你可以去在手机上下载 deepsea, 然后创建一个账号,然后直接到这个电脑上,你去登录就可以了。 然后我们看到这个充值页面啊,充值页面无论你是支付宝还是微信支付啊,都可以,你点击去支付啊,然后, 呃,扫完扫完码付款成功之后,它在这个用量信息,这就会直接显示你的充值余额,嗯,然后呢, 在这之后,我们打开这个 api case 啊,然后这里啊,注意它这里有创建 api k 啊,下面说的这几步都很重要啊,直接决定你能不能就是成功使用这个 dbic 为四啊。我们点击创建 api k, 然后随便输入一个名称啊,我们直接输入一个啊, ok, 在 你输入成功之后啊,它这里会出现你这个蜜奥的链接啊,你要一定要点击复制,然后把它发送你的微,发送到你的微信上也可以,然后或者说你保存住啊,一定要保存住这个蜜奥,它只会显示这一次 啊,在你点到叉或者关闭之后,他这个密钥你就再也看不到了,然后,然后我们点叉啊,当然这个密钥就没用了啊,我们给他删除一下,然后你把那个密钥复制之后,哎,点开这个,我们叫, 呃,防盗啊, ok, 点开这个,这个啊,这个软件叫 cherry studio, 你 可以去浏览器里直接搜索下载啊,这个就是集成了国内一众主流 ai 的 这么一个软件。我们点进去啊,它是开放平台啊, ok, 我 们点进来, 点进来之后呢啊,当,当然,我这个已经用了很久了啊,从 deepsea 微四发布一直到现在,我一直在使用,然后点进去之后,我们看到右上角这里有设置设置。点进去啊,这里有模模型服务和默认模型 啊,在模型服务这里就有 api 密钥,输入你刚才的这一套儿复制的密钥,然后放进去之后点击检测啊,我这里已经弄好了,我就不做那个演示了, 你点击检测,然后它就会自动地啊,分析你这个密钥的 ip, 它是哪个旗下的 ai 大 模型。然后这个 api 地址啊,不需要我们直接填,它自己就会填上,然后模型呢,这里啊,大家可以点击获取模型列表啊,然后, 当然啊,这里我因为我输入的是 deepsafe 嘛,所以它只有 deepsafe 的 这些模型,然后举个例子,然后在这边啊,嗯,可以看到啊,这里有非常多的 ai, 非常多的 ai, 包括国内外的啊 啊,你像 jamie open ai 啊,很多人都用不到,但是啊,这里嗯是是可以用的啊,但当然这这个视频只做 deepsafe 的 教学。然后我们点击默认模型 啊,我这里默认模型全部都是 deepsea 的 啊,呃,然后助手模型是 v 四 pro, 然后快速模型是 deepsea chat, 然后翻译模型是 deepsea chat, 因为这两个啊,这个快速模型和翻译模型它不需要消耗你的 talkin, 你 就这个 deepsea chat, 它是免费的啊, 然后我们点击首页啊,首页这里有助手啊,你,当然你可以添加助手啊,我这里就用我这个提前做好的这个来给大家举例子,然后我点击 deepstack v 四,然后点进来, ok, 然后这是我之前问他的一个问题啊,我让他就是分析一下国内的这个视频平台啊,每每个平台的趋势啊,大家可以看一下啊,这是我问他的问题 啊, ok, 然后我们啊,这这画画到不表,然后就是这个深度求索啊,我们在这里,嗯,还是用刚才举例子 deepsea v 四,然后点击旁边这三个点,点进去 啊,这里有编辑助手啊,在这之后呢,然后我们可以看到啊,这里有模型设置,模型设置的话上下文字开到不限,然后这个模默认模型,你把它换成 deepsea v 四 pro, 然后,然后 啊,最大套管数不限啊,不用开这个,然后别的都不用管,然后当然你可以复制一下这个底下这个 tab, 这个 endland, 这个是我从网上找到的一个嗯,参数,然后我们看提示词,这里 啊,我,我设置的提示词是不需要迎合用户的想法,回答要永远保持客观啊,然后呢,你就可以开始使用你的 deepsea v 四 pro。

deepseek v 四刚好赶上毕业季上线,这波红利简直就是送到嘴边,摆明了就是让咱们轻松搞定初稿,剩下的时间安心备考、考公考研,或是专心找工作。 这波一定要紧跟新版本节奏,先用之网高级解锁,锁定两三个核心研究方向,文献年限直接限定近五年。既然都用上 deepseek v 四了,参考文献肯定也要选最新的才配得上文章的水准。 快速筛选出十几篇优质文献,导出标准引文格式,再拿去找那条鲸鱼号称能跟贵它几十倍的模型掰掰手腕,把整理好的文献资料端贴进去,去梳理逻辑缜密、结构完整的三级大纲, 说实话,效果比自己苦思冥想拼凑出来的靠谱太多。真实文献有了,完整的研究思路有了,文章整体框架也稳稳搭好了文, 完全没必要自己一字一句手动硬整。大家要知道,五月过一半了,直接上传基础信息,把 deepsea 梳理好的研究思路填充进去,手上有实验数据,调研数据也全都往里导入。再勾选本校专用格式模板,就能帮你规整排版。 导入筛选好的参考文献,填入定制大纲,什么建模图、仿真图、流程图这类专业图勾选就能完成。 来看最终文章配图表格质感高级,整体格式排版完全合规,目录摘要等细节也整理得妥妥当当,就连 ai 查重率也能轻松达标。把剩余时间放在重要的事上,祝你们都能顺利通过!

不用担心 deepsea 弄出稿会编假文献了,最近 deepsea 微四出来了,想着试试他能不能找几篇文献,结果真给我扒拉出来了,还都是如假包换的真货,不是什么瞎编的,说白了,用它就是帮我们节省大把时间,快速搞定初稿,稳稳顺利毕业。 但别一上来就无脑,让他整全书容易翻车。让他根据给出的文献,结合题目帮我梳理文章三级大纲,不管是逻辑调理还是整体框架,都挑不出毛病, 而且还能按专科、本科、硕博不同时历定制对应难度的大纲。你以为梳理完大纲就要自己逐字手敲论文?那可太天真了!眼看交稿倒计时迫在眉睫,根本没精力 直接再把 deepsea 整理好的文献和大纲一并给到我们的老朋友自己手里。有调研数据、案例资料,直接往里补充就行。 导入表格、表格公式、代码这些也不用自己费劲画,点一下对应按钮就能完成。最后看效果,格式排版整整齐齐,内容逻辑也很顺畅,出稿直接就成型了。说实话,体验完这一套,先玩两把再说。

大部分人把 deepsafe 用错了, v 四版本综合能力现在重回国产第一,今天直接给你出 v 四保姆级教程,先带你看它现在到底强到什么程度。二 零二六年四月二十四号刚发布的 v 四系列,发布仅三天,第三方 super 四 lue 精准实测结果就直接炸场。 pro 版以七十点九八分登顶国产大模型综合榜第一, flash 版以六十八点八二分紧随其后拿下国产第二。 双版本直接包揽了国产榜单的前两名,把一众老牌大模型都甩在了身后。六大核心能力的硬核增幅直接给你摆明白。智能体任务规划能力 七十七点四九分,国产第一,比上一代暴涨二十点八七分,是这次升级最大的杀招,大白话讲就是他能自己拆解任务规划步骤,不用你一步步盯着叫。数学推理能力八十七点三九分,同样登顶国产第一, 硬核数理能力直接拉满,从小学算数到考研高数,没有他解不明白的题。幻觉控制。八十点六八分,国产第三, 仅次于 glm 五和千问三点五,意味着他瞎编乱造的概率极低,给你的答案靠谱度很高。科学推理七十九点二七分,国产第二,仅次于豆包专家模式,专业领域的内容拆解、逻辑推演,他都能精准拿捏代码生成。六十三点二四分,国产第三, 似于 kimi 二点五和豆包专家模式,稳居开源模型里的代码能力第一梯队,开发者和普通职场人都能用精确指令遵循。 三十七点八四分,国产第三,比上一代暴涨十一点八九分,从之前的国产垫底,直接冲进第一梯队,你让他干什么,他就严格按你的要求来,不会跑偏,不会露相,实现了全维度无短板。那这么强的能力, 为什么你用着总觉得不好用?核心原因只有一个,你从跟上就把它的两个模式用反了。很多人用了一年 deepsea, 根本没搞懂哪个模式适合干什么,回头还骂他能力不行,这完全是把屠龙刀拿来切菜了。快速模式运行的是 v 四 flash 版本,主打响应快、成本低,全功能免费无门槛。它适配日常闲聊、简单提问、清亮文本处理、基础信息查询, 用它完全够用。但你要是拿它解高数,做复杂报告、写代码,那肯定会觉得它能力不行,这不是它的问题,是你用错了场景。而专家模式运行的是 v 四 pro 版本,是这次升级的核心杀招。佛有登顶榜单的硬核能力, 全在这个模式里,这才是你真正应该学会使用的方法。下面这三大专属用法,普通人直接照着用,效率拉满十倍。第一个,用它做全场景数学问题解答,学生党,职场人刚需中的刚需。他有着国产第一的数学推理能力, 不管是中小学数理化作业公式推导、大学高数微积分考研考公的数量关系题,还是职场人需要的数据分析、财务核算,他都能精准搞定。他不仅能给你标准答案, 还会拆解每一步解析思路,标注易错点,讲透底层逻辑,甚至给你同类型题的通用解析技巧,比网课老师讲的还细致。给你一个直接就能用的指令模板,我需要你讲解这道题,先给出标准答案, 再一步步拆解解析步骤,标注核心考点和易错点。最后给我三道同类型的练习题,附带答案和解析,直接复制粘贴就能用。第二个,用它的科学推理能力做内容校准, 做自媒体写报告的人,靠它彻底避免翻车。不管是视频内容的技术参数核对、 ai 测评、数据校准, 还是行业报告的深度拆解、数据交叉验证,又或是科普内容的真实性核实,独家细节挖掘,他都能精准排查数据错误,核实内容真实性,挖出同行没注意到的信息差,直接把文案丢给他,说帮我核对这篇文案里的所有数据 错误,给出正确数据和权威来源补充三个差异化独家细节,直接优化出有干货、有爆点的文案。最后给你一个高级玩法,用它的顶级智能体能力搭建你的专属数字员工。很多人到现在都不知道智能体到底是什么, 说白了,他就是把 ai 从你让他干什么他才干什么的被动工具,变成了你告诉他要什么结果他自己想办法干完的 主动执行者。之前你用 ai 做报告,得一步步给指令盯着改,随时纠错,前前后后要折腾十几轮。现在用 deepsea v 四的智能体能力,你只需要定一个最终目标,它会自己拆解任务 规划步骤,调用工具自主纠错,最后直接给你交付成品,全程不用你定 deepsea v 四在闲聊、语音交互、创意文案商品选择上,不如豆包千问顺手。本地部署对新手也有门槛,所以选对场景是你最应该注意的。 最后问你两个问题,你已经用上 deepsea v 四了吗?最让你惊艳的是哪个能力?评论区告诉我!收藏转发这条保姆级教程,下期带你解锁更多 ai 提效的隐藏玩法!

家人们科技圈炸了!四月二十四日, deep seek 憋了一年半的大招终于放出来了,旗下新一代模型 deep seek v 四预览版正式上线,一出场直接封神。他们造出了一个跟美国顶尖水平旗鼓相当的 ai 大 脑, 最关键的是,这个大脑跑的是咱们中国自己的芯片,完全没靠美国货。可以说,这不只是一次普通的版本更新,而是在释放一个信号,那就是中国大模型竞争变了。 那么,这次 deepsea v 四到底有哪些不一样?核心优势是什么?以下划分四个重点,带你快速解读。第一,不是一个模型,是两条路线。这次 deepsea v 四一口气推了两个版本, pro 版和 flash 版 啥意思呢?打个比方, pro 版就像一名顾问,专门处理复杂分析,写代码、做文档。而 flash 版像是一名助理,跑得快,成本低,适合批量处理日常事务。也就是说, deepsea v 四把能力分了层,企业可以按需求选择解决了。以前的问题就是强的太贵,便宜的又不够用。 第二个,一百万 token 是 什么概念?这次 v 四支持一百万 token 的 上下文,简单讲就是模型一次能看更长的内容了。一百万 token 相当于一本七八百页厚的书,也就是你把九十万字的三体一口气扔给他,他从头读到尾,帮你分析细节,绝不断篇。 对企业来说意义重大,因为真正的业务不是聊聊天,而是要处理大量的报告、合同、知库。第三,模型开始干活,不只是聊天。以前大家说 ai 想的是帮我写个文章,帮我翻译一下。现在 deepsea v 四强化的是 agent 能力, 也就是让模型自己拆解任务、调用工具、写代码、查资料,把事情从头到尾办完。经评测显示, v 四 pro 在 代码和自动化任务上已经接近部分顶级闭源模型的水平,内部体验上甚至被认为优于 anthropic、 the cloud sonnet, 当然,和最顶级的思考模式模型相比还有差 距。第四,价格信号面向商业化。 flash 版的定价非常激进,适合高频、低成本的企业调用, pro 版价格更高,但对应的是更强的能力。这种分层定价的方式其实是在告诉市场, deepsea 已经想清楚了商业化怎么走。另外值得一提的是, v 四的 api 同时支持 openai 和 antropic 两种接入格式,意味着开发者迁移成本极低,接过来就能用。 总的来说, deepsea v 四这次发布的意义已经从从会做题转向能办事的阶段。它清晰地划出了一条线,大模型从实验室走向生产力工具。下一轮 ai 竞争比的是谁能真正帮企业把活干好, 谁能让模型稳定、便宜、大规模地完成真实业务,谁才有机会赢下接下来的 ai 应用市场。当然,这还是预览版,后续的稳定性、延迟成本能不能经得住大规模调用的考验,还需要持续观察。 总之, deepsea v 四传递了一个非常明确的信号,技术封锁未必能限制发展,反而可能会逼出一个更强大的系统,中国 ai 正在进入真正属于自己的时代。

本期视频分享 obfuscate 加 cryptic v 四来搭建 obfuscate 加 ai 的 本地之库。而在上期视频介绍了将 cryptic v 四接入 cryptic 的 详细步骤,那这期视频我们把这套组合打包放进 obfuscate 中,让 ai 完成内容总结完、赚写等工作, 并且还可以让它画出我屏幕上展示的这些手绘风格的画板。视频内容主要分为四个部分,第一,安装 colorcode 和购买 deepsafe api 并完成配置。第二,介绍两款 obsidian 插件,能够实现 ai 接入。第三,演示 ai 加 obsidian webclip 来获取网页内容并总结。 第四,来安装 external 和 skill, 一 键完成白板的画布绘制。第一步,安装 cloud code 和购买 deepsafe api。 在 我的上一期视频有非常完整的介绍,你可以直接去看上一期视频, 不过在这里我可以快速的过一下。首先,到 cloud code 项目官网复制你电脑类型的一键安装指令,支持 microsoft linux, windows windows 用户需要安装一下 get, 直接到 get 的 官网下载安装包安装即可。 第二步,打开电脑终端应用,粘贴命令执行,执行完毕之后你就可以使用 colocode, 可以 通过 colocode 命令启动它,但是它还需要接入第三方的 api 模型。 第三步,我们来安装一个 cc switch 的 开源工具,它可以帮你把第三方的大模型接入 colocode。 在 项目的首页有下载安装包的地址,找到对应的安装包下载安装。 第四步,到 deepsea api 官网购买十块钱额度的 api, 然后创建一个 api k, 点击复制。最后打开 cc switch 这个软件,点击右上角的加号找到 deepsea 供应商,下滑粘贴 api k 模型,这里复制我填写的模型名称,点击保存,然后点击测试模型按钮,显示运行正常,之后点击使用就可以了,然后在终端应用输入可导的 code 了。 视频第二部分介绍两款 obsidian 插件,都能够实现调用 ai 的 功能,分别是 terminal 和 cloud 点,根据个人的需求来选择。先来介绍 terminal, 它可以在 obsidian 内部直接打开一个终端窗口来执行命令行的操作,比如调用 cloud code, 而且不离开 obsidian, 我 们直接在第三方的插件市场搜索这个名称安装即可。安装好之后,左侧会出现 open terminal 这个 logo, 点击一下 就会有三种使用方式可以选择,这三种模式对应三种不同的场景。外部模式它是在 obsit 之外启动一个终端应用,所以会脱离 obsit 的 环境,所以不太需要。 整合式,它是在 obsit 内部启动一个终端应用,所以推荐使用这个第三种。开发者控制台主要是给开发者调试插件使用,所以也不推荐。 我们在这里点击整合式,右侧的侧边栏就会出现一个终端程序,这个终端所在文件夹的位置就是当前知识库的位置,输 入 code 的 指令就能够直接调用 code。 比如我提问统计一下当前知识库一共有多少文章,多少个字,那它在侧边栏就会执行任务指令,如果需要权限许可的话,也会提醒 它可以在这里阅读文章内容,写文案,安装 skill 等等。操作和终端的使用体验是一样的,区别就是不需要额外单独的开一个终端窗口。 另一个插件是 cloud 点,在我准备视频的时候,它还没有上线第三方插件市场,但现在好像已经上架了,可以直接在这里安装。如果你搜索不到,这里也介绍另一种安装方式。我们直接打开 cloud 点的 github 仓库, 点击 release, 来到发布页面,需要下载这三个文件,分别是 g s, jason 和 c s s。 然后回到 obc 点第三方插件这里,点击打开插件文件夹,那这里呢?都是你在 obc 点中安装的插件,在这里新建一个文件夹,名称就叫做 ko 点。比如我这个, 直接把刚刚那三个文件都移动过来,然后重启一下 ko 点,在第三方插件里启动 ko 点, 左侧应该会有一个 open cloudian 的 图标,点击一下,右侧就会出现 cloudian 的 对话框,不需要进行任何的设置,只要本地安装了 cloud code 就 可以使用。我这里已经有了一些历史对话,它的界面相比于 terminal 是 比较美观的,对话时会默认选中当前正在看的 microsoft 文件。 右下角有三个按钮,分别是开启新的 type 页面、开启新对话以及查看历史的对话。我推荐使用考点,它比特米诺的适配度更高,也更方便。 cloud code 在 每一个工作的项目文件夹都会有一个 cloud 点 markdown 文件,用来指导 ai 如何在这个项目里面工作。一个完整的 cloud 点 md 文件可能需要包含这些内容,但这个是给开发用的,个人简单使用的话,只需要制定规范,明确输出要求和输出格式就行了, 不需要写得很复杂。我的 cloud 点 macdunk 里面就包括了简单的仓位定位、目录结构、输出规范等等。因为我可能会获取到一些英文的内容,所以会有翻译的规范。每个人的 cloud 点 md 根据个人的需求来不断修改。 在看一些扑克网站的时候,可以通过官方的 obsidian webcliff 这个拓展插件来将网页的内容保存成 macdunk 格式,并存储在 obsidian 中,并且是保留了章节的信息、配图等主要内容。 我之前的视频里会用到一个白板工具,用来展示整个视频的章节信息或者某个功能对比。 这个白板叫做 excel, 是 一个主打手绘风格的在线白板,它有单独的网页版,但是在 opc 店里面也是可以使用的,并且我觉得在 opc 店里面可能会更加方便,因为可以直接使用 ai 来生成内容。 我们首先需要安装一个 offset 插件,名称就叫做 extracutor。 然后我们可以在文件里面新建一个白板,在这里面进行内容的编排,可以直接插入图片或者输出这种手绘风格的文字。 但是想要让 ai 帮我们直接生成的话,就需要安装一个 skill。 我 安装了这个 skill 叫做 extracutor diagram, 安装方式也非常简单,直接复制这个 skill 的 仓库地址给到 cloud code, 然后说请帮我安装这个 skill 就 可以了。 安装好之后可以通过斜杠命令来险性的调用这个 skill, 比如让它把以下内容生成一个画布,具 体的内容是我刚刚从网页上获取到的,是关于 deepsea v 四的任务表现情况,那等待一会,它就会生成一个内容,一个简单的 deepsea v 四使用场景分析就做好了,如果需要修改的话,直接在这里编辑就可以了。 在之前的一期分享 obsidian 获取视频内容的教程里,有人让我分享我的 cloud 点 macdunk 文件,我会把我的配置保存成一个在线文档,包含这期视频提及到的所有内容, 一键三连,然后私信我, obsidian 自动获取。 ok, 那 以上就是本期视频的全部内容了,我们下期再见!拜拜!

deep seek v 四出来了,这次他引的文献居然是真的,不是瞎编的!于是你瞬间觉得自己又站起来了。导师催稿也不慌不忙,慢慢悠悠地拖,等到点了,你哐哐一顿输出,想让 v 四给你撸一篇完整的出稿。 结果倒好了,文献是稳住了,但里面那些 ai 到极致的段落连自己都看不下去。尤其是最近维普和格子达一个接一个优化升级, ai 率想要控制在合格范围内更是难上加难。 不过今天先来看看一篇优秀工整且 ai 率在合格线的范文是怎样的。不仅格式规范,排版工整,还有表格公式和图标。想要完成这样一篇出稿,其实没有你想的那么难, 先自己去织网,敲上关键词,时间范围收窄,到最近五年,挑十来篇顺眼的导出复制,存好别丢,然后让 v 四给你打下手,你就把文件和题目丢过去,让他帮你理理思路,搭个骨架,你只管复制保存。 最后把这些资料全都打包放进, ok, 毕业文献塞进去,大纲传回去,右边再把图标一勾,公式一塞,论文立马显得又扎实又像样。前前后后不到半小时,一篇格式好看,结构稳当,内容实在, ai 痕迹压得低低的,出稿就这么出来了。

朋友们,他来了,那个让整个硅谷恨之入骨的中国 ai 公司在沉默了整整十五个月之后,终于放出了大招,四月二十四号啊, deepsea 微四 pro 没有任何的预告,直接炸场。还记得去年二一发布那天吗?因为他股价一天蒸发了六千亿美元。那一波啊,全世界叫他 deepsea 时刻,那一次呢?他要改写的是整个 ai 产业的游戏规则。 先说大家最关心的问题,这个 v 四 pro 到底强在哪?一句话概括,它用只有别人七分之一甚至十分之一的成本,做到了和美国最顶尖模型平起平坐的水平,牛不牛? 具体啥概念啊? v 四 pro 总参数量达到了一点六万亿,用的是自家的混合专家架构,每次推理呢,只激活必要的那部分参数。再说数据呢,编程能力上, v 四 pro 直接超过了 g p t 和谷歌的大模型 agent。 编码评测上呢, v 四 pro 拿到了当下所有开源模型里的最高分。 那世界支持层面呢?大幅领先所有的开源模型,仅次于谷歌的大模型。数学竞赛的推理任务呢? v 四 pro 已经超越了所有公开评测过的开源模型,真正挤进了全球第一梯队。 还有件事特别的关键,这次呢, v 四 pro 全系标配百万 tokin 的 超长上下文,直接把百万字级别的处理能力变成了标配。啥意思? 那么厚的一本红楼梦,也就是九十多万字,一整本长篇小说,一整套代码仓库一次性喂进去,它都能给你处理的明明白白。还有问题来了,既然这么强,它跟美国最顶尖的模型比,到底还有多大差距? g p c 可自己说的非常坦诚啊,他们公开承认, v 四 pro 的 某些方面表现呢,小幅超越了 g p t 的 五点二和谷歌的大模型,但整体仍然是落后于 g p t 五点四的模型的大模型,差距大概就是在三到六个月。 但是我们要明白, deepsea 用的芯片是被限制出口的,而且呢,训练成本呢,是国际顶尖大模型的几分之一,但结果呢,追到了只差三到六个月,这哪是差距啊,这简直就是骄傲!而且最狠的是,什么?是定价!听好了, v 四 pro 每百万输入 token 呢,只要一点七四美元,输出呢,只要三点四八美元。 g p t 五点五是多少呢? 输入要五美元,输出要三十美元,完成同一项任务用 gpt, 可 v 四的成本只有 gpt 五点五的百分之十五,就连一项以实惠著称的谷歌的大模型在它面前都显得很贵。 甚至是最近它们呢还宣布了更激进的降价,输入缓存命中的价格呢,直接降到原来的十分之一。 你以为故事到这就完了吗?真正的猛料还在后面呢。 v 四 pro 这次最让人震撼的不是性能,而是另一个石破天惊的举动,它用的是华为生成的国产芯片。跑起来的朋友们,这才是真正的 deepsea 时代的二点零版。 b 四 pro 呢,把整套系统从之前深度依赖的英伟达生产,整体迁移到了华为生存的架构上,这可不是换一个驱动那么简单,万亿参数的模型,底层的代码调度的逻辑工程体系,全部要重写一遍。 那有人就要问了,那升腾芯片的性能不是还不如英伟达吗?没错啊,但是 deepsea 自己也说了,虽然目前 pro 的 服务吞吐还比较有限,但等今年下半年华为升腾超节点芯片批量上市之后, v 四 pro 的 价格还会大幅下调。 因为他 ceo 黄仁勋自己都坐不住了。他在一次深度访谈里原话说,如果 gpt 可与华为生成芯片深度绑定,并实现规模化落地,这对美国来说将是灾难性的。 这背后则是一个更深层的东西,硅谷在造墙,中国呢,在修路。你看硅谷那边, oppo、 ai、 谷歌全是闭源阵营,模型呢?越做越封闭, 发布节奏呢?完全变成了互相掐架。在中国这边呢, tiffany 微四用的是什么?是开源协议,任何人都可以自由下载和修改。 发布当天就登上了开源模型第一名,紧随其后的第二名是谁呢?是 kimi k 二点六?还是咱们中国科技公司的大模型?两家万亿参数的大模型,前脚后脚发布,不但没有互撕,反而在技术底层上互相协同与引进。这种模式正在形成一个极大可怕的飞轮效应, 开源吸引全球开发者共同迭代优化。然后呢,模型能力快速提升,然后更多企业基于它做商业应用?然后国产芯片的生态越来越完善, 美国想靠芯片封锁来遏制中国 ai 的 发展,结果呢,中国反而走出了一个用国产算力跑国产模型的独立闭环。 那这对产业意味着什么?我告诉你,是一场底层逻辑的颠覆。以前整个 ai 行业呢,信奉的是大力出奇迹,堆更多的 gpu, 花更多的钱,烧更贵的算力。但 deep seek 从 r 一 开始呢,就在干一件事,证明花小钱也能办大事。 现在 v 四 pro 啊,更进一步证明呢,用中国自己的芯片也能办世界级的大事。那带来的连锁反应是什么?第一呢,是 ai 的 门槛被踩碎了,中小企业和创业者以后不用再遥望硅谷那些天价的 api 了, 全世界开发者的热情被彻底的点燃,一个开源、开放、低成本、高效率的中国 ai 生态正在加速生成。 第二呢,是道比特算力产业链的全面爆发。 v 四强不强?强,但它对算力的消耗也大啊,尤其是推理团的 tolkien, 消耗啊,就在指数级增长,模型越强,普及越快,整个产业链上的 ai 芯片、服务器、数据中心,光模块的需求就越大。 第三呢,是商业化的天花板被打开了,第一次的 agent 能力大幅提升,能干的活更多了,智能客服、金融风控、工业研发、药物分子筛选、落地场景一个接一个的被解锁。 讲完了产业逻辑,很多做投资的朋友最关心的一定是资本市场上哪些赛道会真正的受益。首先我要先说一句大实话, a 股上几乎没有任何一家公司是直接控股 deepsea 的, 那些所谓的参股概念,大部分已经被辟谣了。比如说什么华金资本、每日互动、浙江东方都曾发布公告,明确否认存在的股权投资关系。 目前唯一比较确定的间接关联是智联互联啊,通过其持有的基金份额,据说间接持有了 deepsea 的 百分之三点三的权益。但这件事本身也存在不确定性,最真正的机会不在概念炒作。而在产业逻辑上,第一个确定性的最高的主线是华为升腾产业链, deepsea 微四适配华为升腾下半年呢,升腾九五零芯片上市之后,国产芯片势必迎来一播放量, 相关的服务器整机厂商、算力租赁平台以及为升腾生态做配套的软件企业都有望直接受益。 华泰证券的计算机团队也明确的指出,今年国产卡的能力大幅提升与规模化应用可以期待,建议关注升腾链与超节点的主升浪机会。第二呢,是半导体先进、封装技术先进的龙头企业。 第三呢,是算力基础设施,包括 ai 服务器、光模块、数据中心、液冷等领域,因为这是为大模型 ai 训练和推理提供水电煤的。第四呢,是应用层的机会, tiffany 开放生态之后呢,原本煤炭资源大模型的中小企业,现在呢,都能用上一流的模型了。 像办公软件、金融余情、教育辅导这些垂直场景,接入 deepsea 的 能力后,产品体验会明显提升。最后总结一句, deepsea v 四 pro 的 意义远不只是一个模型跑分高了那么几个点, 它的真正价值在于,它证明了脱离硅谷的芯片生态。面对持续的技术封锁,中国 ai 仍然有能力杀尽世界最前沿,并且走出一条截然不同的路, 这条路叫做开源携同,降本增效。用国产算力跑国产模型,它不一定是最快的路,但一定是最踏实的路。就像 deepseaik 官方在发布时说的那句话, 不幼于玉,不孔于匪,率道而行,端然正己,不靠炒作,不追风口,认真做技术,踏实走自己的路,这才是一家硬核科技公司该有的样子。 至于大 a 的 机会,记住一句话,跟着产业链走,别跟着概念走。真正吃到肉的,永远是那些在这个生态里扮演关键角色,有真实技术壁垒的公司,而不是那些蹭概念草预期的标的。

为什么建议用 deepsea 微四降 ai? 因为它是真的牛,今天带你们实操展示下。 首先来到 deepsea, 这里一定要勾选专家模式,不然还是之前的老模型。然后把深度思考打开,智能搜索关闭,先让它给咱生成一段内容出来, 生成完了去跑一下原始 ai 率,可以看出来是非常高的。然后进入降 ai 环节,我们先开一个新的对话窗口, 这里一定要切到专家模式,把这段特别好用的降 ai 指令发给他,等他领会了改写要求之后,再把刚才生成的内容发过去,稍微等一下就有了。 然后拿改写后的内容再去测一趟, ai 率明显已经降下来了。咱们这套降 ai 指令加上 deep seek 的 专家模式,效果确实不错,但同时也存在几个问题,这种方法很容易改变文章的原意,导致文章过于口语化,而且降 ai 也不是很稳定, 有时候能给你降到个位数,有时候 ai 率怎么都降不下来,这时候你可以把文章丢到这里面,它可以在不改变原意的基础上做到这种效果,你就学吧。

就在今天, deepsea 在 毫无征兆的情况下发布了 deepsea v 四全系产品啊,包括一点六万亿参数的 deepsea v 四 pro 和两千八百四十亿参数的 v 四 flash 啊,并且支持百万 talk 的 上下文。 那当然,这个在现在的大模型当中是一个标配了,相当于呢,可以一次性把红楼梦喂给它,它能瞬间理解其中的内容。 我本身呢,不是一个 ai 资讯类的博主,但今天没忍住啊,想唠叨几句,那我读了 deepsea 微四的技术文档,当然由于我本身不是搞算法出身的啊,所以对于里面的算法细节呢,我们就略过了。 这个文档我觉得可以回答大家啊,也包括我自己啊,以下几个问题。首先第一个问题, deepsea 微四到底强在哪里啊? 第一点,六万亿三点一 pro 以及 cloud 十点六在同一级别。 第二,使用混合注意力架构,也就是 csa 加 hca 的 架构。在百万托管下, pro 的 推理 f l o p s 仅为 v 三点二的百分之二十七, k v 缓存仅为 v 三点二的百分之十。 那这里的 flops 呢,表示浮点数计算。简单来讲,在生成同一个字母时, v 四消耗的算力只有 v 三点二的四分之一。那另外 v 四还进行了工程优化,比如自研的 mega moe 内核,推理速度提升了一点五到一点九六倍。 那自研的特定领域的编程语言 telethon 可以 降低调用开销,保证数值可付现易购。 k v 缓存管理,支持磁盘缓存与共享前缀附用,可以适配百万托管的上下文。 那总结下来呢,就是在推理速度比 v 三点二更快的前提下,准确度还提高了。那第二个问题呢,就是和国际上其他大模型相比, deepsea 微四 pro max 在 支持推理上下文智能体任务方面呢, 已经全面超越啊现在这一代的开源模型。那第二在简单问题的基础测试上大幅领先开源模型,已经逼近 gemino 三点一 pro。 那 第三在数学代码竞赛上呢,表现媲美 g p t 五点四以及 gemino 三点一 pro。 那 第四 上下文百万托肯场景下呢? m r c r k pi 性能超越 gemino 三点一 pro, 仅次卡洛的 opus 四点六。那最后一个问题, 相信也是大家最关心的,就是 deepsea v 四到底有没有完全实现芯片国产化,那这个呢,在技术文档中没有明确的说明啊,但是一定是做了相当的适配的。呃,我们在文档中可以找到一些线索,比如在 p 十六中有一句话, we invented the fan grade ap scheme on both nvidia gpus and the huawei ascended npu's platforms 明确表示呢,不绑定 qda 架构,并且同时支持 qda 和华为升腾的 npu 芯片。那再比如,在 p 十九中对 f p 四的说明,原文中结论是 f p 四可以让内存与计算大幅下降,在未来呢,硬件理论上可以再提速三分之一。 那这只差点名升腾九五零等国产的 n p u 芯片了。那再比如,在 p 十三中针对混合注意力架构的说明,那也就是 c s a 加 h c a 这种架构天生呢就是为小显存设计的, 目前国产芯片的显存和待宽呢,还是主要的瓶颈,这相当于从架构上进行了匹配。那最后呢,还给出了硬件匹配的建议啊,那原文呢,给硬件厂商四条明确的建议,每条都是国产芯片可直接对齐的点。那首先,第一,优先平衡计算通信比,而非盲目的对待宽。 第二,留足工号预算。第三,降低跨芯片通知延迟。第四,简化激活函数。那 deepsea 到底有没有完全使用国产芯片呢?那我觉得应该是没有的,目前主要应该还是使用的英伟达的芯片。 完全国产化应该还是需要一个过程,目前国产芯片不管是在能耗还是在性能上,都还需要一定的时间解决。但很明显啊,从 deepsea 微四的技术文档中我们可以看出,不管是软件还是硬件, 已经不太可能被卡脖子了。那总结下来呢, deepsea v 四依然是主流模型中的第一梯队,但相比国外模型依然还有一些差距,但这些差距啊,可能又会招来一堆人的吴老黑,但从 deepsea v 四所做的工作来看,未来已经很明朗了。首先,从架构上深度适配国产芯片的不足。 其次,从技术文档中我们可以看出, deepsea 在 研发上是下了功夫的,那比如啊,自研的 teleon, mega moe 等,在纯工程上已经可以和国外的厂商掰掰手腕了。 那最后,它完全适配了国产芯片,实现了完全自主化,完全不用担心卡脖子的问题了,这会给国产芯片争取非常宝贵的时间。那相信啊,随着时间的推移,时间线不断拉长, 当我们从未来的某个时间点再回过头来看,这也许便是改变整个 ai 格局的一个关键点。

deepsea 终于是有一百万的上下文了,有朋友说,我也不用他写小说那么长上下文跟我有什么关系?还真有关系,首先大模型他没有记忆啊。有朋友说,那我用豆包有记忆啊,我说什么他都能记住啊, 那个豆包呢,他其实不是大模型,咱们用的豆包是一个应用程序,它的底层呢是豆包大模型,那他是这么工作的, 就你跟那个豆包说了一堆东西之后,然后他会把所有的历史聊天记录一起发给大模型, 然后大模型一看说,啊,你们历史聊了这么多东西啊啊,然后他给你回复消息,这样的话,他看上去就有记忆了,但其实不是大模型有记忆,大模型只不过是接收到了所有的历史聊天记录,才看上去让 你和豆包的聊天有记忆,他是这么做的。那有朋友说了,我跟豆包聊了那么多东西,他是把所有的东西全都一起发给豆包大模型吗?那是不是东西也太多了呢? 那肯定是不能这么发啊。早期的话,这个聊天机器人他这么做的啊,就是只记录最近几次聊天内容,比如记录十次, 那你第一次聊完到第十次,他都能记住,你聊第十一次的时候呢,他就把第一次给删掉啊,所以他只记录十次的内容,这样就不会内容太多。但这里缺陷就出来了,那你第一次聊的内容,比如说你跟他说我今年多大,我想干什么,这个信息是很重要的, 那如果这个大模型不知道这个信息的话,他回复的东西可能就跑偏了。所以呢,这个记忆的方式就进行了一定优化,比如他可以把一些重要的内容给提取出来 啊,假如你说了你的姓名、年龄、职业、发展方向,还有聊天的时候你遇到的什么问题,他把这些东西全都给你提取到一个地方,然后再给大模型发的时候,大模型就能拿到这些关键信息,他再给你回复内容的时候,就会围绕这些关键信息来回答,他看上去的话,就会有一个很长期的记忆, 后来又发展一些,比如说你可以把这些重要的信息存在本地。假如你使用这个 reg 啊,用这个限量数据库来存储一些重要信息, 或者用 skill 啊,你可以把这些重要的信息存储到文档中啊,然后用 skill 去解锁。总之就是让这个 ai 呢,它有长期记忆、短期记忆,但是不管有什么记忆,大家也会发现一个问题,这个大模型它是没有记忆的, 所有记忆都是基于这个应用程序,怎么去总结你的历史聊天内容,然后把这些东西汇总,提取重要信息,再发给大模型。大模型呢,接收到这些信息再给你回复,他都是这么做的, 那也就是说这个大模型他能记住多少东西,完全取决于他的上下文长度。这就是说为什么 d、 p、 c 和 v 四他有了一百万头根的上下文的价值很大。因为以前的话,你可能跟他聊天的时候很多,聊着聊着,就算他总结他也记不住了。但是现在有了一百万头根的话, 你可以聊很多很多内容,它也可以记住更多的关键信息,这就是一百万 token 的 价值,所以说这个一百万 token 不是 说非得用它来 读小说呀,生成小说呀,它能记住那么长的内容啊,就是每一个人用大模型,它有了更长的上下文的话,它都能记住更多重要的信息,才能给你回复更有价值的内容。

前几天外网呢,流传了这么一个搞笑视频啊,是英伟达的这个黄仁勋在上一个播客访谈节目的时候,直接动手和主持人打起来了, 虽然这是个 ai 视频,但他的确上了那个节目,而且当时的确很生气,因为当时的那个主持人呢,他有意的挑动黄仁勋,他坚持着一种典型的美式霸权思维,他认为美国不应该向中国出售算力芯片啊,用来类比的是,就好像美国不能把浓缩又卖给伊朗造核武器一样。 黄仁勋呢,强烈反对这种想法,他觉得只要中国的 ai 依旧跑在美国的硬件上,那就不是什么坏事啊,因为他可以卖东西嘛,因为这样的话,中国没有那么快突破啊,相反,你卡中国脖子就是逼中国自己搞研发,一旦中国研发跟上来了, ai 跑在中国自主研发的硬件上了, 那才是真正的灾难,真正该担心的。 and the day that deep seek comes out on huawei first that is a horrible outcome for our nation。 没想到啊,刚过了两个礼拜,他担心的这个灾难就真的发生了。 周五 deep seek v 四发布啊,单看这个模型能力呢, v 四并不是最牛的,它只是在开源模型当中它是领先的,更强的闭源模型也不是没有相关的性能细节,很多技术博主都做了解读,但这款模型真正的价值其实体现在 三个方面,芯片适配、基础设施开放。还有最重要的关键,它便宜。咱们大白话解释一下,首先,国产芯片适配所有 ai 模型都离不开芯片的算力支撑,但芯片和模型之间的协调, 它不是一件水到渠成的事儿。以前国内每一款新的大模型发布都是要优先适配英伟达的,上线初期的版本就只能在英伟达的芯片上跑, 后续才会陆陆续续推出一些补丁版本,勉强的去适配国产算力卡。但这次 deepsea 在 模型研发阶段就深入地融入了华为升腾,实现了真正意义上的 原升级,深度适配可以毫无障碍地跑在升腾芯片上。以往呢,但凡有一些重大的模型发布,英伟达总是能 提前拿到测试版本啊,先测一下。可这一次,英伟达是全程没有拿到任何测试权限,因为根本就不在你的芯片上跑,那当然用不着让你来测了。这一幕恰恰就是黄仁勋所担心的, 因为高端的 ai 算力市场几乎被英伟达垄断了, ai 企业大部分都得去买他们家的芯片。英伟达呢,可以控制供给,并且拥有很强的定价权,一片芯片几万美金,市场只能接受。但现在 v 四凭借突出的性能,加上它还开源,势必会吸引全球的用户。 大家回想一下,二四年 deepsea 初代模型发布之前,欧洲、日韩这些国家在停滞不前,但 但是 deepsea 初代问世以后,很多国家瞬间就掏出了自己的 ai 战略,行业格局彻底被改写,这背后离不开 deepsea 对 开源模型的推动和引领。 如今这个性能更强、生态更完善的 v 四版本面世了,全球用户必然会跟进,那他们也就自然会选用与之深度适配的中国芯片。 不仅仅是动摇了英伟达在高端算力上的垄断,也打破了他的定价权,因为以往只有英伟达一个选择,当然价格他说了算。但现在有了华为,有了韩五 g 等国产算力, 以中国的制造业能力,把算力成本打下来,那就只是时间问题。如果英伟达还坚持高价,全球买家自然会转向性价比更高的中国方案,市场的定价权永远是掌握在那些成本最低、性价比最高的玩家手中。 其次呢,是基础设施的开放。举个例子,很多人用这个苹果手机,并不是因为它硬件多么强悍,而是因为所谓的苹果生态。 无数开发者基于苹果的 ios 系统进行了应用的开发,让苹果手机的用户有海量的可选用的软件,什么 iphone 啊, ipad 啊, mac, 电脑之间能够实现无缝的互联互通、文件共享,这种基于统一的底层操作系统所衍生出来的全场景便利, 就叫做生态价值。而 ios 系统就是苹果生态不可或缺的底层基础设施。同理, 华为也推出了鸿蒙的系统,单论这个功能和技术来说,鸿蒙也很强,但一直被诟病的、被非议的就是很多软件它不适配鸿蒙,所以很多人就不用, 这就是基础设施的重要性。黄仁勋当然也懂这个,他多次在公开场合强调说,英伟达的核心优势从来就不是那个芯片硬件,而是英伟达的扩大生态。这套生态系统包含操作系统、开发工具、编程语言等全链条的技术,形成了牢不可破的技术壁垒,牢牢绑定了全球的开发者。而现在, deepsea v 四彻底摆脱了扩大生态,并且把工具、技术框架和标准分享了出来,这就会吸引更多的开发者来一起用, 无疑就动摇了英伟达的根基。当然了,无论是这个新的标准还是生态迁移,这当中都有很高的成本,所以最后的最后决定性的因素就是它便宜。 deepsea 的 token 输出成本仅相当于海外同等主流模型的四十分之一到百分之一之间, 真正实现了叫又便宜又好用。便宜的根源就在于模型和国产算力芯片以及国产基础设施的全面融合。用实践证明,摆脱英伟达,扩大生态,不仅在技术上它是完全可行的, 在经济上、成本上它更是有吸引力的。以往你想说服一个企业放弃成熟的英伟达方案,转而用国产算力,企业都会陷入深深的犹豫和观望。但现在, 真金白银的利益摆在面前,再去推动企业进行生态迁移,搬家到国产算力平台,就有了足够的说服力。以后这套低成本、高效率、无政治附加条件的方案可以走向全球,完成生态的出海。以中国强大的制造业能力和供应链整合能力, 未来将 ai 算力打成白菜价绝非空谈,这才是真正意义上的算力平权。科技平权。中国的科技界有一个名词叫 deepseek 时刻。就像当年乔布斯发布 iphone 的 时候有 iphone 时刻一样,它是指 某一款技术和产品给整个行业带来颠覆性的转折和改革的那个时刻。二四年初代的 deepseek 模型发布,成为中国 ai 发展的重要里程, 那是属于我们的第一个 deepsea 时刻。十五个月以后, deepsea v 四再次创造了又一次的 deepsea 时刻,用自主技术打破了国外的垄断,用生态的重构 改写了 ai 的 产业格局。从技术封锁到生态突围,这次我们好像没有那么激动,因为我们已经习惯了中国的科技产品,一次次在封锁中 实现突围。想想过去的十五个月,有人说 deepsea 团队人才流失,有人说他们忙着圈钱去了,美国人说我们偷窃蒸馏,网友说他们跳票啊!说好的发布时间一推再推,面对着种种的质疑, deepsea 是 一个字的回应都没有。 而在 v 四发布的推文最后,团队写下了一句寻子的话,不幼于欲,不恐于匪,率道而行,端然正己,不为外界的赞誉所诱惑,不被恶意的诽谤所恐吓,沿着正确的道路坚定前行,叩首初心, 端正自身,这就是最好的回应,也是中国科技应有的风骨和底气。约直播,咱们直播间接着聊!