粉丝978获赞1.2万


你是不是觉得 deep seek 不 如豆包好用?那是因为你用错了,天天拿 deep seek 当某度用,纯属暴舔天物,今天直接甩你六套 deep seek 高阶提问指令,让你秒变 deep seek 顶级玩家, 硬核干货来了,别愣着点赞收藏!一、知识百科类一、查询人物生品,比如把李白的底,就这么问李白一生踩过哪些大事件的节点。二、查询历史事件,比如问赤壁之战,直接怼赤壁之战哪年开打,对阵的是哪路神仙。 三、查询地理知识,比如问最长河流就得怎么捞,世界上最长的河是哪条鎏金的国家都有哪些狠角色? 四、查询科学知识,比如问地球自转简单粗暴,地球自转一圈得耗多长时间?二、创意写作类一、写故事,比如写友情故事,下指令以友情为核,整一篇八百字以上的作文给我支棱起来。 二、写诗歌,比如写爱情诗,直接要求以爱情为题,整一首八十行以上的现代诗,给我整点高级感。三、写散文,比如写自然散文指令的硬, 以自然为脉,整一篇六百字以上的课文,给我写出画面感。三、语言学习类一、翻译,比如中意音就这么来,把人生苦短及时行乐给我翻成英文,要地道。二、语法分析,比如西句子结构直接扔, but i love you because you are kind and beautiful 这个句子的语法骨架给我拆明白。三、词汇辨析,比如辨近一词就得较真,把 abandon 和 desert 这俩词的用法给我掰扯清楚。 四、学术研究类一、论文写作,比如写人工智能论文指令要狠,以人工智能为把性,整一篇三千字以上的毕业论文,给我整出深度。二、文献综述比如写教育心理学综述,要求的高, 以教育心理学为主题,整一篇五千字以上的文献综述,给我捋清脉络。三、课题申报书比如写心理健康教育申报书,就得专业, 以心理健康教育为方向,整一份八千字以上的课题申报书,给我整出可行性。五、职场工作类一、商业计划书比如写餐饮行业计划书,野心要大, 以餐饮行业为赛道,整一份一万字以上的商业计划书,给我整出盈利点。二、市场调研报告比如写电子产品调研报告,格局要开, 以电子产品市场为切口,整一份一万五千字以上的市场调研报告,给我整出趋势感。三、营销策划方案比如写化妆品营销方案,创意要足,以化妆品营销为战场,整一份两万字以上的营销策划方案,给我整出爆点。 六、生活娱乐类一、旅游攻略比如写三亚攻略,就得细致,以三亚为目的地,整一份三万字以上的旅游攻略,给我整出吃喝玩乐全套。二、美食推荐。比如推荐北京火锅店,就得实在, 给我推荐一家北京的火锅店,要地道,要巴适。三、电影评论,比如评星上映电影就得犀利,给我评论一部最近上映的电影。要观点,要态度,关注锦瑶,但解锁更多 ai 狠活!

想象一下,一个 ai 能在一秒钟之内读完整本红楼梦一百二十回, 同时记住每一个细节,每一段对话,每一个人物关系,然后它可以回答你关于任意章节的任何问题。这不是科幻小说,这是 deepsea 微四正在做到的事情。 一百万个 token 的 上下文窗口,相当于七百五十万个汉字,相当于一整座图书馆。今天,我们来彻底拆解这项技术。 deep sec v 四系列包含两个旗舰模型, deep sec v 四 pro 拥有一点六万亿参数,每次推理激活四百九十亿参数。 deepsea v 四 flash 拥有两千八百四十亿参数,激活一百三十亿参数。两个模型都原生支持一百万 token 的 超长上下文。更惊人的是效率。 在一百万 token 的 场景下, deepsea v 四 pro 的 推理计算量仅是 deepsea v 三二的百分之二十七, k v 缓存仅需百分之十。 这意味着什么?意味着同样的算力可以处理三点七倍更长的上下文。这背后是三项颠覆性的架构创新。要理解 deepsea v 四的意义,我们必须先理解它解决的根本问题。 transform 架构是当今所有大模型的基础,但它有一个致命的弱点,注意力机制的计算复杂度是序列长度的平方,上下文翻倍, 计算量变成四倍,上下文扩大到八倍,计算量是原来的六十四倍。在一百万透坑的情况下,朴素实现的计算量和显存占用大到根本无法落地。这就是所谓的长上下文效率危机,它像一堵无形的墙,阻挡着 ai 进入真正的长城推理时代, 无法分析完整的法律文书,无法处理整个代码库,无法进行跨文档的深度研究。 deep sec v 四用三把钥匙打开了这道门。 deep sec v 四的三项核心创新分别是,第一,流行约束超连接,简称 mhc。 它从根本上升级了 transformer 中的残差连接,让超身网络训练更加稳定。第二,混合注意力机制,结合压缩吸收注意力 c s a 和重度压缩注意力 h c a, 将 k v 缓存压缩到原来的百分之二,彻底破解长上下文的显存瓶颈。 第三,密网优化器用矩阵正交化替代传统的 item 方向,大幅提升训练收敛速度和稳定性。三项创新环环相扣,共同构成了百万投肯智能的技术基石。 接下来,我们逐一深入解析。第一项创新流行约束超连接 mhc。 我 们先从残差连接说起,在标准 transform 中,每个 block 的 输出会直接加到输入上, 这就是残差连接,它让梯度可以直接流过深层网络,解决了梯度消失问题。但当网络变得极深,比如 deepsea 这样数百层的模型,标准残差连接会出现信号漂移和数值不稳定的问题,滞约了。进一步扩展超连接。 hc 的 思路是,扩展残差流的宽度, 不是简单的加,而是通过三个先行变换输入映射残差映射输出映射来更灵活的控制信息流动,这带来了更强的表达能力,但也带来了一个新问题,训练时频繁出现数值爆炸。 mhc 的 关键突破是给残差映射矩阵加上一个数学约束,必须属于双随机矩阵的流行,也就是 burkoff 多面体双随机矩阵的每行每列之合都等于一,这保证了矩阵的普泛数不超过一, 从而使变换是非膨胀的信号既不会爆炸,也不会消失在实线上。 mhc 通过 synchop knop 算法将矩阵迭代的投影到这个流形上,迭代二十次即可收敛。这个看似简单的约束换来了整个训练过程的数值稳定性, 让 deep sec v 四得以训练数百个传感器而无需任何额外的稳定化技巧。第二项,创新的第一部分,压缩吸收注意力 csa 要理解 c s a, 我 们先要明白 kv 缓存是什么。在自回归生成时,每一步都需要访问所有历史 token 的 key 和 value 向量,这些就是 kv 缓存。在百万 token 场景下, kv 缓存会占用数十 gb 的 显存,成为最大的瓶颈。 c s c 的 核心思路分两步,第一步,压缩 c s c。 将每 m 个相邻 token 的 k v 向量压缩成一个压缩 k v 条目。具体实现时,对 m 个 token 的 k v 向量做加权求和权重,由一个可学习的 token 级压缩器动态生成。 压缩后缩列长度降低到原来的 m 分 之一。第二步,细数选择。即使压缩之后,如果缩列还是很长,全量注意力依然昂贵。 csa 引入了一个叫做 lightning index 闪电锁影器的模块,它对压缩后的 k v 条目进行快速平分,找出与当前查询最相关的 top k 条目,只对这 k 条目做完整的注意力计算。闪电锁影器本身也是用压缩后的锁影 k 来平分,计算量极小, 这样 cic 把注意力计算的规模从 n 降低到了 n, 除以 m 再取 k, 效率大幅提升。同时, cic 还保留了一个滑动窗口的未压缩 k v 条目,用来捕捉局部的细力度,依赖保证模型对最近几个 token 的 感知精度不下降。混合注意力的第二部分,重度压缩注意力 hca。 如果说 csa 是 聪明的压缩, hca 就是 激进的压缩。 hca 的 思路更简单粗暴,把更大范围的偷看 m 撇各 m 撇远大于 m, 压缩成一个 k v 条目,然后直接做全量的多查询注意力,不做稀疏选择。 hca 牺牲了一定的局部精度,但换来了极低的计算成本,因为压缩率高得多。在 deepsea 微四的实际配置中, csa 层和 hca 层交替排列。 粗略理解, h c a 负责低成本地补货全局信息, c s a 负责精准地补货关键局部信息, 两者形成互补,最终效果是什么?在一百万 token 的 设置下, deepsea v 四 pro 的 k v 缓存大小仅为以 b f 十六 g q a 八为基线的百分之二。 deepsea v 四 flash 更极端,仅为基线的百分之一点四。 这意味着原来需要五十 gb 显存的 k 位缓存,现在只需要不到一 gb。 这是十倍以上的效率跃升,让百万 token 推理在实际工程中真正变得可行。第三项创新,密用油化器为什么需要一个新的油化器? 我们知道大模型训练的核心是梯度下降,用损失函数对参数求梯度,然后沿梯度方向更新参数。 edm 是 目前最流行的油画器,它通过自适应学习率来处理不同参数的梯度尺度差异,但 edm 有 一个几何上的缺陷,它独立处理每个参数, 忽略了参数之间的相关性,也就是损失曲面的曲率信息。运用的思路来自矩阵正交化。 对于权重矩阵 w m u, 先用 nestrof 动量累积梯度,然后用 newtshoff 迭代对梯度矩阵进行正交化处理, 把更新方向变成正交矩阵 uv 的 转制乘积。 newtshoff 迭代的公式是, m k i 等于 am k 三加 b, m 开三 m 开三转制, m 开三加切 m 开三, m 开三转制的平方 m 一 经过十次迭代, 所有期一直都收敛到一,得到一个精确的正交矩阵。这个正交化的更新方向等价于在 remine 流行上进行梯度下降, 天然地与损失曲面的几何结构对齐,收敛更快,更稳定。实测中,使用 mu 的 deepsea v 四收敛速度更快,训练损失曲线更平滑,而且不需要 qk, clip 这类防止注意力分数爆炸的额外技巧,因为 mhc 的 rms norm 已经保证了数值稳定性。 三大架构创新之外, deepstack v 四还构建了一套世界级的训练和推理基础设施。第一, telig 定制内核。 deepstack 团队开发了 telig 一 种领域专属语言 dsl, 用于编写高度优化的 gpu 内核。 telig 的 关键能力是将计算、通信和显存访问融合进单个内核,消除了多个独立 kernel 之间的数据搬运开销。 第二, f p 四量化感知训练专家模型的路由参数使用 f p 四精度存储,相比 f p 八再次减半显存占用。 deepsea v 四将 f p 四集成到训练流程中,通过量化感知训练,保证了精度损失极小。 第三,细力度专家并行混合专家模型模拟的训练需要在多台机期间分发 token 到对应的专家,这涉及大量的 auto 通信。 deepsea v 四设计了一种细力度流水线方案, 将专家分批调度成多个 v 五,每个 v 五的通信和计算完全重叠,相比朴素,实现理论加速比高达一点九二倍。第四,分层 k v 缓存推理时的 k v 缓存分为 gpu、 显存、 cpu 内存和硬盘三层, 不同频率的缓存条目存储在不同层级,最大化了有效缓存容量,支持多用户共享长前缀,显著降低了服务成本。在架构和基础设施就绪之后, deepsea v 四进行了大规模的预训练。 deepsea v 四 flash 在 三十二万亿高质量 token 上训练。 deepsea v 四 pro 在 三十三万亿 token 上训练。数据构建方面, deepsea 团队对数据质量有极高要求,包含多语言、文本代码、数学、 科学、论文等多个领域,并通过多轮过滤去除低质量内容。训练稳定性方面, mhc 和 mon 的 结合从根本上解决了超深网络的数值不稳定问题,训练全程无需人工干预来处理 lossback 基础模型评估显示, deepsea v 四 pro base 在 几乎所有基础能力基础上都超越了 deepsea v 三二 base, 在 长上下文、代码、数学等核心领域建立了全面优势。预训练之后, deepsea v 四采用了一套精心设计的两阶段后训练流水线。第一阶段,专家模型独立培养。针对数学代码 agent 指令遵循四个核心领域分别训练独立的专家模型, 每个专家模型先在该领域的高质量数据上做监督,微调 sft 建立基础能力,然后用群体相对策略优化 g r p o 做强化学习,进一步提升领域内的峰值性能。 g r p o。 不 依赖单一奖励模型,而是用一组后选回答的相对质量来计算奖励,更稳定、更高效。 第二阶段,在线策略蒸馏 o p d。 把第一阶段训练好的四个专家模型作为教师训练一个统一的学生模型,同时学习所有领域的能力。蒸馏采用反向 k l 散度作为损失, 让学生模型的输出分布尽可能接近教师模型。这种方式避免了多任务微调式的能力相互干扰, 同时实现了能力的有机融合。最终得到的统一模型 deepsea v 四 pro 在 知识、推理、代码、 agent、 长上下文五大维度上全面达到甚至超越各自专家模型的水平,最终的性能成果令人印象深刻。 效率维度在一百万 token 的 推理场景中, deepsea v 四 pro 相比 deepsea v 三二单步推理, flops 降低到百分之二十七, kv 缓存降低到百分之十,分别实现了三点七倍和九点五倍的效率提升。 deepsea v 四 flash 更激进, flops 降至百分之七,效率提升近十倍。知识与推理维度 deepseek v 四 pro max 在 simple qa 的 广泛世界知识测试中显著领先所有开源模型, 在 hle 学术知识测试中以九十点三的成绩与 gpt 五点四并列第一,在 mmlu pro 上超越了大多数闭源竞争对手。代码与数学在 code forces 编程竞赛题上接近 gpt 五点四水平,在数学推理基础上超越了 gemini 三一 pro 长上下文能力。在一百万 token 的 合成和真实测试基上, deep sec v 四 pro max 超越了 gemini 三一 pro, 这在当前所有模型中处于顶级水平。 agent 的 能力在 stwebench、 代码修复、 terminalbench、 命令行操作等 agent, 基本上 deep sec v 四 pro max 接近 cloud ops 四点五的表现是所有开源模型中最强的。 这些成绩表明 deepsea v 四已经真正进入了第一梯队。让我们站得更高一点来看 deepsea v 四的深邃意义, 它证明了一件最重要的事,架构创新,而不是单纯的堆砌。算力是突破 ai 能力边界的关键路径。 mhc 让我们看到数学约束可以从根本上解决深度网络的稳定性问题。 混合注意力让我们看到压缩和稀疏的结合可以把百万 token 推理的成本降低到实际可用的水平。妙,让我们看到优化器的几何视角可以带来真实的收敛加速。这三项创新的组合 打开了一个新的可能性空间。更长的上下文,更深的推理链,更复杂的 agent 任务。百万 token 只是一个里程碑,而不是终点。 deepsea 团队在论文中明确指出,这项工作为在线学习、超长程推理、多文档深度研究等下一代 ai 范式砥定了基础。高校的长上下文智能不再是少数超级计算中心的专利,它正在走向每一个人。 deepsea v 四已经在这里。