今天我们来学习 deepsea 的 mo 机制, mo 一 的中文名呢,叫做混合专家。那专家是什么?它在哪里?它有什么作用? 其实专家呢,是对大元模型中前馈神经网络的拟人化称谓。我们先来回顾一下什么是前馈神经网络, 再来理解它为什么被称为专家。在 transfoam 中,乾坤神经网络的标准结构可以理解为两线一非,这两个限性变化层呢,加着一个非限性几乎函数,它的数学表达式如下。 需要特别注意的是,在 transfoam 架构中, ffm 的 输出呢,不是直接替换掉输入,而是通过长叉连接加回到输入的向量上,表达式如下, 这就意味着输入向量 x 就 像一个信息载体,而 f f n 的 作用是根据当前的内容计算出一个增量,并把它叠加到 x 上,这增量呢,就是专家的理解和支持。 比如某一个词手机,在苹果手机的语境下呢, f f n 会为其增加高端、拍照好等特征。若在廉价手机的语境下,则可能增加入门、性价比等不同的特征。所以这个公式呢,就触及到了专家的本质, 通过计算一个精确的知识增量,在保留原始信息的基础上,对当前表示进行智能化、语境化的微调,从而提升整体语义的表达的准确性和深度,这就是专家的作用。所以乾坤神经网络会被称为专家。 其实我们会发现,大元模型的推理过程呢,无非就是在重复问同一个终极问题,下一个脱轨到底是什么? 而 f f n 层为了回答这个问题,就用当前的状态加上专家的判断,得到了跟进后的预测。搞清楚了专家是什么,我们再来看看传统 transform 架构。由于每一层只有一个前馈神经网络, 它需要处理所有类型的输入,如同一个全能通才的专家,压力三大。而 m o e transform 架构中呢,每层包含了多个前缀,神经网络专家。每个专家呢,专注于特定领域,形成专家团队, 通过分工协助提升了整体能力。 deep sec v 三将专家分为两类,左侧是共享专家,每层固定数量。 deep sec 呢,目前设置的是每层一个。 这个专家呢,始终参与计算,负责处理通用基础的语域特征,确保模型的基础能力和稳定性。 而右侧呢,是路由专家,数量众多。目前 deepsea 每层呢,有二百五十六个动态选择性激活,每次激活其中的八个,约百分之三的激活率, 负责处理特定专业的语言模式。现在的问题是,面对这么多专家,我们应该如何选择? deepsea 在 这里引入了亲和度的概念,谁和我亲近,我就选择谁,谁更懂我,我就选谁。就像你遇到问题时,会本能地寻找最相关领域的专家一样。 模型也为每个输入计算它与所有专家的匹配得分。这是个很奇妙但又很自然的想法。问题是如何计算亲和度? deepsea v 三呢?给出的解决方案是,为每个路由专家定一个智星项链,你可以想象它是专家的能力。简介写着,我擅长处理名词,我擅长处理运动,或者我擅长处理颜色等。 当一个输入信息,比如代表苹果或者发动机的项链来,到时,它会快速浏览所有专家的这份简历,寻找专业最对口的那一位。 当然,以上呢,是拟人化的说法。实际上呢,至心向量的数学底层实现呢,就是一个高维向量,其维度呢,与模型的隐藏层维度相同,比如七千一百六十八维。亲和度的计算,就是用当前的输入向量和这个至心向量做点击计算, 点击后的结果执行 sigma 的 操作,得分越高,代表亲和度就越高。那你一定会很好奇,知心向量到底是如何得到的?一个最初完全随机的向量,是怎么一步步变成能代表专业领域的智能简历的? 我们可以想象这样一个动态的试错过程,假设一开始专家 a 的 知心向量是随机的, 当一个输入向量,比如代表苹果的向量过来,计算出的亲和度得分竟然很高,于是系统就选中了专家 a 来处理。但问题是,专家 a 因为专业不对口,给出的输出结果很差, 而是最终预测的错误很大,既损失函数的值很高。这时反向传播机制呢,就会发挥作用,它会给出一个明确的调整信号, 这次选错专家了,于是模型会轻微的调整专家 a 的 纸型向量的数值,让他在这个苹果向量的方向上稍微远离一些。这样的一来,下次再遇到类似苹果向量时,亲和度分数自然就降低了,专家 a 被选中的概率也会随之下降。 反过来说,如果这个专家反复被同一类输入选中,并且总能给出高质量的结果,也就是损失很小,那么他的执行向量就会不断的微调,越来越对准那类输入所在的方向。 正是这样海量动态的尝试反馈微调循环中,每个专家的智行向量从一片混沌的随机初始状态逐渐漂移沉淀,最终稳定的指向了一个高微空间中的特定方向,而这个方向就是模型自己学习到的,对该专家专业领域的数学刻画。 所以呢,智行向量不是被预先设定的,而是在训练中自己长出来的专业肖像。好了, 现在我们已经拿到了所有专家的亲和度成绩单,系统面临下一个决策,该翻谁的牌子,该 pick 谁。 选择方法呢,其实很粗暴,谁的得分高就选谁。模型还为这种方法取了个名字叫 top k, 也就是选择得分最高的前 k。 个 k 等于一,就选得分最高的那个 k 等于二,就选得分最高的前两个。 在 deepsea 微三中呢, k 被设置为八,这意味着每次只有 top 八的专家被激活参与工作。这种设计呢,保证了极高的计算效率,是 mo 模型实现稀疏激活的核心。 选秀结束了,专家就开始会诊。会诊结果呢,并不是直接相加,路由器会根据这些入选专家的专业匹配度,为他们分配不同的话语权。这个过程也叫做门控机制。 门控值呢,是将 topk 专家的原始亲和度分数 si 进行归一化后得到的。 最终的预测结果会是这样合成的,输出等于现有状态,加上权重一乘以专家一的诊断,加上权重二乘以专家二的诊断等等等等,依次类推。这就像一个专家会诊最权威、最对口的专家,他的诊断意见分量是最重的。 亲和度低的专家虽然也会在会场,但发言权较小。举个例子,如果只选了两位专家,他们的权重分别是零点五一五和零点四八五,那就意味着第一位专家的意见呢,比第二位专家的意见影响程度更高。 这样模型通过 topk 保证了效率,又通过门控权重实现了智慧的精细融合,而不是粗暴的平均。关于专家之间的负债均衡问题呢? deepsea v 三通过引入偏置实现了动态调节,这里我们就不赘述了,大家可以翻阅论文查看细节。 好了,让我们最终梳理一下 deepsea v 三的 m o e。 的 完整工作流程。首先,计算亲和度 s i t, 根据亲和度选出最相关的 topk 的 专家,通过 softmax 对 亲和度 s 进行归一化,得到门控值 g i t, 也就是专家权重。 专家独立处理信息,分别得到共享专家的输出和路由专家的输出,两者相加,再进行残差连接,得到最终输出。 总结为四句话,一、组建团队。二、独立分析。三、汇总意见。四、形成决意。以上就是 m o e。 背后的真相,感谢您的关注,我们下次再见!
粉丝4.6万获赞15.6万

炸了!今天 github 全球趋势榜第一就是这个 deep sync t u i, 一 天狂涨六千加 star 直接登顶!它是一款运行在终端里的原生编程智能体,专为 deep sync v 四量身打造。如果你想用国产最强模型开发项目,一定要试试! 项目是由 rust 翻译单二定制文件无依赖,不装 node, 不 装 python, 开箱即用。并且支持全平台 linux、 macos、 windows, 同时还带简体中文界面, 能一次性吃透整个代码仓库, ai 思考过程实时看得见,还带智能缓存,响应更快又省 token。 支持三大模式,只读审批,全自动,能直接读写文件执行效管理、 get 搜索网页,调用子 agent 绘画续作、快照回滚,实时费用统计。而且现在正好赶上 deepstack v 四官方折扣活动,这个时间段用,性价比很高。一行命令启动 ai, 直接接管你的整个工作区,不用浏览器,不用复制粘贴,直接提升开发效率。 项目地址放评论区了,欢迎评论交流,关注科技区角,看见更全面的科技世界!

cosco 的 桌面端接入 deepsafe 第三方 api 教学,点开应用后点击右上角,在 help 里继续点击, 在这个位置有一个开启开发者模式,启动后在右上角点击开发者,继续点击第三个, 进入这个界面,保持 get 位,输入 url, 可以 去 deepsafe 官网寻找,复制后粘贴,然后输入自己的 a p i。 接下来添加模型信息, 我这里添加 deepsafe v 四 pro, 开启一百万上下文,然后就可以正常使用了。 想要 cloud code 的 中文语言的方法很简单,随便使用一个 ai 告诉他你需要 cloud code 的 桌面端中文语言包,他就会推给你,还是完全免费的。

通过 comfy ui 调用网页版 deep seek, 点击这个节点,可以在右侧看到详细信息。来看中文解释窗口距屏 就是右边。这里打开 deep seek 窗口的页面,出使化信息,可选用于角色出使化信息,这里填你要发送的信息回复格式,你希望怎么回答你?最后一个没啥用,不用管它, 现在简单试一下。你是一个数学家,给我一个一百字的小故事。 检查这个窗口,选择运行,试一下,没问题。成功运行了,向网页发送了信息, 等待回复完成。可以看到这里显示了收到的消息,换一个提示。试一下,换成律师,等待页面回复完成。 这个回复肯定没问题。好了,看下一项吧。通过窗口选择器节点输入窗口,这里也可以通过下拉选择,下面是个没什么用的随机数,好了,改一下试试。 运行稍等片刻,照样没什么问题。那么问题来了,这个窗口选择节点有什么用呢? 他的第二个参数是个列表,这样就可以通过下标,或者说通过编号来指定使用哪个窗口。看我演示。添加一个通过下标输出列表值的节点,他的输出就是一个窗口,连到后面 默认从零开始。输入信息也简单改一下好了,运行等待结果 没问题。拿到回复了,下面换一个窗口好了,运行 等待结果, 拿到结果了就酱,再见!

hello, 之前有讲过 dsp 怎么生成 word, excel, 还有 pdf, 然后评论区有很多人都不会用,然后要不然就是,呃,下载不了,要不然就是下载了是空白的,乱码的。然后现在我们再给大家再教一次吧, 注意看哦!首先用 dsp 生成 word, excel, pdf 都是需要用到电脑的,这一句是提示词后面这一部分蓝色的部分是很重要的, 如果你要的是 word 形式,那你就要打 word, 两个地方都要改成 word, 点发送,等待一下它就生成好了,然后上面有运行按钮,直接点击运行就可以了,运行打开之后它就是一个文档了,然后我们直接点,呃,上面有一个下载, 下载之后直接保存在咱们的本地就可以了。如果你要下载是 pdf 的 形式,那就在原来的那个提示词上面修改一下,把 word 改成 pdf, 两个都要改,点击发送就可以了。也是一样,点击运行, 生成好后,我们滑到下面就可以看到下载 pdf, 然后点一下,然后点击保存在我们本地就可以了。如果你要下载 excel, 那 你就在原来的提示词上面把它修改成 excel 形式就可以了。 修改后直接点击发送,生成好了,点运行,然后就可以看到我们的表格,生成好了, 然后直接点击上面的下载 excel 文件,然后点一下,保存在我们的本地就可以啦。下载后打不开的宝字可以像我一样问他为什么打不开,他会重新帮你生成可以直接打开的形式,然后我们再点击运行,再重新下载就可以打开了。 我是两个都可以打开的,然后给你们看一下他们两个有什么不一样?第一个就是我直接运行就可以生成的,直接就可以打开。然后第二份是我们重新问他打不开,然后他重新生成的表格, 他除了封面不一样,然后里面的,呃形式也有一点不一样。好了,如果大家还有什么不懂的可以评论区问我。

大家好,我是知了 deepsafe 已经发布了全新的 v 四版本,我们的 vba 输入法也同步更新了,首先请确保你已经更新到了最新的版本,对应的是这两个版本号。然后我们可以先打开设置 在 ai 助手这里, api 密钥是不需要改变的,如果你以前填过了,就可以继续使用。然后我们来看一下全新的 deepsafe v 四它的使用方法。 我们先打开一个工作簿,然后打开 vba 编辑器,在编辑器里边我们先写一个问题,比如说写一个九九乘法表,结果输出到 a 一 单元格, 我们可以把问题写到这里,然后添加上一个注式,选中它。我们可以在轮盘上点击 ai 助手,或者是在工具条上在这里 点击第一个打开 ai 助手,打开之后这有两个选项,如果取消勾选使用的就是 flash 模型,如果勾上它就是 pro 模型, 这种简单的问题,其实我们使用 flash 就 可以了,它更便宜,而且录的还快一些,然后思考或者是非思考,大家自己来定就可以了。然后我们选中问题,点击提问, 这个时候它就会生成代码。 好结果写完之后我们选择一个位置,点击写回代码就输出了,这个时候我们直接来运行一下, 然后可以看到在 a 一 单元格,它就输出了一个求救乘法表,这是提问的使用方式,我们可以先把注视还有空行都删掉, 然后我们再打开 ai 助手,再来看一下解释功能,解释,其实它就是添加上注,我们先选中需要解释的代码,然后点击解释, 它就会把每一行都添加上注是,这就是解释功能,用法和以前是一样的,非常简单。我们的 ai 助手 并不支持多人对话,所以他只是辅助我们日常写代码。你有哪些问题不清楚,一次性提问,一次性拿到结果就行了。然后这次更新我们还添加了很多功能,比如说刚才你看到的语音输入 这部分,我们下个视频再来讲解。好,以上就是本期视频的全部内容,如果觉得有帮助,欢迎点赞、收藏、关注,三点转发,感谢大家观看我们下期视频,再见!


原来很多人还不知道呀, deepsafe 已经可以直接导出 word 和 excel 啦,今天手把手教你操作哦!首先在 deepsafe 里输入这段文字,文案中必须包含三个重点内容,一是要以 h t m l 的 方式进行输出, 第二个是要可以直接运行。第三是页面要提供可以直接下载 word 和 excel 的 功能。 点击发送后, deepsafe 开始运行。思考完成后,点击右下角的运行,就可以选择下载 excel 和 word 啦!你学会了吗?有问题评论区告诉我,喜欢的话可以点赞、收藏加关注!

简单三步,用上 cloud 桌面端,并接入最新的 deep sec v 四 pro 模型。桌面端操作简洁,还不用担心网页端载高、响应慢以及账号封禁。接入 deep sec 最新大模型的优势是中文表现好,成本相对低,适合写文案、写代码和做内容分析。接下来跟着我的步骤走三步就能用上。 第一步,下载安装 cloud 桌面端,进入 cloud code 官方网站,根据自己的电脑系统选择 mac 或 windows 版本下载安装。 安装完成后直接打开 cloud desktop。 第二步,更改 cloud 桌面端设置,打开 cloud desktop, 在 顶部菜单栏依次选择 help, 帮助 troubleshooting 故障排除。 enable developer mode 启用开发者模式, 开启后,软件会自动重启。重启完成后,顶部菜单栏会出现一个新的选项,点击 developer 开发者 configure third party inference, 这时会弹出第三方 a p i 配置面板,然后进入 debug 平台,配置 a p i key。 没有账号的先注册账号, 然后点击控制台令牌管理,添加令牌,创建 api key 并复制保存。回到 cloud desktop 的 三方 api 配置面板,把刚才复制的 api key 填进去,选择 xapkey, 填入平台上支持 antropic 协议的模型 id, 例如选择或填写 deepsafe v 四 pro 模型,然后保存配置。 配置完成后重启 cloud 桌面端,重启后可以直接测试,比如输入调用 deep sec v 四 pro, 帮我写一段视频脚本,如果能正常返回内容,就说明接入成功。大家也可以像我一样询问是什么模型来测试。注意,如果你切换了 v 四模型, 但它还是会回答自己是 opus 四点七,不必担心,因为这是软件内置的提示词。如果实在不放心,也可以在平台的使用网址里查询实际的使用模型以及自己的用量。