粉丝35.7万获赞351.1万

一百期 ai 专业名词科普今天是蒸馏模型,先给你一个比较直观的对比,米其林大厨和速冻饺子。一家米其林餐厅的大厨做一份招牌饺子,时间 可能需要一个小时。专业厨房上等食材师傅二十年的经验,一份卖五百块,但你超市买的速冻饺子,三分钟煮好五块钱一份,口感呢,大体能做到大厨的百分之八十吧。为啥速冻饺子能做这件事?因为大厨啊, 把怎么做这道饺子的核心步骤交给了工厂,面皮怎么配比,馅料怎么调味,揉面揉多久,煮多久,火候多大, 这些知识被工厂学走了,做成了标准化生产。速冻饺子不是压缩版的这个米其林饺子,它是学了大厨手艺的工业产品,便宜快量产, 但是呢,也就只能吃到百分之七八十的味道。蒸馏模型做的就是这个事。我们的六百七十一币的大模型,就相当于我们的米其林大厨,能力强,但贵慢,有的时候需要很多很多张顶级的 gpu 才能跑, 一次调用就很贵。小模型七币,就等于这个速冻饺子便宜快。哎,笔记本就能跑几乎呢,不怎么费钱。蒸馏的过程啊,就是大厨把核心手艺交给工厂,让小模型学到大模型的核心能力。 但这里啊,有一个特别容易误解的地方,很多人是以为蒸馏就是把大模型压小, 其实不是把大模型压小,我们叫做减脂或者量化,这个是另一个技术。蒸馏呢,不是改大模型,而是从零造一个小模型,让他跟大模型学。打个比方,你不是说把这个大厨厨房变小, 而是另外培养一个工厂工人,让他们跟大厨学这道菜。大厨呢,这个本身他自己厨房该多大还是多大, 工人啊,就是来跟他学习的,他做出来的菜接近大厨水平。蒸馏的英文名叫 knowledge distillation, 这个概念 吴昕深度学习。三巨头之一的 jeffrey hinton 第一次提出这个想法,就是二零二四年拿诺贝尔物理学奖那位啊,他在论文里提到了一个特别关键的洞察,叫暗知识, dark knowledge, 这个就是蒸馏能起效的核心原因。举一个直观例子, 让 ai 接龙这句话,今天天气真杠, ai 最终输出好,但他心里其实做了一整套的概率判断,好是百分之六十,不错,是百分之二十,热是百分之十,冷是百分之五,其他几万个人加起来百分之五,他选了概率最高的,好给你。 但是啊,你想想,这一整套的概率分布,信息量是不远比单纯今天天气真好大的多。他实际上就是在告诉你这一句话之后啊, 大模型呢,对,好不错,热冷四个字都有把握,而对其他字几乎不考虑,这个就是大模型藏在概率里面的语言经验。这些案中的概率分布呢,就是暗知识,蒸馏要传递的不只是好的这个最终答案还有好不错,热冷这套概率分布, 学生相当于他学的是大模型,怎么去想这个全套的思维方式?这就是为啥说蒸馏学的快,他学的全 因为小模型,它不是实际这个答案,它是真正会了大模型。这个是怎么想的?我们用 deep seek 一个真实案例来感受一下,让 deep seek r 一 六百七十一 b 交 千问二点五七 b 的 这种小模型。整个过程大体就三步。第一步, deep seek 收集了约八十万道题目,包含数学、编程、逻辑、推理题、对话题,它把这些题目全部都丢给 r 一。 r 一 相当于老师啊, 让他一道题一道题解答,关键就是要带思考过程。比如说数学题二百三十七乘以四十九,老师不会直接给一万一千六百一十三吧?他会展示完整的推理,先拆解四十九等于五十减一,再计算二百三十七乘五十等于一万一千八百五, 最后再减去二百三十七,得到一万一千六百一十三,然后再用另外一个方法演算一遍,这种思考过程就叫做思维链,这就是蒸馏的核心材料。第二步, excel 公开了这个数据集的组成,它可能包含了六十万条推理题,其中有数学、编程、逻辑,还有二十万条非推理题 写作常识对话,总共有八十万条带完整思考过程的教材。这个就像大厨啊,把做菜的所有步骤全都录了下来,做成了八十万份的教学视频。这里要强调一点,数据质量在蒸馏里比数量 更关键。所以说最强的推理模型,它的思考过程足够标准,足够清晰,小模型来学这种教材效果才会好。那到第三步,它会把这八十万条数据丢给小模型,让它反复学习。这种题目,你到底该怎么想?这一步在技术上叫 sft 监督微调, 实际上就是小模型模仿大模型的思考过程。学完之后,小模型有了什么样的变化呢?它这个 r e 的 七 b, 它已经开始会自言自语推理了,你们的数学题,它会输出一段完整的思考过程再给答案。这就是我们提到的 小模型。不止学到了答案,还学到了暗知识,就是老师在回答时心里所有的判断,他学会了,不只是什么答案对,还得学会了怎么想才对。当时的一个测试结果啊,千问二点五的七 b 在 蒸馏前,他在 a i m e 的 数学竞赛上只有约等于百分之十五, 那在 r e 千问七 b 蒸馏后,数学竞赛达到了百分之五十五点五,同样一个七 b 模型,只是学了八十万条 r e 的 思考过程, 成绩就翻了三到四倍。这就是蒸馏最直观的一个体现,速冻饺子真能做出大出百分之八十水平。但讲到这啊,我们有几个词很容易混,蒸馏、微调、训练,这三个词都涉及到调整模型,但意识不同。我们一个一个来看, 训练它等于是从零教 ai 学语言,这就是模型最初的诞生,也是说预训练,让一个空模型读完几十万亿字,他慢慢学会语言知识推理, 成本就是几千万到几亿吗?时间也是需要几个月,需要顶级的算力。微调是在已有模型上加点新知识,模型已经确定好了,但你让他学一点专业知识,比如说医疗啊、法律啊这种的,就得用专业数据 进行微调,成本是通常几万到几十万,时间呢也从几天会有到几周的。那蒸馏是用大模型教这个小模型 不是从零训练,也不是改已有的模型,是让一个小模型通过学习大模型的输出,获得接近大模型的能力, 成本是几万到几十万美元,他的时间呢,可能就是几天。这三件事是互相配合的,你可以先训练一个大模型,再微调,让他钻进某个领域, 最后蒸馏出一个专用的小版本。这种场景通常就可以跑在用户的手机上,或者专门的笔记本电脑上。那我们回到开始的问题, deepsea 二零二五年的这次开源,为啥会说游戏规则变了?要理解这个事,我们得先知道蒸馏在 deepsea 之前是什么状态啊?蒸馏二零一五年就被提出来了, 过去的十年里面呢? open a a 啊,谷歌 i s o p 这些大厂,它们内部呢,一直在用,相当于把碧桂园大模型蒸流出小版本部署到自家产品里。但具体怎么蒸,用什么数据,效果能到多少, 这些呢,是大厂的内部秘密。但随着二零二五年的一月,把蒸馏的整个过程完全公开了,八十万条蒸馏数据的来源,六个蒸馏好的小模型完全开源, 训练方法,超参数效果对比,这就等于把之前珍藏了十年小模型的蜜蜂全都免费公开。而且 deepsea 在 论文里还做了一个观念对比, 它们试了两条路,第一个是把 r e 的 推理数据增留给一个七 b 的 小模型,就是我们提到让小模型学大模型, a i m e 拿到了百分之五十五点五。第二个方案是直接呢对七 b 做强化学习,就让小模型自己去学推理,在 a i m e 上拿到了只有百分之三十 增流的效果,几乎是强化学习的两倍。 deep 这次开源还藏了一个真正的杠杆,普通开源社区没有 r e 这种千亿参数的大模型, 看他们有 deepsea 公开的那个八十万条蒸馏数据的组成方法,这就意味着开源社区如果想用,就完全可以跳过训练大模型这一步了。 r 一 的论文啊,公开后的几个月,整个开源社区都爆发了,开发者基于 deepsea 方法做出了一百四十万条开源蒸馏推理的数据集, 比 deepsea 自己用的还多。那各种蒸馏的小模型在 hegengface 上紧喷,每个开发者都能做自己的推理小模型,国产的厂商 统一 kimi 包括智浦都跟进做蒸馏版本。这就是为啥说游戏规则真的变了。那讲了这么多技术和行业跟我们有什么关系?第一个,通过了解,我们要知道我们手机里后续的 ai 大 部分基本都是蒸馏的产物, 比如说华为、小米、 oppo 的 手机 ai 助手、谷歌的 demo 系列,这些跑在咱们手机上的小模型,全都是从更大的云端模型里直接蒸馏出来的。第二个, 企业部署 ai 增流是性价比之王,如果企业想要部署这种 ai 客服,我不可能直接租八张 h 一 百来跑六百七十一 b 嘛。 但我们可以增流出一个七 b 模型,放在一个普通的服务器上跑,成本就降到了百分之一,效果也只损失了百分之十到百分之二十。第三个,在 deepsea 之后呢?任何开发者都可以增流做自己的小模型, 特别是做行业锤类,法律、医疗、金融,这个极大降低了 ai 应用的开发门槛。最后我做个总结,增流到底是什么?它的本质啊,不是技术细节, 而是 ai 普及化的关键。增流把千亿参数大模型的能力,以前只有大厂玩得起的,变成了我们手机里面笔记本家里都能跑的小模型。 ok, 本期视频就到这里,欢迎点赞、关注、收藏!


今天解密一个赛道小说推文,这还带着六块腹肌的轮廓,这个赛道流量大,变现猛,但是很多人做出来没有流量最大的问题就是画面粗略,内容通俗化,经过我两天的研究,终于找到一套既简单又高效的方法。第一步,我们找到小说高分吧, 选一部想要推的小说,进入小说,点这个分享箭头,然后再打开,我们就得到了小说的链接。复制链接,来到 deepsea 界面,粘贴进来,告诉他提取出小说的第一章内容,接着输入这段提示词,把深度思考打开,点击发送 我们的视频内容就有了。当然我们的小说是需要授权的,这个授权是免费的方法,按照这个步骤去操作就可以了,大家可以自己了解一下。现在我们来到剪映界面,找到这个 ai 文字成片的功能,进来之后把做好的内容粘贴进来,这些多余的部分记得给它去掉。 注册,这里选择画风视频比例,通常选择十六比九,点击配音,默认是智能推荐,这里我选择小说推文,点击三条杠,可以调节语速,点击音乐,选择一首合适的音乐, 点击生成视频,不到一分钟,他就把剧本拆分成多个分镜,以及对应的画面,不满意的地方我们可以单独调整,比如内容和图片不符合,我们调整一下截字词,重新生成一张图片,替换掉就可以了。接着点击右上角的更多编辑, 进来之后,我们可以看到 ai 已经帮我们做好了大部分的工作,我们只需简单调整一下音乐的大小,添加短场,添加音效,视频就做好了,来看效果。前一秒我还在病床上咽气,下一秒我睁开眼。 二零零二年,东北十九岁的身体毕业晚会马上开始,文艺委员急哭了,李一博没来,我们班完蛋了,班主任指着我,你能不能上?全班哄堂大笑,他会唱歌。

不买系统,不搞贴牌, g e o 优化照样能做透。市面上两千到一万元的主流系统,我几乎都深度体验过。今天把踩坑总结的干货全部分享给各位老板,老板娘有不同看法也欢迎评论区交流,咱们直接上干货。先给大家一个扎心结论, 这些动辄几千上万的付费工具,系统核心功能其实就那么几项,而且绝大多数都能被免费工具完美替代。 比如被吹的神乎其神的关键词蒸馏功能,说白了就是挖掘用户向 ai 提问时常用的语境词。我实测对比下来,豆包在这方面不仅响应速度更快,还能直接展示每个关键词的实时搜索热度,完全能满足日常需求。再说说企业知识库功能,本质就是把公司介绍、 产品优势、客户案例这些信息做结构化整理。豆包的专家模式在这方面可以说是降维打击,生成的知识图谱逻辑严谨、内容专业,比系统那种模板化输出的质量高出不止一个档次。 还有大家最关心的批量文章。生成系统无非是靠预设提示词和模板,靠关键词批量产出,但实际效果很一般,大多是毫无营养的流水账,根本做不到深度拆解行业痛点和用户需求。反观 deepsea 的 专家模式, 生成的内容语义精准、逻辑通顺,记录率和排名表现都非常出色,一篇能顶系统生成的十篇。但为什么还有人愿意花钱买系统? 主要是冲着自动发布功能能省时间。说实话,这个功能确实有一定便利性,就是偶尔需要手动过一下人机验证,但其实网上有很多免费的一键分发平台,操作更简单,发布速度也更快, 唯一需要注意的是,要自己把控好企业信息安全。至于系统自带的媒体发稿功能,效果也就那样。如果想省钱,市面上正规的第三方发稿平台 渠道更多,价格更低,随便选一个靠谱的就行。还有关键词排名监测系统,测一次就要十到二十块钱,其实自己定期手动搜索查看效果,结果也差不了多少。看到这里,肯定有人会问,难道这些付费系统真的一无是处吗? 当然不是,吐槽归吐槽,他们还是有一定价值的,毕竟把分散的功能整合到了一个平台上,不用来回切换工具,界面也更直观,操作体验会好一些。 请大家记住一句话,事在人为,想要真正做好 ceo 优化,光靠工具是远远不够的。现在 ai 算法规则迭代的非常快,你既要懂自己的产品,又要懂 ai 的 底层逻辑,两者结合才能真正做出效果。我是匠心科技,下期我们深入聊聊海外 ceo 优化怎么做。


cloud 最新的 opus 四点八蒸馏了千问和 deepsea 吗?这个视频带你实测检验。但这次实测一开始就翻车了,我们本来想直接测 opus 四点八,结果 cloud code 升级后先报错丧案, e b u s y 模型还没开始测,工具链先卡住了。最后是 codex 帮我们把问题拆开的。他判断这不是账号问题,也不是网络问题,而是本地 clock code 组建状态坏了,一个旧三审文件解析异常,一个可执行文件处在半下载被占用的状态。修好这些组建之后, clock code 才重新跑起来。这反而很真实, 因为普通人用 ai 工具遇到的经常不是漂亮演示,而是升级失败,环境异常,本地组建出问题, code code 修好以后,我们才开始真正测试 opus 四点八。我们问了一个很直接的问题,你是什么大模型?他这次回答的是 cloud opus 四点八, antropic 开发的大语言模型,他还明确说自己运行在 cloud code 环境里。也就是说,在我们这次实测里,他没有说自己是 qwind, 也没有说自己是 deepsea。 所以 开头那个问题目前只能给一个谨慎结论, 这次素材里没有复现 opus 四点八自称 qw 或 deepseek 的 情况。这件事对普通人最直接的提醒是, 新模型发布或者 ai 工具更新,经常不会一次就顺利,你遇到的可能只是升级失败,组建损坏或者本地环境卡住。所以电脑上最好不要只装一个 agent, 至少准备两个以上。比如 cloud code codex, 这类工具 可以互相排查问题, cloud 出问题可以让 code x 帮你看, code x 遇到问题也可以反过来让 code 分 析。另外,网上看到某个模型蒸馏了谁,某个模型套壳了谁,不要轻易相信, 真正有价值的做法是自己去问去测,去看真实输出,做一个实战派,而不是只跟着传言跑。想看更多 office 四点八真实评测吗?你最想测它什么能力?评论区聊聊,我们下期就安排。

我用议论对话就让 cloud 飞波五做了一个我自己的 codex, 这前面的就是我自己的 codex, 叫 my codex, 然后后面的是真正的 codex, 然后我的提日词就几点,然后呢?他就接受了。然后这里有一个比较有意思的点是因为我本机已经安了 codex 嘛,所以我就让他去解包去 copy 一下本机的这个 codex, 但是他一整颜色说是不行,所以他就自己重写了整个界面, 然后大概写了有两三个小时,然后到这里,这里其实当时我离开电脑了,然后有一个同意我没点上,所以我点完之后让他继续 好,然后到这就结束了。然后我们再看一下成品啊,对比一下,就是这两个卡扣的,虽然说他没有完美的一比一的复刻,但其实大体的功能,包括大体的造型都已经有了,我们试着让他去做一件事情啊, build a to do list app, 看它能不能真的做起来。 ok, 有 反应了,有反应了,这个前面的这个物流工作流还挺像样的,你看它这个小的光效呀,其实和那个真实的 codex 是 一样的 哦,完成了,总共花了四百多秒,我看它其实还挺细的,就中间不断地在检查,我们测试一下,打开 哦,打开了,好像还真可以呢, test 可以 做出来了。 所以啊,这只是一个一轮对话得到的成果,再多对话几轮,效果肯定会更接近真实的 gold x 了。 这个还真是挺厉害的,可以大家都可以去试一试,试试一试。这个飞博五的这个能力确实还是蛮强的,就是有点贵。

兄弟们,这是由 hugging face 大 佬制作的开源高质量推理导向模型蒸馏数据集。数据集是从 g l m 五点一清洗后的推理数据 提取,所有的答案和思维链全部由 deepsea v 四 flash 教师模型生成,数据格式是标准的 jason l, 精选了七千七百一十六条高难度长思维链,数据覆盖复杂推理 agent、 任务工具调用、代码生成等场景。 它的核心作用很简单,就是把超大模型 deepsea v 四的顶级推理能力浓缩蒸馏到千问三点五九 b 这类中小模型里,让小模型可以本地运行,强推理能力。

前段时间美国 cloud 发布了新的版本,然后有人用中文问答的过程当中问了他到底是谁,他有回答说自己是千问,或者说是 deepsea, 这两个回答都有。 呃,就有人怀疑他是不是蒸馏了中国的 deepsea, 或者说是蒸馏了千问啊?当然也有人说他可能是被 ai 投毒了。那真实情况的话,我们作为吃瓜群众也不知道,因为在之前的时候 deepsea 被曝过蒸馏 cloud, 呃,那这样子蒸馏来蒸馏去。我们听到过很多的这种新闻了,那什么是蒸馏?我们可以简单的来唠一唠。那我这边的话就简单给大家说一下蒸馏要有什么样的过程。那比如你要去蒸馏一个模型的话,我们可以去写一个脚本,然后不停的向我们的那个大模型提问, 然后提问的过程当中,你把他的模型的一个思考过程还有他的结果都给他记录下来,就当数据量累积到一定程度以后,你就把这些全部喂给你的模型,然后他可以基于这些结果,就因为他有思考过程也有结果, 然后他基于这种结果作为自己的一个训练数据,然后以后他遇到这些问题的时候,他就会用之前的那个模型的那个思考方式 和推理逻辑去实现自己的一个推理。呃,这样子的话其实就实现了 从一定程度上去拷贝另一个模型的能力。那举个比较简单的例子的话,就是有一个学霸,然后你不停的问他问题,然后他给你讲解题的过程当中,把解析思路还有答案全部都写到你的纸上,然后你回去只需要去学这些 过程和思路,然后这样子的话你就能够学会做这个,做同样类型的题。那你刚才也看到我这个比喻里面,他有说到学霸和自己 作为学渣的这种角色啊。嗯,其实蒸馏的话确实是有这样子的一个条件,就是说,呃,你要确定你要蒸馏的这个模型本身它的能力是比较强大的,嗯,这样子的话你才能够去 蒸馏,出来的效果才会好,比如说对方都是学渣,你怎么可能用学渣的解析思路作为自己的一个学习素材?所以的话,一般情况下我们去做蒸馏的话都是呃,小模型,蒸馏大模型,所以这一次 cloud 的 可能去蒸馏 deepsea, 在 一定程度上的话,其实大家也都会觉得 挺搞笑的,因为从评分上来看的话, cloud 的 它的评分事实上是高 deepsea 不 少。呃,然后他居然去蒸馏 deepsea, 那这个是不是说明 deepsea 在 一些方面是比较优秀的?当然呢,我说的科奥的蒸馏 deepsea 这个事情本身还没有定论啊,然后他们官方肯定也不会承认,所以这个事情的话,我们就当作为一个吃瓜,然后简单地了解一下什么叫蒸馏。

网上最多吐槽 deepsea 的 就是说 deepsea 是 蒸馏出来的,然后也就说东西是偷过来的嘛。 呃,说的好像这个东西很容易做似的。我就想问那你为什么不蒸馏一个呢?也别说你了,就腾讯阿里 为什么不蒸馏一个出来呢?是因为不想吗?那些公司,那些互联网大厂哪个是有节操的对不对?他们咋不蒸馏呢? 这是你实在要攻击 deepsea。 呃,你可以攻击他们公司,你就攻击他们老总做量化交易,偷散户的钱。