公职人员监督迎来数字升级,大数据夜巡系统全面铺开,不用人工蹲守,不用挨个排查,系统就能自动锁定违规线索。作为中央纪委国家监委数字纪检检查体系建设规划的核心落地决策,二零二六年,大数据监督 已经从试点走向了全国,江苏、重庆、山西等地已经建成了成熟的平台,整合超过一百亿条关键数据,用技术手段实现精准监督不越界。有人担心了,这是全天候监控, 会侵犯他们的私生活。也有人好奇,大数据到底是怎么抓现行?大数据越巡,本质是用科技手段规范权力运行,既不是对公职人员的不信任, 也不是对私人生活的过度干预。大数据与夜巡的监督范围,始终聚焦公权力运行的关键环节,重点盯防六类高频违规行为,都是系法明确禁止的,与私人生活无关。第一个,与管理服务对象的不正当利益往来。比如说频繁接受宴请、 收受礼品礼金,利用股权谋取便利。第二个,收入与消费明显不匹配,比如说大额消费远超合法收入,又无法说明这些资金的来源。第三个,资产申报不实或者异常转移, 比如瞒报房产、股权,让他人代持资产。第四个,敏感履职出行为,按照规定报备或者报备的事由与实际形成不符。第五个,被近亲属利用其知情违规获利。比如说在管辖范围内经办企业。第六个,线上线下滥用公权力, 比如公车私用、违规报销,在社交平台发表一些不当言论,泄露工作的秘密。反过来,只要你不碰这些红线, 公职人员的日常消费、私人社交、家庭事务等等,都属于私人生活范畴,系统一概不干涉。比如说用合法收入带家人去旅个游,和朋友正常聚个餐,完全不用顾虑。
粉丝5362获赞5.5万

当你不小心想在一台电脑上拥有多只龙虾,还希望每个龙虾既能各做各的事情,互不干扰,又能在同一个群里让一只小龙虾指挥其他的小龙虾完成复杂工作。于是聪明的你就打开了这个来自飞出官方的文档,并点击了小龙虾一键创建。几秒钟后,你的飞书里就出现了一只新的龙虾 agent。 但这个时候你发现啊,跟他说话他并不理你。然后聪明的你突然想起来,你应该还没有给这只新的小龙虾开通飞书通道。于是你在科室中端里面输了这段神秘代码,打开了小龙虾的底层代码。此时此刻,你是不是感觉自己有点代码工程师的样子了? 有毅力的你别慌啊,搜索 channel, 然后你就看到了自己已有的几只龙虾。你复制了其中一段代码,并粘贴在了,并挨个复制粘贴了过来, 然后在对话框里输了第二段神秘代码,了解到了自己最新的小龙虾的名字,并把名字复制粘贴到了刚刚的部分。这个时候,链接飞书通道就大功告成了。 然后啊,有毅力的你又在紧挨着的部分找到了 bendy 模块。聪明的你知道,得把 bendy 部分也设置好,这等于把刚刚的通道跟小龙虾链接起来。 于是你如法炮制复制粘贴,并把其中的 account id 跟 agent id 改成了新的小龙虾的名字。这个时候,你再次回到飞书页面和小龙虾说话,它又提示需要批准一个东西,于是你把最后一行复制粘贴发给了 cursor。 这个时候,恭喜你,小龙虾成功上线了。然后聪明的你又想起来简单的任务,可以用性价比高的模型, 于是你就想给每只龙虾进入不同的大模型,来给自己节省 token。 这时候你又在小龙虾的 just 文档里面搜索 list。 睿智的你知道,此时此刻,小龙虾们其实都在使用你默认的大模型。 如果想要某只龙虾使用新的模型,只要在那只小龙虾的代码部分加上这第三段神秘代码就好了。然后去按顺序选择模型,主流的模型几乎都在里面了。如果想选择模型不在清单里头,我也给大家准备好了一个复杂的代码,来布置不在清单里的模型。 至此啊,你的龙虾军团已经完全搞定,而且每个小龙虾专职专办,这样就能避免小龙虾因为对话太长太杂而导致上下文污染,记忆错乱。快把他们拉到同一个群里,给他们下达指令,给你干活吧!刚刚说的一键安装文档跟几段神秘代码也给大家准备好了, 下一期我们再详细教大家怎么让龙虾们可以互相指挥,全自动为你干活。我是拉菲,这是 open call 实战系列的第四期,咱们下次见!

ok, 这条视频呢,跟大家说一下我是如何利用 ai 帮我搭建我的量化模型的,废话不多说,直接进干货。 ok, 给大家看一下这个动量因子的一个模型的构建了,他的一个思路还是非常简单的,我们可以看到这里蓝色纸表的部分, 这些就是数据的一个源头,包括说我用了像标普五百的一个呃,阅读的数据作为一个精准。那还有就是在这个市场上面所有美股的,呃,我,我的池子里面,所有美股的这个上市公司在每个月的收盘价啊,这个都在这里。还有就是池子 就是成分股,那成分股这个是我觉得在这一个表格里面,这个版本比我以前自己做的版本,因为这个版本是有 cloud 的 帮忙去做的,那一会他帮了我哪些东西,我会给大家去说。 我以前自己在手搓的时候呢,其实很难解决的东西就是动态的成分股,因为我们知道像标普它是有进有出的,但以前手搓的时候呢,呃,处理这方面的数据太麻烦了,所以我因为我也不不会写代码,我也不是马龙, 所以我很多时候我只能用静态的当下的成分股去倒推过往的数据,这样其实会存在一个幸存者偏差,因为有很多不好的公司,他可能退市了,所以做出来的结果呢,可能会偏高估。但是呢, 在这个版本里面呢,大家可以看到我这个成分股的选择是动态的,每一期自动线去拉取当期标普里面的成分股,然后再进行计算。为什么能做到这么动态?因为我在 excel 里面还加入了一个数据库, 大家可以看到这里,所以我可以直接在 excel 里面去调用这些数据。那我们有了动态的成分股,有了每一家公司在每一个时间节点的价格,就可以去计算它们的涨跌幅,从而算出来谁涨得好,谁涨得坏,从而去构建一年 一年时间维度的一个动量因子。你可能觉得这个很简单,对吧?就是把过去一年长得好的这些公司挑出来,就这么简单吧。没错,就这么简单。那我跟大家说一下,可能很多去做因子投资的人,他们会去搞一些非常复杂的一些因子,尤其是偏技术面的啊,包括做日内的,他们会构建非常复杂的因子, 其实因子并不是越复杂越好的,有的时候更纯粹的因子,更古老的因子可能会更加有效。并且动量因子呢,在学术也好,业界也好,都是被证明是一个长期有效的因子。那我们来看一下这个纯粹的古法动量,他是怎么跑赢标普的啊?来最终构建出来的动量的一个结果。 这里回测他也帮我做好了,你看每个月他会选出三十家公司,每个月有三十家公司,这 个策略还是蛮牛的。就拿最近很火的散碟来说,他在二五年十二月呢,就开始把散碟选进来了,非常的牛逼。然后呢,这个是回测的一些结果,比如说啊,挑选三家公司,二十家公司,十五家公司,十家公司, 呃,对应到同期的标普五百的变化,标普五百的净值变化呢?是从一变到了二点六六,这从一九年开始到现在。 那我们如果是动量的这些策略的话,你可以看到至少最终的净值,这个是很明显跑赢标普的。我觉得从一九年一月份回测到现在是非常有代表性的一个时期啊,因为我们在 这段时间里面经历了二零年的急跌,经历了二二年的熊市,也经历了二五年四月份中突发的解放日事件,这个策略都扛住了啊。我们也可以看到 sharp ratio 非常漂亮,达到了一以上,然后这个是一个追求 alpha 的 策略,所以它的 information ratio 呢? 呃,这个持二十只和持五只都是来到零点八以上,非常好看。但这里有一个问题,就是这个最大回测是月度的, 而且呢,为了计算 alpha 呢,我还用 capm 去构建了一个 benchmark。 那 我们可以看到 alpha 的 数据情况啊,包括 r squared 可以 看到。呃,有多少是可以被大盘的涨幅去解释掉?其实当我们选股来到十五二十只,也就只有一半左右的涨幅能被大盘解释掉,剩下一半呢,都来自于选股。 这个数据结果是蛮不错的,而且做法呢,也是非常的简单纯粹。但有个问题就是我之前在手搓的时候,也只能看到月度的一个情况,对吧?但是在这个里面,月度的最大回测其实是低估的人,因为他有一个平滑的效果,所以我想要看日度每一天的变化,所以 在 ai 的 帮助下,他帮我把日度回测也做了出来。你看他给我构建了三个非常牛逼的指标, 超级多的数据,光是拉取这个数据都跑了我好一会儿。然后我们可以看到日度回测的结果,这一条线呢是 sp 五百,那么剩下的上面这些线呢?以及下面的线呢,就是不同数量的一个动量因子的一个持股情况变化。最屌的来了,整个这个模型的构建 几乎都是由 cloud 完成的,大家可以看到在我的 excel 里面呢,我可以把这个 cloud 给调用出来,那我想要 呃去做什么东西,我只要跟他说,然后他自动就帮我在 excel 上面去处理了,太牛了,而且我的 excel 还接入了数据库,所以从取数据到数据处理这种效率哈,以前可能一个金融工程的团队需要干个三五天的,现在这 现在这玩意直接两个小时就搞定了。我也跟硅谷的两位朋友交流过啊,那两位都是马农,不约而同的给出了我一个感觉裁员潮很快要来的答案。而且这有一个很牛的地方呢,就是我一开始去算 capm 的 时候,因为我要用到无风险利率嘛,所以我要把每在十年期的无风险利率去把它给调用出来。 但这个数据库的调用呢,出了一点问题,那我就抱怨了两句啊,你看我给这个 cloud 说烦死了,结果这家伙直接就给了我一个替代的方案,他自己跑到美国财政部的网站上面,把美债十年期收益率的数据给扒了下来。但我们并不是说十年期美债的这个收益率是什么很难 获取的数据,只不过说在这个过程当中,它是会自己思考,并且自己进化,自己迭代,自己去完成任务的,这真的太夸张了,不过你说那我们人类还有没有用呢?其实目前来看是有一点用处的啊,因为这个模型在构建的过程当中呢, ai 它犯了一点小小的一个错误。那 但就是你好歹你要之前知道说你在做一个什么样的事情,可能你才能够看得出那个错误。因为我此前是首抽过一个版本的,只不过呢,在我首抽的版本里面有很多细节以及效率提升的方面, 这个把 ai 直接嵌进 excel 之后,可以帮我非常完美的提升,甚至有了这个东西,理论上面来说,几乎世界上面所有的对冲基金的策略,我都可以顺藤摸瓜地去复现出来,就是这么牛逼。总而言之一句话,留给我们的时间不多了,不知道朋友们你们怎么看?反正用完之后我非常之震撼。

来看一下机器学习的几种类型,很多同学在开始接触机器学习的时候,总会有些困惑啊,到底要学哪些范围,怎么样才能算是学会了,对老师上课讲的知识点也比较困惑,觉得这节课讲这些,下节课又讲那些了,他们之间的联系究竟是什么? 这个视频呢,就和大家介绍一下机器学习常见的几种类型,下面的一些典型的研究方法。相信了解了这个之后呢,上面的疑惑就会有所缓解。 在今天,记忆学习在非常多领域都已经有应用了,比如说预测房价,预测股票价格啊,识别垃圾邮件,人脸识别啊,推荐电影或者做摘药,智能驾驶,或者是围棋象棋,一些 ai 游戏,这些都是记忆学习。 虽然说应用场景特别的多啊,但是其实我们是能看出来很多问题它的解决方案是非常相似的,比如说预测房价和预测股票的价格,都是预测一个数字吗?看看邮件是不是垃圾邮件,或者是一个信用卡的消费是不是存在风险,这种呢都是做一个简单的分类,也是很相似的问题。 比如说呢,对于继续学习,我们是有一些分类的,在不同的分类下是用,在一些,在同样的分类下,我们是用的相似的解决手段,所以说呢,我们就来看看他有多少种类型。 在探讨继续学习的具体的分类之前呢,我们先来搞清楚一个问题,到底什么是数据?因为我们天天说继续学习呢,就是学习数据之后可以去做预测了,那么在继续学习中,我们说的数据究竟是什么意思呢? 简单来说,数据就是用来训练和测试继续学习的模型的原始的信息。在日常的应用中,我们最常见的都是结构化的数据,什么叫结构化呢?它就是它可以用表格的形式,无论是 excel 或者是数据库中的表来做存储。每一行就代表一个实体, 他每一列就代表一些属性特征,比如说就是一个房子的信息,我们最终要预测房价,他可能会有一些,每一行就代表一个行,一个房子的一些信息。 对,每一列呢,其实就是这个房子的一个属性,面积啊,卧室的数量呀,地段评分啊,或者房龄这些,最终我们要预测,根据这些信息预测出房价来,我们就称这就是结构化的数据。 记住上面的表格呢,我们就来看一下记忆学习中有几个我们天天说的概念。首先叫数据集,也就是说上面这一张完整的数据表格,我们称这就是一个数 据集中呢,每一行我们称之为是一个数据点,有的时候也叫样本,称的就是数据集中的单条记录。在表格中,每一行就是一个数据点了,每一列我们称之为是一个特征,它表示就是这个数据的一个属性或者是性质。 每一行是一个数据点,每一列就是一个特征。如果说呢,在这个数据集中一共有多少列,我们就称之为这个数据集的维度是多少。 像这一个呢?可能啊,一看有六列是不是啊?但是我们只把前五列称之为维度,最后一列是我们要预测的结果,我们称之为就不是特征了,我们称之为标签,实际上英文原意是 label 啊, 模型要预测的这个变量究竟是什么?所谓预测呢,本质上就是让机器学习来学这些特征,然后去推算数据中的标签。这四个知识点呢,我们先要了解一下,就能看后面的了, 我们来看一下继续学习究竟由从最广义上有哪几种分类啊?就是根据数据集是否带有标签,以及学习的方式不同。我们把继续学习呢,其实有三个主要的研究方向,一个叫做监督学习,他的数据集中,每个数据点都是有标签的,就像我们刚才的表格中是有房价的, 你在学习的时候都告诉你他的房价是多少了,你可以看看自己学的对不对是吧?继续学习呢,就可以通过学习特征和标签之间的关系来进行预测。 另外一种呢,叫做无监督学习,其实和监督学习对应的呢,他就没有了数,在整个数据点中呢,就没有标签了, 机器呢,需要自己在所有的特征中来发现隐藏的结构和规律。另外一种叫做强化学习,相对而言,这两者都是静态的数据。而强化学习呢,是让大家让智能体呢,在动态的环境中不断的试错,来学习一个最优的策略, 我们展开讨论一下。首先看一下监督学习,它就是处理带标签的数据,它应用当然是非常广泛了,无论图像识别啊,文本处理、推荐系统等,都在用核心的目标,根据已有的数据来预,就是根据这些特征来预测标签。在房价的数据集中, 房价本身就是房子的数据集啊,房价就是我们要预测的标签了,模型通过学习这些现有的历史的数据,就是五个特征,我们讲这是一个五维的数据,是不是啊?它的维度是五吗?来找到这些五个特征和最终这个房价的一些对应关系,找到它背后的规律, 这就意味着我们在接下来呢,向模型输入一个缺失了价格信息的新的房子的数据的时候,模型就能自动预测出它的价格来了,这个价房价呢就是我们要预测的标签啊, 监督学习就是干这个的,在监督学习中呢,如果细分的话,它也可以分为再分为两类,我们的标签的数据类型是什么啊?其中有一种,如果说我们的标签呢,都是一些数值连续的数值型的数据,比如说房价就是连续的数值,我们就称这种呢,叫做用的是回归模型, 数数也是一个,我预测的就是一个数字嘛,房价是多少就是多少,就是这种呢,其实应用我们日常会非常的常见啊,也有很多常见的算法,在接下来我们要介绍的先行回归就是最常见的应用。 另外一种叫做分类模型,它它预测的就不是一个连续的数值了,它预测的是一个离散的分类型的数据。比如说这个图片中是猫还是狗,就只有这两类,它是一个两,它你可以叫猫或狗,你在数字上就给他定义成零或一,它是一个离散的数据,离散就是相对于连续的一个概念啊, 它没有,只是我用数字来代表猫和狗而已,其实它背后这个数字并没有意义,而房价的数字后面是有意义的,一百万和二百万就是不一样的。 而猫和狗呢,我既可以把猫定义成零,狗定义成一,我也可以把它定义成十和二十,都无所谓了,只是计算机更擅长处理数字而已。我数字后面是有类型的含义的,今天是晴天还是下雨,是零是一都可以,但是你只要把它区分清楚就可以。这种呢,我们称之为分类的模型, 比如说做一些图像识别中是猫是狗。垃圾邮件检测,这个是垃圾邮件,不是垃圾邮件。客户群体的划分可能呢,我们的客户群体有五大类型,他们的数字是一、二、三、四、五,无所谓的,只要把它这五类分清楚就好,它有一些很常见的算法。在接下来我们也会学习的 是无监督学习,他就处理没有标签的数据,大家可以看到。监督学习,大家能想到啊,你来预测一个数值,或者是预测他的一个分类,我通过标签呢和特征之间的对应关系就学会了。但是如果说是这个数据集中都没有标签,那我怎么学习呢?或者我去学习什么呢? 无监督学习的目标呢?就不再是预测某一个具体的数值或者是类别了,他是干什么让模型自己探索这些特征?你的数据集不是只有特征吗?我就研究这些特征,来发现这个数据内部隐藏的结构模式或者是规律。 怎么来说就为什么要干这种事情呢?因为在现实的场景中啊,其实带有标签的数据的成本是非常高的,因为他需要依赖,甚至这有一个行业就叫做标注,只要是依赖人工了,价格就会非常的高, 我们手中绝大部分数据其实是没有标签的,所以很多时候呢,我们一方面有的时候用无监督学习呢,去做一些基础的分类就可以了,做一些据类,把他们把相似的给他聚在一块就可以了。另外一种呢,其实也是为监督学习提前做一些数据的分析, 所以说无监督学习在实际的业务应用中也是非常常见的,它呢主要是有三种方向,据类、降维和生成算法。我们来看一下 据类是干什么呢?一个数据集给一个数据集做分组,很多时候我们面对海量的数据,他的分类是无法下手的,我我也想做一个分类问题,但是呢,其实他我我也没有标签吗?数据量又特别的大, 怎么办呢?我就可以用一些据类的算法来计算数据之间的相似度,把一些行为模式特别相似的数据自动的分到一个组中, 实现物以类聚。我只是没有标签,但是我我的结果呢,就是给他分出标来,也就是用机器来实现达标。 比如说举个例子啊,我们如果是一个电商网站,我们每天有一百万的用户的各种各样的访问啊,交易的数据,我怎么对这些来的这些用户做一下分类呢?我不可能对一百万人都做一下人工去做一下达标。所以说呢, 这种时候我们就可以通过无监督学习的剧类的方式,让平台可以自动的梳理出,根据用户的行为就把它梳理成几类的用户,价格敏感型、品牌忠诚型,就有了这些清晰的用户画像了,我们就能做一些精准的推荐了。 在后面我们也会接触到 kimi's 这种算法,这就是无监督学习其中的一个作用,对于海量数据做一下具类。但是说一下这个和监督学习的区别啊,监督学习是让你猜一下它的具体的一个数据点的类型是什么, 监督学习中的分类,而无监督学习呢,实际上是给你海量的数据,把这些数据可能分成两组,或者分成十组之类的,把它分分成组就可以了,实际上是对数据的一些预处理。我们再来看一下无监督学习的第二类降维算法。 什么叫降维呢?我们刚才提到了,在数据集中,特征的就是一个数据表中列数,就是特征的数量,就是它的维度, 但是呢,对于很多复杂的数据,它的维度或者是它的特征数实在是太多了,而且呢,这些特征也并不是完全都有用的,有很多是有一些噪声,可能和我们的目标呢,并不是直接相关的,有很多在表达相似的含义, 但是如果说我们都把这些数据直接就拿去训练了,他会非常的消耗计算资源啊。我们降维的目标呢,就是在尽量不丢失关键信息的前提下,极大的简化数据集,他可能把一些无干的不相干的特征给删掉,或者是呢,把一些很相似的特征合并成一个, 造成整体的关键信息并没有丢失,你训训练起来还是可以用的,但是呢,训练的数量会显著的下降, 比如说在房价预测的呃,例子中啊,我们有一个周边环境的特征,它可能会有好几列,有一列距离地铁站多远,还有周边的学校的数量,商场的个数等几十个都在描述 相关的信息。但其实我们能看出来啊,这些他就是来描述他这个房子的地段怎么样,是好的地段还是不好的地段?我们就可以把用降维的算法呢,对这些特征进行学习,把他们的合并压缩成一个新的特征,比如说呢,综合地段评分, 这样就把几十个特征就变成一个特征了,同时呢,关键的信息没有丢失,在做后续的训练的时候呢,效率就会高非常多。 当然它也是有典型的代表算法的 p c a。 后面我们也会接触到关于无监督学习的第三类的生成算法,这个在今天我们已经非常常见了, d i j c 啊,会经常用到从数据中创作全新的内容。 很多时候我们是面临着数据匮乏的,尤其比如说啊,在医疗 ai 中,因为病人的隐私数据你不能随便分享的,它是有很多限制的。或者是说我们无论是作家呀,或者是画家呀,创作是有些瓶颈的, 我们普通人可能也会有些生成算法的,来学真实的数据,来学会变成作家,来给大家创造一些全新的数据。 这个我们现在用的已经比较多了,在 ai j c 就 ai 绘画,你说几句话,它就给你生成一个图片,甚至生成一个视频。 但现在我们接触的无论是说那个 nasa banana 或者是就叉的 gpt 提供的这些效果呢,它可能都是通过 farmer 来训练过来的,但是呢,在更早之前用机器学习呢,我们也是有 jn 这种,也可以做到类似的效果, 当然它还可以模拟出全新的数据。用做训练不只是给人去消费啊,还可以为后面的监督学习去用。医疗信息有隐私的时候,这种我们就可以用 生成算法来生成一些非常逼真的这些并列切片,然后作为扩充的训练级,这样他就非常有用了。这就是无监督学习的几种分类啊,除了是无监监督学习,学习啊, 记忆学习呢,还有一种类型强化学习。在监督学习和无监督学习呢,他们本质上都是用的现成的静态的数据集,都是通过历史数据,你学会了就能预测新的数据了。 但是呢,还有一种复杂的场景,比如说在自动驾驶,或者是说在实时下围棋,他并不是不能根据完全的历史来预测出新的,他必须要根据当前的环境来做一些实时的决策。 我学用一个自动驾驶的汽车开到了一个全新的路段,你也要不断的给我学会变道啊,转向啊,或者是看红绿灯之类的这些。 比如说呢,强化学习的核心是什么?他就在训练的时候让智能体不断的试错,在这个过程中学会能够做出一个最优的策略。就像人不断的学开车,你只要渐渐的你就学会了如何应对 有紧急冲入的行人要赶紧踩刹车啊,或者是遇到红灯就要停啊,渐渐的你就学会了,你就能到全新的路段去做驾驶了, 它的一个运行的机制呢,做了一个智能体,也是我们现在当前特别流行的概念, agent 放在环境中,无论你是下棋或者是智能驾驶, 智能体呢去采取动作,在训练的过程中呢,环境就根据你动作的好坏给你实时的反馈,就奖励给你一个惩罚。 比如说在智能驾驶你转弯的时候呢,给转到了撞上墙了,就要给你一个惩罚,如果你转弯没有闯红灯,而且还特别顺畅,在车道里面可能就会给你一个奖励,渐渐的就能够让智能体学会开车了, 它的终极目标就是探索出一套能够最大长期累积奖励的策略,渐渐的学会了到任何地方去开车,强化学习最典型的应用啊,或者最大的里程碑呢,也是二零一六年,阿尔法购击败了就是 李世石,人类围棋的世界冠军,证明了他的价值,他通过左右互搏,不断的去看人类的下棋的方式,渐渐的试错,学会了下围棋了,而且能够超越人类了。其实在阿尔法 go 之后呢,还有 zero go, 就 他连人类的棋盘都没看过,完全就是只告诉他规则,他自己去学, 结果呢,其实他还训练了两个月,就赢下了一千盘,就一千盘全都赢了。阿尔法够了就不参考人类,他也能学会要更强,只要是给他这个环境,给他这个清晰的规则就行。 强化学习的应用呢,也超级的广泛,无论是说我们复杂的棋牌,或者是 lol 啊,或者是王者荣耀,一些跟 ai 机器人打游戏都是用强化学习训练来的, 包括我们日常在工厂中啊,或者是在家机器人的一些姿态的控制,或者是工业机械臂的一些调度,这些都是用强化学习训练来的,包括做量化交易中的策略定制,也会用到强化学习。 今天我们的大语言模型天天都在用,它的最后的一步也是要做,训练完了之后呢,也是要经过强化学习和人类的意图呢,做一下对齐的。所以说强化学习的应用是非常广泛的啊。最丁,我们在课程中呢,后续也会接触到 qing 算法, 看看怎么让 ai 像人类一样能够思考跟行动。做个简单的总结,今天我们要学的积极学习到底有哪些分类?他们在现实生活中都是干什么的,有哪些关键技术? 从最大的方面上,他就分为三个,监督学习,无监督学习和强化学习。监督学习内部呢,根据标签是连续的数值还是离散类型的类别,就可以分成回归和分类这两种。对于无监督学习呢,他专门探索无标签数据, 有标签我就可以用监督学习了,没有标签就用无监督学习,他就会包含了有几种学习的方法,其中就是剧类、降维和生成,这是无监督学习最典型的应用,如果是动态的环境中,我们需要不断的试错,让他来学,最优决策就是用强化学习。 你如果说无论是说学习记学习的范围,还是说老师讲的各种知识点,比如说今天讲回归了,明天讲句累了,他们都是在什么位置,彼此之间是什么关系啊?通过这个视频就可以理明白了。 在下个视频中呢,我们就介绍最基础也是最最重要的监督学习的算法就是限性回归,就来看看怎么从一堆数据点中拟合出一个直线来,能够精准的预测房价等股票的价格。好,这个视频就先到这里。

嘿,今天我们来聊一个特别有意思的话题,人工智能到底是怎么来的?你有没有想过一个 ai, 它是怎么从一堆冷冰冰的原始数据一步步长大,最后变成我们现在离不开的?好像真的会思考的智能助手,咱们这就来一探究竟。 我们肯定都用过 ai 吧,让他写个菜谱啊,或者帮忙总结一下文件什么的,你只要点一下发送,嗖的一下,一个看起来挺聪明的回吧就出来了。但是你有没有想过,就在你按下发送键之后,那个我们看不见的黑箱子里到底发生了什么? 更重要的是,在你能够问出第一个问题之前,那几个月,甚至好几年的时间里,又发生了些什么呢?其实啊,一个 ai 的 诞生,就好像一部三部曲,第一幕是给他造一个超级庞大的大脑,第二幕呢,是教会他怎么说话,给他塑造一个独特的人格。 那到了最后一幕,就轮到我们用户上场了,看我们怎么用指令来跟它互动。今天呢,我们就跟着这个线索,从它最开始吞掉海量文本,一直到它掌握看起来很复杂的推理能力,把整个过程走一遍。 好,那我们先回到一切开始的地方,在 ai 成为你那个聪明的助手之前,它其实是一个很原始的东西,我们管它叫基础模型, 那么这个基础模型到底是个啥?你可以把它想象成一个超级巨大而且复杂到不行的文字接龙机器。在他最初的这个阶段,他的目标只有一个,就是获取知识。他就像一个数字黑洞,疯狂的吸收人类写过的所有文字,那个规模大到你马上就知道了。 这一切都始于一场堪称史氏级的数据大搜集。数据都从哪来呢?主要就是互联网的各种档案库。你想想,像 commoncrow 这种非盈利组织,还有危机百科,各种学术论文,以及 github 上所有的公开代码,都是它的食物。 当然了,你不能把乱七八糟的整个互联网直接塞给它,这个过程需要非常严格的筛选,把所有的垃圾邮件、病毒还有重复的内容全都提出去。 那你知道吗?就算是这么大扫除之后,剩下的数据量依然是个天文数字。举个例子,一个高质量的数据集里头,光是纯文本就有大概四十四太字节,这得相当于几百本厚厚的实体书了。 接着这四十四泰字节的文本会被切成一个个 ai 能理解的最小单位,我们叫它词源,你可以理解成词的碎片,光是这一个数据集就能切出大概十五万亿个词源。你想象一下,这可是十五万亿块独立的知识积木啊。模型要做的就是一块一块的去理解,去拼接它们之间的关系。 那模型是怎么学习的呢?就是通过调整它内部数以万亿计的我们称之为参数的东西。 你可以把这些参数想象成一个巨大调音台,上面密密麻麻的旋钮模型每猜一个词,它就会根据正确答案,以每秒几百万次的速度去微调这些旋钮,时间一长,这些旋钮的特定组合就把语言的规律给记住了。 像 gpt 四这样的顶级模型,据说就有多达一点八万亿个这样的旋钮,所以我们花了那么多钱买的 gpu, 到底在干一件什么事呢?说出来你可能不信,它的核心机制在概念上其实非常简单, 大语言模型呢,是自回归的,这听起来很专业,但说白了就是他只根据你前面说了什么,来猜你下一个最可能说什么词。比如我说猫坐在地毯,模型就会预测下一个词最有可能是上,就这么简单。 我觉得这个比喻真的特别贴切,欲训练的最终结果就像是把整个互联网打包成了一个巨大的但有损耗的压缩包,它是一个概率性的压缩文件,记住了人类知识的各种模式和语法,但它其实还不懂什么是对的,什么是错的,更别提逻辑了,也根本不知道怎么跟人进行有意义的对话。 好了,现在我们有了一个非常昂贵,只会玩文字接龙的基础模型,但这还不是我们平时用的那种聊天机器人。要想把它变成一个真正有用的对话助手,我们就必须进入下一个阶段后训练。 这里面就有两个特别关键的步骤。第一个要监督为调,他的任务是塑造模型的人格。我们找来人类专家,写几万个理想的对话本,然后让模型去学,教会他应该说什么。第二个叫强化学习, 这个是用来训练模型的思维能力。我们让他在数学、编程这种有唯一正确答案的领域里反复练习,教会他应该怎么去思考。 就在这个训练思维的过程中,一个特别神奇的现象出现了,模型自己发现了一种策略,叫做思维练。他好像突然想明白了,要解决复杂问题,不能一口吃个胖子,必须得像人一样,先自言自语,搞一个内心独白,把问题一步步拆解开,最后才能找到答案。 这个比喻简直太形象了。你想想,如果你逼着 ai 必须一次性给出一道复杂数学题的答案,他几乎肯定会算错。你必须引导他,让他一步一步地把思考过程写出来。所以,观战点就在这,模型是需要通过生成一个一个的词源来进行思考的, 不让他分不来,就等于不给他草稿纸,让他心算微积分,那当然不行了。不过,对于写个笑话好不好笑这种主观问题怎么办呢?这里就需要一个升级版的技术,叫基于人类反馈的强化学习。 简单来说,我们另外训练了一个 ai, 当品味裁判,这个裁判 ai 专门学习人类喜欢什么,不喜欢什么,就让这个裁判去给主模型写的笑话打分,通过这种方式引导主模型生成更符合咱们人类口味的内容。 ok, 到现在为止,我们有了一个既有知识,又有人格,还有初步推理能力的 ai 了。但俗话说的好,再强的工具也得配一个会用它的工匠。这最后一步其实就掌握在我们用户自己手里。 是的,当我们在实际工作里用它的时候,马上就会撞上几个大问题。首先,模型的知识是旧的,它不知道昨天发生了什么新闻。其次,它不了解你个人或者你公司的内部数据。而且最麻烦的是,它有时候还会产生幻觉,也就是一本正经的胡说八道。 那么为了解决这些问题呢?一个叫解锁增强生成或者简称 r a g 的 技术就变得非常非常重要了,可以说它是对抗模型知识过时和信息幻觉问题的最有效武器。 这个解释可以说是非常到位了,他的工作原理大概是这样,当模型意识到这个问题光靠我自己的旧知识回答不了,他就会触发一个外部工具,比如去网上搜一下,然后呢,搜索结果会立刻被塞进他的临时记忆里,这样他就能根据最新的事实来生成答案,而不是只靠他那些陈旧的训练数据瞎猜了。 当我们真的掌握了这些技巧之后, ai 就 不再是个聊天玩具了,它会变成一个真正的生产力工具。你看看这个对比,本来要花三个小时干的活,有 ai 帮忙,九十秒就搞定了。这真的印证了一句话,工程师可能不会对 ai 取代,但他们一定会被那些懂得怎么高效使用 ai 的 工程师取代。 想要达到这种惊人的效率,我们就需要用一些专业的提问技巧,比如说角色扮演,你得先告诉 ai, 你 现在是一个资深软件开发工程师。再比如,用结构化提示,用一些标签把复杂的数据整理好,微给他,方便他理解。 更高级一点的技巧是维护一个持久化上下文,就是每次跟他对话,都把项目的核心逻辑再给他看一遍,确保他不会聊着聊着就跑偏了。好了,今天我们算是把 ai 诞生的整个旅程都走了一遍,从数万亿个原始的文字碎片,到赋予他人格的人类对话,再到需要一步步拆解问题的复杂推理, 在这有一个核心要点,大家一定要记住,大语言模型的能力就像一块瑞士奶酪,他可能聪明到能解决奥数级别的难题,但一转头可能连九点一和九点九哪个大都分不清。 他的能力非常强,但同时又充满了各种随机的你意想不到的恐动。所以我们必须把他当成一个带有随机性的工具来用,并且时刻要对他的产出进行验证。 最后,我们用一个思考题来结束今天的分享。几年前, r f go 在 围棋比赛中下出了著名的第三十七首,那是一部当时所有顶尖人类棋手都无法想象的神来之笔。 那么,如果 ai 在 更广阔的领域里继续这样进化,不断发现那些超越我们人类认知的全新策略。试讲一下,当解决某个重大问题的最佳方案是任何一个人类都无法构想出来的时候,这对我们又意味着什么呢?这个问题我觉得值得我们每一个人去深深地思考。

挑战用一百期讲懂 ai 大 模型架构,今天我们介绍合成数据的应用场景。第一个核心场景呢,就是大模型训练数据的补充和替代。真实的数据不够用,高质量的数据集又太贵,还容易踩合规风险。那尤其是医疗、金融这样的专业领域,数据采集难,合规要求高,时间会拖累整个模型研发的一些进展。 未来合成数据就能解决这个痛点,他能精准的去模仿真实数据的特征,生成大规模合规的数据级,补充真实数据的缺口。遇到像医疗病例、个人金融这样的敏感场景,合成数据甚至可以直接替代真实的数据, 既不影响模型的性能,又能直接去避免这样的数据隐私合规风险,省钱又高效。多模态的大模型也能靠它生成文本和图像、音频这样的融合数据能力再提升。 第二个场景就是大模型的隐私保护和合规的落地,这也是合成数据最突出的一个优势。随着个人信息保护法、数据安全法越来越严,那大模型真实数据的合规风险也就越来越高,尤其是敏感隐私的数据,而合成数据就没有这些个人信息,而是用这种模拟的数据来代替 真实的数据进行训练推理,又能杜绝这样的隐私风险。你比如说像医疗大模型,用合成的病例影像数据进行泄露 影像数据进行训练,不会碰真实的患者信息。比如说金融大模型,就可以用信用数据来合成。第三个场景就是领域专用大模型的定制化研发。专业大模型的核心是要贴合场景,真实的数据往往就覆盖不全、特征不准,满足不了定制需求,未来合成数据就能按需提供, 根据特定的领域进行需求定制化,模拟对应的数据特征和业务规律,生成专属的数据集。你比如说像工业设备故障检测模型,它就能模拟极端故障的数据,提升检测的准确率。 再比如教育大模型能够模拟不同学生的学习数据来适配不同场景的模型,让教育的服务更加精准化。第四个场景就是大模型的迭代优化和极端场景的测试。 大模型要不断的升级,就离不开大量的测试数据,尤其是极端边缘场景的数据,比如说像极端天气的图像、罕见病的病例,这些在真实场景是很难进行采集的, 而却对大模型来说就是一个很稳定性却事关关键的。那未来合成数据就能生成这些特殊的数据,帮助测试模型找到更精准的方向。

我们来看一下下一个的应用场景,就是第三种应用场景,就是数据治理智能体,数据治理智能体的话,我们先创建一个工具,叫做数据库的查询工具, 我们是这样做的,我们点这个空白应用,然后点这个工作流,然后我们起个名字,数据库查询工具, 导游区别之前我做的那么加一个演示查询 my circle 数据库创建, 然后开始这个节点的话,我们要加一个变量名称,写个 circle, 然后长度的话我们稍微长一点,因为我们这个是一个缩口,所以呢我们这里用段落好一点,我们可以弄长一点, 然后我们选择下一个节点,我们来点一个代码,执行的一个节点, 就是我们这里要输入一个代码,首先变量的话就是刚才我们定义的这个缩口,那它输入这是它的一个输入,我们点缩口, 然后它的取值呢也是缩口,那这里呢就会让我们去连接我们的一个数据库,然后这个的脚本的话也是放在本地的, 我们把这个代码给复制进去, 注意这里的 ip 地址尽量就选我们那个服务器的 ip 地址,不要写什么幺二七点、零点、零点一。 然后我们开始看下一个,下一个就是结束,结束的话就是把我们的一个结尾输出, 这里要添加个变量,直接就输入结果就好了。然后我们保存一下 这里,它是调用这个 url, 我 们要生成这个 url 的 这个链接,那这个需要我们在本地执行一个连接 micro 的 一个操作, 就是执行一个 python 脚本就可以了,就是这个脚本, 这个脚本呢?它是基于 flask 的 web api 服务, 我们可以把它拖进来, 那直接执行就可以了。

挑战用一百期讲懂 ai 大 模型架构,今天我们介绍合成数据的应用场景。第一个核心场景呢,就是大模型训练数据的补充和替代。真实的数据不够用,高质量的数据集又太贵,还容易踩合规风险。那尤其是医疗、金融这样的专业领域,数据采集难,合规要求高,时间会拖累整个模型研发的一些进展。 未来合成数据就能解决这个痛点,他能精准的去模仿真实数据的特征,生成大规模合规的数据级,补充真实数据的缺口。遇到像医疗病例、个人金融这样的敏感场景,合成数据甚至可以直接替代真实的数据, 既不影响模型的性能,又能直接去避免这样的数据隐私合规风险,省钱又高效。多模态的大模型也能靠它生成文本和图像、音频这样的融合数据能力再提升。 第二个场景就是大模型的隐私保护和合规的落地,这也是合成数据最突出的一个优势。随着个人信息保护法、数据安全法越来越严,那大模型真实数据的合规风险也就越来越高,尤其是敏感隐私的数据,而合成数据就没有这些个人信息,而是用这种模拟的数据来代替 真实的数据进行训练推理,又能杜绝这样的隐私风险。你比如说像医疗大模型,用合成的病例影像数据进行泄露 影像数据进行训练,不会碰真实的患者信息。比如说金融大模型,就可以用信用数据来合成。第三个场景就是领域专用大模型的定制化研发。专业大模型的核心是要贴合场景,真实的数据往往就覆盖不全、特征不准,满足不了定制需求,未来合成数据就能按需提供, 根据特定的领域进行需求定制化,模拟对应的数据特征和业务规律,生成专属的数据集。你比如说像工业设备故障检测模型,它就能模拟极端故障的数据,提升检测的准确率。 再比如教育大模型能够模拟不同学生的学习数据来适配不同场景的模型,让教育的服务更加精准化。第四个场景就是大模型的迭代优化和极端场景的测试。 大模型要不断的升级,就离不开大量的测试数据,尤其是极端边缘场景的数据,比如说像极端天气的图像、罕见病的病例,这些在真实场景是很难进行采集的, 而却对大模型来说就是一个很稳定性却事关关键的。那未来合成数据就能生成这些特殊的数据,帮助测试模型找到更精准的方向。

挑战用一百期讲懂 ai 大 模型架构!大家好,今天我们讲解合成数据未来的发展和创新。随着大模型的不断迭代,真实数据的短缺、合规风险、隐私保护这样的问题就越来越突出。而合成数据的作用是作为一种新型数据来进行补充,它是有一些好处,主要是包括合规、可控、可定制化, 逐渐成为大模型研发和落地的重要补充,甚至在部分场景下可以完全替代真实数据,未来的应用空间也十分的广阔。那什么是合成数据?是指通过算法模型,比如说像生成式 ai 模拟真实数据的一个分布特征、结构规律生成,具有和真实数据相似的统计特性, 但是它不包括真实的个人信息,不涉及隐私泄露这样的一些风险。但是它可不是一个简单的真实数据的一个复制,而是基于数据这样的一些特征,通过算法生成全新的数据,既能保留真实数据的特征, 又能就又能有效地规避真实数据的合规风险和隐私泄露。问题是大模型数据体系的重要组成部分。当前合成数据已经在大模型的研发和落地中得到了初步的应用,但随着生成式 ai 技术和大模型技术的不断创新,合成数据的应用场景也在不断地拓展, 创新方向也会变得更加多样化。下一期我们就会重点讲解合成数据的六大未来应用空间,包含大模型的研发、行业落地、隐私保护等多个领域,精准的去呈现他在未来的一个发展的潜力。

这个是我们做的一个大模型测试报告的一个工具啊,用什么显卡,什么大模型,很快就能给出一个结果。比如说在这边我们可以看到显卡的一个工号啊,显存占用,这里总共是九十六 g, 显存占用了八十七 g, 温度是三十一。 在这边呢,我们可以选择要测试什么,一般来是测试并发数据吗?比如说这里测试的起步并发是十,最高并发是一百,意思就是说他会从十一直测到一百个并发,然后测不同的这个头等数量和速度。这边雨料库呢,就可以选择自己的雨料库,也可以选择公开的雨料库, 这个可以自己上传的,当然也可以用我们提供的语料库。那么点击开始很快呢,他就会跑完这个测试,这边就开始在运行了,这里可以看到他的核心利用率啊,都一直在变化,然后这边会显示他的进度啊,比如说现在攻克到八十平方,攻克到一百平方,这五杠五已经快完成了, 然后这个最终的结果就出来了,从十平方、二十平方、四十平方,八十平方、一百平方,每一个的这个偷看穿透量都可以看到,会有一个表格的方式去呈现, 以及这个 r、 p、 s, 然后呢手自延迟,这些都是行业标准的一些数据,这样很快的我们就能看到不同的显卡啊,针对不同的模型,它的速度怎么样?很方便我们去做这个机器配置或者去研发。

抓了浙江,用 ai 揪出个贪官,准确性相当高。浙江有个干部负责当地工程项目的招投标,他给特定公司量身定制招投标参数,暗箱操作, 自认为手段很高明。但他不知道,浙江搞了个公权力大数据监督平台,专门盯着招投标数据。这 ai 有 多深,他能一眼看出哪个专家打分偏了心。比如超过三个专家的最高分,都不约而同的给了同一家公司, 系统就会立刻预警它还能看穿哪些量身定制的项目。你以为你设置的参数很专业,外人看不懂,但在 ai 眼里啊,这就是唯一标串标的明显信号,直接提供线索,线头一查一个 准。哪怕是你几年前干的事,只要数据录进去, ai 就 都能给你翻出来,在大数据面前,根本无处可藏。这个案例啊,只是开始,如果全国各领域都装上这样的 ai 天眼,估计很多人要睡不着了吧。

建设行业真的要全面进入数据监管时代了。在重庆做勘查设计的室内企业和入语企业,今年开始真的要重视信息报送了。重庆建委的一号文,我用三句话说清影响。第一,进场门槛变了。 企业要先完成信息报送并公示,才算具备在重庆开展勘查设计活动的合规前置条件。后续招投标监管和审查环节会以此作为查验入口。 第二,过程节点变了。签了合同到出成果文件之前要报人员信息,季度信息也要按时上报。企业基本信息变更也要在期限内补报漏一次可能在招投标监管、外业检查出涉审批、施工图审查这些环节被卡住。第三,结果联动变了。 报送信息既会被按年度累计次数出发约谈、通报、屏蔽等惩罚,也会被纳入日常动态核查事项。 营业不合格会直接标注资质异常影响业务成乱,整改期满人不通过,将会面临撤回资质或注销入鱼信息的风险。 现在你可以把它理解成一个新的监管逻辑,先把企业和项目的关键数据放进系统,再按节点持续更新 监管,在多个业务环节用同一套信息去核对,一旦对不上,就会走补正、整改、处罚和联动处置。过去信息报送是走个形式,现在它是企业经营的底线,辞职问题就找知讯。

最近发现一个超猛的 ai 股市分析工具,上线才四个月, github 直接狂飙两万加薪!他能全自动实时盯盘大 a, 不 用你手动看盘,查数据,板块涨跌,资金流向,技术面分析,盘面情报,多维度专业分析报告直接推送到你手机, 支持市面上几乎所有主流 ai 大 模型和数据源。最绝的是你发张截图给他,他就能自动读图分析,准确率超高,还能自定义交易策略,做历史回测,复盘小白也能一键粉底部署,零门槛上手。想体验这款真正好用的 ai 看盘神器?右侧评论区。

在不断的练习过程中,大脑对乒乓球模型做了一次升级,一个模型分裂成多个子模型,一个专门处理削球,一个专门处理直球,一个专门处理悬球。 球飞来的一瞬间,大脑快速识别类型,调出对应的模型,提前预判落点和旋转。这时候你已经不是接球,而是预判了球刚离开对方的球拍, 你的身体已经开始移动。更有甚者,对方击球的瞬间,你已经从对方的落肩、坠肘、步伐、姿态中 肌肉记忆般的做出了你的回球策略,这就是高手的秘密。模型更细,反应更快,而这一切离不开庞大的数据支撑。国乒作为世界第一,其更有前辈们的经验加成, 这又是一种数据的积累传承。乒乓球运动是如此,你所见过的一切技能都是如此。 学习就是一个建立模型的过程,模型又是为了预测,现在出现了一个新的问题,你明天需要出远门,你不知道天气情况如何,这就为预测提出更高的要求。但问题来了,你作为一个个体, 寿命有限,精力有限,能录入的数据也有限。短期模型可以预测下一秒,但要预测明天,明年十年后 需要的鲜艳数据远远不够,这自然的就引出模型的演化。通常我们学习的方式是先积累数据, 再从数据中总结模型,这是规划法。但还有另一种方式,先建立一个模型框架,然后再用数据去验证、填充,这是演绎法,两种方式,两种思维。 而演绎法是先设计一个模型,可以先有一个粗糙的框架,让数据有处可放, 随着数据增多,框架可以不断修正、细化,这就是演绎模型的根本逻辑。先建框架,再填数据, 这让你想到了什么?古人面对更大的不确定性天气收场命运,他们用了同样的智慧,通过观察事物的规律, 新建立一个模糊的模型框架。周易、干支、五行四柱都是古人的模型框架。先有模型,再往里填数据,用于预测农耕事实。两千多年前,老子用一句话说穿了这件事的终极奥秘。 道法自然,道是万物的规律,自然是你所见到的事实。道法自然就是一切规律都隐藏 在那些你所见到的事实的客观世界。我们用几千年的不断记录、对比、参照、调整模型,并发现模型中的规律对应的事物变化。我们一直在用模型理解世界。

我们总觉得啊,训练 ai, 那 肯定又烧钱又费时,对吧?但如果我告诉你有种方法能让它变得更聪明,而不是更辛苦呢?今天我们就来聊聊一个叫 skill select 的 技术,它的核心思想简单说就是四个字,事半功倍。 来,咱们想个事儿,要是只用原来一小部分数据,比如说减少个八十四 percent, 就 能训练出同样牛的 ai, 这会怎么样?你想想看,成本下来了,研发速度上去了,那很多以前觉得太贵太慢搞不出来的应用是不是就有可能了? 没错,这正是咱们今天要聊的核心。那怎么才能做到呢?答案就是一项叫 skill select 的 新技术,你可以把它想象成一个超级聪明的淘金者,面对一座巨大的数据金山,它不是把所有沙子都过一遍,而是有本事直接从里面挑出那些闪闪发光的金块。 不过啊,要真正明白 skill select 到底有多牛,咱们得先聊聊它要解决的这个大麻烦。啥麻烦呢?就是现在搞 ai 训练,简直就是对海量数据的一种疯狂的依赖。 现在的 ai 啊,特别是那些能看图说话的,他们怎么学习的呢?说白了就是搞题海战术。这个过程呢,有个专业名词叫视觉指令微调,听着挺复杂,其实就是,呃,给模型海量的图片再配上指令,比如说这图里有啥,然后让他硬生生的学,看多了自然就懂了。 但问题来了,这种提海战术有个巨大的毛病,那就是数据涌于。你想啊,那么多的数据,里面肯定有大量重复的没啥用的信息。这就好比你天天给 ai 喂垃圾食品,吃的是挺多,但营养跟不上啊。 这种数据上的暴饮暴食啊,后果可不是闹着玩的。首先,烧钱烧算力这是肯定的,但更要命的是,它就像一个沉重的矛,把整个 ai 创新的大船给拖慢了。你想想,摩羯把宝贵的时间都花在学习那些翻来覆去没啥新意的东西上,这效率能高吗? 当然了,这个问题也不是今天才有的,大家早就意识到了,也想了不少办法去解决。但是呢,说实话,以前那些方法,效果嘛,总是差了那么点意思。 以前的办法基本上可以分成两派,一派就要基于训练的这种方法,为了挑数据,自己得先跑个训练。这就很搞笑了,为了省钱,反而先花一大笔钱,本末倒置嘛。另一派呢,就要无需训练的。 这个听起来挺美,对吧?可他的做法是把数据两两配对,一个一个比,你想一想,几百万的数据这么比下去,那速度简直慢到让人抓狂。而且他还经常抓不住重点,忽略了我们到底想让 ai 干嘛。 所以啊,这就轮到咱们的主角儿 sky select 登场了,他干脆就不玩儿以前那套了,带来了一种全新的思路,可以说是范式上的转变。他不再一个个儿地去比较,而是站得更高,用一种嗯,大局的视角来看待整个数据集。 你看,这句引文就说到了点子上,他说的是啥呢?就是别再纠结于这张图和那张图有啥区别这种细节问题了。 schelsy like 换了个问法,他问的是这个数据样本对于撑起我们整个知识体系的股价到底有多重要,看到了吗?他关心的是每一个个体对整体的贡献。 这个比喻我特别喜欢,就是一个专家级的图书管理员。你想啊,老的办法就像是把图书馆里每一本书都跟另外所有书比一遍,看内容是不是重复了,这得累死。 但 scout select 这位管理员呢?他上来先不看书,他先看整个图书馆的布局,哦,这边是历史区,那边是科学区。然后呢,他再为每个区域挑出那么几本最核心、最能代表这个领域的书,这思路一下就打开了,对吧?那么问题来了,这位聪明的图书管理员具体是怎么操作的呢?咱们这就来看看他的工作流程。 其实啊,整个过程就两步特别清晰。第一步,他先给每个数据点都创建一个招标,这个招标是跟我们的指令相关的。第二步就是根据这些招标选出那些最有影响力的样本。简单说就是先看懂再挑选 好。我们先看第一步。比如说,你给 ai 一 张图,问他这辆八十是啥颜色的 skill select 干的第一件事就是悄悄地看一眼 ai 的 注意力,也就是为了回答你这个问题, ai 的 眼睛主要在看图里的哪个地方。这么一来,他就确保了接下来的所有分析都是围绕着八式颜色这个核心问题来的,不会跑偏。 然后就是最关键的第二步了,还记得咱们说的图书管理员吧, scare select 现在就要开始给整个数据级分区了,识别出里面的主要主题。这就好比找到了图书管理的一个历史区、科学区, 然后他会给每个数据项目打个分,看他对定义自己所在的这个区有多重要。分越高的,说明他越是这个主题的代表作,那价值自然就越高。 这儿就是它最厉害的地方了。因为 scale select 它不需要两两比较,所以它的计算速度是限性的,超级快。啥叫限信?简单说就是数据量翻一倍,计算时间也差不多就翻一倍,而不是像以前那样翻四倍、八倍甚至更多。 正是因为这个特性,它才能轻松地处理那种几百万甚至上亿规模的超大数据。结,这在以前简直想都不敢想 好理论咱们聊得差不多了,是骡子是马,得拉出来遛遛。 scan select 在 实际测试里表现到底怎么样呢?我只能说结果非常惊人,你猜怎么着?结果显示啊, scan select 只需要从原始数据里精挑细选出仅仅百分之十六的数据, 就这么点数据,它训练出来的模型性能就达到了用全部数据进行训练时,你听好百分之九十七点五的性能。我的天,这简直就是花小钱办大事儿,用一小部分成本干了几乎所有的活儿。 咱们来看点具体的数字,这张表里的结果啊,真的会让你惊掉下巴。你看,在 l v v 九 v 这个模型上,用百分之十六的数据,性能就达到了差不多百分之九十八,这已经很厉害了对吧?但真正疯狂的还在后头。 你看这个匡问模型,同样只用百分之十六的精选数据,性能居然超过了用全部数据训练的模型。你没听错,是百分之一百零四,它居然更好了! 你看这句引文就证实了我们刚才看到的这个有点反常识的结果,这说明什么?这说明啊,原始数据里不光有垃圾食品,甚至还有毒药,你把这些拖后腿的东西都给它剔除掉,只为给 ai 最有营养最精华的部分,那它的学习效果可不就比什么都吃的大胖子也好得多吗?