粉丝1664获赞3.5万

首先我们要收集需要的文件,进入解锁式搜索界面, 填入我们写好的解锁式开始解锁。 这里我做了些简单过滤,各位可以根据自己的需要自行调整过滤条件。 点击导出,选择你想要的格式,记录内容,切换为全记录与引用的参考文献。最后点击记录,依次导出全部需要的文献即可。 到这里我们的素材就收集完了。进入下一步, 打开 exe 文件, 进入我们的工具,点击新建项目, 项目名称可以自己起,我这里直接使用课题名称。点击上传数据, 选中我们下载的文件, 打开, 选中数据来源后保存进入。第二步, 点击 ai 审核数据结构,工具会自动帮你判断清洗数据。 完成,我们简单过一下报告,点击确认审核并开始去重分析,工作台会在这步自动进行数据清洗和图像生成, 完成后会进入第三步, 我们可以在这里确认图像内容,并做一定的修改。 最后我们点击生成论文及最终交付包, 就可以得到完整的论文出稿了。

接着往下我们就来到一个非常核心的办法,它叫做广益插分法。广益插分法呢?它的一个原理是什么样子的呢?就是原本这么一个模型, 哎,我好像因为 miu t 它存在自相关,我不太能估计,估计出来的结果呢?估计出来的 b 零跟 b 一, 它是有问题的,对吧?那么我就推大家进行一波操作,操作变换得到这么一个模型,得到这么一个模型之后呢,我的这个 miu t 啊,变成了 v t, 而 v t 呢,它是满足我基本目的 基本假设的。那么我可以对这个模型进行普通最小的乘法进行估计,但是我估计出来的时候,我 b 一 有,对吧? b 一 就是 b 一, 但是我 b 零没有了, 对吧?我 b 零跑不知道跑到哪里去了,所以说到最后的时候,我还要把这个 a 啊,变成我这个 b 零啊,变成我这个 b 零,为什么呢?其实很简单,你看啊,假设这是一个收入跟支出的式子, x 表示收入, y 表示支出,那我这里面 b 一 表示的是什么?表示的是收入跟支出他们之间的一个关系。然后 b 零表示的是什么?表示的是我收入如果为零的话,我的支出会有多少?就像是我们的最基本支出,对吧?我就算不工作不干嘛,但是我也会花钱的, 对吧?这是绝对的,所以说这个就是我们基本之初,这就是 b 零跟 b 一, 它的含义。但如果我把它变成这么一个式子,这个式子虽然是非常完美,它符合古典基本。假设它估计出来的 b 一 跟 a 是 非常好的,但是 b 就是 这个 b, 我 不用管它,但是这个 a 你 要看这个 a 的 话,它没有任何的含义,因为我 x 心是这个东西, 外心是这个东西,我把它估计出来没有任何的含义,对吧?它没有任何的含义能够说,所以说我要把这个 a 再重新变换一下,把它变成 b 零,才能有它具体的一个含义啊,才能有它具体的一个含义。然后呢,这里面我需要你掌握一元和一阶自相关的一个推导啊,推导这个广义差分法需要你掌握一下,然后我们来讲一下啊, 我们来看一下,我们就只讲一元跟一阶的,因为这个需要掌握 一元一阶长这样,一元长这样。然后呢我们把假定它是一阶自相关长成这个样子,其中呢 v t 是 满足古典基本假设的。那么首先我们要做的第一步呢,是把它们全部都滞后一期,就把这个这个这个这个全部都滞后一期,也就是这里面的所有 t 都变成 t 减一, 这个好理解吧,对吧?所以 t 都变成 t 减一。然后第二个呢,就是让模型两边同时乘以肉,这个乘以肉,这个乘以肉乘以肉,这个好理解吧,对吧?乘以肉,然后呢让一式,这个是一式,然后减去二式,得到这个结果,哎,长成这个样子, 这个也好理解吧,对吧?然后呢又因为式子太长了不好看,那我就把它变成外心,把它呢变成 a, 把它呢变成 x 星,把它呢变成 v t, 哎,又非常的巧,这个东西刚好减一减,它就是 v t, 对 不对?所以说我就不需要令了,它就是 v t, 那 最后得到的结果,这个 v t 是 不是就满足我们这个假设了,对吧?这是非常非常棒的一个操作,我的目的就是为了凑这个 v t, 因为我整个柿子回归的好不好,就是看我这个 随机扰动项他到底随机误差项他到底好不好,对不对?他现在变成 v t 了,他非常好,所以说我对这个式子估计就可以了。然后估计完之后,假设啊,我们对这个式子估计用普通最小的乘法,估计出来,他外心是等于二加三倍的 x 心的, 那么这里面的话,这个三是 b 一, ok, 没有任何的问题,我可以直接给他放到这边,但是这里面这个二他是 a a, 没有任何的含义,所以说我需要把这个 a a 是 等于什么? a 等于这个,对吧? a 等于 b 零 乘以一减六,所以说我这里面的话,要把这个 b 零单独拎出来,让它二除以一减六,得到的结果就是我的这个呃 b 零,然后我把这个 b 零带进去,把这个 b 一 带进去,得到的结果呃 b 零就是四,然后 b 一 就是三,对吧?这个是一个我最需要的式子,得到这个方程 才是估计结束了啊,才是估计结束了这个方程。那么这个模型呢,叫做广义差分模型啊,这个模型叫做广义差分模型,要知道要会写啊,写的最多的就是广义差分模型了,非常的重要,我们可以看到题,就比如说, 嗯,想一想啊,就比如说这道题,这道题呢,你看他对这个模型跑了一遍普通最小二乘法,你看就这个式子 是不?刚我们推导那个式子对他跑了一遍普通最小的乘法得到的结果呢?长这边和这边这两个东西,对吧?这两个东西你把它估计完之后啊,你不能把它直接写出来了,因为你这个式子写完之后,它是 y 星,然后这个是 a, 这个是 b 一, 这个是 x 星,对吧?那么这个式子呢?它不能直接用,不能直接用,所以说我要把这个 a 给它除一下,你看除以一减六,看到没有?这边除以一减六,这个就变成 b 零了。然后呢这个是 b 一 可以直接用的,那把它带回到原本的那个式子里面去 啊,原本的那个式子啊,不是放到这个式子里面,这个式子没有用的,因为这个式子只是为了推导出我们的 b 零跟 b e 而已啊,只是为了推导出 b 零跟 b e 而已。所以这个就是我们的广义差分法,广义差分法的一个最终的一个核心,其实就是把这个 v t 啊构建出来啊,把这个 v t 构建出来,这个就可以了。然后呢我们接着往下 刚刚我们讲的广义差分法,广义差分法里面这个肉啊,我是不是直接跟你说相乘就可以了?但是这个肉是怎么来的呢?对吧?我都没有跟你说这个肉应该怎么来,所以说呢,我们现在要具体来看一下这个肉应该是如何构建的,我们来看一下 这个肉呢,其实构建其实非常简单啊,肉构建的方法呢?首先第一个用 dw 检验,还记得我们刚刚讲的那个等式吗? 两倍乘以一减肉,对吧?两倍乘以一减肉这个关系式,那么这个东西呢,其实你就可以把肉单独用 dw 来计算,对吧? dw 他 每次都会给我们,所以说 dw 可以 计算,但是这里面你要记住一个点啊,他是大样本的情况,并且是一阶自相关才能用。 在这种情况下的话,一般来说我们课本会给出提示,就是这样,如果存在一阶自相关的话,那么请用 dw 值来 估计,请用 dw 来估计啊,这个是比较好理解的啊,这个我觉得是很好理解的,然后那这就是第一个,那第二个呢?就叫做渡兵两步法来进行估计。渡兵两步法估计怎么估计呢?它其实也是非常简单啊,它前面这部分操作跟我们刚刚的广义插分法都是一毛一样的,对吧? 这个就是广义乘分法,那个广义乘分模型嘛,对吧?你就把这个变成 y 心,变这个变成 a, 这个变成 x 心,它就是了。但是我们到这一步以后,我们不这么做,我们怎么做呢?我们把这个移到式子的右边去,把它变成这个样子, 把它变成这个样子之后,哎,我对它你也可以觉得它复杂,你就把它变成下面这个,把它变成 a 零,然后把它变成 a 一, 把它变成 a 一、 a 二这些东西,把它变一下也可以,或者你直接对着这个做一遍,普通最小,呸,普通最小的乘法 evos 图跑一下得到的结果,得到结果之后,哎,我这个 y t 减一,前面是不是会有个系数?得到这个系数它就是我们的肉,它这个系数就是我们的肉啊。我们来看一道题, 这道题你看这道题,这道题它是 y t, 然后呢?这是 y, 然后呢? c, 然后你看这边 y t 减一,是不是给它放到式子里面去了?你看这个这么一个式子跑出来,结果是这个是 y, 然后这个是 y t 减一,然后这是 b 一, 这是 x, 这是 b b, 那 个那个减二,对吧?这个式子里面这个 y t 减一, y t 减一的前面系数是不是就是这个结果 啊?得到这个结果就是了。所以说你具体用哪个方法,题目里都会问啊,题目里都会问,只要你做过题,我相信你一方查的题你应该也做过了。你如果做过一方查的题,你会知道你所有的操作题目里都会给你规划好,只要你会知道这个知识点怎么用,他都会告诉你,你就用这个知识点去做就行了。

学虚拟变量就可以,虚拟变量是什么东西呢?它其实比较好理解的,它就是什么呢?就是我前面是不是给你提到过,就是一般来说我们的模型里面的东西,它都是 定量的数据,比如说,呃,身高啊、体重啊、 gdp 啊这些东西,它是不是定量的数据,对吧?那引入这个方程的话,直接让它 x 一 x 二 x 三,加加加加就可以了,对吧?但是如果我想引入个东西叫男女性别呢? 我怎么引他?我引不了啊,别人都是连续的,你是一个连离散的,甚至连吃个变量都不是, 对不对?所以说我这个东西没法引,所以说我难道把这个加个男吗?或者说加个女吗?这个不太好搞,对吧?所以在这个过程当中呢,我们这个虚拟变量就起到这么个作用,他把我们这种定性的男女把它取之为零。根一 这种人工变量呢,称之为叫虚拟变量,我们用字母 d 来表示。一般来说呢,当这个属性存在的时候呢,我们把它取一,当这个属性不存在的时候呢,我们把它取零,这个就叫做虚拟变量,那就虚拟变量。因为说我们看一下课本,比较简单的一个例子啊, 有这个群里面那城镇居民、农村居民,如果我要做区分的话,我怎么做区分呢?那就是这引入个 d, 一 为农村人,为城镇居民,零为农村居民,当然可以反着来啊,一也可以是农村居民,零也可以是城镇居民,都可以啊,都可以。然后男或女就业是夜宵那个旺季、淡季,对吧? 这个好理解这个好理解。那么这个是只有两种情况啊,男女他没有一个中性人,或者失业就业,他也没有个中间的变量,对吧?所以说这个呢,如果是两种属性的,那这个好理解。那如果是多个属性的呢? 像是这个啊,不是这个,像是这个吧?本科研究生大专,对吧?所以说这里面他就不能在一个里面直接给他写出来。如果是只有一个的话,那就是本科,或者说非本科, 或者说是其他,对吧?这个时候可以写出来,但他有三个属性,那这种情况下的话,我就可以写个本科,然后另外两个呢?我用其他来表示啊,用其他来表示,这个好理解吧?对吧?然后我们接着往下啊,接着往下就是虚拟变量引入它有什么作用? 虚拟变量引入它的作用是什么呢?作用第一个就是可以把我们的定性因素给它数量化,这个好理解吧?对吧?可以给它数量化。然后第二个呢,就是 提高模型的精确度,就是我可以把男女啊,或者说把一些呃人员的一些情况啊,给他引入到里面,让我们这个模型呢更加精确,这好理解吧,对吧?然后呢第三个就是变去处理异常数据, 什么叫异常数据呢?就比如说疫情是一个异常的时间节点,对吧?我们一般来说我们的 gdp 呢,增长是这么巴拉巴拉巴拉的,但是如果遇到疫情呢?哎,他可能就停滞了,然后再继续增长这段时间就是我们认为他是疫情的期间,那么我们就可以把这个 d 取之时间,呃,不是这个取一,然后取零,如果取一的时候,这段时间就是说呃,疫情这段时间,疫情这个时间怎么取呢?假设疫情是一九年开始,到 是什么时候算结束啊?二二年吧,算他二二年结束好了,二三年应该是二二年。二二年,那这个时候,那这个时候我就会认为这个时间是二零一九到 二零二二这块区间,然后这个呢,就是其他的区间啊,就是其他的区间,其他区间就是我们非疫情的区间,那这个区间呢?就是我们疫情的区间,可以来研究一下我们这个异常的数据啊,这就是处理异常,然后这个就是它影响的度。然后我们来看一下虚拟变量,它引入它的一个。呃, 规则是什么样的?它的规则呢?其实也比较简单,我们来看一下它,你读一遍这个我不知道你能不能理解啊?就是第一个就是如果电信因素有 m 个不同的属性,那么我只能引入 m 减一个虚拟变量, 否则会引起完全贡献性。如果有 m 个电信因素,则只能引入 m 个不同的类型, 引入 m 减一。在求和的一个群里边,这是不是听着非常的复杂,对吧?那么我们来到课本,我来给你讲一讲这是什么一个东西啊?这个的话呢,其实很好理解啊。呃,记住我这句话就可以了。书上那句话其实比较抽象,比较繁琐,而且他还有一些限定条件的缺失。那你听我这句话, 模型当中是否具有截距项来进行区分啊?模型当中是否具有截距项来进行区分?如果这个模型当中它具有截距项,就有这个 a 的 话,那么只能引入 m 减一个向量, 如果这个模型当中它没有截距项的话,可以引入 m 个向量,那么这个 m 是 什么东西呢? m 就是 我们所对应的属性,就比如说季节、春夏秋冬这四个可以用来表示吧?那它的 m 就 等于四, 四就是它的属性啊,就它的属性,春夏秋冬就它四个属性,那么这个就是它的四个属性。那如果是这么一个拮据项的话, 它有拮据项,那我只能引入三个,就也就是说我引入春,引入夏,引入秋,那我冬就不能引入了。或者说你看就这样,比如第一、第二、第三,我第四就不引入,那我第四怎么来表示呢?我如果要想来表示冬天,我怎么表示?我把它取零,把它取零,把它取零,是不是默认就是冬天, 对吧?把它取零,把它取零,把它取零,那留下来这个结果 y 等于 a 加 b x, 这个结果是不是就是默认是冬天了?这个好理解吧?那如果它没有解聚项,那我就可以把这几个全部引进去,那如果全部引进去的话,那么它取零,它取零,它取一,这个时候 冬天是不是 y 等于 b x 加 d 四了,对吧?两个是不一样的,刚刚这个是什么?是 a 对 不对?所以说如果他多一个截距项,那么这个截距项就是用来表示没有引入的那一个虚拟变量的一个因素。如果他没有截距项,那就把它全部引进去 啊,这个东西有个什么区别呢?区别还是挺大的啊。假设春夏秋冬我们用来表示春天、秋天、夏天、冬天他的一个销售量,那么请问 冬天如果是这个,我们先看这个,如果是这个的话,我们来看啊,他如果是冬天,我如果想问,呃,冬天比夏天 销售量多了多少?那么在这种情况下的话,冬天应该是什么?冬天?如果是第一个是 y 等于 a 加 b x, 这是冬天,然后第二个呢?是夏天,夏天是什么? y 等于 a 加 b x, 然后夏天是什么?夏天是夏天是第二, 对吧?这两个东西,然后两者做个差,是不是就是多的关系?那多,多的是谁?多的是不是就第二? 是吧?两者做个差,多出来的东西是不是就第二?我写的这边多的是第二,那么在这个时候,这个第二就不代表是冬天,就不代表是夏天的销售额了,而代表的是什么?代表的是夏天比冬天,冬天比夏天多的一个结果 啊?冬天比夏天多的一个结果了。那如果把这个换成三,那多的是不是就第三?第三是什么?第三就是冬天比秋天多的一个量,那么如果是这样一个值呢?来看一下,如果是这样子,依旧是冬天比夏天多,如果是冬天,它是什么? y 等于 b x 加上 d, 四, 夏天呢? y 等于 b x 加上第一,夏天是什么?夏天是第二,对吧?那好, ok, 这两个减减是什么?第四减第二,那这个是好理解的, 第四是夏天,呃,那个夏,那个秋天冬天的量,第二是夏天的量,两者减减就是冬天比夏天多,那如果冬天比秋天呢?就第三,冬天比春天呢?那就这个对吧?所以说这个是代表夏天比春天多,而这个 a 代表的是冬天比夏天多了。两是不一样的哦,一个是用它来表示,一个是用它来表示,两者具体的一个定义是不同的, 这个一定要做清楚啊。这个这个是非常非常重要的,这个是我们两种有洁具跟没洁具的时候,他在进行比较的时候,他在取值结果的一个区别。这个呢我们在里面后面有一个非常重要的题目, 就是这道题,冰箱的季节销,季节性与销售量,它这个是有洁具象的,有洁具象的时候,这个里面它引入了二、三、四,那就是引入了第二季度、第三季度、第四季度,第一季度没有引入,对不对?那这个时候如果让你解释 b 一 的时候,解释 b 一, b 一 是怎么解释? b 一 代表的就是第一季度的量, 这个量的明确啊,这个代表的是第一季度的量,那到这边来,如果他把他的截距项去掉了,去掉常数项,然后这里面啊,这个 b 一 代表的是第一季度的,那这个 b 二代表的是什么?请问 b 二代表就是刚刚我们说的那个 b 二代表什么? b 二代表的是 第第二季度比第一季度多的多少量,就跟我们刚刚说的是一样的。这个第二代表了什么?第二代表是冬天比夏天多的量了, 这个很明确。然后呢?下面这道题,如果我去掉常数项,那在这个过程当中我 b 二代表的是什么? b 二代表的就是第二季度它的销售量,这个要好理解啊,这个要好理解,这个你后面去做题就能比较好的理解好。

财经专业的同学啊,在大学期间都会学一门课程,叫做计量经济学,很多同学呢,这门课程学起来都很头疼啊,也不喜欢这门课程。那我本身呢,也是财经专业科班出身啊,但是现在呢,回想起来啊,我觉得计量经济学绝对是你将来在金融行业里啊,最用得着,也最能提升你竞争力的一门学科。 那这样经济学呢,本质上就是把金融经济学还有统计学啊揉在一起的。哎,一个核心的交叉学科,那说白了就是用数据说话的方式,搞懂金融市场,找出规律。呃,是现在金融行业做科学检测的关键工具。那随着金融市场越来越自动化,那他能用的地方越来越多,懂这门技术的人呢,也越来越抢手。 那么计量经济学到底有什么用呢?将来又能够在哪些方向去就业呢?首先是资产定价。哎,这是计量经济学啊,最基础也最重要的用处,核心就是解决这个金融产品到底值多少钱的问题。 金融产品的价格受太多因素的影响,你光靠经验猜肯定是不准的。计量经济学呢,就是把历史的交易数据啊,公司的财务数据,还有像宏观经济数据啊,都收集起来, 用回归分析,时间血液分析这些方法啊,找出真正影响价格涨跌的关键因素。然后呢,建出模型,既能够解释过去为什么会涨,为什么会跌,还能预测未来的走势。那也不管是投资者选股票,基金经理调仓,还是同行给公司 ipo 定价啊,企业做并购估值都离不开这个能力。 第二个是风险管理,这是所有金融机构命根子,而计量经济学正好呢,给我们提供了一整套啊,把这个看不见摸不着的风险变成具体数字的工具。 这样经营模型呢,可以量化分析不同类型的风险,比如说像市场风险、信用风险,呃,操作风险等等。那通过使用这些模型啊,风险管理者可以评估潜在的损失,制定风险缓释策略,并确保符合监管的要求 啊。第三个呢,是投资组合优化。投资组合优化,说白了就是在赚最多的钱和冒最小的风险之间呢,去找到最佳的平衡点。比如说像经典的马克维斯模型,哎,就可以告诉你怎么搭配资产最划算。资本资产定价模型 c p r 模型才会告诉你到底哪只证券更有性价比。那最终呢,帮助投资者根据自己的风险承受能力,搭配出最适合自己的投资组合, 把单个资产特有的风险给它分散化掉。第四个呢,则是经济预测。经济预测呢,是连接宏观经济和金融市场桥梁。 计量经济呢,会用过去几十年的宏观数据啊,去建预测模型,算出未来的通胀率,失业率, gdp 增速,还有利率会怎么走。那 这些预算其实太重要了啊,央行要靠它来决定要不要加息降息,企业要靠它来去规划明年到底投多少钱,招多少人。投资者呢,就要靠它来去判断现在到底是买股票呢,还是买证券。第五个呢,是事件研究法。 事件研究法呢,专门用来衡量某件大事,他对于金融市场到底有多大影响?呃,他会对比事件发生前后资产的实际收益和正常情况下应该有的收益差多少,看这个差值呢,是不是真的有意义, 还是说就只是偶然的波动啊?那既能够帮助投资者提前布局或者及时跑路,也能让公司老板知道自己的决策效果怎么样?呃,还有让监管部门看看政策到底有没有达到预期的效果。现在其实金融行业特别缺既懂金融理论,又会做数据分析的复合型的人才。 那接下来我们就来看看计量经济学,他的就业方向,他有哪些?首先呢是金融分析师啊,这是金融行业需求量最大的岗位了啊,像证券公司、金融公司、银行还有大型的这个企业,财务部都有。 那他主要就是用计量的方法去分析各种金融数据,写研究报告,预测市场走势,评估一个投资项目,他到底值不值得去投资。在投资机构里给金经理出主意,在企业里呢,帮助公司做投资和财务规划。 第二个呢是风险经理,这是金融机构里啊,管风险的核心人物。各金融机构呢,都必须要有专门的风险管理部门,那他们的工作呢,就是要找出公司可能面临的各种各样的一些金融风险啊,利用计量经济学的技术啊,去量化风险到底有多大?哎,盯住风险的变化,然后想办法呢,去控制住他。 呃,还要建立内部的这个风险评级的体系,算一算,哎,到底要留多少风险资本啊?呃,包括做压力测试呀等等,保证公司啊,符合巴塞尔协议等监管的要求。第三个呢是量化研究员, 量化人员啊,是金融行业里技术含量最高的岗位之一了啊,核心工作就是写代码,建数学模型,从海量的市场数据里边啊,找出定价不合理的机会,然后做自动化的教育策略,这样经济学的知识啊,在这个岗位上都会用到。 第四个呢是数据科学家。那数据科学家呢,也是大数据时代火起来的新岗位,金融科技公司和大的金融机构都特别需要。呃,他们要把计量经济和现在很火的记忆学习技术啊,结合起来,从海量的结构化、非结构化数据里边去挖宝,比如说做信用评分的模型,反欺诈模型,客户流失预警模型等等。 呃,还有现在很流行的像什么智能头部系统都是他们的工作成果。那么对于想要投身金融领域的同学来说哈,系统的学习计量经济学的知识,熟练的掌握二语言呀, python 呀, start 啊,这些常用的工具啊,绝对是提升你自己竞争力, 打开职业上升通道的关键。要不然随着人工智能和金融结合越来越深,计量经济学的用途只会越越大,那价值呢,也会越越高。

我花了一个多月,把文献计量学的工作内容放进了一个软件中。传统流程里最耗时间的是数据整理、跑图、调参和结果写作,而筛选数据、清理、图像生成、 按格式生成论文都是爱爱擅长的工作,所以我就通过 live coding 来做了一个这样的软件。本期视频就是我的成果展示, 三十分钟带你完成一篇文献计量学。本次流程总共花了十六分钟,算上从数据库下载文献的时间,差不多在三十分钟左右,并且中间的筛选、审核、图像生成、 初稿、转载全部交由大模型自动进行,文献计量学轻松搞定不在话下。这里生成的图片是可以进行验收和修改的,我这里只展示最后结果就跳过了, 现在我们去验收一下。成果压缩包里是我们所有已上传的文件、过程文件、各种格式的图片及论文初稿。

hello, 大家好,我是果粒数据分析,每天一分钟带你解决一个报错数据从 excel 导进来,全是红色的,三个命令带你从函数型转成数值型。首先我们导入数据,从数据可以看出来,变量都是红色的,属于函数型变量。 第一步, district。 如果你的输入列全是纯数字字母串,这条命令就够了,跑完会变黑。 但是从这里会发现,这里报错了,说明里面有万元元这种字或者空格,比如九千前面有一个细小的空格。第二步,加个 false, 能转的转,转不了的,看一下丢了几个 missen。 然后我们来用这个命令看一下具体是哪些变量丢失了。 第三步, in code。 如果是学历,这种分类本科、硕士、博士别用 district, 用 in code, 它把字母标签变成带标签的数值回归的时候当成分类编码来用。 从这里就可以看出来,记一个原则,真数字用 district, 分 类用 in code 用反了。所以记住这三条命令就够你用了。

大家好,今天想和大家聊一个特别实用的话题, token 经济学。很多人用大模型只知道 token 会影响收费,但其实 token 不 只是计费单位,它还关系到模型如何理解,信息如何消耗、算力为什么长,对话会变慢,以及为什么一句提示词甚至可能改变模型回答的风格。 所以今天我们讲讲 token 到底为什么重要。接下来我们从这几个方面进行讲解。 token 这个词在大模型时代到来之前有两个含义,第一个是密钥,是一种用于身份认证和权限授权的数字凭证, 用来证明你是谁,以及你能访问什么。第二个是区块链的一种数字资产或者权益凭证,可以代表货币资产、投票权、使用权或者某种价值。 大模型时代到来之后,最常用的含义就变为了大模型的 token。 在 大模型里, token 指的是文本、图像、音频等数据经过 tokenizer 或编码器处理之后得到的基本计算单位。大模型的 token 到底是什么?大家看左边这幅图, token 就是 在大模型内部流动的信息,那么它是通过分词器将数据处理之后得到的。 因此 token 实则就是信息的代号,例如文本信息、视频信息、图像信息、音频信息等等信息的代号。大模型无法直接处理这些原始信息,因此需要先将不同模态转化为可计算的表示。大模型的 token 到底是怎么生成的?有哪些类别呢? 文本 token 生成方式,有机于空格的字体分割 bp 子词分割 word piece, sentence piece 纯字体 token。 音频 token 生成方式是音频编码器或者离散化模型,将音频分帧并量化为离散变量 图像。 token 生成方式是将图像划分为 patch 或者按像素编码为 token。 多模态 token 生成方式是每种模态单独 token 化,然后共享,应摆定对齐。 token 为什么会带来成本?因为每一个 token 进入模型都需要参与计算。如果是输入 token 模型,需要先做 prefill, 也就是把整段输入上下文,一次性编码进去,建立当前对话的上下文状态。如果输入很长,比如一整篇论文,一次性编码进去,建立当前对话的上下文状态。如果输入很长,比如一整篇论文的上下文状态,如果输入量和显存压力都会上升。 如果是输出 token, 模型是一个一个生成的,它不是一次性把整段回答全吐出来,而是生成第一个 token, 在 基于前面的内容生成下一个 token, 所以 输出越长,等待时间也越长。这就解释了为什么 token 增加后,计算成本、时间成本和 api 费用都会上涨。很多人以为大模型像人一样记住了前面的聊天 看。实际使用中更常见的机制是,每次你发新问题时,系统会把前面的历史对话和当前问题一起拼成新的上下文,再送给模型处理。也就是说,你问到第十轮时,模型看到的可能不是只有第十个问题, 而是前面九轮对话加上当前问题。这就会导致一个问题,对话越长,输入 token 越多, prefill 计算越重,成本越高,响应也可能越慢。更重要的是,长上下文不只是费钱,还可能影响质量。因为模型需要在一大堆历史信息里判断哪些是当前任务真正相关的, 如果前面有很多寒暄跑题内容错误信息或者互相矛盾的指令,就可能干扰模型当前判断。所以长对话里真正贵的不是多聊了几句,而是历史上下文不断累积,占用了模型的计算预算和注意力空间。那有没有办法减少这种重复计算?有,这就是 prompt catching。 prompt catching 可以 理解为重复前缀缓存, 如果多个请求开头部分是一样的,比如相同的系统提示词、相同的论文原文、相同的任务模板模型服务,就可以把这部分前缀的计算结果缓存下来。下次再遇到同样的前缀,就不需要从头计算一遍,而是直接附用前面已经算过的结果。这里要注意一个技术点, prompt catching 主要优化的是输入阶段,也就是 prefill 阶段。它不是说模型直接复制答案,而是说相同上下文前缀的中间计算结果可以附用。我们接下来着重讲解 deepseek 的 缓存优化方式。首先是 prefill cache, 它主要解决的是长输入重复计算的问题, 比如系统提示词固定模板共用文档前缀反复出现时,可以把前缀部分的计算结果缓存下来,减少重复 prefill。 其次是 k b cache, 大 模型生成文本时,每生成一个新 token, 都要参考前面已经生成的内容。 如果每次都把所有历史 token 重新计算一遍,代价会非常大。 k v cash 的 作用就是把前面 token 对 应的 key 和 value 缓存下来,这样生成下一个 token 时,就可以直接附用已有的 k v, 指计算新 token 相关的部分。简单来说, prefer cash 主要服务于输入阶段, k v cash 主要服务于生成阶段。最后是 m l a, 也就是多头潜在注意力。它的核心思路是压缩 k v cash, 因为长上下文场景下, k v cash 会占用大量显存, 尤其是上下文越长,层数越多,投诉越多,缓存压力越大。 m l a 通过更紧凑的潜在表示,也就是引入 latent kv 进行低质压缩 来减少 kv 缓存开销,从而提高长文本推理效率。在一系列技术的加持下,一位 web 开发者在 reddit 上发帖称,使用 deepseek 的 api 单日消耗八千九百万 tolkien, 命中率高达百分之九十八,极大地降低了开发成本。 前面讲的是成本和效率,但 tucker 还有一个容易被忽视的作用,它会影响模型的行为状态。大模型在预训练阶段学习了大量文本模式,可以理解为它见过很多知识、语气、角色和表达方式后,训练阶段又会把模型调成一个更安全、更有帮助、更像助手的状态。但是模型每一次回答都会受到当前上下文的影响。 也就是说,你输入的 token 不 只是传递信息,也是在给模型提供一种语境和行为暗示。比如你说请你严谨的分析,模型可能会变得更谨慎。你说大胆一点给我想法,模型可能会更发散。你说你必须支持我的观点,模型可能会受到立场诱导。 所以从模型生成机制上看, token 并不是完全没有影响的,它不只是传递内容,也会改变当前上下文的语气、角色和任务框架,从而影响模型后续生成的倾向。这也是为什么 prompt 里的一些礼貌词、 情绪词、身份设定、价值判断看起来没什么技术含量,但实际上可能改变模型的输出风格。 token 经济学不是让我们一味少说,而是要区分高价值 token 和低价值 token。 高价值 token 是 什么?比如明确任务目标、提供必要背景、 说明判断标准、给出输出格式、提供高质量视力。这些 token 虽然也会增加长度,但它们能提高模型回答质量,所以是值得的。低价值 token 是 什么?比如大量重复寒暄、无关背景模糊、要求情绪化表达、过强的立场诱导。这些 token 不 仅会增加成本,还可能让模型偏离原本任务。 总结来说就是 prompt 不要追求长,而要追求有效。真正好的 prompt 是 用尽可能少的 token, 让模型获得尽可能轻触的任务背景和判断标准。本次分享到此结束,谢谢大家!

经济学 s s c i。 刊分享,一到四区全覆盖,好中又快头一区顶刊。 social economic planning sciences 分 区,经济学大类一区 top j c r q。 一 影响因子,五点四 收稿方向,经济政策分析、可持续发展、区域经济规划、数字经济与产业转型、公共政策评估。特别青睐量化实证加政策建议结合的研究 建议 elsefear 出版出神,仅四天,平均六十天录用,适合有政策影响力的高质量研究,对交叉学科友好。 二区优选。 economic modeling 分 区,经济学大类两区, j c r q。 一, 影响因子,四点七收稿方向,宏观经济建模、计量分析、经济预测、金融市场模型、数字经济影响评估。 特别欢迎理论模型加中国时政的研究建议。 alfware 出版,审稿周期约二到三个月,录用率约百分之三十五,适合有扎实计量基础的时政研究,支持快速出版通道。 三区稳头。 public choice 分 区,经济学大类三区, j c r q。 二,影响因子,二点二 收稿方向,公共经济学、政治经济学、制度经济学、博弈论、应用、公共政策分析、接收理论创新加实证检验结合的研究 建议 springer nature 出版,出审仅三天,平均七十天录用,录用率约百分之四十年发文量一百五十左右,无预警风险,适合投稿,受挫后的稳妥选择,方法规范即可,四驱保底。 journal of economics 分区,经济学大类,四驱 g c r q。 二影响因子,一点七收稿方向,微观宏观经济理论应用经济学计量方法、产业组织接收规范、时政论文和理论拓展研究 建议,审稿平均四个月,一周内反馈反修意见,录用率约百分之七十是硕博毕业清交保底的 s s c i 保险箱适合数据完整但创新性中等的研究。投稿小技巧, 一到二区重视理论创新和政策价值,三到四区更看重方法规范和数据完整性。 公共经济学政策研究优先选 public choice, 计量建模首选 economic modeling, 政策研究优选 social economic planning sciences。 毕业保底强烈推荐 journal of economics。

一定要清楚流程啊,一定要清楚流程就是你的 c 应该取多少啊?然后让你要取两边的,这个取的是谁?他可能会给你很多个,给你 tss, 给你 ssr, 给你什么 东西,这个东西对吧?你要能清楚啊,一定要能清楚,这个大家能清楚就 ok 了。然后呢我们再往下, 呃,哥德菲尔的旷特检验,这边就到此结束啊,这边就到此结束。然后呢我们可以来看一下这个检验,叫做怀特检验啊,怀特检验,怀特检验呢是非常非常重要的一个检验,这个检验的话我们先不讲,我们先讲呃,课本上的这这这几个检验, 一个这个布鲁斯帕根格列检验,这是一个非常基础的检验,这个检验呢是涉及我们统计学配集物的一学,所以我们一方叉自相关多重空间型后面所有的东西的里面的一个非常非常基础的检验,它提出了一个核心的内容,叫做 叫做什么呢?叫做这个东西辅助回归模型检验。辅助回归模型检验就是它不是用本身进行检验的,像我们刚刚那两个例子,要么就用图,要么就是用它本身的数据进行检验,对吧?那这里面呢,它会提出一个东西叫辅助回归模型检验,大家能弄清楚啊,你看它是这个非常常用的一种一方差减值的过程。 我们首先知道我们的回归模型呢,讲这样对不对?如果是同方差,那意味着方差是不是等于这个,对吧?一个常数或者它有个等价的关系,叫做一个或多个解释之变量之间不相关, 对不相关嘛?就 c o b 这个东西,就是我之前讲过那个 c o b 等于零不等于零的那个情况,对不对?不相关一方差就意味着随机误差向它的方差等于这么一个变量, 或者说他的解释变量之间呢,会存在相关性,会存在相关性。那么就这个东西就很好来说了,如果他存在一定的相关性,相关性代表什么意思?是不是代表变量之间可以相互解释,或者要相互表示对不对?那在这个过程当中,我们就可以写出 随机误差项跟我们 x 之间的一个方程形式这样子,因为我们这样说,他 与它会存在一定的相关性。为什么?这句话其实可以再这么理解啊?如果是同方差, v a r m t 等于六方,它如果是同方差,是不是代表我这个里面不存在任何其他的 x 的 变量信息,对不对?可以这么理解吧。那如果是等于 t 的 话,这个当中它是异方差,是不是代表我这里面可能会出现其他的 x 的 其他信息,对不对?所以说这个东西就代表可以与它呢变量相关, 这个呢就代表与这个变量呢不相关的意思啊,可以这么理解,就相关与不相关。那么我就列出我这个 mutt 跟其他这个方程 x 相关的一个方程,让它们列出这么一个方程。那列出这么一个方程的话, 怎么说呢?我如果这个方程我对它进行为我的假设检验,我对它进行哎 t 检验,对它进行 f 检验,然后呢对它进行别的检验,我来研究这个方程对它到底有没有显著性影响,哎,如果这个方程对它有显著性影响,那是不是说明这里面 x 至少有一个 会对它有影响?那是不是就说明它们之间会存在相关关系,对不对?这个大家能清楚,这个项链是一个非常容易的点,所以说呢,我把这个方程列出来,然后呢对它列出一个假设, 就是这他们全为零,全为零的意义是什么?就代表这个为零,这个为零,他这个方差后面没有了,为一个 a 零,就为一个长竖向,这个意思就是说这个东西为什么为同方差? 为同方差如背折。假设呢?就是一方差的意思啊,一方差的意思,那在这个过程当中呢?因为我们是用它来进行估计的,而它是什么?它是总体的一个方差,我们一般来说是得不到总体方差的,所以说可以通过普通最小的乘法呢,先对模型跑一遍,跑一遍得到残差项 e t 让他呢来近似估计。这个这个我们在前面的课经常有题,对吧?前面的课经常有题,在这个过程当中,这个方程就变成他了,就把他稍微变一变而已,那这个东西就是称之为我们的辅助回归模型啊。辅助回归模型,我们对这个模型再跑一遍普通最小二乘法, 就可以得到他的 f 值,得到他的 f 值,或者得到一个这个东西, 这个叫拉格朗的陈述,拉格朗的陈述,那拉格朗日,拉格朗日可以通过 f 检验跟拉格朗日这两个东西来判断它这个东西是否存在。一方差,可以通过这个这个东西来判断。我们可以看一下啊, 就这个假设,我们原方程呢长这样,原方程长这样,然后呢通过普洛斯帕帕,普洛斯帕根格雷检验呢?得到的结果长这样, 这个东西是什么?这个东西其实很简单,这个东西其实也是一次普通最小乘法的估计,只不过它估计的式子是谁?是这样子的一个式子, 对不对?估计的是这样一个式子,所以说得到的结果呢?是长这样的,你看它的这个字变量是呃,音变量是谁?一方一平方,对吧?然后呢它的这个还是普通最小乘法,然后个数是二十八个,然后下面是 x 跟 c, 这里面这个 x 是 什么意思?是这个是这个, 因为我们检验的这个,因为它它这道题目是有一道例题的,例题的话运用的是那个,所以它就用这个东西来判断它是否存在一方差。然后这个东西我们应该如何判断? 如何判断呢?我们应该看这个东西,这个就是 f, 这个就是 o、 b、 s r 方,什么意思?我们就看前面这个东西,你看 这是不是 f, 他 说了可以对这个方程通过 f 跟拉格朗日来进行检验,检验的结果就是这个,一个是 f, 一个是这个拉格朗日。拉格朗日是什么呢?是 n r 方, n 乘 r 方也可以看成是自由度为 k 的 卡方检验啊,他可以看成是自由度为 k 的 卡方检验,所以说我们可以看这个,这个就是布罗斯帕根格菲利检验。怎么看出来的?看这边 写了啊,布洛斯帕干戈夫列检验,这个结果就是 evos 图,你要会看这张图,你要知道它是布洛斯帕干戈夫列检验,你要知道它是检验一方查的,你这些你都要知道啊,你要知道,然后呢这个东西应该如何判断呢?就是看它这块东西就可以了,这块东西你要会看就可以了。首先第一个 f 检验, f 减一的话,给出这个是 f 的 值,然后呢这个是 f 的 自由度以及 f 的 那个,对吧?然后这个是 f 的 p 值,那这个其实就很简单的 p 跟 r 法进行比较,零点零五小于,所以说它是存在一方差的,对不对?如果是不小于,它是同 就是同方差,如果是小于,是不是?拒绝原假设,接受背折假设,那就是 h 一 h 一 是什么?存在一方差,对不对?那一样的,下面这个也是一样的,这是什么? n 乘以 r 方的意思, n 乘以二方,这个是什么意思?这个是自由度的,这个是这个这个东西这个单词的意思,对不对?这个单词代表容量的意思,容量乘以二方,就是 n 乘以二方的结果是谁?这个东西也是小于二方的,对不对?也是小于二发的,它是你看自由度为一的卡方检验吧,对不对?这个东西其实是等价于自由度为 k 的 卡方检验,那因为我们是都这个模型进行假设的,所以说它自由度为一,两个可以综合验证一个,说明它是存在一方差的 啊,存在一方差的,这个就是布洛斯帕根克夫里检这个检验你要知道他什么东西呢?首先第一个他的整套流程你要知道,就是他的前提是来判断,如果是存在一方差,那他的这个东西跟他是具有相关性的, 具有相关性之后呢,我们就要构造出我们的辅助回购模型,然后呢,对辅助回购模型呢进行布洛斯帕根克夫里检验,也是对他跑一遍普通制药而生法得到的结果呢?长这样。 然后呢,要通过谁来判断呢?通过他跟他来进行判断就 ok 了啊。考试考的最常用的就是第一个 让你回答他的一个操作流程,这是第一个简答题的形式。第二个呢,就让你写出他的辅助回归模型,这是第二种形式。第三个呢,就是给你这张表,然后让你来判断他是否存在预防炸,就这么个意思,我们可以看一下啊,我们去年的一个,不是我们去年我们之前的一个考题,考题的形式呢是长这样子的。 这里面的话,你看它图一显示出来了什么问题?这个东西我们还没有学,我们先不知道,但是你可以看它的问题是什么,估计值有什么影响, 哎,问题有什么影响?如果我们是存在一方差,那问一方差对估计值的影响是不是我们上节课讲的那个?呃,什么?仍然是限行无偏,但是它的那个有效期会减少,它的 tf 会有影响,它的那个致信区间跟预测区间会有影响,对不对? 这就是他的影响。然后呢,思考解决办法哦,如果我们是我们现在学的一封叉,我们有什么解决方法?我们还没有学,对吧?但是你要知道他可以有很多方法,然后写出,哎,模型对不对?模型如果是我们现在的检验的办法的话,叫做什么方法呢?叫做布洛斯帕根格弗雷解,那你的模型你要会写出来,模型长什么样?模型就是长这样的, 这就是你的模型,这就是你的模型。然后你要会写,这是一个点,所以说知道模型的意义是什么,所以呢原理点就是第二,他会让你写模型,这个你要会写啊,这一个点,然后呢我们再往下这个就是布洛斯帕根和布雷检验啊。 五,你要能判断,能判断出来就 ok 了。然后呢哈维检验跟格里瑟检验。

ok, 今天给大家录一下怎么样去三十分钟出一篇带时政的经济学分析论文。首先给大家介绍一下两个工具,一个是 cloud code, 是 这个页面啊,别的不行,一定要是这个编程的页面。还有一个是 codex, 就是 这个专门用来编程的,是一个很强的生产力工具,这两个工具是现在目前最强的 ai 模型,你需要充一个二十美刀的 cloud code 会员啊,或者是 gpt plus, 就 可以使用这两个东西了。然后呢,具体的操作流程就是调用我写的这个 skill, 是 一个写论文的全流程,地址是这个,然后我也会发在评论区,十分简单,就就跟这个 codex 说一下, 你去搜一下这个地址,然后他下载下来,然后直接调用就可以了。开始之后呢,他会去问你论文的类型,还有字数范围和地址日期,接着他会给你进行一个头脑风暴, 从选择题开始。选择题是很重要的,因为这是你在全流程里面为数不多可以动脑的东西,就是决定你研究题目,你看他给了这五个,你看有没有和你心意的这个题目, 当然这五个就太宽泛了,你看这这都啥?所以你要后面再去细划这个论文的研究方向。你看我说我感觉这个选择题都跟经济学不太搭,尬吗? 然后他就说其实这五个都属于经济学类题目,这时候我就说了,感觉这个题目要宽泛,要不锁定在一个区域里面。 ok, 我 就说这个就可以,接下来就他全流程自动了, 他会自己去确认这个成不成立,然后设计研究问题,设计假设设计这个变量,因变量,这变量,那变量,然后去自己去找这个数据,自己去确定计量方法,他给出这个一切的 time, 但其实都不用考虑这个 time, 直接让他一天暴干 二十分钟出一篇得了。这是个出稿,来看一下他二十分钟出来这么一篇大致可用的出稿吧,但是肯定不是说没一点没问题, 肯定有小问题,但是小问题就后期在修缮的时候了,你看一下他第一版给我出的时候,他只出了四千多个词,四千八百个词吧啊?四千六百多个词,然后让他拓展一下到六千左右,他要去执行, 那这个时候怎么样去让他看起来像人写的?这个时候要做的就是把他丢给两个网页版的 ai, 然后让网页版的 ai 去审这个初稿怎么样?哪里有什么逻辑问题啊?或者说哪里有什么格式问题,包括这个语句的修改,你就问他说哪有 ai 味重的地方,比如说这个句式太工整,或者这个逻辑都一样,那去让他挑出来,然后让两个 ai 互相挑,就这么左手倒右手去实现一篇可以看得过去的论文就可以了。哎,其实我说实话,这论文谁看啊?尤其是经济学啊, 咱也不是拿诺奖的人,就随便写个实证就得了,对不对?我感觉学经济学就是混混的也没啥用,你说学这个计量嘛, 这些专业的东西 ai 全给跑了,这 ai 出的代码又快又好,然后数据他也都全找了,你看这数据,这表格一点毛病都没有,这图像他这些二院全出了。所以说以后的科研只会越来越简单,之前这么痛苦的学习的日子已经不复存在了, ai 带来的竞争力提升已经是巨大巨大了。你要说这算不算什么学术不端?我觉得不算,因为这是属于科技进步带来的这个解放我们的体力劳动了,对吧?你说因为之前感觉这个科研吧,也就是劳神费力, 也没有那多么多么的有技术含量,尤其是这种经济学,如果你不是那种很前沿的科技的话,需要做实验那种,那你这个写这论文,写那论文也没啥用,其实大家都知道,就混一混,搞一搞就得了。所以说 学好新技术,学会用 ai 是 现在目前最重要的事情。 ok, 关注我,获得更多 ai 相关知识。

跟自己的文章不熟,怎样才能顺利通过答辩呢?其实你只需要一份这样带有答辩稿的 ppt, 一 份这样的带有答案的问题预测,把上面的答案背熟了,基本就稳了。很简单,你就把自己的文章上传到这个 ai 大 模型,然后将这个演讲者备注选中,并且选择一个合适的模板, 他就会根据你论文里的内容自动出一份 ppt, 全是论文里的重点。最关键的是啥呢?字数稿直接帮你写好,插在 ppt 里了,到时候放映后,导师看到的只有你的 ppt 部分,这部分是被藏起来的,直接读就行。 他还能模拟答辩老师对你的论文内容进行提问,每一道题都给你配好详细的答案。再说一点重要的,答辩过程中,老师会提问你一些大范围的问题,像是你的论文创新点是什么?为什么选这个选择题?你文章中的数据是怎么来的? 这样的问题一般就是老师在捞你的暗号,你只要不跟老师顶嘴,不沉默不语,也不瞎编乱造,老师一般都懒得深究。实在不会回答,你就参考我这个模板套公式去回答,答而不变,问就道歉,答变,想糊弄的还是回家吧回家吧,好不好?