大家好,我是马红梅,今天我要和大家分享的内容是基于 state 的面板数据实状分析。 首先我们来看一下什么是面板数据。面板数据指的是在一段时间内跟踪同一组个体的数据,它既有横截面的维度, 又有时间维度,是同时在时间和洁面上取得的二维数据,又称时间序列与洁面混合数据。比如说一个时间维度为三的编版数据,就如这个表所示。 那么我们来看一下洁面数据、时间序列数据和面板数据之间的区别。这三幅图呢,是老友记里面几名演员的不同时期的照片。呃,首先看第一幅图,第一幅图就是这些演员 在一个时间点上的状态,那么这个第一幅图它代表的就是洁面数据。然后再看第二幅图,第二幅图是这个演员他在不同的时间上 的状态,那么这三幅照片构成的数据就是时间序列数据。最后一幅图呢,是这些演员每一名演员在 不同的时间上的几个状态过程的呃,这个结果,那么这个数据它就是面板数据。 然后我们看一下面板数据的分类,面板数据通常分为三类,第一类是短面板数据和长面板数据,当个体数大于时间维度的时候,就成为 短面板数据,否则就称为长面板数据。我们拿这个面板数据的呃图为例,这张图呢,有六个演员,也就是 n 等于六,然后 每个演员他有三个状态,也就是时间维度 p 等于三,这个时候 n 大于 t, 所以这个数据是短面板数据。第二类是动态面板数据和静态面板数据,第三类是平衡面板和非平板非平衡面板数据, 接下来是面板数据的优缺点,然后面板数据模型可以分为非观测效应模型和混合回归模型两类。非平衡效应模型指的是存在不可观测的个体 效应模型,否则就成为混合回归模型。在这里可以举个例子, 比如说我们要研究气候因素对粮食产量 的影响的话,那么我们只研究气候因素对粮食产量的影响。但是对于一些土壤数据,还有一些农业措施数据,这些数据我们是观测不到的,那么呃,观测不到的这些就这些变量呢?就可以 把他们叫做不可观测的数据。那么我们如果针对这个问题去构建变版数据模型的话,这个模型就是非观测效应模型,然后这个非观测效应模型就 要分为固定校园模型和随机校园模型。 固定效应模型当中又可以分为单向固定效应模型和双向固定效应模型。其中单向固定效应模型它指的是只考虑个体效应,不考虑时间效应。 那么什么是个体效应和时间效应呢?个体效应指的是用来捕捉不随时间变化的个体之间的差异,可以用来克服遗漏变量的问题,比如说不随时间变动的个体特征变量有性别等等。 时间效应指的是解决不随个体变化,但随着时间变化的遗漏变量问题。比如说我们要捕捉经济周期以及宏观经济变化的时候,这个时候就是时间效应, 然后双向固定效应模型指的是同时考虑个体效应和时间效应这样的面板数据模型。 我本次实状分析是对美国十个州一九六三到一九九二年香烟消费量数据及进行面板数据分析建模。 它涉及到以下六个变量,第一个变量 loinc, 它是人均香烟销售量的对数。 lon p 是实际香烟价格的对数。 loin p, m i, n, 它是相邻州最低香烟价格的对数。 long by 是人均可支配收入对数。 state 是周一二十年, 然后我们看这个里面它有十个轴,也就是 n 等于十,然后这个年份算出来是三十,所以这个面板数据是长面板数据。然后我们要是把它导入到 state 的话,可以用到下面这两行代码。 然后在建立面板数据模型的时候,我们首先要判断他是固定效用,要用到固定效用模型呢还是随机效用模型呢?这个时候我们要进行豪斯曼检验, 这个检验的原假设是随机效应模型是正确的。以下是 skate 代码, 这个代码运行出来的结果是这样的,可以看出来 p 是小于零点零五的,所以我们要选择 拒绝原假设,所以要建立固定校园模型。然后,嗯,接下来进行建模。考虑到香烟销售量 和每个周的情况还有时间都可能是有关系的,所以我们考虑建立双向固定效应模型,这个是建立的需求函数。 然后是一些理论,当,呃,对于短面板数据来说,由于时间维度比较小,信息比较少,所以不能讨论 找动向是否存在自相关。这个时候一般假设短面板数据的找动向是独立同分布的,但是对于 场面版数据来说呢,由于时间维度比较大,包含的个体信息比较多,那么这个时候我们就需要考虑扰动性的一方差和自然关性, 然后他的呃这个一方差和自相观包含这三种情形。首先是组建一方差,也就是每个个体的方差是不相同的, 第二个是主界主内自相关,第三个是截面相关。 对于这两种现象,处理方法有以下两种,首先是呃,第一种是用普通只有二层方法去 细数,然后只对他的那个标准误差进行矫正。第二种是对呃异方差或者自相关的情形进行假设,然后用广义对二乘法去估计。 然后接下来我们进入到一方差和自相关检验这个步骤当中。首先检验组内一方差 原假设是不存在主内异方差,这个是代码,代码的运行结果是批小于零点零五,所以要拒绝原假设,说明这个面板数据中是存在主内异方差的。 接下来是主内自相关检验,原假设是不存在主内自相关,这块少打一个固字,不好意思。 然后结果也是小于零点零五,说明这个密码数据存在之内一次相关。接下来是洁面相关检验, h 零同样是不存在洁面相关,然后运行的结果还是小于零点零五。 然后在这一块,嗯,检验结面自相关的话,可以用两个代码,下面的这个代码同样也输出的结果是小于零点零五,也说明存在界面自相关。 接下来就是模型估计部分,首先呃只建立这个 o l s 模型, 这个模型它先 现在是不考虑组内预防差或者是次相关的。然后从这个模型的结果来看呢,有一些周 的呃虚拟变量很显著,说明存在这个个体固定效应,说明粥和粥之间的香烟销售情况是存在差异的。 然后这个时间效应部分它是不显出的,因为 p 等于零点一九大于零点零五了。 然后接下来要建立的是面板叫账标准物, 然后运行的结果呢?这个回归系数和前面的这个方法系数是相同的, 但是从这个标准固这第二类的数据上来看,标准固是要小一些的。下一种方法是仅解决组内自相关的可行广义最好二乘法。 嗯,在这一块假定扰东向服从 a、 r、 e 这个分布。 然后第一个方面是考虑存在组内自相关情形,要求各组的字回归系数是相同的, 这个是他运行的结果。然后第二组是考虑自相关,但是允许自相自回归系数不同。 然后可以看出来,考虑组内自相关的话,和和刚才的这个估计结果是有很大差别的,而且这 两种方法由于考虑的方面不同,所以结果也存在差异。从 iphone 来看的话,后面这个方法要比前面的这个好一点。 接下来用到的方法是全面的,可行广义做二层方法。首先考虑呃组组建一方差,还有自相关以及洁面相关,这些都考虑在内, 但是字回归系数是相同的,它的运行结果如下。然后右边的这个考虑的是各组的字回归 系数不同的,这种情况同样也能看出来,这两种方法结果也是差异很大的。 接下来对这些模型进行比较,用到的是这行代码输出的结果中包括各个模型的估计系数,还有 r 方,由于后两种方法他没有 r 方,所以这块是空白的。 然后从这个表中可以看出来,各个模型结果是不相同的,要选择哪种方法去估计我们这个面板数据模型的话, 取决于对组间异方差,组内自愿观还有洁面相关的检验结果。然后前两种方法, 前两种方法中第二个方法是呃结果最稳健的, 然后全面的可行,广义最有二成方法,也就是后两种方法是最有效率的,中间这两种方法 呃稳的稳健性,还有效率都是呃处于中间这个档次的。然后对于这次的这个例子来说,由于这三种都是存在的,所以我接下来选择用 第五个模型去进行建模,这个是输出的表达式,可以看出来实际香烟价格的对数会 抑制人均香烟销售量的对数,从这个系数来看,他这个影响是非常显著的,他只每增加一个单位, 人均香烟销售量对数就会减少零点三六三个单位,然后后边这两个变量会促进这个人均销售量对数,但是中间的这个就是相邻中最低香烟价格的对数, 他这个系数不显著,而且值非常小。后边的这个人均可支配收入对数,他每增加一个单位,会导致人均香烟销售量对数 增加零点五幺零点五一二。这么多 以上就是分析的全部内容了,谢谢大家。
粉丝1197获赞7075

同学们大家好,欢迎来到 stat 数据分析入门课程,我是车水老师,本节课我们来讲一下面板数据的处理, 主要分为三个部分,第一部分是如何声明面板数据,第二部分是面板资料的统计,第三部分呢是将非平衡面板数据处理为平衡面板数据。我们首先来看一下如何声明面板数据, 类似于声明时间序列数据的方法,我们用呃 xt set 来声明面板数据,然后后面加上呃洁面的 声明变量以及时间序列的声明变量。当然在九随塔九点零以上的版本中呢,我们也可以用 tsat 来声明面板数据,但是为了区分和啊时间序 进行区分的,我还是建议大家用 tst 这个啊命令来声明面板数据,然后后面先加啊洁面声明洁面的这个变量,后加声明时间序列的变量就可以了。 然后呢,我们再来学习一下如何将重复的样本删除,因为在这个声明面板数据的时候,我们这个洁面变量和时间系列变量,他们两个合起来是需要唯一的确定某一行的数据的。那如果说 呃,比如说在某一个时间时间下面,我对应了两个相同的这个洁面,比如说我两个相同的公司以及两个相同的年份,我同时出现在了某一个这个数据里 里面,那我用这个公司代码以及年份来声明时间序,他就是不可以的,因为这个,所以他他就识别不了了,也不能做后续的面板分析了。所以我们需要先将这个重复的样本删除,然后我们要 使用的命令呢,就是 dopecake, 这个就是重复的意思,然后照就是删除啊,然后再加洁面和时间序列这两个变量,然后后面加一个 furse 的选项就可以了。我们用 ccta 来演示一下, 我们还是先保存一下 好,我们引用一份网网络上的 pic 数据。 嗯,怎么这么慢呢?重新引用一下。 好,那我们来看一下他的 id 呢,是猪的 id, 然后位可能是时间,他的这个位可能是重量,嗯,第一行的数据呢,就代表 第一头猪在第一周的重量,第二行呢代表第二头不是第一头猪在第二周的重量, 然后呢第一头猪呢,有九周,他的重量分别是怎么样给他记录下来?然后第二头猪呢?从第一周到第九周,他的重量是怎么样给他记录下来?然后第三头猪他第一周到第九周,这样呢就是一个,呃,面板数据。面板数据的意思呢?就是 这个洁面,这个是洁面,然后这个是时间序列,然后洁面,每一个洁面和每一个时间序列他俩对应起来,就可以唯一的确定出某一个观测值。比如说一一,那我就代表第一个,嗯, 第一个个体的第一个时间,然后二二呢就代表第二个体的第二个时间,以此类推。是这样这个意思。 那我们要做面板数据处理之前呢,需要先声明面板数据,所以我们用 xt set 来声明面板数据。第一个呢就是我们他的洁面变量以及 id, 第二个是他的时间区别变量, 他就会告诉你,嗯,你这个他这个洁面的变量呢是 id, 然后时间序列的变量呢是 week, 然后他告诉你是呃非常稳健的这个平衡,也就是说这个 平衡面板数据就是从呃每一个个体第一周的第九周的数据都是有的,没有确实值, 是这个意思。然后呢,如果说有重复的样本怎么办?我们需要先用,先用这个 dope kiss, 比如说我们来,我们来,嗯,就是改造一下这个样本啊,比如说我把第一行呢变成第一头猪,第二个周 就是把这个,把第一行的这个 wake 把一改成二,那我们来 第一行,这个我们之前说过就是这个杠,嗯,那就代表就代表当前的这一行,他是一,就是代表第一行的数据呢? 我把这个 vc 本来是一,把它改成改成二,那我们就发现就是 id 和 vc 他无法唯一的确定某一头猪了。比如说我现在说 id 是一, vc 二呢?我可能是第一行的数据,也可能是第二行的数据。那这个时候我想再声明我的面板数据 怎么可不可以呢?我们来试一下,发现他就不可以了,因为他说这个时间序列和洁洁面他们两个无法唯一的确定某一个观测值是有重复值的。那这个时候怎么办?我们需要用这个九 kkstrop 这个命令 jupics, 照意思就是将重复的这个贯彻值删掉,然后先要填啊洁面的变量,再填时间血液的变量,然后记得在后面加一个 fus 选项,也就是强制删除其中一个。好,他说删除了一个点亮,我们来看一下,就发现刚刚本来是有两个吗?现在已经删,删掉了其中一个。那我现在看一下能不能用来声明面板数据呢? 可以的,但是跟刚刚这个结果就不一样了,这个位可能刚刚是一到九,现在也是一到九,但是这个 id 就是这个面板数据呢,说刚刚是非常本贱的平衡面板,现在呢就是非平衡面板数据了,因为第一头猪他只有 八周的数据,而不是所有的猪都是九周的数据,所以呢,现在就是非评论面板数据。好,我们再来学习一下面板资料的统计。 面板资料的基本描述呢,用 xtd describe 的意思就是 xt 前面加一个 stxt, 意思就是对面板资料的基本统计,然后面板资料的形态呢?用 xt pantry 这个 pantry, 这个呢,我们之前也学过,就是用 miss pattern 那个 命令来看一下缺失值的形态。我们现在呢,来看面板资料的形态,我们用 xt 排头,我们一个一个来看,先看 xtd, 好,他就会告诉大家呢,一共有几个 啊?洁面数据,四十八头猪有九周,然后呢,这个,嗯, n 是四十八, t 是九, n 就是洁面 t 是时间序列这个意思。然后呢, 呃,说对于这个 t 的分布,也就是说对于时间序别这个电量的分布呢,他最小值是八,最大值是九,这个八九就是这个大 t 的这个意思。 然后为什么有这么多 t 呢?就第一头猪的 t, 他是 t, 一等于八,第二头猪的 t 呢,是 t, 二就等于九,是这个意思,就是后面的猪他 t 都是九,所以呢才出来一个 ti 的分布, 然后他告诉你呢,有百分之有,这个一共有四十八头猪,有七十四十七头猪呢,他的面板形态都是一一一,意思呢就是说每一周的数据都是有的,但是其中有一头猪呢,他的面板形态呢是点点,就是代表缺失值, 意思是第一,第一周的数据是缺失,然后后面八周的数据是有的,就是这意思来,所以说 xtds 这个命令呢,就是用来来描绘这个面板数据的形态的。 好,我们再来看一下第二个命令,就是 xt pantern, x t pant 呢,他是要生成一个新的变量, x t pent, 意思就是说你要生成一个新的变量,这个变量的 呃这个变量的内容呢,就是他这个变量。如果是呃你是平衡的面板数据的话,比如说是这种,就是九个时间序列都有的话,那你的判断呢?就是呃九个一。如果你是第一个, 第一周是确实值,后面全是一的话,那,那你比如说这个第一头猪,他的判断呢就是点一一一,然后其他猪的这个判断就是形态呢,就是九个一这样子的。 所以我们用这个 xp 呢,就是来生成一个新的变量,这个新的变量呢就是来记录他的这个形态的,所以我们来生成一个新的变量,叫做呃,开就做,就做屁屁吧。然后 生成之后呢,我们来看一下这个屁屁是什么样子的, 就是呃有四百二十三个观测值呢,是呃就是九个一,也就是说他是平衡的面板数据, 其中有八个观测值呢,他是呃其中有八个观测值,他是点一一,我们来看一下这个样,类似于他意思就是说第一头猪这些是第一头猪的观测值,他的呃这个面板形态呢,就是 第一周没有值,然后面八周都有值这个意思。然后后面的这些猪呢,他的这个形态都是九个全是一,所以我们生成一个新的值呢,就是来记录他的面板形态的, 然后这个电量它有什么用呢?就是它可以帮助我们去筛选,比如说我想留下九个一全有的,那我就可以加银行命令,就是 keep a 这个 pp 等于九个一。那如果我 运行的这一条命令呢,那第一头猪的这个观测值就都被删掉了,我们只保留了这个呃权,就是每一 每一周都有竖直的这些猪的这个观测量。所以说我们平时可以用这个 xcpat 这个 命令啊,来统计面板资料,同时呢也可以用它来生成这个平衡面板数据,然后处理为平衡面板数据的方法呢?除了刚刚那种之外,还有另一种就是 s balance, 这个呢,它更简单,比如说我一共,是 啊,那个 t 呢?一共是一到九,嗯, x t 拍 balance 呢?就是,呃,我要把它处理为平衡面板,然后后面再加一个选项,我的选项呢是,比如说我要保留 从 t 到从 t, 从一到八的数据,那我后面的润值呢,就是一八。如果我只想保留二到五的数据呢,那我后面就是二五,我们来试一下,比如说我只想保留二第二周到第五周周的数据。 xc, ba balance, ranch 二五,我们来看一下 错 balance, 好,他提示呢是说二百三十九个观测值被删掉了, 我们现在来再来看一下我们的这个样板形态。 好,现在的面板形态呢,就跟刚刚的不一样了,还是有 四十八头猪,但是呢这个周只从第二周到第五周了,而且现在呢,每一个猪呢,它的形态,面板形态都是一一都是非常平衡的面板数据,不信我们可以用这个 xdbzzidv 来看一下。 现在呢是非常平衡的面板数据了,所以用这个 xp balance 呢,我们就可以一键把它生成一个呃平衡面板数据,而且可以选择我要 嗯那个面板数据的时间序列,他的范围是非常方便的。好,这就是本节课的内容,我们学习了如何声明面板数据,如何删除重复样本,以及如何统计面板资料和如何将这个非评的面板数据处理为平衡面板数据。

今天的话我们只要讲一下如何将一份宽面板数据转化为长面板数据,宽面板数据就是咱们这种可能经常下载到的数据,就是变量和年份都在同一行,但是我们想得到的长面板可以用来做回归分析的数据,是变量在行的上面,然后 年份在裂上面,这样的话我们就需要用到一个蕊 ship 树,蕊 ship 就是改变的意思,改变它的形状的意思,浪就是转化为场面板长的意思。然后后面的话输入我们需要转化的变量, 然后再写上我们固定不变的一个量,就是我们的康锤是我们个体,他是固定不变的,然后这一页的话就是我们后面的年份,把它给提取出来之后就放在年份的上面,这样迷回车, 一回车我们把这个英文的,然后他就这样就可以进行了一个转化,我们可以看一下结果,这就是我们转化后的数据,他是非常规整的,看都是按从小到大从首字母顺序排列的 国家,然后年份,然后这他的变量值都非常的规整,这就是我们进行一个转化的步骤,如果大家喜欢的话就点个关注,谢谢。

大家好,欢迎来到 sita 数据分析入门课程,我是车水老师,本节课我们来进行第一节 sita 的简介, 主要包含三个部分,分别是熟悉随他的界面,熟悉随他的基本设定以及设置我们自己的工作目录。首先我们来进行第一部分,熟悉一下随他的简界面, 所以他的界面呢,包括四组窗口,两个菜单栏以及一个 输出结果窗口。四组窗口呢,分别是历史代码窗口,密令栏窗口,变量栏窗口以及数据性质窗口。在此基础,在此基础上呢,我们要学会如何浏览数据 和使用度文档。我们来打开斜塔,实地操作一下。双击打开, 我们发现,呃,最先映入眼帘的呢是中间这一部分,它是我们的结果输出窗口。呃,四个窗口呢,分别是 历史代码窗口,是最左边的这一列,比如说我在命令窗口进入一行命令之后呢,在左边他就会出现这个历史记录,如果我双击这历史记录的某一行,他就会重新再运行一次。 第二个窗口呢是命令窗口,我们可以把塞塔的指令呢在这里面建入,然后按回车就可以执行。第三个呢是变量窗 窗口,在右上角,我们可以在这里呃看到每一个变量的名称以及他的标签。第四个窗口呢是性质窗口,在右下角我们可以看到这份数据的名称,标签。呃,数据类型以及 嗯,变量的个数和观测值的个数以及这份数据的大小等等。然后两个菜单栏呢,在最左上角呃,用菜单栏我们可以进行一些基本的统计分析,做图,导入,导出数据等等都可以。 然后呢第二行呢是我们平时用的比较多的,比如说打开文件保存,嗯,然后打开读文档,浏览数据等等。嗯,在 基础上呢,我们来学习一下如何浏览数据。我们主要用的是这两个按钮, 这样单击就可以出现我们的数据,然后第二个按钮也是一样的,他们两个的区别呢就在于第一个按钮可以修改数据,比如说我第一个是一,第二个是二,呃,这个技术上 如果我想要修改的话呢,我打开,比如说我想把第一个数据变成零,那我就直接可以是零 就可以了。但如果我用这个第二个浏览数据的窗口呢,我想把它这个数据再变一下,就不可以这样直接改了。 所以在平时的使用过程中呢,我更推荐大家用第二第二个指令,它类似于指读,呃,这样呢,我们可以减少我们嗯,误误操作导致的数据的变化。然后 接下来呢,我们要学会使用杜文档,杜文档呢,就是这个类似于幕布一样的按钮,我们单击可以打开,在这个里面我们可以写入我们的命令,然后呃选中纸, 点击这个三角形就可以运行。克里尔的意思呢是清除数据,那我们就会发现这里面的数据刚刚进入的数据已经没有了。呃,相比于运用这个命令栏呢,相 我更推荐大家用杜文档,因为杜文档呢,我们可以随时的修改保存,以及和合作者同时使用的时候,我们可以把我们的写过的杜文档发给对方,然后在对方呢在你的杜文档基础之上再进行 修改呀,运行之类的都是可以的,这样就更方便更有嗯,修改的余地和更有操作性,也对我们的合作有一些有很大的帮助。嗯,比如说我们 来举个例子,如果我想浏览一下系统的数据呢?我们用 ccuse 这个命令,比如说系统有一份数据叫做 out, 嗯,我们可以 选中,然后点击这个三角形运行一下,就发现我已经把这个,呃一九七八年的机动车的数据 已经掉入进来了。是这个,那我们就可以发现呢,在看右上角可以看到变量的名称和标签,右下角可以看到这一份,嗯,变量的名字, 呃,数据的名字以及数据的标签,然后观测值的个数,嗯,变量的个数都是可以看得到的。好,我们 现在呢来看一下随他的基本设定。呃,因为刚刚开始了解一个软件的话,我们要呃把它设计成我们 喜欢的样子,我们如何设置呢?在 id 的这个里面呢,最下面有一个 praprans, 我们打开这样的 praprans, 我们就可以设置我们这个界面的, 呃显示的属性,比如说这个这个里面有主题,是标准主题,或者是呃什么经典的主题都是可以的,比如说我用标准主题点击 ok 就可以了。呃, 然后呢,第二个我要说的是要学会嗨老婆功能,可以让我们的效率事半功倍。比如说有一个命令叫做三木 s, 是用来做描述性统计的,但是呢,我不知道这个三木 s 是什么意思,那我就要在前面 加一个嗨,然后呢,嗯,直接回车来执行一下这一份,这个代码就可以出来了,他就会跳出来一个嗨,要普文档,告诉你这个三 ms 的命令是用来干什么的,他首先跟你解释这是一个用来做描述性统计的命令, 然后告诉你这个秘密应该怎么用。呃,首先进入三木 s 或者是 su, 就代表了三木 s 这个单词,然后 后面呢加入你的,嗯,变量的名称,后面再加 f 选项,应选项括号呢代表嗯,可加可不加是, 嗯,可以根据自己的需要去加的,然后可以加一些选项,然后有哪些选项呢?后面都会给你列出来,然后呢在后面他会 告诉你用菜单栏呢如何实现这个功能。呃,然后后面呢会给你举一些例子,让你更深刻的来理解这个命令。 所以说如果遇到一些不会使用的命令的时候呢,我们一定要学会使用哈尔普文档,然后也要学会如何阅读哈尔普文档。好,第三 部分呢是设置我们的工作目录,首先我们要来看一下当前的工作目录,用 p wd, 用 p wd 这个命令来实现。 没车,我们就发现当前的工作目录呢是地盘下的四件套。呃,那如果我想改变我的工作目录该怎么办呢?我用下面这一个命令 cd, 然后呢再把我的想要进入的目录在 写进来,比如说我想进入的目录呢是 f 盘。好,那呃,我已经设置到 f 盘,我们来验证一下,用现在的 p wd 发现呢当前的工作目录呢是 f 盘了。呃,还有一个呢是要查看系统的目录,用 casd 啊, diydl 呢,就是 draxdrax, 就发现呢有,所以他呢有六个文件夹,然后分别的系统的路径在哪里?我们如果想改变其中的一个呢?啊?当然是 都是可以改的。我这里演示一个,比如说我想改变这个 plus, 他的路径用 cs 镜。 啊,我想改变 plus, 所以我要把 plus 加进来。然后你想改到哪一个路径?比如说我想改到 fpard, 比如说我想改到地盘的四件套 的 a 度下面的 pass。 那执行一下就可以了。那我验证一下我这个改成功了没有?再用一下 cs, 然后呢就发现我的 plus 已经到了我刚刚设置的这个目录下面了。好,这就是本节课的内容, 我们学习了 cta 的界面、 cta 的基本设定,以及如何设置我们的工作目录。

![stata超详细实证分析命令
👊企业-年份的面板数据实证--stata超详细命令
Ps:如果回归结果比较好建议还是使用控制企业和年份的双固定效应模型
⭕️下面详细讲解大部分文献对于企业-年份的面板数据的做法,控制行业+年份(更容易显著)
✅数据导入
use filename.dta,clear
✅数据处理1%缩尾
winsor2 var1 var2 var3,cut(1 99) replace
✅描述性统计,用下面这个命令可以把所有变量一起输出到word
outreg2 using statistic,word replace sum(log)
✅相关性分析
logout,save(cor) word replace:pwcorr_a var1 var2 var3, star1(0.01) star5(0.05) star10(0.1)
✅基本回归-控制行业+年份
如果行业和年份是数值型变量
reg 被解释变量 核心解释变量 控制变量 i.年份 i.行业
如果行业和年份是字符型变量
xi:reg 被解释变量 核心解释变量 控制变量 i.年份 i.行业
✅结果输出
reg 被解释变量 核心解释变量 控制变量 i.年份 i.行业
est sto r1
outreg2 [r1] using result,word replace tstat bdec(4) tdec(2) keep(被解释变量 核心解释变量 控制变量)
✅分组回归-这里怎么分都行就举一个非常简单的例子,按照国有非国有划分,假设SOE变量取1为国有取0为非国有
reg 被解释变量 核心解释变量 控制变量 i.年份 i.行业 if SOE==0
est sto r1
reg 被解释变量 核心解释变量 控制变量 i.年份 i.行业 if SOE==1
est sto r2
outreg2 [r1 r2] using result,word replace tstat bdec(4) tdec(2) keep(被解释变量 核心解释变量 控制变量)
✅稳健性检验-可以找一个类似含义的被解释变量或者核心解释变量的替换指标进行一次以上回归,如果还是一致显著那么就是结果稳健
#stata #毕业论文 #实证分析](https://p3-pc-sign.douyinpic.com/image-cut-tos-priv/d337bb8a8d80c72d2c6abd651c465597~tplv-dy-resize-origshort-autoq-75:330.jpeg?lk3s=138a59ce&x-expires=2104527600&x-signature=gDYEatunAapFuAxxJAyszwNfIHo%3D&from=327834062&s=PackSourceEnum_AWEME_DETAIL&se=false&sc=cover&biz_tag=pcweb_cover&l=2026091207422805C4AFE48CCD8786A256)

大家好,欢迎来到 stata 数据分析入门课程,我是车水老师,本节课我们来讲一下如何使用 stata 来识别以及处理离群池。 主要分为三个部分,第一部分是离群值的识别,第二部分是缩尾处理,第三部分是结尾处理。缩尾处理和结尾处理呢,是处理离群值的两种 非常常用也是非常有用的方法,我们来具体学习一下。首先是离群值的识别,我们有两种识别方式,第一种呢是画香型图, 第二种是使用 adjacent 命令,然后画香型图的命令呢是用 graph box 后面添加要画的那个变量的名称 就可以了。然后 adjacent 这个命令呢是,嗯,直接在 adjacent 的后面要加上你要识别的那个变量名称就可以。好,我们来用 sata 实地操作一下, 首先打开 state, 打开杜文档,然后我们调用一份系统的数据,还是要首先首先先把这个杜文档保存一下, 叫离裙值得处理。 ctrl b 运行好。呃,比如说,我想知道, 嗯,这个,比如说这个价格,这个变量呢,它的均值是六千一百六十五,最小值是三千二百九十一,而最大值呢是一万五千九百零六,就比这个均值大很多很多,而且它的 标准差呢是两千九百四十九,也是非常大的,所以我们就可以猜测他可能有一些利群值。嗯,那我们用香型图来画的话呢,就是用刚刚说的 graph box, 然后面直接加 呃,变量名称 price 就可以了,我们运行一下看一下。 好, 这个是啊,香型图中间最中间这条线呢是中位数,然后,呃, 这这个箱子的上上端和下端呢是上下四分位数,然后,呃,最上面最上面的这个横线和最下面的这个横线呢,是上边缘和下边缘。如果我们的数据分布在上边缘的 和或下边缘以外的话呢,我们就认为这些数据是离群值。那我们可以很明显的看到,其实这个 price 这个变量呢,是有很多的离群值的。 然后这个香型图呢,还有一种功能就是可以看到,嗯,不同分类下的林群值得分布。就比如说我想知 知道这个 foreign, 它是一个分类面料,在我想知道国内和国外的呃,不同种类下的汽车价格它的离群值的分布状况,那我可以直接在后面添加一个 嗯, by foreign 的选项, by 就是类别的意思 foreign, 然后运行一下 就可以看到,就是对于国内的这这一组来说呢,它的离群值更多,也分布的更广。对于国外的这一组 啊,样本来说呢,他的离群值相对就少那么一点。那我们就可以从这个箱型图里面看到啊,这个离群值的分布,以及他在不同种不同组别下的分布状况。 好,我们还有第二种,呃,识别离群指的方式呢,就是用 adjacent 这个命令,这个它的英文里面的含义是匹零的意思,那我们来使用一下,看一下结果会是什么样的。 adjacent price。 好,他出来的结果呢是,嗯, 低于 adjacent, a lower adjacent and upper adjacent。 意思呢就是说,呃,在 我们的上边缘以上的值和下边缘以下的值,就是上边缘的那个边缘值是八八一四,下边缘的边缘值是三二九一,也就是意味着说如果我的样 本呃的价格低于三二九一或者高于八八一四呢,就意味着它是离群值。 嗯,然后呃用这个命令的话呢,我们同样也可以知道不同种类下的离群值的分布,后面也是加 by, 然后加入你的分类变量,比如说 foreign, 那我们就可以看到,就是对于国内的这一组汽车来说,低于三二九一 或高于八八一四就是离群值了。而对于国外的这一组来说,低于三四三七四八和高于九七三五啊,他才是离群值。 所以跟跟我们用香型图的那个结果是一致的,因为因为国刚刚香型图里面国外的那个他在上边缘以外的离群值也是分布比较少的吗?说明大部分的离群值是分布在这个国内这一组的,跟 这个是一致的。好,识别了离群值之后呢,我们就要对离群值进行处理,我们有两种处理方式,我们首先来讲第一种缩尾处理,缩尾处理的含义呢就是, 嗯,将边缘值给他,缩到边缘值我们的边缘之内。我们来用一下这个缩尾处理的命令呢,是 visa 这个命令,然后它的使用方法呢是 后面加入你要缩的那个变量名称,然后再加生成新的变量名称的选项,然后再加你要缩尾的比例。比如说我要呃双边百分之一的缩尾,那后面就是 p, 这个 p 代表 person, 他有就是比例 零点零一,如果你要百分之五的缩尾就是 p 零点零五,如果是百分之十缩尾,那就是 p 零点一,我们来用一下试试看。嗯, visa, 我要将 price 这个命令 缩尾进行,呃,生成一个新的变量,叫做 price 杠 w w 就是 winter 的意思,然后缩尾的比例呢是百 分之五,运行一下好,他就缩回来了,那我我怎么能知道他缩回来之后是什么样子的呢?我们来画一个脂肪图看一下。用这个 two way, 我们首先来看一下缩尾之前的直方图是什么样子的, 是这样的,我们就看到呢,就是左边这一些,呃,其实是没有的,最小值是三千二百九十一, 我记得,嗯,对,最小值是三千二百九十一,所以这边是没有的。但是对于这边呢,你就发现他的脱尾的现象是特别严重的。 那我们来看一下缩尾之后的图位。 还记得之前说,嗯,画图的方式, instagram 运行一下, 这个就是看不太清,所以我们用颜色来给它标标记一下,后面加一个 color 的选项,那我要用绿色 就能分出来了,就是这个绿色的呢。是,呃,这个变量,也就是说缩尾之后的变量,那我们就 可以发现呢,缩尾之后的这个,嗯,样本的分布呢,他更更接近于中间,他就没有这个特别离谱的这些数据了,就是相当于把这些啊离群值给他缩到中间来了这个意思。 然后对于左边的一些值也是这样的, 好,这个如这个呢是双边缩尾,如果对于这份数据来说,呃,我的这个下边缘呢,是三二九一,但是我数据的最小值也是三二九一,说明这个下边缘这边我是没有离群值的。如果我只 只想说,呃其中的一侧的话,那我需要在这个 winter 这个 命令之后呢再添加一个选项,就是比如说我只想嗯,对上圆圆所谓,那我要加一个 high only only, 那我就回生成一个新的边梁叫,比如说 h。 然后呢我们再来看一下嗯,上边缘缩尾之后的样子, 就看到左边是一样的,就是没有进行缩尾处理,但是右边呢就把利群值给他缩回来了。是这样的,所以我们要根据自己的 啊变量的分布状态来选择我缩尾的比例,以及缩尾的是上,嗯,是双边缩尾还是单边缩尾,还上缩尾还是下缩尾这样, 嗯,我们来讲第三部分就是结尾处理,如果说这这个离群值我不想要了,那我就可以直接把它结掉,然后我们用的命令呢是这个一杠 p c tyle 这个命令, 然后呢后面要加上结尾的这个比例,比如说我想啊上下百分之五都给它截掉,那我就要后面加一个 person tire, 后面加五上五下九十五,这个是比例。 然后我们来试一下 p c 啊 rice, 呃,嗯,行,好,那我们运行一下就可以, 好,他就已经运行好了。呃,那我们现在来再来看 price 有什么变化呢? 它跟之前是一样的,没有什么变化。那我们需要呢返回一下我们的分位数值, 需要一起好返回,返回之后呢,这个的意思就是,嗯,上 边的百分之五的那个节点是三七四八,也就是小于三七四八的那那些样本数他占了整体样本的百分之五,同理大于一万三千四百六十六的样本数量占了总体样本的百分之五, 所以这个就是嗯,上下百分之五的那个节点,所以我们如果想结尾的话,就需要把小于这个下百分之五的数据和大于上百分之九十五的这个数据删掉,所以我们叫 job 一下,然后面添加一个呃条件, if price 小于呃 r r 一, r r 一呢,就是代表, 呃,是这个三七四八这个数啊,就是代表的百分之五的那个节点, if price 大于这个代表的是上百分之五的那个节点二二。好, 那这样呢,我就把这个上下百分之五的数据给它解掉了。 哦,这就是连上百分之五、下百分之五的数据,分别是三七四八一、三四六六,和这个的意思是结果是一样的。 好,这就是我们讲的缩尾处理和结尾处理。本节课呢我们主要讲了三个方面,第一方面呢是 h 值得识别, 第二方面呢是离群值的处理,包括缩尾处理和结尾处理,这个是这两种处理方,方法呢是非常常用的,大家一定要记住。

哈喽,大家好,今天是二零二二年一月二号,祝大家元旦快乐呀。那么今天这期视频呢,就是很多人一直催我的关 关于动态面板模型 gmm c 的操作。嗯,其实他的官方名称呢,是广义,据估计 原理就是回归,其实就是一种高级一点的回归吧。那么为什么要使用这个方法,和谁使用以及注意事项呢? 大家可以再去搜索学习啊,学问很多,这里我就直接教大家啊,实际的比较简单的 set 操作步骤是保证新手也可以看得懂,可以做出结果来,但还是建议呢,大家在使用这个模型之前呢,一定要了解一定的呃, 基础知识,比如什么是内生变量,外生变量,工具变量是相关等各类问问题。 嗯,如果不太懂,也没有时间学,就建议使用。嗯,最小二乘法呀,或者是固定模型这类比较简单的回归。 那么废话不多说,接下来就直接跟着我一步步操作吧。嗯,首先呢,我们还是打开我们最常用的一个教学数据,也就是我卫生费用的相关面板数据。呃,仍然是实际外是因变量,然后自变量是 x 一到 x 七, 那一般我们都比较常用,取对数之后的数据进行回归。嗯,如果是小于一的数呢,我们通常会建议可以转换为百分比,千分比,那么保证数值大于一。 那么原始数据的处理方式有很多种,大家可以自行选择。那么在做回归之前呢,我们一般 都会先做一个基础的一个相关性的分析。嗯,这里我把代码放在右边,就是方便大家观看啊,我们直接复制过来,然后回车键我们就看到相关性的分析就出来了,那么这块比较简单,我就不过多讲了。嗯,接下来呢, 我就直接开始我们的动态回归啊,先安装我们要用的秘密,我们现在最常用的 gm 呢,是 xtab 二,就是这个秘密,安装秘密还是 ssc in store 好了,我们安装好了这个呢,我们就开始呃,使用具体的一个例子来给大家教学示范啊。那么我先把这个语法粘贴过来,然后给大家讲解。呃,这个都是什么? 首先呢,前面 s t a b 二我们就不讲了,然后后面呢,请跟的是音变量外,实际我的是实际卫生费用,那你们的是什么?就先放在先放音变量外,你想放什么?取对数,呃, 拆分后的,或者是取对之后的形式啊,那你就变一下就行了。然后后面呢,就是把音变量的之后一节作为一个字变量放在模型后面,然后这两个放完,后面的 x 一到 x 呢,就是一系列的解释变量啊,比如说你的主要解释变量是 x 一,你的控制变量呢是 x x x x x x, 或者是 c 二 c 三 c 四,那你们就要把它全部都放在后面就可以了。那么这一部分呢,基本上就是固定不变的,要变也只能是变数据的形式,比如是否取对数呀,是否那个呀,那么 对号后面的都是可以调节的。嗯,那么这里呢, i 点一什么意思呢?就是 gm, 我们知道是自动控制了省份啊,也就是个体差异,如果你还想要控制时间,那就加上这个命令就可以了, 那这个也是可加可不加的。那么 gm m 和 iv 里面怎么变量怎么放呢?嗯,我这里是假设哈,假设我的 x 一是严格的外升变量, x 二是前置变量, 但是不不完全外伸,那么 x 三呢?是内伸变量,然后我们一般就会把 x 一放在这里, x 二 x 三就放在 gm 里面。那么这里具体反正放电量是多少放多少个变量,嗯,都是可以调节的。文献里面经常会把音变量的滞后一节放在 iv 里。 嗯,其他呢?非严格的外身变量就放在 gm m 里面。嗯,建议大家可以参考以往文献都是怎么放的啊?研究目的不同的可能放的面变量都是不一样的啊,这里我们我后面还会再提的。 那么后面这个参数呢, low level eq 就表示的就是呃,差分的 g m m 就是 dfres g m, 因为系统默认的是 system, 嗯,所以我们这里加入这个设置呢,就是代表我们做的是差分。然后我们按回车键 就可以看到我们就出现了啊,前面的回归结果,还有一些自相关检验和过度检验的结果,那么检验结果如何如何看呢?等我把命令讲完了,我再给大家分析。 那这是一个比较简单的一种形式,然后我们在这个形式上进行一定的更新。 嗯,接下来呢,我们经常刚才说了系统,呃,系统自带的是系统 gm, 那我们经常用的就是两部系统的 gmm, 我们只需要在后面这个参数,嗯,把它删除,更改为两部系统 gm 参数设置就是 t w o s t two stab, 然后因为两步估计比一步估计呢,就是容易呃,低估回归叙述的标准误差,所以我们一般加 too stab 就要加 robust, 呃,这两个也算是半捆在一起的感觉。然后这个,呃按回车键,我们就做的是两部系统 gmm, 我们可以看到明年输入输入之后他后面会有提示的。呃,看这里动态面板模型,两部系统 gmm, 我们可以放掉。 我上面的一个秘密啊,这里写着动态面板估计,然后一步的插分的 gmm, 那么接下来呢,我我们再在这个的基础,这个命令的基础上再进行一定的更新, 这种呢是比较常见的。嗯,那我们还可以看到。呃,这里的 gm 的变量里面呢,我们可以呃更新,比如说 gmm 的面料,我们可以设置一个之后下,嗯,通常呢会在后面, 嗯,在家里都好。一定一定要是英文输入下哈,然后 leg, 然后再括号也要是英文输入下的。呃,比如说二三这样子,那证明你的 leg ab 表示什么意思呢?就是把 x 三 xx 三呢?嗯,进行那个,然后再作为工具边上放进去,那么这里的这里的二三就是你放任何数字都可以,但必须是整数,然后那我们的二和三分别就代表最近和最远的最后接触,那么这两个接触你是可以呃 任意换的,并不代表就一定要是二和三。我就我就举个例子,然后呢在整个命令的后面呢,我们还可以加各种加各种参数,比如说我们家镂空赛的,就是我这里写了,呃, 就是不要缠住下,比如说减少工具变量的个数,我们就在这个 jm 里面,这里在这个逗号后面再加个 claps, 呃,比如说创造工具变的方式变换一些,我们就在这个后面命令的参数后面再加入这个单词就可以了。 嗯,那这里具体的各种加餐术呢?在我的知乎和 b 站里面,嗯,都有更加一个详细的一个文字介绍啊,大家可以自行的去学习,如果有什么不合适的地方,也欢迎大家批评尺寸。嗯,那么在视频里面呢,我就给大家介绍比较常见的命令形式。 那么命令讲完的接下来还有一个很重要的步骤,就是如何看结果呢?嗯,那我就以现在这个命令,呃呃,输入进去,然后给大家解释一下结果怎么看。 我们看这个命令输入进去了。嗯,我做的是两部系统的 gm 比较常见的一种形式。 那前面的就是一个简单的一个回归系数表格,那这里大家我就不过多介绍了,也就是回归系数标准 这只 p 值百分之九十五的可信区间,那一般来说,应变的之后一节,这里一般都是应该是显著的。嗯, 那接下来我们看后面的检验怎么看呢?呃,第一个就是 a r 检验, a ar 检验呢,就是一个字相关的检验,是检验脑脑动向的差分是否存在一阶和二阶字相关啊,保证这 m 的一致。估计一般而言呢,都会存在一阶相关,一阶 相关就是 a r 一,一般都必须是显著的,也就是存在呃,一届的字相关。那么二级的字相关呢,一般是应该是拒绝的, 所以最好是大于零点零五。呃,最好的情况是大于零点一,但是我们一般呢认为大于零点零五也是可以接受的,那这里如果 a r 二也 a r 二的批值也是小于零点零五,也 是啊,小于零点零五的话,我们可以检验 a r 三,那么检验 a r 三的语法呢?就是在呃刚才的这个密对, 刚才的这个命令基础上的后面再加一个呃,加一个 a r a r test, t e s t t test, 然后括号三就可以了,我们只要在这个后面再加上一个 a r。 哦,打错了, a r 太子三就可以出现 a r 三的值,你看,我们可以看到这边就出现了 a r 三的值,如果 a r 二实在是一直小于一点零五,我们可以再进行呃三阶相关,嗯,我们看一下,呃,就就要用三阶以及更高阶作为一个工具变量,所以我们在后面 再进行 a r 三 tes 就可以了。但是最好最理性的情况肯定是 a r 二,拒绝是最好的, 那么 a r 自相关检验讲完了,接下来就是呃后面的这个萨根检验和黑 n 检验,那这两个呢?都是过度检验,嗯,那么这这一种过度检验他的原甲设呢?是工具变量是有效的,那么 所以说 p 不显著,不拒绝原假设,也就是 p 只要大于零点零五才是说明工具变量是有效的。嗯, 所以说,呃,但是我们一般也是要呃萨根减压和黑 n 减,要大于零点一以上就是最好的,但是同时也不要等于一,嗯,等于一一般也是不合适的。嗯,一般我们应该是在零点一到零点二五之间最合适,但是由于一般 都很难通过,所以大于零点零五我们都算是合适的。那么至于这两个值,呃,我们是报告哪一个值呢?嗯,你可以自己选择,也可以自己领域里面的文献确定,也就是根据文献确定,那大部分时候可能都是哪个通过了,就报告哪一个吧, 我们可以看一下上面的,嗯,比如上面的这个黑色检验是通过的,然后三个检验是不通过的,那我们可以报告 a r 二和黑色检验,对吧?所以大家可以灵活的去处理。 最后呢,我想给大家说的就是,嗯,可能刚刚开始做动态面板模型的同学们经常会遇到,就是不管我们,呃,怎么调节,就是怎么调节内身边 外身变量,还有包括调节这里的工序变量啊,他的之后,他的这里的之后结束呀, 可能都做不到,可能都做不到就是满意的结果,要么就是三根检验,四检验不通过, 要么就是系数一个也不显著,然后我们拼命在网上搜索答案应该怎么解决,那么这里我就把也把我的时间经验给大家分享一下啊。 首先呢,我们就是要相信自己,只要你设定的这个模型是在一定的,呃,理论基础之上的变量也是比较正常的数值,就是文献中经常会用到的一些变量,你的动态模型就一定会成功的没有通过, 可能是你的模型设置那么暂时不适合你的数据情况,那么 gm 可以调节的地方是很多的,你都可以去试验一下, 就除了前面是比较固定的,后面这些都是可调节的,而且前面这个这种变量的形式,原始数据的形式也是可以改变的,所以你们要有一定的耐心,然后多多调试。 那另一方面可能就是因为动态模型的检验很难通过,所以很多时候哈,我们都被动的只能选择以结果为导向去调整我们的模型,就会觉得这个动态模型吧,就可能只是理论上比较成功,那么实际操作就有点鸡肋。嗯 嗯,可能听起来比较高大上,所以用的人还蛮多的。嗯,那么大家就自行体会吧。那么今天这期教学视频就到这里结束了,因为我,呃,给大家讲完了,我想出去过节了哈。呃,如果对大家有所帮助的话,呃,希望你们点赞关注 支持一下吧,然后祝大家节日快乐,谢谢大家。

同学们大家好,欢迎来到极乐数据课堂,我是倪老师,今天给大家介绍的一款软件叫斯贝塔,它是一款统计软件, 我先介绍一下我们的课程特色啊,相信大部分同学都去网上看过一些视频,特别是连老师的视频啊, 林老师的视频其实讲的非常好,每一个视频的时长也是比较长的,内容讲的非常的细,主要是从理论然后实践操作这么整个过程来说。但是对于刚入门学习斯蒂达同学来说啊,这类的视频我还是不建议大家去看,因为 通过一个半小时的学习下来,你可能真正掌握的内容其实只有一点点,比如说你只会导入的一个数据,对吧?但是你浪费了你一个半小时。我们这个课程的特色呢,就是经练啊,比较干货,并且偏应用。 大部分同学来学习我们这个软件主要还是为了去啊做一个实证分析,然后完成你的毕业论文,或者是头一片好的旗开。 那么我们的应用其实就非常重要。这个课程啊,我们的特色就是啊,在较短的时间里,然后让你掌握斯德塔,并且能够自己去做一篇论文。 那么我们啊讲了我们的课程特色,那相信大部分同学啊,还不知道实证是什么东西,那我这边先给大家简单的介绍一下什么叫实证实证,简单的说就是去用数据验证我们的一个结论。 那怎么用数据去验证我们的结论呢?我再举一个粗俗的例子啊,比方说我们现在有一个研究主题,就是想研究饭量对上升高的一个影响啊,我们都 知道饭吃的越多,人就长得越高,对吧?这个其实就是我们的一个理论预期,现在我们去找一份数据,比方说你把全国所有人的一个 饭量以及身高的数据被统计下来,然后我们去研究这两者的关系,基于这一份数据去研究这两者的关系,并且得到了 饭量是促进长升高的啊,那你现在做的就是一个实证分析,就是通过数据去得到一个结论。好,那么 我们现在来看一下整一个课程啊,我们会讲到哪些东西啊?接下来我们所有的课程就是按照这一个思路来的,那这个思路我主要是按照实证分析的啊,一个框架给大家梳理的。那么在做实证分析之前,大家都知 知道啊,我们需要有一份数据,那这份数据我们肯定是要对他进行一个整理和清洗,不然的话你是没有办法进行实证分析的啊,除非你这份数据是哪里买来的,对吧?相信大家自己下载下来的数据啊,都是一份一份零散的,必须要进行清洗和整理。 那整理完数据之后,我们要做的就是实证分析了,实证分析主要分为四个模块,第一个就是对于你对于你前面那份数据的一个描述性统计啊,它里面主要分为五个,一个是 n 就是你的样本量, me 就是样本的一个均值啊, m i n m a x 就是样本变量最小值和最大值, sd 就是标准差,主要包含这五项指标来对你的数据进行一个详细的描述,做完数据描述之后就进 我们的第二步主回归,主回归就是去验证我们这篇文章的一个主题结论,也就是主要的结论 还是从我们前面的那个例子来说,我们想研究饭量对长身高的影响,那么你的主回归就是要去验证你的饭量对你长身高的影响是什么?是促进的还是意志的?那当然这种影响我们必须存在于一些模型去做。 接下来我们的课程中啊,会讲 ous 模型,也叫混合回归模型, fe and r e 这个叫固定效应模型和随机效应模型, gmm iv 啊,以及 did。 did 这个模型呢,其实和前面的模型差别有点大,它是一个啊,独立的模型,就是跟前面其实没什么关联啊,为什么要讲 did 这个模型?因为这个模型现在比较流, 而且他发好的期刊非常好发,所以说我把它单独拿一块出来讲。第三部分叫扩展研究,也叫深入研究, 也就是把我们的文章的结论进一步挖掘,我们验证了饭量会促进一场升高。那么如果我把这份样本划分成两份,一份是男性,一份是女性,我们去比较男性和女性之间的一个差异,也就是吃同样的饭,男的长得高还是女的长得高, 这个其实就叫深入研究啊,也就是我后面给大家列出来的一个分组回归这么一个东西。当然我们后面还会介绍更多的一个深入研究啊,就是中介效应以及调节效应。 第四部分就是我们的稳健性检验了,稳健性检验主要是对我们的主回归进行一个进一步的验证,也就是你前面做了一次,结果其实 存在一定的偶然性,不太可靠,我们让这个结果更可靠一点,就要做一个稳定性检验。稳定性检验 啊,主要是包括以下三种方式,一个是替换变量,一个是变换模型,一个是数据样本的变换。 我们前面用吃饭,用饭量,呃呃,我们前面去研究饭量对长身高的影响,那么饭量如果我们前面是用一天吃饭的次数,就是吃一次饭还是两次饭,吃三次饭来衡量的话,呃,我们可以得到吃饭的次数越多, 你的身高越高,其实也就是验证了饭量越大,你的身高越高,对吧?那么如果我把这个次数 啊变成另一个东西,就是饭量,我不用次数来衡量,用我一天吃几斤大米来衡量,那其实吃的大米的斤数越多,也其实能够 说明我们的饭量越大,对吧?从而也是验证了我们饭量对长身高的影响,就是说把次数换成了吃几斤纳米, 这个就叫做替换变量的五金星。当然我们的方法还有后面两个啊,这个在后面的课程中我们会给大家强详细的介绍。经过上面四个步骤啊,其实我们就把 整个实证分析给做完了啊。在做完实证分析之后呢,我们其实还要讨论一下文章的一个内存性 啊,内生性它是一个问题,它会造成你回归结果的一个偏恶,所以说这个问题啊非常重要。为什么重要? 因为我们在发一些比较好的期刊的时候,神高老师只要看到你的文章中没有去讨论这个内存性,你的文章一定会被 d 稿,所以说我把它单独列为一个专题来给大家进行详细的讲解。 呃,接下来就是我们显著性调整的一个专题课,因为我们理论是理论,实际是实际,真的我们去做一份实证的时候,你做出来的结果往往是不显著的 啊,基本上两篇里面就有一篇是不显著的,那这个时候你怎么办呢?不是说直接换个题目对吧?或者是重新再找一个数据去做,我们其实是可以通过合理的计量方法给他调整到显著的啊,所以说这一个专题课程呢,实用性非常的高, 到这里为止,我们整个实证分析就已经做完了,那么接下来你就是要去写你的一个 论文的文字了,那么论文的文字其实它里面也有很多的讲究,也有很多大家不了解的东西,接下来我会给大家梳理,就是论写论文的一个重点是在哪里?就是每一个 章节里面到底该怎么去写他,你的导师才会喜欢,省高老师才会喜欢,文章才会更好发。最后就是我们的一个实战训练营,就是基于我们前面学过的一些内容,我会给大家进行一些实战训练啊,来巩固我们所学的一个内容。 最后的话我再给大家看一个呃,实证做完的一个呃案例是怎么样的? 刚刚我们讲过啊,实证分为四个模块,一个是描述性,那其实这个就是我们描述性统计的一个表格做出来的样子,就是这样子的啊,其实这个表格并不需要我们手动去做啊,斯贝塔 会给我们直接输出出来,最后就是长这样。第二块就是我们的主回归,也就是去验证 x 对外的一个影响 啊。最后做出来的表格是这样子的,这个其实软件也会直接给我们说出来,通过银行代码就可以了。 第三部分是扩展研究,其实我们这里做的扩展研究也就是对样本进行了划分,分为的 state 为零, state 为一的两个样本,然后去研究这两个核心,解释变量对你应变量的一个影响是怎么样的 啊?这里其实就是做了一个分组回归。最后第四步骤就是我们的稳定性检验,也就是 啊对主回归的结论的进一步验证。这里用的方法是替换变量啊,但是这里做了两个,一个是替换了 y, 还有一个是替换了 x。 前面我们可以看到用的都是罗恩佩特的,一,这边换成了罗恩佩特的,二替换了音变量,然后前面用的都是 siri ems, 二,一,这里替换成了 siri rms, 二, 替换了你的核心音变量,这个叫替换,呃,变量的一个文件性。好,那我们第一节课就先上到这里。

大家好,欢迎来到三金课堂,这里是软件大全系列,本节将演示 state 一十七简体中文永久版的安装教程, 关键字 state。 这是一款功能丰富的图表绘制软件,主要用于管理分析和绘制定量数据,还可以进行各种统计分析。下面我们来看一下它怎么安装。首先将软件安装包下载下来,然后将它解压出来, 打开安装包,右击安装文件以管理员身份运行,选择式的正在解压,在这里点击下一步,点击我接受,点击下一步,这里输入用户名,点击下一步, 选择第一个。点击下一步,这里选择一个你喜欢的安装位置,选择好位置后点击下一步,再 点击下一步,然后点击安装好的正在安装,请耐心等待。 ok, 安装成功,点击结束。然后来将它激活一下,找到软件的安装位置, 再进入他这个激活的文件包,将这个软件包里面的激活文件复制一下,粘贴到安装位置里面替换,只需要这样就激活成功了。我们来打开软件看一下,这里点击禁止自动更新,然后点击 ok, 点击帮助。关于好的可以看到这里是已经激活的状态,这个版本是 state 一十七版本的。好的,喜欢的朋友请帮忙点赞关注、评论转发,如果需要这款软件可以关注我的工号,三星课堂二零二二,回复关键字即可获取。本节到此结束,谢谢大家。

大家好,今天给大家讲解的是如何做规范这个时间研究,就前面我们已经做了很多期关于如何使用 state, 如何使用一位不行,如何使用 spss 这些呃软件,那么在有很多呃小伙伴们,呃,在后台私信我,我可以说,哎,我就学了很多方法,但是还是不会写,怎么办?就是会说说,写的过程中好像作业和批判他不是一回事。呃,他好像有些格式上的问题,嗯,有些程序上的问题,会有很多东西。 首先我们要知道数据它是分三种类型, 他数据总共分为三种类型,分别是电板啊,应该这样做,应该是洁面数据、时间序列数据和电板数据。那么洁面数据是什么呢?洁面数据就是,呃呃洁面就是数据 就是,呃时间为一年啊,时间为 i 就时间为一,就只有一个年度,然后一个时间段,然后,哦有 n 个个体,时间序列是什么?时间序列正好是相反的,时间序列是有。呃这个有 i 就个体,个体,嗯,只有一个,但是时间确实有 n 个,那面板数据就他们两个的组合,也就是说 i 和 n 就时间和个体啊,都是有 n 个就大于等于二个, 大家知道,呃这个是面面,这个说实话,那我们今天开始不如正题就如何做规范的那个时间引流啊。在本书中啊,呃,整课程中啊,我们就呃就学到了计量机一起学。那么如何在配方里面做连拍摄类似顺其这个这个东西呢? 呃有人可能会认为啊,这这样进学,呃理解为一一种概率统计的一个课程,嗯,把注意力集中于定理的这个推导于证明,实际上,嗯,这个呃计量他不仅 是一种手段,而且是一种验证。我们假设的一个呃,一个一个方法,比如计量知识可以告诉我们在合作情况下利用哪一种模型呃,然后去验证我们的假设,那他的局限又是怎么样?然后我们如何去呃检验这些呃,这这些结果? 那么,呃,那么接下来我们就想呃你计量的理论与现实的数据如何去呃去这个去凑能力。企业计量经济学的理论总是建,呃,总是呃建立在 一些理想化的一个假定基础上,而现实经济数据啊,又特别多呃,而且不是那么合理化的,而不是那么理想化的一些经济数据就或多或少会不符合这个呃假设或那个假定就模型的假设。 因此,这两理论可以呃是可以严格证明的一门科学。但实证研究和实证分析啊,他本身在一定程度上他也是一门嗯诉 数字和数学上的一个艺术吧。呃,可以点赞。二零二零三年啊,他的呃书中说过,呃一句话就说,嗯,理论。计量经济学家和计量实践者,他们常常是缺乏交流的, 所以呃,计量的实践者在处理限时数据时,有时会不知所措,这时候我们就要去提出数,提出假设验证假设计量实证分析就是在让我们去验证我们所提出的假设。 那么在实证研究分析中啊,我们主要又拿紧步骤,首先我们要呃步骤先打出来吧, 而建立学士实证研究的工具。 因此,只有站在实证研究的框架上,才能更好的回答如何使用尽量支持这一问题?一般来说,规范的实证呃分期包括以下几个步骤,大家请看。第一步,提出假设。刚开始进行研究的人来说,常常不知道如何提出这个研究。呃课题,呃研究者 通常知道自己想要研究的领域,但是他并不是一个具体的内容,所以呃对于十的分析而言是研究问题,通常是关于 x 对 y、 xdy 啊有什么作用之类的一些问题。如果想要研究进入发展对经济增长的作用,或者是呃这个数字经济啊,对这个呃数字经济,对这个呃消费啊,呃消费差距、收入差距的一个影响,那么这就比较具体。 而此处的 x 和 y 可能有很多变量,比如 x 可以用呃金融发展, x 代表金融发展,但它可以用很多变量去表示金融发展。相比银行业的发展啊啊,中国的这个金融 市场的发展去表示这个金融发展这个指标,而 y 它仅仅是指的经济。真的这个变量研究内容嘛?研究的问题我们可以来源于呃与理论,也可以来源于对这个社会的经济现象的一个观察,也可以研究某个政策的政策效应,也可以对文献中已有的一个配套里面的呃模型 model 进行去改改善,改善改善。 其中研究假设啊,就意味着我们有了研究的内容,我们就可以进行聚焦了啊。总的来说,研究问题啊,越具体,越有趣,越创新,越有可行性,这就越好。 具体有趣,创新可行,这是我们提出假设的一个要求。那么提出假设完了过后,我们需要做什么呢?我们就要去做一个文献回顾,以及我们常说所说的这个相关文献或者是相关理论。就在这部分,我们主要呃为什么?就主要原因是什么?就论文啊,他 发出来过后我配报发出来过后他最重要的就是要创新,假设你找到一个具体呃创新可行的一个研究问题,那么他,嗯就需要去体现出这个创新程度,这个具体程度和这种可行性。嗯,我们一般就呃 就一开始来讲的话,我们还是先看文献,然后再提出假设,因为先做假设后看文献的话,这样话,因为我们不是大师吗?所以我们可能对这个文献的这个呃文献的熟知度并没有。呃,就是学研究生,学学者,他们比较呃了解和属性, 然后我们先回顾完了过后我们就可以了解了我们的大致啊,已有的这个研究成果当中啊,他们是怎么用了什么模型,找到什么结论?好,可以,这是我们的体检测,然后体检测我们就开始建立饮用模型, 就是我们这个,我们可以在,我们可以在一些前任的基础上进行完善他的模型或参照他的模型都是可以的。在我弄完过后我们就开始收集数据了, 那数据呢?可能说我们其实不知道,他不知道数据来源是哪,是什么地方,他一般直接去找国家统计局里面去找啊,或者商务局啊、外汇局啊这些啊,电话去找。其实不是的,我们有专门的数据,呃数据,呃消失,呃这个软件,呃消失 ctrl 这种软件,比如我们常常用的, 嗯,常看哪些?就 a 呀,或者是呃 gace 这些抵抗有金融领域的抵抗啊,就 mac economic 内容和那个呃,翻译过来应该是美国经济评论这些顶抗事业的抵抗国,国内的顶刊应该就是管理事件,呃经营研究,经济研究啊这些,嗯,上面他们是出去是买的, 他,他们其实就是嗯通过呃一些我买的数据库和国泰亚数据库,还有童话中的 ifi 的数据库进行呃手机数据,然后这些数据库呢?他们的数据又是哪来?他们数据又就是呃他们有专门的人从呃国家统计学院统计零件上去把所有的数据汇总到数据库里面,所以这也方便我们呃整个呃 研究研究研究员吧,呃去更好的工作效率提升。然后设计完数据完后,我们开始使用适当 我们可我们要根据这个数据啊和数据就数据特点和特征来选择合适的一个猫斗。比如背景是,如果背景是背面是二元, 就是虚拟变量的时候,我们就可以考虑用 plob, 才不了解他。如果是非负之处,我们可以用坡松回归,坡松回归,如果我们是面板数据,我们可以考虑固定随机时间动态面板的,如果我们时间序列数据的话,他应该先判断这是否含有单位根,然后再决定 其做相应的计量方法。其实很多小伙伴们呃他有面板数据,我其实我看很多黑豹呃,尤其是硕士,他们很多黑豹呃中啊,他们实验序列他面板数据也做单位,跟其实准确来讲是不严谨的,你们可以去看一看最近五年的顶看很少有面板数据去做单位跟去做写诊的。对, 所以这个这个逻辑顺序啊就嗯对,不要搞搞错了,反正是对于一般的数据啊,我们一般啊也要记住,大家注意点是一般而言,通常先做 ois, 然后看结果,作为一个成长系,做完 ois 过后我们画画这个残叉图就是稍作 pro。 其实老公圈是否符合经典假地,如果符合的话,我们再进行严格的检验,然后如果有所谓的比如存在一方差存在相关,只要我们需要去做相应的处理,对于时间训练数据还可以去检验,但是我们存在结构变动,变动就是做检验就 f 检验,然后对这数据 质量进行检验,判断期是否存在多功能功效性、极端值,如果工具变量等等,可以做出相应的这个调节啊。其实整个呃对多功能功能先进,我会在后期来讲,为什么现在呃配方里面不做多功能,因为他对结果不太影响。对于回归函数的句型是,我们可以考虑线性的,也可以考虑非线性的,也可以考虑双对数的,也可以考虑非那个对数型单对数的 啊,对于受数据可获得的一个限制啊。遗漏变量几乎不可避免就会扯到遗遗漏变量的问题啊,一直很很有必要在时的呃配套里面对进行进行讨论。不外乎一般遗漏变量就低存在遗漏变量,但与解释变量不相关,可,所以可以不做处理。第二,存在遗漏变量且与解释变量相关,这时候我们就要去呃进行一个处理的 处理方法,包括增加变量,寻找代理变量,使使用工具变量,使用面板数据。因为,所以很多很多小伙伴问我,哎,面板数据,呃为为为什么不会?就是说不会,特别说,呃去考虑这个遗落变量问题,因为 面板素它本来是结构的,而且最重要是其实面板素也也需要考虑,大家会看到每每天配方里面之后,呃都会有一个稳定性检验哦,我把这个打上去了,方便大家记一下。 第一次准备一个面, 不想换 第二个,也是纯的一个变量,但是相关这种就就应该处理。处理方法,嗯,加控制变量, 寻找代理变量,使用工具变量,使用面板试卷。 啊,对,还有另外一种问题呢,常见问题就内心解释变了, 这是我们的处理方式,就是说呃寻找有效的工具备用。 由于面板数据啊,哦,我这个单独说,为什么面板数据他比较特殊,这是因为面板数据啊,在一定程度,在一定程度上不是完全啊, 所以啊,它比洁面数据和时间数据的数据, 所以我们在这个网尽量去找这些找面板税,能在面板税一定要找面板税。 然后我接下来下一堂课就会讲解一下我们常用的一些数据来源,包括,呃,中文的数据,英文的数据,国际的这个外文数据啊,包括一些历史上的数据,我们应该用它们去 去找,怎么找?对,好了,今天视频就讲解到这里,私人分析给你看,不一样的私人分析。

大家好,今天教大家在麦克电脑上下载安装一款统计分学软件, 它的名字呢就叫 stout, 有需要在工作和学习中用到这款软件的小伙伴呢,可以跟着本次的视频教程来下载安装,装好之后呢就可以使用了。 首先我先教大家如何下载这款软件,下载的方式非常简单,只需要打开微信搜索小木全堂,关注以后回复 stout 就可以获取了。 安装包下载完了之后双击打开,打开之后双击运行这个 synta 的安装程序, 进入安装界面之后点击继续,点击继续 选择。同意,这里有三个选项,我们只选择中间这这个就可以了,其他两个一般是用不到的。然后点击继续点击安装,输入电脑密码 提示,安装完成之后点击关闭, 接下来打开软件进行激活, 打开之后前面两个随便填就可以了, 后面这三个需要用到激活文件里的内容,然后提示激活完成,这里提示是让你注册把这个取消,然后点击完成,这是提示自动更新的一个选项,我们选择最下面这个,不用管它更新,然后点击 ok, 这样软件就安装完成了。不过软件安装完成之后,他是英文版的,很多小伙伴呢还是需要中文的,那么如何进行修改语言呢?点击左上角的软件名称,然后选择首选项,首选项这里面有一个用户界面语言, 这里选择 chinese 就可以了,然后点击 ok, 修改完成之后退出软件,重新启动一下, 再次打开之后你会发现他已经成为了中文版本的。好了,那本次的 storet 的软件安装教程就给大家带来到这里, 如果你也想在自己的麦克电脑上下载安装这款统计分析软件的话,我在这里提供一个下载地址,只需要你打开微信搜索小木学堂,关注以后回复 stop 就可以获取了。 在安装过程中如果有不清楚的地方可以给我留言,我看到后会第一时间回复。

stat 做数据分析,分类变量 森林图 敏感性分析, 挨个检验学会了吗?

哈喽,大家好,那么最近收到私信表示面板数据我们都知道做简单的固定效应模型,但是具体的命令又有好几种,然后大家可能有点稍微的分不清楚,那么这期视频就把最常见的几种代码给大家分享一下,希望对大家有所帮助。 然后对于面板数据呢,我们最常用的就是这四种方法,嗯,总体来说这四种方法都特别简单,只是每一种就是稍微有一点点需要注意的地方,那么这里给大家简单的解释一下。那么 呃,然后我的这个数据仍然是我常用的一个面板数据的一个教学示范数据,然后就是个体是 province, 然后年份是 e, 然后后面是 y x c x 三这样子的一个数据。那么第一种命令呢?我们主要是 呃通过,如果要做双向固定的固定效应模型,一般是通过引入虚拟变量来代表不同的个体,可以取起起到和固定效应这个组类估计一样的效果, 那么区别就在于我们要引引入虚拟变量来代表不同的个体,那么这种就就称之为简单经典的一个呃,最小二成虚拟变量方法 through lsdv, 那他们的优点就是可以对个体, 也就是可以对个体进行一个抑制性的估计,那么缺点就是如果你的个体 pro, 我的是 province, 一般不会大,就是固定的,如果大家是公司啊或者是银行啊什么的,就是在嗯,特别大的情况下,可能会要引入特别多的 呃,虚拟变量,那么自由度损失太大了,可能会超出 stator 所决所允许的解释变量个数,那么可能就 这,那么这可能就是他的一个缺点,那优点呢?就是他对数据格式是没有要求的,他是横截面数据啊,面板数据啊,都可以使用的。 那我们接下来先跑一下第一种结果,但是第一种结果你如果做面板数据,你要控制时间和个体的话,就只能通过这种加入虚拟变量的方式而来进行控制, 所以他的结果,所以他的结果会报告一大串串那种虚拟变量的回归结果,你看我有多少个个体就得包包多少个虚拟变量的结果,一儿也是的。然后你看, 如果你这里的,呃,我的,呃,如果你这里的个体很多的话,那么可能会很多很多跑下来,呃,如果如果特别多,那可能 会超出他解释的个数,所以,嗯,很大的话,那么这个命令就不太行啊。这是第一种比较简单,我把结果保存一下,等会一起导出来对比看一下。 嗯,第二种呢?我们用的很少,那么第二种命令是对第一种命令的一个优化,它,它对数据结构也没有要求,嗯, 他唯一对他改进的就是指,就是 i 点 promise, 就 i 点个体, i 点 id 这种。因为我们有时候在回归中控制很多虚拟变量,但是又不想生成, 呃,这么多的,生成这么多的虚拟变量的时候,不想报告虚拟变量的回归结果,那么我们就可以使用这种,使用这种命令,那么这种命令就是可以更快的汇报这种更简洁的结果,那么他的局限就是这个,额不,字儿里面包含了这个分类变量,是只能加 一个变量的,如果你是要估计是要进行双向固定效应,或者是更高维度的固定效应的话,那么还是得使用这个 idea, ear idea 什么的方式来映入一个序列的变量。 但是我现在写的这个代码跟 d 中的代码是等价的,结果其实是一样的, 那么这是第二种情况,我们也把它保存一下。你看这里,我把 year 把 province 说错了,加入这个 oppo zero 里面进行控制歌词, 把个个体进行控制的时候,他就不会报告易产川的这种虚拟变量的回归结果。所以在 n 很大的话,我们可能就不用第一种,就用第二种 mini 比较方便一些,那么接下来是第三种。嗯,第三种呢,是我们最最最 常用的,因为这个是呃 state 的一个固定效应的一个官方的命令,那么是最为纯正的吧。应该这样说,它是一种组类的估计量,但它要求的必须是针对面板数据,因为它是 x t, 它是针对面板数据的。所以我们在使用这个命令的情况下,前提下一定要先定义呃 个体维度和时间维度。 我的个体是 province 的,年份是 year, 我们先要进行个体和时间维度的一个定义, 那我们一旦在这个固定效应后面加上这个 f e, 呃,不是这个回归效应,加上 f e 就表示使用固定效应组类估计的方法。如果这里是 r e 呢?就是随机效应,那这 这个代码呢?因为我们如果加了 f 一,就是使用固定效应足类估计,那么这个代码是默认我们是控制了个体了,所以这里不需要再用 idid, provinceididid 或者是 idid。 呃,什么什么?呃,就是你的个体的变量名来进行控制你的个体,因为这个命令 这个 mini 是只要你这里加了 f 一,它就自动是控制了个体的,这种固定效应是自动控制了个体,大家一定要记住,所以这里不要再加 i 点 i 点 id, i 点 province 什么的。但是呢,如果我们要控制时间的话,我们还是要通过引入虚拟变量 i 点 e 而来表示不同的时间。 嗯,这种是这种方,这种固定效应呢是通过一种呃泥叉变换消除了不同个体的组间差异,保留了每个个体的一个组类差异,所以这种方法我们一般称为组类估计,这种是一个 组类的估计,那么需要主要的。呃,需要注意的是,就是同一个个体不同时间的扰动项可能相关,所以说我们也可能存在一定存在一定的组类字相关,所以我们还需要使用以每个个体为剧类的一个剧类稳健标准物,也就是后面的后面的这个操作, 剧类文件标准为个体为剧类。然后我后面发现我每个代码后面都都进行了这个操作,因为我为了让四种尽可能的一致嘛。然后接下来我们跑一下这个最纯正的一个固定效应模型, 它这里也不会报告你的个体的一个虚拟变量,因为它是直接自动控制了个体的,所以这里只需要用 i 点 e 来引入虚拟变量控制年份就可以了。 然后我们可以把这个回归结果保存一下。嗯,接下来要要分享啊,文字, 文字,算了,讲完了之后再拍他。然后第四种命令是一个多维的固定效应模型,因为有的时候我们需要控制一个多个维度,有时候我们的个体 可能会先分城市,再分区域,再分什么或者是银行,呃,先分先是具体的银行,然后再分一定的行业 或者是公司,把,公司也会通过某一个指标进分,再分一定的行业什么的,所以这里有时候会有个 industry, 或者有个什么区域的划分就是,嗯,所以我们会,所以我们就叫多维固定,他除了他不止可以控制时间,个体还可以控制更 高维度的,这是它一个最大的一个优点。但是在我的这个,呃,我的这个面板数据里面,我没有这个更高维度的需求,所以我这里就是还是以 ear province 来进行控制。就是我这里强调这个命令就是为了想告诉大家它是可以进行多维固定的。如果我们还要 对更高一个维度进行控制的话,那么这个固定效应模型是,呃最方便的,那他们的他的 运行速度也比上面的命令都要高一些。但是呢,这个命令是一个外部的命令,所以我们执行这个命令的时候,嗯,必须要先安装一下,也就是 s s c in store 安装一下。 那安装这个命令的时候,有的人会说会出现一定的报错,然后报错的时候他下面不是会进行一个提示吗?你点进去看的话,你会 会发现他还需要再安装一个辅助工具箱就可以了,就点击一下就可以了。那这个命令就是多维的固定效应,我这里是没有更高维度的一个需求,先把它删了。 嗯,这个就是多维固定效应,然后它跟与前面的 mini 相比呢,它不会不需要使用 ident province, ident year 挨一点 province 挨点也或者挨点什么来引入虚拟变量,那他会方便很多,而且也不会报告呃,就是易缠穿的一个虚拟变量回归结果,所以他总体这里都比较简约, 比较好看。上面的话都会报告很多的虚拟变量的结果。因为我这边我的数据量不大,所以你觉得这些虚拟变量对你的结果什么的没什么影响,但你如果数据量很大的话,你就会发现一定的不变性的。 那我觉得这种 mini 是前面的一个 mini 的一个更高的优化哦。接下来我们把这个 mini 也保存一下, 然后接下来我们把这四个 mini 一起导出来,看一下这四个 mini 的一个估计的差别。 a step mini mini 结果导出这个我有教学视频的,我们我们 a step 四个 mini, 然后用表格用 reg 一来进行表达,然后后面这些参数的话,大家学习的话可以看我另外一个视频。 然后因为我里面有些变量都报告了虚拟变量的结果,所以我这里只知道除了 x 一二三对外的一个回归结果的一个结果汇报。 然后我们把四个结果导出来,点击一下, 我们看到这个结果导出来了,然后我们看一下这个结果。首先呢,我们看到这个回归系数基本上都是一致的,是没有什么差别的,因为我做命令的时候我就会尽量把,呃,尽量就是保持一致, 嗯,就是在等价的方式上进行这个代码的一个变换吧,然后他们的回归系数基本上是一致的,没有什么变化,变化的唯一的就是这个标准物,标准物可能会略有差异, 我们可以看到二三这两种标准物是一模一样的,因为这两个估,呃,这两个估计结果的标准物是一致的,因为这两个命令背后的估计方法是 特殊的那种混合的 ols, 也就是最小二乘法,所以他们两个的那个呃结果是等价的回归,连标准物都是一致的。那么一和四的标准物呢? 呃,也是一致的,因为他们两个人,他们两个命运的背后是组类的,一个估计是一个固体效应的一个估计结果,所以一四等价,二三是等价的,但是,但是标准会稍微有点差别,倒也不太有影响。 那么最后再把这四个命音给大家讲一下呢,就是强项,重点就是 这三个。第四个命令是一个多维的固定效应,我们需要呃对多个维度进行控制的话,又先又先选择第四个,又先选择第四个命令, 然后再强调一下,第一个命令是 state 的一个官方命令,它是自动控制个体的,所以有时间需要时间固定效应,需要引入时间虚拟变量进行控制,但是个体是自动控制的,那么这两种命令呢,都是一个最小二乘法的一个回归结果。 嗯,他对于这种第二种情况,是个体和时间都需要通过引入虚拟变量的方法进行控制,那他相对来说就会速度,运行的速度会比较慢,但是他会汇报详细的一个虚拟变量的结果, 那么它是可以控制一个虚拟变量,它是可以,呃,就是它相比于第二种情况的话,它是可以汇报一个更简洁的结果,如果你的 n 很大的话,然后你可以考虑试一下使用三, 没有说哪个命令最好。嗯,但是你这个二三是不挑数据的,它是横截面数据也可以的,那么意思都是针对一个面板数据的,尤其是一,所以大概就是这四种模,呃,大概,哎,我这么讲的被我自己把我自己绕进去了呢, 反正以上就是这个四种固定效应模型的一个简单的一个讲解。嗯,希望对大家有所帮助。那么我们自己在日常的写论文什么的,一般用的比较多的都是一和四,如果是面板数据的话,如果是很简便数据的话,那就是二和三, 那么在横截面数据中优先使用二和三,横截面数据中 n 比较大的话,我们就使用三,那么如果是面板数据,我们优先选择一,然后如果是面板数据中,我们需要对多个效应的多维固定,就除了时间、个体还有更高的一个区域进行需要控制的话,我们就使用四, 简而言之就是上面的这些。嗯,那么今天这期视频就到这里结束,大家如果还有问题的话可以在评论区留言,嗯,谢谢大家。

这节课我们来讲一下 stat 基础界面的一个介绍。嗯,这个就是我们安装好的一个 stat, 大家安装好的时候应该是这个界面 啊,它处于一个标准模式下,也就是整个界面都是白白的。嗯,我这边的话把它调成了一个克拉斯扣,经典模式,也就是右键 preference, 偏好选择 classical。 这个模式下有什么好处呢?就是我们很多的代码在这个框里面就不会出现乱码,就好比一些中文,在我们白色界面下,也就是标准模式下,它是可能会乱码的。 而我们这个黑色线界面,也就是经典模式下,他是不会乱码的。好,我们来说一下这个 ctrl 界面整体的一个功能啊。首先 中间这一块最大的,最黑的这一块是我们的结果输出框,也就是你所有的命令回馈都会在这里面展示啊。下面这个空面的就是我们的输入命令的地方,我们可以随便输一个命令, 敲毁车直行,那下面就会有一个回馈,对吧?在这个结果输出框,当然我们也可以敲击一个错误的命令,它里面也会有回馈啊。如果出现了这种红色的,红色的这些英文,那就说明我们这条命令是执行有误的。 好,我们左边这一栏呢,是我们,呃命令的记录栏,刚刚我们说了两条命令,一条克里亚,一条错误的命令,左边都是会有记录, 如果你不小心把这个记录栏里关掉了,我们可以从上面的 window 找到 review, 然后点击一下, 他就可以出来了。好,右边这一块呢,是我们的变量啊,上面下面都是变量,那我们现在这份数据里面他没有啊,他没有任何数据,所以这边展示都是空白的。 上面他可以具体展示我们有哪些变量,而下面呢,他能展示我们啊,这份数据里面有几个变量,以及这份数据他一共有多少条数据,也就是一共有起航。 至于上面的这个菜单,来啊,其实我们只需要掌握三个按钮就可以了啊。像上面这一行英文菜单,其实我们呃在平时的使用过程中啊,基本不可能会用到,所以说啊,真正会用到的只有我们下面的三个,其中第一个 点击一下,他会跳出一个新的界面啊,昂抬头的度,这个界面呢,就是叫 我们的读文件。读文件他的功能其实和我们命令栏其实是相似的,都是可以在他的里面输入命令并且执行 啊。如果我们输入一下克利亚,那怎么执行呢?只需要把这条命令选中啊,也可以选中其中一部分啊,不需要全部选中。点击上面菜单栏的最后一个按钮, 那这边就会有一个回馈,也就是执行了。既然这个读文件和扣面的这里都可以输入命令和执行命令,那我们该如何选择使用哪个呢?其实 对于初学者来说啊,我建议大家直接去使用我们这个读文件,这个读文件他有什么好处?我们执行的命令之后,呃可以给他进行保存,然后关掉,下次打开还能够继续执行。 而我们这里的 comand 他就不不具备这种纯属功能,虽然他在左边这个 field 这里会有记录,但是你如果关掉了,你下次再想执行你今天执行的这个命令,那你就再也找不到了啊。所以刚学 stata, 我们一定要养成一个好的习惯,把所有的命令都写在读文件里, 我们来看一下这个读文件,如果你写好了,我们该怎么去保存他啊?保存的话其实很简单,只需要点击上面这个保存按钮, 然后点击我们的呃要保存的路径,比如说桌面,我们给他保存下来,好,现在把它关掉。我们可以看到在桌面上就出现了一个啊, 读文件,这个就是读文件,可以看一下他的后缀,他的后缀就是点 do, 也就是我们 stay 的一个脚本文件 啊。如果你要打开它,只需要把它拖入到 c 塔中就可以打开了,那么里面所有的命令都可以执行,比如像执行第一行克里亚,点击执行就可以了。另外两个按钮就是我们后面两个按钮,他们这两个按钮都是关于我们数据的。 我们先讲这个有放大镜图标的,他叫查看数据,点击一下啊,就可以啊,到我们的这个命啊数据界面啊,那现在里面是空白的,没有任何数据。前面这一个呢,有个小笔头的也很形象,可以写叫编辑数据, 他跟查看数据的差别就是我们可以在里面进行一些修改,而查看数据就不具备这样的功能。对于整个 sta 界面,我们只要清楚以下几点,第一,中间这一块可以看结果,下面可以输命令,左边 我们命令会有一个记录,右边是我们变量的一个展示啊。上面的菜单只需要掌握三个按钮,第一个读文件,我们可以在里面写命令,把命令保存 啊,下次也可以直接打开使用。然后是后面两个,一个是编辑数据,还有一个是查看数据。好,今天我们的课就先上到这里。

哈喽,大家好,那么今天这期视频的主题呢是格兰节因果检验。 呃,那么之所以会出现这期视频呢,是因为我本来想讲呃, pvair 模型面板像量子回归模型的,因为这个模型呢,一般还会去考虑别俩之间的因果关系,所以这里单独拎出来讲一下。 那么格兰杰英国检验的前提呢是变量是平稳的,如果不平稳是需要做携程检验的,如果携程检验不通过的话,一般是不能进行格兰杰英国检验的,不过可以对他进行处理,比如说插分啊,或者是其他处理得到一个同届单诊的序列 啊。那么需要强调的是呢,格兰杰英国检验是从统计学角度而言,是通过一种概率或者是 是呃分布函数的角度体现的,那么其他什么呃基本的思想理论什么的我懂得也不是很多,大家就多看看文献。这里呢,我就直接开始具体的教学操作吧。 那我们一般使用的命令呢,就是 s t j chords 这个命令,呃,我也不知道连起来应该怎么读,毕竟我是个学渣渣,但是既然我这个学渣都可以给大家教学说明,只要自己肯学呢,没有什么是可以打倒我们的哦。 那么接下来呢,我们就直接开始,我还是以我这个常见的面板教学数据。嗯,大家随机选一个面板数据进行操作就行了,并不是说一定要用我的这个数据。那刚才讲了歌单节命令的假定是所有的变量都是平稳的, 所以我们这里使用的是平稳后的数据进行哦,如果你们是差分后的数据才平稳,就要用差分后的数据来做,更难解。英国检验,哦, 那么这里我假设我的数据已经是平稳的,而且我是面板,数据是三十一个省份,呃,远远是大于我的 t 十九年,一般是不需要单位给你检验的,所以我们直接进行简单的操作吧。那么我的变量是 yxzx, 就最常规的,那么输入 xtj 裤子,然后就是,然后我们就首先比如输入 yx 一,检验 x 一是否导致了 y 默认呢?是之后一节,这是最简单的一种形式,然后结果就出来 来了,哦,就你要讲一下,就是这个命令,就这个命令的安装,安装语法就是 ss say in store 就可以了,就是最简单的那种,因为我已经安装了,所以我就不给大家重复了。 呃,那么这里呢?我的数据,这里的,呃,统计值不论是 z 还是这种,他的 p 值都是怎么样?大于零点零五的 说明我的 x 一不是 y 的格兰杰因狗检验用它的这里它的 h 零是 x e d n t, 有什么 y, 我就是 x e, 不是 y 的格兰杰。英格因果检验,那么我这里的配置小于大于零点零五,就说明不拒绝而去 不拒绝 h 零,不拒绝 h 零,也就是相约等于 h 零是成立的,也就是 x 一不是 y 的。格兰姐。英国检验, 呃,接下来的我们可以设定,呃,这是最简,是最简单的形式,接下来的我们在这个基础上,呃,再加一些参数的设置,呃,比如说,呃,还可以在后面进行, 不好意思,应该是英文模式下好,比如我们还可以进行之后二阶计算的,之后二阶三阶嘛,所以我们在后面直接输了那一个,然后默认是一阶,所以我们这里输入二阶。 呃,说二届,他会提醒我们,他说我们的 tmase blaze 必须比什么什么大五加三 k 大,那么 k 是 leg 之后接数, 那如果我要求只,也就是说我们如果要求这里的那个设置为二,之后接数为二,也就是 k 等于二, k 等于二,二三得六,六加五是十 十一,所以要求我的 t 也就是我们泰姆年份必须是十一年,而我只有九年的数据,所以就说明我怎么样不可以进行之后二届,嗯,所以说我为什么要把这个错误可以给大家讲出来呢? 啊,是因为我经常收到呃私信,大家都说,嗯,就是我当我们根据 aic 或者 bic 的准则确定最佳的之后接触,还有我们在做 pva 模型的时候呢,会 会用 xtvrsoc 这个代码确定追究了之后接触,那确定了之后呢?根据, 嗯,根据这个确定的最优之后接触来做这个国内节英国检验的时候呢,发现根本就做不了。所以说如果你的如果你的数据可以满足那个呃你通过别的方法确定的最优质 之后接触,那种情况下,那当然是最好的,如果不行,我觉得我们在执行高端节英国检验的时候可以不必距离于呃我们其他方式显出的之后接触,因为高端节英国检验就是检验 x 之后像对外的一个联合影响吗?那么既然 我们的数据要求不能,那就那就,那就不用去呃去那么的纠结,而且很多文献里面好像也嗯,做 pva 而摸心的时候很多时候也没有做各大节英国检验,我觉得,呃,没有必要,就是没有必要那么那么去强求自己的数据那么完美。 呃,如果你的数据年份比较大的话,一般都会做他时间年,时间年份比较长的话,一般都会进行单位跟他写证,然后都要跟大姐英国检验这种, 然后会根据别的方式确定最优的之后结束。比如说 aicbic 准则这里,呃 我的数据可能不是很理想做这个模型,但是其他人可能会,所以我还是给大家讲一下。呃,通过这个方式,通过格兰在格兰节英国检验时候可以怎么确定之?最佳的最后结束就是根据 aicbic 准则。 嗯,首先我们是 lex 一,然后我们输入 estat, 不好意思, esatat, 然后是 sa, 可以看到这里会出现 aic 和 bic, 我们一般是根据 sbic 最小的准则来确定最佳的之后结束。如果你可以之后二阶,你就 接下来。呃,你就接,你就接下来。在这里输入 nike 二,然后 nike 三,呃,然后再输入呃 esktic, 看他的 acbic 准则,然后选择一个最佳的就可以了, 就可以确定这个最优的之后结束。或者是做 pvr 模型的时候会专门有一个代码去确定最优的之后结束。 嗯,那到时候呢,我会在我另外一个视频中进行一个呃前后的衔接。接下来我们还是将我们的格兰街英国检验,然后这种在这种形式基础上呢,我们还可以扩展到基基于 boss trip 计算的壁纸和各种零戒指。呃,我们只需要在后面输入 就是 boss trap, 嗯, boss trip 设定了之后呢,正在这种情况下的配置和临界制,在设置这种情况下,我们还可以进行一个,我们还可以进行,比如说我们比较常见的一个呃 rips, 也就是重复次数, 嗯,我们一般设置为一百吧,一百吧,重复一百次。还有比如说我们的 blev, 也就是不出来不计算的临界值的减注性水平,默认的是百分之九十五, 然后还有其他的一系列选项的话,一一系列之选项的话,到时候我放在评论区吧,大家直接复制粘贴吧,也比较简单。 嗯,输入之后我们看结果。我本来把这个命令单独拎出来,是想给大家回答一下大家经常问的一些问题, 但是我发现单独拎出来好像意义不是很大,还是得放在具体的一个整体的一个模型中去讲解比较合适。那到时候我再讲。呃,面板下面做回归模型的时候呢,再给大家呃梳理一下, 那么我们可以在不下这个种情况下计算的壁纸还是怎么样?大于零点零五的说明不能拒绝。 xhanxc 还是 xc 不是外的歌单接英国检验, 那说明我们的隔断节英国节是没有通过的。呃,那么这期视频我们就到这里结束了,可能讲的都比较基础, 大家讲简单入门。那么下一期视频呢?我刚刚讲了是关于 pvr 模型的,到时候会把这个歌单节英国检验和其他分析连接在一起,讲一下具体的分析流程的, 然后非常感谢大家的关注,大家有什么问题在评论区留言,然后我也希望其他人在看到嗯别人的问题的时候,因为我, 呃呃我跑,就是每个人跑模型的问题都各不相同,我希望大家可以互帮互助,如果你呃知道别人的问题,也可以在评论区下面给他回复一下。呃,有,因为有时候我也没有遇到这样的 问题,我并不是说什么都都会懂,会了解具体问题出在哪里。嗯,然后我们下期视频再见吧。