统计分数据分类啊,包括二分类,也包括多分类,包括有序分类,也包括无序分类,他们一般不描述均数,一般他们会描述 其他的指标,比方说率或者构成。对这类数据,它的统计分项一般采用咖坊级或者 fisher 具体概率法。所以我 这阶段我们主要介绍啊,第十十一、十二十三,主要主动介绍他方企,顺便会提一下致和解, 今天我们主要介绍两个绿比较的卡方解,那么这个题目呢,我们主要讨论绿的比较,主要采用方法是卡方解方法,因为啊,我们数据库常见的描述方法, 定量的用均数中位数分类数据的,就用绿或者构成比,这个绿跟构成比啊,他们有共同的特点,都是百分比,最常见的就是我们绿的比较,那么绿的比较呢 啊,包括有效率啊,发病率,死亡率等等等。那么绿的背后呢,是两组数据的比较, 两组序列比较,比如说有效,无效啊,有效无效,有无效,那么就会算出有效率到百分之三十, 那么有实验组有效率,对照组有效率,那么就两个有效率比较,我们要去研究,去分析我们才能方法,就是 比如说引达潘安片治疗原发性高血压疗效,将患者随机分为两组,也就是引达潘安片加辅助治疗,另外就是对照组用 m g 加辅助治疗,问两组有效率有没有差别? 我们这里这个表格大家可以看出来,有两种人群,那么有效无效,可以算出来有效率, 一种有效率百分之四十五点四五,另外一种有效率百分之八十七点七七啊,这个百分比,这个数,这个表格啊,我们称为汇总表,他汇总了对照组的有效人数、无效人数、事业组的有效人数和无效人数,同时在此基础上计算两组有效率。大家可以看出来,这两组有效率是有差别的, 但这种差别呢,是样本的差别,还不能上升到总体人群的差别。我们统计学需要探讨样本背后总人群的差异性,所以我们要进行统计分析。在这个表格里面, 大家看看,我们把这个表格称之为二乘二交叉表,为什么叫二乘二交叉表呢? 它的数据是由两行分别代表两组,预兆组跟事业组有两列,分别反映了结局有效或无效。所以呢, 它主要数据啊,存在,在存在,在四个表格里面,四个单元格里面,二十二四,二十一五,它不是原始数据,是汇总的个数,其他的数据都是由这个四个单元格的数据计算而得到的,这样数据成为二乘二的交叉表,它是分类数据比较研究 一种常见的汇总格式。这种汇总格式我们称为四格表,因为这个本例的资料经整理,就会形成这么四个单元的格式,四个单元格的数据, 我们把这样子的二乘二的交叉表成为四格表资料啊。交叉表, 交叉表又称为行列表,有两行,两列啊,就是二乘二,所以两组率的比较往往体现的表格就汇总表格啊,不是原始数据的表格,汇总表 就是二乘二的四格表,假组一组发声未发声, a、 b、 c、 d 四个单元格有四个汇总数据,那么你可以说是四格表资料的比较或者两组率的比较都是可以的。 对,这样的分组是两个水平,其余指标也是二分类,是完全随机设计或者成组设计比较,两个构成比,而且啊,是比较两组二分类结局的分布,那么通俗一点,往往是两个绿的比较,我们采用卡方结的方法来开展,采用卡方结的结果来开展。 那么卡方结或者卡方结它的写法啊,是希腊字母平方啊,不是 x 平方,是卡方。我的写起来比较奇怪啊,那么卡方结 是比较绿,它就像 t g 发达分析一样,它首先会换算出一个卡房值,再根据这个卡房值计算的 p 值。这里面的原理我这里不多讲,它的卡房值主要探讨理论评述与实际评述的吻合程度。 我们的实际平数我们称之为 a, 就是我们刚才看到的四格表实际的数字, a、 b、 c、 d 二十二十四,二十一五实际上发生的数据。 另外一个我们成为理论平数 t 又称为七万平数。 e 是假设计 h 零成立的情况下, pa 一等于 pa 二,也就是两个 率相等的情况下,算出来一个假想的评数。理论上的评数,也就说在 h 零乘零时候的时候的一个评数。我们假设界有 h 零, h 一对不对? 一般我们先假设 h 零成立,那么 h 零如果他们相等会怎么样?相等的时候会算出一个理论平数,我们称为总体平数,实际平数我们是量平数,那么卡番茄就会先计算理论平数啊。然后呢,计算理论平数跟实际平数的吻合程度,这个吻合程度就是实际平数跟理论平数的差别, a 是实际平数, t 是零的平数, a 减 g 平方除以 t, 这个就是每一个单元格的零的平数和单元格的实际平数的差值,他差 差别 四个单元格就可以是算出四个理论平数跟四个实际平数。然后呢,每个单元格都可以算出实际平数跟理论平数差别。外面公式是 sigma 累加累加,就可以把把所有单元格的理论平数跟实际平数的差别加起来,这个加起来就是卡方值。 当然我想很多人朋友圈周老师什么是理论名数,怎么算出来的?当然我们本科生教学的时候会讲怎么算,但对这门课程来说,大家无需 不需取算,软件会给你算出来,甚至你什么叫理论评述,什么意义都不需要,不需要掌握,你只要知道我们可以根据理论评述采用合适的方法就可以了。如果假设题 h n 真的成立,就拍 等于他这种成立,那么理论名数跟实际评数应该相差不大, h 的成立相差不大,那么这个时候卡方值会比较小。如果卡方值比较大,那意味着理论名数跟实际评数相差就大了,这个一大,反过来就要怀疑 h 的成立。如果这个值很大, 我们就要认为 h 零不成立,谁成立呢? h 一, h 是谁呢? h 是怕一不等于怕二。 所以卡方值的大小决定了到底相等还是不等, h 零是相等, h e 是不等,当然它实际上决定的是它的屁值。卡方值先 确定 p 值,在下结论,也就是我们跟之前学过一样, p 值可以算出 p 值,这里咖方值也可以算出 p 值, p 值在零点零五, 那不拒绝群差有没有统计协议啊?这个都懂,对吧?反过来,平时小于等于零点零五,我们是差有统计协议。 那么一般情况下,咖方值越大, p 值越小,当咖方值大于他的小概率世界界时的时候啊, 大家可以看这公式,对吧?看完值逼大大于小概率世界计时的时候, p 值小于零六,开完值小于小概率事件计值的时候必是大于零。 这具体的东西我们想问去讲,这 t 级方法分析也一样,他都有个小概率系的戒指,这个戒指多少我们也不用去管它,统计软件都会根据这个戒指会帮助我们去算 p 值,因为我们最重要的就是了解去计算 p 值,具体怎么算出来的,请忽略啊。 它的假设结过程, h 零 pa 等于 pa, 两组有效率相等。 h 一 pa 不等 pa, 两组有效率不等。阿尔法等于零点零五, p 值小于零点零五,有同缺异。 然后呢,我们都可以通过软件可以算出卡方值来啊,这是卡方值的计算公式啊,连列米数跟实际米数的吻合程度可以综合算出来,等于八点四八,怎么算的,软件给你算。 接着我们可以根据他的 p 值啊,可以根据他他方值,他方值八点四八,他的小概率数据地值是三点八四啊,为什么三点八四?不要想,不用去考虑啊,这个是统计学原理,他方值大于三点八四,这 p 值小于零点五, 开方值越大, p 值越小,所以大于三点八四, p 值则小于零点零五。小于零点零五,我们总认为要拒绝选择 in 接算 c 差异额统权益差异额统权益 有差别,说明两组率不同。这个就是卡方解的一个解步骤,大家听得云里雾里,但其中的东西不需要讲太多, 这个东西两组列的比表或者四格列四格表之间的分析。二乘二行列表就四格表采用的是咖方结,我们最终是希望是计算 p 值来下结论, p 值小于零五,两组率由统继续差异。 大家重点掌握的是这张 ppt 卡方体的应用条件,也就是说卡方体并不是所有的四个表都可以分析的。什么时候可以用卡方呢?两种情况要不然大于四十七等于五,则第六乘法 总要不要大点四十 t 呢?每个单元格的零的名数啊,七是零的名数对吧?每任何一个单元格零的名数都大点。五,我们用卡方解, 第二种情况是另外一种开放,叫第二种开放,要不要大点试试?至少一个单元格,至少一个单元格啊这是,我们四个表不是有四个单元格吗? 剩下一个单元格里面的名数小于五。大一,我们采用的方法是校正开放。这校正两个字大家不陌生了,我们在介介绍 t 结的时候就讲过,对吧?有 t 结和交正替结, t 结是放他起的手,交正替结是放他不起的手。 那么如果上述调节的不符合,要么让小一试词 who 至少一个 t, 至少一个单元格的理论平数。小一,我们不再用卡方解,用的是 fisher 确切概率法。 fisher 确切概率的方法, 你说卡方企业和调动卡方都属于广义上的卡方,它只有硬条件,如果要买小于四十或者至少一个单元格理论平数小一,卡方,企业就不能用了。用 facial 确切代理法来判断 啊。这个是交通卡方公式,这个减去零点零五,多了一个减零点零五的操作。 比如说某医师,一比较花令胆结与神经碱干支治疗脑血管疾病的疗效,花令胆结组、神经结干支组具体指标也是有效无效,因此他也是二乘二的交叉表或者行列表这个表资料了。 然后呢,我们在计算理论平数的时候,发现这里有两个单元格理论平数是小于五的, 都大一,而且样板量呢,也都大于四十,因为是五十八嘛,总的样板量是大于四十。在这种情况下,我们采用方法就是调动卡放,第一步,建立假设,第二步, 采用卡方校正的公式去计算卡方值。卡方校正的公式计算卡方值啊,算出来是零点三七六。第三步,根据卡方值算, 一直可以吃大零点零五,因此不积极。 h 零差异,五桶积血液上部分人认为两种药物治疗脑血管疾病有效率不等,还看不出来差别来,从统计学上来,看不出差别来。 另外是非洲人法,非洲人法是一种精确解决的方法,卡方解是禁词法,非洲人法是精确法。 那么 fashion 法呢?是卡方其的重要补充。那么有些场合它甚至不是配角,而是主角。比如说样板量,总样板量小于四十,不能用卡方制造一个单元格的理论平数小一,不能用卡方,都要用 fashion 法。 有些时候,第三种场景,当开放器 p 值接近零点零五的时候,就开放器 p 值约等于零点零五,零点零五一,零点零 四九。那么这个时候你到你说到底是大零点零还是小零点零啊?有些时候不好说,因为卡方杰的 p 值,卡方杰是近视法,他算出来 p 值近视值而非求法的精确法。 你现在想知道到底我的结果是 p 是大零点零五还是小零点零五?有些时候我们要借助精确法, 所以当卡番茄 p 值低至零点零五的时候,你要不明确到底是阴性结果还是阳性结果,就可以用精确法,也就是非选法来一锤定音。所以以上这种场景都可以用非选法。 不过非选法有个缺点,你的它样本来一大,往往它就算不出来,因为它它对计算机,计算机的性能有一定的考验。所以一般情况下,如果卡方解条件允许的话,多用卡方,卡方解条件不允许用非选法, 你明白了吗?更多的大家可以参考今天的课程推文,了解更多的 facial 法结 好这段视频就讲这里。
粉丝244获赞597

哈喽,大家好,欢迎继续回来,我是吴松老师,刚才呢,我们已经说了什么?第二个叫描述,我们再来看一下探索,我们探索什么呢?我们再探索一个身高,对不对?我们打破 大哥问到底,我们逮着身高不放,我们点分析秒统计呢?我们再探索一个 spro 探索,点开探索的时候发现他还是一个套路,是不是?那只不过是多了几个锅而已,那么探索什么呢?我们探索身高 啊,探身高,那么在下面怎么办呢?这样子吧,送个增加一个难度,我们探索不同性别的身高到底是什么情况?我们将 性别放入硬字列表,那么后面就会按照男和女的身高分别来进行探索。探索什么呢啊?二级功能窗口永远只干两件事情,一是选变量,我们变量已经选好了,第二个就是设置 参数,摄餐数就是添油加醋, ok, 我们点开统计,点开统计啊,我们先来看一下,在这统计里面,他是 写的是平均值的百分之九十五的咨询区间,我们上课的时候大家还记得吗?我们学过一张总体均数的百分之九十五肯定区间,估计 当时我们花了一定的时间推倒了他的什么百分之九十五可云之间。 gucci 的一个什么公司啊,推的比较烦人,但是 spss 他已经默认了他的 百分之九十五,退到就已经默认的选项就勾选在这地方,如果你此时要想算那百分之九十九的可以去见的话,你只要改就行了,通常默认的有百分之九十五,所以点继续确定,下面就可以进行作图,进行作图,我们点 plot 作图,那么第一个就是相识图 boxplot 默认, 我们把它吗放进去啊,叫做相视图,然后右边还可以描述描述我们数据的,可以做 stem and neaf graph, 就是敬业图和黑色素管理之方图。我们还可以对我们数据是 组织符合正态分布进行同区检验啊,叫含检验的正态图。 ok, 把他们勾选好了之后呢点继续又回到我们爱情功能窗口选项呢,是不需要进行做的,他告诉我们我们如何 感谢我们的数据啊,这是默认的,不用关心他好,自助抽样就不是出来。我们前面也简单的聊了聊了一下,这个呢,嗯,不说啊,不说,不要进行一个了解, 那么等大家读研究生的时候再进行学习吧。 ok, 叫自助抽象法。好,我们设置好了之后, ig 功能窗口选参数,设备量, ok, 点确定, 结果刷刷刷就已经出来了。好,出来好了之后呢,第一个呢叫做更按处理摘药,这个呢,我们简单看一下,他告诉我们什么呢?他告诉我们的数据到底有没有确实值,我们发现确实有没有啊,有,对,男生有三百零三个是有效的,二百八十七是 有效的女生,那么男生有七个缺失,女生呢?有两个缺失的。 ok, 那么缺失的数据是不参加后续分析的。好,我们再来看下面, 下面又分别对了男生和女生来进行一个同学的描述,那么这个描述我相信大家都能看懂。告诉我们男生的身高的均值是多少呢?是一米七 零点零九二,他的标准误差是零点三幺五,是不是他的百分之九十五可以区间?大家注意了,这就是什么?这就是总体三数的百分之九十五的可以区间,是不是他是一六九点四六零到一七零点七二五,而且呢, 真正的总体均速落在这个范围的可能性达到满百分之九十五,下面就是百分之五的修正均值。什么叫百分之五?修正均值是指 我们会把一些特大的、特小的来百分之五的数给他去除掉之后,剩下来的百分之九十五的数据来描述他的均值,我们发现他是一七零点幺五零 和零九二,相差是不大的, ok, 然后这就是他的中位数方差,标准偏差,就是标准差,最小值,最大值极差 四分位数间距偏度,分度啊,老生常谈,和前面都是一样的,下面是女生也是一样的,是不是? ok, 这就带大家看了一个, 你们自己举一反三, ok, 男女生都是一样的。下面就进行了正态音检验,就是 sps 啊,他会用两种方法去告诉我们到底符合不符正态分布。一种叫做,哎呀,这个呢是 翻译成中文的,中文呢,读起来很别扭,不好啊。我们前面这种呢叫做 d 检验啊,叫做 d 检验。后面这种呢叫做 w 检验啊, w 检验, d 检验。一般样板量比较大的时候呢,用 d 检验,样板量比较小的时候呢,用 w 检验,所以叫做大 d 小 w 啊,大 d 小 w, 那何为大,何为小呢?又存在一个困惑,那么何为大呢? 那么在萨斯统计软件认为样本量大于二千的时候才叫大, spss 认为样本量大于五千才叫大。但是我们生物医药领域里面, 我们医学同级学人为出版社这个十周华教授主编的认为,大于五十在生物一样就算大了啊,就算大了,那我们就以就选择一个参考标准吧,就以五十为结吧,我们这个样本来肯定大于五十的,那就那就算大,算大的话,我们看大就是大 递检验发现,男生男生的身高正在检验的批值是零点零零零,小于零点零五的小心意义。有差异和什么有差异啊?失职 男生身高值的分布与正态分布有差异,那么就是说他和正态分布比是有差别的,因此他不符合正态分布。那么女生呢?零点零零零,零点零零九也是小于零点零五的,因此呢,他也是不 符合正在分布的。那为什么不符合正在分布呢?我再往下看一下。哎,有的人说了,老师,这男生不是挺好的吗?男生数据不是挺好的吗?也挺对称的,为什么不符合正在分布呢?是不是然后发现,哎,女生好像也挺好的,为什么不符合正在分布呢? ok, 所以呢,在统计风险的时候,我们很多教材里面都说了,比如说提前要求独立,正在放茶期,虽然 有正态音要求,但是正态音要求不是非常的高,不是非常的高,近似正态也可以啊,近似正态也可以。如果这一题你真正要想知道他为什么不符正态分布,我们就就看偏度系数和风度系数,我们来进行验证,用偏度系数去处于他的标准物,看绝对值是不是大于一点九六。大于那就说明 偏啊,就是说明偏,如果是正的大于一点九六叫正偏态,负的叫负偏态, ok, 如果用风度系数去出一个他的标准物,那么如果大于一点九六,如果是正的话,那叫做奸笑风太尖了,如果是负的了,叫贫苦风, ok, 下面呢就叫做敬业图, stami 的立服 graph, 那么这个敬业图其实就是一个脂肪图,大家看,如果把它逆时针旋转九十度,用数字就用一个纸条,把他们的数字就用一个纸条,给他 拉起来的话,你看是不是就相当于一个脂肪土,是一样的道理,是不是?哎,数字枝条啊,不能拉那么高,是不是就像一个脂肪土的一个道理啊?但是这个怎么看呢?这是告诉我们, 比如说我们以这个为例,这个是四点零,后面是一五七七七,一五七七是指什么呢?有四个人,这地方有四个人,四个人的身高分别是一米五七、一米五七、一米五七、一米五七,四个一米五七,就那样。老师,为什么是四个一米五七呢?这明明是十五点七七七七七啊,那 如果你说四个,那也应该是四个十五点七啊。可是这地方告诉你们什么,这有个主观的看度,主 干的宽度是十,也就说数字要成一个十倍, ok, 而且他说了,每一个叶子代表一个个案,也就说这一个七就代表一个数字七。什么叫做 树敬业图了?大家看一下,十五、十五、十六,这个都叫做树干,在每一个树干上面就长了这么多树叶啊,这有多少个树叶呢?数一数,数一数,前面就是二十四个啊,就是这么一个道理,下面也是一样的,女生也是同样的道理来进行这样干, ok, 这就是正太的 qq 图,用图来进行一个反应,那么数据到底符合不符之乃分布,这怎么看呢?其实大家想想,这就是老北京糖葫芦串,那么中间这一根线呢,就是一个竹签,上面呢就挂着糖葫芦, 如果所有的糖葫芦都在这根线上串着,那就说明什么?说明他符合正在分布。我们看这个图发现总体还是不错的,可是在这个偏小的部分,偏小的部分有些值啊,他已经没有在这个线上了。这是什么数据?这是男生数据,也就说明什么?也就说明在男生里面有几个人啊,身高太矮了点。是这样概念, 下面是女生,我们发现女生总体不错的,可是发现在女生里面有几个人啊?他身高是吧,太高了点点。 ok, 去趋势的,去趋势的,就是我们发现这是这条线,是不是带一定趋势的,如果把他一个趋势给他去掉,是不是变成水平线?变成水平 线怎么看呢?变成水平线就看这些点是不是在这条线的上下对称分布,我们发现总体还行,在这这地方是不是左下角是不是有些直偏小了?哎,到底是一样的啊,女生也是一样的, ok, 最最重要的就是这个 boxplot 叫做相视图, 这个相视图是怎么看的呢?相视图每一个箱子的中间这条线,黑线是代表的中位数,中间这个黑线是代表什么?代表的是中位数啊,黑线是代表的中位数,然后上面这一个呢,是代表的是百分之七十五,下面这个是代表 是百分之二十五,哎,这不就是中位数和四分之一间距吗?然后呢有两条胡须,两条胡须,上面这个胡 须是指这组数据中的什么最大值?最大值 max 啊,最大值 m x 最大值。那么下面这个有东西讲,老师,下面这个胡须是不是最小值啊?下面胡须不是最小值,最小值是谁?是幺幺四啊?是幺幺四,那就告诉我们是什么,如果外面要有值的话, 如果外面要有值的话,那就那这个这个线的位置怎么画?没有值的话,那这个值就是最大值,如果要有值的话,那这个位置是什么呢?这个位置的就这个宽度是我们四分位数间距的多少呢?一点五倍啊,一点五倍,这个箱体 从这里到这里不就是一个 q 吗?四分位数间距吗?那从这里到这里就是乱,就是一点五 q, 哎,也就说在一 一点五倍 q 的时候呢,他画出了他的另外一个胡须,啊,是这样道理,通过这个呢我们可以看出来,男生的身高是比女生要高的,是不是看他的中位数是不是明显比女生要高, ok, 那么到底高不高,我们要经过同学检验是不是啊?但是通过这个图我们可以得到这样的一个主观印象,同时我们可以发现在男生中有三个人身高偏矮了,在女生中有一个人身高偏高了,五百零四号, ok, 如果要身高让他更极端更高,怎么办呢?会不会出现别的情况?我们点开这个身高,这不是,呃,一米七二吗?我们给他改成 两百五十,我们再次调用探索一下点确定,然后我们找到最后一张图,找到最后一张图,哎,我们来看一下他的结果,有没有发现第一号这个人已经不在五行中跳出红尘脉了,他用的 是一个五角星,五角星各位了, sbss, 如果用的是一个圈,表示这是一个可移纸,如果用的一个五角星,那就表示这是一个异常值,那么 以后我们再进行统计分析,如果要发现这么一场值怎么办呢?回到我们的数据来看一下这个人, 一个人啊,他是爱武林,然后去找到这场调查表,或者找到当时的原始测量记录,来看一下到底是不是爱武林,是不是我们录入错了等相关演员,是不是。如果发现录入错了更改,如果发现确实就是爱武林, 那得看你是干什么事情了。如果是调查类的,他确实是这样,那就是这样的,如果是实验人 类的,那有可能他就是实验误差,实验误差要把它进行删除掉的。 ok, 这一小讲时间又有点长了,那么稍后呢?我们再来学另外一个描述方法,稍后再来。

哈喽,大家好,我是武松老师,欢迎回来。前面呢我们介绍了 spss, 他的一个简单的一个 安装常用的界面,现在呢我们就来去学习如何用 sps 去构建统计分析的一个数据库。 sps 统计分析数据库呢,有两种方法,一种叫做间接法,一种叫做直接法,那么所谓的间接法,它是拿来主义,常用是间接,我们以后呢用的都是间接法,所谓的拿来主义间接法是指什么呢?是指用 spss 去调用别的数据库, 从而构建自己的数据库,这就叫做拉赖法啊,间接法。那么所谓的直接法呢,就是在 spss 中打开一个空的数据文件,然后呢自己一个一个往里面进行录入,我们发现这 方法是非常笨猪的一种方法,所以一般来讲很少用,但是呢,你只有学会了直接法,你以后用这方法的时候,万一不对,你会调试,哎,讲白了你自己会做饭了以后,你发现那个饭不好吃,你知道哪地方出问题了啊,就是这样概念,那么 对于咱们本科生呢,我呢会给大家一种比较折中的一个方法哎,叫做间接修改法啊,间接修改法就是用间接法拿来之后呢,然后来进行一个数据的一个修正 参数的重新来进一个调试啊,那我们就来教大家这种方法叫做间接调整法,那么请各位呢, 打开一个 sps 数据文件啊,双击打开 sps 数据文件,这就进入了一个 sps 数据师图,然后呢我们去调用 一个 excel 文档,这个 excel 文档可以用两种调用方法,一种直接点左上角常用工具栏有个打开文件夹,是不是?这是第一种方法,第二种方法可以通过菜单文件,然后呢打开,然后去找到我们要的一个数据,我们点打开, 这是比较常用的这两种方法,那么还可以用导入数据,你看大家,你看下面可以导入数据库, 导入一下,导入 csc, txt 等等,包括萨斯斯、白塔迪贝斯等等这一些其他统计软件的一个数据录入的格式啊,这些呢相对来讲有点专业啊,我们只要 学习文件打开数据,或者直接调用这个打开文件夹就可以了。我们点开打开文件夹,然后在 这个数据文件中呢,我不知道这个数据文件会不会在智慧树上有下载附件的地方啊?如果要有的话,我会跟他们后台联系一下,然后把这个上传上去,大家也可以进行试用。 ok, 我们现在呢就要打开一个,这样当我打开这个 打开数据文件的时候,我们发现这地方根本就没有 excel, 那是因为他默认的格式在这里就是 sps 格式的,对不对?那 excel 是不展示的,我们选择下拉菜单,找到 ofires 所有的文件,然后你就发现这地方有个立一 excel。 好,我们把立一 excel 点打开, 那么根据你软件电脑的一个速度,他会稍等一下啊,那么就会出现一个读取 excel 文件的一个可视化读入窗口,那么这个可视化读入窗口是 spss 二十四点零才 有的,二十三点零机器以下那么只有上面这一部分,二十三点零机器以下只有上面这一部分,那么下面呢是没有的,那么下面其实就是可视化读入,就是在没有读入之前,我已经都知道了我们即将读入变量将会是什么样的,数据结构将是什么样子的。 ok, 好,那么在这个里面呢,我还会为大家讲两点,第一点就是第一行一定要当做变量民主,当我把这个勾勾选掉之后,当我把勾勾选掉之后,你会发现下面的什么姓名啊、民族啊等等都已经变 成第一行记录了,第一个记录了,是不是其实姓名是下面所有人的一个什么变量名称,所以把它勾选中,他们姓名性别就已经进入到什么变量名称,这个什么这 一个,嗯,位置了,是不是?然后第二个就是我们在读 excel 的时候呢, excel 他左下角通常是公主表一,公主表二,公主表三,如果你以后的数据他 在公主表一,那么默认读入就可以了,万一是在公主表二,公主表三怎么办呢?可以通过下拉菜单去找来来理解吧。 ok, 好,我们点确定,那么会稍等片刻,他就会 把数据读过来,你看数据就已经全部读进来了,读进来之后呢,他会出现宽宽窄窄,那么发现不太好看,你就可以通过拖拖拉拉的方式把它调整 一个比较好的看的一个视野。 ok, 好,读完了之后呢,我们稍后,现在呢就来带大家来进一个参数的修正,那么这 这毒是毒进来的,那毒的对不对?好不好呢?我们点左下角有个变量师图,我们就进入了变量师图,我们发现一共有十二个变量, 他变量名声都已经读进来了,那么在前面我们已经说了,到底对不对,好不好,关键看这个十个参数属性到底设置的好不好,对不对?我们再说了,在这十个里面要掌握爱八定律,只要记这两个,一是类型,后面是什么?测量尺度,测量尺度,那么这个类型点开之后 他就会弹出一个变量类型框,变量类型框里面包括这么多二四六八九种,是不是 啊?包括九种变量类型,那如何来进行选择呢?大家记着艾巴定义,只要选两个,要么是数字,要么是字符,大家想想我们这一个,我们这个姓名是什么姓?梁姓名张三宁是王爱武松,是不是?他肯定是字符的,所以 选字符, ok, 没问题,那么再点点,确定之后点性别性别,我们这个数据是什么类型呢?我们你看性别,性别是一二三四,一二三四,那我们性别是吗?是数字,能理解吧?好,没问题。然后民族,民族是什么样的民族?是汉族啊,其他什么什么民族啊? ok, 是民族,是什么类型的?民族是自负型的,没问题。年龄肯定是素质的。什么什么学院,应该是自负串的专业是自负串的。身高是多少多少多少,肯定是素质的,是吧?体重素质的,胸围素质的,肺活量数字的体育成绩是肺素质的。哎,血型,我们看一下血型他是怎么录入的 啊?找到血型发现血型录入的什么 abo ib, abo ib, 他肯定也是自动转的,是不是?哎,那你要想已经进入了数据,师徒要想快速的到 变量师图,只要双击他的变量名称,双击变量名称就立马进入到什么变量师图, ok, 他也应该自负段,那么这个变量类型就讲完了。 这个宽度是指什么?是指你前面这个变量明星的宽度,比如说武松,武松的宽度是两个汉字,通常我们认为两个汉字应该是几个字符啊?两个汉字应该是字,四个字符,是不是?但是 sbss, 当我们采用的优力库的模式,什么叫优力库的,大家看这个右下角是不是优力库的模式?优力库的模式是一种兼容性的模式 啊,他会把我们变量的宽度放大到三倍,也就说武松虽然来讲本来应该是四个字符,那么现在至少要十二个字符,特在能够写, ok, 好,那么他这地方设置的是十三个字符,这个宽一点窄一点没关系,你你如果写 三十都没有问题,他只不过软件会多占用一些内存来进行保存就可以了啊。但是短了不行啊,短了不行,比如说姓名,我点开这个姓名,姓名呢?有一个人叫什么名字呢?叫王凉风,大家看好第一个人叫王凉风,如果我把它变量的宽度 降到六个,你看是不是只有王良了,是不都出不来了,是不是这样概念啊?那么这时候怎么办呢?我们再给他升升升升升升,十到十二个 g 级以上, 非常有一点需要大家进行注意,当我们当我们进行把它降低之后,降低之 之后他已经把那个给他删掉了,当你在恢复的时候,他已经回复不过来了,所以这点适当要进行注意。那么这时候大家可以怎么办呢?你后撤,后撤后撤后撤,哎,可以把他后撤出来啊,这没关系的 好。然后第二个就是性别,性别的宽度不就男女男女嘛,对不对?他一个一个到两个基本上也够用了啊,一到两个基本上够用了啊,他保持,因为是阿拉伯数字,阿拉伯数字一个就是一个,对不对?然后民族他这地方默认的, 大家看一下,他默认的有宽有窄,那么如果他敢用这样子来进行一个读书的话,那基本上他前面的数据都能读进来,哎,所以 也没什么关系,那没关系。那么你可能会纳闷一下,那软件怎么知道他应该是十三个,是十个是两个呢?因为刚才在读取的时候,他已经说了,软件会对前两百条数据来进行一个扫,就是这个变量的前两百条记录啊, 他会扫视一遍,扫完了之后,他觉得那么我多宽就可以够用了,就可以了。 ok, 这是小数点的位数,小数点的位 数呢?比如说我们这个自负串,自负串,小数点位数怎么点都不可以,但是性别小数点位数,当我选中的时候,就可以把它设置成两位啊,一位。哎,这为什么可以的呢? 为什么制服串这个就不能动了呢?那是因为制服串吗?比如说姓名武松吗?你说武松不就武松吗?你武松点零零有意思吗?那没有意思的,所以制服串的是不可以设置小维素的,那么其他数字型的都可以设定啊,都可以设定啊,就是这么意思。 好,那么这就小数位数就讲完了,我们再来看一下标签,标签是指什么?对变量名称进行一个解释,如果前面这个不叫做姓名,比如说我给他改一下,改成叫做 n a m e, 叫做 lime 啊,叫做 lime 的话,那么 内蒙了,我们现在都知道对不对?但是 对于一些 一点统计学攻击都没啊,医学英文基础都没有的人,那么他不知道什么叫内蒙的,那这时候就可以在这地方添加一个姓名啊,叫做内蒙就知道了。哎,底下同样的我就不再进行解释了。 ok, 比如说某一些英文的话,比如说 plt, w b c, r b c, 那么这些指标我们是不知道他什么意思的, 你如果选择是什么?哇的布拉克赛啊,那么太长了,写在前面对不对?没有 w b c 减三,所以我们在后面就直接写白细胞。那么这个值呢?是指值标签,值标签是什么意思呢?值标签 是对变量尺度来进行一个复制,比如说性别,我们点开性别,我们发现性别是什么?性别是一二一,那么什么是一,什么是二呢?是不知道的是不是?其实一是代表蓝,二是代表绿,那怎么让软件知道呢?就点这标签输入什么一,然后底下输入 男添加,然后按点输入女,然后再添加,再点确定他软件就知道了,他怎么知道呢?稍后我给大家演示,我得抓紧时间把这个讲完。 ok, 然后呢 再往后面就是确实值, sps, 确实值,大家不用关注确实值,如果没有的话,他就用一个点来进行一个展示。 ok, 这个列是指列的宽度,列的宽,什么叫列的宽度呢?就是大家看我这个拖拉的宽度叫列的宽度。 ok, 列的宽度一定要大于等于前面的宽度,不然他就展示不全,是不是这样概念啊? 好,展示不全会呈现什么样状态呢?大家看我这样拖,我往这边拖,当字符,字符不够的时候,展示不全的时候,你看他就被用点来进代替了,是吧?然后这就对齐方式。那么中国人一般喜欢剧中的,一般喜欢剧中的,你就可以点点剧 中、剧中、剧中,但是如果太多的话,你慢慢点,会太复杂了,我们直接点复制,然后把它全部抹中,然后点连天就全部剧中了啊。然后最后一个比较重要的就是测量尺度,这个测量尺度 到底怎么看?我们选择第二个,我们再给大家看一下第二个就是标度,有序和名义,为什么点第一个的时候他只有有序和名义呢?因为第一个我们的变量类型是自负赚的,自负赚是不可能够是什么,是老大,是素质变量的。 ok, 所以这个地方如何来进行选择?一定要根据我们统计学的 所说的老大老二还是老三。 ok, 我们第一个是姓名,姓名肯定是老三,对不对?然后性别,性别肯定是什么, 也是老三,是不是?然后在下面这是什么来着呢?在下面这是什么呢?啊?是民族年龄啊,我们民族也是老三,年龄是第四个,那年龄就 应该是标度,所以大家这时候一定要根据我们同居所说的老大老二老三把它定义好,所有都定义好之后,我们回到数据库,你发现是不是都居中呢?啊?所有的都居中,很好看吧?然后呢,我再展示两点, 我们这一小节就结束,有可能已经超过十分钟了, ok, 我们来看一下我刚才是不是把内蒙了,内蒙改改名字了,改成内蒙了,当我鼠标偷偷摸摸的放到内蒙上的时候,你会发现他告诉你这叫做姓名,他是名义的,对不对?哎,这是为什么软件会这样进行提示呢? 那是因为刚才我们已经对他进行一个变量的标签。我们再来看第二个,刚才我们不是说一是代表男,二代表女的吗?那怎么能够显示一代表男,二代表女呢?大家点这个一 a 一 a, 你看他就在跳转,是不是点一 a 一 a 的时候他在进行跳转哦,发现当 都是中文的时候,发现这个数据库很乱,是不是?哎,所以当都是数字的时候,就感觉到很简洁哎,所以一个叫专业师徒,一个叫什么统计师徒啊,就是这样的,好,好,就不再多说了啊。那么 当我们数据库构建好了之后,你这时候如果要进行相应的编辑和修改,你完全把它当做 excel 就可以了。如果这是十九,你觉得这是输入错了,你把它改成二十一,直接改就可以了,你觉得这个二十一是没有的,你直接删掉就可以了。你,你想怎么做就进行怎么做吧,你把它当做 excel 来进行 一个后续的编辑就行了。 ok, 好,那么这一小节讲到这地方,后面呢我们就教大家如何进行同群描述分析和推断性分析了。

hello, 大家好,我是 doctor 李,大家呢在接触统计分析的时候呢,经常有很多疑惑,比如说我无从下手分析出来的结果呢,不知道怎么样去解读, 不知道论文当中该如何选择合适的数据分析方法等等等等。接下来呢我们一起来学习 ss 统计分析,一起来解决这些疑惑。首先呢我们学习的是数据的导入, 咱们大多数人呢,大部分都是通过 windows 星来进行数据的收集,那接下来我们来看一下 windows 星收集到的数据如何导入到 spas 软件当中。首先打开 windows, 然后选中自己所所调查到的问卷,然后点击分析下载,点击查看下载答卷,再点击下载答卷数据中的按选项序号下载,由于这个速度比较慢,所以之前已经下载好了一个,大家可以看一下,这就是我们 所收集到的数据啊,这当中呢不需要的一些选项呢,可以提前删除,点击保存, 然后打开我们的 spas 软件,将数据呢导入到 spas 软件当中,点击文件打开数据,然后选择我们保存文件所在的位置桌面, 然后下面选取文件类型。 swats 呢,它兼容性比较强,很多文件类型呢都是可以进行分析的。然后我们保存的是 excel 文件,然后选中我们要分析的数据,点击打开, 然后点击确定,这样的话我们的数据就已经完成 导入到了 spas 软件当中。导入过来的数据呢,我们要进行一些标注,首先呢看变量式橱窗呢名称这一栏,我们需要对这一栏呢进行一个编码, 此次数据的收集呢,主要验证工作排斥,工作创新以及组织自尊以及网络闲逛之间的一个影响关系探究。所以说呢,这些问项呢,都是针对于这四个变量进行提问的。本研究呢,前六个主要针针对的是工作排斥, 后面五个呢,主要是网络闲逛,其次呢是工作创新以及组织自尊这几个变量。所以说呢,我们需要对这些变量呢进行编码, p, h, e, 然后依次呢在我们这些问题上进行编码。 其次呢,需要对每一个变量呢进行复值,因为我们采用的是李克特五分量表,所以说呢,哎,每一分代表什么,我们需要在这里标注,变成一,代表的是 完全不符合,然后点击添加啊,二,标签不符合点击添加。三,一般点击添加四,符合 添加五,完全符合点减六,然后确定剩下的变量呢,也是依次 将它进行复制。现在呢,各个变量的编码以及复制均已完成,接下来呢,就可以进行我们的数据分析。好,今天的课程就讲到这里,下节课呢,我们来讲一下数据的转换。

大家好,欢迎来到 spas 课堂,我是宇博士,接下来我跟大家分享的是 spas 里面的量关于量表问题的合并。 呃,也可以叫做呢让表的维度得分计算,这呢是前段时间的一个同学呃问题,然后这里呢来做一个视频来集中处理一下。 好,我们来看一下关于量表维度得分计算。呃,关于量表维度得分计算呢,我们主要是考虑到他这两点,第一点呢就是看量表有没有反向问题,如果有反向问题呢,我们需要把 呃反向问题呢计算,得分的时候呢,需要进行反向积分,然后他呢是通过可以通过转换的重新编码相同变量, 呃,重新把所有反向题目呢一块回到反向得分处理,就可以这样集中处理。第二个呢就是维度或整体得分计算。 呃,这里呢有两种方法,第一种方法呢就是计算得分,就是求和。第二种呢就是计算平均值。呃,通常情况下这是两点都可以。呃,要是有明确量表说明的话呢, 就根据大家的说明就行,有的呢是求总班的,有的呢是求呃得班均职的, 这个都可以。然后呢,我们通过一个焦虑量表达来具体看一下,这是 焦虑自评量表,他呢是有有十五个中奖评分,五个反向评分。我们来看一下呃焦虑。我们来看这个机制,就是我觉得比平时更容易紧张或着急, 这是焦虑焦虑的表现,是吧?然后五呢,你看,我觉得一切都很好,也不会发生不尽,这明显是不焦虑。所以说呢,这五呢就是我们争做 反向体,因为我们白质主要是素质越高,它的腰力程度越高, 像五呢这种呢数值,数值越高呢就交易程度越低,所以说呢,我们就需要把五呢给反向积分处理一下, 就是反向积分题,这五九十三是第十九,反向计算呢,在这里呢就是一百没有过,很少有时间呢,评分是四三二一分,一次是四三二一分, 然后像一这种正讲正讲平分题呢,没有过,很少有一二三四,然后得分越高呢,这个 呃焦虑程度呢就越高。然后再来看他的得分,这些得分呢就与二十个全部相加, 得到一个粗分,然后呢用粗分乘以一点二五,再取整数部分呢就得到标准分, 然后这个标准根呢再跟着呃,跟按照那个长模比较,他看这个临界分值五十迈,然后五十到五十九拿轻度,调六十到六十九拿中度,然后六十九半以上的是重度。 这样呢我们就这两点基本就都设计了,呃,设计到了 一个总分计算,还有一个百降问题处理好,我们根据那个数据呢来具体做一下,这是他这个数据。呃量表问题呢,我们看到是这二十个量表, 然后首先呢把反降问题给标一下,反降问题五九三九 十三十七十九,这样呢把它标注出来呢,再进行反向积分处理啊,这里呢 一呢就是没有时间,四呢就是,呃,绝大部分毛全部时间,这样是对应的是一二三子弹,然后呢我们再给他转化成呢,呃,四三二一转化,中间编码 相同变大, 这五个五九值端直接十九,然后进行就值和金值的一个替换,一呢替换成 c, 然后二 三呢个乘,二四呢个乘 进去, 确定好,这里呢依旧 t 完成四,二就完成三,三 t 完成 二,二就完成一了,然后这里呢就不是这个时间了,我们就可以认为是这个得分了,就不要用这个时间来一就是上到这一分 就转化成一分,二呢就变成二分 这样的。哎,你看这张九呢也是同样的,这里就不做修改了,做完这个之后呢,我们就可以对他进行一个 总分计算,先二十个题目相加,这呢涉及到一个 呃 s p s s 里面的函数计算,我们可以通过计算变量,这里面有个数字表达式。我们来看一下这个, 这里面呢主要是用到了这三个函数,第一个呢就是赞,就多个变量组合,第二个呢就是多个变量就平均值。第三个呢就是 呃账户表达是取整数值,就是去掉小数点部分,整数部分这个 t、 r、 u、 n、 c 这个函数, 然后这个呢咱就跟四舍五入去整是有区别的,你像这个呢 r、 n、 d 呢是去整 四舍五入,这个呢就截掉后面这角度边后的数值,因为我们呢需要先求和,就是对所有变慢的求和,先撒,这就做音量,然后呢再乘上一点二五, 这是一点二五,然后取整个部分就是这个数值了,就写为它。我们复制一下,直接用过来 这个变量呢,因为我们这次取得变量这个 to 呢是从第一个到最后一个, 然后呢我们就这儿还是写个 web 外呢,就是标准分了。呃,我们再来看一下,这呢是这里面这些曲折,然后 sum 是这些球壳乘以一点二五,这呢就是这一部分,然后确定。 好,这样呢,就增加了一列外,增加了一列外呢,我们看到他的描述统计看一下, 最小值呢是二十五,最大值呢是八十五,然后平均值呢是四十九, 然后我们再来根据这个他的临界值呢,来给他分一下,看他是焦虑程度是怎么样的。 登记转换,重新编码为不同编码, 焦虑沉重。 好,我们来再来剪一下。呃,五十分,五十分之内的呢是无了。呃, 也就是从最低到四十九至零,然后五十到五十九,轻度交易 六十到六九, 然后六九以上 啊,不知道 最顶端 再比这个负离还值 零呢?是五一呢,是轻度酒, 中度酒 断桥。 好,这样呢,我们再来描述一下。 好,我们看到了这无奈呢是二百一十一人,然后轻度中度呢?战斗呢都有了,他呢就是增加了。 好,这是关于这个焦虑量表得分得分计算他那个焦虑程度的一个划分情况,还有情况,这是 如果对某个在一些亮条里面呢,有部分题目呢,他是需要划分维度的,比如说一到一个维度,这样的拿出来单独做计算, 比如说一到五吧,一到四吧,一到五,这是维度一,我们就来算一下维度一, 比如说维度一,维度一呢,我们如果先求和的话,可以直接主炸, 然后 一到五,就是说呢,从这个一到二, 这,然后从这一到二,这是维度一求和, 这又增加了一个求和。呃,如果求均值呢,我们直接换一下函数就可以,这叫变量,这呢改成 me 平均值, 然后一到五。 好,我们再来看一下,再来描述一下这两个。 好,我们看到维度一求和呢,就对这五个题目呢进行一架求和均值呢这时,然后 呃求均值呢,均值呢是二点一四五九,这样呢就把维度呃求和或求均值的情况下都计算了,这就是关于呃量表问题的维度的合并或者 计算问题。呃,关于其他问题呢?大家如果有问题呢可以联系我们,这是你的联系方式。呃,这里呢,我们可以呃定制相关的视频,如果有需要可以联系。好,谢谢。

如何用 spss 做比例分析?打开 spss, 输入数据,点击分析,选择描述统计比例命令,将需要描述的变量选入对应列表框中,单击右侧的统计按钮,勾选平均值 trd coverb, 在集中指标选项组的低比例文本框中输入零点八,在高比例文本框中输入一点二,点击添加,点击确定。小朋友,你是否有很多偶号?潇洒结束分析验证结果收对,你学会了吗?

大家好,我是陈老师,欢迎大家收看杏花开医学统计课程,我们的课程在微信公众号中持续更新,帮助大家轻松掌握医学统计学方法和统计软件的操作。我们的微信公众号是 xhk 三四五,欢迎大家关注。 今天我们要讲到的是不同类型的医学数据的接触统计方法,盘点其中的一项描述性统计不同类型的医学数据,他会涉及到多种统计学方法,我们今天着重只要着重只讲到的是医学数据的描述性统计分析 好。呃,我们在一般来讲的话,作为医生,我们搜取到数据之后呢,需要根据数据的特点来选择正确的统计学方法,也就是说,当我们的这个呃,对数据的认知没有合适的一个,没有一个合 合理和正确的认知的时候,那么这个运算的呃,选择的统计学方法也都是错误的。好,首先我们来看看。呃,从统计学的角度来讲的话呢,这个数据类型分为哪几种?一种是机量资料,一种是技术资料,一种是等级资料, 计量技术等级资料。这种关于变量类型的介绍呢,同学可以关注一下陈老师的第一期杏花开的啊,医学统计分析里面详细讲到了医学变量类型。 好,这陈老师还是再介绍一下啊,机量资料指的就是连续数值型的变量,比如说身高、体重、年龄这种带单位的,并且可以取到任意一个数值的, 在合理范围内取到任意一个数值的,比如说,嗯,年龄可以是两岁,三岁,四岁,五岁,也可以 是两点一岁,两点二岁,两点三岁,两点四岁,这样一个呃几岁几岁?首先岁是一个带单位的,并且他可以取到小数,所以呢这种就是一个典型的积量资料。 那么什么是技术资料?技术资料呢?一般就是那种分类的,比如说性别分两类,男性和女性两类。 比如说血型分为 abo 还有 ab 四种血型,这种啊,他没有单位,但是呢每一种类型可以有人数或者是有个数的,这种数数的我们一般都叫做技术资料,比如说男性有五十人,女性有五十三人,这种就是技术资料。 还有一种就是等级资料。什么是等级资料呢?其实等级资料它是一种比较特殊的技术资料,我们刚才说到了性别和 血型,尤其是性别,男性和女性,男女是平等的,不存在谁大谁小。那么这个等级资料实际上就是在技术这样一类分类资料的基础上,更进一步的还包含了一种等级递增的趋势。 比如说我们在呃研究疗效的时候,这个疗效可以分为无效、有效治愈, 无效有效治愈,它是一种等级递增的反应,疗效逐步变好的一个情况。比如说还有一个就是疾病的严重程度, 有轻度、中度、重度也是反映一个疾病严重递增的啊,他越往后靠疾病就越严重。也是一个,他不仅仅是分类分成轻中重三类,他不仅仅分成了轻中重三类,那么这个轻 中重还包含有一个等级递增的一个趋势,这样的就是一个等级变量。好,那么首先我们分清楚了数据的类型,有计量技术和等级资料之后,那么对于这么三种资料,在不同的试验的情况下,选择的统计学方法也是不一样的。 比如说对于这种计量资料,计量资料他可以参与这种呃完全随机对照,或者是随机驱阻,还有拉筋方等等这样一些事业都可以涉及到连续数值性的变量, 那么对于连续数值性的变量,也就是这种计量资料,我们一般采用的都是 t 检验或者是方差分析这样一类参数检验。并且对于这种计量资料的描述性统计方法呢,我们一般都选择的是平均值,标准 差,中位数,四分位数等等。关于这个呃计量资料的描述统计呢,是今天这一个章节的核心部分,正好是在本期视频的后面会详细的讲到。 好,对于这种技术资料,因为是属个数的,所以技术资料他是可以参与完全随机设计,也可以参加,也可以参与这种配对设计的这样一种试验原理。对于技术资料,我们主要选择的就是这种卡方检验, 那么对于技术资料,我们要对技术资料,比如说像性别,血型这样的技术资料进行描述统计,我们一般采用的是频述,频率和重数等等这样的一种描述性统计方式。 关于这个,陈老师在本期的视频的后面会详细的跟大家讲啊,请同学耐心的听听完这个视频。 好,对于这种等级资料,我们着重选择的等级资料也可以参与这个完全随机,然后呢,随机区组还有配对。那么等级资料我们一般选择的统计学方法都是属于非参数类的致和检验 志和检验的志实际上是志序的志,他包含有一个等级的意思在里面,所以呢,和这个等级资料是匹配的。 很多同学把技术资料和等级资料容易搞混淆,有很多同学最容易混淆的就是把等级资料误用了。卡房检验是绝对错误的,因为等级资料除了有一种分类之外,他还包含一个,他还包含一个程度上的递增, 而卡方仅仅只考虑了不同类别的占比,他没有考虑不同类别的这样一个程度上的递增的变异。所以等 及资料误用卡方检验是同学最常犯的一种一种错误。今天程老师跟大家详细的讲到了啊,务必跟大家更正,等级资料务必要用制和检验,因为制和检验他不,他不仅仅是考虑了他分类的问题,同时还考虑了一个等级递增的一个 程度上的递增的问题,这个很重要的啊,好,这个是一个好,这个下面的这一段话呢,和陈老师刚才讲到的是有重复的,就是计量资料我们一般用体检验, 嗯,方差分析等等。当然这个计量资料如果要用 t 检验和方差分析的话,他必须是服从正态分布的计量资料。如果这个计量资料不服从正态分布,我们可能还是要改用非参数类的检验方法。然后技术资料我们常用到的呢,就是这种卡方检验。 呃,最最常见的一个错误就是等级资料被误用卡方检验是最常见的错误,等级资料应该选择致和检验 好。上面呢,就是陈老师对各种各样的这种变量类型,还有他的试验设计,还有他常用的统计学方法的一个轮廓的一个概括。

在 spss 中可以对数据进行描述性分析,分析方法包括频率分析、描述统计和交叉表分析等。本节内容来介绍一下 spss 中的频率分析。 spss 可以对变量出现的频率进行分析,并给出相应的结果, 具体操作如下,先用 spss 打开一个数据集,依次点击分析描述统计频率,随后弹出频率选项卡。将频率选项卡中左侧教育水平变量选入到右侧的变量中,然后点击右侧统计按钮,弹出统计选项卡。选中四分位数,点击继续 返回到频率选项卡。点击右侧图表按钮,弹出图表选项卡。选中条形图,点击继续再次返回到频率选项卡,点击右侧格式按钮,弹出格式选项卡。 排序方式,按值的升序排序,点击继续返回到频率选项卡后点确定,这样 spss 就会输出本次频率分析的结果。 具体观察输出结果可知,在教育水平表格中分别列出了不同教育水平的频率百分比、有效百分比和累积百分比,同时在教育水平条形图中显示了不同教育水平的频率分布。

大家好,我是陈老师,欢迎大家收看杏花开医学统计课程,我们将每周在微信公众号中更新最实用的医学统计文章及视频案例教程,帮助大家轻松掌握医学统计学方法和统计软件的操作。 我们的微信公众号是 xhk 三四五,欢迎大家关注。今天我们要讲到的是四格表资料的非色确切概率法。一般来讲,同学可能都知道四格表资料我们一般匹配的是卡方检验, 卡方检验呢,是用于检验构成比率的差异,比如说我们想知道对照组,他的治愈率和试验组的治愈率有没有显出差异,这个治愈率就是呃治愈和未治愈的一个构成比率比较。对 照组和试验组在治愈和未治愈的构成比率上有没有差异。我们一般第一反应都是卡方检验,但是呢,呃 呃,这个呢,也是一个同学比较容易犯错误的地方,因为四个表检验可能本能的就联系到卡方检验,但是卡方检验对四个表的数据他是有一定的要求的。 同学可以看一下新花开医学统计公众号的这个上一期陈老师详细讲到了卡方检验的适应的前提条件, 也就是说,呃,并不是所有的数据都可以进行卡房检验,一定要满足一定要求的数据我们才能够进行卡房检验。好,我们翻看一下上一期公众号卡房检验,里面陈老师详细的写到了 对于四个表资料总样本量必须大于四十,并且每一个单元格的频数,每一个单元格的理论频数不能出现零 或者是呃,或者是理论评数小于五的单元格的格数的占比不能超过百分之二十, 也就是说呃,也就是说,简单的来讲,普通的卡房检验一定要求样本量是要过四十的,并且每个单元格的这个理论评数不能太少,也就是说每个单元格的理论评数最好是不能低于五的。 一般来讲,如果某一个单元格的理论评数出现了零,或者是总样本量小于四十的时候,这个时候卡方检验是失效的,因为 卡方检验是基于卡方分布的一种统计学方法,卡方分布他要求不能有零的这种理论评书的单元格。那么当我们的原始数据资料样本量过小,或者是某一个单元格出现了理论评书是零, 或者是理论评数小于五的单元格的这个个数的占比超过百分之二十。对于这么三种情况的时候,卡房检验是失效的,不准确的。此时我们就应该改用非舍确切概率法。 为什么非舍确切概率法可以适用于小样本理论评数为零的单元格,或者是理论评数小于五的单元格的个数占比大于百分之二十的这种这么三种情况呢?是因为非舍确切概率法它基于的统计学理论是超级和分布, 他是可以接纳这样一个小样本或者是呃,评数为零的这种这种情况,而且也可以接纳呃,理论评数小于五的单元格的个数比较多的这样一种情况。 好,关于什么是超级和分布呢?啊同学可以看一下陈老师这一期的微信公众号里面的文字的这个文档详细的写了啊,超级和分布的这个公式。 好,关于这个公式呢,嗯,大家可以懂也可以不懂,这个没有关系,因为毕竟啊不是非专业的话呢,懂和不懂这个呢,其实是, 嗯,没有太大的影响的,只用知道飞雪却切概率法,它是基于超级和分布,可以接纳小样本理论评数为零或者是理论评数小于五的单元格的个数比较多的 这样一种四格表资料的情况。好,这个呢,就是陈老师刚才讲解的这个卡方检验和非学确切概率法的这样一个,呃,前提条件,他们的区别,以及这个当数据是什么样的时候,我们选择卡方检验,数据又是什么样的时候,我们选择非学确切概率法。 好,这个呢是比较重要的啊。好,嗯,关于这个,关于这种啊飞雪确切概率法或者是卡房检验的这个案例呢,我们在长期的工作中整理整理了一套详细的教程, 除了卡方检验飞雪确切概率法之外,这一套教程里面还包含有大量的医学统计方法以及统计学方法分析结果的详细的文字说明的模板以及配套的数据,并且持续更新,有需要的朋友可以 可以联系我们的客服进行领取,客服 qq 是三三零幺八八八二零零。好,嗯,同学可以持续关注我们的微信公众号 xhk 三四五,我们会持续的更新各种各样的统计学方法的这个讲解和应用的案例。 好,回到我们刚才说的,我们这一次讲的主要是非小确切概率法,一般来讲就是卡方检验,对, 呃,对原始数据,也就是对四个表资料的数据,他是有一定的要求的。当我们的原始数据达不到这个要求的时候呢?我们可以改选用非选确切概率法。

我们这里讲描述性统计,首先我们把仕途窗口切换到变量,仕途来设置变量的属性,我们先设置名称 例行,我们这里选述职, 我们可以选择保留移位, 输入好以后,我们再把窗口切换到数据试图中。 价格我们先输入十组数据,因为前面我们已经输 设置保留意味,即使你输入整数,他也会保留一位小数。我们描述统计 有三个位置,可以把该列数据的一些统计特性全部求出。 首先第一个是描述统计中的频率,我们将价格导入到右侧的边梁框中,我们这里就可以,我们可以点出我们想要求的 一些统计量,这样我们点击确定,我们就可以求出, 包括平均指,中位数等等,这是第一种算法。 第二种我们可以在描述中我们也可以来求出这些这些变量我们只要将我们想求出的值进行打勾 就可以,我们再点击再点确定 他,这种是属于横排的一个排列方式,这是第二种球法。 第三种求法就是我们软件中自带的探索功能,我们这里面也不需要你进 进行打钩,我们软件会自动把它能够求出的所有所有统计量全部求出, 我们只需要将价格放到这个音变量列表中,我们点击确定即可, 这个报告中就已经把所有的描述量已经求出, 还有画出精液图。 接下来我们要输入自辅串型数据,我们还是把仕途窗口切换到 变量试图中, 我们要选择倒数第二个字符串, 我们这里可以哎,不用管他,我们输入好他的名称和类型以后 进入到数据视图中,我们来进行输入, 输入好以后我们再点击分析,我们可以统计出他的, 放到右侧的框中我们来选择,因为我们是输入的这些汉字字符, 所以说我们这些就无法求出 来。进行他的 图表的计算, 我们这里是要统计他的频率,点击确定这里我们就可以看出美中数出现的频率和频率, 这个是它的图形,我们这些图形都可以进行复制粘贴贴到我们。

大家好,今天我想跟大家分享几种常用的。 当我们拿到一组数据的时候,首先要确定数据类型是哪一种,想要得到什么样的分析结果。在数学里面包含了两类数据,离散和连续。比如说性别,男或者女就是离散数据。身高体重这种有数据变化的就是连续数据,区别为数字大小是否具有比较意义。离散数据可以理解为分类类别,而连续数据可以理解为能不能求平均值,比如说平均身高,平均年龄,但是没有平均性别的说法。 我们在做数据分析时,通常会换成另外一种称呼,定类和定量,定类就是分类数据,定量就是连续数据。我们再来看 x 和 y, 研究 x 和 y 之间的关系,通常是 x 对 y 的影响关系,或者 x 对 y 的差异关系等。 还是以性别和身高来举例,当不需要区分 x 和 y 时,比如只研究性别占比,男女各占百分之多少,或者只研究身高和体重的平均值,并不需要研究性别和身高体重的关联关系。这种统称为基本描述统计。比如说性别为定位数据,这时候用平数分析。身高体重是定量数据,这时候用描述分析。

成分分析是一种非常常见的统计方法,通过降维的方式将原本具有多个变量的数据转换成只有几个具有代表性的主成分,能更好地反映样本的情况。那今天我就用 spac 教大家如何简单上手主成分分析。首先我这有七组人的各类指标数据,我们将它粘贴到 spac 中。随后我们点击分析中的降为,并选择因子,将我们的变量全部转到变量中。点击右侧的描述,将系数和 kmo 给选上, 再点击提取,将相关性矩阵碎石图选上后就可以了,其他不用动,然后点击确定就可以得到结果了。我们可以看到,在相关性矩阵中,数据之间存在着很好的正相关和负相关。 在总方差解释中,我们发现在这组数据中主要提取了两个主成分,第一个方差贡献率为百分之五十八,第二 二个为百分之二十五,他们一共贡献了百分之八十三。在成分矩阵中,我们可以清晰的看到,在主成分一中,体重、身高和体脂的载客较大,而智商和年龄在主成分二上的载客绝对值较大。用你的数据也去试试吧!这里是正在读博的大学长,关注我,带你开心读研!

那么我们接下来来看一下我们的人口统计分析里面第二种情况叫做描述性统计。如果说咱们的频率统计,他所针对的一个变量类型是所谓的分类变量的话,我们描述性统计他就是可以对连续性的变量进行一个统计分析了。 比方说我们的年龄他是一个连续性的一个变量,那我们在做分析的时候就不能再用频率,而是要用我们的呃描述性统计里面的描述,我们看一下,点击描述,然后把我们的年龄位置放进来,然后点击确定就可以了。 那他这边所给出的是一个关于年龄的一个描述性统计,他包括了最小值、最大值、均值跟他的一个标准偏差。

大家好,这里是由公众号小白数据音给大家带来的数据分析课程,我是小白,今天的话呢,我们一起来看一下关于描述统计分析的最后一节内容,就是数据标准化的一个处理。 数据标准化处理在我们平时进行一个数据分析当中的时候,用的相对来说不是特别多,他会对他一般用到的是在哪哪些方面呢?他主要是 呃用到包括这个数据同区化处理以及这个无量钢化处理的两个方面。而这两个方面比如说像数据同区化处理呢,它主要是解决不同性质数据的一个问题, 对于我们这个不同性质指标直接加总呢,我们是不能够正确反映这个不同作用力的一个综合结果,这个时候我们必须是 要先考虑改变数据,这个指标的一个数据性质是所有这个指标对测评方案的作用力呢是同区化的,然后这个时候我们再来对我们的这个数据夹走呢, 就可以得到我们这个这样一个正确的一个结果了。也就是说如果这个数据这样在没有做这个标准化以前,可能他的这个结果呢是有误差的。还有一个就是 数据标准化处理呢,他有很多种这样的一个方法,比如说我们一会跟大家讲到的这个类标准化, 这个标准化处理以后呢,我们是可以保证我们这个数据呢是服从标准正态分布的,也跟大家之前有跟大家说过,嗯,关于这个标准正态分布,我们怎么样去进行一个判定,然后对于标准化这样一个 过程呢?他有一个计算的一个公式,我们假设这个样本数据呢是从 x 一一直到 xn, 他的均值呢是 x 八,他的一个标准差呢是 s, 那他的一个计算过程公式呢?他就是 z 是等于 x 分之 x, x 还能减去 spa 这个公式呢,就可以对于我们的数据呢进行一个标准化的一个处理。嗯,然后对于这个标准化处理呢,其实在我们 spa 当中呢是非常简单的,我们只需要选中我们的数据,进行一个就是 小小的一个设定,我们就可以得到我们这样的一个结果,我们可以。嗯,这里小白给大家做一个演示吧,这也是我们最后一部分内容了,给大家演示一下。我们是依旧用到我们之前用到的这样的一个企业里边员工学历和薪资的一个 数据,比如说我们现在对于这个薪资这一块这样的一个数据,我们是需要进行一个处理的,我们这个时候呢是怎么样对他进行一个数据标准化处理呢?我们是在我们的分析当中, 也是在描述统计只菜单当中的这样一个描述当中,这个里边我们已经把这个薪资勾选到这个变量框当中了。那在这里边比如说像选项样式以及 这个执行当中,我们是选定哪一个对他进行一个标准化处理呢?其实在这三个选项里面都不是我们需要的,只是在左下角把这个标准化得分另存变量,把它勾选好就行,我们只需要勾选他就行,我们的系统就会自动将我们的这个数据进行一个标准化的一个处理, 我们先将我们之前的这样一个数值呢,先把它取消一些,然后我们正常的就只需要勾选这样的一个位置就行,然后我们点击确定, 点击完确定以后,我们就等于说对我们的数据其实已经做完一个标准化的一个处理了。当然这是因为我们刚才选定了他要输出这样的两个值,所以他会在这个地方进行一个显示, 输出框里面是看不到我们这样的一个标准化处理以后的一个结果了,他是在我们的变量框中变量这样一个界面当中,我们可以看到在薪资后边多出了一个认薪资的这样一列数据, 这一列数据呢就是我们对于薪资这一列数据的一个标准化的一个处理结果。那 截止到这里呢,我们整个这个描述性统计分析这样一个大的一个章节内容呢,就跟大家全部介绍完了。呃,我们再来回顾一下我们整个章节, 主要是给大家介绍了这个描述印统计分析的这样的一个方法和其中的一些技巧。比如说一开始的时候,我们给大家介绍了这个分类变量的一个频率分析,然后接着往后我们介绍了常见的这样一个描述印统计指标的一个分析指标。比如说, 嗯,其中有这个中心趋势的这样的一些指标,像均值、中位数呀,重数的这样一些指标,然后以及紧接着这个离散趋势的这个,比如说方差呀,嗯,极差、标准差、变音系数的这样一些指标。说完这个趋势指标以后,我们就又看了这个他的一个分布形态的一 指标,像这个分度偏度和这个风度,呃和还有之前所说的这个分位数也都是根据我们这个分布形态有关的这样的一些指标情况。然后再往后就跟大家看了一起来进行了一个实操,了解了在 spa 当中 得到统计性分析结果,我们需要怎么样进行一个操作。然后在这个在这一块给大家讲完以后,我们又看了关于定性数据的一个图形描述,以及定量数据的一个图形描述。 最后呢也就是我们今天给大家看到的这个给大家讲到的这个关于数据标准化的一个处理。嗯,整个我们标那个描述统计性分析呢,也就是这样的一些内容,在后期的话我们会在嗯,针对于 我们描述统计分析以外的其他一些分析,会继续给大家带来我们其他的一些数据分析课程,如果大家感兴趣的话可以关注我们的公众号小白数据营进行一个学习,然后后期的话会给大家带来其他一些精彩的课程。嗯,今天的话我们先讲到这里,再见。

家好,我是李博志,接下来我跟大家分享的是 spss 万卷分期于三件表制作。呃,万卷的第一部分内容,人口学变量的描述,他呢主要是进行一个评数统计, 呃,主要是针对我们在这里的第一块内容,人口学变量描述,就是对人口学变量各选项的一个人数和占比进行统计,并进行了三件表的制作。好,我们来打开这个数据, 这是我们模拟的一组问卷试句。呃,这里呢人口学变量主要有这么三个,性别年龄,最高学历。然后呢分别给他每个数值呢给他付一个标签,然后性别年, 年龄还有这学历呢,都给他补一个标签。然后我们呢先对用 spss 呢对性别年龄进行频数统计, 频率,把性别年龄,最高学历选进来确定。这样呢,就把 这个基本近期情况呢性别年龄,呃,最高学历呢?就是,呃相关结果呢输出来了。呃,这样呢,我们就可以把数据呢复制到 a、 c、 r 里面呢,进行结果的整理,复制 到年龄 举例, 因为后面这些呢用不到,我们可以删掉。然后性别呢给他稍微一整理, 然后我们再用摘选呢给他把,呃,没用的呢去掉, 把空白去掉。这样呢,我们就把性别年龄,最高学历呢筛选出来了。那么百分比呢,这应该有,后面加个百分, 然后这是边亮, 这是类别。 好,这样呢,基本形式呢就有了。我们再进行简单的调整 下上光键,再加个下光键。好,这样呢三线表就出来了,我们呢这样呢,就可以把它,呃,把它小数点位数呢是一位。 把它复制到 its word 里面呢,就可以基本形式出来了,然后呢我们再把上下两条线呢给它加速一下,自动调整, 调到一点五八 确定。好,这样呢,人口诀变量的一个描述,就表呢三线,表呢就做出来了人口诀, 然后后面呢写上样本量一百二十九 a 呢是解体 m g 六脉,然后呢团呢可以设置为五号黑体居中。 好,这样呢,第一个表格呢,人口诀变量描述三千,表呢就制作出来了。呃,对字体呢可以进行一下修修正。十点五,中文呢是宋体, 然后英文呢是弹子牛脉,这样呢就是一个比较规范的三件表形式了。好,关于人口诀变量的一个呃,描述情况呢就介绍到这里,大家如果有合作适应呢,可以联系我们,这是我们的联系方式。好,谢谢。