如何使用 excel 得到对数据的统计描述呢?通常情况下, excel 默认并未加载数据分析项,如果需要进行统计分析,首次使用就需要加载。 加载的方法也很简单,可以点赞关注,随时沟通。打开 excel 选项卡,点加载项选项,点管理加载项的转档按钮,在加载项对话框中将分析工具库勾选,那现在这个地方就有了一个分析工具。 点开分析工具,弹出数据分析工具对话框, 选择描述统计,然后点确定按钮,依照对话框里面的提示选择输入区域,也就是需要统计的这三组数据。 勾选标志位于第一行输出区域,选择输出区域,指定输出区域位置可以用鼠标选择,比如放置在 ever 开始的位置, 鼠标点一下 f 二单元格,输出选项下面的汇总统计知心度、 dk 大、 dk 小等可以勾选,也可以不选。选择完毕后,就可以点击确定按钮进行统计。 点击确定按钮,就可以得到三组数据的统计描述了,你学会了吗?欢迎评论区留言讨论!
粉丝1.8万获赞11.0万

大家好,我是二幺幺统计课堂王老师,本节我们继续来讲描述统计分析, 我们这节课的内容是使用 excel 的这个数据分析插件来实现描述统计分析结果。数据资料呢?还是刚才那个数据资料, 某财经类院校四十名应统专业的硕士研究生,他的出师成绩好,我们这样来做, 我们是数据啊,选数据,首先选数据,这边一个数据分析,数据分析点完以后呢, 会出现这样一个对话框啊,这样一个界面,我们选的是里面的描述统计啊,大家可以找一下,通过这个滑动条啊,来找一下描述统计,确定 决定。那么这个对话框里面呢,会告诉我们你的数据在哪里,那么我们的输入区域的是就是我们的硬桶这这一列数据, 这里面提醒大家,在 excel 里面一列数据是一个变量, 所以说呢,虽然我们有的时候在其他一些材料上看的这个数据呢,他是一个行和列的这个综合,但实际上我们在分析的时候,一定要 把所有的数据呢放到一列,如果是一个变量的话啊,放到一列千万不要放到两列,如果你放到两列的话呢,软件会认为这是两个变量,而不是一个变量,一列就是一个变量啊,一列就是一个变量啊, 我们选输入区域,我们选 a 一到 a 四十一,对吧,当然了,我们可以使用之前讲的那个快捷键康字器加下箭头啊,这种方法非常的好,大家一定要牢牢的掌握啊,掌握 再点一下,他呢就回来了,分组方式是逐列,是一列一列,然后呢,我们的标志呢,位于第一行,这样打上对号,因为我们选的这 这个音筒呢是选上了,如果说你不是从 a 一到 a 四十一,你是从什么 a 二到 a 四十一,那么这个时候呢,你不能选标志位于第一行啊,第一行好,输出选项呢,是有三个,默认的是新工作表组, 哎,默认的写,我们点到第一个输出区域,我们给他指定一个啊,输出区域呢,是这个,比如说我们放到这个 c 三, c 三啊,美颜 c 美颜三,这是一个绝对引用啊,这个格二 好,下面这几个呢,都要打个对号啊,汇总统计平均数的执行度, dk 大值, dk 小值都要打上,打上对号,确定 确定,大家再看一遍啊,数据里面,尤其是第一个数,他如果是一个汉字,那么应该他会认为就是一个标志,所以说要选标志啊,标志啊, 基本上的默认是一列,是一个变量,所以叫主列。输出区域的话呢,我们没有选他的默认。新工作表组,我们自己呢,还是在这个序的,在这个序的里面啊,我们选的是 c 三,当然你说我选 b 三行不行?行啊, b 三行不行?行 啊, c 也可以,都可以啊,都可以,只要不是原有数据的,你给他占掉就行哈,好,确定。 哎,这个时候呢,大家会看到,出来了啊,出来了,你看看烟筒就是我们 第一个是吧?第一个有,然后呢,平均值四百零四点二二五,也就是说呢,这四十名同学,他的平均的除数成绩是四百零四分, 我们知道考研的成绩最终是五百分,平均成绩四百零四分是非常高的啊,非常高的标准误差是二点三二三,中位数四百零八,重数四百一十八,标准差是十四点六九分 啊,就说这标准差是十点六九,那么方差的话呢是二百一十五点九七三,风度偏度啊,风度偏度 这个区域的话呢,他实际上是因为是润景啊, a n、 g、 e, 这个是最大值和最小值相减的结果啊,最大值减去最小值是值, 这个最小值的话呢,刚才我们也排序过了三百八十三分,最大值呢,我们也排序过了是四百三十八分。 求和的话呢,就是说这四十个这个成绩的加起来一六一六九关,这数呢是四十个啊,也就是说这个一六一六九除以四十呢,就是这个四百零四点二五二五, 最大值的一是四百三十八,最小的一是三百八十三,这个自信度这边还有一个百分之九十五呢啊,自信度 这个是用的是啊正太总体方差未知小样本的那个公式啊,四点七零零就四点七分,四点七分就构造了这个自信区间,那么这个呢,就是 我们说的描述统计的结果,所有的数据呢都是这样生成的,如果说你选两列啊,如果说你选两列,比如说我们现在的话呢,是两个数据啊,来两个数据的话,因为,呃这个 啊,数据的这个个数是不一样的啊,如果你选两列的话呢,他会出来两个啊,当然呃数据个数的一样才行啊,可同时选不一样的话,是一个一个来做啊, 这个就是我们讲的在一个线里面通过数据分析插件里边的 呃描述统计这个功能来实现的啊?来实现的。好,本节课内容就讲到这里,感谢大家的聆听。

接着演示 sum 函数的实例,这里有一个销售表,要统计出二月一日至二月十日这三种产品销售额是多少。现在来演示菜单数据筛选筛选 日期,这里点击日期筛选,介于这里是二月一日, 这里是二月十日。确定规格,选择惠普,确定就筛选出了惠普的金额, 我们现在取消 sum 函数,演示等于 sum 括号括号,首先选中日期这个区域,要小于等于二月十日括号乘以,再选择日期这个区域, 在这里要打一个括号,要大于等于二月一日括号括号 括号,这里呢,要乘以乘以我们的规格,规格是等于什么?选择这里绘谱括号,再乘以 括号,然后是金额这个区域括号括号回车,然后就算出了惠普的金额,然后我们向后填充,发现这里不对,那么我们双击看一下,我们的 核算区域已经向后填充了,那该怎么办呢?选择惠普这个区域,我们绝对引用的呢?我们选中按键旁的 f 四,就是绝对引用他的数据,就区域不会变, 都是绝对引用,只有这里产品,产品这里呢,我们发现函数是不变的,只有列在变,所以我们把行绝对引用按键旁 f 四两下 车,选中单元格,向后填充,这样就可以了。

统计表格中两个范围以上的数据操作方法,我们输,等于 c o u 找到康特一副函数, 点击 fx, 打开函数参数表,第一参数选择成绩范围,第二参数我们输,第一条件小于八十。好,点击确定,大家看结果呢?出来了,如果直接说的话,希望大家注意,表达条件时一定要用引号引起来。 好,那要求一百二以上怎么办呢?我们只需要把它复制一下,然后呢,写个加当前的函数值, 把这个小于八十改为大于一百二,这两个公式相加的结果就是两个范围的,和,你学会了吗?点赞加关注,谢谢支持!

可以随意选择显示多少数据。下面是数据源区域,有一组累加的数据, 在做图表的数据区域输入 tab 函数数组,选择数据源区域,函数参数是变动的,这个单元格确定总计直接求和 占比直接用公式计算出来。 选择做图表的数据,插入组合图, 每家和金额。选用堆积的柱状图,占比选择折线图, 将左侧坐标轴最大值适当的改大一点,比如这里改成一千,右侧坐标轴最小边最值改成一。 将每家的柱状设置为无填充色。 给折线添加数据标签,柱状添加数据标签, 合计的柱状可以给他改一个不一样的颜色, 最后就美化图标就可以了。

咱们每天都在跟数据打交道,但你有没有想过,如果数据本身就有问题,那分析出来的结果还能信吗?就像盖房子,地基不牢,楼再漂亮也白搭。 所以,拿到数据的第一件事不是急着分析,而是先给他做个全面体检,看看有没有啥毛病 好。第一个要查的病就是缺失值。啥叫缺失值?简单说就是数据表里那些空着的格子,可能是系统没录上,可能是用户忘了填。总之就是没数据 这玩意儿可不能小去它,就像数据里的空洞,会直接影响你的分析结果。怎么查呢?很简单,算一下每个字段有多少个空格,占总数据量的比例是多少, 然后把这些信息整理成一个表,按缺失率从高到低排个序,一眼就能看出哪些地方缺斤少两最严重。 发现了缺失值怎么办?难道就不管了吗?当然不是。这就好比发现家里水管漏水,得赶紧想办法修补。 如果只是零星几个空缺,比如整个数据集里只有一两个地方是空的,那还好,直接删掉这几行,或者用平均数、中位数之类的填上就行。 但如果空缺比较多,比如某个指标有一半的数据都是空的,那就得小心了。这时候你得琢磨一下,为啥会缺这么多?是这个指标本身就不重要,还是数据收集出了大问题。 如果实在太多,超过三分之一了,那这个指标可能就不太靠谱了,最好别用它,甚至干脆把这个字段整个删掉。 最关键的一点是,有时候缺失不是随机的,比如效率低的人可能就不愿意填问卷,这种非随机缺失,会严重影响你的结论,必须得说明白, 接下来是异常值。啥叫异常值?就是数据里那些特别突出的异类,跟其他数据格格不入。 比如大家都在考六十到八十分,突然冒出一个一百五十分,或者一个负五十分,这很可能就是异常值。 最常见的检测方法叫 i q r。 听起来有点玄乎,其实就是先找到数据的中间一半的上下边界,然后往外扩一点,大概一点五倍的距离,超出这个范围的就是异常值。 为啥是一点五倍?这是个经验值,实践证明这样效果还不错。但是重点来了,异常值不一定是坏数据, 比如刚才说的那个一百五十分,也许是真的有超级学霸,而不是录入错误。所以,发现异常值后,别急着删,先判断一下它是真异常还是假异常,然后再决定是保留、剔除还是做个处理。你的处理方法也要写清楚 再来看。重复值这玩意儿也挺烦人,就像数据里多了很多复制品,有两种情况,一种是整行都一样,完全重复。另一种更常见,就是某个关键字段重复了,比如员工 id。 你想啊,一个公司里能有两个员工有同一个 id 吗?肯定不行,如果 id 都重复了,那分析的时候就麻烦了,可能把同一个人的业绩算好几次,导致平均值什么的都跑偏。 所以检查重复值,特别是关键字断的重复非常重要,一定要查清楚有没有这种低级错误 数据。体检完了,接下来就要给数据画个像了,这就是描述统计。对于连续型数据,比如年龄、收入,我们通常看平均值、中位数、最大最小值这些,了解数据的大致情况, 但要注意,平均值容易被极端值带偏,所以中位数往往更稳健。对于分类数据,比如性别部门,我们看每个类别的数量和占比, 更重要的是分组统计。比如你想知道不同部门的员工平均效率怎么样,那就得按部门分组分别计算平均值,这样就能看出不同组之间的差异了。这就像给不同班级的学生分别算平均分,而不是把所有学生混在一起算。 光看数字可能有点枯燥,咱们还得让数据自己说话,这就是可视化。最常用的三种图。直方图用来看数据的分布形状,像个山坡一样,能看出数据是胖还是瘦,有没有歪脖子。镶线图特别适合比较不同组别的数据, 比如不同部门的效率,一眼就能看出哪个部门高,哪个部门低,还有没有异常值。 散点图用来看两个变量之间有没有关系,比如加班时间和工作效率是正相关还是负相关,或者根本没关系。画完图记得保存好,放到指定的文件夹里,文件名要起得有意义,方便以后查找。 分辨率也要调高点,不然图糊了就不好看了。理论讲了不少,现在来点实际的,咱们一步步来做一个完整的数据体检报告。 第一步,准备好环境,导入需要的工具库,设置好数据路径,把数据加载进来,然后做几个基础检查,看看数据是不是真的加载进来了,字段类型对不对。 第二步,检查缺失值,用刚才说的方法算出缺失率表,看看哪些地方缺的厉害,然后根据缺失率多少,决定是删掉填充还是换个指标。 第三步,检查异常值。用 i q r 方法写个函数,对每个数值行的列都跑一遍,找出异常值,然后决定是保留剔除还是截断。 第四步,检查重复值,看看有没有整行重复,更重要的是检查关键字段,比如员工 id 有 没有重复。 继续我们的实战演练。第五步,做描述统计。先算一下整体的均值中位数这些,再至少做一次分组统计,比如按部门分组,看看不同部门的平均效率有什么不一样。 第六步,画图。根据前面的分析,选择合适的图标,比如画个效率得分的值方图,看看分部长啥样, 画个镶线图比较不同部门的效率。再画个散点图,看看加班时间和效率有没有关系。每张图都要配一句说明,解释一下你看到了什么。 最后一步,把所有结果整理到一个报告模板里,包括缺失率表、异常值情况描述、统计结果三张图。最后再加一句总结性的结论,记住,报告要保存在指定的位置。 前面讲了这么多,其实也是为了避免大家踩坑。第一个大坑就是拿到数据就急着分析结果,发现结果不对,又回头检查数据,黄花菜都凉了。 正确的做法是先做基础检查,确保数据没问题,再开始分析。第二个坑是处理缺失值的时候稀里糊涂地删掉,也不说为啥,删也不记录删了多少,这可不行, 必须算出缺失率,说明你是怎么处理的,为什么这么处理?特别是如果缺失率很高,更要说明这可能会带来什么影响。 第三个坑是发现异常值就一股脑全删掉。刚才说了,异常值不一定是坏数据,可能是真的有极端情况,比如有个员工特别牛,效率特别高,这不能算错啊。 所以先判断理性,再决定处理方法,并且要说明你做了什么。还有几个容易忽略的坑。第四个,只检查整行重复,忘了检查关键字段。比如员工 id 是 不是重复了? 这就像查虫只看整篇文章一样不一样,却忽略了作者名字是不是重复了。关键字段的唯一性非常重要,如果重复了,必须处理。第五个,只做整体的平均值,标准差这些不去做分组比较。 这就好比只算全校学生的平均身高,却不看男生女生的平均身高有啥差别?分组统计能帮你发现很多隐藏的模式,比如不同部门的员工,效率可能差很多,这在整体统计里是看不出来的,所以至少要做一次分组统计。 接着看坑。第六个,辛辛苦苦画了图,结果忘了保存,或者保存的路径写错了,下次找不到,这太可惜了。所以画完图立刻保存,用相对路径保证别人也能运行你的代码,保存到指定的文件夹,文件名起得清楚明白。 第七个,贴了一堆图,结果不说图里说了啥,光说如图所示,那图白画了。每张图都要配一句解释,告诉读者你从图里看到了什么,比如分布是正态的还是歪的?不同组之间有啥差异?两个变量是正相关还是负相关? 第八个,描述统计,只贴个 df 点 describe 的 结果,也不挑重点,也不做分组,这跟贴广告似的,得告诉读者你从这些数字里发现了什么有意思的东西。 最后两个坑。第九个,用绝对路径读取数据。啥叫绝对路径?就是像 c 盘用户你的名字、项目数据、原始数据、 sample data、 csv 这种,写得太死板了, 换个电脑路径就不对了,代码就跑不了。应该用相对路径,就是相对于当前文件的位置来定位,这样代码才能在任何地方运行。第十个,忘记处理缺失值,就直接做统计, 比如直接用 df efficiency score 到 mean, 如果这一列里有空值,那算出来的平均值可能就不准了。要么先用 dropna 把空值删掉再算,要么就用 pandas 的 mean 函数,它默认会自动忽略内 n 值,但最好还是明确处理一下,显得更专业。 说了这么多,是时候动手练练了。今天的任务就是完成一份数据体检报告,你可以用课程提供的视力数据,也可以用自己的数据, 按照我们刚才讲的步骤,把缺失值、异常值、重复值都检查一遍,然后做描述统计,画三张图, 最后把这些内容都填到提供的报告模板里,完成后对照一下自查清单,看看有没有漏掉什么,或者哪里做的不够好。 再看看视力答案,对比一下自己的报告,看看结构和内容是不是完整,多练几次,你就能熟练掌握这套数据体检的流程了。 今天我们一起学习了如何给数据做体检,从检查缺失值、异常值、重复值,到计算、描述、统计,再到绘制成图表,这些都是数据分析的基础,也是非常重要的一步。记住,数据质量是分析的基石,千万不能忽视。 希望大家通过今天的练习,能够熟练掌握这些技能,为后续更深入的数据分析打下坚实的基础。下此课我们将进入一个新的主题,学习如何理解和处理数据中的不确定性。

别再手动算库存了! sumif 函数出入库自动统计管理库房的大叔托关系做了一张出入库的统计表,他说为了美观,把日期和出入库做成了二维表的形式。 但他对 excel 函数并不熟悉,所以只能把每个单元格进行相加,数据多的时候光敲加号都能敲半天。其实这个用 sumif 就 可以解决。在入库单元格输入 sumif 函数 第一个参数框,选出入库的所有表头 第二个参数,一对双引号里输入入库 第三个参数框,选第一行出入库的数量,补齐最后一个括号,给第一个参数绝对引用,这样就对入库的数量条件求和了。复制这个公式,粘贴到出库单元格,把入库改为出库即可。 选中两个单元格,双击向下填充,这样每当有新的出入库数据的时候,总数量也会自动更新。你学会了吗?每天五分钟,带你学习更多小知识!

下面我们来看一些真实的案例,那么大家看这张表,这张表呢,是来自于一篇 sci 论文,嗯,是一个数据表, 那么大家看这个表,它大概分为了这么几列,第一列呢是 parameters 啊,姑且认为它是一些参数啊,包括这个年龄,性别分期,淋巴结转移和远处转移啊,这么几个参数。那么第二列呢是 number of cases, 是 这个样本量。第三列呢是一个 r a 的 表达量,是一个 lincoln r o r 的 表达水平,那么他把表达水平呢,分成了一个二分类,低表达和高表达。那么最后一列呢,是对应的 p 值, 那么我们来看这个年龄对这个表达水平的影响啊,年龄呢,本来应该是一个计量资料,但是呢,他以六十为界限,把它分成了一个二分类,那么这是什么分析方法呀? 啊,这是一个四格表卡方,对不对?那么我就不问大家了,我直接公布答案啊,四格表卡方, 那么下面这个性别呢,男性和女性也是四格表,对不对?那么这个分期呢,也是个二分类啊,那么也是四格表,那么这个淋巴结转移呢?啊否或者是那也是个二分类,那也是个四格表卡方,对不对?那么这个有没有远处转移呢? 那么也是个二分类啊,也是四个表卡方,那么通过四个表卡方,你还可以得出来一个 p 值,对不对?那么这是统计分析方法的部分,大家看这张表格,大家有没有发现什么不寻常的地方,有没有什么异常的地方 啊?啊,大部分同学都发现了,是不是我已经给大家标出来了这一题呢,他研究的疾病是什么? prostate cancer 是 什么?是前列腺癌,但是他研究对象里面竟然有二十二个女性。我们知道得前列腺癌的前提, 你得有前列腺吧,那女性都没有前列腺,你是怎么得的前列腺癌呢?那显然这个数据呢,它是一个百分之百造假的数据。 好,我们再看下一个案例,这也是一个真实的案例。当然这是一篇中文文章啊,但是这篇文章呢,应该也已经被撤稿了,因为也是涉嫌造假。 那么他是研究了两种教学方案啊,的一个成绩对比。这两种教学方案呢,分别是传统教学和案例教学。 那么这篇文章呢,是一个某大学的一个副教授发的,然而现在有可能是正教授了啊,那么两种教学方案分别是传统教学和案例教学。那么他对两个班级的这个学生呢,分别做了模拟考试和期末考试啊,这个 两个班级的人数呢,分别是四十九和五十三。那么他把这个考试的题型呢,分为选择题啊,填空题,名字解释和检查题,当然了,也统计出来一个总分,对不对?那么我想知道这个传统教学方案啊,他有没有效果呢? 那么我们该用怎样的统计方法呀?啊?是不是配对题检验对不对?因为他有一个模拟考试,一个期末考试啊,一个干预措施施加之前,一个干预措施施加之后是一个相关的样本, 所以你单看传统教学有没有效果,那配对 t, 单看案例教学有没有效果,也是配对 t 对 不对?但是我想知道两种教学方案有没有差异?那么这题我们怎么做 啊?之前给大家讲过,是斜方差分析对不对?把这个啊,这个模拟考试作为一个斜变量啊,把这个期末考试作为校园指标做斜方差分析,当然了,要符合这些检验类型的使用条件。 好,这是统计方法。那大家再看这张表格,大家有没有发现什么不对的地方?这个比较隐晦,我没有标出来,大家来看一下啊 啊,大家讲的应该都没有讲到点子上,我直接公布答案吧。大家先看一下这个四个题型,它这试卷呢,分为 这个选择题,填空题、名词解释和解答题,还有总分啊,总分,当然是啊,最后统计出来的总分,我们知道啊,他用的是均值加减标准差,比如说第一个数是均值对不对?那是总分的均值, 各个题型的均值,那么总分的均值和各个题型的均值是什么关系啊?啊,大家说一说。这个大家应该知道呀,这个这个初中生都知道,应该是各个题型的均值之和, 必须要等于总分的这个均值。但是显然呢,你看这个模拟考试,十五点三加八点四啊,我们粗略的加减一下,二十三对不对?加十二,三十五,三十五加二十,应该是五十五,跟这个五十一点二差了四,对不对?差了四点多, 那么显然这是不对的,这是对不上的。可能大家有的同学要问,这可能是因为四舍五入对不对?因为这都是保留小数点后移位,但是保留小数点后移位的结果,虽然会造成一定的误差,但是不会相差这么多,相差这么多,绝对是假的啊,大家能不能理解,那这一题呢,也是一个造假的数据。 那么其实啊,在我们的这个这个学习过程中,会遇到很多暴雷的,已经被这个纰漏出来 啊,很多很多啊,当然了,还有一个例子啊,我没有把它放到 ppt 上,因为这篇文章作者,尤其是他的通讯作者啊,还是一个比较有威望的人啊,在业内非常知名。那为什么要说他炸裂呢? 这也是一篇 i c r 论文,但是现在也已经被撤稿了,他研究的是一个呼吸内科疾病,我们都知道呼吸内科有一个很重要的检查,叫做血气分析,那么里面有一个很重要的项目,叫做酸碱度,也就是 ph 值。 那这篇文章呢,他分了三个组,一个安慰剂组和两个治疗组,每组大概是二十多个人啊,具体是多少人,我记不得了,应该是每组大概是二十个人。那么这三组患者呢,在治疗前的 ph 值,有一组达到了十一点多,另外两组呢,他的治疗前的 ph 值达到了十二点多。 那么大家可能觉得不可思议,人的 ph 值怎么会达到这么高?但是还有更离谱的,有这些患者,最后都治好了啊,都治好了,治疗后的 ph 值呢,基本上都恢复正常了。 这篇文章呢,我们先抛开这个疗效不谈,就单单说他发现了六十多个人活着的人,他的 ph 值竟竟然能达到十点以上,十一点多,十二点多,而且还是平均值啊,说明有的人的 ph 值已经达到十三点多了,对不对?十二以上了, 那么他单凭这个发现,他就能震惊世界,因为他发现了人类进化的秘密,人类已经可以进化到可以耐受十二年多的 ph, 是 不是啊?那么朋友们肯定感觉这个故事非常的荒诞对不对?但是这就是一个真实的案例,这篇文章的所有作者 都是国内某中医药大学附属医院的呼吸内科医生,连我们都知道,一个活着的人,他无论病的有多么重,他的 ph 值都不可能达到这么高 啊,那么这些个呼吸内科医生呢,肯定比我们更懂对不对?那么我们都知道,他们也知道呀,那么很明显,这篇文章呢,根本就不是这个医生写的,这篇文章大概率是一个根本就没学过医的人写的, 那么这些个署名作者可能在发表之前根本就没有看过这篇文章,如果他看的话,不可能发现不了问题, 那这篇文章究竟是怎么产生的呢?究竟是谁写出来的呢?这个很难猜,对不对啊?我也猜不到这个答案是什么,大家可以自己猜一下啊,但是不要说出来啊,不要在单位上说出来。 好,当然这是个题外话。接下来我们来讲这个毕业论文,包括一些这个科研论文啊,数据的描述方法。我们讲我们的数据大概分为三种类型,分别是 定量数据,也就是我们平时说的计量资料,数值型资料。那么定序数据呢,就是我们的这个等级资料, 那么定性数据呢?就是我们说的无序分类资料。好,这是一种分类方法,那么也可以有另外一种分类方法,分为两类,分为两大类,一类是计量资料,一类是基数资料,那么当然基数资料又可以细分为两小类,那么基数资料就是我们的分类资料。好, 我们计量资料的描述呢,可以用这个平均值啊,中位数极差,极差就是最大值减最小值得到一个差值,那么还有标准差,四位数的间距等等等。 那我们如果我们的这个计量资料服从质态分布,那么我们可以用均值加减标准差的形式来表示,那么如果是一个极度的偏态呢,我们可以用中位数和四位数的间距表示,这个 m 呢,就是中位数,也叫百分之五十分位数,那么这个 q 一 和 q 三呢,分别是两个四分位数,对不对? 这个数据的描述方法跟我们使用的统计方法有一个对应关系,如果你用了参数检验,比如说你用了 t 检验和方差分析,那你的数据描述就应该使用均值加减标准差的形式啊。如果你的这个数据是一个极度偏态,那么你使用了非参数检验,那么你的数据描述就应该使用中位数和四位数的间距来表示, 这是这个分析方法与这个描述方法的对应关系啊。那么我们举一个例子啊,是不是一个计量资料, 但是呢,因为可能他不服从这个正态分布,是个极度偏态的,那么他用的是中位数和四位数的间距啊。当然 q 一 q 三可以表示这个四位数,那么 p 二十五, p 七十五呢,也是这个 四位数的一个表述方法,那么他用的是六十七,是中位数啊,四位数分别是五十六和七十二,四位数是有两个的,一个上四位数,一个下四位数,那么这个发病年龄呢,也是一个 中位数和四位数间距表示的,那么这个并乘呢,也是中位数和四位数间距表示的啊,那么这是这样一个例子,我们再举另外一个例子,这个数据就非常的多了,对不对?我们看这个体重,它是用均值加减标准差的,那说明它可能是服从正态分布的,并且我们用的这个检验方法呢,对应的应该是这个 啊,基检验对不对?因为它一共分了两个组,那么这个身高呢,它是用中位数和四位数的间距表示的,那可能它是一个极度的偏态,那么它对应的应该是一个非参数检验,那么统计量呢,就是 z 值, 那么这个 bmi 呢,它可能也是不正态的,或者极度偏态,它用中位数和四位数的间距表示,对应的呢,也应该是个 z z 统计量用的非参数检验。好,就是这样一个例子,那么基数资料啊,包括等级资料和这个分类资料, 那么统称为基数资料啊,它主要是描述呢,可以用滤核构成比,我们卡方检验比较的就是滤核构成比,对不对? 这是一个分类资料,那么它有两个组啊, led 组合,非 led 组,那么它的这个运动压型呢,分为三个压型,那是一个二乘三的一个交叉表,它用的是卡方检验,对不对?那么它的描述呢,就是用例数啊,和这个百分比来描述的啊, 好,这是下面呢,这是一个等级资料,它的疗效描述是显效、有效和无效,这是个等级资料,那么它的描述方法呢,也是利索括号里面呢是百分比啊,那么这是一个 基数资料的啊表述方法。那么我们再看一下我们常见的统计图啊,一般文章里面我们讲 图纹并茂啊,硕形结合,那么这个形呢,指的就是统计图,我们的统计图种类非常非常多,包括直方图,线图,丙图,三点图等等,我们来看几个图,那这个图呢啊,是一个柱状图,我们可能大部分同学都用过这个图,那这个呢?这个叫热图啊, 这个呢叫相图啊,或者相线图或者相视图,这个呢叫丙图啊,这是图集图,下面我们再给大家介绍几个这个数据分析以及绘图的工具。我们先看这个分析工具啊,那么第一个呢,这是 space, 就是 今天我们主要用的这个统计软件。 那么第二个呢叫 stat 啊,也是非常常用的一个统计软件。那么第三个呢叫 mini table, 这个大家可能用的比较少啊,这个其实也非常简单,这个界面呢跟这个 space 非常的相似, 那么底下这个呢叫萨斯软件啊,萨斯软件加 swars 加 stata, 这是世界三大通缉软件,那最后两个呢,是属于后来者居上,一个 r 语言,一个 python, 那 么今天我们也用到了 r 语言这个 python 呢啊,以后如果有机会的话,可以跟大家一起来探讨这个 python, 这是数据分析工具,当然这个工具呢也可以做图,那么下面再介绍几个专门用来做图的这个工具,但这个工具也有数据分析的功能啊,那么第一个呢叫 prism graphpad, prism, 那 么这是一个非常简单的软件,操作非常简单,而且与我们生物医药领域非常的契合,那么第二个呢叫 orange 啊,第三个呢叫 c 八 proct 啊,当然后面这两个软件是所有的专业所有领域几乎都可以啊去操作,那么第一个呢,与我们生物药最为契合, 那么除了这些还有没有其他的有同学问啊?当然有,这个汇通软件肯定不止这三个,那么数据分析的软件呢?也不止这六个啊,当然这些呢是我用过的啊,我给大家推荐的,我,我不会给大家推荐的啊,这是这样一个情况, 好,那我今天的分享就到这就结束了,感谢大家的支持啊,进到最后我看还剩了一百多个人啊,这个非常感谢大家的这个关注。今天我们花了三个多小时的时间来给大家简单的讲一下这个编论文或者说开源论文里面 常用到的一些统计方法,当然是差异比较的分析方法,那么关于这个关联性分析,关系性分析,比如说回归分析,比如说主成分和因子分析等等, 以后如果我们有机会的话,可以跟大家在一起讨论,大家都是兄弟姐妹,大家应该都是我的师弟师妹啊,那么如果大家在写毕业论文的过程中,如果遇到什么问题的话,可以跟我们进行沟通啊,我们五个都可以 啊,那么关于我的联系方式呢啊,刚刚两位老师已经给大家分享给大家了,大家在加我微信的时候要备注一下啊,以防我认为你是这个卖保险的或者是些做广告的啊,大家在加我的讲解就结束。

零基础,小白只用一个函数就能做出动态统计表,这你敢信?这就是 pivot by 函数第八集先筛选,再统计 输入 pivot by 函数,第一参数,行字段,选明细表中的产品名称区域。第二参数,列字段,选发货地区。第三参数值区域,选金额这一列。第四参数,数据汇总方式仍然使用 sum 进行求和,这些用法前面都详细讲过,大家可以自行考古。 接下来按六个逗号通过这种方式跳过第五至第九个参数,进入第十参数。这个参数是筛选条件,选中品类,这一列等于上方筛选条件的绿色单元格 公式,将对符合筛选条件的数据进行行行行列的数据汇总。回车,小白也能分分钟完成这么高大上的动态筛选统计表点关注学更多用法!

这里有一份销售表格,记录着产品每天的销售记录,需要统计出所有产品的销量和销售金额。要怎么做呢?让肖总管来教大家吧。 首先,我们在单元格里输入 group b 函数第一个参数,我们选择产品名称列第二个参数,选择销量和销售金额列第三个参数,我们使用 sum 函数第四个参数,输入零,表示不需要表头, 因为我们已经提前输入了表头了。第五个参数,选择一,需要总计回车,可以看到所有产品的销量和金额都被统计出来了,但是当我们新增数据的时候,它并不会自动统计进来, 所以我们需要把数据范围扩大一下,可以扩大到五百行数据,点击公式把所有范围改为五百, 我们可以看见在五百行里面的数据都统计了,但是当数据区域有控制的时候,会显示零。我们就需要使用 group 笔的第七个参数了,在第七个参数选择筛选产品名称列不能为空。 怎么样,你学会了吗?还想解锁哪些表格使用技巧?评论区留言,肖总管优先安排教程,关注我,学习更多职场干货!

大家好啊,欢迎继续学习所有数据分析基础系列技巧视频 啊,在我们平常处理数据或者分析数据的过程中呢,我们第一步呢往往是想对我们要分析的数据集呢,先做出一个大概的描述啊,就了解一下我们数据的一个大概情况啊,这里边呢基本上就是描述统计的一些主要内容啊,像什么军值啊,然后这种啊,最大值,最小值啊, 啊,他的离散程度啊,还有什么标准差之类的,就是这些信息啊,我们先对整个数据集呢,有一些有一个大致的一个了解, 然后在这个基础值上呢,再决定要不要对数据进行转换啊,进行清理啊,进行这个异常值得这种剔除啊,包括一些这种确实值得替换啊,类似这些数这些动作都要有一个前, 就是你对你的整个数学题的概况的有一个了解,那么在在我里边呢,我们有一些函数是来做这些事情的,比如说我们有均值的函数,标准差的函数啊,有最大最小值的函数啊,还有一些这个呃 相关的一个方差呀,还有这种这个技术啊,类似这些东西啊,这个还有蜡纸和丝帽这种函数, 但是啊,我们一个个的去做的话呢,会比较麻烦啊,那么我们呢在在我里边呢,其实有一个地方呢,可以直接把整个数据级的相关概况呢,一次性的给我们完整的显示出来 啊,这就是描述统计这个功能啊,这个功能在什么地方呢?在我们数据菜单的这个数据分析这个选项里边啊,数据菜单的数据分析,数据分析应该是在最右边,如果你的数据菜单里边 没有数据分析的这个选项的话呢,你要到这个在我的选项里边去, 在这里边呢有一个加载项呃,点一下加载项,然后在底下管理 xl 加载项,这个地方呢转到一般情况下呢,如果你的 xl 是正常安装的版本的话呢,这个地方会有一个分析工具库, 还有一个是微微的微微,这个可以不用管他啊,只是上面这个分析工具库,你把它勾上,勾上之后呢点确定就可以了啊,这样的话呢,他就会出现在你的数据菜单的最右边啊, 数据分析,当然如果你归你同时勾了规划求解的话呢,也会有规划求解的这个选项规划求解的我们后续的视频呢会讲啊,这也是非常强大的一项功能。好,我们现在呢,比如说这个成绩啊,我们要 分析一下员工的这个成绩的表现啊。啊,这个时候呢,我们打开数据分析,然后呢找到这个,在所有的这这些选项里面找到描述统计啊,描述统计,然后点确定啊,这样呢,我们来去选这个我们的收入数据的区域 啊,光标放进来税区呢,我先选中 a 一第一个单元格,然后呢 ctrl shift 按住下箭头啊, ctrl shift 两个键按住之后呢,再按一次下箭头, 他就会把整个的数据给我们选中,但是呢不会多选任何空白的单元格,这是我们选择数据最精准的方法啊。 好,这数据是按列分布呢还是按行分布呢啊?当然我们现在看到的数据是按列分布的啊,所以默认是助列啊,标志位于第一行的意思是说你第一个,第一个单元格啊, 是不是是数值还是文本啊?我们第一个单元格呢,是这个呃,这一列数据的一个题目啊,这一列数据的一个字段的名称, 所以呢,我们要告诉我们的 excel 说我的标志在第一行,你不要分析他,他是个文本啊,否则的话他会报错啊。你如果你的第一个单元格里边不是数字而是文本的话啊,一定要勾上这个, 然后呢,下边呢?汇总统计啊,知心度的话,你愿意勾呢就勾啊,比如说这里边默认的话有百分之九十五啊,就是这个 一般情况下呢啊,看不看的问题不大啊,如果你是要做进一步数据分析的话呢,这个后续的一些分析方法里边都会有这个选项啊,这个就不用管他啊,汇总统计啊,然后呢,如果你想看 dk 大致 这个是什么意思呢?就是说我们的麦克斯和麦呢,只会给你最大值和最小值, dk 大值的实际上是相当于函数辣值的用法啊,就是说你我不看最后一个,我也不看第一,我不看最大的,不看最小的,我要看那个什么倒数第五名是个什么样子, 正数第三名是个什么样的啊?这个时候你就可以在这地方呢去勾,比如说第第 k 大指我要第,我要填个五的话,这个时候他会给你输出。第五名的那个值是什么啊?第五名那个值是什么?如果说啊,我们要选 这个 dk 小值的话呢啊,比如说我要看倒数第三名是什么啊,就是这个意思,这个一般的我们也用不到啊,基本上我们就看汇总统计就可以了啊,当然这个数据呢,你可以放在新工作表,也可以放在什么呢?这个输出区域啊,还可以放在一个 新的一项文件啊,就新工作部。那这个就是在自己选啊,这个数据呢很简单,我们就放在我们现在这张表里就可以了啊,选一下输出区域,把它放在这个地方啊。 c 一设置好了之后呢,我们来点确定啊,这样的话呢,你会看到他的整个的这个 相关数据的就全出来了啊,平均值八十分啊,那个标准物呢?是一点三五,然后呢这个标准差是十三分啊,这个平均值, 这个呢我们是重点看的是平均值啊,标准差来看他的这个,呃,集中趋势和离散趋势啊,集中趋势到八十点几啊,八十点,这个九四啊, 不错,离散区。是呢,十三点十三分,十三分半啊,现在有点大啊。然后呢我们来看他的整个区域, 这个区域就是最大值减最小值啊,这是他的整个的波动范围啊,你就你可以看到波动范围的足足有四十五分的一个差距,也就是说最好的和最差的中间差了四十五分啊,这个波动呢还是蛮大的,就是说我们整个的这个成绩表现的不是特别稳定 啊,然后呢这个观测数时间就是 comt 了啊,一共有多少个人啊?求和在这里边没什么意义的啊,最大值是一百分,最小值五十五分啊,这样的话呢,我们就可以对整个数据线呢有一个一个大致的一个描述 啊,然后这个八十九分啊,是人数最多的,就是有很多人考了八十九分啊,这里这里面这种数啊,中位数呢是八十四,然后平均只能八十点几,就是这个分布呢,还算就这三个数值啊,这三个数值就平均值,呃,平均值,这个 中位数啊和种数啊,这三个呢,能够我们进一步去判断整个数据的这种这个分布啊,是不是均衡啊,差距并不大啊,这个按道理来讲,如果是这个很对称的分布的话呢,我们平均只和中位数的应该是呃,差不多的,应该或者是同一个数 啊,这样的话呢,稍微偏了四分吧,四分左右啊,还是可以的啊,还是可以的 啊,然后呢如果说我们看的标准差比较大的话呢,那么就是说他的整个的这个分布的范围呢,还是比较大,那么如果形象的来看一下的话,应该是这个样子啊,应该是这个样子,就是比较对称, 对称,但是呢他的整个的这个呃分布的范围比较大,这边是四十五分啊,然后呢这边是一百, 哎,就是说我们整个的这个跨度啊,也就是标准差所所所预示的这个东西比较大。我们理想状况下是什么?理想状况下是大家是这个样子的啊,这个这这才是我们所需要的啊,比如说这边都是最低分是 这个七十五分啊,然后呢最高分呢,这边是一百分啊,这样大家就比较满意啊,就是比较对称的一种另一种这种分布方式。 好啊,这是这个在我带给我们的一个描述统计啊,对数据做出一个大致描述的功能啊,今天呢就给大家来介绍到这。

描述统计、差异性分析、回归分析,一句话就全部搞定,接下来教大家如何利用意测来完成以上分析。首先点击创建项目,并在需求中输入你的要求,如果不知道该做什么,也可以像我这样直接让小册根据你的数据进行分析, 然后点击上传文件,把你的数据进行上传,然后点击创建项目就可以开始分析了。接下来让我们来看一下最终的分析报告吧! oh my god! 好 了,今天就到这里,如果还想看什么分析评论区给我留言吧,记得关注主播会不定期发放积分码哦!

大家好,我是二幺幺统计课堂王老师,本节我们来讲描述统计分析, 实际上在 excel 中有一个非常好的插件,就是数据分析插件,他可以做绝大部分统计学原理里面的内容。 下面我来演示一下我们怎么样来加载数据分析插件。 首先呢点开打开一个一个下文的 左键,点击文件,这里边呢有一个选项,最下面 一个选项, 点击选项 在这里边的话呢,我们会找到一个三号选项,常用的常规数公式数据较对,点这个加载项,加载项点一下左键, 那么点完加载项以后呢会出现这些内容。分析工具库,分析工具库 vba, 规划求解。加载项。一般来说,如果说我们 office 软件呢是一个完整版本的,那么你装完以后, 那么他会出现这些内容。分析工具工具库和分析工具库 vba, 还有 规划求解。如果说我们安装的是一个不完全,完不完全的这个版本,那么点完加载项以后,他没有没有这些内容,如果没有这些内容呢,说明我们的版本是不完整的, 不可以使用数据分析插件。大家呢需要再再下载另外一个更为完整的 office 安装包,再一次安装 office, 再看一看里面有没有是这样一个 过程啊?分析工以后,点完以后呢,他是默认的点第一个,但是你可以点第二个啊,都可以,这两个都可以。这边呢有一个管理叫 excel 加载下点转到, 点一下转到啊,转到,点完以后的话呢,他会出现这样一些内容 啊,欧元工具是吧?比如说卡瑞斯,基本上我们都不用这个,我们用的是后面三个分析工具库,分析工具库 vba 和规划求解加载项。 实际上我们在本本门课程的讲解过程中,我们主要会用到分析工具库和规划求解。 那不妨呢,把这几个都选上啊,我们就选这三个,确定啊,确定, 那么确定完以后呢,好像没有什么反应啊?没有什么反应不要紧, 我们去找一下。这个在哪里找呢?在这个数据下面啊,在这个数据下面点一下数据, 你会发现呢,在他的最右边,最右边啊,有两个,一个是数据分析,一个是规划求解。 那么如果说这个步骤呢,做完以后,大家发现自己的 excel 软件里面有了这个数据分析和规划求解这两项,说明我们加载成功了, 加载成功了,那么里面的这些功能呢,就可以使用了啊,就可以使用了。如果说没有,就按照老师刚才说的,我们需要呢重新再下载 一个更为完整的 office 安装包,重新再安装,再加载, 基本上所有的这个软件呢,所有的安装包里面都会有,这个很少。呃,没有的啊,用这个工具呢,数据分析插件和规划求解呢,在零三版一个三二里面就已经有了, 他存在的时间比较长,这里面内容呢好长时间也没有更新过了啊,没有更新过了,好,我们点一下数据分析看一下啊,先点一下, 那么点完以后呢,会出现这样一个界面啊,这个里面的内容呢,就是我们。 哎,我们这个第三张啊,第四张,第五张,第六张等等,第七张, 第八章,我们都有可能会用到的这些内容都有可能会用到啊,这就以上呢,就是我们讲解的 一个线的这个数据分析,这个插件的加载如何加载的这样一个方法。本节课内容就讲到这里,感谢大家的聆听。

在数据库里面把行呢叫做记录,把类呢叫做之段, 这里我们可以横向的投放一下来,就是一类一类的东西,按照这样一块一块的喷,喷在一起,它就会显现一个完整的表格, 每一类呢,它是相当于一个属性,它描述同一类东西,属于同一类信息,这就是数据的基本采集规范。那我们平时 对一些数字的单位都是内外单独起一行,这个没问题,这是一个习惯问题。但是假如这个表格有很多的数值,它的维度,它的属性比较丰富,那我们这样子 每一个数字后面带一个单位,是不是看起来就很难看?这里有建议有个办法,就是在自断 头,也就是表头回车单元格里面回车 alt 加回车键换行, 然后手动标注这一类的单位,比如说按个数的,那就是 e a, 比如说按重量的,那就是括号里面公斤。 还有更直接的就是设置单元格的格式,比如说这里用自动 e, 自动 e, 后面加一个文本的符号, 注意这里只是改变它的显示样式啊,并没有改变单元格里面的数值。敲一个空格键,隔开一点,用半角双引号把单位引起来,下面就可以看到它的一个效果。设置好了, 那我们在底下直接虚数值,他就自己就会带单位了,这样看起来了,整个数字一看就知道他是表达要多少公斤,是一个重量,后面带了单位的这个数字看起来就更加直观了, 这个是可以直接求和的啊,因为他后面的空间呢,并没有渐渐的加上去,把它变成文本。