第二章 统计数据的描述
统计学原理(第二章)
数据的计量和类型
一、数据的计量尺度 4.定比尺度:又称为比例尺度或是比较水平, 是对事物之间比值的一种测度,它是最高层 次的测量,可用于参数和非参数统计推断。 它是与定距尺度属于同一层次的一种计量尺 度,但其功能比定距尺度更强一些。
在日常生活中,大多数情况下使用的都是 定比尺度。例如,年龄、收入、某地区每年的 失业人数、罪犯人数等。
数值数据的描述
一、数值数据的 分组
为什么要进行数据的分组?
品质数据的描述
某电脑公司50名销售代表某季度电脑销售量按从小 到大排序如下表:
107 108 108 110 112 112 113 114 115 117 117 117 118 118 118 119 120 120 121 122 122 122 122 123 123 123 123 124 124 124 125 125 126 126 126 127 127 128 128 129 130 131 133 133 134 134 135 139 139 139
204 80.00% 105 41.17%
235 92.16% 51 20%
255 100% 20 7.84%
— 100% —
品质数据的描述
二、品质数据的 图示 1.条形图:是用宽度相同的条形的高度或长 短来表示数据变动的图形,横置的称为带形 图,纵置的称为柱形图(直方图)。
柱形图(直方图)
120 100 80 60 40 20
定类变量、定序变量、 数值型变量(离散变量、连续变量)
第二节 品质数据的描述
一、品质数据的描述 二、数据的类型品质数据的图示 三、品质数据的分布特征描述
品质数据的描述
一、品质数据的 描述 1.频数:是落在某一特定类别(或组)中的 数据的个数。把各个类别及其相应的频数全 部列出来则形成频数分布。
医学统计学-第二章 统计描述
1. 首先对资料作分布类型的判定; 2. 针对分布类型先用合适的指标描述:
均值、标准差;常记录为 X S
中位数、四分位间距; 常录为M(Ql, Qu)
一、集中趋势:用于描述一组计量资料的集中位置, 说明这种变量值大小的平均水平(average)表示。
频 数
身高(cm)
图3.1 某市100名8岁男童身高(cm)的频数分布
(三)频数表的用途:
1.揭示频数的分布特征
频 数
分布 特征
身高(cm)
图3.1 某市100名8岁男童身高(cm)的频数分布
集中趋势
(central tendency)
离散趋势
(tendency of dispersion)
集中趋势与离散趋势结合能全面反映频数的分布特征
2.揭示频数的分布类型
对称 分布
频数 分布
正偏
非对称 分布
负偏
集中部位在中部,两 端渐少,左右两侧的
基本对称,为对称 (正态)分布。
集中部位偏于较小 值一侧(左侧),较大 值方向渐减少,为
正偏态分布。
集中部位偏于较大 值一侧(右侧),较 小值方向渐减少,
为负偏态分布。
(2) 定量资料的描述指标
描述指标: 集中趋势:
累计频数 (4) 1 6 14 31 54 75 89 96 99 100 100
累计频率 (5) 0.01 0.06 0.14 0.31 0.54 0.75 0.89 0.96 0.99 1.00 1.00
频数分布图(frequency distribution figure) :
根据频数分布表,以变量值为横坐标,频数为纵坐 标,绘制的直方图。
第二章 统计数据的描述
第二章统计数据的描述一、填空题:1.统计分组有等距分组与异距分组两大类。
2. 频率是每组数据出现的次数与全部次数之和的比值。
3. 统计分组的关键在于确定组数和组距。
4. 统计表从形式上看,主要由表头(总标题)、横行标题、纵栏标题和数字资料(指标数值)四部分组成。
5. 均值是测度集中趋势最主要的测度指标,标准差是测度离散趋势最主要的测度指标。
6.当平均水平和计量单位不同时,需要用变异系数(离散系数)来测度数据之间的离散程度。
7.众数是一组数据中出现次数最多的变量值。
8.对于一组数据来说,四分位数有 3 个。
二、单项选择题:1. 次数是分配数列组成的基本要素之一,它是指( B )。
A、各组单位占总体单位的比重B、分布在各组的个体单位数C、数量标志在各组的划分D、以上都不对2. 某连续变量数列,其末组为600以上。
又如其邻近组的组中值为560,则末组的组中值为( D )。
A、620B、610C、630D、6403. 变量数列中各组频率的总和应该是( B )。
A、小于1B、等于1C、大于1D、不等于14. 某连续变量数列,其首组为500以下。
又如其邻近组的组中值为520,则首组的组中值为( C )。
A、460B、470C、480D、4905. 在下列两两组合的指标中,哪一组的两个指标完全不受极端数值的影响(D )A、算术平均数和调和平均数B、几何平均数和众数C、调和平均数和众数D、众数和中位数6. 在编制等距数列时,如果全距等于56,组数为6,为统计运算方便,组距应取(D )A、9.3B、9C、6D、107. 一项关于大学生体重的调查显示,男生的平均体重是60公斤,标准差为5公斤;女生的平均体重是50公斤,标准差为5公斤.据此数据可以推断( B) 用变异系数算A、男生体重的差异较大B、女生体重的差异较大C、男生和女生的体重差异相同D、无法确定8. 某生产小组有9名工人,日产零件数分别为10,11,14,12,13,12,9,15,12.据此数据计算的结果是( A ) 众数12 中位数12 平均数12A、均值=中位数=众数B、众数>中位数>均值C、中位数>均值>众数D、均值>中位数>众数9. 按连续型变量分组,最后一组为开口组,下限值为2000。
统计学 第2章 统计数据的描述
第2章统计数据的描述练习:2.1为评价家电行业售后服务的质量,随机抽取了由100家庭构成的一个样本。
服务质量的等级分别表示为:A.好;B.较好;C.一般;D.差;E.较差。
调查结果如下:B EC C AD C B A ED A C B C DE C E EA DBC C A ED C BB ACDE A B D D CC B C ED B C C B CD A C B C DE C E BB EC C AD C B A EB ACDE A B D D CA DBC C A ED C BC B C ED B C C B C(1) 指出上面的数据属于什么类型;(2)用Excel制作一张频数分布表;(3) 绘制一张条形图,反映评价等级的分布。
2.2某行业管理局所属40个企业2002年的产品销售收入数据如下(单位:万元):152 124 129 116 100 103 92 95 127 104105 119 114 115 87 103 118 142 135 125117 108 105 110 107 137 120 136 117 10897 88 123 115 119 138 112 146 113 126(1)根据上面的数据进行适当的分组,编制频数分布表,并计算出累积频数和累积频率;(2)如果按规定:销售收入在125万元以上为先进企业,115万~125万元为良好企业,105万~115万元为一般企业,105万元以下为落后企业,按先进企业、良好企业、一般企业、落后企业进行分组。
2.3某百货公司连续40天的商品销售额如下(单位:万元):41 25 29 47 38 34 30 38 43 4046 36 45 37 37 36 45 43 33 4435 28 46 34 30 37 44 26 38 4442 36 37 37 49 39 42 32 36 35根据上面的数据进行适当的分组,编制频数分布表,并绘制直方图。
医学统计学 第二章 计量资料的统计描述
肌红蛋白含量
人数
0~
2
5~
3
10~
7
15~
9
20~
10
25~
22
30~
23
35~
14
40~
9
45~50
2
18
人数
25 20 15 10
5 0
2.5 12.5 22.5 32.5 42.5 52.5 血 清 肌 红 蛋 白(μg / m L)
图 2-3 101 名 正 常 人 血 清 肌 红 蛋 白 的 频 数 分 布
医学统计学 第二章 计量资料的统计 描述
计量资料(定量资料、数值变量资料) 总体:有限或无限个(定量)变量值 样本:从总体随机抽取的n个变量值:
X1,X2,X3,……,Xn
n为样本例数(样本大小、样本含量)
2
统计描述——描述其分布规律 1、用频数分布表(图)
要求:大样本 如 n〉30
2、用统计指标 描述 集中趋势 离散趋势
6
➢制表步骤 了解分布
1. 求极差(range) 极差也称全 距,即最大值和最小值之差,记作R。 本例
R 5 .7 1 2 .3 5 3 .3 6 ( m m o l/L )
7
2.确定组距(i) :
组段数通常取组 10-15组 本例组距
i 3 .3 6 /1 0 0 .3 3 6 0 .3 0
累计频率(%) (4)
0
402
402
35.80
1
330
732
65.18
2
232
964
85.84
3
118
1082
96.35
4
27
第二章 数值变量资料的统计描述
频数分布的类型
频数分布分为对称分布和偏态分布两种类型。 频数分布分为对称分布和偏态分布两种类型。 对称分布是指集中位置在正中, 对称分布是指集中位置在正中,左右两侧频 数分布大体对称,如上表所示。 数分布大体对称,如上表所示。若将其绘制 成频数分布直方图,则更清楚。 成频数分布直方图,则更清楚。 直方图是以x 本例为体重) 为横坐标 , 直方图是以 x( 本例为体重 ) 为横坐标, 频 数或百分数为纵坐标, 数或百分数为纵坐标,用矩形面积大小表示 频数多少。 频数多少。
某地150名12岁男童体重频数分布图 名 岁男童体重频数分布图 某地
40
30
Frenquency
20
10
0 21.5 24.5 27.5 30.5 33.5 36.5 39.5 42.5 45.5 48.5 51.5
体重(kg)
频数分布的类型
偏态分布指集中位置偏向一侧, 偏态分布指集中位置偏向一侧 , 频数分布 不对称。 不对称。 一些以儿童为主的传染病, 一些以儿童为主的传染病 , 患者的年龄分 布 , 集中位置偏于年龄小的一侧, 频数尾 集中位置偏于年龄小的一侧 , 部向右侧延伸, 称为正偏态 ( 部向右侧延伸 , 称为正偏态( 峰 ) 分布 , 分布, 如图
一、频数分布表(frequency table)的编制 频数分布表( table)
某地儿研所测得该地150名12岁健康男童体重 某地儿研所测得该地150名12岁健康男童体重 kg)原始数据如下,试编制频数表。 (kg)原始数据如下,试编制频数表。
25.2 30.5 36.5 35.1 37.1 37.1 28.7 31.4 36.8 27.3 37.6 37.8 35.7 34.9 36.2 42.5 37.8 44.0 29.2 33.7 34.1 27.2 48.6 25.5 33.4 39.3 34.3 51.0 33.7 32.4 35.6 38.2 35.1 25.3 34.0 35.8 37.3 32.2 42.2 38.1 38.0 29.3 38.5 44.5 41.1 42.9 29.6 34.7 29.7 37.5 33.4 35.3 41.3 43.8 39.6 28.2 46.5 36.2 20.1 38.2 44.4 45.6 41.5 32.4 30.1 27.8 40.9 37.5 36.5 35.0 43.5 35.4 43.7 41.2 41.8 38.4 32.8 27.2 33.8 37.5 39.6 23.4 31.8 32.8 26.5 33.8 35.3 33.0 44.2 36.8 37.7 36.6 33.2 35.8 36.4 36.3 42.0 24.5 42.6 28.3 43.2 45.7 28.4 33.4 32.1 34.1 36.2 31.8 39.6 29.2 34.1 33.3 31.5 41.2 33.5 47.4 29.9 27.6 47.9 30.6 38.7 45.9 30.0 35.1 40.2 40.9 47.3 36.4 43.7 42.6 38.7 38.5 35.4 32.5 31.4 40.6 34.5 36.5 34.8 41.4 33.8 23.1 20.5 39.6 51.2 23.5 40.8 38.2 37.4 47.9
统计学第三版书后答案第二章
第2章统计数据的描述●9.某百货公司6月份各天的销售额数据如下单位万元257 276 297 252 238 310 240 236 265 278 271 292 261 281 301 274 267 280 291 258 272 284 268 303 273 263 322 249 269 295 1计算该百货公司日销售额的均值、中位数和四分位数2计算日销售额的标准差。
解1将全部30个数据输入Excel表中同列点击列标得到30个数据的总和为8223 于是得该百货公司日销售额的均值见Excel练习题2.9 xxn822330274.1万元或点选单元格后点击“自动求和”→“平均值”在函数EVERAGE 的空格中输入“A1A30”回车得到均值也为274.1。
在Excel表中将30个数据重新排序则中位数位于30个数据的中间位置即靠中的第15、第16两个数272和273的平均数Me2722732272.5万元由于中位数位于第15个数靠上半位的位置上所以前四分位数位于第1第15个数据的中间位置第8位靠上四分之一的位置上由重新排序后的Excel 表中第8位是261第15位是272从而QL2612732724261.25万元同理后四分位数位于第16第30个数据的中间位置第23位靠下四分之一的位置上由重新排序后的Excel表中第23位是291第16位是273从而QU2912732724290.75万元。
2未分组数据的标准差计算公式为s30211iixxn 利用上公式代入数据计算是个较为复杂的工作。
手工计算时须计算30个数据的离差平方并将其求和再代入公式计算其结果得s21.1742。
见Excel练习题2.9 我们可以利用Excel表直接计算标准差点选数据列A列的最末空格再点击菜单栏中“∑”符号右边的小三角“▼”选择“其它函数”→选择函数“STDEV”→“确定”在出现的函数参数窗口中的Number1右边的空栏中输入A1:A30→“确定”即在A列最末空格中出现数值21.17412即为这30个数据的标准差。
《医学统计学》第二章定量数据的统计描述
累积频数
(3) 27
196 363 457 538 580 608 622 626 629 630
-
累积频率(%)
(4) 4.29 31.11 57.62 72.54 85.40 92.06 96.51 98.73 99.37 99.84 100.00
资料如表,试计算其中位数。
某地630名正常女性血清甘油三酯含量(mmol/L)
甘油三酯(mmol/L)
(1) 0.10~ 0.40~ 0.70~ 1.00~ 1.30~ 1.60~ 1.90~ 2.20~ 2.50~ 2.80~ 3.10~
合计
频数
(2) 27 169 167 94 81 42 28 14 4 3 1
练习
例 8名食物中毒患者的潜伏期分别为1,4,3,3,2,5,8,16小时,
求中位数。
n=8,为偶数
M
1
2
(
x (
8 2
)
x (
8
1)
)
2
1 2 ( x4
x5 )
1 3 4
2
3.5(小时)
例 某传染病11名患者的潜伏期(天)分别为1,3,2,2,3,7,5,6,
4,7,9,求中位数。
n=11,为奇数 M xn1 2 x(111) x6 4(天 ) 2
偏态分布
正偏态 负偏态
正偏态:集中位置偏向数值小的一侧 负偏态:集中位置偏向数值大的一侧
医学统计学(第7版)
正 态 分 布
医学统计学(第7版)
正偏态
集中位置偏向 数值小的一侧
负偏态
集中位置偏向 数值大的一侧
(麻疹年龄分布)
(肺癌年龄分布)
统计学(第四版)袁卫 庞皓 贾俊平 杨灿 (02)第2章 统计数据的描述(袁卫)
n
2. 各变量值与平均数的离差平方和最小
(x
i 1
5 - 36
i
x ) min
2
统计学
STATISTICS
几何平均数
统计学
STATISTICS
几何平均数
(geometric mean)
n 个变量值乘积的 n 次方根 2. 适用于对比率数据的平均 3. 主要用于计算平均增长率 4. 计算公式为
QM
25%
QU
2. 不受极端值的影响 3. 主要用于顺序数据,也可用于数值型数据, 但不能用于分类数据
5 - 27
统计学
STATISTICS
四分位数
(位置的确定)
n 1 QL 位置 4 Q 位置 3(n 1) U 4 n QL 位置 4 Q 位置 3n U 4
去掉大小两端的若干数值后计算中间数 据的均值 2. 在电视大奖赛、体育比赛及需要人们进行 综合评价的比赛项目中已得到广泛应用 3. 计算公式为
1.
x
5 - 41
x( n 1) x( n 2) x( n n ) n 2 n
1 2
n 表示观察值的个数;α表示切尾系数,0
f
i
i i
样本平均数
5 - 34
f
i 1
i
统计学
STATISTICS
加权平均数 (例题分析)
x
x f
i 1 k
k
i i
f
i 1
i
3110 103.67 (件) 30
5 - 35
统计学
STATISTICS
平均数
第2章统计数据的描述
第二章统计数据的描述一、单项选择题1.下列中,最粗略、计量层次最低的计量尺度是()A.间隔尺度B.顺序尺度C.比例尺度D.列名尺度2.将全国人口按“民族”划分为汉、白、彝、回、藏…..,这里使用的计量尺度是()A.比例尺度B.列名尺度C.间隔尺度D.顺序尺度3.某个人对某一事物的态度可以划分为非常同意、同意、保持中立、不同意、非常不同意,这里使用的计量尺度是()A.列名尺度B.间隔尺度C.顺序尺度D.比例尺度4.下列中,计量层次的最高、最精确的计量尺度是()A.比例尺度B.间隔尺度C.顺序尺度D.列名尺度5.下列调查方式中,只能调查一些最基本、最一般现象的调查方式是()A.抽样调查B.重点调查和典型调查C.统计报表D.普查6.实际中应用最为广泛的一种调查方式是()A.重点调查B.统计报表C.普查D.抽样调查7.某城市拟对占全市储蓄额4/5的几个大储蓄所进行调查,以了解全市储蓄的一般情况,则这种调查方式是()A.抽样调查B.典型调查C.重点调查D.普查8.一次性调查是指()A.只做过一次的调查B.调查一次以后不再调查C.间隔一段时间在进行一次调查D.只隔一年就进行一次的调查9.在统计分析中,对累积的次数分配用得最直接的是()A.供给曲线B.需求曲线C.洛伦茨曲线D.边际需求曲线10.专门用来衡量和反映收入分配平均程度的统计指标是()A.基尼系数B.可决系数C.相关系数D.离散系数11.一般认为,基尼系数在()之间是比较恰当的。
A.0.1— —0.4 C.— —0..812.一般认为,基尼系数等于( )是收入分配不公平的警戒线。
A.0.2B.0.6C. 利用公式计算众数的基本假定之一是众数组的频数在该组内呈( )A.正态分布 分布 C.均匀分布 D.偏态分布14.计算中位数时,假定中位数所在组的频数在该组内呈( )A.左偏分布B.正态分布C.右偏分布D.均匀分布15.反映数据分布集中趋势的最主要的测度值是( )A.众数B.中位数C.均值D.几何平均数16.各个变量值与均值的离差之和( )A.大于0B.小于0C.等于0D.等于一个不为0的常数17.各个变量值与均值的离差平方和( )A.为最大B.为最小C.为0D.为一个不为0的常数18.下列中,专门用来衡量众数代表性大小的离散程度测度值是( )A.异众比率B.四分位差C.方差或标准差D.极差19.下列中,专门用来衡量中位数代表性大小的离散程度测度值是( )A.方差和标准差B.内距C.异众比率D.平均差20.下列中,适用于列名数据的集中趋势测度值是( )A.众数B.中位数C.均值D.几何均值21.描述数据离散程度最简单的测度值是( )A.平均差B.方差和标准差C.极差D.四分位差22.经验法则表明,当一组数据呈对称分布时,大约有95%的数据在( )范围之内。
第二章数据描述
值的影响。因此,它不能准确地描述数据的分散程度。
【例题 2.14】在反映各变量值离散趋势的变异指标中,只与变量极端标志值有关的指标是( )。
(4)用哪个值代表一组数据 平均数的主要缺点是更容易受少数极端数值的影响,对于严重偏态分布的数据,平均数的代表性较 差。 中位数和众数的优点是不受极端值的影响,具有统计上的稳健性,当数据为偏态分布,特别是偏斜 程度较大时,可以考虑选择中位数和众数,这时它们的代表性要比平均数好。
【例题 2.12】在各种平均指标中,不受极端值影响的平均指标有( )。[2009 年中级真题] A.算数平均数 B.调和平均数 C.中位数 D.几何平均数 E.众数 【答案】CE
3
述。
【例题 2.8】为描述身高与体重之间是否有某种关系,适合采用的图形是( )。
A.直方图
B.条形图
C.散点图
D.环形图
【答案】C
【解析】散点图来反映两个变量的关系。题中只有两个变量,即身高和体重,因此可用散点图来描
【例题 2.9】下列各项中,即适用于定性数据,又适用于定量数据的图形表示方法有( )。
【例题 2.5】某管理局对其所属的企业的生产计划完成百分比采用如下分组,其中最能反映事物本质 差异的分组是( )。[2007 年中级真题]
A.80~89%,90~99%,100~109%,110%以上 B.80%以下,80~100%,100%以上 C.80%以下,80~90%,90~100%,100%~110%,110%以上 D.85%以下,85~95%,95~105%,105%以上 【答案】C 2.确定组距 组距:指每个组变量值中的最大值与最小值之差。若将最大值称为上限,最小值称为下限,则组距 等于上限与下限之差,即 组距=上限-下限 第一组的下限应小于最小值,最后一组的上限应高于最大值。 在确定组距时,一般应当掌握以下原则: (1)要考虑各组的划分是否能区分总体内部各个组成部分的性质差别 如果不能正确反映各部分质的差异,必须重新分组。例如,按学生百分制成绩分组,必须要有 60 分 的组限,否则不能反映是否及格的本质区别。 (2)要能准确地清晰地反映总体单位的分布特征 在确定组距时,在研究的现象变动比较均匀的情况下,可以采用等距分组;而当研究的现象变动很 不均匀时,则一般采用不等距分组。
第二章期末复习总结与习题 统计数据的描述
第二章统计数据的描述统计整理:是根据统计研究任务的要求,对调查所搜集到的原始资料进行审核、分组、汇总、编表,使其条理化、系统化的工作过程。
统计整理的内容:审核、分组、汇总、编表数据整理的原则:目的性、联系性、简明性2.1.1统计分组一、统计分组:根据研究任务的要求和现象总体的内在特点,把统计总体按照某一标志划分为若干性质不同又有联系的几个部分。
基本要求组内的单位性质相同组间的单位性质相异二、统计分组种类类型分组的目的是划分现象类型,结构分类的目的是研究同质总体的构成,分析分组的目的是研究现象总体内部诸标志间的依从和制约关系。
简单分组是将总体按一个标志进行分组,复合分组是将总体按两个或两个以上的标志重叠起来进行分组。
品质分组是将总体按品质标志进行分组,变量分组是将总体按数量标志进行分组三、统计分组方法1、品质分组方法品质分组是将总体按品质标志进行分组.品质标志分组一般较简单,分组标志一旦确定,组数、组名、组与组之间的界限也就确定。
有些复杂的品质标志分组可根据统一规定的划分标准和分类目录进行。
2、数量标志(变量)分组方法按数量标志分组的目的并不是单纯确定各组在数量上的差别,而是要通过数量上的变化来区分各组的不同类型和性质。
变量分组方法从以下几个方面说明:(1)单项式分组:以一个变量值代表一组。
如居民家庭按儿童数或人口数分组,这种分组适用于离散性变量且变量值的个数较少情况。
(2)组距式分组:以变量值变动的一个区间作为一组,并且把区间的距离称为组距。
这种分组适用于连续型变量,也适用于离散型变量的变量值个数较多的情况。
组距式分组步骤: 第一步、将原始资料排序并计算全距R第二步、确定组数第三步、确定组距(max-min)/K第四步、确定组限第五步、整理成表全距R =最大值—最小值组距i = 每组中最大变量值与最小变量值之间的距离或差数。
组限= 各组最大的变量值称为上限,最小的变量值称为下限,确定组限的方法有两种:间断式确定组限和重叠式确定组限。
统计数据的描述
第二章统计数据的描述在对一组统计数据的分布变化进行深入研究之前,我们首先研究一组数据的特征。
为了比较精确地描述一组统计资料的特征,需要使用一些统计指标来描述它。
一组数据的统计特征通常包括以下四个方面:1、集中趋势,也称作中心位置。
即表示一组数据的中心位置的数据点是在什么地方,也就是数据位置的度量。
2、离散性。
即一组数据的分散程度,也就是数据散布的范围。
3、倾斜度。
一组数据所描述的曲线既可以是左右对称的,也可能是倾斜的,即通过曲线最高点的垂线把曲线分为两半,是左右对称还是并不对称。
4、尖削度。
这就是一组数据所描绘的曲线顶部的峰态特征。
根据一组数据所描绘的曲线顶部既可能是尖峰状的,也可能是扁平状的。
即使根据两组数据所描绘的曲线具有相同的中心位置和离散程度,但它们的尖削度也可能是不一样的。
在管理科学中,我们最感兴趣的常常是数据的集中趋势和离散程度,本章就主要介绍度量这两个特征的统计量。
第一节数据集中趋势的度量一组数据的集中趋势通常用平均数、中位数和众数等来表示。
这些统计量均称为平均指标。
它表明同类社会经济现象的各单位的某一数量指标在一定时间、地点等条件下达到的平均水平。
平均指标的特点是将一组数据中各个数据之间的差异抽象化,用一个指标来代表各个数据的一般水平,它反映了一组数据中各个数据的典型水平、中心位置或集中趋势。
一、平均数管理统计中常用的平均数有算术平均数、调和平均数和几何平均数等几种。
但这里我们主要介绍算术平均数。
算术平均数又称均值,常用x来表示。
根据计算方法的不同,算术平均数又可分为简单算术平均数和加权算术平均数。
1、简单算术平均数简单算术平均数的计算公式如下:xx x xNxNNiiN =+++==∑121式中:N 是数据的个数;2122x i 是各数据的观察值。
2、加权算术平均数如一组数据是已经经过分组的,共有N 组。
x i 为各相应组中数据的观察值或每一组的中心值,f i 是观察值为x i 的相应组中数据出现的次数,又称为频率,则可以采用加权平均法来计算其均值,其公式为x x f x f x f f f f xf fN NNiii Nii N =++++++===∑∑11221211式中:x i 是各相应组中数据的观察值;f i 是观察值为x i 的相应组中数据出现的次数,又称为频率; N 是组数。
统计学简答题参考答案
统计学简答题参考答案第一章绪论1.什么是统计学?怎样理解统计学与统计数据的关系?答:统计学是一门收集、整理、显示和分析统计数据的科学。
统计学与统计数据存在密切关系,统计学阐述的统计方法来源于对统计数据的研究,目的也在于对统计数据的研究,离开了统计数据,统计方法以致于统计学就失去了其存在意义。
2.简要说明统计数据的来源。
答:统计数据来源于两个方面:直接的数据:源于直接组织的调查、观察和科学实验,在社会经济管理领域,主要通过统计调查方式来获得,如普查和抽样调查。
间接的数据:从报纸、图书杂志、统计年鉴、网络等渠道获得。
3.简要说明抽样误差和非抽样误差。
答:统计调查误差可分为非抽样误差和抽样误差。
非抽样误差是由于调查过程中各环节工作失误造成的,从理论上看,这类误差是可以避免的。
抽样误差是利用样本推断总体时所产生的误差,它是不可避免的,但可以控制的。
4.解释描述统计和推断统计的概念?(P5)答:描述统计是用图形、表格和概括性的数字对数据进行描述的统计方法。
推断统计是根据样本信息对总体进行估计、假设检验、预测或其他推断的统计方法。
第二章统计数据的描述1描述次数分配表的编制过程。
答:分二个步骤:(1)按照统计研究的目的,将数据按分组标志进行分组。
按品质标志进行分组时,可将其每个具体的表现作为一个组,或者几个表现合并成一个组,这取决于分组的粗细。
按数量标志进行分组,可分为单项式分组与组距式分组单项式分组将每个变量值作为一个组;组距式分组将变量的取值范围(区间)作为一个组。
统计分组应遵循“不重不漏”原则(2)将数据分配到各个组,统计各组的次数,编制次数分配表。
2. 一组数据的分布特征可以从哪几个方面进行测度?答:数据分布特征一般可从集中趋势、离散程度、偏态和峰度几方面来测度。
常用的指标有均值、中位数、众数、极差、方差、标准差、离散系数、偏态系数和峰度系数。
3.怎样理解均值在统计中的地位?答:均值是对所有数据平均后计算的一般水平的代表值,数据信息提取得最充分,具有良好的数学性质,是数据误差相互抵消后的客观事物必然性数量特征的一种反映,在统计推断中显示出优良特性,由此均值在统计中起到非常重要的基础地位。
- 1、下载文档前请自行甄别文档内容的完整性,平台不提供额外的编辑、内容补充、找答案等附加服务。
- 2、"仅部分预览"的文档,不可在线预览部分如存在完整性等问题,可反馈申请退款(可完整预览的文档不适用该条件!)。
- 3、如文档侵犯您的权益,请联系客服反馈,我们会尽快为您处理(人工客服工作时间:9:00-18:30)。
某车间工人周加工零件直方图
我一眼就看 出来了,周 加工零件在 100 ~ 110 之 间的人数最 多!
次 数 (单 位 : 人 )
12
8
4
0
80
90Biblioteka 100110120
130
周加工零件数
2011 2 12
件
数
的
1. 折线图也称次数多边形图。 折线图也称次数多边形图。 2. 是在直方图的基础上,把直方图顶部的中点 (组 是在直方图的基础上, 中值) 用直线连接起来, 中值) 用直线连接起来,再把原来的直方图抹掉 3. 折线图的两个终点要与横轴相交,具体的做法是 折线图的两个终点要与横轴相交,
2011年 2011年2月12日星期六 12日星期六
第二章 统计数据的描述
例:以前面例题中数据分组结果为例,来绘制直方图
据周加工零 件个数分组 人数
80~90 90~100 100~110 110~120 120~130 3 7 13 5 2
2011年 2011年2月12日星期六 12日星期六
第二章 统计数据的描述
– 第一个矩形的顶部中点通过竖边中点( 第一个矩形的顶部中点通过竖边中点 ( 即该组频数 一半的位置)连接到横轴, 一半的位置 ) 连接到横轴, 最后一个矩形顶部中点 与其竖边中点连接到横轴 折线图下所围成的面积与直方图的面积相等, 折线图下所围成的面积与直方图的面积相等, 二者 所表示的频数分布是一致的
f m − f −1 Mo ≈ L + ×i ( f m − f − 1 ) + ( f m − f +1 )
式中:M 式中:Mo表示众数 • • L表示众数所在组的下限; i表示众数所在组的组距; fm为众数组的频数; f-1为众数前一组的频数; f+1为众数后一组的频数;
第二章 统计数据的描述
2011年 2011年2月12日星期六 12日星期六
二、个数
不存在:没有明显的集中趋势或最高峰点 不存在: 有一个:一般的正态分布或偏态分布 有一个: 有两个或多个:有两个或多个高峰点或集中趋势 有两个或多个:
2011年 2011年2月12日星期六 12日星期六
无众数
一个众数
两个众数 第二章 统计数据的描述
三、计算 对于分组数据,可以用下面的近似公式计算: 对于分组数据,可以用下面的近似公式计算:
组中值 =
2011年 2011年2月12日星期六 12日星期六
下限值+ 下限值+上限值 2
第二章 统计数据的描述
按零件加 工数分组 80~90 90~100 100~110 110~120 120~130 合计
2011年 2011年2月12日星期六 12日星期六
向下累积 人数 人数 3 7 13 5 2 30 3 10 23 28 30 — 频率 10% 33.33% 76.67% 93.33% 100% —
13 − 7 6 M o ≈ 100 + × 10=100+ × 10=104.2857 (13 − 7) + (13 − 5) 14
2011年 2011年2月12日星期六 12日星期六
第二章 统计数据的描述
四、公式中的假设
假定数据具有明显的集中趋势 假定众数所在组与相邻的上下组次数之差反映了偏态 分布陡峭上升而缓慢下降的特点 利用线形插值计算众数
累 积 的 收 入 百 分 比
2011年 2011年2月12日星期六 12日星期六
绝对公平线
A B
第二章 统计数据的描述 累积的人口百分比
1.
20 世纪初意大利经济学家基尼 世纪初意大利经济学家基尼(G.Gini)根据洛伦茨曲线给出了 根据洛伦茨曲线给出了 衡收入分配平均程度的指标
A 基尼系数= A+ B
2011年 2011年2月12日星期六 12日星期六
☺ ☺~☺ ☺~☺ ☺~☺ 第二章 统计数据的描述 ☺~☺
次数分配
将数据按其分组标志进行分组的过程,就是次 数分配形成的过程。次数分配就是观察值按其 分组标志分配在各组内的次数。
☞
【例】某车 间 30 名工人 每周加工某 种零件件数 如右表试对 数据进行分 组。
80~90 90~100 100~110 110~120 120~130
2011年 2011年2月12日星期六 12日星期六
第二章 统计数据的描述
四、注意事项 分组时要遵循“ 分组时要遵循 “ 不重不 漏”的原则 即每个数据必须属于而 且只能属于一组 每组数据“ 每组数据 “ 含下限不含 上限” 上限” 按零件加工数分组 人数 80~90 90~100 100~110 110~120 120~130 合计
据周加工零 件个数分组 人数
80~90 90~100 100~110 110~120 120~130 3 7 13 5 2
f m − f −1 Mo ≈ L + ×i ( f m − f −1 ) + ( f m − f +1 )
解:L=100; i=10; fm=13; f-1=7; f+1=5;则
2011年 2011年2月12日星期六 12日星期六
第二章 统计数据的描述
2.1 统计数据的整理 2.2 分布集中趋势的测度 2.3 分布离散程度的测度 2.4 分布偏态与峰度的测度 2.5 统计表与统计图 本章小结
2011年 2011年2月12日星期六 12日星期六
第二章 统计数据的描述
掌握数值型数据的整理方法 掌握数据集中趋势 掌握离散程度的测度方法 掌握分布偏态与峰度的测度方法 掌握茎叶图和箱线图的制作方法
单位: 单位:件
96 106 119 97 106 121 99 106 128
2011年 2011年2月12日星期六 12日星期六
第二章 统计数据的描述
二、确定组数: 确定组数: 组数的确定应以能够显示数据的分布特征和 规律为目的。 规律为目的。 同时,组数太少,反映不出数据的规律性; 同时,组数太少,反映不出数据的规律性; 组数太多,反映出来的都是偶然性。 组数太多,反映出来的都是偶然性。 一般情况下, 组为宜。 一般情况下,组数应以 5-15 组为宜。 在实际分组时, 在实际分组时,可以按 Sturges 提出的经 验公式来确定组数( 验公式来确定组数 ( 其中 n 是数据的个 数)。
工人 编号 1 2 3 4 5 6 7 8 9 10
2011年 2011年2月12日星期六 12日星期六
周加工 零件数 106 84 110 91 109 91 111 107 121 105
工人 编号 11 12 13 14 15 16 17 18 19 20
周加工 零件数 99 94 119 88 118 97 103 106 95 106
五、应用
众数是一种位置代表值,它的应用场合有限。 众数是一种位置代表值,它的应用场合有限。例如在农贸 市场上,某种商品的价格常以众数值为代表。 市场上,某种商品的价格常以众数值为代表。
2011年 2011年2月12日星期六 12日星期六
2. 3. 4. 5. 6. 7.
A表示实际收入曲线与绝对平均线之间的面积 表示实际收入曲线与绝对平均线之间的面积 B 表示实际收入曲线与绝对不平均线之间的面积 如果A=0,则基尼系数 ,表示收入绝对平均 如果 ,则基尼系数=0, A 如果 B=0,则基尼系数 ,表示收入绝对不平均 ,则基尼系数=1, B 基尼系数在 0 和 1 之间取值 一般认为, 一般认为 , 基尼系数若小于 0.2,表明分配平均; 基尼系数在 , 表明分配平均; 0.2 至 0.4 之间是比较适当的,即一个社会既有效率又没有造 之间是比较适当的, 成极大的分配不公; 成极大的分配不公;基尼系数在 0.4 被认为是收入分配不公平 的警戒线,超过了 0.4 应该采取措施缩小这一差距。 的警戒线, 应该采取措施缩小这一差距统计数据的描述 第二章 。 2011年 2011年2月12日星期六 12日星期六
向上累积 人数 30 27 20 7 2 — 频率 100% 90% 66.67% 23.33% 6.67% —
第二章 统计数据的描述
次数分配直方图
Excel
1. 用直观的图形描述数据的分布形状和特征 2. 在直角坐标中 , 用横轴表示数据分组 , 纵 在直角坐标中,用横轴表示数据分组, 轴表示频数或频率, 轴表示频数或频率 , 各组与相应的频数就 形成了一个矩形, 形成了一个矩形,即直方图 3. 直方图与条形图的区别: 直方图与条形图的区别: 直方图中的矩形是相连的, 直方图中的矩形是相连的 , 而条形图中的 矩形有一定的间隔。 矩形有一定的间隔。
lg( n ) K =1+ lg(2)
2011年 2011年2月12日星期六 12日星期六
☺~☺ ☺~☺ ☺~☺ ☺~☺ ☺~☺
第二章 统计数据的描述
三、确定组距: 确定组距:
班级宽度) 组距 (班级宽度 是一个组的上限与下限之 班级宽度 差,可根据全部数据的最大值和最小值及所 分的组数来确定,即 分的组数来确定, 组距= 最小值)÷ 组距=( 最大值 - 最小值 ÷ 组数 组距不一定相等 如我国工薪阶层税收的征收比例; 如我国工薪阶层税收的征收比例; 销售人员的销售提成等。 销售人员的销售提成等。 但在做作业时组距要相等
2.2 分布集中趋势的测度
☞一、众数 ☞二、中位数 ☞三、四分位数 ☞四、均值 五、几何均值 六、切尾均值 ☞七、众数、中位数和均值的比较
众数
一、定义
众数是将数据按大小顺序排队形成次数分配后, 众数是将数据按大小顺序排队形成次数分配后,在统计 分布中具有明显集中趋势点的数值, 分布中具有明显集中趋势点的数值,是数据一般水平的 代表性的一种,常用M 表示。 代表性的一种,常用Mo表示。
2011年 2011年2月12日星期六 12日星期六