概率论与数理统计7.3区间估计
概率论与数理统计复习7章
( n − 1) S 2 ( n − 1) S 2 = 1 − α 即P 2 <σ2 < 2 χα 2 ( n − 1) χ1−α 2 ( n − 1) ( n − 1) S 2 ( n − 1) S 2 置信区间为: 2 , χα 2 ( n − 1) χ12−α 2 ( n − 1)
则有:E ( X v ) = µv (θ1 , θ 2 ,⋯ , θ k ) 其v阶样本矩是:Av = 1 ∑ X iv n i =1
n
估计的未知参数,假定总体X 的k阶原点矩E ( X k ) 存在,
µ θ , θ ,⋯ , θ = A k 1 1 1 2 µ2 θ1, θ 2 ,⋯ , θ k = A2 用样本矩作为总体矩的估计,即令: ⋮ µ θ , θ ,⋯ , θ = A k k k 1 2 ɵ ɵ ˆ 解此方程即得 (θ1 , θ 2 ,⋯ , θ k )的一个矩估计量 θ 1 , θ 2 ,⋯ , θ k
+∞
−∞
xf ( x ) dx = ∫ θ x θ dx =
1 0
令E ( X ) = X ⇒
θ +1
θ
ˆ = X ⇒θ =
( )
X 1− X
θ +1
2
θ
7.2极大似然估计法
极大似然估计法: 设总体X 的概率密度为f ( x,θ ) (或分布率p( x,θ )),θ = (θ1 ,θ 2 ,⋯ ,θ k ) 为 未知参数,θ ∈ Θ, Θ为参数空间,即θ的取值范围。设 ( x1 , x2 ,⋯ , xn ) 是 样本 ( X 1 , X 2 ,⋯ , X n )的一个观察值:
i =1 n
概率论与数理统计第7章参数估计PPT课件
a1(1, ,k )=v1
1 f1(v1, ,vk )
假定方程组a2(1, ,k ) v2 ,则可求出2 f2(v1, ,vk )
ak (1, ,k ) vk
k fk (v1, ,vk )
则x1 xn为X的样本值时,可用样本值的j阶原点矩Aj估计vj,其中
Aj
1 n
n i1
xij ( j
L(x1, ,xn;ˆ)maxL(x1, ,xn;),则称ˆ(x1, ,xn)为
的一种参数估计方法 .
它首先是由德国数学家
高斯在1821年提出的 ,然而, 这个方法常归功于英国统
Gauss
计学家费歇(Fisher) . 费歇在1922年重新发现了
这一方法,并首先研究了这
种方法的一些性质 .
Fisher
10
极大似然估计是在已知总体分布形式的情形下的 点估计。
极大似然估计的基本思路:根据样本的具体情况
注:估计量为样本的函数,样本不同,估计量不 同。
常用估计量构造法:矩估计法、极大似然估计法。
4
7.1.1 矩估计法
矩估计法是通过参数与总体矩的关系,解出参数, 并用样本矩替代总体矩而得到的参数估计方法。 (由大数定理可知样本矩依概率收敛于总体矩, 且许多分布所含参数都是矩的函数)
下面我们考虑总体为连续型随机变量的情况:
n
它是的函数,记为L(x1, , xn; ) f (xi , ), i 1
并称其为似然函数,记为L( )。
注:似然函数的概念并不仅限于连续随机变量 ,
对于离散型随机变量,用 P {Xx}p(x,)
替代f ( x, )
即可。
14
设总体X的分布形式已知,且只含一个未知参数,
概率论与数理统计应用_参数估计_
第7章 参数估计
7.2 估计量的评选标准
授课教师:李林杉 副教授
估计量的评选标准
由前面的学习知道, 对于同一个参数,用不同的估计方法求出的估计量可能不相同,对 不同的样本值也会得到不同的估计值,原则上任何统计量都可以作为未知参数的估计量.
问题 (1)对于同一个参数究竟采用哪一个估计量好? (2)评价估计量的标准是什么?
D(1 6
X1
5 6
X
3)
1 36
D
X1
25 36
D
X
2
13 ቤተ መጻሕፍቲ ባይዱ8
因为 13 18
5 ,所以估计量 9
ˆ1
2 3
X1
1 3
X 2 更有效.
估计量的评选标准
三、相合性
我们不仅希望一个估计量是无偏的,并且具有较小的方差,还希望当样本容量n 增大时,估计量能充分地接近于未知参数的真值, 因此就引出相合性(一致性)的 评价标准.
解
的矩估计量和极大似然估计量都是 X
1 n
n i 1
Xi
.
的估计值都是 ˆ x 1200
估计值与真值的误差?(精度) 点估计可信程度有多大?(可信度)
区间估计
二、置信区间
定义 设总体X 的分布函数F(x,θ)含有一个未知参数θ. X1, X 2, , X n 为总体的样本, 对于给定值α( 0<α<1), 若能确定两个统计量
( X1, X 2, , X n ), ( X1, X 2, , X n ) 满足: P{ } 1
则称随机区间 , 是θ 的置信度为1 的置信区间,
——置信下限, ——置信上限, 置信度1 ——称为置信水平.
第七章7-3概率论与数理统计
3.以该区间内任一值作为的近似值,
误差不大于
s
6.2022
n t 2(n 1)=
2.1315 2=6.61 16
9
2 方差 2的置信区间 只讨论均值未知情形
由于
(n 1)S2 2
~
2(n 1)
取 (n 1)S2 作为枢轴量
2
对给定的置信水平1 ,确定分位数
2 1
2(n 1) , 2 2(n 1) ,
§4 正态总体均值与方差的区间估计
一 单个总体N (, 2 )的情形 设已给定置信水平为1-,并设
X1, X 2,L ,X n为总体N (, 2 )的样本,
X 和S 2分别是样本均值和方差.
1
1 均值的置信区间
(1) 2已知,均值的置信水平为1-
的置信区间为
简记为
X
n
z 2 ,
X
n
z
2
X
n
试求总体均值 的置信水平为0.95的
置信区间
6
解:这是单总体方差未知,总体均值 的区间估计问题.
均值 的置信水平为 1的置信区间为
s
s
x
n t 2(n 1), x
n
t
2(n1) 这里 1 0.95, / 2 0.025, n 1 15,
t / 2 (n 1) t0.025 (15) 2.1315
S
11 n1 n2
18
从而可得,在
12
2 2
2,但 2未知,
均值差1 2的置信水平为1-的置信区间
X Y t /2 (n1 n2 2)S
其中
1 n1
1 n2
S2
(n1
1)S12 (n2 1)S22 n1 n2 2
概率论——区间估计
概率与 概率与统计
第十九讲 区间估计
主讲教师: 主讲教师: 于红香 e-mail:fishr2001@
概率论与数理统计
第四节
区间估计
学习要求
理解区间估计的概念 会求单个正态总体的均值和方差的置信区间 会求两个正态总体的均值差和方差比的置信区间
对于概念和理论方面的内容,从高到低分别用 “理解”、“了解”、“知道”三级来表述; 对于方法,运算和能力方面的内容,从高到低分别用 “熟练掌握”、“掌握”、“能”(或“会”)三级来 表述。
N( µ, σ2 )的情况 单个总体
2 2 N( µ1, σ1 ),N( µ2 , σ2 )的情况 两个总体
课堂练习 小结 布置作业
概率论与数理统计
一、单个总体 N( µ, σ ) 的情况
2
X
N( µ, σ2 ),并设 X1,K, Xn 为来自总体的
样本 , X, S2 分别为样本均值和样本方差 .
的置信水平( 则称区间 ( θ,θ ) 是 θ 的置信水平(置信度 )为1−α 为 置信区间 的置信区间.
θ 和 θ 分别称为置信下限和置信上限 分别称为置信下限 置信上限. 置信下限和
概率论与数理统计
1. 要求 θ 以很大的可能被包含在区间( θ,θ ) 内,就是说,概率 P{θ < θ < θ} 要尽可能大 . 就是说, 即要求估计尽量可靠. 即要求估计尽量可靠 2. 估计的精度要尽可能的高 如要求区间长度 估计的精度要尽可能的高. 尽可能短,或能体现该要求的其它准则. θ − θ 尽可能短,或能体现该要求的其它准则 可靠度与精度是一对矛盾, 可靠度与精度是一对矛盾,一般是 在保证可靠度的条件下尽可能提高 精度. 精度
《概率论与数理统计》7
未知参数 , ,, 的函数.分别令
12
k
L(1,,k ) 0,(i 1,2,...,k)
或令
i
ln L(1,,k ) 0,(i 1,2,...,k)
i
由此方程组可解得参数 i 的极大似然估计值 ˆi.
例5 设X~b(1,p), X1, X2 , …,Xn是来自X的一个样本,
求参数 p 的最大似然估计量.
解 E( X ) ,E( X 2 ) D( X ) [E( X )]2 2 2
由矩估计法,
【注】
X
1
n
n i 1
X
2 i
2
2
ˆ X ,
ˆ
2
1 n
n i 1
(Xi
X )2
对任何总体,总体均值与方差的矩估计量都不变.
➢常见分布的参数矩估计量
(1)若总体X~b(1, p), 则未知参数 p 的矩估计量为
7-1
第七章
参数估计
统计 推断
的 基本 问题
7-2
参数估 计问题
(第七章)
点估计 区间估 计
假设检 验问题 (第八章)
什么是参数估计?
参数是刻画总体某方面概率特性的数量.
当此数量未知时,从总体抽出一个样本, 用某种方法对这个未知参数进行估计就 是参数估计.
例如,X ~N ( , 2),
若, 2未知, 通过构造样本的函数, 给出
k = k(A1, A2 , …, A k)
用i 作为i的估计量------矩估计量.
例1 设总体X服从[a,b]上的均匀分布,a,b未知,
X1, X2 , …,Xn为来自总体X的样本,试求a,b的 矩估计量.
解 E(X ) a b , D(X ) (b a)2
中国矿业大学周圣武概率论与数理统计_图文
定义2 设 都是参数θ的无偏估计量,若有
则称
有效。
例:160页,例7、例8
定义3 设
为参数θ的估计量,
若对于任意θ∈Θ,当
则称
的一致估计量。
例:由大数定律知
一致性说明:对于大样本,由一次抽样得到的估 计量 的值可作θ的近似值
例5 设 X1, X2, …, Xn 是取自总体 X 的一个样本,
⑴ 验证
试求θ的极大似然估计值。 解
极大似然估计的不变性
练习
1.设总体X在
上服从均匀分布,
X1 , X 2 ,L X n是来自X的样本,试求 q 的矩估计量
和最大似然估计.
2.设X1,X2,…Xn是取自总体X的一个样本
其中 >0, 求 的极大似然估计.
课堂练习
P156:5,6
作业
P178:1,2,5,6
Fisher
最大似然法的基本思想:
问题:请推断兔子 是谁打中的?
例6 袋中放有白球和黑球共4个,今进行3次有放回 抽样,每次抽取1个,结果抽得2次白球1次黑球,试 估计袋中白球个数。 解 设袋中白球个数为m,
X为3次抽样中抽得的白球数,则
当袋中白球数m分别为1,2,3时, p对应的值分别为1/4,2/4,3/4, X对应的分布律见下表
中国矿业大学周圣武概率论与数理统计_图文 .ppt
第七章 参数估计
§7.1 点估计 §7.2 估计量的评选标准 §7.3 区间估计 §7.4 单个正态总体参数的区间估计 §7.4 两个正态总体参数的区间估计
统计推断
矩估计 点估计 最大似然估计
参数估计
最小二乘估计
区间估计
参数假设检验
假设检验 非参数假设检验
概率论与数理统计 71 点估计与最大似然估计 优质课件
10
解方程组即得
1 = 1 ( X1 , X2 ,
k = k ( X1 , X2 ,
, Xn), , Xn),
这就是1 ,2 , ,k 的矩估计量 .
11
例1: 设总体 X 在[a , b]上服从均匀分布, a , b 未知 . X1 , X2 , … , Xn 是来自 X 的样本, 求a , b的矩估计量.
5
一、点估计的概念:
1、定义7.1:
设总体 X 的分布函数为 F( x , θ ), 其中θ 为 未知参数 . 从总体 X 中抽取样本 X1 , X2 ,
… , Xn , 其观测值为 x1 , x2 , … , xn .
构造一个统计量 ( X1 , X2 , , Xn ), 用它的 观测值 ( x1 , x2 , , xn ) 来估计参数 , 称
设总体分布已知, 但含有k个未知数1,2 , ,k ,
若总体 X 的前 k 阶矩均存在 , 则可令
E( X rX
r i
,r =1,2,
,k ,
再利用总体 X 分布已知, 具体求出 E( X r ),
当然它是未知参数 1 ,2 , ,k 的函数, 这样
就得到含 k 个未知数和 k 个方程的方程组 ,
1 n
n i 1
Xi =A1称为一阶样本原点矩,
4
,1 n
n i 1
Xik =Ak称为k阶样本原点矩,
样本k阶中心矩:
Sn2 =
1 n
n
(Xi -X )2=B2称为样本二阶中心矩,
i 1
Snk =
1 n
n i 1
(Xi -X )k =
Bk 称为样本k阶中心矩,
概率论和数理统计(第三学期)第7章数理统计的基本概念
n i1
i
1 n
n
Ei
i1
D
D 1 n
n i 1
i
1 n2
n
Di
i 1
2
n
2
S~ 1 n
n i 1
i
2
1 n
n i 1
i2 2i
2
1 n
n
i2
i 1
2
n
i
i 1
n
2
1 n
n
i2
i 1
2
2
2
1 n
n
i2
i 1
2
E S~2
E
1 n
n
i2
i 1
23
.209
2
2 0.95
20
10
.851
当自由度n 45时,可用下面近似公式去求2 n:
x2 n
1 2
u
2
2n 1
例3
求
2 0.05
60 .
解
2 0.05
60
1 2
u0.05
2
2 60 1
1 1.645
2
119 78.798
2
3、t分布的上侧分位点
对于给定的α(0<α<1),使
2
e
xi 2 2
2
(2
) e 2
n 2
1
2 2
n i1
xi 2
在数理统计中,总体的分布往往是未知的,需 要通过样本找到一个分布来近似代替总体分布。
§7.3 分布的估计
频率分布 例 某炼钢厂生产的钢由于各种因素的影响,各炉
钢的含硅量可以看作是一个随机变量,现记录了 120炉钢的含硅量百分数,求出这个样本的频数分 布与频率分布。
7.4单个正态总体均值与方差的区间估计
2
(n 1)S 2
2 1
/
2
(n
1)
1,
P
(n 1)S 2
2
/
2
(n
1)
(n
2 1
/2
1)S 2 (n
1)
1
,
即标准差 的置信水平为1 α 的一个置信区间为
n 1S ,
2 / 2(n 1)
n
2 1 /
1S 2(n
1)
.
11
概率论与数理统计
例2 (续例1) 求例1中总体标准差 的置信度为0.95 的置信区间.
506 508 499 503 504 510 497 512 514 505 493 496 506 502 509 496
设袋装糖果的质量服从正态分布, 试求总体均值
的置信度为 0.95 的置信区间.
(1) 2 38.44; (2) 2未知. 解: 1 0.95, 0.05
6
概率论与数理统计
b
3
概率论与数理统计
由P
z
/
2
X
/
n
z /2
1,
P X
n
z / 2
X
n
z
/
2
1
.
即的一个置信水平为1 的置信区间为
X
n
z / 2 , X
n
z / 2 .
置信区间的长度为
2
n
z / 2 .
4
概率论与数理统计
2 2未知
“枢轴量”
X ~ t(n 1)
1
S/ n
由
P{tα
2(n 1)
X S
概率论与数理统计必考点
进一步可得:
标准差 的一个置信度为 1 的置信区间
是 2 的无偏估计 ,
( n 1) S
2
*2 n
~ 2 ( n 1),
P243
*2 n 1 S 2 n 2 由P /2 n 1 1- /2 n 1 1 2 *2 *2 n 1 S n 1 S n n 有P 2 2 2 1 /2 n 1 1- /2 n 1
2. 求置信区间的一般步骤(共3步) (1) 寻求一个样本 1 , 2 , , n 的函数: Z Z (1 , 2 , , n ; ) 其中仅包含待估参数 , 并且Z的分布已知 且不依赖于任何未知参数(包括 ). (2) 对于给定的置信度1 , 决定出两个常数a, b, 使P{a Z (1 , 2 ,, n ; ) b} 1 .
设给定置信度为1 , 并设 1 , 2 , , n 为
*2 总体 N ( , 2 )的样本, , S n 分别是样本均值和
修正样本方差.
(1) 2 已知,求
的置信区间
的一个置信度为 1 的置信区间 X u1- /2 . n
1. 要求 以很大的可能被包含在区间 ( , ) 内,就是说,概率 P{ } 要尽可能大. 即要求估计尽量可靠. 2. 估计的精度要尽可能的高. 如要求区间 ˆ ˆ 尽可能短,或能体现该要求的其 长度 2 1 它准则. 可靠度与精度是一对矛盾, 一般是在保证可靠度的条件下 尽可能提高精度.
( 3)
未知,求
2
的置信区间
概率论与数理统计PDF版课件7-2
. 的一个合理解释. 但注意,并不要求包含真实值的区
间正好%,只要是大约%就是合理地,比如也可以.
第七章参数估计 §7.2 区间估计
求置信区间的步骤
=
, ⋯ , ,
(1)找一个与未知参数有关的统计量
11 0.248
3.816
第七章参数估计 §7.2 区间估计
注1 上述求解或 的置信区间时,我们选取的点估计
都是矩估计量或者最大似然估计量. 事实上,我们也可以用
贝叶斯估计量来构造置信区间.详细内容参考本章“重要补
充及扩展问题”的第五节(见教材P220)
注2 上述利用枢轴量进行区间估计的时候都要求总体服
从正态分布. 但实际中,我们考虑的总体经常不服从正态分
布. 这种情况下的区间估计采用的是大样本区间估计. 详细
内容参考本章“重要补充及扩展问题”的第六节(见教材
P220)
第七章参数估计 §7.2 区间估计
三、两个正态总体的区间估计
设 , ⋯ , 为来自正态总体 ∼ , 的简单随机
1. 当 和 已知时,求 − 的置信区间
ഥ−
ഥ 作为总体均值差 − 的点估计;
(1)选取样本均值差
X − Y − ( 1 − 2 )
(2)构造枢轴量
~ N ( 0,1) ;
2
2
(
)
1
n1
(3)选取 = − = Τ ;
+
2
n2
(4) − 的 − 的置信区间
.
n
n
2
2
第七章参数估计 §7.2 区间估计
例3( 见教材P213) 假设 轮胎的寿 命服从正 态分布
概率论与数理统计(叶慈南 刘锡平 科学出版社)第7章 参数估计教程
估计 θ ,故称这种估计为点估计.
5 6
,σ 2未知,
… 随机抽查100个婴儿 得100个体重数据 10,7,6,6.5,5,5.2, …
而全部信息就由这100个数组成. 据此,我们应如何估计 和 σ 呢?
我们知道,服从正态分布N ( , σ 2 )的r.v. X , E ( X ) = , 由大数定律, 样本体重的平均值 1 → ∑ X i P n i =1 自然想到把样本体重的平均值作为总体平均 体重的一个估计. X= 用样本体重的均值 X估计 , 类似地,用样本体重的方差 S 2估计 σ 2 . 1 n 1 n 2 X = ∑ Xi, S = ∑ ( X i X )2 n 1 i =1 n i =1
(一)矩估计法
基本思想:用样本矩估计总体矩
(二)最大似然估计法
基本思想:
15
16
最大似然估计法 (最大似然法)
它首先是由德国数学家 高斯在1821年提出的 , 然而,这个方法常归功于 英国统计学家费希尔(Fisher) . 费希尔在1922年重新发现了 这一方法,并首先研究了这 种 方法的一些性质 . Fisher
1. 矩估计法 2. 最大似然法 3. 最小二乘法 4. 贝叶斯方法 ……
(一) 矩估计法(简称"矩法")
它是基于一种简单的"替换"思想 建立起来的一种估计方法 . 英国统计学家 K. 皮尔逊 最早提出的 . 基本思想: 用样本矩估计总体矩 . 理论依据: 大数定律
Ak = 1 n k P ∑ X i → k = E ( X k ) n i =1
4
在参数估计问题中,假定总体分布 形式已知,未知的仅仅是一个或几个 参数.
《概率论与数理统计》第三版_科学出版社_课后习题答案.所有章节
第二章 随机变量 2.12.2解:根据1)(0==∑∞=k k X P ,得10=∑∞=-k kae,即1111=---e ae 。
故 1-=e a2.3解:用X 表示甲在两次投篮中所投中的次数,X~B(2,0.7) 用Y 表示乙在两次投篮中所投中的次数, Y~B(2,0.4) (1) 两人投中的次数相同P{X=Y}= P{X=0,Y=0}+ P{X=1,Y=1} +P{X=2,Y=2}=11220202111120202222220.70.30.40.60.70.30.40.60.70.30.40.60.3124C C C C C C ⨯+⨯+⨯=(2)甲比乙投中的次数多P{X >Y}= P{X=1,Y=0}+ P{X=2,Y=0} +P{X=2,Y=1}=12211102200220112222220.70.30.40.60.70.30.40.60.70.30.40.60.5628C C C C C C ⨯+⨯+⨯=2.4解:(1)P{1≤X ≤3}= P{X=1}+ P{X=2}+ P{X=3}=12321515155++= (2) P{0.5<X<2.5}=P{X=1}+ P{X=2}=12115155+= 2.5解:(1)P{X=2,4,6,…}=246211112222k +++ =11[1()]1441314k k lim →∞-=-(2)P{X ≥3}=1―P{X <3}=1―P{X=1}- P{X=2}=1111244--= 2.6解:(1)设X 表示4次独立试验中A 发生的次数,则X~B(4,0.4)34314044(3)(3)(4)0.40.60.40.60.1792P X P X P X C C ≥==+==+=X 2 3 4 5 6 7 8 9 10 11 12P 1/36 1/18 1/12 1/9 5/36 1/6 5/36 1/9 1/12 1/18 1/36(2)设Y 表示5次独立试验中A 发生的次数,则Y~B(5,0.4)345324150555(3)(3)(4)(5)0.40.60.40.60.40.60.31744P X P X P X P X C C C ≥==+=+==++=2.7 (1)X ~P(λ)=P(0.5×3)= P(1.5)0 1.51.5{0}0!P X e -=== 1.5e - (2)X ~P(λ)=P(0.5×4)= P(2)0122222{2}1{0}{1}1130!1!P X P X P X e e e ---≥=-=-==--=-2.8解:设应配备m 名设备维修人员。
概率论与数理统计(理工类第四版)吴赣昌主编课后习题答案第七章
写在前面:由于答案是一个个复制到word中,比较耗时耗力,故下载收取5分,希望需要的朋友给予理解和支持!PS:网上有一些没经我同意就将我的答案整合、转换成pdf,放在文库里的,虽然是免费的,但是窃取了我的劳动成果,希望有心的朋友支持我一下,下载我的原版答案。
第七章假设检验7.1 假设检验的基本概念习题1样本容量n确定后,在一个假设检验中,给定显著水平为α,设此第二类错误的概率为β,则必有(). (A)α+β=1;(B)α+β>1;(C)α+β<1;(D)α+β<2.解答:应选(D).当样本容量n确定后,α,β不能同时都很小,即α变小时,β变大;而β变小时,α变大.理论上,自然希望犯这两类错误的概率都很小,但α,β的大小关系不能确定,并且这两类错误不能同时发生,即α=1且β=1不会发生,故选(D).习题2设总体X∼N(μ,σ2),其中σ2已知,若要检验μ,需用统计量U=X¯-μ0σ/n.(1)若对单边检验,统计假设为H0:μ=μ0(μ0已知),H1:μ>μ0,则拒绝区间为;(2)若单边假设为H0:μ=μ0,H1:μ<μ0,则拒绝区间为(给定显著性水平为α,样本均值为X¯,样本容量为n,且可记u1-α为标准正态分布的(1-α)分位数).解答:应填(1)U>u1-α;(2)U<uα.由单侧检验及拒绝的概念即可得到.习题3如何理解假设检验所作出的“拒绝原假设H0”和“接受原假设H0”的判断?解答:拒绝H0是有说服力的,接受H0是没有充分说服力的. 因为假设检验的方法是概率性质的反证法,作为反证法就是必然要“推出矛盾”,才能得出“拒绝H0”的结论,这是有说服力的,如果“推不出矛盾”,这时只能说“目前还找不到拒绝H0的充分理由”,因此“不拒绝H0”或“接受H0”,这并没有肯定H0一定成立. 由于样本观察值是随机的,因此拒绝H0,不意味着H0是假的,接受H0也不意味着H0是真的,都存在着错误决策的可能.当原假设H0为真,而作出了拒绝H0的判断,这类决策错误称为第一类错误,又叫弃真错误,显然犯这类错误的概率为前述的小概率α:α=P(拒绝H0|H0为真);而原假设H0不真,却作出接受H0的判断,称这类错误为第二类错误,又称取伪错误,它发生的概率β为β=P(接受H0|H0不真).习题4犯第一类错误的概率α与犯第二类错误的概率β之间有何关系?解答:一般来说,当样本容量固定时,若减少犯一类错误的概率,则犯另一类错误的概率往往会增大.要它们同时减少,只有增加样本容量n.在实际问题中,总是控制犯第一类错误的概率α而使犯第二类错误的概率尽可能小.α的大小视具体实际问题而定,通常取α=0.05,0.005等值.习题5在假设检验中,如何理解指定的显著水平α?解答:我们希望所作的检验犯两类错误的概率尽可能都小,但实际上这是不可能的. 当样本容量n固定时,一般地,减少犯其中一个错误的概率就会增加犯另一个错误的概率. 因此,通常的作法是只要求犯第一类错误的概率不大于指定的显著水平α,因而根据小概率原理,最终结论为拒绝H0较为可靠,而最终判断力接受H0则不大可靠,其原因是不知道犯第二类错误的概率β究竟有多少,且α小,β就大,所以通常用“H0相容”,“不拒绝H0”等词语来代替“接受H0”,而“不拒绝H0”还包含有再进一步作抽样检验的意思.习题6在假设检验中,如何确定原假设H0和备择假设H1?解答:在实际中,通常把那些需要着重考虑的假设视为原假设H0,而与之对应的假设视为备择假设H1.(1)如果问题是要决定新方案是否比原方案好,往往将原方案取假设,而将新方案取为备择假设;(2)若提出一个假设,检验的目的仅仅是为了判断这个假设是否成立,这时直接取此假设为原假设H0即可.习题7假设检验的基本步骤有哪些?解答:根据反证法的思想和小概率原理,可将假设检验的步骤归纳如下:(1)根据问题的要求,提出原理假设H0和备择假设H1.(2)根据检验对象,构造检验统计量T(X1,X2,⋯,Xn),使当H0为真时,T有确定的分布.(3)由给定的显著水平α,查统计量T所服从的分布表,定出临界值λ,使P(∣T∣>λ)=α,或P(T>λ1)=P(T<λ2)=α/2,从而求出H0的拒绝域:∣T∣>λ或T>λ1,T<λ2.(4)由样本观察值计算统计量T的观察值t.(5)作出判断,将t的值与临界值比较大小作出结论:当t∈拒绝域量时,则拒绝H0,否则,不拒绝H0,即认为在显著水平α下,H0与实际情况差异不显著.习题8假设检验与区间估计有何异同?解答:假设检验与区间估计的提法虽不同,但解决问题的途径是相通的. 参数θ的置信水平为1-α的置信区间对应于双边假设检验在显著性水平α下的接受域;参数θ的置信水平为1-α的单侧置信区对应于单边假设检验在显著性水平α下的接受域.在总体的分布已知的条件下,假设检验与区间估计是从不同的角度回答同一个问题. 假设检验是判别原假设H0是否成立,而区间估计解决的是“多少”(或范围),前者是定性的,后者是定量的.习题9某天开工时,需检验自动包装工作是否正常. 根据以往的经验,其装包的质量在正常情况下服从正态分布N(100,1.52)(单位:kg).现抽测了9包,其质量为:99.3,98.7,100.5,101.2,98.3,99.7,99.5,102.0,100.5.问这天包装机工作是否正常?将这一问题化为假设检验问题. 写出假设检验的步骤(α=0.05).解答:(1)提出假设检验问题H0:μ=100,H1:μ≠100;(2)选取检验统计量U:U=X¯-1001.59,H0成立时, U∼N(0,1);(3)α=0.05,uα/2=1.96,拒绝域W={∣u∣>1.96};(4)x¯≈99.97,∣u∣=0.06.因∣u∣<uα/2=1.96,故接受H0,认为包装机工作正常.习题10设总体X∼N(μ,1),X1,X2,⋯,Xn是取自X的样本. 对于假设检验H0:μ=0,H1:μ≠0,取显著水平α,拒绝域为W={∣u∣>uα/2},其中u=nX¯,求:(1)当H0成立时, 犯第一类错误的概率α0;(2)当H0不成立时(若μ≠0),犯第二类错误的概率β.解答:(1)X∼N(μ,1),X¯∼N(μ,1/n),故nX¯=u∼N(0,1).α0=P{∣u∣>uα/2∣μ=0}=1-P{-uα/2≤u≤uα/2}=1-[Φ(uα/2)-Φ(-uα/2)]=1-[(1-α2)-α2]=α,即犯第一类错误的概率是显著水平α.(2)当H0不成立,即μ≠0时,犯第二类错误的概率为β=P{∣u∣≤uα/2∣E(X)=μ}=P{-uα/2≤u≤uα/2∣E(X)=μ}=P{-uα/2≤nX¯≤uα/2∣E(X)=μ}=P{-uα/2-nμ≤n(X¯-μ)≤uα/2-nμ∣E(X)=μ}=Φ(uα/2-nμ)-Φ(-uα/2-nμ).注1当μ→+∞或μ→-∞时,β→0.由此可见,当实际均值μ偏离原假设较大时,犯第二类错误的概率很小,检验效果较好.注2当μ≠0但接近于0时,β≈1-α.因α很小,故犯第二类错误的概率很大,检验效果较差.7.2 单正态总体的假设检验习题1已知某炼铁厂铁水含碳量服从正态分布N(4.55,0.1082).现在测定了9炉铁水,其平均含碳量为4.484.如果估计方差没有变化,可否认为现在生产的铁水平均含碳量仍为4.55(α=0.05)?解答:本问题是在α=0.05下检验假设H0:μ=4.55,H1:μ≠4.55.由于σ2=0.1082已知,所以可选取统计量U=X¯-4.550.108/9,在H0成立的条件下,U∼N(0,1),且此检验问题的拒绝域为∣U∣=∣X¯-4.550.108/9∣>uα/2,这里u=4.484-4.550.108/9≈-1.833,uα/2=1.96.显然∣u∣=1.833<1.96=uα/2.说明U没有落在拒绝域中,从而接受H0,即认为现在生产之铁水平均含碳量仍为4.55.习题2要求一种元件平均使用寿命不得低于1000小时,生产者从一批这种元件中随机抽取25件,测得其寿命的平均值为950小时. 已知该种元件寿命服从标准差为σ=100小时的正态分布,试在显著性水平α=0.05下确定这批元件是否合格?设总体均值为μ,μ未知,即需检验假设H0:μ≥1000,H1:μ<1000.解答:检验假设H0:μ≥1000,H1:μ<1000.这是单边假设检验问题. 由于方差σ2=0.05,故用u检验法. 对于显著性水平α=0.05,拒绝域为W={X¯-1000σ/n<-uα.查标准正态分布表,得u0.05=1.645.又知n=25,x¯=950,故可计算出x¯-1000σ/n=950-1000100/25=-2.5.因为-2.5<-1.645,故在α=0.05下拒绝H0,认为这批元件不合格.习题3打包机装糖入包,每包标准重为100kg.每天开工后,要检验所装糖包的总体期望值是否合乎标准(100kg).某日开工后,测得9包糖重如下(单位:kg):99.398.7100.5101.298.399.799.5102.1100.5打包机装糖的包得服从正态分布,问该天打包机工作是否正常(α=0.05)?解答:本问题是在α=0.05下检验假设H0:μ=100,H1:μ≠100.由于σ2未知,所以可选取统计量T=X¯-100S/n,在H0成立的条件下,T∼t(n-1),且此检验问题的拒绝域为∣T∣=∣X¯-100S/n∣>tα/2(n-1),这里t=x¯-100s/n≈99.978-1001.2122/9≈-0.0544,t0.025(8)=2.306.显然∣t∣=0.0544<2.306=t0.025(8),即t未落在拒绝域中,从而接受H0,即可以认为该天打包工作正常.习题4机器包装食盐,假设每袋盐的净重服从正态分布,规定每袋标准含量为500g,标准差不得超过10g.某天开工后,随机抽取9袋,测得净重如下(单位:g):497,507,510,475,515,484,488,524,491,试在显著性水平α=0.05下检验假设:H0:μ=500,H1:μ≠500.解答:x¯=499,s≈16.031,n=9,t=(x¯-μ0)sn=499-50016.0319=-0.1871,α=0.05,t0.025(8)=2.306.因∣t∣<t0.025(8),故接受H0,认为该天每袋平均质量可视为500g.习题5从清凉饮料自动售货机,随机抽样36杯,其平均含量为219(mL),标准差为14.2mL,在α=0.05的显著性水平下,试检验假设:H0:μ=μ0=222,H1:μ<μ0=222.解答:设总体X∼N(μ,σ2),X代表自动售货机售出的清凉饮料含量,检验假设H0:μ=μ0=222(mL),H1:μ<222(mL).由α=0.05,n=36,查表得t0.05(36-1)=1.6896,拒绝域为W={t=x¯-μ0s/n<-tα(n-1).计算t值并判断:t=219-22214.2/36≈-1.27>-1.6896,习题6某种导线的电阻服从正态分布N(μ,0.0052).今从新生产的一批导线中抽取9根,测其电阻,得s=0.008Ω,对于α=0.05,能否认为这批导线电阻的标准差仍为0.005?解答:本问题是在α=0.05下检验假设H0:σ2=0.0052,H1:σ2≠0.0052.选取统计量χ2=n-1σ2S2,在H0成立的条件下,χ2∼χ2(n-1),且此检验问题的拒绝域为χ2>χα/22(n-1)或χ2<χ1-α/22(n-1).这里χ2=9-10.0052s2=80.0052×0.0082=20.48,χ0.9752(8)=2.18,χ0.0252(8)=17.5.显然χ2落在拒绝域中,从而拒绝H0,即不能认为这批导线电阻的标准差仍为0.005.习题7某厂生产的铜丝,要求其折断力的方差不超过16N2.今从某日生产的铜丝中随机抽取容量为9的样本,测得其折断力如下(单位:N):289,286,285,286,285,284,285,286,298,292设总体服从正态分布,问该日生产的铜线的折断力的方差是否符合标准(α=0.05)?解答:检验问题为H0:σ2≤16,H1:σ2>16,n=9,s2≈20.3611,χ2=8×s216≈10.181,α=0.05,χ0.052(8)=15.507.因χ2<χ0.052(8)=15.507,故接受H0,可认为铜丝的折断力的方差不超过16N2.习题8过去经验显示,高三学生完成标准考试的时间为一正态变量,其标准差为6min.若随机样本为20位学生,其标准差为s=4.51,试在显著性水平α=0.05下,检验假设:H0:σ≥6,H1:σ<6.解答:H0:σ≥6,H1:σ<6.α=0.05,n-1=19,s=4.51,χ0.952(19)=10.117.拒绝域为W={χ2<10.117}.计算χ2值χ2=(20-1)×4.51262≈10.74.因为10.74>10.117,故接受H0,认为σ≥6.习题9测定某种溶液中的水分,它的10个测定值给出s=0.037%,设测定值总体服从正态分布,σ2为总体方差,σ2未知,试在α=0.05水平下检验假设:H0:σ≥0.04%,H1:σ<0.04%.解答:在α=0.05下,拒绝域为W={(n-1)S2σ02<χ1-α2(9).查χ2分布表得χ0.952(9)=3.325.计算得(n-1)s2σ02=(10-1)×(0.037\per)2(0.04\per)2≈7.7006>3.325,未落入拒绝域,故接受H0.sw=(5-1)×(1.971)2+(4-1)×(1.167)25+4-2≈1.674.查表得t0.005(7)=1.895.算得t=2.86-2.075-01.67415+14≈0.699<1.895.因为0.699<1.895,故不拒绝H0,认为此药无效.习题3据现在的推测,矮个子的人比高个子的人寿命要长一些.下面给出美国31个自然死亡的总统的寿命,将他们分为矮个子与高个子2类,列表如下:矮个子总统8579679080高个子总统6853637088746466606078716790737177725778675663648365假设2个寿命总体均服从正态分布且方差相等,试问这些数据是否符合上述推陈出推测(α=0.05)?解答:设μ1,μ2分别为矮个子与高个子总统的平均寿命,则检验问题为H0:μ1≤μ2,H1:μ1>μ2,n1=5,x¯=80.2,s1≈8.585,n2=26,y¯≈69.15,s2≈9.315,sw=4×8.5852+9.315229≈9.218,n1n2n1+n2≈2.048,t=(80.2-69.15)9.218×2.048≈2.455,α=0.05,t0.05(29)=1.6991,因t>t0.05(29)=1.6991,故拒绝H0,认为矮个子总统的寿命比高个子总统寿命长.习题4在20世纪70年代后期人们发现,酿造啤酒时,在麦芽干燥过程中形成致癌物质亚硝基二甲胺(NDMA).到了20世纪80年代初期,人们开发了一种新的麦芽干燥过程,下面给出了分别在新、老两种过程中形成的NDMA含量(以10亿份中的份数计):故拒绝H0,认为新、老过程中形成的NDMA平均含量差大于2.习题5有两台车床生产同一种型号的滚珠. 根据过去的经验,可以认为这两台车床生产的滚珠的直径都服从正态分布. 现要比较两台车床所生产滚珠的直径的方差,分别抽出8个和9个样品,测得滚珠的直径如下(单位:mm).甲车床xi:15.014.515.215.514.815.115.214.8乙车床yi:15.215.014.815.215.015.014.815.114.8问乙车床产品的方差是否比甲车床的小(α=0.05)?解答:以X,Y分别表示甲,乙二车床产品直径.X∼N(μ1,σ12),Y∼N(μ2,σ22),X,Y独立. 检验假设H0:σ12=σ22,H1:σ22<σ22.用F检验法, 在H0成立时F=S12S22∼F(n1-1,n2-1).由已知数据算得x¯≈15.01,y¯≈14.99,s12≈0.0955,s22≈0.0261,n1=8,n2=9,α=0.05.拒绝域为Rα={F>Fα(n1-1,n2-1)}.查F分布表得F0.05(8-1,9-1)=3.50.计算F值F=s12/s22=0.0955/0.0261≈3.66.因为3.66>3.50,故应否定H0,即认为乙车床产品的直径的方差比甲车床的小.习题6某灯泡厂采用一项新工艺的前后,分别抽取10个灯泡进行寿命试验. 计算得到:采用新工艺前灯泡寿命的样本均值为2460小时. 样本标准差为56小时;采用新工艺后灯泡寿命的样本均值为2550小时,样本标准差为48小时. 设灯泡的寿命服从正态分布,是否可以认为采用新工艺后灯泡的平均寿命有显著提高(α=0.01)?解答:(1)检验假设H0:σ12=σ22,H1:σ12≠σ22.应选取检验统计量F=S12/S22,若H0真, 则F∼F(m-1,n-1);对于给定的检验水平α=0.01,查自由度为(9,9)的F分布表得F0.005(9,9)=6.54;已知m=n=10,s1=56,s2=48,由此得统计量F的观察值为F=562/482≈1.36;因为F<F0.005(9,9),所以接受原假设H0,即可认为这两个总体的方差无显著差异.(2)检验假设H0′:μ1=μ2,H1′:μ1<μ2.按上述关于双总体方差的假设检验的结论知这两个总体的方差未知但相等,σ12=σ22,所以应选取检验统计量:T=X¯-Y¯(m-1)S12+(n-1)S22m+n-2(1m+1n),若H0′真,则T∼t(m+n-2);对给定的检验水平α=0.01,查自由度为m+n-2=18的t分布表得临界值计算t值t=z¯-0sz/n=-0.1-00.141/5≈-1.59>-2.776,故接受H0:μz=0,即在α=0.05下,认为两种分析方法所得的均值结果相同.7.4 关于一般总体数学期望的假设检验习题1设两总体X,Y分别服从泊松分布P(λ1),P(λ2),给定显著性水平α,试设计一个检验统计量,使之能确定检验H0:λ1=λ2,H1:λ1≠λ2的拒绝域,并说明设计的理论依据.解答:因非正态总体,故宜用大样统计,设X¯=1n1∑i=1n1Xi,S12=1n1-1∑i=1n1(Xi-X¯)2;Y¯=1n2∑i=1n2Yi,S22=1n2-1∑i=1n2(Yi-Y¯)2.\because(X¯-Y¯)-(λ1-λ2)S12n1+S22n2→N(0,1)∴可选用样本函数u=(X¯-Y¯)-(λ1-λ2)S12n1+S22n2作为拒绝域的检验统计量.习题2设某段高速公路上汽车限制速度为104.6km/h,现检验n=85辆汽车的样本,测出平均车速为x¯=106.7km/h,已知总体标准差为σ=13.4km/h,但不知总体是否服从正态分布. 在显著性水平α=0.05下,试检验高速公路上的汽车是否比限制速度104.6km/h显著地快?解答:设高速公路上的车速为随机变量X,近似有X∼N(μ,σ2),σ=13.4km/h,要检验假设H0:μ=μ0=104.6,H1:μ>104.6.α=0.05,n=85,uα=u0.05=1.645.拒绝域W={u=x¯-μ0σ/n>uα.由x¯=106.7,σ=13.4,μ0=104.6,n=85得u=106.7-104.613.4/85≈1.44<1.645.因为1.44<1.645,所以接受H0,即要α=0.05显著性水平下,没有明显的证据说明汽车行驶快于限制速度.习题3某药品广告上声称该药品对某种疾病和治愈率为90%,一家医院对该种药品临床使用120例,治愈85人,问该药品广告是否真实(α=0.02)?解答:设该药品对某种疾病的治愈率为p,随机变量X为X={1,临床者使用该药品治愈0,反之则X∼b(1,p),问题该归结为检验假设:H0:p=0.9,H1:p≠0.9.由于n=120足够大,可以用u检验法,所给样值(x1,x2,⋯,x120)中有85个1,35个0,所以x¯=1120∑i=1120xi=1120∑i=1851=85120≈0.71,又p0=0.9,以之代入统计量U得U的观察值为∣u∣=∣0.71-0.9∣0.9×0.1120=6.94>u0.01=2.33,故拒绝H0,即认为该药品不真实.习题4一位中学校长在报纸上看到这样的报道:“这一城市的初中学生平均每周看8小时电视.”她认为她所领导的学校,学生看电视时间明显小于该数字. 为此,她向她的学校的100名初中学生作了调查,得知平均每周看电视的时间x¯=6.5小时,样本标准差为s=2小时,问是否可以认为这位校长的看法是对的(α=0.05)?解答:检验假设H0:μ=8,H1:μ<8.由于n=100,所以T=X¯-μS/n近似服从N(0,1)分布,α=0.05,u0.05=1.645.又知x¯=6.5,s=2,故计算得t=6.5-82/100=-7.5,否定域W={X¯-8S/n<-u0.05.因为-7.5<-1.645,故否定H0,认为这位校长的看法是对的.习题5已知某种电子元件的使用寿命X(h)服从指数分布e(λ),抽查100个元件,得样本均值x¯=950(h),能否认为参数λ=0.001(α=0.05)?解答:由题意知X∼e(λ),E(X)=1/λ,D(X)=1/λ2,故当n充分大时u=x¯-1/λ1nλ=(x¯-1λ)λn=(λx¯-1)n(0,1).现在检验问题为H0:λ=0.001,H1:λ≠0.001,样本值u=(0.001×950-1)×100=0.5,α=0.05,u0.025=1.96.因∣u∣<u0.025=1.96,故接受H0,即可认为参数λ=0.001(即元件平均合适用寿命为1000h).习题6某产品的次品率为0.17,现对此产品进行新工艺试验,从中抽取400检查,发现次品56件,能否认为这项新工艺显著地影响产品质量(α=0.05)?解答:检验问题为H0:p=0.17,H1:p≠0.17,由题意知⌢p=mn=56400=0.14,u=(⌢p-p0)p0q0n=0.14-0.170.17×0.83×400≈-1.597,α=0.05,u0.025=1.96.因∣u∣<u0.025=1.96,故接受H0,即认为新工艺没有显著地影响产品质量.习题7某厂生产了一大批产品,按规定次品率p≤0.05才能出厂,否则不能出厂,现从产品中随机抽查50件,发现有4件次品,问该批产品能否出厂(α=0.05)?解答:问题归结为在α=0.05下,检验假设H0:p≤0.05,H1:p>0.05.这是一个单侧检验问题,用u检验法,H0的拒绝域为U=X¯-p0p0(1-p0)n>uα.已知n=50,p0=0.05,x¯=450=0.08,代入U的表达式得u=0.08-0.050.05×0.9550≈0.97<uα=u0.05=1.645,故接受H0,即认为这批产品可以出厂.习题8从选区A中抽取300名选民的选票,从选区B中抽取200名选民的选票,在这两组选票中,分别有168票和96票支持所提候选人,试在显著水平α=0.05下,检验两个选区之间对候选人的支持是否存在差异. 解答:这是两个比率的比较问题,待检假设为H0:p1=p2,H1:p1≠p2.由题设知n=300,μn=168,m=200,μm=96,p1 =168320=0.56,p2 =96200=0.48,p=μn+μmm+n=264500=0.528.U0∼=p1 -p2 p(1-p)(1n+1m)=0.56-0.480.528×0.472×1120≈1.755,由P{∣U∼∣>1.96}=α=0.05,得拒绝域∣U∼∣>1.96,因为U0∼=1.755<1.96,故接受H0,即两个选区之间无显著差异.7.5 分布拟合检验Ai k概率pi npi频数fi(fi-npi)2(fi-npi)2npiA001/108085250.3125A111/108093169 2.1125A221/108084160.2A331/10807910.0125A441/10807840.05A551/108069121 1.5125A661/108074360.45A771/10807181 1.0125A881/108091121 1.5125A991/108076160.2∑18007.375由于当H0为真时,χ2=∑i=0k(fi-npi)2npi∼χ2(k-1-r),且此检验问题的拒绝域为χ2≥χα2(k-1-r).这里χ2=7.375,查表知χ0.052(10-1-0)=χ0.052(9)=16.9,显然χ2=7.375<16.9=χ0.052(9),即χ2未落在拒绝域中,所以接受H0,即认为这个正20面体是由均匀材料制面的.习题2根据观察到的数据疵点数0 1 2 3 4 5 6频数fi 14 27 26 20 7 3 3检验整批零件上的疵点数是否服从泊松分布(α=0.05).解答:设X表示整批零件上的疵点数,则本问题是在α=0.05下检验假设H0:P{X=i}=λie-λi!,i=0,1,2,⋯.由于在H0中参数λ未具体给出,所以先估计λ的值. 由极大似然估计法得λ =x¯=1100(0×14+1×27+2×26+3×20+4×7+5×3+6×3)=2.将试验的所有可能结果分为7个互不相容的事件A0,A1,⋯,A7, 当H0成立时,P{X=i}有估计值p0=P{X=0}=e-2≈0.135335,p1=P{X=1}=2e-2≈0.27067,p2=P{X=2}=2e2≈0.270671,p3=P{X=3}≈0.180447,p4=P{X=4}=2/3e-2≈0.090224,p5=P{X=5}=4/15e-2≈0.036089, p6=P{X=6}=4/45e-2≈0.0120298. 列表如下:Ai k 概率pi npi 频数fi (fi-npi)2 (fi-npi)2npiA0 A1 A2 A3 A4 A5 A6 0 1 2 3 4 5 6 0.1353350.270671 0.270671 0.180447 0.090224 0.036089 0.0120298 13.5335 27.0671 27.0672 18.0447 9.02243.60891.2029813.83428 14 27 26 2073313 0.2176 0.0045 1.1387 3.8232 0.6960 0.01608 0.000166 0.04207 0.2118740.050310∑1000.3205当H0为真时,χ2=∑i=0k(fi-npi)2npi ∼χ2(k-1-r),且此检验问题的拒绝域为χ2≥χα2(k-1-r), 这里χ2=0.3205, 查表知χ0.052(5-1-1)=χ0.052(3)=7.815. 显然 χ2=0.3205<7.815=χ0.052(3).即χ2未落在拒绝域中,接受H0, 故可认为整批零件上的疵点数服从泊松分布.习题3检查了一本书的100页,记录各页中印刷错误的个数,其结果为错误个数fi123456 ≥7含fi 个错误的页数 36 4019221问能否认为一页的印刷错误个数服从泊松分布(取α=0.05)? 解答:检验假设H0: 一页的印刷错误个数X 服从泊松分布, P{X=i}=λie -λi!,i=0,1,2,⋯.H0 不成立. 先估计未知参数λλ =x¯=1/100(0×36+1×40+2×19+3×2+4×0+5×2+6×1)=1. 在H0成立下p =P{X=i}=(λ )ie -λ i !=e-1i!,i=0,1,2,⋯. 用χ2检验法χ2=∑i=1k(fi -np )2np ∼χ2(k -r-1). 本题中r=1, 其中fi 为频数. H0的拒绝域为 Rα={χ2>χα2(k -r-1)}. 列表计算如下:n=100, 对每个{X=i}计算 p ,np ,fi -np ,(fi -np )2/(np )(i=1,2,⋯,7). 要求每一个np ≥5.计算χ2值χ2=0.0170+0.2801+0.0202+1.1423=1.4596.习题6下表记录了2880个婴儿的出生时刻:试问婴儿的出生时刻是否服从均匀分布U[0,24](显著性水平α=0.05)?解答:原假设H0:F0(x), 由F0(x)算得pi=F0(i)-F0(i-1)=124,npi=2880×124=120 (i=1,2,⋯,24),于是χ2=∑i=124(fi-npi)2npi≈40.47,对α=0.05, 自由度n-1=23, 查χ2-分布表,得χα2(n-1)=35.17,因为χ2=40.47>35.17, 所以拒绝H0, 即可以认为婴儿出生时刻不服从均匀分布U[0,24].总习题解答习题1下面列出的是某工厂随机选取的20只部件的装配时间(min):9.8,10.4,10.6,9.6,9.7,9.9,10.9,11.1,9.6,10.2,10.3,9.6,9.9,11.2,10.6,9.8,10.5,10.1,10.5,9.7.设装配时间的总体服从正态分布N(μ,σ2),μ,σ2均未知,是否可以认为装配时间的均值显著地大于10(取α=0.05)?解答:检验假设H0:μ≤μ0=10,H1:μ>10.已知n=20,α=0.05,由数据算得x¯=10.2,s≈0.5099.因σ2未知,故用t检验法,拒绝域为W={X¯-μ0S/n>tα(n-1).计算得x¯-μ0s/n=10.2-100.5099/20≈1.7541.查t分布表得t0.05(19)=1.7291.因为1.7541>1.7291,故拒绝H0,可以认为装配时间的均值显著地大于10.习题2某地早稻收割根据长势估计平均亩产为310kg,收割时,随机抽取了10块,测出每块的实际亩产量为x1,x2,⋯,x10,计算得x¯=110∑i=110xi=320.如果已知早稻亩产量X服从正态分布N(μ,144),显著性水平α=0.05,试问所估产量是否正确?解答:这是一个正态分布总体,方差已知,对期望的假设检验问题,如果估计正确,则应有μ=310,因此我们先将问题表示成两个假设:①H0:μ=310,H1:μ≠310.接下来就要分析样本值来确定是接受H0,还是接受H1.当H0为真时,统计量②U=X¯-31012/10∼N(0,1),从而有③P{∣U∣>1.96}=0.05,拒绝域为(-∞,-1.96)∪(1.96,+∞).④计算U0=∣320-310∣12/n≈2.64>1.96,即拒绝H0,也就是有理由不相信H0是真的,故认为估产310kg不正确.习题3设某次考试的考生成绩服从正态分布,从中随机地抽取36位考生的成绩,算得平均成绩为66.5分,样本标准差为15分,问在显著水平0.05下,是否可认为这次考试全体考生的平均成绩为70分?并给出检验过程.(1)设这次考试全体考生的平均成绩X∼N(μ,σ2),则待检验假设H0:μ=70,备择假设H1:μ≠70;(2)在H0成立条件下选择统计量T=X¯-μ0S/n∼t(n-1);(3)在显著性水平0.05下,查t分布表,找出临界值tα/2(n-1)=t0.025(35)=2.0301,则拒绝域为(-∞,-2.0301)∪(2.0301,+∞);(4)计算t=∣66.5-70∣15/36=1.4∈(-2.0301,2.0301),故接受H0,因此可认为这次考试全体考生的平均成绩为70分.习题4设有来自正态总体的容量为100的样本,样本均值x¯=2.7,μ,σ2均未知,而∑i=1n(xi-x¯)2=225,在α=0.05水平下,检验下列假设(1)H0:μ=3,H1:μ≠3;(2)H0:σ2=2.5,H1:σ2≠2.5.解答:(1)由题意知n=100,x¯=2.7,s=199×225≈1.508,t=(2.7-3)1.508×100≈-1.9894,α=0.05,t0.025(99)≈t0.025(100)=1.984.因∣t∣=1.9894>t0.025(99)=1.984,故拒绝H0,即认为μ≠3.(2)由题意知χ2=∑i=1n(x1-x¯)22.5=2252.5=90,α=0.05,χ0.0252(99)≈χ0.0252(100)=129.56,χ0.9752(99)≈χ0.9752(100)=74.22,因χ0.9752(99)<χ2=90<χ0.0252(99),故接受H0,即可以认为σ2=2.5.习题5设某大学的男生体重X为正态总体,X∼N(μ,σ2),欲检验假设:H0:μ=68kg,H1:μ>68kg.已知σ=5,取显著性水平α=0.05,若当真正均值为69kg时,犯第二类错误的概率不超过β=0.05,求所需样本大小.解答:由第一类、第二类错误及分位数的定义,易于证明:对于某个给定的δ>0(∣μ-μ0∣≥δ),样本容量n应满足:n≥(uα+uβ)2σ2δ2.因为α=β=0.05,故uα=uβ=1.645,对其对立假设μ=69而言,取δ=1,则n=(uα+uβ)2σ2δ2=(1.645+1.645)2×251≈270.6,故取n=271.某装置的平均工作温度据制造厂家称不高于190∘C.今从一个由16台装置构成的随机样本测得工作温度的平均值和标准差分别为195∘C和8∘C,根据这些数据能否说明平均工作温度比制造厂所说的要高?(设α=0.05,并假设工作温度近似服从正态分布.)解答:设X为工作温度,则X∼N(μ,σ2).①待检假设H0:μ≤190,备择假设H1:μ>190;②在H0成立条件下,选择统计量T=X¯-μ0S/n≈t(n-1);③在显著性水平0.05下,查t分布表,找出临界值tα(n-1)=t0.05(15)=1.75,拒绝域为(1.75,+∞);④计算t=X¯-μ0S/n=195-1908/16=2.5>1.75,所以否定原假设H0,说明平均工作温度比制造厂所说的要高.习题7电工器材厂生产一批保险丝,抽取10根试验其熔断时间,结果为42657578715957685455假设熔断时间服从正态分布,能否认为整批保险丝的熔断时间的方差不大于80(α=0.05)?解答:①待检假设H0:σ2≤80,备择假设H1:σ2>80;②在H0成立时,选取统计量χ2=(n-1)S2σ02∼χ2(n-1);③由α=0.05,n-1=9,查χ2分布表,χα2(n-1)=χ0.052(9)=16.919;④计算样本值:x¯=110(42+65+75+78+71+59+57+68+54+55)=62.4,s2=19∑i=110(xi-x¯)2≈121.8,χ2=9×121.880≈13.7∈(0,16.919).故接受原假设H0即在α=0.05下,可认为整批保险丝的熔断时间的方差不大于80.习题8某系学生可以被允许选修3学分有实验物理课和4学分无实验物理课,11名学生选3学分的课,考试平均分数为85分,标准差为4.7分;17名学生选4学分的课,考试平均分数为79分,标准差为6.1分. 假定两总体近似服从方差相同的正态分布,试在显著性水平α=0.05下检验实验课程是否能使平均分数增加8分?解答:设有实验的课程考分X1∼N(μ1,σ12),无实验的课程考分X2∼N(μ2-σ22).假定σ12=σ22=σ2未知,检验假设H0:μ1-μ2=8,H1:μ1-μ2≠8.由题意知,选用t检验统计量,则拒绝域为W={∣x1¯-x2¯-(μ1-μ2)sw1n1+1n2∣>tα/2(n1+n2-2),其中sw2=(n1-1)s12+(n2-1)s22n1+n2-2.由x1¯=85,x2¯=79,n1=11,n2=17,s1=4.7,s2=6.1,算出sw=(11-1)×4.72+(17-1)×6.1211+17-2≈5.603.从而算出t值为t=85-79-85.603111+117≈-0.92,由α=0.05,查表得t0.025(11+17-2)=t0.025(25)=2.056,因为∣t∣=0.92<2.056,故接受H0,认为μ1-μ2=8.习题9某校从经常参加体育锻炼的男生中随机地选出50名,测得平均身高174.34厘米;从不经常参加体育锻炼的男生中随机地选50名,测得平均身高172.42厘米. 统计资料表明两种男生的身高都服从正态分布,其标准差分别为5.35厘米和6.11厘米,问该校经常参加锻炼的男生是否比不常参加锻炼的男生平均身高要高些(α=0.05)?解答:设X,Y分别表示常锻炼和不常锻炼男生的身高,由题设X∼N(μ1,5.352),Y∼N(μ2,6.112).①待检假设H0:μ1≤μ2,备择假设H1:μ1>μ2;②选取统计量U=X¯-Y¯σ12n+σ22m∼(H0成立)N(0,1);③对于α=0.05,查标准正态分布表,uα=u0.05=1.64;则拒绝域为(1.64,+∞);④计算u=174.34-172.425.35250+6.11250≈1.67>1.64,故否定原假设H0,即表明经常体育锻炼的男生平均身高比不经常体育锻炼的男生平均身高高些.习题10在漂白工艺中要改变温度对针织品断裂强力的影响,在两种不同温度下分别作了8次试验,测得断裂强力的数据如下(单位:kg):70∘C:20.818.819.820.921.519.521.021.280∘C:17.720.320.018.819.020.120.219.1判断两种温度下的强力有无差别(断裂强力可认为服从正态分布α=0.05)?解答:(1)本问题是在α=0.05下检验假设μ1=μ2,为此需要先检验σ12=σ22是否成立.H01:σ12=σ22,H11:σ12≠σ22.选取统计量F=S12S22,在H01成立的条件下,F∼F(n1-1,n2-1),且此检验问题的拒绝域为F>Fα/2(n1-1,n2-1)或F<F1-α/2(n1-1,n2-1).这里F=s12s22≈0.90550.8286≈1.0928,F0.025(7,7)=4.99,F0.975(7,7)=1F0.025(7,7)=14.99≈0.2004.显然F0.975(7,7)=0.2004<1.0928<4.99=F0.025(7,7).说明F未落在拒绝域中,从而接受H01,即认为两温度下的强力的方差没有显著变化,亦即σ12=σ22. (2)再检验假设H0ʹ:μ1=μ2,H0ʹ:μ1≠μ2,在H0ʹ成立的条件下,T=X1¯-X2¯(n1-1)S12+(n2-1)S22n1+n2-21n1+1n2∼t(n1+n2-2),且此检验问题的拒绝域为∣T∣>tα/2(n1+n2-2),这里T≈20.4-19.47×0.9055+7×0.82868+8-218+18≈2.148,显然∣T∣=2.148>2.145=t0.025(14).说明T落在拒绝域中,从而拒绝H0,即认为两种温度下的断裂强力有显著差别.习题11一出租车公司欲检验装配哪一种轮胎省油,以12部装有Ⅰ型轮胎的车辆进行预定的测试. 在不变换驾驶员的情况下,将这12部车辆换装Ⅱ型轮并重复测试,其汽油耗量如下表所示(单位:km/L).汽车编号i123456789101112Ⅰ型胎(xi)4.24.76.67.06.74.55.76.07.44.96.15.2Ⅱ型胎(yi)4.14.96.26.96.84.45.75.86.94.76.04.9假定两总体均服从正态分布,试在α=0.025的显著性水平下,检验安装Ⅰ型轮胎是否要双安装Ⅱ型轮胎省油?解答:设两种轮胎汽油消耗量之差为随机变量D,则取值为zi=xi-yi=0.1,-0.2,0.4,0.1,-0.1,0.1,0,0.2,0.5,0.2,0.1,0.3.设Z∼N(μz,σz2),σz2未知. 若消耗油相同,则μz=0;若Ⅰ型比Ⅱ型轮胎省油,则μz>0,于是检验假设H0:μz=0,H1:μz>0.由题意知z¯≈0.142,s≈0.198,n-1=12-1=11.α=0.025,查t分布表得t0.025(11)=2.201.所以,拒绝域为W={t>2.201}.由于样本值t=z¯-0s/n=0.142-00.198/12≈2.48>2.201,故拒绝H0:μz=0,即说明Ⅰ型轮胎省油.习题12有两台机器生产金属部件,分别在两台机器所生产的部件中各取一容量n1=60,n2=40的样本,测得部件重量(以kg计)的样本方差分别为s12=15.46,s22=9.66. 设两样本相互独立,两总体分别服从分布N(μ1,σ12),N(μ2,σ22).μi,σi2(i=1,2)均未知,试在α=0.05水平下检验假设H0:σ12≤σ22,H1:σ12>σ22.解答:在α=0.05下,检验假设H0:σ12≤σ22,H1:σ12>σ22,经计算p=1100×10(45+2×17+3×4+4×1+5×1)=1/10,故检验假设为H0:X∼B(10,1/10),即p =P{X=i}=C10i(1/10)i(9/10)10-i,i=0,1,2,⋯,10.为了使np ≥5,将xi≥3合并,于是k=4,r=1.计算χ2的观察值,计算结果如下表:[200,300) [300,+∞)435843.466.9-0.4-8.90.0041.184∑300300 1.8631其中理论概率pi=p{ti≤T≤ti+1}=∫titi+1f(t)dt(i=1,2,3),p4=1-∑i=13pi,例如p1=P{T<100}=∫01000.005e-0.005tdt=1-e-0.5≈0.393.由k=4,未知参数个数r=0,查表知χα2(k-r-1)=χ0.052(3)=7.815.因χ2=1.8631<χ0.052(3)=7.815.故接受H0,即可认为灯泡的寿命服从该指数分布.习题16关于正态总体X∼N(μ,1)的数学期望有如下二者必居其一的假设,H0:μ=0,H1:μ=1.考虑检验规则:当X¯≥0.98时否定假设H0接受H1,其中X¯=(X1+⋯+X4)/4,而X1,⋯,X4是来自总体X的简单随机样本,试求检验的两类错误概率α和β.解答:易见,在假设“H0:μ=0”成立的条件下,X¯∼N(0,1/4),2X¯∼N(0,1);在假设“H1:μ=1”成立的条件下,X¯∼N(1,1/4),2(X¯-1)∼N(0,1).因此,由定义得α=P{X¯≥0.98∣μ=0}=P{2X¯≥1.96∣μ=0}=0.025,β=P{X¯<0.98∣μ=1}=P{2(X¯-1)<-0.04∣μ=1}=0.4840.习题17考察某城市购买A公司牛奶的比例,作假设H0:p=0.6,H1:p<0.6,随机抽取50个家属,设x为其中购买A公司牛奶的家庭数,拒绝域W={x≤24}.(1)H0成立时,求第一类错误的α;(2)H1成立且p=0.4时,求第二类错误的β(0.4);又当p=0.5时,求第二类错误的β(0.5).解答:由定义知(1)α=P{x≤24∣p=0.6}=Φ(24-50×0.650×0.6×0.4)≈Φ(-1.73)=1-Φ(1.73)=1-0.9528=0.0418.(2)β(0.4)=P{x>24∣p=0.4}=1-Φ(24-50×0.450×0.4×0.6)≈1-Φ(1.15)=1-0.8749=0.1251;。
《概率论与数理统计》课件第七章 参数估计
03
若存在, 是否惟一?
添加标题
1
2
3
4
5
6
对于同一个未知参数,不同的方法得到的估计量可能不同,于是提出问题
应该选用哪一种估计量? 用何标准来评价一个估计量的好坏?
常用标准
(1)无偏性
(3)一致性
(2)有效性
7.2 估计量的评选标准
无偏性
一致性
有效性
一 、无偏性
定义1 设 是未知参数θ的估计量
09
则称 有效.
10
比
11
例4 设 X1, X2, …, Xn 是X 的一个样本,
添加标题
问那个估计量最有效?
添加标题
解 ⑴
添加标题
由于
添加标题
验证
添加标题
都是
添加标题
的无偏估计.
都是总体均值
的无偏估计量.
故
D
C
A
B
因为
所以
更有效.
例5 设总体 X 的概率密度为
关于一致性的两个常用结论
1. 样本 k 阶矩是总体 k 阶矩的一致性估计量.
是 的一致估计量.
由大数定律证明
用切比雪夫不 等式证明
似然函数为
其中
解得参数θ和μ的矩估计量为
2
时
3
令
1
当
6
,故
5
,表明L是μ的严格递增函数,又
4
第二个似然方程求不出θ的估计值,观察
添加标题
所以当
01
添加标题
从而参数θ和μ的最大似然估计值分别为
03
添加标题
时L 取到最大值
02
添加标题
- 1、下载文档前请自行甄别文档内容的完整性,平台不提供额外的编辑、内容补充、找答案等附加服务。
- 2、"仅部分预览"的文档,不可在线预览部分如存在完整性等问题,可反馈申请退款(可完整预览的文档不适用该条件!)。
- 3、如文档侵犯您的权益,请联系客服反馈,我们会尽快为您处理(人工客服工作时间:9:00-18:30)。
(3) 若能从 a Z( X1, X2 ,, Xn; ) b 得到等价的 不等式 , 其中 ( X1, X2 ,, Xn ), ( X1, X2 ,, Xn ) 都是统计量, 那么 ( , ) 就 是 的一个置信度为1 的置信区间.
第三节 区间估计
一、区间估计的基本概念 二、典型例题
一、区间估计的基本概念
1. 置信区间的定义
设总体 X 的分布函数F ( x; )含有一个未知参 数 , 对于给定值 (0 1), 若由样本X1, X2 ,,
Xn 确定的两个统计量
( X1, X2 ,, Xn )和 ( X1, X2 ,, Xn ) 满足 P{ ( X1, X2 ,, Xn ) ( X1, X2 ,, Xn )} 1 , 则称随机区间( , )是 的,
则置信区间为(5.20 0.49), 即 (4.71, 5.69).
在例2中如果给定 0.05,
则又有
P
z0.04
X
/
n
z0.01
0.95,
即
P{ X
n
z0.01
X
n
z0.04
}
0.95,
故 X
n
z0.01
,
X
n
z0.04
也是
间, 和分别称为置信度为1 的双侧置信区间 的置信下限和置信上限, 1 为置信度.
关于定义的说明
被估计的参数虽然未知, 但它是一个常数, 没有随机性, 而区间( , )是随机的.
因此定义中下表达式
P{ ( X1, X2 ,, Xn ) ( X1, X2 ,, Xn )} 1
的本质是:
X
n
z
/
2
.
这样的置信区间常写成
X
n
z
/
2
.
其置信区间的长度为
2
n
z / 2
.
注意 : 置信水平为 1 的置信区间是不唯一的.
如果在例2中取 n 16, 1, 0.05,
查表可得 z / 2 z0.025 1.96,
得一个置信水平为0.95的置信区间 X
1 16
1.96.
n
z
/
2
,
X
n
z
/
2
,
由 n 9, 4, 0.05, z0.025 1.96, x 147.333知,
的置信度为0.95的置信区间为 (144.720, 149.946).
样本容量n固定, 置信水平1 增大, 置信区
间长度增大, 可信程度增大, 区间估计精度降低.
置信水平1 固定, 样本容量 n 增大, 置信区
间长度减小, 可信程度不变, 区间估计精度提高.
二、典型例题
例1 设总体 X 在 [0, ] 上服从均匀分布, 其中 ( 0) 未知, ( X1, X2,, Xn ) 是来自总体X的样本, 给定 , 求 的置信水平为1 的置信区间.
按伯努利大数定理, 在这样多的区间中,
包含真值的约占100(1 )%, 不包含的约占100%.
例如 若 0.01, 反复抽样1000 次, 则得到的 1000 个区间中不包含 真值的约为10个.
2. 求置信区间的一般步骤(共3步)
(1) 寻求一个样本 X1, X2 ,, Xn的函数 :
Z Z( X1, X2 ,, Xn; ) 其中仅包含待估参数 , 并且 Z 的分布已知 且不依赖于任何未知参数 (包括 ).
置信区间长度最小.
例3 设某工件的长度 X 服从正态分布 N ( ,16),
今抽9件测量其长度, 得数据如下(单位:mm):
142, 138, 150, 165, 156, 148, 132, 135, 160.
试求参数 的置信水平为 95%的置信区间. 解 根据例2得的置信度为1 的置信区间
X
解 因为 X 是 的无偏估计, 且 U X ~ N (0,1), / n X ~ N (0,1)是不依赖于任何未知参数的, / n
由标准正态分布的上 分位点的定义知
P
X
/
n
z
/
2
1,
即
P X
n
z
/
2
X
n
z
/
2
1
,
于是得的一个置信水平为 1 的置信区间
X
n z / 2 ,
的置信
水平
为0.95的置信区间.
其置信区间的长度为
n
(
z0.04
z0.01) .
比较两个置信区间的长度
L1
2
n
z0.025
3.92
,
n
L2
n
( z0.04
z0.01
)
4.08
,
n
显然 L1 L2 . 置信区间短表示估计的精度高.
说明: 对于概率密度的图形是单峰且关于纵坐标
轴对称的情况, 易证取a和b关于原点对称时,能使
随机区间( , )以1 的概率包含着参数的真值, 而不能说参数以1 的概率落入随机区间( , ).
另外定义中的表达式
P{ ( X1 , X 2 ,, X n ) ( X1 , X 2 ,, X n )} 1
还可以描述为 : 若反复抽样多次(各次得到的样本容量相等,都是n)
每个样本值确定一个区间( , ), 每个这样的区间或包含 的真值或不包含 的真值,
满足条件
P a
Xh
b
1 ,
即 1 b nz n1dz bn an , a
P
Xh b
Xh a
1 ,
Xh b
,
Xh a
为置信区间.
例2 设 X1, X2,, Xn 是来自正态总体N (, 2 ) 的样本, 其中 2 为已知, 为未知, 求 的置信水平 为 1 的置信区间.
解 令 Xh max{X1, X2,, Xn},
由上节例3可知, n 1 n
因为 Xh的概率密度为f
Xh 是 (x)
的无偏估计 ,
nx
n1 n
,
0 x
,
0,
其他.
考察包括待估参数 的随机变量 Z Xh ,
其概率密度为
g(z)
nz n1,
0,
0 z 1, 其他.
对于给定的 ,可定出两个常数 a,b(0 a b 1),