7第7章 参数估计(点估计与区间估计)---复习思想
概率论与数理统计复习7章
![概率论与数理统计复习7章](https://img.taocdn.com/s3/m/1004ca3043323968011c92f6.png)
( n − 1) S 2 ( n − 1) S 2 = 1 − α 即P 2 <σ2 < 2 χα 2 ( n − 1) χ1−α 2 ( n − 1) ( n − 1) S 2 ( n − 1) S 2 置信区间为: 2 , χα 2 ( n − 1) χ12−α 2 ( n − 1)
则有:E ( X v ) = µv (θ1 , θ 2 ,⋯ , θ k ) 其v阶样本矩是:Av = 1 ∑ X iv n i =1
n
估计的未知参数,假定总体X 的k阶原点矩E ( X k ) 存在,
µ θ , θ ,⋯ , θ = A k 1 1 1 2 µ2 θ1, θ 2 ,⋯ , θ k = A2 用样本矩作为总体矩的估计,即令: ⋮ µ θ , θ ,⋯ , θ = A k k k 1 2 ɵ ɵ ˆ 解此方程即得 (θ1 , θ 2 ,⋯ , θ k )的一个矩估计量 θ 1 , θ 2 ,⋯ , θ k
+∞
−∞
xf ( x ) dx = ∫ θ x θ dx =
1 0
令E ( X ) = X ⇒
θ +1
θ
ˆ = X ⇒θ =
( )
X 1− X
θ +1
2
θ
7.2极大似然估计法
极大似然估计法: 设总体X 的概率密度为f ( x,θ ) (或分布率p( x,θ )),θ = (θ1 ,θ 2 ,⋯ ,θ k ) 为 未知参数,θ ∈ Θ, Θ为参数空间,即θ的取值范围。设 ( x1 , x2 ,⋯ , xn ) 是 样本 ( X 1 , X 2 ,⋯ , X n )的一个观察值:
i =1 n
概率论与数理统计第7章参数估计PPT课件
![概率论与数理统计第7章参数估计PPT课件](https://img.taocdn.com/s3/m/209c407a0722192e4536f6ec.png)
a1(1, ,k )=v1
1 f1(v1, ,vk )
假定方程组a2(1, ,k ) v2 ,则可求出2 f2(v1, ,vk )
ak (1, ,k ) vk
k fk (v1, ,vk )
则x1 xn为X的样本值时,可用样本值的j阶原点矩Aj估计vj,其中
Aj
1 n
n i1
xij ( j
L(x1, ,xn;ˆ)maxL(x1, ,xn;),则称ˆ(x1, ,xn)为
的一种参数估计方法 .
它首先是由德国数学家
高斯在1821年提出的 ,然而, 这个方法常归功于英国统
Gauss
计学家费歇(Fisher) . 费歇在1922年重新发现了
这一方法,并首先研究了这
种方法的一些性质 .
Fisher
10
极大似然估计是在已知总体分布形式的情形下的 点估计。
极大似然估计的基本思路:根据样本的具体情况
注:估计量为样本的函数,样本不同,估计量不 同。
常用估计量构造法:矩估计法、极大似然估计法。
4
7.1.1 矩估计法
矩估计法是通过参数与总体矩的关系,解出参数, 并用样本矩替代总体矩而得到的参数估计方法。 (由大数定理可知样本矩依概率收敛于总体矩, 且许多分布所含参数都是矩的函数)
下面我们考虑总体为连续型随机变量的情况:
n
它是的函数,记为L(x1, , xn; ) f (xi , ), i 1
并称其为似然函数,记为L( )。
注:似然函数的概念并不仅限于连续随机变量 ,
对于离散型随机变量,用 P {Xx}p(x,)
替代f ( x, )
即可。
14
设总体X的分布形式已知,且只含一个未知参数,
贾俊平《统计学》复习笔记课后习题详解及典型题详解(参数估计)【圣才出品】
![贾俊平《统计学》复习笔记课后习题详解及典型题详解(参数估计)【圣才出品】](https://img.taocdn.com/s3/m/58eff8cdc77da26925c5b09e.png)
∧
定义:点估计是用样本统计量θ的某个取值直接作为总体参数 θ 的估计值。 局限性:一个点估计值的可靠性是由它的抽样标准误差来衡量的,这表明一个具体的点 估计值无法给出估计的可靠性的度量,因此不能完全依赖于一个点估计值,而应围绕点估计 值构造总体参数的一个区间。 (2)区间估计 区间估计的基本思想:在点估计的基础上,给出总体参数估计的一个区间范围,该区间 通常由样本统计量加减估计误差得到。进行区间估计时,根据样本统计量的抽样分布能够对 样本统计量与总体参数的接近程度给出一个概率度量。 置信区间:在区间估计中,由样本统计量所构造的总体参数的估计区间。
著性水平表示区间估计的不可靠概率。置信度愈大(即估计的可靠性愈大),则置信区间相
应也愈大(即估计准确性愈小)。
3.评价估计量的标准
2 / 57
圣才电子书
(1)无偏性
十万种考研考证电子书、题库视频学习平台
指估计量抽样分布的数学期望等于被估计的总体参数。
∧
∧
∧
设总体参数为 θ,所选择的估计量为θ,若有 E(θ)=θ,则称θ为 θ 的无偏估计量。
1 / 57
圣才电子书 十万种考研考证电子书、题库视频学习平台
置信下限:置信区间的最小值。
置信上限:置信区间的最大值。
置信水平(也称为置信度或置信系数):将构造置信区间的步骤重复多次,置信区间中
包含总体参数真值的次数所占的比例。
∧
∧
区间估计的数学定义:若用两个统计量θ1(x1,x2,…,xn)和θ2(x1,x2,…,xn)
存在“可能包含”或“可能不包含”的问题。
③在实际问题中,进行估计时往往只抽取一个样本,此时所构造的是与该样本相联系的
第7章参数估计
![第7章参数估计](https://img.taocdn.com/s3/m/6869531e6c175f0e7cd137f1.png)
31 100
假定A品牌袋装大米的重量服从正态分布,现随机抽取13袋大 米,测得其重量(单位:千克)分别为 ⎛ ⎞ 24, 24.2, 24.4, 24.6, 24.7, ⎝ 24.8, 25, 25.1, 25.1, 25.2, ⎠ 25.3, 25.4, 25.6. 分别计算该品牌袋装大米的重量的均值,及重量的标准差 的95%的置信区间。
4. 整理后,得到未知参数������的置信区间
参数估计的基本原理 点估计 区间估计 一个总体参数的区间估计 总体均值的区间估计 总体比例的区间估计 总体方差的区间估计 两个总体参数的区间估计 两个总体均值之差的区间估计 两个总体比例之差的区间估计 两个总体方差之比的区间估计 样本量������的确定 估计总体均值是样本量的确定 估计总体比例时是样本量的确定
一家食品生产企业以生产袋装食品为主,每天的产量大约 为8000袋左右。按规定每袋的重量应为100g。为了对产品质量进 行监测,企业质检部门经常要进行抽检,以分析每袋重量是否符 合要求。现从某天生产的一批食品中随机抽取25袋,测得每袋重 量如下所示: 112.5 102.6 100 116.6 136.8 101 107.5 123.5 95.4 102.8 103 95 102 97.8 101.5 102 108.8 101.6 108.6 98.4 100.5 115.6 102.2 105 93.3
正态总体,������未知,因此应用公式①,即 ������ 2 ������ 2 方差的置信区间为[ ������(2������−(1) , ������2(������−1) ], ������ − 1) ( ������ −1) ������/2 1−������/2 √︂ √︂ ������ 2 ������ 2 标准差的置信区间为[ ������(2������−(1) , ������2(������−1) ]。 ������−1) (������−1)
第七章 参数估计
![第七章 参数估计](https://img.taocdn.com/s3/m/21e4a06152d380eb63946d07.png)
第七章 参数估计
1、正态总体、方差已知或非正态总体,大样本 当总体服从正态分布且方差已知时,或者总体不是正态分布但是大样本时,样本 均值的抽样分布均为正态分布,其数学期望为总体均值u,方差为Ϭ2/n。而样本均 值经过标准化以后的随机变量则服从标准正态分布,即 Z=(x-u)/(Ϭ/n0.5)~N(0,1) 根据上式和正态分布的性质可以得出总体均值u在1-α置信水平下的置信区间为: xα+是(-)事Z(α先/2)所(Ϭ确/n定0.5的)。而其一中个,概x率+Z值(α/2,) (Ϭ也/n称0.为5)为风置险信值上,限是,总x体-Z均(α/2值) (Ϭ不/包n0.含5)为在置置信信下区限间,的 概是率估;计1总- 体α称均为值置时信的水估平计,误Z差(α/。2) 是标准正态分布右侧面积为α/2的z值;Z(α/2) (Ϭ/n0.5) 也即是说,总体均值的置信区间由两个部分构成:点估计值和描述估计量精度的 +(-)值,这个+(-)值称为估计误差。
第七章 参数估计
在区间估计中,由样本统计量所构造的总体参数的估计区间称为置信区间。
其中,区间的最小值称为置信下限,最大值称为置信上限。
由于统计学家在某种程度上确信这个区间会包含真正的总体参数,所以给它取名 为置信区间。原因是:如果抽取了许多不同的样本,比如说抽取100个样本,根据 每一个样本构造了一个置信区间,这样,由100个样本构造的总体参数的100个置 信区间中,有95%的区间包含了总体参数的真值,而5%则没有包含,则95%这个值 称为置信水平。一般,如果将构造置信区间的步骤重复多次,置信区间中包含总 体参数真值的次数所占的比例称为置信水平,也称为置信度或置信系数。
自然使用估计效果最好的那种估计量。什么样的估计量才算一个好的估计量呢? 统计学家给出了评价估计量的一些标准,主要包括以下几个:
概率第7章 参数估计
![概率第7章 参数估计](https://img.taocdn.com/s3/m/28647d25482fb4daa58d4b40.png)
Gauss
Fisher
基本思想
甲.乙两人比较射击技术,分别射击目标一次,甲中而乙未中, 可以认为:甲射击技术优于乙射击技术. 事件A发生的概率为0.1或0.9,观察一次,事件A发生了, 可以认为:事件A发生的概率为0.9. 实际问题(医生看病、公安人员破案、技术人员进行质量 检验等)尽管千差万别,但他们具有一个共同的规律,即在 获得了观察资料之后,给参数选取一个数值,使得前面的观 察结果出现的可能性最大. 最大似然估计就是通过样本值 x1 , , x n 等数求得总体的 分布参数,使得 X1 ,, X n 取值为 x1 , , x n 的概率最大.
i
L( ) L( x1 , , x n ; ) f ( x i ; ),
i 1
n
的最大值,这里 ( )称为样本的似然函数 L .
ˆ 若 L( x 1 , , x n ; ) max L( x 1 , , x n ; )
ˆ 则称 ( x1 , , xn )为 的极大似然估计值 .
i
xi
在得到观测值 x1 , x 2 , , x n 的前提下,自然 应当选取使得 n
f ( x ; )dx
i i 1
i
达到最大的 值作为未知参数 的估计值.
因为当未知参数 等于这个值时,出现给 定的那个 样本观测值的可能性最 大.
但 dxi 不随 而变,故只需考虑:
3.期望和方差的点估计 在实际中,常常以样本均值作为总体均值的 点估计,以样本方差作为总体方差的点估计. 期望的点估计: (1)无偏性 1 n 选择估计量 X X i n i 1 (2)样本容量越大,估计值 越有效 方差的点估计:
第7章估计理论
![第7章估计理论](https://img.taocdn.com/s3/m/2cb9be657e21af45b207a809.png)
D X EX EX 2 12
2 2 2
1 1 2 1 X i X i Xi X n n n
2
2
样本方差
∴样本均值和样本方差是总体数学期望与总体方差的矩估计量。可以证明, 前面讲过的样本各种数字特征是总体同名数字特征的矩估计量。
X EX
标准化后的变量
也是随机变量,常数为离均系数,若X的数字特征为 EX , , Cs则的
Cs Cs 的最小值为: 均值为0 ,方差为1,
0
a EX 2 2 Cs Cs
当Cs 0,
,此时
为标准化正体分布∴结论是对的
从以上所推导出离均系数分布密度可知,该分布密度仅与 Cs 有关,那么只要给p 可通过积分求得p 即
解:设样本
x1 , x 2 , x n
x
1
为极大值 ∵ x1
* 即 取值范围[ x1 , ) 是抽自以上总体的。故 为使似然函数达最大
即
L 1 n 达最大 在 取值范围内 显然 x1时可使L达最大
对于P-III型分布中的τ分布(即a0=0的P-III分布),可以用两个似然方
P-Ⅲ型分布是我国水利水电工程水文计算规范中推荐采用的分 布,我国水文工作者对其参数估计的方法作了大量研究,现行广泛采用 的是适线法。 一、适线法 适线法不是给出估计量的计算公式,而是由实测样本直接推求 参数的估计值。包括目估和计算机优化适线法。 (一)、适线法的基本原理 设随机变量X的超过制分布函数 P( X x) G ( x; u10 ,, ul0 ) 的函 数类型已知,其中的参数 u10 ,, ul0未知,待估计,又设x1,…,xn为X 的一个容量为n的样本,利用这个样本通过适线法估计参数 u10 ,, ul0 的值。 将x1,x2,…,xn由大到小排队:x 计算经验频率 Pm P X xm ,将点 ( Pm , xm )(m=1~n)(称为经验点据)
参数的点估计与区间估计 ppt课件
![参数的点估计与区间估计 ppt课件](https://img.taocdn.com/s3/m/e5a03a1e02768e9950e7381f.png)
进行统计推断的一般步骤为: 总体 随机抽样 样本
统计量
作出推断
统计推断的
基本问题
参数的点估计 参数估计问题
参数的区间估计
参数假设检验 假设检验问题
非参数假设检验
参数估计问题: 就是要利用样本, 对总体 分布中包含的未知参数或未知参数的某些函数 作出估计.
如: 估计产品的废品率; 估计湖中鱼的数量; 估计降雨量等等.
,
2
解得 2E( X ) ,
总体矩用相应的样本矩代替, 得矩估计量:
2
1
n
X
i
2X
.
n i1
二、 极大似然估计法 是在总体类型已知的条件下使用的一种参数
估计方法 . 其基本思想是概率最大的事件最可能发生 .
例如: 某位同学与一位猎人一起外出打猎 .一只野兔 从前方窜过 . 只听一声枪响,野兔应声倒下 . 是谁打中的呢?
同样是无偏估计量, 有的取值较集中, 有的 取值较分散. 自然是: 取值越集中的越好. 由此 引入了有效性这个标准 .
估计量与样本容量有关, 我们希望: 随着样 本容量的无限增大, 估计量与被估计量任意接近 的可能性越来越大. 由此引入了一致性这个标准.
无偏性: 若 E( ) , 则称 是 的无偏估计.
根据“概率最大的事件最可能发生”,我们可取
使
概率
n
f
(
xi
;
)d
xi
达到最大的参数
作为
的估计;
i 1
n
n
即求 使 f ( xi;
(07)第7章 参数估计
![(07)第7章 参数估计](https://img.taocdn.com/s3/m/66854ff6ba0d4a7302763a6e.png)
STATISTICS
第 7 章 参数估计
7.1 参数估计的一般问题 7.2 一个总体参数的区间估计 7.3 必要的样本容量的确定
7-1
统计学
STATISTICS
学习目标
1. 2. 3. 4.
估计量与估计值的概念 点估计与区间估计的区别 一个总体参数的区间估计方法 必要的样本容量的确定方法
7-2
统计学
STATISTICS
置信水平
1. 将构造置信区间的步骤重复很多次,置 信区间包含总体参数真值的次数所占的 比重称为置信水平,也叫做置信度 2. 表示为 (1 -
为总体参数未在区间内的比重
相应的 为0.01,0.05,0.10
3. 常用的置信水平值有 99%, 95%, 90%
2. 则,将所有样本均值标准化为t统计量:
t x n ~ t (n 1)
3. 最终,总体均值 在1-置信水平下的置信 区间为: s
x t
2
s
7 - 24
n
统计学
STATISTICS
t 分布
t 分布是类似正态分布的一种对称分布,它通常要比 正态分布平坦和分散。一个特定的t分布依赖于称之 为自由度的参数。随着自由度的增大,分布也逐渐 趋于正态分布
2
n
或 p z
p(1 - p)
2
( 未知时)
n
统计学
STATISTICS
总体比重的区间估计
(例题分析)
解:已知 n=100,p=65% , 1- = 95%, z/2=1.96
p z p (1 p )
2
【例】某城市想 要估计下岗职工 中女性所占的比 重,随机地抽取 了 100 名 下 岗 职 工,其中65人为 女性职工。试以 95%的置信水平 估计该城市下岗 职工中女性比重 的置信区间
07心理统计学-第七章 参数估计
![07心理统计学-第七章 参数估计](https://img.taocdn.com/s3/m/8bbcbe83b9d528ea81c779fb.png)
犯错误的概率,常用α(或p)表示。则1-α为置信 度。(显著性水平越高表示的是α值越小,即犯错误的可
能性越低) α为预先设定的临界点,常用的如.05、.01、.001;p 为检验计算所得的实际(犯错误)概率。
第一节 点估计、区间估计与标准误
三、区间估计与标准误
3、区间估计的原理与标准误
转换成比率为
p
n
p, SE p
n
pq n
同理可得公式7-17。自习[例7-12、例7-13]
1、从某地区抽样调查400人,得到每月人均文化消费为 160元。已知该地区文化消费的总体标准差为40元。试 问该地区的每月人均文化消费额。(α=.05,总体呈正态
分布)
2、上题中总体方差未知,已知Sn-1=44元。 3、已知某中学一次数学考试成绩的分布为正态分布,总 体标准差为5。从总体中随机抽取16名学生,计算得平 均数为81、标准差为Sn=6。试问该次考试中全体考生成 绩平均数的95%置信区间。 4、上题中总体方差未知,样本容量改为17人。 5、假定智商服从正态分布。随机抽取10名我班学生测 得智商分别为98、102、105、105、109、111、117、 123、124、126(可计算得M=112,Sn≈9.4),试以95% 的置信区间估计我班全体的智商平均数。 返回
值表,求tα /2(df)。
5、计算置信区间CI。
σ2已知,区间为M-Zα /2 SE <μ< M+Zα /2 SE;
σ2未知,区间为M-tα /2(df)SE <μ< M+tα /2(df)SE。
6、对置信区间进行解释。
二、σ2已知,对μ的区间估计(Z分布,例7-1 & 2) 三、σ2未知,对μ的区间估计(t分布,例7-3 & 4)
心理及教育统计学第7章参数估计
![心理及教育统计学第7章参数估计](https://img.taocdn.com/s3/m/7d2daa85ad02de80d5d84039.png)
章节内容
第一节 点估计、区间估计及标准误 第二节 总体平均数的估计 第三节 标准差与方差的区间估计 第四节 相关系数的区间估计 第五节 比率及比率差异的区间估计
总体参数估计:在研究中从样本获得一组数 据后,通过这组信息,对总体特征进行估计, 即从局部结果推论总体的情况。
总体参数估计分点估计和区间估计两种。
7 8 2 . 2 6 2 2 . 6 7 7 8 2 . 2 6 2 2 . 6 7
71.9684.04
当n2=36时,df2=35,t0.05/2=2.042
7 9 2 . 0 4 2 1 . 5 2 7 9 2 . 0 4 2 1 . 5 2
75.982.1
【例7-4】
根据n2=36的样本估计总体参数μ:
0.95的置信区间 7 8 1 . 9 6 1 . 1 8 7 9 1 . 9 6 1 . 1 8
76.781.3
0.99的置信区间
7 9 2 . 5 8 1 . 1 8 7 9 2 . 5 8 1 . 1 8
75.782.04
83.686.4
总体方差σ2未知,对总体平均数的估计
总体方差未知,用样本的无偏方差(
s
2 n 1
)作为总体
方差的估计值,实现对总体平均数μ的估计。因为在总
体方差未知时,样本平均数的分布为t分布,故应查t值
表,确定t/2或t(1-)/2。
有两种情况:
(1)总体的分布为正态时,可不管n之大小。
(2)总体分布为非正态时,只有n>30,才能用概率对 其抽样分布进行解释,否则不能推论。
0.05水平和0.01水平是人们习惯上常用的两个显著性 水平。
区间估计的原理是抽样分布理论。在计算区间估计值, 解释估计的正确概率时,依据的是该样本统计量的分 布规律及抽样分布的标准误(SE)。
第7章参数估计—第1节点估计精品文档
![第7章参数估计—第1节点估计精品文档](https://img.taocdn.com/s3/m/b2950794f61fb7360b4c65b6.png)
设总体的分布函数中含有k个未知参数 θ1,θ2, ,θk, 那么它的前k阶矩 μ1,μ2, ,μk, 一般
都是这 k 个参数的函数,记为:
数理统计
μ i μ i(θ 1 ,θ 2 , ,θ k ) i=1,2, … ,k
从这 k 个方程中解出
θjθj(μ 1,μ 2, ,μ k) j=1,2,…,k
求解方程:
dlnL() 0 d
可以得到 的MLE .
若是向量,上述方程必须用方程组代替 .
2、用上述求导方法求参数的MLE有时行不
通,这时要用最大似然原则来求 .
数理统计
下面举例说明如何求最大似然估计
例5 设X1,X2,…Xn是取自总体 X~B(1, p) 的一个 样本,求参数p的最大似然估计量.
令
1n
LnL (
μ
σ2 i1
xi nμ)0
σ 2L n L 2 n σ 2 2 (σ 1 2)2i n 1(x i μ )2 0
解得
1 n
μ n i1 xi x
σ2
1n n i1 (xi
x)2
μ , σ 2 的最大似然估计量为
μ X ,
x
2
似然函数为
n
L(μ,σ2)
1 e(x2 i σμ 2)2
i1 2πσ
n
L(μ,σ2)
1 e(x2 i σμ 2)2
i1 2πσ
数理统计
于是
(2 π ) n2 (σ 2) n2e x p [ 2 σ 1 2i n 1(x i μ )2 ]
L n L n 2 ln (2 π ) n 2 ln σ 2 2 σ 1 2i n 1(x i μ )2
统计学第七章、第八章课后题答案
![统计学第七章、第八章课后题答案](https://img.taocdn.com/s3/m/9078f63d804d2b160b4ec0b6.png)
]统计学复习笔记第七章一、思考题1.解释估计量和估计值在参数估计中,用来估计总体参数的统计量称为估计量。
估计量也是随机变量。
如样本均值,样本比例、样本方差等。
根据一个具体的样本计算出来的估计量的数值称为估计值。
2.简述评价估计量好坏的标准"(1)无偏性:是指估计量抽样分布的期望值等于被估计的总体参数。
(2)有效性:是指估计量的方差尽可能小。
对同一总体参数的两个无偏估计量,有更小方差的估计量更有效。
(3)一致性:是指随着样本量的增大,点估计量的值越来越接近被估总体的参数。
3.怎样理解置信区间在区间估计中,由样本统计量所构造的总体参数的估计区间称为置信区间。
置信区间的论述是由区间和置信度两部分组成。
有些新闻媒体报道一些调查结果只给出百分比和误差(即置信区间),并不说明置信度,也不给出被调查的人数,这是不负责的表现。
因为降低置信度可以使置信区间变窄(显得“精确”),有误导读者之嫌。
在公布调查结果时给出被调查人数是负责任的表现。
这样则可以由此推算出置信度(由后面给出的公式),反之亦然。
4.解释95%的置信区间的含义是什么置信区间95%仅仅描述用来构造该区间上下界的统计量(是随机的)覆盖总体参数的概率。
也就是说,无穷次重复抽样所得到的所有区间中有95%(的区间)包含参数。
不要认为由某一样本数据得到总体参数的某一个95%置信区间,就以为该区间以的概率覆盖总体参数。
5.|6.简述样本量与置信水平、总体方差、估计误差的关系。
1.估计总体均值时样本量n为2. 样本量n 与置信水平1-α、总体方差、估计误差E 之间的关系为与置信水平成正比,在其他条件不变的情况下,置信水平越大,所需要的样本量越大;与总体方差成正比,总体的差异越大,所要求的样本量也越大; 与与总体方差成正比,样本量与估计误差的平方成反比,即可以接受的估计误差的平方越大,所需的样本量越小。
)二、 练习题1. 从一个标准差为5的总体中采用重复抽样方法抽出一个样本量为40的样本,样本均值为25。
概率论与数理统计(叶慈南 刘锡平 科学出版社)第7章 参数估计教程
![概率论与数理统计(叶慈南 刘锡平 科学出版社)第7章 参数估计教程](https://img.taocdn.com/s3/m/cd8c9bef5ef7ba0d4a733b1a.png)
估计 θ ,故称这种估计为点估计.
5 6
,σ 2未知,
… 随机抽查100个婴儿 得100个体重数据 10,7,6,6.5,5,5.2, …
而全部信息就由这100个数组成. 据此,我们应如何估计 和 σ 呢?
我们知道,服从正态分布N ( , σ 2 )的r.v. X , E ( X ) = , 由大数定律, 样本体重的平均值 1 → ∑ X i P n i =1 自然想到把样本体重的平均值作为总体平均 体重的一个估计. X= 用样本体重的均值 X估计 , 类似地,用样本体重的方差 S 2估计 σ 2 . 1 n 1 n 2 X = ∑ Xi, S = ∑ ( X i X )2 n 1 i =1 n i =1
(一)矩估计法
基本思想:用样本矩估计总体矩
(二)最大似然估计法
基本思想:
15
16
最大似然估计法 (最大似然法)
它首先是由德国数学家 高斯在1821年提出的 , 然而,这个方法常归功于 英国统计学家费希尔(Fisher) . 费希尔在1922年重新发现了 这一方法,并首先研究了这 种 方法的一些性质 . Fisher
1. 矩估计法 2. 最大似然法 3. 最小二乘法 4. 贝叶斯方法 ……
(一) 矩估计法(简称"矩法")
它是基于一种简单的"替换"思想 建立起来的一种估计方法 . 英国统计学家 K. 皮尔逊 最早提出的 . 基本思想: 用样本矩估计总体矩 . 理论依据: 大数定律
Ak = 1 n k P ∑ X i → k = E ( X k ) n i =1
4
在参数估计问题中,假定总体分布 形式已知,未知的仅仅是一个或几个 参数.
第七章 参数估计(复习二)
![第七章 参数估计(复习二)](https://img.taocdn.com/s3/m/c650181ca76e58fafab003af.png)
求正态总体参数置信区间的解题步骤: 求正态总体参数置信区间的解题步骤:
(1) 根据实际问题构造样本的函数,要求仅 根据实际问题构造样本的函数, 含待估参数且分布已知; 含待估参数且分布已知; (2) 令该函数落在由分位点确定的区间里的 令该函数落在由分位点确定 函数落在由分位点确定的区间里的 概率为给定的置信度 −α,要求区间按几何对称 概率为给定的置信度1−α,要求区间按几何对称 给定的置信度 −α 或概率对称; 或概率对称; (3)解不等式得随机的置信区间; 解不等式得随机的置信区间; 解不等式得随机的置信区间 (4)由观测值及α值查表计算得到所求的置信 由观测值及α值查表计算得到所求的置信 由观测值及 区间. 区间
P {θ < θ < θ } = 1 − α ,
*
置信度为1−α −α的 则称随机区间 (θ ,θ ) 为θ的置信度为 −α的置信区间
θ 和θ 分别称为置信度 1 − α 的置信下限和置信上限 .
注:F(x;θ)也可换成概率密度或分布律. θ 也可换成概率密度或分布律
18
7.4
正态总体参数的区间估计
(1) 做似然函数
iid
^
^
L(θ ) = L( x1 , L , x n ; θ ) = ∏ f ( x i ; θ )
i =1
8
n
L(θ ) = L( x1 , L , x n ; θ ) = ∏ f ( x i ; θ )
i =1
n
(2) 做对数似然函数
ln L(θ ) = L( x1 , L , x n ; θ ) = ∑ ln f ( x i ; θ )
令 p{ T < tα / 2 (n1 + n2 − 2)} = 1 − α .
概率论与数理统计第七章 参数估计
![概率论与数理统计第七章 参数估计](https://img.taocdn.com/s3/m/207d7146b84ae45c3b358c91.png)
第七章 参数估计参数估计是数理统计研究的主要问题之一. 假设总体X ~N (μ,σ2),μ,σ2是未知参数,X 1,X 2,…,X n 是来自X 的样本,样本值是x 1,x 2,…,x n ,我们要由样本值来确定μ和σ2的估计值,这就是参数估计问题,参数估计分为点估计(Point estimation )和区间估计(Interval estimation).第一节 点估计所谓点估计是指把总体的未知参数估计为某个确定的值或在某个确定的点上,故点估计又称为定值估计.定义7.1 设总体X 的分布函数为F (x ,θ),θ是未知参数,X 1,X 2,…,X n 是X 的一样本,样本值为x 1,x 2,…,x n ,构造一个统计量(X 1,X 2,…,X n ),用它的观察值 (x 1,x 2,…,x n )作为θ的估计值,这种问题称为点估计问题.习惯上称随机变量(X 1,X 2,…,X n )为θ的估计量,称(x 1,x 2,…,x n )为的估计值.构造估计量(X 1,X 2,…,X n )的方法很多,下面仅介绍矩法和极大似然估计法. 1.矩法矩法(Moment method of estimation )是一种古老的估计方法.它是由英国统计学家皮尔逊(K .Pearson )于1894年首创的.它虽然古老,但目前仍常用.矩法估计的一般原则是:用样本矩作为总体矩的估计,若不够良好,再作适当调整. 矩法的一般作法:设总体X ~F (X ;θ1,θ2,…,θl )其中θ1,θ2,…,θl 均未知. (1) 如果总体X 的k 阶矩μk =E (X k ) (1≤k ≤l)均存在,则μk =μk (θ1,θ2,…,θl ),(1≤k ≤l ).(2) 令⎪⎪⎩⎪⎪⎨⎧.),,,(,),,,(,),,,(2122121211l l l l l A A A θθθμθθθμθθθμ其中A k (1≤k ≤l )为样本k 阶矩.求出方程组的解,ˆ,,ˆ,ˆ21l θθθ 我们称),,,(ˆˆ21n k k X X X θθ=为参数θk (1≤k ≤l )的矩估计量, ),,,(ˆˆ21nk k x x x θθ=为参数θk 的矩估计值. 例7.1 设总体X 的密度函数为:f (x )=⎩⎨⎧-><<+.,0),1(,10,)1(其他αααx x其中α未知,样本为(X 1,X 2,…,X n ),求参数α的矩法估计.解 A 1=X .由μ1=A 1及μ1=E (X )=21)1()(1++=+=⎰⎰+∞∞-ααααx x x x x xf d d , 有21++=ααX ,得121ˆ--=X Xα.例7.2 设X ~N (μ,σ2),μ,σ2未知,试用矩法对μ,σ2进行估计. 解⎪⎪⎩⎪⎪⎨⎧======∑∑==.1)(,1)(12222111ni i ni i X n A X E X n A X E μμ 又 E (X )=μ, E (X 2)=D (X )+(EX )2=σ2+μ2,那么 .1ˆˆ,ˆ2222S nn A X -=-==μσμ. 例7.3 在某班期末数学考试成绩中随机抽取9人的成绩.结果如下:试求该班数学成绩的平均分数、标准差的矩估计值.解 设X 为该班数学成绩,μ=E (X ),σ2=D (X ))558994(919191+++==∑= i i x x =75;2/19122)(819898⎥⎦⎤⎢⎣⎡-⋅=∑=i i x x s =12.14.⎪⎪⎩⎪⎪⎨⎧======∑∑==.91)(,91)(9122229111i i i i X A X E X A X E μμ 由于E (X 2)=D (X )+(EX )2=σ2+μ2,那么,2222228ˆˆˆ,().9X A A x S μσμ==-=-= 所以,该班数学成绩的平均分数的矩估计值x =μˆ=75分,标准差的矩估计值298ˆs =σ=12.14. 作矩法估计时无需知道总体的概率分布,只要知道总体矩即可.但矩法估计量有时不惟一,如总体X 服从参数为λ的泊松分布时,X 和B 2都是参数λ的矩法估计.2.极(最)大似然估计法极大似然估计法(Maximum likelihood estimation)只能在已知总体分布的前提下进行,为了对它的思想有所了解,我们先看一个例子.例7.4 假定一个盒子里装有许多大小相同的黑球和白球,并且假定它们的数目之比为3∶1,但不知是白球多还是黑球多,现在有放回地从盒中抽了3个球,试根据所抽3个球中黑球的数目确定是白球多还是黑球多.解 设所抽3个球中黑球数为X ,摸到黑球的概率为p ,则X 服从二项分布P {X =k }=k 3C p k(1-p )3-k , k =0,1,2,3.问题是p =1/4还是p =3/4?现根据样本中黑球数,对未知参数p 进行估计.抽样后,共有4种可能结果,其概率如表7-1所示.假如某次抽样中,只出现一个黑球,即X =1,p =1/4时,P {X =1}=27/64;p =3/4时,P {X =1}=9/64,这时我们就会选择p =1/4,即黑球数比白球数为1∶3.因为在一次试验中,事件“1个黑球”发生了.我们认为它应有较大的概率27/64(27/64>9/64),而27/64对应着参数p =1/4,同样可以考虑X =0,2,3的情形,最后可得p =⎪⎩⎪⎨⎧==.3,2,43,1,0,41时当时当x x(1) 似然函数在极大似然估计法中,最关键的问题是如何求得似然函数(定义下文给出),有了似然函数,问题就简单了,下面分两种情形来介绍似然函数. (a ) 离散型总体设总体X 为离散型,P {X =x }=p (x ,θ),其中θ为待估计的未知参数,假定x 1,x 2,…,x n 为样本X 1,X 2,…,X n 的一组观测值.P {X 1=x 1,X 2=x 2,…,X n =x n }=P {X 1=x 1}P {X 2=x 2}…P {X n =x n }=p (x 1,θ)p (x 2,θ)…p (x n ,θ)=∏=ni ix p 1),(θ.将∏=ni ix p 1),(θ看作是参数θ的函数,记为L (θ),即 L (θ)=∏=ni ix p 1),(θ. (7.1)(b ) 连续型总体设总体X 为连续型,已知其分布密度函数为f (x ,θ),θ为待估计的未知参数,则样本(X 1,X 2,…,X n )的联合密度为:f (x 1,θ)f (x 2,θ)…f (x n ,θ)=∏=ni ix f 1),(θ.将它也看作是关于参数θ的函数,记为L (θ),即L (θ)=∏=ni ix f 1),(θ. (7.2)由此可见:不管是离散型总体,还是连续型总体,只要知道它的概率分布或密度函数,我们总可以得到一个关于参数θ的函数L (θ),称L (θ)为似然函数.(2) 极大似然估计极大似然估计法的主要思想是:如果随机抽样得到的样本观测值为x 1,x 2,…,x n ,则我们应当这样来选取未知参数θ的值,使得出现该样本值的可能性最大,即使得似然函数L (θ)取最大值,从而求参数θ的极大似然估计的问题,就转化为求似然函数L (θ)的极值点的问题,一般来说,这个问题可以通过求解下面的方程来解决0)(=θθd d L . (7.3)然而,L (θ)是n 个函数的连乘积,求导数比较复杂,由于ln L (θ)是L (θ)的单调增函数,所以L (θ)与ln L (θ)在θ的同一点处取得极大值.于是求解(7.3)可转化为求解0)(=θθd dln L .(7.4)称ln L (θ)为对数似然函数,方程(7.4)为对数似然方程,求解此方程就可得到参数θ的估计值.如果总体X 的分布中含有k 个未知参数:θ1,θ2,…,θk ,则极大似然估计法也适用.此时,所得的似然函数是关于θ1,θ2,…,θk 的多元函数L (θ1,θ2,…,θk ),解下列方程组,就可得到θ1,θ2,…,θk 的估计值,⎪⎪⎪⎩⎪⎪⎪⎨⎧=∂∂=∂∂=∂∂.0),,,(ln ,0),,,(ln ,0),,,(ln 21221121k k k k L L L θθθθθθθθθθθθ(7.5) 例7.5 在泊松总体中抽取样本,其样本值为:x 1,x 2,…,x n ,试对泊松分布的未知参数λ作极大似然估计.解 因泊松总体是离散型的,其概率分布为:P {X =x }=λλ-e !x x,故似然函数为:L (λ)=∏∏==∑--⋅⋅==ni ni i x nixx x ni ii11!1!1λλλλee. ln L (λ)=11ln ln (!)nniii i n x x λλ==-+-∑∏,∑=+-=ni i x n 11)ln(λλλd d . 令λλd d ln =0,得: ∑=+-ni i x n 11λ=0.所以x x n ni i L ==∑=11ˆλ,λ的极大似然估计量为X L=λˆ(为了和λ的矩法估计区别起见,我们将λ的极大似然估计记为Lλˆ). 例7.6 设一批产品含有次品,今从中随机抽出100件,发现其中有8件次品,试求次品率θ的极大似然估计值.解 用极大似然法时必须明确总体的分布,现在题目没有说明这一点,故应先来确定总体的分布.设 X i =,100,,2,1,0,1 =⎩⎨⎧i ,i ,i 次取正品第次取次品第则X i 服从两点分布:12100p (x i ,θ)=P {X i =x i }=θ xi (1-θ)1-xi ,x i =0,1,故似然函数为:L (θ)=∑-∑=-==-=-∏1001100110010011)1()1(i ii i iix x i x x θθθθ由题知:∑=1001i ix =8,所以 L (θ)=θ8(1-θ)92. 两边取对数得:ln L (θ)=8ln θ+92ln (1-θ).对数似然方程为:θθθθ--=1928)(ln d d L =0.解之得θ=8/100=0.08.所以Lθˆ=0.08. 例7.7 设x 1,x 2,…,x n 为来自正态总体N (μ,σ2)的观测值,试求总体未知参数μ,σ2的极大似然估计.解 因正态总体为连续型,其密度函数为f (x )=222)(21σμσ--x e π,所以似然函数为:L (μ,σ2)=⎭⎬⎫⎩⎨⎧--⎪⎭⎫ ⎝⎛=⎭⎬⎫⎩⎨⎧--∑∏==n i i nni i x x 122122)(21exp 212)(exp 21μσσσμσππ ln L (μ,σ2)=∑=----n i i x n n 1222)(21ln 22ln 2μσσπ. 故似然方程组为:⎪⎪⎩⎪⎪⎨⎧=-+-=∂∂=-=∂∂∑∑==.0)(212),(ln ,0)(1),(ln 124222122ni i ni i x n L x L μσσσσμμσμσμ 解以上方程组得:⎪⎪⎩⎪⎪⎨⎧=-=-===∑∑∑===.ˆ)(1)(1,12121221B x x n x n x x n ni i n i i ni i μσμ 所以 ⎩⎨⎧==.ˆ,ˆ22B X L σμ例7.8 设总体X 服从[0,θ]上的均匀分布,X 1,X 2,…,X n 是来自X 的样本,求θ的矩法估计和极大似然估计.解 因为E (X )=θ/2,令X =E (X ),得.2ˆX =矩θ 又 f (x )=⎪⎩⎪⎨⎧≤≤.,0,0,1其他θθx所以L (θ)=n θ1,0≤x i ≤θ. 要L (θ)最大,θ必须尽可能小,又θ≥x i ,i =1,2,…,n ,所以{}ini L X ≤≤=1max ˆθ.第二节 估计量的评价标准设总体X 服从[0,θ]上的均匀分布,由上节例7可知ˆ2X θ=矩,{}1ˆmax L ii nX θ≤≤ 都是θ的估计,这两个估计哪一个好?下面我们首先讨论衡量估计量好坏的标准问题.1.无偏性定义7.2 若估计量(X 1,X 2,…,X n )的数学期望等于未知参数θ,即:ˆ()E θθ=, (7.6) 则称ˆθ为θ的无偏估计量(Non -deviation estimator ).估计量ˆθ的值不一定就是θ的真值,因为它是一个随机变量,若ˆθ是θ的无偏估计,则尽管ˆθ的值随样本值的不同而变化,但平均来说它会等于θ的真值.例7.9 设X 1,X 2,…,X n 为总体X 的一个样本,E (X )=μ,则样本平均数11nii X X n ==∑是μ的无偏估计量.证 因为E (X )=μ,所以E (X i )=μ,i =1,2,…,n ,于是1111()()n ni i i i E X E X E X n n ==⎛⎫== ⎪⎝⎭∑∑=μ.所以X 是μ的无偏估计量.例7.10 设有总体X ,E (X )=μ,D (X )=σ2,(X 1,X 2,…,X n )为从该总体中抽得的一个样本,样本方差S 2及二阶样本中心矩B 2=11()ni i X X n =-∑是否为总体方差σ2的无偏估计?解 因为E (S 2)=σ2,所以S 2是σ2的一个无偏估计,这也是我们称S 2为样本方差的理由.由于B 2=21n S n -, 那么 E (B 2)=2211()n n E S n nσ--=, 所以B 2不是σ2的一个无偏估计.还需指出:一般说来无偏估计量的函数并不是未知参数相应函数的无偏估计量.例如,当X ~N (μ,σ2)时,X 是μ的无偏估计量,但2X 不是μ2的无偏估计量,事实上:22222()()().E X D X E X nσμμ⎡⎤=+=+≠⎣⎦2.有效性对于未知参数θ,如果有两个无偏估计量1ˆθ与2ˆθ,即E (1ˆθ)=E (2ˆθ)=θ,那么在1ˆθ,2ˆθ中谁更好呢?此时我们自然希望对θ的平均偏差E (ˆθ-θ)2越小越好,即一个好的估计量应该有尽可能小的方差,这就是有效性.定义7.3 设1ˆθ和2ˆθ都是未知参数θ的无偏估计,若对任意的参数θ,有 D (1ˆθ)≤D (2ˆθ), (7.7)则称1ˆθ比2ˆθ有效. 如果1ˆθ比2ˆθ有效,则虽然1ˆθ还不是θ的真值,但1ˆθ在θ附近取值的密集程度较2ˆθ高,即用1ˆθ估计θ精度要高些. 例如,对正态总体N (μ,σ2),11ni i X X n ==∑,X i 和X 都是E (X )=μ的无偏估计量,但D (X )=2nσ≤D (X i )=σ2,故X 较个别观测值X i 有效.实际当中也是如此,比如要估计某个班学生的平均成绩,可用两种方法进行估计,一种是在该班任意抽一个同学,就以该同学的成绩作为全班的平均成绩;另一种方法是在该班抽取n 位同学,以这n 个同学的平均成绩作为全班的平均成绩,显然第二种方法比第一种方法好.3.一致性无偏性、有效性都是在样本容量n 一定的条件下进行讨论的,然而(X 1,X 2,…,X n )不仅与样本值有关,而且与样本容量n 有关,不妨记为n ,很自然,我们希望n 越大时,n 对θ的估计应该越精确.定义7.4 如果n 依概率收敛于θ,即∀ε>0,有{}ˆlim 1,nn P θθε→∞-<=,(7.8) 则称ˆnθ是θ的一致估计量(Uniform estimator ). 由辛钦大数定律可以证明:样本平均数X 是总体均值μ的一致估计量,样本的方差S 2及二阶样本中心矩B 2都是总体方差σ2的一致估计量.第三节 区间估计1.区间估计的概念上节我们介绍了参数的点估计,假设总体X ~N (μ,σ2),对于样本(X 1,X 2,…,X n ),ˆX μ=是参数μ的矩法估计和极大似然估计,并且满足无偏性和一致性.但实际上X =μ的可能性有多大呢?由于X 是一连续型随机变量,P {X =μ}=0,即ˆμ=μ的可能性为0,为此,我们希望给出μ的一个大致范围,使得μ有较高的概率在这个范围内,这就是区间估计问题.定义7.5 设1ˆθ(X 1,X 2,…,X n )及2ˆθ (X 1,X 2,…,X n )是两个统计量,如果对于给定的概率1-α(0<α<1),有:P {1ˆθ<θ<2ˆθ}=1-α, (7.9) 则称随机区间(1ˆθ,2ˆθ)为参数θ的置信区间(Confidence interval ),1ˆθ称为置信下限,2ˆθ称为置信上限,1-α叫置信概率或置信度(Confidence level).定义中的随机区间(1ˆθ,2ˆθ)的大小依赖于随机抽取的样本观测值,它可能包含θ,也可能不包含θ,(7.9)式的意义是指(1ˆθ,2ˆθ)以1-α的概率包含θ.例如,若取α=0.05,那么置信概率为1-α=0.95,这时,置信区间(1ˆθ,2ˆθ)的意义是指:在100次重复抽样中所得到的100个置信区间中,大约有95个区间包含参数真值θ,有5个区间不包含真值θ,亦即随机区间(1ˆθ,2ˆθ)包含参数θ真值的频率近似为0.95. 例7.11 设X ~N (μ,σ2),μ未知,σ2已知,样本X 1,X 2,…,X n 来自总体X ,求μ的置信区间,置信概率为1-α.解 因为X 1,X 2,…,X n 为来自X 的样本,而X ~N (μ,σ2),所以uX ~N (0,1),对于给定的α,查附录中表2可得上分位点2z α,使得2P z α⎫<⎬⎭=1-α,即22P X z X z ααμ⎧-<<+⎨⎩=1-α. 所以μ的置信概率为1-α的置信区间为X z X z αα⎛-+ ⎝. (7.10) 由(7.10)式可知置信区间的长度为22z α,若n 越大,置信区间就越短;若置信概率1-α越大,α就越小,2z α就越大,从而置信区间就越长.2.正态总体参数的区间估计由于在大多数情况下,我们所遇到的总体是服从正态分布的(有的是近似正态分布),故我们现在来重点讨论正态总体参数的区间估计问题.在下面的讨论中,总假定X ~N (μ,σ2),X 1,X 2,…,X n 为其样本. (1) 对μ的估计 分两种情况进行讨论. (a ) σ2已知此时就是例7.11的情形,结论是:μ的置信区间为22X z X z αα⎛-+ ⎝, 置信概率为1-α.(b ) σ2未知当σ2未知时,不能使用(7.10)式作为置信区间,因为(7.10)式中区间的端点与σ有关,考虑到S 2=211()1n ii X X n =--∑是σ2X σ换成S 得 TX ~t (n -1).对于给定的α,查附录中t 分布表4可得上分位点t σ/2(n -1),使得2(1)P t n α⎫<-⎬⎭=1-α,即22(1)(1)P X t n X t n ααμ⎧⎫-<<-⎨⎬⎩⎭=1-α.所以μ的置信概率为1-α的置信区间为22(1),(1)X t n X t n αα⎛⎫-- ⎪⎝⎭. (7.11)=,S 0,所以μ的置信区间也可写成22(1),(1)X t n X t n αα⎛⎫-+- ⎪⎝⎭.(7.12) 例7.12 某车间生产滚珠,已知其直径X ~N (μ,σ2),现从某一天生产的产品中随机地抽出6个,测得直径如下(单位:毫米)14.6 15.1 14.9 14.8 15.2 15.1试求滚珠直径X 的均值μ的置信概率为95%的置信区间.解 111(14.615.114.914.815.215.1)6n i i x x n ===+++++∑=14.95,s 0, t α/2(n -1)=t 0.025(5)=2.571,所以2(t n α-=2.571=0.24, 置信区间为(14.95-0.24,14.95+0.24),即(14.71,15.19),置信概率为95%.σ2的置信区间我们只考虑μ未知的情形.此时由于S 2=211()1n i i X X n =--∑是σ2的无偏估计,我们考虑22(1)n S σ-,由于222(1)~(1)n S n χσ--,所以,对于给定的α,2122222(1)(1)(1)n S P n n ααχχσ-⎧⎫--<<-⎨⎬⎩⎭=1-α. 即222221(1)(1)(1)(1)n S n S P n n αασχχ-⎧⎫--⎪⎪<<⎨⎬--⎪⎪⎩⎭=1-α.所以σ2的置信区间为2222221(1)(1),(1)(1)n S n S n n ααχχ-⎛⎫-- ⎪ ⎪--⎝⎭(7.13) 或222200221,(1)(1)nS nS n n ααχχ-⎛⎫ ⎪ ⎪--⎝⎭, 其中S 02=211()ni i X X n =-∑. 例7.13 某种钢丝的折断力服从正态分布,今从一批钢丝中任取10根,试验其折断力,得数据如下:572 570 578 568 596 576 584 572 580 566试求方差的置信概率为0.9的置信区间.解 因为111(572570566)10n i i x x n ===+++∑=576.2,s 02=2211n i i x x n =-∑=71.56, α=0.10,n -1=9,查附表得:2220.05(1)(9)n αχχ-==16.919,220.951(1)(9)n αχχ--==3.325,22021071.56(1)16.919ns n αχ⨯=-=42.30,220211071.56(1) 3.325ns n αχ-⨯=-=215.22.所以,σ2的置信概率为0.9的置信区间为(42.30,215.22).以上仅介绍了正态总体的均值和方差两个参数的区间估计方法.在有些问题中并不知道总体X 服从什么分布,要对E (X )=μ作区间估计,在这种情况下只要X 的方差σ2已知,并且样本容量n 很大,X 准正态分布N (0,1),因而μ的置信概率为1-α的近似置信区间为X z X z αα⎛-+ ⎝.小 结参数估计问题分为点估计和区间估计.设θ是总体X 的待估计参数.用统计量ˆθ=ˆθ(X 1,X 2,…,X n )来估计θ称ˆθ是θ的估计量,点估计只给出未知参数θ的单一估计.本章介绍了两种点估计的方法:矩估计法和极大似然估计法.矩法的做法:设总体X ~F (X ;θ1,θ2,…,θl )其中θk (1≤k ≤l )为未知参数. (1) 求总体X 的k (1≤k ≤l )阶矩E (x k ); (2) 求方程组112112(,,,)(),(,,,)().l l l l l E X A E X A μθθθμθθθ==⎧⎪⎨⎪==⎩的一组解1ˆθ,2ˆθ,…, ˆl θ,那么ˆk θ=ˆk θ (X 1,X 2,…,X n )(1≤k ≤l)为k 的矩估计量. ˆkθ(x 1,x 2,…,x n )为θk 的矩估计值. 极大似然估计法的思想是若已观察到样本值为(x 1,x 2,…,x n ),而取到这一样本值的概率为P =P (θ1,θ2,…,θl ),我们就取θk (1≤k ≤l )的估计值使概率P 达到最大,其一般做法如下: (1) 写出似然函数L =L (θ1,θ2,…,θl ) 当总体X 是离散型随机变量时,L =121(;,,,)nil i P x θθθ=∏,当总体X 是连续型随机变量时L =121(;,,,)nil i f x θθθ=∏,(2) 对L 取对数ln L =121ln (;,,,)nil i f x θθθ=∑,(3) 求出方程组ln kLθ∂∂=0, k =1,2,…,l . 的一组解ˆk θ=ˆk θ (x 1,…,x n ) (1≤k ≤l )即k 为未知参数θ的极大似然估计值,ˆkθ=(X 1,X 2,…,X n )为θk 的极大似然估计量.在统计问题中往往先使用极大似然估计法,在此法使用不方便时,再用矩估计法进行未知参数的点估计.对于一个未知参数可以提出不同的估计量,那么就需要给出评定估计量好坏的标准.本章介绍了三个标准:无偏性、有效性、一致性.重点是无偏性.点估计不能反映估计的精度,我们就引人区间估计.设θ是总体X 的未知参数,1ˆθ,2ˆθ均是样本X 1,X 2,…,X n 的统计量,若对给定值α(0<α<1)满足P (1ˆθ<θ<2ˆθ)=1-α,称1-α为置信度或置信概率,(1ˆθ,2ˆθ)为θ的置信度为1-α的置信区间.参数的区间估计中一个典型、重要的问题是正态总体X (X ~N (μ,σ2))中μ或σ2的区间估计,其置信区间如表7-3所示.表7-3 正态总体的均值、方差的置信度为(1-α)的置信区间区间估计给出了估计的精度与可靠度(1-α),其精度与可靠度是相互制约的即精度越高(置信区间长度越小),可靠度越低;反之亦然.在实际中,应先固定可靠度,再估计精度. 重要术语及主题矩估计量 极大似然估计量估计量的评选标准:无偏性、有效性、一致性, 参数θ的置信度为(1-α)的置信区间, 单个正态总体均值、方差的置信区间.习 题 七1.设总体X 服从二项分布b (n ,p ),n 已知,X 1,X 2,…,X n 为来自X 的样本,求参数p 的矩法估计.2.设总体X 的密度函数f (x ,θ)=22(),0,0,.x x θθθ⎧-<<⎪⎨⎪⎩其他X 1,X 2,…,X n 为其样本,试求参数θ的矩法估计.3.设总体X 的密度函数为f (x ,θ),X 1,X 2,…,X n 为其样本,求θ的极大似然估计.(1) f (x ,θ)=,0,0,0.e x x x θθ-⎧≥⎨<⎩(2) f (x ,θ)=1,01,0,.x x θθ-⎧<<⎨⎩其他5.随机变量X 服从[0,θ]上的均匀分布,今得X 的样本观测值:0.9,0.8,0.2,0.8,0.4,0.4,0.7,0.6,求θ的矩法估计和极大似然估计,它们是否为θ的无偏估计.6.设X 1,X 2,…,X n 是取自总体X 的样本,E (X )=μ,D (X )=σ2,2ˆσ=k 1211()n i ii XX -+=-∑,问k 为何值时2ˆσ为σ2的无偏估计. 7.设X 1,X 2是从正态总体N (μ,σ2)中抽取的样本112212312211311ˆˆˆ;;;334422X X X X X X μμμ=+=+=+ 试证123ˆˆˆ,,μμμ都是μ的无偏估计量,并求出每一估计量的方差. 8.某车间生产的螺钉,其直径X ~N (μ,σ2),由过去的经验知道σ2=0.06,今随机抽取6枚,测得其长度(单位mm )如下:14.7 15.0 14.8 14.9 15.1 15.2 试求μ的置信概率为0.95的置信区间.9.总体X ~N (μ,σ2),σ2已知,问需抽取容量n 多大的样本,才能使μ的置信概率为1-α,且置信区间的长度不大于L ? 10.设某种砖头的抗压强度X ~N (μ,σ2),今随机抽取20块砖头,测得数据如下(kg ·cm -2):64 69 49 92 55 97 41 84 88 99 84 66 100 98 72 74 87 84 48 81 (1) 求μ的置信概率为0.95的置信区间. (2) 求σ2的置信概率为0.95的置信区间. 11.设总体X ~f (x )=(1),01;10,.x x θθθ⎧+<<>-⎨⎩其中其他 X 1,X 2,…,X n 是X 的一个样本,求θ的矩估计量及极大似然估计量. (1997年研考)12.设总体X ~f (x )= 36(),0;0,.xx x θθθ⎧-<<⎪⎨⎪⎩其他X 1,X 2,…,X n 为总体X 的一个样本(1) 求θ的矩估计量;(2) 求ˆ()D θ. (1999研考) 13.设某种电子元件的使用寿命X 的概率密度函数为f (x ,θ)= 2()2,0;0,.e x x x θθ--⎧>⎨≤⎩其中θ(θ>0)为未知参数,又设x 1,x 2,…,x n 是总体X 的一组样本观察值,求θ的极大似然估计值. (2000研考)估计值和极大似然估计值. (2002研考)15.设总体X 的分布函数为F (x ,β)=1,,0,.x xx ββααα⎧->⎪⎨⎪<⎩其中未知参数β>1,α>0,设X 1,X 2,…,X n 为来自总体X 的样本(1) 当α=1时,求β的矩估计量;(2) 当α=1时,求β的极大似然估计量;(3) 当β=2时,求α的极大似然估计量. (2004研考) 16.从正态总体X ~N (3.4,62)中抽取容量为n 的样本,如果其样本均值位于区间(1.4,5.4)内的概率不小于0.95,问n 至少应取多大?2/2()d zt z t ϕ-=⎰(1998研考)17. 设总体X 的概率密度为f (x ,θ)=,01,1,12,0,.x x θθ<<⎧⎪-≤<⎨⎪⎩其他 其中θ是未知参数(0<θ<1),X 1,X 2,…,X n 为来自总体X 的简单随机样本,记N 的样本值x 1,x 2,…,x n 中小于1的个数.求: (1) θ的矩估计;(2) θ的最大似然估计. (2006研考)。
第7章参数估计
![第7章参数估计](https://img.taocdn.com/s3/m/853acd01312b3169a551a44e.png)
所以重量的标准差的95%的置信区间
√︁
√︁
为[
12*0.230256 23.337
,
12*0.230256 4.403
]
=
[0.3441,
0.7922]。
即,我们约有95%的把握估计该品牌袋装大米重量的标准
差������在0.3441千克到0.7922千克之间。
参数估计的基本原理 点估计 区间估计
=0.31 ± 1.645
2
������
100
=0.31 ± 0.07608
=(23.39%, 38.61%)
即,我们约有90%的把握估计全校学生戴眼镜比 例������在23.39%到38.61%之间。
R的计算结果: 90 percent confidence interval: 0.2340092, 0.3946717
假定A品牌袋装大米的重量服从正态分布,现随机抽取13袋大 米,测得其重量(单位:千克)分别为
⎛ 24, 24.2, 24.4, 24.6, 24.7, ⎞ ⎝ 24.8, 25, 25.1, 25.1, 25.2, ⎠
25.3, 25.4, 25.6.
分别计算该品牌袋装大米的重量的均值,及重量的标准差 的95%的置信区间。
参数估计的基本原理 点估计 区间估计
一个总体参数的区间估计 总体均值的区间估计 总体比例的区间估计 总体方差的区间估计
两个总体参数的区间估计 两个总体均值之差的区间估计 两个总体比例之差的区间估计 两个总体方差之比的区间估计
样本量������的确定 估计总体均值是样本量的确定 估计总体比例时是样本量的确定
2������
∑︁ ������������
������=1
第七章__参数估计
![第七章__参数估计](https://img.taocdn.com/s3/m/088781e04afe04a1b071dedd.png)
三、区间估计与标准误
㈠区间估计的定义 是根据样本统计量,利用抽样分布的原理,在一定的
可靠程度上,估计出总体参数所在的范围,即以数 轴上的一段距离表示未知参数可能落入的范围。 ㈡置信区间与显著性水平 ⑴置信区间:也称置信间距,指在一定可靠程度上,总体参
数所在的区域距离或区域长度。
⑵置信界限(临界值):置信区间的上下两端点值。 ⑶显著性水平:指估计总体参数落在某一区间时,可能犯错
⑶区间估计的原理是样本分布理论。在计算区间估计值解释估 计的正确概率时,依据的是该样本统计量的分布规律及样本 分布的标准误。样本分布可提供概率解释,而标准误的大小 决定区间估计的长度。一般情况下,加大样本容量可使标准 误变小。
当总体方差已知时,样本平均数的分布为正态分布或
渐近正态分布,此时,样本平均数的平均数uX u, 平均数的离散程度即平均数分布的标准差(简称
例4
解:由题意知,其总体方差未知,但其总体分布为正态分布,
则此样本均数的分布服从t分布, 可以依t分布对总平 均身高μ进行估计。
SEX
S 4.8 0.81; df n 1 36 1 35 n 1 35
查t值表可知 : t0.05 230 2.042;t0.01 230 2.75
例2 已知某区15 岁男生立定跳远的方差 为 436.8cm ,现从该区抽取58名15岁男生, 测得该组男生立定跳远的平均数为198.4cm, 试求该区15岁男生立定跳远平均成绩的95%和 99%的置信区间。
例2
解:由题意知:由于样本容量(n=58)大于30 ,
该样本的抽样分布为渐进正态分布。
SEX
因此, 的95%的置信区间为 :
82 2.0211.12 82 2.0211.12
- 1、下载文档前请自行甄别文档内容的完整性,平台不提供额外的编辑、内容补充、找答案等附加服务。
- 2、"仅部分预览"的文档,不可在线预览部分如存在完整性等问题,可反馈申请退款(可完整预览的文档不适用该条件!)。
- 3、如文档侵犯您的权益,请联系客服反馈,我们会尽快为您处理(人工客服工作时间:9:00-18:30)。
7 - 5 -88
估计量与估计值
7 - 6 -88
估计量与估计值
(estimator & estimated value)
1. 估计量:用于估计总体参数的统计量
如样本均值,样本比例、样本方差等 例如: 样本均值就是总体均值 的一个估计量
ˆ 表示 2. 参数用 表示,估计量用 3. 估计值:估计参数时计算出来的统计量的 具体值
D(1 ) D( 2 )
^ ^
量,有更小标准差的估计量更有效
ˆ) P(
ˆ1 的抽样分布
B A
ˆ2 的抽样分布
ˆ
7 - 14 -88
一致性
(consistency)
一致性:随着样本容量的增大,估计量的 ^ lim P(| | ) 1 值越来越接近被估计的总体参数 n
我们只能是希望这个区间是大量包含总体参数真 值的区间中的一个,但它也可能是少数几个不包 含参数真值的区间中的一个
7 - 20 -88
置信区间与置信水平
均值的抽样分布
/2
x
1 –
/2
x
(1 - ) % 区间包含了
x
% 的区间未包含
7 - 21 -88
影响区间宽度的因素
x z
2
s 7.77 39.5 1.645 n 36 39.5 2.13 37.37,41.63
投保人平均年龄的置信区间为37.37岁~41.63岁
7 - 24 -88
略
7 - 25 -88
7.2 一个总体参数的区间估计 ------略
7.2.1 总体均值的区间估计 7.2.2 总体比例的区间估计 7.2.3 总体方差的区间估计
^ ^
7 - 11 -88
评价估计量的标准
7 - 12 -88
无偏性
(unbiasedness)
无偏性:估计量抽样分布的数学期望等于被 ^ 估计的总体参数 E ( )
ˆ) P(
无偏 有偏
A
B
7 - 13 -88
ˆ
有效性
(efficiency)
有效性:对同一总体参数的两个无偏点估计
25袋食品的重量
112.5
102.6 100.0 116.6
101.0
107.5 123.5 95.4
103.0
95.0 102.0 97.8 101.5
102.0
108.8 101.6 108.6 98.4
100.5
115.6 102.2 105.0 93.3
136.8 7 - 30 -88 102.8
(例题分析)
【例】某城市想 要估计下岗职工 中女性所占的比 例,随机地抽取 了100名下岗职 工,其中 65 人为 女性职工。试以 95% 的置信水平 估计该城市下岗 职工中女性比例 的置信区间
7 - 41 -88
解:已知 n=100,p=65% , 1- = 95%, z/2=1.96
p z
2. 使用正态分布统计量 z x z ~ N (0,1) n 3. 总体均值 在1- 置信水平下的置信区间为 s x z 2 或 x z 2 ( 未知) n n
7 - 29 -88
总体均值的区间估计
(例题分析)
【 例 】一家食品生产企业以生产袋装食品为主,为对产量质 量进行监测,企业质检部门经常要进行抽检,以分析每袋重 量是否符合要求。现从某天生产的一批食品中随机抽取了25 袋,测得每袋重量如下表所示。已知产品重量的分布服从正 态分布,且总体标准差为 10g 。试估计该批产品平均重量的 置信区间,置信水平为95%
该食品平均重量的置信区间为101.44g~109.28g
7 - 31 -88
总体均值的区间估计
(例题分析)
【例】一家保险公司收集到由 36 投保个人组成的随 机样本,得到每个投保人的年龄(周岁)数据如下表。 试建立投保人年龄90%的置信区间
36个投保人年龄的数据
23 36 42 34 39 34
35 42 53 28 49 39
如果样本均值 x =80,则80就是的估计值
7 - 7 -88
点估计与区间估计
7 - 8 -88
参数估计的方法
估 计 方 法
点
估
计
区间估计
矩估计法 顺序统计量法 极大似然法 最小二乘法
7 - 9 -88
点估计
(point estimate)
1. 用样本的估计量直接作为总体参数的估计值
例如:用样本均值直接作为总体均值的估计
2
p (1 p ) n
总体均值的区间估计
(例题分析)
解:已知X~N(,102),n=25, 1- = 95%,z/2=1.96。根 据样本数据计算得:x 105.36 总体均值在1-置信水平下的置信区间为
x z
2
10 105.36 1.96 n 25 105.36 3.92 101.44,109.28
7 - 26 -88
一个总体参数的区间估计
总体参数
符号表示
样本统计量
x p
s
2
均值
比例
2
方差
7 - 27 -88
总体均值的区间估计
(正态总体、2已知,或非正态总体、大样本)
7 - 28 -88
总体均值的区间估计
(大样本)
1. 假定条件
总体服从正态分布,且方差(2) 已知 如果不是正态分布,可由正态分布来近似 (n 30)
总体服从二项分布 可以由正态分布来近似
2.
使用正态分布统计量 z p z ~ N (0,1) (1 ) n 3. 总体比例在1-置信水平下的置信区间为
p z 2
7 - 40 -88
(1 )
n
或 p z 2
p(1 - p) ( 未知时) n
总体比例的区间估计
16灯泡使用寿命的数据
1510 1450 1480 1460
7 - 37 -88
1520 1480 1490 1460
1480 1510 1530 1470
1500 1520 1510 1470
总体均值的区间估计
(例题分析)
解:已知X~N(,2),n=16, 1- = 95%,t/2=2.131 根据样本数据计算得:x 1490 , s 24.77 总体均值在1-置信水平下的置信区间为
为是总体参数未在区间内的比例
相应的 为0.01,0.05,0.10
3. 常用的置信水平值有 99%, 95%, 90%
7 - 19 -88
置信区间
(confidence interval)
1. 由样本统计量所构造的总体参数的估计区间称 为置信区间 2. 统计学家在某种程度上确信这个区间会包含真 正的总体参数,所以给它取名为置信区间 3. 用一个具体的样本所构造的区间是一个特定的 区间,我们无法知道这个样本所产生的区间是 否包含总体参数的真值
标准正态分布
标准正态分布
t (df = 13)
t 分布
t (df = 5)
z
t 分布与标准正态分布的比较xຫໍສະໝຸດ 不同自由度的t分布t
7 - 36 -88
总体均值的区间估计
(例题分析)
【例】已知某种灯泡的寿命服从正态分布,现从一 批灯泡中随机抽取 16只,测得其使用寿命(小时)如 下。建立该批灯泡平均使用寿命95%的置信区间
区间估计的图示
x z 2 x x z 2
正态分布 方差已知
n
x
x
90% 95% 99%
x +1.65x
x +2.58x
x - 2.58x x -1.65 x x -1.96 x
x +1.96x
7 - 18 -88
置信水平
1. 将构造置信区间的步骤重复很多次,置 信区间包含总体参数真值的次数所占的 比例称为置信水平 2. 表示为 (1 -
ˆ) P(
较大的样本容量
B A
较小的样本容量
7 - 15 -88
ˆ
区间估计(枢轴量法)
(interval estimate)
在点估计的基础上,给出总体参数估计的一个区间 范围,该区间由样本统计量加减抽样误差 x n 而得到的 2. 根据样本统计量的抽样分布能够对样本统计量与总体 参数的接近程度给出一个概率度量 1.
36个投保人年龄的数据
23 36 42 34 39 34
35 42 53 28 49 39
39 46 45 39 38 45
27 43 54 36 34 48
36 31 47 44 48 45
44 33 24 40 50 32
7 - 23 -88
总体均值的区间估计
(例题分析)
解:已知n=36, 1- = 90%,z/2=1.645。根据样本数 据计算得: x 39.5 ,s 7.77 总体均值在1- 置信水平下的置信区间为
7 - 2 -88
参数估计在统计方法中的地位
统计方法
描述统计 推断统计
参数估计
7 - 3 -88
假设检验
统计推断的过程
总体
样 本
样本统计量
如:样本均值 、比例、方差
7 - 4 -88
7.1 参数估计的一般问题
7.1.1 估计量与估计值 7.1.2 点估计与区间估计 7.1.3 评价估计量的标准
x t
2
s 24.77 1490 2.131 n 16 1490 13.2 1476.8,1503.2