基于Excel搞懂置信区间计算——从理论到实操一文搞定置信区间
背景
参数估计是推断统计的重要内容,是在抽样和抽样分布的基础上,根据统计量来推断我们所关心的总体参数。在很多时候,我们难以获得研究总体的数据,只能抽取一部分样本进行处理,进而通过样本提供的信息来推断总体的数量特征。但是这个值只是一个点的值,称为点估计。所以我们需要一个区间来确定,这个点估计的可靠性怎么样,这个估计到底有多准呢?这个就是区间估计。
在区间估计中,我们相信由样本统计量所构造的总体参数的估计区间会包括真正的总体参数,所以叫做置信区间,最小值称为置信下限,最大值称为置信上限。
理论基础
置信区间是一种统计学上的概念,是概率的另外一种表述,用于估计未知总体参数(如均值、比例、方差等)的可能取值范围。它是由样本统计量(如样本均值、样本比例等)计算出来的、具有一定可信程度的数值区间。
函数曲线下68.27%的面积在平均数左右的一个标准差范围内,从49.98-82.42,,95.45%的面积在平均数左右两个标准差的范围内,从32.26-99.14。99.73%的面积在平均数左右三个标准差的范围内,从15.54-115.86。99.99%的面积在平均数左右四个标准差的范围内。
置信区间与一个特定的概率水平相关联,通常用百分比表示,如90%、95%或99%。这个概率水平反映了我们对区间估计的信赖程度,反映了我们对未知参数值的认识程度及其不确定性。置信区间反映在重复抽样的过程中,总体参数的真实值落在所构造区间内的概率等于指定的置信水平。例如,对于一个95%的置信区间,我们可以说“有95%的把握认为,该区间包含了总体参数的真实值”。
置信水平定义为减去您在统计检验中使用的 alpha (α) 值:
因此,如果使用 p < 0.05 的 alpha 值作为统计显着性,则置信水平将为 1 − 0.05 = 0.95,即 95%。
置信区间是估计值的平均值加上减去该估计值的变异值。这是在一定置信度内重做测试时预计估计值介于两者之间的值范围。
其中:
-
样本均值是根据样本数据计算出的统计量,用来估计总体均值。所以样本构建的置信区间是不固定的,所以置信区间是一个随机空间。置信区间是为了捕捉未来参数来撒出的网,不是所有网都能够捕捉到参数。
-
在实际中,我们通常只抽取一个样本,基于该样本构建一定水平下的置信区间,不是随机区间(很多次抽样),所以无法知道该区间是否包含总体参数的真值。所以可能含真值,也可能不含。
-
-
如果用某种方法构造的所有区间中有95%的区间包含总体参数
-
标准误差(SE)衡量样本均值围绕总体均值的波动程度,通常等于总体标准差(如果已知)或样本标准差除以样本大小的平方根(如果总体标准差未知)。
置信区间有助于量化不确定性,为决策者提供了一个可以接受的风险水平下的参数估计范围。
一个总体参数的置信区间计算
下面以正态总体、方差未知、大样本/小样本已知的情况进行分析说明。
(1)正态总体、方差已知,或非正态总体、大样本
正态总体、方差已知,或非正态总体、大样本,所以说样本均值
的抽样分布为正态分析,经过标准化处理后服从标准正态分布。
图 正态分布95%置信水平
,我们可以使用Z分数来标准化它:
比如α为5%,那么1-α为95%,其概率区间即为P(-1.96<P<1.96),也就是P(-1.96<P<1.96)=0.95。而0.025概率对应的值为-1.96,可以用Excel公式=NORM.INV(0.025,0,1)进行验算。
将Z值代入上面公式,我们得到:
(2)正态总体、方差未知、小样本
因为正态总体、方差未知、小样本,所以说样本均值
的抽样分布为正态分析,因为是小样本,所以使用t分布。
基于Excel的置信区间实操计算
产品质量检测
一家食品生产企业以生产袋装食品为主,每天的产量大约为8000袋左右。按规定每袋的重量应为100g。为对产量质量进行监测,企业质检部门经常要进行抽检,以分析每袋重量是否符合要求。已知产品重量的分布服从正态分布,且总体标准差为10g。试估计该天产品平均重量的置信区间,置信水平为95%。
根据样本数据,计算得到样本均值为105.36,总体标准差为10。所以其估计误差等于:
其置信区间为101.44-109.28。所以我们在95%的水平上认为该批产品重量不符合要求。
在Excel中,如何计算统计误差呢?使用CONFIDENCE.NORM 函数。
在Excel中,CONFIDENCE.NORM 函数用于计算在指定的置信水平下,总体均值的置信区间。这个函数特别有用,当你知道总体标准差时,可以用来估计总体均值的可能范围。
CONFIDENCE.NORM(confidence_level, standard_dev, size)
-
confidence_level:置信水平,以小数形式表示。例如,95%的置信水平应该输入为0.95。
-
standard_dev:总体标准差。
-
size:样本大小。
返回值,该函数返回在指定的置信水平下,总体均值的置信区间的边际或估计误差。
从上图中可以看到,均值、标准差、样本数量、置信水平确定下,使用=CONFIDENCE.NORM(1-C6,C4,C5)进行计算,得到估计误差为3.9199,与手算结果一致。
学生身高的置信区间估计
假设我们想要估计一个学校所有学生的平均身高。由于测量每一个学生的身高既不现实也不经济,因此我们采用抽样的方法。我们随机抽取了20名学生,并记录了他们的身高数据。通过这些数据,我们计算出样本均值
为162厘米,样本标准差
为12厘米。
我们希望在95%的置信水平下,估计学生平均身高的置信区间。因为是小样本,总体不可知,所以使用t分布。在此,使用CONFIDENCE.T计算估计误差。与CONFIDENCE.NORM不同,CONFIDENCE.T 适用于小样本量的情况,并且它使用t分布来考虑样本标准差的不确定性。
CONFIDENCE.T(confidence_level, standard_dev, size)
-
confidence_level:置信水平,以小数形式表示。例如,对于95%的置信水平,你应该输入0.95。
-
standard_dev:样本标准差。
-
size:样本大小。
返回值,该函数返回在指定的置信水平下,总体均值的置信区间的边际误差或估计误差。
从上图中可以看到,t分布双尾检验,自由度为19,累积概率为0.975,其临界值为2.093,手算结果为5.62,与CONFIDENCE.T计算结果一致。
所以该学校学生95%置信水平下的学生身高为【156.38,168.62】
知识点分析
- 置信区间的原理和推导过程
- 置信区间的手算
- Excel的CONFIDENCE.NORM和CONFIDENCE.T函数
- 采用两个大样本和小样本案例进行实例演示分析