[大谦MATLAB,dqmatlab点com]
1.两正态总体均值向量的检验
(1)两总体协方差相等(但未知)时均值向量的检验
设X(a)(a=1,…,n)为来自总体X~Np(μ(1),Σ)的随机样本;Y(a) (a=1,…,m)为来自总体Y~Np(μ(2),Σ)的随机样本,且相互独立,Σ未知。检验
H0∶μ(1)=μ(2), H1∶μ(1)≠μ(2)
统计量
利用T2与F的关系,检验统计量取为
(2)两总体协方差矩阵不等时均值向量的检验
当n=m时,作为成对数据进行处理。令
将两个总体化为单个p元总体Z的均值检验问题
H0∶μ(1)=μ(2), H1∶μ(1)≠μ(2)
当n≠m时(不妨设n<m):
令 \({Z}_{(i)}={X}_{(i)}-\sqrt{\frac{n}{m}}{Y}_{(i)}+\frac{1}{\sqrt{nm}}\sum_{j=1}^{n} {{Y}_{(j)}}-\frac{1}{m}\sum_{j=1}^{m} {{Y}_{(j)}}\)
有 \({Z}_{(i)}\~{N}_{p}({\mu}^{\left( 1 \right)}-{\mu}^{\left( 2 \right)},{\Sigma}_{z})\) (i=1, …,n)且相互独立。
为了研究日、美两国在华投资企业对经营环境的评价是否存在差异,下面从两国投资企业中各抽出10家,让其对政治、经济、法律、文化等环境进行打分,评分结果如表3-2所示(序号1~10为美国在华投资企业的代号,11~20为日本在华投资企业的代号。数据来源于:国务院发展研究中心APEC在华投资企业情况调查)。
表3-2 日、美两国在华投资企业对经营环境的评价数据
| 序 号 | 政治环境 | 经济环境 | 法律环境 | 文化环境 |
|---|---|---|---|---|
| 1 | 65 | 35 | 25 | 60 |
| 2 | 75 | 50 | 20 | 55 |
| 3 | 60 | 45 | 35 | 65 |
| 4 | 75 | 40 | 40 | 70 |
| 5 | 70 | 30 | 30 | 50 |
| 6 | 55 | 40 | 35 | 65 |
| 7 | 60 | 45 | 30 | 60 |
| 8 | 65 | 40 | 25 | 60 |
| 9 | 60 | 50 | 30 | 70 |
| 10 | 55 | 55 | 35 | 75 |
| 11 | 55 | 55 | 40 | 65 |
| 12 | 50 | 60 | 45 | 70 |
| 13 | 45 | 45 | 35 | 75 |
| 14 | 50 | 50 | 50 | 70 |
| 15 | 55 | 50 | 30 | 75 |
| 16 | 60 | 40 | 45 | 60 |
| 17 | 65 | 55 | 45 | 75 |
| 18 | 50 | 60 | 35 | 80 |
| 19 | 40 | 45 | 30 | 65 |
| 20 | 45 | 50 | 45 | 70 |
假定两总体方差相同:
在命令窗口中输入
>> x=[65 35 25 60;75 50 20 55;60 45 35 65;75 40 40 70;70 30 30 50;55 40 35 65;60 45 30 60;65 40 25 60;60 50 30 70;55 55 35 75];
>> y=[55 55 40 65;50 60 45 70;45 45 35 75;50 50 50 70;55 50 30 75;60 40 45 60;65 55 45 75;50 60 35 80;40 45 30 65;45 50 45 70];
>> n=10;
>> m=10;
>> mx=mean(x)'
>> my=mean(y)'
>> A1=cov(x)*(n-1)
>> A2=cov(y)*(m-1)
>> A=A1+A2;
>> mxy=mx-my;
>> D2=mxy'*inv(A)*mxy;
>> D2=(n+m-2)*D2
>> T2=n*m*D2/(m+n)
>> p=4;
>> f=(n+m-p-1)*T2/((n+m-2)*p)
>> p=1-fcdf(f,p,n+m-p-1)
mx =
64.0000
43.0000
30.5000
63.0000
my =
51.5000
51.0000
40.0000
70.5000
A1 =
490.0000 -170.0000 -120.0000 -245.0000
-170.0000 510.0000 10.0000 310.0000
-120.0000 10.0000 322.5000 260.0000
-245.0000 310.0000 260.0000 510.0000
A2 =
502.5000 60.0000 175.0000 -7.5000
60.0000 390.0000 50.0000 195.0000
175.0000 50.0000 450.0000 -100.0000
-7.5000 195.0000 -100.0000 322.5000
D2 =
5.9725
T2 =
29.8625
f =
6.2214
p =
0.0037
显著性概率p小于0.01,所以拒绝零假设,认为日、美两国在华投资企业对中国经营环境的评价存在显著性差异。
假定两总体方差不相同:
在命令窗口中输入
>> x=[65 35 25 60;75 50 20 55;60 45 35 65;75 40 40 70;70 30 30 50;55 40 35 65;60 45 30 60;65 40 25 60;60 50 30 70;55 55 35 75];
>> y=[55 55 40 65;50 60 45 70;45 45 35 75;50 50 50 70;55 50 30 75;60 40 45 60;65 55 45 75;50 60 35 80;40 45 30 65;45 50 45 70];
>> z=x-y;
>> n=10;
>> mz=mean(z);
>> T2=(n-1)*n*mz*inv((n*cov(z,1)))*mz'
>> p=4;
>> f=(n-p)*T2/((n-1)*p)
>> p=1-fcdf(f,p,n-p)
T2 =
31.5536
f =
5.2589
p =
0.0364
显著性概率p小于0.05,所以在显著性水平0.05下拒绝零假设,认为日、美两国在华投资企业对中国经营环境的评价存在显著性差异。
当n不等于m时,将x的第10行删除,这样n<m。
在命令窗口中输入
>> x=[65 35 25 60;75 50 20 55;60 45 35 65;75 40 40 70;70 30 30 50;55 40 35 65;60 45 30 60;65 40 25 60;60 50 30 70;55 55 35 75];
>> y=[55 55 40 65;50 60 45 70;45 45 35 75;50 50 50 70;55 50 30 75;60 40 45 60;65 55 45 75;50 60 35 80;40 45 30 65;45 50 45 70];
>> n=9;
>> m=10;
>> x([10],:)=[];
>> z=x-sqrt(n/m)*y([1:9],:)+sqrt(1/(n*m))*repmat(sum(y([1:9],:)),n,1)-1/m*repmat(sum(y),n,1)
>> mz=mean(z);
>> cv= n*cov(z,1);
>> T2=(n-1)*n*mz*inv(cv)*mz'
>> p=4;
>> f=(n-p)*T2/((n-1)*p)
>> p=1-fcdf(f,p,n-p)
z =
10.8648 -19.6893 -15.5270 -5.2295
25.6082 -9.4327 -25.2705 -14.9730
15.3516 -0.2025 -0.7836 -9.7164
25.6082 -9.9459 -10.0139 0.0270
15.8648 -19.9459 -1.0402 -24.7164
-3.8786 -0.4591 -10.2705 4.5139
-3.6221 -9.6893 -15.2705 -14.7164
15.6082 -19.4327 -10.7836 -19.4598
20.0950 4.7975 -1.0402 4.7705
T2 =
31.4529
f =
4.9145
p =
0.0554
在显著性水平0.05下接受零假设。
2.多个正态总体均值向量的检验——多元方差分析
有k个p元总体Np(μ(i),Σ)(假定k个总体的协方差矩阵相等,且记为Σ),记第i个p元总体的数据矩阵为
对总离差矩阵T进行分解:
其中\(A=\sum_{i=1}^{k} {{A}_{i}}\)被称为组内离差矩阵,\(B=\sum_{i=1}^{k} {{n}_{i}({\overline{X}}^{(i)}-\overline{X})({\overline{X}}^{(i)}-\overline{X})'}\)被称为组间离差矩阵。
根据直观想法以及用似然比原理得到检验H0的统计量为
在H0下,
当k1=2时,可转换为F统计量进行检验,即
为了研究某种疾病,对一批人同时测量了4个指标:β脂蛋白(X1),甘油三酯(X2),α脂蛋白(X3),前β脂蛋白(X4)。按不同年龄、性别分为三组(20~35岁的女性、20~25岁的男性和35~50岁的男性),具体数据见表3-3。试问这三组的4项指标之间有无显著性差异(α=0.01)?
表3-3 身体指标化验数据
| X1 | X2 | X3 | X4 | 组 | X1 | X2 | X3 | X4 | 组 | X1 | X2 | X3 | X4 | 组 |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 260 | 75 | 40 | 18 | 1 | 310 | 122 | 30 | 21 | 2 | 320 | 64 | 39 | 17 | 3 |
| 200 | 72 | 34 | 17 | 1 | 310 | 60 | 35 | 18 | 2 | 260 | 59 | 37 | 11 | 3 |
| 240 | 87 | 45 | 18 | 1 | 190 | 40 | 27 | 15 | 2 | 360 | 88 | 28 | 26 | 3 |
| 170 | 65 | 39 | 17 | 1 | 225 | 65 | 34 | 16 | 2 | 295 | 100 | 36 | 12 | 3 |
| 270 | 110 | 39 | 24 | 1 | 170 | 65 | 37 | 16 | 2 | 270 | 65 | 32 | 21 | 3 |
| 205 | 130 | 34 | 23 | 1 | 210 | 82 | 31 | 17 | 2 | 380 | 114 | 36 | 21 | 3 |
| 190 | 69 | 27 | 15 | 1 | 280 | 67 | 37 | 18 | 2 | 240 | 55 | 42 | 10 | 3 |
| 200 | 46 | 45 | 15 | 1 | 210 | 38 | 36 | 17 | 2 | 260 | 55 | 34 | 20 | 3 |
| 250 | 117 | 21 | 20 | 1 | 280 | 65 | 30 | 23 | 2 | 260 | 110 | 29 | 20 | 3 |
| 200 | 107 | 28 | 20 | 1 | 200 | 76 | 40 | 17 | 2 | 295 | 73 | 33 | 21 | 3 |
| 225 | 130 | 36 | 11 | 1 | 200 | 76 | 39 | 20 | 2 | 240 | 114 | 38 | 18 | 3 |
| 210 | 125 | 26 | 17 | 1 | 280 | 94 | 26 | 11 | 2 | 310 | 103 | 32 | 18 | 3 |
| 170 | 64 | 31 | 14 | 1 | 190 | 60 | 33 | 17 | 2 | 330 | 112 | 21 | 11 | 3 |
| 270 | 76 | 33 | 13 | 1 | 295 | 55 | 30 | 16 | 2 | 345 | 127 | 24 | 20 | 3 |
| 190 | 60 | 34 | 16 | 1 | 270 | 125 | 24 | 21 | 2 | 250 | 62 | 22 | 16 | 3 |
| 280 | 81 | 20 | 18 | 1 | 280 | 120 | 32 | 18 | 2 | 260 | 59 | 21 | 19 | 3 |
| 310 | 119 | 25 | 15 | 1 | 240 | 62 | 32 | 20 | 2 | 225 | 100 | 34 | 30 | 3 |
| 270 | 57 | 31 | 8 | 1 | 280 | 69 | 29 | 20 | 2 | 345 | 120 | 36 | 18 | 3 |
| 250 | 67 | 31 | 14 | 1 | 370 | 70 | 30 | 20 | 2 | 360 | 107 | 25 | 23 | 3 |
| 260 | 135 | 39 | 29 | 1 | 280 | 40 | 37 | 17 | 2 | 250 | 117 | 36 | 16 | 3 |
解 在命令窗口中输入
>> xg1=[260 75 40 18;200 72 34 17;240 87 45 18;170 65 39 17;270 110 39 24;205 130 34 23;190 69 27 15;200 46 45 15;250 117 21 20;200 107 28 20;225 130 36 11;210 125 26 17;170 64 31 14;270 76 33 13;190 60 34 16;280 81 20 18;310 119 25 15;270 57 31 8;250 67 31 14;260 135 39 29];
>> xg2=[310 122 30 21; 310 60 35 18;190 40 27 15;225 65 34 16;170 65 37 16;210 82 31 17;280 67 37 18;210 38 36 17;280 65 30 23;200 76 40 17;200 76 39 20;280 94 26 11;190 60 33 17;295 55 30 16;270 125 24 21;280 120 32 18;240 62 32 20;280 69 29 20;370 70 30 20;280 40 37 17];
>> xg3=[320 64 39 17;260 59 37 11;360 88 28 26;295 100 36 12;270 65 32 21;380 114 36 21;240 55 42 10;260 55 34 20;260 110 29 20;295 73 33 21;240 114 38 18;310 103 32 18;330 112 21 11;345 127 24 20;250 62 22 16;260 59 21 19;225 100 34 30;345 120 36 18;360 107 25 23;250 117 36 16];
>> k=3;
>> n=60;
>> nn=20;
>> A1= cov(xg1,1)*nn;
>> A2= cov(xg2,1)*nn;
>> A3= cov(xg3,1)*nn;
>> A=A1+A2+A3;
>> T= cov([xg1;xg2;xg3],1)*n
>> lm=det(A)/det(T)
>> p=4;
>> f=(n-k-p+1)*(1-sqrt(lm))/(p*sqrt(lm))
>> %计算显著性概率,若小于0.01,则否定原假设
>> p=1-fcdf(f,2*p,2*(n-k-p+1))
>> %考察三个组指标之间的差异由哪些指标引起
>> f1=((T(1)-A(1))/(k-1))/(A(1)/(n-k))
>> p1=1-fcdf(f1,k-1,n-k)
>> f2=((T(2)-A(2))/(k-1))/(A(2)/(n-k))
>> p2=1-fcdf(f2,k-1,n-k)
>> f3=((T(3)-A(3))/(k-1))/(A(3)/(n-k))
>> p3=1-fcdf(f3,k-1,n-k)
A =
1.0e+005 *
1.25408750000000 0.23278500000000 -0.03950750000000 0.01748000000000
0.23278500000000 0.40466950000000 -0.01937750000000 0.02166300000000
-0.03950750000000 -0.01937750000000 0.02082500000000 -0.00026900000000
0.01748000000000 0.02166300000000 -0.00026900000000 0.01024400000000
T =
1.0e+005 *
1.64474583333333 0.25586416666667 -0.04674833333333 0.02534000000000
0.25586416666667 0.44484183333333 -0.01973566666667 0.02139400000000
-0.04674833333333 -0.01973566666667 0.02095933333333 -0.00041600000000
0.02534000000000 0.02139400000000 -0.00041600000000 0.01041600000000
lm =
0.66212289123034
f =
3.09069070964615
p =
0.00353843714961
f1 =
8.87797900864176
p1 =
4.400760766427592e-004
f2 =
2.8256
p2 =
0.0676
f3 =
5.2234
p3 =
0.0083
显著性概率p小于0.01,所以拒绝零假设,认为3个组的指标之间有显著差异。p1和p3小于0.01,说明第一项和第三项指标(特别是第一项指标)引起3个组指标之间的差异。