多总体均值向量的检验

[大谦MATLAB,dqmatlab点com]

1.两正态总体均值向量的检验

(1)两总体协方差相等(但未知)时均值向量的检验

设X(a)(a=1,…,n)为来自总体X~Np(μ(1),Σ)的随机样本;Y(a) (a=1,…,m)为来自总体Y~Np(μ(2),Σ)的随机样本,且相互独立,Σ未知。检验

H0∶μ(1)=μ(2), H1∶μ(1)≠μ(2)

统计量

\[{T}^{2}=(n+m-2)\frac{nm}{n+m}(\overline{X}-\overline{Y})'({A}_{1}+{A}_{2}{)}^{-1}(\overline{X}-\overline{Y})\~{T}^{2}(p,n+m-2)\]

利用T2与F的关系,检验统计量取为

\[F=\frac{(n+m-2)-p+1}{(n+m-2)p}{T}^{2}\~F(p,n+m-p-1)\]

(2)两总体协方差矩阵不等时均值向量的检验

当n=m时,作为成对数据进行处理。令

\[{Z}_{(i)}={X}_{(i)}-{Y}_{\left( i \right)} (i=1,\cdots,n)\]

将两个总体化为单个p元总体Z的均值检验问题

H0∶μ(1)=μ(2), H1∶μ(1)≠μ(2)

当n≠m时(不妨设n<m):

\({Z}_{(i)}={X}_{(i)}-\sqrt{\frac{n}{m}}{Y}_{(i)}+\frac{1}{\sqrt{nm}}\sum_{j=1}^{n} {{Y}_{(j)}}-\frac{1}{m}\sum_{j=1}^{m} {{Y}_{(j)}}\)

\({Z}_{(i)}\~{N}_{p}({\mu}^{\left( 1 \right)}-{\mu}^{\left( 2 \right)},{\Sigma}_{z})\) (i=1, …,n)且相互独立。

为了研究日、美两国在华投资企业对经营环境的评价是否存在差异,下面从两国投资企业中各抽出10家,让其对政治、经济、法律、文化等环境进行打分,评分结果如表3-2所示(序号1~10为美国在华投资企业的代号,11~20为日本在华投资企业的代号。数据来源于:国务院发展研究中心APEC在华投资企业情况调查)。

表3-2 日、美两国在华投资企业对经营环境的评价数据

序 号 政治环境 经济环境 法律环境 文化环境
1 65 35 25 60
2 75 50 20 55
3 60 45 35 65
4 75 40 40 70
5 70 30 30 50
6 55 40 35 65
7 60 45 30 60
8 65 40 25 60
9 60 50 30 70
10 55 55 35 75
11 55 55 40 65
12 50 60 45 70
13 45 45 35 75
14 50 50 50 70
15 55 50 30 75
16 60 40 45 60
17 65 55 45 75
18 50 60 35 80
19 40 45 30 65
20 45 50 45 70

假定两总体方差相同:

在命令窗口中输入

code.matlab
>> x=[65 35 25 60;75 50 20 55;60 45 35 65;75 40 40 70;70 30 30 50;55 40 35 65;60 45 30 60;65 40 25 60;60 50 30 70;55 55 35 75];
>> y=[55 55 40 65;50 60 45 70;45 45 35 75;50 50 50 70;55 50 30 75;60 40 45 60;65 55 45 75;50 60 35 80;40 45 30 65;45 50 45 70];
>> n=10;
>> m=10;
>> mx=mean(x)'
>> my=mean(y)'
>> A1=cov(x)*(n-1)
>> A2=cov(y)*(m-1)
>> A=A1+A2;
>> mxy=mx-my;
>> D2=mxy'*inv(A)*mxy;
>> D2=(n+m-2)*D2
>> T2=n*m*D2/(m+n)
>> p=4;
>> f=(n+m-p-1)*T2/((n+m-2)*p)
>> p=1-fcdf(f,p,n+m-p-1)
mx =
   64.0000
   43.0000
   30.5000
   63.0000
my =
   51.5000
   51.0000
   40.0000
   70.5000
A1 =
  490.0000 -170.0000 -120.0000 -245.0000
 -170.0000  510.0000   10.0000  310.0000
 -120.0000   10.0000  322.5000  260.0000
 -245.0000  310.0000  260.0000  510.0000
A2 =
  502.5000   60.0000  175.0000   -7.5000
   60.0000  390.0000   50.0000  195.0000
  175.0000   50.0000  450.0000 -100.0000
   -7.5000   195.0000 -100.0000  322.5000
D2 =
    5.9725
T2 =
   29.8625
f =
    6.2214
p =
    0.0037

显著性概率p小于0.01,所以拒绝零假设,认为日、美两国在华投资企业对中国经营环境的评价存在显著性差异。

假定两总体方差不相同:

在命令窗口中输入

code.matlab
>> x=[65 35 25 60;75 50 20 55;60 45 35 65;75 40 40 70;70 30 30 50;55 40 35 65;60 45 30 60;65 40 25 60;60 50 30 70;55 55 35 75];
>> y=[55 55 40 65;50 60 45 70;45 45 35 75;50 50 50 70;55 50 30 75;60 40 45 60;65 55 45 75;50 60 35 80;40 45 30 65;45 50 45 70];
>> z=x-y;
>> n=10;
>> mz=mean(z);
>> T2=(n-1)*n*mz*inv((n*cov(z,1)))*mz'
>> p=4;
>> f=(n-p)*T2/((n-1)*p)
>> p=1-fcdf(f,p,n-p)
T2 =
   31.5536
f =
    5.2589
p =
    0.0364

显著性概率p小于0.05,所以在显著性水平0.05下拒绝零假设,认为日、美两国在华投资企业对中国经营环境的评价存在显著性差异。

当n不等于m时,将x的第10行删除,这样n<m。

在命令窗口中输入

code.matlab
>> x=[65 35 25 60;75 50 20 55;60 45 35 65;75 40 40 70;70 30 30 50;55 40 35 65;60 45 30 60;65 40 25 60;60 50 30 70;55 55 35 75];
>> y=[55 55 40 65;50 60 45 70;45 45 35 75;50 50 50 70;55 50 30 75;60 40 45 60;65 55 45 75;50 60 35 80;40 45 30 65;45 50 45 70];
>> n=9;
>> m=10;
>> x([10],:)=[];
>> z=x-sqrt(n/m)*y([1:9],:)+sqrt(1/(n*m))*repmat(sum(y([1:9],:)),n,1)-1/m*repmat(sum(y),n,1)
>> mz=mean(z);
>> cv= n*cov(z,1);
>> T2=(n-1)*n*mz*inv(cv)*mz'
>> p=4;
>> f=(n-p)*T2/((n-1)*p)
>> p=1-fcdf(f,p,n-p)
z =
   10.8648  -19.6893  -15.5270   -5.2295
   25.6082   -9.4327  -25.2705  -14.9730
   15.3516   -0.2025   -0.7836   -9.7164
   25.6082   -9.9459  -10.0139    0.0270
   15.8648  -19.9459   -1.0402  -24.7164
   -3.8786   -0.4591  -10.2705    4.5139
   -3.6221   -9.6893  -15.2705  -14.7164
   15.6082  -19.4327  -10.7836  -19.4598
   20.0950    4.7975   -1.0402    4.7705
T2 =
   31.4529
f =
    4.9145
p =
    0.0554

在显著性水平0.05下接受零假设。

2.多个正态总体均值向量的检验——多元方差分析

有k个p元总体Np(μ(i),Σ)(假定k个总体的协方差矩阵相等,且记为Σ),记第i个p元总体的数据矩阵为

\[{X}^{(i)}=\left[ \begin{matrix} {x}_{11}^{(i)} & \cdots & {x}_{1p}^{(i)} \\ \vdots & & \vdots \\ {x}_{{n}_{i}1}^{(i)} & \cdots & {x}_{{n}_{i}p}^{(p)} \end{matrix} \right]=\left[ \begin{matrix} {X}_{(1)}^{(i)}' \\ \vdots \\ {X}_{({n}_{i})}^{(i)}' \end{matrix} \right]\begin{matrix} , & (i=1,\cdots,k) \end{matrix}\]

对总离差矩阵T进行分解:

\[T=\sum_{i-1}^{k} {\sum_{j=1}^{{n}_{j}} {({X}_{(j)}^{(i)}-\overline{X})({X}_{(j)}^{(i)}-\overline{X})'}}=\sum_{i=1}^{k} {\sum_{j=1}^{{n}_{i}} {({X}_{(j)}^{(i)}-{\overline{X}}^{(i)})({X}_{(j)}^{(i)}-{\overline{X}}^{(i)})}}'+\sum_{i=1}^{k} {\sum_{j=1}^{{n}_{i}} {({\overline{X}}^{(i)}-\overline{X})({\overline{X}}^{(i)}-\overline{X})'}}=\sum_{i=1}^{k} {{A}_{i}+\sum_{i=1}^{k} {{n}_{i}({\overline{X}}^{(i)}-\overline{X})({\overline{X}}^{(i)}-\overline{X})'}}=A+B\]

其中\(A=\sum_{i=1}^{k} {{A}_{i}}\)被称为组内离差矩阵,\(B=\sum_{i=1}^{k} {{n}_{i}({\overline{X}}^{(i)}-\overline{X})({\overline{X}}^{(i)}-\overline{X})'}\)被称为组间离差矩阵。

根据直观想法以及用似然比原理得到检验H0的统计量为

\[\Lambda=\frac{\left| A \right|}{\left| A+B \right|}=\frac{\left| A \right|}{\left| T \right|}\]

在H0下,

\[\Lambda=\frac{\left| A \right|}{\left| A+B \right|}\~\Lambda(p,n-k,k-1)\]

当k1=2时,可转换为F统计量进行检验,即

\[F=\frac{n-k-p+1}{p}\cdot\frac{1-\sqrt{\Lambda\left( p,n,2 \right)}}{\sqrt{\Lambda\left( p,n,2 \right)}}=F(2p,2(n-k-p+1))\]

为了研究某种疾病,对一批人同时测量了4个指标:β脂蛋白(X1),甘油三酯(X2),α脂蛋白(X3),前β脂蛋白(X4)。按不同年龄、性别分为三组(20~35岁的女性、20~25岁的男性和35~50岁的男性),具体数据见表3-3。试问这三组的4项指标之间有无显著性差异(α=0.01)?

表3-3 身体指标化验数据

X1 X2 X3 X4 X1 X2 X3 X4 X1 X2 X3 X4
260 75 40 18 1 310 122 30 21 2 320 64 39 17 3
200 72 34 17 1 310 60 35 18 2 260 59 37 11 3
240 87 45 18 1 190 40 27 15 2 360 88 28 26 3
170 65 39 17 1 225 65 34 16 2 295 100 36 12 3
270 110 39 24 1 170 65 37 16 2 270 65 32 21 3
205 130 34 23 1 210 82 31 17 2 380 114 36 21 3
190 69 27 15 1 280 67 37 18 2 240 55 42 10 3
200 46 45 15 1 210 38 36 17 2 260 55 34 20 3
250 117 21 20 1 280 65 30 23 2 260 110 29 20 3
200 107 28 20 1 200 76 40 17 2 295 73 33 21 3
225 130 36 11 1 200 76 39 20 2 240 114 38 18 3
210 125 26 17 1 280 94 26 11 2 310 103 32 18 3
170 64 31 14 1 190 60 33 17 2 330 112 21 11 3
270 76 33 13 1 295 55 30 16 2 345 127 24 20 3
190 60 34 16 1 270 125 24 21 2 250 62 22 16 3
280 81 20 18 1 280 120 32 18 2 260 59 21 19 3
310 119 25 15 1 240 62 32 20 2 225 100 34 30 3
270 57 31 8 1 280 69 29 20 2 345 120 36 18 3
250 67 31 14 1 370 70 30 20 2 360 107 25 23 3
260 135 39 29 1 280 40 37 17 2 250 117 36 16 3

解 在命令窗口中输入

code.matlab
>> xg1=[260 75 40 18;200 72 34 17;240 87 45 18;170 65 39 17;270 110 39 24;205 130 34 23;190 69 27 15;200 46 45 15;250 117 21 20;200 107 28 20;225 130 36 11;210 125 26 17;170 64 31 14;270 76 33 13;190 60 34 16;280 81 20 18;310 119 25 15;270 57 31 8;250 67 31 14;260 135 39 29];
>> xg2=[310 122 30 21; 310 60 35 18;190 40 27 15;225 65 34 16;170 65 37 16;210 82 31 17;280 67 37 18;210 38 36 17;280 65 30 23;200 76 40 17;200 76 39 20;280 94 26 11;190 60 33 17;295 55 30 16;270 125 24 21;280 120 32 18;240 62 32 20;280 69 29 20;370 70 30 20;280 40 37 17];
>> xg3=[320 64 39 17;260 59 37 11;360 88 28 26;295 100 36 12;270 65 32 21;380 114 36 21;240 55 42 10;260 55 34 20;260 110 29 20;295 73 33 21;240 114 38 18;310 103 32 18;330 112 21 11;345 127 24 20;250 62 22 16;260 59 21 19;225 100 34 30;345 120 36 18;360 107 25 23;250 117 36 16];
>> k=3;
>> n=60;
>> nn=20;
>> A1= cov(xg1,1)*nn;
>> A2= cov(xg2,1)*nn;
>> A3= cov(xg3,1)*nn;
>> A=A1+A2+A3;
>> T= cov([xg1;xg2;xg3],1)*n
>> lm=det(A)/det(T)
>> p=4;
>> f=(n-k-p+1)*(1-sqrt(lm))/(p*sqrt(lm))
>;> %计算显著性概率,若小于0.01,则否定原假设
>> p=1-fcdf(f,2*p,2*(n-k-p+1))
>;> %考察三个组指标之间的差异由哪些指标引起
>> f1=((T(1)-A(1))/(k-1))/(A(1)/(n-k))
>> p1=1-fcdf(f1,k-1,n-k)
>> f2=((T(2)-A(2))/(k-1))/(A(2)/(n-k))
>> p2=1-fcdf(f2,k-1,n-k)
>> f3=((T(3)-A(3))/(k-1))/(A(3)/(n-k))
>> p3=1-fcdf(f3,k-1,n-k)
A =
  1.0e+005 *
   1.25408750000000   0.23278500000000  -0.03950750000000   0.01748000000000
   0.23278500000000   0.40466950000000  -0.01937750000000   0.02166300000000
  -0.03950750000000  -0.01937750000000   0.02082500000000  -0.00026900000000
   0.01748000000000   0.02166300000000  -0.00026900000000   0.01024400000000
T =
  1.0e+005 *
   1.64474583333333   0.25586416666667  -0.04674833333333   0.02534000000000
   0.25586416666667   0.44484183333333  -0.01973566666667   0.02139400000000
  -0.04674833333333  -0.01973566666667   0.02095933333333  -0.00041600000000
   0.02534000000000   0.02139400000000  -0.00041600000000   0.01041600000000
lm =
   0.66212289123034
f =
   3.09069070964615
p =
   0.00353843714961
f1 =
   8.87797900864176
p1 =
4.400760766427592e-004
f2 =
    2.8256
p2 =
    0.0676
f3 =
    5.2234
p3 =
    0.0083

显著性概率p小于0.01,所以拒绝零假设,认为3个组的指标之间有显著差异。p1和p3小于0.01,说明第一项和第三项指标(特别是第一项指标)引起3个组指标之间的差异。