ARTICLE · 1116166
353 真题解析(二)
今天晚上打开手机一看,粉丝破 2500 了。
感谢大家一直以来的关注,大晚上临时决定加更一期。
这次讲一道多重线性回归的练习题。
一、先来看看题目
大家可以先自己做一下,别急着往下翻,其实不算什么难题。
某研究调查 48 名大学生,收集其平均每日睡眠时长(X₁,小时)、每周运动时长(X₂,小时)、平均每日屏幕使用时长(X₃,小时),以及疲劳评分 Y。疲劳评分越高,表示疲劳程度越重。
研究将 3 个自变量同时纳入模型,采用含截距的普通最小二乘多重线性回归,分析上述生活习惯与疲劳评分的线性关联。
假定线性关系、误差独立、正态且方差齐等条件成立,自变量不存在完全共线性。结果见表 1、表 2。
表 1 多重线性回归的方差分析表
表 2 偏回归系数及其检验结果
题目要求:
(1)补全表 1。自由度写整数,其余待填数值保留两位小数。
(2)写出回归方程,并选用合适指标评价模型的拟合效果。
(3)取 α=0.05,写出回归方程整体 F 检验的假设、统计量、自由度及结论。
二、第一问:先别急着算平方和,先把自由度搞清楚
1. 回归自由度是不是“3−1”
有同学看到“3 个自变量”,很自然的就往下写:
很好,本题 0 分了。如果你也是这么想的,那请你现在、立刻、马上,打开课本 P189 页!
你大概率是和随机区组设计方差分析弄混了。
这里的 3,表示模型里有 3 个自变量,也就是 3 个斜率参数。
它并不表示“分了 3 个处理组”。
把总体回归模型写出来,就清楚了:
本题需要估计多少个回归参数?
一个截距 ,再加上三个斜率 、、,一共 4 个参数。
因此,残差自由度为:
合计自由度为:
剩下的回归自由度就是:
所以,本题回归、残差、合计的自由度依次为:
2. 为什么估计了 4 个参数,回归自由度却只有 3?
这是一个很容易混淆的地方。
整体 F 检验,是把:
含截距和所有自变量的完整模型与只有截距(常数项)的模型进行比较,如果你学的比较扎实的话,你会发现,这个检验思想实际上和 Logistic 回归的似然比检验是一致的。
因此真正新增并接受整体检验的,是那 3 个斜率参数。
所以,回归自由度等于斜率参数个数,而不是总参数个数。
当然,对于大部分情况下,做题你只需要记住回归自由度等于自变量个数就行。
多重线性回归方差分析中的自由度为:
整体 F 检验的两个自由度也就是:
本题有 3 个自变量,所以:
因此:
还有一个非常好用的检查方法:
本题就是:
算完自由度,顺手加一下,能避免不少低级错误。
三、都是 F 检验,为什么随机区组设计的自由度不一样?
这正是很多同学容易串台的地方。
1. 随机区组设计的符号
设:
有 个处理组; 有 个区组; 每个区组中每种处理安排一个实验单位。
因此,总观测数为:
在不含处理与区组交互作用的加性模型下,总自由度为:
其中:
处理自由度为:
区组自由度为:
剩下的就是误差自由度:
所以,这里的“两个减一再相乘”是有明确来源的。而不是理所当然的。
2. 把两种 F 检验放在一起比较
举个例子。 同样是 48 个观测值。
如果像本题一样,是 48 名研究对象、纳入 3 个自变量,那么多重线性回归整体 F 检验的自由度为:
但如果换成另一项实验:3 个处理;16 个区组
那么总观测数同样是:
但处理效应 F 检验的自由度却是:
样本量都是 48,自由度却完全不同。
四、现在我们继续吧!
自由度弄清楚之后,第一问剩下的就很直接了。
1. 计算回归平方和
2. 计算均方
回归均方:
残差均方:
3. 计算 F 值
所以:
4. 完整的填入表中
对应七个空:
①264.00,②3,③44,④47,⑤88.00,⑥4.00,⑦22.00。
五、第二问:回归方程怎么写,拟合效果怎么看?
1. 写出估计回归方程
由表 2 中的未标准化偏回归系数,得到估计回归方程:
这里要注意:
如果不写残差的话,最好把 Y 的“小帽子”带上,表示这是估计值。
写回归方程时,用的是表中的未标准化偏回归系数,不要把标准化回归系数带入了!
2. X₃ 没有统计学意义,要不要从方程里删掉?
表中:
有同学会故意谨慎的多想一步:
X₃ 没有统计学意义,写回归方程时是不是应该把它删掉?
很显然不能直接删。
题目让你写的是表中这个已经拟合完成的模型,因此 X₃ 仍然属于模型的一部分,方程中当然要保留。
如果决定删掉 X₃,那就应该重新拟合一个只包含 X₁、X₂ 的模型。
而删掉一个自变量以后,其余变量的偏回归系数也会随之变化,就不是现在这个偏回归系数了。
所以不能在原来的方程上简单去掉
3. 用什么指标评价拟合效果?
最直接的指标是 决定系数 。
代入本题数据:
也就是说:
该模型解释了这批样本中疲劳评分总变异的 60%。
一定要注意表述!
你可以说:
模型解释了样本中 Y 总变异的 60%。
但不能说:
60% 的疲劳是由这三个因素导致的。
更不能说:
模型的预测准确率为 60%。
4. 调整后的决定系数
对于多重线性回归,还可以报告调整后的决定系数:
本题中:
因此:
为什么多重线性回归中还常常要看调整后的 ?
因为对于普通最小二乘回归,在同一批样本上增加自变量后,普通 通常不会下降。所以单纯靠增加变量,就可能让 看起来越来越大。
调整后的 会对模型中自变量的数量进行一定校正,因此在比较复杂程度不同的模型时更有参考价值。
不过考场上你大概率没空算,所以了解知道就行。
这一问可以写成:
模型的 ,表示该回归模型可以解释样本中疲劳评分总变异的 60%;调整后的 约为 0.57。模型具有一定的解释能力,但拟合是否满足研究目的,还需结合残差诊断和具体实际综合评价。
题目里面说“不存在多重共线性”,那我们就不写了,否则的话也可以多提一嘴。总之严谨一些没坏处。
六、第三问:整体 F 检验到底在检验什么?
按照假设检验的标准步骤来写。
1. 建立检验假设
本题有 3 个自变量,即:
整体 F 检验的原假设为:
备择假设为:
取检验水准(千万别忘了写!ps:其实是我自己经常忘嘻嘻):
2. 计算检验统计量
整体 F 统计量为:
本题:
在 成立且题设模型条件满足时:
本题即:
所以检验统计量为:
写检验统计量的时候别忘了在旁边写自由度!保持优雅!
3. 根据 P 值作出结论
由表可知:
因此,在 的检验水准下,拒绝 。
可以写成:
在 水准下,这三个自变量构成的回归方程整体解释大学生疲劳评分有统计学意义。
七、整体 F 检验显著,不等于每个自变量都显著
这个地方也是考试和实际分析中非常常见的误区。
整体 F 检验显著以后,不能接着写:
“三个自变量都与疲劳评分有关。”
看看表 2 就知道了。
X₁ 的偏回归系数检验有统计学意义; X₂ 的偏回归系数检验有统计学意义; X₃ 的偏回归系数检验无统计学意义。
但整体 F 检验仍然可以有统计学意义。
这两件事完全不矛盾。
至此,这道题三问全部结束。