跳转至

10.6成对数据的统计分析

本页由讲义拆分版 TeX 初步转换生成;答案默认收起。

讲义正文

成对数据的统计分析

最小二乘法

十八世纪末,天文学和大地测量经常遇到一种困境,比如一条行星轨道方程只由几个参数决定,但天文学家手上有海量的观测记录,由于观测总有误差,无论怎么选取参数,都会与一部分观测数据产生矛盾。显然观测误差是无法避免的,那么如何确定轨道方程的参数呢?

一种思路是,确定一条轨道曲线,使得它与所有观测数据的偏差尽可能小,也就是让误差的平方和最小(因误差有正有负,但二者不可抵消)。这便是最小二乘法(Least Squares Method)。

1805 年,法国数学家勒让德在《计算彗星轨道的新方法》中正式提出并命名了最小二乘法,这是该方法第一次公开发表。而高斯则声称自己从 1795 年起就已使用这一方法\footnote{今天一般认为,他们各自独立发现了这一方法,高斯使用更早,勒让德发表更早。},并据此算出了谷神星的轨道。他在1809 年出版的《天体运动论》中系统阐述了最小二乘法,并给出了理论支撑:当观测误差服从正态分布时,最小二乘估计在统计意义下是最优的.后来的高斯–马尔科夫定理则从理论上进一步巩固了最小二乘的地位:在误差零均值、互不相关、同方差的线性模型中,最小二乘估计是所有线性无偏估计中方差最小的,即最佳线性无偏估计。今天,最小二乘法已经成为回归分析、曲线拟合、信号处理以及机器学习中最基础、最常用的工具之一。

已知成对观测数据\(\displaystyle (x_1, y_1), (x_2, y_2), \dots, (x_n, y_n)\),可将它们视为平面直角坐标系中的 \(\displaystyle n\) 个点.希望找到一条直线 \(\displaystyle Y = a + bX\),使得对每一个 \(\displaystyle x_i (i=1, 2, \dots, n)\),由这个直线方程计算得到的预测值 \(\displaystyle a + bx_i\) 与实际观测值 \(\displaystyle y_i\) 的差距(这称为第\(\displaystyle i\)个数据的残差)整体最小.

记第\(\displaystyle i\)个数据的残差为 \(\displaystyle \mathrm{e}_i = y_i - (a + bx_i)\),我们希望所有残差的绝对值之和最小,即最小化\(\displaystyle \sum_{i=1}^n |\mathrm{e}_i|\),该优化目标在数学上是合理的,但在实际计算中却不方便.我们考虑使用残差平方和作为衡量标准,即通过确定\(\displaystyle a,b\)的取值以最小化$\(\displaystyle \sum_{i=1}^{n}\mathrm{e}_i^{2}=\sum_{i=1}^{n}(y_i - (a + bx_i))^2\)$ 这一优化目标可导,是凸函数,且对离群点敏感度较高(平方级增长)。

先研究简单的情形,考虑 \(\displaystyle 3\) 对数据 \(\displaystyle (x_1, y_1), (x_2, y_2), (x_3, y_3)\),求 \(\displaystyle a, b\) 的值以最小化 $\(\displaystyle \sum_{i=1}^{3}(y_i - (a + bx_i))^2\)$

用向量解决这一问题.设偏差向量 $\(\displaystyle \vv{e}&=(y_1 - (a + bx_1), y_2 - (a + bx_2), y_3 - (a + bx_3)) &=(y_1,y_2,y_3)-a(1,1,1)-b(x_1,x_2,x_3) &=\vv{y}-a\vv{1}-b\vv{x}\)$

问题简化为求 \(\displaystyle a, b\) 的值以最小化\(\displaystyle |\vv{e}|\),设\(\displaystyle \vv{OY}=\vv{y},\vv{OI}=\vv{1},\vv{OX}=\vv{x}\),\(\displaystyle \vv{OY},\vv{OI},\vv{OX}\)均为已知向量,记\(\displaystyle \alpha\)为过点\(\displaystyle O,I,X\)的平面,当\(\displaystyle a,b\)任意取值时,\(\displaystyle a\vv{OI}+b\vv{OX}\)可以表示这一平面内的任意一条向量。于是当\(\displaystyle |\vv{e}|=|\vv{OY} - (a\vv{OI} + b\vv{OX})|\)取到最小值时,一定有\(\displaystyle \vv{e}\perp \alpha\),此时 \(\displaystyle \vv{e} \cdot \vv{OI} = 0 ,\vv{e} \cdot \vv{OX} = 0\),即 $\(\displaystyle \begin{cases} [(y_1, y_2, y_3) - a(1, 1, 1) - b(x_1, x_2, x_3)] \cdot (1, 1, 1) = 0 \\ [(y_1, y_2, y_3) - a(1, 1, 1) - b(x_1, x_2, x_3)] \cdot (x_1, x_2, x_3) = 0 \end{cases}\)$

解得$\(\displaystyle \hat{b} = \frac{\sum_{i=1}^3 x_i y_i - 3\overline{x}\overline{y}}{\sum_{i=1}^3 x_i^2 - 3\overline{x}^2},\hat{a} = \overline{y} - \hat{b}\overline{x}\)$

推广为 \(\displaystyle n\) 对数据 \(\displaystyle (x_1, y_1), (x_2, y_2), \dots, (x_n, y_n)\) 时,直觉地猜测,使得 \(\displaystyle \sum_{k=1}^{n}[y_k - (a + bx_k)]^2\) 最小化的 \(\displaystyle a, b\) 取值应当为 $\(\displaystyle \hat{b} = \frac{\sum_{i=1}^n x_i y_i - n\overline{x}\overline{y}}{\sum_{i=1}^n x_i^2 - n\overline{x}^2},\hat{a} = \overline{y} - \hat{b}\overline{x}\)$

类比先前的步骤,设\(\displaystyle \vv{y} = (y_1, y_2, \cdots, y_n)^T,\vv{1} = (1, \cdots, 1)^T,\vv{x} = (x_1, \cdots, x_n)^T\).\(\displaystyle \vv{z}=a\vv{1}+b\vv{x}\),于是\(\displaystyle \vv{e}=\vv{y}-\vv{z}\).\(\displaystyle \vv{1},\vv{x}\)张成一个二维子平面\(\displaystyle W\),我们断言,\(\displaystyle \|\vv{e}\|\)取到最小值当且仅当\(\displaystyle \vv{e}\)正交于平面\(\displaystyle W\)中的任意向量,即 \(\displaystyle \vv{e}\cdot \vv{1} = 0, \vv{e}\cdot \vv{x} = 0(*)\).

证明

\(\displaystyle a_0,b_0\)使得\(\displaystyle \vv{z}_0 = a_0\vv{1}+b_0\vv{x}\)\(\displaystyle \vv{y}-\vv{z}_0\)正交于平面\(\displaystyle W\)中的任意向量,于是$\(\displaystyle \|\vv{e}\|^2 = \|\vv{y} - \vv{z}\|^2=\|\vv{y}-\vv{z}_0+\vv{z}_0-\vv{z}\|^2=\|\vv{y}-\vv{z}_0\|^2+\|\vv{z}_0-\vv{z}\|^2\geqslant \|\vv{y}-\vv{z}_0\|^2\)$

\(\displaystyle (*)\)式变形即可得到结论.

样本相关系数

给定随机变量 \(\displaystyle X\)\(\displaystyle Y\),可知,若 \(\displaystyle X\)\(\displaystyle Y\) 的线性相关性好,则观测值\(\displaystyle y_i\)和预测值\(\displaystyle \hat{a} + \hat{b}x_i\) 的差距应该很小,最理想的情况是

\(\displaystyle y_i = \hat{a} + \hat{b}x_i,i=1,2,\cdots,n\)

又有\(\displaystyle \overline{y} = \hat{a} + \hat{b}\overline{x}\),将其代入上式,消去\(\displaystyle \hat{a}\),得

\(\displaystyle y_i - \overline{y} = \hat{b}(x_i - \overline{x}),i=1,2,\cdots,n\)

记向量 \(\displaystyle \vv{u} = (x_1 - \overline{x}, x_2 - \overline{x}, \cdots,x_n-\overline{x})\),\(\displaystyle \vv{v} = (y_1 - \overline{y}, y_2 - \overline{y},\cdots, y_n - \overline{y})\),则上式可记为 \(\displaystyle \vv{v} = \hat{b}\vv{u}\).这表明线性回归方程最理想的情况是向量 \(\displaystyle \vv{u}, \vv{v}\) 共线.因此可以考虑用向量 \(\displaystyle \vv{u}, \vv{v}\) 夹角的大小来刻画 \(\displaystyle X\)\(\displaystyle Y\) 线性相关的程度,记

\(\displaystyle r = \cos \langle \vv{u}, \vv{v} \rangle = \frac{\vv{u} \cdot \vv{v}}{|\vv{u}| |\vv{v}|} = \frac{\sum_{i=1}^n(x_1 - \overline{x})(y_1 - \overline{y})}{\sqrt{\sum_{i=1}^{n}(x_i-\overline x)^2}\sqrt{\sum_{i=1}^{n}(y_i-\overline y)^2}}\)

上式也可简化为

\(\displaystyle r= \frac{\sum_{i=1}^n x_i y_i - n\overline{x}\overline{y}}{\sqrt{\sum_{i=1}^n x_i^2 - n\overline{x}^2} \sqrt{\sum_{i=1}^n y_i^2 - n\overline{y}^2}}\)

根据柯西不等式的一般形式可以得到\(\displaystyle |r| \leqslant 1\)\(\displaystyle |r|\) 越接近 \(\displaystyle 1\),说明 \(\displaystyle X\)\(\displaystyle Y\) 的线性相关性越强;\(\displaystyle |r|\) 越接近 \(\displaystyle 0\),说明 \(\displaystyle X\)\(\displaystyle Y\) 的线性相关性越弱.

A 组习题

B 组习题

C 组习题

D 组习题