概率是用来刻画不确定性的工具
频率主义:独立重复试验中随机事件发生频率的极限
局限:若随机事件非可重复怎么办?
下一轮学科评估,华科计算机得 A+ 的概率有多大?
明天大 A 股上涨的概率有多大?
今年祖国统一的概率有多大?
我们有一些观测
根据这些观测,我们对上页问题的概率会有自己的判断
贝叶斯主义:概率是观测者对随机事件发生的主观信念 (belief)
\begin{align} \underbrace{p(\Theta|X)}_{后验} & = \frac{\overbrace{p(X|\Theta)}^{似然} \overbrace{p(\Theta)}^{先验}}{\underbrace{p(X)}_{证据}} = \frac{p(X|\Theta) p(\Theta) }{\int p(X|\Theta) p(\Theta) \diff \Theta} \end{align}
$\Theta$为参数或模型,$X$为训练数据
\begin{align} \underbrace{p(\Theta|X)}_{后验} & = \frac{\overbrace{p(X|\Theta)}^{似然} \overbrace{p(\Theta)}^{先验}}{\underbrace{p(X)}_{证据}} = \frac{p(X|\Theta) p(\Theta) }{\int p(X|\Theta) p(\Theta) \diff \Theta} \end{align}
根据是否利用先验,有两种估计$\Theta$的方式:
前者为频率主义者的做法,后者为贝叶斯主义者的做法
以抛硬币为例,记$\theta = p(\textrm{正面})$,观测$X$:$t$次抛掷中有$k$次正面
频率主义:
贝叶斯主义:
观测$X$:$t$次抛掷中有$k$次正面,似然是二项式分布
\begin{align} p(X | \theta) = \binom{t}{k} \theta^k (1 - \theta)^{t-k} \end{align}
假设某次观测抛了$10$次全正,根据极大似然有$\theta^{\ml} = 1$
预测:该硬币抛掷$100\%$都是正面
观测$X$:$t$次抛掷中有$k$次正面,似然$p(X | \theta) = \binom{t}{k} \theta^k (1 - \theta)^{t-k}$
先验取参数为$(\alpha,\beta)$的贝塔分布:
\begin{align} p(\theta) & = \BetaDist(\theta|\alpha,\beta) \\ & = \frac{\theta^{\alpha - 1} (1-\theta)^{\beta - 1}}{\int_0^1 \theta^{\alpha - 1} (1-\theta)^{\beta - 1} \diff \theta} \\ & = \frac{\theta^{\alpha - 1} (1-\theta)^{\beta - 1}}{\BetaFunc(\alpha,\beta)} \end{align}
分母$\BetaFunc(\alpha,\beta) = \int_0^1 \theta^{\alpha - 1} (1-\theta)^{\beta - 1} \diff \theta$是第一类欧拉积分,归一化用
证据和后验分别为
\begin{align} p(X) & = \int_0^1 p(\theta) p(X|\theta) \diff \theta = \binom{t}{k} \frac{1}{\BetaFunc(\alpha,\beta)} \int_0^1 \theta^{\alpha + k - 1} (1 - \theta)^{\beta + t-k-1} \diff \theta \\ & = \binom{t}{k} \frac{\BetaFunc(\alpha+k,\beta+t-k)}{\BetaFunc(\alpha,\beta)} \end{align}
\begin{align} p(\theta|X) = \frac{p(\theta) p(X|\theta)}{p(X)} = \frac{\theta^{\alpha + k - 1} (1-\theta)^{\beta + t - k - 1}}{\BetaFunc(\alpha+k,\beta+t-k)} = \BetaDist(\theta|\alpha+k,\beta+t-k) \end{align}
后验
\begin{align} p(\theta|X) = \frac{\theta^{\alpha + k - 1} (1-\theta)^{\beta + t - k - 1}}{\BetaFunc(\alpha+k,\beta+t-k)} = \BetaDist(\theta|\alpha+k,\beta+t-k) \end{align}
若目标就是估计$\theta$,采用 MAP 估计:$\theta^{\map} = \argmax_\theta ~ p(\theta|X)$
若目标是对下次抛硬币的结果$\xh$做预测,有两种做法:
\begin{align} p(\xh|X) = \int p(\xh|\theta) p(\theta|X) \diff \theta \end{align}
若有一组模型$\{ \mc_i \}_{i=1,2,\ldots}$,如何选择?
频率主义者:$\dc = \dc_{\train} \uplus \dc_{\val}$,$\mc_i \xrightarrow[训练]{\dc_{\train}} \theta_i \xrightarrow[验证]{\dc_{\val}} (\mc^\star, \theta^\star)$
局限:数据不能全部用来训练模型,数据利用率不高
贝叶斯主义者
\begin{align} p (\mc_i | \dc) = \frac{p(\dc | \mc_i) p(\mc_i)}{p(\dc)} = \frac{p(\dc | \mc_i) p(\mc_i)}{\sum_j p(\dc | \mc_j) p(\mc_j)} \end{align}
模型选择:最大后验,$\mc = \argmax_{\mc_i} p (\mc_i | \dc)$
模型平均:未知样本$\xh$的预测分布为
\begin{align} p (\xh | \dc) & = \sum_i p (\xh | \mc_i, \dc) p (\mc_i | \dc) \\ & = \sum_i \underbrace{\left( \int p (\xh | \mc_i, \theta_i) p (\theta_i | \mc_i, \dc) \diff \theta_i \right)}_{单个模型的预测分布} p (\mc_i | \dc) \end{align}
贝叶斯主义者
\begin{align} p (\mc_i | \dc) = \frac{p(\dc | \mc_i) p(\mc_i)}{p(\dc)} = \frac{p(\dc | \mc_i) p(\mc_i)}{\sum_j p(\dc | \mc_j) p(\mc_j)} \end{align}
先验:如果对模型没有特别的偏好,$p(\mc_i)$可以选均匀分布
似然:$p(\dc | \mc_i)$恰是推断参数$\theta_i$时贝叶斯公式 (下式) 的分母,称为模型证据 (model evidence),在选定参数$\theta_i$的先验后,模型$\mc_i$生成数据$\dc$的概率
\begin{align} p (\theta_i | \dc, \mc_i) = \frac{p(\dc | \theta_i, \mc_i) p(\theta_i | \mc_i)}{p(\dc | \mc_i)} = \frac{p(\dc | \theta_i, \mc_i) p(\theta_i | \mc_i)}{\int p(\dc | \theta_i, \mc_i) p(\theta_i | \mc_i) \diff \theta_i} \end{align}
之前推断参数$\theta_i$的贝叶斯公式中没有将$\mc_i$显式写出来,因为它是公式中所有概率的条件变量
模型后验几率:先验几率与模型证据比值的乘积,后者也称为贝叶斯因子 (Bayes factor)
\begin{align} \frac{p(\mc_1 | \dc)}{p(\mc_2 | \dc)} = \frac{p(\mc_1)}{p(\mc_2)} \cdot \frac{p(\dc | \mc_1)}{p(\dc | \mc_2)} = \frac{p(\mc_1)}{p(\mc_2)} \cdot \frac{\int p(\dc | \theta_1, \mc_1) p(\theta_1 | \mc_1) \diff \theta_1}{\int p(\dc | \theta_2, \mc_2) p(\theta_2 | \mc_2) \diff \theta_2} \end{align}
不同人对模型有不同的偏好,将贝叶斯因子公布,其他人可根据自己的先验几率计算后验几率从而选择模型
优点:只需计算模型证据$p(\dc | \mc_i)$即可完成模型选择,所有数据都可用于训练,不用再分出一部分作为验证集
以抛硬币为例
\begin{align} p(\dc | \mc_1) & = \binom{100}{60} \frac{1}{2^{100}} \approx 0.010843866711637987 \\ p(\dc | \mc_2) & = \int_0^1 p(\dc | \theta, \mc_2) p(\theta | \mc_2) \diff \theta = \int_0^1 \binom{100}{60} \theta^{60} (1 - \theta)^{40} \frac{\theta (1-\theta)}{\BetaFunc(2,2)} \diff \theta \\ & = \binom{100}{60} \frac{\BetaFunc(62,42)}{\BetaFunc(2,2)} \approx 0.014141848222515001 \end{align}
数据给出的证据更利于$\mc_2$
\begin{align} \underbrace{p(\dc | \mc)}_{模型证据} \underbrace{p(\theta | \dc, \mc)}_{参数后验} = \underbrace{p(\dc | \theta, \mc)}_{参数似然} \underbrace{p(\theta | \mc)}_{参数先验} \end{align}
\begin{align} p(\dc | \mc) & \approx p(\dc | \theta^{\map}, \mc) \frac{\Delta_{\posterior}}{\Delta_{\prior}} \\ & \Longrightarrow \ln p(\dc | \mc) \approx \ln p(\dc | \theta^{\map}, \mc) + \ln \frac{\Delta_{\posterior}}{\Delta_{\prior}} \end{align}
朴素贝叶斯通过极大似然估计$p(y), ~ p(x_1 | y), ~ \ldots, ~ p(x_d | y)$
记$\alpha_k = p(y = k)$,于是$\sum_{k \in [c]} \alpha_k = 1$且
\begin{align} p(y | \alpha_k) = \prod_{k \in [c]} p(y = k)^{\ib(y=k)} = \prod_{k \in [c]} \alpha_k^{\ib(y=k)} \end{align}
是分类分布,伯努利分布的多元扩展,$c=2$即为伯努利分布
伯努利分布呈$\theta^\spadesuit (1-\theta)^\heartsuit$的形式,共轭先验是贝塔分布
\begin{align} \BetaDist(\theta|\alpha,\beta) = \frac{\theta^{\alpha - 1} (1-\theta)^{\beta - 1}}{\int_0^1 \theta^{\alpha - 1} (1-\theta)^{\beta - 1} \diff \theta} = \frac{\theta^{\alpha - 1} (1-\theta)^{\beta - 1}}{\BetaFunc(\alpha,\beta)} \end{align}
分类分布的共轭先验是贝塔分布的多元扩展?
伽玛函数 (第二类欧拉积分) 和贝塔函数 (第一类欧拉积分):
\begin{align} & \Gamma(m) = \int_0^\infty \theta^{m - 1} \exp(- \theta) \diff \theta \\ & \BetaFunc(\alpha,\beta) = \int_0^1 \theta^{\alpha - 1} (1-\theta)^{\beta - 1} \diff \theta = \frac{\Gamma(\alpha) \Gamma(\beta)}{\Gamma(\alpha+\beta)} \end{align}
由贝塔函数可导出贝塔分布
\begin{align} \BetaDist(\theta|\alpha,\beta) = \frac{\theta^{\alpha - 1} (1-\theta)^{\beta - 1}}{\BetaFunc(\alpha,\beta)} = \frac{\Gamma(\alpha+\beta)}{\Gamma(\alpha) \Gamma(\beta)} \theta^{\alpha - 1} (1-\theta)^{\beta - 1} \end{align}
贝塔分布的多元扩展为狄利克雷分布
\begin{align} \Dir(\alphav | \mv) = \frac{\Gamma(m_1 + \cdots + m_c)}{\Gamma(m_1) \cdots \Gamma(m_c)} \prod_{k \in [c]} \alpha_k^{m_k - 1}, \quad \sum_{k \in [c]} \alpha_k = 1 \end{align}
记$\alpha_k = p(y = k)$,于是
\begin{align} p(y | \alphav) = \prod_{k \in [c]} p(y = k)^{\ib(y=k)} = \prod_{k \in [c]} \alpha_k^{\ib(y=k)}, \quad \sum_{k \in [c]} \alpha_k = 1 \end{align}
设$\alphav$服从参数为$\mv$的狄利克雷分布:
\begin{align} p(\alphav) = \Dir(\alphav | \mv) = \frac{\Gamma(m_1 + \cdots + m_c)}{\Gamma(m_1) \cdots \Gamma(m_c)} \prod_{k \in [c]} \alpha_k^{m_k - 1}, \quad \sum_{k \in [c]} \alpha_k = 1 \end{align}
根据贝叶斯公式,后验
\begin{align} p(\alphav | \yv) & \propto p(\alphav) p(\yv|\alphav) \\ & = \left( \frac{\Gamma(m_1 + \cdots + m_c)}{\Gamma(m_1) \cdots \Gamma(m_c)} \prod_{k \in [c]} \alpha_k^{m_k - 1} \right) \left( \prod_{i \in [m]} \prod_{k \in [c]} \alpha_k^{\ib(y^{(i)}=k)} \right) \\ & = \frac{\Gamma(m_1 + \cdots + m_c)}{\Gamma(m_1) \cdots \Gamma(m_c)} \prod_{k \in [c]} \alpha_k^{m_k - 1} \alpha_k^{\sum_{i \in [m]} \ib(y^{(i)}=k)} \\ & = \frac{\Gamma(m_1 + \cdots + m_c)}{\Gamma(m_1) \cdots \Gamma(m_c)} \prod_{k \in [c]} \alpha_k^{A_k + m_k - 1} \\ & \propto \Dir(\alphav | A_1 + m_1, \ldots, A_c + m_c) \end{align}
其中$A_k = \sum_{i \in [m]} \ib(y^{(i)} = k)$为第$k$类样本数
这就验证了狄利克雷分布是分类分布的共轭先验
记$A_k = \sum_{i \in [m]} \ib(y^{(i)} = k)$为第$k$类样本数,后验
\begin{align} p(\alphav | \yv) \propto \frac{\Gamma(m_1 + \cdots + m_c)}{\Gamma(m_1) \cdots \Gamma(m_c)} \prod_{k \in [c]} \alpha_k^{A_k + m_k - 1} \end{align}
最大后验估计$\alpha_k$只需求解优化问题
\begin{align} & \max_{\alpha_k} ~ \sum_{k \in [c]} (A_k + m_k - 1) \ln \alpha_k, \quad \st ~ \sum_{k \in [c]} \alpha_k = 1 \\[4pt] & \alpha_k^{\map} = \frac{A_k + m_k - 1}{\sum_{j \in [c]} (A_j + m_j - 1)} \end{align}
| 类别 | 似然 | 共轭先验 | 后验 |
|---|---|---|---|
| 枚举型 | $\left. \mathrm{Cate}(\yv \right\arrowvert \alphav)$ | $\left. \mathrm{Dir}(\alphav \right\arrowvert \mv)$ | $\left. \mathrm{Dir}(\alphav \right\arrowvert m_1 + A_1, \ldots, m_c + A_c)$ |
| 特征 | 似然 | 共轭先验 | 后验 |
|---|---|---|---|
| 枚举型 | $\left. \mathrm{Cate}(\xv \right\arrowvert \thetav)$ | $\left. \mathrm{Dir}(\thetav \right\arrowvert \mv)$ | $\left. \mathrm{Dir}(\thetav \right\arrowvert m_1 + A_1, \ldots, m_c + A_c)$ |
| $\{ 0,1 \}$ | $\left. \mathrm{Bern}(x_j \right\arrowvert \theta_{kj})$ | $\left. \BetaDist(\theta_{kj} \right\arrowvert m,n)$ | $\left. \BetaDist(\theta_{kj} \right\arrowvert m + B_{kj},n+\bar{B}_{kj})$ |
| $\nb$ | $\left. \mathrm{Mult}(\xv \right\arrowvert \thetav)$ | $\left. \mathrm{Dir}(\thetav \right\arrowvert \mv)$ | $\left. \mathrm{Dir}(\thetav \right\arrowvert m_1 + A_1, \ldots, m_c + A_c)$ |
| $\rb$ | $\left. \nc(x_{kj} \right\arrowvert \mu_{kj}, \sigma_{kj}^2)$ | 均值未知、精度 (方差的倒数) 已知时,高斯分布 | |
| - | - | 均值已知、精度 (方差的倒数) 未知时,伽玛分布 | |
| - | - | 均值、精度 (方差的倒数) 都未知时,高斯-伽玛分布 | |
共轭先验的参数就是拉普拉斯平滑中的系数
特征空间$\rb^d$,标记空间$\rb$,线性回归模型
\begin{align} f(\xv, \wv) = w_0 + w_1 \phi_1(\xv) + \cdots + w_n \phi_{n-1}(\xv) \end{align}
其中$w_0$是截距,$\phi_1, \ldots, \phi_{n-1}$是固定的基函数 (basis function)
得益于基函数的存在,$f(\xv, \wv)$能表示非线性关系,但它关于参数$\wv$是线性的,故仍称为线性模型
模型:
为表示方便,引入设计矩阵 (design matrix)
\begin{align} \Phiv & = \begin{bmatrix} \phi_0(\xv_1) & \phi_1(\xv_1) & \cdots & \phi_{n-1}(\xv_1) \\ \phi_0(\xv_2) & \phi_1(\xv_2) & \cdots & \phi_{n-1}(\xv_2) \\ \vdots & \vdots & \ddots & \vdots \\ \phi_0(\xv_m) & \phi_1(\xv_m) & \cdots & \phi_{n-1}(\xv_m) \end{bmatrix} = \begin{bmatrix} \phiv(\xv_1)^\top \\ \phiv(\xv_2)^\top \\ \vdots \\ \phiv(\xv_m)^\top \end{bmatrix} \in \rb^{m \times n} \\ & = \begin{bmatrix} \varphiv_0 & \varphiv_1 & \cdots & \varphiv_{n-1} \end{bmatrix} \end{align}
数据集$\dc = \{ (\xv_i, y_i) \}_{i \in [m]}$,对数似然
\begin{align} \ln p (\yv | \wv, \beta) & = \ln \prod_{i \in [m]} \nc(y_i | \phiv (\xv_i)^\top \wv, \beta^{-1}) \\ & = \ln \prod_{i \in [m]} \sqrt{\frac{\beta}{2 \pi}} \exp \left( -\frac{\beta}{2} (y_i - \phiv (\xv_i)^\top \wv)^2 \right) \\ & = \frac{m}{2} \ln \beta - \frac{m}{2} \ln (2 \pi) - \beta \cdot \frac{1}{2} \| \yv - \Phiv \wv \|_2^2 \end{align}
令关于$\wv$、$\beta$的梯度为零可得极大似然解
似然$p (\yv | \wv, \beta)$的条件变量里应该还包含$\xv_1, \ldots, \xv_m$,但贝叶斯线性回归不对特征向量的分布进行建模,它们永远作为条件变量出现在$|$的右边,因此就统一省略了
对于$\wv$,显然最大似然 等价于 最小二乘 等价于 列空间投影
\begin{align} \argmax_\wv \ln p & (\yv | \wv, \beta) \Longleftrightarrow \argmin_\wv \frac{1}{2} \| \yv - \Phiv \wv \|_2^2 \\ & \Longleftrightarrow \argmin_{\yv'} \frac{1}{2} \| \yv - \yv' \|_2^2, ~ \st ~ \yv' \in \mathrm{span} \{ \varphiv_0, \ldots, \varphiv_{n-1} \} \end{align}
根据极大似然解,投影点为
\begin{align} \yv' = \Phiv \wv^{\ml} = \Phiv (\Phiv^\top \Phiv)^{-1} \Phiv^\top \yv \end{align}
因此$\Phiv (\Phiv^\top \Phiv)^{-1} \Phiv^\top$也称为投影矩阵 (projection matrix)
验证$\yv' = \Phiv \wv^{\ml} = \Phiv (\Phiv^\top \Phiv)^{-1} \Phiv^\top \yv$就是投影点
$\yv'$属于列空间$\mathrm{span} \{ \varphiv_0, \ldots, \varphiv_{n-1} \}$是显然的
$\yv - \yv'$正交于列空间$\mathrm{span} \{ \varphiv_0, \ldots, \varphiv_{n-1} \}$
\begin{align} (\yv - \yv')^\top \varphiv_j & = \yv^\top \varphiv_j - \yv^\top \Phiv (\Phiv^\top \Phiv)^{-1} \Phiv^\top \varphiv_j \\ & = \yv^\top \varphiv_j - \yv^\top [\Phiv (\Phiv^\top \Phiv)^{-1} \Phiv^\top \Phiv]_j \\ & = \yv^\top \varphiv_j - \yv^\top [\Phiv]_j \\ & = \yv^\top \varphiv_j - \yv^\top \varphiv_j \\ & = 0 \end{align}
为避免过拟合,约束$\wv$的可行域,问题形式化为
\begin{align} (\spadesuit) \quad \min_\wv \frac{1}{2} \| \yv - \Phiv \wv \|_2^2, \quad \st ~ \frac{1}{2} \| \wv \|_2^2 - \eta \le 0 \end{align}
拉格朗日对偶问题为
\begin{align} \max_{\lambda \ge 0} \min_{\wv} L(\wv, \lambda) = \frac{1}{2} \| \yv - \Phiv \wv \|_2^2 + \lambda \left( \frac{1}{2} \| \wv \|_2^2 - \eta \right) \end{align}
一般形式
\begin{align} \min_{\wv} \frac{1}{2} \| \yv - \Phiv \wv \|_2^2 + \lambda \cdot \Omega (\wv) \end{align}
正则项的系数$\lambda$需通过验证集去挑选
数据:$20$个样本,$x \sim \uc[0,1]$,$y = \cos (3 \pi x / 2) + \nc(0, 1) / 10$
模型:$20$阶多项式基函数,$\ell_2$正则,正则项系数$\lambda$
无正则项时过拟合,随着$\lambda$指数递增,抗过拟合越来越好
假设$\beta$已知,$\wv$的先验取高斯分布$\nc (\muv_0, \Sigmav_0)$
$\wv$的后验
\begin{align} p & (\wv | \yv) \propto p (\yv | \wv) p (\wv) \\ & \propto \exp \bigg( - \frac{\beta}{2} \| \yv - \Phiv \wv \|_2^2 \bigg) \exp \bigg( -\frac{1}{2} (\wv - \muv_0)^\top \Sigmav_0^{-1} (\wv - \muv_0) \bigg) \\ & \propto \exp \bigg( - \frac{1}{2} \wv^\top (\underbrace{\beta \Phiv^\top \Phiv + \Sigmav_0^{-1}}_{\Sigmav_m^{-1}}) \wv + \wv^\top \Sigmav_m^{-1} \underbrace{\Sigmav_m (\beta \Phiv^\top \yv + \Sigmav_0^{-1} \muv_0)}_{\muv_m} \bigg) \\ & \propto \exp \bigg( - \frac{1}{2} \wv^\top \Sigmav_m^{-1} \wv + \wv^\top \Sigmav_m^{-1} \muv_m \bigg) \\ & \propto \exp \bigg( - \frac{1}{2} (\wv - \muv_m)^\top \Sigmav_m^{-1} (\wv - \muv_m) \bigg) \sim \nc (\wv | \muv_m, \Sigmav_m) \end{align}
若$\beta$未知,共轭先验为高斯-伽玛分布$\nc (\wv | \muv_0, \beta^{-1} \Sigmav_0) \Gam (\beta | a_0, b_0)$,预测分布为学生 t 分布
数据:$x \sim \uc[-1,1]$,$y = x / 2 + \nc(0, 0.01)$
模型:$f(x) = w_0 + w_1 x$,先验:$(w_0, w_1) \sim \nc(\zerov, \Iv_2 / 4)$
取$\muv_0 = \zerov$、$\Sigmav_0 = \alpha^{-1} \Iv_n$,$\Sigmav_m^{-1} = \beta \Phiv^\top \Phiv + \alpha \Iv_n$、$\muv_m = \beta \Sigmav_m \Phiv^\top \yv$
\begin{align} \argmax_\wv \ln p (\wv | \yv) & = \argmin_\wv \frac{1}{2} (\wv - \muv_m)^\top \Sigmav_m^{-1} (\wv - \muv_m) \\ & = \argmin_\wv \left\{ \frac{1}{2} \wv^\top \Sigmav_m^{-1} \wv - \wv^\top \Sigmav_m^{-1} \muv_m \right\} \\ & = \argmin_\wv \left\{ \frac{1}{2} \wv^\top (\beta \Phiv^\top \Phiv + \alpha \Iv_n) \wv + \beta \wv^\top \Phiv^\top \yv \right\} \\ & = \argmin_\wv \left\{ \frac{\beta}{2} \| \yv - \Phiv \wv \|_2^2 + \frac{\alpha}{2} \|\wv\|_2^2 \right\} \end{align}
岭回归 等价于 高斯先验下的最大后验
更一般的,$\wv$的先验取
\begin{align} p (\wv | \muv_0, \alpha) = \left( \frac{q}{2} \left( \frac{\alpha}{2} \frac{1}{\Gamma(1/q)} \right)^{1/q} \right)^n \exp \left( - \frac{\alpha}{2} \| \wv - \muv_0 \|_q^q \right) \end{align}
$q = 2$即为$(\alpha / (2 \pi))^{n/2} \exp (- (\alpha/2) \| \wv - \muv_0 \|_2^2) = \nc(\wv | \muv_0, \alpha^{-1} \Iv_n)$
$q = 1$即为$(\alpha/4)^n \exp (- (\alpha/2) \| \wv - \muv_0 \|_1) = \mathrm{Lap}(\wv | \muv_0, (\alpha/2)^{-1})$
\begin{align} p (\wv | \yv) \propto p(\wv) p(\yv | \wv) \propto \exp \left( - \frac{\alpha}{2} \| \wv - \muv_0 \|_1 - \frac{\beta}{2} \| \yv - \Phiv \wv \|_2^2 \right) \end{align}
取$\muv_0 = \zerov$,LASSO 等价于 拉普拉斯先验下的最大后验
只有$q=2$时为似然的共轭先验
对任意未知样本$\xv$,其预测$y$的分布为
\begin{align} p (y | \yv) & = \int p (y | \wv) p (\wv | \yv) \diff \wv \\ & = \int \nc (y | \phiv(\xv)^\top \wv, \beta^{-1}) \nc (\wv | \muv_m, \Sigmav_m) \diff \wv \\ & = \int \frac{\beta^{1/2}}{(2 \pi)^{1/2}} \exp \left( -\frac{\beta}{2} (y - \phiv(\xv)^\top \wv)^2 \right) \\ & \qquad \cdot \frac{1}{(2 \pi)^{n/2} |\Sigmav_m|^{1/2}} \exp \left( -\frac{1}{2} (\wv - \muv_m)^\top \Sigmav_m^{-1} (\wv - \muv_m) \right) \diff \wv \end{align}
$\wv$只出现在$\exp(\cdot)$中且是负二次型,服从高斯分布
整理$\wv$的相关项,确定高斯分布的均值、协方差
\begin{align} & - \frac{\beta}{2} (y - \phiv(\xv)^\top \wv)^2 -\frac{1}{2} (\wv - \muv_m)^\top \Sigmav_m^{-1} (\wv - \muv_m) \\ = & - \frac{1}{2} \wv^\top (\underbrace{\beta \phiv(\xv) \phiv(\xv)^\top + \Sigmav_m^{-1}}_{\Sigmav^{-1}}) \wv + \wv^\top \Sigmav^{-1} \underbrace{\Sigmav (\beta \phiv(\xv) y + \Sigmav_m^{-1} \muv_m)}_{\muv} \\ & \qquad \qquad - \frac{\beta}{2} y^2 - \frac{1}{2} \muv_m^\top \Sigmav_m^{-1} \muv_m \\ = & - \frac{1}{2} (\wv - \muv)^\top \Sigmav^{-1} (\wv - \muv) - \frac{\beta}{2} y^2 - \frac{1}{2} \muv_m^\top \Sigmav_m^{-1} \muv_m + \frac{1}{2} \muv^\top \Sigmav^{-1} \muv \end{align}
将$\wv$积分掉可得
\begin{align} p (y | \yv) = \frac{\beta^{1/2}}{(2 \pi)^{1/2}} \frac{|\Sigmav|^{1/2}}{|\Sigmav_m|^{1/2}} \exp \left( - \frac{\beta}{2} y^2 - \frac{1}{2} \muv_m^\top \Sigmav_m^{-1} \muv_m + \frac{1}{2} \muv^\top \Sigmav^{-1} \muv \right) \end{align}
注意$\muv = \Sigmav (\beta \phiv(\xv) y + \Sigmav_m^{-1} \muv_m)$中也有$y$,继续化简
\begin{align} \frac{1}{2} \muv^\top \Sigmav^{-1} \muv & = \frac{1}{2} (\beta \phiv(\xv) y + \Sigmav_m^{-1} \muv_m)^\top \Sigmav (\beta \phiv(\xv) y + \Sigmav_m^{-1} \muv_m) \\ & = \frac{y^2}{2} \beta^2 \phiv(\xv)^\top \Sigmav \phiv(\xv) + y \beta \phiv(\xv)^\top \Sigmav \Sigmav_m^{-1} \muv_m + \frac{1}{2} \muv_m^\top \Sigmav_m^{-1} \Sigmav \Sigmav_m^{-1} \muv_m \end{align}
注意$\Sigmav^{-1} = \beta \phiv(\xv) \phiv(\xv)^\top + \Sigmav_m^{-1}$,根据 Sherman-Morrison 公式
\begin{align} \Sigmav = (\Sigmav_m^{-1} + \beta \phiv(\xv) \phiv(\xv)^\top)^{-1} = \Sigmav_m - \frac{\beta \Sigmav_m \phiv(\xv) \phiv(\xv)^\top \Sigmav_m}{1 + \beta \phiv(\xv)^\top \Sigmav_m \phiv(\xv)} \end{align}
于是可以对$\phiv(\xv)^\top \Sigmav \phiv(\xv)$、$\phiv(\xv)^\top \Sigmav \Sigmav_m^{-1} \muv_m$继续化简
Sherman-Morrison 公式
\begin{align} \Sigmav = (\Sigmav_m^{-1} + \beta \phiv(\xv) \phiv(\xv)^\top)^{-1} = \Sigmav_m - \frac{\beta \Sigmav_m \phiv(\xv) \phiv(\xv)^\top \Sigmav_m}{1 + \beta \phiv(\xv)^\top \Sigmav_m \phiv(\xv)} \end{align}
\begin{align} \phiv(\xv)^\top \Sigmav \phiv(\xv) & = \phiv(\xv)^\top \left( \Sigmav_m - \frac{\beta \Sigmav_m \phiv(\xv) \phiv(\xv)^\top \Sigmav_m}{1 + \beta \phiv(\xv)^\top \Sigmav_m \phiv(\xv)} \right) \phiv(\xv) \\ & = \frac{\phiv(\xv)^\top \Sigmav_m \phiv(\xv)}{1 + \beta \phiv(\xv)^\top \Sigmav_m \phiv(\xv)} \end{align}
\begin{align} \phiv(\xv)^\top \Sigmav \Sigmav_m^{-1} \muv_m & = \phiv(\xv)^\top \left( \Sigmav_m - \frac{\beta \Sigmav_m \phiv(\xv) \phiv(\xv)^\top \Sigmav_m}{1 + \beta \phiv(\xv)^\top \Sigmav_m \phiv(\xv)} \right) \Sigmav_m^{-1} \muv_m \\ & = \phiv(\xv)^\top \muv_m - \frac{\beta \phiv(\xv)^\top \Sigmav_m \phiv(\xv) \phiv(\xv)^\top \muv_m}{1 + \beta \phiv(\xv)^\top \Sigmav_m \phiv(\xv)} \\ & = \frac{\phiv(\xv)^\top \muv_m}{1 + \beta \phiv(\xv)^\top \Sigmav_m \phiv(\xv)} \end{align}
$y$的相关项为负二次函数
\begin{align} & - \frac{\beta}{2} y^2 + \frac{1}{2} \muv^\top \Sigmav^{-1} \muv \\ = & - \frac{\beta}{2} y^2 + \frac{y^2}{2} \frac{\beta^2 \phiv(\xv)^\top \Sigmav_m \phiv(\xv)}{1 + \beta \phiv(\xv)^\top \Sigmav_m \phiv(\xv)} + y \frac{\beta \phiv(\xv)^\top \muv_m}{1 + \beta \phiv(\xv)^\top \Sigmav_m \phiv(\xv)} + \const \\ = & - \frac{y^2}{2} \frac{\beta}{1 + \beta \phiv(\xv)^\top \Sigmav_m \phiv(\xv)} + y \frac{\beta \phiv(\xv)^\top \muv_m}{1 + \beta \phiv(\xv)^\top \Sigmav_m \phiv(\xv)} + \const \\ = & - \frac{1}{2} \frac{\beta }{1 + \beta \phiv(\xv)^\top \Sigmav_m \phiv(\xv)} (y - \phiv(\xv)^\top \muv_m)^2 + \const \end{align}
预测分布$p (y | \yv) = \nc ( y | \phiv(\xv)^\top \muv_m, \beta^{-1} + \phiv(\xv)^\top \Sigmav_m \phiv(\xv) )$,其中
\begin{align} \muv_m = \Sigmav_m (\beta \Phiv^\top \yv + \Sigmav_0^{-1} \muv_0), \quad \Sigmav_m^{-1} = \beta \Phiv^\top \Phiv + \Sigmav_0^{-1} \end{align}
预测分布$p (y | \yv) = \nc ( y | \phiv(\xv)^\top \muv_m, \beta^{-1} + \phiv(\xv)^\top \Sigmav_m \phiv(\xv) )$,其中
\begin{align} \muv_m = \Sigmav_m (\beta \Phiv^\top \yv + \Sigmav_0^{-1} \muv_0), \quad \Sigmav_m^{-1} = \beta \Phiv^\top \Phiv + \Sigmav_0^{-1} \end{align}
$\muv_m$是$\wv$后验 (高斯分布) 的均值,即$\wv^{\map}$,故预测分布的均值就是最大后验模型$\wv^{\map}$的预测结果
取先验均值$\muv_0$为零,则$\muv_m = \beta \Sigmav_m \Phiv^\top \yv$,于是预测分布的均值
\begin{align} \phiv(\xv)^\top \muv_m = \beta \phiv(\xv)^\top \Sigmav_m \Phiv^\top \yv = \sum_{i \in [m]} \beta \phiv(\xv)^\top \Sigmav_m \phiv(\xv_i) y_i = \sum_{i \in [m]} \kappa (\xv, \xv_i) y_i \end{align}
其中$\kappa (\xv, \xv_i) = \beta \phiv(\xv)^\top \Sigmav_m \phiv(\xv_i)$称为等效核 (equivalent kernel)
等效核 -> 某种相似度,最大后验预测与类推学派也是有联系的
预测分布$p (y | \yv) = \nc ( y | \phiv(\xv)^\top \muv_m, \beta^{-1} + \phiv(\xv)^\top \Sigmav_m \phiv(\xv) )$,其中
\begin{align} \muv_m = \Sigmav_m (\beta \Phiv^\top \yv + \Sigmav_0^{-1} \muv_0), \quad \Sigmav_m^{-1} = \beta \Phiv^\top \Phiv + \Sigmav_0^{-1} \end{align}
方差中的第一项$\beta^{-1}$为固有噪声
第二项随样本增多单调递减趋向零,故最终预测的不确定性只剩噪声项,注意$\Sigmav_m^{-1} = \beta \Phiv^\top \Phiv + \Sigmav_0^{-1} = \Sigmav_{m-1}^{-1} + \beta \phiv(\xv_m)^\top \phiv(\xv_m)$
\begin{align} \phiv(\xv)^\top \Sigmav_m \phiv(\xv) & = \phiv(\xv)^\top (\Sigmav_{m-1}^{-1} + \beta \phiv(\xv_m)^\top \phiv(\xv_m))^{-1} \phiv(\xv) \\ & = \phiv(\xv)^\top \left( \Sigmav_{m-1} - \frac{\beta \Sigmav_{m-1} \phiv(\xv_m) \phiv(\xv_m)^\top \Sigmav_{m-1}}{1 + \beta \phiv(\xv_m)^\top \Sigmav_{m-1} \phiv(\xv_m)} \right) \phiv(\xv) \\ & = \phiv(\xv)^\top \Sigmav_{m-1} \phiv(\xv) - \frac{\beta (\phiv(\xv)^\top \Sigmav_{m-1} \phiv(\xv_m))^2}{1 + \beta \phiv(\xv_m)^\top \Sigmav_{m-1} \phiv(\xv_m)} \\ & < \phiv(\xv)^\top \Sigmav_{m-1} \phiv(\xv) \end{align}
数据:$x \sim \uc[-1,1]$,$y = \sin(\pi x) + \nc(0, 0.1)$
模型:$4$阶多项式,先验:$\wv \sim \nc(\zerov, \Iv_5)$
取$\muv_0 = \zerov$、$\Sigmav_0 = \alpha^{-1} \Iv_n$,$\Sigmav_m^{-1} = \beta \Phiv^\top \Phiv + \alpha \Iv_n$、$\muv_m = \beta \Sigmav_m \Phiv^\top \yv$
在$\alpha$、$\beta$都是已知常数的前提下,预测分布为
\begin{align} p (y | \yv) = \nc( y | \beta \phiv(\xv)^\top \Sigmav_m \Phiv^\top \yv, \beta^{-1} + \phiv(\xv)^\top (\beta \Phiv^\top \Phiv + \alpha \Iv_n)^{-1} \phiv(\xv) ) \end{align}
全贝叶斯 (fully Bayes):$\alpha$、$\beta$都是随机变量,不能当作已知常数,预测分布需要将其积分掉
\begin{align} p (y | \yv) = \iiint p(y | \wv, \beta) p (\wv | \yv, \alpha, \beta) p(\alpha, \beta | \yv) \diff \wv \diff \alpha \diff \beta \end{align}
单独对$\wv$积分或单独对$\alpha$、$\beta$积分都不难,但一起积分很难,因为$\wv$是受$\alpha$、$\beta$影响的
预测分布为
\begin{align} p (y | \yv) = \iiint p(y | \wv, \beta) p (\wv | \yv, \alpha, \beta) p(\alpha, \beta | \yv) \diff \wv \diff \alpha \diff \beta \end{align}
经验贝叶斯 (empirical Bayes):先最大化模型证据$p(\yv | \alpha, \beta)$得到$\widehat{\alpha}$、$\widehat{\beta}$,再用其做近似预测
\begin{align} p (y | \yv) \approx p (y | \yv, \widehat{\alpha}, \widehat{\beta}) = \int p(y | \wv, \widehat{\beta}) p (\wv | \yv, \widehat{\alpha}, \widehat{\beta}) \diff \wv \end{align}
该方法也称为第二型极大似然 (type 2 maximum likelihood),或证据近似 (evidence approximation)
模型证据
\begin{align} p(\yv | \alpha, \beta) & = \int p(\yv | \wv, \beta) p( \wv | \alpha) \diff \wv \\ & = \int \frac{\beta^{m/2}}{(2 \pi)^{m/2}} \exp \left( - \frac{\beta}{2} \| \yv - \Phiv \wv \|_2^2 \right) \frac{\alpha^{n/2}}{(2 \pi)^{n/2}} \exp \left( -\frac{\alpha}{2} \wv^\top \wv \right) \diff \wv \end{align}
整理$\wv$的相关项,确定高斯分布的均值、协方差
\begin{align} E(\wv) & = - \frac{\beta}{2} \| \yv - \Phiv \wv \|_2^2 - \frac{\alpha}{2} \wv^\top \wv \\ & = - \frac{1}{2} \wv^\top (\underbrace{\beta \Phiv^\top \Phiv + \alpha \Iv_n}_{\Sigmav^{-1}}) \wv + \wv^\top \Sigmav^{-1} \underbrace{\Sigmav (\beta \Phiv^\top \yv)}_{\muv} - \frac{\beta}{2} \yv^\top \yv \\ & = - \frac{1}{2} (\wv - \muv)^\top \Sigmav^{-1} (\wv - \muv) - \frac{\beta}{2} \yv^\top \yv + \frac{1}{2} \muv^\top \Sigmav^{-1} \muv \end{align}
积分项是似然乘以先验,因此这里的$\muv$、$\Sigmav$就是$\wv$后验的均值、协方差矩阵
将$\wv$积分掉,模型证据
\begin{align} p(\yv | \alpha, \beta) = \frac{\beta^{m/2} \alpha^{n/2} |\Sigmav|^{1/2}}{(2 \pi)^{m/2}} \exp \left( - \frac{\beta}{2} \yv^\top \yv + \frac{1}{2} \muv^\top \Sigmav^{-1} \muv \right) \end{align}
其中$\Sigmav^{-1} = \beta \Phiv^\top \Phiv + \alpha \Iv_n$、$\muv = \beta \Sigmav \Phiv^\top \yv$,代入
\begin{align} - \frac{\beta}{2} \yv^\top & \yv + \frac{1}{2} \muv^\top \Sigmav^{-1} \muv = - \frac{1}{2} (\beta \yv^\top \yv - 2 \muv^\top \Sigmav^{-1} \class{blue}{\muv} + \muv^\top \class{green}{\Sigmav^{-1}} \muv) \\ & = - \frac{1}{2} (\beta \yv^\top \yv - 2 \muv^\top \Sigmav^{-1} \class{blue}{\beta \Sigmav \Phiv^\top \yv} + \muv^\top \class{green}{(\beta \Phiv^\top \Phiv + \alpha \Iv_n)} \muv) \\ & = - \frac{1}{2} (\beta \yv^\top \yv - 2 \beta \muv^\top \Phiv^\top \yv + \beta \muv^\top \Phiv^\top \Phiv \muv + \alpha \muv^\top \muv) \\ & = - \frac{\beta}{2} \| \yv - \Phiv \muv \|_2^2 - \frac{\alpha}{2} \muv^\top \muv \end{align}
注意$|\Sigmav|^{1/2} = |\Sigmav^{-1}|^{-1/2}$,对数模型证据
\begin{align} \ln p(\yv | \alpha, \beta) = \frac{n}{2} \ln \alpha + \frac{m}{2} \ln \beta - \frac{1}{2} \ln |\Sigmav^{-1}| - \frac{\beta}{2} \| \yv - \Phiv \muv \|_2^2 - \frac{\alpha}{2} \muv^\top \muv - \frac{m}{2} \ln (2 \pi) \end{align}
对数模型证据
\begin{align} \ln p(\yv | \alpha, \beta) = \frac{n}{2} \ln \alpha + \frac{m}{2} \ln \beta - \frac{1}{2} \ln |\Sigmav^{-1}| - \frac{\beta}{2} \| \yv - \Phiv \muv \|_2^2 - \frac{\alpha}{2} \muv^\top \muv - \frac{m}{2} \ln (2 \pi) \end{align}
注意$\Sigmav^{-1} = \beta \Phiv^\top \Phiv + \alpha \Iv_n$,设$\beta \Phiv^\top \Phiv$特征值为$\{ \lambda_i \}_{i \in [n]}$,则$\Sigmav^{-1}$特征值为$\{ \lambda_i + \alpha \}_{i \in [n]}$
\begin{align} & \ln |\Sigmav^{-1}| = \ln \prod_{i \in [n]} (\lambda_i + \alpha) = \sum_{i \in [n]} \ln (\lambda_i + \alpha) \\ & \frac{\diff \ln |\Sigmav^{-1}|}{\diff \alpha} = \sum_{i \in [n]} \frac{\diff \ln (\lambda_i + \alpha)}{\diff \alpha} = \sum_{i \in [n]} \frac{1}{\lambda_i + \alpha} \\ & \frac{\diff \ln |\Sigmav^{-1}|}{\diff \beta} = \sum_{i \in [n]} \frac{1}{\lambda_i + \alpha} \frac{\diff \lambda_i}{\diff \beta} = \sum_{i \in [n]} \frac{1}{\lambda_i + \alpha} \frac{\lambda_i}{\beta} \end{align}
注意$\beta \Phiv^\top \Phiv \vv_i = \lambda_i \vv_i$,两者呈线性关系,故$\diff \lambda_i / \diff \beta = \lambda_i / \beta$。
令对数模型证据关于$\alpha$的导数为零
\begin{align} & \frac{\diff \ln p(\yv | \alpha, \beta)}{\diff \alpha} = \frac{n}{2\alpha} - \frac{1}{2} \sum_{i \in [n]} \frac{1}{\lambda_i + \alpha} - \frac{1}{2} \muv^\top \muv = 0 \\ \Longrightarrow ~ & \alpha \muv^\top \muv = n - \sum_{i \in [n]} \frac{\alpha}{\lambda_i + \alpha} = \sum_{i \in [n]} \frac{\lambda_i}{\lambda_i + \alpha} \triangleq \gamma \\ \Longrightarrow ~ & \alpha = \frac{\gamma}{\muv^\top \muv} \end{align}
注意$\gamma$、$\muv = (\beta \Phiv^\top \Phiv + \alpha \Iv_n)^{-1} (\beta \Phiv^\top \yv)$都与$\alpha$相关,故交替求解
令对数模型证据关于$\beta$的导数为零
\begin{align} & \frac{\diff \ln p(\yv | \alpha, \beta)}{\diff \beta} = \frac{m}{2\beta} - \frac{1}{2} \sum_{i \in [n]} \frac{1}{\lambda_i + \alpha} \frac{\lambda_i}{\beta} - \frac{1}{2} \| \yv - \Phiv \muv \|_2^2 = 0 \\ \Longrightarrow ~ & \frac{m - \gamma}{\beta} = \| \yv - \Phiv \muv \|_2^2 \\ \Longrightarrow ~ & \frac{1}{\beta} = \frac{1}{m - \gamma} \| \yv - \Phiv \muv \|_2^2 \end{align}
注意$\muv = (\beta \Phiv^\top \Phiv + \alpha \Iv_n)^{-1} (\beta \Phiv^\top \yv)$与$\beta$相关,故交替求解
极大似然 vs. 最大后验
\begin{align} \min_\wv & ~ \frac{1}{2} \| \yv - \Phiv \wv \|_2^2 \Longrightarrow \wv^{\ml} = (\Phiv^\top \Phiv)^{-1} \Phiv^\top \yv \\ \min_\wv & ~ \left\{ \frac{\beta}{2} \| \yv - \Phiv \wv \|_2^2 + \frac{\alpha}{2} \|\wv\|_2^2 \right\} \Longrightarrow \wv^{\map} = (\beta \Phiv^\top \Phiv + \alpha \Iv_n)^{-1} \beta \Phiv^\top \yv \end{align}
设$\beta \Phiv^\top \Phiv$对应于$\lambda_i$的特征向量为$\uv_i$,且全部已标准正交化
\begin{align} \beta \Phiv^\top \Phiv & \underbrace{\begin{bmatrix} \uv_1 & \cdots & \uv_n \end{bmatrix}}_{\Uv} = \underbrace{\begin{bmatrix} \uv_1 & \cdots & \uv_n \end{bmatrix}}_{\Uv} \underbrace{\begin{bmatrix} \lambda_1 \\ & \ddots \\ & & \lambda_n \end{bmatrix}}_{\Lambdav} \end{align}
\begin{align} \Longrightarrow ~ & \beta \Phiv^\top \Phiv = \Uv \Lambdav \Uv^\top \\ & (\beta \Phiv^\top \Phiv)^{-1} = \Uv \Lambdav^{-1} \Uv^\top \\ & (\beta \Phiv^\top \Phiv + \alpha \Iv_n)^{-1} = (\Uv \Lambdav \Uv^\top + \alpha \Iv_n)^{-1} = \Uv (\Lambdav + \alpha \Iv_n)^{-1} \Uv^\top \end{align}
极大似然 vs. 最大后验
\begin{align} \wv^{\ml} & = (\Phiv^\top \Phiv)^{-1} \Phiv^\top \yv = \Uv \Lambdav^{-1} \Uv^\top \beta \Phiv^\top \yv \\ & = \begin{bmatrix} \uv_1 & \cdots & \uv_n \end{bmatrix} \begin{bmatrix} \uv_1^\top / \lambda_1 \\ \vdots \\ \uv_n^\top / \lambda_n \end{bmatrix} \beta \Phiv^\top \yv = \sum_{i \in [n]} \uv_i \frac{\beta \uv_i^\top \Phiv^\top \yv}{\lambda_i} \end{align}
\begin{align} \wv^{\map} & = (\beta \Phiv^\top \Phiv + \alpha \Iv_n)^{-1} \beta \Phiv^\top \yv = \Uv (\Lambdav + \alpha \Iv_n)^{-1} \Uv^\top \beta \Phiv^\top \yv \\ & = \begin{bmatrix} \uv_1 & \cdots & \uv_n \end{bmatrix} \begin{bmatrix} \uv_1^\top / (\lambda_1 + \alpha) \\ \vdots \\ \uv_n^\top / (\lambda_n + \alpha) \end{bmatrix} \beta \Phiv^\top \yv = \sum_{i \in [n]} \uv_i \frac{\beta \uv_i^\top \Phiv^\top \yv}{\lambda_i + \alpha} \end{align}
以$\uv_1, \ldots, \uv_n$为坐标轴表示解空间,则$\wv^{\map}$、$\wv^{\ml}$在第$i$个轴上的坐标分别为$\frac{\beta \uv_i^\top \Phiv^\top \yv}{\lambda_i + \alpha}$、$\frac{\beta \uv_i^\top \Phiv^\top \yv}{\lambda_i}$,比值为$\frac{\lambda_i}{\lambda_i + \alpha}$
在第$i$个轴上,$\wv^{\map}$与$\wv^{\ml}$的坐标比值为$\frac{\lambda_i}{\lambda_i + \alpha}$
\begin{align} \frac{1}{\beta^{\ml}} = \frac{1}{m} \| \yv - \Phiv \wv^{\ml} \|_2^2, \quad \frac{1}{\beta} = \frac{1}{m - \gamma} \| \yv - \Phiv \wv^{\map} \|_2^2 \end{align}