5.1 极大似然估计的局限
在上一章中,我们学习了极大似然估计(MLE)。它的核心思想非常直观:既然现在的样本发生了,那我就认为参数取值应该是让这些样本出现概率最大的那个值。在数据量充足的情况下,MLE 的效果非常好。
然而,当观测数据较少甚至缺失时,MLE 就会暴露出严重的缺陷,甚至得出违背常识的结论。我们可以通过两个例子来看清这一点:
抛硬币。假设我们抛了 3 次硬币,运气不好,3 次全是反面,正面次数为 0。按照 MLE 的公式,硬币正面朝上的概率估计值 \(\hat{p}=\frac{正面次数}{总次数}=0\)。此时 MLE 计算出的概率 \(\hat{p} = 0\)。这显然违背了我们的常识,因为我们知道硬币通常都有两面,仅仅因为 3 次实验没出现正面就断定它概率为 0 是极其武断的。
交通事故的时间间隔。假设事故间隔服从指数分布,MLE 估计的“平均间隔时间”就是样本的均值。如果路段刚开放,只发生了两次事故,观测到一个间隔数据 \(x_1\),MLE 会直接认为该路段的平均事故间隔就是 \(x_1\)。这会因为样本太少而极不可靠。更极端的情况是,如果第二次事故还没发生,我们根本没有间隔数据,MLE 就完全无法计算了。
MLE 的根本问题在于它完全依赖于当前的观测数据。当数据量太少时,观测到的特征可能只是偶然误差,不能代表总体规律。此时完全相信数据会导致估计值偏差巨大。在机器学习中,这种对有限样本过度拟合而忽略了普遍规律的现象,被称为“过拟合”。
为了解决这个问题,我们需要在数据之外引入额外的判断依据(比如“硬币通常是均匀的”这种常识)。这便是贝叶斯估计的基本思想。
5.2 贝叶斯公式与贝叶斯估计
我们在第一章中讲过贝叶斯公式。设 \(B_1, B_2, \dots, B_n\) 为完备事件群,则对于任意事件 \(A\):
\[ P(B_i|A) = \frac{P(A|B_i)P(B_i)}{\sum_{j} P(A|B_j)P(B_j)} \]
在统计推断(贝叶斯估计)中,我们将上述公式中的“事件”替换为“数据”和“参数”:
\(X\):观测到的样本数据(Evidence/Data)。
\(\theta\):模型的参数(Unknown Parameter)。
由此得到了贝叶斯估计的核心公式:
\[ p(\theta|X) = \frac{p(X|\theta)p(\theta)}{p(X)} = \frac{p(X|\theta)p(\theta)}{\int p(X|\theta)p(\theta) d\theta} \]
这个公式中的每一项都有其特定的统计学含义:
| 符号 | 名称 | 含义 |
|---|---|---|
| \(p(\theta)\) | 先验分布 | 在观测到数据之前,我们对参数 \(\theta\) 的认知或信念。这通常基于以往的经验、历史数据或主观判断,例如硬币正面朝上的概率是 \(\frac{1}{2}\)。 |
| \(p(X \| \theta)\) | 似然函数 | 假设参数已知时,当前数据出现的概率。这与 MLE 中的似然函数完全一致。 |
| \(p(\theta \| X)\) | 后验分布 | 在观测到数据之后,我们对参数 \(\theta\) 的新认知。这是贝叶斯估计的最终目标,它综合了先验知识和数据信息。 |
| \(p(X)\) | 边缘似然 | 数据的全概率(归一化常数)。它通过对所有可能的 \(\theta\) 积分得到:\(p(X) = \int p(X\|\theta)p(\theta) d\theta\)。 |
贝叶斯估计的理想目标是求出完整的后验分布 \(p(\theta|X)\)。然而,公式中的分母 \(p(X)\) 是一个积分:
\[ p(X) = \int p(X|\theta)p(\theta) d \theta \]
如果 \(\theta\) 是高维向量,这个积分在数学上通常是不可积的 (Intractable) 或者计算量极其巨大。既然分母算不出来,我们就无法得到标准的后验分布。
为了解决这个问题,在实际应用中,我们通常采用两条捷径:
- 最大后验概率 (MAP):既然分母与 \(\theta\) 无关,那我们在求最大值时直接忽略分母,只关注分子。
- 共轭先验:挑选特殊的先验分布,使得我们可以通过代数运算直接推导出后验分布,从而避开积分。
5.3 最大后验概率(MAP)估计
正如前文所述,为了避开贝叶斯公式中分母(边缘似然 \(p(X)\))那个难以计算的积分,我们不再追求参数 \(\theta\) 的完整分布,而是退而求其次,寻找后验分布中概率密度最大的那个点。这就是 最大后验概率估计 (MAP)。
5.3.1 MAP 的核心公式
根据贝叶斯公式: \[ p(\theta|X) = \frac{p(X|\theta)p(\theta)}{p(X)} \]
由于我们要找的是让 \(p(\theta|X)\) 最大的 \(\theta\) 值,而分母 \(p(X)\) 是关于数据 \(X\) 的积分,与参数 \(\theta\) 无关(相对于 \(\theta\) 是常数)。因此,优化时可以忽略分母:
\[ \begin{aligned} \hat{\theta}_{\text{MAP}} &= \operatorname*{argmax}_{\theta} p(\theta|X) \\ &= \operatorname*{argmax}_{\theta} \frac{p(X|\theta)p(\theta)}{p(X)} \\ &= \operatorname*{argmax}_{\theta} \underbrace{p(X|\theta)}_{\text{似然函数}} \cdot \underbrace{p(\theta)}_{\text{先验分布}} \end{aligned} \]
与 MLE 一样,为了方便计算,我们通常对目标函数取对数:
\[ \hat{\theta}_{\text{MAP}} = \operatorname*{argmax}_{\theta} \left( \ln p(X|\theta) + \ln p(\theta) \right) \]
如果数据 \(X = \{x_1, ..., x_n\}\) 是独立同分布 (i.i.d.) 的(通常都是独立同分布的),则展开为:
\[ \hat{\theta}_{\text{MAP}} = \operatorname*{argmax}_{\theta} \left( \sum_{i=1}^n \ln f(x_i|\theta) + \ln p(\theta) \right) \]
5.3.2 例子
抛 10 次硬币,其中正面(1)出现 7 次,反面(0)出现 3 次。根据常识,硬币大概率是均匀的。我们假设参数 \(\theta\)(正面朝上的概率)服从正态分布 \(N(0.5, 0.01)\),这就是 \(\theta\) 的先验分布。
似然函数:每个数据服从伯努利分布,进行 10 次试验,故 \(L(X|\theta) = \theta^7 (1-\theta)^3\)。
先验分布:\(p(\theta) = \frac{1}{\sqrt{2\pi}\sigma} e^{-\frac{(\theta-\mu)^2}{2\sigma^2}} \propto e^{-\frac{(\theta-0.5)^2}{2 \times 0.01}} = e^{-50(\theta-0.5)^2}\)
因此
\[ \begin{aligned} \hat{\theta}_{\text{MAP}} &= \operatorname*{argmax}_{\theta} \left( \theta^7 (1-\theta)^3 \cdot e^{-50(\theta-0.5)^2} \right) \end{aligned} \]
求导得 \(J(\theta) = 7\ln \theta + 3\ln(1-\theta) - 50(\theta-0.5)^2\)
令 \(\frac{\partial J}{\partial \theta} = \frac{7}{\theta} - \frac{3}{1-\theta} - 100(\theta-0.5) = 0\),得 \(\theta≈0.558\),即硬币朝上的最大后验概率为 \(0.558\)。
接下来让我们对比一下三种估计结果,就能理解 MAP 的作用。
| 估计方法 | 计算公式/来源 | 结果 | 含义 |
|---|---|---|---|
| 先验均值 | 仅凭经验 | 0.500 | 我坚信硬币是均匀的 |
| MLE 估计 | 仅凭数据 (\(7/10\)) | 0.700 | 数据显示正面概率很高,我完全信数据 |
| MAP 估计 | 数据 + 经验 | 0.558 | 折中:数据把信念从 0.5 拉向了 0.7,但先验的引力把它拽回了一点 |
可以看到,MAP 估计值位于“先验均值”和“MLE 估计值”之间。先验分布方差越小(越确信先验),MAP 结果就越接近先验;数据量越大(\(n\) 越大),MAP 结果就越接近 MLE。
5.3.3 MAP 与 正则化
在机器学习(特别是深度学习)中,MAP 有一个极其重要的等价解释:MAP 就是带正则项的 MLE。
观察 Log-MAP 的公式: \[ \hat{\theta}_{\text{MAP}} = \operatorname*{argmax}_{\theta} \underbrace{\ln L(\theta)}_{\text{Loss项}} + \underbrace{\ln p(\theta)}_{\text{正则项}} \]
L2 正则化
如果我们假设参数 \(\theta\) 服从正态分布 \(\theta \sim N(0, \sigma^2)\): \[ \ln p(\theta) \propto - \frac{\theta^2}{2\sigma^2} = -\lambda \|\theta\|^2 = -\lambda \|\theta\|_2\] 这正是我们熟悉的 L2 正则化!在损失函数中加 L2 正则,本质上就是假设权重参数服从高斯先验,然后做 MAP 估计。
L1 正则化
如果我们假设参数 \(\theta\) 服从拉普拉斯分布\[ \ln p(\theta) \propto -|\theta| = -\lambda \|\theta\|_1 \] 这正是 L1 正则化!
因此,这一章学的 MAP 并不是什么过时的统计概念,它是现代 AI 模型防止过拟合(Regularization)的数学基石。
5.4 共轭先验分布
在 MAP 中,我们为了避开积分,选择了忽略分母。而在共轭先验的方法中,我们通过巧妙选择先验分布 \(p(\theta)\) 的形式,使得它和似然函数 \(p(X|\theta)\) 共轭,生成的后验分布 \(p(\theta|X)\) 与先验分布 \(p(\theta)\) 属于同一种分布。这样做的好处是,我们完全不需要做积分,只需要做简单的加法来更新参数即可。
我们先给出结论,并通过例子解释结论怎么用,最后推导结论。
5.4.1 共轭分布大全
符号说明:
\(n\):样本数量
\(\sum x_i\):样本观测值的总和
\(\alpha, \beta\):先验分布的参数(超参数)
\(\alpha', \beta'\):后验分布的参数
| 先验分布 | 似然函数 | 后验分布 | 更新公式 |
|---|---|---|---|
| \(\text{Beta}(\alpha, \beta)\) | 二项分布 / 伯努利 | \(\text{Beta}(\alpha', \beta')\) | \(\alpha' =
\alpha + \text{成功次数}\) \(\beta' = \beta + \text{失败次数}\) |
| \(\text{Gamma}(\alpha, \beta)\) | 泊松分布 | \(\text{Gamma}(\alpha', \beta')\) | \(\alpha' =
\alpha + \sum x_i\) \(\beta' = \beta + n\) |
| \(\text{Gamma}(\alpha, \beta)\) | 指数分布 | \(\text{Gamma}(\alpha', \beta')\) | \(\alpha' =
\alpha + n\) \(\beta' = \beta + \sum x_i\) |
| \(\text{N}(\mu_0, \sigma_0^2)\) | 正态分布 (已知 \(\sigma^2\)) | \(\text{N}(\mu_n, \sigma_n^2)\) | \(\frac{1}{\sigma_n^2} = \frac{1}{\sigma_0^2} +
\frac{n}{\sigma^2}\) \(\mu_n = \frac{\frac{1}{\sigma_0^2}\mu_0 + \frac{n}{\sigma^2}\bar{x}}{\frac{1}{\sigma_0^2} + \frac{n}{\sigma^2}}\) |
| \(\text{Dir}(\mathbf{\alpha})\) | 多项分布 | \(\text{Dir}(\mathbf{\alpha}')\) | \(\alpha_k' = \alpha_k + \text{第}k\text{类的计数}\) |
在贝叶斯统计中,如果后验分布与先验分布属于同类,则先验分布与后验分布互为共轭分布,先验分布称为似然函数的共轭先验。 例如表格第一行,Beta 分布与 Beta分布互为共轭分布,Beta分布是二项分布/伯努利分布的共轭先验。
下面通过例子解释这个表格的用法。
5.4.2 例子
1. Beta分布+二项分布=Beta分布
Beta 分布 \(p \sim Beta(\alpha, \beta)\) 定义在 \([0,1]\) 区间上,描述的是我们对某个事件发生概率 \(p\) 的信心。 \(\alpha\) 可以看作虚拟的成功次数,\(\beta\) 看作虚拟的失败次数。
现在要估计硬币正面朝上的概率 \(p\)。
- 先验:根据尝试,硬币正面朝上和反面朝上的概率是相等的。设先验为 \(Beta(10, 10)\),这意味着我假装之前已经抛过 20 次,10 正 10 反。
- 数据:新做了 \(n=10\) 次实验,7 正 3 反。
- 后验:根据更新公式,\(\alpha' = 10+7=17, \beta'=10+3=13\)。后验为 \(Beta(17, 13)\)。
- 估计:后验均值 \(\text{E}(p)=\frac{17}{17+13}=\frac{17}{30}\)。即硬币正面朝上的概率为 \(\frac{17}{30}\)。
2. Gamma分布+泊松分布=Gamma分布
Gamma 分布 \(\lambda \sim Gamma(\alpha, \beta)\) 定义在 \((0, +\infty)\),通常用于描述单位时间内事件发生的次数 \(\lambda\),或事件发生的速率。其中 \(\alpha\) 代表总次数,\(\beta\) 代表总时间。
现在要估计单位时间(这里取 1 小时)内进站的公交车数量 \(\lambda\)。
- 先验:根据经验,每小时大概来 3 辆。设 Gamma(3, 1)(意思是 1 小时观察到了 3 辆)。
- 数据:观察了 \(n=2\) 小时,分别来了 4 辆和 6 辆。总数 \(\sum x = 10\)。
- 后验:根据更新公式,\(\alpha' = 3 + 10 = 13\) (总共来了 13 辆), \(\beta' = 1 + 2 = 3\) (总共观察了 3 小时)。后验为 \(Gamma(13, 3)\)。
- 估计:后验均值 \(\text{E}(\lambda) = 13/3\)。即一小时内来了 \(13/3\) 辆公交车。
3. Gamma分布+指数分布=Gamma分布
设灯泡寿命 \(X \sim Exp(\lambda)\)。现在要估计灯泡的寿命。
- 先验:\(Gamma(10, 1800)\),即根据经验,10个灯泡的总寿命是1800小时。
- 数据:测试了 \(n=5\) 个灯泡,寿命总和 \(\sum x = 1000\) 小时。
- 后验:注意这里 \(\alpha\) 更新的是样本个数,\(\beta\) 更新的是观测值总和。 根据更新公式,\(\alpha' = \alpha + 5=15, \quad \beta' = \beta + 1000=2800\)。
- 估计:后验均值 \(\text{E}(X) = \frac{2800}{15}=186.66\),即灯泡的平均寿命是186.66小时。
需要注意的是,gamma+泊松与gamma+指数的更新公式正好相反。本质原因是,泊松分布中,时间是固定的(人为选取的,比如上面观察了2小时内进站的公交车数量),次数是随机变量(1小时内进站的公交车数量,是观测得到的);而泊松分布中,时间是随机变量(观测到的灯泡寿命),次数是固定的(人为选取的,比如上面测试了5个灯泡)。两者的定义相反,导致更新公式正好相反。
4. Dirichlet分布+多项分布=Dirichlet分布
Dirichlet分布是 Beta 分布在高维上的推广。Beta 是两面的硬币,Dirichlet 是 \(K\) 面的骰子。它描述的是多分类概率向量 \(\mathbf{p}=(p_1, ..., p_K)\) 的分布。\(Dir(\alpha_1, \alpha_2, ..., \alpha_k)\) 的参数 \(\alpha_1, \alpha_2, ..., \alpha_k\) 分别代表事件 1,2,…,k 出现次数的伪计数。
现在有一个三面的骰子。
- 先验:\(Dir(1, 1, 1)\)。这代表均匀分布认为每一面出现的概率相等。
- 数据:现在投了若干次骰子,投掷结果为:1点出现2次,2点出现0次,3点出现1次。向量 \(\mathbf{m} = (2, 0, 1)\)。
- 后验:根据更新公式,\(Dir(\alpha_1', \alpha_2', \alpha_3')=Dir(1+2, 1+0, 1+1) = Dir(3, 1, 2)\)。
- 估计:第1面朝上的概率为 \(\frac{3}{3+1+2}=\frac{1}{2}\),第2面朝上的概率为 \(\frac{1}{3+1+2}=\frac{1}{6}\),第3面朝上的概率为 \(\frac{2}{3+1+2}=\frac{1}{3}\)。
5. 正态分布+正态分布=正态分布
测量温度,假设已知温度计的测量误差方差为 \(\sigma^2=1\)(即精度为 \(1/\sigma^2 = 1\))。现在要估计真实气温 \(\mu\)。
- 先验:根据天气预报或体感,我相信气温在 25 度左右,不确定度(方差)为 \(\sigma_0^2=2\)。这意味着先验分布为 \(N(25, 2)\),先验精度为 \(1/2 = 0.5\)。
- 数据:做了一次测量 (\(n=1\)),温度计读数 \(x=30\)。数据的观测精度为 \(1/1 = 1\)。
- 后验:正态分布的后验均值是先验均值和观测数据的加权平均,权重是各自的精度(方差的倒数);后验精度是先验精度与观测精度之和。
- 后验精度:\(\frac{1}{\sigma'^2} = \frac{1}{\sigma_0^2} + \frac{n}{\sigma^2} = 0.5 + 1 = 1.5\)。因此后验方差 \(\sigma'^2 = \frac{1}{1.5} \approx 0.67\)。
- 后验均值:\(\mu' = \frac{\text{先验精度} \cdot \mu_0 + \text{数据精度} \cdot x}{\text{总精度}} = \frac{0.5 \times 25 + 1 \times 30}{0.5 + 1} = \frac{12.5 + 30}{1.5} = \frac{42.5}{1.5} \approx 28.33\)。
- 后验分布为 \(N(28.33, 0.67)\)。
- 估计:后验均值 \(\text{E}(\mu) = 28.33\)。
5.4.3 数学原理与推导
上面五个例子直观地展示了共轭分布与更新公式的用法。事实上,这五个例子非常符合人们的直觉,即在经验的基础上,根据新观测到的数据,更新信念。
下面通过数学推导更新公式。 这里的核心逻辑是,写出 \(先验分布 \times 似然函数\),然后忽略常数,看剩下的部分像什么分布。
1. Beta分布 + 二项分布 = Beta分布
Th. 设 \(\theta\) 为事件成功的概率,且服从先验分布 \(Beta(\alpha, \beta)\)。现又做了 \(n\) 次试验(即数据服从二项分布 \(X \sim B(n, \theta)\)),成功次数为 \(k\)。则现在 \(\theta | X\) 服从后验分布 \(Beta(\alpha+k, \beta+n-k)\)。
proof.
\[ p(\theta) = \text{Beta}(\alpha, \beta) \propto \theta^{\alpha-1}(1-\theta)^{\beta-1}(根据 Beta 分布的概率密度函数) \]
\[ p(X|\theta) = C_{n}^{k} \theta^k (1-\theta)^{n-k} \propto \theta^k (1-\theta)^{n-k} \]
\[ P(\theta|X) \propto P(\theta) \cdot P(X|\theta) \]
\[ \phantom{P(\theta|X)} \propto \theta^{\alpha-1}(1-\theta)^{\beta-1} \cdot \theta^k (1-\theta)^{n-k} \]
\[ \phantom{P(\theta|X)} = \theta^{(\alpha+k)-1} (1-\theta)^{(\beta+n-k)-1} \]
即 \(\theta | X\) 服从 Beta 分布 \(Beta(\alpha+k, \beta+n-k)\)。
2. Gamma分布 + 泊松分布 = Gamma分布
Th. 设 \(\lambda\) 为单位时间内某事件发生的次数,且满足先验分布 \(Gamma(\alpha, \beta)\)。现观测了 \(n\) 单位时间(即数据服从泊松分布 \(X \sim Poi(\lambda)\)),得到观测数据 \(X=\{X_1, X_2, ..., X_n\}\),其中 \(X_i\) 为第 \(i\) 个小时观测到的事件发生次数。则 \(\lambda | X\) 服从分布 \(Gamma(\alpha + \sum X_i, \beta+n)\)。
proof.
\(p(\lambda) = \text{Gamma}(\alpha, \beta) \propto \lambda^{\alpha-1} e^{-\beta\lambda}\)(根据 Gamma 分布的概率密度函数)
\(p(X|\lambda) = p(X_1|\lambda) p(X_2|\lambda)... p(X_n|\lambda)=\prod \frac{\lambda^{x_i}e^{-\lambda}}{x_i!} \propto \lambda^{\sum x_i} e^{-n\lambda}\)
\(P(\lambda|X) \propto P(\lambda) \cdot P(X|\lambda)\)
\(\phantom{P(\lambda|X)} \propto \lambda^{\alpha-1} e^{-\beta\lambda} \cdot \lambda^{\sum x_i} e^{-n\lambda}\)
\(\phantom{P(\lambda|X)} = \lambda^{(\alpha+\sum x_i)-1} e^{-(\beta+n)\lambda}\)
即 \(\lambda | X\) 服从 Gamma 分布 \(Gamma(\alpha+\sum x_i, \beta+n)\)。
3. Gamma分布 + 指数分布 = Gamma分布
Th. 设 \(\lambda\) 为灯泡坏掉的速率,且 \(\lambda\) 服从先验分布 \(Gamma(\alpha, \beta)\)。现在又观测了 \(n\) 个灯泡(即数据服从指数分布 \(X \sim Exp(\lambda)\)),得到观测数据 \(X=\{X_1, X_2,...,X_n\}\),其中 \(X_i\) 为第 \(i\) 个灯泡的寿命。则 \(\lambda | X\) 服从 Gamma 分布 \(Gamma(\alpha+n, \beta+\sum X_i)\)。
proof.
\(p(\lambda) = \text{Gamma}(\alpha, \beta) \propto \lambda^{\alpha-1} e^{-\beta\lambda}\)(根据 Gamma 分布的概率密度函数)
\(p(X|\lambda) = p(X_1|\lambda) p(X_2|\lambda)... p(X_n|\lambda)= \prod \lambda e^{-\lambda x_i} = \lambda^n e^{-\lambda \sum x_i}\)
\(P(\lambda|X) \propto P(\lambda) \cdot P(X|\lambda)\)
\(\phantom{P(\lambda|X)} \propto \lambda^{\alpha-1} e^{-\beta\lambda} \cdot \lambda^n e^{-\lambda \sum x_i}\)
\(\phantom{P(\lambda|X)} = \lambda^{(\alpha+n)-1} e^{-(\beta+\sum x_i)\lambda}\)
即 \(\lambda|X\) 服从 Gamma 分布 \(Gamma(\alpha+n, \beta+\sum x_i)\)。注意与泊松分布的区别。
4. Dirichlet分布 + 多项分布 = Dirichlet分布
Th. 设 \(\vec{\theta}=(\theta_1, \dots, \theta_K)\) 为多分类概率向量,且服从先验分布 \(Dir(\alpha_1, \dots, \alpha_K)\)。现进行 \(n\) 次试验(即数据服从多项分布),观测结果中第 \(k\) 类出现的次数为 \(m_k\)。则 \(\vec{\theta} | X\) 服从后验分布 \(Dir(\alpha_1+m_1, \dots, \alpha_K+m_K)\)。
proof.
\(P(\vec{\theta}) = \text{Dir}(\vec{\alpha}) \propto \prod_{k=1}^K \theta_k^{\alpha_k - 1}\)(根据 Dirichlet 分布的概率密度函数)
\(P(X|\vec{\theta}) =p(X_1|\vec{\theta}) p(X_2|\vec{\theta})... p(X_n|\vec{\theta})\propto \prod_{k=1}^K \theta_k^{m_k}\)
\(P(\vec{\theta}|X) \propto P(\vec{\theta}) \cdot P(X|\vec{\theta})\)
\(\phantom{P(\vec{\theta}|X)} \propto \prod_{k=1}^K \theta_k^{\alpha_k - 1} \cdot \prod_{k=1}^K \theta_k^{m_k}\)
\(\phantom{P(\vec{\theta}|X)} = \prod_{k=1}^K \theta_k^{(\alpha_k + m_k) - 1}\)
即 \(\vec{\theta} | X\) 服从 Dirichlet 分布 \(Dir(\alpha_1+m_1, \dots, \alpha_K+m_K)\)。
5. 正态分布 + 正态分布 = 正态分布 (方差已知)
Th. 设 \(\mu\) 为正态分布的均值(观测方差 \(\sigma^2\) 已知),且 \(\mu\) 服从先验分布 \(N(\mu_0, \sigma_0^2)\)。现观测到 \(n\) 个样本数据 \(X=\{x_1, \dots, x_n\}\)(均值为 \(\bar{x}\))。则 \(\mu | X\) 服从后验分布 \(N(\mu_n, \sigma_n^2)\)。
proof.
\(P(\mu) = N(\mu_0, \sigma_0^2) \propto \exp\left( -\frac{(\mu-\mu_0)^2}{2\sigma_0^2} \right)\)
\(P(X|\mu) = \prod_{i=1}^n N(x_i|\mu, \sigma^2) \propto \exp\left( -\frac{\sum_{i=1}^n(x_i-\mu)^2}{2\sigma^2} \right)\)
\(P(\mu|X) \propto P(\mu) \cdot P(X|\mu)\)
\(\phantom{P(\mu|X)} \propto \exp\left( -\frac{(\mu-\mu_0)^2}{2\sigma_0^2} \right) \cdot \exp\left( -\frac{\sum(x_i-\mu)^2}{2\sigma^2} \right)\)
\(\phantom{P(\mu|X)} = \exp\left( -\frac{1}{2} \left[ \frac{(\mu-\mu_0)^2}{\sigma_0^2} + \frac{\sum(x_i-\mu)^2}{\sigma^2} \right] \right)\)
通过整理 \(\mu\) 的二次项系数和一次项系数,可得 \(\mu | X\) 仍服从正态分布,且: * 后验精度:\(\frac{1}{\sigma_n^2} = \frac{1}{\sigma_0^2} + \frac{n}{\sigma^2}\)
- 后验均值:\(\mu_n = \frac{\frac{1}{\sigma_0^2}\mu_0 + \frac{n}{\sigma^2}\bar{x}}{\frac{1}{\sigma_0^2} + \frac{n}{\sigma^2}}\)
5.5 总结
本章系统地介绍了贝叶斯估计,旨在解决极大似然估计(MLE)在数据稀缺时容易过拟合及产生偏差的问题。
我们从贝叶斯公式出发,确立了后验分布 \(\propto\) 似然函数 \(\times\) 先验分布的核心推断框架。为了解决贝叶斯推断中分母(边缘似然)难以积分计算的痛点,本章重点讲解了两条捷径: 1. 最大后验概率(MAP):通过寻找后验概率最大的点来代替完整分布,并揭示了它在机器学习中等价于带正则项(L1/L2)的 MLE 这一重要本质。 2. 共轭先验:通过选择与似然函数匹配的特定先验分布(如 Beta-二项、Gamma-泊松、正态-正态),使得后验分布保持相同的函数形式,从而将复杂的概率积分转化为简单的参数更新。
归根结底,贝叶斯估计体现了数据与信念的动态折中。当数据不足时,先验知识能防止模型走偏;当数据充足时,观测事实则会主导结果。这是现代统计学习中处理不确定性和防止过拟合的数学基石。