5.1 极大似然估计的局限

在上一章中,我们学习了极大似然估计(MLE)。它的核心思想非常直观:既然现在的样本发生了,那我就认为参数取值应该是让这些样本出现概率最大的那个值。在数据量充足的情况下,MLE 的效果非常好。

然而,当观测数据较少甚至缺失时,MLE 就会暴露出严重的缺陷,甚至得出违背常识的结论。我们可以通过两个例子来看清这一点:

  1. 抛硬币。假设我们抛了 3 次硬币,运气不好,3 次全是反面,正面次数为 0。按照 MLE 的公式,硬币正面朝上的概率估计值 \(\hat{p}=\frac{正面次数}{总次数}=0\)。此时 MLE 计算出的概率 \(\hat{p} = 0\)。这显然违背了我们的常识,因为我们知道硬币通常都有两面,仅仅因为 3 次实验没出现正面就断定它概率为 0 是极其武断的。

  2. 交通事故的时间间隔。假设事故间隔服从指数分布,MLE 估计的“平均间隔时间”就是样本的均值。如果路段刚开放,只发生了两次事故,观测到一个间隔数据 \(x_1\),MLE 会直接认为该路段的平均事故间隔就是 \(x_1\)。这会因为样本太少而极不可靠。更极端的情况是,如果第二次事故还没发生,我们根本没有间隔数据,MLE 就完全无法计算了。

MLE 的根本问题在于它完全依赖于当前的观测数据。当数据量太少时,观测到的特征可能只是偶然误差,不能代表总体规律。此时完全相信数据会导致估计值偏差巨大。在机器学习中,这种对有限样本过度拟合而忽略了普遍规律的现象,被称为“过拟合”。

为了解决这个问题,我们需要在数据之外引入额外的判断依据(比如“硬币通常是均匀的”这种常识)。这便是贝叶斯估计的基本思想。

5.2 贝叶斯公式与贝叶斯估计

我们在第一章中讲过贝叶斯公式。设 \(B_1, B_2, \dots, B_n\) 为完备事件群,则对于任意事件 \(A\)

\[ P(B_i|A) = \frac{P(A|B_i)P(B_i)}{\sum_{j} P(A|B_j)P(B_j)} \]

在统计推断(贝叶斯估计)中,我们将上述公式中的“事件”替换为“数据”和“参数”:

  • \(X\):观测到的样本数据(Evidence/Data)。

  • \(\theta\):模型的参数(Unknown Parameter)。

由此得到了贝叶斯估计的核心公式:

\[ p(\theta|X) = \frac{p(X|\theta)p(\theta)}{p(X)} = \frac{p(X|\theta)p(\theta)}{\int p(X|\theta)p(\theta) d\theta} \]

这个公式中的每一项都有其特定的统计学含义:

符号 名称 含义
\(p(\theta)\) 先验分布 在观测到数据之前,我们对参数 \(\theta\) 的认知或信念。这通常基于以往的经验、历史数据或主观判断,例如硬币正面朝上的概率是 \(\frac{1}{2}\)
\(p(X \| \theta)\) 似然函数 假设参数已知时,当前数据出现的概率。这与 MLE 中的似然函数完全一致。
\(p(\theta \| X)\) 后验分布 在观测到数据之后,我们对参数 \(\theta\) 的新认知。这是贝叶斯估计的最终目标,它综合了先验知识和数据信息。
\(p(X)\) 边缘似然 数据的全概率(归一化常数)。它通过对所有可能的 \(\theta\) 积分得到:\(p(X) = \int p(X\|\theta)p(\theta) d\theta\)

贝叶斯估计的理想目标是求出完整的后验分布 \(p(\theta|X)\)。然而,公式中的分母 \(p(X)\) 是一个积分

\[ p(X) = \int p(X|\theta)p(\theta) d \theta \]

如果 \(\theta\) 是高维向量,这个积分在数学上通常是不可积的 (Intractable) 或者计算量极其巨大。既然分母算不出来,我们就无法得到标准的后验分布。

为了解决这个问题,在实际应用中,我们通常采用两条捷径:

  1. 最大后验概率 (MAP):既然分母与 \(\theta\) 无关,那我们在求最大值时直接忽略分母,只关注分子。
  2. 共轭先验:挑选特殊的先验分布,使得我们可以通过代数运算直接推导出后验分布,从而避开积分。

5.3 最大后验概率(MAP)估计

正如前文所述,为了避开贝叶斯公式中分母(边缘似然 \(p(X)\))那个难以计算的积分,我们不再追求参数 \(\theta\) 的完整分布,而是退而求其次,寻找后验分布中概率密度最大的那个点。这就是 最大后验概率估计 (MAP)

5.3.1 MAP 的核心公式

根据贝叶斯公式: \[ p(\theta|X) = \frac{p(X|\theta)p(\theta)}{p(X)} \]

由于我们要找的是让 \(p(\theta|X)\) 最大的 \(\theta\) 值,而分母 \(p(X)\) 是关于数据 \(X\) 的积分,与参数 \(\theta\) 无关(相对于 \(\theta\) 是常数)。因此,优化时可以忽略分母:

\[ \begin{aligned} \hat{\theta}_{\text{MAP}} &= \operatorname*{argmax}_{\theta} p(\theta|X) \\ &= \operatorname*{argmax}_{\theta} \frac{p(X|\theta)p(\theta)}{p(X)} \\ &= \operatorname*{argmax}_{\theta} \underbrace{p(X|\theta)}_{\text{似然函数}} \cdot \underbrace{p(\theta)}_{\text{先验分布}} \end{aligned} \]

与 MLE 一样,为了方便计算,我们通常对目标函数取对数:

\[ \hat{\theta}_{\text{MAP}} = \operatorname*{argmax}_{\theta} \left( \ln p(X|\theta) + \ln p(\theta) \right) \]

如果数据 \(X = \{x_1, ..., x_n\}\) 是独立同分布 (i.i.d.) 的(通常都是独立同分布的),则展开为:

\[ \hat{\theta}_{\text{MAP}} = \operatorname*{argmax}_{\theta} \left( \sum_{i=1}^n \ln f(x_i|\theta) + \ln p(\theta) \right) \]

5.3.2 例子

抛 10 次硬币,其中正面(1)出现 7 次,反面(0)出现 3 次。根据常识,硬币大概率是均匀的。我们假设参数 \(\theta\)(正面朝上的概率)服从正态分布 \(N(0.5, 0.01)\),这就是 \(\theta\) 的先验分布。

似然函数:每个数据服从伯努利分布,进行 10 次试验,故 \(L(X|\theta) = \theta^7 (1-\theta)^3\)

先验分布:\(p(\theta) = \frac{1}{\sqrt{2\pi}\sigma} e^{-\frac{(\theta-\mu)^2}{2\sigma^2}} \propto e^{-\frac{(\theta-0.5)^2}{2 \times 0.01}} = e^{-50(\theta-0.5)^2}\)

因此

\[ \begin{aligned} \hat{\theta}_{\text{MAP}} &= \operatorname*{argmax}_{\theta} \left( \theta^7 (1-\theta)^3 \cdot e^{-50(\theta-0.5)^2} \right) \end{aligned} \]

求导得 \(J(\theta) = 7\ln \theta + 3\ln(1-\theta) - 50(\theta-0.5)^2\)

\(\frac{\partial J}{\partial \theta} = \frac{7}{\theta} - \frac{3}{1-\theta} - 100(\theta-0.5) = 0\),得 \(\theta≈0.558\),即硬币朝上的最大后验概率为 \(0.558\)

接下来让我们对比一下三种估计结果,就能理解 MAP 的作用。

估计方法 计算公式/来源 结果 含义
先验均值 仅凭经验 0.500 我坚信硬币是均匀的
MLE 估计 仅凭数据 (\(7/10\)) 0.700 数据显示正面概率很高,我完全信数据
MAP 估计 数据 + 经验 0.558 折中:数据把信念从 0.5 拉向了 0.7,但先验的引力把它拽回了一点

可以看到,MAP 估计值位于“先验均值”和“MLE 估计值”之间。先验分布方差越小(越确信先验),MAP 结果就越接近先验;数据量越大(\(n\) 越大),MAP 结果就越接近 MLE。

5.3.3 MAP 与 正则化

在机器学习(特别是深度学习)中,MAP 有一个极其重要的等价解释:MAP 就是带正则项的 MLE。

观察 Log-MAP 的公式: \[ \hat{\theta}_{\text{MAP}} = \operatorname*{argmax}_{\theta} \underbrace{\ln L(\theta)}_{\text{Loss项}} + \underbrace{\ln p(\theta)}_{\text{正则项}} \]

  • L2 正则化

    如果我们假设参数 \(\theta\) 服从正态分布 \(\theta \sim N(0, \sigma^2)\)\[ \ln p(\theta) \propto - \frac{\theta^2}{2\sigma^2} = -\lambda \|\theta\|^2 = -\lambda \|\theta\|_2\] 这正是我们熟悉的 L2 正则化!在损失函数中加 L2 正则,本质上就是假设权重参数服从高斯先验,然后做 MAP 估计。

  • L1 正则化

    如果我们假设参数 \(\theta\) 服从拉普拉斯分布\[ \ln p(\theta) \propto -|\theta| = -\lambda \|\theta\|_1 \] 这正是 L1 正则化

因此,这一章学的 MAP 并不是什么过时的统计概念,它是现代 AI 模型防止过拟合(Regularization)的数学基石。

5.4 共轭先验分布

在 MAP 中,我们为了避开积分,选择了忽略分母。而在共轭先验的方法中,我们通过巧妙选择先验分布 \(p(\theta)\) 的形式,使得它和似然函数 \(p(X|\theta)\) 共轭,生成的后验分布 \(p(\theta|X)\) 与先验分布 \(p(\theta)\) 属于同一种分布。这样做的好处是,我们完全不需要做积分,只需要做简单的加法来更新参数即可。

我们先给出结论,并通过例子解释结论怎么用,最后推导结论。

5.4.1 共轭分布大全

符号说明:

  • \(n\):样本数量

  • \(\sum x_i\):样本观测值的总和

  • \(\alpha, \beta\):先验分布的参数(超参数)

  • \(\alpha', \beta'\):后验分布的参数

先验分布 似然函数 后验分布 更新公式
\(\text{Beta}(\alpha, \beta)\) 二项分布 / 伯努利 \(\text{Beta}(\alpha', \beta')\) \(\alpha' = \alpha + \text{成功次数}\)
\(\beta' = \beta + \text{失败次数}\)
\(\text{Gamma}(\alpha, \beta)\) 泊松分布 \(\text{Gamma}(\alpha', \beta')\) \(\alpha' = \alpha + \sum x_i\)
\(\beta' = \beta + n\)
\(\text{Gamma}(\alpha, \beta)\) 指数分布 \(\text{Gamma}(\alpha', \beta')\) \(\alpha' = \alpha + n\)
\(\beta' = \beta + \sum x_i\)
\(\text{N}(\mu_0, \sigma_0^2)\) 正态分布 (已知 \(\sigma^2\)) \(\text{N}(\mu_n, \sigma_n^2)\) \(\frac{1}{\sigma_n^2} = \frac{1}{\sigma_0^2} + \frac{n}{\sigma^2}\)
\(\mu_n = \frac{\frac{1}{\sigma_0^2}\mu_0 + \frac{n}{\sigma^2}\bar{x}}{\frac{1}{\sigma_0^2} + \frac{n}{\sigma^2}}\)
\(\text{Dir}(\mathbf{\alpha})\) 多项分布 \(\text{Dir}(\mathbf{\alpha}')\) \(\alpha_k' = \alpha_k + \text{第}k\text{类的计数}\)

在贝叶斯统计中,如果后验分布与先验分布属于同类,则先验分布与后验分布互为共轭分布,先验分布称为似然函数的共轭先验。 例如表格第一行,Beta 分布与 Beta分布互为共轭分布,Beta分布是二项分布/伯努利分布的共轭先验。

下面通过例子解释这个表格的用法。

5.4.2 例子

1. Beta分布+二项分布=Beta分布

Beta 分布 \(p \sim Beta(\alpha, \beta)\) 定义在 \([0,1]\) 区间上,描述的是我们对某个事件发生概率 \(p\) 的信心。 \(\alpha\) 可以看作虚拟的成功次数,\(\beta\) 看作虚拟的失败次数。

现在要估计硬币正面朝上的概率 \(p\)

  • 先验:根据尝试,硬币正面朝上和反面朝上的概率是相等的。设先验为 \(Beta(10, 10)\),这意味着我假装之前已经抛过 20 次,10 正 10 反。
  • 数据:新做了 \(n=10\) 次实验,7 正 3 反。
  • 后验:根据更新公式,\(\alpha' = 10+7=17, \beta'=10+3=13\)。后验为 \(Beta(17, 13)\)
  • 估计:后验均值 \(\text{E}(p)=\frac{17}{17+13}=\frac{17}{30}\)。即硬币正面朝上的概率为 \(\frac{17}{30}\)

2. Gamma分布+泊松分布=Gamma分布

Gamma 分布 \(\lambda \sim Gamma(\alpha, \beta)\) 定义在 \((0, +\infty)\),通常用于描述单位时间内事件发生的次数 \(\lambda\),或事件发生的速率。其中 \(\alpha\) 代表总次数,\(\beta\) 代表总时间。

现在要估计单位时间(这里取 1 小时)内进站的公交车数量 \(\lambda\)

  • 先验:根据经验,每小时大概来 3 辆。设 Gamma(3, 1)(意思是 1 小时观察到了 3 辆)。
  • 数据:观察了 \(n=2\) 小时,分别来了 4 辆和 6 辆。总数 \(\sum x = 10\)
  • 后验:根据更新公式,\(\alpha' = 3 + 10 = 13\) (总共来了 13 辆), \(\beta' = 1 + 2 = 3\) (总共观察了 3 小时)。后验为 \(Gamma(13, 3)\)
  • 估计:后验均值 \(\text{E}(\lambda) = 13/3\)。即一小时内来了 \(13/3\) 辆公交车。

3. Gamma分布+指数分布=Gamma分布

设灯泡寿命 \(X \sim Exp(\lambda)\)。现在要估计灯泡的寿命。

  • 先验:\(Gamma(10, 1800)\),即根据经验,10个灯泡的总寿命是1800小时。
  • 数据:测试了 \(n=5\) 个灯泡,寿命总和 \(\sum x = 1000\) 小时。
  • 后验:注意这里 \(\alpha\) 更新的是样本个数\(\beta\) 更新的是观测值总和。 根据更新公式,\(\alpha' = \alpha + 5=15, \quad \beta' = \beta + 1000=2800\)
  • 估计:后验均值 \(\text{E}(X) = \frac{2800}{15}=186.66\),即灯泡的平均寿命是186.66小时。

需要注意的是,gamma+泊松与gamma+指数的更新公式正好相反。本质原因是,泊松分布中,时间是固定的(人为选取的,比如上面观察了2小时内进站的公交车数量),次数是随机变量(1小时内进站的公交车数量,是观测得到的);而泊松分布中,时间是随机变量(观测到的灯泡寿命),次数是固定的(人为选取的,比如上面测试了5个灯泡)。两者的定义相反,导致更新公式正好相反。

4. Dirichlet分布+多项分布=Dirichlet分布

Dirichlet分布是 Beta 分布在高维上的推广。Beta 是两面的硬币,Dirichlet 是 \(K\) 面的骰子。它描述的是多分类概率向量 \(\mathbf{p}=(p_1, ..., p_K)\) 的分布。\(Dir(\alpha_1, \alpha_2, ..., \alpha_k)\) 的参数 \(\alpha_1, \alpha_2, ..., \alpha_k\) 分别代表事件 1,2,…,k 出现次数的伪计数。

现在有一个三面的骰子。

  • 先验:\(Dir(1, 1, 1)\)。这代表均匀分布认为每一面出现的概率相等。
  • 数据:现在投了若干次骰子,投掷结果为:1点出现2次,2点出现0次,3点出现1次。向量 \(\mathbf{m} = (2, 0, 1)\)
  • 后验:根据更新公式,\(Dir(\alpha_1', \alpha_2', \alpha_3')=Dir(1+2, 1+0, 1+1) = Dir(3, 1, 2)\)
  • 估计:第1面朝上的概率为 \(\frac{3}{3+1+2}=\frac{1}{2}\),第2面朝上的概率为 \(\frac{1}{3+1+2}=\frac{1}{6}\),第3面朝上的概率为 \(\frac{2}{3+1+2}=\frac{1}{3}\)

5. 正态分布+正态分布=正态分布

测量温度,假设已知温度计的测量误差方差为 \(\sigma^2=1\)(即精度为 \(1/\sigma^2 = 1\))。现在要估计真实气温 \(\mu\)

  • 先验:根据天气预报或体感,我相信气温在 25 度左右,不确定度(方差)为 \(\sigma_0^2=2\)。这意味着先验分布为 \(N(25, 2)\),先验精度为 \(1/2 = 0.5\)
  • 数据:做了一次测量 (\(n=1\)),温度计读数 \(x=30\)。数据的观测精度为 \(1/1 = 1\)
  • 后验:正态分布的后验均值是先验均值和观测数据的加权平均,权重是各自的精度(方差的倒数);后验精度是先验精度与观测精度之和。
    • 后验精度:\(\frac{1}{\sigma'^2} = \frac{1}{\sigma_0^2} + \frac{n}{\sigma^2} = 0.5 + 1 = 1.5\)。因此后验方差 \(\sigma'^2 = \frac{1}{1.5} \approx 0.67\)
    • 后验均值:\(\mu' = \frac{\text{先验精度} \cdot \mu_0 + \text{数据精度} \cdot x}{\text{总精度}} = \frac{0.5 \times 25 + 1 \times 30}{0.5 + 1} = \frac{12.5 + 30}{1.5} = \frac{42.5}{1.5} \approx 28.33\)
    • 后验分布为 \(N(28.33, 0.67)\)
  • 估计:后验均值 \(\text{E}(\mu) = 28.33\)

5.4.3 数学原理与推导

上面五个例子直观地展示了共轭分布与更新公式的用法。事实上,这五个例子非常符合人们的直觉,即在经验的基础上,根据新观测到的数据,更新信念。

下面通过数学推导更新公式。 这里的核心逻辑是,写出 \(先验分布 \times 似然函数\),然后忽略常数,看剩下的部分像什么分布。

1. Beta分布 + 二项分布 = Beta分布

Th. 设 \(\theta\) 为事件成功的概率,且服从先验分布 \(Beta(\alpha, \beta)\)。现又做了 \(n\) 次试验(即数据服从二项分布 \(X \sim B(n, \theta)\)),成功次数为 \(k\)。则现在 \(\theta | X\) 服从后验分布 \(Beta(\alpha+k, \beta+n-k)\)

proof.

\[ p(\theta) = \text{Beta}(\alpha, \beta) \propto \theta^{\alpha-1}(1-\theta)^{\beta-1}(根据 Beta 分布的概率密度函数) \]

\[ p(X|\theta) = C_{n}^{k} \theta^k (1-\theta)^{n-k} \propto \theta^k (1-\theta)^{n-k} \]

\[ P(\theta|X) \propto P(\theta) \cdot P(X|\theta) \]

\[ \phantom{P(\theta|X)} \propto \theta^{\alpha-1}(1-\theta)^{\beta-1} \cdot \theta^k (1-\theta)^{n-k} \]

\[ \phantom{P(\theta|X)} = \theta^{(\alpha+k)-1} (1-\theta)^{(\beta+n-k)-1} \]

\(\theta | X\) 服从 Beta 分布 \(Beta(\alpha+k, \beta+n-k)\)

2. Gamma分布 + 泊松分布 = Gamma分布

Th. 设 \(\lambda\) 为单位时间内某事件发生的次数,且满足先验分布 \(Gamma(\alpha, \beta)\)。现观测了 \(n\) 单位时间(即数据服从泊松分布 \(X \sim Poi(\lambda)\)),得到观测数据 \(X=\{X_1, X_2, ..., X_n\}\),其中 \(X_i\) 为第 \(i\) 个小时观测到的事件发生次数。则 \(\lambda | X\) 服从分布 \(Gamma(\alpha + \sum X_i, \beta+n)\)

proof.

\(p(\lambda) = \text{Gamma}(\alpha, \beta) \propto \lambda^{\alpha-1} e^{-\beta\lambda}\)(根据 Gamma 分布的概率密度函数)

\(p(X|\lambda) = p(X_1|\lambda) p(X_2|\lambda)... p(X_n|\lambda)=\prod \frac{\lambda^{x_i}e^{-\lambda}}{x_i!} \propto \lambda^{\sum x_i} e^{-n\lambda}\)

\(P(\lambda|X) \propto P(\lambda) \cdot P(X|\lambda)\)

\(\phantom{P(\lambda|X)} \propto \lambda^{\alpha-1} e^{-\beta\lambda} \cdot \lambda^{\sum x_i} e^{-n\lambda}\)

\(\phantom{P(\lambda|X)} = \lambda^{(\alpha+\sum x_i)-1} e^{-(\beta+n)\lambda}\)

\(\lambda | X\) 服从 Gamma 分布 \(Gamma(\alpha+\sum x_i, \beta+n)\)

3. Gamma分布 + 指数分布 = Gamma分布

Th. 设 \(\lambda\) 为灯泡坏掉的速率,且 \(\lambda\) 服从先验分布 \(Gamma(\alpha, \beta)\)。现在又观测了 \(n\) 个灯泡(即数据服从指数分布 \(X \sim Exp(\lambda)\)),得到观测数据 \(X=\{X_1, X_2,...,X_n\}\),其中 \(X_i\) 为第 \(i\) 个灯泡的寿命。则 \(\lambda | X\) 服从 Gamma 分布 \(Gamma(\alpha+n, \beta+\sum X_i)\)

proof.

\(p(\lambda) = \text{Gamma}(\alpha, \beta) \propto \lambda^{\alpha-1} e^{-\beta\lambda}\)(根据 Gamma 分布的概率密度函数)

\(p(X|\lambda) = p(X_1|\lambda) p(X_2|\lambda)... p(X_n|\lambda)= \prod \lambda e^{-\lambda x_i} = \lambda^n e^{-\lambda \sum x_i}\)

\(P(\lambda|X) \propto P(\lambda) \cdot P(X|\lambda)\)

\(\phantom{P(\lambda|X)} \propto \lambda^{\alpha-1} e^{-\beta\lambda} \cdot \lambda^n e^{-\lambda \sum x_i}\)

\(\phantom{P(\lambda|X)} = \lambda^{(\alpha+n)-1} e^{-(\beta+\sum x_i)\lambda}\)

\(\lambda|X\) 服从 Gamma 分布 \(Gamma(\alpha+n, \beta+\sum x_i)\)注意与泊松分布的区别。

4. Dirichlet分布 + 多项分布 = Dirichlet分布

Th. 设 \(\vec{\theta}=(\theta_1, \dots, \theta_K)\) 为多分类概率向量,且服从先验分布 \(Dir(\alpha_1, \dots, \alpha_K)\)。现进行 \(n\) 次试验(即数据服从多项分布),观测结果中第 \(k\) 类出现的次数为 \(m_k\)。则 \(\vec{\theta} | X\) 服从后验分布 \(Dir(\alpha_1+m_1, \dots, \alpha_K+m_K)\)

proof.

\(P(\vec{\theta}) = \text{Dir}(\vec{\alpha}) \propto \prod_{k=1}^K \theta_k^{\alpha_k - 1}\)(根据 Dirichlet 分布的概率密度函数)

\(P(X|\vec{\theta}) =p(X_1|\vec{\theta}) p(X_2|\vec{\theta})... p(X_n|\vec{\theta})\propto \prod_{k=1}^K \theta_k^{m_k}\)

\(P(\vec{\theta}|X) \propto P(\vec{\theta}) \cdot P(X|\vec{\theta})\)

\(\phantom{P(\vec{\theta}|X)} \propto \prod_{k=1}^K \theta_k^{\alpha_k - 1} \cdot \prod_{k=1}^K \theta_k^{m_k}\)

\(\phantom{P(\vec{\theta}|X)} = \prod_{k=1}^K \theta_k^{(\alpha_k + m_k) - 1}\)

\(\vec{\theta} | X\) 服从 Dirichlet 分布 \(Dir(\alpha_1+m_1, \dots, \alpha_K+m_K)\)

5. 正态分布 + 正态分布 = 正态分布 (方差已知)

Th. 设 \(\mu\) 为正态分布的均值(观测方差 \(\sigma^2\) 已知),且 \(\mu\) 服从先验分布 \(N(\mu_0, \sigma_0^2)\)。现观测到 \(n\) 个样本数据 \(X=\{x_1, \dots, x_n\}\)(均值为 \(\bar{x}\))。则 \(\mu | X\) 服从后验分布 \(N(\mu_n, \sigma_n^2)\)

proof.

\(P(\mu) = N(\mu_0, \sigma_0^2) \propto \exp\left( -\frac{(\mu-\mu_0)^2}{2\sigma_0^2} \right)\)

\(P(X|\mu) = \prod_{i=1}^n N(x_i|\mu, \sigma^2) \propto \exp\left( -\frac{\sum_{i=1}^n(x_i-\mu)^2}{2\sigma^2} \right)\)

\(P(\mu|X) \propto P(\mu) \cdot P(X|\mu)\)

\(\phantom{P(\mu|X)} \propto \exp\left( -\frac{(\mu-\mu_0)^2}{2\sigma_0^2} \right) \cdot \exp\left( -\frac{\sum(x_i-\mu)^2}{2\sigma^2} \right)\)

\(\phantom{P(\mu|X)} = \exp\left( -\frac{1}{2} \left[ \frac{(\mu-\mu_0)^2}{\sigma_0^2} + \frac{\sum(x_i-\mu)^2}{\sigma^2} \right] \right)\)

通过整理 \(\mu\) 的二次项系数和一次项系数,可得 \(\mu | X\) 仍服从正态分布,且: * 后验精度:\(\frac{1}{\sigma_n^2} = \frac{1}{\sigma_0^2} + \frac{n}{\sigma^2}\)

  • 后验均值:\(\mu_n = \frac{\frac{1}{\sigma_0^2}\mu_0 + \frac{n}{\sigma^2}\bar{x}}{\frac{1}{\sigma_0^2} + \frac{n}{\sigma^2}}\)

5.5 总结

本章系统地介绍了贝叶斯估计,旨在解决极大似然估计(MLE)在数据稀缺时容易过拟合及产生偏差的问题。

我们从贝叶斯公式出发,确立了后验分布 \(\propto\) 似然函数 \(\times\) 先验分布的核心推断框架。为了解决贝叶斯推断中分母(边缘似然)难以积分计算的痛点,本章重点讲解了两条捷径: 1. 最大后验概率(MAP):通过寻找后验概率最大的点来代替完整分布,并揭示了它在机器学习中等价于带正则项(L1/L2)的 MLE 这一重要本质。 2. 共轭先验:通过选择与似然函数匹配的特定先验分布(如 Beta-二项、Gamma-泊松、正态-正态),使得后验分布保持相同的函数形式,从而将复杂的概率积分转化为简单的参数更新。

归根结底,贝叶斯估计体现了数据与信念的动态折中。当数据不足时,先验知识能防止模型走偏;当数据充足时,观测事实则会主导结果。这是现代统计学习中处理不确定性和防止过拟合的数学基石。