变分下界 ELBO

相关:变分自编码器VAE笔记(单步潜变量模型) | 去噪扩散概率模型DDPM笔记(多步潜变量模型上的 ELBO)

预备:概率记号与期望

不熟悉概率记号?先读本节,再回到 边缘分布的困难。

随机变量与分布 、

随机变量是”结果不确定的量”:掷骰子的点数、明天气温;分布 描述它取各个值的可能性大小。

  • 离散情形(如骰子):,例如 ;
  • 连续情形(如气温): 是密度函数,” 落在 的概率 ”。

分布必须归一化(所有可能性的总概率为 1):

本笔记中 是观测数据(看得见的,如图片、文本), 是隐变量(看不见的,如图片的物体类别); 叫先验,是”对 事先的认识”。

联合、条件、边缘与贝叶斯公式

  • :联合分布, 与 同时取该值的概率;
  • :条件分布,给定 之后 的概率,竖线读作”在……条件下”;
  • 乘法公式:;
  • 边缘化:把不关心的 积分掉,,这正是正文要算的量。

把乘法公式换一种排列就是贝叶斯公式:

四个角色:先验 、似然 、后验 、证据 。 例: 大,即”看到菜刀后,这是位厨师”的概率高;背景中菜刀极少与螺丝刀、雨伞同时出现,后两者的贡献可忽略。

期望:按概率加权平均

期望就是”以概率为权重求平均”。掷骰子:。

直观上 是”重复实验无穷多次的平均结果”。任意函数 的期望同理:

期望满足线性性:、(正文把常数 提出期望用的就是这条)。 注意 : 是凹函数,只有 Jensen 不等式 (下文推导会用到)。

记号 E_{z∼q}[·]

读作” 按分布 抽取,再对括号内取平均”:

与 的区别只是显式写明平均所用的分布。本笔记主要在四处使用它:

  1. KL 散度:,即按 平均两个分布对数之比;
  2. 指数例子中的矩:、,代入即可闭式计算 ELBO;
  3. 重要性采样恒等式:,只要 的支撑覆盖 就成立,是 Jensen 路线的基础;
  4. 重构项:,按变分分布平均”重构对数似然”。

边缘分布的困难

概率记号不熟?先看 预备:概率记号与期望。

隐变量与后验

我们想对观测数据 的分布 建模,但直接建模十分困难。 引入简单隐变量 ,把边缘分布写成

该积分一般无法解析计算;注意 不含 ,在关于 的期望中可视为常数。 由贝叶斯公式

困难集中在后验 上,故引入参数化的变分分布 来近似它。 为记号简洁,推导中先写与 无关的 ,VAE(见 变分自编码器VAE笔记)再推广为编码器 ;相应地,生成过程为 、(解码器)。

直观理解

由 可知,被积函数只在 大的区域显著,其余 几乎没有贡献。 因此近似 时只需覆盖后验集中的区域,这正是 应集中的地方。 例如 大,菜刀对 的计算贡献大;而螺丝刀、雨伞之类可以舍弃。

ELBO 的推导

思路: 难算,就用 KL 散度度量 与后验的差距,把 从该距离中反解出来。

KL 散度分解

从变分分布与后验的 KL 散度出发:

代入 ,并把常数 提出期望:

移项即得基本恒等式:

Jensen 不等式路线

同一下界也可由重要性采样加 Jensen 得到: 是 的无偏估计,

取对数后由 的凹性(Jensen 不等式):

两边缺口恰为 ,与 KL 路线一致。

“下界”的含义

由 得 ,即 ELBO 是对数似然(对数证据)的下界。 最大化 同时最小化了 KL 散度,使 更接近真实后验,也把下界抬向 。

等价形式与两项解读

重构项 − 正则项

把 拆开:

重构项 为什么叫”重构”,分三步看:

  1. 是”给定 生成出 的概率”,扮演解码器: 是压缩后的编码, 是从编码恢复出的数据;
  2. 大,说明”用这个 生成 “这件事很靠谱,即 保存了 的关键信息;
  3. 外面按 取平均,意为”按变分分布随机抽一个 ,都应该能解释 “——这就是”由 能准确重构 ”。

呼应前面的例子: 大,就是从隐变量”厨师”能重构出观测”菜刀”;反过来 小,就重构不出来。 用例子里的高斯似然 看得最直接:最大化重构项 ⟺ 最小化 ,抽出的 必须贴近 。一维时是数值贴近;VAE 中则是解码器输出的重建图与输入图逐像素接近。

正则项 起平衡作用:若只看重构项, 会坍缩成”把全部概率放在单个 上的退化分布”(最能重构 的那个点);正则项用先验 把 拉住,使它不坍缩、保持在先验附近并保留一定宽度。

例子:指数先验与高斯似然

联合分布与真实后验

先验取简单分布 ,似然为 .

指数配方 ,故后验为截断正态:

归一化常数 随观测 变化且难以解析计算,正是变分近似的动机。

优化 ELBO

取变分分布为指数分布 ,则 . 利用指数分布矩 、,展开 :把不含 且与 无关的项并入 ,而 必须保持显式(它含 ,求导时不能丢):

令导数为零:

取 ,解得 .

结果讨论

此时变分分布均值 ,与真实后验(中心在 的截断正态)形态相近,验证了”最大化 ELBO 使 逼近后验”。 本例中所有期望均可闭式计算,无需采样; 的归一化常数从头到尾没有算过,这正是变分近似的价值。

走向 VAE

把变分分布推广为编码器 后,配合解码器 与重参数化技巧,就得到完整的 VAE——网络结构、损失推导与训练细节见 变分自编码器VAE笔记。

主线回顾

  1. 动机: 的积分难算,根源是后验 未知;
  2. 推导:由 KL 分解或 Jensen 不等式得恒等式 ;
  3. 解读:ELBO 拆为重构项 + 正则项,两项均可计算;
  4. 例证:指数先验 × 高斯似然下闭式优化 ,验证 ;
  5. 应用:VAE(见 变分自编码器VAE笔记)用编码器输出变分参数,重参数化保证梯度可回传。

相关:KL 散度分解 | 重构项 − 正则项 | 优化 ELBO | 结果讨论 | 变分自编码器VAE笔记