在贝叶斯学派中,如果后验分布 与先验概率分布 在相同的概率分布族中,则先验分布和后验分布称为「共轭分布」,而先验分布被称为似然函数的「共轭先验」(Conjugate prior)。
要想真正了解共轭分布和它的用途,我们需要从贝叶斯学派说起。
贝叶斯学派试图描述观察者在已有的先验知识状态下,在观测到新事件发生后得到后验知识状态。与之对立的是频率学派,频率学派强调从样本数据中直接得到出现的比例或者频率。频率学派需要大量样本数据作为支持,但是实际应用上,比如在药物等真实场景上是没有这么多数据的,因此在真实环境下贝叶斯理论使用更为广泛。
介绍几个与贝叶斯定理有关的概念。
「似然函数」(Likelihood): 关于统计模型中的参数 的函数,表示模型参数中的似然性;
「先验分布」(Prior):在未看到观测数据的时候参数 的不确定性的概率分布;
「后验分布」(Posterior):考虑和给出相关证据或数据后所得到的条件概率分布;
「分母」():可以理解为是正则化,使得最终概率相加为1,符合基本约束的作用。
在贝叶斯定理中,参数先有一个先验认知(先验分布),然后通过观察新数据,得到后验认知(后验分布)。

在贝叶斯统计中,如果后验分布与先验分布属于同类(分布形式相同),则先验分布与后验分布被称为「共轭分布」,而先验分布被称为似然函数的「共轭先验」。

由于「后验分布 似然函数*先验分布」,因此,我们可以通过将似然函数、先验分布和正则项带入的方式来验证后验分布与先验分布是否属于共轭分布。如果形式相同,那就说明他们是共轭分布。
举个例子,我们认为有一个二项分布的似然函数,先验分布服从 Beta 分布。基于以上条件,我们来求后验分布。
似然:
先验:
后验:
这里计算的中间过程中用了两次正比简化计算过程,第一次是将正则化的分母去掉了,因为分母对这里的参数π是没有影响的。第二次是最后一步中去掉所有不包含 的项, 是样本数据中确定的, 是先验分布中已确定的参数,也是对 没有影响的。
因此后验也是符合 Beta 分布,只是参数有所不同:。由此我们知道 Beta 分布和二项分布是共轭的。
从上面例子推导结果中,我们其实已经能看到共轭分布的意义了。
因为后验分布和先验分布形式相近,只是参数有所不同,这意味着当我们获得新的观察数据时,我们就能直接通过参数更新,获得新的后验分布,此后验分布将会在下次新数据到来的时候成为新的先验分布。如此一来,我们更新后验分布就不需要通过大量的计算,十分方便。
我们继续结合上面二项分布和 Beta 分布的共轭证明,以抛硬币作为例子说明共轭的意义。
此处先简单介绍一下 Beta 分布。
每个概率模型都有其现实意义,Beta 分布是指一组定义在 (0, 1) 区间的连续概率分布,有两个参数 ,
模型会在 处取最大值,模型均值 。
Beta 分布常用于表示概率的概率分布,常用于表示成功或者失败的概率的概率分布。
假设我们有一个硬币,似然函数采用二项分布,先验认为抛一次硬币正面的平均概率是 0.5,且 P(正面)= ,其中 的取值服从 分布,即 。此处只要使得模型期望等特征与设想相同,取值还可以是其他的数字,比如 。模型参数的选择将会影响后面观察数据对后验的贡献,下面举例进行说明。
假设后面我们扔了十次硬币,结果是三正七反。回想上面我们对二项分布和Beta分布的共轭证明中得到后验分布将服从的 Beta 分布形式:
此时我们的 ,由此我们可以得到后验服从 ,平均概率约等于 0.482。但是如果我们认为先验分布服从 分布,那后验将会是 ,平均概率约等于0.499。在两个模型下,后验分布的期望概率都比之前的0.5要小,十次硬币的数据样本对后面一个模型的后验分布的影响较小。由此可见,先验分布的参数选择有时会影响到样本数据对后验的贡献等,大家应根据自己实际情况进行先验分布模型的具体参数的选择。
如果没有共轭的话会怎么样?
如果没有共轭,在需要计算多批新样本数据下的后验分布时,每次计算都需要整体重新计算。反之如果存在共轭分布,共轭可以使得我们的后验分布,之后直接成为“先验”,不需要重新整体计算,只需要考虑新样本数据。因此共轭的存在将会给我们对后验的更新带来极大的便利。
共轭还可以保证后验分布符合某概率模型分布,而常见的概率模型分布如Beta、Gamma、正态分布等会有一些已有的数学性质可以直接使用,比如期望、极值点等。