MLE(Maximum Likelihood Estimation)是我们建模概率分布的常用方法。它的基本思想很简单:
给定一组数据,找一个分布,使得在此分布下,该组数据出现的概率(称为“似然”)最大。
本文将用一些简短的推导说明,KL散度的最小化将同样给出MLE.
KL散度衡量两个概率分布之间的“距离”,因此,用KL散度刻画分布建模的质量是自然的。
设X1,X2,...,Xn 是分布P∗ 给出的一组观测数据。考虑分布P与P∗的KL散度:
KL(P∗∣∣P)=x∑P∗(x)logP(x)P∗(x)=x∑P∗(x)logP∗(x)−x∑P∗(x)logP(x)=EP∗[logP∗(x)]−EP∗[logP(x)]
我们想要找一个P, 使得上式最小。注意上式第一项由真实分布P∗决定,与优化目标无关。因此最小化KL散度等价于最大化
EP∗[logP(x)]
注意X1,...,Xn由真实分布P∗给出,根据大数定律,上面的期望可以由
n1i=1∑nlogP(Xi)=n1logi=1∏nP(Xi)
给出。
其中
logi=1∏nP(Xi)
正是观测数据在概率模型P下的对数似然。