2.9 深度学习的理论基础:信息论、估计理论与流形假设

深度学习的理论基础(Theoretical Foundations of Deep Learning)通常从信息论、估计理论以及流形假设(Manifold Assumption)等角度出发,解释神经网络为什么能有效学习:数据本身往往具有某种结构,而深度模型通过学习表征,把这种结构以可计算的方式“提取并压缩”,从而实现更好的预测与泛化。

02/23/2026

KL散度(Kullback–Leibler Divergence)——用一个分布近似另一个分布时的信息损失度量

KL散度(Kullback–Leibler Divergence)用于度量:当我们用一个概率分布去近似另一个概率分布时,会损失多少信息。它常用来定量比较真实数据分布与模型分布之间的差异,是机器学习与概率建模中的基础工具。

02/16/2026

交叉熵——用信息量度量两个概率分布之间差异的标准

交叉熵(Cross-Entropy)是在信息论视角下衡量两个概率分布差异的指标。在机器学习中,它常用来刻画真实分布(由标签暗含)与模型输出的预测分布之间的偏离程度。它的核心性质很直观:如果模型给真实发生的事件分配了很低的概率,就会产生很高的信息代价。

03/01/2026

信息论——解释信息量与不确定性的理论

信息论(Information Theory)是用来说明一个事件包含多少信息,以及这些信息能够被多高效地表示出来的理论框架。它最核心的思想很简单:经常发生的事件信息量小,而罕见事件的信息量大。信息论把这种直觉转化为可计算的数值,用来描述不确定性有多大、数据可以被压缩到什么程度,以及预测与真实结果之间的吻合程度。

03/17/2026

哈夫曼编码——一种根据符号频率分配可变长度编码、以减少总比特数的无损压缩方法

哈夫曼编码(Huffman Encoding)是一种经典的无损压缩方法,它根据符号出现频率的高低,为高频符号分配更短的编码、为低频符号分配更长的编码,从而减少表示同样信息所需的总比特数。由于压缩后的数据仍然可以被准确还原,哈夫曼编码一直被视为信息论与数据压缩中的基础算法之一。

03/18/2026

完整性——评估同一类别数据是否被聚集到同一个簇中的聚类质量标准

完整性(Completeness)是一个用于评估同一类别的数据是否集中在同一个簇中,而不是被分散到多个簇里的聚类质量指标。聚类算法通常是在没有真实标签的情况下对数据进行分组,但当数据集具有类别标签时,我们就可以进一步判断聚类结果是否形成了有意义的结构。在这种情况下,完整性关注的核心问题是:同一类数据是否被尽量聚到一起,而不是被切分到不同簇中。

03/15/2026

熵——用信息量定量刻画不确定性的标准

熵(Entropy)用于度量随机变量结果有多难预测:它把这种不确定性转化为需要的平均信息量(expected information)。熵是信息论的核心概念,由克劳德·香农(Claude Shannon)在 1948 年提出,用来回答通信中的一个关键问题:“为了高效编码与传输消息,平均需要多少比特?”

02/15/2026