<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>交叉熵 on 二三事</title><link>https://iharee.github.io/tags/%E4%BA%A4%E5%8F%89%E7%86%B5/</link><description>Recent content in 交叉熵 on 二三事</description><generator>Hugo</generator><language>zh-CN</language><lastBuildDate>Thu, 30 Jul 2026 18:14:27 +0800</lastBuildDate><atom:link href="https://iharee.github.io/tags/%E4%BA%A4%E5%8F%89%E7%86%B5/index.xml" rel="self" type="application/rss+xml"/><item><title>对交叉熵损失的见解</title><link>https://iharee.github.io/math-statistics/ce/</link><pubDate>Thu, 30 Jul 2026 18:14:27 +0800</pubDate><guid>https://iharee.github.io/math-statistics/ce/</guid><description>&lt;h1 id="交叉熵损失的形式"&gt;交叉熵损失的形式&lt;/h1&gt;
&lt;p&gt;对于回归任务，特别是简单的回归问题，我们通常使用 MSE（Mean Squared Error，均方误差）作为损失函数，少数情况下也使用 MAE（Mean Absolute Error）。MSE 有诸多优良性质，比如光滑、便于求导且导数仍光滑、在某些理想条件下具有凸性且等价于 MLE（Maximum Likelihood Estimation，极大似然估计）。此外，MSE 本身能被分解为偏差的平方、方差与噪声之和，这也为 MSE 提供了一种合理的解释。关于这部分内容，可见于另一篇我在本科时为《回归分析》课程所撰写的笔记：&lt;a href="https://iharee.github.io/math-statistics/regression/"&gt;回归分析&lt;/a&gt;。&lt;/p&gt;
&lt;p&gt;不过，今天我想从统计学与信息论两个角度分别讨论一个在分类任务中被广泛应用的损失函数——CE（Cross Entropy，交叉熵）损失。&lt;/p&gt;
&lt;p&gt;CE 的形式十分简单，在 $M$ 分类问题中，对于输入样本 $x$ ，记模型对 $x$ 关于第 $m$ 个分类的输出预测概率为 $q_m(x)$ 或 $q(y_m\mid x)$，而真实的概率为 $p_m(x)$ 或 $p(y_m\mid x)$，则样本 $x$ 的 CE 为
&lt;/p&gt;
$$
CE_x=-\sum^M_{i=1}p_i(x)\log_2q_i(x)
$$&lt;p&gt;
对于事先给出准确标签的有监督学习，在训练过程中往往有数据的真实标签，因此真实概率 $p$ 通常是 One-Hot 编码的，此时 CE 可简化为
&lt;/p&gt;
$$
CE_x=-\log_2q_{y}(x)
$$&lt;p&gt;
若考虑全部的 $N$ 个样本，则取各样本的平均 CE 作为损失函数，即
&lt;/p&gt;
$$
CE=-\frac{1}{N}\sum^N_{i=1}\sum^M_{j=1}p_j(x_i)\log_2q_j(x_i)
$$&lt;p&gt;对于 One-Hot 编码，可进一步简化为
&lt;/p&gt;
$$
CE=-\frac1{N}\sum_{i=1}^{N}\log_2q_{y_i}(x_i)
$$&lt;p&gt;
这应当是人尽皆知的故事，几乎是我们的常识。可是，为什么 CE 能够在（多）分类任务损失函数家族中占据统治地位呢？本文将从统计学与信息论两个视角分别讨论这一点，说明为什么 CE 适合分类任务。&lt;/p&gt;</description></item></channel></rss>