香农熵计算器

根据事件概率或消息中的字符频率,以 bits 衡量信息的不确定性。

计算信息熵
选择概率或文本,然后输入要分析的分布。

关于香农熵

香农熵是衡量概率分布中不确定性、意外程度或平均信息量的数学指标。克劳德·香农在奠定信息论基础时提出了这一概念。对于概率为 p 的各个结果,熵等于所有 p 乘以 p 的以 2 为底的对数之和的负值。以 2 为底的对数使结果以 bits 表示,便于联系二进制编码和数字通信。 必然事件的熵为零,因为观察它不会带来意外。公平硬币有两个等概率结果,熵为一个 bit。四个等概率结果的熵为两个 bits,八个则为三个 bits。在可能符号数量固定时,所有符号等概率出现可达到最大熵。当分布集中在少数较可能的结果上时,观察结果更容易预测,熵也随之降低。 概率模式接受用逗号、空格或分号分隔的正小数概率。除微小的浮点舍入误差外,其总和必须为一。文本模式统计消息中的每个字符,将各字符频率转换为概率,再使用同一熵公式。空格和标点也携带信息,因此同样视为符号。字符级熵适合快速比较,但不考虑相邻字符之间的依赖关系。 熵广泛用于数据压缩、编码理论、决策树、密码学、生态学、语言分析和机器学习。压缩器可为常见符号分配更短的编码;当符号相互独立时,熵给出了平均所需 bits 数的理论下限。在分类任务中,信息增益比较数据划分前后的熵。在安全分析中,较高的观测熵可能意味着随机性,但仅凭熵无法证明密码、密钥或生成器安全。 解读结果时,应结合可能结果的数量及符号定义。直接比较不同大小字母表的原始熵可能产生误导,因此显示的最大熵可作为参考。小样本也可能导致频率估计不稳定。评估不确定性时,应使用有代表性的数据、保留有意义的符号,并结合领域知识。本计算器提供透明、确定性的结果,适用于教学和探索性分析。

香农熵示例

比较均衡与不均衡的概率分布。

分布解读
0.5, 0.51 bit公平的二元结果具有两种可能情况下的最大不确定性。
0.25, 0.25, 0.25, 0.252 bits四个等概率结果平均需要两个 bits。
0.7, 0.2, 0.11.15678 bits第一个结果占主导,使此分布更容易预测。

如何使用香农熵计算器

  1. 选择“概率”分析已知分布,或选择“文本消息”计算字符频率。
  2. 输入总和为 1 的正概率值,或输入要分析的消息。
  3. 选择“计算熵”,应用以 2 为底的香农熵公式。
  4. 将熵与观测符号数量对应的最大熵进行比较。

香农熵常见问题

香农熵衡量什么?

它衡量结果的平均不确定性或信息量。对于所提供的分布,熵越高,结果越难预测。

为什么熵以 bits 衡量?

本计算器使用以 2 为底的对数,因此单位是 bit。其他对数底数会产生 nat 或 hartley 等单位。

香农熵可以为零吗?

可以。某个结果必然发生时,熵为零。观察必然结果不会提供新信息。

熵何时最大?

结果数量固定时,所有结果等概率出现可达到最大熵,其值为结果数量的以 2 为底的对数。

文本熵高是否意味着加密安全?

不是。字符熵只是一个描述性统计量。安全加密需要可靠的算法、密钥、随机性,以及频率计算之外的分析。