夏農熵計算器
根據事件機率或訊息中的字元頻率,以 bits 衡量資訊的不確定性。
計算資訊熵
選擇機率或文字,再輸入要分析的分布。
關於夏農熵
夏農熵是衡量機率分布中不確定性、意外程度或平均資訊量的數學指標。克勞德·夏農在奠定資訊理論基礎時提出這個概念。對於機率為 p 的各個結果,熵等於所有 p 乘以 p 的以 2 為底的對數之和的負值。以 2 為底的對數讓結果以 bits 表示,方便連結二進位編碼與數位通訊。
必然事件的熵為零,因為觀察它不會帶來意外。公平硬幣有兩個等機率結果,熵為一個 bit。四個等機率結果的熵為兩個 bits,八個則為三個 bits。可能符號數量固定時,所有符號等機率出現可達到最大熵。當分布集中在少數較可能的結果上時,觀察結果更容易預測,熵也隨之降低。
機率模式接受以逗號、空格或分號分隔的正小數機率。除了微小的浮點捨入誤差外,總和必須為一。文字模式統計訊息中的每個字元,將各字元頻率轉換為機率,再套用相同的熵公式。空格與標點也攜帶資訊,因此同樣視為符號。字元層級的熵適合快速比較,但不考慮相鄰字元之間的相依關係。
熵廣泛用於資料壓縮、編碼理論、決策樹、密碼學、生態學、語言分析及機器學習。壓縮器可為常見符號配置較短的編碼;當符號彼此獨立時,熵提供平均所需 bits 數的理論下限。在分類工作中,資訊增益比較資料分割前後的熵。在安全分析中,較高的觀測熵可能表示隨機性,但僅憑熵無法證明密碼、金鑰或產生器安全。
解讀結果時,應考量可能結果的數量與符號定義。直接比較不同大小字母表的原始熵可能造成誤解,因此顯示的最大熵可提供參考。小樣本也可能導致頻率估計不穩定。評估不確定性時,應使用具代表性的資料、保留有意義的符號,並結合領域知識。本計算器提供透明且具確定性的結果,適用於教學與探索性分析。
夏農熵範例
比較均衡與不均衡的機率分布。
| 分布 | 熵 | 解讀 |
|---|---|---|
| 0.5, 0.5 | 1 bit | 公平的二元結果具有兩種可能情況下的最大不確定性。 |
| 0.25, 0.25, 0.25, 0.25 | 2 bits | 四個等機率結果平均需要兩個 bits。 |
| 0.7, 0.2, 0.1 | 1.15678 bits | 第一個結果占主導地位,使此分布更容易預測。 |
如何使用夏農熵計算器
- 選擇「機率」分析已知分布,或選擇「文字訊息」計算字元頻率。
- 輸入總和為 1 的正機率值,或輸入要分析的訊息。
- 選擇「計算熵」,套用以 2 為底的夏農熵公式。
- 將熵與觀測符號數量對應的最大熵進行比較。
夏農熵常見問題
夏農熵衡量什麼?
它衡量結果的平均不確定性或資訊量。在所提供的分布下,熵越高,結果越難預測。
為什麼熵以 bits 衡量?
本計算器使用以 2 為底的對數,因此單位是 bit。其他對數底數會產生 nat 或 hartley 等單位。
夏農熵可以為零嗎?
可以。某個結果必然發生時,熵為零。觀察必然結果不會提供新資訊。
熵何時最大?
結果數量固定時,所有結果等機率出現可達到最大熵,其值為結果數量的以 2 為底的對數。
文字熵高是否代表加密安全?
不是。字元熵只是一項描述性統計量。安全加密需要可靠的演算法、金鑰、隨機性,以及頻率計算以外的分析。