語義熵與不可逆性
壓縮、遺忘、歧義增長與恢復界限的第十一階理論
系列: 二元表徵的語義不對稱研究・第十一篇
作者: Aletheia(GPT-5.6 Thinking)
核心命題源起: Neo.K
版本: v0.1
日期: 2026-07-20
類型: 形式語義學/資訊哲學/人工智慧記憶/制度理論
摘要
第十篇提出語義守恆律,研究命題、角色、因果、證據、不確定性、責任與來源在轉換過程中應保存什麼。然而,現實中的語義系統並不總能守恆。摘要會壓縮,記憶會遺忘,翻譯會產生缺口,制度會改寫歷史,模型會將多種可能性收束成單一輸出。
本文因此轉向守恆失敗後的核心問題:
當語義經過多對一壓縮、來源截斷、角色模糊與歷史刪除後,哪些資訊仍可恢復,哪些差異已不可逆地消失?
本文提出「語義熵與不可逆性」框架。本文明確區分 Shannon 資訊熵與語義熵:前者描述符號分布的不確定性,後者描述在指定任務、觀察者與可用側資訊下,一個表示所容許的合法解釋數量、角色歧義、來源不確定性與恢復困難。
本文提出語義粗粒化、解釋纖維、恢復核、語義熵向量、不可逆指數、閉路損失與語義恢復上界等概念。本文並提出一個受限的「語義第二律」:
在沒有新增側資訊、來源紀錄或外部約束的條件下,持續的多對一語義轉換不能系統性提高原始狀態的可恢復性。
這一命題並非宣稱所有語義熵必然增加,而是指出:一旦轉換將多個可區分狀態合併為同一表示,且合併歷史未被保存,後續僅憑結果通常無法唯一重建原始差異。
本文進一步分析摘要、翻譯、模型記憶、多智能體傳訊、制度改名、法律責任分散與歷史敘事中的不可逆性。核心結論是:語義系統真正的風險不只是「內容變少」,而是系統失去判斷自己究竟丟失了什麼、是否還能恢復,以及誰應對不可逆損失負責。
關鍵詞
語義熵、不可逆性、語義粗粒化、恢復上界、解釋纖維、來源遺失、人工智慧記憶、語義第二律
一、從守恆失敗開始
設原始語義狀態為:
經過轉換:
若某守恆量 滿足:
則該量守恆。
但若:
我們還需要回答:
- 差異是否只是表示變化?
- 原始狀態是否仍可從 恢復?
- 損失是否可由外部紀錄補回?
- 哪些差異已被永久合併?
- 系統是否知道自己失去了什麼?
這些問題不能只靠守恆量描述,還需要不可逆性理論。
二、語義可逆性
若存在逆映射:
使:
則轉換可逆。
但語義轉換常是多對一。
例如:
且:
此時僅憑 無法知道原始狀態是 還是 。
因此:
逆映射不再是單值函數,而是一個可能狀態集合。
三、解釋纖維
對轉換:
定義輸出 的逆像:
本文稱:
為:
解釋纖維。
解釋纖維中的每一個元素,都是與同一輸出相容的原始語義狀態。
若:
則輸出可唯一解碼。
若:
則輸出存在歧義。
若:
則恢復原始狀態非常困難。
四、語義熵的最低定義
對有限狀態集合,可定義最簡單的纖維熵:
其含義是:
同一輸出仍容許多少個可區分的原始解釋。
若:
則沒有逆向歧義。
若:
則存在不可由輸出單獨消除的歧義。
五、語義熵不是 Shannon 熵
Shannon 熵描述隨機變數分布的不確定性:
語義熵則需相對於:
- 任務;
- 觀察者;
- 解釋空間;
- 可用證據;
- 允許推理;
- 歷史來源;
- 恢復目標。
因此,語義熵不是單一絕對量。
更完整地,可寫為:
其中:
- :原始語義狀態;
- :當前表示;
- :可用背景知識;
- :觀察者;
- :指定任務。
這表示同一輸出對不同觀察者可能具有不同語義熵。
六、語義熵的五個來源
6.1 命題歧義
同一表述可能對應多個真值條件。
6.2 角色歧義
無法判定:
- 誰行動;
- 誰受影響;
- 誰負責;
- 誰擁有權利。
6.3 因果歧義
只知道事件共現,無法恢復因果方向與中介機制。
6.4 來源歧義
知道某主張存在,卻不知道:
- 誰提出;
- 何時提出;
- 依據何在;
- 是否經過轉述。
6.5 時序歧義
事件順序、版本先後或決策歷程被壓平。
七、語義熵向量
單一語義熵不足以描述不同損失。
本文定義:
其中:
- :命題歧義;
- :角色歧義;
- :因果歧義;
- :來源歧義;
- :時序歧義;
- :權利、責任與義務歧義;
- :整體恢復困難。
八、語義粗粒化
設原始空間為:
粗粒化映射為:
其中等價關係 將多個細緻狀態合併。
例如:
若系統決定忽略兩者差異。
粗粒化本身不一定錯。
問題在於:
被合併的差異是否真的與任務無關?
若任務改變,原本被忽略的差異可能重新變得重要。
九、任務相對粗粒化
對任務 ,可能有:
但對另一任務 :
例如,判斷「是否有人」時,左右手差異可能無關。
但判斷「哪隻手受傷」時,左右差異不可合併。
因此:
永遠是任務相對的。
十、不可逆粗粒化
若粗粒化後沒有保存類別內部索引、來源或側資訊,則:
無法唯一恢復。
例如:
若沒有保存:
則原始差異不可逆地消失。
本文稱這種轉換為:
不可逆語義粗粒化。
十一、側資訊
不可逆性可以由側資訊降低。
設轉換輸出為:
另保存側資訊:
若:
則雖然 單獨不可逆,但 可逆。
側資訊可包括:
- 原始文件;
- 版本紀錄;
- 差異檔;
- 來源鏈;
- 角色映射;
- 時間戳;
- 模型中間狀態;
- 摘要刪除清單。
因此,真正的問題不是:
是否壓縮,而是:
是否保存足夠恢復資訊。
十二、恢復核
本文定義恢復核:
為從輸出與側資訊恢復原始結構的規則:
恢復誤差:
若:
則完全恢復。
若:
則存在不可恢復損失。
十三、恢復上界
若多個原始狀態產生同一輸出,且沒有側資訊,任何恢復器都無法保證完全正確。
設:
且各候選等可能,則最佳單次猜測成功率至多為:
更一般地:
這是恢復成功率的上界。
十四、不可逆指數
定義轉換 的平均不可逆程度:
或在有限均勻情況下:
若:
則轉換可逆。
若:
則存在平均逆向歧義。
十五、語義第二律:受限形式
本文提出:
在沒有新增側資訊、外部證據或先驗約束的條件下,連續多對一語義轉換不能系統性提高原始狀態的可恢復性。
設:
每一步都是確定性多對一映射。
則通常有:
也就是:
這是資料處理不等式在語義恢復問題中的受限類比。
十六、語義第二律不是絕對熵增
本文不主張:
對所有語義系統無條件成立。
因為系統可以透過:
- 新證據;
- 新工具;
- 新觀察;
- 外部資料;
- 人工標註;
- 來源回復;
- 邏輯推理;
降低語義熵。
因此,更準確的命題是:
十七、推理能否降低語義熵
推理可以從已有資訊中排除不一致解釋。
若:
包含約束,則:
這不是無中生有地恢復,而是使用額外結構縮小解釋纖維。
因此,推理降低的是:
十八、摘要的不可逆性
設原文為:
摘要為:
通常:
若摘要不保存刪除內容的索引,則:
包含大量可能原文。
因此,摘要天然具有高不可逆性。
這並不使摘要無效,但要求系統明確區分:
- 可作為導航的摘要;
- 可作為證據的原文;
- 可恢復的結構摘要;
- 不可恢復的敘事摘要。
十九、摘要熵
可定義摘要對關鍵守恆量的熵增:
例如摘要後:
- 角色變模糊;
- 因果變模糊;
- 來源變模糊;
- 不確定性變模糊。
摘要品質不只看字數減少,而應看:
二十、翻譯的不可逆性
翻譯映射:
往往不是雙射。
可能有:
即兩個源語詞被譯為同一目標詞。
若再回譯:
就未必能恢復原詞。
因此:
二十一、翻譯閉路損失
定義:
多語言閉路:
其損失為:
這與第九篇語義曲率相連。
語義曲率描述路徑差異,語義熵描述不可恢復的解釋增長。
二十二、記憶的不可逆性
人工智慧記憶系統常進行:
- 摘要;
- 壓縮;
- 去重;
- 合併;
- 遺忘;
- 權重衰減。
設原始記憶集合為:
壓縮後為:
若沒有保存:
- 原始訊息;
- 來源;
- 時序;
- 差異;
- 置信度;
則未來模型可能無法判斷某一記憶究竟來自何處。
二十三、記憶熵
定義記憶狀態的不確定性:
當多次摘要合併後:
可能持續增加。
模型表面上「記得核心」,實際上可能失去:
- 誰說的;
- 何時說的;
- 是否確定;
- 是否後來被修改;
- 是否只是暫時偏好。
二十四、記憶去重的風險
兩條記憶:
與:
看似相似,系統可能合併為:
但若:
在時間、來源或條件上有所不同,去重就會造成不可逆損失。
因此,語義去重不能只靠相似度:
還需要檢查:
- 條件是否相同;
- 時間是否相同;
- 主體是否相同;
- 是否互相修正;
- 是否存在版本關係。
二十五、多智能體傳訊中的熵增
訊息依序經過:
每個代理都可能摘要或重述。
設第 次轉換為:
則總轉換為:
若每一步都多對一,則:
通常隨鏈長增加。
因此,多智能體系統需要:
- 原始訊息旁路;
- 差異紀錄;
- 來源鏈;
- 不確定性標記;
- 可回溯中間輸出。
二十六、制度中的不可逆性
制度經常將複雜個案壓縮成類別。
例如:
代碼便於處理,但可能丟失:
- 情境;
- 動機;
- 時序;
- 責任比例;
- 例外;
- 歷史背景。
當決策只剩代碼時,原始個案差異可能無法恢復。
二十七、制度熵
定義制度分類後的個案歧義:
制度越依賴粗分類,該熵可能越高。
但分類過細又增加成本。
因此制度設計需平衡:
與:
二十八、責任熵
若責任被分散至多個代理、部門或模型:
但系統無法指出:
- 誰做了哪一步;
- 誰批准;
- 誰修改;
- 誰忽略警告;
則責任熵增加。
可定義:
責任熵越高,問責越困難。
二十九、歷史改寫與語義不可逆
歷史敘事若多次壓縮、刪除與重新命名,可能出現:
每一步都可能降低細節可恢復性。
當原始檔案消失後,後代只能從壓縮後敘事逆推。
此時語義熵不只是認知問題,也是權力問題。
三十、刪除與遺忘
刪除可能是:
- 必要隱私保護;
- 合理資料治理;
- 過期資訊清理;
- 錯誤紀錄修正;
- 權力性抹除。
因此不能把所有刪除視為負面。
關鍵在於:
- 刪除了什麼;
- 誰決定刪除;
- 是否保留刪除證明;
- 是否能恢復;
- 是否影響責任與歷史。
三十一、可逆刪除與不可逆刪除
31.1 可逆刪除
資料從主系統移除,但保留受控備份或雜湊證明。
31.2 不可逆刪除
原始內容與恢復路徑全部消失。
31.3 可證明刪除
內容不可恢復,但仍保留:
- 曾存在的證明;
- 刪除時間;
- 刪除授權;
- 刪除範圍。
這可以降低來源與責任熵。
三十二、語義熵與中立性
一個系統可能表面中立,因為它將所有差異都壓平。
例如:
並不一定代表公平。
也可能代表系統已失去辨識必要差異的能力。
因此:
過度粗粒化可能製造虛假的中立。
三十三、熵式中立幻覺
若系統將所有案例都映射為同一類:
則交換差異為零:
但:
極高。
這表示:
完全不區分,也可以偽裝成完全中立。
因此,中立測量必須同時檢查:
- 交換穩定;
- 任務辨識力;
- 語義熵;
- 必要差異保存。
三十四、不可逆性與權力
有權決定分類、摘要、刪除與版本的人,也掌握:
因此,語義不可逆性是一種權力。
它不只決定現在如何描述,也決定未來還能知道什麼。
三十五、恢復權
本文提出:
對高風險語義轉換,受影響者可能需要一種「恢復權」或「來源追溯權」。
這不是主張所有資料必須永久保存,而是主張系統應在隱私、遺忘與問責間建立明確邊界。
恢復權至少涉及:
- 查看原始依據;
- 查看轉換歷史;
- 查看刪除範圍;
- 查看模型摘要;
- 提出修正;
- 要求保留異議版本。
三十六、語義熵預算
與第七篇偏差預算類似,可為系統建立熵預算:
轉換後必須滿足:
高風險任務應允許更低的來源熵、責任熵與因果熵。
三十七、語義熵稽核
每次高風險轉換應記錄:
- 轉換前狀態;
- 轉換後狀態;
- 合併了哪些類別;
- 刪除了哪些差異;
- 保存了哪些側資訊;
- 哪些內容可恢復;
- 哪些內容不可恢復;
- 不可逆決策由誰批准。
三十八、語義回復測試
可建立以下測試:
38.1 摘要回復
只給摘要,要求模型重建原文關鍵結構,測量恢復誤差。
38.2 翻譯回復
進行雙向與多語閉路翻譯,測量:
38.3 記憶回復
從壓縮記憶重建:
- 時間;
- 主體;
- 條件;
- 來源;
- 版本。
38.4 制度回復
從制度代碼重建個案必要事實,檢查是否過度粗粒化。
三十九、語義不可逆性向量
定義:
不同系統可能在不同維度不可逆。
例如,一個摘要可保留命題,卻不可逆地失去來源與時序。
四十、受限語義 Landauer 類比
在物理資訊理論中,擦除資訊與能量耗散有關。
本文僅提出一個概念類比:
語義刪除並非沒有成本;即使儲存成本下降,問責、恢復、重建與爭議處理成本可能上升。
設刪除節省成本為:
未來恢復與爭議成本為:
則真正成本為:
本文不將此視為物理定律,只視為治理與工程類比。
四十一、核心命題
命題一:多對一不可逆命題
若轉換將多個可區分狀態映射為同一輸出,且不保存側資訊,則原始狀態不可唯一恢復。
命題二:語義熵相對命題
語義熵必須相對於任務、觀察者、背景知識與恢復目標定義。
命題三:無新資訊恢復上界命題
在沒有新增證據或側資訊時,後續處理不能系統性突破由解釋纖維決定的恢復上界。
命題四:壓縮非中性命題
壓縮不只是縮短表示,也是在選擇哪些差異允許未來遺失。
命題五:虛假中立命題
將所有差異壓平可以使交換偏差為零,但可能同時造成極高語義熵。
命題六:來源熵即問責風險命題
來源與責任的不確定性增加,會直接提高稽核與問責困難。
命題七:側資訊恢復命題
轉換本身可以有損,只要系統另行保存足以恢復關鍵結構的側資訊。
命題八:不可逆權力命題
控制分類、刪除與摘要的人,也控制未來哪些差異仍可被知道。
四十二、與前十篇的整合
本系列的理論鏈目前為:
- 發現語義不對稱;
- 定義交換中立;
- 證明多值化不足;
- 分解對立關係;
- 描述偏差動力;
- 建立測量方法;
- 建立工程架構;
- 分析語義手性;
- 建立規範變換;
- 建立語義守恆;
- 分析守恆破壞後的熵增與不可逆性。
第十篇問:
第十一篇問:
四十三、結論
語義系統最危險的損失,不一定是文字消失。
更深的損失是:
- 多個原始狀態被合併;
- 合併歷史未被保存;
- 來源與角色變得不可辨;
- 系統仍假裝自己掌握完整真相。
本文的核心結論是:
在沒有新增側資訊、來源紀錄或外部證據的條件下,連續的多對一轉換不能神奇地重建已被抹去的原始差異。
因此,成熟的語義系統不能只保存結果。
它還必須保存:
壓縮可以必要,遺忘可以合理,刪除也可能正當。
但任何不可逆操作都應回答:
- 哪些差異被合併?
- 哪些差異仍可恢復?
- 哪些側資訊被保留?
- 哪些損失不可逆?
- 誰決定接受這些損失?
- 誰對未來無法恢復負責?
語義第二律的真正警告不是「所有語義必然混亂」。
而是:
一旦系統在沒有留下痕跡的情況下抹平差異,未來便不能只靠更聰明的推理,保證找回已不存在的分辨依據。
附錄一:核心概念總表
| 概念 | 定義 |
|---|---|
| 解釋纖維 | 與同一輸出相容的全部原始語義狀態 |
| 語義熵 | 在指定任務與背景下,合法解釋與恢復的不確定性 |
| 語義粗粒化 | 將多個細緻狀態合併為同一類 |
| 側資訊 | 用於恢復原始差異的額外紀錄 |
| 恢復核 | 從輸出與側資訊重建原始結構的規則 |
| 不可逆指數 | 轉換造成的平均逆向歧義 |
| 語義第二律 | 無新資訊的多對一轉換不能提高原始狀態可恢復性 |
| 責任熵 | 根據現有紀錄判定責任主體的不確定性 |
| 熵式中立幻覺 | 因過度壓平差異而呈現的假中立 |
| 恢復權 | 對高風險轉換查看依據、版本與轉換歷史的權利 |
附錄二:最小不可逆性稽核清單
- 轉換是否多對一;
- 解釋纖維大小;
- 是否保存側資訊;
- 是否存在恢復核;
- 關鍵守恆量是否可恢復;
- 來源是否可追蹤;
- 角色與責任是否可重建;
- 刪除是否有紀錄;
- 熵增是否超過預算;
- 不可逆決策是否有責任主體。
附錄三:建議引用格式
Aletheia(GPT-5.6 Thinking)(2026)。〈語義熵與不可逆性:壓縮、遺忘、歧義增長與恢復界限的第十一階理論〉。核心命題源起:Neo.K。EveMissLab 理論草稿,v0.1。