從理論壓縮到顯式認知壓縮
TCF v2.1 作為 AI 認知中介表示、記憶重整協議與知識治理層
英文題名: From Theory Compression to Explicit Cognitive Compression: TCF v2.1 as an AI Cognitive Intermediate Representation, Memory-Consolidation Protocol, and Knowledge-Governance Layer
作者: Neo.K(許筌崴)
AI 協作: GPT-5.6 Thinking
機構: EveMissLab/一言諾科技有限公司
版本: Public Paper v2.1
日期: 2026-07-20
文件性質: 公開研究論文/概念架構與技術方法論
摘要
本文提出 Theory Compression Format(TCF)2.1 的一般化理論:TCF 不應僅被理解為將形式理論整理為統一結構的文件格式,而應被理解為一種面向人工智慧的顯式認知壓縮方法。它位於自然語言原始資料、知識圖譜、檢索系統、形式驗證工具與神經網路隱式表示之間,將概念、命題、論證、證據、來源、認識狀態、版本、可見性與翻譯約束編碼為可尋址、可驗證、可投影的中介表示。
本文修正早期 TCF 對形式公理化與單一壓縮率的過度依賴。新版不再主張固定壓縮率可以判斷一個理論的真假,也不再要求觀察論文、哲學論證、技術白皮書、規格文件與文學化思想文本被強制改寫為公理—定理系統。相反地,TCF v2.1 將「內容主張」「證據狀態」「形式化程度」「語義角色」「修辭角色」彼此分離,並加入驗證證明書、證據工件、多軸狀態、符號命名空間、身份體制、成本模型、來源束合併及版本可見性治理。
本文進一步論證:若 AI 能將其讀取的公開知識、任務經驗與長期記憶週期性地轉換為 TCF,則 TCF 可成為 AI 的認知中介表示、外部長期記憶格式、跨模型知識交換協議,以及自我記憶重整時的安全邊界。這種壓縮不是對模型參數的直接壓縮,而是對 AI 所使用之顯式語義結構的壓縮。最終,AI 系統可能同時依賴兩種互補機制:神經網路的隱式統計壓縮,以及 TCF 的顯式認知壓縮。
關鍵詞: Theory Compression Format、TCF、認知中介表示、顯式認知壓縮、AI 記憶、知識治理、語義壓縮、知識圖譜、可追溯人工智慧、跨模型交換
1. 問題:AI 擁有大量知識,卻缺少可治理的知識形態
當代大型語言模型可以從大量文本中學習語言規律、概念關聯與問題解法。然而,模型所學得的知識主要分布於高維參數與動態激活之中。這種表示具有極高密度與良好泛化能力,但也具有四項結構性限制。
第一,來源不透明。模型可以產生一個正確或近似正確的答案,卻未必能指出該命題究竟來自哪份文件、哪個版本、哪段證據。
第二,狀態不清楚。模型容易把來源主張、作者推測、實驗結果、形式證明與後續詮釋混合為同一種「知道」。
第三,更新不可局部治理。當某一命題被反駁、修訂或限制適用範圍時,很難只修改該知識節點而不重新訓練或影響其他能力。
第四,跨模型交換成本高。模型之間可以交換自然語言摘要或向量,但缺少一個同時保留命題、證據、版本、衝突與可見性政策的通用顯式結構。
向量資料庫改善了檢索,知識圖譜改善了關係表示,形式證明器改善了可驗證推導,但三者通常各自處理不同層級。AI 仍缺少一個位於原始文本與下游工具之間的共同中介層。
TCF v2.1 的核心問題因而可以表述為:
能否建立一種不取代原文、不假裝理解全部隱含語境,卻能把顯式知識壓縮為可追溯、可驗證、可更新、可投影且可由不同 AI 交換的認知中介表示?
2. 從舊版 TCF 到新版 TCF:一次必要的理論修正
早期 TCF 的出發點,是將形式理論整理為原語、公理、依賴圖、定理、證明與模型,並嘗試以輸入結構和推論產出之比衡量理論壓縮能力。這個方向揭示了重要直覺:有價值的理論往往能以較少核心結構組織較多後果。
然而,將這個直覺直接提升為真假理論的固定判準,存在明顯問題。
2.1 形式化程度不等於真實性
一個錯誤理論可以被高度形式化;一個尚未形式化的觀察也可能是真實且重要的。形式化衡量的是表達與驗證狀態,不是世界是否服從該理論。
2.2 推導數量可以被人為膨脹
若只計算定理或證明步驟數量,理論可以透過同義改寫、平凡推論與冗長證明獲得虛高分數。因此單一壓縮率不能作為真理判定器。
2.3 並非所有知識都是公理—定理型
公開知識還包括:
- 經驗觀察;
- 命題猜想;
- 方法論;
- 技術規格;
- 哲學論證;
- 批判與反例;
- 歷史敘事;
- 政策文件;
- 版本化軟體文件;
- 文學化但具有理論功能的思想文本。
強迫這些內容全部轉成公理與定理,不會增加嚴謹性,反而會製造虛假形式化。
因此,TCF v2.1 將早期命題修正為:
TCF 的首要功能不是替理論判真,而是忠實揭露理論或知識文件的結構、證據、狀態、來源與治理邊界。
壓縮度量仍可作為診斷向量的一部分,但不得被單獨解釋為真理分數。
3. TCF 作為認知中介表示
編譯器通常不會讓每一種高階語言直接對應每一種硬體,而是建立中介表示(Intermediate Representation, IR)。中介表示負責保留程序的核心語義,並讓不同最佳化器、分析器與後端共同使用。
TCF 可以對知識扮演類似角色。令原始資料集合為 ,TCF 編碼器為 ,則:
其中 不是原文摘要,而是由穩定節點與關係構成的顯式認知表示。不同下游任務可使用解碼器或投影函數:
其中 可以是:
- 某一語言的學術論文;
- 任務專用上下文;
- 知識圖譜子圖;
- 教學材料;
- 問答資料;
- 反方論證;
- 形式驗證任務;
- 公開版本;
- 內部工作版本。
因此,同一份 TCF 不必等同於單一輸出文件。它更接近一個可被多種工具共同使用的認知原始碼。
本文將此定位稱為:
TCF-CIR:Theory Compression Format as Cognitive Intermediate Representation
它具有三個基本特徵。
3.1 顯式性
概念、命題、論證、證據與版本規則都有穩定 ID,可被人類與機器直接引用。
3.2 中介性
TCF 不試圖取代原始文本,也不等同於最終輸出;它連接來源、圖譜、驗證器、翻譯器與生成模型。
3.3 可治理性
知識不只有內容,還有來源、權限、可見性、驗證狀態、版本與撤回條件。這些都可以被明確表示與驗證。
4. 什麼是顯式認知壓縮
一般資料壓縮主要消除位元或字串重複。TCF 處理的是另一種重複:
- 同一概念的多種名稱;
- 同一命題的多次敘述;
- 相同論證在不同文件中的重複展開;
- 跨語言表面差異;
- 被散落在正文、附錄與版本說明中的證據狀態;
- 由段落順序隱含、但未顯式表示的依賴;
- 同一符號在不同命名空間中的重載;
- 同一文件不同公開版本中的重複內容。
所以,TCF 壓縮的不是字數本身,而是將分散的顯式知識結晶成可尋址結構。
可將顯式認知壓縮寫為:
但必須滿足:
其中:
- 是核心語義損失;
- 是來源與歸屬損失;
- 是猜想、證據、爭議與驗證狀態的失真;
- 是隱私、公開版本與位置約束的違反。
最後一項應被視為硬約束。若一個公開投影洩漏內部節點,即使語義摘要十分準確,也不能視為成功壓縮。
5. TCF v2.1 的核心表示
TCF v2.1 不要求每份文件具有相同內容,而是提供可選模組。只有當來源真的包含某種結構時,才啟用相應欄位。
5.1 基礎語義層
Concept:文件中的核心概念;Statement:可獨立引用的命題;Argument:前提、推理與結論的支持結構;Relation:依賴、支持、反駁、修訂、對應等關係;Term:術語與跨語言譯名;Symbol:符號、簽章與作用域;Model:案例、反例、實作或模型。
5.2 狀態分離
每一命題至少應區分:
- 命題種類,例如定義、觀察、假設、猜想、定理、批判;
- 認識狀態,例如已主張、受支持、推測、爭議、反駁、開放;
- 形式化程度,例如非形式、半形式、形式、機器驗證;
- 語義角色,例如正式運算子、模型、類比、治理規則;
- 修辭角色,例如題辭、警告、論題、橋接、終結語。
這些維度不得壓成單一標籤。題辭可以承載核心思想,但不因此成為公理;來源稱某項結果為「定理」,也不表示它已被機器檢查。
5.3 證據與驗證
TCF v2.1 將證據本身物件化。測試日誌、資料集、形式證明物件、引用文獻、案例與推導軌跡,都可以成為 EvidenceArtifact。
驗證狀態另外使用 VerificationAttestation 表示,至少區分:
source_claimed:來源聲稱已驗證;artifact_present:證據工件存在;reproduced:本環境已重現;independently_reviewed:第三方已獨立審查。
因此:
只有存在可追溯工件,且重現或獨立審查結果為通過時,命題才可標為 machine_checked。
5.4 狀態、符號、身份與成本
某些理論描述多軸狀態空間。此時應分開保存軸、軸值與複合狀態,避免把十五個基礎標籤誤解為只有十五種完整狀態。
符號重載則透過命名空間區分。相同字形若在同一文件中代表不同對象,必須建立不同符號 ID。
IdentityRegime 用於表示「何時仍算同一對象」,例如版本身份、語義身份、時間連續性或結構同構。
CostModel 用於綁定複雜度主張的前提。任何 、低成本或高效率主張,都必須說明成本模型與排除項,而不能脫離執行環境獨立成立。
5.5 來源束與版本治理
現實中的正式版本經常不是單一檔案,而是由基底稿、修訂稿、順序補丁、附件與內部規則合成。SourceBundleMerge 記錄來源角色、優先序、覆寫範圍與合成指紋。
EditionProjection、VisibilityPolicy 與 CanonicalPlacementConstraint 則允許同一內部母稿生成公開版、翻譯版與內部工作版,並阻止隱藏內容透過占位符、編號缺口、翻譯註記或依賴關係外洩。
6. TCF 與知識圖譜的差異
TCF 可以輸出知識圖,但不等同於一般知識圖譜。
知識圖譜通常關注實體與關係:
TCF 還必須表示:
- 命題由誰提出;
- 命題在何處出現;
- 命題是觀察、猜想還是定理;
- 支持它的是哪種證據;
- 驗證是否實際重現;
- 與哪些版本衝突;
- 哪一個公開投影可以顯示;
- 哪些術語在翻譯時必須鎖定;
- 哪些隱含依賴只是候選,不是正典關係。
因此可以把兩者關係表述為:
TCF 保存文件內的可追溯結構,語義圖處理跨文件耦合,而任務上下文只取出當前需要的局部子圖。
7. 作為 AI 長期記憶與記憶鞏固協議
AI 在長期運作中會累積大量對話、工具操作、閱讀紀錄、程式修改、實驗結果與錯誤修正。若全部以原始文字永久加入上下文,成本會持續增加;若只保留普通摘要,又會遺失來源、分歧與證據狀態。
TCF 可作為介於原始事件與長期知識之間的記憶鞏固層:
原始事件與來源
↓
事件分類與來源雜湊
↓
概念/命題/證據抽取
↓
重複辨識與衝突保留
↓
TCF 記憶記錄
↓
跨記錄語義圖
↓
任務條件式上下文
令既有記憶為 ,新事件集合為 ,則:
其中:
這不是將所有舊內容刪除,而是建立可回溯的語義索引。AI 在一般任務中先讀取 TCF 節點;只有需要精確引文、文風、語境或法律效力時,才回查原始來源。
可形成五層記憶架構:
- L0: 不可變原始來源與事件;
- L1: 文件級 TCF;
- L2: 跨文件語義圖;
- L3: 任務專用動態上下文;
- L4: 模型當前推理與工作記憶。
8. 為何不能讓 AI 直接覆寫自己的唯一記憶
讓 AI 自動重整記憶具有實際價值,也具有不可忽視的風險。模型可能錯誤合併術語、刪除少數觀點、把來源猜想升格為事實,或在公開輸出中洩漏內部內容。
因此,自我壓縮必須採用影子重整,而不是原地覆寫:
原始記憶庫 M0
↓
唯讀快照
↓
候選 TCF 記憶庫 M1
↓
結構、來源、能力、隱私與回歸測試
↓
通過後切換讀取指標
更安全的更新形式是:
而不是:
最低限度應保存:
- 模型權重快照;
- 原始資料不可變副本;
- TCF 版本歷史與節點指紋;
- 記憶庫切換前後快照;
- 行為與能力回歸測試;
- 公開/私密投影測試;
- 可撤銷的部署指標。
若來源衝突無法解析、主要來源不可取得、驗證工件缺失或公開可見性測試失敗,系統應停止正典合併,而不是自行補完。
9. TCF 不是模型權重壓縮
必須清楚區分兩種壓縮。
9.1 神經網路的隱式壓縮
模型權重將大量語言與世界規律壓縮為分布式數值表示,擅長:
- 模式識別;
- 泛化;
- 類比;
- 流暢生成;
- 未明示組合。
但其內部知識不容易逐條審計與局部更新。
9.2 TCF 的顯式壓縮
TCF 將知識壓縮為具 ID、來源與狀態的結構,擅長:
- 可追溯記憶;
- 精確更新;
- 衝突保存;
- 版本治理;
- 跨模型交換;
- 任務上下文生成;
- 人類審核。
兩者並不互斥。較完整的 AI 知識架構應是:
神經模型提供直覺與生成能力,TCF 提供可治理的顯式記憶。前者不應被強迫完全轉成符號系統,後者也不應假裝可以取代神經表示。
10. 任務相對無損,而非字面無損
TCF 無法從結構表示逐字還原所有原文。自然語言包含節奏、語氣、修辭、歷史背景、雙關與未明示的文化知識。
因此,TCF 不應自稱一般意義上的無損壓縮。較精確的概念是任務相對語義保存。
對任務集合 ,若:
則可以說,TCF 對該任務集合近似無損。
TCF 對下列任務可能具有較高保存度:
- 命題檢索;
- 理論比較;
- 術語翻譯;
- 證據追蹤;
- 版本更新;
- 推理依賴分析。
但對下列任務必須回到原文:
- 精確引文;
- 文學風格重建;
- 法律文字解釋;
- 歷史語用分析;
- 修辭與敘事研究。
所以任何正規 TCF 系統都必須保留來源 URI、內容雜湊、來源跨度、版本、授權與歸屬。
11. AI 學習 TCF 的四個層級
11.1 工具使用層
一般模型透過提示詞、Schema、驗證器與 SKILL,將文件轉成 TCF。這不需要修改模型權重。
11.2 格式熟練層
透過微調或合成資料訓練,使模型原生理解穩定 ID、來源跨度、認識狀態、證據工件與版本投影。
11.3 記憶原生 Agent 層
Agent 的長期記憶直接以 TCF 與語義圖管理。新資訊不只是追加文字,而是執行新增、合併、衝突標記、版本分叉、證據升降級與來源重綁定。
11.4 TCF 原生訓練層
訓練資料同時包含:
模型學習的不只是下一個 token,也包括:
- 如何從長文結晶出穩定結構;
- 如何從結構生成不同語言和粒度;
- 如何維持證據與不確定性;
- 如何保留衝突而不強行統一;
- 如何知道某項知識尚未被驗證;
- 如何遵守版本與可見性政策。
這一層仍屬研究方向,不應在缺乏系統評測時宣稱已經解決 AI 的理解或記憶問題。
12. 公開知識大規模轉換的架構
若要將大量公開顯式知識轉換為 TCF,合理流程不是一次性抓取整個網路,而是逐層建立可審核語料。
12.1 來源層
只處理具有明確授權、公開存取條件或合法使用基礎的資料。保存來源時間、版本與授權狀態。
12.2 文件層
每份文件獨立轉換,保留其自身命題與來源跨度。在完成文件內結構前,不急於做全域合併。
12.3 術語層
建立跨文件術語登錄,但不因表面相似就認定同義。模糊對應必須保留為候選。
12.4 圖譜層
以低成本規則產生跨文件候選邊,再由模型、規則或人工審核接受。避免對全部文件做昂貴且不可解釋的全配對比較。
12.5 發行層
每次語料庫更新形成不可變版本,具有文件指紋、節點指紋、術語版本及關係變更紀錄。
12.6 任務層
下游 AI 不直接讀取整個語料庫,而是根據問題生成局部、可追溯的 TCF 上下文包。
13. 評估方法
TCF 系統不能只以壓縮後大小評分。至少應同時評估下列向量。
13.1 結構有效性
- Schema 是否通過;
- ID 是否唯一;
- 引用是否完整;
- 圖是否存在非法循環;
- 版本投影是否可重現。
13.2 來源追溯性
- 重要命題可否定位至來源;
- 引文與來源雜湊是否一致;
- 修訂後是否仍能找到舊節點。
13.3 認識狀態保真
- 猜想是否被誤升為事實;
- 作者自稱驗證是否被誤升為重現驗證;
- 反例與異議是否被刪除;
- 不確定性是否保留。
13.4 任務效用
- 是否降低上下文 token;
- 是否提升檢索精度;
- 是否改善跨語翻譯一致性;
- 是否降低版本錯用;
- 是否能更快回查證據。
13.5 治理安全
- 公開投影是否洩漏內部節點;
- 私密資料是否被候選關係間接暴露;
- 省略後是否殘留編號缺口或元資料提示;
- 授權與刪除請求能否傳播至所有投影。
13.6 重建與退化測試
將同一原文轉換為 TCF,再由不同模型生成摘要、論文、問答與批判,評估核心命題、條件、證據與反例的保存程度。
14. 風險與限制
14.1 顯式知識不等於全部知識
大量技能、直覺、身體經驗與社會默契無法完全以命題表示。TCF 主要面向公開、可陳述、可引用的顯式知識。
14.2 結構化可能製造虛假確定性
JSON 欄位看起來精確,不代表抽取內容正確。每個節點都應保留來源與置信狀態。
14.3 自動合併可能抹除少數觀點
多數模型傾向生成單一協調答案。TCF 系統必須允許平行命題、學派分歧與不可解衝突共存。
14.4 Schema 可能成為新的僵化中心
TCF 本身不能被視為所有知識唯一合法形態。它必須允許擴充、版本化與替代表示,並保留原文作為最高來源。
14.5 大規模轉換涉及授權與治理
公開可讀不必然等於可任意再發布、訓練或建立衍生資料庫。實作必須區分讀取、索引、轉換、再發布與商業使用權限。
14.6 自我壓縮可能造成能力退化
AI 若反覆以自己的摘要取代原始資料,可能發生語義漂移與模型坍縮。原始資料、獨立評測與可撤銷版本不可省略。
15. 可檢驗研究命題
本文提出下列可被實驗反駁或支持的命題。
命題一:上下文效率命題
在來源追溯任務中,TCF 子圖可以在比完整原文更少的 token 下,維持相近或更高的答案正確率。
命題二:認識狀態保真命題
使用 TCF 明確區分猜想、證據與重現驗證後,模型將較少把來源自述誤報為已獨立證實。
命題三:跨模型交換命題
不同模型透過 TCF 交換知識時,術語與命題一致性將高於只交換自然語言摘要。
命題四:版本治理命題
使用明確版本投影與可見性政策,能顯著降低私密節點在公開輸出中的洩漏率。
命題五:記憶鞏固命題
在保留原始來源與版本回滾的條件下,週期性 TCF 記憶鞏固能降低長期 Agent 的檢索成本,而不顯著損害核心任務能力。
命題六:雙層壓縮命題
結合神經隱式表示與 TCF 顯式記憶的系統,在可追溯性與更新效率上優於只依賴任一單層表示的系統。
16. 研究路線
TCF 後續研究可以分為六條路線。
- 語料轉換基準: 建立跨文類公開資料集,測試形式理論、觀察論文、技術規格、哲學論證與版本化文本。
- 重建評測: 比較不同模型從同一 TCF 重建內容時的語義保存率。
- 全域術語協調: 研究術語同一性、異名同義、同名異義與跨語言鎖定。
- 驗證後端: 串接 Lean、Coq、Isabelle、測試框架與資料分析環境,使證明書可重現。
- 記憶原生 Agent: 實作影子記憶庫、回滾、衝突保存與能力回歸測試。
- 開放互通標準: 讓不同模型、知識庫與研究機構交換 TCF packet,而不要求共享模型權重。
17. 結論
TCF 的演化揭示了一個比「如何整理論文」更大的問題:AI 的知識不應只存在於不可直接審核的模型權重中,也不應只存在於無限增長的原始文本庫中。
AI 需要一個中間層。這一層必須比普通摘要更忠實,比純知識圖更接近文獻結構,比形式邏輯更能容納多種知識文類,也比模型參數更容易更新、審核與交換。
TCF v2.1 因而可被重新定義為:
一種將公開顯式知識、任務經驗與長期記憶,轉換為可追溯、可驗證、可版本化、可投影之認知中介表示的顯式認知壓縮協議。
這個定義不聲稱 TCF 能取代原文、知識圖譜、形式證明器或神經網路。它的價值恰恰在於連接它們。
最終的 AI 知識架構可能不是符號主義或連結主義二選一,而是:
模型負責從世界中形成能力;TCF 負責讓其中可陳述的知識被保存、核對、更新與傳遞。
壓縮在此不只是縮短內容,而是把知識從不可治理的堆積,轉化為可以被不同智能共同閱讀、質疑與修訂的結構。
附錄 A:TCF 顯式認知壓縮的最小不變項
一個最低限度的 TCF 顯式認知壓縮系統,應遵守以下原則:
- 原始來源不可被 TCF 覆寫;
- 重要命題必須可回查來源;
- 命題種類、認識狀態與形式化程度必須分離;
- 來源聲稱驗證不等於本地重現;
- 同名術語與同形符號不得自動合併;
- 衝突應被保存,而不是被強行消解;
- 所有更新必須版本化;
- 公開投影不得洩漏內部節點;
- AI 自我重整必須可回滾;
- 結構驗證通過不等於理論為真。
附錄 B:建議引用格式
Neo.K(許筌崴)(2026)。〈從理論壓縮到顯式認知壓縮:TCF v2.1 作為 AI 認知中介表示、記憶重整協議與知識治理層〉。EveMissLab Public Research Paper v2.1。