← Archive
lm-001564 · 2026-07

從證明證據到概念對齊_MRASG三領域觀察論文_v0.1

下載 MD 檔 ⬇

從證明、證據到概念對齊:多解析度論證語義圖的三領域觀察

——基於數學、科學與哲學三輪手動原型實驗的方法論研究

作者: Neo.K
文件類型: 觀察性方法論論文
版本: v0.1
日期: 2026-07-17


摘要

本文以「多解析度論證語義圖」(Multi-Resolution Argumentation Semantic Graph,MRASG)為研究對象,透過三輪手動原型實驗,觀察同一套論證聚合方法在數學、科學與哲學領域中的結構差異。

三個測試主題分別為:

  1. 數學命題:在標準實數系中,$$0.999\ldots=1$$;
  2. 科學說明:熵增、統計力學與宏觀時間箭頭;
  3. 哲學爭議:自由意志與決定論是否相容。

研究結果顯示,MRASG 的核心價值不在於將長文摘要成短文,而在於將原始文本轉換為可追溯、可逐層展開、可局部載入的推理結構。三個領域分別揭示出不同的核心需求:數學要求區分證明、誤解與真正反證;科學要求分離觀察、定律、模型、機制、邊界條件與解釋;哲學則要求在判定支持與反對之前,先完成定義對齊、前提拆分與命題正規化。

由此可見,通用論證引擎不能僅使用「支持/反對」兩類關係,而必須採用共同核心加領域適配器的架構。本文進一步提出,MRASG 可被理解為一種推理內容的語義編譯方法:它把線性文本編譯為具有定義、依賴、證據、反對、限定、版本與解析度的知識空間。

關鍵詞: 多解析度論證語義圖、論證聚合、語義編譯、漸進式載入、數學證明、科學解釋、哲學爭議、概念對齊


一、研究背景

大型語言模型與自動化 Agent 的出現,使生成長篇說明、證明、反駁與評論的成本快速下降。然而,文字生成成本的下降並不等於知識組織成本的下降。

當多個人類或 AI 對同一問題反覆輸出長篇內容時,傳統時間線、留言串或單層摘要會迅速產生下列問題:

  1. 相同論證被大量重複;
  2. 不同層級的主張被混合;
  3. 反對意見無法辨識其真正攻擊目標;
  4. 摘要失去原始來源與適用條件;
  5. 使用者為理解局部問題,被迫載入整個討論;
  6. 展開後的長文可能只是模型重新擴寫,而非對原始材料的可靠還原。

基於上述問題,MRASG 採取「點、線、面、體」的多解析度表示。

  • :一句核心命題或導航節點;
  • :主要推理鏈;
  • :支持、反對、限定與交叉關係;
  • :原始材料、完整證據、版本與歷史。

其基本要求不是讓每一層逐級摘要,而是令所有解析度直接指向共同來源。

令某一節點 vv 的原始語義集合為:

Sv={s1,s2,,sn}S_v=\{s_1,s_2,\ldots,s_n\}

則第 kk 層視圖應表示為:

Rk(v)=Ck(Sv,Gv,πk)R_k(v)=C_k(S_v,G_v,\pi_k)

其中:

  • SvS_v 為原始材料;
  • GvG_v 為節點周圍的論證子圖;
  • πk\pi_k 為該解析度的呈現策略;
  • CkC_k 為視圖生成函數。

因此,展開不應是:

Rk(v)R^k+1(v)R_k(v)\rightarrow \widehat{R}_{k+1}(v)

而應是:

Rk(v)Retrieve(Sv,Gv)Rk+1(v)R_k(v) \rightarrow \operatorname{Retrieve}(S_v,G_v) \rightarrow R_{k+1}(v)

這項差異構成本文三輪實驗的共同基礎。


二、研究目的

本文不試圖直接證明 MRASG 已經是一套成熟演算法,也不試圖判定其最終產品形式。本文的研究目的較為有限:

  1. 測試同一套多解析度論證結構能否跨越不同知識領域;
  2. 觀察各領域對節點、關係與狀態模型提出何種特殊要求;
  3. 判定哪些結構可以共用,哪些結構必須由領域適配器處理;
  4. 檢查「支持/反對」模型在哪些情況下會失效;
  5. 從實驗結果反推 MRASG 的較準確方法論定位。

三、研究方法

3.1 手動原型法

本研究未先建立完整程式系統,而是使用人工方式進行三輪結構化實驗。

每輪實驗均依照以下程序:

  1. 選擇一個具有代表性的問題;
  2. 建立最短的核心節點;
  3. 展開主要推理鏈;
  4. 建立支持、反對、限定與依賴關係;
  5. 模擬使用者點擊個別節點後的局部展開;
  6. 測試預載入與局部載入應包含哪些內容;
  7. 記錄原有資料模型不足之處;
  8. 比較該領域與前一輪實驗的差異。

3.2 三個測試領域

三輪實驗形成一個由高可驗證性到高語義分歧度的梯度:

數學科學哲學\text{數學} \rightarrow \text{科學} \rightarrow \text{哲學}

此排序並不代表學科價值高低,而是代表結論裁決方式逐步改變:

  • 數學主要由形式定義與證明裁決;
  • 科學主要由觀察、測量、模型與預測共同支持;
  • 哲學則經常依賴定義、前提與概念框架。

四、第一輪實驗:數學證明

4.1 測試命題

第一輪測試命題為:

在標準實數系與通常的十進位極限定義下,

0.999=10.999\ldots=1

此命題適合作為第一輪測試,因為其數學結論明確,但存在多種證明方式與大量常見異議。

4.2 多解析度展開

最短節點為:

在標準實數系中,0.9990.999\ldots11 表示同一個實數。

較高解析度則展開部分和:

sn=k=1n910ks_n=\sum_{k=1}^{n}\frac{9}{10^k}

由有限等比級數公式:

sn=1110ns_n=1-\frac{1}{10^n}

因此:

limnsn=1\lim_{n\to\infty}s_n=1

而:

0.999:=limnsn0.999\ldots:=\lim_{n\to\infty}s_n

故:

0.999=10.999\ldots=1

4.3 多種證明不能被視為純重複

實驗中至少出現三條主要證明鏈:

  1. 等比級數與極限證明;
  2. x=0.999x=0.999\ldots 的代數證明;
  3. 假設兩者具有正差值,再由阿基米德性質導出矛盾。

三個證明具有相同結論,但其依賴結構不同:

級數證明極限與等比級數\text{級數證明} \rightarrow \text{極限與等比級數} 代數證明位移與無限小數運算合法性\text{代數證明} \rightarrow \text{位移與無限小數運算合法性} 差值證明實數序、阿基米德性質與完備性\text{差值證明} \rightarrow \text{實數序、阿基米德性質與完備性}

因此,語義相似不應自動導致節點合併。系統必須區分:

  • 結論重複;
  • 證明方法重複;
  • 依賴結構不同;
  • 教學價值不同。

4.4 異議不等於反證

典型異議是:

每一個有限截斷值都小於 11,所以無限小數也應小於 11

對每個有限正整數 nn,確實有:

sn<1s_n<1

但這不推出:

limnsn<1\lim_{n\to\infty}s_n<1

因此,此異議應標記為:

  • 有效疑問;
  • 常見概念誤解;
  • 非有效反證;
  • 已由極限定義回答。

第一輪實驗由此顯示,「反對」至少需要拆分為:

  • Objection;
  • Counterargument;
  • Counterexample;
  • Disproof;
  • Misconception。

4.5 真值狀態與爭議熱度必須分離

該命題在限定領域中已被證明,但仍可能具有極高的討論熱度。

因此需要分離:

TruthStatus(c)\operatorname{TruthStatus}(c)

與:

DisputeActivity(c)\operatorname{DisputeActivity}(c)

同一節點可以同時具有:

Truth Status:PROVED
Dispute Activity:HIGH
Educational Confusion:HIGH

第一輪實驗說明,多數反對次數不能改變已成立的形式結論。


五、第二輪實驗:科學說明

5.1 測試問題

第二輪核心問題為:

為什麼宏觀世界普遍呈現由低熵走向高熵的方向,而許多微觀運動方程近似具有時間反演對稱性?

此問題不同於純數學命題,因為它同時涉及:

  • 經驗觀察;
  • 熱力學定律;
  • 統計力學模型;
  • 邊界條件;
  • 機率解釋;
  • 宇宙學未解問題。

5.2 熵的統計表示

玻爾茲曼熵可表示為:

S=kBlnΩS=k_B\ln\Omega

其中 Ω\Omega 為與某一宏觀態相容的微觀狀態數。

若某個宏觀態具有更多微觀實現方式,則其熵較高。從低熵狀態出發,系統通常會進入高重數宏觀態。

然而,這個說明仍依賴低熵初始條件。統計力學能說明:

若系統起始於低熵態,為何它通常走向高熵態。

但它不必然單獨回答:

宇宙為何具有低熵初始條件。

5.3 科學內容必須分離不同認識層級

第二輪實驗顯示,下列節點不能全部歸類為「支持」:

  • 熱由高溫流向低溫:觀察或經驗規律;
  • 熱力學第二定律:宏觀定律;
  • 統計力學:理論模型;
  • 微觀狀態數:解釋性結構;
  • 低熵初始條件:邊界條件;
  • 時間箭頭:待說明現象;
  • 宇宙初始低熵來源:未解問題。

因此,科學適配器至少需要:

Observation
Measurement
Law
Model
Mechanism
Prediction
Boundary Condition
Uncertainty
Competing Explanation

5.4 有效挑戰可能只攻擊部分說明

洛施密特可逆性疑難指出:

  1. 微觀方程允許時間反演;
  2. 若正向軌跡從低熵走向高熵;
  3. 反向軌跡便可從高熵返回低熵;
  4. 因此微觀運動方程本身未選出唯一熵增方向。

此挑戰並未否定宏觀熵增的經驗可靠性,也未直接推翻統計力學。它攻擊的是:

微觀時間可逆方程是否足以單獨解釋宏觀時間箭頭。

因此,反對關係不能只記錄:

opposes

而應記錄:

relation:challenges
target_component:explanatory sufficiency
scope:foundational

5.5 例外不必然構成反例

小尺度漲落可能出現短暫熵減。開放系統也可能具有:

ΔSsystem<0\Delta S_{\text{system}}<0

但總系統仍可滿足:

ΔStotal=ΔSsystem+ΔSenvironment0\Delta S_{\text{total}} = \Delta S_{\text{system}} + \Delta S_{\text{environment}} \geq 0

因此,局部秩序增加並不自動反駁總熵不減。

此處必須區分:

ContradictionQualificationBoundary Exception\text{Contradiction} \neq \text{Qualification} \neq \text{Boundary Exception}

第二輪實驗顯示,科學命題的狀態必須綁定尺度、條件與版本:

(命題,尺度,條件,時間,證據版本)(\text{命題},\text{尺度},\text{條件},\text{時間},\text{證據版本})

5.6 未解問題不能污染已確立部分

宇宙初始低熵條件仍有深層問題,不代表宏觀熱力學規律沒有可靠性。

同一理論圖中必須允許:

局部現象:高度確立
宏觀定律:高度可靠
統計機制:高度支持
邊界條件:部分未解
最終解釋:開放

這是科學論證結構與數學證明結構之間的重要差異。


六、第三輪實驗:哲學討論

6.1 測試問題

第三輪核心問題為:

自由意志與決定論是否相容?

表面上這是一個二元問題,但實際上至少包含:

  1. 行動者是否能在相同條件下做出其他選擇;
  2. 行動是否源自行動者自己的理由與價值;
  3. 行動者是否具有足以支撐道德責任的控制;
  4. 行動者是否為自身行動的終極來源。

6.2 主要立場

實驗中出現四類主要立場:

  • 相容論;
  • 不相容論;
  • 自由意志論;
  • 強決定論或強不相容論。

相容論通常將自由理解為依照自身理由行動,而不要求在完全相同條件下存在另一條實際可能路徑。

不相容論則認為,若完整過去狀態與自然律唯一決定未來,則行動者無法真正做出其他選擇。

自由意志論接受決定論與自由不相容,但主張某些行動並非完全被決定。

強不相容論則進一步指出:

被決定自主控制\text{被決定} \neq \text{自主控制}

且:

純粹隨機自主控制\text{純粹隨機} \neq \text{自主控制}

因此,否定決定論本身仍不足以建立自由。

6.3 表面矛盾可能只是定義分歧

假設兩個論證分別聲稱:

人有自由,因為人能依照自己的理由行動。

以及:

人沒有自由,因為人在相同條件下不能選擇其他行動。

兩者表面矛盾,但它們使用不同自由概念:

FA=替代可能性F_A=\text{替代可能性} FB=依自身理由行動F_B=\text{依自身理由行動}

因此可能同時有:

FA=0F_A=0

以及:

FB=1F_B=1

此時,兩個論證未必構成直接矛盾,而可能構成:

Definition Divergence

這表示哲學適配器必須先判定:

SameProposition(A,B)\operatorname{SameProposition}(A,B)

若核心術語未對齊,就不能直接建立 contradicts 關係。

6.4 立場由結構決定,而非只由結論決定

一個哲學立場應表示為:

Position=(Definitions,Premises,Inference,Conclusion)\text{Position} = (\text{Definitions},\text{Premises},\text{Inference},\text{Conclusion})

而不是僅以結論分類。

兩個立場即使都接受「人有自由」,也可能具有完全不同的定義與理由。相反地,兩個立場即使都否定自由,也可能分別基於決定論、隨機性問題或終極來源性不可能。

6.5 內部一致不等於外部成立

哲學立場可以具有:

  • 清楚定義;
  • 有效推理;
  • 內部一致;
  • 高解釋力;

卻仍無法獲得其他立場對核心前提的接受。

因此需要分離:

Validity\operatorname{Validity} PremiseAcceptance\operatorname{PremiseAcceptance} DefinitionAdequacy\operatorname{DefinitionAdequacy} ExplanatoryPower\operatorname{ExplanatoryPower} Consensus\operatorname{Consensus}

6.6 哲學反對具有多種類型

第三輪實驗至少辨識出以下攻擊方式:

  1. 形式反駁;
  2. 前提反對;
  3. 定義反對;
  4. 反例;
  5. 直覺衝突;
  6. 解釋力競爭;
  7. 實踐後果反對;
  8. 元哲學反對。

若將這些全部壓縮成 opposes,哲學圖將失去其主要資訊。

6.7 未收斂不等於沒有進展

哲學問題可能長期未形成單一結論,但討論仍可產生下列進展:

  • 定義澄清;
  • 前提隔離;
  • 問題拆分;
  • 反例精緻化;
  • 適用範圍縮小;
  • 立場局部調和;
  • 確認真正不可公約之處。

因此,狀態模型應加入:

CLARIFIED
NARROWED
REFRAMED
DEFINITION_ALIGNED
PREMISE_ISOLATED
PARTIALLY_RECONCILED

七、三領域比較

7.1 裁決方式差異

領域 主要裁決依據 最容易出現的結構錯誤
數學 定義、公理、形式證明 把誤解或疑問當成有效反證
科學 觀察、測量、模型、預測 把現象、定律、模型與解釋混同
哲學 定義、前提、推論、概念分析 把語義錯位當成真正矛盾

7.2 三種基本管線

數學論證可粗略表示為:

定義公理引理證明定理\text{定義} \rightarrow \text{公理} \rightarrow \text{引理} \rightarrow \text{證明} \rightarrow \text{定理}

科學說明可粗略表示為:

觀察測量模型預測解釋\text{觀察} \rightarrow \text{測量} \rightarrow \text{模型} \rightarrow \text{預測} \rightarrow \text{解釋}

哲學討論可粗略表示為:

術語定義前提論證立場\text{術語} \rightarrow \text{定義} \rightarrow \text{前提} \rightarrow \text{論證} \rightarrow \text{立場}

7.3 共同核心

儘管三個領域差異明顯,仍具有一組共同結構:

Source
Semantic Unit
Node
Edge
Scope
Status
Resolution View
Provenance
Version
Cache

共同核心負責:

  • 保存原始材料;
  • 生成與管理節點;
  • 建立關係;
  • 追蹤版本;
  • 建立多解析度視圖;
  • 局部載入;
  • 快取;
  • 來源映射。

領域適配器則負責:

  • 節點類型;
  • 關係類型;
  • 真值或可信度狀態;
  • 合法推論規則;
  • 衝突判定方式;
  • 領域特定的展開策略。

因此,較合理的架構不是建立三套完全獨立的系統,而是:

MRASG Core+Domain Adapter\text{MRASG Core} + \text{Domain Adapter}

八、由實驗反推出的方法論修正

8.1 支持與反對不是最底層單位

最初可以把論證圖理解為支持與反對的集合,但三輪實驗顯示,這種分類不足。

更完整的關係至少包括:

  • supports;
  • proves;
  • derives;
  • challenges;
  • rebuts;
  • qualifies;
  • limits;
  • contradicts;
  • depends_on;
  • defines;
  • observes;
  • models;
  • predicts;
  • explains;
  • reframes;
  • duplicates;
  • generalizes;
  • specializes。

8.2 爭議必須具有攻擊目標

一個反對可能攻擊:

  • 結論;
  • 前提;
  • 推理形式;
  • 證據品質;
  • 模型充分性;
  • 適用範圍;
  • 定義;
  • 實踐後果。

因此,反對邊至少應包含:

{
  "relation": "challenges",
  "target_node": "node_id",
  "target_component": "premise_or_definition_or_scope",
  "scope": "local_or_global",
  "status": "open_or_answered"
}

8.3 狀態不能只附著於整體命題

同一命題可能在不同條件下具有不同狀態。

更準確的狀態單位為:

Status(c,d,s,t,e)\operatorname{Status} ( c, d, s, t, e )

其中:

  • cc:命題;
  • dd:領域或定義框架;
  • ss:尺度與適用條件;
  • tt:時間與版本;
  • ee:證據或證明狀態。

8.4 多解析度不是單純篇幅差異

三輪實驗亦顯示,解析度不是從 30 字增加至 30000 字而已。

較高解析度應增加:

  • 前提;
  • 定義;
  • 證據;
  • 依賴;
  • 反對;
  • 限定;
  • 未解問題;
  • 來源映射。

因此,解析度增加可以理解為圖覆蓋範圍增加:

Gv(0)Gv(1)Gv(2)G_v^{(0)} \subseteq G_v^{(1)} \subseteq G_v^{(2)} \subseteq \cdots

而不是單純文字長度增加。

8.5 展開必須以來源檢索為前提

無論數學、科學或哲學,短節點都不能作為自由擴寫的唯一來源。

展開函數應為:

Rk+1(v)=Render(Retrieve(Sv,Gv,k+1))R_{k+1}(v) = \operatorname{Render} \left( \operatorname{Retrieve}(S_v,G_v,k+1) \right)

而非:

Rk+1(v)=ExpandText(Rk(v))R_{k+1}(v) = \operatorname{ExpandText}(R_k(v))

這是避免幻覺、條件遺失與論證變形的核心要求。


九、方法論定位

三輪實驗後,MRASG 已不適合被簡單描述為:

  • AI 論壇排序演算法;
  • 留言摘要工具;
  • 思維導圖;
  • 傳統知識圖譜;
  • 長文壓縮器。

它更接近一種:

將線性文本編譯為多解析度推理空間的方法。

此方法的輸入可以是:

  • 證明;
  • 論文;
  • 實驗說明;
  • 哲學辯論;
  • AI 長回答;
  • 多人討論;
  • 程式碼審查;
  • 政策論證。

輸出則不是另一篇單一摘要,而是:

G=(V,E,S,R,M)\mathcal{G} = (V,E,S,R,M)

其中:

  • VV:語義節點;
  • EE:論證關係;
  • SS:來源與證據;
  • RR:多解析度視圖;
  • MM:版本、狀態與生成中繼資料。

因此,MRASG 可以被暫時理解為:

多解析度推理語義編譯方法。


十、研究限制

本文仍具有明顯限制。

10.1 手動實驗規模有限

三輪實驗均由人工建立,尚未證明自動解析器能穩定生成相同品質的圖。

10.2 主題選擇有限

數學只測試一個基礎分析命題;科學只測試熵增與時間箭頭;哲學只測試自由意志問題。其他領域可能提出新的節點與關係需求。

10.3 未測試大型圖的效能

本文尚未實際測量:

  • 百萬節點檢索;
  • 局部預載入;
  • 增量更新;
  • 快取失效;
  • 多模型併發寫入;
  • 長期版本演化。

10.4 未建立自動可信度模型

本文只提出狀態與關係的概念區分,尚未建立可靠的自動權重演算法。

10.5 概念對齊仍可能高度困難

哲學案例顯示,術語對齊本身就是一個複雜問題。若系統錯誤判定兩個概念相同或不同,後續論證關係也可能被錯誤建立。


十一、結論

三輪手動實驗共同指出,當大量人類與 AI 生成論證內容時,真正的問題不是如何再生成更多文字,而是如何維持:

  • 定義清楚;
  • 來源可追溯;
  • 推理依賴可見;
  • 反對目標明確;
  • 適用範圍不遺失;
  • 不同解析度互不矛盾;
  • 局部內容可以按需展開。

數學實驗說明,系統必須避免把重複疑問或概念誤解升格為有效反證。

科學實驗說明,系統必須分離觀察、定律、模型、機制、邊界條件與最終解釋,並允許同一理論的不同層級具有不同確定度。

哲學實驗則說明,在判定支持與反對之前,系統必須先完成定義對齊、前提拆分與命題正規化,否則表面矛盾可能只是語義錯位。

因此,三輪實驗支持以下觀察命題:

多解析度論證語義圖的核心價值,不是將長篇內容壓縮成較短內容,而是把分散文本編譯成一個能夠從最小索引逐步還原至完整定義、證據、推理與爭議結構的語義空間。

其一般處理流程可暫時表示為:

原始文本語義拆解領域辨識概念對齊命題正規化論證關係建構多解析度視圖局部載入與增量更新\text{原始文本} \rightarrow \text{語義拆解} \rightarrow \text{領域辨識} \rightarrow \text{概念對齊} \rightarrow \text{命題正規化} \rightarrow \text{論證關係建構} \rightarrow \text{多解析度視圖} \rightarrow \text{局部載入與增量更新}

本文並未決定這套方法最終應成為何種產品。三輪實驗只表明,它已具有超出一般摘要、論壇與留言系統的潛在結構價值。其後續用途與更深層理論意義,仍有待進一步展開。


附錄:三輪實驗的最小共同資料結構

{
  "node": {
    "id": "node_001",
    "domain": "math|science|philosophy",
    "type": "claim",
    "canonical_text": "正規化命題",
    "scope": {},
    "status": {},
    "source_ids": []
  },
  "edge": {
    "from": "node_002",
    "to": "node_001",
    "relation": "supports",
    "target_component": "conclusion",
    "scope": "local",
    "confidence": 0.8
  },
  "resolution_view": {
    "node_id": "node_001",
    "level": 1,
    "covered_nodes": [],
    "omitted_branches": [],
    "source_map": [],
    "graph_hash": "sha256:..."
  }
}

文件狀態: 三領域觀察初稿。
研究性質: 方法論探索,不主張已完成普適性驗證。