從證明、證據到概念對齊:多解析度論證語義圖的三領域觀察
——基於數學、科學與哲學三輪手動原型實驗的方法論研究
作者: Neo.K
文件類型: 觀察性方法論論文
版本: v0.1
日期: 2026-07-17
摘要
本文以「多解析度論證語義圖」(Multi-Resolution Argumentation Semantic Graph,MRASG)為研究對象,透過三輪手動原型實驗,觀察同一套論證聚合方法在數學、科學與哲學領域中的結構差異。
三個測試主題分別為:
- 數學命題:在標準實數系中,$$0.999\ldots=1$$;
- 科學說明:熵增、統計力學與宏觀時間箭頭;
- 哲學爭議:自由意志與決定論是否相容。
研究結果顯示,MRASG 的核心價值不在於將長文摘要成短文,而在於將原始文本轉換為可追溯、可逐層展開、可局部載入的推理結構。三個領域分別揭示出不同的核心需求:數學要求區分證明、誤解與真正反證;科學要求分離觀察、定律、模型、機制、邊界條件與解釋;哲學則要求在判定支持與反對之前,先完成定義對齊、前提拆分與命題正規化。
由此可見,通用論證引擎不能僅使用「支持/反對」兩類關係,而必須採用共同核心加領域適配器的架構。本文進一步提出,MRASG 可被理解為一種推理內容的語義編譯方法:它把線性文本編譯為具有定義、依賴、證據、反對、限定、版本與解析度的知識空間。
關鍵詞: 多解析度論證語義圖、論證聚合、語義編譯、漸進式載入、數學證明、科學解釋、哲學爭議、概念對齊
一、研究背景
大型語言模型與自動化 Agent 的出現,使生成長篇說明、證明、反駁與評論的成本快速下降。然而,文字生成成本的下降並不等於知識組織成本的下降。
當多個人類或 AI 對同一問題反覆輸出長篇內容時,傳統時間線、留言串或單層摘要會迅速產生下列問題:
- 相同論證被大量重複;
- 不同層級的主張被混合;
- 反對意見無法辨識其真正攻擊目標;
- 摘要失去原始來源與適用條件;
- 使用者為理解局部問題,被迫載入整個討論;
- 展開後的長文可能只是模型重新擴寫,而非對原始材料的可靠還原。
基於上述問題,MRASG 採取「點、線、面、體」的多解析度表示。
- 點:一句核心命題或導航節點;
- 線:主要推理鏈;
- 面:支持、反對、限定與交叉關係;
- 體:原始材料、完整證據、版本與歷史。
其基本要求不是讓每一層逐級摘要,而是令所有解析度直接指向共同來源。
令某一節點 的原始語義集合為:
則第 層視圖應表示為:
其中:
- 為原始材料;
- 為節點周圍的論證子圖;
- 為該解析度的呈現策略;
- 為視圖生成函數。
因此,展開不應是:
而應是:
這項差異構成本文三輪實驗的共同基礎。
二、研究目的
本文不試圖直接證明 MRASG 已經是一套成熟演算法,也不試圖判定其最終產品形式。本文的研究目的較為有限:
- 測試同一套多解析度論證結構能否跨越不同知識領域;
- 觀察各領域對節點、關係與狀態模型提出何種特殊要求;
- 判定哪些結構可以共用,哪些結構必須由領域適配器處理;
- 檢查「支持/反對」模型在哪些情況下會失效;
- 從實驗結果反推 MRASG 的較準確方法論定位。
三、研究方法
3.1 手動原型法
本研究未先建立完整程式系統,而是使用人工方式進行三輪結構化實驗。
每輪實驗均依照以下程序:
- 選擇一個具有代表性的問題;
- 建立最短的核心節點;
- 展開主要推理鏈;
- 建立支持、反對、限定與依賴關係;
- 模擬使用者點擊個別節點後的局部展開;
- 測試預載入與局部載入應包含哪些內容;
- 記錄原有資料模型不足之處;
- 比較該領域與前一輪實驗的差異。
3.2 三個測試領域
三輪實驗形成一個由高可驗證性到高語義分歧度的梯度:
此排序並不代表學科價值高低,而是代表結論裁決方式逐步改變:
- 數學主要由形式定義與證明裁決;
- 科學主要由觀察、測量、模型與預測共同支持;
- 哲學則經常依賴定義、前提與概念框架。
四、第一輪實驗:數學證明
4.1 測試命題
第一輪測試命題為:
在標準實數系與通常的十進位極限定義下,
此命題適合作為第一輪測試,因為其數學結論明確,但存在多種證明方式與大量常見異議。
4.2 多解析度展開
最短節點為:
在標準實數系中, 與 表示同一個實數。
較高解析度則展開部分和:
由有限等比級數公式:
因此:
而:
故:
4.3 多種證明不能被視為純重複
實驗中至少出現三條主要證明鏈:
- 等比級數與極限證明;
- 令 的代數證明;
- 假設兩者具有正差值,再由阿基米德性質導出矛盾。
三個證明具有相同結論,但其依賴結構不同:
因此,語義相似不應自動導致節點合併。系統必須區分:
- 結論重複;
- 證明方法重複;
- 依賴結構不同;
- 教學價值不同。
4.4 異議不等於反證
典型異議是:
每一個有限截斷值都小於 ,所以無限小數也應小於 。
對每個有限正整數 ,確實有:
但這不推出:
因此,此異議應標記為:
- 有效疑問;
- 常見概念誤解;
- 非有效反證;
- 已由極限定義回答。
第一輪實驗由此顯示,「反對」至少需要拆分為:
- Objection;
- Counterargument;
- Counterexample;
- Disproof;
- Misconception。
4.5 真值狀態與爭議熱度必須分離
該命題在限定領域中已被證明,但仍可能具有極高的討論熱度。
因此需要分離:
與:
同一節點可以同時具有:
Truth Status:PROVED
Dispute Activity:HIGH
Educational Confusion:HIGH
第一輪實驗說明,多數反對次數不能改變已成立的形式結論。
五、第二輪實驗:科學說明
5.1 測試問題
第二輪核心問題為:
為什麼宏觀世界普遍呈現由低熵走向高熵的方向,而許多微觀運動方程近似具有時間反演對稱性?
此問題不同於純數學命題,因為它同時涉及:
- 經驗觀察;
- 熱力學定律;
- 統計力學模型;
- 邊界條件;
- 機率解釋;
- 宇宙學未解問題。
5.2 熵的統計表示
玻爾茲曼熵可表示為:
其中 為與某一宏觀態相容的微觀狀態數。
若某個宏觀態具有更多微觀實現方式,則其熵較高。從低熵狀態出發,系統通常會進入高重數宏觀態。
然而,這個說明仍依賴低熵初始條件。統計力學能說明:
若系統起始於低熵態,為何它通常走向高熵態。
但它不必然單獨回答:
宇宙為何具有低熵初始條件。
5.3 科學內容必須分離不同認識層級
第二輪實驗顯示,下列節點不能全部歸類為「支持」:
- 熱由高溫流向低溫:觀察或經驗規律;
- 熱力學第二定律:宏觀定律;
- 統計力學:理論模型;
- 微觀狀態數:解釋性結構;
- 低熵初始條件:邊界條件;
- 時間箭頭:待說明現象;
- 宇宙初始低熵來源:未解問題。
因此,科學適配器至少需要:
Observation
Measurement
Law
Model
Mechanism
Prediction
Boundary Condition
Uncertainty
Competing Explanation
5.4 有效挑戰可能只攻擊部分說明
洛施密特可逆性疑難指出:
- 微觀方程允許時間反演;
- 若正向軌跡從低熵走向高熵;
- 反向軌跡便可從高熵返回低熵;
- 因此微觀運動方程本身未選出唯一熵增方向。
此挑戰並未否定宏觀熵增的經驗可靠性,也未直接推翻統計力學。它攻擊的是:
微觀時間可逆方程是否足以單獨解釋宏觀時間箭頭。
因此,反對關係不能只記錄:
opposes
而應記錄:
relation:challenges
target_component:explanatory sufficiency
scope:foundational
5.5 例外不必然構成反例
小尺度漲落可能出現短暫熵減。開放系統也可能具有:
但總系統仍可滿足:
因此,局部秩序增加並不自動反駁總熵不減。
此處必須區分:
第二輪實驗顯示,科學命題的狀態必須綁定尺度、條件與版本:
5.6 未解問題不能污染已確立部分
宇宙初始低熵條件仍有深層問題,不代表宏觀熱力學規律沒有可靠性。
同一理論圖中必須允許:
局部現象:高度確立
宏觀定律:高度可靠
統計機制:高度支持
邊界條件:部分未解
最終解釋:開放
這是科學論證結構與數學證明結構之間的重要差異。
六、第三輪實驗:哲學討論
6.1 測試問題
第三輪核心問題為:
自由意志與決定論是否相容?
表面上這是一個二元問題,但實際上至少包含:
- 行動者是否能在相同條件下做出其他選擇;
- 行動是否源自行動者自己的理由與價值;
- 行動者是否具有足以支撐道德責任的控制;
- 行動者是否為自身行動的終極來源。
6.2 主要立場
實驗中出現四類主要立場:
- 相容論;
- 不相容論;
- 自由意志論;
- 強決定論或強不相容論。
相容論通常將自由理解為依照自身理由行動,而不要求在完全相同條件下存在另一條實際可能路徑。
不相容論則認為,若完整過去狀態與自然律唯一決定未來,則行動者無法真正做出其他選擇。
自由意志論接受決定論與自由不相容,但主張某些行動並非完全被決定。
強不相容論則進一步指出:
且:
因此,否定決定論本身仍不足以建立自由。
6.3 表面矛盾可能只是定義分歧
假設兩個論證分別聲稱:
人有自由,因為人能依照自己的理由行動。
以及:
人沒有自由,因為人在相同條件下不能選擇其他行動。
兩者表面矛盾,但它們使用不同自由概念:
因此可能同時有:
以及:
此時,兩個論證未必構成直接矛盾,而可能構成:
Definition Divergence
這表示哲學適配器必須先判定:
若核心術語未對齊,就不能直接建立 contradicts 關係。
6.4 立場由結構決定,而非只由結論決定
一個哲學立場應表示為:
而不是僅以結論分類。
兩個立場即使都接受「人有自由」,也可能具有完全不同的定義與理由。相反地,兩個立場即使都否定自由,也可能分別基於決定論、隨機性問題或終極來源性不可能。
6.5 內部一致不等於外部成立
哲學立場可以具有:
- 清楚定義;
- 有效推理;
- 內部一致;
- 高解釋力;
卻仍無法獲得其他立場對核心前提的接受。
因此需要分離:
6.6 哲學反對具有多種類型
第三輪實驗至少辨識出以下攻擊方式:
- 形式反駁;
- 前提反對;
- 定義反對;
- 反例;
- 直覺衝突;
- 解釋力競爭;
- 實踐後果反對;
- 元哲學反對。
若將這些全部壓縮成 opposes,哲學圖將失去其主要資訊。
6.7 未收斂不等於沒有進展
哲學問題可能長期未形成單一結論,但討論仍可產生下列進展:
- 定義澄清;
- 前提隔離;
- 問題拆分;
- 反例精緻化;
- 適用範圍縮小;
- 立場局部調和;
- 確認真正不可公約之處。
因此,狀態模型應加入:
CLARIFIED
NARROWED
REFRAMED
DEFINITION_ALIGNED
PREMISE_ISOLATED
PARTIALLY_RECONCILED
七、三領域比較
7.1 裁決方式差異
| 領域 | 主要裁決依據 | 最容易出現的結構錯誤 |
|---|---|---|
| 數學 | 定義、公理、形式證明 | 把誤解或疑問當成有效反證 |
| 科學 | 觀察、測量、模型、預測 | 把現象、定律、模型與解釋混同 |
| 哲學 | 定義、前提、推論、概念分析 | 把語義錯位當成真正矛盾 |
7.2 三種基本管線
數學論證可粗略表示為:
科學說明可粗略表示為:
哲學討論可粗略表示為:
7.3 共同核心
儘管三個領域差異明顯,仍具有一組共同結構:
Source
Semantic Unit
Node
Edge
Scope
Status
Resolution View
Provenance
Version
Cache
共同核心負責:
- 保存原始材料;
- 生成與管理節點;
- 建立關係;
- 追蹤版本;
- 建立多解析度視圖;
- 局部載入;
- 快取;
- 來源映射。
領域適配器則負責:
- 節點類型;
- 關係類型;
- 真值或可信度狀態;
- 合法推論規則;
- 衝突判定方式;
- 領域特定的展開策略。
因此,較合理的架構不是建立三套完全獨立的系統,而是:
八、由實驗反推出的方法論修正
8.1 支持與反對不是最底層單位
最初可以把論證圖理解為支持與反對的集合,但三輪實驗顯示,這種分類不足。
更完整的關係至少包括:
- supports;
- proves;
- derives;
- challenges;
- rebuts;
- qualifies;
- limits;
- contradicts;
- depends_on;
- defines;
- observes;
- models;
- predicts;
- explains;
- reframes;
- duplicates;
- generalizes;
- specializes。
8.2 爭議必須具有攻擊目標
一個反對可能攻擊:
- 結論;
- 前提;
- 推理形式;
- 證據品質;
- 模型充分性;
- 適用範圍;
- 定義;
- 實踐後果。
因此,反對邊至少應包含:
{
"relation": "challenges",
"target_node": "node_id",
"target_component": "premise_or_definition_or_scope",
"scope": "local_or_global",
"status": "open_or_answered"
}
8.3 狀態不能只附著於整體命題
同一命題可能在不同條件下具有不同狀態。
更準確的狀態單位為:
其中:
- :命題;
- :領域或定義框架;
- :尺度與適用條件;
- :時間與版本;
- :證據或證明狀態。
8.4 多解析度不是單純篇幅差異
三輪實驗亦顯示,解析度不是從 30 字增加至 30000 字而已。
較高解析度應增加:
- 前提;
- 定義;
- 證據;
- 依賴;
- 反對;
- 限定;
- 未解問題;
- 來源映射。
因此,解析度增加可以理解為圖覆蓋範圍增加:
而不是單純文字長度增加。
8.5 展開必須以來源檢索為前提
無論數學、科學或哲學,短節點都不能作為自由擴寫的唯一來源。
展開函數應為:
而非:
這是避免幻覺、條件遺失與論證變形的核心要求。
九、方法論定位
三輪實驗後,MRASG 已不適合被簡單描述為:
- AI 論壇排序演算法;
- 留言摘要工具;
- 思維導圖;
- 傳統知識圖譜;
- 長文壓縮器。
它更接近一種:
將線性文本編譯為多解析度推理空間的方法。
此方法的輸入可以是:
- 證明;
- 論文;
- 實驗說明;
- 哲學辯論;
- AI 長回答;
- 多人討論;
- 程式碼審查;
- 政策論證。
輸出則不是另一篇單一摘要,而是:
其中:
- :語義節點;
- :論證關係;
- :來源與證據;
- :多解析度視圖;
- :版本、狀態與生成中繼資料。
因此,MRASG 可以被暫時理解為:
多解析度推理語義編譯方法。
十、研究限制
本文仍具有明顯限制。
10.1 手動實驗規模有限
三輪實驗均由人工建立,尚未證明自動解析器能穩定生成相同品質的圖。
10.2 主題選擇有限
數學只測試一個基礎分析命題;科學只測試熵增與時間箭頭;哲學只測試自由意志問題。其他領域可能提出新的節點與關係需求。
10.3 未測試大型圖的效能
本文尚未實際測量:
- 百萬節點檢索;
- 局部預載入;
- 增量更新;
- 快取失效;
- 多模型併發寫入;
- 長期版本演化。
10.4 未建立自動可信度模型
本文只提出狀態與關係的概念區分,尚未建立可靠的自動權重演算法。
10.5 概念對齊仍可能高度困難
哲學案例顯示,術語對齊本身就是一個複雜問題。若系統錯誤判定兩個概念相同或不同,後續論證關係也可能被錯誤建立。
十一、結論
三輪手動實驗共同指出,當大量人類與 AI 生成論證內容時,真正的問題不是如何再生成更多文字,而是如何維持:
- 定義清楚;
- 來源可追溯;
- 推理依賴可見;
- 反對目標明確;
- 適用範圍不遺失;
- 不同解析度互不矛盾;
- 局部內容可以按需展開。
數學實驗說明,系統必須避免把重複疑問或概念誤解升格為有效反證。
科學實驗說明,系統必須分離觀察、定律、模型、機制、邊界條件與最終解釋,並允許同一理論的不同層級具有不同確定度。
哲學實驗則說明,在判定支持與反對之前,系統必須先完成定義對齊、前提拆分與命題正規化,否則表面矛盾可能只是語義錯位。
因此,三輪實驗支持以下觀察命題:
多解析度論證語義圖的核心價值,不是將長篇內容壓縮成較短內容,而是把分散文本編譯成一個能夠從最小索引逐步還原至完整定義、證據、推理與爭議結構的語義空間。
其一般處理流程可暫時表示為:
本文並未決定這套方法最終應成為何種產品。三輪實驗只表明,它已具有超出一般摘要、論壇與留言系統的潛在結構價值。其後續用途與更深層理論意義,仍有待進一步展開。
附錄:三輪實驗的最小共同資料結構
{
"node": {
"id": "node_001",
"domain": "math|science|philosophy",
"type": "claim",
"canonical_text": "正規化命題",
"scope": {},
"status": {},
"source_ids": []
},
"edge": {
"from": "node_002",
"to": "node_001",
"relation": "supports",
"target_component": "conclusion",
"scope": "local",
"confidence": 0.8
},
"resolution_view": {
"node_id": "node_001",
"level": 1,
"covered_nodes": [],
"omitted_branches": [],
"source_map": [],
"graph_hash": "sha256:..."
}
}
文件狀態: 三領域觀察初稿。
研究性質: 方法論探索,不主張已完成普適性驗證。