# 回憶重建還是重新推演？

## ——AI 數學研究路徑的可觀測證據、認識論限制與實際價值

**作者：Neo.K（理論構想與問題設定）／Aletheia（協作整理與形式化）**  
**版本：v1.0 初版認識論稿**  
**日期：2026-07-11**  
**系列定位：三篇論文之二——面向 AI 懷疑論者**

---

## 重要聲明

本文不試圖證明某個 AI 模型在一次研究對話中完全沒有調用訓練記憶、既有證明片段、語義聯想或隱性模式。

本文明確承認：

$$
\boxed{
\text{僅憑輸出文字，通常無法完全區分「回憶重建」與「當下重新推演」。}
}
$$

因此，本文不主張：

1. AI 的每一個中介步驟都必然是第一次生成；
2. AI 對已知定理的重建等於獨立發現；
3. 對話中的自我敘述可以直接揭示模型內部因果來源；
4. 一條看似連貫的研究路徑必然代表純粹推理；
5. 研究者應僅因 AI 聲稱「我重新推導了」就接受該主張。

本文真正捍衛的是另一個較弱、但可被外部檢查的命題：

$$
\boxed{
\text{即使內部來源無法完全判定，外部研究路徑仍可能具有獨立價值。}
}
$$

這個價值來自：

- 可重驗的命題；
- 可執行的程式；
- 可檢查的反例；
- 被保存的錯誤；
- 可追蹤的修正；
- 明確的依賴關係；
- 對新穎性主張的主動降級；
- 對後續研究可直接使用的中介結果。

---

## 摘要

當 AI 參與數學研究時，一個常見質疑是：模型究竟是在「重新推演」，還是在「從訓練資料中回憶並重建」？這個問題重要，但若將其視為唯一判準，容易把三種不同層級混為一談：內部來源、外部研究過程與數學結果有效性。

本文提出三分框架：

$$
\mathsf O
=
\text{Origin Claim},
$$

$$
\mathsf P
=
\text{Process Claim},
$$

$$
\mathsf R
=
\text{Result Claim}.
$$

其中：

- $\mathsf O$ ：某一步是否主要來自當下推演而非既有記憶；
- $\mathsf P$ ：對話是否實際形成可追蹤、可修正、可重驗的研究過程；
- $\mathsf R$ ：最終命題、證明或反例是否成立。

本文主張：

$$
\boxed{
\neg\operatorname{Know}(\mathsf O)
\not\Rightarrow
\neg\mathsf P
}
$$

且：

$$
\boxed{
\neg\operatorname{Know}(\mathsf O)
\not\Rightarrow
\neg\mathsf R.
}
$$

也就是說，我們無法完全知道模型是否「純推演」，並不自動否定研究路徑的外部價值，更不自動否定最終數學結果。

本文以一場多輪穩定 Kneser 圖研究實驗為案例。該路徑並非一條事後整理的線性成功故事，而包含多次具體失敗與修正：基本容量與譜尺度不足、單 carrier 一般化失敗、單值 selector 的精確不可行、局部一致 atlas 的理論塌縮、triangle-supported 命題的漏洞、non-star 容量常數由 $3r-27$ 修正為 $3r-28$ ，以及將求解器 infeasibility 升級為精確有理對偶證書。這些步驟可以被獨立重算與重驗。

本文不把上述痕跡當成「純推演的決定性證明」。一個足夠強的生成系統理論上也可能模擬錯誤、修正與研究日誌。但本文指出：當錯誤能導致後續搜索空間收縮，當程式輸出可重跑，當新穎性主張因文獻檢索而下降，當後續步驟依賴前面局部失敗所產生的特定狀態時，這些資料就不再只是修辭，而成為可審計的研究工件。

因此，本文提出「來源不可觀測、路徑可審計」原則：

$$
\boxed{
\text{不必先證明 Agent 內部如何想到；
先檢查它留下了什麼可重驗的研究痕跡。}
}
$$

本文同時提出一組更嚴格的未來驗證方案，包括：預註冊、時間戳與雜湊承諾、分階段資訊隔離、獨立 verifier、盲化目標、反事實接棒測試、跨模型重現、依賴圖審計，以及將自然語言路徑轉換成可執行研究狀態。

本文的核心結論是：

$$
\boxed{
\text{AI 研究的價值不能只由「它是否記得」決定，}
}
$$

$$
\boxed{
\text{而應由結果有效性、路徑可審計性與研究狀態可繼承性共同評估。}
}
$$

**關鍵詞：** AI 數學研究、回憶重建、重新推演、認識論、研究路徑、可審計性、可重現性、模型污染、證明工程、研究痕跡

---

# 1. 問題：AI 究竟是在想，還是在記得？

## 1.1 質疑的合理性

對大型模型而言，輸出可能來自多種混合來源：

$$
Y
=
f(
K_{\mathrm{param}},
C_{\mathrm{current}},
R_{\mathrm{retrieved}},
T_{\mathrm{tool}},
S_{\mathrm{search}}
).
$$

其中：

- $K_{\mathrm{param}}$ ：模型參數中的既有知識；
- $C_{\mathrm{current}}$ ：當前上下文；
- $R_{\mathrm{retrieved}}$ ：外部檢索資料；
- $T_{\mathrm{tool}}$ ：計算或形式工具輸出；
- $S_{\mathrm{search}}$ ：當前生成與搜索過程。

外部觀察者通常只能看到：

$$
Y
$$

與部分工具紀錄，無法直接分解內部權重。

所以懷疑論者提出：

> 這也許只是把訓練資料中的證明重新拼出來。

這個質疑本身合理。

---

## 1.2 不合理的跳躍

問題出在下一步：

> 因為無法證明是純推演，所以整條研究過程沒有價值。

這個結論不成立。

它把：

$$
\text{來源不確定}
$$

錯誤推成：

$$
\text{過程無價值}
$$

再推成：

$$
\text{結果無效}.
$$

形式上，這相當於：

$$
\neg\operatorname{Know}(\mathsf O)
\Rightarrow
\neg\mathsf P
\Rightarrow
\neg\mathsf R,
$$

但兩個推論都不必然成立。

---

# 2. 三個不能混淆的命題

## 2.1 來源命題

$$
\mathsf O:
\text{某一結果主要由當下獨立推演產生。}
$$

這是最難證明的一層。

---

## 2.2 過程命題

$$
\mathsf P:
\text{對話實際形成可追蹤、可修正、可重驗的研究過程。}
$$

這一層可以透過：

- 時序紀錄；
- 程式執行；
- 反例；
- 版本差異；
- 中介命題；
- 依賴圖；

進行外部檢查。

---

## 2.3 結果命題

$$
\mathsf R:
\text{最後的數學結論在給定假設下成立。}
$$

這一層由證明、形式驗證或可審計計算決定。

---

## 2.4 邏輯獨立性

可能出現：

### 已知結果的正確重建

$$
\neg\mathsf O,
\qquad
\mathsf P,
\qquad
\mathsf R.
$$

### 真正新穎但證明錯誤

$$
\mathsf O,
\qquad
\mathsf P,
\qquad
\neg\mathsf R.
$$

### 純粹抄錄

$$
\neg\mathsf O,
\qquad
\neg\mathsf P,
\qquad
\mathsf R.
$$

### 有價值的失敗研究

$$
\mathsf O\text{ 未知},
\qquad
\mathsf P,
\qquad
\neg\mathsf R.
$$

因此：

$$
\boxed{
\mathsf O,\mathsf P,\mathsf R
\text{ 必須分開評估。}
}
$$

---

# 3. 為什麼無法完全證明「純推演」？

## 3.1 內部來源不可觀測

自然語言輸出不是模型內部因果圖的完整投影。

即使模型說：

> 我剛剛重新推導了。

這也只是輸出的一部分，不能自動視為內部機制證明。

---

## 3.2 記憶與推演不是互斥二元

人類數學研究同樣依賴：

- 記得定理；
- 記得證明技巧；
- 記得反例；
- 類比過去問題；
- 在既有框架中重新組合。

所以更合理的模型是：

$$
\text{研究生成}
=
\text{記憶}
+
\text{局部推演}
+
\text{重組}
+
\text{驗證}.
$$

真正需要區分的是：

> 是否直接複製既有完整答案？

而不是要求研究者處於完全無記憶狀態。

---

## 3.3 事後合理化風險

模型可能先產生結論，再生成看似合理的中間步驟。

因此單一完整答案中的「推理過程」不能被自動當作歷史紀錄。

---

## 3.4 網路檢索污染

一旦 Agent 看到標準證明、作者名稱或關鍵引理，後續生成便受到污染。

所以真正嚴格的盲測需要資訊隔離，而不是事後口頭聲稱「我沒看」。

---

# 4. 為何路徑仍可能有價值？

## 4.1 來源與驗證可分離

一個命題的有效性不取決於提出者是否第一次想到它。

若：

$$
T_1,\dots,T_m
\Rightarrow
P
$$

可被獨立檢查，則證明是否成立，與模型是否曾看過相似證明是不同問題。

因此：

$$
\boxed{
\text{provenance}
\neq
\text{validity}.
}
$$

---

## 4.2 路徑提供搜索資訊

研究過程中的失敗可以排除整個方法族。

例如：

$$
\text{single carrier}
+
\text{first-order root count}
$$

在多個小參數中被完整枚舉證明不足。

即使模型曾見過最終定理，這個失敗資訊仍能縮小未來搜索空間。

---

## 4.3 錯誤修正產生新狀態

若錯誤只是裝飾，它對後續結果沒有約束。

但在本案例中：

- triangle-supported 漏洞迫使 block 類型重定義；
- $3r-27$ 的錯誤迫使重新審計模板；
- selector 不可行迫使放棄單值選擇；
- 已知 broader theorem 迫使停止重做 $k=2$ 。

所以：

$$
\mathcal F_t
$$

真實進入了：

$$
\mathcal S_{t+1}
=
\mathcal U(
\mathcal S_t,
\mathcal F_t
).
$$

---

## 4.4 可執行工件超越敘事

本案例留下兩個 verifier：

1. $s=3,k=2$ 的 finite block-cover verifier；
2. $s=3,k=3$ 的 finite-core rational dual verifier。

它們可以被另一個人或 Agent 重跑。

所以至少部分路徑已從自然語言轉為：

$$
\boxed{
\text{executable artifact}.
}
$$

---

# 5. 案例中的可觀測研究摩擦

## 5.1 基本容量與譜界失配

最初一階方法只達：

$$
\frac nk,
$$

而目標為：

$$
n-2k+2.
$$

這迫使搜索轉向更高階結構。

---

## 5.2 單 carrier 一般化失敗

$s=2$ 的區塊數—根數方法不能直接推至 $s>2$ 。

完整小參數枚舉顯示，最佳 binary carrier 也不足。

這不是一個修辭錯誤，而是可計算的方法族障礙。

---

## 5.3 selector 精確不可行

在有限 covector poset 上，單值序相容 selector 被精確模型判定不可行。

因此後續不能再假裝「也許只差一個漂亮選擇函數」。

---

## 5.4 atlas 理論塌縮

重疊一致的局部 carrier atlas 必然拼成全域 carrier。

這是一個結構否證，不依賴求解器。

---

## 5.5 triangle-supported 漏洞

研究路徑曾錯誤認為殘餘邊必由殘餘圖內三角形覆蓋。

反例指出第三點可能在殘餘集外。

修正後 block 類型變成：

$$
\text{internal triangle}
\quad\text{or}\quad
\text{singleton edge}.
$$

---

## 5.6 常數錯一

non-star stable capacity 先估為：

$$
3r-27,
$$

後經獨立枚舉與逐型分析修正為：

$$
3r-28.
$$

此一單位使 star-forcing threshold 從 $16$ 降至 $15$ 。

---

## 5.7 黑箱結果升級為精確證書

初始有限核心只得到 MILP infeasible。

最後改成有理對偶權重：

$$
\sum_{A\in\mathcal F}y_A\le1,
$$

而：

$$
\sum_Ay_A>r-7.
$$

所以有限核心可以被獨立逐項檢查。

---

# 6. 這些摩擦是否能證明「真的重新推演」？

不能完全證明。

一個極強生成系統理論上可以生成：

- 假錯誤；
- 假修正；
- 假研究日誌；
- 看似路徑依賴的文本。

因此：

$$
\boxed{
\text{摩擦是證據，不是決定性證明。}
}
$$

但證據強度會隨以下條件增加：

1. 錯誤在當時確實未被預知；
2. 修正改變後續搜索空間；
3. 工具輸出具有時間戳；
4. 程式可重跑；
5. 後續命題依賴先前局部失敗；
6. 新穎性審計降低而非放大主張；
7. 不同 Agent 能從中間 checkpoint 接續；
8. 原始版本與修改版本均被保存。

---

# 7. 路徑依賴作為外部證據

## 7.1 研究路徑

令：

$$
\Pi_T
=
(
m_0,m_1,\dots,m_T
)
$$

為訊息與工具紀錄序列。

若後續狀態：

$$
\mathcal S_{t+1}
$$

包含只可能由早期局部結果生成的資訊，例如：

- 特定反例；
- 特定常數修正；
- 特定有限核心；
- 特定 verifier 輸出；

則路徑具有：

$$
\operatorname{PathDependence}(\Pi_T)>0.
$$

---

## 7.2 反事實測試

可以移除某個關鍵 checkpoint：

$$
m_j
$$

再讓另一 Agent 接續。

若缺少該 checkpoint 時：

- 搜索重複舊錯誤；
- 無法重現後續壓縮；
- 產生不同研究狀態；

則表示該訊息不是純粹敘事冗餘，而具有研究因果作用。

---

## 7.3 注意限制

路徑依賴仍不能證明模型主觀上「第一次想到」。

它只能證明：

> 此研究工件對後續搜索有外部可測的資訊作用。

---

# 8. 七個常見懷疑與回應

## 8.1 「模型只是背過標準證明」

可能。

因此標準 Tucker、Lovász、Schrijver 路線應標記為：

$$
\mathrm{Reconstruction}.
$$

但後續方法族淘汰、有限核心壓縮與 verifier 仍需分別評估。

---

## 8.2 「它只是事後編故事」

若只有一份最後答案，這個質疑很強。

若有：

- 原始時序訊息；
- 中間程式；
- 當輪輸出；
- 失敗版本；
- 後續修正；

則「純事後敘事」的空間會縮小，但不會完全歸零。

---

## 8.3 「真正做工作的是求解器」

工具確實做了部分計算。

但研究活動包括：

- 決定算什麼；
- 將無限問題有限化；
- 設計 block 類型；
- 生成對偶證書；
- 解讀反例；
- 根據輸出更新理論。

所以正確描述是：

$$
\text{Agent}
+
\text{solver}
+
\text{human direction}
$$

的混合研究系統，而非單一主體神話。

---

## 8.4 「有限計算不是一般證明」

正確。

因此本文只讓有限 verifier 負責：

$$
10\le r\le14
$$

等明確有限範圍。

一般範圍由解析容量不等式與 star peeling 負責。

---

## 8.5 「人類一直在引導，所以不是自主研究」

本實驗不是全自主 benchmark。

使用者提供了：

- 持續推進要求；
- 三軌並行策略；
- 對過早收斂的修正；
- 對方法論目標的設定。

因此應稱為：

$$
\boxed{
\text{human-guided autonomous research loop}
}
$$

而不是完全無人介入的 autonomous discovery。

---

## 8.6 「結果已被別人證明，所以沒有價值」

若唯一價值是首證，則價值確實下降。

但仍可能存在：

- 替代證明；
- 新的 proof-engineering 路線；
- 可重用 verifier；
- 更好的研究 benchmark；
- 方法論證據；
- 可繼承研究狀態。

---

## 8.7 「你們只是要求讀者相信對話是真的」

任何實驗紀錄都需要最低信任條件。

但可透過：

- 時間戳；
- 雜湊；
- 原始檔；
- 公開版本庫；
- 重跑腳本；
- 第三方驗證；

將：

$$
\text{請相信我們}
$$

轉換為：

$$
\boxed{
\text{請重驗這些工件。}
}
$$

---

# 9. 五種獨立價值

## 9.1 數學有效性

$$
V_{\mathrm{math}}
$$

由證明或反例決定。

---

## 9.2 證明工程價值

$$
V_{\mathrm{PE}}
$$

來自候補生成、依賴拆分、有限核心與證書。

---

## 9.3 負結果價值

$$
V_{\mathrm{neg}}
$$

來自被否定的方法族。

---

## 9.4 Benchmark 價值

$$
V_{\mathrm{bench}}
$$

來自可供其他 Agent 重跑的完整研究路徑。

---

## 9.5 語料與繼承價值

$$
V_{\mathrm{trace}}
$$

來自可被後續 Agent 解碼與接續的研究狀態。

總價值不應只寫成：

$$
V=V_{\mathrm{novelty}}.
$$

更合理的是：

$$
\boxed{
V
=
f(
V_{\mathrm{math}},
V_{\mathrm{PE}},
V_{\mathrm{neg}},
V_{\mathrm{bench}},
V_{\mathrm{trace}}
).
}
$$

---

# 10. 最小認識論立場

本文不要求讀者接受：

$$
\boxed{
\text{「AI 真正像人類一樣思考了。」}
}
$$

只要求考慮以下較弱命題：

## 命題一：來源不確定性不消除結果驗證

$$
\neg\operatorname{Know}(\mathsf O)
\not\Rightarrow
\neg\mathsf R.
$$

## 命題二：來源不確定性不消除過程價值

$$
\neg\operatorname{Know}(\mathsf O)
\not\Rightarrow
\neg\mathsf P.
$$

## 命題三：可執行工件比自我敘述更強

$$
E_{\mathrm{artifact}}
>
E_{\mathrm{self\ report}}.
$$

## 命題四：保存錯誤可增加研究價值

若：

$$
\mathcal F_t
$$

能降低後續重複搜索，則：

$$
V(\Pi_T)
>
V(\text{final answer only}).
$$

---

# 11. 更嚴格的未來實驗設計

## 11.1 預註冊

研究開始前公開：

- 目標；
- 可用工具；
- 停止條件；
- 成功與失敗標準。

---

## 11.2 階段雜湊承諾

每輪保存：

$$
h_t
=
H(
m_t,
C_t,
F_t,
D_t
).
$$

後續不得重寫早期狀態。

---

## 11.3 資訊隔離

將角色分成：

- Generator；
- Verifier；
- Literature Auditor；
- Novelty Auditor。

Generator 不得看到已知證明。

---

## 11.4 隱名目標

隱去：

- 定理名稱；
- 作者；
- 年份；
- 領域提示；
- 標準引理名稱。

---

## 11.5 反事實接棒

讓不同 Agent 從：

$$
\mathcal S_t
$$

接續，測試：

- 是否避免已知失敗；
- 是否能使用中介命題；
- 是否重現核心證書；
- 是否產生相似後續壓縮。

---

## 11.6 可執行依賴圖

每個節點標記：

- Known；
- Proposed；
- Computed；
- Refuted；
- Filled；
- Novelty uncertain。

---

# 12. 可證偽條件

本文的認識論主張並非不可反駁。

若出現以下情況，路徑價值應下降：

1. 程式無法重跑；
2. 輸出與論文敘述不一致；
3. 關鍵反例不存在；
4. 修正未實際影響後續路線；
5. 所謂新中介命題只是標準證明的改名；
6. 時序紀錄顯示事後插入；
7. 新 Agent 無法從保存狀態接續；
8. 文獻審計顯示完整路徑早已逐字存在；
9. 有限證書依賴未公開浮點誤差；
10. 解析引理無法獨立通過逐型檢查。

---

# 13. 研究誠信的分級表述

建議未來對 AI 數學結果使用以下標記：

## Level 0：Unverified Output

只有答案，無過程與證書。

## Level 1：Reconstructed Known Route

可驗證，但高度可能來自既有知識。

## Level 2：Auditable Process

包含失敗、程式、反例與修正。

## Level 3：Contamination-Controlled Reconstruction

具有資訊隔離與預註冊。

## Level 4：Independent Alternative Proof Candidate

結果已知，但路線可能獨立。

## Level 5：Novel Result Candidate

完成文獻審計，但尚未同行確認。

## Level 6：Externally Verified New Result

經獨立重驗與公開審查。

本案例較合理的整體標記是：

$$
\boxed{
\text{Level 2–4，依不同子結果而異。}
}
$$

---

# 14. 本案例究竟證明了什麼？

它沒有證明：

$$
\text{AI 必然可以自主解決開放問題。}
$$

它也沒有證明：

$$
\text{所有中間步驟皆為純推演。}
$$

它較有力地支持：

$$
\boxed{
\text{AI、人類與工具可以形成可持續、自我修正、可審計的研究循環。}
}
$$

並且：

$$
\boxed{
\text{即使最終結果已知，重新走過的路徑仍能產生新的研究工件與方法資訊。}
}
$$

---

# 15. 與第三篇的關係

本篇只處理：

> 為什麼一條無法完全證明其內部來源的 AI 研究路徑，仍可能具有外部價值？

下一篇將處理另一個問題：

> 這些訊息、錯誤、程式、證明義務與依賴圖，如何被編碼為可由下一個 Agent 直接接棒的研究狀態？

因此：

$$
\text{本篇}
=
\text{路徑價值的認識論辯護},
$$

$$
\text{下一篇}
=
\text{路徑繼承的系統理論}.
$$

---

# 16. 結論

對 AI 數學研究最簡單的懷疑是：

> 它只是記得。

這個懷疑可能在部分情況下成立。

但它不足以終結討論。

真正需要分開的是：

$$
\text{它如何產生}
$$

$$
\text{它留下什麼}
$$

$$
\text{它是否正確}.
$$

即：

$$
\boxed{
\mathsf O
\neq
\mathsf P
\neq
\mathsf R.
}
$$

在本案例中，我們無法完全證明所有步驟都是純粹重新推演。

但我們可以檢查：

- 哪些命題被提出；
- 哪些方法被反例淘汰；
- 哪些漏洞被修正；
- 哪些程式被執行；
- 哪些常數被重算；
- 哪些有限證書可重驗；
- 哪些新穎性主張被主動降低。

所以更合理的評估原則是：

$$
\boxed{
\text{不要只問「它是不是記得」；}
}
$$

$$
\boxed{
\text{還要問「這條路徑是否可重驗、可修正、可使用」。}
}
$$

本文最終主張：

$$
\boxed{
\text{AI 研究的可信度不應建立在相信其內心，}
}
$$

$$
\boxed{
\text{而應建立在檢查其留下的研究工件。}
}
$$

---

# 附錄 A：本案例的關鍵可審計痕跡

1. 基本容量與譜界尺度不足；
2. Tucker 路線重建；
3. Schrijver 核心的小參數辨認；
4. 區塊數—根數橋樑；
5. $s>2$ 單 carrier 失敗；
6. 多 carrier 覆蓋與反足衝突；
7. selector 精確不可行；
8. atlas 塌縮；
9. triangle-supported 漏洞；
10. triangle/singleton 修正；
11. $k=2$ exact cover verifier；
12. 14 型 intersecting 3-family 模板吸收；
13. 23-core 壓縮；
14. $3r-27\rightarrow3r-28$ ；
15. $10\le r\le14$ 有理對偶證書；
16. star peeling；
17. 新穎性降級。

---

# 附錄 B：認識論狀態標記

- **O?**：來源未知；
- **M**：可能含既有記憶；
- **R**：已知路線重建；
- **P**：可觀測研究過程；
- **V**：結果可驗證；
- **A**：可執行工件存在；
- **C**：污染受控；
- **N?**：新穎性未決；
- **F**：已被外部重驗。

---

# 附錄 C：最低信任前提

本文仍需要最低限度接受：

1. 所展示的對話與工具輸出確實存在；
2. 時序未被任意改寫；
3. 程式檔與輸出相符；
4. 引用文獻沒有被故意錯置；
5. 研究者願意公開足夠工件供第三方檢驗。

若連這些最低前提都完全拒絕，則不只 AI 研究，任何實驗日誌、版本控制與研究筆記都無法建立證據效力。

---

# 附錄 D：研究誠信聲明

1. 本文不宣稱能讀取或證明模型內部思考來源。
2. 本文不將連貫自然語言自動視為真實歷史。
3. 本文接受模型可能重建訓練資料中的已知路線。
4. 本文將已知重建、候選替代證明與新穎結果分級。
5. 本文要求所有數學結論接受獨立驗證。
6. 本文認為失敗路徑只有在可影響後續搜索時才具研究價值。
7. 本文主張可重跑工件高於模型自我敘述。
8. 本文不以 AI 主觀性作為論證前提。
9. 本文支持公開原始訊息、程式、輸出、時間戳與雜湊。
10. 本文將認識論不確定性視為需要管理的條件，而不是抹除全部研究價值的理由。
