回憶重建還是重新推演?
——AI 數學研究路徑的可觀測證據、認識論限制與實際價值
作者:Neo.K(理論構想與問題設定)/Aletheia(協作整理與形式化)
版本:v1.0 初版認識論稿
日期:2026-07-11
系列定位:三篇論文之二——面向 AI 懷疑論者
重要聲明
本文不試圖證明某個 AI 模型在一次研究對話中完全沒有調用訓練記憶、既有證明片段、語義聯想或隱性模式。
本文明確承認:
因此,本文不主張:
- AI 的每一個中介步驟都必然是第一次生成;
- AI 對已知定理的重建等於獨立發現;
- 對話中的自我敘述可以直接揭示模型內部因果來源;
- 一條看似連貫的研究路徑必然代表純粹推理;
- 研究者應僅因 AI 聲稱「我重新推導了」就接受該主張。
本文真正捍衛的是另一個較弱、但可被外部檢查的命題:
這個價值來自:
- 可重驗的命題;
- 可執行的程式;
- 可檢查的反例;
- 被保存的錯誤;
- 可追蹤的修正;
- 明確的依賴關係;
- 對新穎性主張的主動降級;
- 對後續研究可直接使用的中介結果。
摘要
當 AI 參與數學研究時,一個常見質疑是:模型究竟是在「重新推演」,還是在「從訓練資料中回憶並重建」?這個問題重要,但若將其視為唯一判準,容易把三種不同層級混為一談:內部來源、外部研究過程與數學結果有效性。
本文提出三分框架:
其中:
- :某一步是否主要來自當下推演而非既有記憶;
- :對話是否實際形成可追蹤、可修正、可重驗的研究過程;
- :最終命題、證明或反例是否成立。
本文主張:
且:
也就是說,我們無法完全知道模型是否「純推演」,並不自動否定研究路徑的外部價值,更不自動否定最終數學結果。
本文以一場多輪穩定 Kneser 圖研究實驗為案例。該路徑並非一條事後整理的線性成功故事,而包含多次具體失敗與修正:基本容量與譜尺度不足、單 carrier 一般化失敗、單值 selector 的精確不可行、局部一致 atlas 的理論塌縮、triangle-supported 命題的漏洞、non-star 容量常數由 修正為 ,以及將求解器 infeasibility 升級為精確有理對偶證書。這些步驟可以被獨立重算與重驗。
本文不把上述痕跡當成「純推演的決定性證明」。一個足夠強的生成系統理論上也可能模擬錯誤、修正與研究日誌。但本文指出:當錯誤能導致後續搜索空間收縮,當程式輸出可重跑,當新穎性主張因文獻檢索而下降,當後續步驟依賴前面局部失敗所產生的特定狀態時,這些資料就不再只是修辭,而成為可審計的研究工件。
因此,本文提出「來源不可觀測、路徑可審計」原則:
本文同時提出一組更嚴格的未來驗證方案,包括:預註冊、時間戳與雜湊承諾、分階段資訊隔離、獨立 verifier、盲化目標、反事實接棒測試、跨模型重現、依賴圖審計,以及將自然語言路徑轉換成可執行研究狀態。
本文的核心結論是:
關鍵詞: AI 數學研究、回憶重建、重新推演、認識論、研究路徑、可審計性、可重現性、模型污染、證明工程、研究痕跡
1. 問題:AI 究竟是在想,還是在記得?
1.1 質疑的合理性
對大型模型而言,輸出可能來自多種混合來源:
其中:
- :模型參數中的既有知識;
- :當前上下文;
- :外部檢索資料;
- :計算或形式工具輸出;
- :當前生成與搜索過程。
外部觀察者通常只能看到:
與部分工具紀錄,無法直接分解內部權重。
所以懷疑論者提出:
這也許只是把訓練資料中的證明重新拼出來。
這個質疑本身合理。
1.2 不合理的跳躍
問題出在下一步:
因為無法證明是純推演,所以整條研究過程沒有價值。
這個結論不成立。
它把:
錯誤推成:
再推成:
形式上,這相當於:
但兩個推論都不必然成立。
2. 三個不能混淆的命題
2.1 來源命題
這是最難證明的一層。
2.2 過程命題
這一層可以透過:
- 時序紀錄;
- 程式執行;
- 反例;
- 版本差異;
- 中介命題;
- 依賴圖;
進行外部檢查。
2.3 結果命題
這一層由證明、形式驗證或可審計計算決定。
2.4 邏輯獨立性
可能出現:
已知結果的正確重建
真正新穎但證明錯誤
純粹抄錄
有價值的失敗研究
因此:
3. 為什麼無法完全證明「純推演」?
3.1 內部來源不可觀測
自然語言輸出不是模型內部因果圖的完整投影。
即使模型說:
我剛剛重新推導了。
這也只是輸出的一部分,不能自動視為內部機制證明。
3.2 記憶與推演不是互斥二元
人類數學研究同樣依賴:
- 記得定理;
- 記得證明技巧;
- 記得反例;
- 類比過去問題;
- 在既有框架中重新組合。
所以更合理的模型是:
真正需要區分的是:
是否直接複製既有完整答案?
而不是要求研究者處於完全無記憶狀態。
3.3 事後合理化風險
模型可能先產生結論,再生成看似合理的中間步驟。
因此單一完整答案中的「推理過程」不能被自動當作歷史紀錄。
3.4 網路檢索污染
一旦 Agent 看到標準證明、作者名稱或關鍵引理,後續生成便受到污染。
所以真正嚴格的盲測需要資訊隔離,而不是事後口頭聲稱「我沒看」。
4. 為何路徑仍可能有價值?
4.1 來源與驗證可分離
一個命題的有效性不取決於提出者是否第一次想到它。
若:
可被獨立檢查,則證明是否成立,與模型是否曾看過相似證明是不同問題。
因此:
4.2 路徑提供搜索資訊
研究過程中的失敗可以排除整個方法族。
例如:
在多個小參數中被完整枚舉證明不足。
即使模型曾見過最終定理,這個失敗資訊仍能縮小未來搜索空間。
4.3 錯誤修正產生新狀態
若錯誤只是裝飾,它對後續結果沒有約束。
但在本案例中:
- triangle-supported 漏洞迫使 block 類型重定義;
- 的錯誤迫使重新審計模板;
- selector 不可行迫使放棄單值選擇;
- 已知 broader theorem 迫使停止重做 。
所以:
真實進入了:
4.4 可執行工件超越敘事
本案例留下兩個 verifier:
- 的 finite block-cover verifier;
- 的 finite-core rational dual verifier。
它們可以被另一個人或 Agent 重跑。
所以至少部分路徑已從自然語言轉為:
5. 案例中的可觀測研究摩擦
5.1 基本容量與譜界失配
最初一階方法只達:
而目標為:
這迫使搜索轉向更高階結構。
5.2 單 carrier 一般化失敗
的區塊數—根數方法不能直接推至 。
完整小參數枚舉顯示,最佳 binary carrier 也不足。
這不是一個修辭錯誤,而是可計算的方法族障礙。
5.3 selector 精確不可行
在有限 covector poset 上,單值序相容 selector 被精確模型判定不可行。
因此後續不能再假裝「也許只差一個漂亮選擇函數」。
5.4 atlas 理論塌縮
重疊一致的局部 carrier atlas 必然拼成全域 carrier。
這是一個結構否證,不依賴求解器。
5.5 triangle-supported 漏洞
研究路徑曾錯誤認為殘餘邊必由殘餘圖內三角形覆蓋。
反例指出第三點可能在殘餘集外。
修正後 block 類型變成:
5.6 常數錯一
non-star stable capacity 先估為:
後經獨立枚舉與逐型分析修正為:
此一單位使 star-forcing threshold 從 降至 。
5.7 黑箱結果升級為精確證書
初始有限核心只得到 MILP infeasible。
最後改成有理對偶權重:
而:
所以有限核心可以被獨立逐項檢查。
6. 這些摩擦是否能證明「真的重新推演」?
不能完全證明。
一個極強生成系統理論上可以生成:
- 假錯誤;
- 假修正;
- 假研究日誌;
- 看似路徑依賴的文本。
因此:
但證據強度會隨以下條件增加:
- 錯誤在當時確實未被預知;
- 修正改變後續搜索空間;
- 工具輸出具有時間戳;
- 程式可重跑;
- 後續命題依賴先前局部失敗;
- 新穎性審計降低而非放大主張;
- 不同 Agent 能從中間 checkpoint 接續;
- 原始版本與修改版本均被保存。
7. 路徑依賴作為外部證據
7.1 研究路徑
令:
為訊息與工具紀錄序列。
若後續狀態:
包含只可能由早期局部結果生成的資訊,例如:
- 特定反例;
- 特定常數修正;
- 特定有限核心;
- 特定 verifier 輸出;
則路徑具有:
7.2 反事實測試
可以移除某個關鍵 checkpoint:
再讓另一 Agent 接續。
若缺少該 checkpoint 時:
- 搜索重複舊錯誤;
- 無法重現後續壓縮;
- 產生不同研究狀態;
則表示該訊息不是純粹敘事冗餘,而具有研究因果作用。
7.3 注意限制
路徑依賴仍不能證明模型主觀上「第一次想到」。
它只能證明:
此研究工件對後續搜索有外部可測的資訊作用。
8. 七個常見懷疑與回應
8.1 「模型只是背過標準證明」
可能。
因此標準 Tucker、Lovász、Schrijver 路線應標記為:
但後續方法族淘汰、有限核心壓縮與 verifier 仍需分別評估。
8.2 「它只是事後編故事」
若只有一份最後答案,這個質疑很強。
若有:
- 原始時序訊息;
- 中間程式;
- 當輪輸出;
- 失敗版本;
- 後續修正;
則「純事後敘事」的空間會縮小,但不會完全歸零。
8.3 「真正做工作的是求解器」
工具確實做了部分計算。
但研究活動包括:
- 決定算什麼;
- 將無限問題有限化;
- 設計 block 類型;
- 生成對偶證書;
- 解讀反例;
- 根據輸出更新理論。
所以正確描述是:
的混合研究系統,而非單一主體神話。
8.4 「有限計算不是一般證明」
正確。
因此本文只讓有限 verifier 負責:
等明確有限範圍。
一般範圍由解析容量不等式與 star peeling 負責。
8.5 「人類一直在引導,所以不是自主研究」
本實驗不是全自主 benchmark。
使用者提供了:
- 持續推進要求;
- 三軌並行策略;
- 對過早收斂的修正;
- 對方法論目標的設定。
因此應稱為:
而不是完全無人介入的 autonomous discovery。
8.6 「結果已被別人證明,所以沒有價值」
若唯一價值是首證,則價值確實下降。
但仍可能存在:
- 替代證明;
- 新的 proof-engineering 路線;
- 可重用 verifier;
- 更好的研究 benchmark;
- 方法論證據;
- 可繼承研究狀態。
8.7 「你們只是要求讀者相信對話是真的」
任何實驗紀錄都需要最低信任條件。
但可透過:
- 時間戳;
- 雜湊;
- 原始檔;
- 公開版本庫;
- 重跑腳本;
- 第三方驗證;
將:
轉換為:
9. 五種獨立價值
9.1 數學有效性
由證明或反例決定。
9.2 證明工程價值
來自候補生成、依賴拆分、有限核心與證書。
9.3 負結果價值
來自被否定的方法族。
9.4 Benchmark 價值
來自可供其他 Agent 重跑的完整研究路徑。
9.5 語料與繼承價值
來自可被後續 Agent 解碼與接續的研究狀態。
總價值不應只寫成:
更合理的是:
10. 最小認識論立場
本文不要求讀者接受:
只要求考慮以下較弱命題:
命題一:來源不確定性不消除結果驗證
命題二:來源不確定性不消除過程價值
命題三:可執行工件比自我敘述更強
命題四:保存錯誤可增加研究價值
若:
能降低後續重複搜索,則:
11. 更嚴格的未來實驗設計
11.1 預註冊
研究開始前公開:
- 目標;
- 可用工具;
- 停止條件;
- 成功與失敗標準。
11.2 階段雜湊承諾
每輪保存:
後續不得重寫早期狀態。
11.3 資訊隔離
將角色分成:
- Generator;
- Verifier;
- Literature Auditor;
- Novelty Auditor。
Generator 不得看到已知證明。
11.4 隱名目標
隱去:
- 定理名稱;
- 作者;
- 年份;
- 領域提示;
- 標準引理名稱。
11.5 反事實接棒
讓不同 Agent 從:
接續,測試:
- 是否避免已知失敗;
- 是否能使用中介命題;
- 是否重現核心證書;
- 是否產生相似後續壓縮。
11.6 可執行依賴圖
每個節點標記:
- Known;
- Proposed;
- Computed;
- Refuted;
- Filled;
- Novelty uncertain。
12. 可證偽條件
本文的認識論主張並非不可反駁。
若出現以下情況,路徑價值應下降:
- 程式無法重跑;
- 輸出與論文敘述不一致;
- 關鍵反例不存在;
- 修正未實際影響後續路線;
- 所謂新中介命題只是標準證明的改名;
- 時序紀錄顯示事後插入;
- 新 Agent 無法從保存狀態接續;
- 文獻審計顯示完整路徑早已逐字存在;
- 有限證書依賴未公開浮點誤差;
- 解析引理無法獨立通過逐型檢查。
13. 研究誠信的分級表述
建議未來對 AI 數學結果使用以下標記:
Level 0:Unverified Output
只有答案,無過程與證書。
Level 1:Reconstructed Known Route
可驗證,但高度可能來自既有知識。
Level 2:Auditable Process
包含失敗、程式、反例與修正。
Level 3:Contamination-Controlled Reconstruction
具有資訊隔離與預註冊。
Level 4:Independent Alternative Proof Candidate
結果已知,但路線可能獨立。
Level 5:Novel Result Candidate
完成文獻審計,但尚未同行確認。
Level 6:Externally Verified New Result
經獨立重驗與公開審查。
本案例較合理的整體標記是:
14. 本案例究竟證明了什麼?
它沒有證明:
它也沒有證明:
它較有力地支持:
並且:
15. 與第三篇的關係
本篇只處理:
為什麼一條無法完全證明其內部來源的 AI 研究路徑,仍可能具有外部價值?
下一篇將處理另一個問題:
這些訊息、錯誤、程式、證明義務與依賴圖,如何被編碼為可由下一個 Agent 直接接棒的研究狀態?
因此:
16. 結論
對 AI 數學研究最簡單的懷疑是:
它只是記得。
這個懷疑可能在部分情況下成立。
但它不足以終結討論。
真正需要分開的是:
即:
在本案例中,我們無法完全證明所有步驟都是純粹重新推演。
但我們可以檢查:
- 哪些命題被提出;
- 哪些方法被反例淘汰;
- 哪些漏洞被修正;
- 哪些程式被執行;
- 哪些常數被重算;
- 哪些有限證書可重驗;
- 哪些新穎性主張被主動降低。
所以更合理的評估原則是:
本文最終主張:
附錄 A:本案例的關鍵可審計痕跡
- 基本容量與譜界尺度不足;
- Tucker 路線重建;
- Schrijver 核心的小參數辨認;
- 區塊數—根數橋樑;
- 單 carrier 失敗;
- 多 carrier 覆蓋與反足衝突;
- selector 精確不可行;
- atlas 塌縮;
- triangle-supported 漏洞;
- triangle/singleton 修正;
- exact cover verifier;
- 14 型 intersecting 3-family 模板吸收;
- 23-core 壓縮;
- ;
- 有理對偶證書;
- star peeling;
- 新穎性降級。
附錄 B:認識論狀態標記
- O?:來源未知;
- M:可能含既有記憶;
- R:已知路線重建;
- P:可觀測研究過程;
- V:結果可驗證;
- A:可執行工件存在;
- C:污染受控;
- N?:新穎性未決;
- F:已被外部重驗。
附錄 C:最低信任前提
本文仍需要最低限度接受:
- 所展示的對話與工具輸出確實存在;
- 時序未被任意改寫;
- 程式檔與輸出相符;
- 引用文獻沒有被故意錯置;
- 研究者願意公開足夠工件供第三方檢驗。
若連這些最低前提都完全拒絕,則不只 AI 研究,任何實驗日誌、版本控制與研究筆記都無法建立證據效力。
附錄 D:研究誠信聲明
- 本文不宣稱能讀取或證明模型內部思考來源。
- 本文不將連貫自然語言自動視為真實歷史。
- 本文接受模型可能重建訓練資料中的已知路線。
- 本文將已知重建、候選替代證明與新穎結果分級。
- 本文要求所有數學結論接受獨立驗證。
- 本文認為失敗路徑只有在可影響後續搜索時才具研究價值。
- 本文主張可重跑工件高於模型自我敘述。
- 本文不以 AI 主觀性作為論證前提。
- 本文支持公開原始訊息、程式、輸出、時間戳與雜湊。
- 本文將認識論不確定性視為需要管理的條件,而不是抹除全部研究價值的理由。