← Archive
lm-001404 · 2026-07

回憶重建還是重新推演_AI數學研究路徑的可觀測證據認識論限制與實際價值_v1.0

下載 MD 檔 ⬇

回憶重建還是重新推演?

——AI 數學研究路徑的可觀測證據、認識論限制與實際價值

作者:Neo.K(理論構想與問題設定)/Aletheia(協作整理與形式化)
版本:v1.0 初版認識論稿
日期:2026-07-11
系列定位:三篇論文之二——面向 AI 懷疑論者


重要聲明

本文不試圖證明某個 AI 模型在一次研究對話中完全沒有調用訓練記憶、既有證明片段、語義聯想或隱性模式。

本文明確承認:

僅憑輸出文字,通常無法完全區分「回憶重建」與「當下重新推演」。\boxed{ \text{僅憑輸出文字,通常無法完全區分「回憶重建」與「當下重新推演」。} }

因此,本文不主張:

  1. AI 的每一個中介步驟都必然是第一次生成;
  2. AI 對已知定理的重建等於獨立發現;
  3. 對話中的自我敘述可以直接揭示模型內部因果來源;
  4. 一條看似連貫的研究路徑必然代表純粹推理;
  5. 研究者應僅因 AI 聲稱「我重新推導了」就接受該主張。

本文真正捍衛的是另一個較弱、但可被外部檢查的命題:

即使內部來源無法完全判定,外部研究路徑仍可能具有獨立價值。\boxed{ \text{即使內部來源無法完全判定,外部研究路徑仍可能具有獨立價值。} }

這個價值來自:

  • 可重驗的命題;
  • 可執行的程式;
  • 可檢查的反例;
  • 被保存的錯誤;
  • 可追蹤的修正;
  • 明確的依賴關係;
  • 對新穎性主張的主動降級;
  • 對後續研究可直接使用的中介結果。

摘要

當 AI 參與數學研究時,一個常見質疑是:模型究竟是在「重新推演」,還是在「從訓練資料中回憶並重建」?這個問題重要,但若將其視為唯一判準,容易把三種不同層級混為一談:內部來源、外部研究過程與數學結果有效性。

本文提出三分框架:

O=Origin Claim,\mathsf O = \text{Origin Claim}, P=Process Claim,\mathsf P = \text{Process Claim}, R=Result Claim.\mathsf R = \text{Result Claim}.

其中:

  • O\mathsf O :某一步是否主要來自當下推演而非既有記憶;
  • P\mathsf P :對話是否實際形成可追蹤、可修正、可重驗的研究過程;
  • R\mathsf R :最終命題、證明或反例是否成立。

本文主張:

¬Know(O)⇏¬P\boxed{ \neg\operatorname{Know}(\mathsf O) \not\Rightarrow \neg\mathsf P }

且:

¬Know(O)⇏¬R.\boxed{ \neg\operatorname{Know}(\mathsf O) \not\Rightarrow \neg\mathsf R. }

也就是說,我們無法完全知道模型是否「純推演」,並不自動否定研究路徑的外部價值,更不自動否定最終數學結果。

本文以一場多輪穩定 Kneser 圖研究實驗為案例。該路徑並非一條事後整理的線性成功故事,而包含多次具體失敗與修正:基本容量與譜尺度不足、單 carrier 一般化失敗、單值 selector 的精確不可行、局部一致 atlas 的理論塌縮、triangle-supported 命題的漏洞、non-star 容量常數由 3r273r-27 修正為 3r283r-28 ,以及將求解器 infeasibility 升級為精確有理對偶證書。這些步驟可以被獨立重算與重驗。

本文不把上述痕跡當成「純推演的決定性證明」。一個足夠強的生成系統理論上也可能模擬錯誤、修正與研究日誌。但本文指出:當錯誤能導致後續搜索空間收縮,當程式輸出可重跑,當新穎性主張因文獻檢索而下降,當後續步驟依賴前面局部失敗所產生的特定狀態時,這些資料就不再只是修辭,而成為可審計的研究工件。

因此,本文提出「來源不可觀測、路徑可審計」原則:

不必先證明 Agent 內部如何想到; 先檢查它留下了什麼可重驗的研究痕跡。\boxed{ \text{不必先證明 Agent 內部如何想到; 先檢查它留下了什麼可重驗的研究痕跡。} }

本文同時提出一組更嚴格的未來驗證方案,包括:預註冊、時間戳與雜湊承諾、分階段資訊隔離、獨立 verifier、盲化目標、反事實接棒測試、跨模型重現、依賴圖審計,以及將自然語言路徑轉換成可執行研究狀態。

本文的核心結論是:

AI 研究的價值不能只由「它是否記得」決定,\boxed{ \text{AI 研究的價值不能只由「它是否記得」決定,} } 而應由結果有效性、路徑可審計性與研究狀態可繼承性共同評估。\boxed{ \text{而應由結果有效性、路徑可審計性與研究狀態可繼承性共同評估。} }

關鍵詞: AI 數學研究、回憶重建、重新推演、認識論、研究路徑、可審計性、可重現性、模型污染、證明工程、研究痕跡


1. 問題:AI 究竟是在想,還是在記得?

1.1 質疑的合理性

對大型模型而言,輸出可能來自多種混合來源:

Y=f(Kparam,Ccurrent,Rretrieved,Ttool,Ssearch).Y = f( K_{\mathrm{param}}, C_{\mathrm{current}}, R_{\mathrm{retrieved}}, T_{\mathrm{tool}}, S_{\mathrm{search}} ).

其中:

  • KparamK_{\mathrm{param}} :模型參數中的既有知識;
  • CcurrentC_{\mathrm{current}} :當前上下文;
  • RretrievedR_{\mathrm{retrieved}} :外部檢索資料;
  • TtoolT_{\mathrm{tool}} :計算或形式工具輸出;
  • SsearchS_{\mathrm{search}} :當前生成與搜索過程。

外部觀察者通常只能看到:

YY

與部分工具紀錄,無法直接分解內部權重。

所以懷疑論者提出:

這也許只是把訓練資料中的證明重新拼出來。

這個質疑本身合理。


1.2 不合理的跳躍

問題出在下一步:

因為無法證明是純推演,所以整條研究過程沒有價值。

這個結論不成立。

它把:

來源不確定\text{來源不確定}

錯誤推成:

過程無價值\text{過程無價值}

再推成:

結果無效.\text{結果無效}.

形式上,這相當於:

¬Know(O)¬P¬R,\neg\operatorname{Know}(\mathsf O) \Rightarrow \neg\mathsf P \Rightarrow \neg\mathsf R,

但兩個推論都不必然成立。


2. 三個不能混淆的命題

2.1 來源命題

O:某一結果主要由當下獨立推演產生。\mathsf O: \text{某一結果主要由當下獨立推演產生。}

這是最難證明的一層。


2.2 過程命題

P:對話實際形成可追蹤、可修正、可重驗的研究過程。\mathsf P: \text{對話實際形成可追蹤、可修正、可重驗的研究過程。}

這一層可以透過:

  • 時序紀錄;
  • 程式執行;
  • 反例;
  • 版本差異;
  • 中介命題;
  • 依賴圖;

進行外部檢查。


2.3 結果命題

R:最後的數學結論在給定假設下成立。\mathsf R: \text{最後的數學結論在給定假設下成立。}

這一層由證明、形式驗證或可審計計算決定。


2.4 邏輯獨立性

可能出現:

已知結果的正確重建

¬O,P,R.\neg\mathsf O, \qquad \mathsf P, \qquad \mathsf R.

真正新穎但證明錯誤

O,P,¬R.\mathsf O, \qquad \mathsf P, \qquad \neg\mathsf R.

純粹抄錄

¬O,¬P,R.\neg\mathsf O, \qquad \neg\mathsf P, \qquad \mathsf R.

有價值的失敗研究

O 未知,P,¬R.\mathsf O\text{ 未知}, \qquad \mathsf P, \qquad \neg\mathsf R.

因此:

O,P,R 必須分開評估。\boxed{ \mathsf O,\mathsf P,\mathsf R \text{ 必須分開評估。} }

3. 為什麼無法完全證明「純推演」?

3.1 內部來源不可觀測

自然語言輸出不是模型內部因果圖的完整投影。

即使模型說:

我剛剛重新推導了。

這也只是輸出的一部分,不能自動視為內部機制證明。


3.2 記憶與推演不是互斥二元

人類數學研究同樣依賴:

  • 記得定理;
  • 記得證明技巧;
  • 記得反例;
  • 類比過去問題;
  • 在既有框架中重新組合。

所以更合理的模型是:

研究生成=記憶+局部推演+重組+驗證.\text{研究生成} = \text{記憶} + \text{局部推演} + \text{重組} + \text{驗證}.

真正需要區分的是:

是否直接複製既有完整答案?

而不是要求研究者處於完全無記憶狀態。


3.3 事後合理化風險

模型可能先產生結論,再生成看似合理的中間步驟。

因此單一完整答案中的「推理過程」不能被自動當作歷史紀錄。


3.4 網路檢索污染

一旦 Agent 看到標準證明、作者名稱或關鍵引理,後續生成便受到污染。

所以真正嚴格的盲測需要資訊隔離,而不是事後口頭聲稱「我沒看」。


4. 為何路徑仍可能有價值?

4.1 來源與驗證可分離

一個命題的有效性不取決於提出者是否第一次想到它。

若:

T1,,TmPT_1,\dots,T_m \Rightarrow P

可被獨立檢查,則證明是否成立,與模型是否曾看過相似證明是不同問題。

因此:

provenancevalidity.\boxed{ \text{provenance} \neq \text{validity}. }

4.2 路徑提供搜索資訊

研究過程中的失敗可以排除整個方法族。

例如:

single carrier+first-order root count\text{single carrier} + \text{first-order root count}

在多個小參數中被完整枚舉證明不足。

即使模型曾見過最終定理,這個失敗資訊仍能縮小未來搜索空間。


4.3 錯誤修正產生新狀態

若錯誤只是裝飾,它對後續結果沒有約束。

但在本案例中:

  • triangle-supported 漏洞迫使 block 類型重定義;
  • 3r273r-27 的錯誤迫使重新審計模板;
  • selector 不可行迫使放棄單值選擇;
  • 已知 broader theorem 迫使停止重做 k=2k=2

所以:

Ft\mathcal F_t

真實進入了:

St+1=U(St,Ft).\mathcal S_{t+1} = \mathcal U( \mathcal S_t, \mathcal F_t ).

4.4 可執行工件超越敘事

本案例留下兩個 verifier:

  1. s=3,k=2s=3,k=2 的 finite block-cover verifier;
  2. s=3,k=3s=3,k=3 的 finite-core rational dual verifier。

它們可以被另一個人或 Agent 重跑。

所以至少部分路徑已從自然語言轉為:

executable artifact.\boxed{ \text{executable artifact}. }

5. 案例中的可觀測研究摩擦

5.1 基本容量與譜界失配

最初一階方法只達:

nk,\frac nk,

而目標為:

n2k+2.n-2k+2.

這迫使搜索轉向更高階結構。


5.2 單 carrier 一般化失敗

s=2s=2 的區塊數—根數方法不能直接推至 s>2s>2

完整小參數枚舉顯示,最佳 binary carrier 也不足。

這不是一個修辭錯誤,而是可計算的方法族障礙。


5.3 selector 精確不可行

在有限 covector poset 上,單值序相容 selector 被精確模型判定不可行。

因此後續不能再假裝「也許只差一個漂亮選擇函數」。


5.4 atlas 理論塌縮

重疊一致的局部 carrier atlas 必然拼成全域 carrier。

這是一個結構否證,不依賴求解器。


5.5 triangle-supported 漏洞

研究路徑曾錯誤認為殘餘邊必由殘餘圖內三角形覆蓋。

反例指出第三點可能在殘餘集外。

修正後 block 類型變成:

internal triangleorsingleton edge.\text{internal triangle} \quad\text{or}\quad \text{singleton edge}.

5.6 常數錯一

non-star stable capacity 先估為:

3r27,3r-27,

後經獨立枚舉與逐型分析修正為:

3r28.3r-28.

此一單位使 star-forcing threshold 從 1616 降至 1515


5.7 黑箱結果升級為精確證書

初始有限核心只得到 MILP infeasible。

最後改成有理對偶權重:

AFyA1,\sum_{A\in\mathcal F}y_A\le1,

而:

AyA>r7.\sum_Ay_A>r-7.

所以有限核心可以被獨立逐項檢查。


6. 這些摩擦是否能證明「真的重新推演」?

不能完全證明。

一個極強生成系統理論上可以生成:

  • 假錯誤;
  • 假修正;
  • 假研究日誌;
  • 看似路徑依賴的文本。

因此:

摩擦是證據,不是決定性證明。\boxed{ \text{摩擦是證據,不是決定性證明。} }

但證據強度會隨以下條件增加:

  1. 錯誤在當時確實未被預知;
  2. 修正改變後續搜索空間;
  3. 工具輸出具有時間戳;
  4. 程式可重跑;
  5. 後續命題依賴先前局部失敗;
  6. 新穎性審計降低而非放大主張;
  7. 不同 Agent 能從中間 checkpoint 接續;
  8. 原始版本與修改版本均被保存。

7. 路徑依賴作為外部證據

7.1 研究路徑

令:

ΠT=(m0,m1,,mT)\Pi_T = ( m_0,m_1,\dots,m_T )

為訊息與工具紀錄序列。

若後續狀態:

St+1\mathcal S_{t+1}

包含只可能由早期局部結果生成的資訊,例如:

  • 特定反例;
  • 特定常數修正;
  • 特定有限核心;
  • 特定 verifier 輸出;

則路徑具有:

PathDependence(ΠT)>0.\operatorname{PathDependence}(\Pi_T)>0.

7.2 反事實測試

可以移除某個關鍵 checkpoint:

mjm_j

再讓另一 Agent 接續。

若缺少該 checkpoint 時:

  • 搜索重複舊錯誤;
  • 無法重現後續壓縮;
  • 產生不同研究狀態;

則表示該訊息不是純粹敘事冗餘,而具有研究因果作用。


7.3 注意限制

路徑依賴仍不能證明模型主觀上「第一次想到」。

它只能證明:

此研究工件對後續搜索有外部可測的資訊作用。


8. 七個常見懷疑與回應

8.1 「模型只是背過標準證明」

可能。

因此標準 Tucker、Lovász、Schrijver 路線應標記為:

Reconstruction.\mathrm{Reconstruction}.

但後續方法族淘汰、有限核心壓縮與 verifier 仍需分別評估。


8.2 「它只是事後編故事」

若只有一份最後答案,這個質疑很強。

若有:

  • 原始時序訊息;
  • 中間程式;
  • 當輪輸出;
  • 失敗版本;
  • 後續修正;

則「純事後敘事」的空間會縮小,但不會完全歸零。


8.3 「真正做工作的是求解器」

工具確實做了部分計算。

但研究活動包括:

  • 決定算什麼;
  • 將無限問題有限化;
  • 設計 block 類型;
  • 生成對偶證書;
  • 解讀反例;
  • 根據輸出更新理論。

所以正確描述是:

Agent+solver+human direction\text{Agent} + \text{solver} + \text{human direction}

的混合研究系統,而非單一主體神話。


8.4 「有限計算不是一般證明」

正確。

因此本文只讓有限 verifier 負責:

10r1410\le r\le14

等明確有限範圍。

一般範圍由解析容量不等式與 star peeling 負責。


8.5 「人類一直在引導,所以不是自主研究」

本實驗不是全自主 benchmark。

使用者提供了:

  • 持續推進要求;
  • 三軌並行策略;
  • 對過早收斂的修正;
  • 對方法論目標的設定。

因此應稱為:

human-guided autonomous research loop\boxed{ \text{human-guided autonomous research loop} }

而不是完全無人介入的 autonomous discovery。


8.6 「結果已被別人證明,所以沒有價值」

若唯一價值是首證,則價值確實下降。

但仍可能存在:

  • 替代證明;
  • 新的 proof-engineering 路線;
  • 可重用 verifier;
  • 更好的研究 benchmark;
  • 方法論證據;
  • 可繼承研究狀態。

8.7 「你們只是要求讀者相信對話是真的」

任何實驗紀錄都需要最低信任條件。

但可透過:

  • 時間戳;
  • 雜湊;
  • 原始檔;
  • 公開版本庫;
  • 重跑腳本;
  • 第三方驗證;

將:

請相信我們\text{請相信我們}

轉換為:

請重驗這些工件。\boxed{ \text{請重驗這些工件。} }

9. 五種獨立價值

9.1 數學有效性

VmathV_{\mathrm{math}}

由證明或反例決定。


9.2 證明工程價值

VPEV_{\mathrm{PE}}

來自候補生成、依賴拆分、有限核心與證書。


9.3 負結果價值

VnegV_{\mathrm{neg}}

來自被否定的方法族。


9.4 Benchmark 價值

VbenchV_{\mathrm{bench}}

來自可供其他 Agent 重跑的完整研究路徑。


9.5 語料與繼承價值

VtraceV_{\mathrm{trace}}

來自可被後續 Agent 解碼與接續的研究狀態。

總價值不應只寫成:

V=Vnovelty.V=V_{\mathrm{novelty}}.

更合理的是:

V=f(Vmath,VPE,Vneg,Vbench,Vtrace).\boxed{ V = f( V_{\mathrm{math}}, V_{\mathrm{PE}}, V_{\mathrm{neg}}, V_{\mathrm{bench}}, V_{\mathrm{trace}} ). }

10. 最小認識論立場

本文不要求讀者接受:

「AI 真正像人類一樣思考了。」\boxed{ \text{「AI 真正像人類一樣思考了。」} }

只要求考慮以下較弱命題:

命題一:來源不確定性不消除結果驗證

¬Know(O)⇏¬R.\neg\operatorname{Know}(\mathsf O) \not\Rightarrow \neg\mathsf R.

命題二:來源不確定性不消除過程價值

¬Know(O)⇏¬P.\neg\operatorname{Know}(\mathsf O) \not\Rightarrow \neg\mathsf P.

命題三:可執行工件比自我敘述更強

Eartifact>Eself report.E_{\mathrm{artifact}} > E_{\mathrm{self\ report}}.

命題四:保存錯誤可增加研究價值

若:

Ft\mathcal F_t

能降低後續重複搜索,則:

V(ΠT)>V(final answer only).V(\Pi_T) > V(\text{final answer only}).

11. 更嚴格的未來實驗設計

11.1 預註冊

研究開始前公開:

  • 目標;
  • 可用工具;
  • 停止條件;
  • 成功與失敗標準。

11.2 階段雜湊承諾

每輪保存:

ht=H(mt,Ct,Ft,Dt).h_t = H( m_t, C_t, F_t, D_t ).

後續不得重寫早期狀態。


11.3 資訊隔離

將角色分成:

  • Generator;
  • Verifier;
  • Literature Auditor;
  • Novelty Auditor。

Generator 不得看到已知證明。


11.4 隱名目標

隱去:

  • 定理名稱;
  • 作者;
  • 年份;
  • 領域提示;
  • 標準引理名稱。

11.5 反事實接棒

讓不同 Agent 從:

St\mathcal S_t

接續,測試:

  • 是否避免已知失敗;
  • 是否能使用中介命題;
  • 是否重現核心證書;
  • 是否產生相似後續壓縮。

11.6 可執行依賴圖

每個節點標記:

  • Known;
  • Proposed;
  • Computed;
  • Refuted;
  • Filled;
  • Novelty uncertain。

12. 可證偽條件

本文的認識論主張並非不可反駁。

若出現以下情況,路徑價值應下降:

  1. 程式無法重跑;
  2. 輸出與論文敘述不一致;
  3. 關鍵反例不存在;
  4. 修正未實際影響後續路線;
  5. 所謂新中介命題只是標準證明的改名;
  6. 時序紀錄顯示事後插入;
  7. 新 Agent 無法從保存狀態接續;
  8. 文獻審計顯示完整路徑早已逐字存在;
  9. 有限證書依賴未公開浮點誤差;
  10. 解析引理無法獨立通過逐型檢查。

13. 研究誠信的分級表述

建議未來對 AI 數學結果使用以下標記:

Level 0:Unverified Output

只有答案,無過程與證書。

Level 1:Reconstructed Known Route

可驗證,但高度可能來自既有知識。

Level 2:Auditable Process

包含失敗、程式、反例與修正。

Level 3:Contamination-Controlled Reconstruction

具有資訊隔離與預註冊。

Level 4:Independent Alternative Proof Candidate

結果已知,但路線可能獨立。

Level 5:Novel Result Candidate

完成文獻審計,但尚未同行確認。

Level 6:Externally Verified New Result

經獨立重驗與公開審查。

本案例較合理的整體標記是:

Level 2–4,依不同子結果而異。\boxed{ \text{Level 2–4,依不同子結果而異。} }

14. 本案例究竟證明了什麼?

它沒有證明:

AI 必然可以自主解決開放問題。\text{AI 必然可以自主解決開放問題。}

它也沒有證明:

所有中間步驟皆為純推演。\text{所有中間步驟皆為純推演。}

它較有力地支持:

AI、人類與工具可以形成可持續、自我修正、可審計的研究循環。\boxed{ \text{AI、人類與工具可以形成可持續、自我修正、可審計的研究循環。} }

並且:

即使最終結果已知,重新走過的路徑仍能產生新的研究工件與方法資訊。\boxed{ \text{即使最終結果已知,重新走過的路徑仍能產生新的研究工件與方法資訊。} }

15. 與第三篇的關係

本篇只處理:

為什麼一條無法完全證明其內部來源的 AI 研究路徑,仍可能具有外部價值?

下一篇將處理另一個問題:

這些訊息、錯誤、程式、證明義務與依賴圖,如何被編碼為可由下一個 Agent 直接接棒的研究狀態?

因此:

本篇=路徑價值的認識論辯護,\text{本篇} = \text{路徑價值的認識論辯護}, 下一篇=路徑繼承的系統理論.\text{下一篇} = \text{路徑繼承的系統理論}.

16. 結論

對 AI 數學研究最簡單的懷疑是:

它只是記得。

這個懷疑可能在部分情況下成立。

但它不足以終結討論。

真正需要分開的是:

它如何產生\text{它如何產生} 它留下什麼\text{它留下什麼} 它是否正確.\text{它是否正確}.

即:

OPR.\boxed{ \mathsf O \neq \mathsf P \neq \mathsf R. }

在本案例中,我們無法完全證明所有步驟都是純粹重新推演。

但我們可以檢查:

  • 哪些命題被提出;
  • 哪些方法被反例淘汰;
  • 哪些漏洞被修正;
  • 哪些程式被執行;
  • 哪些常數被重算;
  • 哪些有限證書可重驗;
  • 哪些新穎性主張被主動降低。

所以更合理的評估原則是:

不要只問「它是不是記得」;\boxed{ \text{不要只問「它是不是記得」;} } 還要問「這條路徑是否可重驗、可修正、可使用」。\boxed{ \text{還要問「這條路徑是否可重驗、可修正、可使用」。} }

本文最終主張:

AI 研究的可信度不應建立在相信其內心,\boxed{ \text{AI 研究的可信度不應建立在相信其內心,} } 而應建立在檢查其留下的研究工件。\boxed{ \text{而應建立在檢查其留下的研究工件。} }

附錄 A:本案例的關鍵可審計痕跡

  1. 基本容量與譜界尺度不足;
  2. Tucker 路線重建;
  3. Schrijver 核心的小參數辨認;
  4. 區塊數—根數橋樑;
  5. s>2s>2 單 carrier 失敗;
  6. 多 carrier 覆蓋與反足衝突;
  7. selector 精確不可行;
  8. atlas 塌縮;
  9. triangle-supported 漏洞;
  10. triangle/singleton 修正;
  11. k=2k=2 exact cover verifier;
  12. 14 型 intersecting 3-family 模板吸收;
  13. 23-core 壓縮;
  14. 3r273r283r-27\rightarrow3r-28
  15. 10r1410\le r\le14 有理對偶證書;
  16. star peeling;
  17. 新穎性降級。

附錄 B:認識論狀態標記

  • O?:來源未知;
  • M:可能含既有記憶;
  • R:已知路線重建;
  • P:可觀測研究過程;
  • V:結果可驗證;
  • A:可執行工件存在;
  • C:污染受控;
  • N?:新穎性未決;
  • F:已被外部重驗。

附錄 C:最低信任前提

本文仍需要最低限度接受:

  1. 所展示的對話與工具輸出確實存在;
  2. 時序未被任意改寫;
  3. 程式檔與輸出相符;
  4. 引用文獻沒有被故意錯置;
  5. 研究者願意公開足夠工件供第三方檢驗。

若連這些最低前提都完全拒絕,則不只 AI 研究,任何實驗日誌、版本控制與研究筆記都無法建立證據效力。


附錄 D:研究誠信聲明

  1. 本文不宣稱能讀取或證明模型內部思考來源。
  2. 本文不將連貫自然語言自動視為真實歷史。
  3. 本文接受模型可能重建訓練資料中的已知路線。
  4. 本文將已知重建、候選替代證明與新穎結果分級。
  5. 本文要求所有數學結論接受獨立驗證。
  6. 本文認為失敗路徑只有在可影響後續搜索時才具研究價值。
  7. 本文主張可重跑工件高於模型自我敘述。
  8. 本文不以 AI 主觀性作為論證前提。
  9. 本文支持公開原始訊息、程式、輸出、時間戳與雜湊。
  10. 本文將認識論不確定性視為需要管理的條件,而不是抹除全部研究價值的理由。