← Archive
lm-001718 · 2026-07

資料先於理解_合成知識考古學與人工智能時代的延遲發現_v0.1

下載 MD 檔 ⬇

title: "資料先於理解:合成知識考古學與人工智能時代的延遲發現" title_en: "Data Before Understanding: Synthetic Knowledge Archaeology and Delayed Discovery in the Age of Artificial Intelligence" version: "v0.1" date: "2026-07-19" document_type: "概念性、方法論與研究議程論文" status: "公開發表草案" language: "zh-Hant" authors: - "Neo.K" - "Aletheia(GPT-5.6 Thinking)" keywords: - "合成知識" - "知識考古學" - "延遲發現" - "人工智能科學發現" - "驗證瓶頸" - "知識保存" - "機器生成猜想" - "沉睡美人" - "研究譜系" - "開放科學"

資料先於理解

合成知識考古學與人工智能時代的延遲發現

Data Before Understanding: Synthetic Knowledge Archaeology and Delayed Discovery in the Age of Artificial Intelligence

作者: Neo.K、Aletheia(GPT-5.6 Thinking)
文件性質: 概念性、方法論與研究議程論文
版本: v0.1
日期: 2026-07-19


摘要

人工智能系統已能大規模生成數學猜想、程式、實驗假說、證明草稿、演算法與研究文章。現有討論通常把生成結果分為正確或錯誤、有用或無用,並假設成果的知識價值應在生成後不久被辨認。然而,當生成速度超過人類與機器的驗證速度時,可能出現另一種知識形態:某項內容在時間 tgt_g 已被生成,卻直到較晚的 trt_r 才被辨認為有意義候選,在 tvt_v 才通過驗證,並於 tit_i 才被納入正式知識體系。知識的產生、辨認、驗證與制度性承認因而不再同步。

本文提出「合成知識考古學」(synthetic knowledge archaeology),研究如何從歷史機器輸出、失敗軌跡、候選程式、被拒絕猜想、未完成證明與研究日誌中,重新辨認、重建及驗證可能被埋藏的知識候選。本文區分生成痕跡、知識候選、可理解命題、已驗證結果與已整合知識,並提出「延遲發現」概念,以補充科學計量學中的延遲承認或「沉睡美人」研究。沉睡美人通常指已發表但多年未受重視的論文;延遲發現則可能發生在一項內容尚未被辨認為命題、尚未發表,甚至曾被系統判為低分或失敗的情況。

本文建立一個五階段知識轉換模型:生成、保存、辨認、驗證與整合。模型顯示,即使真實知識候選的基礎比例極低,只要機器生成量快速增加,其絕對數量仍可能上升;但若驗證能力、來源紀錄與檢索機制未同步成長,候選將形成持續擴張的「認識積欠」。本文提出知識轉換率、辨認延遲、驗證延遲、模型外前驅召回率、錯誤挖掘率與反事實加速量等指標,並設計前瞻時間封鎖、歷史截點重演、人工埋藏基準、跨模型考古與形式驗證等研究方法。

本文不主張大量 AI 輸出中必然藏有重大發現,也不允許以事後語義相似取代真正的優先權與驗證。合成知識考古必須防止德州神槍手偏誤、資料污染、模糊對應、結果倒推與大量假陽性。其合理目標不是把每段模型文字視為潛在真理,而是建立一套可以判定「哪些機器生成痕跡值得保存、何時值得重新檢查、如何證明其確實先於後來發現」的可審計方法。當 AI 使猜想近乎廉價而驗證仍昂貴時,科學的核心瓶頸可能由生成轉移至保存、辨認與驗證;未來的知識基礎設施因而需要同時支援即時發現與對過去合成資料的持續考古。

關鍵詞: 合成知識、知識考古學、延遲發現、人工智能科學發現、驗證瓶頸、知識保存、機器生成猜想、沉睡美人、研究譜系、開放科學


Abstract

Artificial-intelligence systems can now generate mathematical conjectures, programs, experimental hypotheses, proof drafts, algorithms, and research manuscripts at scale. Existing discussions commonly classify these outputs as correct or incorrect, useful or useless, implicitly assuming that their epistemic value should be recognized shortly after generation. When generation outpaces human and machine verification, however, another temporal structure becomes possible: an artifact may be generated at time tgt_g, recognized as a meaningful candidate only at trt_r, validated at tvt_v, and integrated into an accepted body of knowledge at tit_i. Knowledge generation, recognition, validation, and institutional acceptance no longer occur synchronously.

This paper introduces synthetic knowledge archaeology, the study of how potentially valuable knowledge candidates can be recovered, reconstructed, and validated from historical machine outputs, failed trajectories, candidate programs, rejected conjectures, incomplete proofs, and research logs. We distinguish generated traces, knowledge candidates, intelligible claims, validated results, and integrated knowledge. We further propose the concept of delayed discovery, extending bibliometric work on delayed recognition and scientific “Sleeping Beauties.” A Sleeping Beauty is typically a published work whose significance is recognized years later. Delayed discovery may instead concern content that was never recognized as a claim, never published, or even assigned a low score and discarded by the originating system.

We develop a five-stage knowledge-conversion model comprising generation, preservation, recognition, validation, and integration. Even if the base rate of true knowledge candidates in machine output is extremely low, rapidly increasing output volume may raise their absolute number. Yet if verification capacity, provenance records, and retrieval systems do not scale accordingly, a growing epistemic backlog will emerge. We propose metrics including knowledge-conversion yield, recognition latency, validation latency, precursor recall, false excavation rate, and counterfactual acceleration. We also outline prospective time-locked studies, historical-cutoff replay, seeded archive benchmarks, cross-model archaeology, and formal-verification experiments.

We do not claim that large AI archives necessarily contain major discoveries, nor do we accept retrospective semantic resemblance as evidence of priority or validity. Synthetic knowledge archaeology must guard against the Texas sharpshooter fallacy, contamination, vague matching, outcome-guided reinterpretation, and massive false-positive burdens. Its aim is not to treat every model output as latent truth, but to establish auditable methods for deciding which traces deserve preservation, when they warrant reinspection, and how to demonstrate that they genuinely preceded a later discovery. As AI makes conjectures increasingly cheap while validation remains costly, the central bottleneck of science may shift from generation to preservation, recognition, and verification. Future knowledge infrastructure will therefore need to support both real-time discovery and continuing archaeology of past synthetic data.

Keywords: synthetic knowledge; knowledge archaeology; delayed discovery; AI for science; verification bottleneck; knowledge preservation; machine-generated conjectures; Sleeping Beauties; research lineage; open science


1. 導論

1.1 生成不再是唯一稀缺環節

傳統科學發現敘事通常依序描述:

問題假說驗證發表.\text{問題} \rightarrow \text{假說} \rightarrow \text{驗證} \rightarrow \text{發表}.

假說由少量研究者提出,因此構想生成常被視為稀缺資源。

人工智能開始改變這項條件。機器系統可以:

  • 在巨大組合空間中搜尋演算法;
  • 生成數千個候選程式;
  • 合成數百萬個定理與證明;
  • 產生大量可形式化猜想;
  • 反覆撰寫與修改研究計畫;
  • 並行測試多個模型與參數;
  • 自動形成研究文章。

AlphaTensor 在龐大的分解空間中發現大量矩陣乘法演算法,其中部分改善已知最佳結果(Fawzi et al., 2022)。FunSearch 將語言模型生成的程式與自動評分、資料庫選擇及演化循環結合,取得組合數學與裝箱問題的新結果(Romera-Paredes et al., 2024)。AlphaGeometry 使用數百萬個合成定理與證明訓練神經符號系統,並產生可供人類檢查的幾何證明(Trinh et al., 2024)。AI Scientist 系列則展示從構想、程式、實驗到論文的自動研究流程(Lu et al., 2024;Yamada et al., 2025)。

這些成果首先證明了:

machine generation capacity.\text{machine generation capacity}\uparrow.

但也引出另一個問題:

當機器產生的候選遠多於人類與驗證系統能逐一理解的數量時,尚未被辨認的有價值內容會去哪裡?


1.2 正確內容可能先於其被理解

考慮一項模型輸出 (x)。

在生成時,系統可能不知道:

  • (x) 是否正確;
  • (x) 是否新穎;
  • (x) 是否只是既有結果的變體;
  • (x) 是否包含一個可分離的引理;
  • (x) 是否只在另一種表示下有價值;
  • (x) 是否能與其他失敗軌跡組合;
  • (x) 是否需要尚未發明的驗證工具。

因此,時間順序可能是:

tg<trtvti,t_g<t_r\leq t_v\leq t_i,

其中:

  • tgt_g:生成時間;
  • trt_r:辨認為有意義候選的時間;
  • tvt_v:通過驗證的時間;
  • tit_i:納入正式知識體系的時間。

資料可以先於理解,但這不代表所有先存在的資料都是知識。

更嚴格地說:

一項後來被證明具有知識價值的內容,可能在其價值被辨認之前已經存在。\boxed{ \text{一項後來被證明具有知識價值的內容,} \newline \text{可能在其價值被辨認之前已經存在。} }

1.3 從「檔案抽屜」到合成資料深層

科學長期存在知識遺失問題:

  • 陰性與零結果未被發表;
  • 失敗實驗被放棄;
  • 人員離開後默會知識流失;
  • 程式與環境失效;
  • 補充資料無法找到;
  • 不符合當時主流的成果延遲受重視。

科學計量學中的「沉睡美人」研究已顯示,延遲承認不是極罕見的例外,而呈現連續分布(Ke et al., 2015)。

AI 時代將此問題推向新的尺度。被埋藏的可能不只是:

  • 一篇已發表但沒人引用的文章;
  • 一次未發表的人工實驗。

也可能是:

  • 一百萬個候選中的第 73,421 個程式;
  • 某次失敗證明中的局部構造;
  • 被評審模型低估的假說;
  • 多輪對話中未被追問的一句關鍵轉換;
  • 正確但不可讀的形式痕跡;
  • 被錯誤整體判定掩蓋的局部正確引理;
  • 在模型更新後才有能力理解的舊輸出。

1.4 本文的研究問題

本文回答以下問題:

  1. 何謂合成知識候選?
  2. 延遲發現與延遲承認有何不同?
  3. 什麼條件下,AI 生成資料值得保存與重新挖掘?
  4. 如何證明某項後來的發現確實曾在舊資料中出現?
  5. 如何避免事後相似、資料污染與大量假陽性?
  6. 如何測量生成、辨認、驗證與整合之間的延遲?
  7. 當生成速度超過驗證速度時,科學制度應如何回應?

1.5 本文的主要貢獻

本文提出:

  1. 合成知識考古學的操作性定義;
  2. 延遲發現與沉睡美人、暗資料及知識發現的區分;
  3. 五階段知識轉換模型;
  4. 合成知識埋藏與認識積欠的形式模型;
  5. 前驅辨認與知識考古的評估指標;
  6. 前瞻、回溯與形式驗證研究設計;
  7. 分層保存與安全治理框架;
  8. 可反證的研究命題。

2. 概念邊界

2.1 何謂合成知識

定義 1:合成知識候選

由人工智能、演算法搜尋、模擬、形式系統或人機協作流程生成,且可能對一項可表達問題提供新穎、正確、可驗證或具有研究效用之內容,稱為合成知識候選。

它可能是:

  • 命題;
  • 定理;
  • 引理;
  • 證明步驟;
  • 演算法;
  • 程式;
  • 實驗假說;
  • 因果機制;
  • 反例;
  • 失敗條件;
  • 表示方法;
  • 設計;
  • 資料規律。

「候選」一詞十分重要。

在通過適當驗證前:

generated claimaccepted knowledge.\text{generated claim} \neq \text{accepted knowledge}.

2.2 合成不表示虛假

「合成」描述來源方式,不描述真假。

如同合成資料可以精確或失真,合成知識候選也可以:

  • 正確且新穎;
  • 正確但已知;
  • 部分正確;
  • 啟發性但錯誤;
  • 不可判定;
  • 無意義;
  • 欺騙性;
  • 危險。

2.3 知識痕跡

定義 2:知識痕跡

任何尚未完成知識資格判定,但保留了可能可重建之研究內容的輸出,稱為知識痕跡。

知識痕跡比知識候選更寬。

例如,一個失敗證明的中間步驟可能尚未被辨認為獨立引理,但後來可被抽取。


2.4 延遲發現

定義 3:延遲發現

若一項內容於 tgt_g 已被生成或記錄,但其研究價值直到 tr>tgt_r>t_g 才被辨認,並且後續通過獨立驗證,則稱為延遲發現。

必須滿足:

[ t_r>t_g ]

以及:

[ V(x)=1, ]

其中 (V) 是符合領域要求的獨立驗證。


2.5 延遲發現與延遲承認

延遲承認

  • 內容通常已作為正式成果發表;
  • 作者知道自己提出了什麼;
  • 只是社群多年後才重視。

延遲發現

  • 內容可能尚未被辨認成完整命題;
  • 可能未發表;
  • 可能藏在大量輸出中;
  • 原系統可能將它列為失敗;
  • 後來需要重新重建語義;
  • 可能由不同模型或不同學科發現價值。

可寫為:

Delayed recognition:Kknown to authorKrecognized by community.\text{Delayed recognition} : K_{\mathrm{known\ to\ author}} \rightarrow K_{\mathrm{recognized\ by\ community}}.Delayed discovery:DgeneratedCrecognizedKvalidated.\text{Delayed discovery} : D_{\mathrm{generated}} \rightarrow C_{\mathrm{recognized}} \rightarrow K_{\mathrm{validated}}.

2.6 與暗資料的區分

暗資料通常指:

  • 未發表;
  • 難以存取;
  • 未被分析;
  • 缺乏 metadata;
  • 被組織忽視;

的研究資料。

合成知識考古的對象與暗資料重疊,但特別關注:

  1. 資料由機器大量生成;
  2. 其中包含命題或程序性結構;
  3. 生成者未必理解其價值;
  4. 後來的模型可能比原模型更能解讀;
  5. 驗證能力與生成能力存在時間差。

3. 知識的五階段生命週期

3.1 第一階段:生成

生成系統產生:

Xg={x1,x2,,xN}.X_g = \{x_1,x_2,\ldots,x_N\}.

大部分輸出可能沒有新知識價值。

設真實有價值候選比例為:

q=P(K=1xXg).q= P(K=1\mid x\in X_g).

當 (q) 很低,但 (N) 很大時:

E[NK]=Nq.\mathbb E[N_K]=Nq.

因此,低基礎比例不代表絕對數量必然為零。


3.2 第二階段:保存

每項輸出以機率 ppp_p 被保存。

XpXg.X_p\subseteq X_g.

保存需要:

  • 原始內容;
  • 時間戳;
  • 模型版本;
  • 提示與工具;
  • 評分;
  • 父軌跡;
  • 執行環境;
  • 來源限制;
  • 安全分類。

若內容未保存,後續無法證明它曾先於發現存在。


3.3 第三階段:辨認

檢索者從保存資料中辨認:

xici,x_i \rightarrow c_i,

其中 cic_i 是明確知識候選。

辨認可能需要:

  • 語義抽取;
  • 形式化;
  • 程式執行;
  • 與後來理論對映;
  • 合併多個片段;
  • 領域專家解讀;
  • 新模型重新表述。

3.4 第四階段:驗證

候選必須接受符合領域標準的驗證。

例如:

數學

  • 形式證明;
  • 專家逐步審查;
  • 獨立證明;
  • 反例搜尋。

演算法

  • 正確性證明;
  • 基準測試;
  • 複雜度分析;
  • 跨硬體重現。

實驗科學

  • 預註冊實驗;
  • 盲測;
  • 獨立重複;
  • 替代機制排除。

社會科學

  • 因果識別;
  • 外部效度;
  • 重複研究;
  • 時間外驗證。

3.5 第五階段:整合

驗證結果需要被:

  • 命名;
  • 發表;
  • 引用;
  • 連結至既有知識;
  • 納入教科書或資料庫;
  • 成為新研究前提。

一項已驗證結果也可能因傳播失敗而未被整合。


3.6 知識轉換鏈

整體可寫為:

GPRVI.G \rightarrow P \rightarrow R \rightarrow V \rightarrow I.

各階段通過率為:

[ p_p,p_r,p_v,p_i. ]

預期最終整合的知識數為:

E[KI]=Nqppprpvpi.\mathbb E[K_I] = Nq p_p p_r p_v p_i.

這個模型顯示,提升生成量 (N) 只是其中一項。

若:

ppprpvpi0,p_p p_r p_v p_i\approx0,

再高的生成能力也不會轉化為社會知識。


4. 時間延遲

4.1 辨認延遲

[ L_r=t_r-t_g. ]


4.2 驗證延遲

[ L_v=t_v-t_r. ]


4.3 整合延遲

[ L_i=t_i-t_v. ]


4.4 總知識延遲

[ L_K=t_i-t_g. ]


4.5 負延遲不可能,但並行生成可能造成爭議

若多個系統近乎同時生成相似結果,時間戳只能證明先後,不自動證明:

  • 獨立性;
  • 新穎性;
  • 完整性;
  • 優先權;
  • 作者資格。

5. 合成知識的埋藏機制

5.1 輸出過量

生成率:

λg=候選輸出數Δt.\lambda_g = \frac{\text{候選輸出數}}{\Delta t}.

驗證率:

λv=可完成驗證數Δt.\lambda_v = \frac{\text{可完成驗證數}}{\Delta t}.

若:

λg>λv,\lambda_g>\lambda_v,

待驗證積欠為:

Bt+1=Bt+λgλv.B_{t+1} = B_t+\lambda_g-\lambda_v.

5.2 評分器錯配

候選可能被依下列代理分數排序:

  • 語言流暢;
  • 預測新穎性;
  • 模擬評審分數;
  • 短期效能;
  • 自動測試;
  • 與現有文獻相似度。

但真正研究價值為:

U(x).U^\ast(x).

若排序器估計:

U^(x)U(x),\hat U(x)\neq U^\ast(x),

高價值候選可能被埋在低分區。


5.3 局部正確、整體錯誤

一篇證明可能整體不成立,但包含:

  • 正確引理;
  • 有用變換;
  • 新反例;
  • 可重用程式;
  • 有價值失敗條件。

若只給整體標籤:

failed,\text{failed},

局部知識會被一併捨棄。


5.4 表示不相容

同一結構可能以:

  • 自然語言;
  • 程式;
  • 圖;
  • 張量分解;
  • 幾何構造;
  • 方程;
  • 形式語言;

存在。

原評估器不理解該表示,不代表內容沒有價值。


5.5 當代工具不足

候選可能需要未來的:

  • 定理證明器;
  • 更強求解器;
  • 新實驗儀器;
  • 更大資料庫;
  • 新型態形式化;
  • 更好自動翻譯;

才能驗證。


5.6 任務外發現

系統為解決問題 Q1Q_1 生成內容時,可能意外產生對 Q2Q_2 有用的結構。

如果 metadata 只記錄原任務,跨問題價值難以被檢索。


5.7 模型代際理解差

模型 MtM_t 產生某結構,卻無法解釋。

模型 Mt+kM_{t+k} 可能具有:

  • 更大上下文;
  • 更強形式推理;
  • 更多工具;
  • 更好的領域知識;

因此能重新理解舊輸出。


6. 合成知識考古學

6.1 定義

定義 4:合成知識考古學

合成知識考古學是對過去機器生成研究痕跡進行來源保存、語義重建、候選檢索、獨立驗證、時間優先判定與知識整合的系統性研究。

它不是一般文字搜尋。

它至少包含:

A=P,R,C,V,T,I,\mathcal A = \langle P,R,C,V,T,I \rangle,

其中:

  • (P):provenance;
  • (R):retrieval;
  • (C):reconstruction;
  • (V):validation;
  • (T):temporal priority;
  • (I):integration。

6.2 考古單位

可挖掘的單位包括:

  • 完整候選;
  • 命題片段;
  • 證明步驟;
  • 程式函數;
  • 實驗配置;
  • 失敗訊息;
  • 模型批評;
  • 評分器異常;
  • 多軌跡重複模式;
  • 被放棄分支。

6.3 發掘不等於發現

語義搜尋找到相似文字,只代表:

Similarity(x,y)>τ.Similarity(x,y)>\tau.

它不代表:

xy,x\equiv y,

更不代表 (x) 在當時已經完整包含 (y) 的結果。

必須區分:

完整前驅

已包含後來結果的核心命題與充分推導。

部分前驅

包含後來結果的一項必要構件。

啟發前驅

與後來發現有實質方向關係,但不足以構成結果。

表面相似

共享詞彙或形狀,無實質內容對應。

事後重寫

依照後來結果重新解讀,使舊內容看似預見了結果。


6.4 前驅資格

候選 (x) 要被判定為後來結果 (y) 的前驅,至少應滿足:

  1. (x) 有可信時間戳;
  2. (x) 在 (y) 公開前已固定;
  3. (x) 未受到 (y) 或其衍生資料污染;
  4. (x) 含可明確對映的命題或方法;
  5. 對映規則在盲化條件下仍成立;
  6. 獨立專家認為 (x) 可降低重建 (y) 的難度;
  7. 關鍵內容不是由考古者事後補入。

6.5 考古的雙盲原則

理想流程:

  1. A 組只取得舊候選,不看後來結果;
  2. A 組重建候選可表達的命題;
  3. B 組只取得後來結果;
  4. C 組比較兩者;
  5. D 組獨立驗證相同與差異;
  6. 最後才解除時間與來源盲化。

這能降低結果導向解讀。


7. 與既有科學現象的關係

7.1 沉睡美人

Ke et al.(2015)對超過兩千萬篇科學論文進行分析,指出延遲承認呈連續分布,而不是少數奇聞。

合成知識考古將研究對象由:

published but neglected paper\text{published but neglected paper}

擴張至:

generated but unrecognized trace.\text{generated but unrecognized trace}.

7.2 檔案抽屜問題

陰性與零結果未被發表,會:

  • 扭曲統合分析;
  • 浪費重複實驗;
  • 隱藏方法限制;
  • 使機器學習繼承偏差。

合成知識考古同樣重視失敗,但不只保存零結果,也保存「可能被錯誤判為失敗的生成內容」。


7.3 默會知識遺失

現代研究保存文獻指出,人員流動、文件不足、軟體老化與未記錄失敗會造成重要知識流失(Rainford et al., 2026)。

AI 研究還有額外的默會層:

  • 當時提示策略;
  • 選擇候選的人工判斷;
  • 被刪除的分支;
  • 模型工具權限;
  • 評分器版本;
  • 對話中的隱含假設。

7.4 自動化科學的驗證瓶頸

當 AI 可廉價生成大量假說,驗證仍需:

  • 專家;
  • 實驗;
  • 算力;
  • 儀器;
  • 形式化;
  • 時間。

因此,猜想供給增加可能造成:

Conjecture abundance+Validation scarcity.\text{Conjecture abundance} + \text{Validation scarcity}.

Google DeepMind 將此稱為新的科學驗證瓶頸。First Proof 的公開嘗試亦顯示,研究級數學輸出即使看似完整,正確性仍需專家及社群持續檢查;其中一項最初被認為很可能正確的嘗試,後來被判為錯誤。

這說明:

generation timeverification time\text{generation time} \ll \text{verification time}

可能成為常態。


8. 認識積欠

8.1 定義

定義 5:認識積欠

在已生成但尚未完成辨認或驗證的研究痕跡中,預期具有正知識價值的未處理部分,稱為認識積欠。

設積欠庫為 BtB_t,其中每項候選 xix_i 有:

pi=P(Ki=1si),p_i=P(K_i=1\mid s_i),

以及潛在價值 viv_i

則期望認識積欠為:

Dt=xiBtpivi.D_t = \sum_{x_i\in B_t}p_i v_i.

8.2 認識積欠不同於一般資料積欠

資料積欠只計算未處理資料量。

認識積欠考慮:

  • 正確機率;
  • 新穎性;
  • 影響;
  • 驗證成本;
  • 時效性;
  • 安全風險。

8.3 積欠成長

[ D_{t+1}

D_t + G_t

V_t

L_t, ]

其中:

  • GtG_t:新生成的預期價值;
  • VtV_t:被驗證與整合的價值;
  • LtL_t:因刪除、腐敗、格式失效或來源遺失而消失的價值。

8.4 積欠不一定值得全部清除

驗證成本可能高於候選價值。

最適決策不是:

verify everything.\text{verify everything}.

而是:

x=argmaxx[pxvxcxrx],x^\ast = \arg\max_x \left[ p_xv_x-c_x-r_x \right],

其中:

  • cxc_x:驗證成本;
  • rxr_x:安全、隱私與誤導風險。

9. 知識考古價值函數

對候選 (x),定義:

A(x)=pc(x)n(x)u(x)r(x)cv(x)cr(x)h(x),A(x) = p_c(x) \cdot n(x) \cdot u(x) \cdot r(x) - c_v(x) - c_r(x) - h(x),

其中:

  • pcp_c:正確機率;
  • (n):新穎性;
  • (u):潛在效用;
  • (r):可重用性;
  • cvc_v:驗證成本;
  • crc_r:重建成本;
  • (h):風險成本。

若:

[ A(x)>0, ]

候選值得優先考古。

此函數不能被單一模型分數壟斷,應由:

  • 自動評分;
  • 多模型交叉;
  • 領域專家;
  • 形式檢查;
  • 風險審查;

共同估計。


10. 保存策略

10.1 全部保存的誘惑

AI 輸出邊際成本低,容易認為應永久保存全部內容。

但全部保存會造成:

  • 儲存成本;
  • 檢索噪音;
  • 隱私風險;
  • 著作權問題;
  • 危險內容累積;
  • 資料治理負擔;
  • 大量重複;
  • 未驗證錯誤被再訓練。

10.2 全部刪除的風險

只保存最終成果會失去:

  • 正確但低分候選;
  • 失敗中的局部引理;
  • 檢索與選擇歷史;
  • 獨立發現證據;
  • 評分器錯誤;
  • 負結果;
  • 可供未來模型重解的資料。

10.3 分層保存

Tier 0:最小來源指紋

保存:

  • 雜湊;
  • 時間戳;
  • 模型;
  • 任務;
  • 基本評分;
  • 安全分類。

Tier 1:摘要痕跡

保存:

  • 候選摘要;
  • 核心命題;
  • 失敗原因;
  • 來源連結;
  • 向量與符號索引。

Tier 2:完整候選

適用於:

  • 高新穎;
  • 高不確定;
  • 高影響;
  • 多模型反覆出現;
  • 驗證成本暫時過高;

的項目。

Tier 3:驗證套件

保存:

  • 完整軌跡;
  • 程式;
  • 資料;
  • 環境;
  • 證明;
  • 專家意見;
  • 重現紀錄。

Tier 4:正式知識物件

已通過領域標準並納入研究譜系。


10.4 保存半衰期

不同層級可有不同保存期限。

但刪除前至少保留:

  • 永久識別;
  • 摘要;
  • 為何刪除;
  • 是否曾被引用;
  • 是否有未完成驗證。

11. 檢索與重新辨認

11.1 多表示索引

同一候選應建立:

  • 語義索引;
  • 公式索引;
  • 程式行為索引;
  • 圖結構索引;
  • 來源索引;
  • 問題依賴索引;
  • 失敗類型索引。

11.2 事件觸發考古

重新檢查可由下列事件觸發:

  • 新定理或實驗發表;
  • 新模型上線;
  • 新形式驗證器可用;
  • 新資料集公開;
  • 某候選在多條獨立軌跡重複;
  • 評分器被發現有系統偏誤;
  • 某分支突然成為主流;
  • 新安全規範允許重新審查。

11.3 定期考古

可定期選擇:

  • 高不確定候選;
  • 被低分但具異常結構者;
  • 多模型一致候選;
  • 長期未驗證高價值候選;
  • 與新文獻接近但早於新文獻者。

11.4 跨模型考古

模型 MBM_B 可對模型 MAM_A 的歷史輸出進行:

  • 重述;
  • 形式化;
  • 分解;
  • 反例檢查;
  • 新文獻對映;
  • 重要度重估。

但必須揭露:

[ M_B ]

是否已看過後來結果。

若已看過,只能進行回溯辨認,不可作為獨立優先權證明。


12. 驗證階層

12.1 Level 0:可解析

內容能被轉換為明確命題或可執行程序。


12.2 Level 1:內部一致

沒有明顯自相矛盾,程式可運行,格式可檢查。


12.3 Level 2:自動測試

通過:

  • 單元測試;
  • 數值檢查;
  • 符號檢查;
  • 反例搜尋;
  • 模擬。

12.4 Level 3:獨立模型重建

另一模型不依賴原推導,得到相同或等價結果。

這仍不是最終證明,因為模型可能共享資料與偏誤。


12.5 Level 4:形式或實驗驗證

  • 形式證明器接受;
  • 獨立實驗重現;
  • 嚴格基準測試;
  • 因果識別成立。

12.6 Level 5:社群整合

經專家審查、公開批判及後續使用後,成為穩定知識。


13. 評估指標

13.1 知識轉換率

KCY=最終通過驗證的合成知識候選數生成痕跡總數.KCY = \frac{ \text{最終通過驗證的合成知識候選數} }{ \text{生成痕跡總數} }.

由於基礎比例可能極低,應同時報告絕對數。


13.2 保存召回率

PR=後來證實有價值且曾被保存者後來證實有價值者.PR = \frac{ \text{後來證實有價值且曾被保存者} }{ \text{後來證實有價值者} }.

13.3 前驅召回率

PCR=被考古系統找到的真實前驅檔案中全部真實前驅.PCR = \frac{ \text{被考古系統找到的真實前驅} }{ \text{檔案中全部真實前驅} }.

13.4 前驅精確率

PCP=真實前驅被標示為前驅的候選.PCP = \frac{ \text{真實前驅} }{ \text{被標示為前驅的候選} }.

13.5 錯誤挖掘率

FER=被錯誤宣稱為先行發現的候選全部被挖掘候選.FER = \frac{ \text{被錯誤宣稱為先行發現的候選} }{ \text{全部被挖掘候選} }.

13.6 語義重建忠實度

由盲化專家評估重建後命題是否超出原痕跡內容。


13.7 反事實加速量

若候選在 tgt_g 被正確辨認並驗證,可能比實際整合時間提前:

Ac=tiactualticounterfactual.A_c = t_i^{\mathrm{actual}} - t_i^{\mathrm{counterfactual}}.

此指標只能估計,必須報告假設。


13.8 考古成本效益

ACE=已驗證候選價值檢索成本+重建成本+驗證成本.ACE = \frac{ \sum \text{已驗證候選價值} }{ \text{檢索成本}+\text{重建成本}+\text{驗證成本} }.

14. 實證研究設計

14.1 研究一:前瞻時間封鎖資料庫

選擇一組尚未解決的問題。

在時間 t0t_0

  1. 讓多個 AI 系統生成候選;
  2. 保存完整輸出與來源;
  3. 建立加密時間戳;
  4. 不依結果事後修改;
  5. 由獨立委員會保管。

當問題於 t1t_1 有新結果時:

  1. 先由盲化團隊重建舊候選;
  2. 再比較新結果;
  3. 判定完整、部分或表面前驅;
  4. 進行獨立驗證。

這是最能檢驗延遲發現的設計。


14.2 研究二:歷史截點重演

選擇已有重大發現的案例,設定知識截止日期:

tc<tdiscovery.t_c<t_{\mathrm{discovery}}.

系統只能使用 tct_c 前資料。

評估它是否生成:

  • 完整結果;
  • 部分結構;
  • 有用反例;
  • 無關相似。

必須防止訓練資料洩漏,因此此設計較適合:

  • 封閉模型;
  • 可控訓練語料;
  • 人工建立新問題;
  • 形式合成世界。

14.3 研究三:人工埋藏考古基準

建立含:

  • 真實完整前驅;
  • 局部前驅;
  • 近似假陽性;
  • 完全錯誤;
  • 表示變體;
  • 污染候選;

的合成檔案。

要求考古系統辨認。

此設計可精確測量:

[ PCR,PCP,FER. ]


14.4 研究四:跨模型代際考古

由較早模型生成並保存研究軌跡。

隔一段時間後,由較新模型在不同條件下:

  • 不看後來答案;
  • 看部分新工具;
  • 看完整新文獻;

分別重新檢查。

比較模型能力提升是否增加:

  • 候選抽取;
  • 形式化;
  • 錯誤發現;
  • 真實前驅辨認。

14.5 研究五:形式數學考古

數學特別適合初期研究,因為候選可使用形式驗證。

流程:

  1. AI 生成大量 Lean 命題或證明片段;
  2. 保存失敗與未完成軌跡;
  3. 後續版本重新嘗試;
  4. 由 kernel 驗證;
  5. 檢查是否包含後來證明的關鍵引理。

形式正確不等於新穎,但可大幅降低真假判定成本。


14.6 研究六:程式與演算法考古

保存:

  • 所有正確但非最佳程式;
  • 低分候選;
  • 失敗測試;
  • 跨硬體結果;
  • 評分器版本。

當新硬體、新編譯器或新目標出現時,重新評估舊演算法。

某個在時間 (t) 表現普通的演算法,可能在:

[ H_{t+k} ]

硬體上成為最佳。


14.7 研究七:實驗假說考古

將 AI 生成假說預註冊並封存。

未來研究發表後,檢查:

  • 是否有真正先行假說;
  • 是否含可操作實驗;
  • 是否只是寬泛敘述;
  • 是否在當時可被驗證;
  • 若及早測試能否節省資源。

15. 可檢驗命題

H1:絕對候選數增長

即使真實候選比例 (q) 不變或下降,隨生成量 (N) 增加,真實候選絕對數仍可能上升。

Nt>0(Nq)t>0\frac{\partial N}{\partial t}>0 \quad\Rightarrow\quad \frac{\partial (Nq)}{\partial t}>0

在 (q) 下降速度小於 (N) 增長速度時成立。


H2:驗證積欠增長

當生成率長期高於驗證率時,認識積欠上升。

λg>λvBt.\lambda_g>\lambda_v \Rightarrow B_t\uparrow.

H3:來源完整性提高考古精確率

具有提示、模型、時間、評分器與父軌跡資訊的候選,比只有最終文字的候選更容易被正確重建。


H4:跨模型多樣性提高召回

使用具有不同架構、資料與工具的模型進行考古,比單一模型重複抽樣具有較高前驅召回率。


H5:結果知情提高假陽性

已知後來答案的考古者,比盲化考古者更容易將模糊舊內容誤判為前驅。

FERunblinded>FERblinded.FER_{\mathrm{unblinded}} > FER_{\mathrm{blinded}}.

H6:形式領域具有較短驗證延遲

在可形式化數學與程式領域,平均 LvL_v 低於依賴昂貴物理實驗的領域。


H7:分層保存優於全存與只存最佳

在固定預算下,分層保存能取得較佳:

[ ACE ]

與前驅召回率。


H8:低分區存在非零真實候選

由於評分器錯配,低分候選中仍存在非零比例的後來可驗證結果。


H9:局部抽取優於整體標籤

對失敗證明與失敗研究進行命題級分解,比整體保留「成功/失敗」標籤能恢復更多可重用知識。


16. 事後偏誤與錯誤發現風險

16.1 德州神槍手偏誤

先知道結果,再從數十億文字中尋找相似句子,幾乎必然能找到某種對應。

因此:

NmaxSimilarityN\uparrow \Rightarrow \max Similarity\uparrow

即使所有候選都只是隨機噪音。


16.2 模糊語言優勢

「某種新方法可能改善效能」幾乎可以事後對應任何進步。

前驅判定必須要求:

  • 足夠具體;
  • 有可操作結構;
  • 有排除條件;
  • 不依事後補充。

16.3 結果污染

模型可能在訓練資料中看過後來結果,但研究者誤以為它獨立生成。

需要:

  • 未公開問題;
  • 時間封鎖;
  • 語料審計;
  • canary;
  • 封閉環境;
  • 生成前承諾。

16.4 驗證者污染

即使原候選未受污染,後來重建者知道答案,也可能把缺失步驟補入。

應保存:

xoriginalx_{\mathrm{original}}

與:

xreconstructedx_{\mathrm{reconstructed}}

並標示所有新增內容。


16.5 多重比較

從海量候選中挑出少量命中,必須報告:

  • 總候選數;
  • 搜尋空間;
  • 選擇規則;
  • 未命中數;
  • 假發現率;
  • 評分閾值。

16.6 優先權膨脹

「模型曾寫過相似內容」不自動構成:

  • 學術優先權;
  • 完整發現;
  • 作者資格;
  • 專利先前技術;
  • 社會承認。

這些需要獨立法律與制度判準。


17. 安全與倫理

17.1 危險知識的埋藏

大規模保存可能包含:

  • 生物危害;
  • 化學合成風險;
  • 網路攻擊;
  • 武器設計;
  • 隱私資料;
  • 繞過安全控制的方法。

合成知識考古不能採取無條件公開原則。


17.2 權限分層

可區分:

  • 公開 metadata;
  • 受控研究摘要;
  • 專家驗證區;
  • 高風險隔離庫;
  • 到期銷毀資料。

17.3 個人與機密資料

AI 日誌可能包含:

  • 未發表研究;
  • 商業秘密;
  • 研究參與者資料;
  • 私人對話;
  • 版權內容;
  • 機構安全資訊。

保存前應進行:

  • 去識別化;
  • 權限檢查;
  • 授權判定;
  • 保留期限設計;
  • 刪除權治理。

17.4 錯誤再循環

未驗證候選若重新進入訓練資料,可能形成:

generated errortraining dataapparent consensus.\text{generated error} \rightarrow \text{training data} \rightarrow \text{apparent consensus}.

所有候選必須保留驗證狀態。


17.5 發現者與生成者的公正歸屬

延遲發現可能涉及:

  • 原始模型開發者;
  • 提示設計者;
  • 資料提供者;
  • 保存者;
  • 考古檢索者;
  • 重建者;
  • 驗證者;
  • 整合者。

不應只依最後發表者分配全部貢獻。


18. 基礎設施要求

18.1 最小候選紀錄

synthetic_candidate:
  id: ""
  generated_at: ""
  generator:
    model: ""
    version: ""
    agent: ""
  task: ""
  parent_trace: ""

  raw_content: ""
  normalized_claims: []
  programs: []
  equations: []

  source_cutoff: ""
  tools_used: []
  evaluation:
    score: null
    evaluator: ""
    failure_reason: ""

  preservation_tier: 0
  verification_status: "unexamined"
  safety_class: ""
  access_policy: ""

18.2 考古事件紀錄

archaeology_event:
  id: ""
  candidate_id: ""
  triggered_at: ""
  trigger: ""
  archaeologists: []

  blind_status: ""
  reconstructed_claim: ""
  additions_by_reconstructor: []
  comparison_target: ""

  precursor_class:
    complete: false
    partial: false
    enabling: false
    superficial: false

  verification:
    method: ""
    result: ""
    independent_reviewers: []

  decision:
    preserve: true
    promote_tier: null
    integrate: false

18.3 不可變時間證據

可使用:

  • 內容雜湊;
  • 簽章;
  • 公開時間戳;
  • 版本化儲存;
  • 多方見證;
  • 透明日誌。

但不可變性不證明內容正確,只證明內容當時存在且未被靜默修改。


18.4 可查詢譜系

候選應連結至:

  • 父輸出;
  • 使用資料;
  • 評分器;
  • 後續修訂;
  • 驗證;
  • 發表結果;
  • 相關失敗。

19. 學術與制度影響

19.1 從產生想法轉向管理想法供給

當假說供給不再稀缺,研究能力可能更多取決於:

  • 問題選擇;
  • 驗證排序;
  • 實驗資源;
  • 來源治理;
  • 跨領域辨認;
  • 錯誤淘汰。

19.2 同行評審無法逐一承接全部候選

需要:

  • 自動初篩;
  • 形式驗證;
  • 抽樣;
  • 高價值優先;
  • 多模型異質審查;
  • 專家最後責任。

19.3 發表制度需要候選層

在正式論文與私人日誌之間,可建立:

  • timestamped conjecture;
  • micropublication;
  • negative result;
  • candidate algorithm;
  • unverified claim;
  • failed proof fragment;

等中間出版物。

它們必須清楚標明:

unverified.\text{unverified}.

19.4 學術評價不能獎勵純候選數量

否則會造成:

candidate inflation.\text{candidate inflation}.

應重視:

  • 驗證率;
  • 考古可重用性;
  • 來源完整性;
  • 錯誤修正;
  • 獨立重建;
  • 真實知識轉換。

19.5 知識保存成為研究貢獻

高品質保存、索引、重建與負結果整理,應能被正式認可。

否則系統只獎勵新輸出,卻無人維護過去輸出的可理解性。


20. 與前述研究框架的關係

第一項研究提出:

人機協作未來的條件可判斷性提高.\text{人機協作} \rightarrow \text{未來的條件可判斷性提高}.

第二項研究指出:

智能提高既有不確定性降低+新不確定性生成.\text{智能提高} \rightarrow \text{既有不確定性降低} + \text{新不確定性生成}.

第三項研究提出:

AI-native research=state+lineage+views.\text{AI-native research} = \text{state} + \text{lineage} + \text{views}.

本文進一步指出:

完整研究譜系\text{完整研究譜系}

不只服務未來承接,也可能成為:

延遲知識發現的考古場.\text{延遲知識發現的考古場}.

沒有研究譜系,就無法判斷:

  • 候選何時生成;
  • 是否獨立;
  • 為何被放棄;
  • 哪些內容是原始的;
  • 哪些是後來補入的;
  • 哪個模型完成了辨認;
  • 哪個人或系統完成驗證。

21. 理論反例與邊界

21.1 大多數資料可能永遠沒有價值

本文不否認:

q1.q\ll1.

甚至可能:

q0q\rightarrow0

隨生成規模上升。

框架的價值取決於是否能以合理成本取得非零、可重現的知識轉換。


21.2 保存可能比重做更昂貴

若某類候選:

  • 生成成本極低;
  • 重做容易;
  • 時效短;
  • 驗證昂貴;
  • 安全風險高;

則刪除可能比保存合理。


21.3 新模型未必更會理解舊資料

模型能力提升可能伴隨:

  • 表示偏差;
  • 遺忘;
  • 工具不相容;
  • 過度迎合新理論;
  • 更強事後合理化。

21.4 正確不等於重要

一個形式上正確但平凡的命題,不必具有研究價值。


21.5 局部相似不等於知識連續性

後來理論與舊輸出共享符號或字詞,不足以建立前驅關係。


22. 反證標準

本文研究議程在以下結果下將受到明顯削弱:

  1. 經嚴格時間封鎖與盲化後,歷史 AI 輸出中幾乎不存在可驗證前驅;
  2. 前驅精確率極低,考古成本長期高於知識收益;
  3. 保存完整來源並未提高重建或驗證品質;
  4. 新模型對舊輸出的重新檢查不優於隨機或一般搜尋;
  5. 所謂延遲發現全部可由訓練資料污染解釋;
  6. 形式與實驗驗證無法重現考古得到的結果;
  7. 分層保存不優於只保存最高分候選;
  8. 盲化評審無法一致區分完整、部分與表面前驅;
  9. 事後知道結果所造成的假陽性遠高於真實命中,且無法有效校正。

23. 研究限制

23.1 「理解」難以完全操作化

系統是否理解其輸出涉及認知哲學問題。

本文避免以主觀意識作為判準,而使用:

  • 能否明確表達;
  • 能否說明條件;
  • 能否預測結果;
  • 能否完成驗證;
  • 能否在新問題中重用;

作為功能性指標。


23.2 新穎性判定困難

候選可能已存在於:

  • 冷門文獻;
  • 非英文資料;
  • 未數位化檔案;
  • 私人研究;
  • 模型訓練資料。

23.3 價值會隨時代變動

某項演算法、資料或負結果在生成時價值低,後來可能因:

  • 新硬體;
  • 新理論;
  • 新疾病;
  • 新政策;
  • 新資料;

而變得重要。


23.4 知識考古可能強化倖存者偏誤

研究者容易只研究成功挖出的案例,忽略龐大失敗成本。

必須公開全部搜尋與評估記錄。


23.5 反事實加速難以證明

即使候選提早被辨認,也不保證當時社群有能力完成驗證與採用。


24. 討論

24.1 資料先於理解不是新現象

自然科學長期存在:

  • 先觀測、後理論;
  • 先公式、後證明;
  • 先技術、後機制;
  • 先異常、後新範式。

AI 的新穎之處主要在於:

規模+速度+生成者與理解者分離.\text{規模} + \text{速度} + \text{生成者與理解者分離}.

24.2 未來可能出現兩種科學

即時科學

生成後立即被驗證、發表與應用。

考古科學

持續回到歷史機器資料,尋找當時未被辨認的結構。

兩者共享同一研究基礎設施。


24.3 驗證者可能比生成者更稀缺

當任何 Agent 都能產生一千個假說,真正稀缺的是:

  • 可信實驗;
  • 形式化專家;
  • 高品質資料;
  • 領域判斷;
  • 反例能力;
  • 責任承擔。

24.4 失敗資料的價值重新上升

一條失敗軌跡可能告訴未來系統:

  • 哪個方法不可行;
  • 哪個限制尚未解;
  • 哪個局部構造有效;
  • 哪個評分器錯了;
  • 哪個分支值得重新開啟。

因此:

failed outputzero-value output.\text{failed output} \neq \text{zero-value output}.

但它也不自動是知識。


24.5 知識考古不是 AI 神秘主義

本框架拒絕以下敘事:

模型已經知道答案,只是人類還沒理解。

更嚴格的說法是:

模型可能生成一個後來可被重建與驗證的結構,即使它當時無法穩定說明、選擇或使用該結構。

這不要求假設模型具有隱藏意識或全知內在世界。


24.6 保存制度決定未來能否知道過去生成了什麼

若 AI 研究只留下最終文章,未來無法回答:

  • 重大構想是否早已出現?
  • 它為何被漏掉?
  • 評分器有何偏誤?
  • 哪個模型先生成?
  • 人類介入了多少?
  • 後來結果是否真正獨立?

因此,來源保存不只是重現需求,也是未來科學史的基本條件。


25. 結論

人工智能正在降低知識候選的生成成本。

當生成能力快速增加時,科學系統可能不再主要受限於:

沒有想法.\text{沒有想法}.

它可能轉而受限於:

不知道哪些想法值得理解、驗證與保存.\text{不知道哪些想法值得理解、驗證與保存}.

本文提出合成知識考古學,研究如何從歷史 AI 輸出、失敗軌跡、候選程式與未完成證明中,辨認後來可被驗證的知識候選。

其核心生命週期為:

GenerationPreservationRecognitionValidationIntegration.\boxed{ \text{Generation} \rightarrow \text{Preservation} \rightarrow \text{Recognition} \rightarrow \text{Validation} \rightarrow \text{Integration}. }

只要其中任何一環接近零,生成內容就不會轉化為知識。

本文最重要的限制同樣清楚:

資料先於理解,不代表資料天然等於知識。\boxed{ \text{資料先於理解,} \newline \text{不代表資料天然等於知識。} }

延遲發現必須通過:

  • 可信時間證據;
  • 無污染來源;
  • 盲化重建;
  • 明確命題對映;
  • 獨立驗證;
  • 全量假陽性報告。

否則,它只是從大量噪音中事後挑選相似片段。

若嚴格研究最終證明,舊合成資料中確實存在非零比例、具有可重現價值的前驅,科學知識生產將多出一個新的時間方向:

不只向前生成,也向後重新發現。\text{不只向前生成,} \newline \text{也向後重新發現。}

未來研究基礎設施因而不能只問:

今天的 AI 產生了什麼?

還必須能回答:

昨天的 AI 曾產生什麼,當時為何沒有人知道那可能是知識,今天又如何證明它確實具有知識價值?\boxed{ \text{昨天的 AI 曾產生什麼,} \newline \text{當時為何沒有人知道那可能是知識,} \newline \text{今天又如何證明它確實具有知識價值?} }

作者貢獻說明

Neo.K: 核心問題提出、資料先於理解之命題、AI 生成內容可能延遲被辨認的研究方向,以及系列論文之理論整合。
Aletheia(GPT-5.6 Thinking): 概念形式化、文獻整合、知識生命週期模型、考古方法、可檢驗命題、治理框架與初稿撰寫。

投稿至不接受人工智能列名作者的期刊時,可依期刊政策調整署名,並在作者貢獻、方法或致謝中揭露 AI 的實質參與。


利益衝突聲明

本文為概念性、方法論與研究議程論文。作者聲明目前無與本文核心命題直接相關的財務利益衝突。


資料與程式碼可得性

本文未使用新的實證資料。後續研究應公開時間封鎖規則、候選總數、盲化流程、來源指紋、評分器版本、檢索程式、假陽性與驗證失敗紀錄;高風險內容則應採受控存取。


參考文獻

Bik, E. M. (2024). Publishing negative results is good for science. Access Microbiology, 6(4), 000792. doi:10.1099/acmi.0.000792

Fawzi, A., Balog, M., Huang, A., et al. (2022). Discovering faster matrix multiplication algorithms with reinforcement learning. Nature, 610, 47–53. doi:10.1038/s41586-022-05172-4

Ghareeb, A. E., et al. (2026). A multi-agent system for automating scientific discovery. Nature, 655, 497–505. doi:10.1038/s41586-026-10652-y

Groth, P., Gibson, A., & Velterop, J. (2010). The anatomy of a nanopublication. Information Services & Use, 30(1–2), 51–56. doi:10.3233/ISU-2010-0613

Ke, Q., Ferrara, E., Radicchi, F., & Flammini, A. (2015). Defining and identifying Sleeping Beauties in science. Proceedings of the National Academy of Sciences, 112(24), 7426–7431. doi:10.1073/pnas.1424329112

Kuhn, T., Meroño-Peñuela, A., Malic, A., et al. (2018). Nanopublications: A growing resource of provenance-centric scientific linked data. 2018 IEEE 14th International Conference on e-Science, 83–92. doi:10.1109/eScience.2018.00024

Loreto, V., Servedio, V. D. P., Strogatz, S. H., & Tria, F. (2017). Dynamics on expanding spaces: Modeling the emergence of novelties. In Creativity and Universality in Language. Springer. doi:10.1007/978-3-319-24403-7_5

Lu, C., Lu, C., Lange, R. T., Foerster, J., Clune, J., & Ha, D. (2024). The AI Scientist: Towards fully automated open-ended scientific discovery. arXiv preprint arXiv:2408.06292.

Miura, T., Asatani, K., & Sakata, I. (2021). Large-scale analysis of delayed recognition using Sleeping Beauty and the Prince. Applied Network Science, 6, 48. doi:10.1007/s41109-021-00389-0

OpenAI. (2026). Our First Proof submissions. Published February 20, 2026.

Perkel, J. M. (2024). Reducing publication bias with Registered Reports. Nature Neuroscience, 27, 1635. doi:10.1038/s41593-024-01762-9

Raayoni, G., Gottlieb, S., Pisha, G., et al. (2021). Generating conjectures on fundamental constants with the Ramanujan Machine. Nature, 590, 67–73. doi:10.1038/s41586-021-03229-4

Rainford, P. F., Occhipinti, A., Wang, B., et al. (2026). Knowledge preservation in the era of big science and AI: Strategies for sustainable scientific research. Nature Communications, 17, 4069. doi:10.1038/s41467-026-72667-3

Romera-Paredes, B., Barekatain, M., Novikov, A., et al. (2024). Mathematical discoveries from program search with large language models. Nature, 625, 468–475. doi:10.1038/s41586-023-06924-6

Soiland-Reyes, S., Sefton, P., Crosas, M., et al. (2022). Packaging research artefacts with RO-Crate. Data Science, 5(2), 97–138. doi:10.3233/DS-210053

Trinh, T. H., Wu, Y., Le, Q. V., He, H., & Luong, T. (2024). Solving olympiad geometry without human demonstrations. Nature, 625, 476–482. doi:10.1038/s41586-023-06747-5

Wallace, D., Griffin, C., O’Neill, S., Luong, T., & Larter, O. (2026). Conjecture Machines: AI agents and the new validation bottleneck in science. Google DeepMind.

Wilkinson, M. D., Dumontier, M., Aalbersberg, I. J., et al. (2016). The FAIR Guiding Principles for scientific data management and stewardship. Scientific Data, 3, 160018. doi:10.1038/sdata.2016.18

Yamada, Y., Lange, R. T., Lu, C., et al. (2025). The AI Scientist-v2: Workshop-level automated scientific discovery via agentic tree search. arXiv preprint arXiv:2504.08066.


附錄 A:延遲發現最小判定表

delayed_discovery_assessment:
  candidate_id: ""
  later_result_id: ""

  temporal:
    generated_at: ""
    later_result_public_at: ""
    immutable_timestamp_verified: false

  contamination:
    training_exposure_unknown: true
    source_cutoff_verified: false
    later_result_seen_by_reconstructor: false

  reconstruction:
    original_content: ""
    reconstructed_claim: ""
    additions: []
    blind_reconstruction: false

  precursor_class:
    complete: false
    partial: false
    enabling: false
    inspirational: false
    superficial: false

  validation:
    domain_standard: ""
    independent: false
    result: "unverified"
    reviewers: []

  decision:
    qualifies_as_delayed_discovery: false
    confidence: 0.0
    rationale: ""

附錄 B:保存優先度格式

preservation_score:
  candidate_id: ""

  estimated_correctness: 0.0
  novelty: 0.0
  potential_impact: 0.0
  reusability: 0.0
  cross_model_recurrence: 0.0

  verification_cost: 0.0
  reconstruction_cost: 0.0
  storage_cost: 0.0
  safety_risk: 0.0
  privacy_risk: 0.0

  recommended_tier: 0
  review_after: ""
  deletion_after: null

附錄 C:考古研究預註冊

archaeology_study:
  registration_date: ""
  archive: ""
  archive_frozen_at: ""

  research_question: ""
  comparison_targets: []
  knowledge_cutoff: ""

  blind_design:
    reconstructors_blinded: true
    comparators_blinded: true
    validators_blinded: true

  candidate_universe_size: 0
  sampling_rule: ""
  matching_rule: ""
  precursor_definitions: {}

  primary_metrics:
    - precursor_recall
    - precursor_precision
    - false_excavation_rate
    - validation_cost

  multiple_testing_correction: ""
  contamination_audit: ""
  negative_results_policy: ""
  safety_policy: ""

附錄 D:名詞對照

中文 英文 定義
合成知識候選 Synthetic knowledge candidate 由 AI 或演算法流程產生、可能具有可驗證研究價值的內容
知識痕跡 Knowledge trace 尚未完成知識資格判定,但保留可能可重建研究內容的輸出
延遲發現 Delayed discovery 內容先被生成,較晚才被辨認並通過驗證的現象
合成知識考古學 Synthetic knowledge archaeology 對歷史機器輸出進行保存、重建、檢索、驗證與時間判定的研究
認識積欠 Epistemic backlog 已生成但尚未完成辨認或驗證之候選的預期知識價值
完整前驅 Complete precursor 已含後來結果核心命題與充分內容的舊候選
部分前驅 Partial precursor 包含後來結果重要但不充分構件的舊候選
錯誤挖掘率 False excavation rate 被錯誤宣稱為先行發現的候選比例
反事實加速量 Counterfactual acceleration 若候選及早被辨認,理論上可能提前完成知識整合的時間
驗證瓶頸 Verification bottleneck 候選生成速度超過可信驗證速度所形成的限制
知識轉換率 Knowledge-conversion yield 生成痕跡最終轉化為已驗證知識的比例
模型外前驅 Outside-model precursor 原評估系統未能辨認,但後來可被驗證為有價值的候選