title: "從不可知到條件可判斷:人機協作下的未來空間壓縮與可預判邊界" title_en: "From Uncertainty to Conditional Predictability: Future-Space Compression and the Predictability Frontier in Human–AI Collaboration" version: "v0.1" date: "2026-07-19" document_type: "概念性與方法論論文" status: "公開發表草案" language: "zh-Hant" authors: - "Neo.K" - "Aletheia(GPT-5.6 Thinking)" keywords: - "人機協作" - "預測" - "條件可判斷性" - "未來空間壓縮" - "可預判邊界" - "機率校準" - "深度不確定性" - "科技預見"
從不可知到條件可判斷
人機協作下的未來空間壓縮與可預判邊界
From Uncertainty to Conditional Predictability: Future-Space Compression and the Predictability Frontier in Human–AI Collaboration
作者: Neo.K、Aletheia(GPT-5.6 Thinking)
文件性質: 概念性與方法論論文
版本: v0.1
日期: 2026-07-19
摘要
人工智能的發展重新激活了一個古老問題:人類能否透過更強的計算、搜尋與推理能力,更準確地預測未來?現有研究多以命中率、Brier score、校準度或決策績效評估預測能力,並比較人類、人工智能及人機組合的相對表現。然而,這類評估通常把「未來能否被預測」簡化為對既定問題輸出一個較準確的機率,較少處理另一種更基礎的能力:能否將原本模糊、無法操作、缺乏邊界的未來問題,轉化為可分解、可條件化、可否證、可更新與可追溯的判斷對象。
本文提出「條件可判斷性」(conditional judgeability)、「未來空間壓縮」(future-space compression)與「可預判邊界」(predictability frontier)三個概念,以描述人機協作可能帶來的預測增益。本文主張,人機協作的主要價值未必是直接找到唯一正確的未來,而可能是縮小合理可能世界的範圍、辨識關鍵前置條件、建立可觀測的更新觸發器,並將不確定性轉化為可校準的條件結構。此一壓縮必須受到校準、涵蓋率與適當評分規則約束;否則,錯誤地排除真實未來只是過度自信,而非知識進步。
本文進一步提出一套可預註冊的縱向比較方法,同時評估人類、人工智能與人機協作在預測準確度、校準、情境涵蓋、條件完整性、更新速度、可追溯性及成本上的表現。本文不預設人機協作必然產生互補效應。既有統合研究顯示,人機組合平均而言並不總能超越表現較佳的一方,因此,資訊差異、錯誤相關性、互動協議、任務類型與信心對齊均應被視為條件變項。本文的理論目標不是將人機協作描述成類拉普拉斯妖,而是建立一個可以衡量「多少原本混亂的未來,能被轉化為條件式可判斷現實」的研究框架。
關鍵詞: 人機協作、預測、條件可判斷性、未來空間壓縮、可預判邊界、機率校準、深度不確定性、科技預見
Abstract
The development of artificial intelligence has renewed an old question: can humans predict the future more accurately by combining human judgment with enhanced computational, retrieval, and reasoning capabilities? Existing forecasting research commonly evaluates performance through hit rates, Brier scores, calibration, or decision outcomes, comparing humans, artificial intelligence, and human–AI teams. These approaches, however, often reduce predictability to the quality of a probability assigned to a predefined question. They pay less attention to a more foundational capability: transforming a vague, operationally undefined, and seemingly chaotic future problem into an object that can be decomposed, conditioned, falsified, updated, and audited.
This paper proposes three concepts—conditional judgeability, future-space compression, and the predictability frontier—to characterize potential gains from human–AI collaboration. We argue that the central value of collaboration may not lie in identifying a single correct future, but in narrowing the range of plausible worlds, identifying critical preconditions, defining observable update triggers, and converting uncertainty into a calibrated conditional structure. Such compression must remain constrained by calibration, coverage, and proper scoring rules; otherwise, excluding the realized future merely constitutes overconfidence rather than epistemic progress.
We further propose a preregistrable longitudinal framework for comparing humans, AI systems, and human–AI teams across forecast accuracy, calibration, scenario coverage, conditional completeness, update speed, traceability, and cost. The framework does not assume that human–AI collaboration necessarily generates complementarity. Existing meta-analytic evidence indicates that human–AI combinations do not consistently outperform the better standalone participant. Informational diversity, error correlation, interaction protocols, task type, and confidence alignment must therefore be treated as conditional variables. The aim is not to portray human–AI systems as Laplacian demons, but to establish a framework for measuring how much of an apparently chaotic future can be transformed into conditionally judgeable reality.
Keywords: human–AI collaboration; forecasting; conditional judgeability; future-space compression; predictability frontier; probabilistic calibration; deep uncertainty; foresight
1. 導論
1.1 預測能力的問題被問得過於狹窄
關於人工智能能否預測未來,最常見的提問方式是:
人工智能給出的結果,是否比人類更準確?
這個問題重要,但不完整。
它預設了:
- 預測問題已經被正確提出;
- 可能結果已經被事先列舉;
- 解決條件已經明確;
- 所需資料已經可得;
- 評估時間點已經固定;
- 真實結果最終可以被單一判定。
在許多封閉型預測任務中,這些條件可以成立。例如:
- 某候選人是否會在指定日期前當選;
- 某項法案是否會通過;
- 某價格是否超過指定門檻;
- 某航天任務是否會在期限前發射。
對這類問題,研究者可以要求預測者輸出:
[ p(Y=1)=q, ]
並在結果發生後使用 Brier score、log score 或其他適當評分規則進行評估。
然而,許多重要的未來問題最初並不是這種形式。例如:
- 某種新型研究基礎設施是否會形成;
- 人工智能如何改變學術傳播;
- 一種新產業形態會以何種制度形式出現;
- 某項技術從實驗室走向常態應用需要哪些前置條件;
- 多智能體社會會增加還是降低某類不確定性。
這些問題的困難不只在於「不知道答案」,還在於:
- 尚未知道應如何拆解;
- 尚未知道哪些變項重要;
- 尚未知道哪些名稱只是表面差異;
- 尚未知道什麼現象可以算作部分實現;
- 尚未知道何時應撤回原判斷。
因此,未來研究不能只測量結果命中率,也必須測量一個問題由混亂敘述轉化成可操作判斷的程度。
1.2 從「預測未來」轉向「提高未來的可判斷性」
本文提出:
人機協作的主要預測增益,未必只是提高單一事件的命中率,也可能是提高未來問題的可分解性、條件化程度、可否證性、可更新性與可追溯性。
設某個尚未結構化的未來問題為 (Q)。在初始狀態下,它可能只是一種直覺、疑問或模糊趨勢感知:
經過人類提出問題、人工智能搜尋資料、比較歷史路徑、生成情境、尋找反例及辨認指標後,問題可能轉化為:
其中:
- (O):可觀測結果;
- :候選未來狀態;
- (C):前置與條件集合;
- (T):時間區間;
- (F):否證或撤回條件;
- (U):更新規則。
即使 仍不能產生唯一答案,它已經比 更可研究、更可比較,也更可被未來資料修正。
本文將這種轉換稱為:
1.3 本文的研究問題
本文處理以下五個問題:
- 何謂未來問題的「條件可判斷性」?
- 人機協作如何壓縮合理的未來可能空間?
- 如何區分有效壓縮與錯誤的過度自信?
- 可否建立一個同時比較人類、AI 與人機協作的實驗框架?
- 在什麼條件下,人機協作可能提高或降低預測品質?
1.4 本文的主要貢獻
本文提出四項貢獻。
第一,將預測研究的評估對象由「答案」擴張至「問題如何被結構化」。
第二,提出未來空間壓縮的形式模型,並要求任何壓縮都必須接受校準與結果涵蓋的約束。
第三,將可預判邊界定義為一個隨資料、工具、制度與智能協作能力移動的問題集合,而非固定的人類認知極限。
第四,提出可預註冊、可長期重複、可跨模型比較的三組實驗設計。
2. 文獻背景與理論缺口
2.1 機率預測與適當評分規則
機率預測不要求預測者假裝確定,而要求其明確表示不確定程度。對二元事件,預測者輸出 ,結果為 。Brier score 可寫為:
[ BS(p,y)=(p-y)^2. ]
分數越低代表預測越好。
適當評分規則的核心功能,是使誠實報告主觀機率成為期望分數最優策略。Gneiting 與 Raftery(2007)系統整理了適當評分規則的理論,並指出其與資訊量、熵及散度之間的關係。
然而,單一分數並不能完整描述預測品質。機率預測通常至少包含:
- 校準度:例如所有預測為 70% 的事件,長期而言是否約有 70% 發生;
- 尖銳度:預測分布是否能在保持校準的前提下集中;
- 辨識力:能否區分高風險與低風險事件;
- 解析度:是否能對不同事件給出有意義的不同機率。
Gneiting、Balabdaoui 與 Raftery(2007)將機率預測的理想原則概括為:
在維持校準的前提下最大化尖銳度。
本文的未來空間壓縮延續此原則:減少可能結果或提高分布集中度本身不是進步;只有在不犧牲校準與真實結果涵蓋的情況下,壓縮才具有認識價值。
2.2 人類判斷與超級預測
地緣政治預測競賽顯示,人類預測能力並非固定不變。透過問題拆解、基準率、團隊討論、機率思維、持續更新與加權聚合,部分預測者能穩定取得較佳成績(Mellers et al., 2014;Mellers et al., 2015)。
這些成果有兩項重要意涵。
第一,預測能力不只是領域知識的直接函數,也與問題如何被表示、資訊如何被更新以及判斷如何被聚合有關。
第二,預測進步不是來自一次性神諭,而來自反覆校正:
這為人機協作提供了自然接口。AI 可以協助搜尋、整理、分解與生成反例;人類則可以判斷問題重要性、制度語境、價值後果與模型未觀測資訊。
2.3 語言模型與事件預測
早期直接要求通用大型語言模型參與現實預測競賽的研究顯示,未經專門設計的模型可能明顯落後人類群體預測(Schoenegger & Park, 2023)。
但後續研究指出,加入歷史資訊檢索、問題分解、多次推理及預測聚合後,語言模型系統可以顯著改善。Halawi et al.(2024)建立檢索增強的自動預測流程,使用跨平台現實預測問題進行測試;其系統整體表現接近競爭性人類群體,在選擇性作答情境中能於部分子集超越群體基準。
這個差異說明:
預測表現取決於:
- 資訊是否新鮮;
- 問題是否被拆解;
- 是否使用基準率;
- 是否多次取樣;
- 是否聚合;
- 是否選擇性作答;
- 是否存在有效的更新機制。
本文因此把「AI」視為一套可設計的認知流程,而不是固定的聊天介面。
2.4 人機互補並非自然發生
人機協作經常被直覺描述成「人類直覺加上機器計算」,彷彿兩者相加必然優於任一方。但系統性回顧與統合分析並不支持如此簡單的假設。
Vaccaro、Almaatouq 與 Malone(2024)分析 106 項實驗研究及 370 個效應量,發現人機組合平均而言低於人類或 AI 中表現較佳的一方。效果受到任務類型明顯調節:在內容創造型任務中較可能產生增益,在有限選項的決策任務中則經常出現損失。
Steyvers et al.(2022)以貝葉斯模型說明,人機互補取決於雙方錯誤是否具有互補性,以及人類能否正確推斷何時應依賴 AI。後續研究也顯示,AI 信心與人類自我信心之間的對齊會影響協作效用(Corvelo Benz & Gomez Rodriguez, 2025)。
因此,本文不提出:
作為普遍定律。
本文提出的是條件命題:
只有在資訊增量、錯誤多樣性、互動協議、信心校準與任務結構符合一定條件時才可能成立。
2.5 深度不確定性與多情境方法
在深度不確定性下,決策者可能無法就以下事項形成共識:
- 系統模型;
- 重要參數;
- 結果機率;
- 目標函數;
- 行動後果。
Robust Decision Making 不以找到單一最佳預測為目標,而是使用大量可能未來測試策略,辨認脆弱條件並尋找穩健、可調整的行動(Lempert, 2019;Marchau et al., 2019)。
這一傳統提醒我們:
本文的「未來空間壓縮」並不是消滅多重未來,而是將未分化的混亂轉換為有結構的多情境集合。
2.6 現有缺口
現有研究已經能回答:
- 預測機率是否準確?
- AI 是否接近人類群體?
- 人機組合是否提高任務績效?
- 哪些策略在多種未來下較穩健?
但仍較少直接回答:
人機協作是否能讓原本無法形成預測問題的領域,變得可以被條件化、測量、更新與回溯?
換言之,預測研究通常從已經被定義的 (Q) 開始;本文研究的是:
3. 核心概念
3.1 條件可判斷性
定義 1:條件可判斷性
一個未來問題 (Q) 的條件可判斷性,是該問題能被轉化為下列結構的程度:
其中:
- (D):可分解性(decomposability);
- (C):條件明確性(conditional specificity);
- (F):可否證性(falsifiability);
- (U):可更新性(updateability);
- (R):可追溯性(traceability)。
可進一步定義標準化分數:
[ J_Q= w_DD_Q+ w_CC_Q+ w_FF_Q+ w_UU_Q+ w_RR_Q, ]
其中:
這不是預測準確度,而是預測問題的操作成熟度。
3.2 可分解性
問題可否被分為:
- 技術前置條件;
- 制度前置條件;
- 經濟誘因;
- 主要行動者;
- 競爭與替代路徑;
- 外生衝擊;
- 可觀測領先指標。
例如,模糊問題:
某類新制度會不會出現?
可以被分解為:
可分解不保證可預測,但會使錯誤位置更容易被辨識。
3.3 條件明確性
條件明確性要求預測不只給結論,還要聲明:
例如:
若模型能穩定執行長程任務、研究過程需要跨模型承接,而且產出量超過人工逐篇審查能力,則研究狀態與譜系基礎設施的需求將上升。
這類敘述比「未來一定會出現某產品」更具學術價值,因為它提供了因果與撤回接口。
3.4 可否證性
可否證性要求明確說明何種觀察會削弱或推翻預測。
設命題為 (M),其否證集合為:
若在指定時間窗內持續觀察到 ,則應降低:
[ P(M). ]
缺乏否證條件的未來敘述容易退化為事後重新解釋。
3.5 可更新性
預測必須定義何時及如何更新。
其中 是更新規則, 是新證據。
更新規則不必完全機械化,但至少應說明:
- 哪些指標需要追蹤;
- 何種變化構成重大新證據;
- 何時需要重新分解問題;
- 何時應停止使用原模型。
3.6 可追溯性
一項判斷必須能回溯:
- 當時擁有哪些資料;
- 使用了哪些來源;
- 哪些部分由人類提出;
- 哪些部分由 AI 搜尋或推理;
- 哪些假設未被驗證;
- 後續為何修改。
否則無法區分真正的預測能力與事後選擇性記憶。
4. 未來空間壓縮
4.1 可能世界集合
設:
為時間 (t) 被視為合理的未來狀態集合。
人類在未獲 AI 協助時形成:
AI 系統形成:
人機協作形成:
直覺上,若人機協作能排除不合理路徑,可能有:
但這個包含關係不能被直接視為進步。若真實結果 被錯誤排除,集合雖然縮小,預測卻更差。
4.2 支集壓縮
對有限狀態集合,可定義:
其中 是初始候選集合。
但此指標只計算刪除了多少可能性,不判斷刪除是否合理。
因此必須加入涵蓋條件:
可定義單次有效支集壓縮:
跨多題評估時,還需對錯誤排除施加額外懲罰,避免系統透過極端狹窄集合獲得表面高分。
4.3 熵壓縮
若對各未來狀態配置機率分布 ,可使用 Shannon entropy:
人機協作的熵壓縮為:
[ C_H= H(p_t^0)-H(p_t^{HA}). ]
但熵降低也可能只是過度自信。
因此本文主張:
4.4 受校準約束的壓縮
機率預測理論中的基本原則是:
本文據此定義:
定義 2:受校準約束的未來空間壓縮
若一套預測方法相對基準方法:
- 降低預測分布的熵或支持範圍;
- 不降低長期校準;
- 不降低真實結果涵蓋率;
- 在適當評分規則上得到較佳期望分數;
則其壓縮可被視為有效的認識增益。
以 Brier score 為例,人機協作相對人類基準的事後增益為:
[ G_{BS}
BS(p_H,y)
BS(p_{HA},y). ]
若跨足夠多的預註冊問題有:
則人機協作在該問題分布上具有預測增益。
若熵降低但:
則該壓縮應被判定為過度壓縮或錯誤自信。
4.5 結構壓縮不等於機率壓縮
有些問題無法合理配置精確機率,但仍能進行結構壓縮。
例如初始狀態可能有數十種互相混雜的敘述。研究後可將其整理成:
- 三條主要制度路徑;
- 兩個必要技術條件;
- 四個領先指標;
- 一個關鍵否證條件。
這種進步可以寫為:
其中 是未結構化敘述集合, 是條件與關係圖。
因此,未來空間壓縮至少有兩種形式:
- 分布壓縮:使機率分布在保持校準下更尖銳;
- 結構壓縮:把未分化可能性整理成有限、可觀測、可更新的路徑。
5. 可預判邊界
5.1 定義
設所有可提出的未來問題集合為:
給定方法 (m)、資料 (d)、時間 (t) 與最低品質門檻 ,可預判邊界內的問題集合定義為:
其中:
- :條件可判斷性;
- :預測品質或適當評分表現;
- :最低門檻。
可預判邊界不是一條物理直線,而是「目前能被合理操作的問題集合」。
5.2 邊界的移動
新資料、新模型、新制度與新方法可能使:
原本只能以模糊語言討論的問題,可能進入可條件判斷範圍。
但邊界也可能收縮。當出現制度突變、資料污染、戰略欺騙或結構斷裂時:
因此,可預判邊界是動態的,而非文明單向逼近全知的刻度。
5.3 三種邊界擴張
問題邊界擴張
以前無法形成操作定義的問題,現在可以被正式提出。
時間邊界擴張
同一問題可以在更早的時間點形成有意義判斷。
解析度邊界擴張
以前只能判斷大方向,現在可以辨認條件、分支與時序。
6. 人機協作的可能作用機制
6.1 人類提供的能力
人類可能在以下環節具有相對優勢:
- 決定哪些問題值得預測;
- 發現制度與語言中的異常;
- 理解未被數據完整捕捉的社會語境;
- 判斷利益、權力與價值衝突;
- 辨認看似合理但不重要的結果;
- 對全新現象提出初始命名;
- 決定何時不應將問題簡化。
6.2 AI 提供的能力
AI 可能在以下環節提供增益:
- 擴大資料搜尋範圍;
- 對多來源資訊進行快速比較;
- 將問題拆成子問題;
- 尋找基準率與歷史類比;
- 生成互斥或競爭情境;
- 進行反例與反事實搜尋;
- 檢查敘述內部矛盾;
- 記錄與比較多輪更新;
- 對大量問題持續重估。
6.3 協作不是能力相加,而是流程重組
人機協作不能被簡化為:
[ H+AI. ]
更適合表示為:
其中:
- :問題提出;
- :資料檢索;
- :條件與情境建構;
- :反例、校準與驗證;
- :聚合與更新。
任何環節設計不良,都可能使整體協作低於任一方單獨表現。
6.4 資訊重疊與錯誤相關性
若人類與 AI 使用相同來源,並具有高度相似偏誤,兩者結合不一定增加資訊。
設:
- :人類資訊;
- :AI 資訊;
- :共同資訊;
- :AI 提供的邊際新資訊。
協作價值部分取決於:
同時也取決於錯誤相關性:
若:
聚合的價值有限。
若雙方錯誤來源不同,且能被適當辨識,則互補機會較高。
7. 可檢驗命題
本文提出以下研究命題,而非宣告其已被證明。
命題 H1:條件可判斷性增益
在需要跨來源搜尋、問題分解與情境建構的開放型預測問題中,人機協作組的 將高於人類單獨組與 AI 單獨組。
命題 H2:準確度增益不是普遍性的
人機協作不會在所有問題類型上取得較佳適當評分。
此命題用以拒絕「協作必然優越」假設。
命題 H3:檢索與分解是關鍵中介
具備時間一致資料檢索、問題分解與多次聚合的 AI 系統,將優於裸模型單次回答。
命題 H4:錯誤多樣性調節互補效果
當人類與 AI 的資訊來源及錯誤結構較為互補時,人機協作增益較高。
命題 H5:人機協作首先改善結構,而非必然改善命中
在研究早期,人機協作對 的提升可能先於對 Brier score 或 log score 的提升。
這表示協作先讓問題變得可研究,未必立即讓答案變得更準。
命題 H6:未校準的壓縮造成過度自信
若協作系統只追求減少情境數量或提高預測集中度,而缺乏校準約束,則其熵可能降低,但適當評分惡化。
命題 H7:持續更新優於一次性預測
在資訊持續變化的問題上,明確更新協議的人機協作系統將優於只做一次判斷的系統。
8. 實證研究設計
8.1 整體設計
建議採取預註冊、縱向、三組或四組比較實驗:
- Human-only:人類獨立完成;
- AI-only:AI 系統獨立完成;
- Human–AI:人類可與 AI 反覆協作;
- Human–AI Protocol:使用結構化協作協議的人機組。
第四組用以區分:
與:
的差別。
8.2 問題類型
樣本應涵蓋:
封閉二元問題
例如:
- 某事件是否在指定日前發生?
多類別問題
例如:
- 某制度將優先採取哪一種實作方式?
數值區間問題
例如:
- 某指標將落在哪個區間?
結構預測問題
例如:
- 哪些前置條件將先後出現?
- 最可能形成哪幾條制度路徑?
- 哪些可觀測信號代表預測正在實現?
深度不確定性問題
無法合理假定單一機率模型,需要建立多情境與穩健判斷。
8.3 時間範圍
至少分為:
- 短期:1 至 4 週;
- 中短期:1 至 3 個月;
- 中期:6 至 12 個月;
- 長期:2 年以上。
不同時間尺度不可直接混合計分。
8.4 每次預測的必要輸出
每個參與者或系統必須提交:
forecast:
question: ""
timestamp: ""
information_cutoff: ""
probability:
outcomes: {}
scenarios:
- id: ""
description: ""
probability: null
preconditions:
necessary: []
enabling: []
blocking: []
leading_indicators: []
falsifiers: []
update_triggers: []
confidence_notes: []
unresolved_unknowns: []
sources: []
這使研究能同時評估結果與結構。
8.5 資訊時間封鎖
預測研究最容易受到未來資訊洩漏污染。
所有組別必須遵守:
使用 AI 網路檢索時,應保存:
- 查詢時間;
- 來源發布時間;
- 網頁快照或來源雜湊;
- 模型知識截止資訊;
- 是否檢索到事後更新頁面。
8.6 主要評估指標
Brier score
Log score
校準誤差
以分箱或連續校準方法估計預測機率與實際頻率差距。
尖銳度
衡量分布集中程度,但只能在校準條件下解讀。
情境涵蓋率
情境效率
情境效率必須與涵蓋率共同報告。
條件可判斷性
由盲化評審依照預註冊量表評估:
- 可分解性;
- 條件明確性;
- 可否證性;
- 可更新性;
- 可追溯性。
至少兩名評審,並報告評審一致性。
更新延遲
從重大證據出現到預測被修正的時間:
成本
包括:
- 人類時間;
- 模型推理成本;
- 搜尋成本;
- 評審成本;
- 每單位預測品質改善所需成本。
8.7 條件可判斷性量表草案
每項以 0 至 4 分評估。
可分解性
- 0:問題完全未拆解;
- 1:列出少量因素但無結構;
- 2:形成子問題;
- 3:形成依賴與優先關係;
- 4:形成可測量的因果或條件圖。
條件明確性
- 0:只有結論;
- 1:有籠統理由;
- 2:列出部分前置條件;
- 3:區分必要、促成與阻礙條件;
- 4:條件與結果間具有明確可檢查映射。
可否證性
- 0:無法被判定錯誤;
- 1:只有模糊撤回語句;
- 2:有至少一項否證觀察;
- 3:否證條件具時間與指標;
- 4:可明確觸發機率下修或模型撤回。
可更新性
- 0:一次性敘述;
- 1:表示會更新但無規則;
- 2:列出更新資料;
- 3:列出更新觸發條件;
- 4:有版本、時間與更新幅度紀錄。
可追溯性
- 0:沒有來源;
- 1:來源不完整;
- 2:可回溯主要資料;
- 3:可回溯資料與推論角色;
- 4:具有時間封鎖、版本與人機貢獻紀錄。
9. 協作協議草案
9.1 第一階段:人類提出問題
人類必須先獨立記錄:
- 為何此問題值得研究;
- 初始直覺;
- 已知與未知;
- 不希望 AI 預先覆蓋的原始判斷。
這能避免 AI 輸出完全取代人類初始訊號。
9.2 第二階段:AI 獨立分解
AI 在看見人類完整結論前,獨立完成:
- 問題重寫;
- 子問題;
- 基準率;
- 歷史類比;
- 候選情境;
- 反例;
- 所需資料。
此設計保留一定程度的資訊獨立性。
9.3 第三階段:差異比較
比較:
特別標記:
- AI 發現而人類未發現的條件;
- 人類知道但 AI 無法取得的語境;
- 雙方共同假設;
- 互相矛盾之處;
- 可能的共享錯誤來源。
9.4 第四階段:反駁循環
雙方分別回答:
- 哪個情境最可能被高估?
- 哪個關鍵資料可能是錯的?
- 哪個結果被敘述方式排除?
- 若相反結果發生,最合理的原因是什麼?
- 哪一項前置條件其實不是必要條件?
9.5 第五階段:聚合
最終輸出必須保留:
- 一致部分;
- 人類保留意見;
- AI 保留意見;
- 未解衝突;
- 最終機率;
- 更新觸發器。
不得只保留協商後的單一流暢敘述。
10. 可能的失敗模式
10.1 自動化偏誤
人類可能因 AI 語言流暢而高估其正確性。
10.2 相關性忽視
人類可能把 AI 輸出當成獨立證據,但 AI 其實使用了與人類相同的公開資料。
重複資訊被錯誤計算兩次,可能造成:
10.3 過度情境生成
AI 可以輕易生成大量情境,但數量本身不代表涵蓋品質。
過多情境會使所有結果都能被事後宣稱為「曾經考慮」。
10.4 敘事一致性幻覺
AI 擅長將零散資料組成連貫故事,但連貫性不等於因果正確性。
10.5 過度壓縮
為了給出清楚結論,系統可能過早排除低機率但高影響路徑。
10.6 評估污染
研究者可能在結果發生後重新定義:
- 原問題;
- 成功條件;
- 時間範圍;
- 所謂「結構命中」。
因此,所有定義必須在結果未知時保存。
10.7 選擇性公開
只公開命中的預測,會使人機協作能力被系統性高估。
完整研究必須保存所有預註冊預測。
11. 與拉普拉斯式預測的區分
本文不主張:
本文只主張這是一個可檢驗問題:
拉普拉斯妖要求:
- 完整狀態資訊;
- 完整動力學規律;
- 無限或充分計算能力;
- 不受觀測與預測反作用影響;
- 未來狀態空間不因智能創新而改變。
現實社會與技術系統不滿足這些條件。
本文所謂可預判邊界擴張,只表示:
- 更多問題可以被操作;
- 更多條件可以被辨識;
- 更多未知可以被精確命名;
- 更多判斷可以被校準與撤回。
它不表示未知將被消滅。
12. 理論上的重要區分
12.1 命中率與可判斷率
命中率
預測結果是否正確。
可判斷率
某類問題中,有多少比例能被轉化為符合最低 門檻的預測對象。
設某領域問題集合為 ,則:
一個系統可能未立即大幅提高命中率,卻提高可判斷率。
這仍然具有價值,因為它使後續驗證與累積學習成為可能。
12.2 無知減少與不確定性減少
無知減少表示我們更清楚:
- 不知道什麼;
- 缺少什麼資料;
- 哪些模型互相衝突;
- 哪些結果無法區分。
不確定性未必同時下降。
因此:
不必然導致:
更完整的認識有時反而會擴大合理情境,因為原先被忽略的可能性被發現。
12.3 預測與預備
預測追求:
預備則追求:
或其他穩健策略準則。
人機協作即使不能提高單一路徑預測,也可能透過更好的情境結構改善預備。
13. 適用領域
13.1 技術與科學發展
適合研究:
- 技術前置條件;
- 實驗能力演化;
- 研究工具普及;
- 學術制度變化;
- 產品類別形成。
不宜只依賴產品名稱命中,應評估結構路徑。
13.2 公共政策
人機協作可用於:
- 辨認政策觸發條件;
- 建立多情境影響;
- 預先列出撤回條件;
- 追蹤政策假設失效。
但政策預測公開後可能改變行動者行為,相關反身性應另行建模。
13.3 經濟與產業
可評估:
- 需求路徑;
- 成本下降條件;
- 供應鏈瓶頸;
- 商業模式替代;
- 制度採用。
金融市場等高度策略性領域的結果,不應直接外推至所有未來預測。
13.4 災害與風險治理
即使無法精確預測事件,仍可改善:
- 風險條件;
- 領先指標;
- 脆弱點;
- 觸發式應變策略。
14. 公開預測資料庫的研究價值
若要驗證本文,單次成功案例遠遠不夠。
需要建立可公開審計的預測資料:
prediction_record:
id: ""
created_at: ""
horizon: ""
domain: ""
group: "human | ai | human_ai"
original_question: ""
operationalized_question: ""
probability: {}
scenarios: []
preconditions: []
falsifiers: []
update_rules: []
evidence_cutoff: ""
later_updates: []
resolution: null
scores: {}
此資料庫的價值不是展示預測者多聰明,而是讓後續研究能回答:
- 哪類問題可以被有效壓縮?
- 人機協作在哪些領域失敗?
- 哪種互動流程產生增益?
- AI 是否提高條件完整性卻降低校準?
- 人類在哪些情況能修正 AI?
- AI 在哪些情況能修正人類?
- 哪些預測只是使用了模糊語言逃避失敗?
15. 反證標準
一個有意義的理論必須說明自己可能如何失敗。
本文框架在以下結果下將受到明顯削弱:
- 人機協作在長期、跨領域、預註冊資料中,既不改善適當評分,也不改善 ;
- 條件可判斷性評分無法取得可信的評審一致性;
- 較高 與後續準確度、更新效率或決策品質完全無關;
- 所謂結構壓縮只能在事後重新解釋,無法事前編碼;
- 協作增益完全可由增加時間或成本解釋;
- AI 只增加文字長度,並未增加獨立資訊或可檢查條件;
- 人機組的錯誤在不同問題與模型版本間無法重現。
16. 研究限制
16.1 狀態空間難以窮舉
真實未來常包含事前未被命名的狀態,因此 通常只是建模集合,不是完整宇宙。
16.2 結構命中難以評分
某種制度可能以不同名稱或不同技術實作出現。研究者必須在事前定義:
- 完全命中;
- 結構命中;
- 部分命中;
- 不可判定;
- 失敗。
16.3 長期預測需要較長觀測期
短期結果可能偏好易解決問題,無法代表真正的長期預見能力。
16.4 模型持續變動
「AI-only」不是穩定處置。模型、搜尋能力與工具鏈會持續更新,因此每次實驗都必須保存完整版本資訊。
16.5 協作成本
即使人機協作更準確,若其成本遠高於單獨方法,也未必具有實際價值。
16.6 價值與事實不可完全分離
何種未來值得預測、何種錯誤最嚴重、何種風險應優先處理,仍包含規範性判斷。
17. 討論
17.1 從答案競賽轉向可知性工程
預測研究常聚焦於誰給出最準的數字。
本文提出另一種研究方向:
其目標不是保證正確,而是改善:
- 問題表示;
- 條件結構;
- 不確定性分類;
- 更新接口;
- 歷史可追溯性。
一個原本無法被評估的模糊預言,即使偶然命中,也不具有高認識價值。
一個明確、可否證、可更新的條件預測,即使最後失敗,仍能告訴我們:
- 哪個假設錯了;
- 哪個條件沒有成立;
- 哪個模型需要修改。
17.2 失敗也能構成認識增益
若預測被完整記錄,失敗可以產生:
若預測沒有條件、版本與來源歷史,失敗只會消失在敘事中。
因此,本文的長期目標不是建立「命中紀念館」,而是建立可以累積失敗的預測科學。
17.3 人機協作的真正強項可能是尺度
人類超級預測者可以取得高品質判斷,但時間有限。AI 系統即使單題品質略低,也可能:
- 同時覆蓋更多問題;
- 更頻繁更新;
- 持續監測指標;
- 保留完整版本;
- 以低邊際成本重做分析。
因此,總體價值可能來自:
不能只比較單題平均分數。
17.4 可預判邊界不是終點
當某一類問題進入可預判邊界後,新的問題會出現:
- 預測公開是否改變結果?
- 行動者是否學會欺騙預測系統?
- AI 是否創造原模型不存在的新選項?
- 多個 AI 是否形成高階策略遞迴?
這些問題屬於智能化的不確定性生成,應由後續研究獨立處理。
18. 結論
人機協作預測的學術問題,不應被壓縮成:
人類加上 AI,是否能猜得更準?
更完整的問題是:
人類與 AI 能否共同把更多原本模糊、混亂、不可操作的未來問題,轉化為可以分解、條件化、否證、更新、校準與回溯的研究對象?
本文將此能力稱為條件可判斷性,將合理可能世界在校準約束下的縮減稱為未來空間壓縮,並將特定時刻能達到最低操作與預測品質的問題集合稱為可預判邊界。
其核心主張可以寫成:
人機協作未必在所有任務上優於表現較佳的一方。它可能產生自動化偏誤、相關性忽視、敘事幻覺與過度壓縮。因此,本文沒有把協作優越性當作前提,而是把它轉化為可預註冊、可否證的研究命題。
最終目標不是建造類拉普拉斯妖,而是測量:
作者貢獻說明
Neo.K: 核心問題提出、概念方向、理論命題、人機協作預測研究構想。
Aletheia(GPT-5.6 Thinking): 概念形式化、文獻整合、研究設計與初稿撰寫。
投稿至不接受人工智能列名作者的期刊時,可依該期刊政策調整署名方式,並在方法或致謝中完整揭露 AI 的研究與寫作貢獻。
利益衝突聲明
本文為概念性與方法論研究。作者聲明目前無與本文核心命題直接相關的財務利益衝突。
資料與程式碼可得性
本文未使用新的實證資料。後續驗證研究應公開預註冊方案、去識別化預測紀錄、評分程式與模型版本資訊。
參考文獻
Brier, G. W. (1950). Verification of forecasts expressed in terms of probability. Monthly Weather Review, 78(1), 1–3. doi:10.1175/1520-0493(1950)078<0001:VOFEIT>2.0.CO;2
Corvelo Benz, N. L., & Gomez Rodriguez, M. (2025). Human-alignment influences the utility of AI-assisted decision making. Scientific Reports, 15, 29154. doi:10.1038/s41598-025-12205-1
Gneiting, T., Balabdaoui, F., & Raftery, A. E. (2007). Probabilistic forecasts, calibration and sharpness. Journal of the Royal Statistical Society: Series B, 69(2), 243–268. doi:10.1111/j.1467-9868.2007.00587.x
Gneiting, T., & Raftery, A. E. (2007). Strictly proper scoring rules, prediction, and estimation. Journal of the American Statistical Association, 102(477), 359–378. doi:10.1198/016214506000001437
Gonzalez, C., & Heidari, H. (2025). A cognitive approach to human–AI complementarity in dynamic decision-making. Nature Reviews Psychology, 4, 808–822. doi:10.1038/s44159-025-00499-x
Halawi, D., Zhang, F., Yueh-Han, C., & Steinhardt, J. (2024). Approaching human-level forecasting with language models. arXiv preprint arXiv:2402.18563.
Inkpen, K., Chappidi, S., Mallari, K., Nushi, B., Ramesh, D., Michelucci, P., Mandava, V., Vepřek, L. H., & Quinn, G. (2023). Advancing human–AI complementarity: The impact of user expertise and algorithmic tuning on joint decision making. ACM Transactions on Computer-Human Interaction, 30, 1–29. doi:10.1145/3534561
Lempert, R. J. (2019). Robust Decision Making (RDM). In V. A. W. J. Marchau, W. E. Walker, P. J. T. M. Bloemen, & S. W. Popper (Eds.), Decision Making under Deep Uncertainty (pp. 23–51). Springer. doi:10.1007/978-3-030-05252-2_2
Lempert, R. J., Groves, D. G., Popper, S. W., & Bankes, S. C. (2006). A general, analytic method for generating robust strategies and narrative scenarios. Management Science, 52(4), 514–528. doi:10.1287/mnsc.1050.0472
Marchau, V. A. W. J., Walker, W. E., Bloemen, P. J. T. M., & Popper, S. W. (Eds.). (2019). Decision Making under Deep Uncertainty: From Theory to Practice. Springer. doi:10.1007/978-3-030-05252-2
Mellers, B., Ungar, L., Baron, J., Ramos, J., Gurcay, B., Fincher, K., Scott, S. E., Moore, D., Atanasov, P., Swift, S. A., Murray, T., Stone, E., & Tetlock, P. E. (2014). Psychological strategies for winning a geopolitical forecasting tournament. Psychological Science, 25(5), 1106–1115. doi:10.1177/0956797614524255
Mellers, B., Stone, E., Murray, T., Minster, A., Rohrbaugh, N., Bishop, M., Chen, E., Baker, J., Hou, Y., Horowitz, M., Ungar, L., & Tetlock, P. E. (2015). Identifying and cultivating superforecasters as a method of improving probabilistic predictions. Perspectives on Psychological Science, 10(3), 267–281. doi:10.1177/1745691615577794
Schoenegger, P., & Park, P. S. (2023). Large language model prediction capabilities: Evidence from a real-world forecasting tournament. arXiv preprint arXiv:2310.13014.
Steyvers, M., Tejeda, H., Kerrigan, G., & Smyth, P. (2022). Bayesian modeling of human–AI complementarity. Proceedings of the National Academy of Sciences, 119(11), e2111547119. doi:10.1073/pnas.2111547119
Tetlock, P. E. (2005). Expert Political Judgment: How Good Is It? How Can We Know? Princeton University Press.
Tetlock, P. E., & Gardner, D. (2015). Superforecasting: The Art and Science of Prediction. Crown.
Vaccaro, M., Almaatouq, A., & Malone, T. W. (2024). When combinations of humans and AI are useful: A systematic review and meta-analysis. Nature Human Behaviour, 8, 2293–2303. doi:10.1038/s41562-024-02024-1
附錄 A:最小預註冊模板
study:
title: ""
registration_date: ""
registration_platform: ""
research_questions:
- ""
hypotheses:
H1: ""
H2: ""
groups:
- human_only
- ai_only
- human_ai_free
- human_ai_protocol
forecast_domains:
- technology
- policy
- economy
- science
- geopolitics
horizons:
- 1_month
- 3_months
- 12_months
- 24_months
primary_metrics:
- brier_score
- log_score
- calibration_error
- conditional_judgeability
secondary_metrics:
- scenario_coverage
- scenario_efficiency
- update_latency
- cost
- traceability
exclusion_rules: []
missing_data_policy: ""
model_versions: []
information_cutoff_policy: ""
analysis_plan: ""
附錄 B:預測紀錄最小格式
{
"prediction_id": "pred-000001",
"created_at": "2026-07-19T00:00:00+08:00",
"group": "human_ai_protocol",
"question": "",
"resolution_criteria": "",
"close_date": "",
"information_cutoff": "",
"outcome_probabilities": {},
"scenarios": [],
"necessary_conditions": [],
"enabling_conditions": [],
"blocking_conditions": [],
"leading_indicators": [],
"falsifiers": [],
"update_triggers": [],
"unknowns": [],
"human_initial_judgment": {},
"ai_independent_judgment": {},
"final_joint_judgment": {},
"disagreements_preserved": [],
"sources": [],
"model_metadata": {},
"updates": [],
"resolution": null,
"scores": null
}
附錄 C:名詞對照
| 中文 | 英文 | 定義 |
|---|---|---|
| 條件可判斷性 | Conditional judgeability | 未來問題可被分解、條件化、否證、更新與追溯的程度 |
| 未來空間壓縮 | Future-space compression | 合理候選未來集合或分布在分析後的縮減 |
| 有效壓縮 | Valid compression | 不犧牲校準、涵蓋率與適當評分的壓縮 |
| 可預判邊界 | Predictability frontier | 在特定資料與方法下達到最低可操作與預測品質的問題集合 |
| 結構預測 | Structural forecasting | 預測條件、路徑、關係與制度形態,而非只預測表面名稱 |
| 可判斷率 | Judgeability rate | 一個領域中能被轉化為合格預測對象的問題比例 |
| 更新延遲 | Update latency | 新證據出現到預測修正之間的時間 |
| 過度壓縮 | Overcompression | 透過錯誤排除未來狀態而取得表面確定性 |