---
title: "從發布失敗到重返前沿：GPT-5 系列在 2025—2026 年的能力合流、產品化臨界點與「突然變強」現象"
subtitle: "一份基於官方發布、獨立評測與外部使用體感的時間線觀察報告"
author: "Neo.K"
collaboration: "Aletheia（GPT）協作整理"
date: "2026-07-15"
document_type: "觀察性論文報告"
status: "公開研究草稿"
---

# 從發布失敗到重返前沿：GPT-5 系列在 2025—2026 年的能力合流、產品化臨界點與「突然變強」現象

## 摘要

2025 年上半年至 2026 年中期，OpenAI 的 GPT 系列經歷了一段外部評價高度矛盾的發展期。一方面，GPT-4.5、o3、o4-mini、GPT-4.1、Codex 與 GPT-5 相繼推出，顯示 OpenAI 在預訓練、推理、長上下文、工具使用與 Agent 化方面同時推進；另一方面，GPT-5 初次發布時卻因模型替換、路由不穩、使用者控制權下降、語氣改變及體感不一致而遭遇大量批評。此後不到一年，GPT-5.4、GPT-5.5 與 GPT-5.6 又使 GPT 系列重新成為綜合能力、程式 Agent、專業知識工作與成本效率前沿的重要競爭者，形成「先被認為退步，後又突然變強」的外部印象。

本文提出：GPT 的回歸並非源自某一次神祕的單模型躍升，而是多條原本分離的技術路線逐步合流，並在 2026 年春季跨越產品效用臨界點。這些路線包括大型預訓練模型、測試時計算、自適應推理、真實軟體工程強化學習、工具調用、電腦操作、長程任務持續性、模型路由及產品介面整合。GPT-5.0 是統一架構的早期版本，但其產品實作尚未成熟；GPT-5.1 修復溝通與使用體驗；GPT-5.2 將能力轉向專業工作；GPT-5.3-Codex 完成程式 Agent 與通用推理的初步合流；GPT-5.4 首次把 Codex 的前沿能力正式併入 GPT 主線；GPT-5.5 則在獨立綜合評測中明確重新領先。GPT-5.6 未必在所有單項通用智力指標上排名第一，但已建立更完整的能力—成本—Agent 執行前沿。

本文因此主張，所謂「重回寶座」不應理解為單一榜單上的永久第一，而應理解為 GPT 從聊天模型重新演化為一套能夠推理、操作工具、持續執行、驗證結果並交付工作成果的整合智能系統。

**關鍵詞：** GPT-5、Codex、推理模型、Agent、強化學習、工具使用、產品化、模型路由、知識工作、人工智慧競爭

---

## 一、問題意識：為什麼外部感覺像是「突然」變強？

若只依照一般使用者的記憶，GPT 系列在 2025 年至 2026 年的發展容易被敘述成一條不連續的曲線：

1. GPT-4o 曾具有強烈的日常使用黏性；
2. GPT-4.5 沒有帶來與名稱相稱的世代震撼；
3. o 系列推理能力強，但產品線分裂且使用成本較高；
4. GPT-5 發布後反而出現「變笨、變冷、變不穩」的批評；
5. 後續 GPT-5.x 名稱密集出現，外部一度難以辨認每次更新的實質差異；
6. 到 2026 年春季後，GPT 又突然在程式開發、研究、文件、工具操作、長任務與綜合工作中顯得非常強。

這種感受並非純粹錯覺，但它混合了至少四種不同現象：

- **底層模型能力變化；**
- **推理時間與算力配置變化；**
- **工具、Agent 與執行環境變化；**
- **ChatGPT 產品介面與路由策略變化。**

若把這些因素都壓縮成「某個 GPT 版本比較聰明」，就會錯過真正的技術轉折。

本文採用下列基本區分：

$$
\text{模型能力} \neq \text{產品能力} \neq \text{使用者感受到的能力}
$$

一個底層模型即使更強，只要被較差的路由器選錯、被限制在不適合的推理強度、無法使用工具、無法保存任務狀態，或在介面上失去可控性，使用者仍可能認為它退步。

反過來說，一個底層智力只增加有限幅度的模型，若同時獲得更好的工具、執行環境、上下文管理、驗證閉環與產品整合，其實際工作能力可能出現非線性增長。

---

## 二、研究範圍與證據分級

本文觀察期間為 2025 年 2 月至 2026 年 7 月 15 日，主要使用三類資料：

### 2.1 第一級：官方發布與系統卡

用來確認模型發布日期、官方定位、功能合流、評測結果及產品設計。官方資料可以證明「公司宣稱並部署了什麼」，但不能單獨證明所有外部情境中的實際優越性。

### 2.2 第二級：獨立模型評測

本文主要引用 Artificial Analysis 的綜合智力、Coding Agent 與知識工作評測。這些結果比單一公司自評更具有比較價值，但仍受到測試集、Agent harness、推理預算、價格計算及版本快照影響。

### 2.3 第三級：產品發布後的公共反應

包括 GPT-5 初次發布後的模型選擇器、路由與 GPT-4o 恢復事件。此類資料適合證明產品體感與市場反應，卻不等同於底層能力測量。

### 2.4 第四級：本文的結構性推論

例如「Codex 是高品質 Agent 強化學習場」、「多條能力線在 GPT-5.4 跨越臨界點」等，是根據公開時間線作出的合理推論，而非 OpenAI 已公開的完整訓練配方。本文將這些判斷明確標示為推論，不把它們偽裝成內部事實。

---

## 三、核心分析模型：能力不是加法，而是乘法

為了描述使用者真正感受到的 GPT 能力，本文定義一個簡化的系統效用模型：

$$
U_t
=
M_t
\cdot
R_t
\cdot
T_t
\cdot
H_t
\cdot
P_t
\cdot
C_t
$$

其中：

- $M_t$ ：基礎模型的知識、表徵與生成能力；
- $R_t$ ：推理、規劃與測試時計算能力；
- $T_t$ ：搜尋、Python、檔案、瀏覽器、電腦操作與外部工具能力；
- $H_t$ ：Agent harness、沙盒、終端、測試、記憶壓縮及任務調度；
- $P_t$ ：產品介面、模型選擇、路由、額度與使用者控制；
- $C_t$ ：跨長上下文與多步驟工作的持續性。

這是一個概念模型，而非可直接測量的物理定律。採用乘法的原因是：任何一個因素接近零，都可能使整個工作流失敗。

例如：

- 模型會寫程式，但不能執行測試，則可靠性受限；
- 模型具備推理能力，但路由器沒有啟動推理，則能力沒有顯化；
- 模型能操作工具，但長任務中遺失狀態，則無法完成工程；
- 底層模型更強，但產品移除使用者熟悉的模型與控制，則體感可能下降。

因此，使用者感受到的「突然變強」可以形式化為：

$$
\Delta U_t
>
\Delta M_t
$$

亦即，實際效用的增幅可能遠大於基礎模型本身的增幅，因為其餘多個乘數同時上升。

---

## 四、前史：GPT-5 之前其實已經存在多條分裂的能力線

## 4.1 2025 年 2 月 27 日：GPT-4.5 與預訓練擴張路線

GPT-4.5 的官方定位很重要。OpenAI 明確表示，GPT-4.5 並不像 o1 那樣先進行推理，而是透過擴大預訓練提高一般知識、自然互動與模式辨識能力。這代表當時 OpenAI 已經把未來能力分成兩條路：

$$
\text{預訓練擴張}
\quad+\quad
\text{推理擴張}
$$

GPT-4.5 的問題不是完全沒有進步，而是它的優勢偏向隱性的知識廣度、自然度與判斷感，沒有直接轉化成大眾期待的複雜推理躍升。它更像一塊更好的底盤，而不是完成品。

## 4.2 2025 年 4 月：o3、o4-mini 與工具化推理

o3 與 o4-mini 將推理、視覺理解與工具使用結合。這一階段證明，OpenAI 已能讓模型在回答前配置更多計算，並在需要時使用 Python、搜尋、檔案與圖片工具。

然而，當時的能力仍以獨立模型族群存在：

$$
\text{GPT 通用模型}
\parallel
\text{o 系列推理模型}
$$

一般使用者必須理解不同模型的特性、成本與適用任務，產品複雜度很高。

## 4.3 2025 年 5 月：Codex 把模型放進可驗證的工作環境

Codex 的關鍵不只是「更會寫程式」，而是把模型放進一個具有下列結構的工作環境：

$$
\text{理解程式庫}
\rightarrow
\text{修改檔案}
\rightarrow
\text{執行命令}
\rightarrow
\text{讀取錯誤}
\rightarrow
\text{重新修改}
\rightarrow
\text{提交結果}
$$

這和一般聊天模型有根本差異。聊天模型的答案通常只被人類主觀評價；程式 Agent 則可以由編譯器、測試、型別檢查、執行結果與版本差異提供高密度回饋。

由此可以提出一項重要推論：

> Codex 不只是 OpenAI 的程式產品，也可能是其最重要的可驗證長程 Agent 能力培養場之一。

---

## 五、GPT-5.0：架構方向正確，發布結果卻掩蓋了進步

## 5.1 2025 年 8 月 7 日：統一系統正式出現

GPT-5 的官方架構不是一個完全單一的模型，而是一套統一系統，包括：

- 快速回答模型；
- 深度推理模型；
- 根據任務複雜度、工具需要與使用者意圖選擇模式的即時路由器。

其理想形式是：

$$
\text{輸入}
\rightarrow
\text{路由判斷}
\rightarrow
\begin{cases}
\text{快速回答}, & \text{簡單任務}\\
\text{深度推理}, & \text{複雜任務}
\end{cases}
$$

這個方向本身十分合理。它試圖讓普通使用者不再手動理解 GPT、o 系列及各種模型名稱，而由系統自動配置智能。

## 5.2 發布為何被大量批評？

GPT-5 發布時，同時替換了 GPT-4o、o3、o4-mini、GPT-4.1 與 GPT-4.5 等舊模型。外部報導指出，發布初期路由器表現不穩，部分使用者感覺請求被分配到較弱或不適合的模式；模型選擇器與 GPT-4o 隨後又被恢復給部分付費使用者。

因此，GPT-5.0 的失敗不是單一的「模型智力失敗」，而是三層失配：

### 第一層：能力路由失配

模型具有深度推理能力，不代表每次請求都會正確觸發。

### 第二層：產品控制失配

系統希望替使用者做決策，卻移除了使用者原有的模型控制權。

### 第三層：人格與互動失配

部分使用者熟悉 GPT-4o 的語氣與互動節奏；即使 GPT-5 在技術測試上更強，突然更換風格仍會被感受為退步。

可將當時狀態概括為：

$$
M_{5.0} > M_{\text{舊}}
$$

但同時：

$$
P_{5.0} < P_{\text{舊}}
$$

因此總體可能出現：

$$
U_{5.0} \leq U_{\text{舊}}
$$

至少對某些使用者與任務而言如此。

## 5.3 GPT-5.0 的真正歷史角色

GPT-5.0 並不是成熟的重新登頂版本，而是統一架構的第一次大規模上線。它完成了「GPT 與 o 系列合流」的制度設計，卻沒有立即完成產品層與體感層的校準。

換句話說：

> GPT-5.0 是正確架構的粗糙初版，而不是最後勝利版本。

---

## 六、2025 年秋冬：從修復體感到建立專業工作能力

## 6.1 2025 年 9 月：GPT-5-Codex 開始形成隱性轉折

GPT-5-Codex 將 GPT-5 進一步針對真實軟體工程任務優化。官方資料指出，相關模型以真實程式工作進行強化學習，能反覆執行測試直到獲得需要的結果。

這代表訓練目標開始從：

$$
\text{生成看似正確的答案}
$$

轉向：

$$
\text{在環境中完成可驗證的任務}
$$

這一改變十分重要。因為對 Agent 而言，真正困難的不只是第一步推理，而是：

- 是否記得任務目標；
- 是否能辨認錯誤；
- 是否能修正自己的工作；
- 是否能在多次工具調用後保持一致；
- 是否能停止於真正完成，而不是語言上宣稱完成。

## 6.2 2025 年 11 月：GPT-5.1 修復「聰明但不好用」

GPT-5.1 的官方重點是：

- Instant 更溫暖；
- 指令遵循更好；
- Thinking 在簡單問題上更快；
- 在複雜問題上更持續；
- 回答更容易理解；
- 提供更細的語氣與人格控制。

這說明 OpenAI 已承認模型品質不能只由抽象智力定義：

$$
Q
=
\text{正確性}
+
\text{可理解性}
+
\text{指令遵循}
+
\text{互動適配}
$$

GPT-5.1 的價值不一定是所有 benchmark 大幅躍升，而是修復 GPT-5.0 造成的產品體感斷裂。

同月推出的 GPT-5.1-Codex-Max 又強化長時間、跨多個上下文視窗的專案工作，顯示 Codex 支線正在解決「如何持續工作」而不只是「如何回答」。

## 6.3 2025 年 12 月：GPT-5.2 第一次呈現明顯的專業工作躍升

GPT-5.2 將定位從一般聊天進一步推向：

- 程式開發；
- 長文件理解；
- 試算表與簡報；
- 視覺介面理解；
- 工具使用；
- 多步驟知識工作；
- 更低的事實錯誤率。

官方公布的若干結果包括：

- GDPval 的勝或和比例由 GPT-5 的 $38.8\%$ 上升至 GPT-5.2 Thinking 的 $70.9\%$ ；
- SWE-Bench Pro 達 $55.6\%$ ；
- SWE-bench Verified 達 $80.0\%$ ；
- 在帶搜尋的 ChatGPT 查詢中，無錯誤回答比例提高；
- 長上下文、多工具與視覺介面理解均顯著改善。

這是 GPT-5 路線第一次明確顯示：它不只是把原有聊天能力做得更好，而是在成為「工作產出模型」。

同月的 GPT-5.2-Codex 又強化大型重構、遷移、Windows、上下文壓縮與長時間工程任務，使 Codex 支線繼續領先主線的 Agent 執行能力。

---

## 七、真正的臨界點：GPT-5.3-Codex 與 GPT-5.4 的能力合流

## 7.1 2026 年 2 月 5 日：GPT-5.3-Codex 把兩條線合在同一模型

OpenAI 對 GPT-5.3-Codex 的官方描述十分直接：它把 GPT-5.2-Codex 的前沿程式能力，與 GPT-5.2 的推理及專業知識能力結合在同一模型中，並提高執行速度。

這可寫成：

$$
\text{GPT-5.3-Codex}
=
\text{前沿程式 Agent}
+
\text{通用推理}
+
\text{專業知識}
+
\text{長程執行}
$$

這是「突然變強」現象背後最重要的準備階段。

在此之前，OpenAI 最好的通用模型與最好的程式 Agent 能力並不完全位於同一主線。GPT-5.3-Codex 首次表明，Codex 已不只是專用支線，而是下一代通用智能的重要能力來源。

## 7.2 2026 年 3 月 3 日：GPT-5.3 Instant 修復日常預設模型

GPT-5.3 Instant 改善日常對話、搜尋結果脈絡、過度警告、無意義的死路及過度斷言式語氣。

這類改進很少被視為「智力突破」，卻直接影響數億次普通互動。它降低了使用者必須反覆澄清、要求重寫或糾正模型態度的成本。

## 7.3 2026 年 3 月 5 日：GPT-5.4 把 Codex 能力正式併入 GPT 主線

GPT-5.4 是本文認定的真正結構轉折點。OpenAI 明確表示，它是第一個納入 GPT-5.3-Codex 前沿程式能力的主線推理模型。

這不是小幅版本升級，而是能力來源的重新組裝：

$$
\text{主線 GPT}
\leftarrow
\text{Codex 的程式、工具與長程執行能力}
$$

GPT-5.4 的官方評測也出現明顯跳升：

| 評測 | GPT-5.2 | GPT-5.3-Codex | GPT-5.4 |
|---|---:|---:|---:|
| GDPval（勝或和） | $70.9\%$ | $70.9\%$ | $83.0\%$ |
| SWE-Bench Pro | $55.6\%$ | $56.8\%$ | $57.7\%$ |
| OSWorld-Verified | $47.3\%$ | $74.0\%$ | $75.0\%$ |
| Toolathlon | $46.3\%$ | $51.9\%$ | $54.6\%$ |
| BrowseComp | $65.8\%$ | $77.3\%$ | $82.7\%$ |

其中最值得注意的並非單純程式測試，而是 OSWorld、Toolathlon 與 BrowseComp。它們反映的不是只回答題目，而是使用工具、操作環境、搜尋資訊並完成任務。

因此，GPT-5.4 可以被視為：

> OpenAI 將「會回答的模型」與「會做事的 Agent」正式合併成同一條主產品線的版本。

---

## 八、2026 年 4 月：GPT-5.5 才是外部意義上的明確重新登頂

GPT-5.5 於 2026 年 4 月 23 日發布，官方將其定位為更擅長程式、研究、資訊統合、資料分析、文件與跨工具工作的模型。

官方評測包括：

- GDPval： $84.9\%$ ；
- OSWorld-Verified： $78.7\%$ ；
- Tau2-bench Telecom： $98.0\%$ ；
- 專業財務、辦公文件與科學資料分析能力進一步提升。

更關鍵的是，獨立評測機構 Artificial Analysis 在同日明確稱 GPT-5.5 為新的領先模型。其綜合智力指數領先當時第二名約三分，打破 OpenAI、Anthropic 與 Google 的並列狀態；同時，GPT-5.5 在其評測中比 GPT-5.4 減少約 $40\%$ 的輸出 token 使用量。

這代表 GPT-5.5 的提升不只是「用更多推理 token 暴力換分」，而是一定程度上的效率改善：

$$
\text{更高能力}
+
\text{更低 token 消耗}
=
\text{更好的有效智能密度}
$$

因此，若要回答「GPT 何時真正重回寶座」，最精確的分層答案是：

- **架構起點：** 2025 年 8 月 GPT-5.0；
- **能力明顯成熟：** 2025 年 12 月 GPT-5.2；
- **主線結構轉折：** 2026 年 3 月 5 日 GPT-5.4；
- **獨立綜合評測明確重新領先：** 2026 年 4 月 23 日 GPT-5.5。

---

## 九、GPT-5.6：不是永久全面第一，而是能力—成本—工作系統前沿

2026 年 7 月推出的 GPT-5.6 分為 Sol、Terra 與 Luna 等層級，用不同推理強度與價格覆蓋不同工作負載。

截至 2026 年 7 月中旬，Artificial Analysis 的結果顯示：

- GPT-5.6 Sol 在其通用 Intelligence Index 得分 $59$ ，比 Claude Fable 5 低一分；
- GPT-5.6 Sol 的每項任務成本約為該競爭模型的三分之一；
- GPT-5.6 Sol 在 Coding Agent Index 得分 $80$ ，排名第一；
- 在文件、簡報與試算表等知識工作評測中具有極強表現；
- 不同推理層級建立新的能力—成本 Pareto 前沿。

因此，將 GPT-5.6 描述為「所有榜單的絕對王者」並不準確。更合理的說法是：

$$
\text{GPT-5.6 的優勢}
=
\text{接近最高通用能力}
+
\text{領先的程式 Agent}
+
\text{更佳成本效率}
+
\text{完整產品整合}
$$

所謂「王座」已經不再是一張單維排行榜，而是多維前沿：

$$
\mathcal{F}
=
\{
\text{智力},
\text{成本},
\text{速度},
\text{工具},
\text{文件},
\text{程式},
\text{可靠性},
\text{產品可用性}
\}
$$

在這個意義下，GPT-5.6 即使沒有在每一個純智力指數上第一，仍可能是最強的綜合工作系統之一。

---

## 十、為什麼能力會在外部體感中呈現「相變」？

## 10.1 多條技術路線不是同步公開成熟

2025 年上半年，OpenAI 已經分別具備：

- GPT-4.5 的大型預訓練能力；
- o3／o4-mini 的推理能力；
- GPT-4.1 的長上下文與指令能力；
- Codex 的環境執行能力；
- Deep Research 的多步搜尋能力。

但當時這些能力仍分散在不同模型、模式與產品中。

因此，外部看到的是很多零件，而不是完整機器。

## 10.2 Codex 提供可執行、可驗證、可反覆修正的回饋

純文字對話的品質很難客觀判定，而程式與電腦任務具有更清楚的結果：

$$
r_t
=
\begin{cases}
1, & \text{測試通過或任務完成}\\
0, & \text{失敗}\\
-\lambda, & \text{破壞既有功能或違反限制}
\end{cases}
$$

這使程式 Agent 能透過更高密度的環境回饋學習：

- 規劃；
- 工具選擇；
- 錯誤恢復；
- 狀態維持；
- 結果驗證；
- 何時繼續與何時停止。

當這些能力回流主線模型後，其效益不只限於程式碼，也會外溢到研究、資料處理、文件製作與其他可工具化任務。

## 10.3 推理不再只是「想久一點」，而是資源調度

早期推理模型容易被理解成生成更長的隱性思考。GPT-5 系列逐步轉向更完整的資源配置問題：

$$
\pi(a_t \mid s_t, g, B)
$$

其中：

- $s_t$ 是目前任務狀態；
- $g$ 是目標；
- $B$ 是可用預算；
- $a_t$ 可以是回答、搜尋、執行程式、讀檔、操作電腦、呼叫子 Agent 或重新規劃。

當模型能選擇「下一步做什麼」，推理就從文字生成轉成行動策略。

## 10.4 長上下文只有配合壓縮與任務狀態才真正有用

單純宣稱支援數十萬或一百萬 token，不代表模型能在長任務中穩定工作。真正重要的是：

- 哪些資訊被保留；
- 哪些中間過程可壓縮；
- 哪些錯誤會污染後續；
- 是否能在多輪工具操作後維持目標；
- 是否能重新讀取外部產物，而不是只依賴內部上下文。

Codex-Max、GPT-5.2-Codex 與後續模型持續強調 compaction、長程任務與跨上下文工作，說明這已成為核心競爭面。

## 10.5 產品介面終於不再抵銷底層能力

GPT-5.0 時期，路由錯配、舊模型移除與控制權下降，使產品層成為負乘數。

後續版本逐步補回：

- Instant 與 Thinking 的差異；
- 推理強度控制；
- 模型選擇；
- 語氣與個人化；
- Codex 與 ChatGPT 的整合；
- 檔案、搜尋、連接器及電腦操作；
- 多 Agent 協作；
- 更穩定的工作產物交付。

因此，2026 年春季的體感跳升可以表示為：

$$
U_{5.4}
=
M_{\uparrow}
\cdot
R_{\uparrow}
\cdot
T_{\uparrow}
\cdot
H_{\uparrow}
\cdot
P_{\uparrow}
\cdot
C_{\uparrow}
$$

多個因素同時改善，使系統跨越某個使用臨界值 $U^\*$ ：

$$
U_{5.2} < U^\* \leq U_{5.4}
$$

在臨界值以下，使用者仍需要大量監督、重試與手動拼接；跨越臨界值後，模型開始能完整接手部分任務。這就是「突然強很多」的主要來源。

---

## 十一、榜單重新領先與使用者體感重新領先不是同一件事

GPT 是否「重回寶座」，至少有四種不同判準：

### 11.1 學術題目第一

看數學、科學、推理與知識評測。

### 11.2 程式 Agent 第一

看程式庫修改、終端操作、測試通過與長時間工程。

### 11.3 專業知識工作第一

看報告、簡報、試算表、財務模型、研究與跨工具任務。

### 11.4 一般產品體感第一

看速度、穩定性、語氣、記憶、檔案、額度、搜尋及介面。

單一模型可能在其中一項第一，卻不適合成為主要工作平台。因此本文使用「重返前沿」而非「永久統治」：

$$
\text{重返前沿}
\neq
\forall d,\ \operatorname{rank}_d = 1
$$

更適當的定義是：

$$
\text{重返前沿}
=
\text{在多數高價值維度進入第一梯隊，且形成可持續的產品優勢}
$$

GPT-5.5 在 2026 年 4 月確實曾獲得獨立綜合評測的明確第一；GPT-5.6 則顯示市場又進入快速交替狀態。這說明「王座」已變成暫時位置，而非長期身份。

---

## 十二、本文的主要命題

### 命題一：GPT-5.0 的批評與後續變強並不矛盾

GPT-5.0 可以同時具有更先進的底層架構與更差的初期產品體感。

$$
\text{架構進步}
\land
\text{發布失敗}
$$

兩者可以同時成立。

### 命題二：GPT 的重新領先主要由能力合流，而非單一路線擴張造成

其核心不是單純增大參數，而是：

$$
\text{預訓練}
+
\text{推理}
+
\text{工具}
+
\text{Agent}
+
\text{可驗證環境}
+
\text{產品整合}
$$

### 命題三：Codex 是整個 GPT-5 後期躍升的關鍵中介層

GPT-5.3-Codex 與 GPT-5.4 的官方時間線明確顯示，Codex 的程式與執行能力被併入通用主線。本文因此推論，Codex 不只是附屬產品，而是 GPT 主模型能力演進的重要實驗與訓練場。

### 命題四：2026 年 3 月是結構轉折，4 月是外部確認

- GPT-5.4：能力合流跨越臨界點；
- GPT-5.5：獨立評測確認其重新領先。

### 命題五：GPT-5.6 的優勢是系統前沿，而非所有單項永遠第一

GPT-5.6 顯示未來競爭將從「誰的單模型最高分」轉向：

$$
\max
\left(
\frac{
\text{完成任務的品質}
}{
\text{成本}
\times
\text{時間}
\times
\text{人工監督}
}
\right)
$$

---

## 十三、限制與反證條件

本文仍有以下限制：

1. OpenAI 沒有公開完整訓練資料、參數規模、強化學習配方與內部架構；
2. 官方 benchmark 可能偏向公司重視的能力；
3. 獨立評測也受 harness、提示、推理預算與版本快照影響；
4. ChatGPT 實際體感會因方案、地區、額度、路由與灰度發布而不同；
5. 模型排名可能在數週內被競爭者改寫；
6. Codex 能力回流主線的公開事實，不足以證明所有能力增長都由 Codex 訓練造成。

若未來出現下列證據，本文部分推論應被修正：

- OpenAI 公開證明 GPT-5.4 的主要增長與 Codex 訓練無關；
- 獨立重測顯示 GPT-5.5 的領先主要由特定推理預算或測試配置造成；
- 長期真實工作評測顯示模型並未降低人工監督需求；
- GPT-5.6 的成本與能力優勢在大規模部署中不能重現。

因此，本文不是宣告 OpenAI 已永久勝出，而是描述一個已可由公開時間線支持的能力合流現象。

---

## 十四、結論

GPT 並不是在某一天突然發明了全新的智能，也不是 GPT-5 這個名稱一出現就重新登頂。

更接近事實的歷程是：

1. GPT-4.5 提供更強的預訓練底盤；
2. o3／o4-mini 推進推理與工具使用；
3. GPT-4.1 改善長上下文與指令遵循；
4. Codex 建立可執行、可驗證、可反覆修正的 Agent 環境；
5. GPT-5.0 嘗試統一快速模型、推理模型與路由器，卻在發布與產品體感上失敗；
6. GPT-5.1 修復溝通、指令與使用者控制；
7. GPT-5.2 把能力推進到專業工作與長程任務；
8. GPT-5.3-Codex 把前沿程式 Agent 與通用推理合流；
9. GPT-5.4 將這種能力正式併入主線；
10. GPT-5.5 在獨立綜合評測中重新取得明確領先；
11. GPT-5.6 進一步建立接近最高智力、領先程式 Agent 與更佳成本效率的整合前沿。

因此，本文的最終判斷是：

> GPT 的「重回寶座」不是單模型復仇，而是 OpenAI 在近一年內把原本分裂的預訓練、推理、Codex、工具、長上下文與產品系統重新編譯成一個整體。

外部之所以覺得它突然變強，是因為技術增長長期發生在不可見或分離的支線中；直到 GPT-5.4 與 GPT-5.5，這些支線才同時進入同一個可日常使用的產品系統。

更簡潔地說：

$$
\boxed{
\text{GPT 的回歸}
=
\text{能力合流}
+
\text{Agent 化}
+
\text{產品化臨界點}
}
$$

而這也提示未來的模型競爭不再只是「誰更會回答」，而是：

> 誰能在更少監督、更低成本與更高可靠性下，把複雜意圖轉換成可檢查、可修改、可持續的現實成果。

---

## 附錄 A：關鍵時間線摘要

| 日期 | 版本／產品 | 主要意義 | 本文判定 |
|---|---|---|---|
| 2025-02-27 | GPT-4.5 | 擴大預訓練，非推理模型 | 底盤能力 |
| 2025-04-16 | o3、o4-mini | 推理、視覺與工具使用 | 推理支線 |
| 2025-04／05 | GPT-4.1、Codex | 長上下文；可執行程式 Agent | Agent 基礎 |
| 2025-08-07 | GPT-5 | 快速模型、Thinking 與路由器統一 | 架構起點、發布失敗 |
| 2025-09-15 | GPT-5-Codex | 真實軟體工程與反覆測試 | 隱性轉折 |
| 2025-11-12 | GPT-5.1 | 語氣、指令與自適應推理修復 | 體感修復 |
| 2025-11-19 | GPT-5.1-Codex-Max | 長時間與跨上下文工程 | 持續性提升 |
| 2025-12-11 | GPT-5.2 | 專業工作、程式、長上下文、事實性 | 首次明顯躍升 |
| 2025-12-18 | GPT-5.2-Codex | 大型重構、遷移、壓縮與 Windows | Agent 強化 |
| 2026-02-05 | GPT-5.3-Codex | 程式 Agent 與通用推理合流 | 主線合流前夜 |
| 2026-03-03 | GPT-5.3 Instant | 日常搜尋與對話體感修復 | 預設層修復 |
| 2026-03-05 | GPT-5.4 | Codex 前沿能力併入主線 | 結構轉折點 |
| 2026-04-23 | GPT-5.5 | 獨立綜合評測明確領先 | 外部重新登頂 |
| 2026-05-05 | GPT-5.5 Instant | 預設模型事實性與個人化 | 大眾化擴散 |
| 2026-07 | GPT-5.6 | 能力—成本前沿與 Coding Agent 領先 | 整合系統成熟 |

---

## 附錄 B：主要參考資料

### OpenAI 官方資料

1. [Introducing GPT-4.5](https://openai.com/index/introducing-gpt-4-5/)
2. [Introducing OpenAI o3 and o4-mini](https://openai.com/index/introducing-o3-and-o4-mini/)
3. [Introducing GPT-4.1 in the API](https://openai.com/index/gpt-4-1/)
4. [Introducing Codex](https://openai.com/index/introducing-codex/)
5. [Introducing GPT-5](https://openai.com/index/introducing-gpt-5/)
6. [GPT-5 System Card](https://openai.com/index/gpt-5-system-card/)
7. [Introducing upgrades to Codex / GPT-5-Codex](https://openai.com/index/introducing-upgrades-to-codex/)
8. [GPT-5.1: A smarter, more conversational ChatGPT](https://openai.com/index/gpt-5-1/)
9. [Building more with GPT-5.1-Codex-Max](https://openai.com/index/gpt-5-1-codex-max/)
10. [Introducing GPT-5.2](https://openai.com/index/introducing-gpt-5-2/)
11. [Introducing GPT-5.2-Codex](https://openai.com/index/introducing-gpt-5-2-codex/)
12. [Introducing GPT-5.3-Codex](https://openai.com/index/introducing-gpt-5-3-codex/)
13. [GPT-5.3 Instant](https://openai.com/index/gpt-5-3-instant/)
14. [Introducing GPT-5.4](https://openai.com/index/introducing-gpt-5-4/)
15. [Introducing GPT-5.5](https://openai.com/index/introducing-gpt-5-5/)
16. [GPT-5.5 Instant](https://openai.com/index/gpt-5-5-instant/)
17. [GPT-5.6](https://openai.com/index/gpt-5-6/)

### 獨立評測與外部觀察

18. [Artificial Analysis: OpenAI's GPT-5.5 is the new leading AI model](https://artificialanalysis.ai/articles/openai-gpt5-5-is-the-new-leading-AI-model)
19. [Artificial Analysis: GPT-5.6 benchmarks across Intelligence, Speed and Cost](https://artificialanalysis.ai/articles/gpt-5-6-has-landed)
20. [TechCrunch: ChatGPT's model picker is back, and it's complicated](https://techcrunch.com/2025/08/12/chatgpts-model-picker-is-back-and-its-complicated/)
21. [TechCrunch: Sam Altman addresses bumpy GPT-5 rollout](https://techcrunch.com/2025/08/08/sam-altman-addresses-bumpy-gpt-5-rollout-bringing-4o-back-and-the-chart-crime/)

---

## 版本紀錄

- **v1.0 — 2026-07-15**
  - 建立 GPT-4.5 至 GPT-5.6 的核實時間線。
  - 區分官方事實、獨立評測、外部體感與結構性推論。
  - 提出「乘法式系統效用模型」與「產品化臨界點」解釋。
  - 將 GPT-5.4 定義為結構轉折，GPT-5.5 定義為外部重新領先確認點。
  - 修正「GPT-5.6 在所有榜單絕對第一」的過度敘述。
