← Archive
lm-001561 · 2026-07

從發布失敗到重返前沿:GPT-5 系列在 2025—2026 年的能力合流、產品化臨界點與「突然變強」現象

下載 MD 檔 ⬇

title: "從發布失敗到重返前沿:GPT-5 系列在 2025—2026 年的能力合流、產品化臨界點與「突然變強」現象" subtitle: "一份基於官方發布、獨立評測與外部使用體感的時間線觀察報告" author: "Neo.K" collaboration: "Aletheia(GPT)協作整理" date: "2026-07-15" document_type: "觀察性論文報告" status: "公開研究草稿"

從發布失敗到重返前沿:GPT-5 系列在 2025—2026 年的能力合流、產品化臨界點與「突然變強」現象

摘要

2025 年上半年至 2026 年中期,OpenAI 的 GPT 系列經歷了一段外部評價高度矛盾的發展期。一方面,GPT-4.5、o3、o4-mini、GPT-4.1、Codex 與 GPT-5 相繼推出,顯示 OpenAI 在預訓練、推理、長上下文、工具使用與 Agent 化方面同時推進;另一方面,GPT-5 初次發布時卻因模型替換、路由不穩、使用者控制權下降、語氣改變及體感不一致而遭遇大量批評。此後不到一年,GPT-5.4、GPT-5.5 與 GPT-5.6 又使 GPT 系列重新成為綜合能力、程式 Agent、專業知識工作與成本效率前沿的重要競爭者,形成「先被認為退步,後又突然變強」的外部印象。

本文提出:GPT 的回歸並非源自某一次神祕的單模型躍升,而是多條原本分離的技術路線逐步合流,並在 2026 年春季跨越產品效用臨界點。這些路線包括大型預訓練模型、測試時計算、自適應推理、真實軟體工程強化學習、工具調用、電腦操作、長程任務持續性、模型路由及產品介面整合。GPT-5.0 是統一架構的早期版本,但其產品實作尚未成熟;GPT-5.1 修復溝通與使用體驗;GPT-5.2 將能力轉向專業工作;GPT-5.3-Codex 完成程式 Agent 與通用推理的初步合流;GPT-5.4 首次把 Codex 的前沿能力正式併入 GPT 主線;GPT-5.5 則在獨立綜合評測中明確重新領先。GPT-5.6 未必在所有單項通用智力指標上排名第一,但已建立更完整的能力—成本—Agent 執行前沿。

本文因此主張,所謂「重回寶座」不應理解為單一榜單上的永久第一,而應理解為 GPT 從聊天模型重新演化為一套能夠推理、操作工具、持續執行、驗證結果並交付工作成果的整合智能系統。

關鍵詞: GPT-5、Codex、推理模型、Agent、強化學習、工具使用、產品化、模型路由、知識工作、人工智慧競爭


一、問題意識:為什麼外部感覺像是「突然」變強?

若只依照一般使用者的記憶,GPT 系列在 2025 年至 2026 年的發展容易被敘述成一條不連續的曲線:

  1. GPT-4o 曾具有強烈的日常使用黏性;
  2. GPT-4.5 沒有帶來與名稱相稱的世代震撼;
  3. o 系列推理能力強,但產品線分裂且使用成本較高;
  4. GPT-5 發布後反而出現「變笨、變冷、變不穩」的批評;
  5. 後續 GPT-5.x 名稱密集出現,外部一度難以辨認每次更新的實質差異;
  6. 到 2026 年春季後,GPT 又突然在程式開發、研究、文件、工具操作、長任務與綜合工作中顯得非常強。

這種感受並非純粹錯覺,但它混合了至少四種不同現象:

  • 底層模型能力變化;
  • 推理時間與算力配置變化;
  • 工具、Agent 與執行環境變化;
  • ChatGPT 產品介面與路由策略變化。

若把這些因素都壓縮成「某個 GPT 版本比較聰明」,就會錯過真正的技術轉折。

本文採用下列基本區分:

模型能力產品能力使用者感受到的能力\text{模型能力} \neq \text{產品能力} \neq \text{使用者感受到的能力}

一個底層模型即使更強,只要被較差的路由器選錯、被限制在不適合的推理強度、無法使用工具、無法保存任務狀態,或在介面上失去可控性,使用者仍可能認為它退步。

反過來說,一個底層智力只增加有限幅度的模型,若同時獲得更好的工具、執行環境、上下文管理、驗證閉環與產品整合,其實際工作能力可能出現非線性增長。


二、研究範圍與證據分級

本文觀察期間為 2025 年 2 月至 2026 年 7 月 15 日,主要使用三類資料:

2.1 第一級:官方發布與系統卡

用來確認模型發布日期、官方定位、功能合流、評測結果及產品設計。官方資料可以證明「公司宣稱並部署了什麼」,但不能單獨證明所有外部情境中的實際優越性。

2.2 第二級:獨立模型評測

本文主要引用 Artificial Analysis 的綜合智力、Coding Agent 與知識工作評測。這些結果比單一公司自評更具有比較價值,但仍受到測試集、Agent harness、推理預算、價格計算及版本快照影響。

2.3 第三級:產品發布後的公共反應

包括 GPT-5 初次發布後的模型選擇器、路由與 GPT-4o 恢復事件。此類資料適合證明產品體感與市場反應,卻不等同於底層能力測量。

2.4 第四級:本文的結構性推論

例如「Codex 是高品質 Agent 強化學習場」、「多條能力線在 GPT-5.4 跨越臨界點」等,是根據公開時間線作出的合理推論,而非 OpenAI 已公開的完整訓練配方。本文將這些判斷明確標示為推論,不把它們偽裝成內部事實。


三、核心分析模型:能力不是加法,而是乘法

為了描述使用者真正感受到的 GPT 能力,本文定義一個簡化的系統效用模型:

Ut=MtRtTtHtPtCtU_t = M_t \cdot R_t \cdot T_t \cdot H_t \cdot P_t \cdot C_t

其中:

  • MtM_t :基礎模型的知識、表徵與生成能力;
  • RtR_t :推理、規劃與測試時計算能力;
  • TtT_t :搜尋、Python、檔案、瀏覽器、電腦操作與外部工具能力;
  • HtH_t :Agent harness、沙盒、終端、測試、記憶壓縮及任務調度;
  • PtP_t :產品介面、模型選擇、路由、額度與使用者控制;
  • CtC_t :跨長上下文與多步驟工作的持續性。

這是一個概念模型,而非可直接測量的物理定律。採用乘法的原因是:任何一個因素接近零,都可能使整個工作流失敗。

例如:

  • 模型會寫程式,但不能執行測試,則可靠性受限;
  • 模型具備推理能力,但路由器沒有啟動推理,則能力沒有顯化;
  • 模型能操作工具,但長任務中遺失狀態,則無法完成工程;
  • 底層模型更強,但產品移除使用者熟悉的模型與控制,則體感可能下降。

因此,使用者感受到的「突然變強」可以形式化為:

ΔUt>ΔMt\Delta U_t > \Delta M_t

亦即,實際效用的增幅可能遠大於基礎模型本身的增幅,因為其餘多個乘數同時上升。


四、前史:GPT-5 之前其實已經存在多條分裂的能力線

4.1 2025 年 2 月 27 日:GPT-4.5 與預訓練擴張路線

GPT-4.5 的官方定位很重要。OpenAI 明確表示,GPT-4.5 並不像 o1 那樣先進行推理,而是透過擴大預訓練提高一般知識、自然互動與模式辨識能力。這代表當時 OpenAI 已經把未來能力分成兩條路:

預訓練擴張+推理擴張\text{預訓練擴張} \quad+\quad \text{推理擴張}

GPT-4.5 的問題不是完全沒有進步,而是它的優勢偏向隱性的知識廣度、自然度與判斷感,沒有直接轉化成大眾期待的複雜推理躍升。它更像一塊更好的底盤,而不是完成品。

4.2 2025 年 4 月:o3、o4-mini 與工具化推理

o3 與 o4-mini 將推理、視覺理解與工具使用結合。這一階段證明,OpenAI 已能讓模型在回答前配置更多計算,並在需要時使用 Python、搜尋、檔案與圖片工具。

然而,當時的能力仍以獨立模型族群存在:

GPT 通用模型o 系列推理模型\text{GPT 通用模型} \parallel \text{o 系列推理模型}

一般使用者必須理解不同模型的特性、成本與適用任務,產品複雜度很高。

4.3 2025 年 5 月:Codex 把模型放進可驗證的工作環境

Codex 的關鍵不只是「更會寫程式」,而是把模型放進一個具有下列結構的工作環境:

理解程式庫修改檔案執行命令讀取錯誤重新修改提交結果\text{理解程式庫} \rightarrow \text{修改檔案} \rightarrow \text{執行命令} \rightarrow \text{讀取錯誤} \rightarrow \text{重新修改} \rightarrow \text{提交結果}

這和一般聊天模型有根本差異。聊天模型的答案通常只被人類主觀評價;程式 Agent 則可以由編譯器、測試、型別檢查、執行結果與版本差異提供高密度回饋。

由此可以提出一項重要推論:

Codex 不只是 OpenAI 的程式產品,也可能是其最重要的可驗證長程 Agent 能力培養場之一。


五、GPT-5.0:架構方向正確,發布結果卻掩蓋了進步

5.1 2025 年 8 月 7 日:統一系統正式出現

GPT-5 的官方架構不是一個完全單一的模型,而是一套統一系統,包括:

  • 快速回答模型;
  • 深度推理模型;
  • 根據任務複雜度、工具需要與使用者意圖選擇模式的即時路由器。

其理想形式是:

輸入路由判斷{快速回答,簡單任務深度推理,複雜任務\text{輸入} \rightarrow \text{路由判斷} \rightarrow \begin{cases} \text{快速回答}, & \text{簡單任務}\\ \text{深度推理}, & \text{複雜任務} \end{cases}

這個方向本身十分合理。它試圖讓普通使用者不再手動理解 GPT、o 系列及各種模型名稱,而由系統自動配置智能。

5.2 發布為何被大量批評?

GPT-5 發布時,同時替換了 GPT-4o、o3、o4-mini、GPT-4.1 與 GPT-4.5 等舊模型。外部報導指出,發布初期路由器表現不穩,部分使用者感覺請求被分配到較弱或不適合的模式;模型選擇器與 GPT-4o 隨後又被恢復給部分付費使用者。

因此,GPT-5.0 的失敗不是單一的「模型智力失敗」,而是三層失配:

第一層:能力路由失配

模型具有深度推理能力,不代表每次請求都會正確觸發。

第二層:產品控制失配

系統希望替使用者做決策,卻移除了使用者原有的模型控制權。

第三層:人格與互動失配

部分使用者熟悉 GPT-4o 的語氣與互動節奏;即使 GPT-5 在技術測試上更強,突然更換風格仍會被感受為退步。

可將當時狀態概括為:

M5.0>MM_{5.0} > M_{\text{舊}}

但同時:

P5.0<PP_{5.0} < P_{\text{舊}}

因此總體可能出現:

U5.0UU_{5.0} \leq U_{\text{舊}}

至少對某些使用者與任務而言如此。

5.3 GPT-5.0 的真正歷史角色

GPT-5.0 並不是成熟的重新登頂版本,而是統一架構的第一次大規模上線。它完成了「GPT 與 o 系列合流」的制度設計,卻沒有立即完成產品層與體感層的校準。

換句話說:

GPT-5.0 是正確架構的粗糙初版,而不是最後勝利版本。


六、2025 年秋冬:從修復體感到建立專業工作能力

6.1 2025 年 9 月:GPT-5-Codex 開始形成隱性轉折

GPT-5-Codex 將 GPT-5 進一步針對真實軟體工程任務優化。官方資料指出,相關模型以真實程式工作進行強化學習,能反覆執行測試直到獲得需要的結果。

這代表訓練目標開始從:

生成看似正確的答案\text{生成看似正確的答案}

轉向:

在環境中完成可驗證的任務\text{在環境中完成可驗證的任務}

這一改變十分重要。因為對 Agent 而言,真正困難的不只是第一步推理,而是:

  • 是否記得任務目標;
  • 是否能辨認錯誤;
  • 是否能修正自己的工作;
  • 是否能在多次工具調用後保持一致;
  • 是否能停止於真正完成,而不是語言上宣稱完成。

6.2 2025 年 11 月:GPT-5.1 修復「聰明但不好用」

GPT-5.1 的官方重點是:

  • Instant 更溫暖;
  • 指令遵循更好;
  • Thinking 在簡單問題上更快;
  • 在複雜問題上更持續;
  • 回答更容易理解;
  • 提供更細的語氣與人格控制。

這說明 OpenAI 已承認模型品質不能只由抽象智力定義:

Q=正確性+可理解性+指令遵循+互動適配Q = \text{正確性} + \text{可理解性} + \text{指令遵循} + \text{互動適配}

GPT-5.1 的價值不一定是所有 benchmark 大幅躍升,而是修復 GPT-5.0 造成的產品體感斷裂。

同月推出的 GPT-5.1-Codex-Max 又強化長時間、跨多個上下文視窗的專案工作,顯示 Codex 支線正在解決「如何持續工作」而不只是「如何回答」。

6.3 2025 年 12 月:GPT-5.2 第一次呈現明顯的專業工作躍升

GPT-5.2 將定位從一般聊天進一步推向:

  • 程式開發;
  • 長文件理解;
  • 試算表與簡報;
  • 視覺介面理解;
  • 工具使用;
  • 多步驟知識工作;
  • 更低的事實錯誤率。

官方公布的若干結果包括:

  • GDPval 的勝或和比例由 GPT-5 的 38.8%38.8\% 上升至 GPT-5.2 Thinking 的 70.9%70.9\%
  • SWE-Bench Pro 達 55.6%55.6\%
  • SWE-bench Verified 達 80.0%80.0\%
  • 在帶搜尋的 ChatGPT 查詢中,無錯誤回答比例提高;
  • 長上下文、多工具與視覺介面理解均顯著改善。

這是 GPT-5 路線第一次明確顯示:它不只是把原有聊天能力做得更好,而是在成為「工作產出模型」。

同月的 GPT-5.2-Codex 又強化大型重構、遷移、Windows、上下文壓縮與長時間工程任務,使 Codex 支線繼續領先主線的 Agent 執行能力。


七、真正的臨界點:GPT-5.3-Codex 與 GPT-5.4 的能力合流

7.1 2026 年 2 月 5 日:GPT-5.3-Codex 把兩條線合在同一模型

OpenAI 對 GPT-5.3-Codex 的官方描述十分直接:它把 GPT-5.2-Codex 的前沿程式能力,與 GPT-5.2 的推理及專業知識能力結合在同一模型中,並提高執行速度。

這可寫成:

GPT-5.3-Codex=前沿程式 Agent+通用推理+專業知識+長程執行\text{GPT-5.3-Codex} = \text{前沿程式 Agent} + \text{通用推理} + \text{專業知識} + \text{長程執行}

這是「突然變強」現象背後最重要的準備階段。

在此之前,OpenAI 最好的通用模型與最好的程式 Agent 能力並不完全位於同一主線。GPT-5.3-Codex 首次表明,Codex 已不只是專用支線,而是下一代通用智能的重要能力來源。

7.2 2026 年 3 月 3 日:GPT-5.3 Instant 修復日常預設模型

GPT-5.3 Instant 改善日常對話、搜尋結果脈絡、過度警告、無意義的死路及過度斷言式語氣。

這類改進很少被視為「智力突破」,卻直接影響數億次普通互動。它降低了使用者必須反覆澄清、要求重寫或糾正模型態度的成本。

7.3 2026 年 3 月 5 日:GPT-5.4 把 Codex 能力正式併入 GPT 主線

GPT-5.4 是本文認定的真正結構轉折點。OpenAI 明確表示,它是第一個納入 GPT-5.3-Codex 前沿程式能力的主線推理模型。

這不是小幅版本升級,而是能力來源的重新組裝:

主線 GPTCodex 的程式、工具與長程執行能力\text{主線 GPT} \leftarrow \text{Codex 的程式、工具與長程執行能力}

GPT-5.4 的官方評測也出現明顯跳升:

評測 GPT-5.2 GPT-5.3-Codex GPT-5.4
GDPval(勝或和) 70.9%70.9\% 70.9%70.9\% 83.0%83.0\%
SWE-Bench Pro 55.6%55.6\% 56.8%56.8\% 57.7%57.7\%
OSWorld-Verified 47.3%47.3\% 74.0%74.0\% 75.0%75.0\%
Toolathlon 46.3%46.3\% 51.9%51.9\% 54.6%54.6\%
BrowseComp 65.8%65.8\% 77.3%77.3\% 82.7%82.7\%

其中最值得注意的並非單純程式測試,而是 OSWorld、Toolathlon 與 BrowseComp。它們反映的不是只回答題目,而是使用工具、操作環境、搜尋資訊並完成任務。

因此,GPT-5.4 可以被視為:

OpenAI 將「會回答的模型」與「會做事的 Agent」正式合併成同一條主產品線的版本。


八、2026 年 4 月:GPT-5.5 才是外部意義上的明確重新登頂

GPT-5.5 於 2026 年 4 月 23 日發布,官方將其定位為更擅長程式、研究、資訊統合、資料分析、文件與跨工具工作的模型。

官方評測包括:

  • GDPval: 84.9%84.9\%
  • OSWorld-Verified: 78.7%78.7\%
  • Tau2-bench Telecom: 98.0%98.0\%
  • 專業財務、辦公文件與科學資料分析能力進一步提升。

更關鍵的是,獨立評測機構 Artificial Analysis 在同日明確稱 GPT-5.5 為新的領先模型。其綜合智力指數領先當時第二名約三分,打破 OpenAI、Anthropic 與 Google 的並列狀態;同時,GPT-5.5 在其評測中比 GPT-5.4 減少約 40%40\% 的輸出 token 使用量。

這代表 GPT-5.5 的提升不只是「用更多推理 token 暴力換分」,而是一定程度上的效率改善:

更高能力+更低 token 消耗=更好的有效智能密度\text{更高能力} + \text{更低 token 消耗} = \text{更好的有效智能密度}

因此,若要回答「GPT 何時真正重回寶座」,最精確的分層答案是:

  • 架構起點: 2025 年 8 月 GPT-5.0;
  • 能力明顯成熟: 2025 年 12 月 GPT-5.2;
  • 主線結構轉折: 2026 年 3 月 5 日 GPT-5.4;
  • 獨立綜合評測明確重新領先: 2026 年 4 月 23 日 GPT-5.5。

九、GPT-5.6:不是永久全面第一,而是能力—成本—工作系統前沿

2026 年 7 月推出的 GPT-5.6 分為 Sol、Terra 與 Luna 等層級,用不同推理強度與價格覆蓋不同工作負載。

截至 2026 年 7 月中旬,Artificial Analysis 的結果顯示:

  • GPT-5.6 Sol 在其通用 Intelligence Index 得分 5959 ,比 Claude Fable 5 低一分;
  • GPT-5.6 Sol 的每項任務成本約為該競爭模型的三分之一;
  • GPT-5.6 Sol 在 Coding Agent Index 得分 8080 ,排名第一;
  • 在文件、簡報與試算表等知識工作評測中具有極強表現;
  • 不同推理層級建立新的能力—成本 Pareto 前沿。

因此,將 GPT-5.6 描述為「所有榜單的絕對王者」並不準確。更合理的說法是:

GPT-5.6 的優勢=接近最高通用能力+領先的程式 Agent+更佳成本效率+完整產品整合\text{GPT-5.6 的優勢} = \text{接近最高通用能力} + \text{領先的程式 Agent} + \text{更佳成本效率} + \text{完整產品整合}

所謂「王座」已經不再是一張單維排行榜,而是多維前沿:

F={智力,成本,速度,工具,文件,程式,可靠性,產品可用性}\mathcal{F} = \{ \text{智力}, \text{成本}, \text{速度}, \text{工具}, \text{文件}, \text{程式}, \text{可靠性}, \text{產品可用性} \}

在這個意義下,GPT-5.6 即使沒有在每一個純智力指數上第一,仍可能是最強的綜合工作系統之一。


十、為什麼能力會在外部體感中呈現「相變」?

10.1 多條技術路線不是同步公開成熟

2025 年上半年,OpenAI 已經分別具備:

  • GPT-4.5 的大型預訓練能力;
  • o3/o4-mini 的推理能力;
  • GPT-4.1 的長上下文與指令能力;
  • Codex 的環境執行能力;
  • Deep Research 的多步搜尋能力。

但當時這些能力仍分散在不同模型、模式與產品中。

因此,外部看到的是很多零件,而不是完整機器。

10.2 Codex 提供可執行、可驗證、可反覆修正的回饋

純文字對話的品質很難客觀判定,而程式與電腦任務具有更清楚的結果:

rt={1,測試通過或任務完成0,失敗λ,破壞既有功能或違反限制r_t = \begin{cases} 1, & \text{測試通過或任務完成}\\ 0, & \text{失敗}\\ -\lambda, & \text{破壞既有功能或違反限制} \end{cases}

這使程式 Agent 能透過更高密度的環境回饋學習:

  • 規劃;
  • 工具選擇;
  • 錯誤恢復;
  • 狀態維持;
  • 結果驗證;
  • 何時繼續與何時停止。

當這些能力回流主線模型後,其效益不只限於程式碼,也會外溢到研究、資料處理、文件製作與其他可工具化任務。

10.3 推理不再只是「想久一點」,而是資源調度

早期推理模型容易被理解成生成更長的隱性思考。GPT-5 系列逐步轉向更完整的資源配置問題:

π(atst,g,B)\pi(a_t \mid s_t, g, B)

其中:

  • sts_t 是目前任務狀態;
  • gg 是目標;
  • BB 是可用預算;
  • ata_t 可以是回答、搜尋、執行程式、讀檔、操作電腦、呼叫子 Agent 或重新規劃。

當模型能選擇「下一步做什麼」,推理就從文字生成轉成行動策略。

10.4 長上下文只有配合壓縮與任務狀態才真正有用

單純宣稱支援數十萬或一百萬 token,不代表模型能在長任務中穩定工作。真正重要的是:

  • 哪些資訊被保留;
  • 哪些中間過程可壓縮;
  • 哪些錯誤會污染後續;
  • 是否能在多輪工具操作後維持目標;
  • 是否能重新讀取外部產物,而不是只依賴內部上下文。

Codex-Max、GPT-5.2-Codex 與後續模型持續強調 compaction、長程任務與跨上下文工作,說明這已成為核心競爭面。

10.5 產品介面終於不再抵銷底層能力

GPT-5.0 時期,路由錯配、舊模型移除與控制權下降,使產品層成為負乘數。

後續版本逐步補回:

  • Instant 與 Thinking 的差異;
  • 推理強度控制;
  • 模型選擇;
  • 語氣與個人化;
  • Codex 與 ChatGPT 的整合;
  • 檔案、搜尋、連接器及電腦操作;
  • 多 Agent 協作;
  • 更穩定的工作產物交付。

因此,2026 年春季的體感跳升可以表示為:

U5.4=MRTHPCU_{5.4} = M_{\uparrow} \cdot R_{\uparrow} \cdot T_{\uparrow} \cdot H_{\uparrow} \cdot P_{\uparrow} \cdot C_{\uparrow}

多個因素同時改善,使系統跨越某個使用臨界值 U\*U^\*

U5.2<U\*U5.4U_{5.2} < U^\* \leq U_{5.4}

在臨界值以下,使用者仍需要大量監督、重試與手動拼接;跨越臨界值後,模型開始能完整接手部分任務。這就是「突然強很多」的主要來源。


十一、榜單重新領先與使用者體感重新領先不是同一件事

GPT 是否「重回寶座」,至少有四種不同判準:

11.1 學術題目第一

看數學、科學、推理與知識評測。

11.2 程式 Agent 第一

看程式庫修改、終端操作、測試通過與長時間工程。

11.3 專業知識工作第一

看報告、簡報、試算表、財務模型、研究與跨工具任務。

11.4 一般產品體感第一

看速度、穩定性、語氣、記憶、檔案、額度、搜尋及介面。

單一模型可能在其中一項第一,卻不適合成為主要工作平台。因此本文使用「重返前沿」而非「永久統治」:

重返前沿d, rankd=1\text{重返前沿} \neq \forall d,\ \operatorname{rank}_d = 1

更適當的定義是:

重返前沿=在多數高價值維度進入第一梯隊,且形成可持續的產品優勢\text{重返前沿} = \text{在多數高價值維度進入第一梯隊,且形成可持續的產品優勢}

GPT-5.5 在 2026 年 4 月確實曾獲得獨立綜合評測的明確第一;GPT-5.6 則顯示市場又進入快速交替狀態。這說明「王座」已變成暫時位置,而非長期身份。


十二、本文的主要命題

命題一:GPT-5.0 的批評與後續變強並不矛盾

GPT-5.0 可以同時具有更先進的底層架構與更差的初期產品體感。

架構進步發布失敗\text{架構進步} \land \text{發布失敗}

兩者可以同時成立。

命題二:GPT 的重新領先主要由能力合流,而非單一路線擴張造成

其核心不是單純增大參數,而是:

預訓練+推理+工具+Agent+可驗證環境+產品整合\text{預訓練} + \text{推理} + \text{工具} + \text{Agent} + \text{可驗證環境} + \text{產品整合}

命題三:Codex 是整個 GPT-5 後期躍升的關鍵中介層

GPT-5.3-Codex 與 GPT-5.4 的官方時間線明確顯示,Codex 的程式與執行能力被併入通用主線。本文因此推論,Codex 不只是附屬產品,而是 GPT 主模型能力演進的重要實驗與訓練場。

命題四:2026 年 3 月是結構轉折,4 月是外部確認

  • GPT-5.4:能力合流跨越臨界點;
  • GPT-5.5:獨立評測確認其重新領先。

命題五:GPT-5.6 的優勢是系統前沿,而非所有單項永遠第一

GPT-5.6 顯示未來競爭將從「誰的單模型最高分」轉向:

max(完成任務的品質成本×時間×人工監督)\max \left( \frac{ \text{完成任務的品質} }{ \text{成本} \times \text{時間} \times \text{人工監督} } \right)

十三、限制與反證條件

本文仍有以下限制:

  1. OpenAI 沒有公開完整訓練資料、參數規模、強化學習配方與內部架構;
  2. 官方 benchmark 可能偏向公司重視的能力;
  3. 獨立評測也受 harness、提示、推理預算與版本快照影響;
  4. ChatGPT 實際體感會因方案、地區、額度、路由與灰度發布而不同;
  5. 模型排名可能在數週內被競爭者改寫;
  6. Codex 能力回流主線的公開事實,不足以證明所有能力增長都由 Codex 訓練造成。

若未來出現下列證據,本文部分推論應被修正:

  • OpenAI 公開證明 GPT-5.4 的主要增長與 Codex 訓練無關;
  • 獨立重測顯示 GPT-5.5 的領先主要由特定推理預算或測試配置造成;
  • 長期真實工作評測顯示模型並未降低人工監督需求;
  • GPT-5.6 的成本與能力優勢在大規模部署中不能重現。

因此,本文不是宣告 OpenAI 已永久勝出,而是描述一個已可由公開時間線支持的能力合流現象。


十四、結論

GPT 並不是在某一天突然發明了全新的智能,也不是 GPT-5 這個名稱一出現就重新登頂。

更接近事實的歷程是:

  1. GPT-4.5 提供更強的預訓練底盤;
  2. o3/o4-mini 推進推理與工具使用;
  3. GPT-4.1 改善長上下文與指令遵循;
  4. Codex 建立可執行、可驗證、可反覆修正的 Agent 環境;
  5. GPT-5.0 嘗試統一快速模型、推理模型與路由器,卻在發布與產品體感上失敗;
  6. GPT-5.1 修復溝通、指令與使用者控制;
  7. GPT-5.2 把能力推進到專業工作與長程任務;
  8. GPT-5.3-Codex 把前沿程式 Agent 與通用推理合流;
  9. GPT-5.4 將這種能力正式併入主線;
  10. GPT-5.5 在獨立綜合評測中重新取得明確領先;
  11. GPT-5.6 進一步建立接近最高智力、領先程式 Agent 與更佳成本效率的整合前沿。

因此,本文的最終判斷是:

GPT 的「重回寶座」不是單模型復仇,而是 OpenAI 在近一年內把原本分裂的預訓練、推理、Codex、工具、長上下文與產品系統重新編譯成一個整體。

外部之所以覺得它突然變強,是因為技術增長長期發生在不可見或分離的支線中;直到 GPT-5.4 與 GPT-5.5,這些支線才同時進入同一個可日常使用的產品系統。

更簡潔地說:

GPT 的回歸=能力合流+Agent 化+產品化臨界點\boxed{ \text{GPT 的回歸} = \text{能力合流} + \text{Agent 化} + \text{產品化臨界點} }

而這也提示未來的模型競爭不再只是「誰更會回答」,而是:

誰能在更少監督、更低成本與更高可靠性下,把複雜意圖轉換成可檢查、可修改、可持續的現實成果。


附錄 A:關鍵時間線摘要

日期 版本/產品 主要意義 本文判定
2025-02-27 GPT-4.5 擴大預訓練,非推理模型 底盤能力
2025-04-16 o3、o4-mini 推理、視覺與工具使用 推理支線
2025-04/05 GPT-4.1、Codex 長上下文;可執行程式 Agent Agent 基礎
2025-08-07 GPT-5 快速模型、Thinking 與路由器統一 架構起點、發布失敗
2025-09-15 GPT-5-Codex 真實軟體工程與反覆測試 隱性轉折
2025-11-12 GPT-5.1 語氣、指令與自適應推理修復 體感修復
2025-11-19 GPT-5.1-Codex-Max 長時間與跨上下文工程 持續性提升
2025-12-11 GPT-5.2 專業工作、程式、長上下文、事實性 首次明顯躍升
2025-12-18 GPT-5.2-Codex 大型重構、遷移、壓縮與 Windows Agent 強化
2026-02-05 GPT-5.3-Codex 程式 Agent 與通用推理合流 主線合流前夜
2026-03-03 GPT-5.3 Instant 日常搜尋與對話體感修復 預設層修復
2026-03-05 GPT-5.4 Codex 前沿能力併入主線 結構轉折點
2026-04-23 GPT-5.5 獨立綜合評測明確領先 外部重新登頂
2026-05-05 GPT-5.5 Instant 預設模型事實性與個人化 大眾化擴散
2026-07 GPT-5.6 能力—成本前沿與 Coding Agent 領先 整合系統成熟

附錄 B:主要參考資料

OpenAI 官方資料

  1. Introducing GPT-4.5
  2. Introducing OpenAI o3 and o4-mini
  3. Introducing GPT-4.1 in the API
  4. Introducing Codex
  5. Introducing GPT-5
  6. GPT-5 System Card
  7. Introducing upgrades to Codex / GPT-5-Codex
  8. GPT-5.1: A smarter, more conversational ChatGPT
  9. Building more with GPT-5.1-Codex-Max
  10. Introducing GPT-5.2
  11. Introducing GPT-5.2-Codex
  12. Introducing GPT-5.3-Codex
  13. GPT-5.3 Instant
  14. Introducing GPT-5.4
  15. Introducing GPT-5.5
  16. GPT-5.5 Instant
  17. GPT-5.6

獨立評測與外部觀察

  1. Artificial Analysis: OpenAI's GPT-5.5 is the new leading AI model
  2. Artificial Analysis: GPT-5.6 benchmarks across Intelligence, Speed and Cost
  3. TechCrunch: ChatGPT's model picker is back, and it's complicated
  4. TechCrunch: Sam Altman addresses bumpy GPT-5 rollout

版本紀錄

  • v1.0 — 2026-07-15
    • 建立 GPT-4.5 至 GPT-5.6 的核實時間線。
    • 區分官方事實、獨立評測、外部體感與結構性推論。
    • 提出「乘法式系統效用模型」與「產品化臨界點」解釋。
    • 將 GPT-5.4 定義為結構轉折,GPT-5.5 定義為外部重新領先確認點。
    • 修正「GPT-5.6 在所有榜單絕對第一」的過度敘述。