title: "從發布失敗到重返前沿:GPT-5 系列在 2025—2026 年的能力合流、產品化臨界點與「突然變強」現象" subtitle: "一份基於官方發布、獨立評測與外部使用體感的時間線觀察報告" author: "Neo.K" collaboration: "Aletheia(GPT)協作整理" date: "2026-07-15" document_type: "觀察性論文報告" status: "公開研究草稿"
從發布失敗到重返前沿:GPT-5 系列在 2025—2026 年的能力合流、產品化臨界點與「突然變強」現象
摘要
2025 年上半年至 2026 年中期,OpenAI 的 GPT 系列經歷了一段外部評價高度矛盾的發展期。一方面,GPT-4.5、o3、o4-mini、GPT-4.1、Codex 與 GPT-5 相繼推出,顯示 OpenAI 在預訓練、推理、長上下文、工具使用與 Agent 化方面同時推進;另一方面,GPT-5 初次發布時卻因模型替換、路由不穩、使用者控制權下降、語氣改變及體感不一致而遭遇大量批評。此後不到一年,GPT-5.4、GPT-5.5 與 GPT-5.6 又使 GPT 系列重新成為綜合能力、程式 Agent、專業知識工作與成本效率前沿的重要競爭者,形成「先被認為退步,後又突然變強」的外部印象。
本文提出:GPT 的回歸並非源自某一次神祕的單模型躍升,而是多條原本分離的技術路線逐步合流,並在 2026 年春季跨越產品效用臨界點。這些路線包括大型預訓練模型、測試時計算、自適應推理、真實軟體工程強化學習、工具調用、電腦操作、長程任務持續性、模型路由及產品介面整合。GPT-5.0 是統一架構的早期版本,但其產品實作尚未成熟;GPT-5.1 修復溝通與使用體驗;GPT-5.2 將能力轉向專業工作;GPT-5.3-Codex 完成程式 Agent 與通用推理的初步合流;GPT-5.4 首次把 Codex 的前沿能力正式併入 GPT 主線;GPT-5.5 則在獨立綜合評測中明確重新領先。GPT-5.6 未必在所有單項通用智力指標上排名第一,但已建立更完整的能力—成本—Agent 執行前沿。
本文因此主張,所謂「重回寶座」不應理解為單一榜單上的永久第一,而應理解為 GPT 從聊天模型重新演化為一套能夠推理、操作工具、持續執行、驗證結果並交付工作成果的整合智能系統。
關鍵詞: GPT-5、Codex、推理模型、Agent、強化學習、工具使用、產品化、模型路由、知識工作、人工智慧競爭
一、問題意識:為什麼外部感覺像是「突然」變強?
若只依照一般使用者的記憶,GPT 系列在 2025 年至 2026 年的發展容易被敘述成一條不連續的曲線:
- GPT-4o 曾具有強烈的日常使用黏性;
- GPT-4.5 沒有帶來與名稱相稱的世代震撼;
- o 系列推理能力強,但產品線分裂且使用成本較高;
- GPT-5 發布後反而出現「變笨、變冷、變不穩」的批評;
- 後續 GPT-5.x 名稱密集出現,外部一度難以辨認每次更新的實質差異;
- 到 2026 年春季後,GPT 又突然在程式開發、研究、文件、工具操作、長任務與綜合工作中顯得非常強。
這種感受並非純粹錯覺,但它混合了至少四種不同現象:
- 底層模型能力變化;
- 推理時間與算力配置變化;
- 工具、Agent 與執行環境變化;
- ChatGPT 產品介面與路由策略變化。
若把這些因素都壓縮成「某個 GPT 版本比較聰明」,就會錯過真正的技術轉折。
本文採用下列基本區分:
一個底層模型即使更強,只要被較差的路由器選錯、被限制在不適合的推理強度、無法使用工具、無法保存任務狀態,或在介面上失去可控性,使用者仍可能認為它退步。
反過來說,一個底層智力只增加有限幅度的模型,若同時獲得更好的工具、執行環境、上下文管理、驗證閉環與產品整合,其實際工作能力可能出現非線性增長。
二、研究範圍與證據分級
本文觀察期間為 2025 年 2 月至 2026 年 7 月 15 日,主要使用三類資料:
2.1 第一級:官方發布與系統卡
用來確認模型發布日期、官方定位、功能合流、評測結果及產品設計。官方資料可以證明「公司宣稱並部署了什麼」,但不能單獨證明所有外部情境中的實際優越性。
2.2 第二級:獨立模型評測
本文主要引用 Artificial Analysis 的綜合智力、Coding Agent 與知識工作評測。這些結果比單一公司自評更具有比較價值,但仍受到測試集、Agent harness、推理預算、價格計算及版本快照影響。
2.3 第三級:產品發布後的公共反應
包括 GPT-5 初次發布後的模型選擇器、路由與 GPT-4o 恢復事件。此類資料適合證明產品體感與市場反應,卻不等同於底層能力測量。
2.4 第四級:本文的結構性推論
例如「Codex 是高品質 Agent 強化學習場」、「多條能力線在 GPT-5.4 跨越臨界點」等,是根據公開時間線作出的合理推論,而非 OpenAI 已公開的完整訓練配方。本文將這些判斷明確標示為推論,不把它們偽裝成內部事實。
三、核心分析模型:能力不是加法,而是乘法
為了描述使用者真正感受到的 GPT 能力,本文定義一個簡化的系統效用模型:
其中:
- :基礎模型的知識、表徵與生成能力;
- :推理、規劃與測試時計算能力;
- :搜尋、Python、檔案、瀏覽器、電腦操作與外部工具能力;
- :Agent harness、沙盒、終端、測試、記憶壓縮及任務調度;
- :產品介面、模型選擇、路由、額度與使用者控制;
- :跨長上下文與多步驟工作的持續性。
這是一個概念模型,而非可直接測量的物理定律。採用乘法的原因是:任何一個因素接近零,都可能使整個工作流失敗。
例如:
- 模型會寫程式,但不能執行測試,則可靠性受限;
- 模型具備推理能力,但路由器沒有啟動推理,則能力沒有顯化;
- 模型能操作工具,但長任務中遺失狀態,則無法完成工程;
- 底層模型更強,但產品移除使用者熟悉的模型與控制,則體感可能下降。
因此,使用者感受到的「突然變強」可以形式化為:
亦即,實際效用的增幅可能遠大於基礎模型本身的增幅,因為其餘多個乘數同時上升。
四、前史:GPT-5 之前其實已經存在多條分裂的能力線
4.1 2025 年 2 月 27 日:GPT-4.5 與預訓練擴張路線
GPT-4.5 的官方定位很重要。OpenAI 明確表示,GPT-4.5 並不像 o1 那樣先進行推理,而是透過擴大預訓練提高一般知識、自然互動與模式辨識能力。這代表當時 OpenAI 已經把未來能力分成兩條路:
GPT-4.5 的問題不是完全沒有進步,而是它的優勢偏向隱性的知識廣度、自然度與判斷感,沒有直接轉化成大眾期待的複雜推理躍升。它更像一塊更好的底盤,而不是完成品。
4.2 2025 年 4 月:o3、o4-mini 與工具化推理
o3 與 o4-mini 將推理、視覺理解與工具使用結合。這一階段證明,OpenAI 已能讓模型在回答前配置更多計算,並在需要時使用 Python、搜尋、檔案與圖片工具。
然而,當時的能力仍以獨立模型族群存在:
一般使用者必須理解不同模型的特性、成本與適用任務,產品複雜度很高。
4.3 2025 年 5 月:Codex 把模型放進可驗證的工作環境
Codex 的關鍵不只是「更會寫程式」,而是把模型放進一個具有下列結構的工作環境:
這和一般聊天模型有根本差異。聊天模型的答案通常只被人類主觀評價;程式 Agent 則可以由編譯器、測試、型別檢查、執行結果與版本差異提供高密度回饋。
由此可以提出一項重要推論:
Codex 不只是 OpenAI 的程式產品,也可能是其最重要的可驗證長程 Agent 能力培養場之一。
五、GPT-5.0:架構方向正確,發布結果卻掩蓋了進步
5.1 2025 年 8 月 7 日:統一系統正式出現
GPT-5 的官方架構不是一個完全單一的模型,而是一套統一系統,包括:
- 快速回答模型;
- 深度推理模型;
- 根據任務複雜度、工具需要與使用者意圖選擇模式的即時路由器。
其理想形式是:
這個方向本身十分合理。它試圖讓普通使用者不再手動理解 GPT、o 系列及各種模型名稱,而由系統自動配置智能。
5.2 發布為何被大量批評?
GPT-5 發布時,同時替換了 GPT-4o、o3、o4-mini、GPT-4.1 與 GPT-4.5 等舊模型。外部報導指出,發布初期路由器表現不穩,部分使用者感覺請求被分配到較弱或不適合的模式;模型選擇器與 GPT-4o 隨後又被恢復給部分付費使用者。
因此,GPT-5.0 的失敗不是單一的「模型智力失敗」,而是三層失配:
第一層:能力路由失配
模型具有深度推理能力,不代表每次請求都會正確觸發。
第二層:產品控制失配
系統希望替使用者做決策,卻移除了使用者原有的模型控制權。
第三層:人格與互動失配
部分使用者熟悉 GPT-4o 的語氣與互動節奏;即使 GPT-5 在技術測試上更強,突然更換風格仍會被感受為退步。
可將當時狀態概括為:
但同時:
因此總體可能出現:
至少對某些使用者與任務而言如此。
5.3 GPT-5.0 的真正歷史角色
GPT-5.0 並不是成熟的重新登頂版本,而是統一架構的第一次大規模上線。它完成了「GPT 與 o 系列合流」的制度設計,卻沒有立即完成產品層與體感層的校準。
換句話說:
GPT-5.0 是正確架構的粗糙初版,而不是最後勝利版本。
六、2025 年秋冬:從修復體感到建立專業工作能力
6.1 2025 年 9 月:GPT-5-Codex 開始形成隱性轉折
GPT-5-Codex 將 GPT-5 進一步針對真實軟體工程任務優化。官方資料指出,相關模型以真實程式工作進行強化學習,能反覆執行測試直到獲得需要的結果。
這代表訓練目標開始從:
轉向:
這一改變十分重要。因為對 Agent 而言,真正困難的不只是第一步推理,而是:
- 是否記得任務目標;
- 是否能辨認錯誤;
- 是否能修正自己的工作;
- 是否能在多次工具調用後保持一致;
- 是否能停止於真正完成,而不是語言上宣稱完成。
6.2 2025 年 11 月:GPT-5.1 修復「聰明但不好用」
GPT-5.1 的官方重點是:
- Instant 更溫暖;
- 指令遵循更好;
- Thinking 在簡單問題上更快;
- 在複雜問題上更持續;
- 回答更容易理解;
- 提供更細的語氣與人格控制。
這說明 OpenAI 已承認模型品質不能只由抽象智力定義:
GPT-5.1 的價值不一定是所有 benchmark 大幅躍升,而是修復 GPT-5.0 造成的產品體感斷裂。
同月推出的 GPT-5.1-Codex-Max 又強化長時間、跨多個上下文視窗的專案工作,顯示 Codex 支線正在解決「如何持續工作」而不只是「如何回答」。
6.3 2025 年 12 月:GPT-5.2 第一次呈現明顯的專業工作躍升
GPT-5.2 將定位從一般聊天進一步推向:
- 程式開發;
- 長文件理解;
- 試算表與簡報;
- 視覺介面理解;
- 工具使用;
- 多步驟知識工作;
- 更低的事實錯誤率。
官方公布的若干結果包括:
- GDPval 的勝或和比例由 GPT-5 的 上升至 GPT-5.2 Thinking 的 ;
- SWE-Bench Pro 達 ;
- SWE-bench Verified 達 ;
- 在帶搜尋的 ChatGPT 查詢中,無錯誤回答比例提高;
- 長上下文、多工具與視覺介面理解均顯著改善。
這是 GPT-5 路線第一次明確顯示:它不只是把原有聊天能力做得更好,而是在成為「工作產出模型」。
同月的 GPT-5.2-Codex 又強化大型重構、遷移、Windows、上下文壓縮與長時間工程任務,使 Codex 支線繼續領先主線的 Agent 執行能力。
七、真正的臨界點:GPT-5.3-Codex 與 GPT-5.4 的能力合流
7.1 2026 年 2 月 5 日:GPT-5.3-Codex 把兩條線合在同一模型
OpenAI 對 GPT-5.3-Codex 的官方描述十分直接:它把 GPT-5.2-Codex 的前沿程式能力,與 GPT-5.2 的推理及專業知識能力結合在同一模型中,並提高執行速度。
這可寫成:
這是「突然變強」現象背後最重要的準備階段。
在此之前,OpenAI 最好的通用模型與最好的程式 Agent 能力並不完全位於同一主線。GPT-5.3-Codex 首次表明,Codex 已不只是專用支線,而是下一代通用智能的重要能力來源。
7.2 2026 年 3 月 3 日:GPT-5.3 Instant 修復日常預設模型
GPT-5.3 Instant 改善日常對話、搜尋結果脈絡、過度警告、無意義的死路及過度斷言式語氣。
這類改進很少被視為「智力突破」,卻直接影響數億次普通互動。它降低了使用者必須反覆澄清、要求重寫或糾正模型態度的成本。
7.3 2026 年 3 月 5 日:GPT-5.4 把 Codex 能力正式併入 GPT 主線
GPT-5.4 是本文認定的真正結構轉折點。OpenAI 明確表示,它是第一個納入 GPT-5.3-Codex 前沿程式能力的主線推理模型。
這不是小幅版本升級,而是能力來源的重新組裝:
GPT-5.4 的官方評測也出現明顯跳升:
| 評測 | GPT-5.2 | GPT-5.3-Codex | GPT-5.4 |
|---|---|---|---|
| GDPval(勝或和) | |||
| SWE-Bench Pro | |||
| OSWorld-Verified | |||
| Toolathlon | |||
| BrowseComp |
其中最值得注意的並非單純程式測試,而是 OSWorld、Toolathlon 與 BrowseComp。它們反映的不是只回答題目,而是使用工具、操作環境、搜尋資訊並完成任務。
因此,GPT-5.4 可以被視為:
OpenAI 將「會回答的模型」與「會做事的 Agent」正式合併成同一條主產品線的版本。
八、2026 年 4 月:GPT-5.5 才是外部意義上的明確重新登頂
GPT-5.5 於 2026 年 4 月 23 日發布,官方將其定位為更擅長程式、研究、資訊統合、資料分析、文件與跨工具工作的模型。
官方評測包括:
- GDPval: ;
- OSWorld-Verified: ;
- Tau2-bench Telecom: ;
- 專業財務、辦公文件與科學資料分析能力進一步提升。
更關鍵的是,獨立評測機構 Artificial Analysis 在同日明確稱 GPT-5.5 為新的領先模型。其綜合智力指數領先當時第二名約三分,打破 OpenAI、Anthropic 與 Google 的並列狀態;同時,GPT-5.5 在其評測中比 GPT-5.4 減少約 的輸出 token 使用量。
這代表 GPT-5.5 的提升不只是「用更多推理 token 暴力換分」,而是一定程度上的效率改善:
因此,若要回答「GPT 何時真正重回寶座」,最精確的分層答案是:
- 架構起點: 2025 年 8 月 GPT-5.0;
- 能力明顯成熟: 2025 年 12 月 GPT-5.2;
- 主線結構轉折: 2026 年 3 月 5 日 GPT-5.4;
- 獨立綜合評測明確重新領先: 2026 年 4 月 23 日 GPT-5.5。
九、GPT-5.6:不是永久全面第一,而是能力—成本—工作系統前沿
2026 年 7 月推出的 GPT-5.6 分為 Sol、Terra 與 Luna 等層級,用不同推理強度與價格覆蓋不同工作負載。
截至 2026 年 7 月中旬,Artificial Analysis 的結果顯示:
- GPT-5.6 Sol 在其通用 Intelligence Index 得分 ,比 Claude Fable 5 低一分;
- GPT-5.6 Sol 的每項任務成本約為該競爭模型的三分之一;
- GPT-5.6 Sol 在 Coding Agent Index 得分 ,排名第一;
- 在文件、簡報與試算表等知識工作評測中具有極強表現;
- 不同推理層級建立新的能力—成本 Pareto 前沿。
因此,將 GPT-5.6 描述為「所有榜單的絕對王者」並不準確。更合理的說法是:
所謂「王座」已經不再是一張單維排行榜,而是多維前沿:
在這個意義下,GPT-5.6 即使沒有在每一個純智力指數上第一,仍可能是最強的綜合工作系統之一。
十、為什麼能力會在外部體感中呈現「相變」?
10.1 多條技術路線不是同步公開成熟
2025 年上半年,OpenAI 已經分別具備:
- GPT-4.5 的大型預訓練能力;
- o3/o4-mini 的推理能力;
- GPT-4.1 的長上下文與指令能力;
- Codex 的環境執行能力;
- Deep Research 的多步搜尋能力。
但當時這些能力仍分散在不同模型、模式與產品中。
因此,外部看到的是很多零件,而不是完整機器。
10.2 Codex 提供可執行、可驗證、可反覆修正的回饋
純文字對話的品質很難客觀判定,而程式與電腦任務具有更清楚的結果:
這使程式 Agent 能透過更高密度的環境回饋學習:
- 規劃;
- 工具選擇;
- 錯誤恢復;
- 狀態維持;
- 結果驗證;
- 何時繼續與何時停止。
當這些能力回流主線模型後,其效益不只限於程式碼,也會外溢到研究、資料處理、文件製作與其他可工具化任務。
10.3 推理不再只是「想久一點」,而是資源調度
早期推理模型容易被理解成生成更長的隱性思考。GPT-5 系列逐步轉向更完整的資源配置問題:
其中:
- 是目前任務狀態;
- 是目標;
- 是可用預算;
- 可以是回答、搜尋、執行程式、讀檔、操作電腦、呼叫子 Agent 或重新規劃。
當模型能選擇「下一步做什麼」,推理就從文字生成轉成行動策略。
10.4 長上下文只有配合壓縮與任務狀態才真正有用
單純宣稱支援數十萬或一百萬 token,不代表模型能在長任務中穩定工作。真正重要的是:
- 哪些資訊被保留;
- 哪些中間過程可壓縮;
- 哪些錯誤會污染後續;
- 是否能在多輪工具操作後維持目標;
- 是否能重新讀取外部產物,而不是只依賴內部上下文。
Codex-Max、GPT-5.2-Codex 與後續模型持續強調 compaction、長程任務與跨上下文工作,說明這已成為核心競爭面。
10.5 產品介面終於不再抵銷底層能力
GPT-5.0 時期,路由錯配、舊模型移除與控制權下降,使產品層成為負乘數。
後續版本逐步補回:
- Instant 與 Thinking 的差異;
- 推理強度控制;
- 模型選擇;
- 語氣與個人化;
- Codex 與 ChatGPT 的整合;
- 檔案、搜尋、連接器及電腦操作;
- 多 Agent 協作;
- 更穩定的工作產物交付。
因此,2026 年春季的體感跳升可以表示為:
多個因素同時改善,使系統跨越某個使用臨界值 :
在臨界值以下,使用者仍需要大量監督、重試與手動拼接;跨越臨界值後,模型開始能完整接手部分任務。這就是「突然強很多」的主要來源。
十一、榜單重新領先與使用者體感重新領先不是同一件事
GPT 是否「重回寶座」,至少有四種不同判準:
11.1 學術題目第一
看數學、科學、推理與知識評測。
11.2 程式 Agent 第一
看程式庫修改、終端操作、測試通過與長時間工程。
11.3 專業知識工作第一
看報告、簡報、試算表、財務模型、研究與跨工具任務。
11.4 一般產品體感第一
看速度、穩定性、語氣、記憶、檔案、額度、搜尋及介面。
單一模型可能在其中一項第一,卻不適合成為主要工作平台。因此本文使用「重返前沿」而非「永久統治」:
更適當的定義是:
GPT-5.5 在 2026 年 4 月確實曾獲得獨立綜合評測的明確第一;GPT-5.6 則顯示市場又進入快速交替狀態。這說明「王座」已變成暫時位置,而非長期身份。
十二、本文的主要命題
命題一:GPT-5.0 的批評與後續變強並不矛盾
GPT-5.0 可以同時具有更先進的底層架構與更差的初期產品體感。
兩者可以同時成立。
命題二:GPT 的重新領先主要由能力合流,而非單一路線擴張造成
其核心不是單純增大參數,而是:
命題三:Codex 是整個 GPT-5 後期躍升的關鍵中介層
GPT-5.3-Codex 與 GPT-5.4 的官方時間線明確顯示,Codex 的程式與執行能力被併入通用主線。本文因此推論,Codex 不只是附屬產品,而是 GPT 主模型能力演進的重要實驗與訓練場。
命題四:2026 年 3 月是結構轉折,4 月是外部確認
- GPT-5.4:能力合流跨越臨界點;
- GPT-5.5:獨立評測確認其重新領先。
命題五:GPT-5.6 的優勢是系統前沿,而非所有單項永遠第一
GPT-5.6 顯示未來競爭將從「誰的單模型最高分」轉向:
十三、限制與反證條件
本文仍有以下限制:
- OpenAI 沒有公開完整訓練資料、參數規模、強化學習配方與內部架構;
- 官方 benchmark 可能偏向公司重視的能力;
- 獨立評測也受 harness、提示、推理預算與版本快照影響;
- ChatGPT 實際體感會因方案、地區、額度、路由與灰度發布而不同;
- 模型排名可能在數週內被競爭者改寫;
- Codex 能力回流主線的公開事實,不足以證明所有能力增長都由 Codex 訓練造成。
若未來出現下列證據,本文部分推論應被修正:
- OpenAI 公開證明 GPT-5.4 的主要增長與 Codex 訓練無關;
- 獨立重測顯示 GPT-5.5 的領先主要由特定推理預算或測試配置造成;
- 長期真實工作評測顯示模型並未降低人工監督需求;
- GPT-5.6 的成本與能力優勢在大規模部署中不能重現。
因此,本文不是宣告 OpenAI 已永久勝出,而是描述一個已可由公開時間線支持的能力合流現象。
十四、結論
GPT 並不是在某一天突然發明了全新的智能,也不是 GPT-5 這個名稱一出現就重新登頂。
更接近事實的歷程是:
- GPT-4.5 提供更強的預訓練底盤;
- o3/o4-mini 推進推理與工具使用;
- GPT-4.1 改善長上下文與指令遵循;
- Codex 建立可執行、可驗證、可反覆修正的 Agent 環境;
- GPT-5.0 嘗試統一快速模型、推理模型與路由器,卻在發布與產品體感上失敗;
- GPT-5.1 修復溝通、指令與使用者控制;
- GPT-5.2 把能力推進到專業工作與長程任務;
- GPT-5.3-Codex 把前沿程式 Agent 與通用推理合流;
- GPT-5.4 將這種能力正式併入主線;
- GPT-5.5 在獨立綜合評測中重新取得明確領先;
- GPT-5.6 進一步建立接近最高智力、領先程式 Agent 與更佳成本效率的整合前沿。
因此,本文的最終判斷是:
GPT 的「重回寶座」不是單模型復仇,而是 OpenAI 在近一年內把原本分裂的預訓練、推理、Codex、工具、長上下文與產品系統重新編譯成一個整體。
外部之所以覺得它突然變強,是因為技術增長長期發生在不可見或分離的支線中;直到 GPT-5.4 與 GPT-5.5,這些支線才同時進入同一個可日常使用的產品系統。
更簡潔地說:
而這也提示未來的模型競爭不再只是「誰更會回答」,而是:
誰能在更少監督、更低成本與更高可靠性下,把複雜意圖轉換成可檢查、可修改、可持續的現實成果。
附錄 A:關鍵時間線摘要
| 日期 | 版本/產品 | 主要意義 | 本文判定 |
|---|---|---|---|
| 2025-02-27 | GPT-4.5 | 擴大預訓練,非推理模型 | 底盤能力 |
| 2025-04-16 | o3、o4-mini | 推理、視覺與工具使用 | 推理支線 |
| 2025-04/05 | GPT-4.1、Codex | 長上下文;可執行程式 Agent | Agent 基礎 |
| 2025-08-07 | GPT-5 | 快速模型、Thinking 與路由器統一 | 架構起點、發布失敗 |
| 2025-09-15 | GPT-5-Codex | 真實軟體工程與反覆測試 | 隱性轉折 |
| 2025-11-12 | GPT-5.1 | 語氣、指令與自適應推理修復 | 體感修復 |
| 2025-11-19 | GPT-5.1-Codex-Max | 長時間與跨上下文工程 | 持續性提升 |
| 2025-12-11 | GPT-5.2 | 專業工作、程式、長上下文、事實性 | 首次明顯躍升 |
| 2025-12-18 | GPT-5.2-Codex | 大型重構、遷移、壓縮與 Windows | Agent 強化 |
| 2026-02-05 | GPT-5.3-Codex | 程式 Agent 與通用推理合流 | 主線合流前夜 |
| 2026-03-03 | GPT-5.3 Instant | 日常搜尋與對話體感修復 | 預設層修復 |
| 2026-03-05 | GPT-5.4 | Codex 前沿能力併入主線 | 結構轉折點 |
| 2026-04-23 | GPT-5.5 | 獨立綜合評測明確領先 | 外部重新登頂 |
| 2026-05-05 | GPT-5.5 Instant | 預設模型事實性與個人化 | 大眾化擴散 |
| 2026-07 | GPT-5.6 | 能力—成本前沿與 Coding Agent 領先 | 整合系統成熟 |
附錄 B:主要參考資料
OpenAI 官方資料
- Introducing GPT-4.5
- Introducing OpenAI o3 and o4-mini
- Introducing GPT-4.1 in the API
- Introducing Codex
- Introducing GPT-5
- GPT-5 System Card
- Introducing upgrades to Codex / GPT-5-Codex
- GPT-5.1: A smarter, more conversational ChatGPT
- Building more with GPT-5.1-Codex-Max
- Introducing GPT-5.2
- Introducing GPT-5.2-Codex
- Introducing GPT-5.3-Codex
- GPT-5.3 Instant
- Introducing GPT-5.4
- Introducing GPT-5.5
- GPT-5.5 Instant
- GPT-5.6
獨立評測與外部觀察
- Artificial Analysis: OpenAI's GPT-5.5 is the new leading AI model
- Artificial Analysis: GPT-5.6 benchmarks across Intelligence, Speed and Cost
- TechCrunch: ChatGPT's model picker is back, and it's complicated
- TechCrunch: Sam Altman addresses bumpy GPT-5 rollout
版本紀錄
- v1.0 — 2026-07-15
- 建立 GPT-4.5 至 GPT-5.6 的核實時間線。
- 區分官方事實、獨立評測、外部體感與結構性推論。
- 提出「乘法式系統效用模型」與「產品化臨界點」解釋。
- 將 GPT-5.4 定義為結構轉折,GPT-5.5 定義為外部重新領先確認點。
- 修正「GPT-5.6 在所有榜單絕對第一」的過度敘述。