← Archive
lm-001617 · 2026-07

半年窗口的提前啟動_Fable級模型常態化第一階段觀察_v0.1

下載 MD 檔 ⬇

半年窗口的提前啟動

Fable 級模型常態化的第一階段觀察與 Agent 基礎設施合流

英文工作名: The Half-Year Window Started Early: First-Stage Evidence for the Normalization of Fable-Class Models and the Convergence of Agent Infrastructure
作者: Neo.K
機構: EveMissLab/一言諾科技有限公司
文件性質: AI 產業觀察論文/前作更新/可持續修訂稿
版本: v0.1
觀察截止日: 2026-07-18
前作: 《半年窗口:Fable 級模型常態化與 Agent 級 AGI 基礎設施的前夜》
前作日期: 2026-07-07


摘要

2026 年 7 月 7 日,前作提出一項高權重觀察假說:未來半年可能不是等待單一「AGI 模型」降臨的時期,而是 Fable 級能力逐步由少數前沿模型的特殊優勢,轉化為多家公司、多價格層、多部署形態與多種 Agent 工作流都能取得的常態化能力帶。

截至 2026 年 7 月 18 日,距前作成稿僅十一日,公開市場已密集出現 GPT-5.6、Meta Muse Spark 1.1、Kimi K3 與 Grok 4.5;此前不久,Claude Fable 5、GLM-5.2 與 Gemini 3.5 Flash 亦已發布。這些模型並不完全同等,也不能只憑供應商公布的 benchmark 直接排序;然而,它們在長程編程、知識工作、百萬 Token 上下文、多 Agent 調度、工具使用、電腦操作、上下文壓縮與工作台整合等方向上,呈現高度同步的產品化收斂。

因此,本文不主張「半年窗口已全部驗證」,而提出較嚴格的更新:

半年窗口並非尚未開始的倒數,而是已提前進入第一階段驗證。\boxed{ \text{半年窗口並非尚未開始的倒數,而是已提前進入第一階段驗證。} }

「半年」應重新理解為觀察能力擴散、價格下降、開放部署、Agent 可靠性與工作流吸收程度的驗證窗口,而不是等待相變起點的時間預報。

本文進一步區分「模型常態化」與「Agent 基礎設施常態化」:前者已出現強烈早期訊號,後者雖快速合流,仍未完成對長任務可靠性、錯誤恢復、權限治理、持久記憶、企業採用與人類審核介面的全面驗證。

關鍵詞: Fable 級模型、GPT-5.6、Kimi K3、GLM-5.2、Grok 4.5、Muse Spark 1.1、Gemini 3.5、Agent、模型常態化


一、不是勝利宣言,而是提前驗證紀錄

前作中的「半年」不是保證日期,也不是聲稱六個月後必然出現 AGI。它指的是:當模型能力、推理成本、上下文長度、工具介面、Agent framework、產品 UX、企業需求、安全政策與競爭壓力同時接近臨界點時,未來半年可能成為觀察這些條件是否合流的高價值窗口。

前作真正的判定重點不是社群是否高喊 AGI,而是:

  • 模型能否處理跨檔案與跨工具工作;
  • 長任務能否從數分鐘延伸至數小時乃至數日;
  • Agent 是否具備錯誤恢復與上下文維持;
  • 工作台是否從聊天界面轉向任務委派;
  • 成本是否下降到可日常使用;
  • 企業是否把真實流程交給 Agent;
  • 人類是否建立可審核、可回滾、可中止的介面。

從 2026 年 7 月 7 日到 7 月 18 日只有十一天。這足以觀察模型發布密度、能力方向收斂與供應商增加,但不足以驗證數月級穩定性、企業採用率、安全事故率與長期成本。

因此,目前結論強度應限制在:

L2=方向性更新L_2=\text{方向性更新}

至:

L3=競爭解釋中較佳L_3=\text{競爭解釋中較佳}

而不是完整實證確認。


二、時間校準:相變起點可能早於前作

日期 模型/事件 與前作的關係 主要方向
2026-05-19 Gemini 3.5 Flash 模型卡 前作前 49 日 高速 Agent、長程執行、多模態、1M 上下文
2026-06-09 Claude Fable 5 前作前 28 日 長程 Coding、知識工作、電腦操作
2026-06-16 GLM-5.2 前作前 21 日 開放權重、MIT、1M 上下文、長程工程
2026-07-07 《半年窗口》成稿 觀察起點 建立半年驗證框架
2026-07-09 GPT-5.6 正式發布 前作後 2 日 模型分層、端到端知識工作、多 Agent
2026-07-09 Meta Muse Spark 1.1 前作後 2 日 多 Agent、Computer Use、1M 上下文、API
2026-07-16 Kimi K3 前作後 9 日 2.8T、原生視覺、1M 上下文、Agent 工作台
2026-07-16 Grok 4.5 前作後 9 日 Coding、Agent、知識工作、Office

Fable 5、Gemini 3.5 Flash 與 GLM-5.2 都早於前作,不能在事後全部算成「預測成功」。較嚴格的說法是:

  1. 它們構成前作形成時的背景訊號;
  2. 前作據此辨認出能力帶將快速擴散;
  3. 前作之後十一天內,GPT-5.6、Muse Spark 1.1、Kimi K3 與 Grok 4.5 形成新的追加證據。

因此,前作的歷史定位可能不是「相變前預言」,而是:

相變初期的結構辨識\boxed{ \text{相變初期的結構辨識} }

三、什麼叫做 Fable 級模型常態化?

常態化不要求所有模型完全相等。它只要求多個模型進入「前沿鄰近能力帶」:

Fθ(t)={mS(m,t)θS(t)}\mathcal F_\theta(t) = \left\{ m\mid S(m,t)\geq \theta S^\ast(t) \right\}

其中:

  • S(t)S^\ast(t) :時間 tt 的可觀察前沿;
  • θ\theta :前沿鄰近門檻;
  • Fθ(t)\mathcal F_\theta(t) :前沿鄰近模型集合。

當以下三件事同時發生時,常態化開始:

Fθ(t)|\mathcal F_\theta(t)|\uparrow

即前沿鄰近模型數量增加;

Diversity(Fθ)\operatorname{Diversity}(\mathcal F_\theta)\uparrow

即供應商、國家、授權、價格與部署方式增加;

以及:

Substitutability(Fθ)\operatorname{Substitutability}(\mathcal F_\theta)\uparrow

即同一工作流可在多模型之間遷移。

本文將常態化拆為五個維度:

NF(t)=f(Ct,Dt,Pt,Ht,Wt)N_F(t) = f(C_t,D_t,P_t,H_t,W_t)

其中:

  • CtC_t :能力接近度;
  • DtD_t :供應者多樣性;
  • PtP_t :價格與效率可用性;
  • HtH_t :Agent harness 成熟度;
  • WtW_t :工作流吸收度。

截至 2026 年 7 月 18 日,前四者已有明顯上升訊號,第五項仍待長期驗證。


四、中國前沿模型不再只是追趕者

4.1 GLM-5.2:開放長程工程基座

GLM-5.2 於 2026 年 6 月 16 日發布,其主要特徵包括:

  • 工程可用的 100 萬 Token 上下文;
  • 多級推理強度;
  • 針對長程 Coding Agent 軌跡訓練;
  • MIT 開放授權;
  • 多種本地推理框架支援;
  • 與 Claude Code、OpenCode、ZCode 等 harness 整合;
  • 明確處理上下文壓縮、超長軌跡與推理效率。

其意義不是單純 benchmark 提升,而是:

前沿鄰近能力+開放權重+長程 Agent 訓練+工程部署\boxed{ \text{前沿鄰近能力} + \text{開放權重} + \text{長程 Agent 訓練} + \text{工程部署} }

這削弱了「長程 Agent 基座只能由少數美國封閉公司提供」的假設。

4.2 Kimi K3:開放模型逼近全球前沿帶

Kimi K3 於 2026 年 7 月 16 日發布。官方公布:

  • 2.8T 總參數;
  • 原生視覺能力;
  • 100 萬 Token 上下文;
  • 面向長程 Coding、知識工作與推理;
  • 可在 Kimi、Kimi Work、Kimi Code 與 API 中使用;
  • 完整權重預定於 2026 年 7 月 27 日發布;
  • 整體表現仍落後最強的 Fable 5 與 GPT-5.6 Sol,但已進入前沿級能力區間。

這顯示:

開放或準開放模型全球前沿鄰近能力帶\text{開放或準開放模型} \rightarrow \text{全球前沿鄰近能力帶}

Kimi K3 還展示了長時間工程、多 Agent 研究、視覺—程式閉環、科學文獻到可執行程式,以及 Widgets、Dashboard、Work、Code 等產品棧整合。

但截至 7 月 18 日,完整權重尚未發布。後續需檢查:

  • 是否按期發布;
  • 授權是否足夠開放;
  • 社群能否實際部署;
  • 推理成本是否可承受;
  • 第三方是否能重現長程能力。

五、美國前沿公司同步轉向 Agent 基座

5.1 GPT-5.6:能力分層與多 Agent 商品化

GPT-5.6 於 2026 年 7 月 9 日全面發布,形成:

  • Sol:前沿能力;
  • Terra:能力與成本平衡;
  • Luna:高效率與高吞吐;
  • ultra:多 Agent 平行工作模式。

這種分層表示常態化不只靠最高階模型,而靠:

高階能力不同成本與延遲層大量工作流可用\text{高階能力} \rightarrow \text{不同成本與延遲層} \rightarrow \text{大量工作流可用}

公開重點已從單次回答轉向端到端知識工作、Coding、Computer Use、設計判斷、多 Agent 調度與每美元任務成功率。

5.2 Muse Spark 1.1:平台型個人 Agent

Meta 於 2026 年 7 月 9 日發布 Muse Spark 1.1,並開放 Meta Model API 預覽。其方向包括:

  • 多模態推理;
  • MCP、原生工具與自訂 Skill;
  • 100 萬 Token 主動上下文管理;
  • 多 Agent 編排;
  • Computer Use;
  • 大型程式庫工作;
  • 規劃、委派、子 Agent 執行與回報;
  • 上下文壓縮。

Meta 的潛在優勢不只在模型,而是:

模型+Agent+社交圖譜+裝置+平台分發\boxed{ \text{模型} + \text{Agent} + \text{社交圖譜} + \text{裝置} + \text{平台分發} }

這使其可能走出與純模型公司不同的個人 Agent 路線。

5.3 Grok 4.5:從即時聊天轉向工程與知識工作

Grok 4.5 於 2026 年 7 月 16 日發布,官方定位已轉向:

  • Coding;
  • Agentic Tasks;
  • Knowledge Work;
  • 長程軟體工程;
  • Office 工作;
  • 高速與 Token 效率;
  • Grok Build 工作台。

這表示不同公司雖從不同路線出發,卻走向相似產品終點:

規劃+工具+執行+驗證+工作成品\text{規劃} + \text{工具} + \text{執行} + \text{驗證} + \text{工作成品}

六、Google:消費端體感與技術基礎必須分開

部分使用者可能認為 Gemini 在長篇協作、語義穩定性或完成感上不如 GPT-5.6、Fable 5 或部分中國模型。這是一種可記錄的產品體驗,但不能直接推出 Google 底層技術落後。

Google 已公開:

  • Gemini 3.5 Flash;
  • 100 萬 Token 上下文;
  • 長程 Agent 執行;
  • 多 Agent 編排;
  • Coding;
  • 多模態;
  • Tool Use;
  • Gemini Enterprise Agent Platform;
  • Google Antigravity。

同時,Gemini 3.5 Pro 仍標示為即將推出。

所以:

消費端體感未必領先研究與 Agent 基礎設施不先進\boxed{ \text{消費端體感未必領先} \neq \text{研究與 Agent 基礎設施不先進} }

至於 Google 內部是否已有顯著超越公開版的模型,目前只能列為合理推論,不能視為已確認事實。


七、真正發生的是能力形態收斂

不同公司反覆使用相似概念:

  • Long-Horizon Tasks;
  • Agentic Coding;
  • Knowledge Work;
  • Computer Use;
  • Multi-Agent;
  • Planning;
  • Subagent Delegation;
  • Context Compaction;
  • 1M Context;
  • Tool Calling;
  • MCP;
  • Office;
  • End-to-End Work;
  • Persistent Workspace。

這意味著競爭焦點已逐漸從單次問答,轉向:

把模型變成可持續執行工作的認知作業核心\boxed{ \text{把模型變成可持續執行工作的認知作業核心} }

模型與 harness 也已不可分離:

Performance=f(M,H,T,C,V,R)\operatorname{Performance} = f(M,H,T,C,V,R)

其中:

  • MM :模型;
  • HH :Agent harness;
  • TT :工具;
  • CC :上下文管理;
  • VV :驗證器;
  • RR :錯誤恢復。

當模型差距縮小,真正差異可能來自任務分解、平行 Agent、工具選擇、記憶壓縮、權限、回滾與審核。


八、目前已獲得的第一階段支持

截至 2026 年 7 月 18 日,至少形成以下候選集合:

F={Fable 5,GPT-5.6,Kimi K3,GLM-5.2,Grok 4.5,Muse Spark 1.1,Gemini 3.5 Flash}\mathcal F = \{ \text{Fable 5}, \text{GPT-5.6}, \text{Kimi K3}, \text{GLM-5.2}, \text{Grok 4.5}, \text{Muse Spark 1.1}, \text{Gemini 3.5 Flash} \}

它們並不完全同等,但已共同進入長程 Coding、知識工作、工具使用、多模態、長上下文與工作台整合構成的前沿競爭區。

若只有一家美國公司突破,仍可解讀為單點領先;但中國模型也在大規模 MoE、開放權重、百萬上下文、Coding Agent、多 Agent、低價 API 與工作台方向快速靠近,更合理的解釋是:

前沿能力正在跨公司、跨國家擴散\boxed{ \text{前沿能力正在跨公司、跨國家擴散} }

同時,各家公司開始強調更少 Token、更低成本、更快完成、多種 effort level、模型家族分層與 Cache,顯示市場正從「能力是否存在」轉向「能力能否大量調用」。


九、尚未完成的第二階段驗證

9.1 長任務可靠性

仍需第三方長期驗證:

  • 是否能穩定重現;
  • 是否需要大量人工救援;
  • 是否會中途偏離目標;
  • 壓縮是否遺失關鍵約束;
  • 是否產生難以發現的局部錯誤;
  • 成本是否可被一般團隊承受。

9.2 錯誤恢復

真正的 Agent 常態化需要:

FailureDetectionDiagnosisRollbackRetry\text{Failure} \rightarrow \text{Detection} \rightarrow \text{Diagnosis} \rightarrow \text{Rollback} \rightarrow \text{Retry}

目前成功案例很多,但失敗分布、回復率、未察覺錯誤率與權限錯用仍缺乏充分資料。

9.3 權限治理

Agent 能操作程式碼、終端、網頁、檔案、Office 與第三方服務,因此必須同步成熟:

  • 最小權限;
  • 敏感操作確認;
  • 操作日誌;
  • 來源追蹤;
  • 沙盒;
  • 回滾;
  • 資料隔離;
  • 多 Agent 權限分層;
  • 人類中止權。

9.4 工作流吸收

模型發布速度很快,但組織吸收速度可能較慢:

模型能力產品功能工作流程組織制度\text{模型能力} \rightarrow \text{產品功能} \rightarrow \text{工作流程} \rightarrow \text{組織制度}

所以模型常態化不代表勞動流程立即全面重寫。


十、修正版命題:半年是擴散窗口,不是等待窗口

原命題可修正為:

Fable 級能力常態化已經啟動;未來半年要觀察的是,這種能力是否由發布密集轉化為價格、部署、可靠性、Agent harness、企業採用與日常委派的全面擴散。

形式化為:

Tstart<2026-07-07T_{\mathrm{start}} < 2026\text{-}07\text{-}07

而:

Tvalidation=[2026-07-07, 2027-01-07]T_{\mathrm{validation}} = [2026\text{-}07\text{-}07,\ 2027\text{-}01\text{-}07]

三階段如下:

第一階段:能力帶形成

少數前沿模型多供應商前沿鄰近集合\text{少數前沿模型} \rightarrow \text{多供應商前沿鄰近集合}

目前狀態:已明顯開始。

第二階段:產品與價格商品化

前沿能力不同成本、速度、授權與部署層\text{前沿能力} \rightarrow \text{不同成本、速度、授權與部署層}

目前狀態:正在快速形成。

第三階段:工作流與制度吸收

模型可用Agent 可委派組織流程重構\text{模型可用} \rightarrow \text{Agent 可委派} \rightarrow \text{組織流程重構}

目前狀態:尚待驗證。


十一、後續更新計畫

節點 日期 主要檢查內容
基準版 2026-07-18 建立本篇與初始狀態
Kimi 開放節點 2026-07-27 K3 權重、授權、技術報告與部署
一個月節點 2026-08-18 第三方評測、API 穩定性、早期經驗
三個月節點 2026-10-07 Agent 生態、企業採用、價格與工作流
半年終點 2027-01-07 正式成立/部分成立/下修判定

每次更新應記錄六組指標:

  1. 模型能力:長程 Coding、知識工作、Computer Use、工具、多模態;
  2. 成本效率:API 價格、Token、推理時間、Cache、本地部署;
  3. Agent harness:規劃、子 Agent、壓縮、恢復、驗證、回滾;
  4. 開放生態:權重、授權、社群部署、推理框架;
  5. 工作流吸收:企業、個人工作、Office、科學、法律、金融;
  6. 可靠性治理:幻覺、偏移、權限事故、Prompt Injection、人類介入。

十二、可證偽與下修條件

若未來出現以下情況,應下修常態化判斷:

  1. benchmark 無法轉化為真實生產能力;
  2. 長任務成本過高;
  3. Agent 仍需高密度人工救援;
  4. 開放模型因硬體、授權或成本無法實際部署;
  5. 半年後仍只有展示案例,未進入組織流程;
  6. 安全與權限治理成本上升得比可用能力更快。

人工介入密度可表示為:

Dhuman=人工介入次數任務時間D_{\mathrm{human}} = \frac{\text{人工介入次數}} {\text{任務時間}}

若它長期維持高位,Agent 只是放大局部工作,尚未形成真正可委派的基礎設施。


十三、對小型團隊與研究者的含義

當前沿能力逐步形成多供應商能力帶,最合理的策略不是永久依賴某一模型,而是建立:

  • 模型可替換接口;
  • 統一工具協議;
  • 知識庫;
  • 記憶層;
  • 權限層;
  • 驗證層;
  • 回滾層;
  • 可審核輸出;
  • Agent 任務格式。

即:

模型可以更換,外部認知結構必須累積。\boxed{ \text{模型可以更換,外部認知結構必須累積。} }

當基礎模型差距縮小,差異化資產將更多位於專業語料、特定工作流、領域驗證器、長期記憶、權限治理、人類審核介面與跨模型調度。

這與前作的戰略判斷一致:

半年窗口不是等待下一個模型,而是建造下一層結構。


十四、結論

截至 2026 年 7 月 18 日,最合理的判斷不是「Fable 5 已成為毫無差異的普通模型」,也不是「Agent 級 AGI 基礎設施已完成」。

而是:

Fable 級能力已從單點領先,進入多供應商能力帶形成期。\boxed{ \text{Fable 級能力已從單點領先,進入多供應商能力帶形成期。} }

同時:

Agent 基礎設施的技術方向已高度合流,但可靠性與制度吸收仍待驗證。\boxed{ \text{Agent 基礎設施的技術方向已高度合流,但可靠性與制度吸收仍待驗證。} }

GLM-5.2 與 Kimi K3 顯示,前沿 Agent 能力的擴散不只發生在美國封閉模型之間;它也可能透過開放權重、超長上下文、低價 API、Coding Agent、工作台與多 Agent 系統向外擴散。

GPT-5.6、Muse Spark 1.1 與 Grok 4.5 則顯示,美國不同類型公司正同步把競爭從聊天模型推向:

端到端工作+工具+多 Agent+電腦操作+工作成品\text{端到端工作} + \text{工具} + \text{多 Agent} + \text{電腦操作} + \text{工作成品}

Google 的消費端體感可能暫時不占優勢,但其公開 Agent、長上下文、多模態與企業基礎設施仍使其不能被排除於前沿競爭之外。

因此,前作的半年窗口應更新為:

常態化不是六個月後才開始。它在文章完成時可能已經啟動。未來半年真正要觀察的,是模型能力帶能否穿透價格、部署、工作流、可靠性與制度治理,成為可持續委派的 Agent 基礎設施。


十五、一句話版本

Fable 級模型常態化沒有等待半年; 半年窗口在被命名時,已經開始。\boxed{ \text{Fable 級模型常態化沒有等待半年; 半年窗口在被命名時,已經開始。} }

附錄 A:初始狀態表

模型 公開日期 長上下文 Agent/工具 多 Agent 開放狀態 觀察角色
Gemini 3.5 Flash 2026-05-19 1M 展示/平台 封閉 高速 Agent 與 Google 基礎設施
Claude Fable 5 2026-06-09 長程產品化 工作流支援 封閉 原始前沿標尺
GLM-5.2 2026-06-16 1M Harness 可組合 MIT 開放權重 開放長程工程基座
GPT-5.6 2026-07-09 依產品規格 ultra 平行 Agent 封閉 分層與效率商品化
Muse Spark 1.1 2026-07-09 1M 主動管理 原生編排 API 預覽/封閉 平台型個人 Agent
Kimi K3 2026-07-16 1M 權重預定 7 月 27 日 中國開放前沿逼近
Grok 4.5 2026-07-16 依產品規格 長程 Agent 訓練 封閉 工程、知識與 Office 追趕

各公司使用不同 benchmark、harness、推理強度與成本假設,本表不將其視為可直接橫向排序的統一測量。


附錄 B:後續版本紀錄模板

版本:
觀察截止日:

一、新模型與產品發布
二、既有模型的重要更新
三、第三方評測變化
四、價格與效率
五、開放權重與部署
六、Agent harness
七、企業與個人工作流採用
八、可靠性、安全與治理事故
九、支持原命題的證據
十、反對或下修原命題的證據
十一、目前結論強度:L0 / L1 / L2 / L3 / L4 / L5
十二、下一觀察節點

參考資料

前作與內部文件

  1. Neo.K,《半年窗口:Fable 級模型常態化與 Agent 級 AGI 基礎設施的前夜》,2026-07-07。
  2. Neo.K,《脈衝式智能發展與現實耦合閾值》,2026-07-07。

官方公開資料

  1. Anthropic, “Claude Fable 5,” 2026-06-09;全球重新部署更新,2026-07-01。
  2. Z.ai, “GLM-5.2: Built for Long-Horizon Tasks,” 2026-06-16。
  3. OpenAI, “GPT-5.6: Frontier Intelligence That Scales with Your Ambition,” 2026-07-09。
  4. Meta Superintelligence Labs, “Introducing Muse Spark 1.1,” 2026-07-09。
  5. Kimi, “Kimi K3: Open Frontier Intelligence,” 2026-07-16。
  6. SpaceXAI, “Introducing Grok 4.5,” 2026-07-16。
  7. Google DeepMind, “Gemini 3.5 Flash Model Card,” 2026-05-19。

版本說明

v0.1 — 2026-07-18

  • 建立前作的第一份正式更新論文;
  • 校準 2026 年 5 月至 7 月公開模型時間線;
  • 區分模型常態化與 Agent 基礎設施常態化;
  • 建立能力接近、供應商多樣性、價格效率、harness 與工作流吸收五維模型;
  • 加入中國 AI、OpenAI、Meta、Grok 與 Google 的分別觀察;
  • 建立 2026-07-27、2026-08-18、2026-10-07、2027-01-07 四個後續節點;
  • 保留反證條件與下修機制。