# 半年窗口的提前啟動
## Fable 級模型常態化的第一階段觀察與 Agent 基礎設施合流

**英文工作名：** *The Half-Year Window Started Early: First-Stage Evidence for the Normalization of Fable-Class Models and the Convergence of Agent Infrastructure*  
**作者：** Neo.K  
**機構：** EveMissLab／一言諾科技有限公司  
**文件性質：** AI 產業觀察論文／前作更新／可持續修訂稿  
**版本：** v0.1  
**觀察截止日：** 2026-07-18  
**前作：** 《半年窗口：Fable 級模型常態化與 Agent 級 AGI 基礎設施的前夜》  
**前作日期：** 2026-07-07  

---

## 摘要

2026 年 7 月 7 日，前作提出一項高權重觀察假說：未來半年可能不是等待單一「AGI 模型」降臨的時期，而是 Fable 級能力逐步由少數前沿模型的特殊優勢，轉化為多家公司、多價格層、多部署形態與多種 Agent 工作流都能取得的常態化能力帶。

截至 2026 年 7 月 18 日，距前作成稿僅十一日，公開市場已密集出現 GPT-5.6、Meta Muse Spark 1.1、Kimi K3 與 Grok 4.5；此前不久，Claude Fable 5、GLM-5.2 與 Gemini 3.5 Flash 亦已發布。這些模型並不完全同等，也不能只憑供應商公布的 benchmark 直接排序；然而，它們在長程編程、知識工作、百萬 Token 上下文、多 Agent 調度、工具使用、電腦操作、上下文壓縮與工作台整合等方向上，呈現高度同步的產品化收斂。

因此，本文不主張「半年窗口已全部驗證」，而提出較嚴格的更新：

$$
\boxed{
\text{半年窗口並非尚未開始的倒數，而是已提前進入第一階段驗證。}
}
$$

「半年」應重新理解為觀察能力擴散、價格下降、開放部署、Agent 可靠性與工作流吸收程度的驗證窗口，而不是等待相變起點的時間預報。

本文進一步區分「模型常態化」與「Agent 基礎設施常態化」：前者已出現強烈早期訊號，後者雖快速合流，仍未完成對長任務可靠性、錯誤恢復、權限治理、持久記憶、企業採用與人類審核介面的全面驗證。

**關鍵詞：** Fable 級模型、GPT-5.6、Kimi K3、GLM-5.2、Grok 4.5、Muse Spark 1.1、Gemini 3.5、Agent、模型常態化

---

# 一、不是勝利宣言，而是提前驗證紀錄

前作中的「半年」不是保證日期，也不是聲稱六個月後必然出現 AGI。它指的是：當模型能力、推理成本、上下文長度、工具介面、Agent framework、產品 UX、企業需求、安全政策與競爭壓力同時接近臨界點時，未來半年可能成為觀察這些條件是否合流的高價值窗口。

前作真正的判定重點不是社群是否高喊 AGI，而是：

- 模型能否處理跨檔案與跨工具工作；
- 長任務能否從數分鐘延伸至數小時乃至數日；
- Agent 是否具備錯誤恢復與上下文維持；
- 工作台是否從聊天界面轉向任務委派；
- 成本是否下降到可日常使用；
- 企業是否把真實流程交給 Agent；
- 人類是否建立可審核、可回滾、可中止的介面。

從 2026 年 7 月 7 日到 7 月 18 日只有十一天。這足以觀察模型發布密度、能力方向收斂與供應商增加，但不足以驗證數月級穩定性、企業採用率、安全事故率與長期成本。

因此，目前結論強度應限制在：

$$
L_2=\text{方向性更新}
$$

至：

$$
L_3=\text{競爭解釋中較佳}
$$

而不是完整實證確認。

---

# 二、時間校準：相變起點可能早於前作

| 日期 | 模型／事件 | 與前作的關係 | 主要方向 |
|---|---|---:|---|
| 2026-05-19 | Gemini 3.5 Flash 模型卡 | 前作前 49 日 | 高速 Agent、長程執行、多模態、1M 上下文 |
| 2026-06-09 | Claude Fable 5 | 前作前 28 日 | 長程 Coding、知識工作、電腦操作 |
| 2026-06-16 | GLM-5.2 | 前作前 21 日 | 開放權重、MIT、1M 上下文、長程工程 |
| **2026-07-07** | **《半年窗口》成稿** | **觀察起點** | 建立半年驗證框架 |
| 2026-07-09 | GPT-5.6 正式發布 | 前作後 2 日 | 模型分層、端到端知識工作、多 Agent |
| 2026-07-09 | Meta Muse Spark 1.1 | 前作後 2 日 | 多 Agent、Computer Use、1M 上下文、API |
| 2026-07-16 | Kimi K3 | 前作後 9 日 | 2.8T、原生視覺、1M 上下文、Agent 工作台 |
| 2026-07-16 | Grok 4.5 | 前作後 9 日 | Coding、Agent、知識工作、Office |

Fable 5、Gemini 3.5 Flash 與 GLM-5.2 都早於前作，不能在事後全部算成「預測成功」。較嚴格的說法是：

1. 它們構成前作形成時的背景訊號；
2. 前作據此辨認出能力帶將快速擴散；
3. 前作之後十一天內，GPT-5.6、Muse Spark 1.1、Kimi K3 與 Grok 4.5 形成新的追加證據。

因此，前作的歷史定位可能不是「相變前預言」，而是：

$$
\boxed{
\text{相變初期的結構辨識}
}
$$

---

# 三、什麼叫做 Fable 級模型常態化？

常態化不要求所有模型完全相等。它只要求多個模型進入「前沿鄰近能力帶」：

$$
\mathcal F_\theta(t)
=
\left\{
m\mid S(m,t)\geq \theta S^\ast(t)
\right\}
$$

其中：

- $S^\ast(t)$ ：時間 $t$ 的可觀察前沿；
- $\theta$ ：前沿鄰近門檻；
- $\mathcal F_\theta(t)$ ：前沿鄰近模型集合。

當以下三件事同時發生時，常態化開始：

$$
|\mathcal F_\theta(t)|\uparrow
$$

即前沿鄰近模型數量增加；

$$
\operatorname{Diversity}(\mathcal F_\theta)\uparrow
$$

即供應商、國家、授權、價格與部署方式增加；

以及：

$$
\operatorname{Substitutability}(\mathcal F_\theta)\uparrow
$$

即同一工作流可在多模型之間遷移。

本文將常態化拆為五個維度：

$$
N_F(t)
=
f(C_t,D_t,P_t,H_t,W_t)
$$

其中：

- $C_t$ ：能力接近度；
- $D_t$ ：供應者多樣性；
- $P_t$ ：價格與效率可用性；
- $H_t$ ：Agent harness 成熟度；
- $W_t$ ：工作流吸收度。

截至 2026 年 7 月 18 日，前四者已有明顯上升訊號，第五項仍待長期驗證。

---

# 四、中國前沿模型不再只是追趕者

## 4.1 GLM-5.2：開放長程工程基座

GLM-5.2 於 2026 年 6 月 16 日發布，其主要特徵包括：

- 工程可用的 100 萬 Token 上下文；
- 多級推理強度；
- 針對長程 Coding Agent 軌跡訓練；
- MIT 開放授權；
- 多種本地推理框架支援；
- 與 Claude Code、OpenCode、ZCode 等 harness 整合；
- 明確處理上下文壓縮、超長軌跡與推理效率。

其意義不是單純 benchmark 提升，而是：

$$
\boxed{
\text{前沿鄰近能力}
+
\text{開放權重}
+
\text{長程 Agent 訓練}
+
\text{工程部署}
}
$$

這削弱了「長程 Agent 基座只能由少數美國封閉公司提供」的假設。

## 4.2 Kimi K3：開放模型逼近全球前沿帶

Kimi K3 於 2026 年 7 月 16 日發布。官方公布：

- 2.8T 總參數；
- 原生視覺能力；
- 100 萬 Token 上下文；
- 面向長程 Coding、知識工作與推理；
- 可在 Kimi、Kimi Work、Kimi Code 與 API 中使用；
- 完整權重預定於 2026 年 7 月 27 日發布；
- 整體表現仍落後最強的 Fable 5 與 GPT-5.6 Sol，但已進入前沿級能力區間。

這顯示：

$$
\text{開放或準開放模型}
\rightarrow
\text{全球前沿鄰近能力帶}
$$

Kimi K3 還展示了長時間工程、多 Agent 研究、視覺—程式閉環、科學文獻到可執行程式，以及 Widgets、Dashboard、Work、Code 等產品棧整合。

但截至 7 月 18 日，完整權重尚未發布。後續需檢查：

- 是否按期發布；
- 授權是否足夠開放；
- 社群能否實際部署；
- 推理成本是否可承受；
- 第三方是否能重現長程能力。

---

# 五、美國前沿公司同步轉向 Agent 基座

## 5.1 GPT-5.6：能力分層與多 Agent 商品化

GPT-5.6 於 2026 年 7 月 9 日全面發布，形成：

- Sol：前沿能力；
- Terra：能力與成本平衡；
- Luna：高效率與高吞吐；
- `ultra`：多 Agent 平行工作模式。

這種分層表示常態化不只靠最高階模型，而靠：

$$
\text{高階能力}
\rightarrow
\text{不同成本與延遲層}
\rightarrow
\text{大量工作流可用}
$$

公開重點已從單次回答轉向端到端知識工作、Coding、Computer Use、設計判斷、多 Agent 調度與每美元任務成功率。

## 5.2 Muse Spark 1.1：平台型個人 Agent

Meta 於 2026 年 7 月 9 日發布 Muse Spark 1.1，並開放 Meta Model API 預覽。其方向包括：

- 多模態推理；
- MCP、原生工具與自訂 Skill；
- 100 萬 Token 主動上下文管理；
- 多 Agent 編排；
- Computer Use；
- 大型程式庫工作；
- 規劃、委派、子 Agent 執行與回報；
- 上下文壓縮。

Meta 的潛在優勢不只在模型，而是：

$$
\boxed{
\text{模型}
+
\text{Agent}
+
\text{社交圖譜}
+
\text{裝置}
+
\text{平台分發}
}
$$

這使其可能走出與純模型公司不同的個人 Agent 路線。

## 5.3 Grok 4.5：從即時聊天轉向工程與知識工作

Grok 4.5 於 2026 年 7 月 16 日發布，官方定位已轉向：

- Coding；
- Agentic Tasks；
- Knowledge Work；
- 長程軟體工程；
- Office 工作；
- 高速與 Token 效率；
- Grok Build 工作台。

這表示不同公司雖從不同路線出發，卻走向相似產品終點：

$$
\text{規劃}
+
\text{工具}
+
\text{執行}
+
\text{驗證}
+
\text{工作成品}
$$

---

# 六、Google：消費端體感與技術基礎必須分開

部分使用者可能認為 Gemini 在長篇協作、語義穩定性或完成感上不如 GPT-5.6、Fable 5 或部分中國模型。這是一種可記錄的產品體驗，但不能直接推出 Google 底層技術落後。

Google 已公開：

- Gemini 3.5 Flash；
- 100 萬 Token 上下文；
- 長程 Agent 執行；
- 多 Agent 編排；
- Coding；
- 多模態；
- Tool Use；
- Gemini Enterprise Agent Platform；
- Google Antigravity。

同時，Gemini 3.5 Pro 仍標示為即將推出。

所以：

$$
\boxed{
\text{消費端體感未必領先}
\neq
\text{研究與 Agent 基礎設施不先進}
}
$$

至於 Google 內部是否已有顯著超越公開版的模型，目前只能列為合理推論，不能視為已確認事實。

---

# 七、真正發生的是能力形態收斂

不同公司反覆使用相似概念：

- Long-Horizon Tasks；
- Agentic Coding；
- Knowledge Work；
- Computer Use；
- Multi-Agent；
- Planning；
- Subagent Delegation；
- Context Compaction；
- 1M Context；
- Tool Calling；
- MCP；
- Office；
- End-to-End Work；
- Persistent Workspace。

這意味著競爭焦點已逐漸從單次問答，轉向：

$$
\boxed{
\text{把模型變成可持續執行工作的認知作業核心}
}
$$

模型與 harness 也已不可分離：

$$
\operatorname{Performance}
=
f(M,H,T,C,V,R)
$$

其中：

- $M$ ：模型；
- $H$ ：Agent harness；
- $T$ ：工具；
- $C$ ：上下文管理；
- $V$ ：驗證器；
- $R$ ：錯誤恢復。

當模型差距縮小，真正差異可能來自任務分解、平行 Agent、工具選擇、記憶壓縮、權限、回滾與審核。

---

# 八、目前已獲得的第一階段支持

截至 2026 年 7 月 18 日，至少形成以下候選集合：

$$
\mathcal F
=
\{
\text{Fable 5},
\text{GPT-5.6},
\text{Kimi K3},
\text{GLM-5.2},
\text{Grok 4.5},
\text{Muse Spark 1.1},
\text{Gemini 3.5 Flash}
\}
$$

它們並不完全同等，但已共同進入長程 Coding、知識工作、工具使用、多模態、長上下文與工作台整合構成的前沿競爭區。

若只有一家美國公司突破，仍可解讀為單點領先；但中國模型也在大規模 MoE、開放權重、百萬上下文、Coding Agent、多 Agent、低價 API 與工作台方向快速靠近，更合理的解釋是：

$$
\boxed{
\text{前沿能力正在跨公司、跨國家擴散}
}
$$

同時，各家公司開始強調更少 Token、更低成本、更快完成、多種 effort level、模型家族分層與 Cache，顯示市場正從「能力是否存在」轉向「能力能否大量調用」。

---

# 九、尚未完成的第二階段驗證

## 9.1 長任務可靠性

仍需第三方長期驗證：

- 是否能穩定重現；
- 是否需要大量人工救援；
- 是否會中途偏離目標；
- 壓縮是否遺失關鍵約束；
- 是否產生難以發現的局部錯誤；
- 成本是否可被一般團隊承受。

## 9.2 錯誤恢復

真正的 Agent 常態化需要：

$$
\text{Failure}
\rightarrow
\text{Detection}
\rightarrow
\text{Diagnosis}
\rightarrow
\text{Rollback}
\rightarrow
\text{Retry}
$$

目前成功案例很多，但失敗分布、回復率、未察覺錯誤率與權限錯用仍缺乏充分資料。

## 9.3 權限治理

Agent 能操作程式碼、終端、網頁、檔案、Office 與第三方服務，因此必須同步成熟：

- 最小權限；
- 敏感操作確認；
- 操作日誌；
- 來源追蹤；
- 沙盒；
- 回滾；
- 資料隔離；
- 多 Agent 權限分層；
- 人類中止權。

## 9.4 工作流吸收

模型發布速度很快，但組織吸收速度可能較慢：

$$
\text{模型能力}
\rightarrow
\text{產品功能}
\rightarrow
\text{工作流程}
\rightarrow
\text{組織制度}
$$

所以模型常態化不代表勞動流程立即全面重寫。

---

# 十、修正版命題：半年是擴散窗口，不是等待窗口

原命題可修正為：

> Fable 級能力常態化已經啟動；未來半年要觀察的是，這種能力是否由發布密集轉化為價格、部署、可靠性、Agent harness、企業採用與日常委派的全面擴散。

形式化為：

$$
T_{\mathrm{start}}
<
2026\text{-}07\text{-}07
$$

而：

$$
T_{\mathrm{validation}}
=
[2026\text{-}07\text{-}07,\ 2027\text{-}01\text{-}07]
$$

三階段如下：

### 第一階段：能力帶形成

$$
\text{少數前沿模型}
\rightarrow
\text{多供應商前沿鄰近集合}
$$

**目前狀態：已明顯開始。**

### 第二階段：產品與價格商品化

$$
\text{前沿能力}
\rightarrow
\text{不同成本、速度、授權與部署層}
$$

**目前狀態：正在快速形成。**

### 第三階段：工作流與制度吸收

$$
\text{模型可用}
\rightarrow
\text{Agent 可委派}
\rightarrow
\text{組織流程重構}
$$

**目前狀態：尚待驗證。**

---

# 十一、後續更新計畫

| 節點 | 日期 | 主要檢查內容 |
|---|---:|---|
| 基準版 | 2026-07-18 | 建立本篇與初始狀態 |
| Kimi 開放節點 | 2026-07-27 | K3 權重、授權、技術報告與部署 |
| 一個月節點 | 2026-08-18 | 第三方評測、API 穩定性、早期經驗 |
| 三個月節點 | 2026-10-07 | Agent 生態、企業採用、價格與工作流 |
| 半年終點 | 2027-01-07 | 正式成立／部分成立／下修判定 |

每次更新應記錄六組指標：

1. 模型能力：長程 Coding、知識工作、Computer Use、工具、多模態；
2. 成本效率：API 價格、Token、推理時間、Cache、本地部署；
3. Agent harness：規劃、子 Agent、壓縮、恢復、驗證、回滾；
4. 開放生態：權重、授權、社群部署、推理框架；
5. 工作流吸收：企業、個人工作、Office、科學、法律、金融；
6. 可靠性治理：幻覺、偏移、權限事故、Prompt Injection、人類介入。

---

# 十二、可證偽與下修條件

若未來出現以下情況，應下修常態化判斷：

1. benchmark 無法轉化為真實生產能力；
2. 長任務成本過高；
3. Agent 仍需高密度人工救援；
4. 開放模型因硬體、授權或成本無法實際部署；
5. 半年後仍只有展示案例，未進入組織流程；
6. 安全與權限治理成本上升得比可用能力更快。

人工介入密度可表示為：

$$
D_{\mathrm{human}}
=
\frac{\text{人工介入次數}}
{\text{任務時間}}
$$

若它長期維持高位，Agent 只是放大局部工作，尚未形成真正可委派的基礎設施。

---

# 十三、對小型團隊與研究者的含義

當前沿能力逐步形成多供應商能力帶，最合理的策略不是永久依賴某一模型，而是建立：

- 模型可替換接口；
- 統一工具協議；
- 知識庫；
- 記憶層；
- 權限層；
- 驗證層；
- 回滾層；
- 可審核輸出；
- Agent 任務格式。

即：

$$
\boxed{
\text{模型可以更換，外部認知結構必須累積。}
}
$$

當基礎模型差距縮小，差異化資產將更多位於專業語料、特定工作流、領域驗證器、長期記憶、權限治理、人類審核介面與跨模型調度。

這與前作的戰略判斷一致：

> 半年窗口不是等待下一個模型，而是建造下一層結構。

---

# 十四、結論

截至 2026 年 7 月 18 日，最合理的判斷不是「Fable 5 已成為毫無差異的普通模型」，也不是「Agent 級 AGI 基礎設施已完成」。

而是：

$$
\boxed{
\text{Fable 級能力已從單點領先，進入多供應商能力帶形成期。}
}
$$

同時：

$$
\boxed{
\text{Agent 基礎設施的技術方向已高度合流，但可靠性與制度吸收仍待驗證。}
}
$$

GLM-5.2 與 Kimi K3 顯示，前沿 Agent 能力的擴散不只發生在美國封閉模型之間；它也可能透過開放權重、超長上下文、低價 API、Coding Agent、工作台與多 Agent 系統向外擴散。

GPT-5.6、Muse Spark 1.1 與 Grok 4.5 則顯示，美國不同類型公司正同步把競爭從聊天模型推向：

$$
\text{端到端工作}
+
\text{工具}
+
\text{多 Agent}
+
\text{電腦操作}
+
\text{工作成品}
$$

Google 的消費端體感可能暫時不占優勢，但其公開 Agent、長上下文、多模態與企業基礎設施仍使其不能被排除於前沿競爭之外。

因此，前作的半年窗口應更新為：

> **常態化不是六個月後才開始。它在文章完成時可能已經啟動。未來半年真正要觀察的，是模型能力帶能否穿透價格、部署、工作流、可靠性與制度治理，成為可持續委派的 Agent 基礎設施。**

---

# 十五、一句話版本

$$
\boxed{
\text{Fable 級模型常態化沒有等待半年；
半年窗口在被命名時，已經開始。}
}
$$

---

# 附錄 A：初始狀態表

| 模型 | 公開日期 | 長上下文 | Agent／工具 | 多 Agent | 開放狀態 | 觀察角色 |
|---|---:|---|---|---|---|---|
| Gemini 3.5 Flash | 2026-05-19 | 1M | 是 | 展示／平台 | 封閉 | 高速 Agent 與 Google 基礎設施 |
| Claude Fable 5 | 2026-06-09 | 長程產品化 | 是 | 工作流支援 | 封閉 | 原始前沿標尺 |
| GLM-5.2 | 2026-06-16 | 1M | 是 | Harness 可組合 | MIT 開放權重 | 開放長程工程基座 |
| GPT-5.6 | 2026-07-09 | 依產品規格 | 是 | `ultra` 平行 Agent | 封閉 | 分層與效率商品化 |
| Muse Spark 1.1 | 2026-07-09 | 1M 主動管理 | 是 | 原生編排 | API 預覽／封閉 | 平台型個人 Agent |
| Kimi K3 | 2026-07-16 | 1M | 是 | 是 | 權重預定 7 月 27 日 | 中國開放前沿逼近 |
| Grok 4.5 | 2026-07-16 | 依產品規格 | 是 | 長程 Agent 訓練 | 封閉 | 工程、知識與 Office 追趕 |

> 各公司使用不同 benchmark、harness、推理強度與成本假設，本表不將其視為可直接橫向排序的統一測量。

---

# 附錄 B：後續版本紀錄模板

```text
版本：
觀察截止日：

一、新模型與產品發布
二、既有模型的重要更新
三、第三方評測變化
四、價格與效率
五、開放權重與部署
六、Agent harness
七、企業與個人工作流採用
八、可靠性、安全與治理事故
九、支持原命題的證據
十、反對或下修原命題的證據
十一、目前結論強度：L0 / L1 / L2 / L3 / L4 / L5
十二、下一觀察節點
```

---

# 參考資料

## 前作與內部文件

1. Neo.K，《半年窗口：Fable 級模型常態化與 Agent 級 AGI 基礎設施的前夜》，2026-07-07。
2. Neo.K，《脈衝式智能發展與現實耦合閾值》，2026-07-07。

## 官方公開資料

3. Anthropic, “Claude Fable 5,” 2026-06-09；全球重新部署更新，2026-07-01。
4. Z.ai, “GLM-5.2: Built for Long-Horizon Tasks,” 2026-06-16。
5. OpenAI, “GPT-5.6: Frontier Intelligence That Scales with Your Ambition,” 2026-07-09。
6. Meta Superintelligence Labs, “Introducing Muse Spark 1.1,” 2026-07-09。
7. Kimi, “Kimi K3: Open Frontier Intelligence,” 2026-07-16。
8. SpaceXAI, “Introducing Grok 4.5,” 2026-07-16。
9. Google DeepMind, “Gemini 3.5 Flash Model Card,” 2026-05-19。

---

# 版本說明

## v0.1 — 2026-07-18

- 建立前作的第一份正式更新論文；
- 校準 2026 年 5 月至 7 月公開模型時間線；
- 區分模型常態化與 Agent 基礎設施常態化；
- 建立能力接近、供應商多樣性、價格效率、harness 與工作流吸收五維模型；
- 加入中國 AI、OpenAI、Meta、Grok 與 Google 的分別觀察；
- 建立 2026-07-27、2026-08-18、2026-10-07、2027-01-07 四個後續節點；
- 保留反證條件與下修機制。
