半年窗口的提前啟動
Fable 級模型常態化的第一階段觀察與 Agent 基礎設施合流
英文工作名: The Half-Year Window Started Early: First-Stage Evidence for the Normalization of Fable-Class Models and the Convergence of Agent Infrastructure
作者: Neo.K
機構: EveMissLab/一言諾科技有限公司
文件性質: AI 產業觀察論文/前作更新/可持續修訂稿
版本: v0.1
觀察截止日: 2026-07-18
前作: 《半年窗口:Fable 級模型常態化與 Agent 級 AGI 基礎設施的前夜》
前作日期: 2026-07-07
摘要
2026 年 7 月 7 日,前作提出一項高權重觀察假說:未來半年可能不是等待單一「AGI 模型」降臨的時期,而是 Fable 級能力逐步由少數前沿模型的特殊優勢,轉化為多家公司、多價格層、多部署形態與多種 Agent 工作流都能取得的常態化能力帶。
截至 2026 年 7 月 18 日,距前作成稿僅十一日,公開市場已密集出現 GPT-5.6、Meta Muse Spark 1.1、Kimi K3 與 Grok 4.5;此前不久,Claude Fable 5、GLM-5.2 與 Gemini 3.5 Flash 亦已發布。這些模型並不完全同等,也不能只憑供應商公布的 benchmark 直接排序;然而,它們在長程編程、知識工作、百萬 Token 上下文、多 Agent 調度、工具使用、電腦操作、上下文壓縮與工作台整合等方向上,呈現高度同步的產品化收斂。
因此,本文不主張「半年窗口已全部驗證」,而提出較嚴格的更新:
「半年」應重新理解為觀察能力擴散、價格下降、開放部署、Agent 可靠性與工作流吸收程度的驗證窗口,而不是等待相變起點的時間預報。
本文進一步區分「模型常態化」與「Agent 基礎設施常態化」:前者已出現強烈早期訊號,後者雖快速合流,仍未完成對長任務可靠性、錯誤恢復、權限治理、持久記憶、企業採用與人類審核介面的全面驗證。
關鍵詞: Fable 級模型、GPT-5.6、Kimi K3、GLM-5.2、Grok 4.5、Muse Spark 1.1、Gemini 3.5、Agent、模型常態化
一、不是勝利宣言,而是提前驗證紀錄
前作中的「半年」不是保證日期,也不是聲稱六個月後必然出現 AGI。它指的是:當模型能力、推理成本、上下文長度、工具介面、Agent framework、產品 UX、企業需求、安全政策與競爭壓力同時接近臨界點時,未來半年可能成為觀察這些條件是否合流的高價值窗口。
前作真正的判定重點不是社群是否高喊 AGI,而是:
- 模型能否處理跨檔案與跨工具工作;
- 長任務能否從數分鐘延伸至數小時乃至數日;
- Agent 是否具備錯誤恢復與上下文維持;
- 工作台是否從聊天界面轉向任務委派;
- 成本是否下降到可日常使用;
- 企業是否把真實流程交給 Agent;
- 人類是否建立可審核、可回滾、可中止的介面。
從 2026 年 7 月 7 日到 7 月 18 日只有十一天。這足以觀察模型發布密度、能力方向收斂與供應商增加,但不足以驗證數月級穩定性、企業採用率、安全事故率與長期成本。
因此,目前結論強度應限制在:
至:
而不是完整實證確認。
二、時間校準:相變起點可能早於前作
| 日期 | 模型/事件 | 與前作的關係 | 主要方向 |
|---|---|---|---|
| 2026-05-19 | Gemini 3.5 Flash 模型卡 | 前作前 49 日 | 高速 Agent、長程執行、多模態、1M 上下文 |
| 2026-06-09 | Claude Fable 5 | 前作前 28 日 | 長程 Coding、知識工作、電腦操作 |
| 2026-06-16 | GLM-5.2 | 前作前 21 日 | 開放權重、MIT、1M 上下文、長程工程 |
| 2026-07-07 | 《半年窗口》成稿 | 觀察起點 | 建立半年驗證框架 |
| 2026-07-09 | GPT-5.6 正式發布 | 前作後 2 日 | 模型分層、端到端知識工作、多 Agent |
| 2026-07-09 | Meta Muse Spark 1.1 | 前作後 2 日 | 多 Agent、Computer Use、1M 上下文、API |
| 2026-07-16 | Kimi K3 | 前作後 9 日 | 2.8T、原生視覺、1M 上下文、Agent 工作台 |
| 2026-07-16 | Grok 4.5 | 前作後 9 日 | Coding、Agent、知識工作、Office |
Fable 5、Gemini 3.5 Flash 與 GLM-5.2 都早於前作,不能在事後全部算成「預測成功」。較嚴格的說法是:
- 它們構成前作形成時的背景訊號;
- 前作據此辨認出能力帶將快速擴散;
- 前作之後十一天內,GPT-5.6、Muse Spark 1.1、Kimi K3 與 Grok 4.5 形成新的追加證據。
因此,前作的歷史定位可能不是「相變前預言」,而是:
三、什麼叫做 Fable 級模型常態化?
常態化不要求所有模型完全相等。它只要求多個模型進入「前沿鄰近能力帶」:
其中:
- :時間 的可觀察前沿;
- :前沿鄰近門檻;
- :前沿鄰近模型集合。
當以下三件事同時發生時,常態化開始:
即前沿鄰近模型數量增加;
即供應商、國家、授權、價格與部署方式增加;
以及:
即同一工作流可在多模型之間遷移。
本文將常態化拆為五個維度:
其中:
- :能力接近度;
- :供應者多樣性;
- :價格與效率可用性;
- :Agent harness 成熟度;
- :工作流吸收度。
截至 2026 年 7 月 18 日,前四者已有明顯上升訊號,第五項仍待長期驗證。
四、中國前沿模型不再只是追趕者
4.1 GLM-5.2:開放長程工程基座
GLM-5.2 於 2026 年 6 月 16 日發布,其主要特徵包括:
- 工程可用的 100 萬 Token 上下文;
- 多級推理強度;
- 針對長程 Coding Agent 軌跡訓練;
- MIT 開放授權;
- 多種本地推理框架支援;
- 與 Claude Code、OpenCode、ZCode 等 harness 整合;
- 明確處理上下文壓縮、超長軌跡與推理效率。
其意義不是單純 benchmark 提升,而是:
這削弱了「長程 Agent 基座只能由少數美國封閉公司提供」的假設。
4.2 Kimi K3:開放模型逼近全球前沿帶
Kimi K3 於 2026 年 7 月 16 日發布。官方公布:
- 2.8T 總參數;
- 原生視覺能力;
- 100 萬 Token 上下文;
- 面向長程 Coding、知識工作與推理;
- 可在 Kimi、Kimi Work、Kimi Code 與 API 中使用;
- 完整權重預定於 2026 年 7 月 27 日發布;
- 整體表現仍落後最強的 Fable 5 與 GPT-5.6 Sol,但已進入前沿級能力區間。
這顯示:
Kimi K3 還展示了長時間工程、多 Agent 研究、視覺—程式閉環、科學文獻到可執行程式,以及 Widgets、Dashboard、Work、Code 等產品棧整合。
但截至 7 月 18 日,完整權重尚未發布。後續需檢查:
- 是否按期發布;
- 授權是否足夠開放;
- 社群能否實際部署;
- 推理成本是否可承受;
- 第三方是否能重現長程能力。
五、美國前沿公司同步轉向 Agent 基座
5.1 GPT-5.6:能力分層與多 Agent 商品化
GPT-5.6 於 2026 年 7 月 9 日全面發布,形成:
- Sol:前沿能力;
- Terra:能力與成本平衡;
- Luna:高效率與高吞吐;
ultra:多 Agent 平行工作模式。
這種分層表示常態化不只靠最高階模型,而靠:
公開重點已從單次回答轉向端到端知識工作、Coding、Computer Use、設計判斷、多 Agent 調度與每美元任務成功率。
5.2 Muse Spark 1.1:平台型個人 Agent
Meta 於 2026 年 7 月 9 日發布 Muse Spark 1.1,並開放 Meta Model API 預覽。其方向包括:
- 多模態推理;
- MCP、原生工具與自訂 Skill;
- 100 萬 Token 主動上下文管理;
- 多 Agent 編排;
- Computer Use;
- 大型程式庫工作;
- 規劃、委派、子 Agent 執行與回報;
- 上下文壓縮。
Meta 的潛在優勢不只在模型,而是:
這使其可能走出與純模型公司不同的個人 Agent 路線。
5.3 Grok 4.5:從即時聊天轉向工程與知識工作
Grok 4.5 於 2026 年 7 月 16 日發布,官方定位已轉向:
- Coding;
- Agentic Tasks;
- Knowledge Work;
- 長程軟體工程;
- Office 工作;
- 高速與 Token 效率;
- Grok Build 工作台。
這表示不同公司雖從不同路線出發,卻走向相似產品終點:
六、Google:消費端體感與技術基礎必須分開
部分使用者可能認為 Gemini 在長篇協作、語義穩定性或完成感上不如 GPT-5.6、Fable 5 或部分中國模型。這是一種可記錄的產品體驗,但不能直接推出 Google 底層技術落後。
Google 已公開:
- Gemini 3.5 Flash;
- 100 萬 Token 上下文;
- 長程 Agent 執行;
- 多 Agent 編排;
- Coding;
- 多模態;
- Tool Use;
- Gemini Enterprise Agent Platform;
- Google Antigravity。
同時,Gemini 3.5 Pro 仍標示為即將推出。
所以:
至於 Google 內部是否已有顯著超越公開版的模型,目前只能列為合理推論,不能視為已確認事實。
七、真正發生的是能力形態收斂
不同公司反覆使用相似概念:
- Long-Horizon Tasks;
- Agentic Coding;
- Knowledge Work;
- Computer Use;
- Multi-Agent;
- Planning;
- Subagent Delegation;
- Context Compaction;
- 1M Context;
- Tool Calling;
- MCP;
- Office;
- End-to-End Work;
- Persistent Workspace。
這意味著競爭焦點已逐漸從單次問答,轉向:
模型與 harness 也已不可分離:
其中:
- :模型;
- :Agent harness;
- :工具;
- :上下文管理;
- :驗證器;
- :錯誤恢復。
當模型差距縮小,真正差異可能來自任務分解、平行 Agent、工具選擇、記憶壓縮、權限、回滾與審核。
八、目前已獲得的第一階段支持
截至 2026 年 7 月 18 日,至少形成以下候選集合:
它們並不完全同等,但已共同進入長程 Coding、知識工作、工具使用、多模態、長上下文與工作台整合構成的前沿競爭區。
若只有一家美國公司突破,仍可解讀為單點領先;但中國模型也在大規模 MoE、開放權重、百萬上下文、Coding Agent、多 Agent、低價 API 與工作台方向快速靠近,更合理的解釋是:
同時,各家公司開始強調更少 Token、更低成本、更快完成、多種 effort level、模型家族分層與 Cache,顯示市場正從「能力是否存在」轉向「能力能否大量調用」。
九、尚未完成的第二階段驗證
9.1 長任務可靠性
仍需第三方長期驗證:
- 是否能穩定重現;
- 是否需要大量人工救援;
- 是否會中途偏離目標;
- 壓縮是否遺失關鍵約束;
- 是否產生難以發現的局部錯誤;
- 成本是否可被一般團隊承受。
9.2 錯誤恢復
真正的 Agent 常態化需要:
目前成功案例很多,但失敗分布、回復率、未察覺錯誤率與權限錯用仍缺乏充分資料。
9.3 權限治理
Agent 能操作程式碼、終端、網頁、檔案、Office 與第三方服務,因此必須同步成熟:
- 最小權限;
- 敏感操作確認;
- 操作日誌;
- 來源追蹤;
- 沙盒;
- 回滾;
- 資料隔離;
- 多 Agent 權限分層;
- 人類中止權。
9.4 工作流吸收
模型發布速度很快,但組織吸收速度可能較慢:
所以模型常態化不代表勞動流程立即全面重寫。
十、修正版命題:半年是擴散窗口,不是等待窗口
原命題可修正為:
Fable 級能力常態化已經啟動;未來半年要觀察的是,這種能力是否由發布密集轉化為價格、部署、可靠性、Agent harness、企業採用與日常委派的全面擴散。
形式化為:
而:
三階段如下:
第一階段:能力帶形成
目前狀態:已明顯開始。
第二階段:產品與價格商品化
目前狀態:正在快速形成。
第三階段:工作流與制度吸收
目前狀態:尚待驗證。
十一、後續更新計畫
| 節點 | 日期 | 主要檢查內容 |
|---|---|---|
| 基準版 | 2026-07-18 | 建立本篇與初始狀態 |
| Kimi 開放節點 | 2026-07-27 | K3 權重、授權、技術報告與部署 |
| 一個月節點 | 2026-08-18 | 第三方評測、API 穩定性、早期經驗 |
| 三個月節點 | 2026-10-07 | Agent 生態、企業採用、價格與工作流 |
| 半年終點 | 2027-01-07 | 正式成立/部分成立/下修判定 |
每次更新應記錄六組指標:
- 模型能力:長程 Coding、知識工作、Computer Use、工具、多模態;
- 成本效率:API 價格、Token、推理時間、Cache、本地部署;
- Agent harness:規劃、子 Agent、壓縮、恢復、驗證、回滾;
- 開放生態:權重、授權、社群部署、推理框架;
- 工作流吸收:企業、個人工作、Office、科學、法律、金融;
- 可靠性治理:幻覺、偏移、權限事故、Prompt Injection、人類介入。
十二、可證偽與下修條件
若未來出現以下情況,應下修常態化判斷:
- benchmark 無法轉化為真實生產能力;
- 長任務成本過高;
- Agent 仍需高密度人工救援;
- 開放模型因硬體、授權或成本無法實際部署;
- 半年後仍只有展示案例,未進入組織流程;
- 安全與權限治理成本上升得比可用能力更快。
人工介入密度可表示為:
若它長期維持高位,Agent 只是放大局部工作,尚未形成真正可委派的基礎設施。
十三、對小型團隊與研究者的含義
當前沿能力逐步形成多供應商能力帶,最合理的策略不是永久依賴某一模型,而是建立:
- 模型可替換接口;
- 統一工具協議;
- 知識庫;
- 記憶層;
- 權限層;
- 驗證層;
- 回滾層;
- 可審核輸出;
- Agent 任務格式。
即:
當基礎模型差距縮小,差異化資產將更多位於專業語料、特定工作流、領域驗證器、長期記憶、權限治理、人類審核介面與跨模型調度。
這與前作的戰略判斷一致:
半年窗口不是等待下一個模型,而是建造下一層結構。
十四、結論
截至 2026 年 7 月 18 日,最合理的判斷不是「Fable 5 已成為毫無差異的普通模型」,也不是「Agent 級 AGI 基礎設施已完成」。
而是:
同時:
GLM-5.2 與 Kimi K3 顯示,前沿 Agent 能力的擴散不只發生在美國封閉模型之間;它也可能透過開放權重、超長上下文、低價 API、Coding Agent、工作台與多 Agent 系統向外擴散。
GPT-5.6、Muse Spark 1.1 與 Grok 4.5 則顯示,美國不同類型公司正同步把競爭從聊天模型推向:
Google 的消費端體感可能暫時不占優勢,但其公開 Agent、長上下文、多模態與企業基礎設施仍使其不能被排除於前沿競爭之外。
因此,前作的半年窗口應更新為:
常態化不是六個月後才開始。它在文章完成時可能已經啟動。未來半年真正要觀察的,是模型能力帶能否穿透價格、部署、工作流、可靠性與制度治理,成為可持續委派的 Agent 基礎設施。
十五、一句話版本
附錄 A:初始狀態表
| 模型 | 公開日期 | 長上下文 | Agent/工具 | 多 Agent | 開放狀態 | 觀察角色 |
|---|---|---|---|---|---|---|
| Gemini 3.5 Flash | 2026-05-19 | 1M | 是 | 展示/平台 | 封閉 | 高速 Agent 與 Google 基礎設施 |
| Claude Fable 5 | 2026-06-09 | 長程產品化 | 是 | 工作流支援 | 封閉 | 原始前沿標尺 |
| GLM-5.2 | 2026-06-16 | 1M | 是 | Harness 可組合 | MIT 開放權重 | 開放長程工程基座 |
| GPT-5.6 | 2026-07-09 | 依產品規格 | 是 | ultra 平行 Agent |
封閉 | 分層與效率商品化 |
| Muse Spark 1.1 | 2026-07-09 | 1M 主動管理 | 是 | 原生編排 | API 預覽/封閉 | 平台型個人 Agent |
| Kimi K3 | 2026-07-16 | 1M | 是 | 是 | 權重預定 7 月 27 日 | 中國開放前沿逼近 |
| Grok 4.5 | 2026-07-16 | 依產品規格 | 是 | 長程 Agent 訓練 | 封閉 | 工程、知識與 Office 追趕 |
各公司使用不同 benchmark、harness、推理強度與成本假設,本表不將其視為可直接橫向排序的統一測量。
附錄 B:後續版本紀錄模板
版本:
觀察截止日:
一、新模型與產品發布
二、既有模型的重要更新
三、第三方評測變化
四、價格與效率
五、開放權重與部署
六、Agent harness
七、企業與個人工作流採用
八、可靠性、安全與治理事故
九、支持原命題的證據
十、反對或下修原命題的證據
十一、目前結論強度:L0 / L1 / L2 / L3 / L4 / L5
十二、下一觀察節點
參考資料
前作與內部文件
- Neo.K,《半年窗口:Fable 級模型常態化與 Agent 級 AGI 基礎設施的前夜》,2026-07-07。
- Neo.K,《脈衝式智能發展與現實耦合閾值》,2026-07-07。
官方公開資料
- Anthropic, “Claude Fable 5,” 2026-06-09;全球重新部署更新,2026-07-01。
- Z.ai, “GLM-5.2: Built for Long-Horizon Tasks,” 2026-06-16。
- OpenAI, “GPT-5.6: Frontier Intelligence That Scales with Your Ambition,” 2026-07-09。
- Meta Superintelligence Labs, “Introducing Muse Spark 1.1,” 2026-07-09。
- Kimi, “Kimi K3: Open Frontier Intelligence,” 2026-07-16。
- SpaceXAI, “Introducing Grok 4.5,” 2026-07-16。
- Google DeepMind, “Gemini 3.5 Flash Model Card,” 2026-05-19。
版本說明
v0.1 — 2026-07-18
- 建立前作的第一份正式更新論文;
- 校準 2026 年 5 月至 7 月公開模型時間線;
- 區分模型常態化與 Agent 基礎設施常態化;
- 建立能力接近、供應商多樣性、價格效率、harness 與工作流吸收五維模型;
- 加入中國 AI、OpenAI、Meta、Grok 與 Google 的分別觀察;
- 建立 2026-07-27、2026-08-18、2026-10-07、2027-01-07 四個後續節點;
- 保留反證條件與下修機制。