多模型具身智能體的最小完備分層架構
從單體大模型迷思到多時間尺度、異質模型與物理控制協同
英文工作名: A Minimal Complete Layered Architecture for Multi-Model Embodied Agents: From Monolithic Foundation Models to Multi-Timescale Heterogeneous Intelligence 作者: Neo.K機構: EveMissLab/一言諾科技有限公司文件性質: 具身 AI 架構論文/命題性理論稿/可持續修訂版版本: v0.1日期: 2026-07-18
摘要
當前具身人工智慧的主流敘事,經常把進步想像為:只要將更大的視覺語言模型、推理模型或世界模型部署到更強的 AI 晶片上,機器人便能逐步獲得通用能力。本文認為,這種「單體大模型」想像忽略了具身智能的本質:具身系統同時包含物理動力學、感知融合、狀態估計、任務規劃、運動控制、安全約束與故障恢復,而這些子問題具有不同的時間尺度、可靠性要求、資料形式與計算結構。
本文提出「多模型具身智能體的最小完備分層架構」:
大型模型負責探索與高階推理,中型模型負責具身協調, 小型模型負責感知與技能,非生成式控制器負責即時安全。 \boxed{
\text{大型模型負責探索與高階推理,中型模型負責具身協調,
小型模型負責感知與技能,非生成式控制器負責即時安全。}
} 大型模型負責探索與高階推理,中型模型負責具身協調, 小型模型負責感知與技能,非生成式控制器負責即時安全。
本文不主張大模型對具身智能無用,也不主張中小模型能全面取代大模型。相反,本文提出:大模型、中型模型、小型模型、專用感知器、規劃器、驗證器與經典控制器,將形成多時間尺度的異質智能群落。具身智能的有效能力,不等於單一模型能力,而是受物理、感知、控制、規劃與安全中最弱一層所限制:
Q e m b o d i e d = min ( Q p h y s i c s , Q p e r c e p t i o n , Q c o n t r o l , Q p l a n n i n g , Q s a f e t y ) Q_{\mathrm{embodied}}
=
\min
\left(
Q_{\mathrm{physics}},
Q_{\mathrm{perception}},
Q_{\mathrm{control}},
Q_{\mathrm{planning}},
Q_{\mathrm{safety}}
\right) Q embodied = min ( Q physics , Q perception , Q control , Q planning , Q safety )
只要任何一層接近零,整個系統便可能失效。
本文進一步提出:未來具身 AI 的核心工程問題,不是把最大的模型塞入機器人,而是把適當大小的智能放置於適當的時間尺度、硬體位置與控制責任上。本文建立五層具身架構、四級模型分工、控制權優先序、硬體映射、可證偽條件與研究路線,以作為後續具身智能系統設計的理論基礎。
關鍵詞: 具身智能、多模型系統、分層控制、大型語言模型、中型模型、小模型、機器人、即時控制、安全約束、異質計算
一、問題意識
1.1 單體大模型迷思
當模型能力不斷提升時,很自然會出現一種推論:
更大模型 + 更強晶片 → 更完整具身智能 \text{更大模型}
+
\text{更強晶片}
\rightarrow
\text{更完整具身智能} 更大模型 + 更強晶片 → 更完整具身智能
這個推論並非完全錯誤。
大型模型確實可以提升:
自然語言理解;
任務分解;
常識推理;
視覺語義理解;
長程規劃;
新情境泛化;
跨領域知識調用。
但具身智能不只是理解與推理。
一個機器人必須同時完成:
感測器讀取;
視覺、觸覺與聲音融合;
姿態與位置估計;
路徑規劃;
抓取與步態生成;
關節力矩控制;
碰撞迴避;
故障診斷;
急停與安全降級。
這些問題的更新頻率可能從數秒、數百毫秒,一直到毫秒甚至更低。
因此:
T f o u n d a t i o n > T c o n t r o l d e a d l i n e T_{\mathrm{foundation}}
>
T_{\mathrm{control\ deadline}} T foundation > T control deadline
時,即使模型具有很高的語義能力,也不能直接承擔底層控制。
1.2 問題不只是算力不夠
一台具備強大 Arm CPU、GPU、統一記憶體與 AI 加速器的機器,可能可以載入大型模型。
但:
能載入 ≠ 能即時運行 ≠ 能安全控制 \text{能載入}
\neq
\text{能即時運行}
\neq
\text{能安全控制} 能載入 = 能即時運行 = 能安全控制
具身系統的總資源需求為:
R t o t a l = R r e a s o n i n g + R v i s i o n + R s t a t e + R p l a n n i n g + R c o n t r o l + R s a f e t y R_{\mathrm{total}}
=
R_{\mathrm{reasoning}}
+
R_{\mathrm{vision}}
+
R_{\mathrm{state}}
+
R_{\mathrm{planning}}
+
R_{\mathrm{control}}
+
R_{\mathrm{safety}} R total = R reasoning + R vision + R state + R planning + R control + R safety
因此,即使單一硬體能夠運行大型模型,也可能無法同時滿足:
多路感測器吞吐;
高頻控制;
最壞延遲;
功耗上限;
散熱限制;
長時間續航;
故障隔離。
具身智能的主要矛盾不是單純「模型太大」,而是:
不同功能需要不同類型的計算, 單一模型難以同時成為所有層的最佳解。 \boxed{
\text{不同功能需要不同類型的計算,
單一模型難以同時成為所有層的最佳解。}
} 不同功能需要不同類型的計算, 單一模型難以同時成為所有層的最佳解。
二、具身智能的最小完備性命題
2.1 五層最小完備架構
本文將具身智能分為五層:
Level 0:物理與本體層
剛體與軟體動力學;
關節、摩擦與接觸;
馬達、扭矩與功率;
質心、平衡與結構;
能源與硬體限制。
Level 1:感知與狀態估計層
視覺;
觸覺;
聲音;
本體感覺;
感測器融合;
不確定性估計。
Level 2:控制與技能層
關節控制;
抓取;
步態;
平衡;
技能切換;
局部反應。
Level 3:幾何與任務規劃層
可達集;
路徑;
抓取姿態;
空間推理;
多步任務;
其他主體行為預測。
Level 4:安全、衝擊與治理層
碰撞;
力限制;
Jerk 限制;
急停;
權限;
故障降級;
人類監督。
2.2 木桶效應
本文提出:
命題一:具身智能木桶命題。 具身智能的實際能力,由物理、感知、控制、規劃與安全中最弱的一層所限制。
形式化為:
Q e m b o d i e d = min ( Q 0 , Q 1 , Q 2 , Q 3 , Q 4 ) Q_{\mathrm{embodied}}
=
\min
\left(
Q_0,Q_1,Q_2,Q_3,Q_4
\right) Q embodied = min ( Q 0 , Q 1 , Q 2 , Q 3 , Q 4 )
其中:
Q 0 Q_0 Q 0 :物理可行性;
Q 1 Q_1 Q 1 :感知與估計;
Q 2 Q_2 Q 2 :控制;
Q 3 Q_3 Q 3 :規劃;
Q 4 Q_4 Q 4 :安全與治理。
若:
∃ i , Q i ≈ 0 \exists i,\ Q_i\approx 0 ∃ i , Q i ≈ 0
則:
Q e m b o d i e d ≈ 0 Q_{\mathrm{embodied}}\approx 0 Q embodied ≈ 0
例:
模型理解能力很強,但無法平衡;
規劃正確,但視覺估計失真;
控制器穩定,但任務理解錯誤;
所有功能皆有,但碰撞安全不足;
模型能力高,但延遲超過控制截止時間。
這些情況都不能被視為完整具身智能。
2.3 乘法完備性
另一種表達是:
Q e m b o d i e d = Q c o g n i t i o n ⋅ Q b o d y ⋅ Q c o n t r o l ⋅ Q s a f e t y Q_{\mathrm{embodied}}
=
Q_{\mathrm{cognition}}
\cdot
Q_{\mathrm{body}}
\cdot
Q_{\mathrm{control}}
\cdot
Q_{\mathrm{safety}} Q embodied = Q cognition ⋅ Q body ⋅ Q control ⋅ Q safety
任何乘數為零,整體歸零。
因此:
高階智能不能抵銷物理與安全缺失。 \boxed{
\text{高階智能不能抵銷物理與安全缺失。}
} 高階智能不能抵銷物理與安全缺失。
三、多時間尺度命題
3.1 不同層級具有不同時間尺度
具身智能不是單一時鐘運行的系統。
可粗略分為:
層級
功能
典型時間尺度
高階任務規劃
理解意圖、分解任務
秒至分鐘
具身推理
場景理解、技能選擇
百毫秒至秒
局部規劃
路徑、抓取、避障
數十至數百毫秒
感知估計
追蹤、定位、融合
毫秒至數十毫秒
關節控制
力矩、速度、平衡
毫秒
硬安全
過流、碰撞、急停
最短且確定
這些時間尺度並非固定標準,而是用來顯示結構差異。
3.2 時間尺度不可壓平命題
命題二:時間尺度不可壓平命題。 一個具身智能系統無法在不付出巨大延遲、能耗與可靠性代價的情況下,將所有功能壓入同一模型與同一更新頻率。
若大型模型更新時間為:
T L T_L T L
底層控制截止時間為:
T C T_C T C
當:
T L > T C T_L>T_C T L > T C
則大型模型不能直接成為底層控制器。
解法不是要求大模型永遠更快,而是:
高階模型低頻運行 + 低階模型高頻運行 \text{高階模型低頻運行}
+
\text{低階模型高頻運行} 高階模型低頻運行 + 低階模型高頻運行
四、四級智能分工
4.1 大型模型:教師與高階顧問
大型模型適合:
跨領域知識;
長程任務分解;
新情境推理;
離線模擬;
失敗分析;
合成資料生成;
更新中小模型;
未知問題升級處理。
可表示為:
M L : X c o m p l e x → P h i g h l e v e l M_L:
\mathcal X_{\mathrm{complex}}
\rightarrow
\mathcal P_{\mathrm{high\ level}} M L : X complex → P high level
其中 P h i g h l e v e l \mathcal P_{\mathrm{high\ level}} P high level 為高階計畫。
大型模型不必持續放在機器人本體上高速運行。
它可以位於:
雲端;
邊緣伺服器;
本地工作站;
機器人基地站;
高性能個人 AI 設備。
4.2 中型模型:具身協調核心
中型模型可能是未來具身 AI 最重要的核心層。
其職責包括:
場景理解;
語言意圖轉換;
物體關係推理;
技能選擇;
局部任務規劃;
多感知摘要;
例外處理;
下層模型調度。
形式化為:
M M : ( Intent , x ^ , W ) → ( SkillGraph , Constraints ) M_M:
(\text{Intent},\hat x,\mathcal W)
\rightarrow
(\text{SkillGraph},\text{Constraints}) M M : ( Intent , x ^ , W ) → ( SkillGraph , Constraints )
其中:
x ^ \hat x x ^ :估計狀態;
W \mathcal W W :世界模型;
SkillGraph:技能圖;
Constraints:執行約束。
中型模型需要:
比大型模型低延遲;
比小型模型更強整合能力;
可在本地長時間運行;
能接受安全層否決。
4.3 小型模型:感知器官與技能器官
小型模型可以專門負責:
物件偵測;
視覺追蹤;
姿態估計;
觸覺滑動檢測;
步態;
抓取;
聲音定位;
馬達異常;
碰撞預測;
局部避障。
模型集合為:
M S = { M v i s i o n , M t o u c h , M p o s e , M g r a s p , M g a i t , M c o l l i s i o n } \mathcal M_S
=
\{
M_{\mathrm{vision}},
M_{\mathrm{touch}},
M_{\mathrm{pose}},
M_{\mathrm{grasp}},
M_{\mathrm{gait}},
M_{\mathrm{collision}}
\} M S = { M vision , M touch , M pose , M grasp , M gait , M collision }
它們的優勢是:
延遲低;
能耗低;
可量化;
可驗證;
可替換;
可獨立更新;
失敗容易隔離。
4.4 非生成式控制器:即時物理底座
最底層不必完全使用生成式模型。
可使用:
PID;
MPC;
EKF;
狀態機;
控制障礙函數;
李雅普諾夫控制;
硬體安全電路;
即時作業系統。
設高階系統提出控制意圖:
u p r o p o s e d u_{\mathrm{proposed}} u proposed
安全與控制層實際執行:
u e x e c u t e d = SafetyFilter ( u p r o p o s e d , x ) u_{\mathrm{executed}}
=
\operatorname{SafetyFilter}
(
u_{\mathrm{proposed}},x
) u executed = SafetyFilter ( u proposed , x )
若控制意圖不符合硬約束,則:
u e x e c u t e d ≠ u p r o p o s e d u_{\mathrm{executed}}
\neq
u_{\mathrm{proposed}} u executed = u proposed
必要時:
u e x e c u t e d = 0 u_{\mathrm{executed}}=0 u executed = 0
五、控制權優先序
5.1 高階智能不能擁有最高控制權
傳統軟體常把最高階模組視為最高權限模組。
具身系統不能完全如此。
較合理的控制權順序為:
硬安全 > 即時穩定控制 > 局部技能 > 具身規劃 > 大型模型意圖 \text{硬安全}
>
\text{即時穩定控制}
>
\text{局部技能}
>
\text{具身規劃}
>
\text{大型模型意圖} 硬安全 > 即時穩定控制 > 局部技能 > 具身規劃 > 大型模型意圖
也就是:
A s a f e t y > A c o n t r o l > A s k i l l > A p l a n n e r > A L L M A_{\mathrm{safety}}
>
A_{\mathrm{control}}
>
A_{\mathrm{skill}}
>
A_{\mathrm{planner}}
>
A_{\mathrm{LLM}} A safety > A control > A skill > A planner > A LLM
其中 A A A 表示對實際動作的否決權。
5.2 語義權與物理權分離
大型或中型模型可以擁有:
但底層控制器擁有:
即:
Semantic Authority ≠ Physical Authority \text{Semantic Authority}
\neq
\text{Physical Authority} Semantic Authority = Physical Authority
這是具身智能安全治理的核心原則。
六、五層架構的數學骨架
6.1 Level 0:物理層
機器人狀態:
x = [ q , q ˙ ] T x=[q,\dot q]^T x = [ q , q ˙ ] T
基本動力學:
M ( q ) q ¨ + C ( q , q ˙ ) q ˙ + G ( q ) = τ + J T F e x t M(q)\ddot q
+
C(q,\dot q)\dot q
+
G(q)
=
\tau
+
J^TF_{\mathrm{ext}} M ( q ) q ¨ + C ( q , q ˙ ) q ˙ + G ( q ) = τ + J T F ext
此層定義:
可行動作;
功率上限;
平衡;
碰撞;
結構負荷。
6.2 Level 1:感知與狀態估計
觀測模型:
z i = h i ( x ) + v i z_i
=
h_i(x)+v_i z i = h i ( x ) + v i
其中 i i i 可代表:
融合估計:
p ( x t ∣ z 1 : t ) ∝ p ( z t ∣ x t ) p ( x t ∣ z 1 : t − 1 ) p(x_t\mid z_{1:t})
\propto
p(z_t\mid x_t)
p(x_t\mid z_{1:t-1}) p ( x t ∣ z 1 : t ) ∝ p ( z t ∣ x t ) p ( x t ∣ z 1 : t − 1 )
這一層的核心輸出不是「世界真實狀態」,而是:
( x ^ , P ) (\hat x,P) ( x ^ , P )
即估計值與不確定性。
6.3 Level 2:控制層
控制目標:
u ∗ = arg min u ∫ t 0 t f L ( x , u ) d t u^\ast
=
\arg\min_u
\int_{t_0}^{t_f}
L(x,u)\,dt u ∗ = arg u min ∫ t 0 t f L ( x , u ) d t
subject to:
x ( t ) ∈ X s a f e x(t)\in\mathcal X_{\mathrm{safe}} x ( t ) ∈ X safe
控制層必須在有限時間內求解近似最優控制。
大型模型可以提出目標,但不能取代此層的硬約束。
6.4 Level 3:幾何與規劃層
可達集:
R τ ( t ) = { p : ∃ u ( ⋅ ) , p = f ( q ( t + τ ) ) } R_\tau(t)
=
\left\{
p:
\exists u(\cdot),
p=f(q(t+\tau))
\right\} R τ ( t ) = { p : ∃ u ( ⋅ ) , p = f ( q ( t + τ )) }
規劃的本質是:
Plan : ( x 0 , g , O ) → { x t , u t } t = 0 T \operatorname{Plan}
:
(x_0,g,\mathcal O)
\rightarrow
\{x_t,u_t\}_{t=0}^{T} Plan : ( x 0 , g , O ) → { x t , u t } t = 0 T
其中:
g g g :目標;
O \mathcal O O :障礙與環境;
x t x_t x t :狀態軌跡;
u t u_t u t :控制軌跡。
6.5 Level 4:安全與衝擊層
安全約束包括:
∥ F ∥ ≤ F max \|F\|\leq F_{\max} ∥ F ∥ ≤ F m a x
∥ F ˙ ∥ ≤ F ˙ max \|\dot F\|\leq \dot F_{\max} ∥ F ˙ ∥ ≤ F ˙ m a x
∥ j ∥ ≤ J max \|j\|\leq J_{\max} ∥ j ∥ ≤ J m a x
x ( t ) ∈ X s a f e x(t)\in\mathcal X_{\mathrm{safe}} x ( t ) ∈ X safe
其中 j j j 為 Jerk。
具身 AI 不只是完成任務,還必須:
完成任務 ∧ 不造成不可接受傷害 \text{完成任務}
\land
\text{不造成不可接受傷害} 完成任務 ∧ 不造成不可接受傷害
七、硬體映射
7.1 單一晶片不是單一智能
即使採用 Arm CPU、GPU、NPU、DSP 或其他 AI 加速器,合理架構仍可能是異質分工。
例如:
硬體
適合工作
CPU
任務管理、狀態機、系統協調
GPU
視覺、大中型模型、批次推理
NPU/AI 加速器
小模型、低功耗持續推理
MCU
馬達控制、感測器讀取、硬安全
FPGA/專用晶片
固定低延遲管線、特殊感知
硬體架構為:
H = { H C P U , H G P U , H N P U , H M C U , H s p e c i a l } \mathcal H
=
\{
H_{\mathrm{CPU}},
H_{\mathrm{GPU}},
H_{\mathrm{NPU}},
H_{\mathrm{MCU}},
H_{\mathrm{special}}
\} H = { H CPU , H GPU , H NPU , H MCU , H special }
模型與硬體的映射為:
ϕ : M → H \phi:
\mathcal M
\rightarrow
\mathcal H ϕ : M → H
最佳映射不是把所有模型放到最強晶片,而是:
ϕ ∗ = arg min ϕ Cost ( ϕ ) \phi^\ast
=
\arg\min_\phi
\operatorname{Cost}(\phi) ϕ ∗ = arg ϕ min Cost ( ϕ )
subject to:
Latency ( ϕ ) ≤ T d e a d l i n e \operatorname{Latency}(\phi)
\leq
T_{\mathrm{deadline}} Latency ( ϕ ) ≤ T deadline
以及:
Q s y s t e m ( ϕ ) ≥ Q r e q u i r e d Q_{\mathrm{system}}(\phi)
\geq
Q_{\mathrm{required}} Q system ( ϕ ) ≥ Q required
7.2 大模型本地化的合理位置
大型模型可能適合:
任務開始前規劃;
低頻重新規劃;
例外升級;
離線學習;
技能生成;
多機器人協調;
人類交互。
它不必:
持續讀取所有感測器;
直接輸出每個關節力矩;
負責硬即時安全;
在每個控制週期重新推理。
八、中型模型加小模型的核心優勢
8.1 智能能力密度
設系統有效能力為:
Q e f f e c t i v e Q_{\mathrm{effective}} Q effective
資源消耗為:
R t o t a l R_{\mathrm{total}} R total
則智能密度為:
ρ I = Q e f f e c t i v e R t o t a l \rho_I
=
\frac{Q_{\mathrm{effective}}}
{R_{\mathrm{total}}} ρ I = R total Q effective
多模型架構的目標不是最大化單一模型能力,而是最大化:
ρ I \rho_I ρ I
8.2 故障隔離
若單一大模型承擔全部功能,一次錯誤可能影響整個系統。
多模型架構可將故障限制在局部:
Failure ( M i ) ⇏ Failure ( S ) \operatorname{Failure}(M_i)
\not\Rightarrow
\operatorname{Failure}(\mathcal S) Failure ( M i ) ⇒ Failure ( S )
前提是存在:
8.3 可替換性
每一層可以獨立升級:
M v i s i o n ( 1 ) → M v i s i o n ( 2 ) M_{\mathrm{vision}}^{(1)}
\rightarrow
M_{\mathrm{vision}}^{(2)} M vision ( 1 ) → M vision ( 2 )
而不需要重新訓練整個具身系統。
這可降低:
8.4 能源與散熱
持續運行一個大型模型,可能造成:
高功耗;
散熱;
電池壽命下降;
延遲;
頻率降級。
多模型架構可採:
Event-Driven Invocation \text{Event-Driven Invocation} Event-Driven Invocation
大型模型只在事件觸發時啟用。
九、系統信息流
9.1 下行控制流
人類意圖 → M L 或 M M → 任務圖 → M S i → C R → 身體 \text{人類意圖}
\rightarrow
M_L\text{ 或 }M_M
\rightarrow
\text{任務圖}
\rightarrow
M_{S_i}
\rightarrow
C_R
\rightarrow
\text{身體} 人類意圖 → M L 或 M M → 任務圖 → M S i → C R → 身體
其中:
M L M_L M L :大型模型;
M M M_M M M :中型具身模型;
M S i M_{S_i} M S i :小型技能模型;
C R C_R C R :即時控制器。
9.2 上行回饋流
感測器 → M S i → ( x ^ , P ) → M M → 重新規劃 \text{感測器}
\rightarrow
M_{S_i}
\rightarrow
(\hat x,P)
\rightarrow
M_M
\rightarrow
\text{重新規劃} 感測器 → M S i → ( x ^ , P ) → M M → 重新規劃
大型模型只在:
任務歧義;
未知情況;
下層失敗;
需要跨領域知識;
需要技能創建;
時被調用。
十、模型群落命題
命題三:模型群落命題。 穩定的具身智能不會由單一模型構成,而會由多個功能不同、時間尺度不同、硬體位置不同的模型與控制器共同構成。
模型群落:
M = { M p l a n n e r , M e m b o d i e d , M v i s i o n , M t o u c h , M c r i t i c , M r o u t e r , M s a f e t y } \mathcal M
=
\{
M_{\mathrm{planner}},
M_{\mathrm{embodied}},
M_{\mathrm{vision}},
M_{\mathrm{touch}},
M_{\mathrm{critic}},
M_{\mathrm{router}},
M_{\mathrm{safety}}
\} M = { M planner , M embodied , M vision , M touch , M critic , M router , M safety }
系統能力:
Q s y s t e m = ∑ i w i Q ( M i ) + Q c o o r d i n a t i o n − C i n t e g r a t i o n Q_{\mathrm{system}}
=
\sum_i w_iQ(M_i)
+
Q_{\mathrm{coordination}}
-
C_{\mathrm{integration}} Q system = i ∑ w i Q ( M i ) + Q coordination − C integration
其中:
Q c o o r d i n a t i o n Q_{\mathrm{coordination}} Q coordination :協調收益;
C i n t e g r a t i o n C_{\mathrm{integration}} C integration :整合成本。
多模型架構不一定天然優於單模型。
只有當:
Q c o o r d i n a t i o n > C i n t e g r a t i o n Q_{\mathrm{coordination}}
>
C_{\mathrm{integration}} Q coordination > C integration
才具有淨優勢。
十一、需要避免的過度推論
11.1 中型模型不一定永遠是核心
未來大型模型可能因:
新架構;
新晶片;
低精度;
稀疏化;
蒸餾;
更高能源效率;
而能以極低成本本地運行。
所以中型模型作為具身核心,是當前高可能性判斷,不是永恆定律。
11.2 小模型不等於可靠模型
模型較小不代表:
一定更安全;
一定更準確;
一定更低延遲;
一定更容易驗證。
仍需實際測量:
最壞延遲;
分布外失敗;
錯誤率;
量化損失;
硬體利用率。
11.3 分層架構也有代價
多模型系統會增加:
介面設計;
同步;
路由錯誤;
狀態不一致;
模型版本管理;
調試難度;
安全邊界設計。
因此:
多模型 ≠ 自動更好 \text{多模型}
\neq
\text{自動更好} 多模型 = 自動更好
它只是在具身系統多時間尺度條件下,更可能接近合理解。
十二、可證偽條件
本文是架構命題,不是已完成定律。
若未來出現以下情況,應下修本文。
12.1 單一大型模型能穩定完成所有層級
若單一模型能同時做到:
高階推理;
感知融合;
毫秒級控制;
最壞延遲保證;
低功耗;
可形式驗證;
安全故障降級;
則多模型分層的必要性將下降。
12.2 多模型整合成本過高
若:
C i n t e g r a t i o n > Q c o o r d i n a t i o n C_{\mathrm{integration}}
>
Q_{\mathrm{coordination}} C integration > Q coordination
且長期如此,單模型加少量控制器可能更有效。
12.3 中型模型無法承擔具身協調
若中型模型在場景推理、技能選擇與例外處理上,長期顯著落後大型模型,則大型模型必須更頻繁地參與本地控制。
12.4 傳統控制器被完全可驗證神經控制取代
若未來可證明神經模型同時具有:
穩定性;
最壞延遲;
安全邊界;
可解釋故障模式;
經典控制器的角色可能縮小。
十三、研究與工程路線
13.1 第一階段:建立最小分層原型
建立:
一個中型具身協調模型;
三至五個小型技能模型;
一個即時控制器;
一個安全監督器;
一個大型模型遠程顧問。
13.2 第二階段:測量模型分工
比較:
全部交給大型模型;
中型模型加控制器;
中型模型加小模型;
大中小模型加安全層。
測量:
任務成功率;
Token;
延遲;
能耗;
人工介入;
碰撞率;
故障恢復率。
13.3 第三階段:動態模型路由
設任務難度為:
d ( x ) d(x) d ( x )
模型路由:
Route ( x ) = { M S , d ( x ) < θ 1 M M , θ 1 ≤ d ( x ) < θ 2 M L , d ( x ) ≥ θ 2 \operatorname{Route}(x)
=
\begin{cases}
M_S,& d(x)<\theta_1\\
M_M,& \theta_1\leq d(x)<\theta_2\\
M_L,& d(x)\geq\theta_2
\end{cases} Route ( x ) = ⎩ ⎨ ⎧ M S , M M , M L , d ( x ) < θ 1 θ 1 ≤ d ( x ) < θ 2 d ( x ) ≥ θ 2
未來系統不固定使用一個模型,而根據任務動態分配計算資源。
13.4 第四階段:跨機器人能力共享
大型教師模型可為多台機器人生成技能。
每台機器人則保留:
本地狀態;
本地小模型;
個體記憶;
硬體差異;
安全參數。
形成:
共享高階智能 + 個體化低階身體 \text{共享高階智能}
+
\text{個體化低階身體} 共享高階智能 + 個體化低階身體
十四、與智能能力密度命題的關係
先前的智能能力密度猜想提出:
最大智能 → 最高單位資源智能 \text{最大智能}
\rightarrow
\text{最高單位資源智能} 最大智能 → 最高單位資源智能
本文把它套用到具身 AI:
具身智能不是把最大模型放進身體, 而是把最合適的智能放進最合適的功能位置。 \boxed{
\text{具身智能不是把最大模型放進身體,
而是把最合適的智能放進最合適的功能位置。}
} 具身智能不是把最大模型放進身體, 而是把最合適的智能放進最合適的功能位置。
因此,具身 AI 的最佳化問題為:
min ( E , L , M , T , C ) \min
\left(
E,
L,
M,
T,
C
\right) min ( E , L , M , T , C )
subject to:
Q e m b o d i e d ≥ Q r e q u i r e d Q_{\mathrm{embodied}}
\geq
Q_{\mathrm{required}} Q embodied ≥ Q required
且:
x ( t ) ∈ X s a f e x(t)\in\mathcal X_{\mathrm{safe}} x ( t ) ∈ X safe
其中:
E E E :能源;
L L L :延遲;
M M M :記憶體;
T T T :Token;
C C C :成本。
十五、結論
本文提出,具身人工智慧的合理演化方向,不是單純由更大的模型接管更多層級,而是形成多時間尺度、異質模型、傳統控制與安全監督共同構成的分層智能體。
其基本結構為:
M L : 教師、知識、長程推理與未知問題 M M : 具身協調、場景理解與技能選擇 { M S i } : 感知、觸覺、抓取、步態與預測 C R : 即時控制、物理穩定與安全 \boxed{
\begin{aligned}
M_L &: \text{教師、知識、長程推理與未知問題}\\
M_M &: \text{具身協調、場景理解與技能選擇}\\
\{M_{S_i}\} &: \text{感知、觸覺、抓取、步態與預測}\\
C_R &: \text{即時控制、物理穩定與安全}
\end{aligned}
} M L M M { M S i } C R : 教師、知識、長程推理與未知問題 : 具身協調、場景理解與技能選擇 : 感知、觸覺、抓取、步態與預測 : 即時控制、物理穩定與安全
大型模型仍然重要,但它不必直接控制所有關節。
中型模型可能成為本地具身協調核心。
小型模型則成為感知與技能器官。
經典控制器與硬安全層負責保證系統不因高階模型的錯誤而直接造成物理失控。
因此,具身智能的完整鏈條是:
物理可行域 → 狀態估計 → 分層控制 → 時空規劃 → 安全執行 \boxed{
\text{物理可行域}
\rightarrow
\text{狀態估計}
\rightarrow
\text{分層控制}
\rightarrow
\text{時空規劃}
\rightarrow
\text{安全執行}
} 物理可行域 → 狀態估計 → 分層控制 → 時空規劃 → 安全執行
最終命題為:
具身 AI 的核心不是單一模型最大化, 而是整個智能體在多時間尺度上的完備協同。 \boxed{
\text{具身 AI 的核心不是單一模型最大化,
而是整個智能體在多時間尺度上的完備協同。}
} 具身 AI 的核心不是單一模型最大化, 而是整個智能體在多時間尺度上的完備協同。
十六、一句話版本
不要把最大的模型塞進身體; 要把適當大小的智能,放進適當的時間尺度。 \boxed{
\text{不要把最大的模型塞進身體;
要把適當大小的智能,放進適當的時間尺度。}
} 不要把最大的模型塞進身體; 要把適當大小的智能,放進適當的時間尺度。
附錄 A:核心命題集合
命題一:具身智能木桶命題
具身智能受物理、感知、控制、規劃與安全中最弱層限制。
命題二:時間尺度不可壓平命題
不同具身功能無法在不付出巨大代價下,被壓入同一模型與同一更新頻率。
命題三:模型群落命題
穩定具身智能將由多個模型、控制器與安全模組共同構成。
命題四:語義權與物理權分離命題
高階模型可以提出意圖,但底層控制與安全層保有最終否決權。
命題五:中型具身核心猜想
在大型模型仍昂貴、小模型整合能力有限的過渡期,中型模型最可能成為本地具身協調核心。
命題六:事件驅動大型模型猜想
大型模型將由持續運行,轉為在歧義、失敗與未知事件中被選擇性調用。
附錄 B:版本說明
v0.1 — 2026-07-18
首次建立多模型具身智能體的五層最小完備架構;
將物理、感知、控制、規劃與安全分離;
建立大型、中型、小型模型與非生成式控制器的四級分工;
提出時間尺度不可壓平命題;
提出語義權與物理權分離;
建立硬體異質映射;
加入可證偽條件與四階段研究路線;
與智能能力密度猜想建立銜接。