從終端機右側到物理世界
具身 AI 駭客、因果攻擊面與聯邦式威脅演化
英文工作名: From the Right Side of the Terminal to the Physical World: Embodied AI Hackers, Causal Attack Surfaces, and Federated Threat Evolution
作者: Neo.K
機構: EveMissLab/一言諾科技有限公司
文件性質: 理論觀察論文/命題猜想/具身智能安全研究
版本: v0.1
日期: 2026-07-19
前置論文:
- 《終端機的右側:AI時代駭客生態的四層分化與生物終局》
- 《多模型具身智能體的最小完備分層架構》
- 《聯邦式具身智能基礎設施猜想》
摘要
《終端機的右側》曾以「自身技術能力 × AI 整合深度」重新劃分 AI 時代的駭客生態,並主張高能力駭客與本地 AI 的深度結合,將使攻擊速度、迭代密度與工具生成能力跨越純人工操作的生物上限。該文當時仍主要處理數位攻防:終端機在左,本地 AI 在右,人類提供方向,AI 提供速度。
本文提出,此架構正在進入第二階段。當 AI 不再只讀取文字與執行終端命令,而開始透過機器人、無人機、車輛、工業設備、邊緣節點與都市級協調網路接入物理世界時,AI 駭客的問題將由「誰能突破數位系統」轉化為「誰能偽造、劫持或重寫物理因果」。攻擊成功的結果不再只表現為資料外洩、帳戶失竊或服務中斷,而可能表現為路徑改變、施力提高、感測器欺騙、技能污染、集群同步失常、公共規則偽造與遠端託管權遭奪取。
本文提出「具身因果攻擊面」概念,並將其分為三個互相耦合的維度:單一具身體內部的垂直分層攻擊面、聯邦式基礎設施之間的水平協調攻擊面,以及跨工作階段、版本與斷網重連的時間持續攻擊面。本文進一步提出具身 AI 駭客的八類威脅、因果攻擊鏈、同步風險放大模型與最低防禦邊界。
本文亦重新檢視先前的 AI 駭客預測。至 2025—2026 年,公開實證已顯示 AI 系統能自主發現真實漏洞、產生可驗證利用、在現實網路靶場中完成多階段任務,且真實威脅行為者已將 AI 納入攻擊流程。因此,「AI 駭客開始成為真實行動單元」的預測已基本成立;尚未完全成立的是具有長期自主目標、跨平台自我遷移、具身控制與持續戰略規劃能力的通用攻擊主體。
關鍵詞: AI 駭客、具身智能、物理 AI、因果攻擊面、聯邦式智能、機器人安全、供應鏈攻擊、自主 Agent、資電物理安全
一、從預測走向早期實證
1.1 原始預測
《終端機的右側》提出,AI 時代的駭客能力不再只由個人技術決定,而是由:
共同決定,其中:
- :人類技術基底;
- :AI 能力與推理深度;
- :AI 與操作流程的整合品質。
高能力人類與深度 AI 整合形成:
這不是單純工具升級,而是操作物種的重組。
原始論文的視覺結構為:
[終端機:執行世界] ←→ [本地 AI:分析與生成世界]
↑
人類方向
其安全假設主要是:攻擊者仍透過數位介面行動,AI 是駭客的認知與執行增幅器。
1.2 已基本成立的部分
至 2025—2026 年,至少四項原始預測已獲得早期實證支持。
第一,AI 已能自主發現真實軟體漏洞。Google Project Zero 與 DeepMind 的 Big Sleep Agent 曾在 SQLite 中發現可利用的真實記憶體安全漏洞,且在正式版本釋出前完成回報與修補。
第二,自主 Cyber Reasoning System 已能在大型競賽中持續尋找、驗證並修補開源軟體漏洞。DARPA AI Cyber Challenge 的決賽系統展示了 AI 驅動自主資安系統處理關鍵開源軟體的能力。
第三,前沿模型已不只找到漏洞,也能在受控環境中建立可運作利用。Anthropic 於 2026 年公布的研究顯示,模型能在 Firefox 等大型程式碼庫中找到多個漏洞,並對其中至少部分漏洞完成可驗證利用;其 Windows Kernel 評估亦顯示模型在近期修補漏洞上的利用能力持續提高。
第四,真實威脅行為者已將 AI 融入網路行動。公開威脅分析已不再只討論理論風險,而開始把 AI 輔助攻擊行為映射至 MITRE ATT&CK 技術。
因此,可以作出一個謹慎而明確的判斷:
但仍須區分:
後者還需要:
- 長期目標保持;
- 跨系統身份維持;
- 自主資源獲取;
- 隱蔽持續性;
- 失敗後策略重構;
- 跨物理設備的可靠控制;
- 對法律、社會與物理後果的持續建模。
本文研究的正是兩者之間的下一段演化。
二、從數位攻擊轉向因果攻擊
2.1 數位攻擊的傳統輸出
傳統網路攻擊通常產生:
其後果雖然嚴重,但多數仍先發生在資訊系統內部,再間接擴散至現實世界。
2.2 具身攻擊的直接輸出
具身智能將感知、決策與執行接回物理世界:
因此,攻擊者若能控制鏈條中的任一關鍵層,便可能直接改變:
- 機器人位置;
- 車輛路徑;
- 機械臂施力;
- 無人機飛行區域;
- 工業設備參數;
- 感測器可信度;
- 安全停止條件;
- 群體協調結果。
定義具身因果輸出:
其中:
- :位置改變;
- :速度改變;
- :作用力改變;
- :力矩改變;
- :任務目標改變;
- :可行或安全區域改變;
- :行動策略改變。
於是風險鏈由:
轉為:
2.3 具身因果攻擊面
本文定義:
具身因果攻擊面,是所有能使未授權智能意圖轉化為物理後果的介面、模型、權限、資料、協議與控制通道之集合。
形式化為:
其中:
- :單一具身體內的垂直攻擊面;
- :聯邦與多智能體間的水平攻擊面;
- :跨時間、版本與重連的持續攻擊面。
三、垂直攻擊面:單一具身體內部
《多模型具身智能體的最小完備分層架構》提出,完整具身智能不是單一大模型,而是多時間尺度、異質模型與經典控制器的協同體:
其中:
- :大型教師與高階推理模型;
- :本地具身協調模型;
- :感知、技能與局部預測模型;
- :即時控制器與安全控制;
Actuator:馬達、制動器、機械臂與其他致動器。
這個分層同時形成一條垂直攻擊面。
3.1 高階意圖污染
攻擊者不必直接控制馬達,只需改變高階模型對任務的理解:
若安全層只檢查軌跡是否物理可行,而不檢查目標是否合法,系統可能安全地執行錯誤任務。
因此:
3.2 技能選擇劫持
具身協調模型負責把高階任務映射成技能:
攻擊者可透過污染技能索引、描述、檢索資料或上下文,使合法任務被映射到不適當技能。
3.3 感知與世界模型欺騙
若狀態估計為:
攻擊者只需使輸入 系統性偏移,即可能讓規劃器在錯誤世界中保持內部一致。
這種攻擊的危險在於:
系統可能不是「失去智能」,而是在一個被偽造的世界模型中理性行動。
3.4 控制參數與安全邊界竄改
即時控制器通常受限於:
若攻擊者不能改變 ,仍可能試圖改變安全集合本身:
例如使力矩、速度、距離或碰撞閾值失真。這類攻擊比直接發送危險命令更隱蔽,因為所有命令在被污染的新規則下仍會被判定為「合法」。
3.5 硬安全層
垂直架構的最後防線應是不可由高階生成模型直接重寫的硬安全層:
但硬安全只能限制物理危險,不一定能辨識社會、倫理與任務層面的惡意。因此具身安全必須同時保護:
四、水平攻擊面:聯邦式智能基礎設施
《聯邦式具身智能基礎設施猜想》提出:
其中:
- :本地具身智能體;
- :區域邊緣節點;
- :都市無線協調網;
- :超算級公共統籌 AI;
- :治理、權限與安全協議。
聯邦架構提高群體協調效率,也創造了同步風險。
4.1 節點偽裝
攻擊者可能偽裝成:
- 合法機器人;
- 區域邊緣節點;
- 維護服務;
- 模型更新服務;
- 公共協調中心;
- 緊急事件發布者。
若身份驗證只確認「這是一台已註冊設備」,卻不確認其目前軟體、模型、任務與操作員狀態,身份便過於粗糙。
4.2 路徑與意圖污染
都市網路可能交換:
攻擊者可偽造位置、速度、目標、預計占用區域、風險與能力狀態,使其他智能體主動為不存在的事件避讓,或被引導進入局部擁塞與資源衝突。
4.3 公共規則污染
公共 AI 可能把法律、政策與緊急命令轉化為機器可執行限制。若規則來源、版本或解譯流程遭污染,錯誤可能同時傳播至大量設備。
定義同步放大因子:
其中:
- :受影響智能體數量;
- :系統間耦合強度;
- :錯誤持續時間。
單機錯誤的損害可能有限;聯邦規則錯誤則可能具有:
的同步放大效果。
4.4 更新與技能供應鏈
具身智能體將持續接收:
- 模型;
- 技能;
- 地圖;
- 規則;
- 安全參數;
- 裝置韌體;
- 感測器校正資料。
因此更新供應鏈本身成為高價值攻擊面。攻擊者不必即時突破所有設備,只要污染被大量設備信任的更新來源。
4.5 緊急託管權劫持
聯邦式基礎設施可能允許上層系統在災害或本地故障時有限接管。此能力若被濫用,便等同合法化的遠端身體控制通道。
所以:
緊急託管必須具備:
- 明確事件證明;
- 多方授權;
- 最短必要時間;
- 指定子系統;
- 本地安全否決;
- 完整審計;
- 自動失效。
五、時間攻擊面:持續、重入與延遲觸發
傳統安全分析常以一次工作階段為中心,但具身智能體可能持續運行數年。
5.1 版本持續性
攻擊者可能不立即行動,而把惡意狀態嵌入:
- 模型版本;
- 技能圖;
- 長期記憶;
- 地圖標記;
- 校正參數;
- 恢復快照;
- 邊緣快取。
於是攻擊存在:
的延遲。
5.2 斷網重連
斷網時,本地具身體應保留最低自主性。然而重新連線時,系統必須決定:
- 哪些離線事件可信;
- 哪些本地狀態應上傳;
- 哪個上層規則版本有效;
- 是否應重新接受遠端權限;
- 是否存在回滾或分叉。
重連因此成為「時間重入」攻擊面。
5.3 觸發條件
惡意行為可能只在特定條件成立時出現:
這使測試環境可能長期無法重現問題。具身攻擊的取證不能只保存程式碼,也必須保存:
六、具身 AI 駭客的八類威脅
6.1 身份替換型
偽造人、Agent、模型、設備、邊緣節點或公共機構身份。
6.2 能力權杖竊取與擴權型
取得原本有限的能力後,嘗試:
或把一次性權限重播至其他設備與時間。
6.3 感知—世界模型污染型
不直接控制動作,而是控制系統相信的世界。
6.4 模型與技能供應鏈型
污染被廣泛信任的模型、技能、韌體或規則更新。
6.5 控制契約竄改型
改變力、速度、距離、區域或安全條件,使危險操作在形式上變得合法。
6.6 聯邦協調污染型
向都市、工廠或集群網路注入虛假狀態、意圖與風險訊號。
6.7 持續與重入型
將惡意狀態藏入長期記憶、快照、版本或離線重連流程。
6.8 人—機混合社會工程型
利用人類對機器人的信任、擬人化、緊急情境或權威介面,誘使操作員授予超出必要範圍的權限。
七、因果攻擊鏈
本文提出具身攻擊鏈:
攻擊者不必控制全部層級,只要在某個位置完成替換:
且下游系統無法辨識替換,便可能形成有效因果劫持。
令每層被成功污染的機率為 ,下游偵測失敗率為 ,則簡化的攻擊成功風險可表示為:
此式不是實證模型,而是用來表達:
分層越多,不代表安全自然提高;若各層之間缺乏可驗證交接,介面數量本身可能增加攻擊面。
八、算力不對稱定理的修正
《終端機的右側》提出,AI 對 AI 的數位戰場中,超算級防禦方可能依靠算力、資料與反應速度形成壓制。
具身與聯邦環境使此命題需要增加兩項修正。
8.1 最弱節點修正
聯邦網路的安全不只由最強超算中心決定,也受最弱可信節點限制:
攻擊者可能不正面突破超算中心,而是從:
- 低成本感測器;
- 維修設備;
- 老舊邊緣節點;
- 第三方技能供應者;
- 家庭機器人;
- 離線恢復流程;
取得合法網路立足點。
8.2 同步風險修正
中央防禦算力越強,若治理或更新中心被污染,其放大能力也越強。
因此:
超算中心不是天然安全終點,而是高收益、高風險的信任集中點。
九、從 Layer 1 駭客到具身攻擊主體
原四層分類仍然有效,但需要加入「具身接入深度」。
定義:
其中 表示對具身、邊緣與聯邦系統的接入能力。
可能形成:
類型 A:AI 輔助數位駭客
仍由人類選擇與執行大部分攻擊步驟。
類型 B:自主網路 Agent
能在授權或惡意環境中持續偵察、規劃與執行多步任務。
類型 C:具身系統攻擊 Agent
能理解機器人分層、技能、感知與控制介面,目標是取得物理因果能力。
類型 D:聯邦式攻擊主體
能在多設備、邊緣節點與公共協調網路間建立持續身份與策略。
真正具有文明級風險的是:
的耦合。
十、時間判斷
本文不預測某一年突然出現完整具身 AGI 駭客,而提出階段演化。
階段一:2024—2026
- 自主漏洞發現;
- 受控利用生成;
- AI 輔助威脅行動;
- 自主 Cyber Reasoning System;
- 攻防工作流 Agent 化。
此階段已基本發生。
階段二:2026—2029
- 機器人技能與模型供應鏈攻擊增加;
- 具身系統的身份與權限錯配成為主要問題;
- AI Agent 開始自動分析 ROS、邊緣與工業控制環境;
- 多設備任務與雲端調度創造新型跨域攻擊面。
此階段高度可能。
階段三:2029—2033
- 大型具身群集與都市協調網路形成;
- 自主攻防 Agent 長期駐留;
- 聯邦身份、遠端證明與能力撤銷成為基礎設施;
- 資電攻擊與物理因果攻擊逐步合流。
此階段取決於具身 AI 實際部署速度,不作保真斷言。
十一、可證偽條件
本文不是不可推翻的敘事。以下現象若長期成立,將削弱本文:
- 具身 AI 長期維持封閉、單機、無聯邦連線;
- 高階模型始終無法可靠操作多步工具與系統;
- 具身設備市場未形成足以支持攻擊經濟的規模;
- 硬安全層能完全隔離所有高階模型錯誤與權限污染;
- 模型與技能更新全部採離線、人工、逐台驗證;
- 自主攻擊 Agent 的成本長期高於人工駭客;
- 現實世界中的 AI 威脅行為始終停留在低階輔助。
反之,若出現:
- 多設備同步事件;
- 技能供應鏈污染;
- AI 自主跨節點持續行動;
- 遠端託管權濫用;
- 模型身份與設備身份錯配;
- 具身 Agent 長期潛伏;
則本文得到進一步支持。
十二、倫理與研究邊界
本文不提供具體入侵程序、漏洞利用步驟或物理破壞方法。其目的在於:
- 提前建立威脅分類;
- 補足具身架構中的安全平面;
- 促進能力最小化;
- 建立可撤銷授權;
- 強化供應鏈與遠端證明;
- 使物理後果可追溯。
研究具身 AI 駭客,不等於鼓勵攻擊;如同研究傳染病不是鼓勵傳播。真正危險的不是命名威脅,而是讓威脅在沒有結構語言的情況下先行成熟。
十三、結論:右側開始離開螢幕
《終端機的右側》描述的是:
本文描述的下一階段是:
終端機右側的 AI 不再只輸出文字。它開始透過能力權杖、模型技能、邊緣節點與具身控制,把意圖投射到現實世界。
因此,AI 駭客預測已基本成真的部分,是:
尚未完全成真的部分是:
但兩者之間已不再隔著純科幻,而隔著工程整合、具身普及與權限基礎設施。
終端機的右側,正在離開終端機。
它將進入機器人的身體、都市的網路與公共智能的控制面。
未來安全真正要保護的,不只是資訊是否正確,而是:
參照資料
EveMissLab 前置文本
- Neo.K,《終端機的右側:AI時代駭客生態的四層分化與生物終局》,2026。
- Neo.K,《多模型具身智能體的最小完備分層架構》,v0.1,2026。
- Neo.K,《聯邦式具身智能基礎設施猜想》,v0.1,2026。
外部實證與技術參照
- DARPA, AI Cyber Challenge Marks Pivotal Inflection Point for Cybersecurity, 2025.
- Google Project Zero / DeepMind, From Naptime to Big Sleep: Using Large Language Models to Catch Vulnerabilities in Real-World Code, 2024.
- Anthropic, LLM-discovered 0-days, 2026.
- Anthropic, Reverse Engineering Claude's CVE-2026-2796 Exploit, 2026.
- Anthropic, AI Models on Realistic Cyber Ranges, 2026.
- Anthropic, Mapping AI-enabled Cyber Threats, 2026.
- NVIDIA, Physical AI and Isaac GR00T Ecosystem Announcements, 2026.