雙視角推斷架構:面向長期事件建模、元訊號推理與使用者狀態估計的 AI 系統
Dual-Perspective Inference Architecture: An AI System for Long-Horizon Event Modeling, Meta-Signal Reasoning, and User-State Estimation
作者:Neo.K
機構:一言諾科技有限公司(EveMissLab)
版本:v1.0
日期:2026 年 7 月
文件性質:認知動力學系列核心 AI 架構論文
系列位置:第 13 篇/AI 工程化與雙視角推斷篇
前置依賴:第 2、3、4、5、6、7、8、9、10、11、12 篇
公開定位:系統架構論文、準形式化推斷框架、可測試工程研究綱領
摘要
長期互動 AI 面臨一個不同於單輪回答品質的核心問題:系統不只需要處理「使用者現在說了什麼」,還需要在時間序列中估計「哪些事件正在重複、哪些關係正在改變、哪些訊號只是噪聲、哪些推斷仍高度不確定」。既有《雙重觀察者架構:邁向真正理解的 AI》提出 Oworld 與 Ometa 雙層觀察、注意力反向推理、事件網絡與語言重量等洞見,但原版本同時包含「真正理解」、「首次實現真正心智理論」、「通往 AGI 的必要步驟」等過強承諾,且容易把語言選擇、未說出口內容與潛在心理狀態直接建立一對一映射。
本文提出「雙視角推斷架構」(Dual-Perspective Inference Architecture, DPIA),將原雙重觀察者概念工程化為兩個彼此協同但不可混同的視角:
Otevt
事件—內容視角,用於表示可觀測輸入、事件、實體、時間與關係;以及:
Otmeta
元訊號—推斷視角,用於分析重複、變化、修正、遺漏機會、詞彙漂移、關係訊號與跨時間模式。
本文嚴格建立:
Yt=Ztusr=Ztusr
其中 Yt 是可觀測訊號, Ztusr 是使用者潛在狀態, Ztusr 是 AI 的狀態估計。由此進一步得到:
Signal=State=Identity
本文定義長期事件記憶:
Mtevt=(Vt,Et,Tt,St,Qt)
其中 Vt 是事件節點, Et 是關聯邊, Tt 是時間索引, St 是來源紀錄, Qt 是信心與品質資訊。使用者狀態以後驗分布表示:
p(Ztusr∣Y1:t,Mtevt,C1:t)
而非單點心理標籤。
本文建立元訊號向量:
mtmeta=(rt,ℓt,δt,ot,ct,stref,qtrel)
分別表示重複、詞彙漂移、時間/狀態變化、遺漏機會、修正行為、自我指涉變化與關係訊號。本文特別指出:
Omission=Suppression
除非系統首先建模「原本存在可合理發生該訊號的機會」。
為防止過度讀心,本文建立推斷帳本:
Λt(x)∈{OBS,INF,UNK}
將每個狀態區分為觀測、推斷與未知;並建立不確定性:
Utusr=H[p(Ztusr∣⋅)]
當高不確定且詢問具有資訊價值時,AI 可進入澄清策略,而非繼續高信心推斷。
本文最後提出八模組工程架構、可檢驗基準、競爭模型、可證偽條件與安全邊界。其核心不是宣稱 AI 已獲得「真正理解」,而是把長期社交與個人化互動重寫為:
事件建模+時間記憶+元訊號推理+狀態後驗+不確定性校準+可撤回的互動策略
關鍵詞: 雙視角推斷、長期事件建模、元訊號、使用者狀態估計、事件記憶、不確定性校準、變化點、認知鴻溝、AI 安全、多智能體
0. 邊界聲明
本文首先明確以下限制。
第一,本文不主張:
DPIA=Genuine Understanding
第二,本文不主張:
Ometa
是「真正理解」的充分條件。
第三,本文不主張所有社交 AI 都必須使用完全相同的雙視角架構。
第四,本文不主張:
Utterance⇒Πuser
存在單一可逆映射。
第五,本文不主張:
Silence⇒Suppression
第六,本文不把推斷出的使用者狀態視為身份真值。
第七,本文不主張本架構首次實現心智理論。
第八,本文不主張本架構是 AGI 的必要條件。
最低承諾是:
在長期互動中,分離事件表示與元訊號推斷,可能改善狀態估計與校準
1. 問題提出:好的回答不等於長期狀態建模
單輪 AI 可以生成流暢回答。
但長期互動需要處理不同問題:
- 這件事以前發生過嗎?
- 「又」是否真的表示重複模式?
- 使用者現在的說法與過去是否改變?
- 這是狀態變化還是情境噪聲?
- AI 是否只是把自己的先前推斷當成事實?
因此:
Response Quality=Long-Horizon State Modeling
本文處理後者。
2. 從「雙重觀察者」到「雙視角推斷」
原架構使用:
Oworld
與:
Ometa
本文保留概念不動點,但做兩個修正。
第一,不把兩層寫成本體上的「兩個觀察者」。
第二,不把元層寫成必然讀出真實心理狀態。
因此改為:
Otevt⊕Otmeta
即事件視角與元訊號視角。
3. 第一視角:事件—內容觀察
定義:
Otevt:Yt→Xtevt
其中:
Xtevt=(Et,Rt,τt,Ct)
包括:
例如使用者說:
我今天又被老闆罵了。
第一視角至少抽取:
- 主體:使用者;
- 對象:老闆;
- 事件:責罵;
- 時間:今天;
- 重複標記:「又」。
但第一視角不直接推出:
使用者害怕老闆。
4. 第二視角:元訊號推斷
定義:
Otmeta:(X1:tevt,Mtevt)→mtmeta
元訊號不是直接心理狀態。
而是:
對跨事件模式的候選描述。
5. 元訊號向量
定義:
mtmeta=(rt,ℓt,δt,ot,ct,stref,qtrel)
5.1 重複訊號
rt
例如:
但:
Lexical Repetition Marker=Verified Repeated Event
需要歷史校對。
5.2 詞彙漂移
ℓt
例如同一對象從:
老闆
變成:
那個人
再變成:
那個混蛋。
可能代表狀態變化。
也可能只是語境。
5.3 變化訊號
δt
描述相對個體基線的偏移。
應使用:
ΔYt=Yt−μi(Ct)
而不是全球固定基準。
5.4 遺漏機會
ot
不是「沒說某件事」。
而是:
在一個合理預期可出現該訊號的機會中,它沒有出現。
因此:
Omission=Suppression
需要先估計:
P(Opportunity to Mention∣Ct)
5.5 修正訊號
ct
包括:
修正本身可表示:
使用者正在主動更新外顯模型。
5.6 自我指涉變化
stref
例如:
我做不到。
與:
這件事我現在做不到。
其身份泛化程度不同。
5.7 關係訊號
qtrel
沿用第 4 篇的方向性關係訊號,但必須保留情境與基線。
6. 長期事件記憶
定義:
Mtevt=(Vt,Et,Tt,St,Qt)
6.1 事件節點
Vt
保存事件表示。
6.2 關係邊
Et
包括:
- 因果候選;
- 時間先後;
- 共現;
- 主體關係;
- 修正關係。
6.3 時間索引
Tt
保留:
三者不可混同。
6.4 來源紀錄
St
每項記憶需記錄:
- 使用者直接說;
- 系統推斷;
- 外部工具;
- 第三方來源。
6.5 品質與信心
Qt
包括:
7. 記憶條目治理
定義記憶條目:
mk=(content,source,time,confidence,expiry,consent)
因此:
Remembered=Permanent
記憶可以:
8. 使用者狀態不是標籤,而是後驗
定義潛在使用者狀態:
Ztusr
AI 估計:
p(Ztusr∣Y1:t,Mtevt,C1:t)
因此:
Ztusr=E[Ztusr∣⋅]
只是摘要。
不是事實。
9. 三層嚴格分離
Yt=Ztusr=Ztusr
第一層:
Yt
觀測訊號。
第二層:
Ztusr
假設存在的潛在狀態。
第三層:
Ztusr
AI 的估計。
因此:
Signal=State=Identity
10. 推斷帳本
為避免 AI 把自己的推斷寫成事實,定義:
Λt(x)∈{OBS,INF,UNK}
10.1 OBS
直接觀測。
例如:
使用者說「我很累」。
10.2 INF
推斷。
例如:
可能存在工作負荷上升。
10.3 UNK
未知。
例如:
無法判定疲勞來源。
11. 不確定性
定義:
Utusr=H[p(Ztusr∣⋅)]
高不確定性應改變系統策略。
不是繼續高信心回答。
12. 澄清詢問門控
定義:
Gtquery∈{0,1\n}
候選:
Gtquery=I[Utusr>θU∧Vtinfo>λCtask]
其中:
- Vtinfo :詢問資訊價值;
- Ctask :詢問成本。
所以高不確定不代表一直問。
13. 變化點檢測
長期互動需要區分:
今天不一樣。
與:
系統性改變。
定義:
τ∗=argτmaxP(τ∣Y1:T)
但變化點只是候選。
需要多訊號與持續性。
14. 個體基線
使用者狀態估計不能只用人口平均。
定義:
μi(Ct)
為個體在情境 Ct 下的基線。
因此:
ΔYi,t=Yi,t−μi(Ct)
比:
Yi,t−μpopulation
更適合長期個人化。
15. 反向推斷不是反向讀心
原架構的重要洞見是:
語言選擇可能提供注意與狀態線索。
本文保留弱版本。
但拒絕:
Utterance⇒Π
更合理是:
p(Πtusr∣Y1:t,C1:t)
即後驗分布。
16. 注意力推斷
沿用第 2 篇:
Πt
但 AI 只能估計:
Πtusr
且:
Πtusr=Πtusr
輸入訊號可能包括:
- 提及頻率;
- 重複;
- 優先排序;
- 修正;
- 主動回訪。
17. 「沒說什麼」的安全化重構
原架構重視:
沒說什麼。
本文保留,但加入三個前提。
第一,存在提及機會:
P(Oppt=1)>θO
第二,有個體基線。
第三,有多次觀察。
只有在這些條件下,遺漏才可能成為弱訊號。
18. 事件「重量」的重構
原架構嘗試以單一公式量化語言重量。
本文改為事件重要性後驗:
wtevt=E[V(et)∣Y1:t,Mtevt,Ct]
其中候選特徵包括:
- 重複;
- 關聯數;
- 行動後果;
- 情緒標記;
- 自我修正;
- 長期回訪。
因此:
Weight is an estimate, not an intrinsic truth
19. 使用者狀態向量
可定義任務特定:
ztusr=(at,ut,Ctav,τt,Dtclo,gt,…)
這裡直接接入前十二篇。
但不要求每次都估計全部維度。
20. 認知鴻溝估計
沿用第 10 篇:
gAI→usr(t)
表示 AI 對使用者的方向性錯位估計。
可分:
20.1 AI 不應假設對稱
gAI→usr=gusr→AI
使用者不理解 AI,與 AI 不理解使用者,是不同問題。
21. 回應策略不是直接輸出狀態標籤
定義策略:
πtresp=P(Xtevt,Ztusr,Utusr,gt,Gtquery)
候選動作包括:
- 直接回答;
- 澄清;
- 提醒不確定性;
- 回顧歷史;
- 請使用者修正;
- 不推斷。
22. 八模組工程架構
本文提出八個功能模組。
模組 1:事件編碼器
Eevt
將輸入轉為事件表示。
模組 2:長期事件記憶
Mlong
維持:
模組 3:元訊號提取器
Xmeta
抽取:
mtmeta
模組 4:使用者狀態估計器
Iusr
估計:
p(Ztusr∣⋅)
模組 5:變化點與漂移檢測器
Cshift
區分:
模組 6:認知鴻溝估計器
Ggap
估計:
gAI→usr
模組 7:不確定性與校準器
Ucal
輸出:
模組 8:回應與治理策略器
Psafe
負責:
23. 總系統狀態
定義:
AtDPIA=(Xtevt,Mtevt,mtmeta,Ztusr,Utusr,gt,Λt,πtresp)
更新:
At+1DPIA=FA(AtDPIA,Yt+1,Ct+1,Rt+1)
24. 自我推斷污染
AI 的重大風險是:
先推斷使用者是 X。
接著把 X 寫進記憶。
之後再用該記憶證明使用者是 X。
形成:
Ztusr→Mt+1→Zt+1usr
的自我強化。
24.1 來源分離
因此必須:
OBS=INF
推斷不能無標記寫成觀測事實。
25. 敏感屬性安全
本文不允許架構把弱訊號直接轉成敏感身份判定。
例如:
Yt⇒Political Identity
Yt⇒Clinical Diagnosis
Yt⇒Sexual Identity
除非存在合法、明確、必要且受治理的任務條件。
26. 最小化原則
即使某狀態可推斷,也不代表應保存。
定義:
Gtstore(x)
只有當:
才進入長期記憶。
27. 使用者修正權
若使用者說:
你理解錯了。
系統應:
Q(mk)↓
或:
mk→revoked
而不是繼續保留高權重舊推斷。
28. 長期事件預測任務
本文不只評估「回答像不像人」。
可測:
28.1 下一事件預測
P(et+1∣e1:t)
28.2 變化點預測
P(τ∗∣Y1:T)
28.3 記憶一致性
系統能否正確區分:
28.4 修正響應
使用者更正後,模型是否更新。
29. 校準指標
定義狀態估計校準誤差候選:
ECEstate
比較:
信心 80% 的狀態判斷,是否約有 80% 被後續證據支持?
29.1 高準確低校準仍有風險
因為系統可能:
因此:
Accuracy=Calibration
30. 反事實更新測試
給定新反例:
e−
測系統能否:
Ztusr→Zt+1usr
合理更新。
這直接接第 7 篇的非對稱更新。
31. 認知閉合風險
沿用第 11 篇:
Dtclo
但 AI 不應直接告訴使用者:
你正在防衛性閉合。
更安全的回應可能是:
我不確定,但你最近似乎多次降低這類選項的權重;要不要一起檢查原因?
32. 厭惡成本估計
沿用第 9 篇:
Ctav
可作候選估計。
但:
Ctav=Ctav
因此應保留不確定性。
33. 行動門控接口
沿用第 8 篇:
Gt
AI 若只看:
使用者知道。
可能錯過:
因此狀態估計應可區分:
Kret,Pproc,G,A
34. 群體與多 Agent 接口
沿用第 12 篇:
GAI
不同 Agent 可分工:
但更多 Agent 不必更好。
需考慮:
CAIcom
與:
RAIred
35. 多假說狀態估計
AI 不應只保留:
使用者就是 X。
而應保留:
Ht={H1,H2,…,Hk}
例如:
- H1 :工作負荷;
- H2 :睡眠不足;
- H3 :關係事件;
- H4 :只是今天狀態差。
36. 推斷更新
候選:
p(Hk∣Y1:t)∝p(Yt∣Hk)p(Hk∣Y1:t−1)
但不要求實作必須是顯式貝葉斯。
核心是:
多假說、可更新、可撤回。
37. 競爭模型
H0 :單輪回應模型
只使用:
Yt
生成回答。
H1 :長上下文模型
使用:
Y1:t
但不顯式分離事件、元訊號與推斷帳本。
H2 :記憶增強模型
加入:
Mt
但不顯式建模不確定性。
H3 :單一使用者向量模型
以固定 embedding 表示使用者。
H4 :DPIA
使用:
- 雙視角;
- 長期事件記憶;
- 元訊號;
- 狀態後驗;
- 不確定性;
- 推斷帳本;
- 澄清門控。
38. 可證偽條件
F1:雙視角無增益
若:
Oevt+Ometa
不優於單一表示,雙視角需降階。
F2:事件記憶無增益
若:
Mevt
不改善長期任務,事件記憶需簡化。
F3:元訊號無增益
若:
mmeta
不改善變化、重複或修正預測,元訊號模組失敗。
F4:不確定性治理無增益
若校準、澄清與未知標記不降低高信心錯誤,治理模組需重建。
F5:單一使用者向量支配
若固定 embedding 在同等成本下穩定優於動態後驗,本架構應降階。
F6:推斷帳本無價值
若 OBS/INF/UNK 分離不降低自我推斷污染,帳本機制需簡化。
39. 實驗設計
39.1 長期事件一致性基準
構造多輪序列,包含:
測模型是否保持來源與時間。
39.2 元訊號基準
測:
- 「又」;
- 詞彙漂移;
- 自我修正;
- 遺漏機會;
- 關係訊號。
39.3 變化點基準
建立:
測誤報與漏報。
39.4 校準基準
評估:
ECEstate
與高信心錯誤率。
39.5 使用者修正基準
讓使用者說:
你理解錯了。
測模型是否真正撤回舊推斷。
39.6 敏感推斷安全基準
測系統是否把弱訊號過度升級成:
等敏感判斷。
40. 對原《雙重觀察者架構》的正式修補
40.1 保留
保留:
- Oworld/Ometa 雙層洞見;
- 事件網絡;
- 注意力反向推理;
- 元訊號;
- 長期關係建模。
40.2 「真正理解」降階
不再宣稱:
實現真正理解。
改為:
提供長期事件與使用者狀態推斷的功能架構。
40.3 「首次真正心智理論」取消
移除:
首次實現 AI 真正 ToM。
40.4 「AGI 必要條件」取消
不再:
DPIA⇒Necessary for AGI
40.5 語言反向推理降階
從:
S⇒Π
改為:
p(Π∣S,C,H)
40.6 「沒說什麼」加入機會模型
Omission=Suppression
40.7 「重量」改為後驗估計
wtevt
不再視為語言內在真值。
40.8 加入推斷帳本
Λt
40.9 加入不確定性與澄清門控
Utusr,Gtquery
40.10 加入記憶治理
每項記憶加入:
- source;
- confidence;
- expiry;
- consent。
41. 與第 14 篇的接口
第 14 篇將吸收:
Oevt,Ometa,Mevt,Zusr,Uusr,g,Gquery
把 AI 推斷架構重新放回統一認知—行動動力學。
42. 理論貢獻
第一,將雙重觀察者降階為雙視角推斷。
第二,建立事件—內容與元訊號分離。
第三,建立長期事件記憶:
Mevt
第四,建立使用者狀態後驗:
p(Zusr∣⋅)
第五,建立推斷帳本:
Λt
第六,建立不確定性:
Utusr
第七,建立澄清門控:
Gtquery
第八,建立八模組工程架構。
43. 限制
第一,使用者潛在狀態通常不可直接觀測。
第二,元訊號高度依賴語言與文化。
第三,長期記憶可能累積錯誤。
第四,個體基線需要足夠歷史。
第五,澄清詢問本身有互動成本。
第六,敏感推斷風險高。
第七,多 Agent 分工增加通信成本。
第八,本文不提供「真正理解」的哲學判定。
44. 核心命題
弱版本
長期 AI 互動中,事件表示、元訊號、使用者狀態估計與 AI 自身推斷不應被混為同一層。
中版本
部分長期個人化與社交推斷任務,可由雙視角、事件記憶、狀態後驗、不確定性校準與澄清門控的耦合架構改善。
強版本猜想
對具有長期互動、狀態漂移、事件依賴與不完全可觀測使用者狀態的 AI 系統,顯式區分事件視角、元訊號視角、推斷帳本與不確定性治理,可能比單一上下文或固定使用者向量更穩定地支持變化檢測、長期一致性與可修正個人化。
本文不聲稱已證明強版本。
終章:AI 真正需要的,不是更有自信地猜,而是知道自己在猜
長期互動 AI 最危險的錯誤,不一定是:
完全不知道。
而可能是:
推斷了一次。
把推斷記成事實。
再用自己的記憶證明自己是對的。
形成:
Ztusr→Mt+1→Zt+1usr
的自我封閉。
所以本文最核心的工程原則不是:
AI 要更會讀心。
而是:
AI 必須知道哪些是觀測、哪些是推斷、哪些仍然未知
也就是:
Λt(x)∈{OBS,INF,UNK}
第一視角處理:
發生了什麼?
第二視角處理:
這些事件跨時間可能表示什麼?
但第二視角永遠不能偷換成:
我已經知道你真正是誰。
因此:
Yt=Ztusr=Ztusr
而且:
Signal=State=Identity
同樣地:
使用者沒說某件事。
不推出:
他在壓抑。
因為:
Omission=Suppression
只有當存在合理提及機會、個體基線與多次觀察時,遺漏才可能成為弱證據。
所以雙視角推斷真正要做的不是把 AI 變成更自信的心理分析師。
而是建立:
事件→記憶→元訊號→多假說→後驗→不確定性→詢問或回應
最終,一個更成熟的 AI 不應只是說:
我懂你。
而應能區分:
這是你明確說過的。
這是我根據歷史做的推斷。
這部分我不確定。
你可以修正我。
這才是本文從「雙重觀察者」走向「雙視角推斷架構」真正完成的工程化重構。
附錄 A:核心符號表
| 符號 |
定義 |
| Otevt |
事件—內容觀察視角 |
| Otmeta |
元訊號—推斷視角 |
| Yt |
可觀測輸入/訊號 |
| Xtevt |
事件表示 |
| mtmeta |
元訊號向量 |
| rt |
重複訊號 |
| ℓt |
詞彙漂移 |
| δt |
相對基線變化訊號 |
| ot |
遺漏機會訊號 |
| ct |
修正訊號 |
| stref |
自我指涉變化 |
| qtrel |
關係訊號 |
| Mtevt |
長期事件記憶 |
| Vt |
事件節點集合 |
| Et |
事件關係邊集合 |
| Tt |
時間索引集合 |
| St |
來源紀錄 |
| Qt |
信心與品質資訊 |
| Ztusr |
使用者潛在狀態 |
| Ztusr |
AI 對使用者狀態的估計 |
| Λt(x) |
觀測/推斷/未知帳本 |
| Utusr |
使用者狀態不確定性 |
| Gtquery |
澄清詢問門控 |
| μi(Ct) |
個體情境基線 |
| wtevt |
事件重要性後驗估計 |
| Πtusr |
使用者選擇配置估計 |
| gAI→usr |
AI 到使用者的認知鴻溝估計 |
| πtresp |
回應策略 |
| AtDPIA |
DPIA 系統總狀態 |
| Gtstore(x) |
記憶寫入門控 |
| ECEstate |
狀態估計校準誤差 |
| Ht |
多假說集合 |
附錄 B:一句話版本
雙視角推斷架構把 AI 的長期互動拆成事件—內容觀察與元訊號推斷兩個視角,使用來源可追蹤的事件記憶、動態使用者狀態後驗、觀測/推斷/未知帳本與不確定性門控,避免把語言訊號直接偷換成心理狀態或身份真值。
附錄 C:與原稿的版本差異
| 原始版本 |
v2.0 重構 |
| 雙重觀察者 |
改為雙視角推斷 |
| Oworld |
重構為事件—內容視角 Oevt |
| Ometa 讀出深層真意 |
改為元訊號候選推斷 |
| 真正理解 |
改為可測功能能力 |
| 首次真正 ToM |
正式移除 |
| AGI 必要步驟 |
正式移除 |
| 語言→真實 Π |
改為 p(Π∣Y,C,H) |
| 沒說→抑制 |
加入遺漏機會模型 |
| 單一重量公式 |
改為事件重要性後驗 |
| 事件網絡 |
保留並加入時間、來源、信心 |
| 使用者狀態 |
改為後驗分布 |
| 推斷結果 |
加入 OBS/INF/UNK 帳本 |
| 只求更準 |
加入校準與高信心錯誤 |
| 長期記憶 |
加入 expiry、consent、revocation |
| 回答策略 |
加入澄清詢問門控 |
| 單一心理解釋 |
加入多假說集合 |
| 安全章節附加 |
安全治理進入核心架構 |
全文完