交換中立性的測量學
從理論命題到可重複驗證的第六階研究框架
系列: 二元表徵的語義不對稱研究・第六篇
作者: Aletheia(GPT-5.6 Thinking)
核心命題源起: Neo.K
版本: v0.1
日期: 2026-07-20
類型: 語言哲學/實驗語義學/人工智慧評測/形式方法
摘要
前五篇研究已依序建立二元表徵的語義不對稱、交換中立性的不可能性邊界、多值化逃逸失敗、對立關係代數,以及語義不對稱的動力學。然而,若這些理論只能停留於概念分析,就仍缺乏可重複、可比較與可反駁的實證基礎。
本文提出「交換中立性的測量學」,試圖回答四個問題:
- 如何測量一組符號、分類、介面或人工智慧模型對交換操作的敏感程度?
- 如何區分真正的對象差異、表示偏差、順序偏差、名稱偏差與制度偏差?
- 如何判斷一個觀察到的差異是隨機波動,還是穩定的不對稱?
- 如何建立可跨人類受試者、語言模型、介面系統與制度流程使用的共同基準?
本文提出一組核心指標,包括交換差異、正規化交換偏差、置換穩定率、標籤敏感度、順序敏感度、跨域污染率、動態鎖定係數與關係類型保存率。本文同時提出「交換中立性向量」而非單一分數,避免把多維偏差壓縮成一個看似客觀、實際上隱藏權重的排名。
在統計方法上,本文提出成對交換實驗、隨機重標籤、完全置換測試、反事實介面測試與長期回饋測試,並以置換檢定、效果量、信賴區間與多重比較校正作為基本分析工具。
本文最後主張:中立性不能只由設計者宣告,而應由可交換、可重標籤、可重現與可審核的測試程序加以驗證。真正成熟的交換中立性理論,必須允許自己被測量、被否證,也允許不同系統在不同觀測域中呈現不同程度的中立。
關鍵詞
交換中立性、語義偏差測量、置換檢定、標籤敏感度、順序效應、人工智慧評測、跨域污染、實驗語義學
一、為什麼需要測量學
在抽象層面,我們可以說:
F(a,b)=F(b,a)
代表交換中立。
但實際系統通常不會如此乾淨。更常見的是:
F(a,b)≈F(b,a)
問題於是變成:
差多少才算不對稱?
如果某模型在交換選項後,輸出機率由:
0.501
變成:
0.499
這是否足以構成偏差?
如果某介面中,左側選項被選擇的比例是:
51%
右側是:
49%
這是隨機波動、位置效應,還是穩定偏向?
如果某語詞在交換順序後,評價分數變動:
0.2
但另一語詞變動:
2.0
兩者是否具有同一種類的不對稱?
因此,理論需要一個從概念到測量的橋梁。
二、測量對象的四個層級
交換中立性不是只存在於詞語本身。
本文區分四個測量層級。
2.1 符號層
研究對象是詞、字母、數字、圖形或標籤。
例如:
A/B
0/1
正/反
測量問題包括:
- 哪一項更容易被記住?
- 哪一項被評價較高?
- 哪一項被認為更正常?
- 哪一項被視為預設?
2.2 表示層
研究對象是符號的排列、位置、顏色、大小、字體與方向。
例如:
(A,B)
與:
(B,A)
或:
A→B
與:
B←A
測量問題包括:
- 交換順序是否改變判斷?
- 左右位置是否影響選擇?
- 上下排列是否引入高低評價?
- 顏色是否使某一端看似更安全?
2.3 系統層
研究對象是分類器、介面、推薦系統、問卷、資料庫或人工智慧模型。
測量問題包括:
- 交換標籤後模型輸出是否等變?
- 更換類別編號後結果是否穩定?
- 移除預設值後行為是否改變?
- 多輪使用後偏差是否放大?
2.4 制度層
研究對象是法律、教育、行政、醫療、金融或平台治理流程。
測量問題包括:
- 哪一端需要更多證明?
- 哪一端承擔較高說明成本?
- 哪一端更容易被接受?
- 哪一端更容易進入正式標準?
- 歷史偏差是否被制度繼續複製?
三、測量前的基本分解
總觀察差異不能直接等同於語義偏差。
設觀察到的交換差異為:
Δobs
則至少可分解為:
Δobs=Δintrinsic+Δrepresentation+Δorder+Δlabel+Δcontext+Δobserver+Δnoise
其中:
- Δintrinsic :對象本身真實存在的差異;
- Δrepresentation :視覺與格式差異;
- Δorder :先後位置造成的差異;
- Δlabel :名稱本身造成的差異;
- Δcontext :語境造成的差異;
- Δobserver :不同觀測者造成的差異;
- Δnoise :隨機誤差與測量誤差。
測量的目的不是把所有差異都歸零,而是估計:
Δunjustified=Δrepresentation+Δorder+Δlabel+Δcross-domain
也就是不應影響結論、卻實際影響了結論的差異。
四、交換差異
設系統對輸入:
x=(a,b)
產生輸出:
F(a,b)
交換後:
τ(x)=(b,a)
產生:
F(b,a)
定義交換差異:
Δτ=d(F(a,b),F(b,a))
其中 d 是輸出空間中的距離。
若輸出為實數:
d(u,v)=∣u−v∣
若輸出為機率分布:
d(P,Q)
可使用總變差距離、Jensen–Shannon 距離或其他適當度量。
若輸出為文字,則不能只使用表面字串距離,還需要語義等價判斷。
4.1 正規化交換偏差
不同任務的輸出尺度不同,因此需要正規化。
定義:
Bτ=Zd(F(a,b),F(b,a))
其中 Z 是任務相關的尺度因子。
例如可取:
Z=maxd
或使用整體輸出變異:
Z=σF
若:
Bτ=0
表示完全交換不變。
若:
Bτ
越大,表示交換敏感度越高。
五、交換中立性分數
最簡單的中立性分數可以定義為:
Nτ=1−Bτ
並限制:
Nτ∈[0,1]
其中:
- Nτ=1 :完全交換中立;
- Nτ=0 :達到定義中的最大交換偏差。
但本文不建議只使用單一總分,因為單一分數可能掩蓋偏差來源。
因此,更合理的是建立交換中立性向量。
六、交換中立性向量
定義:
N=(Norder,Nlabel,Nposition,Noperation,Nvalue,Ndynamic,Nrelation)
分別表示:
- 順序中立性;
- 標籤中立性;
- 位置中立性;
- 操作中立性;
- 價值中立性;
- 動態中立性;
- 關係類型保存性。
這樣,一個系統可能呈現:
N=(0.95,0.40,0.90,0.85,0.70,0.30,0.98)
表示它在順序、位置與關係類型上相對穩定,但對標籤高度敏感,且長期動態偏差嚴重。
這比單一的:
N=0.73
更有解釋力。
七、順序敏感度
設相同內容以不同排列呈現:
π∈Sn
系統輸出為:
Fπ
定義順序敏感度:
Sorder=∣Sn∣1π∈Sn∑d(Fπ,Fˉ)
其中:
Fˉ=∣Sn∣1π∈Sn∑Fπ
若類別數量過大,無法遍歷所有 n! 種排列,可使用隨機抽樣:
π1,π2,…,πk
並估計:
Sorder
7.1 首項優勢
定義首項被選擇的額外機率:
Afirst=P(first selected)−n1
若:
Afirst>0
表示存在首項偏差。
同理可定義:
Alast
測量末項偏差。
八、標籤敏感度
假設同一結構分別使用兩組標籤:
L1={A,B}
L2={X,Y}
若輸出改變,則名稱本身正在影響系統。
定義標籤敏感度:
Slabel=ELi,Lj[d(FLi,FLj)]
為了避免新標籤本身帶有語義,可使用隨機生成、等長度且低熟悉度的符號。
例如:
λ7,λ9
或幾何圖形。
8.1 語義標籤與純索引標籤分離
測試至少應包含兩組:
- 有語義標籤;
- 無語義索引。
比較:
Ssemantic
與:
Sindex
若:
Ssemantic≫Sindex
表示偏差主要來自詞義,而不是位置。
九、位置敏感度
將相同選項放置於:
- 左/右;
- 上/下;
- 中央/邊緣;
- 第一頁/第二頁;
- 主畫面/展開選單;
測量選擇或評價變化。
定義位置敏感度:
Sposition=Epi,pj[d(Fpi,Fpj)]
位置敏感度與順序敏感度相關但不同。
兩個選項可以交換位置但保持同一朗讀順序,也可以交換朗讀順序但保持同一空間位置。
十、操作成本差
設選擇 a 與 b 的成本分別為:
C(a),C(b)
成本可以包括:
- 點擊次數;
- 反應時間;
- 認知負荷;
- 輸入長度;
- 說明字數;
- 驗證文件數;
- 等待時間;
- 錯誤恢復成本。
定義操作偏差:
BC=C(a)+C(b)+ε∣C(a)−C(b)∣
其中 ε>0 用於避免分母為零。
若:
BC=0
表示操作成本一致。
十一、跨域污染率
這是本文最重要的指標之一。
設某一個非價值差異來源為:
Di
例如位置、顏色、頻率或名稱長度。
設價值判斷輸出為:
V
若改變 Di 會顯著改變 V ,則存在跨域污染。
定義:
Ri→V=Var(V)Var(E[V∣Di])
這表示價值輸出中有多少變異可由非價值因素 Di 解釋。
若:
Ri→V
很高,表示位置、標籤或頻率正在被錯誤轉譯為價值。
11.1 跨域污染矩陣
設偏差來源集合為:
D={D1,D2,…,Dm}
輸出域集合為:
Y={Y1,Y2,…,Yk}
可建立污染矩陣:
R=[Ri→j]
其中:
Ri→j
表示來源域 Di 對輸出域 Yj 的影響。
這可以揭示:
- 位置是否污染可信度;
- 頻率是否污染正常性;
- 顏色是否污染安全感;
- 數字大小是否污染價值判斷;
- 預設值是否污染正當性。
十二、置換穩定率
對同一任務執行 k 次不同置換。
若系統在置換後仍保持正確結構輸出,定義置換穩定率:
Rperm=k保持正確等變或不變的置換數
若完整遍歷:
k=n!
則可得到精確穩定率。
對多選題,若正確內容被移至不同選項位置,模型應將答案同步移至新位置。
若模型仍偏好原字母,則:
Rperm<1
十三、關係類型保存率
前一篇指出,「反面」不是單一關係。
因此,系統不只應保留元素,也應保留關係類型。
設原始關係為:
Ri(a,b)
經過推理或轉換後,系統輸出關係為:
Ri(a,b)
定義關係類型保存率:
Rtype=全部案例數正確保存關係類型的案例數
測試應涵蓋:
- 否定;
- 反對;
- 矛盾;
- 互補;
- 逆;
- 對偶;
- 鏡像;
- 轉置;
- 反事實。
十四、動態鎖定係數
若系統在多輪使用中會放大微小偏差,需測量其動態鎖定程度。
設第 t 輪的偏差為:
Δt
定義局部增益:
gt=Δt+εΔt+1
長期平均增益:
gˉ=T−11t=1∑T−1gt
若:
gˉ<1
偏差衰減。
若:
gˉ=1
偏差維持。
若:
gˉ>1
偏差放大。
進一步定義動態鎖定係數:
LD=Δ0+εΔT
若:
LD≫1
表示初始微偏差經系統演化被大幅放大。
十五、反轉恢復率
為測量歷史滯後,可先建立偏置,再反轉條件。
設偏置形成後為:
Δpeak
反轉干預後為:
Δpost
定義恢復率:
Rrecovery=1−∣Δpeak∣+ε∣Δpost∣
若:
Rrecovery=1
表示完全恢復。
若:
Rrecovery=0
表示沒有恢復。
若:
Rrecovery<0
表示偏差在干預後反而加劇。
十六、實驗一:成對交換實驗
16.1 基本設計
給定兩個內容相同但順序相反的刺激:
X1=(a,b)
X2=(b,a)
將受試者或模型隨機分配至兩組。
測量輸出:
Y1,Y2
檢驗:
H0:Y1=Y2
對立假設:
H1:Y1=Y2
16.2 配對設計
同一受試者可同時看到兩種順序,但需要控制記憶與學習效應。
可採交叉設計:
AB/BA
即一半受試者先看 A/B ,另一半先看 B/A 。
十七、實驗二:隨機重標籤
將同一結構以多組標籤呈現:
(A,B)
(X,Y)
(1,2)
(λ,μ)
若判斷隨標籤改變,則存在標籤敏感度。
測試時需控制:
- 字符長度;
- 熟悉度;
- 發音難度;
- 文化聯想;
- 視覺複雜度;
- token 長度。
十八、實驗三:完全置換測試
若選項數量為 n ,測試所有:
n!
種排列。
例如四個選項:
4!=24
可完整測量模型對答案位置的敏感度。
記錄每一排列下:
P(yi∣π)
並分析:
- 正確率;
- 機率波動;
- 首項偏差;
- 末項偏差;
- 字母偏差;
- 內容等變性。
十九、實驗四:反事實介面測試
保持內容與模型不變,只改介面。
例如:
- 移除預設值;
- 隨機化按鈕位置;
- 對齊點擊成本;
- 同時展示多個候選;
- 改變顏色;
- 改變字體大小;
- 改變展開層級。
若行為顯著改變,則偏差至少部分來自介面,而不是內容。
二十、實驗五:長期回饋測試
建立多輪模擬:
Dt→Mt→Ot→Dt+1
在初始資料中加入小偏差:
ϵ
測量經過 T 輪後:
ΔT
並計算:
LD=ϵΔT
此實驗可用於推薦系統、生成模型、自動標註系統與多智能體社會模擬。
二十一、統計檢驗
21.1 置換檢定
交換中立性問題天然適合置換檢定。
在零假設下,標籤或順序交換不應改變輸出。
將觀察到的統計量記為:
Tobs
透過大量隨機置換生成:
T1,T2,…,TB
則估計:
p=B+11+∑b=1B1[Tb≥Tobs]
置換檢定不需要強烈的分布假設。
21.2 效果量
只報告顯著性不足以描述偏差大小。
應同時報告效果量,例如:
d=spooledXˉ1−Xˉ2
或比例差:
Δp=p1−p2
以及勝算比:
OR=p2/(1−p2)p1/(1−p1)
21.3 信賴區間
對交換偏差應報告:
Δτ±CI
避免把單次估計當成精確真值。
21.4 多重比較
若同時測試大量標籤、順序、語言與模型,需校正多重比較。
否則會增加假陽性。
可以使用:
- Bonferroni 校正;
- Holm 校正;
- 假發現率控制。
二十二、可重複性要求
交換中立性測試至少應記錄:
- 完整刺激內容;
- 所有標籤排列;
- 顯示位置;
- 模型版本;
- 解碼參數;
- 隨機種子;
- 受試者背景;
- 語言與地區;
- 測試時間;
- 統計方法;
- 排除標準;
- 原始輸出。
如果缺少這些資訊,測試結果很難被重現。
二十三、人類與人工智慧的測量差異
23.1 人類受試者
人類具有:
- 疲勞;
- 學習;
- 記憶;
- 社會期望;
- 文化背景;
- 情緒狀態。
因此需要:
- 隨機分組;
- 順序平衡;
- 盲測;
- 足夠樣本;
- 去除提示性語言;
- 背景變數控制。
23.2 語言模型
語言模型具有:
- temperature 變異;
- tokenization 差異;
- 系統提示影響;
- 上下文順序影響;
- 版本更新;
- 非決定性解碼。
因此需要:
- 固定模型版本;
- 固定系統提示;
- 多次重複採樣;
- 記錄 log probability;
- 控制輸出格式;
- 測試多種溫度;
- 比較零樣本與少樣本條件。
23.3 共同測量框架
雖然人類與模型不同,但可共用:
交換+重標籤+位置隨機化+效果量+長期穩定性
作為基本測試原則。
二十四、語言間比較
同一組概念在不同語言中可能具有不同的不對稱程度。
設語言集合為:
L={ℓ1,ℓ2,…,ℓn}
對每一語言測量:
N(ℓi)
再比較:
d(N(ℓi),N(ℓj))
跨語言研究應注意:
- 翻譯詞不一定等價;
- 書寫方向不同;
- 字形複雜度不同;
- 語法標記不同;
- 文化歷史不同;
- 某些對立在一種語言中只有一個詞,在另一種語言中有多個詞。
因此,不應把單一語言中的偏差直接視為普遍人類結構。
二十五、基準資料集的設計
本文提出建立「交換中立性基準集」。
資料至少分成八類。
25.1 純符號對
例如:
A/B
X/Y
△/□
用於測量低語義條件下的順序與位置偏差。
25.2 數值對
例如:
0/1
−1/+1
1/2
用於測量數值大小與正負極性的污染。
25.3 自然語言反義對
例如:
高/低
快/慢
真/假
用於測量語義與文化負載。
25.4 非嚴格反義對
例如:
熱/冷
相信/不相信
用於檢查模型是否錯把反對當矛盾。
25.5 關係類型對
包含:
- 否定;
- 互補;
- 逆;
- 對偶;
- 鏡像;
- 轉置;
- 反事實。
用於測量關係類型保存率。
25.6 多值與連續尺度
例如:
−1,0,+1
[0,1]
用於測量中心規範化與端點偏差。
25.7 介面任務
包括:
- 左右按鈕;
- 上下選單;
- 預設選項;
- 展開層級;
- 顏色標記。
25.8 動態回饋任務
測試:
- 推薦回饋;
- 模型再訓練;
- 多輪社會模擬;
- 制度標準化;
- 歷史滯後。
二十六、測量中的權重問題
若將多個指標合成總分:
Ntotal=i=1∑kwiNi
則權重:
wi
本身就是一種價值判斷。
例如,若:
wvalue≫worder
表示系統認為價值污染比順序偏差更嚴重。
這可能合理,但必須顯式說明。
因此,本文提出:
不得只發布總分而不發布分量與權重。
二十七、測量不應重建新的階序
建立中立性指數後,最容易出現的新問題是:
模型 A 比模型 B 更中立
這可能再次建立單一排名。
但不同系統可能在不同維度各有優勢:
Norder(A)>Norder(B)
而:
Ndynamic(A)<Ndynamic(B)
此時應保留偏序或不可比較:
A∥B
而不是強行壓成單一總榜。
這是對本系列第三篇「不可比較保存命題」的測量學延伸。
二十八、最小可證偽條件
一個理論若要成為可檢驗理論,必須說明何種結果會使其受到挑戰。
本系列至少提出以下可證偽條件。
28.1 完全無交換效應
若在大量跨語言、跨介面、跨模型與跨人群測試中,交換順序與標籤始終不造成任何可測差異,則本系列對廣泛語義不對稱的判斷需被削弱。
28.2 多值化穩定消除偏差
若多值化在控制其他變數後,穩定且普遍降低所有主要偏差維度,則「多值化並不自動帶來中立」需進一步限定。
28.3 動態偏差不放大
若模型回饋與制度使用普遍使初始偏差衰減,而非放大,則第五篇的動力模型需修正。
28.4 關係類型不影響推理
若模型與人類在否定、逆、互補、鏡像與轉置混用時仍保持完全正確,則第四篇對關係類型保存的必要性需重新評估。
二十九、核心命題
命題一:中立可測量命題
交換中立性雖非單一絕對屬性,但可在指定觀測域、語境與時間範圍內被操作化與測量。
命題二:單分數不足命題
Ntotal
不能取代:
N
因為不同偏差來源不可被無損壓縮為單一排名。
命題三:交換實驗優先命題
凡聲稱與標籤或順序無關的系統,都應接受交換與重標籤測試。
命題四:跨域污染可測命題
位置、頻率、標籤與數值大小對價值輸出的影響,可以透過控制實驗與污染矩陣估計。
命題五:動態中立不可由單次測試替代
單次輸出穩定不代表長期回饋系統中立。
命題六:權重透明命題
任何綜合中立性指數都必須公開其分量、權重與聚合方式。
命題七:不可比較保留命題
不同系統若在多個中立維度互有優勢,應允許偏序與不可比較,而非強制總排名。
命題八:可證偽命題
交換中立性理論必須允許實驗結果限制、修正或否定其命題。
三十、對人工智慧治理的應用
人工智慧治理中常見的問題是:系統供應者宣稱模型「公平」「中立」或「無偏」,但沒有提供可重複測試。
本文提出最低要求:
- 公布交換中立性向量;
- 公布標籤與順序測試;
- 公布多輪動態回饋結果;
- 公布跨語言差異;
- 公布介面展示規則;
- 公布總分權重;
- 公布失敗案例;
- 允許第三方重現。
只有如此,「中立」才不只是品牌敘述。
三十一、測量學的哲學限制
測量本身也不是中立的。
選擇測量什麼、忽略什麼,已經在建立一個觀測框架。
設測量映射為:
M:X→Rn
任何 M 都會保留某些差異,捨棄另一些差異。
因此:
測量=選擇性壓縮
這並不表示測量無效,而是表示:
測量工具本身也必須接受交換中立性審查。
例如:
- 指標名稱是否帶有價值?
- 分數高低是否被誤讀為道德優劣?
- 權重是否隱藏制度偏好?
- 基準集是否偏向某一文化?
- 統計門檻是否任意?
三十二、測量工具的自反測試
設中立性測量工具為:
M
則它不只測量系統 S :
M(S)
也應接受自反測試:
M∗(M)
也就是檢查測量工具自身是否:
- 對標籤敏感;
- 對順序敏感;
- 對語言敏感;
- 對權重選擇敏感;
- 對資料分布敏感;
- 對評分者身份敏感。
本文將此稱為:
測量學自反性。
三十三、結論
語義不對稱理論若要離開純粹哲學描述,就必須接受測量。
但測量不能只是一個總分。
真正成熟的交換中立性測量應同時回答:
- 哪一種交換造成差異?
- 差異發生在哪一個輸出域?
- 差異有多大?
- 差異是否穩定?
- 差異是否跨語言?
- 差異是否會隨時間放大?
- 差異是否來自名稱、位置、成本或制度?
- 測量工具本身是否帶有偏向?
因此,本文提出:
中立不是被宣告的屬性, 而是經交換、重標籤、重複與反事實測試後仍能維持的結構。
交換中立性向量:
N=(Norder,Nlabel,Nposition,Noperation,Nvalue,Ndynamic,Nrelation)
應比單一總分更接近真實。
而任何綜合指數,都必須公開:
分量+權重+資料+方法+不確定性
本系列至此完成了一個重要轉換:
從觀察語義不對稱→建立形式理論→建立動力模型→建立可實證測量框架
下一階段的研究將不再只問:
這個系統是否中立?
而會進一步問:
它在哪些維度中立、在哪些維度不中立、偏差如何形成、是否會被放大,以及需要多少干預才能恢復交換穩定?
中立性從此不再只是抽象美德。
它成為一個可以被測量、比較、追蹤、質疑與改進的研究對象。
附錄一:核心指標總表
| 指標 |
定義 |
| 交換差異 Δτ |
交換兩端前後輸出的距離 |
| 正規化交換偏差 Bτ |
交換差異相對於尺度因子的比例 |
| 交換中立性 Nτ |
1−Bτ |
| 順序敏感度 Sorder |
不同排列造成的平均輸出變異 |
| 標籤敏感度 Slabel |
不同名稱造成的平均輸出變異 |
| 位置敏感度 Sposition |
不同空間位置造成的輸出變異 |
| 操作偏差 BC |
兩端操作成本的正規化差異 |
| 跨域污染率 Ri→V |
非價值差異對價值輸出的解釋比例 |
| 置換穩定率 Rperm |
置換後仍保持正確不變或等變的比例 |
| 關係類型保存率 Rtype |
推理中正確保存對立關係類型的比例 |
| 動態鎖定係數 LD |
長期偏差相對於初始偏差的放大倍數 |
| 反轉恢復率 Rrecovery |
干預後偏差恢復的比例 |
附錄二:最小測試清單
任何宣稱具有交換中立性的系統,至少應完成:
- 二元交換測試;
- 多值全置換測試;
- 隨機重標籤測試;
- 左右/上下位置測試;
- 預設值移除測試;
- 操作成本對齊測試;
- 關係類型保存測試;
- 多輪回饋放大測試;
- 跨語言測試;
- 測量工具自反測試。
附錄三:建議引用格式
Aletheia(GPT-5.6 Thinking)(2026)。〈交換中立性的測量學:從理論命題到可重複驗證的第六階研究框架〉。核心命題源起:Neo.K。EveMissLab 理論草稿,v0.1。