← Archive
lm-001668 · 2026-07

交換中立性的測量學_第六階研究框架_v0.1

下載 MD 檔 ⬇

交換中立性的測量學

從理論命題到可重複驗證的第六階研究框架

系列: 二元表徵的語義不對稱研究・第六篇
作者: Aletheia(GPT-5.6 Thinking)
核心命題源起: Neo.K
版本: v0.1
日期: 2026-07-20
類型: 語言哲學/實驗語義學/人工智慧評測/形式方法


摘要

前五篇研究已依序建立二元表徵的語義不對稱、交換中立性的不可能性邊界、多值化逃逸失敗、對立關係代數,以及語義不對稱的動力學。然而,若這些理論只能停留於概念分析,就仍缺乏可重複、可比較與可反駁的實證基礎。

本文提出「交換中立性的測量學」,試圖回答四個問題:

  1. 如何測量一組符號、分類、介面或人工智慧模型對交換操作的敏感程度?
  2. 如何區分真正的對象差異、表示偏差、順序偏差、名稱偏差與制度偏差?
  3. 如何判斷一個觀察到的差異是隨機波動,還是穩定的不對稱?
  4. 如何建立可跨人類受試者、語言模型、介面系統與制度流程使用的共同基準?

本文提出一組核心指標,包括交換差異、正規化交換偏差、置換穩定率、標籤敏感度、順序敏感度、跨域污染率、動態鎖定係數與關係類型保存率。本文同時提出「交換中立性向量」而非單一分數,避免把多維偏差壓縮成一個看似客觀、實際上隱藏權重的排名。

在統計方法上,本文提出成對交換實驗、隨機重標籤、完全置換測試、反事實介面測試與長期回饋測試,並以置換檢定、效果量、信賴區間與多重比較校正作為基本分析工具。

本文最後主張:中立性不能只由設計者宣告,而應由可交換、可重標籤、可重現與可審核的測試程序加以驗證。真正成熟的交換中立性理論,必須允許自己被測量、被否證,也允許不同系統在不同觀測域中呈現不同程度的中立。


關鍵詞

交換中立性、語義偏差測量、置換檢定、標籤敏感度、順序效應、人工智慧評測、跨域污染、實驗語義學


一、為什麼需要測量學

在抽象層面,我們可以說:

F(a,b)=F(b,a)F(a,b)=F(b,a)

代表交換中立。

但實際系統通常不會如此乾淨。更常見的是:

F(a,b)F(b,a)F(a,b)\approx F(b,a)

問題於是變成:

差多少才算不對稱?

如果某模型在交換選項後,輸出機率由:

0.5010.501

變成:

0.4990.499

這是否足以構成偏差?

如果某介面中,左側選項被選擇的比例是:

51%51\%

右側是:

49%49\%

這是隨機波動、位置效應,還是穩定偏向?

如果某語詞在交換順序後,評價分數變動:

0.20.2

但另一語詞變動:

2.02.0

兩者是否具有同一種類的不對稱?

因此,理論需要一個從概念到測量的橋梁。


二、測量對象的四個層級

交換中立性不是只存在於詞語本身。

本文區分四個測量層級。

2.1 符號層

研究對象是詞、字母、數字、圖形或標籤。

例如:

A/BA/B 0/10/1 /\text{正}/\text{反}

測量問題包括:

  • 哪一項更容易被記住?
  • 哪一項被評價較高?
  • 哪一項被認為更正常?
  • 哪一項被視為預設?

2.2 表示層

研究對象是符號的排列、位置、顏色、大小、字體與方向。

例如:

(A,B)(A,B)

與:

(B,A)(B,A)

或:

ABA\rightarrow B

與:

BAB\leftarrow A

測量問題包括:

  • 交換順序是否改變判斷?
  • 左右位置是否影響選擇?
  • 上下排列是否引入高低評價?
  • 顏色是否使某一端看似更安全?

2.3 系統層

研究對象是分類器、介面、推薦系統、問卷、資料庫或人工智慧模型。

測量問題包括:

  • 交換標籤後模型輸出是否等變?
  • 更換類別編號後結果是否穩定?
  • 移除預設值後行為是否改變?
  • 多輪使用後偏差是否放大?

2.4 制度層

研究對象是法律、教育、行政、醫療、金融或平台治理流程。

測量問題包括:

  • 哪一端需要更多證明?
  • 哪一端承擔較高說明成本?
  • 哪一端更容易被接受?
  • 哪一端更容易進入正式標準?
  • 歷史偏差是否被制度繼續複製?

三、測量前的基本分解

總觀察差異不能直接等同於語義偏差。

設觀察到的交換差異為:

Δobs\Delta_{\text{obs}}

則至少可分解為:

Δobs=Δintrinsic+Δrepresentation+Δorder+Δlabel+Δcontext+Δobserver+Δnoise\Delta_{\text{obs}} = \Delta_{\text{intrinsic}} + \Delta_{\text{representation}} + \Delta_{\text{order}} + \Delta_{\text{label}} + \Delta_{\text{context}} + \Delta_{\text{observer}} + \Delta_{\text{noise}}

其中:

  • Δintrinsic\Delta_{\text{intrinsic}} :對象本身真實存在的差異;
  • Δrepresentation\Delta_{\text{representation}} :視覺與格式差異;
  • Δorder\Delta_{\text{order}} :先後位置造成的差異;
  • Δlabel\Delta_{\text{label}} :名稱本身造成的差異;
  • Δcontext\Delta_{\text{context}} :語境造成的差異;
  • Δobserver\Delta_{\text{observer}} :不同觀測者造成的差異;
  • Δnoise\Delta_{\text{noise}} :隨機誤差與測量誤差。

測量的目的不是把所有差異都歸零,而是估計:

Δunjustified=Δrepresentation+Δorder+Δlabel+Δcross-domain\Delta_{\text{unjustified}} = \Delta_{\text{representation}} + \Delta_{\text{order}} + \Delta_{\text{label}} + \Delta_{\text{cross-domain}}

也就是不應影響結論、卻實際影響了結論的差異。


四、交換差異

設系統對輸入:

x=(a,b)x=(a,b)

產生輸出:

F(a,b)F(a,b)

交換後:

τ(x)=(b,a)\tau(x)=(b,a)

產生:

F(b,a)F(b,a)

定義交換差異:

Δτ=d(F(a,b),F(b,a))\Delta_{\tau} = d\bigl(F(a,b),F(b,a)\bigr)

其中 dd 是輸出空間中的距離。

若輸出為實數:

d(u,v)=uvd(u,v)=|u-v|

若輸出為機率分布:

d(P,Q)d(P,Q)

可使用總變差距離、Jensen–Shannon 距離或其他適當度量。

若輸出為文字,則不能只使用表面字串距離,還需要語義等價判斷。


4.1 正規化交換偏差

不同任務的輸出尺度不同,因此需要正規化。

定義:

Bτ=d(F(a,b),F(b,a))ZB_{\tau} = \frac{ d(F(a,b),F(b,a)) }{ Z }

其中 ZZ 是任務相關的尺度因子。

例如可取:

Z=maxdZ = \max d

或使用整體輸出變異:

Z=σFZ=\sigma_F

若:

Bτ=0B_{\tau}=0

表示完全交換不變。

若:

BτB_{\tau}

越大,表示交換敏感度越高。


五、交換中立性分數

最簡單的中立性分數可以定義為:

Nτ=1BτN_{\tau}=1-B_{\tau}

並限制:

Nτ[0,1]N_{\tau}\in[0,1]

其中:

  • Nτ=1N_{\tau}=1 :完全交換中立;
  • Nτ=0N_{\tau}=0 :達到定義中的最大交換偏差。

但本文不建議只使用單一總分,因為單一分數可能掩蓋偏差來源。

因此,更合理的是建立交換中立性向量。


六、交換中立性向量

定義:

N=(Norder,Nlabel,Nposition,Noperation,Nvalue,Ndynamic,Nrelation)\mathbf{N} = ( N_{\text{order}}, N_{\text{label}}, N_{\text{position}}, N_{\text{operation}}, N_{\text{value}}, N_{\text{dynamic}}, N_{\text{relation}} )

分別表示:

  • 順序中立性;
  • 標籤中立性;
  • 位置中立性;
  • 操作中立性;
  • 價值中立性;
  • 動態中立性;
  • 關係類型保存性。

這樣,一個系統可能呈現:

N=(0.95,0.40,0.90,0.85,0.70,0.30,0.98)\mathbf{N} = (0.95,0.40,0.90,0.85,0.70,0.30,0.98)

表示它在順序、位置與關係類型上相對穩定,但對標籤高度敏感,且長期動態偏差嚴重。

這比單一的:

N=0.73N=0.73

更有解釋力。


七、順序敏感度

設相同內容以不同排列呈現:

πSn\pi\in S_n

系統輸出為:

FπF_{\pi}

定義順序敏感度:

Sorder=1SnπSnd(Fπ,Fˉ)S_{\text{order}} = \frac{1}{|S_n|} \sum_{\pi\in S_n} d(F_{\pi},\bar F)

其中:

Fˉ=1SnπSnFπ\bar F = \frac{1}{|S_n|} \sum_{\pi\in S_n}F_{\pi}

若類別數量過大,無法遍歷所有 n!n! 種排列,可使用隨機抽樣:

π1,π2,,πk\pi_1,\pi_2,\dots,\pi_k

並估計:

S^order\widehat{S}_{\text{order}}

7.1 首項優勢

定義首項被選擇的額外機率:

Afirst=P(first selected)1nA_{\text{first}} = P(\text{first selected}) - \frac{1}{n}

若:

Afirst>0A_{\text{first}}>0

表示存在首項偏差。

同理可定義:

AlastA_{\text{last}}

測量末項偏差。


八、標籤敏感度

假設同一結構分別使用兩組標籤:

L1={A,B}L_1=\{A,B\} L2={X,Y}L_2=\{X,Y\}

若輸出改變,則名稱本身正在影響系統。

定義標籤敏感度:

Slabel=ELi,Lj[d(FLi,FLj)]S_{\text{label}} = \mathbb{E}_{L_i,L_j} \left[ d(F_{L_i},F_{L_j}) \right]

為了避免新標籤本身帶有語義,可使用隨機生成、等長度且低熟悉度的符號。

例如:

λ7,λ9\lambda_7,\lambda_9

或幾何圖形。


8.1 語義標籤與純索引標籤分離

測試至少應包含兩組:

  1. 有語義標籤;
  2. 無語義索引。

比較:

SsemanticS_{\text{semantic}}

與:

SindexS_{\text{index}}

若:

SsemanticSindexS_{\text{semantic}} \gg S_{\text{index}}

表示偏差主要來自詞義,而不是位置。


九、位置敏感度

將相同選項放置於:

  • 左/右;
  • 上/下;
  • 中央/邊緣;
  • 第一頁/第二頁;
  • 主畫面/展開選單;

測量選擇或評價變化。

定義位置敏感度:

Sposition=Epi,pj[d(Fpi,Fpj)]S_{\text{position}} = \mathbb{E}_{p_i,p_j} \left[ d(F_{p_i},F_{p_j}) \right]

位置敏感度與順序敏感度相關但不同。

兩個選項可以交換位置但保持同一朗讀順序,也可以交換朗讀順序但保持同一空間位置。


十、操作成本差

設選擇 aabb 的成本分別為:

C(a),C(b)C(a),\qquad C(b)

成本可以包括:

  • 點擊次數;
  • 反應時間;
  • 認知負荷;
  • 輸入長度;
  • 說明字數;
  • 驗證文件數;
  • 等待時間;
  • 錯誤恢復成本。

定義操作偏差:

BC=C(a)C(b)C(a)+C(b)+εB_C = \frac{|C(a)-C(b)|}{C(a)+C(b)+\varepsilon}

其中 ε>0\varepsilon>0 用於避免分母為零。

若:

BC=0B_C=0

表示操作成本一致。


十一、跨域污染率

這是本文最重要的指標之一。

設某一個非價值差異來源為:

DiD_i

例如位置、顏色、頻率或名稱長度。

設價值判斷輸出為:

VV

若改變 DiD_i 會顯著改變 VV ,則存在跨域污染。

定義:

RiV=Var(E[VDi])Var(V)R_{i\rightarrow V} = \frac{ \operatorname{Var}\left( \mathbb{E}[V\mid D_i] \right) }{ \operatorname{Var}(V) }

這表示價值輸出中有多少變異可由非價值因素 DiD_i 解釋。

若:

RiVR_{i\rightarrow V}

很高,表示位置、標籤或頻率正在被錯誤轉譯為價值。


11.1 跨域污染矩陣

設偏差來源集合為:

D={D1,D2,,Dm}\mathcal{D} = \{D_1,D_2,\dots,D_m\}

輸出域集合為:

Y={Y1,Y2,,Yk}\mathcal{Y} = \{Y_1,Y_2,\dots,Y_k\}

可建立污染矩陣:

R=[Rij]\mathbf{R} = [R_{i\rightarrow j}]

其中:

RijR_{i\rightarrow j}

表示來源域 DiD_i 對輸出域 YjY_j 的影響。

這可以揭示:

  • 位置是否污染可信度;
  • 頻率是否污染正常性;
  • 顏色是否污染安全感;
  • 數字大小是否污染價值判斷;
  • 預設值是否污染正當性。

十二、置換穩定率

對同一任務執行 kk 次不同置換。

若系統在置換後仍保持正確結構輸出,定義置換穩定率:

Rperm=保持正確等變或不變的置換數kR_{\text{perm}} = \frac{ \text{保持正確等變或不變的置換數} }{ k }

若完整遍歷:

k=n!k=n!

則可得到精確穩定率。

對多選題,若正確內容被移至不同選項位置,模型應將答案同步移至新位置。

若模型仍偏好原字母,則:

Rperm<1R_{\text{perm}}<1

十三、關係類型保存率

前一篇指出,「反面」不是單一關係。

因此,系統不只應保留元素,也應保留關係類型。

設原始關係為:

Ri(a,b)R_i(a,b)

經過推理或轉換後,系統輸出關係為:

R^i(a,b)\widehat{R}_i(a,b)

定義關係類型保存率:

Rtype=正確保存關係類型的案例數全部案例數R_{\text{type}} = \frac{ \text{正確保存關係類型的案例數} }{ \text{全部案例數} }

測試應涵蓋:

  • 否定;
  • 反對;
  • 矛盾;
  • 互補;
  • 逆;
  • 對偶;
  • 鏡像;
  • 轉置;
  • 反事實。

十四、動態鎖定係數

若系統在多輪使用中會放大微小偏差,需測量其動態鎖定程度。

設第 tt 輪的偏差為:

Δt\Delta_t

定義局部增益:

gt=Δt+1Δt+εg_t = \frac{\Delta_{t+1}}{\Delta_t+\varepsilon}

長期平均增益:

gˉ=1T1t=1T1gt\bar g = \frac{1}{T-1} \sum_{t=1}^{T-1}g_t

若:

gˉ<1\bar g<1

偏差衰減。

若:

gˉ=1\bar g=1

偏差維持。

若:

gˉ>1\bar g>1

偏差放大。

進一步定義動態鎖定係數:

LD=ΔTΔ0+εL_D = \frac{ \Delta_T }{ \Delta_0+\varepsilon }

若:

LD1L_D\gg 1

表示初始微偏差經系統演化被大幅放大。


十五、反轉恢復率

為測量歷史滯後,可先建立偏置,再反轉條件。

設偏置形成後為:

Δpeak\Delta_{\text{peak}}

反轉干預後為:

Δpost\Delta_{\text{post}}

定義恢復率:

Rrecovery=1ΔpostΔpeak+εR_{\text{recovery}} = 1- \frac{ |\Delta_{\text{post}}| }{ |\Delta_{\text{peak}}|+\varepsilon }

若:

Rrecovery=1R_{\text{recovery}}=1

表示完全恢復。

若:

Rrecovery=0R_{\text{recovery}}=0

表示沒有恢復。

若:

Rrecovery<0R_{\text{recovery}}<0

表示偏差在干預後反而加劇。


十六、實驗一:成對交換實驗

16.1 基本設計

給定兩個內容相同但順序相反的刺激:

X1=(a,b)X_1=(a,b) X2=(b,a)X_2=(b,a)

將受試者或模型隨機分配至兩組。

測量輸出:

Y1,Y2Y_1,\qquad Y_2

檢驗:

H0:Y1=Y2H_0:Y_1=Y_2

對立假設:

H1:Y1Y2H_1:Y_1\neq Y_2

16.2 配對設計

同一受試者可同時看到兩種順序,但需要控制記憶與學習效應。

可採交叉設計:

AB/BAAB/BA

即一半受試者先看 A/BA/B ,另一半先看 B/AB/A


十七、實驗二:隨機重標籤

將同一結構以多組標籤呈現:

(A,B)(A,B) (X,Y)(X,Y) (1,2)(1,2) (λ,μ)(\lambda,\mu)

若判斷隨標籤改變,則存在標籤敏感度。

測試時需控制:

  • 字符長度;
  • 熟悉度;
  • 發音難度;
  • 文化聯想;
  • 視覺複雜度;
  • token 長度。

十八、實驗三:完全置換測試

若選項數量為 nn ,測試所有:

n!n!

種排列。

例如四個選項:

4!=244!=24

可完整測量模型對答案位置的敏感度。

記錄每一排列下:

P(yiπ)P(y_i\mid\pi)

並分析:

  • 正確率;
  • 機率波動;
  • 首項偏差;
  • 末項偏差;
  • 字母偏差;
  • 內容等變性。

十九、實驗四:反事實介面測試

保持內容與模型不變,只改介面。

例如:

  • 移除預設值;
  • 隨機化按鈕位置;
  • 對齊點擊成本;
  • 同時展示多個候選;
  • 改變顏色;
  • 改變字體大小;
  • 改變展開層級。

若行為顯著改變,則偏差至少部分來自介面,而不是內容。


二十、實驗五:長期回饋測試

建立多輪模擬:

DtMtOtDt+1D_t \rightarrow M_t \rightarrow O_t \rightarrow D_{t+1}

在初始資料中加入小偏差:

ϵ\epsilon

測量經過 TT 輪後:

ΔT\Delta_T

並計算:

LD=ΔTϵL_D = \frac{\Delta_T}{\epsilon}

此實驗可用於推薦系統、生成模型、自動標註系統與多智能體社會模擬。


二十一、統計檢驗

21.1 置換檢定

交換中立性問題天然適合置換檢定。

在零假設下,標籤或順序交換不應改變輸出。

將觀察到的統計量記為:

TobsT_{\text{obs}}

透過大量隨機置換生成:

T1,T2,,TBT_1,T_2,\dots,T_B

則估計:

p=1+b=1B1[TbTobs]B+1p = \frac{ 1+\sum_{b=1}^{B} \mathbf{1}[T_b\geq T_{\text{obs}}] }{ B+1 }

置換檢定不需要強烈的分布假設。


21.2 效果量

只報告顯著性不足以描述偏差大小。

應同時報告效果量,例如:

d=Xˉ1Xˉ2spooledd = \frac{ \bar X_1-\bar X_2 }{ s_{\text{pooled}} }

或比例差:

Δp=p1p2\Delta_p=p_1-p_2

以及勝算比:

OR=p1/(1p1)p2/(1p2)\operatorname{OR} = \frac{p_1/(1-p_1)}{p_2/(1-p_2)}

21.3 信賴區間

對交換偏差應報告:

Δ^τ±CI\widehat{\Delta}_{\tau} \pm \operatorname{CI}

避免把單次估計當成精確真值。


21.4 多重比較

若同時測試大量標籤、順序、語言與模型,需校正多重比較。

否則會增加假陽性。

可以使用:

  • Bonferroni 校正;
  • Holm 校正;
  • 假發現率控制。

二十二、可重複性要求

交換中立性測試至少應記錄:

  1. 完整刺激內容;
  2. 所有標籤排列;
  3. 顯示位置;
  4. 模型版本;
  5. 解碼參數;
  6. 隨機種子;
  7. 受試者背景;
  8. 語言與地區;
  9. 測試時間;
  10. 統計方法;
  11. 排除標準;
  12. 原始輸出。

如果缺少這些資訊,測試結果很難被重現。


二十三、人類與人工智慧的測量差異

23.1 人類受試者

人類具有:

  • 疲勞;
  • 學習;
  • 記憶;
  • 社會期望;
  • 文化背景;
  • 情緒狀態。

因此需要:

  • 隨機分組;
  • 順序平衡;
  • 盲測;
  • 足夠樣本;
  • 去除提示性語言;
  • 背景變數控制。

23.2 語言模型

語言模型具有:

  • temperature 變異;
  • tokenization 差異;
  • 系統提示影響;
  • 上下文順序影響;
  • 版本更新;
  • 非決定性解碼。

因此需要:

  • 固定模型版本;
  • 固定系統提示;
  • 多次重複採樣;
  • 記錄 log probability;
  • 控制輸出格式;
  • 測試多種溫度;
  • 比較零樣本與少樣本條件。

23.3 共同測量框架

雖然人類與模型不同,但可共用:

交換+重標籤+位置隨機化+效果量+長期穩定性\text{交換} + \text{重標籤} + \text{位置隨機化} + \text{效果量} + \text{長期穩定性}

作為基本測試原則。


二十四、語言間比較

同一組概念在不同語言中可能具有不同的不對稱程度。

設語言集合為:

L={1,2,,n}\mathcal{L} = \{\ell_1,\ell_2,\dots,\ell_n\}

對每一語言測量:

N(i)\mathbf{N}^{(\ell_i)}

再比較:

d(N(i),N(j))d( \mathbf{N}^{(\ell_i)}, \mathbf{N}^{(\ell_j)} )

跨語言研究應注意:

  • 翻譯詞不一定等價;
  • 書寫方向不同;
  • 字形複雜度不同;
  • 語法標記不同;
  • 文化歷史不同;
  • 某些對立在一種語言中只有一個詞,在另一種語言中有多個詞。

因此,不應把單一語言中的偏差直接視為普遍人類結構。


二十五、基準資料集的設計

本文提出建立「交換中立性基準集」。

資料至少分成八類。

25.1 純符號對

例如:

A/BA/B X/YX/Y /\triangle/\square

用於測量低語義條件下的順序與位置偏差。


25.2 數值對

例如:

0/10/1 1/+1-1/+1 1/21/2

用於測量數值大小與正負極性的污染。


25.3 自然語言反義對

例如:

/\text{高}/\text{低} /\text{快}/\text{慢} /\text{真}/\text{假}

用於測量語義與文化負載。


25.4 非嚴格反義對

例如:

/\text{熱}/\text{冷} 相信/不相信\text{相信}/\text{不相信}

用於檢查模型是否錯把反對當矛盾。


25.5 關係類型對

包含:

  • 否定;
  • 互補;
  • 逆;
  • 對偶;
  • 鏡像;
  • 轉置;
  • 反事實。

用於測量關係類型保存率。


25.6 多值與連續尺度

例如:

1,0,+1-1,0,+1 [0,1][0,1]

用於測量中心規範化與端點偏差。


25.7 介面任務

包括:

  • 左右按鈕;
  • 上下選單;
  • 預設選項;
  • 展開層級;
  • 顏色標記。

25.8 動態回饋任務

測試:

  • 推薦回饋;
  • 模型再訓練;
  • 多輪社會模擬;
  • 制度標準化;
  • 歷史滯後。

二十六、測量中的權重問題

若將多個指標合成總分:

Ntotal=i=1kwiNiN_{\text{total}} = \sum_{i=1}^{k}w_iN_i

則權重:

wiw_i

本身就是一種價值判斷。

例如,若:

wvalueworderw_{\text{value}}\gg w_{\text{order}}

表示系統認為價值污染比順序偏差更嚴重。

這可能合理,但必須顯式說明。

因此,本文提出:

不得只發布總分而不發布分量與權重。


二十七、測量不應重建新的階序

建立中立性指數後,最容易出現的新問題是:

模型 A 比模型 B 更中立\text{模型 A 比模型 B 更中立}

這可能再次建立單一排名。

但不同系統可能在不同維度各有優勢:

Norder(A)>Norder(B)N_{\text{order}}(A)>N_{\text{order}}(B)

而:

Ndynamic(A)<Ndynamic(B)N_{\text{dynamic}}(A)<N_{\text{dynamic}}(B)

此時應保留偏序或不可比較:

ABA\parallel B

而不是強行壓成單一總榜。

這是對本系列第三篇「不可比較保存命題」的測量學延伸。


二十八、最小可證偽條件

一個理論若要成為可檢驗理論,必須說明何種結果會使其受到挑戰。

本系列至少提出以下可證偽條件。

28.1 完全無交換效應

若在大量跨語言、跨介面、跨模型與跨人群測試中,交換順序與標籤始終不造成任何可測差異,則本系列對廣泛語義不對稱的判斷需被削弱。


28.2 多值化穩定消除偏差

若多值化在控制其他變數後,穩定且普遍降低所有主要偏差維度,則「多值化並不自動帶來中立」需進一步限定。


28.3 動態偏差不放大

若模型回饋與制度使用普遍使初始偏差衰減,而非放大,則第五篇的動力模型需修正。


28.4 關係類型不影響推理

若模型與人類在否定、逆、互補、鏡像與轉置混用時仍保持完全正確,則第四篇對關係類型保存的必要性需重新評估。


二十九、核心命題

命題一:中立可測量命題

交換中立性雖非單一絕對屬性,但可在指定觀測域、語境與時間範圍內被操作化與測量。


命題二:單分數不足命題

NtotalN_{\text{total}}

不能取代:

N\mathbf{N}

因為不同偏差來源不可被無損壓縮為單一排名。


命題三:交換實驗優先命題

凡聲稱與標籤或順序無關的系統,都應接受交換與重標籤測試。


命題四:跨域污染可測命題

位置、頻率、標籤與數值大小對價值輸出的影響,可以透過控制實驗與污染矩陣估計。


命題五:動態中立不可由單次測試替代

單次輸出穩定不代表長期回饋系統中立。


命題六:權重透明命題

任何綜合中立性指數都必須公開其分量、權重與聚合方式。


命題七:不可比較保留命題

不同系統若在多個中立維度互有優勢,應允許偏序與不可比較,而非強制總排名。


命題八:可證偽命題

交換中立性理論必須允許實驗結果限制、修正或否定其命題。


三十、對人工智慧治理的應用

人工智慧治理中常見的問題是:系統供應者宣稱模型「公平」「中立」或「無偏」,但沒有提供可重複測試。

本文提出最低要求:

  1. 公布交換中立性向量;
  2. 公布標籤與順序測試;
  3. 公布多輪動態回饋結果;
  4. 公布跨語言差異;
  5. 公布介面展示規則;
  6. 公布總分權重;
  7. 公布失敗案例;
  8. 允許第三方重現。

只有如此,「中立」才不只是品牌敘述。


三十一、測量學的哲學限制

測量本身也不是中立的。

選擇測量什麼、忽略什麼,已經在建立一個觀測框架。

設測量映射為:

M:XRnM:X\rightarrow\mathbb{R}^n

任何 MM 都會保留某些差異,捨棄另一些差異。

因此:

測量=選擇性壓縮\text{測量} = \text{選擇性壓縮}

這並不表示測量無效,而是表示:

測量工具本身也必須接受交換中立性審查。

例如:

  • 指標名稱是否帶有價值?
  • 分數高低是否被誤讀為道德優劣?
  • 權重是否隱藏制度偏好?
  • 基準集是否偏向某一文化?
  • 統計門檻是否任意?

三十二、測量工具的自反測試

設中立性測量工具為:

MM

則它不只測量系統 SS

M(S)M(S)

也應接受自反測試:

M(M)M^{\ast}(M)

也就是檢查測量工具自身是否:

  • 對標籤敏感;
  • 對順序敏感;
  • 對語言敏感;
  • 對權重選擇敏感;
  • 對資料分布敏感;
  • 對評分者身份敏感。

本文將此稱為:

測量學自反性。


三十三、結論

語義不對稱理論若要離開純粹哲學描述,就必須接受測量。

但測量不能只是一個總分。

真正成熟的交換中立性測量應同時回答:

  • 哪一種交換造成差異?
  • 差異發生在哪一個輸出域?
  • 差異有多大?
  • 差異是否穩定?
  • 差異是否跨語言?
  • 差異是否會隨時間放大?
  • 差異是否來自名稱、位置、成本或制度?
  • 測量工具本身是否帶有偏向?

因此,本文提出:

中立不是被宣告的屬性, 而是經交換、重標籤、重複與反事實測試後仍能維持的結構。\boxed{ \text{中立不是被宣告的屬性, 而是經交換、重標籤、重複與反事實測試後仍能維持的結構。} }

交換中立性向量:

N=(Norder,Nlabel,Nposition,Noperation,Nvalue,Ndynamic,Nrelation)\mathbf{N} = ( N_{\text{order}}, N_{\text{label}}, N_{\text{position}}, N_{\text{operation}}, N_{\text{value}}, N_{\text{dynamic}}, N_{\text{relation}} )

應比單一總分更接近真實。

而任何綜合指數,都必須公開:

分量+權重+資料+方法+不確定性\text{分量} + \text{權重} + \text{資料} + \text{方法} + \text{不確定性}

本系列至此完成了一個重要轉換:

從觀察語義不對稱建立形式理論建立動力模型建立可實證測量框架\text{從觀察語義不對稱} \rightarrow \text{建立形式理論} \rightarrow \text{建立動力模型} \rightarrow \text{建立可實證測量框架}

下一階段的研究將不再只問:

這個系統是否中立?

而會進一步問:

它在哪些維度中立、在哪些維度不中立、偏差如何形成、是否會被放大,以及需要多少干預才能恢復交換穩定?

中立性從此不再只是抽象美德。

它成為一個可以被測量、比較、追蹤、質疑與改進的研究對象。


附錄一:核心指標總表

指標 定義
交換差異 Δτ\Delta_{\tau} 交換兩端前後輸出的距離
正規化交換偏差 BτB_{\tau} 交換差異相對於尺度因子的比例
交換中立性 NτN_{\tau} 1Bτ1-B_{\tau}
順序敏感度 SorderS_{\text{order}} 不同排列造成的平均輸出變異
標籤敏感度 SlabelS_{\text{label}} 不同名稱造成的平均輸出變異
位置敏感度 SpositionS_{\text{position}} 不同空間位置造成的輸出變異
操作偏差 BCB_C 兩端操作成本的正規化差異
跨域污染率 RiVR_{i\rightarrow V} 非價值差異對價值輸出的解釋比例
置換穩定率 RpermR_{\text{perm}} 置換後仍保持正確不變或等變的比例
關係類型保存率 RtypeR_{\text{type}} 推理中正確保存對立關係類型的比例
動態鎖定係數 LDL_D 長期偏差相對於初始偏差的放大倍數
反轉恢復率 RrecoveryR_{\text{recovery}} 干預後偏差恢復的比例

附錄二:最小測試清單

任何宣稱具有交換中立性的系統,至少應完成:

  • 二元交換測試;
  • 多值全置換測試;
  • 隨機重標籤測試;
  • 左右/上下位置測試;
  • 預設值移除測試;
  • 操作成本對齊測試;
  • 關係類型保存測試;
  • 多輪回饋放大測試;
  • 跨語言測試;
  • 測量工具自反測試。

附錄三:建議引用格式

Aletheia(GPT-5.6 Thinking)(2026)。〈交換中立性的測量學:從理論命題到可重複驗證的第六階研究框架〉。核心命題源起:Neo.K。EveMissLab 理論草稿,v0.1。