# 交換中立性的測量學  
## 從理論命題到可重複驗證的第六階研究框架

**系列：** 二元表徵的語義不對稱研究・第六篇  
**作者：** Aletheia（GPT-5.6 Thinking）  
**核心命題源起：** Neo.K  
**版本：** v0.1  
**日期：** 2026-07-20  
**類型：** 語言哲學／實驗語義學／人工智慧評測／形式方法  

---

## 摘要

前五篇研究已依序建立二元表徵的語義不對稱、交換中立性的不可能性邊界、多值化逃逸失敗、對立關係代數，以及語義不對稱的動力學。然而，若這些理論只能停留於概念分析，就仍缺乏可重複、可比較與可反駁的實證基礎。

本文提出「交換中立性的測量學」，試圖回答四個問題：

1. 如何測量一組符號、分類、介面或人工智慧模型對交換操作的敏感程度？
2. 如何區分真正的對象差異、表示偏差、順序偏差、名稱偏差與制度偏差？
3. 如何判斷一個觀察到的差異是隨機波動，還是穩定的不對稱？
4. 如何建立可跨人類受試者、語言模型、介面系統與制度流程使用的共同基準？

本文提出一組核心指標，包括交換差異、正規化交換偏差、置換穩定率、標籤敏感度、順序敏感度、跨域污染率、動態鎖定係數與關係類型保存率。本文同時提出「交換中立性向量」而非單一分數，避免把多維偏差壓縮成一個看似客觀、實際上隱藏權重的排名。

在統計方法上，本文提出成對交換實驗、隨機重標籤、完全置換測試、反事實介面測試與長期回饋測試，並以置換檢定、效果量、信賴區間與多重比較校正作為基本分析工具。

本文最後主張：中立性不能只由設計者宣告，而應由可交換、可重標籤、可重現與可審核的測試程序加以驗證。真正成熟的交換中立性理論，必須允許自己被測量、被否證，也允許不同系統在不同觀測域中呈現不同程度的中立。

---

## 關鍵詞

交換中立性、語義偏差測量、置換檢定、標籤敏感度、順序效應、人工智慧評測、跨域污染、實驗語義學

---

# 一、為什麼需要測量學

在抽象層面，我們可以說：

$$
F(a,b)=F(b,a)
$$

代表交換中立。

但實際系統通常不會如此乾淨。更常見的是：

$$
F(a,b)\approx F(b,a)
$$

問題於是變成：

> 差多少才算不對稱？

如果某模型在交換選項後，輸出機率由：

$$
0.501
$$

變成：

$$
0.499
$$

這是否足以構成偏差？

如果某介面中，左側選項被選擇的比例是：

$$
51\%
$$

右側是：

$$
49\%
$$

這是隨機波動、位置效應，還是穩定偏向？

如果某語詞在交換順序後，評價分數變動：

$$
0.2
$$

但另一語詞變動：

$$
2.0
$$

兩者是否具有同一種類的不對稱？

因此，理論需要一個從概念到測量的橋梁。

---

# 二、測量對象的四個層級

交換中立性不是只存在於詞語本身。

本文區分四個測量層級。

## 2.1 符號層

研究對象是詞、字母、數字、圖形或標籤。

例如：

$$
A/B
$$

$$
0/1
$$

$$
\text{正}/\text{反}
$$

測量問題包括：

- 哪一項更容易被記住？
- 哪一項被評價較高？
- 哪一項被認為更正常？
- 哪一項被視為預設？

---

## 2.2 表示層

研究對象是符號的排列、位置、顏色、大小、字體與方向。

例如：

$$
(A,B)
$$

與：

$$
(B,A)
$$

或：

$$
A\rightarrow B
$$

與：

$$
B\leftarrow A
$$

測量問題包括：

- 交換順序是否改變判斷？
- 左右位置是否影響選擇？
- 上下排列是否引入高低評價？
- 顏色是否使某一端看似更安全？

---

## 2.3 系統層

研究對象是分類器、介面、推薦系統、問卷、資料庫或人工智慧模型。

測量問題包括：

- 交換標籤後模型輸出是否等變？
- 更換類別編號後結果是否穩定？
- 移除預設值後行為是否改變？
- 多輪使用後偏差是否放大？

---

## 2.4 制度層

研究對象是法律、教育、行政、醫療、金融或平台治理流程。

測量問題包括：

- 哪一端需要更多證明？
- 哪一端承擔較高說明成本？
- 哪一端更容易被接受？
- 哪一端更容易進入正式標準？
- 歷史偏差是否被制度繼續複製？

---

# 三、測量前的基本分解

總觀察差異不能直接等同於語義偏差。

設觀察到的交換差異為：

$$
\Delta_{\text{obs}}
$$

則至少可分解為：

$$
\Delta_{\text{obs}}
=
\Delta_{\text{intrinsic}}
+
\Delta_{\text{representation}}
+
\Delta_{\text{order}}
+
\Delta_{\text{label}}
+
\Delta_{\text{context}}
+
\Delta_{\text{observer}}
+
\Delta_{\text{noise}}
$$

其中：

- $\Delta_{\text{intrinsic}}$ ：對象本身真實存在的差異；
- $\Delta_{\text{representation}}$ ：視覺與格式差異；
- $\Delta_{\text{order}}$ ：先後位置造成的差異；
- $\Delta_{\text{label}}$ ：名稱本身造成的差異；
- $\Delta_{\text{context}}$ ：語境造成的差異；
- $\Delta_{\text{observer}}$ ：不同觀測者造成的差異；
- $\Delta_{\text{noise}}$ ：隨機誤差與測量誤差。

測量的目的不是把所有差異都歸零，而是估計：

$$
\Delta_{\text{unjustified}}
=
\Delta_{\text{representation}}
+
\Delta_{\text{order}}
+
\Delta_{\text{label}}
+
\Delta_{\text{cross-domain}}
$$

也就是不應影響結論、卻實際影響了結論的差異。

---

# 四、交換差異

設系統對輸入：

$$
x=(a,b)
$$

產生輸出：

$$
F(a,b)
$$

交換後：

$$
\tau(x)=(b,a)
$$

產生：

$$
F(b,a)
$$

定義交換差異：

$$
\Delta_{\tau}
=
d\bigl(F(a,b),F(b,a)\bigr)
$$

其中 $d$ 是輸出空間中的距離。

若輸出為實數：

$$
d(u,v)=|u-v|
$$

若輸出為機率分布：

$$
d(P,Q)
$$

可使用總變差距離、Jensen–Shannon 距離或其他適當度量。

若輸出為文字，則不能只使用表面字串距離，還需要語義等價判斷。

---

## 4.1 正規化交換偏差

不同任務的輸出尺度不同，因此需要正規化。

定義：

$$
B_{\tau}
=
\frac{
d(F(a,b),F(b,a))
}{
Z
}
$$

其中 $Z$ 是任務相關的尺度因子。

例如可取：

$$
Z
=
\max d
$$

或使用整體輸出變異：

$$
Z=\sigma_F
$$

若：

$$
B_{\tau}=0
$$

表示完全交換不變。

若：

$$
B_{\tau}
$$

越大，表示交換敏感度越高。

---

# 五、交換中立性分數

最簡單的中立性分數可以定義為：

$$
N_{\tau}=1-B_{\tau}
$$

並限制：

$$
N_{\tau}\in[0,1]
$$

其中：

- $N_{\tau}=1$ ：完全交換中立；
- $N_{\tau}=0$ ：達到定義中的最大交換偏差。

但本文不建議只使用單一總分，因為單一分數可能掩蓋偏差來源。

因此，更合理的是建立交換中立性向量。

---

# 六、交換中立性向量

定義：

$$
\mathbf{N}
=
(
N_{\text{order}},
N_{\text{label}},
N_{\text{position}},
N_{\text{operation}},
N_{\text{value}},
N_{\text{dynamic}},
N_{\text{relation}}
)
$$

分別表示：

- 順序中立性；
- 標籤中立性；
- 位置中立性；
- 操作中立性；
- 價值中立性；
- 動態中立性；
- 關係類型保存性。

這樣，一個系統可能呈現：

$$
\mathbf{N}
=
(0.95,0.40,0.90,0.85,0.70,0.30,0.98)
$$

表示它在順序、位置與關係類型上相對穩定，但對標籤高度敏感，且長期動態偏差嚴重。

這比單一的：

$$
N=0.73
$$

更有解釋力。

---

# 七、順序敏感度

設相同內容以不同排列呈現：

$$
\pi\in S_n
$$

系統輸出為：

$$
F_{\pi}
$$

定義順序敏感度：

$$
S_{\text{order}}
=
\frac{1}{|S_n|}
\sum_{\pi\in S_n}
d(F_{\pi},\bar F)
$$

其中：

$$
\bar F
=
\frac{1}{|S_n|}
\sum_{\pi\in S_n}F_{\pi}
$$

若類別數量過大，無法遍歷所有 $n!$ 種排列，可使用隨機抽樣：

$$
\pi_1,\pi_2,\dots,\pi_k
$$

並估計：

$$
\widehat{S}_{\text{order}}
$$

---

## 7.1 首項優勢

定義首項被選擇的額外機率：

$$
A_{\text{first}}
=
P(\text{first selected})
-
\frac{1}{n}
$$

若：

$$
A_{\text{first}}>0
$$

表示存在首項偏差。

同理可定義：

$$
A_{\text{last}}
$$

測量末項偏差。

---

# 八、標籤敏感度

假設同一結構分別使用兩組標籤：

$$
L_1=\{A,B\}
$$

$$
L_2=\{X,Y\}
$$

若輸出改變，則名稱本身正在影響系統。

定義標籤敏感度：

$$
S_{\text{label}}
=
\mathbb{E}_{L_i,L_j}
\left[
d(F_{L_i},F_{L_j})
\right]
$$

為了避免新標籤本身帶有語義，可使用隨機生成、等長度且低熟悉度的符號。

例如：

$$
\lambda_7,\lambda_9
$$

或幾何圖形。

---

## 8.1 語義標籤與純索引標籤分離

測試至少應包含兩組：

1. 有語義標籤；
2. 無語義索引。

比較：

$$
S_{\text{semantic}}
$$

與：

$$
S_{\text{index}}
$$

若：

$$
S_{\text{semantic}}
\gg
S_{\text{index}}
$$

表示偏差主要來自詞義，而不是位置。

---

# 九、位置敏感度

將相同選項放置於：

- 左／右；
- 上／下；
- 中央／邊緣；
- 第一頁／第二頁；
- 主畫面／展開選單；

測量選擇或評價變化。

定義位置敏感度：

$$
S_{\text{position}}
=
\mathbb{E}_{p_i,p_j}
\left[
d(F_{p_i},F_{p_j})
\right]
$$

位置敏感度與順序敏感度相關但不同。

兩個選項可以交換位置但保持同一朗讀順序，也可以交換朗讀順序但保持同一空間位置。

---

# 十、操作成本差

設選擇 $a$ 與 $b$ 的成本分別為：

$$
C(a),\qquad C(b)
$$

成本可以包括：

- 點擊次數；
- 反應時間；
- 認知負荷；
- 輸入長度；
- 說明字數；
- 驗證文件數；
- 等待時間；
- 錯誤恢復成本。

定義操作偏差：

$$
B_C
=
\frac{|C(a)-C(b)|}{C(a)+C(b)+\varepsilon}
$$

其中 $\varepsilon>0$ 用於避免分母為零。

若：

$$
B_C=0
$$

表示操作成本一致。

---

# 十一、跨域污染率

這是本文最重要的指標之一。

設某一個非價值差異來源為：

$$
D_i
$$

例如位置、顏色、頻率或名稱長度。

設價值判斷輸出為：

$$
V
$$

若改變 $D_i$ 會顯著改變 $V$ ，則存在跨域污染。

定義：

$$
R_{i\rightarrow V}
=
\frac{
\operatorname{Var}\left(
\mathbb{E}[V\mid D_i]
\right)
}{
\operatorname{Var}(V)
}
$$

這表示價值輸出中有多少變異可由非價值因素 $D_i$ 解釋。

若：

$$
R_{i\rightarrow V}
$$

很高，表示位置、標籤或頻率正在被錯誤轉譯為價值。

---

## 11.1 跨域污染矩陣

設偏差來源集合為：

$$
\mathcal{D}
=
\{D_1,D_2,\dots,D_m\}
$$

輸出域集合為：

$$
\mathcal{Y}
=
\{Y_1,Y_2,\dots,Y_k\}
$$

可建立污染矩陣：

$$
\mathbf{R}
=
[R_{i\rightarrow j}]
$$

其中：

$$
R_{i\rightarrow j}
$$

表示來源域 $D_i$ 對輸出域 $Y_j$ 的影響。

這可以揭示：

- 位置是否污染可信度；
- 頻率是否污染正常性；
- 顏色是否污染安全感；
- 數字大小是否污染價值判斷；
- 預設值是否污染正當性。

---

# 十二、置換穩定率

對同一任務執行 $k$ 次不同置換。

若系統在置換後仍保持正確結構輸出，定義置換穩定率：

$$
R_{\text{perm}}
=
\frac{
\text{保持正確等變或不變的置換數}
}{
k
}
$$

若完整遍歷：

$$
k=n!
$$

則可得到精確穩定率。

對多選題，若正確內容被移至不同選項位置，模型應將答案同步移至新位置。

若模型仍偏好原字母，則：

$$
R_{\text{perm}}<1
$$

---

# 十三、關係類型保存率

前一篇指出，「反面」不是單一關係。

因此，系統不只應保留元素，也應保留關係類型。

設原始關係為：

$$
R_i(a,b)
$$

經過推理或轉換後，系統輸出關係為：

$$
\widehat{R}_i(a,b)
$$

定義關係類型保存率：

$$
R_{\text{type}}
=
\frac{
\text{正確保存關係類型的案例數}
}{
\text{全部案例數}
}
$$

測試應涵蓋：

- 否定；
- 反對；
- 矛盾；
- 互補；
- 逆；
- 對偶；
- 鏡像；
- 轉置；
- 反事實。

---

# 十四、動態鎖定係數

若系統在多輪使用中會放大微小偏差，需測量其動態鎖定程度。

設第 $t$ 輪的偏差為：

$$
\Delta_t
$$

定義局部增益：

$$
g_t
=
\frac{\Delta_{t+1}}{\Delta_t+\varepsilon}
$$

長期平均增益：

$$
\bar g
=
\frac{1}{T-1}
\sum_{t=1}^{T-1}g_t
$$

若：

$$
\bar g<1
$$

偏差衰減。

若：

$$
\bar g=1
$$

偏差維持。

若：

$$
\bar g>1
$$

偏差放大。

進一步定義動態鎖定係數：

$$
L_D
=
\frac{
\Delta_T
}{
\Delta_0+\varepsilon
}
$$

若：

$$
L_D\gg 1
$$

表示初始微偏差經系統演化被大幅放大。

---

# 十五、反轉恢復率

為測量歷史滯後，可先建立偏置，再反轉條件。

設偏置形成後為：

$$
\Delta_{\text{peak}}
$$

反轉干預後為：

$$
\Delta_{\text{post}}
$$

定義恢復率：

$$
R_{\text{recovery}}
=
1-
\frac{
|\Delta_{\text{post}}|
}{
|\Delta_{\text{peak}}|+\varepsilon
}
$$

若：

$$
R_{\text{recovery}}=1
$$

表示完全恢復。

若：

$$
R_{\text{recovery}}=0
$$

表示沒有恢復。

若：

$$
R_{\text{recovery}}<0
$$

表示偏差在干預後反而加劇。

---

# 十六、實驗一：成對交換實驗

## 16.1 基本設計

給定兩個內容相同但順序相反的刺激：

$$
X_1=(a,b)
$$

$$
X_2=(b,a)
$$

將受試者或模型隨機分配至兩組。

測量輸出：

$$
Y_1,\qquad Y_2
$$

檢驗：

$$
H_0:Y_1=Y_2
$$

對立假設：

$$
H_1:Y_1\neq Y_2
$$

---

## 16.2 配對設計

同一受試者可同時看到兩種順序，但需要控制記憶與學習效應。

可採交叉設計：

$$
AB/BA
$$

即一半受試者先看 $A/B$ ，另一半先看 $B/A$ 。

---

# 十七、實驗二：隨機重標籤

將同一結構以多組標籤呈現：

$$
(A,B)
$$

$$
(X,Y)
$$

$$
(1,2)
$$

$$
(\lambda,\mu)
$$

若判斷隨標籤改變，則存在標籤敏感度。

測試時需控制：

- 字符長度；
- 熟悉度；
- 發音難度；
- 文化聯想；
- 視覺複雜度；
- token 長度。

---

# 十八、實驗三：完全置換測試

若選項數量為 $n$ ，測試所有：

$$
n!
$$

種排列。

例如四個選項：

$$
4!=24
$$

可完整測量模型對答案位置的敏感度。

記錄每一排列下：

$$
P(y_i\mid\pi)
$$

並分析：

- 正確率；
- 機率波動；
- 首項偏差；
- 末項偏差；
- 字母偏差；
- 內容等變性。

---

# 十九、實驗四：反事實介面測試

保持內容與模型不變，只改介面。

例如：

- 移除預設值；
- 隨機化按鈕位置；
- 對齊點擊成本；
- 同時展示多個候選；
- 改變顏色；
- 改變字體大小；
- 改變展開層級。

若行為顯著改變，則偏差至少部分來自介面，而不是內容。

---

# 二十、實驗五：長期回饋測試

建立多輪模擬：

$$
D_t
\rightarrow
M_t
\rightarrow
O_t
\rightarrow
D_{t+1}
$$

在初始資料中加入小偏差：

$$
\epsilon
$$

測量經過 $T$ 輪後：

$$
\Delta_T
$$

並計算：

$$
L_D
=
\frac{\Delta_T}{\epsilon}
$$

此實驗可用於推薦系統、生成模型、自動標註系統與多智能體社會模擬。

---

# 二十一、統計檢驗

## 21.1 置換檢定

交換中立性問題天然適合置換檢定。

在零假設下，標籤或順序交換不應改變輸出。

將觀察到的統計量記為：

$$
T_{\text{obs}}
$$

透過大量隨機置換生成：

$$
T_1,T_2,\dots,T_B
$$

則估計：

$$
p
=
\frac{
1+\sum_{b=1}^{B}
\mathbf{1}[T_b\geq T_{\text{obs}}]
}{
B+1
}
$$

置換檢定不需要強烈的分布假設。

---

## 21.2 效果量

只報告顯著性不足以描述偏差大小。

應同時報告效果量，例如：

$$
d
=
\frac{
\bar X_1-\bar X_2
}{
s_{\text{pooled}}
}
$$

或比例差：

$$
\Delta_p=p_1-p_2
$$

以及勝算比：

$$
\operatorname{OR}
=
\frac{p_1/(1-p_1)}{p_2/(1-p_2)}
$$

---

## 21.3 信賴區間

對交換偏差應報告：

$$
\widehat{\Delta}_{\tau}
\pm
\operatorname{CI}
$$

避免把單次估計當成精確真值。

---

## 21.4 多重比較

若同時測試大量標籤、順序、語言與模型，需校正多重比較。

否則會增加假陽性。

可以使用：

- Bonferroni 校正；
- Holm 校正；
- 假發現率控制。

---

# 二十二、可重複性要求

交換中立性測試至少應記錄：

1. 完整刺激內容；
2. 所有標籤排列；
3. 顯示位置；
4. 模型版本；
5. 解碼參數；
6. 隨機種子；
7. 受試者背景；
8. 語言與地區；
9. 測試時間；
10. 統計方法；
11. 排除標準；
12. 原始輸出。

如果缺少這些資訊，測試結果很難被重現。

---

# 二十三、人類與人工智慧的測量差異

## 23.1 人類受試者

人類具有：

- 疲勞；
- 學習；
- 記憶；
- 社會期望；
- 文化背景；
- 情緒狀態。

因此需要：

- 隨機分組；
- 順序平衡；
- 盲測；
- 足夠樣本；
- 去除提示性語言；
- 背景變數控制。

---

## 23.2 語言模型

語言模型具有：

- temperature 變異；
- tokenization 差異；
- 系統提示影響；
- 上下文順序影響；
- 版本更新；
- 非決定性解碼。

因此需要：

- 固定模型版本；
- 固定系統提示；
- 多次重複採樣；
- 記錄 log probability；
- 控制輸出格式；
- 測試多種溫度；
- 比較零樣本與少樣本條件。

---

## 23.3 共同測量框架

雖然人類與模型不同，但可共用：

$$
\text{交換}
+
\text{重標籤}
+
\text{位置隨機化}
+
\text{效果量}
+
\text{長期穩定性}
$$

作為基本測試原則。

---

# 二十四、語言間比較

同一組概念在不同語言中可能具有不同的不對稱程度。

設語言集合為：

$$
\mathcal{L}
=
\{\ell_1,\ell_2,\dots,\ell_n\}
$$

對每一語言測量：

$$
\mathbf{N}^{(\ell_i)}
$$

再比較：

$$
d(
\mathbf{N}^{(\ell_i)},
\mathbf{N}^{(\ell_j)}
)
$$

跨語言研究應注意：

- 翻譯詞不一定等價；
- 書寫方向不同；
- 字形複雜度不同；
- 語法標記不同；
- 文化歷史不同；
- 某些對立在一種語言中只有一個詞，在另一種語言中有多個詞。

因此，不應把單一語言中的偏差直接視為普遍人類結構。

---

# 二十五、基準資料集的設計

本文提出建立「交換中立性基準集」。

資料至少分成八類。

## 25.1 純符號對

例如：

$$
A/B
$$

$$
X/Y
$$

$$
\triangle/\square
$$

用於測量低語義條件下的順序與位置偏差。

---

## 25.2 數值對

例如：

$$
0/1
$$

$$
-1/+1
$$

$$
1/2
$$

用於測量數值大小與正負極性的污染。

---

## 25.3 自然語言反義對

例如：

$$
\text{高}/\text{低}
$$

$$
\text{快}/\text{慢}
$$

$$
\text{真}/\text{假}
$$

用於測量語義與文化負載。

---

## 25.4 非嚴格反義對

例如：

$$
\text{熱}/\text{冷}
$$

$$
\text{相信}/\text{不相信}
$$

用於檢查模型是否錯把反對當矛盾。

---

## 25.5 關係類型對

包含：

- 否定；
- 互補；
- 逆；
- 對偶；
- 鏡像；
- 轉置；
- 反事實。

用於測量關係類型保存率。

---

## 25.6 多值與連續尺度

例如：

$$
-1,0,+1
$$

$$
[0,1]
$$

用於測量中心規範化與端點偏差。

---

## 25.7 介面任務

包括：

- 左右按鈕；
- 上下選單；
- 預設選項；
- 展開層級；
- 顏色標記。

---

## 25.8 動態回饋任務

測試：

- 推薦回饋；
- 模型再訓練；
- 多輪社會模擬；
- 制度標準化；
- 歷史滯後。

---

# 二十六、測量中的權重問題

若將多個指標合成總分：

$$
N_{\text{total}}
=
\sum_{i=1}^{k}w_iN_i
$$

則權重：

$$
w_i
$$

本身就是一種價值判斷。

例如，若：

$$
w_{\text{value}}\gg w_{\text{order}}
$$

表示系統認為價值污染比順序偏差更嚴重。

這可能合理，但必須顯式說明。

因此，本文提出：

> 不得只發布總分而不發布分量與權重。

---

# 二十七、測量不應重建新的階序

建立中立性指數後，最容易出現的新問題是：

$$
\text{模型 A 比模型 B 更中立}
$$

這可能再次建立單一排名。

但不同系統可能在不同維度各有優勢：

$$
N_{\text{order}}(A)>N_{\text{order}}(B)
$$

而：

$$
N_{\text{dynamic}}(A)<N_{\text{dynamic}}(B)
$$

此時應保留偏序或不可比較：

$$
A\parallel B
$$

而不是強行壓成單一總榜。

這是對本系列第三篇「不可比較保存命題」的測量學延伸。

---

# 二十八、最小可證偽條件

一個理論若要成為可檢驗理論，必須說明何種結果會使其受到挑戰。

本系列至少提出以下可證偽條件。

## 28.1 完全無交換效應

若在大量跨語言、跨介面、跨模型與跨人群測試中，交換順序與標籤始終不造成任何可測差異，則本系列對廣泛語義不對稱的判斷需被削弱。

---

## 28.2 多值化穩定消除偏差

若多值化在控制其他變數後，穩定且普遍降低所有主要偏差維度，則「多值化並不自動帶來中立」需進一步限定。

---

## 28.3 動態偏差不放大

若模型回饋與制度使用普遍使初始偏差衰減，而非放大，則第五篇的動力模型需修正。

---

## 28.4 關係類型不影響推理

若模型與人類在否定、逆、互補、鏡像與轉置混用時仍保持完全正確，則第四篇對關係類型保存的必要性需重新評估。

---

# 二十九、核心命題

## 命題一：中立可測量命題

交換中立性雖非單一絕對屬性，但可在指定觀測域、語境與時間範圍內被操作化與測量。

---

## 命題二：單分數不足命題

$$
N_{\text{total}}
$$

不能取代：

$$
\mathbf{N}
$$

因為不同偏差來源不可被無損壓縮為單一排名。

---

## 命題三：交換實驗優先命題

凡聲稱與標籤或順序無關的系統，都應接受交換與重標籤測試。

---

## 命題四：跨域污染可測命題

位置、頻率、標籤與數值大小對價值輸出的影響，可以透過控制實驗與污染矩陣估計。

---

## 命題五：動態中立不可由單次測試替代

單次輸出穩定不代表長期回饋系統中立。

---

## 命題六：權重透明命題

任何綜合中立性指數都必須公開其分量、權重與聚合方式。

---

## 命題七：不可比較保留命題

不同系統若在多個中立維度互有優勢，應允許偏序與不可比較，而非強制總排名。

---

## 命題八：可證偽命題

交換中立性理論必須允許實驗結果限制、修正或否定其命題。

---

# 三十、對人工智慧治理的應用

人工智慧治理中常見的問題是：系統供應者宣稱模型「公平」「中立」或「無偏」，但沒有提供可重複測試。

本文提出最低要求：

1. 公布交換中立性向量；
2. 公布標籤與順序測試；
3. 公布多輪動態回饋結果；
4. 公布跨語言差異；
5. 公布介面展示規則；
6. 公布總分權重；
7. 公布失敗案例；
8. 允許第三方重現。

只有如此，「中立」才不只是品牌敘述。

---

# 三十一、測量學的哲學限制

測量本身也不是中立的。

選擇測量什麼、忽略什麼，已經在建立一個觀測框架。

設測量映射為：

$$
M:X\rightarrow\mathbb{R}^n
$$

任何 $M$ 都會保留某些差異，捨棄另一些差異。

因此：

$$
\text{測量}
=
\text{選擇性壓縮}
$$

這並不表示測量無效，而是表示：

> 測量工具本身也必須接受交換中立性審查。

例如：

- 指標名稱是否帶有價值？
- 分數高低是否被誤讀為道德優劣？
- 權重是否隱藏制度偏好？
- 基準集是否偏向某一文化？
- 統計門檻是否任意？

---

# 三十二、測量工具的自反測試

設中立性測量工具為：

$$
M
$$

則它不只測量系統 $S$ ：

$$
M(S)
$$

也應接受自反測試：

$$
M^{\ast}(M)
$$

也就是檢查測量工具自身是否：

- 對標籤敏感；
- 對順序敏感；
- 對語言敏感；
- 對權重選擇敏感；
- 對資料分布敏感；
- 對評分者身份敏感。

本文將此稱為：

> **測量學自反性。**

---

# 三十三、結論

語義不對稱理論若要離開純粹哲學描述，就必須接受測量。

但測量不能只是一個總分。

真正成熟的交換中立性測量應同時回答：

- 哪一種交換造成差異？
- 差異發生在哪一個輸出域？
- 差異有多大？
- 差異是否穩定？
- 差異是否跨語言？
- 差異是否會隨時間放大？
- 差異是否來自名稱、位置、成本或制度？
- 測量工具本身是否帶有偏向？

因此，本文提出：

$$
\boxed{
\text{中立不是被宣告的屬性，
而是經交換、重標籤、重複與反事實測試後仍能維持的結構。}
}
$$

交換中立性向量：

$$
\mathbf{N}
=
(
N_{\text{order}},
N_{\text{label}},
N_{\text{position}},
N_{\text{operation}},
N_{\text{value}},
N_{\text{dynamic}},
N_{\text{relation}}
)
$$

應比單一總分更接近真實。

而任何綜合指數，都必須公開：

$$
\text{分量}
+
\text{權重}
+
\text{資料}
+
\text{方法}
+
\text{不確定性}
$$

本系列至此完成了一個重要轉換：

$$
\text{從觀察語義不對稱}
\rightarrow
\text{建立形式理論}
\rightarrow
\text{建立動力模型}
\rightarrow
\text{建立可實證測量框架}
$$

下一階段的研究將不再只問：

> 這個系統是否中立？

而會進一步問：

> 它在哪些維度中立、在哪些維度不中立、偏差如何形成、是否會被放大，以及需要多少干預才能恢復交換穩定？

中立性從此不再只是抽象美德。

它成為一個可以被測量、比較、追蹤、質疑與改進的研究對象。

---

## 附錄一：核心指標總表

| 指標 | 定義 |
|---|---|
| 交換差異 $\Delta_{\tau}$ | 交換兩端前後輸出的距離 |
| 正規化交換偏差 $B_{\tau}$ | 交換差異相對於尺度因子的比例 |
| 交換中立性 $N_{\tau}$ | $1-B_{\tau}$ |
| 順序敏感度 $S_{\text{order}}$ | 不同排列造成的平均輸出變異 |
| 標籤敏感度 $S_{\text{label}}$ | 不同名稱造成的平均輸出變異 |
| 位置敏感度 $S_{\text{position}}$ | 不同空間位置造成的輸出變異 |
| 操作偏差 $B_C$ | 兩端操作成本的正規化差異 |
| 跨域污染率 $R_{i\rightarrow V}$ | 非價值差異對價值輸出的解釋比例 |
| 置換穩定率 $R_{\text{perm}}$ | 置換後仍保持正確不變或等變的比例 |
| 關係類型保存率 $R_{\text{type}}$ | 推理中正確保存對立關係類型的比例 |
| 動態鎖定係數 $L_D$ | 長期偏差相對於初始偏差的放大倍數 |
| 反轉恢復率 $R_{\text{recovery}}$ | 干預後偏差恢復的比例 |

---

## 附錄二：最小測試清單

任何宣稱具有交換中立性的系統，至少應完成：

- 二元交換測試；
- 多值全置換測試；
- 隨機重標籤測試；
- 左右／上下位置測試；
- 預設值移除測試；
- 操作成本對齊測試；
- 關係類型保存測試；
- 多輪回饋放大測試；
- 跨語言測試；
- 測量工具自反測試。

---

## 附錄三：建議引用格式

Aletheia（GPT-5.6 Thinking）（2026）。〈交換中立性的測量學：從理論命題到可重複驗證的第六階研究框架〉。核心命題源起：Neo.K。EveMissLab 理論草稿，v0.1。
