# 全語言覆蓋前沿下的參數稀缺命題
## 從單一參數規模律到語言—資料—容量聯合規模律

**版本：v0.1**  
**日期：2026-07-20**  
**文件類型：命題／觀察論文**

---

## 摘要

當代大型語言模型常被視為已具有龐大參數與廣泛多語能力。然而，這種判斷多半建立於有限語言、有限任務與有限評測集合之上。若人工智能的目標不再只是支援少數核心語言，而是逐步納入人類世界中的大量語言、方言、語域、專業領域、歷史層次、文字系統與語音變體，則目前被稱為「大模型」的模型，相對於完整目標空間，仍可能處於容量不足狀態。

本文提出「全語言覆蓋前沿下的參數稀缺命題」：模型參數是否充足，不能只由絕對參數量判斷，而應由模型有效容量與目標世界複雜度之比判斷。當目標覆蓋範圍由少數高資源語言擴張至大量低資源語言及其文化、方言與專業知識時，原本看似充足的參數會重新顯得稀缺。

本文進一步提出「共享語義核心—語言特有殘差模型」「語言組合空間乘法命題」「覆蓋前沿參數稀缺命題」「資料—容量匹配命題」與「多語智能聯合規模律」。本文主張，未來規模律可能不會失效，而會從單一模型尺寸定律，演化為總參數、啟用參數、有效資料、訓練計算、推理時計算、外部記憶、語言專家、驗證器與基礎設施共同構成的聯合規模律。

因此，未來高階多語人工智能未必採用單一、全部同時啟用的巨型稠密模型，而可能形成共享世界模型、語系專家、語言專家、領域專家、文化適配器與外部語料庫的階層式系統。參數規模仍然重要，但真正需要擴大的已不只是模型本體，而是整個可承載人類語言世界的智能系統總容量。

**關鍵詞：** 規模定律、模型參數、多語人工智能、低資源語言、有效容量、MoE、語言殘差、智能能力密度、聯合規模律

---

## 一、問題的提出

大型語言模型已經能夠處理多種語言，並在部分翻譯、問答與推理基準上取得高分。由於模型參數量已達到極大規模，一種常見判斷是：

> 人工智能模型的參數可能已經足夠，未來的主要問題只剩效率、資料品質與推理方法。

這個判斷在有限任務域內可能成立，但它隱含了一個未被充分檢查的前提：

$$
\text{當前評測覆蓋的世界}
\approx
\text{人工智能需要理解的完整世界}
$$

實際上，現有模型主要能力常集中於：

- 少數高資源語言；
- 標準書面語；
- 常見網路語域；
- 已高度數位化的文化；
- 主流專業知識；
- 易於建立評測集的任務。

若將目標改為：

- 數千種語言；
- 大量地方方言；
- 正式、口語、宗教、法律、學術等語域；
- 古典與現代語言；
- 多種文字系統；
- 語音與文字的跨模態映射；
- 地方制度、文化分類與知識傳統；

則模型需要承載的結構會大幅增加。

因此，真正需要詢問的不是：

$$
\text{模型參數是否很多？}
$$

而是：

$$
\text{模型容量相對於目標世界是否充足？}
$$

---

## 二、絕對參數量與相對容量

設模型總參數量為：

$$
P_{\mathrm{total}}
$$

若只看絕對值，數千億或數兆參數可以被稱為巨大模型。

但參數是否充足，應相對於目標複雜度：

$$
\mathcal{C}_{\mathrm{target}}
$$

定義「相對容量比」：

$$
\Gamma
=
\frac{P_{\mathrm{effective}}}
{\mathcal{C}_{\mathrm{target}}}
$$

其中：

- $P_{\mathrm{effective}}$ ：模型可用於穩定表示與推理的有效容量；
- $\mathcal{C}_{\mathrm{target}}$ ：希望模型覆蓋的知識、語言與任務複雜度。

當模型只需服務少數語言與標準任務時：

$$
\mathcal{C}_{\mathrm{target}}
$$

相對有限，模型會顯得巨大。

當目標擴張至完整人類語言世界時：

$$
\mathcal{C}_{\mathrm{target}}\uparrow
$$

即使參數量不變，也會出現：

$$
\Gamma\downarrow
$$

因此：

> 模型的「大」不是絕對屬性，而是相對於目標世界的比例屬性。

---

## 三、共享語義核心與語言特有殘差

不同語言並不是完全互不相關的獨立系統。

它們共享大量世界結構，例如：

- 物體；
- 空間；
- 時間；
- 因果；
- 數量；
- 生存行為；
- 社會互動；
- 基本情緒；
- 自然現象。

因此，模型不需要為每一種語言重新學習一套完整世界。

設共享世界—語義核心為：

$$
Z
$$

語言 $L_i$ 可以由共享核心加上語言特有映射與殘差構成：

$$
L_i
=
g_i(Z)
+
\Delta_i
$$

其中：

- $g_i$ ：共享概念到語言 $L_i$ 的映射；
- $\Delta_i$ ：無法由共享核心直接壓縮或推導的語言特有殘差。

殘差可能包括：

- 特有詞形與語法；
- 敬語系統；
- 語氣與證據性；
- 文化分類；
- 地方制度；
- 特有隱喻；
- 特殊文字結構；
- 方言差異；
- 歷史語義；
- 不可直接對譯的概念。

模型最小容量可粗略表示為：

$$
P_{\min}
\gtrsim
f
\left(
H(Z)
+
\sum_{i=1}^{N}H(\Delta_i)
+
H(\mathcal{I})
\right)
$$

其中：

- $H(Z)$ ：共享世界核心的資訊複雜度；
- $H(\Delta_i)$ ：第 $i$ 種語言特有殘差的複雜度；
- $H(\mathcal{I})$ ：語言間映射與交互關係的複雜度。

因此，加入新語言不必完整增加一套模型，但也不可能永遠零成本加入。

---

## 四、語言組合空間乘法命題

人工智能需要覆蓋的不是單純語言數量。

真實能力空間包含：

$$
\text{語言}
\times
\text{方言}
\times
\text{語域}
\times
\text{領域}
\times
\text{時代}
\times
\text{文字}
\times
\text{語音}
\times
\text{任務}
$$

可將語言能力目標空間寫為：

$$
\mathcal{L}^{\ast}
=
L
\times
D
\times
R
\times
K
\times
T
\times
W
\times
A
\times
X
$$

其中：

- $L$ ：語言數量；
- $D$ ：方言與地區變體；
- $R$ ：語域；
- $K$ ：知識與專業領域；
- $T$ ：歷史時期；
- $W$ ：文字系統；
- $A$ ：語音與口音；
- $X$ ：任務類型。

這些變項並非完全獨立，但它們會形成龐大的長尾組合。

例如，「某語言可用」並不代表模型同時具備：

- 該語言的日常口語；
- 法律文件；
- 地方方言；
- 古典文本；
- 醫療問答；
- 語音辨識；
- 兒童語言；
- 專業翻譯。

因此：

$$
\text{支援語言數量}
\ll
\text{真正語言能力組合數量}
$$

---

## 五、覆蓋前沿參數稀缺命題

本文提出：

# 覆蓋前沿參數稀缺命題

> 當模型只服務少數高資源語言與有限任務時，參數可能顯得充足；當能力邊界持續擴張至更多語言、方言、文化、領域與模態時，原本看似充足的參數會重新顯得稀缺。

其核心形式為：

$$
P_{\mathrm{relative}}
=
\frac{P_{\mathrm{effective}}}
{\mathcal{L}^{\ast}}
$$

當：

$$
\mathcal{L}^{\ast}\uparrow
$$

若：

$$
P_{\mathrm{effective}}
$$

沒有同步提高，則：

$$
P_{\mathrm{relative}}\downarrow
$$

由此得到：

$$
\text{基準飽和}
\neq
\text{世界飽和}
$$

某個模型在主流多語評測上接近飽和，不代表它已充分承載人類全部語言與文化結構。

---

## 六、低解析度多語能力

當模型容量、資料或驗證不足時，模型仍可能表面上支援大量語言。

這種支援可能分為三層。

### 6.1 原生掌握

模型能穩定處理：

- 語法；
- 語義；
- 語域；
- 長文本；
- 專業知識；
- 文化脈絡；
- 自我校驗。

### 6.2 跨語言投射

模型主要在高資源語言中形成世界知識，再將結果投射至低資源語言。

### 6.3 表面模仿

模型只學會高頻詞彙、常見模板與翻譯形式，缺乏穩定深層理解。

因此：

$$
\text{能產生某種語言}
\neq
\text{完整編碼該語言}
$$

大量長尾語言可能只是被低解析度壓縮進模型，而非真正形成高精度原生能力。

這可以表示為：

$$
Q_i
=
Q_i^{\mathrm{surface}}
+
Q_i^{\mathrm{semantic}}
+
Q_i^{\mathrm{cultural}}
+
Q_i^{\mathrm{verification}}
$$

若只有第一項較高，則名義上可用，實質上仍不足。

---

## 七、合成資料擴張與容量反壓

人工智能可以為低資源語言生成大量合成資料。

若資料經過真實語料錨定、交叉驗證與母語審校，則可提高：

$$
D_{\mathrm{effective}}
$$

其中 $D_{\mathrm{effective}}$ 是有效訓練資料規模。

但資料增加不代表模型必然能完整吸收。

若：

$$
D_{\mathrm{effective}}\uparrow
$$

而：

$$
P_{\mathrm{effective}}
$$

保持不變，模型可能出現：

- 語言間能力干擾；
- 高資源語言覆蓋低資源語言；
- 稀有語法被遺忘；
- 長尾知識無法穩定保留；
- 新資料只形成表面模式；
- 模型內部競爭加劇。

因此提出：

# 資料—容量匹配命題

> 有效資料規模擴張只有在模型容量、架構路由與訓練計算同步適配時，才會穩定轉化為能力。

可表示為：

$$
\Delta Q
=
f
\left(
\Delta D_{\mathrm{effective}},
\Delta P_{\mathrm{effective}},
C_{\mathrm{train}},
A
\right)
$$

若：

$$
\Delta D_{\mathrm{effective}}\gg
\Delta P_{\mathrm{effective}}
$$

則新增資料的邊際效益可能快速下降。

---

## 八、單一稠密模型不是唯一解

全語言能力不必由單一、全部同時啟用的稠密模型承擔。

更可能的未來架構是：

$$
\text{共享語義核心}
+
\text{語系專家}
+
\text{語言專家}
+
\text{領域專家}
+
\text{文化適配器}
+
\text{外部語料庫}
+
\text{驗證器}
$$

這種架構可使：

$$
P_{\mathrm{total}}
\gg
P_{\mathrm{active}}
$$

其中：

- $P_{\mathrm{total}}$ ：系統總容量；
- $P_{\mathrm{active}}$ ：單次任務啟用容量。

例如，某次以低資源語言提出醫療問題時，系統只需啟用：

$$
\text{通用世界核心}
+
\text{目標語言專家}
+
\text{醫療專家}
+
\text{安全驗證器}
$$

不必同時啟用全部語言能力。

這表示未來擴大的可能是總容量與專家數量，而不是每次推理的全部計算。

---

## 九、參數容量、外部容量與動態容量

多語智能系統的能力可分為三種容量。

### 9.1 參數內固化容量

適合承載：

- 基本語法；
- 常用詞彙；
- 通用世界模型；
- 即時推理；
- 穩定語言映射。

### 9.2 外部可檢索容量

適合承載：

- 字典；
- 地方制度；
- 專業文件；
- 稀有詞彙；
- 歷史文本；
- 最新知識。

### 9.3 動態適應容量

適合處理：

- 個人語言習慣；
- 地方方言；
- 新詞；
- 臨時術語；
- 情境語域；
- 持續修正。

因此：

$$
Q_{\mathrm{language}}
=
Q_{\mathrm{parametric}}
+
Q_{\mathrm{retrieval}}
+
Q_{\mathrm{adaptive}}
+
Q_{\mathrm{verification}}
$$

若系統要求完全離線、低延遲且無外部檢索地掌握全部語言，則參數需求會大幅上升。

若允許外部記憶、動態路由與持續適應，內部參數壓力可以部分下降。

---

## 十、多語智能聯合規模律

傳統參數規模律常將能力表示為參數、資料與訓練計算的函數。

但高階多語人工智能需要更完整的能力函數：

$$
Q
=
F
\left(
P_{\mathrm{total}},
P_{\mathrm{active}},
D_{\mathrm{effective}},
C_{\mathrm{train}},
C_{\mathrm{test}},
A,
H,
V,
M,
I,
\mathcal{L}^{\ast}
\right)
$$

其中：

- $Q$ ：有效智能能力；
- $P_{\mathrm{total}}$ ：總參數與總專家容量；
- $P_{\mathrm{active}}$ ：每次推理實際啟用容量；
- $D_{\mathrm{effective}}$ ：經品質與驗證加權的有效資料；
- $C_{\mathrm{train}}$ ：訓練計算；
- $C_{\mathrm{test}}$ ：推理時計算；
- $A$ ：架構、路由與壓縮方法；
- $H$ ：工具與 Agent 執行環境；
- $V$ ：驗證器與錯誤修正；
- $M$ ：外部記憶與檢索；
- $I$ ：晶片、能源與資料中心基礎設施；
- $\mathcal{L}^{\ast}$ ：語言、方言、語域、領域與模態的覆蓋複雜度。

這裡的重點不是：

$$
\text{參數不重要}
$$

而是：

$$
\text{參數仍重要，但不再是唯一需要擴大的變數}
$$

---

## 十一、語言覆蓋能力密度

若只追求最大模型，可能忽略成本。

因此可定義「語言覆蓋能力密度」：

$$
\rho_{\mathcal{L}}
=
\frac{
Q_{\mathrm{effective}}(\mathcal{L}^{\ast})
}{
R_{\mathrm{consumed}}
}
$$

其中 $R_{\mathrm{consumed}}$ 可包含：

- 啟用參數；
- Token；
- 電力；
- 延遲；
- 記憶體；
- 金錢；
- 人工審校；
- 重試成本。

更細分可定義：

### 每啟用參數語言能力

$$
\rho_{\mathrm{active},\mathcal{L}}
=
\frac{
Q_{\mathrm{effective}}(\mathcal{L}^{\ast})
}{
P_{\mathrm{active}}
}
$$

### 每焦耳語言能力

$$
\rho_{E,\mathcal{L}}
=
\frac{
Q_{\mathrm{effective}}(\mathcal{L}^{\ast})
}{
E
}
$$

### 每單位驗證成本語言能力

$$
\rho_{V,\mathcal{L}}
=
\frac{
Q_{\mathrm{verified}}(\mathcal{L}^{\ast})
}{
C_{\mathrm{validation}}
}
$$

未來競爭可能不只是誰能支援更多語言，而是誰能以更低資源，提供更高品質、更可驗證的廣泛語言能力。

---

## 十二、規模律為何仍可能長期有效

若目標能力空間持續擴張，規模律仍可能有長期作用。

原因不是模型在現有考試上分數不夠，而是：

1. 人類語言世界尚未被完整納入；
2. 大量低資源語言資料尚未數位化；
3. 方言、語域與地方知識仍是長尾；
4. 多模態語言能力仍未充分整合；
5. 高品質驗證資料仍極少；
6. 模型需要吸收更多不可壓縮殘差。

因此，規模擴張的方向將由：

$$
\text{增加單一稠密模型參數}
$$

轉為：

$$
\text{增加總容量}
+
\text{增加有效資料}
+
\text{增加專家}
+
\text{增加推理計算}
+
\text{增加記憶}
+
\text{增加驗證能力}
$$

這是一種聯合規模律，而不是單一參數崇拜。

---

## 十三、可檢驗研究假設

### 假設一：語言覆蓋增加會降低固定模型的平均長尾能力

在參數與訓練計算固定時，持續加入更多異質語言資料，可能造成部分低頻語言能力下降或干擾增加。

### 假設二：增加總容量能改善長尾語言保留

在資料、架構與訓練條件相同時，較高有效容量應提高低資源語言的語法保留、詞彙覆蓋與長文本穩定性。

### 假設三：稀疏專家架構比相同啟用成本的稠密模型更適合廣泛語言覆蓋

若總參數顯著高於啟用參數，語言專家路由應能提高長尾語言能力而不同比例增加單次推理成本。

### 假設四：高品質合成資料只有在容量同步增加時才能充分轉化為能力

當有效資料快速擴張而容量固定時，能力增益將逐漸飽和。

### 假設五：語言能力密度將成為比語言數量更有意義的指標

單純宣稱支援多少語言，將逐步被語言級任務成功率、驗證成本與啟用資源所取代。

---

## 十四、可證偽條件

本命題不是不可反駁的。

若未來研究顯示：

1. 固定小型模型可在不增加外部記憶與推理成本下，原生掌握幾乎所有語言、方言與專業領域；
2. 持續增加多語有效資料不會造成任何容量競爭或干擾；
3. 增加總容量對長尾語言能力沒有穩定增益；
4. 語言特有殘差幾乎可完全由共享世界核心推導；
5. 外部檢索與小型適配器可以取代幾乎全部參數容量需求；

則「全語言覆蓋前沿下的參數稀缺命題」需要被削弱或放棄。

---

## 十五、核心命題總結

### 命題一：參數是否充足是相對問題

模型是否夠大，取決於它要覆蓋多大的世界。

### 命題二：新語言不是零成本加入

語言共享世界知識，但仍具有不可完全壓縮的特有殘差。

### 命題三：語言能力空間具有組合性

語言數量只是表層，方言、語域、領域、文字與時代共同形成長尾。

### 命題四：基準飽和不代表世界飽和

主流語言評測的高分不能證明完整人類語言能力已被承載。

### 命題五：資料擴張需要容量同步

有效資料增加若沒有容量、架構與訓練計算配合，不一定轉化為穩定能力。

### 命題六：未來可能是巨大總容量與稀疏啟用

總參數可以持續擴張，但單次任務只啟用必要專家。

### 命題七：規模律將演化為聯合規模律

參數仍然重要，但要與資料、推理、工具、記憶、驗證與基礎設施共同考察。

---

## 十六、結論

今天的大型語言模型，相對於現有主流基準，可能已經非常巨大。

但相對於完整的人類語言、文化、專業與多模態世界，它們的有效容量仍可能相當有限。

因此，更準確的判斷不是：

$$
\text{目前大模型參數很少}
$$

而是：

> **當人工智能的目標從少數核心語言的高表現，擴張為對人類語言世界的廣泛原生理解時，現有模型的相對容量可能重新顯得不足。**

規模定律未必會消失。

它可能從：

$$
\text{模型越大，能力越高}
$$

進化為：

$$
\boxed{
\text{當目標世界持續擴張時，
總容量、有效資料、專家路由、推理計算、外部記憶與驗證能力必須共同擴張。}
}
$$

未來真正的大模型，不一定只是單一參數更多的模型。

它可能是一個擁有：

- 巨大共享語義核心；
- 大量語言與領域專家；
- 稀疏動態路由；
- 可持續更新的外部記憶；
- 高密度驗證；
- 多層基礎設施；

的總體智能系統。

在這個意義上，人類目前所稱的「大模型」，可能只是相對於少數被充分數位化的世界而言很大。

相對於尚未被完整納入的整個人類語言世界，它們或許仍只是早期模型。

---

## 附錄 A：簡化形式化模型

設：

- $Z$ ：共享世界核心；
- $\Delta_i$ ：語言 $L_i$ 的特有殘差；
- $P$ ：模型有效容量；
- $D_i$ ：語言 $L_i$ 的有效資料；
- $Q_i$ ：語言 $L_i$ 的能力；
- $R_i$ ：語言專家與外部資源。

則：

$$
Q_i
=
f
\left(
Z,
\Delta_i,
P,
D_i,
R_i
\right)
$$

總目標為：

$$
\max
\sum_{i=1}^{N}
w_iQ_i
$$

並限制：

$$
\operatorname{Cost}
\left(
P_{\mathrm{active}},
C_{\mathrm{test}},
M,
E
\right)
\leq B
$$

其中：

- $w_i$ ：語言的重要性或公平權重；
- $B$ ：可用資源預算。

若要同時降低語言間能力差距，可加入：

$$
\min
\left(
\max_i Q_i-\min_iQ_i
\right)
$$

因此，多語模型最佳化不是單純最大化平均分數，而是同時處理：

$$
\text{總能力}
+
\text{長尾保留}
+
\text{語言公平}
+
\text{資源效率}
$$

---

## 附錄 B：與既有理論的銜接

本文可與以下三個研究方向銜接：

1. **總資源—能力—效率聯合規模律**：規模定律不只擴大參數，也擴大有效資料、推理計算、工具、記憶、驗證與基礎設施。
2. **人工智能語言摩擦不對稱**：不同語言需要不同資料、算力與驗證資源。
3. **低資源語言合成資料增益命題**：合成資料可擴張有效資料，但必須由真實資料錨定並經獨立驗證。

三者共同形成：

$$
\boxed{
\text{語言覆蓋擴張}
\rightarrow
\text{有效資料擴張}
\rightarrow
\text{容量與驗證需求擴張}
\rightarrow
\text{聯合規模律持續成立}
}
$$

---

**文件狀態：** 初稿  
**後續方向：** 可建立語言覆蓋複雜度指數、容量—資料匹配實驗、MoE 語言專家路由基準，以及跨語言智能能力密度指標。
