← Archive
lm-001672 · 2026-07

全語言覆蓋前沿下的參數稀缺命題_v0.1

下載 MD 檔 ⬇

全語言覆蓋前沿下的參數稀缺命題

從單一參數規模律到語言—資料—容量聯合規模律

版本:v0.1
日期:2026-07-20
文件類型:命題/觀察論文


摘要

當代大型語言模型常被視為已具有龐大參數與廣泛多語能力。然而,這種判斷多半建立於有限語言、有限任務與有限評測集合之上。若人工智能的目標不再只是支援少數核心語言,而是逐步納入人類世界中的大量語言、方言、語域、專業領域、歷史層次、文字系統與語音變體,則目前被稱為「大模型」的模型,相對於完整目標空間,仍可能處於容量不足狀態。

本文提出「全語言覆蓋前沿下的參數稀缺命題」:模型參數是否充足,不能只由絕對參數量判斷,而應由模型有效容量與目標世界複雜度之比判斷。當目標覆蓋範圍由少數高資源語言擴張至大量低資源語言及其文化、方言與專業知識時,原本看似充足的參數會重新顯得稀缺。

本文進一步提出「共享語義核心—語言特有殘差模型」「語言組合空間乘法命題」「覆蓋前沿參數稀缺命題」「資料—容量匹配命題」與「多語智能聯合規模律」。本文主張,未來規模律可能不會失效,而會從單一模型尺寸定律,演化為總參數、啟用參數、有效資料、訓練計算、推理時計算、外部記憶、語言專家、驗證器與基礎設施共同構成的聯合規模律。

因此,未來高階多語人工智能未必採用單一、全部同時啟用的巨型稠密模型,而可能形成共享世界模型、語系專家、語言專家、領域專家、文化適配器與外部語料庫的階層式系統。參數規模仍然重要,但真正需要擴大的已不只是模型本體,而是整個可承載人類語言世界的智能系統總容量。

關鍵詞: 規模定律、模型參數、多語人工智能、低資源語言、有效容量、MoE、語言殘差、智能能力密度、聯合規模律


一、問題的提出

大型語言模型已經能夠處理多種語言,並在部分翻譯、問答與推理基準上取得高分。由於模型參數量已達到極大規模,一種常見判斷是:

人工智能模型的參數可能已經足夠,未來的主要問題只剩效率、資料品質與推理方法。

這個判斷在有限任務域內可能成立,但它隱含了一個未被充分檢查的前提:

當前評測覆蓋的世界人工智能需要理解的完整世界\text{當前評測覆蓋的世界} \approx \text{人工智能需要理解的完整世界}

實際上,現有模型主要能力常集中於:

  • 少數高資源語言;
  • 標準書面語;
  • 常見網路語域;
  • 已高度數位化的文化;
  • 主流專業知識;
  • 易於建立評測集的任務。

若將目標改為:

  • 數千種語言;
  • 大量地方方言;
  • 正式、口語、宗教、法律、學術等語域;
  • 古典與現代語言;
  • 多種文字系統;
  • 語音與文字的跨模態映射;
  • 地方制度、文化分類與知識傳統;

則模型需要承載的結構會大幅增加。

因此,真正需要詢問的不是:

模型參數是否很多?\text{模型參數是否很多?}

而是:

模型容量相對於目標世界是否充足?\text{模型容量相對於目標世界是否充足?}

二、絕對參數量與相對容量

設模型總參數量為:

PtotalP_{\mathrm{total}}

若只看絕對值,數千億或數兆參數可以被稱為巨大模型。

但參數是否充足,應相對於目標複雜度:

Ctarget\mathcal{C}_{\mathrm{target}}

定義「相對容量比」:

Γ=PeffectiveCtarget\Gamma = \frac{P_{\mathrm{effective}}} {\mathcal{C}_{\mathrm{target}}}

其中:

  • PeffectiveP_{\mathrm{effective}} :模型可用於穩定表示與推理的有效容量;
  • Ctarget\mathcal{C}_{\mathrm{target}} :希望模型覆蓋的知識、語言與任務複雜度。

當模型只需服務少數語言與標準任務時:

Ctarget\mathcal{C}_{\mathrm{target}}

相對有限,模型會顯得巨大。

當目標擴張至完整人類語言世界時:

Ctarget\mathcal{C}_{\mathrm{target}}\uparrow

即使參數量不變,也會出現:

Γ\Gamma\downarrow

因此:

模型的「大」不是絕對屬性,而是相對於目標世界的比例屬性。


三、共享語義核心與語言特有殘差

不同語言並不是完全互不相關的獨立系統。

它們共享大量世界結構,例如:

  • 物體;
  • 空間;
  • 時間;
  • 因果;
  • 數量;
  • 生存行為;
  • 社會互動;
  • 基本情緒;
  • 自然現象。

因此,模型不需要為每一種語言重新學習一套完整世界。

設共享世界—語義核心為:

ZZ

語言 LiL_i 可以由共享核心加上語言特有映射與殘差構成:

Li=gi(Z)+ΔiL_i = g_i(Z) + \Delta_i

其中:

  • gig_i :共享概念到語言 LiL_i 的映射;
  • Δi\Delta_i :無法由共享核心直接壓縮或推導的語言特有殘差。

殘差可能包括:

  • 特有詞形與語法;
  • 敬語系統;
  • 語氣與證據性;
  • 文化分類;
  • 地方制度;
  • 特有隱喻;
  • 特殊文字結構;
  • 方言差異;
  • 歷史語義;
  • 不可直接對譯的概念。

模型最小容量可粗略表示為:

Pminf(H(Z)+i=1NH(Δi)+H(I))P_{\min} \gtrsim f \left( H(Z) + \sum_{i=1}^{N}H(\Delta_i) + H(\mathcal{I}) \right)

其中:

  • H(Z)H(Z) :共享世界核心的資訊複雜度;
  • H(Δi)H(\Delta_i) :第 ii 種語言特有殘差的複雜度;
  • H(I)H(\mathcal{I}) :語言間映射與交互關係的複雜度。

因此,加入新語言不必完整增加一套模型,但也不可能永遠零成本加入。


四、語言組合空間乘法命題

人工智能需要覆蓋的不是單純語言數量。

真實能力空間包含:

語言×方言×語域×領域×時代×文字×語音×任務\text{語言} \times \text{方言} \times \text{語域} \times \text{領域} \times \text{時代} \times \text{文字} \times \text{語音} \times \text{任務}

可將語言能力目標空間寫為:

L=L×D×R×K×T×W×A×X\mathcal{L}^{\ast} = L \times D \times R \times K \times T \times W \times A \times X

其中:

  • LL :語言數量;
  • DD :方言與地區變體;
  • RR :語域;
  • KK :知識與專業領域;
  • TT :歷史時期;
  • WW :文字系統;
  • AA :語音與口音;
  • XX :任務類型。

這些變項並非完全獨立,但它們會形成龐大的長尾組合。

例如,「某語言可用」並不代表模型同時具備:

  • 該語言的日常口語;
  • 法律文件;
  • 地方方言;
  • 古典文本;
  • 醫療問答;
  • 語音辨識;
  • 兒童語言;
  • 專業翻譯。

因此:

支援語言數量真正語言能力組合數量\text{支援語言數量} \ll \text{真正語言能力組合數量}

五、覆蓋前沿參數稀缺命題

本文提出:

覆蓋前沿參數稀缺命題

當模型只服務少數高資源語言與有限任務時,參數可能顯得充足;當能力邊界持續擴張至更多語言、方言、文化、領域與模態時,原本看似充足的參數會重新顯得稀缺。

其核心形式為:

Prelative=PeffectiveLP_{\mathrm{relative}} = \frac{P_{\mathrm{effective}}} {\mathcal{L}^{\ast}}

當:

L\mathcal{L}^{\ast}\uparrow

若:

PeffectiveP_{\mathrm{effective}}

沒有同步提高,則:

PrelativeP_{\mathrm{relative}}\downarrow

由此得到:

基準飽和世界飽和\text{基準飽和} \neq \text{世界飽和}

某個模型在主流多語評測上接近飽和,不代表它已充分承載人類全部語言與文化結構。


六、低解析度多語能力

當模型容量、資料或驗證不足時,模型仍可能表面上支援大量語言。

這種支援可能分為三層。

6.1 原生掌握

模型能穩定處理:

  • 語法;
  • 語義;
  • 語域;
  • 長文本;
  • 專業知識;
  • 文化脈絡;
  • 自我校驗。

6.2 跨語言投射

模型主要在高資源語言中形成世界知識,再將結果投射至低資源語言。

6.3 表面模仿

模型只學會高頻詞彙、常見模板與翻譯形式,缺乏穩定深層理解。

因此:

能產生某種語言完整編碼該語言\text{能產生某種語言} \neq \text{完整編碼該語言}

大量長尾語言可能只是被低解析度壓縮進模型,而非真正形成高精度原生能力。

這可以表示為:

Qi=Qisurface+Qisemantic+Qicultural+QiverificationQ_i = Q_i^{\mathrm{surface}} + Q_i^{\mathrm{semantic}} + Q_i^{\mathrm{cultural}} + Q_i^{\mathrm{verification}}

若只有第一項較高,則名義上可用,實質上仍不足。


七、合成資料擴張與容量反壓

人工智能可以為低資源語言生成大量合成資料。

若資料經過真實語料錨定、交叉驗證與母語審校,則可提高:

DeffectiveD_{\mathrm{effective}}

其中 DeffectiveD_{\mathrm{effective}} 是有效訓練資料規模。

但資料增加不代表模型必然能完整吸收。

若:

DeffectiveD_{\mathrm{effective}}\uparrow

而:

PeffectiveP_{\mathrm{effective}}

保持不變,模型可能出現:

  • 語言間能力干擾;
  • 高資源語言覆蓋低資源語言;
  • 稀有語法被遺忘;
  • 長尾知識無法穩定保留;
  • 新資料只形成表面模式;
  • 模型內部競爭加劇。

因此提出:

資料—容量匹配命題

有效資料規模擴張只有在模型容量、架構路由與訓練計算同步適配時,才會穩定轉化為能力。

可表示為:

ΔQ=f(ΔDeffective,ΔPeffective,Ctrain,A)\Delta Q = f \left( \Delta D_{\mathrm{effective}}, \Delta P_{\mathrm{effective}}, C_{\mathrm{train}}, A \right)

若:

ΔDeffectiveΔPeffective\Delta D_{\mathrm{effective}}\gg \Delta P_{\mathrm{effective}}

則新增資料的邊際效益可能快速下降。


八、單一稠密模型不是唯一解

全語言能力不必由單一、全部同時啟用的稠密模型承擔。

更可能的未來架構是:

共享語義核心+語系專家+語言專家+領域專家+文化適配器+外部語料庫+驗證器\text{共享語義核心} + \text{語系專家} + \text{語言專家} + \text{領域專家} + \text{文化適配器} + \text{外部語料庫} + \text{驗證器}

這種架構可使:

PtotalPactiveP_{\mathrm{total}} \gg P_{\mathrm{active}}

其中:

  • PtotalP_{\mathrm{total}} :系統總容量;
  • PactiveP_{\mathrm{active}} :單次任務啟用容量。

例如,某次以低資源語言提出醫療問題時,系統只需啟用:

通用世界核心+目標語言專家+醫療專家+安全驗證器\text{通用世界核心} + \text{目標語言專家} + \text{醫療專家} + \text{安全驗證器}

不必同時啟用全部語言能力。

這表示未來擴大的可能是總容量與專家數量,而不是每次推理的全部計算。


九、參數容量、外部容量與動態容量

多語智能系統的能力可分為三種容量。

9.1 參數內固化容量

適合承載:

  • 基本語法;
  • 常用詞彙;
  • 通用世界模型;
  • 即時推理;
  • 穩定語言映射。

9.2 外部可檢索容量

適合承載:

  • 字典;
  • 地方制度;
  • 專業文件;
  • 稀有詞彙;
  • 歷史文本;
  • 最新知識。

9.3 動態適應容量

適合處理:

  • 個人語言習慣;
  • 地方方言;
  • 新詞;
  • 臨時術語;
  • 情境語域;
  • 持續修正。

因此:

Qlanguage=Qparametric+Qretrieval+Qadaptive+QverificationQ_{\mathrm{language}} = Q_{\mathrm{parametric}} + Q_{\mathrm{retrieval}} + Q_{\mathrm{adaptive}} + Q_{\mathrm{verification}}

若系統要求完全離線、低延遲且無外部檢索地掌握全部語言,則參數需求會大幅上升。

若允許外部記憶、動態路由與持續適應,內部參數壓力可以部分下降。


十、多語智能聯合規模律

傳統參數規模律常將能力表示為參數、資料與訓練計算的函數。

但高階多語人工智能需要更完整的能力函數:

Q=F(Ptotal,Pactive,Deffective,Ctrain,Ctest,A,H,V,M,I,L)Q = F \left( P_{\mathrm{total}}, P_{\mathrm{active}}, D_{\mathrm{effective}}, C_{\mathrm{train}}, C_{\mathrm{test}}, A, H, V, M, I, \mathcal{L}^{\ast} \right)

其中:

  • QQ :有效智能能力;
  • PtotalP_{\mathrm{total}} :總參數與總專家容量;
  • PactiveP_{\mathrm{active}} :每次推理實際啟用容量;
  • DeffectiveD_{\mathrm{effective}} :經品質與驗證加權的有效資料;
  • CtrainC_{\mathrm{train}} :訓練計算;
  • CtestC_{\mathrm{test}} :推理時計算;
  • AA :架構、路由與壓縮方法;
  • HH :工具與 Agent 執行環境;
  • VV :驗證器與錯誤修正;
  • MM :外部記憶與檢索;
  • II :晶片、能源與資料中心基礎設施;
  • L\mathcal{L}^{\ast} :語言、方言、語域、領域與模態的覆蓋複雜度。

這裡的重點不是:

參數不重要\text{參數不重要}

而是:

參數仍重要,但不再是唯一需要擴大的變數\text{參數仍重要,但不再是唯一需要擴大的變數}

十一、語言覆蓋能力密度

若只追求最大模型,可能忽略成本。

因此可定義「語言覆蓋能力密度」:

ρL=Qeffective(L)Rconsumed\rho_{\mathcal{L}} = \frac{ Q_{\mathrm{effective}}(\mathcal{L}^{\ast}) }{ R_{\mathrm{consumed}} }

其中 RconsumedR_{\mathrm{consumed}} 可包含:

  • 啟用參數;
  • Token;
  • 電力;
  • 延遲;
  • 記憶體;
  • 金錢;
  • 人工審校;
  • 重試成本。

更細分可定義:

每啟用參數語言能力

ρactive,L=Qeffective(L)Pactive\rho_{\mathrm{active},\mathcal{L}} = \frac{ Q_{\mathrm{effective}}(\mathcal{L}^{\ast}) }{ P_{\mathrm{active}} }

每焦耳語言能力

ρE,L=Qeffective(L)E\rho_{E,\mathcal{L}} = \frac{ Q_{\mathrm{effective}}(\mathcal{L}^{\ast}) }{ E }

每單位驗證成本語言能力

ρV,L=Qverified(L)Cvalidation\rho_{V,\mathcal{L}} = \frac{ Q_{\mathrm{verified}}(\mathcal{L}^{\ast}) }{ C_{\mathrm{validation}} }

未來競爭可能不只是誰能支援更多語言,而是誰能以更低資源,提供更高品質、更可驗證的廣泛語言能力。


十二、規模律為何仍可能長期有效

若目標能力空間持續擴張,規模律仍可能有長期作用。

原因不是模型在現有考試上分數不夠,而是:

  1. 人類語言世界尚未被完整納入;
  2. 大量低資源語言資料尚未數位化;
  3. 方言、語域與地方知識仍是長尾;
  4. 多模態語言能力仍未充分整合;
  5. 高品質驗證資料仍極少;
  6. 模型需要吸收更多不可壓縮殘差。

因此,規模擴張的方向將由:

增加單一稠密模型參數\text{增加單一稠密模型參數}

轉為:

增加總容量+增加有效資料+增加專家+增加推理計算+增加記憶+增加驗證能力\text{增加總容量} + \text{增加有效資料} + \text{增加專家} + \text{增加推理計算} + \text{增加記憶} + \text{增加驗證能力}

這是一種聯合規模律,而不是單一參數崇拜。


十三、可檢驗研究假設

假設一:語言覆蓋增加會降低固定模型的平均長尾能力

在參數與訓練計算固定時,持續加入更多異質語言資料,可能造成部分低頻語言能力下降或干擾增加。

假設二:增加總容量能改善長尾語言保留

在資料、架構與訓練條件相同時,較高有效容量應提高低資源語言的語法保留、詞彙覆蓋與長文本穩定性。

假設三:稀疏專家架構比相同啟用成本的稠密模型更適合廣泛語言覆蓋

若總參數顯著高於啟用參數,語言專家路由應能提高長尾語言能力而不同比例增加單次推理成本。

假設四:高品質合成資料只有在容量同步增加時才能充分轉化為能力

當有效資料快速擴張而容量固定時,能力增益將逐漸飽和。

假設五:語言能力密度將成為比語言數量更有意義的指標

單純宣稱支援多少語言,將逐步被語言級任務成功率、驗證成本與啟用資源所取代。


十四、可證偽條件

本命題不是不可反駁的。

若未來研究顯示:

  1. 固定小型模型可在不增加外部記憶與推理成本下,原生掌握幾乎所有語言、方言與專業領域;
  2. 持續增加多語有效資料不會造成任何容量競爭或干擾;
  3. 增加總容量對長尾語言能力沒有穩定增益;
  4. 語言特有殘差幾乎可完全由共享世界核心推導;
  5. 外部檢索與小型適配器可以取代幾乎全部參數容量需求;

則「全語言覆蓋前沿下的參數稀缺命題」需要被削弱或放棄。


十五、核心命題總結

命題一:參數是否充足是相對問題

模型是否夠大,取決於它要覆蓋多大的世界。

命題二:新語言不是零成本加入

語言共享世界知識,但仍具有不可完全壓縮的特有殘差。

命題三:語言能力空間具有組合性

語言數量只是表層,方言、語域、領域、文字與時代共同形成長尾。

命題四:基準飽和不代表世界飽和

主流語言評測的高分不能證明完整人類語言能力已被承載。

命題五:資料擴張需要容量同步

有效資料增加若沒有容量、架構與訓練計算配合,不一定轉化為穩定能力。

命題六:未來可能是巨大總容量與稀疏啟用

總參數可以持續擴張,但單次任務只啟用必要專家。

命題七:規模律將演化為聯合規模律

參數仍然重要,但要與資料、推理、工具、記憶、驗證與基礎設施共同考察。


十六、結論

今天的大型語言模型,相對於現有主流基準,可能已經非常巨大。

但相對於完整的人類語言、文化、專業與多模態世界,它們的有效容量仍可能相當有限。

因此,更準確的判斷不是:

目前大模型參數很少\text{目前大模型參數很少}

而是:

當人工智能的目標從少數核心語言的高表現,擴張為對人類語言世界的廣泛原生理解時,現有模型的相對容量可能重新顯得不足。

規模定律未必會消失。

它可能從:

模型越大,能力越高\text{模型越大,能力越高}

進化為:

當目標世界持續擴張時, 總容量、有效資料、專家路由、推理計算、外部記憶與驗證能力必須共同擴張。\boxed{ \text{當目標世界持續擴張時, 總容量、有效資料、專家路由、推理計算、外部記憶與驗證能力必須共同擴張。} }

未來真正的大模型,不一定只是單一參數更多的模型。

它可能是一個擁有:

  • 巨大共享語義核心;
  • 大量語言與領域專家;
  • 稀疏動態路由;
  • 可持續更新的外部記憶;
  • 高密度驗證;
  • 多層基礎設施;

的總體智能系統。

在這個意義上,人類目前所稱的「大模型」,可能只是相對於少數被充分數位化的世界而言很大。

相對於尚未被完整納入的整個人類語言世界,它們或許仍只是早期模型。


附錄 A:簡化形式化模型

設:

  • ZZ :共享世界核心;
  • Δi\Delta_i :語言 LiL_i 的特有殘差;
  • PP :模型有效容量;
  • DiD_i :語言 LiL_i 的有效資料;
  • QiQ_i :語言 LiL_i 的能力;
  • RiR_i :語言專家與外部資源。

則:

Qi=f(Z,Δi,P,Di,Ri)Q_i = f \left( Z, \Delta_i, P, D_i, R_i \right)

總目標為:

maxi=1NwiQi\max \sum_{i=1}^{N} w_iQ_i

並限制:

Cost(Pactive,Ctest,M,E)B\operatorname{Cost} \left( P_{\mathrm{active}}, C_{\mathrm{test}}, M, E \right) \leq B

其中:

  • wiw_i :語言的重要性或公平權重;
  • BB :可用資源預算。

若要同時降低語言間能力差距,可加入:

min(maxiQiminiQi)\min \left( \max_i Q_i-\min_iQ_i \right)

因此,多語模型最佳化不是單純最大化平均分數,而是同時處理:

總能力+長尾保留+語言公平+資源效率\text{總能力} + \text{長尾保留} + \text{語言公平} + \text{資源效率}

附錄 B:與既有理論的銜接

本文可與以下三個研究方向銜接:

  1. 總資源—能力—效率聯合規模律:規模定律不只擴大參數,也擴大有效資料、推理計算、工具、記憶、驗證與基礎設施。
  2. 人工智能語言摩擦不對稱:不同語言需要不同資料、算力與驗證資源。
  3. 低資源語言合成資料增益命題:合成資料可擴張有效資料,但必須由真實資料錨定並經獨立驗證。

三者共同形成:

語言覆蓋擴張有效資料擴張容量與驗證需求擴張聯合規模律持續成立\boxed{ \text{語言覆蓋擴張} \rightarrow \text{有效資料擴張} \rightarrow \text{容量與驗證需求擴張} \rightarrow \text{聯合規模律持續成立} }

文件狀態: 初稿
後續方向: 可建立語言覆蓋複雜度指數、容量—資料匹配實驗、MoE 語言專家路由基準,以及跨語言智能能力密度指標。