一個空間塞進比維度更多的概念
2025 年,MIT 的 Yizhou Liu、Ziming Liu 與 Jeff Gore 發表〈Superposition Yields Robust Neural Scaling〉,從模型的表示空間解釋 neural scaling law:為什麼模型變大時,損失往往會沿著可預測的冪次曲線下降。論文後來獲得 NeurIPS 2025 最佳論文亞軍。
大型語言模型要處理的 token 與抽象特徵,遠多於隱藏空間能提供的獨立維度。Anthropic 在 2022 年的 toy model 研究把這種作法稱為 superposition;簡單說,就是讓多個特徵共用、甚至重疊在同一片空間裡。好處是有限維度能容納更多特徵,代價是不同表示之間會互相干擾。
加寬模型減少的是其中一種損失
MIT 團隊用 toy model 控制特徵重疊程度,再檢查不同寬度下的損失變化。在強特徵重疊的情況下,表示向量的幾何重疊會造成干擾,這一部分的損失大致與模型寬度成反比。換句話說,寬度加倍時,因表示干擾造成的損失約可減半。團隊也檢查多個開源 LLM 的 language model head,並指出結果與 Chinchilla scaling laws 相符。
不過,這裡減半的是「受寬度限制的表示損失」,不是模型犯下的所有錯誤。論文另外區分 transformer 層解析與處理資訊造成的損失,也保留語言本身沒有唯一答案所形成的不可消除部分。把公式直接翻成「模型寬度加倍,所有錯誤都減半」,會把研究範圍說得太大。
來源:Yizhou Liu、Ziming Liu、Jeff Gore / arXiv,CC BY 4.0
成本暴增不是數學上限本身
影片用一串木塊與美元數字,把模型寬度每加倍、訓練成本約增加六倍的推算做成視覺階梯,從 3 億美元一路算到 3,900 億美元。影片裡的成本階梯是推算,不是論文實測價格。另一份 2024 年的前沿 AI 成本研究估計,2016 年以來最耗運算的模型訓練成本平均每年增加 2.4 倍;如果趨勢延續,最大型的訓練工作可能在 2027 年超過 10 億美元。這能說明經濟壓力,卻不能單獨證明模型能力的終點。
論文談的數學限制,是幾何關係決定了受寬度限制的損失大致只能按「一除以寬度」的速度下降。作者認為,在自然語言上很難只靠改變特徵頻率,讓這條曲線變得更快;但在頻率分布非常偏斜的特定領域,仍可能不同。
上限只屬於這條擴展路線
論文對「何時停止」的回答本身很保守:若模型維度追上需要獨立表示的特徵數量,superposition 消失,繼續加寬就不再減少這一類干擾。但作者也明說,把特徵數量直接連到詞彙量只是一個初步近似;詞彙量可能只是語言中獨立事物數量的下界,因此這條冪次曲線可能延續得更久。
研究也有清楚邊界:核心證據來自簡化的 toy model,它省略 transformer 層;論文沒有研究資料量與訓練步數的 scaling,也沒有證明其他架構、工具使用或推論時運算無法繼續改善模型。研究的是寬度限制,不是 AI 進步的總上限。
影片上線後,一則高互動留言正是質疑它把「scaling alone has limits」說成「AI progress is over」。Dan Grib 隨後置頂更正,承認舊標題會讓人誤解,並改成目前的「LLM scaling 有硬上限」。不過縮圖與部分旁白仍留著更強的說法。這項研究真正收窄的是「持續加寬就能照同一條曲線改善」的假設,而不是替所有 AI 路線畫上句點。