
模型參數不是硬碟
依據 ICML 2026 記憶容量研究:權重同時混著樣本細節、通用規律與訓練痕跡;過了相變點,死記會讓位給泛化。
對大模型有一種很誘人的想像:它是巨型資料庫,訓練檔案塞進參數就永遠待在那裏。相反的想像同樣誘人:模型什麼都不記,只學抽象規律。ICML 2026 一篇關於記憶容量的研究指向更混亂的中間地帶——而且這個中間地帶會隨資料量動態變化。
混合載體,不是檔案櫃
參數不是一塊硬碟:你往裏存檔案,存滿就存不進去。它更像同時幹好幾件事的共享工作區:裝著一些樣本細節,裝著從大量例子提煉出的可重用規律,也留著訓練過程的統計痕跡。這幾層並非涇渭分明,而是纏在同一組權重裏。
所以「7B 參數 × 每參數 3.6 比特 = 記住了多少 GB 檔案」會誤導人。同一研究線上那個有名的「每參數比特數」,測量的是在嚴格定義下的非預期記憶容量——不是說每個權重都是留給你文件的迷你 SSD 插槽。
過了容量,死記讓位給泛化
在 FineWeb 這類真實文本上,作者看到類似相變的過程。訓練集小到容量裝得下時,模型主要背樣本細節——這條路降損失最快。資料超過容量之後,非預期記憶不再上升甚至開始下降,泛化則快速佔比上升。背不完時,梯度下降會逼模型去抽取跨樣本的共享模式。
因此記憶與泛化不是簡單的對立。容量未滿時,記憶主導、泛化稀薄;超過容量後,記憶讓出空間,泛化變強,模型平均更有用。著名的雙下降——測試損失先降、再升、再降——恰好出現在資料量逼近容量的臨界附近,把舊謎題串回同一條轉變線上。
為何 scaling 仍然說得通——以及還有什麼沒答案
這幅圖景也有助解釋:為何模型與資料同時變大時,Scaling Laws 仍常成立。參數變大,容量跟著變大——能在更大語料上先充分記憶,再過渡到更深的泛化。資料量與容量匹配,往往比「永遠加更多資料」更有效率。
- 稀疏模型或混合專家(MoE)的每參數(或每活躍參數)容量,比稠密 GPT 式結構更高還是更低?
- 優化器、學習率調度、資料增強會不會改變有效容量?
- SFT、RLHF 這類對齊階段,是擦掉一部分記憶,還是主要改寫提取方式?
若有朝一日我們能精確控制記憶——保留通用規律、擦除敏感樣本、選擇哪些該牢記、哪些該遺忘——大模型的應用邊界會被拉開。那會徹底解決資料隱私,還是帶來現在還看不清的新挑戰,仍是開放問題。眼下我們至少多了一把更清楚的尺:參數是混合介質,不是硬碟。