深度分析
Muon 優化器光譜帽:統一框架防止 nanoGPT、MoE 路由器與 FlashAttention 數值崩潰
Muon 優化器在尺度不變網路中會移除更新煞車,導致權重光譜範數失控。本研究提出光譜帽技術,在每次更新時移除對最大特徵值增長貢獻最大的方向,同時保留其他學習路徑。三個案例顯示:nanoGPT 輸出共變異數頂部分額從 0.74 降至 0.30、MoE 路由器避免秩一崩潰、FlashAttention 即時攔截 133K 特徵值危機。
深度分析
Muon 優化器在尺度不變網路中會移除更新煞車,導致權重光譜範數失控。本研究提出光譜帽技術,在每次更新時移除對最大特徵值增長貢獻最大的方向,同時保留其他學習路徑。三個案例顯示:nanoGPT 輸出共變異數頂部分額從 0.74 降至 0.30、MoE 路由器避免秩一崩潰、FlashAttention 即時攔截 133K 特徵值危機。
深度分析
深度學習常用ReLU與LayerNorm會導致死神經元與特徵正交性喪失。研究者提出Z‑Plane神經網路,將隱藏狀態映射至2維相位束,使用徑向限制激活保留相位並限制能量。實驗顯示100層MLP在MNIST上達98.34%訓練準確率,證明此幾何激活即可提供穩定深度學習。