大佬動態
Poolside 推出 Laguna S 2.1:118B MoE 編碼模型,單張 DGX Spark 就能跑
Poolside AI 共同執行長 Eiso Kant 揭露其小型團隊打造的模型工廠,成功訓練出 118B 總參數的 MoE 編碼模型 Laguna S 2.1。該模型每次僅啟動 8B 參數,可在單台 NVIDIA DGX Spark 上運行,編碼表現匹敵更大規模的開放權重模型。
大佬動態
Poolside AI 共同執行長 Eiso Kant 揭露其小型團隊打造的模型工廠,成功訓練出 118B 總參數的 MoE 編碼模型 Laguna S 2.1。該模型每次僅啟動 8B 參數,可在單台 NVIDIA DGX Spark 上運行,編碼表現匹敵更大規模的開放權重模型。
深度分析
MoE模型因靜態Top‑k路由易產生長尾資訊幻覺。研究提出訓練無關的反事實路由(CoR)透過層級擾動與CEI指標,動態調整專家分配,使沉睡的長尾專家被喚醒。實驗顯示在TruthfulQA、FACTOR等基準上平均提升3.1%的事實正確率,且推論成本未增加。