深度分析
OSVE 框架:單步擴散模型實現 155 倍加速的即時影片編輯
傳統擴散模型影片編輯因多步取樣與反演而速度緩慢。OSVE 框架採用單步文字轉圖像模型,以可學習編碼器取代迭代反演,並透過結構感知損失函數與統一幀編輯技術,在單次生成中保留結構與時間一致性。實驗顯示,其品質媲美多步方法,速度卻快約 155 至 171 倍。
深度分析
傳統擴散模型影片編輯因多步取樣與反演而速度緩慢。OSVE 框架採用單步文字轉圖像模型,以可學習編碼器取代迭代反演,並透過結構感知損失函數與統一幀編輯技術,在單次生成中保留結構與時間一致性。實驗顯示,其品質媲美多步方法,速度卻快約 155 至 171 倍。
速報
研究團隊開發了首個能在高度動態、具複雜物理互動環境中運作的多人世界模型。與傳統單人模型不同,它以多位玩家的行動序列為條件,能正確歸因場景變化並在任意組合動作下保持一致性。模型以 10,000 小時的公開機器人遊戲資料訓練,使用 5 億參數的潛在擴散架構,單顆 Nvidia B200 GPU 即可即時產生四人對戰,達到每秒 20 幀。