速報
俄語長時記憶基準 RUMBA 問世,填補 LLM 記憶評估缺口
大型語言模型(LLM)的長時記憶能力越來越受到重視,但現有基準測試多以英文為主,且依賴整體檢索指標,無法捕捉長範圍上下文、時間資訊與推理之間的互動。為此,研究團隊推出 RUMBA(Russian User Memory BenchmArk),這是一個針對長時對話記憶的新基準測試。
速報
大型語言模型(LLM)的長時記憶能力越來越受到重視,但現有基準測試多以英文為主,且依賴整體檢索指標,無法捕捉長範圍上下文、時間資訊與推理之間的互動。為此,研究團隊推出 RUMBA(Russian User Memory BenchmArk),這是一個針對長時對話記憶的新基準測試。
深度分析
面對現有視覺-語言-動作模型在動態與接觸任務的短板,RLDX-1以Multi-Stream Action Transformer整合影像、運動感知、長時記憶與物理感測;並透過合成稀有場景資料、三階段訓練與推理優化,在仿真與實機基準上達到顯著提升,部分任務成功率超過八成。