速報
俄語長時記憶基準 RUMBA 問世,填補 LLM 記憶評估缺口
大型語言模型(LLM)的長時記憶能力越來越受到重視,但現有基準測試多以英文為主,且依賴整體檢索指標,無法捕捉長範圍上下文、時間資訊與推理之間的互動。為此,研究團隊推出 RUMBA(Russian User Memory BenchmArk),這是一個針對長時對話記憶的新基準測試。
速報
大型語言模型(LLM)的長時記憶能力越來越受到重視,但現有基準測試多以英文為主,且依賴整體檢索指標,無法捕捉長範圍上下文、時間資訊與推理之間的互動。為此,研究團隊推出 RUMBA(Russian User Memory BenchmArk),這是一個針對長時對話記憶的新基準測試。
速報
來自 ArXiv 的研究團隊發表了一項名為 Relay-Bench 的全新大型語言模型評測基準,旨在填補現有測試的不足。與傳統單一領域的評測不同,Relay-Bench 完全由複合問題組成,每個問題包含 2 到 13 個來自不同領域的子問題,例如視覺推理、程式碼撰寫、數學計算、資訊提取、問題解決、常識知識與數據分析。