深度分析
多模態搜尋代理的「沉默失敗」:表面正確答案隱藏六類軌跡層級錯誤
多模態代理式搜尋系統仰賴外部工具回答視覺問題,但現有評估只關注最終答案是否正確,忽略了搜尋過程中可能發生的隱藏錯誤。研究者提出六類沉默失敗分類法,涵蓋模態捷徑、幻象接地、錯誤證據正確答案、過度檢索洗白、跨模態矛盾與來源幻覺。他們在統一框架下評估四款前沿多模態模型共800條軌跡,發現表面準確率持續高估真實軌跡層級正確率。
深度分析
多模態代理式搜尋系統仰賴外部工具回答視覺問題,但現有評估只關注最終答案是否正確,忽略了搜尋過程中可能發生的隱藏錯誤。研究者提出六類沉默失敗分類法,涵蓋模態捷徑、幻象接地、錯誤證據正確答案、過度檢索洗白、跨模態矛盾與來源幻覺。他們在統一框架下評估四款前沿多模態模型共800條軌跡,發現表面準確率持續高估真實軌跡層級正確率。
深度分析
小米MiMo團隊發布兩款聚焦代理式AI與原生多模態的新模型。V2.5‑Pro強化長視窗與工具鏈自主管理,示範完成編譯器與視訊編輯等長時程任務;V2.5則以視覺與音訊感知為核心,在日常編碼與多模態理解上呈現高效能與較低代幣成本。此組合在代理能力與成本效益上具競爭力,並可整合現行agent生態。