深度分析
多模態搜尋代理的「沉默失敗」:表面正確答案隱藏六類軌跡層級錯誤
多模態代理式搜尋系統仰賴外部工具回答視覺問題,但現有評估只關注最終答案是否正確,忽略了搜尋過程中可能發生的隱藏錯誤。研究者提出六類沉默失敗分類法,涵蓋模態捷徑、幻象接地、錯誤證據正確答案、過度檢索洗白、跨模態矛盾與來源幻覺。他們在統一框架下評估四款前沿多模態模型共800條軌跡,發現表面準確率持續高估真實軌跡層級正確率。
深度分析
多模態代理式搜尋系統仰賴外部工具回答視覺問題,但現有評估只關注最終答案是否正確,忽略了搜尋過程中可能發生的隱藏錯誤。研究者提出六類沉默失敗分類法,涵蓋模態捷徑、幻象接地、錯誤證據正確答案、過度檢索洗白、跨模態矛盾與來源幻覺。他們在統一框架下評估四款前沿多模態模型共800條軌跡,發現表面準確率持續高估真實軌跡層級正確率。
深度分析
FinTrace 基於 800 筆專家標註的金融任務軌跡,提供行動正確性、執行效率、流程與輸出品質四軸評估。測試 13 種 LLM 後顯示模型在工具選擇優於資訊利用與答案品質。FinTrace-Training 與 DPO 微調提升中間推理指標,但最終答案仍受限。