深度分析
多模態搜尋代理的「沉默失敗」:表面正確答案隱藏六類軌跡層級錯誤
多模態代理式搜尋系統仰賴外部工具回答視覺問題,但現有評估只關注最終答案是否正確,忽略了搜尋過程中可能發生的隱藏錯誤。研究者提出六類沉默失敗分類法,涵蓋模態捷徑、幻象接地、錯誤證據正確答案、過度檢索洗白、跨模態矛盾與來源幻覺。他們在統一框架下評估四款前沿多模態模型共800條軌跡,發現表面準確率持續高估真實軌跡層級正確率。
深度分析
多模態代理式搜尋系統仰賴外部工具回答視覺問題,但現有評估只關注最終答案是否正確,忽略了搜尋過程中可能發生的隱藏錯誤。研究者提出六類沉默失敗分類法,涵蓋模態捷徑、幻象接地、錯誤證據正確答案、過度檢索洗白、跨模態矛盾與來源幻覺。他們在統一框架下評估四款前沿多模態模型共800條軌跡,發現表面準確率持續高估真實軌跡層級正確率。
深度分析
隨著實體AI模型直接產出行動,傳統安全機制不足以防止沉默失敗。研究提出運行時授權護欄,從語意、狀態、可行性、時效與操作等七面檢驗,展示新框架對機器人與自駕安全的必要性。此框架將模型信心、感測不確定性與操作限制結合,形成完整的授權事件,避免硬體執行前的隱性錯誤。