深度分析
VisDeception 基準揭露 VLM 對欺騙性圖表高度脆弱,多智能體防禦框架有效降低錯誤
視覺語言模型(VLM)在分析圖表時,容易受到軸線截斷、反轉、比例扭曲、色彩誤導等欺騙性設計影響,導致錯誤解讀。為系統性評估此漏洞,研究團隊提出 VisDeception 基準,包含 1,600 組配對圖表(忠實 vs 誤導),涵蓋八類欺騙策略。他們並引入「欺騙分數」指標,區分因欺騙導致的錯誤與一般圖表理解錯誤。
深度分析
視覺語言模型(VLM)在分析圖表時,容易受到軸線截斷、反轉、比例扭曲、色彩誤導等欺騙性設計影響,導致錯誤解讀。為系統性評估此漏洞,研究團隊提出 VisDeception 基準,包含 1,600 組配對圖表(忠實 vs 誤導),涵蓋八類欺騙策略。他們並引入「欺騙分數」指標,區分因欺騙導致的錯誤與一般圖表理解錯誤。
深度分析
大型視覺語言模型(VLM)在生成回答時,常依賴語言先驗而忽略圖片中的細微證據。為解決此問題,現有方法多依賴外部教師模型、輔助答案或視覺提示,但這些資源並非隨時可得。本研究提出「視覺對比自蒸餾」(VCSD),僅需同一模型在原始圖片與內容抹除圖片下的預測差異,即可建構有效的自我蒸餾目標。
深度分析
Robostral Navigate是僅需單顆RGB鏡頭的8B視覺語言導航模型。它透過「指向」預測導航點,無需深度感測器或預建地圖。在R2R-CE標竿以77.4%成功率超越所有單鏡頭與多鏡頭系統,訓練時間從月縮至日,為通用機器人導航提供可規模化的解決方案。
深度分析
現有AI安全系統對隱藏仇恨內容的偵測幾近失效,準確率低於25%。研究提出Adaptive View Retrieval框架,將問題轉化為感知檢索,透過自適應選擇最佳視角,在HatefulIllusion資料集上達93.2%準確率,大幅超越現有方法。
深度分析
在視覺語言模型(VLM)中,直覺上認為先給問題能引導模型注意影像內容,然而實驗發現「問題先行」的提示方式在多項基準測試上表現最差,形成所謂的問題先行悖論。研究者透過 logit‑lens 與注意力探測證實,先問問題確實能驅動影像特徵向問題相關概念靠攏,但因問題被長長的影像序列隔離,答案產生階段幾乎不會讀取到問題,導致錯誤答案。
深度分析
隨著機器人學習需要大量物理互動資料,傳統人力收集成本高昂。研究提出 RADAR 系統,利用少量 3D 示範結合視覺語言模型與圖神經網路自動產生任務、執行並以 VQA 評估成功,最後以 FSM 完成環境自動重置。實驗顯示在模擬與實機上可達 90% 成功率,顯著提升資料取得效率。
深度分析
在視覺語言模型的社會認知測試中,研究團隊以 FlipSet 這套 L2 視覺視角推理基準,對 103 種公開模型進行零樣本評估。結果顯示,超過七成的回答是自我中心的相機視角,整體正確率僅 9%,遠低於 25% 的機會水平,說明模型在將他人視角與空間旋轉結合時存在根本缺失。此問題若不解決,將限制多模態 AI 在真實互動情境中的應用。
深度分析
研究團隊探討測試時擴展技術在小規模視覺語言模型上的適用性,並在多國語言視覺選擇題基準 EXAMS-V 上進行測試。透過對比 Qwen 系列模型,研究發現效能提升關鍵在於基礎模型能力、正確的解析格式與充足的解碼代幣預算,而非複雜的搜尋機制。最終配置在 ImageCLEF 2026 測試集達到 84.1% 準確率,位居榜首。
深度分析
視覺語言模型轉為視覺語言動作模型的挑戰在於輸出分布不匹配,CLAP透過在動作代幣前加入自然語言描述,使預訓練語意保留,同時僅需單輪微調即可在LIBERO測試中達到90.8%成功率,顯示此簡潔流程提升效能且易於分析。預期此方法將加速多模態機器人開發,降低門檻。
深度分析
FalconPerception以0.6億參數的早期融合Transformer取代傳統視覺管線,透過混合注意力遮罩同時處理影像與文字,於SA‑Co基準取得68.0Macro‑F1,並推出PBench診斷測試與0.3億參數的FalconOCR,顯示單模型可同時支援分割與文件辨識。
深度分析
隨著視覺語言模型被廣泛用於流程圖圖像轉程式碼,缺少參考碼使品質監控困難。研究提出以OCR產生文字作為參考的Recall_OCR,並以視覺蕴涵驗證生成內容的Precision_VE,合成F1_OCR-VE作為品質指標。實驗在FlowVQA上驗證,與真實指標相關係數分別達0.97、0.91、0.94。
深度分析
長尾實例分割受限於資料稀缺,研究提出結合 T2I 生成與情境感知 I2I 編輯的混合框架,透過教師‑學生過濾與 VRAIN 指令式稀有類別插入,提高標籤可信度與影像真實感。實驗在 LVIS 上整體 AP 提升 4 點,稀有類別更增 9.5 點,顯示此方法在提升模型表現與擴展性方面具備顯著潛力。