深度分析
Adaptive View Retrieval 自適應視角檢索框架:破解多模態安全系統對仇恨性錯覺影像的偵測盲點
現有AI安全系統對隱藏仇恨內容的偵測幾近失效,準確率低於25%。研究提出Adaptive View Retrieval框架,將問題轉化為感知檢索,透過自適應選擇最佳視角,在HatefulIllusion資料集上達93.2%準確率,大幅超越現有方法。
深度分析
現有AI安全系統對隱藏仇恨內容的偵測幾近失效,準確率低於25%。研究提出Adaptive View Retrieval框架,將問題轉化為感知檢索,透過自適應選擇最佳視角,在HatefulIllusion資料集上達93.2%準確率,大幅超越現有方法。
SALLIE
研究人員開發出 SALLIE 框架,能同時對抗文本與視覺越獄及提示詞注入。該技術基於機制解釋性,透過偵測模型內部激活值來識別惡意請求,無需修改模型架構即可在多模態模型中實現高效防禦,在多個開源模型測試中表現優於傳統防禦方案。