速報
釣魚郵件偵測模型在對抗攻擊下準確率暴跌,研究揭示乾淨資料測試的盲點
釣魚郵件是持續存在的網路安全威脅,機器學習分類器廣泛用於偵測。一項研究比較 TF-IDF 邏輯迴歸與 DistilBERT 模型,兩者在乾淨資料上準確率超過 98%,但在對抗攻擊下分別跌至 64.00% 與 63.64%。結果顯示乾淨資料準確率無法預測對抗穩健性。
速報
釣魚郵件是持續存在的網路安全威脅,機器學習分類器廣泛用於偵測。一項研究比較 TF-IDF 邏輯迴歸與 DistilBERT 模型,兩者在乾淨資料上準確率超過 98%,但在對抗攻擊下分別跌至 64.00% 與 63.64%。結果顯示乾淨資料準確率無法預測對抗穩健性。
深度分析
為防止AI模型未經授權使用資料,「不可學習資料」(ULD)技術應運而生。透過在訓練資料中加入微小擾動,ULD能有效阻止模型學習有意義的特徵,同時維持人類觀看的品質。此技術與機器遺忘、後門攻擊不同,是一種主動式防禦,但其在計算成本與倫理層面仍面臨挑戰。
深度分析
模型上下文協定(MCP)為大型語言模型新擴充功能,亦產生新攻擊面。本研究以監督式機器學習與深度模型偵測惡意 MCP 工具,二元分類達 100% F1,多類別最高 90.56% F1,優於傳統規則式。此成果顯示 AI 防禦可透過學習模型提升效能。
資料漂移
資料漂移使機器學習安全模型失效,資安團隊需留意模型表現下降、統計分布變化與預測行為異常等徵兆。透過KS測試或PSI等方法偵測,並定期再訓練模型,可降低因漂移造成的偽陽偽陰風險,維持防禦效能。