深度分析
合成少數樣本過採樣無效?新研究揭露二十年類別不平衡學習的驗證偏差
一項來自 ArXiv 的最新研究,對過去二十年來在類別不平衡學習中廣泛使用的合成少數樣本(如 SMOTE 及其變體)提出了根本性的質疑。研究團隊指出,傳統的合成樣本有效性驗證存在嚴重的「父母洩漏」偏差:由於合成點是從真實少數樣本之間內插產生,其最近的鄰居往往是生成它的母體樣本,導致驗證結果形同虛設。
深度分析
一項來自 ArXiv 的最新研究,對過去二十年來在類別不平衡學習中廣泛使用的合成少數樣本(如 SMOTE 及其變體)提出了根本性的質疑。研究團隊指出,傳統的合成樣本有效性驗證存在嚴重的「父母洩漏」偏差:由於合成點是從真實少數樣本之間內插產生,其最近的鄰居往往是生成它的母體樣本,導致驗證結果形同虛設。
合成資料
學習分析受限於學生資料的隱私與稀缺,阻礙教育科技發展。研究以一萬筆學生成績資料比較傳統重抽樣(SMOTE、Bootstrap、隨機過採樣)與深度生成模型(自編碼器、變分自編碼器、Copula-GAN)的統計擬合、效用與隱私指標。結果發現重抽樣在TSTR上接近實資料但DCR趨近0,而深度模型DCR趨近1;變分自編碼器在效用與隱私間取得最佳折衷。