速報 強化學習新突破:相對價值學習直接學習價值差異,效能匹敵PPO 強化學習傳統上依賴絕對狀態價值估計,但新研究提出相對價值學習(RV)框架,直接透過反對稱函數學習價值差異。該方法引入成對貝爾曼運算子,並重建廣義優勢估計(R-GAE),整合至PPO後在Atari基準測試中表現與標準PPO相當,證明相對價值估計是有效的替代方案。