深度分析
PaTR:以過程評分器引導自適應樹式展開,提升多回合強化學習效率
在長回合代理任務中,傳統均勻抽樣浪費資源;PaTR透過任務導向的過程評分器,動態擴展有前景的分支並及早剪枝,於FrozenLake與SWE‑Bench提升9.3與5.0分,證明樹式展開提升探索效率。保留剪枝失敗樣本作負向訓練,提升GRPO相對優勢估計。
深度分析
在長回合代理任務中,傳統均勻抽樣浪費資源;PaTR透過任務導向的過程評分器,動態擴展有前景的分支並及早剪枝,於FrozenLake與SWE‑Bench提升9.3與5.0分,證明樹式展開提升探索效率。保留剪枝失敗樣本作負向訓練,提升GRPO相對優勢估計。
深度分析
本研究針對失智症照護對話的長期目標與即時患者情緒波動,提出 T2‑GRPO(Turn‑Trajectory Group Relative Policy Optimization)框架。該方法直接從凍結的失智患者模擬器取得回合層面的環境獎勵,並以中心排名正規化同時保留軌跡層獎勵,避免獎勵崩潰;