ملف الباحث
Chaoyue Zhao
ورقة واحدة في مجموعة PaperMetrix
المنشورات
أوراق هذا المؤلف
-
Provably Convergent Policy Optimization via Metric-aware Trust Region Methods
2023 · arXiv (Cornell University)
Trust-region methods based on Kullback-Leibler divergence are pervasively used to stabilize policy optimization in reinforcement learning. In this paper, we exploit more flexible metrics and examine two natural extensions of policy optimization with Wasserstein and …