ملف الباحث
Takashi Sakuragawa
ورقة واحدة في مجموعة PaperMetrix
المنشورات
أوراق هذا المؤلف
-
A Sublinear-Regret Reinforcement Learning Algorithm on Constrained Markov Decision Processes with reset action
2020
In this paper, we study model-based reinforcement learning in an unknown constrained Markov Decision Processes (CMDPs) with reset action. We propose an algorithm, Constrained-UCRL, which uses confidence interval like UCRL2, and solves linear programming problem …