ملف الباحث

Takashi Watanabe

ورقة واحدة في مجموعة PaperMetrix

المنشورات

أوراق هذا المؤلف

  1. A Sublinear-Regret Reinforcement Learning Algorithm on Constrained Markov Decision Processes with reset action

    2020

    In this paper, we study model-based reinforcement learning in an unknown constrained Markov Decision Processes (CMDPs) with reset action. We propose an algorithm, Constrained-UCRL, which uses confidence interval like UCRL2, and solves linear programming problem …