ملف الباحث
Kaichiu Wong
ورقة واحدة في مجموعة PaperMetrix
المنشورات
أوراق هذا المؤلف
-
Weak Human Preference Supervision for Deep Reinforcement Learning
2021 · IEEE Transactions on Neural Networks and Learning Systems
The current reward learning from human preferences could be used to resolve complex reinforcement learning (RL) tasks without access to a reward function by defining a single fixed preference between pairs of trajectory segments. However, …