ملف الباحث

Kaichiu Wong

ورقة واحدة في مجموعة PaperMetrix

المنشورات

أوراق هذا المؤلف

  1. Weak Human Preference Supervision for Deep Reinforcement Learning

    2021 · IEEE Transactions on Neural Networks and Learning Systems

    The current reward learning from human preferences could be used to resolve complex reinforcement learning (RL) tasks without access to a reward function by defining a single fixed preference between pairs of trajectory segments. However, …