ملف الباحث

Jenny Zhang

ورقة واحدة في مجموعة PaperMetrix

المنشورات

أوراق هذا المؤلف

  1. Quality Diversity through Human Feedback: Towards Open-Ended Diversity-Driven Optimization

    2023 · arXiv (Cornell University)

    Reinforcement Learning from Human Feedback (RLHF) has shown potential in qualitative tasks where easily defined performance measures are lacking. However, there are drawbacks when RLHF is commonly used to optimize for average human preferences, especially …