ملف الباحث
Jenny Zhang
ورقة واحدة في مجموعة PaperMetrix
المنشورات
أوراق هذا المؤلف
-
Quality Diversity through Human Feedback: Towards Open-Ended Diversity-Driven Optimization
2023 · arXiv (Cornell University)
Reinforcement Learning from Human Feedback (RLHF) has shown potential in qualitative tasks where easily defined performance measures are lacking. However, there are drawbacks when RLHF is commonly used to optimize for average human preferences, especially …