ملف الباحث

Omer Gottesman

ورقة واحدة في مجموعة PaperMetrix

المنشورات

أوراق هذا المؤلف

  1. Efficient RL for optimizing conversation level outcomes with an LLM-based tutor

    2025 · arXiv (Cornell University)

    Large language models (LLMs) built on existing reinforcement learning with human feedback (RLHF) frameworks typically optimize responses based on immediate turn-level human preferences. However, this approach falls short in multi-turn dialogue settings, such as online …