ملف الباحث
Kun Wan
ورقة واحدة في مجموعة PaperMetrix
المنشورات
أوراق هذا المؤلف
-
DUMP: Automated Distribution-Level Curriculum Learning for RL-based LLM Post-training
2025 · arXiv (Cornell University)
Recent advances in reinforcement learning (RL)-based post-training have led to notable improvements in large language models (LLMs), particularly in enhancing their reasoning capabilities to handle complex tasks. However, most existing methods treat the training data …