ملف الباحث
Mohammad Mahdi Khalili
ورقة واحدة في مجموعة PaperMetrix
المنشورات
أوراق هذا المؤلف
-
From Emergence to Control: Probing and Modulating Self-Reflection in Language Models
2025 · arXiv (Cornell University)
Self-reflection -- the ability of a large language model (LLM) to revisit, evaluate, and revise its own reasoning -- has recently emerged as a powerful behavior enabled by reinforcement learning with verifiable rewards (RLVR). While …