ملف الباحث
Saaz, Mootez
ورقة واحدة في مجموعة PaperMetrix
المنشورات
أوراق هذا المؤلف
-
On Inter-dataset Code Duplication and Data Leakage in Large Language Models
2024 · arXiv (Cornell University)
Motivation. Large language models (LLMs) have exhibited remarkable proficiency in diverse software engineering (SE) tasks. Handling such tasks typically involves acquiring foundational coding knowledge on large, general-purpose datasets during a pre-training phase, and subsequently refining …