ملف الباحث
Dominik G. Grimm
ورقة واحدة في مجموعة PaperMetrix
المنشورات
أوراق هذا المؤلف
-
Self-Improvement for Neural Combinatorial Optimization: Sample without Replacement, but Improvement
2024 · arXiv (Cornell University)
Current methods for end-to-end constructive neural combinatorial optimization usually train a policy using behavior cloning from expert solutions or policy gradient methods from reinforcement learning. While behavior cloning is straightforward, it requires expensive expert solutions, …