ملف الباحث

Dominik G. Grimm

ورقة واحدة في مجموعة PaperMetrix

المنشورات

أوراق هذا المؤلف

  1. Self-Improvement for Neural Combinatorial Optimization: Sample without Replacement, but Improvement

    2024 · arXiv (Cornell University)

    Current methods for end-to-end constructive neural combinatorial optimization usually train a policy using behavior cloning from expert solutions or policy gradient methods from reinforcement learning. While behavior cloning is straightforward, it requires expensive expert solutions, …