ملف الباحث

Apurv Verma

ورقة واحدة في مجموعة PaperMetrix

المنشورات

أوراق هذا المؤلف

  1. Watermarking Degrades Alignment in Language Models: Analysis and Mitigation

    2025 · arXiv (Cornell University)

    Watermarking has become a practical tool for tracing language model outputs, but it modifies token probabilities at inference time, which were carefully tuned by alignment training. This creates a tension: how do watermark-induced shifts interact …