ملف الباحث

Martin Karafiát

ورقتان في مجموعة PaperMetrix

المنشورات

أوراق هذا المؤلف

  1. Multilingual sequence-to-sequence speech recognition: architecture, transfer learning, and language modeling

    2018 · arXiv (Cornell University)

    Sequence-to-sequence (seq2seq) approach for low-resource ASR is a relatively new direction in speech research. The approach benefits by performing model training without using lexicon and alignments. However, this poses a new problem of requiring more …

  2. Adapting Diarization-Conditioned Whisper for End-to-End Multi-Talker Speech Recognition

    2026

    We propose a speaker-attributed (SA) Whisper-based model for multi-talker speech recognition that combines target-speaker modeling with serialized output training (SOT). Our approach leverages a Diarization-Conditioned Whisper (DiCoW) encoder to extract target-speaker embeddings, which are concatenated …