SISER: Speaker-Invariant Speech Emotion Recognition with Entropy-Based Adversarial Training
This work proposes SISER (Speaker-Invariant Speech Emotion Recognition), integrating wav2vec 2.0 as a feature encoder and ECAPA-TDNN as a speaker discriminator within an entropy-based adversarial training scheme.
Eunseo Choi, Hyunku Kang, Chanwoo Kim
· 0 citations