RECHERCHE
EmoRES-TTS : un pilotage vectoriel résiduel pour la génération de parole émotionnelle
Une méthode sans réentraînement décompose les vecteurs d'émotion pour mieux contrôler le TTS émotionnel, surpassant CoCoEmo sur plusieurs backbones.
arXiv cs.AI · cs.LG · cs.CL·Kuan-Po Huang, Haohe Liu, Puyuan Peng, Haibin Wu·29 septembre 2026
Les chercheurs montrent qu'un vecteur d'émotion se décompose en une composante partagée (éloignement du neutre) et une composante résiduelle (direction vers l'émotion cible). EmoRES exploite cette décomposition pour piloter un modèle TTS figé sans réentraînement. Sur IEMOCAP, la méthode surpasse CoCoEmo sur IndexTTS-2 et CosyVoice2, avec des gains significatifs en corrélation de rang et en taux de reconnaissance d'émotion, confirmés par évaluation humaine.