Toutes les news taguées avec ce sujet.
Une méthode sans réentraînement décompose les vecteurs d'émotion pour mieux contrôler le TTS émotionnel, surpassant CoCoEmo sur plusieurs backbones.
DeepMind dévoile les capacités de synthèse vocale de Gemini 3.8, une nouvelle brique text-to-speech pour son modèle phare.
Un nouveau codec neuronal applique une compression indépendante à chaque couche de quantification pour améliorer l'efficacité des systèmes de synthèse vocale.
Nari Labs présente ses modèles de synthèse et reconnaissance vocale basés sur Qwen3, mis en avant pour leur précision, faible latence et coût réduit.