RECHERCHE
Représentations temps-fréquence pour l'estimation multi-pitch dans les ensembles vocaux
Une étude montre que la STFT linéaire surpasse la HCQT pour détecter les pitchs dans les chants polyphoniques, à moindre coût.
arXiv cs.AI · cs.LG · cs.CL·Junyoung Koh, Hao-Wen Dong·2 octobre 2026
Les chercheurs réexaminent le choix classique de la représentation HCQT pour l'estimation multi-pitch dans les ensembles vocaux, où les harmoniques se chevauchent fortement. Ils montrent qu'une STFT linéaire, malgré sa résolution fréquentielle fixe, obtient de meilleurs résultats que la HCQT tout en réduisant significativement le coût d'extraction des features. L'analyse révèle qu'une fenêtre d'analyse plus courte est plus efficace pour suivre les pitchs vocaux variables dans le temps.