RECHERCHE
VeriSpeak : vérification factuelle par RAG sur les grands modèles audio
Un nouveau benchmark évalue la capacité des LALMs à vérifier des affirmations orales, révélant un fossé modalité texte-parole que la RAG seule ne comble pas.
arXiv cs.AI · cs.LG · cs.CL·Debajyoti Mazumder, Mamta, Abhirama Subramanyam Penamakuri·24 septembre 2026
Les auteurs introduisent VeriSpeak, un benchmark de 3 879 affirmations orales pour évaluer la vérification factuelle des Large Audio Language Models (LALMs). Les expériences révèlent un fossé modality gap persistant : les modèles fiables sur texte échouent souvent sur les mêmes affirmations prononcées. La RAG seule apporte des gains limités car les modèles confondent l'évidence récupérée et l'affirmation, mais combinée à un raisonnement explicite, un LALM optimisé atteint 86,1 % de précision.