RECHERCHE
Last Translation Benchmark : un test évolutif pour piéger les modèles de traduction automatique
Un nouveau benchmark collaboratif rassemble des exemples multimodaux conçus pour faire échouer les meilleurs systèmes de traduction actuels.
arXiv cs.AI · cs.LG · cs.CL·Vilém Zouhar, Niyati Bafna, Mukund Choudhary, Maike Züfle·3 septembre 2026
Face à la saturation des benchmarks classiques et aux limites des métriques automatiques et de l'évaluation humaine, des chercheurs proposent le Last Translation Benchmark. Ce jeu de données évolutif compile des exemples textuels, visuels, audio et vidéo rédigés par des humains et revus par des pairs, accompagnés de règles de vérification précises pour chaque cas d'échec. La première version, LTBv1, intègre les contributions validées avant septembre 2026, avec des mises à jour continues prévues.