RECHERCHE
FriendBench : évaluer l'inférence de familiarité entre deux personnes chez l'humain et les LLM multimodaux
Un nouveau benchmark teste si les modèles multimodaux peuvent deviner si deux personnes se connaissent déjà à partir d'un court échange filmé.
arXiv cs.AI · cs.LG · cs.CL·Jeffrey M. Girard, Jason Z. Zheng, Jacqueline R. Vertino, Antony D'Avirro·31 juillet 2026
FriendBench compare 26 modèles de sept entreprises à des humains sur leur capacité à juger, à partir d'un clip de 20 secondes, si deux personnes sont familières ou étrangères. Les meilleurs modèles atteignent une précision statistiquement équivalente à celle des humains, mais avec un biais marqué vers la réponse "étrangers". Seuls les humains bénéficient réellement de l'ajout du signal visuel au-delà de la parole. Les stimuli, annotations humaines et prédictions des modèles sont publiés.