Toutes les news taguées avec ce sujet.
Un modèle multimodal apprend à construire une représentation 3D compacte de la scène pour raisonner comme un humain avant de formuler sa réponse.
Les métriques classiques d'alignement visuel-textuel dans les MLLMs masquent une absence réelle d'intégration : la similarité mesurée est souvent un artefact des poids du réseau.
Un nouveau benchmark évalue la capacité des modèles fondationnels à raisonner sur des relations spatiales topologiques.