Toutes les news taguées avec ce sujet.
Un nouveau benchmark teste si les modèles multimodaux peuvent deviner si deux personnes se connaissent déjà à partir d'un court échange filmé.
Une nouvelle métrique agnostique au modèle mesure la qualité des explications XAI en la comparant aux jugements humains, sur texte, image et données tabulaires.
VAD isole les preuves visuelles dans la distillation multimodale on-policy pour améliorer la reconstruction des cibles.
DeepMind dévoile Gemini Robotics 2, un système IA permettant aux robots de comprendre et d'agir avec tout leur corps.
Un nouveau modèle vise à généraliser sur des graphes multimodaux inédits sans adaptation ni fine-tuning, en modélisant des contextes hiérarchiques partagés.
Une architecture edge-cloud combinant vision et langage pour le dépistage précoce de maladies animales via agents.
Un nouveau benchmark de 2 960 diagrammes ER révèle les limites des modèles vision-langage sur les schémas conceptuels complexes.
Un nouveau modèle multimodal médical unifie imagerie 2D/3D et surpasse GPT-5.2 et Gemini-3-Flash sur la plupart des benchmarks testés.
Un nouveau modèle vision-langage de 3 milliards de paramètres, optimisé pour l'instruction et disponible en open-weights.
Une méthode RL exploitant les vues texte et image pour améliorer la cohérence des modèles de vision-language.
Un nouveau framework injecte des représentations 3D dans les modèles vision-langage à partir de simples vidéos RGB, sans capteur additionnel.
Moonshot AI publie un modèle léger de raisonnement visuel sur Hugging Face.
Une nouvelle architecture deep learning multimodal améliore l'identification précise de biomarqueurs via des capteurs nanopores.
Une méthode introduisant des tokens compacts pour guider précisément les DiTs selon des zones définies.
Un nouveau framework guide des agents de codage pour transformer des implémentations de référence en déploiements multi-GPU optimisés, avec des gains massifs de latence.
Un cadre utilisant des outils spécialisés et le reinforcement learning pour améliorer la vérification de réclamations scientifiques.
SceneBind permet une représentation omni-modale sémantique et spatiale pour la compréhension de scènes réalistes.
Un nouveau jeu de données combine vidéos et fils de commentaires TikTok pour étudier les prises de position politiques lors de l'élection américaine de 2024.
Thinking Machines Lab dévoile Inkling, un modèle MoE multimodal open Apache 2.0, accompagné d'une version légère Inkling-Small.
Un nouveau benchmark évalue la capacité des agents multimodaux à appeler des outils sur 500+ fonctions.
Une approche basée sur LoRA fusionne progressivement plusieurs modalités pour la reconnaissance d'actions en formation médicale.
Doorash utilise des jurys de LLM et de l'IA multimodale pour structurer les données de ses menus.
Une étude montre que pré-entraîner directement sur des documents visuels surpasse l'approche texte-only classique, sans passer par l'extraction de texte.
Moonshot AI présente un modèle VL compact pensant, accessible sur Hugging Face.
Un framework open-source qui transforme la génération vidéo en mécanisme de raisonnement séquentiel, alternatif au Chain-of-Thought textuel.
Un nouveau benchmark évalue les agents LLM sur des tâches réelles en conteneurs Docker, avec une stratégie en boucle fermée pour simuler des interactions humaines multi-tours.
Des chercheurs proposent MedPMC, un pipeline automatisé extrayant 11 millions de paires image-texte médicales depuis PubMed Central pour entraîner des foundation models.
Un modèle de fondation multimodal capable de raisonner sur des protéines, molécules et cristaux en préservant l'information structurelle native.
Des chercheurs proposent un cadre d'orchestration modulaire pour les modèles d'IA en oncologie, découplant la logique clinique des modèles sous-jacents.
Un nouveau framework résout les conflits de gradients entre modalités acoustique et sémantique qui dégradaient les modèles de parole full-duplex natifs.