Toutes les news taguées avec ce sujet.
Un modèle en deux étapes infère l'expression génique à partir de biopsies histopathologiques pour prédire la réponse complète au traitement.
Un modèle multimodal apprend à construire une représentation 3D compacte de la scène pour raisonner comme un humain avant de formuler sa réponse.
Une méthode de RL entraîne conjointement diagnostic textuel et révision d'image pour que les modèles unifiés corrigent leurs propres générations.
Un nouveau dataset multimodal vise à combler le manque de ressources non anglophones pour détecter le hate speech en contexte mexicain.
Une nouvelle architecture repositionne l'étape d'Encode comme point de contrôle du pipeline Encode-Prefill-Decode pour les MLLM.
Un nouveau framework combine LLM et alignement spectral pour inférer le sentiment humain malgré des modalités manquantes ou bruitées.
Runway détaille WorldPrompt, un format d'entrée pour piloter des simulations vidéo/audio générées en temps réel par son modèle GWM Worlds 2.
DeepMind dévoile Gemini 3.8 Live, intégrant une fonctionnalité Live Avatar pour des interactions multimodales en temps réel.
Un nouveau modèle combine vision et toucher pour prédire les dynamiques de contact, surpassant nettement les approches purement visuelles.
Alibaba dévoile Qwen 3.8 Omni Flash, un modèle multimodal rapide optimisé pour la voix et la vidéo.
PANORAMA améliore l'ancrage pixel des légendes VLM via la sélection de masques conditionnels et un benchmark dédié.
Un cadre multimodal UID-preserving pour reconstruire les chronologies cliniques à partir de données structurées et de récits.
Une méthode d'alignement multi-échelle par transport optimal améliore la cohérence structurelle de la musique générée depuis des vidéos de danse.
Une étude empirique sur huit jeux de données CGM montre que le fine-tuning léger surpasse les modèles zero-shot pour la prévision glycémique.
NVIDIA détaille une technique d'optimisation d'inférence qui sépare l'encodage visuel du prefill et du decode, avec des gains jusqu'à 5x.
Un nouveau Transformer multimodal et time-aware capable de modéliser et de prédire l'évolution clinique globale des patients.
Une étude systématique montre que les pertes spécifiques par tâche sont plus fiables que la reconstruction pour évaluer les tokenizers d'images.
Hugging Face dévoile NeoMME, un encodeur efficace et nativement multimodal pour le multilingue.
Un test de vision par LLM pour identifier des champignons révèle les limites et les risques de ces modèles sur des tâches à enjeu réel.
DeepMind introduit des capacités de compréhension vidéo agentic dans Gemini pour une analyse poussée.
Un nouveau cadre d'apprentissage permet de transférer les modèles de résistance au gel des cépages vers des régions peu documentées.