Toutes les news taguées avec ce sujet.
Des chercheurs utilisent l'intelligence artificielle pour automatiser l'analyse des comportements de primates dans leur environnement naturel.
VAD isole les preuves visuelles dans la distillation multimodale on-policy pour améliorer la reconstruction des cibles.
Un framework CBF-RL améliore l'esquive de balles par des humanoïdes en couplant sécurité et perception embarquée réaliste.
Le framework DITL améliore le dépistage du cancer du sein en adaptant l'apprentissage aux caractéristiques des datasets.
Un développeur présente FeyNoBg, un outil open-source pour retirer automatiquement les arrière-plans d'images, avec code d'entraînement inclus.
Un nouveau transformer reconstruit en un seul passage la géométrie 3D et le mouvement structuré à partir d'une vidéo RGB monoculaire.
Bruce Schneier alerte sur des projets académiques du MIT qui développeraient des technologies de surveillance vidéo assistée par IA.
Face à la rareté des images de défauts industriels, des chercheurs génèrent des données synthétiques pour entraîner un détecteur d'objets performant.
Une méthode par continued-training améliore la segmentation sémantique RGB-D lors de pannes de capteurs.
Microsoft présente Mage-Flow, un modèle de fondation efficace pour la génération d'images à résolution native.
Une méthode introduisant des tokens compacts pour guider précisément les DiTs selon des zones définies.
Une méthode minimaliste rivalisant avec les modèles de diffusion sur ImageNet sans débruitage itératif.
L'essor de la surveillance par caméras Flock Soulève des questions sur le suivi automatisé des véhicules.
Une méthode d'entraînement certifié garantit une robustesse formelle des modèles de vision face aux flous de mouvement, surpassant l'Adversarial Training.
Un système combine LLM et méthodes causales pour explorer les liens entre météo, heures de pointe et densité du trafic à partir de vidéos de conduite.
MetaPerch exploite les metadata d'enregistrements comme signaux auxiliaires pour améliorer la robustesse des modèles de bioacoustique.
Une solution de reconnaissance optique de caractères performante et prête à l'emploi.
NVIDIA détaille comment ses nouvelles fonctions DeepStream 9.1 permettent de suivre un objet en 3D à travers plusieurs caméras.
DeepSeek annonce DeepSeek-OCR, un modèle performant pour l'extraction de texte à partir d'images.
La ville de Cape Coral envisage d'équiper ses camions de collecte de caméras IA pour scanner automatiquement les propriétés privées.