Toutes les news taguées avec ce sujet.
Un simulateur GPU multi-agents rend les vues caméra de chaque agent en temps réel, permettant d'entraîner des politiques de conduite sans observations privilégiées.
Un nouveau modèle vision-langage de 3 milliards de paramètres, optimisé pour l'instruction et disponible en open-weights.
NVIDIA montre comment des agents de codage automatisés accélèrent l'adaptation de modèles de raisonnement visuel pour la production vidéo.
Des chercheurs de l'EPFL utilisent l'IA générative pour créer des stimuli visuels optimisés capables d'activer au maximum une zone précise du cerveau.
Un nouveau modèle Vision-Language-Action permet aux robots d'opérer depuis n'importe quel angle de caméra sans nécessiter de calibration extrinsèque préalable.
Un projet open-source qui donne aux LLMs la capacité d'analyser des vidéos en temps réel, sans dépendre d'API multimodales natives.