Toutes les news taguées avec ce sujet.
Une enquête technique suggère que le générateur de jeux Muse de Meta reposerait en partie sur un modèle OpenAI, et non uniquement sur une architecture maison.
Un modèle prédictif en espace latent aide les véhicules sous-marins télécommandés à anticiper les interactions de contact sans capteurs tactiles.
Un nouveau modèle du monde corrige les raisonnements bruités des agents LLM plutôt que de simuler les retours des outils.
Un nouveau modèle combine vision et toucher pour prédire les dynamiques de contact, surpassant nettement les approches purement visuelles.
Un nouveau modèle génère des explorations vidéo cohérentes sur plusieurs minutes grâce à une mémoire 3D interrogeable par point de vue.
Un framework domain-agnostic fondé sur la factorisation prédictive orthogonale unifie l'apprentissage de modèles du monde sur sept domaines distincts.
Un nouveau modèle combine vision et toucher pour prédire actions et dynamiques physiques, plus rapide que les backbones génératifs classiques.
Un backbone de diffusion masquée traite langage, vision, buts et actions comme des tokens discrets pour la robotique conditionnée par instructions.
Un framework léger convertit un générateur vidéo de 33B paramètres en modèle de monde interactif piloté par instructions en langage naturel.
World Labs présente Atlas, un modèle génératif capable de comprendre et de naviguer dans des environnements 3D interactifs.