Toutes les news taguées avec ce sujet.
Cortex propose une interface de planification hiérarchique reliant VLM et VLA pour réaliser des tâches robotiques complexes en plusieurs étapes.
Un nouveau modèle Vision-Language-Action permet aux robots d'opérer depuis n'importe quel angle de caméra sans nécessiter de calibration extrinsèque préalable.
Une approche en deux étapes qui sépare compétence motrice et alignement sémantique pour réduire drastiquement le besoin en données expertes.
Des chercheurs présentent FurnitureVLA, premier système robotique bimanuels capable d'assembler des meubles réels grâce à un modèle Vision-Language-Action.