RECHERCHE
X-Reset : passer à l'échelle le RL centré-objet grâce à des resets cross-embodiment
Un nouveau cadre de RL utilise des démonstrations main-objet humaines pour résoudre l'exploration en manipulation robotique dextre.
arXiv cs.AI · cs.LG · cs.CL·Prithwish Dan, Chenyang Ma, Wei Zhan·28 septembre 2026
X-Reset retargete cinématiquement des états main-objet humains vers des états robot bruités, filtre les configurations instables en simulation, puis les échantillonne comme resets durant l'entraînement RL avec des récompenses centrées-objet génériques. La politique résultante ne dépend que de l'état de l'objet et de l'objectif. Le système entraîne des politiques généralistes sur 20 objets et trois embodiments (main 22-DoF sur deux bras, pince parallèle), généralise à des objets inédits et transfère en zero-shot du simulateur au réel.