Aller au contenu principal
Phantom : entraîner des robots sans robots, uniquement avec des vidéos humaines
RecherchearXiv cs.RO 

Phantom : entraîner des robots sans robots, uniquement avec des vidéos humaines

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de chercheurs a publié Phantom (arXiv:2503.00779), un framework d'entraînement de politiques de manipulation robotique n'utilisant aucune donnée robot : uniquement des vidéos de démonstrations humaines. Le pipeline extrait les trajectoires via estimation de pose des mains (hand pose estimation), efface le bras humain par inpainting, puis superpose un rendu 3D du robot cible pour produire des paires observation-action directement exploitables. Déployé en zero-shot sur matériel réel sans fine-tuning, le système atteint jusqu'à 92 % de taux de réussite sur des tâches de manipulation d'objets déformables, de balayage multi-objets et d'insertion de composants. Les politiques supportent l'exécution en boucle fermée (closed-loop) et généralisent à des environnements inédits non vus à l'entraînement.

L'enjeu est la scalabilité des données. La téléopération, méthode dominante chez Figure, 1X ou Physical Intelligence, exige du matériel disponible, des opérateurs qualifiés et des sessions d'enregistrement coûteuses. En substituant des vidéos humaines à ces démos, Phantom compresse drastiquement le coût d'acquisition du dataset. Si les taux de réussite annoncés se confirment en dehors des conditions contrôlées du laboratoire, cela représenterait un argument solide contre le "reality gap" classique entre simulation et déploiement industriel. La capacité à généraliser sans fine-tuning, point souvent problématique pour les modèles VLA (Visual Language Action), mérite toutefois une validation sur des environnements plus variés que ceux présentés dans le papier.

Le problème des données hors-robot n'est pas nouveau : DexMV, ACT et les travaux autour de GR00T N2 de NVIDIA ont exploré des voies comparables, et Physical Intelligence avec pi-0 a parié sur la diversité massive de données multi-embodiment. Les approches sim-to-real via IsaacLab ou Genesis constituent les concurrents méthodologiques directs, contournant le même obstacle par la simulation plutôt que par la vidéo humaine. Phantom se distingue par sa légèreté : pas de flotte de robots nécessaire pour constituer le dataset initial. Le travail reste à ce stade une preuve de concept académique, sans partenariat ni déploiement industriel annoncé. La prochaine étape attendue serait une validation sur des morphologies robotiques variées et des tâches à précision sub-millimétrique.

À lire aussi

Apprentissage robotique à partir de vidéos humaines : une synthèse
1arXiv cs.RO 

Apprentissage robotique à partir de vidéos humaines : une synthèse

Une équipe de chercheurs a publié sur arXiv (arXiv:2604.27621) un état de l'art complet sur l'apprentissage des compétences robotiques à partir de vidéos humaines. Le papier recense les techniques permettant de transférer des habiletés gestuelles filmées vers des robots manipulateurs, en s'appuyant sur la masse de vidéos d'activités humaines disponibles en ligne. Les auteurs proposent une taxonomie hiérarchique structurée en trois axes : l'apprentissage orienté tâche (le robot déduit l'objectif), l'apprentissage orienté observation (alignement visuel entre humain et robot), et l'apprentissage orienté action (estimation directe des mouvements moteurs). Le survey couvre également les fondements de données, en analysant les principaux jeux de données de vidéos humaines existants ainsi que les schémas de génération vidéo synthétique. Une liste exhaustive des travaux référencés est disponible sur GitHub (IRMVLab/awesome-robot-learning-from-human-videos). Ce travail de synthèse arrive à un moment clé : le manque de données robotiques à grande échelle constitue aujourd'hui le principal goulot d'étranglement pour les systèmes d'IA incarnée généralistes. Les vidéos humaines représentent une ressource passive quasi illimitée, et leur exploitation pourrait contourner le coût exorbitant de la collecte de démonstrations téléopérées. Le papier analyse explicitement comment les différentes approches se comportent selon les paradigmes d'apprentissage (imitation, renforcement, diffusion) et les configurations de données, ce qui est directement utile pour des intégrateurs qui cherchent à choisir une architecture VLA (Vision-Language-Action) selon leur contrainte de données terrain. Le survey souligne aussi honnêtement les limitations du champ : le gap démo-réalité reste non résolu dans la plupart des pipelines, et les métriques de transfert restent hétérogènes d'un papier à l'autre. Ce type de survey émerge dans un contexte où plusieurs labos et startups misent sur le video-based learning comme levier de scalabilité : Physical Intelligence (pi-0), NVIDIA (GR00T N2), et Google DeepMind ont tous intégré des données humaines ou des vidéos internet dans leurs pipelines d'entraînement récents. Côté recherche académique, les travaux comme R3M, UniPi ou RoboAgent ont posé les jalons de cette approche ces deux dernières années. Ce survey offre donc une base de référence structurée pour les équipes qui entrent maintenant dans ce champ, avec des pistes de recherche ouvertes notamment sur la synchronisation temporelle corps-robot et la génération de données vidéo simulées pour la diversification des trajectoires.

UELes équipes de recherche françaises (CEA-List, INRIA) et les startups européennes travaillant sur des architectures VLA peuvent exploiter cette taxonomie structurée pour orienter leurs choix méthodologiques selon leurs contraintes de données terrain.

RecherchePaper
1 source
Robots acquièrent des compétences de manipulation en secondes grâce à une seule vidéo humaine
2arXiv cs.RO 

Robots acquièrent des compétences de manipulation en secondes grâce à une seule vidéo humaine

Des chercheurs ont présenté HOST (Human-to-robot One-Shot Skill AcquisiTion), un framework permettant à un robot d'acquérir une nouvelle compétence de manipulation à partir d'une seule vidéo humaine, en 29 secondes en moyenne au moment de l'inférence. Le système fonctionne par une cascade de prédictions auto-référencées : il estime d'abord la progression du robot dans la tâche démontrée, traduit cette progression en observations futures propres à l'embodiment du robot, puis en déduit les actions à exécuter. L'entraînement de cette cascade s'appuie sur une correspondance entre la trajectoire du robot et la vidéo de démonstration, projetées sur une même variété de progression de tâche, ce qui permet d'aligner les cibles d'apprentissage sur le déroulé futur de la vidéo. Sur les tâches testées, HOST atteint un taux de réussite moyen de 62%, soit 45 points de plus qu'une baseline zero-shot, tout en conservant les compétences déjà maîtrisées par le robot. Ce résultat s'attaque directement à un goulot d'étranglement connu du secteur de la robotique manipulatrice : les méthodes actuelles d'apprentissage de compétences reposent sur des boucles d'entraînement lourdes et coûteuses, qui en plus dégradent souvent les compétences précédemment acquises à chaque nouvel apprentissage (le problème dit du "catastrophic forgetting"). En affichant des performances supérieures à une baseline fine-tunée sur 50 démonstrations robot par tâche, tout en n'utilisant qu'une seule vidéo humaine et 507 fois moins de temps d'acquisition, HOST illustre une piste concrète pour réduire drastiquement le coût de déploiement des VLA (vision-language-action models) en environnement industriel réel, un enjeu central pour les intégrateurs qui doivent reconfigurer rapidement des cellules robotiques sur de nouvelles références produit sans campagne de collecte de données coûteuse. Cette approche s'inscrit dans la lignée des travaux récents sur l'apprentissage par imitation cross-embodiment, où des modèles comme GR00T N2 ou Pi-0 cherchent également à exploiter des données humaines ou hétérogènes pour accélérer l'apprentissage robotique. La contribution spécifique de HOST réside dans sa capacité à opérer en one-shot, à l'inférence, sans réentraînement du modèle sous-jacent, et sans effacer les compétences déjà en mémoire du robot. Les auteurs renvoient vers un site du projet pour des démonstrations complémentaires ; il s'agit à ce stade de résultats de recherche publiés sur arXiv, non d'un produit ou d'un déploiement industriel.

RecherchePaper
1 source
Robotique évoluée : améliorer l'efficacité humaine dans le post-entraînement de robots à grande échelle via un pipeline guidé par VLAC-Cut
3arXiv cs.RO 

Robotique évoluée : améliorer l'efficacité humaine dans le post-entraînement de robots à grande échelle via un pipeline guidé par VLAC-Cut

Les chercheurs à l'origine de ce rapport technique publié sur arXiv proposent un nouveau pipeline pour l'entraînement post-hoc des modèles Vision Language Action (VLA), ces systèmes qui permettent à un robot de traduire une consigne en langage naturel en actions physiques. Le constat de départ est simple: un seul cycle de collecte de données ne suffit jamais à corriger toutes les faiblesses d'un modèle, ce qui impose plusieurs rounds successifs de réentraînement. L'équipe organise le travail humain autour de deux rôles distincts, un téléopérateur formé qui intervient à distance uniquement sur les cas à forte valeur ajoutée et les démonstrations de récupération après échec, et un opérateur de terrain qui surveille plusieurs robots simultanément, déclenche les prises de contrôle et effectue les réinitialisations physiques. À cela s'ajoute VLAC CUT, un outil de curation automatique qui découpe les trajectoires autonomes des robots en segments utiles, en distinguant les portions qui font progresser la tâche, les phases d'inactivité, celles qui provoquent l'échec et celles de récupération, pour ne conserver que les données exploitables. Sur quatre tâches réelles de manipulation, les politiques finales atteignent entre 80 et 95% de taux de réussite et multiplient le débit de tâches par 1,7 à 4,2 par rapport au modèle de base. L'enjeu ici est économique autant que technique. Le vrai goulot d'étranglement du déploiement des VLA à grande échelle n'est pas la puissance de calcul mais le coût du travail humain de supervision et de téléopération, un point sensible pour toute l'industrie robotique qui vise la commercialisation de flottes de robots manipulateurs ou humanoïdes. En montrant qu'une réutilisation intelligente des trajectoires autonomes, combinée à une supervision humaine mieux répartie, surpasse un entraînement reposant uniquement sur l'humain dans la boucle à budget d'intervention égal, ce travail apporte un argument concret dans le débat sur la viabilité économique des VLA déployés en usine ou en entrepôt. Ce rapport s'inscrit dans la lignée des travaux récents sur l'apprentissage par imitation et le human-in-the-loop pour les VLA, où la collecte de démonstrations reste le principal poste de coût. Aucun partenaire industriel ni plateforme robotique spécifique n'est nommé dans cette publication académique, qui reste à ce stade validée sur un nombre restreint de tâches en laboratoire, sans indication de calendrier vers un déploiement à plus grande échelle.

RechercheActu
1 source
Co-entraînement avec vidéo égocentrique et démonstration pour la navigation robotique
4arXiv cs.RO 

Co-entraînement avec vidéo égocentrique et démonstration pour la navigation robotique

Des chercheurs ont publié sur arXiv (réf. 2606.01951) un cadre d'apprentissage par imitation pour robots mobiles qui exploite des vidéos égocentrées tournées par des humains en train de marcher. Le principe : estimer le mouvement de la caméra à partir de ces séquences piétonnes, puis convertir ce flux en représentations d'actions compatibles avec des robots mobiles au sol. Un modèle VLA (Vision-Language-Action) est ensuite entraîné conjointement sur ces données dérivées de vidéos humaines et sur des trajectoires collectées directement par le robot. Les expériences portent sur une tâche de navigation avec recherche de fruits, où le robot doit localiser des objets cibles dans un environnement non structuré en suivant des instructions en langage naturel. L'intérêt de cette approche réside dans sa réponse au principal goulot d'étranglement de la robotique apprise : la collecte de données sur robot réel est coûteuse, lente, et difficilement scalable. Si recycler des vidéos égocentrées humaines pour l'apprentissage de tâches de manipulation existe déjà dans la littérature (notamment via des datasets comme EPIC-Kitchens ou des pipelines type ACT), l'étendre à la navigation mobile reste difficile car les changements de point de vue lors de la locomotion créent des discontinuités que les modèles de manipulation ne rencontrent pas. Les résultats montrent que l'entraînement conjoint dépasse les deux sources de données prises isolément, aussi bien en compréhension du langage qu'en robustesse de génération d'actions. Cela valide partiellement l'hypothèse que le sim-to-human-video-to-real peut fonctionner pour la navigation, sans simulation physique. Ce travail s'inscrit dans une course plus large à la scalabilité des données pour les VLA, où des acteurs comme Physical Intelligence (pi0), Google DeepMind (RT-2, GR00T N2 pour Nvidia) ou Boston Dynamics cherchent des pipelines moins dépendants de la téléopération humaine sur robot. La navigation mobile reste moins couverte que la manipulation dans cette littérature, et ce papier ouvre une voie de co-training à moindre coût. Les prochaines étapes naturelles seraient d'évaluer la généralisation à des environnements plus complexes, de mesurer le ratio optimal données humaines/données robot, et de tester sur des plateformes AMR commerciales. Le code et les datasets ne sont pas encore publiés au moment de la soumission arXiv.

RechercheOpinion
1 source