Aller au contenu principal
Recherche vision-based pour dribble au football humanoïde par apprentissage de représentation privilégiée
RecherchearXiv cs.RO 

Recherche vision-based pour dribble au football humanoïde par apprentissage de représentation privilégiée

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche propose une nouvelle méthode d'apprentissage par renforcement pour le dribble de ballon chez les robots humanoïdes, appliquée en simulation à un Booster T1. Publiée le 12 juillet 2026 sur arXiv, l'approche intègre un encodeur de profondeur temporel directement dans la politique de contrôle via une couche de projection spécifique à la tâche, permettant au robot d'apprendre à dribbler uniquement à partir d'images de profondeur embarquées, sans estimation d'état explicite ni information privilégiée sur la scène. Les résultats chiffrés sont précis : 100% de réussite en dribble nominal vers une cible fixe, 96% avec un obstacle statique unique sur le trajet, mais seulement 46% de réussite face à un adversaire mobile qui tente activement de intercepter le ballon.

Cet écart de performance entre scénarios statiques et dynamiques est en soi la donnée la plus intéressante pour l'industrie robotique : il illustre concrètement le fossé qui sépare les démonstrations contrôlées des conditions réelles d'usage, un problème récurrent chez les humanoïdes commerciaux (Figure 03, Optimus, ou les plateformes utilisant des architectures VLA comme Pi-0 ou GR00T N2). Pour les intégrateurs et décideurs qui évaluent la maturité de la locomotion-manipulation embarquée, ce travail confirme qu'apprendre la perception et le contrôle de façon conjointe, plutôt que de les traiter comme deux modules séparés, améliore la robustesse face aux occlusions et aux mouvements rapides du ballon. Mais le taux de succès de 46% contre un adversaire actif montre que la gestion d'interactions dynamiques et imprévisibles reste un problème ouvert, loin d'être résolu à l'échelle.

Le travail s'inscrit dans la lignée des recherches sur le soccer humanoïde comme banc d'essai pour l'agilité robotique, un domaine où les approches classiques séparaient historiquement perception et contrôle moteur, au prix d'une fragilité en conditions réelles. Les auteurs positionnent leur méthode comme une base pour aborder des scénarios encore plus complexes impliquant des adversaires mobiles multiples, sans toutefois annoncer de calendrier de transfert vers un robot physique, l'ensemble des expériences restant à ce stade purement simulé.

À lire aussi

HARP-VLA : apprentissage de représentations alignées humain-robot pour modèle vision-langage-action
1arXiv cs.RO 

HARP-VLA : apprentissage de représentations alignées humain-robot pour modèle vision-langage-action

Des chercheurs ont publié le 31 mai 2026 HARP-VLA (Human-Robot Aligned Representation Learning for Vision-Language-Action), un framework de pré-entraînement conçu pour exploiter les vastes corpus de vidéos humaines dans l'apprentissage de politiques de manipulation robotique. Le coeur de l'approche repose sur deux composants entraînés conjointement : un encodeur visuel adapté aux robots et un modèle d'action latente. L'entraînement combine un petit nombre de démonstrations appariées humain-robot utilisées comme ponts inter-embodiment, et une quantité bien plus importante de vidéos non appariées des deux types comme supervision de dynamique. Sur le benchmark CALVIN ABC-D, HARP-VLA atteint un score moyen de 4,481 tâches consécutives réussies, et enregistre un gain de 7,1 points de pourcentage de taux de succès en conditions réelles par rapport à la meilleure baseline testée. Le problème que résout HARP est structurel pour tout le champ des VLA (Vision-Language-Action models) : les vidéos humaines sont abondantes et bon marché, mais les représentations visuelles qu'on en extrait sont mal alignées avec celles d'un robot, ce qui rend le co-entraînement inefficace voire contre-productif. Les modèles d'action latente existants, comme ceux utilisés dans les travaux sur UniPi ou Genie, réduisaient déjà le gap d'exécution en apprenant des abstractions d'action, mais restaient dépendants de features visuelles non alignées induisant des actions latentes domain-dépendantes. HARP introduit une perte d'alignement par discrimination relative de paires (source-relative pair-discriminative alignment loss) qui adapte les représentations robot vers la sémantique humaine sans effacer la discrimination inter-paires. Pour les intégrateurs et les équipes de recherche en manipulation, c'est un signal concret que le sim-to-real gap peut être partiellement adressé au niveau de la représentation, pas seulement du domaine de simulation. Ce travail s'inscrit dans une lignée de recherches sur l'apprentissage inter-embodiment qui a pris de l'ampleur depuis RT-2 (Google DeepMind, 2023) et OpenVLA (2024), lesquels montraient qu'un pré-entraînement sur données humaines ou web pouvait transférer vers des politiques robotiques. Les approches concurrentes directes incluent Octo, pi-0 de Physical Intelligence, et GR00T N2 de NVIDIA, tous confrontés à la même tension entre généralisation cross-embodiment et performance sur tâches précises. HARP se distingue en n'exigeant que peu de démonstrations appariées, ce qui réduit le coût de collecte de données. L'article reste pour l'instant une publication arXiv sans déploiement industriel annoncé, et les résultats en conditions réelles, bien que positifs, portent sur un nombre limité de configurations de manipulation.

RechercheOpinion
1 source
Retargeting dynamique direct pour l'apprentissage par imitation des humanoïdes à partir de vidéos
2arXiv cs.RO 

Retargeting dynamique direct pour l'apprentissage par imitation des humanoïdes à partir de vidéos

Une nouvelle méthode d'apprentissage par imitation pour robots humanoïdes vient d'être publiée sur arXiv (2605.23762, mai 2026), proposant un cadre à étape unique baptisé Direct Dynamic Retargeting (DDR). L'objectif est d'apprendre des comportements moteurs complexes à partir de simples vidéos monoculaires de démonstration humaine, sans capteurs de mouvement ni combinaisons de capture. Le défi central est morphologique : un humain et un robot humanoïde ne partagent ni les mêmes proportions, ni les mêmes centres de masse, ni les mêmes contraintes articulaires, ce qui rend la transposition directe des trajectoires impossible. Les approches standards, dites Geometric Retargeting ou Indirect Dynamic Retargeting, projettent d'abord le mouvement humain dans un espace cinématique intermédiaire avant de générer les commandes robot, introduisant ce que les auteurs appellent un biais géométrique qui restreint l'espace de solutions et produit des comportements sous-optimaux. DDR supprime cette étape intermédiaire en formulant le problème directement dans l'espace des tâches (task space), couplé à un solveur de contrôle prédictif par modèle (Model Predictive Control, MPC) à base d'échantillonnage, exécuté au sein d'un simulateur physique. Ce couplage permet au système d'optimiser nativement les séquences de contact sol-pied tout en limitant la dérive des entrées, garantissant la faisabilité dynamique des trajectoires générées. Les expériences montrent que DDR surpasse les méthodes de référence en précision de suivi des démonstrations. Plus significatif pour les praticiens : fournir ces références physiquement viables à un agent d'apprentissage par renforcement accélère la convergence de l'entraînement et améliore l'exécution finale de comportements agiles et d'équilibrage dynamique. L'apprentissage par imitation à partir de vidéo est devenu un axe majeur de la robotique humanoïde, porté par des travaux comme Pi-0 de Physical Intelligence ou les pipelines de données de téléopération développés chez Figure AI et Agility Robotics. Ces approches cherchent à exploiter l'immense corpus de vidéos de mouvements humains disponibles en ligne pour réduire le coût prohibitif de la collecte de données sur robot. DDR s'inscrit dans cette tendance mais attaque le problème par la dynamique plutôt que par la géométrie, un pari prometteur qui reste à valider en conditions réelles : aucun résultat physique sur robot n'est présenté dans cet article, uniquement des évaluations en simulation. Le code source sera rendu public, ce qui permettra à la communauté de reproduire et d'étendre ces résultats.

RecherchePaper
1 source
RayViT : représentations visuelles conditionnées par rayons pour l'apprentissage par imitation robuste au point de vue
3arXiv cs.RO 

RayViT : représentations visuelles conditionnées par rayons pour l'apprentissage par imitation robuste au point de vue

RayViT, ou Ray-conditioned Vision Transformer Encoder, est une nouvelle architecture légère proposée par des chercheurs pour rendre l'apprentissage par imitation visuelle plus robuste aux changements de camera. Le problème cible est simple: les politiques robotiques entraînées sur des images RGB brutes manquent d'indices géométriques explicites, ce qui les rend fragiles des qu'une camera est déplacée ou réorientée. RayViT injecte la géométrie de la camera directement dans des backbones ViT pré-entraines, en représentant cette géométrie sous forme de carte de rayons de Plucker, découpée en patches de features de rayons. Une attention croisée a portes (gated cross-attention) génère ensuite un token de classe conditionne par ces rayons, qui remplace le token de classe original du ViT tandis que les features de rayons sont ajoutées comme embeddings positionnels denses. Une fonction de perte auxiliaire par similarité cosinus renforce la cohérence de ces tokens géométriques. Sur le benchmark simulate RoboCasa multi-taches, la méthode améliore la robustesse d'environ 13 points de pourcentage face aux perturbations de camera, et sur des taches robotiques réelles multi-taches elle ajoute en moyenne 1,78 étape complétée par rapport aux méthodes de référence. L'enjeu dépasse la seule performance sur benchmark: c'est un problème très concret pour l'industrie robotique, ou les cameras embarquées se désalignent avec l'usure, les chocs ou des remontages successifs sur une chaine de production. Un système qui dégradé fortement des que le point de vue change n'est pas déployable a l'échelle chez un intégrateur, même s'il performe bien en démo contrôlée. En rendant les représentations visuelles conditionnées par la géométrie plutôt que par l'apparence brute, RayViT s'attaque directement a l'écart entre démonstration en laboratoire et fiabilité en conditions réelles, un des points de friction récurrents des approches VLA actuelles. Cette piste s'inscrit dans une tendance de recherche plus large visant a doter les politiques d'apprentissage par imitation d'une meilleure conscience 3D, plutôt que de compter uniquement sur le volume de données d'entrainement pour généraliser. En réutilisant des backbones ViT déjà pré-entraines et en ajoutant un module de conditionnement géométrique relativement léger, les auteurs proposent une voie peu couteuse a intégrer dans des pipelines existants, sans reentrainement complet du modèle visuel.

RecherchePaper
1 source
PACE : augmentation physique pour un apprentissage par renforcement coordonné de bout en bout, vers un tennis de table humanoïde polyvalent
4arXiv cs.RO 

PACE : augmentation physique pour un apprentissage par renforcement coordonné de bout en bout, vers un tennis de table humanoïde polyvalent

Des chercheurs du TRACE Lab de l'université Purdue ont publié PACE, un système d'apprentissage par renforcement qui traduit directement les positions de balle observées en commandes articulaires pour tout le corps, bras et jambes, au tennis de table humanoïde. Un prédicteur léger anticipe la trajectoire future de la balle, tandis qu'un second prédicteur physique fournit, à l'entraînement, des récompenses denses guidant l'exploration. En simulation, sur une plage variée de services, la politique atteint un taux de frappe réussie supérieur ou égal à 96% et un taux de succès supérieur ou égal à 92%. Déployé en zero-shot sur un robot Booster T1 à 23 articulations rotatives, le système produit un jeu de jambes coordonné avec des retours rapides et précis; le code est publié en open source en vue d'ICRA 2026. Ce résultat s'attaque à l'un des écarts les plus tenaces de la robotique humanoïde, celui entre démonstration et réalité: le tennis de table exige perception rapide, locomotion proactive et coordination bras-jambes sous contrainte de timing serré, un registre longtemps hors de portée du contrôle bout-en-bout. Le transfert zero-shot, fonctionnel sans réentraînement spécifique, apporte une preuve concrète que l'approche sim-to-real peut tenir sur des tâches dynamiques rapides, pas seulement sur de la marche ou de la manipulation lente. Pour les équipes de recherche, cela valide l'usage de prédicteurs physiques comme mécanisme de récompense à l'entraînement, une piste transférable à d'autres sports de raquette ou tâches exigeant réactivité et coordination corps entier. Ce travail s'inscrit dans une vague plus large de recherche sur les humanoïdes sportifs, alimentée par des démonstrations de course ou de manipulation dynamique chez Boston Dynamics, Unitree ou Figure, mais rarement documentée avec un tel niveau de détail méthodologique et de code ouvert. Le choix du Booster T1, plateforme chinoise de Booster Robotics, confirme sa place croissante dans la recherche académique en RL humanoïde, aux côtés des Unitree G1 et H1 plus répandus dans les laboratoires occidentaux. Les prochaines étapes attendues, en vue d'ICRA 2026, incluent des échanges plus longs et compétitifs, au-delà du simple retour de service, et des tests face à des adversaires humains réels.

RecherchePaper
1 source