Aller au contenu principal
Brachiation robuste sur un robot bibras taille humaine grâce à l'apprentissage par renforcement guidé par points de passage
RecherchearXiv cs.RO 

Brachiation robuste sur un robot bibras taille humaine grâce à l'apprentissage par renforcement guidé par points de passage

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une prépublication arXiv (2608.17320), publiée mi-août 2026, décrit une méthode d'apprentissage par renforcement permettant à un robot bipède à deux bras de taille humaine de pratiquer la brachiation, le déplacement par les bras seuls comme chez les primates sur des barres suspendues. Baptisée Waypoint-Guided Reinforcement Learning (WGRL), la technique ne spécifie que quelques points de passage épars pour la trajectoire de l'effecteur terminal; le mouvement complet du corps est ensuite généré par renforcement, guidé par une récompense mêlant respect des points de passage, réussite de la tâche et efficacité énergétique. Conçu pour le transfert sim-to-real, l'entraînement a été validé par des essais sim-to-sim sur des parcours de barres à géométrie variable, puis par des tests sur le robot physique, confirmant une brachiation robuste avec récupération après échec de prise.

Le résultat s'attaque à un verrou resté ouvert sur les plateformes grandeur nature: la coordination fine et le timing précis pour saisir et relâcher un appui, sans données de démonstration humaine disponibles, la tâche étant trop spécifique pour un jeu d'apprentissage par imitation. En s'appuyant sur de simples points de passage plutôt que sur des trajectoires complètes annotées, la méthode contourne ce manque de données, un frein courant à l'apprentissage par renforcement en robotique réelle. Pour les chercheurs en locomotion et les intégrateurs travaillant sur des humanoïdes, elle élargit les modes de déplacement envisageables au-delà de la marche bipède, qui concentre l'essentiel des efforts du secteur, vers des structures, échafaudages ou sites industriels sans appui continu au sol.

La brachiation robotique est étudiée depuis plusieurs décennies, mais les démonstrations concluantes restaient jusqu'ici cantonnées à des simulateurs ou à des robots miniatures et légers, la coordination bras-corps se compliquant nettement à l'échelle humaine entre inertie et contraintes de couple. Ce travail prolonge un courant de recherche qui combine apprentissage par renforcement et transfert sim-to-real pour la locomotion dynamique, déjà exploité pour la marche et la course des humanoïdes bipèdes. L'article ne précise ni le laboratoire d'origine ni le nom commercial de la plateforme testée, et présente ses résultats comme des lignes directrices méthodologiques réutilisables plutôt que comme un produit finalisé, sans calendrier de déploiement ni partenariat industriel annoncé.

Dans nos dossiers

À lire aussi

RobotDancing : l'apprentissage par renforcement à action résiduelle permet un suivi robuste des mouvements humanoïdes sur le long terme
1arXiv cs.RO 

RobotDancing : l'apprentissage par renforcement à action résiduelle permet un suivi robuste des mouvements humanoïdes sur le long terme

Des chercheurs présentent RobotDancing, une méthode d'apprentissage par renforcement en une seule étape pour faire exécuter à des robots humanoïdes des mouvements de danse longs et dynamiquement exigeants, avec une robustesse accrue face aux erreurs d'accumulation. Le principe : plutôt que de demander à la politique de recréer entièrement un mouvement de référence retargeté (transposé depuis une capture humaine vers la cinématique du robot), RobotDancing prédit des corrections résiduelles sur les cibles articulaires. La politique se concentre ainsi sur la compensation des écarts dynamiques entre la référence et le robot réel (limites d'actionneurs, latence, friction, inertie) plutôt que sur la resynthèse complète du geste. Une politique est entraînée par séquence de référence, avec une recette d'entraînement et de déploiement commune réutilisée entre mouvements et plateformes. L'équipe a évalué la méthode sur huit chorégraphies issues du jeu de données LAFAN1, exécutées sur le robot Unitree G1, avec des expériences complémentaires de transfert inter-plateforme sur les Unitree H1 et H1-2. Le problème ciblé est central dans la robotique humanoïde actuelle : les mouvements retargetés depuis des captures humaines sont cinématiquement plausibles mais dynamiquement incohérents avec le robot réel, ce qui fait dériver le suivi de trajectoire sur les séquences longues et finit par déstabiliser le contrôleur. En montrant des politiques G1 capables d'exécuter des comportements longs et énergétiques directement sur matériel, sans ajustement au moment du test, RobotDancing apporte un signal concret sur la viabilité du transfert simulation-vers-réel pour du contrôle whole-body à haute dynamique, un point souvent démontré en vidéo mais rarement quantifié avec rigueur dans la littérature. Le travail s'inscrit dans la lignée des méthodes de motion tracking par RL pour humanoïdes, où LAFAN1 sert de banc d'essai de référence pour les mouvements complexes. La publication, une version révisée sur arXiv (2509.20717v2), inclut des clips qualitatifs sur H1 et H1-2 pour illustrer la généralisation inter-plateforme, sans toutefois fournir de métriques chiffrées équivalentes à celles obtenues sur le G1, ce qui invite à la prudence sur l'ampleur réelle du transfert démontré.

RecherchePaper
1 source
Récupération robuste après chute pour robots bipèdes à roues sans bras par apprentissage guidé par les forces
2arXiv cs.RO 

Récupération robuste après chute pour robots bipèdes à roues sans bras par apprentissage guidé par les forces

Des chercheurs présentent FTSR (Force-guided Teacher-student framework with Stage-wise Rewards), une méthode d'apprentissage par renforcement pour la récupération après chute des robots bipèdes à roues sans bras, publiée sur arXiv en juin 2026 (arXiv:2606.14270). En simulation, une force auxiliaire externe corrélée en temps réel à la hauteur du robot est formulée comme contrainte optimisable : l'algorithme d'apprentissage contraint pousse la politique à réduire progressivement sa dépendance à cette force tout en relevant le corps. Une architecture teacher-student distille la connaissance privilégiée des dynamiques de récupération, structurée par des récompenses progressives par seuils de hauteur (height-progressive stage-wise rewards). La politique est ensuite déployée sur un robot bipède à roues sans bras physique, testée dans des conditions variées et difficiles, et transfère également à un humanoïde à nombreux degrés de liberté (high-DOF). Sans bras ni pattes supplémentaires pour générer des forces d'appui, un bipède à roues figure parmi les morphologies robotiques les plus contraintes pour la récupération après chute. FTSR contourne ce verrou en injectant une force auxiliaire virtuelle pendant l'entraînement en simulation, puis en la supprimant graduellement via une contrainte optimisable : le robot développe ainsi des stratégies de redressement internes sans jamais dépendre d'un artefact absent en conditions réelles. La validation sim-to-real sur robot physique, combinée à la généralisation à un humanoïde high-DOF sans sur-adaptation à une cinématique spécifique, renforce la crédibilité pratique de l'approche pour les équipes travaillant sur plusieurs plateformes. C'est précisément ce gap entre démonstration en simulation et déploiement physique robuste que FTSR cherche à combler, avec des résultats qui méritent d'être suivis. Les robots bipèdes à roues occupent une niche croissante entre les AMR classiques et les humanoïdes complets : ils combinent mobilité sur terrain plat et capacité partielle à franchir des obstacles, à un coût mécanique inférieur. Sur le problème précis de la récupération après chute, les travaux existants se concentrent sur les humanoïdes avec bras (Boston Dynamics Atlas) et les quadrupèdes multi-pattes (ANYmal d'ANYbotics, Unitree Go2), laissant peu de littérature sur les morphologies intermédiaires sans membres supérieurs. FTSR reste à ce stade un preprint arXiv sans déploiement industriel annoncé et sans plateforme commerciale nommée ; les suites naturelles seraient une évaluation sous perturbations extérieures actives et une intégration dans une stack de navigation autonome complète.

RecherchePaper
1 source
Apprentissage d'une exécution robuste en manipulation robotique par apprentissage par renforcement à base d'agents
3arXiv cs.RO 

Apprentissage d'une exécution robuste en manipulation robotique par apprentissage par renforcement à base d'agents

Traduction en cours. Ce papier de recherche s'attaque à un problème central de la manipulation robotique : la fragilité d'exécution face à l'incertitude et aux tâches longues, où une petite déviation peut faire échouer toute une séquence d'actions. Les modèles vision-langage-action (VLA) actuels, malgré leurs bonnes capacités de généralisation, manquent de mécanismes explicites pour détecter qu'une exécution dérape et pour s'en remettre. Les auteurs proposent deux contributions complémentaires : des métriques permettant d'évaluer en temps réel la qualité de l'exécution, et un cadre d'apprentissage par renforcement dit "agentique", où une politique de haut niveau observe l'historique récent d'exécution et choisit parmi un petit ensemble de modes d'exécution pour réguler le comportement du robot. Plutôt que de réapprendre directement les actions bas niveau, cette politique déclenche des mécanismes de récupération qui ramènent le robot vers des états nominaux déjà visités, permettant à la tâche de reprendre son cours. Testée sur le benchmark LIBERO, la méthode améliore le taux de réussite jusqu'à 13,7% en conditions standards, et jusqu'à 39,2% en conditions perturbées. L'enjeu dépasse la simple performance chiffrée : c'est une réponse directe à l'écart entre démonstration et réalité qui pénalise l'industrie humanoïde et les intégrateurs. Un modèle VLA capable d'enchaîner des tâches en laboratoire s'effondre souvent dès qu'un objet glisse, qu'un capteur bruite, ou qu'une perturbation externe survient sur une ligne réelle. En ajoutant une couche de supervision qui détecte la dérive et enclenche une correction plutôt que de laisser le modèle bas niveau tenter d'improviser, cette approche s'attaque directement à la robustesse, le principal frein à la mise en production de bras manipulateurs et d'humanoïdes en environnement industriel non contrôlé. Le gain nettement plus marqué en conditions perturbées (39,2%) qu'en conditions standards (13,7%) suggère que le bénéfice réel se manifeste précisément là où les décideurs B2B en ont besoin: en présence d'aléas, pas en démo scriptée. Ce travail s'inscrit dans la lignée des recherches récentes sur les modèles VLA généralistes (dans la veine de Pi-0 ou GR00T N2), qui ont démontré une capacité de généralisation impressionnante mais restent critiqués pour leur manque de garanties d'exécution en conditions réelles. En séparant la décision de haut niveau (quel mode d'exécution adopter) de l'apprentissage bas niveau des actions, les auteurs évitent de devoir réentraîner l'ensemble du modèle VLA pour gagner en robustesse, une approche modulaire qui pourrait s'intégrer à des piles existantes plutôt que les remplacer. Reste à voir si cette architecture agentique se transpose au-delà du benchmark simulé LIBERO vers des déploiements physiques réels, où la latence de décision et la diversité des modes de défaillance sont bien plus complexes qu'en simulation.

RecherchePaper
1 source
Une approche hors ligne d'apprentissage par renforcement guidé par fNIRS pour le comportement des robots
4arXiv cs.RO 

Une approche hors ligne d'apprentissage par renforcement guidé par fNIRS pour le comportement des robots

Une nouvelle étude, publiée sur arXiv (2607.14393v1) mi-juillet 2026, explore la possibilité de piloter l'apprentissage par renforcement de robots à l'aide de signaux cérébraux captés par spectroscopie proche infrarouge fonctionnelle (fNIRS), une technique d'imagerie optique non invasive. Les chercheurs testent leur approche en simulation, en comparant des agents entraînés sur des tâches d'interaction passive (l'humain observe) et active (l'humain démontre l'action). Plusieurs méthodes d'intégration du signal neural dans l'algorithme de RL sont évaluées, avec un choix de conception clé : le signal cérébral vient augmenter les paramètres existants plutôt que les remplacer. L'équipe étudie aussi l'impact de la granularité du modèle et du bruit sur la qualité de l'apprentissage. Résultat principal, le signal fNIRS améliore les performances lorsqu'il sert à pondérer les priorités de trajectoire et les valeurs Q état-action, et le système fonctionne aussi à partir de données hors ligne, sans capture en temps réel. Ce dernier point est le plus significatif pour le secteur. L'apprentissage par renforcement avec humain dans la boucle est déjà largement utilisé pour aligner le comportement des robots sur les préférences des utilisateurs, généralement via des démonstrations, des retours explicites ou des comparaisons de trajectoires. Un signal cérébral direct promettrait un canal de préférence plus rapide et moins intrusif que les méthodes actuelles. Mais les interfaces cerveau-machine en temps réel restent lourdes à déployer hors laboratoire. En montrant que le cadre fonctionne aussi avec des données fNIRS collectées hors ligne, l'étude ouvre une voie plus réaliste pour intégrer ce type de signal sans exiger un dispositif BCI branché en continu, un obstacle pratique majeur pour toute application au-delà de la recherche. Ce travail s'inscrit dans la lignée des recherches sur l'apprentissage par renforcement guidé par préférences humaines, déjà central dans l'entraînement des agents conversationnels et de plus en plus exploré pour la robotique physique. Il reste toutefois à un stade précoce : validation uniquement en simulation, pas de test sur robot réel, et l'abstract ne précise ni le nombre de participants ni l'institution porteuse. Les prochaines étapes attendues concernent vraisemblablement le passage à des environnements physiques et l'élargissement du panel de sujets testés.

RecherchePaper
1 source