Aller au contenu principal
L'architecture du critique est cruciale : critiques doubles ou unifiés pour la loco-manipulation des humanoïdes
RecherchearXiv cs.RO 

L'architecture du critique est cruciale : critiques doubles ou unifiés pour la loco-manipulation des humanoïdes

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une étude publiée sur arXiv le 11 juin 2026 (réf. 2606.11891) présente une comparaison rigoureuse de deux architectures de critique en apprentissage par renforcement multi-objectifs pour robots humanoïdes : un critique unifié (un seul réseau estimant la valeur combinée de tous les objectifs) contre des critiques duaux (deux réseaux distincts, chacun associé à un signal de récompense séparé, l'un pour la locomotion, l'autre pour la manipulation). Les expériences ont été conduites sur le Unitree G1, un humanoïde à 23 degrés de liberté actifs, dans le simulateur NVIDIA Isaac Lab, via un curriculum séquentiel de 13 niveaux progressant de l'atteinte stationnaire jusqu'à la marche avec des cibles à orientation variable. Résultat : les politiques entraînées avec critiques duaux atteignent leurs cibles 3,5 fois plus vite (6,5 pas de simulation contre 22,6), affichent un débit deux fois supérieur (14,3 contre 7,0 atteintes validées pour 1 000 pas), et un taux de réussite validé de 65,2 % contre 53,8 % pour le critique unifié.

Ce que l'étude démontre, c'est que le choix de l'architecture du critique est un levier de conception primaire, souvent négligé, dont l'impact surpasse celui du reward engineering. Fait notable : l'ajout de mécanismes anti-gaming, conçus pour empêcher la politique d'exploiter les failles de la fonction de récompense, ne produit aucun gain au-delà du changement architectural seul (60,9 % contre 65,2 %). L'implication la plus immédiate concerne le fine-tuning RL de politiques pré-entraînées par imitation : lorsqu'on affine un modèle de manipulation déjà appris (style Pi-0 ou GR00T N2), un critique unifié risque de supprimer les comportements acquis par interférence des gradients de locomotion. Pour les équipes qui cherchent à spécialiser des modèles de fondation robotiques par RL, cette mise en garde est directement opérationnelle.

Le Unitree G1, vendu autour de 16 000 dollars, est devenu un banc de test standard pour la recherche en humanoïde abordable, face aux plateformes de Figure AI, Agility Robotics ou 1X Technologies qui opèrent sur des gammes de prix bien supérieures. NVIDIA Isaac Lab, successeur d'Isaac Gym, s'est imposé comme l'environnement de référence pour l'entraînement sim-to-real. La question du découplage locomotion/manipulation en RL multi-objectifs est au coeur de plusieurs groupes de recherche (Stanford, CMU, ETH Zurich), et les résultats de cette étude, issus d'un cadre contrôlé et reproductible, offrent une base solide pour orienter les choix d'architecture avant tout entraînement coûteux sur robot réel.

À lire aussi

Apprentissage de politiques par simulation pour la loco-manipulation des robots humanoïdes
1arXiv cs.RO 

Apprentissage de politiques par simulation pour la loco-manipulation des robots humanoïdes

Une équipe de chercheurs a publié le 9 juin 2026 sur arXiv (2606.08278) SIMPLE, un banc de test de simulation unifié pour l'apprentissage et l'évaluation de politiques de contrôle de robots humanoïdes. La plateforme couple la simulation de dynamique de contact de MuJoCo avec le rendu photoréaliste d'IsaacSim, et propose 60 tâches de loco-manipulation plein corps, 50 scènes d'intérieur et plus de 1 000 assets d'objets. Pour la collecte de données, deux pipelines sont intégrés : génération automatisée de trajectoires par planification de mouvement, et interface de téléopération VR à faible latence. Les auteurs y benchmarkent plusieurs familles de politiques humanoïdes : réseaux d'imitation légers, grands modèles vision-langage-action (VLA) et les récents modèles d'action du monde (WAM, World Action Models). Les expériences démontrent, selon les auteurs, un transfert zero-shot vers des robots humanoïdes physiques dans des configurations similaires. L'enjeu central est un goulot d'étranglement d'évaluation : les modèles fondationnels humanoïdes progressent plus vite que les protocoles pour les tester. Les benchmarks existants se concentrent sur la robotique de table ou les robots à roues, sans couvrir la loco-manipulation plein corps, compétence clé pour les humanoïdes déployés en environnement industriel ou domestique. Si la corrélation sim-to-real revendiquée dans l'article se confirme à plus grande échelle, elle légitime le recours massif à la simulation pour entraîner des politiques de contrôle, réduisant drastiquement les coûts de collecte de données en conditions réelles. C'est précisément le pari industriel de Physical Intelligence avec pi-0, et de Figure AI avec Figure 02 : remplacer les démos téléopérées coûteuses par des pipelines simulés reproductibles. La fragmentation des benchmarks est un problème structurel en robotique humanoïde : chaque laboratoire publie sur ses propres protocoles, rendant toute comparaison inter-équipes difficile. Des initiatives comme HumanoidBench, RoboVerse ou Isaac Lab ont tenté d'y répondre, mais sans couvrir la chaîne complète loco-manipulation avec rendu photoréaliste et pipelines de données intégrés. SIMPLE se positionne à cette intersection. Les équipes de Google DeepMind (GR00T N2, Helix), Agility Robotics (Digit) et Boston Dynamics sont directement concernées. Ce preprint arXiv n'est pas encore évalué par les pairs ; l'adoption par la communauté dépendra de la disponibilité publique du code et des assets, non encore confirmée.

RecherchePaper
1 source
LUCID : contrôle unifié des compétences latentes via une dynamique imaginée pour la loco-manipulation humanoïde à long terme
2arXiv cs.RO 

LUCID : contrôle unifié des compétences latentes via une dynamique imaginée pour la loco-manipulation humanoïde à long terme

Le laboratoire de recherche à l'origine du papier arXiv:2608.07746v1 (soumis en catégorie cross-listing, daté d'août 2026) présente LUCID, acronyme de "Latent-Skill Unified Control via Imagined Dynamics", un framework d'apprentissage par renforcement hiérarchique et basé sur un modèle du monde, destiné aux tâches de loco-manipulation humanoïde longue durée. La méthode se déroule en deux temps : une politique bas niveau, conditionnée par des codes latents structurés, est d'abord entraînée par imitation adversariale puis gelée ; un modèle de dynamique de haut niveau ("macro-dynamics world model") est ensuite appris conjointement avec une politique de décision, ce modèle prédisant les transitions d'état à horizon étendu induites par chaque décision latente, ce qui permet d'optimiser la politique haut niveau via des simulations imaginées plutôt que par essais réels. Les auteurs évaluent LUCID sur des scénarios simulés de réarrangement multi-objets et rapportent une amélioration du taux de réussite complète des tâches ainsi que des taux de complétion partielle, comparés à des méthodes de référence combinant planificateurs scriptés, automates à états finis ou politiques model-free spécifiques à une tâche. Le problème visé est celui de la coordination longue durée chez les robots humanoïdes : enchaîner marche, atteinte et préhension sur des séquences complexes sans dépendre d'automates codés à la main, un goulot d'étranglement que les démonstrations courtes de nombreux acteurs du secteur (modèles VLA type Pi-0, GR00T N2 ou Helix) laissent souvent dans l'ombre. En remplaçant la planification scriptée par un modèle du monde appris, capable de projeter les conséquences de décisions latentes avant de les exécuter, LUCID propose une alternative architecturale aux pipelines VLA end-to-end dominants, ce qui intéresse directement les intégrateurs cherchant à fiabiliser des tâches multi-étapes en logistique ou en usine plutôt qu'à empiler des démonstrations isolées. Il s'agit toutefois d'une contribution strictement académique et simulée : aucun robot physique, aucune entreprise ni aucun site de déploiement n'est mentionné dans l'abstract, et les gains rapportés portent uniquement sur des environnements de simulation de réarrangement d'objets, sans chiffres de charge utile, de degrés de liberté ou de temps de cycle réels. LUCID s'inscrit dans la lignée des travaux sur les modèles du monde appliqués à la robotique (dans l'esprit de Dreamer ou TD-MPC), en offrant une voie hiérarchique et modulaire face à l'approche monolithique des modèles VLA. Aucun essai matériel, partenariat industriel ou calendrier de transfert vers un robot réel n'est annoncé à ce stade.

RecherchePaper
1 source
CWI : système d'imitation du corps entier pour la loco-manipulation de robots humanoïdes
3arXiv cs.RO 

CWI : système d'imitation du corps entier pour la loco-manipulation de robots humanoïdes

Des chercheurs ont publié fin juin 2026 sur arXiv (réf. 2606.27676) le framework CWI (Composite Whole-Body Imitation), une architecture de contrôle pour robots humanoïdes visant à coordonner locomotion et manipulation bimanuelle en simultané. Le système a été évalué en simulation puis déployé sur un LimX Oli, humanoïde pleine taille du fabricant chinois LimX Robotics. L'approche repose sur une dissociation du recours aux données de capture de mouvement (MoCap) : les données MoCap de manipulation diversifiées pilotent le contrôle du haut du corps, tandis que la locomotion est guidée par deux discriminateurs adversariaux (Adversarial Motion Prior, AMP) entraînés sur des clips curatés de marche et d'accroupissement. Une architecture multi-critique réduit les conflits entre objectifs de locomotion, de manipulation et de style de mouvement ; une étape de distillation enseignant-élève produit ensuite une politique conditionnée uniquement sur les poses des mains et des commandes de vitesse et hauteur. La loco-manipulation reste l'un des verrous majeurs de la robotique humanoïde. Les méthodes purement par renforcement, sans MoCap, souffrent de récompenses creuses et nécessitent des curricula finement réglés ; les méthodes imitant le corps entier butent sur le déséquilibre des datasets, les trajectoires de locomotion trop dynamiques dégradant la stabilité globale. CWI propose une dissociation architecturale qui contourne les deux écueils. Le résultat pratique est une téléopération sans équipement MoCap complet, ce qui abaisse le seuil d'intégration industrielle. Pour les intégrateurs et les décideurs B2B, cela signifie qu'un humanoïde capable d'agir dans des environnements mixtes (déplacements et saisie d'objets) devient envisageable sans infrastructure de capture de mouvement coûteuse. Cela dit, la publication ne fournit aucune métrique de temps de cycle ni de volumes de déploiement, ce qui invite à lire ces résultats comme une preuve de concept compétitive, pas comme un produit shipé. CWI s'inscrit dans une vague de travaux combinant apprentissage par renforcement et imitation de mouvement humain, dont l'Adversarial Motion Prior (AMP) de Peng et al. constitue la brique fondatrice. LimX Robotics reste un acteur discret face aux mastodontes du secteur : Figure AI (Figure 03), Tesla (Optimus Gen 3), Physical Intelligence (Pi-0) ou encore Boston Dynamics (Atlas) travaillent sur des architectures comparables intégrant contrôle corps entier et politiques Vision-Language-Action (VLA). CWI ne mentionne ni calendrier de déploiement industriel, ni partenariat commercial : il s'agit d'un preprint arXiv sans revue par les pairs publiée. Les prochaines étapes probables passeront par une validation en conditions réelles plus variées et une publication dans une conférence robotique de référence (ICRA, IROS ou RAL).

RecherchePaper
1 source
Fermeture de la boucle en VLA humanoïde : jetons d'objets 3D persistants pour une loco-manipulation vérifiable
4arXiv cs.RO 

Fermeture de la boucle en VLA humanoïde : jetons d'objets 3D persistants pour une loco-manipulation vérifiable

Des chercheurs viennent de publier sur arXiv (2607.18016v1) une nouvelle méthode baptisée Persistent Object Tokenization (POT), testée sur un robot humanoïde Unitree G1 dans le cadre d'un système appelé POT-VLA. Le problème ciblé est ce que les auteurs nomment la "divergence d'état objet" : dans les politiques vision-langage-action (VLA) actuelles, l'état de l'objet utilisé pour décider d'un mouvement du corps entier peut différer de celui utilisé ensuite pour vérifier si l'action a bien produit la relation physique voulue, un décalage qui devient critique lors de déplacements, contacts, occlusions ou phases de récupération. POT maintient des enregistrements 3D d'objets indexés par rôle, construits à partir d'observations RGB-D, et les convertit en tokens exploitables par un module d'action corps entier. Sur huit familles de tâches réelles, POT-VLA fait passer le taux de réussite de 39 sur 80 à 71 sur 80 par rapport à une base directe GR00T-N1.7 comparable. Sur un protocole externe aligné sur le benchmark Being-0, le système obtient 44 succès sur 50 tâches de service, contre 37 sur 50 rapportés dans l'article Being-0 original. Pour l'industrie de la robotique humanoïde, ce travail s'attaque à un angle mort souvent glissé sous le tapis dans les démonstrations impressionnantes : la capacité réelle à maintenir une relation géométrique correcte entre un bras et un objet pendant une tâche longue, plutôt que la seule génération d'une trajectoire plausible. En rendant l'état objet à la fois exploitable et vérifiable via des contrôles de prédicats géométriques, le système ferme la boucle entre perception et exécution, un point sensible pour les intégrateurs qui cherchent des garanties de fiabilité au-delà des vidéos de démonstration soigneusement sélectionnées. Les gains les plus marqués concernent justement les tâches nécessitant le maintien prolongé d'une relation 3D, ce qui suggère que l'abstraction d'objet persistant comble une limite structurelle des architectures VLA actuelles plutôt qu'un simple réglage fin. Ce papier s'inscrit dans la course actuelle autour des politiques VLA pour humanoïdes, dominée par des architectures comme GR00T (NVIDIA), utilisée ici comme base de comparaison directe, et des benchmarks de référence comme Being-0 pour les tâches de service. L'usage d'un Unitree G1, plateforme largement adoptée dans la recherche académique en loco-manipulation, ancre les résultats dans un cadre reproductible plutôt que propriétaire. Les auteurs ne mentionnent pour l'instant ni déploiement pilote ni calendrier de commercialisation : il s'agit d'une contribution de recherche, destinée à être étendue à davantage de familles de tâches et potentiellement intégrée à d'autres piles VLA que GR00T.

RecherchePaper
1 source