Aller au contenu principal
Robots: apprentissage à double processus des compétences atomiques, découplant raisonnement sémantique et contrôle temps réel
RecherchearXiv cs.RO 

Robots: apprentissage à double processus des compétences atomiques, découplant raisonnement sémantique et contrôle temps réel

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Cette semaine, une équipe de recherche publie sur arXiv (référence 2607.10625v1) un nouveau framework baptisé DASL, pour Dual-Process Atomic Skill Learning, destiné à l'apprentissage par imitation conditionné par le langage pour les robots. Le problème visé est concret : quand un robot doit exécuter une instruction en langage naturel composée de plusieurs étapes, les approches hiérarchiques existantes, qui décomposent la tâche en compétences atomiques, souffrent d'instabilité à l'entraînement et d'un phénomène de "codebook collapse", causé par un couplage trop étroit entre le raisonnement de haut niveau et la génération d'actions bas niveau lorsque les deux sont entraînés conjointement. DASL répond à ça en séparant clairement deux modules : une Slow-Frequency Policy qui prédit des compétences discrètes et interprétables via quantification vectorielle, et une High-Frequency Policy qui s'appuie sur un modèle de diffusion latent combiné à un Decision Transformer pour générer les actions précises, conditionnées par ces compétences. Les deux tournent de façon asynchrone. Sur des benchmarks de simulation et des expériences réelles, DASL dépasse significativement les méthodes de référence de l'état de l'art, en particulier sur la généralisation compositionnelle à des instructions jamais vues à l'entraînement. Le code est disponible sur GitHub.

L'enjeu dépasse la seule performance benchmark : c'est un signal de plus que la généralisation compositionnelle, le vrai goulot d'étranglement des modèles vision-langage-action (VLA) déployés en usine ou en logistique, reste un problème d'architecture autant que de données. Découpler la lenteur du raisonnement sémantique de la rapidité du contrôle moteur fait écho à une intuition déjà présente chez d'autres équipes travaillant sur les VLA à grande échelle, où le mélange des deux niveaux dans un seul réseau tend à fragiliser l'apprentissage dès que le nombre de compétences ou la diversité des instructions augmente.

Le nom du framework s'inspire explicitement de la théorie du double processus en sciences cognitives, celle qui distingue une pensée rapide et intuitive d'une pensée lente et délibérative. DASL s'inscrit dans la lignée des travaux récents sur les politiques hiérarchiques pour la robotique conditionnée par le langage, où la tension entre interprétabilité des compétences et précision du contrôle reste un axe de recherche actif ; la publication du code laisse la porte ouverte à une réplication et une comparaison directe avec d'autres architectures du domaine.

À lire aussi

Apprentissage de compétences atomiques sémantiques pour la manipulation robotique multitâche
1arXiv cs.RO 

Apprentissage de compétences atomiques sémantiques pour la manipulation robotique multitâche

Des chercheurs ont mis en ligne une nouvelle version (v2) de leur article "Learning Semantic Atomic Skills for Multi-Task Robotic Manipulation" sur arXiv (2512.18368), présentant AtomSkill, un framework d'apprentissage par imitation pour la manipulation robotique multi-tâches. La méthode s'attaque à trois obstacles connus de l'apprentissage par démonstration à grande échelle : démonstrations sous-optimales, multi-modalité des comportements et interférences destructrices entre tâches lorsqu'un même modèle doit apprendre plusieurs compétences simultanément. AtomSkill découpe les démonstrations en compétences atomiques de longueur variable, alignées sémantiquement grâce à un objectif contrastif qui impose à la fois cohérence sémantique et cohérence temporelle, formant une bibliothèque de compétences compacte et réutilisable. La politique apprise prédit à la fois la position finale (keypose) d'une compétence et les actions immédiates, ce qui permet des transitions fluides entre compétences en fonction de la progression. Lors de l'inférence, un échantillonneur par diffusion génère des séquences de compétences plausibles, tandis que les keyposes prédites déclenchent automatiquement l'enchaînement. Les auteurs annoncent des résultats supérieurs aux méthodes de référence en imitation learning et aux approches par compétences existantes, en simulation comme en conditions réelles. L'enjeu dépasse la seule prouesse technique : la plupart des bibliothèques de compétences actuelles sont soit trop dépendantes de la structure du langage utilisé pour les décrire, soit mal alignées sémantiquement d'une tâche à l'autre, ce qui limite leur capacité à généraliser. Résoudre ce compromis conditionne directement la viabilité des politiques multi-tâches pour des applications industrielles comme le picking, l'assemblage ou la manutention, où un même robot doit enchaîner des gestes variés sans réapprentissage complet à chaque nouvelle tâche. C'est aussi un signal dans le débat actuel sur les modèles vision-langage-action (VLA) : la promesse d'une politique unique capable de généraliser à grande échelle reste difficile à tenir, et des architectures hiérarchiques par compétences comme AtomSkill pourraient constituer une alternative plus robuste que les VLA monolithiques. L'article s'inscrit dans une lignée de recherche en concurrence directe avec des approches VLA de bout en bout telles que Pi-0 de Physical Intelligence, GR00T N2 de Nvidia ou Helix de Figure. Contrairement à ces annonces industrielles très médiatisées, il s'agit ici d'une publication académique sans chiffres de benchmark détaillés ni précisions sur le matériel utilisé dans l'abstract, et sans affiliation commerciale indiquée. Les auteurs renvoient vers une page de projet (atom-skill.github.io) pour le code et les démonstrations vidéo ; la validation à plus grande échelle sur robots physiques reste, comme souvent à ce stade de publication, la prochaine étape à surveiller.

RecherchePaper
1 source
Politique de contrainte de surface pour l'apprentissage de compétences robotiques contraintes et dynamiquement réalisables
2arXiv cs.RO 

Politique de contrainte de surface pour l'apprentissage de compétences robotiques contraintes et dynamiquement réalisables

Des chercheurs ont déposé en mai 2026 sur arXiv (identifiant 2605.31321) un article présentant la Surface Constraint Policy (SCP), une méthode destinée à améliorer la fiabilité des robots dans des tâches de manipulation dextre impliquant des contraintes de surface complexes et de forme libre. L'approche encode la géométrie de surface à partir de démonstrations humaines via une fonction noyau gaussien pondérée en deux dimensions. Sur cette base, une politique de diffusion infère des intentions d'action à partir d'entrées multimodales (observations visuelles et retour d'état du robot), qui sont ensuite transformées en primitives de mouvement dynamique contraintes à la surface (DMPs, Dynamic Movement Primitives) via une méthode de mapping par similarité. Ce pipeline produit des trajectoires à la fois géométriquement admissibles et dynamiquement réalisables. Les auteurs font état de taux de succès et d'une stabilité de contact supérieurs aux méthodes comparées, sans que le résumé ne détaille les métriques précises ni les benchmarks utilisés. Ce travail pointe un angle mort persistant des approches actuelles d'apprentissage par imitation à base de diffusion : les politiques classiques génèrent des actions de manière stochastique, sans modéliser explicitement la géométrie de la surface de contact. En pratique, cela se traduit par des glissements, des décrochages ou des trajectoires physiquement inadmissibles, problèmes rédhibitoires pour des applications industrielles comme le polissage, l'assemblage surfacique ou le soudage. L'originalité de SCP tient à l'intégration des contraintes géométriques dès la génération d'action, couplée à des DMPs qui garantissent la faisabilité dynamique. Pour les intégrateurs et les équipes R&D, cette approche représente un pas concret vers la répétabilité requise en production, là où la stabilité du contact prime sur la généralisation toutes-tâches. Ce travail s'inscrit dans une vague de recherche intense autour des politiques de diffusion pour la manipulation robotique, initiée par Diffusion Policy (Chi et al., 2023, Columbia University) et accélérée par des acteurs comme Physical Intelligence avec pi0, Google DeepMind avec RT-2, ou encore ACT de Stanford. Les primitives de mouvement dynamique mobilisées ici sont un outil classique de la robotique depuis les travaux de Schaal dans les années 2000, mais leur couplage avec un pipeline de diffusion moderne pour gérer des contraintes surfaciques constitue l'apport original de la méthode. Les limitations pointées par les auteurs sont partagées par la plupart des architectures VLA actuelles, ce qui signale un axe de recherche pertinent pour quiconque vise le déploiement industriel. Les prochaines étapes naturelles incluraient une validation sur des surfaces déformables ou en mouvement, ainsi qu'un test de passage à l'échelle avec une plus grande diversité de tâches et de morphologies robotiques.

RecherchePaper
1 source
Extreme-RGMT : apprentissage continu de compétences hautement dynamiques pour un contrôle humanoïde généraliste robuste
3arXiv cs.RO 

Extreme-RGMT : apprentissage continu de compétences hautement dynamiques pour un contrôle humanoïde généraliste robuste

Une équipe de recherche publie sur arXiv le framework Extreme-RGMT, une méthode d'apprentissage continu en deux étapes destinée au contrôle de robots humanoïdes généralistes. La première étape entraîne une politique de suivi de mouvement généraliste à partir de données de mouvement multi-sources diverses. La seconde étape introduit un mécanisme asymétrique d'acquisition de compétences et de consolidation des capacités, qui limite la dérive de la politique sur les mouvements déjà maîtrisés tout en concentrant l'apprentissage sur les segments dynamiques difficiles. Pour pallier la rareté des mouvements très dynamiques et leur fort taux d'échec à l'entraînement, les auteurs combinent un échantillonnage sensible à la difficulté avec un rééchantillonnage de trajectoires priorisé par l'avantage. Résultat annoncé : des performances état de l'art en suivi de mouvement corps entier généraliste, avec une nette amélioration du taux de réussite sur les mouvements dynamiques rares, le contrôleur final exécutant des mouvements inédits sous références fixes et sous entrées de capture de mouvement inertielle en ligne. L'enjeu dépassé ici est un compromis classique et bloquant du secteur : les politiques généralistes de suivi de mouvement échouent souvent sur les gestes rares et acrobatiques, tandis que le fine-tuning spécialisé sur ces gestes fait régresser les comportements courants déjà acquis, un phénomène d'oubli catastrophique bien connu en apprentissage continu. Si les résultats se confirment au-delà du papier, cela réduit un frein concret à la commercialisation des humanoïdes généralistes, où les intégrateurs veulent un seul contrôleur capable à la fois de gestes du quotidien fiables et de réactions dynamiques ponctuelles, sans devoir maintenir des politiques séparées ni recertifier le comportement de base à chaque ajout de compétence. Le travail s'inscrit dans la lignée des recherches sur le suivi de mouvement corps entier pour humanoïdes, où des approches génériques par imitation ou par capture de mouvement sont couramment utilisées pour transférer des mouvements humains vers des robots. Extreme-RGMT ne s'appuie pas sur des données terrain ni sur un déploiement industriel : il s'agit d'une contribution méthodologique en simulation ou banc d'essai contrôlé, publiée en preprint (arXiv:2607.20110), sans partenaire industriel ni plateforme matérielle nommée dans le résumé. Les suites logiques attendues seraient une validation sur robot physique réel et une comparaison directe avec les contrôleurs généralistes existants du secteur.

RecherchePaper
1 source
Préentraînement séparé des dynamiques directe et inverse pour un apprentissage robotique découplé
4arXiv cs.RO 

Préentraînement séparé des dynamiques directe et inverse pour un apprentissage robotique découplé

Des chercheurs ont publié le 23 avril 2026 sur arXiv un article présentant DeFI (Decoupled visual Forward and Inverse dynamics pretraining), un framework d'apprentissage pour robots généralistes qui dissocie explicitement la prédiction visuelle de la prédiction d'actions motrices. L'architecture repose sur deux modules distincts : le General Forward Dynamics Model (GFDM), pré-entraîné sur des vidéos humaines et robotiques pour anticiper l'évolution visuelle d'une scène, et le General Inverse Dynamics Model (GIDM), entraîné par auto-supervision pour inférer des "actions latentes" à partir de transitions vidéo non annotées. Les deux modules sont ensuite fusionnés dans une architecture unifiée et affinés conjointement sur des tâches cibles. Sur le benchmark CALVIN ABC-D, DeFI atteint une longueur de tâche moyenne de 4,51, un score de 51,2 % sur SimplerEnv-Fractal, et un taux de succès de 81,3 % en déploiement réel, surpassant selon les auteurs les méthodes antérieures sur chacun de ces indicateurs. L'enjeu technique central que DeFI prétend résoudre est le "sim-to-real gap" structurel propre aux modèles VLA classiques : ces derniers entraînent conjointement la prédiction d'images 2D et la génération d'actions 3D, deux objectifs dont les gradients entrent en conflit. La dissociation proposée permet surtout d'exploiter des vidéos web à grande échelle sans annotation d'actions, une ressource quasi-illimitée comparée aux datasets robotiques labellisés, rares et coûteux. Pour les intégrateurs et les équipes R&D industrielles, cela signifie potentiellement réduire le coût de collecte de données de démonstration, un goulot d'étranglement bien documenté dans le déploiement de robots manipulateurs polyvalents. DeFI s'inscrit dans une dynamique de recherche très active autour des VLA, portée notamment par Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA et les travaux OpenVLA. La principale limite à évaluer ici est celle de tout papier arXiv sans validation industrielle externe : les 81,3 % en "déploiement réel" correspondent à un environnement de laboratoire contrôlé, pas à une ligne de production. Les benchmarks CALVIN et SimplerEnv sont désormais saturés par de nombreuses méthodes concurrentes, ce qui en rend l'interprétation délicate sans contexte de variance et de répétabilité. Aucun partenariat industriel ni timeline de commercialisation n'est mentionné dans l'article.

RechercheActu
1 source