Aller au contenu principal
CONTACT : apprentissage tactile sensible au contact pour le démontage robotique
RecherchearXiv cs.RO 

CONTACT : apprentissage tactile sensible au contact pour le démontage robotique

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche présente CONTACT (CONtact-aware TACTile learning), un cadre d'apprentissage qui évalue systématiquement le rôle du toucher dans le désassemblage robotique, tâche qui reste l'un des points faibles de la robotique industrielle car elle implique des contacts serrés et des transitions d'état dépendantes de la force, contrairement au montage où la vision seule suffit souvent. Les chercheurs ont construit cinq tâches de désassemblage rigide en simulation, avec des contraintes géométriques croissantes, et cinq tâches réelles (trois rigides, deux déformables). Dans un même cadre d'apprentissage, ils comparent trois configurations de perception : vision seule, vision plus capteur tactile RGB (TacRGB), et vision plus champ de force tactile (TacFF). Résultat constant en simulation comme en réel : les politiques basées sur TacFF obtiennent les meilleurs taux de réussite, avec des gains particulièrement marqués sur les scénarios à fort contact et sur les objets déformables. Fait notable, la simple fusion de TacRGB et TacFF donne de moins bons résultats que chaque modalité utilisée seule, ce qui suggère qu'une concaténation naïve dilue l'information de force pertinente pour la tâche.

Pour l'industrie robotique, ce travail apporte une preuve empirique que la perception visuelle seule, sur laquelle reposent la plupart des politiques de manipulation de type VLA aujourd'hui, atteint ses limites dès que la tâche devient contact-dominante ou implique des matériaux déformables comme des câbles ou des joints souples. Le désassemblage, contrairement à l'assemblage en usine où les tolérances et les pièces sont contrôlées, correspond justement aux cas d'usage en forte demande : recyclage de batteries, réparation, économie circulaire électronique, où les géométries sont variables et non calibrées à l'avance. Le résultat sur la fusion naïve des modalités est aussi un signal utile pour les équipes qui intègrent des capteurs tactiles sur leurs bras robotiques : ajouter du tactile brut sans architecture dédiée peut dégrader la performance plutôt que l'améliorer, ce qui remet en question des approches de fusion multimodale trop simplistes actuellement déployées dans certains systèmes VLA génériques.

Ce travail s'inscrit dans une vague de recherche récente cherchant à dépasser les limites du "sim-to-real" purement visuel qui domine les VLA comme GR00T N2 ou Pi-0, en réintroduisant des modalités proprioceptives et tactiles jugées indispensables pour la manipulation fine. Les capteurs de champ de force tactile restent coûteux et peu standardisés industriellement comparés aux capteurs RGB tactiles de type GelSight, ce qui limite pour l'instant un déploiement à grande échelle. Les auteurs ne précisent pas de partenariat industriel ni de calendrier de transfert vers un produit commercial ; il s'agit à ce stade d'un travail de recherche fondamentale publié sur arXiv, sans démonstration en usine réelle ni chiffres de cycle de production.

Dans nos dossiers

À lire aussi

Learning et interaction physique : une revue de l'apprentissage robotique tactile et sensible à la force
1arXiv cs.RO 

Learning et interaction physique : une revue de l'apprentissage robotique tactile et sensible à la force

Une équipe de chercheurs publie sur arXiv (identifiant 2608.07558v1) une étude de synthèse consacrée à l'apprentissage robotique sensible au toucher et à la force dans les tâches de manipulation en contact. Plutôt que de présenter un nouveau robot ou un nouveau modèle, le papier propose un cadre baptisé TF-ART (Tactile/Force-Aware Robot learning Taxonomy), une classification unifiée des méthodes existantes qui combinent capteurs de force, retour tactile, vision, langage et proprioception au sein de politiques de manipulation apprises. La taxonomie décrit comment ces systèmes organisent les modalités de perception, encodent et fusionnent des signaux sensoriels hétérogènes, puis génèrent et affinent les actions selon des architectures multi-phases articulant une politique de haut niveau, des modules de raffinement d'action et des contrôleurs bas niveau chargés du pilotage réactif de l'effecteur. L'intérêt de ce travail pour les intégrateurs et les équipes de R&D en manipulation robotique tient à un vide méthodologique qu'il comble explicitement: aucune revue existante n'avait jusqu'ici croisé la fusion multimodale force/tactile/vision/langage avec l'analyse des architectures multi-phases. Cette mise en ordre touche un débat central du secteur, celui de savoir si les architectures vision-langage-action (VLA) génériques suffisent pour la manipulation en contact ou si des boucles dédiées de régulation de force restent nécessaires pour des tâches où l'exécution dépend autant du contrôle des efforts que de la perception visuelle. En structurant les approches publiées dans une hiérarchie commune, TF-ART fournit un référentiel comparatif utile pour repérer où les pipelines actuels sont robustes et où ils restent fragiles, notamment sur la fusion tactile-force plutôt que sur la seule perception visuelle. Le travail s'inscrit dans la dynamique récente des politiques de manipulation apprises qui intègrent de plus en plus de modalités sensorielles au-delà de la caméra, un mouvement porté par la multiplication des architectures multi-phases séparant compréhension sémantique de la tâche et exécution physique réactive. Au-delà du seul recensement méthodologique, les auteurs examinent également les configurations de tâches et les exigences d'infrastructure, capteurs, bancs d'essai, matériel de contrôle, nécessaires à la manipulation physique réelle, reliant ainsi perspective algorithmique et contraintes pratiques de déploiement. Le survey ne cite pas de calendrier de suivi ni d'implémentation industrielle précise, son apport étant avant tout de structurer un champ de recherche en pleine expansion pour orienter les travaux futurs.

RecherchePaper
1 source
Factorisation tâche-monde pour l'apprentissage robotique
2arXiv cs.RO 

Factorisation tâche-monde pour l'apprentissage robotique

Une équipe de chercheurs a publié le 2 juin 2026 sur arXiv (arXiv:2606.02027) un framework d'apprentissage robotique baptisé "World-Task Factorization", dont le principe central est de séparer structurellement ce qui relève du monde physique de ce qui relève de la tâche à accomplir. Les facteurs "monde" regroupent les propriétés du corps du robot et de son environnement, indépendamment de toute intention ; les facteurs "tâche" encodent la logique de ce que le monde autorise à faire. Pour instancier cette séparation, les auteurs couplent un module analytique nommé AICON, un graphe différentiable d'estimateurs récursifs compositionnels opérant sans données spécifiques à la tâche, à une politique apprise compacte qui module les chemins de gradient. Ce mécanisme est testé sur trois familles de problèmes impliquant des robots hétérogènes, des modalités sensorimotrices variées et des logiques de tâche distinctes ; le framework surpasse les baselines bout-en-bout et les heuristiques analytiques dans tous les scénarios, et les auteurs rapportent un transfert vers du matériel réel sans réentraînement. L'intérêt industriel de cette approche tient à ce qu'elle adresse directement le problème de généralisation, obstacle majeur à la commercialisation des robots polyvalents. En factorisant explicitement monde et tâche, le framework promet de réduire le volume de données nécessaire au réentraînement lors d'un changement de contexte, de coéquipier ou de contrainte, là où les architectures bout-en-bout actuelles exigent de recollecterdes données à chaque variation. La capacité annoncée de généralisation zero-shot à des configurations hors distribution reste toutefois à valider à plus grande échelle : les expériences rapportées, bien que convaincantes sur trois domaines, demeurent de portée laboratoire, sans chiffres de volume de déploiement ni métriques de cycle time dans des contextes industriels réels. Sur le plan académique, ce travail s'inscrit dans un débat structurant du domaine : faut-il laisser la structure émerger du passage à l'échelle des données (approche des VLA de type Pi-0, GR00T N2 ou OpenVLA), ou l'encoder explicitement via des hiérarchies ou des bibliothèques de compétences ? Le framework proposé prend une troisième voie, fondée sur la théorie bayésienne (evidence du modèle, rasoir d'Occam) pour justifier la factorisation. Il se positionne ainsi face aux travaux de Physical Intelligence (Pi-0), de Boston Dynamics, et des laboratoires académiques comme Berkeley (RT-2, RoboAgent) ou Stanford (Mobile ALOHA). Les auteurs n'annoncent pas de partenariat industriel ni de calendrier de commercialisation ; l'étape suivante naturelle serait une validation sur des manipulateurs ou des humanoïdes dans des environnements semi-structurés, avec des métriques de robustesse publiées.

RecherchePaper
1 source
Une seule démonstration suffit pour l'apprentissage par renforcement robotique en conditions réelles
3arXiv cs.RO 

Une seule démonstration suffit pour l'apprentissage par renforcement robotique en conditions réelles

Des chercheurs présentent AutoSERL, un framework d'apprentissage par renforcement (RL) pour robots qui n'a besoin que d'une seule démonstration humaine pour apprendre des tâches de manipulation complexes en conditions réelles, sans intervention humaine continue pendant l'entraînement. Le système repose sur trois mécanismes complémentaires : une fenêtre glissante d'intervention qui guide l'exploration pour éviter les minima locaux et les mouvements dangereux, un mécanisme de récupération de sécurité qui détecte les échecs et corrige la trajectoire via des points de reprise prédéfinis, et un critère d'arrêt automatique qui coupe le guidage dès que la politique apprise devient autonome. Les auteurs ont testé AutoSERL sur six tâches de manipulation à contact intensif (insertion, accrochage, tâches à charnière) réparties sur deux plateformes robotiques différentes. Le framework atteint 100% de réussite sur les tâches d'insertion et dépasse systématiquement SERL entraîné avec 20 démonstrations, l'apprentissage par imitation classique (behavior cloning) et MILES, une méthode dédiée à l'apprentissage en un coup, tout en égalant les performances de HIL-SERL qui nécessite lui une supervision humaine continue. L'intérêt pour l'industrie tient à la réduction drastique du coût de collecte de données, généralement le principal frein au déploiement de RL sur du matériel physique. La plupart des approches existantes exigent soit des dizaines de démonstrations, soit un opérateur qui intervient en permanence pendant l'entraînement, ce qui limite le passage à l'échelle en usine ou en intégration industrielle. En automatisant l'intervention à partir d'un seul exemple tout en conservant une robustesse aux variations de position des pièces, AutoSERL rapproche le RL réel de tâches d'assemblage fin, un terrain où les approches purement basées sur l'imitation ou les politiques VLA préentraînées peinent encore à garantir une fiabilité industrielle. Ce travail s'inscrit dans la lignée de SERL et HIL-SERL, frameworks de référence pour le RL avec intervention humaine sur robots physiques, en cherchant à supprimer leur principale contrainte opérationnelle. Le code et les vidéos de démonstration sont publiés par les auteurs sur un site dédié, mais le papier, déposé sur arXiv le 1er juillet 2026, reste à ce stade une contribution de recherche académique évaluée en laboratoire sur deux plateformes robotiques, sans indication de déploiement industriel ni de partenariat commercial annoncé.

RecherchePaper
1 source
Apprentissage de dynamiques neuronales ODE adaptées au contexte pour le contrôle robotique adaptatif
4arXiv cs.RO 

Apprentissage de dynamiques neuronales ODE adaptées au contexte pour le contrôle robotique adaptatif

Des chercheurs ont proposé un modèle de dynamique contextuel fondé sur les équations différentielles ordinaires neuronales (Neural ODE) pour améliorer le contrôle de robots opérant dans des environnements incertains et variables. Le travail, déposé en juin 2026 sur arXiv (référence 2606.15469), cible les perturbations que les contrôleurs classiques peinent à absorber: variations des conditions de contact, effets aérodynamiques et perturbations externes imprévues. La méthode repose sur une procédure d'entraînement en deux phases: le modèle inspecte l'historique des états et des actions du robot pour inférer les facteurs environnementaux courants, sans capteurs dédiés supplémentaires. La compatibilité avec le MPC (Model Predictive Control) est intégrée dès la conception. Les validations portent sur trois plateformes distinctes: un drone quadrirotor en simulation, un robot sphérique Sphero BOLT et un bras manipulateur industriel Fanuc, ces deux derniers testés en conditions réelles. L'enjeu central est la dérive de modèle lors du déploiement: un robot calibré en laboratoire voit ses performances se dégrader dès que l'environnement change, que ce soit un sol différent, une charge variable ou des turbulences. Par rapport aux approches récurrentes classiques (LSTM, GRU), les Neural ODE présentent un avantage structurel: elles modélisent la dynamique en temps continu, ce qui améliore la cohérence physique et simplifie l'interface avec les solveurs MPC. L'inférence du contexte depuis le seul historique actions-états, sans instrumentation additionnelle, réduit la barrière d'intégration pour les industriels. Le test sur un Fanuc, bras omniprésent en production manufacturière, ancre les résultats dans une réalité opérationnelle tangible. Point de réserve: l'article est un preprint et l'abstract ne publie aucune métrique chiffrée de performance, ce qui rend l'évaluation indépendante difficile à ce stade. Les Neural ODE ont été introduites en 2018 par Chen et al. (NeurIPS) comme alternative aux réseaux récurrents pour modéliser des systèmes dynamiques continus. Leur application au contrôle robotique adaptatif répond à un obstacle persistant du secteur: le sim-to-real gap, qui fragilise la fiabilité des systèmes autonomes hors conditions contrôlées. Les approches concurrentes comprennent les processus gaussiens (GP) pour l'adaptation en ligne, les algorithmes méta-apprenants (MAML, PEARL) et l'identification de systèmes en temps réel. Ce travail se distingue par l'inférence contextuelle implicite, couplée nativement au MPC plutôt qu'ajoutée en couche. Le code source est ouvert sur GitHub et des démonstrations vidéo sont accessibles. La prochaine étape logique serait une validation sur des tâches de manipulation à charge variable ou un déploiement en environnement industriel non contrôlé.

RecherchePaper
1 source