Aller au contenu principal
Manipulation Tactile et Visuelle Centrée sur le Contact pour la Manipulation du Bras Complet
RecherchearXiv cs.RO 

Manipulation Tactile et Visuelle Centrée sur le Contact pour la Manipulation du Bras Complet

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs du laboratoire EMPRISE de l'université Cornell présentent TACTIC (Tactile and Vision Conditioned Contact-Centric Control), un contrôleur pour la manipulation "bras entier", où le robot touche l'environnement avec plusieurs segments de son bras et non plus seulement sa pince. Décrit dans un preprint arXiv (2607.09218), le système combine images RGB-D, capteurs tactiles distribués et une carte de proximité 2D compacte pour prédire comment les contacts se forment, glissent ou se rompent au fil du mouvement. Un modèle de dynamique appris est couplé aux jacobiennes de contact pour simuler à l'avance forces d'interaction et configurations futures, et alimente un planificateur prédictif (MPC) à échantillonnage dont les trajectoires candidates sont orientées vers des directions qui modulent les forces plutôt que de les subir. En simulation, TACTIC dépasse les méthodes de référence à base de modèle et les approches purement apprises. Sur un bras réel équipé de peau tactile, l'équipe démontre trois tâches multi-contacts : retourner et repositionner un mannequin, et atteindre un objectif dans un labyrinthe 3D dynamique.

La manipulation bras entier est un angle mort des pipelines d'apprentissage actuels, taillés pour un contact unique au niveau de la pince. Dès que plusieurs segments touchent l'environnement simultanément, mouvement et forces de contact deviennent étroitement couplés, l'état de contact reste partiellement caché sous occlusion, et les politiques purement apprises se désynchronisent physiquement hors distribution, faute de données sur les configurations multi-contacts. En hybridant apprentissage et modèle physique explicite, TACTIC illustre une tendance de fond en robotique de manipulation : combiner du model-based pour la garantie physique et de l'apprenant pour la perception, plutôt que tout confier à un modèle de bout en bout type VLA. Pour les intégrateurs visant des bras opérant en espace encombré (tri, logistique, désassemblage), c'est un manque réel comblé, la plupart des démonstrateurs actuels évitant soigneusement tout contact hors pince.

Le travail émane du laboratoire EMPRISE de Cornell, spécialisé en manipulation riche en contact et perception tactile, et s'inscrit dans une littérature plus large sur le contrôle prédictif informé par le contact, aux côtés de recherches comparables au MIT ou à CMU. Contrairement aux annonces commerciales de robots humanoïdes comme Figure, Optimus ou les modèles VLA de Physical Intelligence et NVIDIA, il s'agit ici d'un résultat académique validé en simulation puis sur un unique bras de laboratoire, pas d'un produit commercialisé. Aucun acteur français ou européen n'est associé à cette publication. Les auteurs mettent en ligne une page projet (emprise.cs.cornell.edu/tactic) sans calendrier annoncé de transfert vers des plateformes commerciales.

À lire aussi

VT-WAM : modèle du monde et action visuo-tactile pour la manipulation à contacts riches
1arXiv cs.RO 

VT-WAM : modèle du monde et action visuo-tactile pour la manipulation à contacts riches

Des chercheurs présentent VT-WAM, un modèle de manipulation robotique combinant vision et toucher, décrit dans un article déposé sur arXiv (2607.02503v1) et accompagné d'un site dédié (vt-wam.github.io). Le système, un "Visual-Tactile World Action Model", apprend simultanément trois choses dans un même cadre de flow matching : prédire les images visuelles futures, prédire la déformation tactile future, et prédire l'action à exécuter. Deux mécanismes techniques soutiennent cette approche : une attention "Asymmetric Mixture-of-Transformers" (MoT) qui relie une première image de référence à la dynamique tactile dans le temps, et un module nommé AVTAG (Action-Visual-Tactile Attention Guidance) qui force le modèle à s'appuyer davantage sur le signal tactile pendant les phases de contact. Sur six tâches de manipulation en conditions réelles impliquant un contact physique important, VT-WAM atteint un taux de réussite moyen de 71,67%, contre des scores inférieurs de 26,67 points pour Fast-WAM et de 35,84 points pour OmniVTLA, deux modèles de référence utilisés en comparaison. L'enjeu dépasse la simple performance chiffrée : les politiques visuo-tactiles existantes se contentent généralement d'injecter le signal tactile brut dans la prédiction d'action, sans modéliser comment cette déformation évolue dans le temps. Or c'est précisément sur les tâches à fort contact (insertion, préhension d'objets déformables, gestion du glissement) que les modèles purement visuels ou de type VLA (vision-language-action) échouent le plus souvent, malgré des démonstrations impressionnantes en environnement contrôlé. Pour les intégrateurs industriels qui cherchent à automatiser des opérations d'assemblage fin, ce travail illustre une piste concrète pour combler l'écart entre démonstration et fiabilité réelle. Le papier s'inscrit dans la lignée des "world models" appliqués à la robotique, dont Fast-WAM constitue un prédécesseur direct servant de base de comparaison, aux côtés de familles de modèles VLA comme OmniVTLA. Il s'agit toutefois d'une publication académique, sans acteur industriel identifié ni date de déploiement annoncée : les résultats restent circonscrits à six tâches de laboratoire, et les auteurs eux-mêmes soulignent via leurs ablations que la modélisation de la dynamique tactile reste un problème ouvert plutôt qu'une solution définitivement close.

RecherchePaper
1 source
OmniVTA : modélisation du monde visuo-tactile pour la manipulation robotique en contact riche
2arXiv cs.RO 

OmniVTA : modélisation du monde visuo-tactile pour la manipulation robotique en contact riche

Une équipe de recherche présente sur arXiv (arXiv:2603.19201v3) OmniVTA, un framework de manipulation robotique visuo-tactile adosse a OmniViTac, un jeu de données de plus de 21 000 trajectoires couvrant 86 taches et plus de 100 objets repartis en six catégories d'interaction physique comme l'essuyage ou l'assemblage. Le système combine un encodeur tactile auto-supervise, un modèle du monde visuo-tactile a deux flux prédisant l'évolution du contact a court terme, une politique de fusion sensible au contact générant les actions, et un contrôleur réflexe a 60 Hz corrigeant en boucle fermée les écarts entre signal tactile prédit et observe. Teste sur robot réel dans les six catégories, OmniVTA dépasse les méthodes existantes et généralisé a des objets et configurations non vus ; les auteurs annoncent la publication future des données, modèles et code sur mrsecant.github.io/OmniVTA. Le résultat cible un angle mort connu de la manipulation industrielle : l'assemblage, le polissage ou le nettoyage exigent de percevoir des forces de contact, des changements de friction et des transitions d'état que la vision seule ne capture pas fiablement. La plupart des systèmes actuels traitent le tactile comme une observation passive, alors qu'OmniVTA en fait une variable prédictive exploitée en boucle fermée a haute fréquence, ce qui améliore la robustesse face a des objets inconnus. Pour les intégrateurs visant des bras ou des mains capables de gestes fins comme l'insertion de connecteurs, cette généralisation hors distribution répond a un point faible récurrent des démonstrations de manipulation, souvent performantes seulement sur les objets vus a l'entrainement. Ce travail s'inscrit dans un intérêt croissant pour la manipulation visuo-tactile, jusque-la freine par des jeux de données restreints en échelle et en diversité de taches, limite que le dataset OmniViTac vise a combler. Il s'agit d'une publication académique, pas d'un produit commercial ni d'un déploiement industriel annonce : le papier, une version révisée sur arXiv, ne cite ni date de disponibilité ni partenaire intégrateur, et l'ouverture promise du code et des données reste pour l'instant une intention. L'article ne précise pas le matériel exact (bras, main, capteurs tactiles) utilise pour les expériences, ce qui limite l'évaluation de sa portée industrielle immédiate.

RecherchePaper
1 source
URF : cadre de contrôle unifié pour une manipulation stable et consciente du contact
3arXiv cs.RO 

URF : cadre de contrôle unifié pour une manipulation stable et consciente du contact

Traitement effectué. Voici l'article en français : --- Des chercheurs proposent URF (Unified Robot Control-Policy Framework), une architecture de contrôle qui unifie prédiction d'action et exécution bas niveau pour la manipulation robotique en contact rigide. Publié sur arXiv (2607.20912v1), le système part d'un constat technique précis : les politiques de manipulation apprises prédisent généralement une trajectoire ou une cible virtuelle, puis délèguent son exécution à un contrôleur bas niveau séparé, ce qui peut provoquer un contact instable, des erreurs de suivi, une surcharge de force voire une casse d'outil selon le contrôleur utilisé. URF fait converger ces deux étages : à partir d'observations multimodales, le modèle prédit simultanément une cible virtuelle, une matrice de rigidité (stiffness matrix), et un ratio de bascule entre contrôle en admittance et contrôle en impédance. Ce ratio détermine à quel moment privilégier un suivi de mouvement précis (admittance) ou une gestion plus sûre du contact rigide (impédance). Faute de vérité terrain sur la rigidité de l'environnement dans les données de démonstration, les chercheurs construisent leurs labels de supervision à partir des forces de contact réellement mesurées. Sur deux tâches de test, retournement de boîte et pressage linéaire, URF affiche un taux de réussite supérieur aux approches en admittance seule, avec moins d'échecs par montée en force rapide, oscillations de force, casse d'outil ou arrêts de sécurité du robot. Pour l'industrie de la manipulation robotique, ce travail cible un angle mort souvent sous-traité dans la course aux politiques VLA (vision-language-action) : la qualité d'une politique de haut niveau ne garantit rien si le contrôleur bas niveau n'est pas conçu pour exploiter cette information de contact. Beaucoup de démonstrations impressionnantes de manipulation dextre échouent en conditions réelles précisément à cause de ce écart entre commande prédite et exécution physique stable, un des points aveugles classiques du fossé démo-vers-réalité. En intégrant la prédiction du comportement du contrôleur lui-même dans le modèle appris, URF illustre une tendance de fond chez les intégrateurs et laboratoires de recherche en manipulation : traiter le contrôle de force comme un objet d'apprentissage à part entière plutôt que comme un simple paramètre fixe en aval, ce qui intéresse directement les applications d'assemblage industriel, de polissage ou d'insertion de précision où le contact rigide est la norme plutôt que l'exception. Ce travail s'inscrit dans la lignée des architectures hybrides impédance-admittance étudiées depuis longtemps en robotique de contact, mais l'apporte au contexte des politiques de manipulation apprises de bout en bout, un terrain où les grands modèles VLA (de type Pi-0, GR00T ou Helix évoqués dans le débat sectoriel actuel) se concentrent surtout sur la prédiction de trajectoires plutôt que sur la dynamique de contact fine. Il s'agit ici d'une publication de recherche académique, avec page projet dédiée, et non d'un produit commercialisé ni d'un déploiement industriel : les résultats se limitent à deux tâches de manipulation en environnement contrôlé. La suite logique, non détaillée dans l'abstract, porterait sur l'extension à des tâches de contact plus variées et sur une validation en dehors du cadre expérimental initial avant toute intégration dans des piles de contrôle robotique commerciales.

RecherchePaper
1 source
TacForeSight : un modèle du monde tactile guidé par la force pour la manipulation en contact dense
4arXiv cs.RO 

TacForeSight : un modèle du monde tactile guidé par la force pour la manipulation en contact dense

Des chercheurs ont publié sur arXiv (référence 2606.11184) TacForeSight, un framework léger d'anticipation tactile guidée par la force pour la manipulation en contact riche. Le système repose sur deux composants : TacForceWM, un modèle du monde tactile qui prédit les dynamiques latentes tactiles à court horizon à partir de capteurs bi-doigts conditionnés par les signaux de force et de couple au poignet à haute fréquence, et une politique conditionnée par l'anticipation tactile (Predictive Tactile-Conditioned Policy) qui exploite ces prédictions comme priors de contact, modélise l'évolution tactile courante-vers-future via cross-attention, et fusionne les features visuo-tactiles via un module de gating adaptatif. Les expériences portent sur cinq tâches représentatives de manipulation sur robot réel et trois scénarios de perturbation en cours de manipulation, avec des résultats supérieurs aux baselines existantes dans tous les cas, notamment sous perturbations de contact dynamiques. Le code et les datasets seront mis à disposition publiquement sur tacforesight.github.io. L'apport technique central est de modéliser explicitement les rôles asymétriques de la force globale au poignet (basse résolution spatiale, haute fréquence) et du toucher local bi-doigts (haute résolution spatiale, dynamique plus lente), distinction que la plupart des méthodes d'imitation learning actuelles ignorent. En opérant entièrement dans un espace latent compact, le framework permet un raisonnement de contact proactif compatible avec le contrôle haute fréquence, là où les approches réactives échouent sous perturbations imprévues. Pour les intégrateurs industriels et les équipes travaillant sur l'assemblage ou le conditionnement robotisé, c'est une démonstration concrète que la fusion force+tactile dans un world model améliore la robustesse réelle sans alourdir l'inférence en temps réel. Ce travail s'inscrit dans une vague de recherche combinant world models et retour tactile pour la manipulation dextre, aux côtés d'approches comme Pi-0 (Physical Intelligence) ou les travaux sur GR00T N2 de NVIDIA qui intègrent également des politiques tactile-aware. Aucun concurrent français ou européen direct n'est identifié sur ce créneau précis, bien que des acteurs comme Pollen Robotics ou Enchanted Tools s'appuient aussi sur la manipulation fine. Il s'agit ici d'un preprint non encore évalué par les pairs, sans déploiement industriel ni partenaire annoncé : les résultats, bien que prometteurs sur cinq tâches de laboratoire, devront être reproduits sur des géométries et conditions de contact plus variées avant de valider la généralisation à l'échelle industrielle.

UEImpact indirect : le code open-source prévu sur tacforesight.github.io pourrait être exploité par des équipes européennes travaillant sur la manipulation fine, comme Pollen Robotics ou les labos CEA-List, mais aucun acteur FR/EU n'est impliqué dans ce travail.

RecherchePaper
1 source