Aller au contenu principal
ContactFusion : cartes de surface de Poisson stochastiques à partir de la détection visuelle et tactile
RecherchearXiv cs.RO 

ContactFusion : cartes de surface de Poisson stochastiques à partir de la détection visuelle et tactile

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

ContactFusion, décrite dans un article arXiv (2503.16592, version 2) actualisant une publication antérieure, propose une méthode pour améliorer la précision des tâches d'assemblage robotique nécessitant l'insertion de pièces à tolérances serrées. L'approche combine une cartographie visuelle globale, construite à partir de nuages de points, avec des informations de contact locales obtenues par capteur de force/couple au poignet du robot. Les chercheurs introduisent un procédé d'estimation de l'occupation de contact basé sur l'échantillonnage par rejet (rejection sampling), qui localise le point de contact sur l'effecteur terminal à partir des seules mesures de force. Ces données sont ensuite fusionnées dans une carte appelée Stochastic Poisson Surface Map (SPSMap), mise à jour via l'algorithme de reconstruction de surface stochastique de Poisson (SPSR). La méthode a d'abord été validée en simulation, confirmant la capacité du capteur d'occupation de contact à localiser correctement les points de contact, puis testée sur une tâche classique de peg-in-hole, où elle améliore l'estimation de la pose du trou par rapport à une approche purement visuelle.

L'enjeu dépasse la démonstration académique isolée: dans l'assemblage industriel, le bruit de perception issu de la seule vision reste souvent supérieur aux tolérances mécaniques exigées, ce qui fait échouer les insertions automatisées. En montrant qu'une fusion vision-contact réduit concrètement cette incertitude, ContactFusion s'attaque directement à un goulot d'étranglement connu des intégrateurs en assemblage de précision, secteur où la robotique manipulatrice peine encore à rivaliser avec la dextérité humaine sur les opérations fines.

Ce travail s'inscrit dans une lignée de recherche plus large sur la fusion multimodale tactile-visuelle en robotique, domaine où plusieurs laboratoires explorent des capteurs tactiles (type GelSight) ou des méthodes bayésiennes de fusion de capteurs pour combler les limites de la perception purement visuelle. La publication d'une deuxième version sur arXiv suggère un article retravaillé, probablement en vue d'une conférence ou revue en robotique, avec pour prochaine étape logique un déploiement sur des tâches d'assemblage plus complexes ou multi-pièces.

Dans nos dossiers

À lire aussi

Estimation de la pose 6-DOF d'un objet à partir d'un seul contact tactile
1arXiv cs.RO 

Estimation de la pose 6-DOF d'un objet à partir d'un seul contact tactile

Une équipe de recherche publie sur arXiv (réf. 2606.28899) YOTO, pour "You Only Touch Once", un système d'estimation de pose 6-DoF fondé exclusivement sur le toucher. Contrairement aux approches visuelles classiques, YOTO reconstruit la position et l'orientation complète d'un objet à partir d'une seule paire de contacts tactiles simultanés, sans nécessiter d'historique de manipulation. Chaque contact est modélisé comme un nuage de points 3D local, puis localisé sur la surface de l'objet par un réseau coarse-to-fine. Les deux contacts localisés, combinés aux poses calibrées des capteurs, alimentent un solveur SVD en forme fermée, conscient des normales de surface, qui restitue la pose 6-DoF en une seule passe. Le réseau est préentraîné sur des patches tactiles virtuels générés depuis le modèle 3D de l'objet, puis affiné avec un petit nombre de contacts réels, réduisant significativement les besoins en données terrain. Les expériences portent sur quatre objets aux géométries variées avec des capteurs GelSight, et incluent une évaluation comparative entre reconstructions issues de scans mobiles grand public et modèles CAO de référence. Ce travail s'attaque à un angle mort bien documenté de la manipulation robotique : les méthodes visuelles de pose estimation échouent systématiquement en cas d'occlusion, d'éclairage défavorable, ou face à des surfaces réfléchissantes et transparentes, conditions courantes en environnement industriel réel. L'approche à contact unique sans historique constitue un avantage pratique majeur, car elle élimine les séquences d'exploration multi-contacts et s'intègre dans des boucles de manipulation courtes. YOTO surpasse les baselines visuelles et géométriques testées dans les scénarios où la perception visuelle est dégradée. La compatibilité avec des scans mobiles plutôt que des modèles CAO précis abaisse la barrière d'intégration pour des objets non catalogués, un point non négligeable pour les intégrateurs industriels. L'estimation de pose par capteurs tactiles de type GelSight est un axe de recherche actif depuis les travaux pionniers du MIT et de l'entreprise éponyme GelSight Inc. Les méthodes antérieures nécessitaient généralement plusieurs contacts successifs ou un historique de manipulation pour converger ; YOTO rompt avec cette contrainte. Sur le plan compétitif, les pipelines visuels basés sur des modèles de fondation (MegaPose, FoundPose, benchmarks BOP) restent dominants en conditions nominales, mais leur robustesse aux surfaces dégradées est limitée, c'est précisément là que le toucher devient complémentaire. Le code, les modèles entraînés et le jeu de données GelSight seront publiés à l'acceptation de l'article. À ce stade, il s'agit d'un preprint arXiv sans déploiement annoncé ni partenaire industriel identifié.

RecherchePaper
1 source
Manipulation Tactile et Visuelle Centrée sur le Contact pour la Manipulation du Bras Complet
2arXiv cs.RO 

Manipulation Tactile et Visuelle Centrée sur le Contact pour la Manipulation du Bras Complet

Des chercheurs du laboratoire EMPRISE de l'université Cornell présentent TACTIC (Tactile and Vision Conditioned Contact-Centric Control), un contrôleur pour la manipulation "bras entier", où le robot touche l'environnement avec plusieurs segments de son bras et non plus seulement sa pince. Décrit dans un preprint arXiv (2607.09218), le système combine images RGB-D, capteurs tactiles distribués et une carte de proximité 2D compacte pour prédire comment les contacts se forment, glissent ou se rompent au fil du mouvement. Un modèle de dynamique appris est couplé aux jacobiennes de contact pour simuler à l'avance forces d'interaction et configurations futures, et alimente un planificateur prédictif (MPC) à échantillonnage dont les trajectoires candidates sont orientées vers des directions qui modulent les forces plutôt que de les subir. En simulation, TACTIC dépasse les méthodes de référence à base de modèle et les approches purement apprises. Sur un bras réel équipé de peau tactile, l'équipe démontre trois tâches multi-contacts : retourner et repositionner un mannequin, et atteindre un objectif dans un labyrinthe 3D dynamique. La manipulation bras entier est un angle mort des pipelines d'apprentissage actuels, taillés pour un contact unique au niveau de la pince. Dès que plusieurs segments touchent l'environnement simultanément, mouvement et forces de contact deviennent étroitement couplés, l'état de contact reste partiellement caché sous occlusion, et les politiques purement apprises se désynchronisent physiquement hors distribution, faute de données sur les configurations multi-contacts. En hybridant apprentissage et modèle physique explicite, TACTIC illustre une tendance de fond en robotique de manipulation : combiner du model-based pour la garantie physique et de l'apprenant pour la perception, plutôt que tout confier à un modèle de bout en bout type VLA. Pour les intégrateurs visant des bras opérant en espace encombré (tri, logistique, désassemblage), c'est un manque réel comblé, la plupart des démonstrateurs actuels évitant soigneusement tout contact hors pince. Le travail émane du laboratoire EMPRISE de Cornell, spécialisé en manipulation riche en contact et perception tactile, et s'inscrit dans une littérature plus large sur le contrôle prédictif informé par le contact, aux côtés de recherches comparables au MIT ou à CMU. Contrairement aux annonces commerciales de robots humanoïdes comme Figure, Optimus ou les modèles VLA de Physical Intelligence et NVIDIA, il s'agit ici d'un résultat académique validé en simulation puis sur un unique bras de laboratoire, pas d'un produit commercialisé. Aucun acteur français ou européen n'est associé à cette publication. Les auteurs mettent en ligne une page projet (emprise.cs.cornell.edu/tactic) sans calendrier annoncé de transfert vers des plateformes commerciales.

RecherchePaper
1 source
LightTact : un capteur tactile-visuel de bout de doigt pour la détection de contact sans déformation
3arXiv cs.RO 

LightTact : un capteur tactile-visuel de bout de doigt pour la détection de contact sans déformation

LightTact est un capteur tactile-visuel de bout de doigt conçu pour détecter les contacts sans déformation mécanique de surface. Là où les capteurs conventionnels (GelSight du MIT, DIGIT de Meta, Tactip) s'appuient sur la déformation d'un élastomère pour inférer un contact, LightTact exploite une configuration optique à blocage de lumière ambiante: seule la lumière diffusée aux points de véritables contacts traverse le système, laissant les pixels non-contactés à une valeur de gris moyenne inférieure à 3 sur 255. Les images brutes produites sont à fort contraste, chaque zone de contact préservant l'apparence naturelle de la surface touchée. La robustesse annoncée couvre les variations de propriétés matérielles, de force de contact, d'apparence de surface et d'éclairage ambiant, sans calibration spécifique au matériau. Ce verrou adresse un angle mort structurant de la manipulation robotique fine: les contacts dits "légers" avec des liquides, semi-liquides ou matériaux ultra-mous ne génèrent pas de déformation macroscopique et restent donc invisibles pour la plupart des capteurs actuels. LightTact démontre des comportements jusque-là difficiles à automatiser: étalement d'eau sur une surface, prélèvement de crème cosmétique, interaction avec des films minces souples. Pour les intégrateurs ciblant la cosmétique, l'agroalimentaire ou la manutention de produits fragiles, c'est un point de blocage technique levé. Fait significatif: les images visuelles et tactiles, spatialement alignées, sont directement interprétables par des vision-language models (VLMs), ce qui abaisse la barrière d'intégration avec les pipelines d'IA multimodaux sans couche de traitement intermédiaire dédiée. Le travail est publié en préprint sur arXiv (référence 2512.20591, troisième version), ce qui le situe au stade de la recherche académique: aucun produit commercial ni déploiement industriel n'est annoncé. Dans le panorama des capteurs tactiles visuels, LightTact occupe une niche distincte de celle de GelSight et ses dérivés, ou des solutions capacitives comme Xela Robotics, qui ciblent des régimes de contact avec déformation mesurable. Du côté européen, Pollen Robotics ou Wandercraft ne proposent pas de capteur tactile propre à ce niveau de spécificité. Les prochaines étapes logiques incluent une validation en boucle fermée sur plateforme robotique réelle et un test de durabilité de la surface optique face à des matériaux agressifs en usage répété.

UEAucun impact direct documenté à ce stade de préprint, mais les acteurs FR/EU ciblant la manipulation fine (Pollen Robotics, intégrateurs agroalimentaire/cosmétique) pourraient bénéficier de cette approche pour des contacts légers avec matériaux mous ou liquides.

RecherchePaper
1 source
Détection et estimation de distance des contacts externes transitoires par détection tactile dynamique 6D
4arXiv cs.RO 

Détection et estimation de distance des contacts externes transitoires par détection tactile dynamique 6D

Des chercheurs présentent TECDAR (Transient Extrinsic Contact Detection And Ranging), une méthode de détection et de localisation des contacts transitoires entre un objet saisi par un robot et son environnement, décrite dans un article publie sur arXiv le 10 aout 2026 (arXiv:2608.07075v1, page projet humitlab.github.io/TECDAR/). Le système repose sur des embouts de pince équipes d'un unique capteur tactile dynamique, une centrale inertielle 6D de seulement 2,5 x 3 mm, capable de capturer des deformations sub-milliseconde a 7 kHz d'échantillonnage pour un débit de données limite a 84 Ko/s. En fusionnant ce flux tactile avec la pose du robot via un filtre de Kalman étendu, TECDAR localise un contact extrinsèque avec une précision millimétrique en 180 millisecondes seulement. Les expériences rapportées montrent une précision moyenne d'environ 7 mm, aussi bien pour des contacts linéaires que ponctuels. Cette rapidité change la donne pour la manipulation fine en robotique. La main humaine localise instinctivement un contact fortuit grâce a sa sensibilité tactile, alors que la plupart des systèmes robotiques manquent de résolution pour capter ce type d'information et corrigent leur trajectoire trop tard, générant des gestes maladroits voire des échecs de tache. En montrant qu'un capteur compact et peu gourmand en bande passante permet de corriger une trajectoire a l'échelle de la milliseconde, les auteurs visent des applications a faible marge d'erreur: assemblage de précision, assistance chirurgicale, exploration autonome dans des environnements domines par le toucher. Il s'agit toutefois d'un résultat de recherche publie en preprint, valide sur des taches de laboratoire contrôlées, et non d'un produit commercialise ou déployé en usine: les intégrateurs devront attendre une validation sur des taches de préhension plus complexes avant d'envisager une adoption. Le travail s'inscrit dans un effort plus large visant a combler l'écart entre la sensibilité tactile humaine et les capacités perceptives des mains robotiques, un axe explore depuis plusieurs années notamment par des capteurs a base de vision comme GelSight, généralement plus volumineux et plus lents a traiter. En misant sur un capteur inertiel miniature unique plutôt que sur une matrice dense de capteurs, TECDAR vise a réduire a la fois le cout matériel et la charge de calcul nécessaire au traitement en temps réel. L'équipe ne communique pas de calendrier de transfert vers une plateforme robotique commerciale; la publication, classée comme nouvelle soumission sur arXiv, ouvre la voie a des travaux de suivi destines a étendre la méthode a des taches de manipulation plus complexes et a des pinces dotées de plusieurs doigts instrumentes.

RecherchePaper
1 source