Aller au contenu principal
TouchWorld : un modèle fondation tactile, prédictif et réactif, pour la manipulation dextérique
RecherchearXiv cs.RO 

TouchWorld : un modèle fondation tactile, prédictif et réactif, pour la manipulation dextérique

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche présente TouchWorld, un modèle fondationnel tactile conçu pour la manipulation dextre, dans un article publié sur arXiv (2607.07287v1) début juillet 2026. Le système repose sur une politique hiérarchique en trois couches : une couche de planification vision-langage qui découpe la tâche en sous-objectifs et prédit des sous-buts tactiles, une politique visuo-tactile conditionnée par objectif qui génère des séquences d'actions nominales, et une politique de raffinement conditionnée par le toucher qui corrige en temps réel à partir du retour tactile et proprioceptif haute fréquence. Évalué sur six tâches de manipulation dextre longues et riches en contacts, TouchWorld atteint 65,0% de réussite en conditions propres et 53,7% sous perturbations humaines, soit 15,7 et 18,5 points de plus que la meilleure référence testée.

L'apport principal tient à la séparation des échelles de temps : la plupart des politiques existantes traitent le toucher comme un simple flux d'observation basse fréquence, mélangé dans la même boucle que le raisonnement de tâche et la génération d'action. TouchWorld découple ce retour rapide (glissement, désalignement, force, stabilité de prise) du raisonnement sémantique lent porté par la vision et le langage. Pour les intégrateurs et chercheurs en robotique, cela répond directement à une limite connue des architectures vision-langage-action : leur capacité de généralisation sémantique ne suffit pas à gérer les micro-corrections de contact nécessaires en manipulation fine, un écart souvent cité entre démonstrations impressionnantes et robustesse réelle en conditions perturbées.

L'article s'inscrit dans la lignée des travaux récents sur les modèles de fondation tactiles et les politiques visuo-tactiles pour la robotique, un axe de recherche encore jeune comparé aux modèles vision-langage-action purement visuels. Les auteurs ne précisent pas d'affiliation ni de calendrier de déploiement dans le résumé ; il s'agit à ce stade d'un travail de recherche évalué en environnement contrôlé, sans indication de transfert vers un produit ou un déploiement industriel.

À lire aussi

ReTouch : de la manipulation dextérique à contacts riches grâce à la prédiction tactile affinée en ligne
1arXiv cs.RO 

ReTouch : de la manipulation dextérique à contacts riches grâce à la prédiction tactile affinée en ligne

ReTouch est un modèle vision-langage-action (VLA) conçu pour la manipulation dextre en contact riche, présenté dans un article publié le 1er août 2026 sur arXiv (arXiv:2608.01824v1). Le système s'appuie sur deux innovations principales : un Tactile-Patch Encoder qui représente les signaux tactiles sous forme de patches structurés préservant l'identité de chaque doigt et la structure locale du contact, et un module d'action haute fréquence qui prédit conjointement les états tactiles futurs et des blocs d'actions, en les affinant en continu grâce au retour tactile pendant l'exécution. Les chercheurs ont aussi construit XHT-Dataset, un jeu de données de 900 démonstrations réelles couvrant sept tâches de manipulation en contact riche, collectées sur une plateforme combinant une main robotique XHand et un bras UR7e. Testé en boucle fermée sur robot réel, ReTouch dépasse la meilleure référence existante de 18,4 points de pourcentage en conditions standards et de 23,8 points en conditions difficiles, en taux de réussite moyen. Ce résultat s'attaque à un angle mort connu des VLA actuels : la plupart des modèles de manipulation s'appuient surtout sur la vision et peinent à intégrer le retour tactile de façon exploitable en temps réel, alors que la manipulation fine (insertion, préhension d'objets déformables, ajustement de prise) dépend justement de ce signal. En démontrant qu'un raffinement tactile en boucle fermée améliore nettement la robustesse face aux erreurs d'exécution et aux changements de contact, les auteurs apportent un argument concret en faveur de l'intégration tactile native dans les architectures VLA, plutôt que comme un module accessoire ajouté après coup. Pour les intégrateurs et équipes de R&D en robotique dextre, cela suggère une voie pour réduire l'écart persistant entre démonstrations en laboratoire et fiabilité en conditions réelles, un problème récurrent pour les mains robotiques multi-doigts. Le travail s'inscrit dans une lignée de recherche académique sur la fusion tactile pour la manipulation dextre, un domaine resté largement expérimental faute de jeux de données réels standardisés et de méthodes exploitant efficacement le signal tactile à haute fréquence. En publiant à la fois le modèle et XHT-Dataset, les auteurs positionnent ReTouch comme une base de comparaison pour de futurs travaux sur les mains robotiques dextres, sans toutefois annoncer de déploiement industriel ni de partenariat commercial à ce stade : il s'agit pour l'instant d'un résultat de recherche évalué en laboratoire, non d'un produit prêt à l'intégration.

RechercheActu
1 source
PAIWorld : un modèle fondation du monde en 3D cohérent pour la manipulation robotique
2arXiv cs.RO 

PAIWorld : un modèle fondation du monde en 3D cohérent pour la manipulation robotique

Des chercheurs ont soumis PAIWorld sur arXiv (2506.18375, juin 2026), un framework de modèle fondationnel de monde (world foundation model, WFM) conçu pour la manipulation robotique avec cohérence 3D multi-vues. L'architecture, construite sur un transformateur de diffusion (DiT), intègre trois composants : des blocs d'attention croisée géométriquement informés (Geometry-Aware Cross-View Attention), un encodage positionnel rotatif qui intègre directions de rayons caméra et poses extrinsèques (Geometric RoPE), et un module Latent 3D-REPA qui distille des représentations 3D à partir de modèles 3D figés. Sur les benchmarks publics, PAIWorld se classe premier sur le leaderboard WorldArena et deuxième sur l'AgiBot-Challenge2026, deux références communautaires pour les simulateurs de manipulation. Le problème que PAIWorld adresse est concret : les robots de manipulation utilisent typiquement plusieurs caméras simultanées (vue égocentrique, eye-to-hand, poignet), mais les modèles de monde existants se contentent de concaténer les tokens de chaque vue sans raisonnement géométrique, générant dérive d'objet entre vues, incohérence de profondeur et désalignement de texture. Ces artefacts dégradent l'entraînement de politiques dans les simulateurs et amplifient le sim-to-real gap, problème central pour tout industriel cherchant à transférer des comportements entraînés en simulation vers des robots physiques. En établissant un canal explicite de communication inter-vues combiné à un prior géométrique 3D, PAIWorld vise à améliorer la fidélité des simulateurs utilisés pour le post-entraînement de politiques multi-vues et la planification basée sur des modèles (model-based planning). Les world foundation models appliqués à la robotique constituent un axe de recherche en forte croissance en 2026, porté notamment par des travaux comme UniSim et Genie 2, ainsi que par les approches VLA (Vision-Language-Action) qui cherchent à intégrer simulation et apprentissage de politiques. L'AgiBot-Challenge2026, structuré autour de tâches de manipulation dextère, joue un rôle de référence communautaire croissant pour ces systèmes. Il s'agit d'une prépublication scientifique sans partenariat commercial ni déploiement industriel annoncé : les suites logiques restent l'évaluation sur des benchmarks de transfert sim-to-real avec des plateformes physiques et l'intégration dans des world action models complets.

RecherchePaper
1 source
PHANES AI intègre le toucher aux modèles fondation de robots : TouchWorld, un modèle tactile pour la manipulation dextérique
3Pandaily 

PHANES AI intègre le toucher aux modèles fondation de robots : TouchWorld, un modèle tactile pour la manipulation dextérique

PHANES AI, start-up fondée par Yang Shuo, professeur à l'Institut de technologie de Harbin (campus de Shenzhen), a publié un nouveau modèle de fondation tactile baptisé TouchWorld, conçu pour la manipulation dextre en robotique. L'objectif est de combler une faille des modèles vision-langage-action (VLA) actuels: ceux-ci peuvent voir qu'un doigt robotique touche un bouton, mais ne peuvent pas savoir s'il a réellement été enfoncé. TouchWorld attribue au toucher un double rôle. En mode prédictif, avant d'exécuter une action, le modèle anticipe non seulement l'image visuelle attendue en fin de sous-tâche, mais aussi une carte tactile précisant quel doigt devrait ressentir une pression, à quel endroit et avec quelle intensité, une référence physique que la vision seule ne peut fournir. En mode réactif, une fois le contact établi, le modèle lit en continu les signaux tactiles et l'état des articulations pour appliquer des micro-corrections de position, de force de préhension et d'angle du poignet, sans nécessiter une replanification par la politique de haut niveau. Sur six tâches réelles (arrosage de plantes, nettoyage de table, insertion de prise, insertion de tasse, récurage de poêle, prise de mouchoir), TouchWorld atteint 65,0% de réussite en conditions normales et 57,2% en présence de perturbations comme le déplacement de la cible ou une interférence de préhension, soit 15,7 et 16,0 points de plus que la meilleure référence testée. Chaque tâche a été entraînée sur 200 trajectoires de téléopération et évaluée sur 100 essais robotiques réels. Cette approche répond à un problème concret pour l'industrie: les modèles VLA actuels échouent souvent en silence lorsqu'un contact physique ne se passe pas comme prévu, un angle mort critique pour des applications comme l'assemblage de précision ou la manipulation d'objets fragiles. En traitant le signal tactile comme un flux séparé plutôt que comme une modalité fondue dans le pipeline visuel, PHANES AI défend l'idée que la densité d'information et la vitesse de traitement du toucher sont trop différentes de celles de la vision pour partager une même architecture sans que le signal tactile ne soit noyé. Si les résultats se confirment à plus grande échelle, ce découplage pourrait devenir un standard pour les robots humanoïdes ou les bras industriels appelés à manipuler des objets déformables ou mal positionnés, un domaine où la démonstration en laboratoire peine souvent à se traduire en fiabilité réelle. Yang Shuo, né en 1998, est déjà professeur titulaire et directeur de thèse à HIT Shenzhen, l'un des plus jeunes professeurs titulaires de Chine. Lauréat de la bourse doctorale Google (un des neuf récipiendaires mondiaux) et finaliste du prix du meilleur article à ICLR, il est rentré en Chine à 26 ans pour fonder PHANES AI, qui réunit désormais une équipe couvrant les données, la modélisation, le contrôle robotique et le matériel. L'entreprise s'inscrit dans une compétition mondiale sur les modèles de fondation pour la manipulation dextre, aux côtés d'acteurs comme les équipes derrière Pi-0 ou GR00T N2, avec pour différenciation affichée le traitement natif du signal tactile plutôt qu'un simple ajout de capteurs.

IA physiqueActu
1 source
Un modèle de représentation universel pour la manipulation dextérique unifiée
4arXiv cs.RO 

Un modèle de représentation universel pour la manipulation dextérique unifiée

Une équipe de chercheurs propose OHRA (One Hand to Rule Them All), un cadre de représentation canonique paramétrisée visant à unifier les politiques de manipulation dextère sur des mains robotiques de morphologies très différentes. Constat de départ : les politiques d'apprentissage actuelles supposent une architecture de main fixe et ne se transfèrent pas sans réentraînement complet. Le système combine un espace de paramètres unifié capturant les variations cinématiques et morphologiques essentielles, et un format URDF canonique standardisant l'espace d'action tout en préservant les propriétés dynamiques de chaque main d'origine. Un VAE (Variational Autoencoder) est entraîné sur cet espace pour produire un plongement latent compact et sémantiquement cohérent. Résultat clé : la politique de préhension conditionnée sur cette représentation atteint 81,9 % de succès en transfert zéro-shot sur une LEAP Hand à 3 doigts, morphologie non vue pendant l'entraînement, validée en simulation et sur tâches réelles. L'enjeu est directement industriel : la fragmentation des designs de mains, Shadow Robotics, LEAP, Allegro, Ability Hand, rend les politiques non portables d'un hardware à l'autre. Un cadre partagé permettrait à un intégrateur de réentraîner une politique existante sur un nouveau manipulateur sans repartir de zéro, comprimant les coûts de déploiement. Le score de 81,9 % en zéro-shot sur une configuration inédite est un signal mesurable que le "morphology gap", l'analogue du sim-to-real gap appliqué aux architectures de mains, commence à être adressé. Le fait que les interpolations dans l'espace latent produisent des transitions morphologiques physiquement cohérentes indique que le VAE capture une géométrie fonctionnelle, pas seulement statistique. Ce travail s'inscrit dans la dynamique plus large de l'apprentissage cross-embodiment, aux côtés de travaux comme UniDexGrasp, DexGraspNet ou les approches fondées sur des VLA (Vision-Language-Action models). Sur le plan concurrentiel, Google DeepMind, Physical Intelligence (Pi-0) et Unitree investissent dans des politiques généralisables, mais l'angle "unification par représentation canonique de la morphologie de main" reste peu exploré industriellement. Les suites naturelles incluent l'extension à la manipulation bimanuelle, aux mains à plus de 5 doigts, et l'intégration dans des pipelines de téléopération. Aucun déploiement commercial ni partenariat industriel n'est annoncé à ce stade.

RecherchePaper
1 source