Aller au contenu principal
roto 2.0 : l'Olympiade de robotique tactile
RecherchearXiv cs.RO 

roto 2.0 : l'Olympiade de robotique tactile

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de chercheurs a publié roto 2.0, deuxième version du Robot Tactile Olympiad, un benchmark standardisé pour l'apprentissage par renforcement (RL) basé sur le toucher. La plateforme, accélérée GPU en parallèle, couvre quatre morphologies robotiques de 16 à 24 degrés de liberté (DOF) et impose un régime de manipulation strictement "aveugle" : les agents n'ont accès qu'à la proprioception et aux capteurs tactiles, sans information d'état, sans vision, sans distillation depuis un teacher model. Le résultat phare : les agents entraînés atteignent 13 rotations de boules Baoding en 10 secondes, que les auteurs décrivent comme un ordre de grandeur supérieur aux performances actuelles de l'état de l'art sur cette tâche. Les environnements, configurations et baselines sont publiés en open source.

Ce travail pointe un problème structurel reconnu dans la communauté : la recherche en manipulation tactile reste morcelée, avec une concentration excessive sur des tâches d'orientation surexploitées et peu de benchmarks permettant des comparaisons rigoureuses entre approches. En forçant l'absence totale de perception visuelle, roto 2.0 adresse une contrainte concrète pour les intégrateurs industriels : un manipulateur opérant uniquement par retour tactile et proprioceptif peut fonctionner dans des environnements où les caméras sont inutilisables (assemblage en aveugle, poussière, occlusion totale). L'affirmation d'"un ordre de grandeur plus rapide" mérite cependant d'être nuancée : elle s'applique à cette tâche spécifique en simulation, et le gap sim-to-real reste entièrement à démontrer sur hardware réel.

La manipulation dextère sans vision est un défi porté depuis des années par des laboratoires majeurs, notamment OpenAI avec Dactyl (équipe robotique dissoute en 2021) et Stanford avec ses travaux sur la préhension en contact riche, ainsi que par des fabricants de capteurs tactiles comme Xela Robotics ou GelSight MIT. roto 2.0 s'inscrit dans une dynamique de benchmarking plus rigoureux qui traverse la communauté, dans le sillage de ManiSkill et Isaac Lab. En France, le LAAS-CNRS mène des recherches sur des approches similaires de manipulation par contact. En open-sourçant les environnements et des baselines correctement tuned, les auteurs visent explicitement à libérer les chercheurs du coût en temps lié au réglage RL pour qu'ils se concentrent sur les défis algorithmiques fondamentaux.

Impact France/UE

Le LAAS-CNRS mène des travaux sur la manipulation par contact similaires à ceux que roto 2.0 cherche à benchmarker ; la publication open-source des environnements et baselines peut directement accélérer ces recherches françaises et réduire leur coût de réglage RL.

Dans nos dossiers

À lire aussi

CONTACT : apprentissage tactile sensible au contact pour le démontage robotique
1arXiv cs.RO 

CONTACT : apprentissage tactile sensible au contact pour le démontage robotique

Une équipe de recherche présente CONTACT (CONtact-aware TACTile learning), un cadre d'apprentissage qui évalue systématiquement le rôle du toucher dans le désassemblage robotique, tâche qui reste l'un des points faibles de la robotique industrielle car elle implique des contacts serrés et des transitions d'état dépendantes de la force, contrairement au montage où la vision seule suffit souvent. Les chercheurs ont construit cinq tâches de désassemblage rigide en simulation, avec des contraintes géométriques croissantes, et cinq tâches réelles (trois rigides, deux déformables). Dans un même cadre d'apprentissage, ils comparent trois configurations de perception : vision seule, vision plus capteur tactile RGB (TacRGB), et vision plus champ de force tactile (TacFF). Résultat constant en simulation comme en réel : les politiques basées sur TacFF obtiennent les meilleurs taux de réussite, avec des gains particulièrement marqués sur les scénarios à fort contact et sur les objets déformables. Fait notable, la simple fusion de TacRGB et TacFF donne de moins bons résultats que chaque modalité utilisée seule, ce qui suggère qu'une concaténation naïve dilue l'information de force pertinente pour la tâche. Pour l'industrie robotique, ce travail apporte une preuve empirique que la perception visuelle seule, sur laquelle reposent la plupart des politiques de manipulation de type VLA aujourd'hui, atteint ses limites dès que la tâche devient contact-dominante ou implique des matériaux déformables comme des câbles ou des joints souples. Le désassemblage, contrairement à l'assemblage en usine où les tolérances et les pièces sont contrôlées, correspond justement aux cas d'usage en forte demande : recyclage de batteries, réparation, économie circulaire électronique, où les géométries sont variables et non calibrées à l'avance. Le résultat sur la fusion naïve des modalités est aussi un signal utile pour les équipes qui intègrent des capteurs tactiles sur leurs bras robotiques : ajouter du tactile brut sans architecture dédiée peut dégrader la performance plutôt que l'améliorer, ce qui remet en question des approches de fusion multimodale trop simplistes actuellement déployées dans certains systèmes VLA génériques. Ce travail s'inscrit dans une vague de recherche récente cherchant à dépasser les limites du "sim-to-real" purement visuel qui domine les VLA comme GR00T N2 ou Pi-0, en réintroduisant des modalités proprioceptives et tactiles jugées indispensables pour la manipulation fine. Les capteurs de champ de force tactile restent coûteux et peu standardisés industriellement comparés aux capteurs RGB tactiles de type GelSight, ce qui limite pour l'instant un déploiement à grande échelle. Les auteurs ne précisent pas de partenariat industriel ni de calendrier de transfert vers un produit commercial ; il s'agit à ce stade d'un travail de recherche fondamentale publié sur arXiv, sans démonstration en usine réelle ni chiffres de cycle de production.

RecherchePaper
1 source
Principes de l'autonomie robotique
2arXiv cs.RO 

Principes de l'autonomie robotique

Un nouveau manuel intitulé "Principles of Robot Autonomy" vient d'être publié sur arXiv (2608.03496v1, début août 2026). L'ouvrage est issu de plusieurs décennies d'enseignement à Stanford et propose une introduction unifiée aux méthodes qui composent les piles logicielles d'autonomie robotique modernes, de la perception à la planification en passant par le contrôle. Chaque chapitre est accompagné de notebooks Jupyter et d'exercices d'implémentation, pensés pour que les lecteurs construisent une intuition pratique en parallèle des fondements théoriques. Le texte s'adresse aux étudiants, ingénieurs et chercheurs qui entrent dans le domaine, et vise explicitement à faire le pont entre la robotique classique (odométrie, SLAM, planification de trajectoire, commande) et ce que les auteurs appellent l'IA physique, c'est à dire les architectures d'apprentissage qui pilotent aujourd'hui les robots déployés sur route, en entrepôt, dans les airs ou en environnement spatial. L'intérêt de ce manuel dépasse le cadre académique. Il acte un changement de statut de l'autonomie robotique, qui n'est plus seulement un sujet de recherche mais un ensemble de méthodes éprouvées sur le terrain, utilisées quotidiennement par des praticiens. Pour les ingénieurs et les décideurs B2B qui recrutent ou forment des équipes robotique, disposer d'un cadre conceptuel commun, couvrant aussi bien les fondamentaux classiques que les briques modernes d'IA physique, répond à un vrai manque : la formation universitaire peine souvent à suivre le rythme d'un secteur où les modèles VLA (vision language action) et les stacks d'autonomie évoluent plus vite que les programmes d'enseignement. Ce manuel s'inscrit dans une lignée de références historiques de la robotique universitaire, à un moment où le secteur connaît une accélération commerciale sans précédent, portée par des architectures d'IA physique et des humanoïdes déployés en usine ou en entrepôt par plusieurs acteurs industriels. Ce contexte de bascule rapide entre recherche et déploiement réel rend d'autant plus utile un ouvrage qui structure les principes fondamentaux plutôt que de courir après chaque nouvelle démonstration. Le texte ne mentionne pas de suite ou de version imprimée prévue au delà de cette publication arXiv.

RecherchePaper
1 source
Dream-Tac : un modèle d'action monde tactile unifié pour la manipulation robotique riche en contacts
3arXiv cs.RO 

Dream-Tac : un modèle d'action monde tactile unifié pour la manipulation robotique riche en contacts

Des chercheurs ont publié le 9 juin 2026 sur arXiv (arXiv:2606.08737) Dream-Tac, un modèle d'action mondial unifié intégrant la modalité tactile pour la manipulation robotique en contact. L'architecture joint trois dimensions simultanément : la génération d'actions, la prédiction d'observations visuelles futures et la dynamique tactile. Deux contributions techniques structurent le système : une fusion visuotactile à déclenchement par contact ("contact-gated visuotactile fusion"), qui intègre sélectivement les signaux tactiles uniquement lors des phases d'interaction physique effective, et un biais d'attention conscient du contact ("contact-aware attention bias") régulant les échanges cross-modaux. Pour rendre le modèle déployable en temps réel, les auteurs introduisent une stratégie d'accélération à deux niveaux : reformulation du biais lors de l'entraînement pour préserver les chemins d'attention fusionnés, et accélération de la diffusion par cache à l'inférence. Résultat annoncé : entraînement 2,9 fois plus rapide, inférence 1,8 fois plus rapide. Sur six tâches de manipulation en contact riche, Dream-Tac améliore la précision des actions de 31,7 % en moyenne. Le code est publié sur GitHub. Le résultat le plus significatif n'est pas le chiffre brut des 31,7 %, mais ce qu'il révèle sur une limitation structurelle des modèles d'action mondiaux (world action models) actuels : ces architectures, qui héritent la capacité prédictive des world models pour guider la génération d'actions, s'appuient quasi exclusivement sur la vision. Or, la vision seule est insuffisante pour les tâches à fort contact (assemblage de pièces, vissage, insertion de connecteurs, manipulation d'objets souples) où les signaux critiques sont d'ordre haptique. Dream-Tac adresse directement ce "reality gap" tactile, en montrant que l'intégration conditionnelle de la modalité tactile dans le pipeline de diffusion améliore substantiellement la robustesse. Pour les intégrateurs industriels et les équipes robotique travaillant sur des cellules d'assemblage ou de finishing, c'est un signal clair que les VLA (Vision-Language-Action models) ne suffisent pas seuls pour les cas d'usage à contact. Le contexte est celui d'une compétition intense entre laboratoires sur la manipulation dextère. Physical Intelligence (pi0, pi0-FAST), Boston Dynamics, Figure AI et Agility Robotics investissent massivement dans des pipelines de manipulation généralisable, principalement visuels. Côté recherche académique, des travaux comme DexDiffuser ou UniDexGrasp ont posé les bases de la manipulation dextère par diffusion, mais sans intégration tactile unifiée. Dream-Tac s'inscrit dans une tendance émergente visant à enrichir ces pipelines avec des capteurs de contact (GelSight, Digit, BubbleGripper), encore peu intégrés dans les architectures de world models. Il s'agit ici d'un article de recherche arXiv, pas d'un produit ou d'un déploiement industriel : les six tâches de validation sont des benchmarks contrôlés en laboratoire, et la généralisation à des environnements réels non structurés reste à démontrer. Les prochaines étapes naturelles seraient une validation sur des plateformes hardware commerciales (UR, Franka, ou bras dextre humanoïde) et une extension à des gripper tactiles standardisés disponibles sur le marché.

RechercheOpinion
1 source
Learning et interaction physique : une revue de l'apprentissage robotique tactile et sensible à la force
4arXiv cs.RO 

Learning et interaction physique : une revue de l'apprentissage robotique tactile et sensible à la force

Une équipe de chercheurs publie sur arXiv (identifiant 2608.07558v1) une étude de synthèse consacrée à l'apprentissage robotique sensible au toucher et à la force dans les tâches de manipulation en contact. Plutôt que de présenter un nouveau robot ou un nouveau modèle, le papier propose un cadre baptisé TF-ART (Tactile/Force-Aware Robot learning Taxonomy), une classification unifiée des méthodes existantes qui combinent capteurs de force, retour tactile, vision, langage et proprioception au sein de politiques de manipulation apprises. La taxonomie décrit comment ces systèmes organisent les modalités de perception, encodent et fusionnent des signaux sensoriels hétérogènes, puis génèrent et affinent les actions selon des architectures multi-phases articulant une politique de haut niveau, des modules de raffinement d'action et des contrôleurs bas niveau chargés du pilotage réactif de l'effecteur. L'intérêt de ce travail pour les intégrateurs et les équipes de R&D en manipulation robotique tient à un vide méthodologique qu'il comble explicitement: aucune revue existante n'avait jusqu'ici croisé la fusion multimodale force/tactile/vision/langage avec l'analyse des architectures multi-phases. Cette mise en ordre touche un débat central du secteur, celui de savoir si les architectures vision-langage-action (VLA) génériques suffisent pour la manipulation en contact ou si des boucles dédiées de régulation de force restent nécessaires pour des tâches où l'exécution dépend autant du contrôle des efforts que de la perception visuelle. En structurant les approches publiées dans une hiérarchie commune, TF-ART fournit un référentiel comparatif utile pour repérer où les pipelines actuels sont robustes et où ils restent fragiles, notamment sur la fusion tactile-force plutôt que sur la seule perception visuelle. Le travail s'inscrit dans la dynamique récente des politiques de manipulation apprises qui intègrent de plus en plus de modalités sensorielles au-delà de la caméra, un mouvement porté par la multiplication des architectures multi-phases séparant compréhension sémantique de la tâche et exécution physique réactive. Au-delà du seul recensement méthodologique, les auteurs examinent également les configurations de tâches et les exigences d'infrastructure, capteurs, bancs d'essai, matériel de contrôle, nécessaires à la manipulation physique réelle, reliant ainsi perspective algorithmique et contraintes pratiques de déploiement. Le survey ne cite pas de calendrier de suivi ni d'implémentation industrielle précise, son apport étant avant tout de structurer un champ de recherche en pleine expansion pour orienter les travaux futurs.

RecherchePaper
1 source