Aller au contenu principal
DexVerse : un référentiel modulaire pour la manipulation dextre multi-tâche et multi-incarnation
RecherchearXiv cs.RO 

DexVerse : un référentiel modulaire pour la manipulation dextre multi-tâche et multi-incarnation

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un consortium de chercheurs présente DexVerse, un benchmark modulaire à grande échelle pour la manipulation dextre multi-tâches et multi-embodiments. L'ensemble couvre 100 tâches réparties sur des compétences variées : saisie et déplacement d'objets, interaction avec des objets articulés, usage fonctionnel d'outils, coordination bimanuelle, contrôle non préhensile, comportements riches en contact, exécution multi-objectifs et tâches longues à plusieurs étapes. Le système prend en charge 3 bras robotiques et 6 mains dextres différentes, et reste extensible à de nouvelles tâches, de nouveaux actifs et de nouveaux embodiments. Pour tester la généralisation visuomotrice, DexVerse propose des variations visuelles paramétrables (textures, arrière-plans, éclairage, points de vue caméra). Les auteurs fournissent aussi une interface de téléopération en réalité virtuelle ainsi que 3 180 démonstrations avec observations synchronisées : données proprioceptives, images RGB, profondeur, nuages de points et états. Quatre méthodes représentatives ont été évaluées sur 19 tâches : Diffusion Policy, DP3, OpenVLA et π0.5.

Les résultats révèlent des difficultés importantes de généralisation entre tâches et de robustesse visuomotrice, même pour ces politiques d'apprentissage jugées à la pointe. Pour l'industrie robotique, ce constat vient nuancer l'enthousiasme actuel autour des modèles VLA (vision-langage-action) présentés comme des solutions généralistes prêtes à l'échelle : DexVerse montre que la performance chute nettement dès que les conditions visuelles ou la nature de la tâche s'écartent du contexte d'entraînement. C'est un signal utile pour les intégrateurs et décideurs B2B qui évaluent des politiques de manipulation dextre avant déploiement industriel : la démonstration en laboratoire ne garantit pas la robustesse en conditions réelles variables.

DexVerse s'inscrit dans une lignée de benchmarks robotiques cherchant à dépasser les évaluations sur tâche isolée, un manque identifié dans les jeux d'essai existants, limités en diversité de tâches, de couverture d'embodiments ou de variation visuelle contrôlable. En couvrant simultanément plusieurs bras, plusieurs mains et un large éventail de conditions, il se positionne comme un terrain d'essai de référence pour comparer des approches comme Diffusion Policy ou les modèles de la famille π face à des architectures VLA telles qu'OpenVLA. La page du projet est disponible à l'adresse ycyao216.github.io/DexVerse.site, laissant présager de futures évaluations élargies et l'ajout d'autres méthodes et tâches.

À lire aussi

TactiDex : un référentiel tactile réel pour la manipulation dextre proche de l'humain
1arXiv cs.RO 

TactiDex : un référentiel tactile réel pour la manipulation dextre proche de l'humain

La recherche en manipulation robotique dextre franchit une nouvelle étape avec TactiDex, un benchmark et un jeu de données publiés sur arXiv (référence 2607.09190v1) et dédiés à la manipulation guidée par le toucher. Le projet part d'un constat technique précis: la plupart des méthodes actuelles de transfert humain-robot pour les mains dextres reposent uniquement sur des trajectoires cinématiques, ce qui produit une imitation du mouvement sans véritable ancrage physique dans le contact. TactiDex propose à la place un jeu de données réel qui aligne des signaux tactiles couvrant l'ensemble de la main avec des états cinématiques et des états d'objets à plusieurs niveaux de granularité, accompagné de métriques d'évaluation standardisées. Sur cette base, les auteurs introduisent TactiSkill, un framework de transfert reposant sur une récompense tactile à trois composantes, conçue pour unifier dans un seul objectif le guidage du geste, la ressemblance avec le comportement humain et le respect des contraintes de contact. Les expériences couvrent à la fois des tâches à une main et des tâches bimanuelles, avec une page projet dédiée (tactidex.github.io) pour consulter les données et résultats. Pour l'industrie robotique, ce travail s'attaque directement à un angle mort connu des pipelines d'apprentissage par démonstration: la plupart des systèmes actuels, y compris les architectures VLA les plus médiatisées, valident surtout la trajectoire du geste et non la qualité physique du contact, ce qui laisse un écart entre démonstration réussie en vidéo et manipulation réellement stable en conditions réelles. En intégrant le retour tactile comme signal de supervision structuré plutôt que comme donnée accessoire, TactiDex offre aux équipes de recherche et aux intégrateurs travaillant sur des mains robotiques un cadre d'évaluation plus rigoureux pour juger si un geste appris est simplement copié ou physiquement plausible, ce qui pèse directement sur la fiabilité des déploiements en préhension fine. Le travail s'inscrit dans la lignée des efforts récents visant à dépasser la simple imitation cinématique dans le transfert humain-robot, un problème identifié de longue date dans la littérature sur la téléopération et l'apprentissage par démonstration. Aucune date de publication de code ni de partenariat industriel n'est mentionnée à ce stade; le projet reste au niveau d'un benchmark de recherche, dont l'adoption dépendra de sa reprise par d'autres laboratoires travaillant sur des mains dextres et l'apprentissage tactile.

RecherchePaper
1 source
Guava : un cadre efficace et universel pour la manipulation incarnée
2arXiv cs.RO 

Guava : un cadre efficace et universel pour la manipulation incarnée

Des chercheurs ont publié en juin 2026 sur arXiv (identifiant 2606.18363) Guava, un cadre de harness pour agents robotiques de manipulation. Le système repose sur trois ingrédients identifiés après une exploration systématique de l'espace de conception : des boucles itératives perception-raisonnement-action, des abstractions d'action sémantiques et des observations multimodales. À partir de ces principes, les auteurs ont entraîné un modèle open-source de 4 milliards de paramètres en utilisant moins de 2 000 trajectoires collectées entièrement en simulation, sans aucune donnée réelle. Les évaluations en environnement simulé et en conditions réelles montrent des performances comparables aux modèles propriétaires de pointe, avec une généralisation robuste à des objets non vus en entraînement, des instructions inédites et des tâches longues à plusieurs étapes. Le résultat le plus significatif est qu'un modèle compact peut atteindre des performances compétitives avec des systèmes propriétaires massifs à condition que l'architecture de harness soit bien conçue, et non que le modèle soit immense. Cela conteste directement l'hypothèse dominante selon laquelle les systèmes VLA (Vision-Language-Action) end-to-end nécessitent des millions de trajectoires réelles pour franchir le sim-to-real gap. L'approche par tool use découple le raisonnement de haut niveau des modules de perception et de contrôle, rendant le cadre agnostique au modèle sous-jacent, un avantage concret pour les intégrateurs industriels souhaitant substituer les composants sans réentraîner l'ensemble du système. Ce travail s'inscrit dans un débat structurant de la manipulation robotique qui oppose les VLA end-to-end, comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, aux approches modulaires par harness, qui misent sur la composabilité et le raisonnement émergent des LLM. L'approche rappelle SayCan (Google/Everyday Robots) ou Code as Policies, mais avec une validation sim-to-real plus explicite et sur modèle open-source. Le modèle 4B utilisé n'est pas nommé dans le papier, et aucun déploiement industriel ni partenariat commercial n'est mentionné : Guava demeure pour l'instant un résultat de recherche, sans timeline de productisation annoncée.

UELes laboratoires de recherche et intégrateurs robotiques européens peuvent s'appuyer sur ce cadre open-source pour développer des systèmes de manipulation compétitifs sans infrastructure de données réelles à grande échelle.

RechercheOpinion
1 source
Labimus : simulation et référentiel pour la manipulation dextérique humanoïde en laboratoire de chimie
3arXiv cs.RO 

Labimus : simulation et référentiel pour la manipulation dextérique humanoïde en laboratoire de chimie

Des chercheurs ont présenté Labimus, premier benchmark évaluant la manipulation dextre de robots humanoïdes dans un laboratoire de chimie organique, selon un article publié sur arXiv (2606.31037v1). Le système reconstruit plus de 30 éléments fidèles fonctionnellement à partir de postes de travail réels de chimie organique, via une modélisation dite "real-to-sim", couvrant les opérations centrales des expériences de routine en laboratoire. Labimus intègre des instruments articulés, une physique de poudre basée sur des particules, et des mesures en boucle fermée reliant manipulation et lecture d'instruments. Le benchmark définit six opérations atomiques et un protocole en sept étapes pour la pesée de solides, directement dérivé de procédures opératoires standard utilisées en laboratoire réel. Les auteurs y associent un protocole d'évaluation "precision-aware", mesurant conjointement la réussite de la tâche, la précision expérimentale et l'exécution sur des horizons longs. Trois politiques de contrôle représentatives ont été testées sous des dispositions procédurales variables et des perturbations environnementales. Le résultat central est ce que les auteurs nomment un "gap de précision" : des politiques capables de mener une tâche à terme échouent malgré tout à respecter les tolérances quantitatives exigées par les protocoles expérimentaux réels. C'est un signal important pour l'écosystème robotique humanoïde, où la plupart des démonstrations publiques (Figure 03, Optimus, GR00T N2, Helix) se concentrent sur la réussite visible d'une tâche plutôt que sur sa validité métrologique. Labimus démontre que "terminer la tâche" et "produire un résultat scientifiquement exploitable" sont deux critères distincts, ce qui questionne la pertinence des benchmarks actuels pour des applications à forte exigence de précision comme l'automatisation de laboratoire. Le travail s'inscrit dans la dynamique plus large d'automatisation scientifique par IA, où les plateformes robotiques et le raisonnement scientifique assisté par IA ont progressé rapidement, mais où des opérations comme le transfert solide-solide restent difficiles à standardiser en raison de leur caractère dynamique. Contrairement aux benchmarks de manipulation généralistes existants, Labimus cible spécifiquement ce contexte de précision critique, ouvrant la voie à des travaux futurs de développement de robots humanoïdes fiables pour les laboratoires scientifiques, un segment encore largement inexploré par les acteurs commerciaux du secteur.

RecherchePaper
1 source
SiMDex : exploiter des vidéos égocentriques similaires pour la manipulation dextre inter-incarnation
4arXiv cs.RO 

SiMDex : exploiter des vidéos égocentriques similaires pour la manipulation dextre inter-incarnation

Des chercheurs présentent SiMDex, un framework de curation de données par similarité pour l'entraînement des modèles vision-langage-action (VLA) appliqués à la manipulation dextre robotique, publié début août 2026 sur arXiv. Le système traite un problème concret: parmi des millions de vidéos égocentriques humaines disponibles, lesquelles sont réellement utiles pour apprendre à un bras ou une main robotique à manipuler des objets? SiMDex formule cette sélection comme un problème de recommandation, avec un pipeline en trois étapes (rappel, classement, reclassement) qui extrait, pour chaque démonstration robotique, les sous-ensembles pertinents dans un réservoir d'environ 32 millions d'échantillons vidéo égocentriques. L'espace d'action utilisé est agnostique à la morphologie, donc aucune modification de l'architecture VLA ni du processus d'entraînement n'est requise pour l'intégrer. Face à une base de référence entraînée avec un volume équivalent de données humaines choisies aléatoirement, SiMDex n'utilise que 1,49 million d'échantillons triés, soit moins de 5% du réservoir total, tout en faisant grimper le taux de réussite global de 47,7% à 61,1%. Cet écart de plus de 13 points obtenu avec dix fois moins de données a une portée directe pour le secteur: il suggère que le frein au post-entraînement des VLA n'est pas le volume de vidéos humaines disponibles, mais leur pertinence pour la tâche visée. Depuis deux ans, la course à la manipulation dextre mise surtout sur la mise à l'échelle brute de jeux de données égocentriques pour combler l'écart entre démonstration et déploiement réel. SiMDex questionne cette logique indiscriminée: pour les laboratoires et intégrateurs qui entraînent des politiques de manipulation, un curatoriat ciblé peut réduire fortement les coûts de calcul et de stockage tout en améliorant la performance, sans toucher au modèle lui-même. Le travail s'inscrit dans la recherche sur l'apprentissage cross-embodiment, où des vidéos de mains humaines servent à préentraîner des politiques ensuite transférées à des mains ou bras robotiques de morphologie différente, une piste explorée par plusieurs équipes travaillant sur des VLA généralistes. Les résultats restent pour l'instant limités à des benchmarks internes: rien n'indique encore une validation en déploiement réel, ni si le code ou le jeu de données mineur seront rendus publics.

RechercheActu
1 source