Aller au contenu principal
GraspIT : un jeu de données comblant l'écart simulation-réel pour la génération validée de poses de préhension SE(3)
RecherchearXiv cs.RO 

GraspIT : un jeu de données comblant l'écart simulation-réel pour la génération validée de poses de préhension SE(3)

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

GraspIT, un nouveau dataset de prises robotiques présenté dans un article arXiv publié cette semaine, s'attaque au problème du transfert simulation-réel pour la préhension d'objets inédits. L'équipe a généré des scènes de table dans NVIDIA Isaac Sim, puis annoté chaque prise candidate via un test physique de glissement en quatre étapes, exécuté sur des instances virtuelles de bras Franka Panda, allant au-delà du simple critère de force-closure classique. Sur environ 2,3 millions de prises candidates, 83% obtiennent un score de qualité jugé bon (seuil de 0,50 ou plus), tandis que les 17% restants, qui passent le test de force-closure mais échouent au test de glissement, constituent des "hard negatives" utiles à l'entraînement. Une boucle réel-vers-simulation rétroprojette ensuite ces annotations sur 100 scènes réelles. Au total, le dataset livre environ 316 000 jeux d'images RGB-D annotées, couvrant 1035 scènes simulées et 100 scènes réelles, avec masques d'instance, poses en 6 degrés de liberté, propriétés physiques des objets et scores de qualité pour chaque prise. Les outils sont open source et conteneurisés via Docker.

Cette publication comble un manque identifié par les auteurs eux-mêmes: aucun dataset existant ne combinait jusqu'ici observations photoréalistes, validation physique rigoureuse des prises et pont explicite entre simulation et monde réel. Pour les équipes de recherche en manipulation robotique, ce type de ressource conditionne directement la qualité des politiques apprises par imitation ou par renforcement, notamment pour les modèles vision-langage-action qui nécessitent de gros volumes de démonstrations fiables. Les négatifs difficiles générés par le test de glissement offrent en particulier un signal d'entraînement plus discriminant que les datasets fondés sur la seule force-closure, souvent trop permissifs.

Le projet s'inscrit dans une littérature croissante cherchant à réduire l'écart sim-to-real, un obstacle persistant pour déployer en conditions réelles des politiques entraînées en simulation. La planification de trajectoires intégrée dans Isaac Sim permet en outre de streamer des démonstrations haute résolution pour l'apprentissage de politiques de manipulation sur table et le clonage comportemental, ouvrant la voie à des travaux de suivi sur des tâches de préhension plus complexes.

À lire aussi

RoboDesign1M : un jeu de données à grande échelle pour la compréhension de la conception robotique
1arXiv cs.RO 

RoboDesign1M : un jeu de données à grande échelle pour la compréhension de la conception robotique

Le dataset RoboDesign1M rassemble un million d'échantillons multimodaux consacrés à la conception de robots, extraits automatiquement de la littérature scientifique couvrant plusieurs domaines de la robotique. Les auteurs ont mis au point un pipeline de collecte semi-automatisé permettant d'agréger efficacement des données diverses (texte et images) issues de publications existantes, plutôt que de les créer manuellement. Pour valider l'utilité du corpus, l'équipe a mené des expériences sur trois tâches distinctes : la génération d'images de conception robotique, la réponse à des questions visuelles portant sur des schémas de conception, et la recherche d'images de conception à partir de requêtes. Les résultats montrent que ce jeu de données constitue un nouveau benchmark exigeant pour ces tâches de compréhension du design. Le dataset sera rendu public, avec une page de projet dédiée (airvlab.github.io/robotdesign1m). Il s'agit d'une version mise à jour d'un article déposé sur arXiv (2503.06796), initialement publié en mars puis révisé. Ce travail cible un goulot d'étranglement méthodologique plutôt qu'un produit commercial : la conception mécanique d'un robot reste un processus long, coûteux et dépendant d'une expertise rare, et les modèles de fondation qui pourraient l'automatiser manquaient jusqu'ici de données d'entraînement à grande échelle sur ce sujet précis. En fournissant un million d'exemples annotés, RoboDesign1M ouvre la voie à des assistants IA capables de proposer des pistes de conception, de retrouver des schémas existants à partir d'une description textuelle, ou de générer des visualisations de composants robotiques. Pour les laboratoires de recherche et les équipes R&D en robotique, c'est surtout un instrument de mesure standardisé qui manquait pour comparer objectivement les approches de génération et de compréhension de designs. Le projet s'inscrit dans la tendance plus large d'application des modèles de fondation multimodaux à des domaines d'ingénierie spécialisés, après leur succès en vision et en langage naturel. La rareté des jeux de données de conception robotique freinait jusqu'à présent ce transfert, contrairement à des domaines comme la manipulation ou la navigation qui disposent déjà de corpus massifs. La mise à disposition publique annoncée par les auteurs devrait permettre à d'autres équipes de recherche de reproduire et d'étendre ces travaux, sans toutefois que des applications commerciales concrètes ou des partenariats industriels n'aient été mentionnés à ce stade.

RecherchePaper
1 source
TableVerse : un jeu de données de tables à grande échelle avec des dispositions ancrées dans le réel pour la manipulation généralisable
2arXiv cs.RO 

TableVerse : un jeu de données de tables à grande échelle avec des dispositions ancrées dans le réel pour la manipulation généralisable

TableVerse est un nouveau pipeline Real2Sim entièrement automatisé qui transforme des images non structurées, glanées sur internet, en environnements de table simulables avec une échelle métrique précise et une stabilité mécanique vérifiée. Contrairement aux méthodes existantes qui génèrent des scènes à partir de texte ou par génération procédurale simplifiée, TableVerse reconstruit de manière déterministe des dispositions d'objets réellement observées, en préservant leur topologie authentique. Le pipeline intègre également un module de génération de trajectoires conditionné par tâche, capable de produire des démonstrations de préhension et dépose (pick-and-place) sans collision. À partir de cette chaîne complète, les chercheurs ont constitué TableVerse-100K, un corpus de 100 000 environnements de table uniques et physiquement cohérents, chacun associé à des trajectoires de manipulation interactives. L'enjeu principal est celui, bien identifié dans la robotique manipulative, du goulot d'étranglement des données : entraîner des politiques de manipulation généralisables nécessite des volumes massifs de scènes réalistes et denses en encombrement, proches de véritables environnements domestiques ou industriels. Les approches de synthèse par hallucination texte-vers-disposition ou par génération procédurale produisent souvent des agencements physiquement implausibles, avec un encombrement bien plus pauvre que celui d'un vrai bureau ou d'une vraie table de cuisine. En ancrant la génération de scènes dans des images réelles plutôt que dans l'imagination d'un modèle génératif, TableVerse cherche à combler cet écart entre données synthétiques et complexité du monde réel, un enjeu central pour les modèles de type VLA (vision-langage-action) qui peinent aujourd'hui à généraliser au-delà de leurs environnements d'entraînement. Cette publication s'inscrit dans une dynamique de recherche plus large sur la génération automatisée de données d'entraînement pour la manipulation robotique, où plusieurs équipes explorent des approches concurrentes de synthèse procédurale ou de génération de scènes par diffusion 3D. L'accent mis ici sur la reconstruction déterministe à partir de médias internet non scénarisés, plutôt que sur la génération purement imaginative, marque une inflexion méthodologique. Les auteurs présentent TableVerse-100K comme une fondation de données destinée à alimenter les travaux futurs sur les politiques de manipulation généralisables, sans toutefois préciser à ce stade de calendrier de mise à disposition publique ou de validation par des déploiements robotiques réels.

RecherchePaper
1 source
R2RGEN : génération de données 3D réel-vers-réel pour une manipulation spatialement généralisée
3arXiv cs.RO 

R2RGEN : génération de données 3D réel-vers-réel pour une manipulation spatialement généralisée

Une équipe de chercheurs propose R2RGen, un cadre de génération de données pour l'apprentissage par imitation en manipulation robotique, publié sur arXiv (identifiant 2510.08547, version 2). Le principe : à partir d'un nombre minimal de démonstrations humaines réelles, le système génère automatiquement un grand volume de données d'entraînement spatialement diversifiées, sans jamais recourir à un simulateur. R2RGen traite les observations sous forme de nuages de points (pointcloud) et augmente les paires observation-action directement dans l'espace 3D réel. Le pipeline repose sur trois étapes : un module de parsing de scène et de trajectoire unifie les démonstrations issues de différentes configurations de caméras dans un espace 3D partagé ; une stratégie de backtracking par groupe augmente ensuite la position des objets et du robot lui-même ; enfin, un post-traitement adaptatif à la caméra aligne les données générées sur la distribution réelle des capteurs 3D. Le cadre est compatible avec les robots mobiles, ce qui le distingue des approches existantes, limitées aux bras fixes et à des angles de prise de vue prédéfinis. Ce résultat s'attaque à l'un des goulots d'étranglement les plus persistants de la robotique apprenante : le fossé sim-to-real. La plupart des pipelines de génération de données actuels passent par des moteurs physiques ou des rendus synthétiques, introduisant des artefacts visuels et des dynamiques inexactes qui dégradent les performances une fois transférés sur robot réel. R2RGen court-circuite entièrement cette chaîne en restant dans le domaine réel du début à la fin. En pratique, cela se traduit par une meilleure efficacité de la donnée sur l'ensemble des expériences rapportées, y compris sur des scénarios de manipulation mobile. Pour les équipes développant des politiques visuomotrices par imitation, cela signifie moins de démonstrations humaines nécessaires pour atteindre une généralisation spatiale robuste, c'est-à-dire la capacité du robot à opérer correctement quelle que soit la configuration relative des objets, de l'environnement ou de l'agent. La généralisation spatiale est le prérequis reconnu à toute manipulation robotique à usage général. Les travaux antérieurs, dans le sillage de RT-X et des pipelines sim-to-real basés sur Isaac Gym ou MuJoCo, avaient montré des gains mais restaient contraints à des bras fixes et à des angles de caméra prédéfinis. R2RGen se positionne comme une alternative plug-and-play sans infrastructure de simulation, abaissant la barrière d'entrée pour les laboratoires ou les équipes industrielles n'ayant pas accès à des environnements simulés robustes. La publication reste à ce stade une contribution académique sans déploiement industriel annoncé ; les auteurs indiquent comme prochaine étape naturelle la validation du passage à l'échelle sur des flottes de robots mobiles en environnement ouvert.

RecherchePaper
1 source
Combler l'écart de réalité : déploiement zero-shot du transfert simulation-réel pour la préhension et la manipulation dextériques basées sur la force
4arXiv cs.RO 

Combler l'écart de réalité : déploiement zero-shot du transfert simulation-réel pour la préhension et la manipulation dextériques basées sur la force

Une équipe de recherche présente une méthode d'apprentissage par renforcement permettant de transférer directement en simulation vers le réel des politiques de contrôle pour une main robotique à cinq doigts, sans aucun réglage fin sur le matériel physique. Le système combine un retour tactile dense avec une mesure du couple articulaire pour réguler finement les interactions de contact. Trois innovations techniques rendent ce transfert possible : une simulation tactile rapide calculant les distances entre unités tactiles virtuelles et l'objet via une cinématique directe parallélisée, une calibration courant-couple qui élimine le besoin de capteurs de couple physiques en convertissant le courant moteur en couple articulaire, et une modélisation randomisée de la dynamique des actionneurs pour compenser les effets non idéaux couple-vitesse. Entraînées entièrement en simulation via un pipeline PPO acteur-critique asymétrique, les politiques obtenues exécutent deux compétences clés de la main humaine, le contrôle de force de préhension sur commande et la réorientation d'objets dans la main, de façon robuste dès le déploiement sur robot réel. Cette avancée s'attaque à un verrou majeur de la robotique manipulatrice : l'écart de réalité (reality gap) entre simulation et exécution physique, particulièrement critique pour les mains à cinq doigts où la richesse des contacts et les imperfections d'actionnement rendent le transfert notoirement difficile. Contrairement aux approches nécessitant un réglage fin coûteux sur le robot réel, cette méthode zéro-shot réduit drastiquement le temps et le coût de déploiement, un enjeu direct pour les intégrateurs et fabricants qui cherchent à industrialiser la manipulation dextre au-delà des pinces simples. Les auteurs affirment qu'il s'agit de la première démonstration de préhension contrôlable sur une main multi-doigts entraînée uniquement en simulation. Le défi du sim-to-real occupe la recherche en robotique depuis plusieurs années, avec des approches concurrentes s'appuyant sur la randomisation de domaine ou l'apprentissage par imitation à partir de données réelles. L'ajout combiné de capteurs tactiles denses et de couple articulaire, plutôt que la seule vision ou proprioception, distingue cette approche et pourrait orienter les prochains travaux vers une intégration plus poussée du sens tactile dans les architectures de contrôle destinées aux mains robotiques commerciales.

RecherchePaper
1 source