Aller au contenu principal
Les agents IA créent des terrains de jeu virtuels pour fournir aux robots des données d'entraînement essentielles
RechercheMIT News Robotics 

Les agents IA créent des terrains de jeu virtuels pour fournir aux robots des données d'entraînement essentielles

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs du MIT CSAIL et du Toyota Research Institute ont présenté SceneSmith, un système qui génère des environnements 3D synthétiques pour entraîner des robots en simulation. L'outil s'appuie sur trois agents IA reposant chacun sur GPT-5.2, un modèle vision-langage (VLM) entraîné sur du texte et des images à grande échelle : un agent "designer" génère les éléments de la scène (murs, objets, mobilier), un agent "critique" évalue le réalisme du résultat, et un "orchestrateur" gère les allers-retours entre les deux jusqu'à validation finale. Les chercheurs ont produit plus de 1300 scènes de ce type, couvrant des restaurants, chambres, hôtels et garages, avec jusqu'à six fois plus d'objets par scène que les méthodes précédentes. Sur simple requête textuelle ("un garage avec une voiture, un établi, des pneus empilés dans un coin et une échelle contre le mur"), le système produit une scène directement chargeable dans un moteur de simulation physique. Nicholas Pfaff, doctorant au MIT EECS et auteur principal de l'étude aux côtés de Russ Tedrake, professeur au MIT et chercheur principal au CSAIL, note que le système a improvisé des arrangements créatifs sans instruction explicite en ce sens. Dans une phase de test, les chercheurs ont généré 100 environnements uniques pour évaluer des politiques d'action robotiques (des plans de tâches comme déposer une tasse dans l'évier ou déplacer une canette d'une étagère à une table). Un agent VLM a jugé chaque tentative, et ses verdicts ont concordé avec l'avis humain dans plus de 99% des cas.

L'enjeu principal reste le goulot d'étranglement des données pour l'apprentissage robotique : entraîner physiquement un robot à chaque tâche, dans chaque environnement, est coûteux en temps et en main d'œuvre. La simulation est identifiée depuis des années comme solution potentielle, mais butait jusqu'ici sur la pauvreth et le manque de diversité du contenu généré, loin de la richesse du monde réel. Si les résultats de validation à 99% se confirment sur d'autres benchmarks, SceneSmith apporterait un début de réponse concrète à ce problème en permettant de tester et filtrer les politiques robotiques en simulation avant tout déploiement physique, réduisant d'autant les essais-erreurs coûteux sur du matériel réel. Pour les intégrateurs et équipes de R&D robotique, cela ouvre la possibilité de valider un plus grand nombre de comportements avant la mise en service, un enjeu classique de l'écart entre démonstration et réalité opérationnelle.

Le projet s'inscrit dans la continuité des travaux du laboratoire de Russ Tedrake au CSAIL sur la simulation physique et l'apprentissage robotique, en partenariat avec le Toyota Research Institute, acteur historiquement actif sur la robotique domestique et industrielle. La question de la validité de ces mondes virtuels, à savoir dans quelle mesure leur réalisme se traduit effectivement par un transfert réussi vers le monde physique (le fameux problème du "sim-to-real"), reste ouverte : les chercheurs indiquent avoir engagé des vérifications supplémentaires sur ce point, sans que les détails de cette validation ne soient encore précisés.

À lire aussi

IA agents créent des terrains de jeu virtuels pour entraîner les robots
1Robohub 

IA agents créent des terrains de jeu virtuels pour entraîner les robots

Des chercheurs du MIT CSAIL et du Toyota Research Institute ont conçu SceneSmith, un système qui génère des scènes 3D réalistes pour entraîner des robots en simulation. Trois agents IA, tous pilotés par le même modèle vision-langage GPT-5.2, se répartissent le travail : un agent "designer" place les objets et l'agencement de la pièce, un agent "critique" évalue le réalisme du résultat, et un "orchestrateur" décide quand la scène est terminée avant de la charger dans un moteur physique. L'équipe, menée par le doctorant Nicholas Pfaff sous la direction de Russ Tedrake (chaire Toyota, CSAIL), a produit plus de 1300 scènes de restaurants, chambres, hôtels et garages, avec jusqu'à six fois plus d'objets par pièce que les méthodes précédentes. Cent espaces additionnels ont servi à tester automatiquement, via un agent VLM juge, la fiabilité de politiques de contrôle de robots pour des tâches comme poser un verre dans un évier ou déplacer une canette d'une étagère à une table. Le principal frein de la robotique généraliste reste la donnée : entraîner un robot physique à de nouvelles tâches en conditions réelles coûte cher en temps et en supervision. SceneSmith automatise la création de mondes virtuels assez variés pour que les compétences apprises en simulation se transfèrent au réel, un défi connu sous le nom de sim-to-real. Pour les intégrateurs, l'intérêt est direct : tester des politiques de contrôle dans des scènes générées automatiquement plutôt que construites pièce par pièce à la main, avant tout essai physique. Le résultat illustre aussi une tendance plus large : des modèles vision-langage entraînés sur des corpus internet encodent assez de connaissance spatiale pour composer des environnements crédibles sans règles d'agencement écrites à la main, signe que les VLM à grande échelle deviennent des briques réutilisables au-delà de la perception ou du langage. À nuancer : il s'agit d'un système testé en simulation, sans robot physique déployé, et la créativité des arrangements, saluée par les auteurs, reste une appréciation qualitative plutôt qu'une métrique chiffrée. Ces travaux prolongent les recherches du laboratoire de Russ Tedrake au CSAIL sur la génération procédurale de scènes, un axe où les moteurs physiques ont progressé plus vite que le contenu réaliste à y faire tourner. Le partenariat avec le Toyota Research Institute s'inscrit dans les efforts du constructeur pour accélérer l'apprentissage de robots domestiques et industriels sans multiplier les essais physiques coûteux. SceneSmith rejoint la vague d'outils de génération de données synthétiques et de jumeaux numériques que les laboratoires de robotique développent pour combler l'écart entre simulation et réalité. Aucun calendrier de déploiement sur un robot commercial n'est annoncé : l'outil reste un système de recherche en simulation, dont la prochaine étape logique serait de vérifier que les politiques entraînées sur ces scènes se transfèrent bien à des robots physiques.

RecherchePaper
1 source
IA incarnée : le MIT forme des robots grâce à des environnements virtuels 3D réalistes
2Interesting Engineering 

IA incarnée : le MIT forme des robots grâce à des environnements virtuels 3D réalistes

Des chercheurs du MIT ont dévoilé SceneSmith, un système d'intelligence artificielle capable de générer automatiquement des environnements intérieurs 3D réalistes pour entraîner des robots. La plateforme s'appuie sur trois agents IA complémentaires fonctionnant en boucle: un "designer" qui construit la disposition de la pièce et place meubles et objets, un "critique" qui vérifie le réalisme de la scène et signale les incohérences (un objet qui n'a rien à faire dans cette pièce, par exemple), et un "orchestrateur" qui pilote l'ensemble du processus et décide quand la scène est terminée ou doit être révisée. Ces agents s'appuient sur GPT-5.2, le modèle vision-langage d'OpenAI, pour comprendre comment les espaces réels sont agencés. Un utilisateur peut simplement décrire une pièce en langage naturel, par exemple un garage avec voiture, établi, pneus empilés et échelle contre le mur, et SceneSmith en génère une version virtuelle détaillée. L'équipe a produit plus de 1300 environnements virtuels (cuisines, hôtels, bureaux, commerces, espaces à thème), dans lesquels des robots se sont entraînés à des tâches domestiques courantes: poser des fruits sur une assiette, déplacer des canettes entre étagères et table, ouvrir des placards, ranger des tasses dans un évier. Sur 100 environnements testés, un agent IA a évalué la réussite des tâches, avec un taux d'accord de plus de 99% avec des évaluateurs humains. Une étude auprès de plus de 200 personnes a montré que plus de 90% jugeaient les scènes de SceneSmith plus réalistes que celles produites par les méthodes précédentes, avec jusqu'à six fois plus d'objets interactifs par scène. L'enjeu central que vise SceneSmith est le principal goulot d'étranglement de la robotique actuelle: contrairement aux chatbots qui apprennent sur du texte, les robots ont besoin de données d'interaction physique variées, coûteuses et lentes à collecter en conditions réelles. En automatisant la création de mondes virtuels riches et crédibles, le MIT cherche à réduire cette dépendance aux essais physiques tout en accélérant l'itération sur les stratégies de contrôle. Le test le plus révélateur reste celui d'un contrôleur robotique entraîné principalement sur des données réelles, qui a réussi des tâches (saisir une pomme dans un bol, la poser sur une planche à découper) dans des environnements SceneSmith qu'il n'avait jamais vus, un indice de transfert sim-to-real qui intéressera directement intégrateurs et équipes R&D cherchant à réduire les coûts de collecte terrain. Le projet s'inscrit dans la course plus large à la génération de données synthétiques pour la robotique, où plusieurs laboratoires tentent de contourner la rareté des données physiques réelles. Le MIT ne communique pas, à ce stade, de calendrier de déploiement commercial ni de partenariat industriel annoncé: il s'agit d'une publication de recherche, présentée via un communiqué de l'équipe, dont l'ampleur des bénéfices en conditions réelles de production reste à confirmer au-delà des tests en laboratoire.

RecherchePaper
1 source
HABIT : jeu de données pour l'entraînement de la manipulation robotique sensible aux comportements humains
3arXiv cs.RO 

HABIT : jeu de données pour l'entraînement de la manipulation robotique sensible aux comportements humains

Des chercheurs publient HABIT (Human-Aware Behavior and Interaction Training), un jeu de données de démonstration pour l'apprentissage de politiques de manipulation robotique en présence humaine, décrit dans un article déposé sur arXiv (identifiant 2606.31682, juin 2026). Le corpus rassemble plus de 10 000 épisodes et 160 heures d'enregistrements couvrant 60 tâches, organisées selon trois rôles d'interaction homme-robot : « Collaborateur », où humain et robot accomplissent une tâche ensemble, « Collègue », où ils opèrent des tâches séparées dans un espace partagé, et « Superviseur », où l'humain dirige le robot par instructions. Contrairement aux jeux de données existants pour les politiques robotiques généralistes, collectés sans présence humaine dans la scène, HABIT introduit explicitement des humains dans les démonstrations. L'enjeu est la capacité des robots à adopter des comportements conscients de la présence humaine, un angle mort des grands corpus qui alimentent aujourd'hui les politiques VLA (vision-langage-action). Les expériences montrent que l'entraînement sur données incluant des humains fait émerger des comportements que les données robot seul ne produisent pas : synchronisation spatio-temporelle dans les tâches de collaboration, cession de passage dans les tâches de coexistence, et ancrage gestuel pour interpréter les instructions du superviseur. Les auteurs indiquent aussi que l'entraînement sur HABIT accélère l'adaptation à de nouvelles tâches d'interaction homme-robot. Pour les intégrateurs qui déploient des robots en usine ou en entrepôt aux côtés d'opérateurs, c'est un signal que la cohabitation sûre et fluide dépend moins du matériel que de la composition des données d'entraînement, un manque que la course aux modèles fondation robotiques a largement laissé de côté. HABIT s'inscrit dans la lignée des grands corpus type Open X-Embodiment ou DROID, qui ont permis l'essor des politiques généralistes telles que Pi-0 ou GR00T N2 mais restent tournés vers des scènes sans humains, un manque que plusieurs équipes académiques cherchent désormais à combler à mesure que les humanoïdes et bras collaboratifs sortent des lignes de démonstration pour entrer dans des ateliers occupés. À ce stade, HABIT reste une publication de recherche accompagnée d'un jeu de données, sans annonce de produit ni de partenariat industriel ; sa portée dépendra de son adoption par d'autres laboratoires pour entraîner et comparer leurs politiques sur des tâches de collaboration homme-robot.

RecherchePaper
1 source
Un nouveau système d'IA aide les robots à transférer leur entraînement virtuel vers des tâches réelles
4Interesting Engineering 

Un nouveau système d'IA aide les robots à transférer leur entraînement virtuel vers des tâches réelles

Des chercheurs de l'Aston University et de l'University of Birmingham ont publié dans Scientific Reports une méthode d'entraînement robotique visant à réduire le "sim-to-real gap", ce fossé persistant entre les performances d'un robot en simulation et son comportement réel. L'approche, développée dans le cadre du projet REBELION financé par UK Research and Innovation, utilise un générateur de variations d'environnement piloté par IA : pendant la phase de simulation, le système introduit automatiquement des perturbations (bruit capteur, variabilité des matériaux, forces inattendues) pour entraîner le robot à des conditions plus proches du terrain. La validation expérimentale porte sur des tâches de manipulation et de découpe impliquant une interaction physique avec des matériaux, puis un ajustement avec un volume minimal de données réelles. Le cas d'usage mis en avant est le recyclage de batteries lithium-ion, où les robots doivent opérer autour de cellules endommagées ou potentiellement dangereuses, rendant les cycles de test physiques coûteux et risqués. L'intérêt industriel est direct : la dépendance à de longs cycles de test en environnement réel est l'un des principaux freins au déploiement rapide de robots dans des lignes de production ou des ateliers de recyclage. En permettant de compresser l'essentiel de l'apprentissage en simulation tout en garantissant un transfert fiable avec peu de données réelles, cette approche pourrait raccourcir significativement les timelines d'intégration et réduire les coûts opérationnels pour les industriels. Elle valide aussi une hypothèse qui fait débat dans le secteur depuis plusieurs années : que le sim-to-real gap n'est pas une fatalité, mais un problème d'exposition à la variance pendant l'entraînement. La vision formulée par le Dr. Alireza Rastegarpanah, assistant professor en applied AI and robotics à Aston University, est celle de systèmes robotiques "plug-and-play", entraînés une fois en simulation et redéployés rapidement dans un nouveau contexte sans reconfiguration lourde. C'est une promesse ambitieuse, et les résultats publiés restent limités à un périmètre de tâches contrôlées ; aucun chiffre de performance comparative (taux de succès, cycles de recalibration) n'est rendu public dans la version relayée. Le sim-to-real gap est un problème structurel documenté depuis les premières applications de reinforcement learning en robotique. Des acteurs comme Boston Dynamics, Agility Robotics ou encore Wandercraft (France, exosquelettes) utilisent des combinaisons de domain randomization et de transfert par imitation pour y répondre, avec des niveaux de maturité variables selon les tâches. Le projet REBELION s'inscrit dans un effort européen plus large sur l'automatisation du recyclage de batteries, filière en forte croissance avec l'essor des véhicules électriques. Les prochaines étapes annoncées par l'équipe visent à élargir la méthode à des environnements industriels plus incertains et à des applications en manufacturing avancé et opérations autonomes, sans calendrier précis communiqué.

UELa méthode du projet REBELION (financé UKRI, inscrit dans un effort européen) pourrait accélérer le déploiement de robots dans les filières EU de recyclage de batteries lithium-ion, secteur stratégique pour la transition électrique.

RecherchePaper
1 source