Aller au contenu principal
Real2Sim à base d'agents : modélisation physique du monde par agents vision-langage
RecherchearXiv cs.RO 

Real2Sim à base d'agents : modélisation physique du monde par agents vision-langage

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Optimus, Figure, Gr00t... la robotique humanoïde progresse vite en démos mais bute toujours sur un même verrou technique : reconstruire un environnement réel en simulation physique exploitable. Un article arXiv (2607.19190) présente Agentic Real2Sim, un framework qui utilise des agents vision-langage (VLA) pour automatiser cette conversion. Concrètement, à partir d'un simple enregistrement d'une interaction robot-objet dans le monde réel, le système génère un "jumeau épisodique" simulable, préservant les observations visuelles, les géométries de la scène, les états des objets et les mouvements du robot. Les auteurs ont testé leur approche sur trois familles de scénarios distinctes habituellement traitées par des pipelines séparés : manipulation d'objets rigides, interaction avec des objets déformables, et mouvements humanoïdes. Point notable, le framework peut fonctionner avec un modèle vision-langage open-weight, à une fraction du coût des modèles frontier (type GPT-4V ou équivalents propriétaires), tout en obtenant un taux de conversion réussie comparable.

L'enjeu dépasse la seule prouesse académique. Le goulot d'étranglement du "real2sim" est aujourd'hui l'un des principaux freins à l'entraînement de politiques robotiques par apprentissage : sans environnement simulé fidèle, impossible d'entraîner ou d'évaluer massivement des modèles de contrôle sans multiplier les essais coûteux sur robot physique. Actuellement, ce travail repose sur du réglage manuel de modèles de vision, du nettoyage de maillages 3D et de l'alignement de repères de coordonnées, un processus lent et peu reproductible d'un labo à l'autre. Automatiser cette étape via des agents autonomes, capables de prendre eux-mêmes les décisions de pipeline, pourrait accélérer la constitution de jeux de données d'entraînement pour les politiques de type VLA, un sujet clé alors que des acteurs comme Physical Intelligence (Pi-0) ou NVIDIA (GR00T N2) cherchent à démontrer que leurs modèles généralisent au-delà des données d'entraînement.

Ce travail s'inscrit dans une tendance plus large de recherche visant à combler l'écart entre simulation et réel (le "sim-to-real gap"), longtemps considéré comme l'un des obstacles majeurs à la robotique généraliste. Il ne s'agit ici que d'une publication de recherche, avec un site de projet public, et non d'un produit commercial ou d'un déploiement industriel : les auteurs eux-mêmes le présentent comme "un premier pas" vers une conversion real2sim généralisable et à l'échelle, sans préciser de calendrier de mise à disposition ou d'intégration dans des pipelines industriels existants.

À lire aussi

JEPA-WAM : des politiques vision-langage-action apprises par modélisation du monde à embarquement conjoint
1arXiv cs.RO 

JEPA-WAM : des politiques vision-langage-action apprises par modélisation du monde à embarquement conjoint

JEPA-WAM, un nouveau modèle de monde latent (world action model, WAM) pour le contrôle robotique, est présenté dans un article publié le 11 août 2026 sur arXiv (2608.09381v1). Le système s'appuie sur l'espace latent pré-entraîné V-JEPA, l'architecture d'auto-supervision vidéo développée par Meta AI, et couple prédiction de transition et génération d'action continue via un prédicteur partagé, plutôt que de générer explicitement des vidéos futures comme le font les WAM à base vidéo, coûteux à déployer. Sur le benchmark LIBERO-Plus, JEPA-WAM atteint 79,2 % de réussite, le meilleur score parmi les méthodes sans pré-entraînement à grande échelle sur des politiques robotiques. Instancié sur le modèle pi0.5 déjà pré-entraîné, il grimpe à 86,3 %, la meilleure performance globale rapportée dans l'article. Des expériences complémentaires sur le simulateur RoboTwin 2.0 et sur des tâches de manipulation bimanuelle en conditions réelles confirment une bonne généralisation face aux variations visuelles et spatiales. Ce travail s'attaque à un compromis central dans l'apprentissage de politiques vision-langage-action (VLA) : les modèles de monde générant explicitement des vidéos futures sont coûteux en calcul et en latence, tandis que les approches latentes existantes sacrifient souvent la richesse de la représentation prédictive ou la séparent du chemin utilisé pour générer l'action. En démontrant qu'un même prédicteur partagé peut porter à la fois la supervision de transition et la prédiction d'action sans déconnecter représentation et politique, JEPA-WAM fournit un argument empirique en faveur de l'unification des deux tâches dans une même colonne vertébrale visuelle. Pour les équipes de recherche et les intégrateurs en robotique, l'intérêt pratique tient au fait que la méthode s'applique aussi à des politiques VLA déjà pré-entraînées, comme pi0.5, sans modifier leurs chemins de perception et d'action d'origine, ce qui laisse entrevoir un gain applicable à des systèmes existants plutôt qu'une architecture entièrement nouvelle à réentraîner. Il s'agit d'un article de recherche publié sur arXiv, sans annonce de produit ni de déploiement commercial : les résultats reposent sur des benchmarks de simulation (LIBERO-Plus, RoboTwin 2.0) complétés par des essais réels limités en manipulation bimanuelle, sans précision sur le nombre de robots ou les sites concernés. JEPA-WAM s'inscrit dans la lignée des architectures d'apprentissage par prédiction latente issues de V-JEPA, et se positionne face à l'écosystème grandissant des politiques VLA telles que pi-0 de Physical Intelligence, GR00T N2 de Nvidia ou Helix de Figure. Les auteurs ne précisent aucun calendrier de suite, pilote industriel ou partenariat, ce qui situe cette publication au stade de la recherche fondamentale plutôt qu'à une étape de déploiement à court terme.

RechercheActu
1 source
RedVLA : l'attaque physique des modèles vision-langage-action (VLA)
2arXiv cs.RO 

RedVLA : l'attaque physique des modèles vision-langage-action (VLA)

Une équipe de chercheurs a publié RedVLA (arXiv:2604.22591), présenté comme le premier framework de red teaming physique dédié aux modèles VLA (Vision-Language-Action), ces architectures multimodales qui pilotent des robots physiques en interprétant simultanément des instructions visuelles et textuelles. Le framework opère en deux étapes : une phase de "Risk Scenario Synthesis" qui identifie automatiquement les régions d'interaction critiques dans des trajectoires normales pour y insérer des facteurs de risque entremêlés au flux d'exécution du modèle, suivie d'un "Risk Amplification" qui raffine itérativement la position et l'état du facteur de risque via une optimisation sans gradient guidée par des caractéristiques de trajectoire. Testé sur six modèles VLA représentatifs, RedVLA atteint un taux de succès d'attaque (Attack Success Rate) de 95,5 % en seulement 10 itérations d'optimisation. Les chercheurs proposent en parallèle SimpleVLA-Guard, un module de sécurité léger entraîné sur les données générées par RedVLA, dont le code et les assets sont disponibles publiquement. Un ASR de 95,5 % signifie que dans quasiment tous les scénarios testés, le framework a réussi à provoquer des comportements dangereux dans des modèles VLA avant déploiement. C'est un résultat préoccupant pour les intégrateurs industriels : contrairement aux attaques sur systèmes purement logiciels, les comportements physiques incorrects (collisions, chutes d'objets, dommages environnementaux) sont souvent irréversibles. RedVLA démontre qu'il est possible de cartographier ces risques de façon systématique avant mise en production, ce qui comble un vide méthodologique réel. Pour les équipes chargées de qualifier des robots manipulateurs ou des humanoïdes, ce type d'outil d'évaluation adversariale pourrait devenir une exigence de certification, à l'image des standards de sécurité fonctionnelle (IEC 61508) dans l'automatisation industrielle. Les modèles VLA ont connu une accélération marquée depuis 2023 avec RT-2 (Google DeepMind), OpenVLA (Stanford), Pi-0 (Physical Intelligence) et GR00T N2 (NVIDIA), chacun visant à généraliser les capacités de manipulation via de grandes architectures multimodales pré-entraînées. La sécurité physique de ces systèmes est restée largement sous-étudiée, la recherche en robustesse IA se concentrant surtout sur les attaques adversariales textuelles ou visuelles en contexte numérique. RedVLA adapte les méthodologies de red teaming issues des LLMs au domaine physique, un glissement de paradigme qui devrait intéresser aussi bien les acteurs américains (Figure AI, Agility Robotics, Boston Dynamics) que les startups européennes déployant des robots en environnement humain, comme Enchanted Tools (Mirokaï, France) ou Wandercraft. Les prochaines étapes naturelles seraient des validations sur hardware réel et l'intégration de SimpleVLA-Guard dans des pipelines de déploiement industriels.

UELes startups françaises déployant des robots en environnement humain (Enchanted Tools, Wandercraft) sont directement concernées par ces vulnérabilités VLA, et SimpleVLA-Guard pourrait s'imposer comme exigence dans les pipelines de qualification sous réglementation européenne (AI Act, certification IEC 61508).

RechercheOpinion
1 source
Modèle du monde critique pour l'apprentissage par renforcement vision-langage-action (WCM)
3arXiv cs.RO 

Modèle du monde critique pour l'apprentissage par renforcement vision-langage-action (WCM)

Des chercheurs ont publié fin juillet 2026 un article arXiv (2607.29613) présentant le World Critic Model (WCM), une nouvelle architecture pour l'apprentissage par renforcement (RL) appliqué aux modèles Vision-Language-Action (VLA) utilisés en manipulation robotique. Le problème ciblé est celui des méthodes RL à base de critique, qui évaluent la valeur d'une action à partir d'une seule image ou d'un seul instant du flux visuel, un choix mal adapté au contrôle robotique où l'observation est par nature partielle et séquentielle. Bâti sur une architecture légère dérivée de LeJEPA, WCM prédit conjointement l'état latent futur de la scène et estime la valeur de l'action, ce qui force le critique à apprendre la dynamique temporelle plutôt qu'à simplement régresser un score. Le système s'intègre aux pipelines on-policy et off-policy et fonctionne avec les backbones VLA de référence Pi0, Pi0.5 et OpenVLA-OFT. Les auteurs rapportent des résultats état de l'art sur 149 tâches réparties sur quatre benchmarks, avec des gains marqués en généralisation hors distribution, ainsi qu'une validation sur sept tâches de manipulation réelles combinant OpenVLA-OFT et Pi0.5 en RL off-policy. L'enjeu dépasse la seule performance chiffrée: le RL post-entraînement des modèles VLA est aujourd'hui l'un des leviers les plus regardés pour fiabiliser les politiques robotiques au-delà de l'imitation pure, mais les critiques scalaires classiques peinent justement là où le contrôle réel exige de la mémoire et de l'anticipation. Si les gains de généralisation se confirment en dehors du cadre des benchmarks académiques, WCM pourrait devenir un composant standard pour les équipes qui affinent des VLA en production plutôt qu'une simple curiosité de laboratoire, en particulier pour les intégrateurs qui cherchent à réduire l'écart entre démonstration en simulation et déploiement réel. L'article s'inscrit dans la lignée des travaux récents sur l'apprentissage par prédiction de représentations latentes (JEPA, popularisé par Meta AI) appliqués à la robotique, et complète les approches critic-based existantes du RL pour VLA. Les auteurs ne précisent pas de plan de mise en open source ni de calendrier d'intégration dans des stacks robotiques commerciales; l'étape suivante logique serait une validation à plus grande échelle sur des plateformes industrielles.

RechercheActu
1 source
ACE-Brain-0.5 : un modèle fondation incarné unifié pour l'IA physique à base d'agents
4arXiv cs.RO 

ACE-Brain-0.5 : un modèle fondation incarné unifié pour l'IA physique à base d'agents

Une équipe de recherche présente ACE-Brain-0.5, un modèle de fondation embarqué unifié pour l'IA physique agentique, dans un article publié sur arXiv début juillet 2026. Le système s'appuie sur un backbone unique de 8 milliards de paramètres qui assure quatre fonctions simultanées : ancrage des objets et des affordances dans la scène, raisonnement spatial en 3D et en vue égocentrique, décomposition d'instructions en sous-objectifs, génération d'actions de navigation et de manipulation, et estimation de la progression pour vérifier ou corriger l'exécution. Une cinquième fonction, l'auto-amélioration, repose sur un cadre externe qui met à jour les schémas de tâches, la mémoire spatiale et les cas de récupération d'échec à partir des données de déploiement. Le modèle s'appuie sur un prédécesseur, ACE-Brain-0, et introduit une méthode nommée SSR+ (Scaffold-Specialize-Reconcile avec une étape de Réactivation après fusion des vecteurs de tâches) pour combiner ces capacités sans qu'elles n'interfèrent entre elles. Sur quinze bancs d'essai, ACE-Brain-0.5 surpasse son prédécesseur sur 14 des 18 tests de perception spatiale et d'ancrage, tout en restant compétitif en navigation et manipulation. Cette approche illustre une tendance de fond dans la robotique humanoïde et les agents physiques : le passage de politiques bout-en-bout, souvent dépourvues de raisonnement spatial explicite, vers des architectures qui unifient perception, planification, action et auto-évaluation dans une représentation partagée. C'est un pari différent de celui des modèles VLA généralistes type Pi-0 ou GR00T N2, qui privilégient l'apprentissage direct d'une politique d'action : ici, l'accent est mis sur la boucle fermée complète, avec vérification et récupération d'erreur intégrées, un point souvent négligé dans les démonstrations spectaculaires mais peu robustes du secteur. Le papier ne précise pas de partenariat industriel ni de déploiement sur plateforme commerciale à ce stade : il s'agit d'un travail de recherche fondamentale, positionné comme une étape vers une IA physique agentique plus générale, sans calendrier de mise en production annoncé.

RechercheOpinion
1 source