Aller au contenu principal
Modèle du monde ancré : alignements latents prédictifs pour l'action (LeapBot-WA)
RecherchearXiv cs.RO 

Modèle du monde ancré : alignements latents prédictifs pour l'action (LeapBot-WA)

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche a publié sur arXiv (référence 2607.23969v1) LeapBot-WA, un nouveau modèle de type World Action Model (WAM) pour le contrôle robotique. Contrairement aux WAM classiques qui génèrent des vidéos pixel par pixel pour prédire l'évolution d'une scène, ce qui gaspille de la capacité de calcul sur des détails visuels sans intérêt pour la tâche et rend les politiques vulnérables aux distracteurs visuels, LeapBot-WA adopte une architecture "Predictive-Latent" en s'appuyant sur le Joint-Embedding Predictive Architecture (JEPA), utilisé comme "ancre du monde" (World-Anchor). Le système prédit la dynamique physique directement dans un espace latent abstrait plutôt que de reconstruire des images. Pour relier cet espace latent aux modèles de diffusion, les auteurs introduisent un Isotropic Semantic Autoencoder (ISAE), qui remodèle l'espace latent pour éviter les dérives hors variété. L'architecture repose aussi sur un Mixture-of-Transformers asymétrique : un Anchor Diffusion Transformer guide l'entraînement d'un Action Diffusion Transformer, puis est retiré à l'inférence pour ne conserver aucun surcoût de calcul. Sur les benchmarks LIBERO et RoboTwin 2.0, LeapBot-WA atteint l'état de l'art parmi les modèles prédictifs et rivalise avec les meilleurs WAM génératifs, sans pré-entraînement massif sur trajectoires. Le code est disponible sur GitHub (LeapWM/leapbot-wa).

Pour l'industrie robotique, ce résultat questionne un présupposé répandu : que la génération vidéo pixel par pixel est nécessaire pour qu'un modèle de monde capture une dynamique physique exploitable. En montrant qu'un espace latent compact suffit à égaler des générateurs vidéo lourds, tout en gagnant en robustesse zero-shot face à des environnements inédits et en démontrant un transfert réel sur robot physique, LeapBot-WA plaide pour des architectures VLA plus légères et déployables, un enjeu concret pour les intégrateurs cherchant à réduire la latence d'inférence en production plutôt qu'en démonstration.

Le travail s'inscrit dans la filiation du JEPA popularisé par les travaux de Yann LeCun sur l'apprentissage auto-supervisé non génératif, appliqué ici pour la première fois comme socle central d'un WAM plutôt que comme simple module auxiliaire. Il se positionne face aux générateurs vidéo dominants du secteur (type Pi-0, GR00T N2 ou Helix) qui misent sur la synthèse pixel. Les auteurs annoncent la publication du code mais ne mentionnent pas encore de partenariat industriel ni de calendrier de déploiement commercial.

À lire aussi

DreamWAM : au-delà de la prédiction RGB pour les modèles d'action du monde
1arXiv cs.RO 

DreamWAM : au-delà de la prédiction RGB pour les modèles d'action du monde

Des chercheurs du laboratoire HUST-VL publient DreamWAM, un modèle monde-action (World Action Model) pour l'apprentissage de politiques robotiques, détaillé dans un article arXiv (2608.04996v1) avec code et modèles publiés sur GitHub. Contrairement à la plupart des WAM, qui prédisent le futur de la scène uniquement en RGB et mélangent ainsi les changements pertinents pour la tâche avec du bruit de texture, d'éclairage ou de point de vue, DreamWAM représente l'état futur sous plusieurs formes complémentaires (apparence, mouvement, géométrie, sémantique). Le modèle combine un débruitage latent conjoint RGB et mouvement avec des branches résiduelles légères pour la géométrie et la sémantique, entraînées via une attention partagée entre les modules VideoDiT et ActionDiT ; ces branches supplémentaires sont désactivées à l'inférence, qui reste purement RGB. Sur le benchmark LIBERO, le taux de réussite passe de 97,30% à 98,40% en inférence sans rollout et de 98,00% à 98,90% en inférence conjointe vidéo-action. Sous les perturbations inédites de LIBERO-Plus, les gains grimpent nettement, de 51,36% à 63,44% et de 69,16% à 75,47%. En manipulation robotique réelle, avec des changements non vus d'éclairage, de fond et de disposition des objets, DreamWAM atteint 74,4% de réussite moyenne, contre 55,6% pour la référence Fast-WAM-Joint. Ce travail pointe un problème bien connu des modèles vision-langage-action: des gains mesurés sur bancs d'essai standards qui s'effondrent dès que l'environnement change légèrement, cet écart entre démonstration et réalité freinant le déploiement industriel des bras manipulateurs et robots humanoïdes. En montrant que des gains modestes en conditions contrôlées, de l'ordre d'un point de pourcentage, se transforment en écarts de dix à vingt points sous perturbation, DreamWAM suggère que la robustesse d'une politique ne dépend pas seulement de la qualité de la prédiction du futur, mais de la forme sous laquelle ce futur est représenté pendant l'entraînement. Pour les équipes de R&D robotique, l'intérêt pratique est que cette supervision multi-vues n'ajoute aucun coût au déploiement puisque les branches concernées sont coupées à l'inférence: la robustesse s'acquiert à l'entraînement, sans alourdir le système embarqué. Ce travail s'inscrit dans une recherche qui cherche à dépasser l'imitation pure en dotant les politiques robotiques d'un modèle du monde capable d'anticiper les conséquences d'une action avant son exécution. DreamWAM se positionne explicitement face à Fast-WAM-Joint, utilisé comme référence RGB pure dans les comparaisons de l'article. Contrairement à une annonce produit ou une démonstration de plateforme humanoïde, il s'agit d'une publication académique évaluée en simulation (LIBERO, LIBERO-Plus) et sur un nombre limité de tâches de manipulation réelle, sans déploiement industriel ni calendrier commercial annoncé. Code et modèles étant publiés en accès libre, la suite logique sera de voir si d'autres équipes reproduisent ces gains de robustesse sur des politiques VLA plus larges ou des tâches de manipulation plus complexes que celles testées ici.

RechercheOpinion
1 source
LARA : alignement des représentations d'actions latentes pour les modèles vision-langage-action
2arXiv cs.RO 

LARA : alignement des représentations d'actions latentes pour les modèles vision-langage-action

Une équipe de recherche propose LARA (Latent Action Representation Alignment), un framework qui entraîne conjointement deux composants jusqu'ici séparés dans les modèles vision-langage-action (VLA) : le modèle d'action latente (LAM), qui apprend des représentations d'actions à partir de vidéos non annotées, et le modèle VLA lui-même. Jusqu'à présent, ces deux briques étaient optimisées indépendamment, ce qui limitait leurs bénéfices mutuels : le LAM restait déconnecté du contexte robotique réel, et le VLA était contraint par des représentations figées, sans possibilité d'ajustement. LARA aligne les deux via un mécanisme de représentation partagée, permettant au LAM d'apprendre à partir de trajectoires d'actions réelles pour éviter de capter de simples changements visuels sans pertinence (comme un déplacement de caméra), tandis que le VLA est régularisé par la dynamique prédictive du LAM pour réduire les hallucinations de trajectoires inefficaces. Les auteurs rapportent des gains moyens d'environ 10% en pré-entraînement, 5% en amélioration post-entraînement de modèles VLA déjà entraînés, et 15% en affinage du LAM seul, mesurés sur trois benchmarks de manipulation en simulation et un benchmark réel conçu spécifiquement pour l'évaluation. L'enjeu pour le secteur est la dépendance chronique des VLA à des jeux de données robotiques réels, coûteux et rares à grande échelle. Exploiter des vidéos humaines non étiquetées comme source de supervision, sans perdre en fiabilité, est une piste suivie par plusieurs laboratoires travaillant sur des modèles comme GR00T N2 ou Pi-0. Ce que suggère LARA, c'est que le goulot d'étranglement n'est pas seulement la quantité de données vidéo disponibles, mais la façon dont les représentations d'action apprises restent ou non ancrées dans la réalité physique du robot pendant l'entraînement conjoint. L'approche s'inscrit dans la lignée des travaux sur les Latent Action Models, qui cherchent depuis plusieurs années à combler l'écart entre l'abondance de vidéos web et la rareté des démonstrations robotiques annotées. Contrairement à une annonce produit, il s'agit ici d'un travail académique (version 2 d'un article déposé sur arXiv), sans déploiement industriel annoncé ni calendrier de commercialisation ; sa portée dépendra de sa reproductibilité et de son adoption par les équipes développant des VLA en conditions réelles.

RecherchePaper
1 source
JEPA-WAM : prédiction d'embeddings conjoints par étapes pour les modèles monde-action en manipulation robotique
3arXiv cs.RO 

JEPA-WAM : prédiction d'embeddings conjoints par étapes pour les modèles monde-action en manipulation robotique

Des chercheurs présentent JEPA-WAM (arXiv:2608.10780), qui ajoute a un World-Action Model fonde sur Motus un module Stage-JEPA, un prédicteur Joint-Embedding Predictive Architecture conditionne par objectif. L'architecture distingue un futur physique court terme, capturant l'évolution locale de la scene pour l'exécution du geste, d'un futur sémantique au niveau de l'étape, qui représente la progression de la tache d'une phase a la suivante. Stage-JEPA s'appuie sur un encodeur V-JEPA2 gelé pour extraire l'état courant a partir de l'observation et de l'instruction, puis prédit la cible latente de l'étape suivante inférée. Sur 50 taches du benchmark de simulation RoboTwin 2.0, en environnements propres et randomises, le système atteint 90,25 % de réussite globale et réduit de 5,97 % le nombre moyen d'étapes d'exécution dans les épisodes réussis par rapport a la meilleure base de comparaison testée. Ce travail cible une limite connue des politiques vision-langage-action généralistes : la plupart représentent le futur comme un court segment vidéo-action fixe, ce qui capture la dynamique locale mais ignore la progression d'une tache a plusieurs étapes. En séparant prédiction court terme et planification sémantique par étape, JEPA-WAM propose une piste pour réduire l'écart entre réactivité immédiate et raisonnement a plus long horizon, un enjeu partage par des architectures comme Pi-0, GR00T N2 ou Helix qui visent la généralisation entre taches. Le gain de 5,97 % en nombre d'étapes suggère une meilleure efficacité d'exécution sans perte de taux de réussite, un signal utile pour des intégrateurs cherchant a raccourcir les cycles, même si ces résultats restent obtenus en simulation et non en déploiement réel. L'approche s'inscrit dans la lignée des architectures Joint-Embedding Predictive popularisées par V-JEPA et V-JEPA2, des modèles du monde auto-supervises entraines sur vidéo et repris ici comme encodeur gelé plutôt que reentraine. Le choix d'un WAM fonde sur Motus situe la contribution dans la famille grandissante des modèles combinant prédiction du monde et génération d'action, en concurrence avec les approches VLA de Physical Intelligence (Pi-0), Nvidia (GR00T N2) ou Figure (Helix) ; aucun acteur européen n'apparait dans cette publication. L'article, publie sur arXiv sous la référence 2608.10780, ne fixe aucun calendrier de transfert vers des robots physiques ni de partenariat industriel, l'étape suivante habituelle pour ce type de recherche étant la validation hors simulation avant toute intégration commerciale.

RecherchePaper
1 source
SANTS : un planificateur adaptatif à l'état pour les modèles d'action du monde
4arXiv cs.RO 

SANTS : un planificateur adaptatif à l'état pour les modèles d'action du monde

Des chercheurs proposent SANTS (State-Adaptive Noise Trajectory Scheduler), un scheduler léger pour les politiques de diffusion vidéo-vers-action dans les World Action Models (WAMs). Soumis sur arXiv (2605.27947) le 28 mai 2026, le travail part d'un constat empirique : dans les WAMs pixel-space, débruiter complètement la vidéo future n'optimise pas toujours la qualité de l'action produite. Au-delà d'un seuil dépendant de l'état du robot, le raffinement supplémentaire sature ou dégrade la performance. SANTS lit la représentation vidéo-état courante et le niveau de bruit, prédit un point d'arrêt adaptatif, et est entraîné par post-training avec une récompense sur la qualité finale de l'action (et non sur la fidélité de la vidéo intermédiaire). Résultats annoncés : 94,4 % de succès sur RoboTwin 2.0, 73,1 % sur sept tâches réelles, avec une réduction de latence de 81,7 % et 79,0 % respectivement par rapport au débruitage complet. L'enjeu opérationnel est la fréquence de contrôle : les WAMs souffrent d'une latence d'inférence élevée qui limite leur déploiement dans des boucles de contrôle rapides. Diviser par cinq ce coût d'inférence sans perte majeure de performance valide l'idée que la représentation future n'a pas besoin d'être parfaitement rendue pour conditionner efficacement l'action, une hypothèse implicite des architectures WAM qui n'était pas encore démontrée à cette échelle. Cela dit, le papier reste un preprint non relu par les pairs, et sept tâches réelles constituent un set de validation étroit pour prétendre à une généralisation industrielle. Les WAMs ont émergé comme alternative aux politiques VLA classiques en intégrant une prédiction vidéo du futur pour guider la génération d'actions. SANTS se positionne comme une surcouche d'optimisation compatible avec les designs existants, sans modifier la branche action du modèle de base. Dans l'écosystème actuel, Physical Intelligence (pi0), NVIDIA (GR00T N2) et Figure (Figure 03) développent des politiques de diffusion pour la manipulation, où la réduction de la latence d'inférence devient un facteur de compétitivité commerciale. Les prochaines étapes naturelles seraient une validation sur des benchmarks plus larges comme DROID ou Open X-Embodiment, et la mise à disposition publique des poids et du code.

RechercheOpinion
1 source