Aller au contenu principal
MotionWAM : vers des modèles fondation action-monde pour la loco-manipulation humanoïde en temps réel
IA physiquearXiv cs.RO 

MotionWAM : vers des modèles fondation action-monde pour la loco-manipulation humanoïde en temps réel

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent MotionWAM (arXiv:2606.09215), un World Action Model (WAM) temps réel pour la loco-manipulation humanoïde, validé sur neuf tâches physiques avec un Unitree G1 piloté par une unique caméra égocentrique. Contrairement aux architectures dominantes qui séparent une politique pour les bras et un contrôleur pour la locomotion, le système prédit des tokens de mouvement corps-entier dans un espace d'action unifié couvrant locomotion, déplacements du torse, régulation de hauteur, interaction plantaire et manipulation des mains. Pour atteindre le temps réel, MotionWAM conditionne la politique sur les features intermédiaires de débruitage d'un modèle monde vidéo, évitant le débruitage itératif complet sur des latents haute dimension, goulot d'étranglement des WAMs antérieurs. Sur le hardware réel, le système dépasse de plus de 30 points les baselines Vision-Language-Action (VLA) entraînées sur les mêmes démonstrations et réalise des tâches d'interaction plantaire inatteignables par les politiques haut/bas-corps découplées.

Le paradigme hiérarchique haut/bas-corps, présent dans des systèmes comme GR00T N2 (NVIDIA) et de nombreuses architectures humanoïdes commerciales, contraint les jambes à un simple rôle d'équilibre déconnecté de la manipulation. MotionWAM démontre sur matériel réel que cette contrainte n'est pas une fatalité et valide que des modèles monde pré-entraînés sur vidéo peuvent réduire la dépendance aux démonstrations robotiques coûteuses. Les métriques restent à contextualiser: neuf tâches sur un seul embodiment, sans publication de temps de cycle ni de robustesse aux variations de scène, restent loin d'une validation industrielle.

Les WAMs appliqués à la robotique s'appuient sur des travaux antérieurs en manipulation tabletop (UniSim, Genie de Google DeepMind); MotionWAM étend ces techniques à la commande humanoïde corps-entier. Face aux approches VLA dominantes dans les publications de référence, notamment pi-0 (Physical Intelligence) et GR00T N2, cette architecture propose une alternative centrée sur la dynamique vidéo pré-entraînée. Les prochaines étapes naturelles concernent la validation multi-embodiment et des déploiements industriels semi-structurés, où la variabilité des environnements constituera le vrai test de maturité.

À lire aussi

FlowPilot : modélisation monde-action en temps réel pour la navigation agile de drones
1arXiv cs.RO 

FlowPilot : modélisation monde-action en temps réel pour la navigation agile de drones

Des chercheurs présentent FlowPilot, un modèle compact de navigation temps réel pour drones, fonctionnant entièrement à bord à partir d'un flux de profondeur. Contrairement aux pipelines classiques qui reconstruisent une carte locale avant d'optimiser une trajectoire, ou aux politiques bout-en-bout sans prédiction de scène, FlowPilot débruite conjointement les observations de profondeur futures et les trajectoires exécutables via du flow matching. L'architecture associe un mélange de transformeurs à double flux, où un expert vidéo et un expert action partagent l'attention pour s'informer mutuellement. Au déploiement, seul le flux d'action est actif : le système produit une trajectoire paramétrée en polynômes de Bernstein de degré 7, l'état courant fixant les points de contrôle initiaux et le réseau prédisant cinq points libres, garantissant une continuité C² avec vitesse, accélération et jerk en forme close. Le modèle est entraîné sur une pyramide de données à trois niveaux (simulation haut débit, simulation photoréaliste, données réelles embarquées). En simulation, il surpasse les méthodes d'apprentissage et d'optimisation concurrentes face à un encombrement croissant et des vitesses jusqu'à 8 m/s. Sur un quadricoptère physique, le pipeline perception-action complet tourne en moins de 18 ms sur un Jetson Orin NX, avec des vols jusqu'à 5,5 m/s en intérieur encombré et en forêt, sans assistance extérieure. Cette démonstration cible un point de friction connu de l'autonomie aérienne : l'écart entre performance en simulation et robustesse réelle en environnement encombré à haute vitesse. En fusionnant prédiction de scène et génération de trajectoire dans un seul modèle plutôt qu'en deux étages séparés, FlowPilot transpose à l'aérien une logique de "world-action model" jusqu'ici surtout explorée en manipulation robotique au sol. Le budget de calcul, 18 ms de bout en bout sur du matériel embarqué léger, intéresse directement les intégrateurs d'inspection industrielle ou de logistique par drone, où poids et consommation du calculateur restent contraignants. L'écart entre les 8 m/s simulés et les 5,5 m/s atteints en vol réel rappelle toutefois que la validation reste celle d'un seul papier académique, sans comparaison indépendante ni déploiement commercial. Ce travail s'inscrit dans la recherche sur la navigation de drones par apprentissage, où les approches oscillent entre cartographie-puis-optimisation et politiques bout-en-bout. Les modèles par flow matching, popularisés récemment en génération d'image et en robotique de manipulation à l'image des politiques VLA telles que Pi-0 ou GR00T N2, sont ici transposés à la navigation aérienne pour produire des trajectoires lisses et dynamiquement réalisables. Publié sur arXiv fin juillet 2026 en prépublication non relue par les pairs, l'article ne mentionne aucune affiliation industrielle ni calendrier commercial. Les suites attendues porteraient sur l'extension à des vitesses et environnements plus variés, et sur une comparaison indépendante face aux meilleures méthodes de navigation par optimisation déjà déployées sur drones commerciaux.

IA physiqueActu
1 source
RynnWorld-4D : des modèles du monde incarnés en 4D pour la manipulation robotique
2arXiv cs.RO 

RynnWorld-4D : des modèles du monde incarnés en 4D pour la manipulation robotique

Des chercheurs (l'article ne précise pas d'affiliation institutionnelle dans le résume) publient sur arXiv, le 7 juillet 2026, RynnWorld-4D, un modèle génératif de monde en 4D pour la manipulation robotique. Le système produit simultanément, a partir d'une seule image RGB-D et d'une instruction en langage naturel, des images RGB futures, des cartes de profondeur et des flux optiques, le tout dans un unique processus de diffusion. Son architecture a trois branches combine attention cross-modale et RoPE 3D image par image pour que l'apparence visuelle, la géométrie et le mouvement évoluent de manière cohérente. Pour l'entrainer, les auteurs ont constitue Rynn4DDataset 1.0, un jeu de données de plus de 254,4 millions d'images issues de vidéos de manipulation, a la fois humaines en vue égocentrique et robotiques, avec des pseudo-étiquettes de profondeur et de flux optique. Un module dérivé, RynnWorld-4D-Policy, exploite directement les représentations internes du modèle en un seul passage avant, sans les étapes couteuses de debruitage itératif, pour générer des actions robotiques en boucle fermée. L'intérêt de cette approche tient a l'hypothèse qu'elle teste: en combinant RGB, profondeur et flux optique plutôt qu'en travaillant sur de simples pixels 2D, la représentation obtenue se rapprocherait davantage des commandes bas niveau de l'effecteur, réduisant l'écart classique entre prédiction du monde et apprentissage de politique. Sur des taches réelles de manipulation bimanuelle dextérité, les auteurs rapportent des résultats a l'état de l'art, en particulier sur les taches exigeant précision spatiale et coordination temporelle, deux points ou les approches VLA généralistes butent souvent en conditions réelles. Il s'agit pour l'instant d'un travail de recherche publie en preprint, sans déploiement industriel ni produit commercialise. Il s'inscrit dans la lignée des modèles de monde appliques a la robotique, aux cotes d'approches comme GR00T N2 ou Pi-0, mais mise sur une fusion multimodale plus riche et un passage a l'échelle des données d'entrainement. Les prochaines étapes attendues concernent la généralisation a d'autres plateformes robotiques et la validation hors des benchmarks contrôles du laboratoire.

IA physiqueActu
1 source
DeMaVLA : un modèle fondation vision-langage-action (VLA) pour la manipulation de matériaux déformables
3arXiv cs.RO 

DeMaVLA : un modèle fondation vision-langage-action (VLA) pour la manipulation de matériaux déformables

Des chercheurs ont publié DeMaVLA, un modèle fondation de type Vision-Langage-Action (VLA) conçu pour la manipulation d'objets déformables, en particulier le pliage de vêtements. Annoncé en preprint arXiv (2605.31286, mai 2026), DeMaVLA couple un backbone VLM à un module appelé "action expert" qui génère des trajectoires continues par flow matching. Pour réduire les coûts d'entraînement et d'inférence, cet action expert est construit en élaguant une couche transformer sur deux du backbone, tout en préservant l'alignement entre les deux modules. Le modèle est d'abord pré-entraîné sur environ 5 000 heures de démonstrations bimanuals en conditions réelles, puis affiné via un pipeline DAgger (Data Aggregation) avec supervision humaine : des trajectoires correctives sont collectées à partir des échecs du robot sur plusieurs tâches de pliage, puis réinjectées en entraînement. Les résultats sont compétitifs sur le benchmark RoboTwin et solides sur un benchmark maison de pliage domestique. La plupart des systèmes VLA actuels entraînent des politiques séparées par catégorie d'objet (un réseau pour les t-shirts, un autre pour les pantalons), ce qui limite la généralisation et alourdit la maintenance. DeMaVLA propose une politique unifiée capable de traiter des vêtements de géométries, matières et états initiaux variés sans réentraînement par catégorie, ce qui est directement pertinent pour les intégrateurs en robotique domestique et logistique. Le recours au DAgger avec boucle humaine est aussi un signal industriel : les corrections issues des échecs du robot, structurées et réinjectées, améliorent concrètement la robustesse au-delà des seules démonstrations expertes. Cela valide l'hypothèse que les données correctives à grande échelle sont un levier clé pour réduire le sim-to-real gap sur des tâches à haute variabilité. La manipulation d'objets déformables reste l'un des problèmes ouverts les plus difficiles en robotique physique : contrairement aux objets rigides, un vêtement n'a pas d'état canonique stable, ce qui complique radicalement la planification et la perception. Plusieurs équipes travaillent sur ce terrain : Physical Intelligence avec Pi-0 (manipulation généraliste bimanuels), NVIDIA avec GR00T N2, et divers laboratoires académiques (Columbia, CMU) sur la manipulation textile. DeMaVLA se positionne sur le créneau des fondations multi-tâches déformables, en combinant pré-entraînement à grande échelle et fine-tuning correctif. Ce travail reste un preprint non encore évalué par les pairs, et les benchmarks maisons appellent à une validation indépendante. Les suites naturelles sont l'extension à d'autres objets déformables (câbles, sacs souples) et l'évaluation sur des plateformes robotiques commerciales en environnement non contrôlé.

IA physiqueOpinion
1 source
FAWAM : modèles d'action du monde sensibles aux forces pour la manipulation en boucle fermée à contacts multiples
4arXiv cs.RO 

FAWAM : modèles d'action du monde sensibles aux forces pour la manipulation en boucle fermée à contacts multiples

Une équipe de chercheurs a publié sur arXiv (référence 2606.08555) FAWAM, un modèle d'action robotique intégrant les signaux de force à trois niveaux distincts du pipeline de manipulation : la perception, la prédiction et l'exécution en boucle fermée. Concrètement, le système encode des signaux force/couple sur six axes (6-DoF wrench) pour moduler la génération d'actions, prédit conjointement les actions futures et les efforts en bout d'effecteur afin de modéliser explicitement l'évolution du contact, puis utilise cette trajectoire de wrench prédite comme référence d'exécution pour corriger les actions en temps réel via un module de correction résiduelle. Sur plusieurs tâches de manipulation nécessitant des contacts riches -- vissage, insertion, assemblage par contrainte -- FAWAM affiche un taux de succès moyen supérieur de 36,25 % aux baselines purement visuelles et de 21,25 % aux baselines force-aware existantes. Il s'agit d'un preprint, sans déploiement industriel annoncé à ce stade. L'apport technique est notable pour les intégrateurs et les équipes R&D en manipulation apprise : la plupart des politiques modernes type Diffusion Policy, ACT ou des VLA (Vision-Language-Action models) traitent la force comme une modalité d'observation annexe, sans lui donner de rôle prédictif dans la dynamique future du contact. FAWAM repositionne le signal force comme variable de première classe dans l'architecture du modèle, ce qui permet une correction online des actions sans nécessiter de replanification complète. C'est précisément ce découplage entre prédiction de wrench et correction résiduelle qui explique le gain de performance : le robot anticipe l'effort attendu avant de l'observer, et ajuste en conséquence dès qu'un écart apparaît. Pour un COO ou un directeur technique envisageant des cellules d'assemblage automatisées, cela représente une réduction significative du gap simulation-réalité sur les tâches à contact fort. La manipulation en contact riche reste l'un des derniers verrous majeurs de la robotique industrielle polyvalente, là où les approches vision-seule échouent dès que les tolérances sont serrées ou les surfaces glissantes. Des travaux récents comme Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) ou les politiques de manipulation de Google DeepMind intègrent parfois la proprioception mais rarement le couple d'axe complet en boucle de prédiction. FAWAM s'inscrit dans un courant émergent de world action models orientés contact, aux côtés de travaux comme RoboDex ou des approches de manipulation tactile de Berkeley et Carnegie Mellon. La prochaine étape logique serait une validation sur robot humanoïde ou sur bras industriel en environnement semi-structuré, ce que le preprint ne couvre pas encore.

IA physiqueOpinion
1 source