Aller au contenu principal
Worldscape-MoE : un modèle du monde à mélange d'experts unifié pour un contrôle d'action hétérogène et évolutif
IA physiquearXiv cs.RO 

Worldscape-MoE : un modèle du monde à mélange d'experts unifié pour un contrôle d'action hétérogène et évolutif

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche publie sur arXiv (7 juillet 2026) Worldscape-MoE, un modèle du monde basé sur des Diffusion Transformers combinés à une architecture Mixture-of-Experts (MoE), conçu pour unifier le contrôle d'actions hétérogènes dans les simulateurs génératifs vidéo. Jusqu'ici, les modèles du monde utilisés pour l'IA incarnée traitaient séparément chaque type de commande, trajectoires de caméra, actions robotiques, signaux de jointures de main, avec des interfaces isolées les unes des autres. Worldscape-MoE introduit à la place une injection de contrôle sensible à la modalité, des experts partagés et des experts spécifiques à chaque type de commande, ainsi qu'une stratégie d'entraînement MoE progressive permettant d'ajouter de nouvelles modalités d'action sans tout réentraîner. Les tests couvrent trois domaines, locomotion, manipulation robotique et contrôle égocentrique de la main, avec des résultats évalués sur le benchmark WorldArena.

L'apport principal tient dans un résultat contre-intuitif pour le secteur: faire apprendre au même modèle des signaux de contrôle très différents (déplacement d'un robot, geste d'une main, trajectoire de caméra) améliore les performances sur chaque tâche individuelle, plutôt que de les dégrader par interférence. Cela infirme l'hypothèse répandue selon laquelle mélanger les types de supervision dilue la qualité du contrôle. Pour les équipes qui développent des simulateurs destinés à entraîner des politiques robotiques ou des agents VLA (vision-language-action), ce résultat plaide pour des architectures mutualisées plutôt que des modèles du monde spécialisés par tâche, un enjeu direct de coût et de scalabilité pour l'industrie.

Le travail s'inscrit dans la montée en puissance des modèles du monde comme infrastructure de base pour l'IA incarnée, à mesure que la fragmentation des interfaces de contrôle devient un frein au passage à l'échelle. Worldscape-MoE se positionne comme une alternative structurelle aux générateurs vidéo contrôlables existants, avec une architecture pensée pour absorber, au fil du temps, nouvelles modalités et nouveaux jeux de données sans repartir de zéro, un axe que les auteurs annoncent vouloir poursuivre avec l'ajout d'experts et de données supplémentaires.

À lire aussi

SelfWAM : un modèle unifié d'action et du monde auto-fondé pour le contrôle rapide de robots
1arXiv cs.RO 

SelfWAM : un modèle unifié d'action et du monde auto-fondé pour le contrôle rapide de robots

Une nouvelle publication arXiv (2608.00725v1) présente SelfWAM, un modèle unifié de type "World Action Model" (WAM) conçu pour le contrôle rapide de robots manipulateurs. Contrairement aux WAM classiques qui prédisent les observations futures uniquement à partir du prompt de tâche et du contexte visuel, ce qui les pousse à capturer une progression générique de la tâche plutôt que les conséquences précises de l'action exécutée, SelfWAM s'appuie sur une architecture Mixture-of-Transformers (MoT) spécialisée par modalité. Elle prédit simultanément trois éléments: l'action à exécuter, les images RGB futures conditionnées par cette action, et des masques de silhouette du robot lui-même. Pendant l'entraînement conjoint, le modèle laisse la branche vidéo attendre une copie "propre" de l'action démontrée, ce qui transforme cette branche en modèle des conséquences spécifiques à chaque action, sans ralentir le chemin d'inférence rapide dédié uniquement à l'action. Les auteurs ajoutent des objectifs spécifiques au prompt pour la prédiction des masques du robot, une supervision qui retire les détails d'apparence et concentre l'apprentissage sur les changements visuels directement liés au mouvement du bras. Les tests sur le benchmark RoboTwin 2.0 et sur des tâches de manipulation en conditions réelles montrent des prédictions plus sensibles à l'action et une amélioration des performances de la politique de contrôle, sans dégrader la vitesse d'inférence. Pour le secteur, ce travail s'attaque à un problème connu des modèles vision-langage-action (VLA): la difficulté à faire coïncider prédiction visuelle et effet réel de l'action, un écart qui limite souvent le transfert entre simulation et monde réel. En couplant explicitement la prédiction future à une action "propre" et à la silhouette du robot, SelfWAM cherche à combler ce fossé sans sacrifier la latence, un compromis central pour tout déploiement industriel où le temps de cycle compte. Il s'agit ici d'une publication de recherche déposée sur arXiv, sans produit commercial ni déploiement annoncé: SelfWAM s'inscrit dans la lignée des World Action Models qui gagnent du terrain comme alternative aux politiques purement réactives, en misant sur une modélisation conjointe action-observation pour améliorer la généralisation des robots manipulateurs.

IA physiqueActu
1 source
Tau-zéro WM : un modèle du monde vidéo-action unifié pour la manipulation robotique
2arXiv cs.RO 

Tau-zéro WM : un modèle du monde vidéo-action unifié pour la manipulation robotique

Des chercheurs ont déposé le 1er juin 2026 sur arXiv (réf. 2606.01027) τ₀-WM (tau-zéro World Model), une architecture unifiée vidéo-action pour la manipulation robotique. Le modèle repose sur un backbone de diffusion vidéo partagé qui intègre simultanément apprentissage de politique, prédiction vidéo et évaluation d'actions au sein d'un même cadre prédictif. Il expose deux interfaces complémentaires : un modèle d'action vidéo qui prédit conjointement des représentations visuelles latentes futures et des séquences d'actions continues à partir d'observations multi-caméras, d'instructions en langage naturel et de l'état courant du robot ; et un simulateur vidéo conditionné sur l'action, capable de dérouler des séquences candidates en projections multi-vues tout en attribuant des scores denses de progression de tâche. L'entraînement porte sur environ 27 300 heures de données combinant téléopération réelle, interactions de style UMI (Universal Manipulation Interface, protocole de collecte de données en bimanuel développé par Stanford), vidéos égocentrées humaines, et trajectoires de succès comme d'échecs. L'intérêt principal réside dans la convergence entre politique et modèle de monde au sein d'une architecture commune. Les VLA (Vision-Language-Action models) actuels génèrent des actions sans anticiper leurs conséquences, laissant la gestion des erreurs à des modules séparés. τ₀-WM introduit un mécanisme de rectification à l'inférence : le simulateur évalue chaque séquence candidate via un score dense de progression, et les candidats jugés insuffisants sont corrigés par re-débruitage. Ce test-time scaling structuré pourrait réduire les interventions humaines sur des tâches longue durée, un enjeu clé pour les intégrateurs industriels qui peinent encore à déployer des robots autonomes sur des séquences de plus de quelques étapes. Sur les benchmarks de manipulation fine et longue séquence, les auteurs déclarent surpasser les baselines comparables, sans préciser les conditions expérimentales ni les contraintes matérielles testées. Ce travail s'inscrit dans une course engagée depuis fin 2024 entre Physical Intelligence (pi-0), NVIDIA (GR00T N2) et Figure (Helix) pour des architectures VLA à grande échelle, mais rares sont celles qui intègrent simulation interne et évaluation d'action dans un seul modèle plutôt que dans un pipeline découplé. L'usage de données UMI signale une stratégie d'agrégation multi-source qui dépasse les corpus propriétaires et pourrait favoriser la généralisation à de nouveaux environnements. Le papier reste pour l'instant un preprint non soumis à revue par les pairs : les performances annoncées restent à valider sur robot physique en conditions réelles, et aucune date de déploiement ou partenariat industriel n'est mentionné.

IA physiqueOpinion
1 source
Diffusion à double flux pour un modèle vision-langage-action augmenté par modèle du monde
3arXiv cs.RO 

Diffusion à double flux pour un modèle vision-langage-action augmenté par modèle du monde

Une équipe de chercheurs propose DUST (DUal-STream diffusion), un framework qui augmente les modèles vision-langage-action (VLA) avec un world model pour améliorer l'apprentissage de politiques robotiques. L'architecture repose sur un transformer de diffusion multimodal qui maintient des flux séparés pour chaque modalité (vision et action) tout en permettant un partage de connaissances inter-modal. Techniquement, DUST introduit des perturbations de bruit indépendantes, une perte flow matching découplée pour apprendre les relations causales entre modalités, et une méthode d'échantillonnage asynchrone des tokens action et vision. Sur les benchmarks simulés RoboCasa et GR-1, DUST affiche des gains allant jusqu'à 6 % par rapport aux meilleures références VLA et world-modeling actuelles, avec une amélioration supplémentaire de 2 à 5 % via le scaling à l'inférence. Sur tâches réelles avec le bras Franka Research 3, le système surpasse les baselines de 10 % en taux de succès. Le point critique ici est la gestion du "modality gap" : prédire simultanément des états visuels futurs et des séquences d'actions est un problème ouvert, car les deux modalités ont des structures temporelles et sémantiques très différentes. DUST contourne ce problème en maintenant des flux distincts plutôt qu'en les fusionnant naïvement, ce qui préserve les propriétés propres à chaque modalité. Le gain de 10 % en conditions réelles est notable, mais reste à interpréter avec prudence : les expériences portent sur un seul robot (Franka Research 3) et les tâches réelles ne sont pas détaillées dans l'abstract, ce qui limite la généralisation. La capacité de transfer learning à partir de vidéos sans annotations d'actions ouvre en revanche une voie concrète pour réduire le coût de collecte de données. DUST s'inscrit dans une vague de travaux qui cherchent à doter les VLA d'une forme de "prévoyance" via des world models, en écho à des approches comme GR-1 (Humanoid VLA de Shanghai AI Lab) ou Pi-0 de Physical Intelligence. La tendance lourde est de combiner la puissance des LLM pour le raisonnement avec des modèles prédictifs du monde physique, pour réduire le sim-to-real gap et permettre une généralisation hors distribution. La prochaine étape logique serait de tester DUST sur des morphologies robotiques hétérogènes et des tâches de manipulation longue durée, ce que le joint-training avec des datasets humains et robots suggère comme direction.

IA physiqueOpinion
1 source
CAC-VLA : un conditionnement d'action contrôlé par le contexte pour les modèles vision-langage-action
4arXiv cs.RO 

CAC-VLA : un conditionnement d'action contrôlé par le contexte pour les modèles vision-langage-action

Des chercheurs proposent CAC-VLA (Context-Gated Action Conditioning), une nouvelle architecture pour les modèles vision-langage-action (VLA), la famille de systèmes qui pilote de plus en plus de bras et robots humanoïdes generalistes. Le problème identifié: dans les VLA classiques, les représentations visuelles et langagières ne sont pas pensées pour guider directement le contrôle moteur, ce qui laisse à «l'expert action» (le module qui génère la trajectoire) la charge de combler cet écart. Des méthodes récentes tentent de corriger cela avec des modules de raisonnement d'action séparés, mais elles nécessitent des architectures dédiées supplémentaires. CAC-VLA prend une autre voie: il entraîne le modèle vision-langage lui-même à prédire des actions latentes, des représentations compactes encodées à partir de segments d'action futurs, du grossier au fin, puis utilise une «porte de contexte» pour doser en temps réel l'influence de ce signal sur l'expert d'action. Sur les bancs d'essai LIBERO et LIBERO-Plus, la méthode atteint respectivement 98,3% et 89,5% de taux de réussite moyen. Pour l'industrie robotique, l'enjeu dépasse le simple gain de quelques points de benchmark. Le goulot d'étranglement entre compréhension multimodale et motricité précise est l'un des obstacles centraux à la généralisation des VLA au-delà de tâches scriptées, un sujet suivi de près par les équipes qui travaillent sur des systèmes comme π0, GR00T N2 ou Helix. Une interface qui intègre le raisonnement d'action directement dans le VLM, sans framework de génération séparé, simplifierait l'entraînement et le déploiement de ces piles logicielles chez les intégrateurs, réduisant la complexité d'ingénierie souvent invoquée comme frein à la mise en production. Ces résultats restent toutefois obtenus en simulation, sur des suites de tâches standardisées et non sur du matériel réel en usine ou en entrepôt, une nuance importante alors que le secteur multiplie les annonces de percées en manipulation générale. LIBERO et sa variante LIBERO-Plus servent de référence commune pour comparer les approches d'action-conditioning, et la prochaine étape logique pour valider l'intérêt de CAC-VLA sera sa transposition sur des robots physiques et des tâches de manipulation en conditions réelles.

IA physiqueActu
1 source