Aller au contenu principal
SANTS : un planificateur adaptatif à l'état pour les modèles d'action du monde
RecherchearXiv cs.RO 

SANTS : un planificateur adaptatif à l'état pour les modèles d'action du monde

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent SANTS (State-Adaptive Noise Trajectory Scheduler), un scheduler léger pour les politiques de diffusion vidéo-vers-action dans les World Action Models (WAMs). Soumis sur arXiv (2605.27947) le 28 mai 2026, le travail part d'un constat empirique : dans les WAMs pixel-space, débruiter complètement la vidéo future n'optimise pas toujours la qualité de l'action produite. Au-delà d'un seuil dépendant de l'état du robot, le raffinement supplémentaire sature ou dégrade la performance. SANTS lit la représentation vidéo-état courante et le niveau de bruit, prédit un point d'arrêt adaptatif, et est entraîné par post-training avec une récompense sur la qualité finale de l'action (et non sur la fidélité de la vidéo intermédiaire). Résultats annoncés : 94,4 % de succès sur RoboTwin 2.0, 73,1 % sur sept tâches réelles, avec une réduction de latence de 81,7 % et 79,0 % respectivement par rapport au débruitage complet.

L'enjeu opérationnel est la fréquence de contrôle : les WAMs souffrent d'une latence d'inférence élevée qui limite leur déploiement dans des boucles de contrôle rapides. Diviser par cinq ce coût d'inférence sans perte majeure de performance valide l'idée que la représentation future n'a pas besoin d'être parfaitement rendue pour conditionner efficacement l'action, une hypothèse implicite des architectures WAM qui n'était pas encore démontrée à cette échelle. Cela dit, le papier reste un preprint non relu par les pairs, et sept tâches réelles constituent un set de validation étroit pour prétendre à une généralisation industrielle.

Les WAMs ont émergé comme alternative aux politiques VLA classiques en intégrant une prédiction vidéo du futur pour guider la génération d'actions. SANTS se positionne comme une surcouche d'optimisation compatible avec les designs existants, sans modifier la branche action du modèle de base. Dans l'écosystème actuel, Physical Intelligence (pi0), NVIDIA (GR00T N2) et Figure (Figure 03) développent des politiques de diffusion pour la manipulation, où la réduction de la latence d'inférence devient un facteur de compétitivité commerciale. Les prochaines étapes naturelles seraient une validation sur des benchmarks plus larges comme DROID ou Open X-Embodiment, et la mise à disposition publique des poids et du code.

À lire aussi

Modèle du monde à action conditionnée : un planificateur d'action généralisable pour la prise de décision
1arXiv cs.RO 

Modèle du monde à action conditionnée : un planificateur d'action généralisable pour la prise de décision

Des chercheurs présentent World Action Planner (WAP), un système de planification robotique combinant un modèle vision-langage (VLM) et un modèle du monde conditionné par les poses et les images, capable de gérer plusieurs tâches. Décrit dans un article arXiv publié fin juillet 2026 (arXiv:2607.27599), le système fonctionne en deux temps : le VLM propose un plan d'action initial à partir d'une consigne, puis ce plan est raffiné de manière itérative par optimisation et recherche, en simulant des trajectoires possibles ("rollouts") dans le modèle du monde avant de les exécuter réellement. Selon les auteurs, WAP surpasse significativement les modèles de bout en bout de référence, à la fois les architectures vision-langage-action (VLA) et les modèles du monde purs (WAM), sur des tâches compositionnelles, des agencements de scène inédits et des scénarios de généralisation zéro-shot. Le projet est documenté sur worldactionplanner.github.io, sans précision sur le matériel robotique utilisé ni sur un calendrier de déploiement. L'enjeu dépasse la performance brute : c'est la capacité de généralisation qui est visée, un point faible connu des politiques par apprentissage par imitation, qui excellent dans leur environnement d'entraînement mais échouent souvent face à une scène ou une tâche nouvelle. En couplant raisonnement symbolique du VLM et vérification physique via simulation interne, WAP s'attaque directement à l'écart entre démonstration contrôlée et robustesse réelle, un sujet central pour les intégrateurs qui cherchent des robots capables de sortir du script préprogrammé. À ce stade, il s'agit toutefois d'un résultat de recherche évalué en simulation ou en environnement contrôlé, pas d'un produit commercial ni d'un déploiement industriel. Ce travail s'inscrit dans la course actuelle autour des modèles VLA (à l'image de Pi-0 ou GR00T N2) et des modèles du monde pour la robotique, deux approches concurrentes pour doter les robots humanoïdes et bras manipulateurs d'une autonomie généralisable. En proposant une architecture hybride qui combine planification par recherche et prédiction du monde plutôt qu'une politique end-to-end unique, les auteurs positionnent WAP comme une alternative aux approches purement VLA, dont les limites de généralisation restent un point de friction reconnu dans le secteur.

RecherchePaper
1 source
PAPO-VLA : une optimisation de politique adaptée à la planification pour les modèles vision-langage-action
2arXiv cs.RO 

PAPO-VLA : une optimisation de politique adaptée à la planification pour les modèles vision-langage-action

Des chercheurs ont publié en mai 2026 sur arXiv (2605.19580) PAPO-VLA, une méthode d'optimisation pour les modèles Vision-Language-Action (VLA) appliqués à la manipulation robotique guidée par le langage naturel. L'observation centrale est qu'une politique VLA opère en boucle fermée : chaque action modifie l'état de la scène et conditionne toutes les décisions suivantes, ce qui rend une erreur de planification particulièrement coûteuse. Les auteurs distinguent donc deux rôles dans une politique VLA : le planificateur, qui prend des décisions orientées tâche susceptibles de rediriger l'exécution, et l'exécuteur, qui les traduit en actions continues denses. PAPO-VLA identifie les "actions de planification" en croisant variation d'action et issue de trajectoire, estime leur importance causale via deux critères formels (suffisance et nécessité causales), puis intègre ces poids dans l'estimation d'avantage du GRPO (Group Relative Policy Optimization), de sorte que les moments critiques reçoivent une emphase d'optimisation plus forte sans abandonner le signal de trajectoire globale. Des améliorations sont rapportées sur plusieurs benchmarks de manipulation robotique, sans chiffres précis disponibles dans le résumé public. L'apport clé est de combler un angle mort des approches existantes : l'imitation de trajectoires et l'optimisation par retour de trajectoire entière traitent toutes les actions avec la même importance, alors que certains instants de décision ont un impact causal disproportionné sur le succès de la tâche. Quantifier cet impact via des métriques causales formelles plutôt qu'heuristiques est une avancée méthodologique notable. Pour les équipes déployant des VLA en environnement réel, sur des plateformes comme pi-0 (Physical Intelligence), OpenVLA (Berkeley) ou GR00T N2 (NVIDIA), la méthode promet d'améliorer la fiabilité sans données de démonstration supplémentaires. Depuis RT-2 (Google DeepMind, 2023), le secteur des VLA cherche à combler l'écart entre performance en démonstration contrôlée et robustesse en déploiement réel. Le GRPO, popularisé par DeepSeek-R1 pour le raisonnement en LLM, est ici adapté à la robotique via une pondération causale des actions, dans un axe de recherche croissant autour du renforcement causal appliqué aux robots. PAPO-VLA est un preprint non encore revu par les pairs ; la validation expérimentale complète, avec benchmarks précis et comparaisons contrôlées, reste à confirmer via publication.

RechercheOpinion
1 source
Adaptation planificateur : apprentissage adaptatif des paramètres par modèle vision-langage-action
3arXiv cs.RO 

Adaptation planificateur : apprentissage adaptatif des paramètres par modèle vision-langage-action

Article sur l'apprentissage adaptatif de paramètres de planification pour la navigation robotique. Des chercheurs ont présenté APPLV (Adaptive Planner Parameter Learning from Vision-Language-Action Model), une méthode qui utilise un modèle vision-langage pré-entraîné doté d'une tête de régression pour prédire les paramètres de configuration de planificateurs classiques de navigation, plutôt que de générer directement des actions comme le font les modèles VLA traditionnels. Deux stratégies d'entraînement ont été développées : un apprentissage supervisé à partir de trajectoires de navigation collectées, puis un affinage par apprentissage par renforcement pour optimiser davantage les performances. L'équipe a évalué APPLV sur plusieurs planificateurs de mouvement via le jeu de données simulé BARN (Benchmark Autonomous Robot Navigation), ainsi que lors d'expériences sur robot physique. Les résultats montrent qu'APPLV surpasse les méthodes existantes à la fois en performance de navigation et en capacité de généralisation à des environnements non vus durant l'entraînement. Cette avancée s'attaque à un problème concret pour les intégrateurs de robotique mobile : la navigation dans des espaces fortement contraints. Les approches classiques de navigation, bien que sûres, nécessitent un réglage manuel et fastidieux des paramètres pour chaque nouvel environnement, tandis que l'apprentissage de bout en bout contourne ce réglage mais échoue souvent sur le contrôle précis requis en espace confiné. APPLV se positionne dans une troisième voie déjà explorée par des travaux récents en robot learning, qui automatisent le réglage des paramètres tout en conservant les garanties de sécurité des systèmes classiques, mais qui peinaient jusqu'ici à généraliser à des environnements inédits. En s'appuyant sur les capacités de compréhension de scène des modèles fondation, APPLV cherche aussi à répondre aux limites connues des VLA appliqués à la navigation : latence d'inférence et manque de précision dans le contrôle, deux obstacles qui freinent leur déploiement industriel réel. Le travail s'inscrit dans la lignée des recherches sur les modèles Vision-Language-Action (VLA) appliqués à la robotique mobile, un domaine où la promesse de généralisation via les modèles fondation se heurte régulièrement à la réalité du contrôle bas niveau. En choisissant de faire prédire des paramètres de planificateur plutôt que des actions brutes, les auteurs combinent l'interprétabilité et la sécurité des planificateurs classiques avec la capacité d'adaptation contextuelle des modèles vision-langage. Le papier, une version révisée (v2) déposée sur arXiv, ne précise pas d'acteur industriel ni de calendrier de déploiement commercial ; il s'agit à ce stade d'une contribution de recherche académique, dont la portée pratique dépendra de futurs travaux de validation sur des flottes robotiques réelles et de comparaisons plus larges avec d'autres architectures de navigation apprise.

RechercheOpinion
1 source
ACID : cohérence des actions par dynamique inverse pour la planification avec des modèles du monde
4arXiv cs.RO 

ACID : cohérence des actions par dynamique inverse pour la planification avec des modèles du monde

ACID (Action Consistency via Inverse Dynamics), présenté dans un article arXiv publié début juillet 2026 (arXiv:2607.02403v1), s'attaque à un défaut connu de la planification par modèles du monde conditionnés par l'action, une méthode largement utilisée en contrôle robotique. Le problème identifié par les auteurs : le coût de planification standard ne juge une trajectoire candidate qu'à l'aune de la proximité entre l'état terminal prédit et l'objectif, sans vérifier si les transitions intermédiaires sont réalisables. Résultat, une trajectoire peut sembler cohérente sur le papier tout en divergeant fortement une fois exécutée dans l'environnement réel. ACID introduit un principe de "cohérence d'action cyclique" : à chaque étape, un modèle de dynamique inverse tente de retrouver, à partir de la transition prédite, l'action qui l'a produite ; l'écart entre cette action reconstruite et l'action réelle est intégré au coût de planification via une pondération adaptative invariante à l'échelle. Les auteurs valident la méthode sur quatre modèles du monde différents et six tâches couvrant la manipulation d'objets rigides et déformables, le contrôle de systèmes articulés et la navigation visuelle, avec un gain systématique en qualité de planification. L'apport principal n'est pas seulement la précision, mais l'efficacité : ACID atteint une exactitude comparable aux méthodes de référence tout en réduisant substantiellement le budget de calcul nécessaire à la planification. C'est un point sensible pour l'embarqué robotique, où le temps de cycle et la puissance de calcul disponible contraignent directement le déploiement temps réel. Le papier touche aussi à un débat plus large dans le secteur : la fiabilité des modèles du monde utilisés pour anticiper les conséquences d'une action avant de l'exécuter, un maillon critique face aux erreurs qui s'accumulent le long d'une trajectoire prédite. Cette approche s'inscrit dans la lignée des travaux sur la planification par modèle prédictif (MPC) couplée à des dynamiques apprises, une alternative aux architectures vision-langage-action de bout en bout comme Pi-0, GR00T N2 ou Helix, qui n'exposent pas de mécanisme de vérification explicite des trajectoires intermédiaires. Publié en preprint, ACID n'a pas encore fait l'objet d'une revue par les pairs ni d'une validation sur robot physique au-delà des bancs de test utilisés dans l'étude ; la suite logique serait une évaluation en conditions réelles et une comparaison directe avec les méthodes de planification par diffusion, autre piste active du domaine.

RecherchePaper
1 source