Aller au contenu principal
Harness VLA : orienter les VLA figés vers des primitives de manipulation fiables via des agents guidés par la mémoire
RecherchearXiv cs.RO 

Harness VLA : orienter les VLA figés vers des primitives de manipulation fiables via des agents guidés par la mémoire

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent Harness VLA, un framework agentique décrit dans un article publié le 10 juillet 2026 sur arXiv (2607.08448v1), qui vise à rendre les modèles Vision-Language-Action (VLA) plus fiables sans réentraînement. Le système transforme un VLA figé en une primitive de manipulation "contact-rich" réessayable, orchestrée par un agent doté de mémoire et couplée à une bibliothèque fixe de primitives analytiques couvrant le grounding, le staging, le transport, la navigation et le relâchement d'objet. Plutôt que d'élargir le répertoire de compétences du robot, le harness apprend la plage de fonctionnement de ces primitives à partir de traces d'exécution spécifiques à la tâche, de règles de succès globales et de modèles d'échec. Testé sur trois bancs d'essai simulés perturbés (manipulation de table, cuisine domestique, et manipulation bimanuelle avec transfert propre-vers-aléatoire), le système améliore les performances de 38,6 points de pourcentage sur LIBERO-Pro et de 25,4 points sur RoboCasa365 par rapport aux meilleures baselines existantes, et atteint 58,4% de réussite sur RoboTwin C2R.

Ce travail s'attaque à un problème central dans le déploiement des VLA end-to-end : entraînés sur des trajectoires en distribution, ces modèles s'effondrent souvent dès que le contexte de déploiement s'écarte du jeu d'entraînement, que ce soit par un changement sémantique de la tâche, un repositionnement spatial des objets ou une instabilité de contact locale. Les agents LLM apportent un raisonnement compositionnel complémentaire, mais échouent typiquement sur les phases de préhension irrégulière, de placement contraint ou d'interaction avec des objets articulés, précisément là où les VLA excellent. En confiant au planificateur le re-ancrage sémantique et l'exécution non contactuelle, et en réservant le VLA figé aux phases de contact fin, Harness VLA prolonge la distribution effective des compétences d'un modèle pré-entraîné sans le retoucher. Pour les intégrateurs et les équipes de recherche en robotique, l'intérêt est double : cela réduit le coût de réentraînement à chaque nouvel environnement et adresse directement l'écart entre démonstrations contrôlées et robustesse en conditions perturbées, un point sensible depuis que la plupart des annonces commerciales de robots humanoïdes s'appuient sur des vidéos filtrées.

Le papier s'inscrit dans la lignée des travaux récents combinant modèles VLA (Pi-0, GR00T N2, Helix, ou les architectures propriétaires de Figure et Tesla Optimus) avec des couches de planification symbolique, une tendance qui s'accélère à mesure que les limites du end-to-end pur en dehors du laboratoire deviennent visibles. Contrairement à des approches qui étendent le répertoire de compétences via de nouvelles données ou du finetuning, Harness VLA mise sur l'orchestration et la mémoire d'exécution pour exploiter au mieux un modèle existant, une direction qui pourrait intéresser les acteurs cherchant à déployer des VLA génériques sur du matériel varié sans long cycle de réentraînement. Les résultats restent pour l'instant limités à des bancs d'essai simulés (LIBERO-Pro, RoboCasa365, RoboTwin C2R) ; aucun déploiement sur robot physique n'est mentionné dans l'abstract, ce qui invite à la prudence avant d'extrapoler ces gains à des conditions réelles d'usine ou de foyer.

À lire aussi

Explorateurs, communicatifs et déployables : des agents incarnés guidés par la vision pour la manipulation mobile en monde ouvert
1arXiv cs.RO 

Explorateurs, communicatifs et déployables : des agents incarnés guidés par la vision pour la manipulation mobile en monde ouvert

Des chercheurs du laboratoire InternRobotics ont publié REAL, un framework agentique pour la manipulation mobile en environnement ouvert, accompagné du benchmark REAL-Bench couvrant 241 tâches réparties entre exploration active, distraction visuelle, manipulation d'objets articulés et désambiguïsation interactive de l'intention utilisateur. Le système combine des API d'environnement cohérentes entre simulation et réel, sans recourir à une perception oracle, et un simulateur d'utilisateur permettant une boucle homme-machine pour clarifier des instructions incomplètes. L'agent, entraîné via un pipeline hiérarchique associant apprentissage supervisé et renforcement en ligne, atteint un taux de réussite de 56,9% sur les tâches interactives, devançant des VLM commerciaux à code fermé sur ce même exercice. Déployé sur un robot mobile à double bras physique, il obtient 78,3% de réussite de bout en bout sur 60 épisodes réels, avec un transfert zero-shot vers des scénarios domestiques inédits. Le code est disponible sur github.com/InternRobotics/REAL. Ce résultat s'attaque directement à l'un des points faibles reconnus des agents robotiques actuels: la plupart des démonstrations s'appuient sur des instructions complètes fournies à l'avance ou sur des états privilégiés du simulateur, ce qui masque les difficultés réelles du déploiement, comme comprendre une consigne ambiguë ou explorer un environnement inconnu pour localiser un objet. En surpassant des modèles vision-langage-action commerciaux sur les tâches interactives, REAL apporte une preuve empirique que l'écart entre simulation et réalité peut être réduit sans capteurs ou informations privilégiées, un enjeu central pour les intégrateurs qui cherchent à déployer des robots domestiques ou logistiques capables de gérer des instructions humaines imparfaites plutôt que des scripts rigides. Le projet s'inscrit dans la lignée des travaux sur les agents vision-langage-action (VLA) tels que Pi-0 ou GR00T N2, mais se distingue en intégrant explicitement la dimension conversationnelle et exploratoire plutôt que la seule exécution de tâches préformulées. Les auteurs positionnent leur contribution face aux VLM propriétaires fermés, sans toutefois nommer précisément les modèles concurrents testés. Les prochaines étapes évoquées portent sur l'extension du benchmark et l'amélioration du raisonnement à vocabulaire ouvert sur des horizons d'exploration encore plus longs, avant d'envisager des déploiements pilotes à plus grande échelle.

RechercheActu
1 source
Mémoire spatiale pour la manipulation hors champ de vision dans les modèles VLA
2arXiv cs.RO 

Mémoire spatiale pour la manipulation hors champ de vision dans les modèles VLA

Une équipe de chercheurs a publié en mai 2026 (arXiv:2605.22283) SOMA, un framework de mémoire spatiale conçu pour résoudre un angle mort structurel des modèles Vision-Language-Action (VLA) : leur incapacité à manipuler des objets hors du champ visuel. Le système s'appuie sur une caméra de tête mobile pour acquérir des observations multi-vues, qu'il agrège en une représentation spatiale et sémantique persistante. SOMA repose sur trois modules : une construction de mémoire spatiale par balayage angulaire, un raffinement dynamique pour maintenir la cohérence globale au fil du temps, et une récupération contextuelle qui active les indices spatiaux pertinents à l'instruction en cours d'exécution. Les chercheurs l'ont évalué sur cinq tâches réelles de manipulation hors champ, incluant des scénarios multi-étapes et à deux bras où les objets cibles sont initialement invisibles. Les résultats montrent une amélioration du taux de succès, une localisation plus rapide des cibles, moins de recherche de point de vue, et un comportement proche du "one-shot grasping" en conditions d'observabilité partielle. Des expériences complémentaires sur les benchmarks RoboCasa GR1 et SimplerEnv confirment l'efficacité du design mémoire en contexte pleinement observable. Ce travail s'attaque à un verrou souvent ignoré dans la littérature VLA : l'hypothèse implicite que tous les objets pertinents sont dans le champ de vision au moment de l'action. Cette hypothèse rend les systèmes actuels fragiles dès qu'on sort des configurations de démonstration. Le fait que SOMA induise des comportements qualitativement différents, et non de simples gains de score, est notable : une localisation en quasi-une-passe sous observabilité partielle est un résultat concret pour tout intégrateur robotique travaillant en environnement non structuré. Cela suggère que la mémoire spatiale persistante peut s'ajouter comme couche modulaire à un VLA existant, sans refonte complète de l'architecture, ce qui abaisse le seuil d'adoption. Les VLAs ont émergé comme approche dominante en robotique de manipulation depuis fin 2023, portés par Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA, et OpenVLA issu de Stanford et Berkeley. Ces modèles héritent de l'architecture vision-langage mais restent fondamentalement réactifs : ils traitent un flux visuel instantané sans mémoire de scène. Des travaux parallèles sur la mémoire épisodique existent en navigation mobile (méthodes SLAM-like, NeRF tactique), mais leur intégration dans des pipelines VLA de manipulation reste peu explorée. SOMA comble ce gap sur une plateforme à bras réel. Le code n'est pas encore disponible au moment de la publication, ce qui limite la reproductibilité immédiate ; son déploiement sur d'autres plateformes humanoïdes, au-delà de GR1, constituera l'étape de validation industrielle clé.

RechercheOpinion
1 source
Robot binoculaire non préhensile : apprentissage de primitives de manipulation par catégorie
3arXiv cs.RO 

Robot binoculaire non préhensile : apprentissage de primitives de manipulation par catégorie

BiNoMaP présente un nouveau cadre pour l'apprentissage de primitives de manipulation bimanuelle non préhensile, c'est-à-dire des gestes robotiques qui ne saisissent pas l'objet mais le manipulent par contact, comme pousser, faire pivoter, envelopper ou pousser du bout des doigts. Contrairement à la plupart des travaux antérieurs limités à un seul bras ou dépendants de supports environnementaux favorables (murs, rebords), les chercheurs proposent une configuration bimanuelle générique. Leur méthode se distingue aussi par son approche sans apprentissage par renforcement (RL-free), articulée en trois étapes: extraction de trajectoires de mouvement des mains à partir de vidéos de démonstration en vue égocentrique, puis raffinement de ces trajectoires brutes via un algorithme d'optimisation géométrique pour corriger le bruit de perception et les écarts morphologiques entre humain et robot, et enfin paramétrage des primitives selon des attributs géométriques de l'objet, principalement sa taille, pour permettre une généralisation à des instances inédites. Les primitives ont été testées sur deux plateformes robotiques bimanuelles réelles aux configurations cinématiques distinctes, démontrant un transfert cross-embodiment sans redesign de la structure des compétences. L'intérêt pour l'industrie robotique tient à l'angle mort que ce travail comble: la manipulation non préhensile reste largement sous-exploitée car son caractère riche en contacts la rend difficile à modéliser analytiquement, alors que de nombreuses tâches industrielles ou domestiques (repositionner un objet encombrant, l'orienter, le pousser dans un bac) ne se prêtent pas à une simple préhension. En s'appuyant sur des démonstrations vidéo plutôt que sur du RL coûteux en simulation, l'approche répond aussi à un problème récurrent du secteur, le fossé entre simulation et réalité (sim-to-real gap), en apprenant directement des trajectoires exécutables. Pour les intégrateurs et décideurs B2B travaillant sur des bras bimanuels ou des plateformes humanoïdes à deux bras, cela suggère une voie pour doter les robots de compétences de manipulation plus polyvalentes sans multiplier les cycles d'entraînement par RL ni redessiner les primitives à chaque changement de robot. Ce travail s'inscrit dans la lignée des recherches en apprentissage par imitation à partir de vidéos humaines, un axe de plus en plus exploré face aux limites du RL pur pour les tâches de contact complexes, aux côtés d'approches VLA comme GR00T N2 ou Pi-0 qui visent la généralisation à l'échelle. La publication, une version révisée d'un article initialement déposé sur arXiv (2509.21256), a été validée par des expériences robot réel sur "divers objets et configurations spatiales", sans toutefois préciser de partenaire industriel ou de calendrier de déploiement commercial. Aucun acteur français ou européen n'est mentionné dans cette publication, qui reste à ce stade un travail de recherche académique plutôt qu'un produit prêt à déployer.

RecherchePaper
1 source
μVLA : mémoire récurrente pour la manipulation partiellement observable dans les modèles VLA
4arXiv cs.RO 

μVLA : mémoire récurrente pour la manipulation partiellement observable dans les modèles VLA

Des chercheurs ont publié sur arXiv (arXiv:2606.12497) une étude d'isolation contrôlée baptisée muVLA, une famille de variantes du modèle OpenVLA-OFT augmentées de récurrence minimale. Le principe : injecter un petit ensemble de tokens mémoire apprenables dans le transformer, transportés d'un pas de temps au suivant et mis à jour par auto-attention, sans loss auxiliaire ni modification architecturale. L'entraînement se fait de bout en bout avec rétropropagation tronquée dans le temps (TBPTT), paramétrée par la largeur mémoire m et la longueur de troncature K, avec deux règles de mise à jour comparées -- gradients inter-pas ou EMA détachée. Sur le benchmark MIKASA-Robo, muVLA porte le taux de succès moyen sur cinq tâches d'entraînement de 0,42 à 0,84 dans la configuration la plus forte, et atteint 0,23 sur des tâches hors distribution contre 0,07 pour la baseline sans mémoire. Sur LIBERO, environnement à observabilité complète, la variante récurrente la plus forte atteint 96,2 % de succès moyen -- sans régression par rapport au modèle de base. Ce travail apporte une contribution méthodologique précise à un champ encombré d'ablations mal contrôlées. La quasi-totalité des VLA à mémoire existants couplent récurrence, retrieval, compression et objectifs hiérarchiques dans un seul système, rendant impossible d'attribuer les gains à un mécanisme isolé. muVLA démontre que la récurrence seule -- sans aucune machinerie additionnelle -- suffit à doubler le taux de succès sur des tâches à observabilité partielle, c'est-à-dire les situations où une partie de l'état pertinent a disparu du champ de vision. Pour les intégrateurs robotiques travaillant sur des cellules avec occlusions ou des séquences d'assemblage multi-étapes, c'est un signal clair : le goulot n'est pas la puissance brute du modèle de base, mais la capacité à maintenir un état latent persistant. Le résultat sur LIBERO indique également que l'ajout de mémoire ne dégrade pas les performances en pleine observabilité, ce qui lève un frein souvent cité à l'adoption de ces architectures en production. OpenVLA est un modèle open-source lancé fin 2024 par une collaboration Stanford/Berkeley/Toyota Research Institute, positionné comme alternative ouverte aux VLA propriétaires comme RT-2 (Google DeepMind) ou pi0 (Physical Intelligence). OpenVLA-OFT en est une variante fine-tunée pour l'exécution rapide. La question de la mémoire dans les VLA est activement travaillée par plusieurs équipes -- RoboVLMs, SpatialVLA, Helix (Figure AI) -- mais avec des architectures nettement plus lourdes. muVLA se distingue par sa minimalité revendiquée et son protocole d'isolation rigoureux, ce qui en fait un outil de calibration plus qu'un système prêt au déploiement. Les auteurs délimitent explicitement le "régime de suffisance" de la récurrence minimale : elle fonctionne pour les tâches où la structure mémoire requise est homogène entre entraînement et évaluation, et atteint ses limites dès que les tâches hors distribution exigent une structure mémorielle différente. Les prochaines étapes naturelles -- combinaison avec des mécanismes de retrieval ou de compression -- sont implicitement balisées par ces résultats.

RechercheOpinion
1 source