Aller au contenu principal
ManiSoft : vers la manipulation vision-langage pour la robotique souple à continuum
RecherchearXiv cs.RO 

ManiSoft : vers la manipulation vision-langage pour la robotique souple à continuum

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs du laboratoire CoLa de l'université BUAA (Beijing University of Aeronautics and Astronautics) ont publié ManiSoft, un benchmark conçu pour évaluer la manipulation vision-langage sur des bras robotiques souples à continuum. Le jeu de données comprend 6 300 scènes générées automatiquement avec leurs trajectoires expertes correspondantes, réparties en quatre tâches progressives allant de la coordination basique de l'effecteur terminal jusqu'à l'évitement d'obstacles dans des environnements encombrés. Le simulateur développé pour l'occasion couple une dynamique de corps déformables réaliste avec des interactions riches en contact, grâce à une contrainte de force élastique. Le pipeline de génération de trajectoires fonctionne en deux étages : un planificateur de haut niveau décompose chaque tâche en séquences de waypoints, puis une politique d'apprentissage par renforcement de bas niveau génère les commandes de couple pour suivre ces waypoints.

ManiSoft s'attaque à un angle mort réel de la recherche en manipulation robotique : la quasi-totalité des travaux sur les modèles vision-langage (VLA) cible des bras rigides à morphologie fixe, qui montrent leurs limites dans les espaces confinés ou encombrés. Les bras souples offrent une déformabilité naturellement adaptée à ces contextes, mais ils posent deux problèmes fondamentaux que le benchmark met en évidence : la proprioception peu fiable (le robot ne sait pas précisément où se trouve son propre corps) et l'actuation distribuée à bas niveau, incompatible avec les abstractions classiques des VLA. Les trois architectures de politiques évaluées obtiennent des résultats corrects en scènes propres, mais accusent une chute de performance significative dès que la randomisation des scènes augmente, ce qui souligne que le sim-to-real gap reste ouvert pour cette catégorie de robots.

La robotique souple à continuum reste un domaine de recherche académique, loin des déploiements industriels à grande échelle qu'occupent les bras rigides de Fanuc, KUKA ou Universal Robots. Du côté des acteurs émergents, des startups comme Festo (avec ses bionics) ou des laboratoires européens explorent ces morphologies pour des applications chirurgicales et d'inspection en milieux contraints. ManiSoft ne vise pas pour l'instant à combler directement ce fossé industriel, mais à fournir une base d'évaluation reproductible pour comparer les approches. Le code et les données sont disponibles publiquement, ce qui devrait faciliter l'adoption par la communauté académique. Les prochaines étapes logiques seraient un transfert sim-to-real sur hardware physique et l'intégration de retour haptique pour corriger les dérives proprioceptives identifiées.

Dans nos dossiers

À lire aussi

Vers une intelligence physique semblable à l'humain : apprentissage vision-langage-action continu pour la manipulation robotique
1arXiv cs.RO 

Vers une intelligence physique semblable à l'humain : apprentissage vision-langage-action continu pour la manipulation robotique

Des chercheurs proposent LifelongVLA, un nouveau framework d'apprentissage continu pour les modèles Vision-Language-Action (VLA) appliqués à la manipulation robotique, décrit dans un article publié sur arXiv (2607.14852). Le système s'attaque à un problème classique de l'apprentissage séquentiel chez les robots : le compromis plasticité-stabilité, c'est-à-dire la capacité d'apprendre une nouvelle tâche sans effacer les compétences acquises précédemment. Concrètement, LifelongVLA introduit un module de gating LoRA à double échelle temporelle, séparant l'adaptation en deux voies légères : un adaptateur court terme pour la plasticité (apprentissage rapide de nouvelles tâches) et un adaptateur long terme pour la consolidation stable des compétences déjà maîtrisées. Une passerelle "task-aware" arbitre entre les deux. Le framework ajoute aussi une stratégie de rejeu ("replay") stochastique et économe en mémoire cache, qui préserve des signaux de rétention équilibrés sans avoir à stocker les trajectoires complètes des tâches passées. Les auteurs rapportent des résultats supérieurs aux méthodes existantes sur un bras robotique xArm en conditions réelles, avec une expansion efficace des compétences et une meilleure rétention des comportements de manipulation déjà appris. Cette avancée cible un angle mort réel des modèles VLA actuels (type Pi-0, GR00T N2 ou Helix) : la plupart sont entraînés une fois puis figés, ou doivent être ré-entraînés intégralement pour intégrer une nouvelle tâche, ce qui est coûteux et impraticable pour un déploiement industriel évolutif. Si un robot déployé en usine ou en entrepôt doit apprendre continuellement de nouvelles manipulations sans tout ré-apprendre à chaque fois ni oublier les précédentes, une méthode d'adaptation légère et peu gourmande en mémoire comme celle-ci intéresse directement les intégrateurs et décideurs qui cherchent à réduire les coûts de ré-entraînement et les temps d'arrêt liés à la mise à jour des compétences robotiques. C'est un pas vers des flottes de robots capables de monter en compétences sur site plutôt que de dépendre d'un redéploiement complet du modèle depuis un data center. Le travail s'inscrit dans la lignée de la recherche en "continual learning" appliquée à la robotique, un domaine longtemps dominé par les architectures de vision classique avant l'essor des VLA génératifs à grande échelle. Contrairement aux approches de fine-tuning complet ou à certaines méthodes de rejeu qui nécessitent de stocker l'intégralité des trajectoires passées (coûteux en stockage et en calcul), LifelongVLA mise sur des adaptateurs LoRA légers, une technique déjà largement utilisée pour le fine-tuning efficace des grands modèles de langage, ici transposée au contrôle robotique. L'article ne mentionne pas de partenaire industriel ni de déploiement commercial ; il s'agit d'un travail de recherche académique testé sur un seul bras xArm, avec des perspectives de validation à plus grande échelle et sur des plateformes robotiques plus variées à confirmer.

RechercheActu
1 source
ThinkingVLA : raisonnement vision-langage entrelacé pour la manipulation robotique
2arXiv cs.RO 

ThinkingVLA : raisonnement vision-langage entrelacé pour la manipulation robotique

Une équipe de chercheurs a publié sur arXiv (réf. 2606.17937, juin 2026) ThinkingVLA, un modèle VLA (Vision-Language-Action) conçu pour la manipulation robotique sur des séquences longues. L'architecture, de type Mixture-of-Transformers, intercale raisonnement textuel et visuel dans un unique processus génératif. Un Chain-of-Thought "forward" identifie le sous-objectif suivant et prédit l'état visuel cible correspondant ; un CoT "inverse" prend ensuite cette image générée comme entrée et infère les commandes motrices nécessaires pour l'atteindre. L'action finale est générée conditionnée sur ce contexte de raisonnement complet. Sur des benchmarks en simulation et en conditions réelles, ThinkingVLA surpasse les baselines de l'état de l'art, avec les gains les plus marqués sur les tâches à horizon temporel long. La grande majorité des modèles VLA actuels, notamment Pi-0 de Physical Intelligence ou OpenVLA, projettent directement observations vers actions sans raisonnement explicite, ce qui les pénalise sur les séquences longues nécessitant planification spatiale et décomposition en sous-étapes. ThinkingVLA adresse ce "reasoning gap" en forçant le modèle à anticiper visuellement l'état du monde avant de dériver les commandes. Cette boucle d'inverse dynamics grounding visuel est, si elle se confirme à l'échelle sur des objets et environnements variés, une piste sérieuse pour réduire le fossé persistant entre démonstrations en laboratoire et robustesse opérationnelle hors domaine. Les modèles VLA ont connu une accélération nette depuis 2024 avec RT-2 de Google DeepMind, Pi-0 de Physical Intelligence (lancé fin 2024), GR00T N2 de NVIDIA et Helix de Figure AI. L'ajout de CoT textuel dans les VLA est une tendance consolidée, mais ThinkingVLA se distingue par un CoT visuel explicite, soit la génération d'une image intermédiaire comme étape de raisonnement, ce qui implique une architecture bimodale plus coûteuse à l'inférence. Le travail est soumis en pre-print sans revue par les pairs à ce stade, sans partenariat industriel annoncé. Les prochains défis identifiés par le domaine concernent la généralisation hors distribution et la réduction du coût d'inférence pour un déploiement embarqué en temps réel.

RechercheOpinion
1 source
MARVL : guidage multi-étapes pour la manipulation robotique via des modèles vision-langage
3arXiv cs.RO 

MARVL : guidage multi-étapes pour la manipulation robotique via des modèles vision-langage

Des chercheurs ont publié MARVL (Multi-Stage Guidance for Robotic Manipulation via Vision-Language Models, arXiv:2602.15872), une méthode visant à automatiser la conception de fonctions de récompense dense pour l'apprentissage par renforcement (RL) appliqué à la manipulation robotique. L'approche repose sur l'affinage (fine-tuning) d'un modèle de vision-langage (VLM) pour améliorer sa cohérence spatiale et sémantique, puis décompose chaque tâche en sous-tâches séquentielles. Un mécanisme dit de projection de direction de trajectoire (task direction projection) renforce la sensibilité du signal de récompense aux progrès réels de l'agent. Évalué sur le benchmark Meta-World, référence standard pour les tâches de manipulation à récompenses éparses, MARVL surpasse les méthodes VLM-reward existantes en efficacité d'échantillonnage et en robustesse. La contribution centrale de MARVL est de corriger trois défauts chroniques des approches naïves de récompense par VLM : le désalignement entre signal de récompense et avancement réel de la tâche, la faiblesse du grounding spatial, et la compréhension insuffisante de la sémantique d'une tâche robotique. Pour les équipes de recherche en RL robotique, l'enjeu est concret : la conception manuelle de fonctions de récompense dense est coûteuse, non scalable, et constitue un goulot d'étranglement majeur dans le déploiement de nouveaux comportements. Si la méthode confirme ses performances sur des benchmarks plus larges, elle représenterait un pas vers l'automatisation du cycle de reward design, réduisant la dépendance aux ingénieurs spécialisés et accélérant l'itération expérimentale. Les VLMs utilisés comme superviseurs pour le RL robotique constituent un axe de recherche actif depuis 2023, porté notamment par des travaux comme EUREKA (OpenAI/NVIDIA) ou VLP. MARVL se distingue par son affinage ciblé du VLM et sa décomposition multi-étapes, là où EUREKA s'appuie sur un LLM pour générer du code de récompense sans fine-tuning préalable. La validation se limite pour l'instant à Meta-World, un environnement entièrement simulé ; aucun résultat sur robot physique n'est rapporté dans cette version, ce qui laisse ouverte la question du sim-to-real gap. Les suites naturelles incluront une évaluation sur des plateformes matérielles et des benchmarks plus récents comme RLBench ou ManiSkill.

RechercheOpinion
1 source
Dual mémoire latente dans les modèles vision-langage-action pour la manipulation robotique
4arXiv cs.RO 

Dual mémoire latente dans les modèles vision-langage-action pour la manipulation robotique

Des chercheurs ont publié le 7 juillet 2026 sur arXiv (arXiv:2607.07608v1) un nouveau framework baptisé LaMem-VLA, conçu pour doter les modèles Vision-Language-Action (VLA) d'une mémoire native directement intégrée à leur espace latent de raisonnement. Aujourd'hui, la plupart des VLA prédisent une action à partir de la seule observation courante sous hypothèse markovienne, ce qui les rend peu efficaces sur les tâches longues et dépendantes du temps. LaMem-VLA repose sur quatre composants coordonnés: un "curator" qui organise l'expérience passée en deux coffres mémoire, court terme et long terme; un "seeker" qui interroge ces coffres via la cognition multimodale pour en extraire les preuves pertinentes au contexte; un "condenser" qui reconstruit ces preuves en tokens de mémoire latente compacts; et un "weaver" qui injecte ces tokens avec l'observation et l'instruction courantes dans une seule séquence d'embedding continue. Les auteurs rapportent une supériorité de leur approche sur les benchmarks SimplerEnv et LIBERO, deux références standard pour évaluer la manipulation robotique pilotée par VLA. L'enjeu dépasse la simple performance sur benchmark. Les VLA actuels, qu'ils s'appuient sur des architectures type Pi-0, GR00T N2 ou Helix, butent tous sur une mémoire de travail limitée à la fenêtre d'observation courante, ce qui les fragilise dès qu'une tâche exige de se souvenir d'une action antérieure, par exemple qu'un tiroir a déjà été ouvert. Les solutions existantes, élargir la fenêtre d'observation ou interroger une banque mémoire externe comme contexte auxiliaire, laissent cette mémoire hors de l'espace latent natif du modèle, limitant son intégration au raisonnement multimodal. En rendant la mémoire nativement latente, LaMem-VLA vise à réduire l'écart entre démonstrations courtes réussies en laboratoire et déploiements réels où les séquences de tâches s'étirent, un critère que surveillent de près les intégrateurs industriels évaluant la fiabilité des VLA au delà du simple "pick and place". Ce travail s'inscrit dans une vague de recherche sur la mémoire des VLA, alors que le secteur de la robotique humanoïde et généraliste, Physical Intelligence avec Pi-0, NVIDIA avec GR00T N2, Figure avec Helix, cherche à dépasser les tâches courtes démontrées en vidéo pour viser des chaînes d'actions plus longues et industriellement exploitables. Classé "Announce Type: new" sur arXiv et non encore relu par les pairs, le papier ne mentionne aucun déploiement matériel ni partenariat industriel: il s'agit pour l'instant d'une contribution académique validée uniquement en simulation. Les suites attendues, classiques pour ce type de travaux, seraient une validation sur robot physique et une comparaison directe avec les architectures mémoire déjà explorées par les grands laboratoires de robotique généraliste.

RechercheActu
1 source