Aller au contenu principal
2D ou 3D : qui gouverne la saillance dans les modèles VLA ? Un cadre d'élagage de tokens en trois étapes avec conscience de la saillance modale
RecherchearXiv cs.RO 

2D ou 3D : qui gouverne la saillance dans les modèles VLA ? Un cadre d'élagage de tokens en trois étapes avec conscience de la saillance modale

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont publié sur arXiv (référence 2604.09244, version 2, avril 2026) un article proposant un cadre d'élagage de tokens en trois étapes pour accélérer les modèles VLA (Vision-Language-Action) multi-modaux. Le constat de départ : les VLA de dernière génération ne se contentent plus d'entrées 2D classiques (images RGB) mais intègrent également des données 3D (nuages de points, profondeur), formant ce que les auteurs appellent des modèles MVLA (Multi-Visual-Modal VLA). Cette expansion modale améliore la perception spatiale des robots, mais elle multiplie le nombre de tokens traités à l'inférence, créant un goulot d'étranglement computationnel significatif. Le framework proposé introduit une analyse en trois phases qui capture les différences de saillance entre tokens 2D et 3D à chaque étape du traitement, puis applique un élagage ciblé selon ces différences. Les expériences rapportent un gain d'accélération allant jusqu'à 2,55x à l'inférence, avec une perte de précision minimale et un surcoût de traitement limité à 5,8%.

Ce résultat est pertinent pour les équipes qui cherchent à déployer des VLA sur du matériel embarqué ou des robots opérant en temps réel. L'un des freins majeurs à la commercialisation des robots manipulateurs pilotés par VLA est précisément le coût computationnel de l'inférence : un gain de 2,55x sans dégradation significative des performances ouvre la voie à des cycles de décision plus courts sans nécessiter de GPU de datacenter. Il met aussi en lumière un angle mort des approches d'optimisation existantes : les méthodes d'élagage de tokens conçues pour des VLA 2D ne tiennent pas compte du fait que les tokens 3D et 2D n'ont pas la même importance selon le contexte et l'étape de traitement. Ignorer cette hétérogénéité conduit à des élagages sous-optimaux.

Les modèles VLA sont devenus le paradigme dominant en robotique incarnée depuis Pi-0 (Physical Intelligence, 2024) et GR00T N2 (NVIDIA, 2025), qui ont tous deux popularisé l'architecture action-transformer multi-modal. La tendance à intégrer la modalité 3D s'est accélérée avec l'essor des capteurs LiDAR et RGB-D dans les environnements industriels. Ce travail s'inscrit dans une série d'efforts d'optimisation de l'inférence VLA, aux côtés de travaux comme FastV ou des approches de distillation, mais avec la spécificité de traiter explicitement la multi-modalité visuelle. Le code source n'est pas encore publié, ce qui limite pour l'instant la reproductibilité et l'adoption pratique ; les prochaines étapes annoncées concernent sa mise à disposition publique.

À lire aussi

Évolution continue des compétences dans un modèle vision-langage-action (VLA)
1arXiv cs.RO 

Évolution continue des compétences dans un modèle vision-langage-action (VLA)

Des chercheurs ont publié Stellar VLA (arXiv:2511.18085v3), un cadre d'apprentissage continu par imitation (continual imitation learning, CIL) pour les modèles Vision-Langage-Action (VLA). La méthode propose deux variantes progressives : T-Stellar, fondée sur une modélisation plate centrée sur les tâches, et TS-Stellar, organisée en structure hiérarchique tâche-compétence. Les expériences menées sur le benchmark LIBERO, référence standard pour les tâches de manipulation robotique, montrent que les deux variantes surpassent les baselines VLA et CIL actuelles, avec seulement 1 % de rejeu de données. Une validation en conditions réelles sur une plateforme bi-bras, avec des configurations de scènes et d'embodiments distincts, confirme que le transfert de connaissances entre tâches reste effectif au-delà du simulateur. Le principal apport de Stellar VLA est d'adresser un frein structurel au déploiement des grands modèles VLA : les méthodes CIL existantes nécessitent des paramètres additionnels ou des modules externes, ce qui les rend difficilement scalables lorsque le modèle de base est déjà massif. En optimisant conjointement des représentations de tâches et un espace de connaissances partagé, Stellar VLA introduit un mécanisme de routage expert guidé par la sémantique, sélectionnant les K embeddings les plus proches pour orienter le modèle vers la compétence pertinente, sans alourdir l'architecture. Pour les équipes qui déploient des robots polyvalents en production, cela ouvre la voie à l'apprentissage incrémental de nouvelles tâches avec un coût de fine-tuning réduit. TS-Stellar se distingue notamment sur les manipulations hiérarchiques complexes, et les visualisations publiées illustrent une rétention robuste des compétences acquises ainsi qu'une capacité de découverte automatique de nouvelles tâches. Les VLA constituent un axe de recherche en accélération depuis 2023, portés par Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA), OpenVLA (UC Berkeley) ou encore RT-2 (Google DeepMind), qui cherchent à généraliser la manipulation robotique via un préentraînement multimodal massif. La question du catastrophic forgetting, c'est-à-dire la perte des compétences antérieures lors de l'apprentissage d'une nouvelle tâche, reste un verrou non résolu à l'échelle industrielle. Stellar VLA se positionne comme une surcouche légère applicable à des VLA existants, sans retraining complet. Le projet est documenté sur stellarvla.github.io ; aucun partenariat industriel ni calendrier de déploiement n'est mentionné dans la publication, qui reste à ce stade un travail de recherche académique.

RechercheOpinion
1 source
VLA-Arena : un cadre open source pour évaluer les modèles vision-langage-action (VLA)
2arXiv cs.RO 

VLA-Arena : un cadre open source pour évaluer les modèles vision-langage-action (VLA)

Une équipe de chercheurs a publié VLA-Arena, un framework open-source de benchmark conçu pour évaluer les modèles Vision-Language-Action (VLA), ces politiques robotiques généralisées capables d'interpréter commandes en langage naturel et observations visuelles pour générer des actions motrices. La version 2 du preprint (arXiv 2512.22539v2) présente un protocole structuré autour de 170 tâches, organisées selon quatre dimensions orthogonales : sécurité (Safety), gestion des distracteurs (Distractor), extrapolation hors-distribution (Extrapolation) et planification longue portée (Long Horizon). Chaque tâche existe en trois niveaux de difficulté (L0 à L2), le fine-tuning étant exclusivement réalisé sur L0 afin de tester la capacité de généralisation. En parallèle, des perturbations linguistiques (W0-W4) et visuelles (V0-V4) s'appliquent indépendamment à chaque tâche, permettant une analyse découplée de la robustesse. Les auteurs publient également les datasets VLA-Arena-S/M/L ainsi qu'un leaderboard public. Les résultats de l'évaluation des VLA de l'état de l'art sont sévères et contre-intuitifs pour ceux qui suivent les démonstrations marketing du secteur. Les modèles testés exhibent une forte tendance à la mémorisation plutôt qu'à la généralisation réelle : leurs performances s'effondrent dès que la tâche sort légèrement de la distribution d'entraînement. La robustesse est asymétrique selon l'axe perturbé (visuel vs. linguistique), les contraintes de sécurité sont quasi-ignorées, et la composition de compétences pour les tâches longue portée reste hors de portée de tous les modèles testés. Pour les intégrateurs industriels et les équipes R&D qui envisagent de déployer des VLA en production, ces résultats constituent un signal d'alerte : le "sim-to-real gap" n'est pas résolu, et les capacités affichées en démo ne tiennent pas face à des conditions réelles variables. VLA-Arena arrive dans un contexte de prolifération rapide des VLA généralistes : Physical Intelligence (Pi-0), NVIDIA (GR00T N2), Google DeepMind (RT-2, Gemini Robotics) et OpenVLA font tous état de progrès importants, mais sur des benchmarks hétérogènes et souvent propriétaires, rendant toute comparaison directe impossible. L'absence d'un protocole d'évaluation standardisé est depuis longtemps identifiée comme le principal obstacle à la progression scientifique rigoureuse du domaine. VLA-Arena n'est pas encore un standard industriel adopté, mais sa publication en open-source avec toolchain complet (définition de tâche, évaluation automatisée, datasets) le positionne comme candidat sérieux. Les prochaines étapes dépendront de l'adoption par les équipes qui développent ces modèles, et d'une éventuelle intégration dans les pipelines de validation avant déploiement réel en atelier.

RechercheOpinion
1 source
Ancrage des affordances par tokens avec de grands modèles vision-langage
3arXiv cs.RO 

Ancrage des affordances par tokens avec de grands modèles vision-langage

Le papier arXiv 2607.03595, publié cette semaine, présente TokAG, une méthode "zero-shot" de localisation d'affordances dans les images, c'est-à-dire l'identification des zones précises qui permettent une action donnée sur un objet (attraper une poignée, s'asseoir sur une chaise, etc.). Contrairement aux approches précédentes qui s'appuyaient sur un apprentissage faiblement supervisé à partir d'étiquettes d'action sur des images à la première personne extérieure (exocentriques), TokAG n'utilise aucune annotation externe. La méthode exploite les cartes d'attention associées aux différents tokens générés par un grand modèle vision-langage (LVLM) : les auteurs montrent que ces cartes varient fortement selon le token choisi, certains pointant vers l'arrière-plan plutôt que vers l'objet ciblé. Un mécanisme de sélection spatiale identifie automatiquement le token dont l'attention se concentre le mieux sur l'objet pertinent, et cette carte est ensuite convertie en carte de chaleur d'affordance. Sur les benchmarks de référence, TokAG améliore le score NSS de 10,7% sur le split "invisible" d'AGD20K et de 29,7% sur HICO-IIF par rapport aux meilleures méthodes faiblement supervisées existantes. L'enjeu dépasse la seule métrique académique : la localisation d'affordances est une brique centrale pour la perception incarnée et l'intelligence physique, notamment en robotique de manipulation, où un système doit repérer où et comment saisir un objet sans supervision spécifique à chaque action. Le problème que ciblent les auteurs est concret : les méthodes précédentes confondaient des actions sémantiquement proches car elles s'appuyaient sur de courtes étiquettes textuelles pauvres en détails, et échouaient sur des images ambiguës où plusieurs actions cohabitent. Montrer qu'un LVLM déjà entraîné encode implicitement assez de signal spatial pour s'en passer va dans le sens d'une tendance plus large : réutiliser les modèles vision-langage-action existants plutôt que ré-entraîner des détecteurs dédiés à chaque tâche. Le travail s'inscrit dans la lignée des recherches sur l'extraction de signaux spatiaux depuis des modèles figés, sans fine-tuning supplémentaire. Les auteurs annoncent la publication future du code et des modèles, ce qui reste à vérifier puisque rien n'est encore disponible au moment de la parution du preprint ; les gains restent donc validés uniquement sur benchmarks internes (AGD20K, HICO-IIF), pas encore testés en conditions réelles de manipulation robotique.

RecherchePaper
1 source
Adaptation de modalité en test, un cadre causal d'inférence-diagnostic-raffinement pour les modèles VLA
4arXiv cs.RO 

Adaptation de modalité en test, un cadre causal d'inférence-diagnostic-raffinement pour les modèles VLA

Une équipe de chercheurs publie sur arXiv un nouveau cadre baptisé infer-diagnose-refine (IDR), conçu pour améliorer les modèles vision-langage-action (VLA) qui pilotent des bras ou des robots humanoïdes à partir d'instructions en langage naturel, d'images et de l'état proprioceptif du robot. Le problème ciblé: dans une tâche de manipulation, l'importance de la vision varie selon la phase, un déplacement longue distance dépendant surtout de la caméra tandis qu'une prise fine dépend davantage du retour proprioceptif, et les VLA actuels fusionnent ces modalités de façon statique. IDR corrige cela au moment du test, sans réentraînement: le modèle infère d'abord une action factuelle avec l'image réelle, puis une action contrefactuelle en neutralisant l'image via une intervention de type "zero-padding", avant qu'un module ne quantifie l'écart entre les deux par une mesure de norme pour estimer l'importance causale de la vision à cet instant précis, puis qu'une fusion résiduelle à gate ajustable ne recombine les deux prédictions. Les auteurs rapportent des gains de performance sur plusieurs benchmarks de simulation et sur des tâches réelles, avec plusieurs architectures VLA testées comme backbones. Pour l'industrie robotique, l'intérêt tient au fait que ce travail s'attaque à une limite bien identifiée mais rarement corrigée des VLA: leur incapacité à pondérer dynamiquement les modalités selon le contexte, ce qui pèse sur la robustesse en conditions réelles (occlusions, éclairage variable, phases de contact). Le caractère "model-agnostic" et "training-free" est ce qui retient le plus l'attention des intégrateurs: si la méthode tient ses promesses hors cadre académique, elle pourrait s'appliquer en post-traitement à des VLA déjà déployés, sans le coût d'un réentraînement complet, rare parmi les correctifs proposés dans la littérature. Il s'agit toutefois d'une publication de recherche évaluée sur des benchmarks propres aux auteurs, pas d'un produit ni d'un déploiement industriel, et le gain réel dépendra d'une reproduction indépendante sur des tâches de manipulation hors laboratoire. Ce travail s'inscrit dans une vague de recherche plus large autour des VLA, catégorie qui regroupe aujourd'hui des systèmes comme RT-2, OpenVLA, pi-0 de Physical Intelligence ou GR00T de Nvidia, tous confrontés au même arbitrage entre richesse perceptuelle et robustesse d'exécution. Chercher des gains de fiabilité au moment de l'inférence, plutôt que via un réentraînement massif, reflète une tendance récente à vouloir corriger à moindre coût des modèles déjà volumineux. Les auteurs ne précisent ni calendrier d'intégration industrielle ni partenariat avec un fabricant de robots; la suite logique serait une validation sur des plateformes commerciales et une comparaison directe avec les méthodes de fusion de modalités déjà employées par les principaux acteurs du secteur.

RechercheActu
1 source