Aller au contenu principal
Pelican-VLA 0.5 : l'attention avant l'action améliore la généralisation
IA physiquearXiv cs.RO 

Pelican-VLA 0.5 : l'attention avant l'action améliore la généralisation

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Pelican-VLA 0.5, un nouveau modèle VLA (vision-langage-action) présenté dans un rapport arXiv publié début juillet, unifie dans une seule architecture la compréhension vision-langage, la génération de trames futures et la prédiction d'action. Sa caractéristique centrale : sans annotations d'objets, sans masques de segmentation, sans supervision explicite de l'attention ni fine-tuning spécifique à la tâche, le module d'action du modèle se concentre spontanément sur l'objet pertinent pour l'instruction et sur sa zone de contact. Ce comportement se maintient sur des scènes inédites et sur des embodiments robotiques jamais vus à l'entraînement, et il est nettement plus marqué que chez les autres modèles VLA open source testés en comparaison. Les auteurs attribuent cette capacité à un module qu'ils nomment Reasoning Slots, inséré entre les étages de perception et d'action.

Cette découverte touche un point sensible de l'industrie des VLA : jusqu'ici, obtenir qu'un modèle regarde le bon objet avant de le manipuler exigeait souvent une supervision lourde, annotations manuelles, masques de segmentation ou fine-tuning tâche par tâche, ce qui limite le passage à l'échelle et la généralisation à de nouveaux robots ou environnements. Si l'attention correcte émerge directement de l'architecture plutôt que de données d'entraînement coûteuses, cela réduit la dépendance à l'ingénierie de données et s'attaque directement à l'écart persistant entre démonstrations en laboratoire et déploiement réel, un sujet central pour les intégrateurs qui évaluent des piles VLA comme Pi-0, GR00T N2 ou Helix.

Techniquement, les Reasoning Slots agissent comme un goulot d'étranglement compact qui force l'information visuelle pertinente pour la tâche à transiter par un nombre limité de canaux, ce qui induit une attention centrée sur la manipulation dès le pré-entraînement. Les auteurs montrent que ce mécanisme reste efficace même appliqué à des architectures de politique différentes, y compris un style Mixture-of-Transformers (MoT). Il s'agit pour l'instant d'un rapport de recherche déposé sur arXiv (arXiv:2607.06655v1), sans annonce de produit commercial ni de déploiement industriel associé.

À lire aussi

AffordanceVLA : un modèle VLA qui améliore la génération d'actions grâce à la compréhension des affordances
1arXiv cs.RO 

AffordanceVLA : un modèle VLA qui améliore la génération d'actions grâce à la compréhension des affordances

Des chercheurs ont publié le 6 juin 2026 sur arXiv (réf. 2606.06155) un nouveau framework baptisé AffordanceVLA, conçu pour améliorer la manipulation robotique pilotée par des modèles vision-langage-action (VLA). Le coeur du système repose sur l'introduction de l'affordance comme représentation intermédiaire structurée entre la compréhension sémantique et la génération de commandes motrices. Concrètement, trois modules complémentaires décomposent la tâche : Which2Act identifie l'objet pertinent via une prédiction dans l'espace latent visuel pour filtrer les distracteurs ; Where2Act localise en 2D le point d'interaction via une carte d'affordance estimée ; How2Act raisonne en 3D sur la géométrie de la scène pour guider la politique de manipulation. Ces modules sont intégrés dans une architecture Mixture-of-Transformer (MoT) avec des experts spécialisés, entraînée selon un curriculum progressif en trois étapes. Pour pallier le manque de labels d'affordance denses dans les jeux de données robotiques existants, les auteurs ont développé un pipeline automatisé d'augmentation de données. Les résultats sont validés sur bancs de simulation et en conditions réelles, sans que les métriques quantitatives précises soient encore publiées à ce stade de preprint. Le problème que cible AffordanceVLA est bien documenté dans la communauté VLA : les modèles vision-langage préentraînés encodent une sémantique riche mais abstraite, structurellement incompatible avec les espaces de contrôle moteur continu. Combler ce fossé directement, sans représentation intermédiaire, produit des politiques fragiles face aux variations de scène. L'approche par affordance offre une solution élégante car elle reste géométriquement ancrée tout en restant conditionnée sémantiquement, ce qui facilite la généralisation sim-to-real. Pour les intégrateurs qui déploient des bras manipulateurs en environnement non structuré, ce type de robustesse perceptuelle est un critère clé souvent sacrifié dans les démos labo. Le paysage des VLA pour la manipulation est désormais très concurrentiel : Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA, OpenVLA issu de Stanford et Berkeley, ou encore RT-2 de Google DeepMind incarnent différentes approches du même défi. AffordanceVLA se distingue en positionnant explicitement l'affordance comme pont structurel, une direction également explorée par des travaux comme RoboAfford ou UniPI. Ce preprint reste une contribution de recherche, pas un produit commercialisé ; aucun déploiement industriel ni partenariat n'est annoncé. Les prochaines étapes naturelles seront une évaluation sur benchmarks standardisés comme LIBERO ou RLBench, et une confrontation aux modèles de référence avec métriques comparatives publiées.

IA physiqueOpinion
1 source
InternVLA-A1.5 : unifier compréhension, prévision latente et action pour une généralisation compositionnelle
2arXiv cs.RO 

InternVLA-A1.5 : unifier compréhension, prévision latente et action pour une généralisation compositionnelle

Des chercheurs présentent InternVLA-A1.5, un modèle unifie de manipulation robotique qui embarque a la fois les capacités sémantiques d'un VLM preentraine et une prévision physique du futur, le tout dans une seule politique de contrôle. L'architecture conserve un backbone VLM natif qui continue de s'entrainer sur des taches de question-réponse visuelle et de prédiction de sous-taches, auquel est attache un expert léger dédié a la génération continue d'actions. L'innovation clé porte sur la prévision du futur, reformulée comme un problème de "latent-querying": un petit ensemble de jetons de prévision apprenables condense les éléments du futur pertinents pour la tache en un code latent compact, sous la supervision d'un modèle de génération vidéo preentraine et gelé, sans jamais apprendre de génération au niveau du pixel. La branche vidéo est abandonnee au moment de l'inférence, ce qui préservé le contrôle en temps réel. Preentraine sur 1,2 million d'épisodes robotiques et 3 millions d'échantillons multimodaux, InternVLA-A1.5 obtient les meilleurs résultats globaux sur six benchmarks de simulation, et affiche en conditions réelles la généralisation compositionnelle la plus solide sur des combinaisons d'instructions inédites. Ce travail s'attaque a un problème récurrent des modèles VLA unifies: entrainer conjointement compréhension sémantique et prédiction d'action tend a dégrader les priors du VLM d'origine, créé des interférences entre objectifs hétérogènes, et oblige souvent a réapprendre la prévision visuelle depuis zero en espace pixel, sans exploiter les modèles de génération vidéo déjà entraines. En évitant cette dernière étape couteuse tout en gardant un contrôle temps réel, l'approche laisse entrevoir, pour les intégrateurs et les équipes de recherche en robotique, une voie pour combiner raisonnement de haut niveau et dynamique physique sans sacrifier la vitesse d'exécution ni la robustesse face a des consignes formulées différemment de celles vues a l'entrainement, un point sensible pour tout déploiement commercial au-delà de la démo. Le papier s'inscrit dans la vague des modèles vision-langage-action généralistes portée ces deux dernières années par des acteurs comme Physical Intelligence avec pi-0, Nvidia avec GR00T N2, ou Figure AI avec Helix, tous confrontes au même arbitrage entre sémantique préservée et dynamique apprise. InternVLA-A1.5 reste pour l'instant une contribution de recherche publiée sur arXiv, évaluée sur benchmarks de simulation et expériences réelles limitées, et non un produit déployé a grande échelle; la suite logique serait une validation sur des plateformes robotiques tierces et des taches manufacturières plus complexes pour confirmer que les gains de généralisation tiennent hors laboratoire.

IA physiqueActu
1 source
IA généralisable par ancrage de représentation et alignement langage-action pour les modèles VLA
3arXiv cs.RO 

IA généralisable par ancrage de représentation et alignement langage-action pour les modèles VLA

Le laboratoire à l'origine de ce travail publie Anchor-Align, une méthode de finetuning pour les politiques vision-langage-action (VLA), décrite dans un article arXiv (2607.13429, juillet 2026, projet en ligne sur anchoralignvla.github.io). Le problème ciblé est concret : quand un modèle vision-langage préentraîné est affiné sur des démonstrations robotiques par clonage comportemental (behavior cloning), il perd progressivement les représentations qui lui permettaient de généraliser visuellement et sémantiquement. Le co-entraînement sur des données web texte-image, remède habituel, ne corrige pas le vrai défaut : les pertes de langage et d'action portent sur des observations différentes, ce qui laisse un désalignement langage-action invisible aux benchmarks de manipulation classiques. Anchor-Align ajoute deux objectifs d'entraînement, l'un qui distille les représentations couche par couche d'une copie figée du VLM d'origine, l'autre qui convertit chaque action cible en étiquette discrète de direction de mouvement pour entraîner conjointement langage et action sur la même observation robotique. Sur un bras robotique physique xArm7, avec deux architectures VLA largement utilisées, les taux de réussite passent de 28% à 54% pour l'une et de 37% à 60% pour l'autre. L'enjeu dépasse la seule courbe de performance : c'est une remise en cause d'un présupposé du secteur des VLA, celui du "plus de données de co-entraînement suffit" pour éviter l'oubli catastrophique. En montrant qu'il existe un désalignement structurel que les benchmarks de manipulation standards ne détectent pas, les auteurs pointent un angle mort méthodologique qui concerne tous les laboratoires construisant des politiques de type RT-2, OpenVLA, Pi-0 ou GR00T. Pour les équipes qui finetunent des VLA pour des tâches industrielles, le message est que préserver les représentations préentraînées et apprendre correctement l'action ne sont pas des objectifs contradictoires, contrairement à l'hypothèse implicite du compromis généralisation-performance. Il faut toutefois noter que la majorité des gains rapportés (LIBERO-PRO, LIBERO-Plus, CALVIN) proviennent de simulation, avec seulement deux architectures testées en conditions réelles sur un unique bras robotique, ce qui limite la portée immédiate pour un déploiement industriel à grande échelle. Le contexte est celui d'une course intense autour des modèles VLA depuis l'émergence de RT-2 puis des systèmes open source comme OpenVLA, où le clonage comportemental sur démonstrations téléopérées est devenu la recette standard malgré ses limites connues de généralisation. Anchor-Align se positionne comme une brique méthodologique plutôt qu'un produit ou un robot, sans annonce de partenariat industriel ni de calendrier de déploiement pour l'instant. La suite logique serait une validation sur davantage d'architectures et de plateformes physiques, ainsi qu'une comparaison directe avec les techniques de co-entraînement existantes utilisées par les acteurs commerciaux du secteur, pour voir si le gain se maintient à l'échelle des flottes industrielles réelles.

IA physiqueActu
1 source
La simplicité avant tout : génération d'actions en une étape pour les modèles vision-langage-action (VLA)
4arXiv cs.RO 

La simplicité avant tout : génération d'actions en une étape pour les modèles vision-langage-action (VLA)

Une équipe de chercheurs publie sur arXiv (2606.05737, juin 2026) une méthode simplifiée pour accélérer la génération d'actions dans les modèles VLA (vision-language-action) à base de diffusion. L'observation centrale: là où les pipelines diffusion classiques requièrent dix étapes de débruitage itératif pour produire un chunk d'actions, un simple biais de la distribution d'entraînement vers les états à bruit élevé suffit à obtenir des politiques efficaces en une seule étape, sans modèle enseignant, sans distillation et sans objectif auxiliaire. Sur les benchmarks LIBERO, LIBERO-Plus et LIBERO-Pro devenus quasi-standards pour la manipulation dextre simulée, les politiques one-step entraînées avec ce calendrier biaisé égalent ou dépassent des politiques à décodage dix-étapes entraînées avec une distribution uniforme. Sur LIBERO-Long spécifiquement, un modèle combinant un LVM de 1,4 milliard de paramètres et une tête d'action de 30 millions de paramètres atteint 95,6 % de taux de succès en une seule étape. Une validation croisée sur robot bimanual réel (plateforme YAM, dans le cadre d'une évaluation RSS) confirme la tendance, sur un échantillon limité. L'enjeu opérationnel est direct: réduire le décodage d'un facteur dix libère de la latence critique pour les applications temps-réel. Mais l'argument de fond est plus structurel. Les auteurs identifient une asymétrie fondamentale entre génération d'images et génération d'actions robotiques: un espace d'action (quelques degrés de liberté, un chunk de positions articulaires) est incomparablement plus compact qu'une image de millions de pixels. Cette différence implique que les méthodes one-step avancées développées pour la synthèse d'images (distillation de consistency models, score distillation, flow matching accéléré) ne sont pas nécessairement requises ici. Pour un intégrateur ou un décideur industriel, cela simplifie significativement le pipeline d'entraînement: pas de phase de distillation en deux étapes, pas de teacher freezing, et donc moins de complexité opérationnelle pour déployer un VLA performant. Les VLA à base de diffusion ont connu une montée en puissance rapide depuis mi-2024, portée par pi0 de Physical Intelligence, GR00T N2 de NVIDIA et Helix de Figure AI, tous construits autour d'architectures à flux diffusion ou flow-matching pour la génération d'actions. Ce travail s'inscrit dans un mouvement de simplification qui cherche à réduire la friction entre recherche et déploiement industriel. Les benchmarks LIBERO restent cantonnés à la manipulation de petits objets en environnement simulé, et la validation sur robot réel présentée ici reste préliminaire. Les prochaines étapes naturelles seront de tester cette approche à plus grande échelle sur des architectures de référence comme pi0 ou GR00T, dans des contextes d'assemblage ou de logistique où la latence d'inférence est un critère de déploiement direct.

IA physiqueOpinion
1 source