Aller au contenu principal
Attaques par redirection de trajectoire sur les modèles vision-langage-action (VLA)
RecherchearXiv cs.RO 

Attaques par redirection de trajectoire sur les modèles vision-langage-action (VLA)

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont publié le 12 juin 2026 un article (arXiv:2606.12978) introduisant une nouvelle classe d'attaques adversariales sur les politiques robotiques de type VLA (Vision-Language-Action), ces architectures qui combinent un modèle de langage, une vision par caméra et un contrôleur moteur pour exécuter des tâches de manipulation à partir d'instructions textuelles. L'attaque baptisée "command-preserving trajectory redirection" (redirection de trajectoire préservant la commande) consiste à modifier subtilement le prompt d'entrée de façon à ce qu'il reste visuellement et sémantiquement proche de l'instruction légitime, mais provoque un résultat physique entièrement différent. Le modèle de menace est strict : l'attaquant ne modifie ni les poids du modèle, ni l'environnement, il choisit un seul prompt avant l'épisode, et ce prompt reste dans la norme syntaxique de la commande originale, sans mots-cibles ni langage correctif. Les auteurs proposent une méthode de recherche "on-policy" qui exploite des rollouts réels du robot pour identifier les perturbations textuelles dont le comportement en boucle fermée dévie vers une tâche cible. Les expériences sont conduites en simulation et sur robot physique, confirmant le transfert de l'attaque au monde réel.

Ce résultat est significatif pour les intégrateurs et les décideurs industriels qui évaluent l'adoption des VLA en production, notamment dans les contextes de manipulation collaborative ou d'assemblage. La vulnérabilité exploite une propriété structurelle des VLA en boucle fermée : le même prompt est réappliqué à chaque étape de re-planification, et chaque action conditionnée modifie les observations futures sur lesquelles la politique agit. Un prompt malveillant peut donc cumuler ses effets sur toute une trajectoire, là où les attaques précédentes se limitaient à des perturbations action-par-action ou à la persistance d'actions basses. Cela contredit implicitement l'hypothèse que la robustesse visuelle d'un VLA suffit à garantir son intégrité comportementale, et soulève des questions concrètes sur la validation de sécurité avant déploiement.

Les modèles VLA sont au coeur de plusieurs développements récents : pi0 de Physical Intelligence, OpenVLA, RT-2 de Google DeepMind, ou encore les politiques embarquées sur les humanoïdes Figure et 1X. La recherche en sécurité adversariale sur ces architectures était jusqu'ici dominée par des attaques sur les observations visuelles ou sur les actions individuelles ; ce travail ouvre formellement le champ des attaques au niveau de l'instruction textuelle à horizon long. Les auteurs n'annoncent pas de correctif ni de contre-mesure validée, ce qui laisse ouverte la question de la robustification des pipelines VLA. Les prochaines étapes attendues dans la communauté concerneront vraisemblablement la détection de prompts adversariaux à la volée et l'évaluation de ce vecteur d'attaque sur des modèles déployés commercialement. Le site projet est accessible à l'adresse indiquée dans le papier.

À lire aussi

RedVLA : l'attaque physique des modèles vision-langage-action (VLA)
1arXiv cs.RO 

RedVLA : l'attaque physique des modèles vision-langage-action (VLA)

Une équipe de chercheurs a publié RedVLA (arXiv:2604.22591), présenté comme le premier framework de red teaming physique dédié aux modèles VLA (Vision-Language-Action), ces architectures multimodales qui pilotent des robots physiques en interprétant simultanément des instructions visuelles et textuelles. Le framework opère en deux étapes : une phase de "Risk Scenario Synthesis" qui identifie automatiquement les régions d'interaction critiques dans des trajectoires normales pour y insérer des facteurs de risque entremêlés au flux d'exécution du modèle, suivie d'un "Risk Amplification" qui raffine itérativement la position et l'état du facteur de risque via une optimisation sans gradient guidée par des caractéristiques de trajectoire. Testé sur six modèles VLA représentatifs, RedVLA atteint un taux de succès d'attaque (Attack Success Rate) de 95,5 % en seulement 10 itérations d'optimisation. Les chercheurs proposent en parallèle SimpleVLA-Guard, un module de sécurité léger entraîné sur les données générées par RedVLA, dont le code et les assets sont disponibles publiquement. Un ASR de 95,5 % signifie que dans quasiment tous les scénarios testés, le framework a réussi à provoquer des comportements dangereux dans des modèles VLA avant déploiement. C'est un résultat préoccupant pour les intégrateurs industriels : contrairement aux attaques sur systèmes purement logiciels, les comportements physiques incorrects (collisions, chutes d'objets, dommages environnementaux) sont souvent irréversibles. RedVLA démontre qu'il est possible de cartographier ces risques de façon systématique avant mise en production, ce qui comble un vide méthodologique réel. Pour les équipes chargées de qualifier des robots manipulateurs ou des humanoïdes, ce type d'outil d'évaluation adversariale pourrait devenir une exigence de certification, à l'image des standards de sécurité fonctionnelle (IEC 61508) dans l'automatisation industrielle. Les modèles VLA ont connu une accélération marquée depuis 2023 avec RT-2 (Google DeepMind), OpenVLA (Stanford), Pi-0 (Physical Intelligence) et GR00T N2 (NVIDIA), chacun visant à généraliser les capacités de manipulation via de grandes architectures multimodales pré-entraînées. La sécurité physique de ces systèmes est restée largement sous-étudiée, la recherche en robustesse IA se concentrant surtout sur les attaques adversariales textuelles ou visuelles en contexte numérique. RedVLA adapte les méthodologies de red teaming issues des LLMs au domaine physique, un glissement de paradigme qui devrait intéresser aussi bien les acteurs américains (Figure AI, Agility Robotics, Boston Dynamics) que les startups européennes déployant des robots en environnement humain, comme Enchanted Tools (Mirokaï, France) ou Wandercraft. Les prochaines étapes naturelles seraient des validations sur hardware réel et l'intégration de SimpleVLA-Guard dans des pipelines de déploiement industriels.

UELes startups françaises déployant des robots en environnement humain (Enchanted Tools, Wandercraft) sont directement concernées par ces vulnérabilités VLA, et SimpleVLA-Guard pourrait s'imposer comme exigence dans les pipelines de qualification sous réglementation européenne (AI Act, certification IEC 61508).

RechercheOpinion
1 source
Diffusion cachée : attaques robotiques non restreintes sur les modèles vision-langage-action
2arXiv cs.RO 

Diffusion cachée : attaques robotiques non restreintes sur les modèles vision-langage-action

Des chercheurs ont publié le 12 août 2026 sur arXiv (référence 2608.10393v1) une nouvelle méthode d'attaque baptisée DURA, pour "diffusion-based unrestricted robotic attack", ciblant les modèles Vision-Language-Action (VLA) qui pilotent des robots dans des tâches de manipulation. Contrairement aux attaques adversariales classiques qui modifient des pixels de façon visible ou nécessitent un accès complet au modèle cible (white-box), DURA génère des patches adversariaux visuellement naturels en optimisant le long de la trajectoire latente d'un modèle de diffusion pré-entraîné. La méthode fonctionne aussi bien en mode white-box qu'en mode black-box, ce dernier ne nécessitant que l'observation des actions prédites par le modèle victime, sans accès à ses poids internes. Les auteurs ont testé DURA à la fois en simulation et en conditions physiques réelles, et rapportent des performances supérieures aux méthodes d'attaque existantes pour détourner un robot vers des actions choisies par l'attaquant. Cette démonstration met en lumière un angle mort de sécurité largement sous-exploré dans les systèmes robotiques pilotés par des modèles VLA, une famille d'architectures de plus en plus déployée dans les bras manipulateurs et robots humanoïdes industriels. Le fait qu'un patch visuellement anodin, sans artefact détectable à l'œil, puisse suffire à détourner un robot vers une action arbitraire constitue un signal d'alarme pour les intégrateurs et décideurs qui envisagent des déploiements physiques de ces modèles dans des environnements non contrôlés. Cela contredit l'hypothèse implicite selon laquelle les attaques adversariales restent cantonnées au numérique ou nécessitent des perturbations grossières et repérables. La validation en monde réel, et pas seulement en simulation, renforce la crédibilité de la menace. Ce travail s'inscrit dans la continuité des recherches sur la robustesse adversariale des réseaux de neurones, désormais étendue aux modèles VLA à mesure que ceux-ci quittent les laboratoires pour piloter des robots physiques. Les auteurs soulignent les limites des attaques existantes, jugées peu déployables en conditions réelles à cause de leur dépendance à un accès white-box ou à des perturbations trop visibles, et appellent explicitement à des mécanismes de défense plus robustes avant une adoption industrielle plus large de ces modèles.

RechercheActu
1 source
VLALeaks : attaques par inférence d'appartenance contre les modèles vision-langage-action
3arXiv cs.RO 

VLALeaks : attaques par inférence d'appartenance contre les modèles vision-langage-action

Des chercheurs ont publié le 15 juin 2026 un article (arXiv:2606.15165) présentant VLALeaks, une méthode d'attaque par inférence d'appartenance (membership inference attack, MIA) ciblant spécifiquement les modèles Vision-Language-Action (VLA). Ces modèles, qui permettent le contrôle bout-en-bout d'un robot à partir d'instructions en langage naturel et d'entrées visuelles, sont au cœur des systèmes robotiques les plus récents, de Pi-0 (Physical Intelligence) à OpenVLA en passant par les variantes de RT-2. L'attaque repose sur une observation de divergences dans les mécanismes d'attention interne des VLA selon que l'exemple présenté appartient ou non aux données d'entraînement. Le pipeline proposé se décompose en deux étapes : extraction de caractéristiques d'appartenance, puis construction d'un modèle d'attaque supervisé. Les résultats sur plusieurs benchmarks VLA montrent des métriques élevées, notamment en AUC et en TPR à 1 % de taux de faux positifs (TPR@1%FPR), sans que les auteurs donnent les valeurs absolues dans le résumé disponible. L'enjeu est substantiel pour quiconque développe ou déploie des systèmes robotiques fondés sur des VLA. Les données de démonstration robotique sont coûteuses à collecter, téléopération, enregistrement de trajectoires, annotation, et constituent un actif industriel stratégique. Montrer qu'un adversaire peut déterminer, à partir du seul accès aux sorties du modèle, si une démonstration spécifique a servi à l'entraînement revient à exposer à la fois la propriété intellectuelle des intégrateurs et les données potentiellement personnelles des opérateurs ayant effectué les démonstrations. C'est la première étude systématique de ce type de vulnérabilité sur des VLA, un angle resté jusqu'ici largement ignoré alors que les MIA sont bien documentées pour les LLM et les modèles de vision. Les VLA ont émergé comme paradigme dominant dans la robotique généraliste depuis 2023, portés par des travaux comme RT-2 (Google DeepMind), Octo (Berkeley) et les modèles de Physical Intelligence. Leur adoption croissante dans des contextes industriels réels, où les données propriétaires d'entreprises comme Amazon Robotics, Boston Dynamics ou Exotec pourraient constituer le corpus d'entraînement, rend cette classe d'attaques particulièrement critique. Les prochaines étapes naturelles incluent l'évaluation de défenses (differential privacy, data augmentation, output perturbation) et l'extension des attaques à des architectures multimodales plus récentes. Les auteurs positionnent VLALeaks comme un outil de recherche pour construire des déploiements VLA sécurisés, mais la publication de la méthode en elle-même constitue aussi un signal d'alarme pour les équipes qui mutualisent des données de démonstration dans des pipelines de fine-tuning partagés.

UEExotec (France) figure parmi les entreprises dont les données de démonstration propriétaires pourraient être exposées par ce vecteur d'attaque, ce qui impose une révision des pratiques de sécurité pour tout déployeur de VLA mutuali­sant des pipelines de fine-tuning en Europe.

RechercheOpinion
1 source
Hermite curves comme a priori de trajectoire pour les modèles vision-langage-action
4arXiv cs.RO 

Hermite curves comme a priori de trajectoire pour les modèles vision-langage-action

Une équipe de recherche présente les "Hermite trajectory priors", une méthode qui structure explicitement les trajectoires générées par les modèles Vision-Language-Action (VLA) pour la manipulation robotique. Le problème identifié : les VLA actuels découpent chaque "chunk" d'action en commandes point par point, ce qui produit des mouvements saccadés et des discontinuités aux frontières entre segments lors de l'exécution physique. La solution proposée paramétrise la trajectoire comme une courbe cubique d'Hermite par morceaux, définie par les positions et vitesses aux points de contrôle, pour imposer mathématiquement la fluidité. Trois variantes sont testées : les Hermite Tokens (prédiction autorégressive des variables de frontière quantifiées), le Hermite Scaffold (décomposition en trajectoire de base plus résidus) et la Hermite Regularization (contrainte ajoutée uniquement comme objectif d'entraînement auxiliaire). Cette dernière s'avère la plus performante des trois. Appliquée au modèle π0.5, elle fait passer le taux de succès de 95,9 % à 98,7 % sur le benchmark LIBERO, de 85,7 % à 90,9 % sur LIBERO-plus, et de 63,4 % à 90,0 % sur quatre tâches réelles exécutées sur robot physique, sans surcoût de calcul à l'inférence. Ce résultat pèse dans un débat central du secteur : celui de l'écart entre démonstration et réalité pour les modèles VLA. Beaucoup de systèmes affichent des scores élevés en simulation mais se dégradent nettement lors du transfert vers un robot réel, notamment à cause de la gigue de mouvement générée par le découpage naïf en chunks. En montrant qu'une contrainte de lissage purement géométrique, ajoutée pendant l'entraînement et retirée à l'inférence, améliore les performances réelles sans coût supplémentaire, les auteurs suggèrent que la structuration explicite des trajectoires agit comme un biais inductif d'apprentissage plutôt que comme une contrainte d'exécution en temps réel. Le travail s'inscrit dans la lignée des architectures VLA récentes comme π0, GR00T N2 ou Helix, qui cherchent toutes à généraliser le contrôle robotique à partir de données multimodales massives. La méthode, agnostique à l'architecture, pourrait s'intégrer à d'autres pipelines VLA existants ; les auteurs ne précisent toutefois pas de calendrier de déploiement industriel ni de partenariat avec un fabricant de robots.

RechercheActu
1 source