Aller au contenu principal
IndoorR2X : coordination robot-vers-tout en intérieur pilotée par LLM
RecherchearXiv cs.RO 

IndoorR2X : coordination robot-vers-tout en intérieur pilotée par LLM

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un article de recherche arXiv (2603.20182v4) présente IndoorR2X, un benchmark et un framework de simulation pour la planification multi-robots pilotée par des grands modèles de langage (LLM), avec perception et communication de type "Robot-to-Everything" (R2X) en environnement intérieur. Le système combine les observations de robots mobiles avec celles de capteurs IoT statiques déjà présents dans de nombreux bâtiments, comme des caméras, pour construire un état sémantique global de la scène. Cette architecture permet une compréhension de l'environnement à l'échelle du bâtiment, dépassant ce qu'un seul robot ou même une flotte en communication robot-à-robot (R2R) peut percevoir. Le framework propose des environnements de simulation configurables, des dispositions de capteurs, des compositions d'équipes robotiques et des suites de tâches, afin d'évaluer systématiquement différentes stratégies de coordination sémantique via planification LLM.

L'enjeu principal que cible IndoorR2X est un problème connu de la robotique multi-agents : la communication R2R seule ne résout pas l'observabilité partielle sans exploration coûteuse ou sans multiplier le nombre de robots déployés. En exploitant des capteurs IoT déjà installés (caméras de bâtiment notamment), l'approche réduit l'exploration redondante et améliore l'efficacité et la fiabilité de la coordination, selon les auteurs. Pour les intégrateurs et opérateurs de flottes AMR en entrepôt ou en environnement industriel, cela ouvre une piste concrète pour réduire les coûts d'infrastructure robotique en réutilisant l'instrumentation IoT existante plutôt que de multiplier les capteurs embarqués.

Ce travail s'inscrit dans la vague de recherche récente combinant LLM et planification robotique multi-agents, où la coordination sémantique de haut niveau reste un défi ouvert face aux limites de perception embarquée. Il s'agit ici d'un outil de recherche et de benchmarking, pas d'un système commercial déployé : les auteurs eux-mêmes documentent les modes d'échec observés dans leurs expériences, signe que la coordination LLM-robots-IoT reste à un stade exploratoire. Le projet, dont le code et les détails sont disponibles sur une page dédiée, vise à devenir une référence pour comparer les futures stratégies de coordination sémantique entre robots et capteurs ambiants.

Dans nos dossiers

À lire aussi

Navigation par apprentissage pour robots mobiles en intérieur
1arXiv cs.RO 

Navigation par apprentissage pour robots mobiles en intérieur

Des chercheurs ont publié sur arXiv (référence 2605.30468) un framework de navigation hybride pour robots mobiles intérieurs, combinant un planificateur global neuronal et un planificateur local affiné par apprentissage par renforcement. Le planificateur global est un réseau de neurones supervisé, entraîné à partir de trajectoires générées par un algorithme A* pondéré par les coûts, ce qui lui permet de produire des routes globalement cohérentes et évitant les zones dangereuses. Le planificateur local, baptisé Learning-Based DWA, reformule l'approche classique Dynamic Window Approach (DWA) comme un problème de sélection discrète sur une grille d'actions prédéfinies. La politique locale est d'abord initialisée par clonage comportemental (imitation d'un expert), puis optimisée par Proximal Policy Optimization (PPO) avec un masquage de faisabilité, un mécanisme éliminant les actions physiquement irréalisables ou à risque de collision avant même l'exploration. Les résultats expérimentaux, conduits en simulation et en environnement réel intérieur, montrent une navigation sûre et fiable vers des objectifs en présence d'obstacles. L'intérêt de cette contribution réside dans son positionnement hybride : plutôt que d'abandonner DWA au profit d'une approche entièrement apprise, les auteurs l'utilisent comme squelette structurant pour contraindre le problème d'apprentissage. Ce choix de conception présente deux avantages pour les intégrateurs. D'abord, le masquage de faisabilité réduit l'espace d'exploration du policy gradient aux seules actions physiquement admissibles, limitant les comportements dangereux en phase d'apprentissage et facilitant le transfert sim-to-réel. Ensuite, conserver la logique DWA comme substrat rend la politique plus interprétable qu'un réseau boîte noire, un critère non négligeable pour les déploiements industriels soumis à certification. La méthode démontre qu'un classique de la robotique réactive, largement jugé dépassé par les approches end-to-end, peut encore être un socle pertinent pour des pipelines d'apprentissage modernes. Le DWA a été introduit par Fox, Burgard et Thrun en 1997 et reste une brique fondamentale des stacks de navigation ROS et Nav2, déployés sur une large partie des flottes d'AMR (robots mobiles autonomes) industriels actuels. C'est dans cet écosystème très installé que s'inscrit ce travail, face à des approches concurrentes plus radicales : navigation end-to-end par apprentissage (ETH Zurich, MIT CSAIL), planificateurs à modèle comme TEB ou MPPI, et méthodes VLA émergentes pour la navigation en langage naturel. Les auteurs annoncent la mise à disposition du code source sur leur page projet. Aucun partenaire industriel ni déploiement commercial n'est mentionné : il s'agit d'une contribution de recherche académique, pas d'un produit commercialisé.

RecherchePaper
1 source
NavVerse : évaluer la navigation incarnée intérieur-extérieur en simulation robotique continue
2arXiv cs.RO 

NavVerse : évaluer la navigation incarnée intérieur-extérieur en simulation robotique continue

NavVerse est un nouveau benchmark de simulation physique dédié à la navigation robotique continue entre intérieur et extérieur, présenté dans un article déposé sur arXiv le 24 juillet 2026. Il couvre 100 scènes intérieures, 50 scènes urbaines extérieures et 50 scènes hybrides intérieur-extérieur, pour un total de 10 000 épisodes répartis sur trois tâches : navigation vers un objet (Object Navigation), navigation guidée par le langage (Vision-and-Language Navigation) et navigation vers un lieu (Place Navigation), où l'agent doit localiser des points d'intérêt sémantiques comme un restaurant ou une banque. Contrairement aux benchmarks existants qui évaluent séparément l'intérieur et l'extérieur et abstraient souvent l'exécution robotique réelle, NavVerse impose aux agents de passer par des interfaces robotiques exécutables, avec des métriques de succès de tâche, d'efficacité de trajectoire et de sécurité. Les tests zéro-shot menés avec des baselines par apprentissage par renforcement (RL), des modèles vision-langage-action (VLA) et des architectures modulaires montrent qu'aucune approche ne résout le problème : les VLA de bout en bout obtiennent le meilleur taux de succès zéro-shot, tandis que la méthode modulaire affiche le meilleur profil de sécurité. Cette double évaluation comble un angle mort réel du secteur : la plupart des robots de livraison, de campus ou d'intervention d'urgence doivent aujourd'hui franchir la frontière bâtiment-rue au sein d'un seul épisode continu, un cas d'usage rarement testé de bout en bout. Le résultat le plus révélateur concerne PlaceNav, dont les performances chutent nettement dès qu'on passe d'un environnement purement extérieur à un scénario hybride intérieur-extérieur, ce qui pointe l'adaptation au changement de contexte comme goulot d'étranglement majeur plutôt que la perception ou la planification prises isolément. Pour les intégrateurs et décideurs B2B, ce constat tempère l'idée que les modèles VLA génériques sont prêts à généraliser sans friction hors des environnements d'entraînement : le meilleur taux de succès zéro-shot ne s'accompagne pas du meilleur niveau de sécurité, ce qui illustre un arbitrage encore mal résolu entre performance brute et fiabilité opérationnelle. Le benchmark s'inscrit dans une lignée de plateformes de simulation pour la navigation incarnée (embodied navigation), généralement centrées soit sur l'intérieur soit sur l'extérieur, que NavVerse cherche explicitement à unifier en modélisant la traversée de frontière, la recherche de sortie et les échecs kinodynamiques souvent ignorés ailleurs. L'article ne précise pas d'institution porteuse ni de partenaire industriel, et reste à ce stade un outil d'évaluation académique plutôt qu'un produit déployé. Les prochaines étapes annoncées concernent l'élargissement des baselines testées et l'affinement des scénarios hybrides, dans un contexte où la course aux agents de navigation généralistes s'intensifie face à la difficulté persistante de transférer des compétences apprises en simulation vers des déploiements réels multi-environnements.

RecherchePaper
1 source
Agentic Harnesses : des couches de vérification pilotées par LLM pour l'autonomie des robots
3arXiv cs.RO 

Agentic Harnesses : des couches de vérification pilotées par LLM pour l'autonomie des robots

Un article publié sur arXiv (identifiant 2608.09857) propose une couche de vérification pilotée par des grands modèles de langage (LLM), insérée entre la planification et l'exécution des actions d'un robot autonome. Ce middleware, dénommé « agentic harness », intercepte les plans avant qu'ils n'atteignent le serveur MCP (Model Context Protocol) et les commandes bas niveau du robot, en s'appuyant sur un ensemble de LLM juges qui combinent raisonnement en chaîne de pensée et synthèse multi-modèles, selon une logique de mélange d'experts et d'auto-cohérence. Chaque plan est classé en trois catégories : approuvé, rejeté pour reformulation, ou escaladé vers une révision humaine. Les auteurs rapportent une précision proche de 85% sur ces trois catégories, un taux de blocage de 97% des attaques adversariales, et des erreurs quasi nulles entre acceptation et rejet, la plupart des erreurs résiduelles se situant à la frontière de l'escalade. Cette proposition comble un angle mort de la recherche en robotique autonome, jusqu'ici concentrée sur l'exécution des plans plutôt que sur la vérification de leur faisabilité : comme les LLM généralistes, les modèles de planification robotique peuvent produire des actions biaisées vers l'objectif fixé par l'utilisateur, contraires à l'éthique scientifique, dangereuses faute de mémoire des risques déjà identifiés, ou vulnérables aux attaques adversariales. Pour les intégrateurs qui déploient des piles agentiques combinant modèles vision-langage-action et contrôle robotique, ce travail illustre un besoin croissant de gouvernance intermédiaire entre la décision du modèle et l'actionnement physique. Il apporte une mesure rare dans un domaine où les garanties de sécurité restent souvent qualitatives, même si des erreurs subsistent à la frontière de l'escalade, où l'arbitrage humain reste nécessaire. Cette recherche s'inscrit dans la montée des architectures agentiques en robotique, où les modèles de fondation vision-langage-action, tels que ceux développés par Physical Intelligence, NVIDIA ou Figure AI pour piloter des robots humanoïdes, sont de plus en plus reliés à des chaînes d'outils via des protocoles comme MCP. L'article, publié en août 2026, ne précise ni plateforme robotique testée ni calendrier de déploiement industriel : il s'agit à ce stade d'une contribution méthodologique de recherche, dont l'adoption par des laboratoires ou des intégrateurs reste à démontrer.

RecherchePaper
1 source
Propagation d'actions dangereuses dans une collaboration multi-robots pilotée par LLM via un seul robot compromis
4arXiv cs.RO 

Propagation d'actions dangereuses dans une collaboration multi-robots pilotée par LLM via un seul robot compromis

Des chercheurs ont publié sur arXiv (arXiv:2605.15641, mai 2026) un nouveau paradigme d'attaque ciblant les systèmes multi-robots pilotés par des grands modèles de langage (LLM). Le principe : compromettre un seul robot d'un essaim suffit à propager des instructions malveillantes à l'ensemble du système via la communication inter-robots. L'équipe a évalué l'attaque sur trois dimensions à haut risque, abandon de mission, compromission de données privées, et mise en danger de la sécurité publique, en la quantifiant avec trois métriques : obéissance (taux d'exécution des instructions malveillantes), infectiosité (proportion de robots compromis), et furtivité. Les résultats sont nets : le score d'obéissance atteint 1,00 dans les cas les plus défavorables, l'infectiosité monte à 0,90, et l'attaque complète la propagation en seulement 3,0 rounds en moyenne, tout en maintenant un score de furtivité de 0,81. Le code est disponible publiquement sur GitHub (InfectBot). Ce travail met en évidence un angle mort majeur dans la sécurité des flottes robotiques industrielles et logistiques pilotées par LLM : jusqu'ici, la recherche en sécurité s'était concentrée sur les robots isolés. Or, les architectures multi-robots en production, entrepôts automatisés, chantiers collaboratifs, environnements hospitaliers, reposent précisément sur la communication pair-à-pair pour la coordination. Le mécanisme de consensus qui rend ces systèmes efficaces devient ici un vecteur d'amplification : dans les situations critiques (urgences, conflits de priorité), les instructions adversariales peuvent supplanter les garde-fous de sécurité sans déclencher d'alerte. La persistance du contrôle attaquant (obéissance à 1,00) indique que les alignements de sécurité actuels des planificateurs LLM ne sont pas conçus pour résister à une pression latérale venant d'un pair de confiance. Les LLM comme planificateurs embarqués sont une tendance lourde : des entreprises comme Figure AI, Physical Intelligence (pi0), Boston Dynamics et Agility Robotics intègrent des couches de raisonnement à haut niveau dans leurs architectures. NVIDIA GR00T N2 et les frameworks VLA (Vision-Language-Action) poussent dans la même direction. Ce paper s'inscrit dans un corpus émergent qui questionne la robustesse de ces systèmes face à des attaques adversariales physiquement concrètes, non plus des jailbreaks textuels, mais des actions dans le monde réel. Les prochaines étapes probables incluent des défenses basées sur la vérification cryptographique des instructions inter-robots et des mécanismes de consensus multi-signatures, pistes déjà explorées dans la robotique en essaim mais rarement couplées aux LLM.

UELes flottes robotiques LLM déployées en Europe (entrepôts automatisés, industrie, hôpitaux) sont exposées à ce vecteur d'attaque latérale, et l'AI Act impose aux fournisseurs de systèmes à haut risque de documenter et tester leurs mécanismes de sécurité face à ce type de compromission pair-à-pair.

RechercheOpinion
1 source