Aller au contenu principal
SAGE : un moteur génératif conscient du social pour la navigation multi-agents hétérogène
RecherchearXiv cs.RO 

SAGE : un moteur génératif conscient du social pour la navigation multi-agents hétérogène

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche propose SAGE (Socially-Aware Generative Engine), un nouveau système de navigation pour robots évoluant parmi des humains et d'autres agents hétérogènes, décrit dans un article publié sur arXiv (référence 2607.16619v1). Le modèle représente la scène, robots, piétons, autres véhicules, comme un graphe hétérogène orienté, traité par un Heterogeneous Graph Transformer (HGT) capable d'encoder des interactions asymétriques selon le type d'agent. Un module génératif basé sur la diffusion prédit conjointement les trajectoires futures des entités environnantes et le plan de trajectoire du robot. Au moment de l'inférence, un mécanisme de guidage baptisé "safety-social energy", sans entraînement supplémentaire, affine les trajectoires échantillonnées via des contraintes différentiables de collision, de cinématique, de progression de tâche et de conformité sociale selon le rôle de l'agent. Les tests ont été menés sur les jeux de données réels ETH/UCY et Stanford Drone Dataset (SDD), ainsi que sur des données synthétiques, avec une mise à l'échelle démontrée jusqu'à des équipes de 20 robots.

Pour l'industrie robotique, ce travail s'attaque à un vrai point de friction: la plupart des méthodes de prédiction de trajectoire et de planification traitent les agents de façon homogène ou se limitent à des contraintes géométriques de collision, ce qui échoue à modéliser des situations réalistes où un robot logistique, un piéton et un véhicule autonome n'ont ni la même dynamique ni le même rôle social. En couplant prédiction et planification dans un seul module génératif, et en permettant un arbitrage explicite entre sécurité, précision et performance de tâche sans réentraîner le modèle, SAGE répond à un besoin concret pour les intégrateurs déployant des flottes de robots mobiles (AMR) en environnement partagé avec des humains, entrepôts, hôpitaux, espaces publics.

Ce travail s'inscrit dans la lignée des recherches en navigation socialement consciente, un champ où les approches précédentes reposaient souvent sur des modèles de forces sociales ou de l'apprentissage par renforcement avec des hypothèses simplificatrices sur l'homogénéité des agents. L'article ne précise pas de calendrier de déploiement industriel ni de partenaire commercial: il s'agit à ce stade d'une contribution de recherche, dont la prochaine étape logique serait une validation sur robots physiques au-delà des simulations et jeux de données existants.

Dans nos dossiers

À lire aussi

D3D-GEN : génération interactive de mondes 3D ancrée dans le domaine pour la robotique sociale, consciente du robot
1arXiv cs.RO 

D3D-GEN : génération interactive de mondes 3D ancrée dans le domaine pour la robotique sociale, consciente du robot

D3D-GEN est un système de génération de mondes 3D interactifs présenté dans un article publié sur arXiv (arXiv:2608.11876v1) et conçu pour l'entraînement et la validation de robots sociaux en navigation autonome. Développé pour résoudre le compromis entre réalisme et simulabilité, le système combine un agent de recherche de domaine avec un pipeline de génération augmentée par récupération (RAG) ancré dans ce domaine. À partir d'une simple description textuelle du domaine visé, l'agent collecte automatiquement des données publiques spécifiques et construit une base de connaissances persistante, sans dépendre d'une bibliothèque fixe de modèles 3D. Le pipeline RAG interroge ensuite dynamiquement une base sémantique fournie par l'utilisateur pour générer des plans d'étage et des placements d'objets plausibles. Les mondes produits sont pleinement interactifs et compatibles avec les simulateurs Isaac Sim et Gazebo, deux outils largement utilisés en robotique. Les chercheurs ont bâti des bases de données pour trois domaines courants (résidentiel, hospitalier, bureau) et généré des dizaines d'environnements distincts pour chacun, le tout accessible via une interface web locale. Pour l'industrie robotique, cet outil s'attaque à un goulot d'étranglement concret : la pénurie d'environnements de simulation à la fois réalistes et diversifiés freine l'entraînement des politiques de navigation sociale, un maillon clé pour les robots amenés à opérer parmi des humains (hôpitaux, bureaux, domicile). En automatisant la collecte de connaissances de domaine et la synthèse de scènes plausibles sans base 3D préexistante, D3D-GEN pourrait réduire le travail manuel de conception d'environnements simulés, un frein connu à l'échelle du sim-to-real pour les intégrateurs et laboratoires de recherche en IA incarnée. Reste que la validation du réalisme et de la généralisation à d'autres domaines n'est démontrée que sur trois cas d'usage, ce qui limite pour l'instant la portée des conclusions. Ce travail s'inscrit dans la lignée des efforts récents visant à combler l'écart entre simulation et réalité pour l'IA incarnée, où des bases de données de scènes 3D figées (comme celles utilisées historiquement avec Isaac Sim ou Gazebo) limitent la diversité des scénarios d'entraînement. En s'appuyant sur des agents de recherche et du RAG plutôt que sur des bibliothèques statiques, D3D-GEN se positionne face à d'autres approches de génération procédurale de scènes pour la robotique. L'article ne précise pas de partenariats industriels ni de calendrier de déploiement au-delà du prototype de recherche présenté avec son interface web locale.

RecherchePaper
1 source
IA incarnée, HumAIN : la navigation sociale implicite du robot conscient des humains
2arXiv cs.RO 

IA incarnée, HumAIN : la navigation sociale implicite du robot conscient des humains

Des chercheurs présentent HumAIN (Human-Aware Implicit Social Robot Navigation), un nouveau framework publié sur arXiv (arXiv:2607.07357v1) qui vise à rendre la navigation des robots sociaux plus sensible aux comportements humains. Le système repose sur un modèle enseignant de type transformer qui fusionne plusieurs sources de données : images historiques, points clés du squelette humain (keypoints), état du robot et objectif de destination, afin d'apprendre des représentations robustes pour planifier la trajectoire future du robot. Cette connaissance est ensuite distillée dans un modèle élève beaucoup plus léger, optimisé conjointement pour reconstruire la trajectoire et aligner ses caractéristiques latentes sur celles de l'enseignant, ce qui permet un déploiement en temps réel. Lors des tests, HumAIN améliore les métriques de prédiction de trajectoire de 29,8% en moyenne sur l'ensemble des métriques évaluées, par rapport aux meilleures méthodes existantes. L'enjeu principal de ces travaux est de combler l'écart entre prédiction et planification, un problème récurrent dans la navigation robotique en environnement humain : beaucoup de systèmes prédisent bien le mouvement des piétons mais peinent à traduire cette prédiction en trajectoire exploitable en temps réel, surtout sur du matériel aux ressources limitées. En s'appuyant sur des indices sociaux implicites, comme la démarche ou l'orientation du corps, plutôt que sur des règles explicites ou des modèles de forces sociales classiques, cette approche pourrait rendre les robots mobiles (AMR, robots de service, plateformes embarquées) plus fluides et prévisibles dans des espaces partagés avec des humains, un facteur clé pour l'acceptabilité et la sécurité de ces systèmes en usage réel, notamment en logistique ou en environnement industriel où humains et robots cohabitent. Ce travail s'inscrit dans la lignée des recherches sur la navigation sociale des robots, un domaine qui cherche depuis plusieurs années à dépasser les modèles purement géométriques d'évitement d'obstacles pour intégrer une compréhension plus fine du comportement humain. La technique de distillation de connaissances, empruntée à l'apprentissage profond, est ici appliquée pour rendre exploitables sur des plateformes à ressources contraintes des représentations normalement coûteuses à calculer. Les auteurs positionnent HumAIN par rapport à des méthodes de l'état de l'art en prédiction de trajectoire, et les prochaines étapes attendues porteraient sur une validation au-delà de la simulation, sur des robots physiques en conditions réelles.

RecherchePaper
1 source
MPPI, planification par fonction de coût humain gaussienne pour la navigation sociale
3arXiv cs.RO 

MPPI, planification par fonction de coût humain gaussienne pour la navigation sociale

L'université ou le laboratoire à l'origine de PGIF (Predictive Gaussian Interaction Fields) propose une nouvelle formulation de coût pour la navigation robotique en milieu social, publiée sur arXiv le 8 août 2026. La méthode s'appuie sur le contrôleur MPPI (Model Predictive Path Integral), un planificateur par échantillonnage largement utilisé en robotique mobile, mais qui traite habituellement les piétons comme des obstacles ponctuels statiques à leur position actuelle. PGIF corrige ce défaut en projetant les trajectoires prédites des piétons sur tout l'horizon de planification et en les encodant sous forme de champs répulsifs gaussiens anisotropes, alignés sur la direction de déplacement de chaque personne. L'étendue de chaque champ croît avec la vitesse du piéton, créant une zone de danger en forme de cône qui pénalise davantage les trajectoires du robot coupant la route d'un piéton que celles l'abordant par l'arrière. Testée sur 300 scénarios de foule randomisés répartis sur trois niveaux de densité, l'approche PGIF-MPPI atteint un taux de collision de 0% à chaque niveau, contre jusqu'à 82% pour une implémentation MPPI classique, tout en conservant des performances de planification en temps réel, la formulation étant décrite comme calculable en forme close et entièrement parallélisable sans surcoût de calcul mesurable. Pour les intégrateurs de robots mobiles autonomes (AMR) et les équipes travaillant sur des plateformes destinées à des entrepôts, hôpitaux ou espaces publics, ce résultat s'attaque à un point de friction connu: les planificateurs par échantillonnage comme MPPI sont appréciés pour leur simplicité et leur rapidité, mais leur modélisation naïve des humains comme obstacles statiques les rend fragiles dès que la densité de foule augmente. Un taux de collision de 82% pour la version vanille de MPPI, même en simulation, illustre l'ampleur du problème que rencontrent les déploiements réels en environnement dynamique. Si les résultats se confirment au-delà de la simulation, cela renforcerait l'argument selon lequel la sécurité en navigation sociale ne nécessite pas forcément des architectures d'apprentissage profond lourdes, mais peut passer par un enrichissement ciblé de la fonction de coût dans des planificateurs classiques déjà utilisés en production. Ce travail s'inscrit dans une lignée de recherches en navigation sociale robotique cherchant à combler l'écart entre prédiction de trajectoires piétonnes et planification de mouvement du robot, un défi documenté depuis plusieurs années dans la littérature sur les champs de force sociaux et les modèles de prédiction de trajectoires. Contrairement à des approches basées sur l'apprentissage par renforcement ou des réseaux profonds pour la navigation sociale, PGIF reste une extension analytique du MPPI existant, ce qui facilite potentiellement son intégration dans des piles logicielles robotiques déjà en production. L'article, à ce stade une publication arXiv non encore validée par les pairs, ne précise pas de déploiement sur robot physique ni de partenariat industriel; les résultats rapportés reposent uniquement sur des scénarios simulés, et la validation en conditions réelles avec capteurs bruités et prédictions imparfaites reste l'étape suivante à surveiller.

RecherchePaper
1 source
AnyGoal : exploration multi-agents guidée par vision-langage pour une navigation permanente sans entraînement
4arXiv cs.RO 

AnyGoal : exploration multi-agents guidée par vision-langage pour une navigation permanente sans entraînement

Une équipe de chercheurs a publié sur arXiv (arXiv:2606.13878) AnyGoal, une architecture multi-agents de navigation en intérieur conçue pour fonctionner sans entraînement préalable sur les scènes cibles. Le système coordonne plusieurs robots via une carte partagée appelée Bayesian Value Map (BVM), une grille 2D maintenant pour chaque pixel une distribution gaussienne (μ, σ²) représentant la pertinence estimée de l'objectif. Cette carte est mise à jour par fusion pondérée des scores issus d'un modèle vision-langage (VLM), projetés via un masque conique de profondeur, et n'est jamais remise à zéro entre les sous-tâches, permettant une accumulation d'indices dite « lifelong ». Sur le benchmark GOAT-Bench (360 épisodes, 2 669 sous-tâches, configuration physique stricte : pas discrets de 0,25 m, champ de vision horizontal de 42°, sans téléportation), la version bi-agent atteint 52,4 % de taux de réussite par sous-tâche (Subtask SR) pour un SPL de 12,7 %, contre 41,9 % en configuration mono-agent. Ce résultat représente un gain de +27,5 points de pourcentage sur Modular GOAT (24,9 %), le système modulaire de référence précédent, ce qui est substantiel dans un domaine où les progrès se mesurent souvent en quelques points. L'intérêt principal réside dans l'approche sans entraînement : là où la plupart des politiques de navigation end-to-end se dégradent dès qu'elles rencontrent des scènes, des catégories d'objets ou des modalités d'objectif hors distribution, AnyGoal s'appuie sur la généralisation intrinsèque du VLM. L'ablation à quatre variables de perception révèle que l'intégration de détecteurs open-vocabulary déplace le goulot d'étranglement : la cause principale d'échec n'est plus l'exploration, mais la vérification de l'objectif, un déplacement de problème qui oriente clairement les futurs travaux. AnyGoal s'inscrit dans la lignée des travaux tentant de remplacer les pipelines fermés (détection à ensemble d'objets fixe, comme dans Modular GOAT) et les mémoires 3D denses (comme 3D-Mem, coûteuses à maintenir et sensibles au point de vue) par des représentations légères pilotées par le langage. La coordination multi-agents repose ici sur un allocateur glouton avec pénalité de séparation spatiale et hysteresis d'engagement, sans contrôleur centralisé, ce qui simplifie le déploiement. L'architecture reste à ce stade une contribution de recherche publiée sur preprint ; aucun pilote industriel ni déploiement réel n'est annoncé. Les prochaines étapes naturelles concernent la robustesse du VLM à la vérification de but et l'extension à des environnements semi-structurés ou extérieurs, où la généralisation sera encore plus mise à l'épreuve.

RecherchePaper
1 source