Aller au contenu principal
IA incarnée, HumAIN : la navigation sociale implicite du robot conscient des humains
RecherchearXiv cs.RO 

IA incarnée, HumAIN : la navigation sociale implicite du robot conscient des humains

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent HumAIN (Human-Aware Implicit Social Robot Navigation), un nouveau framework publié sur arXiv (arXiv:2607.07357v1) qui vise à rendre la navigation des robots sociaux plus sensible aux comportements humains. Le système repose sur un modèle enseignant de type transformer qui fusionne plusieurs sources de données : images historiques, points clés du squelette humain (keypoints), état du robot et objectif de destination, afin d'apprendre des représentations robustes pour planifier la trajectoire future du robot. Cette connaissance est ensuite distillée dans un modèle élève beaucoup plus léger, optimisé conjointement pour reconstruire la trajectoire et aligner ses caractéristiques latentes sur celles de l'enseignant, ce qui permet un déploiement en temps réel. Lors des tests, HumAIN améliore les métriques de prédiction de trajectoire de 29,8% en moyenne sur l'ensemble des métriques évaluées, par rapport aux meilleures méthodes existantes.

L'enjeu principal de ces travaux est de combler l'écart entre prédiction et planification, un problème récurrent dans la navigation robotique en environnement humain : beaucoup de systèmes prédisent bien le mouvement des piétons mais peinent à traduire cette prédiction en trajectoire exploitable en temps réel, surtout sur du matériel aux ressources limitées. En s'appuyant sur des indices sociaux implicites, comme la démarche ou l'orientation du corps, plutôt que sur des règles explicites ou des modèles de forces sociales classiques, cette approche pourrait rendre les robots mobiles (AMR, robots de service, plateformes embarquées) plus fluides et prévisibles dans des espaces partagés avec des humains, un facteur clé pour l'acceptabilité et la sécurité de ces systèmes en usage réel, notamment en logistique ou en environnement industriel où humains et robots cohabitent.

Ce travail s'inscrit dans la lignée des recherches sur la navigation sociale des robots, un domaine qui cherche depuis plusieurs années à dépasser les modèles purement géométriques d'évitement d'obstacles pour intégrer une compréhension plus fine du comportement humain. La technique de distillation de connaissances, empruntée à l'apprentissage profond, est ici appliquée pour rendre exploitables sur des plateformes à ressources contraintes des représentations normalement coûteuses à calculer. Les auteurs positionnent HumAIN par rapport à des méthodes de l'état de l'art en prédiction de trajectoire, et les prochaines étapes attendues porteraient sur une validation au-delà de la simulation, sur des robots physiques en conditions réelles.

À lire aussi

Robots demandent leur chemin : la navigation sociale à base de communication
1arXiv cs.RO 

Robots demandent leur chemin : la navigation sociale à base de communication

Des chercheurs ont présenté CommNav (Communication-enabled Social Navigation), une nouvelle tâche pour robots assistants évoluant en environnement multi-agents, décrite dans un article publié sur arXiv (2607.01044v1). Plutôt que de se contenter d'éviter les obstacles humains de façon réactive, comme le font les méthodes actuelles de navigation sociale, le robot cherche activement de l'aide en interrogeant les résidents sur les déplacements récents d'une personne cible : où elle se trouve, où elle a été vue, dans quelle direction elle s'est dirigée. Pour évaluer cette approche, l'équipe a créé Habitat 3.0c, une extension du simulateur Habitat 3.0 intégrant des protocoles d'échange d'informations en environnement multi-humains. En ajoutant leur module de communication, baptisé COMM, à un modèle de navigation sociale de référence, les chercheurs obtiennent un gain de 10 points de pourcentage sur le taux de succès des épisodes de navigation. Ils ont aussi comparé un entraînement sur instructions générées par un LLM à un entraînement sur formulations familières, collectées lors d'une étude auprès d'humains. Ce travail répond à un angle mort réel des systèmes de navigation sociale existants, focalisés sur l'évitement de collision et l'adaptation de trajectoire mais incapables de solliciter proactivement de l'information humaine. Pour les intégrateurs travaillant sur des robots d'assistance en environnement résidentiel, hospitalier ou logistique (recherche d'une personne dans un bâtiment, livraison ciblée en présence de plusieurs occupants), la capacité d'un robot à poser une question simple et à exploiter la réponse change la donne par rapport à une exploration purement géométrique de l'espace. Le résultat le plus notable pour la robustesse en conditions réelles est la troisième conclusion des auteurs : la politique de navigation reste performante face à un langage naturel et familier, avec un taux de succès statistiquement comparable à celui obtenu avec des données structurées parfaites, ce qui limite le risque que le système échoue simplement parce qu'un humain formule sa réponse maladroitement. CommNav s'inscrit dans la lignée des travaux sur la navigation sociale embarquée dans Habitat, plateforme de simulation largement utilisée en recherche robotique pour entraîner des agents en environnement intérieur peuplé d'humains virtuels. L'apport spécifique ici est le pré-entraînement du module COMM sur une tâche annexe de communication, une astuce présentée par les auteurs comme le moyen de gérer le caractère rare et irrégulier des signaux d'interaction avec les résidents. L'article ne mentionne pas de déploiement sur robot physique ni de partenaire industriel ; il s'agit à ce stade d'un travail de recherche en simulation, dont la prochaine étape logique serait un transfert vers un robot réel et une évaluation face à des locuteurs non scriptés en conditions non contrôlées.

RecherchePaper
1 source
Navigation dans la foule : commande prédictive non linéaire avec dynamique des forces sociales pour la navigation robotique tenant compte des humains
2arXiv cs.RO 

Navigation dans la foule : commande prédictive non linéaire avec dynamique des forces sociales pour la navigation robotique tenant compte des humains

Une équipe de chercheurs publie sur arXiv (arXiv:2607.10374v1, dépôt du 14 juillet 2026) un nouveau cadre de contrôle baptisé SFM-NMPC, pour Social Force Model based Non-linear Model Predictive Control. L'idée consiste à intégrer directement le Social Force Model, un modèle physique classique de la dynamique des foules, dans la boucle d'optimisation d'un contrôleur prédictif non linéaire (NMPC) pilotant la navigation d'un robot mobile. Concrètement, le contrôleur prédit simultanément les trajectoires futures des humains environnants et celle du robot sur tout l'horizon de prédiction, et s'appuie sur un ensemble de fonctions de coût sociales dédiées pour orienter la planification vers des comportements jugés conformes aux normes sociales, au-delà du simple évitement de collision. Malgré la complexité accrue du modèle, les auteurs annoncent un fonctionnement temps réel à 20 Hz, validé par des tests simulés extensifs en environnements encombrés, ainsi qu'une étude d'ablation isolant la contribution de la dynamique SFM et des termes de coût social. Pour l'industrie de la robotique mobile et les intégrateurs de robots destinés à des environnements partagés avec des humains, entrepôts, hôpitaux, espaces commerciaux, ce travail s'attaque à un point de friction connu: les méthodes classiques d'évitement d'obstacles traitent les piétons comme des obstacles dynamiques sans anticiper leur comportement, ce qui produit une navigation perçue comme intrusive ou erratique. En démontrant qu'un modèle de prédiction humaine sophistiqué peut être embarqué dans la boucle de contrôle sans casser la contrainte temps réel, l'étude apporte un argument concret contre l'hypothèse selon laquelle précision sociale et efficacité computationnelle seraient nécessairement antagonistes en MPC. Reste que les résultats, à ce stade, ne reposent que sur de la simulation: la validation sur robot physique en environnement humain réel, avec ses incertitudes de perception et de suivi de trajectoire, constitue l'étape suivante indispensable avant toute conclusion sur l'applicabilité terrain. Le Model Predictive Control s'est imposé ces dernières années comme alternative robuste aux approches classiques de planification et aux méthodes purement data-driven pour la navigation robotique, mais sa performance dépend étroitement de la qualité des modèles de prédiction humaine qu'il embarque. Le Social Force Model, formalisé dans les années 1990 pour modéliser les dynamiques de foule, offre une base physique interprétable que plusieurs travaux récents cherchent à coupler à des contrôleurs optimaux. SFM-NMPC s'inscrit dans cette lignée et se compare à des méthodes de référence de l'état de l'art sur des métriques de conformité sociale, sans toutefois se positionner face à des acteurs industriels ou des systèmes commerciaux déployés, le travail restant à ce stade de nature académique et exploratoire.

RecherchePaper
1 source
D3D-GEN : génération interactive de mondes 3D ancrée dans le domaine pour la robotique sociale, consciente du robot
3arXiv cs.RO 

D3D-GEN : génération interactive de mondes 3D ancrée dans le domaine pour la robotique sociale, consciente du robot

D3D-GEN est un système de génération de mondes 3D interactifs présenté dans un article publié sur arXiv (arXiv:2608.11876v1) et conçu pour l'entraînement et la validation de robots sociaux en navigation autonome. Développé pour résoudre le compromis entre réalisme et simulabilité, le système combine un agent de recherche de domaine avec un pipeline de génération augmentée par récupération (RAG) ancré dans ce domaine. À partir d'une simple description textuelle du domaine visé, l'agent collecte automatiquement des données publiques spécifiques et construit une base de connaissances persistante, sans dépendre d'une bibliothèque fixe de modèles 3D. Le pipeline RAG interroge ensuite dynamiquement une base sémantique fournie par l'utilisateur pour générer des plans d'étage et des placements d'objets plausibles. Les mondes produits sont pleinement interactifs et compatibles avec les simulateurs Isaac Sim et Gazebo, deux outils largement utilisés en robotique. Les chercheurs ont bâti des bases de données pour trois domaines courants (résidentiel, hospitalier, bureau) et généré des dizaines d'environnements distincts pour chacun, le tout accessible via une interface web locale. Pour l'industrie robotique, cet outil s'attaque à un goulot d'étranglement concret : la pénurie d'environnements de simulation à la fois réalistes et diversifiés freine l'entraînement des politiques de navigation sociale, un maillon clé pour les robots amenés à opérer parmi des humains (hôpitaux, bureaux, domicile). En automatisant la collecte de connaissances de domaine et la synthèse de scènes plausibles sans base 3D préexistante, D3D-GEN pourrait réduire le travail manuel de conception d'environnements simulés, un frein connu à l'échelle du sim-to-real pour les intégrateurs et laboratoires de recherche en IA incarnée. Reste que la validation du réalisme et de la généralisation à d'autres domaines n'est démontrée que sur trois cas d'usage, ce qui limite pour l'instant la portée des conclusions. Ce travail s'inscrit dans la lignée des efforts récents visant à combler l'écart entre simulation et réalité pour l'IA incarnée, où des bases de données de scènes 3D figées (comme celles utilisées historiquement avec Isaac Sim ou Gazebo) limitent la diversité des scénarios d'entraînement. En s'appuyant sur des agents de recherche et du RAG plutôt que sur des bibliothèques statiques, D3D-GEN se positionne face à d'autres approches de génération procédurale de scènes pour la robotique. L'article ne précise pas de partenariats industriels ni de calendrier de déploiement au-delà du prototype de recherche présenté avec son interface web locale.

RecherchePaper
1 source
HUMEMBR : apprentissage des routines humaines pour la navigation incarnée prédictive
4arXiv cs.RO 

HUMEMBR : apprentissage des routines humaines pour la navigation incarnée prédictive

Des chercheurs ont publié sur arXiv (arXiv:2606.30404, juin 2026) un système baptisé HUMEMBR, Human-Centered Memory for Embodied Robots, conçu pour permettre à un robot incarné de modéliser, mémoriser et exploiter les routines comportementales des individus qu'il côtoie. Le système répond à des requêtes telles que « où se trouve probablement cette personne en ce moment » ou « à quelle heure quitte-t-elle habituellement le bâtiment », en s'appuyant sur un historique d'observations accumulé sur le long terme. HUMEMBR couple une construction mémoire continue à un mécanisme de récupération et d'interrogation parallèle, produisant des représentations structurées des routines humaines interrogeables à la demande. Le système a été validé sur un robot physique déployé dans deux environnements distincts, sans que le papier précise le modèle de plateforme, le nombre de DOF ni les conditions exactes des essais terrain. L'intérêt principal de HUMEMBR réside dans son efficacité computationnelle par rapport aux approches naïves à base de LLM en plein contexte : les auteurs rapportent de meilleures performances sur le raisonnement à long horizon tout en consommant significativement moins de tokens. Pour les intégrateurs de robots de service ou les déployeurs en environnement tertiaire (hôpitaux, entrepôts, bureaux), cela ouvre la voie à des robots capables d'anticiper la position d'un opérateur sans requête GPS ni tag actif, en inférant simplement depuis des patterns observés. C'est un pas vers la résolution du « routine gap », la difficulté à faire raisonner un robot sur des comportements récurrents et non étiquetés, au-delà de la navigation réactive classique. La navigation incarnée guidée par le langage (VLA, NavLLM) est un champ très actif depuis 2023, avec des travaux comme NavGPT, SayNav ou EmbodiedGPT qui explorent l'usage des LLMs comme planificateurs de trajectoire. HUMEMBR se différencie en ciblant explicitement la modélisation comportementale humaine sur la durée, plutôt que la seule compréhension d'instructions à la volée. Aucun partenaire industriel ni calendrier de transfert technologique n'est mentionné dans l'abstract, il s'agit d'une contribution académique, pas d'un produit annoncé. Les prochaines étapes naturelles seraient de tester la robustesse face à des changements de routine imprévus et de quantifier les performances sur des métriques standardisées comme HM3D ou R2R.

RecherchePaper
1 source