Aller au contenu principal
Pense quand c'est important : raisonnement VLM conditionnel pour la navigation sociale avec des politiques RL
FR/EU ecosystemearXiv cs.RO 

Pense quand c'est important : raisonnement VLM conditionnel pour la navigation sociale avec des politiques RL

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Le laboratoire à l'origine de ce papier arXiv (référence 2607.10991v1) présente HUMA, une architecture hybride de navigation sociale pour robots mobiles qui combine une politique d'apprentissage par renforcement (RL) avec un modèle vision-langage (VLM). Le principe : la politique RL, rapide et réactive, gère les déplacements courants à faible densité humaine, tandis qu'un VLM post-entraîné prend le relais uniquement quand une personne entre dans la zone de proximité sensible du robot. Évalué sur les benchmarks Social-MP3D et Social-HM3D, HUMA améliore le taux de réussite des tâches de 20% et 3% respectivement par rapport aux meilleures méthodes existantes, tout en réduisant significativement les violations d'espace personnel et les collisions avec des humains. Le système a aussi été testé en conditions réelles sur le robot mobile Mirokaï, conçu par la start-up française Enchanted Tools.

Cette approche répond à un compromis central dans la navigation sociale robotique : les politiques RL sont rapides mais peinent à généraliser à des scénarios sociaux complexes, tandis que les VLM offrent un raisonnement sémantique plus fin mais restent trop lents pour un déploiement temps réel. En activant le VLM seulement de façon conditionnelle, HUMA évite l'écueil du tout-VLM (latence, coût de calcul) sans sacrifier la finesse de compréhension sociale dans les moments qui comptent le plus, c'est-à-dire l'interaction rapprochée avec des humains. Pour les intégrateurs et décideurs déployant des robots de service en environnement partagé (hôpitaux, bureaux, commerces), cela suggère une voie concrète pour rendre les VLM exploitables en production sans réécrire toute la pile de contrôle.

Le travail s'inscrit dans la tendance récente consistant à substituer ou hybrider les VLM aux politiques RL classiques pour améliorer le raisonnement sémantique en navigation, une piste explorée notamment par des architectures VLA comme Pi-0 ou GR00T N2 dans d'autres contextes robotiques. Les auteurs ont mené des études d'ablation détaillées pour valider chaque composant architectural, et la démonstration sur Mirokaï, robot déployé par Enchanted Tools, ancre l'approche au-delà de la simulation, dans un cas d'usage réel de robot d'accueil et d'assistance en environnement humain.

Impact France/UE

La validation en conditions réelles de HUMA sur le robot Mirokaï, conçu par la start-up française Enchanted Tools, ancre cette avancée de recherche en navigation sociale dans un produit robotique européen déployé en environnement humain.

À lire aussi

Apprentissage par renforcement avec mélange d'experts pour la locomotion quadrupède tolérante aux pannes
1arXiv cs.RO 

Apprentissage par renforcement avec mélange d'experts pour la locomotion quadrupède tolérante aux pannes

Des chercheurs du Dynamic Legged Systems Lab de l'Istituto Italiano di Tecnologia (IIT) proposent sur arXiv (prépublication 2506.25965) une architecture de contrôle modulaire pour robots à pattes conçue pour maintenir la locomotion en cas de panne d'actionneur. Le système repose sur un mélange d'experts (Mixture-of-Experts, MoE) piloté par apprentissage par renforcement : un module de diagnostic identifie en temps réel le type de défaillance (joint bloqué, couple réduit, actionneur hors service), puis active l'expert spécialisé correspondant parmi plusieurs politiques de contrôle distinctes, chacune entraînée pour un mode de panne spécifique. Les expériences menées dans le simulateur IsaacLab montrent que ces politiques modulaires surpassent systématiquement des politiques monolithiques de taille comparable sur l'ensemble des scénarios de panne évalués. L'architecture conserve de surcroît des performances compétitives avec une capacité réseau significativement réduite, un critère déterminant pour les plateformes embarquées à ressources de calcul limitées, notamment en contexte d'exploration planétaire. Ce résultat adresse un angle mort persistant du déploiement hors-laboratoire des robots à pattes : la robustesse aux défaillances matérielles en cours de mission. Les politiques monolithiques entraînées par RL, qui ont produit des performances remarquables sur terrain accidenté (ANYmal d'ETH Zurich, Spot de Boston Dynamics, MIT Cheetah), supposent implicitement l'intégrité de l'ensemble des actionneurs. Injecter explicitement l'état diagnostiqué de panne dans la boucle de décision permet à chaque expert de se spécialiser sur un sous-espace comportemental bien délimité, ce qui explique leur supériorité même à capacité réduite. Pour un intégrateur ou un concepteur de mission, l'architecture MoE trace une voie concrète vers des robots capables de poursuivre une mission malgré une défaillance partielle, sans intervention humaine ni recalibration à distance. L'IIT est l'un des laboratoires européens de référence en robotique à pattes, à l'origine de la lignée hydraulique HyQ et HyQReal. La cible applicative explicitement déclarée par les auteurs est l'exploration planétaire, domaine où l'ESA et la NASA cherchent activement des solutions de mobilité résiliente pour des rovers de nouvelle génération. Les approches concurrentes, notamment les politiques adaptatives basées sur l'estimation d'état développées par le Robotics Systems Lab de l'ETH Zurich sur ANYmal, n'exploitent pas aussi directement l'information de diagnostic pour router dynamiquement vers des experts dédiés par mode de panne. Le code est publié en open source sur GitHub (dépôt iit-DLSLab/fault-locomotion-isaaclab) sous IsaacLab, ce qui facilite la reproductibilité et l'adoption par la communauté. Prochaine étape attendue : validation sur plateforme physique, les résultats actuels étant entièrement en simulation.

UEL'IIT, laboratoire européen de référence en robotique à pattes, publie une architecture MoE open source pour la locomotion tolérante aux pannes, offrant une base directement exploitable pour les programmes de rovers résilients de l'ESA.

FR/EU ecosystemePaper
1 source
Teachy Mini : développement et évaluation préliminaire d'un robot social génératif basé sur les connaissances pour l'enseignement supérieur
2arXiv cs.RO 

Teachy Mini : développement et évaluation préliminaire d'un robot social génératif basé sur les connaissances pour l'enseignement supérieur

Une équipe de recherche a développé Teachy Mini, un système de tutorat robotique construit sur la plateforme Reachy Mini, conçu selon des principes de "knowledge-based design" (KBD) censés encadrer le comportement des robots sociaux génératifs (GSR) alimentés par des grands modèles de langage. Concrètement, les chercheurs ont implémenté ces exigences KBD via trois mécanismes techniques : du system prompting, de la génération augmentée par récupération (RAG) et une orchestration de prompts avec état (stateful). Le système a été testé lors d'une étude préliminaire impliquant 24 participants, répartis entre une session de tutorat sur les méthodologies de recherche guidée par Teachy Mini et une session équivalente avec une version témoin ne suivant pas les principes KBD. Résultat mesuré par vérification de manipulation : Teachy Mini a utilisé de façon nettement plus systématique la personnalisation, des explications ancrées sur les supports de cours, le questionnement socratique, le soutien affectif et un feedback adapté à l'apprenant. Ce travail répond à un problème central pour le déploiement de robots sociaux en éducation supérieure : le risque que des LLM embarqués diffusent de la désinformation, manquent de transparence ou renforcent par erreur des réponses incorrectes d'étudiants. L'étude montre qu'un cadrage explicite par conception peut modifier objectivement le comportement du robot perçu comme responsable, sans pour autant se traduire, à ce stade, par un gain significatif d'acceptation, de motivation intrinsèque ou d'efficacité d'apprentissage mesurée directement. Des analyses exploratoires suggèrent toutefois un effet positif sur les gains d'apprentissage objectifs une fois les préférences des apprenants prises en compte, un signal encourageant mais à confirmer sur un échantillon plus large. Le choix de la plateforme Reachy Mini n'est pas anodin : elle est développée par Pollen Robotics, société française rachetée par Hugging Face en 2025, positionnée sur la robotique sociale open source à bas coût plutôt que sur l'humanoïde industriel. Ce travail s'inscrit dans la continuité d'exigences KBD définies dans des travaux antérieurs des mêmes auteurs, et ouvre la voie à des études de plus grande ampleur pour valider si un tutorat robotique responsable peut réellement améliorer l'apprentissage à l'échelle, au delà du seul comportement perçu.

UELe robot utilisé, Reachy Mini, est développé par Pollen Robotics, entreprise française rachetée par Hugging Face en 2025, ce qui met en valeur l'écosystème robotique social français dans la recherche académique internationale.

FR/EU ecosystemePaper
1 source
Un bras robotique façon pieuvre pense avec ses ventouses pour explorer les fonds marins
3New Atlas Robotics 

Un bras robotique façon pieuvre pense avec ses ventouses pour explorer les fonds marins

Des chercheurs de l'Institut italien de technologie (IIT) ont présenté un bras robotique biomimétique inspiré de la pieuvre, conçu pour l'exploration des fonds marins. Contrairement aux systèmes actuels, qui reposent sur des mouvements préprogrammés, une architecture rigide et un processeur central unique, ce dispositif délègue le traitement de l'information directement aux ventouses : chaque ventouse embarque ses propres capteurs et une capacité de calcul locale, lui permettant d'interagir avec son environnement sans attendre les instructions d'un cerveau central. L'enjeu est significatif pour la robotique sous-marine. Les environnements océaniques combinent courants variables, faible visibilité et topographies imprévisibles, trois facteurs qui mettent en échec les architectures de contrôle centralisées classiques. En distribuant l'intelligence au niveau des effecteurs, l'approche de l'IIT réduit la latence de réaction et rend le système intrinsèquement plus résilient aux perturbations locales. C'est une validation concrète de l'intelligence incarnée (embodied intelligence) à l'échelle d'un organe préhensile, un paradigme que la communauté robotique théorise depuis des années sans déploiement probant en milieu réel non contrôlé. L'IIT est l'un des laboratoires européens les plus actifs en soft robotics, avec une longue tradition de recherche sur les robots inspirés des invertébrés marins. La pieuvre sert de modèle depuis près de 500 millions d'années d'évolution : neuf cerveaux (un central, huit dans les bras), une structure entièrement déformable, et une capacité d'adaptation sensorimotrice sans équivalent. Sur le plan concurrentiel, ce travail se positionne face aux approches rigides de Woods Hole Oceanographic Institution ou aux ROV conventionnels, et ouvre une voie distincte de celle des bras industriels sous-marins d'acteurs comme Schilling Robotics.

UEL'IIT (Italie) confirme son leadership européen en soft robotics biomimétique et positionne l'UE à la frontière de l'intelligence incarnée distribuée, un paradigme directement transférable aux bras manipulateurs de robots humanoïdes et aux systèmes physiques adaptatifs.

FR/EU ecosystemePaper
1 source
Le Fil selon un robot social : enrichir le dialogue humain-robot avec des modèles vision-langage
4arXiv cs.RO 

Le Fil selon un robot social : enrichir le dialogue humain-robot avec des modèles vision-langage

Selon un article publié sur arXiv (2607.16318v1, juillet 2026), une équipe de recherche a testé l'intégration d'un modèle de langage visuel (VLM) sur un robot social Pepper, produit historiquement développé par Aldebaran puis SoftBank Robotics. Le système combine un modèle de langage de Mistral AI avec des capacités de perception visuelle, permettant au robot d'observer non seulement les paroles de son interlocuteur mais aussi son comportement et le contexte de la scène pendant un dialogue humain-robot. Les chercheurs ont mesuré l'impact de cet ajout d'information visuelle sur le temps de réponse du robot, en comparant plusieurs configurations de modèles. Résultat principal: l'ajout du contexte visuel n'augmente que modérément la latence de réponse, tout en enrichissant significativement la compréhension de la situation par le robot, notamment sur les éléments non verbaux de l'échange. Cette expérimentation touche à un problème central pour les robots sociaux déployés en environnement réel, à l'accueil, en médiation ou en assistance: comprendre les codes sociaux implicites sans que l'utilisateur ait à tout formuler explicitement. C'est aussi un signal pour les intégrateurs et décideurs européens: le choix d'un modèle Mistral AI, hébergé en Europe, permet de respecter le RGPD sans dépendre de fournisseurs américains ou chinois, un argument de poids pour des déploiements dans des administrations, hôpitaux ou établissements publics soumis à des contraintes réglementaires strictes. L'étude reste toutefois à un stade préliminaire, avec un nombre limité d'interactions testées, loin d'une validation à grande échelle. Le choix de Pepper, robot social lancé il y a plus d'une décennie et longtemps utilisé dans la recherche en interaction humain-robot, s'inscrit dans la continuité des travaux sur l'intelligence conversationnelle embarquée. Face à des architectures VLA plus orientées manipulation physique comme GR00T N2 ou Helix, cette approche cible spécifiquement le dialogue social et la compréhension contextuelle plutôt que l'action motrice. Le recours à Mistral AI illustre aussi la montée en puissance d'une offre souveraine européenne en IA, alternative crédible à OpenAI ou Google dans des cas d'usage sensibles aux données. Les auteurs annoncent vouloir approfondir ces travaux avec des scénarios d'interaction plus complexes.

UEL'utilisation d'un modèle Mistral AI héberge en Europe pour ce robot social illustre une alternative souveraine conforme au RGPD, pertinente pour des déploiements dans les administrations et hôpitaux français et européens.

FR/EU ecosystemePaper
1 source