Aller au contenu principal
FAM-HRI : interaction humain-robot multimodale assistée par modèle fondation, combinant regard et parole
RecherchearXiv cs.RO 

FAM-HRI : interaction humain-robot multimodale assistée par modèle fondation, combinant regard et parole

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de chercheurs a publié en mars 2025 sur arXiv (référence 2503.16492, troisième révision) FAM-HRI, un framework multimodal d'interaction humain-robot combinant le suivi du regard et la parole via des modèles de fondation. Le système s'appuie sur les lunettes Meta ARIA, un dispositif de recherche léger, pour capturer en temps réel les signaux visuels et vocaux de l'utilisateur. Ces données sont fusionnées par un grand modèle de langage (LLM) qui interprète l'intention de l'utilisateur en la croisant avec le contexte visuel de la scène, permettant au robot d'identifier et manipuler des objets désignés par le regard. Un algorithme dédié détermine l'intervalle temporel de fixation oculaire afin de filtrer le bruit inhérent aux mouvements naturels des yeux. Les auteurs rapportent un "taux de succès élevé" et un "temps d'interaction faible" lors des évaluations expérimentales, sans publier de métriques chiffrées précises dans le résumé, ce qui limitera la comparabilité directe avec d'autres systèmes.

L'enjeu de FAM-HRI dépasse la performance brute : le système cible explicitement les utilisateurs souffrant de handicaps moteurs ou de mobilité réduite, une population pour laquelle les interfaces gestuelles classiques sont inutilisables et les commandes vocales seules insuffisamment précises pour la manipulation spatiale. En fusionnant regard et parole au niveau sémantique via un LLM, l'architecture évite les ambiguïtés typiques des commandes monocanal, comme "prends l'objet" sans désignation claire. C'est un pas concret vers des robots d'assistance utilisables en conditions réelles, où la robustesse à l'imprécision humaine prime sur la performance en environnement contrôlé.

La combinaison regard-parole pour le contrôle robotique n'est pas nouvelle, mais l'intégration de LLMs pour la fusion contextuelle représente une évolution récente, rendue possible par la réduction des coûts d'inférence. Les lunettes Meta ARIA, conçues initialement pour la recherche en réalité augmentée, trouvent ici une application robotique directe. Les concurrents dans l'espace HRI multimodal incluent des travaux issus de CMU, ETH Zurich et d'équipes japonaises comme Preferred Networks et l'AIST. L'ensemble du code et des algorithmes est publié en open source sur GitHub, ce qui facilitera la reproductibilité. Les prochaines étapes naturelles seraient une validation en conditions cliniques ou à domicile, et une extension à des plateformes mobiles au-delà de la manipulation fixe.

Dans nos dossiers

À lire aussi

Perception multimodale, ancrage linguistique, contrôle et saisie d'objets en interaction humain-robot : étude d'ablation
1arXiv cs.RO 

Perception multimodale, ancrage linguistique, contrôle et saisie d'objets en interaction humain-robot : étude d'ablation

Une étude soumise en mai 2025 sur arXiv (référence 2605.00963) présente une analyse par ablation d'un système de manipulation robotique piloté par interaction homme-robot multimodale, appliqué à une tâche de détection et saisie d'objets. Les chercheurs ont ciblé trois modules du pipeline : le modèle de langage chargé d'extraire les actions à partir d'instructions verbales, le système de perception assurant l'ancrage visuel des objets cibles, et le contrôleur gérant l'exécution du mouvement. L'étude compare trois LLM distincts, cinq configurations de perception, et trois contrôleurs, avant de soumettre les meilleures combinaisons à une analyse factorielle croisée en seconde phase. L'objectif déclaré n'est pas de redessiner le pipeline, mais d'isoler la contribution de chaque composant sous un protocole expérimental commun. Cette approche répond à une question directement actionnable pour les intégrateurs et ingénieurs robotiques : quel module optimiser en priorité pour améliorer le taux de succès, et lequel pour réduire le temps d'exécution ? Dans un contexte industriel, ces deux métriques obéissent à des contraintes distinctes selon les postes de travail, et les confondre dans une évaluation globale masque les vrais leviers d'amélioration. La méthodologie par ablation reste encore rare dans les publications de manipulation robotique, où la tendance est d'évaluer un seul composant à la fois, ce qui rend les résultats difficiles à reproduire ou à transposer d'un système à l'autre. Les auteurs précisent que l'analyse vise aussi à orienter les choix d'ingénierie dans les prochaines versions du système. Ce travail s'inscrit dans un effort plus large de la communauté pour rendre opérationnels les pipelines de manipulation guidés par langage hors des environnements contrôlés de laboratoire. Sur le plan concurrentiel, deux écoles s'affrontent actuellement : les modèles unifiés de type VLA (Vision-Language-Action) entraînés à grande échelle, comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, et les pipelines modulaires qui préservent la séparabilité des composants pour faciliter le débogage et l'adaptation sectorielle. L'étude n'annonce pas de déploiement industriel et reste pour l'instant au stade de la validation expérimentale. La prochaine étape logique serait de tester si les gains mesurés en laboratoire résistent au sim-to-real gap, qui demeure le principal obstacle à la mise en production des systèmes de manipulation guidés par instructions en langage naturel.

RecherchePaper
1 source
Modèle de cognition du monde pour l'interaction humain-robot généralisable
2arXiv cs.RO 

Modèle de cognition du monde pour l'interaction humain-robot généralisable

Un article scientifique publié sur arXiv (référence 2607.22999v1) présente WCM, pour World-Cognition Model, un agent robotique conçu pour rendre l'interaction homme-robot aussi fluide que celle qu'offrent déjà les agents conversationnels dans le logiciel. Le système repose sur une architecture baptisée SLAK, acronyme de Sensing, Logic, Action et Knowledge, qui sépare explicitement la perception, le raisonnement, le contrôle moteur et la mémoire. Cette séparation s'appuie sur un runtime asynchrone permettant au raisonnement, au dialogue et à l'exécution de se dérouler en parallèle plutôt que séquentiellement. WCM ajoute un mode d'apprentissage supervisé par l'humain, où l'utilisateur peut enseigner interactivement au robot des tâches longues ou complexes ; ces épisodes d'enseignement, combinés aux exécutions autonomes, sont ensuite convertis en données de supervision par chaîne de raisonnement (chain-of-thought) pour affiner le modèle en continu. Sur neuf tâches réelles d'interaction homme-robot, le système atteint un taux de réussite moyen de 73,8 %, y compris sur des tâches exclues de l'entraînement par chaîne de raisonnement et sur une tâche longue apprise uniquement par démonstration humaine. L'enjeu dépassé ici n'est pas tant la performance brute que la question de la contrôlabilité. Les approches dominantes actuelles, qu'il s'agisse des politiques vision-langage-action (VLA) ou des planificateurs fondés sur des modèles du monde, sont optimisées pour exécuter une instruction, mais laissent peu de visibilité à l'utilisateur sur les raisons d'une action donnée et peu de moyens de corriger ou réorienter le robot en cours de tâche. En proposant un mécanisme explicite de correction et d'enseignement en temps réel, WCM répond à un point de friction identifié par les intégrateurs industriels : un robot qui exécute bien mais s'explique mal reste difficile à déployer et à faire confiance sur des tâches non anticipées. Le travail s'inscrit dans la lignée des recherches récentes sur les modèles de fondation pour la robotique, où des architectures comme les VLA ont cherché à généraliser l'exécution de tâches à partir de démonstrations massives. WCM se positionne en complément plutôt qu'en rupture, en ajoutant une couche cognitive et interactive au-dessus du contrôle bas niveau. Les auteurs ne précisent pas de calendrier de déploiement industriel ni de partenaire commercial ; il s'agit à ce stade d'une publication de recherche, dont la prochaine étape logique serait l'extension à un plus grand nombre de tâches et de plateformes robotiques.

RecherchePaper
1 source
Glance-Say : collaboration homme-robot multimodale et reconnaissance d'intention via un regard soutenu
3arXiv cs.RO 

Glance-Say : collaboration homme-robot multimodale et reconnaissance d'intention via un regard soutenu

Des chercheurs proposent Glance-Say, un cadre d'interaction multimodale associant regard et parole pour la manipulation robotique assistive destinee aux personnes a mobilité réduite. Le système repose sur un algorithme dit de "regard collant" (sticky-glance) qui stabilise la sélection de cible en cumulant conjointement la distance géométrique et l'évidence directionnelle du regard, un mécanisme conçu pour compenser les micro-saccades oculaires et l'ambiguïté sémantique dans des environnements comportant plusieurs objets. Dans ce paradigme, le regard désigne l'objet vise pendant que la commande vocale précise l'action a exécuter, le tout couple a un schéma de contrôle partage en continu qui maintient le bras robotique en état de haute réactivité tout en intégrant un retour humain-dans-la-boucle. Les expériences rapportées affichent un taux de suivi de 0,92 pour des cibles mobiles, une précision de sélection de 0,97 pour des cibles statiques, ainsi qu'une réduction du temps nécessaire pour accomplir les taches, par rapport aux paradigmes d'interaction de référence. Pour l'assistance robotique aux personnes en situation de handicap moteur, ce travail s'attaque a un verrou concret: les interfaces regard-plus-voix existantes échouent souvent des que plusieurs objets similaires sont présents ou que l'utilisateur bouge la tête, forçant des ré-sélections fastidieuses. Une méthode qui stabilise l'intention en temps réel sans capteur exotique, en s'appuyant sur des signaux de regard et de parole standards, rapproche ce type d'interface d'un usage quotidien réaliste plutôt que d'une démonstration de laboratoire en conditions idéales. Pour les intégrateurs travaillant sur des bras assistifs ou des fauteuils robotises, cela ouvre la voie a des contrôles plus naturels, sans dispositifs de pointage dédiés ni entrainement lourd de l'utilisateur. Ce travail s'inscrit dans la lignée des recherches en interaction cerveau-machine et interfaces oculaires pour l'assistance, un champ historiquement freine par le bruit du regard et l'ambiguïté des commandes vocales isolées. Publie sur arXiv en tant que version révisée, l'article ne mentionne pas de partenariat industriel ni de déploiement au-delà du banc d'essai expérimental; les prochaines étapes attendues concernent une validation sur davantage d'utilisateurs et de scenarios de manipulation réels, ainsi qu'une comparaison plus large face aux systèmes commerciaux d'assistance existants.

RecherchePaper
1 source
Évaluation physiologique multimodale de l'interaction physique humain-robot à contacts intensifs en conditions variables
4arXiv cs.RO 

Évaluation physiologique multimodale de l'interaction physique humain-robot à contacts intensifs en conditions variables

Une équipe de chercheurs a publié une étude empirique multimodale portant sur l'interaction physique humain-robot (pHRI) dans des conditions environnementales variables. Le protocole a soumis des opérateurs humains à 18 combinaisons distinctes de température, bruit acoustique et niveau d'éclairement, pendant l'exécution de tâches de traçage en contact direct avec un robot. Les chercheurs ont enregistré simultanément l'activité électrodermale (EDA), l'électromyographie de surface (sEMG), des données d'eye-tracking et des évaluations subjectives du confort. Résultat principal : la performance d'exécution est restée stable à travers toutes les conditions, mais la charge autonomique, mesurée par le niveau de conductance cutanée (SCL), a augmenté significativement avec la température. Les charges physique et cognitive, elles, n'ont pas varié de façon notable. Ces résultats mettent en évidence un mécanisme de compensation physiologique : les opérateurs maintiennent leur niveau de performance en augmentant leur effort biologique pour supprimer l'inconfort thermique, sans que cela ne soit visible dans les métriques de tâche classiques. C'est une distinction critique pour les intégrateurs et les concepteurs de systèmes cobotiques industriels : une évaluation centrée uniquement sur la performance (temps de cycle, taux d'erreur) peut masquer un coût opérateur réel, notamment en environnements chauds ou bruyants. Le fait que le confort perçu ne corrèle pas avec l'erreur de traçage ni le temps d'exécution invalide l'hypothèse courante que la performance se dégrade avec l'inconfort ressenti. Ce travail s'inscrit dans un courant de recherche croissant sur les architectures de contrôle "physiology-aware", où les signaux biologiques temps réel de l'opérateur alimentent la boucle de commande du robot pour adapter son comportement à l'état de charge de l'humain. La robotique collaborative industrielle, notamment dans des secteurs comme l'automobile ou la logistique, où les conditions thermiques et sonores sont variables, constitue le terrain d'application naturel. Des systèmes comme les cobots Universal Robots ou KUKA devront intégrer ce type de feedback pour répondre aux exigences ergonomiques croissantes des régulateurs européens. Les prochaines étapes identifiées par les auteurs incluent le développement de pipelines de traitement de signal adaptatifs capables d'exploiter ces métriques physiologiques en conditions non structurées.

UELes fabricants de cobots européens (KUKA, Universal Robots) et les régulateurs ergonomiques UE sont directement concernés : cette étude démontre que les métriques de performance classiques masquent un coût physiologique réel chez l'opérateur, ce qui invalide les protocoles d'évaluation actuels et anticipe des exigences réglementaires renforcées pour les déploiements cobotiques industriels en Europe.

RecherchePaper
1 source