Aller au contenu principal
Traduction pipeline hybride d'estimation de l'attention pour une IHR adaptative avec une tête robotique expressive
RecherchearXiv cs.RO 

Traduction pipeline hybride d'estimation de l'attention pour une IHR adaptative avec une tête robotique expressive

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche présente dans un article arXiv (soumis fin juillet 2026, référence 2608.00284) un pipeline hybride d'estimation de l'attention visuelle pour l'interaction homme-robot, testé sur une tête robotique expressive basée sur l'écosystème open source InMoov. Le système combine deux couches de perception indépendantes: une couche géométrique rapide qui suit en haute fréquence la position du visage et l'orientation de la tête pour la régulation temporelle, et une couche sémantique s'appuyant sur un modèle vision-langage (VLM) qui analyse les images brutes de la caméra égocentrique du robot pour produire des étiquettes contextuelles (attention portée au robot, usage du téléphone, regard ailleurs). Ces deux flux sont fusionnés par une machine à états finis qui pilote le comportement adaptatif du robot: activation, mise en attente, reprise d'interaction et retour au repos. Le dispositif a été évalué avec 10 participants sur 40 essais, répartis entre une condition de référence et une condition d'interaction adaptative avec distraction.

Cette démonstration illustre une tendance de fond dans la robotique sociale: le passage d'une perception purement géométrique, rapide mais limitée au suivi de pose, vers des architectures hybrides qui ajoutent une couche de compréhension contextuelle via VLM sans sacrifier la réactivité temps réel nécessaire à une interaction fluide. Pour les intégrateurs travaillant sur des robots d'accueil, d'assistance ou éducatifs, l'apport principal est méthodologique plutôt que spectaculaire: les auteurs montrent que les signaux géométriques et sémantiques apportent une information non redondante, ce qui justifie l'architecture à deux couches plutôt qu'un unique modèle VLM plus lourd et plus lent. Le résultat reste toutefois un prototype de recherche à faible échelle, avec des essais contrôlés en laboratoire et non un déploiement en conditions réelles.

InMoov, plateforme de tête et de main robotiques open source lancée par le designer français Gaël Langevin il y a plus d'une décennie, sert ici de base matérielle low-cost pour prototyper des comportements d'interaction adaptative habituellement réservés à des plateformes commerciales fermées. L'article s'inscrit dans la lignée des travaux combinant perception classique et modèles de fondation multimodaux pour l'HRI, un axe de recherche actif face à des systèmes concurrents intégrant directement la compréhension de scène dans des architectures VLA plus larges. Les auteurs ne mentionnent pas de suite commerciale ou de partenariat industriel annoncé à ce stade.

Impact France/UE

Impact indirect: la plateforme materielle InMoov utilisee dans l'etude a ete creee par le designer francais Gael Langevin, mais aucune institution ou entreprise francaise n'est impliquee dans cette recherche.

Dans nos dossiers

À lire aussi

SegDiff : diffusion de trajectoires segmentées pour une manipulation robotique cohérente et adaptative
1arXiv cs.RO 

SegDiff : diffusion de trajectoires segmentées pour une manipulation robotique cohérente et adaptative

SegDiff, présenté dans un article déposé sur arXiv (2607.11027v1), est une nouvelle politique visuomotrice en boucle fermée pour l'apprentissage par imitation en robotique manipulation. La méthode découpe les démonstrations humaines en segments de mouvement délimités par des keyposes (poses clés), puis apprend à prédire la trajectoire continue reliant l'état courant à la prochaine keypose. Elle s'appuie sur des modèles de diffusion combinés à l'inversion DDIM pour introduire un mécanisme appelé Dynamic Temporal Ensembling, conçu pour répondre efficacement aux environnements dynamiques et lisser les discontinuités provoquées par un échantillonnage multi-modal incohérent. Les auteurs rapportent des gains de performance significatifs par rapport aux approches existantes, testés à la fois en simulation et sur des scénarios réels de manipulation robotique. L'enjeu technique visé est concret : les méthodes actuelles d'apprentissage par imitation doivent choisir entre deux limites. La prédiction continue à court horizon accumule des erreurs qui se propagent au fil de l'exécution et gère mal les distributions d'actions multi-modales (plusieurs façons valides d'atteindre un objectif). Les méthodes par keyposes évitent ce problème mais nécessitent un planificateur externe pour relier les points clés, ce qui casse le temps réel. SegDiff prétend combiner les deux avantages, hypothèse centrale pour l'industrie : produire une politique robotique capable de raisonner sur des horizons temporels longs tout en restant réactive et stable, sans dépendance à un module de planification séparé, un point clé pour les intégrateurs qui cherchent des politiques déployables directement sur du matériel. Le travail s'inscrit dans la lignée des politiques de diffusion appliquées à la robotique (type Diffusion Policy), déjà largement adoptées comme alternative aux transformeurs d'action classiques. Il ne s'agit pas ici d'un produit commercial ni d'un déploiement industriel : c'est un article de recherche fraîchement publié, sans affiliation industrielle mentionnée dans l'abstract, et ses résultats restent à confirmer par la communauté et par des essais indépendants avant toute reprise en conditions de production.

RecherchePaper
1 source
GAIT : estimation proprioceptive de l'état d'un robot à pattes par attention sur tokens inertiels
2arXiv cs.RO 

GAIT : estimation proprioceptive de l'état d'un robot à pattes par attention sur tokens inertiels

Une équipe de chercheurs a publié sur arXiv (2606.14160) une nouvelle méthode d'estimation d'état proprioceptive pour robots à pattes, baptisée GAIT. L'approche repose sur une tokenisation inertielle-jambe (Inertial-Leg, IL) couplée à un réseau d'attention : plutôt que de concaténer l'ensemble des données capteurs en un seul vecteur plat, l'architecture représente les mesures inertielles et les mesures par jambe comme des tokens distincts, puis utilise un mécanisme d'attention pour pondérer dynamiquement chaque source selon les conditions de contact courantes. La méthode a été validée sur un robot quadrupède Unitree Go1, sur des terrains encombrés de débris absents de la simulation d'entraînement, et sur des allures (gait patterns) non présentées lors de l'apprentissage. L'enjeu de GAIT est de résoudre un problème central des estimateurs à pattes : la fiabilité des mesures de cinématique directe dépend du contact effectif du pied avec le sol. Les estimateurs classiques "contact-aided" contournent ce problème via un module de détection de contact explicite et l'hypothèse d'un appui stationnaire, ce qui les rend fragiles sur terrains irréguliers ou lors de transitions d'allure. GAIT apprend ce comportement de repondération directement depuis les données, sans estimateur de contact dédié, éliminant une source d'erreur en cascade. Les résultats montrent une supériorité sur les estimateurs d'apprentissage existants pour des allures non vues, ainsi qu'une amélioration par rapport aux méthodes modèles contact-aided, confirmant que les architectures à attention peuvent réduire le gap sim-to-real sur l'estimation proprioceptive bas-niveau. L'estimation d'état proprioceptive reste un défi persistant en robotique à pattes : les filtres de Kalman étendu (EKF) et variantes invariantes dominent en production chez Boston Dynamics et Unitree, mais peinent sur terrains non structurés. Les approches d'apprentissage antérieures traitaient généralement les capteurs comme un vecteur plat homogène, sans différenciation structurelle entre inertielles et cinématiques. GAIT s'inscrit dans la tendance 2024-2026 d'appliquer des mécanismes d'attention aux données robotiques bas-niveau, une direction convergente avec les architectures VLA (Vision-Language-Action) pour la commande motrice. Le code n'est pas encore publié ; la prochaine étape naturelle serait une validation sur plateformes bipèdes telles que l'Unitree H1 ou le Boston Dynamics Atlas, où la phase de vol rend l'estimation d'état encore plus critique.

RecherchePaper
1 source
Filtrage adaptatif de Kalman basé sur les résidus pour l'estimation d'état des robots à pattes
3arXiv cs.RO 

Filtrage adaptatif de Kalman basé sur les résidus pour l'estimation d'état des robots à pattes

Des chercheurs proposent une nouvelle méthode d'adaptation en ligne pour l'estimation d'état des robots à pattes, publiée sur arXiv (2608.02316) début août 2026. Le filtre de Kalman est l'outil standard pour estimer la position et la vitesse du corps flottant d'un robot en fusionnant plusieurs capteurs, mais le réglage de ses paramètres de bruit (matrices de covariance de processus Q et de mesure R) exige une expertise pointue et reste figé face aux changements de démarche ou d'environnement. L'équipe introduit une adaptation basée sur le résidu du filtre et l'innovation, intégrée dans un filtre de Kalman étendu invariant (InEKF) qui fusionne données IMU et cinématique des pattes. Les tests, menés en intérieur et en extérieur sur un quadrupède Unitree Go2, montrent qu'adapter uniquement R suffit à améliorer la précision de 25 % en trot par rapport à un InEKF réglé de façon fixe, tout en égalant les performances d'une approche concurrente basée sur des capteurs de force au sol. Pour l'industrie robotique, l'enjeu dépasse la seule performance chiffrée: cette méthode supprime le besoin de capteurs de force plantaire, souvent coûteux ou absents sur des plateformes commerciales comme le Go2, et réduit la dépendance à un réglage manuel expert lors du déploiement sur de nouveaux terrains ou de nouvelles démarches. Pour les intégrateurs qui cherchent à faire tourner des robots à pattes hors laboratoire, sur des sols irréguliers ou en extérieur, un estimateur d'état qui s'auto-ajuste en temps réel limite les échecs de contrôle liés à un mauvais calage des filtres, un problème récurrent qui freine le passage des démonstrations en intérieur vers des déploiements réels plus robustes. L'estimation d'état par filtre de Kalman est un pilier du contrôle basé modèle en robotique à pattes depuis des années, avec l'InEKF comme évolution reconnue pour sa cohérence géométrique. Les approches précédentes s'appuyaient largement sur des capteurs de force additionnels pour corriger les dérives, une solution matérielle plus lourde. En s'appuyant uniquement sur IMU et cinématique, cette adaptation résiduelle s'inscrit dans une tendance plus large vers des pipelines de perception moins dépendants d'instrumentation spécialisée, avec des validations attendues sur d'autres démarches et plateformes bipèdes ou humanoïdes.

RecherchePaper
1 source
Étude de cas sur l'acceptation d'une tête robotique humanoïde utilisée dans trois espaces publics
4arXiv cs.RO 

Étude de cas sur l'acceptation d'une tête robotique humanoïde utilisée dans trois espaces publics

Une équipe de recherche a testé en conditions réelles une tête robotique humanoïde interactive dans trois lieux publics allemands : un office de tourisme, une bibliothèque municipale et l'accueil d'une administration du bâtiment (Bauamt). Le robot y a fonctionné en continu pendant plusieurs jours, engageant la conversation avec les visiteurs dans leur propre langue grâce à un pipeline de traitement du langage naturel couplé à un moteur de simulation émotionnelle, qui génère des réponses verbales multimodales enrichies d'expressions faciales. Les chercheurs ont mesuré l'acceptation des usagers via le questionnaire TAM2 (Technology Acceptance Model), un outil standard évaluant l'utilité perçue et la facilité d'usage. Résultat global : les utilisateurs se sont montrés motivés à interagir avec le robot et l'ont jugé plutôt utile et facile à prendre en main, quel que soit le site. Mais un usager sur cinq a trouvé le temps de réponse du système trop lent, ce qui nuisait à la fluidité du dialogue. L'enseignement principal dépasse la simple démonstration technique : l'acceptation d'un robot humanoïde conversationnel dépend fortement du contexte d'usage, pas seulement de ses capacités. L'office de tourisme et la bibliothèque, lieux où l'interaction est perçue comme légitime et sans enjeu, se sont révélés bien plus favorables que l'accueil administratif, où la volonté d'engager la conversation était nettement plus faible. Pour les intégrateurs et décideurs qui envisagent de déployer des robots d'accueil ou d'assistance multilingue, ce résultat suggère de prioriser les environnements à faible friction sociale plutôt que les guichets administratifs, et de traiter la latence de réponse comme un frein d'adoption aussi critique que la précision linguistique elle-même. Ce travail s'inscrit dans la lignée des recherches en interaction homme-robot social, où l'acceptation en conditions réelles reste plus rarement documentée que les démonstrations en laboratoire. Contrairement aux plateformes humanoïdes orientées tâches industrielles ou logistiques, ce projet cible l'accueil du public et la médiation linguistique. Les auteurs identifient la réduction du temps de réponse comme priorité pour les développements futurs, condition jugée nécessaire avant d'envisager un déploiement plus large de ce type de tête robotique interactive dans d'autres services publics.

UEL'étude a été menée dans des lieux publics allemands (office de tourisme, bibliothèque, administration du bâtiment), fournissant des enseignements directement applicables au déploiement de robots d'accueil dans les services publics européens.

RecherchePaper
1 source