Aller au contenu principal
Robot réceptionniste à tête humanoïde articulée pour interaction humaine naturelle
RecherchearXiv cs.RO 

Robot réceptionniste à tête humanoïde articulée pour interaction humaine naturelle

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche présente dans une publication arXiv (juillet 2026) une tête humanoïde articulée conçue spécifiquement pour un rôle de robot réceptionniste. Le système compte 21 degrés de liberté (DoF), répartis entre des mécanismes dédiés à la bouche, aux yeux, aux sourcils et au cou, le tout recouvert d'une peau en silicone réaliste destinée à reproduire une apparence et des expressions humaines crédibles. Côté logiciel, l'architecture combine plusieurs modèles spécialisés : SCRFD, ArcFace et ByteTrack pour la reconnaissance et le suivi des visages, associés à Llama pour le traitement du langage naturel et à Whisper pour la reconnaissance vocale. L'ensemble fonctionne en temps réel et intègre une fonction de ré-identification permettant au robot de reconnaître une personne déjà rencontrée. Une étude utilisateur a mesuré quantitativement les capacités conversationnelles et de ré-identification du système, tandis que son expressivité émotionnelle et sa ressemblance humaine ont été évaluées séparément, obtenant un score moyen de similarité humaine de 4,13 sur 5.

Ce travail illustre une tendance de fond dans la robotique sociale : la course ne se joue plus seulement sur la mobilité ou la manipulation, comme chez les humanoïdes industriels type Figure 03 ou Optimus, mais aussi sur l'interaction faciale fine, jugée déterminante pour l'acceptabilité dans des rôles d'accueil, d'éducation ou de service. Un score de 4,13/5 en similarité humaine, obtenu via une étude utilisateur et non une simple démonstration vidéo, constitue une donnée relativement solide face à l'inflation habituelle de communiqués promettant un réalisme "sans précédent". Pour les intégrateurs et décideurs B2B envisageant des déploiements en accueil ou en relation client, ce type de plateforme à 21 DoF avec pile logicielle ouverte (Llama, Whisper) montre qu'une expressivité crédible reste accessible sans recourir à des architectures propriétaires fermées.

Le développement de têtes robotiques expressives répond à des limites connues du secteur : coûts élevés, complexité mécanique et faible adaptabilité des solutions existantes à des environnements variés. Contrairement aux humanoïdes généralistes de grande taille conçus pour la logistique ou l'industrie, cette approche cible spécifiquement l'interaction sociale localisée, un segment où des acteurs comme Enchanted Tools ou Pollen Robotics explorent également des pistes d'expressivité et d'accueil, sans toutefois atteindre le même niveau de granularité faciale. Les auteurs ne précisent pas encore de calendrier de commercialisation ni de site pilote concret, l'étude restant à ce stade au niveau de la validation en laboratoire.

À lire aussi

ZeroWBC : apprentissage de l'interaction naturelle corps entier pour humanoïdes à partir de données égocentrées humaines
1arXiv cs.RO 

ZeroWBC : apprentissage de l'interaction naturelle corps entier pour humanoïdes à partir de données égocentrées humaines

Une équipe de recherche a publié sur arXiv (référence 2603.09170v2) ZeroWBC, un cadre d'apprentissage du contrôle corporel complet pour robots humanoïdes qui se passe entièrement de données de télé-opération. Le système apprend à partir de vidéos égocentrées humaines -- c'est-à-dire filmées du point de vue d'un opérateur -- associées à des annotations de mouvement corps-entier et de texte. Concrètement, une image initiale prise en vue subjective est combinée à une instruction en langage naturel ; un modèle vision-langage (VLM) affiné génère alors des tokens de mouvement humain futur, qui sont décodés en trajectoires continues et retargetés vers le robot humanoïde. Ces mouvements de référence, accompagnés des trajectoires de la racine et des parties clés du corps, alimentent ensuite une politique de suivi de mouvement interactif. Les expériences ont été conduites sur le robot Unitree G1, un humanoïde compact commercialisé à environ 16 000 dollars. L'apport central de ZeroWBC réside dans l'élimination du coût de collecte des données de télé-opération, traditionnellement un verrou majeur pour l'apprentissage du contrôle corps-entier à grande échelle. En exploitant le stock immense de vidéos humaines égocentrées déjà disponibles, la méthode ouvre un paradigme de scalabilité que les approches par démonstration robotique directe ne peuvent pas égaler facilement. L'introduction d'une récompense de suivi orientée interaction -- qui priorise l'alignement global des trajectoires tout en préservant la naturalité du mouvement -- tente de combler le gap entre génération de gestes plausibles et exécution physiquement cohérente. C'est un résultat de recherche académique, pas un produit déployé en production : les vidéos présentées montrent des comportements variés en scène statique, mais les conditions réelles d'un environnement industriel dynamique n'ont pas été testées. ZeroWBC s'inscrit dans un courant plus large de méthodes "zéro-démonstration robot" qui cherchent à transférer la richesse des données humaines vers des systèmes incarnés, à l'instar des travaux sur les politiques visuomotrices à base de VLA (Vision-Language-Action). Sur le terrain concurrent, des approches comme ACT, UMI ou les pipelines de diffusion de Physical Intelligence (Pi-0) misent encore largement sur la télé-opération directe ou les données simulées. Unitree, constructeur chinois dont le G1 est l'une des plateformes humanoïdes les plus accessibles du marché, bénéficie ici d'une visibilité croissante comme banc d'essai académique de référence. Les prochaines étapes naturelles seraient d'étendre ZeroWBC à des scènes dynamiques, de tester la robustesse en dehors du labo, et d'évaluer si le sim-to-real tient face à la variabilité réelle des interactions objet-robot.

RechercheOpinion
1 source
Modèle de cognition du monde pour l'interaction humain-robot généralisable
2arXiv cs.RO 

Modèle de cognition du monde pour l'interaction humain-robot généralisable

Un article scientifique publié sur arXiv (référence 2607.22999v1) présente WCM, pour World-Cognition Model, un agent robotique conçu pour rendre l'interaction homme-robot aussi fluide que celle qu'offrent déjà les agents conversationnels dans le logiciel. Le système repose sur une architecture baptisée SLAK, acronyme de Sensing, Logic, Action et Knowledge, qui sépare explicitement la perception, le raisonnement, le contrôle moteur et la mémoire. Cette séparation s'appuie sur un runtime asynchrone permettant au raisonnement, au dialogue et à l'exécution de se dérouler en parallèle plutôt que séquentiellement. WCM ajoute un mode d'apprentissage supervisé par l'humain, où l'utilisateur peut enseigner interactivement au robot des tâches longues ou complexes ; ces épisodes d'enseignement, combinés aux exécutions autonomes, sont ensuite convertis en données de supervision par chaîne de raisonnement (chain-of-thought) pour affiner le modèle en continu. Sur neuf tâches réelles d'interaction homme-robot, le système atteint un taux de réussite moyen de 73,8 %, y compris sur des tâches exclues de l'entraînement par chaîne de raisonnement et sur une tâche longue apprise uniquement par démonstration humaine. L'enjeu dépassé ici n'est pas tant la performance brute que la question de la contrôlabilité. Les approches dominantes actuelles, qu'il s'agisse des politiques vision-langage-action (VLA) ou des planificateurs fondés sur des modèles du monde, sont optimisées pour exécuter une instruction, mais laissent peu de visibilité à l'utilisateur sur les raisons d'une action donnée et peu de moyens de corriger ou réorienter le robot en cours de tâche. En proposant un mécanisme explicite de correction et d'enseignement en temps réel, WCM répond à un point de friction identifié par les intégrateurs industriels : un robot qui exécute bien mais s'explique mal reste difficile à déployer et à faire confiance sur des tâches non anticipées. Le travail s'inscrit dans la lignée des recherches récentes sur les modèles de fondation pour la robotique, où des architectures comme les VLA ont cherché à généraliser l'exécution de tâches à partir de démonstrations massives. WCM se positionne en complément plutôt qu'en rupture, en ajoutant une couche cognitive et interactive au-dessus du contrôle bas niveau. Les auteurs ne précisent pas de calendrier de déploiement industriel ni de partenaire commercial ; il s'agit à ce stade d'une publication de recherche, dont la prochaine étape logique serait l'extension à un plus grand nombre de tâches et de plateformes robotiques.

RecherchePaper
1 source
Politiques hiérarchiques à partir de signaux verbaux et égocentrés pour l'interaction naturelle homme-robot
3arXiv cs.RO 

Politiques hiérarchiques à partir de signaux verbaux et égocentrés pour l'interaction naturelle homme-robot

Des chercheurs ont présenté EDITH (Egocentric Data for Intent from The Human), un cadre de contrôle robotique qui intègre les signaux non-verbaux humains, notamment le regard et la vue égo-centrique, comme entrées directes d'une politique de robot, en complément des instructions verbales. Le système repose sur des lunettes intelligentes portées par l'opérateur, qui diffusent en temps réel un flux vidéo à la première personne, le point de regard (gaze tracking) et la parole transcrite automatiquement en texte. Une architecture hiérarchique à deux niveaux traite ces signaux : un module haut niveau infère l'intention et génère une séquence de sous-tâches, chacune représentée par une instruction textuelle fine associée à une image-clé (keyframe) ancrant l'objet cible dans la scène ; un module bas niveau exécute ensuite ces sous-tâches sur le robot physique. Les expériences sur des tâches interactives montrent qu'EDITH réagit à des signaux non-verbaux exprimés très brièvement et réduit significativement l'effort de communication par rapport à une interface purement textuelle. L'enjeu industriel est direct : les politiques robotiques actuelles reposent exclusivement sur des commandes linguistiques explicites, forçant l'opérateur à verbaliser chaque intention, une friction significative dans les environnements collaboratifs et sur les lignes d'assemblage. En capturant le geste et le regard comme canaux implicites, EDITH rapproche l'interaction humain-robot des modes naturels de collaboration entre humains et ouvre une voie vers des manipulateurs plus accessibles à des opérateurs non formés. La représentation en keyframe ancre l'intention dans la scène réelle plutôt que dans un espace de tokens abstrait, adressant partiellement le gap entre instructions ambiguës et exécution physique précise, une limitation bien documentée des approches VLA (Vision-Language-Action) à entrée textuelle seule. EDITH s'inscrit dans un mouvement plus large de politiques multimodales pour la manipulation robotique, aux côtés de travaux comme Pi-0 de Physical Intelligence, OpenVLA ou GR00T N2 de NVIDIA, qui combinent vision et langage mais conservent le texte comme unique interface d'intention. L'originalité d'EDITH réside dans l'exploitation du gaze tracking comme signal de sélection d'objet implicite, une approche étudiée en recherche mais rarement intégrée dans une politique bout-en-bout déployée sur robot réel. Le travail, publié en preprint sur arXiv (2606.10276), inclut le code source et des vidéos de démonstration sur robot physique, mais ne mentionne aucun partenaire industriel ni timeline de déploiement commercial. Les prochaines étapes naturelles concerneront la robustesse du gaze tracking en environnement industriel bruité et la validation sur des tâches d'assemblage plus complexes.

RechercheOpinion
1 source
IA incarnée : perception et action pour l'exécution de tâches par un robot humanoïde en construction
4arXiv cs.RO 

IA incarnée : perception et action pour l'exécution de tâches par un robot humanoïde en construction

Des chercheurs publient sur arXiv (référence 2608.01600v1, soumis début août 2026) un système de perception et d'action destiné aux robots humanoïdes pour l'exécution de tâches de construction. L'architecture combine deux réseaux de neurones profonds : Humanoid-PoseNet, qui capture les postures d'un ouvrier lors d'une démonstration et les traduit en poses mécaniquement réalisables pour un robot humanoïde, puis Humanoid-ActionNet, qui apprend à partir de ces poses traduites les actions que le robot peut réellement exécuter. Testé sur huit tâches liées au chantier, le système atteint une erreur moyenne de suivi de mouvement de 82,45 mm en MPJPE (Mean Per Joint Position Error, l'écart moyen par articulation entre le geste de référence et celui reproduit par le robot). L'abstract ne cite aucun modèle de robot précis, aucun site de déploiement ni partenaire industriel : il s'agit d'un travail de recherche méthodologique et non d'un produit commercialisé. L'enjeu porte sur un goulot d'étranglement bien identifié de l'apprentissage par démonstration chez les humanoïdes : la différence de morphologie et de degrés de liberté (DOF) entre un corps humain et un robot rend la traduction directe des mouvements captés souvent instable ou irréalisable mécaniquement. En séparant explicitement l'étape de retargeting des poses (PoseNet) de l'apprentissage de l'action (ActionNet), l'étude propose une réponse ciblée à ce problème, potentiellement transposable à d'autres tâches physiques répétitives et dangereuses en environnement non structuré, un terrain bien plus exigeant pour un humanoïde que l'entrepôt logistique. Le chiffre de 82,45 mm reste toutefois difficile à juger sans point de comparaison ni contexte sur la difficulté relative des huit tâches testées. Le secteur de la construction, confronté à une pénurie de main-d'œuvre et à des tâches physiquement éprouvantes, est régulièrement cité comme débouché naturel pour les humanoïdes, aux côtés des usines et entrepôts déjà ciblés par Figure, Agility Robotics ou Unitree. Ce travail se positionne en amont de tout déploiement commercial : les auteurs le présentent eux-mêmes comme une « étape précoce » vers des collaborateurs humanoïdes de chantier, sans calendrier de pilotes ni annonce industrielle à ce stade.

RecherchePaper
1 source