
Glance-Say : collaboration homme-robot multimodale et reconnaissance d'intention via un regard soutenu
Des chercheurs proposent Glance-Say, un cadre d'interaction multimodale associant regard et parole pour la manipulation robotique assistive destinee aux personnes a mobilité réduite. Le système repose sur un algorithme dit de "regard collant" (sticky-glance) qui stabilise la sélection de cible en cumulant conjointement la distance géométrique et l'évidence directionnelle du regard, un mécanisme conçu pour compenser les micro-saccades oculaires et l'ambiguïté sémantique dans des environnements comportant plusieurs objets. Dans ce paradigme, le regard désigne l'objet vise pendant que la commande vocale précise l'action a exécuter, le tout couple a un schéma de contrôle partage en continu qui maintient le bras robotique en état de haute réactivité tout en intégrant un retour humain-dans-la-boucle. Les expériences rapportées affichent un taux de suivi de 0,92 pour des cibles mobiles, une précision de sélection de 0,97 pour des cibles statiques, ainsi qu'une réduction du temps nécessaire pour accomplir les taches, par rapport aux paradigmes d'interaction de référence.
Pour l'assistance robotique aux personnes en situation de handicap moteur, ce travail s'attaque a un verrou concret: les interfaces regard-plus-voix existantes échouent souvent des que plusieurs objets similaires sont présents ou que l'utilisateur bouge la tête, forçant des ré-sélections fastidieuses. Une méthode qui stabilise l'intention en temps réel sans capteur exotique, en s'appuyant sur des signaux de regard et de parole standards, rapproche ce type d'interface d'un usage quotidien réaliste plutôt que d'une démonstration de laboratoire en conditions idéales. Pour les intégrateurs travaillant sur des bras assistifs ou des fauteuils robotises, cela ouvre la voie a des contrôles plus naturels, sans dispositifs de pointage dédiés ni entrainement lourd de l'utilisateur.
Ce travail s'inscrit dans la lignée des recherches en interaction cerveau-machine et interfaces oculaires pour l'assistance, un champ historiquement freine par le bruit du regard et l'ambiguïté des commandes vocales isolées. Publie sur arXiv en tant que version révisée, l'article ne mentionne pas de partenariat industriel ni de déploiement au-delà du banc d'essai expérimental; les prochaines étapes attendues concernent une validation sur davantage d'utilisateurs et de scenarios de manipulation réels, ainsi qu'une comparaison plus large face aux systèmes commerciaux d'assistance existants.
Dans nos dossiers




