Aller au contenu principal
HumanCLAW : les modèles vision-langage peuvent-ils agir à travers un corps ?
RecherchearXiv cs.RO 

HumanCLAW : les modèles vision-langage peuvent-ils agir à travers un corps ?

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Décider où poser le pied ou quoi ramasser est une chose ; l'exécuter avec un corps qui doit garder l'équilibre en est une autre, et jusqu'ici les benchmarks d'IA incarnée mélangeaient les deux dans un seul score d'échec. Une équipe de recherche présente HumanCLAW, un cadre d'évaluation qui sépare explicitement la décision d'action, confiée à un modèle vision-langage (VLM) générique non modifié, de son exécution motrice. À chaque étape, le VLM se contente d'émettre une commande de compétence atomique (aller vers, saisir, éviter), traduite ensuite en une fraction de seconde de mouvement corporel complet soumis à la vraie physique, gravité et collisions comprises, mais dont l'exécution motrice elle-même n'est pas imputée au modèle. Sur cette base, les chercheurs ont construit HumanCLAW-Bench : 1 218 épisodes longs, en vue égocentrique, combinant recherche, navigation et interaction dans 41 scènes d'intérieur. Neuf VLMs de pointe ont été testés, et aucun ne parvient à résoudre le benchmark ; le meilleur plafonne à 16,8 % de réussite.

Ce résultat déplace le diagnostic habituel sur l'IA incarnée. Puisque les erreurs de motricité et d'équilibre sont neutralisées par construction, l'échec ne peut plus être attribué à un contrôleur bas niveau défaillant : il révèle une limite propre à l'intelligence décisionnelle du modèle. Or reconnaître la cible visuellement n'est pas le problème, selon les auteurs : c'est l'absence de conscience corporelle incarnée qui bloque les VLMs, incapables de savoir où se situe leur propre corps, s'ils ont atteint l'objectif, ou s'ils viennent de heurter un obstacle. Pour les équipes qui développent des modèles vision-langage-action destinés à des robots humanoïdes, cela suggère que l'ajout de capacités motrices ou de données de démonstration ne suffira pas tant que le modèle n'intègre pas une forme de proprioception explicite.

HumanCLAW s'inscrit dans une lignée de benchmarks d'IA incarnée cherchant à isoler les sources d'échec plutôt qu'à mesurer un taux de succès global. En proposant une méthodologie reproductible et un large jeu de scènes, les auteurs ouvrent la voie à des comparaisons plus fines entre futurs VLMs et à des pistes de recherche ciblées sur l'auto-localisation et le suivi d'état corporel, plutôt que sur la seule perception d'objets.

Dans nos dossiers

À lire aussi

Les modèles vision-langage apprennent aux robots à lire les émotions humaines
1IEEE Spectrum Robotics 

Les modèles vision-langage apprennent aux robots à lire les émotions humaines

Des chercheurs de l'Université de Melbourne ont entraîné un robot collaboratif à reconnaître les émotions humaines en combinant analyse faciale et facteurs contextuels, via un modèle de langage visuel (VLM, ou Vision Language Model). Les résultats, publiés le 18 mai 2026 dans IEEE Robotics and Automation Letters, montrent que cette approche surpasse les systèmes classiques de reconnaissance d'expression : le VLM obtient un score de similarité de 0,86 sur 1, contre 0,77 pour les outils d'analyse faciale et de suivi d'objets conventionnels. L'étude a été conduite par Seung Chan Hong dans le cadre de sa thèse de licence, avec une cohorte de 40 volontaires. Pour entraîner le modèle, des participants ont d'abord visionné des vidéos de robots effectuant des transferts d'objets à des humains avec des degrés de succès variés, puis décrit les émotions perçues en tenant compte de la scène complète : posture, gestes (doigts qui tambourinent, lèvres pincées), position dans l'espace, et non plus seulement l'expression du visage. Dans un second test, le robot équipé du VLM a intentionnellement commis une erreur, puis proposé soit une excuse adaptée à l'état émotionnel perçu, soit une formule pré-scriptée. Résultat : 31 personnes sur 40 ont préféré la réponse contextuelle. Le résultat le plus significatif n'est pourtant pas le gain de performance du VLM, mais la limite qu'il révèle. Même avec une excuse personnalisée et émotionnellement cohérente, la confiance des participants envers le robot avait chuté après l'erreur, indépendamment de la qualité de la réponse sociale. Les auteurs en tirent une conclusion directe pour les intégrateurs et les équipes de conception : l'adaptivité émotionnelle agit comme un lubrifiant social, elle n'efface pas un déficit fonctionnel. Pour les COO et décideurs qui évaluent des déploiements de cobots en environnement humain, cela signifie que l'investissement dans la fiabilité mécanique reste prioritaire sur les couches d'intelligence émotionnelle. En revanche, dans les scénarios où des erreurs sont inévitables, un module de reconnaissance émotionnelle contextuelle peut atténuer les effets négatifs sur la relation opérateur-robot, ce qui est pertinent dans les environnements d'assemblage ou de logistique. Le VLM utilisé dans l'étude fonctionne sur un principe similaire aux grands modèles de langage comme ChatGPT, mais avec une entrée visuelle permettant une lecture de scène au-delà de la seule mimique faciale. La recherche en interaction humain-robot (HRI) investit depuis plusieurs années dans les modèles de reconnaissance d'affect, mais les approches classiques restaient cantonnées à l'analyse des expressions faciales ou au suivi de posture. L'intégration des VLMs dans ce domaine suit la vague des modèles de vision-langage généralistes issus de Google DeepMind, OpenAI ou Meta. L'étude de Melbourne se distingue par une validation empirique sur sujets humains réels avec une tâche collaborative concrète, plutôt qu'une évaluation sur benchmark. Les prochaines étapes pour ce type de recherche incluront probablement des tests en environnement industriel contrôlé, pour vérifier si la perception émotionnelle reste robuste sous pression temporelle et dans des scènes visuellement chargées.

RecherchePaper
1 source
VLAff : un modèle vision-langage-affordance unifié pour les capacités d'action
2arXiv cs.RO 

VLAff : un modèle vision-langage-affordance unifié pour les capacités d'action

Une publication arXiv soumise en août 2026 présente VLAff, un modèle vision-langage-affordance conçu pour apprendre aux robots à manipuler des objets à partir de vidéos humaines filmées à la première personne. Le verrou visé est connu du secteur : la morphologie d'un bras robotique diffère de celle d'une main humaine, ce qui complique le transfert direct des gestes observés. Les auteurs contournent l'obstacle en extrayant des affordances centrées sur l'objet, indépendantes de la morphologie du robot, qui précisent où interagir, comment saisir et comment déplacer. La méthode combine reconstruction 3D par Structure-from-Motion et reconstruction de maillage de la main sur des vidéos égocentriques, appliquée à un nouveau jeu de données, EgoAffordance, comptant 204 000 épisodes, 5,6 millions d'affordances visuelles et 11,6 millions d'affordances de préhension et de trajectoire. Entraîné sur cette base, VLAff génère, à partir d'une observation et d'une instruction, des cartes de chaleur d'affordance, des poses de préhension et des trajectoires, converties en actions exécutables via les informations de scène 3D. Ce travail s'inscrit dans une tendance de fond de la robotique manipulative : exploiter la masse de vidéos humaines disponibles en ligne pour pallier la rareté et le coût des données de téléopération robotique. Si l'état de l'art revendiqué en prédiction d'affordance visuelle se confirme au-delà des bancs d'essai internes des auteurs, la méthode ouvrirait une source de données bon marché pour les modèles vision-langage-action que développent des acteurs comme Physical Intelligence (Pi-0), NVIDIA (GR00T) ou Figure AI (Helix), tous engagés dans la course aux modèles fondation génériques pour la manipulation. Un bémol s'impose toutefois : les résultats sont pour l'instant mesurés en interne, sans comparaison indépendante publiée, et les démonstrations de manipulation zero-shot sur robot réel restent, d'après le résumé, cantonnées à des scénarios de laboratoire plutôt qu'à un déploiement industriel. La recherche sur les affordances actionnables, où et comment interagir avec un objet, est un axe actif de la robotique et de la vision par ordinateur depuis plusieurs années, mais les travaux antérieurs se limitaient souvent à une seule modalité ou à des jeux de données restreints tournés en environnement contrôlé. L'apport revendiqué par VLAff est d'unifier trois modalités, visuelle, préhension et trajectoire, dans un seul modèle fondation entraîné sur des vidéos égocentriques du quotidien plutôt que sur des démonstrations robotiques dédiées et coûteuses. Le papier ne précise ni affiliation institutionnelle ni calendrier de publication du code ou du jeu de données : il s'agit à ce stade d'une contribution académique, non d'un produit ou d'un pilote industriel annoncé, dont la suite logique serait la publication du code pour permettre à la communauté de reproduire les résultats.

RechercheOpinion
1 source
Entraînement hybride pour les modèles vision-langage-action (VLA)
3arXiv cs.RO 

Entraînement hybride pour les modèles vision-langage-action (VLA)

Une équipe de chercheurs a publié sur arXiv (identifiant 2510.00600, version 2) un framework nommé Hybrid Training (HyT), conçu pour les modèles Vision-Language-Action (VLA) utilisés en robotique de manipulation. Le problème central est le suivant : le raisonnement par chaîne de pensée (Chain-of-Thought, CoT), qui consiste à générer des "pensées" intermédiaires avant chaque action, améliore les performances des VLA mais allonge mécaniquement le temps d'inférence. Dans des tâches requérant de longues séquences d'actions successives, ce délai compromet l'utilisabilité réelle du système. HyT découple la phase d'apprentissage de la phase d'exécution : le modèle s'entraîne en intégrant les pensées intermédiaires, acquiert les gains de performance associés, puis peut les omettre entièrement lors du déploiement. Le framework supporte trois modes à l'inférence selon le contexte : prédiction directe d'actions, génération CoT complète, ou suivi d'instructions. Les auteurs ont validé l'approche sur plusieurs benchmarks simulés et sur des expériences en conditions réelles. Ce découplage entraînement/inférence répond à l'une des tensions fondamentales dans le déploiement industriel des VLA : les techniques qui améliorent la fiabilité dégradent souvent la réactivité. Pour un intégrateur ou un COO industriel, un système qui "réfléchit" trop longtemps avant d'agir est difficilement intégrable sur une ligne de production cadencée. HyT avance que les bénéfices du raisonnement explicite peuvent être distillés dans les poids du modèle et activés implicitement, sans générer de tokens supplémentaires au runtime. Si ce résultat se confirme à plus grande échelle, il simplifierait le compromis latence/performance qui freine aujourd'hui le déploiement de bras manipulateurs VLA en environnement non structuré. C'est également une réponse indirecte au "demo gap" fréquemment reproché à ces modèles : de bonnes performances en simulation ne garantissent pas une vitesse d'exécution acceptable sur le terrain. L'essor des VLA s'est accéléré depuis 2023 avec RT-2 (Google DeepMind), OpenVLA (UC Berkeley), Pi-0 (Physical Intelligence) et GR00T N2 (NVIDIA), qui combinent vision, langage et prédiction d'actions dans un seul réseau. L'application du CoT à la robotique prolonge les travaux fondateurs sur les LLMs, mais se heurte aux contraintes temps-réel absentes du traitement de texte. HyT s'inscrit dans un courant de recherche orienté déployabilité, aux côtés de la distillation de politiques et des architectures à flux de tokens réduit. La publication est une preprint arXiv non peer-reviewed, et les résultats en conditions réelles restent à confirmer à plus grande échelle industrielle. Aucun acteur européen n'est impliqué dans ces travaux ; les laboratoires cités opèrent principalement depuis les États-Unis.

RechercheOpinion
1 source
Raisonnement continu pour les modèles vision-langage-action (VLA)
4arXiv cs.RO 

Raisonnement continu pour les modèles vision-langage-action (VLA)

Des chercheurs ont publié sur arXiv (2606.00229) une architecture appelée Continuous Reasoning for VLA, qui remplace le langage naturel comme médium de raisonnement pour les politiques robotiques par un espace latent gaussien continu. Le problème est fondamental : le texte opère à la granularité d'une tâche entière, tandis qu'une politique VLA (Vision-Language-Action) doit sélectionner des actions à une échelle temporelle bien plus fine. Le modèle génère d'abord un ensemble structuré de "pensées continues" sous forme de vecteurs gaussiens, puis les réutilise comme contexte partagé pour la génération d'actions par chunks. L'entraînement repose sur un objectif de vérification croisée : un teacher EMA (exponential moving average) doit consommer le raisonnement du modèle étudiant pour prédire les actions cibles, forçant le latent à rester transférable et vérifiable entre instances. Sur robots réels, l'architecture améliore le taux de succès moyen par sous-tâche de 40,4 % sur TX-G2 (variante compatible AgiBot G2) et de 26,3 % sur HSR (Human Support Robot de Toyota), comparé à π0.5 de Physical Intelligence. Ces résultats contredisent une hypothèse répandue : ajouter des tokens de raisonnement textuel via chain-of-thought ou sous-objectifs explicites améliore le contrôle robotique. Les auteurs montrent que ce raisonnement textuel devient facilement un raccourci interne au modèle, efficace sur les comportements vus en entraînement mais peu généralisable. Un médium de raisonnement utile doit être partageable entre instances de modèle et vérifiable via l'amélioration du contrôle aval, deux propriétés que le texte satisfait mal à l'échelle de l'action. La comparaison directe avec π0.5 positionne ce travail en réponse à Physical Intelligence, acteur de référence dans l'espace VLA. Les plateformes testées (AgiBot G2 et HSR) couvrent la robotique de service et industrielle légère, pas uniquement les humanoïdes à fort investissement comme Figure 03 ou Optimus Gen 3. D'autres architectures concurrentes, dont GR00T N2 de NVIDIA et Helix de Figure AI, misent sur des représentations latentes pour améliorer le transfert sim-to-real, mais restent davantage orientées production que recherche fondamentale. Il s'agit pour l'instant d'un résultat académique, sans annonce de pilote commercial ni de déploiement industriel.

RechercheOpinion
1 source