Aller au contenu principal
Ask-to-Clarify : résoudre l'ambiguïté des instructions par un dialogue multi-tours
IA physiquearXiv cs.RO 

Ask-to-Clarify : résoudre l'ambiguïté des instructions par un dialogue multi-tours

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent Ask-to-Clarify, un cadre qui permet à un robot équipé d'un modèle vision-langage-action (VLA) de poser des questions avant d'agir plutôt que d'exécuter aveuglément une consigne ambiguë. Le système marie un planificateur cognitif basé sur un modèle vision-langage, chargé de mener le dialogue de clarification, à un exécuteur moteur fondé sur la diffusion, chargé du contrôle bas niveau. Les deux modules communiquent via un adaptateur d'alignement sémantico-visuel, une interface qui traduit l'intention exprimée en langage naturel en flux de perception visuelle exploitable par le contrôleur. Pour l'entraîner, les auteurs ont dû résoudre un oubli catastrophique observé lors de leurs premiers essais : le réglage fin sur les tâches de manipulation effaçait entièrement la capacité de dialogue du modèle. Leur parade est une stratégie d'entraînement en deux étapes qui isole la logique conversationnelle de l'apprentissage moteur. Le système a été testé sur 11 tâches de manipulation réelles, où il devance nettement les méthodes existantes.

L'enjeu dépasse le confort d'usage. La quasi-totalité des VLA actuels, qu'il s'agisse de familles comme Pi-0 ou GR00T N2, fonctionnent selon un paradigme rigide d'écoute puis d'exécution : ils postulent que l'instruction est claire et agissent sans vérifier, ce qui échoue dès qu'un environnement réel présente plusieurs objets similaires ou une consigne sous-spécifiée d'un utilisateur non expert. C'est précisément l'écart entre démonstrations scénarisées et déploiement réel que pointe régulièrement le secteur. En documentant un oubli catastrophique aussi net entre dialogue et contrôle moteur, ce travail met aussi en garde les équipes qui cherchent à empiler perception, raisonnement et action dans un modèle généraliste unique : ce n'est pas gratuit, cela demande des architectures et des entraînements spécifiquement pensés pour éviter que les compétences s'écrasent entre elles.

Historiquement, la clarification d'instructions robotiques passait par des planificateurs externes de type LLM (dans la lignée de SayCan) posés au-dessus d'un contrôleur bas niveau séparé, une architecture en deux blocs disjoints. Ask-to-Clarify s'en distingue en intégrant dialogue et contrôle moteur dans un seul système entraîné de bout en bout, sans primitives d'action codées à la main ni planificateur externe. Les auteurs, dont les travaux sont publiés sur arXiv, envisagent d'étendre l'approche à des instructions et environnements plus variés, au-delà de la simple levée d'ambiguïté.

À lire aussi

Modèle MVP-LAM : apprentissage de représentations d'actions latentes centrées sur l'action par reconstruction multi-points de vue
1arXiv cs.RO 

Modèle MVP-LAM : apprentissage de représentations d'actions latentes centrées sur l'action par reconstruction multi-points de vue

Une équipe de chercheurs a publié MVP-LAM (Multi-ViewPoint Latent Action Model), une méthode visant à améliorer le pré-entraînement des modèles vision-langage-action (VLA) à partir de vidéos humaines non étiquetées. Le problème ciblé : les actions latentes apprises depuis des vidéos mono-vue encodent des indices visuels propres à l'angle de caméra, plutôt que la sémantique réelle du mouvement. MVP-LAM impose un objectif de reconstruction inter-vues (cross-viewpoint reconstruction) : une action latente extraite depuis une caméra doit prédire l'évolution de la scène telle que vue depuis une autre caméra. Évalué sur le jeu de données Bridge V2, le modèle produit des actions latentes dont l'information mutuelle avec les vraies actions de référence dépasse celle des baselines, y compris en conditions hors-distribution. Ces représentations améliorées se traduisent par de meilleures performances de manipulation en aval sur plusieurs benchmarks standards. Le code et les checkpoints entraînés sont disponibles publiquement. La contrainte géométrique multi-vues a un impact direct pour les intégrateurs : un modèle pré-entraîné sur des actions latentes robustes au changement de point de vue devrait mieux résister au gap entre démonstration et déploiement réel, notamment dans des cellules robotiques où la position des caméras diffère entre collecte de données et production. MVP-LAM valide aussi l'usage de larges corpus vidéo non supervisés (vidéos internet, archives industrielles) sans démonstrations téléopérées : la cohérence inter-vues remplace partiellement le signal proprioceptif, réduisant le coût de collecte des données d'entraînement. Le pré-entraînement VLA depuis des vidéos non annotées s'inscrit dans la continuité de travaux comme RT-2 (Google DeepMind), UniPi, et plus récemment pi-0 (Physical Intelligence) ou OpenVLA. Ces approches partagent l'ambition d'exploiter des données vidéo à grande échelle pour doter les robots d'une compréhension généraliste du mouvement avant fine-tuning sur tâches spécifiques. MVP-LAM apporte une contribution méthodologique en renforçant la qualité des pseudo-labels d'action, une étape souvent négligée au profit de l'architecture des modèles aval. Il s'agit d'un travail académique sans déploiement industriel annoncé, mais dont la disponibilité du code facilite la reproduction et l'adaptation sur d'autres plateformes robotiques.

IA physiqueOpinion
1 source
Passage sémantique ancré pour une généralisation robuste des instructions dans les modèles vision-langage-action
2arXiv cs.RO 

Passage sémantique ancré pour une généralisation robuste des instructions dans les modèles vision-langage-action

Des chercheurs ont publié le 2 août 2026 sur arXiv un article intitulé « Grounded Semantic Re-Binding for Robust Instruction Generalization in Vision-Language-Action Models », qui s'attaque à un défaut connu des modèles Vision-Language-Action (VLA) utilisés en manipulation robotique : leurs performances s'effondrent dès qu'une instruction canonique est simplement reformulée, même sans changement de sens. Les auteurs montrent que la cause n'est pas un manque de compréhension sémantique, que les modèles capturent correctement en interne, mais un problème architectural : l'encodage conjoint des observations visuelles dynamiques et du texte introduit des décalages de features qui perturbent la politique d'action en aval. Pour corriger ce goulot d'étranglement, l'équipe propose Grounded Semantic Re-binding (GSR), une méthode qui extrait séparément la sémantique de la tâche et les features visuelles natives avant de les fusionner, puis entraîne un expert d'action entièrement réinitialisé à partir de démonstrations canoniques uniquement, sans données de paraphrase supplémentaires. Sur le benchmark LIBERO-Para, GSR améliore le taux de réussite jusqu'à 44,6 points. La méthode permet aussi à des modèles légers d'égaler des baselines massivement mises à l'échelle, et pousse l'état de l'art à un score PRIDE record de 70,4, devançant le modèle Xiaomi-Robotics-0 récemment introduit. Les chercheurs présentent également ParaVLA, un modèle nativement découplé de seulement 0,33 milliard de paramètres, quasi insensible à la reformulation des instructions. Pour l'industrie robotique, ce résultat remet en cause un réflexe devenu standard : face à la fragilité des VLA aux reformulations, la réponse habituelle est d'empiler davantage de données d'entraînement, une approche coûteuse en calcul et en collecte de démonstrations. En identifiant la cause comme structurelle plutôt que statistique, GSR ouvre la voie à des modèles plus compacts et robustes sans scaling brut, un enjeu direct pour les intégrateurs qui déploient des VLA en environnement réel, où un opérateur ne formule jamais deux fois une consigne exactement de la même façon. Qu'un modèle de 0,33 milliard de paramètres rivalise avec des systèmes bien plus massifs interroge aussi l'hypothèse dominante selon laquelle la robustesse sémantique des VLA dépend mécaniquement de la taille du modèle ou du corpus d'entraînement. Les VLA, qui combinent perception visuelle, compréhension du langage et génération de commandes, sont devenus l'architecture de référence pour la manipulation robotique généraliste, portée notamment par des modèles comme Pi-0 ou GR00T N2. Leur fragilité face aux reformulations reste un point faible documenté, généralement traité par scaling de données plutôt que par correction architecturale. En se comparant explicitement à Xiaomi-Robotics-0, modèle pré-entraîné à grande échelle récemment mis en avant, les auteurs positionnent GSR comme une alternative frugale à la course au gigantisme. Le papier, disponible en preprint sur arXiv (2608.02497), reste pour l'instant une contribution de recherche évaluée en simulation ; sa validation sur des déploiements robotiques réels déterminera sa portée pratique au-delà du laboratoire.

IA physiqueActu
1 source
Apprendre à agir par le contact : une vision unifiée de l'apprentissage multi-tâches pour les robots
3arXiv cs.RO 

Apprendre à agir par le contact : une vision unifiée de l'apprentissage multi-tâches pour les robots

Des chercheurs ont publié sur arXiv (2510.03599v2) un cadre unifié d'apprentissage de politiques pour la locomotion et la manipulation robotique multi-tâches, fondé sur une représentation dite "contact-explicite". Le principe central consiste à définir chaque tâche non pas par des trajectoires articulaires spécifiques, mais par une séquence d'objectifs de contact: positions de contact souhaitées, timings, et effecteurs actifs. Une politique unique, entraînée par apprentissage par renforcement (RL) conditionné aux objectifs, prend ces plans de contact en entrée et les exécute. Le framework a été validé sur plusieurs morphologies robotiques: un quadrupède exécutant différentes allures (trot, galop, etc.), un humanoïde réalisant des locomotions bipèdes et quadrupèdes, et ce même humanoïde effectuant des tâches de manipulation bimanuelles d'objets. Dans les trois cas, une seule politique gère l'ensemble des comportements. L'intérêt industriel est direct: l'approche contact-explicite améliore significativement la généralisation à des scénarios non vus pendant l'entraînement, ce qui s'attaque frontalement au "sim-to-real gap" qui pénalise la plupart des politiques entraînées en simulation. Pour un intégrateur ou un OEM robotique, cela signifie moins de politiques spécialisées à maintenir, moins de re-training à chaque variante de tâche, et une architecture potentiellement plus robuste aux variations de terrain ou d'objet. Le fait qu'une seule politique puisse couvrir à la fois locomotion et manipulation (loco-manipulation) dans un cadre commun réduit également la complexité d'orchestration en production. Les résultats présentés semblent solides en simulation, mais les auteurs n'annoncent pas de déploiement physique à l'échelle, ce qui invite à distinguer démonstration de recherche et produit shipé. Les approches classiques traitent locomotion et manipulation comme deux sous-problèmes séparés, avec des planificateurs et des politiques dédiées. L'espace des politiques générales est aujourd'hui dominé par des VLA (Vision-Language-Action models) comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, qui s'appuient sur de larges datasets visuels et du transfert de fondation. La contribution ici prend le parti inverse: une représentation géométrique structurée des contacts, plus frugale en données mais plus contrainte en hypothèses. Dans le domaine de la locomotion quadrupède unifiée, les groupes de l'ETH Zurich (ANYmal), de CMU et de Berkeley restent les références. La suite logique de ces travaux serait d'interfacer la planification de contacts avec un module de compréhension du langage naturel, pour permettre des instructions de haut niveau, une direction déjà explorée par plusieurs laboratoires académiques et startups de la robotique incarnée.

IA physiquePaper
1 source
Piloter un robot humanoïde par instructions en langage libre : un modèle d'action à grand vocabulaire de mouvement unifié
4arXiv cs.RO 

Piloter un robot humanoïde par instructions en langage libre : un modèle d'action à grand vocabulaire de mouvement unifié

Des chercheurs ont publié sur arXiv (identifiant 2511.22963, troisième version) Humanoid-LLA, un modèle d'action fondé sur un grand modèle de langage capable de convertir des instructions en langage naturel libre en séquences de mouvement whole-body exécutables directement sur des robots humanoïdes. Le système s'attaque à deux verrous techniques bien connus dans le domaine : la rareté des données appariées langage-mouvement humanoïde, et l'instabilité physique des mouvements synthétiques. Pour y remédier, l'architecture apprend un vocabulaire de mouvement unifié humain-humanoïde qui permet d'ancrer la sémantique de haut niveau dans un espace de contrôle physiquement cohérent. L'entraînement suit un protocole en deux étapes : une phase supervisée par Chain-of-Thought sur les séquences de mouvement, suivie d'un affinage par reinforcement learning conditionné par un retour de simulation physique. Les évaluations combinent tests en simulation et expériences réelles en cross-embodiment, soit sur plusieurs modèles de robots distincts. Ce travail comble un angle mort persistant dans la recherche sur les humanoïdes : la commande en langage libre pour le contrôle du corps entier, et pas seulement du bras manipulateur. Les approches existantes restent soit cantonnées à des instructions prédéfinies, soit contraintes à sacrifier la diversité des mouvements pour conserver la stabilité physique. Humanoid-LLA tente de lever ce compromis en intégrant explicitement la physique dans la boucle d'apprentissage via le RL. Pour les intégrateurs et les COO industriels, l'enjeu est concret : un tel modèle pourrait réduire la dépendance aux interfaces de programmation spécialisées et abaisser le coût d'interaction avec des humanoïdes en ligne de production. La capacité de généralisation à des commandes inédites reste la métrique-clé revendiquée, mais l'absence de benchmarks comparatifs standardisés et la sélection probable des démonstrations vidéo invitent à nuancer les conclusions. Humanoid-LLA s'inscrit dans la montée en puissance des modèles VLA (Vision-Language-Action), un segment où Physical Intelligence avec pi0, Google DeepMind avec RT-2 et GR00T N2 co-développé avec NVIDIA, et Figure avec son pipeline Helix ont toutes misé sur le couplage langage-action pour dépasser les politiques sensorimotrices figées. La spécificité de cette contribution est le focus explicite sur le mouvement du corps complet plutôt que sur la manipulation d'objets, un espace encore peu exploré à grande échelle. L'article demeure un preprint non évalué par les pairs, sans déploiement industriel ni partenariat de mise en production annoncé. Les prochaines étapes probables incluent une soumission en conférence de type ICRA ou CoRL, et une validation sur des humanoïdes commerciaux comme l'Unitree H1 ou le Boston Dynamics Atlas, régulièrement utilisés comme bancs de test dans ce segment.

IA physiqueOpinion
1 source