Aller au contenu principal
HAVE : un vérificateur sensible à l'historique qui raisonne sur les interactions passées
RecherchearXiv cs.RO 

HAVE : un vérificateur sensible à l'historique qui raisonne sur les interactions passées

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent HAVE (History-Aware VErifier), une architecture de contrôle robotique publiée sur arXiv (2509.00271v2) et soumise à CoRL 2025. Le principe central est une dissociation explicite entre deux composants distincts : un générateur diffusif non conditionnel qui propose plusieurs actions candidates, et un vérificateur apprenant à sélectionner la meilleure action en raisonnant sur l'historique des interactions passées. Les expériences couvrent des environnements simulés et réels incluant des objets articulés, des portes à comportement multimodal (poussée ou tirée selon le contexte), et des scénarios de saisie d'objets sur surfaces inégales. Aucun chiffre de déploiement industriel ni de partenaire commercial n'est mentionné : il s'agit d'une contribution académique pure.

L'intérêt de HAVE réside dans son diagnostic du problème plutôt que dans la solution elle-même. Les modèles génératifs récents, y compris ceux conditionnés sur l'historique d'actions, peinent à résoudre les ambiguïtés visuelles lors de la manipulation : un objet dont l'état interne est incertain (tiroir bloqué, poignée bimode) génère des échecs répétés même avec des VLA sophistiqués. Séparer génération et vérification permet au vérificateur de capitaliser sur les tentatives précédentes, là où un seul réseau intégré lisse ces signaux. Les auteurs fournissent une analyse théorique montrant que l'ajout d'un vérificateur améliore statistiquement la qualité d'action espérée, ce qui est moins courant dans la littérature robotique que les seules validations empiriques. Pour un intégrateur industriel, cela suggère une voie pour traiter les cas limites sans collecter massivement de données étiquetées sur chaque configuration ambiguë.

HAVE s'inscrit dans la vague des politiques diffusives initiée par Diffusion Policy (Chi et al., 2023) et étendue par pi-0 de Physical Intelligence, qui applique ce paradigme aux robots humanoïdes. Face aux approches concurrentes comme GR00T N2 de NVIDIA ou OpenVLA, qui misent sur le conditionnement fort des transformeurs vision-langage-action, HAVE choisit une architecture modulaire où la vérification est un citoyen de première classe et non une post-correction. Aucun acteur européen ou français n'est impliqué dans cette publication. Les prochaines étapes naturelles seraient des tests sur des manipulateurs industriels en conditions non structurées et une intégration avec des modèles de fondation plus larges pour le raisonnement contextuel.

À lire aussi

VISTA : navigation visuelle à l'échelle par conditionnement sur l'historique d'actions
1arXiv cs.RO 

VISTA : navigation visuelle à l'échelle par conditionnement sur l'historique d'actions

VISTA, un nouveau modèle de navigation visuelle présenté en preprint (arXiv:2606.17294), s'attaque à une faille structurelle identifiée dans les Vision Navigation Foundation Models (VNMs) actuels : la normalisation des actions prédites. Lorsqu'un VNM produit des trajectoires normalisées, l'application d'un facteur d'échelle différent selon le robot ou l'environnement déforme la géométrie physique de la trajectoire, ce qui dégrade les performances de navigation et augmente les risques de collision. Pour corriger cela, VISTA conditionne ses prédictions sur l'historique normalisé des actions exécutées, en parallèle des observations visuelles, offrant au modèle un contexte explicite sur la relation entre ses sorties et le déplacement physique réel du robot. Le modèle intègre également un encodeur DINOv3, dont les représentations plus riches permettent de mieux discriminer les environnements visuellement répétitifs (couloirs, entrepôts) où les VNMs classiques peinent à se localiser. En déploiement zéro-shot dans trois environnements réels (extérieur, forêt, bureau), VISTA affiche 100 % de précision dans la prédiction des objectifs et un taux moyen de 95 % de points de passage atteints. Ce résultat éclaire un angle mort largement sous-estimé dans le déploiement des politiques de navigation généralisées : l'invariance à l'échelle. Un modèle entraîné sur une flotte homogène peut échouer sur un robot dont la calibration diffère légèrement, sans qu'aucun défaut de l'architecture ne soit en cause. VISTA propose une correction légère mais systémique, applicable sans ré-entraînement, ce qui représente un avantage concret pour les intégrateurs qui déploient des politiques de navigation sur des flottes hétérogènes. Les résultats à 100 % méritent toutefois d'être nuancés : ils portent sur trois environnements seulement, et le terme "zéro-shot" désigne ici l'absence de fine-tuning spécifique aux sites de test, non une absence totale de données d'entraînement supervisé. VISTA s'inscrit dans la montée en puissance des modèles de navigation généraux, portée ces deux dernières années par des travaux comme NoMaD (CMU/Berkeley, 2023) ou GNFactor, qui cherchent tous à produire une politique de déplacement transférable sans adaptation manuelle. L'usage de DINOv3 suit une tendance nette : les encodeurs de la famille DINOv2/v3 (Meta FAIR) s'imposent progressivement comme backbone de référence pour les tâches nécessitant une compréhension géométrique fine de l'environnement. Le preprint ne mentionne ni partenaires industriels ni timeline de commercialisation ; il s'agit à ce stade d'une contribution académique, sans annonce de déploiement à grande échelle.

RechercheOpinion
1 source
Position : les modèles vision-langage-action ne peuvent pas être vérifiés pour le raisonnement physique
2arXiv cs.RO 

Position : les modèles vision-langage-action ne peuvent pas être vérifiés pour le raisonnement physique

Position: Vision-Language-Action Models Cannot Be Verified to Perform Physical Reasoning Un article de position publié sur arXiv (2606.30686) remet en cause l'interprétation dominante des progrès des systèmes Vision-Language-Action (VLA), ces modèles de robotique construits sur des modèles vision-langage (VLM) pré-entraînés comme GR00T N2, Pi-0 ou Helix. Les auteurs décomposent une politique VLA en deux briques distinctes : le mapping sémantique, hérité de l'entraînement internet-scale, et la décision d'action physique, propre à l'exécution motrice. Leur démonstration centrale est que le taux de réussite de tâche, la métrique quasi universelle des benchmarks de manipulation robotique, ne permet pas de distinguer laquelle de ces deux briques est responsable d'une amélioration de score. Autrement dit, un gain de performance mesuré peut aussi bien refléter une meilleure généralisation sémantique, un simple recouvrement distributionnel avec les données d'entraînement, qu'une réelle généralisation physique, sans qu'aucun protocole actuel ne permette de trancher. Cette limite touche directement l'argument commercial central de la vague VLA actuelle: la promesse que des représentations apprises sur des corpus internet transfèrent vers la généralisation en environnement physique réel. Pour les intégrateurs et décideurs B2B qui évaluent des solutions humanoïdes ou des bras manipulateurs sur la base de benchmarks affichant des taux de réussite en hausse, ce papier suggère une prudence méthodologique: un score supérieur ne garantit pas une robustesse physique supérieure, et peut masquer un simple effet de mémorisation de distribution. Le concept de "narrative drift" que les auteurs pointent, où chaque nouveau système hérite et renforce l'interprétation optimiste du précédent sans isoler le mécanisme causal réel, résonne avec les critiques déjà formulées sur l'écart entre démonstrations vidéo sélectionnées et déploiements réels en usine. Les auteurs ne rejettent pas l'utilité des VLM en robotique, mais proposent une piste de recherche: des protocoles d'évaluation introduisant une variation contrôlée pour mesurer séparément la généralisation sémantique et la généralisation physique, sans nécessiter d'accès aux poids internes des modèles. Cette approche s'inscrit dans un débat plus large sur la fiabilité des benchmarks robotiques, alors que des laboratoires et startups, de Figure à Physical Intelligence, multiplient les annonces de performance sur des tâches de manipulation dont la reproductibilité en conditions réelles reste rarement vérifiée indépendamment.

RecherchePaper
1 source
Learning et interaction physique : une revue de l'apprentissage robotique tactile et sensible à la force
3arXiv cs.RO 

Learning et interaction physique : une revue de l'apprentissage robotique tactile et sensible à la force

Une équipe de chercheurs publie sur arXiv (identifiant 2608.07558v1) une étude de synthèse consacrée à l'apprentissage robotique sensible au toucher et à la force dans les tâches de manipulation en contact. Plutôt que de présenter un nouveau robot ou un nouveau modèle, le papier propose un cadre baptisé TF-ART (Tactile/Force-Aware Robot learning Taxonomy), une classification unifiée des méthodes existantes qui combinent capteurs de force, retour tactile, vision, langage et proprioception au sein de politiques de manipulation apprises. La taxonomie décrit comment ces systèmes organisent les modalités de perception, encodent et fusionnent des signaux sensoriels hétérogènes, puis génèrent et affinent les actions selon des architectures multi-phases articulant une politique de haut niveau, des modules de raffinement d'action et des contrôleurs bas niveau chargés du pilotage réactif de l'effecteur. L'intérêt de ce travail pour les intégrateurs et les équipes de R&D en manipulation robotique tient à un vide méthodologique qu'il comble explicitement: aucune revue existante n'avait jusqu'ici croisé la fusion multimodale force/tactile/vision/langage avec l'analyse des architectures multi-phases. Cette mise en ordre touche un débat central du secteur, celui de savoir si les architectures vision-langage-action (VLA) génériques suffisent pour la manipulation en contact ou si des boucles dédiées de régulation de force restent nécessaires pour des tâches où l'exécution dépend autant du contrôle des efforts que de la perception visuelle. En structurant les approches publiées dans une hiérarchie commune, TF-ART fournit un référentiel comparatif utile pour repérer où les pipelines actuels sont robustes et où ils restent fragiles, notamment sur la fusion tactile-force plutôt que sur la seule perception visuelle. Le travail s'inscrit dans la dynamique récente des politiques de manipulation apprises qui intègrent de plus en plus de modalités sensorielles au-delà de la caméra, un mouvement porté par la multiplication des architectures multi-phases séparant compréhension sémantique de la tâche et exécution physique réactive. Au-delà du seul recensement méthodologique, les auteurs examinent également les configurations de tâches et les exigences d'infrastructure, capteurs, bancs d'essai, matériel de contrôle, nécessaires à la manipulation physique réelle, reliant ainsi perspective algorithmique et contraintes pratiques de déploiement. Le survey ne cite pas de calendrier de suivi ni d'implémentation industrielle précise, son apport étant avant tout de structurer un champ de recherche en pleine expansion pour orienter les travaux futurs.

RecherchePaper
1 source
EARL : un cadre unifié guidé par l'analyse pour le raisonnement d'interaction égocentrique et l'ancrage au pixel
4arXiv cs.RO 

EARL : un cadre unifié guidé par l'analyse pour le raisonnement d'interaction égocentrique et l'ancrage au pixel

Des chercheurs publient sur arXiv (réf. 2605.14742) EARL, un cadre d'apprentissage par renforcement guidé par analyse pour la compréhension d'interactions humain-environnement en vision égocentrique, c'est-à-dire depuis une caméra portée à la première personne. L'architecture repose sur deux étages séquentiels : une phase d'interprétation globale qui produit une description textuelle structurée des interactions observées, suivie d'une phase de réponse fine qui génère simultanément une réponse textuelle, des boîtes englobantes et un masque de segmentation au niveau pixel. Le lien entre ces deux étages est assuré par un module original, l'Analysis-guided Feature Synthesizer (AFS), qui extrait un descripteur sémantique global et l'injecte comme prior lors du raisonnement orienté requête. La phase de réponse est optimisée par GRPO (Group Relative Policy Optimization), une variante d'apprentissage par renforcement popularisée récemment par les travaux DeepSeek. Sur le benchmark Ego-IRGBench, EARL atteint 65,48 % de cIoU pour le pixel grounding, soit +8,37 points au-dessus des meilleures méthodes RL comparables. Le test de généralisation hors-distribution sur EgoHOS, un benchmark de segmentation mains-objets, confirme une transférabilité satisfaisante sur des scènes non vues à l'entraînement. Ce résultat souligne une limite structurelle des grands modèles multimodaux de langage (MLLMs) actuels : ils décrivent correctement les scènes, mais peinent à localiser avec précision les zones d'interaction au niveau pixel, une granularité pourtant indispensable pour qu'un robot assistif saisisse un objet ou qu'un système embarqué guide un geste en temps réel. EARL démontre qu'injecter un prior sémantique structuré avant la phase de grounding améliore significativement cette précision sans sacrifier la compréhension globale. La robustesse OOD mesurée sur EgoHOS est un signal positif pour des déploiements en conditions variées, même si l'article reste un preprint académique et non un système industriellement déployé, ce qui invite à la prudence sur la portée des métriques annoncées. La vision égocentrique connaît une forte dynamique, portée par des dispositifs comme les lunettes Meta Orion, l'Apple Vision Pro et les casques industriels RealWear, tandis que le dataset Ego4D (Meta/FAIR) reste la référence d'entraînement du domaine. EARL s'inscrit dans une vague de travaux combinant MLLMs et RL pour dépasser les limitations du fine-tuning supervisé classique, aux côtés de systèmes comme SpatialVLM ou EgoVLP. Aucun partenariat industriel ni calendrier de déploiement n'est mentionné dans le preprint ; les extensions naturelles incluent l'intégration dans des pipelines robotiques temps-réel et l'évaluation sur des environnements industriels ou médicaux, où la précision du grounding pixel conditionne directement la sécurité opérationnelle.

RecherchePaper
1 source