Aller au contenu principal
AgentGrounder : ancrage visuel 3D en zéro-shot dans des nuages de points via des modèles multimodaux
RecherchearXiv cs.RO 

AgentGrounder : ancrage visuel 3D en zéro-shot dans des nuages de points via des modèles multimodaux

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs du laboratoire be2rlab publient sur arXiv (arXiv:2605.25901) AgentGrounder, un système de localisation visuelle 3D zéro-shot opérant directement sur des nuages de points colorés, sans entraînement spécifique à la tâche. L'architecture repose sur deux étapes : une phase hors ligne construit une table de correspondance d'objets (Object Lookup Table, OLT) regroupant identifiants d'instances, labels sémantiques et boîtes englobantes 3D ; une phase en ligne déploie un agent qui décompose chaque requête en langage naturel, récupère les candidats pertinents dans l'OLT, effectue un scoring géométrique, puis déclenche un rendu d'image à la demande lorsque des indices visuels supplémentaires (couleur, texture, angle de vue) sont nécessaires. Évalué sur les benchmarks ScanRefer et Nr3D en configuration zéro-shot, AgentGrounder surpasse SeeGround de +2,5 % en précision Acc@0.5 sur ScanRefer et de +6,3 % sur Nr3D, dont un gain de +6,3 % sur les requêtes indépendantes du point de vue. Le code est publié sur GitHub.

Ce résultat est directement pertinent pour les équipes travaillant sur la manipulation robotique et la navigation en environnements intérieurs non structurés. L'absence d'entraînement dédié abaisse la barrière d'intégration : un robot équipé d'un LiDAR ou d'une caméra de profondeur pourrait répondre à des commandes en langage naturel sans fine-tuning sur l'environnement cible, ce qui simplifie les déploiements dans des entrepôts ou des espaces de service variables. Le mécanisme de récupération sélective dans l'OLT réduit les erreurs en cascade typiques des pipelines d'ancrage-cible fixes, qui saturent la fenêtre de contexte des modèles de langage avec des objets non pertinents. L'inspection visuelle adaptative évite par ailleurs de solliciter inutilement les capacités multimodales coûteuses lorsque la géométrie seule suffit à discriminer.

La localisation visuelle 3D est un domaine de recherche structuré autour de benchmarks comme ScanRefer (2020) et Nr3D, qui évaluent la capacité à identifier un objet précis dans une scène intérieure 3D à partir d'une description textuelle ambiguë. Les méthodes zéro-shot antérieures supposaient souvent des ensembles d'images multi-vues préexistants et peinaient face aux limites sémantiques des outils de segmentation 3D standards, SeeGround représentant jusqu'ici l'état de l'art sur ces benchmarks. Côté industrie, NVIDIA intègre des capacités de grounding 3D dans son framework GR00T pour la manipulation robotique, tandis qu'Enchanted Tools en France et les équipes embodied AI de Meta FAIR travaillent sur des modules similaires de compréhension spatiale ouverte. AgentGrounder, encore au stade de preprint non évalué par les pairs, devra confirmer ses performances hors contexte académique avant toute adoption en conditions réelles.

Impact France/UE

Enchanted Tools (France), explicitement citée comme travaillant sur des modules similaires de compréhension spatiale ouverte, peut utiliser AgentGrounder comme référence zéro-shot pour réduire les coûts de fine-tuning dans ses déploiements robotiques.

À lire aussi

Manipulation dextérique à long horizon en zéro-shot par raisonnement VLM multi-vues ancré en 3D
1arXiv cs.RO 

Manipulation dextérique à long horizon en zéro-shot par raisonnement VLM multi-vues ancré en 3D

Des chercheurs ont publié le 19 juin 2026 sur arXiv (référence 2606.19340) un framework zero-shot pour la manipulation dextre à longue séquence, capable d'exécuter des tâches en plusieurs étapes sur des objets inconnus sans entraînement spécifique. Le système prend en entrée des instructions en langage naturel et des images RGB multi-vues calibrées, sans capteur de profondeur, et utilise un modèle vision-langage (VLM) pour générer des points-clés 2D dans un référentiel de vue de référence. Ces points sont ensuite reconstruits en 3D par fusion multi-vues combinant triangulation et une technique de "ray voting" : le système parcourt le rayon optique de la caméra principale pour identifier les candidats géométriquement cohérents dans les vues adjacentes. Les points-clés 3D obtenus supportent deux modes d'exécution : saisie-dépose directe et utilisation d'outils via la récupération d'une trajectoire outil stockée à 6 degrés de liberté (6DoF), alignée sur la configuration de scène courante. Un module bras-main génère ensuite les paires grasping-mouvement faisables. Les expériences réelles montrent que le système surpasse des baselines RGB-D vue unique et des VLA fine-tunés en précision de grounding 3D et en fiabilité d'exécution. L'enjeu central est la flexibilité de déploiement : un système zero-shot qui surpasse des VLA (Vision-Language-Action models) fine-tunés sur données spécifiques remet en question l'hypothèse dominante selon laquelle la manipulation dextre en environnement réel exige obligatoirement de larges datasets annotés et un réentraînement par tâche. Pour les intégrateurs industriels, cela signifie potentiellement des cycles de mise en production raccourcis, sans collecte systématique de démonstrations téléopérées pour chaque nouvel objet ou configuration. La boucle fermée de vérification d'état et de replanification (closed-loop replan) est particulièrement significative : elle distingue ce travail des approches open-loop qui accumulent les erreurs sur des séquences longues, un problème récurrent dans les démos de manipulation non supervisées. L'absence de capteur de profondeur réduit par ailleurs les contraintes matérielles à l'intégration sur des cellules robotiques existantes. Ce travail s'inscrit dans la tension croissante entre deux paradigmes : les VLA de bout-en-bout, comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou OpenVLA de Stanford, qui nécessitent supervision et données massives, et les approches modulaires exploitant les capacités de raisonnement de VLM existants sans réentraînement. Depuis 2023, les VLA dominent les benchmarks de manipulation dextre, mais leur coût en données et leur manque de généralisation zero-shot à de nouveaux objets freinent les déploiements industriels à grande échelle. À noter : ce preprint ne mentionne pas d'affiliation institutionnelle dans l'abstract disponible, ce qui limite l'évaluation de la maturité des résultats, et n'a pas encore été soumis à peer review. Aucun acteur européen n'est impliqué. Les suites naturelles seraient une validation sur les benchmarks standardisés DROID ou Open X-Embodiment, et une comparaison formelle avec les versions récentes de Pi-0 et GR00T N2 pour situer précisément les gains annoncés.

RechercheOpinion
1 source
VTLoc : localisation tactile de contact par apprentissage dans des nuages de points visuels
2arXiv cs.RO 

VTLoc : localisation tactile de contact par apprentissage dans des nuages de points visuels

Voici la traduction/résumé de l'article. Des chercheurs présentent VTLoc, un système d'apprentissage qui combine vision et toucher pour localiser précisément un point de contact tactile sur la surface d'un objet, à partir d'un nuage de points 3D issu d'une caméra. Le défi technique central est l'alignement spatial entre les données tactiles, très locales et ponctuelles, et la géométrie visuelle globale de l'objet. VTLoc s'appuie sur deux composants: un module d'alignement multimodal géométrique, qui reconstruit un pseudo-nuage de points à partir des caractéristiques visuelles-tactiles fusionnées puis l'aligne avec le nuage de points visuel réel pour garantir une cohérence spatiale entre les deux modalités; et un module de raffinement itératif, qui ajuste progressivement l'estimation du point de contact au fil des itérations en réexploitant les données fusionnées. Le système a été évalué sur un nouveau benchmark constitué de 100 objets réels, où il améliore la localisation d'un contact tactile unique en réduisant l'ambiguïté de correspondance entre repère local (le capteur tactile) et repère global (l'objet dans son ensemble). Pour l'industrie robotique, cette avancée s'attaque à un verrou concret de la manipulation fine: savoir exactement où un doigt ou un capteur tactile touche un objet est indispensable pour des tâches comme l'insertion de précision, la manipulation en aveugle partiel ou le réajustement de prise sans vision directe du point de contact. La plupart des systèmes actuels traitent vision et toucher comme des flux séparés ou les fusionnent de façon grossière, ce qui laisse une ambiguïté importante dès que le capteur tactile ne "voit" qu'une zone très locale de la surface. En démontrant une réduction mesurable de cette ambiguïté sur un benchmark réel de 100 objets plutôt que sur des simulations, VTLoc apporte une preuve empirique que la fusion géométrique multimodale peut combler l'écart entre la perception globale par caméra et le retour local par capteur tactile, un prérequis pour des manipulateurs plus autonomes en environnement encombré ou peu éclairé. Ce travail s'inscrit dans une lignée de recherche en perception visuo-tactile qui s'est accélérée avec la démocratisation de capteurs tactiles denses (type GelSight ou équivalents) et la maturation des architectures de nuages de points 3D pour la robotique. Il se positionne aux côtés d'efforts plus larges sur les modèles vision-langage-action (VLA) et les architectures de perception multimodale pour la manipulation, sans toutefois constituer un produit déployé: il s'agit d'une contribution de recherche publiée sur arXiv, évaluée en laboratoire, dont les suites naturelles seraient une intégration dans des pipelines de contrôle en boucle fermée et des tests sur des tâches de manipulation complètes plutôt que sur la seule localisation de contact.

RecherchePaper
1 source
Où suis-je ? Localisation multimodale par ancrage sémantique de cartes via des modèles vision-langage
3arXiv cs.RO 

Où suis-je ? Localisation multimodale par ancrage sémantique de cartes via des modèles vision-langage

Des chercheurs proposent une nouvelle approche de la localisation robotique en intérieur, dans les zones sans signal GPS, en la traitant comme un problème de raisonnement sémantique plutôt que d'estimation géométrique classique. L'équipe a affine le modèle vision-langage Qwen2.5-VL-7B via LoRA, en lui ajoutant une tête de régression légère qui prédit directement les coordonnées de pose continues (x, y, theta) a partir de l'état cache final, sans passer par une génération de texte. Le système reçoit trois entrées simultanées: une image de camera frontale, un scan LiDAR polaire, et une carte de grille sémantique vue du dessus. L'entrainement s'appuie sur une fonction de perte composite position-direction avec apprentissage par curriculum, sur un jeu de données Gazebo maison de 120 112 échantillons repartis sur 527 scènes. Sur un ensemble de test de 18 017 échantillons en distribution, le modèle atteint 98,23% de précision en position, 98,00% en direction et 96,75% de pose complète correcte, avec une erreur moyenne de position de 0,11 mètre, une erreur d'orientation de 5,7 degrés, et un temps de traitement de 0,62 seconde par échantillon. L'intérêt de ces résultats tient moins a la performance brute qu'a leur robustesse face a la généralisation, un point faible récurrent des systèmes de localisation bases sur l'apprentissage. Sur sept catégories d'objets jamais vues a l'entrainement, la précision de position ne chute que de 7,2 points, a 90,99%, ce qui suggère que le modèle raisonne réellement sur la sémantique spatiale plutôt que de mémoriser l'apparence des objets. Face a des cartes incomplètes ou périmées, un simple réajustement restaure la performance a 93,72% de précision, un scenario fréquent en usage réel ou les cartes ne sont pas toujours a jour. Pour les intégrateurs et les équipes robotique en environnement industriel ou logistique, ce travail ouvre une piste concrète pour réduire la dépendance aux pipelines SLAM géométriques, couteux a calibrer, dans des lieux déjà cartographies sémantiquement comme des entrepôts ou des usines. Il apporte aussi une preuve supplémentaire que des modèles vision-langage généralistes, une fois spécialisés, peuvent remplacer des chaines de perception sur mesure pour des taches de bas niveau comme l'estimation de pose. Deux études d'ablation éclairent la complémentarité des capteurs. Sans LiDAR, avec seulement la camera et la carte, la précision de position reste a 95,06%, a peine 3,2 points sous le système complet, ce qui montre que la vision seule porte l'essentiel du signal utile. Mais lorsque la camera fait face a un mur sans objet visible, le LiDAR permet de maintenir 92,33% de précision, contre 70,74% seulement quand ni le LiDAR ni des objets visibles ne sont disponibles, un cas typique d'occlusion ou de couloir peu structure. Ce travail s'inscrit dans la lignée de recherches récentes qui détournent les modèles vision-langage de leur usage génératif d'origine pour en faire des estimateurs de pose directs, une tendance déjà visible dans les architectures VLA comme Pi-0 ou GR00T N2, mais appliquée ici spécifiquement a la localisation plutôt qu'au contrôle moteur. Les auteurs positionnent leur méthode comme une alternative aux approches SLAM traditionnelles, potentiellement plus résiliente aux environnements dynamiques, sans toutefois avancer de calendrier de déploiement sur robot réel au-delà des simulations Gazebo présentées dans l'étude.

RecherchePaper
1 source
Ancrage visuel pour le contrôle vision-langage en zero-shot
4arXiv cs.RO 

Ancrage visuel pour le contrôle vision-langage en zero-shot

Une équipe de recherche a testé des modèles vision-langage (VLM) utilisés comme contrôleurs zero-shot via une batterie d'ablations : images aveugles, entrées répétées à l'identique, réflexion en miroir de la voie, lignes de base non visuelles et contrôles d'intégrité du pipeline. L'étude couvre neuf modèles à action directe, six VLM locaux structurés et une architecture hybride VLM-MPC, sur 32 874 appels notés, deux embodiments et trois simulateurs. Résultats majoritairement négatifs : une politique constante "SLOW" bat un contrôleur géométrique scripté, plusieurs modèles restent quasi insensibles à l'image, et ceux qui détectent bien les dangers longitudinaux échouent à inverser leurs décisions gauche/droite en miroir. Aucun VLM local ne remplit les deux critères de fondement visuel à la fois. Un contrôle positif purement visuel estime pourtant l'écart avec le véhicule précédent à 0,090 m d'erreur près, preuve que l'image contient bien l'information nécessaire. Ce travail questionne un postulat central des politiques vision-langage-action (VLA) en robotique et conduite autonome : qu'un modèle généraliste puisse piloter un système physique sans entraînement spécifique du simple fait qu'il "voit" l'image. Le test miroir est révélateur : un modèle vraiment fondé sur la perception inverserait sa décision quand l'image l'est, ce qui n'est presque jamais observé. Pour les intégrateurs tentés par un VLM prêt à l'emploi comme contrôleur direct, l'étude illustre un écart concret entre score en simulation et perception réelle. Un usage plus restreint fonctionne en revanche : un comité figé de deux modèles, votant entre vue originale et vue miroir, atteint 0,954 de précision équilibrée sur données tenues à l'écart, confirmé par validation croisée. Les VLM ressortent utilisables comme assistants de détection ciblés et calibrés, pas comme contrôleurs bout en bout. Cette étude s'inscrit dans un scepticisme méthodologique croissant envers les politiques VLA type Pi-0, GR00T N2 ou Helix, promues pour piloter bras robotiques et humanoïdes après entraînement à grande échelle. En privilégiant une batterie d'ablations rigoureuse plutôt que des scores de réussite en simulation, les auteurs proposent une méthode reproductible pour auditer ces systèmes avant déploiement, une démarche encore rare face aux annonces commerciales du secteur où vidéos sélectionnées et métriques de cycle mal contextualisées restent fréquentes. La suite logique serait d'étendre ces tests à des environnements réels, à d'autres familles de VLM propriétaires, et de valider le comité de consensus symétrique sur des flottes en conditions réelles.

RecherchePaper
1 source