Aller au contenu principal
DIPOLE : fusion vision et géométrie pour une généralisation visuomotrice robuste
RecherchearXiv cs.RO 

DIPOLE : fusion vision et géométrie pour une généralisation visuomotrice robuste

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont publié sur arXiv (2511.22445) une politique visuomotrice baptisée DIPOLE, pour DIffusion POlicy with compLementarity Encoders, conçue pour rendre les robots manipulateurs robustes aux variations de conditions réelles. L'architecture fusionne deux modalités complémentaires, vision RGB et géométrie 3D, via un mécanisme d'entraînement en deux temps : un dropout par modalité force chaque branche à rester individuellement informative, puis une couche cross-attention légère échange les indices complémentaires entre les deux. Évalué sur 18 tâches en simulation et 4 tâches en conditions réelles, DIPOLE surpasse six méthodes de référence de 39,1 % en moyenne. Les gains sont particulièrement marqués face à des distracteurs visuels non vus à l'entraînement (+41,5 %) et lors de placements d'objets aléatoires (+15,2 %). Le système atteint une précision spatiale inférieure au centimètre et démontre un transfert zéro-shot vers des objets non rencontrés pendant l'apprentissage.

Ce résultat s'attaque directement au problème central de la robotique de manipulation : la fragilité des politiques apprises par imitation dès que les conditions de déploiement dévient du jeu de démonstration. Changement d'éclairage, de texture, d'angle de caméra ou d'instance d'objet suffisent généralement à faire chuter les performances de façon dramatique. DIPOLE contourne ce problème sans architecture de fusion spécialisée ni données supplémentaires, ce qui est notable : le mécanisme de dropout contraint le modèle à apprendre des représentations redondantes et complémentaires simultanément. Le transfert zéro-shot vers des objets inédits suggère une généralisation structurelle plutôt que mémorisation, un point que les industriels cherchant à déployer en environnement ouvert suivront de près.

DIPOLE s'inscrit dans la lignée des politiques de diffusion, popularisées depuis 2023 comme alternative aux approches autorégressive type ACT. La fusion vision-géométrie est un axe actif : des travaux comme RVT, 3D Diffusion Policy ou Act3D avaient montré l'intérêt de la 3D pour la précision spatiale, mais au prix d'une complexité architecturale élevée. DIPOLE propose une voie plus légère, sans module de fusion dédié. Les concurrents directs incluent Octo, OpenVLA et les variantes de Diffusion Policy de l'équipe de Chelsea Finn. Aucun partenaire industriel ni calendrier de déploiement n'est mentionné dans la publication, qui reste à ce stade un résultat académique à valider sur des manipulateurs et environnements industriels réels.

Dans nos dossiers

À lire aussi

GWM-VLA : une modélisation latente du monde tenant compte de la géométrie pour le VLA
1arXiv cs.RO 

GWM-VLA : une modélisation latente du monde tenant compte de la géométrie pour le VLA

Publié sur arXiv sous la référence 2608.07619 (août 2026), GWM-VLA est un nouveau cadre de modélisation latente du monde pour les modèles vision-langage-action (VLA) utilisés en manipulation robotique. L'architecture combine trois éléments : un module d'encodage multi-vues géométriquement conscient, nommé VGGT-Ω, qui agrège à chaque pas de temps les flux de plusieurs caméras pour construire un état multi-vues cohérent ; un modèle du monde latent qui prédit uniquement les tokens de patch de l'étape suivante pour une vue cible unique, la caméra de poignet du bras robotique dans les expériences, plutôt que de reconstruire l'intégralité de la scène multi-vues ; et une représentation d'action latente partagée qui conditionne à la fois ce modèle du monde et une tête d'action par flow-matching, entraînée simultanément par supervision de prédiction latente et par les actions robotiques réelles. Les auteurs testent le système en simulation et sur robot réel, sans détailler de chiffres de performance dans le résumé public. L'enjeu vise une faiblesse connue des VLA : leurs performances de manipulation, solides en conditions contrôlées, se dégradent souvent face à des changements visuels ou environnementaux comme l'éclairage, la position de caméra ou l'arrière-plan. La plupart des modèles du monde latents existants encodent chaque vue caméra indépendamment et prédisent la dynamique globale de la scène sans modéliser explicitement les relations géométriques entre vues, ce qui fragilise la robustesse. En imposant une cohérence géométrique multi-vues dès l'encodage, GWM-VLA s'inscrit dans les efforts récents pour combler l'écart entre démonstrations en laboratoire et déploiement réel, un point sensible pour les intégrateurs qui évaluent des politiques VLA de type Pi-0, GR00T N2 ou Helix pour des lignes de production ou de la logistique, où la variabilité des scènes est la norme plutôt que l'exception. GWM-VLA s'ajoute à une vague de recherches associant modélisation du monde et apprentissage d'actions pour renforcer la généralisation des politiques robotiques, un axe explore en parallèle par plusieurs laboratoires travaillant sur les architectures VLA à grande échelle. L'article ne précise ni l'affiliation institutionnelle des auteurs ni de comparaison chiffrée avec des bases de référence publiées, ce qui en fait pour l'instant une contribution académique en preprint, non revue par les pairs, plutôt qu'un produit ou un déploiement industriel. Aucune date de publication en conférence, aucun partenariat industriel ni feuille de route de déploiement ne sont mentionnés ; la validation indépendante de la robustesse annoncée reste donc à établir par la communauté.

RecherchePaper
1 source
DiffusionVS : un cadre génératif pour l'asservissement visuel robuste basé sur la politique de diffusion
2arXiv cs.RO 

DiffusionVS : un cadre génératif pour l'asservissement visuel robuste basé sur la politique de diffusion

DiffusionVS, déposé sur arXiv (2506.19397) en juin 2026, propose un cadre génératif pour le visual servoing robotique fondé sur la Diffusion Policy. Le système prend en entrée les coordonnées normalisées des coins de marqueurs visuels observés par la caméra embarquée, et génère des commandes de vitesse caméra via un processus de débruitage conditionnel. Pour contourner les limitations de généralisation propres aux modèles entraînés sur jeux de données statiques, les auteurs adoptent un paradigme d'entraînement en ligne : le modèle collecte continuellement de nouvelles expériences interactives pour diversifier sa distribution d'apprentissage. Les résultats rapportés atteignent un taux de succès de quasi 100% en simulation et 93% en expériences physiques réelles. Le visual servoing par régression classique souffre de deux problèmes structurels : le jitter de trajectoire causé par des mappings mono-étape sensibles au bruit, et l'accumulation d'erreurs lors de distribution shifts en cours de trajectoire. La Diffusion Policy adresse ces deux points simultanément. En prédisant des séquences d'actions plutôt que des commandes isolées, elle maintient la cohérence temporelle. L'augmentation implicite de données inhérente au processus de débruitage renforce par ailleurs la robustesse aux perturbations. Ce qui est notable, au-delà des performances brutes, c'est la généricité démontrée du module : intégré à des architectures de visual servoing existantes, il améliore systématiquement leurs résultats, sans modification de leur pipeline de base. Cela valide le mécanisme diffusion comme composant réutilisable, pas seulement comme architecture ad hoc. La Diffusion Policy, popularisée par Chi et al. en 2023 (Columbia/MIT), s'est imposée en apprentissage par imitation pour la manipulation, puis adoptée par Physical Intelligence dans pi-0 et d'autres systèmes VLA. Son application au visual servoing, problème classique de robotique de précision, était moins explorée. Les approches concurrentes restent dominées par la régression directe ou les contrôleurs IBVS/PBVS à base de features géométriques. La contribution principale ici est l'entraînement en ligne, qui contourne le problème de covariate shift sans nécessiter un dataset exhaustif pré-collecté, contrainte majeure en déploiement industriel. Les limites actuelles sont notables : le système repose sur des marqueurs visuels structurés (AprilTags), et les expériences physiques ne précisent pas le type de robot ni les conditions d'environnement, ce qui rend difficile l'évaluation de la maturité pour un déploiement réel.

RecherchePaper
1 source
Structured Observation Language pour la navigation vision-langage efficace et généralisable
3arXiv cs.RO 

Structured Observation Language pour la navigation vision-langage efficace et généralisable

Une équipe de recherche propose SOL-Nav (Structured Observation Language for Navigation), une nouvelle méthode de navigation par instructions en langage naturel pour agents embarqués, décrite dans un article déposé sur arXiv (2603.27577v2). Plutôt que de convertir les images en tokens visuels ou en représentations implicites comme le font la plupart des systèmes de Vision-Language Navigation (VLN) actuels, SOL-Nav découpe chaque image RGB-D captée par l'agent en une grille de N par N cellules, puis extrait pour chaque cellule des informations sémantiques, de couleur et de profondeur. Ces données sont transformées en texte structuré, concaténé directement avec l'instruction en langage naturel, avant d'être transmises telles quelles à un modèle de langage pré-entraîné (PLM). L'ensemble du pipeline évite ainsi tout module de vision dédié. Les auteurs rapportent des résultats sur les benchmarks standards R2R et RxR ainsi que des tests en conditions réelles, avec une réduction significative de la taille du modèle et de la dépendance aux données d'entraînement visuel. L'intérêt principal de cette approche réside dans la généralisation : les méthodes VLN classiques, qui s'appuient sur un pré-entraînement visuel massif, tendent à mal résister aux variations d'environnement comme les changements d'éclairage ou de texture. En reformulant l'observation visuelle en langage structuré, SOL-Nav exploite directement les capacités de raisonnement des PLM sans repasser par un espace latent visuel fragile. Pour les équipes travaillant sur la navigation robotique autonome, cela suggère une voie alternative aux architectures VLA lourdes, potentiellement plus légère à déployer et moins gourmande en données d'entraînement spécifiques à un environnement. Ce travail s'inscrit dans la lignée des recherches en VLN qui cherchent depuis plusieurs années à combler l'écart entre performance en simulation et robustesse réelle, un problème récurrent pointé par le secteur pour les agents de navigation entraînés sur des jeux de données comme R2R ou RxR. La validation en conditions réelles annoncée par les auteurs, au-delà des seuls benchmarks académiques, laisse présager des travaux de suivi visant à tester la méthode sur des plateformes robotiques variées et des instructions plus complexes.

RecherchePaper
1 source
OC-VLA++ : cohérence multi-vue guidée par géométrie monoculaire pour une manipulation robotique robuste au point de vue
4arXiv cs.RO 

OC-VLA++ : cohérence multi-vue guidée par géométrie monoculaire pour une manipulation robotique robuste au point de vue

Le laboratoire à l'origine d'OC-VLA publie une extension baptisée OC-VLA++, qui vise à corriger un angle mort connu des modèles vision-langage-action (VLA) pour la manipulation robotique : la généralisation à des points de vue caméra non vus pendant l'entraînement. La méthode originale, OC-VLA, ancrait déjà les prédictions d'action dans le repère de la caméra plutôt que dans le repère robot, pour aligner la supervision avec l'observation visuelle. Mais les auteurs montrent que cet ancrage seul reste sujet au surapprentissage lorsque peu de points de vue sont couverts à l'entraînement. OC-VLA++ ajoute deux mécanismes : une supervision par paires de vues guidée par la géométrie, et un objectif explicite d'équivariance d'action inter-vues. Concrètement, le modèle reçoit des paires d'observations d'une même scène de manipulation, prises sous des angles géométriquement reliés, et apprend à produire des prédictions dans l'espace caméra qui correspondent à la même action une fois ramenées au repère du robot. Le papier, publié en preprint sur arXiv (2608.01066v1), rapporte des gains « substantiels » en généralisation à des vues inédites sous couverture caméra limitée, avec une dégradation plus progressive à mesure que le déplacement de caméra augmente, sans toutefois fournir de chiffres précis de taux de réussite dans le résumé, ce qui invite à rester prudent avant validation indépendante. Pour les intégrateurs et les équipes robotique, le sujet touche à un problème très concret : la plupart des déploiements industriels utilisent un nombre restreint de caméras fixes, et un modèle VLA entraîné sur ces angles précis échoue souvent dès qu'une caméra est repositionnée, remplacée ou que la cellule de travail change de configuration. Si l'équivariance d'action inter-vues tient ses promesses au-delà du cadre expérimental du papier, elle pourrait réduire le besoin de collecter des données massives multi-caméras pour chaque nouvelle installation, un poste de coût important dans le déploiement des VLA à grande échelle. Cela s'inscrit dans un débat plus large du secteur sur l'écart entre démonstrations en laboratoire et robustesse réelle : beaucoup de modèles VLA impressionnent sur les vues d'entraînement mais généralisent mal dès que l'environnement visuel bouge, un des obstacles cités au passage à l'échelle des humanoïdes et bras manipulateurs. Le travail se situe dans la lignée directe d'OC-VLA, dont il corrige une limite identifiée par ses propres auteurs plutôt que de proposer une architecture radicalement nouvelle. Le papier ne mentionne pas de comparaison directe avec les autres familles de VLA du moment comme Pi-0, GR00T N2 ou Helix, et ne précise pas si les expériences ont été menées en simulation, sur robot réel, ou les deux, une information qu'on aimerait voir clarifiée avant de juger de la portée réelle des résultats. Les auteurs présentent ces résultats comme un argument en faveur de l'équivariance d'action inter-vues comme complément à l'ancrage centré sur l'observation, en vue d'un déploiement robuste en conditions réelles, mais aucun calendrier de test terrain ni partenariat industriel n'est annoncé à ce stade. Le texte reste, pour l'instant, une contribution de recherche publiée en preprint, sans revue par les pairs ni suite commerciale connue.

RechercheActu
1 source