Aller au contenu principal
SplatSearch : navigation vers une image cible pour robots mobiles via 3D Gaussian Splatting et modèles de diffusion
RecherchearXiv cs.RO 

SplatSearch : navigation vers une image cible pour robots mobiles via 3D Gaussian Splatting et modèles de diffusion

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent SplatSearch, une nouvelle architecture de navigation robotique permettant à un robot mobile de retrouver un objet ou une personne spécifique à partir d'une seule image de référence, prise sous un angle arbitraire. Le système s'appuie sur des reconstructions 3D par Gaussian Splatting (3DGS) construites à partir de vues éparses, une technique bien moins gourmande en données que les reconstructions denses classiques. SplatSearch génère plusieurs points de vue synthétiques autour des objets candidats grâce à cette carte 3DGS, puis utilise un modèle de diffusion multi-vues pour compléter les zones manquantes des images rendues, ce qui permet une mise en correspondance robuste avec l'image cible. Une politique d'exploration de frontières a également été développée : elle combine le contexte visuel des vues synthétisées et le contexte sémantique de l'image but pour hiérarchiser les zones à explorer en priorité. Les auteurs rapportent des performances supérieures aux méthodes de référence actuelles, mesurées en taux de réussite et en longueur de chemin jusqu'au succès, sur des environnements domestiques photoréalistes et des tests en conditions réelles. Une étude d'ablation confirme la pertinence des choix de conception retenus.

Cette avancée s'attaque à un problème central pour la robotique de service et l'inspection industrielle : la capacité d'un robot à localiser une cible précise dans un environnement inconnu, sans dépendre d'un scan 3D exhaustif préalable. La navigation par instance d'image (Instance Image Goal Navigation) est particulièrement exigeante lorsque l'image de référence est prise sous un angle très différent de celui du robot au moment de la recherche, un scénario fréquent en usage réel mais souvent contourné dans les benchmarks. En misant sur des reconstructions éparses complétées par diffusion plutôt que sur des cartes 3D denses coûteuses à construire, l'approche pourrait réduire le temps de calibration nécessaire au déploiement de robots de recherche et de récupération d'objets, un enjeu concret pour les intégrateurs travaillant sur des AMR en environnement domestique ou logistique.

Le travail s'inscrit dans la lignée des recherches combinant 3D Gaussian Splatting et navigation robotique, une technique de rendu apparue en 2023 et rapidement adoptée pour la cartographie temps réel en raison de sa rapidité par rapport aux champs de radiance neuronaux (NeRF). SplatSearch se positionne face aux méthodes état de l'art existantes en IIN, qu'il dépasse selon les métriques de taux de réussite et de longueur de chemin rapportées dans l'article, republié en version 2 sur arXiv. Le papier ne précise pas de partenariat industriel ni de calendrier de déploiement commercial ; il s'agit à ce stade d'une contribution de recherche académique, validée par simulation et par des tests réels limités, sans indication d'un acteur français ou européen impliqué.

Dans nos dossiers

À lire aussi

ReaDy-Go : simulation dynamique réel-vers-sim par Gaussian Splatting 3D pour la navigation visuelle avec obstacles mobiles
1arXiv cs.RO 

ReaDy-Go : simulation dynamique réel-vers-sim par Gaussian Splatting 3D pour la navigation visuelle avec obstacles mobiles

Des chercheurs présentent dans un preprint arXiv (référence 2602.11575, troisième version) un pipeline baptisé ReaDy-Go qui vise à combler l'écart simulation-réalité pour la navigation visuelle robotique en environnements dynamiques. Le principe : reconstruire une scène réelle cible (domicile, restaurant, usine) sous forme de nuage de gaussiennes 3D (Gaussian Splatting, ou GS), puis y insérer des avatars humains animables, eux aussi représentés en GS photoreáliste, dont les mouvements sont synthétisés à partir de trajectoires 2D. Un planificateur expert dédié aux représentations GS dynamiques, couplé à un planificateur humain, génère ensuite automatiquement des milliers de scénarios de navigation depuis des points de vue arbitraires. Les politiques de navigation entraînées sur ces datasets sont ensuite déployées sur robot physique. Les auteurs rapportent des gains de performance en simulation et en conditions réelles face à des obstacles mobiles, ainsi qu'un transfert zero-shot dans un environnement inédit, ce qui suggère une capacité de généralisation au-delà des scènes d'entraînement. L'enjeu industriel est significatif pour les intégrateurs de robots de service et les concepteurs de systèmes AMR (autonomous mobile robots) en environnements non contrôlés. Le verrou principal que ReaDy-Go cherche à lever est double : les méthodes classiques souffrent d'un sim-to-real gap important parce que les scènes d'entraînement sont génériques, et les obstacles dynamiques y sont soit absents, soit représentés par des mannequins non photoréalistes issus de simulateurs comme Isaac Sim ou Gazebo. En ancrant la simulation dans une reconstruction GS de l'environnement cible réel et en peuplant cette scène d'avatars humains photoréalistes et cinématiquement plausibles, l'approche réduit la distance de distribution entre entraînement et déploiement. Il s'agit d'une contribution méthodologique, pas d'un produit commercialisé ; les résultats restent à ce stade des démonstrations académiques, et les métriques annoncées (temps de cycle, taux de succès) gagneraient à être contextualisées par des conditions de test plus variées. Le Gaussian Splatting a émergé comme technique de reconstruction 3D rapide et photoréaliste depuis les travaux de Kerbl et al. en 2023, et plusieurs groupes l'ont depuis exploré pour la simulation robotique, notamment pour la manipulation (voir les travaux de RoboGSim ou GaussianWorld). ReaDy-Go se distingue en ciblant la navigation en présence de piétons, un cas d'usage critique pour les robots de livraison indoor et les plateformes de service en espace public. Sur ce segment, les concurrents directs incluent les pipelines basés sur NeRF (plus lents à l'entraînement), les simulateurs procéduraux type NVIDIA Omniverse, et des approches comme UniSim ou HabitatSim. Aucun acteur européen n'est cité dans le preprint, mais des équipes comme Enchanted Tools (robotique de service, France) ou les labos de navigation de l'INRIA pourraient trouver dans ReaDy-Go une brique de simulation réutilisable. La page projet est accessible et le code pourrait être publié ; les prochaines étapes naturelles seraient des tests à plus grande échelle avec diversité de populations et d'environnements, et une intégration dans des stacks de navigation open-source comme Nav2.

UECette méthode de simulation photoréaliste à base de Gaussian Splatting pourrait être réutilisée par des équipes européennes de navigation robotique (INRIA, Enchanted Tools) pour réduire le sim-to-real gap sans dépendre de simulateurs propriétaires comme Isaac Sim ou NVIDIA Omniverse.

RecherchePaper
1 source
EffiNav : fusion de la profondeur et du modèle vision-langage pour une navigation efficace vers des objets
2arXiv cs.RO 

EffiNav : fusion de la profondeur et du modèle vision-langage pour une navigation efficace vers des objets

Une équipe de chercheurs a publié EffiNav, un framework de navigation robotique orientée-objet (Object Goal Navigation, ObjNav) qui fusionne perception de profondeur et modèles vision-langage pour améliorer l'efficacité des trajectoires d'exploration en environnement inconnu. La contribution, déposée en preprint sur arXiv (2606.18634) en juin 2026, évalue le système sur deux simulateurs de référence du domaine, HM3D (Habitat Matterport 3D) et OVON (Open-Vocabulary Object goal Navigation), puis le valide sur robots physiques en conditions réelles. Les auteurs l'étendent également à GOAT-BENCH, un benchmark de navigation avec mémoire augmentée, pour démontrer la généralisation du framework au-delà du protocole ObjNav standard. Sur les deux métriques habituelles du domaine, taux de succès (SR) et succès pondéré par longueur de chemin (SPL), EffiNav égale ou dépasse les baselines récentes, sans que le preprint ne communique de valeurs numériques absolues permettant une comparaison chiffrée directe. L'apport principal porte moins sur le taux de réussite brut que sur le SPL, qui pénalise les trajets inutilement longs. C'est précisément là que les approches actuelles divergent : les modèles entraînés end-to-end, y compris certains VLA (Vision-Language-Action), peinent à généraliser à de nouveaux environnements, tandis que les frameworks modulaires sans apprentissage accumulent des allers-retours redondants et revisitent des zones déjà explorées. EffiNav prétend adresser ces deux pathologies simultanément en combinant une estimation de la profondeur pour la représentation géométrique de l'espace et un modèle vision-langage pour l'interprétation sémantique. Pour les intégrateurs de robots de service ou les décideurs B2B, l'efficacité de trajectoire est directement liée au temps disponible pour les tâches secondaires, donc à la rentabilité opérationnelle d'un déploiement en entrepôt ou en environnement indoor. Le champ ObjNav s'est structuré autour de l'écosystème Habitat de Meta AI Research, qui fournit les simulateurs HM3D et OVON utilisés ici. Les approches concurrentes incluent des pipelines modulaires à cartographie explicite comme SemExp ou OpenFMNav, et des VLA appliqués à la navigation. EffiNav se positionne comme un framework hybride ne nécessitant ni encodeurs supplémentaires lourds ni réentraînement complet par domaine. Aucune timeline commerciale ni partenariat industriel n'est mentionné dans le preprint ; la prochaine étape naturelle serait une validation sur des plateformes AMR variées pour confirmer le transfert sim-to-real sur des morphologies autres que celles testées.

RecherchePaper
1 source
VistaVLA : modèle vision-langage-action fondé sur du 3D gaussian splatting conscient de la géométrie et de la sémantique, pour la manipulation robotique
3arXiv cs.RO 

VistaVLA : modèle vision-langage-action fondé sur du 3D gaussian splatting conscient de la géométrie et de la sémantique, pour la manipulation robotique

VistaVLA, présenté dans un article arXiv publié le 15 juillet 2026, est un nouveau framework de manipulation robotique combinant vision, langage et action (VLA) qui construit une représentation 3D explicite de la scène à partir de primitives de Gaussiennes 3D. Contrairement aux modèles VLA classiques qui projettent directement instructions textuelles et images 2D vers des actions, VistaVLA fonctionne en deux étapes : il élève des caractéristiques vision-langage multi-vues en primitives gaussiennes 3D, créant des tokens sémantiques ancrés géométriquement, puis les compresse via un mécanisme baptisé Merge-then-Query (MtQ). Ce module réduit de 99% le nombre de tokens nécessaires tout en préservant les informations spatiales et sémantiques utiles à l'action. Les auteurs rapportent des gains de 22,8% du taux de réussite sur sept tâches réelles, et de 30% par rapport à la baseline VLA-Adapter sur des tâches hors distribution (out-of-distribution), en environnement simulé comme réel. Pour l'industrie robotique, ce travail cible un point faible connu des modèles VLA actuels : leur absence de représentation 3D persistante et invariante au point de vue, qui limite leur capacité à raisonner sur des contraintes géométriques et des layouts spatiaux complexes. La plupart des VLA en production s'appuient sur des flux caméra 2D bruts ou des cartes de profondeur peu structurées ; VistaVLA propose une carte cognitive 3D sémantique inspirée de la cognition humaine, un argument qui, s'il se confirme à plus grande échelle, pourrait influencer la conception des prochaines générations de politiques d'action pour bras manipulateurs et robots mobiles. Ce travail s'inscrit dans une vague de recherche académique cherchant à combler l'écart entre modèles VLA à succès commercial, comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure, et leurs limites documentées en generalisation spatiale. Les résultats restent pour l'instant issus d'évaluations contrôlées en laboratoire, sans déploiement industriel annoncé ; la validation sur des tâches de manipulation plus variées et à plus grande échelle reste la prochaine étape naturelle pour ce type d'approche.

RechercheActu
1 source
SONG : une plateforme de simulation 3D en Gaussian Splatting photoréaliste pour évaluer la navigation sociale
4arXiv cs.RO 

SONG : une plateforme de simulation 3D en Gaussian Splatting photoréaliste pour évaluer la navigation sociale

Sortie automatisée de mouvements corporels complets à partir de ces trajectoires. Un chercheur propose SONG, une plateforme de simulation pour la navigation sociale robotique, construite sur le 3D Gaussian Splatting (3DGS), une technique de rendu photoréaliste qui reconstruit à la fois les scènes et les avatars humains évoluant dedans. Les piétons virtuels ne suivent pas des scripts fixes: leurs trajectoires sont générées par un grand modèle de langage de façon sémantiquement cohérente, puis converties en mouvements corporels continus via un générateur conditionné par trajectoire. Autour de cette plateforme, les auteurs construisent SONG-Bench, un ensemble de scénarios d'évaluation classés par niveau de difficulté, associé à une suite de métriques multidimensionnelles couvrant l'efficacité du déplacement, la sécurité et le respect des conventions sociales. Le travail est décrit dans un article déposé sur arXiv (2607.25219v1) comme une nouvelle soumission. L'enjeu dépasse le simple outil de test. Jusqu'ici, les simulateurs de navigation sociale souffraient d'un compromis frustrant: soit ils offraient des observations visuelles pauvres, soit ils manquaient d'avatars humains mobiles, soit leur rendu et le comportement des piétons restaient trop éloignés du réel pour valider des algorithmes de navigation guidés uniquement par la vision embarquée. En évaluant des méthodes de référence sur SONG-Bench, les auteurs tirent trois constats qui pèsent sur tout le secteur de la robotique mobile: la navigation sociale basée vision est loin d'être résolue, les modèles actuels présentent un déficit de sécurité plus criant encore que leurs manquements en étiquette sociale, et l'entraînement sur des données réelles compte davantage que la simple augmentation de la taille des modèles. Point notable, les auteurs montrent qu'un ajustement fin sur les données qu'ils ont constituées améliore concrètement le taux de réussite en conditions réelles, ce qui distingue cette contribution d'une simple démonstration en simulation. Ce travail s'inscrit dans une trajectoire de recherche qui est passée d'environnements 2D simplifiés à des cadres visuels plus exigeants, où le robot ne dispose que de sa caméra embarquée pour se comporter correctement en présence d'humains. Les auteurs présentent SONG comme un banc d'essai destiné à structurer la prochaine génération de recherches sur la navigation sociale visuelle, sans toutefois annoncer de partenariat industriel ou de déploiement au-delà du cadre académique à ce stade.

RecherchePaper
1 source