Aller au contenu principal
VoLN : navigation à long terme uniquement par vision (paradigme, référentiel et méthode)
RecherchearXiv cs.RO 

VoLN : navigation à long terme uniquement par vision (paradigme, référentiel et méthode)

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent VoLN (Vision-Only Long-Horizon Navigation), un nouveau paradigme de navigation pour agents embarqués qui se passe totalement d'instructions en langage naturel détaillées. Publié sur arXiv le 24 juillet 2026, ce travail part d'un constat : dans la navigation vision-langage classique (VLN), les instructions de type "tournez à droite après 50 mètres" encodent des informations spatiales (orientation, distance, disposition des lieux) que l'agent ne peut pas réellement percevoir depuis ses seuls capteurs, surtout dans des environnements ouverts sans GPS. VoLN retire ces indices explicites : seule une image de destination est fournie, et l'agent doit repérer, interpréter et suivre des repères visuels locaux pour progresser. L'équipe a instancié ce paradigme pour le vol de drones avec VoLN-UAV, un benchmark de 7 210 épisodes combinant vols longue distance orientés objectif, mouvements 3D continus, changements de point de vue importants et sélection de balises dépendante du contexte. Un modèle de référence, VoLN-MLLM, aligne des caractéristiques visuelles auto-supervisées sur un espace sémantique structuré et prédit des segments de trajectoire courts à partir de l'historique d'observation, des vues cibles, de tokens visuo-sémantiques récupérés et de la proprioception.

Les résultats obtenus sur le split Test-Unseen (cinq environnements) sont particulièrement bas : 7,4% de réussite sur les épisodes faciles, 4,5% sur les normaux et seulement 1,8% sur les difficiles. Ces chiffres, très inférieurs aux performances habituellement rapportées en VLN classique, illustrent l'écart entre la navigation guidée par instructions explicites et une navigation purement visuelle où l'agent doit reconstruire lui-même la structure de l'itinéraire. Pour les équipes travaillant sur l'autonomie des drones et des robots en environnements GPS-denied, ce résultat sert d'avertissement : les scores impressionnants obtenus sur les benchmarks VLN traditionnels reflètent en partie la richesse des instructions fournies, pas uniquement la capacité de perception et de décision de l'agent.

VoLN s'inscrit dans la lignée des travaux sur la navigation vision-langage, en proposant une lecture complémentaire plutôt qu'un remplacement des benchmarks existants. En isolant la composante purement visuelle du problème, les auteurs cherchent à mesurer séparément l'intégration d'indices sur un horizon long, l'appariement d'images entre différents points de vue et la stabilité en boucle fermée, trois faiblesses identifiées comme majeures par leurs expériences. Le code et les détails du benchmark sont disponibles sur la page du projet, ouvrant la voie à des comparaisons futures pour d'autres plateformes robotiques que les drones.

Dans nos dossiers

À lire aussi

RAVEN : raisonnement à long horizon et navigation avec une mémoire visuo-spatio-temporelle
1arXiv cs.RO 

RAVEN : raisonnement à long horizon et navigation avec une mémoire visuo-spatio-temporelle

Des chercheurs ont publié RAVEN (arXiv:2606.25206), un système de mémoire agentique conçu pour les robots devant opérer sur de longues durées sans réinitialisation. Le système stocke des embeddings visuels enrichis de données de pose et d'horodatage dans une base vectorielle, puis ancre la récupération dans une carte spatiale pour répondre à des requêtes ou naviguer vers des objectifs exprimés en langage naturel. Contrairement aux approches classiques qui convertissent les images en descriptions textuelles, RAVEN opère directement sur les représentations visuelles brutes, évitant la perte d'information sémantique inhérente à cette étape de transcription. Le système a été évalué sur plusieurs benchmarks de question-réponse vidéo en simulation et en environnement réel, puis déployé physiquement sur un robot quadrupède Unitree Go1 pour des tâches de navigation longue portée dans de grands espaces intérieurs. Les résultats publiés indiquent que RAVEN surpasse systématiquement les mémoires à base de captioning sur les benchmarks long-horizon, tout en égalant les VLM de pointe à un coût de récupération dix fois inférieur. Ce ratio coût-performance est directement pertinent pour les intégrateurs : maintenir une mémoire épisodique précise sur des heures ou des jours de déploiement est l'un des verrous principaux vers l'autonomie prolongée. La capacité à répondre à des questions sémantiques et spatiales depuis une mémoire compacte ouvre la voie à des robots de service, de logistique ou d'inspection capables de missions multi-sessions, sans réinitialisation entre chaque passage. Il faut cependant noter que les benchmarks et environnements de test restent contrôlés : le fossé entre performance en labo et déploiement industriel à grande échelle n'est pas encore comblé. La mémoire à long terme est un défi structurel de la robotique autonome depuis l'essor des approches LLM+captioning popularisées entre 2022 et 2024 (SayPlan, CLIP-Nav et leurs dérivés), lesquelles sacrifient la précision visuelle au profit de la flexibilité textuelle. RAVEN s'inscrit dans une tendance croissante de mémoires vectorielles embarquées, proche des architectures RAG transposées au robotique, en compétition conceptuelle avec des systèmes comme SpatialVLM ou MemoryOS. Le Unitree Go1, quadrupède commercialisé autour de 9 000 dollars, sert ici de plateforme de validation accessible, ce qui renforce la reproductibilité potentielle. Aucun partenariat industriel ni calendrier de productisation n'est annoncé : RAVEN demeure une contribution de recherche dont l'impact concret dépendra de la qualité du code publié et de son éventuelle intégration dans des frameworks ouverts comme ROS2.

RecherchePaper
1 source
LH-AVLN : un benchmark pour la navigation audio-visuo-langagière à long terme
2arXiv cs.RO 

LH-AVLN : un benchmark pour la navigation audio-visuo-langagière à long terme

Des chercheurs présentent LH-AVLN (Long-Horizon Audio-Visual-Language Navigation), un nouveau benchmark pour évaluer des agents de navigation autonome devant accomplir des missions longues combinant vision, langage et audio spatialisé. Contrairement aux benchmarks existants, généralement silencieux et centrés sur un objectif unique, LH-AVLN impose à l'agent une mission globale de deux à quatre objectifs, spécifiés soit par catégorie d'objet, soit par description en langage naturel, soit par image de référence. L'agent navigue dans des environnements intérieurs en 3D à l'aide d'observations RGB-D, de données de pose et de son binaural persistant, les missions pouvant être ordonnées ou non. Les chercheurs ont aussi développé PAG-Nav, un agent de référence sans entraînement (training-free) qui construit une carte sémantique temporelle uniforme et planifie ses déplacements de façon progressive, utilisant le son pour guider la recherche hors champ de vision tout en réservant la confirmation finale d'un objectif à une vérification visuelle et sémantique. Ce travail met en lumière un écart important entre les capacités démontrées par les agents actuels et les exigences de missions longues et multimodales. Les tests montrent que les agents existants, qu'ils soient basés sur la vision-langage, la mémoire ou l'audio-visuel, échouent largement à compléter des missions LH-AVLN dans leur intégralité. Ce constat interroge la solidité réelle des approches de navigation incarnée dès qu'elles sortent du cadre mono-objectif habituel des benchmarks académiques, un signal utile pour les équipes de recherche en robotique mobile et en IA incarnée qui cherchent à évaluer la maturité réelle de leurs systèmes avant tout déploiement. LH-AVLN s'inscrit dans une tendance de fond de la recherche en navigation incarnée, qui délaisse progressivement les tâches ponctuelles pour des scénarios de mission complexes et prolongés, plus proches des besoins réels en robotique de service ou d'inspection. En proposant simultanément des indices sonores persistants, des spécifications d'objectifs hétérogènes et des missions multi-étapes, ce benchmark comble un vide par rapport aux travaux antérieurs en navigation audio-visuelle, généralement focalisés sur un seul objectif. PAG-Nav, présenté comme référence diagnostique plutôt que solution définitive, laisse une marge de progression substantielle, ouvrant la voie à de futurs travaux combinant mieux perception multimodale et planification à long terme.

RecherchePaper
1 source
UAV-ON : un référentiel pour la navigation aérienne autonome vers des objets en monde ouvert
3arXiv cs.RO 

UAV-ON : un référentiel pour la navigation aérienne autonome vers des objets en monde ouvert

Un nouveau benchmark baptisé UAV-ON vise à évaluer la capacité de drones autonomes à localiser des objets dans de vastes environnements ouverts, sans dépendre d'instructions linguistiques détaillées. Publié sur arXiv (2508.00288v5), le jeu de données couvre 14 environnements haute fidélité construits sous Unreal Engine, mêlant zones urbaines, milieux naturels et espaces mixtes, avec des agencements spatiaux complexes. Il définit 1270 objets cibles annotés individuellement, chacun décrit par une instruction de niveau instance précisant la catégorie, l'emprise physique et des descripteurs visuels, permettant un raisonnement ancré dans la scène. Les chercheurs ont aussi implémenté plusieurs méthodes de référence, dont Aerial ObjectNav Agent (AOA), une politique modulaire combinant sémantique de l'instruction et observations égocentriques pour une exploration orientée objectif sur de longs horizons. Résultat: tous les modèles testés peinent à accomplir la tâche, ce qui souligne la difficulté cumulée de la navigation aérienne et de l'ancrage sémantique des objectifs. Ce benchmark marque une rupture avec le paradigme dominant de la navigation vision-langage (VLN), qui repose sur des séquences d'instructions pas à pas et limite de fait l'autonomie et le passage à l'échelle des agents. En proposant une tâche d'Object Goal Navigation où l'agent ne reçoit qu'un objectif sémantique de haut niveau, UAV-ON teste une compétence plus proche des besoins réels d'inspection, de surveillance ou de cartographie par drone. L'échec généralisé des baselines confirme que le passage d'instructions détaillées à des objectifs sémantiques abstraits reste un verrou majeur, loin d'être résolu malgré les progrès des modèles vision-langage-action sur d'autres plateformes robotiques. La navigation aérienne embarquée demeure sous-explorée comparée à la navigation terrestre, où les benchmarks VLN se sont multipliés ces dernières années. UAV-ON s'inscrit dans cette lignée en l'adaptant aux contraintes spécifiques du vol: grande échelle, environnements non structurés, absence de repères au sol. Les auteurs positionnent ce travail comme une fondation pour de futures recherches sur l'autonomie UAV pilotée par des descriptions sémantiques, ouvrant la voie à des méthodes capables de généraliser au-delà des scénarios scriptés actuels.

RecherchePaper
1 source
Ce que révèlent réellement les méthodes RL pour la navigation vers un objectif : étude empirique et cadre unifié
4arXiv cs.RO 

Ce que révèlent réellement les méthodes RL pour la navigation vers un objectif : étude empirique et cadre unifié

Traduction et synthèse en français, format article autonome : Une équipe de recherche publie une étude empirique à grande échelle sur les systèmes de navigation vers un objet cible (Object-Goal Navigation, ObjectNav) basés sur l'apprentissage par renforcement (RL), une capacité clé pour déployer des robots mobiles dans des environnements du quotidien comme les foyers, les écoles ou les lieux de travail. La tâche consiste, pour un agent équipé uniquement de perception embarquée, à localiser un objet cible dans un environnement inconnu, ce qui combine compréhension sémantique, raisonnement spatial et planification à long horizon. Les chercheurs décomposent le pipeline de navigation en trois modules, perception, politique de décision et stratégies d'amélioration au moment de l'inférence, et mènent des expériences contrôlées pour isoler la contribution de chacun. Sur cette base, ils construisent un système unifié qui établit un nouvel état de l'art sur le benchmark Gibson, avec un gain de 6,6% en SPL (Success weighted by Path Length) et de 2,7% en taux de réussite par rapport aux méthodes précédentes. Ils introduisent également une référence humaine, atteignant 98% de réussite. Le papier est disponible sur arXiv (2510.01830, version révisée) avec une page projet dédiée. Le résultat le plus significatif pour le secteur tient au diagnostic des leviers de performance: contrairement à une hypothèse répandue selon laquelle les gains proviennent surtout de politiques de décision plus sophistiquées, l'étude montre que la qualité de la perception et les stratégies appliquées au moment du test apportent des gains souvent supérieurs. Pour les équipes qui conçoivent des robots domestiques ou de service, cela oriente l'investissement en ingénierie vers la perception et l'inférence plutôt que vers la seule complexification des architectures de politique. L'écart persistant entre les meilleurs agents RL actuels et les 98% de réussite humaine rappelle aussi que la navigation en environnement inconnu reste loin d'être résolue malgré les progrès affichés sur les benchmarks. Le RL s'est imposé comme paradigme dominant pour l'ObjectNav ces dernières années, mais la multiplication des choix de conception, modules de perception, architectures de politique, techniques d'inférence, rendait difficile d'identifier ce qui compte réellement. En structurant ces choix dans un cadre unifié et en publiant des recommandations pratiques module par module, les auteurs visent à orienter les prochains travaux de recherche sur des bases plus rigoureuses que l'empilement de composants ad hoc.

RecherchePaper
1 source