Aller au contenu principal
StreamVLN : navigation vision-langage en flux continu via modélisation contextuelle SlowFast
RecherchearXiv cs.RO 

StreamVLN : navigation vision-langage en flux continu via modélisation contextuelle SlowFast

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Chercheurs présentent StreamVLN, un framework de navigation vision-langage (VLN) conçu pour fonctionner en flux continu plutôt que sur des séquences vidéo pré-découpées. Publié sur arXiv (version 2, remplaçant une première mouture du 05/07/2025 sous la référence 2507.05240), le système repose sur une architecture dite "slow-fast" : un contexte de dialogue rapide gère une fenêtre glissante d'échanges multi-tours pour générer des actions avec une latence minimale, tandis qu'une mémoire à mise à jour lente compresse l'historique visuel via une stratégie d'élagage de tokens tenant compte de la géométrie 3D de la scène. Grâce à la réutilisation du cache KV, StreamVLN maintient des dialogues en temps réel sur des flux vidéo longs, avec une taille de contexte et un coût d'inférence bornés, quelle que soit la durée du flux. Sur les benchmarks VLN-CE, référence du domaine pour évaluer la navigation guidée par instructions en environnement continu, les auteurs revendiquent des performances état de l'art combinées à une faible latence.

L'enjeu dépasse la simple performance sur benchmark : les modèles vidéo-LLM appliqués à la navigation robotique butent généralement sur un compromis entre compréhension visuelle fine, mémorisation du contexte long terme et coût de calcul, un compromis qui freine leur déploiement embarqué sur robots mobiles ou humanoïdes à ressources limitées. En bornant le coût d'inférence indépendamment de la longueur du flux vidéo, StreamVLN répond directement à un obstacle pratique du secteur : faire tourner un agent VLA (vision-language-action) en continu, sans dérive de latence ni explosion mémoire, condition nécessaire pour une navigation autonome réactive en environnement réel plutôt qu'en simulation contrôlée ou sur clips vidéo courts.

Le travail s'inscrit dans la lignée des approches VLN basées sur des Video-LLM apparues ces deux dernières années, qui cherchaient à exploiter les capacités de raisonnement multimodal de ces modèles pour l'instruction-following robotique, au prix jusqu'ici d'architectures gourmandes en contexte. La publication d'une version 2 sur arXiv indique une itération après retours ou revue, sans changement de statut : il s'agit toujours d'un travail de recherche, avec code et démonstrations disponibles sur la page projet (streamvln.github.io), et non d'un produit ou d'un déploiement industriel annoncé. La suite logique pour ce type d'approche reste son intégration et sa validation sur plateformes robotiques physiques, au-delà des benchmarks simulés VLN-CE.

Dans nos dossiers

À lire aussi

FSD-VLN : modélisation duale rapide-lente pour la navigation aérienne vision-langage à long horizon
1arXiv cs.RO 

FSD-VLN : modélisation duale rapide-lente pour la navigation aérienne vision-langage à long horizon

Des chercheurs publient sur arXiv (papier 2607.08359, juillet 2026) FSD-VLN, une architecture de navigation aérienne guidée par le langage destinee aux drones (UAV) évoluant en environnement inconnu, sans dépendance GPS ni trajectoire préprogrammée. Le système repose sur deux flux asynchrones : un flux "lent" qui extrait des priors sémantiques stables a partir de modèles vision-langage pré-entraines, et un flux "rapide" fonde sur un Diffusion Transformer (DiT) qui modélise les distributions d'actions dans le temps pour générer des commandes de vol cohérentes. Un optimiseur adaptatif sensible au temps a été intègre pour stabiliser l'entrainement sur de longues séquences et limiter les oscillations de gradient. En simulation a grande échelle sur des scenarios de vol a basse altitude, FSD-VLN atteint un taux de réussite de navigation jusqu'a deux fois supérieur aux méthodes de référence sur des scènes inédites, tout en réduisant de plus de 50% le délai d'inférence par action et la durée totale des taches. L'enjeu technique vise juste : les systèmes de navigation aérienne par langage souffrent généralement d'un désalignement entre compréhension multimodale globale et génération d'actions séquentielles, ce qui produit des trajectoires saccadées et une latence de décision pénalisante sur les missions longues. En découplant explicitement raisonnement sémantique et génération de commandes bas niveau, FSD-VLN reprend une logique "système rapide / système lent" déjà explorée cote robotique humanoïde (Pi-0, GR00T N2, Helix) et l'applique au vol de drone, un domaine ou la contrainte de latence est encore plus stricte qu'au sol. Pour les intégrateurs de drones industriels (inspection, logistique, surveillance), c'est une piste crédible pour rendre la navigation instructable en langage naturel viable sur des taches longues, même si les gains annonces restent, a ce stade, mesures uniquement en simulation. La navigation vision-langage (VLN) s'est imposée ces dernières années comme alternative aux systèmes GPS-dépendants, en promettant une interaction homme-machine plus intuitive et une meilleure adaptabilité environnementale, au prix d'une charge de calcul et de coordination bien plus lourde qu'un pilotage classique. FSD-VLN s'inscrit dans une lignée de travaux cherchant a résoudre ce compromis vitesse/compréhension, déjà au cœur des débats sur les modèles VLA en robotique générale. Les auteurs présentent leurs résultats comme un "paradigme pratique" plutôt qu'un système déployé : la prochaine étape logique, non couverte par cette publication, sera la validation en conditions de vol réelles, seule capable de confirmer si les gains constates en simulation résistent au bruit sensoriel et aux perturbations physiques du monde réel.

RechercheActu
1 source
FutureNav : modélisation unifiée monde-action pour la navigation vision-langage
2arXiv cs.RO 

FutureNav : modélisation unifiée monde-action pour la navigation vision-langage

FutureNav est un cadre de modélisation unifiée monde-action pour la navigation vision-langage (VLN) en environnements continus, présenté sous forme de preprint sur arXiv (arXiv:2606.30367). Le système encode conjointement des features textuelles, visuelles et spatiales dans un grand modèle de langage, entraîné sur quatre objectifs simultanés : prédiction d'action de navigation, dynamiques inverse et forward pour modéliser les transitions d'états, et génération future pour anticiper les états spatiaux à venir. Avec un backbone de 4 milliards de paramètres, FutureNav revendique des performances state-of-the-art sur plusieurs benchmarks VLN, surpassant les méthodes antérieures selon ses auteurs. Le code et les modèles seront publiés en open source. La contribution centrale est architecturale : la plupart des modèles de navigation fondationnels récents traitent la tâche comme une génération directe d'actions, sans modéliser explicitement l'état du monde ni son évolution future. FutureNav cherche à combler cet écart en forçant le modèle à représenter des transitions d'états, ce qui est censé renforcer la robustesse sur des séquences d'actions longues en environnement non discrétisé. Pour les chercheurs en navigation incarnée ou les intégrateurs de robots mobiles autonomes, cela pointe vers une approche où le raisonnement spatial prospectif améliore la politique d'action sans surcoût d'inférence notable, un point clé pour l'embarqué. La VLN en environnements continus est un domaine actif depuis les benchmarks R2R, VLN-CE et REVERIE. Des travaux comme NavGPT, MapGPT ou EmbodiedScan ont scalé des VLM sur la navigation, mais en mode "action pure". FutureNav s'inscrit dans la tendance des world models appliqués à la navigation incarnée, parallèlement aux approches VLA comme OpenVLA ou aux travaux de DeepMind sur la robotique prédictive. Il s'agit pour l'instant d'un preprint non évalué par les pairs, et les gains annoncés sur les benchmarks méritent une vérification indépendante avant conclusions définitives. La prochaine étape annoncée est la publication publique du code.

RechercheActu
1 source
WNM-3D : un modèle de navigation intégrant une conditionnalisation 3D pour la navigation vision-langage en boucle fermée
3arXiv cs.RO 

WNM-3D : un modèle de navigation intégrant une conditionnalisation 3D pour la navigation vision-langage en boucle fermée

Un article publié sur arXiv (référence 2608.07267, catégorie "cross-listing" signalant un croisement entre disciplines) présente WNM-3D, un modèle de navigation "world-action" conçu pour la navigation vision-langage en boucle fermée, c'est-à-dire des robots qui suivent des instructions en langage naturel à partir de flux vidéo égocentriques. Le système combine un encodeur de géométrie gelé, qui extrait des représentations 3D à partir de l'historique RGB monoculaire de l'agent, avec un adaptateur entraînable appelé 3D Scene-to-Token, qui convertit ces représentations en un préfixe de longueur fixe injecté dans un Transformer de diffusion. Grâce à un mécanisme d'attention "block-causal", ce contexte géométrique conditionne à la fois la génération des futures vues visuelles et celle des actions de navigation. L'entraînement se déroule en trois étapes : un ajustement supervisé sur des démonstrations générées par l'algorithme A*, une adaptation de type DAgger sur les états visités par la politique elle-même, puis une optimisation en boucle fermée via une méthode appelée DanceGRPO. Sur le benchmark GN-Bench, WNM-3D surpasse des politiques de navigation basées sur des modèles vision-langage classiques ainsi que sa propre variante conditionnée en 2D, avec une meilleure cohérence entre flux visuel et action et une erreur de mouvement visuel réduite sur un jeu d'évaluation proche de l'objectif. L'intérêt de ces travaux réside dans le diagnostic qu'ils posent sur les approches VLA (vision-language-action) actuelles, qui associent directement observations et instructions à des actions sans modéliser explicitement comment la scène visuelle doit évoluer sous l'effet du mouvement prédit. En ancrant la prédiction conjointe d'images futures et d'actions dans une représentation 3D persistante plutôt que dans un simple contexte 2D, WNM-3D vise à réduire la dérive en boucle fermée, un problème classique où les erreurs de navigation s'accumulent au fil des pas de temps. Pour les intégrateurs de robots mobiles autonomes, ce résultat suggère qu'un conditionnement géométrique explicite améliore la robustesse par rapport à des politiques purement basées sur des modèles vision-langage préentraînés, sans toutefois constituer une preuve de déploiement réel : les résultats restent circonscrits à un benchmark, sans essai terrain ni robot physique mentionné. Ce travail s'inscrit dans la lignée des modèles génératifs "world-action" (WAM), une famille d'approches qui prédisent conjointement observations futures et actions mais qui, jusqu'ici, ne conditionnaient pas cette génération sur une représentation géométrique de l'historique observé pour la navigation continue. WNM-3D se positionne explicitement contre les politiques VLA de référence et contre une variante 2D du même modèle, utilisée comme ablation pour isoler l'apport du conditionnement 3D. Aucun partenariat industriel, aucun calendrier de déploiement ni acteur commercial n'est mentionné dans l'abstract, ce qui situe cette publication au stade de la recherche amont plutôt que d'un produit prêt à l'intégration.

RechercheActu
1 source
ViTL : navigation en langage naturel zéro-shot guidée par logique temporelle via modèles vision-langage
4arXiv cs.RO 

ViTL : navigation en langage naturel zéro-shot guidée par logique temporelle via modèles vision-langage

Des chercheurs présentent ViTL (Vision-Language Temporal Logic), un système de navigation robotique capable d'exécuter des commandes en langage naturel impliquant plusieurs cibles et des contraintes temporelles, sans entraînement spécifique à l'environnement testé. Publié sur arXiv le 30 juin 2026, le framework s'attaque à un cas concret : une instruction comme "Nettoie la chaise ou le canapé, puis allume la télé" implique un ordre logique et un choix entre deux objets, ce qu'aucun système zero-shot existant ne gérait jusqu'ici. ViTL agit à deux niveaux. Au niveau tâche, un grand modèle de langage traduit la commande en formule de logique temporelle linéaire (LTL), convertie ensuite en automate fini déterministe (DFA) qui coordonne des cartes de valeur multi-canaux et déclenche une replanification dynamique dès qu'un nouvel objet pertinent est détecté. Au niveau navigation, les auteurs introduisent un "score directionnel" : plutôt qu'une valeur unique et indifférenciée sur tout le champ de vision, chaque direction de frontière est étiquetée sur l'image d'observation et notée séparément par le modèle vision-langage. Les tests ont été menés sur le simulateur Habitat-Matterport 3D (HM3D). L'enjeu dépasse la démonstration académique. Les méthodes actuelles de navigation zero-shot vers un objet, qui s'appuient sur des VLM pour guider une exploration par frontières dans un environnement inconnu, restent cantonnées à une seule cible à la fois. En prouvant qu'un pipeline LLM-vers-logique-vers-automate peut orchestrer plusieurs sous-tâches ordonnées sans réentraînement, ViTL déplace la limite de ce qu'un robot peut comprendre d'une instruction humaine complexe, un enjeu direct pour les intégrateurs qui déploient des robots domestiques ou logistiques devant suivre des consignes composites. Le score directionnel améliore aussi, selon les auteurs, la précision et l'efficacité sur les tâches à cible unique par rapport à leur référence de base, signe que le gain ne se limite pas aux scénarios multi-cibles. Ce travail s'inscrit dans la lignée des approches récentes combinant VLM et exploration frontalière pour la navigation sémantique zero-shot, une piste active depuis l'essor des modèles vision-langage capables de raisonner sur des scènes inconnues sans carte préexistante. La contribution spécifique de ViTL, la formalisation en logique temporelle plutôt qu'en heuristique ad hoc, ouvre la voie à des commandes encore plus complexes (conditions, boucles, contraintes de sécurité) dans de futurs travaux, même si le passage du simulateur HM3D à un robot réel reste l'étape non résolue par cette publication.

RecherchePaper
1 source