
XS-VLA : associe distillation spatiale à gros grain et appariement de flux latent pour un contrôle robotique léger
Des chercheurs publient sur arXiv (juillet 2026) XS-VLA, un modèle Vision-Language-Action en deux étapes conçu pour le contrôle robotique embarque a faible cout de calcul. La première étape distille les connaissances spatiales d'un grand modèle, Qwen3-VL-4B, vers un squelette léger SmolVLM2 de seulement 0,25 milliard de paramètres, via un fine-tuning sur des descriptions spatiales grossières. La seconde étape conditionne ce squelette enrichi avec une politique de Latent Flow Matching, qui combine un autoencodeur variationnel conditionnel (CVAE) et une dynamique de flow matching pour modéliser des distributions d'actions multimodales, plutôt qu'un contrôleur déterministe classique. Sur le benchmark de simulation LIBERO, XS-VLA atteint l'état de l'art parmi les modèles de moins de 0,5 milliard de paramètres, avec un gain de taux de réussite moyen allant jusqu'a 7,2 points par rapport a la base SmolVLA 0,25B, dont 23 points sur la tache LIBERO-Long, et dépasse même la version SmolVLA a 2,2 milliards de paramètres, près de neuf fois plus grosse. Les auteurs revendiquent aussi une accélération de 3,2 fois du temps d'exécution de mission face a la précédente politique de flow matching légère.
Le résultat cible un problème concret pour l'industrie robotique: les grands modèles vision-langage comprennent bien l'espace mais sont trop lourds pour du contrôle temps réel embarque, tandis que les modèles légers souffrent généralement de "cécité spatiale". Si les chiffres se confirment au-delà de la simulation, cela suggère qu'un entrainement cible, distillation spatiale puis génération d'actions par flow matching, peut compenser un manque de paramètres, ce qui intéressé directement les intégrateurs cherchant a déployer des VLA sur du materiel edge limite plutôt que sur des clusters GPU.
Ce travail s'inscrit dans la vague de modèles VLA ouverts lancée par des politiques comme Pi-0, GR00T N2 ou Helix, et prolonge spécifiquement la lignée SmolVLA d'Hugging Face en visant l'efficacité plutôt que la taille. Il reste toutefois a un stade de recherche: les résultats sont mesures sur LIBERO, un benchmark simule standard mais éloigné des conditions réelles, et aucune validation sur robot physique n'est mentionnée a ce stade.
Dans nos dossiers




