Aller au contenu principal
TurboVLA : un modèle vision-langage-action en temps réel à 32 Hz sur RTX 4090 avec moins d'1 Go de VRAM
IA physiquearXiv cs.RO 

TurboVLA : un modèle vision-langage-action en temps réel à 32 Hz sur RTX 4090 avec moins d'1 Go de VRAM

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche présente TurboVLA, un nouveau modèle vision-langage-action (VLA) capable de tourner à 32 Hz sur une carte grand public RTX 4090, avec moins d'1 Go de VRAM utilisée à l'inférence. Publié sur arXiv fin juillet 2026, le travail propose une architecture radicalement allégée : plutôt que de faire transiter les observations visuelles par un grand modèle de langage avant de les décoder en actions (le schéma classique V→L→A des VLA actuels), TurboVLA encode séparément l'image et l'instruction textuelle, les fait interagir via un mécanisme bidirectionnel léger, puis prédit directement des séquences d'actions continues avec un petit décodeur (V+L→A). Résultat chiffré sur le benchmark de manipulation LIBERO : 97,7% de taux de réussite moyen, avec seulement 0,2 milliard de paramètres, 31,2 ms de latence d'inférence et 0,9 Go de VRAM sur RTX 4090. Le code est disponible sur GitHub (H-EmbodVis/TurboVLA).

L'intérêt pour l'industrie robotique tient moins à la performance brute qu'à l'efficacité : la plupart des VLA compétitifs (Pi-0, GR00T N2, Helix) s'appuient sur des LLM de plusieurs milliards de paramètres, coûteux à faire tourner en temps réel sur du matériel embarqué. En atteignant un score comparable ou supérieur avec un modèle cent fois plus petit et une inférence tenant sur une carte de jeu grand public, TurboVLA questionne l'hypothèse selon laquelle un grand modèle de langage est nécessaire pour connecter perception et action. Pour les intégrateurs et équipes robotique, cela ouvre la voie à des politiques VLA déployables sur du edge compute limité, sans datacenter dédié à l'inférence.

Le papier s'inscrit dans la vague de recherche sur les modèles VLA compacts qui a suivi la démonstration de la faisabilité de l'apprentissage par imitation à grande échelle (RT-2, OpenVLA, puis Pi-0 et GR00T). À ce stade, TurboVLA reste un résultat de recherche validé uniquement en simulation sur LIBERO, sans démonstration publiée de déploiement sur robot physique ni partenariat industriel annoncé ; la prochaine étape naturelle serait une validation sim-to-real sur plateforme réelle.

À lire aussi

Contrôle de flux : piloter les modèles vision-langage-action avec des entrées simples en temps réel
1arXiv cs.RO 

Contrôle de flux : piloter les modèles vision-langage-action avec des entrées simples en temps réel

Des chercheurs publient en juin 2026 une méthode baptisée "flow control" (arXiv:2606.10180) permettant de piloter en temps réel les modèles VLA (Vision-Language-Action) via des entrées génériques, comme un clavier ou un joystick, sans aucun ré-entraînement ni fine-tuning. L'approche opère à l'inférence en orientant l'échantillonnage du modèle vers des actions qui reflètent l'intention de l'opérateur tout en restant dans la distribution experte apprise à l'entraînement. Les auteurs documentent dans ce preprint quatre propriétés mesurées : guidage précis et réactif, robustesse aux commandes imprécises, taux de succès améliorés avec réduction des temps de tâche, et enfin un gain de performance autonome lorsqu'on fine-tune le VLA sur les trajectoires corrigées par flow control. L'enjeu est concret pour les intégrateurs : les VLAs montrent des performances solides en démo, mais leurs taux d'échec en déploiement réel restent non nuls face aux variations d'environnement et aux instructions ambiguës. Plutôt que de corriger ces défauts par du ré-entraînement coûteux, flow control permet à un opérateur de guider le robot à la volée sans dégrader la qualité des mouvements générés. La boucle est vertueuse : les corrections humaines produisent des trajectoires haute qualité réutilisables comme données d'entraînement, traçant un chemin de déploiement progressif où la supervision humaine se retire au fil des itérations. Les VLAs ont pris de l'ampleur avec Pi-0 de Physical Intelligence (publié fin 2024), dont l'architecture repose précisément sur le flow matching, d'où le jeu de mots du titre. NVIDIA GR00T N2, OpenVLA (Berkeley/Stanford), et les modèles LeRobot de Hugging Face (Paris) constituent les autres plateformes où cette couche de contrôle pourrait s'intégrer sans modifier le pipeline d'entraînement existant. L'idée de guidage conditionné à l'inférence existe déjà en génération d'images via le classifier guidance des modèles de diffusion, mais son application à la robotique physique restait peu explorée. Les prochaines étapes annoncées dans le papier incluent le fine-tuning systématique sur trajectoires flow-control pour quantifier le gain autonome à plus grande échelle.

UEHugging Face (Paris) est explicitement cité comme plateforme d'intégration via LeRobot, ce qui rend cette méthode directement applicable à l'initiative robotique open-source française sans modifier le pipeline d'entraînement existant.

💬 C'est exactement le problème que personne ne veut admettre sur les VLAs : ils impressionnent en démo et flanchent en prod dès que l'environnement bouge un peu. L'idée de guider l'échantillonnage à l'inférence plutôt que de tout ré-entraîner, c'est le genre de solution pragmatique qu'on attendait. La boucle où les corrections humaines deviennent des données d'entraînement, c'est propre, et si ça marche à l'échelle avec LeRobot, Hugging Face tient quelque chose de sérieux.

IA physiqueOpinion
1 source
La simplicité avant tout : génération d'actions en une étape pour les modèles vision-langage-action (VLA)
2arXiv cs.RO 

La simplicité avant tout : génération d'actions en une étape pour les modèles vision-langage-action (VLA)

Une équipe de chercheurs publie sur arXiv (2606.05737, juin 2026) une méthode simplifiée pour accélérer la génération d'actions dans les modèles VLA (vision-language-action) à base de diffusion. L'observation centrale: là où les pipelines diffusion classiques requièrent dix étapes de débruitage itératif pour produire un chunk d'actions, un simple biais de la distribution d'entraînement vers les états à bruit élevé suffit à obtenir des politiques efficaces en une seule étape, sans modèle enseignant, sans distillation et sans objectif auxiliaire. Sur les benchmarks LIBERO, LIBERO-Plus et LIBERO-Pro devenus quasi-standards pour la manipulation dextre simulée, les politiques one-step entraînées avec ce calendrier biaisé égalent ou dépassent des politiques à décodage dix-étapes entraînées avec une distribution uniforme. Sur LIBERO-Long spécifiquement, un modèle combinant un LVM de 1,4 milliard de paramètres et une tête d'action de 30 millions de paramètres atteint 95,6 % de taux de succès en une seule étape. Une validation croisée sur robot bimanual réel (plateforme YAM, dans le cadre d'une évaluation RSS) confirme la tendance, sur un échantillon limité. L'enjeu opérationnel est direct: réduire le décodage d'un facteur dix libère de la latence critique pour les applications temps-réel. Mais l'argument de fond est plus structurel. Les auteurs identifient une asymétrie fondamentale entre génération d'images et génération d'actions robotiques: un espace d'action (quelques degrés de liberté, un chunk de positions articulaires) est incomparablement plus compact qu'une image de millions de pixels. Cette différence implique que les méthodes one-step avancées développées pour la synthèse d'images (distillation de consistency models, score distillation, flow matching accéléré) ne sont pas nécessairement requises ici. Pour un intégrateur ou un décideur industriel, cela simplifie significativement le pipeline d'entraînement: pas de phase de distillation en deux étapes, pas de teacher freezing, et donc moins de complexité opérationnelle pour déployer un VLA performant. Les VLA à base de diffusion ont connu une montée en puissance rapide depuis mi-2024, portée par pi0 de Physical Intelligence, GR00T N2 de NVIDIA et Helix de Figure AI, tous construits autour d'architectures à flux diffusion ou flow-matching pour la génération d'actions. Ce travail s'inscrit dans un mouvement de simplification qui cherche à réduire la friction entre recherche et déploiement industriel. Les benchmarks LIBERO restent cantonnés à la manipulation de petits objets en environnement simulé, et la validation sur robot réel présentée ici reste préliminaire. Les prochaines étapes naturelles seront de tester cette approche à plus grande échelle sur des architectures de référence comme pi0 ou GR00T, dans des contextes d'assemblage ou de logistique où la latence d'inférence est un critère de déploiement direct.

IA physiqueOpinion
1 source
Modèles vision-langage-action (VLA) : retours d'expérience sur une plateforme UR5 réelle
3arXiv cs.RO 

Modèles vision-langage-action (VLA) : retours d'expérience sur une plateforme UR5 réelle

Des chercheurs ont publié sur arXiv (preprint 2606.30456) une évaluation du transfert de modèles VLA (Vision-Language-Action) vers un bras manipulateur UR5e d'Universal Robots en conditions réelles. Deux modèles ont été mis à l'épreuve : OpenVLA et sa variante OpenVLA-OFT, fine-tunés sur des données collectées directement sur le robot physique et converties au format RLDS (Robot Learning Dataset Specification), un standard de facto dans la communauté robotique. L'équipe a construit une chaîne complète comprenant l'acquisition de données sur robot réel, un workflow de conversion de dataset compatible RLDS, une infrastructure de fine-tuning et d'inférence, ainsi qu'un protocole de validation systématique des représentations d'actions et des interfaces de contrôle. Le résultat central contredit une hypothèse répandue dans la recherche VLA : des métriques offline prometteuses ne se traduisent pas nécessairement en comportement stable en boucle fermée sur le système physique. Cet écart entre indicateurs de validation et exécution réelle n'est pas principalement imputable à la capacité intrinsèque des modèles. Il est fortement conditionné par la sémantique des actions (comment sont encodées les commandes moteur), les conventions de référentiels de coordonnées, l'alignement temporel entre la vision et les sorties de contrôle, la cohérence du prétraitement d'image, et la couverture du dataset d'entraînement. La conclusion opérationnelle est directe : pour des intégrateurs industriels, augmenter la taille du modèle VLA n'est pas le levier prioritaire ; c'est la maîtrise du pipeline données-modèle-contrôle dans son ensemble qui détermine la fiabilité du déploiement, un déplacement de paradigme du problème de modèle vers un problème de système. Ce travail s'inscrit dans un contexte d'accélération marquée autour des VLA, portée par des modèles comme pi-0 (Physical Intelligence), OpenVLA (UC Berkeley), GR00T N2 (NVIDIA) ou encore ACT et Diffusion Policy, qui promettent une généralisation des politiques de manipulation via des architectures multimodales entraînées à large échelle. La plupart des démonstrations publiées restent toutefois en environnement contrôlé, et les conditions précises du passage au déploiement réel sont rarement documentées avec rigueur. En s'appuyant sur une plateforme reproductible et des formats ouverts (UR5e, RLDS), cette étude fournit un cadre méthodologique directement transférable, utile pour les équipes cherchant à qualifier leurs pipelines VLA avant mise en production, y compris côté européen où des acteurs comme Enchanted Tools travaillent sur des approches similaires de généralisation de politiques de manipulation.

UELe cadre méthodologique open-source (UR5e + RLDS) est directement réutilisable par les équipes européennes qualifiant leurs pipelines VLA avant production, notamment pour des acteurs comme Enchanted Tools travaillant sur la généralisation des politiques de manipulation.

💬 Ce que montrent ces chercheurs, c'est qu'en robotique VLA, le problème n'est pas le modèle. Des métriques offline prometteuses ne prédisent pas le comportement en boucle fermée sur le vrai robot, et ce qui change tout c'est le pipeline complet (encodage des actions, conventions de coordonnées, alignement temporel). Reste à voir combien d'équipes industrielles vont enfin arrêter de chercher un modèle plus gros et commencer par auditer leur dataset.

IA physiqueOpinion
1 source
HapticVLA : manipulation riche en contacts via un modèle vision-langage-action sans détection tactile à l'inférence
4arXiv cs.RO 

HapticVLA : manipulation riche en contacts via un modèle vision-langage-action sans détection tactile à l'inférence

HapticVLA, décrit dans un article arXiv (2603.15257v2, republié) sans affiliation académique précisée, propose une architecture vision-langage-action capable de manipulation en contact riche sans capteur tactile embarqué au moment de l'inférence. La méthode se déroule en deux étapes couplées. D'abord, un module baptisé SA-RWFM (Safety-Aware Reward-Weighted Flow Matching) entraîne un expert d'action par flow matching à partir de récompenses tactiles précalculées, qui pénalisent une force de préhension excessive et des trajectoires de saisie sous-optimales. Ensuite, la Distillation Tactile (TD) transfère cette capacité vers un VLA classique : un token tactile compact, issu du modèle SA-RWFM, sert de cible d'apprentissage à un VLA étudiant qui doit le prédire uniquement à partir de la vision et de l'état du robot. Résultat annoncé sur des expériences réelles : un taux de réussite moyen de 86,7 %, supérieur à celui de VLA de référence, y compris des versions disposant d'un vrai retour tactile pendant l'inférence. L'intérêt pratique tient au coût et à la reproductibilité. Les capteurs tactiles dédiés renchérissent le matériel et compliquent le transfert d'un comportement appris d'une plateforme robotique à une autre. Si l'approche tient sur d'autres tâches et d'autres bras, elle affaiblirait une hypothèse répandue dans le secteur, celle qu'un retour haptique direct est indispensable pour un contrôle fin de la force de préhension sur des objets fragiles ou déformables. Pour les intégrateurs industriels, cela ouvrirait la voie à des lignes de préhension contact-riche moins instrumentées, donc moins chères à déployer et à maintenir. Il s'agit toutefois d'un résultat de recherche publié sur arXiv, pas d'un produit commercialisé ni d'un déploiement industriel annoncé. Le papier s'inscrit dans la vague actuelle des modèles VLA généralistes pour la manipulation, aux côtés de GR00T N2 de NVIDIA, Pi-0 de Physical Intelligence ou Helix de Figure, qui cherchent tous à réduire la dépendance à des capteurs spécialisés tout en préservant une manipulation fine. Aucune date de disponibilité ni partenariat industriel n'est mentionné dans l'abstract, la validation reste donc circonscrite au cadre expérimental décrit.

IA physiqueActu
1 source