Aller au contenu principal
Robots Jetson-PI : contrôle robotique en temps réel embarqué via inférence asynchrone alignée sur l'anticipation
IA physiquearXiv cs.RO 

Robots Jetson-PI : contrôle robotique en temps réel embarqué via inférence asynchrone alignée sur l'anticipation

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe du PKU-SEC-Lab (Peking University) publie Jetson-PI, une méthode pour déployer des modèles Vision-Language-Action (VLA) directement à bord de cartes embarquées à faible consommation comme le Nvidia Jetson Orin, très utilisées en robotique mobile et humanoïde. Le problème ciblé est connu : l'inférence asynchrone, qui parallélise l'exécution des actions et le calcul de l'action suivante pour masquer la latence, introduit en pratique un décalage entre ce que le robot perçoit et ce qu'il exécute, ainsi qu'un temps de réaction dégradé. Jetson-PI corrige cela via un module léger de "correction par anticipation" qui prédit la représentation future de l'environnement à partir des actions déjà engagées, permettant à l'expert d'action de raisonner directement sur l'état futur plutôt que sur un état périmé. S'y ajoute un ordonnancement piloté par la confiance du modèle, qui arbitre dynamiquement entre appels au VLM et à l'expert d'action, complété par des optimisations bas niveau (réutilisation de CUDA graphs, buffers intermédiaires résidents en mémoire GPU, déroulement de flux). Résultat mesuré : un gain de fréquence de contrôle de 8,66x face à une implémentation PyTorch naïve et de 5,41x face à vla.cpp, avec un taux de réussite supérieur de 14,8% à VLASH sur le benchmark LIBERO.

L'enjeu dépasse la performance brute : c'est le goulot d'étranglement classique du déploiement de VLA en robotique embarquée qui est visé, celui qui empêche des modèles entraînés en simulation ou sur GPU serveur de tourner en temps réel sur du matériel embarqué bon marché. Pour les intégrateurs et fabricants de robots mobiles ou humanoïdes, cela réduit un frein concret à la mise en production de piles de contrôle par VLA, sans dépendre d'une puissance de calcul embarquée démesurée.

Le travail s'inscrit dans la lignée des recherches sur l'accélération des VLA (dont VLASH, utilisé ici comme référence de comparaison) et sur les moteurs d'inférence légers type llama.cpp. Les auteurs publient à la fois leur algorithme d'inférence asynchrone et un moteur d'inférence dédié, Jetson-PI-Edge, en open source sur GitHub, ouvrant la voie à une reproduction et une adoption par la communauté robotique.

À lire aussi

VLASH : des VLA en temps réel grâce à une inférence asynchrone anticipant les états futurs
1arXiv cs.RO 

VLASH : des VLA en temps réel grâce à une inférence asynchrone anticipant les états futurs

Des chercheurs du MIT Han Lab publient VLASH, une méthode d'inférence asynchrone pour les modèles Vision-Language-Action (VLA) qui vise à résoudre le problème de latence de réaction sur les robots. Aujourd'hui, la plupart des VLA fonctionnent en mode synchrone : le robot suspend son action pendant que le modèle calcule la suivante, ce qui crée des à-coups visibles et l'empêche de réagir aux changements de son environnement pendant l'exécution. L'inférence asynchrone permettait déjà d'agir et de calculer en parallèle, mais générait un décalage temporel entre l'état prédit et l'état réel au moment de l'exécution, provoquant de l'instabilité. VLASH corrige ce décalage en projetant l'état futur du robot à partir du chunk d'action précédent, sans changement d'architecture ni surcoût de calcul. Les auteurs annoncent une réduction de la latence de réaction jusqu'à 11,8 fois par rapport à l'inférence synchrone, une précision supérieure à toutes les méthodes asynchrones existantes, et, combinée à une quantification des actions, une accélération de 1,5 à 2 fois du temps de complétion des tâches avec une perte de précision minime. Le code est disponible sur GitHub (mit-han-lab/vlash). Pour l'industrie robotique, cette avancée s'attaque directement à un goulot d'étranglement connu des VLA à l'échelle : leur difficulté à gérer des tâches rapides et dynamiques, un point faible régulièrement cité face aux approches de contrôle classiques. En améliorant un modèle existant comme π0.5 sans le réentraîner ni alourdir son architecture, VLASH illustre une voie d'optimisation logicielle low-cost pour rendre les VLA déployables sur des cas d'usage à haute cadence, un enjeu clé pour les intégrateurs qui cherchent à sortir ces modèles du seul cadre de la démonstration en laboratoire. Les auteurs démontrent concrètement ce gain sur des tâches exigeant une réaction fine et rapide, comme jouer au ping-pong ou au jeu de la taupe, des scénarios où l'inférence synchrone échoue purement et simplement. Ce travail s'inscrit dans une course plus large autour des VLA temps réel, aux côtés de modèles comme GR00T N2, Pi-0 ou Helix, où la latence de contrôle devient un critère de différenciation aussi important que la précision des gestes.

IA physiqueActu
1 source
Reflex : contrôle VLA en temps réel par inférence en continu
2arXiv cs.RO 

Reflex : contrôle VLA en temps réel par inférence en continu

Des chercheurs présentent Reflex, un framework permettant l'inférence en temps réel pour les modèles Vision-Language-Action (VLA) basés sur le flow matching, une technique de contrôle continu prisée pour sa précision mais jusqu'ici incompatible avec la robotique temps réel. Le problème identifié est structurel : l'injection globale du timestep dans le processus de débruitage itératif invalide le KV-caching classique, obligeant à choisir entre un recalcul coûteux en O(N²) ou une réutilisation de cache mathématiquement incorrecte. Reflex exploite ce que les auteurs nomment la "Timestep-Invariance Property", le fait que les encodeurs de perception fonctionnent indépendamment de la boucle de débruitage, pour partitionner le contexte d'attention en régions statique, glissante et dynamique, permettant des mises à jour de cache incrémentales en O(1) sans perte de précision sur les sorties d'attention. Une couche de normalisation adaptative baptisée AdaRMSNorm évite l'effondrement numérique en BFloat16 lors d'inférences continues à haute fréquence, en se calant sur la phase du flux. Un pipeline asynchrone découple encodage visuel et génération d'action, complété par de la fusion d'opérateurs pour réduire l'overhead des kernels. Sur les benchmarks LIBERO et Kinetix, Reflex atteint une accélération d'inférence de 2,58x et un streaming stable à 50Hz, avec une latence de réaction réduite jusqu'à 54%, sans dégradation de performance. Pour l'industrie robotique, ce travail s'attaque à un goulot d'étranglement rarement discuté publiquement : les modèles VLA à flow matching, malgré leurs résultats impressionnants en démonstration, peinent à tourner en boucle fermée à des fréquences compatibles avec un contrôle robotique réactif. Un déploiement stable à 50Hz sans compromis sur la qualité change la donne pour les intégrateurs qui cherchent à faire tourner ces politiques sur du matériel embarqué à budget de calcul limité, plutôt que de dépendre d'un GPU distant surdimensionné. C'est aussi une réponse concrète à l'écart fréquemment pointé entre les métriques de benchmark et la viabilité en conditions réelles de contrôle continu. Ce travail s'inscrit dans la lignée des politiques VLA à diffusion ou flow matching comme Pi-0 ou GR00T N2, qui ont démontré la faisabilité du contrôle continu appris mais restent contraintes par leur coût d'inférence. Reflex ne propose pas un nouveau modèle mais une couche d'infrastructure d'inférence, potentiellement transférable à d'autres architectures de flow matching. Publié sur arXiv (2607.14695), l'article ouvre la voie à des évaluations sur du matériel physique réel, au-delà des environnements simulés LIBERO et Kinetix utilisés pour la validation actuelle.

IA physiqueActu
1 source
Contrôle robotique sans démonstration via des agents LLM
3arXiv cs.RO 

Contrôle robotique sans démonstration via des agents LLM

Des chercheurs ont publié FAEA (Frontier Agent as Embodied Agent), un framework qui applique directement aux manipulateurs robotiques les architectures d'agents LLM conçues pour le génie logiciel, sans démonstrations spécifiques à la tâche ni fine-tuning. Évalué sur trois benchmarks de référence en simulation avec accès privilégié à l'état de l'environnement (positions des objets fournies directement, sans perception visuelle brute), FAEA atteint des taux de succès de 84,9 % sur LIBERO, 85,7 % sur ManiSkill3, et 96 % sur MetaWorld, en utilisant le Claude Agent SDK d'Anthropic comme modèle frontier non modifié. Une itération optionnelle de feedback humain porte le score LIBERO à 88,2 %. Ces résultats se rapprochent des performances des modèles VLA (Vision-Language-Action) entraînés sur moins de 100 démonstrations par tâche, seuil qui représente aujourd'hui le plancher de coût pour la collecte de données en robotique incarnée. L'implication centrale est notable : pour les tâches de manipulation dominées par la planification délibérative à haut niveau, un agent généraliste non spécialisé peut suffire, sans pipeline de données propriétaire. FAEA peut en outre explorer de façon autonome des scénarios inédits en simulation et générer des trajectoires réussies pour augmenter les datasets d'entraînement, court-circuitant ainsi le goulot de la collecte humaine. Nuance critique : tous les tests restent en simulation avec état privilégié ; aucun transfert sim-to-real n'est validé dans ce travail, ce qui limite la portée des conclusions pour un déploiement industriel réel. Les modèles VLA entraînés bout-en-bout, pi-0 de Physical Intelligence, RT-2 de Google DeepMind, ou OpenVLA, dominent la recherche en manipulation depuis 2023 mais restent contraints par des pipelines de collecte de données coûteux et spécifiques à chaque domaine. FAEA s'inscrit dans un courant alternatif qui cherche à exploiter l'infrastructure d'agents software directement en robotique : la même boucle plan-act-observe-debug qui pilote les agents de coding est ici transférée sans modification au contrôle de manipulateurs. Ce positionnement implique un bénéfice passif : toute amélioration des modèles frontier se répercute directement sur les capacités robotiques sans retraining. Le préprint est disponible sur arXiv (2601.20334v2) et le code sur GitHub ; aucun déploiement industriel n'est annoncé à ce stade.

IA physiquePaper
1 source
Optimisation de politique par dérive : apprentissage natif en une étape pour le contrôle robotique en ligne
4arXiv cs.RO 

Optimisation de politique par dérive : apprentissage natif en une étape pour le contrôle robotique en ligne

Une équipe de chercheurs publie sur arXiv (réf. 2604.03540, version 3) un cadre en deux étapes baptisé Drift-Based Policy Optimization (DBPO), conçu pour ramener les politiques génératives de manipulation robotique à une seule passe de réseau au moment de l'inférence. La première brique, la Drift-Based Policy (DBP), exploite des objectifs de "fixed-point drifting" pour internaliser le raffinement itératif directement dans les paramètres du modèle pendant l'entraînement, supprimant ainsi le besoin de débruitage multi-étapes à l'exécution. La seconde brique, DBPO, greffe sur ce backbone une interface stochastique compatible avec le renforcement en ligne, autorisant des mises à jour on-policy stables sans sacrifier la propriété de déploiement en une étape. Sur un robot bi-bras réel, le système atteint 105,2 Hz en boucle fermée, soit une fréquence comparable aux contrôleurs industriels classiques. Sur les benchmarks de manipulation, DBP égale ou dépasse les politiques de diffusion multi-étapes tout en réduisant le coût d'inférence jusqu'à un facteur 100 en nombre d'évaluations réseau (NFEs). Ce résultat touche directement l'un des verrous les plus concrets du déploiement de politiques diffusion en robotique : le coût computationnel à l'inférence. Les politiques de diffusion actuelles (Diffusion Policy, Chi et al., 2023) nécessitent typiquement 10 à 100 NFEs par action, ce qui les rend incompatibles avec du contrôle haute fréquence sans accélérateur dédié. Transférer ce coût vers l'entraînement plutôt que l'inférence change le profil économique du déploiement : un robot en production n'a plus besoin de GPU haut de gamme pour tourner en temps réel. Par ailleurs, coupler une politique one-step avec du renforcement en ligne ouvre la voie à une adaptation continue post-déploiement, hypothèse clé pour les environnements industriels non-structurés. Les politiques de diffusion pour la manipulation ont émergé comme référence de facto depuis 2022-2023, portées par des travaux comme Diffusion Policy ou les architectures VLA de Physical Intelligence (pi0) et d'autres. La course à réduire leur latence a produit plusieurs approches concurrentes : distillation de consistance (Consistency Policy), flow matching en une étape (comme dans certaines variantes de pi0-fast), ou encore les politiques à action chunking. DBPO s'inscrit dans cette compétition avec une approche qui revendique de préserver la modélisation multimodale tout en atteignant la vitesse des méthodes one-shot. Les prochaines étapes naturelles seraient un test à plus grande échelle de tâches et de morphologies robotiques, ainsi qu'une validation sur des plateformes humanoïdes telles que celles de Figure AI ou 1X Technologies, pour lesquelles la fréquence de contrôle est un critère de sécurité, pas seulement de performance.

UELes équipes de recherche et industriels européens en robotique manipulatrice pourraient réduire leurs besoins en accélérateurs GPU à l'inférence en adoptant cette approche, mais aucun acteur français ou européen n'est directement impliqué.

IA physiquePaper
1 source