Aller au contenu principal
GhostShell : appels de fonctions LLM en streaming pour la programmation incarnée concurrente
RecherchearXiv cs.RO 

GhostShell : appels de fonctions LLM en streaming pour la programmation incarnée concurrente

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un groupe de chercheurs a présenté GhostShell, une architecture logicielle permettant à des grands modèles de langage (LLM) de piloter des robots en continu, en déclenchant des fonctions directement pendant la génération du texte plutôt qu'en attendant un plan complet avant d'agir. Le système repose sur des « function tokens », une représentation au format XML des appels de fonction que GhostShell extrait du flux de génération du LLM et convertit en commandes exécutables, orchestrées par un algorithme de planification multi-canal combinant synchronisation intra-canal et dispatch asynchrone inter-canal pour coordonner plusieurs composants robotiques en parallèle. L'équipe a testé l'approche sur son prototype robotique CoCo, à travers 33 tâches réelles et neuf fournisseurs de LLM différents. Sur 30 tâches d'interaction homme-robot, le score DSBC (Directed Structured Behavior Correctness) le plus élevé, 0,83, a été obtenu avec Claude Sonnet 4, tandis que sur trois tâches multimodales longues, GPT-4.1 a atteint 7,0/10 en évaluation humaine. Face au function calling natif proposé par les fournisseurs de LLM, le schéma de function tokens de GhostShell affiche un taux de complétion de 15 tâches sur 15, contre 6 sur 15 pour l'approche standard.

Ce résultat cible un point de friction concret pour l'IA embarquée en robotique : les mécanismes natifs d'appel de fonction des LLM, conçus pour des usages conversationnels ou logiciels, gèrent mal la coordination d'actions physiques et langagières simultanées, un besoin central pour tout robot devant parler et agir en même temps. En démontrant un gain net de complétion de tâches sur des scénarios concurrents plutôt que séquentiels, les auteurs apportent un argument technique en faveur d'architectures de contrôle repensées spécifiquement pour l'embodied AI, plutôt que d'un simple réemploi des API de function calling issues du monde du logiciel.

Il s'agit d'un article de recherche académique, publié sur arXiv (identifiant 2508.05298, troisième version), et non d'un produit commercialisé ou d'un déploiement industriel : les résultats reposent sur un unique prototype maison, CoCo, et 33 tâches définies par les auteurs eux-mêmes, ce qui appelle à la prudence avant toute généralisation. Le code, les vidéos et le matériel supplémentaire sont mis à disposition sur le site dédié du projet, coco-robot.github.io/GhostShell, ce qui permettra à la communauté robotique d'évaluer indépendamment la reproductibilité de ces résultats face aux nombreuses autres approches de contrôle vocal-langage-action (VLA) en développement.

À lire aussi

Automatisation intelligente pour la construction de benchmarks en IA incarnée : pipelines, morphologies, simulateurs et tendances
1arXiv cs.RO 

Automatisation intelligente pour la construction de benchmarks en IA incarnée : pipelines, morphologies, simulateurs et tendances

Un article de synthèse déposé sur arXiv (identifiant 2606.12207) en juin 2026 cartographie les méthodes de construction de benchmarks pour l'intelligence incarnée, un domaine couvrant désormais la navigation, l'assistance domestique, la manipulation robotique, la conduite autonome, les agents aériens et le contrôle par grands modèles multimodaux. Les auteurs structurent leur analyse autour d'un pipeline en cinq étapes : définition des exigences et des tâches, acquisition des données, nettoyage et annotation, génération de la suite d'évaluation avec définition des métriques, puis exécution avec retour diagnostique. Pour chaque étape, l'étude compare la curation manuelle, l'automatisation traditionnelle, l'assistance par modèles de fondation et les workflows en boucle fermée pilotés par agents. Les coûts de construction sont analysés selon six axes : main-d'oeuvre humaine, acquisition de données et d'assets, calcul et simulation, validation et débogage, gouvernance et maintenance, et risque de rework. La conclusion centrale remet en cause l'hypothèse selon laquelle automatiser la construction de benchmarks réduirait mécaniquement les coûts. Les auteurs montrent qu'elle déplace les dépenses vers la validation, l'auditabilité, la gestion de versions et la gouvernance à long terme. Pour les équipes de recherche et les industriels qui s'appuient sur ces benchmarks pour comparer des systèmes (bras manipulateurs, humanoïdes, AMR), cela signifie qu'un benchmark peu coûteux à générer peut devenir onéreux à maintenir. Le risque de rework, souvent sous-estimé, est identifié comme le poste de coût le plus variable selon la stratégie de construction choisie. Ce survey s'inscrit dans un contexte de prolifération rapide des systèmes incarnés où les évaluations sur jeux de données statiques ne suffisent plus à capturer la complexité d'environnements dynamiques réels. La question est directement pertinente pour les VLA (Vision-Language-Action models) en cours de déploiement chez Figure, 1X, Agility ou Physical Intelligence (Pi-0), dont les performances dépendent de benchmarks robustes et maintenables. Le cadre d'analyse proposé s'applique aux initiatives de benchmarking publiées par Google DeepMind, Meta FAIR ou le Stanford HAI. La thèse centrale : les progrès en évaluation robotique dépendront autant de la qualité des pipelines de construction, auditables et actualisables, que de la taille des suites de tests elles-mêmes.

RecherchePaper
1 source
Pyramide de données pour la manipulation incarnée
2arXiv cs.RO 

Pyramide de données pour la manipulation incarnée

Une équipe de recherche publie sur arXiv (2607.24744) une revue structurant l'écosystème des données pour l'apprentissage robotique en une "pyramide" à cinq niveaux : données réelles issues de robots physiques, données de type UMI (capture de démonstrations humaines avec interface portable), vidéos égocentriques et exocentriques, données de simulation, et données vision-langage générales issues du web. Les auteurs organisent cette pyramide autour d'un compromis central entre scalabilité et alignement robotique, et évaluent chaque source selon quatre critères : qualité, diversité, réutilisabilité et fidélité physique. Ils passent ensuite en revue les modèles fondation récents pour la robotique, qu'il s'agisse de modèles de "cerveau" incarné, de modèles vision-langage-action (VLA) ou de modèles monde-action, en analysant comment chacun sélectionne, aligne et mélange ces différentes sources lors du pré-entraînement, et comment ce choix conditionne leurs capacités de perception, de raisonnement, de planification et de prédiction. Cette cartographie répond à un problème identifié depuis plusieurs années dans le secteur : contrairement aux modèles de langage ou de vision, qui s'entraînent sur la quasi-totalité du contenu textuel et visuel disponible sur internet, les agents incarnés ne peuvent pas se contenter de données passives puisqu'ils doivent apprendre le couplage entre observation, état physique et action. C'est ce goulot d'étranglement qui explique pourquoi des modèles comme Pi-0, GR00T N2 ou Helix combinent systématiquement plusieurs sources de données plutôt qu'une seule, et pourquoi des plateformes comme Figure 03 ou Optimus Gen 3 misent autant sur la collecte de données réelles en usine que sur la simulation. Les auteurs terminent par six chantiers non résolus : constituer des jeux de données tactiles à grande échelle, capturer des séquences d'échec et de récupération, développer des pipelines de collecte scalables, aligner les actions entre différentes morphologies de robots, exploiter les données égocentriques pour la manipulation dextre, et concevoir des recettes de données principielles plutôt qu'empiriques, autant de points de friction qui continuent de freiner le passage de la démonstration au déploiement industriel fiable.

RecherchePaper
1 source
GASE : système automatisé basé sur le Gaussian Splatting pour la reconstruction d'environnements de simulation incarnée
3arXiv cs.RO 

GASE : système automatisé basé sur le Gaussian Splatting pour la reconstruction d'environnements de simulation incarnée

Une équipe de chercheurs a publié fin juin 2026 un système baptisé GASE (Gaussian Splatting-Based Automated System for Reconstructing Embodied-Simulation Environments), conçu pour automatiser la construction de scènes de simulation photoréalistes destinées à l'entraînement de robots. Le pipeline exploite des réseaux de caméras panoramiques multivues pour capturer l'environnement réel, extrait automatiquement les objets de premier plan via une stratégie basée sur les poses de caméras dans le domaine 2D, puis reconstruit séparément objets et arrière-plan statique par 3D Gaussian Splatting avant de les importer dans un simulateur physique avec inpainting haute-fidélité des zones manquantes. Sur des benchmarks de segmentation, GASE surpasse les méthodes 3DGS concurrentes de plus de 10 %. Surtout, lors de déploiements réels sur des tâches de manipulation et de navigation, les politiques entraînées en simulation n'affichent qu'un écart de performance inférieur à 10 % par rapport à celles entraînées sur données réelles, arXiv:2606.17520. Ce résultat chiffré est l'argument central du papier. Le sim-to-real gap, soit la dégradation des performances lors du passage du simulateur au robot physique, reste l'un des obstacles majeurs au déploiement à grande échelle de l'apprentissage robotique. Un écart sous les 10 % suggère que la simulation générée automatiquement depuis des scans réels peut constituer un vecteur de data augmentation viable, réduisant la dépendance à des opérateurs qualifiés et à du matériel coûteux pour la collecte terrain. Pour les intégrateurs et les industriels engagés dans des projets de manipulation ou de navigation autonome, la promesse est de compresser significativement le coût des pipelines d'entraînement, à condition que la méthode tienne à l'échelle et sur des environnements plus complexes que ceux testés. GASE s'inscrit dans la trajectoire tracée par l'émergence du 3D Gaussian Splatting en 2023 comme alternative temps-réel aux NeRF pour la reconstruction de scènes. Les approches concurrentes, notamment SplatSim, Gaussian Grouping et les pipelines d'assets manuels dans Isaac Sim ou MuJoCo, progressent en parallèle, mais l'automatisation complète de l'acquisition jusqu'à l'import simulateur reste un problème ouvert. Le preprint ne mentionne ni institution ni partenaires industriels, ce qui rend difficile l'évaluation des perspectives de transfert applicatif. Le code doit être publié ultérieurement mais n'est pas encore disponible au moment de la soumission. Le périmètre limité des tâches testées et l'absence de comparaison avec des environnements synthétiques construits manuellement laissent plusieurs questions ouvertes à la communauté.

RecherchePaper
1 source
Robot2Air : transfert de squelette inter-incarnations pour la formation en relais 3D
4arXiv cs.RO 

Robot2Air : transfert de squelette inter-incarnations pour la formation en relais 3D

Des chercheurs ont publié sur arXiv (papier arXiv:2607.27627v1) un système baptisé Arm2Air, qui transfère des compétences d'évitement d'obstacles apprises sur des bras robotiques vers le placement de drones relais formant un réseau de communication d'urgence. Les mouvements d'un bras robotique, générés par un modèle pré-entraîné nommé Neural MP, sont convertis en trajectoires ordonnées servant à pré-entraîner une plateforme de transfert basée sur un transformeur, ensuite adaptée au domaine des drones via une méthode d'adaptation à faible rang (LoRA) avec peu de données cibles. La trajectoire transférée initialise une chaîne de relais optimisée pour la capacité réseau, le délai et le coût de déplacement. Sur neuf cartes urbaines 3D denses en obstacles, Arm2Air réduit de 64,9% le temps de calcul médian par rapport au meilleur planificateur classique. Sur un second jeu de 30 cartes, dans le sous-groupe le plus obstrué, la capacité du goulot d'étranglement augmente de 32,6%, sa variance chute de 74,7%, la distance de saut maximale baisse de 13,2% et le déplacement des relais de 16,9%, comparé à l'algorithme IMPC-MD. Avec seulement trois cartes d'entraînement dans le domaine cible, l'erreur de position des relais chute de 53,6% par rapport à un entraînement from scratch, en ne mettant à jour que 134 000 paramètres contre 1,38 million pour les méthodes classiques. Ce travail répond à un problème concret : après un sinistre ou une panne réseau, restaurer une connectivité en zone urbaine dense exige de positionner des drones relais en tenant compte simultanément de la ligne de vue, de la portée radio, de l'altitude et des obstacles tridimensionnels, un calcul combinatoire coûteux en temps réel. En montrant qu'un savoir-faire d'évitement d'obstacles appris sur un bras manipulateur, domaine sans contrainte radio ni dynamique de vol, se transfère efficacement à la planification de trajectoires de drones, Arm2Air illustre un principe plus large : des priors structurels ordonnés peuvent traverser des tâches robotiques hétérogènes sans réapprentissage coûteux. Pour les opérateurs de flottes de drones, l'intérêt est double : une replanification plus rapide sur le terrain, et une adaptation à faible coût en données pour chaque nouveau site. Arm2Air s'inscrit dans une tendance de recherche consistant à réutiliser des modèles pré-entraînés sur une morphologie, souvent des bras manipulateurs, pour accélérer l'apprentissage sur une autre, comme les véhicules aériens, à mesure que des modèles de fondation robotiques tels que Neural MP deviennent des briques réutilisables. Le papier reste un travail académique en preprint, sans acteur industriel identifié ni déploiement réel annoncé, comparé uniquement à des planificateurs conventionnels et à IMPC-MD. La suite logique consisterait à valider l'approche sur des drones physiques plutôt que sur cartes simulées, et à tester le transfert de squelette sur d'autres couples de robots hétérogènes.

RecherchePaper
1 source