Aller au contenu principal
VASO : des compétences formellement vérifiables et auto-évolutives pour agents d'IA physique
RecherchearXiv cs.RO 

VASO : des compétences formellement vérifiables et auto-évolutives pour agents d'IA physique

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont publié sur arXiv (identifiant 2606.05395) un framework nommé VASO, pour "Verification-guided Self-evolution of LLM-generated robot skill contracts", qui vise à rendre les compétences robotiques générées par des grands modèles de langage à la fois réutilisables et formellement vérifiables. L'idée centrale : chaque compétence n'est plus un simple script exécutable mais un contrat sémantique à double interface, une interface formelle qui aligne états du robot, observations et commandes de contrôle avec des propositions logiques pour le model checking, et une interface orientée planificateur qui guide la génération de comportements exécutables. Lorsqu'un plan généré échoue à la vérification, VASO traduit la trace de contre-exemple en un gradient textuel qui met à jour le contrat de compétence réutilisable, sans toucher aux poids du modèle de fondation. Sur des plateformes Clearpath Jackal et PX4 (quadrocoptère), le framework atteint 97,2 % de conformité aux spécifications temporelles formelles en moins de 100 échantillons d'optimisation, surpassant les baselines de feedback d'exécution, d'optimisation de prompt et de fine-tuning.

Le problème adressé est précis et rarement traité : les boucles d'évolution de compétences existantes, retour d'exécution, tests unitaires, récompenses d'environnement, auto-critique LLM, ne fournissent que des preuves au niveau de la trace. Elles montrent qu'une compétence a fonctionné sur des exécutions échantillonnées, pas qu'elle satisfait des contrats de sécurité temporelle dans des conditions non testées. Pour un intégrateur ou un COO industriel, c'est la différence entre une démo convaincante en lab et un déploiement certifiable en production. Le fait que VASO maintienne les poids du modèle gelés est également notable sur le plan économique : pas de fine-tuning, pas de GPU dédié à la mise à jour du modèle.

Ce travail s'inscrit dans la tendance des "physical AI agents" où les LLM orchestrent des comportements robotiques à long horizon depuis des instructions en langage naturel. Les compétences réutilisables sont devenues les unités de base de ces architectures, mais leur fiabilité formelle reste un angle mort notable. Des approches concurrentes comme les VLA (Vision-Language-Action models) ou les frameworks d'optimisation de prompts comme OPRO ne ferment pas cette boucle vérification-évolution. VASO affirme être le premier à le faire explicitement. Il s'agit néanmoins d'un preprint sans validation industrielle publiée, et les résultats obtenus sur deux plateformes relativement simples devront être confirmés sur des environnements plus complexes et des chaînes de compétences plus longues avant d'envisager un déploiement en conditions réelles.

À lire aussi

Système d'exploitation auto-évolutif pour agents incarnés : planification cognitive et exécution physique découplées
1arXiv cs.RO 

Système d'exploitation auto-évolutif pour agents incarnés : planification cognitive et exécution physique découplées

Des chercheurs présentent PhyAgentOS, un système d'exploitation pensé spécifiquement pour les agents robotiques incarnés (embodied agents), décrit dans un preprint arXiv (2607.16636v1) publié fin juillet 2026. Le système introduit un "Session-Centered Runtime" qui traite une session complète, et non une action isolée, comme unité minimale d'ordonnancement, de vérification de compatibilité et de collecte de preuves d'exécution. La couche cognitive (planification) est séparée de la couche physique (exécution) via un protocole appelé State-as-a-File, qui matérialise l'état du système sous forme de fichiers Markdown/YAML lisibles et versionnables, sans dépendance de code entre les deux couches. Un module SessionVerifier distingue la fin d'exécution d'une tâche de sa réussite sémantique réelle, avec trois verdicts possibles : succès, échec ou replanification. Les résultats vérifiés alimentent une mémoire épistémique qui capitalise l'expérience sous forme de leçons réutilisables, sans réentraînement du modèle. PhyAgentOS a été testé sur les bancs d'essai Optimus-67, StarDojo et DST-Dojo, validé sur plus de 19 corps robotiques simulés et physiques, et montre des gains de performance sur les benchmarks LIBERO, Calvin et RoboCasa365 avec plusieurs modèles VLA (vision-language-action) différents. L'enjeu dépasse la prouesse technique isolée : les modèles VLA, les modèles du monde et les planificateurs agentiques progressent chacun de leur côté, mais sans abstraction d'exécution commune ni état partagé, ce qui rend leur composition fragile dès qu'on sort du laboratoire. En distinguant explicitement la terminaison d'une action de sa réussite réelle, PhyAgentOS s'attaque directement à l'écart bien documenté entre démonstration et fiabilité en conditions réelles, un problème central pour les intégrateurs qui déploient des flottes de robots en usine ou en entrepôt. Pour un décideur B2B, la promesse n'est pas un nouveau modèle plus performant mais une couche d'infrastructure capable de faire cohabiter différents modèles VLA, de vérifier objectivement leurs sorties et de capitaliser les échecs sans réentraînement coûteux, un point clé pour la maintenabilité à long terme de déploiements robotiques hétérogènes. Cette proposition s'inscrit dans la vague actuelle de modèles VLA généralistes tels que Figure 03, Optimus Gen 3, Pi-0 ou GR00T N2, qui ont démontré des capacités de manipulation impressionnantes en démo mais restent difficiles à orchestrer, vérifier et faire évoluer une fois déployés sur du matériel réel. PhyAgentOS se positionne comme une couche d'infrastructure sous ces modèles plutôt que comme un concurrent direct, avec une architecture de sécurité en couches (préflight, ponts d'action, SafetyGuard, surveillance par heartbeat) et une validation progressive allant des jeux virtuels à la simulation puis au robot physique, en gardant la couche cognitive constante pour isoler les variables. Publié comme preprint arXiv avec le statut "Announce Type: new", ce travail reste à ce stade une contribution de recherche académique plutôt qu'un produit commercial ; les auteurs ne précisent ni calendrier de mise en production ni partenariat industriel à ce jour.

RecherchePaper
1 source
Du numérique au physique : des agents numériques comme coachs autonomes de l'intelligence physique
2arXiv cs.RO 

Du numérique au physique : des agents numériques comme coachs autonomes de l'intelligence physique

Des chercheurs ont publié EmboCoach-Bench, un benchmark évaluant la capacité d'agents LLM à automatiser l'ingénierie de politiques pour systèmes robotiques incarnés. Présenté sur arXiv (arXiv:2501.21570), le cadre couvre 32 tâches conçues par des experts en apprentissage par renforcement (RL) et apprentissage par imitation (IL), avec le code exécutable comme interface universelle entre l'agent et l'environnement de simulation. Plutôt que de générer des solutions statiques, les agents opèrent en boucle fermée: ils proposent du code, l'exécutent dans le simulateur, analysent le retour d'environnement, puis itèrent pour corriger et optimiser. Les tâches couvrent des aspects allant de la conception de fonctions de récompense informées par la physique aux architectures de politiques avancées, notamment les diffusion policies. Les résultats quantitatifs méritent attention: les agents autonomes ont surpassé les baselines conçues manuellement par des humains de 26,5% en taux de succès moyen, contestant l'hypothèse selon laquelle l'expertise humaine en reward shaping serait difficilement substituable pour les politiques incarnées. Deuxième enseignement: le workflow agentique avec retour d'environnement réduit substantiellement l'écart de performance entre modèles open-source et propriétaires, ce qui suggère que la boucle de feedback itératif est plus déterminante que le modèle sous-jacent. Enfin, les agents démontrent une capacité de self-correction sur des cas pathologiques d'ingénierie, récupérant des tâches en quasi-échec total via un débogage itératif en simulation. Pour les équipes robotiques, cela représente une voie potentielle pour réduire le temps ingénieur consacré au tuning manuel des hyperparamètres et à la conception artisanale de fonctions de récompense. Ce travail s'inscrit dans une tendance plus large: l'application des workflows agentiques LLM, prouvés dans l'automatisation logicielle et la découverte scientifique, au domaine de l'IA incarnée. Le goulot d'étranglement identifié, à savoir la supervision manuelle intensive pour le réglage des simulations, est un problème structurel bien connu des équipes travaillant sur Optimus (Tesla), GR00T N2 (NVIDIA) ou les systèmes de Figure AI. La contribution différenciante d'EmboCoach-Bench est de proposer un cadre d'évaluation standardisé pour mesurer ce que les agents LLM peuvent réellement automatiser, plutôt que des démos ciblées. Les extensions naturelles incluent l'intégration à des backends hétérogènes (Isaac Lab, MuJoCo, Genesis) et la validation sim-to-real pour confirmer si ces gains en simulation se transfèrent aux systèmes physiques, ce qui reste le test décisif pour une adoption industrielle.

RecherchePaper
1 source
ASPIRE : découverte de compétences à base d'agents pour la robotique
3arXiv cs.RO 

ASPIRE : découverte de compétences à base d'agents pour la robotique

ASPIRE (Agentic Skill Programming through Iterative Robot Exploration) est un nouveau système d'apprentissage continu pour la robotique, décrit dans un article publié sur arXiv (2607.00272) début juillet 2026. Contrairement à la programmation robotique traditionnelle, qui impose de coder manuellement la perception multimodale, la gestion des contacts physiques et la diversité des échecs d'exécution, ASPIRE écrit et corrige lui-même ses programmes de contrôle selon le paradigme "code-as-policy", puis capitalise chaque correction validée dans une bibliothèque de compétences réutilisables. Le système s'appuie sur trois briques : un moteur d'exécution en boucle fermée qui expose des traces multimodales fines pour diagnostiquer les échecs et synthétiser des réparations ; une bibliothèque de compétences qui s'enrichit en continu de correctifs transférables ; et une recherche évolutionnaire qui génère des séquences de tâches et des programmes de contrôle variés, au-delà du simple raffinement trajectoire par trajectoire. Sur les bancs d'essai simulés, ASPIRE dépasse les méthodes précédentes de 77% sur les manipulations perturbées de LIBERO-Pro, 72% sur les transferts bimanuels de Robosuite, et 32% sur les tâches ménagères longues de BEHAVIOR-1K. Ce travail s'attaque directement à un point de friction connu du secteur : la difficulté à faire generaliser des politiques de contrôle robotique au-delà de la tâche pour laquelle elles ont été conçues, sans réentraînement lourd à chaque nouvelle configuration. La bibliothèque cumulative d'ASPIRE permet une généralisation zero-shot à des tâches longues jamais vues : 31% de réussite sur LIBERO-Pro Long, contre seulement 4% pour les meilleures méthodes concurrentes, qui pourtant s'appuient sur du raisonnement et des tentatives répétées au moment de l'exécution. Pour les intégrateurs et décideurs robotique, c'est un signal encourageant sur la viabilité de bibliothèques de compétences auto-construites plutôt que de politiques VLA monolithiques entraînées une fois pour toutes, mais les auteurs restent prudents : ils ne parlent que de "premières preuves" de transfert simulation-vers-réel, pas d'un problème résolu. Ce résultat s'inscrit dans la lignée des travaux récents sur les politiques de contrôle générées ou affinées par des grands modèles de langage, où l'enjeu principal est de dépasser le stade de la démonstration isolée pour atteindre une robustesse répétable en conditions réelles. Contrairement aux approches par apprentissage par renforcement pur ou aux VLA entraînés de bout en bout (type Pi-0 ou GR00T), ASPIRE mise sur l'exploration itérative et la mémoire de compétences pour réduire l'effort de programmation à chaque nouvel embodiment ou API robotique. Les auteurs annoncent vouloir approfondir la validation du transfert sim-to-real sur des plateformes physiques variées, une étape encore à venir puisque l'article ne documente pour l'instant que des résultats en simulation.

RecherchePaper
1 source
Héritage lamarckien en environnements dynamiques : comment les variables clés influencent la dynamique évolutive
4arXiv cs.RO 

Héritage lamarckien en environnements dynamiques : comment les variables clés influencent la dynamique évolutive

Une équipe de chercheurs en robotique évolutionnaire a publié en mai 2025 sur arXiv (2605.15769) une étude clarifiant les conditions dans lesquelles l'héritage lamarckien améliore ou dégrade les performances d'un système de co-optimisation corps-cerveau. L'expérience repose sur des robots mous virtuels dont la morphologie évolue par algorithme évolutionnaire, tandis que le contrôleur est optimisé en cours de vie par apprentissage, soit par optimisation bayésienne, soit par apprentissage par renforcement. L'héritage lamarckien consiste ici à transférer directement les paramètres de contrôle appris par un parent à sa descendance, à la différence de l'héritage darwinien classique qui ne transmet que le génome structurel. Les auteurs font varier deux dimensions de l'environnement dynamique : le niveau de conflit entre les changements environnementaux et le comportement optimal du robot, et la prévisibilité de ces changements pour l'agent. Résultat : l'héritage lamarckien n'est inférieur à l'approche darwinienne que dans le seul cas où les changements sont à la fois conflictuels et imprévisibles. L'ajout d'un capteur permettant de détecter les transitions environnementales restaure les bénéfices lamarckiens même dans les environnements conflictuels, en donnant à l'agent les moyens d'anticiper un changement de comportement nécessaire. Ce résultat réconcilie une littérature jusque-là contradictoire. La théorie évolutionnaire classique considère l'héritage lamarckien comme neutre ou négatif à long terme, tandis que plusieurs travaux récents en robotique évolutionnaire rapportaient des gains de performance. Cette étude suggère que les comparaisons précédentes omettaient de contrôler conjointement la conflictualité et la prévisibilité des perturbations, deux variables qui interagissent de façon non-linéaire. Pour les praticiens du morpho-evolution, domaine qui cherche à co-optimiser forme et contrôle pour des robots adaptatifs industriels ou de terrain, cela pose un cadre d'analyse actionnable : le bon mécanisme d'héritage dépend du profil statistique de l'environnement opérationnel, pas d'un choix dogmatique. La co-optimisation morphologie-contrôleur est un problème ouvert depuis les travaux fondateurs de Karl Sims dans les années 1990, et reste un défi majeur en conception de robots autonomes. La robotique douce (soft robotics) sert ici de banc d'essai car ses espaces morphologiques continus amplifient la sensibilité aux stratégies d'héritage. Ce preprint n'est pas encore évalué par les pairs et les résultats reposent exclusivement sur simulation, le transfert sim-to-real reste à démontrer. Parmi les acteurs qui travaillent sur des approches similaires figurent des laboratoires comme le Vermont Complex Systems Center ou le groupe Kriegman, ainsi que des initiatives industrielles en conception générative de robots. La prochaine étape naturelle est une validation sur morphologies physiques dans des environnements dont les statistiques sont connues et contrôlées.

RecherchePaper
1 source