Aller au contenu principal
LabEvolver : évolution d'expérience sans entraînement pour des agents de laboratoire humide sûrs et ancrés
RecherchearXiv cs.RO 

LabEvolver : évolution d'expérience sans entraînement pour des agents de laboratoire humide sûrs et ancrés

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont présenté LabEvolver, un framework sans entraînement (training-free) qui dote les agents robotiques de laboratoire d'une mémoire épisodique construite à partir de leur propre expérience d'exécution. Le système combine une boucle interne ancrée dans l'état, chargée de la perception adaptative, de la planification en ligne et de la validation de sécurité, avec une boucle externe d'évolution qui distille les trajectoires complétées en compétences, stratégies et connaissances de sécurité réutilisables. Sur des tâches robotiques de préparation de solutions en laboratoire, LabEvolver réduit de 48,2% le temps nécessaire à la régulation du pH et de 60,0% le nombre d'interventions des garde-fous de sécurité par rapport à une méthode de référence. Sur le benchmark ALFWorld, qui teste des agents dans des environnements domestiques simulés, le taux de succès cumulé sur 20 étapes passe de 76,2% avec la méthode ReAct à 91,4%, résultat obtenu sur 500 tâches continues, ce qui montre que l'approche généralise au-delà du seul contexte du laboratoire. Le code du projet est disponible sur GitHub, sous le compte AndyGao6186.

Pour l'automatisation de laboratoire, ce résultat s'attaque à un problème central: la plupart des agents pilotés par des modèles de langage échouent à progresser durablement parce qu'ils repartent de zéro à chaque tâche, sans capitaliser sur leurs erreurs passées. En évitant tout réentraînement du modèle et en s'appuyant sur une mémoire d'expérience accumulée, LabEvolver propose une voie moins coûteuse et plus rapide à déployer que le fine-tuning classique, un argument qui compte pour les intégrateurs de robotique de laboratoire où les cycles de test sont longs et les erreurs coûteuses en réactifs ou en sécurité. La baisse marquée des interceptions de sécurité est le chiffre le plus significatif pour les décideurs industriels: elle suggère que le système apprend à anticiper les situations à risque plutôt que de simplement se faire bloquer par des garde-fous statiques, ce qui va dans le sens d'une automatisation scientifique en boucle fermée, où le robot ajuste son comportement sans supervision humaine constante.

LabEvolver s'inscrit dans la lignée des travaux récents sur les agents LLM dotés de mémoire épisodique pour la robotique, une alternative à l'apprentissage par renforcement classique jugée trop gourmande en données et en calcul pour des tâches de laboratoire à faible marge d'erreur. La comparaison avec ReAct, méthode de référence pour le raisonnement et l'action séquentielle des agents LLM, positionne LabEvolver comme une amélioration incrémentale plutôt qu'une rupture méthodologique, la boucle d'évolution externe étant l'apport principal par rapport aux architectures agent-plus-outils existantes. Les auteurs présentent leurs résultats comme une preuve de faisabilité plutôt qu'un système prêt pour un déploiement industriel généralisé: les tests restent limités à la préparation de solutions et n'abordent pas encore la diversité des protocoles d'un vrai laboratoire de recherche. La publication sur arXiv fin juillet 2026 et l'ouverture du code laissent présager des extensions à d'autres tâches de laboratoire dans les prochains mois.

Dans nos dossiers

À lire aussi

Auto-évolution d'agents incarnés par évolution de compétences en environnement d'entraînement
1arXiv cs.RO 

Auto-évolution d'agents incarnés par évolution de compétences en environnement d'entraînement

Un article publié sur arXiv (2608.11350v1, catégorie "cross-listing", 13 août 2026) présente SHAPER, un cadre pour l'adaptation sans entraînement d'agents incarnés (embodied agents) construits autour de modèles de fondation. Le principe : les poids du modèle restent figés, et c'est la couche non paramétrique autour de lui, compétences réutilisables et "harnais" de contexte-code, qui évolue via des essais répétés (rollouts) dans l'environnement cible. Le même modèle figé joue à la fois le rôle de planificateur et d'optimiseur, affinant ses compétences externes sans aucune mise à jour de paramètres. Les auteurs évaluent SHAPER sur deux bancs d'essai, VLABench et ESI-Bench, qui couvrent des agents disposant d'interfaces d'action bas niveau différentes, et comparent les résultats à l'exécution pure, au fine-tuning supervisé (SFT) et à des méthodes de mise à l'échelle au moment du test comme la sélection sans vérificateur et le vote. L'enjeu pour l'industrie robotique est concret. Le fine-tuning supervisé et l'apprentissage par renforcement exigent des données, des fonctions de récompense et des cycles d'entraînement coûteux ; à l'inverse, les approches sans entraînement centrées sur le code s'appuient d'ordinaire sur des API robotiques programmables, souvent absentes des systèmes à interface fixe. SHAPER propose une troisième voie, faire évoluer les compétences et le harnais logiciel plutôt que le modèle lui-même, ce qui intéresserait particulièrement les intégrateurs qui ne peuvent pas se permettre de réentraîner un modèle à chaque nouvel environnement de déploiement. Les résultats restent toutefois issus de bancs d'essai simulés, pas de déploiements sur robots physiques : c'est une preuve de concept méthodologique, pas encore une validation terrain. Ce travail s'inscrit dans une tendance plus large où la performance des agents incarnés dépend autant du harnais d'exécution, compétences, contexte, interfaces d'action, que des poids du modèle sous-jacent. Il se positionne explicitement entre deux familles d'approches existantes : le fine-tuning et le RL d'un côté, gourmands en données et en calcul, et les approches code-centric sans entraînement de l'autre, limitées par leur dépendance à des API robotiques programmables. L'article ne mentionne ni partenariat industriel ni plateforme robotique commerciale associée ; la suite logique serait une validation sur robots réels pour vérifier si les gains observés sur VLABench et ESI-Bench se transposent hors simulation.

RecherchePaper
1 source
AnyGoal : exploration multi-agents guidée par vision-langage pour une navigation permanente sans entraînement
2arXiv cs.RO 

AnyGoal : exploration multi-agents guidée par vision-langage pour une navigation permanente sans entraînement

Une équipe de chercheurs a publié sur arXiv (arXiv:2606.13878) AnyGoal, une architecture multi-agents de navigation en intérieur conçue pour fonctionner sans entraînement préalable sur les scènes cibles. Le système coordonne plusieurs robots via une carte partagée appelée Bayesian Value Map (BVM), une grille 2D maintenant pour chaque pixel une distribution gaussienne (μ, σ²) représentant la pertinence estimée de l'objectif. Cette carte est mise à jour par fusion pondérée des scores issus d'un modèle vision-langage (VLM), projetés via un masque conique de profondeur, et n'est jamais remise à zéro entre les sous-tâches, permettant une accumulation d'indices dite « lifelong ». Sur le benchmark GOAT-Bench (360 épisodes, 2 669 sous-tâches, configuration physique stricte : pas discrets de 0,25 m, champ de vision horizontal de 42°, sans téléportation), la version bi-agent atteint 52,4 % de taux de réussite par sous-tâche (Subtask SR) pour un SPL de 12,7 %, contre 41,9 % en configuration mono-agent. Ce résultat représente un gain de +27,5 points de pourcentage sur Modular GOAT (24,9 %), le système modulaire de référence précédent, ce qui est substantiel dans un domaine où les progrès se mesurent souvent en quelques points. L'intérêt principal réside dans l'approche sans entraînement : là où la plupart des politiques de navigation end-to-end se dégradent dès qu'elles rencontrent des scènes, des catégories d'objets ou des modalités d'objectif hors distribution, AnyGoal s'appuie sur la généralisation intrinsèque du VLM. L'ablation à quatre variables de perception révèle que l'intégration de détecteurs open-vocabulary déplace le goulot d'étranglement : la cause principale d'échec n'est plus l'exploration, mais la vérification de l'objectif, un déplacement de problème qui oriente clairement les futurs travaux. AnyGoal s'inscrit dans la lignée des travaux tentant de remplacer les pipelines fermés (détection à ensemble d'objets fixe, comme dans Modular GOAT) et les mémoires 3D denses (comme 3D-Mem, coûteuses à maintenir et sensibles au point de vue) par des représentations légères pilotées par le langage. La coordination multi-agents repose ici sur un allocateur glouton avec pénalité de séparation spatiale et hysteresis d'engagement, sans contrôleur centralisé, ce qui simplifie le déploiement. L'architecture reste à ce stade une contribution de recherche publiée sur preprint ; aucun pilote industriel ni déploiement réel n'est annoncé. Les prochaines étapes naturelles concernent la robustesse du VLM à la vérification de but et l'extension à des environnements semi-structurés ou extérieurs, où la généralisation sera encore plus mise à l'épreuve.

RecherchePaper
1 source
Apprendre sans perdre son identité : l'évolution des capacités des agents incarnés
3arXiv cs.RO 

Apprendre sans perdre son identité : l'évolution des capacités des agents incarnés

Des chercheurs ont publié sur arXiv (arXiv:2604.07799) un cadre baptisé "capability-centric evolution paradigm" qui permet aux agents robotiques incarnés d'acquérir continuellement de nouvelles compétences sans modifier leur architecture centrale. Le concept pivot est celui des Embodied Capability Modules (ECMs): des unités modulaires et versionnées de fonctionnalité, qui peuvent être apprises, affinées et composées indépendamment de l'identité cognitive de l'agent. Le processus fonctionne en boucle fermée -- exécution de tâche, collecte d'expérience, raffinement du modèle, mise à jour du module -- le tout supervisé par une couche d'exécution (runtime layer) appliquant en permanence les contraintes de sécurité. En simulation, le taux de réussite des tâches est passé de 32,4% à 91,3% en 20 itérations, avec zéro dérive de politique et zéro violation de sécurité signalées. Le problème adressé est concret: dans les systèmes robotiques à longue durée de vie (entrepôts, manufactures, logistique hospitalière), chaque mise à jour du modèle risque de dégrader des comportements précédemment validés -- un frein majeur au déploiement à l'échelle. En découplant l'identité de l'agent de l'évolution de ses capacités, l'approche ECM ouvre la voie à des mises à jour incrémentales et auditables sans régression. Les performances annoncées surpassent SPiRL et SkiMo, deux méthodes de référence en apprentissage de compétences. Il faut cependant souligner que l'ensemble des résultats est obtenu en simulation uniquement: le franchissement du sim-to-real gap, défi central de la robotique incarnée, n'est pas démontré dans ce travail. Cette recherche s'inscrit dans un courant plus large autour du lifelong learning et de la modularité en robotique, en réponse directe aux limites du fine-tuning de politique classique et du prompt engineering, qui induisent ce que les auteurs nomment une "instabilité d'identité" dans les systèmes durables. Elle dialogue avec les travaux sur les VLA (Vision-Language-Action models) comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, où la question de la mise à jour continue sans régression est également ouverte. Pour les intégrateurs et les décideurs industriels, la prochaine étape déterminante sera la validation sur hardware réel, en environnements non contrôlés, avant toute considération de déploiement.

RecherchePaper
1 source
Mémoire à long terme pour agents VLA dans l'exécution de tâches en environnement ouvert
4arXiv cs.RO 

Mémoire à long terme pour agents VLA dans l'exécution de tâches en environnement ouvert

Une équipe de chercheurs a publié le 22 avril 2026 sur arXiv (ref. 2504.15671) les résultats de ChemBot, un système robotique conçu pour automatiser des protocoles d'expérimentation chimique complexes en laboratoire. ChemBot repose sur une architecture à deux couches couplant un agent IA planificateur à un modèle Vision-Language-Action (VLA) baptisé Skill-VLA, capable de décomposer hiérarchiquement des tâches longues, typiquement des protocoles multi-étapes, puis de les exécuter sur des robots collaboratifs. Le système intègre une mémoire persistante à double niveau qui archive les trajectoires réussies sous forme d'assets réutilisables, et s'appuie sur un serveur Model Context Protocol (MCP) pour orchestrer les sous-agents et les outils. Un mécanisme d'inférence asynchrone basé sur la prédiction d'états futurs est également implémenté pour réduire les discontinuités de trajectoire, un défaut récurrent des VLA standards. Les expériences rapportées montrent des taux de succès et une précision opérationnelle supérieurs aux baselines VLA existantes sur des scénarios longs et multi-étapes. Ce travail adresse une limite structurelle bien documentée des modèles VLA : leur incapacité à capitaliser sur les expériences passées, ce qui force le système à recommencer par tâtonnements à chaque nouvelle session. En intégrant une mémoire persistante récupérable, ChemBot réduit concrètement le "trial-and-error gap" dans des environnements à longue horizon de planification, un problème critique pour l'automatisation de laboratoire où une erreur en milieu de protocole peut invalider toute une expérience. C'est également une démonstration applicative du sim-to-real dans un domaine non industriel, le laboratoire chimique, traditionnellement peu couvert par les benchmarks robotiques. Pour les intégrateurs B2B dans le pharma ou la recherche chimique, cela constitue un signal concret vers des robots de laboratoire autonomes capables de gérer des workflows non déterministes. Les modèles VLA ont connu une montée en puissance rapide depuis 2023 avec des travaux comme RT-2 (Google DeepMind), OpenVLA et Pi-0 (Physical Intelligence), mais la majorité des déploiements restent limités à des tâches courtes et répétitives. ChemBot se positionne dans le segment émergent des "long-horizon VLA", aux côtés de travaux comme SayCan ou des architectures hiérarchiques de Carnegie Mellon. Aucun déploiement industriel n'est annoncé à ce stade, il s'agit d'une publication académique avec validation sur robots collaboratifs en environnement contrôlé. Les prochaines étapes logiques incluent des tests sur des plateformes comme les robots Universal Robots ou Franka, et une intégration potentielle avec des systèmes LIMS existants dans les laboratoires pharmaceutiques.

RechercheOpinion
1 source