Aller au contenu principal
RePlan-Bot : replanification à plusieurs niveaux pour le suivi d'instructions par IA incarnée
RecherchearXiv cs.RO 

RePlan-Bot : replanification à plusieurs niveaux pour le suivi d'instructions par IA incarnée

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche a publié fin mai 2026 un preprint arXiv (2605.25851) présentant RePlan-Bot, un agent conçu pour l'exécution d'instructions en langage naturel dans des environnements 3D interactifs, un champ désigné sous le terme Embodied Instruction Following (EIF). Le système repose sur trois couches complémentaires : un auditeur de haut niveau basé sur un LLM, qui ajuste dynamiquement les sous-objectifs en fonction des retours de l'environnement ; un mécanisme de recherche guidé par le sens commun, s'appuyant sur une carte d'instances multi-couches pour localiser précisément les objets ; et un correcteur léger basé sur un Vision Transformer (ViT), chargé de détecter et corriger les actions bas niveau à risque avant qu'elles ne causent des erreurs irréversibles. Évalué sur le benchmark ALFRED (Action Learning From Realistic Environments and Directives), RePlan-Bot revendique des performances à l'état de l'art dans les environnements vus et non vus, bien que l'abstract ne fournisse aucun chiffre précis de taux de succès ni comparaisons numériques explicites.

L'intérêt de cette architecture pour les équipes d'IA embarquée réside dans sa gestion du replanning continu face aux changements d'état irréversibles, un point de défaillance classique des systèmes de planification hiérarchique. En robotique de service ou en manipulation d'objets, une action mal exécutée (déplacer un objet au mauvais endroit, ouvrir un conteneur prématurément) peut invalider l'ensemble du plan en cours. RePlan-Bot adresse ce problème via un audit permanent pendant l'exécution, ce qui le distingue des approches plan-then-execute qui supposent un environnement statique. La combinaison LLM haute-décision et ViT basse-exécution reflète une tendance structurante dans les architectures VLA (Vision-Language-Action) actuelles : déléguer la supervision sémantique à un modèle de langage, et la correction réactive à un modèle vision plus léger et plus rapide.

Le benchmark ALFRED, publié par l'Allen Institute for AI en 2020, reste la référence dominante pour l'EIF en simulation (environnement iTHOR), mais son écart avec les conditions réelles (manipulation physique, bruit sensoriel, variabilité des objets) est bien documenté dans la littérature. RePlan-Bot s'inscrit dans un champ de recherche concurrentiel qui inclut des travaux comme FILM et HLSM, ainsi que des approches VLA plus récentes comme OpenVLA ou Pi-0 de Physical Intelligence. Aucun déploiement matériel ni partenariat industriel n'est mentionné dans le preprint : il s'agit d'une contribution académique en environnement simulé, et la question du transfert sim-to-real, centrale pour tout intégrateur, reste entière.

À lire aussi

TravExplorer : exploration incarnée inter-niveaux par planification 3D sensible à la traversabilité
1arXiv cs.RO 

TravExplorer : exploration incarnée inter-niveaux par planification 3D sensible à la traversabilité

Des chercheurs proposent TravExplorer, un framework de navigation autonome multi-étages publié en mai 2026 sur arXiv (arXiv:2605.19958). Le système s'attaque à la navigation zero-shot par objets (ZSON, Zero-Shot Object Navigation), soit la capacité à localiser une cible désignée en langage naturel dans un environnement inconnu, sans carte préalable. Validé sur 4 195 épisodes simulés dans les benchmarks HM3D (Habitat-Matterport 3D) et Matterport3D (MP3D), puis sur 50 essais réels avec un robot quadrupède Unitree Go2, TravExplorer opère sur escaliers, paliers et espaces à chevauchements verticaux. Le système maintient une carte volumétrique unifiée distinguant structures occupées et surfaces accessibles au robot, extrait des frontières traversables sur sols, escaliers et paliers, et s'appuie sur un planificateur hiérarchique couplant une recherche 3D guidée par points d'appui (foothold-guided) à une optimisation de trajectoire localement contrainte en vertical. Presque tous les systèmes ZSON existants supposent un environnement mono-étage et une représentation plane, une hypothèse qui casse dans tout bâtiment réel comportant escaliers ou mezzanines. TravExplorer comble ce fossé avec deux apports concrets : un module sémantique allégé qui aligne une carte d'instances probabiliste (segmentation open-vocabulary en ligne) avec une carte de valeur spatiale via image-to-text rapide, réduisant la latence de raisonnement ; et une stratégie de perception active FOV-aware pour résoudre les zones partiellement observées lors des transitions d'étages. Les résultats sur HM3D et MP3D sont supérieurs aux baselines ObjectNav de référence, et les 50 essais sur Go2 sans carte ni intervention humaine constituent une validation sim-to-real concrète, même si elle reste limitée à une seule plateforme et à des intérieurs contraints. Le champ du ZSON multi-étages émerge dans un contexte plus large d'ambition robotique pour les environnements non structurés. HM3D (Meta) et MP3D sont les benchmarks standards du domaine ; y surpasser les méthodes ObjectNav actuelles est un signal de maturité technique. Le Unitree Go2, quadrupède de recherche commercialisé autour de 8 700 euros, est devenu une plateforme de référence en navigation académique. Le code source sera mis à disposition sur GitHub. Les extensions logiques incluent des bâtiments plus complexes, des espaces semi-ouverts et l'intégration sur robots humanoïdes ou à roues. Aucun acteur européen n'est impliqué dans cette publication.

RecherchePaper
1 source
IA incarnée : représentations polynomiales pour le contrôle moteur structuré par l'interaction
2arXiv cs.RO 

IA incarnée : représentations polynomiales pour le contrôle moteur structuré par l'interaction

Des chercheurs présentent PRISM (Polynomial Representations for Interaction-Structured Motor Control), une nouvelle architecture pour les politiques de contrôle robotique, décrite dans un preprint arXiv publié fin juillet 2026. Le constat de départ : la quasi-totalité des politiques robotiques reposent aujourd'hui sur des MLP (perceptrons multicouches) qui associent observations et actions de façon linéaire couche par couche, alors que des phénomènes physiques clés (puissance, effets inertiels, contact, glissement, compliance) dépendent en réalité de produits entre variables observées, pas de leur simple somme pondérée. PRISM introduit un module polynomial factorisé qui expose ces interactions d'ordre supérieur sans énumérer tous les termes polynomiaux possibles, ce qui le rend compact et entraînable de bout en bout. En apprentissage par renforcement, le module s'ajoute après un backbone MLP standard via une fonction polynomiale élément par élément activée progressivement ; en apprentissage par imitation, il remplace le conditionnement proprioceptif linéaire de Diffusion Policy par une couche polynomiale. Sur des tâches de locomotion humanoïde et de manipulation à contacts riches, PRISM surpasse les MLP classiques, y compris des MLP plus larges à capacité équivalente, et produit un comportement compliant sans capteur de force, de couple, tactile, ni étiquette de contact ou contrôle en admittance. Pour l'industrie robotique, le résultat central est que la structure des interactions ne se remplace pas simplement par davantage de paramètres, un argument qui s'oppose à la tendance actuelle consistant à gonfler la taille des modèles VLA (Pi-0, GR00T N2, Helix) pour gagner en performance. La compliance sans capteur intéresse particulièrement les intégrateurs, car elle réduit le coût et la complexité du câblage tactile sur les mains et pinces. PRISM se positionne comme une brique architecturale plutôt qu'un produit : c'est un preprint non encore relu par les pairs, testé en simulation sur des benchmarks académiques, avec code et vidéos disponibles sur la page du projet. La comparaison directe avec Diffusion Policy, référence largement utilisée en apprentissage par imitation, suggère une piste d'intégration dans les têtes d'action des futurs modèles VLA plutôt qu'un remplacement complet des architectures existantes.

RecherchePaper
1 source
Vers l'échec à la supervision : DynamicEnvPlan pour une planification incarnée robuste à long terme
3arXiv cs.RO 

Vers l'échec à la supervision : DynamicEnvPlan pour une planification incarnée robuste à long terme

Des chercheurs ont présenté DynamicEnvPlan, un système de planification en boucle fermée pour agents humanoïdes évoluant dans des environnements qui changent en cours d'exécution, publié sur arXiv début août 2026 (arXiv:2608.00613). Le framework associe agents humanoïdes, compétences primitives de haut niveau, mémoire sémantique structurée et perturbations contrôlables. Trois modules, planification, perturbation et correction supervisée, transforment les échecs d'exécution en traces de récupération, utilisées pour un fine-tuning supervisé en plusieurs étapes. Testé sur 104 combinaisons tâche-scène couvrant des conditions i.i.d., de généralisation compositionnelle et hors distribution, le système fait passer le taux de réussite de 33,3% à 76,2% par rapport au planificateur de base, tout en améliorant les sept métriques d'évaluation retenues, dont la sécurité et la conformité d'affordance, c'est-à-dire le respect des contraintes physiques d'interaction avec les objets. Cette approche cible un angle mort classique des benchmarks robotiques: les échecs de planification, objet déplacé, obstacle apparu, porte fermée, sont généralement consignés comme des scores d'évaluation plutôt que réinjectés dans l'entraînement. En transformant systématiquement ces échecs en signal d'apprentissage, DynamicEnvPlan illustre un basculement dans la planification pilotée par des modèles vision-langage-action (VLA): passer d'une exécution calquée sur des trajectoires nominales à une capacité de récupération active face à un monde qui bouge pendant l'action. Pour les intégrateurs qui travaillent sur des humanoïdes en environnement non contrôlé, entrepôt, domicile, site industriel, un gain de 43 points de taux de réussite sur des scénarios incluant de l'hors distribution est un signal concret que le fossé entre démonstration et robustesse réelle peut se combler par la donnée d'entraînement. Les résultats restent toutefois mesurés en simulation, sur un périmètre encore limité. Le travail s'inscrit dans la vague de recherche en planification embodied qui a suivi la percée des modèles VLA comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure AI, où la difficulté ne réside plus dans l'exécution motrice mais dans une planification de haut niveau capable de s'adapter. Contrairement à ces systèmes orientés produit, DynamicEnvPlan reste un travail académique centré sur la méthode de génération de données, sans robot ni partenaire industriel précisé, ni calendrier de déploiement physique. La suite logique serait une validation sur plateforme humanoïde réelle, au-delà de la simulation, et une comparaison directe avec les frameworks de planification hiérarchique déjà utilisés par les acteurs commerciaux du secteur.

RecherchePaper
1 source
PACE : allocation adaptative de budget pour une planification incarnée efficace en temps
4arXiv cs.RO 

PACE : allocation adaptative de budget pour une planification incarnée efficace en temps

Des chercheurs présentent PACE (Planning with Adaptive Cognitive Effort), un nouveau framework destiné à accélérer la planification des systèmes robotiques pilotés par des grands modèles de langage à raisonnement renforcé. Publié le 5 août 2026 sur arXiv (identifiant 2608.03034v1), le papier s'attaque au principal frein empêchant ces modèles d'équiper des systèmes embarqués: des délais d'inférence qui dépassent parfois la minute par instance de planification, le modèle devant achever tout son raisonnement avant d'exécuter la moindre action. PACE repose sur deux mécanismes. Une architecture "Interleaved Think-Act" entrelace le raisonnement cognitif et l'exécution des actions au lieu de les séquencer strictement. Un "Dynamic Budget Allocator" ajuste ensuite le budget de tokens de raisonnement à la fenêtre de temps d'exécution réellement disponible. Testé sur le benchmark Robotouille avec le modèle Qwen3-8B-AWQ, PACE atteint un taux de réussite de 10%, soit une amélioration relative de 67% par rapport à la référence ReAct+Think, tout en accélérant le temps de réflexion d'un facteur 6,9 comparé à un raisonnement non contraint. Le framework parvient à masquer 66,8% du temps de réflexion dans les fenêtres d'exécution. Cette approche répond à un goulot d'étranglement bien identifié: les modèles de raisonnement type "thinking" améliorent la qualité des plans générés mais restent inutilisables en temps réel, un robot ne pouvant rester immobile plusieurs dizaines de secondes entre chaque décision. En interrompant le raisonnement pour agir puis en le reprenant pendant l'exécution, PACE ouvre une piste concrète pour rendre les architectures LLM-planificateur compatibles avec des domaines sensibles à la latence, du pick-and-place industriel à la navigation d'AMR. Il faut toutefois relativiser l'ampleur du résultat: un taux de réussite absolu de 10% reste faible en tant que tel, même si le gain relatif et l'accélération démontrent la validité du principe. Il s'agit d'une preuve de concept en simulation, pas d'un système prêt pour un déploiement industriel. Classé "Announce Type: new" sur arXiv, ce travail s'inscrit dans la vague de recherches qui tentent d'adapter les modèles de raisonnement récents, conçus pour du texte, à des contextes physiques et temporisés. La comparaison retenue par les auteurs, ReAct+Think, reflète l'approche dominante actuelle où planification et action restent strictement séquentielles. Robotouille, le benchmark utilisé, simule des tâches de cuisine multi-étapes nécessitant coordination et replanification, un terrain de test courant pour évaluer les agents LLM en environnement embarqué. Les auteurs ne donnent ni calendrier de suite ni validation sur robot physique; l'extension à d'autres benchmarks et, à terme, des tests sur plateformes réelles constituent les prochaines étapes attendues pour ce type de travaux académiques.

RecherchePaper
1 source