Aller au contenu principal
Cortex : un cadre d'agent incarné à alignement bidirectionnel pour la manipulation à long horizon
RecherchearXiv cs.RO 

Cortex : un cadre d'agent incarné à alignement bidirectionnel pour la manipulation à long horizon

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Cortex, présenté dans un article arXiv publié début juillet 2026 (arXiv:2607.05377), est un nouveau framework d'agent incarné destiné aux tâches de manipulation robotique à long horizon. Le problème qu'il cible: les modèles Vision-Language-Action (VLA) actuels, de par leur nature markovienne, ne s'appuient que sur l'observation courante et peinent sur les séquences longues, tandis que les approches hiérarchiques à double système existantes souffrent d'un décalage entre la sémantique du planning haut niveau et la cinématique d'exécution bas niveau. Cortex introduit une interface de planification qui traduit les plans du VLM haut niveau en sous-tâches exécutables pour le VLA bas niveau, en standardisant les manipulations en 32 primitives de compétences canoniques. Les chercheurs ont ainsi pu annoter automatiquement plus de 4 000 heures de vidéos open-source et générer 30 heures de données de simulation, avec une stratégie d'échantillonnage équilibré par événements pour affiner l'entraînement sur les transitions ambiguës entre sous-tâches.

Sur le plan des résultats, Cortex dépasse les baselines monolithiques de 3,1% sur le benchmark Libero-long et de 4,1% sur RoboTwin, en évaluation à la fois open-loop (VLM) et closed-loop (système complet). Plus notable pour l'industrie: le VLM généraliste de Cortex permet de réaliser en zero-shot des tâches réelles inédites à long horizon, comme des expériences de chimie en plusieurs étapes, simplement en le couplant à un VLA fine-tuné, une capacité que le fine-tuning d'un VLA seul n'atteint pas. Cela suggère qu'une architecture correctement pontée entre planification et exécution peut combler l'écart simulation-réel mieux qu'un unique modèle monolithique, un argument qui intéresse directement les intégrateurs cherchant à généraliser au-delà des tâches d'entraînement.

Ce travail s'inscrit dans la lignée des architectures duales explorées par des modèles comme Pi-0, GR00T N2 ou Helix, qui tentent chacun de résoudre la même tension entre raisonnement sémantique et contrôle moteur. Cortex reste à ce stade une contribution de recherche évaluée sur benchmarks académiques et non un système déployé en production, mais son approche par primitives standardisées et annotation automatique à grande échelle pourrait influencer la prochaine génération de frameworks d'agents robotiques génécralistes.

À lire aussi

ChainVLA : enchaînement des requêtes vision-langage-action via un état d'exécution unifié pour la manipulation à long horizon
1arXiv cs.RO 

ChainVLA : enchaînement des requêtes vision-langage-action via un état d'exécution unifié pour la manipulation à long horizon

Une équipe de recherche présente ChainVLA, une politique vision-langage-action (VLA) de 1,2 milliard de paramètres conçue pour la manipulation robotique à long horizon. Le système introduit un "Progress Context", combinant un état de travail récurrent et une mémoire d'événements éparse pour suivre la progression de la tâche à partir des observations, ainsi qu'un "Motion Tail" qui réinjecte la portion non exécutée de la prédiction précédente dans la génération de l'action suivante. Ces deux composants conditionnent un décodeur qui régénère chaque horizon d'action à partir de la dernière observation, permettant à l'état porté de guider la prédiction suivante sans la figer. Sur le benchmark RMBench, ChainVLA atteint 62,8% de réussite moyenne, et 98,8% sur les quatre suites LIBERO. Les ablations montrent l'importance critique de chaque composant : retirer le Motion Tail fait chuter le score RMBench à 11,2%, et retirer le Progress Context à seulement 3,0%. Ce travail cible un problème structurel connu des politiques VLA actuelles à découpage par blocs d'actions ("action-chunked") : à chaque nouvelle requête, le modèle replanifie depuis zéro à partir de l'entrée courante, perdant la continuité entre ce qui a déjà été accompli et ce qui reste à faire. Les approches existantes ne couvrent qu'une partie du problème, soit en préservant la mémoire de tâche à long terme, soit la continuité de mouvement à court terme via la réutilisation ou l'ensembling d'actions, mais pas les deux simultanément. Pour les intégrateurs et chercheurs en robotique manipulatrice, cette lacune du "handoff" entre requêtes successives est directement liée à l'échec des tâches longues et multi-étapes, un point de friction majeur pour le déploiement de VLA en conditions réelles au-delà des démonstrations en laboratoire. L'ampleur des écarts de performance observés dans les ablations suggère que la continuité de mouvement joue un rôle clé pour préserver le flux d'observations dont dépend l'inférence de progression, un mécanisme jusqu'ici sous-exploré. Le papier, publié sur arXiv (2608.02326v1) début août 2026, s'inscrit dans la lignée des travaux récents sur les politiques VLA à grande échelle comme Pi-0, GR00T N2 ou Helix, qui cherchent tous à améliorer la robustesse des robots manipulateurs sur des tâches complexes et prolongées. ChainVLA se positionne comme une réponse ciblée à la limite du replanning répété à chaque requête, un défaut partagé par de nombreuses architectures action-chunked actuelles. Les benchmarks utilisés, RMBench et LIBERO, sont des références standard du domaine pour évaluer la manipulation robotique, ce qui permet une comparaison directe avec les approches concurrentes. Le document ne précise pas de calendrier de déploiement matériel ni de partenariat industriel identifié à ce stade ; il s'agit pour l'instant d'un travail de recherche évalué en simulation et sur benchmarks standardisés, sans validation annoncée sur robot physique en conditions réelles de production.

RechercheActu
1 source
ACE : contrôle à base d'agents pour la manipulation incarnée via raisonnement de flux de travail zéro-shot
2arXiv cs.RO 

ACE : contrôle à base d'agents pour la manipulation incarnée via raisonnement de flux de travail zéro-shot

Une équipe de recherche publie sur arXiv (arXiv:2607.04162v1) ACE, pour Agentic Control for Embodied Manipulation, un cadre de raisonnement en zero-shot destiné à la manipulation d'objets sur table à partir d'instructions en langage naturel. Plutôt que de faire correspondre directement le langage à des actions motrices bas niveau, comme le font la plupart des politiques VLA de bout en bout, ACE orchestre un raisonnement de type workflow agentique couplé à deux compétences robotiques réutilisables : une interface de repérage visuel et une primitive générique de saisie-dépose. Le sous-objectif actif est traduit en un masque visuel qui désigne à la fois l'objet cible et sa destination, masque qui est suivi dans le temps, exposé à la vérification humaine, puis transmis à une politique d'exécution indépendante de la tâche. Le système fonctionne en boucle fermée grâce à une mémoire multi-échelle temporelle qui vérifie après chaque action si le sous-objectif a réussi, avant de décider de poursuivre, réessayer, corriger ou replanifier. Sur des tâches longues et logiquement complexes, comme la formation d'équations avec des cubes numérotés ou la récupération d'objets sous contrainte, ACE atteint 50% de réussite pour la formation d'équations et 70% pour la récupération sous contrainte, quand les approches de bout en bout classiques échouent largement sur ces mêmes tâches. Ce résultat cible un point de friction précis du secteur : la capacité d'un système à généraliser à des scènes et contraintes sémantiques inédites sans réentraînement spécifique à la tâche, ce qui reste l'un des principaux écarts entre les démonstrations en laboratoire et un déploiement robuste en environnement réel. En montrant qu'un raisonnement explicite par étapes, combiné à un contrôle médié par masque, surpasse des politiques end-to-end sur des tâches à horizon long, ACE apporte un argument concret pour les intégrateurs et équipes de R&D qui cherchent des architectures de manipulation capables de gérer l'échec d'exécution et la correction humaine en cours de tâche, plutôt que de miser uniquement sur l'échelle des données d'entraînement. ACE s'inscrit dans la lignée des travaux récents sur les architectures agentiques pour la robotique, qui cherchent à combiner les capacités de raisonnement des grands modèles de langage avec des compétences robotiques modulaires et vérifiables, en alternative aux politiques VLA monolithiques comme Pi-0 ou GR00T. Les auteurs positionnent explicitement leur approche contre des baselines de bout en bout sur les mêmes bancs d'essai, mais l'évaluation reste limitée à des scénarios de manipulation tabletop en conditions contrôlées, sans indication de déploiement industriel ni de partenariat annoncé à ce stade.

RecherchePaper
1 source
IA incarnée sûre pour les tâches à long horizon : une analyse multi-couches de la manipulation robotique
3arXiv cs.RO 

IA incarnée sûre pour les tâches à long horizon : une analyse multi-couches de la manipulation robotique

Une équipe de chercheurs publie sur arXiv (identifiant 2606.05660, juin 2026) une revue systématique de la sécurité dans les systèmes d'IA incarnée (embodied AI) appliqués à la manipulation robotique à long horizon. Ce survey structure la littérature selon trois niveaux d'intervention : la sécurité au stade de la planification (planning-time), au niveau de la politique de contrôle (policy-time) et pendant l'exécution (execution-time). Les auteurs identifient quatre vecteurs de risque pouvant s'accumuler dans un même système en boucle fermée : le misgrounding sémantique (l'agent interprète mal l'instruction de haut niveau), la propagation d'erreur entre sous-tâches, la dérive d'exécution (execution drift) et les risques physiques liés aux contacts. Ils distinguent par ailleurs trois catégories de garanties dans la littérature existante : formelles, statistiques et heuristiques empiriques, et concluent que les preuves formelles font défaut à chaque couche. L'enjeu est direct pour les intégrateurs et les décideurs industriels. Un bras robotique déployé en entrepôt ou en ligne de production enchaîne des dizaines d'actions sur des horizons temporels étendus, et chaque sous-tâche peut propager silencieusement une erreur vers les suivantes. Or le survey révèle que la sécurité au niveau de la politique de contrôle, au coeur même des modèles VLA (Vision-Language-Action) comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, est la couche la moins documentée empiriquement. Les mécanismes d'intervention déclenchés par l'incertitude (uncertainty-triggered intervention) restent immatures, et les benchmarks spécifiques à la sécurité en manipulation longue durée sont quasi-inexistants, ce qui rend toute validation rigoureuse avant déploiement aujourd'hui difficile. Ce travail paraît dans un contexte d'accélération industrielle : Figure AI, Boston Dynamics, Unitree et Physical Intelligence multiplient les démonstrations de manipulation dextère, souvent en conditions semi-contrôlées, alimentant un écart potentiel entre annonces marketing et réalité opérationnelle. Il convient de souligner que ce papier est une analyse critique de l'existant, pas un nouveau système ou algorithme. Ses recommandations prioritaires portent sur trois axes : des assurances cross-couche cohérentes de la planification jusqu'à l'exécution physique, des benchmarks dédiés à la sécurité en manipulation longue durée, et des protocoles de déploiement progressifs pour les agents robotiques en environnements réels. En creux, le constat est que les capacités du secteur progressent plus vite que les outils pour en évaluer la sécurité.

UEL'absence de benchmarks formels de sécurité pour la manipulation longue durée concerne directement les industriels européens déployant des bras robotisés, et pourrait alimenter les exigences de validation dans le cadre de l'AI Act pour les systèmes robotiques à haut risque.

RecherchePaper
1 source
Guava : un cadre efficace et universel pour la manipulation incarnée
4arXiv cs.RO 

Guava : un cadre efficace et universel pour la manipulation incarnée

Des chercheurs ont publié en juin 2026 sur arXiv (identifiant 2606.18363) Guava, un cadre de harness pour agents robotiques de manipulation. Le système repose sur trois ingrédients identifiés après une exploration systématique de l'espace de conception : des boucles itératives perception-raisonnement-action, des abstractions d'action sémantiques et des observations multimodales. À partir de ces principes, les auteurs ont entraîné un modèle open-source de 4 milliards de paramètres en utilisant moins de 2 000 trajectoires collectées entièrement en simulation, sans aucune donnée réelle. Les évaluations en environnement simulé et en conditions réelles montrent des performances comparables aux modèles propriétaires de pointe, avec une généralisation robuste à des objets non vus en entraînement, des instructions inédites et des tâches longues à plusieurs étapes. Le résultat le plus significatif est qu'un modèle compact peut atteindre des performances compétitives avec des systèmes propriétaires massifs à condition que l'architecture de harness soit bien conçue, et non que le modèle soit immense. Cela conteste directement l'hypothèse dominante selon laquelle les systèmes VLA (Vision-Language-Action) end-to-end nécessitent des millions de trajectoires réelles pour franchir le sim-to-real gap. L'approche par tool use découple le raisonnement de haut niveau des modules de perception et de contrôle, rendant le cadre agnostique au modèle sous-jacent, un avantage concret pour les intégrateurs industriels souhaitant substituer les composants sans réentraîner l'ensemble du système. Ce travail s'inscrit dans un débat structurant de la manipulation robotique qui oppose les VLA end-to-end, comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, aux approches modulaires par harness, qui misent sur la composabilité et le raisonnement émergent des LLM. L'approche rappelle SayCan (Google/Everyday Robots) ou Code as Policies, mais avec une validation sim-to-real plus explicite et sur modèle open-source. Le modèle 4B utilisé n'est pas nommé dans le papier, et aucun déploiement industriel ni partenariat commercial n'est mentionné : Guava demeure pour l'instant un résultat de recherche, sans timeline de productisation annoncée.

UELes laboratoires de recherche et intégrateurs robotiques européens peuvent s'appuyer sur ce cadre open-source pour développer des systèmes de manipulation compétitifs sans infrastructure de données réelles à grande échelle.

RechercheOpinion
1 source