Aller au contenu principal

Actualités robotique — page 71

4 602 articles au fil, du plus récent au plus ancien.

Commande tolérante aux pannes et préservant la rigidité de robots en treillis gonflables
3501arXiv cs.RO 

Commande tolérante aux pannes et préservant la rigidité de robots en treillis gonflables

Des chercheurs ont publié le 21 mai 2026 un cadre de contrôle tolérant aux pannes pour robots-treillis gonflables isopérimétriques, une classe de structures robotiques capables de modifier leur propre géométrie en ajustant la longueur de leurs tubes pneumatiques. L'architecture proposée repose sur trois contributions techniques : une extension de l'optimisation cinématique pour gérer toute combinaison de défaillances moteur via des contraintes d'égalité qui neutralisent les actionneurs hors-service, l'introduction de contraintes DTCBF (Discrete-Time Control Barrier Functions) garantissant mathématiquement la rigidité structurelle en temps discret, et une boucle de contrôle de position en boucle fermée s'appuyant sur des encodeurs embarqués couplés à un estimateur d'état par cinématique directe. Sur un banc de test 2D à 6 actionneurs, les expériences hardware démontrent une préservation de l'espace de travail supérieure à 69 % lors d'une défaillance moteur unique, et une amélioration de la précision de suivi de trajectoire supérieure à 25 % grâce à la boucle fermée. Ces résultats adressent un verrou opérationnel concret pour les robots-treillis déployés en environnements non structurés : sans gestion explicite des pannes, la perte d'un seul actionneur peut rendre le robot inutilisable ou structurellement instable. L'apport des DTCBF est notable car ils offrent des garanties formelles de rigidité, une propriété critique que les approches heuristiques classiques ne peuvent pas assurer. La préservation de 69 % du workspace sous dégradation partielle suggère une dégradation gracieuse plutôt qu'un effondrement des capacités, ce qui est un argument sérieux pour des applications industrielles nécessitant une haute disponibilité. Le gap entre démonstration en simulation et validation hardware réelle est ici comblé, même si les résultats portent uniquement sur une configuration 2D. Les robots-treillis isopérimétriques sont étudiés notamment par le groupe de Zach Manchester à CMU et des équipes liées au JPL (NASA), qui explorent leur potentiel pour l'exploration spatiale et les structures reconfigurables légères. Dans l'espace robotique plus large, cette approche se distingue des robots humanoïdes rigides ou des bras industriels classiques par son rapport résistance/masse élevé et sa reconfigurabilité, au prix d'une complexité de contrôle accrue. Les auteurs positionnent ce travail comme une fondation vers des systèmes 3D plus complexes. Les prochaines étapes naturelles incluent l'extension aux configurations tridimensionnelles, la gestion de défaillances multiples simultanées, et des tests en environnements dynamiques réels.

RecherchePaper
1 source
Perception active et contrôle tenant compte des conflits dans les champs de Gaussian Splatting 3D via des fonctions barrière de contrôle
3502arXiv cs.RO 

Perception active et contrôle tenant compte des conflits dans les champs de Gaussian Splatting 3D via des fonctions barrière de contrôle

Des chercheurs ont publié sur arXiv (référence 2605.20566) un cadre algorithmique baptisé "conflict-aware active perception and control" pour robots évoluant dans des environnements modélisés par 3D Gaussian Splatting (3DGS). L'approche repose sur un programme quadratique unifié qui traite simultanément deux objectifs antagonistes : la sécurité, imposée comme contrainte dure via une Control Barrier Function (CBF), et l'acquisition d'information, traitée comme contrainte souple assouplie par des variables de relâchement (slack variables). La CBF est dérivée d'une métrique de risque de collision dite Average Value-at-Risk (AV@R), qui intègre l'incertitude géométrique de la carte et garantit mathématiquement l'invariance avant d'un ensemble sûr. Pour maximiser la perception, le système sélectionne la prochaine meilleure vue (next-best-view) via une formulation risk-aware de l'Expected Information Gain (EIG), et oriente la caméra vers la direction de montée d'information locale grâce à des "perception barrier functions". Les résultats présentés sont issus de simulations uniquement, sans validation sur plateforme physique. Le problème central que ce travail adresse est structurel : dans un environnement partiellement inconnu, les vues les plus informatives se trouvent précisément dans les zones les moins cartographiées, donc les plus à risque de collision. Les approches existantes basées sur 3DGS traitaient ces deux objectifs séparément ou par simple pondération, sans garanties formelles. Formuler la sécurité comme contrainte inviolable tout en relaxant la perception permet aux décideurs B2B et aux intégrateurs robotiques d'envisager des robots d'exploration actifs qui cartographient des environnements industriels non balisés sans compromis ad hoc entre productivité et sécurité. L'amélioration simultanée de la sécurité et du gain d'information, comparée aux méthodes 3DGS concurrentes, constitue un signal technique intéressant, même si l'absence d'expériences réelles limite pour l'instant la portée de la validation. Le 3DGS s'est imposé comme représentation de référence pour les champs de radiance neuronaux depuis 2023, supplantant progressivement le NeRF grâce à sa vitesse de rendu et sa différentiabilité. Les CBF sont un outil établi en commande sûre, mais leur intégration dans des champs neuronaux pour la perception active reste un axe de recherche émergent. Aucune institution ni entreprise n'est explicitement nommée dans l'abstract, et aucun déploiement industriel n'est annoncé. Les concurrents directs sont les méthodes d'exploration active basées NeRF et les planificateurs next-best-view classiques. Les prochaines étapes naturelles seraient une validation sim-to-real sur plateforme physique et des tests dans des scènes plus complexes.

RecherchePaper
1 source
La startup de robots volants Differential Robotics franchit 500 millions de yuans levés en moins de deux ans
3503Pandaily 

La startup de robots volants Differential Robotics franchit 500 millions de yuans levés en moins de deux ans

La startup chinoise Differential Robotics, basée à Hangzhou, a finalisé un tour de table Series A1 de "plusieurs centaines de millions de RMB", portant son financement total à plus de 500 millions de RMB répartis sur six levées en moins de deux ans d'existence. La société développe ce qu'elle appelle des robots volants à "intelligence incarnée" (flying embodied intelligence), une catégorie distincte des drones classiques téléopérés ou à trajectoire préprogrammée. Ses deux produits commerciaux, le P300 et le P300 Pro, sont conçus pour opérer de manière entièrement autonome dans des environnements sans réseau ni GPS, grâce à un système embarqué qualifié de "double cerveau". Le P300 peut enchaîner des missions d'exploration, de cartographie et d'inspection sans intervention humaine ni information préalable sur l'environnement. Ce positionnement est stratégiquement pertinent dans les segments industriels difficiles d'accès pour les robots terrestres ou les drones conventionnels: espaces confinés, installations souterraines, environnements ATEX ou zones dégradées. L'autonomie sans infrastructure réseau est un différenciateur réel, non un argument marketing, car elle supprime la dépendance aux liens radio qui limitent les drones professionnels actuels. Pour les intégrateurs et les opérateurs industriels, cela réduit le besoin en opérateurs qualifiés et ouvre des cas d'usage en inspection d'actifs (tunnels, cuves, toitures industrielles) que ni les AMR ni les drones FPV ne couvrent efficacement. Reste à qualifier la robustesse de ce "double cerveau" en conditions réelles, les démonstrations publiques disponibles ne donnant pas de métriques précises sur les taux d'échec ou les temps de mission. Differential Robotics s'inscrit dans un marché de la robotique incarnée en Chine estimé à 400 milliards de RMB d'ici 2030 et au-delà de 1 000 milliards de RMB en 2035 selon le Centre de recherche pour le développement du Conseil d'État. Gao Fei, fondateur de l'entreprise, positionne explicitement le robot volant autonome comme l'équivalent aérien des humanoïdes terrestres (Boston Dynamics Spot, Unitree H1, etc.), sur un vecteur différent mais complémentaire. Sur ce segment spécifique, peu d'acteurs occidentaux ont atteint un niveau de maturité produit comparable, bien que Skydio (États-Unis) et Percepto restent des références en inspection autonome. Les prochaines étapes pour Differential Robotics devraient inclure des pilotes industriels à grande échelle et une certification pour les environnements réglementés, conditions sine qua non pour une commercialisation B2B crédible.

Chine/AsieOpinion
1 source
SHAREBOT, plateforme Robot-as-a-Service, lève des centaines de millions de yuans et atteint le statut de licorne à 7 milliards de yuans
3504Pandaily 

SHAREBOT, plateforme Robot-as-a-Service, lève des centaines de millions de yuans et atteint le statut de licorne à 7 milliards de yuans

SHAREBOT, aussi connue sous le nom Qingtian Rent, a bouclé ses tours de financement Série A et A+, levant plusieurs centaines de millions de yuans pour une valorisation post-money de 7 milliards de yuans (environ 970 millions de dollars), franchissant officiellement le seuil de la licorne. Fondée en décembre 2024, la société opère un modèle Robot-as-a-Service (RaaS), louant la capacité opérationnelle de robots à des clients B2B plutôt que de vendre du matériel. Le tour est soutenu par Hillhouse Ventures, Fosun et Zhenghe Group. Avec une flotte déployée dans plus de 50 villes chinoises et plus d'un million d'heures cumulées d'opération, SHAREBOT repositionne désormais sa plateforme au-delà de la location événementielle, ciblant la fabrication industrielle, la logistique d'entrepôt, les campus et les services commerciaux. Ce financement illustre une évolution structurelle du marché robotique chinois, qui commence à se consolider non plus autour des constructeurs mais autour de plateformes d'agrégation et d'orchestration. SHAREBOT agrège des robots de marques multiples, dont Unitree, Zhiyuan, ZhiJi Dynamics, Lingchu Intelligence, Zhongqing et Acceleration Evolution, via un système SaaS unifié permettant la planification de tâches multi-sites, la standardisation des livraisons et une gestion multi-scénarios. La plateforme intègre également une Skills Store, réduisant le coût d'intégration pour les opérateurs industriels. La rapidité de cette valorisation mérite une lecture prudente : le marché RaaS en Chine reste immature, et les métriques communiquées, heures cumulées et villes couvertes, demeurent agrégées sans détail par segment ou par cas d'usage industriel concret. SHAREBOT est issue de l'écosystème Zhiyuan Robot, l'un des constructeurs d'humanoïdes les mieux capitalisés de Chine, ce qui lui a offert un accès privilégié à une flotte matérielle dès le lancement. L'équipe dépasse les 100 personnes, recrutées chez Zhiyuan, Alibaba et Ele.me. Sur le plan concurrentiel, la société s'inscrit dans un segment encore peu structuré, entre des plateformes généralistes de gestion de flottes et des spécialistes verticaux en logistique d'entrepôt. L'annonce ne mentionne aucun client industriel nommé ni volume contractuel précis, ce qui laisse en suspens la distinction entre capacité déployée et usage opérationnel réel. Les prochaines étapes portent sur le développement du système RaaS et l'expansion vers la fabrication et la logistique industrielle, sans calendrier précisé.

Chine/AsieActu
1 source
Verobotics déploie des robots à IA embarquée sur le campus israélien de NVIDIA
3505The Robot Report 

Verobotics déploie des robots à IA embarquée sur le campus israélien de NVIDIA

Sur le campus israélien de NVIDIA, Verobotics a déployé ses robots de nettoyage de façade sur environ 9 290 m² d'enveloppe bâtimentaire, couvrant quelque 3 000 fenêtres et sections de façade. La société, basée à Tel Aviv, a combiné robotique, vision par IA et edge computing embarqué pour réduire l'exposition humaine aux travaux en hauteur tout en constituant un dataset visuel à grande échelle de l'état extérieur des bâtiments. Le déploiement s'est déroulé dans des conditions réelles et contraintes : l'un des bâtiments jouxtait un chantier actif, générant une accumulation de saleté anormalement élevée et des surfaces hétérogènes, après une interruption de nettoyage de huit mois. Le résultat opérationnel a reflété cette réalité, environ 60 % du nettoyage effectué de manière robotisée, 40 % assurés par des équipes humaines, un modèle hybride que Verobotics présente comme délibéré plutôt que comme échec de l'automatisation complète. Pour les intégrateurs et les responsables de facility management, ce déploiement documente un point de bascule dans la robotique de maintenance : la valeur ne réside pas dans l'élimination des opérateurs humains, mais dans la collecte continue de données d'inspection à des endroits structurellement difficiles d'accès. Chaque cycle de nettoyage devient une opportunité d'inspecter joints, panneaux, vitrages et étanchéités de façon répétée et cohérente, une opération quasi impossible à réaliser manuellement sur des structures en hauteur à coût raisonnable. Le robot se transforme ainsi en plateforme d'inspection mobile, générant un historique visuel permanent de l'enveloppe bâtimentaire. Ce modèle, le nettoyage comme vecteur d'entrée, l'inspection comme valeur différenciante, contredit la logique du tout-ou-rien souvent appliquée à la robotique industrielle, et ouvre un segment distinct dans les services aux bâtiments. Il reste néanmoins à noter que la communication officielle ne fournit ni chiffres de productivité comparés au nettoyage manuel, ni métriques de qualité d'inspection, ce qui invite à traiter ce cas comme une validation en conditions réelles plutôt qu'une démonstration de performance absolue. Verobotics s'est positionné sur un marché encore peu robotisé : l'entretien de façade des immeubles commerciaux de grande hauteur. La plateforme embarque du matériel edge AI NVIDIA Jetson directement sur le robot, permettant un traitement des données visuelles sans dépendance réseau permanente, un avantage dans des environnements soumis aux variations de lumière, reflets, vent et géométries complexes. Le partenariat avec NVIDIA constitue autant un cas d'usage marketing qu'une validation technique en conditions réelles. Sur le marché des robots de façade, Verobotics fait face à des acteurs comme Serbot (Suisse) ou SKY Robotics (Israël), tandis que le segment de l'inspection bâtimentaire par drone et robot mobile voit émerger des solutions concurrentes en Europe et en Asie. L'absence de tarification, de volume de clients actifs ou de calendrier de déploiement commercial dans la communication laisse ouverte la question de la mise à l'échelle au-delà de ce site pilote.

IndustrielOpinion
1 source
Comme un matériau fluide : un essaim de robots s'auto-organise par la physique, sans commandes
3506Interesting Engineering 

Comme un matériau fluide : un essaim de robots s'auto-organise par la physique, sans commandes

Des ingénieurs de l'université Cornell ont présenté dans la revue Science Robotics un système robotique collectif baptisé Cross-Link Collective, composé de dizaines de modules indépendants d'environ 200 mm de long et 20 mm de large. Chaque module est animé par un petit moteur interne qui lui fait alterner entre une forme en "I" et une forme en "U", générant une propulsion sur surface. Aux extrémités, des patches de Velcro à faible adhérence permettent aux modules de s'attacher et de se détacher spontanément les uns aux autres pendant le déplacement. Pris isolément, ces robots sont lents et peinent sur les terrains irréguliers. En chaîne, leur comportement change radicalement : ils franchissent des pentes, contournent des obstacles et se réorganisent dynamiquement, sans qu'aucun contrôleur central ne coordonne quoi que ce soit. L'auteure principale Danna Ma et la responsable de l'étude Kirstin Petersen, professeure associée en génie électrique et informatique à Cornell, qualifient cette approche d'«intelligence mécanique» : la coordination émerge des interactions physiques entre modules, non d'algorithmes embarqués ou de communications explicites. L'intérêt de cette architecture pour le secteur robotique réside précisément dans ce que l'industrie appelle la robustesse aux pannes et l'adaptabilité en environnement non structuré. Un module à batterie défaillante ou bloqué ne met pas hors service l'ensemble du collectif, qui se reconfigure autour de la défaillance. C'est une propriété que les systèmes centralisés classiques, AMR ou bras industriels, ne possèdent pas nativement. Le système intègre par ailleurs une forme minimale de perception distribuée : lorsqu'un module perd le contact avec le groupe (détecté par l'absence de secousses mécaniques), il émet un signal sonore audible qui incite les modules voisins à ralentir, lui laissant le temps de se rattacher. Aucun capteur centralisé n'est requis. En termes de paradigme, le Cross-Link Collective emprunte aux gels actifs, des matériaux dont les liaisons moléculaires se forment et se rompent continuellement tout en conservant une structure globale cohérente, une analogie physique, pas seulement rhétorique. Le module de base a été initialement conçu au Georgia Institute of Technology ; l'équipe de Cornell en a repris le design et l'a affiné sur plusieurs années de tests et d'analyses statistiques pour optimiser la connectivité et la progression en grand groupe. Sur le plan concurrentiel, cette approche se distingue des essaims robotiques classiques (comme ceux développés par Harvard ou l'EPFL) en éliminant quasi totalement la couche logicielle de coordination. Elle s'inscrit dans un courant plus large de recherche en soft robotics et en robotique morphologique, où l'intelligence est encodée dans la géométrie et les matériaux plutôt que dans le calcul. Les suites annoncées par l'équipe visent des environnements réels imprévisibles, sans préciser de calendrier de déploiement ni de partenaires industriels pour l'instant, ce qui situe encore le projet au stade de la recherche fondamentale validée en laboratoire, loin d'une commercialisation.

RecherchePaper
1 source
Une nouvelle main robotique chinoise combine un actionnement hybride pour améliorer la préhension
3507Interesting Engineering 

Une nouvelle main robotique chinoise combine un actionnement hybride pour améliorer la préhension

La startup chinoise Xynova a dévoilé la Flex 2, sa main robotique de deuxième génération, conçue pour équiper les robots humanoïdes de capacités de manipulation proches de celles de la main humaine. Le système embarque 23 degrés de liberté pour un poids de 400 grammes, et atteint une cadence de deux extensions de poing par seconde. Sa répétabilité est annoncée à ±0,1 mm, avec une précision de contrôle de force descendant à 0,05 newtons, ce qui lui permet de saisir des objets fragiles ou de forme irrégulière sans les endommager. La charge utile en préhension atteint 12 kg en pic et 4 kg en continu. Xynova revendique un score parfait au test de Kapandji, référence clinique pour évaluer l'opposition du pouce, ainsi qu'une résistance à la poussière, aux chutes et aux impacts compatible avec des millions de cycles opérationnels. La main intègre un système de perception multi-modal comprenant capteurs tactiles, proprioception et un module de détection de glissement, que l'entreprise qualifie de "cervelet artificiel" adaptatif. La Flex 2 illustre une tendance de fond dans la conception des mains robotiques : l'hybridation des modes d'actionnement. Le système combine des tendons à câbles, qui apportent compliance et légèreté, avec une actuation directe qui fournit le couple nécessaire aux tâches de contact précis. Ce compromis cherche à surmonter l'un des obstacles persistants du secteur : la manipulation dite "au dernier centimètre", soit la capacité à exécuter des gestes contact-riches hors d'environnements contrôlés. Xynova a également repositionné la caméra du système de vision depuis la paume vers le poignet, ce qui réduit les problèmes d'occlusion lors de la saisie et améliore la qualité des données collectées pour entraîner des pipelines VLA (vision-language-action) utilisés dans les systèmes d'IA incarnée. C'est une décision architecturale modeste en apparence, mais potentiellement significative pour quiconque développe des politiques d'imitation learning sur données visuelles. Xynova s'inscrit dans une vague de startups chinoises spécialisées dans la manipulation dextre, un segment en croissance rapide depuis que les grands intégrateurs humanoïdes comme Figure AI (Figure 03), Tesla (Optimus Gen 3) ou Physical Intelligence (Pi-0) ont montré les limites des préhenseurs rigides industriels sur des tâches non structurées. Le précédent modèle de Xynova, la Flex 1, affichait 25 DOF, 380 grammes et une force d'extrémité de doigt de 20 N pour une charge de 30 kg, positionnant déjà la marque sur le segment haute performance. Avec la Flex 2, l'entreprise pivote explicitement vers la fidélité de contrôle lors des interactions physiques plutôt que vers les seules métriques hardware. Aucun prix public ni calendrier de livraison commerciale n'ont été communiqués à ce stade : la Flex 2 reste pour l'instant une annonce produit sans déploiement confirmé.

Chine/AsieActu
1 source
Une entreprise chinoise accélère l'intelligence des robots humanoïdes avec un contrôle à 300 FPS
3508Interesting Engineering 

Une entreprise chinoise accélère l'intelligence des robots humanoïdes avec un contrôle à 300 FPS

Horizon Robotics, entreprise chinoise connue jusqu'ici pour ses SoC dédiés à l'IA embarquée dans l'automobile, a publié en open source HoloMotion-1, un modèle de contrôle moteur corps entier pour robots humanoïdes. Fort de 4 milliards de paramètres, ce modèle dépasse d'un à deux ordres de grandeur les architectures cérébelleuses habituellement déployées, qui plafonnent à quelques millions de paramètres. En inférence, HoloMotion-1 atteint 200 à 300 cycles par seconde sur calculateur embarqué, le module moteur physique tournant en parallèle à 50 Hz pour lisser les trajectoires. La démonstration a été conduite sur un robot Unitree G1, en zero-shot complet : aucun fine-tuning sur données réelles, toute l'inférence exécutée en local. Le robot a reproduit des comportements absents de son entraînement physique, notamment la danse, le rampé, la position assise et des frappes de type arts martiaux. Des tests de téléopération en temps réel via combinaison de capture de mouvement et contrôleurs VR ont également montré un suivi stable des gestes humains. Le point critique n'est pas la vitesse brute mais la robustesse du sim-to-real gap sans adaptation. Réussir un transfert zero-shot sur un humanoïde commercial reste un obstacle mal résolu par la majorité des systèmes actuels, qui exigent des phases de fine-tuning coûteuses. HoloMotion-1 contourne partiellement ce problème en constituant un corpus de données radicalement plus large : données MoCap sélectionnées, données internes, et mouvements reconstruits depuis des vidéos du monde réel, augmentant la couverture des situations imprévues. L'architecture MoE (Mixture-of-Experts) Transformer active sélectivement des sous-réseaux spécialisés à chaque pas de temps, réduisant le coût computationnel sans régresser sur la capacité expressive. Le KV-cache accélère l'inférence séquentielle en réutilisant les calculs passés. L'entraînement repose sur une méthode PPO (Proximal Policy Optimization) appliquée à des séquences de mouvement complètes plutôt qu'à des pas de temps isolés, ce qui améliore la stabilité sur corpus hétérogène. Pour un intégrateur ou un OEM robotique, la conséquence concrète est qu'un modèle généraliste à 4 milliards de paramètres devient déployable sur edge hardware sans infrastructure cloud. Il convient toutefois de souligner que les démonstrations publiées restent des séquences sélectionnées, sans métriques indépendantes sur la robustesse en conditions industrielles. Horizon Robotics est historiquement positionnée sur la couche silicium, avec ses puces Journey pour l'ADAS, et HoloMotion-1 marque un pivot vers la couche logicielle en robotique humanoïde. Le choix de l'open source suit la stratégie d'influence sur l'écosystème pratiquée par Meta avec LLaMA dans les LLM : imposer un standard de fait avant que les concurrents ne verrouillent leur stack propriétaire. Le paysage concurrentiel est dense : Physical Intelligence (Pi-0), NVIDIA (GR00T N2), Agility Robotics et Figure AI côté occidental, Unitree, Fourier Intelligence et Zhiyuan Robotics côté chinois. La publication décrit un plan en quatre phases pour le contrôle humanoïde ("Imitate Any Pose, Follow Any Command" en constituent les deux premières), mais les phases suivantes n'ont pas été détaillées publiquement. Aucun déploiement industriel ni partenariat de production n'est annoncé à ce stade.

IA physiqueOpinion
1 source
Un café robotique réunit des praticiens en robotique autonome
3509Robohub 

Un café robotique réunit des praticiens en robotique autonome

Le Robotics Café est une série de séminaires en ligne hebdomadaires lancée récemment pour réunir chercheurs, étudiants et praticiens de la robotique autonome. L'initiative est co-organisée par P.B. Sujit (IISER Bhopal, Inde), Sandeep Manjanna (Plaksha University) et Aditya Paranjape (Monash University, Australie). Les sessions se tiennent chaque jeudi de 17h00 à 18h00 IST (heure de l'Inde) via Google Meet, avec des enregistrements disponibles sur une chaîne YouTube dédiée. La série a démarré avec une intervention du professeur Debasish Ghose (Indian Institute of Science) intitulée "AERObotics : l'art d'attraper des objets en vol", à l'intersection de la théorie du guidage et de la robotique aérienne. La deuxième session a réuni le professeur Arun Kumar Singh (Université de Tartu, Estonie) autour de l'utilisation de l'incertitude prédictive pour la planification et le contrôle basés sur des modèles. L'objectif central du Robotics Café est de donner aux étudiants une tribune pour présenter et diffuser leurs travaux, dans un secteur où la visibilité académique reste concentrée autour de grandes conférences annuelles (ICRA, IROS, RSS) à fort coût d'accès. Ce format hebdomadaire à faible friction comble un vide réel : les sous-disciplines de la robotique autonome (planification, perception, contrôle) disposent rarement d'un espace inter-institutionnel informel. Pour les équipes de recherche en dehors des grands centres occidentaux, c'est aussi un levier d'intégration dans les conversations globales du domaine. Ce type d'initiative s'inscrit dans une tendance plus large de démocratisation des séminaires académiques, accélérée après 2020 par la généralisation des outils de visioconférence. Des formats comparables existent dans d'autres sous-domaines (robotique soft, manipulation, drones), mais restent souvent éphémères faute de structure organisationnelle. Ici, l'ancrage dans trois universités réparties sur trois continents donne à la démarche une continuité institutionnelle. Aucune feuille de route formelle n'est annoncée, mais la série semble pensée sur le long terme avec liste de diffusion et canal YouTube, signes d'une infrastructure légère mais pérenne.

RecherchePaper
1 source
La robotique connaîtra-t-elle son moment ChatGPT ?
3510IEEE Spectrum Robotics 

La robotique connaîtra-t-elle son moment ChatGPT ?

En 2025, les investissements dans les entreprises de robotique ont atteint un record de 40,7 milliards de dollars, soit 9 % de l'ensemble du capital-risque mondial. C'est dans ce contexte que Jonathan Hurst, professeur en robotique à l'Oregon State University et cofondateur d'Agility Robotics, et Wendy Tan White, ancienne CEO du projet Everyday Robots chez Google X, publient une analyse à contre-courant. Leur thèse : la robotique ne connaîtra pas de "moment ChatGPT" unique, mais progressera grâce à l'application coordonnée de plusieurs systèmes d'IA complémentaires. Ils articulent leur démonstration autour de cinq vérités difficiles, dont la première est le "YouTube-to-Reality Gap". La prestation des robots humanoïdes Unitree au gala du Nouvel An chinois 2026, où des machines exécutaient des figures d'arts martiaux avec des enfants, illustre parfaitement ce fossé : techniquement impressionnante, la séquence était entièrement chorégraphiée, relevant du même niveau d'autonomie qu'un bras industriel en usine automobile, et non d'un système capable de s'adapter à l'imprévu. L'enjeu est décisif pour les intégrateurs et décideurs industriels. Si les robots maîtrisent le backflip et le kung-fu, pourquoi sont-ils absents des chaînes de production généralistes et des cuisines domestiques ? L'IA mobilisée dans ces démonstrations ne sert que le contrôle moteur de bas niveau, sans capacité de raisonnement ni d'adaptation à des environnements non structurés. La rupture introduite par l'IA est réelle : les robots apprennent désormais au lieu d'être programmés, et peuvent, avec suffisamment de données, percevoir, raisonner et agir de façon fiable. Mais ce saut exige des systèmes d'IA coordonnés et rigoureusement intégrés, et non un modèle fondateur unique. La promesse de robots polyvalents vivant aux côtés des humains alimente la science-fiction depuis des décennies, et les déceptions accumulées ont rendu le secteur prudent face aux annonces. Agility Robotics déploie son humanoïde Digit dans des entrepôts Amazon depuis 2023, l'une des rares preuves de déploiement industriel réel à l'échelle. La concurrence s'est toutefois densifiée : Figure AI, Tesla Optimus, 1X et Apptronik côté produits, Physical Intelligence (Pi-0) et NVIDIA (GR00T N2) côté recherche. Hurst et White, forts d'une décennie de terrain, ne disqualifient pas l'optimisme ambiant, mais rappellent l'obligation de distinguer ce qui est opérationnel de ce qui reste un prototype filmé sous son meilleur angle.

HumanoïdesOpinion
1 source
Première américaine : le robot humanoïde de Gatsby réalise un service de nettoyage à domicile pour un client
3511Interesting Engineering 

Première américaine : le robot humanoïde de Gatsby réalise un service de nettoyage à domicile pour un client

Le 14 mai 2026, la startup américaine Gatsby a envoyé un robot humanoïde autonome effectuer un nettoyage résidentiel complet chez un particulier à San Francisco, une première déclarée aux États-Unis pour ce type de service à domicile livré à un consommateur final. Le client a été sélectionné aléatoirement sur une liste d'attente, et la réservation s'est faite via l'application iOS de l'entreprise. Le service est facturé 150 dollars par intervention, quel que soit la superficie du logement, ce qui le positionne dans la fourchette basse du marché local où les prestations humaines oscillent entre 150 et 300 dollars selon la taille de l'appartement. La vidéo de l'intervention n'a pas été publiée en détail, et Gatsby n'a pas divulgué le modèle de robot utilisé ni les métriques opérationnelles (temps de cycle, taux de complétion, surfaces traitées), ce qui rend difficile toute évaluation technique indépendante de la performance réelle. Ce que Gatsby tente de prouver n'est pas tant la supériorité d'un hardware spécifique que la viabilité d'un modèle de distribution à la demande pour la robotique humanoïde à usage domestique. Là où Tesla, 1X et d'autres misent sur la vente directe de plateformes à plus de 20 000 dollars l'unité, Gatsby positionne une couche logicielle hardware-agnostique : navigation, interface utilisateur, orchestration de service. Le pari est que le goulot d'étranglement n'est pas le robot lui-même, mais la distribution et l'expérience utilisateur. Si ce modèle tient à l'échelle, il représente un vecteur de commercialisation radicalement différent de celui que suivent les grandes équipes humanoïdes actuelles, et pourrait intéresser des intégrateurs cherchant à déployer des flottes sans s'engager sur un seul fournisseur hardware. C'est aussi une hypothèse implicite sur le sim-to-real : que les tâches ménagères standardisées sont désormais suffisamment maîtrisées pour sortir du laboratoire vers des environnements non contrôlés. Gatsby a été fondée en janvier 2026 par Aron Frishberg, ancien étudiant de l'Université de Chicago, sous la société mère West Egg Labs. La startup est soutenue par NVIDIA Inception et le programme d'accélération Entrepreneurs First. Le choix du nettoyage comme marché d'entrée est délibéré : secteur à forte dépense consommateur, peu innovant depuis des décennies, et socialement universel. L'entreprise se présente comme un Uber de la robotique humanoïde, agnostique au matériel, capable de substituer un robot par un autre selon les évolutions du marché hardware. La demande affichée sur liste d'attente couvre la Bay Area et s'étend au reste du pays, selon la communication de l'entreprise, mais aucun chiffre précis n'a été communiqué. La prochaine étape logique serait une montée en volume de déploiements documentés, avec des métriques de performance publiées, pour confirmer que ce premier service n'était pas un événement isolé à forte valeur médiatique.

HumanoïdesOpinion
1 source
Tianji Intelligence livre plus de 10 000 bras humanoïdes à contrôle de force au T1 et dévoile quatre nouveaux produits
3512Pandaily 

Tianji Intelligence livre plus de 10 000 bras humanoïdes à contrôle de force au T1 et dévoile quatre nouveaux produits

Au premier trimestre 2026, Guangdong Tianji Intelligence System Co., Ltd. (Tianji Intelligence) annonce avoir livré plus de 10 000 bras humanoïdes à contrôle de force, bien que le même communiqué évoque par ailleurs le chiffre de 2 000 unités sans expliquer l'écart. L'entreprise chinoise dévoile simultanément quatre nouveaux produits dans sa gamme de bras humanoïdes à contrôle de force, couvrant quatre segments applicatifs distincts : recherche scientifique, éducation, services commerciaux et industrie de précision. Parmi les caractéristiques revendiquées figurent un nouveau record sectoriel sur le ratio charge utile/poids propre et une envergure de bras inédite, sans que des chiffres précis ne soient communiqués dans ce premier communiqué. Ce positionnement illustre une fracture stratégique qui s'accentue dans le secteur des robots humanoïdes en 2026 : là où certains acteurs concentrent leurs investissements sur le contrôle dynamique haute performance ou sur l'alimentation en données des grands modèles de fondation, Tianji Intelligence mise sur le déploiement opérationnel et la fiabilité terrain, revendiquant un taux de succès supérieur à 99,5 % sur les lignes de production. L'abandon d'un format unique de robot humanoïde au profit d'une gamme segmentée par cas d'usage est un signal fort : l'industrie reconnaît que la polyvalence généraliste se heurte aux contraintes réelles de l'intégration industrielle, et que la spécialisation par verticale devient une condition de commercialisation crédible. Tianji Intelligence opère dans un marché humanoïde chinois en phase d'accélération rapide, sous l'effet combiné d'investissements publics et privés massifs depuis 2025. La société se positionne sur le segment des bras à contrôle de force, une niche moins médiatisée que les humanoïdes full-body (Unitree, Fourier Intelligence côté chinois, Figure AI et Tesla Optimus côté américain), mais potentiellement plus proche de la rentabilité industrielle à court terme. Les quatre nouvelles références seront déployées progressivement sur les segments ciblés, mais aucune date ni volume de production n'ont été précisés. L'absence de fiches techniques détaillées dans ce premier communiqué invite à la prudence avant tout arbitrage d'intégrateur.

Chine/AsieActu
1 source
OLO Robotics finalise son lancement commercial avec trois partenariats internationaux de fabrication et distribution
3513Robotics & Automation News 

OLO Robotics finalise son lancement commercial avec trois partenariats internationaux de fabrication et distribution

OLO Robotics vient de finaliser son lancement commercial en annonçant trois partenariats de fabrication et de distribution avec Deep Robotics, inMotion Robotic et Fiction Lab. Ces accords permettent d'intégrer la plateforme ROS2-native d'OLO à des robots quadrupèdes et des robots mobiles autonomes (AMR) commercialisés par ces partenaires. La géographie de ces alliances est internationale : Deep Robotics est un fabricant chinois de quadrupèdes établi, tandis qu'inMotion Robotic et Fiction Lab opèrent sur des marchés de distribution complémentaires dont les détails n'ont pas été précisés. L'enjeu central de ce lancement est l'accessibilité : OLO vise les équipes de développement logiciel généralistes, et non les seuls roboticiens spécialisés. En s'appuyant sur ROS2 comme standard ouvert, la plateforme réduit la barrière à l'entrée pour les intégrateurs et les directions techniques industrielles souhaitant déployer des robots sans maîtriser les couches bas-niveau de contrôle. C'est un pari sur l'abstraction logicielle comme levier d'adoption à l'échelle, dans un secteur où la complexité du middleware a longtemps freiné le passage du pilote au déploiement réel. OLO s'inscrit dans une concurrence croissante sur la couche d'orchestration entre hardware robotique et applications métier, face à des acteurs comme Foxglove, Intrinsic (Alphabet) ou Transitive Robotics. Sa stratégie se distingue par des partenariats OEM pour ancrer sa plateforme dans l'écosystème matériel existant plutôt que de commercialiser du hardware en propre. Les premiers déploiements clients concrets et les timelines de mise en production n'ont pas été communiqués dans cette annonce.

InfrastructureActu
1 source
RoboJailBench : évaluation des attaques et défenses adversariales dans les agents robotiques incarnés
3514arXiv cs.RO 

RoboJailBench : évaluation des attaques et défenses adversariales dans les agents robotiques incarnés

Des chercheurs du PurSec Lab ont publié RoboJailBench, un benchmark standardisé pour évaluer les attaques adversariales de type "jailbreak" et leurs contre-mesures dans les systèmes d'IA embarquée. Présenté sur arXiv (2605.19328), ce framework cible les agents robotiques et véhicules autonomes qui s'appuient sur des Vision-Language Models (VLMs) pour interpréter l'environnement visuel et exécuter des commandes en langage naturel. Il repose sur trois composantes: une taxonomie de sécurité dérivée des normes ISO et d'incidents documentés, couvrant 18 catégories de violations; un pipeline de données "intent contrast" associant à chaque exemple un objectif adversarial et un objectif bénin, afin de mesurer conjointement sécurité et utilité; et un dépôt évolutif de métriques standardisées. Les auteurs ont construit un dataset taxonomique, enrichi cinq datasets existants, intégré quatre types d'attaques et deux défenses, puis évalué l'ensemble sur les principaux VLMs embarqués actuels. Un leaderboard public est maintenu sur purseclab.github.io. L'enjeu dépasse la recherche académique. Un robot compromis par un jailbreak n'affiche pas une réponse textuelle inappropriée: il exécute une action physique potentiellement dangereuse. Les benchmarks existants ciblaient soit les LLMs conversationnels, soit la sécurité non-adversariale des agents incarnés, sans jamais capturer le triptyque risques adversariaux, conséquences physiques et arbitrage sécurité-utilité. Quantifier explicitement ce compromis est une contribution méthodologique significative: un système trop défensif bloque des commandes légitimes et devient inutilisable en production. Pour les intégrateurs industriels, une grille d'évaluation ancrée dans les normes ISO simplifie la qualification réglementaire avant tout déploiement réel. La montée en puissance des VLMs dans la robotique physique, illustrée par pi0 de Physical Intelligence, GR00T N2 de NVIDIA ou les architectures de Figure AI, a considérablement élargi la surface d'attaque des systèmes autonomes. Des travaux antérieurs avaient documenté la vulnérabilité des agents embarqués aux jailbreaks visuels ou textuels, mais sans cadre d'évaluation reproductible. Alors que des fabricants comme Boston Dynamics, Unitree ou, côté européen, Enchanted Tools intègrent des VLMs en production, la robustesse adversariale est appelée à devenir une exigence réglementaire dans les secteurs logistique, manufacturier et médical. RoboJailBench pose une base commune sur laquelle industriels et académiques peuvent s'appuyer pour standardiser ces tests avant mise en service.

Societe/EthiqueOpinion
1 source
Au-delà du succès binaire : un cadre de méta-évaluation diagnostique pour la manipulation fine
3515arXiv cs.RO 

Au-delà du succès binaire : un cadre de méta-évaluation diagnostique pour la manipulation fine

Des chercheurs ont publié en mai 2026 MetaFine, un cadre de méta-évaluation diagnostique conçu pour mesurer avec précision les capacités de manipulation fine des robots. Contrairement aux benchmarks existants qui réduisent la performance à un taux de succès binaire (réussi ou échoué), MetaFine décompose la compétence de manipulation en trois axes distincts : la compréhension contextuelle de la scène, la perception spatiale haute fidélité, et l'exécution motrice sous contraintes. L'étude démontre que l'approche binaire classique surestime artificiellement les capacités des modèles vision-langage-action (VLA) jusqu'à 70%, masquant les goulots d'étranglement architecturaux qui bloquent le déploiement réel. Le framework s'appuie sur un graphe de tâches compositionnel capable d'absorber des benchmarks externes hétérogènes et de les reconstruire en scénarios diagnostiques de complexité variable, sous un protocole unifié. La validation hybride réel-simulation est également intégrée : un nombre limité de rollouts réels sert à calibrer des estimations simulées scalables pour un benchmarking physique plus robuste. L'enjeu est structurant pour le secteur : si les meilleurs modèles VLA actuels semblent performants selon les métriques classiques, MetaFine révèle des échecs sévères et dimension-spécifiques, invisibles jusqu'ici aux évaluateurs. L'analyse causale ciblée identifie l'encodeur visuel comme principal goulot d'étranglement pour la précision fine. Sa capacité à préserver la structure spatiale locale détermine directement l'accès à des capacités de manipulation jugées hors de portée : améliorer cet encodeur suffit à les débloquer sans modifier la politique de contrôle aval. Cette découverte oriente concrètement les priorités R&D pour les équipes d'ingénierie et les intégrateurs industriels qui cherchent à comprendre pourquoi leurs systèmes échouent en conditions réelles. MetaFine s'inscrit dans un contexte de prolifération de benchmarks pour la manipulation embodied, où la course aux métriques produit des systèmes sur-optimisés pour les tests mais fragiles à l'échelle. La communauté VLA fait face depuis plusieurs années au fossé démo-réalité : des résultats impressionnants en laboratoire qui ne se transfèrent pas en production. Des modèles comme Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) ou Helix ont montré des performances prometteuses, mais leurs architectures restent difficiles à comparer rigoureusement faute d'outils d'évaluation adaptés. MetaFine propose de renverser la logique : passer du classement au diagnostic, pour identifier et corriger systématiquement les couches de capacités défaillantes. Le framework, les benchmarks et les ressources associées seront publiés en accès libre sur metafine.github.io.

IA physiquePaper
1 source
Tests adversariaux des filtres de sécurité du robot humanoïde SPARK
3516arXiv cs.RO 

Tests adversariaux des filtres de sécurité du robot humanoïde SPARK

Une équipe de chercheurs a publié en mai 2026 sur arXiv (arXiv:2605.19009) une étude de robustesse portant sur les filtres de sécurité SPARK pour robots humanoïdes. Le travail consiste en une réplication du cas de référence G1SportMode\D1\WG\SO\v1 dans le simulateur MuJoCo, puis en une batterie de tests adversariaux sur six méthodes de filtrage : RSSA, RSSS, SSA, CBF (Control Barrier Function), PFM et SMA. Les auteurs ont également construit un pipeline de post-traitement pour convertir les logs bruts SPARK en trois métriques exploitables, suivi d'objectif, distance minimale aux obstacles, et nombre de pas en collision. Résultat principal : certaines méthodes optimisent le suivi de trajectoire au détriment de l'évitement, tandis que d'autres réduisent les collisions sans maintenir l'efficacité de déplacement. L'importance de ce travail tient à un angle souvent négligé dans l'évaluation des humanoïdes : les benchmarks nominaux, ceux qui servent à comparer les méthodes en conditions idéales, ne capturent pas les modes d'échec qui émergent dans des environnements contraints. Trois types de perturbations ont été testés : densification des obstacles ("obstacle crowding"), estimation bruitée des distances, et information obstacle avec délai. Dans ces conditions, le comportement de sécurité de plusieurs filtres se dégrade significativement, un résultat qui contredit implicitement l'hypothèse que les scores de référence suffisent à valider une méthode avant déploiement terrain. Pour un intégrateur ou un responsable de sécurité industrielle, c'est un signal clair : la qualification d'un filtre de sécurité humanoïde doit inclure des scénarios de stress, pas seulement les cas nominaux. Le SPARK framework s'est imposé ces dernières années comme cadre de référence pour évaluer la sécurité des humanoïdes à corps complet, face à la complexité inhérente de ces systèmes : haute dimensionnalité, contraintes de collision multiples, proximité avec des opérateurs humains. Le cas répliqué ici est lié au robot Unitree G1, l'une des plateformes humanoïdes accessibles les plus répandues en recherche. Les concurrents directs dans cet espace incluent des travaux sur MPC avec CBF (MIT, CMU), les approches RoboSafe d'ETH Zurich, et les filtres embarqués dans Boston Dynamics Atlas. La suite logique de cette recherche serait un protocole de stress testing standardisé, intégrable dans les pipelines de CI/CD robotique avant déploiement en environnement semi-contrôlé.

RechercheOpinion
1 source
TwinRL : apprentissage par renforcement piloté par jumeau numérique pour la manipulation robotique réelle
3517arXiv cs.RO 

TwinRL : apprentissage par renforcement piloté par jumeau numérique pour la manipulation robotique réelle

Une équipe de chercheurs a publié TwinRL (arXiv:2602.09023), un framework de post-entraînement qui couple un jumeau numérique reconstruit par smartphone avec du reinforcement learning (RL) en monde réel pour affiner des modèles Vision-Language-Action (VLA) en manipulation robotique. La méthode se déroule en trois phases successives : un warm-up par fine-tuning supervisé (SFT), un warm-up RL dans le jumeau numérique, puis du RL directement sur robot. Sur quatre tâches de manipulation testées, TwinRL atteint un taux de succès proche de 100 % en configuration distributionnelle et hors-distribution, avec une convergence 30 % plus rapide que les méthodes de RL réel existantes. Élément frappant : seulement 20 minutes d'interaction physique sur robot sont nécessaires pour obtenir ces résultats, contre des heures ou journées typiques pour les approches concurrentes. L'importance de ce résultat tient à un verrou bien connu du secteur : les modèles VLA comme Pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA) généralisent bien mais restent coûteux à affiner, car ils dépendent de démonstrations expertes massives et leur exploration en RL réel est lente et peu couvrante. Les auteurs montrent expérimentalement que l'espace d'exploration du RL en ligne reste structurellement contraint par la distribution de trajectoires issue du SFT initial, ce qui explique les plafonds de performance observés dans la littérature. TwinRL contourne ce problème en utilisant le jumeau numérique non pas comme outil d'augmentation de données, mais comme guide actif d'exploration : il identifie les configurations difficiles et dirige les rollouts humains là où le robot échoue, réduisant drastiquement le temps on-robot. Pour un intégrateur ou un COO industriel, cela signifie que le déploiement de robots polyvalents pourrait ne plus nécessiter des semaines de collecte de données en production. Ce travail s'inscrit dans une vague de recherches cherchant à résoudre le sim-to-real gap sans recourir à des simulateurs coûteux : ici, la reconstruction du jumeau numérique part de simples captures smartphone, ce qui abaisse significativement la barrière d'entrée. Les approches concurrentes incluent le RL en simulation pure (souvent peu transférable), la distillation de politiques, et les méthodes de curriculum learning. TwinRL se distingue par son pipeline hybride et son usage ciblé de l'humain dans la boucle. Aucune date de déploiement industriel ni partenariat commercial n'est annoncé, il s'agit d'un résultat de recherche académique, mais la faible exigence en temps robot ouvre des perspectives concrètes pour des cellules de manipulation flexible dans l'industrie manufacturière ou logistique.

RechercheOpinion
1 source
DEFLECT : exécution robuste aux délais par ajustement contrefactuel estimé par flow-matching pour les politiques VLA
3518arXiv cs.RO 

DEFLECT : exécution robuste aux délais par ajustement contrefactuel estimé par flow-matching pour les politiques VLA

Des chercheurs ont publié fin mai 2026 sur arXiv (arXiv:2605.19294) une méthode baptisée DEFLECT, Delay-Robust Execution via Flow-matching Likelihood-Estimated Counterfactual Tuning, pour corriger un défaut structurel des politiques VLA (Vision-Language-Action) déployées en production. Le problème ciblé est l'inférence asynchrone : pendant qu'un modèle VLA calcule le prochain chunk d'actions, le robot exécute déjà le chunk précédent, conditionné sur une observation capturée plusieurs cycles de contrôle plus tôt. Ce décalage entre prédiction et exécution est bénin à faible latence, mais catastrophique dès que l'inférence s'étire : sur le benchmark Kinetix, le taux de succès s'effondre de 89 % à moins de 1 % quand le cycle d'inférence couvre jusqu'à sept pas de contrôle. DEFLECT apporte un gain de +6,4 points de succès dans ce régime haute latence (5 à 7 pas), +4,6 points sur un VLA réel à la latence maximale testée, avec des améliorations cohérentes sur deux tâches physiques : un pick-and-place bimanuel sur convoyeur et un jeu réactif de type whack-a-mole. L'intérêt industriel de DEFLECT tient à sa nature d'affinement post-entraînement entièrement offline, conçu comme une mise à niveau quasi plug-in sur les stacks VLA asynchrones existants. La méthode construit des paires d'actions contrefactuelles (fraîche vs. périmée) à partir d'une politique de référence gelée, puis les note via un estimateur implicite de ratio de vraisemblance par flow-matching, sans étiquettes humaines, sans modèle de récompense, et sans rollouts en ligne. Ce profil d'intégration est stratégique : les équipes qui déploient aujourd'hui des VLA en environnement industriel, où la latence réseau, la charge GPU et la fréquence de contrôle sont rarement synchronisées, peuvent théoriquement appliquer DEFLECT sans refaire de collecte de données ni de fine-tuning supervisé. La robustesse au délai est un frein réel à la commercialisation des politiques généralisées, et c'est la première approche qui quantifie explicitement l'ampleur de l'effondrement avant de le corriger. Les politiques VLA ont émergé comme paradigme dominant depuis RT-2 (Google DeepMind, 2023) et sont au coeur des systèmes de Physical Intelligence (pi0), de Figure AI (Helix), et de Boston Dynamics. Le problème de l'inférence asynchrone est documenté dans plusieurs travaux depuis 2024, mais les solutions proposées jusqu'ici impliquaient généralement un entraînement en ligne coûteux ou des architectures modifiées. DEFLECT se positionne comme une couche de correction légère, applicable à posteriori, ce qui facilite son adoption dans des pipelines déjà stabilisés. Les auteurs n'annoncent pas de déploiement industriel ni de partenariat commercial dans cette version arXiv, il s'agit d'un résultat de recherche, pas d'un produit shipped. Les prochaines étapes probables incluent des évaluations sur des benchmarks standardisés comme LIBERO ou Open-X Embodiment, et potentiellement une intégration dans des frameworks VLA open-source.

IA physiqueOpinion
1 source
Au-delà des résidus d'action : guidage de politique robotique en conditions réelles par apprentissage par renforcement sur espace latent contraint
3519arXiv cs.RO 

Au-delà des résidus d'action : guidage de politique robotique en conditions réelles par apprentissage par renforcement sur espace latent contraint

Des chercheurs proposent ZPRL (Z-Perturbation Reinforcement Learning), une méthode d'adaptation en ligne de politiques robotiques pré-entraînées par imitation, évaluée sur huit tâches en simulation et quatre tâches en conditions réelles. Plutôt que de corriger directement les actions produites par le réseau, ZPRL introduit un module variationnel de goulot d'étranglement (Variational Information Bottleneck, VIB) qui extrait, lors de la phase d'entraînement hors ligne, une représentation latente compacte et orientée tâche à partir des embeddings d'observation. En ligne, la politique de base reste gelée : seul un résidu de perturbation dans cet espace latent est appris par apprentissage par renforcement, et ce résidu conditionne ensuite le générateur d'actions. Sur les quatre tâches de manipulation réelle testées, la méthode améliore le taux de succès moyen de 33,7 % par rapport aux politiques d'imitation de base, tout en produisant une exploration sensiblement plus fluide que les approches par résidus dans l'espace d'action. Ce résultat adresse un problème concret et documenté du déploiement robotique : les politiques entraînées par imitation comportementale (IL) souffrent d'une couverture de données limitée et d'un écart entre les conditions d'entraînement et celles du déploiement réel. L'ajustement fin par RL post-entraînement est une voie connue, mais les méthodes existantes qui opèrent directement dans l'espace d'action génèrent une exploration bruitée et structurellement pauvre, ce qui ralentit la convergence. ZPRL démontre qu'une interface latente compacte et alignée sur la tâche offre un point d'entrée plus efficace pour le RL, au prix d'une modification architecturale légère (le module VIB est dit "plug-and-play"). Pour les intégrateurs, cela ouvre la possibilité de personnaliser des politiques généralistes sur des cellules spécifiques sans reprendre un entraînement complet. La méthode s'inscrit dans un courant actif de recherche sur l'adaptation post-déploiement des politiques de manipulation, aux côtés des approches de type residual policy learning et des fine-tunings RL sur architectures de type diffusion ou flow-matching. ZPRL est précisément instancié sur des politiques à flow-matching, une architecture en vogue depuis les travaux de Pi0 (Physical Intelligence) et des frameworks comme RoboMimic. Les auteurs, dont les affiliations ne sont pas précisées dans l'abstract, ont publié une page projet avec vidéos de démonstration. Les résultats restent à confirmer à plus grande échelle et sur des manipulateurs plus variés, les quatre tâches réelles constituant une validation encore limitée.

IA physiqueOpinion
1 source
LLMs incarnés : quand une meilleure fidélité d'observation nuit à la résolution de problèmes
3520arXiv cs.RO 

LLMs incarnés : quand une meilleure fidélité d'observation nuit à la résolution de problèmes

Une équipe de chercheurs présente sur arXiv (réf. 2605.20072) une étude empirique sur le comportement des LLM incarnés en robotique. Pour sonder l'effet de la fidélité perceptuelle sur les agents cognitifs, ils ont conçu une série d'expériences autour du "Lockbox", un puzzle mécanique séquentiel aux interdépendances cachées, déployé sur un robot physique. Trois modes d'observation ont été testés : RGB brut, RGB-D (avec profondeur), et observations symboliques ground-truth (état parfaitement connu de l'environnement). Le résultat est contre-intuitif : les agents obtiennent leurs meilleures performances avec le RGB brut et leurs pires avec les observations parfaites. En simulation, les chercheurs ont consolidé ce constat en injectant du bruit artificiel, en inversant aléatoirement les résultats des actions perçues par l'agent. La performance culmine à un taux d'inversion de 40%, avec une multiplication du taux de réussite par 2,85 par rapport à la baseline sans bruit. Ce résultat interroge directement un postulat central de la robotique cognitive : l'idée qu'une perception plus précise améliore mécaniquement la prise de décision. L'analyse des trajectoires d'actions révèle que le gain provient d'une réduction des boucles répétitives : un agent qui perçoit l'état du monde avec précision peut se bloquer dans un raisonnement circulaire, faute de signal lui indiquant de changer de stratégie. Un bruit perceptuel modéré brise ces boucles en forçant l'agent à reconsidérer ses hypothèses. Cette observation soulève une question sérieuse pour les pipelines VLA (Vision-Language-Action) actuels, où la précision des capteurs et la richesse des représentations symboliques sont présentées comme des leviers d'amélioration inconditionnels. Les auteurs tirent une conclusion méthodologique forte : les taux de réussite seuls sont insuffisants pour évaluer les LLM dans des tâches incarnées, car une performance mesurée peut refléter une interaction fortuite entre erreurs perceptuelles et défauts de raisonnement, plutôt qu'une résolution robuste. Cette mise en garde arrive à un moment où Figure, 1X, Agility Robotics et Boston Dynamics intègrent des LLM comme planificateurs de haut niveau dans leurs humanoïdes, souvent évalués sur des benchmarks de tâches simples en environnement contrôlé. L'approche "empirical AI" adoptée ici, qui consiste à varier systématiquement les entrées et mesurer les effets comportementaux, offre un cadre d'évaluation plus rigoureux que les métriques agrégées habituelles.

RecherchePaper
1 source
CEER : contrôle unifié de l'effecteur final souple et de la base pour la loco-manipulation hiérarchique des humanoïdes
3521arXiv cs.RO 

CEER : contrôle unifié de l'effecteur final souple et de la base pour la loco-manipulation hiérarchique des humanoïdes

CEER (Compliant End-Effector and Root Control) est une abstraction de contrôle pour robots humanoïdes présentée sur arXiv en mai 2026 (arXiv:2605.19981). L'approche résout un problème d'interfaçage central: connecter des planificateurs hétérogènes (téleopération, modèles de langage, VLA) à un contrôleur corps entier sans réentraînement à chaque nouvelle tâche. La solution repose sur deux types de commandes unifiées: les poses cibles de l'effecteur terminal (end-effector) et les commandes de déplacement de la racine (root, soit le torse de l'humanoïde). Un framework enseignant-étudiant distille un contrôleur générique en une politique bas niveau consommant uniquement ces commandes EE-root. Les résultats expérimentaux, conduits en simulation et sur matériel réel, affichent une précision de suivi à 3,3 cm, une réduction substantielle du jerk mécanique par rapport aux baselines, et un taux de succès jusqu'à 70% sur des tâches de loco-manipulation d'objet unique dans un environnement à l'échelle d'une pièce. La manipulation au contact riche (contact-rich manipulation) reste le principal goulot d'étranglement des humanoïdes: saisir des objets en positions variées, pousser des pièces dans des logements, interagir avec des surfaces non structurées. CEER apporte une réponse architecturale plutôt qu'algorithmique: une couche de contrôle compliant (souple au contact, à l'inverse du contrôle rigide en position) que n'importe quel planificateur peut piloter en plug-and-play. Pour un intégrateur industriel ou un OEM, l'argument est concret: la politique bas niveau ne nécessite pas de réentraînement à chaque nouvelle application. C'est précisément la modularité qui manque aux approches bout-en-bout dominantes. La compliance réduit également les risques de dommages en cas de contact imprévu, prérequis pour tout déploiement en environnement humain. La manipulation reste le défi non résolu des humanoïdes commerciaux. Figure Robotics, Tesla (Optimus), Agility Robotics (Digit) et 1X Technologies avancent avec des pipelines souvent propriétaires, dominés par l'imitation learning et la téleopération. Physical Intelligence (Pi-0) et NVIDIA (GR00T N2) misent sur les VLA pour généraliser la manipulation depuis des données multimodales. CEER se positionne comme une couche orthogonale: non pas un nouveau planificateur, mais un socle de contrôle interopérable avec les approches existantes. La validation sur hardware distingue ce travail des publications purement simulées, même si les 70% de succès sur tâche unique en simulation demeurent une métrique circonscrite. Les prochaines étapes naturelles incluent l'intégration avec des planificateurs LLM ou VLA et la validation sur des tâches bi-manuelles et à horizon long.

IA physiquePaper
1 source
COBALT : apprentissage robotique collaboratif par téléopération cloud via smartphones
3522arXiv cs.RO 

COBALT : apprentissage robotique collaboratif par téléopération cloud via smartphones

Des chercheurs ont publié sur arXiv (2605.19138) COBALT, une plateforme de télé-opération robotique cloud conçue pour collecter massivement des données de démonstration via des appareils grand public, smartphones, casques VR, souris 3D ou clavier. L'infrastructure repose sur des environnements vectorisés et un équilibrage de charge permettant à plusieurs utilisateurs de téléopérer simultanément sur un seul GPU, avec une latence bout-en-bout inférieure à 100 ms et une fréquence de contrôle de 20 Hz pour jusqu'à 8 utilisateurs par GPU. La montée en charge a été validée jusqu'à 256 clients simulés répartis sur 8 GPUs. En cinq jours, et depuis neuf pays, COBALT a permis de constituer un jeu de données pilote de plus de 7 500 démonstrations, soit plus de 50 heures de manipulation enregistrées. Un système de métriques en temps réel filtre automatiquement les démonstrations de mauvaise qualité, et un curriculum de formation des opérateurs améliore significativement la qualité des données collectées. L'intérêt majeur de ce travail réside dans l'attaque frontale du goulot d'étranglement principal du robot learning par imitation : la rareté des données de haute qualité à grande échelle. Les approches comme ACT, Diffusion Policy ou Pi-0 (Physical Intelligence) ont démontré que l'apprentissage par imitation fonctionne, mais leur passage à l'échelle bute sur le coût et la logistique de la collecte. COBALT démontre que la télé-opération par smartphone est comparable, parfois supérieure, au matériel spécialisé type ALOHA ou bras haptiques, ce qui élimine une barrière d'entrée majeure. Pour les intégrateurs et les équipes R&D industrielles, cela ouvre la voie à une collecte distribuée sans infrastructure physique dédiée, potentiellement transformatrice pour le coût de développement de politiques de manipulation. Le projet s'inscrit dans une dynamique plus large de constitution de grands jeux de données robotiques ouverts, comparable à Open-X Embodiment (Google DeepMind, 2023) ou au dataset DROID (Berkeley, Stanford). Les concurrents directs incluent l'initiative AgiBot World en Chine, qui a annoncé 1 million de trajectoires collectées via des bras téléopérés dédiés, et Universal Manipulation Interface (UMI) qui mise sur des dispositifs portables. COBALT se distingue par l'accessibilité des équipements et la scalabilité cloud, mais reste à ce stade un preprint académique sans déploiement industriel annoncé. La prochaine étape crédible est la validation sur des tâches réelles de manipulation, les auteurs ayant pour l'instant publié les résultats de politiques entraînées sur ce dataset sans préciser les benchmarks atteints.

IA physiqueOpinion
1 source
Gouverneur de référence explicite pour manipulateurs robotiques souples et adaptés au contact
3523arXiv cs.RO 

Gouverneur de référence explicite pour manipulateurs robotiques souples et adaptés au contact

Des chercheurs présentent dans un preprint arXiv (2504.09188v2) le Compliant Explicit Reference Governor (CERG), un module logiciel intercalé entre le planificateur de haut niveau et le contrôleur bas niveau d'un bras robotique. Son rôle est de filtrer les références de position et de vitesse pour garantir, formellement, que l'énergie disponible lors d'un contact physique reste sous un seuil de sécurité prédéfini. Le système a été validé en simulation et sur hardware réel, sur des manipulateurs de complexité croissante, bien que le preprint ne précise pas les degrés de liberté (DOF) ni les charges utiles (payload) testés. Ce qui distingue le CERG des approches classiques de contrôle en impédance ou en force, c'est son caractère non pénalisant hors contact : le module ne restreint les performances du bras que lorsqu'un contact est imminent ou actif, laissant la dynamique nominale intacte en mouvement libre. Les garanties sont formelles, pas seulement empiriques, ce qui représente un argument fort pour les intégrateurs de cobots soumis aux exigences de certification ISO/TS 15066. Cela répond directement à un angle mort du secteur : la plupart des systèmes actuels sacrifient vitesse ou précision de façon permanente pour rester sous les seuils de force réglementaires. Le gouverneur de référence est une technique établie en automatique, ici adaptée au cas contact en robotique de manipulation. Le positionnement se fait face aux approches d'impédance variable (travaux de De Luca, Albu-Schäffer) et aux méthodes d'apprentissage par renforcement pour la manipulation en contact. Aucun partenaire industriel ni timeline de transfert n'est mentionné dans le preprint, ce qui situe le CERG au stade de la recherche fondamentale, sans déploiement annoncé.

RecherchePaper
1 source
D-CLING : affinage conditionné par la profondeur pour les modèles fondation de navigation, avec préservation des connaissances antérieures
3524arXiv cs.RO 

D-CLING : affinage conditionné par la profondeur pour les modèles fondation de navigation, avec préservation des connaissances antérieures

D-CLING est une méthode de fine-tuning pour les Navigation Foundation Models (NFM) présentée dans un preprint arXiv (2605.19690) par des chercheurs de Toyota Frontier Research Center. Les NFM sont des politiques visuomotrices entraînées sur de larges ensembles de données multi-robots, capables de naviguer dans des environnements variés. Le problème identifié est récurrent dans le déploiement terrain : adapter un NFM à un nouveau contexte par fine-tuning classique dégrade ses capacités, provoquant soit un évitement d'obstacles défaillant, soit une incapacité à atteindre les objectifs fixés. D-CLING s'inspire directement de ControlNet, l'architecture de contrôle conditionné développée pour les modèles de diffusion d'images, en attachant une copie entraînable du backbone pré-entraîné via des connexions résiduelles initialisées à zéro. Ce mécanisme permet au modèle d'acquérir des indices géométriques de profondeur sans écraser le prior pré-entraîné. Les évaluations en navigation réelle montrent une réduction significative des collisions et des interventions humaines sur des trajectoires longue distance. Le problème adressé est central pour la commercialisation des robots mobiles : les NFM généralistes sont puissants mais rarement utilisables sans adaptation sur un site spécifique. Le fine-tuning sur données locales provoque typiquement un phénomène d'érosion du prior, autrement dit l'oubli catastrophique des capacités acquises en pré-entraînement. En isolant l'apprentissage géométrique dans une branche parallèle non destructive, D-CLING préserve la généralisation du modèle de base tout en permettant une adaptation ciblée à la configuration caméra et à la géométrie de l'environnement. L'analyse offline montre que la méthode maintient, voire améliore, la prédiction d'actions au-delà du dataset de fine-tuning, un résultat structurant pour le continual learning en robotique mobile. Pour un intégrateur déployant des AMR avec une configuration optique non standard, cela ouvre une voie d'adaptation sans réentraînement complet du modèle. Toyota Frontier Research Center s'inscrit dans une dynamique plus large : plusieurs équipes industrielles cherchent à capitaliser sur les NFM généralistes issus de travaux de Google DeepMind, Stanford ou Berkeley, plutôt que de repartir de zéro par plateforme. Le transfert méthodologique depuis ControlNet illustre la porosité croissante entre la recherche en génération d'images et la robotique, notamment via les architectures à diffusion. Les concurrents directs incluent les adaptations LoRA appliquées aux politiques robotiques et les approches de domain adaptation sans ré-entraînement. D-CLING reste pour l'instant un preprint, sans benchmark standardisé publié ni déploiement à grande échelle annoncé ; les résultats sont prometteurs, mais la validation sur des environnements industriels diversifiés reste entière.

RechercheOpinion
1 source
Au-delà des waypoints : ancrage à double carte de chaleur pour la navigation sémantique multi-plateforme
3525arXiv cs.RO 

Au-delà des waypoints : ancrage à double carte de chaleur pour la navigation sémantique multi-plateforme

Des chercheurs ont publié en mai 2026 sur arXiv (arXiv:2605.19420) un framework de navigation sémantique appelé Dual-Heatmap Grounding, conçu pour convertir des instructions multimodales ouvertes (texte et image) en objectifs locaux physiquement atteignables par un robot. Plutôt que de prédire un waypoint déterministe unique, leur système génère deux cartes de chaleur : une affordance heatmap modélisant les régions continues accessibles dans le champ de vision du robot, et une facing heatmap encodant les contraintes d'orientation. Ces sorties denses forment un champ de potentiel sémantique différentiable, directement intégrable aux planificateurs locaux existants sans modification d'architecture. L'approche a été évaluée sur trois morphologies robotiques distinctes : le Jetbot (plateforme à roues), le H1 d'Unitree (humanoïde bipède) et l'Aliengo d'Unitree (quadrupède), via un benchmark de simulation construit par les auteurs avec un pipeline de données synthétiques assisté par des modèles de fondation. Les résultats atteignent le niveau state-of-the-art parmi les modèles comparables à 8 milliards de paramètres. Le problème adressé est souvent sous-estimé dans les déploiements réels : régresser un point unique vers le centre géométrique d'un objet cible positionne fréquemment le robot sur une zone non traversable (le milieu d'une table, le centre d'un obstacle), provoquant des échecs d'exécution en cascade difficiles à diagnostiquer. En prédisant une distribution spatiale sur les zones libres plutôt qu'un point fixe, le framework améliore significativement l'Affordance Rate (AR), soit la proportion de cibles effectivement exécutables par le planificateur aval. Pour les intégrateurs de robots de service, de logistique ou d'assistance, c'est un gain direct sur la fiabilité des tâches de navigation pilotées par langage naturel, sans toucher au reste de la stack. Ce travail s'inscrit dans la dynamique des modèles VLA (Vision-Language-Action), qui couplent compréhension sémantique et action physique dans un pipeline unifié. La régression de waypoints était jusqu'ici un standard de fait dans la navigation indoor, malgré ses limites documentées en environnements encombrés. Les travaux concurrents incluent LM-Nav, NavGPT et OpenFMNav. Il faut noter que le papier reste un preprint non peer-reviewed, et que l'ensemble des validations se limite à la simulation. La prochaine étape attendue est une évaluation sur robots physiques en conditions réelles, qui permettrait de mesurer le sim-to-real gap sur cette représentation par heatmap.

IA physiqueOpinion
1 source
RoboMD : détecter les vulnérabilités des robots par champs de potentiel sémantique
3526arXiv cs.RO 

RoboMD : détecter les vulnérabilités des robots par champs de potentiel sémantique

Des chercheurs ont publié RoboMD (arXiv:2412.02818v4), un framework destiné à identifier automatiquement les vulnérabilités des politiques de manipulation robotique avant tout déploiement physique coûteux. La méthode repose sur l'entraînement d'une politique de deep reinforcement learning distincte, chargée non pas d'exécuter une tâche, mais de prédire les scénarios d'échec. Cette politique évolue dans un espace d'embeddings vision-langage continu, traité comme un champ de potentiel : elle se déplace vers les régions associées à des échecs et se fait repousser par les zones de succès. Entraîné sur des rollouts virtuels avec un volume limité de données succès/échec, le système génère une carte probabiliste de vraisemblance de vulnérabilité. Sur des benchmarks de simulation et sur un bras robotique physique, RoboMD découvre jusqu'à 23 % de vulnérabilités uniques supplémentaires par rapport aux meilleures baselines VLA (Vision-Language-Action) existantes, révélant des fragilités subtiles ignorées par les approches heuristiques classiques. Les auteurs montrent également que le fine-tuning de la politique de manipulation avec les scénarios adverses découverts améliore les performances avec nettement moins de données d'entraînement. L'enjeu principal est l'écart entre les performances en laboratoire et la robustesse réelle des politiques de manipulation, un angle mort critique alors que les déploiements de robots physiques s'accélèrent. Tester manuellement les variations d'environnement (éclairage, objets partiellement occultés, perturbations contextuelles) en conditions réelles reste prohibitif en coût et en risque. RoboMD propose une alternative scalable : explorer systématiquement l'espace sémantique des configurations problématiques sans mobiliser le hardware. La carte de vraisemblance produite est directement exploitable par un intégrateur ou un responsable qualité pour prioriser les correctifs avant mise en production, ce qui représente un changement de paradigme par rapport aux tests de robustesse ad hoc actuellement pratiqués dans l'industrie. Ce travail s'inscrit dans un mouvement plus large d'évaluation adversariale des politiques incarnées, alors que des modèles comme pi0 (Physical Intelligence), GR00T N2 (NVIDIA) ou les politiques d'OpenVLA cherchent à généraliser le contrôle robotique via des architectures VLA. La difficulté de tester exhaustivement ces modèles en conditions réelles est l'un des principaux freins à leur adoption industrielle. RoboMD adresse ce goulot d'étranglement par l'angle de la sécurité et de la qualification, plutôt que par la seule performance brute. La version 4 du preprint suggère que les auteurs intègrent des retours communautaires ; aucun déploiement commercial ni partenariat industriel n'est annoncé à ce stade, ce qui reste un résultat de recherche à reproduire sur des plateformes humanoïdes ou AMR à plus grande échelle.

RechercheOpinion
1 source
RoVLA : des contraintes de cohérence multiple pour des modèles vision-langage-action (VLA) robustes
3527arXiv cs.RO 

RoVLA : des contraintes de cohérence multiple pour des modèles vision-langage-action (VLA) robustes

Une équipe du HCPLab de l'Université Sun Yat-sen (SYSU, Chine) a déposé fin mai 2026 sur arXiv (réf. 2605.19678) RoVLA, un cadre d'entraînement pour renforcer la robustesse des modèles Vision-Language-Action (VLA). Ces modèles, qui couplent perception visuelle, compréhension du langage et génération d'actions pour la manipulation robotique, sont reconnus pour leur fragilité face aux variations d'instructions ou aux perturbations visuelles. RoVLA introduit trois contraintes de cohérence appliquées lors de l'entraînement end-to-end : la cohérence instructionnelle (IC), qui stabilise l'ancrage sémantique sous des reformulations équivalentes d'une même commande ; la cohérence évolutive (EC), qui maintient une intention d'action consistante tout au long de la génération de trajectoire ; et la cohérence observationnelle (OC), qui force des prédictions stables avant et après perturbations visuelles ou proprioceptives. Les expériences sont conduites sur les benchmarks LIBERO-Plus et RoboTwin 2.0, ainsi que sur des tâches de manipulation réelles, avec des performances supérieures aux baselines testées. L'enjeu est bien documenté : les VLA actuels, qu'il s'agisse de pi0 (Physical Intelligence), GR00T N2 (NVIDIA) ou OpenVLA, souffrent d'un gap de robustesse distributionnelle avéré. Dès que les conditions visuelles changent, les instructions sont paraphrasées ou les perturbations s'accumulent, les performances chutent significativement, bloquant le déploiement dans des environnements industriels non contrôlés comme l'assemblage ou la logistique d'entrepôt. RoVLA propose une réponse architecturale en forçant explicitement l'invariance pendant l'entraînement, plutôt que d'augmenter le volume de données ou d'adapter post-hoc, deux stratégies courantes mais insuffisantes pour garantir la stabilité en conditions réelles. Si les résultats se confirment à plus grande échelle, cette approche pourrait réduire concrètement le sim-to-real gap pour des politiques incarnées en production. Ce travail s'inscrit dans une compétition dense entre laboratoires académiques et industriels autour de la robustesse des VLA. Google DeepMind (RT-2, RT-X), Physical Intelligence et NVIDIA ont tous investi massivement dans des architectures à grande échelle sans traiter explicitement l'invariance en cours d'entraînement, ce que RoVLA tente précisément de corriger. Le projet reste pour l'instant un article de recherche académique : aucun déploiement commercial n'est annoncé, et le code sera publié sur GitHub sous le compte HCPLab-SYSU/RoVLA. La prochaine étape crédible serait une validation sur robots physiques en environnement industriel non contrôlé, que les premiers résultats en manipulation réelle esquissent sans encore l'établir à l'échelle.

IA physiqueOpinion
1 source
Améliorer automatiquement la physique de simulation des objets articulés
3528arXiv cs.RO 

Améliorer automatiquement la physique de simulation des objets articulés

Une thèse publiée sur arXiv en mai 2026 (identifiant 2605.19136) propose une méthode automatisée pour corriger les propriétés physiques des objets articulés destinés aux simulateurs de robotique. L'approche introduit le concept d'"interaction-readiness", qui caractérise la capacité d'un objet à être simulé de façon fiable lors de tâches de manipulation. Le constat de départ est précis : les grands datasets 3D existants, comme PartNet-Mobility ou Objaverse, fournissent des représentations géométriques et cinématiques riches, mais omettent les paramètres physiques indispensables à une simulation stable (masse, friction, amortissement, limites d'articulations), contraignant les équipes à un travail manuel coûteux. La méthode proposée fusionne des informations géométriques, visuelles et sémantiques dans une boucle itérative avec le simulateur, qui affine ces propriétés automatiquement jusqu'à atteindre une cohérence physique suffisante pour des tâches de manipulation. L'enjeu est concret pour les équipes qui entraînent des politiques de contrôle robotique par apprentissage en simulation. Les expériences conduites sur des objets articulés variés montrent que la qualité des assets influe directement sur la stabilité de la simulation, le comportement lors des interactions, et les performances des politiques apprises, validant empiriquement ce que beaucoup d'équipes observaient sans pouvoir le quantifier. Construire manuellement un objet simulation-ready (tiroir, porte, boîte à couvercle) représente un effort d'ingénierie significatif qui freine la diversification des scénarios d'entraînement. Une pipeline automatisée réutilisant des assets géométriques existants pour y injecter des propriétés physiques réalistes pourrait débloquer la mise à l'échelle des données de simulation, un goulot d'étranglement reconnu dans la course aux VLA (Vision-Language-Action models) et aux politiques de manipulation généralistes. Cette problématique s'inscrit dans un effort collectif pour réduire le sim-to-real gap, domaine où NVIDIA (Isaac Lab) et Google DeepMind (MuJoCo) investissent massivement via la domain randomization et la génération procédurale d'environnements. Le cadre d'évaluation proposé, qui décompose l'"interaction-readiness" en composantes mesurables, constitue aussi une contribution méthodologique indépendante, potentiellement utile comme benchmark pour comparer des pipelines de génération d'assets. Aucune affiliation industrielle n'est précisée dans le préprint, et la méthode n'a pas encore été validée à l'échelle industrielle ; les prochaines étapes naturelles iraient vers des applications de bin-picking ou d'assemblage, où les objets articulés restent un défi ouvert pour les intégrateurs.

RecherchePaper
1 source
Optimisation du débit de communication adaptatif pour la téléopération XR sans fil de robots humanoïdes en transfert simulation-réel
3529arXiv cs.RO 

Optimisation du débit de communication adaptatif pour la téléopération XR sans fil de robots humanoïdes en transfert simulation-réel

Une équipe publie sur arXiv (identifiant 2605.19293, mai 2026) un framework pour optimiser le taux de communication lors de la téléopération sans fil de robots humanoïdes en réalité étendue (XR). Le système enchaîne quatre modules : échantillonnage, transmission, interpolation et reconstruction des trajectoires motrices. L'objectif est de minimiser la consommation d'énergie radio tout en maintenant la précision de reconstruction, via un contrôle du taux d'échantillonnage par dimension (dimension-wise sampling-rate control). Collecter du feedback physique en temps réel étant coûteux à grande échelle, les auteurs entraînent en simulateur et corrigent le décalage sim-to-real via un algorithme PPO (proximal policy optimization) enrichi d'une pondération par ratio de densité et d'une régularisation par région de confiance (trust-region). Le tout repose sur une caractérisation théorique PAC-Bayes qui formalise les effets du biais d'encodeur, de la déviation en échantillons finis et de l'estimation du ratio de densité. Les expériences s'appuient sur un dataset public de téléopération humanoïde, testées sur différents canaux sans fil et profils de trajectoires dynamiques. La téléopération XR est aujourd'hui le principal vecteur de collecte de démonstrations humanoïdes, données indispensables à l'entraînement des politiques VLA et de diffusion. L'overhead radio des transmissions haute fréquence constitue un frein réel à la scalabilité de ces pipelines. En réduisant la consommation énergétique du lien sans fil sans dégrader la qualité des trajectoires reconstruites, ce travail adresse un problème opérationnel concret : déployer des cellules de téléopération en grand nombre dans des environnements à bande passante contrainte, entrepôts ou ateliers de production. La caractérisation PAC-Bayes représente une première formalisation théorique de l'adaptation sim-to-real appliquée spécifiquement à la couche communication, offrant aux équipes une base pour calibrer ces systèmes à l'échelle. La collecte de démonstrations est devenue l'enjeu stratégique central de la robotique humanoïde depuis 2024-2025. Physical Intelligence (pi0), Figure, Unitree et leurs concurrents investissent massivement dans des setups de téléopération, casques VR, exosquelettes et Apple Vision Pro inclus, pour alimenter leurs modèles VLA. L'adaptation sim-to-real reste un verrou ouvert que traitent aussi des équipes chez DeepMind, Stanford (Mobile ALOHA) et Carnegie Mellon. Ce papier est une contribution algorithmique et théorique sur couche communication, ni un produit ni un déploiement : les résultats sont validés sur dataset public, sans partenariat industriel annoncé. La prochaine étape logique serait une intégration dans un pipeline de collecte existant chez un fabricant d'humanoïdes, pour mesurer les gains réels en conditions opérationnelles.

RecherchePaper
1 source
Barrières neuronales dans l'espace de configuration pour la planification et le contrôle de manipulation
3530arXiv cs.RO 

Barrières neuronales dans l'espace de configuration pour la planification et le contrôle de manipulation

Des chercheurs proposent, dans un préprint arXiv (référence 2503.04929, troisième version, mars 2025), une méthode unifiée de planification de trajectoire et de contrôle sécurisé pour bras manipulateurs à haute dimensionnalité en environnement encombré et dynamique. Le coeur de l'approche repose sur l'apprentissage d'une fonction de distance en espace de configuration (CDF, Configuration-space Distance Function) via un réseau de neurones, utilisée simultanément comme outil de vérification de collision pendant la planification et comme barrière de sécurité en temps réel pendant le contrôle. Les expériences matérielles ont été réalisées sur un xArm6 d'UFactory, un manipulateur à 6 degrés de liberté vendu autour de 2 000 dollars, en conditions réelles. Le système ne s'appuie que sur des observations de nuages de points (point-cloud) embarquées, sans infrastructure de perception externe. La planification de trajectoire pour bras multi-axes en environnement non structuré repose classiquement sur des vérifications de collision nombreuses et coûteuses : chaque configuration candidate est testée contre un modèle de l'environnement. La CDF barrier réduit significativement ce nombre d'opérations en approximant localement l'espace libre en configuration. L'apport le plus concret pour les intégrateurs est ailleurs : un réseau de neurones introduit des erreurs de modélisation, et les capteurs ajoutent inévitablement du bruit. La formulation "distributivement robuste" retenue par les auteurs ne suppose aucune distribution statistique connue pour ces incertitudes, ce qui la rend applicable sans calibration préalable fine dans des scénarios industriels réels. C'est une réponse directe au fossé souvent observé entre performances en simulation et comportement effectif sur matériel, particulièrement critique pour des applications de manipulation en cellule dynamique. Ce travail s'inscrit dans une tendance accélérée à remplacer les représentations géométriques analytiques (maillages, distances signées calculées) par des représentations apprises en espace de configuration. Les Control Barrier Functions (CBFs), dont les CDF barriers constituent une extension neurale, sont issues de la théorie du contrôle formel et font l'objet d'un intérêt croissant depuis cinq ans. Parmi les approches concurrentes pour accélérer la vérification de collision : cuRobo de NVIDIA, VAMP (basé sur la décomposition convexe), ou les champs de distance signée neuronaux comme iSDF. Le choix du xArm6, bras commercial accessible et reproductible, renforce la portée pratique des résultats. L'existence d'une troisième version du préprint suggère des révisions substantielles en cours ; une soumission à ICRA ou RSS 2026 apparaît probable.

RecherchePaper
1 source
Regroupement d'actions implicites pour un contrôle continu fluide
3531arXiv cs.RO 

Regroupement d'actions implicites pour un contrôle continu fluide

Une équipe de chercheurs a publié sur arXiv (2605.19592) un nouveau cadre d'apprentissage par renforcement baptisé Dual-Window Smoothing (DWS), destiné à produire des signaux de contrôle continus sans les oscillations haute fréquence typiques des politiques RL. Ces instabilités constituent un frein majeur au déploiement physique. Les méthodes d'action chunking explicite existantes, qui prédisent des trajectoires sur un horizon fixe, atténuent le problème mais font croître la dimension de sortie de la politique proportionnellement à la longueur de l'horizon, générant des difficultés d'optimisation et une incompatibilité avec l'interaction pas-à-pas standard du RL. DWS propose une architecture duale : une fenêtre d'exécution qui garantit la fluidité physique via modulation déterministe, et une fenêtre de valeur qui aligne les cibles de temporal-difference sur l'horizon pour corriger le biais du critique induit par l'exécution en boucle ouverte. Un régulariseur temporel léger basé sur les différences d'actions au premier ordre complète le dispositif. Sur le DeepMind Control Suite et des tâches industrielles de gestion de l'énergie, DWS dépasse les baselines état de l'art ; sur des scénarios de conduite autonome vision, il affiche un taux de succès de 100 % avec une réduction mesurable du jitter. L'enjeu dépasse le cadre académique : la fluidité du signal de contrôle est l'un des verrous critiques pour le déploiement industriel d'agents RL, qu'il s'agisse de bras manipulateurs, de véhicules autonomes ou d'humanoïdes. Le fait que DWS n'élargisse pas l'espace d'action le rend directement compatible avec les pipelines RL standards, sans refonte d'architecture. La correction du biais du critique via la fenêtre de valeur adresse un problème rarement traité explicitement : l'inadéquation entre exécution multi-pas en boucle ouverte et estimations de valeur pas-à-pas. Le taux de 100 % en conduite vision mérite toutefois une lecture critique, les conditions exactes du benchmark ne sont pas détaillées dans l'abstract, et les résultats sur des suites plus larges (Control Suite, gestion d'énergie) constituent une validation plus solide. L'action chunking pour le lissage temporal est issu des travaux récents sur les politiques de diffusion et l'imitation learning, notamment ACT et Diffusion Policy, où prédire des séquences d'actions plutôt que des actions individuelles réduit la variance comportementale. DWS transpose cette logique au RL pur, un transfert non trivial compte tenu des contraintes TD inhérentes à l'interaction pas-à-pas. Les concurrents directs incluent les méthodes de temporal abstraction hiérarchiques (option-critic, HRL) et les filtres de lissage post-hoc. Aucune timeline de déploiement hardware n'est mentionnée dans ce preprint, mais les expériences sur la gestion industrielle de l'énergie suggèrent une orientation vers des applications réelles. Les prochaines étapes naturelles incluent une validation sur robots physiques, où la réduction du jitter se traduit directement en durée de vie mécanique et en sécurité opérateur.

RecherchePaper
1 source
Téléopération bilatérale à compliance avec captation de pose et de force à 6-DOF
3532arXiv cs.RO 

Téléopération bilatérale à compliance avec captation de pose et de force à 6-DOF

Une équipe de chercheurs propose, dans un preprint arXiv publié en mai 2026, une architecture de téléopération bilatérale cartésienne construite autour d'un nouvel effecteur terminal bas coût baptisé Delta6. Ce composant compact intègre à la fois la mesure de pose et d'effort sur 6 degrés de liberté (6-DOF) via une conception compliante, et se monte côté opérateur (leader) comme côté robot (follower). La plateforme repose sur le middleware WinGs Operating Studio (WOS), conçu pour être agnostique au matériel, et chaque bras équipé du Delta6 se comporte alors comme un actionneur élastique en série (SEA) 6-DOF complet. Les tests ont été menés sur un tandem Lite6/FR3 cadencé à 150 Hz: le système maintient une stabilité de suivi sous des délais de réseau allant jusqu'à 120 ± 40 ms avec 1 % de perte de paquets, reproduit fidèlement la raideur virtuelle prescrite en contact, et présente une signature énergétique favorable dans des tests de type passivité. L'intérêt technique de l'approche réside dans deux ruptures simultanées. D'abord, les systèmes bilatéraux actuels exigent des capteurs force/couple rigides six axes onéreux (plusieurs milliers d'euros l'unité) et des boucles de contrôle en temps réel à l'échelle du kilohertz; le Delta6 compliante ouvre une voie vers des coûts nettement inférieurs. Ensuite, la décorrélation explicite de trois échelles temporelles, I/O matériel, boucle d'impédance/admittance intermédiaire, messages de téléopération basse cadence, permet de piloter des bras hétérogènes avec la même couche applicative, ce qui est un avantage concret pour les intégrateurs gérant des parcs robotiques multi-constructeurs. Le filtre biquad coupe-bande 6D côté leader limite les oscillations dues aux résonances mécaniques, point souvent négligé dans les démonstrateurs académiques. La téléopération bilatérale connaît un regain d'intérêt fort depuis 2024, portée par la collecte de données haptiques pour l'apprentissage par imitation sur robots humanoïdes. Des acteurs comme Force Dimension (Suisse) ou Haption (France), spécialiste européen des interfaces à retour d'effort, proposent des solutions commerciales mature mais coûteuses et souvent propriétaires. WOS se positionne comme une couche d'abstraction ouverte pouvant faciliter l'intégration sur des bras Franka, UFactory ou autres. Ce travail reste à ce stade un preprint non évalué par les pairs, sans déploiement industriel annoncé; la robustesse en conditions réelles (surfaces inconnues, perturbations dynamiques) reste à valider hors du banc de test contrôlé.

RecherchePaper
1 source
Localisation SLAM multi-session par texture au sol en environnements peu dynamiques
3533arXiv cs.RO 

Localisation SLAM multi-session par texture au sol en environnements peu dynamiques

Des chercheurs ont publié sur arXiv (identifiant 2605.19701) une étude portant sur le SLAM multi-session par texture de sol dans des environnements à faible dynamique de changement. Le SLAM (Simultaneous Localization and Mapping) basé sur la texture du sol utilise uniquement les patterns visuels du plancher comme repère cartographique, sans marqueurs physiques ni infrastructure dédiée. L'article évalue trois techniques pour améliorer la précision d'estimation de trajectoire dans des environnements où le sol évolue lentement entre sessions : usure de surface, phénomènes météorologiques, variations saisonnières. Parmi ces approches, l'utilisation de la divergence de Kullback-Leibler (KLD), une mesure de dissimilarité entre distributions de probabilité, comme score de similarité et comme biais influençant la confiance dans la détection de bouclage de trajectoire (loop closure), s'est révélée la plus performante. L'équipe met également à disposition un dataset public contenant des images multi-sessions de sol avec variations entre sessions et des données de pose haute précision pour évaluation comparative. La gestion multi-session est un prérequis opérationnel souvent sous-estimé dans les déploiements longue durée de robots mobiles autonomes (AMR) en environnements peu texturés : entrepôts à sols lisses, couloirs hospitaliers, zones de production industrielle. Un robot contraint de reconstruire intégralement sa carte après chaque redémarrage, maintenance ou changement saisonnier génère des interruptions de service et des coûts opérationnels qui compromettent la viabilité à l'échelle. La capacité à détecter des correspondances fiables entre sessions malgré une évolution lente du terrain constitue un pas concret vers des systèmes SLAM "lifelong" exploitables en production, et la KLD semble offrir ici un avantage mesurable sur les métriques de similarité classiques. Le SLAM par texture de sol s'est développé comme alternative aux systèmes LiDAR et aux réseaux de marqueurs au sol dans des contextes où l'infrastructure est coûteuse ou non autorisée, mais les travaux antérieurs restaient limités aux opérations mono-session. Les systèmes AMR commerciaux de référence, notamment ceux d'Exotec pour la logistique française ou les plateformes de navigation d'entrepôt fondées sur LiDAR 2D, s'appuient encore sur des capteurs actifs ou des repères fixes. Cette publication s'inscrit dans l'effort croissant de la communauté SLAM pour traiter les environnements "low-dynamic", zone intermédiaire entre statique et hautement dynamique qui représente pourtant la majorité des déploiements industriels réels. Le dataset public est la contribution la plus directement réutilisable, ouvrant la voie à un benchmark standardisé entre méthodes concurrentes.

RecherchePaper
1 source
Modélisation monde-ego pour l'évolution à long horizon dans les tâches hybrides incarnées
3534arXiv cs.RO 

Modélisation monde-ego pour l'évolution à long horizon dans les tâches hybrides incarnées

Des chercheurs ont publié sur arXiv en mai 2026 (arXiv:2605.19957) un nouveau paradigme appelé World-Ego Modeling, accompagné d'une implémentation concrète, le World-Ego Model (WEM). Le problème ciblé : les world models actuels prédisent l'évolution de la scène et du robot dans un flux unique, confondant deux dynamiques de nature différente, les régularités persistantes de l'environnement d'un côté et la dynamique propre à l'agent conditionnée par ses instructions de l'autre. Ce couplage dégrade les performances sur les tâches hybrides longue horizon, où navigation autonome et manipulation d'objets s'entrelacent. WEM sépare explicitement ces deux composantes via un planificateur implicite dual, couplé à un générateur de diffusion CP-MoE (cascade-parallel mixture-of-experts). Les auteurs publient également HTEWorld, présenté comme le premier benchmark dédié à ce type de tâches, avec 125 000 clips vidéo totalisant plus de 4,5 millions de frames et 300 trajectoires multi-tours représentant plus de 2 000 instructions. WEM atteint l'état de l'art sur HTEWorld et reste compétitif sur les benchmarks de manipulation seule. L'enjeu touche directement les systèmes de manipulation mobile : robots logistiques à bras, humanoïdes polyvalents, AMR avec capacités de saisie. La majorité des world models sont entraînés soit sur de la navigation pure, soit sur de la manipulation fixe, rarement sur des séquences hybrides longues où l'agent doit enchaîner déplacement, identification et manipulation sans intervention humaine. WEM formalise la désambiguation monde-ego et propose trois stratégies de désenchevêtrement (post-, pré- et complet), ouvrant un cadre de comparaison structuré pour les futures architectures VLA ; la création d'HTEWorld comble simultanément un manque concret, l'absence de référence commune pour les tâches hybrides rendant jusqu'ici les comparaisons entre approches difficiles à établir. Ce travail s'inscrit dans l'effervescence autour des world models incarnés, aux côtés de projets comme UniSim (Google DeepMind) ou Genie, et en parallèle des efforts des constructeurs d'humanoïdes comme Figure AI, Agility Robotics et NVIDIA (GR00T N2) sur la planification longue horizon. WEM reste un résultat académique : la validation sur robot réel n'est pas documentée dans l'article, et le code ainsi que les données HTEWorld n'étaient pas encore disponibles à la date de dépôt. Les suites naturelles sont l'évaluation sim-to-real et l'intégration avec des VLA à grande échelle comme pi-0 (Physical Intelligence) ou GR00T N2.

RechercheOpinion
1 source
Learn2Decompose : décomposition de problèmes pour planifier efficacement la manipulation séquentielle de multiples objets
3535arXiv cs.RO 

Learn2Decompose : décomposition de problèmes pour planifier efficacement la manipulation séquentielle de multiples objets

Des chercheurs ont publié sur arXiv (identifiant 2408.06843, cinquième révision soumise en 2025) une méthode baptisée Learn2Decompose, conçue pour réduire les temps de planification dans des tâches de manipulation séquentielle d'objets multiples en environnements dynamiques. L'approche s'appuie sur trois composantes distinctes : la décomposition d'objectifs (goal decomposition), qui découpe le problème global en séquences de sous-objectifs intermédiaires que le robot doit atteindre successivement ; l'apprentissage de distance computationnelle, qui prédit la complexité de planification entre deux états pour identifier le sous-objectif le plus proche après une perturbation de la scène ; et la réduction de l'ensemble d'objets actifs (object reduction), qui limite le nombre d'objets considérés à chaque étape de replanification. La méthode est évaluée sur trois benchmarks de manipulation robotique, sans que les gains chiffrés exacts soient communiqués dans le résumé public du papier. L'enjeu est direct : les solveurs classiques de TAMP (Task And Motion Planning) souffrent d'une complexité exponentielle à mesure que l'horizon de planification s'allonge et que le nombre d'objets augmente. En environnement industriel réel, entrepôt, ligne d'assemblage, cellule de picking, cette explosion combinatoire rend les approches TAMP difficiles à déployer sans contraintes fortes sur la taille des scènes. En apprenant des décompositions depuis des démonstrations humaines plutôt qu'en énumérant l'espace de plans, Learn2Decompose introduit un biais inductif qui réduit l'espace de recherche sans abandonner les garanties formelles du planificateur sous-jacent. L'idée de prédire une "distance computationnelle" entre états comme proxy du coût de replanning est méthodologiquement notable : elle permet au système de se reconfigurer dynamiquement après une perturbation, sans relancer une planification globale depuis zéro. Le TAMP est un domaine classique de la robotique, avec des travaux fondateurs au MIT, à Stanford et à CMU depuis les années 2010. La tension entre robustesse des planificateurs symboliques et leur passage à l'échelle reste un problème ouvert. Deux familles de réponses s'affrontent : les approches entièrement apprenantes comme les VLA (vision-language-action models) ou les diffusion policies telles que Pi-0 de Physical Intelligence, qui évitent le planificateur formel mais peinent sur les tâches longue-durée avec de nombreux objets ; et les approches hybrides comme Learn2Decompose, qui conservent le planificateur mais l'accélèrent par apprentissage automatique. Des acteurs comme Intrinsic (spin-off Google X) ou des équipes académiques comme celles derrière PDDLStream investissent dans des directions similaires. La cinquième révision du papier indique un cycle de peer review itératif ; les résultats quantitatifs complets et les comparaisons systématiques avec d'autres accélérateurs TAMP méritent consultation dans le manuscrit intégral.

RecherchePaper
1 source
COMPASS : planification de la manipulation en espace confiné par perception active
3536arXiv cs.RO 

COMPASS : planification de la manipulation en espace confiné par perception active

Des chercheurs ont publié COMPASS (Confined-space Manipulation Planning with Active Sensing Strategy), un framework multi-étapes destiné à résoudre la manipulation robotique en environnements confinés et encombrés. La méthode repose sur trois composants enchaînés : un scan de proximité dit "near-field awareness" qui construit une carte locale de collision avant tout mouvement, une fonction d'utilité multi-objectifs qui sélectionne des points de vue à la fois informatifs et compatibles avec les poses de saisie ultérieures, et un optimiseur de manipulation contraint qui génère des configurations de préhension respectant les obstacles détectés. Les auteurs proposent également un benchmark structuré en quatre niveaux de difficulté croissante pour évaluer les méthodes d'exploration et de manipulation en espace restreint. En simulation, COMPASS affiche un gain de 24,25 points de pourcentage sur le taux de succès de manipulation par rapport aux méthodes d'exploration conçues pour d'autres types de robots ou n'optimisant que le gain d'information. Des expériences en conditions réelles confirment la faisabilité de l'approche. Ce résultat est significatif parce qu'il adresse directement l'un des angles morts du champ NBV (Next Best View) : les stratégies d'exploration existantes maximisent la couverture informationnelle sans tenir compte de la faisabilité de la manipulation qui suit. En couplant explicitement exploration et planification de saisie dans une même fonction d'utilité, COMPASS réduit l'écart entre "voir la scène" et "agir dessus". Pour un intégrateur industriel, cela signifie une réduction du nombre de cycles d'observation improductifs avant une prise, ce qui devient critique dans des applications comme la désassembly, le picking en bacs profonds, ou la maintenance en espaces contraints. La validation sim-to-real, même partielle, réduit le scepticisme habituel sur le transfert des méthodes d'exploration en laboratoire vers des contextes terrain. Le problème de la manipulation en espace confiné est étudié depuis plusieurs années dans la communauté planification-perception, mais reste ouvert faute de benchmarks standardisés et de méthodes intégrant les deux dimensions simultanément. COMPASS s'inscrit dans un mouvement plus large qui voit des frameworks comme Active Neural Mapping ou des planificateurs basés sur l'échantillonnage (RRT, STOMP) être revisités pour intégrer des contraintes de manipulation dès la phase d'exploration. Aucune entreprise n'est associée à cette publication académique (arXiv:2509.14787), et aucune timeline de commercialisation n'est mentionnée. Les prochaines étapes naturelles seraient d'étendre le benchmark à des objets déformables ou à des scènes dynamiques, et de tester la robustesse face à des capteurs de profondeur bruités, condition sine qua non pour un déploiement industriel.

RecherchePaper
1 source
RoHIL : apprentissage par renforcement robotique robuste avec supervision humaine face aux variations d'éclairage
3537arXiv cs.RO 

RoHIL : apprentissage par renforcement robotique robuste avec supervision humaine face aux variations d'éclairage

Les systèmes de reinforcement learning avec humain dans la boucle (HIL-RL) atteignent des taux de succès quasi parfaits sur le poste de travail où ils sont entraînés, mais s'effondrent lorsque le même robot est déplacé de quelques mètres vers un poste différent. La cause est simple : des variations d'éclairage (position des lampes, lumière naturelle) perturbent suffisamment la distribution des entrées visuelles pour invalider la politique apprise. Pour combler ce "cross-domain gap" sans recollecte de données terrain, des chercheurs présentent RoHIL (Robust Human-in-the-Loop), un framework de fine-tuning hors ligne évalué sur quatre tâches de manipulation robotique réelle. RoHIL repose sur trois mécanismes : un re-lighting basé sur un world model qui resynthétise le flux visuel des trajectoires sources sous plusieurs environnements HDRI virtuels sans modifier les actions ni les récompenses, un mécanisme anti-oubli appelé Illumination-Retention Replay (IRR) qui entrelace transitions d'adaptation et transitions de rétention, et un régulariseur Bellman-acteur ancré limitant la dérive de représentation par rapport à la politique source. L'enjeu industriel est direct : recollecte de démonstrations et ré-entraînement HIL à chaque nouveau poste sont incompatibles avec un déploiement à l'échelle. La fragilité aux variations lumineuses reste l'un des obstacles les plus sous-estimés entre laboratoire et production réelle. RoHIL répond à ce problème sans interaction robot supplémentaire, ce qui réduit le coût d'intégration pour les opérateurs. La combinaison IRR et régulariseur Bellman démontre qu'il est possible d'adapter une politique à de nouvelles conditions visuelles tout en préservant les performances sur l'environnement d'origine, résultat non trivial face à l'oubli catastrophique classique. Ce travail, déposé sur arXiv en mai 2025 sous soumission anonyme et vraisemblablement en cours d'évaluation par une conférence, s'inscrit dans la vague de recherches visant à rendre les politiques robotiques robustes aux variations de domaine. Les approches concurrentes incluent la randomisation de domaine à l'entraînement, les politiques multi-environnements ou l'augmentation visuelle agressive, mais ces techniques nécessitent d'anticiper les variations en amont. RoHIL se distingue par son mode entièrement offline. Aucun déploiement commercial ni partenariat industriel n'est mentionné : il s'agit d'un résultat académique à ce stade, dont les extensions naturelles porteront sur un plus grand nombre de postes, de conditions lumineuses et de tâches à degrés de liberté élevés.

RecherchePaper
1 source
HEX : experts alignés sur les humanoïdes pour la manipulation corps entier multi-plateforme
3538arXiv cs.RO 

HEX : experts alignés sur les humanoïdes pour la manipulation corps entier multi-plateforme

Des chercheurs ont publié HEX (Humanoid-Aligned Experts for Cross-Embodiment Whole-Body Manipulation), un cadre de contrôle robotique déposé sur arXiv (arXiv:2604.07993v2) en avril 2026. HEX cible un problème structurel dans le déploiement des humanoïdes bipèdes de grande taille : la majorité des modèles Vision-Language-Action (VLA) existants traitent les membres du robot de façon indépendante, ce qui rend le contrôle à haute dimension (de nombreux degrés de liberté, ou DoF) instable et peu généralisable. Pour y répondre, HEX introduit une représentation d'état universelle alignée sur l'anatomie humanoïde, conçue pour l'apprentissage à grande échelle sur des plateformes hétérogènes. Son prédicteur proprioceptif unifié basé sur un Mixture-of-Experts (MoE) modélise la coordination corps entier et la dynamique temporelle de mouvement à partir de trajectoires issues de multiples morphologies robotiques. Pour l'encodage visuel temporel, HEX utilise des tokens d'historique légers résumant les observations passées sans réencodage redondant des images, puis fusionne indices visuels et langagiers avec la dynamique proprioceptive via un mécanisme de fusion résiduelle à portes et une tête d'action par flow-matching. Ce cadre adresse un goulet d'étranglement réel dans les VLA appliqués aux humanoïdes : le cloisonnement bras/jambes/torse empêche une coordination fluide et pénalise les tâches à réaction rapide ou à horizon long (planification multi-étapes). Les expériences sur tâches de manipulation réelles montrent que HEX atteint des taux de succès et une capacité de généralisation de l'état de l'art, précisément dans ces deux régimes critiques pour un déploiement industriel. La capacité à transférer des politiques entre morphologies hétérogènes (cross-embodiment) réduit également le coût de collecte de données par plateforme, un argument concret pour les intégrateurs. HEX s'inscrit dans une course dense au contrôle humanoïde haute fidélité. Pi0 de Physical Intelligence a popularisé le flow-matching pour la génération d'actions continues ; GR00T N2 de NVIDIA et Helix de Figure AI misent sur l'apprentissage en simulation massive. OpenVLA reste la référence open-source. HEX se distingue par son MoE dédié à la proprioception multi-corps, absent des architectures concurrentes. L'article étant un preprint arXiv révisé (v2), les résultats restent à confirmer par évaluation indépendante ; aucune affiliation institutionnelle ni timeline de déploiement n'est précisée dans le résumé public.

IA physiqueOpinion
1 source
Contrôle neuromorphique d'un robot à ailes battantes sur matériel à ressources limitées
3539arXiv cs.RO 

Contrôle neuromorphique d'un robot à ailes battantes sur matériel à ressources limitées

Des chercheurs ont présenté un framework de contrôle neuromorphique hiérarchique permettant le vol autonome embarqué d'un micro-robot à ailes battantes inspiré du papillon, pesant moins de 30 grammes. L'architecture déploie deux réseaux de neurones impulsionnels (Spiking Neural Networks, SNNs) directement sur un microcontrôleur ESP32 disponible dans le commerce pour environ 5 dollars : le premier SNN assure l'estimation d'état à partir des retours sensoriels bruts, le second pilote les ailes via modulation d'un Générateur de Patron Central (CPG). Entraîné par imitation learning, le système démontre un suivi stable des angles de tangage et de cap en vol libre non attaché (untethered), sans infrastructure externe. Sur le plan des performances, le contrôleur SNN réduit la latence d'inférence de 36 % (de 1 059 µs à 680 µs) et la consommation de 18 % (de 0,033 W à 0,027 W) par rapport à une baseline réseau de neurones artificiel (ANN) classique. Ce résultat est significatif car il démontre qu'un calcul de type spike-based est viable sans hardware spécialisé (neuromorphic chips type Intel Loihi ou SpiNNaker), en s'appuyant uniquement sur du silicium grand public. Pour les acteurs du secteur des micro-drones et de la robotique embarquée, cela ouvre une voie crédible vers l'autonomie embarquée sur plateformes ultra-contraintes en masse et en énergie (SWaP), un verrou reconnu de la filière. La combinaison estimation d'état + contrôle moteur en un seul pipeline neuromorphique léger, tournant en boucle fermée en temps réel, valide une hypothèse longtemps contestée : les SNNs peuvent rivaliser avec les ANNs sur des tâches de contrôle dynamique à haute fréquence sans sacrifier la précision. Les micro-véhicules à ailes battantes (FWMAVs) sont étudiés depuis une vingtaine d'années pour leur efficacité aérodynamique supérieure aux quadrotors à faible vitesse, mais leur adoption est freinée par la complexité des dynamiques non-linéaires et l'impossibilité historique d'embarquer suffisamment de puissance de calcul. Des projets comme le RoboBee de Harvard ou le DelFly de TU Delft ont établi les bases mécaniques, sans parvenir à la pleine autonomie embarquée. Sur le front concurrent, les approches à base d'ANNs classiques restent dominantes mais se heurtent aux mêmes contraintes énergétiques. Les auteurs revendiquent une première mondiale pour le contrôle neuromorphique entièrement embarqué sur FWMAV en vol autonome, affirmation qui devra être confirmée par pair review complet ; l'article est actuellement un preprint arXiv (2605.19430, mai 2025). Les prochaines étapes attendues concernent la robustesse aux perturbations extérieures et l'extension à des manœuvres 3D plus complexes.

RecherchePaper
1 source
TravExplorer : exploration incarnée inter-niveaux par planification 3D sensible à la traversabilité
3540arXiv cs.RO 

TravExplorer : exploration incarnée inter-niveaux par planification 3D sensible à la traversabilité

Des chercheurs proposent TravExplorer, un framework de navigation autonome multi-étages publié en mai 2026 sur arXiv (arXiv:2605.19958). Le système s'attaque à la navigation zero-shot par objets (ZSON, Zero-Shot Object Navigation), soit la capacité à localiser une cible désignée en langage naturel dans un environnement inconnu, sans carte préalable. Validé sur 4 195 épisodes simulés dans les benchmarks HM3D (Habitat-Matterport 3D) et Matterport3D (MP3D), puis sur 50 essais réels avec un robot quadrupède Unitree Go2, TravExplorer opère sur escaliers, paliers et espaces à chevauchements verticaux. Le système maintient une carte volumétrique unifiée distinguant structures occupées et surfaces accessibles au robot, extrait des frontières traversables sur sols, escaliers et paliers, et s'appuie sur un planificateur hiérarchique couplant une recherche 3D guidée par points d'appui (foothold-guided) à une optimisation de trajectoire localement contrainte en vertical. Presque tous les systèmes ZSON existants supposent un environnement mono-étage et une représentation plane, une hypothèse qui casse dans tout bâtiment réel comportant escaliers ou mezzanines. TravExplorer comble ce fossé avec deux apports concrets : un module sémantique allégé qui aligne une carte d'instances probabiliste (segmentation open-vocabulary en ligne) avec une carte de valeur spatiale via image-to-text rapide, réduisant la latence de raisonnement ; et une stratégie de perception active FOV-aware pour résoudre les zones partiellement observées lors des transitions d'étages. Les résultats sur HM3D et MP3D sont supérieurs aux baselines ObjectNav de référence, et les 50 essais sur Go2 sans carte ni intervention humaine constituent une validation sim-to-real concrète, même si elle reste limitée à une seule plateforme et à des intérieurs contraints. Le champ du ZSON multi-étages émerge dans un contexte plus large d'ambition robotique pour les environnements non structurés. HM3D (Meta) et MP3D sont les benchmarks standards du domaine ; y surpasser les méthodes ObjectNav actuelles est un signal de maturité technique. Le Unitree Go2, quadrupède de recherche commercialisé autour de 8 700 euros, est devenu une plateforme de référence en navigation académique. Le code source sera mis à disposition sur GitHub. Les extensions logiques incluent des bâtiments plus complexes, des espaces semi-ouverts et l'intégration sur robots humanoïdes ou à roues. Aucun acteur européen n'est impliqué dans cette publication.

RecherchePaper
1 source
PAPO-VLA : une optimisation de politique adaptée à la planification pour les modèles vision-langage-action
3541arXiv cs.RO 

PAPO-VLA : une optimisation de politique adaptée à la planification pour les modèles vision-langage-action

Des chercheurs ont publié en mai 2026 sur arXiv (2605.19580) PAPO-VLA, une méthode d'optimisation pour les modèles Vision-Language-Action (VLA) appliqués à la manipulation robotique guidée par le langage naturel. L'observation centrale est qu'une politique VLA opère en boucle fermée : chaque action modifie l'état de la scène et conditionne toutes les décisions suivantes, ce qui rend une erreur de planification particulièrement coûteuse. Les auteurs distinguent donc deux rôles dans une politique VLA : le planificateur, qui prend des décisions orientées tâche susceptibles de rediriger l'exécution, et l'exécuteur, qui les traduit en actions continues denses. PAPO-VLA identifie les "actions de planification" en croisant variation d'action et issue de trajectoire, estime leur importance causale via deux critères formels (suffisance et nécessité causales), puis intègre ces poids dans l'estimation d'avantage du GRPO (Group Relative Policy Optimization), de sorte que les moments critiques reçoivent une emphase d'optimisation plus forte sans abandonner le signal de trajectoire globale. Des améliorations sont rapportées sur plusieurs benchmarks de manipulation robotique, sans chiffres précis disponibles dans le résumé public. L'apport clé est de combler un angle mort des approches existantes : l'imitation de trajectoires et l'optimisation par retour de trajectoire entière traitent toutes les actions avec la même importance, alors que certains instants de décision ont un impact causal disproportionné sur le succès de la tâche. Quantifier cet impact via des métriques causales formelles plutôt qu'heuristiques est une avancée méthodologique notable. Pour les équipes déployant des VLA en environnement réel, sur des plateformes comme pi-0 (Physical Intelligence), OpenVLA (Berkeley) ou GR00T N2 (NVIDIA), la méthode promet d'améliorer la fiabilité sans données de démonstration supplémentaires. Depuis RT-2 (Google DeepMind, 2023), le secteur des VLA cherche à combler l'écart entre performance en démonstration contrôlée et robustesse en déploiement réel. Le GRPO, popularisé par DeepSeek-R1 pour le raisonnement en LLM, est ici adapté à la robotique via une pondération causale des actions, dans un axe de recherche croissant autour du renforcement causal appliqué aux robots. PAPO-VLA est un preprint non encore revu par les pairs ; la validation expérimentale complète, avec benchmarks précis et comparaisons contrôlées, reste à confirmer via publication.

RechercheOpinion
1 source
ContextFlow : alignement hiérarchique tâche-état pour agents incarnés à long horizon
3542arXiv cs.RO 

ContextFlow : alignement hiérarchique tâche-état pour agents incarnés à long horizon

Une équipe de chercheurs a publié en mai 2026 ContextFlow (arXiv:2605.19314), un cadre d'alignement destiné aux agents robotiques longue durée capables d'enchaîner navigation, recherche, approche et manipulation sur des séquences complexes. Le problème central est ce que les auteurs nomment le "task-state misalignment" : un écart de cohérence au niveau tâche, dans lequel le planificateur central, les observations en temps réel, la mémoire contextuelle et les exécuteurs spécialisés ne convergent plus vers la même décision de prochaine étape. Les symptômes concrets incluent les transferts de contrôle non justifiés ("unsupported handoffs"), le blocage de phase ("stage lock") et les replanifications inutiles qui dégradent la performance globale. Le système représente chaque étape comme un contrat explicite, convertit les observations en paquets d'évidence structurés, et applique cinq types de mises à jour : continue, refine, transfer, promote et repair. L'enjeu est structurant pour l'architecture des robots manipulateurs polyvalents. À mesure que les exécuteurs spécialisés, modèles vision-langage-action (VLA) ou stacks de navigation autonome, deviennent plus robustes, le vrai goulot d'étranglement se déplace : non plus la qualité d'exécution locale, mais la capacité à maintenir une frontière de tâche cohérente sur plusieurs dizaines d'étapes, un angle que les architectures hiérarchiques classiques négligent. Pour un intégrateur industriel, ContextFlow promet moins d'échecs silencieux en production et une meilleure diagnosticabilité des incidents. La séparation entre contrôle local délégué aux exécuteurs et cohérence globale gérée par ContextFlow permet aussi de remplacer ou améliorer les exécuteurs sans refondre l'architecture de planification. Ce travail s'inscrit dans une vague de recherche sur les agents incarnés longue durée, portée par la montée en puissance des VLA et des architectures "foundation model" couplées à des exécuteurs de compétences spécialisées. Les approches concurrentes incluent SayCan et TaPA pour la décomposition de tâches langagières, ainsi que les Behavior Trees pour la gestion d'état structuré. ContextFlow se distingue par son accent sur l'inspectabilité et la traçabilité des décisions d'alignement. Les auteurs valident leur approche sur des traces de démonstration de tâches longue durée, sans benchmark public ni déploiement sur robot physique : les résultats restent expérimentaux, ce qui constitue une limite à noter. Les prochaines étapes naturelles seraient une validation sur des plateformes matérielles, bras manipulateurs ou humanoïdes, et une comparaison quantitative avec des baselines de planification classiques.

IA physiqueOpinion
1 source
Génération itérative et compositionnelle de données pour le contrôle de robots
3543arXiv cs.RO 

Génération itérative et compositionnelle de données pour le contrôle de robots

Une équipe de chercheurs propose, dans un article arXiv (2512.10891, cinquième révision), un modèle génératif appelé "semantic compositional diffusion transformer" pour produire des données d'entraînement en manipulation robotique. Le principe central consiste à décomposer chaque transition dans l'espace d'état en quatre composantes distinctes, propres au robot, aux objets manipulés, aux obstacles, et à l'objectif de la tâche, dont les interactions sont apprises via des mécanismes d'attention. Entraîné sur un sous-ensemble limité de combinaisons de tâches, le modèle génère en inférence zéro-shot des transitions synthétiques de haute qualité pour des configurations jamais vues : nouveaux objets, nouveaux environnements, nouvelles associations robot-tâche. Un processus d'auto-amélioration itératif complète l'approche : les données synthétiques générées sont validées par apprentissage par renforcement hors-ligne (offline RL), puis réintégrées dans les rounds d'entraînement suivants. Au terme de ce cycle, le système résout la quasi-totalité des tâches de test non vues lors de l'entraînement. L'enjeu industriel est direct : collecter des démonstrations robotiques réelles pour couvrir l'espace combinatoire de toutes les tâches possibles en environnement multi-objets, multi-robots, multi-sites est économiquement prohibitif. Ce travail démontre qu'une structure compositionnelle apprise permet de briser cette malédiction combinatoire, sans démonstrations exhaustives. La boucle génération-validation-réentraînement est particulièrement notable : elle réduit le risque classique de drift sim-to-real en filtrant les transitions synthétiques non viables avant qu'elles ne contaminent le pipeline de policy learning. Les résultats surpassent significativement les baselines monolithiques et les approches compositionnelles à règles fixes (hard-coded), ce qui suggère que la structure compositionnelle émergente est réellement capturée par les représentations apprises, et non artificiellement injectée. Ce travail s'inscrit dans une dynamique de recherche qui cherche à contourner le goulot d'étranglement des données en robotique, aux côtés d'approches comme Diffusion Policy (Chi et al., CMU) ou les Visual Language Action models (VLA) tels que Pi-0 (Physical Intelligence) et GR00T N2 (NVIDIA). Là où ces derniers misent sur des fondations visuolinguistiques massives, cette contribution cible la généralisation compositionnelle avec des données d'entraînement réduites. La première soumission datant de décembre 2025 et le papier en étant à sa cinquième révision, les auteurs ont visiblement consolidé leurs expériences au fil des retours communautaires. Les prochaines étapes naturelles seraient une validation sur hardware réel et une extension aux chaînes de manipulation longue-horizon, domaine où l'absence de compositionnalité reste le principal point de rupture des approches actuelles.

RecherchePaper
1 source
Un cadre pratique d'indicateurs de performance clés pour les tests sur le terrain avec plusieurs robots lunaires et planétaires
3544arXiv cs.RO 

Un cadre pratique d'indicateurs de performance clés pour les tests sur le terrain avec plusieurs robots lunaires et planétaires

Une équipe de chercheurs a publié sur arXiv (référence 2601.20529, version 3) un cadre structuré d'indicateurs clés de performance (KPI) destiné à évaluer les missions multi-robots lors d'essais analogiques lunaires et planétaires. Le constat de départ : les nombreux tests de terrain simulant la prospection lunaire (ilménite, terres rares, glace d'eau) utilisent des métriques hétérogènes propres à chaque scénario, rendant toute comparaison inter-missions quasi impossible. Le cadre est dérivé de trois scénarios multi-robots représentatifs et organise les KPI autour de trois axes : efficacité (couverture de terrain, débit d'exploration), robustesse (taux de pannes, reprise après défaillance) et précision (qualité des données scientifiques collectées). Validé lors d'un test de terrain réel, il se révèle directement applicable pour les métriques d'efficacité et de robustesse ; les KPI de précision se heurtent en revanche à l'impossibilité pratique d'obtenir des données de vérité terrain fiables dans des environnements extérieurs non instrumentés. L'absence de standard commun est l'un des freins principaux au développement de la robotique planétaire : sans référentiel partagé, comparer deux systèmes multi-robots issus de plateformes et de configurations expérimentales différentes reste impossible, même lorsqu'ils visent le même objectif scientifique. Ce framework comble ce manque en reliant les métriques d'ingénierie aux objectifs de mission (ressources extractibles, couverture cartographique), ce qui est directement utile pour arbitrer entre architectures de flotte ou stratégies de coordination distribuée. La limite identifiée sur les KPI de précision est significative et honnête : mesurer la localisation absolue d'un essaim de robots en extérieur sans infrastructure de référence reste un problème ouvert, ce qui conditionne directement la fiabilité des futurs démonstrateurs ISRU (In-Situ Resource Utilization). La prospection robotique lunaire connaît une structuration accélérée sous l'impulsion du programme Artemis (NASA), des ambitions lunaires de l'ESA et d'acteurs privés comme ispace (Japon/Luxembourg) ou Astrobotic (États-Unis). Les missions analogiques terrestres sur substrats simulant le régolite sont l'outil standard avant vol, mais leur prolifération sans méthode commune a produit une littérature difficile à synthétiser et à comparer. Ce papier s'inscrit dans un mouvement de standardisation comparable à ce que l'IEEE a accompli pour les robots AMR industriels ; l'étape logique serait son adoption par des consortiums comme l'ESA-ESRIC lors de compétitions analogiques de référence, telles que l'ESRIC Space Resources Challenge, pour confirmer sa portée au-delà d'un seul contexte expérimental.

RecherchePaper
1 source
Réceptogenèse dans un corps robotique vascularisé
3545arXiv cs.RO 

Réceptogenèse dans un corps robotique vascularisé

Une équipe de chercheurs présente, dans un preprint arXiv (réf. 2603.09473v2, mai 2026), un composite robotique vascularisé capable de générer ses propres capteurs pendant l'opération. Le concept central, la réceptogenèse, désigne la construction à la demande d'organes sensitifs à partir de réserves de fluide internes, déclenchée par des stimuli environnementaux. Concrètement, des précurseurs chimiques sont acheminés via des micro-canaux fluidiques jusqu'à une zone cible, puis exposés à une irradiation UV localisée. Cette photopolymérisation in situ transforme les précurseurs contenant un initiateur photolatent en une dispersion solide de polypyrrole UV-sensible dans du PETG, créant une zone conductrice dont la formation est confirmée par une chute caractéristique d'impédance électrique. La démonstration a été réalisée sur un robot biomimétique inspiré du papillon de nuit : le capteur synthétisé en temps réel a fermé une boucle de contrôle locale régulant le battement des ailes. Ce résultat met en évidence une limite structurelle des systèmes modulaires actuels, qui permettent la substitution de composants pré-fabriqués mais ne créent pas de nouvelle fonctionnalité au niveau matériau. La réceptogenèse propose une rupture : la fonctionnalité émerge d'une restructuration chimique interne, sans pièce externe ni intervention humaine. La fermeture d'une boucle temps réel avec un capteur synthétisé in situ constitue l'avancée démonstrative clé. Il faut cependant noter que le démonstrateur reste limité à une tâche mécanique simple, et que la robustesse sur des cycles répétés ou en conditions opérationnelles variées n'est pas encore évaluée. Ce travail s'inscrit dans la recherche émergente sur les matériaux robotiques programmables, inspirée des systèmes circulatoires biologiques qui redistribuent masse et fonction dans l'organisme. Ni institution d'origine, ni partenaire industriel, ni timeline de déploiement ne sont mentionnés dans le preprint : il s'agit d'une contribution de recherche fondamentale. Les approches concurrentes les plus proches relèvent des soft robots à composites auto-cicatrisants développés notamment au Harvard Biodesign Lab et à l'ETH Zurich, ainsi que des systèmes à microfluidique intégrée. Les étapes suivantes naturelles incluront l'extension à des vasculatures plus complexes, la validation sur plusieurs cycles de synthèse successifs et la démonstration hors conditions de laboratoire contrôlées.

RecherchePaper
1 source
Justifier la recherche en robotique bio-inspirée : une taxonomie des stratégies
3546arXiv cs.RO 

Justifier la recherche en robotique bio-inspirée : une taxonomie des stratégies

Une équipe de chercheurs a publié sur arXiv (référence 2605.19840) une proposition de taxonomie structurée des motivations qui sous-tendent la conception bio-inspirée en robotique. Le constat de départ est simple mais rarement formulé explicitement : depuis des siècles, l'ingénierie emprunte au vivant sans cadre théorique cohérent pour justifier ces choix. Le papier identifie cette absence comme source de confusions méthodologiques récurrentes, des motivations floues, des métriques d'évaluation inadaptées, et un écart persistant entre les attentes des lecteurs ou financeurs et les résultats effectivement livrés. Les auteurs proposent une classification des différentes postures possibles pour un chercheur qui choisit d'imiter, d'adapter ou de s'inspirer d'un système biologique, avec pour chaque approche une description des contributions scientifiques attendues. L'enjeu est loin d'être purement académique. Dans le domaine de la robotique, la bio-inspiration joue un rôle croissant : locomotion quadrupède (Boston Dynamics Spot, ANYmal), manipulation inspirée de la main humaine (Shadow Dexterous Hand, Leap Hand), vision par événements calquée sur la rétine. Mais la justification de ces choix reste souvent implicite dans les publications, ce qui complique l'évaluation par les comités de financement et crée des attentes mal calibrées. Une taxonomie claire permettrait aux chercheurs d'afficher d'emblée le niveau d'analogie revendiqué, structural, fonctionnel, ou computationnel, et aux programme managers de comparer des approches réellement comparables. C'est aussi un outil pour détecter ce que les auteurs appellent une bio-inspiration "superficielle" : une ressemblance cosmétique avec le vivant sans apport scientifique distinct. La bio-inspiration en robotique puise dans une longue tradition qui remonte aux travaux de Grey Walter dans les années 1940 (tortues électromécaniques), en passant par la cybernétique de Norbert Wiener et les robots de subsomption de Rodney Brooks au MIT dans les années 1980. Aujourd'hui, le champ est fragmenté entre des communautés aux vocabulaires disjoints : soft robotics, neurorobotics, morphological computation. Ce papier ne propose pas de résultats expérimentaux ni de déploiement industriel, c'est une contribution méta-scientifique, un outil de clarification conceptuelle. Son utilité sera mesurée à l'adoption par la communauté et à son éventuelle intégration dans des guidelines de reviewers et de bailleurs comme la NSF ou l'ANR en France.

RecherchePaper
1 source
Vers une récupération d'architecture assistée par LLM pour les systèmes ROS 2 réels : approche multi-niveaux à base d'agents pour la reconstruction de structure hiérarchique
3547arXiv cs.RO 

Vers une récupération d'architecture assistée par LLM pour les systèmes ROS 2 réels : approche multi-niveaux à base d'agents pour la reconstruction de structure hiérarchique

Des chercheurs ont publié sur arXiv (arXiv:2605.20055) une approche basée sur des agents LLM pour reconstruire automatiquement l'architecture logicielle hiérarchique de systèmes robotiques développés sous ROS 2. Le pipeline, dit "blueprint-guided", intègre deux améliorations majeures par rapport à une version antérieure : un raffinement du prompting pour améliorer la cohérence et la contrôlabilité de la synthèse architecturale, et une stratégie de récupération par étapes s'appuyant sur des représentations intermédiaires multi-niveaux, incluant la liste des nœuds ROS atomiques et les dépendances entre fichiers de lancement. L'approche a été évaluée sur un système réel de désassemblage automatisé de produits, basé sur des bras robotiques coopératifs et des artefacts ROS 2 hétérogènes, présentant une complexité d'intégration nettement supérieure au cas d'étude précédent. L'enjeu est concret pour les équipes robotique en production : dans un système ROS 2, la structure logicielle est rarement documentée explicitement. Elle est fragmentée entre le code source, les fichiers de lancement et les paramètres de configuration, rendant la maintenance, l'audit de sécurité et l'évolution du système coûteux. Les outils existants se limitent généralement à la cartographie des nœuds et des topics (niveau "câblage"), sans restituer la décomposition fonctionnelle hiérarchique que les architectes logiciels utilisent réellement. Cette approche LLM propose de franchir ce saut d'abstraction, avec des résultats jugés améliorés en consistance structurelle et en robustesse, bien que les auteurs signalent eux-mêmes des limites persistantes sur la sémantique d'intégration dynamique dans les déploiements à grande échelle, un point de fragilité non négligeable pour des systèmes en production. ROS 2, successeur de ROS 1 maintenu par la Open Robotics Foundation, est devenu le middleware de référence pour les robots industriels et de recherche, avec une adoption croissante chez des intégrateurs comme Clearpath, Boston Dynamics ou Universal Robots. La récupération d'architecture logicielle (architecture recovery) est un problème classique du génie logiciel, mais son application aux systèmes cyber-physiques distribués comme ROS 2 reste un chantier ouvert. Ce travail s'inscrit dans un effort académique plus large visant à automatiser la documentation des systèmes robotiques complexes, en complément d'approches d'analyse statique comme ros2doctor ou roslaunch-analyzer. La prochaine étape naturelle serait de tester la méthode sur des systèmes ROS 2 de plus grande envergure, notamment dans des environnements d'entrepôts ou de lignes de production, pour valider la tenue à l'échelle revendiquée.

RecherchePaper
1 source
Entraînement hybride pour les modèles vision-langage-action (VLA)
3548arXiv cs.RO 

Entraînement hybride pour les modèles vision-langage-action (VLA)

Une équipe de chercheurs a publié sur arXiv (identifiant 2510.00600, version 2) un framework nommé Hybrid Training (HyT), conçu pour les modèles Vision-Language-Action (VLA) utilisés en robotique de manipulation. Le problème central est le suivant : le raisonnement par chaîne de pensée (Chain-of-Thought, CoT), qui consiste à générer des "pensées" intermédiaires avant chaque action, améliore les performances des VLA mais allonge mécaniquement le temps d'inférence. Dans des tâches requérant de longues séquences d'actions successives, ce délai compromet l'utilisabilité réelle du système. HyT découple la phase d'apprentissage de la phase d'exécution : le modèle s'entraîne en intégrant les pensées intermédiaires, acquiert les gains de performance associés, puis peut les omettre entièrement lors du déploiement. Le framework supporte trois modes à l'inférence selon le contexte : prédiction directe d'actions, génération CoT complète, ou suivi d'instructions. Les auteurs ont validé l'approche sur plusieurs benchmarks simulés et sur des expériences en conditions réelles. Ce découplage entraînement/inférence répond à l'une des tensions fondamentales dans le déploiement industriel des VLA : les techniques qui améliorent la fiabilité dégradent souvent la réactivité. Pour un intégrateur ou un COO industriel, un système qui "réfléchit" trop longtemps avant d'agir est difficilement intégrable sur une ligne de production cadencée. HyT avance que les bénéfices du raisonnement explicite peuvent être distillés dans les poids du modèle et activés implicitement, sans générer de tokens supplémentaires au runtime. Si ce résultat se confirme à plus grande échelle, il simplifierait le compromis latence/performance qui freine aujourd'hui le déploiement de bras manipulateurs VLA en environnement non structuré. C'est également une réponse indirecte au "demo gap" fréquemment reproché à ces modèles : de bonnes performances en simulation ne garantissent pas une vitesse d'exécution acceptable sur le terrain. L'essor des VLA s'est accéléré depuis 2023 avec RT-2 (Google DeepMind), OpenVLA (UC Berkeley), Pi-0 (Physical Intelligence) et GR00T N2 (NVIDIA), qui combinent vision, langage et prédiction d'actions dans un seul réseau. L'application du CoT à la robotique prolonge les travaux fondateurs sur les LLMs, mais se heurte aux contraintes temps-réel absentes du traitement de texte. HyT s'inscrit dans un courant de recherche orienté déployabilité, aux côtés de la distillation de politiques et des architectures à flux de tokens réduit. La publication est une preprint arXiv non peer-reviewed, et les résultats en conditions réelles restent à confirmer à plus grande échelle industrielle. Aucun acteur européen n'est impliqué dans ces travaux ; les laboratoires cités opèrent principalement depuis les États-Unis.

RechercheOpinion
1 source
EUPHORIA : planification universelle efficace par optimisation hybride pour l'assemblage robotique industriel
3549arXiv cs.RO 

EUPHORIA : planification universelle efficace par optimisation hybride pour l'assemblage robotique industriel

Une équipe de chercheurs a publié sur arXiv (référence 2605.18872v1) EUPHORIA, un framework de planification unifiée pour l'assemblage robotique en construction architecturale. Le système combine quatre modules distincts : un Meta-Geometric Encoder basé sur des Graph Hypernetworks, un Physics-Informed Graph Transformer entraîné via Soft Actor-Critic (SAC), un module de séquençage Kinematics-Aware, et une couche de correction différentiable baptisée Residual Stability Correction. Le principe central est l'adaptation en few-shot : à partir d'un ensemble de support minimal, le hypernetwork génère dynamiquement les paramètres de politique du robot sans nécessiter de réentraînement par gradient, même sur des géométries non standards comme des dômes ou des arches. Les expériences rapportées montrent une réduction de la consommation énergétique par rapport aux approches découplées, et des taux de succès annoncés comme état de l'art sur des géométries inédites. Il s'agit d'un preprint académique, sans déploiement industriel déclaré à ce stade. L'intérêt technique de EUPHORIA réside dans l'attaque simultanée de deux goulots d'étranglement qui paralysent l'automatisation en construction : le coût de réentraînement pour chaque nouvelle conception géométrique, et le traitement disjoint du séquençage structurel et du mouvement cinématique. Le mécanisme Physics-Bias Attention intègre des forces de contact issues de simulations par éléments discrets (DEM) directement dans les scores d'attention du transformer, orientant le planificateur vers les connexions structurellement critiques. Le module Residual Stability Correction tente de combler le gap sim-to-real en affinant les actions d'assemblage brutes via une optimisation conjointe énergie-stabilité avant exécution, ce qui reste une approche prometteuse mais non validée en conditions industrielles réelles. Si les résultats laboratoire se confirment, l'impact pour les intégrateurs serait significatif : pouvoir déployer un même robot sur des chantiers aux géométries variées sans cycle de requalification logicielle. Le champ de la robotique de construction reste dominé par des systèmes spécialisés : Hadrian X de FBR pour la maçonnerie en ligne droite, les bras ABB et KUKA pour l'assemblage structurel répétitif, ou encore des approches de préfabrication hors-site. La recherche en planification architecturale robotisée s'intensifie dans les labos académiques (ETH Zurich, MIT Media Lab), mais le fossé entre démonstration sur géométries contrôlées et déploiement réel sur chantier reste important. EUPHORIA s'inscrit dans ce courant de travaux cherchant à généraliser les politiques de manipulation via le méta-apprentissage, une direction également explorée par des acteurs comme 1X Technologies ou Apptronik pour la manipulation généraliste, mais ici appliquée à un domaine industriel vertical précis. Les prochaines étapes naturelles seraient une validation sur hardware réel et une collaboration avec un acteur de la construction industrialisée.

RecherchePaper
1 source
Contrôle robuste aux distributions via l'inférence de Stein pour la manipulation au contact
3550arXiv cs.RO 

Contrôle robuste aux distributions via l'inférence de Stein pour la manipulation au contact

Une équipe de chercheurs publie sur arXiv (référence 2605.19029) une méthode de contrôle robuste pour la manipulation robotique en contact riche, domaine couvrant la saisie, l'assemblage et l'insertion précise d'objets. Le travail formalise le problème comme une optimisation de contrôle robuste aux distributions (distributionally robust control), résolue via l'inférence variationnelle de Stein, une technique probabiliste déterministe issue du machine learning bayésien. Les contrôleurs qui en résultent modélisent explicitement l'incertitude paramétrique liée aux contacts, sans nécessiter les volumes massifs de données d'entraînement qu'exigent les approches data-driven modernes. Les résultats expérimentaux rapportés indiquent une robustesse améliorée jusqu'à un facteur 3 par rapport aux méthodes classiques à base de modèles, sur une gamme de tâches avec incertitude paramétrique large. Ce chiffre est à nuancer : il provient des propres benchmarks des auteurs, sans validation indépendante. La manipulation en contact riche reste l'un des goulots d'étranglement critiques pour le déploiement de robots industriels polyvalents. Les approches VLA (Vision-Language-Action models), comme pi-0 de Physical Intelligence, offrent une flexibilité remarquable mais se dégradent fortement lorsque les données d'entraînement sont rares, ce qui limite leur adoption dans des environnements industriels où les jeux de données sont difficiles à constituer. Les contrôleurs classiques à base de modèles, à l'inverse, sont computationnellement efficaces mais peinent à représenter l'incertitude task-sensitive, c'est-à-dire celle qui impacte réellement la performance sur une tâche précise. L'approche proposée tente de combler ce fossé en injectant une modélisation probabiliste flexible dans le cadre déterministe des contrôleurs classiques, un compromis potentiellement attractif pour les intégrateurs industriels cherchant fiabilité sans pipeline de données massif. Ce travail s'inscrit dans une tendance académique cherchant à réconcilier le model-based engineering (Boston Dynamics, ABB) et les learned policies (Physical Intelligence avec pi-0, Google DeepMind avec ses architectures GR00T-style). L'inférence variationnelle de Stein, popularisée par Liu et Wang en 2016, est ici adaptée au contrôle optimal, ce qui représente une contribution méthodologique notable. Le résumé disponible ne mentionne ni déploiements réels ni partenaires industriels, signalant clairement un stade de recherche fondamentale, probablement conduite en simulation ou sur bancs d'essai de laboratoire. Une validation sur des plateformes hardware standardisées comme les bras Franka Emika ou UR10, dont les propriétés de contact sont bien documentées, constituerait la prochaine étape logique avant toute perspective d'industrialisation.

RecherchePaper
1 source