Aller au contenu principal

Actualités robotique — page 68

4 531 articles au fil, du plus récent au plus ancien.

IA incarnée sous contrôle : gouvernance à l'exécution pour agents contraints par des politiques
3351arXiv cs.RO 

IA incarnée sous contrôle : gouvernance à l'exécution pour agents contraints par des politiques

Des chercheurs ont publié sur arXiv (2604.07833) un cadre architectural pour la gouvernance d'exécution des agents incarnés, ces systèmes IA capables d'agir sur des robots, outils ou environnements physiques. La proposition centrale est une couche de gouvernance dédiée, externe à la boucle d'inférence de l'agent, chargée de cinq fonctions : vérification de politiques, admission de capacités, surveillance d'exécution, gestion des rollbacks et déclenchement d'override humain. Cette architecture formalise une frontière de contrôle entre l'agent incarné, des modules de capacité baptisés ECMs (Embodied Capability Modules) et la couche de gouvernance runtime. Les auteurs ont validé l'approche sur 1 000 essais de simulation randomisés couvrant trois dimensions de gouvernance : taux d'interception des actions non autorisées à 96,2 %, réduction des continuations non sécurisées de 100 % à 22,2 % en cas de dérive d'exécution, et 91,4 % de récupération avec conformité totale aux politiques, tous significativement supérieurs aux baselines testés (p<0,001). L'enjeu dépasse la robotique académique. À mesure que des agents IA obtiennent une autorité d'exécution réelle sur des bras industriels, des AMR (Autonomous Mobile Robots) ou des systèmes cyber-physiques, leur contrôlabilité devient un problème d'ingénierie système critique. L'approche dominante actuelle consiste à enfouir la logique de sécurité à l'intérieur de la boucle agent, ce qui rend l'audit difficile et la standardisation quasi impossible dans des environnements réglementés (santé, industrie critique). En externalisant la gouvernance dans une couche séparée, les auteurs proposent un modèle où la politique d'usage peut être modifiée ou vérifiée sans toucher aux poids du modèle, répondant à un besoin concret des intégrateurs industriels qui composent avec plusieurs fournisseurs et des référentiels de sécurité imposés par leurs clients. Ce papier s'inscrit dans un mouvement plus large de "safety at deployment", distinct de l'alignment par entraînement (RLHF, Constitutional AI). Il dialogue avec les architectures de contrôle comme ROS 2 et les travaux sur les systèmes multi-agents à responsabilité distribuée. Le contexte concurrentiel est direct : OpenAI, Google DeepMind, Figure AI, Physical Intelligence et Sanctuary AI développent tous des agents incarnés à capacité d'exécution croissante, mais la gouvernance runtime reste un angle mort industriel. Une telle architecture trouverait une application prioritaire dans les déploiements d'humanoïdes en environnement contrôlé, entrepôts ou lignes d'assemblage, où les opérateurs exigent des garanties d'auditabilité que les architectures end-to-end ne fournissent pas encore.

RechercheOpinion
1 source
OCELOT : odométrie et estimation du contact pour robots à pattes
3352arXiv cs.RO 

OCELOT : odométrie et estimation du contact pour robots à pattes

Une équipe de chercheurs a publié OCELOT (Odometry and Contact Estimation for Legged rObots), un pipeline complet d'odométrie pour robots à pattes reposant exclusivement sur des capteurs proprioceptifs embarqués : une centrale inertielle (IMU) solidaire du corps, des encodeurs articulaires et des capteurs de force. Le système s'appuie sur un filtre de Kalman à état d'erreur (ESEKF) dont l'état est corrigé par les pieds détectés en appui stationnaire. Sa contribution centrale est un module de détection de contact fusionnée et de quantification d'incertitude : deux détecteurs tournent en parallèle pour chaque pied, le premier combinant un modèle de mélange gaussien (GMM) avec une machine à états finis (FSM) à déclenchement anti-rebond sur les données de force, le second appliquant un test de rapport de vraisemblance généralisé (GLRT) sur la vélocité cinématique estimée du pied. Les scores continus issus des deux détecteurs sont fusionnés pour identifier les glissements. Pour valider l'approche, les auteurs ont constitué un dataset de 29 séquences couvrant 2,4 km sur des terrains variés (béton, herbe, graviers, rochers) et ont comparé OCELOT à des méthodes proprioceptives et extéroceptives. Le code et un package ROS2 temps réel sont publiés en open source. L'intérêt principal de OCELOT réside dans sa robustesse aux terrains glissants sans recourir à des capteurs extéroceptifs (caméra, lidar), qui restent coûteux, fragiles et sensibles aux conditions d'éclairage ou de poussière. Pour un intégrateur déployant un robot quadrupède en environnement industriel ou outdoor, disposer d'une odométrie fiable avec uniquement l'équipement embarqué de série réduit significativement la complexité système. La disponibilité d'un package ROS2 prêt à l'emploi abaisse la barrière d'adoption. Le benchmark face à des méthodes extéroceptives constitue un signal fort : il suggère que l'estimation de contact bien conçue peut rivaliser avec des approches visuelles sur des trajectoires courtes à moyennes. Les robots à pattes de type Spot (Boston Dynamics), ANYmal (ANYbotics) ou Unitree B2 sont les cibles naturelles de tels pipelines. L'odométrie proprioceptive pour quadrupèdes est un problème ouvert depuis des années, avec des travaux antérieurs comme Pronto (IIT) ou les pipelines d'ETH Zurich sur ANYmal. OCELOT se distingue par la combinaison explicite GMM+GLRT pour la détection de glissement, un point sensible dans les déploiements extérieurs. Les prochaines étapes probables incluent la validation sur des trajectoires longue distance et l'intégration dans des architectures SLAM proprioceptif complet.

RecherchePaper
1 source
Coordination multi-robots fédérée sans fragmentation multi-agents intra-robot
3353arXiv cs.RO 

Coordination multi-robots fédérée sans fragmentation multi-agents intra-robot

Une équipe de chercheurs a publié sur arXiv (arXiv:2604.11028v2) une architecture de coordination de flottes de robots baptisée Federated Single-Agent Robotics (FSAR). Le principe central s'oppose à une tendance croissante dans la robotique multi-robots : plutôt que de fragmenter chaque robot en plusieurs agents internes spécialisés (approche multi-agent intra-robot), FSAR préserve chaque unité comme un agent unique cohérent, doté de son propre runtime persistant, de son périmètre de politique locale et de son autorité de récupération autonome. La coordination inter-robots s'effectue au niveau de la flotte par fédération, via des registres partagés d'Embodied Capability Modules (ECM), de la délégation de tâches entre robots, une attribution d'autorité sensible aux politiques, et des protocoles de récupération en couches hiérarchiques. Sur des scénarios multi-robots représentatifs, les auteurs mesurent des gains statistiquement significatifs : effet de taille d=2.91 (p<0.001) pour la localité de gouvernance face au contrôle centralisé, et d=4.88 (p<0.001) pour le confinement des défaillances face aux architectures fortement décomposées. Pour les intégrateurs déployant des flottes d'AMR (Autonomous Mobile Robots) en entrepôt ou en environnement industriel, le choix de l'architecture de coordination impacte directement la robustesse opérationnelle. La thèse de FSAR est que la fragmentation intra-robot génère des conflits d'autorité, complique la récupération après panne et dilue la traçabilité des décisions. En maintenant un agent unique par robot, les politiques restent localement auditables, les pannes confinées, et la supervision humaine hiérarchique praticable à l'échelle de la flotte. Ces résultats sont toutefois issus de scénarios simulés qualifiés de "représentatifs" et non d'un déploiement physique documenté, ce qui limite pour l'instant la portée industrielle des conclusions. Le papier s'inscrit dans un débat architectural qui s'intensifie avec la montée en puissance des flottes humanoïdes (Figure AI, Agility Robotics, Apptronik) et des systèmes AMR à grande échelle. Les approches concurrentes, notamment les pipelines LLM/VLA qui décomposent chaque robot en sous-agents spécialisés, offrent davantage de flexibilité mais au prix d'une complexité de gouvernance croissante, selon les auteurs. En Europe, des acteurs comme Exotec (flotte Skypod déployée chez Decathlon et Cdiscount) ou Enchanted Tools (robot Miroka) sont directement concernés par ces choix architecturaux de fond. Le papier est une préprint arXiv en version 2, non encore soumise à ICRA, IROS ou CoRL ; la prochaine étape naturelle serait une validation expérimentale sur plateforme physique réelle.

RecherchePaper
1 source
Attribution et contrôle des artefacts aux frontières de segments dans l'espace du bruit
3354arXiv cs.RO 

Attribution et contrôle des artefacts aux frontières de segments dans l'espace du bruit

Une équipe de chercheurs publie sur arXiv (2506.11642v2) une analyse mécaniste des discontinuités d'exécution aux frontières de blocs d'actions dans les politiques visuomotrices génératives à action chunking. Cette technique, adoptée dans des systèmes comme Diffusion Policy (MIT/Columbia) ou ACT (Action Chunked Transformers, Stanford), consiste à prédire et exécuter plusieurs actions futures en un seul bloc plutôt qu'action par action. Les auteurs montrent d'abord que les métriques d'artefacts de frontière permettent de séparer de façon stable les épisodes réussis des épisodes en échec. Dans des politiques stochastiques, maintenir fixe le contexte d'observation et varier uniquement le bruit latent suffit à moduler systématiquement l'intensité de l'artefact. Sur un même checkpoint Diffusion Policy, la comparaison entre DDPM, DDPM à variance nulle et DDIM confirme que cette contrôlabilité locale dépend de l'intégrité du chemin d'information du bruit initial vers la sortie d'action. Dans un contexte clé favorisant les artefacts élevés, sélectionné par validation matched-continuation sur données tenues à l'écart, le taux de succès passe de 0,033 à 0,717. Ce résultat remet en cause une hypothèse tenace dans la communauté de la robotique apprenante : l'artefact de frontière de bloc n'est pas un simple sous-produit d'exécution à minimiser systématiquement, mais une variable dans l'espace bruit qui peut être attribuée, contrôlée et liée mécanistiquement au résultat de la tâche. Plus troublant encore, la direction préférentielle s'inverse selon le contexte d'exécution local : certains états obtiennent de meilleurs résultats sous artefact faible, d'autres sous artefact élevé, au sein d'une même tâche. Pour les intégrateurs robotiques, cela ouvre la voie à des stratégies d'inférence adaptatives où la sélection du bruit latent devient un levier de performance sans modifier ni réentraîner les modèles. L'action chunking équipe aujourd'hui de nombreuses politiques de manipulation en recherche, dont pi-0 (Physical Intelligence), et commence à apparaître dans des contextes de production. Le débat sur la robustesse à l'exécution et le sim-to-real gap reste central pour les équipes industrielles. Cette analyse fournit un outil diagnostique concret -- les métriques d'artefact comme signal pronostic d'échec -- et suggère que l'optimisation à l'inférence plutôt que la seule modification architecturale pourrait améliorer la fiabilité sur des tâches de manipulation fine. Les prochaines étapes naturelles incluent la généralisation à d'autres architectures VLA (vision-language-action) et la validation sur des plateformes matérielles réelles hors contexte de laboratoire.

IA physiqueOpinion
1 source
PGDG : génération de données physiquement ancrée pour l'apprentissage robuste de politiques bimanuelles à partir d'une seule démonstration
3355arXiv cs.RO 

PGDG : génération de données physiquement ancrée pour l'apprentissage robuste de politiques bimanuelles à partir d'une seule démonstration

Une équipe de chercheurs présente PGDG (Physically Grounded Data Generation), un cadre qui permet d'entraîner une politique de manipulation bimanuelles robuste à partir d'une seule démonstration humaine. Déposé sur arXiv en mai 2026 (réf. 2605.21710), le système attaque un problème structurant du behavior cloning : tout écart par rapport à la trajectoire apprise plonge le robot dans des états hors distribution, sans signal de récupération disponible dans les données d'entraînement. PGDG génère automatiquement, sans annotation humaine supplémentaire, un ensemble compact de trajectoires physiquement plausibles couvrant ces comportements de récupération manquants. Il alterne entre un échantillonneur ancré en physique et un curateur de données qui oriente progressivement l'exploration vers les modes sous-représentés, complété par un reétiquetage d'actions correctives sur les états risqués. Sur la tâche RotateBox-Pitch, manipulation bimanuelles par contact, le taux de succès passe de 38 % à 93 % en simulation et de 35 % à 82 % en transfert zéro-shot vers le robot réel. Appliqué au fine-tuning de GR00T, le modèle de fondation vision-langage-action de NVIDIA, la méthode améliore le taux de succès de 46 % à 77 %. Le résultat le plus notable pour les intégrateurs est le transfert zéro-shot : la politique entraînée exclusivement sur données synthétiques fonctionne directement sur le robot physique, sans adaptation terrain. Ce résultat valide empiriquement que la génération ancrée en physique peut combler le sim-to-real gap pour les tâches en contact, historiquement le talon d'Achille de la manipulation dextère. La compatibilité avec GR00T (un VLA) ouvre également une voie pour enrichir les modèles de fondation à faible coût de collecte : une démonstration unique remplace les centaines typiquement requises en téléopération, ce qui modifie le calcul économique pour tout projet de déploiement à grande variété de configurations. Ce travail s'inscrit dans la course à l'efficacité des données en robotique manipulatrice. L'augmentation spatiale classique, premier concurrent direct, est systématiquement surpassée sur les quatre tâches testées. Les approches alternatives misent soit sur la collecte massive comme ACT/ALOHA (des milliers de démonstrations), soit sur le pré-entraînement multi-tâche à grande échelle comme pi-0 de Physical Intelligence. PGDG se distingue par son paradigme "une démonstration suffit", potentiellement attractif dès que la diversité des pièces ou des configurations rend la collecte par tâche prohibitive. La validation reste pour l'instant en environnement laboratoire ; une évaluation sur des tâches industrielles réelles constituerait la prochaine étape logique.

IA physiqueOpinion
1 source
Analyse des capacités incarnées dans les modèles de langage multimodaux par évaluation et diagnostic par compétences
3356arXiv cs.RO 

Analyse des capacités incarnées dans les modèles de langage multimodaux par évaluation et diagnostic par compétences

Une équipe de chercheurs a publié BEAR (Benchmark for Embodied Abilities and Reasoning), un cadre d'évaluation qui décompose les tâches robotiques en 14 compétences atomiques pour diagnostiquer les failles des grands modèles de langage multimodaux (MLLMs) embarqués. Le benchmark regroupe 4 469 échantillons entrelacés image-vidéo-texte couvrant 6 catégories, de la perception bas niveau jusqu'à la planification de haut niveau. Soumis à 20 MLLMs dont GPT-5, il révèle deux résultats principaux : les capacités perceptuelles constituent le principal goulot d'étranglement derrière les échecs de raisonnement, et les modèles présentent une modélisation spatiotemporelle instable qui restait invisible dans les benchmarks précédents. En réponse, les auteurs proposent BEAR-Agent, un agent multimodal augmenté d'outils de raisonnement visuel et spatial, qui obtient une amélioration relative de 17,5 % sur GPT-5 par rapport au modèle de base, avec des gains confirmés en simulation et en robotique réelle. L'intérêt de ce travail tient à la granularité du diagnostic. Les benchmarks existants mesurent si un agent réussit une tâche sans expliquer pourquoi. BEAR révèle que les modèles n'échouent pas d'abord sur le raisonnement abstrait, mais sur la perception : identifier des objets dans une scène, interpréter une séquence vidéo, localiser un élément dans l'espace. Ce résultat contredit l'hypothèse répandue selon laquelle les LLMs auraient comblé le déficit de compréhension scénique grâce à leur préentraînement massif. La découverte sur l'instabilité spatiotemporelle est particulièrement significative pour les intégrateurs déployant des VLA (Vision-Language-Action models) en environnement industriel : elle suggère que les performances observées en démonstration vidéo curatée ne reflètent pas la fiabilité opérationnelle réelle. Ce preprint arXiv (version 2, 2025) s'inscrit dans un effort plus large pour structurer l'évaluation des agents embarqués, là où des benchmarks comme EgoSchema ou OpenEQA traitent la compréhension incarnée sans diagnostiquer les sous-compétences. BEAR se distingue par ses expériences en environnements robotiques réels, contrairement aux approches purement simulées comme EmbodiedScan. Aucun acteur français ou européen n'est directement impliqué dans cette publication académique, qui émane vraisemblablement d'équipes universitaires asiatiques ou nord-américaines au vu de la page projet associée. La prochaine étape logique serait l'adoption de BEAR comme protocole standard dans les pipelines d'évaluation VLA avant tout déploiement physique.

RecherchePaper
1 source
Apprendre à évoluer : champs interactifs multimodaux pour la navigation humanoïde robuste en environnements dynamiques
3357arXiv cs.RO 

Apprendre à évoluer : champs interactifs multimodaux pour la navigation humanoïde robuste en environnements dynamiques

Des chercheurs ont publié sur arXiv (2605.21935, mai 2026) un système de cartographie dynamique baptisé MIF (Multi-modal Interactive Field), conçu pour permettre aux robots humanoïdes de naviguer et de manipuler des objets dans des environnements réels en constante évolution. Testé sur un Unitree G1, le système améliore le taux de relocalisation dans un bureau non-statique de 12 % à 94 %, tout en réduisant l'empreinte mémoire sémantique de 91,4 % grâce à la distillation de features. MIF repose sur trois composantes couplées : un champ d'apparence basé sur le 3D Gaussian Splatting (3DGS) conscient de l'incertitude pour atténuer le flou induit par la marche bipède, un champ spatial maintenant une mémoire topologique de la scène, et un champ géométrique qui calcule une pose d'interaction sûre (Interaction Pose Safety, IPS) avant chaque manipulation. Un score de détection de discordance distingue les fausses alarmes dues aux oscillations du robot des changements persistants réels, et ne met à jour que les zones localement incohérentes. L'enjeu pratique est direct : les systèmes de cartographie sémantique existants (semantic maps, scene graphs) supposent généralement des trajectoires caméra stables et des environnements statiques, deux hypothèses qu'un humanoïde en mouvement viole en permanence. Passer de 12 % à 94 % de succès en relocalisation sur un robot réel dans un bureau avec personnes en mouvement constitue un résultat concret, pas une démo en laboratoire contrôlé. Pour un intégrateur ou un COO industriel évaluant des humanoïdes pour des tâches de pick-and-place, la capacité à maintenir une carte cohérente sous perturbation locomotrice est un prérequis opérationnel non négociable que la plupart des démos actuelles ne valident pas. Le contexte de ce travail s'inscrit dans l'essor du 3DGS comme alternative aux NeRF pour la représentation de scènes en temps réel, une technique popularisée en 2023 et dont l'adaptation à la robotique mobile reste un sujet de recherche actif. L'Unitree G1 est l'une des plateformes humanoïdes commerciales les plus accessibles du marché (autour de 16 000 dollars), ce qui rend ce type de validation plus reproductible que sur des robots propriétaires comme l'Atlas de Boston Dynamics ou le Figure 02. Le code et la page projet sont publiés (ziya-jiang.github.io/MIF-homepage), signal d'une recherche ouverte à la reproduction. Les prochaines étapes naturelles seraient une validation à plus grande échelle et une intégration dans des pipelines de manipulation end-to-end, terrain sur lequel Physical Intelligence (Pi-0) et les équipes GR00T de NVIDIA travaillent en parallèle.

HumanoïdesPaper
1 source
TacO : évaluation comparative des capteurs tactiles pour la manipulation d'objets
3358arXiv cs.RO 

TacO : évaluation comparative des capteurs tactiles pour la manipulation d'objets

Des chercheurs ont publié sur arXiv (réf. 2605.21976) un cadre d'évaluation systématique baptisé TacO, conçu pour comparer les capteurs tactiles sur des tâches de manipulation robotique concrètes. Quatre modalités ont été mises à l'épreuve : capteurs visuels (à base de caméra et d'élastomère), acoustiques, magnétiques et résistifs, testés sur trois scénarios représentatifs de l'assemblage industriel : pick-and-place avec masse inconnue, réorientation d'objet en main, et insertion de connecteur. Pour chaque tâche, des politiques de manipulation distinctes ont été entraînées, puis évaluées selon les propriétés intrinsèques de chaque capteur : résolution spatiale, détection du cisaillement (shear sensing), représentation tactile, et friction du matériau de contact. L'ensemble des capteurs, du code, des données et des configurations matérielles sera rendu public sur le site du projet. Ce travail remet en cause une hypothèse structurante de la communauté robotique : que le toucher améliore systématiquement les performances de manipulation. TacO montre au contraire que l'utilité de l'information tactile dépend fortement de la modalité du capteur, des propriétés mécaniques des matériaux et de la nature exacte de la tâche. Cette nuance a des implications directes pour les intégrateurs et les équipes R&D : choisir un capteur tactile sans référence à la tâche cible relève du pari. Pour les COO et décideurs industriels qui évaluent des solutions de manipulation complexe (assemblage, insertion, tri de pièces), TacO fournit un étalon comparatif là où n'existait jusqu'ici que du consensus non quantifié. Il faut noter que les métriques de performance détaillées par tâche ne sont pas divulguées dans le préprint, ce qui limite l'interprétation sans accès au papier complet. Le besoin de ce benchmark s'inscrit dans une dynamique plus large : le succès des approches vision-language-action (VLA) et de l'apprentissage par démonstration a repoussé les limites du manipulation standard, mais ces méthodes butent sur les tâches à contact riche, où le retour visuel seul ne suffit pas. Plusieurs capteurs font figure de références sectorielles -- GelSight et DIGIT pour le tactile visuel, ReSkin pour le magnétique, des matrices résistives pour la pression -- mais aucune comparaison tête-à-tête rigoureuse ne permettait aux équipes de justifier leur choix. TacO comble ce vide méthodologique. Les prochaines étapes naturelles incluent l'extension à des tâches bi-manuelles, à des environnements moins contrôlés, et l'intégration de ces résultats dans les pipelines d'entraînement de politiques généralisées comme Pi-0 ou GR00T N2.

RecherchePaper
1 source
Comprendre les défaillances multimodales dans le clonage comportemental par découpage d'actions
3359arXiv cs.RO 

Comprendre les défaillances multimodales dans le clonage comportemental par découpage d'actions

Déposée sur arXiv le 22 mai 2026 (arXiv:2605.22493), une étude analyse les mécanismes d'échec du behavioral cloning (apprentissage par imitation) lorsqu'une même observation admet plusieurs actions valides, un cas fréquent en manipulation robotique. Les auteurs se concentrent sur les politiques à action-chunking, qui prédisent des séquences d'actions futures plutôt qu'une action isolée, et distinguent deux familles d'architectures : les politiques à variable latente de type VAE (dont ACT, Action Chunking with Transformers) et les politiques génératives en espace d'action (dont les politiques de diffusion comme Diffusion Policy). Pour les premières, la régularisation posterior-prior (terme KL dans un VAE) crée un compromis difficile : une régularisation forte stabilise l'échantillonnage au déploiement mais efface l'information permettant de distinguer les modes démontrés ; une régularisation faible préserve cette information mais expose à une couverture insuffisante par le prior. Pour les politiques génératives, les auteurs montrent que la multimodalité est bornée par la constante de Lipschitz du transport entre espace de base et espace d'action : une carte lisse ne peut pas distribuer de probabilité substantielle sur plusieurs modes bien séparés sans introduire des transitions brutales dans l'espace de base ou des régions de pont hors support en espace d'action. Ces mécanismes sont validés sur des tâches synthétiques multimodales et des benchmarks de simulation robotique. Ces résultats donnent aux équipes déployant des politiques d'imitation une grille de diagnostic concrète. En manipulation industrielle, où un préhenseur peut légitimement atteindre un objet depuis plusieurs angles, comprendre pourquoi un modèle s'effondre sur certains modes est directement actionnable : le coefficient bêta d'un VAE de type ACT, souvent ajusté empiriquement par tâtonnement, dispose maintenant d'une interprétation formelle. Pour les politiques de diffusion, la contrainte de Lipschitz suggère que la capacité à couvrir plusieurs modes dépend de l'expressivité du réseau de transport, avec un compromis explicite entre lissage et richesse modale. C'est un verrou théorique central pour le déploiement en production, où les observations ambiguës sont la règle plutôt que l'exception. L'apprentissage par imitation connaît un regain d'intérêt majeur depuis 2023, porté par ACT et Diffusion Policy, puis par des architectures plus récentes comme pi-0 (Physical Intelligence, 2024) et GR00T N2 (NVIDIA, 2025), aujourd'hui au coeur des pipelines d'entraînement des robots humanoïdes chez Figure AI, 1X et Agility Robotics. Malgré leurs succès en démonstration, la multimodalité reste l'un des verrous majeurs du sim-to-real et du passage en production à grande échelle. Cette étude, de nature purement théorique, ne propose pas d'architecture clé en main, mais son cadre analytique devrait orienter les prochains choix de conception et les stratégies de collecte de données pour les tâches à haute ambiguïté gestuelle.

RecherchePaper
1 source
Apprentissage par renforcement en boucle fermée pour le contrôle de forme de microfibres déformables par transfert simulation-réel
3360arXiv cs.RO 

Apprentissage par renforcement en boucle fermée pour le contrôle de forme de microfibres déformables par transfert simulation-réel

Des chercheurs ont publié sur arXiv (référence 2605.21688) une approche d'apprentissage par renforcement sim-to-real en boucle fermée pour le contrôle de forme de microfibres déformables. Le système cible la micromanipulation de contact, en l'occurrence des microfibres de soie de 50, 80 et 120 µm de diamètre, sur des longueurs manipulées de 10, 15 et 20 mm. La politique de contrôle est entraînée exclusivement dans un simulateur sans frottement, puis transférée directement vers un système physique à double préhenseur tournant à 40 Hz, sans réentraînement ni adaptation de domaine. Sur 24 configurations initiales variées et 9 spécimens couvrant toutes les combinaisons de diamètres et de longueurs, le système atteint une erreur moyenne de forme de 270 ± 80 µm, soit systématiquement sous le millimètre. Ce résultat est significatif parce qu'il démontre que le problème du sim-to-real gap n'exige pas forcément une modélisation fine des interactions de surface à l'échelle microscopique. Le tour de force consiste à ne pas chercher à éliminer le mismatch entre simulation et réalité, mais à le rendre observable et corrigeable via le retour visuel en temps réel. Pour les intégrateurs travaillant sur la microassemblage, le placement de composants biologiques, ou la manipulation de fibres dans des procédés textiles ou médicaux, cela ouvre la voie à des systèmes qui généraliseraient à de nouveaux matériaux sans recalibration systématique. La robustesse démontrée sur des spécimens de géométries variées, sans réglage par spécimen, constitue un signal concret que le pipeline est viable au-delà du cadre lab. La micromanipulation robotique basée sur la vision souffre depuis longtemps d'un manque de méthodes capables de gérer les forces capillaires, adhésives et de frottement à l'échelle sub-millimétrique, que les simulateurs classiques ignorent. Les approches dominantes s'appuyaient sur des modèles physiques analytiques ou du domain randomization intensif, deux stratégies coûteuses à paramétrer. Ce travail positionne l'apprentissage par renforcement avec retour visuel comme une alternative compétitive, potentiellement transférable à d'autres objets déformables (cathéters, fils chirurgicaux, câbles fins). Les prochaines étapes probables incluent la validation sur des matériaux non-soyeux, l'extension à des fibres plus courtes ou plus rigides, et l'intégration dans des pipelines de microassemblage multi-étapes.

RecherchePaper
1 source
SONIC : un système de suivi du mouvement étendu pour le contrôle corporel intégral des humanoïdes
3361arXiv cs.RO 

SONIC : un système de suivi du mouvement étendu pour le contrôle corporel intégral des humanoïdes

Des chercheurs présentent SONIC (arXiv:2511.07820), un modèle fondateur pour le contrôle corporel complet de robots humanoïdes, construit autour d'une mise à l'échelle agressive le long de trois axes : la capacité réseau (de 1,2 million à 42 millions de paramètres), le volume de données (plus de 100 millions de frames issues de 700 heures de capture de mouvement) et le calcul (21 000 heures GPU). La tâche centrale est le suivi de mouvement (motion tracking), utilisé comme proxy d'entraînement pour inculquer des priors sur le mouvement humain sans ingénierie manuelle de récompenses. Deux applications aval sont démontrées : un planificateur cinématique temps réel reliant le suivi de mouvement à des tâches de navigation, et un espace de tokens unifié permettant à une seule politique de gérer à la fois la téléopération VR et des modèles vision-langage-action (VLA). Dans ce second mode, le système réalise de la loco-manipulation autonome en coordonnant simultanément position des mains et des pieds. L'apport principal est d'étendre les lois de scaling, jusqu'ici réservées aux grands modèles de langage, au contrôle humanoïde à corps complet. Les auteurs montrent que les performances progressent de manière régulière avec la quantité de données et le calcul, et que les politiques apprises généralisent à des mouvements non vus à l'entraînement, sans nécessiter de reward shaping manuel. Pour les intégrateurs, l'interface unifiée VR-VLA dans un seul modèle réduit le coût d'adaptation entre téléopération humaine et autonomie. Il convient néanmoins de noter qu'il s'agit d'une publication académique, non d'un produit déployé, et que les démonstrations vidéo sélectionnées ne permettent pas encore d'évaluer la robustesse en conditions industrielles réelles. SONIC s'inscrit dans une course au scaling qui agite l'ensemble de la filière humanoïde. Physical Intelligence a publié Pi-0, un modèle VLA polyvalent ; NVIDIA a lancé GR00T N2 en s'appuyant sur des données synthétiques massives ; Figure et Tesla visent des architectures propriétaires à grande échelle avec Optimus Gen 3. Les 42 millions de paramètres de SONIC restent modestes comparés aux VLA les plus ambitieux, et le travail ne mentionne pas d'affiliation à un fabricant de robot ni de calendrier de déploiement physique. La prochaine étape logique serait une validation sur hardware réel avec des évaluations quantitatives standardisées, un exercice que les benchmarks émergents du secteur commencent tout juste à formaliser.

IA physiqueOpinion
1 source
Apprendre sans perdre son identité : l'évolution des capacités des agents incarnés
3362arXiv cs.RO 

Apprendre sans perdre son identité : l'évolution des capacités des agents incarnés

Des chercheurs ont publié sur arXiv (arXiv:2604.07799) un cadre baptisé "capability-centric evolution paradigm" qui permet aux agents robotiques incarnés d'acquérir continuellement de nouvelles compétences sans modifier leur architecture centrale. Le concept pivot est celui des Embodied Capability Modules (ECMs): des unités modulaires et versionnées de fonctionnalité, qui peuvent être apprises, affinées et composées indépendamment de l'identité cognitive de l'agent. Le processus fonctionne en boucle fermée -- exécution de tâche, collecte d'expérience, raffinement du modèle, mise à jour du module -- le tout supervisé par une couche d'exécution (runtime layer) appliquant en permanence les contraintes de sécurité. En simulation, le taux de réussite des tâches est passé de 32,4% à 91,3% en 20 itérations, avec zéro dérive de politique et zéro violation de sécurité signalées. Le problème adressé est concret: dans les systèmes robotiques à longue durée de vie (entrepôts, manufactures, logistique hospitalière), chaque mise à jour du modèle risque de dégrader des comportements précédemment validés -- un frein majeur au déploiement à l'échelle. En découplant l'identité de l'agent de l'évolution de ses capacités, l'approche ECM ouvre la voie à des mises à jour incrémentales et auditables sans régression. Les performances annoncées surpassent SPiRL et SkiMo, deux méthodes de référence en apprentissage de compétences. Il faut cependant souligner que l'ensemble des résultats est obtenu en simulation uniquement: le franchissement du sim-to-real gap, défi central de la robotique incarnée, n'est pas démontré dans ce travail. Cette recherche s'inscrit dans un courant plus large autour du lifelong learning et de la modularité en robotique, en réponse directe aux limites du fine-tuning de politique classique et du prompt engineering, qui induisent ce que les auteurs nomment une "instabilité d'identité" dans les systèmes durables. Elle dialogue avec les travaux sur les VLA (Vision-Language-Action models) comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, où la question de la mise à jour continue sans régression est également ouverte. Pour les intégrateurs et les décideurs industriels, la prochaine étape déterminante sera la validation sur hardware réel, en environnements non contrôlés, avant toute considération de déploiement.

RecherchePaper
1 source
Pre-VLA : vérification préemptive à l'exécution pour fiabiliser les déroulements de modèles VLA et du monde
3363arXiv cs.RO 

Pre-VLA : vérification préemptive à l'exécution pour fiabiliser les déroulements de modèles VLA et du monde

Une équipe de chercheurs a soumis sur arXiv (réf. 2605.22446, mai 2026) Pre-VLA, une architecture de vérification préemptive conçue pour filtrer les actions de mauvaise qualité générées par les modèles VLA (Vision-Language-Action) avant qu'elles ne soient exécutées physiquement ou simulées dans un world model génératif. Concrètement, Pre-VLA s'intercale comme un garde-fou en amont de l'exécution : il exploite un backbone multimodal avec pooling adaptatif par modalité et une tête dual-branch légère pour prédire à la fois un score de confiance sécuritaire et un advantage score dérivé d'un critique, sur des chunks d'actions candidats. L'entraînement combine trois objectifs simultanés : classification Focal (robuste aux déséquilibres de classes), régression d'avantage, et calibration par seuil souple. À l'inférence, un scheduler de rééchantillonnage dual-mode filtre les actions jugées sous-seuil et déclenche un rééchantillonnage adaptatif dans un budget de calcul contraint. Sur le benchmark LIBERO (quatre suites de tâches en boucle fermée), Pre-VLA améliore le taux de succès moyen de 30,79 % à 37,62 % par rapport au modèle de base RynnVLA-002, réduit le nombre d'étapes d'exécution, et affiche un temps de vérification de 183,9 ms par chunk d'action en moyenne. Le gain de 6,8 points de pourcentage sur LIBERO est notable dans un domaine où les benchmarks en boucle fermée restent difficiles à progresser de façon fiable. La valeur industrielle réelle de Pre-VLA ne réside pas dans la performance brute, mais dans la réduction des échecs physiques coûteux et dans la limitation de l'accumulation d'erreurs dans les rollouts de world models génératifs, dont le coût de rendu est élevé. Pour un intégrateur ou un COO industriel, un tel mécanisme de vérification préemptive représente un levier de fiabilité sans refonte du modèle principal, ce qui est compatible avec des pipelines de déploiement réels. La question non résolue reste la généralisation : LIBERO est un benchmark de manipulation tabletop relativement contrôlé, et les résultats sur des environnements plus chaotiques ne sont pas démontrés ici. Pre-VLA s'inscrit dans une tendance croissante visant à sécuriser les politiques VLA pour le déploiement réel, dans le sillage de modèles comme Pi-0 (Physical Intelligence), OpenVLA ou GR00T N2 (NVIDIA), qui peinent tous à franchir le "demo-to-reality gap". Le benchmark LIBERO, développé par une équipe de l'Université de Washington et Stanford, est devenu une référence standard pour évaluer les politiques d'imitation multi-tâches. RynnVLA-002, le modèle de référence utilisé ici, est un VLA récent dont les détails publics restent limités. Ce travail est un preprint, non encore soumis à peer review, ce qui invite à une lecture prudente des chiffres annoncés. Les prochaines étapes naturelles seraient une validation sur des environnements réels hors laboratoire et une comparaison avec d'autres approches de vérification runtime comme les méthodes basées sur les ensembles de confiance ou la vérification formelle légère.

IA physiqueOpinion
1 source
Imagine2Real : vers l'interaction robot humanoïde-objet sans apprentissage préalable grâce aux priors génératifs vidéo
3364arXiv cs.RO 

Imagine2Real : vers l'interaction robot humanoïde-objet sans apprentissage préalable grâce aux priors génératifs vidéo

Une équipe de chercheurs présente Imagine2Real, un framework zéro-shot pour la manipulation humanoïde d'objets, publié sur arXiv en mai 2026. L'Humanoid-Object Interaction (HOI) en corps entier, soit la capacité d'un humanoïde à interagir physiquement avec des objets en coordonnant l'ensemble de ses degrés de liberté, reste historiquement freinée par la rareté des données 3D haute fidélité. Imagine2Real contourne cette limitation en s'appuyant sur des vidéos génératives comme priors de mouvement, sans recourir à des modèles CAO explicites. Les déplacements du robot et des objets sont formalisés comme des trajectoires 4D en points discrets. Un module appelé Keypoints Tracker suit uniquement trois repères critiques (base, mains, objet), court-circuitant le retargeting morphologique, source classique d'amplification d'erreurs. Pour maintenir des allures naturelles malgré ces signaux épars, le système exploite l'espace latent d'un Behavior Foundation Model (BFM), un modèle de fondation entraîné sur des comportements locomoteurs. Une stratégie d'entraînement progressive complète le pipeline, permettant un déploiement physique zéro-shot en environnement de capture de mouvement (mocap). Le travail s'attaque à deux verrous documentés dans la littérature : le "Representation Misalignment", décalage entre les priors géométriques et la réalité physique du robot, et la "Retargeting Complexity", difficulté d'adapter des mouvements humains à une morphologie robotique différente. En réduisant le retargeting à trois points-clés et en supprimant la dépendance aux modèles CAO, Imagine2Real compresse le pipeline de données nécessaire pour générer de nouveaux comportements. Le zéro-shot démontré en déploiement physique, et non uniquement en simulation, distingue la contribution des approches antérieures. Pour un intégrateur ou un décideur industriel, l'enjeu est clair : bootstrapper de nouvelles compétences de manipulation sans dataset 3D dédié ni séquences mocap par tâche. Imagine2Real s'inscrit dans un courant de recherche exploitant les video diffusion models comme source de connaissance pour la robotique, en parallèle des travaux de Physical Intelligence (pi0, pi0-FAST), de NVIDIA (GR00T N2) et des approches VLA de Google DeepMind. La distinction revendiquée est l'abandon des priors géométriques là où les méthodes concurrentes les jugent incontournables. Aucun partenaire industriel ni calendrier de déploiement réel n'est mentionné dans ce preprint : il s'agit d'une contribution de recherche fondamentale, dont les suites naturelles incluront l'extension à des catégories d'objets plus larges et une validation hors environnement mocap contrôlé.

RechercheOpinion
1 source
Au-delà des pixels : apprendre des récompenses invariantes pour la robotique réelle à partir de quelques démonstrations
3365arXiv cs.RO 

Au-delà des pixels : apprendre des récompenses invariantes pour la robotique réelle à partir de quelques démonstrations

Des chercheurs ont publié fin mai 2026 (arXiv:2605.22123) un framework permettant d'apprendre des fonctions de récompense symboliques invariantes à partir de seulement cinq démonstrations pour des tâches de manipulation robotique. Le système repose sur deux composants couplés : une formulation structurelle de récompense encodant des stratégies de niveau tâche et des contraintes physiques, et une procédure hybride symbolique-numérique qui distille des invariants comportementaux depuis ces démonstrations sans requérir d'interaction en ligne avec l'environnement. La méthode a été évaluée sur huit tâches du benchmark Meta-World et trois tâches de manipulation sur bras Franka, affichant de meilleures capacités d'alignement procédural et de classement de rollouts de politique par rapport aux baselines existantes. Trois expériences réelles out-of-distribution valident une généralisation zero-shot à des variations de position, de point de vue caméra et d'instances d'objets inédites. Le problème adressé est structurel : les modèles de récompense basés sur la vision tendent à mémoriser des distributions de pixels spécifiques et s'effondrent dès que les conditions visuelles changent, qu'il s'agisse d'un objet déplacé, d'un angle de caméra différent ou d'une variante d'objet inconnue. Pour un intégrateur déployant un système de manipulation en milieu industriel, cela impose de recollectecter des démonstrations ou de réentraîner le modèle à chaque variation du contexte opérationnel. Le passage aux invariants symboliques, c'est-à-dire des propriétés comportementales constantes indépendamment de l'apparence visuelle, propose une représentation de récompense réutilisable sur de multiples variantes de tâche sans interaction supplémentaire, ce qui réduit significativement le coût itératif du déploiement en apprentissage par renforcement. Ce travail s'inscrit dans une dynamique de recherche active visant à résoudre le goulot d'étranglement du reward engineering en RL robotique. Les approches récentes fondées sur des embeddings visuels issus de VLMs, comme VIP ou RoboCLIP, ont progressé sur la généralisation visuelle mais restent fragilisées par les variations de distribution en dehors des conditions d'entraînement. La méthode proposée se distingue en substituant aux embeddings bruts une abstraction symbolique de la tâche. Des laboratoires comme Berkeley BAIR, Stanford ou le CMU Robotics Institute travaillent sur des directions similaires d'abstraction pour le RL. La capacité à bootstrapper une récompense généralisable depuis cinq démonstrations seulement ouvre la voie à des pipelines de fine-tuning robotique plus accessibles, potentiellement utilisables par des intégrateurs sans expertise RL avancée.

RecherchePaper
1 source
Action par primitives visuelles
3366arXiv cs.RO 

Action par primitives visuelles

Une équipe de chercheurs a publié en mai 2026 sur arXiv (réf. 2605.22183) AVP, Action with Visual Primitives, une nouvelle architecture end-to-end pour la manipulation robotique généraliste. Le système repose sur une séparation explicite des responsabilités : le modèle de vision-langage (VLM) infère l'état cible de la prochaine étape et génère des tokens dits "visuels primitifs", qui conditionnent ensuite un module d'action basé sur le flow matching, supervisé par la cinématique de l'effecteur final. Sur des tâches réelles de pick-and-place, AVP améliore le taux de succès de 27,61 % par rapport à pi0.5, le modèle de référence de Physical Intelligence, avec des gains mesurés en efficacité de données, en généralisation spatiale et compositionnelle, ainsi qu'en transfert à de nouveaux objets. L'enjeu central que pointe ce travail est celui de l'enchevêtrement des objectifs d'apprentissage dans les VLA actuels : dans les architectures dominantes, compréhension du langage, analyse spatiale de la scène et contrôle moteur sont fondus dans un seul passage forward, forçant le module d'action à réapprendre des capacités perceptives déjà présentes dans le VLM préentraîné. AVP découple ce pipeline via une interface à base de tokens visuels primitifs, ce qui réduit la redondance d'apprentissage et améliore l'efficacité des données d'entraînement, un facteur critique dans un domaine où la collecte de démonstrations robotiques reste coûteuse. L'amélioration de 27,61 % sur pi0.5, si elle se confirme sur des benchmarks plus larges, représente un écart significatif pour des intégrateurs industriels qui évaluent des solutions de manipulation flexible. Les modèles VLA ont connu une accélération notable depuis 2024 avec l'émergence de pi0 et pi0.5 (Physical Intelligence), GR00T N2 (NVIDIA) et Helix (Figure AI), tous positionnés sur la manipulation généraliste. La tendance dominante jusqu'ici consistait à empiler VLM et head d'action en bout de chaîne, héritant des représentations visuelles sans structuration intermédiaire. AVP propose une voie alternative en introduisant une représentation symbolique intermédiaire, les visual primitives, comme pont entre perception et action. Le papier reste un preprint sans validation externe à ce stade ; les expériences sont conduites sur des tâches de pick-and-place, ce qui limite la portée des conclusions à des scénarios de manipulation relativement contraints. Les prochaines étapes naturelles seront une extension à des tâches à longue horizon temporel et une comparaison sur des benchmarks standardisés comme LIBERO ou Open X-Embodiment.

IA physiqueOpinion
1 source
Des politiques de mouvement géométrique sûres et pilotables pour la manipulation dextérique robotique
3367arXiv cs.RO 

Des politiques de mouvement géométrique sûres et pilotables pour la manipulation dextérique robotique

Des chercheurs de Stanford (TML, Tamara Manipulation Lab) ont publié sur arXiv (arXiv:2605.21811) un cadre mathématique baptisé SafePBDS (Safe Pullback Bundle Dynamical Systems) destiné à la manipulation dextre robotique. Le système opère sur des espaces géométriques hétérogènes simultanément : une configuration en R^7 pour le bras, des poses d'effecteur en SE(3), et des marges d'évitement d'obstacles en R. Validé sur une plateforme Franka Panda avec main Allegro à 23 degrés de liberté, SafePBDS atteint 92,5 % de succès sur 120 essais de saisie couvrant 20 objets du quotidien. Une interface d'action permet en outre d'exclure n'importe quel doigt de la préhension via une action unidimensionnelle, avec 94,4 % de succès en saisie à trois doigts sur 36 essais. Plus significatif encore : les auteurs revendiquent la première réorientation in-hand palm-down entièrement actionnée et basée sur un modèle, atteignant plus de 360° de rotation en lacet dans les deux sens, sous différents poids d'objet et mouvements de poignet. La contribution centrale de SafePBDS est double. D'abord, une construction de "pullback control barrier function" qui convertit les conditions de sécurité définies sur n'importe quelle variété tâche en contraintes linéaires sur les accélérations en espace de configuration, ce qui permet des garanties de sécurité certifiables, pas seulement empiriques. Ensuite, une interface d'action qui laisse une politique de haut niveau (un VLA, un planificateur, un opérateur humain) injecter des résidus de mouvement de faible dimension, sans jamais violer les contraintes de sécurité. Entrée nulle = comportement autonome préservé. Ce découplage entre planification stratégique et contrôle précis répond à un problème récurrent des architectures VLA : la difficulté à garantir formellement la sécurité physique lors de la phase d'exploration en monde réel. Le travail s'inscrit dans une tradition de dynamical systems pour la manipulation, prolongeant des approches comme les DS-based motion policies de l'EPFL et les travaux de Riemannian motion policies (RMP). Les concurrents directs incluent les méthodes d'apprentissage par imitation avec contraintes CBF (type Berkeley Humanoid, Physical Intelligence pi0) et les architectures modèle-libre qui sacrifient les garanties formelles à la généralisation. SafePBDS reste pour l'instant un résultat de laboratoire sur preprint non relu par les pairs, validé en simulation et sur banc de test mono-robot. Les prochaines étapes annoncées pointent vers l'intégration avec des politiques d'apprentissage de haut niveau et la généralisation à d'autres morphologies de mains.

RecherchePaper
1 source
Mémoire spatiale pour la manipulation hors champ de vision dans les modèles VLA
3368arXiv cs.RO 

Mémoire spatiale pour la manipulation hors champ de vision dans les modèles VLA

Une équipe de chercheurs a publié en mai 2026 (arXiv:2605.22283) SOMA, un framework de mémoire spatiale conçu pour résoudre un angle mort structurel des modèles Vision-Language-Action (VLA) : leur incapacité à manipuler des objets hors du champ visuel. Le système s'appuie sur une caméra de tête mobile pour acquérir des observations multi-vues, qu'il agrège en une représentation spatiale et sémantique persistante. SOMA repose sur trois modules : une construction de mémoire spatiale par balayage angulaire, un raffinement dynamique pour maintenir la cohérence globale au fil du temps, et une récupération contextuelle qui active les indices spatiaux pertinents à l'instruction en cours d'exécution. Les chercheurs l'ont évalué sur cinq tâches réelles de manipulation hors champ, incluant des scénarios multi-étapes et à deux bras où les objets cibles sont initialement invisibles. Les résultats montrent une amélioration du taux de succès, une localisation plus rapide des cibles, moins de recherche de point de vue, et un comportement proche du "one-shot grasping" en conditions d'observabilité partielle. Des expériences complémentaires sur les benchmarks RoboCasa GR1 et SimplerEnv confirment l'efficacité du design mémoire en contexte pleinement observable. Ce travail s'attaque à un verrou souvent ignoré dans la littérature VLA : l'hypothèse implicite que tous les objets pertinents sont dans le champ de vision au moment de l'action. Cette hypothèse rend les systèmes actuels fragiles dès qu'on sort des configurations de démonstration. Le fait que SOMA induise des comportements qualitativement différents, et non de simples gains de score, est notable : une localisation en quasi-une-passe sous observabilité partielle est un résultat concret pour tout intégrateur robotique travaillant en environnement non structuré. Cela suggère que la mémoire spatiale persistante peut s'ajouter comme couche modulaire à un VLA existant, sans refonte complète de l'architecture, ce qui abaisse le seuil d'adoption. Les VLAs ont émergé comme approche dominante en robotique de manipulation depuis fin 2023, portés par Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA, et OpenVLA issu de Stanford et Berkeley. Ces modèles héritent de l'architecture vision-langage mais restent fondamentalement réactifs : ils traitent un flux visuel instantané sans mémoire de scène. Des travaux parallèles sur la mémoire épisodique existent en navigation mobile (méthodes SLAM-like, NeRF tactique), mais leur intégration dans des pipelines VLA de manipulation reste peu explorée. SOMA comble ce gap sur une plateforme à bras réel. Le code n'est pas encore disponible au moment de la publication, ce qui limite la reproductibilité immédiate ; son déploiement sur d'autres plateformes humanoïdes, au-delà de GR1, constituera l'étape de validation industrielle clé.

RechercheOpinion
1 source
CoRMA : RMA contrastive pour la méta-adaptation aux tâches riches en contacts
3369arXiv cs.RO 

CoRMA : RMA contrastive pour la méta-adaptation aux tâches riches en contacts

Une équipe de recherche a publié CoRMA (Contrastive Robotic Motor Adaptation), un framework de méta-adaptation pour robots manipulateurs confrontés à des tâches d'assemblage à contact intense, insertion de goupille (PegInsert), engrenage (GearMesh) et vissage d'écrou (NutThread). CoRMA étend RMA (Rapid Motor Adaptation), une architecture initialement développée pour la locomotion, en remplaçant l'adaptation brute aux paramètres simulateur par un contexte de contact sémantique compact en six dimensions. Ce vecteur 6D encode cinq états discrets du contact : déclenchement, engagement latéral, transition guidée, direction de force, et blocage par coincement (jamming). Un adaptateur Transformer causal déployable infère ce contexte en ligne à partir des historiques de force, de proprioception et d'actions, sans démonstrations humaines, sans entrées privilégiées ni mise à jour de gradient au déploiement. Les évaluations ont été conduites dans Isaac Lab / Isaac Sim 5.0 et validées sur un bras réel Marvin, en comparaison directe avec les baselines FORGE. Le résultat central est que CoRMA maintient un taux de succès réel supérieur aux baselines FORGE sous bruit contrôlé sur la pose cible, alors que ces baselines obtiennent des scores élevés en simulation mais se dégradent significativement au passage sur hardware. Ce résultat adresse directement l'un des problèmes structurels de l'assemblage robotique industriel : le sim-to-real gap sur les tâches à contact fin, où les forces de contact ne se transfèrent pas fidèlement depuis le simulateur. L'inférence sémantique du contact comme interface d'adaptation réutilisable est une piste directement exploitable par les intégrateurs travaillant sur des familles de tâches d'assemblage proches, sans nécessiter de recalibration ou de données terrain supplémentaires. RMA a originellement démontré sa valeur en locomotion quadrupède chez Berkeley et CMU ; l'extension aux manipulateurs en contact forcé est une direction suivie par plusieurs groupes, dont ceux travaillant sur des politiques de type VLA (Vision-Language-Action) ou sur l'apprentissage par imitation pour l'assemblage. La comparaison avec FORGE situe CoRMA dans un espace concurrent actif. Les auteurs reconnaissent que la généralisation à des tâches hors de la famille d'assemblage testée et la calibration Real2Sim restent des travaux futurs, ce qui limite pour l'instant la portabilité directe en production industrielle.

RecherchePaper
1 source
SE3Kit : une bibliothèque Python légère pour les primitives géométriques spécialisées en robotique
3370arXiv cs.RO 

SE3Kit : une bibliothèque Python légère pour les primitives géométriques spécialisées en robotique

Une équipe de chercheurs a publié SE3Kit sur arXiv (identifiant 2605.22633), une bibliothèque Python légère dédiée aux opérations géométriques sur les groupes de Lie SE(3) (groupe euclidien spécial, qui encode rotations et translations rigides en 3D) et SO(3) (groupe orthogonal spécial, rotations pures). L'implémentation est entièrement en Python pur avec NumPy comme unique dépendance, sans recours à des frameworks de deep learning ni à des outils de visualisation. Les cas d'usage ciblés sont le déploiement embarqué (systèmes à ressources contraintes), le prototypage rapide et l'enseignement de la robotique. L'écosystème Python de robotique souffre d'un vide bien documenté : les bibliothèques existantes tombent dans deux catégories extrêmes. D'un côté, SpatialMath et PyPose offrent de la rigueur mathématique mais embarquent des dépendances lourdes (PyTorch pour PyPose, notamment) qui les rendent inadaptées aux contextes embarqués ou à l'enseignement. De l'autre, SciPy fournit des outils génériques de rotation sans sémantique robotique explicite ni opérations natives sur les algèbres de Lie. SE3Kit vise l'espace intermédiaire : une implémentation stricte des opérations de groupe (exponentielle, logarithme, adjoint, interpolation géodésique) sans surcoût logiciel. Pour un intégrateur travaillant sur un bras manipulateur ou un système de navigation, cela signifie pouvoir utiliser des primitives mathématiquement correctes sur un microcontrôleur ou dans un notebook pédagogique sans installer un stack complet. La publication arrive dans un contexte où la fragmentation des outils de transformation en robotique Python est un frein récurrent, notamment pour les équipes qui passent de la simulation (ROS/Gazebo, souvent C++) vers des pipelines Python embarqués. SE3Kit n'est pas le premier à tenter ce positionnement : la bibliothèque transforms3d de Matthew Brett et pytransform3d de Alexander Fabisch couvrent un périmètre similaire, mais avec des niveaux variables de rigueur sur les groupes de Lie. La valeur différenciante annoncée de SE3Kit est l'absence totale de dépendances non-NumPy, ce qui reste à vérifier sur des benchmarks indépendants. Aucun déploiement industriel ni partenariat n'est mentionné dans la publication ; il s'agit pour l'instant d'une contribution académique en phase d'annonce.

RechercheOpinion
1 source
Manutention industrielle bi-bras de boîtes par estimation inertielle en ligne et optimisation convexe du torseur
3371arXiv cs.RO 

Manutention industrielle bi-bras de boîtes par estimation inertielle en ligne et optimisation convexe du torseur

Des chercheurs ont déposé en mai 2026 sur arXiv (arXiv:2605.22021) un framework de manutention dual-bras conçu pour la manipulation industrielle de colis dont la masse et le centre de masse sont inconnus à l'avance. Le système s'appuie sur deux composants couplés : une estimation en temps réel des propriétés inertielles de l'objet à partir des torseurs de contact mesurés (forces et moments aux points de préhension), et un optimiseur convexe de type SOCP (second-order cone program, programme conique du second ordre) qui calcule des forces de contact compatibles avec les contraintes de friction, modélisées par des surfaces limites ellipsoïdales. Une étape de raffinement de trajectoire hors-ligne complète le pipeline pour éviter les contacts indésirables entre l'objet et l'environnement en présence de contraintes géométriques. Les expériences ont été réalisées sur un robot dual-bras réel soumis à plusieurs configurations de centre de masse, sans connaissance préalable des propriétés inertielles. L'enjeu est direct pour les intégrateurs en logistique industrielle : les bras robotiques doivent manipuler des colis dont le contenu varie (masse, répartition du poids, centre de gravité décentré), et les approches classiques génèrent glissements, chutes, déviations d'orientation ou serrage excessif endommageant les produits. La contribution principale est de traiter la faisabilité de friction comme une contrainte dure plutôt qu'un objectif de régulation séparé à calibrer, unifiant ainsi slip avoidance et évitement de l'écrasement dans un seul problème d'optimisation. Pour un responsable de ligne de palettisation, cela signifie moins de paramétrage manuel à chaque changement de référence produit et une meilleure robustesse aux variabilités de conditionnement, deux points de friction concrets dans les déploiements actuels. La manipulation dual-bras d'objets à propriétés inertielles inconnues est un problème ouvert depuis plusieurs années, adressé par des approches allant du contrôle en force classique jusqu'à l'apprentissage par renforcement. Plusieurs acteurs commerciaux proposent des cellules dual-bras pour la logistique : ABB avec le YuMi, Fanuc, et des startups comme Apptronik ou Figure AI qui intègrent des manipulateurs dans des plateformes humanoïdes. Ce travail reste au stade de la publication académique en preprint, sans affiliation commerciale identifiée, sans données de cycle time ni de volume de déploiement. Les expériences décrites constituent une preuve de concept sur système réel plutôt qu'un déploiement industriel, et les suites naturelles seraient l'intégration dans des cellules de palettisation ou de dépalettisation automatisées, un marché en forte croissance porté par la pression logistique de l'e-commerce.

RecherchePaper
1 source
Algorithme d'enchères consensuelles à stratégie d'enchère apprise pour systèmes multi-robots
3372arXiv cs.RO 

Algorithme d'enchères consensuelles à stratégie d'enchère apprise pour systèmes multi-robots

Une équipe de chercheurs a publié sur arXiv (ref. 2605.21932) une approche hybride pour l'allocation décentralisée de tâches en flotte robotique : remplacer le mécanisme d'enchères déterministe du CBBA (Consensus-Based Bundle Algorithm) par une politique d'enchères neuronale entraînée par apprentissage par renforcement. Le CBBA, algorithme de référence en coordination multi-robots, garantit une convergence prouvable mais repose sur des fonctions de score heuristiques codées à la main, souvent sous-optimales face à des scénarios complexes. Les auteurs entraînent leur politique avec PPO (Proximal Policy Optimization), en calibrant les récompenses sur la proximité aux solutions globalement optimales obtenues par programmation linéaire en nombres entiers mixtes (MILP). Trois architectures neuronales sont comparées : un Neural Additive Model (NAM), un LSTM et un Set Transformer. Les expériences couvrent plusieurs tailles de flotte et confirment que les politiques apprises améliorent systématiquement la qualité d'allocation par rapport au CBBA classique, tout en conservant une exécution entièrement décentralisée. Le résultat structurellement important est que ce cadre CTDE (Centralized Training, Decentralized Execution) permet aux robots d'enchérir sur des tâches à partir d'observations locales partielles, sans communication globale à l'exécution. Pour les intégrateurs déployant des flottes en entrepôt ou en logistique industrielle, c'est un signal concret : les heuristiques codées manuellement, longtemps standard de fait, peuvent être surpassées par des politiques apprises sans sacrifier les garanties de coordination décentralisée. La capacité à tenir à l'échelle sur différentes tailles de flotte est particulièrement notable, les approches MARL pures souffrant souvent d'une instabilité d'entraînement croissante avec le nombre d'agents. Le CBBA est issu des travaux de Choi et al. (2009) et reste une référence dans les systèmes multi-robots décentralisés, notamment pour les drones et les AMR industriels. L'hybridation RL et algorithmes de coordination classiques s'inscrit dans un axe de recherche actif, face à deux alternatives concurrentes : les approches MARL pures (scalabilité difficile) et les méthodes d'optimisation combinatoire centralisée (inadaptées au temps réel). Cette publication reste une contribution académique sans déploiement annoncé ni partenaire industriel identifié, mais elle pose une base méthodologique pour des flottes hétérogènes plus larges. Les suites naturelles seraient la validation sur robots physiques et l'extension à des contraintes temporelles explicites, comme des tâches avec fenêtres de temps ou des dépendances séquentielles.

RecherchePaper
1 source
GesVLA : représentations gestuelles intégrées pour un modèle vision-langage-action
3373arXiv cs.RO 

GesVLA : représentations gestuelles intégrées pour un modèle vision-langage-action

Des chercheurs ont publié GesVLA, un modèle Vision-Language-Action augmenté d'une modalité gestuelle, dans un preprint arXiv soumis en mai 2026 (arXiv:2605.22812). L'architecture repose sur un double VLM (Vision-Language Model) qui encode les features gestuelles directement dans l'espace latent, permettant aux gestes pointés de la main de participer à la fois au raisonnement de haut niveau et à la génération d'actions motrices. Pour l'entraînement, l'équipe a construit un pipeline de génération de données synthétiques en rendant des modèles 3D de mains sur des images de scènes réelles, produisant des annotations de pointage variées tout en réduisant le sim-to-real gap visuel. Le modèle a été évalué sur plusieurs tâches physiques réelles : manipulation contrôlée de blocs et sélection de produits dans des environnements encombrés. Les expériences montrent une amélioration mesurée de la précision de grounding cible et de l'efficacité de l'interaction humain-robot, particulièrement dans des scènes complexes avec objets similaires. L'apport principal de GesVLA est d'adresser une faiblesse connue des VLA actuels : l'ambiguïté spatiale. Quand plusieurs objets similaires sont présents dans la scène, une instruction textuelle seule (type "prends la bouteille") reste ambiguë. Intégrer le geste de pointage comme modalité parallèle au texte offre un ancrage spatial explicite sans modifier l'interface verbale. L'architecture dual-VLM représente un choix architectural non trivial par rapport aux approches qui traitent les modalités de façon séquentielle. Ce n'est pas la première tentative d'incorporer des signaux humains dans les VLA, mais la formalisation du geste comme modalité de premier rang dans l'espace latent, plutôt qu'en post-processing, est une contribution d'architecture à surveiller pour les intégrateurs qui déploient des cobots en environnements de picking désordonnés. GesVLA s'inscrit dans la vague de recherche post-RT-2 et pi-0 qui cherche à rendre les VLA robustes au-delà du régime de laboratoire. Les modèles concurrents comme OpenVLA (Berkeley), Octo ou RoboFlamingo travaillent essentiellement avec du texte et de la vision, sans modalité gestuelle native. Physical Intelligence (pi) avec pi-0 et Google DeepMind avec RT-2/RT-X restent les références industrielles sur la généralisation des VLA à grande échelle. Le preprint ne mentionne pas de partenariat industriel ni de timeline de déploiement commercial. Les prochaines étapes naturelles seraient une évaluation sur des benchmarks standardisés (LIBERO, Calvin) pour permettre des comparaisons directes, et une intégration sur des plateformes comme Franka ou UR5 au-delà des configurations de démonstration présentées.

IA physiqueOpinion
1 source
HUSKY : système de skateboard humanoïde via contrôle corps entier conscient de la physique
3374arXiv cs.RO 

HUSKY : système de skateboard humanoïde via contrôle corps entier conscient de la physique

Des chercheurs ont présenté sur arXiv (2602.03205) HUSKY, un framework permettant à l'humanoïde Unitree G1 de faire du skateboard de manière stable en conditions réelles. Un skateboard est une plateforme sous-actionnée soumise à des contraintes non-holonomes (le véhicule ne se déplace pas librement dans toutes les directions) dont l'inclinaison est mécaniquement couplée à l'orientation des trucks. HUSKY modélise ce couplage et décompose la tâche en deux phases : poussée du pied au sol et direction par inclinaison du corps (lean-to-steer), reliées par un mécanisme de transition guidé par trajectoire. Les mouvements de poussée sont appris via les Adversarial Motion Priors (AMP), une technique d'imitation générant des gestes naturels à partir de données de référence. Les tests sur le G1 démontrent une navigation agile en environnement réel. Ce travail pointe une limite structurelle des frameworks de contrôle whole-body actuels : ils supposent quasi-unanimement un sol statique et des contacts prévisibles. En modélisant la dynamique du couplage humain-objet, HUSKY montre qu'un humanoïde peut opérer sur un équipement mobile non conventionnel sans recalibration manuelle, ce qui ouvre la voie à des robots capables de manouvrer chariots ou palettes en environnement industriel. L'association d'un modèle physique du sous-système mécanique avec l'apprentissage par imitation constitue une approche plus robuste que les politiques entraînées en simulation pure, et le transfert sim-to-real semble validé sur un scénario concret. Les conditions précises des tests (vitesse, distance, taux d'échec) ne sont pas détaillées dans l'article, ce qui limite l'évaluation objective des performances annoncées. Le Unitree G1, humanoïde à 43 degrés de liberté vendu autour de 16 000 dollars, s'impose comme plateforme de référence pour la recherche en locomotion avancée aux côtés du Boston Dynamics Atlas et de l'Agility Digit. En 2025-2026, la recherche en contrôle whole-body dynamique s'accélère avec Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) et les politiques loco-manipulation développées à Carnegie Mellon. HUSKY se distingue en explorant le couplage avec des véhicules sous-actionnés plutôt que la manipulation d'objets statiques. Il s'agit pour l'instant d'une démonstration de recherche sans déploiement industriel annoncé, et les étapes suivantes naturelles incluent l'extension à d'autres véhicules (trottinette, vélo) ou des scénarios combinant locomotion et manipulation.

RecherchePaper
1 source
EvoScene-VLA : croyances de scène évolutives dans le décodeur d'action pour un contrôle robot par blocs
3375arXiv cs.RO 

EvoScene-VLA : croyances de scène évolutives dans le décodeur d'action pour un contrôle robot par blocs

Une équipe de chercheurs a déposé sur arXiv (réf. 2605.21862) EvoScene-VLA, une nouvelle architecture de contrôle robotique pour les politiques vision-langage-action (VLA) en mode "chunked", où le robot planifie plusieurs gestes à la fois plutôt qu'une seule commande par observation. Sur 31 tâches de manipulation du benchmark RoboTwin, le système atteint 89,1 % de réussite en évaluation fixe (contre 87,2 % pour les baselines) et 88,5 % en évaluation aléatoire (contre 86,1 %). Des tests sur le robot réel Galaxea R1-Lite confirment que l'architecture surpasse l'ensemble des approches comparées. Le mécanisme central est un "préfixe de scène" récurrent : un vecteur compact et géométriquement informé, mis à jour après chaque chunk d'actions, qui transporte l'état de la scène d'un appel au modèle au suivant. L'apport technique comble un angle mort structurel des VLA chunkées actuelles : celles-ci reconditionent chaque séquence d'actions uniquement sur l'observation visuelle instantanée, sans tenir compte des modifications de géométrie induites par les gestes précédents, contacts, occultations ou déplacements d'objets. Les approches spatiales (amélioration de la géométrie par frame) et temporelles (agrégation de frames passées) n'adressent pas ce problème entre les appels au VLM. EvoScene-VLA maintient un prior de scène persistant et mis à jour après chaque action : le modèle fusionne l'observation fraîche avec ce prior, produit le chunk suivant, et génère une mise à jour compacte de la scène. Pour les intégrateurs travaillant sur la manipulation dextre ou les séquences longues, c'est une démonstration que l'architecture du décodeur peut être déterminante, indépendamment du volume de données d'entraînement. Ce preprint s'inscrit dans la vague de recherche post-π0 (Physical Intelligence) et GR00T N2 (NVIDIA), où les VLA passent du stade académique à celui de politiques testées sur hardware réel. Le Galaxea R1-Lite est une plateforme de recherche de la startup chinoise Galaxea Robotics, positionnée comme alternative ouverte aux robots de labo propriétaires. La publication ne mentionne ni partenaire industriel ni calendrier de déploiement commercial : il s'agit d'une contribution académique, pas d'une annonce produit. Les gains restent modestes en valeur absolue, autour de deux points sur RoboTwin, et les deux modules d'entraînement auxiliaires (Scene Predictor et Geometric Anchor) sont abandonnés à l'inférence, signe d'une conception orientée efficacité au déploiement. La prochaine étape naturelle serait une évaluation sur des tâches out-of-distribution ou en environnement industriel non structuré.

IA physiqueOpinion
1 source
Voler ensemble : contrôle partagé immersif à guidage humain pour équipes de robots aériens en milieu inconnu
3376arXiv cs.RO 

Voler ensemble : contrôle partagé immersif à guidage humain pour équipes de robots aériens en milieu inconnu

Des chercheurs ont présenté dans un preprint arXiv (2605.21680) un cadre de contrôle partagé en réalité virtuelle pour équipes de drones évoluant en environnements inconnus et contraints. Le système repose sur un planificateur à primitives de mouvement guidé par l'opérateur, qui calcule en temps réel des trajectoires continues sans collision tout en intégrant les inputs humains. Un contrôleur d'admittance permet à l'opérateur d'influer sur le comportement de la flotte sans prendre le contrôle direct de chaque appareil : il positionne des "points de migration" via un casque VR, et les drones les atteignent de manière coordonnée. L'interface est bilatérale, l'opérateur recevant un retour visuel immédiat de l'état de l'équipe. Le système a été validé en configuration mixte, combinant drones physiques et drones simulés dans le même environnement de réalité étendue. Les résultats expérimentaux montrent une meilleure évitement des obstacles, un espacement inter-agents maintenu, et une réduction de la charge cognitive opérateur. Ce travail s'attaque à une limite bien connue des systèmes multi-robots autonomes : leur rigidité face à des situations non prévues dans l'environnement opérationnel. Là où un planificateur purement autonome peut rater une zone d'intérêt ou bloquer sur une ambiguïté sémantique, le "human-in-the-loop" permet de ré-orienter l'exploration sans reprendre le contrôle à bas niveau. Le contrôleur d'admittance est la pièce centrale : il absorbe les intentions de l'opérateur comme une compliance mécanique, évitant les commandes brusques tout en préservant la cohérence de la flotte. Pour les intégrateurs industriels ou les opérateurs de drones en inspection d'infrastructures, c'est une architecture qui réduit le nombre d'opérateurs requis tout en maintenant une supervision humaine significative. Le contrôle partagé homme-robot est un champ de recherche actif depuis une décennie, mais son application aux flottes de drones en VR reste émergente. Les approches concurrentes vont des interfaces haptiques monorobot aux systèmes d'autonomie à niveaux (SAE-like pour l'aérien) développés par des équipes comme celle de GRASP Lab (UPenn) ou ETH Zurich. Ce preprint n'annonce pas de déploiement commercial ni de partenariat industriel identifié : il s'agit d'une démonstration de faisabilité académique. Les prochaines étapes logiques seraient une validation à plus grande échelle de flotte (l'article ne précise pas le nombre exact de drones testés) et des scénarios opérationnels réels, notamment search-and-rescue ou inspection de bâtiments.

RecherchePaper
1 source
Symétries ici et là, combinées partout : compositions inter-espaces en robotique
3377arXiv cs.RO 

Symétries ici et là, combinées partout : compositions inter-espaces en robotique

Des chercheurs ont soumis fin mai 2026 sur arXiv (arXiv:2605.22639) un framework baptisé "cross-space symmetry compositions", conçu pour apprendre des politiques robotiques exploitant simultanément plusieurs symétries géométriques. L'approche a été validée sur un robot à deux bras (dual-arm), en simulation et sur hardware réel, sur des tâches de manipulation. Le principe : plutôt que de traiter isolément les symétries de l'espace de configuration (angles articulaires) et celles de l'espace de tâche (position et orientation de l'effecteur), le framework les compose dans un espace de représentation unifié. Les auteurs s'appuient sur la structure différentielle-géométrique de la cinématique directe (forward kinematics map) pour "descendre" des symétries de l'espace de configuration vers l'espace de tâche, ou les "remonter" en sens inverse. L'enjeu pour les équipes R&D en manipulation robotique est direct : les réseaux de neurones équivariants, qui respectent par construction les symétries du problème, requièrent moins de données d'entraînement et généralisent mieux à des configurations non vues. Jusqu'ici, la plupart des approches exploitaient une seule symétrie à la fois (par exemple la SO(2)-équivariance dans le plan horizontal pour la manipulation en table-top), laissant des gains de généralisation inexploités. Les résultats expérimentaux confirment une amélioration sur les tâches de manipulation testées, bien que les marges précises et les volumes de données requis ne soient pas détaillés dans le résumé public. Les équipes travaillant en imitation learning ou sur des architectures VLA (Vision-Language-Action) sont directement concernées par cette piste. Ce travail s'inscrit dans un courant actif autour des réseaux équivariants en robotique, adossé aux formalismes de groupes de symétrie en deep learning (SO(2), SE(3), E(n)). La contribution spécifique réside dans la composition inter-espaces plutôt que dans l'équivariance dans un seul espace. Il s'agit à ce stade d'une publication académique sans code public annoncé, et les expériences portent sur un seul système dual-arm dont la plateforme hardware n'est pas précisée. Les suites naturelles seraient une extension aux robots humanoïdes ou aux plateformes commerciales (bras UR, Franka), ainsi que la mise à disposition du code pour permettre la reproductibilité et une adoption plus large dans la communauté de la robotique apprenante.

RecherchePaper
1 source
Raisonnement d'ordre supérieur pour des opérations collaboratives de robots mobiles sans communication
3378arXiv cs.RO 

Raisonnement d'ordre supérieur pour des opérations collaboratives de robots mobiles sans communication

Des chercheurs présentent un cadre de planification épistémique dynamique permettant à des robots mobiles de se coordonner sans aucun échange de messages entre agents (arXiv:2605.21901). L'architecture repose sur des particules de croyances d'ordre supérieur : chaque robot modélise non seulement l'état du monde, mais aussi ce que ses coéquipiers croient de cet état, et ainsi de suite en cascade. Ces croyances sont mises à jour par inférence bayésienne, et un arbre de comportements sélectionne les actions en anticipant les décisions probables des voisins. Un contrôleur MPPI (Model Predictive Path Integral) temporellement conscient traduit ensuite ce raisonnement en trajectoires basse fréquence adaptées à l'observabilité partielle. Testée en simulation et sur robots physiques, l'approche réduit le temps de complétion des tâches par rapport à une baseline de raisonnement du premier ordre, sans que l'abstract précise la taille des flottes ni les conditions exactes des essais. L'enjeu est direct pour les intégrateurs de flottes d'AMR (Autonomous Mobile Robots) en logistique ou en industrie : les architectures actuelles supposent un orchestrateur central ou un réseau Wi-Fi stable, et toute dégradation du signal dégrade la coordination collective. Un mécanisme de coordination implicite fondé sur la logique épistémique ouvre la voie à des déploiements plus résilients dans des environnements RF-dégradés, souterrains ou à bande passante contrainte. L'approche valide également l'opérationnalisation de la logique épistémique, longtemps cantonnée à l'IA symbolique, dans une boucle de contrôle temps réel sur hardware physique, ce qui n'était pas acquis à cette échelle. La coordination décentralisée sans communication est un problème ouvert depuis les systèmes multi-agents des années 1990, mais son implémentation sur robots réels est restée marginale au profit des solutions centralisées. Les approches concurrentes incluent les champs de potentiel artificiel, l'optimisation distribuée (ADMM, consensus) et l'apprentissage par renforcement multi-agents (MARL). Ce travail se distingue par le couplage inhabituel entre raisonnement épistémique symbolique et contrôle continu par MPPI. Les suites naturelles attendues : une évaluation à plus grande échelle (cinq robots ou plus), des comparaisons directes avec des méthodes MARL de référence, et une analyse de la complexité computationnelle du raisonnement d'ordre supérieur en temps réel, point critique pour un déploiement industriel viable.

RecherchePaper
1 source
Planification de mouvements pour la locomotion dynamique par préhension en microgravité
3379arXiv cs.RO 

Planification de mouvements pour la locomotion dynamique par préhension en microgravité

Des chercheurs ont publié sur arXiv (référence 2605.21704, mai 2026) une étude portant sur la conception de mouvements locomoteurs pour robots multi-membres en microgravité, dans des environnements où les points d'ancrage sont rares et disposés de façon irrégulière. L'approche étudiée repose sur la locomotion par saisie : le robot se déplace en agrippant successivement des ancrages fixes, plutôt qu'en marchant sur un sol stable. Les paramètres de conception analysés incluent le patron de démarche, la longueur de foulée, la vitesse de locomotion et la posture nominale du corps. Un cadre de planification paramétrable a été proposé pour évaluer ces variables en termes de stabilité et de demande en actuation. Deux morphologies quadrupèdes distinctes ont été testées en simulation physique. L'ensemble reste pour l'instant à l'étape de simulation, sans validation sur hardware réel. L'intérêt de cette recherche tient à la difficulté fondamentale de la locomotion hors-gravité : sans réaction au sol, les stratégies classiques de marche sont inopérantes, et le robot doit gérer simultanément des contraintes dynamiques et cinématiques couplées, incluant une manipulation en 6 degrés de liberté pour établir chaque contact. Les résultats indiquent que deux leviers améliorent significativement les performances : élargir l'espace de "contact wrench" faisable, c'est-à-dire maximiser la diversité des forces et couples transmissibles via les points d'appui, et atténuer les dynamiques impulsives de l'ensemble du corps, en évitant les mouvements brusques générateurs d'instabilité. Ces conclusions orientent directement le choix des configurations de contact et les stratégies de coordination corporelle pour de futurs systèmes réels. Ce travail s'inscrit dans un champ en expansion rapide : la robotique spatiale pour maintenance de satellites, exploration d'astéroïdes et interventions sur structures orbitales comme l'ISS. Des acteurs comme le DLR (Centre aérospatial allemand), le JPL-NASA avec ses robots grimpeurs, ou encore l'ESA avec ses programmes de robotique on-orbit, travaillent sur des problématiques adjacentes. La manipulation par saisie en microgravité intéresse aussi des projets d'exploration planétaire à faible gravité (Phobos, petits corps). La prochaine étape logique pour ce type de recherche est la validation expérimentale sur banc de test à gravité réduite ou en orbite, étape que l'étude ne couvre pas encore.

RecherchePaper
1 source
Planification assistée par éclaireur pour équipes de robots hétérogènes en environnements partiellement connus
3380arXiv cs.RO 

Planification assistée par éclaireur pour équipes de robots hétérogènes en environnements partiellement connus

Des chercheurs ont publié sur arXiv (arXiv:2605.22693) un cadre de planification appelé Scout-Assisted Planning (SAP), conçu pour des équipes robotiques hétérogènes évoluant dans des environnements partiellement cartographiés. Le problème ciblé est concret : lorsqu'un robot terrestre (UGV) progresse sur un réseau routier dont certaines voies sont bloquées, il ne le découvre qu'en s'y engageant physiquement, générant des détours coûteux. SAP intègre des drones éclaireurs (UAV) qui collectent de l'information en avance de phase pour guider les UGV. Pour cibler les reconnaissances les plus utiles, les auteurs introduisent l'Information Gain-based Action Pruning (IGAP), un mécanisme qui score chaque action de scouting selon son impact attendu sur le comportement du robot au sol. Comme le calcul exact de l'IGAP est prohibitif en temps réel, un modèle Graph Neural Network (GNN) est entraîné à prédire ces valeurs directement depuis la structure du graphe routier et l'état de croyance courant. Sur trois types d'environnements testés, SAP avec IGAP réduit le coût de déplacement des UGV de 31,9 à 37,7 % par rapport à la baseline Canadian Traveler Problem, et surpasse de 8 à 14 % les approches de guidage par proximité. Ces résultats pointent vers un verrou industriel réel : dans la logistique d'entrepôt, la réponse à sinistre, ou les opérations minières, un robot terrestre contraint de faire demi-tour mobilise du temps machine et perturbe les flux. L'apport de SAP est de rendre la décision de scouting dirigée par la valeur informationnelle plutôt que par la simple distance, un glissement non trivial. L'usage d'un GNN pour approximer l'IGAP est l'élément clé : il ramène le planning à des niveaux temps réel sans dégradation mesurable de la qualité de solution, ce qui ouvre la voie à un déploiement embarqué sur matériel contraint. La distinction entre guidage par information et guidage par proximité, avec 8 à 14 % d'écart, valide quantitativement que la sophistication algorithmique se traduit en gains opérationnels réels. Ce travail s'inscrit dans un courant de recherche actif sur la planification multi-robots hétérogènes, où drones et robots terrestres forment des binômes complémentaires. La formulation s'appuie sur le Canadian Traveler Problem, un cadre classique de navigation sous incertitude, et l'étend avec une couche d'apprentissage automatique. Les acteurs industriels proches de cette problématique incluent Boston Dynamics (Spot + drones), Exotec pour la logistique autonome en entrepôt, ou encore les consortiums de robotique minière australiens. La prochaine étape naturelle serait la validation sur plateforme physique réelle : les expériences rapportées restent simulées, et le sim-to-real gap sur des graphes routiers dynamiques reste un défi non résolu par cet article.

RecherchePaper
1 source
Apprentissage de la collaboration altruiste dans les systèmes multi-équipes hétérogènes
3381arXiv cs.RO 

Apprentissage de la collaboration altruiste dans les systèmes multi-équipes hétérogènes

Des chercheurs ont soumis en mai 2025 sur arXiv (arXiv:2605.21723) un framework d'allocation dynamique de robots entre équipes hétérogènes, où chaque robot constitue une ressource transférable d'une équipe à l'autre en cours de mission. Le mécanisme de décision repose sur la règle de Hamilton, empruntée à la biologie évolutive : un agent "accepte" de quitter son équipe d'origine si le bénéfice collectif pondéré par la relation entre équipes dépasse le coût de transfert. Le problème d'optimisation résultant est combinatoire et démontré NP-difficile. Pour contourner ce verrou de scalabilité, les auteurs proposent une politique fondée sur un réseau de neurones sur graphe (GNN), entraîné en mode centralisé mais exécuté de façon décentralisée (paradigme CTDE, Centralized Training, Decentralized Execution). Le modèle opère sur le graphe d'interaction entre équipes et prédit à la fois les transferts de robots et les réaffectations équipe-par-équipe. La validation s'appuie sur un scénario de lutte contre des incendies simultanés, combinant simulations à grande échelle et expériences physiques réelles, avec des performances proches de l'optimal calculé. Pour les intégrateurs de flottes multi-robots, l'apport principal est la capacité à redistribuer dynamiquement des actifs hétérogènes (robots de capacités différentes) sans coordinateur central en temps réel, ce qui réduit la dépendance à une infrastructure de communication fiable. Démontrer que ce comportement altruiste peut être appris via un GNN et exécuté localement contredit l'idée selon laquelle la coordination complexe entre équipes exige impérativement une optimisation centralisée en ligne. Le passage à l'échelle est validé empiriquement, pas seulement en simulation. Ce travail s'inscrit dans la vague du Multi-Agent Reinforcement Learning (MARL), où CTDE est désormais un paradigme standard avec des baselines comme MAPPO ou QMIX. L'originalité réside dans l'emprunt explicite à l'écologie évolutive comme principe normatif, là où la plupart des approches MARL restent purement empiriques. L'article n'est pas encore évalué par des pairs (preprint arXiv). Aucun acteur industriel n'est impliqué dans cette publication académique, et aucune timeline de déploiement n'est mentionnée. Les prochaines étapes naturelles seraient une validation sur des scénarios industriels réels (entrepôts, chantiers, réponse aux catastrophes) avec des flottes robotiques hétérogènes commerciales.

RecherchePaper
1 source
Parallel OctoMapping : un cadre évolutif pour la planification de trajectoires en navigation autonome
3382arXiv cs.RO 

Parallel OctoMapping : un cadre évolutif pour la planification de trajectoires en navigation autonome

Une équipe de chercheurs a publié sur arXiv (référence 2603.22508v2, mis à jour en mai 2026) une méthode de cartographie baptisée Parallel OctoMapping (POMP), destinée à améliorer la planification de trajectoires dans les systèmes de navigation autonome. POMP s'appuie sur le framework OctoMap, une représentation volumétrique de l'espace libre et occupé largement utilisée en robotique mobile. La contribution centrale consiste à raffiner la représentation de l'espace libre à résolution de grille d'occupancy fixe, tout en préservant la fidélité de la carte et en exploitant le calcul multi-thread. Les auteurs soutiennent, sous réserve de vérification indépendante, qu'il s'agirait de la première méthode à combiner ces deux propriétés à résolution constante. L'enjeu pratique concerne directement les intégrateurs de robots mobiles et les déploiements AMR (Autonomous Mobile Robots) en environnements encombrés. Les méthodes classiques à résolution fixe produisent des représentations d'obstacles trop conservatives, ce qui génère soit des trajectoires sous-optimales, soit des échecs de planification dans des espaces denses. POMP prétend améliorer simultanément le taux de succès de la planification et la longueur des chemins calculés, tout en réduisant substantiellement le coût computationnel grâce au parallélisme. Si ces gains se confirment sur des benchmarks indépendants, la méthode pourrait s'insérer dans des pipelines existants utilisant des planificateurs A* ou équivalents, sans refonte architecturale majeure. OctoMap est un standard de facto dans la navigation robotique depuis les travaux d'Hornung et al. (2013), massivement adopté dans ROS et ROS2 pour les drones, véhicules autonomes et robots d'entrepôt. POMP se positionne comme une extension drop-in plutôt qu'un remplacement, ce qui réduit la barrière à l'adoption. Sur le plan académique, la cartographie haute performance mobilise également des approches concurrentes comme VDB-EDF (NVIDIA), les représentations neurales implicites de type NeRF-Nav, ou les grilles probabilistes hiérarchiques. À ce stade, POMP reste un preprint non évalué par les pairs, sans implémentation open source ni benchmark standardisé publiquement référencé dans l'abstract disponible.

RecherchePaper
1 source
Combler les lacunes : couverture ergodique multi-robot guidée par rétroaction en environnements inconnus
3383arXiv cs.RO 

Combler les lacunes : couverture ergodique multi-robot guidée par rétroaction en environnements inconnus

Des chercheurs ont soumis fin mai 2026 sur arXiv (2605.21719) un framework de couverture adaptative multi-robot intitulé "Mind the Gaps", conçu pour des environnements dont la distribution d'information est inconnue a priori. La méthode repose sur la recherche ergodique : les trajectoires des robots sont optimisées pour que leur distribution spatiale temporelle soit proportionnelle à la densité d'information perçue dans l'environnement. La nouveauté consiste à intégrer un retour en temps réel depuis un modèle paramétrique mis à jour en ligne, permettant de recalculer dynamiquement les zones cibles et de réallouer les agents vers les régions d'intérêt prioritaires. Les validations présentées sont exclusivement en simulation, sans déploiement sur hardware réel. L'obstacle classique des méthodes ergodiques est qu'elles supposent une distribution d'information connue a priori -- une hypothèse irréaliste pour l'inspection industrielle, la surveillance environnementale ou le search-and-rescue. Ce framework élimine ce prérequis en construisant la carte d'intérêt à la volée, concentrant les ressources là où l'incertitude est la plus élevée. Pour un intégrateur déployant des AMR sur un site diffus -- détection de fuites, cartographie de polluants, inspection de grandes surfaces -- cela réduit le nombre d'agents nécessaires et évite les cycles gaspillés sur des zones déjà bien caractérisées. La méthode suppose toutefois un environnement statique ou à évolution lente par rapport à la dynamique des robots, ce qui en limite l'applicabilité aux environnements hautement dynamiques. La recherche ergodique multi-robot s'appuie sur les travaux fondateurs de Mathew et Mezić (2011) et les développements de l'équipe Murphey à Northwestern. Les approches concurrentes -- exploration par frontières et processus gaussiens (GP-UCB) -- offrent une quantification d'incertitude plus explicite mais souffrent d'une complexité de calcul cubique avec le nombre d'observations. Ce papier positionne les méthodes ergodiques comme plus scalables pour de grandes flottes, sans toutefois proposer de comparaison quantitative directe. La validation limitée à la simulation laisse ouverte la question du sim-to-real gap, notamment pour les dynamiques de communication inter-agents à faible bande passante. Aucun partenariat industriel ni timeline de transfert technologique n'est mentionné.

RecherchePaper
1 source
Robots de soudage collaboratifs : le cheval noir qui redessine l'automatisation du soudage en Chine
3384Pandaily 

Robots de soudage collaboratifs : le cheval noir qui redessine l'automatisation du soudage en Chine

En six ans, les robots de soudage collaboratifs ont opéré une percée notable en Chine, passant du stade expérimental en 2020 à une solution d'automatisation largement déployée en 2026. Ces cobots se distinguent par leur aptitude à fonctionner aux côtés des opérateurs sans barrières de sécurité physiques, combinée à une planification de trajectoire adaptative qui réduit les temps de programmation par rapport aux robots industriels classiques. L'adoption a été tirée par la hausse structurelle des coûts salariaux et par une demande accrue en qualité de soudure dans les secteurs automobile, naval et des équipements lourds. Plusieurs acteurs domestiques chinois auraient atteint le premier rang technologique, concurrençant directement les marques internationales sur prix et performance. Des analystes sectoriels projettent une part de marché supérieure à 30 % dans le segment mid-market de la soudure d'ici deux ans, à mesure que les prix unitaires continuent de baisser, bien qu'aucune source indépendante ne soit citée à l'appui de cette projection. L'enjeu principal est de combler le déficit structurel de soudeurs qualifiés tout en automatisant des tâches longtemps réservées à la dextérité humaine. La rupture technique clé réside dans des algorithmes de contrôle propriétaires permettant une adaptation rapide à de nouvelles géométries de pièces, ce qui réduit les cycles de déploiement sur ligne. Pour les intégrateurs et les décideurs industriels, cela se traduit par un argument d'amortissement raccourci. Les métriques de cycle time avancées par les constructeurs restent cependant à valider sur données terrain indépendantes, les communications disponibles reposant essentiellement sur des démonstrations contrôlées plutôt que sur des rapports de production réelle. Ce mouvement s'inscrit dans la montée en gamme globale de la robotique chinoise, portée par des acteurs comme JAKA Robotics, Aubo Robotics ou Elite Robots qui réduisent progressivement l'écart avec les références occidentales FANUC, KUKA et ABB. Le soudage collaboratif représente aujourd'hui l'un des cas d'usage les plus matures pour les bras cobots en environnement industriel réel, avec des déploiements documentés dans la construction navale et l'automobile. Les prochaines étapes probables incluent l'intégration de vision 3D pour l'adaptation en temps réel aux variations géométriques des pièces et l'extension vers les marchés émergents d'Asie du Sud-Est, où les pressions sur les coûts de main-d'oeuvre créent des conditions similaires à celles qui ont catalysé l'adoption en Chine.

Chine/AsieOpinion
1 source
Cainiao déploie le robot grimpeur ZeeBot en entrepôt et double sa productivité
3385Pandaily 

Cainiao déploie le robot grimpeur ZeeBot en entrepôt et double sa productivité

Cainiao, la filiale logistique du groupe Alibaba, a officiellement présenté le ZeeBot, un robot d'entrepôt capable de se déplacer au sol et de grimper directement sur les étagères de stockage. Le robot est déjà opérationnel dans l'entrepôt cross-border de Dongguan, en Chine, et entre désormais en phase de déploiement mondial. Cainiao revendique un gain de 100% sur l'efficacité humaine en entrepôt depuis son introduction, sans préciser la baseline de comparaison ni fournir de données de cycle time, de payload ou de hauteur d'étagère supportée, un manque de transparence métrique habituel dans les annonces du secteur. L'intérêt architectural du ZeeBot réside dans la convergence, au sein d'un seul engin, de la mobilité horizontale (typique des AMR de type Kiva/MIR) et de la mobilité verticale (jusqu'ici assurée par des systèmes séparés : navettes de rayonnages, mini-loads ou lifts dédiés). Pour un opérateur logistique, supprimer cette frontière réduit la complexité de flotte, les interfaces de transfert entre systèmes et potentiellement le coût d'infrastructure par unité de volume traité. Cela dit, les robots grimpants impliquent des contraintes mécaniques sévères sur les étagères elles-mêmes, et l'absence de spécifications techniques publiées rend impossible toute évaluation indépendante des performances annoncées. Cainiao opère l'un des réseaux logistiques les plus denses au monde, avec des entrepôts cross-border en Asie, Europe et Amérique, ce qui lui confère une capacité de déploiement à grande échelle peu commune. Sur le créneau des robots d'entrepôt 3D à mobilité verticale, la concurrence est déjà structurée : Hai Robotics (HAIPICK, Chine) commercialise des robots grimpants depuis 2018 sur des milliers de sites ; AutoStore (Norvège) domine le cube storage dense ; et surtout Exotec, la licorne française de Croix, dont le système Skypod permet à ses robots d'évoluer sur des racks jusqu'à 12 mètres de hauteur et est déployé chez Carrefour, Decathlon ou Uniqlo. L'annonce de Cainiao s'inscrit donc dans un marché déjà disputé, où la différenciation passera par les données de performance réelles en conditions industrielles.

Chine/AsieOpinion
1 source
Du chaos à l'ordre : révolution de la fourniture de données et structuration des compétences pour l'IA incarnée
338636Kr 

Du chaos à l'ordre : révolution de la fourniture de données et structuration des compétences pour l'IA incarnée

Lors de la conférence AI+ Industry 2026 de Beijing Yizhuang, Xu Liangwei, CTO et cofondateur de Zhiyu Jishi (智域基石), a exposé un pipeline de compilation de données en cinq couches destiné à l'intelligence incarnée (embodied AI). Son argument central: la loi de mise à l'échelle (Scaling Law) qui sous-tend les grands modèles de langage ne se transfère pas aux robots. Un LLM peut absorber des textes hétérogènes en masse, mais un robot opérant dans le monde physique nécessite des données multimodales couplées dans le temps et dans l'espace, où qualité et traçabilité priment sur le volume brut. Le pipeline de Zhiyu Jishi comprend cinq étapes séquentielles: contrôle qualité des données brutes, alignement spatio-temporel, extraction sémantique et causale (séquence contexte-action-conséquence), traitement à grande échelle avec indexation multi-dimensionnelle, et livraison aux équipes de modèles. Xu Liangwei précise que ce pipeline s'applique indifféremment aux architectures VLA (Vision-Language-Action, apprentissage par imitation) et aux world models, les deux paradigmes convergeant vers le même besoin: des données physiques structurées et tracées. L'enjeu concret pour les intégrateurs et les équipes de modèles est la traçabilité des défaillances terrain. En 2026, certains robots commencent à passer de pilotes laboratoire à des déploiements industriels en petit lot, et les équipes peinent à relier un comportement anormal à un sample d'entraînement défaillant. Xu Liangwei précise que les modèles fixent le plafond de capacité d'un robot, mais que la qualité des données dans les cas d'échec, de reprise et de retry conditionne la fiabilité en environnement dégradé. Sans cette traçabilité bout en bout, la boucle fermée données-modèle-terrain-données ne peut pas converger à l'échelle industrielle, rendant impossible le passage du petit lot à la production réelle. Zhiyu Jishi se positionne dans une niche émergente, les "data foundry" pour l'embodied AI, distincte des services de labeling classiques par la dimension temporelle et multimodale des données robotiques. Le discours de Xu Liangwei s'oppose implicitement au modèle fragmenté actuel, où fabricants de plateformes matérielles, développeurs de modèles et intégrateurs industriels produisent chacun leurs données en silo. Sa proposition est de structurer un écosystème à trois acteurs avec une séparation claire des responsabilités, comparable à une couche d'infrastructure partagée. La présentation ne comporte aucun chiffre de déploiement vérifiable ni de client cité, ce qui la positionne davantage comme une communication de positionnement stratégique que comme un bilan d'exécution. La suite annoncée est l'ouverture de ce pipeline à l'ensemble de l'écosystème robotique chinois, sans calendrier précis communiqué.

Chine/AsieOpinion
1 source
Brain Corp s'associe à l'UC San Diego pour aider les robots à opérer dans des environnements complexes
3387The Robot Report 

Brain Corp s'associe à l'UC San Diego pour aider les robots à opérer dans des environnements complexes

Brain Corp a annoncé cette semaine un partenariat de recherche élargi avec l'Université de Californie à San Diego (UCSD), centré sur le développement d'une couche dite de "contextual grounding" pour robots autonomes. Concrètement, il s'agit d'une représentation numérique intelligente des espaces physiques, permettant à des AMR, drones et véhicules autonomes de comprendre leur environnement en temps réel et d'y réagir de manière adaptative. Le projet est piloté par le Dr. Nikolay Atanasov, directeur de l'Existential Robotics Laboratory au sein du département Electrical and Computer Engineering de la Jacobs School of Engineering. Les deux partenaires ciblent les environnements commerciaux et industriels complexes, là où la variabilité des conditions -- présence humaine, obstructions dynamiques, modifications de layout -- met en échec les approches SLAM classiques. La collaboration s'appuie sur la base opérationnelle de Brain Corp: plus de 50 000 AMR déployés dans le monde et plus de 25 millions d'heures cumulées de fonctionnement sur des sites commerciaux réels, un volume de données terrain que peu d'acteurs académiques peuvent atteindre seuls. L'enjeu industriel est direct. Les modèles vision-language-action (VLA) et les architectures generatives transforment rapidement ce qu'un robot peut faire, mais leur fiabilité en déploiement réel reste le principal frein à la commercialisation à grande échelle. Ce que Brain Corp et l'UCSD tentent de résoudre, c'est précisément le "sim-to-real gap" appliqué à la perception sémantique: un robot capable d'interpréter une scène dans un simulateur ou un environnement contrôlé ne garantit pas la même robustesse dans un entrepôt logistique avec 200 opérateurs humains. La cartographie 3D sémantique, contrairement aux approches purement end-to-end basées sur la vision brute, conserve une représentation structurée de l'espace -- ce qui facilite l'orchestration de flottes hétérogènes et l'intégration de capteurs fixes avec des agents IA mobiles. L'objectif affiché de Brain Corp n'est pas de résoudre une seule tâche robotique, mais de construire une infrastructure de plateforme capable de coordonner ces systèmes à l'échelle enterprise, ce qui positionne BrainOS comme un système d'exploitation pour flottes plutôt qu'un simple firmware d'AMR. Brain Corp, fondée en 2009 et basée à San Diego, a construit sa position sur BrainOS, plateforme d'autonomie embarquée initialement déployée sur des autolaveuses commerciales de marques comme Tennant et Nilfisk. La collaboration avec l'UCSD s'inscrit dans une tendance sectorielle plus large où les éditeurs de logiciels robotiques cherchent à ancrer leur R&D dans des partenariats académiques pour accéder à une recherche fondamentale en perception et mapping -- une stratégie comparable à celle de Boston Dynamics avec le MIT, ou de Agility Robotics avec Oregon State. Les concurrents directs sur le segment de l'orchestration de flottes incluent Fetch Robotics (Zebra Technologies), 6 River Systems (Shopify) et MiR (Teradyne). Le CTO de Brain Corp, John Black, détaillera cette approche lors du Robotics Summit and Expo 2026 à Boston la semaine prochaine. Aucune timeline de déploiement commercial pour cette couche sémantique n'a été communiquée à ce stade.

IndustrielPaper
1 source
FANUC s'associe à Google pour développer l'IA physique dans ses robots
3388Robotics Business Review 

FANUC s'associe à Google pour développer l'IA physique dans ses robots

FANUC Corp. a annoncé cette semaine un partenariat stratégique avec Google visant à accélérer le déploiement de l'IA physique dans ses robots industriels. L'initiative s'appuie sur les technologies d'intelligence artificielle de Google, notamment les grands modèles de langage (LLM), pour doter les robots FANUC de capacités de perception environnementale, de prise de décision autonome et d'exécution adaptative. Mike Cicco, président et CEO de FANUC America, a résumé l'enjeu sans détour : "Les fabricants ne se demandent plus s'ils doivent utiliser l'IA, mais comment l'appliquer là où ça compte le plus, soit sur le sol de l'usine." Depuis la présentation de son système d'IA physique à l'IREX de Tokyo en décembre 2025, FANUC affirme avoir déjà expédié plus de 1 000 robots pour des applications liées à l'IA physique, une donnée qui distingue ce partenariat d'une simple annonce commerciale. La gamme concernée s'étend des petits bras avec une charge utile de 3 kg jusqu'aux robots industriels lourds supportant 2 300 kg, ainsi que la série collaborative CRX. Sur le plan technique, la compatibilité de FANUC avec le standard ROS (Robot Operating System) via des pilotes open-source constitue le socle de l'intégration. La société prend en charge le langage Python pour le développement IA, des interfaces de communication haute vitesse pour le contrôle externe, et des passerelles vers les automates programmables (PLC), ce qui facilite l'insertion dans des lignes de production existantes sans refonte d'architecture. En parallèle, FANUC annonce un resserrement de l'intégration entre son logiciel de simulation ROBOGUIDE et le framework NVIDIA Isaac Sim, un signal fort vers le sim-to-real, l'un des verrous techniques majeurs de la robotique adaptative. Pour les intégrateurs et les décideurs industriels, ce positionnement signifie que les outils IA grand public deviennent directement utilisables sur des cellules robotisées certifiées production, ce qui réduit significativement la distance entre prototype et déploiement réel. FANUC, fondée au Japon et dont la filiale américaine est basée à Rochester Hills, Michigan, est l'un des leaders mondiaux du contrôle numérique (CNC) et de la robotique industrielle, avec des implantations sur tout le continent américain. Google s'implique dans la robotique principalement via Intrinsic, son unité dédiée à l'IA robotique et l'un des contributeurs majeurs à l'écosystème ROS. Ce partenariat positionne les deux acteurs dans une course qui s'intensifie entre les fournisseurs de robots industriels traditionnels (ABB, KUKA, Yaskawa) et les nouveaux entrants humanoïdes comme Figure ou Agility Robotics, qui misent eux aussi sur des LLM pour la flexibilité d'exécution. FANUC, fort de 1 000 unités déjà expédiées, cherche à démontrer que l'IA physique n'est plus un sujet de R&D mais une réalité commerciale intégrable à grande échelle. Les prochaines démonstrations sont attendues au Robotics Summit & Expo de Boston dans les prochains jours.

IndustrielOpinion
1 source
L'open source commence à aider les robots à raisonner
3389IEEE Spectrum Robotics 

L'open source commence à aider les robots à raisonner

Depuis deux ans, Hugging Face, Nvidia et Alibaba ont multiplié les publications open source dans la robotique cognitive, cherchant à résoudre ce qui était jusque-là le goulot d'étranglement du secteur : faire raisonner, décider et agir un robot. Nvidia a constitué une pile complète articulée autour de trois couches : Cosmos, des world models qui génèrent des données d'entraînement synthétiques et simulent des environnements physiques ; GR00T, des modèles permettant l'exécution de tâches complexes ; et Isaac, un ensemble de frameworks d'orchestration reliant entraînement, simulation et déploiement. Ces modèles sont hébergés sur Hugging Face. Ce mouvement s'inscrit dans une longue tradition : le Robot Operating System (ROS), lancé en 2007, a unifié le secteur en fournissant un framework standardisé au-dessus de Linux pour les fonctions fondamentales de la robotique, communication inter-composants, gestion du hardware, cartographie, planification de trajectoires. Avant ROS, chaque équipe réécrivait cette infrastructure de zéro, absorbant souvent une à deux années de travail avant de pouvoir conduire les recherches réelles. L'enjeu est structurant : si l'open source peut faire pour la cognition robotique ce qu'il a fait pour les LLMs, la barrière à l'entrée pour construire un robot capable pourrait chuter aussi vite qu'elle l'a fait pour les applications d'IA générative. Spencer Huang, directeur produit robotique chez Nvidia, note que la vision par ordinateur, autrefois coûteuse en expertise, se code aujourd'hui en quelques lignes. "Pour entrer dans la robotique, il ne faut plus nécessairement un doctorat", dit-il. La logique économique est explicite : fournir un modèle pré-entraîné de haute qualité que chaque acteur peut fine-tuner, plutôt que de demander à chacun de reprendre le pré-entraînement from scratch. Pour les intégrateurs et les décideurs industriels, cela se traduit concrètement par des cycles de développement raccourcis et une moindre dépendance aux profils rares. Le parallèle avec l'histoire de l'IA est tracé explicitement par Brian Gerkey, co-créateur de ROS, aujourd'hui Board Chair d'Open Robotics et CTO d'Intrinsic, l'unité robotique et IA de Google. La communauté IA a, dès ses débuts, partagé recherches, modèles et données en open source, et le domaine a progressé bien plus vite que presque tous les observateurs ne l'anticipaient. Les premières briques d'infrastructure open source pour la robotique remontent au milieu des années 1990, avec des projets comme le package Inter-Process Communication de Carnegie Mellon et le projet Player au début des années 2000, mais ces initiatives restaient fragmentées et liées à des groupes isolés. ROS a unifié la couche basse du secteur ; Nvidia, Hugging Face et Alibaba tentent aujourd'hui de reproduire cette unification pour la couche cognitive. Les outils de simulation sont désormais suffisamment précis pour être utiles à l'entraînement et accessibles hors des laboratoires spécialisés. La question qui demeure ouverte : ces modèles pré-entraînés tiendront-ils leurs promesses dans des déploiements industriels réels, au-delà des démonstrations contrôlées ?

FR/EU ecosystemeOpinion
1 source
Vidéo : Helios, robot humanoïde à quatre bras pour les missions en orbite
3390Interesting Engineering 

Vidéo : Helios, robot humanoïde à quatre bras pour les missions en orbite

La startup canadienne Orbit Robotics a dévoilé HELIOS, un robot humanoïde à quatre bras conçu pour des missions en orbite basse, dans une vidéo teaser publiée sur YouTube. Le robot présente un châssis noir allégé suspendu dans un banc de test, avec un système mécanique à câbles et poulies tendineux, en rupture nette avec les actionneurs rigides industriels classiques. Les moteurs sont positionnés près des articulations d'épaule afin de réduire la masse en mouvement, tandis que la force est transmise via des câbles et des bobines vers les articulations des bras. L'articulation du coude intègre un joint à contact roulant offrant un mouvement fluide à faible friction, alliant rigidité et compliance. HELIOS ne dispose pas de jambes : Orbit considère la locomotion bipède comme peu pertinente en micropesanteur, où la mobilité repose sur la préhension de surfaces et la stabilisation corporelle. Le robot cible des tâches telles que la gestion de fret, la maintenance répétitive et les opérations de construction orbitale. Les chiffres avancés pour justifier le besoin sont substantiels : les astronautes consacreraient environ 35 % de leur temps à des tâches de maintenance, un cycle de déchargement de fret mobiliserait près de 50 heures d'équipage, et le coût horaire d'un astronaute est estimé à 140 000 dollars. L'architecture à quatre bras d'HELIOS constitue une proposition de conception distincte du courant dominant de la robotique humanoïde terrestre. En ciblant la manipulation multimodale dans un environnement sans gravité, Orbit adresse un segment de niche mais à fort potentiel économique : les stations orbitales commerciales prévues pour cette décennie. L'utilisation d'une transmission par câbles plutôt que d'actionneurs rigides ou hydrauliques est cohérente avec les contraintes spatiales (masse, compliance, robustesse aux vibrations), et rappelle les principes des bras Canadarm ou des robots Astrobee de la NASA, bien que la robotique humanoïde autonome en orbite reste à un stade très expérimental. Il faut souligner que la présentation se limite à un teaser vidéo : aucun test en conditions de micropesanteur réelle n'est documenté à ce stade, et les métriques de performance concrètes (charge utile, degrés de liberté, temps de cycle) ne sont pas encore publiées. Orbit Robotics est une jeune entreprise canadienne en phase précoce ; HELIOS est décrit comme le résultat de deux semestres de développement. En parallèle, la société développe IKARUS, sa première plateforme opérationnelle bimanuelle, construite en deux mois et utilisée comme banc d'essai pour la téléopération, l'apprentissage par imitation et l'itération matérielle rapide. Sur le plan concurrentiel, le segment de la robotique spatiale autonome inclut des acteurs comme Gitai (Japon) ou les programmes ESA dédiés aux robots de service orbital. Aucun calendrier de déploiement ni partenariat avec des agences (NASA, ESA, JAXA) ou des opérateurs de stations commerciales tels qu'Axiom Space ou Vast n'a été annoncé. Les prochaines étapes logiques impliqueraient des essais en flottabilité neutre ou en vol parabolique, avant toute perspective d'intégration sur une infrastructure orbitale réelle.

HumanoïdesOpinion
1 source
Vidéo : un chien robot traque les micro-fuites de gaz dans le gigantesque hub de stockage de CO₂ norvégien
3391Interesting Engineering 

Vidéo : un chien robot traque les micro-fuites de gaz dans le gigantesque hub de stockage de CO₂ norvégien

Un robot quadrupède baptisé "Roberta", construit par la société suisse ANYbotics, patrouille l'installation Northern Lights d'Equinor sur les côtes de Norvège occidentale. Ce hub de stockage de carbone, largement automatisé, reçoit du CO2 liquide capturé dans des usines européennes et l'injecte en permanence dans des réservoirs géologiques situés à 2 500 mètres sous le fond marin. Roberta est un ANYmal D, certifié IP67 (étanche à la poussière et à l'eau), capable de naviguer sur des escaliers métalliques ouverts et des surfaces glissantes sous les tempêtes de la mer du Nord. Équipé de caméras thermiques, de capteurs de gaz et d'un système d'imagerie acoustique comprenant 64 microphones, il détecte les fuites microscopiques en repérant leurs sifflements haute fréquence bien avant tout opérateur humain. Chaque mois, ces quadrupèdes autonomes effectuent des rondes d'inspection sur plusieurs sites, cartographiant les concentrations de gaz, auditant les températures des équipements, et transmettant les données en temps réel à un centre de commande situé à trente minutes du site. Ce déploiement illustre un changement de paradigme opérationnel dans l'industrie lourde : plutôt que d'exposer des techniciens à des environnements hostiles en continu, le robot assure la surveillance permanente pendant que des modèles d'IA analysent les données et n'alertent les équipes humaines qu'en cas d'anomalie avérée. Les industriels utilisant ces quadrupèdes rapportent une réduction de 70 à 90 % de l'exposition humaine aux environnements dangereux. L'impact financier est également mesurable : déployé dans une cimenterie, l'ANYmal D a détecté des fuites d'air comprimé dont la réparation a réduit les émissions de CO2 de l'installation de 1 200 tonnes par an. Ces chiffres, bien qu'issus directement des communications d'ANYbotics, donnent un ordre de grandeur concret pour les décideurs qui évaluent le retour sur investissement de l'inspection autonome. Dans le secteur énergétique, où chaque micro-fuite représente un gaspillage économique et une pénalité carbone, le cas d'usage est particulièrement solide. ANYbotics, spin-off de l'ETH Zurich fondée en 2016 sous la direction du CEO Péter Fankhauser, s'est imposée comme l'un des leaders de l'inspection robotique industrielle aux côtés de Boston Dynamics (Spot) et de Ghost Robotics. La prochaine étape commerciale de la société est l'ANYmal X, présenté comme le premier robot quadrupède antidéflagrant au monde, conçu pour les zones ATEX (pétrole, gaz, chimie) où les gaz combustibles rendent dangereux tout équipement susceptible de produire des étincelles. Il s'agit pour l'instant d'une annonce de lancement commercial imminent, pas encore d'un produit déployé à grande échelle. Le déploiement sur Northern Lights, premier projet de capture et stockage de CO2 industriel à grande échelle en Europe, positionne ANYbotics sur un segment stratégique appelé à croître avec le durcissement des réglementations carbone de l'UE et la multiplication des infrastructures CCS sur le continent.

IndustrielActu
1 source
Humanoid s'associe à Bosch et Schaeffler pour industrialiser la production de robots
3392Robotics Business Review 

Humanoid s'associe à Bosch et Schaeffler pour industrialiser la production de robots

La startup londonienne Humanoid, fondée en 2024 sous le nom SKL Robotics Ltd., a annoncé en mai 2026 deux partenariats industriels majeurs pour industrialiser son robot HMND 01 sur le marché européen. Le premier accord, conclu avec Robert Bosch GmbH (siège à Gerlingen, Allemagne), fait suite à un proof of concept réalisé en mars 2026 dans un entrepôt intralogistique Bosch à Bühl, en Allemagne : le HMND 01, un manipulateur mobile à roues doté d'un torse humanoïde, d'une tête et de deux bras, a transféré de manière autonome des cartons depuis un convoyeur vers des chariots, en gérant cinq formats de boîtes différents sur plusieurs hauteurs, empreintes au sol et masses. Le second accord, signé la semaine précédente avec Schaeffler Technologies AG, est décrit comme un contrat "contraignant et phasé" visant à intégrer les robots HMND dans des lignes de production réelles en Allemagne d'ici fin 2026. Humanoid qualifie ce déploiement de "l'un des plus importants rollouts de robots humanoïdes annoncés à ce jour", ce qui reste difficile à vérifier indépendamment faute de chiffres de volumes publiés. Ces deux partenariats signalent un changement de phase pour Humanoid : de la validation POC vers la fabrication en série et le déploiement industriel. Bosch endosse le rôle de sous-traitant industriel (contract manufacturer) et apportera son infrastructure de production mondiale, sa chaîne d'approvisionnement et son expertise en DfX (design for excellence), un cadre méthodologique couvrant la fabricabilité, la fiabilité, la maintenabilité et l'optimisation des coûts. L'orchestration des tâches repose sur KinetIQ, le framework IA propriétaire d'Humanoid. Pour un COO ou un directeur industriel, l'intérêt concret est double : un robot conçu pour les espaces humano-centriques (convoyeurs, chariots, manipulation multi-format) testé en conditions réelles, et un partenaire de fabrication capable de passer rapidement du prototype au volume. La mention d'une future intégration de composants Bosch (actionneurs, variateurs, capteurs) dans les prochaines versions du HMND ouvre aussi une trajectoire de co-développement hardware. Humanoid s'est constitué rapidement un réseau de partenaires industriels de premier rang : outre Bosch et Schaeffler, la société avait annoncé le mois précédent un accord avec Siemens. Ce positionnement agressif intervient dans un contexte de consolidation du marché humanoïde industriel, où Figure AI (Figure 03), Tesla (Optimus Gen 3), Physical Intelligence (pi0), NVIDIA (GR00T N2) et 1X Technologies se disputent les premiers déploiements à l'échelle. Humanoid mise sur une stratégie de distribution européenne différenciée, en s'appuyant sur l'écosystème industriel allemand plutôt que sur une intégration verticale américaine. La prochaine étape visible sera la mise en service effective des premiers systèmes chez Schaeffler avant la fin de l'année 2026, date qui permettra de valider si le saut du POC au déploiement réel est aussi rapide que le suggèrent les annonces.

FR/EU ecosystemeOpinion
1 source
IA à l'échelle urbaine : du pilote à la généralisation, robots en conditions réelles et passage à l'échelle
339336Kr 

IA à l'échelle urbaine : du pilote à la généralisation, robots en conditions réelles et passage à l'échelle

Coowa Technology, fondée en 2015 à Shanghai et dont le siège social est à Pékin, a présenté lors de la conférence AI+ Industry de Yizhuang en mai 2026 un bilan opérationnel chiffré: 55 millions de kilomètres réels parcourus, déploiement dans plus de 50 villes chinoises, et 10 millions de clips vidéo-sémantique-action alignés collectés. La gamme commercialisée comprend des robots d'assainissement urbain de 1 et 3 tonnes, le minibus autonome Coobus (déployé dans une dizaine de villes à l'échelle mondiale, dont prochainement Yizhuang), le robot de gestion immobilière Wall-E R0, et des robots-chiens quadrupèdes pour la livraison du dernier kilomètre, capables d'assurer des livraisons en moins de 30 minutes dans un rayon de 3 km sans modification des ascenseurs ni de l'infrastructure existante. Li Kehong, COO et co-fondateur, a indiqué une rentabilité annuelle de "plusieurs centaines de millions de yuans". L'argument central de la présentation porte sur la donnée comme avantage concurrentiel structurel: dans l'IA incarnée (embodied AI), le goulot d'étranglement n'est pas algorithmique mais datalogique. Coowa y répond avec une stratégie où les revenus d'exploitation financent directement l'itération du modèle CooWAIM (World-Action Interactive Model), une architecture duale combinant inférence temps réel en bordure de réseau pour la sécurité immédiate et planification sémantique longue portée pour la navigation globale. L'approche "Drive+Work", qui fusionne mobilité et manipulation dans un espace d'action indissociable, s'écarte du paradigme modulaire dominant dans la robotique de service. Les chiffres d'exploitation donnent une mesure concrète: aux heures de pointe, les robots traitent en temps réel plus de 100 caractéristiques dynamiques par intersection (piétons, véhicules non motorisés); un gain de 20% sur le temps de traversée équivaut selon Coowa à une hausse de 20% de la marge brute, argument directement actionnable pour un décideur B2B ou un intégrateur. Fondée sur la base académique de l'Université Jiaotong de Shanghai, Coowa opère depuis dix ans dans les environnements urbains ouverts chinois, accumulant une antériorité opérationnelle que peu de concurrents peuvent revendiquer à cette échelle commerciale. Waymo, issu du laboratoire Google X après plus d'une décennie de développement, et Tesla, qui s'appuie sur sa flotte de plusieurs millions de véhicules pour constituer ses données d'entraînement, progressent en robotaxi sur un périmètre distinct; les acteurs de la robotique humanoïde comme Figure, Agility Robotics ou 1X Technologies demeurent majoritairement en phase de pilote industriel. Coowa anticipe l'ouverture réglementaire de marchés étrangers en positionnant en priorité ses produits dans les pays de l'initiative "Ceinture et Route". Les prochaines étapes concernent la montée en puissance de la livraison instantanée à court terme et, à horizon plus long, l'entrée dans les environnements domestiques fermés, segment le plus complexe techniquement mais potentiellement le plus générateur de données d'entraînement inédites.

Chine/AsieActu
1 source
Pourquoi Tesla mise des milliards sur Optimus
3394Robot Magazine FR 

Pourquoi Tesla mise des milliards sur Optimus

Tesla a engagé un pivot stratégique majeur vers la robotique humanoïde avec son robot Optimus, présenté pour la première fois en 2021 et progressivement monté en priorité interne. Selon des déclarations publiques répétées d'Elon Musk courant 2024-2025, le groupe recrute massivement des ingénieurs en vision par ordinateur, robotique et IA, sans que des chiffres précis d'investissement ou de volumes de production n'aient été officiellement communiqués. Musk a qualifié Optimus de "produit le plus important de Tesla", positionnant le robot comme une plateforme capable d'intervenir dans les usines, entrepôts, logistique et services grand public. À date, Tesla a publié des démonstrations vidéo d'Optimus réalisant des tâches manuelles en environnement contrôlé. Il n'existe pas encore de déploiement industriel à l'échelle documenté ni de prix catalogue annoncé pour des tiers. L'intérêt stratégique d'Optimus repose sur une hypothèse structurelle : le marché des robots humanoïdes polyvalents pourrait dépasser celui de l'automobile à long terme. Pour les décideurs industriels, la promesse est réelle, les humanoïdes pourraient théoriquement remplacer des postes de travail répétitifs sans reconfigurer entièrement les lignes de production, contrairement aux bras industriels fixes. Mais l'écart entre démonstration et déploiement opérationnel reste considérable. Le "demo-to-reality gap" n'est pas comblé : aucun constructeur, ni Tesla, ni Figure AI, ni Boston Dynamics, n'a prouvé une fiabilité suffisante en conditions réelles non supervisées à grande échelle. Ce que le pivot Tesla prouve, c'est que la narration "constructeur automobile" ne suffit plus à soutenir une valorisation boursière qui restait, début 2025, un multiple très élevé par rapport aux revenus automobiles nets. Tesla arrive sur un marché humanoïde déjà encombré. Figure AI (Figure 03, en partenariat avec BMW) a annoncé des déploiements en usine. Agility Robotics (Digit) est en production chez Amazon. Physical Intelligence (pi-0) et 1X Technologies progressent sur les modèles fondationnels robotiques. Boston Dynamics positionne Atlas sur les environnements industriels difficiles. NVIDIA soutient l'écosystème via GR00T et la plateforme Isaac. La Chine industrialise rapidement avec Unitree et Fourier Intelligence. Tesla dispose d'un avantage potentiel : l'accès à d'immenses volumes de données réelles via ses véhicules et ses usines, et une chaîne de fabrication à bas coût. Mais la pression concurrentielle sur l'automobile, notamment de BYD, Xiaomi et Xpeng, comprime les marges et renforce l'urgence de diversifier les revenus. Une éventuelle IPO de SpaceX constitue un risque de dilution d'attention capitalistique supplémentaire pour Tesla. Les prochaines étapes à surveiller : un déploiement interne dans les Gigafactories, et une éventuelle communication sur les métriques de fiabilité opérationnelle.

HumanoïdesOpinion
1 source
Les robots humanoïdes commerciaux en Chine pourraient bientôt faire la lessive, faire les lits et s'occuper des personnes âgées
3395SCMP Tech 

Les robots humanoïdes commerciaux en Chine pourraient bientôt faire la lessive, faire les lits et s'occuper des personnes âgées

GigaAI a présenté mercredi le SeeLight S1, annoncé comme le premier robot humanoïde domestique à usage général conçu pour le marché résidentiel chinois. Développé en partenariat avec le Hubei Humanoid Robot Innovation Centre et le Hubei Humanoid Robotics Industry Alliance, l'appareil est destiné à des tâches ménagères non structurées : lessive, préparation des lits, assistance aux personnes âgées. GigaAI lance un programme de test gratuit auprès de familles à Wuhan, capitale du Hubei, sans communiquer à ce stade de prix public ni de métriques techniques précises (charge utile, degrés de liberté, temps de cycle). Cette annonce illustre un pivot stratégique majeur dans le secteur des humanoïdes chinois : après avoir ciblé les environnements industriels et manufacturiers, les constructeurs s'attaquent à l'environnement domestique, structurellement beaucoup plus difficile à maîtriser. Les tâches ménagères impliquent une variabilité quasi infinie des objets, dispositions et comportements humains, là où une ligne d'assemblage reste prévisible. Passer de la démo convaincante au déploiement réel dans des foyers reste le défi central du secteur, et ce programme de test en conditions réelles constitue une étape méthodologique pertinente, à condition que GigaAI publie des résultats chiffrés. Le projet s'inscrit dans une dynamique nationale soutenue par Pékin, qui a identifié les humanoïdes comme secteur stratégique prioritaire. En parallèle, UnitTree, Fourier Intelligence et UBTECH accélèrent leurs propres développements, tandis qu'à l'international Figure (Figure 03), Tesla (Optimus Gen 3) et Physical Intelligence (Pi-0) restent les références concurrentes. Le programme de Wuhan est un pilote terrain : son issue déterminera si GigaAI peut réellement combler l'écart entre démonstration et usage quotidien.

Chine/AsieOpinion
1 source
Le syndrome du béni-oui-oui : évaluer l'abstention dans les agents robotiques incarnés
3396arXiv cs.RO 

Le syndrome du béni-oui-oui : évaluer l'abstention dans les agents robotiques incarnés

Une équipe du laboratoire PursecLab a publié en mai 2026 un article documentant ce qu'ils nomment le "syndrome du yes-man" dans les VLM (vision-language models) utilisés comme planificateurs pour robots incarnés : ces modèles exécutent des instructions même lorsqu'elles sont physiquement infaisables, ambiguës ou fondées sur de fausses prémisses. Pour mesurer cette faille, les chercheurs ont développé RoboAbstention, un benchmark de 6 069 instructions générées à partir d'images issues de cinq jeux de données robotiques, via un pipeline en trois phases : ancrage visuel structuré, dérivation déterministe de contraintes physiques, et génération contrôlée par gabarits par catégorie. Les résultats sont sévères : Gemini 2.5 Flash, meilleur modèle général testé, n'abstient que dans 39,0 % des cas où il devrait refuser. Gemini Robotics ER 1.6 Preview, planificateur dédié à la robotique incarnée, tombe à 16,5 %. L'application de techniques de "defensive prompting" et d'in-context learning remonte ces taux à 93,6 % pour Gemini Robotics ER et 88,6 % pour GPT-5.4 Mini, sans résoudre entièrement le problème. Ce comportement représente un risque opérationnel concret : un robot qui ne détecte pas les limites d'une instruction peut endommager des équipements, violer des consignes de sécurité, ou échouer silencieusement sans signal d'erreur exploitable. La taxonomie proposée distingue quatre cas légitimes d'abstention - instruction ambiguë, contrainte physique violée, prémisse factuelle fausse, contexte sensoriel insuffisant. Le fait que des modèles dotés de raisonnement avancé échouent massivement démontre que la capacité à "savoir refuser" n'émerge pas naturellement avec la montée en puissance des VLM, y compris ceux dédiés à la robotique. Les benchmarks d'abstention existants portaient exclusivement sur des LLM en contexte textuel, ignorant les contraintes perceptuelles propres aux environnements physiques - c'est le vide que comble RoboAbstention. À mesure que les architectures VLA (Vision-Language-Action) se rapprochent des déploiements industriels réels, la validation comportementale avant mise en service devient un critère incontournable pour intégrateurs et décideurs industriels. Le benchmark est open-source sur purseclab.github.io/RoboAbstention, directement utilisable comme outil d'audit pré-déploiement. Aucun acteur européen n'est impliqué dans cette étude. Les prochaines étapes logiques pointent vers le fine-tuning ciblé sur l'abstention, les correctifs au niveau du prompt ayant montré leurs limites structurelles.

RechercheOpinion
1 source
VLA-REPLICA : un benchmark reproductible et économique pour l'évaluation réelle des modèles vision-langage-action (VLA)
3397arXiv cs.RO 

VLA-REPLICA : un benchmark reproductible et économique pour l'évaluation réelle des modèles vision-langage-action (VLA)

Une équipe de recherche vient de publier VLA-REPLICA (arXiv:2605.20774, mai 2026), un banc d'évaluation réel, bas coût et reproductible, conçu pour tester les modèles de type Vision-Language-Action (VLA) sur des tâches de manipulation robotique. L'architecture repose entièrement sur des composants disponibles dans le commerce, ce qui permet à n'importe quel laboratoire d'assembler le setup en quelques jours et de reproduire les mêmes conditions expérimentales. Le benchmark intègre une suite de tâches de manipulation variées, un dataset de démonstrations de petite taille pour l'adaptation au domaine cible, ainsi que des protocoles d'évaluation distincts pour des scénarios en distribution et hors distribution. Les expériences menées couvrent l'apprentissage par imitation classique et plusieurs modèles VLA de l'état de l'art, avec des résultats cohérents obtenus sur des setups construits indépendamment dans différents sites. L'enjeu derrière VLA-REPLICA est directement lié à un problème structurel du secteur : l'évaluation réelle des modèles VLA reste fragmentée, coûteuse, et difficile à comparer d'un labo à l'autre. Les benchmarks en simulation ne capturent pas la complexité du monde physique, tandis que les benchmarks réels existants exigent souvent du matériel spécialisé onéreux ou une évaluation centralisée. Ce benchmark vise à combler ce fossé en fournissant une infrastructure standardisée et décentralisée, ce qui est une condition nécessaire pour que la communauté puisse comparer honnêtement les modèles et identifier leurs limites réelles, notamment face au sim-to-real gap qui affecte encore la plupart des politiques de manipulation. Les modèles VLA ont connu une montée en puissance rapide ces deux dernières années, avec des systèmes comme pi-0 de Physical Intelligence, GR00T N2 de NVIDIA, ou OpenVLA issu des travaux de Stanford et Berkeley. Malgré des performances impressionnantes en démo, leur déploiement industriel reste freiné par l'absence de protocoles d'évaluation partagés et comparables. VLA-REPLICA s'inscrit dans un mouvement plus large de standardisation des benchmarks robotiques, comparable à ce qu'ont représenté BOP ou NIST Task Board pour d'autres sous-domaines. La prochaine étape logique serait l'adoption de ce protocole par plusieurs équipes tier-1 pour valider la reproductibilité à grande échelle et créer une baseline commune sur laquelle ancrer les publications futures.

IA physiquePaper
1 source
DISC : découplage instruction-contrôle conditionné par l'état via la génération de politique
3398arXiv cs.RO 

DISC : découplage instruction-contrôle conditionné par l'état via la génération de politique

Des chercheurs ont publié DISC (Decoupling Instruction from State-Conditioned Control via Policy Generation), une architecture de politique de manipulation robotique conditionnée par le langage, déposée sur arXiv (2605.20856) en mai 2026. L'approche repose sur un hyperréseau qui génère l'intégralité des paramètres d'une politique visuomotrice spécifique à la tâche à partir de la seule instruction textuelle. La politique générée n'accède jamais directement au langage : sa compréhension de la tâche provient exclusivement des poids produits par l'hyperréseau. Sur les benchmarks LIBERO-90 et Meta-World, DISC surpasse l'ensemble des architectures couplées évaluées, et dépasse pi-0 (Physical Intelligence) malgré l'absence de tout préentraînement sur données externes. Le code est disponible publiquement sur GitHub. Ce résultat touche à un problème structurel bien documenté dans le domaine des VLA (Vision-Language-Action models) : l'"observation leakage", c'est-à-dire la tendance des réseaux couplés à apprendre des raccourcis scène-à-action qui contournent le grounding linguistique. En pratique, cela signifie qu'un modèle peut réussir une tâche en exploitant des corrélations visuelles parasites plutôt qu'en comprenant l'instruction. DISC élimine ce chemin de fuite par construction, et non par régularisation post-hoc. Le fait de surpasser pi-0 sans préentraînement est notable : pi-0 est entraîné sur des volumes de données multi-robots à grande échelle, ce qui rend la comparaison significative pour les équipes qui cherchent à calibrer le retour sur investissement du préentraînement massif versus des architectures mieux conçues. L'hyperréseau apprend également un manifold de paramètres structuré sémantiquement, ce qui permet une adaptation few-shot à partir de très peu de démonstrations et une robustesse aux reformulations d'instructions. Les architectures de politiques conditionnées par le langage sont au coeur de la course aux robots généralistes depuis 2023, avec des travaux fondateurs comme RT-2 (Google DeepMind), OpenVLA, et pi-0 de Physical Intelligence qui ont structuré le débat autour du préentraînement à grande échelle. DISC propose une alternative architecturale plutôt que scalaire : résoudre le problème de couplage instruction-état en amont, plutôt que de le noyer dans des données. Côté concurrents directs, les approches hyperréseau pour la génération de politiques restent peu explorées en robotique de manipulation, ce qui laisse DISC dans un espace relativement dégagé pour l'instant. Les prochaines étapes naturelles seraient une validation sur hardware physique à plus grande échelle (les expériences réelles mentionnées dans le papier restent limitées à un benchmark à contexte visuel partagé) et une évaluation de la latence de génération des paramètres en conditions de déploiement industriel, deux points que le papier ne documente pas encore précisément.

RechercheOpinion
1 source
Explications contrefactuelles temporelles des décisions d'arbres de comportement
3399arXiv cs.RO 

Explications contrefactuelles temporelles des décisions d'arbres de comportement

Une équipe de chercheurs a publié sur arXiv (référence 2509.07674, version 2) une méthode automatisée de génération d'explications contrefactuelles temporelles pour les robots pilotés par des arbres de comportement (behaviour trees, BT). Le système répond en temps réel aux questions de type "pourquoi le robot a-t-il fait X plutôt que Y ?" en construisant automatiquement un modèle causal à partir de la structure du BT et de la connaissance du domaine applicatif, puis en interrogeant ce modèle pour produire un ensemble d'explications contrefactuelles diversifiées. Les auteurs affirment surpasser les méthodes existantes, qui soit ne répondent pas aux questions contrastives avec des explications causales, soit ne garantissent pas la cohérence et la précision des réponses sur une large gamme de structures de BT et d'états système. Les arbres de comportement sont largement utilisés dans les systèmes robotiques industriels et de service pour piloter la prise de décision, des manipulateurs aux robots mobiles autonomes (AMR) en passant par les plateformes humanoïdes. La question de l'explicabilité (XAI) y est critique pour les intégrateurs et les équipes de sécurité fonctionnelle : comprendre pourquoi un robot a choisi une séquence d'actions plutôt qu'une autre est indispensable pour la certification, la maintenance et l'acceptation par les opérateurs. Cette méthode propose le premier mécanisme de causalité contrefactuelle automatique dédié aux BT, comblant un angle mort identifié dans la littérature XAI robotique. Les arbres de comportement ont progressivement remplacé les automates finis (FSM) dans de nombreux systèmes robotiques depuis le milieu des années 2010, grâce à leur modularité et leur lisibilité. Les travaux antérieurs sur l'explicabilité des BT se limitaient à des justifications post-hoc non causales ou à des méthodes génériques issues de LIME, SHAP ou des réseaux causaux structuraux (SCM). La validation présentée repose sur des structures de BT synthétiques et des états variés, sans déploiement industriel annoncé à ce stade. Les prochaines étapes naturelles incluent la validation en environnement réel et l'intégration dans des interfaces opérateur, un enjeu croissant en Europe avec l'AI Act et les normes cobotiques (ISO 10218) qui renforcent les exigences de traçabilité des décisions autonomes.

RecherchePaper
1 source
WestWorld : un modèle du monde de trajectoires évolutif intégrant des connaissances pour systèmes robotiques variés
3400arXiv cs.RO 

WestWorld : un modèle du monde de trajectoires évolutif intégrant des connaissances pour systèmes robotiques variés

Une équipe de chercheurs a publié WestWorld (arXiv:2603.14392), un modèle de monde trajectoire conçu pour opérer sur des systèmes robotiques hétérogènes. Préentraîné sur 89 environnements complexes couvrant une large variété de morphologies en simulation et en conditions réelles, le modèle cible deux lacunes récurrentes dans la littérature : la difficulté de passer à l'échelle face à un grand nombre de dynamiques système distinctes, et l'absence d'intégration des connaissances sur les structures physiques des robots. La validation réelle a été conduite sur un quadrupède Unitree Go1, où WestWorld a démontré des performances stables en locomotion. Le code source est disponible sur GitHub. L'architecture repose sur un mécanisme baptisé Sys-MoE (system-aware Mixture-of-Experts), qui route dynamiquement des experts spécialisés selon le système robotique fourni en entrée, via un embedding système appris. Un embedding structurel complémentaire aligne les représentations de trajectoires avec les informations morphologiques du robot, permettant au modèle de tenir compte du fait qu'un bras articulé, un quadrupède et une plateforme mobile n'obéissent pas aux mêmes contraintes physiques. Les résultats affichent des gains significatifs en prédiction de trajectoire zero-shot et few-shot face aux baselines compétitives, ainsi qu'une amélioration des performances sur le contrôle model-based downstream pour différentes plateformes robotiques. La scalabilité tient sur un spectre large d'environnements, ce qui constitue l'argument central de la contribution. La publication s'inscrit dans une tendance forte : appliquer aux robots les world models issus du monde des agents RL et des LLMs multimodaux, à l'image de Dreamer, UniSim, ou des frameworks VLA (Vision-Language-Action) orientés manipulation. WestWorld se distingue par son ambition généraliste multi-morphologie, là où la majorité des approches concurrentes restent spécialisées sur une famille de robots. L'usage du Unitree Go1 comme banc de test réel est pertinent mais reste un cas relativement balisé dans la littérature, ce qui nuance la portée de la démonstration sim-to-real. Les prochaines étapes logiques seront d'évaluer le transfert sur des morphologies plus complexes, humanoïdes notamment, là où les défis de généralisation sont encore ouverts.

RecherchePaper
1 source