Aller au contenu principal

Actualités robotique — page 72

4 593 articles au fil, du plus récent au plus ancien.

Matrix Super Intelligence dévoile le robot humanoïde MATRIX-3 et vise 100 000 unités d'ici 2027
3551Pandaily 

Matrix Super Intelligence dévoile le robot humanoïde MATRIX-3 et vise 100 000 unités d'ici 2027

Matrix Super Intelligence (矩阵超智), startup d'intelligence artificielle incarnée basée dans le district de Zhangjiang à Pudong (Shanghai), a dévoilé le MATRIX-3, un robot humanoïde grand format que l'entreprise positionne comme l'"Optimus chinois". L'engin mesure 170 centimètres pour 65 kilogrammes. Sa principale particularité de conception est une structure dite "à musculature biomimétique", intégrant des matériaux textiles flexibles dans le châssis, censés assurer une couverture protectrice des mécanismes lors des mouvements. L'entreprise annonce un objectif de production de 100 000 unités d'ici 2027, conditionné à l'obtention de certifications de sécurité et à la validation par des partenaires entreprises pilotes. Aucun cas d'usage spécifique, ni spécification technique détaillée (degrés de liberté, payload, temps de cycle), n'a été communiqué lors de l'annonce initiale. Le chiffre de 100 000 unités à horizon 2027 est la donnée la plus scrutée ici : la quasi-totalité des fabricants d'humanoïdes actuels, de Figure à Agility Robotics en passant par Unitree, opèrent encore en déploiements pilotes de quelques dizaines à quelques centaines d'unités. Monter à ce volume en moins de deux ans supposerait une capacité de rampe industrielle sans précédent dans le secteur. L'absence de métriques de performance concrètes et la formulation en annonce-teaser invitent les intégrateurs et décideurs B2B à traiter cet objectif comme un signal d'intention stratégique plutôt que comme un engagement contractuel de livraison. Les vidéos de démonstration présentées lors du lancement n'ont pas fait l'objet d'une évaluation indépendante. Matrix Super Intelligence s'inscrit dans une vague dense de constructeurs d'humanoïdes chinois cherchant une visibilité internationale, aux côtés d'Unitree (G1, H1), Fourier Intelligence (GR-1) et Agibot (A2). Le contexte industriel chinois, marqué par un soutien d'État actif et une intégration croissante dans les lignes d'assemblage automobile et électronique, favorise des annonces à volumes ambitieux dont l'exécution reste à démontrer. À l'échelle mondiale, Tesla vise plusieurs milliers d'Optimus Gen 3 produits en 2025, Figure prépare des déploiements en logistique avec BMW, et Physical Intelligence positionne son architecture Pi-0 pour la généralisation multi-robot via des modèles VLA. Le MATRIX-3 constitue le premier produit phare de l'entreprise ; sa trajectoire réelle dépendra des résultats des pilotes annoncés et des délais de certification, dont les contours restent à préciser.

Chine/AsieOpinion
1 source
UniStrong Instruments : 15 ans de sous-traitance pour ABB, désormais en course pour dominer le marché mondial des capteurs robotiques
3552Pandaily 

UniStrong Instruments : 15 ans de sous-traitance pour ABB, désormais en course pour dominer le marché mondial des capteurs robotiques

UniStrong Instruments (宇立仪器), fabricant chinois de capteurs force-couple, vient d'obtenir la certification UL et annonce une expansion internationale ciblant en priorité le marché nord-américain. Depuis quinze ans, ses capteurs sont intégrés dans les robots industriels d'ABB et de KUKA, deux des plus grands fabricants mondiaux d'automatisation. L'entreprise élargit désormais son portefeuille vers les cobots (robots collaboratifs) et les plateformes humanoïdes émergentes, où ces composants sont devenus des briques fondamentales de l'architecture mécatronique. Les capteurs force-couple permettent à un robot de mesurer en temps réel les forces qu'il exerce sur son environnement, une capacité indispensable pour l'assemblage de précision, le meulage, le polissage ou toute tâche nécessitant une adaptation dynamique à la résistance du matériau. En robotique humanoïde, ces capteurs conditionnent directement la dextérité manuelle et la sécurité des interactions physiques avec les opérateurs. La certification UL lève un obstacle réglementaire majeur à l'entrée sur le marché nord-américain et repositionne UniStrong comme alternative crédible aux capteurs importés d'Allemagne (Schunk), du Japon et des États-Unis (ATI Industrial Automation, désormais intégré à Novanta), dont les prix restent élevés pour les intégrateurs à volume. UniStrong a construit sa réputation sur un critère souvent absent des brochures : la résistance aux surcharges, c'est-à-dire la capacité à survivre aux chocs et aux efforts imprévus qui détruisent les capteurs concurrents en conditions réelles. Cet avantage, éprouvé sur quinze ans d'intégration chez ABB et KUKA, lui confère une base de référence industrielle difficile à contester. Le timing n'est pas anodin : la Chine pousse activement ses équipementiers robotiques vers l'international, dans un contexte de compétition intense illustré par le marathon humanoïde de Beijing Etown en mai 2025. Pour les intégrateurs et les OEMs qui assemblent des cobots ou des humanoïdes, l'émergence d'un fournisseur chinois certifié UL avec un historique de fiabilité avéré élargit concrètement l'espace des fournisseurs, au-delà des habituels duopoles euro-américains.

Chine/AsieOpinion
1 source
Cloud Depth Technology vise 3,5 milliards de dollars lors de son introduction en bourse sur le STAR Market
3553Pandaily 

Cloud Depth Technology vise 3,5 milliards de dollars lors de son introduction en bourse sur le STAR Market

Cloud Depth Technology (云深处科技) a officiellement déposé un dossier d'introduction en bourse sur le STAR Market (科创板) de Shanghai, la demande ayant été acceptée par la Bourse de Shanghai le 18 mai 2026. La société, qui a mandaté CITIC Securities comme sponsor, vise à lever environ 2,503 milliards de yuans (soit une valorisation implicite d'environ 3,5 milliards de dollars). Fondée dans les laboratoires de l'Université du Zhejiang, Cloud Depth est aujourd'hui l'un des principaux fabricants chinois de robots quadrupèdes, avec des déploiements dans l'inspection industrielle, la recherche scientifique et les opérations de secours, en Chine comme à l'international. Elle devient ainsi la troisième entreprise des "Sept Dragons de Hangzhou" (杭州七小龙), ce groupe de startups tech de Hangzhou, à entrer en bourse, après Unitree Robotics (宇树科技) et Qiangkin Technology (群核科技). Cette candidature à l'IPO traduit une accélération nette de la commercialisation des robots à pattes en Chine, dans un contexte où la demande industrielle pour l'inspection automatisée et la sécurité publique progresse rapidement. Le précédent de Unitree, dont la valorisation a franchi le seuil "licorne" lors de ses derniers tours de table, a clairement démontré l'appétit des investisseurs pour ce segment. Pour les décideurs B2B, cette succession de cotations signale que le marché des robots quadrupèdes n'est plus un secteur émergent spéculatif, mais une industrie en phase de structuration financière, avec des acteurs capables de lever des capitaux à grande échelle pour financer la montée en volume de production. Cloud Depth est issu des travaux de robotique de l'Université du Zhejiang, l'un des principaux viviers académiques du secteur en Chine. Sur le plan concurrentiel, elle se positionne face à Unitree (dont les robots Go2 et H1 ont largement circulé) et, à l'international, face à Boston Dynamics (Spot), ANYbotics (ANYmal) et Ghost Robotics. Le produit de l'IPO doit financer l'expansion R&D et l'augmentation des capacités de fabrication pour répondre à une demande mondiale croissante. Aucune date de première cotation ni de valorisation définitive n'a encore été communiquée, le dossier étant en cours d'instruction par les autorités boursières chinoises.

Chine/AsieActu
1 source
Locus Robotics rachète Nexera Robotics
3554Robotics & Automation News 

Locus Robotics rachète Nexera Robotics

Locus Robotics, spécialiste américain de l'automatisation logistique d'entrepôt, a annoncé l'acquisition de Nexera Robotics, startup canadienne basée à Vancouver spécialisée dans la préhension robotique avancée. L'opération intègre la technologie propriétaire NeuraGrasp de Nexera, un end-effector conçu pour la saisie d'objets variés, directement dans la plateforme "physical AI" de Locus. Cet ajout élargit les capacités de la suite Locus Array, qui couvrait jusqu'ici principalement le transport autonome de charges (AMR), vers la manipulation bout en bout dans les entrepôts. Les conditions financières de la transaction n'ont pas été divulguées. Cette acquisition marque un pivot stratégique pour Locus Robotics : passer de la navigation AMR à la manipulation complète, autrement dit le "dernier mètre" longtemps considéré comme le verrou technologique de l'automatisation logistique. La capacité à saisir, orienter et déposer des références variables sans reprogrammation est le différenciateur clé que les intégrateurs et COO logistiques attendent pour justifier un déploiement à grande échelle. En intégrant NeuraGrasp nativement, Locus évite la dépendance aux end-effectors tiers et peut proposer une offre AMR plus manipulation sous une seule architecture logicielle, simplifiant les cycles d'intégration. Fondée en 2014 à partir du spin-off de Quiet Logistics, Locus Robotics a traversé une période difficile en 2023 avec des restructurations et des recherches de financement, rendant cette acquisition d'autant plus significative comme signal de repositionnement. Le marché de la logistique robotisée est en pleine consolidation, avec des acteurs comme Exotec (France, système Skypod), Geek+ et 6 River Systems (Shopify) qui renforcent eux aussi leurs offres en manipulation. Nexera avait développé NeuraGrasp autour de la dextérité multi-références. L'intégration dans le portfolio Locus Array est annoncée sans calendrier de déploiement précisé à ce stade.

BusinessOpinion
1 source
Découvrez les dernières avancées en automatisation logistique au Robotics Summit
3555Robotics Business Review 

Découvrez les dernières avancées en automatisation logistique au Robotics Summit

La prochaine édition du Robotics Summit & Expo se tiendra les 27 et 28 mai 2026 à Boston, avec un programme centré en partie sur l'automatisation logistique. L'événement, organisé par The Robot Report et WTWH Media, mobilisera plus de 70 intervenants confirmés issus de Tesla, Toyota Research Institute, PickNik Robotics, Harmonic Drive ou encore Fictiv, pour plus de 50 sessions réparties en cinq tracks thématiques. La logistique constitue l'un des fils directeurs de l'édition, adossée à un chiffre fourni par Interact Analysis : en 2025, les prises de commandes dans l'automatisation d'entrepôt ont progressé de 7%, à un rythme supérieur aux prévisions initiales, portées par des investissements massifs d'Amazon, Tesco et Marks & Spencer. Le track logistique comprend des interventions de Teddy Ort, SVP robotics software & AI chez Symbotic, sur le passage à l'échelle des robots autonomes ; d'Anthony Jules, co-fondateur et CEO de Robust AI, sur l'ergonomie des robots en entrepôt ; et de Jan Zizka, co-fondateur et CEO de Brightpick, sur les entrepôts en mode "lights-out", c'est-à-dire sans présence humaine permanente. Chris Morgan (Bastian Solutions), Greg Meyne (enVista) et Omar Asali (Ranpak) complèteront le tableau sur l'intégration des AMR (robots mobiles autonomes) et l'impact des IA physiques sur la rentabilité opérationnelle. L'intérêt de cet événement pour les intégrateurs et les décideurs industriels tient moins aux conférences elles-mêmes qu'aux signaux qu'elles envoient sur la maturité du secteur. Le fait que Symbotic, Robust AI et Brightpick soient amenés à parler de "scale" et de "lights-out" plutôt que de démos techniques marque un glissement du discours : le secteur tente de valider que les systèmes robotiques tiennent en conditions réelles, pas seulement en environnements contrôlés. La progression de 7% des commandes en 2025 est réelle, mais elle reste à nuancer, car Interact Analysis agrège des technologies très hétérogènes (convoyeurs, AMR, bras articulés, trieurs). Le chiffre global masque des disparités importantes selon les segments. Le Robotics Summit existe depuis plusieurs années comme rendez-vous technique de référence aux États-Unis pour les développeurs de robotique commerciale, co-localisé cette année avec DeviceTalks Boston, qui adresse le marché des dispositifs médicaux. Côté networking, le premier soir accueille le dîner de remise des RBR50 Robotics Innovation Awards (de 18h à 20h), avec Aaron Parness et Bhavana Chandrashekhar d'Amazon Robotics en invités de marque. Le deuxième jour démarre avec un Women in Robotics Breakfast réunissant Joyce Sidopoulos (MassRobotics) et Mikell Taylor, head of robotics strategy chez GM. Aucun acteur européen ou français n'est mentionné dans le programme publié à ce stade. Les inscriptions sont ouvertes.

IndustrielActu
1 source
Premier enchères mondial pour robots humanoïdes, présenté lors du plus grand événement commercial de Chine
3556Interesting Engineering 

Premier enchères mondial pour robots humanoïdes, présenté lors du plus grand événement commercial de Chine

JD.com, géant chinois du e-commerce, a annoncé le lancement de la première vente aux enchères mondiale de robots humanoïdes, prévue dans le cadre de son festival annuel "618" prévu en juin 2026. L'initiative a été dévoilée lors de la conférence de lancement de l'édition 2026 du festival, sans que la liste des modèles disponibles à l'enchère ne soit encore communiquée. L'annonce s'inscrit dans un plan de déploiement robotique plus large sur cinq ans : JD.com vise l'intégration de 3 millions de robots, 1 million de véhicules autonomes et 100 000 drônes dans ses opérations. Pour 2026 seul, JD Retail cible un chiffre d'affaires robotique supérieur à 1,47 milliard de dollars, avec un objectif de réduction des cycles de lancement produit de 30 %. La plateforme robotique maison JoyInside, dirigée par Dai Wenjun, vise une connexion à plus de 10 millions de terminaux cette année, avec Unitree Robotics et Noetix Robotics déjà intégrés. En parallèle, Shanghai a annoncé son intention de déployer 100 000 robots humanoïdes dans les usines d'ici la fin du 15e Plan quinquennal (2026-2030), avec un objectif d'adoption des agents IA supérieur à 80 % dans les grandes entreprises industrielles. Ces annonces illustrent un pivot majeur dans la trajectoire commerciale des humanoïdes en Chine : la vente aux enchères publique est un signal de repositionnement, cherchant à normaliser ces machines aux yeux des acheteurs professionnels et grand public, plutôt qu'à les cantonner aux salons et démonstrations. Pour les intégrateurs et les décideurs industriels, l'intégration de fabricants comme Unitree dans une plateforme e-commerce à grande échelle crée un canal de distribution inédit, potentiellement capable d'accélérer les cycles d'adoption en entreprise. Il reste cependant à noter que les chiffres avancés (3 millions de robots, 100 000 humanoïdes en usine) sont des objectifs déclaratifs, sans métriques de déploiement réel à date, et que les modèles concrets mis aux enchères n'ont pas été précisés, limitant la portée opérationnelle immédiate de l'annonce. La Chine consolide ainsi sa stratégie d'intégration de l'IA incarnée à l'échelle industrielle, dans un contexte de compétition internationale intense. Unitree Robotics, dont les robots G1 et H1 ont acquis une visibilité mondiale, et Noetix représentent la vague actuelle des fabricants chinois d'humanoïdes qui cherchent à passer du stade de la démonstration à celui du produit commercialisable. Face à eux, Figure (avec le 03), Boston Dynamics, Agility Robotics et Tesla (Optimus Gen 3) structurent le paysage occidental. L'enchère JD.com pourrait servir de test de marché grandeur nature avant des déploiements industriels planifiés dès 2026, avec Shanghai comme vitrine nationale des ambitions chinoises en robotique humanoïde.

Chine/AsieOpinion
1 source
Nagel renforce sa stratégie d'automatisation industrielle grâce à un partenariat avec Stäubli Robotics
3557Robotics & Automation News 

Nagel renforce sa stratégie d'automatisation industrielle grâce à un partenariat avec Stäubli Robotics

Nagel Technologies, société d'ingénierie spécialisée dans les solutions industrielles, a officiellement rejoint le réseau des partenaires autorisés de Stäubli Robotics. Ce statut d'"Authorized Partner" confère à Nagel un accès privilégié aux technologies robotiques du fabricant suisse, ainsi qu'un support technique renforcé et une intégration plus étroite dans l'écosystème commercial de Stäubli. Les deux entreprises présentent ce rapprochement comme un levier pour proposer aux industriels des solutions "plus performantes, plus flexibles et pleinement intégrées", sans que des chiffres de déploiement ou des références clients spécifiques ne soient communiqués à ce stade. Pour les intégrateurs et décideurs industriels, ce type de partenariat structuré signifie concrètement un accès prioritaire aux gammes de robots Stäubli (bras à 6 axes, robots SCARA, cobots TX2), à la formation certifiée et aux outils d'ingénierie dédiés. Cela réduit les délais de mise en service et renforce la crédibilité commerciale de Nagel face à des donneurs d'ordres exigeant des garanties sur la chaîne d'intégration. Il s'agit néanmoins d'une annonce de partenariat commercial, pas d'un déploiement de ligne de production documenté. Stäubli Robotics, filiale du groupe suisse Stäubli International fondé en 1892, est présent dans l'automatisation industrielle avec une gamme couvrant l'automobile, l'électronique et l'agroalimentaire. Nagel s'inscrit dans un mouvement plus large de consolidation des réseaux de distribution et d'intégration que les grands fabricants de robots accélèrent face à la demande croissante d'automatisation en Europe. Les prochaines étapes probables incluent des projets pilotes communs et une montée en compétence des équipes Nagel sur les plateformes Stäubli.

FR/EU ecosystemeActu
1 source
Locus Array élargit ses capacités de préhension grâce à NeuraGrasp de Nexera Robotics
3558Robotics Business Review 

Locus Array élargit ses capacités de préhension grâce à NeuraGrasp de Nexera Robotics

Locus Robotics a annoncé l'acquisition de Nexera Robotics, une startup canadienne basée à Vancouver, quelques semaines à peine après le lancement commercial de son robot mobile manipulateur Locus Array. Le coeur de la transaction : NeuraGrasp, un préhenseur développé par Nexera qui combine une membrane souple et conforme, de la vision par ordinateur et de l'intelligence artificielle embarquée. Cette technologie remplacera l'effecteur à ventouse actuel de l'Array, avec pour objectif d'élargir la couverture SKU à des catégories jusqu'ici problématiques pour les systèmes de picking robotisé : sacs en polyéthylène poreux, vêtements en vrac, emballages pharmaceutiques irréguliers, petite électronique et produits de grande consommation jusqu'à 2,2 kg (comme un flacon de lessive). Nexera revendique plusieurs millions de picks réalisés à ce jour. Roy Belak, CEO de Nexera, rejoint la structure Locus, dont le CEO Rick Faulk et la chief strategy officer Gina Chung pilotent l'intégration. Les clients existants de Nexera seront repris au cas par cas. L'enjeu est direct pour les opérateurs logistiques et les intégrateurs : le goulot d'étranglement du picking robotisé n'a jamais été la navigation ni la planification de trajectoire, mais bien la préhension elle-même. Rueben Scriven, analyste chez Interact Analysis spécialisé en automatisation logistique, confirme que "la manipulation et la saisie d'articles - et donc la couverture SKU - a été l'un des plus grands obstacles". Le passage d'un préhenseur à ventouse à un système hybride membrane/IA adresse structurellement cette limite : la ventouse échoue sur les surfaces poreuses ou souples, et le changement d'outil (tool switching) est éliminatoire pour la plupart des clients en environnement haute cadence. Locus affirme que les SKU couvertes par NeuraGrasp représentent la majorité du e-commerce. Si le chiffre est plausible dans sa direction, il reste à vérifier dans des déploiements réels diversifiés : les démonstrations vidéo en conditions contrôlées ne garantissent pas les performances en picking haute vitesse sur des millions de références actives. Locus Robotics, qui avait connu des difficultés financières en 2023 avant de se restructurer, mise sur l'Array pour repositionner son offre au-delà des AMR (robots mobiles autonomes) de transport vers la manipulation autonome intégrée. L'Array a d'ailleurs reçu le prix RBR50 Robotics Innovation Award 2026, décerné par Robotics Business Review. Sur le marché, les concurrents directs incluent des systèmes de picking intégré comme ceux d'Exotec (France, avec le Skypod), Boston Dynamics (Stretch), Berkshire Grey ou encore Mujin, ainsi que les bras de picking d'Amazon Robotics. L'acquisition de Nexera positionne Locus sur le segment "un seul préhenseur universel" plutôt que sur des solutions multi-effecteurs, un pari technologique cohérent mais dont la validation à l'échelle industrielle reste la prochaine étape critique. Hamid Montazeri, SVP Software & AI chez Locus, interviendra au Robotics Summit & Expo de Boston la semaine prochaine.

IndustrielOpinion
1 source
Hyundai étend sa stratégie robotique aux États-Unis avec un déploiement de 25 000 robots humanoïdes Atlas
3559Interesting Engineering 

Hyundai étend sa stratégie robotique aux États-Unis avec un déploiement de 25 000 robots humanoïdes Atlas

Hyundai Motor Group prévoit de déployer plus de 25 000 robots humanoïdes Atlas, développés par sa filiale Boston Dynamics, dans les usines de Hyundai Motor et Kia aux États-Unis. L'annonce a été faite lors d'une session organisée par JPMorgan Chase. Le groupe vise une capacité de production annuelle de 30 000 unités Atlas d'ici 2028, avec la fabrication locale de plus de 300 000 actionneurs par an, les composants qui font office d'articulations mécaniques. Le PDG de Kia Corporation, Song Ho-sung, a précisé lors de road shows que les premiers Atlas devraient entrer en service au Hyundai Motor Group Metaplant America en Géorgie en 2028, puis à l'usine Kia de Géorgie en 2029. Aucun calendrier détaillé par site ni liste de factories prioritaires n'a été communiqué. En parallèle, Boston Dynamics a publié un billet technique détaillant comment Atlas manipule des objets industriels lourds : le robot pivote son torse à 180 degrés, s'accroupit pour saisir un mini-réfrigérateur et le transporte en compensant dynamiquement les déplacements de masse interne. Cette capacité a été développée en quelques semaines via apprentissage par renforcement sur des millions d'heures de simulation GPU en parallèle. Ces chiffres représentent le déploiement humanoïde annoncé le plus ambitieux dans l'industrie automobile à ce jour. La production d'actionneurs en volume suggère une intégration verticale qui pourrait compresser les coûts unitaires sur le long terme. Sur le plan technique, l'approche de Boston Dynamics repose principalement sur la proprioception, c'est-à-dire la conscience interne du mouvement et des forces corporelles, plutôt que sur des systèmes de vision dominants, ce qui diverge des architectures VLA (Vision-Language-Action) adoptées par des concurrents comme Physical Intelligence avec son modèle pi-0 ou Figure AI. L'entreprise affirme avoir réduit le "sim-to-real gap" via une architecture simplifiée à deux types d'actionneurs seulement et des membres symétriques, améliorant la fidélité entre simulation et comportement physique réel. Si cette réduction se confirme en production, cela constituera un argument technique fort face à des plateformes plus complexes comme Tesla Optimus Gen 3 ou Apptronik Apollo. Boston Dynamics a présenté la version entièrement électrique d'Atlas en avril 2024, mettant fin à la plateforme hydraulique exploitée depuis 2013. Hyundai avait racheté l'entreprise à SoftBank en 2021 pour environ 1,1 milliard de dollars. L'annonce intervient dans une course industrielle intense : Tesla vise une production de masse d'Optimus, Figure AI a levé 675 millions de dollars pour son robot Figure 02, et Agility Robotics, propriété d'Amazon, déploie son Digit dans des entrepôts logistiques. En Europe, les acteurs restent à des stades plus précoces : Enchanted Tools à Paris développe Miroki pour la logistique hospitalière, tandis que Wandercraft se concentre sur les exosquelettes médicaux. Les prochaines étapes pour HMG incluent la confirmation des sites pilotes et le démarrage effectif des lignes de production d'actionneurs aux États-Unis, deux éléments qui permettront de distinguer l'annonce commerciale du déploiement réel.

HumanoïdesOpinion
1 source
La sécurité des robots domestiques repose avant tout sur la relation humain-machine
3560IEEE Spectrum Robotics 

La sécurité des robots domestiques repose avant tout sur la relation humain-machine

L'Organisation internationale de normalisation (ISO) révise ISO 13482, sa norme de sécurité pour les robots de soin personnel, vieille de douze ans. La mise à jour est actuellement en phase d'approbation finale. Elle couvre l'identification des dangers, l'évaluation des risques et différents scénarios d'utilisation, mais n'établit ni seuils contraignants, ni méthodes de test, ni mécanismes d'application pour les risques liés à l'interaction humain-robot. C'est précisément ce manque que dénonce Jae-Seong Lee, chercheur en politique technologique à l'Electronics and Telecommunications Research Institute de Daejeon (Corée du Sud), dans une interview accordée à IEEE Spectrum. La norme entre en phase finale au moment où les fabricants d'humanoïdes domestiques basculent des prototypes de laboratoire vers des produits destinés à de vraies maisons, de vrais aidants et de vraies familles. Le problème central identifié par Lee est autant conceptuel que technique : la sécurité d'un robot domestique n'est pas une propriété fixe de la machine, elle émerge de la relation entre le robot et l'humain. L'interaction est bidirectionnelle, le robot modifie le comportement de l'humain, et l'humain modifie ce que le robot perçoit et décide ensuite. Les normes industrielles classiques peuvent borner la tâche, l'espace de travail et la population concernée. Dans un domicile, le robot doit s'adapter à des personnes âgées, des enfants, des visiteurs, des animaux, du désordre et des espaces confinés. Ce ne sont pas des cas marginaux : c'est le cadre opérationnel de base. Contraindre l'enveloppe d'un humanoïde domestique pour la rapprocher d'un robot industriel reviendrait à annuler son utilité. Par ailleurs, les entreprises qui constituent les jeux de données d'entraînement envoient déjà des travailleurs salariés filmer leurs tâches quotidiennes dans des logements ordinaires à travers le monde, ancrant la variabilité réelle du terrain dans les modèles. Le problème de sécurité se situe donc au niveau du système humain-robot complet, pas d'un composant isolé. ISO 13482 avait été publiée en 2014, dans un contexte où les robots de soin se limitaient à des assistants de mobilité et des plateformes relativement simples. Douze ans plus tard, des acteurs comme Figure AI, Boston Dynamics, 1X ou Agility Robotics positionnent des humanoïdes polyvalents comme prochaine étape du travail domestique et du maintien à domicile. En Europe, des entreprises comme Enchanted Tools avec son Mirokaï ou Wandercraft évoluent dans des environnements réglementaires similaires, ce qui leur confère une exposition directe à ce vide normatif. Le déficit identifié par Lee est avant tout un déficit de gouvernance : la communauté technique comprend le couplage bidirectionnel, le cadre normatif reconnaît les dangers associés, mais aucune norme ne traduit aujourd'hui cette compréhension en règles applicables pour l'autonomie domestique. Une question reste aussi ouverte : qui décide quel comportement humain est "normal" ? Quelle démarche sert de référence, et quel seuil de risque est acceptable pour une personne âgée à mobilité réduite par rapport à un adulte valide ? Sans réponse à ces questions, la prochaine génération de robots domestiques arrivera sur le marché sans cadre de sécurité adapté à sa réalité opérationnelle.

RegulationReglementation
1 source
Lightwheel annonce 100 millions de dollars de commandes au premier trimestre pour son infrastructure de robotique à IA physique
3561Robotics & Automation News 

Lightwheel annonce 100 millions de dollars de commandes au premier trimestre pour son infrastructure de robotique à IA physique

Lightwheel, startup américaine spécialisée dans l'infrastructure pour robots physiques, annonce avoir enregistré environ 100 millions de dollars de commandes au cours du seul premier trimestre 2026. La société développe des briques logicielles dédiées à la simulation, à la génération de données synthétiques, à l'évaluation de modèles et au déploiement à l'échelle de robots pilotés par de l'intelligence artificielle physique. Le communiqué ne précise ni les clients ni les volumes unitaires concernés, ce qui limite la portée des chiffres annoncés. Ce résultat, s'il se confirme, illustre un changement de phase dans le secteur : les industriels cessent d'expérimenter et commencent à chercher des solutions d'infrastructure clé-en-main pour passer des prototypes au déploiement réel. L'infrastructure de formation, simulation haute fidélité, pipelines de données synthétiques, évaluation en boucle fermée, émerge comme un marché autonome, distinct de la fabrication des robots eux-mêmes. Pour les intégrateurs et les équipes d'automatisation, cela signifie que la question n'est plus seulement "quel robot acheter ?" mais "quelle stack d'entraînement et de qualification choisir ?". Lightwheel s'inscrit dans l'écosystème dit de la "physical AI", terme popularisé par NVIDIA avec sa plateforme Isaac et ses partenaires comme Agility Robotics, Boston Dynamics ou Figure. Ses concurrents directs sur le segment données-simulation incluent Scale AI, Synthesis AI et les stacks propriétaires que développent en interne les fabricants de robots humanoïdes. La prochaine étape à surveiller : des références clients nommées et des métriques de déploiement réel, seuls indicateurs capables de valider que la demande annoncée se traduit en robots effectivement opérationnels en production.

InfrastructureActu
1 source
Yaskawa et Dale Automation s'associent pour améliorer l'efficacité industrielle en Afrique australe
3562Robotics & Automation News 

Yaskawa et Dale Automation s'associent pour améliorer l'efficacité industrielle en Afrique australe

Yaskawa Southern Africa et Dale Automation ont officialisé un partenariat visant à automatiser les opérations de fin de ligne dans les usines d'Afrique australe. L'initiative cible en priorité les secteurs agroalimentaires, où la demande de produits transformés s'accélère, ainsi que les environnements manufacturiers exposés à une hausse structurelle des coûts salariaux. Dale Automation apporte son expertise en manutention et en intégration de systèmes, tandis que Yaskawa fournit ses bras articulés et ses contrôleurs de mouvement. Le contenu complet de l'annonce reste partiel, l'article source est tronqué, aucun chiffre de déploiement, de prix ni de site client n'est communiqué à ce stade. Le signal industriel demeure pertinent : l'Afrique australe, longtemps considérée comme un marché secondaire pour la robotique industrielle en raison d'un accès facile à la main-d'oeuvre, commence à basculer vers l'automatisation sous la pression combinée de l'inflation salariale et des exigences de cadence dans l'agroalimentaire. Pour les intégrateurs et les décideurs B2B de la région, ce type de partenariat distributeur-OEM signale une montée en maturité du marché local, avec un accès simplifié au support technique et aux pièces détachées Yaskawa. Yaskawa, fondé en 1915 à Kitakyushu (Japon), est l'un des quatre grands fabricants mondiaux de robots industriels avec FANUC, ABB et KUKA, et opère via un réseau de filiales et partenaires régionaux. Dale Automation est un intégrateur établi en Afrique du Sud. La prochaine étape attendue serait l'annonce de déploiements pilotes chez des clients identifiés, notamment dans la chaîne d'approvisionnement alimentaire sud-africaine.

IndustrielActu
1 source
La Chine mise sur l'IA et la fabrication avancée pour contrer les vents économiques contraires
3563SCMP Tech 

La Chine mise sur l'IA et la fabrication avancée pour contrer les vents économiques contraires

Le Premier ministre chinois Li Qiang a effectué lundi une visite symbolique à Pékin, passant par l'usine de véhicules électriques de Xiaomi puis par le Humanoid Robot Innovation Centre, un hub qui regroupe plus d'une douzaine de start-ups spécialisées en IA incarnée (embodied AI), des partenaires industriels et des institutions de recherche. Lors de cette tournée, Li a appelé à une intégration accélérée entre les acteurs de l'IA et le secteur de la fabrication avancée, positionnant cette convergence comme levier de croissance prioritaire face au ralentissement de la demande intérieure et aux pressions commerciales extérieures, notamment les tensions tarifaires avec les États-Unis. Le signal politique est clair : Pékin veut transformer ses capacités en robotique humanoïde et en IA générative en avantages compétitifs industriels concrets, pas seulement en vitrines technologiques. Pour les intégrateurs et décideurs B2B, cela signifie une accélération probable des déploiements pilotes en usine, avec un soutien étatique direct aux start-ups locales. La visite du Humanoid Robot Innovation Centre illustre aussi la stratégie de clustering : concentrer capital, talents et clients industriels pour réduire le fossé entre démo lab et déploiement réel. Ce mouvement s'inscrit dans une trajectoire déjà engagée : la Chine a multiplié les programmes de soutien à la robotique humanoïde depuis 2023, avec des acteurs comme Unitree, Fourier Intelligence ou Agibot qui affichent des cadences de production croissantes. Face à eux, les acteurs américains (Figure AI, Physical Intelligence, Tesla Optimus) et européens avancent sur des segments différents. La prochaine étape à surveiller sera la concrétisation de ces orientations politiques en contrats industriels mesurables.

Chine/AsieOpinion
1 source
Automatisation sans code : un seul guide vidéo pour piloter trois robots complètement différents
3564Interesting Engineering 

Automatisation sans code : un seul guide vidéo pour piloter trois robots complètement différents

Des chercheurs du Laboratoire d'algorithmes d'apprentissage et de systèmes (LASA) à l'École Polytechnique Fédérale de Lausanne (EPFL) ont présenté un framework de contrôle robotique baptisé Kinematic Intelligence, capable de transférer une compétence apprise à partir d'une seule démonstration humaine vers des robots de morphologies entièrement différentes, sans réécrire une ligne de code. Dans une expérience sur ligne d'assemblage, une personne a démontré une séquence en trois étapes : pousser un bloc en bois d'un tapis roulant vers un établi, le placer sur une table, puis le jeter dans un panier. Trois robots commerciaux distincts ont ensuite reproduit cette séquence de manière fiable, chacun prenant en charge des étapes différentes. Le système a fonctionné même lorsque la répartition des tâches entre les robots a été modifiée en cours d'expérience, comme l'a précisé Sthithpragya Gupta, doctorant et co-premier auteur : "Chaque robot interprète la même compétence à sa façon, mais toujours dans des limites sûres et faisables." L'enjeu industriel est direct. Aujourd'hui, intégrer un nouveau modèle de robot dans une ligne de production existante implique souvent une reprogrammation complète des tâches, même si le robot entrant est fonctionnellement similaire au précédent. Chaque configuration articulaire différente, chaque amplitude de mouvement propre à un constructeur, exige un travail d'adaptation coûteux en temps et en expertise. Kinematic Intelligence adresse ce goulet d'étranglement en abstrayant la tâche démontrée non pas dans les coordonnées articulaires d'un robot spécifique, mais dans une représentation géométrique universelle ancrée sur la position et la trajectoire de l'effecteur terminal dans l'espace. Cette représentation est ensuite réexprimée dans les termes cinématiques du robot cible, avec une vérification explicite que chaque instruction traduite reste dans l'enveloppe physiquement et sûrement exécutable par la machine. Ce n'est donc pas une simple transposition de mouvements : c'est une garantie de faisabilité avant exécution, ce qui distingue le système d'approches par imitation directe souvent fragiles hors contexte de démonstration. Le LASA, dirigé par la professeure Aude Billard, travaille depuis plusieurs années sur l'apprentissage par démonstration et les systèmes dynamiques pour la robotique. Le framework s'inscrit dans un contexte de marché humanoïde en pleine accélération, où Figure, Agility Robotics, 1X ou Apptronik itèrent leurs plateformes matérielles tous les six à dix-huit mois, rendant la portabilité des compétences entre générations de hardware critique pour la viabilité économique des déploiements. Les chercheurs annoncent vouloir étendre Kinematic Intelligence à la collaboration homme-robot et à l'interaction en langage naturel, permettant à terme à un utilisateur non-technicien d'instruire un robot par commandes simples. Le papier complet n'était pas encore publié au moment de l'annonce : les résultats restent pour l'instant à valider par la communauté en dehors du cadre contrôlé de la démonstration EPFL.

RecherchePaper
1 source
AgiBot lance une startup spécialisée en mains dextériques qui atteint le statut de licorne en 4 mois
3565Pandaily 

AgiBot lance une startup spécialisée en mains dextériques qui atteint le statut de licorne en 4 mois

Lingjiandian (临界点), spin-off d'AgiBot (智元机器人) fondée en janvier 2026 et spécialisée dans les mains dextères pour robots humanoïdes, a bouclé un tour de financement de plusieurs centaines de millions de yuans, atteignant une valorisation supérieure à 1 milliard de dollars en seulement quatre mois. C'est la montée en licorne la plus rapide jamais enregistrée sur le segment des composants critiques pour humanoïdes en Chine. La société a réalisé quatre tours de table en moins de cinq mois : deux rounds successifs en janvier 2026, espacés de six jours, co-menés par Hillhouse Ventures et BlueRun Ventures, un troisième en février, puis ce dernier tour récemment clôturé avec sur-souscription des actionnaires existants. Les fonds sont fléchés vers le développement d'un grand modèle dédié à la manipulation dextère, la constitution d'un dataset open-source, et l'évolution hardware des produits. La cadence de financement révèle l'appétit des investisseurs pour les équipementiers de la supply chain humanoïde, en particulier sur la manipulation dextère, considérée comme l'un des verrous technologiques les plus difficiles de la stack d'IA incarnée (embodied AI). Les mains à haute dextérité conditionnent la capacité des robots à sortir des environnements contrôlés pour réaliser des tâches industrielles précises : assemblage, picking complexe, opérations spécialisées. Un fournisseur capable de proposer un composant clé à l'échelle, couplé à un modèle IA spécialisé et un dataset mutualisé, pourrait devenir un référenceur transversal pour plusieurs constructeurs d'humanoïdes simultanément, ce que les intégrateurs industriels et les décideurs B2B surveillent de près. AgiBot, la société mère, a été fondée en 2023 et s'est imposée comme l'un des acteurs humanoïdes les mieux financés de Chine, aux côtés d'Unitree, Fourier Intelligence et Galbot. Le spin-off de Lingjiandian illustre une tendance de verticalisation ciblée de la chaîne de valeur : plutôt que d'internaliser tous les sous-systèmes, certaines équipes se concentrent sur des composants critiques à forte valeur ajoutée. À l'international, Shadow Robot (Royaume-Uni) et Wonik IPS (Corée) travaillent des positionnements similaires, mais sans cette vélocité de financement. Les prochaines étapes annoncées incluent des déploiements dans l'automatisation industrielle et la robotique de service, avec un dataset open-source qui pourrait devenir un standard de facto pour la manipulation dextère dans l'écosystème humanoïde chinois.

Chine/AsieOpinion
1 source
Les robots ont-ils vraiment besoin de mains anthropomorphiques ? Comparaison entre mains humaines et robotiques
3566arXiv cs.RO 

Les robots ont-ils vraiment besoin de mains anthropomorphiques ? Comparaison entre mains humaines et robotiques

Une revue systématique publiée sur arXiv (2508.05415) pose une question directe : les robots ont-ils vraiment besoin de mains anthropomorphes ? Après analyse de 125 articles scientifiques couvrant 2019 à 2025, les auteurs concluent que les mains à cinq doigts, souvent présentées comme l'objectif ultime de la manipulation robotique, ne sont pas nécessaires pour la majorité des tâches. En comparant les propriétés biomécaniques de la main humaine (degrés de liberté, capteurs cutanés, contrôle moteur) avec les mains robotiques commerciales disponibles aujourd'hui, ils montrent que la complexité mécanique ne se traduit pas systématiquement par une meilleure dextérité pour la manipulation en main (in-hand manipulation). Des mécanismes à deux ou trois doigts se révèlent souvent aussi efficaces pour des applications industrielles ciblées. Pour les intégrateurs et les décideurs industriels, ce résultat remet en cause une hypothèse répandue : reproduire la morphologie humaine ne garantit pas des performances humaines. La revue établit qu'une main à cinq doigts augmente l'étendue des tâches réalisables, mais apporte peu d'avantage pour la manipulation fine d'objets déjà saisis. Plus significatif encore, l'intégration de capteurs et les stratégies de manipulation intelligentes restent sous-exploitées dans la littérature, car la recherche se concentre sur la réplication du nombre de doigts et des DOF plutôt que sur la robustesse mécanique et la compliance. Les auteurs soulignent que des mains plus souples et robustes permettraient un meilleur apprentissage par contact environnemental et une intégration plus dense de capteurs, deux leviers actuellement sacrifiés au profit de l'esthétique biomimétique. Cette remise en question survient dans un contexte de course au design anthropomorphe, portée par les humanoïdes de Figure (Figure 03), Tesla (Optimus Gen 3), 1X Technologies et Agility Robotics, dont les mains à cinq doigts sont systématiquement mises en avant dans les communications marketing. La question n'est pourtant pas nouvelle : les grippers industriels bi-digitaux de Robotiq, OnRobot et Schunk dominent les lignes d'assemblage depuis des années. L'accumulation de preuves empiriques sur 125 publications donne à cet argument une base scientifique que les annonces de lancement ne pouvaient pas offrir. Les auteurs plaident pour des critères d'évaluation standardisés, un manque criant alors que chaque laboratoire définit ses propres benchmarks, condition nécessaire pour que le secteur sorte du cycle annonce/démo et entre dans une phase d'industrialisation mesurable.

RecherchePaper
1 source
DexHoldem : jouer au Texas Hold'em avec un système à IA incarnée dextérique
3567arXiv cs.RO 

DexHoldem : jouer au Texas Hold'em avec un système à IA incarnée dextérique

Une équipe de chercheurs a publié DexHoldem, un benchmark système conçu pour évaluer les robots dextres sur du matériel physique réel. Structuré autour de la manipulation de cartes Texas Hold'em, il mobilise une ShadowHand (24 degrés de liberté) et propose 1 470 démonstrations téléopérées couvrant 14 primitives de manipulation : distribution, tri, retournement de cartes et autres gestes imposant précision et continuité de scène. Sur l'exécution des primitives, le modèle pi-0.5 de Physical Intelligence obtient le meilleur taux de complétion brute à 61,2 %, et s'aligne avec pi-0 sur le taux de succès "préservant la scène" à 47,5 %. Sur la perception agentique, Claude Opus 4.7 d'Anthropic décroche la meilleure précision stricte au niveau du problème complet à 34,3 %, tandis que GPT-5.5 d'OpenAI atteint la meilleure précision champ par champ à 66,8 %. Ces résultats exposent une fracture structurelle dans les pipelines VLA actuels : reconnaître 66,8 % des éléments visuels individuellement ne garantit pas de reconstituer l'état global de la scène, indispensable au routage décisionnel. Pour un intégrateur ou un décideur industriel, cela signifie qu'un modèle performant sur des primitives isolées peut s'effondrer en boucle fermée dès que les erreurs de perception et d'exécution s'accumulent. Les trois études de cas en boucle complète du benchmark le confirment : attentes, replanifications, demandes d'aide humaine et réexécutions émergent comme comportements nécessaires à la robustesse. DexHoldem formalise ainsi une contrainte rarement évaluée dans la littérature : laisser la scène utilisable pour les décisions suivantes, et non simplement compléter chaque primitive en isolation. La ShadowHand, produite par Shadow Robot Company (Royaume-Uni), est une référence académique de longue date dans la manipulation dextre. Le benchmark s'inscrit dans la vague des évaluations système intégrées qui émergent en 2025 face à la multiplication des VLA, dont pi-0, pi-0.5, GR00T N2 de NVIDIA ou encore Helix de Figure. En choisissant le poker comme cadre d'évaluation, les auteurs imposent une perception structurée, une séquence longue et une contrainte d'état partagé entre actions successives, trois propriétés que les benchmarks à primitives isolées ne capturent pas. Le jeu de données de 1 470 démonstrations et le code du benchmark sont disponibles en open source sur dexholdem.github.io, ce qui le rend directement exploitable pour calibrer des pipelines dextres sur des conditions réelles reproductibles.

RechercheOpinion
1 source
Les facteurs de succès en planification physique avec des modèles du monde prédictifs à embedding joint
3568arXiv cs.RO 

Les facteurs de succès en planification physique avec des modèles du monde prédictifs à embedding joint

Des chercheurs de Meta AI (FAIR) ont publié une étude systématique des modèles du monde à architecture prédictive par plongement conjoint, désignés sous l'acronyme JEPA-WM (Joint-Embedding Predictive Architecture World Models), appliqués à la planification physique d'agents autonomes. L'équipe a analysé trois dimensions techniques critiques : architecture du modèle, objectif d'entraînement et algorithme de planification, sur des environnements simulés et sur des données robotiques réelles, pour des tâches de navigation et de manipulation. Au terme de cette ablation, ils proposent une configuration qui surpasse deux baselines de référence, DINO-WM et V-JEPA-2-AC. Le code, les checkpoints et les données sont accessibles publiquement sur GitHub (facebookresearch/jepa-wms). L'originalité des JEPA-WM tient à leur mode de planification : plutôt que d'opérer dans l'espace d'entrée brut (pixels, vecteurs d'état), ces modèles planifient dans l'espace de représentation appris, ce qui permet d'abstraire les détails visuels non pertinents et d'accélérer la recherche de trajectoires. La contribution principale de ce travail n'est pas une nouvelle architecture, mais un guide empirique des choix qui font réellement la différence. Pour un intégrateur ou une équipe R&D robotique, cela comble un vide récurrent dans la littérature : savoir quelles décisions d'implémentation ont de l'impact, et lesquelles n'en ont pas. Le fait que les expériences couvrent des données réelles, et pas uniquement de la simulation, renforce la crédibilité des conclusions et réduit partiellement le problème classique du gap sim-to-real qui fragilise beaucoup de travaux sur les world models pour la manipulation. Les JEPA (Joint-Embedding Predictive Architectures) constituent une famille de modèles portée par Yann LeCun et FAIR comme alternative aux architectures génératives classiques (diffusion, autorégressif) pour modéliser le monde physique. V-JEPA-2, sorti début 2025, en représentait une étape clé ; V-JEPA-2-AC, l'une des baselines ici surpassées, en est la variante avec conditionnement par actions. DINO-WM, l'autre référence, combine des features DINO avec une planification par modèle du monde. Cette étude s'inscrit dans un contexte de forte compétition autour des modèles fondationnels pour la robotique, où Physical Intelligence (pi.), Google DeepMind, et des acteurs européens comme Enchanted Tools ou Wandercraft développent leurs propres pipelines de planification et de contrôle. Les prochaines étapes naturelles incluraient une mise à l'échelle des données d'entraînement et une extension à des morphologies robotiques plus variées, notamment humanoïdes.

RechercheOpinion
1 source
Marche, course et récupération unifiées pour robots humanoïdes via des priors de mouvement adversariaux adaptatifs
3569arXiv cs.RO 

Marche, course et récupération unifiées pour robots humanoïdes via des priors de mouvement adversariaux adaptatifs

Une équipe de chercheurs a publié fin mai 2026 sur arXiv (arXiv:2605.18611) un framework d'apprentissage par renforcement unifié permettant à un seul contrôleur de faire marcher, courir et se relever après une chute le robot humanoïde Unitree G1, sans commande explicite de changement de mode au déploiement. L'approche étend les Adversarial Motion Priors (AMP) en remplaçant la distribution de référence globale par un mécanisme de routage conditionné à l'état : un seuil fixe sur la gravité projetée (|gz+1| > 0,6, soit environ 37° d'inclinaison du torse par rapport à la verticale) aiguille chaque transition d'entraînement soit vers un discriminateur dédié à la récupération, soit vers un discriminateur de locomotion conditionné par la vitesse commandée, qui couvre à la fois la marche et la course. Seuls trois clips de motion capture extraits du jeu de données LAFAN1 sont nécessaires pour régulariser l'ensemble du comportement. Sur hardware réel, la politique tourne à 50 Hz sous forme d'un fichier ONNX figé, sans aucune logique de mode à l'exécution, et valide des relevés réussis depuis les positions ventrale et dorsale ainsi que des transitions fluides marche-course. Ce résultat s'attaque directement à un problème d'intégration récurrent dans la robotique humanoïde commerciale : la fragmentation en contrôleurs spécialisés par mode, reliés par des automates à états qui génèrent des zones de transition fragiles et coûteuses à maintenir. Démontrer qu'une politique apprise par RL couvre ces régimes de façon continue sur hardware réel, et non uniquement en simulation, affaiblit l'argument du sim-to-real gap rédhibitoire pour les comportements complexes. Le coût d'annotation est lui aussi remarquablement bas : trois clips de reference suffisent là où d'autres travaux en exigent des dizaines, ce qui rend la méthode potentiellement transférable à d'autres plateformes avec un effort de données limité, qu'il s'agisse du PAL Robotics TALOS, du MIROKAÏ d'Enchanted Tools, ou de tout humanoïde léger à faible budget de motion capture. La publication s'inscrit dans une course dense à la locomotion humanoïde robuste, où Boston Dynamics (Atlas), Figure (Figure 03), Agility Robotics (Digit) et Tesla (Optimus Gen 3) investissent massivement, mais publient peu. Sur le plan académique, des approches concurrentes comme les VLA (Vision-Language-Action models) de Physical Intelligence ou les travaux de Berkeley visent des politiques encore plus générales, mais sacrifient souvent la robustesse physique au profit de la flexibilité sémantique. L'utilisation du Unitree G1, disponible à environ 16 000 dollars et largement répandu dans les laboratoires, confère à ces travaux une reproductibilité pratique supérieure aux publications sur plateformes fermées. L'article ne précise pas de timeline de déploiement industriel, mais la compatibilité ONNX et l'absence de logique embarquée à l'exécution réduisent la barrière à l'intégration pour un OEM ou un intégrateur souhaitant évaluer la méthode sur sa propre plateforme.

RecherchePaper
1 source
IA incarnée multi-agents : la dégradation du consentement en chaîne, un pont entre gouvernance des agents et éthique robotique
3570arXiv cs.RO 

IA incarnée multi-agents : la dégradation du consentement en chaîne, un pont entre gouvernance des agents et éthique robotique

Un article académique publié sur arXiv (référence 2605.16300) formule un problème de gouvernance que les cadres réglementaires actuels n'adressent pas : lorsqu'un robot physique délègue une tâche à un autre robot qui en délègue une partie à un troisième, le consentement initial donné par l'humain se dilue à chaque maillon de la chaîne. Les auteurs nomment ce phénomène "Consent Chain Degradation" (CCD) et proposent un cadre conceptuel pour le quantifier, accompagné d'une architecture de supervision en trois couches baptisée CoRVE (Consent Runtime Verification Framework for Embodied Agents). CoRVE intègre un modèle de portée du consentement, un suivi des chaînes de délégation et une évaluation de l'irréversibilité physique des actions. Trois scénarios illustrent le mécanisme : robotique médicale, assistance à domicile et environnement industriel, dont un exemple numérique détaillé. L'enjeu dépasse la théorie. Dans un atelier où un AMR (robot mobile autonome) confie une tâche de manipulation à un bras collaboratif, lui-même supervisé par un système de vision tiers, le consentement opérateur formulé en amont peut ne plus couvrir les actions finales, notamment si elles sont physiquement irréversibles (déplacement d'un patient, coupe d'un matériau, accès à un espace privé). Les auteurs montrent que ni la communauté de l'éthique de l'IA (centrée sur les agents logiciels) ni la communauté HRI (Human-Robot Interaction, focalisée sur les interactions dyadiques humain-robot) n'ont produit de cadre adapté aux écosystèmes multi-robots physiques. C'est un angle mort documenté pour la première fois de façon structurée. L'analyse réglementaire conduite dans le papier révèle que quatre textes européens majeurs, l'AI Act, le RGPD, le Règlement Machines révisé et la Directive révisée sur la responsabilité du fait des produits, laissent tous la dimension CCD sans réponse. Aucun n'impose de traçabilité de la délégation inter-robots ni de vérification dynamique du périmètre de consentement. Ce constat arrive alors que des déploiements multi-agents incarnés commencent à sortir du laboratoire, entrepôts Amazon Robotics, hôpitaux pilotes avec Diligent Robotics, sites industriels Exotec. La prochaine étape naturelle serait une implémentation de référence de CoRVE et une proposition d'amendement aux textes européens, que les auteurs n'ont pas encore publiée.

RegulationOpinion
1 source
Auto-encodeurs épars ancrés dans les événements pour les politiques VLA
3571arXiv cs.RO 

Auto-encodeurs épars ancrés dans les événements pour les politiques VLA

Une équipe de chercheurs a publié le 22 mai 2025 sur arXiv (référence 2605.17204) un pipeline d'interprétabilité pour les politiques Vision-Language-Action (VLA), ces modèles qui traduisent des instructions en langage naturel et des entrées visuelles directement en commandes motrices pour robots. Leur approche, baptisée Event-Grounded SAE (Sparse Autoencoder), ancre l'analyse des représentations internes du modèle à des événements comportementaux concrets plutôt qu'à des contextes textuels. Concrètement, des images-clés (keyframes) de l'effecteur terminal sont extraites et regroupées en clusters selon des critères visuels, d'état et temporels, puis associées optionnellement à des annotations sémantiques via un VLM. La méthode a été validée sur deux architectures en simulation et dans une étude sur robot réel, en ciblant notamment les modèles OpenVLA et pi-0.5 (Physical Intelligence). L'enjeu est considérable pour quiconque déploie des VLA en conditions industrielles : ces politiques restent des boîtes noires dont les représentations internes sont difficiles à auditer. Les outils d'interprétabilité mécaniste développés pour les LLMs ne se transfèrent pas directement aux VLA, car les sorties sont des vecteurs d'action continus, non des tokens lisibles, et chaque intervention ne peut être évaluée que via des rollouts en boucle fermée, coûteux à opérer. Le pipeline présenté est, selon les auteurs, parmi les premiers à ancrer l'analyse SAE dans des événements comportementaux fermés, ce qui produit les effets causaux les plus forts mesurés sur OpenVLA et se transfère aux chunks d'action continus de pi-0.5. Les auteurs notent toutefois des limites : le SAE est une base d'intervention sparse mais imparfaite, dont l'utilisabilité varie selon l'architecture et le point d'injection, et des interventions agressives révèlent des défaillances de sécurité non triviales. Ce travail s'inscrit dans une dynamique d'accélération autour des VLA, où des modèles comme OpenVLA (Berkeley), pi-0 et pi-0.5 (Physical Intelligence), ou encore GR00T N2 (NVIDIA) cherchent à généraliser la commande de robots via des fondations pré-entraînées à grande échelle. L'interprétabilité de ces modèles est devenue un prérequis non négociable pour les déploiements à risque élevé, un angle encore peu adressé face à la course aux benchmarks de performance. Les chercheurs identifient plusieurs directions prioritaires : aller au-delà des coordonnées alignées sur l'action, développer des évaluations en boucle fermée plus granulaires, et concevoir des mécanismes d'intervention sûrs. Le code est disponible publiquement sur GitHub (xc-j/Event-SAE).

IA physiqueOpinion
1 source
Clé-Gram : des connaissances mondiales extensibles pour la manipulation par IA incarnée
3572arXiv cs.RO 

Clé-Gram : des connaissances mondiales extensibles pour la manipulation par IA incarnée

Key-Gram (arXiv:2605.18556, mai 2026) est un preprint qui propose un cadre de mémoire conditionnelle séparant explicitement la connaissance linguistique du raisonnement visuel dans les politiques de manipulation robotique. Là où les architectures VLA (Vision-Language-Action) actuelles fusionnent langage et vision dans un backbone partagé, Key-Gram décompose une instruction en "key-grams" (unités sémantiques propres à la tâche), récupère des priors linguistiques via un lookup déterministe O(1) dans une table externe, puis injecte ces entrées dans des couches cachées sélectionnées via gating contextuel et fusion convolutive légère. Appliqué aux modèles π₀ et π₀.₅ de Physical Intelligence, le système enregistre des gains relatifs de 29,5 %/9,9 % sur le benchmark de simulation RoboTwin2.0, de 35,8 %/4,5 % sur LIBERO-Plus en transfert sans fine-tuning sur le domaine cible, et de 15,4 %/8,1 % sur des tâches longues en manipulation bimanuelle réelle. Ces résultats quantifient un problème structurel rarement isolé dans la littérature VLA : la compétition de modalités dans le backbone partagé, où raisonnement visuel et compréhension linguistique se disputent la capacité de calcul. Le gain de 35,8 % sur LIBERO-Plus sans réentraînement cible est la donnée la plus exploitable pour les intégrateurs industriels : il suggère qu'une mémoire externe améliore la généralisation entre tâches sans fine-tuning complet, réduisant directement le coût de déploiement sur des lignes de production variées. La table de mémoire, extensible sans mise à jour du backbone et chargeable en mémoire hôte à l'inférence, permet d'ajouter de nouveaux vocabulaires de tâches sans redéploiement de l'ensemble du modèle. Physical Intelligence (Pi), fondée en 2023 par d'anciens chercheurs de Google et de l'UC Berkeley, a développé π₀ en 2024 comme VLA généraliste pour la manipulation bimanuelle. Key-Gram s'appuie sur ce backbone sans le modifier, ce qui constitue son atout principal : la séparation de la composante linguistique est architecturalement propre et non-destructive. Sur ce créneau de la généralisation compositionnelle, Google DeepMind, Figure AI (architecture Helix) et 1X Technologies proposent des approches concurrentes à base de transformers multi-modaux. La principale limite du papier est l'absence de validation sur des backbones autres que π, ce qui laisse ouverte la question de la généricité de la méthode.

IA physiqueOpinion
1 source
COAST : débloquer les modèles vision-langage-action (VLA) par les états cachés
3573arXiv cs.RO 

COAST : débloquer les modèles vision-langage-action (VLA) par les états cachés

Des chercheurs ont publié sur arXiv (arXiv:2605.17144) une méthode d'inférence baptisée COAST, Contrastive Conceptor Activation Steering, conçue pour améliorer les performances des modèles Vision-Language-Action (VLA) sans nécessiter aucun réentraînement. Le constat de départ est documenté mais rarement quantifié aussi clairement : malgré un pré-entraînement massif sur des corpus web (images, texte, vidéo), les VLA échouent fréquemment sur des tâches robotiques élémentaires. COAST construit ce qu'on appelle des "conceptors", des opérateurs linéaires qui projettent les données vers les composantes principales d'une distribution cible. En pratique, on fournit au système quelques trajectoires de succès et d'échecs pour une tâche donnée ; COAST en extrait des sous-espaces d'activation critiques pour le succès, puis oriente les états latents du modèle vers ces sous-espaces au moment de l'inférence. Testée sur trois architectures distinctes, VLA à flow-matching, VLA autorégressif et Diffusion Policy, la méthode améliore le taux de succès absolu de plus de 20 points en simulation et de plus de 40 points sur robot réel. Ces chiffres sont significatifs parce qu'ils suggèrent que les VLA actuels encodent déjà une connaissance pertinente pour la tâche dans leurs représentations internes, mais qu'un goulot d'étranglement dans le décodage de l'action empêche cette connaissance de se traduire en comportement fiable. COAST contourne ce problème sans toucher aux poids du modèle, ce qui le rend compatible avec n'importe quel VLA déployé. Autre observation structurelle importante : les modes d'échec partagent une géométrie commune entre tâches différentes, alors que les représentations de succès restent largement spécifiques à chaque tâche. Cette asymétrie permet de réutiliser des conceptors calibrés sur une tâche pour améliorer les performances sur une tâche nouvelle, sans recalibration. Le travail s'inscrit dans un courant plus large de recherche sur le pilotage des représentations internes (activation steering), initialement développé dans le domaine de l'interprétabilité mécanistique des LLM. Côté robotique, les VLA de référence incluent Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) et OpenVLA, tous confrontés à ce même écart entre performance en démo et robustesse en déploiement réel. COAST ne rivalise pas avec ces modèles mais s'y greffe en post-traitement. Les auteurs n'annoncent pas de déploiement industriel ; il s'agit pour l'instant d'une contribution de recherche, dont la prochaine étape naturelle serait une validation sur des tâches longue-horizon et sur des plateformes humanoïdes à haute dimensionnalité.

IA physiqueOpinion
1 source
Autonomie robotique à seuil de confiance : quand l'incertitude est-elle vraiment utile ?
3574arXiv cs.RO 

Autonomie robotique à seuil de confiance : quand l'incertitude est-elle vraiment utile ?

Des chercheurs ont déposé sur arXiv (2605.18045) une étude systématique sur l'autonomie à seuil de confiance, mécanisme par lequel un robot décide d'agir de façon autonome ou de déléguer à une politique de repli selon son niveau d'incertitude prédictive. L'équipe a comparé trois familles de méthodes d'estimation de l'incertitude (heuristiques softmax, MC Dropout, ensembles de modèles) sur trois benchmarks de reconnaissance d'activité temporelle, avant de valider les résultats dans une simulation embarquée multi-seed mesurant taux de collision et coût opérationnel. Les auteurs critiquent les métriques standard comme l'ECE (erreur de calibration attendue) et l'AUROC : ces indicateurs ne testent pas directement si l'incertitude modifie la décision agir/déléguer. Ils proposent en remplacement une évaluation par corrélation de rang de Spearman, tests d'équivalence par bootstrap, et accord act/defer. Le résultat central contredit une hypothèse fréquente dans la robotique de déploiement : une fois un seuil de compétence minimal atteint par le modèle de base, les trois méthodes produisent des comportements de gating quasi-identiques. C'est le choix du seuil de décision qui pèse le plus sur les résultats d'exécution, bien davantage que la sophistication de la méthode d'incertitude choisie. En pratique, un proxy simple (softmax) suffit pour le gating sélectif dès lors que le modèle est compétent. Revers de la médaille : la détection sémantique hors-distribution fine-grained reste proche du hasard même avec des ensembles de modèles. Les systèmes actuels ne savent pas identifier une situation véritablement inédite, ce qui représente un angle mort critique pour les robots opérant en environnements non contrôlés. Ce travail s'inscrit dans le champ de l'autonomie partagée (shared autonomy), question centrale pour les robots collaboratifs et les AMR industriels. Les méthodes comparées (MC Dropout, Gal et Ghahramani 2016 ; ensembles, Lakshminarayanan 2017) font figure de références établies dans le domaine. Les résultats relativisent les arguments commerciaux en faveur des estimateurs bayésiens avancés pour le déploiement terrain, un sujet directement pertinent pour des acteurs comme Boston Dynamics, Figure AI, Apptronik ou Intrinsic (Alphabet), dont les systèmes doivent décider en temps réel quand solliciter un opérateur humain. Les auteurs annoncent comme prochaines étapes l'extension à des modalités sensorielles plus riches et à des scénarios de décalage de covariable plus agressifs, pour tester la robustesse des conclusions hors du cadre benchmarké.

RecherchePaper
1 source
Pas ce que vous avez demandé : attaques typographiques dans la manipulation par robots ménagers
3575arXiv cs.RO 

Pas ce que vous avez demandé : attaques typographiques dans la manipulation par robots ménagers

Des chercheurs ont mis en ligne sur arXiv (référence 2605.18593) une étude démontrant que de simples autocollants portant du texte imprimé suffisent à détourner les robots ménagers qui utilisent CLIP comme moteur de perception. Dans un environnement de simulation Habitat configuré avec le benchmark HomeRobot, l'attaque a atteint un taux de succès (ASR) de 67,8% sur un pool de 59 épisodes contrôlés, montant à 70,0% parmi les épisodes où le robot accomplissait normalement sa tâche sans perturbation. L'architecture évaluée repose sur une configuration découplée qui expose un encodeur CLIP gelé aux autocollants adversariaux, tout en maintenant un ancrage géométrique via DETIC. Sans optimisation perceptuelle préalable, sans contrôle des angles de vue ni de l'occlusion, le robot saisit physiquement le mauvais objet et le dépose dans la zone cible désignée. L'apport majeur de ce travail réside dans la démonstration que l'erreur de perception se propage à travers la carte sémantique 3D persistante du robot jusqu'à produire ce que les auteurs appellent des "défaillances cinétiques" - des actions physiques erronées entièrement pilotées par un état sémantique empoisonné. C'est la première évaluation du cycle Sense-Plan-Act complet d'un manipulateur ménager face à des attaques typographiques, là où les travaux antérieurs se limitaient à des benchmarks 2D statiques ou à des tâches de navigation. Pour un intégrateur ou un COO envisageant des déploiements de robots de service, ce résultat révèle un vecteur d'attaque dont le coût d'exécution est quasi nul : une étiquette imprimée. Cela remet en question la robustesse sécuritaire des pipelines VLA (Vision-Language-Action) modulaires qui délèguent la perception à des modèles open-vocabulary non durcis. Les attaques typographiques sur CLIP sont documentées depuis 2021, mais ce travail représente le premier transfert vers la manipulation physique, la tâche commercialement la plus pertinente pour les robots de service. CLIP reste omniprésent dans les stacks d'agents incarnés open-vocabulary, de HomeRobot à des architectures de type SayPlan ou PerAct. Des alternatives comme SigLIP ou Florence pourraient offrir une résistance différente, mais aucun benchmark comparatif n'est fourni dans cette étude. Il n'y a pas de déploiement réel ni de partenaire industriel annoncé : il s'agit d'un preprint publié en mai 2025, en simulation uniquement. La suite logique passe par la validation sur hardware réel et l'évaluation de défenses, notamment la redondance perceptuelle, le filtrage sémantique ou la détection d'anomalies textuelles dans le champ de vision.

RechercheOpinion
1 source
PRIME : estimation inertielle et de mouvement physiquement cohérente pour robots à pattes et humanoïdes
3576arXiv cs.RO 

PRIME : estimation inertielle et de mouvement physiquement cohérente pour robots à pattes et humanoïdes

Une équipe de chercheurs a présenté PRIME (Physically-consistent Robotic Inertial and Motion Estimation), une méthode d'estimation de mouvement pour robots à pattes et humanoïdes publiée sur arXiv en mai 2026 (arXiv:2605.17681). Là où les pipelines conventionnels basés sur des filtres de Kalman étendus (EKF) ou la capture de mouvement externe ne reconstruisent que la cinématique, PRIME formule le problème comme une estimation MAP (Maximum A Posteriori) qui raffine simultanément les données proprioceptives brutes et les commandes des actionneurs pour produire une trajectoire dynamiquement cohérente. L'algorithme estime conjointement les forces de contact frictionnelles et les paramètres inertiels du robot (masses, centres de masse, moments d'inertie), via une modélisation différentiable de la dynamique de contact avec contraintes de complémentarité lissées et un modèle de friction d'Anitescu. Les validations ont été conduites sur des robots quadrupèdes et sur l'humanoïde Unitree G1, lors de séquences de locomotion à contacts multiples en déploiement réel. Le problème abordé est structurel : les pipelines de perception robotique actuels ignorent les forces de contact et les paramètres inertiels effectifs du système, ce qui entraîne des reconstructions qui violent régulièrement la dynamique des corps rigides, en particulier lors des phases de contact. Cette incohérence dégrade la qualité des données d'entraînement et limite la robustesse des contrôleurs en boucle fermée. PRIME produit des reconstructions de mouvement annotées en forces et contacts directement depuis des robots en déploiement terrain, sans infrastructure de laboratoire. Pour les équipes qui développent des modèles de fondation robotiques ou des architectures Visual-Language-Action (VLA), cette capacité représente une source de données haute qualité exploitable à grande échelle, là où la rareté d'annotations dynamiques fiables reste un goulot d'étranglement reconnu. L'estimation d'état pour robots à pattes est un problème ancien, historiquement traité par EKF couplés à la proprioception, la capture de mouvement restant cantonnée aux laboratoires. PRIME se distingue en proposant une solution embarquée et déployable en conditions réelles, sans dépendance à une infrastructure externe. L'humanoïde Unitree G1, commercialisé autour de 16 000 dollars et très présent dans la recherche académique mondiale, sert de banc de validation représentatif. Dans un contexte où Boston Dynamics, Figure AI, Agility Robotics, 1X et Unitree accumulent des données de déploiement pour alimenter leurs pipelines d'apprentissage, PRIME propose une brique méthodologique transversale pour enrichir ces corpus avec des annotations dynamiques fiables. Les applications naturelles incluent l'imitation learning, le transfert sim-to-real et l'entraînement de modèles de fondation à partir de données terrain.

RecherchePaper
1 source
Dexora : un modèle VLA open source pour la dextérité bimmanuelle à haute DOF
3577arXiv cs.RO 

Dexora : un modèle VLA open source pour la dextérité bimmanuelle à haute DOF

Des chercheurs ont publié en mai 2026 Dexora, un système VLA (Vision-Language-Action) open-source conçu nativement pour la manipulation bimane et bi-main à haut nombre de degrés de liberté (DoF). Contrairement aux architectures existantes, limitées soit au contrôle de pinces doubles (faible DoF), soit à la manipulation dextère d'un seul bras, Dexora adresse simultanément les deux problèmes. Le pipeline de téléopération repose sur un exosquelette dorsal pour capturer la cinématique grossière des bras, couplé à un suivi markerless des doigts via Apple Vision Pro pour le mouvement fin des mains. Ce dispositif pilote à la fois un robot physique dual-arm dual-hand et un jumeau numérique identique sous MuJoCo. Le corpus d'entraînement atteint 100 000 trajectoires simulées (6,5 millions de frames) et 10 000 épisodes téléopérés en conditions réelles (2,92 millions de frames). Pour filtrer le bruit inévitable des démonstrations humaines, un discriminateur offline attribue des pondérations par clip avant l'entraînement d'une politique diffusion-transformer. En benchmark, Dexora obtient 66,7 % de succès sur les tâches dextères contre 51,7 % pour les meilleures alternatives comparées, et 90 % sur les tâches de base. Des résultats de généralisation hors distribution et cross-embodiment sont également reportés. Ce travail comble un angle mort réel de l'écosystème VLA actuel : les mains à haute dextérité (typiquement 16 à 22 DoF par main) ne se prêtent pas aux heuristiques utilisées pour les pinces, et les méthodes end-to-end génériques se sont jusqu'ici heurtées à la complexité de la téléopération bimanuelle simultanée. Le gain de 15 points sur les baselines dextères est significatif, même si les benchmarks utilisés restent internes et les conditions expérimentales peu détaillées dans l'abstract, ce qui mérite vérification à la lecture du papier complet. L'ouverture du code, des données et des poids est le point différenciant le plus structurant : elle abaisse la barrière d'entrée pour les laboratoires et les intégrateurs qui cherchent à entraîner des politiques sur leurs propres plateformes dextères sans repartir de zéro. La publication s'inscrit dans une course accélérée à la dextérité fine pour les bras robotiques, où Physical Intelligence (pi0), OpenVLA et plusieurs équipes académiques ont multiplié les releases VLA depuis 2024. Aucun acteur européen n'est directement impliqué dans ce travail, mais des start-ups comme Enchanted Tools (France) ou Shadow Robotics (UK, désormais indépendant de OpenAI) suivent des trajectoires adjacentes sur les mains dextères. Le recours à l'Apple Vision Pro comme capteur de téléopération markerless est un choix pragmatique mais dépendant d'un hardware grand public non industriel, dont la robustesse en environnement de production reste à démontrer. Il s'agit d'un preprint arXiv, pas d'un produit livré : aucun déploiement industriel ni pilote n'est annoncé à ce stade.

IA physiqueOpinion
1 source
Fusion multimodale tactile en IA incarnée : tour d'horizon des paradigmes vision, langage et contact
3578arXiv cs.RO 

Fusion multimodale tactile en IA incarnée : tour d'horizon des paradigmes vision, langage et contact

Une équipe de chercheurs publie sur arXiv (2605.17336v1) un état de l'art de la fusion tactile multimodale dans les systèmes d'intelligence incarnée, couvrant les travaux jusqu'au premier trimestre 2026. L'article recense les approches qui combinent capteurs tactiles, vision et modèles de langage (LLM), et propose une taxonomie hiérarchique selon deux axes : les jeux de données multimodaux (Tactile-Vision, Tactile-Language, Tactile-Vision-Language) et les méthodes, regroupées en trois piliers : perception et reconnaissance (prédiction de saisie, identification d'objets), génération cross-modale (traduction bidirectionnelle entre données tactiles, visuelles et textuelles), et interaction multimodale (contrôle par retour d'effort, manipulation guidée par le langage). Le survey recense également le matériel de captation tactile représentatif et les métriques d'évaluation en usage dans les benchmarks actuels. Ce travail arrive à un moment critique : le toucher reste la grande modalité sensorielle non unifiée dans les pipelines robotiques modernes. Les systèmes de manipulation actuels, qu'il s'agisse de bras industriels ou d'humanoïdes comme Figure 03, Optimus ou GR00T N2, s'appuient massivement sur la vision et les VLA (Vision-Language-Action models), mais le retour tactile reste sous-exploité, souvent réduit à des capteurs force/couple rudimentaires. La perception tactile fournit pourtant des informations irremplaçables sur la géométrie de contact, les propriétés des matériaux et la dynamique d'interaction que la caméra seule ne peut pas restituer, ce qui en fait probablement la prochaine frontière pour réduire les taux d'échec en manipulation fine (assemblage, tri de pièces déformables, objets fragiles). Le domaine a connu une accélération depuis 2020 grâce aux capteurs visuotactiles comme GelSight (MIT) et DIGIT (Meta/FAIR), qui convertissent la déformation de surface en image RGB et permettent d'appliquer les architectures de vision standard au toucher. Des laboratoires comme Stanford, CMU et plusieurs groupes chinois (Shanghai AI Lab, Tsinghua) ont produit l'essentiel des datasets référencés. En Europe, des acteurs comme Shadow Robot et Wandercraft travaillent sur l'intégration du retour haptique dans des systèmes commerciaux. La fragmentation des datasets et des protocoles d'évaluation reste le principal frein à la montée en échelle, et les auteurs identifient la création de benchmarks unifiés et de modèles fondation tactiles comme les prochains jalons structurants du domaine.

RecherchePaper
1 source
Apprentissage de la continuation native pour les politiques de flux par découpage d'actions
3579arXiv cs.RO 

Apprentissage de la continuation native pour les politiques de flux par découpage d'actions

Des chercheurs ont publié sur arXiv (arXiv:2602.12978v2) une méthode d'entraînement baptisée Legato, conçue pour éliminer un problème structurel des politiques robotiques de type VLA (Vision Language Action) : les discontinuités aux jonctions de blocs d'actions prédits. Les modèles VLA actuels découpent leurs séquences en "chunks" pour s'exécuter en temps réel, mais ce découpage provoque des à-coups mécaniques quand le robot transite d'un bloc au suivant. La solution dominante jusqu'ici, le Real-Time Chunking (RTC), traite ce problème en aval, hors du modèle, en lissant post-hoc les transitions. Legato prend le chemin inverse : il intègre la continuité directement dans la phase d'entraînement, en initialisant le débruitage (denoising) à partir d'un mélange pondéré d'actions déjà connues et de bruit, selon un calendrier (schedule) appris. La méthode restructure également la dynamique de flux pour garantir la cohérence entre entraînement et inférence, et utilise des conditions de schedule aléatoires pour s'adapter à des délais variables. Sur cinq tâches de manipulation en conditions réelles, Legato surpasse RTC avec environ 10 % de gain sur la fluidité de trajectoire et le temps de complétion de tâche. Ce chiffre de 10 % mérite d'être mis en contexte : il est mesuré en conditions réelles, non en simulation, ce qui lui confère un poids pratique que les benchmarks purement virtuels ne peuvent pas revendiquer. Le problème de fond que Legato résout, le "spurious multimodal switching", soit le comportement hésitant du robot coincé entre plusieurs configurations valides à chaque frontière de chunk, est un verrou concret pour les déploiements industriels. Le RTC, en tant que couche externe, introduit précisément ces changements de mode intempestifs parce qu'il ne connaît pas l'intention du modèle. En internalisant la régularité dans l'entraînement, Legato produit des trajectoires dont le comportement à l'inférence est cohérent avec ce qui a été appris, ce qui simplifie la validation en production. Pour les intégrateurs qui cherchent à fiabiliser des cellules de manipulation, la prévisibilité du mouvement est souvent aussi critique que sa vitesse. L'action chunking a été popularisé par ACT (Action Chunked Transformer, Stanford/UC Berkeley, 2023) et repris dans des architectures flow-based comme pi0 de Physical Intelligence. La prolifération des VLA en manipulation, portée par Physical Intelligence, Google DeepMind (RT-2), 1X Technologies, et des laboratoires académiques, a rendu ce problème de frontière de chunk de plus en plus visible hors simulation. Legato s'inscrit dans un courant actif visant à réconcilier la génération par blocs, nécessaire pour la latence temps réel, avec la continuité motrice, nécessaire pour la précision. La méthode (version v2, 2025) n'est pas encore associée à un déploiement industriel annoncé, mais ses résultats sur hardware réel en font un candidat crédible à l'intégration dans les pipelines de fine-tuning VLA existants. Les suites naturelles incluent des tests sur architectures diffusion plus larges et une évaluation sur des plateformes bi-manuelles.

IA physiqueOpinion
1 source
REBAR : un référentiel éthique de référence pour l'évaluation de l'autonomie
3580arXiv cs.RO 

REBAR : un référentiel éthique de référence pour l'évaluation de l'autonomie

REBAR (Reference Ethical Benchmark for Autonomy Readiness) est un cadre d'évaluation quantitative publié en préprint arXiv (2605.18423, mai 2026) pour mesurer la conformité éthique et légale des systèmes autonomes. Le framework génère un score appelé Autonomy Readiness Level (ARL), calculé à partir de métriques opérationnelles testées dans un simulateur photoréaliste. Trois innovations techniques distinguent l'approche : une méthode neuro-symbolique combinant LLM et raisonnement formel pour quantifier la difficulté éthique des scénarios de test, une génération automatisée à grande échelle de cas de test pilotée par LLM, et un environnement de simulation versatile et photoréaliste. Le cadre cible les solutions dites "boîte blanche" (white-box), dont l'architecture interne est accessible aux évaluateurs, ce qui en limite d'emblée le périmètre d'application. L'enjeu central est la traçabilité et la responsabilité. Les frameworks éthiques actuels pour l'IA embarquée restent majoritairement qualitatifs : ils imposent des garde-fous qui bloquent les comportements dangereux sans fournir d'explication interprétable ni d'option de dérogation pour l'opérateur. REBAR propose une alternative mesurable via des scores reproductibles, permettant à un intégrateur ou un décideur B2B de déterminer si un système autonome est réellement adapté à une mission donnée. Pour les industriels déployant des véhicules autonomes, des drones ou des robots en environnement non structuré, disposer d'une preuve quantifiée de conformité éthique devient un argument commercial et réglementaire de premier ordre. La demande de tels outils s'est intensifiée avec la montée en puissance des VLA (Vision-Language-Action models) et des agents autonomes déployés en conditions réelles. Les approches actuelles de red teaming ciblé, pratiquées chez Anthropic, OpenAI ou DeepMind, montrent les limites du qualitatif à l'échelle industrielle. REBAR occupe un espace encore peu formalisé : celui des benchmarks standardisés et auditables pour l'autonomie éthique. En Europe, ce type de cadre s'aligne directement avec les exigences de l'AI Act sur les systèmes à haut risque, qui imposent documentation rigoureuse et évaluation continue. Le préprint ne mentionne ni partenariat industriel ni déploiement en cours, mais la méthodologie posée ici pourrait servir de socle à des standards sectoriels pour la certification de robots industriels et de véhicules autonomes en milieu ouvert.

RegulationReglementation
1 source
DexWild : des interactions humaines dextériques pour des politiques robotiques en conditions réelles
3581arXiv cs.RO 

DexWild : des interactions humaines dextériques pour des politiques robotiques en conditions réelles

DexWild est un framework de collecte de données et d'apprentissage pour la manipulation robotique dextère, publié en mai 2025 sur arXiv (2505.07813). L'idée centrale consiste à remplacer la téléopération coûteuse par la capture directe de gestes humains dans des environnements du quotidien. Une équipe diverse de collecteurs utilise le DexWild-System, un dispositif portable et peu onéreux, pour enregistrer des heures d'interactions avec des objets variés dans de multiples contextes réels. Le framework co-entraîne ensuite un modèle sur ces démonstrations humaines combinées à un volume minimal de données robot spécifiques. Les résultats mesurés atteignent 68,5 % de taux de succès dans des environnements non vus à l'entraînement, soit près de quatre fois mieux qu'une politique entraînée sur données robot seules, et une généralisation cross-embodiment (transfert vers d'autres morphologies robotiques) améliorée d'un facteur 5,8. Le goulot d'étranglement des données est un problème structurel pour la manipulation dextère. La téléopération reste la méthode dominante pour produire des datasets de haute qualité, notamment chez Physical Intelligence avec pi-0 ou chez Figure pour ses robots humanoïdes, mais son coût freine la diversité de distribution couverte. DexWild propose un paradigme alternatif : laisser des humains collecter nativement des données gestuelles en vie réelle, puis transférer ces politiques vers des robots via co-training. Si ces performances se confirment hors laboratoire, cette approche pourrait réduire significativement le coût d'acquisition de données pour les intégrateurs industriels, en particulier sur des tâches de pick-and-place complexes. Il convient de noter que le papier est un preprint non encore peer-reviewed et que les vidéos de démonstration sont sélectionnées, deux points qui invitent à la prudence sur la reproductibilité réelle. Ce travail s'inscrit dans la tendance du scaling de datasets robotiques, aux côtés d'Open-X Embodiment et DROID. Sur la problématique du transfert human-to-robot, les approches concurrentes directes incluent UMI (Universal Manipulation Interface, Stanford/Columbia), qui utilise une gripper portable pour capturer des démonstrations dans des environnements non structurés, et les travaux de l'équipe de Sergey Levine à UC Berkeley sur l'apprentissage depuis des vidéos humaines. DexWild se distingue par la diversité explicite de ses collecteurs et la structure de co-training formalisée. Le code et les datasets sont accessibles sur dexwild.github.io ; aucun déploiement industriel ni timeline commerciale n'est annoncé à ce stade.

IA physiqueOpinion
1 source
Amorçage auto-supervisé du raisonnement incarné pour la prédiction d'actions
3582arXiv cs.RO 

Amorçage auto-supervisé du raisonnement incarné pour la prédiction d'actions

Des chercheurs ont publié sur arXiv (réf. 2602.08167, version 2) la méthode R&B-EnCoRe, conçue pour améliorer le raisonnement des modèles Vision-Language-Action (VLA) en robotique sans annotation humaine ni récompense externe. Sur des tâches de manipulation avec bras Franka Panda en simulation et WidowX sur matériel réel, et de navigation sur quatre types de plateformes (bipèdes, wheeled, vélo et quadrupède), la méthode affiche 28 % de gain sur le taux de succès en manipulation, 101 % d'amélioration sur les scores de navigation, et 21 % de réduction du taux de collision par rapport aux baselines VLA traitant indistinctement tous les primitives de raisonnement disponibles. Les tests couvrent des architectures de 1B à 30B paramètres et incluent un volet conduite autonome ; aucun déploiement industriel ni partenaire commercial n'est mentionné, il s'agit d'une contribution de recherche fondamentale. Le problème ciblé est structurel dans le domaine VLA : les approches actuelles de raisonnement "chain-of-thought" incarné (Embodied CoT) imposent des templates rigides qui listent objets visibles, plans de haut niveau et affordances de scène, quelle que soit leur pertinence pour l'action à exécuter. Ce bruit informationnel nuit à la prédiction d'action et fragilise la politique de contrôle. R&B-EnCoRe modélise le raisonnement comme une variable latente dans un cadre d'inférence variationnelle pondérée par importance, permettant au modèle de générer et distiller automatiquement des raisonnements filtrés par leur capacité à prédire une action réussie. Ce mécanisme améliore le transfert des connaissances internet vers l'exécution physique réelle, problème central du "grounding" en robotique incarnée. Les VLA à raisonnement incarné forment un sous-domaine actif depuis les travaux π0 de Physical Intelligence, OpenVLA d'UC Berkeley et RT-2 de Google DeepMind. R&B-EnCoRe se positionne comme un raffinement post-entraînement applicable à des architectures existantes plutôt que comme un nouveau modèle de fondation. La validation sur cinq catégories d'embodiments distincts est plus large que la majorité des contributions VLA, qui restent limitées à la manipulation. Aucune suite commerciale n'est annoncée, mais l'approche est directement compatible avec des plateformes comme Unitree, Boston Dynamics Spot ou Franka Production 3, ainsi qu'avec les benchmarks standardisés LIBERO et BRS.

IA physiqueOpinion
1 source
cuNRTO : optimisation de trajectoires robustes non linéaires accélérée par GPU
3583arXiv cs.RO 

cuNRTO : optimisation de trajectoires robustes non linéaires accélérée par GPU

Des chercheurs ont mis en ligne sur arXiv (réf. 2603.02642v2) cuNRTO (CUDA Nonlinear Robust Trajectory Optimization), un framework GPU pour l'optimisation de trajectoire robuste sous incertitude bornée. Ces problèmes mènent typiquement à des contraintes de programmation conique du second ordre (SOCP), dont la résolution est très coûteuse sur CPU. Les auteurs proposent deux architectures : NRTO-DR, basée sur le splitting de Douglas-Rachford pour paralléliser les projections SOCP et les résolutions directes creuses, et NRTO-FullADMM, une variante inédite exploitant l'ADMM (Alternating Direction Method of Multipliers) pour améliorer la scalabilité en tirant parti de la structure du problème. L'implémentation repose sur des kernels CUDA personnalisés pour les projections SOC et des chaînes cuBLAS GEMM pour les mises à jour des gains de retour d'état. Testées en simulation sur un modèle unicycle, un quadrirotor et le bras manipulateur Franka Emika, les deux architectures atteignent des accélérations allant jusqu'à 139,6x par rapport aux solveurs CPU de référence. L'enjeu est concret pour les équipes robotique et les intégrateurs : l'optimisation de trajectoire robuste en temps réel reste aujourd'hui hors de portée des architectures CPU pour la plupart des applications embarquées, les solveurs classiques étant cantonnés à une planification hors ligne ou à très basse fréquence. Un gain de 139,6x ouvre la voie à une réplanification en boucle fermée sur des manipulateurs industriels et des drones opérant sous incertitudes réelles (charges variables, perturbations mécaniques). Nuance importante : l'ensemble des benchmarks est produit en simulation. Le gap sim-to-real sur GPU embarqués, où la latence mémoire et la bande passante sont significativement plus contraintes que sur un serveur de calcul, reste entièrement à valider avant tout déploiement opérationnel. Ce travail s'inscrit dans la continuité des efforts d'accélération GPU pour le contrôle optimal, dont cuRobo (NVIDIA) et les variantes GPU de l'MPPI sont les exemples les plus connus. L'optimisation robuste avec contraintes SOCP reste un angle peu couvert par ces frameworks, les formulations quadratiques classiques étant structurellement plus simples à paralléliser. Le papier est un preprint arXiv en version v2, pas encore évalué par une conférence de référence comme ICRA, IROS ou RSS. Le code sera rendu public via cunrto.github.io, ce qui permettra des comparaisons indépendantes. La prochaine étape logique serait une validation hardware sur GPU embarqués de type NVIDIA Jetson Orin, représentatifs du déploiement cible en robotique autonome.

RecherchePaper
1 source
TaskGround : inférence de tâches exécutables structurées pour le raisonnement domestique global
3584arXiv cs.RO 

TaskGround : inférence de tâches exécutables structurées pour le raisonnement domestique global

Une équipe de chercheurs publie TaskGround, un cadre de planification de tâches ménagères pour agents robotiques, dans un preprint arXiv daté de mai 2026 (arXiv:2605.18109). Le problème visé : dans un déploiement domestique réel, un agent reçoit une requête contextuelle ("prépare le petit-déjeuner") face à une scène complète comprenant des centaines d'objets non pertinents à la tâche. TaskGround adopte une architecture "Ground-Infer-Execute" en trois étapes, filtrage de la scène vers une tranche compacte d'entités pertinentes, inférence de la structure de tâche exécutable, puis compilation en séquence d'actions au niveau compétence. Le cadre est sans entraînement (training-free) et agnostique au modèle de langage sous-jacent. Pour l'évaluation, les auteurs introduisent FullHome, une suite de 400 tâches ménagères validées humainement, couvrant des environnements domestiques variés et deux types de contraintes : orientées objectif et orientées processus. Les résultats montrent que TaskGround améliore substantiellement les taux de succès sur FullHome, aussi bien pour les modèles propriétaires qu'open-weight. Le point saillant : le modèle Qwen3.5-9B couplé à TaskGround devient compétitif avec GPT-5 en prompting direct complet, tout en réduisant le coût total en tokens d'entrée jusqu'à 18 fois. Pour les intégrateurs et équipes robotiques opérant sous contraintes de calcul local ou de confidentialité des données, c'est un signal concret : la sophistication du raisonnement n'exige pas nécessairement des modèles propriétaires massifs. Les auteurs identifient l'inférence de structure de tâche exécutable comme le goulot d'étranglement central du raisonnement en scène complète, davantage que la qualité intrinsèque du modèle de base. Ce travail s'inscrit dans un axe de recherche actif autour des agents de planification pour la robotique domestique, qui cherche à combler l'écart entre démonstration en laboratoire et déploiement réel. Les approches concurrentes incluent les VLA (Vision-Language-Action models) de Physical Intelligence (pi0), les pipelines de planification hiérarchique utilisés par Figure ou 1X, ainsi que les travaux SayCan de Google DeepMind. TaskGround se distingue en n'exigeant aucun fine-tuning supplémentaire, ce qui facilite l'intégration à des stacks existantes. Le preprint reste pour l'instant confiné à l'évaluation sur benchmarks textuels et simulation ; une validation sur plateformes hardware réelles constituerait la prochaine étape naturelle, non encore annoncée.

RecherchePaper
1 source
Je ne suis pas en colère, juste concentré : comprendre les émotions humaines dans la collaboration humain-robot
3585arXiv cs.RO 

Je ne suis pas en colère, juste concentré : comprendre les émotions humaines dans la collaboration humain-robot

Une équipe de chercheurs a publié fin mai 2026 un préprint arXiv (2605.16816) décrivant un système de reconnaissance des émotions fondé sur un modèle de langage visuel (VLM) pour améliorer la collaboration humain-robot (HRC). Contrairement aux systèmes classiques, qui s'appuient sur des datasets d'émotions jouées et des entrées unimodales comme les expressions faciales, le système proposé exploite la compréhension contextuelle de la scène pour inférer l'état émotionnel de l'opérateur. L'évaluation a suivi deux axes : une comparaison avec des annotations humaines sur un dataset HRC existant, mesurant la similarité sémantique et l'alignement de sentiment, puis une étude utilisateur impliquant un robot de service dans une tâche de livraison collaborative. Le système VLM-ER a surpassé la référence CNN sur ces deux métriques, et les participants ont explicitement préféré le comportement adaptatif du robot piloté par l'inférence émotionnelle. Pour les intégrateurs et les équipes produit déployant des robots de service ou des cobots en environnement humain, le résultat valide une hypothèse clé : un VLM peut dépasser la simple lecture faciale en intégrant la posture, la dynamique de la tâche et le contexte visuel global pour produire une inférence émotionnelle plus proche du jugement humain. Le titre du papier résume le problème concret visé, la confusion systématique entre "en colère" et "concentré", une erreur de classification qui, en robotique industrielle ou de service, génère des interruptions non pertinentes et dégrade la fluidité de la collaboration. La démonstration que ce comportement adaptatif est préféré par les utilisateurs constitue un argument B2B tangible pour les décideurs qui doutent du retour sur investissement de ces fonctionnalités. La reconnaissance des émotions en HRC souffrait jusqu'ici d'un écart important entre laboratoire et terrain, en partie parce que les datasets d'entraînement reposent sur des acteurs et non sur des émotions spontanées. L'intégration de VLMs pré-entraînés à grande échelle représente un saut qualitatif en termes de généralisation par rapport aux architectures CNN ou aux approches multimodales audio-geste traditionnelles. Des travaux similaires émergent autour de modèles comme GPT-4o ou LLaVA appliqués à la robotique sociale, tandis que des startups françaises comme Enchanted Tools, dont le robot Miro cible précisément l'interaction sociale naturelle, s'inscrivent dans cette même dynamique. La prochaine étape critique pour cette équipe sera de valider le système sur des données spontanées hors laboratoire et des populations diversifiées, condition indispensable avant tout déploiement industriel à l'échelle.

RecherchePaper
1 source
SADP : politique de diffusion consciente des sous-objectifs pour robots explicables, apprise à partir de démonstrations générées par modèle fondation
3586arXiv cs.RO 

SADP : politique de diffusion consciente des sous-objectifs pour robots explicables, apprise à partir de démonstrations générées par modèle fondation

Des chercheurs ont publié sur arXiv (référence 2605.16871) SADP, pour Subgoal-Aware Diffusion Policy, un framework d'apprentissage par imitation conçu pour rendre les robots manipulateurs explicables en cours d'exécution. L'approche repose sur deux mécanismes combinés : l'utilisation de modèles de fondation pour générer automatiquement des démonstrations annotées en sous-objectifs intermédiaires, et l'entraînement d'une politique de diffusion conditionnée simultanément sur la description de la tâche globale et sur chaque sous-objectif. Une tête auxiliaire légère prédit en temps réel l'état de complétion de chaque sous-étape, exposant ainsi la progression interne du robot à un opérateur humain. Les expériences couvrent des simulations dans l'environnement de référence RLBench et une validation en conditions réelles sur un bras UR5e d'Universal Robots. Les résultats affichent des taux de succès supérieurs aux baselines de type diffusion conditionnée uniquement par la tâche, sans sacrifier les performances globales. L'apport principal n'est pas l'explicabilité en soi, déjà abordée par des approches post-hoc, mais son intégration native dans la politique d'action. Pour un intégrateur ou un responsable industriel, cela change l'équation opérationnelle : il devient possible de monitorer l'avancement d'une manipulation longue-distance, de localiser précisément le sous-objectif en échec, et de réduire les temps de diagnostic en production. Le recours aux modèles de fondation pour annoter automatiquement les démonstrations contourne par ailleurs la pénurie chronique de supervision au niveau des sous-tâches dans les datasets robotiques standards, un goulot d'étranglement pratique bien identifié. La coexistence d'interprétabilité et de haute performance remet en question l'hypothèse d'un arbitrage inévitable entre les deux. Les diffusion policies sont devenues un paradigme dominant pour la manipulation dextère depuis les travaux de Chi et al. en 2023, mais leur opacité décisionnelle reste une critique persistante dans les contextes déploiement industriel. Les modèles VLA comme pi-0 (Physical Intelligence), OpenVLA ou les RT-séries de Google DeepMind exploitent les connaissances des modèles de fondation sans pour autant structurer explicitement la progression par sous-objectifs. SADP se positionne à l'intersection des politiques de diffusion et de la décomposition hiérarchique de tâches, dans un espace concurrentiel qui inclut également des approches comme SayCan ou Code-as-Policies. L'utilisation d'un UR5e, cobot industriel standard très répandu, renforce la crédibilité des résultats en conditions réelles. Les suites naturelles incluront probablement la mise à l'échelle vers des tâches plus complexes et des tests en environnements industriels réels.

IA physiquePaper
1 source
SuReNav : navigation par graphe de superpixels avec relaxation de contraintes en environnements sur-contraints
3587arXiv cs.RO 

SuReNav : navigation par graphe de superpixels avec relaxation de contraintes en environnements sur-contraints

Des chercheurs ont publié sur arXiv (identifiant 2602.06807) SuReNav, une méthode de navigation robotique conçue pour les environnements dits "sur-contraints", où aucun chemin ne permet d'éviter l'intégralité des obstacles. Le problème visé est concret : dans des espaces semi-statiques (couloirs partiellement encombrés, zones urbaines, campus), les planificateurs classiques échouent ou bloquent faute de solution "parfaite". SuReNav repose sur trois composantes : une carte en graphe de superpixels encodant des contraintes régionales hiérarchisées, un réseau de neurones sur graphe (GNN) entraîné sur des démonstrations humaines pour relâcher sélectivement ces contraintes, et un mécanisme d'entrelacement entre relaxation, planification et exécution en temps réel. La méthode a été évaluée sur des cartes sémantiques 2D et des environnements 3D issus d'OpenStreetMap, obtenant le meilleur score de "ressemblance humaine" parmi les baselines testées. Une démonstration en navigation urbaine réelle a été réalisée avec un quadrupède Spot de Boston Dynamics. L'apport principal est de dépasser les limites des planificateurs à coûts prédéfinis, peu transférables à des environnements inédits. En s'appuyant sur des démonstrations humaines, le GNN apprend à distinguer les zones passables "en dernier recours" des zones strictement interdites, une nuance que les heuristiques fixes peinent à capturer sans sur-estimation systématique. Pour les intégrateurs déployant des robots mobiles en milieux semi-statiques, l'enjeu est direct : le robot cesse de bloquer face à une impasse et produit une solution "best-effort" minimisant le risque traversé. La généralisation sans reconfiguration manuelle des coûts est particulièrement pertinente pour des déploiements à grande échelle. Il convient toutefois de noter que les métriques de "human-likeness" restent auto-définies par les auteurs, et que les vidéos disponibles ne couvrent qu'un sous-ensemble de scénarios. SuReNav s'inscrit dans la tendance à l'apprentissage par imitation pour la navigation mobile, un axe activement exploré par des équipes comme ETH Zurich, CMU Robotics Institute ou dans le cadre de projets EU sur la robotique en espace public. La méthode se distingue des approches VLA (Vision-Language-Action) pures par son ancrage dans une représentation spatiale structurée plutôt que dans un modèle de langage génératif, ce qui la rend plus interprétable et plus légère computationnellement. Les principaux concurrents sur ce créneau incluent des planificateurs à champ de potentiel augmentés et des méthodes de navigation par apprentissage par renforcement. Aucun déploiement commercial n'est annoncé : il s'agit d'un résultat de recherche avec validation expérimentale sur Spot, dont le code est publié sur sure-nav.github.io, ouvrant la voie à des reproductions et pilotes industriels.

RecherchePaper
1 source
RoboMME : évaluation et compréhension de la mémoire pour les politiques robotiques généralistes
3588arXiv cs.RO 

RoboMME : évaluation et compréhension de la mémoire pour les politiques robotiques généralistes

Une équipe de chercheurs a publié RoboMME (Robotic Multi-Memory Evaluation), un benchmark standardisé à grande échelle destiné à évaluer les modèles VLA (vision-language-action) sur des tâches de manipulation robotique nécessitant de la mémoire à long horizon. Le benchmark comprend 16 tâches construites selon une taxonomie en quatre catégories : mémoire temporelle, spatiale, des objets et procédurale, couvrant des scénarios comme le comptage d'actions répétées ou la manipulation d'objets temporairement occultés. Les auteurs ont également développé 14 variantes de VLA augmentées de mémoire, toutes bâties sur le backbone pi0.5 de Physical Intelligence, et les ont évaluées selon différentes stratégies d'intégration mémorielle. L'absence d'un cadre d'évaluation standardisé était jusqu'ici un frein majeur pour la recherche sur la mémoire dans les VLA généralistes : chaque équipe testait ses mécanismes dans des conditions ad hoc, rendant toute comparaison rigoureuse impossible. RoboMME comble ce vide en permettant, pour la première fois, de mesurer systématiquement comment différentes représentations mémorielles (états cachés récurrents, mémoire externe, fenêtre de contexte longue) se comportent sur un spectre de tâches hétérogènes. La conclusion principale est nuancée : l'efficacité d'une architecture mémoire est fortement dépendante de la tâche, chaque approche présentant des avantages distincts selon la catégorie, ce qui remet en cause l'idée qu'une solution universelle serait à portée à court terme. Pour les intégrateurs et les décideurs B2B, cela signifie concrètement que le choix du mécanisme mémoriel devra rester spécifique au cas d'usage, sans recette générique applicable. Ce benchmark s'inscrit dans la montée en puissance des VLA généralistes, portés par des modèles comme pi0 et pi0.5 de Physical Intelligence (levée de 400 millions de dollars en 2024), OpenVLA, Octo ou RoboVLMs, qui cherchent tous à transférer les capacités des grands modèles de langage à la manipulation physique. D'autres benchmarks comme LIBERO, RoboSuite ou MetaWorld couvrent déjà l'évaluation générale des VLA, mais RoboMME se distingue par son focus explicite sur la mémoire à long horizon, un aspect jusqu'ici systématiquement sous-évalué dans ces environnements. Les prochaines étapes probables incluent l'adoption de RoboMME comme référence communautaire dans les pipelines d'évaluation des grands labs robotiques, et le développement d'architectures mémoire capables de généraliser entre catégories de tâches sans sacrifier les performances spécialisées.

RechercheActu
1 source
OxyGen : gestion unifiée du cache KV pour l'inférence de modèles VLA en parallélisme multi-tâches
3589arXiv cs.RO 

OxyGen : gestion unifiée du cache KV pour l'inférence de modèles VLA en parallélisme multi-tâches

Une équipe de chercheurs propose OxyGen, un système de gestion unifiée du cache KV (Key-Value) pour l'inférence des modèles VLA (Vision-Language-Action) sous parallélisme multi-tâches, décrit dans un preprint arXiv (2503.14371). Le travail cible en particulier π₀.₅, le modèle VLA de type Mixture-of-Transformers (MoT) développé par Physical Intelligence, une startup robotique fondée en 2023 par d'anciens chercheurs de Google et DeepMind. Sur un GPU NVIDIA GeForce RTX 4090, OxyGen atteint jusqu'à 3,7 fois la vitesse d'exécution par rapport à un système isolé classique, tout en maintenant simultanément un débit de plus de 200 tokens/s en génération de langage et une fréquence d'action de 70 Hz. Ces résultats ont également été validés sur un robot humanoïde physique embarquant un Jetson AGX Thor, la carte de calcul ciblée par NVIDIA pour les déploiements robotiques edge. Le problème que résout OxyGen est concret : lorsqu'un agent robotique doit exécuter simultanément plusieurs tâches (manipulation, conversation, mise à jour mémoire) à partir d'une même observation visuelle partagée, les systèmes d'inférence existants recalculent indépendamment le cache KV pour chaque tâche, générant une redondance coûteuse et une contention de ressources. Les auteurs identifient la gestion isolée des caches KV comme la cause racine et proposent deux optimisations clés : le partage cross-tâches du cache KV, qui élimine le recalcul des tokens d'observation lors du prefill, et le batching continu inter-frames, qui désolidarise la génération de langage à longueur variable de la génération d'actions à cadence fixe. Cette architecture est particulièrement structurante pour les intégrateurs qui cherchent à déployer des VLAs sur du matériel embarqué sans recourir à des serveurs GPU distants, un verrou majeur pour la commercialisation des robots à intelligence embarquée. Les modèles VLA de type MoT, dont π₀ (publié en octobre 2024) et π₀.₅ sont les représentants les plus visibles, routent les sorties hétérogènes vers des blocs transformer spécialisés tout en partageant un encodeur d'observation commun, ce qui rend techniquement possible le partage de cache KV inter-tâches proposé par OxyGen. Sur le plan concurrentiel, ce type d'optimisation d'inférence concerne aussi les VLAs de Google DeepMind (Gemini Robotics), OpenVLA, ainsi que les projets internes de Tesla pour Optimus Gen 3. Il s'agit à ce stade d'une contribution de recherche sans déploiement industriel annoncé, mais la validation sur robot réel avec Jetson AGX Thor embarqué indique une trajectoire claire vers le déploiement on-device à grande échelle.

IA physiqueOpinion
1 source
WorldArena 2.0 : extension du benchmark de modèles du monde incarnés sur les modalités, fonctionnalités et plateformes
3590arXiv cs.RO 

WorldArena 2.0 : extension du benchmark de modèles du monde incarnés sur les modalités, fonctionnalités et plateformes

WorldArena 2.0 est un benchmark pour l'évaluation des "world models incarnés" (embodied world models), présenté dans un preprint arXiv (2605.17912) en mai 2026. Ces modèles prédictifs entraînent des agents à anticiper l'évolution de leur environnement selon leurs propres actions, une capacité fondamentale pour la robotique autonome. Le benchmark étend l'évaluation sur trois axes : la modalité (de la vision seule vers la perception visuotactile, intégrant le toucher), la fonctionnalité (au-delà de la planification, vers l'utilisation du world model comme environnement d'entraînement par renforcement interactif), et la plateforme (depuis les simulateurs vers des robots physiques à morphologies variées). La suite est accessible sur world-arena.ai sous un protocole standardisé mesurant qualité perceptuelle, utilité interactive et performances cross-plateforme. Le principal apport est de combler un angle mort méthodologique : les benchmarks existants pour les world models se limitaient à la prédiction vidéo hors-ligne, dans des simulateurs, sans évaluer leur utilité dans une boucle RL ni leur comportement sur robots réels. Cette restriction rendait presque impossible de trancher si un world model est réellement utile pour un intégrateur : capable de générer des expériences synthétiques fiables pour affiner une politique de contrôle, et robuste face aux imprécisions du contact physique. L'extension visuotactile est particulièrement significative, le retour haptique étant un verrou connu du sim-to-real pour la manipulation. Ce benchmark succède à une première version de WorldArena centrée sur la simulation, et répond à une critique croissante dans la communauté : les métriques de qualité vidéo (FID, PSNR) ne prédisent pas la performance effective d'un agent sur robot physique. Sur le plan concurrentiel, WorldArena 2.0 s'inscrit aux côtés d'initiatives comme RoboVerse ou les suites d'évaluation des VLAs (Vision-Language-Action models) portées par DeepMind et Meta AI. Aucun acteur français ou européen n'est mentionné dans ce preprint, qui reste une contribution académique sans partenariat industriel annoncé. Les étapes suivantes logiques incluent l'extension à des humanoïdes complets et l'intégration de modalités supplémentaires comme la proprioception.

RecherchePaper
1 source
Pré-entraînement universel sur les poses pour des politiques VLA généralisables
3591arXiv cs.RO 

Pré-entraînement universel sur les poses pour des politiques VLA généralisables

Des chercheurs ont publié Pose-VLA (arXiv:2602.19710, 2026), un nouveau paradigme d'entraînement pour les modèles Vision-Language-Action (VLA) appliqués à la manipulation robotique. L'approche sépare l'entraînement en deux phases distinctes: une phase de pré-entraînement qui extrait des prior spatiaux 3D universels dans un espace centré sur la caméra, puis une phase de post-entraînement pour l'alignement propre à l'embodiment du robot cible. Le mécanisme central repose sur l'introduction de "discrete pose tokens", une représentation intermédiaire universelle qui combine des données de grounding spatial issues de datasets 3D hétérogènes avec des trajectoires géométriques issues de démonstrations robotiques. Sur le benchmark RoboTwin 2.0, Pose-VLA revendique l'état de l'art avec 79,5% de taux de succès moyen, et atteint 96,0% sur LIBERO. En conditions réelles, le modèle généralise à des objets variés avec seulement 100 démonstrations par tâche. Le problème structurel que Pose-VLA cherche à résoudre est bien documenté dans la littérature: les backbones VLM classiques, optimisés pour le Visual Question Answering, excellent à identifier sémantiquement des objets mais restent relativement insensibles aux variations 3D fines qui dictent des stratégies de préhension différentes. Ce phénomène, qualifié de "feature collapse" par les auteurs, dégrade l'efficacité d'entraînement et limite la généralisation inter-tâches. En découplant explicitement la perception spatiale 3D de la supervision d'action, l'approche vise à réduire significativement le nombre de démonstrations nécessaires pour adapter une politique à un nouveau contexte, ce qui représente aujourd'hui l'un des principaux freins à l'industrialisation des VLA. À noter que les tâches réelles testées ne sont pas détaillées dans l'article, et les performances sur benchmarks simulés ne préjugent pas du comportement en environnement industriel non contrôlé. Les VLA sont au coeur d'une compétition de recherche intense depuis RT-2 de Google DeepMind en 2023, et des modèles comme Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) ou OpenVLA ont chacun tenté d'adresser le sim-to-real gap et la dépendance aux larges corpus de démonstrations. RoboTwin 2.0 et LIBERO sont devenus des références de facto pour comparer ces politiques en manipulation. Pose-VLA s'inscrit dans une tendance plus large de découplage des phases d'entraînement, parallèlement à des approches comme UniSim ou RoboVLMs. Cette publication reste au stade académique: aucun déploiement industriel, partenariat commercial ni timeline de mise en production ne sont mentionnés, et les expériences réelles se limitent à un contexte laboratoire avec des objets courants.

RechercheOpinion
1 source
NORM-Nav : navigation de robot mobile sans apprentissage préalable, guidée par contraintes comportementales en langage naturel
3592arXiv cs.RO 

NORM-Nav : navigation de robot mobile sans apprentissage préalable, guidée par contraintes comportementales en langage naturel

NORM-Nav est un framework zero-shot présenté en mai 2026 dans un preprint arXiv (2605.16979) pour la navigation de robots mobiles en environnements humains. Le système associe un grand modèle de langage (LLM) à une perception temps réel par fusion vision-LiDAR: l'opérateur formule des règles comportementales en langage naturel, le LLM les parse en contraintes structurées, et celles-ci sont encodées sous forme de costmaps multi-couches couvrant quatre dimensions (géométrique, sémantique, directionnel, vitesse), directement compatibles avec les planificateurs grid-based standards comme ceux utilisés sous ROS. Des expériences en simulation et en environnement réel indiquent une amélioration des taux de succès de tâche et des trajectoires statistiquement plus proches des références humaines par rapport aux baselines testées, sans réentraînement du planificateur de base. L'enjeu concret est le suivant: les costmaps conventionnels traitent la navigation comme un problème géométrique pur, produisant des trajectoires techniquement valides mais socialement inadaptées, frôlement de passants, ignorance des sens de circulation, vitesse inappropriée en zone dense. Pour un intégrateur déployant des AMR en environnement hospitalier, en entrepôt partagé ou en espace public, cette limite est un frein réel à l'acceptation opérationnelle. NORM-Nav adresse ce verrou en mode zero-shot, sans données de démonstration spécifiques à l'environnement cible, ce qui simplifie le pipeline de déploiement. La compatibilité native avec les planificateurs standard constitue l'argument industriel clé: pas de refonte architecturale, pas de rupture avec la stack ROS existante. La navigation socialement consciente (social navigation) est un chantier actif depuis une décennie, porté par des travaux comme CADRL, SARL ou ORCA, et plus récemment par des approches LLM comme NavGPT ou LM-Nav. NORM-Nav s'inscrit dans cette tendance mais mise sur l'intégration costmap plutôt que sur un planificateur de bout en bout, choix conservateur et pragmatique pour l'industrie. Le preprint ne cite ni partenaires industriels ni timeline de commercialisation, le positionnant clairement comme contribution académique à ce stade. Une soumission en conférence (IROS 2026 ou CoRL 2026) est vraisemblable. Sur le terrain concurrent, Boston Dynamics (Spot en environnements mixtes), les acteurs AMR comme Exotec, et plusieurs projets académiques franco-européens travaillent sur la cohabitation robots-humains, bien qu'aucun n'utilise exactement cette approche de grounding linguistique sur couches costmap.

IA physiquePaper
1 source
D'une seule démonstration à une politique générale pour la manipulation avec contact
3593arXiv cs.RO 

D'une seule démonstration à une politique générale pour la manipulation avec contact

Une équipe de recherche publie sur arXiv (réf. 2605.17601, mai 2026) un framework d'apprentissage par démonstration capable de généraliser à partir d'un seul exemple sur des tâches de manipulation impliquant des contacts répétés avec l'environnement. Le système repose sur un pipeline en quatre étapes : abstraction de la démonstration en primitives de contraintes environnementales, exploration autonome pour lever les ambiguïtés, correction ciblée par un opérateur humain pour couvrir les variantes hors-distribution, et enfin récupération en ligne des détails géométriques via interaction compliante. Validé sur sept tâches réelles multi-étapes à contact riche, le framework atteint un taux de succès supérieur à 90 %. Aucune entreprise spécifique ni plateforme robotique n'est mentionnée dans le préprint, qui reste une contribution académique sans déploiement industriel annoncé. Le point central de l'approche est de représenter une tâche non pas comme une trajectoire à imiter, mais comme une séquence de contraintes environnementales à exploiter. Ce changement de paradigme permet au robot de distinguer la structure générale d'une tâche (types de contraintes, transitions entre elles) des détails spécifiques à une instance donnée (poses exactes, géométrie locale). Pour un intégrateur ou un décideur industriel, cela signifie qu'une seule démonstration suffit potentiellement là où les méthodes de behavior cloning classiques en réclament des centaines. Le résultat de 90 %+ sur des tâches à contact riche est notable car ce domaine concentre la majorité des échecs en manipulation robotique réelle, notamment à cause de la sensibilité aux variations de pose et aux dynamiques de contact non modélisées. L'apprentissage par démonstration est un champ très actif depuis une décennie, concurrencé récemment par les politiques de diffusion (Diffusion Policy, Pi-0 de Physical Intelligence), les architectures VLA (RT-2, GR00T N2 de NVIDIA) et les méthodes ACT (Action Chunking with Transformers). L'originalité revendiquée ici est de traiter les contraintes environnementales comme biais inductif plutôt que d'augmenter massivement les données d'entraînement ou la puissance du modèle. La limite principale reste l'absence d'évaluation sur des plateformes humanoïdes ou collaboratives standard, ce qui rend difficile la comparaison directe avec les benchmarks du secteur. Les suites naturelles seraient un passage à des environnements ouverts et une validation sur des robots commerciaux comme le Franka Research 3 ou les bras UR.

RecherchePaper
1 source
Vers des robots durables : affiner les modèles VLA par apprentissage par renforcement continu
3594arXiv cs.RO 

Vers des robots durables : affiner les modèles VLA par apprentissage par renforcement continu

Une équipe de chercheurs publie sur arXiv (2602.10503, février 2026) une méthode de fine-tuning appelée LifeLong-RFT, conçue pour permettre aux modèles VLA (Vision-Language-Action) de s'adapter en continu à de nouvelles tâches sans effacer les précédentes. Les VLA, tels que pi-0 de Physical Intelligence ou OpenVLA, sont pré-entraînés sur des datasets massifs et variés, ce qui leur confère une bonne généralisation. Leur adaptation à des domaines spécifiques repose cependant majoritairement sur le Supervised Fine-Tuning (SFT), une approche qui exige de larges volumes de données tâche-spécifiques et souffre du catastrophic forgetting : le modèle oublie ses acquis antérieurs en assimilant de nouvelles compétences. LifeLong-RFT substitue au SFT un mécanisme de Reinforcement Fine-Tuning (RFT) indépendant de tout feedback environnemental en ligne et de tout reward model pré-entraîné. La méthode repose sur trois signaux de récompense combinés : le QACR (Quantized Action Consistency Reward), qui vérifie la cohérence de la prédiction d'actions dans l'espace discret ; le CTAR (Continuous Trajectory Alignment Reward), qui aligne les chunks d'actions continues sur des trajectoires de référence ; et le FCR (Format Compliance Reward), qui garantit la validité structurelle des sorties. Sur le benchmark LIBERO dédié à l'apprentissage continu, LifeLong-RFT affiche un gain de 22 points de taux de succès moyen par rapport au SFT, en n'utilisant que 20 % des données d'entraînement pour s'adapter à de nouvelles tâches. Les expériences couvrent SimplerEnv, LIBERO et des scénarios réels. Ce résultat s'attaque directement au principal frein à l'apprentissage continu en déploiement : la nécessité de réentraîner un modèle depuis un checkpoint dès qu'on veut lui enseigner une nouvelle opération. Le fait que LifeLong-RFT ne nécessite ni feedback en ligne (interactions réelles avec l'environnement, coûteuses et parfois dangereuses en production) ni reward model séparé réduit considérablement la barrière à l'adaptation terrain. Pour un intégrateur ou un COO industriel, cela signifie qu'un bras manipulateur ou un robot mobile basé VLA pourrait théoriquement apprendre de nouvelles tâches avec un cinquième des données actuellement nécessaires, sans régresser sur ses acquis. La validation partielle sur des tâches réelles renforce la crédibilité des résultats, même si le papier reste un preprint arXiv et que les conditions expérimentales real-world ne sont pas détaillées dans le résumé public. La course aux VLA comme politique unifiée pour la robotique généraliste s'est intensifiée depuis 2024 avec pi-0 (Physical Intelligence), OpenVLA (UC Berkeley), GR00T N2 (NVIDIA) et Helix (Figure AI), tous cherchant à résoudre l'adaptation domaine-spécifique avec un minimum de données supplémentaires. LifeLong-RFT s'inspire directement des techniques GRPO et RLHF qui ont transformé le post-training des LLMs, les transposant ici au niveau des chunks d'actions robotiques. Il se positionne comme un paradigme post-training alternatif au SFT, sans contrainte d'infrastructure lourde. Aucun déploiement ni partenariat industriel n'est annoncé : il s'agit d'une contribution académique avec page projet dédiée. Les suites naturelles incluent l'extension à des architectures VLA plus récentes et des benchmarks multi-tâches à plus longue durée, critères encore absents de cette évaluation.

IA physiqueOpinion
1 source
Caméras externes fixes comme cartes de référence communes pour la génération active de graphes de scènes 3D
3595arXiv cs.RO 

Caméras externes fixes comme cartes de référence communes pour la génération active de graphes de scènes 3D

Des chercheurs ont publié sur arXiv (réf. 2605.18184) un framework RGB-only permettant à un robot de construire incrémentalement un graphe de scène 3D (3DSG) en exploitant des caméras fixes extérieures comme cartes a priori communes, désignées sous le terme "Common Prior Maps" (CPMs). Le principe : avant même que le robot ne commence à se déplacer, une ou plusieurs caméras RGB fixes, caméras de surveillance, caméras d'atelier déjà en place, fournissent une vue large de l'environnement qui initialise une représentation sémantique et géométrique de la scène. Le système fusionne ensuite les observations embarquées (caméra du robot) et extérieures dans un pipeline unique, sans modification matérielle, en traitant chaque flux caméra de manière identique via un modèle de reconstruction 3D feed-forward. Résultat mesuré : l'intégration d'une seule caméra externe augmente le rappel initial d'objets de +79 %, et l'exploration active subséquente devient significativement plus efficace grâce à ce contexte enrichi. L'intérêt opérationnel est direct pour les intégrateurs robotiques en environnement industriel ou logistique : l'infrastructure caméra fixe est souvent déjà déployée (sécurité, supervision), et la pouvoir réutiliser comme prior sémantique évite le coût d'un SLAM à froid complet. Le graphe de scène 3D oriente ensuite l'exploration active du robot vers les zones de haute incertitude sémantique, ce qui réduit le temps de cartographie utile. L'approche contredit une hypothèse courante selon laquelle la reconstruction 3D précise exigerait obligatoirement des capteurs de profondeur (LiDAR, RGB-D), ici, RGB seul suffit via un modèle feed-forward, ce qui abaisse le seuil matériel d'entrée. Le gain de +79 % en rappel initial est notable, mais il convient de noter que ce chiffre est mesuré en début d'exploration : l'article ne détaille pas les conditions exactes des scènes de test ni la diversité des configurations d'occlusion. Cette recherche s'inscrit dans une dynamique active autour des graphes de scène pour la robotique autonome, après des travaux fondateurs comme 3DSG (MIT, 2020) et les approches Hydra (MIT SPARK Lab). Elle se distingue des méthodes classiques de cartographie sémantique en exploitant des informations a priori déjà disponibles dans de nombreux déploiements industriels, plans BIM, images de télédétection, flux caméra fixes, plutôt que de partir d'une page blanche. Aucune collaboration industrielle ni timeline de transfert n'est mentionnée dans la publication ; le travail reste pour l'instant au stade de la démonstration académique. Les prochaines étapes naturelles seraient l'évaluation sur des scènes dynamiques peuplées d'humains ou d'AMR, et l'intégration avec des pipelines de planification de tâches en aval.

RecherchePaper
1 source
DyGRO-VLA : mise à l'échelle inter-tâches des modèles vision-langage-action par optimisation résiduelle groupée dynamique
3596arXiv cs.RO 

DyGRO-VLA : mise à l'échelle inter-tâches des modèles vision-langage-action par optimisation résiduelle groupée dynamique

Des chercheurs ont soumis sur arXiv (réf. 2605.17486) un nouveau framework d'optimisation pour les modèles VLA (Vision-Language-Action), baptisé DyGRO-VLA (Dynamic Grouped Residual Optimization for VLA). L'approche fonctionne en deux étapes : une phase de capture de représentations latentes inter-tâches fondée sur des principes de théorie de l'information, suivie d'un raffinement dynamique de la politique via un mécanisme de "mixture-of-RL-residuals". Les résultats sont évalués sur les benchmarks LIBERO et RoboTwin2, deux références standard en manipulation robotique multi-tâches, et validés sur robot réel. Les gains de performance sont présentés comme consistants face à des baselines solides, y compris sous distribution shift, c'est-à-dire face à des tâches absentes de l'ensemble d'entraînement. Le problème visé est structurel : lorsqu'on affine un modèle VLA généraliste avec du Reinforcement Learning, il finit généralement par ne bien performer que sur un sous-ensemble étroit de tâches, perdant la polyvalence qui le rendait intéressant. La plupart des optimiseurs RL actuels sont conçus pour une tâche unique, ce qui réduit ces modèles, pourtant pensés comme des contrôleurs généralistes, à des politiques spécialisées peu transférables. Pour un intégrateur ou un industriel déployant des robots sur des lignes à forte variabilité de tâches, ce phénomène est un frein opérationnel direct. DyGRO-VLA répond à ce problème en exploitant les représentations latentes partagées entre tâches tout en limitant les interférences lors de l'optimisation. Si ces résultats se confirment dans des conditions plus diversifiées, cela aurait des implications concrètes sur la viabilité du fine-tuning RL pour des modèles comme Pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA). L'essor des modèles VLA, qui combinent vision, langage et action dans un seul réseau de neurones, est l'une des tendances majeures de la robotique depuis 2023. Des acteurs comme Physical Intelligence (Pi-0, Pi-0.5), NVIDIA (GR00T N2), Google DeepMind (RT-2) ou des startups comme Figure AI et 1X Technologies s'appuient sur cette architecture. Le recours au RL pour dépasser les limites de l'imitation pure est une évolution naturelle, mais le maintien des performances sur plusieurs tâches reste un problème ouvert. DyGRO-VLA s'inscrit dans un courant de recherche actif qui inclut des approches comme ReinFT. L'absence de détails sur les conditions expérimentales exactes (nombre de tâches, hardware robot utilisé, comparaisons directes avec les VLA commerciaux) et l'absence de code public au moment de la soumission rendent difficile une évaluation indépendante, une limite fréquente des prépublications arXiv.

RechercheOpinion
1 source
Un modèle de représentation universel pour la manipulation dextérique unifiée
3597arXiv cs.RO 

Un modèle de représentation universel pour la manipulation dextérique unifiée

Une équipe de chercheurs propose OHRA (One Hand to Rule Them All), un cadre de représentation canonique paramétrisée visant à unifier les politiques de manipulation dextère sur des mains robotiques de morphologies très différentes. Constat de départ : les politiques d'apprentissage actuelles supposent une architecture de main fixe et ne se transfèrent pas sans réentraînement complet. Le système combine un espace de paramètres unifié capturant les variations cinématiques et morphologiques essentielles, et un format URDF canonique standardisant l'espace d'action tout en préservant les propriétés dynamiques de chaque main d'origine. Un VAE (Variational Autoencoder) est entraîné sur cet espace pour produire un plongement latent compact et sémantiquement cohérent. Résultat clé : la politique de préhension conditionnée sur cette représentation atteint 81,9 % de succès en transfert zéro-shot sur une LEAP Hand à 3 doigts, morphologie non vue pendant l'entraînement, validée en simulation et sur tâches réelles. L'enjeu est directement industriel : la fragmentation des designs de mains, Shadow Robotics, LEAP, Allegro, Ability Hand, rend les politiques non portables d'un hardware à l'autre. Un cadre partagé permettrait à un intégrateur de réentraîner une politique existante sur un nouveau manipulateur sans repartir de zéro, comprimant les coûts de déploiement. Le score de 81,9 % en zéro-shot sur une configuration inédite est un signal mesurable que le "morphology gap", l'analogue du sim-to-real gap appliqué aux architectures de mains, commence à être adressé. Le fait que les interpolations dans l'espace latent produisent des transitions morphologiques physiquement cohérentes indique que le VAE capture une géométrie fonctionnelle, pas seulement statistique. Ce travail s'inscrit dans la dynamique plus large de l'apprentissage cross-embodiment, aux côtés de travaux comme UniDexGrasp, DexGraspNet ou les approches fondées sur des VLA (Vision-Language-Action models). Sur le plan concurrentiel, Google DeepMind, Physical Intelligence (Pi-0) et Unitree investissent dans des politiques généralisables, mais l'angle "unification par représentation canonique de la morphologie de main" reste peu exploré industriellement. Les suites naturelles incluent l'extension à la manipulation bimanuelle, aux mains à plus de 5 doigts, et l'intégration dans des pipelines de téléopération. Aucun déploiement commercial ni partenariat industriel n'est annoncé à ce stade.

RecherchePaper
1 source
ESI-Bench : vers une intelligence spatiale incarnée qui boucle la perception et l'action
3598arXiv cs.RO 

ESI-Bench : vers une intelligence spatiale incarnée qui boucle la perception et l'action

Une équipe de chercheurs a publié ESI-Bench, un benchmark dédié à l'intelligence spatiale incarnée (embodied spatial intelligence), conçu pour évaluer la capacité des agents artificiels à fermer la boucle perception-action. Le benchmark, construit sur le simulateur OmniGibson, couvre 10 catégories de tâches et 29 sous-catégories, ancrées dans les systèmes de connaissances fondamentales de la psychologue Elizabeth Spelke (objets, agents, nombre, géométrie). Contrairement aux benchmarks classiques qui fournissent des observations "oracle" figées, ESI-Bench exige que l'agent décide lui-même quelles capacités mobiliser, perception, locomotion, manipulation, et dans quel ordre, pour accumuler activement les informations pertinentes à la tâche. Les expériences menées sur les modèles multimodaux de pointe (MLLMs) révèlent un écart significatif entre exploration active et observation passive : les agents qui choisissent leurs points de vue surpassent nettement leurs homologues passifs. Fait notable, ces agents développent spontanément des stratégies spatiales émergentes sans instruction explicite. En revanche, l'acquisition multi-vues aléatoire dégrade souvent les performances en ajoutant du bruit plutôt que du signal, malgré un volume d'images bien supérieur. L'étude identifie une cause principale d'échec qu'elle nomme "action blindness" : de mauvais choix d'action produisent de mauvaises observations, qui induisent à leur tour des erreurs en cascade. Autre résultat contre-intuitif : une représentation 3D imparfaite se révèle plus nuisible qu'une baseline 2D, car elle distord les relations spatiales au lieu de les clarifier. Les auteurs documentent également un écart métacognitif net par rapport aux humains : là où un opérateur humain cherche activement des angles réfutant son hypothèse et révise ses croyances face à une contradiction, les modèles s'engagent prématurément avec une confiance élevée indépendamment de la qualité des preuves disponibles. ESI-Bench s'inscrit dans une vague de travaux cherchant à dépasser les limites des benchmarks statiques pour robots et agents incarnés, notamment VQA-3D, ScanQA ou EmbodiedScan, qui évaluent la compréhension spatiale sans boucle de rétroaction motrice. La dépendance à OmniGibson implique que les résultats restent pour l'instant confinés à la simulation, et le gap sim-to-real, déjà central dans les débats sur les VLA comme Pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA), n'est pas adressé ici. Ce benchmark ne teste pas de robots physiques déployés mais des MLLMs dans un environnement simulé. Les prochaines étapes naturelles incluront le transfert vers des plateformes réelles et l'intégration de politiques de manipulation close-loop pour valider si les stratégies émergentes observées en simulation tiennent face aux incertitudes du monde physique.

RecherchePaper
1 source
StableVLA : vers des modèles vision-langage-action (VLA) robustes sans données supplémentaires
3599arXiv cs.RO 

StableVLA : vers des modèles vision-langage-action (VLA) robustes sans données supplémentaires

Des chercheurs ont publié sur arXiv (réf. 2605.18287) StableVLA, une approche visant à renforcer la robustesse des modèles Vision-Language-Action (VLA) face aux perturbations visuelles non représentées dans les données d'entraînement. Le coeur de la contribution est l'Information Bottleneck Adapter (IB-Adapter), un module léger fondé sur la théorie de l'information qui filtre sélectivement le bruit dans les entrées visuelles. Sans données supplémentaires ni stratégie d'augmentation, l'IB-Adapter améliore les performances de la baseline de 30% en moyenne, pour un surcoût inférieur à 10 millions de paramètres. Malgré un backbone de seulement 0,5 milliard de paramètres, soit 14 fois plus petit que les VLA concurrents à 7B, StableVLA atteint une robustesse comparable à ces modèles sur des tâches à horizon long, et surpasse OpenPi sous corruptions visuelles synthétiques et physiques, sans pré-entraînement sur le jeu de données Open X-Embodiment. Ce résultat adresse un angle mort critique du déploiement robotique réel : il est structurellement impossible de couvrir dans un dataset d'entraînement l'ensemble des conditions visuelles dégradées rencontrées en production (éclairage adverse, occlusions partielles, flou de bougé, saleté sur les capteurs). Les VLA actuels, malgré leurs performances en benchmark, accusent une chute significative dès qu'une perturbation inédite apparaît, ce qui constitue un frein majeur à leur industrialisation. L'approche proposée réduit ce gap sim-to-real sans alourdir les pipelines de collecte de données, ce qui est pertinent pour les intégrateurs cherchant à déployer des systèmes génériques sans ingénierie de dataset coûteuse. Le contexte de ce travail est la montée en puissance des architectures VLA pour la manipulation robotique généraliste, portée notamment par Physical Intelligence avec Pi-0 (OpenPi), qui fait office de référence dans la catégorie 7B. Open X-Embodiment, le corpus de référence pour le pré-entraînement multi-robot, reste difficile d'accès pour des équipes à ressources limitées. StableVLA se positionne explicitement contre cette tendance à l'échelle, en pariant sur l'efficacité paramétrique. Le papier reste un preprint arXiv sans validation industrielle annoncée, et les métriques de robustesse présentées gagneraient à être confrontées à des évaluations sur matériel réel dans des conditions non contrôlées.

IA physiqueOpinion
1 source
Mono-Hydra++ : construction en temps réel de graphes de scènes monoculaires par apprentissage multi-tâches pour la cartographie 3D intérieure
3600arXiv cs.RO 

Mono-Hydra++ : construction en temps réel de graphes de scènes monoculaires par apprentissage multi-tâches pour la cartographie 3D intérieure

Des chercheurs ont publié en mai 2026 (arXiv:2605.17661) Mono-Hydra++, un pipeline temps réel capable de construire des graphes de scène 3D hiérarchiques d'intérieurs en n'utilisant qu'une caméra RGB monoculaire et une IMU, sans capteur de profondeur actif. Le coeur du système repose sur M2H-MX, un modèle multi-tâches fondé sur DINOv3 qui estime simultanément la profondeur et la sémantique des images. Ces estimations alimentent un front-end d'odométrie visuelle-inertielle (VIO) enrichi de contraintes de profondeur prédites creuses, d'un masquage sémantique des zones dynamiques et d'un alignement temporel tenant compte de la pose, avant fusion volumétrique dans le backend Mono-Hydra. Sur le sous-ensemble d'évaluation Go-SLAM/ScanNet, le système affiche 1,6 % d'erreur de trajectoire en moins que le meilleur baseline RGB-D testé ; sur le benchmark calibré 7-Scenes, il réduit l'ATE moyen de 29,8 % par rapport au meilleur concurrent calibré. Le modèle de perception M2H-MX-L, exporté en ONNX/TensorRT FP16, tourne à 25,53 FPS sur un Jetson Orin NX 16 Go, et le pipeline a été validé dans un déploiement réel dans un bâtiment ITC avec une caméra RealSense RGB + IMU. L'impact industriel est direct pour les plateformes à contraintes sévères : drones d'inspection, robots humanoïdes légers et AMR embarquant peu de puissance. Jusqu'ici, la construction de graphes de scène 3D, qui organisent l'espace en objets, pièces et relations spatiales, nécessitait des capteurs actifs (RGB-D ou LiDAR) impraticables dès que le payload ou la consommation électrique sont limités. Mono-Hydra++ démontre qu'il est possible d'atteindre, voire de dépasser, la précision de ces baselines lourds avec une seule caméra et une IMU bas coût. Pour un intégrateur ou un COO industriel, cela signifie une réduction substantielle du coût matériel embarqué et l'ouverture de cas d'usage où le RGB-D n'est pas envisageable. Il convient toutefois de noter que les résultats sont issus de benchmarks académiques standardisés : la robustesse sur des scènes industrielles non contrôlées, avec éclairages difficiles ou textures répétitives, reste à confirmer dans des conditions opérationnelles réelles. Mono-Hydra++ s'inscrit dans la lignée du système Hydra du MIT, qui a posé les bases de la représentation hiérarchique en graphe de scène pour la robotique. L'utilisation de DINOv3 comme backbone de vision fondationnelle est cohérente avec la tendance forte à extraire simultanément géométrie et sémantique depuis des modèles pré-entraînés à grande échelle. Sur ce terrain, les concurrents directs incluent les systèmes basés sur RGB-D comme Go-SLAM, iMAP ou NICE-SLAM, ainsi que des approches VIO-sémantiques récentes, mais peu proposent la combinaison complète cartographie métrique, sémantique et graphe de scène en temps réel sur matériel embarqué contraint. En tant que preprint arXiv non encore évalué par les pairs, les prochaines étapes attendues sont la publication en conférence (IROS, ICRA), des tests sur plateformes aériennes effectives et une éventuelle intégration dans des stacks robotiques open-source comme ROS 2.

RecherchePaper
1 source