Aller au contenu principal

Actualités robotique — page 86

4 468 articles au fil, du plus récent au plus ancien.

OREN : réseau résiduel octree pour la cartographie en distance euclidienne signée en temps réel
4251arXiv cs.RO 

OREN : réseau résiduel octree pour la cartographie en distance euclidienne signée en temps réel

Des chercheurs ont publié sur arXiv (réf. 2510.18999, version 2) OREN, pour Octree Residual Network, une méthode de reconstruction de fonctions de distance signée euclidienne (ESDF) en temps réel à partir de nuages de points 3D. L'architecture est hybride : une structure octree assure l'interpolation spatiale explicite, tandis qu'un réseau de neurones calcule le résidu implicite. L'objectif annoncé est un ESDF complet (non tronqué), différentiable, avec une empreinte mémoire et computationnelle comparable aux méthodes volumétriques discrètes classiques, et une précision proche des approches entièrement neurales. Des expériences extensives sur des jeux de données de référence sont citées à l'appui de ces affirmations. La carte de distance signée est une primitive fondamentale de l'autonomie robotique : elle conditionne la planification de trajectoire, le contrôle d'évitement de collision et le SLAM. Les méthodes en production restent majoritairement des TSDF (Truncated Signed Distance Field, comme VoxBlox) rapides et scalables mais tronqués à une bande de surface étroite et non différentiables ; les méthodes neurales pures (iSDF de Meta, approches NeRF-based) sont continues et précises mais souffrent d'oubli catastrophique dans les grands environnements et restent trop coûteuses pour l'embarqué temps-réel. Si les performances annoncées de OREN résistent à une validation indépendante, l'approche pourrait concrètement débloquer l'ESDF temps-réel pour des robots mobiles et manipulateurs opérant à grande échelle en environnements dynamiques, sans les compromis habituels. OREN s'inscrit dans une vague de méthodes hybrides cherchant à réconcilier efficacité des structures discrètes et expressivité neurale, aux côtés de travaux comme SHINE-Mapping ou NGLOD. Les représentations volumétriques comme OctoMap et OpenVDB dominent encore les déploiements industriels réels. Meta avait positionné iSDF en 2022 comme alternative neurale scalable ; depuis, plusieurs équipes de recherche travaillent à réduire les coûts d'inférence pour franchir le seuil du temps-réel embarqué. L'article est un preprint arXiv (v2, soumis en octobre 2025), sans peer-review finalisé et sans affiliation industrielle identifiée dans le résumé. Les prochaines étapes attendues incluent une évaluation sur des benchmarks standardisés tels que ScanNet ou SemanticKITTI, et une intégration dans des pipelines SLAM open-source pour confirmer les gains annoncés en conditions réelles.

RecherchePaper
1 source
FeudalNav : un framework simple pour la navigation visuelle
4252arXiv cs.RO 

FeudalNav : un framework simple pour la navigation visuelle

Des chercheurs ont publié sur arXiv (référence 2602.06974) FeudalNav, un cadre hiérarchique de navigation visuelle pour robots mobiles qui ne requiert ni carte métrique, ni GPS, ni données odométriques en phase d'entraînement ou d'inférence. Le système décompose la prise de décision en plusieurs niveaux : un réseau de sélection de sous-objectifs (waypoints) léger et transférable choisit des points intermédiaires, tandis qu'un module de mémoire dans l'espace latent organise les observations visuelles passées par similarité visuelle, utilisée comme proxy de distance. Ce module de mémoire remplace les représentations topologiques classiques basées sur des graphes, sans dégradation notable des performances. Les résultats sont obtenus dans les environnements simulés Habitat AI, un benchmark standard du domaine, et montrent des scores compétitifs face aux méthodes état de l'art. Les auteurs explorent également une modalité d'navigation interactive : ils quantifient la quantité minimale d'intervention humaine nécessaire pour atteindre un taux de succès de 100% sur l'ensemble des trajectoires testées. L'intérêt de FeudalNav réside dans sa sobriété architecturale. Là où la plupart des navigateurs apprenants reposent sur des graphes topologiques coûteux à maintenir ou sur des représentations métriques qui échouent dans des environnements non cartographiés, FeudalNav prouve qu'une mémoire visuelle latente simple suffit pour guider un agent vers un objectif en terrain inconnu. Cette approche réduit les exigences d'infrastructure embarquée (pas de capteur odométrique requis) et améliore la transférabilité entre environnements, deux critères directement pertinents pour les intégrateurs de robots de service ou d'inspection industrielle. La composante interactive est notable : même une intervention humaine minimale et ponctuelle augmente significativement le taux de réussite global, ce qui ouvre la voie à des architectures human-in-the-loop adaptatives. FeudalNav s'inscrit dans un courant de recherche actif visant à dépasser les navigateurs métriques classiques (SLAM, cartographie 2D/3D) en faveur d'approches fondées sur l'apprentissage et la mémoire sémantique, directement inspirées de la cognition spatiale humaine. Le benchmark Habitat AI, développé par Meta AI Research, est devenu la référence pour évaluer ce type de systèmes en simulation. Les méthodes concurrentes incluent les approches à graphes topologiques (NoMaD, ViNT de Berkeley) et les navigateurs basés sur des Vision-Language Models (VLMaps, CoW). FeudalNav se distingue par sa légèreté et l'absence d'odométrie, mais reste pour l'instant cantonné à la simulation, sans validation sur robot physique annoncée dans cet article.

RecherchePaper
1 source
Caractérisation du couplage des couples tangage-roulis dans des robots à ailes battantes de taille insecte via un cardan microfabriqué
4253arXiv cs.RO 

Caractérisation du couplage des couples tangage-roulis dans des robots à ailes battantes de taille insecte via un cardan microfabriqué

Des chercheurs ont publié sur arXiv (réf. 2604.22121) une étude portant sur la caractérisation du couplage entre les couples de tangage (pitch) et de roulis (roll) dans les robots insectes à ailes battantes (FIR, Flapping-wing Insect Robots) sub-gramme. La plateforme testée pèse 180 mg et est actionnée par piézoélectriques, une architecture typique des systèmes volants à l'échelle milligramme, où la fréquence de battement d'aile est calée sur la résonance mécanique. L'outil central de l'étude est un cardan (gimbal) microfabriqué capable de mesurer simultanément le couple de roulis, le couple de tangage et la poussée, comblant ainsi un angle mort instrumental : aucun capteur biaxial ne disposait jusqu'ici d'une sensibilité suffisante pour opérer à cette échelle. Les résultats montrent un coefficient de détermination R² de 0,95 pour le tangage et 0,98 pour le roulis dans la régression linéaire, avec des coefficients de corrélation croisée de -0,001 et -0,085 respectivement, soit un couplage inter-axes négligeable. La poussée ne dévie que de 5,8 % maximum autour de sa valeur moyenne lors des commandes simultanées sur les deux axes. Ces mesures valident une hypothèse de conception qui était jusqu'alors posée sans vérification expérimentale directe : dans les systèmes FIR piézoélectriques, les axes de tangage et de roulis peuvent être traités comme indépendants dans les lois de commande. C'est une donnée structurante pour les équipes qui développent des contrôleurs, des simulateurs ou des modèles aérodynamiques pour ces plateformes : le sim-to-real et la synthèse de correcteurs peuvent s'appuyer sur des modèles découplés sans introduire d'erreur systématique significative. Pour l'écosystème micro-robotique, la contribution méthodologique est peut-être aussi importante que le résultat lui-même : disposer d'un banc de mesure microfabriqué standardisable ouvre la voie à une caractérisation systématique d'autres effets de couplage (yaw, variations d'envergure, asymétries d'aile) qui restent aujourd'hui peu documentés. Le champ des FIR sub-gramme est dominé depuis plus d'une décennie par le RoboBee de Harvard (environ 80 à 100 mg selon les versions), pionnier de l'actionnement piézoélectrique à résonance, et par le DelFly du TU Delft dans la gamme plus élevée (quelques grammes, ailes membraneuses). La modélisation de ces systèmes bute sur deux obstacles conjoints : la complexité mécanique des ailes flexibles et les effets aérodynamiques instationnaires qui rendent les outils classiques de la mécanique du vol inapplicables directement. Cette publication ne mentionne pas d'affiliation ou de financeur dans l'abstract disponible, ce qui limite le contexte institutionnel. Les suites naturelles annoncées sont l'intégration des mesures dans des modèles dynamiques raffinés et leur exploitation pour la conception de contrôleurs plus robustes, étapes préalables à tout déploiement autonome de robots insectes en milieu non contrôlé.

RecherchePaper
1 source
Planification efficace en temps réel pour la robotique en essaim via un tube virtuel optimal
4254arXiv cs.RO 

Planification efficace en temps réel pour la robotique en essaim via un tube virtuel optimal

Une équipe de chercheurs propose, dans un preprint arXiv (2505.01380v2, version 2 publiée en mai 2025), un cadre de planification de trajectoires homotopiques pour essaims de robots naviguant dans des environnements à obstacles inconnus. La méthode repose sur un concept de "tube virtuel optimal" : un corridor topologique calculé de manière centralisée, dans lequel chaque robot se déplace de façon distribuée. En exploitant la programmation multiparamétrique pour approximer les trajectoires optimales par des fonctions affines, la complexité de calcul obtenue est en O(nt), où nt désigne le nombre de paramètres de trajectoire. Ce résultat permet une replanification haute fréquence sur des processeurs embarqués à ressources limitées. Les auteurs valident leur approche par simulations et expériences physiques, sans préciser les dimensions des essaims testés ni les conditions réelles de déploiement. Le verrou adressé est structurant pour la robotique en essaim : les planificateurs réactifs offrent une fréquence de replanification élevée mais convergent vers des minima locaux, tandis que les planificateurs multi-étapes réduisent les interblocages au prix d'un coût de calcul incompatible avec les plateformes embarquées. En combinant planification centralisée homotopique et contrôle distribué, le framework se positionne comme une solution hybride crédible. Si les résultats se confirment sur des essaims de plusieurs dizaines d'agents en environnement réel, les applications sont directes : exploration de zones dangereuses, logistique autonome en entrepôt, coordination de flottes d'AMR en espaces encombrés. Les intégrateurs industriels y trouveraient un algorithme de coordination à faible empreinte calculatoire. La planification d'essaims en milieu inconnu est un domaine actif depuis une décennie, avec des contributions majeures d'ETH Zurich, MIT CSAIL et CMU. Les approches par tubes homotopiques existent depuis les années 2010 dans la planification mono-robot ; leur extension aux essaims pose des problèmes de passage à l'échelle que ce travail tente de résoudre par approximation affine. Aucun partenariat industriel ni calendrier de déploiement n'est mentionné : le stade actuel est celui d'une preuve de concept académique. Les étapes naturelles seraient la validation sur des essaims physiques de 20 à 50 robots et la mise à disposition du code, absente de la publication.

RecherchePaper
1 source
Robotera lève près de 350 M$ en deux mois et revendique le premier PMF en IA incarnée
4255Pandaily 

Robotera lève près de 350 M$ en deux mois et revendique le premier PMF en IA incarnée

Robotera, startup chinoise de robotique humanoïde, a finalisé un tour de financement supérieur à 2 milliards de RMB (environ 280 millions de dollars), mené par SF Group avec la participation de Sequoia China, IDG Capital, CICC Capital, Dongfeng Investment, ICBC Capital et des fonds affiliés à China Unicom. Ce nouveau round porte le total levé à près de 2,5 milliards de RMB (environ 350 millions de dollars) en deux mois, la demande ayant selon la société largement dépassé sa cible initiale. Le portefeuille d'investisseurs comprend désormais Alibaba, Geely, BAIC, Dongfeng, Samsung, Lenovo, Haier, Singtel et Woori Financial Group. Sur le plan opérationnel, Robotera annonce avoir commencé au deuxième trimestre 2026 des livraisons à l'échelle de plusieurs milliers d'unités, avec un taux de croissance revendiqué de 300% (sans base de comparaison publiée). La société déploie ses robots dans plus de dix centres logistiques en Chine du Nord, de l'Est et du Sud, en partenariat avec China Post et SF Group, atteignant dans certains contextes jusqu'à 85% de l'efficacité humaine, en cycle continu 24h/24. Ce financement, bouclé en deux mois, traduit un basculement dans la robotique industrielle chinoise : les grands opérateurs ne regardent plus, ils déploient. Pour les intégrateurs et décideurs B2B, le signal fort vient de la logistique, secteur à pénurie de main-d'oeuvre documentée et cycles de rentabilisation courts. Si les métriques annoncées restent difficiles à vérifier hors conditions contrôlées, la présence de SF Group simultanément comme investisseur et client opérationnel suggère un ancrage plus substantiel qu'une démonstration. L'affirmation d'un PMF ("product-market fit") qualifié de "premier de l'industrie" dans l'IA incarnée mérite d'être lue prudemment, mais la combinaison livraisons effectives et partenariats industriels diversifiés, couvrant la logistique, l'automobile avec Geely et Renault, et l'électronique grand public avec Haier, Lenovo et Samsung, distingue ce dossier des annonces purement technologiques. Positionnée sur une architecture full-stack intégrant cerveau IA, contrôle de mouvement, systèmes de données, mains dextres et hardware humanoïde, Robotera entre en compétition directe avec Figure AI (déployé chez BMW), Agility Robotics (Digit chez Amazon) et 1X Technologies côté occidental, ainsi qu'avec Unitree et Fourier Intelligence sur le marché chinois. Sa distinction principale réside dans un ancrage logistique plutôt qu'un focus sur l'assemblage de précision, marché structurellement plus vaste en volume d'unités. La présence de Samsung et Singtel au capital ouvre des scénarios de déploiement au-delà de la Chine, encore non confirmés calendairement. Les indicateurs à surveiller dans les prochains trimestres seront la réduction du coût unitaire à mesure que les volumes augmentent, et la capacité de la société à répliquer ses performances logistiques dans les secteurs automobile et électronique, où les exigences de précision sont sensiblement plus élevées.

Chine/AsieOpinion
1 source
Xu Huazhe (破壳机器人) : des robots domestiques opérationnels attendus en Chine d'ici deux ans
425636Kr 

Xu Huazhe (破壳机器人) : des robots domestiques opérationnels attendus en Chine d'ici deux ans

Xu Huazhe, ancien Chief Scientist et cofondateur de Xinghaitu (星海图) - startup d'IA incarnée valorisée à 20 milliards de yuans (environ 2,5 milliards d'euros) avec près de 3 milliards de yuans levés - a quitté l'entreprise fin 2025 pour fonder "破壳机器人" (Hatching Robot), une startup dédiée aux robots humanoïdes domestiques. En moins d'un mois d'existence, la société a bouclé un tour d'amorçage de plusieurs dizaines de millions de dollars mené par Yunqi Capital, avec Shunwei Capital, Xiaomi Strategic Investment, BV Baidu Ventures et Honghui Fund à bord. L'équipe compte vingt personnes, le premier modèle d'IA incarnée de 32 milliards de paramètres a complété son premier cycle d'entraînement, et le gant de collecte de données maison en est à sa cinquième ou sixième itération. Xu Huazhe, professeur assistant à l'Institute for Interdisciplinary Information Sciences de Tsinghua et figure connue des "Berkeley returnees", prédit l'arrivée de robots domestiques opérationnels sur le marché chinois d'ici deux ans. La thèse technique de Hatching Robot rompt avec le consensus sectoriel : l'équipe rejette les architectures VLA (Vision-Language-Action) dominantes au profit d'un modèle du monde traitant directement des paires vidéo-action. L'architecture propriétaire baptisée "UAG" remplace le schéma cascade waterfall par un pré-entraînement parallèle avec apprentissage par renforcement intégré de bout en bout - un gain d'efficacité d'entraînement de cinq fois est revendiqué, sans benchmark tiers disponible à ce stade. La collecte de données s'appuie sur trois couches complémentaires : gants UMI, exosquelette et caméra première personne. Xu Huazhe soutient que les environnements domestiques - vêtements enchevêtrés, vaisselle dispersée, enchaînements de tâches multi-étapes - constituent un terrain d'entraînement pour modèles généraux intrinsèquement supérieur aux ateliers industriels. Une position qui conteste directement le mouvement dominant consistant à déployer des humanoïdes en usine pour des opérations de manutention ou d'assemblage accessibles à des bras conventionnels. Ce virage domestique s'inscrit dans un contexte sectoriel qui commence à afficher des signaux de scaling concrets. Generalist AI, startup californienne, affirme avoir porté le taux de réussite de tâches de manipulation fine de 64 % à 99 % sur son modèle GEN-1 via apport massif de données - des résultats annoncés sans publication technique indépendante pour l'instant. Sunday Robotics, licorne américaine, a de son côté envoyé son robot Memo dans des foyers réels (cuisine, café, linge) pour constituer un corpus de démonstrations via gants UMI. Xu Huazhe a cofondé Xinghaitu en 2023 à son retour de Berkeley et Stanford, avant de juger la trajectoire industrielle insuffisamment alignée avec sa vision d'un robot grand public généralisé. Pour Hatching Robot, le positionnement visé n'est pas le calcul coût-heure d'un opérateur en usine, mais un produit hybride - assistant domestique, objet tech lifestyle - comparable selon le fondateur à l'achat d'un véhicule. La définition produit et la fourchette de prix restent en cours de finalisation, et aucun calendrier de disponibilité commerciale n'a été communiqué.

Chine/AsieActu
1 source
Retour sur 10 ans de robots à pattes avec Ghost Robotics au Robotics Summit
4257Robotics Business Review 

Retour sur 10 ans de robots à pattes avec Ghost Robotics au Robotics Summit

Ghost Robotics, fondée en 2015 à Philadelphie, a franchi le cap des 1 000 robots livrés depuis sa création. Le CEO et co-fondateur Gavin Kenneally sera présent au Robotics Summit & Expo, les 27 et 28 mai 2026 à Boston, pour une conférence intitulée "From Prototype to Perimeter : 10 Years of Legged Robotics in Action". Il y présentera des retours d'expérience terrain sur ses déploiements de quadrupèdes, les évolutions logicielles récentes, et les perspectives à cinq ans pour la robotique à pattes dans les secteurs public et privé. Titulaire d'un doctorat en génie mécanique de l'Université de Pennsylvanie, co-concepteur mécanique du Vision 60 Q-UGV, Kenneally cumule six publications académiques et treize brevets. Fin 2025, la société a commercialisé un bras manipulateur monté en partie haute du Vision 60, un système décrit comme léger et précis, conçu pour étendre les capacités de manipulation de la plateforme sans dégrader sa mobilité. Ce seuil des 1 000 unités livrées distingue Ghost Robotics d'une grande partie de ses concurrents dans le segment des quadrupèdes opérationnels, où les annonces marketing précèdent souvent de loin les déploiements réels. Le Vision 60 est utilisé par le Département de la Défense américain (DoD) pour des missions de surveillance périmétrique et d'inspection en environnements contraints. L'ajout du bras manipulateur répond à une critique structurelle des plateformes à pattes : jusqu'ici cantonnées à la mobilité et à la perception, elles manquaient de capacité d'interaction physique avec leur environnement. Pour un intégrateur ou un COO industriel, c'est le signal d'un glissement vers des robots polyvalents capables à la fois de naviguer et d'agir, ce qui élargit significativement les cas d'usage au-delà de la surveillance pure. Il convient toutefois de noter que la société n'a pas publié de métriques détaillées sur les performances du bras en conditions opérationnelles. Ghost Robotics évolue dans un marché de plus en plus dense. Boston Dynamics, dont le Spot est disponible commercialement depuis 2020, reste la référence la plus visible, tandis qu'ANYbotics (ANYmal C, déployé dans le secteur énergétique offshore) et Unitree (B2, positionné sur les prix bas) exercent une pression croissante. Ghost Robotics se différencie par son ancrage défense-sécurité et une stack logicielle et électronique entièrement propriétaire, une exigence de souveraineté technologique souvent requise par le DoD. La conférence de Boston en mai 2026 sera l'occasion pour la société de consolider son image de fournisseur éprouvé, alors qu'une nouvelle génération de compétiteurs mise sur des architectures VLA (Vision-Language-Action) et le transfert sim-to-real pour rattraper leur retard terrain. Les suites annoncées portent sur l'élargissement des capacités du bras manipulateur et l'extension des déploiements vers les secteurs industriels privés.

IndustrielOpinion
1 source
ABB Robotics lance la famille de cobots PoWa pour les tâches industrielles
4258Robotics Business Review 

ABB Robotics lance la famille de cobots PoWa pour les tâches industrielles

ABB Robotics a officiellement lancé cette semaine la famille de cobots PoWa, une gamme de six modèles couvrant des capacités de charge utile allant de 7 à 30 kg, avec une vitesse maximale annoncée de 5,8 m/s. Destinés à des applications industrielles comme l'alimentation de machines, la palettisation, le vissage et la soudure à l'arc, ces cobots reposent sur le contrôleur ABB OmniCore et s'intègrent aux logiciels maison RobotStudio et Wizard Easy Programming. ABB met en avant une mise en service inférieure à une heure, une programmation sans code via des boutons sur le bras, et une compatibilité avec un large écosystème d'accessoires tiers. La gamme est présentée comme un produit disponible à la vente, non comme un teaser, bien que les volumes de déploiement initiaux et la tarification n'aient pas été communiqués. Ce lancement répond à un vrai vide de marché : les cobots classiques plafonnent généralement autour de 10 à 16 kg avec des vitesses limitées, insuffisants pour les applications cycle rapide à charge élevée typiques de l'industrie manufacturière dense. ABB positionne PoWa comme une alternative aux robots industriels traditionnels pour les entreprises qui veulent automatiser des tâches lourdes sans la rigidité opérationnelle et les coûts d'intégration associés. Pour un COO industriel ou un intégrateur, le message est lisible : payload de 30 kg à 5,8 m/s dans un encombrement cobot, avec une programmation accessible aux opérateurs non-spécialistes. Le marché des cobots est estimé en croissance de 20 % par an jusqu'en 2028 selon ABB, un chiffre cohérent avec les projections sectorielles, ce qui rend la fenêtre de lancement stratégiquement pertinente. L'intégration annoncée des librairies NVIDIA Omniverse dans RobotStudio (sous le nom RobotStudio HyperReality, attendu en abonnement pour le second semestre 2026) indique une trajectoire vers la simulation haute fidélité et le déploiement sim-to-real, encore au stade de l'annonce à ce stade. ABB Robotics est l'un des quatre grands du robot industriel mondial, aux côtés de FANUC, KUKA et Yaskawa Motoman. Ses quelque 7 000 employés opèrent depuis un QG américain à Auburn Hills, Michigan. En octobre 2025, ABB Group a annoncé la cession de sa division robotique à SoftBank Group pour 5,3 milliards de dollars, une transaction qui n'est pas encore finalisée et dont les implications sur la stratégie produit restent à préciser. Sur le segment des cobots à forte charge, ABB affronte désormais des acteurs comme Universal Robots (UR20, 20 kg), FANUC CRX-25iA (25 kg) et Techman Robot, mais aussi des challengers asiatiques comme Doosan Robotics ou Elephant Robotics montant en gamme. Aucun partenaire FR/EU n'est mentionné dans ce lancement. Les prochaines étapes annoncées se limitent à RobotStudio HyperReality en H2 2026 ; aucun pilote client ni site de déploiement n'a été rendu public à ce stade.

IndustrielOpinion
1 source
L'araignée spatiale renaît : la Chine relance le rêve de NASA d'un robot de construction en orbite
4259Interesting Engineering 

L'araignée spatiale renaît : la Chine relance le rêve de NASA d'un robot de construction en orbite

Des chercheurs de l'Institut d'automatisation de Shenyang, dans le nord-est de la Chine, travaillent au développement d'un robot de fabrication orbitale autonome directement inspiré du concept "SpiderFab" de la NASA. Jamais testé en orbite, SpiderFab avait été conçu pour assembler en microgravité des structures trop grandes pour tenir dans une coiffe de lanceur, antennes kilométriques, fermes de panneaux solaires, à partir de bobines de fibre de carbone déroulées in situ, à la manière d'une araignée tissant sa toile. Le programme a été mis en veille par la NASA sans atteindre le stade orbital. Le robot chinois se distingue par deux améliorations techniques clés : il utilise des composites à base de fibre de carbone plutôt que de la fibre pure, mis en forme de tubes creux longiformes à la fois très résistants et très légers. Les assemblages n'utilisent ni boulons ni colle : les pièces sont équipées de joints 3D intégrés à la fabrication, puis soudées par liaison laser pour former des connexions solides et adaptées à l'automatisation. À ce stade, l'équipe a validé le concept en laboratoire terrestre en assemblant une antenne à échelle réduite, mais le système reste en phase de recherche et développement. L'intérêt stratégique de cette approche est direct : toute structure envoyée dans l'espace aujourd'hui doit être construite sur Terre, conçue pour survivre aux vibrations du lancement, et suffisamment compacte pour entrer dans un lanceur. Ces contraintes fixent un plafond dur sur la taille et la masse de ce qui peut être mis en orbite. Un robot capable de fabriquer des structures directement en orbite à partir de matières premières brutes ferait sauter cette limite physique, ouvrant la voie à des télescopes, des réseaux d'antennes ou des centrales solaires orbitales d'une envergure aujourd'hui impossible. La soudure laser entre composants imprimés, si elle tient ses promesses en environnement radiatif, représente également une rupture par rapport aux assemblages mécaniques classiques, moins fiables en automatisation complète. Pour l'instant, ces résultats restent des preuves de concept terrestres ; il n'existe pas encore de données publiées sur des tests en microgravité simulée ou parabolique. Le concept SpiderFab avait été développé par la société américaine Tethers Unlimited dans le cadre du programme NIAC (NASA Innovative Advanced Concepts), avant d'être suspendu faute de financement pour la phase de démonstration orbitale. La Chine investit massivement dans les technologies d'assemblage en orbite dans le cadre de ses ambitions pour les stations spatiales de nouvelle génération et les centrales solaires spatiales, un programme sur lequel travaille également l'Agence spatiale européenne et le JAXA. L'équipe de Shenyang devra encore résoudre plusieurs verrous critiques : l'assemblage autonome précis en microgravité réelle, l'alignement sur de grandes distances, et la durabilité à long terme face aux rayonnements et aux cycles thermiques orbitaux. Aucune date de test en orbite n'a été communiquée.

RechercheOpinion
1 source
Hikrobot : chiffre d'affaires 2025 supérieur à 6,4 milliards de yuans, déploiement accéléré en IA incarnée
426036Kr 

Hikrobot : chiffre d'affaires 2025 supérieur à 6,4 milliards de yuans, déploiement accéléré en IA incarnée

Hikvision Robotics, filiale robotique du géant chinois de la vidéosurveillance Hikvision, a annoncé un chiffre d'affaires 2025 de 6,452 milliards de yuans (environ 880 millions d'euros), avec des livraisons cumulées dépassant 10 millions d'unités en vision industrielle et 180 000 robots mobiles produits depuis sa fondation. La société, qui célèbre en 2026 son dixième anniversaire, a tenu sa conférence annuelle du 22 au 24 avril à Tonglu (Hangzhou), où plus de 35 nouveaux produits ont été présentés, couvrant la vision 2D, 2,5D et 3D haute précision ainsi que des modules de vision IA. Le PDG Jia Yonghua y a introduit le concept d'« embodied manufacturing » (具身智造), posant que l'automatisation traditionnelle, trop rigide, doit évoluer vers des systèmes capables de s'adapter à l'environnement plutôt que de contraindre l'opérateur à s'adapter à la machine. Les logiciels industriels propriétaires de l'entreprise comptent plus de 600 000 utilisateurs sous licence, pour plus de 20 000 clients mondiaux. Dans un entretien accordé à 36Kr, le vice-président Zhang Wencong détaille comment l'IA transforme concrètement la ligne de produits. En vision industrielle, les algorithmes de lecture de codes-barres et d'OCR fonctionnent désormais en mode plug-and-play sans entraînement sur site. Le cas le plus documenté concerne un fabricant chinois de gants médicaux jetables : en 2021, chaque nouvelle ligne nécessitait plusieurs dizaines de milliers d'images et une reconfiguration complète du modèle CNN. Après migration vers des grands modèles en 2023-2024, 100 à 200 images suffisent pour déployer une ligne supplémentaire. Le système détecte des défauts à partir de 0,8 mm avec un taux de détection supérieur à 99,995 % pour les défauts critiques (salissures, déchirures), à raison de 300 000 paires par jour et par ligne. Sur les robots mobiles, le système RCS intègre du reinforcement learning depuis 2019, permettant dès début 2021 la coordination de plus de 1 000 robots sur des cartes multi-zones dans une seule usine FAW-Toyota. Ces chiffres signalent une IA industrielle en déploiement réel, non en phase pilote, même si Zhang Wencong reconnaît que l'adoption globale reste freinée par des cycles de retour sur investissement jugés trop longs par les clients industriels. Fondée en 2016 sur la base technologique vision de sa maison mère, Hikvision Robotics structure son offre autour de trois pôles : vision machine, robots mobiles AMR/AGV et bras articulés, ce dernier segment étant encore en montée en charge après cinq ans d'existence. Sur les modèles VLA (Vision-Language-Action) et les robots humanoïdes, Zhang Wencong adopte une posture prudente : à court terme, la priorité est donnée à des combinaisons de petits modèles spécialisés pour garantir la fiabilité industrielle, tandis que des équipes dédiées travaillent en parallèle sur les architectures end-to-end. Face à des acteurs AMR comme Geek+ et Hai Robotics en Chine, ou KION Group et Omron à l'international, Hikvision Robotics mise sur l'intégration verticale logiciel-matériel comme principal levier de différenciation, avec comme prochaine étape déclarée l'approfondissement de l'IA dans des environnements d'inspection plus complexes.

Chine/AsieActu
1 source
De la science-fiction à la réalité : l'avenir de l'IA physique selon le Dr Jan Liphardt
4261Robotics Business Review 

De la science-fiction à la réalité : l'avenir de l'IA physique selon le Dr Jan Liphardt

Lors de son appel aux résultats du premier trimestre 2026, Tesla a annoncé des ambitions de production pour son robot humanoïde Optimus qui redessinent l'échelle de l'industrie. À Fremont, en Californie, l'entreprise prévoit dès le deuxième trimestre 2026 une première ligne à grande échelle, avec une capacité cible d'un million d'unités par an, en remplacement des lignes Model S et Model X existantes. À la Gigafactory du Texas, une ligne de seconde génération vise à terme 10 millions de robots par an, et la préparation du site est déjà en cours. Tesla développe en parallèle le processeur d'inférence AI5, conçu pour répondre aux besoins en calcul des programmes Optimus et robotaxi. Par ailleurs, le tribunal régional de Hambourg a prononcé une injonction préliminaire contre Elite Robots Deutschland GmbH, filiale allemande du fabricant chinois, sur action en contrefaçon logicielle initiée par Teradyne Robotics, maison mère d'Universal Robots. Enfin, HII (Huntington Ingalls Industries), Path Robotics et GrayMatter Robotics ont annoncé conjointement le programme HYPR (High-Yield Production Robotics), destiné à accélérer la construction navale américaine via la soudure mobile robotisée. Les chiffres Tesla méritent d'être lus avec prudence : aucun calendrier de livraison client ni spécification technique n'ont été communiqués, et la distinction entre capacité de production annoncée et déploiement réel reste entière. Un objectif de 10 millions d'unités annuelles positionnerait néanmoins Tesla à un ordre de grandeur au-dessus de tout acteur actuel du marché humanoïde, forçant Figure, Agility, 1X ou Boston Dynamics à reconsidérer leur stratégie de montée en volume. Sur le plan juridique, l'injonction hambourgeoise contre Elite Robots confirme que la concurrence sur les cobots low-cost se joue désormais aussi sur la propriété intellectuelle logicielle. David Brandt, CTO d'Universal Robots, a précisé que l'analyse du code embarqué d'Elite révélait des similitudes marquées avec le logiciel propriétaire d'UR. Après l'affaire Ocado/BrightPick à LogiMAT le mois dernier, ce second cas illustre pourquoi l'Allemagne reste un terrain judiciaire à haut risque pour les exposants en situation de tension brevétaire. Tesla a présenté Optimus en concept en 2021, dévoilé un prototype en 2022 et conduit des démonstrations d'usine en 2024-2025. Le remplacement des lignes Model S/X à Fremont signale un pari industriel fort : sacrifier une capacité automobile établie pour pivoter vers la robotique humanoïde. Universal Robots, fondé au Danemark en 2005 et acquis par Teradyne en 2015, est le leader mondial des cobots avec une base installée de plusieurs centaines de milliers d'unités ; Elite Robots est l'un des fabricants chinois apparus ces dernières années avec des produits fonctionnellement proches à prix sensiblement inférieur. Le programme HYPR, dont les détails techniques restent à préciser, représente une application sectorielle concrète de la robotique mobile de soudage, domaine où Path Robotics et GrayMatter avaient déjà collaboré avec des acteurs de la défense américaine.

HumanoïdesActu
1 source
Une peau électronique étirable permet à une main robotique de ressentir le toucher et la pression
4262Interesting Engineering 

Une peau électronique étirable permet à une main robotique de ressentir le toucher et la pression

Des chercheurs de l'Université de Turku (Finlande) ont développé une peau électronique étirable, transparente et conductrice, intégrée à une main robotique pour lui conférer une sensibilité au toucher. L'équipe, dirigée par le professeur assistant Vipul Sharma en génie des matériaux, s'est inspirée de l'architecture de structures biologiques comme les feuilles d'arbres pour concevoir un substrat à la fois flexible, respirant et conducteur, combinaison rare dans les matériaux électroniques conventionnels. Des capteurs de pression embarqués dans cette peau répondent au contact et génèrent un retour haptique sur la main instrumentée. La même université développe en parallèle, via Anastasia Koivikko en génie de l'automatisation, des robots à structure souple pour la santé et l'industrie, actionnables par air comprimé, électricité ou fluide, capables d'opérer en espace confiné ou en environnement dangereux, centrales nucléaires et opérations de sauvetage souterraines comprises. Aucune métrique de résolution sensorielle ni calendrier de commercialisation n'est avancé : il s'agit à ce stade d'une preuve de concept en laboratoire. La combinaison de flexibilité mécanique et de perception tactile constitue un verrou pour des marchés à fort impact : prothèses capables de distinguer pression, température et humidité, robots chirurgicaux interagissant en sécurité avec des tissus humains, bras industriels manipulant des objets fragiles en boucle sensorielle fermée. Pour les intégrateurs, la capacité à conformer la peau sur des surfaces courbes comme les doigts ou les membres artificiels sans perte de performance représente un avantage concret sur les capteurs rigides qui équipent la majorité des effecteurs actuels. L'utilisation de biomasse finlandaise issue du bois local comme substrat biosourcé vise à réduire la dépendance aux approvisionnements asiatiques en matériaux d'électronique, enjeu de souveraineté industrielle croissant pour les équipementiers européens sous pression réglementaire. Sur le plan compétitif, la recherche en e-skin mobilise des groupes de référence comme celui de Zhenan Bao à Stanford et plusieurs équipes européennes à l'EPFL et au KIT de Karlsruhe. Des acteurs commerciaux tels que Pressure Profile Systems ou Tekscan proposent déjà des capteurs tactiles flexibles pour la robotique industrielle, mais les substrats biosourcés transparents restent peu exploités commercialement. L'équipe de Turku, positionnée dans l'espace UE, n'annonce ni partenaire industriel ni prototype pré-série. Les suites logiques incluent des tests d'endurance mécanique sous cycles de flexion répétés, la caractérisation précise de la résolution spatiale des capteurs, et un rapprochement potentiel avec des fabricants de prothèses ou des acteurs de la robotique médicale.

FR/EU ecosystemePaper
1 source
Accenture, Vodafone et SAP testent des robots humanoïdes en entrepôt
4263Robotics Business Review 

Accenture, Vodafone et SAP testent des robots humanoïdes en entrepôt

Accenture, Vodafone Procure & Connect et SAP ont mené un pilote de robotique humanoïde dans l'entrepôt de Vodafone à Duisburg, en Allemagne, dont les résultats ont été présentés à Hannover Messe 2026. Durant ce programme, les robots recevaient leurs missions d'inspection directement via le système SAP Extended Warehouse Management (EWM) et effectuaient de manière autonome des rondes visuelles dans l'installation : détection de produits mal placés ou endommagés, évaluation de l'empilement des palettes et de la répartition des charges, repérage d'espaces de stockage sous-utilisés, identification de risques comme des obstacles dans les allées ou des palettes mal alignées. Les conclusions étaient remontées en temps réel dans le système SAP. Les robots sont équipés de la solution "Robot Brain" d'Accenture, entraînés dans des jumeaux numériques construits via l'Accenture Physical AI Orchestrator, lui-même basé sur NVIDIA Omniverse, le blueprint NVIDIA Mega et les outils NVIDIA Metropolis pour la vision IA. Ils interagissent avec les opérateurs par la voix, les gestes et le texte. Un point à noter : aucun modèle de robot humanoïde n'est communiqué dans les annonces officielles, et aucune métrique de performance -- charge utile, degrés de liberté, temps de cycle -- n'a été publiée. L'intérêt de ce pilote réside moins dans la prouesse robotique que dans la démonstration d'une intégration native avec un WMS standard du marché. SAP EWM équipe une grande partie des opérations logistiques mondiales : si cette interface tient à l'échelle, elle réduit considérablement la friction d'adoption pour les grands acteurs industriels, qui n'auront pas à refondre leur SI existant. Pour les COO logistiques, les arguments avancés -- réduction des accidents de travail, des heures supplémentaires et de la dépendance à l'intérim -- sont bien plus concrets que la promesse de l'"IA physique". Vodafone Procure & Connect va plus loin en évoquant explicitement un futur "business de solutions de main-d'oeuvre humanoïde", ce qui signale une ambition de monétiser l'expérience acquise au-delà de l'usage interne -- un signal que les intégrateurs et les investisseurs du secteur logistique devraient noter. Ce pilote s'inscrit dans la stratégie d'Accenture de se positionner comme intégrateur de référence pour la robotique humanoïde en entreprise, en capitalisant sur son partenariat technologique avec NVIDIA. Dans un marché où Boston Dynamics déploie Stretch chez DHL et GXO, Figure AI a signé avec BMW, et Apptronik travaille avec Mercedes-Benz, Accenture joue la carte de la couche d'intégration SI plutôt que du hardware -- aucun fabricant de robot n'est nommé dans les communications, ce qui suggère soit une architecture hardware-agnostique, soit des partenariats encore confidentiels. Pour SAP, c'est une démonstration de la pertinence de l'EWM dans un monde de robots physiques autonomes. Les prochaines étapes restent vagues : une extension à la chaîne d'approvisionnement globale de Vodafone est évoquée, mais sans dates ni volumes cibles. Ce projet demeure, pour l'heure, un pilote présenté en salon -- pas encore un déploiement industriel confirmé.

FR/EU ecosystemeOpinion
1 source
Vidéo du vendredi : qui gagne entre un robot et un joueur professionnel de ping-pong ?
4264IEEE Spectrum Robotics 

Vidéo du vendredi : qui gagne entre un robot et un joueur professionnel de ping-pong ?

La semaine du 18 avril 2026 a été marquée par plusieurs démonstrations robotiques notables, dont la plus emblématique s'est déroulée à Pékin : lors d'un semi-marathon de 21 kilomètres réunissant 12 000 coureurs humains, plus de 100 robots humanoïdes ont pris le départ aux côtés d'athlètes humains, et trois d'entre eux ont franchi la ligne d'arrivée avant tout concurrent humain. Ce résultat, relayé par Al Jazeera, illustre une progression rapide de la locomotion bipedale en conditions réelles. En parallèle, Sony AI publiait dans Nature les résultats d'un système autonome capable de disputer une partie de ping-pong contre des joueurs professionnels, en relevant le défi de la perception haute vitesse et du contrôle dynamique en temps réel, deux verrous longtemps considérés comme bloquants pour l'IA physique compétitive. Autre fait marquant, le robot AthenaZero du Robotics and AI Institute a réalisé du jonglage à trois balles à mains nues, sans motion capture externe ni entonnoir mécanique, en s'appuyant uniquement sur des capteurs embarqués et une coordination oeil-main apprise pour gérer l'incertitude au contact. Ces résultats alimentent le débat sur l'écart entre démonstration et déploiement réel. Le semi-marathon de Pékin constitue une preuve de robustesse locomotrice en environnement non contrôlé, même si les conditions de course (surface, pace, assistance technique en bord de piste) mériteraient d'être précisées pour évaluer la comparabilité exacte avec une performance humaine. La publication Sony dans Nature donne une légitimité scientifique au domaine de l'IA physique compétitive et valide l'idée que des boucles de contrôle rapide peuvent être apprises à partir de données réelles plutôt que simulées. AthenaZero, de son côté, illustre les progrès du sim-to-real sur des tâches de manipulation dynamique sans infrastructure externe, ce qui ouvre la voie à des applications industrielles de tri ou de reorientation d'objets en mouvement. En contrepoint, IEEE Spectrum souligne que la vraie valeur en entrepôt vient encore de systèmes d'automatisation mobile comme ceux de Berkshire Grey, et non des humanoïdes, une nuance importante pour les décideurs B2B qui évaluent des ROI à court terme. Le contexte de cette semaine s'inscrit dans une accélération visible de la robotique chinoise, portée notamment par des acteurs comme Unitree, qui présente des séquences de locomotion en milieu non structuré, et DEEP Robotics, dont les robots quadrupèdes sont déjà déployés en patrouille résidentielle en Amérique du Nord. Sur le plan matériau, le Max Planck Institute for Intelligent Systems a publié une méthode d'évaluation des actionneurs électrostatiques souples utilisant des actionneurs Peano-HASEL, atteignant un rendement électromécanique de 63,6 %, soit plus de trois fois supérieur aux valeurs antérieurement rapportées, ce qui ouvre des perspectives pour des robots légers et silencieux. Côté mobilité aérienne, Skydio a montré la capture de drones en vol avec un bras UR20, tandis qu'ETH Zurich continue ses travaux sur drones suractuatés. Enfin, Sphero se positionne pour combler le vide laissé par LEGO Mindstorms sur le marché de la robotique éducative, un segment commercial non négligeable laissé en friche depuis l'abandon de la gamme par LEGO.

IA physiquePaper
1 source
Melody : un robot humanoïde maîtrise 39 degrés de liberté pour une présence quasi humaine
4265Interesting Engineering 

Melody : un robot humanoïde maîtrise 39 degrés de liberté pour une présence quasi humaine

Realbotix, entreprise canadienne spécialisée dans la robotique humanoïde, déploie son robot Melody dans un rôle d'accueil lors de la conférence Bitcoin 2026 au Venetian Resort de Las Vegas, du 27 au 29 avril 2026. Melody appartient à la gamme M-Series, une plateforme modulaire à corps entier dotée de 39 degrés de liberté concentrés dans la partie supérieure du corps, la partie inférieure restant fixe. Le robot est disponible en configurations masculine, féminine ou sur-mesure, et peut être installé en position assise, debout ou de bureau. Alimenté par prise électrique standard sans contrainte de batterie, il tourne en continu sur une journée complète. Sur site, Melody accueille les participants, les aide à localiser les stands et répond aux questions générales grâce à un système d'IA conversationnelle propriétaire développé par Realbotix. La plateforme est proposée à partir de 95 000 dollars, ce qui la positionne clairement dans le segment haut de gamme des interfaces physiques d'accueil. Ce qui est notable ici n'est pas tant la prouesse technique brute que le positionnement commercial : Realbotix cible explicitement les environnements à fort trafic humain où les bornes interactives classiques montrent leurs limites en termes d'engagement. Avec 39 DDL en partie supérieure, Melody peut produire des expressions faciales, des gestes et un contact visuel suffisamment fluides pour réduire l'effet "vallée dérangeante" qui a longtemps freiné l'adoption des robots humanoïdes en contexte public. La modularité des visages et panneaux de carrosserie ouvre la voie à des déploiements multi-marques ou multi-contextes sans changer de plateforme matérielle. Pour un intégrateur ou un décideur B2B, le modèle économique est celui d'un remplacement de kiosque à ROI mesurable sur la qualité d'interaction, non sur la productivité opérationnelle. Il faut cependant noter que cette présentation à Las Vegas reste une démonstration publique contrôlée, pas un déploiement commercial à grande échelle, et qu'aucune donnée de performance terrain n'a été publiée à ce stade. Realbotix opère dans un segment en pleine ébullition, celui des humanoïdes orientés "présence" plutôt que manipulation industrielle. La startup chinoise AheadForm pousse des concepts similaires avec ses séries Origin F1 et Elf, combinant IA auto-supervisée et mouvements bioniques avec synchronisation labiale précise. Ces acteurs se distinguent des approches Boston Dynamics ou Figure AI, qui visent la manutention et la logistique. Andrew Kiguel, PDG de Realbotix, positionne explicitement la M-Series comme une "interface physique pour l'IA" dans les secteurs de service, une thèse que plusieurs grandes chaînes hôtelières et aéroports testent discrètement depuis 2024. La suite logique serait des pilotes dans des environnements comme les hôtels, les banques ou les aéroports, mais Realbotix n'a pas annoncé de partenariats commerciaux formels au-delà de cette démonstration.

HumanoïdesOpinion
1 source
Robot Talk, épisode 153 : des robots inspirés de l'origami, avec Chenying Liu
4266Robohub 

Robot Talk, épisode 153 : des robots inspirés de l'origami, avec Chenying Liu

Chenying Liu, Junior Research Fellow et Associate Member of Faculty au Department of Engineering Science de l'Université d'Oxford, était l'invitée du 153e épisode du podcast Robot Talk pour présenter ses travaux sur l'intelligence physique incarnée (embodied physical intelligence). Sa recherche explore comment la forme physique d'un robot peut activement contribuer à la perception, au traitement de l'information, à la prise de décision et au mouvement, en s'inspirant notamment des principes géométriques de l'origami. L'épisode ne communique pas de métriques techniques précises, pas de charges utiles, de degrés de liberté ni de résultats expérimentaux chiffrés, ce qui le situe davantage dans la vulgarisation académique que dans l'annonce produit. L'approche d'Oxford que défend Liu représente un contrepoids notable au paradigme dominant du tout-logiciel : plutôt que de déléguer l'intelligence uniquement aux modèles de fondation et aux VLA (Vision-Language-Action models), l'idée est d'intégrer la computation directement dans la géométrie et les matériaux du robot. Cette co-conception mécanique-contrôle promet des systèmes plus robustes et plus efficaces en énergie, particulièrement pertinents pour des environnements non structurés où les modèles sim-to-real peinent encore. Ce courant de recherche, parfois appelé morphological computation ou soft robotics computationnelle, est actif dans plusieurs laboratoires mondiaux, MIT CSAIL, ETH Zurich, EPFL, ainsi qu'en France au CNRS LIRMM et à l'INRIA. Oxford se positionne ici via une chercheuse indépendante dont le programme, encore jeune, n'a pas encore de partenaires industriels publiquement annoncés. La prochaine étape naturelle serait une publication de résultats expérimentaux ou un prototype démontrant le gain d'autonomie promis par cette philosophie de conception.

RecherchePaper
1 source
Vidéo : le robot humanoïde Unitree G1 épate avec des sauts acrobatiques et pirouettes sur patins
4267Interesting Engineering 

Vidéo : le robot humanoïde Unitree G1 épate avec des sauts acrobatiques et pirouettes sur patins

Unitree Robotics a publié le 23 avril une vidéo montrant son robot humanoïde G1 exécuter des figures sur rollers et patins à glace : virages à 360 degrés, rotations sur une jambe, et frontflips, le tout en maintenant l'équilibre via un contrôle coordonné des roues et des membres articulés. La plateforme G1 est un hybride roues-jambes lancé en novembre 2025 sous la désignation G1-D, disponible en deux versions. La version Standard, stationnaire, embarque 17 degrés de liberté ; la version Flagship, motorisée par une base à entraînement différentiel capable de 1,5 m/s, monte à 19 DOF. Les deux variantes mesurent entre 126 et 168 cm pour un poids maximal de 80 kg. Chaque bras offre 7 DOF et supporte une charge utile de 3 kg. L'articulation de taille permet 155° de rotation sur l'axe Z et une plage de -2,5° à 135° sur l'axe Y, couvrant une enveloppe de travail verticale de 2 mètres. La perception repose sur une caméra binoculaire en tête et des caméras poignet pour la vision rapprochée. La version Flagship tourne sur un module Nvidia Jetson Orin NX délivrant jusqu'à 100 TOPS, avec une autonomie annoncée de six heures. Cette démonstration illustre une tendance de fond : la mobilité humanoïde sort du strict bipédisme pour intégrer la locomotion hybride. L'association roues et jambes avait été largement laissée de côté au profit du seul marcheur anthropomorphe, considéré comme la voie vers les environnements humains. Unitree repose la question en montrant qu'un humanoïde peut gagner en efficacité énergétique et en polyvalence terrain sans sacrifier l'adaptabilité des membres. Sur le fond, la vidéo reste une démonstration contrôlée, pas un déploiement industriel, et les conditions de tournage ne sont pas précisées. Ce type de footage sélectif est courant dans le secteur et ne documente pas les taux d'échec ni les conditions réelles d'opération. Ce qui est lisible, néanmoins, c'est la maturité des algorithmes de contrôle temps réel et l'apport de l'entraînement en simulation pour des mouvements dynamiques complexes. Unitree, fondée en Chine et connue pour ses quadrupèdes Go1 et B2, a accéléré son virage humanoïde avec le G1 commercialisé à partir de 16 000 dollars en 2024, un prix agressif qui le positionne directement contre les plateformes de recherche d'Agility Robotics (Digit), Figure (Figure 02) et Boston Dynamics (Atlas). Le G1-D intègre un stack logiciel complet couvrant l'annotation de données, la simulation et l'entraînement distribué, ce qui signale une ambition au-delà du hardware : se positionner comme plateforme de développement de modèles d'action (VLA). La prochaine étape attendue du secteur est le passage de ces démos en conditions contrôlées à des déploiements industriels répétables, un saut que ni Unitree ni ses concurrents n'ont encore documenté publiquement à grande échelle.

HumanoïdesOpinion
1 source
Flex et Teradyne Robotics renforcent leur partenariat pour déployer l'automatisation intelligente dans l'industrie mondiale
4268Robotics & Automation News 

Flex et Teradyne Robotics renforcent leur partenariat pour déployer l'automatisation intelligente dans l'industrie mondiale

Flex, l'un des plus grands sous-traitants industriels mondiaux avec des dizaines de sites de production dans une trentaine de pays, et Teradyne Robotics ont annoncé en avril 2026 l'élargissement de leur partenariat pour déployer l'automatisation intelligente à grande échelle dans la fabrication mondiale. L'accord instaure une double relation : Flex intègre les solutions de Teradyne Robotics directement dans ses propres lignes de production, tout en assurant la fabrication de composants robotiques clés pour permettre des déploiements plus larges chez les clients de Teradyne. Les volumes de déploiement visés et les détails financiers de l'accord n'ont pas été communiqués. Ce positionnement simultané en tant que client et fournisseur constitue un modèle industriel peu courant et potentiellement structurant. Pour un décideur B2B, le signal est clair : un EMS (Electronics Manufacturing Services) de cette envergure valide en conditions réelles la maturité opérationnelle des cobots Universal Robots et des robots mobiles MiR, les deux marques regroupées sous Teradyne Robotics. L'accord sécurise également une capacité de fabrication de composants externe pour Teradyne, réduisant les risques de montée en volume sans investissement industriel propre supplémentaire, un avantage concret dans un marché où la capacité de production reste un goulot d'étranglement. Teradyne Robotics est la division robotique de Teradyne Inc., issue de l'acquisition d'Universal Robots en 2015 (environ 285 millions de dollars) puis de MiR en 2018. L'entreprise fait face à une concurrence croissante sur les deux segments : Fanuc, Doosan et Techman Robot gagnent du terrain sur les cobots, tandis qu'Exotec (acteur français en logistique automatisée) et Zebra Technologies (Fetch Robotics) accélèrent sur les AMR. Le réseau de production de Flex, qui couvre des verticales aussi variées que l'automobile, le médical et l'électronique grand public, pourrait servir de terrain d'expansion accéléré pour Teradyne sans passer par les cycles habituels d'intégration terrain.

IndustrielActu
1 source
La Chine prévoit d'investir des milliards pour déployer une armée de robots dans son réseau électrique
4269SCMP Tech 

La Chine prévoit d'investir des milliards pour déployer une armée de robots dans son réseau électrique

La State Grid Corporation of China (SGCC), principal opérateur du réseau électrique national, a annoncé un plan d'investissement de 6,8 milliards de yuans (environ 1 milliard de dollars) pour déployer des milliers de robots dotés d'intelligence artificielle sur l'ensemble de ses infrastructures. Ces systèmes, désignés sous le terme "embodied intelligence" dans le document officiel, seront chargés d'inspecter des sous-stations isolées, d'effectuer la maintenance de lignes très haute tension et d'assurer des opérations de surveillance continues sur un réseau qui alimente 1,1 milliard de personnes. Le calendrier de déploiement n'a pas encore été précisé publiquement. L'ampleur du budget alloué signale un changement de posture : la SGCC ne teste plus des prototypes en laboratoire mais engage un déploiement industriel à grande échelle sur des infrastructures critiques. Pour les intégrateurs et fournisseurs de systèmes robotiques, cela représente un appel d'offres structurant susceptible d'accélérer la standardisation des robots d'inspection sur lignes haute tension, un segment jusqu'ici fragmenté entre solutions maison et prestataires spécialisés. La décision valide aussi l'argument selon lequel les environnements dangereux et répétitifs constituent le premier marché rentable pour les robots autonomes, bien avant les usines de production polyvalentes. Ce mouvement s'inscrit dans la stratégie industrielle chinoise "Made in China 2025" et ses prolongements, qui ciblent explicitement la robotique incarnée comme secteur stratégique. Des acteurs comme Unitree, Leju Robotics ou UBTECH sont positionnés pour répondre à ces appels d'offres, en concurrence avec des équipementiers spécialisés dans l'inspection de lignes. À l'international, des initiatives similaires existent chez EDF ou TenneT, mais aucune ne mobilise des budgets comparables sur une seule commande groupée. Les prochaines étapes attendues sont la publication des cahiers des charges techniques et la sélection des fournisseurs, probablement d'ici fin 2026.

Chine/AsieOpinion
1 source
XYZ Embodied AI lance le sac à dos de calcul embarqué BotPack B Series
4270Pandaily 

XYZ Embodied AI lance le sac à dos de calcul embarqué BotPack B Series

XYZ Embodied AI (星源智机器人) a présenté le 23 avril 2026 au salon Hannover Messe en Allemagne sa gamme BotPack B Series, un sac à dos de calcul embarqué destiné aux robots quadrupèdes et humanoïdes. La gamme comprend deux modèles, le B5 et le B4, tous deux propulsés par des puces NVIDIA. L'ensemble pèse moins de 2,5 kg et embarque des interfaces réseau haut débit (Ethernet 10G, 5G et Wi-Fi 7) ainsi que des modules de positionnement pour la navigation autonome. La compatibilité a été confirmée avec le robot humanoïde Unitree G1 de Unitree Robotics. L'objectif affiché est de permettre aux robots d'exécuter des modèles d'IA localement, en réduisant la dépendance au cloud et la latence de traitement associée. La mise en production de capacités de calcul edge directement sur le châssis d'un robot répond à un verrou opérationnel fréquemment cité par les intégrateurs : la dépendance à une connectivité cloud stable nuit aux déploiements en environnements industriels contraints, ateliers, entrepôts ou zones à couverture réseau limitée. Un backpack standardisé compatible avec plusieurs plateformes ouvre la voie à une séparation entre matériel robot et compute stack, une logique analogue à celle des AMR modulaires. La connectivité Wi-Fi 7 et 5G, couplée à un Ethernet 10G, cible clairement les cas d'usage en inférence temps réel de modèles VLA (Vision-Language-Action), où la latence est critique. Il reste à valider en conditions réelles quelle charge de modèle les configurations B4 et B5 peuvent effectivement supporter, XYZ n'ayant publié ni benchmarks ni données terrain. XYZ Embodied AI avait précédemment développé la plateforme T5, une unité de calcul embarqué positionnée sur le même segment ; la BotPack B Series constitue une évolution vers des formats plus compacts et universels. Hannover Messe 2026 concentre plusieurs annonces dans le domaine du edge computing pour la robotique, un marché en structuration où NVIDIA pousse son stack Isaac/Jetson et où des startups spécialisées compute-on-robot émergent. La compatibilité affichée avec le Unitree G1 positionne le produit face aux solutions de compute intégrées des fabricants humanoïdes comme Agility Robotics ou Figure AI. Aucun prix ni volume de déploiement n'a été communiqué, ce qui classe cette annonce comme lancement commercial sans validation industrielle publique à ce stade.

InfrastructureOpinion
1 source
Deep Robotics déploie des robots quadrupèdes chez FAW pour l'inspection industrielle
4271Pandaily 

Deep Robotics déploie des robots quadrupèdes chez FAW pour l'inspection industrielle

Deep Robotics a annoncé le 23 avril 2026 le déploiement de son robot quadrupède Jueying X30 sur un site industriel du groupe FAW (First Automobile Works), l'un des plus grands constructeurs automobiles chinois. Les robots assurent des missions d'inspection automatisée au sein du parc manufacturier, opérant en continu 24h/24 et 7j/7, y compris en conditions de faible luminosité grâce à un module multi-capteurs embarqué. Le Jueying X30 s'intègre aux systèmes de contrôle d'accès du site pour franchir les portes de manière autonome et navigue indifféremment en environnements intérieurs et extérieurs. Les données collectées et les alertes sont centralisées sur une plateforme dédiée pour le suivi et le reporting. L'annonce ne précise pas les métriques clés habituellement attendues dans ce type de déploiement : vitesse de déplacement, autonomie de la batterie, superficie couverte, nombre d'unités déployées ou résultats opérationnels mesurés. Le déploiement chez FAW constitue un signal intéressant pour le marché de l'inspection industrielle quadrupède, qui cherche depuis plusieurs années à dépasser le stade du pilote isolé. L'intégration native au contrôle d'accès et la capacité à opérer en extérieur comme en intérieur répondent à des contraintes réelles des sites manufacturiers à grande échelle, notamment la couverture incomplète des rondes humaines et les difficultés de recrutement pour les postes de nuit. Pour un intégrateur ou un responsable maintenance industrielle, ce type de déploiement valide le cas d'usage "inspection de site" sur un terrain exigeant, même si l'absence de KPI publics rend difficile l'évaluation de la maturité réelle de la solution versus une démonstration commerciale. Deep Robotics, fondée à Hangzhou, développe la gamme Jueying depuis plusieurs années et positionne le X30 comme sa référence pour l'inspection industrielle lourde. La concurrence sur ce segment est dense : Boston Dynamics Spot reste la référence mondiale la plus déployée, Unitree pousse ses modèles B2 sur les marchés sensibles au prix, et ANYbotics (Zurich) avec son ANYmal C est le principal acteur européen actif sur les sites Oil & Gas et manufacturiers. Ghost Robotics (Philadelphie) cible quant à lui les applications défense et sécurité. La prochaine étape pour Deep Robotics sera de publier des données de performance terrain pour crédibiliser ce déploiement au-delà du communiqué de presse.

Chine/AsieActu
1 source
CorridorVLA : contraintes spatiales explicites pour les têtes d'action génératives via des ancres éparses
4272arXiv cs.RO 

CorridorVLA : contraintes spatiales explicites pour les têtes d'action génératives via des ancres éparses

Une équipe de chercheurs propose CorridorVLA (arXiv 2504.21241), une méthode visant à améliorer la précision des modèles Vision-Langage-Action (VLA) en robotique de manipulation. Le principe : prédire des ancres spatiales éparses exprimées comme des variations incrémentales de position (delta-positions), qui définissent une zone de tolérance explicite, un "couloir", dans l'objectif d'entraînement de la tête d'action générative. Les trajectoires sortant de ce couloir reçoivent des gradients correctifs ; les petits écarts liés au bruit d'exécution ou aux contacts restent tolérés. Sur le benchmark LIBERO-Plus, CorridorVLA améliore le taux de succès de 3,4 % à 12,4 % selon les configurations testées : appliqué à GR00T de NVIDIA, le variant GR00T-Corr atteint 83,21 % de taux de succès absolu, contre moins de 71 % pour la baseline ; appliqué à SmolVLA de HuggingFace, les gains sont comparables. Le code est publié sur GitHub (corridorVLA). Ce travail touche à un problème structurel des VLA actuels : la guidance spatiale y est injectée implicitement via des représentations latentes, ce qui rend les trajectoires générées difficiles à auditer ou à contraindre géométriquement. C'est l'une des causes principales pour lesquelles les VLA peinent au passage sim-to-real en manipulation précise. En rendant ces contraintes explicites et interprétables, CorridorVLA offre un levier concret aux intégrateurs robotiques : comprendre et potentiellement déboguer pourquoi une trajectoire est corrigée. La tête d'action par flow-matching, technique de modélisation générative continue, bénéficie ainsi d'un signal de supervision géométrique direct, sans recourir à des démonstrations denses ni à une supervision pixel à pixel. Ce résultat s'inscrit dans une tendance qui cherche à structurer l'espace de sortie des VLA plutôt qu'à augmenter la puissance brute du backbone multimodal. LIBERO-Plus est une extension plus exigeante de LIBERO, suite standard d'évaluation en manipulation tabletop. GR00T, annoncé par NVIDIA en 2024 comme modèle fondation pour robots humanoïdes, et SmolVLA, publié par HuggingFace en 2025 comme alternative compacte et accessible, constituent les deux familles de baselines retenues, ce qui renforce la portée des résultats. Pi-0 de Physical Intelligence et OpenVLA restent les principaux concurrents directs dans ce segment des VLA généralistes. Ce travail demeure un preprint non évalué par les pairs, sans déploiement sur robot physique annoncé ; les prochaines étapes probables incluent une validation sur manipulateurs réels (type Franka ou UR) et une soumission à CoRL ou IROS 2025.

IA physiqueOpinion
1 source
Démystifier la conception de l'espace d'action pour les politiques de manipulation robotique
4273arXiv cs.RO 

Démystifier la conception de l'espace d'action pour les politiques de manipulation robotique

Une étude empirique de grande envergure, publiée sur arXiv (référence 2602.23408), apporte les premières réponses systématiques à une question restée sans réponse rigoureuse dans la communauté de la manipulation robotique : comment concevoir l'espace d'action d'une politique apprise par imitation ? Les chercheurs ont conduit plus de 13 000 déploiements réels sur un robot bimanuel, entraîné et évalué plus de 500 modèles sur quatre scénarios distincts, en examinant deux axes structurants : l'axe temporel (représentations absolues vs. incrémentales, dites "delta") et l'axe spatial (espace articulaire, ou joint-space, vs. espace opérationnel, ou task-space). Le résultat principal est sans ambiguïté : les représentations delta, qui encodent des variations de position plutôt que des positions cibles absolues, améliorent systématiquement les performances d'apprentissage. Sur l'axe spatial, joint-space et task-space révèlent des forces complémentaires : le premier favorise la stabilité du contrôle, le second facilite la généralisation à de nouveaux scénarios. Ces résultats ont une portée directe pour les équipes qui développent des politiques robotiques en production. Jusqu'ici, le choix de l'espace d'action relevait d'heuristiques héritées ou de conventions propres à chaque laboratoire, sans base empirique solide. L'étude montre que ce choix n'est pas accessoire : il conditionne fondamentalement le paysage d'optimisation de l'apprentissage par imitation, bien davantage que ce que supposait la littérature. Pour un intégrateur ou un ingénieur concevant un système de manipulation industrielle, la recommandation est désormais claire : préférer les delta actions par défaut, et arbitrer entre joint-space et task-space selon que la priorité est la stabilité du suivi de trajectoire ou la robustesse face à la variabilité des tâches. Ces conclusions sont directement applicables aux architectures VLA (Vision-Language-Action), qui dominent actuellement la recherche en politiques généralisables. Ce travail intervient dans un contexte où la course à la mise à l'échelle des données et des modèles concentre la majorité des ressources de recherche. Des systèmes comme pi-0 (Physical Intelligence), ACT ou Diffusion Policy ont popularisé l'imitation learning comme voie principale vers la manipulation généraliste, et des acteurs comme Figure AI, 1X ou Apptronik misent sur ces architectures pour leurs déploiements industriels. Pourtant, la conception de l'espace d'action restait guidée par des choix hérités des années 2010, faute d'étude comparative à grande échelle. En comblant ce manque avec une rigueur rare, les auteurs posent une base méthodologique qui devrait informer la prochaine génération de politiques bimanuelle et les benchmarks de comparaison entre systèmes.

RechercheOpinion
1 source
Comment fonctionnent réellement les VLA en environnements ouverts
4274arXiv cs.RO 

Comment fonctionnent réellement les VLA en environnements ouverts

Un article de recherche publié sur arXiv (référence 2604.21192) soumet les modèles vision-langage-action (VLA) à une évaluation critique sur le benchmark BEHAVIOR1K (B1K), un protocole simulant des tâches domestiques complexes de longue durée dans des environnements ouverts. Le constat est net : les métriques standards de ces benchmarks, taux de succès ou score partiel, ne mesurent que l'état final des objets manipulés, indépendamment des événements qui y ont conduit. Un robot qui renverse un verre avant de le replacer peut ainsi obtenir le même score qu'un robot qui l'a manipulé sans incident. Ce protocole dit "progress-agnostic" ignore entièrement les comportements dangereux en cours d'exécution. Les chercheurs ont soumis plusieurs VLA de pointe à une analyse multidimensionnelle couvrant robustesse, reproductibilité, violations de sécurité et causes d'échec des tâches. Les implications sont directes pour tout acteur envisageant un déploiement réel. Si les métriques actuelles gonflent artificiellement les performances rapportées, les décisions d'intégration basées sur ces benchmarks reposent sur des bases fragiles. La distinction est capitale entre un modèle qui complète une tâche et un modèle qui la complète de façon sûre et reproductible, deux propriétés que les scores agrégés actuels confondent. Les auteurs proposent de nouveaux protocoles d'évaluation capables de capturer les violations de sécurité, comblant un angle mort majeur de la recherche. Pour un intégrateur ou un décideur industriel, cela signifie que les chiffres de "success rate" publiés par les laboratoires doivent être lus avec prudence, en exigeant explicitement des données de reproductibilité et des métriques comportementales. La course aux VLA s'est accélérée depuis 2024 avec des modèles comme pi0 de Physical Intelligence, GR00T N2 de NVIDIA, ou OpenVLA issu de Stanford et Berkeley. Ces systèmes combinent une fondation vision-langage avec un module d'action, affichant des capacités de généralisation notables en simulation. Ce papier suggère que le fossé simulation-réel est peut-être plus profond qu'estimé : des modèles performants sur B1K pourraient s'avérer moins fiables dès lors qu'on intègre sécurité et consistance comportementale comme critères d'évaluation. Les auteurs appellent la communauté à adopter ces nouveaux protocoles dans les futures éditions du B1K Challenge pour aligner les standards de recherche avec les exigences concrètes du déploiement en environnement ouvert.

RechercheOpinion
1 source
Un joint de poignet à abduction-adduction entraîné par tendons améliore les performances d'un exosquelette de membre supérieur à 5 degrés de liberté
4275arXiv cs.RO 

Un joint de poignet à abduction-adduction entraîné par tendons améliore les performances d'un exosquelette de membre supérieur à 5 degrés de liberté

Une équipe de chercheurs a publié sur arXiv (preprint arXiv:2504.20898) une évaluation expérimentale de l'exosquelette de membre supérieur EXOTIC2, enrichi d'un sixième degré de liberté actif au niveau du poignet : le mouvement d'abduction-adduction (Ab-Ad). Le module intégré est compact et léger, utilisant une transmission par tendons pour l'abduction et un rappel par ressort pour l'adduction. Le protocole a impliqué huit adultes sans déficit moteur, soumis à deux tâches fonctionnelles de la vie quotidienne (boire dans un verre, gratter une surface) dans deux conditions randomisées : poignet actif vs. poignet bloqué. Un test de faisabilité préliminaire a également été conduit sur une personne atteinte de sclérose latérale amyotrophique (SLA). Les résultats quantitatifs sont nets : avec le DoF Ab-Ad activé, le taux de renversement lors de la tâche de boisson chute de 56 % à 3 %, et le taux de succès pour le nivellement lors de la tâche de grattage passe de 28 % à 75 %. Aucune dégradation du temps d'exécution n'a été observée. Ces chiffres apportent une preuve expérimentale directe d'un point souvent débattu dans la communauté exosquelette : l'ajout d'un DoF au poignet est fréquemment évité pour des raisons de complexité mécanique et de poids, sans que son bénéfice fonctionnel réel soit bien documenté. Cette étude comble ce vide pour les tâches de préhension et de transport d'objets. L'exosquelette EXOTIC (dont EXOTIC2 est la seconde génération) est développé dans un contexte de rééducation pour personnes à mobilité réduite sévère, notamment les patients SLA. Le domaine des exosquelettes de membre supérieur à vocation clinique reste dominé par quelques acteurs européens et nord-américains : Hocoma, Tyromotion, ou encore le français Wandercraft côté membre inférieur. Pour le membre supérieur, les solutions commerciales disponibles (Armeo, REAplan) intègrent rarement un contrôle actif du poignet en Ab-Ad. Ce travail, encore au stade de preprint, devra être validé sur une cohorte de patients avec déficits moteurs avant toute perspective de commercialisation, mais il pose une base expérimentale solide pour les prochaines itérations de conception.

ExosquelettesPaper
1 source
Hi-WM : un modèle du monde centré sur l'humain pour l'entraînement robotique à grande échelle
4276arXiv cs.RO 

Hi-WM : un modèle du monde centré sur l'humain pour l'entraînement robotique à grande échelle

Une équipe de recherche présente Hi-WM (Human-in-the-World-Model), un cadre de post-entraînement pour politiques robotiques généralisées, publié sur arXiv (2604.21741). L'approche remplace l'exécution physique par un modèle du monde appris : la politique est d'abord déroulée en boucle fermée dans ce simulateur interne, et lorsqu'une trajectoire devient incorrecte ou risquée, un opérateur humain intervient directement dans le modèle pour fournir des actions correctives courtes. Hi-WM met en cache les états intermédiaires et supporte le rollback et le branchement, ce qui permet de réutiliser un seul état d'échec pour générer plusieurs continuations correctives distinctes. Les trajectoires ainsi produites sont réinjectées dans le jeu d'entraînement. Évalué sur trois tâches de manipulation réelle (objets rigides et déformables) avec deux architectures de politique différentes, le système affiche un gain de 37,9 points en taux de succès réel par rapport à la politique de base, et de 19,0 points par rapport à une ligne de base en boucle fermée dans le modèle du monde. La corrélation entre les évaluations dans le modèle et les performances réelles atteint r = 0,953. Ce résultat adresse un goulot d'étranglement structurel du déploiement robotique : le post-entraînement actuel exige du temps robot, des resets de scène, une supervision opérateur en continu, autant de contraintes qui rendent la correction itérative coûteuse à l'échelle. En décorrélant la phase corrective de l'exécution physique, Hi-WM densifie la supervision précisément là où la politique échoue, sans mobiliser le matériel. La forte corrélation sim-to-real (r > 0,95) est notable : elle suggère que le modèle du monde est suffisamment fidèle pour qualifier les politiques avant déploiement, ce qui contredit en partie l'hypothèse que l'évaluation dans le modèle reste trop éloignée des conditions réelles pour être exploitable. Les modèles du monde conditionnés sur les actions sont étudiés depuis plusieurs années principalement pour la génération de données synthétiques et l'évaluation de politiques, notamment dans les travaux autour des VLA (Vision-Language-Action models) et des politiques généralisées comme celles portées par Physical Intelligence (Pi-0) ou les recherches internes de Google DeepMind. Hi-WM repositionne ces modèles comme substrat correctif actif, une troisième fonction jusqu'ici peu explorée. Les suites naturelles incluent l'extension à des tâches de locomotion, la réduction du coût de construction du modèle du monde, et l'intégration dans des pipelines de fine-tuning continu pour robots déployés en environnement industriel variable.

RechercheOpinion
1 source
Apprentissage par renforcement avec priors fondation : vers un agent incarné qui apprend efficacement de manière autonome
4277arXiv cs.RO 

Apprentissage par renforcement avec priors fondation : vers un agent incarné qui apprend efficacement de manière autonome

Des chercheurs ont publié sur arXiv (identifiant 2310.02635, cinquième révision) un cadre appelé RLFP, Reinforcement Learning with Foundation Priors, conçu pour rendre l'apprentissage par renforcement viable sur des robots réels, sans ingénierie manuelle des récompenses. Au coeur du système se trouve l'algorithme FAC (Foundation-guided Actor-Critic), qui s'appuie simultanément sur trois types de modèles fondationnels : un modèle de politique, un modèle de valeur, et un modèle de récompense de succès. Sur cinq tâches de manipulation dextère réalisées avec de vrais robots, FAC atteint un taux de succès moyen de 86 % après seulement une heure d'apprentissage en temps réel. Sur le benchmark simulé Meta-world, il obtient 100 % de succès sur 7 des 8 tâches évaluées, en moins de 100 000 frames d'interaction, là où les méthodes de référence avec récompenses manuelles nécessitent 1 million de frames pour des performances comparables. L'impact industriel potentiel est significatif. L'un des verrous majeurs du déploiement de la robotique apprenante en environnement réel est double : la quantité astronomique de données requise par le RL classique, et le coût humain de la conception des fonctions de récompense, qui exige des ingénieurs spécialisés pour chaque nouvelle tâche. RLFP adresse les deux simultanément, en multipliant par environ dix l'efficacité en données et en automatisant la génération de signal de récompense via des modèles pré-entraînés. Si les résultats se confirment hors conditions de laboratoire, ce type de cadre pourrait réduire drastiquement le temps de mise en service d'un bras industriel sur une nouvelle opération, un enjeu clé pour les intégrateurs. Ce travail s'inscrit dans une tendance de fond qui voit les grands modèles de langage et de vision (VLM/LLM) utilisés comme priors pour guider l'exploration robotique, une approche concurrente des méthodes par imitation pure (apprentissage à partir de démonstrations humaines) ou par curriculum appris. Parmi les travaux proches figurent SayCan (Google), Code as Policies (DeepMind) et les récents VLA comme pi-0 (Physical Intelligence) ou OpenVLA. L'équipe indique que RLFP est agnostique au type de modèle fondationnel utilisé et robuste aux priors bruités, ce qui est une affirmation forte qu'il faudra valider sur des benchmarks extérieurs. Le code et les visualisations sont disponibles publiquement, ce qui facilite la reproduction indépendante.

IA physiqueOpinion
1 source
Compréhension neuro-symbolique de la manipulation par chaînes d'événements sémantiques enrichies
4278arXiv cs.RO 

Compréhension neuro-symbolique de la manipulation par chaînes d'événements sémantiques enrichies

Des chercheurs présentent eSEC-LAM, un cadre neuro-symbolique conçu pour permettre aux robots opérant dans des environnements humains de comprendre les manipulations d'objets en temps réel. Publié sur arXiv (2604.21053), ce travail s'appuie sur les enriched Semantic Event Chains (eSECs), une représentation symbolique relationnelle qui décrit comment les relations spatiales entre objets évoluent au fil d'une séquence de manipulation. eSEC-LAM augmente ces chaînes classiques avec cinq couches d'information supplémentaires : des prédicats pondérés par un score de confiance, des rôles fonctionnels d'objets (outil, patient, récipient), des priors d'affordance, une abstraction en primitives de mouvement, et des indicateurs de saillance pour l'explicabilité. Le système est évalué sur trois benchmarks vidéo reconnus : EPIC-KITCHENS-100, EPIC-KITCHENS VISOR, et Assembly101, couvrant la reconnaissance d'actions, la prédiction de la prochaine primitive, la robustesse au bruit perceptuel et la cohérence des explications. L'intérêt industriel réside dans la prédiction de la prochaine étape de manipulation, un verrou critique pour les robots collaboratifs et les systèmes d'assistance à l'assemblage. Les résultats montrent qu'eSEC-LAM améliore substantiellement cette capacité par rapport aux baselines symboliques classiques et aux modèles vidéo bout-en-bout, tout en restant plus robuste lorsque la perception est dégradée, un scénario fréquent en usine ou à domicile. L'architecture hybride évite la boîte noire des approches purement neuronales : chaque décision est ancrée dans des preuves relationnelles explicites, ce qui facilite l'audit et la certification, deux exigences croissantes pour les intégrateurs industriels soumis aux normes de sécurité fonctionnelle (ISO 10218, EN 13849). Ce n'est pas un modèle VLA qui apprend tout end-to-end depuis des vidéos brutes : c'est délibérément un système de raisonnement léger, conçu pour tourner sans GPU dédié au moment de l'inférence symbolique. Les eSECs ont émergé dans les laboratoires de robotique cognitive au début des années 2010 comme alternative interprétable aux réseaux de neurones pour la compréhension de gestes, mais ils restaient jusqu'ici principalement descriptifs. eSEC-LAM est une tentative de les transformer en états internes actifs pour un raisonnement décisionnel. Dans le paysage concurrent, les approches VLA comme Pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA) misent sur l'apprentissage massif généraliste ; eSEC-LAM propose une voie opposée, plus modulaire et explicable, potentiellement plus adaptée aux certifications réglementaires ou aux domaines à données rares. Les prochaines étapes logiques seraient une validation sur robot réel en boucle fermée et une intégration avec des couches de planification symbolique (PDDL, HTN), pour aller au-delà de la reconnaissance vers l'exécution autonome de tâches multi-étapes.

RecherchePaper
1 source
Simulé ou réel : robustesse des VLM au décalage de domaine en compréhension de scène robotique
4279arXiv cs.RO 

Simulé ou réel : robustesse des VLM au décalage de domaine en compréhension de scène robotique

Une équipe de chercheurs a publié sur arXiv (identifiant 2506.19579, troisième révision, juin 2025) une évaluation systématique des modèles vision-langage (VLM) appliqués à la compréhension de scènes robotiques en vue unique. Le protocole expérimental cible des scènes de table captées par un bras manipulateur, avec un cadre de domain shift contrôlé : chaque outil réel est mis en parallèle avec un homologue imprimé en 3D, géométriquement identique mais différent en texture, couleur et matière. Plusieurs VLM déployables localement, parmi les plus récents du domaine, ont été soumis à un benchmark multicritères axé sur l'alignement sémantique et l'ancrage factuel des descriptions textuelles générées. Les résultats montrent que les VLM décrivent correctement les objets courants du monde réel, mais que leurs performances se dégradent sensiblement dès que ces objets sont remplacés par des pièces imprimées en 3D, malgré une forme structurelle identique. Le constat a une portée directe pour les intégrateurs robotiques et les équipes industrielles qui s'appuient sur des VLM pour la perception de scènes. En atelier, les gabarits, les pièces de fixation et les prototypes imprimés en 3D sont omniprésents : un système de perception qui confond la texture avec la fonction risque de produire des descriptions erronées, voire de déclencher de mauvaises instructions de préhension. Plus préoccupant encore, les chercheurs démontrent que les métriques d'évaluation standard présentent des vulnérabilités critiques : certaines ne détectent pas le domain shift, d'autres récompensent des descriptions linguistiquement fluides mais factuellement incorrectes. Ce double problème, défaillance du modèle et défaillance de la métrique simultanément, rend l'échec invisible pour les équipes qui s'appuient sur les indicateurs habituels. Cette publication s'inscrit dans un courant croissant de travaux questionnant la maturité des modèles fondationnels pour les applications physiques. Le sim-to-real gap est bien documenté dans la littérature robotique, mais ce papier pointe un défi distinct : le real-to-real domain shift entre catégories de matériaux. Alors que les pipelines robotiques modernes, comme ceux qui sous-tendent GR00T N2 (NVIDIA), Pi-0 (Physical Intelligence) ou les architectures VLA en général, intègrent de plus en plus des composants vision-langage, l'étude souligne que les protocoles d'évaluation doivent évoluer en parallèle. Les auteurs appellent à des architectures plus robustes et à des protocoles de validation adaptés aux contraintes physiques du déploiement réel, sans toutefois proposer de solution concrète dans ce travail préliminaire.

RecherchePaper
1 source
ExpressMM : des comportements de manipulation mobile expressifs dans les interactions humain-robot
4280arXiv cs.RO 

ExpressMM : des comportements de manipulation mobile expressifs dans les interactions humain-robot

Des chercheurs ont présenté ExpressMM, un framework destiné aux manipulateurs mobiles déployés en environnements humains, capable de générer des comportements expressifs en temps réel pendant l'exécution de tâches collaboratives. Publié sur arXiv (2604.05320v3), le système repose sur une architecture à deux niveaux : un planificateur de haut niveau fondé sur un modèle vision-langage (VLM) prend en charge la perception et le raisonnement conversationnel, tandis qu'une politique vision-langage-action (VLA) de bas niveau produit les mouvements expressifs du robot. Élément distinctif : ExpressMM supporte les interactions interruptibles, c'est-à-dire que l'utilisateur peut modifier ou rediriger les instructions du robot en cours d'exécution. L'évaluation a été conduite sur un manipulateur mobile réel lors d'un scénario d'assemblage collaboratif, avec des démonstrations en direct devant un public et des questionnaires post-session. La majorité des travaux antérieurs sur les comportements expressifs des robots s'appuyaient sur des mouvements préprogrammés ou appris par démonstration, et n'anticipaient pas les interruptions en cours de tâche, un cas pourtant courant dès qu'un humain travaille aux côtés d'un robot. ExpressMM traite cette lacune en couplant une VLA capable de s'adapter dynamiquement aux nouvelles instructions avec un raisonnement langage-vision pour maintenir la cohérence sociale de l'interaction. Les résultats des questionnaires indiquent que les observateurs ont trouvé les actions du robot clairement interprétables, les interactions socialement appropriées, et le comportement prévisible et sûr. Pour les intégrateurs industriels et les équipes opérations, c'est un signal fort : les robots collaboratifs ne peuvent plus se contenter d'accomplir une tâche ; ils doivent être lisibles par les humains qui partagent l'espace de travail. Le sujet de l'expressivité robotique est activement exploré depuis plusieurs années dans la communauté HRI, mais les approches précédentes peinaient à généraliser au-delà de comportements scénarisés ou de démos contrôlées. L'utilisation conjointe d'un VLM et d'une VLA dans un seul pipeline interruptible représente une progression architecturale significative. Sur le plan concurrentiel, des acteurs comme Boston Dynamics (avec Spot) ou des startups HRI telles que Enchanted Tools en France (robot Miroki) travaillent également sur la dimension sociale des robots collaboratifs, mais peu publient des évaluations HRI aussi structurées en conditions réelles. Les prochaines étapes logiques pour ExpressMM seraient des déploiements en environnements industriels ou de service à plus grande échelle, où la variété des interactions humaines dépasse largement les scénarios d'assemblage contrôlés.

IA physiqueOpinion
1 source
Navigating l'encombrement : planification bi-niveau par points de passage pour systèmes multi-robots
4281arXiv cs.RO 

Navigating l'encombrement : planification bi-niveau par points de passage pour systèmes multi-robots

Des chercheurs de l'Université de Californie à Santa Barbara (UCSB, laboratoire NLP-Chang) ont publié sur arXiv (référence 2604.21138) un framework hybride de contrôle multi-robots capable de planifier simultanément à deux niveaux : la planification de tâches à haut niveau (quel robot fait quoi, dans quel ordre) et la planification de trajectoires à bas niveau (comment éviter les collisions). Le système repose sur une représentation compacte appelée "waypoints", des points de passage intermédiaires qui paramétrisent les trajectoires motrices de façon plus légère qu'une optimisation de trajectoire continue. Pour entraîner le tout, l'équipe utilise un algorithme RLVR (Reinforcement Learning with Verifiable Rewards) modifié, combiné à une stratégie de curriculum progressif qui remonte les retours de faisabilité physique du planificateur bas niveau vers le planificateur haut niveau. Les expériences sont conduites sur BoxNet3D-OBS, un benchmark multi-robots 3D à obstacles denses, avec des configurations allant jusqu'à neuf robots simultanément. Sur ce benchmark, l'approche surpasse de manière consistante les baselines "motion-agnostic" (qui ignorent les contraintes physiques) et les baselines fondées sur des VLA (Vision-Language-Action models). Ce résultat pointe un problème structurel souvent minimisé dans la littérature : l'affectation du crédit entre les deux niveaux de planification. Quand un système multi-robots échoue, est-ce que la tâche était mal assignée ou la trajectoire physiquement infaisable ? Cette ambiguïté rend les approches séquentielles (planifier les tâches, puis les trajectoires) fragiles dès que l'environnement est encombré. Le fait que les modèles VLA, pourtant en vogue depuis les travaux pi-0, GR00T N2 et Helix, sous-performent sur ce benchmark suggère que leur capacité de généralisation atteint ses limites dès qu'on ajoute des contraintes de collision à grande échelle : bonne nouvelle pour les approches d'optimisation hybride, mauvaise nouvelle pour ceux qui misent sur les VLA comme solution universelle en entrepôt. Ce travail s'inscrit dans une tendance de fond : appliquer les techniques de raisonnement par renforcement issues du traitement du langage naturel (notamment la famille DeepSeek-R1 et RLVR) à la robotique multi-agents. Les systèmes concurrents dans cet espace incluent les travaux sur TAMP (Task and Motion Planning) de MIT CSAIL et CMU, ainsi que les approches de planification décentralisée type MAPF (Multi-Agent Path Finding). Le code est disponible sur GitHub (UCSB-NLP-Chang/navigate-cluster). Les prochaines étapes probables incluent une validation sur robots physiques et une montée en charge au-delà de neuf agents, terrain où les questions de latence de planification deviendront critiques pour des déploiements industriels réels.

RecherchePaper
1 source
Apprendre la physique à partir de modèles vidéo préentraînés : modèles du monde continus et séquentiels pour la manipulation robotique
4282arXiv cs.RO 

Apprendre la physique à partir de modèles vidéo préentraînés : modèles du monde continus et séquentiels pour la manipulation robotique

Une équipe de chercheurs propose PhysGen, un cadre d'apprentissage publié en prépublication sur arXiv (réf. 2603.00110v2), qui exploite des modèles de génération vidéo pré-entraînés comme substituts de simulateurs physiques pour la manipulation robotique. L'idée centrale est de traiter la vidéo générée de manière autorégressive comme un proxy du monde physique, et d'y greffer des actions robotiques continues via une représentation unifiée baptisée "physical tokens", des jetons partagés qui fusionnent la modalité vidéo et les commandes motrices. Pour assurer la convergence, PhysGen intègre du masquage causal, de la cinématique inverse, une prédiction multi-tokens anticipative (L-MTP) et du cache clé-valeur (KV caching). Sur les benchmarks Libero et ManiSkill, le système surpasse OpenVLA de 13,8 points et WorldVLA de 8,8 points. Plus frappant : en conditions réelles, PhysGen atteint les performances de π₀ (Physical Intelligence) sur des tâches physiquement exigeantes, notamment la saisie d'objets transparents, sans avoir bénéficié d'un pré-entraînement spécifique aux données d'action. L'enjeu pour l'industrie est direct : la pénurie de données robotiques à grande échelle reste le principal frein à la généralisation des politiques de manipulation. PhysGen contourne ce goulot en recyclant des modèles vidéo entraînés sur des corpus massifs d'internet pour en extraire une intuition physique implicite, permanence des objets, dynamique de contact, sans collecter de trajectoires robot. Le fait de rivaliser avec π₀ sans son pré-entraînement propriétaire sur des données d'action est une validation partielle de l'hypothèse que le "sim-to-real gap" peut être réduit par la connaissance du monde visuel plutôt que par des démonstrations téléopérées. Cela dit, les résultats restent issus d'un papier de recherche avec des benchmarks sélectifs ; la robustesse sur des scènes industrielles non structurées reste à démontrer. PhysGen s'inscrit dans un courant actif qui voit les laboratoires de robotique piller les architectures de génération multimodale pour nourrir leurs politiques de contrôle : UniSim, Genie, et surtout WorldVLA avaient déjà exploré cette piste. Physical Intelligence (π₀) représente aujourd'hui la référence en termes de performances sur tâches réelles grâce à son pré-entraînement massif sur données d'action hétérogènes, ce qui rend la comparaison de PhysGen d'autant plus significative. OpenVLA (Berkeley) constitue le concurrent open-source direct. La prochaine étape logique pour les auteurs serait une évaluation sur des manipulateurs industriels multi-DOF en environnement non contrôlé, et une intégration avec des pipelines de données synthétiques pour réduire encore la dépendance aux démonstrations humaines.

IA physiqueOpinion
1 source
Sécurité dynamique corps entier pour bras robotiques : fonctions de sécurité de Poisson 3D pour filtres de sécurité à base de CBF
4283arXiv cs.RO 

Sécurité dynamique corps entier pour bras robotiques : fonctions de sécurité de Poisson 3D pour filtres de sécurité à base de CBF

Des chercheurs ont déposé sur arXiv (réf. 2604.21189) un cadre pour la sécurité plein-corps des bras manipulateurs robotiques en environnements dynamiques, combinant des fonctions de sécurité de Poisson en 3D (PSF) et des filtres basés sur des Control Barrier Functions (CBF). La méthode discrétise la surface du robot à une résolution paramétrable, puis contracte l'espace libre via une différence de Pontryagin proportionnelle à cette résolution. Sur ce domaine tamponné, une unique CBF globalement lisse est synthétisée en résolvant l'équation de Poisson sur l'ensemble de l'environnement. Les contraintes résultantes, évaluées à chaque point d'échantillonnage, sont appliquées en temps réel par un programme quadratique multi-contraintes. La validation est réalisée sur un manipulateur à 7 degrés de liberté (DOF) en environnement dynamique, seule donnée expérimentale concrète de ce preprint, sans benchmark de temps de cycle publié. L'apport est simultanément théorique et computationnel. Le travail prouve formellement que maintenir les points échantillonnés sûrs dans la région tamponnée suffit à garantir l'absence de collision pour la surface continue du robot, éliminant le gap entre discrétisation et géométrie réelle. Pour les intégrateurs travaillant sur la manipulation collaborative, c'est un levier direct : les approches CBF classiques requièrent une contrainte par paire de points proches, ce qui fait exploser le coût de calcul en haute dimension de configuration. En ramenant le problème à une seule fonction lisse sur tout l'environnement, le filtre devient davantage compatible avec les contraintes temps réel des contrôleurs embarqués. L'absence de métriques de latence dans la publication limite toutefois l'évaluation de la faisabilité industrielle. Les CBFs pour la sécurité robotique constituent un axe de recherche actif depuis 2019, porté notamment par les groupes d'Aaron Ames (Caltech) et des équipes au Georgia Tech. En Europe, le LAAS-CNRS à Toulouse et l'INRIA Sophia Antipolis ont contribué à des formulations similaires pour la planification sous contraintes de sécurité formelle. Du côté des intégrateurs industriels, Universal Robots, FANUC et Franka Robotics (intégré depuis dans l'écosystème Agile Robots) investissent dans des garanties de sécurité certifiables pour la co-manipulation. L'extension naturelle de ces travaux porte sur les environnements partiellement observés, données capteur bruitées ou occlusions partielles, ainsi que sur l'intégration dans une boucle de planification complète pour la manipulation dextre à grande vitesse.

RecherchePaper
1 source
Système de navigation vision-langage incarné et déployable avec cognition hiérarchique et exploration contextuelle
4284arXiv cs.RO 

Système de navigation vision-langage incarné et déployable avec cognition hiérarchique et exploration contextuelle

Une équipe de chercheurs a publié en avril 2026 sur arXiv (référence 2604.21363) un système de navigation embodied par vision et langage (VLN) conçu pour fonctionner en temps réel sur des plateformes robotiques embarquées aux ressources limitées. L'architecture repose sur trois modules asynchrones découplés : un module de perception temps-réel pour l'acquisition continue de l'environnement, un module d'intégration mémorielle pour l'agrégation spatiale et sémantique, et un module de raisonnement pour la prise de décision de haut niveau via un modèle vision-langage (VLM). Le coeur du système est un graphe de mémoire cognitive construit de façon incrémentale, décomposé en sous-graphes pour alimenter le VLM sans saturer la mémoire embarquée. Pour optimiser l'exploration, les auteurs reformulent le problème comme un Weighted Traveling Repairman Problem (WTRP) contextuel, qui minimise le temps d'attente pondéré des points de vue candidats. Les expériences portent à la fois sur des environnements simulés et sur des plateformes robotiques réelles, avec des résultats supérieurs aux approches VLN existantes en taux de succès et en efficacité de navigation. Ce travail s'attaque directement à une tension structurelle du domaine : les systèmes VLN les plus performants exigent des capacités de raisonnement qui restent typiquement hors de portée d'un matériel embarqué. Le découplage en modules asynchrones est une réponse architecturale concrète à cette contrainte, permettant de maintenir une boucle de perception à faible latence sans bloquer le raisonnement lourd. La démonstration sur hardware contraint réel, pas seulement en simulation, est le point de validation critique : elle réduit l'argument du sim-to-real gap qui frappe la majorité des publications académiques sur les VLA et VLN. Pour un intégrateur ou un décideur industriel, cela suggère que des robots capables de suivre des instructions en langage naturel dans des environnements non-structurés pourraient être déployés sans infrastructure GPU dédiée. La navigation embodied par vision et langage est un champ en pleine consolidation, porté par les progrès des VLM multimodaux (GPT-4o, LLaVA, InternVL) et par la disponibilité de benchmarks comme R2R ou REVERIE. La plupart des approches récentes sacrifient soit la généralisation soit la vitesse d'inférence pour tenir sur un robot réel. Ce papier s'inscrit dans un courant de recherche qui cherche à rendre ces systèmes embarquables sans fine-tuning massif, une direction que suivent également des équipes comme celles de CMU, ETH Zurich ou du LAAS-CNRS côté européen. Les prochaines étapes naturelles seraient une évaluation sur des benchmarks standardisés publics et une intégration dans des plateformes commerciales comme Boston Dynamics Spot ou des AMR industriels, mais ces éléments ne sont pas annoncés dans l'abstract.

IA physiqueOpinion
1 source
Correspondance par pont de Schrödinger rectifié pour la navigation visuelle en peu d'étapes
4285arXiv cs.RO 

Correspondance par pont de Schrödinger rectifié pour la navigation visuelle en peu d'étapes

Une équipe de chercheurs a soumis sur arXiv (ref. 2604.05673, v2, avril 2026) un cadre baptisé Rectified Schrödinger Bridge Matching (RSBM), visant à réduire drastiquement le coût d'inférence des politiques génératives de navigation visuelle. Les modèles basés sur la diffusion ou les ponts de Schrödinger (SB) capturent fidèlement les distributions d'actions multimodales mais exigent dix étapes d'intégration ou plus, incompatibles avec le contrôle robotique temps-réel. RSBM unifie les SB standard (ε=1, entropie maximale) et le transport optimal déterministe (ε→0, comme en Conditional Flow Matching) via un unique paramètre de régularisation entropique ε. Les auteurs démontrent que le champ de vitesse conditionnel conserve la même forme fonctionnelle sur tout le spectre ε (un seul réseau suffit pour toutes les intensités de régularisation) et que réduire ε diminue linéairement la variance du champ, stabilisant l'intégration ODE à pas larges. Résultat : 94 % de similarité cosinus et 92 % de taux de réussite en 3 étapes seulement, sans distillation ni entraînement multi-étapes. Ce résultat s'attaque directement au goulot d'étranglement des politiques VLA (Vision-Language-Action) en déploiement industriel. Les architectures de diffusion embarquées dans les robots manipulateurs et humanoïdes actuels (π0 de Physical Intelligence, GR00T N2 de NVIDIA) plafonnent leur fréquence de contrôle à cause du nombre d'étapes de dénoising requises. Passer de dix à trois étapes sans distillation, technique qui ajoute un cycle d'entraînement coûteux et instable, ouvre la voie à des politiques embarquables sur matériel edge standard sans GPU serveur dédié. Limite à noter : les expériences portent sur des benchmarks de navigation visuelle simulés ; le transfert sim-to-real n'est pas validé dans cette publication. RSBM s'inscrit dans la continuité de travaux sur l'accélération du sampling génératif : Rectified Flow (Liu et al., 2022), Consistency Models, et l'application des ponts de Schrödinger au contrôle robotique étudiée par des groupes à Stanford et CMU. Face au Conditional Flow Matching de Meta AI, rapide mais moins expressif face aux distributions fortement multimodales, RSBM revendique un équilibre théoriquement fondé entre vitesse et couverture multimodale. Aucune implémentation open-source ni déploiement hardware n'est annoncé à ce stade. Les suites probables incluent une validation sur tâches de manipulation réelles et une comparaison directe avec des méthodes de distillation rapide comme le Shortcut Model de Physical Intelligence.

RechercheOpinion
1 source
VistaBot : manipulation robotique robuste aux points de vue grâce à la synthèse de vues spatio-temporelles
4286arXiv cs.RO 

VistaBot : manipulation robotique robuste aux points de vue grâce à la synthèse de vues spatio-temporelles

Des chercheurs ont publié VistaBot, un framework de manipulation robotique ciblant un angle mort des politiques end-to-end actuelles : leur fragilité face aux changements de point de vue de caméra entre entraînement et déploiement. La préprint arXiv 2604.21914, déposée en avril 2026, décrit une architecture en trois modules : estimation de géométrie 4D, synthèse de vue par diffusion vidéo, et planification d'actions en espace latent, sans recalibration de caméra requise au moment du déploiement. Intégré dans deux politiques de référence du domaine, ACT (Action Chunking Transformer) et π₀ (la politique diffusion-based de Physical Intelligence), VistaBot améliore la métrique VGS (View Generalization Score, introduite par les auteurs) de 2,79x par rapport à ACT et de 2,63x par rapport à π₀, en simulation et en environnement réel. Le code et les modèles seront publiés en open source. La dépendance à un point de vue fixe constitue un frein structurel au déploiement des bras manipulateurs en conditions industrielles : une caméra repositionnée ou partiellement obstruée peut invalider un modèle entier sans mécanisme de compensation. VistaBot répond en synthétisant dynamiquement des vues alternatives via un modèle de diffusion vidéo, puis en planifiant les actions dans l'espace latent de ces vues synthétisées, sans recollecte de données depuis le nouvel angle. Pour un intégrateur ou un COO industriel, cela réduit directement le coût de reconfiguration sur ligne. L'introduction du VGS comble également un vide méthodologique : le domaine ne disposait pas de benchmark standardisé pour comparer la robustesse cross-view entre politiques, rendant les comparaisons entre travaux difficiles. Le problème de robustesse aux points de vue est documenté en imitation learning depuis plusieurs années, mais les solutions disponibles exigeaient soit une augmentation intensive des données, soit une calibration caméra explicite à chaque reconfiguration. Physical Intelligence, fondée en 2023, a développé π₀ comme politique généraliste de manipulation. D'autres acteurs comme Google DeepMind (RT-2 et ses successeurs), Figure AI (Figure 03) ou 1X Technologies ciblent des architectures VLA à plus large spectre sans traiter spécifiquement cet axe de robustesse aux vues. VistaBot reste une contribution académique préliminaire : la préprint n'est pas encore revue par les pairs, les tâches réelles évaluées ne sont pas décrites en détail, et les gains annoncés devront être confirmés par des reproductions indépendantes une fois le code disponible.

IA physiquePaper
1 source
Apprendre l'apesanteur : imiter des mouvements non auto-stabilisants sur un robot humanoïde
4287arXiv cs.RO 

Apprendre l'apesanteur : imiter des mouvements non auto-stabilisants sur un robot humanoïde

Une équipe de chercheurs propose dans un preprint arXiv (référence 2604.21351, avril 2026) une méthode baptisée Weightlessness Mechanism (WM), conçue pour permettre aux robots humanoïdes d'exécuter des mouvements dits non-autostabilisants (NSS, Non-Self-Stabilizing). Ces mouvements englobent des actions aussi banales que s'asseoir sur une chaise, s'allonger sur un lit ou s'appuyer contre un mur : contrairement à la locomotion bipède classique, le robot ne peut maintenir sa stabilité sans interagir physiquement avec l'environnement. Les expériences ont été menées en simulation et sur le robot humanoïde Unitree G1, sur trois tâches représentatives : s'asseoir sur des chaises de hauteurs variables, s'allonger sur des lits à différentes inclinaisons, et s'appuyer contre des murs via l'épaule ou le coude. La méthode est entraînée sur des démonstrations en action unique, sans fine-tuning spécifique à chaque tâche. L'apport technique central s'appuie sur une observation biomécanique : lors de mouvements NSS, les humains relâchent sélectivement certaines articulations pour laisser le contact passif avec l'environnement assurer la stabilité, un état que les auteurs qualifient de "weightless". Le WM formalise ce mécanisme en déterminant dynamiquement quelles articulations relâcher et dans quelle mesure, complété par une stratégie d'auto-étiquetage automatique de ces états dans les données d'entraînement. Pour les intégrateurs industriels qui déploient des humanoïdes dans des environnements réels, ce verrou est significatif : les pipelines actuels d'imitation learning combiné au reinforcement learning imposent généralement un suivi rigide de trajectoire sans modéliser les interactions physiques avec les surfaces, ce qui les rend inopérants dès que le robot doit s'appuyer sur quelque chose. Le contexte est celui d'un secteur en pleine accélération : Figure AI avec le Figure 03, Agility Robotics avec Digit, Boston Dynamics avec Atlas et 1X Technologies poussent tous leurs humanoïdes vers des déploiements en entrepôt ou en usine, mais les scénarios de contact-riche restent largement non résolus. Le Unitree G1, plateforme commerciale accessible, s'impose progressivement comme banc de test académique standard, ce qui accélère la reproductibilité des résultats. Il faut néanmoins souligner que ce travail est au stade de preprint non évalué par les pairs, et que les séquences vidéo accompagnant ce type de publication sont souvent sélectionnées favorablement : la robustesse réelle en conditions non supervisées reste à démontrer. Les suites naturelles seraient une intégration dans des politiques généralisées comme GR00T N2 de NVIDIA ou pi0 de Physical Intelligence, et une évaluation sur des scènes hors distribution.

IA physiquePaper
1 source
État de l'art de la robotique à pattes en environnements non inertiels : passé, présent et futur
4288arXiv cs.RO 

État de l'art de la robotique à pattes en environnements non inertiels : passé, présent et futur

Une équipe de chercheurs dépose en avril 2026 sur arXiv (référence 2604.20990) une revue de littérature consacrée à la locomotion des robots à pattes dans les environnements dits non inertiels, c'est-à-dire des surfaces en mouvement, en inclinaison ou en accélération. Le travail couvre trois grandes familles d'applications : les plateformes de transport terrestre (véhicules en déplacement), les plateformes maritimes (navires, offshore) et les contextes aérospatiaux. Les auteurs y passent en revue les méthodes existantes de modélisation, d'estimation d'état et de contrôle de la locomotion, en cartographiant leurs hypothèses et leurs limites respectives. Ils identifient ensuite quatre classes de problèmes non résolus : le couplage robot-environnement, l'observabilité du système en présence de perturbations persistantes, la robustesse des lois de contrôle face aux accélérations variables, et la validation expérimentale dans des conditions dynamiques représentatives. L'enjeu industriel est immédiat. L'écrasante majorité des robots à pattes aujourd'hui commercialisés, quadrupèdes comme l'ANYmal d'ANYbotics, le Spot de Boston Dynamics ou le Go2 d'Unitree, est conçue, calibrée et validée sur sol rigide et stationnaire. Les frameworks de contrôle classiques (MPC, whole-body control) posent explicitement l'hypothèse d'un point d'appui fixe. Dès qu'un navire tangue ou qu'un véhicule accélère, ces hypothèses s'effondrent, entraînant des comportements instables non récupérables sans adaptation du contrôleur en temps réel. Pour un COO qui envisage de déployer des robots d'inspection sur une plateforme pétrolière offshore, un cargo ou un aéronef, ce gap technique constitue aujourd'hui un frein concret à la commercialisation, indépendamment des progrès spectaculaires réalisés sur sol plat. Le domaine progresse depuis la fin des années 2010, porté par l'apprentissage par renforcement (sim-to-real) et l'estimation d'état à haute fréquence par IMU, mais les déploiements réels en environnement non inertiel demeurent rares et peu documentés dans la littérature. Aucun acteur industriel dominant ne s'est encore imposé sur ce segment, ni en Europe ni en Asie, ce qui laisse la fenêtre ouverte pour des laboratoires académiques et des intégrateurs spécialisés. Le survey identifie plusieurs directions prioritaires : les stratégies bio-inspirées (adaptation observée chez les animaux marins ou arboricoles), la co-conception robot-plateforme, et l'élaboration de protocoles de test standardisés simulant les perturbations dynamiques. Ce travail de cartographie a vocation à servir de référence pour orienter les prochains appels à projets et les roadmaps des fabricants de robots à pattes qui visent les marchés industriels les plus exigeants.

RecherchePaper
1 source
X2-N : robot humanoïde transformable hybride roues-jambes à double mode de locomotion et manipulation
4289arXiv cs.RO 

X2-N : robot humanoïde transformable hybride roues-jambes à double mode de locomotion et manipulation

Des chercheurs ont publié sur arXiv (référence 2604.21541v1, avril 2026) les résultats de développement du X2-N, un robot à locomotion hybride roues-jambes capable de se transformer entre une configuration humanoïde bipède et une configuration à roues, par reconfiguration articulaire à la volée. Contrairement aux plateformes roues-jambes existantes qui utilisent des roues fixes en guise de pieds et des hanches à degrés de liberté limités, le X2-N dispose d'un grand nombre de degrés de liberté (le nombre exact n'est pas précisé dans l'abstract) et d'un buste complet avec deux bras manipulateurs. Le système de contrôle repose sur un framework de contrôle corps entier basé sur l'apprentissage par renforcement (RL), unifiant locomotion hybride, transformation morphologique et manipulation dans un même pipeline. Les validations expérimentales couvrent des tâches de locomotion dynamique de type skating, de montée d'escaliers et de livraison de colis. Le point central de cette contribution est l'adresse du double goulot d'étranglement qui freine les robots roues-jambes actuels : la rigidité de la configuration au sol, qui dégrade la stabilité en mode biped, et l'absence de membres supérieurs, qui interdit toute manipulation. En intégrant ces deux capacités dans un seul châssis transformable piloté par un unique contrôleur RL, les auteurs montrent qu'il est possible d'obtenir une adaptabilité terrain élevée sans sacrifier les capacités de manipulation. Pour un COO industriel ou un intégrateur logistique, c'est la promesse d'un seul robot capable d'alterner entre déplacement rapide en mode roues sur sol continu et navigation en mode jambes sur terrains discontinus, tout en manipulant des charges. Il convient néanmoins de souligner que les validations présentées restent des démonstrations en laboratoire : aucun déploiement industriel réel ni chiffres de cycle time en conditions production ne sont fournis. Le segment des robots roues-jambes est occupé notamment par Unitree (variantes B2W et H1 avec extensions roues), Boston Dynamics (Handle, orienté logistique mais sans bras polyvalents), et diverses startups issues de laboratoires universitaires asiatiques et américains. Le X2-N se positionne sur la convergence humanoïde-AMR, un créneau en compétition directe avec les approches tout-biped des acteurs comme Figure, Agility Robotics ou Fourier Intelligence, qui misent sur l'universalité de la forme humaine plutôt que sur la flexibilité morphologique. La prochaine étape logique pour cette recherche serait une validation hors laboratoire et la publication de métriques de performance comparables à celles des plateformes commerciales, pour confirmer que les gains en efficacité de locomotion compensent la complexité mécanique additionnelle.

HumanoïdesPaper
1 source
Méthode reproductible de sensibilisation à la robotique par interaction LLM : résultats d'un défi d'entreprise
4290arXiv cs.RO 

Méthode reproductible de sensibilisation à la robotique par interaction LLM : résultats d'un défi d'entreprise

Une équipe de chercheurs a conçu et testé une méthode de sensibilisation à la robotique en milieu industriel réel, en déployant un robot humanoïde contrôlé par un grand modèle de langage (LLM) lors d'un événement interne organisé par AD Ports Group aux Émirats arabes unis. Les employés du groupe portuaire, sans formation préalable en robotique, ont interagi avec le robot via des commandes vocales dans un environnement d'exercice inspiré de la logistique, structuré en équipes avec des rôles attribués. Au terme de l'activité, un questionnaire resté ouvert 16 jours a recueilli 102 réponses. La satisfaction globale atteint 8,46/10, l'intérêt déclaré pour la robotique et l'IA 4,47/5, et la compréhension des nouvelles formes de collaboration homme-robot 4,45/5. Les participants ayant interagi directement avec le robot ont évalué la naturalité de l'échange à 4,37/5 et la progression de la facilité d'interaction à 4,74/5. Les scores concernant la fiabilité et la prédictibilité du robot restent en revanche sensiblement plus bas, ce que les auteurs identifient comme un défi technique à adresser. Ce travail fournit l'une des rares mesures quantitatives issues d'un déploiement en organisation réelle, hors contexte laboratoire, sur l'efficacité des LLM comme interface d'entrée en robotique pour des non-spécialistes. Pour les décideurs industriels et les intégrateurs, il valide un format concret d'onboarding technique : une activité compétitive courte peut suffire à modifier la perception et l'appétence pour la robotique collaborative. La méthode est présentée comme réplicable, ce qui est significatif pour des groupes industriels cherchant à préparer leurs effectifs à des déploiements d'IA incarnée sans passer par une formation longue. L'exploration des LLM comme couche de contrôle en langage naturel pour les robots s'intensifie depuis 2023, portée notamment par des architectures comme Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) ou Helix (Figure AI), mais les preuves d'usage en conditions industrielles non contrôlées restent rares. AD Ports Group, opérateur de ports et de zones logistiques parmi les plus importants du Moyen-Orient, constitue un terrain d'expérimentation pertinent. L'étude ne précise pas le modèle de robot humanoïde utilisé ni l'architecture LLM sous-jacente, une limite notable pour qui voudrait reproduire l'approche. Les prochaines étapes annoncées portent sur l'amélioration de la fiabilité perçue et la réplication de la méthode dans d'autres contextes opérationnels industriels.

RecherchePaper
1 source
Conception, modélisation et évaluation expérimentale d'un mécanisme d'abduction-adduction du poignet à câbles pour exosquelette du membre supérieur
4291arXiv cs.RO 

Conception, modélisation et évaluation expérimentale d'un mécanisme d'abduction-adduction du poignet à câbles pour exosquelette du membre supérieur

Des chercheurs ont publié sur arXiv (preprint 2604.20893, avril 2026) un mécanisme inédit d'actionnement par tendon unique pour le mouvement d'abduction-adduction du poignet dans un exosquelette de membre supérieur. Le système repose sur un câble de Bowden unique, maintenu en tension permanente par un ressort de torsion spiralé (dit "clock spring"), ce qui élimine le besoin d'une actuation antagoniste classique. Le prototype a été évalué expérimentalement avec cinq participants sans déficience motrice (NMD), dans différentes positions du bras et sous plusieurs charges, à travers trois configurations de ressorts. Les résultats montrent une bonne concordance entre les prédictions de simulation et les données expérimentales, avec la configuration nominale offrant le meilleur compromis entre amplitude de mouvement, couple requis et répétabilité. Ce travail s'attaque à un problème réel dans la conception d'exosquelettes du poignet : les actionneurs conventionnels (moteurs électriques, pneumatique) alourdissent le dispositif, introduisent des frottements et compliquent l'intégration mécanique. L'approche par câble de Bowden assisté par ressort torsionnel permet d'obtenir un mécanisme compact et léger, sans recourir à un câble de retour actif. Point méthodologique notable : les auteurs proposent une méthode de sélection des paramètres de rigidité entièrement guidée par simulation, ce qui réduit la dépendance au tuning empirique itératif, typiquement coûteux en phase de prototypage. Pour les intégrateurs en rééducation robotique, cela ouvre la voie à un processus de conception plus prévisible, même si l'évaluation sur cinq sujets valides reste insuffisante pour valider l'usage clinique. Les exosquelettes de poignet font l'objet d'une recherche active, avec des acteurs académiques et industriels comme Hocoma, Tyromotion ou, côté français, Wandercraft et Pollen Robotics qui travaillent sur la rééducation du membre supérieur. L'articulation du poignet, et notamment son degré de liberté en abduction-adduction, est souvent la moins bien couverte dans les dispositifs existants, car mécaniquement complexe à intégrer. Ce preprint ne présente pas un produit commercialisé mais un prototype de recherche validé en laboratoire; les prochaines étapes naturelles seraient une étude sur des patients post-AVC ou avec pathologies neuromusculaires, et une intégration dans un exosquelette complet du membre supérieur.

ExosquelettesPaper
1 source
Prédiction efficace de gestes iconiques tenant compte des émotions pour les robots en co-parole
4292arXiv cs.RO 

Prédiction efficace de gestes iconiques tenant compte des émotions pour les robots en co-parole

Des chercheurs ont publié sur arXiv (preprint 2604.11417) un transformer léger pour prédire le placement et l'intensité des gestes iconiques synchronisés à la parole des robots, à partir du texte et de l'émotion seuls, sans audio à l'inférence. Évalué sur le jeu de données BEAT2, référence du domaine pour la génération de gestes co-parlés, le système surpasse GPT-4o en classification du placement de gestes sémantiques et en régression d'intensité, tout en restant suffisamment compact pour un déploiement temps réel sur agents incarnés. La majorité des systèmes robotiques actuels se limitent à des gestes rythmiques (beat gestures), peu porteurs de sens. Intégrer des gestes iconiques, qui illustrent ou soulignent le contenu du discours, améliore l'engagement et la compréhension de l'interlocuteur humain. Le fait qu'un transformer spécialisé et léger surpasse GPT-4o sur cette tâche précise confirme que des architectures ciblées peuvent rivaliser avec de grands modèles généralistes en interaction homme-robot (HRI), à fraction du coût computationnel. L'absence d'audio à l'inférence simplifie également le pipeline de déploiement sur plateformes sans microphone embarqué ou soumises à des contraintes de latence strictes. La génération de gestes co-parlés est un axe actif en HRI, structuré depuis quelques années par des benchmarks communs dont BEAT2. Ce travail s'inscrit dans une tendance plus large d'allégement des modèles pour agents embarqués, des robots de service aux humanoïdes sociaux. Des plateformes comme Pepper (SoftBank) ou les projets de robotique sociale développés en Europe constituent des cibles naturelles pour ce type de module. Le preprint ne mentionne ni partenariat industriel ni validation hors laboratoire, ce qui reste à confirmer avant tout déploiement opérationnel.

RecherchePaper
1 source
Planification VLA à horizon étendu par conditionnement sur traces
4293arXiv cs.RO 

Planification VLA à horizon étendu par conditionnement sur traces

Une équipe de chercheurs a publié en avril 2026 LoHo-Manip (arXiv:2604.21924), un cadre modulaire conçu pour étendre les politiques VLA (vision-language-action) aux tâches de manipulation longue durée. Le coeur du système repose sur une architecture découplée : un VLM gestionnaire de tâches et un VLA exécuteur distincts. Le gestionnaire opère selon un principe de planification à horizon glissant (receding-horizon) : à chaque étape, il prédit un plan résiduel combinant une séquence de sous-tâches avec une séparation explicite "fait / restant" comme mémoire légère en langage naturel, et une trace visuelle, une trajectoire 2D de points-clés indiquant au bras où se déplacer et quel objet approcher. L'exécuteur VLA est ensuite conditionné sur cette trace rendue pour produire ses commandes motrices. Les expériences couvrent la planification incarnée, le raisonnement longue portée, la prédiction de trajectoire et la manipulation bout-en-bout, à la fois en simulation et sur un robot Franka réel, avec des gains annoncés en taux de succès, robustesse et généralisation hors distribution. Les métriques précises ne sont pas communiquées dans le préprint. Ce qui distingue LoHo-Manip des approches VLA classiques, c'est le bouclage implicite sans logique de récupération codée en dur : lorsqu'une sous-tâche échoue, elle reste dans le plan résiduel prédit au pas suivant, et la trace visuelle se met à jour automatiquement. Les modèles VLA actuels comme pi0 (Physical Intelligence) ou OpenVLA peinent sur les séquences multi-étapes en raison de l'accumulation d'erreurs d'exécution ; LoHo-Manip traite ce problème en transformant la prise de décision longue portée en une série de contrôles locaux guidés par trace. Pour un intégrateur industriel, cela ouvre la voie à des chaînes de manipulation complexes (assemblage séquentiel, tri multi-objets) sans reprogrammation manuelle à chaque point de défaillance, ce que les approches purement symboliques ne permettent pas sans pipeline rigide. Le problème de la manipulation longue portée est un obstacle structurel de la robotique VLA depuis l'émergence des modèles fondationnels en action, notamment après les travaux RT-2 de Google DeepMind (2023) et pi0 de Physical Intelligence (2024). La plupart des solutions actuelles combinent un planificateur symbolique haut niveau avec des primitives de bas niveau, au prix d'une rigidité importante face aux perturbations. LoHo-Manip adopte une voie intermédiaire en ancrant le plan dans une modalité visuelle légère (la trace 2D) plutôt que dans des primitives figées, ce qui est comparable dans l'esprit aux travaux de trajecto-conditioned diffusion de chez Nvidia (GR00T) ou de Cobot Magic. Il s'agit pour l'instant d'un preprint non relu par les pairs, validé sur un seul robot académique (Franka 7 DOF), sans déploiement industriel ni pilote annoncé. Les prochaines étapes crédibles passeraient par une validation sur des manipulateurs à plus haute redondance et des environnements moins structurés.

IA physiqueOpinion
1 source
IA stratifiée et topologique pour la coordination à longue portée (STALC)
4294arXiv cs.RO 

IA stratifiée et topologique pour la coordination à longue portée (STALC)

Une équipe de chercheurs propose STALC (Stratified Topological Autonomy for Long-Range Coordination), un système de planification hiérarchique pour la coordination de flottes de robots dans des environnements réels. Publié sur arXiv (identifiant 2503.10475, quatrième révision), le travail repose sur un planificateur en graphe combinant une carte topologique avec une formulation de programmation mixte en nombres entiers (MIP) conçue pour être computationnellement efficace. Le résultat revendiqué : des plans multi-robots fortement couplés générés en quelques secondes. Pour la validation locale, STALC s'appuie sur des planificateurs à horizon glissant (receding-horizon) assurant l'évitement de collision et le contrôle de formation. Le scénario de test retenu est une mission de reconnaissance multi-robots où les agents doivent se coordonner pour traverser un environnement tout en minimisant le risque de détection par des observateurs, avec des expériences menées à la fois en simulation et sur matériel réel. L'intérêt technique tient principalement à deux points. D'abord, résoudre un MIP en quelques secondes pour des flottes de robots est loin d'être trivial : la programmation mixte en nombres entiers est NP-difficile dans le cas général, et les approches existantes peinent à passer à l'échelle au-delà de quelques agents. L'architecture stratifiée de STALC, qui sépare la planification globale topologique de l'évitement de collision local, est précisément la clé permettant cette efficacité. Ensuite, la validation sur plateforme matérielle réelle, à partir de données du monde réel pour construire les graphes, distingue ce travail des contributions purement simulées qui dominent encore la littérature MAPF (Multi-Agent Path Finding). Pour un intégrateur ou un décideur B2B, cela signifie une architecture potentiellement déployable dans des contextes de sécurité, d'inspection ou de logistique d'entrepôt dense. STALC s'inscrit dans un champ de recherche actif où s'affrontent plusieurs paradigmes : les méthodes CBS (Conflict-Based Search) et ECBS côté planification centralisée, les approches décentralisées à base de champs de potentiel ou de ORCA pour l'évitement local. L'originalité de STALC est de proposer une hiérarchie explicite entre ces niveaux plutôt que de les traiter séparément. Le choix d'un scénario de reconnaissance à faible signature suggère une orientation défense ou applications critiques, cohérente avec l'intérêt croissant des agences de recherche pour les essaims robotiques autonomes. La quatrième révision du preprint indique un travail en cours de consolidation, probablement en route vers une soumission dans une conférence de référence comme ICRA ou IROS.

RecherchePaper
1 source
Conception conjointe pilotée par la tâche de systèmes multi-robots hétérogènes
4295arXiv cs.RO 

Conception conjointe pilotée par la tâche de systèmes multi-robots hétérogènes

Une équipe de recherche a publié sur arXiv (référence 2604.21894) un cadre formel pour la co-conception pilotée par les tâches de systèmes multi-robots hétérogènes. Le problème adressé est fondamental : concevoir une flotte robotique implique de prendre simultanément des décisions sur la morphologie des robots, la composition de la flotte (nombre, types), et les algorithmes de planification, trois domaines traditionnellement traités séparément. Le framework proposé repose sur la théorie de co-conception monotone, qui permet de modéliser robots, flottes, planificateurs et évaluateurs comme des problèmes de conception interconnectés avec des interfaces bien définies, indépendantes des implémentations spécifiques et des tâches cibles. Des séries d'études de cas illustrent l'intégration de nouveaux types de robots, de profils de tâches variés, et d'objectifs de perception probabilistes dans un seul pipeline d'optimisation. L'intérêt industriel tient à la promesse d'optimisation jointe avec garanties d'optimalité, ce que les approches séquentielles actuelles ne peuvent offrir. Pour un intégrateur système ou un COO déployant une flotte AMR dans un entrepôt, la question n'est jamais "quel robot est le meilleur seul" mais "quelle combinaison robot + planificateur + composition de flotte minimise le temps de cycle global sous contrainte budgétaire". Ce framework rend ce raisonnement formellement traçable, et les auteurs soulignent qu'il fait émerger des alternatives de conception non-intuitives que les méthodes ad hoc auraient manquées. La scalabilité et l'interprétabilité revendiquées restent à valider sur des déploiements réels à grande échelle, les résultats publiés restent des études de cas académiques. Ce travail s'inscrit dans un courant de recherche en robotique qui cherche à dépasser les silos disciplinaires : d'un côté la co-conception morphologique (ex : travaux MIT CSAIL sur la co-optimisation structure/contrôle), de l'autre les frameworks de planification multi-agents (ROS 2 Nav2, MoveIt Task Constructor). La théorie de co-conception monotone, développée notamment par Andrea Censi et Luca Carlone, constitue la base théorique. Ce papier étend cette base aux systèmes hétérogènes à grande échelle. Aucune timeline de transfert industriel n'est annoncée, mais le framework pourrait intéresser les éditeurs de logiciels de fleet management (Exotec, Intrinsic/Google, Siemens Xcelerator) comme couche de raisonnement amont à la configuration de flotte.

RecherchePaper
1 source
SLAM comme problème de contrôle stochastique à information partielle : solutions optimales et approximations rigoureuses
4296arXiv cs.RO 

SLAM comme problème de contrôle stochastique à information partielle : solutions optimales et approximations rigoureuses

Des chercheurs présentent sur arXiv (réf. 2604.21693, avril 2026) un cadre théorique qui reformule le SLAM actif comme un problème de contrôle stochastique optimal sous information partielle. Le SLAM (Simultaneous Localization and Mapping) désigne la capacité d'un robot à construire une carte de son environnement tout en s'y localisant simultanément, un problème fondamental en robotique mobile. Dans sa version "active", le robot doit en plus décider quels mouvements effectuer pour maximiser la qualité de sa carte et la précision de sa pose. Les auteurs formalisent ce problème sous la forme d'un processus de décision markovien partiellement observable (POMDP) non standard, intégrant de façon rigoureuse les modèles de mouvement, de perception et de représentation de la carte. Ils introduisent une nouvelle fonction de coût d'exploration qui encode explicitement la géométrie de l'état du robot au moment d'évaluer les actions de collecte d'information. À partir de cette formulation, ils dérivent des solutions approchées quasi-optimales avec garanties formelles. Une étude numérique extensive valide l'approche en utilisant des algorithmes d'apprentissage par renforcement standards pour apprendre ces politiques. L'intérêt principal de ce travail réside dans la rigueur théorique qu'il apporte à un domaine dominé par des heuristiques empiriques. La plupart des approches d'exploration autonome actuelles, qu'elles reposent sur les frontières d'exploration (frontier-based), la maximisation d'information mutuelle, ou des métriques ad hoc, manquent de garanties formelles sur la qualité des solutions produites. En reformulant le problème dans le cadre du contrôle stochastique optimal et des POMDPs, les auteurs fournissent des conditions de régularité et des bornes d'approximation qui permettent de certifier la quasi-optimalité des politiques apprises. Pour les équipes R&D travaillant sur des AMR (robots mobiles autonomes), des drones cartographiques ou des robots d'inspection industrielle, cette approche ouvre la voie à des algorithmes d'exploration dont le comportement est formellement auditable, ce qui est non trivial dans les contextes de certification. Le SLAM est un problème étudié depuis les années 1990, avec des approches classiques basées sur les filtres de Kalman étendus (EKF-SLAM) ou les filtres particulaires (FastSLAM), puis des méthodes graphiques comme ORB-SLAM3 ou RTAB-Map qui dominent aujourd'hui les implémentations industrielles. Les approches neuronales, comme les NeRF et Gaussian Splatting adaptés au SLAM temps réel, émergent en parallèle. Ce papier, encore préprint non évalué par les pairs, ne remplace pas ces implémentations mais propose un cadre décisionnel qui les surplombe. Les laboratoires actifs sur ces questions incluent MIT CSAIL, ETH Zurich (Autonomous Systems Lab) et l'équipe de Joan Solà. Les prochaines étapes naturelles seraient une validation expérimentale sur robot réel et une extension vers les environnements dynamiques, deux points non traités dans cette version arXiv.

RecherchePaper
1 source
ZipFold : des actionneurs modulaires pour des robots adaptatifs à grande échelle
4297arXiv cs.RO 

ZipFold : des actionneurs modulaires pour des robots adaptatifs à grande échelle

Des chercheurs ont publié en avril 2026 un préprint arXiv (référence 2604.05260v2) présentant ZipFold, un actionneur modulaire capable de transformer simultanément sa taille et sa rigidité par plissage et verrouillage de bandelettes plastiques imprimées en 3D. Le principe repose sur l'enroulement de ces bandelettes flexibles en poutres à section carrée : en position compacte, la structure reste souple et peu encombrante ; en position déployée, elle atteint un état quasi-rigide. La transition est continue, réversible, et ne requiert ni mécanisme hydraulique ni pneumatique. Un prototype intégrant quatre de ces modules a été démontré sous la forme d'un robot marcheur adaptatif capable de modifier dynamiquement sa démarche en ajustant la rigidité de ses membres en temps réel. Le principal intérêt de ZipFold réside dans sa généricité : contrairement aux actionneurs à rigidité variable existants, généralement conçus sur-mesure pour un usage précis et difficilement réutilisables dans un autre contexte, cette brique modulaire peut être assemblée en configurations arbitraires. La fabrication par impression 3D de plastique flexible abaisse le seuil d'entrée pour les équipes de recherche et les petits intégrateurs, sans nécessiter de chaîne d'approvisionnement spécialisée. Pour des systèmes robotiques opérant dans des environnements changeants (logistique, inspection, rééducation), la capacité à modifier le comportement mécanique sans reconfiguration matérielle représente un avantage opérationnel concret. Il faut toutefois tempérer : le papier est un préprint académique sans benchmarks comparatifs publiés face aux alternatives existantes, et les performances annoncées (rigidité atteinte, charge utile, nombre de cycles) restent à valider sur des durées et des conditions représentatives. Le problème de la rigidité variable mobilise la communauté robotique depuis des décennies : les approches pneumatiques (jamming de particules, muscles McKibben), les alliages à mémoire de forme (SMA) et les câbles antagonistes dominent aujourd'hui, mais chacun achoppe sur des compromis entre vitesse de commutation, encombrement et complexité d'intégration. ZipFold se positionne sur le créneau de la modularité fabricatoire, un espace encore peu occupé par des solutions génériques et bas-coût. Le préprint ne mentionne ni partenaire industriel ni calendrier de transfert technologique ; les prochaines étapes attendues incluent des tests de charge, des essais en endurance cyclique, ainsi qu'une démonstration sur des morphologies plus complexes que le marcheur quadrimodulaire actuel.

RecherchePaper
1 source
Du bruit à l'intention : ancrage des politiques VLA génératives par ponts résiduels
4298arXiv cs.RO 

Du bruit à l'intention : ancrage des politiques VLA génératives par ponts résiduels

Un préprint déposé le 24 avril 2026 sur arXiv (réf. 2604.21391) présente ResVLA, une nouvelle architecture de politique VLA (Vision-Language-Action) pour le contrôle robotique. Le problème ciblé est le décalage spatiotemporel entre compréhension sémantique de haut niveau et contrôle physique de bas niveau : les VLA actuels génèrent des actions directement "à partir du bruit" (paradigme Generation-from-Noise), produisant une inefficacité de représentation et un alignement faible avec les instructions. ResVLA bascule vers un paradigme "Refinement-from-Intent" : via une analyse spectrale, le mouvement robotique est décomposé en une composante déterministe basse fréquence (l'intention globale) et une composante stochastique haute fréquence (la dynamique locale). Un pont de diffusion résiduel affine ensuite uniquement cette dynamique locale, ancré sur l'intention prédite. Les résultats déclarés incluent une convergence plus rapide que les baselines génératives standards, une robustesse aux perturbations linguistiques et aux variations d'embodiment, et des performances validées en conditions réelles, bien que le papier ne précise pas les plateformes matérielles testées ni les métriques exactes de déploiement physique. Ce travail s'attaque à une limite structurelle des VLA génératifs : ignorer la hiérarchie naturelle du mouvement nuit à l'alignement entre instruction et action. La robustesse à l'embodiment est un point concret pour les intégrateurs travaillant sur des flottes robotiques hétérogènes, où réentraîner un modèle complet par plateforme représente un coût prohibitif. La validation partielle en conditions réelles renforce la crédibilité de l'approche, même si l'absence de métriques détaillées (taux de succès par tâche, temps de cycle, nombre de démos d'entraînement) invite à la prudence avant d'extrapoler les résultats de simulation vers des déploiements industriels. Ce préprint s'inscrit dans une dynamique de recherche intense autour des VLA généralistes. Pi-0 de Physical Intelligence, OpenVLA (UC Berkeley) et les travaux RT-2 de Google DeepMind constituent les références immédiates du domaine. L'approche par résidu spectral est conceptuellement distincte des architectures de diffusion uniformes, mais ResVLA reste une contribution académique sans code public ni produit annoncé. La prochaine étape sera de voir si l'approche se confirme sur des benchmarks partagés comme LIBERO ou BridgeData V2, et si elle influence des frameworks ouverts comme LeRobot de Hugging Face, qui fédère une partie importante de la communauté robotique open-source.

RechercheOpinion
1 source
Scensory : perception olfactive robotique en temps réel pour l'identification conjointe et la localisation de source
4299arXiv cs.RO 

Scensory : perception olfactive robotique en temps réel pour l'identification conjointe et la localisation de source

Des chercheurs ont publié sur arXiv (référence 2509.19318, version révisée en 2026) un système baptisé Scensory, conçu pour doter les robots d'une capacité olfactive temps réel appliquée à la détection de contaminations fongiques en intérieur. Le framework repose sur des réseaux de capteurs VOC (composés organiques volatils) bon marché et à sensibilité croisée, couplés à des réseaux de neurones capables d'analyser de courtes séries temporelles de 3 à 7 secondes. Sur un panel de cinq espèces fongiques testées en conditions ambiantes, Scensory atteint 89,85 % de précision pour l'identification de l'espèce et 87,31 % pour la localisation de la source. Les deux tâches sont résolues simultanément, à partir d'un même flux de données capteurs. Ce résultat est techniquement significatif parce que les signaux chimiques en diffusion libre sont particulièrement difficiles à exploiter : contrairement à la vision ou au toucher, où le signal est directionnel et localisé, les panaches olfactifs se dispersent de manière stochastique selon les flux d'air ambiants. Que des capteurs VOC grand public, combinés à un apprentissage supervisé sur données collectées automatiquement par le robot, permettent de relier dynamique temporelle du signal et position spatiale de la source change l'équation économique du nez électronique embarqué. Jusqu'ici, la perception chimique robotique supposait soit des capteurs spécialisés coûteux, soit des conditions contrôlées de laboratoire. Scensory suggère qu'une approche data-driven sur matériel accessible peut combler une partie de ce fossé. Le domaine de l'olfaction robotique reste nettement en retard sur la vision et la manipulation, malgré des travaux académiques réguliers depuis les années 2000 sur les nez électroniques (e-nose) et la navigation par gradient chimique. Les applications visées par Scensory, inspection de bâtiments, monitoring environnemental indoor, contrôle qualité alimentaire, n'ont pas encore de solution robotique commerciale établie. Le papier reste un résultat académique sur arXiv sans déploiement annoncé ni partenaire industriel identifié ; les performances reportées devront être validées sur un spectre élargi d'espèces, de conditions d'humidité et de géométries de pièce avant d'envisager une intégration produit.

RecherchePaper
1 source
RPG : commutation robuste de politiques pour des transitions fluides entre compétences en combat humanoïde
4300arXiv cs.RO 

RPG : commutation robuste de politiques pour des transitions fluides entre compétences en combat humanoïde

Une équipe de chercheurs a publié le 21 avril 2026 sur arXiv (2604.21355) un framework baptisé RPG (Robust Policy Gating), conçu pour permettre à des robots humanoïdes d'enchaîner plusieurs compétences de combat dynamique sans instabilité. L'approche repose sur une politique unifiée entraînée avec deux mécanismes de randomisation : la randomisation des transitions de mouvement, qui expose la politique à des états initiaux et terminaux variés entre compétences, et la randomisation temporelle, qui rend l'agent robuste aux coupures imprévises dans la séquence de mouvements. La pipeline de contrôle intègre la locomotion (marche, course) avec les compétences de combat, permettant théoriquement des séquences de durée arbitraire. Le système a été validé en simulation extensive, puis déployé sur le robot humanoïde Unitree G1, la plateforme à 23 DDL du constructeur chinois Unitree Robotics. Le problème central que RPG adresse est connu dans le domaine sous le nom de "skill transition gap" : lorsqu'un agent bascule d'une politique spécialisée à une autre, les états terminaux de la première ne correspondent pas aux états initiaux supposés de la seconde, produisant des comportements hors domaine, des chutes ou des mouvements saccadés. Les approches concurrentes utilisent soit une commutation entre politiques mono-compétence, soit une politique généraliste qui imite des motion clips de référence -- les deux souffrent de ce décalage. RPG propose une solution d'entraînement plutôt que d'architecture, ce qui est notable : la robustesse aux transitions est injectée pendant la phase d'apprentissage, pas via un mécanisme de gating à l'inférence. L'absence de métriques quantitatives dans la publication (temps de cycle, taux de chute, nombre de transitions testées) limite cependant la comparaison directe avec d'autres travaux. RPG s'inscrit dans une vague active de recherche sur le contrôle corps entier des humanoïdes pour des tâches hautement dynamiques, un domaine où les laboratoires UCB, CMU et Stanford publient régulièrement depuis 2023. L'utilisation du G1 comme plateforme de validation est cohérente avec sa popularité croissante en recherche académique, notamment grâce à son coût inférieur à celui des plateformes concurrentes (Boston Dynamics Atlas, Agility Digit). Sur le plan commercial, des acteurs comme Figure AI, 1X Technologies ou Apptronik ciblent des tâches répétitives en entrepôt plutôt que le combat, mais les techniques de transition de compétences développées ici sont directement transposables aux scénarios industriels nécessitant des enchaînements fluides de manipulation et de locomotion. La prochaine étape naturelle serait une évaluation quantitative en conditions adversariales réelles, ainsi qu'un transfert vers des tâches moins "spectaculaires" mais plus proches du déploiement B2B.

RecherchePaper
1 source