Aller au contenu principal

Actualités robotique — page 63

4 571 articles au fil, du plus récent au plus ancien.

Main dextérique joueuse de piano : deux minutes de pratique suffisent pour apprendre les notes
3101Interesting Engineering 

Main dextérique joueuse de piano : deux minutes de pratique suffisent pour apprendre les notes

Des chercheurs de l'Université de Californie du Sud (USC Viterbi) ont présenté la "Musician Hand", une main robotique à quatre doigts actionnée par tendons et moteurs électriques, capable de reproduire une mélodie inconnue après seulement deux minutes d'exploration autonome. Le processus s'appelle "motor babbling" : pendant 120 secondes, la main tapote aléatoirement les touches du piano, enregistrant simultanément les sons produits et les mouvements correspondants. Un réseau de neurones établit ensuite la cartographie audio-motrice. Résultat : lors d'un premier essai sans correction en temps réel, la main a restitué fidèlement une mélodie de 30 notes entièrement nouvelle. Lors d'une audition en aveugle, des juges musicaux n'ont pas toujours réussi à distinguer son jeu de celui de quatre pianistes humains. L'étude est publiée dans le Journal of the Royal Society Interface, sous la direction de Francisco Valero-Cuevas, professeur de génie biomédical et mécanique à USC. Ce système illustre une rupture méthodologique avec l'orthodoxie robotique dominante, qui suppose qu'un agent a besoin de données massives et d'une modélisation précise de son environnement pour agir efficacement. La "Musician Hand" fonctionne à rebours : elle perçoit, infère et s'adapte, à la manière d'un animal ou d'un nourrisson humain. Cette approche, baptisée "robotique perceptuelle" par ses créateurs, ouvre la voie à des systèmes capables d'auto-calibration rapide dans des environnements non contrôlés, sans intervention d'un ingénieur. Pour les intégrateurs et concepteurs de robots collaboratifs, c'est une démonstration de principe importante : le coût d'apprentissage d'une nouvelle tâche motrice peut tomber à quelques minutes sur un simple laptop, là où les pipelines classiques exigent des semaines de collecte de données et d'annotation. Il convient néanmoins de noter que la démonstration reste un proof-of-concept dans un environnement très contrôlé, et qu'aucune performance en conditions industrielles réelles n'a encore été publiée. L'équipe USC ne vise pas le marché du divertissement mais la médecine. L'application cible principale est l'assistance aux patients atteints de maladies neurodégénératives progressives comme Parkinson : contrairement aux exosquelettes actuels, rigidement préprogrammés, un dispositif basé sur ce framework pourrait apprendre la signature motrice personnelle d'un patient dès le diagnostic, puis évoluer avec lui à mesure que sa condition se dégrade, sans reprogrammation. D'autres pistes sont évoquées : rééducation post-AVC, assistance aux personnes âgées, voire collaboration avec des ouvriers du bâtiment. Sur le plan concurrentiel, l'approche se distingue des travaux de laboratoires comme Boston Dynamics, Figure AI ou 1X, qui s'appuient majoritairement sur l'imitation à grande échelle (imitation learning, VLA) et des datasets conséquents. Le groupe USC n'a pas annoncé de partenaires industriels ni de timeline de commercialisation à ce stade.

RecherchePaper
1 source
Cette startup IA nettoie votre maison gratuitement pour entraîner ses futurs robots
3102The Verge 

Cette startup IA nettoie votre maison gratuitement pour entraîner ses futurs robots

La startup américaine Shift a annoncé jeudi sur les réseaux sociaux un programme inédit : le nettoyage gratuit de domiciles en échange de données d'entraînement pour robots. Le principe est simple, Shift envoie des agents de ménage équipés de caméras qui filment chaque geste : aspiration, dépoussiérage, lavage de vitres, rangement. Ces vidéos constituent le dataset comportemental que la société utilise pour entraîner ses modèles robotiques. Shift justifie l'économie du deal sur son site : "Vous obtenez un appartement impeccable. Nous obtenons des données d'entraînement. Tout le monde y gagne." Aucun prix de revient ni volume de déploiements n'a été communiqué à ce stade. Ce modèle économique inversé illustre une tension structurelle du secteur : collecter des données de manipulation en environnement domestique réel reste l'un des goulets d'étranglement les plus coûteux pour entraîner des robots polyvalents. Les espaces domestiques sont non structurés, imprévisibles et très variés, exactement ce qui fait défaut aux datasets synthétiques ou aux environnements d'entrepôt contrôlés. Si Shift valide que la valeur des données couvre effectivement le coût opérationnel des interventions, ce modèle pourrait devenir un template pour d'autres acteurs cherchant à scaler la collecte de données en monde réel sans financement massif en propre. Shift s'inscrit dans une vague de startups spécialisées dans la collecte de données robotiques, en concurrence avec des initiatives comme celles de Physical Intelligence (pi0) ou les programmes internes de Figure et 1X. La stratégie rappelle aussi les approches de crowdsourcing adoptées dans l'autonome (dashcams, flottes instrumentées). L'équipement porté par les agents, notamment un casque visiblement encombrant visible dans la vidéo promotionnelle, suggère un dispositif de capture multi-angle encore en phase de prototypage. Aucun partenariat industriel ni timeline de produit n'a été annoncé.

IA physiqueOpinion
1 source
Robot Talk épisode 158 : livraisons autonomes par robot, avec Ahti Heinla
3103Robohub 

Robot Talk épisode 158 : livraisons autonomes par robot, avec Ahti Heinla

Starship Technologies a franchi le cap des 10 millions de livraisons autonomes réalisées par une flotte de plus de 2 700 robots terrestres déployés sur voies publiques et trottoirs. Ces engins à six roues, pilotés par des algorithmes d'IA embarquée, opèrent sans intervention humaine dans des environnements urbains réels, par toutes conditions météorologiques et en présence de piétons. La société, cofondée par Ahti Heinla, l'un des ingénieurs originaux derrière Skype, s'est imposée comme le principal acteur mondial du segment livraison autonome de dernier kilomètre. Ce volume de 10 millions de livraisons constitue un signal concret de résolution partielle du fossé démo-réalité qui plombe depuis des années les promesses de la robotique de service. Pour un décideur B2B ou un intégrateur logistique, c'est la preuve qu'un déploiement à l'échelle est techniquement viable sans superviseur dédié par robot, ce qui change fondamentalement l'économie unitaire du service. Le modèle Starship challenge directement les hypothèses des acteurs de la livraison par drone ou par véhicule autonome de taille véhicule, en privilégiant un format compact, peu coûteux et opérant exclusivement en zone piétonne. Heinla, après avoir construit Skype en tant qu'ingénieur fondateur jusqu'à son rachat par Microsoft pour 8,5 milliards de dollars en 2011, a pivoté vers la robotique grand public il y a une décennie. Starship affronte une concurrence structurée : Nuro aux États-Unis sur le segment véhicule, Kiwibot sur les campus universitaires, et Amazon Scout aujourd'hui suspendu. Le podcast Robot Talk Episode 158 diffuse l'échange complet avec Heinla, mais l'épisode ne dévoile pas de nouvelle annonce produit ou de timeline d'expansion géographique précise.

IndustrielActu
1 source
Le robot humanoïde LeRobot de Hugging Face à 2 500 dollars rend la robotique imprimée en 3D accessible
3104Interesting Engineering 

Le robot humanoïde LeRobot de Hugging Face à 2 500 dollars rend la robotique imprimée en 3D accessible

Hugging Face a dévoilé LeRobot Humanoid, une plateforme bipedale open-source entièrement imprimable en 3D évaluée à environ 2 500 dollars en composants, soit un facteur 40 à 100 en dessous des systèmes humanoïdes commerciaux habituels. Le kit publié comprend des fichiers mécaniques imprimables, une liste de matériaux complète, des instructions d'assemblage et de câblage, ainsi que des outils de configuration moteur. Dans sa version initiale, le robot se limite à la locomotion du bas du corps : station debout, marche expérimentale, calibration et test de politiques de locomotion par renforcement. Les composants structurels sont remplaçables à la demande, ce qui permet une itération matérielle rapide sans reconstruire l'ensemble du système. La plateforme s'intègre au framework LeRobot-legged-zoo avec des environnements de simulation MJLab, et inclut un pipeline sim-to-real : les données collectées sur le robot physique sont rejouées en simulation pour affiner les paramètres du modèle et améliorer la fiabilité du transfert de politique. Un workflow de conception orienté contrôle permet en outre de valider des stratégies d'équilibre sur des représentations simplifiées avant de finaliser la géométrie mécanique, réduisant les coûts de développement en amont. Ce projet représente un changement de repère concret pour les laboratoires universitaires et les petites équipes de R&D en robotique bipedale. Le seuil d'entrée à 2 500 dollars contraste avec les plateformes humanoïdes commerciales comme l'Optimus Gen 2 de Tesla, le Figure 03 ou l'Atlas de Boston Dynamics, dont les coûts dépassent largement les 100 000 dollars et dont l'accès reste conditionné à des partenariats industriels sélectifs. En rendant le matériel reproductible et le workflow sim-to-real accessible, Hugging Face permet des cycles d'itération hardware bien plus courts, une hypothèse centrale de la robotique académique que peu d'acteurs avaient traduite en produit à ce prix. Il faut cependant noter que les performances de locomotion annoncées restent à valider indépendamment : aucune métrique de vitesse de marche, de cycle time ou de robustesse aux perturbations n'est communiquée dans la documentation publiée, ce qui place le projet davantage du côté plateforme d'expérimentation que système opérationnel validé. Ce lancement s'inscrit dans la stratégie hardware d'Hugging Face, initiée en avril 2025 avec l'acquisition de Pollen Robotics, startup bordelaise créatrice du robot humanoïde open-source Reachy 2. C'est la première incursion de l'entreprise new-yorkaise dans le matériel physique, et elle se fait via un acteur français dont l'expertise en robotique open-source est établie depuis plusieurs années. L'objectif déclaré est de construire un écosystème complet combinant matériel, simulation, outils logiciels et systèmes d'entraînement, en miroir de ce que la bibliothèque LeRobot représente déjà pour les bras manipulateurs low-cost. Face à des acteurs comme Unitree Robotics, qui propose déjà le G1 à moins de 20 000 dollars, ou à Agility Robotics et Apptronik qui ciblent des déploiements industriels à grande échelle, Hugging Face se positionne clairement sur le segment recherche et prototypage. L'intégration du haut du corps et les capacités de manipulation complète restent inscrites dans la feuille de route sans date précise, ce qui signifie que la plateforme est pour l'instant un outil de locomotion, pas encore un humanoïde complet.

FR/EU ecosystemeOpinion
1 source
Xynova lève des centaines de millions en Série A pour sa main dextérique Flex2
3105Pandaily 

Xynova lève des centaines de millions en Série A pour sa main dextérique Flex2

Xynova, startup chinoise spécialisée dans la manipulation dextre, a bouclé un tour de série A de plusieurs centaines de millions de yuans, co-piloté par le fonds corporate de Li Auto, CITIC Securities Capital et CITIC Securities Investment, avec la participation du Yangtze River Delta Digital Culture Group, du Yuanjia Fund, et la continuité d'investisseurs historiques dont le fonds corporate de Xiaomi, Caifu Capital et Dianji Fund. Fondée fin 2024, la société accumule ainsi près d'un milliard de yuans de financement total (environ 125 millions d'euros), ce qui la positionne parmi les premiers acteurs du segment des mains dextres en Chine. Son produit phare, la main dextre Flex2, est conçue pour des tâches de manipulation à haut nombre de degrés de liberté, mais l'entreprise n'a publié aucune métrique technique précise (DOF, payload, temps de cycle) dans ce communiqué, ce qui limite l'évaluation indépendante des performances. La composition du tour est aussi significative que son montant. L'entrée de constructeurs automobiles comme Li Auto et Xiaomi indique que les mains dextres sont désormais perçues comme un composant critique pour le déploiement de robots embodied AI, tant dans la fabrication industrielle fine que dans les robots de service domestique. La présence de grandes banques d'investissement en position de lead signal une transition : le segment sort de la phase early-risk et entre dans la cible d'allocation des institutionnels mainstream. Enfin, la participation de capitaux publics régionaux de la zone du Delta du Yangtze traduit une volonté gouvernementale de faire de la main dextre un nœud stratégique de la supply chain robotique, en capitalisant sur les clusters manufacturiers locaux. Xynova se positionne comme fournisseur full-stack de capacités de manipulation dextre, intégrant hardware (la main), architecture d'exécution (coordination bras-main), et algorithmes de contrôle moteur de bas niveau (ce que l'entreprise nomme "contrôle cérébelleux"), formant une boucle fermée perception-contrôle-décision. Son CEO, Xia Yuxuan, double diplômé en physique et informatique, a une trajectoire atypique mêlant recherche académique et capital-risque en hardtech et robotique. Sur un marché des mains dextres de plus en plus encombré, Xynova est en compétition directe avec des acteurs comme Inspire Robots, DexHand ou les équipes en interne chez Figure et Agility Robotics côté occidental, et plusieurs startups chinoises non-divulguées. Les prochaines étapes annoncées par la société portent sur l'accélération du développement produit et de la capacité de fabrication, sans calendrier précis communiqué.

Chine/AsieOpinion
1 source
X-Square Robot dévoile WALL-WM, le premier modèle du monde à IA incarnée avec prédiction au niveau événementiel
3106Pandaily 

X-Square Robot dévoile WALL-WM, le premier modèle du monde à IA incarnée avec prédiction au niveau événementiel

La startup chinoise X-Square Robot, connue pour sa série GreatWall de modèles de fondation robotiques, publie WALL-WM, présenté comme le premier world model à prédiction par événements sémantiques pour la robotique incarnée. Le papier associé, "WALL-WM: Carving World Action Modeling at the Event Joints", décrit une architecture en trois couches : une couche d'entrée d'instructions d'événements, une couche de prédiction centrale utilisant l'optimiseur Muon distribué (DMuon) pour une meilleure stabilité de convergence, et une stratégie de packing multi-événements réduisant les pertes de calcul lors de l'entraînement. Sur les benchmarks de génération vidéo incarnée, WALL-WM surpasse Wan2.1-14B et Open-Sora 2.0 sur qualité de mouvement, cohérence sémantique et plausibilité physique. Sur le benchmark Core15 L1, il dépasse Pi0.5 de Physical Intelligence et DreamZero sur les tâches de base, raisonnement, manipulation dextre et généralisation sous instruction abstraite. L'intérêt technique réside dans un changement de paradigme pour les modèles d'action. Les architectures VLA dominantes prédisent des chunks d'actions à intervalles fixes, où sera la main du robot dans 0.1, 0.2, 0.3 secondes, ce qui force le modèle à mémoriser des déplacements millimétriques par frame plutôt qu'à comprendre l'objectif sémantique ("saisir la tasse"). Cette fragilité structurelle signifie qu'un changement d'objet ou de surface suffit à faire échouer le modèle. WALL-WM prédit directement l'état cible, c'est-à-dire le moment de la saisie, puis génère synchroniquement la séquence d'actions pour y parvenir. Le papier identifie par ailleurs un problème architectural fondamental : texte, vision et action opèrent sur des géométries de manifold distinctes, et leur projection directe dans un espace latent partagé dégrade les représentations préentraînées, un défaut que l'architecture cherche à corriger via ses trois couches spécialisées. X-Square Robot s'inscrit dans la course des laboratoires chinois aux fondations VLA et world models, aux côtés d'Unitree, Fourier Intelligence et Agibot. Les benchmarks publiés visent directement Physical Intelligence (Pi0.5) et ses homologues américains comme Figure AI. Il faut toutefois souligner que WALL-WM reste, à ce stade, une publication de recherche sans déploiement commercial ni pilote industriel annoncé. Les performances sur benchmark L1 ne préjugent pas des résultats en conditions réelles, où l'éclairage variable, la déformation des objets et les perturbations de contact constituent le vrai test de la généralisation sim-to-real. Aucune timeline de productisation n'est mentionnée dans l'annonce.

IA physiqueOpinion
1 source
PhAIL : un benchmark VLA sur robots réels et une méthodologie distributionnelle
3107arXiv cs.RO 

PhAIL : un benchmark VLA sur robots réels et une méthodologie distributionnelle

PhAIL (Physical AI Leaderboard, phail.ai) est un benchmark open-source présenté sur arXiv (arXiv:2605.29710) qui évalue des politiques VLA (vision-language-action) sur un bras Franka FR3 en conditions réelles. Le protocole remplace le traditionnel taux de succès binaire à timeout fixe par une méthodologie distributionnelle centrée sur la fonction de distribution cumulative du temps-avant-succès (CDF). Deux outils distincts structurent l'évaluation : un score nommé Human-Relative Throughput (HRT), grandeur sans dimension avec intervalles de confiance bootstrap, ancré à la téléopération humaine sur le même équipement ; et un test de significativité Kolmogorov-Smirnov calculé par objet puis macro-moyenné. Le benchmark a été appliqué à quatre VLAs publiques, dont GR00T (NVIDIA), ACT et OpenPI, avec jusqu'à 30 rollouts par cellule (modèle x objet). Résultat central : le meilleur VLA évalué reste environ sept fois plus lent par opération que la référence humaine, mesuré via le ratio RMST. L'enjeu est méthodologique autant que technique. L'état de l'art en évaluation VLA repose presque universellement sur un taux de succès à timeout fixe avec N inférieur ou égal à 25 rollouts et sans intervalles de confiance, ce qui rend les comparaisons proches statistiquement non résolvables. PhAIL démontre que le test KS macro-moyenné tranche deux paires proches (GR00T vs. ACT, OpenPI vs. ACT) là où les métriques binaires échouent, toujours à N inférieur ou égal à 30 rollouts. La paire la plus serrée, OpenPI vs. GR00T, reste irrésolue dans le budget expérimental alloué. Le facteur sept entre humain et meilleur VLA constitue un point d'ancrage concret pour les intégrateurs et décideurs industriels qui doivent arbitrer entre performance annoncée et réalité opérationnelle. La publication s'inscrit dans un effort de standardisation comparable à ce qu'ImageNet ou GLUE ont accompli pour la vision par ordinateur et le traitement du langage naturel. Le champ VLA manquait d'un protocole reproductible et statistiquement rigoureux, rendant les comparaisons entre Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA), OpenPI ou les architectures propriétaires de Figure et Boston Dynamics difficiles à interpréter. Le Franka FR3, très répandu en recherche académique, sert de plateforme de référence, et le benchmark est entièrement ouvert : dataset, artefacts par rollout et implémentation de bout en bout disponibles sur phail.ai. Les prochaines étapes naturelles incluent l'extension à d'autres plateformes matérielles, à des tâches bimanuelles ou de manipulation complexe, et l'intégration de VLAs propriétaires dans le protocole.

IA physiqueOpinion
1 source
Contrôle des robots humanoïdes avec conscience de la force pour les mains multidoigts
3108arXiv cs.RO 

Contrôle des robots humanoïdes avec conscience de la force pour les mains multidoigts

Des chercheurs de l'Istituto Italiano di Tecnologia (IIT, Gênes) ont publié sur arXiv (2603.08142v2) un framework de contrôle force-aware pour mains multi-doigts sur robots humanoïdes. Le système exploite cinq capteurs magnétiques Xela pour estimer les forces de contact en temps réel, sans recourir aux signaux tactiles bruts. Un dataset de signaux tactiles couplés à des mesures de force ground-truth a été constitué via des interactions avec des indenters calibrés, puis utilisé pour entraîner des estimateurs de force. Le contrôleur résultant coordonne simultanément le torse, le bras, le poignet et les doigts pour redistribuer les forces de contact et maintenir une prise stable sur des objets à distribution de masse variable. Sur une tâche d'équilibrage impliquant cinq objets distincts, le framework atteint 82,7 % de taux de succès, et 80 % de précision dans des scénarios multi-objets. L'approche est notable car elle s'appuie sur des forces estimées plutôt que sur des signaux capteurs spécifiques, ce qui la rend théoriquement transférable à tout capteur capable de produire une estimation de force, sans recalibration du contrôleur. Le noeud technique central est la minimisation de la distance entre le Centre de Pression (CoP) et le centroïde du polygone de contact des doigts, un critère classique de stabilité de prise en mécanique du contact. Ce choix de critère explicite, couplé à un schéma de contrôle model-based, contraste avec les approches purement apprentissage (VLA, imitation learning) dominantes dans les humanoïdes commerciaux actuels, où l'interprétabilité de la commande reste limitée. Pour les intégrateurs industriels, c'est un signal que le sim-to-real pour la manipulation dextre peut passer par des architectures hybrides capteur-modèle plutôt que par du bout-en-bout. L'IIT est l'un des laboratoires européens les plus actifs en robotique humanoïde, connu notamment pour le robot iCub et ses travaux fondateurs sur la manipulation dextre et la peau artificielle. Ce travail s'inscrit dans la lignée de recherches sur le contrôle de contact multi-doigts, un domaine où des acteurs comme Shadow Robot (UK), Sanctuary AI (Canada) ou Agility Robotics (USA) progressent également, mais via des stacks propriétaires moins publiés. Le code et les données sont disponibles en open source sur GitHub (hsp-iit/multifingered-force-aware-control), ce qui facilite la reproduction et l'adaptation. Les prochaines étapes naturelles seraient une validation sur des scénarios d'assemblage réels et une intégration avec des politiques de plus haut niveau pour la planification de saisie.

FR/EU ecosystemePaper
1 source
RoboWits : les défis inattendus de la résolution créative de problèmes en robotique
3109arXiv cs.RO 

RoboWits : les défis inattendus de la résolution créative de problèmes en robotique

Des chercheurs de l'Université du Massachusetts Amherst viennent de publier RoboWits, un nouveau benchmark robotique bimanuel centré sur la résolution créative de problèmes en conditions dégradées ou inattendues. Le jeu de données comprend 30 tâches de base et 208 tâches générées par mutation, réparties sur trois axes de difficulté progressive : raisonnement géométrique, propriétés des matériaux, et assemblage d'objets. Pour construire ces scénarios à grande échelle sans supervision manuelle, l'équipe a développé un pipeline de génération automatique structuré comme un framework multi-agents coopératifs, avec des agents distincts chargés de la génération de tâches initiales, de la vérification, de la génération de métriques, de la mise en scène et de la mutation. Les politiques robotiques classiques, les VLA (Vision-Language-Action models) pré-entraînés et des planificateurs oracle à état complet ont été mis en compétition sur ce corpus. Les résultats pointent un écart de performance préoccupant pour l'industrie : les VLA pré-entraînés obtiennent des résultats préliminaires acceptables sur les tâches de base après fine-tuning mono-tâche, mais s'effondrent dès que les conditions changent via mutation. Cela confirme empiriquement une fragilité que beaucoup soupçonnaient sans pouvoir la quantifier : ces modèles généralisent mal à des configurations légèrement différentes de celles vues à l'entraînement, qu'il s'agisse d'obstacles inattendus, de contraintes géométriques modifiées, ou d'environnements conçus pour tromper. Pour un COO industriel ou un intégrateur, c'est un signal clair : les VLA actuels ne sont pas prêts pour des déploiements en production où les conditions varient librement. Le benchmark s'inscrit dans une critique croissante des évaluations robotiques dominantes, qui mesurent principalement l'exécution de skills isolés (manipulation standard, saisie d'objets) sans tester l'adaptation cognitive. Des benchmarks comme LIBERO ou RLBench restent centrés sur la répétabilité dans des environnements contrôlés. RoboWits tente de combler ce fossé en introduisant le concept de "unexpected challenge", proche des conditions réelles en logistique ou en manufacture. L'équipe UMass publie le code et le pipeline de génération, ce qui pourrait permettre à d'autres laboratoires, y compris européens, d'étendre le corpus. La prochaine étape attendue est l'intégration de modèles de raisonnement symbolique hybrides pour tester si l'ajout d'un planificateur explicite corrige la brittleness observée.

RechercheOpinion
1 source
ElegantVLA : apprendre quand raisonner pour des modèles vision-langage-action (VLA) efficaces
3110arXiv cs.RO 

ElegantVLA : apprendre quand raisonner pour des modèles vision-langage-action (VLA) efficaces

Une équipe de chercheurs a publié le 29 mai 2026 un article préprint sur arXiv (2605.29438) présentant ElegantVLA, un cadre d'inférence adaptatif conçu pour accélérer les modèles de type Vision-Language-Action (VLA) sans modifier ni réentraîner le modèle de base. Le principe repose sur un ordonnanceur léger qui observe en temps réel la similarité des représentations temporelles, les signaux de mouvement du robot et la progression de l'épisode, puis alloue dynamiquement la charge de calcul entre l'encodeur visuel, le LLM et la tête d'action. Deux niveaux de granularité sont gérés : cinq modes de calcul Vision-LLM, allant de la recomputation complète à la réutilisation temporelle multi-pas, et trois modes de débruitage pour la génération d'actions, qui recyclent les états intermédiaires lors des phases de mouvement stable. Sur le modèle GR00T de NVIDIA sur six tâches réelles, ElegantVLA réduit la charge de calcul d'un facteur 2,18x et fait passer la fréquence de contrôle de 13,8 Hz à 26,3 Hz ; sur CogACT, le gain en vitesse atteint 3,77x. L'enjeu est direct pour les équipes qui cherchent à déployer des VLA en manipulation réelle : la fréquence de contrôle est un goulot d'étranglement critique dans les tâches nécessitant une réactivité fine, et doubler cette fréquence sans retoucher le modèle sous-jacent change fondamentalement le rapport coût-performance du déploiement. Le résultat contredit partiellement l'hypothèse dominante selon laquelle accélérer un VLA impose obligatoirement un compromis sur la qualité du raisonnement : en concentrant la puissance de calcul sur les phases sensibles aux objectifs, à l'image du contrôle moteur humain, le système préserve la précision là où elle compte. C'est un argument concret en faveur de l'inférence adaptative plutôt que des modèles distillés ou quantifiés à la hache. Les VLA généralistss comme GR00T (NVIDIA) ou CogACT (Microsoft Research) souffrent structurellement d'un coût d'inférence élevé dû à l'empilement d'un backbone vision-langage massif et d'une tête d'action itérative à chaque pas de contrôle. Les approches existantes d'accélération, élagage, distillation, cache KV statique, traitent tous les pas de contrôle de façon uniforme, ignorant que les besoins en raisonnement varient fortement au cours d'un épisode. ElegantVLA se positionne comme une surcouche plug-in compatible avec l'ensemble de l'écosystème VLA moderne, sans modifier les pipelines d'entraînement. La prochaine étape naturelle sera de valider l'approche sur des tâches longue durée et des environnements non structurés, là où la variabilité des phases est maximale et où le gain potentiel est le plus difficile à quantifier.

IA physiqueOpinion
1 source
Une architecture hétérogène pour l'apprentissage par renforcement robotique au-delà des paradigmes dominés par les GPU
3111arXiv cs.RO 

Une architecture hétérogène pour l'apprentissage par renforcement robotique au-delà des paradigmes dominés par les GPU

Une équipe de chercheurs a publié le 29 mai 2026 UniLab, un système d'entraînement pour le reinforcement learning (RL) robotique qui repose sur une architecture hétérogène : simulation physique sur CPU en parallèle, apprentissage de politique sur GPU. Contrairement aux pipelines dominants qui concentrent physique, collecte de trajectoires et optimisation sur un unique chemin GPU (approche popularisée par Isaac Gym, IsaacLab ou Genesis), UniLab dissocie ces deux phases via un runtime unifié gérant le transfert de données, le buffering et la synchronisation entre unités de calcul. Le système intègre deux backends physiques CPU-batched, MuJoCoUni et MotrixSim, et supporte cinq algorithmes d'entraînement standards : PPO, SAC, FlashSAC, TD3 et APPO. Sur des tâches de contrôle robotique représentatives, l'architecture affiche un gain de 3 à 10x sur l'efficacité d'entraînement bout-en-bout, à configuration matérielle équivalente. Fait notable : UniLab fonctionne hors de l'écosystème CUDA, avec support explicite de macOS, AMD ROCm et Intel XPU. Ce résultat remet en question une hypothèse structurante du champ depuis trois à quatre ans : que la performance en RL sim-to-real exige que la physique tourne sur GPU pour atteindre un débit suffisant. UniLab démontre empiriquement que le goulot d'étranglement n'est pas le processeur qui exécute la physique, mais la qualité du pipeline de synchronisation entre simulation et apprentissage. Pour les équipes robotique industrielles ou académiques qui ne disposent pas de clusters NVIDIA haut de gamme, cette architecture ouvre des alternatives concrètes, notamment sur Apple Silicon ou sur des accélérateurs AMD/Intel disponibles dans les clouds alternatifs, souvent moins chers. C'est aussi un signal pour les intégrateurs qui déploient des systèmes de sim-to-real en production : la dépendance à CUDA n'est pas une fatalité technique, mais un choix d'architecture. Le débat GPU vs CPU pour la simulation physique en RL robotique n'est pas nouveau, mais il s'était largement tranché en faveur du GPU depuis les travaux d'Isaac Gym (NVIDIA, 2021) et leurs successeurs. La majorité des frameworks modernes, IsaacLab, ManiSkill, Genesis, optimisent autour de ce paradigme. UniLab se positionne explicitement comme une alternative portable et extensible, en s'appuyant sur MuJoCo (DeepMind/Google), devenu le simulateur de référence académique depuis son passage open source en 2021. Le code est disponible publiquement sur GitHub (unilabsim/UniLab). Les prochaines étapes probables concernent la validation sur des tâches de locomotion bipède et de manipulation dextère, qui constituent les benchmarks décisifs pour évaluer si le gain de 3-10x se maintient sur des environnements physiquement plus complexes et des horizons de simulation plus longs.

InfrastructureOpinion
1 source
Sortie de l'Open Motion Planning Library 2.0
3112arXiv cs.RO 

Sortie de l'Open Motion Planning Library 2.0

L'Open Motion Planning Library (OMPL), publiée en open source en 2008, franchit en mai 2026 une étape majeure avec la sortie d'OMPL 2.0, annoncée via un preprint arXiv (2605.29301). Cette mise à jour de fond fait évoluer une bibliothèque de planification de mouvement par échantillonnage qui, en près de deux décennies de développement continu, avait déjà intégré des planificateurs asymptotiquement optimaux, des planificateurs paresseux (lazy planners), la planification sous contraintes, et la planification avec objectifs en logique temporelle. La version 2.0 cible explicitement la planification de mouvement en temps réel grâce à l'accélération matérielle (GPU/FPGA), et s'interface avec les workflows de recherche en IA modernes. Aucun benchmark quantitatif n'est publié dans le résumé; les détails de performance restent à évaluer à la lecture du papier complet. L'enjeu est direct pour les équipes de robotique intégrées dans des environnements industriels ou académiques : OMPL est aujourd'hui l'une des briques les plus utilisées dans ROS/ROS 2 via MoveIt, ce qui signifie qu'une accélération matérielle en production peut réduire les temps de calcul de trajectoire de plusieurs ordres de grandeur, condition sine qua non pour les bras manipulateurs collaboratifs, les humanoïdes en manipulation dextère, et les AMR opérant dans des espaces non structurés. L'intégration avec les pipelines IA modernes, typiquement Vision-Language-Action (VLA) ou apprentissage par imitation, répond à un verrou réel : les planificateurs classiques et les modèles neuronaux cohabitent encore difficilement en temps réel. OMPL a été développé initialement à Rice University sous l'impulsion de Ioan Sucan et Lydia Kavraki, puis maintenu par une communauté large incluant des contributions de Willow Garage, puis de MoveIt. Ses concurrents directs dans l'écosystème open source incluent DRAKE (Toyota Research Institute / MIT), Tesseract (ROS-Industrial), et Pinocchio côté cinématique. Côté européen, des acteurs comme Wandercraft (exosquelette) ou Enchanted Tools (Mirmi) s'appuient sur des couches de planification proches. La prochaine étape naturelle sera la validation sur benchmarks standardisés (MotionBenchMaker, PlanningBenchmark) et l'intégration officielle dans MoveIt 2; aucune timeline n'est encore communiquée.

InfrastructureOpinion
1 source
MonoDuo : apprendre des politiques bimanuelles avec un seul bras robotique
3113arXiv cs.RO 

MonoDuo : apprendre des politiques bimanuelles avec un seul bras robotique

Des chercheurs proposent avec MonoDuo (arXiv:2505.29298) une méthode pour entraîner des politiques de manipulation bimanuelles sans disposer de robots à deux bras. La collecte de données est hybride: un opérateur téléopère un bras unique pour exécuter un côté d'une tâche bimanuelles, un humain réalisant l'autre côté, puis les rôles sont inversés pour couvrir les deux membres. Les séquences RGB-D, capturées par une caméra de poignet et une caméra fixe, sont transformées en démonstrations synthétiques calibrées sur la cinématique du robot bimanuel cible, via estimation de pose des mains, segmentation de nuage de points et inpainting. Testé sur cinq tâches (soulèvement d'une boîte, remplissage d'un sac à dos, pliage d'un vêtement, fermeture d'une veste à glissière, passage d'une assiette), MonoDuo atteint jusqu'à 70% de taux de réussite en déploiement zero-shot sur des configurations bimanuelles non vues à l'entraînement. Avec seulement 25 démonstrations supplémentaires sur le robot cible, un fine-tuning few-shot améliore ces résultats de 65 à 70% par rapport à un entraînement depuis zéro. Le verrou adressé est structurel: les robots à deux bras coordonnés restent rares et onéreux dans les laboratoires de recherche, alors que les bras uniques sont omniprésents. Cette asymétrie crée un goulot d'étranglement dans la constitution de datasets pour les tâches bimanuelles, freinant le développement de politiques viables aussi bien pour les humanoïdes commerciaux que pour les cellules industrielles bimanuelles. MonoDuo montre qu'il est possible de bootstrapper ces politiques sans matériel dédié, réduisant considérablement le coût d'entrée. La réussite du déploiement zero-shot sur des configurations non vues est notable dans un domaine où le sim-to-real gap reste un obstacle structurel, et le gain de 65 à 70% obtenu avec seulement 25 démonstrations de fine-tuning constitue un signal positif pour les intégrateurs ne pouvant se permettre des milliers de cycles de collecte. Ce travail s'inscrit dans la lignée d'ALOHA, de UMI (Universal Manipulation Interface) et de Diffusion Policy, qui cherchent à décorréler la plateforme de collecte de la plateforme cible. L'essor des humanoïdes commerciaux (Figure 03, Tesla Optimus Gen 3, Unitree G1, 1X Eve) relance l'intérêt pour la manipulation bimanuelles à grande échelle. En Europe, Pollen Robotics avec son robot open-source Reachy et Enchanted Tools avec Miroki travaillent sur des problématiques similaires d'efficacité des démonstrations. MonoDuo reste à ce stade un preprint académique sans déploiement industriel annoncé; ses résultats devront être confirmés hors conditions de laboratoire pour valider leur transposabilité opérationnelle.

RecherchePaper
1 source
Stratégies de préhension pratiques pour la manipulation mobile en environnement réel
3114arXiv cs.RO 

Stratégies de préhension pratiques pour la manipulation mobile en environnement réel

Des chercheurs ont publié en avril 2025 sur arXiv (référence 2504.12512) une étude de terrain portant sur SHOPPER, une plateforme de manipulation mobile conçue pour évaluer des stratégies de préhension dans un supermarché réel. L'environnement choisi n'est pas anodin : un magasin d'alimentation impose une diversité extrême d'objets (formes irrégulières, emballages souples, produits réfléchissants), de configurations d'étagères et de layouts changeants. L'équipe a conduit des centaines de tentatives de saisie distinctes et documente en détail les modes de défaillance observés, sans annoncer de taux de réussite global, ce qui tranche avec la communication habituelle du secteur. Ce travail apporte une valeur rare dans la littérature robotique actuelle : une analyse honnête des échecs en conditions non structurées réelles, plutôt qu'une démonstration soigneusement sélectionnée en laboratoire. Le fossé demo-to-reality reste le principal obstacle au déploiement commercial des manipulateurs mobiles, et les auteurs cherchent précisément à le cartographier. Pour un intégrateur ou un décideur industriel, ce type d'inventaire des cas limites est plus exploitable qu'un benchmark contrôlé : il permet de calibrer les attentes sur ce que les pipelines VLA (Vision-Language-Action) et les approches de grasp planning généraliste peuvent réellement délivrer aujourd'hui hors laboratoire. La recherche en manipulation mobile s'est intensifiée ces deux dernières années, portée par des acteurs comme Apptronik, Agility Robotics (Digit) ou Boston Dynamics (Spot avec bras), mais aussi par des startups spécialisées dans le picking retail comme Symbotic ou des robots de supermarché tels que ceux de Focal Systems. Les approches fondées sur l'apprentissage end-to-end (pi0 de Physical Intelligence, RT-2 de Google DeepMind) promettent une généralisation, mais leur robustesse en environnement chaotique reste peu documentée de façon indépendante. SHOPPER s'inscrit dans une démarche de recherche ouverte visant à fournir à la communauté robotique un référentiel de problèmes concrets non résolus, ce qui suggère des publications de suivi et potentiellement un benchmark partagé.

RecherchePaper
1 source
VLAConf : confiance calibrée dans la réussite des tâches pour les modèles VLA
3115arXiv cs.RO 

VLAConf : confiance calibrée dans la réussite des tâches pour les modèles VLA

Des chercheurs ont publié fin mai 2026 sur arXiv (référence 2605.29605) VLAConf, un framework de détection de confiance pour les modèles Vision-Langage-Action (VLA) appliqués à la manipulation robotique. Le principe repose sur un module léger ("confidence head") branché sur les représentations internes d'un VLA préentraîné et figé, capable de calculer en un seul passage (single forward pass) un score d'anomalie à chaque étape de la trajectoire. Le système intègre également un mécanisme de "step-conditioned modeling" qui encode la phase d'exécution le long du rollout. Les performances sont évaluées sur le benchmark LIBERO, référence académique pour la manipulation multi-tâches, et validées sur robot physique. L'enjeu est direct pour le déploiement industriel des VLA : anticiper l'échec d'une tâche avant qu'il ne survienne est une condition nécessaire pour les applications à risque, de la chaîne de montage au laboratoire pharmaceutique. Les méthodes existantes souffrent de deux limitations majeures. Les approches par ensembles requièrent des échantillonnages répétés qui pénalisent fortement le temps d'inférence. Les méthodes basées sur les probabilités de tokens d'action sont incompatibles avec les espaces d'action continus, ce qui exclut de facto les VLA les plus récents comme pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA). VLAConf contourne ces deux obstacles en un seul forward pass, sans modifier l'architecture du modèle hôte, ce qui lui confère une portabilité inter-architectures notable. Les auteurs revendiquent une nette supériorité sur les baselines en termes de qualité du signal de confiance et d'efficacité à l'inférence, bien que les marges précises ne soient pas détaillées dans le résumé disponible. Les VLA connaissent une accélération marquée depuis 2024 : pi-0 de Physical Intelligence, OpenVLA (Berkeley) et GR00T N2 de NVIDIA ont chacun proposé des approches pour généraliser la manipulation en monde ouvert. La robustesse à l'échelle reste cependant le principal frein au déploiement commercial, et la confiance calibrée en constitue une composante critique. VLAConf se positionne comme une brique d'infrastructure transversale, là où ses prédécesseurs restaient cantonnés aux sorties discrètes. Le code source est rendu public. Ce travail est académique, sans partenariat commercial annoncé.

IA physiqueOpinion
1 source
Embodied3DBench : évaluation de l'intelligence spatiale incarnée à bas niveau des modèles vision-langage
3116arXiv cs.RO 

Embodied3DBench : évaluation de l'intelligence spatiale incarnée à bas niveau des modèles vision-langage

Une équipe de chercheurs a publié le 29 mai 2026 Embodied3DBench, un benchmark conçu pour évaluer les capacités de perception spatiale bas niveau des modèles de vision-langage (VLMs) dans des environnements 3D incarnés. Le benchmark couvre 6 catégories de tâches réparties en deux groupes : la compréhension structurelle spatiale (ancrage d'objets, prédiction de relations spatiales, correspondance multi-vues) et la perception orientée interaction (prédiction d'affordances, prédiction de points de saisie, prédiction de trajectoires). Il totalise 12 sous-catégories et plus de 21 000 paires questions-réponses annotées. Treize modèles de pointe ont été évalués sur ce corpus. En parallèle, les auteurs ont synthétisé un dataset d'entraînement à grande échelle de 1,3 million de paires QA pour tenter de combler les lacunes identifiées. Les résultats révèlent une dissociation nette dans les capacités des VLMs actuels : ces modèles affichent des performances raisonnables sur le raisonnement spatial de haut niveau, notamment les relations de position entre objets, mais restent très fragiles dès qu'il s'agit de perception orientée interaction, c'est-à-dire prédire où saisir un objet, anticiper une trajectoire de manipulation, ou estimer l'affordance d'une surface. Pour les équipes qui développent des modèles vision-langage-action (VLA) destinés à la manipulation robotique, ce résultat est structurant : il indique que les fondations perceptuelles nécessaires au déploiement réel restent insuffisantes dans les architectures actuelles, y compris les plus récentes. Le fine-tuning sur le dataset de 1,3M paires améliore significativement les scores bas niveau, ce qui suggère que le problème est en partie un déficit de données d'entraînement ciblées plutôt qu'une limite architecturale fondamentale. Ce travail s'inscrit dans un effort plus large de la communauté robotique pour doter les VLMs de capacités d'interaction physique, au-delà de la simple description de scènes. Des systèmes comme Pi-0 (Physical Intelligence), OpenVLA ou GR00T N2 (NVIDIA) reposent sur ces mêmes briques perceptuelles pour passer de la compréhension sémantique à l'action motrice. Jusqu'ici, l'évaluation de ces capacités bas niveau manquait d'un cadre standardisé : la plupart des benchmarks existants (ScanQA, EmbodiedScan) ciblent la compréhension de scènes plutôt que la manipulation. Embodied3DBench comble ce vide méthodologique en proposant à la fois un protocole d'évaluation reproductible et un levier de progression via son dataset synthétique. L'article est disponible en preprint (arXiv:2605.29074) et le code devrait être rendu public prochainement.

RechercheActu
1 source
Qwen-VLA : un modèle vision-langage-action (VLA) unifié pour les tâches, environnements et morphologies de robots
3117arXiv cs.RO 

Qwen-VLA : un modèle vision-langage-action (VLA) unifié pour les tâches, environnements et morphologies de robots

Qwen-VLA, présenté en préprint arXiv par l'équipe Qwen d'Alibaba (arXiv:2605.30280, mai 2026), est un modèle de fondation incarné qui unifie dans un seul système la manipulation robotique, la navigation vision-et-langage et la prédiction de trajectoires. L'architecture étend la pile vision-langage de Qwen par un décodeur d'action basé sur un Diffusion Transformer (DiT), permettant de générer des actions continues en plus du raisonnement perceptif. L'entraînement joint combine trajectoires de manipulation réelles, démonstrations égocentrées humaines, données de simulation synthétique et jeux de données de navigation. Sur les benchmarks publiés, Qwen-VLA-Instruct atteint 97,9 % sur LIBERO, 86,1 %/87,2 % sur RoboTwin-Easy/Hard, 73,7 % sur Simpler-WidowX, et 69,0 % de taux de succès d'objectif sur R2R en navigation. En conditions réelles sur plateforme ALOHA, le modèle affiche 76,9 % de succès moyen hors-distribution (OOD) et 26,6 % en zéro-shot sur DOMINO, une tâche de manipulation dynamique. La contribution principale est le "embodiment-aware prompt conditioning" : des descriptions textuelles propres à chaque robot spécifient morphologie et conventions de contrôle, permettant théoriquement à un seul jeu de poids de s'adapter à plusieurs plateformes sans réentraînement dédié. Pour les intégrateurs et les COO industriels, c'est directement le problème du cross-embodiment qui freine les déploiements à l'échelle. Les scores OOD sont pertinents mais méritent d'être nuancés : ils portent sur des environnements de laboratoire, et les 76,9 % sur ALOHA concernent une plateforme à deux bras en contexte contrôlé, pas un robot industriel en conditions de production. La sélection des séquences de démonstration dans les preprints arXiv est notoirement favorable aux cas réussis. Qwen-VLA s'inscrit dans la course aux VLA généralistes, aux côtés de pi-0 de Physical Intelligence (spécialisé manipulation, 400 M$ levés), GR00T N2 de NVIDIA (cross-embodiment annoncé en 2025) et OpenVLA d'UC Berkeley. Son décodeur DiT le rapproche des approches diffusion-based de pi-0, par opposition aux méthodes token-based. Qwen étant déjà un modèle ouvert d'Alibaba largement adopté dans des stacks vision-langage, son extension à l'action physique offre aux équipes de recherche et d'intégration un point d'entrée solide pour le fine-tuning multi-tâche multi-robot. Aucun déploiement commercial n'est annoncé à ce stade : c'est un travail de recherche, pas un produit lancé.

IA physiqueOpinion
1 source
VE2VF : distillation vision vers sans vision par apprentissage par renforcement pour la manipulation robuste avec contacts
3118arXiv cs.RO 

VE2VF : distillation vision vers sans vision par apprentissage par renforcement pour la manipulation robuste avec contacts

Des chercheurs ont présenté VE2VF (Vision-Enabled to Vision-Free), un cadre d'apprentissage par renforcement (RL) pour la manipulation robotique en contact riche, publié en préprint sur arXiv (2605.29564). La méthode repose sur une distillation enseignant-élève conduite intégralement sur robot réel, sans simulation ni randomisation de domaine. Un module "enseignant" équipé de vision apprend d'abord la tâche, puis transfère sa politique à un "élève" n'utilisant que la pose, le twist et le wrench (position/orientation, vitesse et couple de force), sans aucun flux caméra. Sur le benchmark NIST d'assemblage, référence standardisée pour les tâches d'insertion de précision, le système atteint 95 % de taux de succès global après environ 50 minutes d'entraînement sur 3 tâches représentatives, et généralise à 8 variantes non vues lors de l'entraînement. Un fine-tuning par distillation permet d'atteindre 100 % de succès sur la variante la plus difficile. Ce résultat adresse un problème structurel en robotique industrielle: les politiques basées sur la vision surapprennent les conditions d'éclairage et de fond vues à l'entraînement, ce qui fragilise leur déploiement en environnement de production variable. En éliminant la vision à l'inférence tout en l'exploitant pendant l'apprentissage, VE2VF produit des politiques robustes aux perturbations visuelles sans coût supplémentaire en données. Plus significatif encore: atteindre cette généralisation en moins d'une heure d'entraînement réel suggère qu'on peut contourner le sim-to-real gap sans simulateur haute-fidélité ni dataset synthétique massif. Pour les intégrateurs déployant des cellules d'assemblage de précision, la combinaison rapidité d'adaptation et robustesse proprioceptive est directement actionnable. Le benchmark NIST Assembly Task Board est utilisé depuis plusieurs années comme terrain de comparaison inter-équipes en manipulation de précision, ce qui confère à ces résultats une lisibilité relative face aux travaux antérieurs. Les approches concurrentes combinent généralement simulation, randomisation de domaine et larges volumes de données synthétiques avant transfert sur robot réel. VE2VF se positionne comme une alternative ancrée dans le réel, avec une boucle human-in-the-loop permettant de superviser l'apprentissage en cours de session. Il s'agit à ce stade d'un préprint de recherche, non d'un système en production ni d'un produit commercialisé. Les suites naturelles incluent des tests sur d'autres plateformes matérielles et des tâches industrielles plus complexes, ainsi qu'une confrontation directe avec les approches de type VLA (Vision-Language-Action) qui ciblent elles aussi la généralisation en manipulation contact-riche à grande échelle.

RecherchePaper
1 source
VLA-Pro : transfert de mémoire procédurale entre tâches pour les modèles vision-langage-action (VLA)
3119arXiv cs.RO 

VLA-Pro : transfert de mémoire procédurale entre tâches pour les modèles vision-langage-action (VLA)

Une équipe de chercheurs a publié en mai 2026 VLA-Pro, un framework « plug-and-play » destiné à améliorer la généralisation inter-tâches des modèles Vision-Language-Action (VLA) en robotique manipulatoire. Le principe repose sur le stockage d'adaptateurs LoRA (Low-Rank Adaptation) comme mémoires procédurales paramétriques pendant la phase d'entraînement. À l'inférence, le système récupère dynamiquement les mémoires les plus pertinentes en fonction du contexte multimodal courant (image, langage, contexte scène), puis les fusionne pour générer le prochain action chunk. Les expériences ont été conduites sur trois benchmarks : RoboTwin, RLBench (simulation), et des tâches de manipulation en environnement réel. Le gain en simulation atteint jusqu'à 207 % d'amélioration relative selon les backbones testés. Sur les tâches réelles, le taux de succès passe de 5,8 % à 65,0 %, soit un facteur d'environ onze. Ce résultat pointe un problème structurel des VLA actuels : leur incapacité à transférer une expérience acquise vers une tâche inédite, même lorsque les objets ou les gestes impliqués sont similaires. Le bond de 5,8 % à 65,0 % en monde réel est notable, bien que l'absence de détails sur la sélection et la difficulté des tâches testées invite à interpréter ces chiffres avec prudence. L'atout principal de VLA-Pro pour les intégrateurs est sa modularité : compatible avec plusieurs backbones existants, il s'insère sans refonte du pipeline d'entraînement. Pour un décideur industriel, cela réduit concrètement le coût de requalification d'un robot lors d'un changement de tâche en production. Les modèles VLA constituent aujourd'hui le front principal de la recherche en manipulation généraliste, avec Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA), OpenVLA (Berkeley) et RT-2 (Google DeepMind) comme références majeures. Leur talon d'Achille commun reste la généralisation out-of-distribution, que VLA-Pro tente d'adresser via un mécanisme de mémoire inspiré des systèmes cognitifs. L'utilisation des LoRA comme vecteurs de mémoire est pragmatique, ces adaptateurs étant déjà présents dans la majorité des pipelines de fine-tuning actuels. Le papier ne mentionne ni partenariat industriel ni déploiement annoncé : il s'agit pour l'instant d'une contribution académique prometteuse dont la validation à l'échelle industrielle reste à démontrer.

RechercheOpinion
1 source
Régularisation contrastive des représentations pour les modèles vision-langage-action (VLA)
3120arXiv cs.RO 

Régularisation contrastive des représentations pour les modèles vision-langage-action (VLA)

Une équipe de chercheurs propose RS-CL (Robot State-aware Contrastive Loss), une nouvelle méthode de régularisation des représentations pour les modèles Vision-Language-Action (VLA), publiée dans une pré-publication arXiv (2510.01711v3, troisième révision). Le principe : ajouter une perte contrastive légère qui aligne les représentations internes du modèle sur les états proprioceptifs du robot, en utilisant les distances relatives entre ces états comme supervision douce. Cette composante s'intègre sans modification architecturale aux pipelines VLA existants et vient compléter l'objectif classique de prédiction d'actions. Sur le benchmark RoboCasa-Kitchen, RS-CL porte le meilleur modèle existant à 69,7 % de taux de succès. Sur des tâches réelles de manipulation en conditions difficiles, le gain est de 45,0 % à 58,3 %, soit plus de treize points d'écart. Ce résultat pointe une faiblesse structurelle des VLA actuels : hérités de Visual Language Models pré-entraînés sur des données web, leurs espaces de représentation sont optimisés pour la compréhension visuelle et linguistique, pas pour le contrôle moteur. RS-CL s'attaque directement à ce désalignement sans réentraîner le backbone ni alourdir significativement l'inférence. Pour les intégrateurs et les équipes de recherche appliquée, cela signifie qu'un gain de plus de treize points sur des tâches réelles est accessible via un simple ajout à la fonction de perte, sans refonte du pipeline. C'est une avancée sur la question du sim-to-real et du gap entre benchmarks synthétiques et déploiements effectifs, même si les conditions exactes des évaluations réelles ne sont pas détaillées dans le résumé. Les VLA constituent un axe de recherche actif depuis l'émergence de modèles comme RT-2 (Google DeepMind, 2023), OpenVLA, et plus récemment Pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA). Ces modèles partagent la même architecture de base : un VLM pré-entraîné auquel on greffe une tête de prédiction d'actions. RS-CL s'inscrit dans une tendance plus large visant à mieux ancrer ces modèles dans la physique du robot plutôt que dans la sémantique du langage. Les prochaines étapes naturelles seraient de tester la méthode sur d'autres benchmarks standardisés (LIBERO, OpenX-Embodiment) et sur des plateformes humanoïdes où la proprioception joue un rôle encore plus central.

IA physiqueOpinion
1 source
Apprentissage par imitation conditionné par phase avec récupération autonome d'échec pour la manipulation robuste d'objets déformables
3121arXiv cs.RO 

Apprentissage par imitation conditionné par phase avec récupération autonome d'échec pour la manipulation robuste d'objets déformables

Des chercheurs ont publié le 29 mai 2026 un article (arXiv:2605.29407) présentant un système robotique capable de manipuler des objets déformables, comme des vêtements, avec une récupération autonome en cas d'échec. Le système, baptisé PHASER, repose sur une architecture hiérarchique en boucle fermée : un encodeur ACT (Action Chunking with Transformers) conditionné via FiLM (Feature-wise Linear Modulation) adapte l'extraction de features selon la phase courante de la tâche, permettant à une politique unifiée de produire des comportements distincts à chaque étape sans dupliquer les modèles. Un prédicteur de phase multimodal fusionne retour visuel, force et pose en temps réel pour estimer l'état courant et détecter les échecs de contact invisibles à la caméra. Un contrôleur d'impédance hybride assure l'exécution compliante. Validé sur la tâche d'accrochage et de retrait d'un T-shirt en manipulation bimanuelle, le système fait passer le taux de succès de 56 % à 87 % grâce à la récupération autonome des erreurs. Ce résultat est notable car la manipulation d'objets déformables reste un des verrous les plus résistants de la robotique industrielle et domestique : les propriétés mécaniques imprévisibles du tissu rendent caduques les approches rigides classiques. Le problème de state aliasing, où des observations visuellement similaires exigent des actions contradictoires selon la phase, sabote les politiques d'imitation standard en inférence markovienne. En conditionnant la politique sur la phase estimée plutôt que sur l'observation brute, et en intégrant le retour de force comme signal de détection d'anomalie, les auteurs montrent qu'il est possible de construire un pipeline sim-to-real sans oracle externe. Les études d'ablation confirment que le conditionnement FiLM surpasse significativement les baselines non conditionnées et celles à token-level, et l'analyse t-SNE valide que les représentations apprises sont bien séparées par phase. L'approche s'inscrit dans la lignée des travaux sur l'imitation learning pour la manipulation dextre, notamment ACT (Chi et al., 2023) et les Diffusion Policies, qui peinent sur les objets non rigides. Elle se distingue des frameworks VLA (Vision-Language-Action) à grande échelle, comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, qui misent sur la généralisation par préentraînement massif plutôt que sur la structure de la tâche. PHASER adopte une stratégie inverse : contrainte forte sur la structure de phase, données limitées, récupération explicite. Les auteurs publient le code et les vidéos en open access. Les prochaines étapes naturelles incluent l'extension à d'autres classes de vêtements et la réduction de la dépendance à l'interface de télé-opération haptique pour la collecte de données d'entraînement.

RecherchePaper
1 source
Diffusion à double flux pour un modèle vision-langage-action augmenté par modèle du monde
3122arXiv cs.RO 

Diffusion à double flux pour un modèle vision-langage-action augmenté par modèle du monde

Une équipe de chercheurs propose DUST (DUal-STream diffusion), un framework qui augmente les modèles vision-langage-action (VLA) avec un world model pour améliorer l'apprentissage de politiques robotiques. L'architecture repose sur un transformer de diffusion multimodal qui maintient des flux séparés pour chaque modalité (vision et action) tout en permettant un partage de connaissances inter-modal. Techniquement, DUST introduit des perturbations de bruit indépendantes, une perte flow matching découplée pour apprendre les relations causales entre modalités, et une méthode d'échantillonnage asynchrone des tokens action et vision. Sur les benchmarks simulés RoboCasa et GR-1, DUST affiche des gains allant jusqu'à 6 % par rapport aux meilleures références VLA et world-modeling actuelles, avec une amélioration supplémentaire de 2 à 5 % via le scaling à l'inférence. Sur tâches réelles avec le bras Franka Research 3, le système surpasse les baselines de 10 % en taux de succès. Le point critique ici est la gestion du "modality gap" : prédire simultanément des états visuels futurs et des séquences d'actions est un problème ouvert, car les deux modalités ont des structures temporelles et sémantiques très différentes. DUST contourne ce problème en maintenant des flux distincts plutôt qu'en les fusionnant naïvement, ce qui préserve les propriétés propres à chaque modalité. Le gain de 10 % en conditions réelles est notable, mais reste à interpréter avec prudence : les expériences portent sur un seul robot (Franka Research 3) et les tâches réelles ne sont pas détaillées dans l'abstract, ce qui limite la généralisation. La capacité de transfer learning à partir de vidéos sans annotations d'actions ouvre en revanche une voie concrète pour réduire le coût de collecte de données. DUST s'inscrit dans une vague de travaux qui cherchent à doter les VLA d'une forme de "prévoyance" via des world models, en écho à des approches comme GR-1 (Humanoid VLA de Shanghai AI Lab) ou Pi-0 de Physical Intelligence. La tendance lourde est de combiner la puissance des LLM pour le raisonnement avec des modèles prédictifs du monde physique, pour réduire le sim-to-real gap et permettre une généralisation hors distribution. La prochaine étape logique serait de tester DUST sur des morphologies robotiques hétérogènes et des tâches de manipulation longue durée, ce que le joint-training avec des datasets humains et robots suggère comme direction.

IA physiqueOpinion
1 source
Bibliothèque d'experts à mélange dynamique progressif pour l'apprentissage robotique continu
3123arXiv cs.RO 

Bibliothèque d'experts à mélange dynamique progressif pour l'apprentissage robotique continu

Des chercheurs proposent DMPEL (Dynamic Mixture of Progressive Parameter-Efficient Expert Library), une architecture publiée sur arXiv (2506.05985) pour l'apprentissage continu en robotique. L'objectif est de permettre à un agent généraliste d'acquérir séquentiellement de nouvelles compétences sans effacer les précédentes, phénomène dit d'oubli catastrophique. DMPEL construit progressivement une bibliothèque d'experts à rang réduit (low-rank, dans la famille PEFT), et utilise un routeur léger pour les combiner dynamiquement en une politique end-to-end. La technique centrale, l'« expert coefficient replay », guide ce routeur vers les experts gelés correspondant aux tâches passées sans rejouer l'intégralité de l'historique d'expériences. Évalué sur LIBERO, benchmark standard de l'apprentissage continu en robotique simulée, DMPEL surpasse l'état de l'art en taux de succès lors d'adaptations séquentielles, avec un nombre minimal de paramètres entraînables. Le verrou levé est pratiquement significatif : les méthodes PEFT existantes supposent un identifiant de tâche disponible à l'inférence, hypothèse irréaliste en déploiement réel où le robot doit lui-même inférer à quelle tâche il est confronté. En s'en affranchissant, DMPEL ouvre la voie à une adaptation incrémentale sans supervision externe. Le remplacement de l'expérience replay classique par l'expert coefficient replay réduit aussi sensiblement les besoins en stockage et en calcul, un argument concret pour l'embarqué industriel. Pour un intégrateur ou un décideur B2B, c'est le signal que spécialiser un robot à de nouveaux postes de travail en séquence devient techniquement plus accessible. L'apprentissage continu connaît un regain d'intérêt direct avec l'essor des politiques vision-langage-action (VLA) comme OpenVLA, RT-2 ou pi-zero, qui nécessitent une spécialisation post-entraînement par tâche. DMPEL s'inscrit dans la lignée des travaux sur les Mixture of Experts et les adaptateurs LoRA, appliqués ici à un cadre multi-tâches séquentiel. Ses concurrents directs sur LIBERO incluent EWC (Elastic Weight Consolidation), PackNet et L2P. La limite principale reste l'absence d'expériences sur robot physique : les gains mesurés en simulation ne garantissent pas le passage au déploiement terrain, un sim-to-real gap que les publications de ce type peinent encore à combler systématiquement.

RecherchePaper
1 source
SM2ITH : manipulation mobile sécurisée avec prédiction interactive des humains via contrôle prédictif hiérarchique par niveaux
3124arXiv cs.RO 

SM2ITH : manipulation mobile sécurisée avec prédiction interactive des humains via contrôle prédictif hiérarchique par niveaux

Des chercheurs ont publié sur arXiv (référence 2511.17798, deuxième version) un framework baptisé SM²ITH, pour Safe Mobile Manipulation with Interactive Human Prediction via Task-Hierarchical Bilevel Model Predictive Control. L'objectif : permettre à des robots mobiles manipulateurs d'évoluer en sécurité dans des espaces partagés avec des humains, sans que ces derniers se comportent de façon prévisible ou coopérative. Le système a été validé expérimentalement sur deux plateformes distinctes, le Stretch 3 de Hello Robot et le Ridgeback-UR10 (Clearpath + bras Universal Robots), dans trois configurations : tâches de livraison avec priorités navigation/manipulation variables, séquences pick-and-place en présence de piétons, et scénarios dits "adversariaux" où l'humain adopte délibérément un comportement perturbateur vis-à-vis du robot. La contribution technique centrale est l'intégration d'un modèle de prédiction interactive du mouvement humain dans un contrôleur MPC hiérarchique via une optimisation bilinéaire. Contrairement aux approches classiques qui modélisent les humains comme des obstacles passifs (modèle en boucle ouverte) ou qui fondent les objectifs en une somme pondérée, SM²ITH anticipe la façon dont le robot influence lui-même la trajectoire de l'humain, et résout conjointement les dynamiques des deux agents. Les résultats montrent une coordination plus sûre et plus efficace que les baselines testées. Pour les intégrateurs industriels ou les équipes déployant des robots de service en milieu hospitalier ou logistique, cela signifie qu'un robot peut maintenir des priorités de tâches strictes (hiérarchie de type HTMPC) tout en s'adaptant en temps réel à un comportement humain non scriptié, y compris hostile. SM²ITH s'inscrit dans une lignée de travaux sur le Hierarchical Task MPC, une famille de méthodes d'optimisation qui gèrent simultanément des tâches de navigation et de manipulation avec des niveaux de priorité explicites, mais jusqu'ici réservées à des environnements structurés ou statiques. L'extension aux dynamiques humaines interactives est le verrou que ce papier prétend lever, au stade de la validation expérimentale en laboratoire. Sur le plan de la compétition académique, les approches concurrentes s'appuient soit sur des politiques apprises (RL, diffusion), soit sur des MPC sans modèle réactif de l'humain. Aucun acteur européen n'est directement impliqué dans cette publication. Les prochaines étapes naturelles seraient une validation hors laboratoire, sur des robots à plus haute charge utile, et une comparaison avec des méthodes de prédiction basées sur des VLA ou des modèles de fondation pour l'humain.

RecherchePaper
1 source
DGSG-Mind : graphes de scène gaussiens 3D dynamiques pour la compréhension et l'ancrage de scènes à long terme
3125arXiv cs.RO 

DGSG-Mind : graphes de scène gaussiens 3D dynamiques pour la compréhension et l'ancrage de scènes à long terme

Des chercheurs de l'ICR Lab présentent DGSG-Mind (arXiv:2605.29879, mai 2026), un système de représentation de scènes 3D dynamiques combinant cartes de Gaussiennes 3D explicites et grille de voxels probabiliste pour permettre à un robot de comprendre et de raisonner sur son environnement sur le long terme. L'architecture fusionne deux niveaux de représentation : les Gaussiennes 3D assurent un ancrage spatial fin des instances d'objets avec suivi incrémental, tandis que la grille voxel gère la fusion cross-modale et la réinitialisation visuelle lorsqu'un objet est déplacé ou occlus. Sur cette carte d'instances, le système construit un graphe de scène hiérarchique, puis y greffe un agent de raisonnement multimodal baptisé "3D Gaussian Mind" qui intègre relations structurelles, informations spatio-sémantiques et rendus annotés des régions d'intérêt. Les expériences reportent les meilleures performances zero-shot en 3D Visual Grounding (3DVG) parmi les méthodes opérant sur des cartes auto-reconstruites, avec des résultats compétitifs en segmentation sémantique open-vocabulary et en reconstruction de scènes. Le système a été déployé sur des robots réels pour valider les capacités de mise à jour dynamique, bien que l'article ne précise pas le matériel ni les conditions exactes des essais terrain. L'enjeu central est la robustesse à long terme : la majorité des systèmes de compréhension de scènes 3D supposent un environnement statique ou s'appuient sur une géométrie ground-truth fournie hors ligne, ce qui les rend inutilisables pour une manipulation robotique en conditions réelles où les objets bougent. DGSG-Mind traite explicitement les changements topologiques au niveau objet via un mécanisme de relocalisation visuelle gaussienne et de raffinement masqué guidé par cohérence géométrique-sémantique. La composante open-vocabulary est particulièrement pertinente pour les intégrateurs : elle signifie qu'un opérateur peut interroger le robot en langage naturel ("prends la bouteille rouge à gauche du moniteur") sans ré-entraînement ni labeling préalable. La performance zero-shot sur cartes auto-reconstruites, par opposition aux benchmarks avec géométrie parfaite, est un indicateur plus honnête de la viabilité réelle du système. Le contexte technique s'inscrit dans la vague post-3DGS (3D Gaussian Splatting, Kerbl et al., 2023) qui a largement supplanté les approches NeRF pour la reconstruction temps réel. Les graphes de scènes pour la robotique sont un axe de recherche actif, avec des travaux concurrents comme ConceptGraphs, OpenMask3D ou SceneGraphFusion, dont aucun ne résout à la fois l'association d'instances robuste et les mises à jour dynamiques incrémentales. DGSG-Mind reste un preprint de recherche, non un produit expédié : le gap entre benchmark académique et déploiement industriel fiable demeure à évaluer, notamment sur la latence de mise à jour des Gaussiennes en environnement encombré. Les prochaines étapes naturelles concernent l'intégration dans des pipelines de manipulation (tâches pick-and-place longues durée) et le couplage avec des modèles VLA comme Pi-0 ou GR00T N2.

RecherchePaper
1 source
Synchronisation SE(3) par double quaternion avec garanties de récupération
3126arXiv cs.RO 

Synchronisation SE(3) par double quaternion avec garanties de récupération

Une équipe de chercheurs propose sur arXiv (2602.00324v2) un algorithme de synchronisation SE(3) formulé directement sur les quaternions duaux. Le problème central - récupérer des poses absolues (position et orientation 3D) à partir de transformations relatives bruitées entre scans ou capteurs - est au coeur du SLAM, de la calibration multi-caméra et de la reconstruction 3D. Les méthodes classiques reposent sur des heuristiques multi-étapes sans garanties théoriques. Les auteurs encodent rotation et translation dans un unique objet mathématique (le quaternion dual unitaire) et construisent un algorithme en deux étapes : d'abord un initialisateur spectral par méthode des puissances sur une matrice hermitienne à coefficients quaternioniques duaux, suivi d'une méthode de puissance généralisée sur quaternions duaux (DQGPM) avec projection géométrique à chaque itération pour garantir la faisabilité. Les tests sur benchmarks synthétiques et sur des enregistrements réels de nuages de points multi-scans montrent une précision et une efficacité supérieures aux méthodes matricielles de référence. L'apport principal est théorique : les auteurs établissent des bornes d'erreur formelles pour l'estimateur spectral et prouvent que DQGPM converge en nombre fini d'itérations avec une contraction linéaire jusqu'à un seuil dépendant explicitement du niveau de bruit. C'est une rareté dans ce domaine, où la convergence est généralement seulement empirique. Pour les ingénieurs déployant des systèmes SLAM ou LiDAR multi-scans en contexte industriel, cela signifie un pipeline dont le comportement est borné et potentiellement certifiable - condition préalable à l'homologation de robots mobiles en environnement critique. La représentation unifiée rotation-translation élimine par ailleurs les erreurs d'accumulation liées à la séparation des deux composantes dans les formulations matricielles classiques. La synchronisation sur SE(3) est un problème formalisé depuis plusieurs décennies, adjacent aux travaux en rotation averaging (Hartley, Govindu) et en synchronisation SO(3) (Carlone, Singer). Les méthodes concurrentes dominantes - relaxations SDP, descente de gradient riemannienne, initialisation chordale - restent toutes à base matricielle. Les quaternions duaux sont établis en cinématique des manipulateurs depuis les années 1990, mais rarement exploités en estimation robuste à grande échelle. Ce travail s'inscrit dans un mouvement récent visant à doter les algorithmes de perception robotique de fondements formels, prérequis à leur certification dans des applications critiques (autonomie industrielle, espace). La validation sur des benchmarks SLAM temps réel à grande échelle tels que KITTI ou Hilti représente l'étape suivante naturelle.

RecherchePaper
1 source
Quand un robot doit-il réfléchir ? Raisonnement adaptatif aux ressources par apprentissage par renforcement pour la prise de décision robotique
3127arXiv cs.RO 

Quand un robot doit-il réfléchir ? Raisonnement adaptatif aux ressources par apprentissage par renforcement pour la prise de décision robotique

Des chercheurs ont publié sur arXiv (arXiv:2603.16673) un framework appelé RARRL (Resource-Aware Reasoning via Reinforcement Learning), conçu pour résoudre un problème concret des robots dotés d'agents LLM : décider à quel moment invoquer un raisonnement coûteux, et quand agir directement. L'approche est hiérarchique, RARRL n'apprend pas une politique de contrôle bas niveau, mais une politique d'orchestration haut niveau qui détermine dynamiquement si le robot doit raisonner, quel "rôle de raisonnement" activer, et quel budget computationnel allouer à l'appel LLM, en fonction des observations courantes, de l'historique d'exécution et des ressources restantes. Les expériences, conduites avec des profils de latence empiriques mesurés sur le benchmark ALFRED (tâches domestiques en langage naturel), montrent que RARRL améliore le taux de succès des tâches tout en réduisant la latence d'exécution et en renforçant la robustesse, comparé à des stratégies de raisonnement fixe ou heuristique. Ce travail adresse un goulot d'étranglement structurel pour les robots embarquant des LLM : chaque appel d'inférence coûte plusieurs centaines de millisecondes à plusieurs secondes, ce qui crée des interruptions dans l'exécution motrice et réduit la fiabilité en conditions réelles. Un raisonnement systématique ralentit le robot ; un raisonnement insuffisant génère des erreurs de planification. RARRL propose une solution par apprentissage par renforcement pour calibrer ce compromis à l'exécution, ce qui est plus robuste que les règles codées en dur ou les seuils de confiance statiques. Pour les intégrateurs déployant des bras manipulateurs ou des robots mobiles avec couche LLM, cette approche suggère qu'il est possible de garder des modèles large et capables sans sacrifier la réactivité temps réel, un argument commercial non négligeable face aux pressions pour downscaler les modèles embarqués. Le problème du "quand raisonner" s'inscrit dans une problématique plus large des architectures VLA (Vision-Language-Action) et des agents robotiques hybrides, où des frameworks comme SayCan (Google DeepMind, 2022), RT-2 ou plus récemment Pi-0 (Physical Intelligence) ont montré que l'intégration LLM/politique motrice reste coûteuse à orchestrer. RARRL se positionne comme une couche d'orchestration agnostique au modèle sous-jacent, potentiellement applicable à des stacks existants. La démonstration reste sur simulateur/benchmark ALFRED ; le passage à du matériel réel avec contraintes temps-réel dures (ARM embarqué, bus CAN à 1 kHz) n'est pas encore documenté, ce qui constitue la prochaine étape évidente pour valider l'approche hors laboratoire.

IA physiqueOpinion
1 source
BORA : apprentissage par renforcement hors ligne et adaptation résiduelle en ligne pour modèles VLA dextériques
3128arXiv cs.RO 

BORA : apprentissage par renforcement hors ligne et adaptation résiduelle en ligne pour modèles VLA dextériques

Des chercheurs ont publié sur arXiv (arXiv:2605.30226) BORA, un cadre de post-entraînement mêlant apprentissage par renforcement hors ligne et adaptation résiduelle en ligne, conçu pour les modèles VLA (Vision-Language-Action) appliqués à la manipulation dextre. Le système fonctionne en deux phases: hors ligne, un réseau critique est entraîné en prenant comme entrées les tokens cognitifs du modèle de langage-vision et les chunks d'actions, ce qui lui permet d'évaluer les mouvements de main au-delà du seul contexte visuel. En ligne, le modèle VLA de base est gelé et une couche d'adaptation résiduelle légère de type chunk-wise est introduite, guidée par un mécanisme Human-in-the-Loop (HiL) générant des récompenses à partir d'interventions humaines. Évalué sur cinq tâches réelles de manipulation dextre complexe, BORA affiche une hausse absolue de 33 points de pourcentage du taux de succès moyen face aux baselines standards, et jusqu'à +43 points sur des objets non vus lors de l'entraînement. Ces résultats s'attaquent à l'un des verrous persistants de la robotique dextre: les mains à haute dimensionnalité amplifient les erreurs d'exécution cumulées, rendant l'exploration RL en conditions réelles à la fois inefficace et risquée pour le matériel. L'approche de BORA, qui préserve le modèle pré-entraîné comme prior stable et n'ajoute qu'une couche corrective légère, circonscrit l'espace d'exploration plutôt que de le réouvrir entièrement. Le gain de 43% sur objets non vus suggère une généralisation réelle plutôt qu'un surapprentissage des démonstrations, ce qui distingue ce travail des pipelines d'imitation learning classiques. Pour un intégrateur ou un décideur B2B, cela valide une trajectoire concrète: spécialiser un VLA généraliste pour une tâche dextre sans repartir d'un entraînement complet. Les VLA ont connu une accélération notable depuis Pi-0 de Physical Intelligence, OpenVLA (Berkeley) ou RoboVLMs (Google DeepMind), mais la manipulation fine multi-doigts reste leur point faible documenté. BORA s'inscrit dans un mouvement offline-to-online concurrent d'approches comme RLPD ou Cal-QL, qui cherchent à rendre le RL online moins destructif pour les politiques pré-apprises. Aucun partenaire industriel ni calendrier de déploiement n'est mentionné dans la publication; il s'agit pour l'instant d'un résultat de recherche sans annonce de commercialisation. La dépendance au HiL en phase online reste par ailleurs une limite pratique non résolue pour un passage à l'échelle industrielle.

RechercheOpinion
1 source
3DVLA : amélioration des modèles VLA par la compréhension spatiale 3D et des instances
3129arXiv cs.RO 

3DVLA : amélioration des modèles VLA par la compréhension spatiale 3D et des instances

Une équipe de chercheurs a publié fin mai 2026 sur arXiv (référence 2605.29416) un cadre méthodologique baptisé 3DVLA, conçu pour renforcer les modèles Vision-Language-Action (VLA) en manipulation robotique. Ces modèles, qui combinent perception visuelle, compréhension du langage et génération d'actions motrices, souffrent d'une limitation structurelle : ils opèrent dans un espace de représentation 2D hérité des grands modèles de vision-langage, alors que les robots évoluent dans un environnement tridimensionnel. Ce manque de compréhension spatiale se traduit par trois faiblesses concrètes : extraction insuffisante des positions 3D sans cohérence multi-vue, mauvaise discrimination des instances individuelles dans une scène encombrée, et raisonnement fragile face aux occlusions partielles. 3DVLA propose d'injecter cette compréhension 3D dans des VLA préentraînés sans modifier leur architecture de base ni exiger d'annotations supplémentaires au niveau des instances, un coût souvent prohibitif dans les pipelines existants. Le framework s'appuie sur trois mécanismes complémentaires : un encodage de features 3D avec contraintes de cohérence multi-vue via une méthode dite Spatially-Conditioned Geometry Aggregation (SCGA) ; un module d'estimation d'instances par tokens de haut niveau pour la conscience 3D des objets ; et une branche d'encodage auto-supervisé masqué pour gérer les occlusions par complétion de tokens visuels. Évalué sur les benchmarks LIBERO-Plus et RoboTwin 2.0, le cadre affiche des gains qualifiés de "consistants et significatifs" sur plusieurs architectures VLA de référence, des résultats qui restent toutefois cantonnés à des environnements de simulation standardisés et non à des déploiements terrain. L'enjeu dépasse la performance sur banc de test. Les VLA de nouvelle génération, notamment Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou OpenVLA, ont démontré une forte capacité de généralisation, mais butent précisément sur la robustesse aux occlusions et aux scènes encombrées, conditions quasi-universelles en production industrielle. La compatibilité plug-and-play de 3DVLA est sa principale proposition de valeur : applicable à des modèles existants sans réentraînement complet, il ouvre la voie à une amélioration incrémentale des VLA déjà en cours d'évaluation. Ce préprint n'est pas encore évalué par les pairs, mais il s'inscrit dans la dynamique de recherche visant à combler le fossé entre démos contrôlées et déploiement réel, ce que le secteur nomme le demo-to-reality gap.

IA physiqueOpinion
1 source
Phantom : entraîner des robots sans robots, uniquement avec des vidéos humaines
3130arXiv cs.RO 

Phantom : entraîner des robots sans robots, uniquement avec des vidéos humaines

Une équipe de chercheurs a publié Phantom (arXiv:2503.00779), un framework d'entraînement de politiques de manipulation robotique n'utilisant aucune donnée robot : uniquement des vidéos de démonstrations humaines. Le pipeline extrait les trajectoires via estimation de pose des mains (hand pose estimation), efface le bras humain par inpainting, puis superpose un rendu 3D du robot cible pour produire des paires observation-action directement exploitables. Déployé en zero-shot sur matériel réel sans fine-tuning, le système atteint jusqu'à 92 % de taux de réussite sur des tâches de manipulation d'objets déformables, de balayage multi-objets et d'insertion de composants. Les politiques supportent l'exécution en boucle fermée (closed-loop) et généralisent à des environnements inédits non vus à l'entraînement. L'enjeu est la scalabilité des données. La téléopération, méthode dominante chez Figure, 1X ou Physical Intelligence, exige du matériel disponible, des opérateurs qualifiés et des sessions d'enregistrement coûteuses. En substituant des vidéos humaines à ces démos, Phantom compresse drastiquement le coût d'acquisition du dataset. Si les taux de réussite annoncés se confirment en dehors des conditions contrôlées du laboratoire, cela représenterait un argument solide contre le "reality gap" classique entre simulation et déploiement industriel. La capacité à généraliser sans fine-tuning, point souvent problématique pour les modèles VLA (Visual Language Action), mérite toutefois une validation sur des environnements plus variés que ceux présentés dans le papier. Le problème des données hors-robot n'est pas nouveau : DexMV, ACT et les travaux autour de GR00T N2 de NVIDIA ont exploré des voies comparables, et Physical Intelligence avec pi-0 a parié sur la diversité massive de données multi-embodiment. Les approches sim-to-real via IsaacLab ou Genesis constituent les concurrents méthodologiques directs, contournant le même obstacle par la simulation plutôt que par la vidéo humaine. Phantom se distingue par sa légèreté : pas de flotte de robots nécessaire pour constituer le dataset initial. Le travail reste à ce stade une preuve de concept académique, sans partenariat ni déploiement industriel annoncé. La prochaine étape attendue serait une validation sur des morphologies robotiques variées et des tâches à précision sub-millimétrique.

RechercheOpinion
1 source
DynaFLIP : repenser la perception robotique via une représentation guidée par les dynamiques tri-modales
3131arXiv cs.RO 

DynaFLIP : repenser la perception robotique via une représentation guidée par les dynamiques tri-modales

Des chercheurs présentent DynaFLIP (arXiv:2605.30350, mai 2026), un framework de pré-entraînement multimodal qui intègre la compréhension du mouvement directement dans l'encodeur visuel d'un robot manipulateur. L'approche repose sur des triplets image-langage-flux 3D extraits de vidéos hétérogènes d'humains et de robots. Le principe géométrique central consiste à forcer ces trois modalités à occuper un volume de simplexe minimal dans un espace hypersphérique partagé, plus ce volume est petit, plus l'alignement entre vision, langage et dynamique 3D est fort. Pour éviter l'effondrement trivial de cette minimisation géométrique, les auteurs combinent une régularisation cosinus et un objectif contrastif. Validé sur des benchmarks en simulation et en conditions réelles, DynaFLIP apporte des gains allant jusqu'à +22,5 % de performance dans des scénarios hors distribution, avec des améliorations constantes sur l'ensemble des politiques testées, y compris les VLA (Vision-Language-Action models). L'enjeu industriel est direct : les pipelines robotiques actuels, y compris ceux qui alimentent les humanoïdes commerciaux et les bras manipulateurs, s'appuient sur des encodeurs visuels pré-entraînés pour la reconnaissance statique ou l'alignement vision-langage de type CLIP. La compréhension du mouvement est laissée à la politique en aval, ce qui crée un goulot d'étranglement pour la généralisation. DynaFLIP déplace ce traitement en amont : le backbone visuel lui-même apprend à encoder non pas seulement ce qui est présent dans la scène, mais comment le monde se transforme sous l'effet d'une action. Le gain de +22,5 % hors distribution est particulièrement significatif, car c'est précisément là que les robots en déploiement réel échouent le plus souvent, sur des objets, des éclairages ou des configurations jamais vus à l'entraînement. Cette approche s'inscrit dans une vague de travaux sur les représentations visuelles pour la manipulation (R3M, MVP, SPA), mais elle se distingue en exploitant le flux optique 3D comme signal de supervision sans l'utiliser à l'inférence. Côté compétiteurs, les VLA comme pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou les modèles de Figure et Agility reposent tous sur des encodeurs dont la qualité représentationnelle conditionne la robustesse terrain. DynaFLIP propose un backbone de substitution directement intégrable dans ces architectures. La prochaine étape logique sera de valider à l'échelle sur des tâches de manipulation longue durée et de mesurer le transfert vers des morphologies robotiques variées, bras industriels, mains dextères, ou bases mobiles.

RechercheOpinion
1 source
ScheduleStream : planification temporelle avec échantillonneurs pour l'ordonnancement et la planification de tâches et mouvements multi-bras accélérée par GPU
3132arXiv cs.RO 

ScheduleStream : planification temporelle avec échantillonneurs pour l'ordonnancement et la planification de tâches et mouvements multi-bras accélérée par GPU

Une équipe de chercheurs présente ScheduleStream (arXiv:2511.04758v2), un cadre généraliste de planification et d'ordonnancement pour robots bi-manuels et humanoïdes, conçu pour coordonner plusieurs bras en parallèle. Contrairement aux algorithmes TAMP (Task and Motion Planning) classiques, qui produisent des plans séquentiels où un seul bras se déplace à la fois, ScheduleStream modélise la dynamique temporelle via des hybrid durative actions, des actions pouvant démarrer de façon asynchrone et persister pendant une durée fonction de leurs paramètres. Cette architecture permet d'orchestrer des mouvements simultanés sur plusieurs membres, réduisant le temps de cycle global. Le système intègre une accélération GPU au sein même des échantillonneurs de trajectoires (samplers), et repose sur des algorithmes indépendants du domaine d'application. Les auteurs le valident en simulation ainsi que sur plusieurs tâches bi-manuelles réelles, dont les démonstrations sont accessibles sur schedulestream.github.io. Aucun chiffre précis de gain de temps ni de configuration matérielle (DOF, payload) n'est fourni dans l'abstract : des éléments à vérifier dans le papier complet. Le verrou adressé est structurel : l'espace d'action hybride discret-continu d'un robot multi-bras croît de façon combinatoire, rendant la planification computationnellement prohibitive dès qu'on autorise le parallélisme. En produisant des schedules plutôt que de simples séquences, ScheduleStream ouvre la voie à des cellules robotiques capables d'exécuter des sous-tâches simultanément, saisie d'un côté et assemblage de l'autre, ce qui est précisément le cas d'usage clé pour les intégrateurs cherchant à justifier un humanoïde bi-manuel (Figure 03, Optimus Gen 3, Atlas) en environnement industriel. L'accélération GPU dans le sampler est notable dans un domaine historiquement dominé par des planificateurs CPU-bound, et suggère une voie vers des temps de planification compatibles avec des cadences réelles. Le champ TAMP multi-bras s'est structuré autour de travaux comme PDDLStream (Garrett et al., MIT CSAIL), qui a introduit l'échantillonnage continu dans TAMP, mais sans gestion native du parallélisme temporel. ScheduleStream prolonge cette lignée en ajoutant la dimension asynchrone, un problème traité par ailleurs dans la communauté PDDL+ via des planificateurs temporels comme OPTIC ou POPF. Sur le terrain applicatif, les approches concurrentes incluent les politiques d'imitation comme ACT ou Diffusion Policy, qui contournent la planification symbolique au prix d'une moindre généralisabilité, et des frameworks comme MoveIt Task Constructor sous ROS2. La prochaine étape naturelle serait une validation sur des cellules de production réelles avec des métriques de cycle time documentées, ainsi qu'une publication du code source, non encore disponible à la date d'annonce.

RecherchePaper
1 source
EXACT-MPPI : navigation par distance signée pour robots à empreinte arbitraire depuis des nuages de points
3133arXiv cs.RO 

EXACT-MPPI : navigation par distance signée pour robots à empreinte arbitraire depuis des nuages de points

Des chercheurs ont publié sur arXiv (preprint 2605.29663) EXACT-MPPI, un framework de navigation locale sans entraînement pour robots au sol dont l'empreinte est non-convexe en raison de charges utiles, d'accessoires ou d'outils fixés à la plateforme. Le système cartographie directement des observations en nuage de points locaux vers des commandes de mouvement, sans grille d'occupation ni champ de distances intermédiaire. Son cœur est un évaluateur analytique de distance signée exacte, intégré dans un contrôleur MPPI (Model Predictive Path Integral) : l'empreinte du robot est décrite comme un polygone simple, convexe ou concave, avec une spécialisation rectangulaire pour les formes rectilinéaires. À chaque itération MPPI, les points d'obstacles observés sont transformés dans le repère du corps prédit et évalués contre ce polygone. Toutes les opérations sont vectorisées sous JAX pour exploiter le parallélisme GPU en temps réel. L'apport principal est l'élimination des approximations qui réduisent les trajectoires faisables : les planificateurs locaux courants simplifient l'empreinte par une enveloppe convexe ou l'inflatent, ce qui supprime des mouvements valides lorsque la clearance est comparable à la géométrie réelle. Les expériences montrent qu'EXACT-MPPI accélère l'évaluation des distances par lot par rapport aux baselines apprises de type point-à-robot, préserve des mouvements que les planificateurs à empreinte convexe refusent, et reste robuste face à des obstacles statiques et mobiles denses. Aucun entraînement, décomposition convexe, inflation ni encodeur appris n'est requis, ce qui simplifie considérablement le déploiement. Ce travail répond à un défi persistant dans les AMR industriels et agricoles : les robots réels portent des fourches, bras ou outils qui rendent l'empreinte irrégulière, mais la majorité des stacks de navigation supposent une géométrie simplifiée. EXACT-MPPI se déploie sur des plateformes à entraînement différentiel, Ackermann, omnidirectionnelles et hybrides en changeant uniquement la description de l'empreinte et le modèle de mouvement, sans réentraînement. Face aux approches neuronales concurrentes qui nécessitent des jeux de données spécifiques à chaque configuration, cet évaluateur analytique est plus facilement auditable et intégrable dans un pipeline industriel existant. La principale contrainte reste la dépendance à un accélérateur GPU pour le contrôle temps réel, un frein non négligeable pour les plateformes embarquées contraintes en énergie.

RecherchePaper
1 source
Capteurs de force pour interfaces humain-robot portables via innervation fluidique
3134arXiv cs.RO 

Capteurs de force pour interfaces humain-robot portables via innervation fluidique

Des chercheurs ont publié sur arXiv (preprint 2602.13436v2) un capteur de force destiné aux interfaces humain-robot portables, basé sur un principe qu'ils nomment "fluidic innervation". Le dispositif consiste en un pad en silicone imprimé en 3D, percé de microcanaux pneumatiques : lorsqu'une force est appliquée sur le pad, les canaux se compriment et la variation de pression est captée par des transducteurs commerciaux standard. En banc de test, la relation entre pression interne et force appliquée s'est révélée hautement linéaire (R² = 0,998). Les auteurs ont ensuite validé le capteur sur un dynamomètre clinique pour mesurer le couple isométrique du genou, puis lors de flexions du biceps cycliques et isométriques en conditions moins contraintes. Enfin, le pad a été intégré dans un exosquelette de membre inférieur : pendant des squats répétés avec l'exosquelette non alimenté, la pression suivait de façon cohérente la phase du mouvement et la dynamique globale de la tâche. L'enjeu est réel : caractériser mécaniquement l'interface humain-machine reste un verrou dans le développement des exosquelettes, car la sensorisation de cette zone est compliquée par la complexité de fabrication et les réponses non linéaires des capteurs conventionnels (jauges de contrainte, FSR). L'approche fluidique contourne ces limites avec des composants peu coûteux et un rapport signal/bruit élevé. Pour les intégrateurs et les équipes de contrôle, disposer d'une mesure d'interaction fiable en temps réel ouvre la voie à des boucles de rétroaction adaptatives, voire à l'optimisation automatique du confort et de l'assistance. La linéarité des mesures, si elle se confirme en usage clinique prolongé, simplifierait considérablement la calibration embarquée. Ce travail s'inscrit dans un effort plus large de la communauté exosquelettes pour dépasser les architectures de contrôle en impédance purement mécaniques, en intégrant une perception distribuée de l'effort. Des acteurs comme Wandercraft (Paris) sur les exosquelettes de rééducation, ou Ekso Bionics et ReWalk côté anglophone, font face au même défi de sensorisation de l'interface. Le preprint ne mentionne pas de partenariat industriel ni de timeline de déploiement : il s'agit à ce stade de résultats préliminaires prometteurs, non d'un produit commercialisé. Les prochaines étapes logiques seraient des essais sur sujets pathologiques et une miniaturisation du système de transduction pour une intégration portée continue.

ExosquelettesPaper
1 source
Apprendre à reconnaître les matériaux à partir de données tactiles multisensorielles via des modèles interprétables
3135arXiv cs.RO 

Apprendre à reconnaître les matériaux à partir de données tactiles multisensorielles via des modèles interprétables

Une équipe de chercheurs présente dans une prépublication arXiv (2605.29572) un cadre computationnel interprétable pour modéliser la perception tactile humaine des matières. Le système s'articule en trois modèles interconnectés : le premier traduit les caractéristiques de l'interaction doigt-surface en attributs psychophysiques (douceur, rugosité, chaleur perçue) ; le second classifie les matériaux à partir de ces représentations perceptuelles ; le troisième classifie directement les matériaux depuis les signaux tactiles bruts. Les données d'entraînement combinent trois types d'interactions : pression statique, contact statique et glissement. Les résultats montrent que l'association de ces trois modalités améliore significativement la précision de classification, et que les indices thermiques se révèlent particulièrement discriminants, aussi bien pour la modélisation perceptuelle que pour la reconnaissance de matériaux. Ce travail pointe une lacune critique dans la conception des doigts robotiques et des interfaces haptiques actuels : les capteurs thermiques et de compliance y sont systématiquement sous-représentés, alors qu'ils jouent un rôle central dans la perception humaine des matières. Pour les intégrateurs de systèmes de manipulation ou les concepteurs d'environnements de réalité mixte, cela suggère que les architectures de capteurs aujourd'hui dominantes, majoritairement fondées sur la pression et la déformation, manquent un canal d'information majeur. L'aspect interprétable du framework est notable : contrairement aux approches deep learning en boîte noire, la chaîne de modèles permet d'identifier quels signaux physiques influencent quels attributs perceptuels, ce qui facilite la traduction en spécifications d'ingénierie. La perception tactile des matériaux est un axe de recherche actif depuis une décennie, porté par des laboratoires comme ceux de Sliman Bensmaia (Chicago) ou des équipes utilisant des capteurs comme le GelSight (MIT) ou le DIGIT (Meta AI). Les interfaces haptiques restent un goulot d'étranglement pour la téléopération et la robotique de manipulation fine, avec des acteurs comme HaptX ou Haption côté industriel, et des initiatives académiques européennes sur la peau électronique. Ce papier ne livre pas encore un prototype matériel, mais propose un cadre analytique susceptible de guider la prochaine génération de capteurs tactiles multimodaux pour bras robotiques et gants haptiques.

RecherchePaper
1 source
Validation reproductible de robots par simulation avec traçabilité de provenance
3136arXiv cs.RO 

Validation reproductible de robots par simulation avec traçabilité de provenance

Un article publié sur arXiv (2605.29973) propose un cadre méthodologique pour rendre les campagnes de validation robotique par simulation réplicables de façon rigoureuse. Le constat de départ : la simulation est l'outil dominant pour évaluer le comportement des robots avant déploiement, mais les conditions exactes des tests (configuration, exécution, post-traitement) sont rarement documentées de façon structurée. Les auteurs répondent en appliquant les principes FAIR (Findability, Accessibility, Interoperability, Reusability) et en intégrant la traçabilité de provenance directement dans les pipelines de test, plutôt qu'en couche ajoutée après coup. Concrètement, ils ont instrumenté un framework de simulation existant avec des mécanismes de capture de métadonnées machine-readable et appliqué cette approche à un jeu de données de navigation de robot mobile. L'enjeu dépasse la recherche académique : sans documentation fiable des conditions de test, il devient impossible de comparer des résultats entre environnements simulés, de reproduire des scénarios de défaillance, ou de constituer une base certifiable pour des AMR industriels ou des robots de service. Ce travail identifie un problème en amont du sim-to-real gap : un "sim-to-sim replicability gap", l'impossibilité de reproduire fidèlement une campagne d'un laboratoire à l'autre. Pour les intégrateurs et les certifiants, c'est un frein direct à la standardisation des processus de qualification robotique. Les principes FAIR, nés en bioinformatique et en physique des particules, restent peu adoptés en robotique. Ce travail s'inscrit dans un effort plus large de structuration des benchmarks du secteur, porté par des communautés ROS et des groupes de travail ISO sur la performance des robots. Les obstacles identifiés par les auteurs -- alignement des vocabulaires entre outils, sélection des attributs pertinents, adoption de standards de domaine -- soulignent que la transition reste complexe. L'étape naturelle serait une intégration dans des simulateurs populaires comme Gazebo, Isaac Sim de NVIDIA ou MuJoCo, et la convergence vers des ontologies partagées entre laboratoires.

RecherchePaper
1 source
Planification par simulation de séquences de mouvements pour l'optimisation automatisée des procédures dans les cellules d'assemblage multi-robots
3137arXiv cs.RO 

Planification par simulation de séquences de mouvements pour l'optimisation automatisée des procédures dans les cellules d'assemblage multi-robots

Une équipe de chercheurs a publié sur arXiv (arXiv:2507.23270) une méthode de planification par simulation pour générer automatiquement des séquences de mouvements coordonnés dans des cellules d'assemblage multi-robots reconfigurables. Le principe repose sur une décomposition des tâches en deux catégories : les opérations "cœur" (core operations), directement liées aux étapes d'assemblage et donc figées par les contraintes du procédé, et les opérations de transit (traverse operations), qui relient ces étapes et constituent le principal levier d'optimisation. La planification de l'ordonnancement des opérations cœur est formulée comme un problème d'optimisation combinatoire, dans lequel les opérations de transit faisables doivent être intégrées via une stratégie de planification de mouvement par décomposition. Trois techniques de résolution sont comparées : une heuristique par échantillonnage, une recherche arborescente et une optimisation sans gradient. Ce travail s'attaque à un verrou opérationnel concret pour les intégrateurs de cellules flexibles : chaque reconfiguration d'une ligne implique aujourd'hui un travail manuel de reprogrammation des trajectoires et de résolution des conflits de mouvement entre bras. La méthode proposée automatise ce processus et génère des séquences sans collision qui surpassent le comportement de base décentralisé, dans lequel chaque robot planifie ses trajectoires indépendamment. L'approche de décomposition identifie des zones du planning qui peuvent être résolues indépendamment avec des algorithmes de planification centralisée modifiés, ce qui réduit la complexité computationnelle. Les résultats en simulation montrent une réduction significative de la durée d'assemblage globale, bien que les auteurs ne communiquent pas de chiffres quantitatifs précis dans l'abstract, ce qui limite l'évaluation externe de l'ampleur du gain. La robotique d'assemblage multi-bras flexible est un segment en forte croissance, porté par la pression sur les constructeurs automobiles et électroniques à adapter leurs lignes plus fréquemment. Des acteurs comme ABB, KUKA et Fanuc proposent des outils de simulation propriétaires (RobotStudio, KUKA.Sim), mais la planification automatisée de séquences coordonnées reste largement un domaine de recherche. Côté académique, ce travail s'inscrit dans une tendance plus large qui combine planification de tâches (task and motion planning, TAMP) et optimisation de scheduling, un domaine où des équipes comme celles du DLR en Allemagne et de l'INRIA en France sont également actives. Les prochaines étapes naturelles seraient la validation sur hardware réel et l'intégration dans des jumeaux numériques industriels, deux conditions indispensables avant tout déploiement en production.

RecherchePaper
1 source
Apprentissage d'une politique visuelle par simulation pour l'insertion de cheville dans des trous inconnus en conditions réelles
3138arXiv cs.RO 

Apprentissage d'une politique visuelle par simulation pour l'insertion de cheville dans des trous inconnus en conditions réelles

Des chercheurs proposent sur arXiv (2205.04297) un système d'insertion visuelle peg-in-hole capable de s'adapter à des formes de trous inconnues au déploiement, après entraînement exclusivement en simulation. L'architecture combine trois modules en cascade : un réseau de segmentation (SN), un réseau de capteur virtuel (VSN) qui estime la pose de la pièce cible, et un réseau de contrôle (CN) qui pilote l'insertion. Le VSN et le CN sont entraînés une seule fois en simulation sur un ensemble de formes génériques ; seul le SN est affiné lors du passage au monde réel, via quelques centaines d'échantillons collectés en moins d'une minute de démonstration humaine. Appliqué à la recharge automatique de véhicule électrique, le système atteint un taux de réussite de 10/10 en 2 à 3 secondes, validé en configurations eye-to-hand et eye-in-hand. Le principal apport est de réduire drastiquement le coût du transfert sim-to-real pour des tâches de manipulation de précision. Les approches classiques exigent soit une large collecte de données réelles, soit une modélisation CAO de chaque référence cible, deux contraintes rédhibitoires sur les lignes d'assemblage à forte variabilité de références. En découplant la perception de la politique générique, les auteurs montrent qu'il suffit d'adapter un seul module léger par nouvelle forme, ce qui ouvre la voie à des systèmes vision-pour-assemblage déployables sans ingénierie lourde par référence. Le résultat sur la recharge EV reste à nuancer : 10 essais constituent un échantillon statistiquement limité, et les conditions de test (tolérance mécanique, variabilité d'éclairage) ne sont pas précisées. La tâche peg-in-hole est un benchmark classique de la robotique d'assemblage, longtemps dominé par le contrôle en force et la modélisation géométrique. Ce travail s'inscrit dans la vague des politiques visuelles généralisables entraînées en sim, portée notamment par les approches VLA de Physical Intelligence (Pi-0) et les travaux de meta-learning de Chelsea Finn. L'application à la recharge de véhicule électrique est stratégiquement opportune : plusieurs constructeurs européens cherchent à automatiser cette opération sans infrastructure dédiée côté borne. Les suites naturelles attendues sont une validation sur un spectre plus large de tolérances dimensionnelles, des conditions d'éclairage industriel variées, et une comparaison formelle avec les méthodes hybrides force-vision existantes.

IA physiquePaper
1 source
Des modèles de vision fondation adaptés à l'estimation fiable de la traversabilité en environnements extérieurs non structurés
3139arXiv cs.RO 

Des modèles de vision fondation adaptés à l'estimation fiable de la traversabilité en environnements extérieurs non structurés

Une équipe de chercheurs propose ViTA (Vision-to-Traversability Adaptation), un framework publié sur arXiv (2605.29565) qui adapte les modèles de vision généralistes, en l'occurrence SAM2, le modèle de segmentation de Meta, à l'estimation de traversabilité en environnements extérieurs non structurés. L'objectif : déterminer, depuis une image RGB seule, quelles zones de terrain un robot mobile peut franchir en toute sécurité. ViTA introduit trois mécanismes distincts : des prompts de traversabilité appris (learnable traversability prompts) injectés dans SAM2 sans détruire sa capacité de généralisation ; un protocole d'entraînement "Perspective-Diversified Training" qui modélise l'incertitude sémantique pour éviter les prédictions trop confiantes aux frontières ambiguës ; et une distillation de connaissance géométrique à l'entraînement, permettant au modèle de raisonner sur la pente et l'élévation du terrain à l'inférence sans capteur de profondeur. La sortie finale est un score de traversabilité continu fusionnant incertitude sémantique et risque géométrique. Les évaluations sur plusieurs datasets hors-route réels montrent des résultats état de l'art en IoU et Précision, avec une réduction significative des faux positifs. L'enjeu pratique est considérable pour les intégrateurs de robots mobiles outdoor, véhicules agricoles autonomes, robots de livraison en terrain mixte, drones terrestres militaires ou de secours. Le taux de faux positifs est le talon d'Achille des approches actuelles : une zone identifiée à tort comme franchissable peut provoquer un basculement ou un enlisement. ViTA attaque ce problème à trois niveaux simultanément, ce qui le distingue des adaptations classiques par fine-tuning de segmentation sémantique. La capacité de généralisation cross-domain est également notable : un modèle entraîné sur un type de terrain (forêt, gravière, prairie) qui tient sur d'autres environnements sans ré-entraînement réduit drastiquement les coûts de déploiement. Il faut cependant souligner qu'il s'agit d'un preprint sans évaluation par les pairs, et que les benchmarks off-road restent hétérogènes, la comparaison directe entre systèmes n'est pas toujours possible. L'estimation de traversabilité visuelle est un problème central depuis les débuts de la robotique outdoor, initialement traité par des approches géométriques (LIDAR, stéréo), puis hybrides, et de plus en plus par des VFMs (Vision Foundation Models) depuis 2022. SAM2, publié par Meta en 2024, est devenu une base populaire d'adaptation grâce à sa robustesse et sa polyvalence. En parallèle, des frameworks comme DINOv2 (Meta) ou OpenCLIP sont aussi exploités pour la traversabilité. Sur ce segment, ViTA se positionne face à des travaux récents comme WayFASTER ou TerrainNet (NVIDIA). Aucun acteur français ou européen n'est mentionné dans ce preprint. Les prochaines étapes attendues pour ce type de travail incluent une validation sur des plateformes embarquées contraintes (edge computing) et une intégration dans des stacks ROS2 pour des tests terrain en conditions réelles.

RecherchePaper
1 source
Follow Everything : suivi de leader et évitement d'obstacles avec adaptation orientée objectif
3140arXiv cs.RO 

Follow Everything : suivi de leader et évitement d'obstacles avec adaptation orientée objectif

Une équipe de chercheurs propose "Follow Everything", un framework de suivi de leader pour robots mobiles à pattes, décrit dans un preprint arXiv (2504.19399, avril 2025). L'approche abandonne les modèles de détection classiques au profit d'un modèle de segmentation, ce qui permet au robot de suivre n'importe quelle entité sans contrainte préalable : humain, robot terrestre, drone, robot à pattes ou simple panneau "stop". Un "distance frame buffer" stocke les embeddings visuels du leader à plusieurs échelles pour maintenir la reconnaissance lors des pertes de vue temporaires. Un mécanisme de "goal-aware adaptation" détermine ensuite les états de planification selon la visibilité et le mouvement du leader, relayé par un planificateur à graphe qui génère des trajectoires candidates tout en assurant l'évitement d'obstacles. Les tests en simulation et en conditions réelles, en intérieur comme en extérieur, montrent des améliorations mesurées sur le taux de succès de suivi, la durée de perte visuelle, le taux de collision et la distance robot-leader. L'enjeu est direct pour les intégrateurs de robots mobiles en environnements non structurés. Les solutions actuelles de suivi, qu'il s'agisse de plateformes AMR logistiques ou de quadrupèdes d'inspection, reposent sur des détecteurs entraînés pour un type de leader précis, les rendant fragiles dès que le contexte change. La généralisation par segmentation ouvre la voie à des déploiements multi-contextes sans retraining, et la gestion explicite des états de visibilité résout un angle mort fréquent : la plupart des systèmes existants échouent silencieusement lors d'une occlusion prolongée. Ces travaux s'inscrivent dans un courant actif sur la navigation sociale et l'interaction humain-robot. Les plateformes testées sont des robots à pattes, segment porté en industrie par Boston Dynamics, Unitree ou ANYbotics. Des approches concurrentes basées sur des VLAs (visual-language-action models) adressent des problèmes adjacents mais couvrent rarement à la fois la généralisation à des leaders arbitraires et la robustesse à l'occlusion. Il s'agit pour l'instant d'une contribution académique sans partenariat industriel annoncé, à distinguer d'un produit commercialisé ; les prochaines étapes naturelles seraient une validation sur des AMR différentiels ou des plateformes commerciales comme le Spot de Boston Dynamics.

RecherchePaper
1 source
Symétrie dynamique extrême : vers des robots omnidirectionnels et multifonctionnels
3141arXiv cs.RO 

Symétrie dynamique extrême : vers des robots omnidirectionnels et multifonctionnels

Des chercheurs ont publié sur arXiv (référence 2605.29254) une étude introduisant le concept de "symétrie dynamique" appliqué à la conception de robots, en proposant une métrique formelle baptisée "isotropie dynamique". Cette mesure quantifie l'uniformité des accélérations atteignables par le centre de masse d'un robot dans toutes les directions. L'équipe a évalué ce principe sur plus de 1 000 morphologies simulées et construit un prototype physique de la famille Argus, un robot sphérique à 20 pattes doté d'actionneurs linéaires orientés radialement. Ce variant physique a démontré une locomotion invariante à l'orientation, une traversée agile de terrains encombrés et déformables, une auto-stabilisation rapide, et une tolérance aux pannes partielles d'actionneurs. La perception omnidirectionnelle distribuée permet en outre l'interaction avec des objets en mouvement continu. Cette approche représente un changement de paradigme notable dans la conception de robots mobiles. Jusqu'ici, la symétrie en robotique se limitait essentiellement à la forme géométrique (bipèdes, quadrupèdes, hexapodes). Ici, elle est exploitée au niveau de la capacité d'actuation dynamique, ce qui produit des gains mesurables en suivi de trajectoire, taux de succès aux tâches, robustesse aux perturbations et efficacité énergétique, avec des bénéfices qui s'accentuent à mesure que l'isotropie dynamique approche sa limite théorique. Pour les intégrateurs industriels et les concepteurs de systèmes autonomes, cela ouvre une voie générale vers des robots multitâches opérant en environnements non structurés, sans reconfiguration matérielle. Le travail s'inscrit dans une tendance plus large de la recherche sur les morphologies non-conventionnelles, aux côtés de robots sphériques et à symétrie sphérique explorés depuis plusieurs années en contexte d'exploration planétaire. Côté compétitif, les architectures bimorphes dominantes (Boston Dynamics Spot, Unitree B2, bipèdes humanoïdes de Figure ou 1X) optimisent l'efficacité pour des tâches spécifiques mais peinent en cas de basculement ou de panne partielle. Le robot Argus 20-pattes offre une résilience structurelle supérieure, au prix d'une complexité mécanique élevée. L'article reste pour l'instant un preprint académique sans annonce de commercialisation ni pilote industriel identifié, et les performances présentées s'appuient sur des vidéos sélectionnées et des simulations, ce qui invite à la prudence avant toute extrapolation à des déploiements réels.

RecherchePaper
1 source
MARS Policy : la multimodalité uniquement quand c'est pertinent
3142arXiv cs.RO 

MARS Policy : la multimodalité uniquement quand c'est pertinent

Une équipe de recherche a déposé le 29 mai 2026 sur arXiv (ref. 2605.29766) une nouvelle politique d'apprentissage par imitation pour la manipulation robotique, baptisée MARS (Modality-Adaptive Robot Sampling). La méthode s'attaque à un compromis central dans les politiques génératives modernes : les modèles multi-modaux comme les politiques de diffusion capturent la diversité comportementale nécessaire à la manipulation complexe, mais au prix d'une latence d'inférence élevée et d'une complexité d'entraînement importante. MARS propose d'injecter de la stochasticité uniquement lors des phases où la diversité comportementale est réellement utile, et de basculer vers un mode déterministe pendant les phases à comportement unique. Sur 8 tâches en simulation et 4 tâches en conditions réelles, la politique affiche une amélioration du taux de succès de 16,67 % et une réduction de la latence d'inférence de 83,20 % par rapport aux baselines génératives classiques. L'enjeu est concret pour les intégrateurs et les équipes de déploiement terrain : les politiques de diffusion, malgré leurs performances, imposent des délais d'inférence de l'ordre de la centaine de millisecondes par pas de temps, ce qui limite leur applicabilité sur des robots à haute cadence ou des plateformes embarquées à ressources contraintes. MARS adresse ce goulet d'étranglement sans sacrifier la capacité multi-modale. Plus contre-intuitif encore : même sur des tâches quasi-déterministes, MARS surpasse les politiques purement déterministes, ce qui suggère que le diagnostic adaptatif de la modalité requise améliore également la modélisation des nuances comportementales, pas seulement la vitesse. Ce travail s'inscrit dans le courant post-Diffusion Policy (Chi et al., 2023, Columbia/MIT) et ACT (Zhao et al., 2023, Stanford), qui ont établi les politiques génératives comme paradigme dominant de l'apprentissage robot. Des approches concurrentes comme VQ-BeT ou BESO tentent également de réduire la complexité inférentielle des modèles génératifs ; MARS se distingue par son caractère adaptatif en ligne plutôt que par une architecture alternative fixe. En tant que preprint non encore évalué par les pairs, ces résultats restent à confirmer sur un spectre de tâches plus large et sur des plateformes hardware diversifiées. Les auteurs ne mentionnent ni feuille de route commerciale ni partenariat industriel à ce stade.

RecherchePaper
1 source
Hypothèses futures guidées par LLM pour une exploration à horizon temporel en manipulation robotique multi-étapes
3143arXiv cs.RO 

Hypothèses futures guidées par LLM pour une exploration à horizon temporel en manipulation robotique multi-étapes

Une équipe de recherche a publié fin mai 2026 un article (arXiv:2605.29864) présentant Future-Experience Conditioning (FEC), une méthode destinée à améliorer la manipulation robotique multi-étapes en conditionnant les politiques de contrôle sur de courtes vidéos futures générées synthétiquement. Le pipeline fonctionne en trois étapes : un raisonneur LLM opérant sur une ontologie de tâche initialisée depuis l'état courant de la scène, un jumeau numérique sans robot qui simule le mouvement attendu des objets, puis un modèle de diffusion vidéo sans masque qui synthétise un clip futur cohérent avec la configuration robotique, sans nécessiter de segmentation à l'inférence. Les expériences sont conduites sur deux benchmarks de simulation standards, RoboCasa et CALVIN, en comparant quatre conditions : absence de futur (NoFuture), futur de référence (GTFuture), futur généré (GenFuture) et futur incorrect (WrongFuture), avec trois familles de politiques testées, BC pur, BC+RL, et une Streaming Flow Policy (SFP). Les résultats indiquent que les futurs générés améliorent systématiquement les performances par rapport à l'absence de signal futur, tandis que des futurs incorrects dégradent l'apprentissage jusqu'à bloquer la progression à zéro sur l'ensemble de la courbe d'apprentissage. L'instantiation BC+RL obtient les meilleurs résultats globaux, et l'analyse sur 8 tâches CALVIN montre que GenFuture permet une convergence plus rapide et à un niveau supérieur à NoFuture. Ces résultats tendent à valider l'hypothèse que des vidéos futures imparfaites, mais structurellement cohérentes avec la tâche, constituent des priors utiles pour l'exploration en renforcement, même sans vérité terrain. C'est un résultat non trivial : la qualité du prior conditionne directement la qualité de l'exploration, ce qui renforce l'intérêt des modèles génératifs comme guides de politique plutôt que comme simples augmentations de données. FEC s'inscrit dans un courant actif qui cherche à exploiter les Video Language Models (VLMs) et les modèles de diffusion vidéo comme substituts aux simulateurs physiques pour la planification à horizon court. Des approches concurrentes comme UniSim, SuSIE ou les travaux de Dreamer en model-based RL avaient déjà exploré le conditioning sur des futurs imaginés, mais FEC se distingue par son pipeline modulaire évitant la segmentation à l'inférence, un obstacle pratique souvent sous-estimé en déploiement réel. Le projet dispose d'un site dédié (enact2026.github.io) et reste pour l'instant cantonné à la simulation, sans résultats sim-to-real publiés.

RechercheOpinion
1 source
XPeng présente sa gamme complète d'IA physique au salon automobile GBA 2026
3144Pandaily 

XPeng présente sa gamme complète d'IA physique au salon automobile GBA 2026

XPeng a présenté l'intégralité de sa gamme "physical AI" au salon automobile 2026 de la Grande Baie (Guangdong-Hong Kong-Macao Greater Bay Area Auto Show), organisé fin mai à Guangzhou. La démonstration centrale porte sur le système de conduite autonome end-to-end basé sur un réseau de neurones, que XPeng déploie en navigation assistée à l'échelle urbaine depuis plusieurs trimestres. L'entreprise expose également ses travaux en robotique humanoïde et en IA incarnée, articulés autour de trois briques techniques : perception, prise de décision et actuation. L'article source ne précise aucun nom de modèle robot, aucune métrique de charge utile ou de degré de liberté, ni aucun chiffre de déploiement, ce qui signale davantage un teaser de positionnement qu'un lancement produit documenté. Ce salon illustre une tendance structurelle dans l'industrie automobile chinoise : les constructeurs EV se requalifient en sociétés d'IA, avec des piles technologiques qui couvrent désormais la mobilité autonome, la robotique industrielle et l'IA embarquée. Pour les intégrateurs et décideurs B2B, ce mouvement signifie que les acteurs automobiles deviennent des concurrents directs des fournisseurs de robotique traditionnels. La convergence entre châssis, capteurs, compute embarqué et modèles de fondation réduit les barrières à l'entrée pour les déploiements humanoïdes en environnement industriel. Cela dit, l'absence de métriques concrètes dans la communication de XPeng interdit toute comparaison rigoureuse avec Figure (Figure 03), Boston Dynamics (Atlas), ou les plateformes chinoises comme Unitree ou Agibot. XPeng a été l'un des premiers constructeurs chinois à déployer la navigation assistée en ville à grande échelle, ce qui lui confère une base de données réelle conséquente pour entraîner ses modèles. La Baie de Canton concentre une part significative de l'écosystème EV-AI mondial, avec Shenzhen et Guangzhou comme noyaux de R&D et de chaîne d'approvisionnement. La concurrence directe inclut BYD, NIO, Li Auto et Xiaomi, tous engagés dans des investissements massifs en conduite autonome et en IA. La prochaine étape observable pour XPeng sera la publication de benchmarks concrets sur ses robots ou l'annonce de pilotes industriels chiffrés, seuls jalons permettant d'évaluer la portée réelle de cette stratégie "physical AI".

Chine/AsieOpinion
1 source
La recherche NVIDIA montre que des robots entraînés en simulation peuvent accomplir des tâches réelles
3145Interesting Engineering 

La recherche NVIDIA montre que des robots entraînés en simulation peuvent accomplir des tâches réelles

NVIDIA a présenté huit travaux de recherche en robotique à l'International Conference on Robotics and Automation (ICRA) 2026, tous centrés sur la réduction du "sim-to-real gap" -- l'écart de performance entre un robot entraîné en simulation et ce même robot confronté au monde physique. Parmi les systèmes mis en avant, COMPASS entraîne des robots exclusivement dans Isaac Lab (le simulateur NVIDIA) avant de transférer les politiques apprises vers des corps physiques différents. Sur 20 essais réels impliquant des robots mobiles autonomes et des humanoïdes, le framework atteint un taux de succès de 80 % en navigation, soit 4,5 fois supérieur aux baselines par imitation learning. Le système Grasp-MPC, dédié à la préhension en environnement encombré, a été entraîné sur 2 millions de trajectoires simulées couvrant 8 000 objets distincts, et atteint 75 % de succès sur des objets inconnus contre 41 % pour les méthodes de référence. Le framework SPARR, appliqué à l'assemblage industriel, découpe la tâche en deux couches -- une politique apprise en sim, corrigée en temps réel sur le hardware réel -- et affiche 38 % de gain sur le taux de succès d'assemblage et 30 % de réduction du temps de cycle par rapport aux baselines zero-shot sim-to-real. Enfin, PEEK améliore l'attention visuelle des robots (filtrage du bruit visuel non pertinent), avec une précision multipliée jusqu'à 41 fois pour des politiques purement simulées. Une collaboration avec Carnegie Mellon, l'Université de l'Utah et l'Université de Sydney a produit SEAL, un framework qui contraint le robot à n'exécuter que les séquences d'actions cohérentes avec son raisonnement planifié. Ces résultats sont significatifs pour les intégrateurs et les décideurs industriels, car ils montrent que le sim-to-real gap -- longtemps considéré comme le verrou structurel de la robotique apprise -- commence à se refermer de façon mesurable, au moins en conditions de laboratoire. Le gain de 30 % sur le temps de cycle (SPARR) est un chiffre qui parle directement aux opérateurs de lignes d'assemblage. Il convient cependant de nuancer : les taux de succès rapportés (75-80 %) sont mesurés dans des protocoles contrôlés par les chercheurs eux-mêmes, sans déploiement industriel validé en production. Les vidéos sélectionnées pour illustrer ces travaux suivent les conventions habituelles des communications académiques, qui ne montrent pas les échecs. La progression reste réelle, mais le passage de 80 % à 99 % de fiabilité -- seuil requis pour la plupart des applications industrielles critiques -- reste un problème ouvert. NVIDIA positionne cette recherche comme la couche logicielle et de simulation de son écosystème robotique plus large, qui inclut Isaac Lab, Isaac GR00T X Embodiment Sim et Omniverse NuRec. La compagnie ne fabrique pas de robots mais ambitionne de devenir l'infrastructure sur laquelle l'industrie entraîne ses systèmes, face à des concurrents comme Google DeepMind (avec ses travaux sur RT-2 et Gemini Robotics), Meta (V-JEPA) et Physical Intelligence (pi0). Sur le segment de la simulation pour la robotique, des acteurs comme Mujoco (DeepMind) et Genesis (MIT/CMU) occupent également le terrain. Les prochaines étapes annoncées par NVIDIA passent par l'extension des datasets ouverts et la montée en échelle des plateformes de simulation, sans timeline de commercialisation précisée pour les frameworks présentés à l'ICRA.

IA physiquePaper
1 source
Vidéo : un humanoïde chinois à 13 000 dollars pour démocratiser la robotique avancée
3146Interesting Engineering 

Vidéo : un humanoïde chinois à 13 000 dollars pour démocratiser la robotique avancée

Astribot, startup robotique de Shenzhen également connue sous le nom Stardust Intelligence, a ouvert les commandes de son humanoïde T1 à partir de 13 000 dollars, soit environ sept fois moins cher que son propre modèle phare S1 vendu près de 100 000 dollars. Le T1 est un humanoïde à base roulante de 155 cm pour 66 kg, doté de 23 degrés de liberté hors effecteurs, avec une capacité de charge de 5 kg par bras. Son architecture motrice repose sur des câbles tendus, la même approche que le S1, conçue pour produire des mouvements plus fluides qu'un entraînement par engrenages traditionnels. Il accepte des pinces robotiques standard et des mains à cinq doigts pour la manipulation fine, et cible des applications comme la cuisine, les opérations en laboratoire, le pliage du linge, le tri de pièces automobiles et la recharge de véhicules électriques. L'IA embarquée est entraînée principalement par démonstration humaine plutôt que par téléopération, une méthode d'imitation learning qui permet au robot d'apprendre des workflows en observant un opérateur humain. Le seuil des 13 000 dollars modifie le calcul économique pour les intégrateurs et les équipes qui souhaitent piloter l'humanoïde en environnement industriel. À titre de comparaison, le Unitree G1 reste l'une des rares références sous 20 000 dollars sur le marché mondial; les offres Figure 03, Agility Digit ou Boston Dynamics Electric Atlas se négocient bien au-delà. Si le T1 tient ses performances hors laboratoire, il pourrait abaisser la barrière d'entrée pour des secteurs à marges serrées comme la logistique légère ou l'assemblage à faible volume. Il convient cependant d'être prudent: Astribot liste des tâches réussies sans publier de métriques de cadence ni de données de robustesse en conditions industrielles réelles, et les vidéos de démonstration restent sélectionnées par l'entreprise. C'est une ouverture de commandes, pas un déploiement en volume documenté. Fondée en 2022 et basée à Shenzhen, Astribot s'est fait connaître à la World Robot Conference de Pékin en août 2024 avec le S1, humanoïde bimanuel de 170 cm et 90 kg aux 23 DOF (7 par bras, 4 pour le torse, 2 pour la tête, 3 pour la base omnidirectionnelle). Une publication arXiv de juillet 2025 détaillait la suite logicielle Astribot Suite, combinant collecte de données en réalité virtuelle, politiques d'imitation learning et optimisation de trajectoire en temps réel, avec des taux de réussite annoncés entre 80 et 100% sur tâches sélectionnées. La startup a levé environ 100 millions de dollars depuis 2024. Sur le segment prix du T1, les concurrents directs incluent le Unitree G1 et, dans une moindre mesure, les robots de recherche comme le GR00T N2 de NVIDIA. Aucun acteur européen ne se positionne encore clairement sur ce créneau accessible. La démonstration de robustesse en milieu non contrôlé et l'annonce de premiers clients industriels constitueront les prochaines étapes décisives pour valider l'ambition commerciale d'Astribot.

HumanoïdesOpinion
1 source
L'essor des cobots dans la fabrication métallique et la construction
3147Robotics Business Review 

L'essor des cobots dans la fabrication métallique et la construction

Les cobots représentent désormais 18 % du total des unités robotiques vendues en Amérique du Nord, selon le dernier rapport de l'Association for Advancing Automation (A3), avec environ 90 % des commandes provenant de secteurs non automobiles : agroalimentaire, biens de consommation, semi-conducteurs, électronique et sciences du vivant. C'est dans ce contexte de croissance record que Hirebotics, entreprise fondée à Nashville en 2015 par Matt Bush et Rob Goldiez, positionne ses solutions de cobots pour la fabrication métallique, le palettising et la construction de data centers. Leur produit phare, Beacon, est une plateforme cloud qui permet aux soudeurs, opérateurs de découpe et de peinture d'enseigner, piloter et surveiller un bras collaboratif via une application mobile, sans ligne de code ni compétence en programmation. La plateforme a servi de socle au Cobot Welder, lancé en 2021, et au BotX, le premier cobot de soudage en mode locatif (rental), développé en partenariat avec Red-D-Arc. L'enjeu derrière cette approche dépasse le produit : il s'agit de répondre à une pénurie structurelle de main-d'oeuvre qualifiée dans la fabrication industrielle, un problème que Bush et Goldiez ont vécu directement depuis les années 1990. La complexité de programmation des premiers cobots freinait l'adoption, notamment dans les PME métallurgiques qui n'ont pas d'ingénieurs dédiés à l'automatisation. En "productisant" le cobot en solution clé en main orientée opérateur, Hirebotics contribue à un changement de paradigme que l'on observe désormais chez les grands constructeurs : Universal Robots, par exemple, présente aujourd'hui majoritairement des configurations prêtes à l'emploi dans ses démonstrations, là où il y a dix ans les stands n'exposaient que des bras nus. Ce glissement vers l'accessibilité valide l'hypothèse que la barrière à l'entrée de la robotique collaborative n'est plus mécanique, mais logicielle et ergonomique. Hirebotics a été fondée en 2015 à l'intersection de deux vagues technologiques alors naissantes : les cobots à limitation de force et de puissance (bras capables de travailler sans cage de sécurité), et le cloud computing industriel. La société s'est d'abord appuyée sur des applications de machine tending et d'assemblage avant de se spécialiser dans le soudage. Rob Goldiez, cofondateur, a passé la main à Matt Bush en début d'année 2026. Sur le plan concurrentiel, le marché des cobots de soudage est disputé entre des intégrateurs spécialisés comme Hirebotics, des constructeurs OEM tels qu'Universal Robots (Danemark, filiale de Teradyne) ou FANUC, et des startups verticalisées comme Vectis Automation ou Genesis Systems. Le segment de la construction de data centers, cité comme nouveau vecteur de croissance, reste encore peu robotisé, ce qui représente une fenêtre d'opportunité pour des solutions cobots adaptées à des environnements moins standardisés que l'atelier industriel classique.

IndustrielOpinion
1 source
Entreprise chinoise dévoile un robot humanoïde compact avec 42 degrés de liberté et 100 TOPS de puissance de calcul
3148Interesting Engineering 

Entreprise chinoise dévoile un robot humanoïde compact avec 42 degrés de liberté et 100 TOPS de puissance de calcul

KEENON Robotics, entreprise shanghaïenne spécialisée dans les robots de service autonomes, a officiellement lancé le XMAN-L1, un robot humanoïde compact destiné aux environnements d'accueil et d'interaction commerciale. Mesurant 136 cm pour un gabarit délibérément contenu, l'XMAN-L1 embarque 42 degrés de liberté biomimétiques, un couple de genou de 132 Nm, une puissance supérieure à 2 000 W par jambe, et une capacité de calcul embarqué de 100 TOPS en inférence locale. Pour la couche conversationnelle, KEENON a intégré les LLMs de Doubao (ByteDance) et de Tencent, permettant un dialogue en langage naturel sans connexion cloud obligatoire. La société annonce le robot comme commercialement disponible immédiatement, avec des cas d'usage ciblés : réception de visiteurs, guidage, animation interactive et présence en espace public. Aucun prix public n'a été communiqué à ce stade. Ce lancement illustre une tendance de fond dans l'industrie robotique chinoise : intégrer des spécifications techniques auparavant réservées aux plateformes de recherche dans des formats de service compacts et déployables à grande échelle. Les 100 TOPS de computing edge sont un signal clair -- le robot est conçu pour fonctionner de manière autonome dans des environnements bruités sans dépendre d'une infrastructure cloud latente, ce qui est un prérequis réel pour l'hôtellerie et le retail. L'intégration native de deux LLMs chinois (Doubao et Tencent) plutôt qu'une API générique constitue un choix de souveraineté technologique cohérent avec le marché domestique visé. Il faut cependant noter que les métriques de mobilité annoncées -- couple et puissance -- ne sont pas accompagnées de données de cycle ou de tests en charge réelle, une réserve habituelle sur ce type d'annonce de lancement. KEENON est historiquement l'un des leaders mondiaux du robot de livraison indoor, avec des gammes bien établies : DINERBOT pour la restauration, BUTLERBOT pour l'hôtellerie, et la série T pour la logistique industrielle. L'XMAN-L1 s'inscrit dans sa série humanoïde XMAN, aux côtés de l'XMAN-R1 (recherche et collaboration homme-robot) et de l'XMAN-F1 (déploiement commercial en réception). Sur le marché humanoïde de service à format compact, KEENON se positionne face à des acteurs comme Enchanted Tools (France, robot Miroki), Unitree (H1/G1) ou encore Fourier Intelligence, tous engagés sur des niches similaires. Les plateformes à vocation industrielle lourde -- Figure 03, Optimus Gen 3, Atlas -- ne ciblent pas encore ce segment. Pour les intégrateurs B2B en hôtellerie ou retail, l'XMAN-L1 représente une option à surveiller, à condition que KEENON publie des données de fiabilité terrain dans les prochains mois de déploiement.

Chine/AsieOpinion
1 source
Votre guide pour le dernier jour du Robotics Summit & Expo 2026
3149The Robot Report 

Votre guide pour le dernier jour du Robotics Summit & Expo 2026

La deuxième et dernière journée du Robotics Summit & Expo 2026 s'est tenue le 28 mai à Boston, au Thomas M. Menino Convention & Exhibition Center. La matinée a débuté à 8h00 par un petit-déjeuner "Women in Robotics" affiché complet, réunissant Joyce Sidopoulos, cofondatrice et COO de MassRobotics, et Mikell Taylor, directrice de la stratégie robotique chez General Motors. Brian Gerkey, président du conseil d'Open Robotics et CTO d'Intrinsic, a ouvert les keynotes à 9h05 avec "An Open Foundation for the Age of AI-Powered Robots", suivi à 10h00 par Taylor sur "What Makes a Robot Worthy?". Le hall d'exposition a fermé à 15h00, et Noland Arbaugh, premier utilisateur d'une interface cerveau-ordinateur Neuralink, a assuré la keynote de clôture à 15h30. Les sessions de breakout de la journée ont couvert l'intégration d'AMR (autonomous mobile robots) en entrepôt (Greg Meyne, enVista), le déploiement AMR de Tesla dans les usines américaines existantes (Joshua Joseph), la productisation de l'IA robotique dans un panel réunissant Anders Beck d'Universal Robots, Dave Coleman de PickNik Robotics et Andy Lonsberry de Path Robotics, les capteurs force-couple en production (Ryan Young, HBK), et la latence en chirurgie à distance (Darren Porras, Healthcare Real-Time Innovations). Le programme de cette journée de clôture traduit un pivot du secteur vers le déploiement concret plutôt que la démonstration conceptuelle. La session Tesla sur les usines "legacy" est particulièrement significative : Joshua Joseph y présente un retour terrain sur l'intégration d'AMR dans des infrastructures industrielles préexistantes, avec leurs contraintes réelles d'interopérabilité et de connectivité, un sujet que les conférences robotiques évitent souvent au profit des environnements greenfield. La tension entre promesse des modèles VLA (vision-language-action) et fiabilité en production ressort du panel sur la productisation de l'IA, tandis qu'Ariana Eisenstein, fondatrice et CTO de Pickle Robot, apporte un angle pragmatique avec son retour d'expérience sur la transition lab-to-field, étape critique souvent sous-documentée dans les publications académiques et industrielles. Le Robotics Summit & Expo, organisé par The Robot Report, est le principal rendez-vous américain des développeurs de robotique commerciale. MassRobotics, le hub robotique de Boston, en est le partenaire institutionnel central, avec un career fair, un healthcare startup showcase en cinquième édition, et le programme Women in Robotics. L'édition 2026 confirme plusieurs dynamiques de fond : la convergence autour des middlewares ouverts portés par Intrinsic et Open Robotics, la montée en puissance des AMR en logistique, et l'irruption des interfaces cerveau-machine comme vecteur d'attention au-delà du public industriel. Aucun acteur français ou européen ne figure dans le programme publié, confirmant que l'événement reste très ancré dans l'écosystème nord-américain, avec une présence marquée des grands industriels (GM, Tesla, Texas Instruments) aux côtés des pure players robotique comme Universal Robots ou Path Robotics.

IndustrielActu
1 source
Alibaba et Tencent mènent le virage de l'IA incarnée pour la robotique
3150SCMP Tech 

Alibaba et Tencent mènent le virage de l'IA incarnée pour la robotique

Alibaba et Tencent ont annoncé un virage stratégique majeur : déployer leurs modèles d'IA générative dans des systèmes robotiques physiques, plutôt que de rester cantonnés aux interfaces conversationnelles. Alibaba a lancé la semaine dernière le modèle Qwen3.7-Max, doté de capacités dites de "tool-calling" qui lui permettent de fonctionner comme cerveau numérique d'un robot, en orchestrant des composants logiciels et matériels externes. Concrètement, le modèle peut déclencher des séquences d'actions physiques comme la navigation autonome, le bras articulé ou la prise d'objet, sans reprogrammation manuelle à chaque tâche. Ce positionnement signale un déplacement du front concurrentiel de l'IA en Chine : la différenciation ne se joue plus sur les benchmarks de raisonnement textuel, mais sur la capacité des VLA (Vision-Language-Action models) à passer du simulateur à l'environnement réel. Pour les intégrateurs industriels et les décideurs B2B, cela implique que des briques d'IA disponibles en open ou semi-open source pourraient bientôt remplacer des stacks robotiques propriétaires coûteux, accélérant les cycles de déploiement tout en abaissant les barrières à l'entrée. Alibaba avait déjà positionné la famille Qwen comme alternative aux modèles occidentaux, avec des versions multimodales compétitives face à GPT-4o et Gemini. Tencent suit une trajectoire similaire avec ses propres initiatives robotiques encore peu documentées publiquement. Les deux groupes se retrouvent en concurrence directe avec Figure AI, Physical Intelligence (pi0), Boston Dynamics et Unitree, ainsi qu'avec les efforts de Nvidia (GR00T N2) pour standardiser les pipelines d'entraînement robotique. Les prochaines étapes annoncées restent pour l'instant au stade de la démonstration technique, sans déploiement industriel confirmé.

Chine/AsieOpinion
1 source