Aller au contenu principal

Actualités robotique — page 73

4 572 articles au fil, du plus récent au plus ancien.

SCAR : apprentissage auto-supervisé de représentations d'actions continues
3601arXiv cs.RO 

SCAR : apprentissage auto-supervisé de représentations d'actions continues

Une équipe de chercheurs a publié début mai 2026 sur arXiv (référence 2605.16412) un framework baptisé SCAR, pour Self-Supervised Continuous Action Representation Learning, visant à apprendre des représentations d'actions unifiées et transférables entre différents robots à partir de simples transitions visuelles. L'architecture repose sur un backbone génératif préentraîné, couplé à deux modules complémentaires : un modèle de dynamique inverse (IDM) qui infère des actions latentes à partir de paires d'observations, et un modèle de dynamique directe (FDM) qui prédit les états futurs conditionnés sur ces actions latentes. Pour éviter que l'espace latent ne devienne un simple goulot d'étranglement visuel générique, les auteurs régularisent la distribution postérieure des actions vers un prior gaussien standard, et introduisent une contrainte d'invariance adversariale pour supprimer les facteurs propres à chaque morphologie de robot ou à chaque environnement. Les expériences sont conduites sur les benchmarks Procgen et Robotwin, et montrent que SCAR surpasse les actions brutes spécifiques à chaque embodiment comme interface de conditionnement pour les world models, notamment en régimes de faibles données. L'enjeu industriel est significatif : l'un des verrous les plus coûteux du déploiement robotique est précisément le besoin de recollecte massive de données à chaque changement de plateforme matérielle. Si une représentation d'action partagée peut effectivement abstraire le "changement contrôlable" indépendamment de l'actuation physique, les intégrateurs pourraient réutiliser des world models pré-entraînés sur un robot pour en adapter un autre avec beaucoup moins d'exemples. SCAR apporte un argument empirique au débat sur la transférabilité des VLA (Vision-Language-Action models) : là où des architectures comme pi-0 ou GR00T N2 s'appuient sur des actions en espace proprioceptif brut, l'approche latente supervisée de façon auto-cohérente pourrait constituer une interface de conditionnement plus robuste. Le contexte est celui d'une compétition intense autour des world models pour la robotique, portée côté industrie par des acteurs comme Physical Intelligence (pi-0), NVIDIA (GR00T), et Figure AI, et côté académique par des travaux sur les modèles d'espace d'état et les représentations de politique. SCAR se distingue en traitant l'action non comme un signal de contrôle auxiliaire mais comme un facteur représentationnel à part entière, ce qui est une position théorique distincte des approches VLA classiques. Les auteurs ne mentionnent pas de code public ni de partenariat industriel dans la prépublication, et les résultats restent à confirmer sur des benchmarks physiques réels, Procgen et Robotwin étant deux environnements de simulation. L'absence de métriques sur du matériel réel est à garder à l'esprit avant toute extrapolation vers des cas industriels.

RechercheOpinion
1 source
Priorité aux gestes, voix assistée par LLM : téléopération 'Puppeteer' via un double virtuel en réalité augmentée
3602arXiv cs.RO 

Priorité aux gestes, voix assistée par LLM : téléopération 'Puppeteer' via un double virtuel en réalité augmentée

Une équipe de chercheurs a publié sur arXiv (2506.13189) une étude comparative portant sur la téléopération de robots via réalité augmentée. Leur système, baptisé "puppeteer", utilise un casque Meta Quest 3 pour permettre à un opérateur de piloter un robot physique en interagissant avec son jumeau virtuel superposé dans l'espace réel. Deux modalités ont été testées en protocole intra-sujet avec 42 participants : geste seul (GO) et combinaison voix assistée par grand modèle de langage (LLM) plus geste (VG), sur une tâche de pick-and-place avec correspondance de motifs. Dans la condition VG, la voix gérait la navigation de haut niveau tandis que le geste assurait la manipulation fine, selon une allocation séquentielle des rôles et non une interaction simultanée. Les résultats montrent que la modalité geste seul offre actuellement un contrôle plus fiable et plus efficace pour les tâches à contrainte temporelle forte. L'ajout de commandes vocales via LLM introduit de la flexibilité mais génère une latence supplémentaire et des erreurs de reconnaissance qui augmentent la charge cognitive de l'opérateur. Ce constat nuance une hypothèse courante dans la communauté HRI (human-robot interaction) : l'accumulation de modalités n'est pas universellement bénéfique. Pour les intégrateurs et décideurs industriels, cela signifie que la multimodalité doit être traitée comme une stratégie adaptative, calibrée au profil de l'utilisateur et à la nature de la tâche. L'étude révèle par ailleurs que l'expertise robotique préalable des participants différencie significativement les performances et l'expérience utilisateur selon les conditions. La téléopération par réalité augmentée s'inscrit dans un effort plus large visant à abaisser la barrière d'entrée au pilotage de robots pour des opérateurs non spécialisés. Des approches concurrentes incluent la téléopération en vue subjective (first-person), les interfaces haptiques et les méthodes d'apprentissage par démonstration directe. La métaphore "puppeteer" se distingue par l'usage d'un double virtuel colocalisé, distinct des flux vidéo classiques. Les auteurs formalisent leurs conclusions en un ensemble de directives de conception pour ce type d'interface, insistant sur la nécessité d'adapter dynamiquement les modalités disponibles au contexte d'usage. Les prochaines étapes naturelles concerneront des tests sur des robots à degrés de liberté (DOF) plus élevés et des environnements industriels réels, au-delà du cadre contrôlé de laboratoire.

RecherchePaper
1 source
PLATO Hand : des ongles pour affiner le comportement de contact et améliorer la précision de la saisie
3603arXiv cs.RO 

PLATO Hand : des ongles pour affiner le comportement de contact et améliorer la précision de la saisie

La PLATO Hand, présentée dans un article de recherche en prépublication sur arXiv (février 2026), est une main robotique dextère dont le bout de doigt hybride combine trois composants mécaniques : un ongle rigide, une phalange distale intégrée et une pulpe souple. Cette architecture organise la manière dont le contact est initié, soutenu et transmis lors de la manipulation, sans capteurs tactiles externes. Pour dimensionner ce bout de doigt, les auteurs ont développé un modèle basé sur l'énergie de déformation (bending-indentation model) reliant la rigidité des matériaux à la répartition des déformations au point de contact. En validation expérimentale, la main a exécuté avec succès trois tâches de manipulation fine sensibles aux arêtes : la singulation de feuilles de papier (séparer une feuille d'une pile), le ramassage de cartes à jouer et l'épluchage d'une orange. Les résultats montrent une meilleure stabilité en pince (pinch stability), une meilleure transmission des forces de contact en configuration dorsale via l'ongle, et une observabilité proprioceptive améliorée, c'est-à-dire une meilleure capacité à déduire les forces de contact à partir des retours articulaires internes. Ces résultats intéressent directement les concepteurs de systèmes de manipulation industrielle, car ils indiquent qu'une couche de conception mécanique au niveau du contact peut améliorer la robustesse de la manipulation fine sans multiplier les capteurs. L'observabilité proprioceptive améliorée est particulièrement notable : estimer les forces de contact depuis les actionneurs existants réduit la dépendance aux capteurs tactiles distribués, coûteux et fragiles en environnement de production. La démonstration sur des tâches comme l'épluchage d'orange ou la singulation de papier cible explicitement le fossé entre démonstration robotique en laboratoire et applicabilité industrielle réelle, un des verrous les plus cités dans le secteur. La PLATO Hand s'inscrit dans un courant de recherche sur les mains dextères hybrides, à mi-chemin entre les approches entièrement rigides (Shadow Hand, Allegro Hand, LEAP Hand) et les mains entièrement souples. Ces mains existantes n'intègrent pas de structuration spécifique de la surface de contact au niveau distal ; la PLATO Hand y ajoute une couche inspirée de la morphologie humaine. Le travail reste à ce stade une démonstration de laboratoire en prépublication (version v2), sans annonce de commercialisation ni de partenariat industriel confirmé. Les suites naturelles incluent l'intégration sur un bras complet et des tests de durabilité en conditions réelles, deux étapes indispensables avant toute validation industrielle.

RecherchePaper
1 source
Au-delà de la géométrie : navigation topologique efficace dans des environnements 3D complexes
3604arXiv cs.RO 

Au-delà de la géométrie : navigation topologique efficace dans des environnements 3D complexes

Des chercheurs ont publié sur arXiv (réf. 2605.17302) un framework de planification de trajectoire pour robots mobiles terrestres opérant dans des environnements intérieurs 3D complexes. Le système extrait automatiquement depuis un nuage de points 3D un espace d'états réduit composé uniquement des positions physiquement atteignables par le robot, en appliquant trois contraintes successives : support au sol vérifié, dégagement vertical suffisant pour la hauteur du robot, et connectivité sémantique via propagation par graine (seed-based). Évalué sur cinq scènes issues du dataset Matterport3D et trois scènes du benchmark PCT, le framework atteint une réduction de l'espace d'états supérieure à 80 % par rapport au voxel space brut, avec des temps de recherche A* inférieurs à la milliseconde sur les scènes Matterport3D. Le taux de succès de planification est de 100 % sur 300 requêtes testées. L'enjeu technique central que ce travail adresse est l'ambiguïté géométrique : dans un environnement intérieur dense, les surfaces de meubles (tables, étagères) partagent localement les mêmes propriétés géométriques que le sol navigable. Les approches purement géométriques confondent fréquemment ces surfaces, générant des trajectoires invalides ou des blocages de planification. En imposant une contrainte topologique explicite plutôt que de s'appuyer uniquement sur la courbure ou la normale de surface, le framework sépare structurellement le sol du reste. Pour les intégrateurs de flottes AMR ou AGV en entrepôt ou milieu hospitalier, cette distinction fiable entre navigable et non-navigable sans calibrage manuel représente un gain opérationnel direct, en particulier dans des espaces reconfigurés fréquemment. Ce type d'approche s'inscrit dans un mouvement plus large visant à dépasser les représentations voxel denses, trop coûteuses pour la planification temps-réel embarquée. Des travaux concurrents explorent les champs de distance neuronaux (NeRF-based planning), les graphes de visibilité sur maillages 3D, ou les approches d'apprentissage par renforcement simulé (sim-to-real). Le recours à des datasets standardisés comme Matterport3D et PCT facilite la comparaison reproductible, même si les scènes testées restent des environnements statiques sans agents dynamiques. Les auteurs n'annoncent pas de déploiement matériel, ce qui positionne ce travail comme une contribution algorithmique amont, dont l'intégration dans des stacks robotiques industriels (ROS 2, Nav2) reste à démontrer sur robot physique.

RecherchePaper
1 source
Apprentissage par renforcement guidé pour les sauts omnidirectionnels en 3D dans les robots quadrupèdes
3605arXiv cs.RO 

Apprentissage par renforcement guidé pour les sauts omnidirectionnels en 3D dans les robots quadrupèdes

Une équipe de chercheurs a publié sur arXiv (référence 2507.16481, troisième version) une méthode d'apprentissage par renforcement guidé destinée à permettre aux robots quadrupèdes d'effectuer des sauts omnidirectionnels en trois dimensions. L'approche combine des courbes de Bézier, classiquement utilisées pour la planification de trajectoires lissées, avec un modèle de mouvement rectiligne uniformément accéléré (UARM), qui encode une intuition physique du saut directement dans la boucle d'entraînement. Les résultats sont validés en simulation et sur robot réel, mais le résumé ne précise ni la plateforme matérielle utilisée ni les métriques chiffrées de performance, ce qui limite l'évaluation indépendante de la contribution. L'intérêt principal de ce travail réside dans l'adresse simultanée de deux limitations majeures des approches existantes. Les méthodes d'optimisation classiques (MPC, trajectory optimization) produisent des sauts contrôlables mais exigent une connaissance fine des paramètres du robot et du terrain, ce qui fragilise leur robustesse en conditions réelles. À l'inverse, l'apprentissage par renforcement bout-en-bout souffre d'une complexité d'échantillonnage élevée, de millions de simulations nécessaires, et d'une imprévisibilité des trajectoires qui complique la certification de sécurité, un prérequis non négociable pour les déploiements industriels. En injectant une structure physique dans la boucle d'entraînement, les auteurs visent à réduire le coût d'apprentissage tout en produisant des mouvements explicables, dont la logique peut être auditée et certifiée. Le saut dynamique pour robots quadrupèdes est un problème ouvert depuis plusieurs années, car il concentre les défis du transfert sim-to-réel : contacts impulsionnels, rigidité des actionneurs, imprécision des estimations d'état. Le Robotics Systems Lab d'ETH Zurich (ANYmal) et les équipes de l'UC Berkeley ont déjà démontré des sauts via RL pur, tandis que Boston Dynamics et Unitree intègrent ces capacités dans leurs plateformes commerciales. Ce papier s'inscrit dans la tendance des approches hybrides modèle-apprentissage, qui cherchent à concilier la robustesse du RL avec la prévisibilité des méthodes analytiques, une direction que poursuivent également des équipes européennes comme le LAAS-CNRS ou l'INRIA.

RecherchePaper
1 source
AffordVLA : intégration de représentations d'affordance dans les modèles vision-langage-action (VLA) par alignement implicite de caractéristiques
3606arXiv cs.RO 

AffordVLA : intégration de représentations d'affordance dans les modèles vision-langage-action (VLA) par alignement implicite de caractéristiques

Des chercheurs ont déposé en mai 2026 sur arXiv (arXiv:2605.17517) un papier présentant AffordVLA, un framework qui améliore la précision des modèles Vision-Langage-Action (VLA) en robotique de manipulation. Le problème central: les VLA actuels encodent l'apparence globale des objets mais peinent à localiser les zones d'interaction fonctionnelle, les affordances, telles que le point de préhension ou la surface de contact optimale. AffordVLA injecte ces représentations d'affordance directement dans les couches visuelles intermédiaires du VLA via un alignement implicite, sans annotation supplémentaire ni module de perception externe. Un "teacher" d'affordance zero-shot extrait des cartes fonctionnelles conditionnées par l'instruction en langage naturel, puis les aligne avec les représentations internes du modèle pendant l'entraînement. Les expériences en simulation et en environnement réel rapportent des performances supérieures aux baselines, avec un taux de succès en manipulation amélioré, sans que l'abstract ne publie de métriques absolues chiffrées. Ce gap entre apparence globale et localisation fonctionnelle est l'un des facteurs limitants du sim-to-real gap en manipulation non structurée: les systèmes réussissent en laboratoire contrôlé mais échouent dès que l'éclairage, le fond ou la pose de l'objet varient. En internalisant la perception d'affordance dans le VLA lui-même, AffordVLA évite les erreurs en cascade des architectures hybrides couplant un VLA à un module de segmentation externe, et n'alourdit pas le temps d'inférence, un critère déterminant pour les déploiements industriels en temps réel. La suppression de la dépendance aux masques annotés réduit également le coût de mise en données pour les intégrateurs, ce qui élargit la portée pratique de l'approche. AffordVLA s'inscrit dans l'accélération des travaux académiques autour des VLA depuis RT-2 (Google DeepMind, 2023), dans un secteur aujourd'hui dominé par des systèmes propriétaires comme Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) et Helix (Figure AI). Ce courant cherche à améliorer le grounding spatial sans refonte architecturale complète, une approche plus accessible pour les laboratoires sans les moyens de Physical Intelligence ou de Figure. Le papier reste un preprint non peer-reviewed; aucun partenariat industriel ni déploiement terrain n'est mentionné. La suite logique serait une validation sur des benchmarks standardisés comme BridgeV2 ou OpenX-Embodiment, et une intégration dans des pipelines open-source comme LeRobot ou OpenVLA.

RechercheOpinion
1 source
FAM-HRI : interaction humain-robot multimodale assistée par modèle fondation, combinant regard et parole
3607arXiv cs.RO 

FAM-HRI : interaction humain-robot multimodale assistée par modèle fondation, combinant regard et parole

Une équipe de chercheurs a publié en mars 2025 sur arXiv (référence 2503.16492, troisième révision) FAM-HRI, un framework multimodal d'interaction humain-robot combinant le suivi du regard et la parole via des modèles de fondation. Le système s'appuie sur les lunettes Meta ARIA, un dispositif de recherche léger, pour capturer en temps réel les signaux visuels et vocaux de l'utilisateur. Ces données sont fusionnées par un grand modèle de langage (LLM) qui interprète l'intention de l'utilisateur en la croisant avec le contexte visuel de la scène, permettant au robot d'identifier et manipuler des objets désignés par le regard. Un algorithme dédié détermine l'intervalle temporel de fixation oculaire afin de filtrer le bruit inhérent aux mouvements naturels des yeux. Les auteurs rapportent un "taux de succès élevé" et un "temps d'interaction faible" lors des évaluations expérimentales, sans publier de métriques chiffrées précises dans le résumé, ce qui limitera la comparabilité directe avec d'autres systèmes. L'enjeu de FAM-HRI dépasse la performance brute : le système cible explicitement les utilisateurs souffrant de handicaps moteurs ou de mobilité réduite, une population pour laquelle les interfaces gestuelles classiques sont inutilisables et les commandes vocales seules insuffisamment précises pour la manipulation spatiale. En fusionnant regard et parole au niveau sémantique via un LLM, l'architecture évite les ambiguïtés typiques des commandes monocanal, comme "prends l'objet" sans désignation claire. C'est un pas concret vers des robots d'assistance utilisables en conditions réelles, où la robustesse à l'imprécision humaine prime sur la performance en environnement contrôlé. La combinaison regard-parole pour le contrôle robotique n'est pas nouvelle, mais l'intégration de LLMs pour la fusion contextuelle représente une évolution récente, rendue possible par la réduction des coûts d'inférence. Les lunettes Meta ARIA, conçues initialement pour la recherche en réalité augmentée, trouvent ici une application robotique directe. Les concurrents dans l'espace HRI multimodal incluent des travaux issus de CMU, ETH Zurich et d'équipes japonaises comme Preferred Networks et l'AIST. L'ensemble du code et des algorithmes est publié en open source sur GitHub, ce qui facilitera la reproductibilité. Les prochaines étapes naturelles seraient une validation en conditions cliniques ou à domicile, et une extension à des plateformes mobiles au-delà de la manipulation fixe.

RecherchePaper
1 source
LACE : représentation visuelle latente pour l'apprentissage multi-robots
3608arXiv cs.RO 

LACE : représentation visuelle latente pour l'apprentissage multi-robots

Une équipe de chercheurs a publié en mai 2026 sur arXiv (référence 2605.16743) un cadre d'apprentissage appelé LACE (Latent Visual Representation for Cross-Embodiment Learning), conçu pour réduire le fossé visuel entre démonstrations humaines et politiques robotiques. Les backbones d'apprentissage auto-supervisé (SSL) comme DINOv2 encodent une riche sémantique d'objets généraux, mais échouent à établir des correspondances spatiales entre mains humaines et mains robotiques. LACE aligne les représentations visuelles des deux embodiments dans l'espace latent de ces backbones, en utilisant comme supervision clairsemée les correspondances entre parties corporelles partagées, obtenues automatiquement par cinématique directe (forward kinematics). Une seule démonstration robot suffit à entraîner le modèle. L'évaluation rapporte un gain de 65 % en transfert zéro-shot pour LACE-DINO face à DINO seul, avec des améliorations consistantes en régimes de faibles données et en environnements hors-distribution. Ce résultat touche l'un des goulets d'étranglement les plus concrets du déploiement robotique: la pénurie de démonstrations robot. Collecter des trajectoires téléopérées coûte cher et ralentit l'itération. Si l'alignement inter-embodiment de LACE tient à l'échelle, les intégrateurs pourraient tirer parti de corpus vidéo humains existants (YouTube, Ego4D, etc.) pour initialiser des politiques sans investissement lourd en données robot. Le gain annoncé de 65 % mérite toutefois d'être contextualisé: le preprint ne détaille pas le nombre de tâches évaluées ni la complexité des scènes, deux facteurs déterminants pour juger de la généralisabilité réelle. LACE s'inscrit dans une vague de travaux sur le transfert cross-embodiment qui a pris de l'ampleur depuis 2023 avec des méthodes comme AnyPoint et les politiques de Physical Intelligence (Pi-0). L'approche dominante consiste à entraîner des VLA (Vision-Language-Action models) à grande échelle sur des données mixtes humain-robot, stratégie portée par DeepMind, Stanford (ALOHA/ACT) et Berkeley (OpenVLA). LACE propose une alternative plus frugale, centrée sur l'alignement de représentations plutôt que sur le volume de données. Aucun pilote industriel ni calendrier de déploiement n'est mentionné; l'article reste au stade de preprint non soumis à révision par les pairs.

RecherchePaper
1 source
Asservissement visuel à événements bio-inspiré pour robots terrestres
3609arXiv cs.RO 

Asservissement visuel à événements bio-inspiré pour robots terrestres

Des chercheurs ont publié sur arXiv (référence 2603.23672v2) un framework de servoing visuel événementiel 1D pour robots terrestres évoluant en environnements structurés. L'approche repose sur un capteur de vision dynamique (DVS), une caméra bio-inspirée qui ne génère des signaux, appelés "événements", qu'en réponse à des variations locales de luminance logarithmique, contrairement aux caméras classiques à trame fixe. En appliquant un noyau spatial fixe au flux d'événements asynchrones produit par des motifs d'intensité structurés, les auteurs montrent analytiquement que le flux d'événements net isole des combinaisons spécifiques d'états cinématiques : un profil spatial linéaire extrait la vitesse du robot, un profil quadratique extrait le produit position-vitesse. En combinant plusieurs motifs simultanément, le système synthétise directement un terme de retour d'état non linéaire, sans passer par une estimation d'état traditionnelle (pas de filtre de Kalman, pas d'odométrie). Pour contourner la perte d'observabilité linéaire à l'équilibre, problème inhérent aux capteurs événementiels qui cessent de générer des signaux en l'absence de mouvement, les auteurs proposent un contrôleur en cycle limite actif, directement inspiré des comportements de fixation oculaire observés chez les animaux. Le tout a été validé expérimentalement sur un véhicule autonome à l'échelle 1/10. L'intérêt principal de ce travail réside dans l'élimination de l'estimation d'état explicite du pipeline de contrôle, ce qui réduit structurellement la latence et la charge computationnelle, deux contraintes critiques pour les robots mobiles rapides ou embarqués sur matériel contraint. Le fait que la séparation des états cinématiques soit obtenue analytiquement, et non par apprentissage, constitue un avantage de robustesse : le comportement est prédictible et formellement borné. L'approche adresse aussi un angle mort connu des capteurs DVS : leur insensibilité à l'état statique, qui rend le contrôle à l'équilibre difficile avec des méthodes classiques. Le cycle limite bio-inspiré contourne ce problème sans injection de bruit artificiel. Les capteurs DVS (commercialisés notamment par Prophesee en France et iniVation en Suisse) suscitent un intérêt croissant en robotique mobile depuis une décennie, portés par leur latence sub-milliseconde et leur dynamique de 120 dB, mais leur intégration dans des boucles de contrôle fermées reste un défi algorithmique non trivial. Ce papier s'inscrit dans un courant de recherche actif sur le "event-based control" qui tente de dépasser le stade de la démonstration perceptive pour atteindre le contrôle en boucle fermée robuste. Les concurrents conceptuels incluent les approches par flot optique événementiel (groupes de Davide Scaramuzza à Zurich, Tobi Delbruck à ETH) et les méthodes de servoing visuel classique accélérées par GPU. La validation sur véhicule 1/10 reste modeste en échelle ; les prochaines étapes naturelles seraient une extension à la navigation 2D et des tests sur plateformes de taille réelle en conditions non structurées.

RecherchePaper
1 source
Robo-Cortex : un agent à base d'IA incarnée auto-évolutif grâce à la mémoire cognitive à double granularité et l'induction autonome de connaissances
3610arXiv cs.RO 

Robo-Cortex : un agent à base d'IA incarnée auto-évolutif grâce à la mémoire cognitive à double granularité et l'induction autonome de connaissances

Publié mi-mai 2026 sur arXiv (2605.18729), Robo-Cortex est un framework d'agent incarné à auto-évolution conçu pour la navigation robotique en environnements inconnus. L'architecture combine trois briques : un mécanisme d'Induction Autonome de Connaissances (AKI) distillant trajectoires et expériences en heuristiques formulées en langage naturel ; une Mémoire Cognitive à Double Grain, avec mémoire réflexive à court terme (SRM) pour l'analyse locale en temps réel et mémoire de principes à long terme (LPM) pour les règles réutilisables ; et une boucle "Imaginer-puis-Vérifier" où un modèle du monde simule les résultats potentiels avant qu'un évaluateur VLM valide chaque plan d'action. Sur les benchmarks IGNav, AR et AEQA, le système surpasse les meilleures méthodes existantes de +4,16% de SPL (Success weighted by Path Length) et de +15,30% de SPL en scénario de transfert de heuristiques vers des environnements totalement inédits. L'enjeu central adressé est l'"amnésie expérientielle" : les agents actuels, pilotés par imitation-learning ou politiques réactives, échouent à capitaliser sur leurs interactions passées pour construire des stratégies généralisables. La mémoire LPM/SRM de Robo-Cortex n'est pas un replay-buffer de données brutes mais une base de connaissances symboliques et linguistiques : un robot déployé dans un nouvel entrepôt pourrait potentiellement améliorer ses performances de navigation de façon autonome, sans nouveau cycle d'annotation ni fine-tuning, en rupture avec les pipelines sim-to-real classiques. Des expériences préliminaires en environnement physique réel sont mentionnées, mais restent peu détaillées dans la publication. Ce travail s'inscrit dans la concurrence directe avec les approches VLA comme Pi-0 de Physical Intelligence ou les architectures à mémoire développées chez DeepMind et Carnegie Mellon, avec une distinction clé : l'accent mis sur la réflexion post-hoc et l'induction de règles symboliques plutôt que sur l'apprentissage end-to-end. La publication reste un preprint non revu par les pairs, et les performances annoncées sont à reproduire indépendamment avant toute conclusion industrielle. Les prochaines étapes naturelles seraient une validation sur des benchmarks physiques standardisés comme RoboCasa ou Open-X Embodiment, et une soumission à une conférence majeure de type ICRA ou CoRL.

RechercheOpinion
1 source
Vertus du chaos ordonné : planification par actions de renversement pour la réorganisation de piles sur table
3611arXiv cs.RO 

Vertus du chaos ordonné : planification par actions de renversement pour la réorganisation de piles sur table

Publiée sur arXiv (2605.17815) en mai 2026, une étude propose d'enrichir les planificateurs de manipulation robotique avec des actions non-préhensiles dites "agrégantes", en particulier le basculement d'objets (topple). Au lieu de déplacer un à un les éléments d'une pile sur un plan de travail, le robot peut renverser tout ou partie de la pile d'un seul mouvement avant de saisir les objets dans l'ordre souhaité. Les chercheurs formalisent cet espace de planification hybride pick-and-place + topple via un gadget graphique directionnel original, réduisant le calcul du plan à une variante du problème des galets en mouvement (pebble motion problem) : chaque objet est traité comme un galet se déplaçant sur un graphe selon des contraintes de non-collision. Les benchmarks conduits en simulation physique sur NVIDIA IsaacSim montrent une réduction significative du temps d'exécution par rapport à une stratégie purement pick-and-place. L'enjeu industriel est concret pour la manipulation en entrepôt, le kitting ou le tri de bacs. Réorganiser une pile de n pièces nécessite classiquement O(n) opérations de saisie-dépose ; une action topple peut en remplacer plusieurs, réduisant le temps de cycle et la sollicitation mécanique des actionneurs. L'article pointe ainsi un angle mort fréquent en robotique de production : les planificateurs de tâches restent majoritairement construits autour de la saisie, alors que les actions non-préhensiles offrent des gains de débit substantiels dès lors qu'elles sont correctement abstraites. Limite notable : les gains sont mesurés en simulation seulement, et le passage sim-to-real pour des actions dynamiques comme le topple reste une question ouverte. Les auteurs s'inscrivent dans la continuité des recherches sur la manipulation non-préhensile, actives depuis les années 1990 mais rarement intégrées au niveau de la planification symbolique de tâches. La formalisation est volontairement généraliste : une action de type "scoop" (raclage) peut être modélisée par la même abstraction graphique, ouvrant la voie à un cadre unifié pour plusieurs familles d'actions agrégantes. Face aux approches concurrentes basées sur l'apprentissage par renforcement ou les planificateurs géométriques, cette méthode symbolique-graphique offre lisibilité et garanties de complétude sur les instances modélisées. Aucun déploiement n'est annoncé ; les auteurs qualifient eux-mêmes leurs résultats de "preliminary indication", laissant la validation en environnement physique réel pour de futurs travaux.

RecherchePaper
1 source
Pince dextérique et souple à actionnement hydraulique doux pour la manipulation en microgravité
3612arXiv cs.RO 

Pince dextérique et souple à actionnement hydraulique doux pour la manipulation en microgravité

Des chercheurs ont présenté DexCoHand, un préhenseur à deux doigts et six degrés de liberté (DOF) à actionnement hydraulique souple, conçu pour étendre les capacités de manipulation d'Astrobee, le robot volant libre de la NASA présent à bord de la Station spatiale internationale (ISS). Le gripper actuel d'Astrobee est limité à un seul DOF sous-actionné, suffisant pour s'accrocher aux rampes de la station mais inadapté à des tâches de manipulation continue. DexCoHand, décrit dans un preprint arXiv publié en mai 2026 (arXiv:2605.17851), a été évalué dans le simulateur MuJoCo sur la séquence d'accrochage standard incluant l'approche, le perchage, puis des mouvements de panoramique et d'inclinaison. Des expériences matérielles ont également été conduites sur Terre. Aucun test en orbite n'est rapporté à ce stade. La difficulté centrale de la manipulation en microgravité est que toute force de contact exercée par l'effecteur se répercute directement dans le mouvement de la base flottante, rendant les tâches précises particulièrement instables avec un système rigide ou à faible DOF. Les résultats de simulation montrent que DexCoHand préserve les mouvements commandés en panoramique et inclinaison tout en réduisant les perturbations non voulues sur les axes transversaux de la base, comparé au gripper d'origine. L'actionnement hydraulique souple offre une compliance passive qui absorbe une partie de l'énergie de contact, un avantage documenté en robotique terrestre mais encore peu exploré pour les systèmes orbitaux. Ces résultats sont pertinents pour la conception de robots d'entretien autonomes de stations spatiales, un segment où la manipulation dextère reste un verrou technologique non résolu. Astrobee a été déployé sur l'ISS en 2019 par le NASA Ames Research Center pour assister les astronautes dans des tâches de surveillance et de logistique. Sa plateforme ouverte a favorisé une série de travaux académiques sur l'extension de ses capacités. Dans le domaine des manipulateurs spatiaux opérationnels, les systèmes actifs incluent le Canadarm2 de la NASA, le bras JEMRMS de la JAXA et le projet CAESAR de l'ESA. DexCoHand s'inscrit dans un courant de robotique souple appliquée à l'espace, où la tolérance aux chocs et la légèreté sont critiques. Les prochaines étapes naturelles seraient des tests en micropesanteur simulée, via vols paraboliques ou bassin neutre, avant toute qualification orbitale.

RecherchePaper
1 source
Génération automatique d'arbres de comportement par VLM pour le transfert réel-vers-simulation via perception active
3613arXiv cs.RO 

Génération automatique d'arbres de comportement par VLM pour le transfert réel-vers-simulation via perception active

Une équipe de chercheurs propose dans un article arXiv (2601.08454) un pipeline Real2Sim piloté par l'intention, qui automatise la construction d'environnements de simulation physiquement précis à partir d'une instruction en langage naturel. Un modèle vision-langage (VLM) analyse une observation visuelle et une description de simulation incomplète pour identifier le sous-ensemble minimal de paramètres physiques manquants (masse des objets, géométrie de surface, friction), puis génère automatiquement un arbre de comportement (Behavior Tree, BT) composé de primitives motrices et sensorielles atomiques pour les acquérir par interaction physique avec l'environnement. Les expériences ont été conduites sur un bras Franka Emika Panda à contrôle en couple (7 DOF), manipulateur standard en recherche robotique. Les résultats indiquent des gains d'efficacité opérationnelle significatifs par rapport aux méthodes d'exploration exhaustive, validés par des études d'ablation sur plusieurs VLMs de référence, mais les chiffres précis de performance ne sont pas fournis dans l'abstract, ce qui limite la comparabilité externe. L'apport principal est le remplacement de pipelines d'identification système manuels par une stratégie sémantique : au lieu d'explorer exhaustivement l'environnement, le système ne collecte que les données pertinentes pour la tâche demandée, réduisant les interactions redondantes. Pour les équipes travaillant sur des jumeaux numériques industriels, cela représente un gain potentiel en temps de calibration avant déploiement. Le BT joue également un rôle de filtre de sécurité déterministe : sa hiérarchie réactive intercepte les hallucinations du VLM et prévient les anomalies physiques dangereuses, ce qui est non-négligeable pour une application en conditions réelles. Cette combinaison, intelligence sémantique du VLM associée à la robustesse déterministe du BT, constitue l'aspect architectural le plus notable du travail. La construction de simulations fidèles au réel est un verrou classique du déploiement robotique : un jumeau numérique mal calibré amplifie le sim-to-real gap qui dégrade les politiques apprises en simulation, problème central pour les VLA (Vision-Language-Action) actuels. Côté concurrence, Physical Intelligence (pi0), Google DeepMind (successeurs de RT-2) et des projets open-source comme LeRobot de Hugging Face investissent tous dans des pipelines sim-to-real plus robustes. L'utilisation des BT comme couche d'interprétabilité face aux modèles génératifs s'inscrit dans une tendance plus large visant à rendre les LLM/VLM compatibles avec des contraintes de sécurité industrielle. Les prochaines étapes logiques seraient d'étendre le pipeline à des robots mobiles ou des plateformes humanoïdes, et de publier des benchmarks complets permettant une comparaison rigoureuse avec les méthodes d'identification système existantes.

RecherchePaper
1 source
LiPS : segmentation panoptique légère pour la robotique aux ressources limitées
3614arXiv cs.RO 

LiPS : segmentation panoptique légère pour la robotique aux ressources limitées

Une équipe de recherche publie sur arXiv (identifiant 2604.00634, version révisée) LiPS, une architecture de segmentation panoptique conçue spécifiquement pour les plateformes robotiques embarquées à ressources limitées. La segmentation panoptique est une tâche de perception qui combine la segmentation sémantique (classifier chaque pixel selon sa catégorie) et la segmentation d'instances (distinguer chaque objet individuel), offrant ainsi une compréhension unifiée de la scène. LiPS conserve l'approche par décodeur à requêtes (query-based decoding), héritée des architectures transformeurs comme Mask2Former, mais introduit un pipeline allégé d'extraction et de fusion de features. Sur les benchmarks standards, LiPS atteint un débit jusqu'à 4,5 fois supérieur en images par seconde et nécessite 6,8 fois moins d'opérations de calcul que les modèles lourds de référence, avec une précision comparable. L'enjeu est réel pour les intégrateurs en robotique mobile. Les modèles d'état de l'art en perception (Mask2Former, OneFormer, Panoptic-DeepLab) atteignent des performances élevées sur des GPU de datacenter, mais leur déploiement sur des plateformes AMR, des robots d'inspection ou des bras collaboratifs équipés de GPU embarqués modestes (Jetson Orin, Hailo, NPU intégrés) reste bloqué par la bande passante mémoire et la latence d'inférence. Un facteur 4,5x sur le débit signifie concrètement la différence entre un pipeline temps réel à 30 FPS et un pipeline batch inutilisable en navigation autonome. Il convient toutefois de souligner que les benchmarks cités ne précisent pas le matériel cible exact ni les conditions d'évaluation, ce qui limite la comparabilité directe avec des contraintes industrielles spécifiques. La segmentation panoptique légère s'inscrit dans une tendance de fond : après l'explosion des grands modèles de vision (SAM, DINOv2, GroundedSAM), la communauté cherche à distiller ces capacités vers l'edge. Des travaux concurrents comme EfficientPS ou RT-DETRv2 adaptés à la segmentation visent des compromis similaires. LiPS se distingue par le maintien du décodeur à requêtes, généralement sacrifié dans les approches légères au profit de têtes plus simples. Aucun partenariat industriel ni déploiement pilote n'est mentionné dans l'article, qui reste pour l'instant une contribution académique sans timeline commerciale annoncée.

RecherchePaper
1 source
Planification optimale de frappe-et-saisie pour des blocs serrés sur table avec pinces parallèles
3615arXiv cs.RO 

Planification optimale de frappe-et-saisie pour des blocs serrés sur table avec pinces parallèles

Des chercheurs ont publié en mai 2025 sur arXiv (réf. 2605.17800) un algorithme de planification optimale pour manipuler des blocs densément rangés sur une surface plane avec des pinces parallèles standard. Le problème est classique en robotique de préhension : ces pinces à deux mâchoires rigides exigent une clearance latérale autour de l'objet cible avant toute saisie, ce qui devient infaisable en configuration serrée. Les auteurs formalisent ce défi sous le nom de "knock-pick planning" en introduisant une primitive directionnelle de frappe (knock) qui pousse un bloc voisin pour libérer l'espace nécessaire. Le plan optimal, minimisant le nombre total d'actions (frappes puis saisies), est calculé par un algorithme de couplage parfait à poids maximum (maximum-weight perfect matching) appliqué à une abstraction graphique du problème, avec une complexité polynomiale garantie. La validation a été conduite sur des configurations de grille de taille croissante en simulation synthétique, puis dans IsaacSim, le simulateur robotique d'NVIDIA. La contribution principale est la garantie d'une complexité polynomiale pour un problème traité jusqu'ici de manière heuristique ou par recherche combinatoire coûteuse. En production, les systèmes pick-and-place contournent le problème de densité par l'espacement forcé des bacs, des effecteurs à ventouses tolérants au désordre, ou des mains robotiques dextres nettement plus onéreuses. Un planificateur polynomial opérant avec des pinces standard pourrait réduire sensiblement le coût d'intégration de lignes de tri dense en e-commerce et en pharmacie. L'algorithme montre aussi que l'entrelacement d'actions préhensiles (saisie) et non-préhensiles (poussée) peut être géré de façon rigoureuse et optimale, contredisant l'hypothèse répandue selon laquelle ce mixage requiert une planification intractable. Ce travail s'inscrit dans la tradition de la manipulation non-préhensile formalisée par Mason et Erdmann dès les années 1980-1990, dont les résultats théoriques restaient difficiles à opérationnaliser dans des délais utiles. Les approches concurrentes actuelles, qu'il s'agisse de MCTS, A* ou d'apprentissage par renforcement, offrent une flexibilité sur des géométries variées mais sans garantie d'optimalité ni complexité bornée. La validation demeure pour l'instant limitée à la simulation, aucun déploiement sur robot physique n'étant annoncé. Les auteurs qualifient eux-mêmes ce travail de "stepping stone" : les extensions naturelles portent sur des objets non uniformes, des dispositions non-régulières, et une validation sur banc physique réel.

RecherchePaper
1 source
TacSE3 : estimation SE(3) équivariante sur images visuotactiles à faible texture pour suivi et compensation en préhension
3616arXiv cs.RO 

TacSE3 : estimation SE(3) équivariante sur images visuotactiles à faible texture pour suivi et compensation en préhension

Des chercheurs ont publié sur arXiv (identifiant 2605.17929) TacSE3, un pipeline d'estimation de mouvement tactile conçu pour le suivi d'objets en prise de robot. Le système prend en entrée des images visuotactiles à faible texture, les convertit en un champ de force tridimensionnel découplé, puis estime le mouvement rigide incrémental dans SE(3), c'est-à-dire le groupe euclidien spécial à six degrés de liberté combinant trois axes de translation et trois axes de rotation. L'architecture dérive la translation planaire depuis le déplacement du centroïde de contact, et estime la rotation principalement à partir des réponses tactiles de cisaillement (shear). Les expériences s'appuient sur une paire de capteurs visuotactiles DM-Tac montés en configuration bidigitale, sans autre précision sur le matériel robotique hôte ni sur les benchmarks comparatifs utilisés. L'intérêt industriel réside dans deux propriétés rarement combinées : l'interprétabilité physique du signal et l'absence de ré-entraînement de la politique de base. En manipulation in-hand, l'occlusion visuelle fréquente prive les approches classiques de correspondances stables entre images, qu'il s'agisse de matching géométrique ou de flux optique. TacSE3 contourne ce problème en exploitant uniquement le retour tactile, lequel reste disponible même lorsque la caméra extéroceptive est aveugle. La configuration à deux capteurs réduit l'ambiguïté translation-rotation inhérente à un capteur unique et permet le suivi en rotation sur plusieurs axes et géométries d'objets. Le signal de compensation reste léger et s'intègre en surcouche d'une politique existante, ce qui simplifie l'industrialisation : pas besoin de reprendre l'apprentissage pour améliorer la tolérance aux perturbations. La manipulation tactile en prise est un axe de recherche actif, porté notamment par les travaux autour des capteurs GelSight (MIT) et des approches vision-language-action (VLA) qui peinent encore sur la finesse des contacts. TacSE3 s'inscrit dans la tendance à enrichir ces pipelines avec un retour proprioceptif interprétable plutôt que de tout déléguer au visuel. Côté concurrence, des équipes comme celles derrière Digit (Meta/GelSight Technologies) ou Soft Robotics travaillent sur des capteurs tactiles embarqués, mais peu proposent une estimation SE(3) sans texture. La preprint ne mentionne pas de partenaire industriel ni de calendrier de déploiement ; les résultats restent à confirmer hors laboratoire, en conditions d'encombrement et de bruit réels.

RecherchePaper
1 source
Planification de la prochaine vue optimale avec prise en compte de l'incertitude de mouvement pour la reconstruction d'objets mobiles
3617arXiv cs.RO 

Planification de la prochaine vue optimale avec prise en compte de l'incertitude de mouvement pour la reconstruction d'objets mobiles

Des chercheurs présentent dans un preprint arXiv (2605.17593) un cadre de planification baptisé "motion-uncertainty-aware next-best-view" (NBV), destiné à reconstruire en 3D des objets rigides en mouvement planaire avec un robot mobile équipé d'un capteur de profondeur. Le problème central est le délai entre la sélection d'un viewpoint et son exécution : au moment où le robot atteint la position choisie, l'objet a déjà bougé, rendant caduc tout plan basé sur une pose prédite unique. Pour y répondre, chaque viewpoint candidat est évalué non pas sur une position fixe, mais sur l'ensemble des états futurs plausibles de l'objet, modélisés par un lisseur à processus gaussien à fenêtre glissante (fixed-lag Gaussian Process smoother) alimenté par des mesures de position bruitées. Les expériences, menées en simulation et en conditions réelles, montrent une complétude de reconstruction supérieure à celle des planificateurs NBV non-prédictifs et des méthodes de tracking-seul. Ce résultat comble un angle mort documenté de la robotique perceptive : les planificateurs NBV classiques optimisent la couverture de surface en supposant des objets statiques, tandis que les méthodes de perception active orientées mouvement favorisent le suivi au détriment de la qualité de reconstruction. La combinaison des deux dans un seul cadre probabiliste est directement applicable à l'inspection automatisée de pièces sur convoyeur, au contrôle qualité en ligne ou à la génération de jumeaux numériques en environnement dynamique. Traiter le futur comme une distribution d'états plutôt qu'une estimation ponctuelle améliore la robustesse aux perturbations capteurs et aux variations de dynamique que les approches déterministes ne gèrent pas. La planification NBV est un problème actif depuis les années 1990 en robotique perceptive, mais son extension aux objets en mouvement reste peu traitée dans la littérature. L'usage de processus gaussiens pour la prédiction de trajectoire est éprouvé dans d'autres domaines, rarement couplé jusqu'ici à des scores de couverture de surface en contexte NBV. Il s'agit d'un preprint sans évaluation par les pairs à ce stade, sans partenaire industriel ni déploiement annoncé. Les métriques de complétude avancées restent à confirmer sur des dynamiques plus complexes : les expériences actuelles se limitent au mouvement planaire et aux objets rigides. Les extensions naturelles incluent le mouvement 3D non-planaire, les objets déformables et les configurations multi-cibles. Aucun acteur français ou européen n'est impliqué dans cette publication.

RecherchePaper
1 source
CompassAD : localisation d'affordance 3D guidée par l'intention parmi des objets fonctionnellement concurrents
3618arXiv cs.RO 

CompassAD : localisation d'affordance 3D guidée par l'intention parmi des objets fonctionnellement concurrents

Des chercheurs proposent CompassAD, un benchmark et une architecture (CompassNet) pour adresser un angle mort des systèmes robotiques actuels : choisir le bon objet parmi plusieurs qui partagent la même affordance. Le cas prototype est simple : face à l'instruction "coupe le gâteau", un robot doit identifier le couteau plutôt que des ciseaux posés à côté, bien que les deux permettent de couper. Le benchmark comprend 30 paires d'objets confusables, 16 types d'affordances, 6 422 compositions de scènes et plus de 88 000 paires requête-réponse. CompassNet repose sur deux modules : l'Instance-bounded Cross Injection (ICI), qui confine l'alignement langage-géométrie aux limites de chaque instance d'objet pour éviter toute fuite sémantique entre objets voisins, et le Bi-level Contrastive Refinement (BCR), qui renforce la discrimination entre surfaces cibles et confusables à deux niveaux de granularité. Le système produit un masque d'affordance point-par-point sur le bon objet dans un nuage de points multi-objets, conditionné par une instruction en langage naturel implicite. Une validation sur bras manipulateur réel est présentée comme preuve de transfert physique. L'intérêt est que la quasi-totalité des méthodes d'affordance 3D existantes évaluent des objets isolés avec le nom de catégorie fourni explicitement dans la requête. CompassAD impose une contrainte plus proche du déploiement réel : une intention formulée en langage naturel, sans étiquette d'objet prédéfinie. Pour un intégrateur ou un décideur industriel, cela vise des systèmes capables de raisonner sur le contexte de tâche sans pipeline de labellisation rigide. La nuance s'impose cependant : 30 paires d'objets et un environnement de laboratoire constituent une base étroite. La robustesse en scènes industrielles denses, avec occlusions et objets multiples non contrôlés, reste à démontrer. L'affordance grounding en robotique s'est structuré autour de travaux comme Where2Act (2021) ou LASO, qui opèrent sur objets isolés avec requêtes explicites. Les architectures vision-langage-action (VLA) des grands labos comme DeepMind, Meta ou Stanford intègrent progressivement la résolution d'ambiguïtés contextuelles, mais sans benchmark dédié aux scènes multi-objets confusables. CompassAD comble en partie ce vide méthodologique. La publication, déposée sur arXiv (2604.02060v2) en version révisée, n'implique pas d'acteur industriel ou FR/EU visible. Les prochaines étapes logiques seraient une extension à des scènes plus denses et une évaluation sur plateformes mobiles manipulatrices, au-delà du bras fixe utilisé dans les expériences publiées.

RecherchePaper
1 source
Sculpture visuelle : représentations de planification alignées visuellement pour la modélisation d'argile robotique sur de longues séquences
3619arXiv cs.RO 

Sculpture visuelle : représentations de planification alignées visuellement pour la modélisation d'argile robotique sur de longues séquences

Des chercheurs ont publié sur arXiv (référence 2605.17556, mai 2025) une méthode de sculpture robotisée de l'argile reposant sur une planification à long horizon dans un espace de représentation visuellement aligné. Le système, baptisé Visual Sculpting, formule la tâche comme un problème de correspondance entre formes : à partir d'une forme cible, le robot calcule une séquence de plus de 100 actions de poussée paramétrées avec un seul effecteur pour déformer progressivement la matière. La méthode a été validée sur trois matériaux déformables distincts et avec plusieurs types d'effecteurs. Les sculptures obtenues sont des reliefs en argile réalisés en boucle fermée, sans intervention humaine entre les passes. La contribution centrale est un modèle de dynamique des matériaux déformables opérant dans un espace de représentation qui encode non seulement la géométrie, mais aussi la texture et l'éclairage de la surface, contrairement aux approches précédentes fondées sur des nuages de points épars. Cette différence est notable pour la manipulation de matières molles, où l'apparence visuelle conditionne la précision des estimations d'état. Les auteurs rapportent des performances comparables à l'état de l'art sur les métriques géométriques classiques, avec l'avantage supplémentaire d'une compatibilité native avec les planificateurs visuels, ouvrant la voie à une intégration plus directe avec des politiques de type VLA (Vision-Language-Action). L'article reconnaît cependant que planifier directement dans cet espace visuel reste plus difficile que dans un espace 3D structuré, un point de friction technique qui devra être résolu avant toute application industrielle. Les travaux sur la manipulation d'objets déformables connaissent une accélération depuis 2022-2023, portés notamment par les progrès des modèles de dynamique neuronaux et l'essor des robots à manipulation dextre. La limite principale des systèmes précédents était la nécessité de réentraîner une politique par objectif, ce que cette approche cherche à contourner via une représentation généraliste. Aucune entreprise ni déploiement industriel n'est associé à ces travaux pour l'instant : il s'agit d'un preprint académique sans validation terrain. Les prochaines étapes probables incluent l'extension à des tâches de déformation bidirectionnelle et le test sur des bras industriels standards comme le Franka ou l'UR10.

RecherchePaper
1 source
COLSON : navigation sociale contrôlable par apprentissage par renforcement basé sur la diffusion
3620arXiv cs.RO 

COLSON : navigation sociale contrôlable par apprentissage par renforcement basé sur la diffusion

Des chercheurs proposent COLSON (Controllable Learning-based Social Navigation), une méthode de navigation sociale pour robots mobiles autonomes (AMR) en milieux piétons, fondée sur l'apprentissage par renforcement couplé à des modèles de diffusion. Publiée sur arXiv (2503.13934v2), cette étude traite d'un verrou persistant pour les robots de service : naviguer de façon fluide et socialement cohérente parmi des piétons dynamiques, sans violer leurs espaces de proximité ni générer de comportements erratiques. Les approches à base de règles telles qu'ORCA ou DWA montrent leurs limites dans les environnements denses, tandis que les méthodes de deep RL conventionnelles reposent sur des distributions gaussiennes qui contraignent la variété des trajectoires produites. COLSON contourne cette limitation en exploitant les distributions d'actions plus riches offertes par les modèles de diffusion appliqués au RL, capables de représenter des comportements multimodaux (hésiter, contourner à gauche ou à droite) que les politiques gaussiennes tendent à lisser. L'apport central de la méthode est sa capacité de généralisation à des scénarios inédits sans ré-entraînement. Dans les démonstrations présentées, le robot adapte son comportement à des obstacles statiques absents du jeu d'entraînement, ou change d'objectif pour accompagner un piéton cible tout en évitant les autres passants. Pour les intégrateurs d'AMR en milieux hospitaliers, aéroportuaires ou logistiques, cette propriété de contrôlabilité zero-shot est stratégiquement importante : elle réduit le coût de re-paramétrage à chaque nouveau site de déploiement. Elle valide aussi partiellement l'hypothèse que les diffusion models peuvent atténuer le sim-to-real gap en navigation sociale, en générant des distributions d'actions plus robustes face à l'imprévu. Le champ de la social navigation par deep RL est actif depuis une décennie, avec des travaux fondateurs comme CADRL (2017), SARL et CrowdNav. L'application des modèles de diffusion au RL dans la robotique est plus récente, s'appuyant notamment sur Diffusion Policy (Columbia/MIT, 2023) dans le domaine de la manipulation. COLSON transfère cette logique vers la planification de mouvement en espace ouvert. Il s'agit à ce stade d'un preprint académique avec validation uniquement en simulation ; aucun déploiement sur robot réel ni partenariat industriel n'est mentionné, ce qui invite à tempérer les conclusions. Les éditeurs actifs sur la navigation sociale autonome incluent Boston Dynamics, ANYbotics et Clearpath Robotics, et côté européen Enchanted Tools (France) ou PAL Robotics (Espagne) pour les robots de service. Les prochaines étapes naturelles seraient une validation en environnement réel et un benchmarking sur les datasets standardisés ETH/UCY.

RecherchePaper
1 source
OrbiSim : des modèles du monde comme moteurs physiques différentiables pour l'IA incarnée
3621arXiv cs.RO 

OrbiSim : des modèles du monde comme moteurs physiques différentiables pour l'IA incarnée

Une équipe de chercheurs a déposé sur arXiv en mai 2026 (réf. 2605.16395) un article présentant OrbiSim, un nouveau paradigme de simulation robotique qui repositionne les modèles du monde (world models) comme des moteurs physiques entièrement différentiables. Là où les world models existants, tels que DreamerV3 ou TD-MPC2, opèrent dans des espaces latents ou visuels sans contraintes physiques explicites, OrbiSim construit une chaîne unifiée et physiquement ancrée reliant trois composantes : des actifs de scène structurés, une dynamique neurale apprise, et l'entraînement par renforcement en aval. L'architecture garantit une différentiabilité de bout en bout sur l'ensemble de la boucle de simulation, depuis les transitions d'état explicites jusqu'à la génération d'observations visuelles. Cette propriété permet des tâches jusqu'ici peu tractables pour les simulateurs classiques : modélisation différentiable des contacts, optimisation de politique par gradient sous récompenses éparses, et inférence physique intuitive. Les auteurs affirment qu'OrbiSim surpasse significativement les world models de l'état de l'art en fidélité prédictive et en performance de contrôle, sans toutefois publier de métriques chiffrées dans l'abstract. L'enjeu industriel est réel : le fossé sim-to-real reste l'un des principaux freins au déploiement de robots en environnement non contrôlé. Les simulateurs classiques comme MuJoCo, Isaac Sim (NVIDIA) ou PyBullet ne sont pas différentiables au niveau des contacts, ce qui bloque l'optimisation par gradient lors des phases de manipulation ou de locomotion complexe. Les world models neuronaux offrent la flexibilité, mais au prix de la cohérence physique. OrbiSim propose une synthèse des deux approches. Si les résultats se confirment à plus grande échelle, la capacité à optimiser des politiques par gradient sous récompenses éparses pourrait réduire significativement les temps de convergence en apprentissage par renforcement, un gain direct pour les équipes développant des robots manipulateurs ou bimanes destinés à l'industrie. Il faut souligner qu'il s'agit d'un preprint non encore soumis à peer review, sans affiliation industrielle explicite ni validation sur hardware physique annoncée. Le domaine de la simulation différentiable est activement disputé : DiffTaichi, Warp (NVIDIA) et Brax (Google DeepMind) couvrent déjà certains aspects de la physique différentiable, mais sans intégrer la génération visuelle neurale. OrbiSim se positionne dans un espace hybride encore peu occupé. Les prochaines étapes crédibles seraient une validation sur benchmarks standardisés comme RoboSuite ou IsaacLab, et surtout des expériences de transfert sim-to-real sur robot physique, dont aucune n'est annoncée à ce stade.

RecherchePaper
1 source
HCLM : un cadre hiérarchique pour la loco-manipulation coopérative avec deux quadrupèdes
3622arXiv cs.RO 

HCLM : un cadre hiérarchique pour la loco-manipulation coopérative avec deux quadrupèdes

Des chercheurs présentent HCLM (Hierarchical Cooperative Loco-Manipulation), un framework de contrôle pour deux robots quadrupèdes réalisant des tâches de manipulation d'objets en coopération, publié sur arXiv (2605.17300) en mai 2025. L'architecture combine une Joint Diffusion Policy centralisée au niveau supérieur, exploitant une représentation SE(3)-invariante de l'espace de tâche pour apprendre des patterns de coordination indépendants du référentiel géométrique des robots, et un Whole-Body Controller hybride au niveau inférieur. Ce WBC associe un MPC cinématique proactif pour distribuer les vitesses sans collision à une couche réactive assurant le suivi précis de l'effecteur terminal. Un schéma d'admittance coopérative régule les forces internes lors des interactions en chaîne fermée, c'est-à-dire quand les deux robots portent simultanément le même objet. Le framework est validé en simulation sur trois tâches de difficulté croissante (transport coopératif, conditionnement, transfert d'objet) et déployé physiquement pour la tâche de transfert uniquement. Ce travail adresse un verrou technique de la manipulation multi-robots sur bases flottantes : concilier coordination spatiale, locomotion robuste et contraintes physiques imposées par les interactions en chaîne fermée, où deux robots tenant le même objet génèrent des stresses internes potentiellement destructeurs. La décomposition hiérarchique découple le raisonnement collaboratif de haut niveau de l'exécution motrice, isolant les problèmes pour les résoudre indépendamment. L'invariance SE(3) de la politique de diffusion est le résultat le plus structurant, permettant une généralisation à des configurations géométriques non vues lors de l'entraînement. Les expériences reportent une robustesse aux perturbations physiques sévères, bien que les benchmarks restent limités à des scénarios de laboratoire soigneusement sélectionnés, sans mesures comparatives tierces. La manipulation coopérative sur quadrupèdes mobiles demeure un sous-domaine académique sans déploiement industriel annoncé. Les quadrupèdes à bras embarqués, ANYmal d'ANYbotics ou Spot de Boston Dynamics instrumentés en labo, constituent le banc de test dominant pour ces recherches. Les approches concurrentes traitent généralement locomotion et manipulation séparément, ou se limitent à un seul agent mobile. HCLM se distingue par la gestion explicite des interactions en chaîne fermée entre deux robots mobiles simultanément en contact avec l'objet, un scénario sous-traité dans la littérature existante. Le papier ne mentionne aucun partenariat industriel ni timeline de commercialisation, et reste une contribution académique avec déploiement physique partiel.

RecherchePaper
1 source
Génération de vidéo 4D intégrant la géométrie pour la manipulation robotique
3623arXiv cs.RO 

Génération de vidéo 4D intégrant la géométrie pour la manipulation robotique

Des chercheurs ont publié sur arXiv (référence 2507.01099, version 4) un modèle de génération vidéo 4D destiné à améliorer la planification et la manipulation robotique. L'approche prend en entrée une seule image RGB-D par point de vue, c'est-à-dire une image couleur couplée à une carte de profondeur, et génère des séquences vidéo futures alignées spatialement et temporellement depuis de nouveaux angles de caméra, sans nécessiter la connaissance préalable des poses de caméra. La cohérence géométrique multi-vue est imposée pendant l'entraînement par une supervision fondée sur l'alignement de nuages de points inter-vues (cross-view pointmap alignment), forçant le modèle à construire une représentation 3D partagée de la scène. Les vidéos 4D prédites sont ensuite exploitées par un tracker de pose 6DoF disponible sur étagère pour reconstituer les trajectoires de l'effecteur terminal du robot, produisant des politiques de manipulation qui généralisent à des points de vue inédits. Les expériences portent sur plusieurs jeux de données robotiques simulés et réels, avec de meilleures performances visuelles et spatiales que les approches de référence. Ce résultat s'attaque directement à l'un des verrous majeurs du déploiement industriel de la manipulation robotique : la dépendance à une calibration précise des caméras et à leur positionnement fixe. En apprenant implicitement la géométrie de la scène plutôt qu'en la recevant comme entrée explicite, le modèle produit des prédictions visuellement stables là où les approches concurrentes dérivent dès qu'on change l'angle de vue. Pour un intégrateur ou un COO industriel, cela signifie qu'une cellule robotisée pourrait potentiellement réutiliser une politique apprise sans reconfigurer l'ensemble du système de vision si une caméra est déplacée. L'utilisation d'un tracker 6DoF hors catalogue pour extraire les trajectoires limite par ailleurs le besoin d'infrastructure propriétaire et simplifie l'intégration. Ce travail s'inscrit dans la vague des "world models" appliqués à la robotique, aux côtés d'approches comme UniSim ou des modèles VLA (Vision-Language-Action) à grande échelle qui cherchent eux aussi à donner aux robots une compréhension prédictive de leur environnement. La principale réserve est que le papier est une prépublication arXiv, sans validation industrielle annoncée ni partenaire de déploiement identifié : c'est de la recherche amont, pas un produit expédié. Les méthodes concurrentes s'appuyant sur des poses de caméra explicites, comme les approches NeRF ou 3D Gaussian Splatting pour la manipulation, offrent parfois une précision supérieure dans des environnements très contrôlés, mais au prix d'une configuration plus contraignante. Les prochaines étapes naturelles seraient une validation sur des tâches de manipulation plus complexes, une montée en échelle sur des plateformes comme les bras Franka ou UR, et une intégration dans des pipelines de politique complète de type diffusion ou transformer.

IA physiquePaper
1 source
Reconstruction simulation-réel pour environnements très encombrés via raisonnement physique inter-objets
3624arXiv cs.RO 

Reconstruction simulation-réel pour environnements très encombrés via raisonnement physique inter-objets

Une équipe de recherche présente un pipeline Real-to-Sim capable de reconstruire des scènes 3D physiquement cohérentes à partir d'une seule image RGB-D, c'est-à-dire une capture combinant couleur et profondeur. L'approche, décrite dans un preprint arXiv (2602.12633, version 2), cible spécifiquement les environnements très encombrés où la manipulation robotique exige une compréhension précise des contacts entre objets. Le coeur du système repose sur un pipeline d'optimisation différentiable qui modélise les dépendances spatiales via un graphe de contact : chaque relation physique entre objets adjacents est représentée explicitement, puis les poses et propriétés physiques de chaque objet sont affinées conjointement par simulation de corps rigides différentiable. Les évaluations couvrent des scènes simulées et des environnements réels. Ce travail s'attaque à un problème concret qui bloque les déploiements de manipulation robotique en contexte industriel désorganisé : les pipelines de perception standard produisent régulièrement des états invalides, objets en lévitation ou interpénétrations géométriques, qui rendent la simulation en aval peu fiable et donc inutilisable pour planifier des saisies ou des déplacements. En forçant la cohérence physique dès la reconstruction, le pipeline permet d'obtenir des scènes simulées qui reproduisent fidèlement la dynamique de contact du monde réel. Pour les intégrateurs et les équipes de recherche en manipulation, c'est une brique clé pour réduire le fossé sim-to-real sans recourir à des setups multicaméras coûteux ou à des annotations manuelles. La reconstruction Real-to-Sim est un chantier actif dans la communauté robotique depuis l'essor des pipelines sim-to-real pour l'apprentissage par renforcement et l'imitation. Des approches concurrentes s'appuient sur des reconstructions NeRF ou des méthodes basées Gaussian Splatting pour obtenir la fidélité géométrique, mais elles n'intègrent pas nécessairement de contraintes physiques explicites. Ce pipeline différentiable se distingue en traitant le raisonnement inter-objets comme une contrainte d'optimisation, pas comme une post-correction. Les prochaines étapes naturelles incluent l'intégration dans des pipelines de planification de manipulation contact-rich et le test sur des scènes industrielles réelles, où le désordre et les occlusions partielles sont la norme plutôt que l'exception.

RecherchePaper
1 source
Amélioration des capacités des robots manipulateurs collaboratifs par algorithme de tâches
3625arXiv cs.RO 

Amélioration des capacités des robots manipulateurs collaboratifs par algorithme de tâches

Des chercheurs ont soumis le 22 mai 2026 sur arXiv (réf. 2605.17293) un algorithme baptisé Task Capability Improvement Algorithm (TCIA), conçu pour les systèmes de manipulation collaborative multi-bras. Le principe central repose sur l'exploitation de moments résiduels, des couples non désirés qui émergent naturellement lorsque des bras robotiques appliquent des forces en un point de préhension différent du centre de gravité de l'objet. Plutôt que de les compenser (l'approche classique), l'algorithme les redirige comme levier d'amélioration de capacité. Les simulations présentées montrent un gain de 5,86 % sur la capacité de tâche globale du groupe de manipulateurs, comparé à une configuration sans exploitation de ces moments. Aucune validation expérimentale sur matériel réel n'est encore présentée à ce stade. Ce résultat, modeste en valeur absolue, est néanmoins pertinent pour les applications industrielles de manipulation lourde ou de transport d'objets en configuration multi-bras. L'algorithme permet simultanément d'optimiser la capacité globale du groupe, l'allocation des ressources entre les bras (distribution de charge, couple disponible par actionneur) et la tolérance aux pannes, soit la capacité du système à maintenir une tâche malgré la défaillance d'un bras. Pour un intégrateur travaillant sur des cellules collaboratives, cette triple optimisation via un seul mécanisme représente un avantage de conception concret. L'approche inverse la logique habituelle : ce qui était traité comme une perturbation physique devient une ressource exploitable. La manipulation coopérative multi-bras est un domaine actif depuis les années 1990, mais l'intérêt s'est intensifié avec la montée des cobots deux bras (Universal Robots, FANUC CRX, KUKA iiwa en configuration duale) et des humanoïdes comme Figure 03, Apptronik Apollo ou Agility Digit, qui doivent manipuler des objets volumineux sans gabarit dédié. L'approche TCIA s'inscrit dans une tendance plus large d'exploitation des contraintes physiques comme ressources plutôt que comme nuisances. Les suites naturelles seraient une validation sur banc physique et une extension aux configurations à géométrie variable, notamment les systèmes mobiles où le point de préhension évolue dynamiquement pendant la tâche.

RecherchePaper
1 source
MR-SLAM : supervision spatiale immersive pour la cartographie multi-robots via réalité mixte
3626arXiv cs.RO 

MR-SLAM : supervision spatiale immersive pour la cartographie multi-robots via réalité mixte

Une équipe de chercheurs présente MR-SLAM, un système de supervision en réalité mixte permettant à un opérateur unique de téléopérer simultanément une flotte de robots en cours de cartographie. L'opérateur porte un casque Meta Quest 3 et visualise, via la vue passthrough superposée au monde physique, trois TurtleBot3 simulés naviguer dans l'espace, pendant que des panneaux de tableau de bord ancrés spatialement affichent en temps réel l'état de la cartographie de chaque robot. Côté serveur, chaque robot exécute une instance indépendante de SLAM Toolbox sous ROS 2 (Robot Operating System 2), et leurs grilles d'occupation sont fusionnées en continu. Sur cinq sessions d'évaluation de neuf minutes, le système a maintenu un débit de 8,83 plus ou moins 0,16 Hz, cartographié 17,9 plus ou moins 0,8 m² fusionnés et atteint 94,7 plus ou moins 0,5 % de cohérence inter-instances. Une session additionnelle a enregistré une gigue médiane de transformation de 6,3 ms et une couverture de 26,7 m² sur un espace de référence de 41 m². Il s'agit d'une prépublication arXiv (2605.16432), conduite sur robots simulés en environnement contrôlé, et non d'un produit commercialisé. La contribution adresse un vrai goulet d'étranglement opérationnel : à mesure que les flottes robotiques grandissent, les interfaces 2D classiques imposent une charge cognitive croissante à l'opérateur, contraint de reconstruire mentalement la géométrie de l'espace à partir de plusieurs fenêtres de cartes planaires. La réalité mixte avec ancrage spatial délègue cette reconstruction à la perception naturelle humaine. Le taux de cohérence de 94,7 % est encourageant pour la fusion multi-robots, mais les chiffres restent à nuancer : environnement contrôlé de moins de 30 m², trois robots seulement, et couverture incomplète (65 % de la grille de référence atteinte dans la session additionnelle). Pour les intégrateurs industriels et les décideurs B2B, le signal utile est la validité de principe sur matériel grand public (Meta Quest 3, environ 500 euros), ce qui ouvre une voie à des solutions de supervision moins coûteuses que des postes de contrôle dédiés. Le problème de la supervision spatiale de flottes multi-robots est un chantier actif depuis l'essor des AMR dans la logistique et l'inspection industrielle. Les approches dominantes reposent sur des interfaces RVIZ ou des tableaux de bord web 2D, sans restitution de profondeur ni de contexte spatial. Les stacks concurrentes en SLAM multi-robots incluent Cartographer de Google et Nav2 sous ROS 2 ; côté supervision en réalité mixte, les travaux antérieurs ciblaient surtout les bras manipulateurs plutôt que les flottes mobiles. Aucun partenariat industriel ni calendrier de déploiement n'est annoncé. Les prochaines étapes naturelles sont la validation sur robots physiques réels, à plus grande échelle et dans des espaces industriels non contrôlés.

RecherchePaper
1 source
SEDualVLN : un système dual à représentation spatiale enrichie pour la navigation vision-langage
3627arXiv cs.RO 

SEDualVLN : un système dual à représentation spatiale enrichie pour la navigation vision-langage

Une équipe a publié sur arXiv (2605.17249) SEDualVLN, un cadre de navigation visuo-langagière (VLN) à double système pour guider un agent autonome à partir d'instructions en langage naturel. Le Système 1 est un modèle VLM affiné sur des trajectoires de navigation, enrichi d'une conscience spatiale globale et locale, chargé de générer les actions immédiates. Le Système 2 intègre un MLLM généraliste et un module de cartographie 3D temps réel : il planifie des points de passage à partir de vues aériennes de la carte construite à la volée et d'un flux d'images de chemin rendues. Ce schéma rapide-lent coordonné atteint des performances état-de-l'art sur les benchmarks VLN-CE (VLN in Continuous Environments). L'intérêt de SEDualVLN est de réconcilier deux paradigmes aux défauts complémentaires. Les approches end-to-end peinent sur les trajectoires longues et manquent de raisonnement dynamique : fine-tunées sur des données de navigation, elles mémorisent des comportements sans réellement planifier. Les pipelines zero-shot exploitent des MLLM pré-entraînés sans ré-entraînement, ce qui offre une meilleure généralisation, mais souffre d'un ancrage spatial insuffisant et d'un temps d'inférence élevé. SEDualVLN hybride les deux : le Système 1 conserve la réactivité end-to-end, le Système 2 apporte la planification raisonnée du modulaire. Pour des robots mobiles de service ou des assistants de livraison intérieure, ce type d'architecture ouvre une voie vers des agents capables de suivre des instructions complexes dans des espaces jamais vus à l'entraînement. Le VLN est un sous-domaine actif de l'IA incarnée, avec des benchmarks comme R2R (Room-to-Room) et VLN-CE sur des environnements Matterport3D et Habitat. SEDualVLN s'inscrit dans une tendance à combiner LLM généralistes et modules de cartographie explicites, direction déjà explorée par NavGPT ou MapGPT. Le papier reste un preprint non évalué par les pairs, sans code ni démo publique, ce qui rend la reproduction indépendante difficile à ce stade. La prochaine étape naturelle est une validation sur robot physique : toutes les expériences rapportées restent pour l'instant confinées à la simulation.

RechercheOpinion
1 source
Pliage dynamique de tissu par robot grâce au contrôle prédictif basé sur l'opérateur de Koopman
3628arXiv cs.RO 

Pliage dynamique de tissu par robot grâce au contrôle prédictif basé sur l'opérateur de Koopman

Une équipe de chercheurs a soumis sur arXiv en mai 2026 (arXiv:2605.18373) une approche de contrôle prédictif par modèle (MPC) pour le pliage dynamique de tissu par bras robotique. Le système repose sur la régression par noyau de l'opérateur de Koopman, une technique d'identification de systèmes non linéaires, pour construire un modèle linéaire de substitution du comportement du tissu. Ce modèle surrogate est entraîné à partir de données issues d'un simulateur physique haute-fidélité, puis intégré dans l'algorithme MPC à la place du modèle non linéaire coûteux, permettant de générer des trajectoires de pliage rapide. Les expériences couvrent des environnements simulés et un robot réel, démontrant la capacité à atteindre des configurations de pliage non vues à l'entraînement sans dégradation mesurée de la précision. L'enjeu est structurant pour la manipulation d'objets déformables : le pliage dynamique de tissu, qui exploite l'inertie du textile via des mouvements rapides, bute depuis des années sur un compromis persistant entre vitesse et précision, les systèmes existants nécessitant plusieurs tentatives ou se limitant à des pièces rigides et petites. Le transfert sim-to-real est également un obstacle majeur avec les modèles physiques non linéaires du tissu, dont l'inférence haute-fidélité est prohibitive en temps réel. En linéarisant la dynamique du tissu via l'opérateur de Koopman, les auteurs allègent drastiquement la charge computationnelle du MPC, ouvrant la voie à un contrôle quasi-temps-réel pour des applications textiles industrielles (blanchisseries, e-commerce, confection). Il convient toutefois de signaler que les expériences en conditions réelles restent limitées en portée à ce stade de preprint, sans validation sur une grande diversité de matières ou de formats de vêtements. L'opérateur de Koopman connaît depuis 2020-2021 un intérêt croissant en robotique comme alternative aux modèles neuronaux pour la linéarisation de systèmes non linéaires, notamment dans la locomotion et la manipulation. Dans le domaine du cloth manipulation, des travaux récents de Columbia, MIT ou de l'équipe derrière UniGarmentManip ont exploré les politiques par apprentissage par renforcement ou par diffusion, mais sans combiner la structure MPC avec l'identification Koopman. Aucune entreprise ni spin-off n'est associée à cette publication. Les suites logiques incluent une validation sur une plus grande variété de tissus (matières, tailles, rigidités variables) et l'intégration dans un pipeline complet combinant perception de l'état du tissu et planification de préhension, deux briques que le preprint ne couvre pas encore.

RecherchePaper
1 source
FUNCanon : primitives d'action sensibles à la pose par canonicalisation fonctionnelle d'objets pour la manipulation robotique généralisable
3629arXiv cs.RO 

FUNCanon : primitives d'action sensibles à la pose par canonicalisation fonctionnelle d'objets pour la manipulation robotique généralisable

Des chercheurs ont publié FuncCanon sur arXiv (réf. 2509.19102, deuxième révision), un framework qui décompose les tâches de manipulation robotique à long horizon en séquences d'"action chunks", des triplets structurés (acteur, verbe, objet), pour apprendre des politiques généralisables à partir de démonstrations humaines. L'idée centrale est de centrer l'apprentissage sur les actions elles-mêmes, pas sur des tâches isolées, ce qui ouvre la voie à la composition et à la réutilisation de primitives. La brique technique originale est la "canonicalisation fonctionnelle d'objets" : les objets sont projetés dans des repères fonctionnels partagés en s'appuyant sur des cues d'affordance extraites de grands modèles vision-langage (VLM). Ce mapping automatique permet de transférer des trajectoires de manipulation entre instances d'une même catégorie sans nouvelles démonstrations. La politique apprise, FuncDiffuser, est une politique de diffusion centrée objet et action, entraînée sur ces données alignées et évaluée sur des benchmarks en simulation et en déploiement réel. L'abstract ne fournit pas de métriques précises (temps de cycle, taux de succès chiffré, nombre de DOF testés), ce qui limite l'évaluation indépendante à ce stade. Le problème que FuncCanon attaque directement est la généralisation hors distribution des politiques end-to-end issues de l'imitation learning, un obstacle bien documenté qui bloque le passage à l'échelle industrielle. En normalisant la pose et la fonctionnalité des objets avant l'apprentissage, FuncDiffuser n'a pas besoin de voir chaque instance d'une catégorie lors de l'entraînement, ce qui réduit structurellement le volume de démonstrations nécessaires par référence produit. Pour un intégrateur industriel, c'est un levier économique potentiellement significatif : le coût de télé-opération pour collecter des données reste l'un des principaux freins au déploiement de bras robotiques en production. Les auteurs revendiquent également une robustesse sim-to-real, mais sans chiffres publiés dans l'abstract, cette affirmation reste à vérifier sur les benchmarks complets disponibles sur le site du projet. FuncCanon s'inscrit dans une vague de travaux visant à dépasser les limites des politiques de diffusion pures (Diffusion Policy, Chi et al., 2023) en ajoutant des représentations sémantiques intermédiaires. Les approches concurrentes incluent Pi-0 de Physical Intelligence, qui exploite une architecture VLA (vision-language-action) pour la généralisation zéro-shot, et GR00T N2 de NVIDIA, qui mise sur un entraînement massif sur données synthétiques. ACT (Action Chunking with Transformers, Zhao et al., 2023) partage la logique de découpage en chunks mais sans canonicalisation fonctionnelle. L'utilisation des VLMs pour extraire des affordances plutôt qu'apprendre des représentations ad hoc est une tendance forte portée par RT-2 de Google DeepMind et OpenVLA. FuncCanon reste pour l'instant une contribution académique sans partenaire industriel ni timeline de commercialisation annoncée.

RechercheOpinion
1 source
Planification du mouvement de manipulateurs mobiles non holonomes coopératifs
3630arXiv cs.RO 

Planification du mouvement de manipulateurs mobiles non holonomes coopératifs

Des chercheurs ont déposé sur arXiv (référence 2502.05462, version 2, 2025) un cadre de planification de mouvement en temps réel conçu pour le transport coopératif d'objets par des robots mobiles manipulateurs (MMR) non-holonomes évoluant en environnement dynamique. L'architecture proposée articule deux niveaux : un planificateur global qui trace un chemin entre position initiale et objectif à travers les zones libres d'obstacles, et une commande prédictive non linéaire (NMPC) qui optimise en temps réel la trajectoire de la base mobile et du bras manipulateur simultanément. Pour délimiter les corridors sûrs autour du chemin calculé, les auteurs introduisent une technique originale basée sur des régions convexes en forme d'ellipses, présentée comme rapide et peu gourmande en calcul. Des expériences en simulation et sur robot physique valident la génération de trajectoires kinodynamiquement faisables et sans collision. La difficulté centrale dans la manipulation coopérative par MMR est de planifier conjointement les degrés de liberté de la base mobile et du bras tout en maintenant la cohérence physique de la prise d'objet entre plusieurs robots, un problème que la plupart des approches existantes traitent de façon découplée ou nécessitent un recalcul hors ligne. Proposer une solution intégrée et exécutable en temps réel représente une avancée méthodologique notable pour les intégrateurs travaillant sur la manutention coopérative en entrepôt ou en environnement semi-structuré. La validation hardware, plutôt qu'uniquement simulée, réduit le gap sim-to-real habituel dans ce type de contribution, même si les conditions expérimentales précises (charge utile, nombre de robots, type de bras) ne sont pas détaillées dans l'abstract publié. La planification de mouvement pour robots non-holonomes à roues est un domaine actif depuis les années 1990, mais la combinaison avec des bras polyarticulés et la coordination multi-robot reste un problème ouvert. Les approches concurrentes incluent les algorithmes RRT (Rapidly-exploring Random Trees), les méthodes de décomposition en espaces de configuration et, plus récemment, les politiques apprises par renforcement. L'adoption du NMPC comme planificateur local s'inscrit dans une tendance académique forte, notamment pour les robots mobiles en environnements contraints. La suite naturelle de ces travaux serait une publication complète avec benchmarks comparatifs quantifiés et tests en condition industrielle réelle.

RecherchePaper
1 source
Filtrage hybride variationnel stable pour la récupération de modes de contact et de lois creuses
3631arXiv cs.RO 

Filtrage hybride variationnel stable pour la récupération de modes de contact et de lois creuses

Une équipe de recherche a publié sur arXiv (référence 2605.16398) VHYDRO, un filtre variationnel hybride conçu pour apprendre la dynamique de contact des robots manipulateurs. Le problème ciblé est précis : dans les systèmes à contact riche, une seule observation peut correspondre à plusieurs régimes latents distincts (mouvement libre, impact, stick-slip). Un filtre amortized classique qui n'affecte aucune probabilité à une transition de contact faisable perd définitivement la branche que le robot suit réellement, sans possibilité de récupération. VHYDRO empêche cette perte de branche en mélangeant la loi de proposition apprise avec une loi de transition physiquement faisable avant l'échantillonnage et la pondération d'importance, garantissant ainsi que chaque transition conservée par le support du modèle reste couverte. Le système infère conjointement un état latent continu et un mode de contact discret, puis ajuste une loi port-Hamiltonienne sparse à chaque régime récupéré. Les résultats empiriques portent sur des démonstrations ManiSkill et sur quatre familles de tâches Sawyer/BridgeData, où VHYDRO surpasse les baselines post-hoc et sans mode sur trois métriques : ARI, change-point F1 et pureté de segment. L'enjeu pour l'industrie robotique est direct : la manipulation à contact riche, préhension, assemblage, insertion de pièces, reste l'un des points durs non résolus pour le déploiement des bras industriels apprenants. La capacité à segmenter temporellement les régimes de contact en segments cohérents est un prérequis pour toute politique de contrôle hybride robuste. Ce que prouve VHYDRO, c'est qu'un filtre défensif au sens du support peut stabiliser la reconstruction du mode discret et, de là, permettre une identification physique sparse des termes actifs dans chaque régime, là où les baselines purement prédictives échouent. Sous occlusion sévère, condition fréquente en atelier, le filtre classique s'effondre tandis que VHYDRO reste utilisable, ce qui est un argument concret pour les intégrateurs travaillant sur des cellules robotisées peu camérisées. La formalisation port-Hamiltonienne, héritée de la mécanique classique des systèmes conservatifs avec contraintes, est ici appliquée à un contexte d'apprentissage hybride, ce qui constitue une contribution méthodologique distincte des approches neurales purement prédictives. ManiSkill et BridgeData sont des benchmarks de référence pour la manipulation robotique apprise, largement utilisés par les laboratoires de la côte Ouest américaine. Le papier est une prépublication arXiv, sans affiliation institutionnelle ni déploiement annoncé. Les concurrents directs sont les méthodes de segmentation de mode post-hoc et les filtres mode-free à apprentissage end-to-end. Les suites naturelles seraient une validation sur robots réels à contact non structuré et une intégration dans des pipelines de contrôle en boucle fermée.

RecherchePaper
1 source
RoboFlow4D : un modèle du monde de flux léger pour la manipulation robotique guidée par flux en temps réel
3632arXiv cs.RO 

RoboFlow4D : un modèle du monde de flux léger pour la manipulation robotique guidée par flux en temps réel

Des chercheurs ont publié le 22 mai 2026 sur arXiv (référence 2605.17522) les travaux autour de RoboFlow4D, un modèle de planification en flux 3D destiné à la manipulation robotique temps réel. L'approche repose sur ce que les auteurs appellent un "flow world model" : plutôt que d'empiler plusieurs sous-modèles spécialisés dans un pipeline modulaire classique, RoboFlow4D prédit directement des flux de mouvement 3D sur plusieurs trames temporelles à partir d'observations visuelles et d'instructions textuelles. Ce flux explicite sert de plan intermédiaire pour guider la génération d'actions motrices, bouclant ainsi un cycle perception-planification-exécution en une seule architecture de bout en bout. L'exécution repose sur une collaboration dite "slow-fast" entre le prédicteur de flux et le contrôleur d'action, visant à réduire la latence globale. Les résultats présentés couvrent des benchmarks en simulation et des expériences en environnement réel, avec des gains annoncés sur les taux de succès de manipulation et sur l'efficacité computationnelle, sans que les chiffres précis soient détaillés dans l'abstract. L'intérêt de cette direction de recherche réside dans la réduction de la charge de calcul associée aux pipelines VLA (Vision-Language-Action) contemporains. Les architectures modulaires dominantes, comme celles utilisées dans Pi-0 (Physical Intelligence) ou les variantes de GR00T N2 (NVIDIA), impliquent des inférences en cascade coûteuses qui limitent la réactivité en conditions industrielles. RoboFlow4D tente de consolider perception et planification dans un seul modèle léger, ce qui, si les performances se confirment à l'échelle, pourrait abaisser les exigences matérielles pour déployer des politiques de manipulation dextres sur des robots à ressources contraintes. Du côté du contexte compétitif, le domaine des planificateurs par flux optique 3D est actif depuis les travaux sur UniFlow et Flowbot3D, mais leur intégration dans des boucles temps réel reste un défi ouvert. RoboFlow4D se positionne comme une réponse légère à ces limitations. Il s'agit pour l'instant d'un preprint non évalué par les pairs, sans code ni modèle publiés, ce qui invite à la prudence avant tout benchmark indépendant. Les prochaines étapes naturelles seraient une évaluation sur des benchmarks standardisés type RLBench ou LIBERO, et une comparaison directe avec les baselines modulaires qu'il prétend dépasser.

RechercheOpinion
1 source
Estimation de pose des parties d'objets avec une stratégie d'apprentissage sans annotation de symétrie
3633arXiv cs.RO 

Estimation de pose des parties d'objets avec une stratégie d'apprentissage sans annotation de symétrie

Des chercheurs ont déposé le 19 mai 2026 sur arXiv (référence 2605.17033) un nouveau cadre d'apprentissage baptisé SAFAG (Symmetry Annotation-Free framework for Generalizable and Actionable Parts), destiné à améliorer l'estimation de pose des parties fonctionnelles d'objets pour la manipulation robotique. Le problème central adressé est celui de la perception cross-catégorie : un robot doit être capable d'identifier et d'utiliser les parties actionnables d'objets inconnus (poignées de tiroirs, vannes, leviers) sans annotations de symétrie produites manuellement. SAFAG propose une architecture à deux étapes de type candidat-vers-final pour la régression de quaternions (représentation mathématique de l'orientation 3D en espace), couplée à un mécanisme d'apprentissage auto-supervisé qui traite la symétrie des objets comme un problème de distribution de probabilité, supprimant ainsi la dépendance aux annotations manuelles. L'enjeu industriel est concret : l'une des frictions majeures dans le déploiement de bras robotiques polyvalents en atelier ou en logistique est précisément la capacité à actionner des objets variés sans reprogrammation par référence. La symétrie géométrique des pièces (bouton rond, valve cylindrique) génère des ambiguïtés de pose qui font échouer les pipelines de perception classiques, contraignant les intégrateurs à constituer des datasets annotés par catégorie d'objet, une démarche coûteuse et non scalable. En automatisant la gestion de la symétrie via l'apprentissage auto-supervisé, SAFAG pourrait réduire significativement ce coût d'intégration pour des tâches pick-and-place sur objets non structurés, domaine où le sim-to-real reste un défi ouvert. Le concept de GAParts (Generalizable and Actionable Parts) sur lequel s'appuie SAFAG a émergé ces dernières années dans la communauté de l'embodied AI, notamment autour de travaux sur la segmentation sémantique des parties d'objets articulés. Le paysage concurrent inclut AnyGrasp, FoundationPose de NVIDIA et UniGraspTransfer, qui visent tous à généraliser la préhension sans supervision dense. SAFAG se distingue par son traitement explicite de la symétrie sans annotation. Il s'agit néanmoins d'un preprint arXiv sans code publié ni évaluation externe disponible à ce stade : les performances revendiquées restent à reproduire de façon indépendante avant toute considération d'intégration industrielle.

RecherchePaper
1 source
MUSE : quantification multimodale de l'incertitude dans l'estimation d'état
3634arXiv cs.RO 

MUSE : quantification multimodale de l'incertitude dans l'estimation d'état

Une équipe de chercheurs a déposé sur arXiv (référence 2605.17421, mai 2026) un cadre d'apprentissage automatique baptisé MUSE (Multimodal Uncertainty Quantification of State Estimation), conçu pour quantifier en temps réel l'incertitude dans l'estimation d'état visuel. La contribution centrale porte sur l'odométrie visuelle-inertielle (VIO), technique qui fusionne données de caméra et unité de mesure inertielle (IMU) pour localiser un robot sans GPS. MUSE exploite l'architecture Mamba, modèle séquentiel à état discret proposé en 2023 comme alternative efficace aux Transformers, pour traiter plusieurs flux de capteurs asynchrones simultanément. Les expériences ont été conduites sur des jeux de données publics et des données propriétaires ; les auteurs rapportent une fiabilité et une robustesse supérieures aux méthodes existantes, sans fournir dans l'abstract de métriques chiffrées précises permettant une comparaison directe avec l'état de l'art. L'enjeu dépasse la simple précision de localisation : savoir quand ne pas faire confiance à une estimation est aussi critique que l'estimation elle-même. En navigation autonome, en conduite sans conducteur et en vol autonome, une erreur non détectée peut provoquer une collision ou un abandon de mission. Le problème est particulièrement difficile en VIO car la distribution des erreurs est hétéroscédastique (la variance évolue selon les conditions lumineuses, les textures, la vitesse) et multimodale (plusieurs hypothèses de pose simultanément plausibles). Une quantification d'incertitude fiable ouvre la voie à des mécanismes embarqués de détection de défaillance et de dégradation gracieuse, deux capacités très recherchées par les intégrateurs de systèmes autonomes en industrie. L'estimation d'état visuel est un domaine très actif, où filtres de Kalman étendus, graphes de facteurs (GTSAM, g2o) et méthodes neuronales récentes (DPVO, DROID-SLAM) se concurrencent sur des benchmarks standard comme EuRoC ou TUM-VI. Mamba gagne du terrain dans les tâches de séquences longues, et MUSE s'inscrit dans cette tendance en l'appliquant à la fusion sensorielle multi-modale. Aucune affiliation institutionnelle ni partenariat industriel n'est mentionné dans l'abstract, et le papier n'a pas encore été soumis à une revue à comité de lecture confirmée. Les performances annoncées restent donc à valider indépendamment avant toute intégration dans un pipeline de production.

RecherchePaper
1 source
Jing Yue Dongli lève des dizaines de millions de yuans auprès de Xinghaitu pour développer un Robo Labor clé en main
363536Kr 

Jing Yue Dongli lève des dizaines de millions de yuans auprès de Xinghaitu pour développer un Robo Labor clé en main

Jingyue Dynamics (鲸跃动力), fondée début 2026 en Chine, vient de boucler un tour de table seed de plusieurs dizaines de millions de yuans, mené exclusivement par le fonds spécialisé Xinghaitu (星海图), avec Shendu Capital comme conseiller financier exclusif. La startup développe ce qu'elle désigne sous le terme "Robo Labor" : une force de travail robotique conçue sur le modèle de l'infrastructure cloud - abonnable, élastiquement scalable, opérationnelle dès la livraison. L'ambition est de mécaniser les tâches dites "4D" (Deadly, Difficult, Dirty, Duplicate) en commençant par la manutention de matériaux (material handling) dans les secteurs de la logistique et de l'industrie manufacturière. La startup indique avoir noué des partenariats avec plusieurs grands comptes dans ces secteurs, sans les nommer. Les fonds seront alloués au recrutement, à la livraison en production, au développement de compétences spécialisées et aux opérations de collecte de données terrain. La proposition technique de Jingyue repose sur une boucle fermée "données + modèle + effecteur terminal", délibérément en rupture avec la course aux très grands modèles. Son fondateur Li Guangyu défend qu'un modèle scénarisé, alimenté par des données réelles de qualité, suffit à une mise en production rapide. La startup a conçu un système de collecte propriétaire Ego-centric + UMI (Universal Manipulation Interface) offrant une localisation de pose sub-millimétrique et une synchronisation multi-source sub-milliseconde sur les signaux visuels, de force et de position. Un pipeline interne traite jusqu'à un million d'heures de données, couplé à une approche Human-in-the-Loop permettant des corrections en temps réel et une opérabilité garantie dès le "Day 1". Leur modèle 3D du monde intègre la compréhension physique - gravité, friction, déformation - pour franchir le saut de la simple "perception-exécution" vers un régime "cognition-prédiction-adaptation". Pour les intégrateurs B2B, le modèle d'accès est présenté comme direct : connexion hardware, interfaçage des capteurs, puis appel de "skills" prépackagés - une architecture plus proche d'une API robotique que d'un projet d'intégration sur mesure, ce qui reste à vérifier en conditions industrielles réelles. Li Guangyu est docteur en génie électrique de l'USC (University of Southern California) ; il a dirigé les équipes de manipulation dextre et de collecte de données au Beijing Humanoid Robot Innovation Center, pilotant notamment le dataset multimodal RoboMIND et l'agent embodied "慧思开物". Auparavant chez DiDi et Qingzhou Zhihang (autonomie routière), il a construit des pipelines de données à l'échelle du million de séquences. L'équipe fondatrice intègre des vétérans de Geek+ (robots AMR), Neolix, Li Auto, Xiaomi et DiDi, formés à l'USC, Tsinghua, Zhejiang et l'USTC. Sur le plan concurrentiel, le paradigme "data-first" pour l'intelligence embodied a été validé à l'international par Sunday, Generalist AI et Genesis AI, qui ont tous convergé vers l'approche Ego-centric + UMI que Jingyue a adoptée. La startup se positionne explicitement comme une plateforme de skills ouverts, transversale aux intégrateurs hardware, plutôt que comme un constructeur de plateforme humanoide - un pari sur l'hypothèse que la qualité et l'efficacité des données seront le vrai différenciateur dans la prochaine phase de scaling de la robotique embodied.

Chine/AsieActu
1 source
Des robots différents peuvent apprendre à effectuer des tâches sans nouveau code
3636New Atlas Robotics 

Des robots différents peuvent apprendre à effectuer des tâches sans nouveau code

Des chercheurs de l'EPFL ont développé une méthode permettant à des robots de morphologies différentes d'apprendre des tâches les uns des autres sans réécriture de code. L'approche exploite une représentation abstraite de la tâche, dissociée de la cinématique propre à chaque plateforme, ce qui permet à un robot à bras articulé d'acquérir un comportement démontré par un robot quadrupède ou à base mobile, par exemple. Aucune date de publication ni de chiffres de performance (taux de succès, degrés de liberté, temps d'entraînement) ne sont disponibles dans la communication initiale. L'enjeu industriel est significatif : aujourd'hui, chaque déploiement d'un nouveau robot dans une cellule automatisée implique un cycle complet de programmation ou de fine-tuning, ce qui représente des semaines d'intégration et un coût élevé. Si une telle méthode de transfert inter-embodiment se confirme à l'échelle, elle réduirait drastiquement le temps de mise en production, notamment dans les environnements multi-robots hétérogènes comme les entrepôts ou les lignes d'assemblage flexibles. Cela rejoint les travaux récents sur les politiques cross-embodiment portés par des modèles comme pi-0 (Physical Intelligence) ou RT-X (Google DeepMind), qui cherchent eux aussi à généraliser au-delà d'une seule plateforme. L'EPFL abrite plusieurs laboratoires actifs en apprentissage robotique, dont le Biorobotics Lab et le Computational Robot Design & Fabrication Lab. Cette annonce s'inscrit dans une tendance plus large où la recherche européenne cherche à rivaliser avec les efforts américains et chinois sur l'apprentissage par imitation et le transfert de politiques. L'article source reste un teaser sans accès au papier complet ni aux benchmarks, ce qui rend toute évaluation des performances prématurée.

FR/EU ecosystemePaper
1 source
Des scientifiques américains développent des robots autonomes capables d'apprendre directement auprès des chercheurs
3637Interesting Engineering 

Des scientifiques américains développent des robots autonomes capables d'apprendre directement auprès des chercheurs

L'Argonne National Laboratory, laboratoire fédéral américain rattaché au Département de l'Énergie (DOE), a annoncé le développement de RoSA (Robot Scientific Assistant for Accelerating Experimental Workflows), un projet visant à créer des robots capables d'apprendre les procédures expérimentales directement en observant des chercheurs humains. L'approche repose sur l'imitation par démonstration : les scientifiques portent des capteurs pendant leurs manipulations, permettant de capturer mouvements, flux de travail et processus de décision, données qui alimentent ensuite des modèles d'IA chargés de reproduire correctement ces protocoles. Nicola Ferrier, informaticienne senior spécialisée en vision par ordinateur, dirige le volet robotique, tandis qu'Arvind Ramanathan contribue son expertise en systèmes de décision autonomes. Trois configurations matérielles sont envisagées : bras robotiques fixes, robots humanoïdes, et systèmes hybrides combinant mobilité et précision stationnaire. Les systèmes seront d'abord validés en simulation virtuelle avant tout déploiement en environnement réel. L'équipe cible une multiplication par cinq de l'efficacité sur les tâches ciblées d'ici un an. RoSA alimentera également OPAL (Orchestrated Platform for Autonomous Laboratories), initiative DOE parallèle visant à créer des réseaux de laboratoires autonomes capables d'apprentissage indépendant, notamment pour des expériences biologiques. Ce projet marque un changement d'approche dans la robotisation scientifique : plutôt que de programmer manuellement chaque geste, l'équipe d'Argonne parie sur l'imitation learning, une méthode qui supprime la phase de programmation explicite pour chaque nouveau protocole. Pour les intégrateurs et les décideurs B2B, cela ouvre la perspective de robots reconfigurables sur simple démonstration humaine, sans expertise en robotique embarquée. L'enjeu est concret : automatiser les tâches répétitives ou dangereuses (pipetage, manipulation de produits chimiques, expériences à haute cadence) améliorerait à la fois la sécurité et la reproductibilité des résultats. Quelques réserves s'imposent néanmoins : l'objectif x5 d'efficacité n'est qu'une cible interne sur douze mois, sans métriques de référence publiées ni benchmark externe validé, et aucun déploiement opérationnel en laboratoire réel n'est encore annoncé. La distance entre validation en simulation et robustesse en environnement de laboratoire réel constitue le principal risque d'exécution de ce type de projet. RoSA s'inscrit dans la Genesis Mission du DOE, initiative nationale mobilisant IA, informatique quantique et supercalculateurs pour doubler la productivité de la recherche américaine dans la décennie. Le segment des "self-driving laboratories" est en pleine croissance : le groupe Cronin à l'Université de Glasgow a publié des résultats emblématiques sur un laboratoire chimique autonome piloté par IA, Emerald Cloud Lab (États-Unis) propose déjà des services de laboratoire entièrement automatisés à distance, et des équipementiers comme Beckman Coulter ou Tecan fournissent des plateformes d'automatisation avancées au marché pharmaceutique. Argonne cherche à se positionner comme référence en robotique scientifique généraliste, au-delà des tâches chimiques ou biologiques standardisées déjà couvertes par ces acteurs. La prochaine étape annoncée reste la démonstration du gain x5 d'efficacité, préalable à une intégration progressive aux équipements existants de laboratoires partenaires.

RecherchePaper
1 source
Boston Dynamics révèle comment Atlas soulève des charges industrielles de 45 kg en production
3638Interesting Engineering 

Boston Dynamics révèle comment Atlas soulève des charges industrielles de 45 kg en production

Boston Dynamics a publié début 2025 un billet technique détaillant comment son robot humanoïde Atlas a appris à manipuler des charges industrielles lourdes grâce au reinforcement learning et à la simulation à grande échelle. La démonstration montre Atlas effectuer une rotation du torse à 180 degrés, se baisser pour saisir un mini-réfrigérateur, puis le transporter sur plusieurs mètres en compensant le déplacement du poids interne de l'objet. La charge nominale d'entraînement se situe entre 23 et 32 kg (50-70 lb), mais le robot a réussi à déplacer un réfrigérateur dépassant les 45 kg (100 lb) lors des tests. Pour percevoir le poids, l'équilibre et la résistance, Atlas s'appuie principalement sur la proprioception, c'est-à-dire la conscience interne de son propre corps, plutôt que sur la vision seule. L'entraînement repose sur des millions d'heures de simulation parallèle sur GPU, où l'on fait varier le poids de l'objet, le frottement au sol, la force de préhension et la position initiale de la charge pour forcer le robot à généraliser ses comportements. Ce que cette publication révèle, au-delà de la performance brute, c'est une avancée méthodologique sur le problème dit du "sim-to-real gap" : l'écart historique entre les comportements appris en simulation et leur transposition sur le robot physique. Boston Dynamics affirme l'avoir réduit grâce à une architecture matérielle délibérément simplifiée : Atlas n'utilise que deux types d'actionneurs sur l'ensemble du corps, les bras et les jambes sont symétriques, et les câbles ont été éliminés au niveau des articulations, autorisant une rotation continue des joints et réduisant les sources d'usure et de latence. Pour les intégrateurs industriels et les décideurs B2B, cela signifie que la simulation devient un outil de développement comportemental fiable, raccourcissant potentiellement les cycles de mise en production. Le fait que le comportement de levage ait été développé en quelques semaines seulement après le lancement public d'Atlas est un signal fort sur la scalabilité du pipeline d'entraînement. Il faut toutefois noter que la démonstration reste une vidéo sélectionnée en laboratoire : aucun déploiement terrain ni données de fiabilité sur durée longue ne sont communiqués. Boston Dynamics, rachetée par Hyundai en 2021 pour 1,1 milliard de dollars, a rebooté Atlas en version entièrement électrique début 2024, abandonnant la plateforme hydraulique utilisée depuis 2013. Ce nouvel Atlas se positionne explicitement comme un "outil polyvalent pour le travail physique", en concurrence directe avec Figure (Figure 02 et 03 annoncés), Tesla (Optimus Gen 3), Physical Intelligence (Pi-0), Agility Robotics (Digit), et NVIDIA dans l'écosystème GR00T N2. La décision de lier les démonstrations athlétiques d'Atlas, dont des figures au sol et des backflips, à des cas d'usage industriels est une communication stratégique visant à montrer que l'agilité n'est pas une fin en soi mais un proxy pour la robustesse en environnement difficile. Les prochaines étapes annoncées concernent des pilotes en environnement industriel réel, notamment avec BMW, sans calendrier précis communiqué.

HumanoïdesOpinion
1 source
Comau acquiert Invent, spécialiste brésilien de l'intralogistique et de l'automatisation d'entrepôt
3639Robotics & Automation News 

Comau acquiert Invent, spécialiste brésilien de l'intralogistique et de l'automatisation d'entrepôt

Comau, l'intégrateur d'automatisation industrielle d'origine italienne, a signé un accord d'acquisition contraignant portant sur Invent, société brésilienne spécialisée dans l'intralogistique et l'automatisation d'entrepôts. La transaction reste soumise aux conditions habituelles de ce type d'opération, notamment l'obtention des autorisations réglementaires. Invent s'est construit un positionnement sur les environnements e-commerce et les centres de distribution à fort débit, deux segments en croissance accélérée en Amérique latine. Aucune valorisation ni date de closing n'a été communiquée publiquement à ce stade. Pour Comau, ce rachat signale une diversification stratégique au-delà de l'automatisation industrielle lourde traditionnelle vers le segment intralogistique, où les marges et les volumes de déploiement sont portés par la logistique du dernier kilomètre et l'essor du e-commerce. Intégrer une société locale au Brésil donne aussi à Comau un ancrage direct sur le plus grand marché d'Amérique latine, où la pression sur les coûts de main-d'oeuvre et la densification des réseaux de distribution créent une demande croissante pour les solutions de convoyage, tri automatisé et gestion de flux. L'opération reste cependant une annonce de closing sous conditions, pas un déploiement actif. Comau, historiquement lié à Fiat puis Stellantis avant son introduction en bourse en 2021, cherche depuis à s'affranchir de sa dépendance à l'automobile en élargissant son portefeuille vers la logistique et les soins de santé. Sur ce terrain, il affronte des acteurs établis comme Dematic, Körber, Swisslog ou l'espagnol Mecalux, ainsi que des spécialistes régionaux. Les prochaines étapes décisives seront l'obtention des clearances réglementaires brésiliennes et la définition du modèle d'intégration produit entre les deux entités.

FR/EU ecosystemeActu
1 source
FANUC renforce l'intégration de ses robots avec NVIDIA Isaac Sim
3640Robotics Business Review 

FANUC renforce l'intégration de ses robots avec NVIDIA Isaac Sim

FANUC a annoncé début mai 2026 un renforcement de l'intégration entre son logiciel de simulation ROBOGUIDE et le framework NVIDIA Isaac Sim, articulé autour de deux modes d'opération complémentaires. Dans le premier, Isaac Sim pilote l'interface utilisateur tandis que ROBOGUIDE tourne en arrière-plan pour garantir la fidélité des trajectoires : les opérateurs manipulent le robot en temps réel via un pupitre virtuel ou physique connecté à ROBOGUIDE, comme sur une machine réelle, avec possibilité d'enseigner des programmes et de vérifier les résultats directement dans l'environnement simulé. Le second mode intègre le moteur physique NVIDIA PhysX dans ROBOGUIDE, permettant de simuler des scénarios de bin picking avec des pièces en vrac modélisées par physique procédurale, associées au système de vision 3D de ROBOGUIDE pour les opérations pick-and-place. En parallèle, FANUC a présenté ce mois-ci un démonstrateur de pliage de T-shirts basé sur le modèle fondation GR00T N de NVIDIA, exécuté sur la plateforme embarquée Jetson Thor via apprentissage par imitation. La collaboration avait été démontrée pour la première fois à l'IREX de Tokyo en décembre 2025. L'enjeu industriel est double. La promesse d'éliminer le "sim-to-real gap" (l'écart de comportement entre robot simulé et robot réel) repose sur l'utilisation des mêmes algorithmes de contrôle dans les deux environnements ; si elle tient en production, cela réduirait significativement le temps de mise en service virtuelle (virtual commissioning), poste de coût majeur pour les intégrateurs industriels. La simulation de bin picking avec PhysX répond par ailleurs à un besoin concret : ce type de cellule nécessitait jusqu'ici de longs essais physiques avec de vraies pièces. Une réserve s'impose cependant : les vidéos de démonstration sont sélectionnées pour leur succès et ne permettent pas de conclure sur la robustesse à l'échelle avec des géométries complexes ou des conditions d'éclairage variables. L'intégration d'Isaac Lab pour l'apprentissage par renforcement et par imitation ouvre également la voie à la génération de politiques de contrôle sans programmation explicite, un gain de temps réel pour les petites séries. FANUC, fondé en 1972 à Oshino au Japon et premier fournisseur mondial de commandes numériques et de robots industriels avec plus de 900 000 unités installées, consolide ici un partenariat avec NVIDIA initié autour des plateformes Jetson et Omniverse. La concurrence directe est significative : ABB propose RobotStudio, KUKA son environnement KUKA.Sim, Universal Robots URSim, mais aucun n'affiche encore une intégration bi-directionnelle aussi étroite avec l'écosystème NVIDIA. Du côté des constructeurs d'humanoïdes (Figure, 1X, Agility Robotics), la simulation haute-fidélité est aussi un levier clé pour l'entraînement des modèles VLA (vision-language-action), segment que FANUC ne cible pas mais dont l'outillage converge vers les mêmes briques technologiques. Les prochaines étapes annoncées portent sur l'extension du support aux composants flexibles (câbles, textiles) et le déploiement commercial de la cellule de pliage basée sur GR00T N, dont les timelines n'ont pas encore été précisées.

IndustrielOpinion
1 source
Faraday Future lève 25 millions de dollars pour livrer 1 500 robots d'ici la fin de l'année
3641Robotics Business Review 

Faraday Future lève 25 millions de dollars pour livrer 1 500 robots d'ici la fin de l'année

Faraday Future, constructeur automobile électrique basé à Los Angeles fondé en 2014, a annoncé la semaine dernière une levée de 25 millions de dollars via l'émission de billets à ordre convertibles auprès d'investisseurs privés. Cumulée au financement de 45 millions de dollars obtenu en avril 2026, la société totalise désormais 70 millions de dollars levés en deux mois. Sur les 25 millions, 12,5 millions sont débloqués immédiatement sur le compte opérationnel de l'entreprise, les 12,5 millions restants étant conditionnels à des critères de performance définis contractuellement. L'objectif affiché est de livrer 1 500 robots d'ici fin 2026, après n'en avoir expédié que 68 depuis le lancement commercial en février 2026 et 200 unités visées pour le seul deuxième trimestre. La gamme comprend trois modèles à pattes -- FF Futurist, FF Master et FX Aegis -- avec un quatrième robot annoncé pour juin 2026. Un accord de mémorandum d'entente a également été signé avec RobotShop, plateforme e-commerce nord-américaine spécialisée en robotique, qui distribuera les produits Faraday Future à l'international. Le chiffre d'affaires du premier trimestre 2026 s'élève à 512 000 dollars, en hausse de 62 % par rapport aux 316 000 dollars du T1 2025, et représente déjà 95 % du revenu annuel total 2025 (536 000 dollars) -- dont 26 % proviennent de licences logicielles et de packs de compétences (SKILLS). Ces chiffres illustrent à la fois la dynamique et les limites d'une stratégie de pivot vers la robotique. 68 unités livrées face à une cible annuelle de 1 500 représente un ratio d'exécution de 4,5 %, ce qui rend l'objectif difficile à tenir sans accélération industrielle significative. La structure de financement -- billets convertibles non immédiatement négociables, avec la moitié des fonds séquestrés -- traduit une prudence des investisseurs plus qu'un vote de confiance inconditionnel. Pour les intégrateurs et décideurs B2B, le signal réel est la présence sur RobotShop : Faraday Future mise sur un canal de distribution à volume plutôt que sur des déploiements industriels profonds, ce qui positionne ses robots davantage comme des produits grand public ou PME que comme des solutions d'automatisation enterprise. Faraday Future s'est construit une réputation difficile dans l'automobile électrique -- la FF 91 n'a jamais atteint une production significative, et l'entreprise a traversé plusieurs crises financières depuis 2021. Son repositionnement dans la robotique incarnée (EAI, Embodied AI) suit une logique de survie plus que de stratégie organique. Dans un secteur dominé par Figure AI (Figure 03), Boston Dynamics, Agility Robotics (Digit), 1X Technologies et le Tesla Optimus Gen 3, Faraday Future aborde le marché avec des robots à pattes non humanoïdes, un segment moins concurrentiel mais aussi moins structuré commercialement. Aucun acteur européen ou français n'est directement impliqué dans ce dossier. Les prochaines étapes à surveiller : le lancement effectif du robot de juin 2026, le rythme réel de livraison au T2, et la conversion des 1 200 pré-commandes non contraignantes en commandes fermes.

BusinessOpinion
1 source
Deep Robotics lance un robot hybride roues-pattes pour l'inspection industrielle et les interventions d'urgence
3642Robotics & Automation News 

Deep Robotics lance un robot hybride roues-pattes pour l'inspection industrielle et les interventions d'urgence

Deep Robotics, entreprise chinoise spécialisée en robotique mobile fondée en 2018 à Hangzhou, a annoncé le Lynx M20S, robot hybride à roues et pattes de nouvelle génération. Successeur direct du Lynx M20, ce modèle cible l'inspection industrielle en milieux contraints et les interventions d'urgence sur terrain accidenté. Selon le communiqué de lancement, les améliorations portent sur trois axes : capacité de charge utile (payload), niveau de protection mécanique et environnementale (indice IP non précisé dans l'annonce), et vitesse de déplacement. Les chiffres exacts de ces paramètres n'ont pas été publiés au moment du lancement, ce qui limite l'évaluation indépendante des performances annoncées. L'architecture roues-pattes répond à une contrainte réelle des déploiements industriels : naviguer efficacement sur sol plat (où les pattes seules sont lentes et énergivores) tout en franchissant obstacles et escaliers inaccessibles aux AMR classiques. Pour un intégrateur ou un COO industriel, ce type de plateforme réduit le besoin de préparer l'environnement (ramps, marquages au sol), ce qui abaisse les coûts d'intégration. Le positionnement sur l'urgence (emergency response) suggère également une résistance renforcée aux conditions extrêmes, bien que les certifications correspondantes ne soient pas encore confirmées publiquement. Deep Robotics a commercialisé le Lynx M20 dans plusieurs applications d'inspection pétrolière, minière et de centrales électriques, notamment en Chine et au Moyen-Orient. Sur ce segment hybride, les concurrents directs incluent ANYbotics (ANYmal D, basé en Suisse) et Boston Dynamics (Spot), ainsi que Unitree avec le B2-W. Les prochaines étapes attendues sont la publication de fiches techniques complètes et l'annonce de pilotes industriels, probablement à l'occasion de foires sectorielles comme CIROS ou IROS 2026.

IndustrielActu
1 source
Qu'est-ce qui rend un métier ennuyeux, sale ou dangereux ?
3643IEEE Spectrum Robotics 

Qu'est-ce qui rend un métier ennuyeux, sale ou dangereux ?

Une équipe de chercheurs a mené une analyse systématique de la littérature robotique publiée entre 1980 et 2024 pour examiner comment la discipline utilise le cadre dit "DDD", dull, dirty, dangerous (répétitif, sale, dangereux), pour justifier le déploiement de robots dans certains secteurs. Le résultat est frappant : sur des milliers de publications mentionnant ce triptyque, seulement 2,7 % en proposent une définition explicite et seulement 8,7 % citent des exemples concrets de tâches ou de métiers visés. Les chercheurs ont ensuite croisé ces données avec la littérature en sciences sociales, anthropologie, économie, psychologie, sociologie, pour proposer un cadre analytique plus rigoureux des trois catégories. Cette imprécision n'est pas sans conséquences pour les décideurs et les ingénieurs qui orientent les feuilles de route robotiques. Sur le volet "dangereux", les données administratives sur les accidents du travail souffrent d'une sous-déclaration estimée à 70 % dans certaines études, et les statistiques sont rarement désagrégées par genre, statut migratoire ou type d'activité informelle. Exemple concret : la plupart des équipements de protection individuelle, masques, gilets, gants, sont dimensionnés pour des morphologies masculines, exposant les femmes à des risques accrus dans les environnements industriels. Sur le volet "sale", la dimension physique (déchets, substances toxiques, entretien) ne représente qu'une partie du concept : la stigmatisation sociale joue un rôle central. Les métiers "socialement dégradants" (agents de recouvrement, agents pénitentiaires) ou "moralement ambigus" selon les normes culturelles entrent dans cette catégorie, et la frontière varie selon les époques et les pays. Les chercheurs soulignent également un paradoxe important pour la conception des systèmes robotiques : un emploi classé "bas prestige" dans les enquêtes quantitatives sur le prestige professionnel peut être vécu avec fierté et sens par ceux qui l'exercent, ce que les roboticiens oublient souvent de mesurer avant d'intervenir. Le cadre DDD est apparu dans les années 1980 comme raccourci rhétorique pour légitimer la robotisation industrielle, notamment dans l'automobile et la manutention lourde. Il s'est imposé sans véritable formalisation, héritage d'une époque où la robotique se déployait quasi exclusivement en milieu manufacturier contrôlé. Aujourd'hui, avec l'essor des robots humanoïdes (Figure AI, Apptronik, Agility Robotics) et des systèmes mobiles en environnements non structurés, la cible s'étend à des secteurs comme les soins à domicile, la logistique urbaine ou l'agriculture. L'enjeu soulevé par cette recherche est de forcer la discipline à définir précisément quel problème humain elle cherche à résoudre, pour quels travailleurs, dans quel contexte culturel, avant de concevoir le robot, pas après.

RecherchePaper
1 source
Robot humanoïde abordable à 15 000 dollars : un kit pour démocratiser la robotique avancée
3644Interesting Engineering 

Robot humanoïde abordable à 15 000 dollars : un kit pour démocratiser la robotique avancée

Menlo Research, une startup basée à Singapour, a lancé un kit de construction pour son robot humanoïde open-source Asimov, vendu environ 15 000 dollars, soit un prix proche du coût réel de ses composants selon la liste publiée sur GitHub. Le robot mesure 1,20 mètre, pèse 35 kilogrammes et dispose de plus de 25 degrés de liberté. Livré entièrement démonté, avec manuels et vidéos de montage, il cible chercheurs, développeurs et hobbyistes avancés. L'architecture est entièrement modulaire : jambes, bras, torse et tête s'interconnectent via des fixations moteur universelles, permettant le remplacement ou la mise à niveau de composants sans refonte globale. La cheville utilise un mécanisme parallèle RSU (Revolute-Spherical-Universal) à deux degrés de liberté (roulis et tangage), améliorant la distribution du couple sur terrain irrégulier. Les orteils sont passifs (non actionnés), simplifiant la transition appui-poussée et réduisant la charge calculatoire. Les pièces structurelles sont optimisées pour l'impression 3D Multi Jet Fusion (MJF), éliminant le recours à l'usinage CNC coûteux. Côté logiciel, l'entraînement repose sur une approche "Processor-in-the-Loop" (PIL) qui injecte délibérément des imperfections réalistes : latences CANBus simulées jusqu'à 9 millisecondes et bruit de capteurs via une couche d'émulation I2C. Un framework Asymmetric Actor-Critic sépare le "critic" (accès aux données de simulation exactes) de l'"actor" (signaux bruités et retardés comme en conditions matérielles réelles), aboutissant à un transfert sim-to-real en zéro-shot : marche avant et arrière, récupération après poussées externes, sans calibration supplémentaire sur le robot physique. Ce positionnement tarifaire est notable dans un secteur où les plateformes humanoïdes commerciales de référence restent fermées ou inaccessibles aux équipes indépendantes. Le zero-shot sim-to-real représente l'un des verrous historiques de la locomotion humanoïde ; l'approche PIL, qui force le modèle à apprendre sous latence et bruit réalistes dès la phase simulation, constitue une réponse directe au problème classique du sim-to-real gap que rencontrent des projets comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA lors du passage à l'échelle. Pour un laboratoire de recherche ou un intégrateur, cela représente un cycle de développement potentiellement plus court entre simulation et déploiement terrain, sans nécessiter de fine-tuning sur matériel physique coûteux. Menlo Research s'inscrit dans la tendance d'open-sourcing de la robotique humanoïde, aux côtés de l'Open Dynamic Robot Initiative et du Unitree H1 (environ 20 000 dollars, firmware partiellement ouvert). Asimov ne rivalise pas directement avec Figure 03, Tesla Optimus Gen 3 ou Agility Digit pour les déploiements industriels à grande échelle : il cible le segment recherche et éducation, aujourd'hui peu couvert par des plateformes réellement capables de locomotion autonome. La publication du bill-of-materials complet sur GitHub renforce la crédibilité de la démarche, même si 15 000 dollars reste hors portée du grand public et que les performances annoncées n'ont pas encore été validées de manière indépendante. Les prochaines étapes annoncées portent sur l'amélioration de la stack logicielle et l'élargissement de la communauté open-source autour du projet.

HumanoïdesActu
1 source
Vidéo : le cerveau robotique de Genesis permet une manipulation au niveau humain et un entraînement à grande échelle
3645Interesting Engineering 

Vidéo : le cerveau robotique de Genesis permet une manipulation au niveau humain et un entraînement à grande échelle

Genesis AI a présenté GENE-26.5, un modèle de fondation robotique conçu pour doter les robots de capacités de manipulation au niveau humain. La vidéo de démonstration publiée par l'entreprise montre des robots accomplissant une séquence culinaire de 20 étapes (couper des tomates, casser un oeuf d'une seule main, coordonner les deux bras pendant la cuisson), ainsi que la préparation d'un smoothie avec service en l'air, des tâches de laboratoire (pipettage, transfert de liquides), du câblage pour assemblage électronique, la résolution d'un Rubik's Cube en manipulation aérienne continue, et l'interprétation d'une pièce de piano rapide. Pour alimenter l'entraînement du modèle, l'entreprise a développé un gant haptique équipé d'une peau électronique à capteurs tactiles, établissant une correspondance 1:1:1 entre la main humaine, le gant et la main robotique. Genesis revendique un coût matériel cent fois inférieur aux solutions de télé-opération conventionnelles, et une efficacité de collecte de données cinq fois supérieure. Le moteur de données associé intègre également des vidéos égocentriques issues de caméras portables et des vidéos publiques centrées sur l'activité humaine. Ces résultats, s'ils se confirment en environnement réel non contrôlé, représentent une avancée potentiellement significative sur l'un des verrous les plus tenaces de la robotique : l'écart d'incarnation (embodiment gap) entre les mains humaines et robotiques, qui limite depuis des années la transférabilité des données d'entraînement. La cartographie 1:1 glove-to-robot est une approche déjà explorée par des acteurs comme Physical Intelligence (pi-0) et plusieurs laboratoires académiques, mais Genesis revendique une démonstration à une échelle et une polyvalence inédites. Pour les intégrateurs industriels et les décideurs cherchant à automatiser des tâches non structurées (assemblage fin, préparation culinaire en volume, logistique d'entrepôt), la promesse d'un système généraliste capable d'apprendre directement des gestes humains quotidiens, sans retraining extensif, représenterait un changement de paradigme. Il faut toutefois noter que les démonstrations sont des vidéos éditées, sans données indépendantes sur le taux d'échec, les conditions d'éclairage, ou la reproductibilité en cycle de production continu. Genesis AI s'inscrit dans un segment en forte concurrence avec Physical Intelligence (pi-0, Berkeley), Figure AI (Figure 03, déployé avec BMW), Tesla (Optimus Gen 3), NVIDIA (GR00T N2) et Apptronik (Apollo). L'approche par gant haptique à bas coût rappelle les travaux d'Enchanted Tools, acteur français du service robotique, qui mise également sur la capture de mouvement humain pour réduire le coût d'entraînement. Genesis n'a pas encore annoncé de déploiements industriels confirmés ni de partenariats nominatifs : GENE-26.5 reste à ce stade une annonce de produit accompagnée d'une démonstration vidéo, pas un système disponible commercialement. L'entreprise indique prévoir le déploiement de ses gants en milieu de travail réel via des partenariats industriels, avec pour objectif de constituer une bibliothèque de compétences humaines à grande échelle pour l'entraînement robotique.

IA physiqueActu
1 source
Le robot humanoïde Tinnie devient apprenti dans un projet de rénovation, une première mondiale
3646Interesting Engineering 

Le robot humanoïde Tinnie devient apprenti dans un projet de rénovation, une première mondiale

Un robot humanoide d'Unitree Robotics, baptisé "Tinnie", s'apprête à intégrer un chantier de rénovation résidentielle en Australie dans le cadre d'un projet intitulé "The Farmhouse". La propriété couvre 8,3 acres à Mulgoa, à quelques minutes du nouvel aéroport international de l'ouest de Sydney. Le site présente un indice BAL 29 (Bushfire Attack Level), correspondant à une exposition élevée aux attaques par braises et chaleur rayonnante, et héberge une faune reptilienne ajoutant une contrainte de sécurité supplémentaire. L'initiative est portée par Cherie Barber, animatrice de télévision surnommée "la Reine de la Rénovation" en Australie, et son partenaire Matt Hume, qui ont coordonné le projet avec Unitree Robotics pendant six mois, incluant un déplacement en Chine pour observer le robot en action. Le nom "Tinnie" est un double clin d'oeil à l'Homme de Fer-blanc du Magicien d'Oz et au slang australien désignant une bière en canette. La mission du robot ne comprend aucune tâche physique: il accueillera les équipes sur site, conduira les inductions de sécurité, consultera les codes du bâtiment, vérifiera les spécifications produits et conseillera sur les décisions de conception. Le projet sera documenté dans une série télévisée nationale australienne et en épisodes bimensuels sur la chaîne YouTube de Cherie Barber. Ce déploiement se distingue nettement des démonstrations industrielles récentes d'humanoïdes: Tinnie ne manipule ni outils ni matériaux, et son rôle reste strictement informationnel. Pour les intégrateurs et décideurs B2B du secteur du bâtiment, la question légitime est de savoir si la forme humanoïde apporte une valeur ajoutée réelle par rapport à une tablette ou un assistant vocal embarqué sur chantier. La communication officielle ne cite aucune métrique de performance: pas de taux d'adoption par les ouvriers, pas de réduction du temps de cycle, aucun indicateur de productivité mesurable. La revendication de "première mondiale" mérite donc d'être tempérée: il s'agit davantage d'une expérience sociale médiatisée que d'un pilote industriel formalisé. Ce qui reste potentiellement instructif pour le secteur, c'est l'exposition du robot à un environnement de chantier actif soumis à des contraintes réglementaires et environnementales réelles, loin des conditions contrôlées de laboratoire. Unitree Robotics est un fabricant chinois positionné sur le segment accessible des robots humanoïdes et quadrupèdes, dont le H1 et le G1 sont commercialisés bien en dessous des tarifs pratiqués par Figure AI ou Boston Dynamics. L'entreprise cherche à multiplier les déploiements visibles à l'international pour crédibiliser ses plateformes face à une concurrence qui progresse sur des cas d'usage plus opérationnels: Boston Dynamics déploie Spot en inspection de chantier, Built Robotics opère des engins autonomes en génie civil, et en Europe, Enchanted Tools (France) développe des approches robotiques collaboratives en environnement de travail mixte. Le projet "The Farmhouse" intègre également un volet de vie autonome, avec serre maraîchère, verger, ruches et poulailler, ce qui renforce l'impression d'une opération de contenu lifestyle plutôt que d'une validation technologique rigoureuse. Les prochaines étapes annoncées se limitent à la production audiovisuelle, sans timeline de déploiement à plus grande échelle ni partenariats industriels communiqués.

HumanoïdesOpinion
1 source
Un robot de tennis de table bat certains des meilleurs joueurs mondiaux : les implications majeures pour la robotique
3647Robohub 

Un robot de tennis de table bat certains des meilleurs joueurs mondiaux : les implications majeures pour la robotique

Sony AI a publié dans la revue Nature les résultats d'un robot de tennis de table autonome baptisé Ace, capable de remporter trois matchs sur cinq contre des joueurs de niveau élite, soit des athlètes comptant plus de dix ans de pratique et vingt heures d'entraînement hebdomadaire en moyenne. Le robot a perdu ses deux confrontations face à des professionnels de la ligue japonaise, mais a remporté un set contre l'un d'eux, dont Yamato Kawamata lors d'un match en décembre 2025. Ace joue sur une table réglementaire, avec un équipement standard, contre des adversaires libres d'utiliser l'intégralité de leur répertoire technique. La balle peut dépasser 20 mètres par seconde et les joueurs professionnels peuvent lui imprimer une rotation jusqu'à 9 000 tours par minute, laissant moins d'une demi-seconde au robot pour évaluer la trajectoire et formuler une réponse. Pour percevoir cette dynamique, le système combine trois capteurs de vision événementielle (qui détectent les changements de luminosité plutôt que de capturer des images fixes) et neuf caméras haute vitesse. Un algorithme d'apprentissage par renforcement profond, entraîné sur plusieurs millions de rallyes simulés en self-play, recalcule les commandes de mouvement du bras articulé toutes les quelques dizaines de millisecondes, en évitant les collisions avec la table et avec le bras lui-même. Ce résultat dépasse le cadre du ping-pong : il constitue la première démonstration publiquement documentée d'un système IA autonome compétitif dans un environnement physique non contraint, à vitesse humaine et contre des adversaires experts. Contrairement aux victoires d'AlphaGo ou de Stockfish, obtenues dans des univers entièrement numériques aux règles fixes, Ace opère dans un espace où la physique, le spin et l'imprévisibilité humaine créent des conditions radicalement ouvertes. Pour l'industrie robotique, cela valide une chaîne technique complète : estimation de spin en temps réel via marquages visuels, transfert sim-to-real sur des tâches dynamiques rapides, et contrôle d'un bras multi-articulé sous contrainte temporelle sévère. Ces mêmes briques techniques (capteurs événementiels, RL simulé, contrôle rapproché temps réel) sont directement transférables à la manipulation industrielle haute cadence, au tri ou à l'assemblage fin, là où les systèmes actuels restent limités par leur latence de perception. Sony AI s'inscrit dans une trajectoire de recherche où la table de ping-pong sert depuis longtemps de banc de test pour la robotique physique. Le robot Forpheus d'Omron, développé depuis 2017, avait pavé la voie mais dans des conditions contraintes : lanceur de balles contrôlé, déplacements limités, effets de rotation peu ou pas pris en compte. Ace franchit un seuil qualitatif en jouant dans les mêmes conditions qu'un humain. Sony n'a pas encore annoncé de calendrier de commercialisation ni de partenariat industriel, et la publication Nature porte le statut d'avancée de recherche plutôt que de produit commercialisé. Du côté des concurrents, les efforts en robotique physique intelligente se concentrent ailleurs : Boston Dynamics sur la locomotion, Figure et 1X sur les humanoïdes polyvalents, Sanctuary AI sur la manipulation généraliste. Le vrai enjeu pour Sony sera de montrer si les innovations d'Ace peuvent migrer vers des cas d'usage industriels concrets, ou si elles restent cantonnées à un démonstrateur de laboratoire remarquable.

RecherchePaper
1 source
Fanuc renforce son partenariat avec Nvidia pour la simulation de robots IA et les jumeaux numériques
3648Robotics & Automation News 

Fanuc renforce son partenariat avec Nvidia pour la simulation de robots IA et les jumeaux numériques

Fanuc a approfondi son partenariat avec Nvidia en intégrant Isaac Sim, le framework ouvert de simulation robotique de Nvidia, directement dans RoboGuide, le logiciel de simulation et de programmation hors-ligne propriétaire de Fanuc. Cette interconnexion permet désormais aux opérateurs de piloter des robots Fanuc au sein d'environnements d'usine entièrement virtuels, et de générer des jumeaux numériques haute-fidélité exploitables pour la planification de production et la validation de trajectoires. La technologie a été présentée en démonstration lors de l'International Robot Exhibition (IRE) de Tokyo en décembre 2025, où Fanuc a montré un flux d'importation de mouvements robotiques entre les deux plateformes. L'enjeu industriel est significatif : RoboGuide est l'un des outils de programmation hors-ligne les plus déployés dans l'automatisation industrielle, Fanuc ayant franchi le cap des 900 000 robots installés à l'échelle mondiale. Connecter cet outil à Isaac Sim, qui s'appuie sur le moteur de simulation physique Omniverse d'Nvidia, réduit concrètement l'écart sim-to-real lors de la mise en service : les programmes validés en virtuel arrivent sur la cellule réelle avec moins de cycles d'ajustement. Pour un intégrateur ou un COO industriel, c'est une réduction directe des temps de commissioning et des risques de redémarrage en production. Fanuc intègre progressivement l'IA à son catalogue depuis plusieurs années, notamment via des modules de vision et d'inspection basés sur l'apprentissage profond. Nvidia, de son côté, multiplie les partenariats similaires avec Universal Robots, Boston Dynamics, Agility Robotics et Figure pour imposer Isaac Sim comme infrastructure standard de la robotique physique. Cette annonce est pour l'instant une démonstration technologique, pas un déploiement commercial confirmé ; les modalités de disponibilité pour les intégrateurs tiers n'ont pas été précisées.

IndustrielOpinion
1 source
Hypershell lève 50 millions de dollars en Série B+, devient l'exosquelette grand public le plus vendu au monde
3649Pandaily 

Hypershell lève 50 millions de dollars en Série B+, devient l'exosquelette grand public le plus vendu au monde

Hypershell, startup shanghaïenne fondée en 2021, a annoncé le 18 mai 2026 une levée de fonds de 50 millions de dollars (340 millions de yuans) en série B+. Les fonds seront alloués au développement de sa prochaine plateforme X Series et à l'expansion internationale. L'entreprise revendique la première place mondiale des exosquelettes grand public par volume de ventes, le leadership de la catégorie sur JD.com en chiffre d'affaires et en parts de marché, ainsi que la position numéro un sur Amazon US et Amazon Europe. La catégorie, longtemps cantonnée à la rééducation médicale et aux applications militaires, s'est étendue à la mobilité quotidienne, la randonnée et le maintien de l'autonomie des personnes âgées. La X Series représente un changement architectural notable: elle abandonne la modélisation du mouvement par règles explicites pour un contrôle moteur de bout en bout intégrant perception, reconnaissance, prédiction et planification comportementale dans une boucle fermée unique. Cette approche emprunte aux architectures de type VLA (Vision-Language-Action) qui ont démontré leur efficacité dans la robotique humanoïde, et suggère que les exosquelettes grand public peuvent bénéficier des mêmes méthodes d'intelligence incarnée. Pour les intégrateurs industriels et les décideurs B2B, cela ouvre des cas d'usage concrets: réduction des troubles musculo-squelettiques en logistique et en manufacture, accompagnement de la mobilité des séniors, et support à la marche prolongée sur terrain difficile, sans paramétrage manuel au profil utilisateur. Hypershell s'est révélée en 2023 via une campagne Kickstarter dépassant le million de dollars, validant la demande grand public avant d'attaquer les plateformes retail. L'entreprise dispose d'un avantage structurel potentiel: chaque utilisation quotidienne génère des données biomécaniques propriétaires qui pourraient alimenter des modèles d'IA incarnée à moyen terme, sur le modèle de ce que les fabricants de robots quadrupèdes font avec leurs flottes terrain. Les concurrents directs dans le segment médical et industriel, comme Ekso Bionics, ReWalk ou Ottobock, se positionnent principalement sur la prescription et la rééducation, laissant le marché grand public et professionnel relativement ouvert. La prochaine étape annoncée est le déploiement commercial de la X Series à l'international, sans calendrier précis communiqué pour l'instant.

ExosquelettesOpinion
1 source
Jike Technology lève 50 millions de dollars en Série B+ et devient le premier vendeur mondial d'exosquelettes grand public
3650Pandaily 

Jike Technology lève 50 millions de dollars en Série B+ et devient le premier vendeur mondial d'exosquelettes grand public

La société shanghaïenne Jike Technology a annoncé le 18 mai une levée de fonds de 50 millions de dollars (340 millions de CNY) lors d'un tour de table Series B+. Le capital sera affecté au développement de sa prochaine plateforme X Series et à l'expansion internationale de la marque. Fondée en 2021, Jike s'est imposée sur la scène mondiale dès 2023 avec un lancement Kickstarter ayant généré plus d'un million de dollars, catapultant l'entreprise au rang de Best Seller. Elle revendique depuis la première place en volume de ventes dans la catégorie exosquelettes sur JD.com, Amazon US et Amazon Europe, se positionnant comme le leader mondial des exosquelettes grand public par unités vendues. L'enjeu dépasse la seule performance commerciale : la plateforme X Series représente un glissement architectural significatif, abandonnant la modélisation de mouvement par règles prédéfinies au profit d'un contrôle moteur end-to-end. Ce système intègre dans une boucle fermée unique la perception, la reconnaissance, la prédiction et la planification comportementale, une approche analogue aux VLA (Vision-Language-Action models) qui s'imposent dans la robotique humanoïde. Pour les intégrateurs B2B et les décideurs industriels, cela signifie des dispositifs capables de s'adapter en temps réel aux variations de terrain et de posture, réduisant la charge physique des opérateurs en logistique et fabrication. Chaque session d'utilisation génère en outre des données biomécaniques propriétaires, un actif stratégique susceptible d'alimenter des modèles d'intelligence embarquée différenciants à moyen terme. Historiquement, le marché des exosquelettes grand public a émergé de niches médicales (réhabilitation) et militaro-industrielles, dominées par des acteurs comme Ekso Bionics ou Sarcos. Jike parie sur une troisième voie : la mobilité du quotidien, la randonnée et l'assistance aux personnes âgées, un segment encore peu disputé à l'échelle mondiale. La convergence robotique-IA en Chine, portée par des investissements massifs en R&D et une chaîne d'approvisionnement mature, lui confère un avantage structurel de coût et de vélocité produit. Les fonds levés financeront la commercialisation de la série X, dont les spécifications techniques restent non publiées, ainsi que l'accélération sur les marchés occidentaux où Jike détient déjà les premières positions e-commerce.

ExosquelettesOpinion
1 source