Aller au contenu principal

Actualités robotique — page 22

4 531 articles au fil, du plus récent au plus ancien.

Le robot-chien coréen apprend un mouvement animal grâce à l'IA pour franchir forêts et escaliers
1051Interesting Engineering 

Le robot-chien coréen apprend un mouvement animal grâce à l'IA pour franchir forêts et escaliers

Les chercheurs du Korea Advanced Institute of Science and Technology (KAIST), de l'Universite Korea, de l'Agence de développement de la défense sud-coréenne et de DIDEN Robotics ont présente APT-RL (Action Pretrained Transformer-based Reinforcement Learning), un framework d'IA qui permet a un robot quadrupède de changer automatiquement de mode de locomotion selon le terrain. Teste sur le robot HOUND de KAIST, le système combine des compétences de déplacement preentrainees a partir de plus de 180 000 trajectoires de mouvement optimisées (soit 15,5 heures de simulation générées en seulement huit minutes) avec un apprentissage par renforcement qui décide quand basculer entre marche, bond, escalade ou saut. Le tout fonctionne uniquement avec des capteurs embarques, une camera de profondeur et un LiDAR 2D, sans système de capture de mouvement externe. Lors d'essais en campus universitaire, en foret, sur terrain rocheux, escaliers, troncs et pierres de gué, HOUND a atteint une vitesse instantanée de 4,25 mètres par seconde, et jusqu'a 6 m/s en sautant depuis un escalier de trois marches, des chiffres que les auteurs présentent comme parmi les plus rapides jamais rapportes pour un quadrupède pilote par perception en conditions réelles. Cette démonstration s'inscrit dans un enjeu central de la robotique legged: le fosse entre les gaits appris en simulation et leur robustesse une fois déployés sur terrain non structure. La plupart des robots quadrupèdes commerciaux (Spot de Boston Dynamics, Go2 d'Unitree) reposent encore sur des contrôleurs distincts ou des transitions de gait limitées a des scenarios pré-testes. En démontrant qu'une politique unique embarquée peut généraliser a des obstacles jamais vus, sans reentrainement, sans capture de mouvement extérieure, KAIST apporte un argument concret en faveur de la viabilité des architectures de type "un seul cerveau, plusieurs compétences" pour des missions d'exploration ou de recherche et sauvetage en environnement réel, ou la connectivité et l'infrastructure de tracking sont absentes. Reste que les chiffres de vitesse, notamment la pointe a 6 m/s en descente d'escalier, méritent d'être lus comme des pics instantanés obtenus dans des conditions contrôlées par l'équipe, pas comme une performance opérationnelle soutenue. Le champ de la locomotion quadrupède a bascule ces dernières années vers l'apprentissage par renforcement en simulation massive (une approche popularisée par ETH Zurich et Boston Dynamics avec Spot, puis reprise par Unitree en Chine), avec un gain de robustesse mais une spécialisation encore forte par tache. APT-RL se distingue par sa méthode en trois étapes: preentrainement de briques motrices de base, apprentissage du séquencement de ces briques par renforcement, puis adaptation au déploiement réel via perception seule. Compare a des méthodes hiérarchiques et RL existantes, le framework affiche de meilleurs taux de réussite, des transitions de gait plus fluides et une meilleure efficacité énergétique, selon l'équipe. Les prochaines étapes évoquées par les chercheurs concernent l'extension a des missions de recherche et sauvetage et d'exploration autonome, sans toutefois de calendrier de déploiement industriel ou commercial précise a ce stade.

RecherchePaper
1 source
La Chine dévoile un nouveau robot humanoïde avec un taux de réussite de 98%, assemblage EV et opérations d'usine
1052Interesting Engineering 

La Chine dévoile un nouveau robot humanoïde avec un taux de réussite de 98%, assemblage EV et opérations d'usine

Xiaomi a annoncé de nouveaux progrès dans le déploiement de son robot humanoïde sur une chaîne de production automobile en Chine. Après quatre mois d'optimisations continues, le taux de réussite du robot sur un poste de vissage de vis autotaraudeuses est passé de 90,2 % à 98 %, ramenant l'écart avec le taux de qualification des ouvriers humains à seulement un point de pourcentage. Ce chiffre de 90,2 % avait été annoncé en mars 2026, lors du premier déploiement du robot en usine d'assemblage de véhicules électriques. Xiaomi a également étendu les tâches confiées au robot avec deux nouvelles applications: le tri des panneaux latéraux de console centrale et le pliage et recyclage de bacs à pièces, toutes deux atteignant 90 % de réussite. Le tri des panneaux latéraux constitue une étape notable puisque, selon Xiaomi, il s'agit de la première fois qu'un robot humanoïde effectue des opérations continues de longue durée sur des pièces flexibles dans une usine automobile, des composants plus difficiles à manipuler que les pièces rigides car ils peuvent se déformer et changer de position. Ces progrès, avancés par communiqué et rapportés par Technode, illustrent le déplacement progressif de la compétition humanoïde industrielle des vidéos promotionnelles courtes vers des démonstrations prolongées en conditions réelles d'usine. Pour les intégrateurs et décideurs industriels, l'enjeu est de savoir si ces taux de réussite, mesurés sur des tâches spécifiques et sur des durées limitées, reflètent une fiabilité réellement transposable à une production en volume, plutôt qu'une performance optimisée pour la communication. La manipulation de pièces flexibles sur une durée prolongée reste un indicateur technique pertinent, car elle teste la robustesse de la perception et du contrôle moteur au-delà des scénarios rigides plus simples à automatiser. Le contexte est celui d'une course serrée entre acteurs chinois du robot humanoïde industriel. Figure a fait tourner son robot Figure 02 pendant plus de 20 heures en continu sur des tâches logistiques, sans communiquer de taux de réussite formel, misant plutôt sur la gestion de flotte et la fiabilité longue durée. AgiBot, de son côté, a revendiqué un taux de réussite de 99,99 % avec son robot G2 ayant exécuté 64 828 tâches sur une ligne de production de tablettes pendant 64 heures consécutives, avant d'annoncer récemment des résultats quasiment identiques à ceux de Xiaomi sur l'assemblage automobile, avec 98 % en vissage et 90 % sur le tri et le pliage. Cette convergence de chiffres entre concurrents chinois suggère une course à la communication de métriques autant qu'une course technologique, sans qu'aucun protocole de mesure indépendant ne soit encore public.

Chine/AsieOpinion
1 source
Un robot à ailes battantes nage et vole comme un oiseau plongeur
1053Robohub 

Un robot à ailes battantes nage et vole comme un oiseau plongeur

Des chercheurs de l'EPFL et du MIT ont présenté un robot volant capable de nager sous l'eau puis de reprendre son envol, à l'image des oiseaux plongeurs comme les guillemots, les mouettes, les macareux ou les pétrels. Baptisé FAAV (flapping-wing aerial-aquatic vehicle), l'engin pèse moins de 300 grammes et se compose d'un fuselage central, de deux ailes battantes flexibles et d'une queue orientable, ces deux derniers éléments étant interchangeables selon la taille souhaitée. Les essais, menés d'abord dans un bassin à l'EPFL puis en conditions réelles sur le lac Léman, ont permis d'identifier la combinaison optimale de paramètres : des ailes de 80 centimètres, une fréquence de battement d'environ 5 hertz, et une inclinaison de la queue permettant au robot de nager sous l'eau à près d'un mètre par seconde puis de voler à environ 6 mètres par seconde, des valeurs proches de celles observées chez les oiseaux plongeurs réels. Pour franchir la surface, l'appareil doit adopter une trajectoire à 70 degrés afin d'éviter que ses ailes ne touchent l'eau au moment du décollage. Les résultats ont été publiés dans la revue Science. Cette démonstration constitue une avancée notable pour la robotique bio-inspirée aérienne et aquatique, un domaine où la transition fluide entre deux milieux aux propriétés physiques très différentes reste un obstacle technique majeur. Au-delà de l'exploit d'ingénierie, le projet ouvre la voie à une nouvelle catégorie de drones capables d'atteindre des zones difficiles d'accès pour les navires océanographiques classiques, glaciers, ports, ou zones de présence de cétacés, afin d'y prélever des échantillons ou d'y effectuer des mesures à moindre coût. Pour les acteurs de la surveillance environnementale et de l'océanographie, un tel système pourrait réduire significativement les coûts et les risques logistiques associés aux missions de terrain, tout en offrant une alternative légère aux flottes de capteurs marins traditionnelles. Le projet a démarré sous la direction de Raphael Zufferey, alors chercheur postdoctoral à l'EPFL au sein des laboratoires LIS (Laboratory of Intelligent Systems, dirigé par Dario Floreano) et BioRob (Biorobotics Lab, dirigé par Auke Ijspeert), avant d'être achevé au MIT où Zufferey dirige désormais l'AURA Lab, spécialisé dans les véhicules aériens et aquatiques bio-inspirés. Des co-auteurs du Northwest Indian College, aux États-Unis, ont également contribué à l'étude. Sur le plan technique, les ailes du robot sont recouvertes de membranes fines traitées avec des nanoparticules hydrophobes pour limiter l'adhérence de l'eau, tandis qu'un moteur électrique étanche entraîne un vilebrequin assurant le battement des ailes. Les chercheurs envisagent désormais des déploiements pilotes avec des océanographes et des communautés côtières, la prochaine étape consistant à valider l'usage opérationnel de l'appareil pour la collecte de données en conditions réelles.

RecherchePaper
1 source
Robotique-U0 de Xiaomi : un modèle génératif incarné à 38 milliards de paramètres unifiant quatre tâches robotiques
1054Pandaily 

Robotique-U0 de Xiaomi : un modèle génératif incarné à 38 milliards de paramètres unifiant quatre tâches robotiques

Xiaomi a mis en open source Xiaomi-Robotics-U0, un modèle génératif embarqué multimodal autorégressif de 38 milliards de paramètres, code et poids disponibles sur GitHub, HuggingFace et ModelScope. L'entreprise chinoise le présente comme le premier modèle génératif unifié du secteur de l'IA embarquée capable de gérer simultanément quatre tâches robotiques distinctes : la génération de scènes multi-vues à partir de descriptions textuelles (établis, cuisines, entrepôts, environnements ouverts) pour un matériel robotique donné ; le transfert de trajectoires existantes vers de nouveaux environnements en modifiant éclairage, arrière-plan, matériaux ou objets cibles tout en conservant les poses du bras et la disposition de la scène ; la génération de vidéos d'interaction robotique prolongeant des observations initiales selon des instructions données, avec généralisation zero-shot à des scénarios inédits ; et des capacités classiques de génération et d'édition d'images texte-image. Sur le benchmark WorldArena, Xiaomi revendique le meilleur score parmi 126 modèles participants. Sur robot réel, en conditions hors distribution (éclairages et arrière-plans inconnus), le taux de réussite des tâches aurait progressé de 26 % en moyenne grâce à l'entraînement sur données augmentées par U0. L'architecture d'inférence UNIS annoncée accélérerait la génération d'environ 83 fois par rapport au paradigme autorégressif brut. Ces chiffres proviennent des communications de Xiaomi et n'ont pas fait l'objet de vérification indépendante à ce stade. L'enjeu dépasse la simple démonstration technique : la rareté des données réelles reste l'un des principaux goulots d'étranglement du développement de l'IA embarquée, et un modèle capable de générer ou d'augmenter des jeux de données synthétiques, y compris pour des scénarios dangereux ou rares physiquement inaccessibles, réduit potentiellement le coût de collecte terrain pour les intégrateurs et laboratoires. Pour les décideurs B2B et les équipes robotique, cela déplace une partie de l'effort d'ingénierie de la collecte physique vers la génération contrôlée de données, à condition que le gain de performance annoncé se vérifie hors du cadre contrôlé du fabricant. C'est aussi un signal de plus que les grands acteurs chinois de l'électronique grand public investissent lourdement la pile complète de l'IA embarquée, du matériel au modèle fondation. Cette sortie s'inscrit dans la continuité du déploiement d'usines robotisées par Xiaomi et positionne le groupe comme acteur intégré sur toute la chaîne : fabrication de robots, déploiement réel et recherche en modèles fondation. Elle intervient dans un paysage déjà occupé par Physical Intelligence (Pi-0), NVIDIA (GR00T N2) ou Figure (Helix), où la course porte désormais autant sur la disponibilité de données d'entraînement à grande échelle que sur l'architecture des modèles eux-mêmes. Aucune feuille de route de déploiement commercial ni de partenariat industriel n'a pour l'instant été précisée au-delà de la publication open source du modèle.

IA physiqueActu
1 source
DECO : transformateur de diffusion multimodal découplé pour la manipulation dextre bimanuelle avec adaptateur tactile enfichable
1055arXiv cs.RO 

DECO : transformateur de diffusion multimodal découplé pour la manipulation dextre bimanuelle avec adaptateur tactile enfichable

DECO (Decoupled multimodal Diffusion transformer for bimanual dExterous manipulatiOn) est un nouveau modèle de politique robotique présenté dans un papier arXiv (2602.05513v3) qui sépare explicitement le traitement de la vision, de la proprioception et du tactile via des voies de conditionnement dédiées, plutôt que de fusionner ces signaux en amont comme le font la plupart des architectures existantes. Un adaptateur tactile léger permet d'injecter le signal de toucher de façon paramétrique-efficace, sans réentraîner l'ensemble du réseau. Les auteurs publient aussi DECO-50, un jeu de données de 50 heures et plus de 5 millions de frames, collecté par téléopération sur de vrais robots à deux bras équipés de capteurs tactiles. Sur plus de 2 000 essais réels (pas de simulation), DECO atteint un taux de réussite moyen de 72,25%, soit 21 points de mieux que la meilleure référence testée. L'ajout de l'adaptateur tactile apporte 10,25 points de réussite supplémentaires en moyenne, et jusqu'à 20 points sur les tâches à contact riche, tout en ne réajustant que moins de 10% des paramètres du modèle. Ce résultat compte parce qu'il s'attaque à un point de friction connu des politiques de manipulation bimanuelle: la fusion multimodale brute dégrade souvent les performances quand un des signaux (typiquement le tactile) est bruité ou absent, et le réentraînement complet pour intégrer un nouveau capteur reste coûteux. Découpler les modalités et rendre l'ajout de signaux modulaire via un adaptateur va dans le sens d'une approche plus industrialisable pour les intégrateurs qui veulent équiper des mains ou pinces existantes de tactile sans repartir d'un modèle de zéro. Le volume d'essais réels (2 000+) et le jeu de données ouvert de 50 heures renforcent aussi la crédibilité par rapport aux annonces qui ne reposent que sur quelques démonstrations sélectionnées. Le travail s'inscrit dans la vague des transformeurs de diffusion appliqués aux politiques robotiques (diffusion policy), une famille d'approches également explorée par des modèles vision-langage-action comme Pi-0 ou GR00T N2, mais ici recentrée spécifiquement sur la dextérité bimanuelle et l'intégration tactile plutôt que sur la généralisation multi-tâches à grande échelle. La publication conjointe du dataset DECO-50 laisse présager des comparaisons à venir avec d'autres politiques entraînées sur les mêmes données, un terrain encore rare dans la manipulation dextre où chaque laboratoire collecte ses propres démonstrations.

IA physiqueOpinion
1 source
Amélioration des performances des nano-drones autonomes via l'optimisation et le déploiement automatisés de bout en bout de réseaux de neurones profonds
1056arXiv cs.RO 

Amélioration des performances des nano-drones autonomes via l'optimisation et le déploiement automatisés de bout en bout de réseaux de neurones profonds

Des chercheurs ont publié une méthodologie complète d'optimisation et de déploiement automatisé pour PULP-Dronet, un réseau de neurones convolutif (CNN) de référence pour la navigation autonome de nano-drones, embarqué sur un Crazyflie 2.1 équipé d'un système-sur-puce multicœur ultra-basse consommation (ULP) servant d'ordinateur de mission. Par rapport à la version originale conçue manuellement, le CNN optimisé obtient une empreinte mémoire divisée par deux et un temps d'inférence 1,6 fois plus rapide, tout en conservant la même précision de prédiction. En vol réel, les gains se traduisent concrètement : évitement d'obstacles avec une vitesse de freinage record de 1,65 m/s et un meilleur ratio vitesse/distance de freinage, vol libre en environnement connu jusqu'à 1,96 m/s contre seulement 0,5 m/s pour la version de référence, et suivi de trajectoire incluant un virage à 90 degrés. L'ensemble du calcul embarqué consomme moins de 1,6 % du budget énergétique du drone. Pour les intégrateurs et ingénieurs travaillant sur des plateformes robotiques miniatures, ce résultat répond à un point de friction connu du secteur : le déploiement de CNN de vision sur nano-UAV reposait jusqu'ici sur des flux de développement itératifs, manuels et sujets aux erreurs, faute d'outils automatisés adaptés aux contraintes mémoire et calcul extrêmes de plateformes sub-10 cm. En démontrant qu'un pipeline d'optimisation end-to-end peut à la fois réduire les ressources nécessaires et améliorer les performances de vol mesurées (et non de simples métriques de laboratoire), les auteurs comblent une partie de l'écart habituel entre démonstration et comportement réel en conditions de vol. Le travail s'inscrit dans la lignée de PULP-Dronet, projet de recherche sur l'informatique embarquée ultra-basse consommation appliquée aux drones autonomes, et cible spécifiquement le Crazyflie 2.1, plateforme open-hardware largement utilisée dans la recherche académique en robotique aérienne miniature. Les auteurs publient l'intégralité de la chaîne logicielle en open source, sous forme de projet prêt à l'emploi compatible avec le Crazyflie 2.1, ouvrant la voie à une adoption directe par d'autres équipes de recherche travaillant sur les capteurs intelligents ubiquitaires et les nano-robots d'assistance de nouvelle génération.

RecherchePaper
1 source
Contract-Grounded Behavior Tree Synthesis via Agents de Codage
1057arXiv cs.RO 

Contract-Grounded Behavior Tree Synthesis via Agents de Codage

Des chercheurs proposent une architecture de synthèse d'arbres de comportement (behavior trees, BT) pour robots, pilotée par un agent de codage qui interroge un serveur MCP (Model Context Protocol) côté robot avant de générer le BT. Ce contrat renvoie une bibliothèque de compétences exécutables, la liste des opérateurs BT autorisés, et éventuellement des templates de composition. Un opérateur non expert formule une commande en langage naturel, puis une passerelle de validation intégrée au runtime du robot vérifie la correction du BT avant toute exécution. L'équipe a testé deux modèles de langage, Sonnet 4.6 (fermé) et Gemma4:31b (open source, plus petit), sur 110 tâches simulées dans l'environnement PyRoboSim et 14 tâches sur un robot physique Husarion Panther équipé d'une pile de navigation Nav2. L'intérêt est de déplacer la charge du "grounding", c'est-à-dire s'assurer que le BT généré ne référence que des actions réellement exécutables, du rédacteur de prompt vers un protocole standardisé interrogé dynamiquement. Concrètement, cela réduit la fragilité des déploiements dans les usines et entrepôts où l'opérateur ignore souvent le détail des capacités du robot ou de son runtime. Les résultats montrent une validation de BT quasi parfaite et un taux de réussite élevé grâce au contrat, et surtout que les templates de composition permettent au modèle open source, moins capable seul, de rattraper une bonne partie de son retard sur les tâches à logique de contrôle réactive. Le transfert réussi sur robot physique, avec une pile Nav2 opaque à la fois pour l'opérateur et pour l'agent, va dans le sens d'une réduction de l'écart simulation-réel souvent observé sur ce type de démonstrations. La synthèse de BT par LLM s'inscrit dans la tendance à rendre les robots pilotables en langage naturel, en alternative aux machines à états codées à la main. Le protocole MCP, popularisé pour connecter des agents IA à des outils et données externes, est ici détourné pour exposer les capacités robotiques de façon structurée plutôt que de tout confier au prompt. Ce travail reste à ce stade une publication académique (arXiv), sans déploiement commercial annoncé, mais pointe vers une piste concrète pour fiabiliser les architectures agentiques face aux approches concurrentes de type VLA telles que Pi-0, GR00T N2 ou Helix, qui misent elles sur l'exécution directe plutôt que sur une couche symbolique intermédiaire.

RecherchePaper
1 source
Look, Focus, Act : apprentissage robotique efficace et robuste grâce au regard humain et aux transformeurs à vision fovéale
1058arXiv cs.RO 

Look, Focus, Act : apprentissage robotique efficace et robuste grâce au regard humain et aux transformeurs à vision fovéale

Des chercheurs du Soltani Lara Lab publient GIAVA (Gaze Integrated Active-Vision ALOHA), un système de vision robotique qui reproduit les mouvements de tête et de cou humains ainsi que l'ajustement du regard pour un traitement visuel "fovéalisé", c'est-à-dire concentré sur les zones pertinentes de la scène plutôt que sur l'image entière. Le système étend la plateforme robotique AV-ALOHA et s'appuie sur un nouveau cadre de collecte de données permettant d'enregistrer simultanément le suivi oculaire, le contrôle de la perspective et les démonstrations de manipulation d'un opérateur humain. L'équipe publie en open source un benchmark de simulation et un jeu de données associé. Techniquement, l'innovation centrale consiste à intégrer l'information de regard dans les Vision Transformers (ViT), très utilisés en apprentissage robotique, via un schéma de tokenisation par patchs fovéalisée : au lieu de découper l'image en patchs uniformes, le système alloue davantage de "tokens" aux zones fixées par le regard et moins au reste, réduisant fortement leur nombre total et donc le coût de calcul. Cette approche s'attaque à un angle mort classique de la vision robotique actuelle, qui traite généralement l'image caméra de façon passive et uniforme, contrairement à la vision humaine, structurée par l'attention active. Pour les équipes qui entraînent des politiques robotiques par imitation ou VLA (Vision-Language-Action), le résultat est double : une baisse significative de la charge de calcul, un enjeu concret pour l'embarqué et le temps réel, et une robustesse accrue face aux distracteurs visuels en arrière-plan, un problème récurrent dans le passage simulation-réel. Les auteurs rapportent même des gains de taux de réussite sur certaines tâches de haute précision, suggérant que la fovéalisation n'est pas qu'une optimisation de coût mais peut aussi améliorer la performance brute. Ce travail s'inscrit dans la lignée des recherches sur la segmentation d'image fovéalisée et prolonge la plateforme AV-ALOHA, déjà utilisée pour la téléopération à vision active. En ouvrant le code, le simulateur et le jeu de données, les auteurs positionnent le regard humain comme un biais inductif encore sous-exploité pour les futures architectures de perception robotique, avec des développements attendus sur des tâches de manipulation plus complexes et des déploiements matériels réels.

RecherchePaper
1 source
Robots Jetson-PI : contrôle robotique en temps réel embarqué via inférence asynchrone alignée sur l'anticipation
1059arXiv cs.RO 

Robots Jetson-PI : contrôle robotique en temps réel embarqué via inférence asynchrone alignée sur l'anticipation

Une équipe du PKU-SEC-Lab (Peking University) publie Jetson-PI, une méthode pour déployer des modèles Vision-Language-Action (VLA) directement à bord de cartes embarquées à faible consommation comme le Nvidia Jetson Orin, très utilisées en robotique mobile et humanoïde. Le problème ciblé est connu : l'inférence asynchrone, qui parallélise l'exécution des actions et le calcul de l'action suivante pour masquer la latence, introduit en pratique un décalage entre ce que le robot perçoit et ce qu'il exécute, ainsi qu'un temps de réaction dégradé. Jetson-PI corrige cela via un module léger de "correction par anticipation" qui prédit la représentation future de l'environnement à partir des actions déjà engagées, permettant à l'expert d'action de raisonner directement sur l'état futur plutôt que sur un état périmé. S'y ajoute un ordonnancement piloté par la confiance du modèle, qui arbitre dynamiquement entre appels au VLM et à l'expert d'action, complété par des optimisations bas niveau (réutilisation de CUDA graphs, buffers intermédiaires résidents en mémoire GPU, déroulement de flux). Résultat mesuré : un gain de fréquence de contrôle de 8,66x face à une implémentation PyTorch naïve et de 5,41x face à vla.cpp, avec un taux de réussite supérieur de 14,8% à VLASH sur le benchmark LIBERO. L'enjeu dépasse la performance brute : c'est le goulot d'étranglement classique du déploiement de VLA en robotique embarquée qui est visé, celui qui empêche des modèles entraînés en simulation ou sur GPU serveur de tourner en temps réel sur du matériel embarqué bon marché. Pour les intégrateurs et fabricants de robots mobiles ou humanoïdes, cela réduit un frein concret à la mise en production de piles de contrôle par VLA, sans dépendre d'une puissance de calcul embarquée démesurée. Le travail s'inscrit dans la lignée des recherches sur l'accélération des VLA (dont VLASH, utilisé ici comme référence de comparaison) et sur les moteurs d'inférence légers type llama.cpp. Les auteurs publient à la fois leur algorithme d'inférence asynchrone et un moteur d'inférence dédié, Jetson-PI-Edge, en open source sur GitHub, ouvrant la voie à une reproduction et une adoption par la communauté robotique.

IA physiqueActu
1 source
Réduction de récompense dense pour la manipulation robotique via synthèse d'échecs
1060arXiv cs.RO 

Réduction de récompense dense pour la manipulation robotique via synthèse d'échecs

Des chercheurs présentent DenseReward, un modèle de récompense visio-linguistique conçu pour l'apprentissage par renforcement (RL) appliqué à la manipulation robotique, détaillé dans un article publié sur arXiv (2607.13033v1). Le système répond à deux limites connues des modèles de récompense existants : la difficulté de collecter des trajectoires d'échec à grande échelle et l'absence de signaux fins au-delà d'un simple label de succès ou d'échec en fin de trajectoire. Pour cela, les auteurs ont développé un pipeline automatisé qui synthétise en simulation des trajectoires d'échec physiquement réalistes, sans intervention humaine, couvrant des modes de défaillance variés : collisions, préhensions manquées, chutes d'objets et comportements de récupération. À partir de ces données, DenseReward prédit des scores de récompense image par image, à partir d'observations visuelles et d'instructions en langage naturel, permettant d'estimer la progression d'une tâche tout au long d'un épisode plutôt qu'un simple verdict final. Les expériences montrent que ce modèle surpasse à la fois des VLM généralistes et les modèles de récompense robotiques existants sur la prédiction de récompense dense, en simulation comme en conditions réelles. Cette avancée cible un goulot d'étranglement central du RL en robotique : sans retour dense et fiable, l'optimisation de politiques reste inefficace et dépendante de démonstrations imitées, ce qui limite la capacité des robots à dépasser les performances de leurs données d'entraînement. En automatisant la génération de données d'échec, DenseReward réduit un coût d'annotation humaine qui freinait jusqu'ici le déploiement du RL à grande échelle sur des tâches de manipulation, un enjeu direct pour l'entraînement de politiques VLA robustes destinées à l'industrie. Le travail s'inscrit dans la lignée des efforts récents visant à doter les robots de modèles de récompense appris plutôt que conçus manuellement, un axe où les VLM généralistes servaient jusqu'ici de solution par défaut faute de mieux. Les auteurs annoncent la publication en accès libre du jeu de données, des modèles de récompense entraînés et d'une suite d'évaluation, avec pour objectif de faciliter l'intégration de DenseReward dans des boucles de contrôle prédictif par modèle (MPC) et de RL en aval, ouvrant la voie à des travaux communautaires sur la récompense dense sensible aux échecs.

RecherchePaper
1 source
MAMMOTH : une politique multimodale de bout en bout robuste face aux modalités manquantes pour la mobilité tout-terrain
1061arXiv cs.RO 

MAMMOTH : une politique multimodale de bout en bout robuste face aux modalités manquantes pour la mobilité tout-terrain

Une équipe de recherche présente MAMMOTH (MAsking Multi-Modal inputs for Off-road Traversability Heuristic-informed navigation), une politique de navigation autonome end-to-end conçue pour les terrains non structurés, publiée sur arXiv le 15 juillet 2026. Le système fusionne quatre modalités de capteurs, la caméra RGB, l'imagerie thermique, le nuage de points 3D issu du lidar et la vitesse propre du robot, pour estimer la praticabilité du terrain et planifier des trajectoires, que ce soit vers un objectif visuel ou en exploration libre. La particularité technique réside dans un entraînement par "modality dropout" : certaines entrées sensorielles sont masquées aléatoirement pendant l'apprentissage, ce qui force le modèle à rester fonctionnel même quand une caméra tombe en panne, qu'un lidar est aveuglé par la poussière ou que la lumière ambiante s'effondre. La planification de trajectoire s'appuie sur une politique de diffusion apprenant conjointement des trajectoires physiquement réalistes et une heuristique de praticabilité intrinsèque. Les auteurs annoncent des tests réels sur robot dans plusieurs environnements tout-terrain distincts, y compris de nuit, avec des gains mesurés en évitement de collision et en planification tenant compte du terrain. L'enjeu dépasse la démonstration technique : la dépendance quasi exclusive au RGB est le talon d'Achille de nombreux systèmes de navigation off-road actuels, qui échouent dès que l'éclairage devient difficile (contre-jour, ombres, obscurité). En rendant la fusion multimodale tolérante aux pannes de capteurs plutôt que rigide, MAMMOTH s'attaque directement à un écart connu entre démonstrations en conditions idéales et déploiement réel, un enjeu clé pour les robots agricoles, miniers, militaires ou de secours en extérieur. Le travail s'inscrit dans la lignée des approches de navigation par apprentissage visuo-conditionné et de génération de trajectoires par diffusion, deux axes de recherche actifs en robotique mobile. Code et jeu de données seront publiés, ce qui permettra une évaluation indépendante des performances annoncées, notamment sur la robustesse réelle en cas de perte de capteurs plutôt que sur des scénarios de dropout simulés en laboratoire.

RecherchePaper
1 source
RoboDesign1M : un jeu de données à grande échelle pour la compréhension de la conception robotique
1062arXiv cs.RO 

RoboDesign1M : un jeu de données à grande échelle pour la compréhension de la conception robotique

Le dataset RoboDesign1M rassemble un million d'échantillons multimodaux consacrés à la conception de robots, extraits automatiquement de la littérature scientifique couvrant plusieurs domaines de la robotique. Les auteurs ont mis au point un pipeline de collecte semi-automatisé permettant d'agréger efficacement des données diverses (texte et images) issues de publications existantes, plutôt que de les créer manuellement. Pour valider l'utilité du corpus, l'équipe a mené des expériences sur trois tâches distinctes : la génération d'images de conception robotique, la réponse à des questions visuelles portant sur des schémas de conception, et la recherche d'images de conception à partir de requêtes. Les résultats montrent que ce jeu de données constitue un nouveau benchmark exigeant pour ces tâches de compréhension du design. Le dataset sera rendu public, avec une page de projet dédiée (airvlab.github.io/robotdesign1m). Il s'agit d'une version mise à jour d'un article déposé sur arXiv (2503.06796), initialement publié en mars puis révisé. Ce travail cible un goulot d'étranglement méthodologique plutôt qu'un produit commercial : la conception mécanique d'un robot reste un processus long, coûteux et dépendant d'une expertise rare, et les modèles de fondation qui pourraient l'automatiser manquaient jusqu'ici de données d'entraînement à grande échelle sur ce sujet précis. En fournissant un million d'exemples annotés, RoboDesign1M ouvre la voie à des assistants IA capables de proposer des pistes de conception, de retrouver des schémas existants à partir d'une description textuelle, ou de générer des visualisations de composants robotiques. Pour les laboratoires de recherche et les équipes R&D en robotique, c'est surtout un instrument de mesure standardisé qui manquait pour comparer objectivement les approches de génération et de compréhension de designs. Le projet s'inscrit dans la tendance plus large d'application des modèles de fondation multimodaux à des domaines d'ingénierie spécialisés, après leur succès en vision et en langage naturel. La rareté des jeux de données de conception robotique freinait jusqu'à présent ce transfert, contrairement à des domaines comme la manipulation ou la navigation qui disposent déjà de corpus massifs. La mise à disposition publique annoncée par les auteurs devrait permettre à d'autres équipes de recherche de reproduire et d'étendre ces travaux, sans toutefois que des applications commerciales concrètes ou des partenariats industriels n'aient été mentionnés à ce stade.

RecherchePaper
1 source
« Cartes sémantiques enrichies par instance pour la navigation en langage visuel »
1063arXiv cs.RO 

« Cartes sémantiques enrichies par instance pour la navigation en langage visuel »

Une équipe de recherche (RCI Lab) publie un nouveau framework baptisé Instance-Enriched Semantic Maps pour la navigation par instructions en langage naturel (Visual Language Navigation, VLN), avec trois apports techniques. D'abord, une cartographie 2.5D au niveau instance construite à partir d'images couleur et de profondeur via segmentation panoptique en vocabulaire ouvert, qui préserve les distinctions verticales et capture les petits objets, tout en associant à chaque élément des attributs sémantiques et des descriptions en langage naturel enrichies du contexte de la pièce. Ensuite, un module de traitement des requêtes s'appuyant sur un LLM pour sélectionner la cible, en routant dynamiquement les requêtes vers des experts spécialisés par type et en fusionnant leurs scores pour une sélection d'objectif cohérente quel que soit le formulation de la requête. Enfin, une représentation sémantique nettement plus compacte, avec une réduction de stockage d'environ 96 % par rapport aux approches à scene-graph 3D, tout en conservant l'information spatiale nécessaire à la navigation. Sur le plan des résultats, la représentation 2.5D dépasse la référence 3D de plus de 27 % en AUC normalisée, et le système complet améliore la récupération d'objets de plus de 17 % et le taux de réussite de navigation de plus de 23 % par rapport à la baseline, sur des types de requêtes variés. Pour les robots mobiles autonomes (AMR) et les agents embarqués évoluant en intérieur, ces travaux ciblent un goulot d'étranglement connu des systèmes VLN actuels : la cartographie sémantique existante manque de granularité au niveau des instances individuelles et se montre fragile face à la diversité réelle des formulations utilisateur. En réduisant drastiquement le coût de stockage des cartes tout en gardant leur précision spatiale, l'approche répond à une contrainte concrète de déploiement embarqué, où la mémoire et le calcul restent limités. C'est un signal que la navigation par langage naturel progresse vers une robustesse compatible avec des usages industriels au-delà des démonstrations de laboratoire. Le travail s'inscrit dans la lignée des systèmes VLN combinant cartes spatiales sémantiques et raisonnement par LLM, une direction de recherche active depuis l'essor des modèles de segmentation en vocabulaire ouvert. Les auteurs comparent explicitement leur méthode à des approches de référence en scene-graph 3D, positionnant leur contribution comme une alternative plus légère et plus précise. Le code et les démonstrations sont disponibles sur la page du projet, mais aucun calendrier de déploiement sur robot physique n'est mentionné à ce stade.

RecherchePaper
1 source
UR-VC : correction non supervisée de la valeur robotique pour proxys de progression dérivés du temps
1064arXiv cs.RO 

UR-VC : correction non supervisée de la valeur robotique pour proxys de progression dérivés du temps

Des chercheurs ont présenté UR-VC (Unsupervised Robotic Value Correction), une méthode hors ligne et sans entraînement pour corriger les signaux de progression utilisés en apprentissage robotique, dans un preprint arXiv publié en juillet 2026 (arXiv:2607.12892). Le problème visé : l'usage courant du temps normalisé au sein d'une démonstration comme proxy de la progression réelle d'une tâche, où une image plus tardive est jugée plus proche de l'accomplissement. Or en manipulation à contact riche, un bras peut avancer puis régresser (glissement, échec de préhension, pli partiellement défait) sans que ce label temporel, strictement monotone, n'en tienne compte. UR-VC corrige ce biais en recherchant des états similaires dans d'autres épisodes puis en agrégeant leurs propres labels temporels, sans annotation manuelle ni modèle de valeur additionnel. La méthode a été testée sur une tâche réelle bimanuelle de pliage de linge, un cas de manipulation d'objet déformable à horizon long où la progression intermédiaire reste visible à l'œil. Pour l'entraînement de politiques vision-langage-action (VLA), la qualité du signal de progression conditionne directement l'apprentissage par avantage (advantage-conditioned policy learning) : un signal insensible aux régressions locales pousse le modèle à ignorer les échecs partiels, un angle mort classique des pipelines de démonstration à grande échelle. En construisant des labels d'avantage à partir des estimations corrigées d'UR-VC, les auteurs rapportent une tendance positive du taux de succès en tâche réelle, à données, modèle et protocole d'entraînement égaux. Ce résultat conforte une hypothèse déjà répandue dans le secteur : le temps écoulé reste un proxy commode mais fragile de la progression physique, un point sensible pour tout intégrateur cherchant à industrialiser l'apprentissage par démonstration sans multiplier les annotations coûteuses. Le travail s'inscrit dans la lignée des méthodes de policy learning conditionné par l'avantage, où le signal de progression sert de fondation à l'entraînement plutôt que la seule structure séquentielle des démonstrations. UR-VC ne nécessite ni ré-entraînement d'un modèle de valeur ni annotation additionnelle, ce qui le rend directement applicable aux jeux de données déjà collectés. Il s'agit pour l'instant d'un preprint de recherche, sans acteur industriel ni intégrateur nommé, et sans calendrier de déploiement annoncé ; la validation reste limitée au pliage de linge en laboratoire, laissant ouverte la question de sa généralisation à d'autres familles de manipulation en contact riche.

RechercheActu
1 source
Exploration structurée pour un ajustement fin par renforcement efficace des modèles vision-langage-action (ExToken)
1065arXiv cs.RO 

Exploration structurée pour un ajustement fin par renforcement efficace des modèles vision-langage-action (ExToken)

Des chercheurs présentent ExToken (RL Exploration Token), une méthode d'apprentissage par renforcement conçue pour affiner plus efficacement les modèles vision-langage-action (VLA) sur des tâches de manipulation robotique complexes, selon un article publié sur arXiv le 15 juillet 2026. Les auteurs identifient d'abord un goulot d'étranglement dans les frameworks VLA-RL actuels: l'exploration stagne rapidement, et la diversité des trajectoires collectées compte davantage pour l'efficacité d'apprentissage que leur simple volume. Pour y remédier, ExToken conditionne la politique du robot sur des tokens discrets dérivés de démonstrations hors ligne, représentant différents modes comportementaux. En variant ces tokens pendant la collecte de trajectoires, le système pousse l'agent à explorer des comportements plus variés et à mieux couvrir l'espace des états et actions possibles. Un sélecteur de tokens conditionné par l'état est ajouté pour choisir automatiquement le mode comportemental le plus adapté lors du déploiement, où l'inférence doit rester déterministe. Les expériences, menées à la fois en simulation et sur des tâches réelles de manipulation, montrent une convergence accélérée et de meilleures performances, notamment avec un budget d'interactions limité. L'enjeu est concret pour tout le secteur du VLA: le fine-tuning par renforcement est aujourd'hui le principal levier pour dépasser les performances de l'apprentissage par imitation pur, mais son coût en interactions environnementales freine son adoption à grande échelle, que ce soit pour des modèles comme Pi-0, GR00T ou des architectures propriétaires chez les acteurs de la robotique humanoïde. Une méthode qui réduit ce coût d'échantillonnage touche directement la viabilité économique du RL pour l'industrie, au-delà des démonstrations en laboratoire. Il s'agit toutefois d'un travail de recherche académique publié en preprint, sans affiliation commerciale revendiquée ni déploiement industriel annoncé. ExToken s'inscrit dans une lignée de travaux cherchant à rendre le RL praticable pour la robotique après la phase d'apprentissage par imitation, aux côtés d'approches comme le curriculum learning ou l'exploration guidée par démonstrations, sans qu'aucun calendrier d'intégration dans un produit commercial ne soit précisé.

RechercheActu
1 source
Vol en formation serrée de quadricoptères en temps réel : apprentissage résiduel préservant la platitude
1066arXiv cs.RO 

Vol en formation serrée de quadricoptères en temps réel : apprentissage résiduel préservant la platitude

Des chercheurs ont mis au point un cadre d'apprentissage capable de compenser en temps réel les perturbations aérodynamiques qui affectent les quadrirotors volant en formation serrée. Le problème ciblé est le downwash, ce souffle descendant généré par chaque drone qui perturbe ses voisins et peut provoquer des collisions s'il n'est pas modélisé. La méthode, un apprentissage de dynamique résiduelle informé par la physique, corrige les équations de mouvement du système multi-drones tout en préservant sa "flatness" différentielle, une propriété mathématique qui permet de calculer directement les commandes à partir de la trajectoire désirée. Cette flatness préservée autorise un contrôleur par linéarisation par bouclage, peu coûteux en calcul et réglable avec des techniques de contrôle linéaire classiques, qui annule les perturbations par compensation feedforward. Sur banc d'essai matériel, l'approche réduit l'erreur moyenne de suivi de trajectoire de 31% par rapport aux contrôleurs de référence sans compensation. Elle égale la précision d'un contrôle prédictif non linéaire (NMPC) de pointe tout en demandant un ordre de grandeur de calcul en moins, avec un vol en formation stable atteint avec moins de 30 secondes de données d'entraînement et une boucle de contrôle à 5 millisecondes. Pour l'industrie des essaims de drones, ce résultat s'attaque à un goulot d'étranglement connu: les modèles capables de compenser les interactions aérodynamiques en formation serrée, comme le NMPC, sont précis mais trop gourmands en calcul pour les cartes embarquées limitées des petits quadrirotors. En divisant la charge de calcul par un ordre de grandeur sans sacrifier la précision, la méthode ouvre la voie à des vols en formation serrée sur du matériel contraint en ressources, un enjeu direct pour les intégrateurs travaillant sur les light shows, l'inspection coordonnée ou la logistique par essaims. Le fait de n'exiger que 30 secondes de données contredit aussi l'hypothèse répandue selon laquelle l'apprentissage de dynamiques aérodynamiques complexes nécessite de vastes jeux de données collectées en vol, ce qui réduit le coût de déploiement sur de nouvelles configurations de flotte. Le downwash et les interactions aérodynamiques en formation serrée constituent un défi ancien en robotique aérienne, traité jusqu'ici soit par des modèles physiques simplifiés peu précis, soit par du contrôle prédictif non linéaire coûteux en calcul, référence de performance du domaine. Ce travail se positionne explicitement face au NMPC, visant à l'égaler en précision avec une charge de calcul bien moindre plutôt qu'à le dépasser en performance brute. Les auteurs présentent leurs résultats comme une première démonstration de vol en formation stable obtenue avec un volume de données aussi faible et une fréquence de boucle aussi élevée. Il s'agit toutefois d'expériences matérielles en conditions contrôlées, et le passage à des flottes plus nombreuses ou à des environnements extérieurs reste à démontrer.

RecherchePaper
1 source
Modélisation par diffusion optimale pour la planification de mouvement multi-robots
1067arXiv cs.RO 

Modélisation par diffusion optimale pour la planification de mouvement multi-robots

Des chercheurs présentent MDOC (Model-Based Diffusion Optimal Control), un planificateur de trajectoires pour flottes multi-robots fondé sur la diffusion, décrit dans un preprint publié sur arXiv (2607.12423). Contrairement aux approches récentes qui traitent la planification de trajectoires comme un problème d'inférence probabiliste et apprennent leurs fonctions de score à partir de larges jeux de données de démonstration, MDOC s'appuie directement sur des modèles de dynamique connus, sans données d'entraînement. Sa mécanique de sécurité combine ces modèles avec des projections contraintes par des Control Barrier Functions (CBF), et le système passe à l'échelle multi-robots grâce à la méthode de Conflict-Based Search (CBS), qui résout les conflits de trajectoires entre agents de façon hiérarchique. Les auteurs rapportent, en simulation, de meilleures performances que des planificateurs de référence en termes d'efficacité d'échantillonnage, de fluidité géométrique des trajectoires et de taux de réussite, tout en réduisant le temps de calcul et en garantissant des trajectoires sans collision. L'enjeu dépasse l'exercice académique : la planification de mouvement multi-robots en environnement continu se heurte à une explosion combinatoire de l'espace des trajectoires conjointes, et les méthodes par diffusion existantes peinent à garantir rigoureusement la faisabilité dynamique et les contraintes de sécurité strictes lors de l'échantillonnage. En s'affranchissant de la dépendance aux données de démonstration tout en conservant des garanties formelles de sécurité, MDOC répond à un frein réel à l'adoption industrielle de ces techniques pour des flottes d'AMR ou de robots collaboratifs, où l'absence de collision n'est pas négociable. Le travail s'inscrit dans la lignée des approches récentes qui recadrent la planification de trajectoires comme un problème d'inférence par diffusion, en s'en distinguant par son caractère "model-based" plutôt que piloté par les données. Il se positionne aussi comme une alternative aux méthodes classiques d'optimisation de trajectoire et de recherche multi-agents. À ce stade, les résultats restent limités à des expériences en simulation ; aucun déploiement sur robots physiques n'est mentionné, ce qui en fait une contribution méthodologique à confirmer avant tout usage en conditions réelles.

RecherchePaper
1 source
GaitSpan : de la marche à la course, l'évolution progressive de la locomotion humanoïde
1068arXiv cs.RO 

GaitSpan : de la marche à la course, l'évolution progressive de la locomotion humanoïde

GaitSpan est un nouveau framework d'apprentissage présente dans un preprint arXiv (2607.12114v1, publie en juillet 2026) qui permet a une politique de contrôle humanoïde pretrainee sur la marche de s'étendre vers des allures plus rapides, jogging et course, sans réapprentissage complet. Le système traite la marche comme une "compétence germe" (seed skill), c'est a dire une structure motrice réutilisable pour l'équilibre, le support, la coordination du corps et les transitions de contact, qui est ensuite régénérée a de nouveaux rythmes, étendue en foulées plus longues et plus hautes, puis corrigée par une adaptation résiduelle. La méthode combine trois mécanismes: une génération de rythme qui module la politique de marche figée via plusieurs horloges internes et apprend des combinaisons conditionnées par des commandes de vitesse; un façonnage de foulée qui récompense des schémas de locomotion dynamique adaptes aux vitesses élevées, inspire de la dynamique du pendule inverse a ressort (spring-loaded inverted pendulum); et une adaptation résiduelle qui capture les détails de mouvement non couverts par les deux premiers mécanismes. Selon les auteurs, GaitSpan est la première politique humanoïde unique, conditionnée par commande, a couvrir un spectre continu allant de la marche au jogging jusqu'a des régimes proches de la course, tout en se transférant a différentes morphologies de robots et en se déployant en zero-shot sur des terrains simules inédits comme sur des terrains réels. Pour l'industrie de la robotique humanoïde, cela répond a une limite récurrente des approches actuelles: les stratégies existantes de diversification des allures, qu'elles reposent sur des calendriers de démarche prédéfinis, l'imitation de clips de mouvement humain, l'entrainement d'experts spécialisés ou la distillation de plusieurs compétences en une seule politique, restent rigides face a des commandes de vitesse continues, des terrains varies et des changements de morphologie. Une politique capable de généraliser la course a partir d'une base de marche déjà maîtrisée réduirait le cout d'ingénierie et accélèrerait le déploiement sur des plateformes variées. Comparee aux approches de référence utilisant plusieurs experts ou l'imitation de démonstrations humaines, GaitSpan apprend plus vite et obtient de meilleures performances de démarche, selon les tests rapportes par les auteurs. Le papier s'inscrit dans la lignée des travaux récents sur les politiques VLA et d'apprentissage par renforcement pour la locomotion humanoïde, ou la question du transfert sim-to-real et de la généralisation entre vitesses et terrains reste un enjeu central de robustesse avant déploiement industriel a grande échelle.

RecherchePaper
1 source
DiffRadar : SLAM radar sensible à la physique et différentiable avec champs gaussiens
1069arXiv cs.RO 

DiffRadar : SLAM radar sensible à la physique et différentiable avec champs gaussiens

Une équipe de recherche présente DiffRadar, un système de SLAM (localisation et cartographie simultanées) radar en temps réel, décrit dans un preprint arXiv publié le 15 juillet 2026 (arXiv:2607.12265v1). Contrairement aux systèmes radar SLAM classiques qui recalent des cartes de chaleur radar discrétisées entre elles, DiffRadar modélise la scène comme un champ de gaussiennes anisotropes différentiable, physiquement cohérent avec le signal radar. Un modèle direct différentiable projette ces primitives dans les espaces range-azimut et Doppler-azimut pour reconstruire les mesures radar brutes, ce qui permet d'optimiser conjointement la pose du robot et la structure de la scène directement depuis les données radar, sans passer par une étape de matching discret. Le système a été implémenté sur du matériel radar FMCW (frequency-modulated continuous-wave) grand public et testé sur le benchmark public Radarize ainsi que sur une suite de stress-tests conçue par les auteurs pour cibler les modes de défaillance classiques du SLAM radar : dégénérescence en couloir, transitions de régime de mouvement, encombrement dynamique et fermetures de boucle sur de longues trajectoires. Les résultats annoncés montrent une réduction substantielle de l'erreur de trajectoire, particulièrement marquée dans les couloirs pauvres en features géométriques, une cohérence cartographique plus que doublée, et un fonctionnement temps réel à 70 images par seconde. Pour l'industrie de la robotique mobile, l'enjeu est de taille : le radar reste le seul capteur fiable dans le noir total, le brouillard, la fumée ou les environnements sensibles à la vie privée où caméras et LiDAR décrochent, mais sa faible résolution angulaire a longtemps limité son usage à un rôle d'appoint. Si les gains rapportés se confirment en conditions réelles au-delà du benchmark contrôlé, cela ouvrirait la voie à des plateformes tout-radar pour l'inspection industrielle, la logistique en environnement enfumé ou les drones en conditions dégradées, sans dépendre d'une fusion capteurs coûteuse. Le papier s'inscrit dans une tendance plus large du SLAM vers les représentations continues et différentiables, héritée des champs de radiance neuronaux (NeRF) et du splatting gaussien popularisé en vision par ordinateur, ici transposés au domaine du signal radar plutôt qu'à l'image. Il reste à ce stade un preprint non encore revu par les pairs, évalué sur un seul benchmark public et une suite de tests maison ; l'étape suivante attendue par la communauté sera une validation indépendante sur d'autres plateformes radar et en conditions de terrain non contrôlées.

RecherchePaper
1 source
StratMamba : partitionnement stratégique et réactif des flux pour l'évitement d'obstacles basé sur le LiDAR
1070arXiv cs.RO 

StratMamba : partitionnement stratégique et réactif des flux pour l'évitement d'obstacles basé sur le LiDAR

Des chercheurs présentent StratMamba, une architecture de modélisation temporelle à deux flux basée sur Mamba, conçue pour la navigation robotique en environnement complexe et encombré d'obstacles. Le système combine deux mémoires aux dynamiques différentes : un flux à décroissance rapide qui traite les données LiDAR haute fréquence pour l'évitement réactif d'obstacles, et un flux à décroissance lente qui conserve les informations de but à plus long horizon pour la planification stratégique. L'architecture a été testée dans les simulateurs IsaacLab et Gazebo sur plusieurs scénarios d'évitement, avec obstacles statiques et dynamiques, puis validée en conditions réelles sur un robot quadrupède Unitree Go1. Face à des références classiques du RL temporel (LSTM, Transformer, Mamba standard), StratMamba affiche un taux de timeout plus faible, la vitesse de navigation la plus rapide (576 pas médians, 5,0% de mieux que le Mamba standard) et la meilleure efficacité de trajectoire mesurée (0,915). Cette approche répond à un problème central en robotique mobile : concilier réactivité immédiate face au danger et cohérence stratégique sur la durée, deux besoins souvent traités par une seule mémoire dans les architectures existantes, au prix de compromis. En séparant explicitement ces deux échelles temporelles, StratMamba illustre une piste concrète pour améliorer la navigation des AMR et robots quadrupèdes dans des environnements denses, un enjeu clé pour les intégrateurs industriels. Le test sur robot physique, où le système reste robuste même avec des portées LiDAR étendues, contrairement au Mamba standard et au Transformer, apporte une validation sim-to-real qui manque souvent aux publications purement simulées. Ce travail s'inscrit dans la lignée des modèles d'état séquentiels (state space models) type Mamba, apparus ces dernières années comme alternative plus efficiente aux Transformers pour le traitement de séquences longues, y compris en apprentissage par renforcement. Il s'agit ici d'un article de recherche déposé sur arXiv, non d'un produit commercialisé ni d'un déploiement industriel annoncé : aucune entreprise, aucun site de déploiement ni calendrier de mise sur le marché n'est mentionné. Les prochaines étapes attendues concernent l'extension à des flottes de robots et à des capteurs plus variés que le seul LiDAR.

RecherchePaper
1 source
Dévoiler des comportements collectifs complexes à partir de récompenses simples
1071arXiv cs.RO 

Dévoiler des comportements collectifs complexes à partir de récompenses simples

Une équipe de recherche propose dans un article publié sur arXiv (2607.12861v1) un cadre d'interprétabilité en deux étapes baptisé EEC, destiné à décortiquer les politiques neuronales opaques de l'apprentissage par renforcement multi-agents (MARL) appliqué aux essaims de robots. L'outil central, nommé Agent Response Map (ARM), cartographie spatialement les décisions de chaque agent pour repérer les zones d'agrégation et d'évitement. Les auteurs valident cette méthode sur deux tâches distinctes : un assemblage coopératif de formes par plusieurs robots, et un scénario compétitif de poursuite-évasion prédateur-proie. Dans la tâche coopérative, ARM révèle que les robots ciblent implicitement l'intérieur inoccupé d'une forme cible, et que cette cible se déplace automatiquement vers la périphérie dès que le centre se remplit, preuve d'une capacité d'exploration autonome des zones libres. Dans la tâche compétitive, la carte identifie de façon inattendue la frontière du diagramme de Voronoï des prédateurs comme point de convergence des proies. Le résultat central de l'étude, c'est que des comportements collectifs complexes émergent de récompenses individuelles simples, sans incitation explicite à l'agrégation, et que ces comportements correspondent à des structures géométriques implicitement apprises par le réseau. Pour l'ingénierie robotique, cela offre un outil concret pour auditer des politiques MARL en boîte noire avant déploiement, un point critique quand ces systèmes gèrent des essaims réels en usine, en logistique ou en défense. Cela répond aussi à une limite connue du MARL : la difficulté à prédire ou garantir un comportement de groupe cohérent à partir de règles de récompense locales, ce qui freinait jusqu'ici l'adoption industrielle au-delà de la simulation. Ce travail s'inscrit dans la lignée des recherches sur l'interprétabilité en apprentissage par renforcement multi-agents, un champ actif où les méthodes de visualisation post-hoc restent rares comparées aux avancées algorithmiques. Les auteurs positionnent ARM comme un outil analytique générique, potentiellement applicable à d'autres tâches de coordination d'essaims, et ouvrent la voie à des extensions vers des environnements plus complexes ou des essaims hétérogènes.

RecherchePaper
1 source
Recherche vision-based pour dribble au football humanoïde par apprentissage de représentation privilégiée
1072arXiv cs.RO 

Recherche vision-based pour dribble au football humanoïde par apprentissage de représentation privilégiée

Une équipe de recherche propose une nouvelle méthode d'apprentissage par renforcement pour le dribble de ballon chez les robots humanoïdes, appliquée en simulation à un Booster T1. Publiée le 12 juillet 2026 sur arXiv, l'approche intègre un encodeur de profondeur temporel directement dans la politique de contrôle via une couche de projection spécifique à la tâche, permettant au robot d'apprendre à dribbler uniquement à partir d'images de profondeur embarquées, sans estimation d'état explicite ni information privilégiée sur la scène. Les résultats chiffrés sont précis : 100% de réussite en dribble nominal vers une cible fixe, 96% avec un obstacle statique unique sur le trajet, mais seulement 46% de réussite face à un adversaire mobile qui tente activement de intercepter le ballon. Cet écart de performance entre scénarios statiques et dynamiques est en soi la donnée la plus intéressante pour l'industrie robotique : il illustre concrètement le fossé qui sépare les démonstrations contrôlées des conditions réelles d'usage, un problème récurrent chez les humanoïdes commerciaux (Figure 03, Optimus, ou les plateformes utilisant des architectures VLA comme Pi-0 ou GR00T N2). Pour les intégrateurs et décideurs qui évaluent la maturité de la locomotion-manipulation embarquée, ce travail confirme qu'apprendre la perception et le contrôle de façon conjointe, plutôt que de les traiter comme deux modules séparés, améliore la robustesse face aux occlusions et aux mouvements rapides du ballon. Mais le taux de succès de 46% contre un adversaire actif montre que la gestion d'interactions dynamiques et imprévisibles reste un problème ouvert, loin d'être résolu à l'échelle. Le travail s'inscrit dans la lignée des recherches sur le soccer humanoïde comme banc d'essai pour l'agilité robotique, un domaine où les approches classiques séparaient historiquement perception et contrôle moteur, au prix d'une fragilité en conditions réelles. Les auteurs positionnent leur méthode comme une base pour aborder des scénarios encore plus complexes impliquant des adversaires mobiles multiples, sans toutefois annoncer de calendrier de transfert vers un robot physique, l'ensemble des expériences restant à ce stade purement simulé.

RecherchePaper
1 source
Représentation des préférences humaines déployable en robotique : apprendre des récompenses représentatives à partir de préférences humaines diverses
1073arXiv cs.RO 

Représentation des préférences humaines déployable en robotique : apprendre des récompenses représentatives à partir de préférences humaines diverses

Une équipe de recherche a publié sur arXiv (2607.12466v1) un nouveau framework baptisé PREC (Preference-based REward Clustering), conçu pour aligner les politiques de contrôle robotique sur les préférences humaines lors du déploiement auprès d'utilisateurs finaux variés. Le problème que les auteurs cherchent à résoudre est concret : quand chaque utilisateur fournit un retour de préférence binaire (trajectoire A préférée à trajectoire B), ce signal est souvent trop rare et bruité pour apprendre une politique individualisée fiable, tandis qu'une politique unique partagée entre tous les utilisateurs écrase les préférences minoritaires. PREC contourne ce dilemme en mettant de côté les labels de préférence dans un premier temps pour apprendre un encodeur de trajectoires au niveau de la population entière, puis en regroupant les utilisateurs en clusters cohérents selon leurs préférences et en entraînant un modèle de récompense représentatif par cluster, à partir duquel une politique dédiée est optimisée. Les tests, menés sur des environnements de locomotion simulés, montrent que PREC identifie mieux les groupes d'utilisateurs aux préférences divergentes que les méthodes de référence, même avec un retour humain sparse et bruité. Pour l'industrie robotique, l'enjeu dépasse la simple curiosité académique : c'est un problème de scalabilité du déploiement. Multiplier les politiques individualisées pour chaque client rend la validation de sécurité intraitable avant mise en production, alors qu'une politique générique déçoit une partie des utilisateurs et nuit à l'adoption. En réduisant le nombre de politiques à un jeu de clusters gérable tout en couvrant les préférences hétérogènes, PREC propose un compromis directement pertinent pour les intégrateurs qui doivent certifier et maintenir un nombre limité de comportements robotiques plutôt qu'une politique par client. Ce travail s'inscrit dans la lignée des recherches sur l'alignement par préférences humaines (RLHF appliqué à la robotique), un champ qui a longtemps oscillé entre alignement individuel coûteux et alignement collectif appauvri. Les auteurs positionnent explicitement PREC face aux approches d'alignement par utilisateur et à l'alignement par politique unique partagée, sur lesquelles il montre des gains sur trois métriques de bien-être social. L'étude reste pour l'instant limitée à des environnements de locomotion simulés, sans validation sur robots physiques ni indication de partenaires industriels ou de calendrier de déploiement.

RecherchePaper
1 source
Directives d'exploration efficace dans l'apprentissage par renforcement sûr
1074arXiv cs.RO 

Directives d'exploration efficace dans l'apprentissage par renforcement sûr

Ce papier de recherche, publié sur arXiv le 15 juillet 2026, présente ATACOM Directional Constraints (ATACOM-DC), une extension du framework ATACOM (safety layer) destinée à l'apprentissage par renforcement sûr pour la robotique. Le problème de départ est connu du secteur : en simulation, le RL permet d'apprendre des comportements robotiques complexes, mais un déploiement réel en environnement ouvert exige des garanties de sécurité fortes pour éviter tout geste dangereux. Les méthodes de Safe RL existantes imposent des contraintes de sécurité issues de la connaissance du système ou apprises depuis les données, mais cette contrainte ralentit généralement l'apprentissage et dégrade les performances de la tâche, l'agent devant résoudre un problème d'optimisation contraint plus complexe qu'en configuration non contrainte. L'innovation proposée introduit des contraintes directionnelles qui distinguent les actions s'approchant d'une frontière de sécurité de celles qui s'en éloignent, n'activant l'enforcement de la contrainte que lorsque c'est réellement nécessaire. Les auteurs évaluent leur méthode sur plusieurs tâches de contrôle robotique complexes en simulation, en mesurant à la fois le coût de violation des contraintes et les performances de tâche obtenues. Code et matériel supplémentaire disponibles sur atacom-dc.robot-learning.net. Pour l'industrie robotique, l'enjeu dépasse la seule performance académique : le compromis sécurité/performance est justement ce qui bloque aujourd'hui le passage de nombreux systèmes RL de la simulation au déploiement réel, notamment pour des bras manipulateurs ou des robots mobiles opérant en environnement humain. Une méthode qui réduit ce compromis sans sacrifier les garanties de sécurité intéresse directement les intégrateurs et les équipes R&D qui cherchent à industrialiser des politiques apprises plutôt que programmées à la main. Cela dit, il s'agit ici de résultats en simulation uniquement, sur un ensemble de tâches de contrôle choisies par les auteurs, sans validation sur robot physique ni déploiement industriel : le gap sim-to-real reste entier, et la portée réelle du gain de performance annoncé demande à être confirmée hors laboratoire. ATACOM-DC s'inscrit dans la lignée d'ATACOM, une safety layer déjà reconnue comme référence pour intégrer des contraintes de sécurité à des algorithmes de RL existants sans les reconcevoir entièrement. Le positionnement se fait ainsi moins face à des concurrents commerciaux que face aux autres approches académiques de Safe RL, généralement critiquées pour leur coût en vitesse d'apprentissage. Aucun acteur français ou européen n'est associé à ces travaux. Les auteurs annoncent la mise à disposition du code et de matériel complémentaire en ligne, ce qui ouvre la voie à une reproduction et une extension par d'autres équipes de recherche en robotique et RL sûr, sans toutefois qu'un calendrier de tests sur systèmes réels ne soit mentionné à ce stade.

RecherchePaper
1 source
TrustVLA : défense guidée par mécanisme contre les portes dérobées des modèles vision-langage-action
1075arXiv cs.RO 

TrustVLA : défense guidée par mécanisme contre les portes dérobées des modèles vision-langage-action

Des chercheurs publient TrustVLA, une défense contre les portes dérobées dissimulées dans les modèles Vision-Language-Action (VLA), ces réseaux qui pilotent des robots a partir d'instructions en langage naturel et d'images. Le papier, mis en ligne sur arXiv le 15 juillet 2026, étudie deux attaques indépendantes, BadVLA et INFUSE, cette dernière survivant même a un réajustement sur données propres en aval. Un modèle VLA empoisonne se comporte normalement sur des observations saines, mais un déclencheur visuel discret suffit a dévier une politique robotique sur un horizon long, sans défaillance visible avant l'échec. Les auteurs identifient un mécanisme récurrent dans les modèles compromis testes: une "empreinte causale compacte", un support visuel restreint, concentre spatialement, capte par les mécanismes d'attention, dont le masquage ramené le score d'évolution des preuves internes a la plage normale. TrustVLA adapte le cadre d'évidence de Dirichlet, conçu pour la classification fiable, afin de surveiller l'incertitude épistémique token par token et couche par couche. Avec un petit jeu de calibration propre, l'outil détecte une évolution anormale, localise le support compact par chute de score contrefactuelle, puis reconstruit l'observation par inpainting localise. Les tests sur OpenVLA/LIBERO et en transfert vers pi_0.5 montrent une réduction du taux de succès des attaques sans dégrader les performances sur taches propres. Ce travail cible un angle mort critique pour l'industrie robotique: les pipelines de déploiement VLA, souvent bâtis sur des poids pré-entraines téléchargés, ne sont généralement pas audites par les utilisateurs finaux, ouvrant une surface d'attaque proche de la chaine d'approvisionnement logicielle. Pour des intégrateurs déployant des bras manipulateurs ou robots mobiles pilotes par des modèles fondation, une défense sans reentrainement change la donne face au cout habituel d'une purge ou recalibration complète. Que INFUSE résiste a un fine-tuning sur données saines contredit l'hypothèse rassurante qu'un réajustement en aval suffirait a nettoyer un modèle compromis, et rappelle que les défenses classiques de vision ou de langage n'expliquent ni la représentation interne d'un modèle déclenche, ni comment restaurer un comportement normal sans tout reentrainer. La recherche VLA s'est accélérée depuis RT-2 et OpenVLA jusqu'a des systèmes généralistes comme pi0 chez Physical Intelligence ou GR00T N2 chez Nvidia, une généralisation accrue qui a fait émerger en parallèle une littérature sur les attaques par backdoor, dont BadVLA et INFUSE sont deux illustrations issues d'équipes distinctes. TrustVLA prolonge les travaux sur la quantification d'incertitude épistémique en les adaptant a des politiques d'action séquentielles. A ce stade, la contribution reste académique, validée sur LIBERO et en transfert vers pi0.5, sans indication de déploiement industriel; les suites attendues portent sur l'extension a d'autres familles de VLA et sur des attaques adaptatives conçues pour contourner ce mécanisme de défense.

RechercheOpinion
1 source
EFLUX : navigation adaptative de formation multi-robots élastique pilotée par des LLM à base d'agents
1076arXiv cs.RO 

EFLUX : navigation adaptative de formation multi-robots élastique pilotée par des LLM à base d'agents

Une équipe de recherche publie EFLUX, un framework qui combine raisonnement par LLM agentique et représentation géométrique structurée pour piloter la navigation de flottes de robots en formation dans des environnements confinés ou encombrés. Le système gère deux comportements complémentaires : la déformation, où la formation change continuellement de géométrie (mise à l'échelle, cisaillement) tout en restant connectée, et la reconfiguration, où les robots se scindent en sous-groupes ou fusionnent à nouveau. Contrairement aux approches existantes qui traitent ces deux comportements séparément ou via des règles écrites à la main, EFLUX extrait une représentation structurée de la scène et laisse un LLM raisonner conjointement sur les deux types d'actions. Ces décisions sont ensuite traduites en trajectoires par robot via un pipeline en boucle fermée de génération, vérification et correction. Les auteurs rapportent des expériences en simulation et sur robots physiques montrant une réduction des blocages (deadlocks) et des échecs de navigation par rapport aux méthodes de référence. L'apport est méthodologique plutôt que produit : il répond à un problème concret de la robotique multi-agents, à savoir que les méthodes découplées ou basées sur des règles manquent de critères géométriques explicites pour décider quand déformer ou reconfigurer une formation, ce qui mène à des trajectoires sous-optimales dans des environnements complexes. Pour les intégrateurs travaillant sur des flottes de robots mobiles autonomes (AMR) en entrepôt, en logistique ou en intervention, ce travail illustre une tendance émergente : utiliser le raisonnement de haut niveau d'un LLM couplé à des contraintes géométriques strictes plutôt que des règles figées, afin de gérer la coordination collective en temps réel. Il s'agit toutefois d'un article de recherche déposé sur arXiv (2607.12050), sans acteur industriel ni produit commercial associé, et l'ampleur exacte des essais matériels n'est pas précisée dans le résumé. EFLUX s'inscrit dans la lignée des travaux récents sur le raisonnement agentique appliqué à la robotique, après des avancées côté modèles vision-langage-action pour robots individuels comme Pi-0 ou GR00T N2. La suite logique serait une soumission à relecture par les pairs et une extension à des flottes plus larges, mais aucune feuille de route n'est annoncée à ce stade.

RecherchePaper
1 source
Infra-Swarm : essaimage multi-robots robuste basé sur la vision, via spectre proche infrarouge
1077arXiv cs.RO 

Infra-Swarm : essaimage multi-robots robuste basé sur la vision, via spectre proche infrarouge

Une équipe de recherche propose Infra-Swarm, une architecture de perception pour essaims de robots reposant entièrement sur la vision proche infrarouge plutôt que sur la communication radio. Le concept, décrit dans un preprint publié sur arXiv (2607.12489), équipe chaque robot d'une source lumineuse proche infrarouge et de quatre caméras standard en niveaux de gris. Le système mesure directement la position 3D de ses voisins, avec une précision de l'ordre du centimètre, en analysant la direction (bearing) et l'intensité des points lumineux captés par les caméras. La clé technique repose sur des filtres à bande étroite de 940 nm qui bloquent physiquement 99,2 % des interférences de lumière ambiante, rendant la détection robuste aux variations d'éclairage dès le niveau matériel, sans recourir à un traitement logiciel lourd. L'intérêt de cette approche pour l'industrie robotique tient à sa capacité à contourner deux limites classiques des essaims multi-robots : la dépendance à une communication sans fil, souvent contrainte en bande passante et vulnérable aux interférences dans des environnements denses, et la fragilité des systèmes de vision passive classiques face aux changements de luminosité. En misant sur un filtrage optique matériel plutôt que sur des algorithmes de traitement d'image coûteux, Infra-Swarm promet une charge de calcul minimale, ce qui ouvre la voie à un déploiement sur du matériel embarqué à ressources limitées, un critère décisif pour faire passer les essaims robotiques de démonstrations en laboratoire à des flottes de taille réelle chez des intégrateurs. Le travail s'inscrit dans un champ de recherche actif sur la coordination décentralisée d'essaims, où les approches historiques oscillent entre communication radio (UWB, mesh Wi-Fi) et vision par caméras RGB classique, chacune avec ses compromis en portée, latence et robustesse environnementale. Infra-Swarm se positionne comme une alternative hybride matérielle, misant sur l'optique proche infrarouge plutôt que sur le calcul pour gagner en fiabilité. À ce stade, il s'agit d'un article de recherche et non d'un produit déployé : les prochaines étapes attendues concernent la validation à plus grande échelle, au-delà des essais en laboratoire décrits dans le preprint.

RecherchePaper
1 source
VistaVLA : modèle vision-langage-action fondé sur du 3D gaussian splatting conscient de la géométrie et de la sémantique, pour la manipulation robotique
1078arXiv cs.RO 

VistaVLA : modèle vision-langage-action fondé sur du 3D gaussian splatting conscient de la géométrie et de la sémantique, pour la manipulation robotique

VistaVLA, présenté dans un article arXiv publié le 15 juillet 2026, est un nouveau framework de manipulation robotique combinant vision, langage et action (VLA) qui construit une représentation 3D explicite de la scène à partir de primitives de Gaussiennes 3D. Contrairement aux modèles VLA classiques qui projettent directement instructions textuelles et images 2D vers des actions, VistaVLA fonctionne en deux étapes : il élève des caractéristiques vision-langage multi-vues en primitives gaussiennes 3D, créant des tokens sémantiques ancrés géométriquement, puis les compresse via un mécanisme baptisé Merge-then-Query (MtQ). Ce module réduit de 99% le nombre de tokens nécessaires tout en préservant les informations spatiales et sémantiques utiles à l'action. Les auteurs rapportent des gains de 22,8% du taux de réussite sur sept tâches réelles, et de 30% par rapport à la baseline VLA-Adapter sur des tâches hors distribution (out-of-distribution), en environnement simulé comme réel. Pour l'industrie robotique, ce travail cible un point faible connu des modèles VLA actuels : leur absence de représentation 3D persistante et invariante au point de vue, qui limite leur capacité à raisonner sur des contraintes géométriques et des layouts spatiaux complexes. La plupart des VLA en production s'appuient sur des flux caméra 2D bruts ou des cartes de profondeur peu structurées ; VistaVLA propose une carte cognitive 3D sémantique inspirée de la cognition humaine, un argument qui, s'il se confirme à plus grande échelle, pourrait influencer la conception des prochaines générations de politiques d'action pour bras manipulateurs et robots mobiles. Ce travail s'inscrit dans une vague de recherche académique cherchant à combler l'écart entre modèles VLA à succès commercial, comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure, et leurs limites documentées en generalisation spatiale. Les résultats restent pour l'instant issus d'évaluations contrôlées en laboratoire, sans déploiement industriel annoncé ; la validation sur des tâches de manipulation plus variées et à plus grande échelle reste la prochaine étape naturelle pour ce type d'approche.

RechercheActu
1 source
Adaptation planificateur : apprentissage adaptatif des paramètres par modèle vision-langage-action
1079arXiv cs.RO 

Adaptation planificateur : apprentissage adaptatif des paramètres par modèle vision-langage-action

Article sur l'apprentissage adaptatif de paramètres de planification pour la navigation robotique. Des chercheurs ont présenté APPLV (Adaptive Planner Parameter Learning from Vision-Language-Action Model), une méthode qui utilise un modèle vision-langage pré-entraîné doté d'une tête de régression pour prédire les paramètres de configuration de planificateurs classiques de navigation, plutôt que de générer directement des actions comme le font les modèles VLA traditionnels. Deux stratégies d'entraînement ont été développées : un apprentissage supervisé à partir de trajectoires de navigation collectées, puis un affinage par apprentissage par renforcement pour optimiser davantage les performances. L'équipe a évalué APPLV sur plusieurs planificateurs de mouvement via le jeu de données simulé BARN (Benchmark Autonomous Robot Navigation), ainsi que lors d'expériences sur robot physique. Les résultats montrent qu'APPLV surpasse les méthodes existantes à la fois en performance de navigation et en capacité de généralisation à des environnements non vus durant l'entraînement. Cette avancée s'attaque à un problème concret pour les intégrateurs de robotique mobile : la navigation dans des espaces fortement contraints. Les approches classiques de navigation, bien que sûres, nécessitent un réglage manuel et fastidieux des paramètres pour chaque nouvel environnement, tandis que l'apprentissage de bout en bout contourne ce réglage mais échoue souvent sur le contrôle précis requis en espace confiné. APPLV se positionne dans une troisième voie déjà explorée par des travaux récents en robot learning, qui automatisent le réglage des paramètres tout en conservant les garanties de sécurité des systèmes classiques, mais qui peinaient jusqu'ici à généraliser à des environnements inédits. En s'appuyant sur les capacités de compréhension de scène des modèles fondation, APPLV cherche aussi à répondre aux limites connues des VLA appliqués à la navigation : latence d'inférence et manque de précision dans le contrôle, deux obstacles qui freinent leur déploiement industriel réel. Le travail s'inscrit dans la lignée des recherches sur les modèles Vision-Language-Action (VLA) appliqués à la robotique mobile, un domaine où la promesse de généralisation via les modèles fondation se heurte régulièrement à la réalité du contrôle bas niveau. En choisissant de faire prédire des paramètres de planificateur plutôt que des actions brutes, les auteurs combinent l'interprétabilité et la sécurité des planificateurs classiques avec la capacité d'adaptation contextuelle des modèles vision-langage. Le papier, une version révisée (v2) déposée sur arXiv, ne précise pas d'acteur industriel ni de calendrier de déploiement commercial ; il s'agit à ce stade d'une contribution de recherche académique, dont la portée pratique dépendra de futurs travaux de validation sur des flottes robotiques réelles et de comparaisons plus larges avec d'autres architectures de navigation apprise.

RechercheOpinion
1 source
Manipulation robuste en main via des a priori en apprentissage par renforcement et conception mécanique
1080arXiv cs.RO 

Manipulation robuste en main via des a priori en apprentissage par renforcement et conception mécanique

Article envoyé en direct par un utilisateur (pas de contexte projet lié) : je traduis et résume le papier de recherche demandé. L'équipe présente une méthode pour améliorer la manipulation intra-main (in-hand manipulation) sans capteurs externes, un problème classique en robotique car les contacts doigt-objet et la gravité introduisent des incertitudes difficiles à modéliser. Les chercheurs combinent l'apprentissage par renforcement avec deux "priors" physiques complémentaires : un prior global de qualité de prise, issu de l'analyse classique de grasping, utilisé comme terme de récompense qui favorise des contacts bien répartis et une meilleure résistance aux forces perturbatrices dans le pire cas ; et un prior local de géométrie de contact, basé sur la courbure du bout des doigts, qui façonne mécaniquement l'interface de contact pour orienter le roulement de l'objet selon la tâche et réduire les dérives hors axe. La méthode est testée sur une main robotique multi-doigts manipulant trois objets différents selon quatre orientations de paume, avec des gains mesurés en efficacité de rotation, stabilité de la prise et rejet de perturbations. L'intérêt pour le secteur tient au fait que les approches RL existantes pour le "finger gaiting" (repositionnement séquentiel des doigts) privilégient souvent la réussite de la tâche sans se soucier de maintenir une prise mécaniquement saine pendant la manipulation, ce qui les rend fragiles face aux perturbations et difficiles à transférer du simulateur au monde réel. En intégrant des critères de qualité de prise directement dans la fonction de récompense, et en couplant cela à un design mécanique du bout des doigts pensé pour la tâche, les auteurs proposent une piste concrète pour des mains robotiques plus robustes en usage industriel, où la manipulation fine sans capteurs tactiles dédiés reste un goulot d'étranglement coûteux. Ce travail s'inscrit dans la lignée des recherches en RL pour la dextérité robotique, où le sim-to-real reste l'obstacle principal malgré des démonstrations impressionnantes en simulation. L'originalité ici est de ne pas traiter le problème uniquement comme une question d'algorithme, mais d'articuler apprentissage et morphologie mécanique. Une vidéo de démonstration accompagne la publication, mais aucun élément sur un déploiement réel ou une validation matérielle à grande échelle n'est mentionné à ce stade.

RecherchePaper
1 source
Réduction de la redondance temporelle pour une inférence VLA efficace
1081arXiv cs.RO 

Réduction de la redondance temporelle pour une inférence VLA efficace

Des chercheurs publient sur arXiv (arXiv:2607.12287v1) une méthode d'accélération pour les modèles Vision-Language-Action (VLA), utilisés en manipulation robotique, dont la latence d'inférence freine aujourd'hui le déploiement en temps réel. Ils identifient deux sources de redondance temporelle dans les pipelines VLA existants : le réencodage visuel complet de trames vidéo consécutives quasi identiques, et l'échantillonnage itératif multi-étapes propre aux politiques d'action basées sur la diffusion. Leur réponse combine deux optimisations système. Côté perception, seuls les tokens correspondant aux régions dynamiques de la scène sont mis à jour de façon incrémentale, au lieu de réencoder l'image entière à chaque frame. Côté génération d'action, le calendrier de diffusion est compressé à seulement deux étapes grâce à un entraînement spécifiquement optimisé pour l'efficacité, sans sacrifier la précision des gestes. Testée sur les bancs d'essai simulés Libero et RobotWin ainsi que sur des plateformes robotiques réelles, la méthode obtient un gain de vitesse supérieur à 2x, avec un taux de réussite allant jusqu'à 98% sur des benchmarks de manipulation générale. Le code doit être publié sur GitHub, mais n'est pas encore disponible : il s'agit pour l'instant d'un preprint académique, pas d'un produit livré. Pour les intégrateurs et les équipes robotique, ce travail s'attaque à un goulot d'étranglement bien réel : les politiques de diffusion, très précises, restent lentes à cause du débruitage itératif, ce qui complique leur usage sur du matériel embarqué à budget de calcul limité. Réduire ce coût sans perte de performance rapproche les VLA d'un fonctionnement temps réel sur GPU embarqué plutôt que sur infrastructure cloud dédiée, un enjeu central pour la commercialisation des bras manipulateurs et des humanoïdes. Cette publication s'inscrit dans une vague plus large de travaux visant l'efficacité d'inférence des VLA, alors que des modèles comme Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) ou Helix (Figure AI) ont démontré de fortes capacités de généralisation mais souffrent des mêmes limites de latence. La méthode reste pour l'instant validée en simulation et sur bancs de test restreints ; sa robustesse à grande échelle, en environnement industriel réel, reste à démontrer une fois le code effectivement publié.

RechercheActu
1 source
ChunkFlow : vers un apprentissage de politique par segments cohérents en continuité
1082arXiv cs.RO 

ChunkFlow : vers un apprentissage de politique par segments cohérents en continuité

Les têtes d'action par blocs ("chunks") sont devenues un standard pour les modèles vision-langage-action (VLA) qui doivent respecter des contraintes temps réel, mais elles souffrent d'un défaut connu: le "boundary jitter", des prédictions incohérentes dans les zones de chevauchement entre deux chunks consécutifs, ce qui dégradé la fluidité des mouvements et le taux de réussite des taches. Un article publie sur arXiv (2607.12992) présente ChunkFlow, un framework d'entrainement et d'exécution qui s'attaque directement a ce problème. La méthode découpe chaque chunk en trois zones, gelée, éditable et future, applique un mélange déterministe des chevauchements au moment de l'exécution, et entraine les prédictions brutes avec des fonctions de perte de continuité de premier et second ordre, plus une perte spécifique de "couture" entre segments. Une corruption contrôlée de l'historique et un échantillonnage programme renforcent la robustesse face aux erreurs déjà exécutées, et une phase de fine-tuning par AWAC adapte ensuite la politique sans effacer ces contraintes structurelles. Les auteurs montrent, sous hypothèses de régularité, que l'écart de couture avant mélange décroît mathématiquement quand le chevauchement augmente. Pour les intégrateurs et ingénieurs travaillant sur des politiques robotiques, ce travail cible un angle mort fréquent des VLA a chunks: les méthodes existantes de mélange a l'inférence se contentent de reponderer des propositions divergentes sans corriger l'erreur sous-jacente, ce qui accumule le bruit au fil de l'exécution. Si les résultats se confirment au-delà des benchmarks académiques, ChunkFlow offrirait un moyen de gagner en stabilité temporelle sans sacrifier la latence, un compromis central pour tout déploiement en boucle fermée sur du matériel réel. L'évaluation reste toutefois principalement académique: elle s'appuie sur les benchmarks simules CALVIN et LIBERO, complètes par des tests sur robots réels dont l'ampleur n'est pas précisée dans le résume. Aucune entreprise commerciale n'est nommée, la page projet est hébergée sous un compte "cytoderm-ai" sans affiliation explicite. La problématique rejoint néanmoins les enjeux des architectures a chunks déjà déployées par des acteurs comme Pi-0, GR00T N2 ou Helix, qui devront a terme arbitrer entre réactivité temps réel et cohérence des trajectoires.

RechercheActu
1 source
ABot-AgentOS : un système d'exploitation robotique généraliste doté d'une mémoire multimodale à long terme
1083arXiv cs.RO 

ABot-AgentOS : un système d'exploitation robotique généraliste doté d'une mémoire multimodale à long terme

ABot-AgentOS, un système d'exploitation générique pour agents robotiques, vient d'être détaillé dans un article arXiv (2607.10350v1, juillet 2026). Il se positionne au-dessus des contrôleurs bas niveau existants et ajoute une couche délibérative chargée de la planification conditionnée par la scène, de l'exécution de compétences isolées par contexte, de la vérification multi-étapes, de la mémoire multimodale et de la collaboration edge-cloud. Pour l'évaluer, les auteurs introduisent EmbodiedWorldBench, un benchmark exécutable couvrant 16 scènes intérieures, extérieures et hybrides, quatre niveaux de difficulté et plus de 200 tâches (navigation, recherche d'objets, dialogue avec des PNJ, événements dynamiques), avec un scoring ancré sur les traces d'exécution réelles. Le système repose sur une "Universal Multi-modal Graph Memory", une mémoire persistante qui transforme dialogues, observations visuelles, contexte spatial, relations temporelles et traces de tâches en nœuds et arêtes typés. Une boucle d'auto-amélioration pilotée par les échecs promeut les correctifs générés uniquement vers de futurs jeux d'évaluation, pour éviter toute fuite de vérité terrain. Sur les benchmarks de mémoire, la version statique atteint 87,5 sur LoCoMo, 59,9 sur OpenEQA EM-EQA, 88,6 sur Mem-Gallery et 76,5 (Acc@All) sur NExT-QA ; l'auto-évolution pousse ces scores à 88,7, 60,4 et 89,0 respectivement. L'enjeu dépasse la simple perception ou prédiction d'action déjà couverte par les modèles VLA (Pi-0, GR00T N2, Helix) : il s'agit de doter les robots d'une mémoire persistante et auditable capable de raisonner sur le long terme, un manque identifié comme un frein à l'autonomie réelle en environnement complexe. Pour les intégrateurs, l'intérêt d'une couche OS générique tient à la promesse d'exécution cross-embodiment, potentiellement réutilisable entre plateformes robotiques différentes. Le scoring ancré sur les traces d'exécution répond directement à une critique récurrente du secteur, celle des démonstrations sélectionnées sans validation vérifiable. Il faut toutefois noter que les résultats ne portent que sur un "sous-ensemble initial" d'EmbodiedWorldBench, sans validation indépendante à ce stade. Ce travail s'inscrit dans la suite logique des modèles VLA qui ont résolu une bonne partie de la perception et de la prédiction d'action, mais laissent en jachère la mémoire et le raisonnement à long horizon. Aucun acteur français ou européen n'apparaît dans cette publication, purement académique et publiée en preprint. Les prochaines étapes annoncées consistent à étendre l'évaluation à l'ensemble du benchmark EmbodiedWorldBench, la boucle d'auto-évolution actuelle n'ayant pour l'instant été validée que sur des correctifs de mémoire ciblés et progressivement promus.

RecherchePaper
1 source
Vérification en temps réel de modèles pour la planification réactive en boucle fermée de robots
1084arXiv cs.RO 

Vérification en temps réel de modèles pour la planification réactive en boucle fermée de robots

Une équipe de recherche a publié une version mise à jour (v2) sur arXiv (2508.19186) d'un article intitulé « Real-Time Model Checking for Closed-Loop Robot Reactive Planning », qui propose une méthode de vérification de modèles (model checking) pour la planification réactive multi-étapes d'un robot autonome. Le constat de départ : les méthodes classiques d'évitement d'obstacles ne raisonnent qu'un pas en avant et se retrouvent souvent piégées dans des minima locaux, par exemple face à une impasse (cul-de-sac) ou un obstacle isolé. Les auteurs ont conçu un petit algorithme de model checking, exécuté directement dans le code du robot, qui génère des plans en temps réel sur un appareil à faible puissance de calcul, sans données pré-calculées ni entraînement préalable. La méthode s'appuie sur des systèmes de contrôle temporaires, activés en chaîne pour contrer les perturbations locales qui écartent le robot de son comportement ou état de repos préféré, et limite l'explosion combinatoire de l'espace d'états en ne travaillant que sur des instantanés temporaires de l'environnement immédiat. La planification multi-étapes repose sur des contre-exemples générés par recherche en profondeur d'abord (depth-first search) et une propriété de chemin en logique temporelle linéaire (LTL) négée. L'intérêt pratique tient à la promesse d'un raisonnement multi-étapes low-cost, sans base de données ni apprentissage profond, embarquable sur du matériel modeste : un argument qui tranche avec la tendance dominante des approches de navigation gourmandes en données et en puissance de calcul. Pour les intégrateurs de robots mobiles critiques (véhicules autonomes, robots de mission), cela ouvre une piste de navigation sûre et déterministe, avec des garanties formelles issues du monde de la vérification logicielle plutôt que des heuristiques d'apprentissage. Les auteurs revendiquent des gains de performance mesurables face à un agent purement réactif limité à un seul pas de raisonnement. Le model checking est historiquement une technique de vérification formelle de logiciels et de systèmes critiques, ici détournée vers la planification de trajectoire en temps réel plutôt que vers l'analyse a posteriori. L'article, positionné comme une étude de cas pédagogique, ne revendique pas de déploiement industriel ni de produit commercialisé : il s'agit de résultats empiriques et de preuves informelles sur deux scénarios contrôlés (impasse et obstacle isolé), présentés comme base pour des travaux futurs en navigation embarquée sûre, notamment pour les véhicules autonomes et la robotique mobile mission-critique.

RecherchePaper
1 source
Robot Drummer : un humanoïde apprend les compétences rythmiques de la batterie
1085arXiv cs.RO 

Robot Drummer : un humanoïde apprend les compétences rythmiques de la batterie

Des chercheurs ont présenté Robot Drummer, un framework de simulation permettant à des robots humanoïdes d'apprendre à jouer de la batterie, dans un article mis à jour sur arXiv (arXiv:2507.11498v3). L'équipe modélise le jeu de batterie comme une succession d'événements de contact minutés, baptisée "Rhythmic Contact Chain". Pour gérer la durée des morceaux, chaque piste est découpée en segments de longueur fixe, et une seule politique d'apprentissage par renforcement est entraînée en parallèle sur l'ensemble de ces segments plutôt que morceau par morceau. Les auteurs ont testé leur méthode sur plus de trente titres populaires et rapportent des scores F1 élevés, avec un apprentissage efficace même sur des performances musicales longues. Le système fait émerger des comportements proches de ceux d'un batteur humain, comme les frappes en croisant les bras ou une répartition adaptative des baguettes entre les mains. Le projet reste pour l'instant purement simulé, sans déploiement sur un robot physique ; une page dédiée (robotdrummer.github.io) présente les résultats. L'intérêt de ces travaux dépasse le simple exercice de style musical. La batterie impose une contrainte rare dans la robotique humanoïde : une synchronisation à la fraction de seconde, des contacts répétés à grande vitesse, et une coordination fine entre plusieurs membres sur des durées de plusieurs minutes, bien au-delà des tâches de manipulation ou de locomotion habituellement étudiées. Démontrer qu'une politique de RL unique peut apprendre ce type de comportement long et précis constitue un test de charge utile pour les architectures de contrôle destinées, à terme, à des tâches industrielles exigeant elles aussi rapidité et coordination multi-membres sous contrainte de timing strict. Les humanoïdes ont beaucoup progressé ces dernières années sur l'équilibre, la marche et la préhension d'objets, mais les domaines expressifs comme la performance artistique restaient largement inexplorés. Ce travail s'inscrit dans une tendance plus large consistant à utiliser des tâches créatives ou ludiques comme bancs d'essai pour la dextérité et la coordination robotique. La prochaine étape logique, non abordée dans cette publication, serait le transfert de cette politique de simulation vers un robot physique réel, avec les défis classiques de sim-to-real que cela implique.

RecherchePaper
1 source
Robots humanoïdes : la planification de trajectoire diversifiée par inférence de Stein contrainte globalisée
1086arXiv cs.RO 

Robots humanoïdes : la planification de trajectoire diversifiée par inférence de Stein contrainte globalisée

Des chercheurs viennent de publier sur arXiv (référence 2607.12732v1) une nouvelle méthode baptisée SteinSQP, pour Stein Variational Sequential Quadratic Programming, destinée à la planification de mouvement robotique. Le constat de départ est simple: les planificateurs classiques ne renvoient généralement qu'une seule trajectoire, alors que le problème est par nature multimodal, avec plusieurs solutions à faible coût possibles. Les approches probabilistes existantes tentent de maintenir une distribution de mouvements plutôt qu'une trajectoire unique, mais peinent à garantir que chaque échantillon respecte les contraintes strictes propres à la robotique: évitement de collisions, limites articulaires, conditions de contact et cohérence dynamique. SteinSQP fait évoluer un ensemble de particules en interaction, à la manière des méthodes Stein variationnelles classiques, tout en intégrant directement ces contraintes dans un sous-problème de programmation quadratique séquentielle en espace noyau. Ce sous-problème contraint de type Stein-Newton est résolu via un algorithme primal-dual sans matrice explicite, optimisé pour le GPU, ce qui permet des mises à jour groupées de l'ensemble de particules. Sur cinq tâches de planification sous contraintes, la méthode produit des ensembles entièrement faisables tout en conservant des alternatives de mouvement diversifiées. L'enjeu dépasse la seule performance algorithmique. Pour les intégrateurs et les équipes de recherche en robotique, disposer de plusieurs trajectoires faisables plutôt que d'une seule change la donne pour le replanning en temps réel, la gestion des échecs d'exécution ou l'arbitrage entre plusieurs stratégies de mouvement selon le contexte. La méthode s'attaque frontalement à un écart connu du secteur: beaucoup de techniques d'échantillonnage diversifié fonctionnent bien sans contraintes, mais s'effondrent dès qu'il faut garantir la faisabilité physique de chaque particule à l'échelle du robot. Les auteurs affirment une convergence plus rapide et plus robuste, une meilleure faisabilité par particule, et un temps de résolution par lot inférieur à celui obtenu avec des bases Stein de premier ordre ou du multistart séquentiel en programmation non linéaire. Ce travail s'inscrit dans la lignée des méthodes d'inférence variationnelle de Stein (SVGD) appliquées à la planification de mouvement, un champ qui cherche à dépasser les limites des planificateurs mono-solution historiques comme CHOMP ou TrajOpt. Il s'agit ici d'une publication de recherche, sans déploiement matériel ni partenaire industriel annoncé; les auteurs comparent leur approche à des méthodes concurrentes de premier ordre et à des solveurs NLP classiques, sans préciser de calendrier vers une intégration en conditions réelles.

RecherchePaper
1 source
Un vocabulaire d'états comportementaux dans le R-CODE de la Sony ERS-111
1087arXiv cs.RO 

Un vocabulaire d'états comportementaux dans le R-CODE de la Sony ERS-111

Une étude publiée sur arXiv (2607.12115) propose une analyse à l'échelle d'un corpus complet de diagrammes comportementaux générés à partir de la distribution d'exemples R-CODE de Sony, le langage de programmation conçu pour le robot chien AIBO ERS-111. Plutôt que d'examiner chaque script isolément, les auteurs comparent les états nommés à travers l'ensemble des routines fournies par Sony pour en extraire le vocabulaire de contrôle récurrent. Le résultat principal montre que des comportements apparemment très différents s'appuient en réalité sur une grammaire embarquée compacte, structurée autour de cinq briques : initialisation, détection sensorielle, action itérative, synchronisation et récupération d'erreur. L'intérêt de ce travail dépasse l'archéologie logicielle. Les auteurs défendent l'idée que cette abstraction par machine à états peut servir de représentation intermédiaire pour construire de nouvelles routines comportementales encapsulées, en particulier sur des systèmes robotiques natifs à ressources contraintes, là où un contrôle déterministe, un accès direct au matériel et une composition modulaire des comportements restent prioritaires. Ce positionnement tranche avec la tendance actuelle de la robotique humanoïde et mobile, dominée par les modèles vision-langage-action (VLA) gourmands en calcul comme Pi-0, GR00T N2 ou Helix : l'étude rappelle qu'une approche par états explicites, héritée des systèmes embarqués des années 2000, garde une pertinence pratique pour le contrôle bas niveau sur du matériel limité. Sorti en 1999 puis décliné jusqu'à l'ERS-7, l'AIBO a été l'un des premiers robots grand public programmables, avec R-CODE comme environnement de script accessible aux amateurs et chercheurs. Ce papier s'inscrit dans une démarche rétrospective : il ne s'agit ni d'une annonce produit ni d'un déploiement, mais d'une analyse historique et méthodologique d'un corpus ancien, destinée à en tirer des principes de conception réutilisables. Les auteurs ne mentionnent pas de suite industrielle directe, mais suggèrent que ce type de vocabulaire comportemental structuré pourrait inspirer des architectures de contrôle modulaires pour la prochaine génération de robots embarqués à ressources limitées.

RecherchePaper
1 source
36Kr : un ex-associé de Flexiv lève des dizaines de millions de yuans pour des agents IA industriels
108836Kr 

36Kr : un ex-associé de Flexiv lève des dizaines de millions de yuans pour des agents IA industriels

Shanghai Zhuizhi Engineering Technology (追知工科), fondée en février 2024, vient de lever plusieurs dizaines de millions de yuans en amorçage auprès de L2F Guangyuan Ventures, Shangrong Capital et Yicun Capital. L'entreprise, issue de la valorisation de recherche de l'université Jiao Tong de Shanghai et incubée par l'Institut d'intelligence artificielle de Shanghai, développe des "agents industriels verticaux" pour des procédés de fabrication comme le meulage et le soudage, plutôt qu'un robot humanoïde généraliste. Sa fondatrice, Yuan Lin, a été partenaire commercial chez Flexiv (非夕科技), contribuant à sa croissance jusqu'au statut de licorne, après des postes de directrice des ventes groupe chez l'équipementier coté Huachangda et de responsable de projets ABB en Chine sur les lignes Changan Ford et Geely, des contrats de plusieurs centaines de millions de yuans. L'équipe technique s'appuie sur le professeur Li Zhuguo, spécialiste des matériaux à Jiao Tong classé parmi les 2% de scientifiques les plus cités au monde, et sur Cao Guangzhi, ancien scientifique en chef de la vision par ordinateur pour Autopilot chez Tesla. Le produit phare, baptisé WOLIF, repose sur une architecture de contrôle en boucle fermée dite "cerveau industriel plus cervelet de procédé", censée ajuster en continu les paramètres d'usinage selon l'état perçu de la pièce, au lieu d'exécuter un programme figé préréglé par des ingénieurs. Cette approche cible un angle mort réel de l'automatisation industrielle : les tâches non standardisées à forte variabilité, où les robots à règles fixes échouent et où la main d'œuvre qualifiée se raréfie. Si la promesse de "boucle fermée totalement autonome" reste à vérifier à grande échelle au-delà des cas cités, la traction commerciale déjà annoncée, un premier contrat livré avec un groupe coté en Chine continentale et une commande de plusieurs dizaines de millions de yuans dans l'aéronautique, distingue ce dossier des simples démonstrations technologiques. La première génération de robot de traitement de surface, FAST, a été validée sur des pièces aéronautiques de haute précision. Zhuizhi vise ensuite l'énergie nouvelle, puis l'automobile, l'électronique grand public, la robotique et les drones, en misant sur la portabilité de son savoir-faire par matériau et procédé plutôt que par secteur, une capacité de traitement du carbone par exemple devant se transférer de l'aéronautique au sport ou à l'électronique.

Chine/AsieActu
1 source
Xiaomi fait le point sur ses robots humanoïdes en usine automobile, avec 98 % de réussite sur certaines tâches
1089TechNode 

Xiaomi fait le point sur ses robots humanoïdes en usine automobile, avec 98 % de réussite sur certaines tâches

Xiaomi a communiqué de nouveaux résultats sur le déploiement de son robot humanoïde dans une de ses usines automobiles. Après quatre mois d'itérations successives, le taux de réussite du robot sur un poste de vissage d'écrous autotaraudeurs est passé de 90,2 % à 98 %, selon les chiffres avancés par l'entreprise, réduisant l'écart avec le taux de qualification des ouvriers humains à un seul point de pourcentage. Xiaomi a également étendu les tâches confiées à la machine avec deux nouveaux postes : le tri de panneaux latéraux de console centrale et le pliage puis recyclage de bacs à pièces, tous deux affichant un taux de réussite de 90 %. Le poste de tri des panneaux de console constitue, selon le constructeur, la première fois qu'un robot humanoïde effectue des opérations continues de longue durée sur des pièces souples dans une usine automobile. Ces chiffres proviennent de communications internes de l'entreprise, relayées par le média chinois Jiemian, sans validation indépendante. Ce type d'annonce pèse dans le débat sur l'écart entre démonstration et réalité industrielle qui traverse le secteur des robots humanoïdes. Manipuler des pièces souples et non rigides en continu reste l'un des obstacles majeurs à une automatisation généralisable au-delà de tâches répétitives sur objets calibrés, un problème central pour les intégrateurs et les décideurs industriels qui évaluent la maturité réelle de ces machines avant d'investir. Un taux de réussite proche de celui d'un opérateur humain sur un poste de production, si confirmé à plus grande échelle, renforcerait l'argument selon lequel certains modèles de contrôle vision-langage-action commencent à tenir leurs promesses en environnement de production réel, et pas seulement en laboratoire. Xiaomi investit dans la robotique humanoïde depuis la présentation de son robot CyberOne en 2022, dans un contexte où les groupes chinois comme Unitree, UBTech et Fourier Intelligence multiplient les essais en usine, aux côtés d'acteurs occidentaux tels que Figure AI, Tesla avec Optimus ou Agility Robotics. Xiaomi n'a pas communiqué de calendrier de déploiement à grande échelle ni de volumes de production visés, laissant ces annonces au stade d'un pilote industriel interne plutôt que d'un déploiement commercial confirmé.

IndustrielActu
1 source
LimX Dynamics, la start-up chinoise spécialisée dans les robots humanoïdes, atteint 2,3 milliards de dollars de valorisation avec un tour pré-IPO de 200 millions de dollars
1090Pandaily 

LimX Dynamics, la start-up chinoise spécialisée dans les robots humanoïdes, atteint 2,3 milliards de dollars de valorisation avec un tour pré-IPO de 200 millions de dollars

LimX Dynamics, startup de robotique humanoïde basée à Shenzhen et fondée il y a quatre ans par Zhang Wei, professeur à la Southern University of Science and Technology, vient de boucler un tour de table Pre-IPO de près de 200 millions de dollars, portant sa valorisation post-money à 2,3 milliards de dollars, un montant qui la place parmi les startups robotiques les plus valorisées de Chine. L'entreprise a bâti une architecture technologique en trois couches: à la base, un modèle fondation type "cervelet" pour le contrôle moteur du corps entier; au milieu, un moteur vision-langage-action baptisé Humanoid VLA qui relie perception visuelle et commandes motrices; au sommet, un système d'exploitation agentique nommé COSA, chargé du raisonnement, de la planification et de l'exécution des tâches. Cette fusion cognito-motrice dans une architecture unique distingue LimX de concurrents qui traitent généralement contrôle moteur et raisonnement cognitif comme deux sous-systèmes séparés. Le catalogue produit illustre cette approche: Luna, le robot humanoïde phare, est vendu 298 000 RMB (environ 41 000 dollars), dispose de 27 degrés de liberté et peut orchestrer des performances synchronisées jusqu'à 200 robots pour l'événementiel. TRON 2, robot multi-formes sur châssis unique, se reconfigure entre versions bipède, à roues ou double-bras via des modules de buste interchangeables, achetés en une fois pour cinq configurations différentes. En avril 2026, LimX a également mis en open source le Flux VLA Engine, plateforme d'ingénierie pour l'intelligence incarnée codéveloppée avec Alibaba Cloud. Le choix stratégique de LimX tranche nettement avec la ruée du secteur vers les démonstrations d'utilité en usine. Zhang Wei affirme que les humanoïdes ne sont pas nés pour les chaînes de production, où l'efficacité coût et le débit priment, mais pour des scénarios commerciaux, hôteliers, touristiques et de divertissement où l'interaction humaine, le mouvement esthétique et la présence sociale créent de la valeur, notamment à l'export. Ce pari a une portée concrète pour l'industrie: si le premier marché de masse des humanoïdes se révèle bien être le service et le divertissement plutôt que l'industrie, LimX prendrait une avance difficile à rattraper sur ce segment, quand les acteurs focalisés sur l'usine capteraient en priorité les revenus manufacturiers. À prendre néanmoins avec prudence: les chiffres de déploiement en conditions réelles restent limités par rapport aux démonstrations mises en avant. Sur le plan concurrentiel, LimX se positionne face à des rivaux chinois et occidentaux qui misent majoritairement sur l'usine et la logistique. Sa stratégie logicielle, décrite par Zhang comme une plateforme à la Taobao où des développeurs tiers viendraient "ouvrir leur boutique" sur le socle matériel et de contrôle moteur LimX, vise à accélérer le déploiement d'applications verticales tout en collectant des données spécifiques à chaque scénario d'usage. Le tour Pre-IPO signale la confiance des investisseurs dans cette différenciation, sans que des pilotes commerciaux à grande échelle n'aient encore été confirmés publiquement.

Chine/AsieOpinion
1 source
Xiaomi déploie ses robots sur la chaîne de production automobile : opérations flexibles sur pièces réussies
1091Pandaily 

Xiaomi déploie ses robots sur la chaîne de production automobile : opérations flexibles sur pièces réussies

Xiaomi a déployé son robot humanoïde sur la ligne de production de la SU7, sa berline électrique, où il exécute désormais deux nouvelles tâches avec un taux de réussite supérieur à 90 % en fonctionnement continu, après seulement six mois d'entraînement en usine. La première consiste à trier des panneaux latéraux de console centrale, des pièces souples et de forme irrégulière extraites de bacs répartis sur trois rangées puis placées avec précision dans un support de fixation. Pour atteindre les pièces au fond d'un bac, le robot stabilise son centre de gravité en agrippant le bord du bac d'une main pendant qu'il tend l'autre, puis réalise plusieurs transferts main à main pour ajuster l'orientation de la pièce avant de la positionner ; en cas de résistance à la pose, il la retire, corrige l'angle et retente automatiquement. La seconde tâche, le pliage et le recyclage de cartons, exige d'ouvrir des loquets avec un contrôle fin de la force des doigts, de plier les boîtes à deux bras puis d'empiler et pousser les unités vers un poste cible, plusieurs robots coordonnant leur cadence avec celle de la chaîne. Six mois plus tôt, ce même robot se limitait à un poste unique de vissage d'écrous autotaraudeurs, avec une fiabilité annoncée de 98 %. Ces chiffres proviennent des communications de Xiaomi et n'ont pas été vérifiés de façon indépendante, ce qui invite à une certaine prudence sur leur portée réelle en conditions de production non filmées. Cette progression prend une dimension particulière face à la déclaration d'Elon Musk en janvier 2026, selon laquelle Optimus n'était pas encore capable d'un travail utile en usine. Que Xiaomi, acteur de l'électronique grand public sans passé industriel en robotique, affiche une trajectoire comparable à celle de Figure 03 chez BMW, référence actuelle du secteur pour le déploiement d'humanoïdes en usine, resserre l'écart perçu entre démonstration et exploitation réelle. La capacité du robot à détecter une résistance et à adapter son geste en cours d'opération, grâce à un retour de force proprioceptif, le distingue des robots industriels classiques, programmés pour des positions fixes et incapables de gérer un imprévu. Pour les intégrateurs et décideurs industriels, ce type de compliance active laisse entrevoir des robots capables de traiter des pièces souples et variables, un usage jusqu'ici hors de portée de l'automatisation rigide. Le robot avait été présenté pour la première fois en avril 2026 lors de la conférence investisseurs de Xiaomi, où il serrait des mains et distribuait des cadeaux, un registre purement social et démonstratif. Le passage en six mois vers des tâches industrielles à cadence de ligne s'inscrit dans une course mondiale aux humanoïdes de production où s'affrontent déjà Tesla avec Optimus, Figure avec son modèle 03 chez BMW, et les architectures VLA comme Pi-0 ou GR00T N2. Xiaomi ne détaille pas de calendrier de déploiement à plus grande échelle, mais la vitesse de cette itération fixe un repère agressif pour l'ensemble du secteur.

IndustrielOpinion
1 source
Clé du progrès des humanoïdes : gérer l'énergie derrière les robots
1092Robotics Business Review 

Clé du progrès des humanoïdes : gérer l'énergie derrière les robots

Murata Power Solutions présente, dans cet épisode du podcast Designing the Future animé par Jim Anderton, les défis d'ingénierie liés à l'alimentation électrique des robots humanoïdes. John Quinlan, Senior Engineering Manager chez Murata Power Solutions (Boston), y détaille pourquoi la gestion de l'énergie embarquée devient le facteur limitant des performances robotiques. Alors que la vitesse, la mobilité, la dextérité, la vision et les interfaces utilisateur des humanoïdes progressent à un rythme soutenu, avec des annonces quasi hebdomadaires dans le secteur, la conversion de l'énergie stockée en batteries ou en piles à combustible embarquées vers les formes utilisables par la mécatronique et l'électronique de contrôle reste un point de blocage physique incontournable. Murata y présente sa gamme de convertisseurs de puissance compacts et à haut rendement, couvrant un large spectre de besoins, des applications de faible puissance jusqu'aux systèmes de forte puissance, destinés aux marchés industriels, médicaux, des télécommunications et de l'information. Ce constat rappelle une réalité souvent éclipsée par les vitrines spectaculaires des démonstrations d'humanoïdes: la performance perçue d'un robot, qu'il s'agisse de sa vitesse de déplacement ou de la fluidité de ses gestes, dépend directement de l'efficacité de sa chaîne d'alimentation électrique. Pour les intégrateurs et décideurs industriels, ce rappel a une portée concrète: l'autonomie, le poids embarqué et la fiabilité thermique d'un humanoïde ne se jouent pas uniquement dans les algorithmes de contrôle moteur ou les modèles vision-langage-action, mais aussi dans des composants moins visibles comme les convertisseurs DC-DC et la gestion thermique de l'électronique de puissance. C'est un angle mort fréquent des comparatifs entre plateformes comme Figure 03, Optimus ou Atlas, qui se concentrent sur le payload, les degrés de liberté ou le temps de cycle sans détailler l'architecture énergétique sous-jacente. Ce format podcast s'inscrit dans une série éditoriale de The Robot Report consacrée aux coulisses techniques de la robotique, où des fournisseurs de composants critiques mais peu médiatisés, capteurs, actionneurs, systèmes d'alimentation, prennent la parole aux côtés des géants de l'humanoïde. Murata Power Solutions, filiale du groupe japonais Murata Manufacturing, est un acteur établi de longue date dans l'électronique de puissance pour environnements contraints, bien avant l'essor actuel des humanoïdes commerciaux. Aucune annonce de produit spécifique aux humanoïdes n'est faite ici: il s'agit d'un contenu de positionnement technique et commercial, destiné à installer Murata comme fournisseur de référence auprès des concepteurs de robots à mesure que la demande en solutions d'alimentation embarquée haute densité s'intensifie.

InfrastructureActu
1 source
NVIDIA explique comment évaluer les politiques robotiques polyvalentes en conditions réelles
1093Robotics Business Review 

NVIDIA explique comment évaluer les politiques robotiques polyvalentes en conditions réelles

NVIDIA a publié un billet technique détaillant les limites actuelles des méthodes d'évaluation des modèles fondation pour la robotique généraliste, ainsi que RoboLab, sa plateforme de benchmarking en simulation censée y répondre. L'entreprise identifie quatre failles structurelles dans les protocoles de test existants. D'abord, un chevauchement du domaine visuel entre entraînement et évaluation : quand un modèle est affiné puis testé dans le même environnement simulé, un bon score ne prouve que sa mémorisation du décor, pas sa capacité de généralisation. Les approches dites real2sim, qui reconstruisent des scènes photoréalistes à partir d'images réelles via inpainting ou Gaussian splatting, corrigent partiellement ce biais mais exigent souvent plus d'une heure de préparation par scène, ce qui rend les tests à grande échelle peu praticables. Ensuite, la plupart des benchmarks reposent sur un jeu de tâches figé, vite saturé : lorsque tous les modèles dépassent 90% de réussite sur le même test, les chiffres perdent leur pouvoir discriminant. NVIDIA pointe aussi un déficit de diagnostic, un simple score de succès binaire ne dit rien sur la cause d'un échec (confusion de couleur, formulation de l'instruction, décalage de caméra). Enfin, l'entreprise soulève un problème de fiabilité statistique : un taux de succès mesuré sur un petit nombre d'essais peut tromper. Exemple donné, une politique affichant 90% de réussite sur seulement 70 rollouts a, selon la méthode de Clopper-Pearson pour calculer un intervalle de confiance binomial exact, un intervalle de confiance à 95% qui s'étend sur 15,4 points de pourcentage, un écart énorme pour un chiffre présenté comme une performance unique. L'exemple illustratif porte sur la politique pi-0.5 de Physical Intelligence testée sur une tâche de tri d'objets ("poser la tasse à mesurer orange et la tasse bleue en dehors de l'assiette"). Pour les intégrateurs et décideurs B2B qui doivent choisir entre plusieurs modèles vision-language-action (VLA) pour équiper des bras ou des humanoïdes, ce travail est une mise en garde directe contre les chiffres de communiqués de presse. Un score de succès affiché sans intervalle de confiance ni contrôle du chevauchement visuel peut masquer un simple surapprentissage plutôt qu'une réelle capacité de généralisation en conditions réelles. Cela renforce l'hypothèse, déjà répandue dans le secteur, d'un écart persistant entre démonstrations et déploiement effectif, et invite à exiger des fournisseurs des protocoles d'évaluation reproductibles plutôt que des vidéos sélectionnées. Cette initiative s'inscrit dans l'effort plus large de NVIDIA autour des fondations robotiques, aux côtés de ses plateformes Isaac Sim et Isaac Lab, dans un secteur où rivalisent des laboratoires comme Physical Intelligence (pi-0, pi-0.5), Google DeepMind (Gemini Robotics) ou Figure AI. À mesure que les modèles VLA généralistes se multiplient, la question de la mesure standardisée devient centrale pour départager annonces marketing et progrès réels, et RoboLab se positionne comme une tentative de fournir un cadre commun avant que le marché ne soit inondé de comparatifs invérifiables.

IA physiquePaper
1 source
Boston Dynamics teste des "chiens robots" pour les livraisons
1094The Verge 

Boston Dynamics teste des "chiens robots" pour les livraisons

Boston Dynamics teste actuellement un nouvel accessoire de type tapis roulant fixé sur son robot quadrupède Spot, permettant de transporter des colis directement depuis un véhicule de livraison jusqu'au pas de la porte d'un client, de façon autonome. L'objectif affiché est de réduire la charge de travail des livreurs humains sur le dernier segment du trajet, celui qui va du camion à l'entrée du domicile. Le dispositif a été présenté via une vidéo de démonstration, sans précision sur le payload maximal, l'autonomie ou un calendrier de déploiement commercial. Spot est déjà utilisé pour des inspections industrielles répétitives en usine et a notamment servi à patrouiller sur le site archéologique de Pompéi. Cette expérimentation illustre une limite persistante de l'automatisation de la livraison du dernier kilomètre. Les robots à roues et les drones aériens peinent à franchir des obstacles courants comme des escaliers, des trottoirs encombrés ou des accès non standardisés, un terrain où la locomotion à pattes de Spot pourrait offrir un avantage réel. Pour les intégrateurs et les acteurs de la logistique, ce test reste toutefois à un stade de démonstration et ne prouve pas encore une viabilité économique ou opérationnelle à grande échelle. Boston Dynamics, racheté par Hyundai en 2021, a construit la réputation de Spot sur des usages B2B établis: inspection de sites industriels, surveillance de chantiers, cartographie. L'entreprise explore ici un nouveau marché face à des concurrents comme les drones de livraison ou les robots à roues déployés par des acteurs de la logistique urbaine. Aucun pilote commercial ni partenaire de livraison n'a pour l'instant été annoncé.

IA physiqueActu
1 source
IA incarnée : le MIT forme des robots grâce à des environnements virtuels 3D réalistes
1095Interesting Engineering 

IA incarnée : le MIT forme des robots grâce à des environnements virtuels 3D réalistes

Des chercheurs du MIT ont dévoilé SceneSmith, un système d'intelligence artificielle capable de générer automatiquement des environnements intérieurs 3D réalistes pour entraîner des robots. La plateforme s'appuie sur trois agents IA complémentaires fonctionnant en boucle: un "designer" qui construit la disposition de la pièce et place meubles et objets, un "critique" qui vérifie le réalisme de la scène et signale les incohérences (un objet qui n'a rien à faire dans cette pièce, par exemple), et un "orchestrateur" qui pilote l'ensemble du processus et décide quand la scène est terminée ou doit être révisée. Ces agents s'appuient sur GPT-5.2, le modèle vision-langage d'OpenAI, pour comprendre comment les espaces réels sont agencés. Un utilisateur peut simplement décrire une pièce en langage naturel, par exemple un garage avec voiture, établi, pneus empilés et échelle contre le mur, et SceneSmith en génère une version virtuelle détaillée. L'équipe a produit plus de 1300 environnements virtuels (cuisines, hôtels, bureaux, commerces, espaces à thème), dans lesquels des robots se sont entraînés à des tâches domestiques courantes: poser des fruits sur une assiette, déplacer des canettes entre étagères et table, ouvrir des placards, ranger des tasses dans un évier. Sur 100 environnements testés, un agent IA a évalué la réussite des tâches, avec un taux d'accord de plus de 99% avec des évaluateurs humains. Une étude auprès de plus de 200 personnes a montré que plus de 90% jugeaient les scènes de SceneSmith plus réalistes que celles produites par les méthodes précédentes, avec jusqu'à six fois plus d'objets interactifs par scène. L'enjeu central que vise SceneSmith est le principal goulot d'étranglement de la robotique actuelle: contrairement aux chatbots qui apprennent sur du texte, les robots ont besoin de données d'interaction physique variées, coûteuses et lentes à collecter en conditions réelles. En automatisant la création de mondes virtuels riches et crédibles, le MIT cherche à réduire cette dépendance aux essais physiques tout en accélérant l'itération sur les stratégies de contrôle. Le test le plus révélateur reste celui d'un contrôleur robotique entraîné principalement sur des données réelles, qui a réussi des tâches (saisir une pomme dans un bol, la poser sur une planche à découper) dans des environnements SceneSmith qu'il n'avait jamais vus, un indice de transfert sim-to-real qui intéressera directement intégrateurs et équipes R&D cherchant à réduire les coûts de collecte terrain. Le projet s'inscrit dans la course plus large à la génération de données synthétiques pour la robotique, où plusieurs laboratoires tentent de contourner la rareté des données physiques réelles. Le MIT ne communique pas, à ce stade, de calendrier de déploiement commercial ni de partenariat industriel annoncé: il s'agit d'une publication de recherche, présentée via un communiqué de l'équipe, dont l'ampleur des bénéfices en conditions réelles de production reste à confirmer au-delà des tests en laboratoire.

RecherchePaper
1 source
Muscles fibreux pour la robotique humanoïde
1096Hackaday Robots Hacks 

Muscles fibreux pour la robotique humanoïde

Des muscles fibreux électrofluidiques pour l'actionnement robotique Les actionneurs robotiques classiques reposent sur des moteurs couplés à des réducteurs ou des systèmes de liaisons pour transformer un mouvement rotatif en mouvement utile, une approche peu adaptée à la reproduction de mouvements humains fluides. Face à cette limite, plusieurs équipes se sont tournées vers l'actionnement pneumatique, sans obtenir jusqu'ici de résultats vraiment convaincants. Une nouvelle piste, baptisée "Electrofluidic Fiber Muscles" (muscles à fibres électrofluidiques), propose une alternative: un faible courant sous haute tension génère un gradient de pression à l'intérieur d'un long tube, ce qui provoque sa contraction, à la manière d'une fibre musculaire. Ce tube peut être associé à un second, monté en configuration extenseur/fléchisseur, reproduisant ainsi le fonctionnement d'une paire de muscles biologiques antagonistes. Particularité notable: la pompe qui génère la pression motrice peut elle-même être enroulée directement autour des fibres, formant un ensemble compact et intégré, sans nécessiter de source de pression externe volumineuse comme c'est le cas pour les actionneurs pneumatiques classiques. Cette approche s'inscrit dans une recherche plus large de solutions d'actionnement légères, compactes et compliantes pour la robotique humanoïde, où les moteurs et réducteurs traditionnels restent lourds, rigides et énergivores. Si elle tient ses promesses, l'intégration directe de la pompe dans la structure fibreuse pourrait réduire l'encombrement et le poids des systèmes actionneurs, un enjeu central pour les concepteurs de robots à mouvements humains. Il s'agit toutefois pour l'instant d'un concept au stade expérimental, loin d'un produit commercialisé ou déployé à grande échelle: aucune donnée sur l'endurance, la force générée ou le coût de fabrication n'est encore disponible. Ce développement s'ajoute à la longue lignée d'expérimentations autour des muscles artificiels, des systèmes pneumatiques de type McKibben aux approches électroactives plus récentes, qui cherchent toutes à s'affranchir des limites mécaniques des moteurs classiques. Les auteurs eux-mêmes tempèrent l'enthousiasme: il faudra encore du temps avant de voir cette technologie équiper des robots grand public ou même des plateformes de hobbyistes.

RecherchePaper
1 source
Vidéo : le nouveau robot humanoïde chinois combine contrôle corps entier et puce Nvidia Thor
1097Interesting Engineering 

Vidéo : le nouveau robot humanoïde chinois combine contrôle corps entier et puce Nvidia Thor

Booster Robotics, start-up chinoise de robotique, a dévoilé le Booster T2, une nouvelle plateforme humanoïde destinée à la fois à la recherche en IA incarnée et à des applications industrielles réelles. La version T2 Pro embarque la puce Nvidia Thor T5000, annoncée jusqu'à 2 070 TFLOPS de calcul embarqué pour la perception, la planification et le contrôle en temps réel. Le robot mesure environ 1,4 mètre et pèse entre 43 et 94,7 livres selon la configuration matérielle, avec 31 degrés de liberté répartis en six articulations par jambe, sept par bras, trois au niveau du bassin et deux à la tête. Il peut porter jusqu'à 10 kg à deux bras, avec un couple articulaire maximal de 140 Nm, et existe en trois configurations : effecteur optionnel, pince standard, ou main dextre à 6 degrés de liberté pour des tâches de manipulation avancées. Côté perception, le T2 embarque des caméras binoculaires à la tête et à la taille, complétées par des caméras de poignet sur les versions haut de gamme, un réseau de microphones, des haut-parleurs et un LiDAR optionnel. Sa batterie de 48V/10Ah offre jusqu'à deux heures de marche continue à une vitesse maximale de 2 m/s. Parallèlement, Booster Robotics lance Booster Studio, une plateforme logicielle ouverte couvrant simulation, entraînement de politiques et déploiement sur robot réel, avec un support pour les modèles vision-langage-action (VLA), l'apprentissage par renforcement et l'apprentissage par imitation. L'enjeu principal tient au calcul embarqué : en réduisant la dépendance à une puissance de calcul externe, Booster mise sur une boucle perception-décision-action autonome, un point de friction classique pour les intégrateurs qui cherchent des robots déployables hors laboratoire. Booster Studio répond quant à lui directement au problème du "sim-to-real", souvent cité comme l'un des principaux goulots d'étranglement de la robotique incarnée actuelle. La vidéo de démonstration montrant chutes récupérées, sauts et coordination dynamique doit toutefois être lue avec prudence : ce type de séquence est généralement sélectionné et ne garantit pas une fiabilité en conditions réelles non contrôlées. Un signal plus solide vient du terrain de compétition : l'équipe THU Huoshen de l'université Tsinghua a conservé son titre à la RoboCup 2026 Humanoid League en Corée du Sud avec le précédent modèle Booster T1, confirmant une certaine maturité de la plateforme dans des contextes dynamiques non scénarisés. Booster T1 s'était déjà imposé comme référence académique low-cost dans les cercles de recherche et de compétition robotique. Le T2 vise à élargir cette base vers des usages commerciaux et industriels, en misant sur une approche ouverte et modulaire plutôt que sur un produit intégré verticalement, à la différence d'acteurs comme Tesla (Optimus) ou Figure. Il vient également se positionner face à Unitree, autre constructeur chinois disputant le même segment des plateformes humanoïdes accessibles aux développeurs. Aucun acteur français ou européen n'est mentionné dans cette annonce.

Chine/AsieActu
1 source
JD.com se lance dans l'IA incarnée : construction de la première usine de robots RoboBase à Guangzhou
1098Pandaily 

JD.com se lance dans l'IA incarnée : construction de la première usine de robots RoboBase à Guangzhou

JD.com a posé la première pierre de son site "Robot Base" à Guangzhou, marquant l'entrée officielle du géant chinois du e-commerce dans l'IA incarnée (embodied AI). L'investissement, estimé à environ 1 milliard de RMB, doit être achevé en 2028 pour une pleine production visée en 2030, avec une valeur de production annuelle projetée à 1,75 milliard de RMB. Le site accueillera des acteurs de l'IA incarnée, de la robotique industrielle et de service, ainsi que des entreprises de la chaîne d'approvisionnement amont et aval. Le fondateur Richard Liu a annoncé un plan de plus de 80 sites RoboBase à travers le pays, tandis que la filiale JD Logistics prévoit d'acquérir 3 millions de robots, 1 million de véhicules autonomes et 100 000 drones sur cinq ans pour automatiser l'ensemble de sa chaîne logistique, de l'entreposage à la livraison du dernier kilomètre. Les partenaires du site de Guangzhou incluent Zhiyuan Robot, Leju Robot, Qingtong Vision et GAC Huilun Technology. JD.com ne fabrique pas de robots lui-même mais se positionne comme orchestrateur de plateforme, un choix stratégique qui mérite d'être souligné plutôt que pris pour argent comptant. L'entreprise met en avant quatre leviers : l'intégration à son écosystème de distribution pour réduire les coûts et donner accès au marché, ses modèles open-source et centres de collecte de données à grande échelle, des terrains de test réels via ses magasins JD MALL, parcs logistiques et pharmacies, et enfin un accès au capital via ses fonds d'investissement et JD Finance. Ce modèle répond directement aux trois blocages classiques du secteur robotique identifiés par l'industrie : l'absence de scénarios de déploiement réels, l'absence de canaux de vente stables, et le manque de capital de développement soutenu. La déclaration selon laquelle Songyan Power aurait vendu plus de 500 robots en deux jours sur la plateforme JD reste toutefois un chiffre communiqué par JD lui-même, sans vérification indépendante, et JD vise 10 milliards de RMB de ventes de robots sur sa plateforme cette année, avec l'objectif de faire dépasser 1 milliard de RMB de ventes à une centaine de marques d'ici trois ans. JD investit dans des startups de robotique incarnée depuis 2025, dont LimX Dynamics (locomotion humanoïde), Zhiyuan Robot (robots humanoïdes généralistes), Zhongqing Robot, Pasini et RoboScience. Le directeur des opérations de Zhiyuan Robot a confirmé que des robots de l'entreprise sont déjà déployés dans des stations de métro de Guangzhou, dans le cadre d'une coentreprise avec l'opérateur local. JD s'attaque aussi au service après-vente, un angle mort classique du secteur, en s'appuyant sur son réseau JD Service+ de plusieurs milliers de techniciens formés pour bâtir un maillage national de maintenance. Le 11 juillet, le gouvernement provincial du Guangdong a signé un accord stratégique global avec le groupe JD couvrant l'économie numérique, la logistique intelligente et la fabrication robotique, signe d'un soutien politique appuyé à ce modèle de plateforme au moment où le secteur robotique chinois cherche à transformer ses démonstrations technologiques en déploiements commerciaux réels.

Chine/AsieOpinion
1 source
Pense quand c'est important : raisonnement VLM conditionnel pour la navigation sociale avec des politiques RL
1099arXiv cs.RO 

Pense quand c'est important : raisonnement VLM conditionnel pour la navigation sociale avec des politiques RL

Le laboratoire à l'origine de ce papier arXiv (référence 2607.10991v1) présente HUMA, une architecture hybride de navigation sociale pour robots mobiles qui combine une politique d'apprentissage par renforcement (RL) avec un modèle vision-langage (VLM). Le principe : la politique RL, rapide et réactive, gère les déplacements courants à faible densité humaine, tandis qu'un VLM post-entraîné prend le relais uniquement quand une personne entre dans la zone de proximité sensible du robot. Évalué sur les benchmarks Social-MP3D et Social-HM3D, HUMA améliore le taux de réussite des tâches de 20% et 3% respectivement par rapport aux meilleures méthodes existantes, tout en réduisant significativement les violations d'espace personnel et les collisions avec des humains. Le système a aussi été testé en conditions réelles sur le robot mobile Mirokaï, conçu par la start-up française Enchanted Tools. Cette approche répond à un compromis central dans la navigation sociale robotique : les politiques RL sont rapides mais peinent à généraliser à des scénarios sociaux complexes, tandis que les VLM offrent un raisonnement sémantique plus fin mais restent trop lents pour un déploiement temps réel. En activant le VLM seulement de façon conditionnelle, HUMA évite l'écueil du tout-VLM (latence, coût de calcul) sans sacrifier la finesse de compréhension sociale dans les moments qui comptent le plus, c'est-à-dire l'interaction rapprochée avec des humains. Pour les intégrateurs et décideurs déployant des robots de service en environnement partagé (hôpitaux, bureaux, commerces), cela suggère une voie concrète pour rendre les VLM exploitables en production sans réécrire toute la pile de contrôle. Le travail s'inscrit dans la tendance récente consistant à substituer ou hybrider les VLM aux politiques RL classiques pour améliorer le raisonnement sémantique en navigation, une piste explorée notamment par des architectures VLA comme Pi-0 ou GR00T N2 dans d'autres contextes robotiques. Les auteurs ont mené des études d'ablation détaillées pour valider chaque composant architectural, et la démonstration sur Mirokaï, robot déployé par Enchanted Tools, ancre l'approche au-delà de la simulation, dans un cas d'usage réel de robot d'accueil et d'assistance en environnement humain.

FR/EU ecosystemePaper
1 source
Xiaomi-Robotics-U0 : synthèse incarnée unifiée avec modèle fondation du monde
1100arXiv cs.RO 

Xiaomi-Robotics-U0 : synthèse incarnée unifiée avec modèle fondation du monde

Xiaomi Robotics a publié U0, un modèle multimodal autorégressif de 38 milliards de paramètres conçu pour unifier plusieurs tâches de génération liées à la robotique au sein d'un seul système. Décrit dans un article déposé sur arXiv, U0 traite la synthèse de contenus "incarnés" comme une extension directe des modèles de génération d'images et de vidéos fondationnels, en optimisant conjointement le texte-vers-image, l'édition d'images, la génération de scènes incarnées, le transfert incarné et la génération vidéo incarnée. Selon les auteurs, il s'agit du premier modèle capable de générer des scènes cohérentes en multi-vues pour plusieurs types de robots différents, et il introduit un mécanisme de transfert structuré et contrôlable permettant une édition fine tout en préservant la cohérence géométrique et la dynamique d'interaction. Les résultats rapportés indiquent que U0 dépasse GPT-Image-2.0 lors d'évaluations humaines sur la génération et le transfert de scènes incarnées, se classe premier sur le classement World Arena pour la génération vidéo incarnée, et fait passer le taux de succès hors distribution du modèle de manipulation pi0.5 de 36,9% à 63,2% sur des tâches de manipulation réelle jugées difficiles. Le code et les checkpoints sont mis à disposition sur le site de Xiaomi Robotics. L'enjeu principal ne se situe pas dans la démonstration visuelle mais dans l'usage de U0 comme moteur de données synthétiques pour l'entraînement de politiques robotiques. Le gain mesuré sur pi0.5, un modèle vision-langage-action tiers développé par Physical Intelligence, est le point le plus significatif: il suggère qu'un monde fondationnel bien conçu peut générer des données d'entraînement suffisamment réalistes pour améliorer la généralisation d'un VLA existant sur des tâches de manipulation réelles, et pas seulement sur des métriques internes. C'est une piste concrète pour réduire l'écart simulation-vers-réel qui freine encore le déploiement à grande échelle des robots humanoïdes et bras manipulateurs, en offrant une alternative à la collecte coûteuse de données physiques. Le travail part d'un constat classique dans le secteur: adapter un modèle fondationnel pré-entraîné avec des données robotiques limitées tend à dégrader les connaissances visuelles acquises lors du pré-entraînement à grande échelle. U0 cherche à préserver cette généralisation tout en l'adaptant aux contraintes des embodiments robotiques. Il se positionne face à des approches comme GR00T N2 de NVIDIA ou les modèles Pi de Physical Intelligence, dans une course où Xiaomi investit désormais explicitement la recherche en IA incarnée. Pour l'instant, la publication reste au stade recherche: code et poids sont ouverts, mais aucun déploiement produit ni pilote industriel n'est annoncé.

IA physiqueOpinion
1 source