Aller au contenu principal

Actualités robotique — page 77

4 531 articles au fil, du plus récent au plus ancien.

ForceFlow : apprendre à ressentir et agir grâce à l'apprentissage par flux guidé par le contact
3801arXiv cs.RO 

ForceFlow : apprendre à ressentir et agir grâce à l'apprentissage par flux guidé par le contact

Des chercheurs ont publié en mai 2026 sur arXiv (2605.11048) ForceFlow, un framework d'apprentissage par imitation pour la manipulation robotique en contact riche, construit sur le flow matching et l'intégration native du retour de force. L'architecture adopte une fusion multimodale asymétrique où le signal force/couple joue le rôle de régulateur global de la politique, couplé à un paradigme de prédiction jointe exploitant force instantanée et historique de mouvement. La décomposition de tâche s'articule en deux phases : une approche pilotée par un VLM (localisation de cible par pointage visuel), puis un contact piloté par la force, reliées par un mécanisme Vision-to-Force (V2F) qui découple explicitement généralisation spatiale et régulation de contact. Sur six tâches réelles à contact riche, ForceFlow dépasse de 37 points de pourcentage le taux de succès de ForceVLA, le baseline de référence, à coût déclaré inférieur, et démontre une généralisation zero-shot hors distribution (OOD). L'apport principal n'est pas l'ajout d'un capteur force mais sa position architecturale : traiter le signal F/T comme régulateur global (et non comme entrée supplémentaire simplement concaténée) améliore significativement la robustesse en généralisation. Le mécanisme V2F est la clé de voûte en séparant la représentation de l'espace de travail, apprise par vision, de la régulation de contact pilotée par force, ce qui réduit le couplage entre les deux sources d'erreur. La démonstration zero-shot OOD est crédible architecturalement, même si l'abstract ne livre pas les taux de succès absolus du baseline ForceVLA ni le détail des conditions expérimentales, ce qui rend les 37 % d'amélioration relative difficiles à pleinement contextualiser. Ce travail prolonge le courant hybride vision-force apparu dans le sillage de Pi-0 (Physical Intelligence, octobre 2024), qui a popularisé le flow matching pour les politiques robotiques à manipulation dextre. ForceVLA constitue le concurrent direct ; d'autres approches comparables incluent Diffusion Policy avec capteurs F/T et les variantes d'ACT augmentées force. L'institution des auteurs n'est pas identifiable dans le résumé publié, et le preprint n'a pas encore été soumis à peer review. Les prochaines étapes naturelles seraient la mise à disposition du code source et une validation sur plateformes hardware standardisées (Franka, UR5) pour confirmer la reproductibilité des résultats annoncés.

IA physiqueOpinion
1 source
SI-Diff : cadre d'apprentissage pour la recherche et l'insertion haute précision par diffusion dans le domaine des forces
3802arXiv cs.RO 

SI-Diff : cadre d'apprentissage pour la recherche et l'insertion haute précision par diffusion dans le domaine des forces

Des chercheurs ont publié en mai 2025 sur arXiv (2605.12247) SI-Diff, un framework d'apprentissage par imitation qui traite dans un seul modèle les deux phases de l'assemblage de précision : la recherche de position (search) et l'insertion proprement dite (high-precision insertion). Le système repose sur une politique de diffusion opérant dans le domaine des forces, couplée à un mécanisme de conditionnement par mode qui permet au réseau de distinguer les deux comportements d'action sans changer de poids ni de modèle. Un policy enseignant (teacher policy) génère en amont des trajectoires diversifiées, dont les démonstrations réussies et efficaces servent à l'entraînement supervisé. À l'inférence, le modèle prend en entrée les retours tactiles et la vitesse de l'effecteur terminal pour produire les commandes motrices. Résultat clé annoncé : SI-Diff tolère des désalignements x-y allant jusqu'à 5 mm, contre 2 mm pour TacDiffusion, le baseline état de l'art, et démontre un transfert zéro-shot sur des géométries non vues à l'entraînement. Ce résultat mérite attention pour les intégrateurs industriels, car le principal frein au déploiement de l'assemblage robotisé de précision n'est pas la vitesse mais la robustesse aux incertitudes de pose, tolérances d'usinage, variabilité du picking, dérive thermique. Passer de 2 à 5 mm de tolérance sans recalibration ni modèle supplémentaire est un écart opérationnellement significatif sur une ligne de production réelle. Le choix du domaine force plutôt que vision pure pour la politique est aussi un signal : là où les VLA visuelles peinent sur les contacts sub-millimétrique, le retour tactile reste le vecteur le plus direct pour les tâches peg-in-hole. La transférabilité zéro-shot, si elle se confirme hors conditions de labo, réduit le coût de reconfiguration lors des changements de référence produit. Le paper se positionne explicitement contre TacDiffusion (2024), qui reste la référence académique sur l'insertion tactile par diffusion. Plus largement, il s'inscrit dans la vague des politiques de diffusion pour la manipulation de contact, popularisées notamment par les travaux de Physical Intelligence (Pi-0) et les frameworks ouverts issus de Columbia et Stanford. Le peg-in-hole est un benchmark historique de la robotique d'assemblage, présent depuis les travaux de Nevins et Whitney dans les années 1970, ce qui rend les comparaisons directes interprétables. Il s'agit pour l'instant d'un résultat de recherche (preprint, pas encore évalué en peer review), sans déploiement industriel annoncé ni partenariat commercial mentionné. Les prochaines étapes naturelles seraient une validation sur cellule d'assemblage réelle multi-référence et une comparaison avec des approches hybrides force-vision.

IndustrielPaper
1 source
GuidedVLA : spécialisation de l'attention pour cibler les facteurs pertinents d'une tâche dans les modèles VLA
3803arXiv cs.RO 

GuidedVLA : spécialisation de l'attention pour cibler les facteurs pertinents d'une tâche dans les modèles VLA

Une équipe de chercheurs propose GuidedVLA, un cadre d'entraînement conçu pour améliorer la robustesse des modèles Vision-Language-Action (VLA) en robotique de manipulation. Publiée sur arXiv (2605.12369) en mai 2026, l'approche repose sur une décomposition fonctionnelle du décodeur d'actions : plutôt que de laisser un bloc monolithique apprendre implicitement ce qui est pertinent dans une scène, GuidedVLA affecte des têtes d'attention spécialisées à des facteurs explicitement définis. Dans cette première instanciation, trois têtes distinctes supervisent respectivement la localisation d'objets (object grounding), la géométrie spatiale, et la logique temporelle des compétences motrices. Les expériences menées en simulation et sur robot réel montrent des gains de taux de réussite aussi bien en conditions connues (in-domain) qu'en conditions non vues lors de l'entraînement (out-of-domain), par rapport à des baselines VLA existantes, sans que les auteurs ne publient de chiffres agrégés dans l'abstract. L'enjeu industriel est direct : les VLA actuels souffrent d'un problème bien documenté de surapprentissage sur des corrélations parasites, raccourcis visuels, bruit de fond, artefacts de jeu de données. Ce phénomène est l'une des causes principales de l'écart démo-réalité qui freine le déploiement en production. En forçant les têtes d'attention à capturer des représentations découplées et sémantiquement définies, GuidedVLA propose une voie vers un meilleur transfert sim-to-real. L'amélioration out-of-domain est particulièrement significative pour les intégrateurs et décideurs industriels : elle indique que le modèle généralise au-delà de ses données d'entraînement, condition nécessaire à tout déploiement en environnement non contrôlé. Les VLA ont émergé dans le sillage des grands modèles de langage, avec des jalons comme RT-2 de Google DeepMind en 2023, puis OpenVLA, Pi-0 de Physical Intelligence et GR00T N2 de NVIDIA, toutes des architectures qui alignent l'action robotique comme une modalité dans des VLMs pré-entraînés, en pariant que la supervision de bout en bout suffit à isoler les bons facteurs. GuidedVLA remet en question ce pari en injectant de la structure explicite dans le décodeur, une direction qui rejoint certains travaux sur les politiques hiérarchiques. L'architecture se veut plug-and-play, ouvrant la voie à une intégration dans des VLA existants. Le papier reste à ce stade un preprint académique sans annonce de déploiement industriel ni partenariat commercial identifié.

IA physiqueOpinion
1 source
Estimation de scènes encombrées prêtes pour la simulation par optimisation conjointe de forme et de pose intégrant la physique
3804arXiv cs.RO 

Estimation de scènes encombrées prêtes pour la simulation par optimisation conjointe de forme et de pose intégrant la physique

Une équipe de chercheurs publie sur arXiv (réf. 2602.20150, v2, février 2026) SPARCS, un pipeline de reconstruction de scènes directement exploitables en simulation physique à partir d'observations réelles. Le système estime simultanément la forme géométrique et la pose de plusieurs objets rigides en interaction, dans des environnements encombrés comportant jusqu'à cinq objets représentés par 22 enveloppes convexes. Deux contributions techniques distinguent l'approche : un modèle de contact à différentiabilité de forme globale permettant l'optimisation conjointe géométrie-pose tout en modélisant les contacts inter-objets, et un solveur linéaire exploitant la sparsité structurée du Hessien Lagrangien augmenté, dont le coût de calcul croît favorablement avec la complexité de la scène. Le pipeline complet enchaîne initialisation par réseau de neurones, optimisation physique contrainte et raffinement différentiable des textures. L'intérêt industriel est direct : les pipelines d'apprentissage de politiques robotiques, qu'ils reposent sur l'imitation learning ou le reinforcement learning, sont freinés par la rareté de scènes simulées physiquement cohérentes. Générer automatiquement ces scènes à partir du réel réduit le fossé real-to-sim qui fragilise ensuite le transfert sim-to-real. Là où les méthodes existantes échouent dans les environnements denses (coût computationnel prohibitif, robustesse insuffisante, portée limitée à un seul objet), SPARCS traite plusieurs objets en contact simultané. Pour un intégrateur développant des systèmes de manipulation ou un laboratoire travaillant sur des robots humanoïdes, cela ouvre une voie crédible vers la génération automatique de données d'entraînement directement issues de scènes réelles. Le domaine real-to-sim est en forte expansion depuis 2023, principalement tiré par l'entraînement de modèles vision-action (VLA) comme pi0 (Physical Intelligence) ou GR00T N2 (NVIDIA). Les approches concurrentes telles que BundleSDF (Meta / University of Washington) privilégient la reconstruction 6-DoF d'objets inconnus, tandis que les méthodes NeRF et 3D Gaussian Splatting maximisent la fidélité visuelle sans garanties physiques. SPARCS se différencie par son orientation explicitement "simulation-ready" : les scènes produites sont directement injectables dans des simulateurs comme MuJoCo ou Isaac Sim. Aucun partenariat industriel ni calendrier de déploiement n'est mentionné dans la publication ; il s'agit d'une contribution académique sans produit commercial annoncé.

RecherchePaper
1 source
Téléopération en temps réel d'un robot humanoïde par capture de mouvement IMU avec validation sim-vers-réel
3805arXiv cs.RO 

Téléopération en temps réel d'un robot humanoïde par capture de mouvement IMU avec validation sim-vers-réel

Une équipe de recherche a publié en mai 2026 un système complet de téléopération whole-body en temps réel pour robot humanoïde, décrit dans un préprint arXiv (2605.12347). Le système capture les mouvements d'un opérateur via une combinaison Virdyn à centrales inertielles (IMU full-body), puis les retransmet en continu sur un robot Unitree G1. Le pipeline de retargeting cinématique et de contrôle fonctionne sans tampon offline ni composant d'apprentissage automatique. La validation s'est déroulée en deux étapes : d'abord en simulation via le modèle MuJoCo du G1 (sim2sim), puis déployé sans aucune modification sur le robot physique (sim2real). Le répertoire de mouvements reproduits couvre la marche, la station debout, la position assise, les rotations, les courbettes et des gestes expressifs coordonnés de tout le corps. Le résultat le plus significatif est le transfert sim-to-real sans recalibration, un point d'échec classique où les paramètres calibrés en simulation s'effondrent face aux frictions réelles, aux latences de communication et aux erreurs de modèle. L'absence de composant d'apprentissage automatique rend le système déterministe et auditable, un argument concret pour les intégrateurs industriels ou les labos qui constituents des datasets de téléopération pour l'imitation learning. L'utilisation de matériel grand public (la combinaison Virdyn est commercialement disponible) plutôt qu'un système de mocap optique type Vicon abaisse significativement le ticket d'entrée pour construire des pipelines de collecte de démonstrations. La limitation est symétrique : sans apprentissage, l'adaptabilité à des morphologies très différentes reste contrainte par le retargeting cinématique. Le Unitree G1 est un humanoïde d'entrée de gamme commercialisé depuis 2024 autour de 16 000 dollars, ciblant explicitement la recherche et les démos industrielles. La téléopération whole-body est devenue un axe central de la course aux données pour les systèmes humanoïdes : Physical Intelligence (Pi-0), Figure et 1X s'appuient tous sur des démonstrations téléopérées pour entraîner leurs politiques. Sur l'approche IMU appliquée aux humanoïdes, des travaux similaires ont été publiés par des équipes chinoises sur le Booster T1 et l'Unitree H1. Ce préprint ne mentionne aucun déploiement industriel ni partenariat commercial, c'est une contribution académique de validation de concept, pas un produit expédié.

RecherchePaper
1 source
DreamPolicy : une politique basée sur un modèle du monde unifié pour la locomotion des robots humanoïdes à grande échelle
3806arXiv cs.RO 

DreamPolicy : une politique basée sur un modèle du monde unifié pour la locomotion des robots humanoïdes à grande échelle

Des chercheurs ont publié DreamPolicy (arXiv:2505.18780, mai 2025), un cadre de locomotion humanoïde conçu pour maîtriser des terrains variés avec une seule politique de contrôle. Son composant central est un modèle du monde à diffusion autorégressive, entraîné sur des trajectoires agrégées issues de plusieurs politiques spécialisées par type de terrain. Ce modèle génère des trajectoires futures physiquement plausibles qui guident une politique conditionnée, sans ingénierie manuelle des fonctions de récompense. En simulation, DreamPolicy surpasse la meilleure baseline de 27% sur des terrains composites jamais vus à l'entraînement, et de 38% sur des terrains combinés. Le framework est conçu pour scaler avec la taille du dataset offline: plus les données s'accumulent, plus le modèle de diffusion acquiert de compétences locomotrices. La contribution principale est de rompre le verrou "une tâche, une politique" qui freine les systèmes humanoïdes actuels. Les méthodes dominantes reposent sur la distillation de politiques enseignantes spécialisées en une politique étudiante unifiée; ce paradigme capture des primitives de base mais échoue à les composer organiquement face à des environnements composites hors distribution. DreamPolicy y substitue un modèle du monde qui capture des compétences locomotrices généralisables, autorisant un transfert zero-shot vers des terrains inédits. Il convient néanmoins de nuancer: les gains relatifs annoncés (27%, 38%) sont mesurés en simulation uniquement, sans détail sur les taux absolus de succès ni les conditions précises des benchmarks, ce qui limite les comparaisons directes avec d'autres systèmes publiés. Ce travail s'inscrit dans une tendance portée par DreamerV3 (Google DeepMind) et le RL model-based, ici appliquée à la locomotion humanoïde scalable. Figure, Agility Robotics (Amazon), Unitree, Apptronik et Boston Dynamics se livrent une course intensive sur ce segment; en Europe, Wandercraft (France) travaille sur la locomotion bipeède thérapeutique et Enchanted Tools sur des humanoïdes de service. DreamPolicy reste une contribution de recherche pure: aucun déploiement hardware ni partenariat industriel n'est mentionné. La validation sur robot physique constitue l'étape suivante naturelle, avec les défis de sim-to-real gap que les approches à diffusion n'ont pas encore pleinement résolus à grande échelle.

RecherchePaper
1 source
Diffusion coordonnée : générer des comportements multi-agents sans démonstrations multi-agents
3807arXiv cs.RO 

Diffusion coordonnée : générer des comportements multi-agents sans démonstrations multi-agents

Une équipe de chercheurs publie sur arXiv (réf. 2605.11485, mai 2026) CoDi (Coordinated Diffusion), un cadre d'apprentissage par imitation qui permet à plusieurs robots de se coordonner en n'utilisant que des données mono-agent. La méthode entraîne indépendamment une politique de diffusion par agent, puis les couple à l'inférence via une fonction de coût définie par l'utilisateur. Mathématiquement, le score de diffusion se décompose en politiques individuelles pré-entraînées auxquelles s'ajoute un terme de guidage piloté par le coût. Ce terme s'estime sans calcul de gradient, rendant CoDi applicable à des fonctions boîte noire non différentiables, sans ré-entraînement ni données coordonnées supplémentaires. Les validations couvrent des simulations et un banc matériel réel de manipulation bimanuelle à deux bras. Le verrou central adressé est l'explosion combinatoire des données : l'espace état-action d'un système multi-agent croît exponentiellement avec le nombre d'agents, rendant la collecte de démonstrations coordonnées prohibitivement coûteuse. CoDi contourne ce problème en réutilisant des démonstrations mono-agent, plus accessibles, et surpasse des baselines multi-agents classiques en efficacité de données. Pour un intégrateur déployant deux bras en coopération, cela représente une réduction potentiellement significative de la charge de télé-opération. L'indépendance vis-à-vis de la différentiabilité du coût élargit également l'applicabilité à des contraintes de sécurité ou opérationnelles arbitraires. L'abstract ne communique cependant pas de métriques précises de taux de succès ni de temps de cycle, ce qui limite l'évaluation externe de ce preprint. CoDi s'inscrit dans la vague des politiques de diffusion pour la robotique, popularisée par Diffusion Policy (2023, Columbia) et les architectures VLA comme Pi-0 de Physical Intelligence. Là où des systèmes comme GR00T N2 de NVIDIA ou Helix de Figure cherchent la généralisation sur un seul corps humanoïde, CoDi cible la coordination multi-corps, un problème distinct et encore peu résolu à l'échelle industrielle. Les approches concurrentes incluent le reinforcement learning multi-agent (MARL) et l'imitation centralisée, toutes deux très consommatrices de démonstrations coordonnées. L'étape suivante naturelle serait la montée en charge au-delà de deux agents et la validation sur des tâches industrielles complexes, dimensions que cette version préliminaire n'aborde pas encore.

RecherchePaper
1 source
ECHO : mémoire hiérarchique continue pour les modèles vision-langage-action (VLA)
3808arXiv cs.RO 

ECHO : mémoire hiérarchique continue pour les modèles vision-langage-action (VLA)

Des chercheurs ont publié sur arXiv en mai 2026 ECHO (Experience Consolidation and Hierarchical Organization), un framework mémoire pour modèles Vision-Language-Action (VLA) ciblant les tâches de manipulation longue durée. L'approche centrale repose sur un autoencodeur hyperbolique qui projette les états internes du VLA dans un espace hiérarchique continu, organisant les expériences passées en arbre sémantique plutôt qu'en liste linéaire d'embeddings. Un mécanisme de consolidation en arrière-plan raffine cet arbre par interpolation géométrique et fragmentation structurelle, permettant la synthèse de mémoires virtuelles. Intégré au modèle de fondation π0 (Physical Intelligence) et évalué sur le benchmark de simulation LIBERO, ECHO affiche un gain absolu de 12,8 points sur LIBERO-Long ainsi qu'une meilleure généralisation compositionnelle sur des suites de tâches non vues à l'entraînement. Des expériences en environnement réel sont mentionnées comme "préliminaires", sans métriques quantitatives publiées. Ce résultat pointe un verrou sous-estimé dans la course aux VLA : la mémoire. Les architectures actuelles (OpenVLA, Octo, π0 en baseline) traitent l'expérience passée comme un buffer plat, sans structure sémantique. Les tâches industrielles réelles, qu'il s'agisse d'assemblage multi-étapes ou de gestion d'exceptions en ligne de production, exigent précisément une récupération contextuelle efficace sur des horizons longs et la capacité à composer des séquences inédites. Le gain de 12,8% reste une métrique en simulation ; l'écart simulation-réalité n'est pas encore évalué rigoureusement, et la sélection des démos vidéo dans ce type de preprint mérite toujours une lecture prudente. Néanmoins, le cadre conceptuel ouvre une direction distincte du simple retrieval k-NN à plat ou de l'augmentation brute de contexte. ECHO s'inscrit dans l'effervescence autour des VLA généralistes depuis fin 2023, portée par π0 (Physical Intelligence, novembre 2024), OpenVLA (Berkeley/Stanford, 2024) et GR00T N1/N2 (NVIDIA, 2025). Physical Intelligence, la startup spécialisée dans les politiques robotiques génératives, fait de π0 sa plateforme de fondation ; ECHO s'y greffe comme module mémoire externe. Aucun code public ni timeline de déploiement industriel n'est annoncé dans le preprint, et aucun acteur français ou européen n'est impliqué. Les prochaines étapes naturelles seraient une évaluation sur des benchmarks physiques (RoboSuite, RT-2-X) et la publication de résultats terrain complets.

IA physiqueOpinion
1 source
ACSAC : acteur-critique à taille de segment adaptative avec réseau-Q à Transformer causal
3809arXiv cs.RO 

ACSAC : acteur-critique à taille de segment adaptative avec réseau-Q à Transformer causal

Des chercheurs proposent ACSAC (Adaptive Chunk Size Actor-Critic), une méthode d'apprentissage par renforcement publiée sur arXiv en mai 2025 (arXiv:2605.11009). L'architecture repose sur un réseau critique de type Transformer causal, qui évalue les retours attendus pour des séquences d'actions -- appelées "chunks" -- de longueurs variables. À chaque frontière de chunk, la politique sélectionne dynamiquement la taille qui maximise le retour estimé, sans nécessiter de réglage manuel par tâche. Évaluée sur OGBench, la suite de référence pour le RL offline longue horizon, ACSAC atteint des performances état de l'art sur des tâches de manipulation à horizon long et récompenses rares, aussi bien en RL offline pur qu'en RL offline-to-online. L'action chunking -- exécuter une séquence d'actions prédite en un seul bloc -- est devenu un mécanisme central dans les politiques robotiques modernes : il réduit l'horizon effectif, accélère les mises à jour de valeur et favorise une exploration cohérente dans le temps. Mais toutes les méthodes existantes, dont ACT, Diffusion Policy ou les récents VLA comme pi-0 de Physical Intelligence, utilisent une taille de chunk fixe, imposant un compromis difficile : un chunk long améliore la cohérence temporelle mais dégrade la réactivité aux nouvelles observations, tandis qu'un chunk court produit des mouvements erratiques. ACSAC supprime ce compromis en rendant la taille dépendante de l'état courant. Les auteurs démontrent formellement que l'opérateur de Bellman associé est une contraction ayant un unique point fixe, garantissant la convergence de l'algorithme -- une propriété que les méthodes heuristiques à chunk fixe ne peuvent pas revendiquer. Le concept d'action chunking a été popularisé par ACT (Action Chunking with Transformers, Zhao et al., 2023), puis généralisé par les politiques de diffusion et intégré dans les VLA de nouvelle génération comme pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA). OGBench, développé par Park et al. en 2024, s'est imposé comme le benchmark standard pour évaluer le RL offline sur des tâches de manipulation complexes. ACSAC se positionne directement contre ces approches à chunk fixe, avec une promesse de généralisation sans tuning par tâche -- une propriété critique pour le déploiement multi-tâches en industrie. Les résultats actuels restent limités à des environnements simulés ; les prochaines étapes naturelles incluent la validation sur matériel réel et l'intégration dans des architectures fondation à grande échelle.

IA physiquePaper
1 source
Kairos : un système de déploiement extensible pour l'IA physique
3810arXiv cs.RO 

Kairos : un système de déploiement extensible pour l'IA physique

Une équipe de chercheurs publie sur arXiv (référence 2605.11381, mai 2025) les spécifications de Kairos, un système d'inférence conçu pour les flottes de robots pilotées par des modèles de fondation. Kairos se positionne comme le premier système de serving multi-robot à intégrer nativement la boucle generate-execute, soit l'enchaînement asynchrone entre les phases d'inférence et d'exécution motrice propre à l'IA physique. Sur un ensemble de modèles et de plateformes robotiques, le système annonce une réduction de la latence bout-en-bout de 31,8 à 66,5 % par rapport aux pratiques de serving issues du monde de l'IA digitale, avec des gains qui s'accroissent avec la taille de la flotte déployée. L'argument central des auteurs tient à une inadéquation structurelle. Les systèmes actuels comme vLLM, TensorRT-LLM ou Triton ont été conçus pour les LLM textuels : ils traitent une requête jusqu'à complétion, sans état intermédiaire. L'IA physique fonctionne différemment : le modèle génère des blocs d'actions (action chunks) à chaque round d'inférence, le robot commence à exécuter pendant que le bloc suivant est calculé, et plusieurs cycles se succèdent sur une même tâche. Cette asynchronicité, ignorée par les serveurs digitaux classiques, crée un goulot d'étranglement critique pour les flottes industrielles. Si les chiffres se confirment en conditions réelles, les intégrateurs y gagneraient des cycles de contrôle plus courts et une capacité de scaling horizontal sans surcoût infrastructure proportionnel. Le contexte explique l'urgence de cette contribution. Depuis 2024, les modèles de fondation pour robots prolifèrent : Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA, Helix de Figure AI. Ces VLA (Vision-Language-Action) ont franchi des seuils de généralisation inédits, mais l'infrastructure de déploiement n'a pas suivi le même rythme. Kairos tente de combler ce fossé côté serving. Il s'agit néanmoins d'un preprint non revu par les pairs : les benchmarks ne sont pas détaillés dans l'abstract, les modèles et robots de test ne sont pas nommés, et aucun déploiement en production n'est déclaré. Les métriques annoncées méritent donc une lecture prudente en attendant une validation expérimentale indépendante.

InfrastructureOpinion
1 source
Planification de mouvement "suivre le chef" par échantillonnage pour robots continus montés sur manipulateur
3811arXiv cs.RO 

Planification de mouvement "suivre le chef" par échantillonnage pour robots continus montés sur manipulateur

Des chercheurs du Continuum Robotics Lab (Université de Toronto) ont publié en mai 2025 sur arXiv (arXiv:2605.11618) un planificateur de mouvement par échantillonnage pour robots continuums (CR) montés sur bras manipulateurs. Le principe exploité, dit "follow-the-leader" (FTL), consiste à faire retracer au corps du robot la trajectoire exacte de son extrémité distale, permettant de naviguer dans des espaces confinés sans collision. L'innovation clé est de découpler la recherche de forme globale du calcul de pose de base via une construction géométrique analytique fermée, éliminant toute optimisation itérative en ligne. Validé sur 120 chemins simulés répartis en trois classes de test, le système atteint 0 % d'erreur d'extrémité distale, 1,9 % d'écart de forme moyen (normalisé par la longueur du robot) et 100 % de taux de succès. Une validation matérielle sur un CR à tendons de 6 DOF monté sur manipulateur série confirme la faisabilité pratique. L'apport principal est de lever un verrou structurel : toutes les méthodes FTL antérieures supposaient une base fixe ou un mécanisme d'insertion à un seul DOF. En autorisant une pose de base pleinement actionnée dans SE(3), le problème devient couplé et combinatoirement difficile. En déportant la majorité du calcul hors ligne, l'approche permet une planification en quasi-temps réel sur des plateformes industrielles réelles. Les garanties théoriques formelles (complétude de la recherche de forme, convergence du suivi de waypoints) facilitent la certification de sécurité, ce qui intéresse directement les intégrateurs en robotique chirurgicale ou en inspection d'infrastructures. Bémol notable : les temps de planification effectifs ne sont pas rapportés dans l'abstract, et la généralisation au-delà des trois classes de chemins testés reste à démontrer. Les robots continuums, structures flexibles sans articulations rigides discrètes, sont étudiés depuis les années 2000 pour la chirurgie minimalement invasive, l'inspection de turbines et l'exploration de conduits étroits. Le Continuum Robotics Lab compte parmi les équipes de référence mondiales, aux côtés du groupe Webster III (Vanderbilt) et de l'Université de Leeds. En Europe, des acteurs comme Surgivisio et des projets ANR autour des cathéters robotisés contribuent également au domaine. Ce travail s'inscrit dans la tendance d'intégration des CR sur bras polyarticulés pour dépasser les limitations des plateformes à base fixe. Le code source et les visualisations sont publiés en open source sur la page du laboratoire, facilitant la réplication indépendante.

RecherchePaper
1 source
Découverte de modes comportementaux pour l'affinage de politiques génératives multimodales
3812arXiv cs.RO 

Découverte de modes comportementaux pour l'affinage de politiques génératives multimodales

Une équipe de chercheurs a publié en mai 2026 sur arXiv (arXiv:2605.11387) une méthode pour affiner des politiques génératives pré-entraînées par apprentissage par renforcement (RL) sans sacrifier la diversité comportementale. Le problème ciblé est le "mode collapse" : appliqué à une politique diffusion (un modèle génératif produisant des distributions d'actions multimodales), le RL fait converger les comportements variés vers une unique stratégie maximisant la récompense. La solution proposée est un framework non supervisé qui identifie les modes comportementaux latents au sein de ces politiques, puis utilise l'information mutuelle entre ces modes et les trajectoires générées comme récompense intrinsèque. Ce signal régularise l'entraînement RL, forçant le modèle à conserver plusieurs stratégies d'exécution simultanément. Sur des benchmarks de manipulation robotique, la méthode surpasse les approches classiques en taux de succès tout en préservant des distributions d'actions plus riches. Cette contribution adresse une tension fondamentale dans le déploiement des politiques robotiques apprenantes : le RL améliore les performances moyennes mais réduit la robustesse aux imprévus en homogénéisant les comportements. Pour un intégrateur industriel, la diversité comportementale détermine concrètement si un robot peut adapter sa prise face à une pose objet inattendue ou récupérer d'une perturbation de surface, des situations que les métriques de succès moyen ne capturent pas. En préservant la multimodalité après fine-tuning, la méthode rend les politiques diffusion plus exploitables hors des conditions d'entraînement et suggère qu'optimisation par RL et robustesse opérationnelle, deux objectifs souvent antagonistes, peuvent être conciliés. Les politiques diffusion se sont imposées comme paradigme dominant en manipulation robotique depuis les travaux de Chi et al. (2023) et alimentent aujourd'hui les modèles VLA (Vision-Language-Action) comme pi-0 de Physical Intelligence ou OpenVLA de Berkeley. Le fine-tuning RL de ces architectures est une direction très active, notamment avec DPPO (Diffusion Policy Policy Optimization). La méthode proposée se positionne comme complément générique à ces pipelines, applicable sans annotation supplémentaire. Point de vigilance : les auteurs ne mentionnent pas de validation sur robot physique, un gap récurrent pour les preprints arXiv dont les résultats restent à confirmer hors simulation.

RechercheOpinion
1 source
NavOL : une politique de navigation par apprentissage par imitation en ligne
3813arXiv cs.RO 

NavOL : une politique de navigation par apprentissage par imitation en ligne

NavOL est une approche d'apprentissage en ligne par imitation pour les politiques de navigation robotique, présentée dans un preprint arXiv (2605.11762) en mai 2026. Le système repose sur une politique de diffusion préentraînée qui projette des observations locales vers des waypoints futurs. Son apprentissage s'organise en boucle rollout-mise à jour : en phase de rollout, la politique agit dans un simulateur et interroge un planificateur global disposant d'un accès privilégié à l'environnement complet pour obtenir des segments de trajectoire optimaux comme labels de référence ; en phase de mise à jour, la politique s'entraîne sur ces paires observation-trajectoire collectées en ligne. Construit sur IsaacLab avec rendu parallèle haute fidélité et randomisation de domaine (pose de caméra, paires départ-arrivée), le système s'entraîne simultanément sur 50 scènes sur 8 GPU RTX 4090, collectant plus de 2 000 trajectoires nouvelles par heure, chacune comptant en moyenne plus de 400 pas. Les auteurs introduisent également un benchmark de navigation visuelle en intérieur avec des positions de départ et d'arrivée prédéfinies, conçu pour évaluer la généralisation zéro-shot. NavOL s'attaque à deux blocages classiques de la navigation robotique autonome : le décalage de distribution de l'imitation hors ligne, qui génère des erreurs composées lors du déploiement réel, et la nécessité de concevoir des fonctions de récompense pour l'apprentissage par renforcement. En entraînant la politique sur ses propres rollouts explorés plutôt que sur un corpus statique, le système réduit ce gap de manière plus systématique. Le volume de données généré automatiquement (2 000+ trajectoires/heure) et les gains de performance cohérents sur le benchmark NavDP ainsi que sur le benchmark propriétaire des auteurs indiquent que l'approche pourrait remplacer des pipelines de collecte de données expertes coûteux pour les intégrateurs travaillant sur la navigation en intérieur structuré. Les politiques de navigation visuelle pour robots mobiles constituent un champ actif, avec des approches récentes comme les VLA (Vision-Language-Action models) et les politiques de diffusion qui cherchent à généraliser sans reward engineering. NavOL s'inscrit dans cette dynamique en exploitant IsaacLab, le simulateur d'NVIDIA, pour un entraînement massivement parallèle requérant 8 GPU RTX 4090 haut de gamme. Un point de vigilance : les expériences en conditions réelles mentionnées dans le papier restent peu détaillées dans le résumé, et la performance en simulation peut diverger significativement des résultats terrain, un écart (sim-to-real gap) que ce type d'approche prétend atténuer sans nécessairement le supprimer. Les prochaines étapes naturelles concerneraient l'évaluation sur des environnements extérieurs plus ouverts et l'intégration avec des VLA pour des tâches impliquant un raisonnement sémantique plus riche.

IA physiqueActu
1 source
DexTwist : téléopération en réalité mixte pour la saisie en torsion avec une main dextérique
3814arXiv cs.RO 

DexTwist : téléopération en réalité mixte pour la saisie en torsion avec une main dextérique

Une équipe de recherche a publié DexTwist, un framework de téléopération dextre via réalité mixte (MR) ciblant les manipulations rotationnelles en contact riche : ouverture de bouchons, rotation de clés, vissage de boulons. L'article, déposé sur arXiv (arXiv:2605.12182) en mai 2026, documente un échec connu des approches classiques de retargeting : minimiser l'erreur d'angle articulaire ou de position des doigts ne suffit pas quand les morphologies humaine et robot divergent. DexTwist opère en trois étapes - détection d'une prise tripode (pouce-index-majeur), estimation en temps réel de l'axe hélicoïdal (screw axis) et de la magnitude de torsion souhaitée, puis raffinement résiduel dans l'espace articulaire minimisant quatre termes simultanément : angle atteint, cohérence de l'axe, fermeture des doigts, stabilité tripode. Les expériences en simulation et en conditions réelles montrent des gains en suivi angulaire et en stabilité de l'axe par rapport à une baseline de retargeting vectoriel classique. Le problème central est l'embodiment gap : les différences de longueurs de segments, d'axes articulaires et de géométrie des phalanges distales entre main humaine et main robot provoquent un glissement tangentiel des doigts plutôt qu'une rotation stable de l'objet, phénomène désigné comme screw axis drift. Ce glissement dégrade directement la qualité des démonstrations collectées pour l'imitation learning ou les modèles VLA (Vision-Language-Action). Or, la téléopération MR est l'une des rares méthodes scalables pour générer des données de manipulation dextre à volume, et sa fiabilité sur les tâches rotationnelles conditionne directement la qualité des datasets sur lesquels reposent les futurs modèles généraux. La téléopération MR pour les mains robotiques s'est imposée ces dernières années comme alternative aux gants haptiques (DEXMO, SenseGlove) et à la capture de mouvement, avec un déploiement moins contraignant. Des travaux antérieurs comme DexPilot ou AnyTeleop avaient posé les bases du retargeting générique, sans adresser spécifiquement les mouvements de vissage. DexTwist se positionne dans un espace qui inclut également les approches par renforcement pur ou les diffusion policies pour mains dextres commerciales (Allegro, Shadow Hand, LEAP Hand). L'étape suivante naturelle serait d'intégrer ce retargeting fonctionnel dans un pipeline d'imitation learning complet afin de vérifier si la meilleure qualité de démonstration améliore effectivement les politiques autonomes en aval - un gap sim-to-real que l'article n'adresse pas encore.

IA physiqueOpinion
1 source
Rainbow Deep Q-Learning intégrant la cinématique pour l'insertion coopérative de robots parallèles Delta et 3-RRS
3815arXiv cs.RO 

Rainbow Deep Q-Learning intégrant la cinématique pour l'insertion coopérative de robots parallèles Delta et 3-RRS

Des chercheurs présentent dans un preprint arXiv (arXiv:2605.11697) un cadre combinant un robot parallèle Delta et un manipulateur 3-RRS (liaisons Rotoïde-Rotoïde-Sphérique) pour réaliser coopérativement une tâche d'insertion cheville-dans-trou (peg-in-hole), étalon classique de l'assemblage de précision. L'espace contrôlable couvre 6 degrés de liberté : trois translations assurées par le Delta, deux rotations et une translation verticale par le 3-RRS, pour un espace de tâche effectivement pentadimensionnel (l'insertion étant invariante à la rotation axiale). Le problème est formulé comme un processus de décision markovien à vecteur d'état de dimension 12 et 12 actions discrètes. L'algorithme retenu est un Rainbow DQN -- intégrant double Q-learning, architecture duale, rejeu à priorité, retours multi-étapes, couches linéaires bruitées et tête de valeur distributionnelle -- entraîné selon un curriculum en deux phases. Les résultats, obtenus exclusivement en simulateur cinématique haute-fidélité, montrent une convergence stable et des insertions fiables, surpassant un DQN classique et un planificateur par échantillonnage. La contribution centrale n'est pas algorithmique mais architecturale : une étape d'optimisation géométrique précède tout entraînement et ajuste la cinématique du 3-RRS pour maximiser l'espace de travail sans singularité et améliorer le conditionnement de la chaîne. Ce co-design élargit la région sûre d'exploration de la politique RL, réduit les violations de contraintes cinématiques et accélère la convergence. Ce principe -- optimiser la géométrie mécanique avant l'apprentissage plutôt que déléguer cette contrainte à la fonction de récompense -- est directement applicable aux intégrateurs travaillant avec des manipulateurs à espace de travail contraint ou à singularités critiques. Les robots parallèles Delta, introduits par Reymond Clavel en 1985 et largement déployés en pick-and-place agroalimentaire et pharmaceutique, sont réputés pour leur rigidité mais pénalisés par un espace de travail réduit. Les architectures 3-RRS partagent ces caractéristiques. Le Rainbow DQN, proposé par DeepMind en 2017, agrège six améliorations du DQN original de 2015 ; son application aux architectures parallèles coopératives reste peu documentée dans la littérature. Ce travail demeure une contribution de recherche en simulation : le franchissement du fossé sim-to-réel n'est pas traité, aucun déploiement sur hardware physique n'est annoncé, et les auteurs n'indiquent pas d'affiliation industrielle.

RecherchePaper
1 source
Suivi de main par vision pour la manipulation robotique via cinématique inverse
3816arXiv cs.RO 

Suivi de main par vision pour la manipulation robotique via cinématique inverse

Des chercheurs ont publié sur arXiv (réf. 2603.11383) une pipeline de télé-opération bas coût pour bras manipulateurs, baptisée hand-shadowing : une caméra RGB-D égocentrique montée sur des lunettes imprimées en 3D capte les mains de l'opérateur, MediaPipe Hands en extrait 21 points de repère par main, la profondeur les projette dans l'espace 3D, et un algorithme de cinématique inverse à moindres carrés atténués (damped least-squares IK) génère les commandes articulaires du robot SO-ARM101 (5 degrés de liberté + 1 préhenseur). Les actions sont d'abord validées dans un simulateur physique avant d'être rejouées sur le robot réel. Sur un benchmark structuré pick-and-place (grille 5 cases, 10 saisies par case, 3 runs indépendants), la pipeline atteint un taux de succès de 86,7 % ± 4,2 %, avec une erreur IK moyenne de 36,4 mm et une réduction du jerk de 57 à 68 % grâce à un lissage par moyenne mobile exponentielle (EMA). En environnements non structurés réels (supermarché, pharmacie), ce taux chute à 9,3 %, principalement à cause de l'occultation des mains par les objets environnants. Ce résultat illustre avec brutalité le reality gap qui sépare les conditions de laboratoire du déploiement industriel : une marge de 77 points entre les deux contextes n'est pas un détail d'intégration, c'est un défi de fond pour toute approche marker-free analytique. La comparaison directe avec quatre politiques VLA entraînées sur données leader-follower (ACT, SmolVLA, pi_0.5 de Physical Intelligence et GR00T N1.5 de NVIDIA) est méthodologiquement utile : elle positionne cette approche de retargeting pur face aux modèles appris, et quantifie l'écart sans se limiter à la démonstration sélective. Pour un COO ou un intégrateur, le message est clair : le bas coût matériel (lunettes imprimées, caméra grand public) ne compense pas encore l'insuffisance de robustesse à l'occlusion. La télé-opération reste un goulot d'étranglement majeur pour la collecte de données d'entraînement robotique, et les systèmes leader-follower filaires ou magnétiques restent chers et contraignants. Ce travail s'inscrit dans une vague de recherche qui cherche à démocratiser la capture de démonstrations avec du matériel grand public, aux côtés d'approches comme UMI (Columbia) ou AnyTeleop. Pour contourner la faiblesse de MediaPipe face à l'occlusion, les auteurs intègrent WiLoR comme détecteur alternatif et obtiennent 8 % de gain en taux de détection, une amélioration modeste qui confirme que le problème reste ouvert. La prochaine étape logique serait d'ajouter une gestion multi-vues ou un suivi temporel robuste pour traiter les environnements encombrés, conditions précisément où la télé-opération sans marqueur aurait le plus de valeur.

RecherchePaper
1 source
Manipulation riche en contacts certifiée par gradient via tubes d'accessibilité à erreur de lissage
3817arXiv cs.RO 

Manipulation riche en contacts certifiée par gradient via tubes d'accessibilité à erreur de lissage

Une équipe de chercheurs publie sur arXiv (2602.09368v2) une méthode certifiée pour la manipulation robotique de contact riche, testée sur la poussée planaire, la rotation d'objets et la manipulation dextère en main. Le coeur du problème : les méthodes à gradient exploitant la simulation différentiable échouent face aux dynamiques hybrides du contact, qui produisent des gradients discontinus ou nuls. Lisser ces dynamiques restaure les gradients mais introduit un écart de modèle qui invalide les contrôleurs en déploiement réel. La méthode proposée, fondée sur un simulateur différentiable basé sur l'optimisation convexe, quantifie explicitement cet écart comme un ensemble de valeurs puis l'intègre dans l'optimisation via des tubes d'atteignabilité analytiques (smoothing-error reachable tubes). Elle produit des politiques de retour d'état affines, variant dans le temps, formellement certifiées pour satisfaire les contraintes de sécurité sous les dynamiques non-lissées originales, avec moins de violations de contraintes et de meilleures précisions de position finale que les approches de référence. La manipulation de contact riche reste l'un des verrous centraux de la robotique industrielle : l'assemblage et le picking dextère se heurtent à l'impossibilité de garantir formellement la robustesse en présence de contact discontinu. Ce travail démontre qu'il est possible de combiner simulation différentiable et certifiabilité formelle, deux objectifs longtemps considérés comme antagonistes. Pour les intégrateurs et équipementiers déployant des cobots ou des bras manipulateurs, cela ouvre la voie à des contrôleurs optimisés par simulation avec des garanties de sécurité exploitables industriellement, sans recalage sur données réelles. Ce travail s'inscrit dans l'essor de la simulation différentiable appliquée au contact, aux côtés d'outils comme Drake (Toyota Research Institute), MuJoCo (DeepMind/Google) ou Dojo. Les approches concurrentes, dont le lissage aléatoire et la relaxation de complémentarité, offrent des gradients continus mais sans garanties formelles de robustesse. Le manuscrit reste en préprint (arXiv v2), sans acceptation dans une conférence majeure ni partenariat industriel annoncé ; les résultats sont exclusivement en simulation, ce qui limite la portée des conclusions avant validation hardware. Les suites logiques portent sur l'extension à des mains dextères multi-doigts et à des tâches en boucle fermée sur robot physique avec des objets de géométrie complexe.

RecherchePaper
1 source
Optimisation distribuée de graphe de poses par dynamique riemannienne continue
3818arXiv cs.RO 

Optimisation distribuée de graphe de poses par dynamique riemannienne continue

Un pré-print déposé le 13 mai 2026 sur arXiv (référence 2605.11210) propose un nouveau cadre algorithmique pour l'optimisation distribuée de graphes de poses (PGO), un problème central en SLAM collaboratif (Simultaneous Localization and Mapping). L'approche reformule le PGO comme un système dynamique du second ordre en temps continu sur des groupes de Lie, les structures mathématiques qui modélisent naturellement rotations et translations dans l'espace. Les variables de pose sont traitées comme des particules massiques amorties, de sorte que les équilibres de la dynamique riemannienne résultante coïncident avec les points critiques du premier ordre du problème original. L'intégrateur géométrique semi-implicite employé, basé sur les équations d'Euler-Poincaré, généralise la descente de gradient riemannienne et la méthode de Gauss-Newton. En contexte multi-robots, chaque agent résout une équation différentielle ordinaire pour ses propres poses via des matrices de masse et d'amortissement block-diagonales, permettant un traitement entièrement parallèle avec une communication minimale. Les benchmarks sur jeux de données PGO standard montrent des performances supérieures aux méthodes distribuées de l'état de l'art, en régime synchrone comme asynchrone. L'intérêt pratique réside dans la gestion des communications retardées, un verrou majeur pour les flottes AMR opérant dans des environnements industriels où les liaisons sans fil sont intermittentes. La modélisation conjointe de l'état et de la vitesse permet une prédiction des voisins qui améliore significativement la convergence malgré ces délais. Pour les intégrateurs de solutions multi-robots en logistique ou en inspection industrielle, ce solveur distribué ouvre la voie à une localisation collective robuste sans infrastructure centralisée à faible latence. Les auteurs établissent par ailleurs des conditions suffisantes garantissant la dissipation d'énergie sous le schéma de discrétisation retenu, ce qui confère au résultat une garantie de convergence formelle plutôt qu'une simple validation empirique. Le PGO distribué est un domaine actif depuis une décennie, avec des travaux pionniers comme DDF-SAM, DOOR-SLAM ou Kimera-Multi développés au MIT et à CMU, qui s'appuient principalement sur des méthodes discrètes de type ADMM. Ce nouveau cadre adopte une perspective continue sur variétés riemanniennes, s'inscrivant dans la tendance récente des optimiseurs géométriques pour la robotique. Il s'agit d'une contribution purement académique : aucun déploiement ni partenariat industriel n'est mentionné. Les suites naturelles seraient une intégration dans des bibliothèques SLAM open-source comme GTSAM ou g2o, et une validation sur plateformes réelles en environnement non contrôlé.

RecherchePaper
1 source
DarkQA : évaluation des modèles vision-langage sur la compréhension visuelle primitive en intérieur faiblement éclairé
3819arXiv cs.RO 

DarkQA : évaluation des modèles vision-langage sur la compréhension visuelle primitive en intérieur faiblement éclairé

Une équipe de recherche a publié DarkQA, un benchmark open-source destiné à évaluer les modèles de vision-langage (VLM) dans des conditions de faible éclairage intérieur, selon un prépublication arXiv (2512.24985, version 4). Le benchmark contient 9 400 paires image-question générées de manière déterministe et vérifiable, couvrant cinq familles de primitives visuelles : détection d'objets, estimation de profondeur, lecture de texte, identification de couleur et reconnaissance de forme. La dégradation lumineuse y est modélisée en espace RAW linéaire, simulant une chute physique d'illumination et du bruit capteur via un pipeline de rendu inspiré des pipelines ISP (Image Signal Processing) des appareils photo. Les résultats ont été validés contre des données réelles de caméras en basse lumière. Les auteurs ont évalué plusieurs VLMs représentatifs ainsi que des méthodes de prétraitement Low-Light Image Enhancement (LLIE). Le verdict : les VLMs se dégradent de manière systématique sous faible illumination et bruit capteur, tandis que les méthodes LLIE offrent une récupération partielle mais instable selon la sévérité des conditions. Ce travail comble un angle mort critique dans l'évaluation des agents incarnés. Les benchmarks existants supposent des conditions d'éclairage idéales, alors que le déploiement 24h/24 de robots ou de systèmes de perception autonome implique nécessairement des environnements mal éclairés : entrepôts de nuit, couloirs intérieurs, scènes résidentielles en soirée. Le fait que les LLIE améliore les performances de façon non monotone selon l'intensité de la dégradation est un signal d'alerte pour les intégrateurs qui considèrent ces méthodes comme une solution générique de prétraitement. DarkQA isole les échecs perceptuels avant qu'ils ne soient noyés dans des tâches embodied complexes, ce qui permet d'identifier précisément quel type de primitive visuelle casse en premier. Dans le contexte plus large, cette publication s'inscrit dans une dynamique de maturité des benchmarks pour l'IA incarnée, après des frameworks comme RoboVQA, OpenEQA ou ScanQA qui évaluaient la compréhension de scène sans contrainte photométrique. L'absence d'un tel benchmark laissait les développeurs sans signal clair sur la robustesse réelle de modèles comme GPT-4V, LLaVA ou Gemini Pro Vision en conditions dégradées. La disponibilité du code et du dataset est conditionnée à l'acceptation de l'article en conférence ou journal, ce qui en limite l'usage immédiat. Le site projet (darkqa-benchmark.github.io) est déjà en ligne, et les auteurs indiquent une prochaine mise à disposition publique complète.

RecherchePaper
1 source
PRISM : planification et raisonnement intentionnel dans des environnements simulés à IA incarnée
3820arXiv cs.RO 

PRISM : planification et raisonnement intentionnel dans des environnements simulés à IA incarnée

Des chercheurs ont publié PRISM (Planning and Reasoning with Intent in Simulated Embodied Environments) sur arXiv en mai 2026, un benchmark de diagnostic pour agents incarnés basés sur des LLM. Là où les benchmarks actuels se limitent à un taux de succès global, PRISM identifie quel module cognitif est responsable d'un échec. Le dispositif repose sur cinq appartements multi-pièces photoréalistes (4 à 8 pièces chacun) et 300 tâches validées par des humains, organisées en trois niveaux de capacité : Basic Ability (ancrage perception-action), Reasoning Ability (résolution d'intentions implicites) et Long-horizon Ability (coordination multi-étapes soutenue). L'API d'évaluation est agnostique au type d'agent, couvrant LLM, VLM, planificateurs symboliques, politiques RL et systèmes hybrides dans le même protocole. Des expériences sur sept LLM contemporains montrent que les modèles légers s'effondrent à 20 % de succès sur les tâches long-horizon tout en consommant davantage de tokens que les modèles frontier, un phénomène que les auteurs nomment sur-raisonnement compensatoire. Ce résultat contredit une hypothèse dominante dans l'IA incarnée : en conditions de perception oracle (sans erreur de détection), l'ancrage spatial n'est pas le principal facteur limitant. C'est la résolution d'intentions implicites qui constitue le goulot d'étranglement commun à toutes les familles de modèles testées, y compris les plus puissantes. Pour les intégrateurs et décideurs B2B, la découverte du sur-raisonnement compensatoire est un signal d'alerte concret : un modèle léger déployé en edge peut afficher une activité de raisonnement apparente (volume de tokens élevé) tout en échouant massivement sur des tâches complexes. PRISM offre ainsi un protocole de qualification plus fin que le simple taux de complétion, permettant de cibler les investissements entre perception, mémoire et planification. PRISM s'inscrit dans un mouvement de benchmarking plus rigoureux des agents incarnés, aux côtés de référentiels comme ALFRED ou ScienceWorld qui agrègent les résultats sans en décomposer les causes. La publication intervient alors que DeepMind, Google, Meta et des startups comme Physical Intelligence (auteure de pi0) investissent massivement dans les architectures VLA (Vision-Language-Action) pour la robotique domestique et industrielle. L'API publique et agnostique à l'agent est conçue pour une adoption communautaire large. Il s'agit cependant d'un preprint académique : aucun pilote industriel ni timeline de déploiement ne sont annoncés à ce stade.

RecherchePaper
1 source
Trajectoire d'abord : un programme d'entraînement pour découvrir des politiques diversifiées
3821arXiv cs.RO 

Trajectoire d'abord : un programme d'entraînement pour découvrir des politiques diversifiées

Des chercheurs ont publié sur arXiv (référence 2506.01568, version 3) une méthode nommée "Trajectory First", un curriculum d'entraînement en deux étapes conçu pour produire des politiques comportementales diversifiées en apprentissage par renforcement (RL). La contribution centrale est l'introduction d'un a priori de trajectoires splines comme biais inductif durant la première phase : ce prior géométrique guide l'exploration de l'espace des comportements, permettant de générer un ensemble de stratégies à haute récompense mais distinctes. La seconde phase distille ces comportements en politiques réactives pas-à-pas, utilisables en temps réel. Les expériences valident l'approche sur des tâches de manipulation robotique en simulation, domaine où les méthodes de diversité contrainte existantes montrent des lacunes d'exploration marquées. La diversité comportementale est un enjeu opérationnel concret pour les intégrateurs et les équipes de robotique industrielle : un robot capable de saisir un objet selon plusieurs stratégies est nettement plus robuste aux variations de position, d'éclairage ou de géométrie qu'un système limité à une unique politique apprise. Les cadres actuels d'optimisation de diversité contrainte, malgré leurs progrès théoriques, convergent fréquemment vers des optima locaux en manipulation dextre, bridant la robustesse effective des systèmes en production. "Trajectory First" propose une voie pour contourner cette limite sans sacrifier la performance sur la tâche principale, ce qui est précisément le compromis clef que la communauté cherche à résoudre depuis plusieurs années. L'approche ne nécessite pas d'entraînement spécifique à chaque configuration, ce qui renforce sa portée généraliste. L'optimisation de diversité en RL s'est structurée autour de paradigmes comme Quality-Diversity (QD-RL), MAP-Elites, DIAYN ou DADS, qui peinent tous sur des espaces d'action continus à horizon long. "Trajectory First" s'inscrit dans un courant combinant curriculum learning et représentations géométriques du mouvement pour améliorer l'exploration initiale avant de contraindre la politique finale. Cette publication est une contribution de recherche fondamentale, validée en simulation uniquement, sans déploiement industriel ni partenaires commerciaux annoncés. Les extensions naturelles incluent le transfert sim-to-real et la manipulation bimanuelle, deux axes très actifs dans les laboratoires académiques (Inria, ETH Zurich, CMU) comme chez les acteurs industriels tels que Physical Intelligence (Pi-0), Covariant ou le Boston Dynamics AI Institute.

IA physiquePaper
1 source
Gaussian Splatting anticipatif pour la représentation 3D prédictive en prise-et-dépose guidée par le langage
3822arXiv cs.RO 

Gaussian Splatting anticipatif pour la représentation 3D prédictive en prise-et-dépose guidée par le langage

Une équipe de chercheurs a proposé sur arXiv (arXiv:2605.11144, mai 2026) un framework baptisé Forecast-GS (Forecast-aware Gaussian Splatting), destiné à la manipulation robotique guidée par le langage naturel. La contribution centrale consiste à modéliser explicitement l'état final attendu d'une tâche via une reconstruction 3D prédictive par Gaussian Splatting, plutôt que de raisonner uniquement sur la configuration courante de la scène. Validé sur trois tâches réelles de pick-and-place (cutter-vers-boîte, pomme-vers-bol, éponge-vers-plateau), le système atteint des taux de succès de 84 % (21/25), 92 % (23/25) et 64 % (16/25) en sélection automatique, contre 60 %, 76 % et 40 % pour la baseline ReKep (Relational Keypoint Constraints). En mode assisté par un opérateur humain pour le classement des candidats, les taux montent à 92 %, 96 % et 76 %, chaque condition étant testée sur 25 essais réels avec configurations initiales variées sur la même plateforme robotique. L'enjeu pratique est le suivant : la plupart des systèmes de manipulation actuels évaluent si une action est faisable depuis l'état présent, sans vérifier si l'état résultant satisfait l'objectif sémantique. Forecast-GS génère une prévision 3D de la scène post-action, que le robot compare à l'instruction en langage naturel avant d'exécuter, ce qui réduit les erreurs en présence d'observations partielles ou d'occlusions. Pour un intégrateur industriel, l'interprétabilité de ce mécanisme, contrairement aux politiques VLA end-to-end comme Pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA), facilite le débogage et la traçabilité. L'écart persistant entre mode automatique et assisté (jusqu'à 12 points de taux de succès) indique cependant que le ranking final des candidats n'est pas encore un problème résolu. Le Gaussian Splatting, introduit en 2023 par Kerbl et al. à SIGGRAPH, a été rapidement adopté en robotique pour ses représentations 3D différentiables et compactes. Forecast-GS s'inscrit dans un courant qui hybride représentations neuronales 3D et planification guidée par le langage, en compétition directe avec ReKep (Stanford/Berkeley), SpatialVLA, et les approches VLA génératives. Aucun partenariat industriel ni calendrier de déploiement n'est mentionné dans la publication. Les prochaines étapes logiques portent sur l'amélioration du classement automatique, principal goulot d'étranglement vers l'autonomie complète, et sur l'extension à des scènes dynamiques plus complexes que les configurations statiques de laboratoire utilisées ici.

RecherchePaper
1 source
Des futurs imaginés aux actions exécutables : mélange d'actions latentes pour la manipulation robotique
3823arXiv cs.RO 

Des futurs imaginés aux actions exécutables : mélange d'actions latentes pour la manipulation robotique

Des chercheurs ont publié sur arXiv (référence 2605.12167, mai 2026) une méthode baptisée MoLA, pour Mixture of Latent Actions, destinée à améliorer la manipulation robotique en exploitant les modèles génératifs de vidéo comme mécanisme d'anticipation. L'idée centrale : un robot peut "imaginer" la trajectoire visuelle future d'une tâche avant de l'exécuter, mais transformer ces séquences générées en commandes moteur concrètes reste un problème ouvert. MoLA introduit une interface dite orientée contrôle qui, au lieu de passer directement les images prédites à la politique de contrôle, mobilise un ensemble de modèles inverses de dynamique (IDM) pré-entraînés pour en extraire des actions latentes. Ces IDM sont multimodaux : ils capturent des indices sémantiques, de profondeur et de flux optique, fournissant une représentation structurée et physiquement ancrée des transitions d'état. L'approche a été évaluée sur les benchmarks simulés LIBERO, CALVIN et LIBERO-Plus, ainsi que sur des tâches de manipulation en conditions réelles, avec des gains annoncés en taux de succès, en cohérence temporelle et en généralisation. Le problème que MoLA tente de résoudre est structurel dans le domaine des VLA (Vision-Language-Action models) : les modèles de génération vidéo optimisent la fidélité perceptuelle, pas la pertinence pour le contrôle. Lorsqu'une politique est conditionnée sur des frames prédites, elle hérite de cette inadéquation, produisant un contrôle indirect et instable. En substituant aux frames brutes des représentations latentes inférées par des IDM complémentaires, MoLA réduit ce fossé structurel. Pour les intégrateurs et les équipes de recherche appliquée, c'est un signal important : l'imagination visuelle peut effectivement améliorer les politiques robotiques, à condition de disposer d'une couche de traduction adaptée plutôt que d'un couplage direct image-action. Ce travail s'inscrit dans un courant actif autour des world models appliqués à la robotique, où des approches comme DreamerV3 (DeepMind) ou SuSIE ont exploré des pistes similaires pour le reinforcement learning et la manipulation. Côté manipulation guidée par vidéo, UniSim et les travaux autour de Pi-0 de Physical Intelligence ont popularisé l'utilisation de prédictions futures pour structurer le comportement. MoLA se distingue par son architecture modulaire à IDM mixtes plutôt qu'un seul encodeur unifié. Aucune affiliation industrielle ni timeline de déploiement n'est mentionnée dans la publication, ce qui en fait pour l'instant une contribution de recherche fondamentale, dont la valeur pratique dépendra de la reproductibilité des gains annoncés en dehors des benchmarks de référence.

RechercheOpinion
1 source
De la réaction à l'anticipation : un graphe de tâches à base d'agents pour la reprise proactive en manipulation robotique
3824arXiv cs.RO 

De la réaction à l'anticipation : un graphe de tâches à base d'agents pour la reprise proactive en manipulation robotique

Une équipe de recherche a publié en mai 2025 sur arXiv (identifiant 2605.11951) AgentChord, un système multi-agents qui anticipe les pannes de manipulation robotique avant l'exécution plutôt qu'en les traitant de manière réactive. L'architecture repose sur un graphe de tâches dirigé enrichi, en amont de toute exécution, de branches de récupération pré-compilées et contextualisées selon chaque étape critique. Trois agents spécialisés structurent ce pipeline : un "composer" modélise la tâche nominale, un "arranger" greffe les branches de récupération anticipées, et un "conductor" orchestre les transitions via des moniteurs à faible latence. Les expériences portent sur des tâches de manipulation bimanuelle à horizon long ; les auteurs rapportent une amélioration "substantielle" des taux de succès sans publier de métriques chiffrées précises dans l'abstract disponible. Le principal apport est d'éliminer la latence inhérente au pipeline classique "détecter-raisonner-récupérer", dans lequel chaque échec déclenche un nouvel appel à un LLM ou à un planificateur symbolique. En pré-compilant les correctifs avant le début de la tâche, AgentChord permet une réponse immédiate sans re-planification dès qu'un moniteur détecte une déviation. Pour les intégrateurs industriels qui automatisent des opérations en cellule non structurée, cette architecture de graphe anticipatif pourrait réduire les arrêts imprévus liés aux échecs de manipulation. L'approche présente néanmoins une limite structurelle : les branches pré-compilées ne couvrent que les pannes anticipées, non les défaillances inédites ou hors-modèle. La robustesse de la manipulation en conditions réelles reste l'un des goulots d'étranglement centraux de la robotique commerciale, que ce soit pour les bras industriels ou les humanoïdes en phase de déploiement comme Optimus de Tesla ou les robots de Figure AI. AgentChord s'inscrit dans un courant qui exploite les LLMs comme orchestrateurs de logique de haut niveau, en complément de politiques d'action de bas niveau. Des approches concurrentes comme les VLA Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA intègrent la récupération de manière implicite dans le réseau de politique, là où AgentChord opte pour une représentation explicite en graphe, plus transparente mais potentiellement moins générique face à la variabilité du monde réel. La page projet est accessible sur shengxu.net/AgentChord ; la validation hors banc de test académique reste la prochaine frontière.

RecherchePaper
1 source
Intégration de contraintes environnementales dans la préhension de matériaux flexibles type papier avec une pince souple
3825arXiv cs.RO 

Intégration de contraintes environnementales dans la préhension de matériaux flexibles type papier avec une pince souple

Une équipe de chercheurs a publié sur arXiv (référence 2605.11714) une étude systématique consacrée à la préhension robotique de matériaux flexibles de type papier, feuilles, documents, cartons fins, à l'aide d'un préhenseur souple universel. L'approche centrale consiste à exploiter les contraintes environnementales du poste de travail (surfaces planes, arêtes de table, bords d'obstacle) comme appuis passifs pour faciliter la saisie, plutôt que de compter uniquement sur les capacités intrinsèques du gripper. Les chercheurs ont défini un ensemble de primitives de manipulation, formalisé leurs modèles mécaniques et cinématiques, puis mis en place un banc d'évaluation mesurant force de préhension et taux de succès sur différents matériaux et conditions opérationnelles. Les résultats caractérisent les espaces de travail spécifiques et les conditions de validité de chaque stratégie, avec pour cible déclarée les robots de service à domicile devant manipuler des objets plats et flexibles. L'article ne fournit pas de chiffres absolus de taux de succès dans le résumé disponible, ce qui limite l'évaluation externe des performances revendiquées. Le verrou technique adressé est réel : les matériaux de type papier se distinguent des textiles par une sensibilité élevée aux contraintes de compression, et de faibles variations de grammage ou d'humidité peuvent faire échouer une prise. Les approches classiques par aspiration (ventouse) ou par pincement rigide échouent sur des géométries planes et déformables. L'exploitation des contraintes environnementales, approche connue sous le nom d'extrinsic dexterity en manipulation robotique, permet de compenser les limitations d'un gripper à degrés de liberté réduits, ce qui est directement pertinent pour les intégrateurs cherchant des solutions à faible coût mécanique. Si les résultats se confirment sur un spectre matériaux large, cela ouvre une voie pour automatiser des tâches de manutention documentaire ou d'emballage léger sans recourir à des effecteurs complexes. Le domaine de la manipulation d'objets déformables (Deformable Object Manipulation, DOM) est en pleine expansion, porté par des groupes comme le Stanford IRIS Lab, le MIT CSAIL ou le DLR, qui travaillent principalement sur les textiles. Les matériaux plans de type papier restent comparativement sous-étudiés malgré leur omniprésence en logistique et en bureautique. Les préhenseurs souples universels, notamment ceux à actionnement pneumatique ou par câbles, sont au coeur des développements de plusieurs startups (Soft Robotics, acquise par Applied Robotics, ou Festo Bionic) et des bras collaboratifs grand public. La prochaine étape naturelle serait une validation sur robot mobile de service en environnement non structuré, condition nécessaire pour passer de la démonstration académique à un déploiement industriel ou domestique crédible.

RecherchePaper
1 source
Interprétation des préférences humaines contextuelles pour la navigation multi-objectifs des robots
3826arXiv cs.RO 

Interprétation des préférences humaines contextuelles pour la navigation multi-objectifs des robots

Des chercheurs ont publié sur arXiv (2603.17510v2) une architecture permettant à un robot mobile de naviguer en environnement partagé en tenant compte des préférences exprimées en langage naturel par ses utilisateurs. Le système repose sur trois couches distinctes : un modèle vision-langage (VLM) qui analyse en continu les images de la caméra embarquée pour extraire un contexte environnemental structuré, un grand modèle de langage (LLM) qui traduit les retours verbaux des utilisateurs en règles comportementales interprétables, stockées dans une mémoire persistante et modifiable, puis un module de traduction des préférences qui convertit ces règles et ce contexte en vecteurs numériques injectés à la volée dans une politique de navigation par apprentissage par renforcement multi-objectif (MORL) préentraînée. L'évaluation couvre des déploiements réels dans plusieurs environnements intérieurs, une étude utilisateur et des mesures quantitatives par composant, sans que l'abstract précise les effectifs ni les métriques chiffrées de performance. Ce travail adresse un verrou concret pour les déploiements en milieu professionnel : aujourd'hui, un robot de livraison intérieure ou un AMR logistique optimise vitesse et sécurité selon des paramètres fixes, incapable d'adapter son comportement si un opérateur lui dit "ralentis dans la zone de picking" ou "évite le couloir principal le matin". L'architecture proposée résout ce problème sans réentraînement : la mémoire de règles est mise à jour à chaud via langage naturel, ce qui réduit dramatiquement le coût d'intégration pour un déploiement B2B. La séparation claire entre raisonnement sémantique de haut niveau (VLM/LLM) et contrôle temps-réel (MORL) est également un argument industriel sérieux, car elle permet de changer le backbone LLM sans toucher à la politique de bas niveau. Ce type d'approche s'inscrit dans une tendance académique forte depuis 2023 : l'utilisation de fondational models comme couche d'interprétation au-dessus de politiques de contrôle classiques, popularisée notamment par les travaux sur les VLA (Vision-Language-Action models) chez Google DeepMind ou Stanford. La différence ici est la persistance explicite des règles en mémoire et l'utilisation de MORL plutôt que d'une politique end-to-end, ce qui offre davantage de contrôle et de transparence. Aucun partenaire industriel ni timeline de commercialisation ne sont mentionnés, ce travail restant pour l'instant une contribution de recherche. La prochaine étape naturelle serait de valider le système sur des robots commerciaux comme le Spot de Boston Dynamics ou des AMR de Locus Robotics, et d'étendre les expériences aux environnements extérieurs ou aux contextes multi-utilisateurs.

IA physiqueOpinion
1 source
Nautilus : de l'invite textuelle à l'apprentissage robotique prêt à l'emploi
3827arXiv cs.RO 

Nautilus : de l'invite textuelle à l'apprentissage robotique prêt à l'emploi

Des chercheurs ont publié le 16 mai 2026 sur arXiv (référence 2605.11665) NAUTILUS, un cadre logiciel open-source conçu pour résoudre l'un des problèmes structurels de la recherche en apprentissage robotique : la fragmentation des implémentations. Aujourd'hui, chaque combinaison de politique d'apprentissage (policy), de simulateur ou benchmark, et de robot physique nécessite du code de liaison (glue code) écrit à la main, formant une matrice de combinaisons qui rend le portage d'un seul élément extrêmement coûteux en ingénierie. NAUTILUS propose une interface unifiée pilotée par une simple instruction en langage naturel, par exemple "évalue la politique A avec le benchmark B", pour générer automatiquement les workflows de reproduction, d'évaluation, de fine-tuning et de déploiement correspondants. Le système génère lui-même les adaptateurs et conteneurs nécessaires, y compris pour des politiques ou simulateurs apportés par l'utilisateur, et inclut des étapes de validation et de tests automatisés à chaque jalon. L'impact potentiel pour la communauté de recherche en robotique est significatif : la reproductibilité des expériences, longtemps considérée comme un frein majeur à la comparaison inter-familles de politiques (VLA, diffusion policies, imitation learning classique), pourrait être accélérée sans surcoût d'ingénierie. Pour les équipes qui évaluent des approches sim-to-real ou qui cherchent à valider un modèle sur plusieurs benchmarks simultanément, NAUTILUS réduit la surface de friction entre la recherche et l'expérimentation à grande échelle. Il faut toutefois souligner que le papier présente un système dont la portée réelle dépendra du nombre de politiques et benchmarks effectivement intégrés dans l'écosystème open-source au fil du temps, la valeur du framework est indexée sur son adoption. La fragmentation décrite dans l'article est un problème bien documenté dans la communauté : des projets comme Lerobot (HuggingFace), RoboMimic (Stanford) ou RoboCasa ont chacun développé leurs propres interfaces, rendant la comparaison directe laborieuse. NAUTILUS s'inscrit dans une tendance plus large d'outillage de la recherche en robotique, aux côtés d'initiatives comme le benchmark Open-X Embodiment ou les efforts de standardisation autour de la norme URDF/MJCF. Les auteurs annoncent un dépôt open-source, mais aucune date de disponibilité publique ni liste de politiques déjà supportées n'est précisée dans l'abstract, des informations déterminantes pour évaluer la maturité réelle du projet.

RecherchePaper
1 source
EvoNav : conception évolutionnaire de fonctions de récompense pour la navigation robotique avec des grands modèles de langage
3828arXiv cs.RO 

EvoNav : conception évolutionnaire de fonctions de récompense pour la navigation robotique avec des grands modèles de langage

Un préprint déposé sur arXiv le 16 mai 2025 (référence 2605.11859) présente EvoNav, un cadre évolutionnaire automatisant la conception de fonctions de récompense pour la navigation robotique en environnements dynamiques peuplés d'humains. Le problème de fond : en reinforcement learning (RL), la qualité d'une politique de navigation dépend directement de sa fonction de récompense, un processus manuel coûteux en expertise et porteur de biais difficilement auditables. EvoNav confie cette tâche à un grand modèle de langage (LLM) dans une boucle évolutionnaire. Chaque candidat-récompense proposé par le LLM est évalué selon une procédure en trois étapes progressives : proxies analytiques peu coûteux (petits jeux de données, règles analytiques), rollouts légers, puis entraînement complet de la politique. Cette progression évite d'entraîner une politique complète pour chaque candidat, réduisant significativement le coût de calcul. Les auteurs concluent qu'EvoNav surpasse les récompenses artisanales et les méthodes de référence actuelles, sans détailler les métriques précises dans le résumé disponible. Pour les équipes développant des robots sociaux ou des AMR en environnements non structurés, l'enjeu est structurel : le reward engineering est l'une des étapes les plus chronophages du développement RL, nécessitant des allers-retours coûteux entre experts domaine et ingénieurs ML. Automatiser ce processus via LLM déplace le goulot d'étranglement de l'expertise tacite vers une boucle d'optimisation pilotée par données. Point de vigilance : le papier est un préprint sans relecture par les pairs, et les comparaisons avec l'état de l'art manquent de détails sur les benchmarks et les configurations de test utilisées, ce qui rend difficile une évaluation indépendante des gains annoncés. EvoNav s'inscrit dans un courant initié notamment par EUREKA (NVIDIA, 2023), qui avait démontré que GPT-4 pouvait générer des récompenses surpassant des experts humains sur des tâches de dextérité en manipulation. La navigation sociale est un terrain plus difficile, car elle implique la prédiction de comportements humains en temps réel dans des espaces ouverts. Aucun partenaire industriel ni institution de recherche n'est identifié dans le document accessible ; les prochaines étapes naturelles seraient une validation sur robot physique et une comparaison directe avec des approches VLA (vision-language-action), qui constituent une alternative architecturale de plus en plus crédible pour la navigation en environnement ouvert.

RecherchePaper
1 source
Remarques sur le clonage stochastique et le filtrage à états différés
3829arXiv cs.RO 

Remarques sur le clonage stochastique et le filtrage à états différés

Un article de recherche publié sur arXiv (identifiant 2508.21260, version 2) remet en question une pratique établie dans les systèmes de navigation et de robotique : le clonage stochastique (SC, stochastic cloning). Cette technique, utilisée pour traiter les mesures dépendant d'états antérieurs comme l'odométrie, qui quantifie le déplacement relatif d'un robot entre deux instants, repose sur l'augmentation du vecteur d'état afin de capturer les corrélations avec les estimations passées. Les auteurs démontrent qu'une alternative plus ancienne, le filtre de Kalman à états différés (DSKF, delayed-state Kalman filter), correctement dérivée, produit exactement les mêmes mises à jour d'état et de covariance que le SC, sans nécessiter d'augmentation du vecteur d'état. Deux formulations équivalentes du DSKF sont présentées, offrant des perspectives complémentaires sur le traitement de ces corrélations dans le cadre du filtre de Kalman généralisé. Ce résultat est significatif pour les ingénieurs qui conçoivent des systèmes de navigation embarqués, de SLAM (Simultaneous Localization and Mapping) ou d'intégration IMU/odométrie. Le clonage stochastique, bien qu'efficace, alourdit le vecteur d'état à chaque mesure différée, ce qui représente un coût mémoire et computationnel non négligeable sur des plateformes contraintes comme les drones, rovers ou robots mobiles AMR. Les auteurs montrent que les deux approches sont équivalentes en complexité asymptotique, et qu'une des formulations DSKF offre une réduction des coûts arithmétiques et de stockage pour certaines configurations dimensionnelles. Le papier corrige également un préjugé persistant dans la communauté : l'idée que les variantes du filtre de Kalman sont intrinsèquement incapables de traiter des mesures corrélées à des états passés. Le filtre de Kalman reste un pilier de la théorie de l'estimation depuis les années 1960, et ses extensions (EKF, UKF) sont omniprésentes en robotique et aérospatiale. Le clonage stochastique a été popularisé dans les années 2000, notamment via les travaux de Roumeliotis sur la navigation vision-inertielle, précurseurs du filtre MSCKF aujourd'hui au coeur de systèmes comme OpenVINS. En réhabilitant le DSKF comme alternative algorithmiquement compétitive, ce travail invite les équipes de recherche et de développement à reconsidérer leur outillage, en particulier pour les applications embarquées à ressources limitées. Il s'agit pour l'instant d'un preprint sans implémentation publique ni validation industrielle annoncée.

RecherchePaper
1 source
Contacts corps rigides lisses formulés comme un ReLCP : un problème de complémentarité linéaire généré récursivement
3830arXiv cs.RO 

Contacts corps rigides lisses formulés comme un ReLCP : un problème de complémentarité linéaire généré récursivement

Des chercheurs publient sur arXiv (référence 2506.14097) une reformulation des méthodes de simulation de contact entre corps rigides lisses, en introduisant le concept de "Problème de Complémentarité Linéaire Récursivement Généré" (ReLCP). Là où les approches classiques discrétisent les surfaces en maillages ou en assemblages de sphères pour détecter les collisions, cette méthode opère directement sur la géométrie lisse sous-jacente. Concrètement, elle part d'un LCP mono-contrainte standard (dit SNSD, shared-normal signed-distance), puis augmente itérativement le système uniquement lorsque la mise à jour temporelle prédirait une interpénétration des surfaces réelles, limitant ainsi l'explosion combinatoire du nombre de contraintes actives. Les auteurs démontrent formellement que pour des corps strictement convexes et des pas de temps suffisamment petits, l'augmentation récursive se termine en un nombre fini d'itérations et produit une mise à jour de vitesse discrète unique. À la limite des petits pas de temps, la méthode se réduit au LCP SNSD classique. Les validations numériques portent sur des ellipsoïdes en collision, des suspensions denses d'ellipsoïdes, des colonies bactériennes en croissance, et des réseaux de cotte de mailles. L'enjeu pour les développeurs de simulateurs physiques est direct : les approches par proxy-surface souffrent d'un défaut bien documenté, améliorer la fidélité géométrique multiplie le nombre de contraintes et dégrade les performances de manière non linéaire. Le ReLCP contourne ce problème en n'activant des contraintes supplémentaires qu'à la demande, ce qui se traduit, selon les auteurs, par des réductions substantielles du nombre de contraintes actives et du temps de calcul, ainsi qu'une interpénétration bornée sans rugosité artificielle induite par la discrétisation. Pour les équipes travaillant sur la simulation de robots manipulant des objets convexes denses (granulats, composants d'assemblage), ou sur des systèmes biologiques computationnels, c'est une alternative concrète aux formulations de surfaces discrètes. Sur le plan du contexte, la simulation de contact par complémentarité est un champ de recherche actif depuis les travaux fondateurs des années 1990-2000 (Stewart, Trinkle, Anitescu), et reste centrale pour les moteurs physiques embarqués dans les simulateurs robotiques comme MuJoCo, Isaac Sim ou Bullet. La méthode s'inscrit dans une tendance plus large visant à exploiter directement la géométrie analytique (fonctions de distance signée, formes implicites) plutôt que des approximations discrètes. Aucune implémentation commerciale ni partenariat industriel n'est annoncé dans ce preprint : il s'agit d'un résultat théorique et numérique dont l'intégration dans des outils de simulation grand public reste à évaluer.

RecherchePaper
1 source
X-Imitator : apprentissage par imitation spatial via interaction bidirectionnelle action-pose
3831arXiv cs.RO 

X-Imitator : apprentissage par imitation spatial via interaction bidirectionnelle action-pose

Des chercheurs ont déposé le 13 mai 2026 sur arXiv (2605.12162) X-Imitator, un cadre d'apprentissage par imitation pour la manipulation robotique fondé sur un couplage bidirectionnel entre perception spatiale et génération d'actions. L'architecture duale fonctionne par conditionnement mutuel : les prédictions de pose courante sont conditionnées sur les actions passées, et les actions générées tiennent compte des estimations de pose réactualisées en retour. Évalué sur 24 tâches simulées et 3 tâches en environnement réel, X-Imitator surpasse selon les auteurs les politiques visuomotrices de base ("vanilla policies") ainsi que les méthodes exploitant un guidage de pose explicite mais unidirectionnel. Le code source sera rendu public. Le verrou adressé est bien identifié dans la littérature : les approches actuelles traitent perception et exécution comme deux modules découplés, ou reliés au mieux de façon unidirectionnelle. X-Imitator instaure une boucle de raffinement mutuel continu, que les auteurs rapprochent des modèles prospectifs internes ("forward models") du système moteur humain. En pratique, la politique corrige ses estimations de pose à la lumière de ses propres actions passées, mécanisme potentiellement utile dans les tâches à contacts multiples ou à déformation d'objet, où les erreurs de perception s'accumulent. L'architecture modulaire est conçue pour s'intégrer à diverses politiques visuomotrices existantes, ce qui lui confère une portée plus large qu'un système monolithique. À noter cependant : l'évaluation réelle se limite à 3 tâches, et le papier reste un preprint non encore relu par les pairs. X-Imitator s'inscrit dans le courant de l'apprentissage par imitation appliqué à la manipulation fine, discipline en forte expansion depuis Diffusion Policy (Chi et al., 2023) et ACT (Zhao et al., 2023). Face aux politiques hybrides perception-action portées par des groupes comme DeepMind, Stanford ou Physical Intelligence avec pi-zero, le système se positionne comme un module d'amélioration orthogonal plutôt qu'une architecture concurrente de remplacement. Aucun partenaire industriel ni calendrier de transfert applicatif n'est mentionné dans la publication : X-Imitator reste un résultat académique. La mise en open source annoncée du code permettra à la communauté de valider les performances sur des benchmarks partagés comme RLBench ou ManiSkill, étape nécessaire avant toute adoption à plus grande échelle.

RecherchePaper
1 source
SAGAS : assemblage par graphe sémantique pour la planification hors ligne en logique temporelle
3832arXiv cs.RO 

SAGAS : assemblage par graphe sémantique pour la planification hors ligne en logique temporelle

Des chercheurs ont déposé sur arXiv (référence 2512.00775, version 2, 2025) un cadre baptisé SAGAS (Semantic-Aware Graph-Assisted Stitching) pour la planification robotique à long horizon à partir de données hors-ligne uniquement. Le problème ciblé : piloter un agent pour exécuter des tâches complexes décrites en logique temporelle linéaire (LTL), un formalisme mathématique exprimant des séquences de conditions du type "atteindre A, puis B, tout en évitant C", sans modèle de dynamique, sans démonstrations spécifiques à la tâche, et sans interaction en ligne avec l'environnement. SAGAS apprend deux composants offline à partir de fragments de trajectoires hétérogènes : un graphe latent d'atteignabilité réutilisable, et un exécuteur conditionné sur des objectifs figé après l'entraînement. Pour chaque nouvelle formule LTL au moment du test, le système augmente ce graphe avec des propositions sémantiques, puis applique une recherche en produit de Büchi pour synthétiser un plan de waypoints "prefix-suffix" à coût minimisé, exécuté par l'exécuteur figé. Les expériences portent sur les domaines de locomotion d'OGBench, une suite de benchmarks offline standard dans la communauté. La contribution centrale revendiquée est la généralisation zero-shot à des spécifications LTL non vues à l'entraînement, sans récompense tâche-spécifique ni réentraînement de politique. C'est une distinction structurelle face aux deux familles dominantes : la synthèse symbolique model-based exige un système de transitions étiqueté précis, difficile à construire sur du matériel réel, tandis que les méthodes d'apprentissage par renforcement supposent généralement une interaction en ligne ou des démonstrations dédiées. SAGAS déplace le raisonnement propre à chaque formule vers une augmentation de graphe et une recherche symbolique au temps d'inférence, découplant ainsi la capacité de généralisation du processus d'entraînement. À noter : les validations sont entièrement simulées sur OGBench ; le gap sim-to-real n'est pas adressé, ce qui limite la portée industrielle immédiate. La planification LTL en robotique mobilise un nombre croissant d'équipes, portée par le besoin de comportements vérifiables formellement sur des robots industriels et de service. Les approches concurrentes couvrent un spectre large : planification par diffusion (Diffuser, Decision Diffuser), politiques conditionnées par langage naturel via des VLA (vision-language-action models), et combinaisons de model checking avec du renforcement offline sur D4RL (IQL, CQL). SAGAS occupe la niche "offline + symbolique + zero-shot LTL", encore peu exploitée. Aucun déploiement matériel ni partenariat industriel n'est annoncé ; les suites logiques seraient une validation sur plateforme physique et une extension à des environnements à espace d'état plus riche.

RecherchePaper
1 source
Apprendre ce qui compte : objectifs adaptatifs fondés sur la théorie de l'information pour l'exploration robotique
3833arXiv cs.RO 

Apprendre ce qui compte : objectifs adaptatifs fondés sur la théorie de l'information pour l'exploration robotique

Une équipe de chercheurs a publié en mai 2025 sur arXiv (référence 2605.12084) une méthode appelée Quasi-Optimal Experimental Design, ou QOED, visant à résoudre un problème fondamental de l'exploration robotique : comment guider un robot vers les expériences qui lui apprendront réellement quelque chose d'utile ? La méthode repose sur une analyse de l'espace propre de la matrice d'information de Fisher pour identifier les directions de paramètres réellement observables, puis modifie l'objectif d'exploration pour concentrer l'effort sur ces directions tout en atténuant l'influence des paramètres secondaires ("nuisance"). Évaluée sur des tâches de navigation et de manipulation en simulation et en conditions réelles, QOED génère un gain de performance de 35,23 % grâce à la sélection des directions identifiables, et de 21,98 % supplémentaires via la suppression des effets parasites. Intégrée comme objectif d'exploration dans une boucle d'optimisation de politique model-based, elle surpasse les baselines classiques de RL. Ce résultat compte parce qu'il attaque directement le goulot d'étranglement de l'apprentissage actif en robotique : dans les systèmes haute dimension (bras articulés, manipulation dextre, navigation en environnement non structuré), une large fraction des paramètres du modèle est faiblement observable, voire non identifiable. Les méthodes classiques de curiosité ou d'information gain mesurent une incertitude globale sans distinguer ce qui peut être réduit par l'expérience de ce qui ne le peut pas. QOED fournit une approximation à facteur constant de l'objectif idéal théorique, une garantie formelle rare dans ce champ, ce qui lui confère une légitimité au-delà de la démonstration empirique seule. La méthode s'inscrit dans une longue tradition de théorie du design expérimental optimal (OED) issue des statistiques, ici adaptée au cadre RL avec optimisation en ligne. Sur le plan concurrentiel, les approches voisines incluent les méthodes de curiosité bayésienne (type DIAYN ou LEXA) et les objectifs d'information mutuelle comme VIME ou Plan2Explore. QOED se distingue par son ancrage théorique rigoureux et l'explicitation du sous-espace identifiable, deux points que les méthodes heuristiques négligent. Aucun déploiement industriel ni partenaire n'est mentionné : il s'agit à ce stade d'un résultat académique, dont l'intégration dans des pipelines de calibration ou de sim-to-real reste à valider à plus grande échelle.

RecherchePaper
1 source
Rollbot : un robot sphérique propulsé par un seul actionneur
3834arXiv cs.RO 

Rollbot : un robot sphérique propulsé par un seul actionneur

Rollbot, présenté dans un article de recherche déposé sur arXiv (réf. 2404.05120v2, révision 2024), est un robot sphérique prototype capable de se déplacer de façon contrôlée sur un plan 2D avec un seul actionneur. Le robot roule au sol en décrivant des arcs de cercle et ajuste la courbure de sa trajectoire en accélérant et décélérant son unique moteur ainsi que la masse solidaire attachée à celui-ci. Les auteurs ont dérivé des lois de contrôle fondées sur une dynamique dite "quasi-stable", et ont validé expérimentalement la capacité du système à suivre des waypoints successifs. Aucune institution ni source de financement n'est mentionnée dans l'abstract public. Ce travail remet en cause une contrainte de conception longtemps tenue pour acquise dans la robotique sphérique: l'obligation d'utiliser au minimum deux actionneurs pour obtenir un mouvement plan maîtrisé. Ramener ce seuil à un seul actionneur réduit mécaniquement la complexité structurelle, la consommation énergétique et le nombre de points de défaillance potentiels. Pour les concepteurs de robots d'inspection en espace confiné, de plateformes de surveillance ou de démonstrateurs éducatifs, cette approche peut ouvrir des architectures plus légères et moins coûteuses à produire. Il faut cependant noter que les résultats sont présentés en contexte laboratoire; aucune métrique de robustesse sur terrain non contrôlé ni de cycle de production n'est communiquée. Les robots sphériques à actionnement interne existent depuis les années 1990 dans la recherche académique, avec des prototypes issus de MIT, ETH Zurich ou Carnegie Mellon, et ont trouvé des applications limitées dans la surveillance et l'exploration. Côté produits grand public, Sphero a popularisé la forme, mais sans ambition de navigation autonome précise. Le créneau du robot sphérique à un seul actionneur reste un espace purement expérimental; la prochaine étape logique serait de démontrer la robustesse aux perturbations extérieures (surface irrégulière, contact), d'étendre le cadre théorique à la navigation 3D, et d'évaluer l'intégration de capteurs embarqués dans un volume aussi contraint.

RecherchePaper
1 source
Pro Universe Robotics dévoile sa gamme de produits d'IA incarnée industrielle 2.0
3835Pandaily 

Pro Universe Robotics dévoile sa gamme de produits d'IA incarnée industrielle 2.0

Pro Universe Robotics a présenté son "Product Matrix 2.0", comprenant deux nouvelles offres : AcCI, une solution d'acquisition de données multimodale à précision sub-millimétrique, et le module Dabai, dédié au chargement et déchargement intelligent par robot. AcCI intègre des technologies de contrôle maître-esclave, de téléopération VR et de manette, et capture des données de force, couple, pose, retour tactile et vision, avec une boucle fermée end-to-end. La société lance simultanément une stratégie d'écosystème baptisée "1+N+infinity" et recrute des partenaires mondiaux pour cibler ce qu'elle décrit comme un marché d'intelligence incarnée industrielle à "trillion de yuans" (environ 138 milliards de dollars). Fondée il y a 16 mois seulement, l'entreprise n'a communiqué ni client ni déploiement terrain confirmé. La collecte de données haute qualité reste l'un des principaux goulots d'étranglement pour le déploiement à grande échelle de robots industriels physiquement intelligents. Une solution d'acquisition multimodale en boucle fermée - force, couple, tactile, visuel, pose - répond directement à ce besoin, notamment pour entraîner des VLA (Vision-Language-Action models) sur des tâches de manipulation complexe comme le chargement et déchargement de pièces. Si la précision sub-millimétrique annoncée se confirme en conditions réelles, ce serait un atout concret pour constituer des datasets d'entraînement denses. Cependant, le communiqué ne fournit ni benchmark indépendant, ni volume de données collectées, ni résultats mesurables sur le terrain. Pro Universe Robotics s'inscrit dans un secteur très compétitif : Physical Intelligence avec Pi-0, Figure AI avec le Figure 03, Apptronik, mais aussi des acteurs spécialisés dans la téléopération et la capture de données comme Embodied Intelligence ou Scale AI. La revendication "global-first" sur l'acquisition fusionnée haute précision est difficile à vérifier sans étude comparative indépendante. L'ambition affichée d'un marché au trillion de yuans est une projection courante dans les annonces robotiques chinoises, où l'écart entre ambition déclarée et réalité commerciale reste souvent important. La prochaine étape déterminante sera la signature de partenaires industriels concrets au sein de l'écosystème annoncé.

Chine/AsieActu
1 source
Le côté obscur des robots chiens Unitree
3836Hackaday Robots Hacks 

Le côté obscur des robots chiens Unitree

Le créateur de contenu et ingénieur indépendant Benn Jordan a publié une analyse approfondie des robots quadrupèdes commerciaux grand public, ciblant notamment la gamme de Unitree Robotics. Ce fabricant chinois s'est imposé sur le marché en proposant des chiens robots à quelques milliers de dollars, un prix très inférieur aux concurrents comme Boston Dynamics, embarquant Lidar, puissance de calcul embarquée et connectivité Wi-Fi. Jordan a découvert une faille d'exécution de commandes arbitraires exploitable directement via le champ de saisie du mot de passe Wi-Fi, référencée sous CVE-2025-2894 et publiée en 2025. Plus préoccupant encore : le firmware génère du trafic réseau vers des serveurs chinois, mais uniquement lorsque le robot détecte qu'il n'est pas surveillé. Sur le plan mécatronique, le placement du Lidar sous la tête crée d'importants angles morts derrière et autour de l'appareil, rendant la surveillance périmétrique autonome pratiquement inapplicable. Ces constats sont particulièrement problématiques pour les intégrateurs industriels et les décideurs B2B qui évaluent ces plateformes pour des missions d'inspection ou de sécurité. CVE-2025-2894 expose n'importe quel réseau local à une compromission complète par simple proximité Wi-Fi, sans authentification préalable. Le trafic sortant conditionnel renforce les doutes sur la chaîne d'approvisionnement logicielle, un vecteur de risque déjà documenté dans d'autres catégories de matériel IoT d'origine chinoise. Ces vulnérabilités ne sont pas compensées par les performances brutes de la plateforme et illustrent que le bas coût s'accompagne de compromis sérieux sur la sécurité opérationnelle. Unitree Robotics s'est positionné comme l'alternative économique face à Boston Dynamics (Spot, environ 75 000 dollars), ANYbotics (ANYmal) et Ghost Robotics. Aucun correctif officiel pour CVE-2025-2894 n'a été confirmé au moment de l'analyse. Des contournements existent, isolation réseau, filtrage du trafic sortant, mais ils déplacent la charge de sécurité sur l'opérateur, ce qui reste une posture structurellement fragile. La tendance à intégrer ces robots dans des environnements industriels et de défense rend la situation d'autant plus préoccupante que les mises à jour firmware demeurent opaques et difficiles à auditer sans accès au code source.

Societe/EthiqueActu
1 source
Comau et OMRON Robotics s'associent pour proposer leurs robots à davantage de secteurs industriels
3837Robotics Business Review 

Comau et OMRON Robotics s'associent pour proposer leurs robots à davantage de secteurs industriels

Comau SpA, le spécialiste italien de l'automatisation industrielle basé à Turin, et OMRON Robotics, filiale robotique d'Omron Industrial Automation dont le siège est à Pleasanton (Californie), ont annoncé un partenariat stratégique visant à accélérer conjointement le déploiement de l'automatisation dans l'industrie mondiale. L'accord, annoncé le 11 mai 2026, cible en priorité quatre secteurs à forte croissance : l'électronique, les semi-conducteurs, la fabrication médicale et l'intralogistique industrielle légère. Les deux PDG, Pietro Gorlier pour Comau et Olivier Welker pour OMRON Robotics, ont confirmé l'initiative sans en préciser les modalités financières ni les engagements de chiffre d'affaires commun. Les sociétés prévoient d'intégrer du matériel robotique, des technologies de contrôle avancées et des plateformes logicielles d'automatisation, avec des initiatives conjointes supplémentaires à l'étude. OMRON a par ailleurs élargi le mois dernier les options de configuration mât de son AMR OL-450S, illustrant une dynamique produit active en parallèle du rapprochement. Ce partenariat répond à une tension réelle du marché : les intégrateurs et les industriels cherchent des solutions qui s'insèrent aussi bien dans des lignes de production existantes que dans des environnements de nouvelle génération, sans multiplier les intégrateurs spécialisés. En combinant le portefeuille OMRON, reconnu pour ses robots industriels, collaboratifs et mobiles ainsi que ses environnements de programmation à déploiement rapide, avec la base installée de Comau dans l'automobile, l'e-mobilité, la pharmacie et la logistique, les deux acteurs visent une offre plus large et accessible à l'échelle mondiale. La portée réelle de la collaboration reste à vérifier dans la pratique : l'annonce est, pour l'instant, une déclaration d'intention sans déploiement client documenté ni métriques de performance communes publiées. Comau, présent dans plus de 30 pays et anciennement dans l'orbite de Stellantis, a engagé depuis deux ans une diversification active hors de l'automobile, notamment avec l'acquisition d'Automha SpA (Bergame, Italie), spécialiste de l'intralogistique globale présenté à MODEX en avril. OMRON Robotics s'appuie sur l'écosystème mondial d'Omron, groupe japonais pesant plusieurs milliards de dollars dans l'automatisation industrielle. Sur ce segment de la robotique légère et de la manutention flexible, les deux entreprises se retrouvent en concurrence directe avec des alliances similaires impliquant Universal Robots, Fanuc ou Yaskawa Motoman. Roberto Mendes Cutrupi, directeur de la business unit Amérique du Nord de Comau, prendra la parole lors du Robotics Summit & Expo de Boston le 28 mai 2026, première occasion publique de préciser la feuille de route opérationnelle de cette collaboration.

FR/EU ecosystemeOpinion
1 source
Infineon lance un défi dédié aux startups de la robotique humanoïde pour 2026
3838Robotics & Automation News 

Infineon lance un défi dédié aux startups de la robotique humanoïde pour 2026

Infineon Technologies a lancé en 2026 son Startup Challenge annuel en le centrant cette année sur la robotique humanoïde. Le programme, ouvert à des équipes fondatrices et des jeunes entreprises high-tech du monde entier, est conçu pour transformer des concepts technologiques en applications commercialisables. Il s'inscrit dans le cadre du Co-Innovation Program global d'Infineon, un dispositif structuré de co-développement entre le groupe et des startups sélectionnées. L'initiative signale que la couche composants et semi-conducteurs commence à se structurer autour du marché humanoïde émergent. Infineon fournit des briques critiques pour la robotique : microcontrôleurs, capteurs radar et LiDAR, puces de gestion de l'énergie, et circuits de contrôle moteur. Impliquer des startups humanoïdes dès la phase de conception permet à Infineon de s'ancrer tôt dans les architectures matérielles qui deviendront des standards. Pour les porteurs de projets robotiques, l'accès à un partenaire industriel de ce niveau représente un levier d'accélération concret sur la fiabilité des composants et la mise à l'échelle de la production. Il convient cependant de noter que l'annonce reste à ce stade un appel à candidatures sans résultats ni métriques publiées. Infineon, groupe allemand coté au DAX avec un chiffre d'affaires de plus de 14 milliards d'euros en 2024, est l'un des rares acteurs européens disposant d'une surface suffisante pour peser dans la course humanoïde sans construire de robot. Cette posture de fournisseur stratégique de composants le place en concurrent indirect de TI, STMicroelectronics (franco-italien) et des divisions semi-conducteurs de Renesas ou Bosch, qui ciblent eux aussi le marché robotique en pleine expansion.

FR/EU ecosystemeOpinion
1 source
Exotec s'associe à Musinsa pour automatiser l'entrepôt de cette marque de K-fashion en pleine croissance
3839Robotics & Automation News 

Exotec s'associe à Musinsa pour automatiser l'entrepôt de cette marque de K-fashion en pleine croissance

Exotec, entreprise française de robotique logistique fondée en 2015 à Lille, annonce son premier déploiement commercial en Corée du Sud en partenariat avec Musinsa, principale plateforme de mode coréenne (K-fashion). Le projet consiste à équiper un nouvel entrepôt automatisé de Musinsa avec le système Skypod d'Exotec, des robots AMR capables de grimper sur des structures de rayonnage à grande hauteur pour préparer les commandes. Les détails opérationnels précis (nombre de robots, capacité de stockage, débit horaire) ne sont pas divulgués dans l'annonce, ce qui limite l'évaluation indépendante des performances annoncées. Ce contrat représente une étape stratégique dans la pénétration du marché asiatique par Exotec, après une implantation au Japon ces dernières années. Pour Musinsa, dont la croissance internationale s'accélère portée par l'engouement mondial pour la mode coréenne, l'automatisation de la logistique est un levier direct de scalabilité : réduire le coût de traitement par commande et absorber les pics saisonniers sans recrutement proportionnel. Ce type de déploiement confirme que les solutions de goods-to-person à robots grimpants trouvent preneurs dans la mode en ligne, un secteur à forte variabilité SKU et cadences irrégulières. Exotec a levé 335 millions de dollars en Serie D en 2022, atteignant le statut de licorne, et compte parmi ses clients Decathlon, 3PL Geodis ou encore Carrefour en Europe. La compétition sur le segment goods-to-person est intense, avec AutoStore (norvégien, très présent en logistique mode), Hai Robotics (chinois, fortement implanté en Asie), et Symbotic côté américain. L'entrée en Corée du Sud positionne Exotec dans un marché e-commerce dynamique avant une éventuelle introduction en bourse évoquée par la direction.

FR/EU ecosystemeOpinion
1 source
Comau s'associe à Omron pour accélérer l'automatisation industrielle avancée dans les secteurs manufacturiers en forte croissance
3840Robotics & Automation News 

Comau s'associe à Omron pour accélérer l'automatisation industrielle avancée dans les secteurs manufacturiers en forte croissance

Comau, filiale robotique de Stellantis basée en Italie, et Omron Robotics, division automation du groupe japonais Omron Corporation, ont signé un accord de collaboration stratégique destiné à accélérer le déploiement de solutions d'automatisation industrielle avancée. Le partenariat cible quatre segments à forte croissance : l'électronique, les semi-conducteurs, la fabrication médicale et l'intralogistique industrielle légère. L'accord porte sur la commercialisation conjointe de solutions flexibles et rapidement déployables, sans que les termes financiers ni les premières installations clients n'aient été communiqués à ce stade. L'intérêt industriel de ce rapprochement tient à la complémentarité des portefeuilles : Comau apporte ses bras robotiques industriels et cobots (dont la gamme AURA) ainsi que son expertise en intégration de lignes complexes, tandis qu'Omron couvre la mobilité autonome (AMR série LD/HD) et les robots collaboratifs TM. Pour un intégrateur ou un COO industriel, cette alliance réduit le nombre d'interlocuteurs pour construire une cellule complète alliant manipulation fixe et transport autonome, un besoin réel dans les ateliers de semi-conducteurs ou de dispositifs médicaux où les flux sont fragmentés et les changements de série fréquents. Il convient toutefois de noter que l'annonce reste au stade de l'accord-cadre, sans déploiement terrain confirmé. Comau opère depuis les années 1970 et a renforcé son positionnement cobot et exosquelette (MATE) après son spin-off partiel de Stellantis. Omron Robotics, de son côté, concurrence directement MiR (Rockwell), Fetch Robotics (Zebra) et Locus Robotics sur le segment AMR. Ce type d'alliance entre robotique fixe et mobile suit une tendance observée chez ABB/Asti et FANUC/iLink, signalant que la course aux solutions d'automatisation bout-en-bout s'intensifie à l'échelle mondiale.

FR/EU ecosystemeActu
1 source
Vidéo : Unitree lance le premier robot à conduite optionnelle au monde prêt pour la production
3841Interesting Engineering 

Vidéo : Unitree lance le premier robot à conduite optionnelle au monde prêt pour la production

Unitree, le fabricant chinois de robots basé à Hangzhou, a dévoilé le GD01 : un robot mécha de 500 kilogrammes (avec pilote à bord) capable de passer d'une configuration bipède à une configuration quadrupède en quelques secondes. Le véhicule civil piloté accueille son opérateur dans un cockpit fixé sur le torse et atteint environ 1,6 fois la hauteur d'un adulte moyen en mode humanoïde. La vidéo de démonstration d'une minute montre le fondateur Wang Xingxing aux commandes : le GD01 marche en mode bipède, renverse un mur de briques, puis replie ses membres pour adopter une allure quadrupède sur terrain accidenté, sans assistance extérieure. Prix annoncé : 3,9 millions de yuan (573 674 dollars). Aucune fiche technique détaillée n'a été publiée à ce stade, et Unitree a émis un avis de sécurité rappelant les limites expérimentales de la robotique humanoïde. La même semaine, la société lançait un humanoïde haut du corps à 26 900 yuan (4 290 dollars), 31 degrés de liberté, avec bases modulaires fixe et mobile. Le GD01 inaugure une catégorie inédite dans la robotique civile, celle du véhicule mécha habité transformable. Mais c'est surtout le contexte de marché qui frappe : selon Omdia, les fabricants chinois ont pesé près de 90 % des ventes mondiales d'humanoïdes en 2025. Unitree aurait livré plus de 5 500 unités cette année-là, quand Tesla, Figure AI et Agility Robotics tournaient chacun autour de 150 expéditions sur la même période, selon le South China Morning Post. L'écart de prix creuse encore le fossé : le R1 d'Unitree est affiché à environ 6 000 dollars, le modèle AgiBot concurrent à 14 000 dollars, tandis qu'Elon Musk estime l'Optimus entre 20 000 et 30 000 dollars. Cette combinaison volume-prix remet en cause le postulat occidental selon lequel une avance technologique suffirait à justifier une prime de coût durable. Unitree commercialise déjà ses G1, R1 et le robot chien Go2 à l'international via AliExpress, couvrant l'Amérique du Nord, l'Europe et le Japon. En mars, la société a déposé un dossier d'IPO sur le STAR Market de Shanghai, visant une levée de 4,2 milliards de yuan (61 millions de dollars), dont 85 % alloués à la R&D et 2 milliards de yuan (29 millions de dollars) dédiés au développement de modèles robotiques. Ses humanoïdes apparaissent déjà en opérations réelles : Japan Airlines conduit des essais à l'aéroport de Haneda avec des systèmes Unitree et UBTech Robotics. Face à cette montée en puissance, les acteurs occidentaux comme Figure AI (Figure 03), Physical Intelligence (Pi-0) ou Boston Dynamics peinent à afficher des volumes comparables, tandis que le GD01 ouvre un segment véhicule-robot encore sans concurrence directe.

Chine/AsieOpinion
1 source
Hello Robot établit la référence en matière de robots domestiques pratiques et sûrs
3842IEEE Spectrum Robotics 

Hello Robot établit la référence en matière de robots domestiques pratiques et sûrs

Hello Robot annonce Stretch 4, une nouvelle version de son robot domestique non-humanoïde, conçu pour des déploiements pilotes réels dans des environnements résidentiels. La rupture principale avec les versions précédentes est l'intégration d'une base omnidirectionnelle : le robot peut désormais se translater dans n'importe quelle direction sans avoir à pivoter au préalable, grâce à des roues omnidirectionnelles initialement développées pour les fauteuils roulants motorisés, après six mois de développement dédié. La tête pan-tilt d'origine est remplacée par une suite sensorielle plus complète offrant un champ de vision nettement élargi : deux lidars hémisphériques, des caméras Luxonis pour la vision et la navigation, et une caméra de profondeur montée sur le poignet pour la manipulation. L'architecture de calcul repose sur un Intel NUC 15 pour le système principal, complété par un NVIDIA Jetson Orin NX mis à disposition des chercheurs pour le traitement visuel et l'IA. Le robot embarque des capacités autonomes de base (cartographie, navigation, autocharge) ainsi que des fonctionnalités de démonstration comme la saisie autonome d'objets. Aucun prix public n'a été communiqué, mais Hello Robot positionne Stretch 4 comme accessible comparé aux humanoïdes actuels. Ce lancement illustre une thèse alternative à la course aux humanoïdes : Aaron Edsinger (CEO) et Charlie Kemp (CTO) misent sur la sécurité, le coût maîtrisé et la praticabilité réelle plutôt que sur la morphologie anthropomorphe. La philosophie de Hello Robot sur l'autonomie tranche nettement avec le secteur : plutôt que de collecter massivement des données en espérant qu'une autonomie commercialement viable en émergera, l'entreprise conserve un opérateur humain dans la boucle, à des niveaux variables allant du contrôle direct à la supervision pure. Cette posture est plus prudente mais aussi plus immédiatement intégrable dans des contextes réels, notamment pour des intégrateurs ou des opérateurs non spécialisés. Sur le plan sensoriel, Hello Robot a renoncé à l'approche "Tesla" (multitude de caméras bon marché) au profit d'une logique "Waymo" : des données plus riches et fiables pour un comportement plus sûr et intelligent, au détriment potentiel du coût. Stretch existe depuis plusieurs années comme plateforme de recherche, avec une communauté active dans les laboratoires universitaires. Hello Robot a été fondé sur le principe du robot minimaliste, et Stretch 4 est le premier modèle explicitement conçu pour franchir le seuil vers des déploiements opérationnels. Le secteur de la robotique humanoïde est actuellement dominé par des acteurs très capitalisés comme Figure (Figure 03), Tesla (Optimus Gen 3), Physical Intelligence (Pi-0) et NVIDIA (GR00T N2), tous positionnés sur des cas d'usage industriels ou logistiques. Hello Robot occupe une niche différente : le marché domestique et de service, avec une approche morphologiquement sobre et des coûts structurellement plus bas. La prochaine étape annoncée est une phase de déploiements pilotes en environnement résidentiel réel, destinée à qualifier les conditions de passage à l'échelle.

IA physiqueOpinion
1 source
Unitree dévoile le GD01 : premier mécha transformable portant un humain produit en série, à 3,9 millions de yuans
3843Pandaily 

Unitree dévoile le GD01 : premier mécha transformable portant un humain produit en série, à 3,9 millions de yuans

Unitree Robotics a dévoilé début mai 2026 le GD01, un robot mécha à transformation capable de transporter un passager humain à bord, affiché à 3,9 millions de yuans (environ 540 000 dollars). Le PDG Wang Xingxing a lui-même réalisé la démonstration en vidéo. Physiquement, l'engin mesure environ 1,5 fois la taille d'un adulte pour une masse de 500 kg passager inclus, ce qui en fait un système hors norme dans la catégorie robotique. Le GD01 dispose de deux modes locomoteurs : en configuration humanoïde bipède, il marche debout et a été filmé en train de perforer un mur de briques d'un seul coup de poing sans oscillation visible ; en configuration quadrupède, il abaisse son centre de gravité, replie ses membres et bascule de forme en quelques secondes pour traverser des terrains complexes, opérateur à bord. Unitree le présente comme le premier mécha transportant un humain à atteindre le stade de la production en série à l'échelle mondiale, une affirmation que la vidéo de lancement tend à valider en termes de démonstration physique, sans que les métriques opérationnelles (autonomie, vitesse, charge utile statique vs dynamique) aient été communiquées. L'importance de cette annonce dépasse le gadget spectaculaire. Dans un secteur humanoïde où la majorité des acteurs bataille encore sur des cycles de marche à 2 km/h et des charges utiles inférieures à 20 kg, Unitree positionne un système à 500 kg en mode transport humain, soit un défi d'ingénierie mécatronique et de contrôle radicalement différent. La capacité de transformation bipède-quadrupède intégrée en quelques secondes, si elle se confirme en conditions réelles, résoudrait partiellement le problème classique du trade-off stabilité-mobilité qui plombe les robots à pattes sur terrain non structuré. Pour les intégrateurs industriels et les décideurs B2B, le signal est double : d'une part, la frontière entre robot de service et véhicule robotisé commence à s'effacer ; d'autre part, le niveau de confiance requis pour embarquer un humain impose des certifications de sécurité fonctionnelle (SIL/ISO 13849) qui n'ont pas encore été évoquées par Unitree, ce qui constitue la principale incertitude pour un déploiement commercial sérieux. Unitree, fondée par Wang Xingxing et basée à Hangzhou, s'est imposée ces dernières années comme le fabricant de robots quadrupèdes grand public le plus agressif sur les prix, avec la série Go et le bipède G1 à 16 000 dollars. Fin avril 2026, la société venait de lancer un robot humanoïde à deux bras à partir de 26 900 yuans et d'ouvrir une boutique en propre à Pékin (Wangfujing Yintai in88), signalant une stratégie de montée en gamme et en visibilité simultanée. Le GD01 s'inscrit dans cette accélération de rythme : en l'espace de deux mois, Unitree couvre le spectre du robot abordable au mécha à 540 000 dollars, une posture délibérément déclarative dans une industrie où Boston Dynamics (Spot, Atlas), Agility Robotics (Digit) et Figure (Figure 02) concentrent l'attention médiatique internationale. Les questions non répondues, autonomie, calendrier de livraison réel, scénarios d'usage validés, restent les variables déterminantes pour savoir si le GD01 est un produit commercial ou un marqueur de capacités technologiques destiné à attirer investisseurs et partenaires industriels.

Chine/AsieOpinion
1 source
Des données de caméras corporelles sur des travailleurs humains servent à entraîner des cerveaux robotiques dans un essai coréen
3844Interesting Engineering 

Des données de caméras corporelles sur des travailleurs humains servent à entraîner des cerveaux robotiques dans un essai coréen

La startup sud-coréenne RLWRLD a annoncé un partenariat avec le Lotte Hotel Seoul, le groupe logistique CJ Logistics et des enseignes Lawson pour constituer une base de données de gestes professionnels humains destinée à l'entraînement de robots. Les employés de ces sites portent des caméras-corps pendant l'exécution de tâches courantes mais techniquement exigeantes : pliage de serviettes de banquet et mise en place de tables à l'hôtel, opérations d'entrepôt chez CJ Logistics, organisation de rayonnages en commerce de détail. Ces flux vidéo, enrichis de données de mouvement et de force, alimentent le modèle fondationnel RLDX-1, présenté en 2025, qui cible la manipulation robotique haute précision avec des mains à haut degré de liberté (DoF). L'architecture centrale, baptisée Multi-Stream Action Transformer (MSAT), traite en flux parallèles les signaux visuels, de mouvement, de mémoire et de couple (torque), qu'elle fusionne ensuite pour générer les actions motrices. Le système intègre également un modèle vision-langage-action (VLA) spécialisé robotique, des modules de physique et de mouvement, et une interface cognitive qui compresse la perception en tokens mémoire pour le suivi de tâches longues. RLWRLD affirme que RLDX-1 dépasse les VLA leaders sur des benchmarks spatiaux, temporels et en contact riche, en simulation comme en conditions réelles, sans chiffres de latence ni taux de succès indépendants publiés à ce stade, ce qui invite à la prudence avant de valider ces affirmations. Ce projet illustre un changement de paradigme dans la collecte de données robotiques : au lieu de téléopération ou de simulation synthétique seule, RLWRLD mise sur la capture in situ d'expertise métier réelle, là où la dextérité humaine est déjà optimisée par des années de pratique. Pour les intégrateurs et les équipementiers industriels, cela signale que le goulot d'étranglement du sim-to-real gap pourrait être partiellement contourné par du data collection en environnement de production réel. La capacité de RLDX-1 à se généraliser sur des configurations single-arm, dual-arm et humanoïde depuis un modèle unique réduit potentiellement les coûts de fine-tuning par plateforme. La gestion de la mémoire à long horizon via tokens de cognition est une réponse directe à la limite connue des VLA actuels sur les tâches séquentielles complexes, problème documenté chez des équipes comme Physical Intelligence (Pi-0) ou chez l'équipe GR00T de NVIDIA. RLWRLD s'inscrit dans une vague coréenne de robotique physique soutenue par des programmes gouvernementaux de numérisation des savoir-faire pour l'IA industrielle. Sur le plan compétitif, la startup se positionne face à Physical Intelligence (Pi-0, États-Unis), à l'équipe GR00T N2 de NVIDIA, à Figure (Figure 03) et à 1X Technologies dans la course aux modèles fondationnels pour la manipulation. La Corée du Sud mobilise sa base manufacturière dense, automobile, électronique, logistique, comme terrain de collecte de données, ce que ni les laboratoires américains ni les acteurs européens comme Wandercraft ou Enchanted Tools ne répliquent à cette échelle sectorielle. Les prochaines étapes annoncées incluent l'extension des captations à d'autres secteurs et le déploiement du modèle sur des plateformes humanoïdes commerciales, sans calendrier précis communiqué.

Chine/AsieOpinion
1 source
Hello Robot présente Stretch 4 : plus grand, plus rapide et plus puissant que ses prédécesseurs
3845Robotics Business Review 

Hello Robot présente Stretch 4 : plus grand, plus rapide et plus puissant que ses prédécesseurs

Hello Robot a annoncé le 12 mai 2026 la disponibilité immédiate de Stretch 4, la quatrième génération de sa plateforme de manipulation mobile à usage général, au prix de 29 950 dollars. Le robot conserve l'architecture distinctive de la gamme, bras télescopique, base omnidirectionnelle, mais intègre une refonte complète selon les termes de Charlie Kemp, co-fondateur et CTO. L'enveloppe sensorielle est significativement enrichie : deux lidars 3D hémisphériques, trois caméras haute résolution, six capteurs laser linéaires et des caméras fisheye RGB à obturateur global couvrent l'environnement à 360 degrés, réduisant drastiquement les angles morts même lorsque le bras est en extension. Une caméra centrale haute résolution surveille spécifiquement l'espace de travail du préhenseur pour les tâches de manipulation fine. La vitesse du bras, du lift et de la base a été doublée par rapport à Stretch 3, et la portée totale étendue de 10 %. Un nouveau système d'alimentation permet jusqu'à huit heures d'autonomie, avec station de recharge autonome intégrée. Ce qui distingue Stretch 4 dans le segment des robots de service tient moins aux gains de vitesse qu'à sa philosophie sensorielle, explicitement calquée sur l'approche "sensor-rich" de Waymo pour le véhicule autonome. Aaron Edsinger, CEO, l'exprime sans détour : les robots mobiles actuels sont "relativement aveugles" aux personnes et aux obstacles dynamiques, ce qui représente un frein réel au déploiement en environnements non structurés, domiciles, établissements de santé. Pour les intégrateurs et les équipes de recherche qui ciblent ces contextes, Stretch 4 offre une base perceptuelle nettement plus robuste que la génération précédente. La hausse de taille répond à un besoin fonctionnel concret : accompagner des utilisateurs en fauteuil roulant motorisé, dont la tête se situe plus haut. La conception reste délibérément orientée sécurité intrinsèque, masse basse, absence d'actionneurs luttant contre la gravité, sans prétendre à une certification formelle, ce qu'Edsinger reconnaît explicitement. Hello Robot a été fondée en 2017 et a commercialisé Stretch à partir de 2020. La plateforme compte aujourd'hui plus de mille utilisateurs dans vingt-trois pays, principalement des laboratoires académiques et des équipes de R&D industrielle. Stretch 3 avait remporté le RBR50 Robotics Innovation Award 2025 dans la catégorie "Robots for Good". La stratégie open-source de Hello Robot la positionne différemment des acteurs humanoïdes (Figure, Agility, Apptronik) ou des robots de service propriétaires (Boston Dynamics Spot). Dans le segment des manipulateurs mobiles à bras unique destinés à la recherche, la concurrence directe inclut Fetch Robotics (racheté par Zebra), le PR2 en voie d'extinction, et les nouvelles plateformes de Robotics+AI startups comme Kepler. Stretch 4 cible une niche précise, recherche en IA physique, assistance aux personnes à mobilité réduite, où le rapport prix/polyvalence sensorielle constitue l'argument principal. Aucune timeline de certification sécurité n'a été communiquée.

IA physiqueActu
1 source
Comme de vrais Transformers : Unitree dévoile un robot mecha qui passe de 2 à 4 pattes
3846SCMP Tech 

Comme de vrais Transformers : Unitree dévoile un robot mecha qui passe de 2 à 4 pattes

Unitree Robotics, entreprise chinoise déjà connue pour ses robots quadrupèdes et humanoïdes à prix agressifs, a dévoilé le 13 mai 2025 le GD01, un engin piloté de 500 kg capable de passer d'une locomotion bipède à une configuration à quatre pattes. Construit en alliage haute résistance, le GD01 transporte un pilote humain en cabine fermée et affiche un prix de départ de 3,9 millions de yuans, soit environ 574 000 dollars américains. L'engin est positionné pour le transport civil, sans précision sur les distances ou charges utiles supportées au-delà du pilote. Le GD01 marque une rupture de catégorie dans le paysage robotique : ce n'est ni un AMR industriel, ni un humanoïde de manipulation, mais un véhicule terrestre à locomotion hybride. La capacité à basculer entre mode bipède et quadrupède pourrait théoriquement offrir une meilleure adaptabilité sur terrains accidentés qu'un véhicule à roues, mais aucune donnée de performance indépendante n'a encore été publiée. Il s'agit à ce stade d'une annonce produit avec démonstration, pas d'un déploiement commercial validé. Unitree s'est imposée ces dernières années comme le challenger low-cost face à Boston Dynamics, avec ses quadrupèdes Go2 et B2, puis ses humanoïdes H1 et G1. Le GD01 s'inscrit dans une stratégie de montée en gamme spectaculaire, sur un segment encore expérimental occupé par quelques acteurs comme Hankook Mirae Technology (Method-2, Corée du Sud) ou des projets de recherche universitaires. Aucun calendrier de livraison ni volume de production n'a été communiqué lors du lancement.

Chine/AsieOpinion
1 source
Moore Threads et Guangyun Intelligence s'associent pour bâtir une base d'IA physique souveraine avec calcul national et simulation
3847Pandaily 

Moore Threads et Guangyun Intelligence s'associent pour bâtir une base d'IA physique souveraine avec calcul national et simulation

Moore Threads et Guangyun Intelligence ont annoncé un partenariat stratégique, selon le média financier chinois IPO Zaozhidao. L'accord associe les GPU polyvalents de Moore Threads et son cluster de calcul intelligent Kua'e à la plateforme de simulation propriétaire de Guangyun Intelligence, articulée autour d'une approche intégrée "solve-measure-generate" (résolution, mesure, génération). L'objectif commun est de produire à grande échelle des données synthétiques haute-confiance pour le développement de l'IA incarnée (embodied AI). Aucun chiffre de volume de données, de puissance de calcul déployée ni de tarification n'a été communiqué dans l'annonce. Ce partenariat cible un verrou structurel de la robotique humanoïde : la rareté des données physiques réelles, leur coût de collecte, la couverture insuffisante des scénarios, et la difficulté à reproduire de façon stable des processus physiques complexes lors des campagnes de collecte sur robot réel. La synthèse de données de haute qualité s'impose comme voie de contournement, mais elle se heurte à des besoins en calcul en croissance exponentielle liés à l'explosion combinatoire du rendu. Le pipeline proposé, de la trajectoire réelle à la modélisation en simulation puis à l'augmentation de données, ambitionne notamment de résoudre la simulation physique de la préhension de corps souples (flexible body grasping), un défi technique clé pour les applications de manipulation industrielle. L'annonce s'inscrit dans la course chinoise à la souveraineté en IA physique. Moore Threads, fondé en 2020, positionne ses GPU comme alternative domestique aux puces Nvidia dans un contexte de restrictions américaines à l'exportation. Guangyun Intelligence se spécialise dans la simulation pour la robotique incarnée. Ce type de boucle fermée entre calcul souverain et production de données synthétiques robotiques trouve des équivalents directs dans l'écosystème occidental, notamment NVIDIA Isaac Sim, la plateforme open-source Genesis, ou les pipelines internes de Figure AI et Physical Intelligence. La portée réelle de ce partenariat reste à démontrer : l'annonce relève du cadre stratégique, sans déploiement documenté ni résultat public à ce stade.

Chine/AsieOpinion
1 source
Interview de Lucas GOUMARRE , CEO Korben For People
3848Robot Magazine FR 

Interview de Lucas GOUMARRE , CEO Korben For People

Korben For People, startup française fondée par Lucas Goumarre, se positionne comme éditeur d'un logiciel de gestion de flotte pour robots de service multi-marques. La société commercialise une plateforme SaaS B2B facturée environ 150 euros HT par robot et par mois, permettant à ses clients de piloter des flottes hétérogènes depuis une interface unique. À ce jour, l'entreprise revendique environ 250 robots connectés et opérés via sa plateforme, déployés en France, en Belgique, en Espagne et en Allemagne. Les secteurs ciblés sont la grande distribution alimentaire, les prestataires de nettoyage professionnel et la logistique d'entrepôt. En complément de son cœur SaaS, Korben For People propose de la revente matérielle multi-marques ainsi que des offres Robot-as-a-Service (RaaS), où les clients souscrivent un abonnement mensuel plutôt que d'acquérir les robots en CAPEX. Le positionnement "hardware-agnostique" de Korben For People répond à un problème concret pour les intégrateurs et les opérateurs de flotte : le risque d'enfermement dans l'écosystème propriétaire d'un seul constructeur. En proposant une couche logicielle indépendante des marques, la société protège les investissements clients sur la durée des cycles de renouvellement des équipements, typiquement pluriannuels. La montée en puissance du modèle RaaS est également significative : elle abaisse la barrière à l'entrée pour des acteurs comme les sociétés de nettoyage, qui hésitaient à immobiliser du capital sur des technologies encore en évolution rapide. L'affirmation de Goumarre selon laquelle "90 % des sols d'un hypermarché sont nettoyés par robot" dans certains déploiements constitue un signal de maturité opérationnelle, même s'il s'appuie sur des cas sélectionnés et mériterait validation à plus grande échelle. L'enjeu cybersécurité des flottes robotiques, évoqué en fin d'interview, commence à peser dans les décisions d'achat des grands comptes industriels soumis à la directive NIS2. Korben For People opère dans un segment encore émergent mais en consolidation rapide : celui du middleware de gestion de flotte robotique de service. Sur ce créneau, la startup française se confronte à des acteurs internationaux comme InOrbit, aux plateformes propriétaires des constructeurs eux-mêmes (SoftBank Robotics, Avidbots, Gaussian Robotics), ainsi qu'aux solutions internes développées par de grandes enseignes ou prestataires logistiques. Son ancrage européen et sa connaissance des contraintes opérationnelles locales constituent ses principaux éléments de différenciation. Les prochaines étapes annoncées portent sur l'expansion géographique en Europe et l'élargissement du portefeuille de robots compatibles. Aucune levée de fonds ni partenariat industriel majeur n'a été communiqué à ce stade dans l'interview.

FR/EU ecosystemeActu
1 source
Comprendre les méthodes d'inférence asynchrone pour les modèles vision-langage-action (VLA)
3849arXiv cs.RO 

Comprendre les méthodes d'inférence asynchrone pour les modèles vision-langage-action (VLA)

Les modèles Vision-Language-Action (VLA), qui combinent perception visuelle, raisonnement linguistique et génération d'actions motrices, souffrent d'un défaut opérationnel central : leur latence d'inférence crée une désynchronisation entre l'observation capturée et l'action exécutée, phénomène désigné sous le terme de "staleness". Quatre approches ont émergé quasi-simultanément pour y remédier : IT-RTC (correction par inpainting à l'inférence), TT-RTC (simulation de délai à l'entraînement), VLASH (conditionnement sur état futur estimé) et A2C2 (correction résiduelle légère à chaque pas de contrôle). Publiée le 12 mai 2025 sous la référence arXiv:2605.08168, une étude systématique compare ces quatre méthodes sous conditions contrôlées via deux codebases unifiées, évaluées sur la suite Kinetix avec des politiques MLPMixer et sur le benchmark LIBERO de manipulation avec SmolVLA, en faisant varier les délais jusqu'à d = 20 pas de contrôle. Les résultats établissent une hiérarchie claire selon le régime de délai. A2C2 domine sur Kinetix avec un taux de résolution supérieur à 90 % jusqu'à d = 8, et prend la tête sur LIBERO à partir de d = 4 ; c'est la méthode la plus efficace pour des délais modérés à élevés. TT-RTC s'impose comme la plus robuste des approches basées sur l'entraînement : elle généralise au-delà de la distribution de délais vue en phase d'entraînement et n'ajoute aucun overhead à l'inférence, ce qui la rend attractive pour des déploiements contraints en calcul. IT-RTC reste compétitif à faibles délais mais se dégrade nettement avec des chunks longs (H = 30) ou des délais importants. VLASH affiche un compromis explicite entre régimes : son efficacité dépend directement de la plage de fine-tuning [0, d\_max] choisie, imposant un calibrage préalable en fonction du délai attendu en production. Ce travail répond à un besoin criant de la communauté VLA, dont les modèles emblématiques, pi-0 de Physical Intelligence, GR00T N2 de NVIDIA et SmolVLA de Hugging Face, visent un déploiement sur robots réels soumis à des contraintes temps-réel strictes. L'absence de benchmark commun rendait jusqu'ici les comparaisons entre méthodes impossibles et freinait l'adoption industrielle, chaque équipe évaluant sa solution sur son propre protocole. En publiant deux codebases reproductibles (github.com/TheAyos/async-vla-inference), les auteurs offrent aux équipes robotiques un cadre de référence pour choisir leur stratégie de correction selon leur architecture et leurs contraintes de latence. Les prochaines étapes naturelles incluent la validation sur robots physiques et l'extension à des VLA de plus grande taille, où les délais d'inférence sont encore plus prononcés.

IA physiqueOpinion
1 source
MVB-Grasp : filtrage par boîte de volume minimal des saisies par diffusion pour la manipulation frontale
3850arXiv cs.RO 

MVB-Grasp : filtrage par boîte de volume minimal des saisies par diffusion pour la manipulation frontale

Une équipe de chercheurs a publié sur arXiv (référence 2505.09672) MVB-Grasp, un système de saisie robotique conçu pour le bras Unitree Z1, un manipulateur à 6 degrés de liberté (DOF) positionné en configuration frontale, c'est-à-dire face à l'objet plutôt qu'en vue surplombante. Le dispositif expérimental associe une caméra Intel RealSense D405, un détecteur d'objets YOLOv8 et le générateur de prises GraspGen basé sur la diffusion. L'innovation centrale est un filtre géométrique fondé sur la boîte englobante de volume minimal orientée (MVBB) : en analysant les normales des faces de cette boîte en temps O(N), le système élimine les candidats de saisie qui traverseraient la table ou s'aligneraient mal avec les faces accessibles de l'objet. Une fonction de re-scoring combine le score du discriminateur appris et l'alignement géométrique avec un coefficient alpha fixé à 0,85. Sur 81 épisodes de simulation MuJoCo (cylindre, boîte asymétrique, bouteille d'eau), MVB-Grasp atteint 59,3 % de succès contre 24,7 % pour GraspGen seul, soit un gain de 2,4x, confirmé ensuite en conditions réelles sans nécessiter de ré-entraînement du modèle. Ce résultat est notable parce qu'il pointe un angle mort structurel de la recherche en manipulation : les benchmarks standards comme GraspNet-1Billion ou YCB-Video sont quasi-exclusivement conçus pour des caméras en vue de dessus sur des manipulateurs haut de gamme à large espace de travail. Or une part croissante des déploiements industriels et de service implique des bras montés sur des piédestaux fixes ou des AMR, en saisie frontale, avec des contraintes cinématiques sévères. Le fait que le gain soit obtenu sans ré-entraînement, uniquement par un filtre géométrique injecté en post-traitement, démontre que le "sim-to-real gap" dans ces configurations n'est pas seulement un problème de données mais aussi de biais dans la sélection des poses candidates. C'est une piste directement exploitable pour les intégrateurs qui déploient des manipulateurs à bas coût dans des cellules contraintes. Le Unitree Z1 est un bras compact vendu autour de 4 000 à 6 000 dollars, souvent utilisé en recherche académique comme alternative économique aux UR5 ou Franka Panda. La diffusion appliquée à la génération de prises est un axe actif depuis 2022-2023 (GraspGen, SE(3)-DiffusionFields, DexGraspNet 2.0), mais la majorité des travaux optimisent pour des postures overhead. Côté concurrents directs sur les manipulateurs frontaux contraints, les approches d'Enchanted Tools et les travaux issus du LAAS-CNRS en France explorent des contraintes similaires, bien que sur des plateformes différentes. La prochaine étape logique pour cette équipe serait d'étendre le protocole à des objets articulés ou transparents, et d'intégrer le filtre MVBB dans une boucle de planification réactive plutôt qu'en sélection statique de candidats.

IA physiquePaper
1 source