Aller au contenu principal

Dossier NVIDIA GR00T

1181 articles

NVIDIA GR00T (Generalist Robot 00 Technology) : modèle fondation pour humanoïdes, intégration Isaac et Cosmos, partenariats Apptronik, Agility, 1X.

Attention à partir de l'action, pour l'action : goulots d'étranglement visuels émergents pour l'apprentissage de politiques
1arXiv cs.RO RecherchePaper

Attention à partir de l'action, pour l'action : goulots d'étranglement visuels émergents pour l'apprentissage de politiques

Des chercheurs publient sur arXiv (arXiv:2608.13422v1, mi-août 2026) Seeker, une méthode d'apprentissage de politiques visuomotrices pour la manipulation robotique. Le système s'appuie sur DINOv3, un extracteur de features visuelles figé, et apprend à générer des régions d'intérêt (ROI) évolutives dans le temps à partir du seul signal d'action, sans étiquette externe comme le regard, la classe d'objet ou une annotation d'affordance. Cette ROI sert de filtre spatial pour trois usages : recadrage RGB, augmentation d'arrière-plan guidée par masque, et filtrage de nuages de points. Testé en simulation et sur robots réels, Seeker porte le taux de succès moyen en conditions connues de 48,3% (meilleure baseline) à 76,7%, et le taux de succès sous variations d'éclairage et de décor de 20% à 60%. Le résultat vise un goulot d'étranglement connu de l'apprentissage par imitation visuomotrice : une politique reste imprécise quand l'indice visuel utile s'éloigne du gripper ou se déplace pendant la tâche, un cas que les recadrages fixes centrés sur l'effecteur terminal ne capturent pas. Pour les intégrateurs qui déploient des politiques vision-language-action à la manière de Pi-0, GR00T ou Helix, la robustesse aux changements de lumière et de fond est précisément ce qui sépare une démonstration de laboratoire d'un déploiement industriel fiable. Seeker montre qu'on peut gagner en efficacité de données et en résistance aux perturbations visuelles sans coût d'annotation supplémentaire, ce qui contredit l'idée reçue que la robustesse exige davantage de labels ou de données brutes. Seeker se positionne face à deux approches existantes : les interfaces ROI à base de labels externes, coûteuses à annoter, et les recadrages dits "action-derived" sans label, qui détectent un événement lié au gripper pour centrer une fenêtre fixe sur l'effecteur terminal projeté, une heuristique rigide dès que l'évidence visuelle utile se déplace. En repartant des features gelées de DINOv3 et en apprenant une requête itérative conditionnée par la tâche et l'état du robot, Seeker automatise cette sélection spatiale. Le travail reste au stade de preprint de recherche, sans annonce de produit ni de partenariat industriel à ce jour, mais s'inscrit dans la course plus large à des politiques VLA à la fois frugales en données et robustes aux variations d'environnement, un enjeu central pour les laboratoires travaillant sur la manipulation robotique généraliste.

1 source
G0.5 : un flux autorégressif unique pour le raisonnement et l'action des robots
2arXiv cs.RO 

G0.5 : un flux autorégressif unique pour le raisonnement et l'action des robots

G0.5, publie en aout 2026 sur arXiv (2608.11739), est un modèle Vision-Language-Action (VLA) dont un décodeur transformeur unique génère raisonnement et tokens d'action sous un seul objectif, au lieu de séparer un VLM pré-entraine et un expert d'action entraine a part par flow-matching. Trois briques le rendent tenable a l'échelle d'un modèle de fondation : un tokenizeur d'action apprenable traduisant des actions robotiques hétérogènes dans un vocabulaire commun entre robots, un flux de chaine de pensée natif mêlant décomposition de taches, ancrage des objets et indices d'action, et un module de mémoire visuelle injectant plusieurs secondes d'historique. Pre-entraine sur des jeux de données robotiques et des exemples VQA, G0.5 devance les références sur sept protocoles : 76,7% de réussite en fine-tuning réel sur les robots R1lite et R1pro contre 53,3% pour Pi-0.5 et 24,4% pour GR00T-N1.7, 31,4% au BEHAVIOR Challenge 2025 contre 26,3% et 26,1% pour le vainqueur du concours, 82,5% en transfert zero-shot après post-entrainement sur DROID, ainsi que 98,9% sur LIBERO, 93,3% sur RoboTwin 2.0 et 87,3% sur SimplerEnv-Bridge. Cette fusion compte parce que l'approche dominante du secteur, illustrée par Pi-0.5 (Physical Intelligence) ou GR00T-N1.7 (NVIDIA), traite le VLM comme un simple encodeur de contexte pendant qu'un module sépare décide de l'action. En partageant les mêmes poids entre raisonnement et action, G0.5 suit les instructions plus finement et laisse un prompt piloter la granularité des gestes, l'horizon de tache ou la gestion de scènes hors distribution, sans reentrainement. L'écart de performance en conditions réelles, près du double de Pi-0.5, et la victoire généraliste au BEHAVIOR Challenge face a des politiques spécialisées, appuient empiriquement l'idée qu'un flux autoregressif unique peut tenir a l'échelle. Le travail s'inscrit dans la lignée des VLA ouverte par RT-2 et OpenVLA, prolongée par la famille Pi de Physical Intelligence, GR00T de NVIDIA ou Helix de Figure, qui ont impose le schéma VLM-encodeur plus expert d'action sépare comme standard de facto. G0.5 s'en écarté en misant sur un flux autoregressif unique, un pari qui reste a confirmer au-delà des benchmarks cites. Il s'agit d'une publication de recherche, sans produit commercialise ni déploiement industriel annonces.

IA physiqueOpinion
1 source
Robots humanoïdes : ramper, roue et backflips maîtrisés grâce aux données de mouvement et d'animation
3Interesting Engineering 

Robots humanoïdes : ramper, roue et backflips maîtrisés grâce aux données de mouvement et d'animation

Des chercheurs du RAI Institute et de Boston Dynamics ont développé ZEST (Zero-shot Embodied Skill Transfer), un framework d'apprentissage par renforcement permettant à des robots à pattes d'acquérir des mouvements agiles à partir de données de mouvement humain, en une seule phase d'entraînement plutôt qu'un réglage par tâche. Le système apprend depuis trois sources : capture de mouvement haute fidélité, vidéo simple caméra, et animation par images clés, converties en commandes robotiques par retargeting cinématique. Testé sur l'humanoïde Atlas et le quadrupède Spot de Boston Dynamics ainsi que sur le G1 d'Unitree, ZEST a reproduit des mouvements tels que reptation au sol, roulades avant, roue, breakdance, danse, tirs au but et escalade de caisses, plus un salto arrière continu et un tonneau pour Spot à partir de données d'animation. Chaque politique de contrôle a nécessité environ 10 heures d'entraînement, soit près de 7 000 itérations, sur un seul GPU NVIDIA L4, entraînée entièrement en simulation puis transférée sur le matériel réel sans réglage supplémentaire, en s'appuyant uniquement sur des capteurs proprioceptifs embarqués à l'exécution. Pour l'industrie robotique, l'intérêt tient à ce que ZEST élimine plusieurs briques habituelles des pipelines de contrôle : estimateurs d'état, longs historiques d'observation, fenêtres de référence future, calendriers de contact au sol et ingénierie poussée de récompenses propres à chaque tâche. Cela réduit potentiellement le travail d'ingénierie et de réglage requis pour chaque nouvelle compétence, un goulot d'étranglement connu du déploiement de robots humanoïdes et quadrupèdes. Le transfert réussi d'une même architecture entre un humanoïde et un quadrupède illustre une portabilité inter-morphologies rarement démontrée à ce niveau d'agilité. L'équipe reste toutefois prudente : le système n'a été validé que sur sols plats et non glissants, sans généralisation démontrée à des mouvements totalement inédits. Il s'agit donc d'une avancée de recherche publiée sous forme d'étude, avec des démonstrations en environnement contrôlé, et non d'un produit commercial déployé ou d'un pilote industriel annoncé. ZEST s'inscrit dans les travaux du RAI Institute, laboratoire de recherche lié à Boston Dynamics et centré sur le contrôle et l'apprentissage pour robots à pattes, prolongeant des efforts visant à réduire la dépendance à l'ingénierie manuelle des contrôleurs. Le framework se positionne différemment des modèles vision-langage-action comme Pi-0 de Physical Intelligence, GR00T N2 de Nvidia ou Helix de Figure, qui ciblent surtout la manipulation : ZEST vise l'agilité locomotrice et les mouvements corporels complets, du crawl militaire au salto arrière. Il ne nécessite pas d'annotations explicites de contact au sol, ce qui allège la préparation des données de démonstration. Les auteurs indiquent que les prochaines étapes porteront sur l'adaptation zero-shot et few-shot ainsi que sur l'apprentissage continu, sans calendrier ni partenaire de déploiement précisés à ce stade.

RecherchePaper
1 source
RynnValue : faire passer à l'échelle les modèles fondation de valeur robotique par la distance temporelle
4arXiv cs.RO 

RynnValue : faire passer à l'échelle les modèles fondation de valeur robotique par la distance temporelle

RynnValue s'attaque au goulot d'étranglement des modèles de récompense pour l'apprentissage robotique en remplaçant les ancrages classiques (préférences, progression normalisée) par la distance temporelle : le coût-à-parcourir dirigé entre une observation et un objectif spécifié en langage naturel. Comme ces étiquettes se déduisent directement des horodatages, le modèle open source s'entraîne sur plus de 7 000 heures et environ 3 millions de clips conditionnés par instruction, sans annotation de préférence ni de progression. Trois techniques stabilisent l'apprentissage à cette échelle : échantillonnage temporel aléatoire, mélange de l'ordre temporel et attention à isolation de valeur, qui empêchent le modèle de trouver des raccourcis insensibles aux échecs et régressions. Résultat : un Kendall's tau_a moyen de 0,675 sur le benchmark RBM-EVAL-OOD, devant l'état de l'art entièrement supervisé par préférences (0,655) et plus du double d'un équivalent entraîné uniquement sur la progression (0,292), avec généralisation zero-shot à des tâches, embodiments et points de vue inédits. Converti en récompense dense via un potential-based shaping, il fait grimper le taux de succès de politiques robotiques réelles de 52,5% à 72,5% en ligne, et de 63,8% à 82,5% hors ligne. Pour les intégrateurs et décideurs robotique, ce résultat pèse dans le débat sur le passage à l'échelle des modèles VLA : il suggère qu'un signal de supervision dérivé automatiquement des timestamps peut remplacer l'annotation manuelle coûteuse (préférences, jugements de progression) tout en généralisant mieux à des robots et environnements jamais vus à l'entraînement. C'est une preuve concrète que le goulot d'étranglement des reward models, souvent cité comme frein au reinforcement learning robotique à grande échelle, peut être contourné par un signal purement temporel plutôt que par plus d'annotation humaine. L'amélioration mesurée du taux de succès en conditions réelles, et pas seulement sur benchmark hors ligne, distingue ce travail d'une simple démonstration académique et le rend directement pertinent pour qui cherche à industrialiser des politiques génératives de contrôle robotique. RynnValue s'inscrit dans la lignée des modèles de fondation pour la robotique de type VLA (vision-langage-action), aux côtés d'approches comme Pi-0 ou GR00T N2, qui cherchent toutes à exploiter des corpus hétérogènes multi-embodiments pour généraliser au-delà d'un seul robot ou d'une seule tâche. Contrairement aux méthodes appuyées sur des préférences annotées ou une progression normalisée par tâche, difficilement transférables entre plateformes et sources de données, RynnValue mise sur un signal universel et bon marché à produire. Le fait que le modèle et vraisemblablement son code soient publiés en open source (arXiv, août 2026) facilite sa reproduction et son intégration par des laboratoires tiers pour du reward shaping en apprentissage par renforcement. Les prochaines étapes attendues concernent l'extension à davantage d'embodiments et de tâches en conditions réelles, ainsi que la comparaison avec d'autres modèles de récompense émergents dans un secteur où la fiabilité du reward model conditionne directement la vitesse d'entraînement des politiques.

RecherchePaper
1 source
Ancrage visuel pour le contrôle vision-langage en zero-shot
5arXiv cs.RO 

Ancrage visuel pour le contrôle vision-langage en zero-shot

Une équipe de recherche a testé des modèles vision-langage (VLM) utilisés comme contrôleurs zero-shot via une batterie d'ablations : images aveugles, entrées répétées à l'identique, réflexion en miroir de la voie, lignes de base non visuelles et contrôles d'intégrité du pipeline. L'étude couvre neuf modèles à action directe, six VLM locaux structurés et une architecture hybride VLM-MPC, sur 32 874 appels notés, deux embodiments et trois simulateurs. Résultats majoritairement négatifs : une politique constante "SLOW" bat un contrôleur géométrique scripté, plusieurs modèles restent quasi insensibles à l'image, et ceux qui détectent bien les dangers longitudinaux échouent à inverser leurs décisions gauche/droite en miroir. Aucun VLM local ne remplit les deux critères de fondement visuel à la fois. Un contrôle positif purement visuel estime pourtant l'écart avec le véhicule précédent à 0,090 m d'erreur près, preuve que l'image contient bien l'information nécessaire. Ce travail questionne un postulat central des politiques vision-langage-action (VLA) en robotique et conduite autonome : qu'un modèle généraliste puisse piloter un système physique sans entraînement spécifique du simple fait qu'il "voit" l'image. Le test miroir est révélateur : un modèle vraiment fondé sur la perception inverserait sa décision quand l'image l'est, ce qui n'est presque jamais observé. Pour les intégrateurs tentés par un VLM prêt à l'emploi comme contrôleur direct, l'étude illustre un écart concret entre score en simulation et perception réelle. Un usage plus restreint fonctionne en revanche : un comité figé de deux modèles, votant entre vue originale et vue miroir, atteint 0,954 de précision équilibrée sur données tenues à l'écart, confirmé par validation croisée. Les VLM ressortent utilisables comme assistants de détection ciblés et calibrés, pas comme contrôleurs bout en bout. Cette étude s'inscrit dans un scepticisme méthodologique croissant envers les politiques VLA type Pi-0, GR00T N2 ou Helix, promues pour piloter bras robotiques et humanoïdes après entraînement à grande échelle. En privilégiant une batterie d'ablations rigoureuse plutôt que des scores de réussite en simulation, les auteurs proposent une méthode reproductible pour auditer ces systèmes avant déploiement, une démarche encore rare face aux annonces commerciales du secteur où vidéos sélectionnées et métriques de cycle mal contextualisées restent fréquentes. La suite logique serait d'étendre ces tests à des environnements réels, à d'autres familles de VLM propriétaires, et de valider le comité de consensus symétrique sur des flottes en conditions réelles.

RecherchePaper
1 source
Humanoïdes : mouvement complet du corps et raisonnement multi-étapes avec Gemini Robotics 2
6Interesting Engineering 

Humanoïdes : mouvement complet du corps et raisonnement multi-étapes avec Gemini Robotics 2

Google a présenté Gemini Robotics 2, un modèle conçu pour piloter des robots humanoïdes dans leur intégralité, marche, flexion, équilibre et manipulation d'objets inclus, avec la capacité de coordonner plusieurs machines et de s'adapter à différents corps robotiques après seulement quelques heures d'entraînement. Le système s'accompagne de deux modèles complémentaires, Gemini Robotics ER 2, dédié au raisonnement de haut niveau, et Gemini Robotics On-Device 2, exécuté localement sans connexion cloud. Lors des démonstrations, le modèle a piloté l'Apollo 2 d'Apptronik pour ramasser un arrosoir, traverser une pièce et le poser sur une étagère basse, et le même checkpoint a également fonctionné sur d'autres plateformes comme le Franka Duo. Google évoque aussi des gains de dextérité: les mains à cinq doigts d'Apollo 2 peuvent nouer un sac poubelle, refermer un sachet Ziploc ou dévisser une ampoule, tandis que sur des pinces industrielles à deux doigts le modèle réalise des insertions précises et de la manipulation d'outils. ER 2 est disponible via Google AI Studio et en prévisualisation privée sur la Gemini Enterprise Agent Platform, le modèle vision-langage-action et la version embarquée restant réservés à des partenaires en accès anticipé. Google a également introduit ASIMOV-Agentic, un benchmark de sécurité évaluant si un robot refuse une action dangereuse, détecte l'incertitude ou sollicite une aide humaine. Ce saut du pilotage de bras isolés au contrôle corporel complet est significatif pour l'industrie: la plupart des humanoïdes actuels restent limités à des tâches répétitives programmées, et la promesse d'un même modèle transférable d'une morphologie à l'autre avec moins de 200 exemples d'entraînement collectés en quelques heures s'attaque directement au problème du sim-to-real et du coût d'intégration, un point clé pour les industriels qui hésitent encore à déployer ces machines à grande échelle. Il faut toutefois noter que les métriques avancées, plusieurs minutes de tâches enchaînant des centaines de décisions, proviennent de démonstrations contrôlées et que le déploiement reste cantonné à des partenaires triés sur le volet: on est encore loin d'un produit généralisé sur le terrain. Cette annonce prolonge Gemini Robotics, lancé plus tôt dans l'année et limité à la manipulation sur table, en l'étendant au mouvement corporel complet. Elle intervient dans un paysage où Figure AI développe son propre modèle Helix, Tesla avance sur Optimus, Physical Intelligence mise sur Pi-0 et NVIDIA sur GR00T N2, chacun cherchant à imposer son architecture VLA comme standard pour les humanoïdes de nouvelle génération. Apptronik, partenaire de longue date de Google pour Apollo, reste pour l'instant le principal terrain de test visible de cette technologie, dont l'ouverture à d'autres intégrateurs dépendra des retours de ce programme d'accès anticipé.

HumanoïdesOpinion
1 source
Pense quand c'est important : raisonnement VLM conditionnel pour la navigation sociale avec des politiques RL
7arXiv cs.RO 

Pense quand c'est important : raisonnement VLM conditionnel pour la navigation sociale avec des politiques RL

Le laboratoire à l'origine de ce papier arXiv (référence 2607.10991v1) présente HUMA, une architecture hybride de navigation sociale pour robots mobiles qui combine une politique d'apprentissage par renforcement (RL) avec un modèle vision-langage (VLM). Le principe : la politique RL, rapide et réactive, gère les déplacements courants à faible densité humaine, tandis qu'un VLM post-entraîné prend le relais uniquement quand une personne entre dans la zone de proximité sensible du robot. Évalué sur les benchmarks Social-MP3D et Social-HM3D, HUMA améliore le taux de réussite des tâches de 20% et 3% respectivement par rapport aux meilleures méthodes existantes, tout en réduisant significativement les violations d'espace personnel et les collisions avec des humains. Le système a aussi été testé en conditions réelles sur le robot mobile Mirokaï, conçu par la start-up française Enchanted Tools. Cette approche répond à un compromis central dans la navigation sociale robotique : les politiques RL sont rapides mais peinent à généraliser à des scénarios sociaux complexes, tandis que les VLM offrent un raisonnement sémantique plus fin mais restent trop lents pour un déploiement temps réel. En activant le VLM seulement de façon conditionnelle, HUMA évite l'écueil du tout-VLM (latence, coût de calcul) sans sacrifier la finesse de compréhension sociale dans les moments qui comptent le plus, c'est-à-dire l'interaction rapprochée avec des humains. Pour les intégrateurs et décideurs déployant des robots de service en environnement partagé (hôpitaux, bureaux, commerces), cela suggère une voie concrète pour rendre les VLM exploitables en production sans réécrire toute la pile de contrôle. Le travail s'inscrit dans la tendance récente consistant à substituer ou hybrider les VLM aux politiques RL classiques pour améliorer le raisonnement sémantique en navigation, une piste explorée notamment par des architectures VLA comme Pi-0 ou GR00T N2 dans d'autres contextes robotiques. Les auteurs ont mené des études d'ablation détaillées pour valider chaque composant architectural, et la démonstration sur Mirokaï, robot déployé par Enchanted Tools, ancre l'approche au-delà de la simulation, dans un cas d'usage réel de robot d'accueil et d'assistance en environnement humain.

UELa validation en conditions réelles de HUMA sur le robot Mirokaï, conçu par la start-up française Enchanted Tools, ancre cette avancée de recherche en navigation sociale dans un produit robotique européen déployé en environnement humain.

FR/EU ecosystemePaper
1 source
Xiaomi-Robotics-U0 : synthèse incarnée unifiée avec modèle fondation du monde
8arXiv cs.RO 

Xiaomi-Robotics-U0 : synthèse incarnée unifiée avec modèle fondation du monde

Xiaomi Robotics a publié U0, un modèle multimodal autorégressif de 38 milliards de paramètres conçu pour unifier plusieurs tâches de génération liées à la robotique au sein d'un seul système. Décrit dans un article déposé sur arXiv, U0 traite la synthèse de contenus "incarnés" comme une extension directe des modèles de génération d'images et de vidéos fondationnels, en optimisant conjointement le texte-vers-image, l'édition d'images, la génération de scènes incarnées, le transfert incarné et la génération vidéo incarnée. Selon les auteurs, il s'agit du premier modèle capable de générer des scènes cohérentes en multi-vues pour plusieurs types de robots différents, et il introduit un mécanisme de transfert structuré et contrôlable permettant une édition fine tout en préservant la cohérence géométrique et la dynamique d'interaction. Les résultats rapportés indiquent que U0 dépasse GPT-Image-2.0 lors d'évaluations humaines sur la génération et le transfert de scènes incarnées, se classe premier sur le classement World Arena pour la génération vidéo incarnée, et fait passer le taux de succès hors distribution du modèle de manipulation pi0.5 de 36,9% à 63,2% sur des tâches de manipulation réelle jugées difficiles. Le code et les checkpoints sont mis à disposition sur le site de Xiaomi Robotics. L'enjeu principal ne se situe pas dans la démonstration visuelle mais dans l'usage de U0 comme moteur de données synthétiques pour l'entraînement de politiques robotiques. Le gain mesuré sur pi0.5, un modèle vision-langage-action tiers développé par Physical Intelligence, est le point le plus significatif: il suggère qu'un monde fondationnel bien conçu peut générer des données d'entraînement suffisamment réalistes pour améliorer la généralisation d'un VLA existant sur des tâches de manipulation réelles, et pas seulement sur des métriques internes. C'est une piste concrète pour réduire l'écart simulation-vers-réel qui freine encore le déploiement à grande échelle des robots humanoïdes et bras manipulateurs, en offrant une alternative à la collecte coûteuse de données physiques. Le travail part d'un constat classique dans le secteur: adapter un modèle fondationnel pré-entraîné avec des données robotiques limitées tend à dégrader les connaissances visuelles acquises lors du pré-entraînement à grande échelle. U0 cherche à préserver cette généralisation tout en l'adaptant aux contraintes des embodiments robotiques. Il se positionne face à des approches comme GR00T N2 de NVIDIA ou les modèles Pi de Physical Intelligence, dans une course où Xiaomi investit désormais explicitement la recherche en IA incarnée. Pour l'instant, la publication reste au stade recherche: code et poids sont ouverts, mais aucun déploiement produit ni pilote industriel n'est annoncé.

IA physiqueOpinion
1 source
Mistral AI lance Robostral Navigate
9Robot Magazine FR 

Mistral AI lance Robostral Navigate

Reformuler ce communiqué en article journalistique neutre, en signalant que les chiffres proviennent uniquement de la communication Mistral, sans donnée sim-to-real indépendante. --- Mistral AI a présenté Robostral Navigate, un modèle de navigation robotique construit selon une architecture Vision-Language-Action : une caméra RGB classique et des instructions en langage naturel remplacent la combinaison habituelle LiDAR, caméras de profondeur, centrale inertielle et cartographie SLAM. Le modèle compte 8 milliards de paramètres, une taille pensée pour tourner sur des plateformes embarquées à ressources limitées plutôt que sur des clusters distants. Selon Mistral, l'entraînement s'est appuyé sur près de 400 000 trajectoires générées dans plus de 6 000 environnements simulés, couvrant bureaux, entrepôts, usines et logements. En fonctionnement, le pipeline doit interpréter le flux vidéo, comprendre la consigne, localiser la cible, planifier une trajectoire, éviter les obstacles fixes et mobiles, et corriger sa position en continu, l'ensemble devant tenir dans un budget de quelques dizaines de millisecondes par cycle de décision. L'intérêt pour les fabricants de robots mobiles tient d'abord au coût : une caméra RGB se chiffre en dizaines d'euros contre plusieurs centaines, voire milliers d'euros pour un LiDAR industriel, ce qui allège aussi bien la facture matérielle que l'intégration logicielle. Sur le fond, Robostral Navigate teste à l'échelle de la navigation pure une hypothèse déjà explorée côté manipulation par les modèles VLA : qu'un système entraîné majoritairement en simulation puisse généraliser à des environnements réels variés sans empiler les capteurs. C'est une promesse à vérifier plutôt qu'un résultat acquis, les chiffres de 400 000 trajectoires et 6 000 environnements provenant uniquement de la communication de Mistral, sans benchmark tiers ni donnée publiée sur l'écart sim-to-real en conditions réelles. Pour les intégrateurs et décideurs industriels, la question qui reste ouverte est celle de la robustesse hors simulation, dans des lieux encombrés, mal éclairés ou changeants. Mistral AI, jusque-là identifiée aux grands modèles de langage (Mistral Large, Mixtral) et positionnée comme l'alternative européenne face à OpenAI et Google, franchit ici son premier pas affiché vers la Physical AI, terrain déjà occupé par NVIDIA avec GR00T N2, Figure AI avec Helix, ou Physical Intelligence avec Pi-0. L'entreprise française n'a pas communiqué de calendrier de déploiement industriel ni de partenariat matériel identifié à ce stade ; Robostral Navigate reste, en l'état des informations disponibles, une annonce de capacité logicielle plutôt qu'un produit livré ou testé en flotte réelle.

UEMistral AI, entreprise française et alternative européenne aux géants américains de l'IA, franchit son premier pas vers la robotique physique, ce qui renforce le positionnement technologique de la France et de l'UE face aux acteurs américains et chinois du secteur.

FR/EU ecosystemeActu
1 source
Développer des politiques de robots humanoïdes de bout en bout avec NVIDIA Isaac GR00T
10NVIDIA Developer Blog 

Développer des politiques de robots humanoïdes de bout en bout avec NVIDIA Isaac GR00T

No fetch tool available here, and I don't have Bash/WebFetch in this session to pull the full article. The source text you pasted is only the article's opening teaser (repeated twice), with no actual facts, no specs, dates, deployment sites, or competitive details. Writing the requested 3-paragraph article would mean inventing numbers and claims that aren't in the source, which I won't do. Could you paste the full article text, or is there a way for me to fetch the URL directly?

IA physiqueActu
1 source
Où regardent les humains lors des démonstrations à des robots : analyse du comportement visuel dans les tâches de prise-et-dépose
11arXiv cs.RO 

Où regardent les humains lors des démonstrations à des robots : analyse du comportement visuel dans les tâches de prise-et-dépose

Une équipe de chercheurs publie sur arXiv (référence 2506.05808v2) une étude expérimentale portant sur le comportement oculaire des opérateurs humains lors de sessions de téleopération robotique, dans le cadre spécifique de tâches de saisie et de dépose (pick-and-place). Le protocole expérimental compare plusieurs dispositifs de démonstration, des interfaces qui émulent l'incarnation et les conditions visuelles d'un robot, et mesure précisément où le regard humain se fixe pendant l'exécution. Les résultats montrent que certaines propriétés des dispositifs provoquent un déplacement systématique de l'attention visuelle : l'opérateur cesse de regarder les indices liés à l'objectif de la tâche (les objets à manipuler) pour se concentrer sur les indices de supervision du contrôle (l'effecteur terminal, c'est-à-dire la pince ou le bras du robot). Ce n'est pas un effet marginal, il est suffisamment prononcé pour mesurer son impact en aval sur les modèles d'apprentissage. L'enjeu pour les équipes qui construisent des pipelines d'imitation learning est direct. L'apprentissage par imitation, qui fonde une part croissante des architectures VLA (Vision-Language-Action) comme Pi-0, GR00T N2 ou OpenVLA, repose sur des volumes massifs de données de démonstration humaine, dont le coût de collecte est élevé. Une hypothèse structurante du domaine est que le regard humain encode des informations cognitives de haut niveau, priorité aux objets, anticipation de la trajectoire, que les modèles peuvent exploiter pour généraliser. Or cette étude montre que, selon le dispositif utilisé, ce signal se dégrade au point de faire chuter les performances des modèles gaze-based en dessous des baselines sans information oculaire. En d'autres termes, le choix du matériel de collecte de données n'est pas neutre : il peut silencieusement empoisonner le signal superviseur. Ce travail s'inscrit dans un débat actif autour de la qualité versus la quantité des données de démonstration, dans un secteur où Physical Intelligence, Hugging Face (LeRobot) et des laboratoires comme Stanford (ALOHA) ou Berkeley (DROID) investissent massivement dans des infrastructures de collecte standardisées. La question de quel dispositif utiliser, manette, bras maître, interface VR, exosquelette, n'avait jusqu'ici été abordée que sous l'angle ergonomique ou de la fidélité de contrôle. Cette étude introduit une nouvelle dimension : l'effet du dispositif sur la qualité du signal cognitif implicite, avec des implications directes pour la conception des futures campagnes de collecte de données à grande échelle.

UEHuggingFace (entreprise française, co-fondatrice de LeRobot) est explicitement citée parmi les organisations dont les infrastructures standardisées de collecte de démonstrations sont directement concernées par ces résultats sur la dégradation du signal gaze selon le dispositif utilisé.

RechercheOpinion
1 source
X Square Robot boucle quatre levées consécutives et atteint 2,8 milliards de dollars de valorisation grâce à ses modèles fondation d'IA physique
12Pandaily 

X Square Robot boucle quatre levées consécutives et atteint 2,8 milliards de dollars de valorisation grâce à ses modèles fondation d'IA physique

X Square Robot, startup pékinoise fondée en 2023 et spécialisée dans l'IA incarnée pour environnements réels, vient de boucler quatre tours de financement consécutifs dont une Série C portant sa valorisation à 2,8 milliards de dollars (20 milliards de yuans). IDG Capital a participé à la Série C, tandis que HongShan et Xiaomi ont soutenu l'entreprise sur plusieurs tours antérieurs. Surtout, Meituan, Alibaba et ByteDance ont chacun conduit un tour précédent, faisant de X Square Robot la seule société d'IA incarnée en Chine à avoir obtenu un lead investment des quatre plus grands groupes tech nationaux. En avril 2026, la société a dévoilé WALL-B, un modèle fondation basé sur son architecture "World Unified Model" (WUM) : contrairement aux approches VLA modulaires qui assemblent des composants vision, langage et action distincts, WALL-B entraîne l'ensemble perception-langage-action-prédiction physique dans un réseau unique. Deux modèles complémentaires ont été mis en open source : WALL-OSS-0.5, qui atteint plus de 80 % de complétion autonome sur 4 des 17 tâches testées en conditions réelles sans fine-tuning post-entraînement, et WALL-WM, un modèle de prédiction monde alignant données langagières, visuelles et gestuelles autour d'événements physiques significatifs. Sur le terrain, X Square Robot a déployé ses robots en partenariat avec 58.com pour un service de nettoyage assisté par IA à Shenzhen et Pékin, les machines opérant aux côtés d'agents humains dans des immeubles résidentiels réels. Depuis mai 2026, un programme "X Family Member" place des robots en foyers volontaires jusqu'à un mois en tant qu'assistants domestiques. La valorisation à 2,8 milliards de dollars positionne X Square Robot parmi les startups d'IA incarnée les mieux capitalisées de Chine, dans une course mondiale où Figure AI, Physical Intelligence et Agility Robotics mobilisent des montants comparables aux États-Unis. L'architecture unifiée de WALL-B constitue un pari architectural distinct des approches modulaires dominantes comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA. Le score de 80 % sur 4 tâches sélectionnées parmi 17 sans post-training est encourageant, mais l'échantillon invite à la prudence : les 13 tâches restantes ne sont pas documentées, ce qui laisse le demo-to-reality gap partiellement ouvert. Les déploiements effectifs chez 58.com et en appartements résidentiels donnent néanmoins plus de crédit à ces métriques que les démonstrations habituelles en laboratoire contrôlé. Fondée en 2023, X Square Robot s'inscrit dans un écosystème chinois de robotique humanoïde incluant Unitree Robotics, Fourier Intelligence et AgiBot, face aux acteurs américains Figure AI (valorisé 2,6 Md$ fin 2024), Boston Dynamics et Physical Intelligence. La présence simultanée de Meituan, Alibaba et ByteDance au capital signale des débouchés ciblés dans la logistique, la livraison et les services à domicile, secteurs que ces groupes cherchent activement à automatiser. La mise en open source de WALL-OSS-0.5 et WALL-WM suit une stratégie classique d'adoption académique et industrielle avant commercialisation. Les fonds levés seront alloués au développement technologique core et à la recherche fondamentale en intelligence incarnée, avec pour horizon déclaré des systèmes robotiques polyvalents capables d'opérer dans des environnements non structurés du quotidien.

UELes modèles WALL-OSS-0.5 et WALL-WM étant open source, les équipes R&D européennes peuvent les évaluer directement ; la montée en puissance de l'écosystème chinois (Alibaba, ByteDance, Meituan comme investisseurs lead simultanés) intensifie la pression concurrentielle sur les acteurs européens de l'IA incarnée.

Chine/AsieOpinion
1 source
NVIDIA lance Halos, un système de sécurité complet pour la robotique
13Robotics Business Review 

NVIDIA lance Halos, un système de sécurité complet pour la robotique

NVIDIA a lancé Halos for Robotics, un système de sécurité à pile complète pour la robotique industrielle et l'IA physique. Premier intégrateur officiel : Agility Robotics, dont les humanoïdes opèrent en entrepôts et usines pour Amazon, GXO, Schaeffler et Toyota Motor Manufacturing Canada. L'architecture couvre trois couches : la plateforme de calcul NVIDIA IGX Thor avec le Holoscan Sensor Bridge pour la connectivité capteurs en temps réel ; Halos OS incluant Halos Core ; et le Outside-In Safety Blueprint, un programme open source disponible sur GitHub qui pilote le comportement du robot via des caméras externes et des agents IA. NVIDIA revendique 18 600 années-ingénieur de développement sécurité issus de son activité véhicule autonome. L'écosystème associe des partenaires logiciels (QNX, Amazon FreeRTOS, Acontis), fabricants de systèmes embarqués (Advantech, NexCobot), fournisseurs de semi-conducteurs (Infineon, NXP, SICK, STMicroelectronics, Texas Instruments) et organismes de certification (TÜV Rheinland, TÜV SÜD, UL Solutions, exida, SGS, CertX). Halos Core est déjà certifié ISO 26262 par TÜV SÜD. Le système est disponible en early access pour les développeurs enregistrés, en configurations Linux et Linux+QNX. L'enjeu de Halos est de répondre à un problème structurel : l'absence d'architecture de sécurité standardisée pour des robots autonomes opérant aux côtés de travailleurs. Les intégrateurs composaient jusqu'ici avec des solutions hétérogènes, ce qui complexifiait la certification et freinait le passage à l'échelle. En proposant une pile unifiée du silicium à la supervision logicielle, NVIDIA cherche à s'imposer comme substrat commun de la sécurité robotique industrielle. La certification ISO 26262 de Halos Core est un signal concret : NVIDIA transfère une base éprouvée du monde AV vers la robotique, ce qui pourrait raccourcir les cycles de validation pour les intégrateurs et réduire les coûts de certification tiers. NVIDIA construit depuis plusieurs années une position dans la robotique via les plateformes Isaac, Omniverse et les modèles de fondation GR00T N2. Halos complète cette stratégie d'infrastructure : vendre le substrat computationnel et logiciel, pas les robots eux-mêmes. Les concurrents directs incluent FORT Robotics dans les solutions de sécurité embarquée (qui figure d'ailleurs parmi les partenaires Halos), ainsi que les approches propriétaires de Boston Dynamics ou Fanuc. L'annonce reste un early access sans données publiques de déploiement à grande échelle avec Halos effectivement activé. Les prochaines inspections de certification de l'IGX Thor et du Holoscan Sensor Bridge par TÜV Rheinland constitueront le vrai indicateur de maturité opérationnelle du système.

UESTMicroelectronics (France/Italie) figure parmi les partenaires semi-conducteurs de Halos, et les organismes TÜV Rheinland et TÜV SÜD (Allemagne) sont intégrés au programme de certification, ce qui peut raccourcir les cycles de validation réglementaire pour les intégrateurs robotiques européens.

InfrastructureOpinion
1 source
Des milliards investis dans l'IA incarnée, mais le déploiement en usine reste hors de portée
14Pandaily 

Des milliards investis dans l'IA incarnée, mais le déploiement en usine reste hors de portée

Au premier semestre 2026, le secteur chinois de la robotique embodied AI a absorbé 46 milliards de yuans (environ 6,2 milliards d'euros) répartis sur 288 opérations de financement impliquant 226 entreprises, selon les données d'IT Juzi. La concentration est massive : les cinq premiers acteurs (Qianxun Intelligence, Xiwang Sunrise, Xinghaitu, Zibianliang Robot et Jijia Vision) ont capté 17,1 milliards de yuans, soit 37 % du total, et le top 20 emporte 70 % des fonds. Qianxun Intelligence seule a levé 4,5 milliards de yuans en quatre tours en quatre mois. Le profil des investisseurs change : les grandes rondes au-dessus du milliard de yuans sont désormais pilotées à plus de 40 % par des industriels et des entités publiques (Baidu, ByteDance, Xiaomi, Meituan, SAIC, fonds gouvernementaux), le capital d'État participant à 42 % des transactions à plusieurs centaines de millions. Ce flux d'argent masque un écart criant entre vitrine et déploiement réel. Le cas Daluo est emblématique : valorisée à plus de 20 milliards de yuans, ayant levé 5,4 milliards, la société n'a vendu que 1,4 million de yuans de produits sur les sept premiers mois de 2025 tout en enregistrant 84,25 millions de pertes nettes. La cause structurelle identifiée par le secteur est le manque de données d'interaction physique de qualité : on estime à 500 000 heures seulement le volume mondial de données réelles utilisables pour entraîner des robots, contre des milliards de tokens texte pour les LLM. Les réponses sont proportionnelles : Xinghaitu a lancé une campagne "un million d'heures" à Yizhuang, Qianxun Intelligence a déployé 300 000 points de collecte à l'échelle nationale, JD.com vise 10 millions d'heures sous deux ans. Les résultats restent modestes : un responsable algorithmique a reconnu que des dizaines de millions de yuans investis pour collecter 100 000 heures n'avaient amélioré la capacité des modèles que de 5 %. Le secteur reste en phase de recherche appliquée, loin d'une industrialisation. L'état de l'art interne, estimé sur 100 points par un praticien du domaine, place les bras industriels à 50, les châssis à roues à 40, les quadrupèdes à 30, les humanoïdes bipèdes à 15, les mains dextères à 5, et l'IA embarquée de support à 3. Les approches VLA (Vision-Language-Action) et World Model convergent techniquement mais sans consensus sur la feuille de route. Les acteurs occidentaux comme Figure (Figure 03), Tesla (Optimus Gen 3), Physical Intelligence (Pi-0) ou NVIDIA (GR00T N2) font face aux mêmes verrous de sim-to-real et de données, mais le déploiement à l'échelle usine reste introuvable partout. Malgré l'étiquette "année de la production de masse" accolée à 2026, aucun robot polyvalent fiable ne s'est encore imposé commercialement dans des environnements industriels non contrôlés.

UELes mêmes verrous structurels, 500 000 heures de données physiques mondiales, sim-to-real non résolu, contraignent les acteurs européens au même plafond de verre que les géants chinois pourtant dix fois mieux capitalisés.

Chine/AsieOpinion
1 source
Humanoid Everyday : un jeu de données robotique complet pour la manipulation humanoïde en monde ouvert
15arXiv cs.RO 

Humanoid Everyday : un jeu de données robotique complet pour la manipulation humanoïde en monde ouvert

Une équipe de recherche a publié sur arXiv (identifiant 2510.08807v2) Humanoid Everyday, un jeu de données massif dédié à l'apprentissage de la manipulation par les robots humanoïdes en conditions ouvertes. Le dataset compile 10 300 trajectoires et plus de 3 millions de frames couvrant 260 tâches réparties en 7 catégories larges : manipulation dextère d'objets, interaction humain-humanoïde, actions intégrant de la locomotion bipède, et d'autres scénarios du quotidien. Les données sont multimodales, RGB, profondeur, LiDAR, retour tactile, accompagnées d'annotations en langage naturel. La collecte repose sur un pipeline de télé-opération supervisée par des humains, optimisé pour maximiser le débit tout en maintenant la qualité des démonstrations. Les auteurs publient simultanément une plateforme d'évaluation cloud permettant à des équipes extérieures de déployer leurs propres politiques de contrôle et d'obtenir des métriques comparables dans un environnement standardisé. Ce dataset comble un vide structurel dans la recherche robotique : la quasi-totalité des benchmarks existants (Open X-Embodiment, DROID, BridgeData V2) ciblent des bras fixes, et les rares datasets humanoïdes disponibles se limitent à des environnements contrôlés, un faible nombre de tâches, et excluent généralement la locomotion et l'interaction avec des personnes. Pour un intégrateur ou un décideur industriel, la portée pratique est double : des données hétérogènes permettent d'entraîner des politiques plus généralisables, notamment des architectures VLA (vision-language-action) ; la plateforme d'évaluation cloud offre pour la première fois un cadre reproductible pour comparer des méthodes d'apprentissage par imitation ou par renforcement sur des tâches humanoïdes réalistes. L'article analyse aussi les performances de plusieurs politiques de référence, en identifiant leurs forces et limites par catégorie. La publication intervient dans un contexte de forte concurrence autour des données d'entraînement pour humanoïdes. Physical Intelligence (Pi-0, π0.5), NVIDIA (GR00T N2), Unitree et Figure AI misent chacun sur des datasets propriétaires pour différencier leurs politiques de contrôle. Côté recherche ouverte, AgiBot World et RH20T ont posé des jalons, mais restent limités dans leur couverture humanoïde. Humanoid Everyday est rendu entièrement public, dataset, code de collecte et plateforme d'évaluation inclus, ce qui en fait une ressource directement exploitable par des laboratoires et startups sans accès à des infrastructures de collecte massives. Les auteurs présentent cette release comme un socle pour de futurs agents incarnés généralistes, sans préciser d'échéancier pour des suites expérimentales.

UELes équipes de recherche et startups européennes en robotique humanoïde peuvent exploiter directement ce dataset open-source, 10 300 trajectoires, 260 tâches, plateforme d'évaluation cloud, sans investir dans une infrastructure de collecte massive, ce qui réduit la barrière d'entrée face aux acteurs américains et asiatiques disposant de données propriétaires.

💬 Le vrai sujet ici, c'est pas juste le volume (10 300 trajectoires, bon), c'est que les benchmarks humanoïdes existants ignoraient presque tous la locomotion et l'interaction avec des humains réels depuis le début. Des acteurs comme Pi-0 ou GR00T N2 misaient sur leurs données propriétaires comme avantage concurrentiel, et une release open-source de cette ampleur vient rogner ce levier directement. Reste à voir si ça tient face à des politiques entraînées en conditions réelles, mais pour des labos sans infrastructure de collecte massive, ça change le rapport de force.

IA physiqueOpinion
1 source
Alibaba dévoile des cerveaux IA conçus pour équiper la prochaine génération de robots
16Interesting Engineering 

Alibaba dévoile des cerveaux IA conçus pour équiper la prochaine génération de robots

Alibaba a annoncé en juin 2026 le lancement de la suite Qwen-Robot, sa première famille de modèles d'IA dite "embodied", développée par son Tongyi Lab et actuellement en phase de pilote avec des clients entreprise d'Alibaba Cloud. La suite repose sur trois modèles spécialisés : Qwen-RobotNav pour la navigation et le suivi de cibles, Qwen-RobotManip pour la manipulation d'objets physiques, et Qwen-RobotWorld pour la modélisation de l'environnement et la prédiction des conséquences d'actions. Le groupe a également publié Qwen-RobotClaw, un framework d'agents qui expose les modèles Qwen-Robot comme outils accessibles à des agents LLM, ainsi que Chat2Robot, une plateforme open-source en navigateur pour tester des interactions avec des robots physiques. Sur le plan des performances déclarées, Qwen-RobotManip a été entraîné sur plus de 38 000 heures de données open-source et a obtenu sur le benchmark RoboChallenge un process score de 59,83 avec un taux de succès de tâches de 45 % dans la catégorie "généraliste". La démonstration de navigation a mis en scène un quadrupède Unitree Go2 équipé d'un NVIDIA Jetson Thor et d'une seule caméra basse résolution, atteignant une latence d'inférence de 196 millisecondes dans un appartement inconnu, sans carte préchargée. Ces résultats méritent d'être lus avec prudence : un taux de succès de 45 % sur un benchmark réel, s'il est confirmé en conditions non contrôlées, reste modeste mais significatif pour un modèle généraliste. Le vrai signal industriel n'est pas le score brut, c'est l'approche architecturale : au lieu de fusionner indifféremment données de navigation, bras robotiques, caméras et véhicules autonomes, Alibaba a opté pour une spécialisation par modalité, évitant les conflits d'apprentissage que génère le mélange hétérogène de données physiques. Pour les intégrateurs et décideurs B2B, la disponibilité via Alibaba Cloud en pilote marque un premier pas vers la commercialisation d'une couche d'IA robotique as-a-service, potentiellement utilisable sur du matériel tiers sans pipeline de training propriétaire. Alibaba entre dans une course déjà engagée par plusieurs acteurs de premier plan. Aux États-Unis, Google DeepMind fait avancer Gemini Robotics sur des architectures Vision-Language-Action (VLA) similaires, tandis que Physical Intelligence (Pi-0), Figure AI (Figure 03) et Boston Dynamics misent sur des pipelines de données propriétaires et des déploiements industriels réels. NVIDIA pousse son framework GR00T N2 comme socle hardware-logiciel pour l'humanoid. Côté chinois, Unitree et Agibot ont déjà des robots en production, mais sans la couche LLM intégrée qu'Alibaba apporte. L'open-sourcing de Chat2Robot et les pilotes cloud suggèrent une stratégie d'écosystème : capter les développeurs et intégrateurs autour des modèles Qwen-Robot avant que le marché des robots généraux ne se consolide, probablement d'ici 2027-2028 selon les timelines annoncées par les principaux concurrents.

UEL'entrée d'Alibaba dans l'IA robotique cloud-as-a-service intensifie la pression concurrentielle mondiale, sans déploiement ni partenariat européen annoncé à ce stade.

💬 45 % de réussite sur un benchmark généraliste, c'est pas brillant, je sais, mais tu regardes au mauvais endroit. Le vrai signal, c'est l'architecture : trois modèles spécialisés par modalité plutôt qu'un gros fourre-tout, parce que mélanger navigation, manipulation et caméras dans le même pipeline, ça crée des conflits d'apprentissage que tout le monde a sous-estimés depuis le début. Alibaba ne cherche pas à gagner les benchmarks robotiques, ils cherchent à s'installer comme la couche cloud entre le matériel tiers et l'IA physique avant que le marché se consolide.

IA physiqueOpinion
1 source
Alibaba lance Qwen-Robot, sa première famille de modèles d'IA incarnée
17Pandaily 

Alibaba lance Qwen-Robot, sa première famille de modèles d'IA incarnée

Alibaba a publié mardi la suite Qwen-Robot, sa première famille de modèles d'IA incarnée, destinée à relier les grands modèles de langage à l'action robotique dans le monde physique. La suite comprend trois modèles : Qwen-RobotNav pour la navigation visuo-langagière, entraîné sur 15,6 millions d'échantillons en unifiant instruction following, navigation par cible et suivi d'objets ; Qwen-RobotManip pour la manipulation robotique via une architecture VLA (Visual Language Action) basée sur un backbone Qwen3.5-4B VL couplé à une tête de diffusion par flow matching, entraîné sur plus de 38 100 heures de données issues exclusivement de sources open source ; et Qwen-RobotWorld, un modèle de monde prédit des futurs physiquement cohérents pour la manipulation, la conduite et la navigation via une interface en langage naturel. La démonstration centrale met en scène un robot quadrupède Unitree Go2 sur hardware NVIDIA Jetson Thor, équipé d'une unique caméra basse résolution : sans cartographie préalable, il navigue dans un appartement inconnu en suivant des instructions verbales, avec une latence d'inférence de 196 millisecondes. Alibaba a également présenté Qwen-RobotClaw, un framework agent permettant aux modèles Qwen VLM d'appeler les outils Qwen-Robot pour gérer des tâches longues et la mémoire de contexte, et mis en open source Chat2Robot, une plateforme d'évaluation navigateur supportant Qwen-RobotManip sur 50 tâches via le dataset RoboTwin-Clean. Pour les intégrateurs et décideurs industriels, deux points méritent attention. L'entraînement de Qwen-RobotManip exclusivement sur des données open source est un choix architectural significatif : il abaisse les barrières de reproduction et contourne le verrou des données propriétaires qui bloque nombre d'acteurs du secteur. La latence de 196 ms sur Jetson Thor illustre la viabilité de l'inférence embarquée pour la navigation, même si cette performance a été mesurée dans un environnement contrôlé et non en production industrielle. La robustesse à grande échelle reste à démontrer : les vidéos présentées constituent une preuve de concept, pas un déploiement validé. L'architecture Qwen-RobotClaw adresserait un problème concret si elle tient ses promesses en production : la gestion de tâches multi-étapes sans reprogrammation manuelle, qui reste le verrou central de l'adoption robotique en environnements non structurés. Alibaba entre tardivement dans l'espace des modèles de fondation robotiques face à des acteurs déjà positionnés : Physical Intelligence (pi0, levée de 400 M$ en 2024), Figure AI (Figure 03, partenariat BMW), Google DeepMind et NVIDIA avec GR00T N2. En Chine, Unitree (fournisseur du Go2 de la démo), Zhiyuan Robot et Agibot développent leurs propres stacks logicielles embarquées. En Europe, Enchanted Tools et Pollen Robotics avancent sur des plateformes collaboratives, mais sans modèle VLA de cette envergure à ce stade. Les prochaines étapes annoncées incluent l'extension de Chat2Robot à de nouvelles plateformes et tâches robotiques, ainsi qu'une intégration commerciale potentielle via Alibaba Cloud.

UEL'entrée d'Alibaba avec une suite VLA entraînée sur données open source creuse l'écart technologique avec les acteurs européens (Enchanted Tools, Pollen Robotics) qui ne disposent pas encore de modèles de fondation robotiques comparables, même si la stack open source pourrait leur servir de base de développement.

Chine/AsieOpinion
1 source
SoK : Sécurité et vie privée des robots à base de modèles fondation
18arXiv cs.RO 

SoK : Sécurité et vie privée des robots à base de modèles fondation

Une équipe de chercheurs a publié sur arXiv (référence 2606.16788) un article de type "Systematization of Knowledge" (SoK) qui dresse un panorama structuré des risques de sécurité et de confidentialité introduits par les modèles de fondation dans les systèmes robotiques. Le travail systématise 96 études antérieures et propose un cadre d'analyse à quatre couches baptisé F-E-S-G : la couche Modèle de fondation (F), la couche Système incarné (Embodied system, E), la couche Écosystème de support (S), et la couche Impact de gouvernance (G). À chaque couche correspond une taxonomie fine qui encode, pour chaque étude analysée, la cible visée, le stade du cycle de vie, le mécanisme d'attaque ou de défense, le niveau d'accès système requis, et les effets observés. L'intérêt de ce travail réside moins dans les vulnérabilités individuelles qu'il recense que dans les "defense mismatches" qu'il met en évidence : les mécanismes de robustesse conçus pour les modèles de langage ou de vision en contexte purement numérique ne s'appliquent pas directement à des pipelines d'exécution incarnés. Quand un robot piloté par un modèle VLA (Vision-Language-Action) interprète une instruction en langage naturel pour saisir un objet, une attaque adversariale ou une injection de prompt ne produit plus une réponse textuelle erronée mais un mouvement physique potentiellement dangereux. Pour un intégrateur industriel ou un COO déployant des flottes humanoïdes, cette propagation du risque à travers les quatre couches constitue un angle mort opérationnel que les grilles d'évaluation actuelles ne capturent pas. Le genre "SoK" est une convention bien établie dans la communauté sécurité, notamment via la conférence IEEE S&P, et signale une tentative de structurer un champ de recherche fragmenté. Cette publication arrive à un moment de transition dans la robotique commerciale : après des années de démos contrôlées, plusieurs acteurs (Figure, Apptronik, Unitree côté américain, Wandercraft et Enchanted Tools côté européen) engagent des déploiements en environnement réel avec des VLAs comme Pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA). L'absence de cadre normatif unifié, que ni l'EU AI Act ni les standards ISO robotiques actuels ne couvrent explicitement, donne à cette méta-analyse une pertinence directe pour les équipes réglementaires et les organismes de certification appelés à évaluer ces systèmes hybrides IA-robotique.

UEL'EU AI Act et les normes ISO robotiques actuelles ne couvrent pas explicitement les systèmes hybrides IA-robotique : ce SoK fournit aux équipes réglementaires européennes et aux acteurs français (Wandercraft, Enchanted Tools) déployant des VLAs un cadre d'analyse des risques directement utilisable pour anticiper les futures exigences de certification.

RechercheOpinion
1 source
L'IA et les modèles du monde : pourquoi la Chine a une longueur d'avance
19SCMP Tech 

L'IA et les modèles du monde : pourquoi la Chine a une longueur d'avance

Les modèles de monde ("world models") sont désormais identifiés comme la prochaine rupture technologique en intelligence artificielle, dépassant les grands modèles de langage (LLM) en leur ajoutant une capacité de simulation de l'environnement physique. Contrairement aux LLM qui traitent du texte, ces architectures apprennent les lois de la physique, la causalité et la géométrie de l'espace réel, ce qui permet d'entraîner des systèmes à intelligence incarnée (embodied AI) : robots humanoïdes, véhicules autonomes, bras industriels. La Chine a déjà déployé ces systèmes à une échelle nettement supérieure à celle des États-Unis, avec des entreprises comme Baidu Apollo (plusieurs dizaines de millions de kilomètres d'autonomie sur route réelle), Unitree et ses robots humanoïdes en production, ainsi que des modèles de monde propriétaires développés par Tencent (HunyuanWorld) et ByteDance. Cet avantage chinois est structurel autant que technologique : le cadre réglementaire y autorise des déploiements massifs en conditions réelles, là où les États-Unis maintiennent des restrictions plus strictes sur les tests d'autonomie. Pour les intégrateurs industriels et les décideurs B2B, cela signifie que le gap sim-to-real, longtemps considéré comme le principal frein à l'adoption robotique, est en train d'être résolu plus vite en Chine qu'ailleurs. Les world models permettent de générer des données synthétiques d'entraînement à partir de simulations physiquement cohérentes, réduisant drastiquement le besoin de collecte en environnement réel. Côté contexte, le concept de world model remonte aux travaux de Yann LeCun chez Meta (architecture JEPA, 2022-2024), mais sa concrétisation industrielle s'est accélérée en 2025-2026 avec l'émergence de modèles dédiés à la robotique comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA et les plateformes chinoises. En Europe, des acteurs comme Enchanted Tools (Paris) travaillent sur des approches similaires mais à bien plus petite échelle. La prochaine étape sera probablement la standardisation des benchmarks de world models, un domaine où le leadership de définition reste encore ouvert.

UEL'Europe accuse un retard structurel face à la Chine dans la course aux world models pour la robotique incarnée, avec seulement Enchanted Tools (Paris) identifié comme acteur actif à petite échelle, là où Pékin bénéficie d'un cadre réglementaire autorisant des déploiements massifs en conditions réelles qui accélèrent la résolution du gap sim-to-real.

Chine/AsieOpinion
1 source
La régularisation en sortie élimine la loterie des seeds dans le fine-tuning VLA sur GPU unique
20arXiv cs.RO 

La régularisation en sortie élimine la loterie des seeds dans le fine-tuning VLA sur GPU unique

Une équipe de chercheurs révèle dans un prépublication arXiv (2606.13856, juin 2026) un défaut structurel dans le fine-tuning des modèles vision-langage-action sur GPU unique : la "loterie de seed". En exécutant le même code d'entraînement sur VLA-JEPA treize fois avec des graines aléatoires différentes, mêmes données, même architecture, douze runs atteignent 91 à 94 % de taux de succès sur les benchmarks LIBERO, mais un run chute silencieusement à 65,2 %, soit un écart de 29 points de pourcentage, sans message d'erreur ni avertissement. La cause identifiée est un phénomène d'effondrement de sortie (output collapse) : le prédicteur d'action converge vers des sorties quasi-identiques quelle que soit l'observation visuelle. Les auteurs ont évalué 7 méthodes de régularisation sur jusqu'à 13 seeds et 3 benchmarks LIBERO, et montrent que trois régularisateurs au niveau des sorties, VICReg (n=12 seeds), Dropout (n=4), et un taux d'apprentissage divisé par deux (n=5), éliminent chaque run catastrophique : 0 effondrement sur 21 tentatives combinées, contre 1/13 pour la baseline (F(12,11)=28,7, p<0,001). Les méthodes classiques de régularisation au niveau des poids, L2 et EWC, laissent la loterie intacte. Ce résultat remet en cause une hypothèse implicite du secteur : que le fine-tuning sur GPU unique des VLA est reproductible par défaut. Pour les intégrateurs industriels et les laboratoires qui déploient Pi-0, GR00T N2, Helix ou des modèles similaires sur des robots réels, un écart de 29 pp non détectable est un risque opérationnel concret. Les méthodes L2 et EWC pénalisent les changements de poids mais restent aveugles à l'effondrement qui se produit dans le null-space jacobien, là où les poids peuvent varier librement sans modifier les sorties observables. La correction la plus simple demande un seul changement dans la configuration de l'optimiseur, ce qui rend la solution immédiatement déployable sans refonte d'architecture. Les VLA connaissent depuis 2024 une montée en puissance accélérée, avec des acteurs comme Physical Intelligence (Pi-0), NVIDIA (GR00T N2) et 1X (Helix) qui misent sur des politiques généralisables entraînées sur données hétérogènes. Le fine-tuning sur matériel modeste est devenu un enjeu clé pour démocratiser l'accès à ces modèles au-delà des grandes entreprises disposant de clusters de calcul. VICReg, issu des travaux de Meta AI sur l'apprentissage auto-supervisé, se retrouve ici appliqué avec succès à la stabilisation de l'espace d'action robotique. Les prochaines étapes naturelles incluent la validation sur robots physiques hors simulation LIBERO, et l'extension à d'autres architectures VLA pour confirmer la généralité du diagnostic.

UELes laboratoires et intégrateurs français/européens qui font du fine-tuning de VLA (Pi-0, GR00T N2, Helix) sur GPU unique sont directement exposés à ce risque opérationnel silencieux (-29 pp), mais peuvent l'éliminer immédiatement via VICReg ou un ajustement du taux d'apprentissage sans refonte d'architecture.

💬 Un run sur treize qui s'effondre à 65 % sans le moindre message d'erreur, c'est le genre de bombe à retardement qu'on découvre sur robot réel, pas en benchmark. Ce qui est malin ici, c'est d'avoir localisé le problème dans l'espace des sorties, là où L2 et EWC sont complètement aveugles. La correction tient en un paramètre d'optimiseur, donc si tu fais du fine-tuning VLA aujourd'hui, t'as pas vraiment d'excuse.

IA physiqueActu
1 source
Sommet en robotique : un panel fait le point sur la conception des robots humanoïdes
21Robotics Business Review 

Sommet en robotique : un panel fait le point sur la conception des robots humanoïdes

Lors du Robotics Summit & Expo 2026, tenu à Boston au Thomas B. Menino Convention & Exhibition Center devant quelque 3 900 participants, un panel de haut niveau a fait le point sur l'état réel du développement des robots humanoïdes. Alberto Rodriguez, directeur du comportement robot pour Atlas chez Boston Dynamics, y a révélé que l'entreprise a engagé le déploiement de l'ordre de 25 000 humanoïdes Atlas dans des usines, avec un objectif de capacité de production portée à 30 000 unités par an d'ici 2028. Boston Dynamics a conduit une première démonstration en conditions réelles en usine en 2025, architecture entièrement pilotée par les données, puis a présenté Atlas au CES de janvier 2026 pendant une semaine complète. Pour 2026, la société prévoit un retour en usine pour une démonstration plus complète, de bout en bout, connectant le robot au système d'information de l'usine et gérant les exceptions opérationnelles. Du côté d'Agility, dont la marque commerciale s'est récemment stabilisée sous le nom Agility (ex-Agility Robotics), les déploiements du robot Digit avancent avec Amazon, GXO, Schaeffler, Toyota et Mercado Libre, marquant une sortie effective de la phase pilote. Ce que ce panel signale clairement pour les intégrateurs et décideurs industriels, c'est que le vrai verrou n'est plus mécanique ni même algorithmique, mais stratégique. Rodriguez a posé le problème avec précision : sauf pour de rares applications à très grand volume et très stable, presque tous les postes de travail sont des cas uniques. Le défi du passage à l'échelle repose sur trois axes simultanés, hardware, modèles de comportement, et stratégie d'intégration, et l'échec sur l'un suffit à rendre le déploiement économiquement non viable. La décision de Boston Dynamics de commencer par la logistique en manufacturing, un environnement qui exige de la généralité sans imposer encore les contraintes de timing et de sécurité de la ligne d'assemblage, illustre une approche pragmatique et graduée. Ces chiffres de déploiement engagés, 25 000 unités, sont une donnée de marché rare dans un secteur habitué aux annonces sans livraisons. Boston Dynamics, filiale de Hyundai depuis 2021, a traversé une longue période de recherche pure avant de commercialiser Atlas dans sa version électrique présentée en 2024, succédant aux plateformes hydrauliques historiques. Le marché des humanoïdes reste en pleine effervescence : Figure AI avec Figure 03, Tesla avec Optimus Gen 3 sur sa propre ligne de production, Physical Intelligence avec Pi-0, NVIDIA avec GR00T N2, et des acteurs émergents comme 1X Technologies ou Apptronik positionnent tous leurs solutions sur des créneaux différents, de l'assemblage léger à la manutention lourde. Côté Europe, Enchanted Tools (France) et Wandercraft restent focalisés sur des niches spécifiques, assistance et rééducation, sans viser encore le marché industriel général. Les prochaines étapes à surveiller : la publication par ASTM International (représenté dans le panel par Aaron Prather) de standards de sécurité pour la cohabitation humains-humanoïdes, et les résultats concrets des déploiements Agility/Amazon, dont les métriques opérationnelles restent pour l'instant non publiques.

UELes entreprises françaises (Enchanted Tools, Wandercraft) restent cantonnées aux niches assistance/rééducation sans feuille de route vers l'industriel général, creusant un écart stratégique avec les déploiements à grande échelle désormais en cours en Amérique du Nord.

HumanoïdesActu
1 source
Apprendre à assister : des modèles VLA collaboratifs pour la coopération implicite humain-robot
22arXiv cs.RO 

Apprendre à assister : des modèles VLA collaboratifs pour la coopération implicite humain-robot

Des chercheurs ont publié le 12 juin 2026 (arXiv:2606.12475) une étude sur l'usage de modèles vision-langage-action (VLA) entraînés par imitation learning pour la collaboration humain-robot (HRC) implicite, sans signal explicite déclenchant l'assistance robotique. Évaluant deux VLA de référence sur des tâches d'assemblage collaboratif, l'équipe identifie un défaut propre aux politiques d'action-chunking : la "fuite d'actions de démonstration" (demonstration action leakage). Ce phénomène survient lorsque des chunks d'actions enjambent des transitions latentes de sous-tâches, poussant le robot à assister l'humain trop tôt, comme tendre un outil avant que l'opérateur soit prêt à le saisir. Pour corriger ce comportement sans réentraîner le modèle, les auteurs proposent un pilotage à l'inférence (inference-time steering). Une étude à 16 participants sur une tâche d'assemblage longue horizon confirme que le steering réduit les interventions prématurées, accélère la collaboration et diminue les échecs par rapport à une politique à horizon court. Ce résultat ouvre une voie concrète pour l'intégration des VLA dans des workflows industriels collaboratifs, jusqu'ici dépendants de pipelines codés à la main, peu scalables vers de nouvelles tâches. La fuite d'actions constitue un avertissement direct pour les équipes déployant des politiques ACT ou diffusion en mode HRC : allonger l'horizon d'exécution, souvent souhaitable pour la fluidité du mouvement, aggrave le problème. Le steering à l'inférence fournit un correctif opérationnel sans modification du modèle entraîné, ce qui le rend attractif pour un déploiement rapide. Les VLA généralistes comme Pi-0 (Physical Intelligence), OpenVLA ou GR00T N2 (NVIDIA) ont prouvé leur efficacité en manipulation autonome, mais leur usage en HRC implicite restait peu documenté. Cette publication comble ce manque méthodologique. En Europe, des acteurs comme Enchanted Tools et Wandercraft, dont les robots sont conçus pour opérer aux côtés d'humains, pourraient réduire leur charge d'ingénierie manuelle en s'appuyant sur ces résultats. La prochaine étape sera d'étendre la méthode à des environnements industriels non contrôlés et à des tâches encore plus longues, afin d'évaluer la robustesse du steering face à la variabilité réelle des comportements humains.

UEEnchanted Tools et Wandercraft, acteurs européens de la robotique collaborative, pourraient réduire leur charge d'ingénierie manuelle en adoptant le steering à l'inférence pour corriger la fuite d'actions dans leurs déploiements VLA, sans réentraîner leurs modèles.

RechercheOpinion
1 source
DuoBench : un benchmark reproductible pour la manipulation bimanuelles en simulation et dans le monde réel
23arXiv cs.RO 

DuoBench : un benchmark reproductible pour la manipulation bimanuelles en simulation et dans le monde réel

Une équipe de chercheurs a publié en juin 2026 DuoBench, un cadre de benchmarking dédié à la manipulation bimanuelle, conçu pour la plateforme FR3 Duo de Franka Robotics. Le benchmark comprend onze tâches réparties en quatre catégories de coordination, implémentées en simulation et partiellement reproduites en environnement réel grâce à des protocoles reproductibles incluant des composants imprimables en 3D. Les auteurs ont constitué des jeux de données de télé-opération humaine pour l'ensemble des onze tâches, et proposent un schéma d'évaluation par étapes (stage-based evaluation) permettant une analyse sémantique fine des modes d'échec, au-delà du simple critère binaire succès/échec. Plusieurs politiques d'apprentissage par imitation à deux bras ainsi que des politiques VLA (vision-language-action) ont été évaluées en simulation et sur matériel réel. Les résultats sont sans ambiguïté : les politiques actuelles, y compris les approches VLA considérées comme l'état de l'art, restent insuffisantes pour la manipulation bimanuelle. Les échecs se concentrent sur trois axes : les phases d'interaction initiale, l'exécution parallèle des deux bras, et le transfert simulation-réel (sim-to-real). Ce dernier point est particulièrement significatif : malgré les progrès récents sur le gap sim-to-real pour la manipulation à un bras, DuoBench révèle que la coordination bimanuelle pose des défis supplémentaires non résolus. Pour les équipes R&D et les intégrateurs industriels, ce benchmark fournit un outil diagnostique structuré pour identifier précisément où les politiques échouent, une lacune que les frameworks existants comme RLBench ou LIBERO, conçus pour les systèmes à un seul bras, ne comblaient pas. La manipulation bimanuelle est un prérequis pour de nombreuses tâches complexes en industrie (assemblage, conditionnement, manipulation d'objets déformables), ce qui explique l'intérêt croissant du secteur pour les plateformes à deux bras. Le FR3 Duo de Franka Robotics est l'une des rares plateformes de recherche standardisées pour ce segment. Dans la course aux capacités bimanuelles, des acteurs comme Physical Intelligence avec Pi-0, NVIDIA avec GR00T N2, ou Figure AI avec ses robots humanoïdes ont annoncé des performances prometteuses, mais les benchmarks publics rigoureux permettant de les comparer restent rares. DuoBench, dont le code, les jeux de données et les vidéos sont disponibles sur duobench.github.io, ambitionne de combler ce manque avec un protocole reproductible que tout laboratoire peut répliquer à faible coût grâce aux assets imprimables en 3D.

UEFranka Robotics (Allemagne) est la plateforme centrale de DuoBench, offrant aux laboratoires et équipes R&D européens un benchmark standardisé et reproductible pour évaluer leurs politiques bimanuelle, y compris les approches VLA, sans disposer de ressources matérielles coûteuses.

FR/EU ecosystemePaper
1 source
NEURA Robotics lève jusqu'à 1,4 milliard de dollars en Série C pour son IA physique
24Robotics Business Review 

NEURA Robotics lève jusqu'à 1,4 milliard de dollars en Série C pour son IA physique

NEURA Robotics GmbH, basée à Metzingen en Allemagne, a annoncé le 10 juin 2026 une levée de fonds de Série C pouvant atteindre 1,4 milliard de dollars, financée par un consortium d'investisseurs technologiques dont Tether, Qualcomm et Amazon. La startup, fondée en 2019 par David Reger, commercialise une gamme couvrant des bras robotiques légers, des robots mobiles (série MAV), des robots humanoïdes (modèle 4NE1) et un manipulateur mobile polyvalent baptisé MiPA, ciblant principalement la fabrication et la supply chain. Ce tour de table vient financer deux axes prioritaires : le développement de la plateforme "Neuraverse", décrite comme un écosystème ouvert d'IA physique permettant aux robots d'apprendre collectivement entre déploiements, et l'expansion d'un réseau mondial de "NEURA Gyms", des environnements d'entraînement à grande échelle combinant interaction sensorielle réelle, simulation et pipelines d'apprentissage multimodal. Il s'agit à ce stade d'une annonce de financement, pas d'un produit expédié ni d'un déploiement industriel documenté à grande échelle. Sur le fond, une levée de 1,4 milliard de dollars pour un acteur européen de la robotique humanoïde est un signal fort : les capitaux qui se concentraient jusqu'ici quasi exclusivement sur Figure AI, Agility Robotics, 1X ou Tesla Optimus commencent à irriguer des challengers hors Silicon Valley. Pour les intégrateurs et les décideurs industriels, la question concrète est celle du sim-to-real gap, que NEURA tente de réduire via son partenariat avec Dassault Systèmes annoncé en avril 2026. Le concept de Neuraverse, où plusieurs robots partagent une intelligence distribuée entre déploiements, s'inscrit dans une tendance plus large des architectures VLA (Vision-Language-Action) à l'échelle fleet, comme l'illustre Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA. Les métriques de performance annoncées restent cependant absentes du communiqué, ce qui rend toute comparaison technique avec les concurrents impossible à ce stade. NEURA Robotics a bâti depuis 2019 un réseau de partenaires industriels structurant : Bosch pour le développement logiciel des humanoïdes (janvier 2026), Dassault Systèmes pour la simulation, mais aussi Schaeffler, Kawasaki, Delta Electronics, Qualcomm et NVIDIA pour l'infrastructure edge AI et les composants. Ce positionnement d'écosystème décentralisé tranche avec l'approche verticalement intégrée de Figure ou de Tesla. En Europe, NEURA est aujourd'hui l'acteur humanoïde le mieux capitalisé, loin devant des startups comme Enchanted Tools (France) ou Wandercraft, qui opèrent sur des segments différents (cobots expressifs et exosquelettes médicaux). Les prochaines étapes déclarées portent sur l'accélération du déploiement à l'échelle industrielle et l'ouverture de nouveaux NEURA Gyms à l'international, sans calendrier précis communiqué.

UENEURA Robotics, acteur allemand désormais le humanoïde le mieux capitalisé d'Europe avec 1,4 Md$, implique directement Dassault Systèmes (France) comme partenaire stratégique simulation et repositionne l'UE comme concurrent crédible face aux leaders américains de la robotique humanoïde industrielle.

FR/EU ecosystemeOpinion
1 source
Exploration des robots à base de modèles fondation dans les soins aux patients et aux personnes âgées
25arXiv cs.RO 

Exploration des robots à base de modèles fondation dans les soins aux patients et aux personnes âgées

Une équipe de chercheurs a publié en juin 2026 sur arXiv (référence 2606.10208) une analyse de synthèse portant sur l'intégration des modèles de fondation dans les robots de soin aux personnes âgées et aux patients. L'article, classé comme Perspective, passe en revue l'état de l'art sur trois axes : les caractéristiques de conception, l'expérience utilisateur mesurée, et les preuves d'impact sur les soins. Le constat central est que les architectures dominantes utilisent les modèles de fondation comme couche de conversation et de raisonnement au sein d'incarnations socioassistives centrées sur la voix, des agents qui parlent et écoutent mais dont l'autonomie physique et la compréhension multimodale restent fortement limitées. Les évaluations empiriques rapportent des bénéfices positifs en termes d'utilisabilité et d'engagement, mais des défaillances de fiabilité persistent : hallucinations, ruptures conversationnelles et pannes dans le pipeline d'interaction. L'enjeu pour les intégrateurs et décideurs du secteur santé est précisément là : les métriques actuellement rapportées portent sur des résultats proximaux comme l'engagement cognitif ou la participation, et non sur des indicateurs cliniques validés. Les robots sociaux conversationnels améliorent peut-être le ressenti ou l'interaction, mais aucun système décrit dans la littérature ne démontre d'impact mesurable sur des outcomes de santé standardisés. Cette lacune est critique pour tout déploiement en EHPAD ou à l'hôpital, où la responsabilité médicale exige traçabilité et supervision humaine explicite. Les auteurs soulignent que les benchmarks génériques importés du NLP ou de la robotique généraliste ne sont pas adaptés aux contraintes des environnements de soin. Le contexte est celui d'une accélération massive des modèles de fondation en robotique, de PaLM-E à Pi-0 de Physical Intelligence en passant par GR00T N2 de NVIDIA, qui creuse un écart croissant entre capacités techniques et readiness clinique. Du côté des plateformes établies, Pepper (SoftBank) et PARO (AIST, Japon) restent les références les plus documentées en milieu de soin. Des acteurs européens comme Enchanted Tools avec Mirokaï, ou des projets portés par l'Inria, s'inscrivent dans cette dynamique. Les auteurs appellent à une transition vers des standards d'évaluation spécifiques aux soins, une autonomie avec supervision humaine intégrée dès la conception, et une intégration réelle dans les flux de travail cliniques, trois conditions encore largement non remplies par les systèmes actuels.

UEEnchanted Tools (Mirokaï) et l'Inria sont explicitement cités comme acteurs européens engagés dans la robotique de soin, et les lacunes identifiées (absence de standards d'évaluation cliniques, supervision humaine insuffisante) concernent directement les déploiements en EHPAD et hôpitaux français soumis à la réglementation médicale.

RecherchePaper
1 source
Vulnérabilités des modèles vision-langage-action (VLA) face aux défauts physiques d'articulation
26arXiv cs.RO 

Vulnérabilités des modèles vision-langage-action (VLA) face aux défauts physiques d'articulation

Des chercheurs ont publié le 10 juin 2026 (arXiv:2606.10501) une étude identifiant une vulnérabilité critique des modèles Vision-Language-Action (VLA) face aux défauts physiques articulaires. Ces modèles, qui traduisent instructions en langage naturel et observations visuelles en commandes motrices, équipent aujourd'hui les robots humanoïdes et manipulateurs les plus avancés. Les auteurs montrent que des failles réalistes, notamment dégradation d'actionneur, friction excessive due à l'usure, dommages de collision ou limites de sécurité restreintes, cassent la boucle fermée entre action commandée, mouvement réalisé et observation suivante, dégradant les taux de succès même pour des défauts physiquement « faisables ». L'impact varie selon l'articulation affectée, rendant toute mitigation générique difficile. En réponse, les auteurs proposent J-PARC (Joint-level Physical-fault Aware Residual Calibrator), un module léger ajouté au-dessus d'une politique VLA figée, qui infère un régime de défaut latent depuis la dynamique articulaire récente et applique une correction résiduelle adaptative sans modifier le modèle de base. Ce résultat comble un angle mort réel dans la validation des systèmes robotiques à base de VLA. L'effort de robustification s'est jusqu'ici concentré sur les variations perceptuelles et sémantiques : éclairage, occlusion, reformulation d'instructions. Or tout robot industriel accumule friction, chocs et dégradation d'actionneur au fil du temps. Montrer que ces perturbations physiquement réalisables suffisent à faire chuter les performances remet en cause l'hypothèse implicite qu'un VLA entraîné sur hardware neuf reste fiable tout au long de son cycle de vie opérationnel. Pour les intégrateurs et responsables de certification, c'est un signal fort : la robustesse mécanique doit entrer dans les critères de qualification aux côtés de la généralisation sémantique. L'approche J-PARC, sans fine-tuning ni capteur supplémentaire, offre une piste d'adaptation réaliste pour les déploiements existants. Les VLA ont connu une montée en puissance rapide depuis Pi-0 (Physical Intelligence, 2024) et GR00T N2 (NVIDIA, 2025), avec des déploiements annoncés chez Figure (modèle 03), Agility Robotics et 1X Technologies. Malgré leurs performances en laboratoire, leur comportement sur hardware vieillissant reste peu documenté dans la littérature. Ce papier s'inscrit dans une tendance croissante sur la fiabilité opérationnelle à long terme, aux côtés des travaux sur le sim-to-real gap. En Europe, des acteurs comme Enchanted Tools avec Mirokaï ou Wandercraft, où la dégradation articulaire est un enjeu quotidien en milieu médical ou logistique, sont directement concernés par ces résultats. Les prochaines étapes naturelles seront une validation sur hardware en vieillissement accéléré et l'intégration de J-PARC dans des pipelines de déploiement continu.

UELes acteurs français Enchanted Tools et Wandercraft, confrontés à la dégradation articulaire en milieu médical et logistique, peuvent directement intégrer J-PARC pour fiabiliser leurs déploiements VLA sans modifier leurs modèles de base.

💬 On a tous fait cette hypothèse implicite : un VLA entraîné en labo reste fiable sur un robot qui a pris des coups après 18 mois en prod. Ce papier montre que non, et c'est un angle mort réel pour tous les intégrateurs qui déploient en milieu industriel ou médical. J-PARC corrige ça sans toucher au modèle de base, bon, reste à voir si ça tient sur du vrai hardware vieilli.

IA physiqueOpinion
1 source
Contrôle de flux : piloter les modèles vision-langage-action avec des entrées simples en temps réel
27arXiv cs.RO 

Contrôle de flux : piloter les modèles vision-langage-action avec des entrées simples en temps réel

Des chercheurs publient en juin 2026 une méthode baptisée "flow control" (arXiv:2606.10180) permettant de piloter en temps réel les modèles VLA (Vision-Language-Action) via des entrées génériques, comme un clavier ou un joystick, sans aucun ré-entraînement ni fine-tuning. L'approche opère à l'inférence en orientant l'échantillonnage du modèle vers des actions qui reflètent l'intention de l'opérateur tout en restant dans la distribution experte apprise à l'entraînement. Les auteurs documentent dans ce preprint quatre propriétés mesurées : guidage précis et réactif, robustesse aux commandes imprécises, taux de succès améliorés avec réduction des temps de tâche, et enfin un gain de performance autonome lorsqu'on fine-tune le VLA sur les trajectoires corrigées par flow control. L'enjeu est concret pour les intégrateurs : les VLAs montrent des performances solides en démo, mais leurs taux d'échec en déploiement réel restent non nuls face aux variations d'environnement et aux instructions ambiguës. Plutôt que de corriger ces défauts par du ré-entraînement coûteux, flow control permet à un opérateur de guider le robot à la volée sans dégrader la qualité des mouvements générés. La boucle est vertueuse : les corrections humaines produisent des trajectoires haute qualité réutilisables comme données d'entraînement, traçant un chemin de déploiement progressif où la supervision humaine se retire au fil des itérations. Les VLAs ont pris de l'ampleur avec Pi-0 de Physical Intelligence (publié fin 2024), dont l'architecture repose précisément sur le flow matching, d'où le jeu de mots du titre. NVIDIA GR00T N2, OpenVLA (Berkeley/Stanford), et les modèles LeRobot de Hugging Face (Paris) constituent les autres plateformes où cette couche de contrôle pourrait s'intégrer sans modifier le pipeline d'entraînement existant. L'idée de guidage conditionné à l'inférence existe déjà en génération d'images via le classifier guidance des modèles de diffusion, mais son application à la robotique physique restait peu explorée. Les prochaines étapes annoncées dans le papier incluent le fine-tuning systématique sur trajectoires flow-control pour quantifier le gain autonome à plus grande échelle.

UEHugging Face (Paris) est explicitement cité comme plateforme d'intégration via LeRobot, ce qui rend cette méthode directement applicable à l'initiative robotique open-source française sans modifier le pipeline d'entraînement existant.

💬 C'est exactement le problème que personne ne veut admettre sur les VLAs : ils impressionnent en démo et flanchent en prod dès que l'environnement bouge un peu. L'idée de guider l'échantillonnage à l'inférence plutôt que de tout ré-entraîner, c'est le genre de solution pragmatique qu'on attendait. La boucle où les corrections humaines deviennent des données d'entraînement, c'est propre, et si ça marche à l'échelle avec LeRobot, Hugging Face tient quelque chose de sérieux.

IA physiqueOpinion
1 source
Contrôle corps entier généraliste et adaptable pour la locomotion de divers humanoïdes
28arXiv cs.RO 

Contrôle corps entier généraliste et adaptable pour la locomotion de divers humanoïdes

Des chercheurs ont publié sur arXiv (référence 2602.05791) un framework baptisé XHugWBC, conçu pour entraîner un contrôleur de locomotion whole-body universel sur une large distribution de morphologies humanoïdes, puis le déployer en zero-shot sur des robots non vus durant l'entraînement. Les expériences couvrent douze humanoïdes simulés et sept robots réels. Le système repose sur trois briques techniques : une randomisation morphologique physiquement cohérente (masse des segments, longueur des membres, inertie), des espaces d'observation et d'action alignés sémantiquement entre châssis hétérogènes, et une architecture de politique qui encode explicitement les propriétés morphologiques et dynamiques de chaque instance. L'entraînement est unique, "one-time training" : aucun fine-tuning par robot n'est requis à l'inférence. L'enjeu industriel est direct. Aujourd'hui, chaque équipe robotique entraîne ses contrôleurs de locomotion depuis zéro pour chaque châssis, ce qui représente des semaines de simulation et d'itérations sim-to-real. XHugWBC déplace ce coût vers une phase d'entraînement généraliste unique, ouvrant la voie à un modèle de déploiement où un intégrateur peut adopter un nouveau châssis humanoïde sans reconstruire l'intégralité de sa stack de contrôle. La validation sur sept robots physiques est plus convaincante que les résultats purement simulés habituels, même si la nature exacte des tâches testées et les taux de succès détaillés ne figurent pas dans le résumé disponible. La capacité de transfert zero-shot sur morphologies inédites renforce l'hypothèse que les biais structuraux appris sur distributions larges surpassent les politiques spécialisées sur certains régimes de locomotion, ce que le secteur débattait encore il y a dix-huit mois. Ce travail s'inscrit dans un mouvement vers les contrôleurs dits "fondation" pour la robotique incarnée. En manipulation, des systèmes comme pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA) ont déjà exploré la généralisation cross-embodiment sur bras et effecteurs; l'extension à la locomotion whole-body humanoïde est plus contrainte par la stabilité dynamique. Les acteurs du secteur, Figure Robotics (Figure 03), Unitree (G1, H1), Agility Robotics (Digit), Fourier Intelligence et 1X Technologies, maintiennent tous des pipelines de contrôle propriétaires et spécialisés. Si XHugWBC tient ses promesses à l'échelle, il réduirait significativement la barrière à l'entrée pour les nouveaux constructeurs, notamment les acteurs européens comme Enchanted Tools (Mirokaï) ou Wandercraft, qui ne disposent pas des ressources d'entraînement des géants américains. Le preprint n'a pas encore fait l'objet d'une évaluation par les pairs.

UELes constructeurs humanoïdes français Wandercraft et Enchanted Tools (Mirokaï) sont explicitement identifiés comme bénéficiaires potentiels, ce framework pouvant réduire significativement leurs coûts d'entraînement de locomotion sans nécessiter les ressources des géants américains.

💬 C'est le genre de papier qui résout un vrai problème industriel : chaque robot humanoïde qui sort oblige aujourd'hui à tout réentraîner depuis zéro. Sept robots physiques en zero-shot, c'est pas du tout la même chose que des résultats simulés, ça valide quelque chose de sérieux. Pour Wandercraft ou Enchanted Tools, bien plus contraints en ressources que Figure ou Unitree, ce type de contrôleur généraliste c'est du concret.

IA physiqueOpinion
1 source
MIIT et SASAC lancent l'initiative 2026 d'entraînement des robots humanoïdes en conditions réelles
29Pandaily 

MIIT et SASAC lancent l'initiative 2026 d'entraînement des robots humanoïdes en conditions réelles

Le ministère chinois de l'Industrie et des Technologies de l'Information (MIIT) et la Commission de surveillance des actifs d'État (SASAC) ont publié conjointement, en juin 2026, un plan d'action national intitulé "Action spéciale pour la formation en scénarios réels des robots humanoïdes et de l'IA embodied". L'objectif affiché : d'ici fin 2026, les humanoïdes et leurs composants clés devront avoir achevé leur vérification applicative et basculer en "mode opérationnel" dans des environnements industriels, de services ou spécialisés. Le plan cible l'identification de plus de 100 scénarios à haute valeur et une capacité de déploiement à l'échelle de 10 000 unités. Les autorités provinciales sont tenues de sélectionner au moins 20 scénarios couvrant deux des trois domaines prioritaires ; les grandes entreprises centrales d'État doivent en identifier au moins 10 dans leurs secteurs respectifs. Le dispositif impose la création de consortiums d'innovation applicative regroupant utilisateurs finaux, fabricants, développeurs d'algorithmes et instituts de recherche. Ces consortiums devront produire des jeux de données d'IA embodied couvrant trajectoires de mouvement, courbes de contrôle force-position et séquences d'exécution de tâches, ainsi que des "packages de compétences" issus d'entraînements en conditions réelles. Des mécanismes de financement incluant equity, dette et assurance complètent le dispositif. Ce plan est la feuille de route gouvernementale la plus structurée publiée par Pékin sur l'industrialisation des humanoïdes, mais l'objectif de 10 000 unités déployées d'ici décembre 2026 est ambitieux, plusieurs observateurs le jugeant irréaliste compte tenu des délais habituels entre annonce politique et opérationnel réel. Ce qui est plus significatif, c'est la logique consortiale imposée : en forçant la coopération entre intégrateurs, fabricants et chercheurs autour de scénarios concrets, l'État tente d'accélérer le passage de la démo en laboratoire à l'usage en production. La prescription explicite de datasets couvrant les courbes force-position signale que Pékin cible directement le verrou du sim-to-real, encore non résolu à l'échelle industrielle. Pour un COO ou un intégrateur, cela signifie qu'un écosystème subventionné et doté d'obligations de résultat se structure en Chine avec des délais contractuels précis. Cette initiative prolonge la stratégie "Made in China 2025" et les plans successifs sur la robotique avancée. Les acteurs nationaux directement visés incluent Unitree (H1, G1), UBTECH (Walker S), Agibot et Fourier Intelligence, qui ont tous conduit des tests industriels en 2024-2025. Sur le plan international, la concurrence se structure autour de Figure AI (Figure 03), Tesla (Optimus Gen 3), Physical Intelligence (Pi-0) et Nvidia (GR00T N2), tous revendiquant des déploiements pilotes en environnements réels. En Europe, Wandercraft et Enchanted Tools restent positionnés sur des segments distincts, l'exosquelette médical et la robotique de service, sans concurrence directe sur le créneau industriel visé par ce plan. Les prochaines étapes dépendront de la capacité des consortiums à produire des résultats mesurables avant l'échéance de fin 2026.

UELa structuration d'un écosystème humanoïde subventionné en Chine avec des obligations de résultat contractuels accroît la pression concurrentielle sur les acteurs européens, bien que Wandercraft et Enchanted Tools restent positionnés sur des segments (exosquelette médical, robotique de service) non directement visés par ce plan industriel.

Chine/AsieOpinion
1 source
Attaquer les modèles du monde pour compromettre les pipelines d'apprentissage robotique
30arXiv cs.RO 

Attaquer les modèles du monde pour compromettre les pipelines d'apprentissage robotique

Un preprint déposé sur arXiv le 9 juin 2026 (arXiv:2606.09499) expose une classe inédite d'attaques par empoisonnement de données ciblant les world models intégrés aux pipelines d'apprentissage robotique. Contrairement aux attaques traditionnelles qui insèrent directement des trajectoires dangereuses dans un jeu de données vendu ou publié, la méthode décrite ici injecte des prompts malveillants ou des dynamiques de transition compromises dans des datasets de téléopération en apparence sûrs. L'attaque reste dormante jusqu'à ce que ces données soient traitées par un world model, lequel génère alors des trajectoires synthétiques d'entraînement dangereuses, aboutissant au déploiement d'une politique robotique unsafe. Les chercheurs démontrent l'efficacité de l'attaque sur deux paradigmes distincts : les world models conditionnés par l'action (action-conditioned) et ceux conditionnés par le texte (text-conditioned). Résultat concret : un backdoor de bout en bout sur une politique DRL (Deep Reinforcement Learning) en aval, et une preuve de concept dans le cadre VLA (Vision-Language-Action). L'enjeu pour l'industrie est structurel. Les world models sont désormais utilisés comme substituts de données dans les pipelines d'entraînement de robots humanoïdes et industriels, notamment pour réduire le coût de la collecte téléopérée. L'attaque décrite contourne l'hypothèse fondatrice de sécurité dans ces pipelines : que des données ground truth visuellement propres garantissent une politique sûre. Ce n'est pas le cas si le world model interposé est lui-même vulnérable. Pour les intégrateurs qui achètent ou mutualisent des datasets de téléopération, et pour les fournisseurs qui commercialisent des world models pré-entraînés, c'est un vecteur d'attaque supply chain directement actionnable, d'autant plus redoutable qu'il ne laisse aucune trace visible dans les données source. Les world models ont connu une adoption rapide ces dix-huit derniers mois, portée par des travaux comme UniSim, IRASim ou le framework GR00T N2 de NVIDIA, promus comme solution au sim-to-real gap et à la pénurie de données réelles. La recherche s'inscrit dans un contexte où Figure, Agility Robotics et 1X accélèrent leurs déploiements en environnement industriel, rendant la surface d'attaque potentielle concrète et non purement théorique. Les auteurs appellent à reconsidérer la position des world models dans la chaîne d'entraînement et à ouvrir un axe de recherche dédié à leur sécurisation, un chantier aujourd'hui quasi inexistant dans la littérature.

UELes acteurs européens de la robotique qui mutualisent des datasets de téléopération ou intègrent des world models pré-entraînés (startups, intégrateurs, labos comme le CEA-List ou l'INRIA) sont exposés au même vecteur d'attaque supply chain, sans qu'aucun standard de sécurité européen ne couvre encore ce risque spécifique.

RechercheOpinion
1 source
Ce que mesurent réellement les benchmarks en manipulation robotique
31arXiv cs.RO 

Ce que mesurent réellement les benchmarks en manipulation robotique

Un article de recherche déposé sur arXiv le 4 juin 2026 (arXiv:2606.04233) remet en cause la fiabilité de cinq benchmarks standards en manipulation robotique : LIBERO, CALVIN, SimplerEnv, RoboCasa et RoboTwin 2.0. Les auteurs identifient quatre modes de défaillance structurelle qui invalident leur usage comme proxy de la capacité de manipulation générale : résolution par raccourci (shortcut solvability), absence de significativité statistique, surapprentissage rampant (creeping overfitting) et dépendance à la source de données. Sur LIBERO, une sonde de 90 millions de paramètres, sans encodeur de langage, atteint des scores au niveau ou proches de l'état de l'art rapporté dans la littérature récente, ce qui suggère que les modèles exploitent des artefacts du benchmark plutôt que des compétences réelles. Sur CALVIN, la simple randomisation des positions des blocs dans la plage d'entraînement fait chuter les performances de toutes les politiques testées, révélant une généralisation quasi nulle même dans des conditions marginalement différentes. Ces résultats ont des implications directes pour les équipes qui évaluent des architectures VLA (Vision-Language-Action). Si LIBERO et CALVIN échouent à plusieurs diagnostics, les progrès revendiqués sur ces benchmarks ne constituent pas une preuve crédible de capacité de manipulation générale. La plupart des gains rapportés sur LIBERO ne sont pas statistiquement significatifs, ce qui signifie que de nombreuses publications revendiquent des améliorations qui pourraient n'être que du bruit. Pour les intégrateurs et les décideurs industriels, cela signifie que les scores de benchmarks courants ne sont pas des indicateurs fiables de la maturité réelle d'un système avant déploiement. Le problème n'est pas nouveau, mais il devient critique au moment où des VLA comme pi0 (Physical Intelligence), GR00T N2 (NVIDIA) ou OpenVLA sont massivement benchmarkés dans la littérature. RoboCasa et RoboTwin 2.0, moins fréquemment cités dans les claims de progression récents, résistent mieux aux diagnostics proposés et constituent des alternatives plus robustes pour mesurer des progrès réels. Les auteurs publient leurs quatre diagnostics avec des implémentations de référence sur ripl.github.io/manipulationbenchmarkaudit, à destination des chercheurs et des reviewers, pour application avant soumission ou acceptation. La prochaine question est de savoir si des conférences majeures comme CoRL, ICRA ou RSS adopteront ces outils comme critère d'évaluation des soumissions.

UELes équipes de recherche françaises et européennes (INRIA, CEA-List) évaluant des architectures VLA devront appliquer ces diagnostics avant soumission pour ne pas revendiquer des gains qui pourraient n'être que du bruit statistique.

RecherchePaper
1 source
Comment les utilisateurs évaluent les performances des modèles fondation robotiques au-delà du taux de réussite des tâches
32arXiv cs.RO 

Comment les utilisateurs évaluent les performances des modèles fondation robotiques au-delà du taux de réussite des tâches

Une étude publiée sur arXiv (arXiv:2602.03920) examine comment des utilisateurs non-spécialistes interprètent les données de performance des modèles de fondation robotiques (RFM, Robot Foundation Models), ces architectures d'IA généraliste conçues pour piloter des robots domestiques polyvalents comme ceux développés par Physical Intelligence (pi0), Google DeepMind (GR00T N2) ou Figure AI. Le cœur du problème : lorsqu'un utilisateur demande à un robot RFM d'effectuer une tâche hors de son domaine d'entraînement, il doit pouvoir évaluer le risque d'échec, qui peut être coûteux, voire dangereux. Les chercheurs ont exposé des participants à des données réelles issues de plusieurs projets RFM publiés, incluant le taux de succès aux tâches (TSR, Task Success Rate), des descriptions de cas d'échec et des vidéos de démos. Les résultats montrent que les non-experts comprennent et utilisent le TSR de façon conforme aux attentes des spécialistes, ce qui valide son usage comme métrique primaire dans les publications académiques. Mais la découverte la plus significative est ailleurs : les utilisateurs accordent une valeur élevée aux descriptions de cas d'échec, une information rarement reportée de façon systématique dans les évaluations de RFMs. Par extension, ils souhaitent disposer à la fois de données historiques issues des évaluations passées du modèle et d'estimations proactives du robot sur ses chances de succès face à une tâche inédite. Cette attente soulève un défi concret pour les intégrateurs et les équipes produit : la transparence sur les limites du modèle n'est pas optionnelle si l'on vise un déploiement grand public. Ce travail s'inscrit dans un débat plus large sur le fossé entre les démos laboratoire et l'usage réel, souvent qualifié de "demo-to-reality gap". Alors que le secteur converge vers des benchmarks standardisés comme DROID ou Open-X-Embodiment pour comparer les RFMs entre eux, la question de leur lisibilité par les décideurs non-techniques reste largement ouverte. Des acteurs comme Enchanted Tools en France ou Wandercraft misent sur des interfaces d'interaction proches de l'utilisateur final, mais peu d'équipes formalisent encore la communication sur les taux d'échec. Cette étude plaide pour l'intégration de "failure reporting" structuré dans les fiches produit et les publications techniques, une évolution qui pourrait devenir un critère de certification dans les futures réglementations européennes sur la robotique.

UEL'étude plaide pour un 'failure reporting' structuré qui pourrait devenir un critère de certification dans les futures réglementations européennes sur la robotique, concernant directement Enchanted Tools et Wandercraft pour leurs fiches produit.

RecherchePaper
1 source
TRAP : détournement du raisonnement CoT dans les VLA par patches adversariaux
33arXiv cs.RO 

TRAP : détournement du raisonnement CoT dans les VLA par patches adversariaux

Des chercheurs ont publié sur arXiv (réf. 2603.23117) une attaque baptisée TRAP (Targeted Reasoning Adversarial Patch), démontrant pour la première fois qu'un patch adversarial physique peut détourner le comportement d'un robot manipulateur piloté par un modèle Vision-Language-Action (VLA) à raisonnement Chain-of-Thought (CoT). Dans les expériences présentées, un patch imprimé sur papier et déposé sur la surface de travail, tel qu'une nappe aux motifs spécifiques, suffit à faire en sorte que le robot remette un couteau à l'opérateur au lieu d'une pomme, sans qu'aucune modification de l'instruction utilisateur ne soit nécessaire. L'attaque a été validée sur trois VLA représentatifs intégrant des mécanismes CoT distincts, et mise en oeuvre en conditions réelles avec un simple imprimé papier. Ce résultat pointe une vulnérabilité structurelle dans les VLA à raisonnement intermédiaire, famille de modèles qui inclut notamment π0 de Physical Intelligence, OpenVLA-OFT ou les variantes de GR00T (NVIDIA) basées sur des CoT explicites. Les auteurs montrent empiriquement que le raisonnement CoT gouverne la génération d'actions de façon prépondérante, même lorsqu'il est sémantiquement incohérent avec l'instruction initiale : le modèle suit la chaîne de pensée corrompue plutôt que l'intention de l'utilisateur. Pour les intégrateurs déployant des bras robotisés en environnement ouvert, entrepôts, blocs opératoires ou assistance à domicile, cela signifie qu'un adversaire pourrait modifier le comportement du robot par simple altération visuelle de l'environnement, sans accès au modèle ni au flux de commandes, ce qui rend l'attaque particulièrement préoccupante en contexte de sécurité physique. Les VLA à raisonnement CoT ont émergé comme réponse aux limites des modèles action-réflexe classiques : le CoT améliore la généralisation et offre une trace d'interprétabilité utile pour la certification. TRAP montre que cette avancée introduit simultanément une surface d'attaque inédite. La recherche en sécurité des systèmes robotiques autonomes reste largement sous-investie par rapport à la sécurité des LLM textuels, et ce travail rejoint un corpus naissant incluant des attaques sur les politiques de diffusion et les modèles de perception. Aucun correctif ni benchmark défensif n'est proposé dans cette version ; les auteurs appellent à une sécurisation urgente des pipelines CoT dans les VLA avant tout déploiement à grande échelle dans des environnements critiques.

UELes intégrateurs européens déployant des VLA sur des bras robotisés en environnement industriel, médical ou d'assistance doivent suspendre tout déploiement à grande échelle dans des environnements critiques et auditer leurs pipelines CoT, en l'absence totale de correctifs défensifs disponibles.

RechercheOpinion
1 source
SilentDrift : exploiter le découpage en actions pour des attaques par porte dérobée furtives sur les modèles VLA
34arXiv cs.RO 

SilentDrift : exploiter le découpage en actions pour des attaques par porte dérobée furtives sur les modèles VLA

Des chercheurs en sécurité informatique ont publié sur arXiv (référence 2601.14323) une attaque baptisée SilentDrift, ciblant les modèles Vision-Language-Action (VLA) utilisés pour piloter des robots manipulateurs. L'attaque exploite deux mécanismes devenus standards dans les architectures VLA modernes : l'action chunking, qui consiste à générer des séquences de K actions d'un coup plutôt qu'action par action, et la représentation en delta de pose, qui encode chaque mouvement sous forme d'incrément relatif à la position précédente. Cette combinaison crée une boucle ouverte visuelle intra-chunk : une fois la séquence lancée, le robot l'exécute sans relire le flux caméra à chaque pas. Des perturbations imperceptibles à l'échelle d'un pas s'accumulent alors par intégration, déviant la trajectoire finale de manière significative. Sur le benchmark LIBERO, SilentDrift atteint un taux de succès d'attaque de 93,2 % avec un taux d'empoisonnement inférieur à 2 % des données d'entraînement, tout en maintenant un taux de réussite sur tâches propres de 95,3 %, rendant la backdoor pratiquement indétectable par les métriques standards. L'impact pour les intégrateurs et décideurs B2B est direct : les VLA comme pi-0 de Physical Intelligence, OpenVLA ou les variantes de RT-2 s'appuient précisément sur ces mécanismes d'action chunking pour obtenir des mouvements fluides et cohérents. Un attaquant ayant accès à une fraction marginale des données d'entraînement peut donc compromettre un système de manipulation robotique déployé en environnement industriel sans déclencher d'alarme sur les métriques de performance habituelles. Les trajectoires empoisonnées sont visuellement identiques aux démonstrations saines, ce qui invalide les audits visuels comme contrôle de qualité suffisant. La stratégie dite "keyframe attack" de SilentDrift cible spécifiquement la phase d'approche critique d'une saisie, maximisant l'effet de déviation tout en minimisant l'exposition du trigger. Ce travail s'inscrit dans un courant de recherche naissant sur la sécurité des modèles de fondation pour la robotique, un champ largement ignoré jusqu'ici face à l'effervescence autour des performances. Les VLA connaissent une adoption rapide depuis 2023, portée par des acteurs comme Physical Intelligence (pi-0), Google DeepMind (RT-2, GR00T N2 de Nvidia) et les laboratoires académiques via des benchmarks comme LIBERO ou Open-X Embodiment. SilentDrift est une attaque en boîte noire, ce qui signifie qu'elle ne nécessite pas d'accès au modèle entraîné, uniquement aux données. Les auteurs n'annoncent pas de contre-mesure, ouvrant un chantier de recherche défensive urgent à mesure que ces modèles approchent de déploiements réels dans la logistique et l'assemblage manufacturier.

UELes intégrateurs européens qui déploient ou évaluent des VLA (pi-0, OpenVLA, RT-2) dans la logistique ou l'assemblage doivent intégrer l'audit de sécurité des données d'entraînement dans leurs processus de qualification, car les métriques de performance standards ne détectent pas ce vecteur d'attaque.

RechercheOpinion
1 source
Doubao payant fin juin, incendie chez SK Hynix, Unitree obtient son IPO : Wang Xingxing vaudrait plus de 14 milliards de yuans
3536Kr 

Doubao payant fin juin, incendie chez SK Hynix, Unitree obtient son IPO : Wang Xingxing vaudrait plus de 14 milliards de yuans

Le 1er juin 2026, la commission d'examen des introductions en bourse de la Bourse de Shanghai a approuvé le dossier d'IPO de Unitree Robotics sur le marché STAR, le segment technologique de la place boursière chinoise. Le fabricant de robots prévoit de lever 4,202 milliards de yuans (environ 575 millions d'euros) répartis sur quatre axes : recherche sur les modèles d'IA embarquée, développement du corps robotique, nouveaux produits humanoïdes et construction d'une usine de fabrication dédiée. Le même jour, lors du GTC Taipei, Jensen Huang, PDG de NVIDIA, a annoncé le H2+, un robot humanoïde présenté comme architecture de référence développée conjointement avec Unitree et désigné sous l'appellation Isaac GR00T System. La plateforme mesure 1,8 mètre pour 68 kilogrammes, embarque 31 degrés de liberté (DOF) sur le corps principal et 25 DOF par main. Huang a déclaré l'intégration système finalisée. Sur le front financier, Alphabet a confirmé une levée de 80 milliards de dollars incluant un placement privé de 10 milliards de dollars souscrit par Berkshire Hathaway à 351,81 dollars l'action de classe A, explicitement destinés à étendre les capacités d'infrastructure IA face à une demande jugée supérieure à l'offre existante. OpenAI a par ailleurs officialisé le même jour son entrée dans la robotique, en se concentrant à court terme sur les robots d'assistance. Pour les intégrateurs et décideurs industriels, la conjonction de l'IPO de Unitree et du partenariat NVIDIA marque un passage vers une commercialisation plus structurée des humanoïdes. Les 575 millions d'euros levés dépassent la quasi-totalité des tours de table récents des fabricants occidentaux hors Tesla, offrant à Unitree un capital de montée en cadence inédit dans le secteur. Le H2+ positionné comme architecture de référence ouverte change la logique d'intégration : NVIDIA apporte la stack logicielle Isaac GR00T et le simulateur Omniverse pour le sim-to-real, Unitree fournit le corps mécanique validé, réduisant le coût d'entrée pour tout OEM souhaitant déployer des humanoïdes sans construire l'ensemble de la chaîne. Les 25 DOF par main ciblent la manipulation fine en assemblage et en logistique pick-and-place, non la manutention de charges lourdes. Ces métriques restent celles d'une annonce de conférence : l'écart entre démonstration et déploiement productif sur des cycles de travail réels demeure à quantifier indépendamment. Unitree s'est imposé sur le marché des quadrupèdes avec les séries Go1, Go2 et B2 avant de lancer les humanoïdes H1 puis G1, construisant une réputation de rapport performance-prix difficile à ignorer. Son fondateur Wang Xingxing voit sa fortune estimée à plus de 14 milliards de yuans après la validation du dossier. NVIDIA avait posé les bases de sa stratégie robotique avec Isaac GR00T, présenté au GTC 2024 comme modèle de fondation pour humanoïdes, et Omniverse pour la simulation; le H2+ est le premier résultat hardware public de cette architecture. Les concurrents directs en Occident incluent Figure AI, Tesla avec Optimus, Boston Dynamics avec Atlas et Physical Intelligence avec son modèle Pi-0; en Chine, Fourier Intelligence et UBTECH couvrent des segments comparables. L'entrée simultanée d'OpenAI dans la robotique pourrait redistribuer les équilibres dans la couche logicielle, chaque acteur hardware cherchant à s'associer au modèle fondation le plus performant. Zhipu AI, spécialiste chinois des grands modèles de langage, a également annoncé le 1er juin son intention de s'introduire sur le marché STAR, signal supplémentaire d'un afflux de capitaux publics vers l'ensemble de la chaîne IA-robotique en Chine.

UELes OEM et intégrateurs européens doivent évaluer si l'architecture de référence ouverte H2+ (NVIDIA/Unitree) réduit suffisamment le coût d'entrée pour justifier un premier pilote humanoïde, mais aucune entreprise ni réglementation française ou européenne n'est directement impliquée.

HumanoïdesActu
1 source
NVIDIA dévoile une plateforme complète pour robots humanoïdes, robotaxis et usines intelligentes
36Interesting Engineering 

NVIDIA dévoile une plateforme complète pour robots humanoïdes, robotaxis et usines intelligentes

Lors du GTC Taipei, NVIDIA a dévoilé une plateforme full-stack destinée aux robots humanoïdes, aux véhicules autonomes et à l'automatisation industrielle. Le cœur de l'annonce est Cosmos 3, un omnimodèle fondational open-source construit sur une architecture mixture-of-transformers, capable de traiter simultanément texte, images, vidéo, son et commandes d'action dans un seul système. Il se décline en Cosmos 3 Super, orienté haute précision pour la robotique et les véhicules autonomes, et Cosmos 3 Nano, optimisé pour l'inférence rapide. NVIDIA lance également l'Isaac GR00T Reference Humanoid Robot, un design de référence intégrant le robot Unitree H2 Plus, les mains articulées Sharpa, le calculateur embarqué Jetson Thor et la pile logicielle GR00T, adopté par Ai2, ETH Zurich, Stanford Robotics Center et UC San Diego. La collaboration avec TSMC porte les bibliothèques CUDA-X dans la fab pour la lithographie computationnelle, la simulation de transistors et l'inspection de plaquettes à l'échelle nanométrique. Alpamayo 2 Super, un modèle de raisonnement à 32 milliards de paramètres, cible quant à lui les applications robotaxi. La cohérence verticale de la plateforme est sa principale valeur ajoutée : NVIDIA prétend désormais couvrir l'intégralité de la chaîne de valeur de l'IA physique, de la génération de données synthétiques à la simulation, jusqu'au déploiement en production. Pour les équipes R&D en robotique humanoïde, GR00T Reference Robot réduit potentiellement plusieurs mois d'intégration hardware/software. Cosmos 3 s'attaque par ailleurs au sim-to-real gap en proposant un world model capable de générer des environnements d'entraînement réalistes, l'un des verrous structurels du secteur. Cela dit, les benchmarks avancés ("meilleur modèle ouvert" sur plusieurs évaluations) émanent de NVIDIA lui-même sans validation tierce, ce qui invite à une lecture prudente. L'intégration dans la fab TSMC est plus tangible : des gains d'efficacité mesurables dans la détection de défauts nanométriques signalent une adoption industrielle réelle, pas seulement un proof-of-concept. NVIDIA construit ce positionnement depuis plusieurs années via Isaac Sim, Omniverse et la famille GR00T N2 présentée en 2025. Sur le marché des humanoïdes, les concurrents directs incluent Figure (Figure 03), Tesla (Optimus Gen 3), Physical Intelligence (Pi-0), Boston Dynamics (Atlas) et Agility Robotics (Digit). Le choix du robot Unitree H2 Plus, acteur chinois concurrent sur le segment humanoïde, comme base matérielle du design de référence NVIDIA est notable. En Europe, Enchanted Tools (Miroki, France) et Wandercraft pourraient tirer parti de Cosmos 3 pour la génération de données d'entraînement, même si aucun partenariat public n'a été annoncé. Les prochaines étapes incluent l'accès des institutions de recherche à GR00T Reference Robot et la disponibilité de Cosmos 3 via NVIDIA NGC ; aucune tarification ni date de commercialisation n'a été communiquée pour l'ensemble de la plateforme.

UEEnchanted Tools et Wandercraft pourraient exploiter Cosmos 3 pour la génération de données d'entraînement, et ETH Zurich figure parmi les partenaires de recherche du GR00T Reference Robot, mais aucun déploiement commercial en Europe n'est confirmé à ce stade.

💬 NVIDIA ne vend plus du silicium, il vend une plateforme verticale, de la simulation jusqu'au robot en prod. Le détail qui m'a accroché : le choix d'Unitree, concurrent chinois direct, comme base matérielle du robot de référence GR00T. C'est soit du pragmatisme pur, soit une façon de dire que l'avantage NVIDIA est dans le software, pas le hardware.

IA physiqueOpinion
1 source
Les 10 actualités robotique incontournables de mai 2026
37Robotics Business Review 

Les 10 actualités robotique incontournables de mai 2026

Mai 2026 a concentré plusieurs avancées concrètes dans la robotique, mises en lumière lors du Robotics Summit & Expo de Boston qui a réuni des milliers de professionnels du secteur. Genesis AI a dévoilé GENE-26.5, un modèle d'IA qu'elle présente comme atteignant des "capacités de manipulation physique au niveau humain", une affirmation à relativiser en l'absence de benchmarks indépendants publiés. Dans le domaine des humanoïdes, 1X Technologies a lancé la production en série de son robot NEO dans une nouvelle usine à Hayward, en Californie, conçu pour fonctionner en dessous du niveau sonore d'un réfrigérateur moderne dans des espaces domestiques. La startup londonienne Humanoid a formalisé un partenariat avec Bosch et Schaeffler pour industrialiser sa production, après un proof of concept conjoint validé en mars 2026. Du côté des capteurs, Ouster a annoncé la famille REV8, basée sur sa puce L4 Ouster Silicon, avec une portée et une résolution doublées par rapport à la génération précédente, et un lidar couleur natif breveté. Automated Tire est sortie de la discrétion avec SmartBay, une plateforme robotique autonome pour le changement de pneus et l'inspection de véhicules, promettant de réduire le temps de service de moitié, soit environ 30 minutes par intervention. Ces actualités illustrent une bifurcation nette dans le secteur: d'un côté, des acteurs humanoïdes comme 1X passent de la démonstration à la production réelle, signal que le "reality gap" se réduit pour certains challengers; de l'autre, des verticaux industriels précis comme la maintenance automobile ou la manipulation dextère cherchent à démontrer un ROI mesurable à court terme. Le partenariat Humanoid-Bosch-Schaeffler est particulièrement notable car il intègre deux équipementiers automobiles de premier plan dans la chaîne d'approvisionnement des humanoïdes, anticipant un marché commercial proche. Hugging Face a également lancé une boîte à outils agentique pour son robot desktop open-source Reachy Mini, permettant de créer des applications fonctionnelles en moins d'une heure sans écrire de code, ce qui signale une démocratisation de la programmation robotique au-delà des équipes d'ingénieurs spécialisés. Le contexte est celui d'une course à la commercialisation qui s'accélère, avec Figure (Figure 03), Tesla (Optimus Gen 3), Physical Intelligence (pi0), Boston Dynamics et NVIDIA (GR00T N2) en embuscade sur le même marché des humanoïdes polyvalents. Pour structurer les comparaisons, le Fraunhofer IPA a publié un benchmark standardisé pour évaluer objectivement ces plateformes, une initiative qui faisait défaut jusqu'ici. Les RBR50 Innovation Awards 2026, qui fêtent leur 15e édition, ont dressé un panorama des leaders actuels, reflétant la diversité des approches: AMR, cobots, architectures VLA (Vision-Language-Action). Les prochains trimestres seront déterminants: les premiers bilans chiffrés des déploiements chez 1X et Humanoid constitueront des tests de réalité cruciaux avant d'éventuels nouveaux tours de financement.

UEHugging Face (française) démocratise la programmation robotique avec sa boîte à outils low-code pour Reachy Mini, tandis que le partenariat Humanoid-Bosch-Schaeffler ancre deux équipementiers automobiles allemands dans la chaîne d'approvisionnement des humanoïdes, posant les bases d'une filière européenne commerciale, et le benchmark Fraunhofer IPA offre enfin un cadre d'évaluation standardisé aux acteurs du marché EU.

FR/EU ecosystemeActu
1 source
Le robot humanoïde de NVIDIA embarque 2 070 téraflops de puissance « cérébrale » pour apprendre dans le monde réel
38Interesting Engineering 

Le robot humanoïde de NVIDIA embarque 2 070 téraflops de puissance « cérébrale » pour apprendre dans le monde réel

NVIDIA a dévoilé le 1er juin 2026, au GTC Taipei, l'Isaac GR00T Reference Humanoid Robot, un design de référence humanoïde open source associant le corps du Unitree H2 (1,80 m, 68 kg, 31 degrés de liberté) aux mains tactiles cinq doigts Sharpa Wave (44 DOF supplémentaires), soit 75 DOF au total. L'intelligence embarquée repose sur le module Jetson AGX Thor T5000, équipé d'un GPU Blackwell délivrant 2 070 téraflops en précision FP4, d'un CPU Arm 14 cœurs et de 128 Go de mémoire unifiée pour le traitement sensoriel en temps réel. Le robot supporte 120 N.m de couple aux bras, 360 N.m aux jambes et une charge utile de 15 kg, avec perception stéréo en tête, caméras montées aux poignets et centrale inertielle. La pile logicielle Isaac GR00T couvre tout le cycle de développement: Isaac Teleop pour la collecte de démonstrations humaines, Isaac Sim et Isaac Lab pour la simulation et l'entraînement, Isaac ROS pour le déploiement sur robot physique. Quatre institutions ont déjà rejoint l'initiative: Ai2, l'ETH Zurich, le Stanford Robotics Center et le laboratoire Advanced Robotics and Controls de l'UC San Diego. La compatibilité avec l'Unitree G1, très répandu en recherche, est également confirmée. La fragmentation du développement humanoïde constitue aujourd'hui l'un des freins majeurs à la recherche: hardware, environnements de simulation, modèles de fondation et middleware proviennent de sources hétérogènes, multipliant les frictions d'intégration. En proposant une pile unifiée et documentée, NVIDIA cherche à compresser le délai entre une nouvelle politique de contrôle et son test sur robot physique. Les 2 070 téraflops FP4 embarqués ne visent pas uniquement l'inférence: la puissance disponible cible l'apprentissage par renforcement en ligne et la collecte de données en situation réelle, deux leviers critiques pour combler le sim-to-real gap qui limite encore la majorité des VLA (Vision-Language-Action models). Steve Cousins, directeur exécutif du Stanford Robotics Center, a résumé la logique: "La robotique avance plus vite quand les chercheurs peuvent construire sur des plateformes ouvertes, partager du code et tester sur de vraies machines." NVIDIA avait posé les premières briques d'Isaac GR00T au GTC 2024 avec des modèles de fondation pour l'imitation et le transfert sim-to-real; l'annonce de Taipei franchit une étape différente avec un design de référence hardware-software complet. NVIDIA ne fabrique pas de robots mais joue explicitement la carte du fournisseur de plateforme, fournissant calcul, modèles et outils à l'ensemble de l'écosystème humanoïde: Figure (02), Tesla (Optimus Gen 3), Physical Intelligence (pi0), Boston Dynamics (Atlas Electric), et les acteurs européens comme Wandercraft ou Enchanted Tools, qui pourraient bénéficier de cette pile ouverte pour accélérer leur R&D. Le risque principal de cette stratégie est que les grands constructeurs, Tesla et Figure en tête, développent des piles entièrement propriétaires, réduisant la surface d'adoption. Les prochaines étapes documentées se limitent aux déploiements dans les quatre institutions partenaires, sans calendrier de commercialisation industrielle annoncé à ce stade.

UEL'ETH Zurich est l'un des quatre partenaires fondateurs de l'initiative, et la plateforme ouverte pourrait permettre à Wandercraft et Enchanted Tools d'accélérer leur R&D humanoïde sans repartir de zéro sur la pile logicielle.

HumanoïdesOpinion
1 source
Wall-OSS-0.5 : rapport technique
39arXiv cs.RO 

Wall-OSS-0.5 : rapport technique

Une équipe de chercheurs a publié sur arXiv (2605.30877) le rapport technique de Wall-OSS-0.5, un modèle Vision-Language-Action (VLA) open source de 4 milliards de paramètres, construit sur un backbone VLM de 3B paramètres auquel sont greffés des composants de génération d'actions. Le modèle a été pré-entraîné sur plus de 20 morphologies robotiques différentes, en ingérant plus d'un million de trajectoires robot par époque, couplées à un corpus multimodal ancré. La recette d'entraînement repose sur un co-entraînement à gradient bridgé combinant trois objectifs complémentaires : prédiction d'actions discrètes pour faire circuler des gradients VLM forts dans le backbone, prédiction multimodale pour préserver la compréhension vision-langage, et flow matching continu comme interface d'action au moment du déploiement. Avant tout fine-tuning spécifique, le checkpoint pré-entraîné atteint des comportements zero-shot non triviaux sur un banc de 17 tâches réelles, y compris une tâche de manipulation d'objets déformables hors distribution. Après fine-tuning, il affiche 60,5% de progression moyenne sur 15 tâches réelles et surpasse Pi-0.5 de 17,5 points de pourcentage. Ce résultat repose la question fondamentale du pré-entraînement VLA : jusqu'ici, la quasi-totalité des preuves de performance étaient mesurées après fine-tuning, rendant impossible la distinction entre "le pré-entraînement forme une politique utilisable" et "le pré-entraînement fournit juste une meilleure initialisation". Wall-OSS-0.5 démontre que le checkpoint brut produit des comportements exécutables sur matériel physique, y compris sur des tâches jamais vues. Le fait que l'entraînement sur données d'action ne dégrade pas les capacités vision-langage générales est également significatif pour les intégrateurs : cela suggère qu'un seul modèle fondation peut couvrir perception, raisonnement et contrôle sans compromis majeur, ce qui simplifie l'architecture système. Wall-OSS-0.5 s'inscrit dans la dynamique des VLA fondationnels initiée par des modèles comme Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) et OpenVLA. Sa publication open source le distingue dans un secteur dominé par des checkpoints propriétaires, et permet des comparaisons reproductibles. La performance zero-shot sur manipulation déformable est notable car ce type de tâche est réputé difficile à généraliser : c'est précisément le type de gap sim-to-real que les approches purement simulées peinent à combler. Les prochaines étapes probables incluent un scaling du corpus et des évaluations sur des plateformes humanoïdes commerciales, où la generalisation cross-embodiment du modèle pourra être testée en conditions industrielles.

UELe caractère open source de Wall-OSS-0.5 permet aux équipes de R&D françaises et européennes d'accéder librement à un modèle VLA fondationnel compétitif, réduisant la dépendance aux checkpoints propriétaires américains et asiatiques.

💬 Le vrai truc ici, c'est pas les 60,5% sur le benchmark. C'est que le checkpoint pré-entraîné produit des comportements exécutables sur du vrai matériel, sans fine-tuning, y compris sur des tâches jamais vues. Et open source par-dessus le marché, dans un secteur où tout le monde garde jalousement ses poids pour soi.

IA physiqueOpinion
1 source
Déploiement de pipelines VLA en atelier d'emballage industriel : étude de cas, flux de travail, échecs et enseignements
40arXiv cs.RO 

Déploiement de pipelines VLA en atelier d'emballage industriel : étude de cas, flux de travail, échecs et enseignements

Des chercheurs associés à Siemens ont publié le 28 mai 2026 sur arXiv (2605.27461) une étude de déploiement industriel d'une politique VLA (Vision-Language-Action) dans l'usine Siemens GWE d'Erlangen, en Allemagne. La tâche ciblée est précisément définie : un bras robotique doit saisir un sachet d'accessoires transparent au sein d'un tas encombré, l'insérer dans la cavité restante d'un emballage carton, puis vérifier que le sachet et son contenu restent en dessous du plan de fermeture du carton. Le modèle de base utilisé est Pi0.5, la politique VLA de Physical Intelligence, affinée de manière itérative sur données terrain. L'équipe a accumulé 2535 épisodes d'entraînement, soit environ 10 heures de données collectées directement en conditions d'usine, via un pipeline cyclique comprenant collecte, curation, fine-tuning, évaluation et collecte de données de récupération ciblées. Ce qui rend cette publication notable, c'est son positionnement éditorial délibérément empirique : les auteurs ne communiquent pas sur un taux de succès global, mais documentent les modes de défaillances récurrents et les ajustements nécessaires à chaque cycle. C'est précisément ce type de retour d'expérience qui manque dans la littérature robotique, où les démonstrations sélectionnées occultent souvent le coût réel d'adaptation d'un modèle généraliste à une tâche industrielle spécifique. La gestion d'objets transparents, notoire pour tromper les systèmes de vision par profondeur, illustre ici les limites concrètes du sim-to-real et du transfert zero-shot. L'étude confirme que le fine-tuning dirigé par les échecs terrain, plutôt que la montée en données brutes, reste le levier dominant pour atteindre la fiabilité industrielle. Pi0.5 est le successeur de π0, lancé par Physical Intelligence (San Francisco) fin 2024, conçu comme politique généraliste pour la manipulation dextère. Son déploiement chez Siemens marque une étape significative dans la commercialisation B2B des VLA, un segment que se disputent actuellement Figure AI avec sa pile Helix, 1X Technologies avec NEO, et des initiatives internes comme GR00T N2 de NVIDIA ou les travaux de Boston Dynamics sur Atlas. Aucun acteur européen n'est directement impliqué dans ce déploiement, bien que Wandercraft et Enchanted Tools positionnent des produits complémentaires sur le segment français. La prochaine étape logique de ce type d'étude serait une généralisation multi-tâches ou multi-sites, mais les auteurs restent prudents : l'article conclut sur des leçons méthodologiques, non sur un déploiement à l'échelle.

UELe déploiement de Pi0.5 dans l'usine Siemens d'Erlangen fournit le premier retour d'expérience empirique documenté d'un modèle VLA généraliste en conditions industrielles réelles au sein d'un acteur EU majeur, directement exploitable par les intégrateurs et équipementiers robotiques européens.

FR/EU ecosystemeOpinion
1 source
L'open source commence à aider les robots à raisonner
41IEEE Spectrum Robotics 

L'open source commence à aider les robots à raisonner

Depuis deux ans, Hugging Face, Nvidia et Alibaba ont multiplié les publications open source dans la robotique cognitive, cherchant à résoudre ce qui était jusque-là le goulot d'étranglement du secteur : faire raisonner, décider et agir un robot. Nvidia a constitué une pile complète articulée autour de trois couches : Cosmos, des world models qui génèrent des données d'entraînement synthétiques et simulent des environnements physiques ; GR00T, des modèles permettant l'exécution de tâches complexes ; et Isaac, un ensemble de frameworks d'orchestration reliant entraînement, simulation et déploiement. Ces modèles sont hébergés sur Hugging Face. Ce mouvement s'inscrit dans une longue tradition : le Robot Operating System (ROS), lancé en 2007, a unifié le secteur en fournissant un framework standardisé au-dessus de Linux pour les fonctions fondamentales de la robotique, communication inter-composants, gestion du hardware, cartographie, planification de trajectoires. Avant ROS, chaque équipe réécrivait cette infrastructure de zéro, absorbant souvent une à deux années de travail avant de pouvoir conduire les recherches réelles. L'enjeu est structurant : si l'open source peut faire pour la cognition robotique ce qu'il a fait pour les LLMs, la barrière à l'entrée pour construire un robot capable pourrait chuter aussi vite qu'elle l'a fait pour les applications d'IA générative. Spencer Huang, directeur produit robotique chez Nvidia, note que la vision par ordinateur, autrefois coûteuse en expertise, se code aujourd'hui en quelques lignes. "Pour entrer dans la robotique, il ne faut plus nécessairement un doctorat", dit-il. La logique économique est explicite : fournir un modèle pré-entraîné de haute qualité que chaque acteur peut fine-tuner, plutôt que de demander à chacun de reprendre le pré-entraînement from scratch. Pour les intégrateurs et les décideurs industriels, cela se traduit concrètement par des cycles de développement raccourcis et une moindre dépendance aux profils rares. Le parallèle avec l'histoire de l'IA est tracé explicitement par Brian Gerkey, co-créateur de ROS, aujourd'hui Board Chair d'Open Robotics et CTO d'Intrinsic, l'unité robotique et IA de Google. La communauté IA a, dès ses débuts, partagé recherches, modèles et données en open source, et le domaine a progressé bien plus vite que presque tous les observateurs ne l'anticipaient. Les premières briques d'infrastructure open source pour la robotique remontent au milieu des années 1990, avec des projets comme le package Inter-Process Communication de Carnegie Mellon et le projet Player au début des années 2000, mais ces initiatives restaient fragmentées et liées à des groupes isolés. ROS a unifié la couche basse du secteur ; Nvidia, Hugging Face et Alibaba tentent aujourd'hui de reproduire cette unification pour la couche cognitive. Les outils de simulation sont désormais suffisamment précis pour être utiles à l'entraînement et accessibles hors des laboratoires spécialisés. La question qui demeure ouverte : ces modèles pré-entraînés tiendront-ils leurs promesses dans des déploiements industriels réels, au-delà des démonstrations contrôlées ?

UEHugging Face, fondée à Paris et co-initiatrice de ce mouvement open source aux côtés de Nvidia et Alibaba, se positionne comme infrastructure centrale de distribution des modèles cognitifs robotiques mondiaux.

FR/EU ecosystemeOpinion
1 source
Humanoid s'associe à Bosch et Schaeffler pour industrialiser la production de robots
42Robotics Business Review 

Humanoid s'associe à Bosch et Schaeffler pour industrialiser la production de robots

La startup londonienne Humanoid, fondée en 2024 sous le nom SKL Robotics Ltd., a annoncé en mai 2026 deux partenariats industriels majeurs pour industrialiser son robot HMND 01 sur le marché européen. Le premier accord, conclu avec Robert Bosch GmbH (siège à Gerlingen, Allemagne), fait suite à un proof of concept réalisé en mars 2026 dans un entrepôt intralogistique Bosch à Bühl, en Allemagne : le HMND 01, un manipulateur mobile à roues doté d'un torse humanoïde, d'une tête et de deux bras, a transféré de manière autonome des cartons depuis un convoyeur vers des chariots, en gérant cinq formats de boîtes différents sur plusieurs hauteurs, empreintes au sol et masses. Le second accord, signé la semaine précédente avec Schaeffler Technologies AG, est décrit comme un contrat "contraignant et phasé" visant à intégrer les robots HMND dans des lignes de production réelles en Allemagne d'ici fin 2026. Humanoid qualifie ce déploiement de "l'un des plus importants rollouts de robots humanoïdes annoncés à ce jour", ce qui reste difficile à vérifier indépendamment faute de chiffres de volumes publiés. Ces deux partenariats signalent un changement de phase pour Humanoid : de la validation POC vers la fabrication en série et le déploiement industriel. Bosch endosse le rôle de sous-traitant industriel (contract manufacturer) et apportera son infrastructure de production mondiale, sa chaîne d'approvisionnement et son expertise en DfX (design for excellence), un cadre méthodologique couvrant la fabricabilité, la fiabilité, la maintenabilité et l'optimisation des coûts. L'orchestration des tâches repose sur KinetIQ, le framework IA propriétaire d'Humanoid. Pour un COO ou un directeur industriel, l'intérêt concret est double : un robot conçu pour les espaces humano-centriques (convoyeurs, chariots, manipulation multi-format) testé en conditions réelles, et un partenaire de fabrication capable de passer rapidement du prototype au volume. La mention d'une future intégration de composants Bosch (actionneurs, variateurs, capteurs) dans les prochaines versions du HMND ouvre aussi une trajectoire de co-développement hardware. Humanoid s'est constitué rapidement un réseau de partenaires industriels de premier rang : outre Bosch et Schaeffler, la société avait annoncé le mois précédent un accord avec Siemens. Ce positionnement agressif intervient dans un contexte de consolidation du marché humanoïde industriel, où Figure AI (Figure 03), Tesla (Optimus Gen 3), Physical Intelligence (pi0), NVIDIA (GR00T N2) et 1X Technologies se disputent les premiers déploiements à l'échelle. Humanoid mise sur une stratégie de distribution européenne différenciée, en s'appuyant sur l'écosystème industriel allemand plutôt que sur une intégration verticale américaine. La prochaine étape visible sera la mise en service effective des premiers systèmes chez Schaeffler avant la fin de l'année 2026, date qui permettra de valider si le saut du POC au déploiement réel est aussi rapide que le suggèrent les annonces.

UELes partenariats avec Bosch (contract manufacturer mondial) et Schaeffler (déploiement en ligne de production d'ici fin 2026 en Allemagne) constituent le premier ancrage industriel sérieux d'un robot humanoïde dans l'écosystème manufacturier européen, avec une trajectoire de co-développement hardware qui pourrait servir de modèle différencié face à l'intégration verticale américaine.

FR/EU ecosystemeOpinion
1 source
Propagation d'actions dangereuses dans une collaboration multi-robots pilotée par LLM via un seul robot compromis
43arXiv cs.RO 

Propagation d'actions dangereuses dans une collaboration multi-robots pilotée par LLM via un seul robot compromis

Des chercheurs ont publié sur arXiv (arXiv:2605.15641, mai 2026) un nouveau paradigme d'attaque ciblant les systèmes multi-robots pilotés par des grands modèles de langage (LLM). Le principe : compromettre un seul robot d'un essaim suffit à propager des instructions malveillantes à l'ensemble du système via la communication inter-robots. L'équipe a évalué l'attaque sur trois dimensions à haut risque, abandon de mission, compromission de données privées, et mise en danger de la sécurité publique, en la quantifiant avec trois métriques : obéissance (taux d'exécution des instructions malveillantes), infectiosité (proportion de robots compromis), et furtivité. Les résultats sont nets : le score d'obéissance atteint 1,00 dans les cas les plus défavorables, l'infectiosité monte à 0,90, et l'attaque complète la propagation en seulement 3,0 rounds en moyenne, tout en maintenant un score de furtivité de 0,81. Le code est disponible publiquement sur GitHub (InfectBot). Ce travail met en évidence un angle mort majeur dans la sécurité des flottes robotiques industrielles et logistiques pilotées par LLM : jusqu'ici, la recherche en sécurité s'était concentrée sur les robots isolés. Or, les architectures multi-robots en production, entrepôts automatisés, chantiers collaboratifs, environnements hospitaliers, reposent précisément sur la communication pair-à-pair pour la coordination. Le mécanisme de consensus qui rend ces systèmes efficaces devient ici un vecteur d'amplification : dans les situations critiques (urgences, conflits de priorité), les instructions adversariales peuvent supplanter les garde-fous de sécurité sans déclencher d'alerte. La persistance du contrôle attaquant (obéissance à 1,00) indique que les alignements de sécurité actuels des planificateurs LLM ne sont pas conçus pour résister à une pression latérale venant d'un pair de confiance. Les LLM comme planificateurs embarqués sont une tendance lourde : des entreprises comme Figure AI, Physical Intelligence (pi0), Boston Dynamics et Agility Robotics intègrent des couches de raisonnement à haut niveau dans leurs architectures. NVIDIA GR00T N2 et les frameworks VLA (Vision-Language-Action) poussent dans la même direction. Ce paper s'inscrit dans un corpus émergent qui questionne la robustesse de ces systèmes face à des attaques adversariales physiquement concrètes, non plus des jailbreaks textuels, mais des actions dans le monde réel. Les prochaines étapes probables incluent des défenses basées sur la vérification cryptographique des instructions inter-robots et des mécanismes de consensus multi-signatures, pistes déjà explorées dans la robotique en essaim mais rarement couplées aux LLM.

UELes flottes robotiques LLM déployées en Europe (entrepôts automatisés, industrie, hôpitaux) sont exposées à ce vecteur d'attaque latérale, et l'AI Act impose aux fournisseurs de systèmes à haut risque de documenter et tester leurs mécanismes de sécurité face à ce type de compromission pair-à-pair.

RechercheOpinion
1 source
FANUC et NVIDIA développent des robots au comportement identique en simulation et en réalité
44Interesting Engineering 

FANUC et NVIDIA développent des robots au comportement identique en simulation et en réalité

FANUC, le géant japonais de la robotique industrielle, et NVIDIA ont annoncé en mai 2026 une extension significative de leur partenariat visant à éliminer l'écart entre simulation et déploiement réel en usine. L'intégration technique combine NVIDIA Isaac Sim avec le logiciel de simulation propriétaire de FANUC, ROBOGUIDE, pour créer des jumeaux numériques où les robots virtuels reproduisent exactement les mêmes trajectoires et temps de cycle que leurs homologues physiques, en s'appuyant sur des algorithmes de contrôle identiques. Deux modes de fonctionnement sont proposés : dans le premier, Isaac Sim orchestre l'environnement virtuel tandis que ROBOGUIDE synchronise les comportements en arrière-plan, avec support des pupitres de programmation physiques et virtuels. Dans le second, ROBOGUIDE prend la main pendant que le moteur physique PhysX de NVIDIA gère la simulation, notamment pour des tâches comme le bin picking, où le robot doit identifier et saisir des pièces empilées en vrac. En parallèle, FANUC a présenté un système bi-bras composé de deux robots collaboratifs CRX capables de plier des T-shirts en temps réel, entraînés par imitation learning via le modèle de fondation robotique Isaac GR00T N de NVIDIA. La plateforme Jetson Thor équipe désormais le robot d'évitement humain de FANUC, avec une puissance de calcul multipliée par 7,5 par rapport à l'ancienne génération Jetson AGX Orin. L'enjeu industriel est direct : le problème du sim-to-real gap coûte des semaines de recalibration sur site à chaque nouveau déploiement. Si FANUC et NVIDIA tiennent leur promesse d'une fidélité totale entre simulation et réalité, les intégrateurs pourraient valider des cellules complètes en virtuel avant même d'avoir commandé les équipements physiques, compressant drastiquement les timelines de mise en production. La démonstration du pliage de textile est également notable : les objets déformables restent l'un des angles morts historiques de la robotique industrielle, et un système capable de gérer le linge en temps réel avec retour visuel ouvre des perspectives concrètes pour la logistique e-commerce et le textile. Le chiffre de 7,5x de gain en calcul sur Jetson Thor est cohérent avec les besoins croissants des pipelines vision-action (VLA) embarqués. Il convient toutefois de noter que les démonstrations présentées, notamment le pliage de T-shirts, restent des prototypes de laboratoire : aucun déploiement en production à grande échelle n'est annoncé à ce stade. FANUC avait une première fois montré cette intégration Isaac Sim / ROBOGUIDE à l'International Robot Exhibition de Tokyo fin 2024, mais la version actuelle approfondit substantiellement la communication entre les deux systèmes. FANUC, avec plus de 700 000 robots installés dans le monde, est l'un des rares acteurs à pouvoir valider ce type d'approche à l'échelle industrielle réelle plutôt qu'en conditions de laboratoire. Sur le terrain concurrentiel, cette initiative s'inscrit dans une course directe avec ABB et son partenariat Isaac Sim, ainsi qu'avec KUKA et Universal Robots qui développent leurs propres pipelines de simulation physique. NVIDIA, de son côté, consolide Isaac comme couche d'abstraction standard pour la simulation robotique industrielle, une position stratégique face à des alternatives open-source comme Gazebo ou MuJoCo. Les technologies seront présentées en conditions réelles lors de l'Open House FANUC prévu en mai 2026, premier test public de la robustesse de l'intégration hors cadre contrôlé.

UELes industriels européens équipés de robots FANUC bénéficieraient d'une réduction significative des délais de mise en production, tandis qu'ABB et KUKA, concurrents européens directs, sont contraints d'accélérer leurs propres pipelines de simulation physique pour ne pas se laisser distancer sur ce segment.

IndustrielActu
1 source
Comprendre les méthodes d'inférence asynchrone pour les modèles vision-langage-action (VLA)
45arXiv cs.RO 

Comprendre les méthodes d'inférence asynchrone pour les modèles vision-langage-action (VLA)

Les modèles Vision-Language-Action (VLA), qui combinent perception visuelle, raisonnement linguistique et génération d'actions motrices, souffrent d'un défaut opérationnel central : leur latence d'inférence crée une désynchronisation entre l'observation capturée et l'action exécutée, phénomène désigné sous le terme de "staleness". Quatre approches ont émergé quasi-simultanément pour y remédier : IT-RTC (correction par inpainting à l'inférence), TT-RTC (simulation de délai à l'entraînement), VLASH (conditionnement sur état futur estimé) et A2C2 (correction résiduelle légère à chaque pas de contrôle). Publiée le 12 mai 2025 sous la référence arXiv:2605.08168, une étude systématique compare ces quatre méthodes sous conditions contrôlées via deux codebases unifiées, évaluées sur la suite Kinetix avec des politiques MLPMixer et sur le benchmark LIBERO de manipulation avec SmolVLA, en faisant varier les délais jusqu'à d = 20 pas de contrôle. Les résultats établissent une hiérarchie claire selon le régime de délai. A2C2 domine sur Kinetix avec un taux de résolution supérieur à 90 % jusqu'à d = 8, et prend la tête sur LIBERO à partir de d = 4 ; c'est la méthode la plus efficace pour des délais modérés à élevés. TT-RTC s'impose comme la plus robuste des approches basées sur l'entraînement : elle généralise au-delà de la distribution de délais vue en phase d'entraînement et n'ajoute aucun overhead à l'inférence, ce qui la rend attractive pour des déploiements contraints en calcul. IT-RTC reste compétitif à faibles délais mais se dégrade nettement avec des chunks longs (H = 30) ou des délais importants. VLASH affiche un compromis explicite entre régimes : son efficacité dépend directement de la plage de fine-tuning [0, d\_max] choisie, imposant un calibrage préalable en fonction du délai attendu en production. Ce travail répond à un besoin criant de la communauté VLA, dont les modèles emblématiques, pi-0 de Physical Intelligence, GR00T N2 de NVIDIA et SmolVLA de Hugging Face, visent un déploiement sur robots réels soumis à des contraintes temps-réel strictes. L'absence de benchmark commun rendait jusqu'ici les comparaisons entre méthodes impossibles et freinait l'adoption industrielle, chaque équipe évaluant sa solution sur son propre protocole. En publiant deux codebases reproductibles (github.com/TheAyos/async-vla-inference), les auteurs offrent aux équipes robotiques un cadre de référence pour choisir leur stratégie de correction selon leur architecture et leurs contraintes de latence. Les prochaines étapes naturelles incluent la validation sur robots physiques et l'extension à des VLA de plus grande taille, où les délais d'inférence sont encore plus prononcés.

UEHuggingFace (entreprise d'origine française) est directement impliquée via SmolVLA, utilisé comme benchmark de référence dans cette étude comparative, ce qui renforce son positionnement central dans l'écosystème VLA mondial.

💬 Le staleness dans les VLA, tout le monde savait que c'était un problème, mais sans benchmark commun on naviguait à vue, chaque équipe évaluant sa solution sur son propre protocole. Ce papier établit enfin une hiérarchie claire : A2C2 pour la majorité des cas d'usage, TT-RTC si tu es contraint en calcul et que tu veux zéro overhead à l'inférence. Le fait que SmolVLA de HuggingFace soit la référence de manipulation, c'est pas anodin pour la visibilité européenne dans la course aux robots.

IA physiqueOpinion
1 source
TAVIS : un benchmark pour la vision active égocentrique et le regard anticipateur en apprentissage par imitation
46arXiv cs.RO 

TAVIS : un benchmark pour la vision active égocentrique et le regard anticipateur en apprentissage par imitation

Une équipe de chercheurs a publié TAVIS, un environnement d'évaluation standardisé pour comparer les approches de vision active en apprentissage par imitation, soit la capacité d'une politique robotique à contrôler son propre regard pendant une tâche de manipulation. Le benchmark comprend deux suites : TAVIS-Head (5 tâches avec caméra sur cardan pan/tilt pour la recherche globale de scène) et TAVIS-Hands (3 tâches avec caméras de poignet pour gérer les occlusions locales). Il est construit sur IsaacLab et s'appuie sur deux embodiments de torse humanoïde : le GR1T2 de Fourier Intelligence et le Reachy2 de Pollen Robotics (Bordeaux). Environ 2 200 épisodes de démonstrations téléopérées sont publiés en format LeRobot v3.0 sur HuggingFace, avec Diffusion Policy et π₀ (Physical Intelligence) comme baselines. Trois résultats principaux ressortent : la vision active améliore les performances, mais de façon conditionnelle à la tâche ; les politiques multi-tâches se dégradent nettement sous distribution shift contrôlé ; et l'imitation seule produit un regard anticipatoire dont les temps de préemption médians, mesurés par la métrique GALT (Gaze-Action Lead Time), sont comparables à ceux du téléopérateur humain de référence. Jusqu'ici, plusieurs groupes avaient démontré indépendamment les bénéfices de la vision active en 2024-2025, sans base commune de comparaison. TAVIS comble ce vide avec trois primitives reproductibles : un protocole comparatif caméra mobile/caméra fixe sur des démonstrations identiques, la métrique GALT issue des sciences cognitives et de l'HRI (Human-Robot Interaction), et des splits procéduraux in-distribution/out-of-distribution. Le constat que les gains sont task-conditional invalide l'hypothèse naïve qu'ajouter des degrés de liberté à la caméra améliore systématiquement les performances, nuance décisive pour les intégrateurs industriels. La fragilité sous distribution shift constitue un signal d'alarme concret pour tout déploiement hors simulation. La vision active en manipulation connaît un regain d'intérêt depuis 2024, porté par les progrès des VLA (Vision-Language-Action models) et la disponibilisation de robots humanoïdes à têtes articulées. Le choix de Reachy2 comme plateforme de référence est notable : Pollen Robotics, startup bordelaise fondée en 2016, est l'un des rares acteurs européens dont le robot open-source figure dans des benchmarks académiques internationaux, face aux concurrents américains (Figure, Agility) et asiatiques (Fourier, Unitree). Les prochaines étapes naturelles incluent l'évaluation de politiques VLA récentes comme GR00T N2 ou OpenVLA sur TAVIS, ainsi que le transfert sim-to-real, que le papier ne couvre pas encore.

UEPollen Robotics (Bordeaux) est l'une des deux seules plateformes de référence du benchmark TAVIS, ce qui ancre un acteur français open-source au cœur d'une infrastructure d'évaluation académique internationale pour les politiques VLA.

FR/EU ecosystemePaper
1 source
Genesis AI publie GENE-26.5 : un robot humanoïde réussit enfin à préparer des œufs brouillés à la tomate
47Pandaily 

Genesis AI publie GENE-26.5 : un robot humanoïde réussit enfin à préparer des œufs brouillés à la tomate

La startup française Genesis AI a publié les premières démonstrations de GENE-26.5, son premier système de modèle de fondation pour robot humanoïde. Les vidéos montrent le robot casser des œufs d'une seule main, couper des tomates en mode bimanuel, préparer des smoothies, effectuer du pipetage, résoudre un Rubik's cube et saisir simultanément quatre objets de tailles différentes entre ses doigts. Le démo central est une tâche de cuisine de 4 minutes décomposée en plus de 20 sous-tâches : casser un œuf, trancher des tomates, manier un fouet, un couteau, une spatule et une poêle. Un détail révélateur : pour transférer les tomates coupées, le robot utilise le dos du couteau et la planche à découper comme appui, une coordination bimanuelles typiquement humaine. Genesis AI déclare des taux de réussite de 90 à 95 % sur la plupart des étapes, mais seulement 50-60 % pour les deux plus délicates (cassage d'œuf d'une main, transfert avec le dos du couteau) -- un niveau d'honnêteté inhabituel dans les communications de ce secteur. La vitesse d'exécution atteint 60-70 % de celle d'un humain. La main dextère est fournie par Dance Muscle (舞肌科技) ; les deux entreprises co-conçoivent une prochaine génération ciblant le format 1:1 main humaine avec 20 degrés de liberté actifs et back-drivables. La portée de GENE-26.5 dépasse les performances brutes des démos. Les tâches domestiques exigent une adaptation en temps réel à des objets imprévisibles et à des états de contact changeants, sans trajectoire pré-programmée, ce qui les rend parmi les problèmes de manipulation les plus difficiles à généraliser en robotique. La recette de données de Genesis combine trois sources : données de gant (mouvements fins et signaux tactiles haute fidélité), vidéo en première et troisième personne, pour un total annoncé de plus de 200 000 heures de données cross-modales collectées avec des partenaires. La simulation Genesis, moteur physique open-source développé en parallèle par l'entreprise, assure l'évaluation en boucle fermée et accélère les itérations. Ce pipeline (préentraînement massif sur données humaines, adaptation sur peu de données robot, évaluation en simulation) ressemble structurellement au paradigme qui a transformé le NLP vers les LLMs, et constitue un signal fort pour les intégrateurs et les décideurs industriels : le sim-to-real gap sur la manipulation dextère commence peut-être à se réduire sérieusement. Genesis AI a été fondée début 2025 et a levé 105 millions de dollars en seed round, l'un des plus importants jamais réalisés en France dans la robotique. Parmi les investisseurs figurent Eric Schmidt (ancien PDG de Google), Xavier Niel et Bpifrance. Le CEO Zhou Xian est titulaire d'un doctorat du Carnegie Mellon University Robotics Institute, ce qui ancre l'entreprise dans la tradition académique américaine malgré son origine française. Dans une course humanoïde particulièrement dense qui comprend Figure AI (Figure 03), Tesla (Optimus Gen 3), Physical Intelligence (Pi-0) et NVIDIA (GR00T N2), Genesis se distingue par son pari sur la donnée humaine à grande échelle et la simulation comme levier de généralisation, en opposition aux approches centrées sur la téléopération robot. GENE-26.5 reste toutefois au stade de démo laboratoire : aucun pilote industriel ni calendrier de déploiement n'a été annoncé à ce stade.

UEGenesis AI, startup française ayant levé 105 M€ avec Bpifrance et Xavier Niel, positionne la France comme acteur de premier plan dans la course mondiale aux modèles de fondation pour robots humanoïdes, avec un pipeline données/simulation potentiellement transposable à l'industrie européenne.

FR/EU ecosystemeOpinion
1 source
Galbot lance LDA-1B, un modèle du monde-action en open source
48Pandaily 

Galbot lance LDA-1B, un modèle du monde-action en open source

Galbot a publié LDA-1B, un modèle fondation monde-action cross-embodiment de 1,6 milliard de paramètres, construit sur son architecture propriétaire WAM (World-Action Model). Ce modèle unifie modèles de monde et modèles d'action au niveau des données, permettant un apprentissage conjoint sur données de simulation et données réelles, données humaines et robotiques, ainsi que sur jeux de données d'action labellisés et non labellisés. LDA-1B peut s'adapter à différentes morphologies de robots après seulement une heure de post-entraînement, selon Galbot. À mesure que le volume de données d'entraînement est passé de 5 000 à 30 000 heures, l'erreur de prédiction d'action a diminué de façon continue, démontrant un comportement de scaling cohérent. La recherche a été acceptée à RSS 2026 et le code source est désormais public. Le modèle est intégré dans AstraBrain et AstraData, l'infrastructure de déploiement de Galbot, couvrant la logistique industrielle, les tâches domestiques et les scénarios retail. En avril 2026, la société est l'entreprise d'IA incarnée non cotée la mieux valorisée en Chine, avec une valorisation dépassant 20 milliards de yuans (2,8 milliards de dollars). Plusieurs points méritent attention. La capacité d'adaptation cross-embodiment en une heure de fine-tuning est une affirmation forte, mais elle reste à valider hors démonstrations contrôlées. Le comportement de scaling confirmé entre 5 000 et 30 000 heures de données est un signal positif pour les VLA (Vision-Language-Action models) à grande échelle, suggérant que les lois d'échelle s'appliquent à l'action robotique de façon analogue aux LLM textuels. L'open-source du codebase réduit la barrière d'entrée pour les intégrateurs souhaitant expérimenter sans infrastructure propriétaire, et positionne Galbot comme fournisseur d'infrastructure fondationale, pas seulement constructeur de robots. Galbot est une startup spécialisée dans les robots humanoïdes et l'IA incarnée. LDA-1B entre en compétition directe avec pi0 de Physical Intelligence, GR00T N2 de NVIDIA, et les approches internes de Figure AI et Agility Robotics côté américain. En Chine, la société rivalise avec Unitree et UBTECH sur le terrain humanoïde. L'acceptation à RSS 2026 lui confère une légitimité académique rare dans ce secteur encore dominé par les communiqués marketing. Les prochaines étapes probables incluent des pilotes industriels en logistique et retail, et une expansion internationale que la valorisation de 2,8 milliards de dollars rend plausible.

UEPression concurrentielle indirecte sur les équipes VLA européennes (INRIA, CEA-List), mais aucun déploiement ni partenariat européen annoncé.

💬 Le comportement de scaling sur les données robotiques, c'est le vrai signal ici, pas le chiffre de valorisation. Que les lois d'échelle s'appliquent à l'action physique comme au texte, ça dit quelque chose sur ce qu'on va voir dans 3 ans, et tu commences à comprendre pourquoi les gros acteurs américains s'agitent. L'open source est une bonne décision stratégique, mais une heure de fine-tuning pour changer de morphologie de robot, j'attends de voir ça hors démo contrôlée.

IA physiqueOpinion
1 source
Hexagon et Schaeffler vont déployer 1 000 humanoïdes Aeon dans leur réseau d'usines mondial
49Robotics & Automation News 

Hexagon et Schaeffler vont déployer 1 000 humanoïdes Aeon dans leur réseau d'usines mondial

Hexagon Robotics et Schaeffler, fabricant allemand de composants de précision et de technologie de mouvement (roulements, actionneurs, systèmes d'entraînement), ont annoncé en 2026 l'élargissement de leur partenariat stratégique avec un objectif chiffré : déployer 1 000 robots humanoïdes Aeon dans les usines du réseau mondial de Schaeffler. L'accord fait suite à un programme pilote conjoint mené en 2025, décrit comme concluant par les deux parties. Les spécifications techniques de l'Aeon, payload, degrés de liberté, cadence de cycle, n'ont pas été communiquées dans cette annonce, ce qui limite l'évaluation indépendante des performances réelles. Un engagement à 1 000 unités représente l'un des ordres de déploiement les plus élevés annoncés publiquement dans le segment humanoïde industriel, où la plupart des acteurs en sont encore aux phases de pilote à moins de 50 robots. Si le chiffre est tenu, il constituerait une preuve d'échelle manufacturière que ni Figure (Figure 03), ni Agility Robotics (Digit), ni 1X Technologies n'ont encore atteinte. Pour les intégrateurs et les COO industriels, le signal est que la phase "demo-to-reality gap" peut être franchie dans un environnement de production réel, à condition de disposer d'un partenaire industriel ancré dans la supply chain mécanique. Hexagon est principalement connu comme éditeur de logiciels de métrologie et de fabrication numérique (ex-Hexagon AB), ce qui rend son bras robotique Hexagon Robotics moins visible que ses concurrents purement hardware. Schaeffler, lui, apporte un réseau d'usines dense en Europe, Asie et Amériques, ainsi qu'une expertise en actionneurs pertinente pour la co-conception des bras et des articulations de l'Aeon. Dans la course humanoïde, les concurrents directs sur le segment industriel incluent Tesla Optimus, GR00T N2 de Nvidia/partenaires, et Apollo de Apptronik. Aucune date de livraison ferme ni calendrier de déploiement par site n'a été précisé.

UESchaeffler, fabricant allemand de composants de précision avec un réseau d'usines dense en Europe, est le déployeur central de l'accord ; si le cap des 1 000 unités est atteint, cela établirait une référence d'échelle industrielle directement pertinente pour les constructeurs et intégrateurs robotiques européens.

ROBOGATE : détection adaptative des défaillances pour un déploiement sûr des politiques de robots via un échantillonnage en deux étapes axé sur les limites
50arXiv cs.RO 

ROBOGATE : détection adaptative des défaillances pour un déploiement sûr des politiques de robots via un échantillonnage en deux étapes axé sur les limites

Des chercheurs ont publié ROBOGATE (arXiv:2603.22126), un framework open-source de validation pré-déploiement pour les politiques de manipulation robotique, conçu pour identifier les zones de défaillance avant mise en production industrielle. Le système repose sur un échantillonnage adaptatif en deux étapes dans un espace de paramètres à huit dimensions : une première phase par Latin Hypercube Sampling (LHS) couvre l'espace global, puis une seconde phase concentre l'effort sur la zone de transition critique entre 30 % et 70 % de taux de réussite, là où les échecs sont les plus révélateurs. Le tout est exécuté dans NVIDIA Isaac Sim avec le moteur physique Newton, sur quatre morphologies robotiques : Franka Panda (7-DOF), UR3e, UR5e et UR10e (tous 6-DOF). Au total, plus de 50 000 expériences ont été simulées, produisant un modèle de régression logistique avec une AUC de 0,780 et une équation analytique fermée de la frontière de défaillance. Le framework a également benchmarké huit politiques VLA, dont une version fine-tunée de NVIDIA GR00T N1.6 (3 milliards de paramètres), entraînée sur LIBERO-Spatial pendant 20 000 étapes. Le chiffre le plus frappant de l'étude est un écart de 97,65 points de pourcentage entre les environnements de simulation : le même checkpoint GR00T N1.6 atteint 97,65 % de réussite sur le benchmark LIBERO sous MuJoCo, mais tombe à 0 % sur les 68 scénarios industriels de ROBOGATE sous Isaac Sim. Ce résultat met en lumière un problème structurel du déploiement des VLA : les scores de benchmark en simulation ne prédisent pas le comportement dans un simulateur différent, a fortiori dans le monde réel. Pour les intégrateurs et les décideurs industriels, cela signifie qu'un modèle validé sur benchmark standard peut être totalement non opérationnel dans leur environnement cible. ROBOGATE propose une couche de validation intermédiaire, inspirée du paradigme que NVIDIA a formalisé pour le calcul quantique avec Ising, transposé ici à l'IA physique. Le gap sim-to-real reste l'un des verrous majeurs de la robotique manipulatrice apprise, et la plupart des acteurs du secteur, de Figure AI (Figure 03) à Physical Intelligence (Pi-0) en passant par Boston Dynamics ou les équipes internes de NVIDIA, travaillent à le réduire via des pipelines sim-to-real renforcés ou de la synthèse de données domain-randomisée. ROBOGATE ne prétend pas résoudre ce gap mais fournit un outil de diagnostic structuré : cartographier les frontières d'échec avant déploiement, ce qui est précisément ce qui manque dans les workflows industriels actuels. Le framework est publié en open-source, ce qui devrait faciliter son adoption par les équipes de validation, en particulier celles qui travaillent sur des cellules pick-and-place standardisées avec des bras industriels UR ou Franka. Les prochaines étapes naturelles seraient l'extension à des morphologies mobiles-manipulatrices et l'intégration dans des pipelines CI/CD robotiques, un domaine encore embryonnaire mais en progression rapide chez des acteurs comme Intrinsic (Alphabet) ou Covariant.

UELes équipes R&D européennes travaillant sur des cellules robotiques avec bras UR (Universal Robots, Danemark) ou Franka Panda peuvent adopter ce framework open-source pour structurer leur validation pré-déploiement et éviter des échecs coûteux en production.

IA physiqueActu
1 source