Aller au contenu principal

Dossier IA physique & VLA

1257 articles

L'IA physique : modèles vision-langage-action qui contrôlent des corps robotisés. État de l'art académique (CoRL, RSS) et premières productions industrielles.

StellaVLA : démonstration structurée en contexte pour des modèles vision-langage-action généralisables
1arXiv cs.RO IA physiqueActu

StellaVLA : démonstration structurée en contexte pour des modèles vision-langage-action généralisables

StellaVLA est un framework pour les modèles Vision-Language-Action (VLA) qui s'adapte a des situations inédites a partir d'une seule démonstration récupérée au moment de l'inférence, sans finetuning. Une pipeline automatisée convertit chaque trajectoire brute en démonstration structurée (plan de tache, sous-objectifs, mouvement 3D verbalise) sans annotation humaine, puis un entrainement dual conjoint action-langage internalise ce raisonnement, l'inférence n'utilisant que l'expert d'action pour un contrôle temps réel sans latence ajoutée. Sur le classement VLA-Arena du 1er aout 2026, StellaVLA arrive premier avec un score de 0,63, contre 0,44 pour pi-0.5 et 0,22 pour LingBot-VLA. Il atteint aussi 98,8% de réussite sur LIBERO et 85,1% sur LIBERO-Plus, et des tests sur robot réel confirment l'usage de démonstrations humain/robot et humain-vers-robot captées en réalité étendue (XR). Le résultat cible un point faible connu des VLA : leurs performances s'effondrent des que la scene, le point de vue ou l'objet différent de l'entrainement, ce qui obligeait jusque-la a recollecter des données et refinetuner pour chaque cas. En rendant la démonstration transférable entre robot réel, main humaine et capture XR, StellaVLA laisse entrevoir une adaptation par simple exemple contextuel plutôt qu'un cycle complet de collecte-entrainement, ce qui intéressé les intégrateurs cherchant a réduire le cout de reconfiguration en usine ou en entrepôt. L'écart revendique face a pi-0.5 (Physical Intelligence) et LingBot-VLA sur un classement tiers reste toutefois, a ce stade, un résultat de preprint sur benchmarks simules et un échantillon limite de robot réel, non un déploiement industriel vérifie indépendamment. Le travail s'inscrit dans la vague des VLA généralistes lancée ces deux dernières années par les modèles pi de Physical Intelligence et par des systèmes comme GR00T N2 de NVIDIA ou Helix de Figure AI, tous confrontes au même écart entre démonstration et usage réel. En choisissant de se comparer directement a pi-0.5 et LingBot-VLA sur VLA-Arena, les auteurs positionnent StellaVLA comme concurrent de ces approches récentes plutôt que comme variante académique isolée. Publie en aout 2026 sur arXiv, l'article ne mentionne ni partenariat industriel ni calendrier de déploiement : il s'agit pour l'instant d'une contribution de recherche destinée a être reproduite avant toute intégration commerciale.

1 source
RoboHarness : robustesse des modèles vision-langage-action via une adaptation en contexte augmentée par mémoire
2arXiv cs.RO 

RoboHarness : robustesse des modèles vision-langage-action via une adaptation en contexte augmentée par mémoire

Des chercheurs présentent RoboHarness, un dispositif logiciel qui se greffe sur des modèles vision-langage-action (VLA) déjà entraines pour améliorer leur robustesse face au bruit perceptif et aux variations d'environnement, sans reentrainer les poids du réseau. L'architecture combine trois briques opérant en ligne, une récupération contrastive a double mémoire (RAG), un orchestrateur vision-langage pilote par un grand modèle de langage multimodal capable d'attribuer causalement les échecs d'exécution, et des interventions extensibles via le Model Context Protocol (MCP), auxquelles s'ajoute un module hors ligne de consolidation mémoire qui distille les traces d'exécution en connaissances a priori réutilisables. Les auteurs ont teste ce système sur trois modèles VLA de base, Pi-0, Pi-0.5 et SmolVLA, sur les benchmarks LIBERO-PRO et sur LIBERO-RoboHarness, un nouveau benchmark qu'ils ont eux-mêmes conçu. Resultat annonce: un gain moyen de taux de réussite absolu de 56,6%, avec une amélioration de 89,1% sur les taches longues enchaînées (long-horizon task chaining). Le code source et la page projet sont publies sur GitHub, sous le compte LZY-1021. Le papier, publie sur arXiv, en est a sa troisième version révisée. Cette approche cible une faiblesse connue des modèles VLA généralistes: leur fragilité des qu'ils sortent de la distribution de données d'entrainement, un écart souvent masque dans les démonstrations mais critique pour un déploiement industriel réel. En proposant une couche additive et sans fine-tuning, applicable a plusieurs backbones existants, RoboHarness s'inscrit dans une tendance émergente consistant a traiter la robustesse comme un problème d'orchestration et de mémoire en contexte plutôt que de seul entrainement. Pour les intégrateurs, cela laisse entrevoir la possibilité de renforcer des politiques VLA déjà déployées sans refaire les couteux cycles de collecte de données et de reentrainement, un argument potentiellement déterminant pour l'adoption en environnement industriel variable. Les modèles VLA généralistes, tels Pi-0 développe par Physical Intelligence, occupent une place croissante dans la robotique manipulatrice, aux cotes d'autres approches généralistes du secteur. RoboHarness ne constitue pas un nouveau modèle mais un harnais complémentaire, positionne comme correctif a la faiblesse structurelle de mémoire et d'attribution causale des VLA figes. Les benchmarks utilises restant majoritairement simules (suite LIBERO), la validation sur robot physique et en conditions industrielles reste l'étape a surveiller pour juger de la portée réelle de ces gains annonces.

RechercheActu
1 source
Lost dans la reconstruction : aligner les représentations d'action et le langage dans les modèles vision-langage-action
3arXiv cs.RO 

Lost dans la reconstruction : aligner les représentations d'action et le langage dans les modèles vision-langage-action

Un article publié le 12 août 2026 sur arXiv (2608.10484) s'attaque à la tokenisation des trajectoires de mouvement dans les modèles vision-langage-action, ou VLA. Sur le jeu de données BridgeV2, les auteurs montrent que ces trajectoires portent des informations liées au sens des verbes d'instruction, au-delà des simples changements d'état visuel, et que les tokenizers classiques, entraînés à reconstruire le geste via des pertes L1/L2, effacent systématiquement cette information linguistique. Leur méthode, baptisée SALT pour Semantically ALigned action Tokenizer, ajoute à un tokenizer de type VQ-VAE un objectif auxiliaire: un modèle vision-langage figé doit retrouver l'instruction textuelle de l'épisode à partir des seuls latents d'action quantifiés. Sur le benchmark de simulation SimplerEnv, les politiques entraînées avec SALT atteignent 71,9% de réussite moyenne, contre 42,7% pour un VQ-VAE classique et 31,2% pour FAST. Ce résultat touche un choix de conception central pour toute la famille des VLA, celle qui sous-tend des systèmes comme Pi-0, GR00T ou Helix: comment découper des actions continues en tokens discrets avant l'entraînement. Jusqu'ici, la priorité allait à la fidélité de reconstruction du geste, sous l'hypothèse que minimiser l'erreur numérique suffisait à préserver le sens de l'instruction en langage naturel. L'écart de près de 30 points entre SALT et un VQ-VAE standard suggère qu'une part importante du sens se perd dès la tokenisation, indépendamment de la taille du modèle ou du volume de données. Pour les équipes qui construisent des politiques de contrôle conditionnées par le langage, obtenir un tel gain par un simple changement d'objectif d'entraînement du tokenizer, sans toucher à l'architecture principale, constitue un signal fort. Le travail s'inscrit dans le débat sur la tokenisation des actions robotiques, partagé entre les tokenizers de reconstruction type VQ-VAE et des approches comme FAST, développée par Physical Intelligence et utilisée dans la lignée Pi-0. SALT s'en distingue en conservant la fidélité de reconstruction tout en développant des codes discrets spécialisés par verbe d'action. Publié comme nouvelle soumission arXiv, le travail est validé uniquement en simulation via SimplerEnv, sans démonstration sur robot physique, laissant ouverte la question du transfert sim-to-real.

UEAucun acteur ni deploiement francais/europeen n'est implique; il s'agit d'un resultat de recherche generique pouvant interesser les equipes europeennes travaillant sur des modeles VLA.

RechercheOpinion
1 source
Modèle vision-langage-action Flex-π : un modèle du monde à multi-flux avec flexibilité de calcul
4arXiv cs.RO 

Modèle vision-langage-action Flex-π : un modèle du monde à multi-flux avec flexibilité de calcul

Une équipe de recherche présente Flex-π, un modèle monde-action (WAM) de 6 milliards de paramètres, détaillé dans un article déposé sur arXiv (2608.10860v1). Sa base est une découverte inattendue : l'encodeur VAE gelé, utilisé pour la génération vidéo et l'encodage RGB, retranscrit aussi presque sans perte les cartes de points 3D, sans entraînement dédié. Cela permet de superviser Flex-π sur la géométrie 3D et la sémantique objet-centrée DINO en plus du RGB, sans capteur, pré-entraînement supplémentaire ni surcoût de latence, dans une architecture Mixture-of-Transformers qui débruite conjointement ces signaux et les actions. Un dropout par flux avec renforcement inter-modalités permet à un même checkpoint de tourner du mode action seule jusqu'à la génération jointe complète ; sur des tâches de manipulation bimanuelle dextre et précise en conditions réelles, Flex-π bat les meilleures références de 2 à 7 fois tout en restant plus rapide que π0.5. Ce résultat comble une limite connue des modèles monde, qui prédisent surtout des pixels sans ancrage 3D ni compréhension sémantique des objets, ce qui freinait leur utilité pour la manipulation fine. Flex-π montre qu'un signal géométrique riche peut être extrait gratuitement d'un VAE vidéo déjà entraîné, sans caméra de profondeur ni pipeline 3D dédié, ce qui abaisse la barrière d'entrée pour les équipes de robotique. Sa flexibilité de calcul et son efficacité en démonstrations, avec des gains de 2 à 7x avec moins de données, répondent à deux freins des VLA (vision-language-action) : le coût d'intégration et le coût de collecte de données par tâche. Flex-π reste à ce stade une publication de recherche accompagnée d'un site de démonstration (flex-pi.github.io), sans annonce de produit commercial ni de déploiement industriel. La comparaison directe avec π0.5, le modèle de référence de Physical Intelligence, le positionne dans la course aux modèles vision-langage-action généralistes, aux côtés d'efforts comme GR00T N2 de NVIDIA ou Helix de Figure AI. L'article ne précise ni l'institution porteuse ni de calendrier, et ses résultats reposent sur des benchmarks internes plutôt que sur un déploiement chez un intégrateur tiers.

IA physiqueActu
1 source
AgiBot dépasse Unitree et devient le premier fournisseur mondial de robots humanoïdes au premier semestre, en pleine préparation d'IPO
5SCMP Tech 

AgiBot dépasse Unitree et devient le premier fournisseur mondial de robots humanoïdes au premier semestre, en pleine préparation d'IPO

AgiBot, entreprise chinoise basée à Shanghai, a dépassé son rival domestique Unitree Robotics pour devenir le premier fournisseur mondial de robots humanoïdes au premier semestre 2026. Selon un rapport publié dimanche par le cabinet de recherche californien Smart Analytics Global (SAG), AgiBot a capté 44% du marché mondial après avoir livré environ 8 400 robots humanoïdes entre janvier et juin 2026. Ce basculement intervient alors que les deux poids lourds chinois du secteur préparent chacun une entrée en bourse, dans un contexte d'engouement financier généralisé pour la "physical AI", l'IA incarnée dans des systèmes robotiques. Ce changement de leadership vaut signal pour toute la filière: il confirme que la Chine concentre aujourd'hui l'essentiel des volumes réels de production et de livraison de robots humanoïdes, loin devant des annonces occidentales encore souvent limitées au prototype ou au pilote restreint. Pour les intégrateurs et décideurs B2B qui évaluent des fournisseurs, les 8 400 unités livrées en six mois marquent un changement d'échelle: le secteur quitte la phase de démonstration pour entrer dans une logique de déploiement mesurable. La double préparation d'IPO d'AgiBot et Unitree confirme aussi que les marchés financiers commencent à valoriser ces acteurs sur des bases commerciales concrètes, et non plus sur la seule promesse technologique. AgiBot, également connue sous le nom de Zhiyuan Robotics, et Unitree, pionnier reconnu de la robotique quadrupède avant de se diversifier vers l'humanoïde, comptent parmi les entreprises chinoises les plus avancées du secteur, soutenues par des fonds publics et privés locaux. Leur course à la cotation s'inscrit dans une compétition mondiale plus large face à des acteurs comme Figure AI ou Tesla aux Etats-Unis, qui visent eux aussi la production de masse de robots humanoïdes pour la logistique et l'industrie. Les prochaines étapes attendues concernent la confirmation des calendriers d'introduction en bourse des deux groupes chinois, ainsi que la publication de données plus détaillées sur la répartition géographique de ces déploiements.

Chine/AsieActu
1 source
Un robot qui apprend à partir de vidéos courtes en 29 secondes : HOST, la nouvelle recette d'IA incarnée de X Square Robot
6Pandaily 

Un robot qui apprend à partir de vidéos courtes en 29 secondes : HOST, la nouvelle recette d'IA incarnée de X Square Robot

Le robot humanoïde chinois X Square Robot a mis en open source HOST, un framework d'apprentissage par vidéo qui permet à un robot de reproduire une tâche dès sa première tentative, après avoir simplement regardé un clip de démonstration de 29 secondes. Sur ce test, HOST atteint un taux de réussite de 62%, contre 38% pour la méthode standard actuelle qui nécessite environ 50 démonstrations expertes et quatre heures de fine-tuning. Le système repose sur deux modules: un module de vision qui reconstruit la scène observée du point de vue du robot, et un module d'action qui calcule la trajectoire articulaire correspondante, le tout aligné par un mécanisme de dynamic time warping qui réduit l'erreur d'alignement d'un facteur dix environ. Fondée fin 2023 à Pékin, X Square Robot a levé plus d'un milliard de yuans sur huit tours de table, avec Meituan Strategic Investment, Alibaba Cloud, Lenovo Capital et Delian Capital parmi ses investisseurs. L'enjeu dépasse la simple prouesse technique: la collecte de données par téléopération, aujourd'hui dominante dans le secteur, repose sur des ingénieurs équipés de casques VR qui pilotent un bras robotique geste par geste, des dizaines de fois, pour chaque tâche. Un robot de collecte coûte plusieurs centaines de milliers de dollars et chaque démonstration peut dépasser cent dollars en coût marginal, un modèle que même les "fabriques de données" en Inde ou les travailleurs à temps partiel des zones rurales chinoises ne parviennent pas à rendre réellement scalable. En inversant la logique, c'est à dire en apprenant à l'inférence plutôt qu'en réentraînant hors ligne sur des données massives, HOST attaque directement ce goulot d'étranglement économique. Si l'approche tient à l'échelle au-delà du benchmark de recherche, elle rebattrait les cartes pour les intégrateurs et décideurs industriels en réduisant drastiquement le coût d'acquisition de nouvelles compétences robotiques, un argument central dans la course actuelle entre laboratoires embodied-AI. Il faut toutefois noter que le chiffre de 62% reste une mesure de recherche sur benchmark, pas une performance de déploiement en conditions réelles, et l'article ne précise pas la diversité des tâches testées ni les conditions d'évaluation. L'approche s'inspire de la théorie cognitive de la simulation, selon laquelle l'humain répète mentalement le résultat visé avant d'agir, une logique que l'équipe chinoise transpose à l'apprentissage robotique en remplaçant l'imitation articulation par articulation par une reconstruction de la scène finale suivie d'un calcul de trajectoire. Le choix de l'open source vise explicitement à capter l'attention des développeurs comme tremplin vers des pilotes en entreprise, une stratégie de positionnement qui s'inscrit dans la compétition plus large entre approches VLA telles que Pi-0, GR00T N2 ou Helix, où la question du passage à l'échelle depuis la démonstration jusqu'au déploiement industriel reste largement ouverte.

IA physiqueOpinion
1 source
STRONG-VLA : robustesse découplée des modèles vision-langage-action face aux perturbations multimodales
7arXiv cs.RO 

STRONG-VLA : robustesse découplée des modèles vision-langage-action face aux perturbations multimodales

STRONG-VLA est un framework de fine-tuning en deux étapes qui vise a rendre les modèles Vision-Language-Action (VLA) plus robustes face aux perturbations multimodales, c'est-a-dire au bruit visuel et aux instructions linguistiques dégradées qui font chuter les performances en conditions réelles. Plutot que d'entrainer conjointement sur données propres et perturbées, ce qui créé un conflit d'optimisation, la méthode sépare l'acquisition de robustesse, via un curriculum de 28 types de perturbations textuelles et visuelles (bruit de capteur, occlusions, instructions corrompues), d'un réajustement final sur taches propres. Sur le benchmark LIBERO, elle ameliore le taux de réussite jusqu'a 12,60% sur perturbations connues et 7,77% sur perturbations inédites pour OpenVLA, avec des gains plus marques encore sur OpenVLA-OFT (+14,48% / +13,81%) et pi0 (+16,49% / +5,58%). Des tests en conditions réelles sur une plateforme robotique AIRBOT confirment ces résultats hors simulation. Le travail cible un angle mort connu du secteur: les démonstrations de VLA se font généralement en environnement contrôle, alors que le déploiement réel expose ces systèmes a des variations d'éclairage, des occlusions et des instructions humaines imprécises. En prouvant que la robustesse peut être gagnée sans sacrifier la performance sur taches propres, et que ce gain se reproduit sur trois architectures distinctes, les auteurs apportent un signal de généralisation qui intéressé directement les intégrateurs cherchant a fiabiliser des pipelines VLA au-delà du laboratoire. Cela remet en cause l'hypothèse, courante dans l'industrie, qu'un simple entrainement conjoint sur données propres et perturbées suffit a garantir la robustesse. STRONG-VLA s'inscrit dans les efforts pour combler l'écart entre simulation et déploiement réel des modèles VLA, une famille d'architectures qui compte déjà des références comme OpenVLA, sa variante OpenVLA-OFT, et pi0 développe par Physical Intelligence. Le benchmark de 28 perturbations introduit par les auteurs se veut un outil de référence pour évaluer la robustesse de futurs modèles, au-delà des scores de réussite en environnement propre mesures par LIBERO. Aucun acteur européen n'est cite dans cette publication académique, qui reste a ce stade une contribution de recherche validée en laboratoire et sur une seule plateforme physique, sans annonce de déploiement industriel ou de partenariat commercial.

RecherchePaper
1 source
AtlasVLA : une modélisation persistante de l'état monde-ego pour les modèles vision-langage-action
8arXiv cs.RO 

AtlasVLA : une modélisation persistante de l'état monde-ego pour les modèles vision-langage-action

Une équipe de recherche présente AtlasVLA, un nouveau framework pour les modèles vision-langage-action (VLA), décrit dans un article publié sur arXiv le 6 août 2026 (arXiv:2608.06729v1). Le système repose sur une architecture à double mémoire: une "4D Persistent World State Memory", qui transforme les observations 2D transitoires en un état spatial global mis à jour en continu via un hachage voxel, et une "Ego-Working State Memory", qui conserve l'historique de l'état du robot et l'avancement de la tâche en cours. Ces deux mémoires conditionnent un transformeur de diffusion (DiT) chargé de générer les actions. Testé sur les bancs d'essai LIBERO, RLBench et sur des tâches réelles, AtlasVLA atteint des performances de pointe en n'utilisant qu'une seule caméra montée au poignet, avec des gains de taux de réussite de 9,4 points sur LIBERO-Long et de 17,5 points sur des tâches réelles à long horizon, comparé à des méthodes de référence multi-caméras. Ce résultat s'attaque à une limite connue des modèles VLA actuels: leur nature réactive, qui pousse les robots à "oublier" un objet dès qu'il sort du champ de la caméra, et à perdre le fil de la progression dans les tâches à plusieurs étapes. Pour les intégrateurs industriels, l'intérêt est concret: obtenir une robustesse comparable à des rigs multi-caméras avec un seul capteur poignet réduit le coût matériel et la complexité de calibration des cellules robotisées. Le résultat remet en question l'hypothèse selon laquelle une couverture visuelle multi-angles serait indispensable pour la manipulation à long horizon, un argument souvent avancé par les fournisseurs de systèmes de vision embarqués. Ces chiffres proviennent toutefois d'un article encore non revu par les pairs, et les conditions précises des essais réels (nombre d'essais, environnements testés) restent à vérifier avant toute généralisation. Le travail s'inscrit dans la lignée des modèles VLA qui ont émergé ces dernières années, de RT-2 à Pi-0 en passant par GR00T N2 ou Helix, tous construits sur un mappage direct image vers action avec peu ou pas de mémoire persistante. AtlasVLA se positionne explicitement contre les approches multi-vues, qu'il dit surpasser de façon nette sur les tâches longues. L'article ne précise pas d'acteur industriel ni de calendrier de déploiement: il s'agit à ce stade d'une contribution de recherche, sans indication de portage vers un produit commercial ou un partenariat avec un fabricant de robots humanoïdes ou de bras manipulateurs.

IA physiqueActu
1 source
Robots d'entrepôt conçus pour résister aux conditions difficiles
9Robotics Business Review 

Robots d'entrepôt conçus pour résister aux conditions difficiles

Nomagic, spécialiste polonais de la robotique d'entrepôt, a présenté son général manager Amérique du Nord Josh Cloer dans l'épisode 256 du podcast The Robot Report, publié début août 2026. Cloer, ancien membre fondateur de l'équipe nord-américaine de Mujin où il a bâti la stratégie commerciale de l'entreprise depuis ses débuts, pilote désormais l'expansion de Nomagic sur le marché nord-américain avec des systèmes de "physical AI" destinés aux opérations de préparation de commandes (order fulfillment). Le même épisode relaie trois actualités du secteur : un accord pouvant atteindre 900 millions de dollars signé par HII avec Path Robotics et GrayMatter Robotics pour de la robotique industrielle, l'annonce par Google DeepMind que Gemini Robotics 2 permet un contrôle corporel complet des robots, et l'ouverture par l'Université de Floride d'un nouveau laboratoire dédié à la construction industrialisée par robots. Pour les intégrateurs et décideurs logistiques, ces annonces confirment une bascule vers des systèmes d'IA physique capables de s'adapter à la variabilité réelle des entrepôts, plutôt que des cellules robotiques figées programmées pour une tâche unique. L'expansion nord-américaine de Nomagic illustre la concurrence croissante face à des acteurs établis comme Mujin sur le créneau du picking automatisé, tandis que l'accord HII à près d'un milliard de dollars signale que les grands industriels américains structurent désormais des budgets robotiques de long terme plutôt que des pilotes ponctuels. L'annonce de Gemini Robotics 2 par DeepMind s'inscrit dans la course aux modèles vision-langage-action (VLA) censés unifier perception et contrôle moteur, un terrain où Google concurrence directement les approches de type Pi-0, GR00T N2 ou Helix, même si l'ampleur réelle du "contrôle corporel complet" annoncé reste à valider en conditions industrielles plutôt que sur démonstration. Ce format, animé par Mike Oitzman pour The Robot Report, mêle habituellement une revue d'actualités hebdomadaire à un entretien approfondi avec un dirigeant du secteur ; il s'inscrit dans la préparation de la conférence RoboBusiness 2026, dont les inscriptions étaient ouvertes au moment de la diffusion. Nomagic, fondée en Pologne et financée notamment par des investisseurs technologiques européens, cible historiquement l'automatisation du picking en entrepôt par bras robotisés et vision par ordinateur ; son arrivée aux États-Unis la place directement face à des concurrents nord-américains déjà implantés comme Mujin, Dexterity ou RightHand Robotics sur le même segment du e-commerce fulfillment.

UENomagic, entreprise polonaise soutenue par des investisseurs technologiques europeens, etend son empreinte via une expansion nord-americaine, mais cette actualite precise ne concerne pas directement le marche francais ni une reglementation europeenne.

IndustrielActu
1 source
Quand un robot humanoïde coûtera-t-il moins cher qu’un salarié ?
10Robot Magazine FR 

Quand un robot humanoïde coûtera-t-il moins cher qu’un salarié ?

Le Boston Consulting Group (BCG) et Fortune Business Insights éclairent une question de plus en plus concrète pour les industriels : à quel moment un robot humanoïde devient-il moins cher qu'un salarié ? Selon leurs estimations, le coût complet d'un opérateur industriel dans un pays développé atteint aujourd'hui 50 000 à 70 000 euros par an, une fois intégrés salaires, charges sociales, congés, formation, assurances et turnover. Face à cela, le prix d'acquisition d'un robot humanoïde professionnel se situe actuellement entre 100 000 et 150 000 dollars, mais plusieurs fabricants visent une baisse sous les 50 000 dollars grâce à l'industrialisation des chaînes de production. L'écart se resserre aussi sur le temps d'utilisation : un salarié européen travaille en moyenne 1 600 à 1 800 heures par an, contre jusqu'à 8 000 heures annuelles pour un robot, maintenance comprise, soit près de cinq fois plus. Fortune Business Insights projette un marché mondial des humanoïdes à 165 milliards de dollars d'ici 2034, avec une croissance annuelle supérieure à 50 % sur la décennie. Ces chiffres déplacent le débat pour les constructeurs automobiles, les acteurs de la logistique, les fabricants d'électronique et les fonds d'investissement : la question n'est plus de savoir si un robot peut exécuter une tâche, mais s'il le fait à un coût horaire inférieur à celui d'un opérateur humain. Le concept de Physical AI mis en avant par le BCG, des systèmes capables de percevoir, raisonner et agir dans un environnement physique conçu pour des humains, marque une inflexion par rapport aux robots industriels classiques, cantonnés à des tâches répétitives en cellules dédiées. Reste que les fourchettes de prix avancées, en particulier l'objectif de descendre sous 50 000 dollars, relèvent d'annonces d'intention plutôt que de tarifs constatés sur des déploiements à grande échelle : le coût total de possession réel, maintenance, licences logicielles et supervision humaine comprises, reste peu documenté publiquement. Cette bascule s'inscrit dans une histoire où le coût des équipements a longtemps réservé l'automatisation aux plus grands groupes industriels. Les progrès conjoints de l'électronique, des batteries, des capteurs, de la vision artificielle et de l'IA embarquée sont présentés comme les leviers qui réduisent ce coût total de possession tout en élargissant la polyvalence des machines. Le BCG illustre cette convergence par une étude de cas portant sur une usine automobile de 500 salariés, dont les détails chiffrés ne sont pas précisés dans les éléments disponibles, ce qui invite à rester prudent tant que des données de déploiement réelles ne viennent pas confirmer l'ampleur des gains annoncés. Pour les décideurs B2B, l'enjeu des prochains mois sera de confronter ces projections économiques à des retours d'expérience concrets sur la productivité, la disponibilité et les coûts de maintenance des flottes de robots humanoïdes effectivement mises en service.

UECes projections economiques de cout total de possession concernent indirectement les industriels europeens (automobile, logistique, electronique) qui devront comparer ces annonces a des donnees reelles de deploiement avant d'ajuster leurs strategies d'automatisation.

BusinessPaper
1 source
PhyAI : l'IA physique en temps réel en périphérie, avec un déploiement à grande échelle dans le cloud
11arXiv cs.RO 

PhyAI : l'IA physique en temps réel en périphérie, avec un déploiement à grande échelle dans le cloud

Publié sur arXiv début août 2026, PhyAI est un moteur d'inférence unifié pour l'IA physique, code et benchmarks disponibles en accès libre sur GitHub (mingti-org/phyai). Le système fait tourner un seul runtime sur les quatre étapes du cycle de vie d'une politique robotique : évaluation de modèle, rollout d'apprentissage par renforcement dans le cloud, service sur GPU en edge et déploiement embarqué. L'architecture isole dans des adaptateurs les briques spécifiques à chaque modèle (conditionnement, solveur, cache, sortie), tandis que le reste, exécution du graphe de calcul, kernels, gestion mémoire, services parallèles, est mutualisé. Les auteurs ont testé la portabilité de cette approche en intégrant MiniCPM-Robot le jour même de sa sortie via cette interface d'adaptateur. Les gains mesurés vont de 1,40x à 4,65x par rapport aux implémentations officielles de pi0, pi0.5, GR00T N1.7 et MiniCPM-Robot. Sur Cosmos3-Nano-Policy-DROID, la latence tombe de 2,46 à 1,18 seconde sur huit GPU H20 (CFG=2, parallélisme tensoriel TP=4), soit un facteur 2,08x. Ce résultat vise directement les intégrateurs et ingénieurs robotique qui jonglent aujourd'hui entre plusieurs runtimes selon l'environnement de déploiement, un vrai point de friction dans l'industrialisation des politiques VLA (vision-language-action). En unifiant évaluation, entraînement et production sous un même code, PhyAI réduit le risque d'écart entre performances mesurées en labo et résultats sur le terrain, un problème classique du secteur. Les auteurs restent factuels sur les limites : des runtimes spécialisés demeurent plus rapides dans plusieurs configurations, l'objectif affiché étant une latence compétitive plutôt qu'un record absolu. L'apport le plus utile pour les décideurs techniques est le concept de "control-time Roofline", qui distingue les cas où le contrôle est limité par l'inférence de ceux limités par l'environnement : sur quatre suites LIBERO, pi0.5 s'avère limité par l'environnement tandis que Cosmos3 reste limité par l'inférence, une grille utile pour prioriser les investissements. Les profils détaillés expliquent pourquoi un runtime unique ne suffit pas seul : sur GPU Hopper, à batch 1, l'expert d'action de pi0.5 représente 8,8% des calculs (FLOPs) mais 57,2% de la latence, un goulot qui retombe à 13,5% à batch 32, portant le débit à environ 100 échantillons par seconde. Cosmos3, dominé par la génération, ne gagne que 14,3% de débit entre batch 1 et 16. Ces travaux s'inscrivent dans la course à l'infrastructure d'inférence pour l'IA physique, alors que les familles pi0/pi0.5 (Physical Intelligence), GR00T (NVIDIA) et les VLA type Cosmos ou MiniCPM-Robot se multiplient, chaque laboratoire ayant historiquement développé son propre runtime maison.

InfrastructureActu
1 source
Structure-Aware Robust Fine-Tuning : défendre les robots vision-langage-action contre le détournement de l'attention physique
12arXiv cs.RO 

Structure-Aware Robust Fine-Tuning : défendre les robots vision-langage-action contre le détournement de l'attention physique

Des chercheurs publient sur arXiv (2608.03231v1) une attaque baptisée AGSD (Attention-Guided Semantic Disruption) : un patch adversarial imprimable, optimisé par Expectation-over-Transformation pour rester efficace sous différents angles et éclairages, qui détourne vers lui-même l'attention conditionnée par l'action des politiques Vision-Language-Action (VLA), au détriment des régions pertinentes pour la tâche. Sur le benchmark de manipulation LIBERO, ce patch fait grimper le taux d'échec du modèle OpenVLA à 100%. Face à cette menace, les auteurs proposent SARF (Structure-Aware Robust Fine-Tuning), une défense qui ne réentraîne que l'encodeur visuel via trois mécanismes (ancrage de features, correction de l'attention critique pour la politique, cohérence géométrique guidée par le langage), sans aucun surcoût en inférence. SARF ramène le taux d'échec sous attaque entre 14,2% et 56,8% selon les suites de tâches (28,6% en moyenne), tout en préservant les performances en conditions normales. Sur un bras manipulateur réel PiPER, le taux de succès sous attaque passe de 23,0% à 65,0% grâce à cette défense. Cette étude révèle une faille de sécurité physique largement absente des benchmarks habituels des modèles VLA, ces politiques génériques censées piloter bras industriels, AMR et humanoïdes à partir d'instructions en langage naturel. Qu'un simple autocollant imprimé fasse chuter le taux de réussite à zéro, et que l'attaque transfère entre tâches et architectures différentes, suggère une vulnérabilité structurelle plutôt qu'un défaut isolé d'OpenVLA. Pour les intégrateurs et décideurs B2B qui envisagent des déploiements sur ligne de production ou en environnement partagé avec des humains, l'évaluation de la robustesse adversariale physique devient aussi nécessaire que les tests classiques de précision ou de temps de cycle. L'absence de surcoût en inférence fait de SARF une piste de mitigation réaliste pour des systèmes déjà contraints en latence. OpenVLA, cible principale de l'étude, compte parmi les politiques vision-language-action open source les plus utilisées depuis 2024, aux côtés de modèles comme Pi-0 de Physical Intelligence, GR00T de NVIDIA ou Helix de Figure. LIBERO sert de référence standard pour évaluer la généralisation des politiques de manipulation en simulation, et ce travail prolonge une littérature déjà ancienne sur les patchs adversariaux physiques en vision par ordinateur, longtemps étudiés contre les systèmes de conduite autonome, désormais transposée aux politiques robotiques génériques. Les auteurs ne mentionnent aucun partenariat industriel ni calendrier de déploiement : il s'agit d'une contribution de recherche en sécurité, publiée en amont de toute adoption commerciale à grande échelle des VLA sur des lignes de production.

UEAucune entreprise ou institution française/européenne n'est citée, mais tout intégrateur européen envisageant un déploiement de politiques VLA en environnement industriel ou partagé avec des humains devrait intégrer ce type de test de robustesse adversariale physique.

IA physiqueActu
1 source
Principes de l'autonomie robotique
13arXiv cs.RO 

Principes de l'autonomie robotique

Un nouveau manuel intitulé "Principles of Robot Autonomy" vient d'être publié sur arXiv (2608.03496v1, début août 2026). L'ouvrage est issu de plusieurs décennies d'enseignement à Stanford et propose une introduction unifiée aux méthodes qui composent les piles logicielles d'autonomie robotique modernes, de la perception à la planification en passant par le contrôle. Chaque chapitre est accompagné de notebooks Jupyter et d'exercices d'implémentation, pensés pour que les lecteurs construisent une intuition pratique en parallèle des fondements théoriques. Le texte s'adresse aux étudiants, ingénieurs et chercheurs qui entrent dans le domaine, et vise explicitement à faire le pont entre la robotique classique (odométrie, SLAM, planification de trajectoire, commande) et ce que les auteurs appellent l'IA physique, c'est à dire les architectures d'apprentissage qui pilotent aujourd'hui les robots déployés sur route, en entrepôt, dans les airs ou en environnement spatial. L'intérêt de ce manuel dépasse le cadre académique. Il acte un changement de statut de l'autonomie robotique, qui n'est plus seulement un sujet de recherche mais un ensemble de méthodes éprouvées sur le terrain, utilisées quotidiennement par des praticiens. Pour les ingénieurs et les décideurs B2B qui recrutent ou forment des équipes robotique, disposer d'un cadre conceptuel commun, couvrant aussi bien les fondamentaux classiques que les briques modernes d'IA physique, répond à un vrai manque : la formation universitaire peine souvent à suivre le rythme d'un secteur où les modèles VLA (vision language action) et les stacks d'autonomie évoluent plus vite que les programmes d'enseignement. Ce manuel s'inscrit dans une lignée de références historiques de la robotique universitaire, à un moment où le secteur connaît une accélération commerciale sans précédent, portée par des architectures d'IA physique et des humanoïdes déployés en usine ou en entrepôt par plusieurs acteurs industriels. Ce contexte de bascule rapide entre recherche et déploiement réel rend d'autant plus utile un ouvrage qui structure les principes fondamentaux plutôt que de courir après chaque nouvelle démonstration. Le texte ne mentionne pas de suite ou de version imprimée prévue au delà de cette publication arXiv.

RecherchePaper
1 source
La start-up chinoise d'IA physique a-t-elle manipulé un classement mondial pour battre Nvidia ?
14SCMP Tech 

La start-up chinoise d'IA physique a-t-elle manipulé un classement mondial pour battre Nvidia ?

Une start-up chinoise d'IA physique basée à Hangzhou, dans la province du Zhejiang, s'est brièvement retrouvée en tête d'un classement mondial de robotique avant que la polémique n'éclate sur la manière dont elle y est parvenue. Fondée en 2024, Spirit AI a vu son modèle Spirit v1.6 dépasser en juin le géant américain Nvidia au sommet de RoboArena, un benchmark de référence pour évaluer les systèmes d'IA physique. Ce classement, censé mesurer objectivement les performances de modèles robotiques face à des tâches réelles, a rapidement suscité des soupçons de manipulation autour de la méthode utilisée par Spirit AI pour obtenir ce score, sans que les détails techniques de l'accusation soient encore pleinement établis publiquement. Cet épisode illustre la tension qui traverse la course sino-américaine à l'IA physique et l'humanoïde: au-delà des annonces spectaculaires, la fiabilité des benchmarks censés arbitrer objectivement entre laboratoires devient elle-même un enjeu stratégique. Si un classement mondial peut être influencé ou contourné, c'est toute la crédibilité des comparaisons entre modèles comme Spirit v1.6, les futures itérations de Nvidia, ou d'autres VLA (vision-language-action) concurrents qui s'en trouve fragilisée, un problème direct pour les intégrateurs et décideurs B2B qui s'appuient sur ces classements pour choisir une pile technologique. L'affaire s'inscrit dans une compétition plus large entre laboratoires chinois et américains sur l'IA incarnée, où Pékin pousse activement ses start-ups de robotique humanoïde et physique à rivaliser avec les géants américains comme Nvidia sur le terrain de la performance mesurable, autant que sur celui du déploiement commercial.

Chine/AsieActu
1 source
IA physique : TravKAN, une analyse rapide et interprétable de la franchissabilité par réseaux de Kolmogorov-Arnold
15arXiv cs.RO 

IA physique : TravKAN, une analyse rapide et interprétable de la franchissabilité par réseaux de Kolmogorov-Arnold

Chercheurs en robotique mobile, une nouvelle architecture baptisée TravKAN vise à résoudre un compromis classique en robotique autonome : celui entre précision et interprétabilité pour l'analyse de traversabilité, c'est-à-dire l'estimation en temps réel de la capacité d'un robot à franchir un type de terrain donné. Publié le 2 août 2026 sur arXiv (référence 2608.02320v1), le papier s'appuie sur les Kolmogorov-Arnold Networks (KAN), une architecture qui remplace les poids fixes des réseaux de neurones classiques par des fonctions univariées apprenables, ce qui permet d'extraire après entraînement une expression analytique symbolique du modèle, baptisée TravKAN-Lite. Les auteurs introduisent aussi un jeu de descripteurs manuels construits à partir du canal de réflectivité des capteurs LiDAR, une information jusqu'ici peu exploitée alors qu'elle renseigne sur la nature et l'état de surface du sol, en complément des données géométriques habituelles. Le système a été testé sur des jeux de données publics couvrant des environnements urbains et tout-terrain réels, face à des références solides comme les réseaux profonds et XGBoost. Sur le plan des résultats, TravKAN dépasse les modèles profonds conventionnels et s'approche des performances de XGBoost, tout en conservant une architecture compacte et un temps de calcul compatible avec un usage embarqué temps réel. L'enjeu dépasse la seule performance brute : dans les systèmes robotiques amenés à prendre des décisions de sécurité, comme éviter un obstacle ou refuser de s'engager sur un terrain instable, la capacité à inspecter et comprendre pourquoi un modèle a estimé qu'un terrain est franchissable ou non devient un critère d'adoption à part entière, notamment pour la certification et le déploiement en conditions réelles chez les intégrateurs. Les études d'ablation menées par les auteurs confirment la robustesse du modèle face à des variations architecturales et quantifient l'apport spécifique des descripteurs de réflectivité. Le travail s'inscrit dans la lignée des recherches récentes sur les KAN, une alternative aux perceptrons multicouches proposée fin 2024 pour offrir une meilleure interprétabilité tout en gardant une capacité d'approximation comparable. Jusqu'ici, l'analyse de traversabilité reposait presque exclusivement sur des réseaux profonds ou des arbres de décision boostés par gradient, performants mais opaques. TravKAN se positionne comme une alternative analytique déployable, sans annonce de partenariat industriel ni de calendrier de déploiement à ce stade : il s'agit d'un résultat de recherche académique, à confirmer par une adoption ultérieure sur des plateformes robotiques réelles.

RecherchePaper
1 source
Positionnels aveugles : détecter et corriger les angles morts des modèles vision-langage-action
16arXiv cs.RO 

Positionnels aveugles : détecter et corriger les angles morts des modèles vision-langage-action

Les modèles Vision-Language-Action (VLA), utilisés pour la manipulation robotique, sont généralement évalués par un taux de réussite agrégé sur des configurations d'objets prédéfinies, une méthode qui suppose implicitement une compétence uniforme sur tout l'espace de travail. Une équipe de recherche montre que cette hypothèse est fausse : même en gardant l'instruction et tous les autres paramètres de la scène identiques, le simple déplacement d'un objet distracteur sans rapport avec la tâche peut faire grimper brutalement le taux d'échec dans des zones localisées et spatialement cohérentes, baptisées "Positional Blind Spots" (PBS, angles morts positionnels). Les chercheurs proposent un cadre en deux étapes, en boîte noire : d'abord un quadrillage de l'espace de travail combiné à un test du rapport de vraisemblance unilatéral pour localiser les cellules à risque élevé, puis un fine-tuning ciblé par LoRA sur des démonstrations collectées dans ces zones. Testé sur cinq politiques VLA de référence et deux benchmarks, le framework révèle des angles morts systématiques, avec des taux d'échec atteignant 0,58 dans certaines cellules. Leur stratégie de recherche atteint un F1-score de 0,678, contre une recherche aléatoire (+0,268) et un échantillonnage adaptatif (+0,178). Le fine-tuning ciblé réduit ensuite le taux d'échec global de 40,00 % à 85,19 %. Ce résultat interroge une pratique d'évaluation largement admise dans le secteur : un taux de réussite agrégé peut masquer des faiblesses spatiales très concentrées, dangereuses en usage réel où la position des objets varie constamment. Pour un intégrateur ou un ingénieur déployant un bras robotique piloté par VLA en entrepôt ou en usine, cela signifie qu'un score de succès global ne garantit rien sur la fiabilité à un endroit précis du poste de travail, et qu'un audit spatial devient nécessaire avant mise en production. C'est aussi un rappel que le "sim-to-real solved" claim de certains labos VLA reste à nuancer : la généralisation spatiale, même sur des tâches simples, n'est pas acquise. Le papier (arXiv:2608.01573v1) s'inscrit dans la vague récente de modèles VLA généralistes (RT-2, OpenVLA, Pi-0, GR00T N2, Helix) évalués presque exclusivement par taux de succès global. Aucun acteur français ou européen n'est cité dans cette étude académique. La méthode se positionne comme un outil de diagnostic et de correction ciblée, potentiellement intégrable en amont du déploiement industriel plutôt que comme un nouveau modèle concurrent.

RecherchePaper
1 source
VLAGuard : un cadre pour évaluer et atténuer le détournement d'attention physique dans les robots vision-langage-action au sein des réseaux de capteurs sans fil
17arXiv cs.RO 

VLAGuard : un cadre pour évaluer et atténuer le détournement d'attention physique dans les robots vision-langage-action au sein des réseaux de capteurs sans fil

Des chercheurs ont présenté VLAGuard, un cadre destiné à évaluer et corriger une faille critique des robots Vision-Language-Action (VLA) déployés comme nœuds mobiles au sein de réseaux de capteurs sans fil (WSN) : le détournement de l'attention croisée action-vision par des patchs adversariaux physiques. Le papier introduit d'abord un module de stress-test, VASA (Visuomotor Attention-guided Semantic Attack), qui utilise de simples patchs imprimables pour perturber gravement le mécanisme d'attention croisée conditionné par l'action, c'est-à-dire la fonction qui relie ce que le robot voit à ce qu'il doit faire. Face à cette vulnérabilité, les auteurs proposent une défense baptisée APFT (Attention-Protective Fine-Tuning), qui stabilise l'attention spatiotemporelle et impose une cohérence géométrique, sans coût de calcul supplémentaire à l'inférence. Testée sur le modèle OpenVLA, cette méthode fait chuter le taux d'échec de 100,0 % à 25,9 % dans les simulations LIBERO. Sur 2 000 essais réels menés dans des environnements intelligents assistés par WSN, APFT fait grimper le taux de réussite moyen de 23,0 % à 67,4 % face à des attaques par patch sévères. Ce résultat expose une faiblesse peu documentée des architectures VLA à grande échelle : leur dépendance à des mécanismes d'attention visuelle facilement manipulables par un simple autocollant imprimé, sans accès numérique au système. Pour les intégrateurs et décideurs qui envisagent de déployer des robots pilotés par VLA en usine, en entrepôt ou dans des environnements connectés en tant que nœuds de capteurs, le taux d'échec de 100 % sous attaque non protégée rappelle que la robustesse des politiques génératives reste loin d'être acquise, même quand les démonstrations en conditions contrôlées paraissent convaincantes. Le fait qu'une contre-mesure sans surcoût d'inférence ramène le taux de réussite à environ deux tiers en conditions réelles, sans l'approcher des 100 %, illustre autant le potentiel que les limites actuelles des défenses par fine-tuning face à des attaques physiques bien conçues. Ce travail s'inscrit dans un courant de recherche croissant sur la sécurité adversariale des modèles VLA, une famille d'architectures (à l'image de Pi-0, GR00T N2 ou Helix) qui gagne du terrain dans la robotique commerciale grâce à sa capacité à traduire des instructions en langage naturel en actions motrices. Jusqu'ici, la plupart des travaux sur la robustesse de ces modèles ciblaient les perturbations numériques ou les échecs de généralisation, laissant de côté les attaques physiques visant spécifiquement les mécanismes d'attention. VLAGuard ouvre la voie à des protocoles d'évaluation standardisés pour ce type de menace, avec des extensions probables à d'autres architectures VLA et à des scénarios d'attaque plus variés que le simple patch imprimé.

RechercheActu
1 source
Modèle du monde critique pour l'apprentissage par renforcement vision-langage-action (WCM)
18arXiv cs.RO 

Modèle du monde critique pour l'apprentissage par renforcement vision-langage-action (WCM)

Des chercheurs ont publié fin juillet 2026 un article arXiv (2607.29613) présentant le World Critic Model (WCM), une nouvelle architecture pour l'apprentissage par renforcement (RL) appliqué aux modèles Vision-Language-Action (VLA) utilisés en manipulation robotique. Le problème ciblé est celui des méthodes RL à base de critique, qui évaluent la valeur d'une action à partir d'une seule image ou d'un seul instant du flux visuel, un choix mal adapté au contrôle robotique où l'observation est par nature partielle et séquentielle. Bâti sur une architecture légère dérivée de LeJEPA, WCM prédit conjointement l'état latent futur de la scène et estime la valeur de l'action, ce qui force le critique à apprendre la dynamique temporelle plutôt qu'à simplement régresser un score. Le système s'intègre aux pipelines on-policy et off-policy et fonctionne avec les backbones VLA de référence Pi0, Pi0.5 et OpenVLA-OFT. Les auteurs rapportent des résultats état de l'art sur 149 tâches réparties sur quatre benchmarks, avec des gains marqués en généralisation hors distribution, ainsi qu'une validation sur sept tâches de manipulation réelles combinant OpenVLA-OFT et Pi0.5 en RL off-policy. L'enjeu dépasse la seule performance chiffrée: le RL post-entraînement des modèles VLA est aujourd'hui l'un des leviers les plus regardés pour fiabiliser les politiques robotiques au-delà de l'imitation pure, mais les critiques scalaires classiques peinent justement là où le contrôle réel exige de la mémoire et de l'anticipation. Si les gains de généralisation se confirment en dehors du cadre des benchmarks académiques, WCM pourrait devenir un composant standard pour les équipes qui affinent des VLA en production plutôt qu'une simple curiosité de laboratoire, en particulier pour les intégrateurs qui cherchent à réduire l'écart entre démonstration en simulation et déploiement réel. L'article s'inscrit dans la lignée des travaux récents sur l'apprentissage par prédiction de représentations latentes (JEPA, popularisé par Meta AI) appliqués à la robotique, et complète les approches critic-based existantes du RL pour VLA. Les auteurs ne précisent pas de plan de mise en open source ni de calendrier d'intégration dans des stacks robotiques commerciales; l'étape suivante logique serait une validation à plus grande échelle sur des plateformes industrielles.

RechercheActu
1 source
KUKA déploie sa plateforme de gestion de l'automatisation pour les constructeurs automobiles nord-américains
19Robotics Business Review 

KUKA déploie sa plateforme de gestion de l'automatisation pour les constructeurs automobiles nord-américains

KUKA AG a annoncé cette semaine le déploiement de sa plateforme d'orchestration Automation Management Platform (AMP) sur le site de KUKA Toledo Production Operations (KTPO), dans l'Ohio. Cette usine de 31 122 m² compte parmi les plus grands sites de fabrication automobile d'Amérique du Nord : elle produit plus de 300 carrosseries de véhicules par jour, soit une toutes les deux minutes, et a déjà assemblé plus de 2 millions de caisses en blanc depuis 2006, date à laquelle elle a commencé à produire celles du Jeep Wrangler (rejoint par le Jeep Gladiator en 2019). Le site s'appuie sur 285 robots et plus de 60 000 appareils connectés. AMP, présentée initialement lors de la conférence NVIDIA GTC 2026, est conçue comme une plateforme API ouverte et modulaire qui connecte l'infrastructure d'automatisation existante à des couches de décision pilotées par l'IA, avec un premier périmètre centré sur les robots mobiles autonomes (AMR). Selon Marc Fleischmann, directeur logiciel et IA de KUKA Group, l'outil doit permettre aux fabricants d'intégrer leurs propres modèles d'IA et de les généraliser en production via une couche de contexte partagée, en analysant en continu les données opérationnelles. Le point notable, que le communiqué de KUKA minimise, est que ce déploiement à KTPO correspond en réalité à un test en version alpha, et non à une bascule complète de l'usine vers un pilotage par IA. Le discours sur une "nouvelle ère" de la fabrication doit donc être lu avec prudence : il s'agit d'une preuve de concept sur un site pilote, pas d'un basculement industriel généralisé. Cela dit, l'initiative illustre une tendance de fond chez les grands intégrateurs industriels (KUKA, mais aussi ABB, Siemens ou Fanuc sur des approches voisines) qui cherchent à superposer une couche logicielle d'IA à des parcs de robots déjà installés plutôt que de tout remplacer, un positionnement pragmatique pour des clients automobiles réticents à interrompre des lignes de production à haut volume. KUKA, filiale historique du groupe chinois Midea depuis son rachat en 2016, emploie plus de 3 400 personnes aux États-Unis entre ingénierie, fabrication, développement logiciel et intégration systèmes. L'annonce s'inscrit dans la vague plus large de "physical AI" mise en avant par NVIDIA lors de GTC 2026, où plusieurs acteurs de l'automatisation industrielle et de la robotique ont présenté des couches d'orchestration IA similaires. KUKA n'a pas précisé de calendrier pour étendre AMP au delà des AMR ni pour généraliser son déploiement à d'autres usines après la phase de test à Toledo.

IndustrielOpinion
1 source
FedEx étend le déploiement de l'IA physique de Dexterity pour le chargement autonome de remorques
20Robotics & Automation News 

FedEx étend le déploiement de l'IA physique de Dexterity pour le chargement autonome de remorques

FedEx et le spécialiste de l'automatisation d'entrepôt Dexterity ont annoncé l'extension de leur collaboration pour déployer à plus grande échelle le modèle du monde Foresight et le système de chargement de remorques Mech de Dexterity, au hub FedEx de Hagerstown, dans le Maryland. Ce déploiement s'appuie sur plusieurs années de développement conjoint, de tests et de validation opérationnelle, et dépasse le site pilote initial sur lequel le partenariat avait été testé jusqu'ici. Le système Mech utilise la perception et la planification de mouvement pilotées par IA pour charger automatiquement des colis dans des remorques, une tâche traditionnellement manuelle, répétitive et physiquement éprouvante dans la logistique du dernier kilomètre. Cette extension marque un signal important pour le secteur : elle indique que la technologie de Dexterity dépasse le stade du pilote isolé pour entrer dans une phase de déploiement multi-sites chez un opérateur logistique majeur. Pour les intégrateurs et décideurs B2B de l'automatisation d'entrepôt, c'est une validation concrète que les systèmes robotiques pilotés par IA pour la manutention peuvent tenir la distance en conditions réelles, au-delà de la démonstration contrôlée, sur des cycles de production à haut volume. Dexterity, fondée par d'anciens chercheurs de Stanford et X (Google), s'est positionnée depuis plusieurs années sur l'automatisation de tâches de manutention complexes en entrepôt, en concurrence avec des acteurs comme Pickle Robot, également actif sur le chargement et déchargement automatisé de remorques. Le partenariat avec FedEx, engagé depuis plusieurs années, illustre la stratégie du transporteur d'intégrer progressivement la robotique dans ses hubs, avec Hagerstown comme nouvelle étape avant d'éventuels déploiements supplémentaires.

IndustrielActu
1 source
Un CTO cadet chinois lance une plateforme d'IA physique, lève plus de 100 millions de yuans en seed auprès de Yunqi et SenseTime
2136Kr 

Un CTO cadet chinois lance une plateforme d'IA physique, lève plus de 100 millions de yuans en seed auprès de Yunqi et SenseTime

Quantum Dynamics (昆腾动力), startup chinoise fondée au premier semestre 2026, vient de boucler un tour d'amorçage dépassant 100 millions de yuans (environ 14 millions de dollars, montant exact non précisé), mené par Yunqi Capital et SenseTime, avec la participation de Duowei Capital à l'incubation et à la construction de l'équipe. Les fonds financeront la R&D en Physical AI, le recrutement et l'expansion internationale. Le fondateur et CEO, Li Qiang, a passé dix-sept ans chez Alibaba : CTO de Cainiao Group, puis CTO de la division commerce international du groupe, tout en dirigeant simultanément l'unité de véhicules autonomes de Cainiao, à la tête d'équipes R&D de plusieurs milliers de personnes réparties dans le monde, avec des partenariats noués avec les services postaux de 200 pays. L'entreprise cible l'entrepôt logistique comme point d'entrée : en 2026, réapprovisionnement, picking et emballage dans des entrepôts B2C et e-commerce de taille moyenne, en priorité sur des SKU standardisés de cosmétique et pharmacie, en mode mixte humain-robot ; en 2027, extension vers des sites de messagerie plus complexes, puis les lignes de production industrielle, le commerce de détail, le tri pharmaceutique, les services commerciaux et, à terme, l'assistance à domicile. Cette annonce illustre un basculement plus large de la course au Physical AI, désormais jugée sur la profondeur des données réelles collectées plutôt que sur la taille des modèles. Selon IDC, les dépenses des utilisateurs chinois en robots à intelligence incarnée devraient dépasser 1,4 milliard de dollars en 2025 et atteindre 77 milliards de dollars en 2030, soit une croissance annuelle moyenne de 94 %. Le pari de Quantum Dynamics repose sur un constat simple : contrairement au texte ou à l'image, les données du monde physique ne peuvent pas être aspirées en masse sur le web. Celui qui déploie le plus de robots réels en premier accumule donc un avantage propriétaire en données, une logique que Li Qiang compare explicitement à celle de Tesla FSD ou de Claude, où l'échelle du parc déployé nourrit un apprentissage par renforcement en boucle continue. Pour les intégrateurs et décideurs B2B, le signal est clair : plutôt que d'attendre un modèle généraliste abouti, l'entreprise mise sur une commercialisation étroite et rapide en entrepôt pour amorcer sa boucle de données, un pari sur l'exécution plus que sur la démonstration. Le contexte est celui d'un salon WAIC 2026 qui vient de s'achever, où les démonstrations spectaculaires de robots dansant ou faisant des saltos attirent toujours les foules, mais où les stands reproduisant des lignes d'usine automobile ou de tri logistique concentrent désormais tout autant l'attention, signe d'un secteur qui bascule du spectacle vers l'exploitation réelle. Li Qiang incarne un profil de fondateur distinct des deux archétypes dominants du secteur, issus soit de la conduite autonome soit de laboratoires de recherche de pointe type Neo Lab : son bagage vient de l'opérationnel logistique et international. Aucun acteur français ou européen n'apparaît dans cette opération. À ce stade, il s'agit d'une levée d'amorçage adossée à une stratégie et une architecture technique détaillées (modèle monde-action, correction en temps réel, apprentissage par renforcement en flotte) mais sans volumes de déploiement ni noms de clients pilotes rendus publics.

Chine/AsieActu
1 source
5 plateformes d'infrastructure pour l'IA physique qui façonnent la robotique en 2026
22Robotics Business Review 

5 plateformes d'infrastructure pour l'IA physique qui façonnent la robotique en 2026

NVIDIA reste l'acteur le plus fondamental de l'infrastructure IA physique, avec sa suite Isaac qui couvre simulation, apprentissage robotique, modèles de fondation et évaluation de politiques : Isaac Sim pour la simulation physique, Isaac Lab pour l'entraînement de modèles de fondation, Isaac GR00T pour le développement humanoïde généraliste, et Isaac Lab-Arena pour l'évaluation de politiques à grande échelle accélérée par GPU. Au niveau physique, le moteur Newton, développé avec Google DeepMind et Disney Research et géré par la Linux Foundation, est un moteur open source accéléré par GPU couvrant contacts, friction, dynamique des corps rigides et souples, actionneurs et capteurs. Deuxième acteur cité, Applied Intuition, né pendant l'ère des véhicules autonomes, propose désormais une plateforme d'ingénierie de validation pour machines autonomes couvrant automobile, défense, poids lourds, mines, construction et agriculture. Cette montée en puissance illustre un basculement structurel : l'infrastructure de l'IA physique ne se résume plus au calcul brut comme pour les grands modèles de langage, mais devient un empilement de couches interdépendantes, allant des démonstrations réelles à la simulation physique en passant par les données synthétiques et l'entraînement de politiques. Pour un robot, entraîner un modèle ne suffit pas : il faut prouver qu'il tiendra dans des conditions réelles coûteuses, dangereuses ou impossibles à reproduire physiquement à répétition, ce qui explique l'émergence de la validation comme discipline d'ingénierie à part entière, distincte du simple entraînement de modèles. L'avantage stratégique de NVIDIA ne tient pas à un produit isolé mais à sa capacité à relier calcul, génération de mondes virtuels, physique, données synthétiques, entraînement et déploiement embarqué au sein d'un même écosystème, ce qui en fait le substrat de développement le plus proche d'un standard commun pour le secteur. Reste une question ouverte : l'entreprise gardera-t-elle cet écosystème ouvert, ou l'orientera-t-elle davantage vers son propre matériel et ses propres logiciels, au risque de devenir une plateforme verticalement intégrée plutôt qu'un substrat neutre. Sur le plan historique, NVIDIA a construit sa position en remontant progressivement de l'accélération matérielle vers la simulation, les modèles de fondation et l'évaluation, tandis qu'Applied Intuition a capitalisé sur son expertise acquise durant l'essor des véhicules autonomes pour l'étendre à l'ensemble des machines autonomes physiques. Ces deux plateformes ne représentent que deux des cinq points de contrôle identifiés dans la chaîne émergente de l'IA physique, les trois autres couvrant les opérations sur les données, l'outillage open source et l'apprentissage continu, des segments que la course à l'humanoïde et à l'automatisation industrielle devrait faire converger dans les prochains mois.

InfrastructureActu
1 source
Mimic Robotics déploie ses « modèles vision-action de pointe » sur la chaîne de production Audi
23Robotics & Automation News 

Mimic Robotics déploie ses « modèles vision-action de pointe » sur la chaîne de production Audi

Robots industriels apprenant des tâches complexes chez Audi ? Voici le résumé factuel de 200-250 mots, sans invention de chiffres absents du communiqué. --- mimic robotics, entreprise suisse de « physical AI » spécialisée dans les Video-Action Models (VAM) pour l'automatisation industrielle, présente FLUX-mimic, un nouveau modèle développé avec Black Forest Labs, le laboratoire allemand connu pour ses modèles de génération d'image FLUX. Le système est censé permettre à des bras robotiques d'apprendre et d'exécuter des tâches de manipulation complexes directement en environnement d'usine, avec une mise en avant explicite d'un déploiement chez Audi. Le communiqué de mimic reste toutefois vague sur les aspects techniques concrets : aucun chiffre communiqué sur le payload, les degrés de liberté, le temps de cycle ou le nombre de sites équipés, ce qui invite à la prudence tant qu'aucune démonstration indépendante n'est disponible. Si la promesse se confirme, l'enjeu dépasse la simple vitrine technologique : faire fonctionner un modèle vision-langage-action dans une usine automobile, environnement réputé exigeant en précision et en fiabilité, constituerait un signal fort pour les intégrateurs industriels cherchant à dépasser le stade de la démonstration en laboratoire. Cela toucherait directement au débat sur l'écart entre annonces spectaculaires et réalité opérationnelle qui traverse le secteur de la robotique dexterous. mimic robotics développe depuis plusieurs années des modèles de manipulation robotique par apprentissage, et ce partenariat avec Black Forest Labs, davantage connu pour la génération d'images que pour la robotique, marque une diversification notable. FLUX-mimic vient ainsi s'ajouter à une compétition déjà dense sur les modèles d'action généralistes, aux côtés de Pi-0 de Physical Intelligence, GR00T N2 de Nvidia ou Helix de Figure. Le communiqué ne précise pas de calendrier pour un déploiement élargi au-delà d'Audi.

UELe déploiement implique Audi et Black Forest Labs, deux entreprises allemandes, ce qui illustre une adoption concrète de modèles vision-action dans l'industrie automobile européenne, bien qu'aucune métrique vérifiable ne confirme l'ampleur réelle du déploiement.

FR/EU ecosystemeActu
1 source
Automatisation d'entrepôt et IA incarnée : Meituan, JD.com, ByteDance et Baidu accélèrent leur expansion dans le monde physique
24Pandaily 

Automatisation d'entrepôt et IA incarnée : Meituan, JD.com, ByteDance et Baidu accélèrent leur expansion dans le monde physique

Les géants technologiques chinois accélèrent massivement leur expansion vers le monde physique, transformant leurs plateformes numériques en infrastructures robotiques verticalement intégrées. Meituan a déployé sa flotte de robots de livraison autonomes qui a cumulé plusieurs millions de trajets sans intervention humaine, naviguant en zones piétonnes, aux passages routiers et jusqu'aux entrées d'immeubles en environnement urbain dense. L'entreprise a bâti une pile complète d'IA physique incluant véhicules de livraison autonomes, drones, robots de service en magasin et systèmes cloud de gestion de flotte. JD.com a de son côté intégré la robotique sur toute sa chaîne logistique, des chariots élévateurs autonomes en entrepôt jusqu'au routage optimisé par IA pour ses camions de livraison. Baidu poursuit le développement de ses robotaxis Apollo, qui ont accumulé des dizaines de millions de kilomètres de conduite autonome, tout en investissant dans l'IA incarnée et ses puces Kunlun. ByteDance a opté pour une stratégie de portefeuille, injectant des capitaux dans des startups de robotique humanoïde, de cobots et d'automatisation industrielle via son bras d'investissement et sa R&D interne. Alibaba exploite les robots logistiques Cainiao et son laboratoire de recherche DAMO, tandis que Tencent Robotics X travaille sur l'IA incarnée. Ce virage n'est pas anecdotique pour l'industrie robotique et les décideurs B2B. Il traduit un épuisement des relais de croissance du pur numérique en Chine, qui pousse les géants internet à chercher de la valeur dans une économie physique encore peu digitalisée. Il signale surtout que les progrès en perception, décision et actionnement rendent désormais l'automatisation du monde physique viable technologiquement et économiquement à grande échelle, un seuil que le secteur attendait depuis des années sans le franchir massivement. Les avantages structurels de ces plateformes, données massives, bases d'utilisateurs, capital disponible, se transposent directement à l'opérationnel physique, où l'optimisation par la donnée et les économies d'échelle jouent le même rôle que dans le numérique pur. Pour les intégrateurs et industriels traditionnels, cela signifie à la fois une pression concurrentielle accrue et de nouvelles opportunités de partenariat avec des acteurs data-natifs. Cette bascule s'inscrit dans une trajectoire longue: les plateformes de livraison et de logistique chinoises ont d'abord digitalisé leurs opérations avant de les automatiser physiquement, un mouvement que la maturation de l'IA rend aujourd'hui exécutable à l'échelle nationale. La compétition entre Meituan, JD.com, Baidu, Alibaba, ByteDance et Tencent structure désormais un marché où chacun bâtit sa propre pile physique-IA, sans consolidation apparente à ce stade. Les implications dépassent la Chine: la combinaison de capacités IA, d'échelle manufacturière et de volumes massifs de données de déploiement constitue un avantage compétitif que les acteurs occidentaux devront désormais prendre en compte dans leurs propres feuilles de route robotiques.

UEAucun acteur français ou européen n'est implique, mais la pression concurrentielle chinoise en IA physique incite les industriels et intégrateurs européens a accélérer leurs propres feuilles de route robotiques.

Chine/AsieOpinion
1 source
IA physique et gouvernance : de la théorie à la pratique sur tout le cycle de vie
25arXiv cs.RO 

IA physique et gouvernance : de la théorie à la pratique sur tout le cycle de vie

Voici l'article traduit et résumé, en trois paragraphes autonomes, sans titres ni tirets cadratins. Une équipe de chercheurs publie une synthèse complète sur la gouvernance de l'IA physique, ces systèmes d'intelligence artificielle qui, contrairement aux IA purement logicielles, perçoivent leur environnement, interagissent physiquement avec lui et coexistent directement avec des humains, comme les robots humanoïdes, les bras manipulateurs ou les véhicules autonomes. Le papier propose un cadre de gouvernance unifié organisé autour d'un cycle de vie en cinq étapes : recherche, conception, données, développement du modèle et déploiement. Pour chacune de ces étapes, les auteurs détaillent des pratiques concrètes de mise en œuvre, allant des contraintes de sécurité en temps réel à la gestion des interactions avec des environnements dynamiques et imprévisibles, en passant par les enjeux propres à la collecte et à l'usage des données issues de capteurs physiques. Cette contribution répond à un vide réel dans les cadres existants de gouvernance de l'IA, largement pensés pour des systèmes basés écran (chatbots, modèles de recommandation, génération de texte) et mal adaptés aux exigences des robots qui agissent physiquement sur le monde. Pour les intégrateurs, les fabricants de robots humanoïdes et les décideurs B2B qui déploient des systèmes comme des bras collaboratifs ou des plateformes mobiles autonomes en usine, l'absence de référentiel de gouvernance clair complique la certification, la conformité réglementaire et la gestion des risques liés à la sécurité humaine. Ce travail fournit un langage commun et une grille de lecture opérationnelle qui pourrait servir de base à de futures normes ou exigences réglementaires spécifiques à la robotique, distinctes de celles qui s'appliquent aux IA génératives. L'émergence de ce que les auteurs appellent la Physical AI s'inscrit dans une dynamique plus large où les modèles vision-langage-action (VLA) comme Pi-0, GR00T N2 ou Helix, ainsi que les plateformes humanoïdes de nouvelle génération, passent progressivement du stade de la démonstration à celui du déploiement réel en environnement industriel ou domestique. Alors que les questions de sécurité, de responsabilité juridique et d'acceptabilité sociale deviennent centrales à mesure que ces robots quittent les laboratoires pour les usines et les espaces partagés avec le public, ce cadre de gouvernance vise à orienter chercheurs, développeurs et régulateurs vers une conception plus rigoureuse et traçable. Les auteurs positionnent leur travail comme une référence structurante, invitant à des développements ultérieurs qui viendraient préciser des exigences sectorielles concrètes, secteur par secteur ou cas d'usage par cas d'usage.

RegulationReglementation
1 source
Chargement en 30 000 heures de données tactiles comble le fossé de l'IA incarnée : XinZhi Embodied et l'université Fudan publient trois rapports techniques sur la perception haptique
26Pandaily 

Chargement en 30 000 heures de données tactiles comble le fossé de l'IA incarnée : XinZhi Embodied et l'université Fudan publient trois rapports techniques sur la perception haptique

XinZhi Embodied et l'université Fudan ont publié conjointement trois rapports techniques consacrés à un maillon longtemps négligé de l'intelligence incarnée : le toucher. Alors que la vision et le langage progressent rapidement dans les modèles de manipulation robotique, la perception tactile reste en retard, alors qu'elle est indispensable pour saisir, assembler ou identifier des objets. La collaboration, basée à Shanghai, met à disposition 30 000 heures de données d'interaction tactile collectées sur de véritables opérations robotiques, destinées à entraîner des modèles capables de reconnaître texture, dureté, température et friction par le contact. Les trois rapports couvrent respectivement la conception et l'étalonnage des capteurs tactiles, la méthodologie de collecte de données à grande échelle, et l'entraînement de modèles de manipulation sensibles au toucher. L'approche matérielle combine plusieurs principes de transduction, capacitif, piézoélectrique et résistif, afin de capter à la fois la distribution statique de pression et les signaux vibratoires dynamiques lors du contact. La collecte a mobilisé plusieurs plateformes robotiques réalisant des tâches de préhension, de manipulation en main et d'exploration de surface sur des milliers d'objets aux matériaux, géométries et textures variés. Cette publication répond à un goulot d'étranglement largement identifié dans le secteur : les systèmes fondés uniquement sur la vision savent repérer un objet et planifier une trajectoire d'approche, mais échouent à juger la force de préhension nécessaire, à détecter un glissement ou à distinguer des matériaux au contact, des compétences que l'humain acquiert par des milliers d'heures d'interaction physique durant son développement. En ouvrant l'accès à un volume aussi important de données tactiles structurées, rare car leur collecte exige du matériel spécialisé, une annotation précise des événements de contact et un temps d'exploitation robotique prolongé, XinZhi Embodied et Fudan espèrent lever un frein concret à la commercialisation de robots capables de manipuler des objets variés en conditions réelles, au-delà des environnements contrôlés typiques des démonstrations actuelles. Cette initiative s'inscrit dans la tendance plus large de la perception multimodale en robotique, où la vision assure la conscience spatiale globale, le langage porte l'instruction de tâche, et le toucher fournit l'information locale nécessaire à une manipulation fine. Elle illustre aussi l'intégration croissante entre recherche académique et innovation entrepreneuriale dans l'écosystème chinois de l'intelligence incarnée, les résultats de recherche alimentant directement les cycles de développement produit. En ouvrant ces données à des chercheurs et développeurs tiers, XinZhi Embodied et Fudan University visent à accélérer l'émergence de capacités de manipulation tactile jusqu'ici hors de portée faute de données, dans un secteur où la course à l'autonomie manipulatoire s'intensifie face aux acteurs américains et européens.

RecherchePaper
1 source
NEURA Robotics crée NEURA Gym RWTH Aachen pour entraîner l'IA physique
27The Robot Report 

NEURA Robotics crée NEURA Gym RWTH Aachen pour entraîner l'IA physique

NEURA Robotics, fabricant allemand de robotique cognitive basé à Metzingen, a annoncé cette semaine un partenariat avec l'université RWTH Aachen pour créer le "NEURA Gym RWTH Aachen", une installation dédiée à l'entraînement de ses robots par données réelles. Le site sera implanté sur le Hightech Campus Melaten et couvrira environ 3 000 m². Il s'agit du premier maillon allemand d'un réseau de dix centres prévus en Europe, aux États-Unis et en Chine, dont la moitié devrait être opérationnelle d'ici fin 2026. Un second centre allemand ouvrira à l'aéroport de Munich, en collaboration avec la Technical University of Munich (TUM) et son Munich Institute of Robotics and Machine Intelligence (MIRMI) ; il s'étendra sur plus de 2 300 m² et testera des flottes de robots cognitifs et humanoïdes. Ce réseau de "gyms" est financé par la levée Série C de NEURA Robotics, qui a atteint jusqu'à 1,4 milliard de dollars, et alimentera directement Neuraverse, la plateforme de développement cloud ouverte de l'entreprise. L'enjeu affiché est celui de la rareté des données réelles pour l'entraînement des robots physiques : contrairement aux grands modèles de langage, entraînés sur des milliers de milliards de points de données, les robots ne disposent que d'une fraction de ce volume, et la simulation seule ne reproduit pas la friction, la variabilité et l'imprévisibilité d'un environnement réel. En combinant entraînement physique et simulation haute fidélité, NEURA cherche à générer des jeux de données multimodales exploitables à grande échelle, un problème central pour toute l'industrie de la robotique humanoïde et cognitive, où l'écart entre démonstration et déploiement réel reste l'un des principaux points de friction. Pour les intégrateurs et décideurs industriels, l'intérêt est de pouvoir valider un cas d'usage avant tout engagement de déploiement, réduisant le risque d'adoption. Des secteurs comme l'industrie manufacturière, l'automobile, la santé et l'automatisation industrielle ont déjà manifesté leur intérêt pour ces installations. NEURA Robotics, fondée en 2019 par David Reger, s'est fait connaître avec ses cobots MAiRA et son projet de robot humanoïde 4NE1. La stratégie de "gyms" physiques s'inscrit dans une tendance plus large du secteur, où plusieurs acteurs de la robotique humanoïde investissent dans des infrastructures dédiées à la collecte de données réelles pour entraîner leurs modèles vision-langage-action. Si l'installation d'Aachen n'existe pour l'instant que sous forme de rendu et de partenariat annoncé, NEURA prévoit une montée en puissance rapide, avec huit autres sites à ouvrir en Europe, aux États-Unis et en Chine, et une répartition des spécialités selon les partenaires académiques et industriels de chaque région.

UELe projet renforce l'écosystème robotique européen avec deux centres d'entraînement en Allemagne (RWTH Aachen et TUM Munich), positionnant l'Allemagne comme hub de collecte de données réelles pour l'IA physique en Europe.

FR/EU ecosystemeActu
1 source
Physical AI dans les hôpitaux : les protocoles cliniques comme spécifications de sécurité
28arXiv cs.RO 

Physical AI dans les hôpitaux : les protocoles cliniques comme spécifications de sécurité

Le mois d'AI: cet article ne concerne pas un robot humanoïde commercial mais une publication de recherche. Un article publié sur arXiv (référence 2607.19827v1, soumission nouvelle) propose de réinterpréter les "parcours de soins" (clinical pathways) hospitaliers comme des spécifications de sécurité exécutables pour l'IA physique déployée dans les services hospitaliers. Les auteurs conçoivent une architecture robotique conceptuelle qui unifie capteurs portables, dispositifs médicaux connectés et composants robotiques assistifs dans un même cadre de surveillance de sécurité en temps réel. Au cœur du système, un Runtime Safety Monitor (RSM) évalue en continu des signaux physiologiques et système multimodaux, en les comparant à des contraintes cliniques dérivées directement du protocole de soins prescrit au patient. Plutôt que de s'appuyer uniquement sur de la détection d'anomalies statistique, l'approche combine prédiction temporelle, raisonnement sous incertitude et vérification par contraintes pour repérer les violations de sécurité. Le RSM cible trois catégories d'événements : les écarts physiologiques par rapport au protocole prescrit, les pannes matérielles ou de communication, et les cas potentiels de falsification ou de mauvais usage des données. L'enjeu dépasse la robotique pure : c'est une tentative de combler le fossé entre perception basée sur l'apprentissage et garanties de sécurité vérifiables, un point de friction central pour tout déploiement d'IA physique en environnement critique. Pour les intégrateurs et décideurs hospitaliers, l'intérêt est de disposer d'un cadre où les contraintes de sécurité ne sont pas génériques mais ancrées dans la connaissance clinique spécifique à chaque patient, ce qui pourrait faciliter la certification et l'acceptation par le personnel soignant, souvent réticent face à des systèmes d'IA opaques. Le papier reste toutefois à un stade conceptuel : il s'agit d'une proposition d'architecture, pas d'un système validé cliniquement ni déployé en conditions réelles. Ce travail s'inscrit dans le champ émergent de la "Safe Physical AI", qui cherche à rendre les robots assistifs et dispositifs autonomes fiables dans des environnements où l'erreur a un coût humain direct, contrairement aux entrepôts ou usines. Contrairement aux approches génériques de détection d'anomalies utilisées en robotique industrielle, l'originalité ici est d'opérationnaliser des connaissances médicales spécifiques au domaine comme contraintes formelles. Les prochaines étapes attendues, non détaillées dans l'abstract, porteraient logiquement sur une implémentation prototype et des tests en environnement hospitalier simulé avant tout essai clinique réel.

RecherchePaper
1 source
Ant Group dévoile sa stratégie duale VLA et modèles d'action du monde pour l'IA physique, écosystème open source et défi des données
29Pandaily 

Ant Group dévoile sa stratégie duale VLA et modèles d'action du monde pour l'IA physique, écosystème open source et défi des données

Ant Group a fondé en décembre 2024 Ant LingBot, filiale à 100 % basée à Shanghai et bras armé du groupe dans l'IA physique, où plus de 90 % des effectifs sont titulaires d'un master ou d'un doctorat. Dirigée par le PDG Zhu Xing et le scientifique en chef Shen Yujun, l'entreprise a présenté six modèles d'IA incarnée en open source lors du WAIC 2026, couvrant vision, vidéo, perception spatiale, manipulation, modèles du monde et modèles d'action du monde. Sa stratégie technologique repose sur deux voies parallèles. La première, VLA (vision language action), incarnée par LingBot-VLA 2.0, suit l'architecture dominante du secteur, celle qu'utilisent aussi Figure ou la série RT de Google DeepMind. La seconde, portée par LingBot-VA 2.0, prédit l'évolution du monde avant de générer une action ; présenté comme le premier modèle d'action du monde nativement incarné du secteur, il est entraîné from scratch sur une architecture autorégressive atteignant 150 Hz d'inférence temps réel sur un seul GPU, avec tokenisation sémantique visuelle-action, pré-entraînement causal strict, architecture MoE et inférence asynchrone permettant au robot de prédire ses états futurs tout en exécutant l'action en cours, avec un temps de réponse de 6,7 millisecondes, contre 300 à 400 millisecondes pour un clignement d'œil humain. Plus d'une dizaine de fabricants ont noué des partenariats, dont Unitree Robotics, Xinghaitu et Leju Robotics, dont le KUAVO 4 Pro a été adapté à LingBot-VLA sur 95 scénarios de manipulation réels. LingBot commercialise aussi son propre robot de service, le Robbyant R1, destiné aux usages domestiques, à la santé et aux personnes âgées, mais dont les volumes livrés restent limités. Ce choix d'ouvrir intégralement poids, code, outils de post-entraînement et benchmarks d'évaluation, à un moment où les standards techniques de l'IA incarnée restent instables, vise à faire de LingBot une base logicielle partagée entre plateformes matérielles hétérogènes. Mais la principale contrainte du secteur demeure la donnée : contrairement aux LLM entraînés sur des billions de tokens textuels, les données d'interaction physique ne s'accumulent que par l'exploitation réelle de robots. LingBot compense en s'appuyant sur les données de ses partenaires (Unitree, Leju, Xinghaitu) plutôt qu'en opérant sa propre flotte, une dépendance qui fragilise sa position à mesure que ces mêmes partenaires développent leurs propres capacités IA. Cette approche intégrale, du modèle cerveau au modèle du monde jusqu'au déploiement matériel, distingue LingBot des autres géants technologiques chinois. Alibaba, Tencent, Huawei, JD.com et Meituan privilégient tous des stratégies plus ciblées, et Ant Group entre en outre en concurrence avec d'autres initiatives affiliées à Alibaba. LingBot constitue ainsi un test grandeur nature : une entreprise de la fintech peut-elle incuber une activité robotique viable, et l'open source combiné à l'emprunt de données suffira-t-il à surmonter les limites structurelles de l'IA incarnée ?

Chine/AsieOpinion
1 source
IA physique et robotique
30Robotics Business Review 

IA physique et robotique

Le Robot Report a mis en ligne un rapport gratuit intitulé « Physical AI and Robotics », compilant les témoignages d'experts du secteur qui développent et déploient de l'IA physique dans l'industrie. Le document souligne un changement structurel dans la robotique : après des années de programmation déterministe pour la navigation et la reconnaissance d'objets, les robots gagnent désormais en capacité de perception, de compréhension, de décision et d'action grâce à l'IA. Selon des chiffres du Wall Street Journal cités dans le rapport, les entreprises d'IA physique ont levé plus de 23 milliards de dollars de capital-risque depuis le début de l'année 2026. Les levées les plus importantes incluent la Série D de 16 milliards de dollars de Waymo, la Série C de 1,4 milliard de dollars de Skild AI, celle de même montant pour l'allemand NEURA Robotics, et le tour d'un milliard de dollars de Physical Intelligence. L'essentiel des financements cible les modèles de fondation, l'automatisation industrielle, ainsi que les véhicules autonomes et les humanoïdes. Ces montants confirment que l'IA physique est devenue une thèse d'investissement à part entière, et pas seulement un argument marketing pour vendre des robots. Pour les intégrateurs et décideurs industriels, le signal est clair : le capital afflue vers les modèles de fondation capables de généraliser d'une tâche à l'autre, plutôt que vers des solutions verticales figées, ce qui laisse présager une consolidation rapide autour de quelques plateformes dominantes. Le rapport pointe aussi une boucle de rétroaction inédite entre IA et robotique : les data centers hyperscale nécessaires à l'entraînement des modèles d'IA générative créent eux-mêmes une demande de robots capables de les construire et de les maintenir, ce qui tire la demande de calcul aussi bien côté cloud que côté edge, pour la simulation, l'orchestration de flottes et le raisonnement embarqué. Le rapport s'inscrit dans un débat plus large que Le Robot Report documente depuis plusieurs années sur la frontière entre automatisation spécialisée et intelligence artificielle générale : les interviewés y discutent notamment si les manipulateurs mobiles et les humanoïdes rapprochent réellement le secteur de l'AGI, ou si ce terme reste largement prématuré face aux limites persistantes des données spécifiques à chaque domaine. Il aborde également où trouver les jeux de données les plus utiles pour l'entraînement, et pourquoi la supervision humaine demeure incontournable. Il s'agit toutefois d'un contenu promotionnel à télécharger via formulaire, davantage une synthèse de tendances qu'une annonce produit ou un déploiement vérifié sur le terrain.

UELa levée de 1,4 milliard de dollars de l'allemand NEURA Robotics montre que l'écosystème européen de l'IA physique attire aussi des capitaux conséquents, même si l'essentiel des 23 milliards levés reste concentre aux Etats-Unis.

BusinessActu
1 source
Le boucle fermée de l'IA physique enfin réalité : Rimnot et Yuantu déploient 10 000 robots industriels pour la fabrication de serveurs
31Pandaily 

Le boucle fermée de l'IA physique enfin réalité : Rimnot et Yuantu déploient 10 000 robots industriels pour la fabrication de serveurs

Rimnot, jeune pousse chinoise de l'IA physique fondée il y a seulement quatre mois par des diplômés de doctorat de Tsinghua passés chez NIO, Huawei et AgiBot, a annoncé un partenariat stratégique avec Yuantu Future Technology pour déployer 10 000 robots industriels dédiés à la fabrication de serveurs. L'annonce, faite juste avant la conférence WAIC 2026, constitue l'un des engagements commerciaux les plus concrets jamais formulés dans le secteur de l'IA incarnée. Lors du salon, Rimnot a fait la démonstration de sa technologie sur une tâche d'assemblage de serveurs en conditions réelles : le robot a manipulé des composants de carte mère densément agencés, puces, connecteurs et pièces de précision, nécessitant la reconnaissance de plusieurs variantes de modèles ainsi qu'un contrôle précis de la force de préhension et du placement. Confrontée à un temps de mise en route limité sur le stand, avec un éclairage, une température et une disposition spatiale différents de son environnement habituel, l'équipe affirme que le robot a réalisé une adaptation complète à ce nouvel environnement en seulement 30 minutes d'entraînement. La technologie repose sur un modèle de fondation du monde physique censé assurer une boucle complète allant de la compréhension des processus et de la planification des tâches jusqu'à l'exécution et l'optimisation continue par retour d'expérience. Cette annonce doit être lue avec prudence : les 30 minutes d'adaptation et la démonstration sur stand restent des chiffres communiqués par l'entreprise elle-même, sans validation indépendante, et le déploiement de 10 000 unités demeure à ce stade un plan annoncé, non un produit livré. Elle n'en illustre pas moins un déplacement d'enjeu pour le secteur de la robotique humanoïde et de l'IA incarnée, longtemps critiqué pour multiplier des démonstrations spectaculaires sans traction commerciale réelle. Contrairement à l'IA numérique, où un modèle unique peut servir des centaines de millions d'utilisateurs, l'IA physique impose à chaque robot de s'adapter à un environnement, des objets et des gestes spécifiques, en tolérant des erreurs visuelles et des aléas que la simulation ne peut jamais entièrement anticiper. Si l'accord tient ses promesses à l'échelle de 10 000 unités, il pourrait fournir un modèle reproductible pour l'automatisation robotisée de l'électronique de précision, un marché que Rimnot évalue lui-même à plusieurs centaines de milliards de yuans. Le décalage entre les quatre mois qui séparent la création de l'entreprise et cet engagement de déploiement massif suggère, selon ses promoteurs, que le principal obstacle pour l'IA physique se déplace désormais de la technologie vers l'exécution des partenariats industriels, une lecture qui reste à confirmer sur le terrain. Yuantu Future Technology, partenaire industriel de l'opération, est un acteur mondial de la fabrication de serveurs et des infrastructures IA complètes, produisant serveurs IA, serveurs généralistes, commutateurs, super-nœuds et armoires à refroidissement liquide, avec une maîtrise intégrale de la chaîne allant de la R&D à la fabrication et au service. La fabrication de serveurs constitue un terrain d'essai particulièrement pertinent pour la robotique incarnée, car elle combine assemblage complexe, câblage, tests fonctionnels et contrôle qualité, avec une valeur industrielle suffisante pour justifier un déploiement à grande échelle. L'ambition affichée par les deux partenaires dépasse le simple remplacement d'une étape de production isolée : il s'agit de construire une opération robotisée en boucle fermée de bout en bout, Rimnot apportant les modèles du monde physique et les solutions de qualité industrielle, Yuantu les scénarios de production réels et l'expérience opérationnelle. Aucun acteur français ou européen n'apparaît dans cette collaboration, qui s'inscrit dans une compétition mondiale de plus en plus vive entre start-up chinoises de l'IA incarnée, à mesure que des sociétés comme AgiBot, dont sont issus certains fondateurs de Rimnot, tentent de traduire leurs avancées technologiques en contrats industriels concrets.

Chine/AsieActu
1 source
Huawei entre dans l'IA incarnée avec la plateforme CloudRobo : peut-elle répéter le miracle SERES de la voiture intelligente ?
32Pandaily 

Huawei entre dans l'IA incarnée avec la plateforme CloudRobo : peut-elle répéter le miracle SERES de la voiture intelligente ?

Huawei a franchi une étape décisive dans l'IA incarnée lors du WAIC 2026 en lançant la bêta publique de CloudRobo, une plateforme complète de développement pour robots intelligents. La stratégie positionne le groupe chinois comme fournisseur de "cerveau robotique" plutôt que comme fabricant, calquant l'approche qui a fait le succès de SERES/AITO dans l'automobile électrique. Plus de 20 entreprises, dont Youibot et Huayan Robotics, ont déjà rejoint CloudRobo comme partenaires initiaux. La plateforme repose sur trois piliers : une base de données de niveau pétaoctet fournissant des millions d'actifs prêts à l'emploi, un moteur cloud de production de modèles s'appuyant sur la série de modèles Pangu pour l'IA incarnée exécutés sur puces Ascend, et un système de simulation et d'évaluation baptisé Real-Sim, développé en interne. Les développeurs accèdent à plus de 20 modèles optimisés pour Ascend et peuvent, selon Huawei, connecter un robot au cloud en quelques heures et déployer un modèle en quelques minutes, couvrant toute la chaîne allant de la collecte de données à l'intégration matérielle. La logique stratégique reprend celle éprouvée dans l'automobile : Huawei avait fourni la conduite intelligente, le cockpit connecté et la motorisation électrique à SERES, qui est ainsi passé de constructeur inconnu à marque premium, le modèle M9 devenant le véhicule le plus vendu du segment au-dessus de 500 000 yuans. La même division du travail s'applique désormais à la robotique : Huawei fournit le système d'exploitation intelligent, la plateforme cloud et les modèles fondation, tandis que les fabricants se concentrent sur le matériel et les applications verticales où ils ont l'expertise métier. La marge brute de 79,8% sur l'activité contrôleurs, contre 38,4% sur le matériel, illustre le pari sur la valeur logicielle. Ce choix intervient alors que les capacités de contrôle moteur ont largement convergé entre fabricants, faisant du "cerveau" le principal facteur de différenciation, et alors que le secteur, fragmenté entre bras industriels, robots de service, quadrupèdes et humanoïdes, souffrait d'un développement artisanal coûteux en ressources. La transposition du modèle automobile à la robotique reste toutefois incertaine : les véhicules sont hautement standardisés, alors que les robots couvrent des formes et exigences très hétérogènes. Huawei dispose néanmoins déjà de M-Robots OS sur OpenHarmony et revendique une influence sur plus de 15 startups d'IA incarnée fondées par d'anciens salariés du groupe, signe d'un rayonnement dépassant CloudRobo lui-même.

Chine/AsieOpinion
1 source
RobustVLA : robustesse d'un modèle vision-langage-action face aux perturbations multimodales
33arXiv cs.RO 

RobustVLA : robustesse d'un modèle vision-langage-action face aux perturbations multimodales

RobustVLA s'attaque à un angle mort des modèles Vision-Language-Action (VLA) : leur fragilité face aux perturbations réelles. Une équipe de recherche a d'abord testé les principaux VLA sous 17 types de perturbations réparties sur quatre modalités (actions, instructions, environnement, observations visuelles). Résultat : les actions constituent la modalité la plus fragile, les modèles réputés robustes visuellement (comme BYOVLA) ne conservent aucun gain sur les autres modalités, et pi0 se distingue par une robustesse supérieure aux autres backbones testés. Pour corriger ces faiblesses, les chercheurs proposent RobustVLA, qui combine une optimisation robuste hors ligne contre le pire cas de bruit sur les actions (via l'objectif de flow matching) et un mécanisme forçant des actions cohérentes malgré les variations d'entrée. La sélection automatique des perturbations les plus nuisibles est traitée comme un problème de bandit multi-bras, résolu par un algorithme d'upper confidence bound. Sur le benchmark LIBERO, RobustVLA gagne 12,6% de réussite absolue sur backbone pi0 et 10,4% sur OpenVLA face aux 17 perturbations combinées, avec une inférence 50,6 fois plus rapide que BYOVLA, qui dépend de LLM externes. Cette avancée touche un point sensible pour l'industrie robotique : la plupart des démonstrations de VLA impressionnent en conditions contrôlées mais s'effondrent face au bruit réel (mauvaise calibration caméra, instructions ambiguës, occlusions, dérive capteurs). En identifiant les actions comme le maillon le plus faible, l'étude remet en question l'hypothèse répandue selon laquelle la robustesse visuelle suffirait à garantir un déploiement fiable. Sur robot réel FR5, RobustVLA dépasse pi0 de 65,6% de taux de réussite avec seulement 25 démonstrations, un résultat clé pour les intégrateurs qui manquent de données d'entraînement en environnement industriel. Même avec des données abondantes, le gain reste de 30%, ce qui suggère que la méthode n'est pas qu'un palliatif pour le few-shot mais une amélioration structurelle. Le papier s'inscrit dans la lignée des travaux récents sur pi0 (Physical Intelligence) et OpenVLA, deux architectures de référence dans la course aux modèles génériques de manipulation robotique. Il répond directement aux limites de BYOVLA, une approche antérieure de robustesse visuelle jugée coûteuse en calcul car dépendante de LLM externes. Les auteurs positionnent RobustVLA comme une alternative légère et généralisable, testée à la fois en simulation (LIBERO) et en conditions réelles. Le code et des vidéos de démonstration sont disponibles sur GitHub, ce qui permettra une validation indépendante par la communauté avant une adoption plus large en environnement industriel.

RecherchePaper
1 source
AGIBOT dévoile quatre produits d'IA incarnée pour des opérations en conditions réelles au WAIC
34Robotics Business Review 

AGIBOT dévoile quatre produits d'IA incarnée pour des opérations en conditions réelles au WAIC

Un article robotique en français à trois paragraphes, respectant les consignes éditoriales (pas de titres, pas de tirets cadratins, ton factuel type IEEE Spectrum). AGIBOT a dévoilé quatre nouveaux produits lors du World Artificial Intelligence Conference (WAIC) 2026 à Shanghai, sur un stand de 200 m² (booth H3-C101) au Shanghai World Expo Exhibition and Convention Center. Le A3 Ultra est un humanoïde grande taille de 1,74 m pour 60 kg, doté de 51 degrés de liberté actifs, d'une capacité de charge de 5 kg par bras et d'une autonomie combinée pouvant atteindre huit heures. Il embarque un système de perception composé de lidar 3D, de caméras RGB-D, de caméras fisheye et de vision binoculaire, ainsi que du GPS, du RTK et de l'UWB pour la navigation, le tout piloté par une puce NVIDIA Thor. Le G2 Max, premier robot industriel à fort payload et contrôle en force de la société, cible la manutention et la palettisation grâce à des bras à contrôle de force, une hauteur de travail ajustable et une mobilité omnidirectionnelle sur roues. L'OmniHand 3 Ultra-M est une main dextre à entraînement direct de 20 degrés de liberté actifs pesant 630 g, conçue pour l'entraînement de modèles d'IA incarnée, la téléopération et la manipulation fine. Un cinquième produit, le X2 Edu, cible le marché éducatif. Lors de l'événement, un robot à roues G2 assurait un guidage en temps réel dans le métro de Shanghai, et AGIBOT a annoncé avoir produit son 15 000e robot le mois dernier. Ces annonces marquent un déplacement du discours du secteur, du spectaculaire vers l'opérationnel. Peng Zhihui, cofondateur, président et directeur technique d'AGIBOT, a résumé cette ambition en affirmant que l'industrie ne devrait plus juger l'IA incarnée sur sa capacité à réussir une démonstration impressionnante, mais sur sa fabricabilité, sa livraison et son intégration fiable dans des environnements réels. Le positionnement mérite d'être nuancé: la démonstration de danse du A3 Ultra sur le salon reste un exercice de vitrine classique, tandis que le guidage effectif dans le métro par le G2 et le cap des 15 000 unités produites constituent des indicateurs plus tangibles de déploiement réel. Pour les intégrateurs industriels et les décideurs B2B, l'intérêt de ce lancement tient surtout au G2 Max et à l'OmniHand 3 Ultra-M, qui s'attaquent directement au goulot d'étranglement identifié depuis des années dans la robotique humanoïde: la manipulation dextre fiable et la manutention à fort payload en environnement de production existant, plutôt que la simple locomotion bipède. Fondée en 2023 à Shanghai sous le nom de Zhiyuan New Technology Co., AGIBOT développe à la fois des modèles fondationnels et les corps robotiques associés, avec une architecture dite "Three Intelligences in One" qui unifie locomotion, interaction et manipulation. Sa gamme couvre déjà des humanoïdes, des quadrupèdes, des systèmes de préhension dextres et des solutions de nettoyage commercial. Les nouveaux produits s'inscrivent dans la continuité de cas de déploiement industriel présentés sur le stand du WAIC, dans un marché chinois de la robotique humanoïde marqué par une compétition intense sur la vitesse de production et la fiabilité en usine plutôt que sur la seule prouesse technique isolée. L'entreprise n'a pas communiqué de calendrier précis de déploiement commercial élargi pour ces quatre nouveaux modèles au-delà de leur présentation au salon.

Chine/AsieOpinion
1 source
Nouvelle main robotique soulève 25 kilos tout en manipulant des objets fragiles avec une dextérité proche de l'humain
35Interesting Engineering 

Nouvelle main robotique soulève 25 kilos tout en manipulant des objets fragiles avec une dextérité proche de l'humain

La startup suisse Mimic Robotics a dévoilé la Mimic Hand M1, une main robotique dexterous destinée à l'automatisation industrielle. Conçue et fabriquée en Suisse, elle repose sur une architecture à câbles tendineux (tendon-driven) inspirée de l'anatomie humaine : les actionneurs sont logés dans l'avant-bras plutôt que dans la paume ou les doigts, et entraînent les phalanges via des tendons passant sur des roulements et poulies plutôt que dans des gaines de guidage sujettes au frottement. La main compte 15 degrés de liberté actifs répartis sur 21 articulations, avec abduction des doigts et pouce opposable. Pour un poids d'environ 1,8 kg, elle peut maintenir une prise cylindrique stable sur des charges dépassant 25 kg, tout en détectant, selon Mimic Robotics, des forces aussi faibles que 0,1 newton (soit l'équivalent d'un objet d'environ 50 grammes) via le seul courant moteur. Des capteurs tactiles aux extrémités des doigts mesurent en complément la force normale, la force de cisaillement tangentielle et la localisation précise du contact. Ces chiffres proviennent des communications de l'entreprise et n'ont pas fait l'objet de validation indépendante à ce stade. Cette annonce s'inscrit dans un débat plus large sur la meilleure architecture de préhension pour les robots humanoïdes et l'automatisation industrielle. Plutôt que les pinces à deux doigts classiques, largement répandues mais limitées en polyvalence, Mimic mise sur une main à morphologie humaine pour faciliter le transfert de compétences apprises par démonstration humaine vers un système robotique, un enjeu central pour l'IA physique (Physical AI). L'entreprise présente la M1 non comme un simple effecteur terminal mais comme une plateforme sensorielle conçue pour rester identique entre la phase de collecte de données, l'entraînement des modèles d'IA et le déploiement final, dans le but de réduire ce qu'elle appelle le « fossé d'incarnation » (cross-embodiment gap), soit la perte de performance quand un modèle entraîné sur des mouvements humains doit s'adapter à une pince mécaniquement différente. Si cette approche tient ses promesses en conditions réelles d'usine, elle pourrait peser dans l'arbitrage entre pinces spécialisées et mains anthropomorphes pour les intégrateurs industriels. La M1 s'inscrit dans une plateforme robotique plus large développée par Mimic, incluant un gant portable destiné à la collecte de données de démonstration humaine, utilisé pour entraîner les modèles avant déploiement sur la main robotique. L'annonce intervient peu après que la firme norvégienne 1X a présenté ses propres mains à câbles tendineux à 25 degrés de liberté pour son robot NEO, avec des objectifs similaires de précision, de robustesse et de sécurité. La course à la main robotique dexterous s'accélère ainsi chez plusieurs acteurs du secteur humanoïde, chacun cherchant à résoudre le même problème : donner aux robots une préhension suffisamment fine et polyvalente pour remplacer, à terme, la main humaine sur les lignes de production.

UEDeveloppee par une startup suisse, cette main robotique pourrait influencer les choix technologiques des intégrateurs robotiques industriels européens, sans impact direct sur une entreprise ou une réglementation française a ce stade.

IA physiqueActu
1 source
Xiaomi-Robotics-1 : passage à l'échelle des modèles vision-langage-action avec plus de 100 000 heures de trajectoires réelles
36arXiv cs.RO 

Xiaomi-Robotics-1 : passage à l'échelle des modèles vision-langage-action avec plus de 100 000 heures de trajectoires réelles

Xiaomi a dévoilé Xiaomi-Robotics-1, un modèle vision-langage-action (VLA) fondation entraîné sur plus de 100 000 heures de trajectoires de manipulation collectées en conditions réelles via des dispositifs UMI (Universal Manipulation Interface). L'entraînement se déroule en deux temps : une phase de pré-entraînement qui dote le modèle de capacités générales de génération d'actions, appuyée sur un pipeline d'auto-annotation générant des descriptions en langage naturel des transitions d'état de la scène, puis une phase de post-entraînement qui aligne ces capacités sur des instructions impératives et sur des embodiments robotiques spécifiques. Sur les benchmarks de simulation, le modèle établit un nouvel état de l'art avec 57,6% de taux de réussite sur RoboCasa365 (contre 46,6% précédemment) et un score moyen de 20,07 sur RoboDojo (contre 13,07 pour le meilleur résultat antérieur). Xiaomi annonce la publication future du code et des poids du modèle. L'intérêt principal tient au comportement de scaling observé : les performances progressent de façon cohérente avec la taille des données et du modèle en pré-entraînement, et ce gain se transfère directement au post-entraînement, avec de meilleures performances hors distribution sur robot réel. C'est un signal notable pour l'industrie, qui cherche à valider l'hypothèse que les modèles VLA généralistes, entraînés à grande échelle sur données réelles plutôt que simulées, peuvent servir de politique de base robuste, adaptable à des tâches dextres complexes avec peu de données de fine-tuning. Pour les intégrateurs et décideurs robotique, cela renforce la piste des foundation models comme alternative viable aux pipelines spécialisés tâche par tâche. Ce travail s'inscrit dans une compétition intense entre grands acteurs sur les modèles VLA fondation, aux côtés de Pi-0 de Physical Intelligence, GR00T N2 de Nvidia ou Helix de Figure. L'usage de dispositifs UMI, portables et peu coûteux pour collecter des données de manipulation sans robot physique, s'inscrit dans une tendance à contourner le goulot d'étranglement de la téléopération classique. Reste à voir si la publication effective du code et des checkpoints, promise mais non encore livrée, confirmera la reproductibilité des résultats annoncés.

IA physiqueActu
1 source
Fujitsu s'associe à Fanuc, Yaskawa et Kawasaki pour faire progresser l'IA physique avec la technologie Nvidia
37Robotics & Automation News 

Fujitsu s'associe à Fanuc, Yaskawa et Kawasaki pour faire progresser l'IA physique avec la technologie Nvidia

Fujitsu a lancé un partenariat avec les trois grands fabricants japonais de robotique Fanuc, Yaskawa Electric et Kawasaki Heavy Industries pour développer et déployer l'IA physique dans la fabrication, la logistique et la santé. L'initiative intègre également les technologies d'IA physique de Nvidia, les partenaires cherchant à construire une plateforme de contrôle collaborative capable de relier systèmes numériques et robots. L'annonce reste à ce stade programmatique : aucune date de déploiement, aucun chiffre de performance (payload, DOF, temps de cycle) ni calendrier de commercialisation n'a été communiqué. Il s'agit pour l'instant d'un cadre de collaboration technologique plutôt que d'un produit ou d'un pilote industriel concret. Ce rapprochement illustre la consolidation en cours entre géants industriels japonais autour de l'IA physique, un secteur jusqu'ici dominé dans le discours public par les humanoïdes américains et chinois (Figure, Tesla Optimus, Unitree) et les plateformes VLA de Nvidia (GR00T) ou Physical Intelligence (Pi-0). Pour les intégrateurs et décideurs B2B, le signal est celui d'une réponse défensive des fabricants historiques de robots industriels, qui cherchent à ne pas se laisser distancer par les nouveaux entrants sur le terrain de l'IA appliquée à la robotique, plutôt qu'une percée technique immédiate. L'absence de métriques concrètes invite à la prudence : il s'agit d'une annonce d'intention, pas d'un déploiement vérifiable. Fanuc, Yaskawa et Kawasaki comptent parmi les plus anciens et plus importants fournisseurs mondiaux de bras robotiques industriels, avec des décennies de présence dans l'automobile et l'électronique. Fujitsu, de son côté, apporte son expertise en intégration de systèmes numériques et en IA d'entreprise, tandis que Nvidia fournit la brique technologique physique AI (simulation, entraînement, inférence embarquée). La suite attendue concerne la publication de spécifications techniques, d'éventuels pilotes clients et un calendrier de mise sur le marché, aucun de ces éléments n'étant encore public à ce stade.

Chine/AsieOpinion
1 source
L'entreprise américaine mise sur des robots industriels plus intelligents et plus rapides avec un nouvel accord sud-coréen
38Interesting Engineering 

L'entreprise américaine mise sur des robots industriels plus intelligents et plus rapides avec un nouvel accord sud-coréen

Le fabricant américain Grid Dynamics a annoncé un partenariat stratégique avec le sud-coréen Doosan Robotics pour accélérer le déploiement de "physical AI" dans l'industrie manufacturière et la logistique. Grid Dynamics va fournir aux clients des cobots Doosan sa plateforme GAIN (Grid Dynamics AI-Native), une pile logicielle combinant manipulation robotique pilotée par modèles Vision-Language-Action (VLA), jumeaux numériques NVIDIA Omniverse, vision par ordinateur et supervision IoT. Doosan, l'un des grands fabricants mondiaux de cobots, propose une gamme allant de la série A polyvalente à la série H pour charges lourdes jusqu'à 25 kg, en passant par la série P certifiée NSF pour l'agroalimentaire et le pharmaceutique. Les cobots Doosan, équipés de capteurs de force et de couple, travaillent sans cage de sécurité aux côtés d'opérateurs humains et couvrent des tâches comme le pick-and-place, le tending machine, la palettisation, le soudage ou l'inspection qualité. Grid Dynamics revendique des gains de cycles d'inspection jusqu'à 1000 fois plus rapides et une détection d'anomalies 24 fois plus véloce, des chiffres qui restent à prendre avec prudence en l'absence de méthodologie ou de cas d'usage précisés. L'enjeu du partenariat dépasse le simple ajout logiciel : il vise les tâches qui résistent encore à l'automatisation classique, comme l'inspection d'objets de forme complexe, l'assemblage de composants variables ou l'emballage d'articles déformables ou jamais vus auparavant. C'est justement le type de scénario où les approches VLA sont censées apporter une généralisation que les robots programmés tâche par tâche n'offrent pas. Pour les intégrateurs et décideurs industriels, l'accord illustre une tendance de fond : les fabricants de cobots cherchent à externaliser la couche IA plutôt qu'à la développer en interne, pariant sur des plateformes tierces pour combler l'écart entre démonstrations en laboratoire et déploiements réels en usine. Doosan Robotics s'est construit depuis plusieurs années une position de leader des cobots collaboratifs, avec une architecture logicielle ouverte facilitant l'intégration de systèmes de vision tiers, un choix qui rend ce type de partenariat possible sans refonte matérielle. Grid Dynamics, de son côté, positionne GAIN comme une couche d'orchestration transversale pour l'automatisation industrielle, en concurrence avec d'autres piles logicielles physical AI émergentes aux États-Unis et en Asie. Les modalités précises de déploiement, calendrier de disponibilité et sites pilotes concernés par ce partenariat n'ont pas été détaillées dans l'annonce.

IndustrielActu
1 source
SafeRelBench : un benchmark sensible aux relations spatiales pour la sécurité au niveau des processus dans les agents incarnés pilotés par VLM
39arXiv cs.RO 

SafeRelBench : un benchmark sensible aux relations spatiales pour la sécurité au niveau des processus dans les agents incarnés pilotés par VLM

Des chercheurs présentent SafeRelBench, un nouveau benchmark évaluant la sécurité des agents robotiques pilotés par des modèles vision-langage (VLM), avec un focus sur les relations spatiales entre objets plutôt que sur la simple reconnaissance de risques statiques. Le jeu de données comprend 507 échantillons d'évaluation exécutables, répartis entre 248 échantillons centrés sur des relations spatiales (support, confinement, proximité) et 259 échantillons de contrôle non spatiaux. L'équipe a testé sept agents robotiques différents, combinant des VLM open-source et propriétaires, pour mesurer non seulement s'ils accomplissent une tâche demandée, mais s'ils respectent des contraintes de sécurité tout au long du processus d'exécution, avant même que des actions risquées ne soient entreprises. Le résultat principal est préoccupant pour l'industrie : les chercheurs observent un écart important entre la réussite d'une tâche et la conformité en matière de sécurité au niveau du processus. Concrètement, les agents testés parviennent souvent à terminer la tâche demandée tout en violant des règles de sécurité intermédiaires, par exemple en manipulant un objet posé de façon instable ou en ignorant un risque de renversement pendant le mouvement. Ce constat remet en question l'hypothèse répandue dans le secteur selon laquelle un modèle VLA qui réussit une tâche a nécessairement raisonné correctement sur les risques physiques associés. Pour les intégrateurs et décideurs B2B déployant des robots domestiques ou humanoïdes en environnement réel, cela signifie que les métriques de succès de tâche classiques ne suffisent pas à garantir un déploiement sûr, et que l'évaluation doit désormais intégrer explicitement le raisonnement sur les relations spatiales entre objets. Ce travail s'inscrit dans un mouvement plus large de recherche sur la sécurité des agents incarnés (embodied AI), où les benchmarks existants se limitaient jusqu'ici à la reconnaissance de dangers statiques, au refus d'instructions dangereuses, ou à la vérification de l'état final d'une tâche, sans examiner la trajectoire du processus. SafeRelBench se distingue en testant explicitement si les conditions de sécurité sont respectées avant l'exécution d'actions à risque, plaçant les relations spatiales au cœur de l'évaluation. Les auteurs concluent qu'une intelligence incarnée véritablement sûre nécessite, au-delà de meilleures capacités de perception et de planification, un raisonnement fiable sur la manière dont les relations entre objets façonnent le risque pendant l'interaction, un axe de recherche qui devrait gagner en importance à mesure que les déploiements de robots humanoïdes et domestiques s'accélèrent.

RecherchePaper
1 source
Action QFormer : structuration des représentations guidée par la supervision des actions dans les modèles vision-langage-action
40arXiv cs.RO 

Action QFormer : structuration des représentations guidée par la supervision des actions dans les modèles vision-langage-action

Des chercheurs publient sur arXiv (2607.14635v1) une étude sur les modèles vision-langage-action (VLA), remettant en question la manière dont la supervision par action est utilisée pour entraîner ces systèmes. Traditionnellement traitée comme un simple objectif d'apprentissage en aval pour prédire les actions, cette supervision agit en réalité comme une force qui remodèle les représentations multimodales héritées des modèles vision-langage préentraînés. Les auteurs montrent que cet effet est double : il est indispensable pour construire des représentations compatibles avec l'action, mais lorsqu'il est appliqué trop directement sur le flux multimodal hérité, il déstabilise aussi les capacités de traitement du langage et d'ancrage des objets. Pour résoudre cette tension, l'équipe introduit Action QFormer, une interface à base de requêtes conditionnées par les instructions, qui réorganise les informations multimodales héritées en représentations orientées action avant la génération des commandes. En navigation zero-shot sim-to-real, cette architecture fait bondir le taux de réussite moyen des tâches en boucle fermée de 18,8% à 56,3%, la justesse de génération d'action à instruction fixe de 22,5% à 75,5%, et réduit quasiment à zéro les générations d'instructions hors distribution. Ce résultat touche un point sensible du secteur robotique : l'écart persistant entre démonstrations impressionnantes et performances réelles en conditions variables, souvent attribué au fossé sim-to-real. En multipliant par trois le taux de succès en navigation zero-shot, Action QFormer suggère que les gains de performance des VLA ne viendront pas uniquement de backbones préentraînés plus puissants, à la manière de Pi-0, GR00T N2 ou Helix, mais aussi de la façon dont l'information multimodale héritée est sélectionnée et organisée avant d'être exposée à la supervision par action. Pour les intégrateurs et équipes de recherche robotique, ce travail envoie un signal clair : le simple passage à l'échelle des données d'action ou le fine-tuning direct sur des architectures VLM existantes comporte un risque de dégradation silencieuse des capacités de compréhension du langage et de perception, un compromis rarement documenté dans les communications commerciales. Ce travail s'inscrit dans la lignée des modèles VLA apparus depuis RT-2 et OpenVLA, qui adaptent des architectures vision-langage préentraînées à la prédiction directe d'actions robotiques, approche depuis reprise par des laboratoires comme Physical Intelligence avec Pi-0, NVIDIA avec GR00T N2 ou Figure AI avec Helix. La question de la préservation des capacités multimodales sous supervision d'action rejoint des préoccupations déjà observées ailleurs dans le secteur, où l'écart entre vidéos de démonstration sélectionnées et déploiement réel reste un sujet de vigilance éditoriale. Les auteurs positionnent Action QFormer comme une brique architecturale plutôt qu'un produit fini, validée pour l'instant sur des tâches de navigation en environnement simulé puis réel ; la suite logique serait son extension à des tâches de manipulation avec davantage de degrés de liberté, ainsi que sa validation sur des backbones VLA de plus grande échelle.

IA physiqueActu
1 source
IA incarnée : le MIT forme des robots grâce à des environnements virtuels 3D réalistes
41Interesting Engineering 

IA incarnée : le MIT forme des robots grâce à des environnements virtuels 3D réalistes

Des chercheurs du MIT ont dévoilé SceneSmith, un système d'intelligence artificielle capable de générer automatiquement des environnements intérieurs 3D réalistes pour entraîner des robots. La plateforme s'appuie sur trois agents IA complémentaires fonctionnant en boucle: un "designer" qui construit la disposition de la pièce et place meubles et objets, un "critique" qui vérifie le réalisme de la scène et signale les incohérences (un objet qui n'a rien à faire dans cette pièce, par exemple), et un "orchestrateur" qui pilote l'ensemble du processus et décide quand la scène est terminée ou doit être révisée. Ces agents s'appuient sur GPT-5.2, le modèle vision-langage d'OpenAI, pour comprendre comment les espaces réels sont agencés. Un utilisateur peut simplement décrire une pièce en langage naturel, par exemple un garage avec voiture, établi, pneus empilés et échelle contre le mur, et SceneSmith en génère une version virtuelle détaillée. L'équipe a produit plus de 1300 environnements virtuels (cuisines, hôtels, bureaux, commerces, espaces à thème), dans lesquels des robots se sont entraînés à des tâches domestiques courantes: poser des fruits sur une assiette, déplacer des canettes entre étagères et table, ouvrir des placards, ranger des tasses dans un évier. Sur 100 environnements testés, un agent IA a évalué la réussite des tâches, avec un taux d'accord de plus de 99% avec des évaluateurs humains. Une étude auprès de plus de 200 personnes a montré que plus de 90% jugeaient les scènes de SceneSmith plus réalistes que celles produites par les méthodes précédentes, avec jusqu'à six fois plus d'objets interactifs par scène. L'enjeu central que vise SceneSmith est le principal goulot d'étranglement de la robotique actuelle: contrairement aux chatbots qui apprennent sur du texte, les robots ont besoin de données d'interaction physique variées, coûteuses et lentes à collecter en conditions réelles. En automatisant la création de mondes virtuels riches et crédibles, le MIT cherche à réduire cette dépendance aux essais physiques tout en accélérant l'itération sur les stratégies de contrôle. Le test le plus révélateur reste celui d'un contrôleur robotique entraîné principalement sur des données réelles, qui a réussi des tâches (saisir une pomme dans un bol, la poser sur une planche à découper) dans des environnements SceneSmith qu'il n'avait jamais vus, un indice de transfert sim-to-real qui intéressera directement intégrateurs et équipes R&D cherchant à réduire les coûts de collecte terrain. Le projet s'inscrit dans la course plus large à la génération de données synthétiques pour la robotique, où plusieurs laboratoires tentent de contourner la rareté des données physiques réelles. Le MIT ne communique pas, à ce stade, de calendrier de déploiement commercial ni de partenariat industriel annoncé: il s'agit d'une publication de recherche, présentée via un communiqué de l'équipe, dont l'ampleur des bénéfices en conditions réelles de production reste à confirmer au-delà des tests en laboratoire.

RecherchePaper
1 source
JD.com se lance dans l'IA incarnée : construction de la première usine de robots RoboBase à Guangzhou
42Pandaily 

JD.com se lance dans l'IA incarnée : construction de la première usine de robots RoboBase à Guangzhou

JD.com a posé la première pierre de son site "Robot Base" à Guangzhou, marquant l'entrée officielle du géant chinois du e-commerce dans l'IA incarnée (embodied AI). L'investissement, estimé à environ 1 milliard de RMB, doit être achevé en 2028 pour une pleine production visée en 2030, avec une valeur de production annuelle projetée à 1,75 milliard de RMB. Le site accueillera des acteurs de l'IA incarnée, de la robotique industrielle et de service, ainsi que des entreprises de la chaîne d'approvisionnement amont et aval. Le fondateur Richard Liu a annoncé un plan de plus de 80 sites RoboBase à travers le pays, tandis que la filiale JD Logistics prévoit d'acquérir 3 millions de robots, 1 million de véhicules autonomes et 100 000 drones sur cinq ans pour automatiser l'ensemble de sa chaîne logistique, de l'entreposage à la livraison du dernier kilomètre. Les partenaires du site de Guangzhou incluent Zhiyuan Robot, Leju Robot, Qingtong Vision et GAC Huilun Technology. JD.com ne fabrique pas de robots lui-même mais se positionne comme orchestrateur de plateforme, un choix stratégique qui mérite d'être souligné plutôt que pris pour argent comptant. L'entreprise met en avant quatre leviers : l'intégration à son écosystème de distribution pour réduire les coûts et donner accès au marché, ses modèles open-source et centres de collecte de données à grande échelle, des terrains de test réels via ses magasins JD MALL, parcs logistiques et pharmacies, et enfin un accès au capital via ses fonds d'investissement et JD Finance. Ce modèle répond directement aux trois blocages classiques du secteur robotique identifiés par l'industrie : l'absence de scénarios de déploiement réels, l'absence de canaux de vente stables, et le manque de capital de développement soutenu. La déclaration selon laquelle Songyan Power aurait vendu plus de 500 robots en deux jours sur la plateforme JD reste toutefois un chiffre communiqué par JD lui-même, sans vérification indépendante, et JD vise 10 milliards de RMB de ventes de robots sur sa plateforme cette année, avec l'objectif de faire dépasser 1 milliard de RMB de ventes à une centaine de marques d'ici trois ans. JD investit dans des startups de robotique incarnée depuis 2025, dont LimX Dynamics (locomotion humanoïde), Zhiyuan Robot (robots humanoïdes généralistes), Zhongqing Robot, Pasini et RoboScience. Le directeur des opérations de Zhiyuan Robot a confirmé que des robots de l'entreprise sont déjà déployés dans des stations de métro de Guangzhou, dans le cadre d'une coentreprise avec l'opérateur local. JD s'attaque aussi au service après-vente, un angle mort classique du secteur, en s'appuyant sur son réseau JD Service+ de plusieurs milliers de techniciens formés pour bâtir un maillage national de maintenance. Le 11 juillet, le gouvernement provincial du Guangdong a signé un accord stratégique global avec le groupe JD couvrant l'économie numérique, la logistique intelligente et la fabrication robotique, signe d'un soutien politique appuyé à ce modèle de plateforme au moment où le secteur robotique chinois cherche à transformer ses démonstrations technologiques en déploiements commerciaux réels.

Chine/AsieOpinion
1 source
L'efficacité du fine-tuning LoRA pour les modèles vision-langage-action dans la manipulation robotique industrielle
43arXiv cs.RO 

L'efficacité du fine-tuning LoRA pour les modèles vision-langage-action dans la manipulation robotique industrielle

Une équipe de recherche publie une étude systématique sur l'adaptation à faible rang (LoRA) appliquée à π0, un modèle Vision-Language-Action (VLA) à correspondance de flux, testé sur quatre tâches d'assemblage de précision avec un bras robotique UR5e. Les chercheurs ont balayé des rangs LoRA de 8 à 256, plusieurs stratégies d'allocation des paramètres, et testé le gel sélectif de composants du modèle. Résultat principal : aucune différence statistiquement significative de performance entre le fine-tuning complet (FFT), qui exige des GPU de datacenter, et certaines configurations LoRA. Les performances plafonnent dès un rang de 32, avec une allocation uniforme des paramètres entraînables entre le backbone vision-langage (VLM) et l'expert d'action qui suffit à égaler le FFT. Geler le VLM ou limiter le LoRA au seul encodeur visuel dégrade nettement les résultats. Avec cette configuration optimale (rang 32, encodeur visuel entièrement ajustable), la mémoire VRAM statique de pointe chute de 36,2 à 10,8 Gio, hors mémoire d'activation, sans perte de performance mesurable. Pour l'industrie robotique, ce résultat a une portée pratique directe : il abaisse fortement la barrière matérielle pour spécialiser un modèle VLA préentraîné à un cas d'usage industriel précis, sans avoir besoin d'un cluster GPU dédié à l'entraînement complet. C'est un signal utile pour les intégrateurs et PME qui veulent déployer des politiques de manipulation fine sans les moyens des grands laboratoires. L'étude apporte aussi un contrepoint méthodologique à l'hypothèse selon laquelle seul un réentraînement complet permettrait de combler le "gap d'incarnation" entre un modèle généraliste et un robot physique donné : ici, un ajustement ciblé mais bien réparti sur les couches sémantiques et visuelles suffit. π0 est le modèle VLA développé par Physical Intelligence, l'un des laboratoires de référence sur les politiques de manipulation par apprentissage à grande échelle, aux côtés d'acteurs comme NVIDIA (GR00T N2) ou Figure AI. Cette publication, un preprint arXiv, s'inscrit dans une tendance plus large de recherche sur l'efficacité des VLA plutôt que sur leur seule capacité brute. Aucun acteur français ou européen n'apparaît dans ce travail, mais ses conclusions concernent directement les intégrateurs européens qui évaluent l'adoption de VLA préentraînés sur du matériel limité.

UEAucun acteur français ou européen n'est impliqué dans cette étude, mais ses conclusions offrent une piste concrète pour les intégrateurs et PME européens qui veulent spécialiser des modèles VLA sur du matériel limité sans cluster GPU dédié.

RechercheActu
1 source
Robotique évoluée : améliorer l'efficacité humaine dans le post-entraînement de robots à grande échelle via un pipeline guidé par VLAC-Cut
44arXiv cs.RO 

Robotique évoluée : améliorer l'efficacité humaine dans le post-entraînement de robots à grande échelle via un pipeline guidé par VLAC-Cut

Les chercheurs à l'origine de ce rapport technique publié sur arXiv proposent un nouveau pipeline pour l'entraînement post-hoc des modèles Vision Language Action (VLA), ces systèmes qui permettent à un robot de traduire une consigne en langage naturel en actions physiques. Le constat de départ est simple: un seul cycle de collecte de données ne suffit jamais à corriger toutes les faiblesses d'un modèle, ce qui impose plusieurs rounds successifs de réentraînement. L'équipe organise le travail humain autour de deux rôles distincts, un téléopérateur formé qui intervient à distance uniquement sur les cas à forte valeur ajoutée et les démonstrations de récupération après échec, et un opérateur de terrain qui surveille plusieurs robots simultanément, déclenche les prises de contrôle et effectue les réinitialisations physiques. À cela s'ajoute VLAC CUT, un outil de curation automatique qui découpe les trajectoires autonomes des robots en segments utiles, en distinguant les portions qui font progresser la tâche, les phases d'inactivité, celles qui provoquent l'échec et celles de récupération, pour ne conserver que les données exploitables. Sur quatre tâches réelles de manipulation, les politiques finales atteignent entre 80 et 95% de taux de réussite et multiplient le débit de tâches par 1,7 à 4,2 par rapport au modèle de base. L'enjeu ici est économique autant que technique. Le vrai goulot d'étranglement du déploiement des VLA à grande échelle n'est pas la puissance de calcul mais le coût du travail humain de supervision et de téléopération, un point sensible pour toute l'industrie robotique qui vise la commercialisation de flottes de robots manipulateurs ou humanoïdes. En montrant qu'une réutilisation intelligente des trajectoires autonomes, combinée à une supervision humaine mieux répartie, surpasse un entraînement reposant uniquement sur l'humain dans la boucle à budget d'intervention égal, ce travail apporte un argument concret dans le débat sur la viabilité économique des VLA déployés en usine ou en entrepôt. Ce rapport s'inscrit dans la lignée des travaux récents sur l'apprentissage par imitation et le human-in-the-loop pour les VLA, où la collecte de démonstrations reste le principal poste de coût. Aucun partenaire industriel ni plateforme robotique spécifique n'est nommé dans cette publication académique, qui reste à ce stade validée sur un nombre restreint de tâches en laboratoire, sans indication de calendrier vers un déploiement à plus grande échelle.

RechercheActu
1 source
Unitree Robotics s'associe à Hunan Steel : l'émergence d'une entreprise d'infrastructure IA physique
45Pandaily 

Unitree Robotics s'associe à Hunan Steel : l'émergence d'une entreprise d'infrastructure IA physique

Unitree Robotics a signé un accord de coopération stratégique avec le groupe sidérurgique Hunan Iron and Steel Group (Hunan Steel), l'un des plus grands producteurs d'acier chinois, dans le cadre d'un partenariat tripartite impliquant également Looper Robotics, une société d'infrastructure d'IA physique spécialisée dans la perception spatiale. Les trois parties vont créer ce qui est présenté comme le premier laboratoire d'innovation en robotique à intelligence incarnée du secteur sidérurgique, couvrant l'inspection et la maintenance intelligentes, la gestion des urgences, la mise en œuvre d'usines intelligentes, l'exécution de production automatisée et la logistique d'entrepôt. Dans cette répartition des rôles, Hunan Steel fournit les scénarios d'application concrets, Unitree le matériel robotique (robots quadrupèdes, humanoïdes ou à roues), et Looper Robotics la couche de perception spatiale via une caméra embarquée intégrant VIO/VSLAM, vision, cartographie, localisation et navigation autonome, compatible avec l'écosystème ROS. L'enjeu tient à la difficulté propre à l'environnement sidérurgique. Les couloirs de convoyeurs à bande y cumulent poussière, vibrations, chaleur intense, faible luminosité et gaz dangereux, rendant les inspections manuelles limitées en fréquence et sujettes à des détections tardives : une simple déchirure de bande ou une défaillance de roulement peut provoquer des heures d'arrêt de production, des rejets environnementaux ou des incidents de sécurité. Ce déploiement illustre un basculement de l'industrie de l'IA incarnée, qui quitte les démonstrations de laboratoire et les vidéos virales pour des mises en œuvre industrielles réelles. Réussir dans un environnement aussi contraignant que celui d'une aciérie constitue une validation qui pourrait faciliter le transfert de cette technologie vers d'autres secteurs comparables, comme l'énergie, la manufacture, l'entreposage ou la logistique, où des besoins similaires de surveillance et d'inspection existent. À noter que la présentation de ce laboratoire comme une première du secteur reste une revendication commerciale des parties prenantes, non vérifiée de façon indépendante. Ce partenariat traduit aussi une standardisation croissante du matériel robotique, qui déplace le point de friction vers la fiabilité de la perception, de la navigation et de l'exécution des tâches en conditions réelles. Le modèle à trois niveaux qui se dessine ici, un fabricant de robots (Unitree) pour le corps, un fournisseur d'IA spatiale (Looper Robotics) pour le cerveau perceptif et décisionnel, et un client industriel (Hunan Steel) pour les exigences métier, illustre une division du travail émergente dans l'écosystème de la robotique industrielle incarnée, où chaque couche technologique peut progresser indépendamment des autres, accélérant le rythme global de déploiement.

IndustrielOpinion
1 source
Mistral AI lance Robostral Navigate
46Robot Magazine FR 

Mistral AI lance Robostral Navigate

Reformuler ce communiqué en article journalistique neutre, en signalant que les chiffres proviennent uniquement de la communication Mistral, sans donnée sim-to-real indépendante. --- Mistral AI a présenté Robostral Navigate, un modèle de navigation robotique construit selon une architecture Vision-Language-Action : une caméra RGB classique et des instructions en langage naturel remplacent la combinaison habituelle LiDAR, caméras de profondeur, centrale inertielle et cartographie SLAM. Le modèle compte 8 milliards de paramètres, une taille pensée pour tourner sur des plateformes embarquées à ressources limitées plutôt que sur des clusters distants. Selon Mistral, l'entraînement s'est appuyé sur près de 400 000 trajectoires générées dans plus de 6 000 environnements simulés, couvrant bureaux, entrepôts, usines et logements. En fonctionnement, le pipeline doit interpréter le flux vidéo, comprendre la consigne, localiser la cible, planifier une trajectoire, éviter les obstacles fixes et mobiles, et corriger sa position en continu, l'ensemble devant tenir dans un budget de quelques dizaines de millisecondes par cycle de décision. L'intérêt pour les fabricants de robots mobiles tient d'abord au coût : une caméra RGB se chiffre en dizaines d'euros contre plusieurs centaines, voire milliers d'euros pour un LiDAR industriel, ce qui allège aussi bien la facture matérielle que l'intégration logicielle. Sur le fond, Robostral Navigate teste à l'échelle de la navigation pure une hypothèse déjà explorée côté manipulation par les modèles VLA : qu'un système entraîné majoritairement en simulation puisse généraliser à des environnements réels variés sans empiler les capteurs. C'est une promesse à vérifier plutôt qu'un résultat acquis, les chiffres de 400 000 trajectoires et 6 000 environnements provenant uniquement de la communication de Mistral, sans benchmark tiers ni donnée publiée sur l'écart sim-to-real en conditions réelles. Pour les intégrateurs et décideurs industriels, la question qui reste ouverte est celle de la robustesse hors simulation, dans des lieux encombrés, mal éclairés ou changeants. Mistral AI, jusque-là identifiée aux grands modèles de langage (Mistral Large, Mixtral) et positionnée comme l'alternative européenne face à OpenAI et Google, franchit ici son premier pas affiché vers la Physical AI, terrain déjà occupé par NVIDIA avec GR00T N2, Figure AI avec Helix, ou Physical Intelligence avec Pi-0. L'entreprise française n'a pas communiqué de calendrier de déploiement industriel ni de partenariat matériel identifié à ce stade ; Robostral Navigate reste, en l'état des informations disponibles, une annonce de capacité logicielle plutôt qu'un produit livré ou testé en flotte réelle.

UEMistral AI, entreprise française et alternative européenne aux géants américains de l'IA, franchit son premier pas vers la robotique physique, ce qui renforce le positionnement technologique de la France et de l'UE face aux acteurs américains et chinois du secteur.

FR/EU ecosystemeActu
1 source
Om AI de Zhao Tiancheng : des années de persévérance, pari sur l'avenir « en flux continu » natif de l'IA physique
4736Kr 

Om AI de Zhao Tiancheng : des années de persévérance, pari sur l'avenir « en flux continu » natif de l'IA physique

Om AI, jeune pousse chinoise fondée par Zhao Tiancheng, docteur de l'institut de technologies du langage de Carnegie Mellon, vient de dévoiler VLX, une famille de modèles multimodaux présentée comme la première au monde conçue nativement pour fonctionner en flux continu sur des terminaux physiques. L'architecture repose sur trois modules imbriqués, Flow pour la perception, Seek pour la localisation, Go pour la décision et l'action, formant une boucle complète perception, localisation, action directement embarquée, sans dépendre du cloud. Contrairement à l'approche dominante qui découpe la vidéo en images fixes traitées une par une, VLX ingère le flux vidéo en continu, à la manière d'une eau qui coule, et raisonne en temps réel sans attendre de requête. Le déclic remonte à 2023, quand l'équipe a constaté qu'un modèle multimodal n'ayant jamais vu la moindre image de vidéosurveillance surpassait des modèles spécialisés entraînés pendant des années sur ce type de données, preuve selon Zhao Tiancheng que l'entraînement conjoint vision-langage generalise mieux dans le monde physique ouvert que les modèles dédiés. Om AI revendique aujourd'hui des revenus de l'ordre de la centaine de millions de yuans et un déploiement effectif sur des robots, drones, objets connectés, caméras de sécurité et PC IA, avec des données réelles remontant en continu depuis le terrain pour réentraîner les modèles. Cette annonce arrive alors que le secteur de l'IA physique traverse une phase de forte incertitude méthodologique, entre modèles vision-langage-action, génération vidéo, simulation 3D et approches par représentation type JEPA, sans consensus sur la voie qui mènera à une production industrielle. Le pari d'Om AI sur l'intelligence embarquée plutôt que centralisée dans le cloud répond à une contrainte concrète de sécurité et de latence: un robot qui se fige ou chute a des conséquences bien plus graves qu'un bug logiciel classique, un argument que la société met en avant pour justifier une intelligence distribuée sur chaque terminal plutôt qu'un cerveau unique. Le financement mondial de l'IA physique a dépassé 6,4 milliards de dollars sur le seul premier trimestre 2026, signe d'un secteur en quête de preuves de déploiement réel plutôt que de démonstrations. Le positionnement de Zhao Tiancheng s'est construit sur cinq années à contre-courant: alors que l'industrie chinoise se ruait sur les grands modèles de langage générateurs de texte après 2023, il a maintenu le cap sur la fusion vision-langage, misant sur son expérience d'un projet multimodal à un milliard de dollars mené chez Yahoo pendant son doctorat. Plusieurs membres de l'équipe sont partis durant les vagues successives d'engouement pour d'autres approches, avant que le virage du secteur vers l'IA physique en 2026 ne valide, selon lui, ce choix initial resté longtemps minoritaire face aux modèles de langage et, plus récemment, aux modèles du monde.

Chine/AsieActu
1 source
BAAI et Alibaba, tous les deux jours un nouveau modèle d'IA incarnée voit le jour
48Pandaily 

BAAI et Alibaba, tous les deux jours un nouveau modèle d'IA incarnée voit le jour

Treize nouveaux modèles fondation et modèles du monde pour la robotique embarquée ont été annoncés en juin 2026, soit environ un tous les 48 heures. Lors de la Conférence Zhiyuan 2026, le BAAI (Beijing Academy of Artificial Intelligence) a présenté deux avancées : Wujie Physis-v0.1, qui prédit l'état physique suivant en compressant vidéo, données RGB-D, nuages de points 3D et retour tactile dans un espace latent unifié, et Wujie RoboBrain Orca, un "cerveau" robotique combinant représentation unifiée, raisonnement causal et décodage multimodal. Le 16 juin, Alibaba a dévoilé la suite Qwen-Robot, composée de trois modèles complémentaires : Qwen-RobotNav pour l'allocation d'attention visuelle en navigation mobile, Qwen-RobotManip qui standardise l'espace état-action pour la manipulation, et Qwen-RobotWorld, doté d'une interface en langage naturel pour prédire la dynamique du monde. CasiaHand a lancé Brain-Si 0.5, présenté comme le premier modèle de manipulation dextre humanoïde, avec une architecture à trois niveaux allant de la planification VLA jusqu'à des modèles physiquement interprétables. GalaxyBot a de son côté publié AstraBrain-WBC 0.5, un modèle de contrôle corps entier entraîné sur environ 2 milliards d'images issues de mouvements humains, pour 80 millions de paramètres. RoboScience, Current Robotics et BoundlessPower ont complété la liste avec respectivement l'architecture Visics, le modèle Curl-0 et le modèle du monde MWA. Cette accélération marque un basculement net dans l'industrie de la robotique embarquée : la compétition ne se joue plus sur les capacités matérielles des robots, mais sur l'intelligence logicielle qui les pilote. Signe le plus révélateur, la posture d'Alibaba tranche avec l'approche dominante du "plus de données, plus de robots" : le groupe affirme que l'hétérogénéité du monde physique ne peut pas être résolue par le seul passage à l'échelle et nécessite un alignement au niveau du modèle lui-même. Pour les intégrateurs et décideurs industriels, le signal est important : les équipes ne cherchent plus seulement à démontrer ce que les robots savent faire, mais à expliquer pourquoi ils échouent encore sur certaines tâches, chacune identifiant un goulot d'étranglement différent, retour tactile, coordination corps entier, transfert simulation-réel ou planification à long horizon. Ce foisonnement s'inscrit dans la course engagée depuis 2024-2025 entre laboratoires chinois et occidentaux (Figure, Physical Intelligence avec Pi-0, NVIDIA avec GR00T) autour des modèles vision-langage-action. La France et l'Europe restent absentes de cette vague spécifique de publications, la dynamique se concentrant pour l'instant sur les acteurs chinois (BAAI, Alibaba, CasiaHand, GalaxyBot) et américains. Les prochaines étapes attendues concernent la validation de ces architectures sur des déploiements réels au-delà des démonstrations en laboratoire, un point sur lequel la prudence reste de mise tant les métriques annoncées, notamment le nombre de paramètres ou de frames d'entraînement, restent difficiles à comparer d'un laboratoire à l'autre sans benchmarks communs.

Chine/AsieOpinion
1 source
Le talon d'Achille de la vision spatiale de l'IA incarnée enfin résolu : la percée de CMG Lab à IROS 2026
49Pandaily 

Le talon d'Achille de la vision spatiale de l'IA incarnée enfin résolu : la percée de CMG Lab à IROS 2026

Une équipe de recherche du LionRock AI Lab, rattaché à l'Institut de recherche en technologies avancées de China Merchants Group, publie à IROS 2026 une étude qui documente une fragilité critique des modèles Vision-Language-Action (VLA) : un déplacement de caméra de quelques millimètres seulement peut faire chuter de moitié le taux de réussite d'une tâche. Les chercheurs identifient trois formes d'apprentissage par raccourci. Le "Camera-Base Coupling" survient quand le modèle mémorise la position des objets par rapport à des coordonnées de caméra fixes plutôt que d'apprendre de vraies relations spatiales ; un changement de position de caméra fait chuter le taux de succès de 85% à 43% dans leurs tests. Le "Camera-Object Coupling" désigne une dépendance à des angles de vue spécifiques, le modèle traitant un même objet vu sous un angle différent comme une entité distincte. Le "Object-Position Coupling", le plus insidieux, apparaît même avec des données multi-vues si les relations entre objets restent fixes pendant la collecte : sur une tâche "saisir un stylo et le placer dans son support", le modèle atteint 95% de réussite tant que le support reste à sa position d'entraînement, mais chute à 72% dès que celui-ci est déplacé d'un seul diamètre, preuve que le modèle avait appris une coordonnée précise plutôt que le concept de "placer dans le support". Leur réponse, baptisée Hybrid Dynamic Data Collection (HDDC), introduit une variation contrôlée pendant la collecte de données en déplaçant dynamiquement caméra et objets, pour forcer l'apprentissage de relations spatiales réelles. Cette découverte pointe un obstacle central au déploiement de l'IA incarnée en conditions réelles : les benchmarks VLA actuels affichent des taux de succès supérieurs à 90% en conditions fixes, un chiffre qui ne dit rien de la robustesse face aux variations de position de caméra, d'éclairage ou d'agencement d'objets rencontrées hors laboratoire. En rendant explicite ce fossé entre démonstration et réalité opérationnelle, l'étude invite les intégrateurs et décideurs B2B à relativiser les métriques de succès communiquées par les fournisseurs de robots humanoïdes et de bras manipulateurs, et à exiger des tests en conditions variables avant tout déploiement industriel. L'atout de HDDC est d'être agnostique au modèle : la méthode a été validée sur plusieurs architectures VLA majeures avec une efficacité constante, ce qui en fait un correctif potentiellement générique plutôt qu'un patch propre à un seul système. Le diagnostic du LionRock AI Lab rejoint des constats similaires obtenus par des équipes de recherche conjointes Stanford-Google et Tongji-Fudan, ce qui suggère qu'il s'agit d'un problème systémique affectant l'ensemble du champ des modèles VLA, et non d'une faiblesse isolée à une architecture ou un laboratoire donné. L'article, intitulé "Hybrid Dynamic Data Collection: Breaking VLA Shortcut Learning for Spatial Generalization", ainsi que le code et les ressources associées, sont publiés en accès libre sur arXiv et GitHub, permettant à la communauté robotique de reproduire les tests de fragilité spatiale et d'évaluer HDDC sur leurs propres modèles avant l'intégration en environnement industriel.

RechercheActu
1 source
HIVE lève 15 millions de dollars pour développer une IA physique destinée aux machines industrielles
50Robotics Business Review 

HIVE lève 15 millions de dollars pour développer une IA physique destinée aux machines industrielles

HIVE, startup de physical AI basée à Londres avec des bureaux en Norvège, a annoncé une levée de 15 millions de dollars en pre-série A menée par SuperSeed, avec la participation de Veriten, Skyfall et Nysnø, ainsi que des investisseurs providentiels comme Børge Hald, fondateur de Medallia, et Jørn Lyseggen, fondateur de Meltwater. L'entreprise, dirigée par le cofondateur et PDG Christoffer Jørgensvaag, développe ce qu'elle appelle un "silicon brain", une couche d'intelligence unifiée qui permet à des engins industriels existants de percevoir leur environnement, de décider et d'agir de façon autonome. Concrètement, HIVE ne construit pas de nouveaux robots mais rétrofite des véhicules déjà en service, chargeuses sur pneus, engins d'entrepôts, de lignes de production ou de chantiers, en y ajoutant capteurs et caméras. Un déploiement est déjà opérationnel sur Vikafjellet, un des cols de montagne les plus exposés de Norvège, où le déminage des zones d'avalanche nécessitait auparavant d'attendre plusieurs heures la validation d'un géologue avant d'envoyer une équipe. Avec le silicon brain installé, l'opérateur de la société Presis Vegdrift peut désormais engager une chargeuse immédiatement, pilotée à distance depuis une salle de supervision sécurisée plutôt que depuis la cabine exposée. L'approche de HIVE tranche avec la course aux robots humanoïdes qui domine l'actualité physical AI: plutôt que de fabriquer une nouvelle plateforme robotique, l'entreprise mise sur le rétrofit de flottes industrielles déjà amorties, un pari pertinent pour les intégrateurs et décideurs B2B qui cherchent un retour sur investissement rapide sans remplacer leur parc machine. Le modèle commercial repose sur une boucle d'apprentissage par renforcement mutualisée entre toutes les machines déployées: chaque heure d'exploitation alimenterait cette boucle, avec un objectif affiché de réduction de 80% du coût de l'heure-machine productive. Ce chiffre, non encore audité indépendamment, reste à confirmer à l'échelle, mais illustre la logique de mutualisation des données propre aux acteurs de la conduite autonome industrielle. HIVE a construit ses premiers déploiements en Scandinavie avant d'entamer une expansion aux États-Unis, actuellement en cours. Le positionnement de l'entreprise la distingue des laboratoires centrés sur les modèles vision-langage-action pour robots humanoïdes, comme Physical Intelligence avec Pi-0 ou NVIDIA avec GR00T, en se concentrant plutôt sur l'autonomie de véhicules lourds déjà présents sur le terrain, mines, chantiers, entrepôts. Les prochaines étapes annoncées incluent le renforcement de l'équipe fondatrice, recrutée récemment à l'international, et l'extension des déploiements commerciaux auprès de partenaires industriels nouveaux et existants.

UELe déploiement opérationnel de HIVE en Norvège et sa base londonienne illustrent une approche de rétrofit industriel pertinente pour les acteurs européens du BTP et des mines, mais sans impact réglementaire ou institutionnel direct sur la France.

IA physiqueActu
1 source