InfrastructureThe Robot Report2sem

NVIDIA publie de nouveaux outils et des mises à jour pour les développeurs d'IA physique

1 source couvre ce sujet·Source originale ↗·

Résumé IASource uniqueImpact UE

Lors du GTC Taipei et du Computex, NVIDIA a dévoilé un ensemble de nouveaux outils open-source rassemblés sous le nom NVIDIA Agent Toolkit, destinés aux développeurs de systèmes d'IA physique : robotique, véhicules autonomes, vision industrielle et jumeaux numériques. L'objectif affiché est de réduire le coût et la complexité des pipelines de développement en rendant l'ensemble de la pile logicielle de NVIDIA directement orchestrable par des agents IA. Les outils concernés incluent Cosmos 3, le modèle de fondation pour la compréhension du monde physique (vidéo, texte, prédiction d'états futurs), les bibliothèques Omniverse pour la simulation et les jumeaux numériques, Isaac pour la robotique, Metropolis pour la vision IA, Alpamayo pour la conduite autonome, et la plateforme Jetson pour le déploiement embarqué. Le déploiement sécurisé de ces agents est encadré par le blueprint NemoClaw et le runtime OpenShell, qui appliquent des politiques de sécurité et de confidentialité en local comme dans le cloud.

L'approche "agent-ready" de NVIDIA marque un changement de paradigme dans le développement de l'IA physique : plutôt que des bibliothèques que les ingénieurs assemblent manuellement, les outils deviennent des briques directement appelables par des agents de codage, capables d'enchaîner automatiquement génération de données, simulation, entraînement et évaluation. Pour les développeurs de véhicules autonomes, cela signifie qu'un agent peut reconstruire des scènes à partir de données de flotte, générer des scénarios de conduite photoréalistes et lancer des boucles de renforcement sans intervention manuelle à chaque étape. Pour les intégrateurs robotiques, des tâches comme l'automatisation de l'entraînement à la navigation ou le tuning de systèmes Jetson deviennent théoriquement scriptables. Rev Lebaredian, vice-président pour la simulation d'IA physique chez NVIDIA, a qualifié Cosmos 3 de "modèle de fondation frontier pour l'IA physique", capable de comprendre vidéo et texte, de prédire les états futurs et de générer des actions, positionnant ce world model comme un candidat généraliste opérationnel, même si aucune métrique de benchmark indépendante n'a été communiquée à ce stade.

NVIDIA consolide avec cette annonce sa position d'infrastructure de référence pour l'IA physique, un rôle qu'elle occupe via ses GPU d'entraînement et ses plateformes Isaac Sim et Jetson. La compétition dans ce segment s'intensifie : Google DeepMind pousse MuJoCo et ses dérivés, Boston Dynamics, Figure, Agility Robotics et Physical Intelligence développent leurs propres stacks de simulation et d'apprentissage, tandis que des acteurs industriels comme Siemens ou ANSYS occupent le terrain des jumeaux numériques. En Europe, des entreprises comme Wandercraft ou Enchanted Tools pourraient bénéficier de ces outils si la promesse de réduction de complexité se confirme en pratique. NVIDIA joue ici la carte de la plateforme unifiée plutôt que du modèle de fondation isolé, un positionnement cohérent avec son modèle d'affaires mais qui reste à valider au-delà des démonstrations internes. Les suites annoncées incluent des applications en santé, dont le détail n'a pas été entièrement communiqué lors de l'événement.

Impact France/UE

Les entreprises françaises comme Wandercraft et Enchanted Tools pourraient bénéficier de la réduction de complexité annoncée, mais aucun déploiement européen concret n'est confirmé à ce stade.

Dans nos dossiers

Boston Dynamics Agility Robotics — Digit Wandercraft Enchanted Tools — Mirokaï

À lire aussi

1Pandaily

Lightwheel AI lève un nouveau tour de table pour développer son infrastructure de données et de simulation pour l'IA physique

Lightwheel AI, startup pékinoise spécialisée dans l'infrastructure de données et de simulation pour l'IA physique, vient de boucler un nouveau tour de financement dont le montant n'a pas été divulgué. Les fonds seront affectés à trois axes : élargir les capacités de livraison, accélérer l'expansion internationale, et renforcer les partenariats avec des fabricants de robots, des développeurs de véhicules autonomes et des industriels. La société propose un triptyque de services : génération de données d'entraînement synthétiques haute qualité, environnements de simulation pour l'entraînement de modèles, et frameworks d'évaluation et de vérification. Son positionnement repose sur une boucle fermée couvrant la collecte terrain, le développement de simulateurs, l'évaluation et le déploiement en production. La technologie centrale est une approche propriétaire baptisée "calibration sur données réelles + amplification par simulation" : des données capteurs réelles servent de base de calibration, puis la simulation génère des jeux de données synthétiques à grande échelle qui reproduisent les propriétés statistiques du réel tout en étendant la couverture des cas limites et scénarios rares. Ce tour illustre une conviction croissante dans le secteur : avant d'entraîner des robots ou des VLA (Vision-Language-Action models) performants, il faut disposer d'une infrastructure de données robuste et reproductible. La plupart des acteurs de l'IA physique butent aujourd'hui sur le "sim-to-real gap" et sur le coût prohibitif de la collecte de données en environnement réel. Une approche de type "real data calibration + sim amplification" vise précisément à réduire ce coût tout en préservant la validité statistique des données, un défi technique non trivial. Si la méthode s'avère scalable, elle pourrait raccourcir significativement les cycles de développement pour les intégrateurs robotiques et réduire la dépendance aux flottes de collecte physique, aujourd'hui l'un des postes de coût les plus lourds du secteur. Matrix Partners China avait déjà mené le tour Pre-A de Lightwheel en décembre 2023, puis sursouscrit le Pre-A+ suivant, s'établissant comme principal investisseur institutionnel de la société. Ce suivi répété est un signal fort, dans un contexte où l'écosystème de l'IA physique chinois s'organise rapidement autour de couches d'infrastructure distinctes : données, simulation, fondation model, application. Les concurrents directs sur ce segment incluent des acteurs comme Scale AI ou Rendered.ai côté occidental, et plusieurs startups chinoises moins visibles à l'international. Le managing partner Tong Ti a déclaré que 2025-2026 marque "l'année du déploiement à l'échelle" pour l'IA physique, ce qui reste un cadrage marketing à surveiller : le passage de la démonstration au déploiement industriel réel, surtout dans la robotique humanoïde, prend systématiquement plus de temps qu'annoncé. Aucun client nommé, aucun volume de données chiffré, aucun site de déploiement mentionné dans le communiqué, ce qui limite pour l'instant l'évaluation indépendante des affirmations techniques.

InfrastructureActu

1 source

2NVIDIA Blog Robotics

NVIDIA Jetson amène l'IA à base d'agents dans le monde physique

Lors du salon COMPUTEX à Taipei le 27 mai 2026, NVIDIA a annoncé JetPack 7.2 et le support de NemoClaw sur la plateforme Jetson, marquant une étape concrète dans le déploiement de l'IA agentique sur des systèmes embarqués physiques. JetPack 7.2 apporte le support du projet Yocto pour une distribution Linux allégée et personnalisable, CUDA 13 sur Jetson Orin, et le support MIG (Multi-Instance GPU) couplé à un noyau temps réel sur Jetson Thor, permettant de réserver des ressources GPU dédiées à des tâches déterministes comme la perception robotique. Le module Jetson AGX Orin 32 Go gagne également 20 % de performances, atteignant 241 TOPS d'inférence IA. NemoClaw, le framework agentique de NVIDIA, se déploie désormais sur Jetson en une seule commande. Deux partenaires sont déjà en production : Solomon, qui utilise NemoClaw pour coordonner raisonnement, perception, fusion de capteurs, locomotion et manipulation sur un robot humanoïde, et Advantech, qui déploie un "cerveau d'usine agentique" dans ses propres lignes de fabrication en combinant NemoClaw, Nemotron 3 et Jetson Thor pour la gestion de flottes robotiques et l'inspection de défauts. L'importance de cette annonce réside dans le passage de l'IA agentique des serveurs vers les systèmes embarqués en production industrielle, un écart que l'industrie peinait à combler. L'architecture en trois couches proposée, OS + compute en base (JetPack), skills d'automatisation développeur au milieu, et NemoClaw en orchestrateur applicatif au sommet, permet aux intégrateurs de construire des workflows agentiques complets sans infrastructure cloud. Pour un COO industriel ou un ingénieur robotique, le gain annoncé est celui du time-to-market : des tâches de déploiement et de configuration qui prenaient plusieurs semaines peuvent désormais être réduites à quelques jours grâce aux agent skills dérivées de la documentation officielle NVIDIA. Le support MIG sur Thor est particulièrement significatif pour les applications robotiques réelles, où l'inférence temps réel ne peut pas être interrompue par des tâches d'IA concurrentes. Il faut toutefois noter que les chiffres de performance et les gains de productivité annoncés proviennent du communiqué de presse NVIDIA lui-même, sans benchmark indépendant disponible à ce stade. La plateforme Jetson est déjà déployée dans des secteurs variés, notamment la robotique industrielle, les drones, les dispositifs médicaux, les machines agricoles et les systèmes humanoïdes, et constitue depuis plusieurs générations, Orin puis Thor, l'un des compute modules embarqués les plus répandus dans l'industrie. NemoClaw s'inscrit dans la stratégie d'NVIDIA de descendre son stack agentique, initialement développé pour les serveurs DGX, vers l'edge et les systèmes physiques autonomes. Sur le plan concurrentiel, cette annonce positionne NVIDIA face à des alternatives edge comme Qualcomm (RB5/RB6 pour la robotique) et Google Coral, mais aussi face aux SOC propriétaires développés par Boston Dynamics, Figure ou 1X pour leurs propres humanoïdes. Les prochaines étapes annoncées incluent l'extension des Metropolis VSS blueprint skills pour l'interprétation visuelle agentique, et la diffusion de l'événement Build-a-Claw à Taiwan, signe que NVIDIA cherche à ancrer son écosystème développeur en Asie du Sud-Est, région clé pour la fabrication électronique et robotique mondiale.

UELes intégrateurs robotiques européens sur Jetson Orin/Thor peuvent déployer des workflows agentiques complets sans cloud, réduisant potentiellement le time-to-market de plusieurs semaines à quelques jours, gain concret pour l'automatisation industrielle EU, sans validation indépendante à ce stade.

InfrastructureOpinion

1 source

3Pandaily

Hesai dévoile sa stratégie et de nouveaux produits pour redéfinir l'infrastructure d'IA physique, de l'automobile à la robotique

Le 17 avril 2026, Hesai Technology (NASDAQ: HSAI, HKEX: 2525) a tenu son Technology Open Day annuel pour dévoiler le Picasso SPAD-SoC, présenté comme le premier chip LiDAR 6D full-color au monde. Ce circuit intègre à la fois la détection couleur RGB et la mesure de distance par temps de vol (TOF) au niveau pixel, générant directement des nuages de points colorés sans post-traitement. Le LiDAR traditionnel se limite aux trois dimensions spatiales XYZ ; le Picasso ajoute la teinte (RGB), portant à six les dimensions de perception simultanée. Son efficacité de détection photonique (PDE) dépasse 40 %, ce qui permet de détecter des objets plus lointains et de mieux performer en faible luminosité. Ce chip alimente la série ETX, plateforme LiDAR full-color dépassant 1 000 lignes, disponible en configurations 1 080, 2 160 et 4 320 lignes. En version haute résolution, le ETX affiche une portée jusqu'à 600 mètres, 400 mètres à 10 % de réflectivité, et est capable d'identifier une barrière de chantier à 300 mètres, un petit animal à 280 mètres, ou un bloc de bois à 150 mètres. La mise en production de masse est prévue pour le second semestre 2026, avec un déploiement sur des modèles phares attendu entre 2027 et 2028. L'annonce repositionne Hesai sur un marché en pleine redéfinition : le passage de la voiture autonome de niveau 2+ vers le L3 exige que le LiDAR passe du statut de composant optionnel à celui de système de sécurité critique. Les architectures véhicules basculent vers des configurations multi-LiDAR (typiquement 3 à 6 capteurs pour une couverture 360°), ce qui démultiplie les volumes par véhicule. Le fait que Hesai soit aujourd'hui le seul fabricant de LiDAR à développer en interne l'intégralité de ses sept composants clés, lasers, détecteurs, drivers, TIA, ADC, DSP et contrôleurs, lui confère une autonomie verticale rare dans un secteur très dépendant des fournisseurs asiatiques de semi-conducteurs. Avec 21 puces certifiées AEC-Q, 230 millions d'unités livrées cumulées et des commandes constructeurs dépassant les 6 millions d'unités pour les seuls produits basés sur le Fermi C500 (lancé en novembre 2025 sur architecture RISC-V), Hesai présente des métriques de commercialisation réels, pas seulement des démonstrations de laboratoire. Fondée à Shanghai, Hesai a construit son écosystème chip en cinq générations de R&D. La dénomination "Picasso", référence au peintre cubiste et à sa maîtrise de la représentation multidimensionnelle, marque symboliquement le pivot stratégique de l'entreprise vers ce qu'elle appelle l'"intelligence spatiale", matérialisé par le nouveau produit Kosmo (hardware IA spatial) et une direction inédite autour de modules d'alimentation pour la robotique. Sur ce dernier segment, Hesai entre en compétition directe avec des acteurs comme Ouster (désormais Ouster-Velodyne fusionné avec Sense Photonics), Luminar, ou encore RoboSense, qui ciblent tous la robotique humanoïde et les AMR industriels. Hesai prévoit que ses livraisons cumulées dépasseront 300 millions d'unités d'ici fin 2026. Les prochaines étapes attendues concernent les homologations L3 par les constructeurs partenaires et les premières intégrations Kosmo dans des environnements de test physique AI, mais aucun client ni calendrier précis n'a été communiqué sur ces deux points.

InfrastructureActu

1 source

4arXiv cs.RO

Données et standards pour la robotique humanoïde : l'infrastructure manquante de l'IA physique

Un groupe de chercheurs impliqués dans l'élaboration de la norme ISO/WD 26264-1 au sein du comité technique ISO/TC 299/WG 16 publie un préprint arXiv (2606.19769, juin 2026) posant que la standardisation des données constitue le prochain verrou critique pour les robots humanoïdes. Leur thèse centrale: le goulot d'étranglement n'est pas seulement la rareté des données, mais leur caractère non cumulatif, causé par des coûts de collecte élevés, des silos organisationnels et des protocoles d'évaluation incompatibles. Les auteurs identifient trois conditions pour qu'un jeu de données soit réutilisable: l'expérience physique doit rester liée au corps du robot, à la tâche et au contexte d'exécution; les flux multimodaux doivent partager synchronisation temporelle, repères de coordonnées, calibration et unités documentées; les données doivent enfin être versionnées et traçables pour s'accumuler entre projets et organisations. L'enjeu est direct pour les équipes qui entraînent des modèles VLA (Vision-Language-Action) comme pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure AI. Sans grammaire commune (métadonnées, provenance, versioning), chaque acteur repart de zéro à chaque nouveau déploiement. Pour un intégrateur industriel, cela signifie concrètement que des données collectées sur un site ne peuvent pas réentraîner un modèle sur un autre, même avec du matériel identique. L'article recadre le "sim-to-real gap" non pas comme un problème de simulation, mais comme un déficit d'alignement des référentiels physiques entre jeux de données: les hypothèses de synchronisation et de cinématique, si elles ne sont pas documentées, rendent les flux non interopérables dès le départ. La norme proposée s'articule en deux couches: une infrastructure horizontale couvrant le cycle de vie, les métadonnées, la qualité, le versioning et la traçabilité, et des parties spécifiques par capacité (manipulation, locomotion, interaction humain-robot, cognition). Le contexte est celui d'un secteur ou Figure AI, Boston Dynamics, Tesla (Optimus Gen 3), Unitree et 1X accumulent des données de manière cloisonnée, tandis que des initiatives ouvertes comme Open X-Embodiment (Google DeepMind) ou LeRobot (HuggingFace) posent des bases communes sans force normative. Le préprint est en phase WD (Working Draft) sans date de ratification annoncée: c'est une prise de position académique, pas une norme publiée ni un déploiement industriel.

UESi ratifiée, la norme ISO/WD 26264-1 structurera les pratiques de données des acteurs européens de la robotique humanoïde ; HuggingFace (Paris) est déjà cité comme contributeur aux bases ouvertes communes (LeRobot), sans force normative à ce stade.

InfrastructureOpinion

1 source