Aller au contenu principal
NIST propose un benchmark de référence pour évaluer les performances des robots humanoïdes
InfrastructureThe Robot Report 

NIST propose un benchmark de référence pour évaluer les performances des robots humanoïdes

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Le National Institute of Standards and Technology (NIST) a publié en avril 2026 une proposition de référentiel de performance standardisé pour les robots humanoïdes, décrit comme un ensemble de tâches de locomotion et de manipulation à faible empreinte logistique. C'est le premier cadre d'évaluation de ce type depuis le DARPA Robotics Challenge de 2015, selon Aaron Prather, directeur du programme Robotics & Autonomous Systems chez ASTM International. Le benchmark couvre quatre dimensions : la mobilité de base (agnostic au domaine d'application), la manipulation et la dextérité, les capacités combinées loco-manipulation, le contrôle en espace contraint, et un niveau minimal de raisonnement et de compréhension de scène. Le NIST prévoit de fabriquer un nombre limité d'appareils de test physiques pour les distribuer gratuitement aux fabricants américains d'humanoïdes et aux centres de test régionaux, et de publier les plans et modèles 3D pour usage en environnement physique ou virtuel (simulateurs de training et de développement de contrôle). Les données collectées seront agrégées sous des accords de partage préapprouvés protégeant la propriété intellectuelle.

L'absence de standard commun est un problème structurel pour le secteur : Tesla Optimus, Figure, Agility Robotics, Apptronik, Unitree et une douzaine d'autres plateformes humanoïdes ont attiré des milliards de dollars d'investissement ces dix dernières années sans qu'il existe de méthode consensuelle pour mesurer ce qu'elles font réellement. Comme le note Prather, "les vidéos marketing ont comblé le vide". Pour un intégrateur industriel ou un décideur B2B, l'absence de benchmarks opposables rend toute comparaison entre plateformes impossible et ralentit les décisions d'achat. Ce référentiel, s'il est adopté, permettrait d'objectiver le fossé entre démo et déploiement réel, de quantifier les progrès en loco-manipulation et en whole-body control, et d'offrir aux chercheurs une baseline reproductible. Il représente aussi un signal réglementaire potentiel : un benchmark NIST peut devenir une norme de fait pour les appels d'offres gouvernementaux américains.

Ce projet s'appuie sur la collaboration antérieure du NIST avec le DARPA pour évaluer les capacités humanoïdes dans l'industrie et la recherche académique. En Europe, le Fraunhofer IPA (Stuttgart) a publié ce mois-ci son propre référentiel de sécurité et de développement pour humanoïdes, structuré autour de six critères, signalant que la course aux standards est désormais transatlantique. Aucun acteur français ou européen n'est directement impliqué dans la proposition NIST à ce stade, bien que des entreprises comme Enchanted Tools ou Wandercraft pourraient être concernées si ce cadre influence les standards ISO ou CEN. Le NIST est en phase de consultation et recherche des participants, fabricants comme labos, pour affiner la liste des tâches et tester leurs robots dans les installations NIST ou partenaires. Aucune date de finalisation n'est annoncée.

Impact France/UE

Le Fraunhofer IPA a publié ce même mois son propre référentiel de sécurité pour humanoïdes, signalant une course transatlantique aux standards ; si le benchmark NIST influence les normes ISO/CEN, des acteurs européens comme Enchanted Tools ou Wandercraft devront adapter leur processus de qualification.

À lire aussi

Clé du progrès des humanoïdes : gérer l'énergie derrière les robots
1Robotics Business Review 

Clé du progrès des humanoïdes : gérer l'énergie derrière les robots

Murata Power Solutions présente, dans cet épisode du podcast Designing the Future animé par Jim Anderton, les défis d'ingénierie liés à l'alimentation électrique des robots humanoïdes. John Quinlan, Senior Engineering Manager chez Murata Power Solutions (Boston), y détaille pourquoi la gestion de l'énergie embarquée devient le facteur limitant des performances robotiques. Alors que la vitesse, la mobilité, la dextérité, la vision et les interfaces utilisateur des humanoïdes progressent à un rythme soutenu, avec des annonces quasi hebdomadaires dans le secteur, la conversion de l'énergie stockée en batteries ou en piles à combustible embarquées vers les formes utilisables par la mécatronique et l'électronique de contrôle reste un point de blocage physique incontournable. Murata y présente sa gamme de convertisseurs de puissance compacts et à haut rendement, couvrant un large spectre de besoins, des applications de faible puissance jusqu'aux systèmes de forte puissance, destinés aux marchés industriels, médicaux, des télécommunications et de l'information. Ce constat rappelle une réalité souvent éclipsée par les vitrines spectaculaires des démonstrations d'humanoïdes: la performance perçue d'un robot, qu'il s'agisse de sa vitesse de déplacement ou de la fluidité de ses gestes, dépend directement de l'efficacité de sa chaîne d'alimentation électrique. Pour les intégrateurs et décideurs industriels, ce rappel a une portée concrète: l'autonomie, le poids embarqué et la fiabilité thermique d'un humanoïde ne se jouent pas uniquement dans les algorithmes de contrôle moteur ou les modèles vision-langage-action, mais aussi dans des composants moins visibles comme les convertisseurs DC-DC et la gestion thermique de l'électronique de puissance. C'est un angle mort fréquent des comparatifs entre plateformes comme Figure 03, Optimus ou Atlas, qui se concentrent sur le payload, les degrés de liberté ou le temps de cycle sans détailler l'architecture énergétique sous-jacente. Ce format podcast s'inscrit dans une série éditoriale de The Robot Report consacrée aux coulisses techniques de la robotique, où des fournisseurs de composants critiques mais peu médiatisés, capteurs, actionneurs, systèmes d'alimentation, prennent la parole aux côtés des géants de l'humanoïde. Murata Power Solutions, filiale du groupe japonais Murata Manufacturing, est un acteur établi de longue date dans l'électronique de puissance pour environnements contraints, bien avant l'essor actuel des humanoïdes commerciaux. Aucune annonce de produit spécifique aux humanoïdes n'est faite ici: il s'agit d'un contenu de positionnement technique et commercial, destiné à installer Murata comme fournisseur de référence auprès des concepteurs de robots à mesure que la demande en solutions d'alimentation embarquée haute densité s'intensifie.

InfrastructureActu
1 source
Fraunhofer IPA propose un nouveau banc de test pour robots humanoïdes
2Robotics Business Review 

Fraunhofer IPA propose un nouveau banc de test pour robots humanoïdes

Le Fraunhofer IPA, l'un des principaux instituts de recherche en automatisation en Allemagne, a publié un référentiel d'évaluation standardisé pour les robots humanoïdes, avec pour premier cobaye le Unitree G1 EDU-4 équipé des mains trois doigts Dex3-1, livré en mai 2025 sous firmware version 1.04. Ce benchmark se décompose en six catégories applicatives couvrant les capacités de base (capteurs vision, audio, reconnaissance vocale, détection humaine), la manipulation (type de préhenseur, mobilité des doigts, forces de saisie), la sécurité (mesures de forces de collision selon ISO 10218 et ISO TS 15066), la propreté (qualification selon ISO 14644, norme sous laquelle l'IPA a déjà certifié plus de 3 000 composants d'automatisation), ainsi que des indicateurs de mobilité et de fiabilité opérationnelle. Le service est modulaire et disponible pour les fabricants, les utilisateurs finaux et les éditeurs de logiciels, qui peuvent sélectionner les volets pertinents selon leur application. L'initiative répond à un problème structurel qui freine l'adoption industrielle des humanoïdes : l'absence de données comparatives neutres et reproductibles. Les annonces marketing de Figure, Tesla, Boston Dynamics ou Agility Robotics s'appuient sur des vidéos sélectionnées et des démos en conditions contrôlées, rendant quasi impossible toute évaluation objective pour un intégrateur ou un COO cherchant à qualifier un robot pour une ligne de production réelle. "Le marché est trop volatile et opaque pour permettre une évaluation fondée des humanoïdes pour ses propres applications", résume Simon Schmidt, directeur senior de l'unité systèmes automatisés à l'IPA. En ancrant le benchmark sur des normes industrielles reconnues internationalement, l'institut cherche à combler le fossé entre le hype médiatique et les capacités réelles, et à rendre les résultats directement interprétables par des ingénieurs et des décideurs sans expertise robotique préalable. Le Fraunhofer IPA s'inscrit dans un contexte de multiplication des initiatives de standardisation autour des humanoïdes. Aux États-Unis, l'IEEE et l'ASTM travaillent sur des protocoles similaires, tandis que des acteurs comme Apptronik, Fourier Intelligence ou Sanctuary AI réclament des cadres communs pour accélérer la confiance des industriels. Côté français, des entreprises comme Enchanted Tools ou Wandercraft évoluent dans un écosystème encore dépourvu de tels référentiels, ce qui rend le travail de l'IPA potentiellement structurant pour les décideurs européens. Werner Kraus, responsable de la division automatisation et robotique à l'IPA, précise que le benchmark a été conçu pour rester pertinent sur les générations futures de robots, avec des tests reproductibles et standardisables. Les résultats complets de l'évaluation du Unitree G1 devaient être présentés au Robotics Summit & Expo de Boston ce mois-ci, avec des sessions dédiées aux humanoïdes industriels.

UELe Fraunhofer IPA fournit aux industriels européens, dont des acteurs français comme Enchanted Tools et Wandercraft, un premier référentiel neutre basé sur des normes ISO (10218, TS 15066, 14644) pour évaluer objectivement les robots humanoïdes avant déploiement en production.

FR/EU ecosystemeOpinion
1 source
Robot low-cost, banc de test ArmnetBench v0.1 pour évaluer des politiques de manipulation en parallèle
3arXiv cs.RO 

Robot low-cost, banc de test ArmnetBench v0.1 pour évaluer des politiques de manipulation en parallèle

Des chercheurs ont publié ArmnetBench v0.1, un benchmark d'évaluation en conditions réelles pour les politiques de manipulation robotique, exécuté sur une flotte de bras low-cost SO-101 sous supervision humaine légère sur site. Cette première version compare 7 politiques sur 12 tâches, en configuration bras unique et bimanuelle. Chaque politique est entraînée ou affinée sur 50 démonstrations par tâche. Le benchmark comptabilise 2 518 rollouts de politiques et 600 démonstrations de référence, soit 3 118 épisodes au total, chacun annoté selon une échelle à trois niveaux (réussite, sous-optimal, échec). Les rollouts sont notés manuellement, tandis que les démonstrations sont par construction considérées comme réussies. L'ensemble des 3 118 épisodes est publié en deux formats standards, LeRobot v3.0 et RoboMeter, pour faciliter la réutilisation par la communauté. L'évaluation en conditions réelles reste le principal goulot d'étranglement du développement de politiques de manipulation généralistes : chaque rollout nécessite du matériel physique et un opérateur pour installer, réinitialiser et noter la tentative, ce qui limite fortement le volume de tests réalisables face aux simulateurs. En s'appuyant sur des bras SO-101 peu coûteux et une supervision réduite, ArmnetBench propose un compromis entre le coût d'un banc d'essai physique et la scalabilité recherchée pour comparer des politiques à grande échelle. Au-delà du classement, la valeur du jeu de données tient surtout à son étiquetage qualité par épisode : ces trajectoires annotées peuvent nourrir l'entraînement de modèles de récompense, de modèles du monde prédictifs, ou de politiques apprises sur des données de qualité mixte, un axe distinct de la simple mesure de performance. Ce travail s'inscrit dans la lignée des efforts communautaires autour de l'écosystème LeRobot et des bras robotiques abordables comme le SO-101, popularisés notamment par Hugging Face pour démocratiser la recherche en manipulation hors des laboratoires équipés de bras industriels coûteux. Il fait écho aux benchmarks existants bâtis en simulation ou sur du matériel plus onéreux, en offrant une alternative reproductible à bas coût. Les auteurs présentent ce classement initial comme un point de départ sous budget partagé plutôt qu'une évaluation définitive, cette v0.1 servant avant tout à valider l'infrastructure de la ferme de bras de bout en bout. Les suites attendues incluent l'élargissement du nombre de tâches et de politiques comparées, ainsi que l'exploitation des données mixtes pour entraîner de nouveaux modèles.

InfrastructureActu
1 source
ROSA : un système d'inférence de modèles fondation pour usines de robots
4arXiv cs.RO 

ROSA : un système d'inférence de modèles fondation pour usines de robots

Une équipe de recherche propose ROSA, un système de service d'inférence pour les modèles fondation de robotique (RFM), décrit dans un preprint publié sur arXiv (2607.01088, 1er juillet 2026). Contrairement aux systèmes existants qui traitent l'inférence comme un problème de calcul en périphérie, avec un GPU embarqué ou dédié par robot, ROSA repose sur trois principes: un pool de GPU partagé accessible en réseau par toute une flotte de robots, une abstraction de programmation "robotics-aware" gérant des pipelines multi-modèles avec exigences de performance par tâche et gestion des échecs, et un ordonnancement piloté par l'objectif global de l'usine plutôt que par la latence d'une seule requête. L'équipe l'a implémenté sur Ray Serve pour l'orchestration distribuée, avec vLLM, PyTorch et JAX comme moteurs d'inférence, et l'a évalué sur des robots réels ainsi que sur des charges de travail synthétiques à grande échelle. Résultat annoncé: jusqu'à 12,06 fois plus de productivité d'usine qu'avec des systèmes de service dédiés classiques, un chiffre qui reste à confirmer sur des déploiements industriels réels plutôt que sur les scénarios de test choisis par les auteurs. L'intérêt de ROSA est de remettre en cause l'hypothèse dominante selon laquelle l'inférence d'un modèle de robot doit tourner localement, robot par robot. En mutualisant des GPU de classe serveur sur le réseau, l'approche promet de meilleures performances d'inférence, une autonomie de batterie accrue et un taux d'utilisation GPU plus élevé, des enjeux critiques pour les industriels qui envisagent des flottes de robots humanoïdes ou mobiles plutôt que des unités isolées. Cela rapproche l'infrastructure de service robotique du modèle déjà adopté pour les grands modèles de langage en cloud, un signal utile pour les intégrateurs et décideurs qui raisonnent en coût par flotte plutôt qu'en coût par robot. Le travail s'inscrit dans la vague plus large des modèles fondation de robotique (VLA) qui rendent les robots généralistes envisageables en usine, où l'inférence reste souvent le goulot d'étranglement plutôt que l'apprentissage lui-même. Il s'agit ici d'une contribution académique, pas d'un produit commercialisé: aucun acteur français ou européen n'est cité, et le passage à l'échelle en production reste à démontrer au-delà des bancs d'essai présentés.

InfrastructureActu
1 source