Aller au contenu principal
Robot low-cost, banc de test ArmnetBench v0.1 pour évaluer des politiques de manipulation en parallèle
InfrastructurearXiv cs.RO 

Robot low-cost, banc de test ArmnetBench v0.1 pour évaluer des politiques de manipulation en parallèle

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont publié ArmnetBench v0.1, un benchmark d'évaluation en conditions réelles pour les politiques de manipulation robotique, exécuté sur une flotte de bras low-cost SO-101 sous supervision humaine légère sur site. Cette première version compare 7 politiques sur 12 tâches, en configuration bras unique et bimanuelle. Chaque politique est entraînée ou affinée sur 50 démonstrations par tâche. Le benchmark comptabilise 2 518 rollouts de politiques et 600 démonstrations de référence, soit 3 118 épisodes au total, chacun annoté selon une échelle à trois niveaux (réussite, sous-optimal, échec). Les rollouts sont notés manuellement, tandis que les démonstrations sont par construction considérées comme réussies. L'ensemble des 3 118 épisodes est publié en deux formats standards, LeRobot v3.0 et RoboMeter, pour faciliter la réutilisation par la communauté.

L'évaluation en conditions réelles reste le principal goulot d'étranglement du développement de politiques de manipulation généralistes : chaque rollout nécessite du matériel physique et un opérateur pour installer, réinitialiser et noter la tentative, ce qui limite fortement le volume de tests réalisables face aux simulateurs. En s'appuyant sur des bras SO-101 peu coûteux et une supervision réduite, ArmnetBench propose un compromis entre le coût d'un banc d'essai physique et la scalabilité recherchée pour comparer des politiques à grande échelle. Au-delà du classement, la valeur du jeu de données tient surtout à son étiquetage qualité par épisode : ces trajectoires annotées peuvent nourrir l'entraînement de modèles de récompense, de modèles du monde prédictifs, ou de politiques apprises sur des données de qualité mixte, un axe distinct de la simple mesure de performance.

Ce travail s'inscrit dans la lignée des efforts communautaires autour de l'écosystème LeRobot et des bras robotiques abordables comme le SO-101, popularisés notamment par Hugging Face pour démocratiser la recherche en manipulation hors des laboratoires équipés de bras industriels coûteux. Il fait écho aux benchmarks existants bâtis en simulation ou sur du matériel plus onéreux, en offrant une alternative reproductible à bas coût. Les auteurs présentent ce classement initial comme un point de départ sous budget partagé plutôt qu'une évaluation définitive, cette v0.1 servant avant tout à valider l'infrastructure de la ferme de bras de bout en bout. Les suites attendues incluent l'élargissement du nombre de tâches et de politiques comparées, ainsi que l'exploitation des données mixtes pour entraîner de nouveaux modèles.

Dans nos dossiers

À lire aussi

Planification à base d'agents en lots pour le service de politiques robotiques
1arXiv cs.RO 

Planification à base d'agents en lots pour le service de politiques robotiques

Des chercheurs du Georgia Tech (laboratoire RL2) publient un article intitulé "Action Chunk Scheduling for Batched Robot Policy Serving" (arXiv:2608.00337v1), qui pose un problème encore peu formalisé dans la robotique : comment servir un même modèle de politique robotique, hébergé sur un GPU distant, à plusieurs robots simultanément. Les auteurs présentent Armory, un système de service ("serving") conçu pour cet usage et validé à la fois sur des flottes de robots simulés et sur des robots réels. Leurs expériences montrent que les heuristiques de scheduling classiques (les méthodes de batching habituelles en inférence LLM) fonctionnent correctement tant que tous les robots de la flotte sont identiques et consomment les actions au même rythme. Mais dès que les robots consomment leurs "action chunks" (blocs d'actions produits par les modèles Vision-Language-Action) à des vitesses différentes, ces heuristiques échouent : elles ne tiennent pas compte des contraintes en boucle fermée ("closed-loop") propres à l'exécution de politiques robotiques. Pour corriger ce défaut, l'équipe propose un nouvel algorithme de scheduling qui intègre cette hétérogénéité de rythme entre robots, avec un gain de débit système mesuré jusqu'à 18 % lors d'essais réels. Le code et les détails sont disponibles sur gatech-rl2.github.io/actionchunkscheduling. Le résultat touche un point aveugle du déploiement à grande échelle des modèles fondation pour la robotique (VLA type Pi-0, GR00T N2, Helix ou autres) : le calcul embarqué est limité en puissance et en encombrement, ce qui pousse naturellement vers une inférence déportée sur GPU distant, mutualisée entre plusieurs robots pour amortir les coûts. Or les architectures de batching héritées du monde LLM, pensées pour du texte asynchrone, ignorent la contrainte physique du temps réel robotique : un robot qui épuise son buffer d'actions avant d'être resservi s'arrête ou dégrade sa trajectoire. Ce papier démontre empiriquement que cette mécanique de service compte autant que la qualité du modèle lui-même pour faire fonctionner une flotte hétérogène en production, un enjeu direct pour les intégrateurs qui veulent mutualiser l'inférence entre robots de générations ou de tâches différentes plutôt que de multiplier les cartes embarquées. Ce travail s'inscrit dans la vague récente de modèles VLA génériques (Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA, Helix de Figure) qui cherchent à démontrer un contrôle robotique à l'échelle d'une flotte plutôt qu'à l'unité, un terrain où l'infrastructure de service devient aussi critique que l'entraînement. En formalisant le problème comme un scheduling explicite et en le testant sur du matériel réel plutôt que seulement en simulation, les auteurs positionnent Armory comme une brique d'infrastructure réutilisable, potentiellement comparable aux serveurs d'inférence LLM (type vLLM) mais adaptée aux contraintes temps réel de la robotique. L'article ne précise pas de partenariat industriel ni de déploiement commercial annoncé ; il s'agit pour l'instant d'un résultat de recherche académique, avec du code ouvert, plutôt que d'un produit prêt à l'emploi.

InfrastructureActu
1 source
XPolicyLab : une norme unifiée et un écosystème ouvert pour l'évaluation et le déploiement de politiques robotiques
2arXiv cs.RO 

XPolicyLab : une norme unifiée et un écosystème ouvert pour l'évaluation et le déploiement de politiques robotiques

Un article publié sur arXiv (2608.09892v1) présente XPolicyLab, un standard unifié et un écosystème ouvert pour l'évaluation et le déploiement de politiques robotiques. Il ramène le coût d'intégration entre N modèles de politique et M environnements, jusqu'ici de O(N×M), à O(N+M), grâce à des schémas communs d'observation, d'action et de trajectoire et à une architecture client/serveur séparant l'inférence de la politique de l'exécution de l'environnement. L'écosystème intègre 42 politiques robotiques et normalise leur installation, leur débogage et leur évaluation ; le respect du standard fait passer l'effort d'intégration d'une politique type de plus de cinq heures à deux heures, puis à trente minutes avec des modules d'agent prêts à l'emploi. Les mêmes adaptateurs font tourner les simulateurs RoboTwin et RoboDojo ainsi que des protocoles d'évaluation sur robot réel via une seule interface, le tout publié sur xpolicylab.github.io. Cette fragmentation logicielle freine depuis longtemps la comparaison reproductible des politiques robotiques, notamment des modèles vision-langage-action (VLA) qui se multiplient sans convention commune de dépendances. Pour les intégrateurs et laboratoires qui testent plusieurs politiques sur plusieurs plateformes, ce coût quadratique explique pourquoi tant de comparatifs publiés restent partiels ou difficiles à reproduire. Les auteurs montrent que le code propre à chaque politique varie d'un ordre de grandeur alors que la boucle côté environnement reste quasi identique à une référence fixe, preuve que la complexité peut être confinée au seul modèle. Le fait que les mêmes adaptateurs couvrent simulation et robot physique constitue un argument concret, mais limité à l'ingénierie logicielle, pour atténuer l'écart entre démonstration et déploiement réel. Ce travail s'inscrit dans la multiplication récente des modèles de politique généralistes pour la robotique, chacun livré avec sa propre pile logicielle et ses propres simulateurs, ce qui rendait les comparaisons indépendantes coûteuses et rares. XPolicyLab se positionne comme une couche d'infrastructure neutre plutôt qu'un produit commercial, un rôle comparable à celui des formats d'échange communs adoptés ailleurs en machine learning. L'article ne mentionne aucun déploiement industriel ni partenariat avec un fabricant de robots : il s'agit d'une publication de recherche, pas d'une annonce produit, présentée comme une infrastructure partagée destinée à être étendue par la communauté avec de nouvelles politiques et de nouveaux environnements.

InfrastructureActu
1 source
NIST propose un benchmark de référence pour évaluer les performances des robots humanoïdes
3The Robot Report 

NIST propose un benchmark de référence pour évaluer les performances des robots humanoïdes

Le National Institute of Standards and Technology (NIST) a publié en avril 2026 une proposition de référentiel de performance standardisé pour les robots humanoïdes, décrit comme un ensemble de tâches de locomotion et de manipulation à faible empreinte logistique. C'est le premier cadre d'évaluation de ce type depuis le DARPA Robotics Challenge de 2015, selon Aaron Prather, directeur du programme Robotics & Autonomous Systems chez ASTM International. Le benchmark couvre quatre dimensions : la mobilité de base (agnostic au domaine d'application), la manipulation et la dextérité, les capacités combinées loco-manipulation, le contrôle en espace contraint, et un niveau minimal de raisonnement et de compréhension de scène. Le NIST prévoit de fabriquer un nombre limité d'appareils de test physiques pour les distribuer gratuitement aux fabricants américains d'humanoïdes et aux centres de test régionaux, et de publier les plans et modèles 3D pour usage en environnement physique ou virtuel (simulateurs de training et de développement de contrôle). Les données collectées seront agrégées sous des accords de partage préapprouvés protégeant la propriété intellectuelle. L'absence de standard commun est un problème structurel pour le secteur : Tesla Optimus, Figure, Agility Robotics, Apptronik, Unitree et une douzaine d'autres plateformes humanoïdes ont attiré des milliards de dollars d'investissement ces dix dernières années sans qu'il existe de méthode consensuelle pour mesurer ce qu'elles font réellement. Comme le note Prather, "les vidéos marketing ont comblé le vide". Pour un intégrateur industriel ou un décideur B2B, l'absence de benchmarks opposables rend toute comparaison entre plateformes impossible et ralentit les décisions d'achat. Ce référentiel, s'il est adopté, permettrait d'objectiver le fossé entre démo et déploiement réel, de quantifier les progrès en loco-manipulation et en whole-body control, et d'offrir aux chercheurs une baseline reproductible. Il représente aussi un signal réglementaire potentiel : un benchmark NIST peut devenir une norme de fait pour les appels d'offres gouvernementaux américains. Ce projet s'appuie sur la collaboration antérieure du NIST avec le DARPA pour évaluer les capacités humanoïdes dans l'industrie et la recherche académique. En Europe, le Fraunhofer IPA (Stuttgart) a publié ce mois-ci son propre référentiel de sécurité et de développement pour humanoïdes, structuré autour de six critères, signalant que la course aux standards est désormais transatlantique. Aucun acteur français ou européen n'est directement impliqué dans la proposition NIST à ce stade, bien que des entreprises comme Enchanted Tools ou Wandercraft pourraient être concernées si ce cadre influence les standards ISO ou CEN. Le NIST est en phase de consultation et recherche des participants, fabricants comme labos, pour affiner la liste des tâches et tester leurs robots dans les installations NIST ou partenaires. Aucune date de finalisation n'est annoncée.

UELe Fraunhofer IPA a publié ce même mois son propre référentiel de sécurité pour humanoïdes, signalant une course transatlantique aux standards ; si le benchmark NIST influence les normes ISO/CEN, des acteurs européens comme Enchanted Tools ou Wandercraft devront adapter leur processus de qualification.

InfrastructureOpinion
1 source
RoboWM-Bench : un benchmark pour évaluer les modèles du monde en manipulation robotique
4arXiv cs.RO 

RoboWM-Bench : un benchmark pour évaluer les modèles du monde en manipulation robotique

Une équipe de chercheurs a déposé sur arXiv (identifiant 2604.19092) RoboWM-Bench, un benchmark dédié à l'évaluation des world models vidéo pour la manipulation robotique. Le protocole est exigeant : les comportements générés par ces modèles, à partir de vidéos de mains humaines ou de robots en action, sont convertis en séquences d'actions exécutables, puis validés par exécution réelle sur robot physique. Les évaluations conduites sur les meilleurs world models actuels sont sans appel : produire des comportements physiquement exécutables de manière fiable reste un problème ouvert. Les modes d'échec récurrents identifiés incluent les erreurs de raisonnement spatial, la prédiction instable des contacts entre effecteur et objet, et les déformations non physiques de matériaux. Un fine-tuning sur données de manipulation améliore les résultats, mais les incohérences physiques persistent. Ce constat soulève une question stratégique pour l'industrie : peut-on utiliser des world models comme simulateurs bon marché pour générer des données d'entraînement, en remplacement des démonstrations terrain coûteuses ? Le réalisme visuel d'une vidéo générée ne garantit pas sa plausibilité physique, une distinction que les benchmarks existants, majoritairement orientés perception ou diagnostic, ne permettaient pas de mesurer. En imposant la validation par exécution réelle comme critère central, RoboWM-Bench dépasse les métriques habituelles de cohérence temporelle ou de FID. Pour les équipes engineering et les intégrateurs, la conclusion est opérationnelle : les world models actuels ne sont pas encore substituables aux démonstrations réelles pour l'apprentissage de politiques de manipulation précise. L'intérêt pour les world models en robotique s'est intensifié depuis 2024, porté par des modèles génératifs comme Sora (OpenAI), Genie 2 (Google DeepMind) ou UniSim, et alimenté par les avancées des VLA (Vision-Language-Action). L'hypothèse qu'un monde simulé pourrait tenir lieu de terrain d'entraînement, évitant la collecte de données réelles, est au coeur des investissements d'une dizaine de startups et labos académiques actifs sur ce créneau. RoboWM-Bench s'inscrit dans une dynamique de standardisation comparable à ce que RoboMimic ou MetaWorld ont établi pour l'imitation learning : un protocole unifié et reproductible. Aucune affiliation institutionnelle ni timeline d'extension du benchmark ne figurent dans le preprint, ce qui en limite la portée immédiate, mais la publication envoie un signal net : la communauté robotique commence à exiger des preuves d'exécutabilité physique, et non plus seulement de cohérence visuelle.

RecherchePaper
1 source