Aller au contenu principal
Un future, tous les robots : prédiction de l'état collectif avec JEPA décentralisé, efficace en étiquetage
RecherchearXiv cs.RO 

Un future, tous les robots : prédiction de l'état collectif avec JEPA décentralisé, efficace en étiquetage

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Traduction et résumé en français :

Des chercheurs présentent CS-JEPA (Collective-State JEPA), une architecture récurrente d'apprentissage par embeddings partagés permettant à chaque robot d'un essaim de prédire un même état collectif futur à partir de ses seules observations locales et de messages limités en bande passante, décrite dans arXiv:2607.28443v1. Au déploiement, chaque robot ne s'appuie que sur un historique local de 16 frames et un message récurrent de 64 flottants par lien dirigé, sans pooling global, sans encodeur cible, sans horloge d'épisode ni action future enregistrée. Après un pré-entraînement sans étiquettes collectives, les représentations gelées sont évaluées via des sondes ridge entraînées sur seulement 6, 12 ou 24 épisodes étiquetés. Face à une baseline de reconstruction directe du futur dotée de 9607 paramètres supplémentaires à l'entraînement, une étude pré-enregistrée à cinq graines montre CS-JEPA meilleur dans 5 cas sur 5, sur des topologies en anneau, en k-plus-proches-voisins mutuels et sur des tailles d'essaim inédites allant jusqu'à 108 robots. Une seconde étude scellée à huit graines, où les robots évaluent des plans à quatre pas avant de produire leurs prédictions, montre une réduction de 45,5% de l'erreur sur la valeur des branches et un gain de 0,1291 de corrélation de Pearson sur le score des candidats, avec un effet favorable dans les 8 graines, y compris pour une taille inédite de 32 robots.

Ce résultat cible un problème central de la robotique en essaim décentralisée: faire converger plusieurs agents autonomes vers la même estimation d'état collectif futur sans communication centralisée ni supervision massive. En battant une reconstruction directe du futur à capacité de déploiement égale, l'étude apporte un argument concret en faveur des cibles JEPA comme primitive efficace en étiquettes pour la prédiction distribuée, y compris quand la topologie du réseau ou la taille de l'essaim change au moment du déploiement. Pour les concepteurs de flottes de drones, de robots mobiles ou de systèmes multi-agents, cela ouvre une voie pour réduire le coût d'étiquetage tout en conservant une robustesse au changement d'échelle, un problème récurrent dès qu'un essaim réel dépasse les configurations testées en simulation. Le gain observé sur l'estimation de valeur conditionnée par un plan renforce aussi l'intérêt de l'approche pour la planification distribuée, où chaque robot doit juger des candidats d'action sans vue globale du système.

CS-JEPA s'inscrit dans la lignée des architectures de prédiction par embeddings partagés, déjà utilisées en apprentissage de représentations pour éviter la reconstruction pixel par pixel, ici transposées au cas multi-agent décentralisé. Les auteurs comparent volontairement leur méthode à une baseline plus riche en paramètres d'entraînement pour écarter l'hypothèse d'un avantage lié à la seule capacité du modèle, et testent la généralisation sur plusieurs topologies et tailles d'essaim non vues à l'entraînement. Le travail reste pour l'instant limité à des simulations évaluées par sondes linéaires; la validation sur essaim physique et la comparaison à d'autres primitives de prédiction distribuée constituent les suites logiques.

Dans nos dossiers

À lire aussi

JEPA-WAM : prédiction d'embeddings conjoints par étapes pour les modèles monde-action en manipulation robotique
1arXiv cs.RO 

JEPA-WAM : prédiction d'embeddings conjoints par étapes pour les modèles monde-action en manipulation robotique

Des chercheurs présentent JEPA-WAM (arXiv:2608.10780), qui ajoute a un World-Action Model fonde sur Motus un module Stage-JEPA, un prédicteur Joint-Embedding Predictive Architecture conditionne par objectif. L'architecture distingue un futur physique court terme, capturant l'évolution locale de la scene pour l'exécution du geste, d'un futur sémantique au niveau de l'étape, qui représente la progression de la tache d'une phase a la suivante. Stage-JEPA s'appuie sur un encodeur V-JEPA2 gelé pour extraire l'état courant a partir de l'observation et de l'instruction, puis prédit la cible latente de l'étape suivante inférée. Sur 50 taches du benchmark de simulation RoboTwin 2.0, en environnements propres et randomises, le système atteint 90,25 % de réussite globale et réduit de 5,97 % le nombre moyen d'étapes d'exécution dans les épisodes réussis par rapport a la meilleure base de comparaison testée. Ce travail cible une limite connue des politiques vision-langage-action généralistes : la plupart représentent le futur comme un court segment vidéo-action fixe, ce qui capture la dynamique locale mais ignore la progression d'une tache a plusieurs étapes. En séparant prédiction court terme et planification sémantique par étape, JEPA-WAM propose une piste pour réduire l'écart entre réactivité immédiate et raisonnement a plus long horizon, un enjeu partage par des architectures comme Pi-0, GR00T N2 ou Helix qui visent la généralisation entre taches. Le gain de 5,97 % en nombre d'étapes suggère une meilleure efficacité d'exécution sans perte de taux de réussite, un signal utile pour des intégrateurs cherchant a raccourcir les cycles, même si ces résultats restent obtenus en simulation et non en déploiement réel. L'approche s'inscrit dans la lignée des architectures Joint-Embedding Predictive popularisées par V-JEPA et V-JEPA2, des modèles du monde auto-supervises entraines sur vidéo et repris ici comme encodeur gelé plutôt que reentraine. Le choix d'un WAM fonde sur Motus situe la contribution dans la famille grandissante des modèles combinant prédiction du monde et génération d'action, en concurrence avec les approches VLA de Physical Intelligence (Pi-0), Nvidia (GR00T N2) ou Figure (Helix) ; aucun acteur européen n'apparait dans cette publication. L'article, publie sur arXiv sous la référence 2608.10780, ne fixe aucun calendrier de transfert vers des robots physiques ni de partenariat industriel, l'étape suivante habituelle pour ce type de recherche étant la validation hors simulation avant toute intégration commerciale.

RecherchePaper
1 source
Prédiction efficace de gestes iconiques tenant compte des émotions pour les robots en co-parole
2arXiv cs.RO 

Prédiction efficace de gestes iconiques tenant compte des émotions pour les robots en co-parole

Des chercheurs ont publié sur arXiv (preprint 2604.11417) un transformer léger pour prédire le placement et l'intensité des gestes iconiques synchronisés à la parole des robots, à partir du texte et de l'émotion seuls, sans audio à l'inférence. Évalué sur le jeu de données BEAT2, référence du domaine pour la génération de gestes co-parlés, le système surpasse GPT-4o en classification du placement de gestes sémantiques et en régression d'intensité, tout en restant suffisamment compact pour un déploiement temps réel sur agents incarnés. La majorité des systèmes robotiques actuels se limitent à des gestes rythmiques (beat gestures), peu porteurs de sens. Intégrer des gestes iconiques, qui illustrent ou soulignent le contenu du discours, améliore l'engagement et la compréhension de l'interlocuteur humain. Le fait qu'un transformer spécialisé et léger surpasse GPT-4o sur cette tâche précise confirme que des architectures ciblées peuvent rivaliser avec de grands modèles généralistes en interaction homme-robot (HRI), à fraction du coût computationnel. L'absence d'audio à l'inférence simplifie également le pipeline de déploiement sur plateformes sans microphone embarqué ou soumises à des contraintes de latence strictes. La génération de gestes co-parlés est un axe actif en HRI, structuré depuis quelques années par des benchmarks communs dont BEAT2. Ce travail s'inscrit dans une tendance plus large d'allégement des modèles pour agents embarqués, des robots de service aux humanoïdes sociaux. Des plateformes comme Pepper (SoftBank) ou les projets de robotique sociale développés en Europe constituent des cibles naturelles pour ce type de module. Le preprint ne mentionne ni partenariat industriel ni validation hors laboratoire, ce qui reste à confirmer avant tout déploiement opérationnel.

UELes plateformes de robotique sociale européennes comme Pepper (SoftBank Robotics, héritière d'Aldebaran) sont citées comme cibles naturelles pour ce module, mais aucun partenariat ni validation hors laboratoire n'est confirmé.

RecherchePaper
1 source
Transport multi-robots de boîtes sur différentes surfaces avec contrôle proportionnel décentralisé basé sur les rôles
3arXiv cs.RO 

Transport multi-robots de boîtes sur différentes surfaces avec contrôle proportionnel décentralisé basé sur les rôles

Des chercheurs ont publié sur arXiv (référence 2605.26430) R2P2 (Roles with Rules and Proportional-control Primitive), une architecture décentralisée pour le transport collaboratif de caisses rectangulaires par plusieurs robots agissant par poussée, sans préhension. Le système assigne dynamiquement trois rôles distincts à chaque robot - pousser, soutenir ou bloquer - selon le mode de manipulation requis : rotation ou translation de la caisse. R2P2 a été évalué en simulation sur NVIDIA IsaacSim avec une équipe de six robots, testée sur des surfaces planes, en montée et en descente avec des variations de friction et de masse de caisse. La validation physique implique quatre TurtleBots déplaçant une caisse de 1,2 kg. Les auteurs revendiquent un meilleur taux de succès que l'approche de référence par leader-suiveur virtuel, sans préciser de métriques chiffrées au-delà des graphes de comparaison. L'élément différenciant clé est l'architecture décentralisée : chaque robot prend ses décisions localement en observant uniquement sa propre position et celle de la caisse, sans communication inter-robots, consensus ou coordinateur central. Cela élimine le point de défaillance unique et réduit les contraintes de synchronisation critiques pour un déploiement en entrepôt ou en zone sinistrée. La gestion simultanée d'inclinaison et de friction variables représente un défi rarement traité dans la littérature, où la plupart des démonstrateurs fonctionnent sur sol plat homogène. La validation sim-to-real, même à petite échelle, confirme que le contrôle proportionnel basé sur les rôles reste transposable au matériel réel - un résultat non trivial pour une méthode sans apprentissage. Le transport collaboratif par poussée est un problème ouvert en robotique multi-agents depuis les années 1990, qui regagne de l'intérêt avec la montée en puissance des flottes AMR dans la logistique et la construction. Les approches concurrentes incluent les méthodes par leader-suiveur centralisé, les algorithmes de consensus distribué et, plus récemment, le renforcement multi-agent. R2P2 se positionne comme une solution légère, interprétable et sans phase d'entraînement, un avantage pour les intégrateurs qui privilégient la prédictibilité et la facilité de certification. NVIDIA IsaacSim, utilisé ici pour les tests en simulation, est devenu la plateforme de référence pour la validation robotique, notamment adoptée par Figure, Boston Dynamics et 1X. Les auteurs ne mentionnent pas de déploiement industriel ni de partenariats : il s'agit d'une contribution académique, avec comme suites logiques des tests sur des charges plus lourdes, des géométries irrégulières et des équipes plus importantes.

RecherchePaper
1 source
CoRL-MPPI : améliorer le MPPI avec des comportements appris pour un évitement de collision multi-robots efficace et sûr
4arXiv cs.RO 

CoRL-MPPI : améliorer le MPPI avec des comportements appris pour un évitement de collision multi-robots efficace et sûr

Une équipe de recherche présente CoRL-MPPI, une méthode combinant apprentissage par renforcement coopératif et Model Predictive Path Integral (MPPI) pour l'évitement de collision décentralisé entre robots mobiles. Publié sur arXiv (version 3, remplaçant une soumission antérieure), le papier décrit un réseau de neurones profond entraîné en simulation pour apprendre des comportements coopératifs locaux d'évitement d'obstacles. Cette politique apprise est ensuite injectée dans le processus d'échantillonnage du contrôleur MPPI classique, orientant les trajectoires candidates vers des actions plus coopératives et pertinentes, y compris dans des scénarios éloignés des données d'entraînement. Les auteurs affirment que leur méthode conserve les garanties théoriques de sécurité du MPPI standard, tout en améliorant le taux de succès de navigation et en réduisant les délais, dans des environnements denses et dynamiques impliquant plusieurs robots. Les résultats sont comparés à des méthodes classiques (MPPI pur) et à des approches d'apprentissage par renforcement multi-agents concurrentes. Pour l'industrie robotique, ce travail illustre une tendance de fond: hybrider contrôle optimal classique et apprentissage profond plutôt que de choisir entre les deux camps. Le MPPI seul souffre d'un échantillonnage aléatoire non informé, ce qui limite ses performances en environnement dense; le RL pur, à l'inverse, manque souvent de garanties formelles de sécurité, un point bloquant pour tout déploiement industriel réel (flottes d'AMR en entrepôt, essaims de drones). En préservant les propriétés de sécurité prouvable du MPPI tout en injectant du comportement appris, CoRL-MPPI répond directement à une critique récurrente adressée aux méthodes purement data-driven: l'absence de garanties exploitables en production. C'est un signal pertinent pour les intégrateurs qui évaluent des piles de navigation multi-robots pour la logistique ou les essaims aériens. Le MPPI est un cadre de contrôle prédictif largement utilisé en robotique mobile depuis plusieurs années, apprécié pour sa flexibilité vis-à-vis de modèles de mouvement arbitraires. Les tentatives précédentes d'amélioration se sont concentrées soit sur de meilleures fonctions de coût, soit sur des politiques d'apprentissage remplaçant entièrement le contrôle classique, au prix des garanties théoriques. CoRL-MPPI se positionne dans une troisième voie, celle des architectures hybrides guidage-par-politique, déjà explorée dans d'autres contextes de planification de trajectoire. Le papier ne mentionne pas de partenariat industriel ni de déploiement matériel réel: il s'agit d'un travail de recherche évalué en simulation, dont la prochaine étape logique serait une validation sur robots physiques en conditions denses et dynamiques.

RecherchePaper
1 source