Aller au contenu principal
Apprendre à lancer des objets en toute sécurité dans des environnements à obstacles multiples
RecherchearXiv cs.RO 

Apprendre à lancer des objets en toute sécurité dans des environnements à obstacles multiples

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE
Apprendre à lancer des objets en toute sécurité dans des environnements à obstacles multiples
▶ Voir sur YouTube

Une équipe de recherche en robotique présente dans un article publié sur arXiv (2607.06388v1) une nouvelle méthode permettant à un bras robotique d'apprendre à lancer des objets dans un panier cible tout en évitant des obstacles disposés aléatoirement dans la scène. Baptisée PFR (representation par champ de potentiel), l'approche encode sur une grille de taille fixe à la fois l'attraction exercée par le panier et la répulsion générée par les obstacles, ce qui permet à des politiques d'apprentissage par renforcement de généraliser à un nombre et à des configurations d'obstacles quelconques, y compris jamais vus à l'entraînement. La politique est d'abord initialisée à partir de démonstrations kinesthésiques, puis optimisée en simulation à l'aide de trois algorithmes de référence, SAC, DDPG et TD3, SAC obtenant les résultats les plus stables. Sur robot réel, avec des objets à lancer inédits, le système atteint jusqu'à 90% de réussite dans des scènes encombrées, un transfert simulation-réel jugé robuste par les auteurs.

Ce résultat comble un angle mort des travaux précédents comme TossingBot, qui apprenaient à lancer des objets à partir d'entrées visuelles mais supposaient un espace de travail dégagé, une hypothèse rarement vérifiée en environnement industriel réel (entrepôt, ligne de tri, cellule partagée avec d'autres équipements). Pour les intégrateurs et les décideurs en logistique ou en manutention, la capacité à placer un objet hors de portée directe du bras tout en évitant des obstacles dynamiques ouvre la voie à des cellules de tri plus denses et moins contraintes en termes d'agencement, sans multiplier les capteurs de sécurité périmétrique. Le taux de succès élevé sur objets et configurations non vus en fait aussi un argument en faveur des représentations d'état compactes plutôt que des encodages explicites de chaque obstacle, plus coûteux à faire passer à l'échelle.

Le travail s'inscrit dans la lignée des recherches sur le lancer robotique initiées par TossingBot, en y ajoutant la dimension de l'évitement d'obstacles restée peu étudiée jusqu'ici. Les auteurs comparent explicitement leur représentation par champ de potentiel à des encodages d'état classiques pour démontrer son avantage en généralisation. Une vidéo de démonstration accompagne la publication, mais aucun calendrier de déploiement industriel ni partenariat commercial n'est mentionné à ce stade: il s'agit pour l'instant d'un résultat de recherche académique, pas d'un produit prêt à intégrer.

Dans nos dossiers

À lire aussi

Apprentissage de la faisabilité des mouvements à partir de nuages de points en environnements encombrés
1arXiv cs.RO 

Apprentissage de la faisabilité des mouvements à partir de nuages de points en environnements encombrés

Une équipe de chercheurs a publié sur arXiv (réf. 2606.26700) une étude sur la prédiction de faisabilité de mouvement pour un bras manipulateur à 7 degrés de liberté (7-DOF), opérant dans des environnements encombrés à partir d'observations RGB-D brutes. Le coeur du travail est GRASPFC-PTX, un transformeur appliqué à des nuages de points 3D, capable de prédire si une saisie est réalisable sans reconstruire de modèle CAO de l'environnement. Pour entraîner et évaluer leur approche, les auteurs ont constitué ce qu'ils présentent comme le premier benchmark à grande échelle de ce type : 2,7 millions d'étiquettes de faisabilité de saisie couvrant 88 objets scannés et 190 scènes de table encombrées. Trois familles d'architectures ont été comparées dans des conditions d'entraînement identiques (réseaux MLP, CNN volumétriques, transformeurs sur nuages de points). GRASPFC-PTX atteint un AUROC de 0,996 sur des objets non vus lors de l'entraînement, et produit ses prédictions bien plus rapidement que les planificateurs à base d'échantillonnage (SBMPs) classiques comme RRT ou PRM. Le goulot d'étranglement visé est précis : dans les pipelines de task and motion planning (TAMP), les tentatives de planification infaisables par les SBMPs consomment du temps de calcul sans résultat utile. Un prédicteur fiable en amont permet de filtrer ces tentatives avant qu'elles n'alourdissent la boucle de planification. Ce qui distingue cette contribution des approches existantes, c'est son fonctionnement en espace de configuration à haute dimension (7-DOF) à partir de perceptions brutes, sans supposer une géométrie simplifiée ni des paramètres d'objets connus. Pour les intégrateurs de manipulation industrielle ou de robotique logistique, cela ouvre la voie à un module greffable sur une cellule existante sans reconstruire le modèle numérique de chaque pièce. La certification d'infaisabilité de mouvement était jusqu'ici principalement traitée pour des espaces de faible dimension et des géométries simples. La montée en puissance des architectures transformeurs sur nuages de points, dans la lignée de PointNet++ et PCT, rend désormais ces prédicteurs plus généraux et applicables à des scènes réalistes. Ce travail s'inscrit dans une tendance plus large où l'apprentissage profond vient court-circuiter les planificateurs géométriques classiques dans des environnements non structurés. Le préprint ne mentionne ni déploiement industriel ni partenariat ; il s'agit d'une contribution de recherche fondamentale avec benchmark public, ce qui en fait un point de référence potentiel pour les équipes travaillant sur la manipulation en milieu réel. Les étapes naturelles seraient d'étendre le benchmark à des scènes dynamiques et de tester la robustesse face au bruit de capteur en conditions réelles.

RecherchePaper
1 source
Interleaved POMDP planning pour la recherche multi-objets dans des environnements domestiques multi-pièces inconnus
2arXiv cs.RO 

Interleaved POMDP planning pour la recherche multi-objets dans des environnements domestiques multi-pièces inconnus

Une équipe de recherche propose Inter-POMDP, un nouvel algorithme de planification pour la recherche multi-objets par des robots dans des environnements domestiques inconnus, comportant plusieurs pièces. Le problème central est la recherche d'objets sous incertitude massive : positions inconnues, obstacles non observés, espaces encombrés. Les POMDP (processus de décision markoviens partiellement observables) offrent un cadre théorique solide pour ce type de problème, mais deviennent ingérables à grande échelle. La solution proposée décompose la tâche en deux niveaux interconnectés : un planificateur de haut niveau, basé sur l'algorithme POUCT, raisonne sur la distribution probable des objets grâce à des croyances sous forme d'histogrammes informées par un LLM, tandis qu'un planificateur de mouvement de bas niveau modélise l'incertitude de navigation via des croyances par particules tenant compte des obstacles, utilisées comme connaissance de domaine pour guider le niveau supérieur. Testé en simulation et en conditions réelles, Inter-POMDP réduit le nombre de collisions jusqu'à 63 %, le nombre d'étapes de navigation jusqu'à 35 %, et améliore le taux de détection jusqu'à 32 % par rapport aux méthodes de référence. Des vidéos de démonstration sont disponibles en ligne. Pour l'industrie robotique, ce travail illustre une tendance de fond : l'utilisation de grands modèles de langage non pas pour remplacer la planification formelle, mais pour l'informer, en fournissant des a priori sémantiques (où chercher une tasse, un livre) qui réduisent l'espace de recherche combinatoire des POMDP classiques. C'est une piste concrète pour rendre les robots domestiques et de service capables de tâches de recherche et de rangement dans des environnements réels non cartographiés à l'avance, un scénario encore mal résolu malgré les progrès des architectures VLA. Les gains rapportés sur collisions et efficacité de navigation, s'ils se confirment hors laboratoire, intéressent directement les intégrateurs travaillant sur la navigation autonome en intérieur. Ce travail s'inscrit dans la lignée des recherches en planification POMDP hiérarchique, un champ actif depuis plusieurs années face à l'explosion combinatoire des POMDP plats. La nouveauté ici est le couplage explicite avec un LLM pour informer les croyances de haut niveau. Il s'agit à ce stade d'une publication de recherche (arXiv, avant relecture par les pairs), pas d'un produit ou d'un déploiement commercial ; les prochaines étapes attendues sont une validation sur des flottes robotiques plus larges et une comparaison avec d'autres approches hybrides LLM-planification.

RecherchePaper
1 source
Vol anticipé guidé par les risques : un apprentissage par renforcement pour voler en sécurité dans un environnement dynamique encombré
3arXiv cs.RO 

Vol anticipé guidé par les risques : un apprentissage par renforcement pour voler en sécurité dans un environnement dynamique encombré

Une équipe de recherche présente un nouveau cadre d'apprentissage par renforcement pour la navigation sécurisée de quadrirotors dans des environnements encombrés et dynamiques, publié sur arXiv fin juillet 2026. La méthode, baptisée "anticipatory risk-guided reinforcement learning", s'appuie sur des états privilégiés du simulateur pour construire une carte de risque de collision future, orientée directionnellement et calculée via le point d'approche le plus proche (Closest Point of Approach, CPA). Une architecture actor-critic asymétrique entraîne le réseau à auto-prédire ce risque structuré, qui guide ensuite la politique visuelle au moment du déploiement réel. Un encodeur spatio-temporel léger extrait les indices de mouvement directement depuis les séquences de profondeur embarquées, sans recourir au tracking d'objets ni à l'estimation de flux optique explicite. Les auteurs rapportent des gains en marge de sécurité et en efficacité de vol par rapport aux méthodes de référence, en simulation comme en conditions réelles, avec un transfert sim-to-real zero-shot validé sur un drone physique. Pour l'industrie des drones et des systèmes autonomes, ce travail s'attaque à un point de friction connu: les pipelines modulaires classiques souffrent de latence de perception, tandis que les approches end-to-end à récompense scalaire peinent à extraire des features spatio-temporelles fiables sans supervision physique explicite. En ancrant l'apprentissage dans une notion de risque géométrique anticipé plutôt que dans un signal de récompense implicite, la méthode illustre une piste pour fiabiliser le comportement des politiques visuelles face à des obstacles mobiles, un scénario encore mal couvert par la plupart des solutions commerciales d'évitement d'obstacles pour drones et robots mobiles autonomes (AMR). Ce résultat s'inscrit dans la lignée des travaux récents combinant perception par profondeur et RL pour le vol autonome en environnement dynamique, un axe de recherche actif face aux limites persistantes des méthodes géométriques classiques. Il s'agit à ce stade d'une publication de recherche avec validation expérimentale limitée, non d'un produit ou d'un déploiement industriel; les prochaines étapes attendues porteraient sur l'extension à des essaims de drones, des obstacles multiples plus denses, et une validation à plus grande échelle hors simulation.

RecherchePaper
1 source
ZONDA : navigation vers un objet sans apprentissage préalable avec évitement dynamique en environnements multi-étages
4arXiv cs.RO 

ZONDA : navigation vers un objet sans apprentissage préalable avec évitement dynamique en environnements multi-étages

Une équipe de recherche présente ZONDA, un nouveau framework de navigation robotique "zero-shot" vers un objet désigné (Object Goal Navigation), conçu pour fonctionner dans des environnements multi-étages et en présence de piétons en mouvement. Le système repose sur trois composants : une planification heuristique multi-étages qui exploite des cartes de différences de hauteur pour permettre à un robot de gravir des escaliers et de changer d'étage sans contrôleur spécifique à la plateforme ; une vérification multi-vues de la cible, qui croise des observations à différentes échelles avec un modèle vision-langage (VLM) pour réduire les faux positifs de détection ; et un module d'évitement dynamique des piétons, qui suit et anticipe leurs déplacements pour générer des trajectoires préventives. Le système a été testé sur un robot bipède TITA du fabricant chinois Direct Drive Tech, ainsi que sur des simulations extensives utilisant les jeux de données HM3D et MP3D, deux benchmarks de référence pour la navigation en environnement intérieur photoréaliste. Les auteurs annoncent des résultats "significativement améliorés" par rapport aux méthodes existantes, ainsi qu'une robustesse maintenue sur HM3D-DYNA, une variante dynamique du benchmark incluant des agents mobiles. Cette publication s'attaque à une limite concrète et rarement traitée des systèmes de navigation robotique actuels : la quasi-totalité des méthodes de pointe supposent un environnement statique et confiné à un seul étage, une hypothèse commode en laboratoire mais irréaliste pour un déploiement réel en entrepôt, hôpital ou bâtiment de bureaux à plusieurs niveaux. En combinant franchissement d'escaliers sans apprentissage spécifique au robot et anticipation des piétons, ZONDA vise directement l'écart entre démonstration en simulation et usage industriel, un problème central pour les intégrateurs qui cherchent à déployer des robots mobiles ou humanoïdes au-delà d'un seul plateau. À noter que l'abstract ne fournit pas de chiffres précis de performance (taux de succès, distance parcourue, temps de cycle) permettant de comparer objectivement l'ampleur du gain revendiqué face aux méthodes concurrentes, une réserve à garder en tête avant de considérer le résultat comme acquis. Le champ de l'Object Goal Navigation s'est largement construit sur des benchmarks comme HM3D et MP3D, où les méthodes récentes intègrent de plus en plus des modèles vision-langage pour améliorer la reconnaissance sémantique des cibles, dans la lignée de travaux comme les architectures VLA utilisées en manipulation robotique. Le choix du robot bipède TITA de Direct Drive Tech comme plateforme de test réel, plutôt qu'un robot à roues plus classique en recherche de navigation, souligne l'ambition de valider l'approche sur une morphologie capable physiquement de franchir des escaliers, condition nécessaire à toute navigation multi-étages. L'article, publié sur arXiv le 24 juillet 2026, ne mentionne pas de partenariat industriel ni de calendrier de déploiement commercial ; il s'agit à ce stade d'une contribution académique, dont la prochaine étape logique serait une validation sur davantage de plateformes robotiques et dans des environnements réels plus variés que le cadre expérimental actuel.

RecherchePaper
1 source