Aller au contenu principal
ForEnt : un jeu de données multimodal pour caractériser le piégeage des robots quadrupèdes en milieu forestier
RecherchearXiv cs.RO 

ForEnt : un jeu de données multimodal pour caractériser le piégeage des robots quadrupèdes en milieu forestier

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont publié ForEnt, un dataset multimodal destiné à caractériser les encastrements de robots quadrupèdes en milieu forestier. Collecté avec le Unitree Go2, un quadrupède d'entrée de gamme, sur huit sites du Southampton Common Woodlands au Royaume-Uni, le jeu de données couvre 1,7 km de traversées réparties en 11 séquences, au cours desquelles 69 événements d'encastrement ont été enregistrés. Un encastrement désigne une situation où les pattes du robot se retrouvent piégées dans des lianes, des racines ou d'autres végétaux, provoquant une perte de stabilité et un risque de chute. ForEnt combine des flux temporellement synchronisés : images RGB-D, nuages de points LiDAR, données proprioceptives et vidéo en vue tierce-personne. Chaque événement est labellisé, ce qui en fait un benchmark reproductible pour évaluer des stratégies de détection d'encastrement.

Les robots quadrupèdes sont de plus en plus déployés pour la surveillance écologique en forêt, mais leur autonomie est régulièrement interrompue par ces incidents mécaniques, qui nécessitent une intervention humaine et risquent d'endommager le matériel. L'absence d'un dataset dédié à ces modes de défaillance spécifiques freinait le développement d'algorithmes robustes. ForEnt comble ce manque : une base de données multimodale structurée permet désormais d'entraîner et d'évaluer des méthodes de détection in situ. Pour les chercheurs en navigation autonome, c'est une brique essentielle pour que des robots identifient proactivement les zones à risque et adaptent leur locomotion, condition nécessaire à des déploiements sans supervision prolongée dans des environnements non structurés.

Le Unitree Go2 est l'un des quadrupèdes les plus accessibles du marché (environ 2 700 dollars), ce qui explique son adoption croissante en recherche académique. La robotique forestière reste un segment de niche mais en expansion, porté par des besoins croissants en monitoring environnemental : inventaires d'espèces, suivi d'incendies, cartographie de biodiversité. Les plateformes plus robustes comme Boston Dynamics Spot ou ANYbotics ANYmal restent hors de portée budgétaire pour la plupart des équipes académiques, ce qui rend les travaux sur des systèmes low-cost d'autant plus stratégiques. Les suites naturelles de ForEnt incluent l'entraînement de modèles de détection en temps réel et leur intégration dans des politiques de locomotion adaptative.

Dans nos dossiers

À lire aussi

EgoWalk : un jeu de données multimodal pour la navigation robotique en conditions réelles
1arXiv cs.RO 

EgoWalk : un jeu de données multimodal pour la navigation robotique en conditions réelles

Une équipe de chercheurs a publié EgoWalk, un dataset multimodal de 50 heures de navigation humaine destiné à entraîner des algorithmes de navigation robotique en conditions réelles. Les données ont été collectées dans une grande variété d'environnements intérieurs et extérieurs, sur plusieurs saisons et sites géographiques différents. Le dataset comprend les données brutes ainsi qu'un format prêt pour l'apprentissage par imitation (Imitation Learning), accompagné de pipelines automatisés générant deux types de sous-datasets dérivés : des annotations d'objectifs en langage naturel et des masques de segmentation de traversabilité. L'ensemble des pipelines de traitement et la description de la plateforme matérielle utilisée pour la collecte sont publiés en open source. L'intérêt principal d'EgoWalk réside dans la rareté des datasets de navigation en conditions non contrôlées, à grande échelle et couvrant plusieurs saisons. La majorité des systèmes de navigation robotique actuels souffrent d'un écart sim-to-real persistant, faute de données réelles suffisamment diversifiées. En proposant simultanément des annotations langage naturel et des masques de traversabilité générés automatiquement, EgoWalk vise à réduire le coût de labellisation manuelle qui freine le développement de modèles vision-langage-action (VLA) pour la navigation outdoor. La publication open source des pipelines permet aux équipes de réplication de reconstruire des datasets similaires sur leur propre plateforme, ce qui est un signal positif pour la reproductibilité dans le domaine. La navigation autonome en environnements non structurés reste l'un des défis centraux de la robotique mobile, que ce soit pour les robots de livraison, les plateformes de surveillance ou les assistants mobiles. EgoWalk s'inscrit dans un mouvement plus large de constitution de datasets ego-centriques, aux côtés d'initiatives comme SCAND (UT Austin) ou des travaux de Boston Dynamics et de Google DeepMind sur la navigation en extérieur. Le fait que les données soient collectées du point de vue humain, plutôt que depuis un robot, soulève la question du transfert de domaine, que les auteurs reconnaissent implicitement en proposant des benchmarks et études de diversité. Les prochaines étapes naturelles seraient la validation sur des plateformes robotiques réelles et l'intégration dans des architectures de type foundation model pour la navigation.

RechercheActu
1 source
GrandTour : un jeu de données de robotique à pattes en conditions réelles pour la perception multimodale et l'estimation d'état
2arXiv cs.RO 

GrandTour : un jeu de données de robotique à pattes en conditions réelles pour la perception multimodale et l'estimation d'état

Des chercheurs publient GrandTour, un jeu de données massif dédié à la perception multimodale et à l'estimation d'état pour robots quadrupèdes, disponible sur grand-tour.leggedrobotics.com au format HuggingFace (indépendant de ROS) ainsi qu'en formats ROS. La plateforme utilisée est un ANYmal-D d'ANYbotics équipé de la charge utile capteurs Boxi, combinant LiDAR rotatif, plusieurs caméras RGB aux caractéristiques complémentaires, capteurs proprioceptifs et caméras de profondeur stéréo, le tout synchronisé temporellement. Les données ont été collectées sur des sites très variés : environnements alpins, forêts, bâtiments démolis et zones urbaines, couvrant une large gamme d'échelles, de conditions d'éclairage et de météo. Point clé pour la fiabilité scientifique : les trajectoires de référence (ground truth) proviennent de GNSS RTK par satellite et d'une station totale Leica Geosystems, offrant une précision de localisation bien supérieure aux méthodes d'estimation embarquées classiques. Selon les auteurs, il s'agit du plus grand jeu de données en accès libre jamais publié pour la robotique à pattes. Ce type de ressource comble un manque criant dans la recherche en robotique légère : jusqu'ici, aucun jeu de données public à grande échelle ne permettait de développer et de comparer rigoureusement des algorithmes de SLAM, d'estimation d'état et de fusion de capteurs pour des quadrupèdes évoluant en conditions réelles, hors laboratoire. Pour les équipes travaillant sur la navigation autonome de robots à pattes, en particulier dans des environnements non structurés (chantiers, sites industriels accidentés, terrains extérieurs), GrandTour offre un benchmark commun et une vérité terrain de précision géodésique, rare dans ce domaine. C'est un signal que la communauté cherche à standardiser l'évaluation des systèmes de perception embarqués, plutôt que de se fier à des démonstrations isolées difficiles à reproduire. Le projet s'inscrit dans la lignée des travaux du Robotic Systems Lab, à l'origine de la plateforme ANYmal, aujourd'hui commercialisée par ANYbotics, acteur suisse reconnu de la robotique quadrupède industrielle aux côtés de Boston Dynamics (Spot) et Unitree. La publication constitue une mise à jour (version 3) d'un article déposé sur arXiv sous la référence 2602.18164. Les auteurs annoncent la mise à disposition d'outils et de ressources de démonstration pour faciliter l'adoption du jeu de données par la communauté SLAM et apprentissage multimodal, sans toutefois préciser de calendrier pour d'éventuelles extensions futures du corpus.

UECe jeu de données en accès libre, issu du Robotic Systems Lab (ETH Zurich) et d'ANYbotics (Suisse), constitue une ressource directement utile aux équipes de recherche françaises et européennes travaillant sur le SLAM et l'estimation d'état pour robots a pattes.

RecherchePaper
1 source
MUSON : jeu de données multimodal orienté raisonnement pour la navigation socialement conforme en milieu urbain
3arXiv cs.RO 

MUSON : jeu de données multimodal orienté raisonnement pour la navigation socialement conforme en milieu urbain

Une équipe de recherche publie MUSON, un nouveau jeu de données multimodal destiné à entraîner les robots et systèmes de navigation autonome à respecter les normes sociales dans les espaces partagés avec des humains. Le corpus comprend 10 110 échantillons égocentriques (captés à la première personne, comme le ferait un robot ou un piéton) collectés dans des scènes intérieures et extérieures variées. Chaque échantillon est annoté selon un cadre structuré en cinq étapes de raisonnement en chaîne : perception, prédiction, raisonnement, action et explication, avec un espace de décision standardisé à six actions possibles et une modélisation explicite des contraintes physiques statiques (obstacles fixes, rétrécissements de passage, etc.). Les chercheurs ont évalué dix modèles vision-langage (VLM) de taille petite à moyenne sur ce benchmark. Qwen3-VL-8B, développé par Alibaba, arrive en tête avec une précision d'action de 0,7765, un score Macro-F1 de 0,7490 et le taux de collision le plus bas parmi les modèles testés, à 0,0609. Le dataset est publié en accès libre sur GitHub sous la version 1.0. Cette publication répond à un manque identifié dans la recherche en navigation sociale : jusqu'ici, aucun jeu de données à grande échelle ne combinait annotations égocentriques et raisonnement structuré pour ce cas d'usage précis. Les modèles vision-langage génériques, même performants sur des tâches visuelles classiques, peinent à interpréter finement les normes sociales implicites (céder le passage, anticiper une trajectoire piétonne, respecter une distance de confort) sans fine-tuning spécifique. En fournissant un benchmark reproductible avec des métriques comparables, MUSON offre aux équipes de recherche en robotique mobile et en véhicules autonomes de proximité un outil pour évaluer objectivement leurs modèles, plutôt que de se fier à des démonstrations ponctuelles souvent peu représentatives des conditions réelles. Le projet s'inscrit dans la lignée des travaux récents cherchant à exploiter les VLM comme couche de raisonnement de haut niveau pour la navigation robotique, en complément des piles de perception et de contrôle bas niveau classiques. Contrairement à une annonce produit, il s'agit ici d'une contribution académique dont la valeur dépendra de son adoption par la communauté comme référence d'évaluation, à l'image d'autres benchmarks ayant structuré des sous-domaines de la robotique ces dernières années. Le code et les données étant publics, les prochaines étapes attendues sont des extensions du dataset et des comparaisons avec des modèles plus volumineux ou spécialisés.

RecherchePaper
1 source
Prédiction d'occupation sémantique multimodale panoramique pour robots quadrupèdes
4arXiv cs.RO 

Prédiction d'occupation sémantique multimodale panoramique pour robots quadrupèdes

Des chercheurs présentent PanoMMOcc, premier jeu de données réel d'occupation sémantique multimodale panoramique conçu pour des robots quadrupèdes, réunissant quatre modalités de capteurs collectées dans des scènes variées. A partir de ce jeu de données, l'équipe propose VoxelHound, un framework de perception d'occupation adapte a la locomotion sur pattes et a l'imagerie sphérique a 360 degrés. Il repose sur deux modules : Vertical Jitter Compensation (VJC), qui corrige les perturbations de point de vue provoquées par le tangage et le roulis du corps pendant la marche, et Multimodal Information Prompt Fusion (MIPF), qui fusionne les indices visuels panoramiques avec les modalités auxiliaires pour affiner la prédiction volumétrique. Sur le benchmark établi a partir de PanoMMOcc, VoxelHound revendique des résultats état de l'art avec un gain de +4.16 points de mIoU par rapport aux méthodes existantes. Le jeu de données et le code source doivent être publies sur le dépôt GitHub SXDR/PanoMMOcc, référençant le papier sous l'identifiant arXiv 2603.13108, dans une version révisée. L'enjeu tient au fait que les méthodes de prédiction d'occupation actuelles ont été conçues pour des véhicules a roues et reposent lourdement sur des indices RGB, une approche mal adaptee aux robots a pattes dont le corps oscille verticalement a chaque cycle de marche, dégradant la cohérence spatiale des modèles existants. En fournissant le premier jeu de données réel et un benchmark spécifiques a ce cas d'usage, ce travail comble un manque concret pour les intégrateurs qui cherchent a déployer des quadrupèdes dans des environnements dynamiques comme des entrepôts ou des chantiers extérieurs. Le gain de +4.16 en mIoU reste toutefois une mesure interne, évaluée sur le benchmark propre des auteurs, sans comparaison indépendante tierce a ce stade. La prédiction d'occupation 3D s'est surtout développée dans le contexte de la conduite autonome, avec des architectures pensées pour des plateformes a roues stables et des rigs multi-cameras fixes. L'essor de plateformes quadrupèdes commerciales, capables de franchir des terrains irréguliers, a mis en évidence l'absence d'outils de perception robustes a ce type de mouvement non rigide. La publication conjointe du dataset et du code vise a faciliter les recherches futures sur la perception 3D multimodale panoramique pour les systèmes robotiques incarnes. Il s'agit pour l'instant d'un travail de recherche académique, sans annonce de déploiement industriel ni de partenaire commercial associe.

RecherchePaper
1 source