Aller au contenu principal
Collaboration humain-robot sécurisée par vision avec garanties de robustesse
RecherchearXiv cs.RO 

Collaboration humain-robot sécurisée par vision avec garanties de robustesse

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont publié sur arXiv (arXiv:2504.15221) un framework de collaboration humain-robot (HRC) fondé sur la vision par ordinateur, capable de certifier formellement la sécurité des trajectoires en présence d'incertitude. Le système combine estimation de pose humaine en temps réel, prédiction de mouvement et prédiction conforme, une méthode statistique qui garantit, avec un niveau de confiance paramétrable, que les ensembles de prédiction couvrent la trajectoire réelle avec une probabilité donnée. Le pipeline intègre également une détection de distribution hors domaine (OOD) pour identifier les configurations corporelles non vues à l'entraînement, réduisant les faux positifs de certitude. Les expériences couvrent à la fois des séquences de mouvement enregistrées et un scénario de collaboration réelle bras robotique/opérateur humain.

L'apport principal est de sortir du compromis classique entre performance et garanties formelles : la plupart des systèmes de sécurité HRC reposent soit sur des marges de sécurité fixes trop conservatrices, soit sur des prédictions neuronales sans borne de confiance vérifiable. Ici, les ensembles de prédiction conformes fournissent une couverture statistique valide indépendamment de la distribution des données, ce qui permet d'intégrer le module dans des architectures de contrôle certifiables (CBF, MPC robuste). C'est un pas concret vers des robots industriels capables de partager l'espace de travail humain sans cage, avec des garanties auditables.

Ce travail s'inscrit dans un axe de recherche actif sur la sécurité formelle en robotique collaborative, aux côtés de travaux sur les Control Barrier Functions et la prédiction d'intention. Les auteurs n'annoncent pas de déploiement industriel ni de partenariat commercial, il s'agit d'une contribution académique, avec validation en laboratoire. La prochaine étape naturelle serait une intégration sur plateforme cobotique standard (UR, KUKA iiwa) dans un environnement manufacturier réel pour évaluer la latence bout-en-bout et la robustesse aux occlusions partielles.

Dans nos dossiers

À lire aussi

Évaluation de la compréhension des collisions dans les modèles vision-langage pour une collaboration homme-robot sécurisée
1arXiv cs.RO 

Évaluation de la compréhension des collisions dans les modèles vision-langage pour une collaboration homme-robot sécurisée

Une équipe de chercheurs a publié TouchSafeBench (arXiv:2605.31196), un benchmark pour évaluer ce qu'ils nomment le "collision grounding" dans les modèles de vision-langage (VLM) : la capacité à relier des observations visuelles à la géométrie du robot, la disposition de la scène et la proximité humaine pour déduire un contact présent ou imminent. Construit dans le simulateur Habitat 3.0 de Meta, il comprend 2 940 épisodes de coprésence indoor simulés, couvrant navigation sociale et réorganisation spatiale, avec des observations RGB-D multi-vues synchronisées, des cartes de trajectoire top-down et des labels de contact dérivés directement du simulateur. Trois VLMs orientés robotique ou frontier models ont été testés sur neuf représentations visuelles, autour de deux tâches : classifier l'état de sécurité courant et anticiper une collision imminente avant tout contact physique. Le meilleur score moyen Macro-F1 obtenu reste inférieur à 50 %. Ce chiffre souligne une limite fondamentale : la fluidité visuelle n'implique pas la responsabilité physique. Un modèle capable de décrire précisément une scène peut échouer à détecter si un bras robotique effleure un opérateur. Pour les intégrateurs travaillant sur la collaboration homme-robot, le signal est sans ambiguité : les VLMs actuels ne peuvent pas jouer le rôle de moniteurs de sécurité sans couche d'abstraction géométrique explicite. L'étude montre également que le contact robot-scène (obstacles, mobilier) est systématiquement plus difficile à détecter que la proximité humaine, contredisant l'intuition courante. Plus frappant encore : la profondeur RGB-D n'est pas automatiquement convertie en évidence de collision corps-robot, faute de représentation morphologique intégrée dans ces modèles. Ces résultats arrivent au moment où les architectures vision-langage-action (VLA) comme RT-2, OpenVLA ou pi0 de Physical Intelligence s'imposent dans les pipelines robotiques, en pariant sur la généralisation sémantique des VLMs pour piloter manipulateurs et robots mobiles. TouchSafeBench constitue un contrepoids empirique à cet enthousiasme : la généralisation linguistique ne résout pas la conscience géométrique nécessaire à la sécurité fonctionnelle. La plateforme sous-jacente, Habitat 3.0, est développée par Meta AI Research et fait référence en navigation sociale simulée. Le benchmark sera publié à l'acceptation de l'article. Les auteurs identifient comme prochaine étape des représentations liant explicitement point de vue caméra, morphologie du robot et géométrie métrique, potentiellement via des approches hybrides VLM et modèles cinématiques.

UELes intégrateurs européens développant des cobots sous contraintes AI Act doivent intégrer que les VLMs actuels ne sont pas des moniteurs de sécurité fiables sans couche d'abstraction géométrique explicite, ce qui impacte directement les architectures VLA en cours de déploiement industriel.

RecherchePaper
1 source
Réponses de robots collaboratifs aux tâches humaines : correction sémantique et physique via modèles vision-langage
2arXiv cs.RO 

Réponses de robots collaboratifs aux tâches humaines : correction sémantique et physique via modèles vision-langage

Ce travail de recherche, publié en version révisée (v2) sur arXiv, s'attaque à un problème central de l'assemblage collaboratif homme-robot : comment un robot doit-il interpréter une instruction corrective ambiguë donnée par un humain, tout en produisant un mouvement physiquement exécutable. Les chercheurs proposent un framework de replanification qui traduit les instructions humaines en candidats "Action Target" (poses de préhension, choix d'outil), combinant deux mécanismes de vérification : un modèle de correction interne, qui valide la cohérence logique avant exécution, et un modèle de correction externe, qui vérifie visuellement le résultat après exécution. Le système intègre un modèle vision-langage (VLM) à de la génération de prise en 6 degrés de liberté et de la planification de trajectoire sans collision. Testé sur un robot humanoïde à buste (upper-body), il atteint 66,7% de réussite en fixation d'objet réelle, 100% en sélection initiale d'outil et 75% en sélection corrective d'outil. L'intérêt de l'étude tient surtout à ce qu'elle révèle sur les limites actuelles des VLM appliqués au contrôle robotique : ces modèles raisonnent bien sémantiquement mais choisissent parfois des cibles logiquement incohérentes ou mal évaluent si une action a réussi. Les ablations en simulation montrent un résultat contre-intuitif : la correction visuelle externe n'aide que lorsque le VLM sous-jacent a une latence faible, et peut au contraire dégrader la performance globale quand elle produit des faux négatifs. Pour les intégrateurs et équipes R&D qui misent sur les architectures VLA (à la manière de GR00T N2, Pi-0 ou Helix) pour piloter des humanoïdes en environnement collaboratif, ce papier illustre concrètement l'écart entre démonstration en simulation et fiabilité terrain, et pointe la vérification de l'état visuel comme le maillon encore faible. L'étude s'inscrit dans la vague de recherche académique cherchant à fiabiliser les architectures vision-langage-action pour la robotique physique, un axe où la plupart des annonces commerciales (Figure, Physical Intelligence, NVIDIA) restent centrées sur la démonstration plutôt que sur le déploiement industriel répété. Les auteurs ne précisent pas de laboratoire ni de suite commerciale ; il s'agit d'une contribution méthodologique destinée à alimenter les futurs travaux sur la replanification interactive et la correction des erreurs de perception dans les tâches collaboratives spatiales et sémantiques.

RecherchePaper
1 source
Planification de trajectoire STL et analyse des risques pour la collaboration humain-robot avec un drone multi-rotors
3arXiv cs.RO 

Planification de trajectoire STL et analyse des risques pour la collaboration humain-robot avec un drone multi-rotors

Des chercheurs ont publié sur arXiv (référence 2509.10692, troisième révision en avril 2026) un framework de planification de mouvement et d'analyse de risque pour la collaboration humain-robot avec un véhicule aérien multirotor. Le coeur du système repose sur la Signal Temporal Logic (STL), un formalisme mathématique permettant d'encoder des objectifs de mission structurés : contraintes de sécurité, exigences temporelles, et préférences humaines incluant l'ergonomie et le confort de l'opérateur. Un planificateur par optimisation génère des trajectoires dynamiquement faisables en tenant compte des dynamiques non-linéaires du drone et de ses contraintes d'actuation. Pour résoudre le problème d'optimisation non-convexe et non-lisse qui en résulte, le framework adopte des approximations de robustesse différentiables combinées à des méthodes de gradient. Le système inclut également un mécanisme de replanification en ligne déclenché par événements, activé lorsque des perturbations menacent les marges de sécurité. La validation s'appuie exclusivement sur des simulations MATLAB et Gazebo, sur une tâche de remise d'objet inspirée de la maintenance de lignes électriques. Ce travail adresse un verrou réel dans le déploiement de drones en environnement industriel partagé : la cohabitation sûre avec des techniciens humains dont la posture est incertaine et dynamique. L'analyse de risque probabiliste quantifie la vraisemblance de violations de spécifications sous incertitude de pose humaine, ce qui représente une avancée par rapport aux approches conservatrices à marge fixe. La replanification événementielle permet une récupération en ligne sans interrompre la mission, un critère déterminant pour les applications en conditions réelles. Cela dit, l'absence de validation physique sur hardware réel constitue une limite importante : le gap sim-to-real pour les drones en proximité humaine reste un problème ouvert, et les résultats en simulation Gazebo ne peuvent pas être directement extrapolés à un déploiement terrain. Le contexte de ce travail s'inscrit dans un effort plus large de la communauté robotique aérienne pour rendre les drones industriels opérables à proximité immédiate des travailleurs, notamment dans les secteurs de l'énergie et de la maintenance d'infrastructures. Côté concurrence, des acteurs comme Skydio (USA) ou Flyability (Suisse) avancent sur des drones robustes en environnement contraint, mais sans formalisme STL ni modèle explicite d'interaction humain-robot. En Europe, des projets académiques financés par l'ANR et H2020 explorent des pistes similaires. La prochaine étape naturelle pour ce framework serait une validation sur banc physique avec un multirotor réel et des opérateurs humains instrumentés, condition sine qua non avant toute intégration industrielle.

UEDes projets ANR et H2020 explorent des approches similaires ; ce framework STL pourrait alimenter la recherche européenne sur les drones industriels en proximité humaine, notamment pour la maintenance d'infrastructures énergétiques.

RecherchePaper
1 source
Robots-bateaux autoreconfigurables : planification de mouvement distribuée avec garanties de sécurité
4arXiv cs.RO 

Robots-bateaux autoreconfigurables : planification de mouvement distribuée avec garanties de sécurité

Traduis et resume l'article, voici le texte en français, prêt à publier : L'équipe de recherche derrière ce papier arXiv (2607.20352, publié le 24 juillet 2026) présente un framework hybride pour la reconfiguration de flottes de robots-bateaux aquatiques capables de s'auto-assembler en formes définies. La méthode combine un contrôle prédictif distribué (MPC) résolu via ADMM (Alternating Direction Method of Multipliers) pour planifier les trajectoires de chaque agent en optimisation locale avec échange d'informations entre voisins, et des filtres de sécurité basés sur des fonctions barrières de contrôle (CBF) qui garantissent en temps réel l'évitement de collisions entre agents. Les auteurs ont validé leur approche en simulation avec jusqu'à 25 agents, puis expérimentalement sur quatre robots physiques réels, démontrant la faisabilité et la capacité de passage à l'échelle du système. Ce travail s'adresse à un problème central de la robotique en essaim : comment coordonner un grand nombre d'agents mobiles pour qu'ils atteignent collectivement une configuration cible, sans collision, malgré la nature non convexe du problème d'optimisation sous-jacent. L'intérêt pratique du MPC distribué est sa capacité prédictive, qui limite le risque de blocage dans des minima locaux, un piège classique des méthodes de planification réactive pure. Les CBF apportent de leur côté des garanties formelles de sécurité, complémentaires et non redondantes avec l'optimisation MPC. Pour l'industrie robotique, notamment les applications de surveillance maritime, de dépollution ou de plateformes modulaires flottantes, ce type de coordination distribuée et scalable est une brique nécessaire avant tout déploiement réel en essaim, où la sécurité inter-agents ne peut pas dépendre d'une supervision centralisée fiable à tout instant. Le champ des robots auto-reconfigurables, terrestres, aériens ou aquatiques, cherche depuis plusieurs années à combiner flexibilité de forme et robustesse de contrôle, avec des travaux antérieurs s'appuyant soit sur des méthodes de contrôle purement réactives (moins performantes en anticipation), soit sur des optimisations centralisées peu scalables au-delà de quelques agents. La validation avec 25 agents en simulation et 4 robots physiques marque une étape de démonstration plutôt qu'un déploiement opérationnel abouti : les auteurs ne précisent pas de calendrier de suite ni de partenaire industriel identifié à ce stade, ce qui situe ce résultat clairement du côté recherche académique plutôt que produit commercialisable à court terme.

RecherchePaper
1 source