VeriGraph : graphes de scène pour la vérification de pl…

KGLAMP : un modèle de langage guidé par graphe de connaissances pour la planification multi-robot adaptative

46

1arXiv cs.RO

KGLAMP : un modèle de langage guidé par graphe de connaissances pour la planification multi-robot adaptative

Des chercheurs ont publié KGLAMP (Knowledge Graph-guided Language Model for Adaptive Multi-robot Planning and Replanning), un framework de planification combinant graphes de connaissances et grands modèles de langage pour coordonner des équipes de robots hétérogènes sur des missions longues. La contribution centrale est une architecture en deux couches : un graphe de connaissances structuré encode en temps réel les relations entre objets, la portée spatiale de chaque robot et leurs capacités spécifiques, tandis qu'un LLM s'appuie sur ce graphe pour générer automatiquement des spécifications PDDL (Planning Domain Definition Language) correctes. Quand l'environnement évolue, un obstacle déplacé, un robot en panne, le graphe détecte l'incohérence et déclenche un replanification automatique. Sur le benchmark MAT-THOR (un environnement simulé de type habitat domestique conçu pour tester la coordination multi-agents), KGLAMP surpasse de 25,3 % au minimum les deux approches de référence : planificateurs PDDL classiques seuls et LLM seuls. Ce résultat est significatif parce qu'il attaque un problème structurel bien documenté dans la littérature : les planificateurs symboliques PDDL exigent des modèles du monde construits manuellement, coûteux à maintenir dans des environnements dynamiques, tandis que les LLM utilisés seuls tendent à ignorer l'hétérogénéité des agents et à produire des plans invalides face à l'incertitude. KGLAMP propose une mémoire persistante et mise à jour dynamiquement qui sert d'interface entre perception et raisonnement symbolique. Pour un intégrateur déployant des flottes mixtes (AMR, bras manipulateurs, drones), la promesse d'un replanning automatique sans re-modélisation manuelle représente un gain opérationnel concret, notamment dans les entrepôts à géométrie variable ou la logistique hospitalière. L'article s'inscrit dans la tendance des approches dites "neuro-symboliques" qui tentent de corriger les faiblesses des LLM par des représentations explicites du monde. Les travaux concurrents incluent SayPlan (Rana et al., 2023) et les variantes LLM+PDDL de Meta AI, Google DeepMind ou CMU. Il reste à noter que les expériences sont conduites exclusivement en simulation sur MAT-THOR : aucune validation physique n'est rapportée, ce qui laisse ouverte la question du sim-to-real gap pour des flottes réelles. La prochaine étape naturelle serait un déploiement sur des plateformes matérielles hétérogènes pour mesurer la robustesse du graphe de connaissances face au bruit sensoriel du monde réel.

RecherchePaper

1 source

Vers une vérification de propriété par backdoor pour les modèles vision-langage-action (VLA)

54

2arXiv cs.RO

Vers une vérification de propriété par backdoor pour les modèles vision-langage-action (VLA)

Des chercheurs ont publié sur arXiv le 12 mai 2026 (référence 2605.09005) GuardVLA, premier cadre de vérification de propriété intellectuelle basé sur les backdoors pour les modèles Vision-Language-Action (VLA). Ces modèles permettent un contrôle robotique généraliste en convertissant des entrées multimodales (vision, langage, données proprioceptives) directement en séquences d'actions motrices. GuardVLA intègre un filigrane cryptographique lors de l'entraînement : un message secret est injecté dans les données visuelles du modèle sans altérer ses performances nominales sur les tâches cibles. La vérification post-déploiement s'effectue via un mécanisme baptisé "swap-and-detect" : un projecteur de déclenchement combiné à une tête de classification externe active et détecte le backdoor intégré à partir des probabilités de prédiction du modèle. Les expériences valident l'approche sur plusieurs architectures, jeux de données et scénarios d'adaptation. L'enjeu est direct pour les intégrateurs et éditeurs de modèles robotiques. Des VLA open-source comme Pi-0 (Physical Intelligence), OpenVLA ou GR00T N2 (NVIDIA) font déjà l'objet de fine-tuning intensif par des tiers. GuardVLA démontre que le filigrane résiste à ces adaptations post-release, ce qui contredit l'hypothèse courante selon laquelle le fine-tuning suffit à effacer toute traçabilité. Pour un éditeur cherchant à protéger un modèle robotique commercial ou à prouver sa propriété en cas de litige, c'est une voie technique crédible sans recours à des mécanismes de DRM contraignants. La capacité à certifier l'origine d'un modèle devient stratégique à l'heure où les VLA s'imposent comme actifs industriels à part entière. Le watermarking de modèles IA existe déjà pour les LLM et les modèles de diffusion d'images, mais les VLA posent une contrainte supplémentaire : leur sortie est une séquence d'actions motrices et non un texte ou une image, ce qui rend la détection de backdoor structurellement différente. Ce travail reste un preprint non évalué par les pairs, sans déploiement industriel annoncé à ce stade. Les approches concurrentes, hachage de poids ou licensing cryptographique, ne ciblent pas spécifiquement la modalité action des VLA. La soumission en conférence, probablement CoRL 2026 ou ICRA 2027, constituera la prochaine validation formelle. L'adoption à grande échelle dépendra aussi de l'intégration aux outils de distribution existants, notamment Hugging Face, où la majorité des VLA généralisés sont aujourd'hui hébergés et redistribués.

UELes éditeurs et chercheurs européens distribuant des modèles VLA via Hugging Face (entreprise française, principal hub de redistribution cité) pourraient adopter GuardVLA pour défendre leur propriété intellectuelle face aux fine-tunings non autorisés.

RechercheOpinion

1 source

Relier la planification discrète à l'exécution continue pour les robots redondants

45

3arXiv cs.RO

Relier la planification discrète à l'exécution continue pour les robots redondants

Des chercheurs publient sur arXiv (identifiant 2604.02021) un cadre de transition entre planification discrète et exécution continue pour bras manipulateurs redondants à 7 degrés de liberté. Le constat de départ est pratique : les trajectoires générées par apprentissage par renforcement sur grille voxel, exécutées directement via cinématique inverse numérique point par point, produisent du jitter de pas, des transitions articulaires brusques et des instabilités au voisinage de configurations singulières. La méthode proposée agit sur deux niveaux sans modifier le planificateur existant. Côté planification : des actions cartésiennes à 26 voisins normalisées en pas et un mécanisme de tie-breaking géométrique qui supprime les virages inutiles et les oscillations. Côté exécution : une couche TP-DLS (task-priority damped least-squares IK) où la position de l'effecteur terminal est traitée comme tâche primaire, le centrage articulaire et le contrôle de posture étant projetés dans l'espace nul comme tâches subordonnées, combinés à un clipping par région de confiance et des contraintes de vitesse articulaire. Sur un 7-DOF testé en environnements sparse, medium et dense générés aléatoirement : taux de succès en scène dense de 0,58 à 1,00, longueur de chemin de 1,53 m à 1,10 m, erreur d'effecteur inférieure à 1 mm, accélérations articulaires de pointe réduites de plus d'un ordre de grandeur. L'intérêt opérationnel est la modularité : la couche TP-DLS s'insère comme un module plug-in sans retoucher le planificateur sous-jacent, abaissant le coût d'adoption pour les équipes qui disposent déjà d'un planificateur RL voxel-grid. La réduction des accélérations de pointe d'un facteur supérieur à 10 se traduit directement par moins d'usure mécanique, une moindre sollicitation des servomoteurs et une meilleure compatibilité avec les normes cobotiques (ISO/TS 15066). Le passage de 58 % à 100 % de succès en scènes denses est surtout un signal de diagnostic : il indique que le goulot d'étranglement n'était pas le planificateur RL mais bien la couche de conversion discret-continu, une hypothèse rarement testée explicitement dans la littérature. Limite à noter : tous les résultats restent en simulation sur environnements générés aléatoirement, sans validation sur hardware réel ni benchmark standardisé de la communauté. La cinématique inverse DLS et la gestion par priorité de tâche sont des techniques classiques issues des travaux de Nakamura et Hanafusa (1986) et de Siciliano et Slotine (1991) ; la contribution ici est leur intégration calibrée dans un pipeline RL voxel-grid avec des heuristiques spécifiques à la discontinuité des actions discrètes. Les premiers concernés sont les intégrateurs et équipementiers utilisant des bras 7-DOF redondants tels que Franka Robotics (FR3), KUKA (LBR iiwa) ou Kinova (Gen3). Aucun partenariat industriel ni timeline de transfert technologique n'est annoncé dans le preprint. La suite logique serait une validation sur robot physique et une comparaison directe avec des planificateurs continus comme CHOMP ou TrajOpt, qui résolvent le problème de manière différente mais avec un coût computationnel nettement plus élevé.

UEKUKA (LBR iiwa) et Franka Robotics (FR3), deux fabricants européens de bras redondants 7-DOF explicitement ciblés, pourraient réduire leur coût d'intégration de planificateurs RL et améliorer leur conformité ISO/TS 15066 grâce à ce module plug-in, sous réserve de validation hardware.

RecherchePaper

1 source

GaLa : des modèles vision-langage guidés par hypergraphe pour la planification procédurale

36

4arXiv cs.RO

GaLa : des modèles vision-langage guidés par hypergraphe pour la planification procédurale

Une équipe de chercheurs a publié sur arXiv (arXiv:2604.17241) un nouveau framework vision-langage baptisé GaLa, conçu pour améliorer la planification procédurale dans les systèmes d'IA incarnée. Le système repose sur une représentation par hypergraphe : chaque objet détecté dans une scène devient un nœud, tandis que des hyper-arêtes agrègent ces objets selon leurs attributs fonctionnels et leur sémantique pour former des régions cohérentes. GaLa intègre également un encodeur baptisé TriView HyperGraph Encoder, qui impose une cohérence sémantique entre trois niveaux de représentation (vue nœud, vue zone, vue association nœud-zone) via apprentissage contrastif. Les expériences menées sur les benchmarks ActPlan1K et ALFRED montrent des gains significatifs sur le taux de succès d'exécution, le score LCS (Longest Common Subsequence) et la correction des plans générés, sans que les auteurs ne publient de chiffres absolus précis dans le résumé disponible. Ce travail cible un problème bien documenté dans la robotique d'interaction : les VLMs (Vision-Language Models) actuels raisonnent correctement sur du langage et de l'image de façon isolée, mais peinent à saisir les relations spatiales implicites et la hiérarchie fonctionnelle d'une scène réelle. Pour un robot devant exécuter une séquence de tâches domestiques (préparer un repas, ranger des objets), comprendre que le plan de travail et le réfrigérateur appartiennent à la même région fonctionnelle change radicalement la qualité du plan généré. GaLa propose une couche de structuration explicite en amont du raisonnement VLM, ce qui réduit la dépendance aux capacités d'inférence implicite des modèles de fondation et ouvre la voie à une meilleure généralisation sur des scènes non vues. Le benchmark ALFRED, développé par Allen AI, est devenu la référence standard pour évaluer la planification procédurale en environnement simulé domestique, et ActPlan1K cible des scénarios procéduraux plus complexes. La tendance actuelle dans ce sous-domaine consiste à enrichir les VLMs généralistes (GPT-4o, LLaVA, InternVL) avec des modules de représentation structurée, une approche que GaLa pousse plus loin que les travaux précédents via l'hypergraphe. Les concurrents directs incluent des travaux comme SQA3D, EmbodiedScan ou les pipelines VLA (Vision-Language-Action) de Physical Intelligence (pi0) et de Google DeepMind, qui cherchent eux aussi à réduire le gap simulation-réel. GaLa reste pour l'instant un résultat de recherche académique sans déploiement physique annoncé.

RechercheActu

1 source

VeriGraph : graphes de scène pour la vérification de plans de robots

À lire aussi

KGLAMP : un modèle de langage guidé par graphe de connaissances pour la planification multi-robot adaptative

Vers une vérification de propriété par backdoor pour les modèles vision-langage-action (VLA)

Relier la planification discrète à l'exécution continue pour les robots redondants

GaLa : des modèles vision-langage guidés par hypergraphe pour la planification procédurale