Aller au contenu principal
Kepler-Encoder-v0.1 : vers un modèle d'embedding multimodal pour robots
RecherchearXiv cs.RO 

Kepler-Encoder-v0.1 : vers un modèle d'embedding multimodal pour robots

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient sur arXiv (2607.13522v1) Kepler-Encoder-v0.1, un encodeur multimodal pour robots qui fusionne vision, proprioception et force/couple dans un espace latent partagé, entraîné en auto-supervisé selon l'objectif LeJEPA/SIGReg. Le point de départ est que les features visuelles brutes d'un ViT figé captent très mal la force, avec un R² inférieur ou égal à 0,10 sur chaque robot testé. Sur le corpus multi-robots RH20T, le latent entraîné avec fusion, mais utilisé vision-seule à l'inférence, récupère significativement mieux l'état de l'effecteur terminal et la force que les baselines vision, sur tous les robots dotés de capteurs de force, tout en égalant les meilleures baselines sur l'état moteur déjà visible par la caméra. Un seul encodeur couvre quatre robots différents ; son erreur de prédiction croisée détecte les états invalides sans entraînement supplémentaire (AUROC de 0,90 sur les états hors limites, 0,69 sur les changements de scène), et un décodeur de diffusion (PixNerd) reconstruit l'image caméra depuis ce latent.

Pour les intégrateurs robotique, l'intérêt est concret : un encodeur entraîné avec force et proprioception, une fois déployé vision-seule, conserve une partie de l'information de contact dans son espace latent, ce qui ouvre la voie à des robots moins instrumentés à l'inférence tout en restant plus sensibles au contact physique. L'approche se distingue de la course aux modèles VLA généralistes comme Pi-0, GR00T N2 ou Helix, centrés sur la génération d'action : Kepler-Encoder-v0.1 s'attaque à la représentation d'état en amont, y compris ce que la caméra ne voit pas directement. Les auteurs restent toutefois prudents, la récupération absolue de la force à un instant donné demeurant modeste, un signal statistique plutôt qu'une reconstruction fiable image par image.

Le travail s'appuie sur RH20T, jeu de données multi-robots déjà utilisé pour entraîner des représentations tactiles et visuelles, et sur LeJEPA/SIGReg, une famille de méthodes type JEPA qui prédit dans l'espace latent plutôt que de reconstruire les pixels bruts. Publié en preprint sur arXiv, le rapport précise explicitement ses limites : il ne valide que le cas à un seul pas de temps, la fusion temporelle à fréquence native étant annoncée comme prochaine étape, et aucun déploiement industriel n'est mentionné à ce stade. Il s'inscrit dans un mouvement de recherche plus large visant des encodeurs d'état généralistes et agnostiques à l'embodiment, en complément des modèles VLA orientés action comme Pi-0 ou GR00T N2.

Dans nos dossiers

À lire aussi

AssemLM : un modèle de langage multimodal pour le raisonnement spatial en assemblage robotique
1arXiv cs.RO 

AssemLM : un modèle de langage multimodal pour le raisonnement spatial en assemblage robotique

Des chercheurs ont publié AssemLM (arXiv:2604.08983), un modèle multimodal de raisonnement spatial pour la robotique d'assemblage. Le système fusionne trois sources (manuels d'assemblage, nuages de points 3D, instructions textuelles) pour prédire des poses 6D, c'est-à-dire la position et l'orientation complètes d'une pièce dans l'espace tridimensionnel. Un encodeur de nuages de points spécialisé extrait des caractéristiques géométriques et rotationnelles fines, transmises ensuite à un LLM multimodal pour le raisonnement spatial de haut niveau. Les auteurs publient également AssemBench, un benchmark de plus de 900 000 échantillons multimodaux avec annotations de poses 6D précises, étendant l'évaluation classique du grounding 2D à l'inférence géométrique 3D complète. Des tests sur robot réel valident des performances à l'état de l'art sur des tâches d'assemblage multi-étapes en conditions réelles. Le verrou ciblé est central en manipulation fine industrielle: les VLMs courants opèrent sur des images 2D et peinent à raisonner sur la géométrie précise qu'exigent le vissage, l'emboîtement ou l'alignement de composants au sous-millimètre. En intégrant les nuages de points comme modalité native, AssemLM raisonne sur l'orientation exacte d'une pièce, pas seulement sur sa présence dans le champ visuel. Pour un intégrateur ou une équipe R&D en automatisation industrielle, prédire des poses 6D depuis un manuel PDF et une capture 3D ouvre la voie à des cellules d'assemblage reconfigurables sans reprogrammation manuelle entre chaque référence produit. AssemBench, avec ses 900 000 échantillons annotés, comble par ailleurs un manque d'infrastructure de comparaison rigoureuse dans ce sous-domaine. Le raisonnement spatial est un défi persistant pour les modèles de vision-langage, majoritairement entraînés sur des tâches 2D (captioning, grounding d'objets, VQA). Les modèles VLA (Vision-Language-Action) récents, comme pi0 de Physical Intelligence, OpenVLA ou les travaux de Google DeepMind sur RoboVLMs, progressent sur la manipulation généraliste, mais l'assemblage industriel structuré avec ses contraintes de précision sub-millimétrique reste peu adressé par ces approches. AssemLM se positionne dans cette niche en ciblant explicitement les tâches avec documentation formalisée (manuels, nomenclatures). Les auteurs annoncent la mise à disposition publique du code, des modèles et du dataset AssemBench, point d'entrée potentiel pour la communauté académique et les industriels souhaitant affiner le modèle sur leurs propres composants. Aucun partenaire industriel ni déploiement commercial n'est mentionné: il s'agit à ce stade d'une publication de recherche, sans produit ni pilote planifié.

UELa publication en open-source d'AssemBench (900 000 échantillons annotés 6D) constitue une ressource d'entraînement et d'évaluation directement exploitable par les labos européens travaillant sur la manipulation industrielle précise, sans acteur FR/EU impliqué à ce stade.

RechercheOpinion
1 source
RoboBench : un benchmark d'évaluation complet pour les grands modèles multimodaux comme cerveau incarné
2arXiv cs.RO 

RoboBench : un benchmark d'évaluation complet pour les grands modèles multimodaux comme cerveau incarné

La robotique humanoïde et manipulatrice s'appuie de plus en plus sur une architecture a deux niveaux: un "System 1" qui gère le contrôle moteur bas niveau et un "System 2", le cerveau incarne, charge du raisonnement et de la prise de décision. Un article mis a jour sur arXiv présente RoboBench, un benchmark conçu pour évaluer spécifiquement ce cerveau incarne lorsqu'il est implémenté par un modèle multimodal de grande taille (MLLM). Le benchmark couvre cinq dimensions: compréhension des instructions, raisonnement perceptif, planification généralisée, prédiction d'affordances et analyse d'échecs, reparties en 14 capacités, 25 taches et 6 092 paires question réponse. Les données combinent des jeux de données robotiques réels a grande échelle et des collectes internes couvrant plusieurs types de robots, des objets aux attributs varies, des scenes multi vues et des taches de navigation dépendantes de la mémoire. Dix huit MLLMs de pointe ont été testes sur ce benchmark. L'enjeu dépasse la simple mesure de performance: la plupart des benchmarks existants évaluent surtout le succès final d'exécution, sans isoler la qualité du raisonnement de haut niveau qui précède l'action, ni la réalité des taches proposées. RoboBench cherche a combler cet écart en testant directement si un modèle comprend une consigne implicite, raisonne correctement sur l'espace et le temps, ou diagnostique un échec, indépendamment de la couche de contrôle moteur. Les résultats montrent des limites persistantes sur la compréhension d'instructions implicites, le raisonnement spatio-temporel, la planification inter scenarios, la compréhension fine des affordances et le diagnostic d'échecs, ce qui questionne la maturité réelle des MLLMs actuels comme cerveaux de robots, au delà des démonstrations souvent mises en avant par les laboratoires. Pour l'évaluation de la planification, les auteurs introduisent un cadre inédit dit "MLLM comme simulateur du monde", qui vérifie si un plan prédit peut effectivement produire les changements d'état critiques d'un objet sous contraintes physiques et visuelles, plutôt que de se contenter d'un simple appariement symbolique avec un plan de référence. Cette approche vise une évaluation plus fidèle du raisonnement a long horizon. Les chercheurs analysent également le lien entre ces capacités cognitives incarnées et la performance réelle en contrôle robotique, positionnant RoboBench comme un outil de référence pour orienter la prochaine génération de MLLMs vers une intelligence robotique plus robuste.

RecherchePaper
1 source
Robot de sécurité pour l'inspection industrielle : un benchmark multimodal
3arXiv cs.RO 

Robot de sécurité pour l'inspection industrielle : un benchmark multimodal

Un consortium de recherche a publié InspecSafe-V1, présenté comme le premier benchmark multimodal dédié à l'évaluation de la sécurité pour l'inspection industrielle construit à partir de données réelles plutôt que simulées. Le jeu de données a été collecté auprès de 41 robots d'inspection, à roues ou montés sur rail, opérant sur 2 239 sites d'inspection valides, pour un total de 5 013 instances d'inspection. Cinq environnements industriels sont couverts : tunnels, installations électriques, équipements de frittage, sites pétrochimiques et gaziers, et convoyeurs à charbon sur chevalets. Chaque instance comprend une annotation de segmentation au pixel près des objets clés dans les images en lumière visible, une description sémantique de la scène, ainsi qu'un label de niveau de sécurité correspondant à des tâches d'inspection réelles. Le dataset intègre en outre sept modalités de capteurs synchronisées : vidéo infrarouge, audio, nuages de points de profondeur, nuages de points radar, mesures de gaz, température et humidité. Pour l'industrie de la maintenance prédictive et de l'inspection autonome, ce type de ressource comble un manque documenté : la plupart des jeux de données publics existants reposent sur des environnements simulés ou une seule modalité de capture, ce qui limite l'entraînement de modèles capables de raisonner de façon robuste sur des scènes industrielles complexes et dynamiques. En fournissant des annotations fines multi-capteurs issues de conditions opérationnelles réelles, InspecSafe-V1 vise à permettre l'entraînement et l'évaluation de modèles de fondation appliqués à l'industrie, avec des tâches de reconnaissance d'anomalies multimodale et de fusion cross-modale, un enjeu clé pour les intégrateurs qui cherchent à fiabiliser des systèmes de perception déployés sur des sites à risque (tunnels, sites pétrochimiques) où l'erreur de détection a un coût opérationnel élevé. Cette publication correspond à une nouvelle version (replace) d'un article déjà déposé sur arXiv, signe d'un travail de consolidation méthodologique plutôt que d'une annonce inédite. Le texte ne précise pas l'organisme ou l'entreprise à l'origine du déploiement des robots, ni si le dataset et son code seront rendus publics, deux éléments qui conditionneront son adoption effective par la communauté robotique et vision industrielle.

RecherchePaper
1 source
Système intelligent d'interaction multimodale cloud-edge pour robots
4arXiv cs.RO 

Système intelligent d'interaction multimodale cloud-edge pour robots

Une équipe de chercheurs présente un système d'interaction multimodale cloud-edge pour robots, combinant un détecteur de gestes basé sur YOLO avec des agents LLM et VLM (vision-language model) coordonnés à distance. Le détecteur, baptisé YOLO-DC, intègre un module d'attention CBAM (Convolutional Block Attention Module) dans le neck du réseau et remplace la fonction de perte classique de régression des boîtes englobantes par une perte DIoU (Distance-IoU), afin de mieux localiser les gestes petits ou partiellement occultés dans des arrière-plans complexes. Dans l'architecture proposée, le cloud prend en charge la détection des gestes, la compréhension de la scène, la fusion multimodale et la planification des actions, tandis que le robot humanoïde TonyPi, utilisé comme plateforme de test, gère localement l'acquisition de données, la communication, l'exécution des actions et le retour utilisateur. Sur un jeu de données public et un jeu de données maison, YOLO-DC atteint des précisions de 98,9% et 95,0%, avec des mAP@0,5 de 90,7% et 92,7%. À l'échelle du système complet, les taux de réussite s'élèvent à 95% pour les tâches à action unique, 88% pour les tâches à actions composites et 82% pour les tâches dépendant de la vision. Une évaluation menée auprès de 30 participants donne un score de satisfaction moyen de 3,69 sur 5. Ces résultats intéressent surtout les concepteurs de systèmes robotiques low-cost et les chercheurs en interaction homme-robot, car ils illustrent une voie alternative au tout-embarqué: déporter la charge de calcul lourde (détection, raisonnement multimodal, planification) vers le cloud permet d'équiper des plateformes à ressources limitées, comme TonyPi, de capacités proches de celles de robots bien mieux instrumentés. La baisse notable du taux de réussite sur les tâches dépendant de la vision (82%) rappelle toutefois que la fusion multimodale reste le maillon faible, un écart classique entre démonstration contrôlée et usage réel. Ce travail s'inscrit dans la lignée des architectures cloud-edge déjà explorées pour la robotique de service, où la latence réseau et la fiabilité de la liaison restent des contraintes pratiques non abordées ici. Le score de satisfaction obtenu avec un échantillon restreint de 30 participants et une plateforme robotique de démonstration suggère un travail encore exploratoire, dont la généralisation à des robots industriels ou à des environnements moins contrôlés reste à démontrer.

RecherchePaper
1 source