Aller au contenu principal
Structure accrue, pas capacité accrue : représentations centrées sur les objets pour l'apprentissage par imitation visuomotrice
RecherchearXiv cs.RO 

Structure accrue, pas capacité accrue : représentations centrées sur les objets pour l'apprentissage par imitation visuomotrice

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont testé, sur le simulateur ManiSkill3 et la tâche PickCube-v1, si des représentations visuelles structurées par objet apportent un réel avantage face aux encodeurs classiques utilisés dans les politiques d'imitation visuomotrice pour la manipulation robotique. En gardant fixes la politique, le token d'objectif, le rendu et la calibration, et en ne changeant que l'encodeur visuel, une représentation object-centric SPOT (DINO ViT-B/16 combiné à un mécanisme de Slot Attention, figé, sans fine-tuning) atteint un taux de succès de 55,0±2,9%, contre 32,6±1,5% pour une référence DINO à embedding global dense, soit un gain de 22,4 points. Fait notable, une grille de patches denses avec seize fois plus de tokens ne fait pas mieux que l'embedding global seul. En ajoutant un objectif spatial 2D explicite et un rendu en résolution native, le système complet grimpe à 68,7±4,2%, juste en dessous d'une borne supérieure "oracle" 3D privilégiée à 71,7±4,1%. Une taxonomie automatisée des échecs cinématiques distingue ensuite les erreurs de précision spatiale ("Near-Miss") des erreurs de suivi d'objet ("No-Grasp"), et montre que l'ancrage spatial réduit les premières sans affecter les secondes ; la même taxonomie, transposée à la tâche plus difficile StackCube-v1, pointe l'occlusion comme principal facteur limitant.

Ces résultats apportent une preuve empirique à une hypothèse importante pour le secteur : ce n'est pas la capacité brute d'un encodeur visuel (plus de tokens, plus de résolution de features) qui détermine la performance en manipulation, mais la structuration de l'information en objets discrets. Pour les équipes qui conçoivent des politiques VLA ou des pipelines d'apprentissage par imitation, cela suggère qu'investir dans des représentations object-centric peut être plus rentable que d'augmenter la taille des backbones visuels, et que le goulot d'étranglement réel se situe souvent dans le suivi d'objet sous occlusion plutôt que dans la précision géométrique pure.

Ce travail s'inscrit dans la lignée des recherches sur les représentations par slots (Slot Attention) appliquées à la robotique, en s'appuyant sur des encodeurs auto-supervisés comme DINO, déjà largement adoptés dans la communauté vision-langage-action. L'étude reste pour l'instant limitée à la simulation (ManiSkill3, tâches PickCube et StackCube) avec des encodeurs figés, sans fine-tuning ni validation en conditions réelles ; les auteurs identifient l'occlusion comme prochain axe de travail prioritaire pour combler l'écart avec la borne oracle.

À lire aussi

3D-DLP : apprentissage auto-supervisé de représentations de scènes 3D centrées sur les objets
1arXiv cs.RO 

3D-DLP : apprentissage auto-supervisé de représentations de scènes 3D centrées sur les objets

Une équipe de chercheurs publie 3D-DLP (3D Deep Latent Particles), un modèle d'apprentissage auto-supervisé de représentations de scène centré sur les objets. À partir d'entrées RGB-D (couleur et profondeur combinées) ou volumétriques en voxels, le modèle décompose une scène en un ensemble de particules latentes 3D, chacune encodant trois attributs distincts : la position 3D du keypoint, les dimensions de la bounding box et des descripteurs d'apparence visuelle. L'entraînement repose sur un objectif de reconstruction end-to-end sans annotations manuelles, en étendant le cadre Deep Latent Particles (DLP) au domaine 3D. Le modèle génère également des cartes de segmentation par particule, lisibles directement. Des expériences sur données simulées et réelles sont présentées dans le preprint arXiv 2606.19451, avec le code open source disponible à l'adresse eubooks3003.github.io/3d-dlp. Pour la manipulation robotique, l'apport principal est une représentation de scène à la fois structurée et compacte. Les benchmarks internes montrent une amélioration par rapport à deux types de baselines : celles qui manquent d'information 3D explicite, et celles qui utilisent des représentations 3D denses (nuages de points complets, volumes de voxels) sans structure centrée sur les objets. Cette dernière catégorie est coûteuse en mémoire à l'échelle, ce que 3D-DLP contourne via sa paramétrisation par particules. L'espace latent est également manipulable : modifier les positions des particules avant décodage permet de synthétiser de nouvelles configurations de scène, une propriété utile pour la planification ou la simulation contrefactuelle en robotique. Le modèle s'inscrit dans le courant de l'apprentissage centré sur les objets, en alternative aux approches monolithiques comme les NeRF ou les Gaussian Splatting pour la représentation 3D de scènes. Il entre aussi en dialogue avec les architectures VLA (Vision-Language-Action), qui peinent encore à intégrer une géométrie 3D explicite et structurée. À ce stade, 3D-DLP reste un preprint académique sans validation industrielle ni intégration dans un pipeline robotique commercial, et les métriques de performance ne sont pas quantifiées précisément au-delà d'une comparaison qualitative aux baselines.

RechercheActu
1 source
RayViT : représentations visuelles conditionnées par rayons pour l'apprentissage par imitation robuste au point de vue
2arXiv cs.RO 

RayViT : représentations visuelles conditionnées par rayons pour l'apprentissage par imitation robuste au point de vue

RayViT, ou Ray-conditioned Vision Transformer Encoder, est une nouvelle architecture légère proposée par des chercheurs pour rendre l'apprentissage par imitation visuelle plus robuste aux changements de camera. Le problème cible est simple: les politiques robotiques entraînées sur des images RGB brutes manquent d'indices géométriques explicites, ce qui les rend fragiles des qu'une camera est déplacée ou réorientée. RayViT injecte la géométrie de la camera directement dans des backbones ViT pré-entraines, en représentant cette géométrie sous forme de carte de rayons de Plucker, découpée en patches de features de rayons. Une attention croisée a portes (gated cross-attention) génère ensuite un token de classe conditionne par ces rayons, qui remplace le token de classe original du ViT tandis que les features de rayons sont ajoutées comme embeddings positionnels denses. Une fonction de perte auxiliaire par similarité cosinus renforce la cohérence de ces tokens géométriques. Sur le benchmark simulate RoboCasa multi-taches, la méthode améliore la robustesse d'environ 13 points de pourcentage face aux perturbations de camera, et sur des taches robotiques réelles multi-taches elle ajoute en moyenne 1,78 étape complétée par rapport aux méthodes de référence. L'enjeu dépasse la seule performance sur benchmark: c'est un problème très concret pour l'industrie robotique, ou les cameras embarquées se désalignent avec l'usure, les chocs ou des remontages successifs sur une chaine de production. Un système qui dégradé fortement des que le point de vue change n'est pas déployable a l'échelle chez un intégrateur, même s'il performe bien en démo contrôlée. En rendant les représentations visuelles conditionnées par la géométrie plutôt que par l'apparence brute, RayViT s'attaque directement a l'écart entre démonstration en laboratoire et fiabilité en conditions réelles, un des points de friction récurrents des approches VLA actuelles. Cette piste s'inscrit dans une tendance de recherche plus large visant a doter les politiques d'apprentissage par imitation d'une meilleure conscience 3D, plutôt que de compter uniquement sur le volume de données d'entrainement pour généraliser. En réutilisant des backbones ViT déjà pré-entraines et en ajoutant un module de conditionnement géométrique relativement léger, les auteurs proposent une voie peu couteuse a intégrer dans des pipelines existants, sans reentrainement complet du modèle visuel.

RecherchePaper
1 source
SAM3D pour aligner les représentations centrées sur l'objet dans les modèles vision-langage-action
3arXiv cs.RO 

SAM3D pour aligner les représentations centrées sur l'objet dans les modèles vision-langage-action

Cette recherche présente un cadre d'alignement de représentations 3D centré sur l'objet, appliqué au modèle vision-langage-action (VLA) $\pi0$. Les auteurs utilisent SAM3D, un modèle 3D figé servant de "professeur", pour injecter des connaissances géométriques sur les objets cibles pendant l'entraînement : les objets pertinents pour la tâche sont localisés via des modèles de reconnaissance, des masques sont générés, puis SAM3D en extrait des représentations 3D denses alignées avec les caractéristiques visuelles intermédiaires de $\pi0$. Fait notable, ce module 3D n'intervient qu'à l'entraînement : au moment de l'inférence, le pipeline reste purement RGB-langage-vers-action, sans besoin de profondeur, nuage de points, masques ou calculs SAM3D supplémentaires. Les résultats en simulation atteignent 99,1% de réussite sur le benchmark LIBERO et une longueur moyenne de tâches de 4,11 sur CALVIN, avec des gains confirmés en conditions réelles, notamment sur des scénarios de manipulation longue durée impliquant plusieurs sous-tâches et objets cibles différents. L'enjeu pour l'industrie robotique est la résolution d'un point faible connu des modèles VLA actuels : leur dépendance à des backbones vision-langage 2D qui peinent face à l'occlusion, aux variations de pose ou d'échelle, et aux interactions spatiales précises. En démontrant qu'on peut internaliser une compréhension 3D fine sans alourdir le pipeline de déploiement, ce travail répond à une critique récurrente du secteur : les architectures VLA génériques marchent bien en démo contrôlée mais échouent sur des tâches de manipulation fine en conditions réelles. Pour les intégrateurs et décideurs B2B, cela suggère une voie pour améliorer la robustesse des politiques de manipulation sans complexifier ni ralentir le matériel embarqué, un compromis critique pour le déploiement industriel à grande échelle de bras robotiques et de robots humanoïdes. Ce travail s'inscrit dans la lignée des modèles VLA construits sur $\pi_0$ (Physical Intelligence), déjà positionné comme concurrent direct des approches comme GR00T N2 de NVIDIA ou Helix de Figure AI dans la course à des politiques de manipulation généralistes. L'apport spécifique ici est méthodologique plutôt qu'un nouveau produit ou déploiement terrain : il s'agit d'une technique d'entraînement, testée pour l'instant en simulation (LIBERO, CALVIN) et en expérimentations réelles limitées, sans annonce de déploiement commercial ni de partenariat industriel. Les prochaines étapes attendues porteraient sur l'extension à d'autres backbones VLA et sur la validation à plus grande échelle en environnement réel, au-delà des bancs d'essai académiques actuels.

RecherchePaper
1 source
SIR : représentations d'images structurées pour un apprentissage robotique explicable
4arXiv cs.RO 

SIR : représentations d'images structurées pour un apprentissage robotique explicable

Des chercheurs du laboratoire Intuitive Robots publient SIR (Structured Image Representations, arXiv:2606.30101), une méthode visant à corriger l'un des angles morts persistants des politiques robotiques basées sur l'apprentissage profond : leur opacité. Le pipeline repose sur les Scene Graphs (graphes de scènes) comme couche intermédiaire entre la perception et l'action. À partir d'une image d'entrée, le système construit d'abord un graphe complet dont les noeuds sont initialisés avec des features visuelles extraites. Un second module apprend ensuite, de bout en bout, à réduire (sparsifier) ce graphe pour n'en conserver que le sous-graphe pertinent à la tâche courante, avant de le transmettre au générateur d'actions. Évalué sur RoboCasa, un benchmark de manipulation en environnement domestique simulé, SIR atteint un taux de succès moyen de 19,5 % contre 14,81 % pour les baselines à embeddings visuels directs, soit un gain relatif d'environ 30 %. L'intérêt ne se limite pas à ce delta de performance, en soi modeste en valeur absolue. Ce qui distingue SIR, c'est que le sous-graphe creux appris constitue une représentation lisible et auditable : il devient possible d'inspecter sur quels objets et quelles relations le modèle fonde ses décisions pour une tâche donnée. Lorsque ce sous-graphe s'écarte des attentes humaines, qu'il intègre des noeuds distracteurs sans rapport avec la tâche ou qu'il omet des objets pourtant centraux, les auteurs montrent que cela révèle systématiquement des biais dans le dataset d'entraînement, notamment des corrélations spurieuses et des biais positionnels. Pour des intégrateurs industriels ou des équipes soumises à des exigences de validation et de certification, cette capacité d'audit intrinsèque est un argument autrement plus fort qu'une amélioration marginale du taux de réussite. Ce travail s'inscrit dans un débat de fond au sein de la communauté robotique : les représentations visuelles latentes des architectures de type VLA (Vision-Language-Action) ou des politiques par diffusion sont puissantes mais pratiquement impossibles à déboguer. Les approches concurrentes pour l'explicabilité passent généralement par des méthodes post-hoc, cartes de saillance ou visualisation d'attention dans les Transformers, qui n'interviennent pas dans la boucle d'inférence. SIR propose à l'inverse une explicabilité structurelle native. Le code est disponible sur GitHub (intuitive-robots/SIR\_Model) et les auteurs évaluent pour l'instant uniquement en simulation ; la généralisation à des robots physiques dans des environnements non contrôlés reste la prochaine étape critique pour valider le sim-to-real transfer de cette approche.

RecherchePaper
1 source