
DiMaS : mise en correspondance des distributions pour piloter les modèles vision-langage-action
Des chercheurs présentent DiMaS (Distribution-Matching Steering), une méthode pour orienter finement le comportement des modèles vision-langage-action (VLA) bases sur le flow matching, sans reentrainement complet. Publie sur arXiv sous la référence 2607.14280, le travail s'attaque a un manque identifie dans le contrôle comportemental fin des robots: la capacité d'intervenir directement sur les représentations internes d'un modèle pour modifier la manière dont il execute une tache. Le "représentation steering" est un outil déjà bien établi en interpretabilite pour les grands modèles de langage et les modèles vision-langage, ou les traits comportementaux s'encodent généralement comme des directions linéaires dans l'espace latent. Les auteurs montrent que ces méthodes classiques échouent sur les VLA. DiMaS remplace le simple décalage le long d'une direction fixe par un transport entre distributions de représentations, et l'équipe démontre son efficacité sur deux VLA de pointe non nommes dans le résume. Elle etudie aussi la généralisation de la méthode a mesure que les taches d'apprentissage et d'évaluation divergent, en cartographiant ou le contrôle comportemental se transféré et ou il s'affaiblit. Code et résultats, avec des vidéos de démonstration, sont disponibles publiquement sur GitHub (pegah-kh/dimas) et sur une page projet dédiée.
Pour les équipes qui développent ou intègrent des politiques robotiques génératives, cette avancée ouvre une piste de personnalisation fine et peu couteuse: ajuster un comportement (prudence, vitesse d'exécution, style de préhension) sans reentrainer le modèle complet. L'apport le plus significatif est cependant diagnostique. En montrant que les traits comportementaux de l'"action expert", le module qui génère les trajectoires du robot, sont linéairement decodables mais pas linéairement pilotables, l'étude remet en question une hypothèse importée telle quelle des LLM: qu'un concept identifiable linéairement peut aussi être manipule linéairement. Une nuance utile face a l'engouement actuel pour les VLA généralistes dans la lignée de Pi-0 ou GR00T N2, ou expliquer une décision robotique ne garantit pas la capacité a la corriger simplement.
Ces travaux s'inscrivent dans la montée en puissance des politiques VLA a base de flow matching pour la manipulation, une famille de modèles qui a progressivement supplante des architectures de clonage comportemental plus rigides. Le champ de l'interpretabilite dont s'inspirent les auteurs est bien documente cote texte et vision, avec des méthodes de steering déjà utilisées pour orienter le ton ou la sécurité des grands modèles de langage; DiMaS transpose cette logique au domaine visuomoteur, ou elle n'avait pas encore été validée rigoureusement. Aucun acteur français ou européen de la robotique (Wandercraft, Pollen Robotics, Enchanted Tools) n'est implique: il s'agit d'un travail de recherche fondamentale, pas d'une annonce produit. Les auteurs annoncent vouloir étendre l'étude de généralisation a des taches encore plus éloignées, pour mieux cerner les limites du transfert comportemental entre contextes.




