
Attention à partir de l'action, pour l'action : goulots d'étranglement visuels émergents pour l'apprentissage de politiques
Des chercheurs publient sur arXiv (arXiv:2608.13422v1, mi-août 2026) Seeker, une méthode d'apprentissage de politiques visuomotrices pour la manipulation robotique. Le système s'appuie sur DINOv3, un extracteur de features visuelles figé, et apprend à générer des régions d'intérêt (ROI) évolutives dans le temps à partir du seul signal d'action, sans étiquette externe comme le regard, la classe d'objet ou une annotation d'affordance. Cette ROI sert de filtre spatial pour trois usages : recadrage RGB, augmentation d'arrière-plan guidée par masque, et filtrage de nuages de points.
















































