Aller au contenu principal
Try Once, Puis Optimal : Mémoire de Procédure Dé-redondée pour l'Amortissement de l'Exploration Inter-Épisodes
RecherchearXiv cs.RO 

Try Once, Puis Optimal : Mémoire de Procédure Dé-redondée pour l'Amortissement de l'Exploration Inter-Épisodes

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent Instance-Oriented Memory (IOM), un système de mémoire objet-centrique qui évite aux robots manipulateurs de re-sonder à chaque rencontre les objets à état caché, comme un four à micro-ondes verrouillé ou une porte au mécanisme invisible. Dès la première rencontre, réussie ou non, IOM enregistre une courte procédure indexée sur les caractéristiques visuelles de l'objet, puis l'injecte comme biais souple dans une politique de manipulation ; à la rencontre suivante, le robot reconnaît l'objet et rappelle directement la procédure au lieu de re-explorer. La distillation s'appuie sur un modèle vision-langage (VLM) prêt à l'emploi, sans entraînement spécifique à la tâche. Sur quatre tâches d'objets articulés (four et porte en simulation, bouteille et armoire sur robot réel), une mémoire de procédure oracle réduit les opérations de manipulation de 16 à 30 % sans perte de réussite, et la version instrumentée par VLM récupère 69 à 88 % de ce gain dès la sortie de boîte.

L'apport cible un angle mort des mémoires inter-épisodes existantes, qui organisent la réutilisation autour d'états génériques plutôt qu'autour de l'objet et du coût réel de sa re-exploration. Pour des intégrateurs déployant des robots en environnement semi-structuré (entrepôt, cuisine, hôpital) où les mêmes appareils reviennent souvent dans le champ d'action, ce gain d'efficacité réduit directement le temps de cycle. Le point le plus significatif pour la fiabilité en conditions réelles : la procédure retrouvée n'est qu'un biais sur une politique pilotée par retour sensoriel, pas une instruction impérative, donc une mémoire erronée est corrigée plutôt que suivie aveuglément. Le taux de réussite ne régresse jamais, même quand la procédure rappelée est fausse, ce qui arrive dans environ 12 % des instances de porte, et il s'améliore même sur le robot réel.

IOM s'inscrit dans la recherche sur la manipulation d'objets articulés à état caché, où le robot doit sonder physiquement un loquet ou une charnière avant d'agir de façon fiable. Contrairement aux politiques VLA généralistes récentes comme GR00T N2, Helix ou Pi-0, centrées sur la généralisation de compétences entre tâches, IOM se positionne comme une couche de mémoire additionnelle au-dessus d'une politique existante plutôt que comme un concurrent direct. L'article, soumis sur arXiv le 28 juillet 2026 en tant que nouvelle contribution, précise que le code sera publié après acceptation : aucune implémentation n'est donc encore disponible publiquement, et la validation reste pour l'instant limitée à quatre tâches de laboratoire.

Dans nos dossiers

À lire aussi

MEMORA : mémoire d'action incarnée à partir de vidéos égocentriques pour le raisonnement et la planification
1arXiv cs.RO 

MEMORA : mémoire d'action incarnée à partir de vidéos égocentriques pour le raisonnement et la planification

Des chercheurs présentent MEMORA, un système de mémoire d'action incarnée pour la planification robotique à long horizon, détaillé dans un article publié le 17 juillet 2026 sur arXiv (2607.14252v1). L'architecture repose sur un cycle formation-consolidation-récupération et quatre magasins de mémoire typés : Environment Memory (lieux), Entity Memory (identité et états des objets), Activity Memory (procédures répétées) et Inferred Knowledge (régularités déduites de l'expérience). Les auteurs ont construit MEMORA-Bench, évalué sur 45 heures de vidéos égocentriques issues d'une extension du jeu de données EPIC-KITCHENS-100 couvrant 18 participants, avec des tâches de planification ancrée en mémoire incluant des objectifs inédits. Testée sur quatre modèles de langage à poids ouverts, la version complète de MEMORA obtient les meilleurs résultats agrégés parmi toutes les conditions comparées, avec un gain jusqu'à 20,5 points de précision sur l'évaluation de mémoire et une amélioration relative jusqu'à 16,6% du score de plan ancré au robot en généralisation hors distribution. Une étude qualitative de déploiement sur deux tâches robotiques illustre l'interfaçage entre plans en langage naturel et contrôle réel. L'enjeu dépasse le simple score de benchmark. La plupart des modèles vision-langage-action actuels, de Pi-0 à GR00T N2 en passant par Helix, raisonnent surtout à partir de la scène présente, sans mémoire persistante des lieux, états d'objets ou procédures déjà rencontrées. Or planifier à long horizon dans un entrepôt, une cuisine industrielle ou un atelier suppose de se souvenir où est rangé tel outil ou quelle procédure a déjà fonctionné. En montrant qu'une mémoire éditable et consolidée améliore la généralisation à des objectifs inédits, MEMORA plaide pour une architecture hybride perception-action plus mémoire structurée, plutôt qu'un modèle unique de bout en bout. Pour les équipes de recherche robotique, le signal est que le goulot d'étranglement du raisonnement long horizon tient autant à l'absence de représentation persistante de l'expérience qu'à la politique d'action elle-même. Ce travail s'inscrit dans la recherche émergente sur l'agentivité incarnée à mémoire longue, en marge des humanoïdes commerciaux comme Figure 03 ou Optimus. À ce stade, MEMORA reste un travail académique évalué sur benchmark et testé qualitativement sur seulement deux tâches robotiques, loin d'un déploiement industriel. Les auteurs le positionnent comme complémentaire aux modèles VLA existants, une couche de contexte en amont plutôt qu'un concurrent. La suite logique serait une intégration à des pipelines VLA en conditions réelles et une extension du benchmark au-delà des tâches de cuisine, vers la logistique ou l'assemblage. Détails et code sur la page projet des auteurs.

RecherchePaper
1 source
Amortissement de l'optimisation de trajectoire pour la MPC résiduelle via différentiation implicite du contact
2arXiv cs.RO 

Amortissement de l'optimisation de trajectoire pour la MPC résiduelle via différentiation implicite du contact

Cette étude publiée sur arXiv (2607.24959v1) s'attaque à un goulot d'étranglement classique de la robotique de contact : l'optimisation de trajectoire dans des simulateurs différentiables. Les chercheurs introduisent une méthode de dérivation implicite assistée par différentiation automatique (AD), appliquée au moteur MuJoCo MJX et fondée sur le théorème des fonctions implicites (IFT). Contrairement aux différences finies, coûteuses et sensibles au choix du pas, ou au déroulement complet de l'AD à travers un solveur de contact itératif, qui fait exploser la trace de calcul stockée en mémoire, leur approche différencie directement le résidu de stationnarité à la solution convergée, sans reconstruire à la main les systèmes KKT propres à chaque solveur. Résultat mesuré : la mémoire temporaire compilée reste quasi constante quel que soit l'effort du solveur, avec moins de 4% de variation entre une et dix itérations, contre une croissance de 10,6 fois pour l'AD déroulée classique. Le gain s'accentue avec la complexité du problème : 20 fois moins de mémoire à 256 contacts actifs, 6 fois moins à 16 contacts et 96 degrés de liberté. L'équipe va plus loin avec une technique de "distillation d'optimiseur" pour le contrôle prédictif résiduel (residual MPC) : un iLQR complet, calculé en batch sur tout l'horizon temporel, est condensé en une politique qui guide ensuite un iLQR résiduel à horizon court, bien moins coûteux à exécuter en ligne. Sur trois bancs d'essai (Finger, bras Franka, quadrupède Unitree), cette approche améliore le taux de succès à six pas de 28 à 98 points de pourcentage par rapport à un iLQR standard. Pour les équipes qui développent du contrôle robotique riche en contacts, manipulation fine, locomotion sur terrain irrégulier, l'intérêt est double : réduire drastiquement l'empreinte mémoire permet de faire tourner des simulations différentiables à plus grande échelle ou en temps réel embarqué, tandis que la distillation d'optimiseur offre une voie pour transférer la qualité d'une planification hors-ligne coûteuse vers un contrôleur exécutable en boucle rapide sur le robot. Le travail s'inscrit dans la lignée des efforts récents autour de MuJoCo MJX et de la simulation différentiable pour la robotique, un axe de recherche actif depuis que des laboratoires comme DeepMind ou des groupes académiques cherchent à exploiter les gradients de simulateurs physiques pour accélérer l'apprentissage et la planification, plutôt que de s'appuyer uniquement sur l'apprentissage par renforcement sans modèle. La méthode proposée ici comble un vide méthodologique entre les approches génériques mais gourmandes en mémoire et les dérivations KKT sur mesure, difficiles à maintenir et à généraliser d'un solveur à l'autre. Les auteurs ne précisent pas de calendrier de publication du code ni de partenariat industriel, mais la validation croisée sur des plateformes hétérogènes (doigt robotique, bras manipulateur Franka, quadrupède Unitree) suggère une ambition de généralisation au-delà d'un cas d'usage unique, avec un potentiel d'intégration dans des piles de contrôle MPC pour la manipulation ou la locomotion dynamique.

RecherchePaper
1 source
PISTO : inférence proximale pour l'optimisation stochastique de trajectoires
3arXiv cs.RO 

PISTO : inférence proximale pour l'optimisation stochastique de trajectoires

Des chercheurs ont publié sur arXiv (arXiv:2605.07215) un algorithme de planification de trajectoires robotiques appelé PISTO (Proximal Inference for Stochastic Trajectory Optimization). Leur contribution centrale est de démontrer que STOMP, méthode stochastique classique, minimise implicitement une divergence KL par rapport à une distribution de trajectoires de Boltzmann, révélant une structure d'inférence variationnelle (VI) sous-jacente. PISTO exploite cette observation en ajoutant une régularisation KL entre propositions gaussiennes successives, ce qui stabilise les mises à jour et produit une interprétation de type trust-region. L'algorithme reste entièrement sans dérivées et s'appuie sur un échantillonnage Monte Carlo à pondération d'importance. Sur les benchmarks de planification de bras robotiques, PISTO atteint 89 % de taux de succès contre 63 % pour CHOMP et 68 % pour STOMP, tout en générant des trajectoires plus courtes et plus lisses, à deux fois la vitesse des méthodes stochastiques concurrentes. Des validations complémentaires sur des tâches de locomotion et manipulation contact-rich en simulation MuJoCo montrent des performances supérieures aux baselines CEM et MPPI en termes de récompense cumulée. Pour les intégrateurs et ingénieurs en planification de mouvement, l'absence totale de dérivées est une caractéristique décisive : elle permet de traiter des fonctions de coût non-différentiables ou discontinues, fréquentes dans les environnements industriels réels (détection de collisions, zones interdites, contraintes non paramétriques). Le gain de vitesse d'un facteur deux par rapport aux méthodes stochastiques existantes réduit directement les temps de cycle dans les applications de planification en ligne, point critique pour la robotique collaborative et les systèmes pick-and-place haute cadence. La validation sur MuJoCo avec contacts ouvre des perspectives vers la locomotion humanoïde et la manipulation dextre, bien que ces résultats restent pour l'instant entièrement simulés, sans validation sur matériel physique. PISTO s'inscrit dans la lignée de STOMP (développé chez Willow Garage et présenté à l'ICRA 2011) et de ses concurrents gradient-based tels que CHOMP, ainsi que des méthodes stochastiques modernes MPPI (popularisé par NVIDIA en 2017) et CEM. Soumis comme preprint arXiv sans révision par les pairs à ce stade, l'article n'annonce ni déploiement industriel ni partenariat commercial. Son impact pratique dépendra de la mise à disposition du code source et de validations expérimentales sur robot réel, étapes absentes de la publication actuelle.

RecherchePaper
1 source
Roue à griffes adaptative au terrain pour l'exploration planétaire optimale : conception et étude expérimentale
4arXiv cs.RO 

Roue à griffes adaptative au terrain pour l'exploration planétaire optimale : conception et étude expérimentale

Une équipe de recherche (identité anonymisée dans le preprint arXiv:2605.24311 soumis en mai 2026) présente une roue multimodale capable d'ajuster en continu la hauteur de ses grousers, les crampons périphériques qui mordent le sol, pour s'adapter aux variations de terrain lors d'explorations planétaires. Le prototype, dont le nom reste masqué pour la révision par les pairs, a été évalué sur quatre surfaces représentatives : carrelage vinyle, roche grossière, gravier de pois et sable dans deux états de compaction. Sur 750 essais expérimentaux, le déploiement adaptatif réduit le glissement de 30 à 58 % selon le terrain, et améliore le temps de parcours ainsi que la consommation énergétique de jusqu'à 77,4 % en régime granulaire, comparé à une configuration à grouser fixe. La conclusion centrale bouscule un paradigme établi : aucune hauteur de grouser unique ne minimise le glissement sur l'ensemble des surfaces testées, ce qui souligne les limites structurelles des roues statiques, encore la norme sur Curiosity, Perseverance et la quasi-totalité des rovers en développement. Pour les agences spatiales (NASA, ESA, JAXA) et les intégrateurs de systèmes de mobilité, un mécanisme adaptatif de ce type offre un gain direct sur l'autonomie énergétique et la distance journalière franchissable. L'équipe propose également une loi de dimensionnement simplifiée reliant la granularité du terrain à la hauteur optimale de grouser, un outil potentiellement utilisable pour la planification de trajectoire embarquée. Les grousers font partie de la conception des roues de rovers depuis les missions Apollo (Lunar Roving Vehicle, 1971), mais leur hauteur a toujours été figée au stade de la conception. Les travaux récents sur les roues multimodales avaient exploré la rigidité variable ou le diamètre ajustable sans jamais traiter la hauteur de grouser comme variable de contrôle continue : ce preprint comble ce manque avec une validation expérimentale à grande échelle. Des designs à compliance variable issus de Carnegie Mellon et du JPL constituent les références concurrentes les plus proches, sans confrontation directe dans l'article. La suite logique passe par une validation sur simulant lunaire ou martien certifié, puis l'intégration d'un contrôleur adaptatif en boucle fermée avec détection de terrain embarquée.

UEL'ESA, mentionnée comme bénéficiaire potentielle, pourrait intégrer ce principe de grouser adaptatif dans ses futurs rovers lunaires ou martiens, mais aucune entité française ou européenne n'est identifiée parmi les auteurs.

RecherchePaper
1 source