Aller au contenu principal
Vidéo : un robot maîtrise l'air hockey et bat des humains sans jamais toucher une vraie table
RechercheInteresting Engineering 

Vidéo : un robot maîtrise l'air hockey et bat des humains sans jamais toucher une vraie table

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE
Vidéo : un robot maîtrise l'air hockey et bat des humains sans jamais toucher une vraie table
▶ Voir sur YouTube

Une équipe de trois étudiants de l'Université de la Colombie-Britannique (UBC) a développé une table de air hockey contrôlée par intelligence artificielle, capable d'affronter des joueurs humains sans avoir jamais été entraînée sur une vraie table. Le système repose sur un transfert simulation-réel (sim-to-real) : l'agent IA a été entraîné exclusivement dans un jumeau numérique haute-fidélité de la table, via une méthode d'apprentissage par renforcement appelée "soft actor-critic" (SAC), qui remplace les moteurs physiques classiques comme Unity ou Unreal pour accélérer les itérations sur des millions de parties simulées. Une fois le modèle entraîné, il a été transféré directement dans le robot physique, équipé d'une caméra aérienne à 120 images par seconde et d'un palet recouvert de bande rétroréfléchissante pour améliorer le tracking. Résultat : l'IA s'est montrée compétitive face à un adversaire humain dès le premier contact avec la table réelle, sans phase d'adaptation supplémentaire.

Ce qui rend ce résultat notable, c'est la gestion explicite du "reality gap", le fossé qui sépare habituellement les performances en simulation de celles dans le monde réel. Le air hockey est un cas particulièrement difficile : le palet se déplace à grande vitesse, ses rebonds sont chaotiques, et le système doit absorber des latences caméra, des fluctuations de tension, des vibrations mécaniques et un tracking imparfait. L'équipe a répondu à ce problème par ce qu'on appelle la "domain randomization" : plutôt que de simuler une table parfaite, ils ont introduit délibérément des imperfections, rails inégaux, rebonds inconsistants, chutes d'alimentation, latence variable, pour forcer l'agent à raisonner en termes de distributions de positions probables plutôt qu'en trajectoires exactes. C'est une approche qui contredit le réflexe habituel de "nettoyer" les simulateurs, et dont les résultats suggèrent que l'imperfection contrôlée peut être un levier d'apprentissage plus robuste que la précision physique maximale.

Sur le plan du contexte, ce projet étudiant s'inscrit dans un effort de recherche plus large sur les transferts sim-to-real pour les systèmes autonomes, thème central dans la robotique de manipulation, les drones et les véhicules autonomes. Il ne s'agit pas d'un produit commercialisé ni d'un déploiement industriel, mais d'une preuve de concept académique dont le code est disponible sur GitHub. Les laboratoires travaillant sur des agents de manipulation à grande échelle, comme Physical Intelligence (Pi) avec pi-0 ou des équipes universitaires spécialisées en sim-to-real, explorent des problèmes analogues sur des environnements bien plus complexes. Ce qui distingue ce travail, c'est la clarté méthodologique et la reproductibilité revendiquée : si l'approche tient à plus grande échelle, la domain randomization couplée au SAC pourrait réduire significativement les coûts et délais d'entraînement de robots autonomes dans des environnements industriels non structurés.

À lire aussi

Vidéo : un robot de la taille d'une main à 8 actionneurs intelligents marche, trotte et saute
1Interesting Engineering 

Vidéo : un robot de la taille d'une main à 8 actionneurs intelligents marche, trotte et saute

Le Q8botOne est un robot quadrupède open-source de la taille d'une paume de main, conçu par Eric Wu et destiné aux hobbyistes, étudiants, chercheurs et développeurs. Contrairement à son prédécesseur Q8bot -- qui nécessitait un assemblage manuel -- le Q8botOne est livré entièrement monté et prêt à l'emploi dès la mise sous tension. Sa mobilité dynamique repose sur huit actionneurs intelligents DYNAMIXEL de la série XL, qui animent des pattes à liaison parallèle légères, fabriquées par impression 3D Multi Jet Fusion (MJF) et équipées de joints à roulements de précision. Ces pattes permettent au robot de marcher, de trotter et de sauter, des capacités habituellement réservées à des plateformes bien plus encombrantes et coûteuses. Le système de contrôle s'articule autour d'un microcontrôleur ESP32-C3-MINI-N4, alimenté par une batterie lithium-ion avec circuit de protection intégré. L'électronique est entièrement centralisée sur un PCB personnalisé, éliminant le câblage distribué caractéristique des projets DIY classiques. Le robot sera disponible prochainement via une campagne Crowd Supply, dont le prix n'a pas encore été communiqué. Ce qui distingue le Q8botOne dans le paysage de la robotique éducative est l'intégration verticale de sa conception : PCB central, actionneurs de série DYNAMIXEL -- habituellement réservés à des plateformes de recherche -- et châssis MJF constituent une combinaison rare à ce format. En supprimant la phase d'assemblage, le projet abaisse significativement le seuil d'entrée pour expérimenter la locomotion quadrupède, un domaine traditionnellement onéreux en temps et en matériel. L'interface UART supporte des coprocesseurs comme un Raspberry Pi avec une alimentation jusqu'à 5 V à 3 A, ouvrant la voie à des applications de vision par ordinateur, de navigation autonome ou d'IA embarquée. Un connecteur Qwiic facilite l'ajout de capteurs compatibles SparkFun et Adafruit sans câblage complexe. Ces choix d'architecture font du Q8botOne un banc d'essai crédible pour la recherche en locomotion et en contrôle, pas uniquement un gadget grand public. Le Q8botOne s'inscrit dans la lignée du Q8bot original, dont il reprend l'approche agile et low-cost tout en franchissant un cap vers la clé-en-main. Le secteur des petits quadrupèdes open-source est animé par des projets comme le Unitree Go1 Nano ou le SpotMicro, mais peu proposent une intégration PCB aussi poussée à ce gabarit. Sur le segment éducatif, le Q8botOne se positionne face aux kits Freenove ou aux dérivés MiniCheetah, avec l'avantage d'actionneurs DYNAMIXEL reconnus pour leur fiabilité dans les labos de recherche. Les fichiers mécaniques sont développés dans Onshape, garantissant l'accessibilité à l'écosystème open-source. La campagne Crowd Supply, dont la date de lancement reste à confirmer, sera le vrai test de la demande du marché pour une plateforme quadrupède aussi compacte et prête à l'emploi.

RecherchePaper
1 source
Phantom : entraîner des robots sans robots, uniquement avec des vidéos humaines
2arXiv cs.RO 

Phantom : entraîner des robots sans robots, uniquement avec des vidéos humaines

Une équipe de chercheurs a publié Phantom (arXiv:2503.00779), un framework d'entraînement de politiques de manipulation robotique n'utilisant aucune donnée robot : uniquement des vidéos de démonstrations humaines. Le pipeline extrait les trajectoires via estimation de pose des mains (hand pose estimation), efface le bras humain par inpainting, puis superpose un rendu 3D du robot cible pour produire des paires observation-action directement exploitables. Déployé en zero-shot sur matériel réel sans fine-tuning, le système atteint jusqu'à 92 % de taux de réussite sur des tâches de manipulation d'objets déformables, de balayage multi-objets et d'insertion de composants. Les politiques supportent l'exécution en boucle fermée (closed-loop) et généralisent à des environnements inédits non vus à l'entraînement. L'enjeu est la scalabilité des données. La téléopération, méthode dominante chez Figure, 1X ou Physical Intelligence, exige du matériel disponible, des opérateurs qualifiés et des sessions d'enregistrement coûteuses. En substituant des vidéos humaines à ces démos, Phantom compresse drastiquement le coût d'acquisition du dataset. Si les taux de réussite annoncés se confirment en dehors des conditions contrôlées du laboratoire, cela représenterait un argument solide contre le "reality gap" classique entre simulation et déploiement industriel. La capacité à généraliser sans fine-tuning, point souvent problématique pour les modèles VLA (Visual Language Action), mérite toutefois une validation sur des environnements plus variés que ceux présentés dans le papier. Le problème des données hors-robot n'est pas nouveau : DexMV, ACT et les travaux autour de GR00T N2 de NVIDIA ont exploré des voies comparables, et Physical Intelligence avec pi-0 a parié sur la diversité massive de données multi-embodiment. Les approches sim-to-real via IsaacLab ou Genesis constituent les concurrents méthodologiques directs, contournant le même obstacle par la simulation plutôt que par la vidéo humaine. Phantom se distingue par sa légèreté : pas de flotte de robots nécessaire pour constituer le dataset initial. Le travail reste à ce stade une preuve de concept académique, sans partenariat ni déploiement industriel annoncé. La prochaine étape attendue serait une validation sur des morphologies robotiques variées et des tâches à précision sub-millimétrique.

RechercheOpinion
1 source
L'électronique cutanée dote robots et prothèses d'un « toucher humain
3Robotics & Automation News 

L'électronique cutanée dote robots et prothèses d'un « toucher humain

Sur le campus ERICA de l'Université Hanyang, en Corée du Sud, une équipe de chercheurs a développé un nouveau type de peau électronique destinée à équiper robots et prothèses d'un sens du toucher proche de celui de l'humain. Le dispositif repose sur une architecture de transistor à double grille, empilée verticalement, conçue pour dépasser les limites des composants tribotroniques classiques, ces capteurs qui convertissent un stimulus mécanique comme un contact en signal électrique. Jusqu'ici, ces dispositifs souffraient d'une sensibilité fixe et se heurtaient à des difficultés d'intégration sur de grandes surfaces à haute densité de capteurs. La nouvelle conception verticale vise précisément à résoudre ces deux contraintes simultanément. Pour l'industrie robotique et les fabricants de prothèses, cette avancée s'attaque à un goulot d'étranglement bien identifié: la capacité à équiper des surfaces étendues, comme une main entière ou un bras robotique, d'un maillage dense de capteurs tactiles fiables et ajustables. Une sensibilité modulable, plutôt que figée, permettrait d'adapter la réponse tactile selon l'usage, préhension délicate d'un objet fragile ou prise plus ferme, un enjeu central pour les intégrateurs qui cherchent à rapprocher la manipulation robotique du niveau de dextérité humain, notamment dans les applications de préhension fine et de retour haptique pour les prothèses. Ce travail s'inscrit dans un effort de recherche plus large sur les technologies tactiles électroniques, un domaine où plusieurs laboratoires explorent des architectures de transistors et de matériaux pour améliorer la densité et la fiabilité des capteurs de peau artificielle. L'annonce reste à ce stade au niveau de la recherche académique, publiée dans une étude, sans indication de partenariat industriel, de calendrier de commercialisation ni de déploiement sur un produit robotique ou prothétique existant.

RecherchePaper
1 source
Robot apprend comme un enfant, puis maîtrise seul le bowling, le pliage et le pressage de jus
4Interesting Engineering 

Robot apprend comme un enfant, puis maîtrise seul le bowling, le pliage et le pressage de jus

Des chercheurs dirigés par la Shanghai Jiao Tong University ont présenté RL-100, un cadre d'entraînement qui combine apprentissage par imitation et apprentissage par renforcement pour permettre à des robots manipulateurs de réaliser des tâches réelles avec une fiabilité proche de 100%. Le système repose sur un pipeline en trois étapes : d'abord l'imitation à partir de démonstrations téléopérées par des experts humains, qui entraîne une politique visuomotrice basée sur un modèle de diffusion et exploite des flux RGB ou des nuages de points 3D ; puis un apprentissage par renforcement hors ligne itératif, où le robot rejoue ses propres tentatives réussies pour affiner sa politique via un objectif unifié de type PPO, sans dégrader les comportements déjà appris ; enfin une phase d'apprentissage en ligne directement sur le robot physique, ciblée sur les cas d'échec rares, qui fait passer le taux de réussite d'environ 90% à un niveau quasi parfait. Les chercheurs ont aussi développé une technique de distillation par modèle de cohérence qui compresse la politique de diffusion multi-étapes en un contrôleur à une seule étape, réduisant la latence d'inférence d'environ 100 à 10 millisecondes. Sur huit tâches de manipulation testées, bowling, pliage de serviettes, versage de liquide, dévissage de bouchons, pliage de boîtes et préparation de jus d'orange en deux étapes, le robot a atteint 100% de réussite après l'entraînement complet, et a fonctionné en continu pendant sept heures dans un centre commercial pour servir du jus frais sans le moindre échec. Ce résultat s'attaque directement à ce que le secteur robotique appelle le "plafond de l'imitation" : un robot qui se contente de copier des démonstrations humaines reste borné par la qualité et l'efficacité de ces démonstrations, sans jamais dépasser la performance de son professeur. En combinant imitation, renforcement hors ligne et un correctif ciblé en ligne, RL-100 illustre une voie concrète pour que les politiques d'apprentissage par diffusion, jugées jusqu'ici trop lentes pour un contrôle robotique à haute fréquence, deviennent utilisables en production. La démonstration en environnement public, sur sept heures sans interruption, est le type de test qui compte pour les intégrateurs et décideurs B2B : elle rapproche l'apprentissage par renforcement appliqué à la robotique d'un déploiement réel plutôt que d'une démonstration en laboratoire soigneusement choisie, un écart que le secteur peine encore à combler pour la plupart des systèmes de type VLA. RL-100 s'inscrit dans une lignée de recherches visant à rendre les politiques de diffusion exploitables en temps réel, un problème également abordé par des approches comme Pi-0 ou GR00T N2 dans l'écosystème de la robotique généraliste. Le cadre revendique une conception agnostique à la tâche, au robot et à la représentation sensorielle, compatible avec des bras simples ou doubles. Les auteurs ne précisent pas de calendrier de commercialisation ni de partenaire industriel identifié ; il s'agit pour l'instant d'un résultat de recherche académique, dont la reproductibilité à plus grande échelle et hors conditions contrôlées reste à démontrer.

RecherchePaper
1 source