Aller au contenu principal
Robots peuvent désormais apprendre des tâches d'usine à haute dextérité par la vidéo, avec un minimum d'entraînement
FR/EU ecosystemeInteresting Engineering 

Robots peuvent désormais apprendre des tâches d'usine à haute dextérité par la vidéo, avec un minimum d'entraînement

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE
Robots peuvent désormais apprendre des tâches d'usine à haute dextérité par la vidéo, avec un minimum d'entraînement
▶ Voir sur YouTube

Mimic Robotics, société suisse de robotique physique, a dévoilé FLUX-mimic, un modèle vidéo-action de nouvelle génération développé avec Black Forest Labs, capable d'enseigner à des robots industriels des tâches de manipulation fine à partir de simples démonstrations vidéo. Le système s'appuie sur FLUX 3, le modèle de génération vidéo de Black Forest Labs, associé à un décodeur d'actions qui traduit les prédictions visuelles en mouvements robotiques exécutables. Selon Mimic Robotics, FLUX-mimic peut être affiné pour certaines tâches avec seulement 30 minutes de démonstrations robotiques, contre 30 heures ou plus pour les pipelines d'apprentissage conventionnels, un écart présenté par l'entreprise elle-même et donc à prendre avec la prudence habituelle réservée aux chiffres communiqués par le fournisseur. La technologie est actuellement déployée chez le constructeur automobile Audi, dans le cadre d'une évaluation portant sur l'automatisation de tâches à haute dextérité impliquant des matériaux flexibles et une manipulation fine.

Cette annonce s'inscrit dans un débat plus large sur la viabilité des modèles vidéo-action (VAM) face aux modèles vision-langage-action (VLA) désormais dominants, à l'image de Pi-0 ou GR00T N2. Contrairement à ces derniers, pré-entraînés sur des paires image-texte statiques et devant apprendre la physique quasi exclusivement via des démonstrations robotiques coûteuses, FLUX-mimic part d'un modèle vidéo déjà entraîné à grande échelle sur la dynamique des objets et des mouvements, ce qui réduirait drastiquement le volume de données spécifiques à collecter. Si la promesse se vérifie en production, elle répond directement à l'un des principaux obstacles à la commercialisation de la robotique industrielle par apprentissage: le coût et la lenteur de la collecte de démonstrations pour chaque nouvelle tâche. Une réduction du cycle de déploiement de plusieurs mois à quelques semaines, telle qu'annoncée, changerait significativement le calcul économique pour les intégrateurs face à des tâches variables et peu standardisées, typiquement délaissées par l'automatisation classique programmée manuellement.

FLUX-mimic prolonge les travaux antérieurs de Mimic Robotics sur les modèles vidéo-action, avec une architecture désormais pensée spécifiquement pour l'IA physique en environnement industriel. Le partenariat avec Audi, dont les usines affichent déjà un fort taux d'automatisation, sert de banc d'essai pour mesurer si ces systèmes d'apprentissage tiennent la route hors laboratoire, un test que beaucoup d'approches VLA ou VAM concurrentes n'ont pas encore passé à cette échelle. Les deux partenaires évoquent des perspectives d'extension à d'autres opérations de fabrication et de logistique, sans toutefois communiquer de calendrier précis ni de métriques de performance en production, ce qui place pour l'instant cette collaboration au stade du pilote d'évaluation plutôt que du déploiement industriel validé.

Impact France/UE

Audi teste FLUX-mimic dans ses usines allemandes pour automatiser des tâches de manipulation fine, un cas concret d'adoption industrielle en Europe qui pourrait influencer d'autres constructeurs automobiles de l'UE si le pilote se confirme.

À lire aussi

Des robots différents peuvent apprendre à effectuer des tâches sans nouveau code
1New Atlas Robotics 

Des robots différents peuvent apprendre à effectuer des tâches sans nouveau code

Des chercheurs de l'EPFL ont développé une méthode permettant à des robots de morphologies différentes d'apprendre des tâches les uns des autres sans réécriture de code. L'approche exploite une représentation abstraite de la tâche, dissociée de la cinématique propre à chaque plateforme, ce qui permet à un robot à bras articulé d'acquérir un comportement démontré par un robot quadrupède ou à base mobile, par exemple. Aucune date de publication ni de chiffres de performance (taux de succès, degrés de liberté, temps d'entraînement) ne sont disponibles dans la communication initiale. L'enjeu industriel est significatif : aujourd'hui, chaque déploiement d'un nouveau robot dans une cellule automatisée implique un cycle complet de programmation ou de fine-tuning, ce qui représente des semaines d'intégration et un coût élevé. Si une telle méthode de transfert inter-embodiment se confirme à l'échelle, elle réduirait drastiquement le temps de mise en production, notamment dans les environnements multi-robots hétérogènes comme les entrepôts ou les lignes d'assemblage flexibles. Cela rejoint les travaux récents sur les politiques cross-embodiment portés par des modèles comme pi-0 (Physical Intelligence) ou RT-X (Google DeepMind), qui cherchent eux aussi à généraliser au-delà d'une seule plateforme. L'EPFL abrite plusieurs laboratoires actifs en apprentissage robotique, dont le Biorobotics Lab et le Computational Robot Design & Fabrication Lab. Cette annonce s'inscrit dans une tendance plus large où la recherche européenne cherche à rivaliser avec les efforts américains et chinois sur l'apprentissage par imitation et le transfert de politiques. L'article source reste un teaser sans accès au papier complet ni aux benchmarks, ce qui rend toute évaluation des performances prématurée.

UEL'EPFL positionne la recherche européenne sur le transfert inter-embodiment face aux initiatives américaines (pi-0, RT-X), mais sans papier ni benchmark publiés, l'impact industriel reste à confirmer.

FR/EU ecosystemePaper
1 source
Gestes robotiques naturels et expressifs via un apprentissage par renforcement itératif avec retours humains et LLMs
2arXiv cs.RO 

Gestes robotiques naturels et expressifs via un apprentissage par renforcement itératif avec retours humains et LLMs

Des chercheurs ont publié en juin 2026 (arXiv:2606.18747) un système permettant au robot humanoïde Pepper de générer des gestes co-verbaux naturels à l'exécution, sans recours à des animations préprogrammées. L'architecture combine ChatGPT pour la génération de code gestuel en langage naturel, couplée à un pipeline d'apprentissage par renforcement à partir de retours humains (RLHF) appliqué de manière itérative. Des utilisateurs évaluent les gestes produits par Pepper lors d'une étude comparative, ces préférences servant de signal de récompense pour affiner le modèle de langage. Résultat annoncé : des mouvements jugés plus expressifs, pertinents et fluides qu'avec le seul pipeline LLM de base. L'enjeu est significatif pour les intégrateurs de robots sociaux. Aujourd'hui, la quasi-totalité des comportements gestuels déployés en production repose sur des bibliothèques d'animations conçues à la main par des experts, ce qui rend les robots rigides face à des contextes conversationnels imprévus. Les approches par apprentissage automatique peinent à capturer la naturalité perçue, un critère subjectif qui se dégrade à mesure que le nombre de degrés de liberté augmente. Ce travail propose une alternative concrète : utiliser un LLM comme générateur de comportements moteurs au runtime, puis le corriger via RLHF pour coller aux préférences réelles des utilisateurs. C'est une transposition directe de la méthode qui a rendu ChatGPT lui-même plus utile, appliquée ici au domaine de la communication non verbale humain-robot. Les résultats restent néanmoins issus d'une étude utilisateur contrôlée, pas d'un déploiement à grande échelle. Pepper est le robot social d'Aldebaran Robotics, société française rachetée par SoftBank en 2012, aujourd'hui commercialisé dans les secteurs retail, accueil et éducation. Après une phase de déception commerciale liée précisément à la rigidité comportementale du robot, plusieurs équipes académiques cherchent à relancer son potentiel via des couches IA génératives. Sur ce terrain, Pepper fait face à une concurrence croissante des agents conversationnels incarnés (avatars AR/VR) et de nouvelles plateformes comme Enchanted Tools (France) avec son robot Miroki, conçu dès l'origine pour une expressivité naturelle. La prochaine étape logique serait un déploiement en contexte réel pour mesurer le gap entre l'évaluation en laboratoire et l'acceptation en environnement ouvert, une question que les auteurs n'adressent pas encore.

UEDes travaux académiques sur Pepper (Aldebaran, origine française rachetée par SoftBank) appliquant l'RLHF à la gestualité co-verbale ouvrent une voie concrète pour réhabiliter cette plateforme en production, dans un contexte où Enchanted Tools (France) cherche à s'imposer sur le segment des robots sociaux expressifs avec Miroki.

FR/EU ecosystemePaper
1 source
Mimic Robotics déploie ses « modèles vision-action de pointe » sur la chaîne de production Audi
3Robotics & Automation News 

Mimic Robotics déploie ses « modèles vision-action de pointe » sur la chaîne de production Audi

Robots industriels apprenant des tâches complexes chez Audi ? Voici le résumé factuel de 200-250 mots, sans invention de chiffres absents du communiqué. --- mimic robotics, entreprise suisse de « physical AI » spécialisée dans les Video-Action Models (VAM) pour l'automatisation industrielle, présente FLUX-mimic, un nouveau modèle développé avec Black Forest Labs, le laboratoire allemand connu pour ses modèles de génération d'image FLUX. Le système est censé permettre à des bras robotiques d'apprendre et d'exécuter des tâches de manipulation complexes directement en environnement d'usine, avec une mise en avant explicite d'un déploiement chez Audi. Le communiqué de mimic reste toutefois vague sur les aspects techniques concrets : aucun chiffre communiqué sur le payload, les degrés de liberté, le temps de cycle ou le nombre de sites équipés, ce qui invite à la prudence tant qu'aucune démonstration indépendante n'est disponible. Si la promesse se confirme, l'enjeu dépasse la simple vitrine technologique : faire fonctionner un modèle vision-langage-action dans une usine automobile, environnement réputé exigeant en précision et en fiabilité, constituerait un signal fort pour les intégrateurs industriels cherchant à dépasser le stade de la démonstration en laboratoire. Cela toucherait directement au débat sur l'écart entre annonces spectaculaires et réalité opérationnelle qui traverse le secteur de la robotique dexterous. mimic robotics développe depuis plusieurs années des modèles de manipulation robotique par apprentissage, et ce partenariat avec Black Forest Labs, davantage connu pour la génération d'images que pour la robotique, marque une diversification notable. FLUX-mimic vient ainsi s'ajouter à une compétition déjà dense sur les modèles d'action généralistes, aux côtés de Pi-0 de Physical Intelligence, GR00T N2 de Nvidia ou Helix de Figure. Le communiqué ne précise pas de calendrier pour un déploiement élargi au-delà d'Audi.

UELe déploiement implique Audi et Black Forest Labs, deux entreprises allemandes, ce qui illustre une adoption concrète de modèles vision-action dans l'industrie automobile européenne, bien qu'aucune métrique vérifiable ne confirme l'ampleur réelle du déploiement.

FR/EU ecosystemeActu
1 source
Vendredi vidéo : un robot humanoïde italien prend vie
4IEEE Spectrum Robotics 

Vendredi vidéo : un robot humanoïde italien prend vie

Le rendez-vous hebdomadaire Video Friday d'IEEE Spectrum met en avant plusieurs annonces robotiques de la semaine. La startup italienne Generative Bionics dévoile GENE.01, un humanoïde développé en seulement six mois, capable de marcher, percevoir son environnement et interagir grâce à une peau multimodale intégrale détectant le toucher, la proximité, la force et la température. De son côté, Generalist présente GEN-1, un modèle fondationnel pour la robotique conçu pour piloter une large variété d'effecteurs terminaux, des mains à cinq doigts aux outils spécialisés, avec l'ambition de transférer un "sens physique universel" vers de nouvelles configurations de préhension. Un laboratoire de l'AIR Lab a par ailleurs validé en vol une aile volante pliable fabriquée en carton ondulé, assemblée en moins de 15 minutes à partir de trois plaques découpées au laser. Flexion, en partenariat avec Niantic Spatial et NVIDIA, a développé un pipeline permettant de scanner un site de déploiement réel avec du matériel grand public, de le reconstruire en Gaussian splatting photoréaliste, puis d'entraîner des politiques par apprentissage par renforcement massivement parallélisé, transférées ensuite sans réentraînement (zero-shot) sur le robot physique. LimX Dynamics, PNDbotics et EngineAI ont également publié des démonstrations de leurs plateformes humanoïdes, tandis que Wing a communiqué sur son service de livraison par drone pour le South West London Pathology, opérationnel depuis février 2026, acheminant des échantillons médicaux urgents pour le NHS jusqu'à 85 % plus vite que le transport routier. Cette accumulation d'annonces illustre une dynamique importante pour le secteur : la course aux humanoïdes ne se limite plus aux acteurs américains et chinois établis, avec l'émergence rapide d'équipes comme Generative Bionics capables de livrer une plateforme fonctionnelle en six mois. Le pari de Generalist sur un modèle vision-langage-action (VLA) générique, capable de généraliser à travers différents effecteurs, s'inscrit dans le débat central du secteur sur la capacité réelle des modèles fondationnels à passer à l'échelle au-delà des démonstrations contrôlées. La combinaison Gaussian splatting et RL massivement parallèle proposée par Flexion répond directement au problème du sim-to-real, en réduisant le coût de création d'environnements d'entraînement réalistes à partir de sites réels. Ces avancées restent toutefois à nuancer : plusieurs vidéos de la semaine, notamment celle d'un robot manipulant des cônes de glace pour la société Sharpa, sont explicitement présentées comme des productions conceptuelles ne représentant pas le fonctionnement réel en magasin, un rappel que la frontière entre démonstration marketing et déploiement opérationnel reste souvent floue dans la communication du secteur. Ces développements s'inscrivent dans la trajectoire plus large de maturation de la robotique physique amorcée ces dernières années, portée par les progrès des modèles de fondation robotiques (à l'image de Pi-0 ou GR00T) et par la baisse du coût des capteurs et systèmes de perception. Le déploiement du service de drones de Wing pour le NHS marque une étape concrète de passage à l'usage réel dans le secteur médical, au-delà des humanoïdes. Les prochaines échéances du calendrier robotique, dont le Summer School on Multi-Robot Systems fin juillet à Prague, la conférence Actuate en août à San Francisco et IROS 2026 fin septembre à Pittsburgh, devraient permettre de mesurer si ces annonces se traduisent par des déploiements pilotes documentés ou restent au stade de démonstrations vidéo.

UEL'émergence de la startup italienne Generative Bionics, capable de livrer un humanoïde fonctionnel en six mois, illustre une dynamique d'innovation robotique naissante en Europe face aux acteurs americains et chinois etablis.

FR/EU ecosystemeActu
1 source