Aller au contenu principal

Actualités robotique — page 26

4 571 articles au fil, du plus récent au plus ancien.

Modèle vision-langage-action débiaisé causalement pour modèles du monde conditionnés par l'action incarnée
1251arXiv cs.RO 

Modèle vision-langage-action débiaisé causalement pour modèles du monde conditionnés par l'action incarnée

Des chercheurs publient sur arXiv (arXiv:2607.09185v1) un nouveau framework baptisé CD-LAM, destiné à améliorer les modèles du monde conditionnés par l'action (ACWM), ces systèmes qui simulent les observations futures d'un robot en fonction des actions qu'il pourrait exécuter. Ces modèles reposent sur des données massives étiquetées avec les actions correspondantes, coûteuses à collecter en conditions réelles. Pour contourner ce goulot d'étranglement, les modèles d'action latente (LAM) infèrent des actions directement depuis des vidéos non étiquetées, mais souffrent d'un biais connu : entraînés uniquement sur des objectifs de reconstruction, ils mélangent la dynamique liée à l'action avec des éléments visuels non pertinents comme l'arrière-plan ou des objets non manipulés. CD-LAM introduit trois objectifs de fine-tuning complémentaires, une reconstruction centrée sur le corps du robot, un apprentissage contrastif centré sur l'action, et une calibration de l'espace latent, pour produire des représentations plus fidèles et non dégénérées. Testé sur des backbones ACWM de 2 et 14 milliards de paramètres, CD-LAM améliore la contrôlabilité des actions latentes, le suivi des commandes en aval, la fidélité visuelle, et ne nécessite que 6 000 étapes de fine-tuning, soit plus de 12 fois moins de mises à jour d'adaptation que la méthode de référence. L'enjeu dépasse la seule performance technique : réduire d'un facteur 12 le coût d'adaptation d'un modèle du monde à un nouveau robot ou une nouvelle tâche s'attaque directement au principal frein à l'échelle des politiques robotiques actuelles, la rareté des données actions-étiquetées réelles. Ce type de travail nourrit la course aux modèles VLA (vision-language-action) comme Pi-0, GR00T N2 ou Helix, où la capacité à généraliser à partir de peu de démonstrations conditionne la viabilité commerciale des humanoïdes. Il faut toutefois distinguer clairement ce résultat, une contribution de recherche à l'échelle du benchmark, d'un déploiement en production. CD-LAM s'inscrit dans la lignée des travaux récents sur les modèles d'action latente, une direction de recherche née du constat que l'étiquetage manuel des actions robotiques ne passera jamais à l'échelle des humanoïdes commerciaux. L'abstract ne cite ni laboratoire ni entreprise précise, signe d'une publication académique classique plutôt que d'une annonce produit. Les auteurs évoquent des pistes de suite via l'adaptation à davantage de plateformes robotiques et de backbones plus larges, sans calendrier de déploiement communiqué.

RecherchePaper
1 source
Acte, ressent, agit : l'apprentissage de la perception active à partir de données égocentriques humaines à grande échelle
1252arXiv cs.RO 

Acte, ressent, agit : l'apprentissage de la perception active à partir de données égocentriques humaines à grande échelle

Un article de robotique/IA en français, prêt à publier : CoMe-VLA (Cognitive and Memory-aware Vision-Language-Action) est un nouveau framework de recherche présenté dans un article arXiv (version révisée, réf. 2602.04600v2) qui s'attaque à la perception active en robotique manipulatrice, c'est-à-dire la capacité d'un robot à chercher activement de l'information plutôt que d'agir sur des données figées. Le système combine une tête cognitive auxiliaire chargée de gérer les transitions entre sous-tâches de façon autonome, et une mémoire à double piste qui fusionne les signaux proprioceptifs (position, effort) et visuels dans le temps pour maintenir une conscience cohérente de soi et de l'environnement. L'entraînement se déroule en trois étapes progressives et s'appuie sur de larges volumes de données égocentriques humaines (vidéos captées à la première personne), alignées avec l'espace d'action du robot pour transférer la coordination main-œil humaine vers la machine. Les tests ont été menés sur un humanoïde à roues, sur des tâches longues et variées impliquant plusieurs scénarios de perception active. L'enjeu dépasse la démonstration technique isolée. La plupart des modèles VLA actuellement médiatisés, qu'il s'agisse de Pi-0, GR00T N2 ou Helix, fonctionnent principalement en supposant une observabilité quasi complète de la scène, ce qui limite leur robustesse dès que l'environnement devient incertain ou partiellement caché, un cas fréquent en usine ou en entrepôt réel. En formalisant la perception active comme une boucle perception-action dépendante de l'historique, cet article propose une catégorisation structurée utile à toute l'industrie pour comparer les approches, et illustre une piste concrète pour réduire l'écart entre démonstrations en laboratoire et déploiement en environnement non contrôlé, un point sensible que les intégrateurs surveillent de près. Ce travail s'inscrit dans une tendance de fond de la recherche en robotique généraliste : exploiter les vidéos humaines à grande échelle, bien plus abondantes que les données de téléopération robotique, pour apprendre des priors d'exploration et de manipulation. Il ne s'agit ici que d'un article de recherche à un stade préliminaire, sans partenaire industriel ni déploiement annoncé, à distinguer clairement des annonces produits de type Figure ou Tesla Optimus. Les prochaines étapes attendues concernent l'extension à des plateformes bipèdes et la validation sur des tâches manipulatrices plus complexes en conditions réelles.

RechercheOpinion
1 source
CLAP : adaptation directe de VLM à VLA par ancrage langage-action
1253arXiv cs.RO 

CLAP : adaptation directe de VLM à VLA par ancrage langage-action

Des chercheurs publient sur arXiv (2607.08974v1) un nouveau modèle nommé CLAP, pour Causal Language-Action Prediction, une méthode qui convertit directement un modèle vision-langage (VLM) pré-entraîné en modèle vision-langage-action (VLA) sans modifier son architecture. Le problème identifié est celui du décalage de distribution en sortie : quand un VLA prédit des actions robotiques sous forme de simples séquences de tokens numériques, la génération s'éloigne de la distribution de langage naturel sur laquelle le VLM a été entraîné, ce qui dégrade les capacités sémantiques qu'on cherchait justement à préserver. CLAP résout ce problème en faisant précéder chaque séquence d'action numérique d'une description en langage naturel du geste à accomplir, conditionnant ainsi la prédiction précise des tokens d'action sur un plan verbalisé. Avec un simple fine-tuning d'une seule époque, la version 2 milliards de paramètres atteint 90,8% sur le benchmark LIBERO, soit 14,9 points de plus que VLA-0, et améliore la robustesse sur LIBERO-PRO face aux perturbations de langage, d'objets et de position spatiale. Les auteurs annoncent la publication en poids ouverts d'une famille de modèles à 0,8, 2 et 4 milliards de paramètres, issus de la même lignée de VLM. L'intérêt de ce travail est avant tout méthodologique plutôt qu'industriel : il permet d'isoler ce que le VLM pré-entraîné apporte réellement au contrôle robotique, alors que les post-entraînements massifs sur données robot et les modifications architecturales tendent habituellement à brouiller cette contribution. Pour les laboratoires travaillant sur des modèles comme Pi-0 de Physical Intelligence, GR00T N2 de Nvidia ou Helix de Figure, cette approche offre une voie plus transparente pour comprendre comment les capacités sémantiques d'un VLM se transfèrent à l'échelle vers le contrôle d'action, sans repartir d'une architecture bricolée sur mesure. CLAP s'inscrit dans un courant de recherche visant à limiter les changements architecturaux entre VLM et VLA, contrairement aux approches type OpenVLA qui modifient plus lourdement le squelette du modèle. Il s'agit ici d'une publication de recherche en preprint, non d'un produit commercial ni d'un déploiement robotique réel : aucun essai sur robot physique n'est mentionné dans l'abstract, seule une évaluation en simulation via LIBERO. La suite annoncée est la mise à disposition en open source des trois tailles de modèles, permettant à la communauté de reproduire et d'approfondir cette analyse du transfert de capacités du VLM vers le VLA.

RechercheActu
1 source
Robot Trajectron V3 : un cadre de contrôle partagé probabiliste pour la manipulation SE(3)
1254arXiv cs.RO 

Robot Trajectron V3 : un cadre de contrôle partagé probabiliste pour la manipulation SE(3)

Un nouveau cadre de contrôle partagé pour la téléopération de bras robotiques à haut degré de liberté, baptisé Robot Trajectron V3 (RT-V3), a été publié sur arXiv (référence 2607.09315). Il cible les tâches de préhension en SE(3), c'est-à-dire combinant translation et rotation dans l'espace. RT-V3 formule l'assistance comme une inférence bayésienne : un modèle transformer génératif apprend un a priori sur l'intention de l'utilisateur à partir de nuages de points, de poses de préhension candidates et de la dynamique passée du robot, puis le combine en temps réel aux commandes de l'opérateur pour estimer la trajectoire future la plus probable. Une représentation factorisée translation-rotation améliore l'apprentissage dans ces espaces d'action de haute dimension. Des études utilisateurs réelles montrent un taux de réussite et une efficacité supérieurs aux méthodes de référence, avec une charge de travail physique et mentale réduite pour l'opérateur. L'enjeu est concret pour l'industrie robotique : la téléopération de bras à haute dimensionnalité reste lourde cognitivement et source d'erreurs, surtout avec des interfaces à faible bande passante comme les joysticks ou les interfaces cerveau-machine. Pour les intégrateurs travaillant en logistique, en désamorçage ou en intervention en environnement dangereux, un contrôle partagé qui anticipe l'intention humaine peut réduire la fatigue de l'opérateur sans exiger une autonomie complète, encore risquée en scène non structurée. Le travail illustre aussi une tendance de fond du secteur : l'usage de modèles génératifs conditionnés par la vision, proches des architectures VLA popularisées par des systèmes comme Pi-0 ou GR00T N2, pour de l'assistance plutôt que de l'autonomie totale. Les résultats restent toutefois issus d'études en laboratoire, dont le passage à l'échelle industrielle reste à démontrer. Le nom "V3" signale une itération sur des versions antérieures de Robot Trajectron, dans un champ de recherche sur le contrôle partagé homme-robot déjà disputé entre approches par diffusion, par apprentissage par renforcement et par inférence bayésienne. Aucun partenaire industriel ni déploiement commercial n'est mentionné : il s'agit à ce stade d'une contribution académique, sans licence ni intégration produit annoncée. La suite logique pour ce type de travaux est généralement une extension à des tâches multi-étapes ou à des flottes de robots, ainsi qu'une comparaison plus poussée face aux politiques VLA end-to-end qui gagnent du terrain dans l'industrie humanoïde.

RecherchePaper
1 source
Modèles vision-langage-action de manipulateurs aériens modulaires, adaptés à la tâche sous contraintes de flux d'air
1255arXiv cs.RO 

Modèles vision-langage-action de manipulateurs aériens modulaires, adaptés à la tâche sous contraintes de flux d'air

Le paragraphe qui suit décode un preprint arXiv (2607.09548v1, catégorie "new") plutôt qu'une annonce produit : posture éditoriale adaptée en conséquence, sans effets d'annonce à dégonfler puisqu'il n'y en a pas. Une équipe de recherche propose un cadre de conception par optimisation pour des manipulateurs aériens modulaires, c'est à dire des drones multirotors équipés d'un bras robotique capable d'interagir physiquement avec leur environnement. Le problème central : le flux d'air généré par les rotors perturbe les tâches impliquant des cibles ou des environnements sensibles au souffle. Les auteurs introduisent une catégorisation inédite de la tolérance des cibles à l'exposition au flux d'air, traduite en contraintes géométriques exploitables dans l'optimisation. Pour modéliser ce flux sans exploser le coût de calcul, ils développent une enveloppe compacte en forme de cône-sphère qui approxime la structure de propagation du souffle d'un quadrirotor. Sur cette base, le système de reconfiguration optimise à la fois la configuration de la plateforme et le placement de l'effecteur terminal, en respectant simultanément les exigences de force et couple (wrench) de la tâche, l'exposition de la cible au flux d'air et les interférences aérodynamiques entre les propres rotors de la plateforme. Contrairement aux approches précédentes qui fixaient d'emblée la position de l'effecteur, ce placement devient ici une variable d'optimisation à part entière. Des expériences de passage à l'échelle et des études d'ablation viennent valider l'approche. L'intérêt pour le secteur tient à un angle mort réel de la manipulation aérienne : la plupart des cadres de conception optimisent la faisabilité mécanique des tâches sans jamais modéliser la perturbation aérodynamique que le drone lui-même inflige à sa cible, un problème critique pour l'inspection de capteurs fragiles, l'agriculture de précision près de cultures sensibles, ou toute intervention à proximité d'équipements ou de personnes. Un cadre qui reconfigure automatiquement bras et plateforme selon la tâche, sans réglage manuel au cas par cas, pourrait accélérer le déploiement de drones manipulateurs modulaires dans ces contextes. Le texte reste toutefois un apport computationnel : la validation s'appuie sur des expériences de simulation et des ablations, sans mention de vols réels ni de plateforme physique testée, ce qui invite à la prudence sur la transférabilité pratique. Le champ de la manipulation aérienne modulaire, porté historiquement par des laboratoires universitaires en robotique aérienne, continue ainsi d'explorer la reconfigurabilité matérielle comme réponse à la diversité des tâches, avec l'intégration du flux d'air comme contrainte de conception encore peu traitée dans la littérature.

RecherchePaper
1 source
Robot quadrupède grand public : un docteur de CUHK, ex-ingénieur DJI, lève plusieurs dizaines de millions en amorçage, mené par Zheng Xuan
125636Kr 

Robot quadrupède grand public : un docteur de CUHK, ex-ingénieur DJI, lève plusieurs dizaines de millions en amorçage, mené par Zheng Xuan

La société shenzhenoise Lumisition Robotics (光之跃迁科技) a bouclé un tour d'amorçage de près de 50 millions de yuans (environ 6,5 millions d'euros), mené par Zhengxuan Investment, avec la participation de Guangdian Capital, Lihe Capital, Songhe Capital et Hengxin Future. Fondée en février 2026, l'entreprise développe des robots quadrupèdes grand public conçus comme des « châssis mobiles tout-terrain », destinés aux foyers américains et européens en maison individuelle, aux amateurs de sports outdoor et aux seniors. Le CEO Le Linzhu, docteur et post-doctorant en robotique à l'Université chinoise de Hong Kong (CUHK) et cofondateur du LRL Lab, a occupé un poste clé en R&D chez DJI avant de cofonder une précédente société de quadrupèdes B2B, Guangnian Innovation Technology. Le CTO, également diplômé de robotique à la CUHK et passé par le collège d'honneur Zhu Kezhen de l'Université du Zhejiang, travaille sur l'apprentissage par renforcement et le contrôle moteur ; le VP hardware, formé à l'Université des sciences et technologies de Huazhong sous la direction du professeur Gao Liang et ancien ingénieur chez Roborock, a coécrit cinq articles IEEE/ASME TMECH, IROS et ICRA et détient sept brevets. L'architecture logicielle repose sur quatre couches : perception, motricité (fondée sur plusieurs années de recherche en apprentissage par renforcement pour franchir des terrains complexes), intention (des agents capables d'arbitrer entre vitesse et sécurité) et rôle, cette dernière permettant de reconfigurer le robot en outil de transport, assistant de camping ou fauteuil roulant motorisé via des modules amovibles. Côté coûts, l'équipe a réduit un module articulaire de 18 à 11 pièces grâce à une optimisation multidisciplinaire, et combine caméras bon marché et lidar avec de la distillation de modèles pour limiter les besoins en calcul. Un prototype existe déjà : un test de randonnée en direct de trois jours est prévu en octobre 2026, un lancement officiel au CES 2027, puis une production de série entre avril et mai 2027. Le positionnement tranche avec l'essentiel du marché des quadrupèdes grand public, aujourd'hui dominé par des produits à vocation ludique ou de compagnie, type Unitree Go2. Lumisition vise au contraire un usage utilitaire assumé : remplacement de l'effort physique pour le « dernier kilomètre » entre garage et domicile, aide à la mobilité pour une population vieillissante confrontée à la hausse du coût des soins et à la pénurie de main-d'œuvre. C'est un pari sur un segment encore vide entre les robots-compagnons et les plateformes logistiques B2B, et il illustre la stratégie désormais classique des startups chinoises de robotique : viser les marges permises par la chaîne d'approvisionnement domestique pour proposer un tarif nettement inférieur aux quadrupèdes occidentaux. Reste que le calendrier annoncé, une entreprise vieille de cinq mois, un prototype tout juste sorti des labos, un lancement CES en janvier 2027 et une production de série trois mois plus tard, est particulièrement serré et mérite d'être suivi avec prudence, comme souvent pour les feuilles de route publiées lors d'un tour d'amorçage. Le projet s'appuie directement sur le vivier du LRL Lab de la CUHK, pépinière reconnue de talents en robotique à Hong Kong, et sur l'expérience préalable de son CEO chez DJI puis chez Guangnian Innovation Technology, acteur B2B du quadrupède. Sur le marché grand public, Lumisition devra se mesurer à Unitree, dont le Go2 a déjà largement diffusé l'image du robot-chien accessible, ainsi qu'à des acteurs professionnels comme Deep Robotics ; à plus long terme, l'entreprise revendique une ambition allant au-delà du transport d'objets, avec une version capable à terme de transporter une personne, dans la lignée des concepts de fauteuil roulant tout-terrain motorisé. Le principal investisseur, Zhengxuan Investment, justifie son entrée par la bascule de l'intelligence incarnée du laboratoire vers le déploiement à grande échelle, misant sur la combinaison logiciel-matériel de l'équipe et sur son modèle de navigation de bout en bout. Les prochaines étapes concrètes restent le test public d'octobre 2026 et la présentation produit prévue au CES de janvier 2027.

Chine/AsieOpinion
1 source
Om AI de Zhao Tiancheng : des années de persévérance, pari sur l'avenir « en flux continu » natif de l'IA physique
125736Kr 

Om AI de Zhao Tiancheng : des années de persévérance, pari sur l'avenir « en flux continu » natif de l'IA physique

Om AI, jeune pousse chinoise fondée par Zhao Tiancheng, docteur de l'institut de technologies du langage de Carnegie Mellon, vient de dévoiler VLX, une famille de modèles multimodaux présentée comme la première au monde conçue nativement pour fonctionner en flux continu sur des terminaux physiques. L'architecture repose sur trois modules imbriqués, Flow pour la perception, Seek pour la localisation, Go pour la décision et l'action, formant une boucle complète perception, localisation, action directement embarquée, sans dépendre du cloud. Contrairement à l'approche dominante qui découpe la vidéo en images fixes traitées une par une, VLX ingère le flux vidéo en continu, à la manière d'une eau qui coule, et raisonne en temps réel sans attendre de requête. Le déclic remonte à 2023, quand l'équipe a constaté qu'un modèle multimodal n'ayant jamais vu la moindre image de vidéosurveillance surpassait des modèles spécialisés entraînés pendant des années sur ce type de données, preuve selon Zhao Tiancheng que l'entraînement conjoint vision-langage generalise mieux dans le monde physique ouvert que les modèles dédiés. Om AI revendique aujourd'hui des revenus de l'ordre de la centaine de millions de yuans et un déploiement effectif sur des robots, drones, objets connectés, caméras de sécurité et PC IA, avec des données réelles remontant en continu depuis le terrain pour réentraîner les modèles. Cette annonce arrive alors que le secteur de l'IA physique traverse une phase de forte incertitude méthodologique, entre modèles vision-langage-action, génération vidéo, simulation 3D et approches par représentation type JEPA, sans consensus sur la voie qui mènera à une production industrielle. Le pari d'Om AI sur l'intelligence embarquée plutôt que centralisée dans le cloud répond à une contrainte concrète de sécurité et de latence: un robot qui se fige ou chute a des conséquences bien plus graves qu'un bug logiciel classique, un argument que la société met en avant pour justifier une intelligence distribuée sur chaque terminal plutôt qu'un cerveau unique. Le financement mondial de l'IA physique a dépassé 6,4 milliards de dollars sur le seul premier trimestre 2026, signe d'un secteur en quête de preuves de déploiement réel plutôt que de démonstrations. Le positionnement de Zhao Tiancheng s'est construit sur cinq années à contre-courant: alors que l'industrie chinoise se ruait sur les grands modèles de langage générateurs de texte après 2023, il a maintenu le cap sur la fusion vision-langage, misant sur son expérience d'un projet multimodal à un milliard de dollars mené chez Yahoo pendant son doctorat. Plusieurs membres de l'équipe sont partis durant les vagues successives d'engouement pour d'autres approches, avant que le virage du secteur vers l'IA physique en 2026 ne valide, selon lui, ce choix initial resté longtemps minoritaire face aux modèles de langage et, plus récemment, aux modèles du monde.

Chine/AsieActu
1 source
L'entreprise Ant Group robotique Lingbo adopte une nouvelle approche pour construire les cerveaux des robots
1258Pandaily 

L'entreprise Ant Group robotique Lingbo adopte une nouvelle approche pour construire les cerveaux des robots

Ant Group, la maison mère d'Alipay, développe via sa filiale Lingbo une approche inhabituelle pour concevoir des cerveaux de robots, en s'appuyant sur l'immense infrastructure de données et d'intelligence artificielle issue de son écosystème de paiement. Plutôt que de partir du matériel comme la plupart des startups d'IA incarnée, Lingbo privilégie d'abord la couche cognitive. L'entreprise mobilise l'expertise d'Ant Group en traitement transactionnel à haute fréquence, en prise de décision en temps réel dans l'incertitude et en inférence distribuée à grande échelle, des compétences accumulées sur plusieurs années à traiter des milliards de transactions quotidiennes via Alipay (détection de fraude, évaluation de risque, recommandation personnalisée). Lingbo entend transposer cette infrastructure vers la robotique pour bâtir un cerveau robotique capable de gérer la complexité et l'incertitude du monde physique avec la même fiabilité que le traitement financier. L'unité bénéficie d'une autonomie importante au sein d'Ant Group et attire des talents issus à la fois de la recherche en IA et de l'industrie robotique. Aucun produit concret ni calendrier commercial n'a été rendu public à ce stade. Cette stratégie illustre un mouvement plus large : des acteurs de la tech et de la finance entrent dans la course à l'IA incarnée en misant sur leurs atouts logiciels et data plutôt que sur la fabrication de matériel. Pour Lingbo, la partie la plus valorisable de la chaîne robotique ne serait pas la mécanique mais la couche d'intelligence, un pari qui, s'il se confirme, redistribuerait les cartes face aux spécialistes du hardware comme les fabricants d'humanoïdes. Pour les intégrateurs et décideurs industriels, ce positionnement pose une question stratégique : la donnée comportementale et transactionnelle à l'échelle d'Alipay, plusieurs centaines de millions d'utilisateurs, peut-elle vraiment se transférer à la compréhension d'un environnement physique et à la décision robotique ? Rien dans les éléments communiqués ne le démontre encore, et l'annonce reste à ce stade programmatique plutôt que prouvée par un produit déployé. Elle mérite néanmoins d'être suivie car elle traduit un changement de doctrine : dans un paysage chinois où les plateformes matérielles se banalisent, l'avantage compétitif se déplacerait vers le logiciel, la donnée et l'infrastructure de déploiement. Ant Group a construit ses capacités d'IA sur plusieurs années, d'abord pour la détection de fraude et la gestion des risques sur Alipay, avant d'intégrer des assistants IA à l'échelle de son écosystème, utilisés par des centaines de millions de personnes. Lingbo s'inscrit dans le prolongement naturel de cette expansion technologique vers le monde physique, dans un contexte où la Chine voit fleurir de multiples acteurs robotiques, qu'il s'agisse de fabricants d'humanoïdes ou de laboratoires développant des modèles généralistes de type VLA (vision-language-action), comparables aux Pi-0 ou GR00T N2 développés aux États-Unis. Contrairement à des concurrents qui présentent déjà des démonstrateurs matériels, Lingbo n'a pour l'instant communiqué ni prototype ni partenariat industriel identifié, ce qui place la démarche au stade de la déclaration d'intention stratégique. Les prochaines étapes à surveiller seront la première présentation publique d'un système intégré, d'éventuels partenariats avec des fabricants de plateformes robotiques, et la manière dont Ant Group articulera cette activité avec ses autres investissements en IA générative.

Chine/AsieOpinion
1 source
PHANES AI intègre le toucher aux modèles fondation de robots : TouchWorld, un modèle tactile pour la manipulation dextérique
1259Pandaily 

PHANES AI intègre le toucher aux modèles fondation de robots : TouchWorld, un modèle tactile pour la manipulation dextérique

PHANES AI, start-up fondée par Yang Shuo, professeur à l'Institut de technologie de Harbin (campus de Shenzhen), a publié un nouveau modèle de fondation tactile baptisé TouchWorld, conçu pour la manipulation dextre en robotique. L'objectif est de combler une faille des modèles vision-langage-action (VLA) actuels: ceux-ci peuvent voir qu'un doigt robotique touche un bouton, mais ne peuvent pas savoir s'il a réellement été enfoncé. TouchWorld attribue au toucher un double rôle. En mode prédictif, avant d'exécuter une action, le modèle anticipe non seulement l'image visuelle attendue en fin de sous-tâche, mais aussi une carte tactile précisant quel doigt devrait ressentir une pression, à quel endroit et avec quelle intensité, une référence physique que la vision seule ne peut fournir. En mode réactif, une fois le contact établi, le modèle lit en continu les signaux tactiles et l'état des articulations pour appliquer des micro-corrections de position, de force de préhension et d'angle du poignet, sans nécessiter une replanification par la politique de haut niveau. Sur six tâches réelles (arrosage de plantes, nettoyage de table, insertion de prise, insertion de tasse, récurage de poêle, prise de mouchoir), TouchWorld atteint 65,0% de réussite en conditions normales et 57,2% en présence de perturbations comme le déplacement de la cible ou une interférence de préhension, soit 15,7 et 16,0 points de plus que la meilleure référence testée. Chaque tâche a été entraînée sur 200 trajectoires de téléopération et évaluée sur 100 essais robotiques réels. Cette approche répond à un problème concret pour l'industrie: les modèles VLA actuels échouent souvent en silence lorsqu'un contact physique ne se passe pas comme prévu, un angle mort critique pour des applications comme l'assemblage de précision ou la manipulation d'objets fragiles. En traitant le signal tactile comme un flux séparé plutôt que comme une modalité fondue dans le pipeline visuel, PHANES AI défend l'idée que la densité d'information et la vitesse de traitement du toucher sont trop différentes de celles de la vision pour partager une même architecture sans que le signal tactile ne soit noyé. Si les résultats se confirment à plus grande échelle, ce découplage pourrait devenir un standard pour les robots humanoïdes ou les bras industriels appelés à manipuler des objets déformables ou mal positionnés, un domaine où la démonstration en laboratoire peine souvent à se traduire en fiabilité réelle. Yang Shuo, né en 1998, est déjà professeur titulaire et directeur de thèse à HIT Shenzhen, l'un des plus jeunes professeurs titulaires de Chine. Lauréat de la bourse doctorale Google (un des neuf récipiendaires mondiaux) et finaliste du prix du meilleur article à ICLR, il est rentré en Chine à 26 ans pour fonder PHANES AI, qui réunit désormais une équipe couvrant les données, la modélisation, le contrôle robotique et le matériel. L'entreprise s'inscrit dans une compétition mondiale sur les modèles de fondation pour la manipulation dextre, aux côtés d'acteurs comme les équipes derrière Pi-0 ou GR00T N2, avec pour différenciation affichée le traitement natif du signal tactile plutôt qu'un simple ajout de capteurs.

IA physiqueActu
1 source
BAAI et Alibaba, tous les deux jours un nouveau modèle d'IA incarnée voit le jour
1260Pandaily 

BAAI et Alibaba, tous les deux jours un nouveau modèle d'IA incarnée voit le jour

Treize nouveaux modèles fondation et modèles du monde pour la robotique embarquée ont été annoncés en juin 2026, soit environ un tous les 48 heures. Lors de la Conférence Zhiyuan 2026, le BAAI (Beijing Academy of Artificial Intelligence) a présenté deux avancées : Wujie Physis-v0.1, qui prédit l'état physique suivant en compressant vidéo, données RGB-D, nuages de points 3D et retour tactile dans un espace latent unifié, et Wujie RoboBrain Orca, un "cerveau" robotique combinant représentation unifiée, raisonnement causal et décodage multimodal. Le 16 juin, Alibaba a dévoilé la suite Qwen-Robot, composée de trois modèles complémentaires : Qwen-RobotNav pour l'allocation d'attention visuelle en navigation mobile, Qwen-RobotManip qui standardise l'espace état-action pour la manipulation, et Qwen-RobotWorld, doté d'une interface en langage naturel pour prédire la dynamique du monde. CasiaHand a lancé Brain-Si 0.5, présenté comme le premier modèle de manipulation dextre humanoïde, avec une architecture à trois niveaux allant de la planification VLA jusqu'à des modèles physiquement interprétables. GalaxyBot a de son côté publié AstraBrain-WBC 0.5, un modèle de contrôle corps entier entraîné sur environ 2 milliards d'images issues de mouvements humains, pour 80 millions de paramètres. RoboScience, Current Robotics et BoundlessPower ont complété la liste avec respectivement l'architecture Visics, le modèle Curl-0 et le modèle du monde MWA. Cette accélération marque un basculement net dans l'industrie de la robotique embarquée : la compétition ne se joue plus sur les capacités matérielles des robots, mais sur l'intelligence logicielle qui les pilote. Signe le plus révélateur, la posture d'Alibaba tranche avec l'approche dominante du "plus de données, plus de robots" : le groupe affirme que l'hétérogénéité du monde physique ne peut pas être résolue par le seul passage à l'échelle et nécessite un alignement au niveau du modèle lui-même. Pour les intégrateurs et décideurs industriels, le signal est important : les équipes ne cherchent plus seulement à démontrer ce que les robots savent faire, mais à expliquer pourquoi ils échouent encore sur certaines tâches, chacune identifiant un goulot d'étranglement différent, retour tactile, coordination corps entier, transfert simulation-réel ou planification à long horizon. Ce foisonnement s'inscrit dans la course engagée depuis 2024-2025 entre laboratoires chinois et occidentaux (Figure, Physical Intelligence avec Pi-0, NVIDIA avec GR00T) autour des modèles vision-langage-action. La France et l'Europe restent absentes de cette vague spécifique de publications, la dynamique se concentrant pour l'instant sur les acteurs chinois (BAAI, Alibaba, CasiaHand, GalaxyBot) et américains. Les prochaines étapes attendues concernent la validation de ces architectures sur des déploiements réels au-delà des démonstrations en laboratoire, un point sur lequel la prudence reste de mise tant les métriques annoncées, notamment le nombre de paramètres ou de frames d'entraînement, restent difficiles à comparer d'un laboratoire à l'autre sans benchmarks communs.

Chine/AsieOpinion
1 source
Dexmal veut booster la productivité de l'IA incarnée avec le modèle DM0.5, DexOS et une stratégie MaaS en trois étapes
1261Pandaily 

Dexmal veut booster la productivité de l'IA incarnée avec le modèle DM0.5, DexOS et une stratégie MaaS en trois étapes

Dexmal, entreprise chinoise spécialisée en IA incarnée, a dévoilé une gamme complète de produits robotiques articulée autour du modèle fondation DM0.5, du robot universel Apex et de trois plateformes de support : le système d'exploitation DexOS, la plateforme de services MaaS et le framework d'apprentissage par renforcement DFOL 2.0. La stratégie suit un modèle en trois étages : d'abord un modèle fondation généraliste, puis des outils pour développeurs (post-entraînement, MaaS, OS), enfin des solutions sectorielles complètes. DM0.5 compte 4 milliards de paramètres entraînés sur 150 000 heures de données multi-sources, soit quatre fois plus de données et deux fois plus de paramètres que DM0, son prédécesseur. Il affiche une latence d'inférence de 50 ms, une efficacité d'inférence améliorée de 25 %, et un taux de réussite de 42 % sur le benchmark RoboChallenge Table30 V2, où il se classe premier avec un score total de 60,1. Sur l'évaluation LIBERO, il atteint 99,1 % de performance globale. Par rapport à DM0, la réussite en navigation zero-shot progresse de 31 %, en few-shot de 45 %, et après fine-tuning de 20 %, pour un coût de fine-tuning réduit de 60 %, permettant un déploiement de niveau expert sur une seule carte RTX 4090 grand public en 18 heures. Le robot Apex propose des effecteurs terminaux interchangeables en moins de 60 secondes, une perception à 360 degrés via double LiDAR, une charge utile de 3 kg par bras, une précision millimétrique et un remplacement de batterie à chaud en 30 secondes, avec un MTBF ciblé au-delà de 1 000 heures. Cette annonce illustre la tentative de Dexmal de combler l'écart, souvent négligé par les démonstrations spectaculaires, entre la capacité d'un modèle et son déploiement industriel réel. DexOS, présenté comme le premier système d'exploitation générique pour l'IA incarnée, découple les modèles du matériel afin que les intégrateurs puissent piloter des robots de marques différentes avec quelques lignes de Python, une approche qui rappelle la logique d'abstraction matérielle déjà tentée par d'autres acteurs de la robotique humanoïde. DFOL 2.0, qui s'appuie sur le modèle du monde DW0.5 comme simulateur haute fidélité, réduirait de 60 % les besoins en données réelles et de 40 % le coût global d'entraînement, un argument central pour les intégrateurs cherchant à limiter le temps de collecte de données sur robot physique. Les chiffres avancés, notamment le classement sur RoboChallenge et les gains de généralisation, restent des métriques internes à confirmer par des tests indépendants. Dexmal s'inscrit dans un écosystème chinois de l'IA incarnée en pleine consolidation, en partenariat avec des fabricants de corps robotiques comme Tiangong, Huaqin et Shihe, ainsi qu'avec les fondeurs de puces Pingtouge (Alibaba), Moore Threads et Cambricon. Le PDG Tang Wenbin a présenté ce lancement comme le franchissement du "dernier kilomètre" séparant les lois d'échelle des modèles d'une productivité réelle, un positionnement qui fait écho aux ambitions affichées par des concurrents comme Physical Intelligence avec Pi-0, ou NVIDIA avec GR00T N2, dans la course à des modèles vision-langage-action généralistes et déployables à grande échelle.

IA physiqueActu
1 source
Exosquelette IA Haier W3 en pratique : le robot portable domestique est-il enfin prêt ?
1262Pandaily 

Exosquelette IA Haier W3 en pratique : le robot portable domestique est-il enfin prêt ?

Haier a ouvert un magasin d'exosquelettes IA à Guangzhou pour présenter son exosquelette de hanche de troisième génération, le W3. L'appareil pèse 1,75 kg et coûte 2 200 dollars (15 999 yuans), soit environ 60% du poids des produits comparables sur le marché, une réduction obtenue grâce à un usage massif de fibre de carbone et à des moteurs compacts. Le couple d'assistance reste modeste, 16 Nm, mais des tests pratiques ont montré qu'il suffit pour des utilisateurs asiatiques de poids normal, avec une aide perceptible dans les escaliers sans forcer la foulée. La nouveauté principale tient à l'algorithme d'apprentissage de la démarche : contrairement aux générations précédentes qui imposaient un mouvement mécanique rigide, le W3 apprend le style de marche naturel de l'utilisateur en quelques minutes, distinguant les transferts de poids en position debout des mouvements de marche intentionnels pour éviter les faux déclenchements qui pénalisaient les modèles antérieurs. Haier propose aussi une version "W3 Mom Edition" adaptée à la morphologie féminine asiatique, ainsi qu'un mode "petits pas" pour les seniors à foulée courte et fréquente, ce qui impose à l'algorithme de reconnaissance de gestes de fonctionner à haute fréquence, un régime technique exigeant pour des systèmes à long bras de levier. Ce lancement illustre une évolution notable pour le secteur des exosquelettes grand public : la combinaison d'un poids réduit, d'une intelligence embarquée capable de s'adapter à l'utilisateur sans calibration lourde, et d'une segmentation par morphologie (au lieu du modèle unique historiquement dominant) rapproche ces dispositifs d'un usage domestique réel, notamment pour l'assistance à la mobilité des seniors et la rééducation. À 2 200 dollars, le W3 reste néanmoins hors de portée d'une adoption de masse, et les résultats évoqués reposent sur un test de prise en main isolé plutôt que sur une évaluation indépendante à grande échelle, ce qui invite à la prudence sur la généralisation des performances annoncées. L'enjeu dépasse le seul marché de l'exosquelette : les briques technologiques développées ici, apprentissage adaptatif de la démarche et anticipation de l'intention de l'utilisateur, sont considérées par les observateurs du secteur comme des briques transférables aux futurs robots domestiques autonomes. Le W3 s'inscrit dans une trajectoire d'itérations rapides chez Haier, la génération précédente étant plus lourde et moins autonome en matière de perception du mouvement. Le positionnement de la marque, acteur de l'électroménager qui investit désormais la robotique portable, tranche avec les start-up spécialisées en exosquelettes qui dominent habituellement ce segment. Si aucun calendrier de commercialisation internationale n'a été communiqué, la trajectoire observée, une génération plus légère, plus abordable et plus intelligente à chaque itération, laisse penser qu'un ou deux cycles de développement supplémentaires pourraient rendre ces dispositifs viables pour un usage domestique courant, au-delà du strict cadre médical ou industriel auquel les exosquelettes sont aujourd'hui largement cantonnés.

ExosquelettesActu
1 source
Comment évaluer les politiques de robots généralistes pour un déploiement en conditions réelles
1263NVIDIA Developer Blog 

Comment évaluer les politiques de robots généralistes pour un déploiement en conditions réelles

Une équipe de recherche en robotique publie un article de blog consacré à l'évaluation rigoureuse des politiques robotiques généralistes destinées au déploiement réel. Le texte part d'un constat : les meilleurs systèmes actuels, capables de suivre des instructions en langage naturel pour saisir, déplacer, trier et manipuler une grande variété d'objets, ont progressé rapidement ces derniers mois. Mais à mesure que ces modèles gagnent en capacité, les évaluer de façon fiable est devenu, selon les auteurs, l'un des problèmes non résolus les plus difficiles du secteur. Le billet ne détaille pas encore la méthode complète, mais annonce vouloir poser les problèmes clés de l'évaluation et présenter une approche pour les traiter, sans livrer dans cet extrait de chiffres de benchmark, de taux de réussite ou de comparaison entre modèles nommés. Pour l'industrie robotique, la question de l'évaluation n'est pas secondaire : elle conditionne la confiance que les intégrateurs et décideurs B2B peuvent accorder à des politiques génériques de type VLA avant de les déployer sur une ligne de production ou un site logistique. De nombreuses démonstrations de robots manipulateurs ou humanoïdes sont aujourd'hui présentées avec des vidéos sélectionnées et des conditions de test non standardisées, ce qui rend difficile toute comparaison objective entre acteurs. En pointant ce manque de rigueur méthodologique, la démarche s'inscrit dans une remise en question plus large de l'écart entre démonstration et réalité opérationnelle, un sujet central alors que plusieurs laboratoires affirment avoir résolu le passage de la simulation au réel à grande échelle. Cette initiative s'inscrit dans un mouvement plus large où plusieurs laboratoires de robotique généraliste développent des politiques capables d'exécuter des instructions en langage naturel sur des tâches variées, sans qu'il existe pour l'instant de standard d'évaluation partagé par le secteur. L'absence de protocole commun complique la comparaison entre approches concurrentes et freine l'adoption industrielle, les entreprises utilisatrices devant se fier aux métriques propres à chaque fournisseur. Le billet annonce vouloir combler ce vide méthodologique, sans préciser à ce stade de calendrier de publication détaillée ni de partenaires industriels associés à la démarche.

RecherchePaper
1 source
IA chinoise dévoile de nouveaux modèles de perception spatiale pour robots
1264Interesting Engineering 

IA chinoise dévoile de nouveaux modèles de perception spatiale pour robots

La société chinoise Robbyant a dévoilé LingBot-Depth 2.0, une nouvelle génération de modèles de perception spatiale pour robots, accompagnée d'un modèle de vision associé baptisé LingBot-Vision. LingBot-Depth 2.0 s'appuie sur la version précédente, qui avait introduit la technique de Masked Depth Modeling (MDM) pour améliorer la détection de profondeur sur les surfaces transparentes et réfléchissantes. Entraîné sur 150 millions d'échantillons, le nouveau modèle obtient les meilleurs résultats sur 12 des 16 benchmarks de complétion de profondeur testés. Dans les scénarios de perte de profondeur sévère, l'erreur est divisée par plus de deux par rapport au modèle précédent, le score RMSE passant de 0,132 à 0,062. Le modèle progresse aussi sur la détection des surfaces vitrées et des miroirs, un point faible classique des caméras de profondeur. LingBot-Vision, entraîné sur 160 millions d'images (un jeu de données plus restreint que ceux des modèles concurrents), utilise pour la première fois la "structure de bordure" comme objectif de pré-entraînement, permettant une localisation des contours au niveau sub-pixel et un suivi stable des arêtes d'objets sur des séquences vidéo. Pour l'industrie robotique, cette annonce illustre la poursuite de la course aux modèles de perception spatiale comme brique fondamentale des systèmes d'IA incarnée, aux côtés des modèles d'action type VLA (vision-langage-action) tels que Pi-0 ou GR00T N2. Une perception de profondeur fiable sur verre et surfaces réfléchissantes reste un obstacle concret pour la navigation en environnement intérieur (entrepôts, bureaux, hôpitaux), là où les caméras stéréo et LiDAR classiques échouent régulièrement. La certification obtenue auprès du Depth Vision Laboratory d'Orbbec, avec des tests sur les caméras stéréo 3D Gemini 330, apporte une validation industrielle plus tangible qu'une simple annonce marketing, même si les chiffres de benchmark restent ceux communiqués par Robbyant lui-même et mériteraient une vérification indépendante. Le partenariat avec Orbbec, fabricant reconnu de capteurs 3D, va au-delà de la validation logicielle : il s'étend au matériel, avec l'intégration d'une version personnalisée de LingBot-Depth dans le dispositif RGB-D EGO de la nouvelle plateforme de collecte de données "Robot-Free" d'Orbbec, conçue pour capturer des données d'entraînement sans mobiliser de robot physique. Robbyant annonce qu'une version commerciale avancée du modèle sera intégrée à cette plateforme dans de futures mises à jour, avec pour objectif de fournir une base de données plus précise et stable pour l'entraînement des systèmes d'IA incarnée. Le mouvement s'inscrit dans une dynamique plus large de fournisseurs chinois de modèles de fondation pour la robotique cherchant à s'imposer comme briques de perception standard, à un moment où la course humanoïde et logistique internationale accélère la demande de systèmes de perception robustes et bon marché.

Chine/AsieActu
1 source
Are les fournisseurs prêts pour les nouvelles normes de sécurité des robots ?
1265Robotics Business Review 

Are les fournisseurs prêts pour les nouvelles normes de sécurité des robots ?

KUKA, l'un des plus grands fournisseurs de robotique industrielle pour l'automobile, illustre les enjeux d'une transition réglementaire majeure qui s'annonce pour le secteur. La norme ISO 10218:2025, version actualisée du référentiel de sécurité pour les robots industriels, doit devenir obligatoire pour le marquage CE en Europe dans le cadre du nouveau règlement Machines UE 2023/1230, qui remplacera la directive Machines 2006/42/CE le 20 janvier 2027. Reste une étape critique en suspens mi-2026 : l'inscription officielle de la norme au Journal officiel de l'Union européenne, préalable indispensable à son entrée en vigueur légale. Lors de la précédente révision de 2011, ce processus d'harmonisation avait pris plus d'un an, ce qui laisse craindre un calendrier très serré, voire un dépassement de l'échéance de 2027, d'autant que la demande manufacturière européenne reste faible et que les PME subissent des pressions de coûts. Aux États-Unis, l'Association for Advancing Automation et l'ANSI ont publié en septembre 2025 leur propre mise à jour, la norme R15.06-2025, alignée sur les standards ISO mais purement volontaire. Cette différence de statut juridique ne doit pas masquer un enjeu commercial commun : les grands équipementiers, déjà largement prêts pour cette transition, devraient voir leur position concurrentielle renforcée, tandis que les fournisseurs de taille moyenne ou émergents, souvent moins avancés dans leur mise en conformité, risquent de perdre l'accès à certains marchés. En Europe, l'investissement nécessaire pour se conformer à la norme pèsera à court terme sur des vendeurs déjà fragilisés par la contraction du marché entre 2023 et 2025, mais ceux qui absorberont cette transition seront mieux placés pour capter une demande industrielle de plus en plus sensible aux questions de sécurité. Aux États-Unis, bien que la norme reste non contraignante sur le plan légal, les grands donneurs d'ordre et intégrateurs l'exigent fréquemment dans leurs cahiers des charges, et l'OSHA peut s'y référer comme benchmark en cas d'accident, rendant la conformité de facto incontournable pour qui vise ce marché. Le contexte plus large est celui d'un marché américain en reprise depuis le second semestre 2025, mais toujours fragilisé par les tensions géopolitiques et la hausse des prix du pétrole, pendant qu'en Europe le calage précis entre le calendrier réglementaire et la publication au Journal officiel reste la grande inconnue. Pour les fournisseurs, la marge de manœuvre se réduit : anticiper la mise en conformité devient un facteur de différenciation avant même l'entrée en vigueur formelle du texte.

RegulationReglementation
1 source
Robots avant déploiement : pourquoi les équipes de robotique ont besoin de salles d'entraînement virtuelles
1266Robotics Business Review 

Robots avant déploiement : pourquoi les équipes de robotique ont besoin de salles d'entraînement virtuelles

Les robots industriels et humanoïdes butent aujourd'hui moins sur l'automatisation d'une tâche que sur l'adaptation à des environnements changeants, selon un article publié par le cabinet de conseil technologique SoftServe. Le marché mondial de la robotique devrait croître à un rythme de 19,6% par an entre 2026 et 2036, selon les chiffres cités de Future Market Insights. Pour combler l'écart entre simulation et réalité, un concept gagne du terrain dans l'industrie : le « virtual gym » (salle de sport virtuelle), un environnement de simulation haute fidélité où un robot peut s'entraîner, échouer, se corriger et être validé avant tout déploiement réel. Ces plateformes combinent jumeaux numériques, simulation physique poussée, données synthétiques, apprentissage par renforcement, modélisation de capteurs et tests hardware-in-the-loop, l'objectif étant de rendre les essais physiques plus ciblés et moins risqués. L'enjeu dépasse la technique pure : c'est un problème de mise en production. Un robot mobile évoluant en entrepôt doit composer avec un trafic qui change d'heure en heure ; un bras robotisé doit reconnaître un même produit sous des emballages, angles ou reflets lumineux différents de ceux vus à l'entraînement. Ces écarts, même mineurs, suffisent à transformer une simulation réussie en échec sur le terrain. L'apprentissage par imitation, souvent utilisé comme point de départ pratique pour la manipulation, reste dépendant de démonstrations de qualité et d'une variété suffisante de cas. Or collecter cette expérience sur du matériel réel coûte cher : arrêts de production, usure des équipements, risques pour la sécurité. Pire, les cas les plus utiles pour l'entraînement (blocages, objets lâchés, quasi-accidents, fuites, palettes endommagées, pannes de capteurs) surviennent trop rarement en conditions normales pour constituer un jeu de données exploitable. Le virtual gym permet de générer ces scénarios de façon contrôlée avant qu'ils ne se produisent en production. Reste que la fidélité de ces environnements doit être calibrée selon le mode de défaillance visé, pas maximisée par principe : un planificateur d'itinéraire pour robot mobile n'a pas besoin du même niveau de physique qu'une tâche de manipulation d'objets déformables ou qu'un robot d'inspection cherchant des défauts thermiques ou structurels. En usine, la modélisation portera sur la géométrie CAO, les fixations, le placement des caméras, l'outillage et les zones de sécurité ; en entrepôt, sur la géométrie des allées, la variabilité des références produits, les mouvements humains et le comportement de flotte. Les virtual gyms les plus aboutis combinent plusieurs approches de modélisation : physique de premiers principes pour le mouvement et les collisions, modèles résiduels pilotés par les données pour corriger les effets difficiles à capturer analytiquement, co-simulation pour coupler plusieurs solveurs (mouvement, thermique, contraintes matérielles), et modèles de substitution comme les réseaux de neurones physiquement informés pour approximer des comportements complexes plus rapidement qu'une simulation complète.

InfrastructureOpinion
1 source
Comment optimiser le soudage robotique par l'IA chez Path Robotics
1267Robotics Business Review 

Comment optimiser le soudage robotique par l'IA chez Path Robotics

Traduction/résumé de l'article. Path Robotics, entreprise basée à Columbus (Ohio), applique l'intelligence artificielle au soudage robotisé pour résoudre un problème de longue date dans l'industrie manufacturière : la difficulté à programmer et calibrer des robots soudeurs sur des pièces variables. Son système utilise la vision en temps réel pour identifier la trajectoire de la torche et guider le robot tout au long de l'opération de soudure, en ajustant la trajectoire à la volée plutôt qu'en suivant un programme rigide préétabli. L'entreprise déploie également des robots quadrupèdes Spot de Boston Dynamics pour des applications de soudage mobile dans la construction navale, un secteur où les pièces à souder sont souvent trop volumineuses ou mal positionnées pour des cellules robotiques fixes classiques. Ces informations ont été détaillées par Andy Lonsberry, cofondateur et PDG de Path Robotics, lors de l'épisode 252 du podcast The Robot Report, aux côtés de Michael Yip, professeur assistant en génie électrique et informatique à l'UC San Diego. Cette approche illustre un mouvement plus large dans la robotique industrielle : remplacer la programmation manuelle fastidieuse des trajectoires de soudure par des systèmes qui perçoivent et s'adaptent à la géométrie réelle des pièces. Pour les intégrateurs et les décideurs industriels, c'est un argument concret en faveur de l'IA physique appliquée à des tâches à forte valeur ajoutée mais chroniquement sous-automatisées, le soudage manuel restant l'un des métiers les plus pénuriques dans l'industrie lourde américaine. L'utilisation de Spot pour le soudage mobile en chantier naval est également révélatrice d'une tendance : recycler des plateformes quadrupèdes déjà éprouvées (initialement conçues pour l'inspection) vers des tâches de fabrication, plutôt que de développer un robot mobile dédié depuis zéro. Cela reste toutefois un déploiement ciblé sur un cas d'usage industriel spécifique, et non une démonstration généraliste. Sur le plan de la recherche, Michael Yip dirige l'Advanced Robotics and Controls Laboratory (ARCLab) à l'UC San Diego, où son équipe travaille sur le contrôle et la planification de mouvement robotique efficaces en données et en calcul, en s'appuyant sur l'apprentissage profond et l'apprentissage par renforcement. Yip, également conférencier distingué IEEE RAS et Hellman Fellow, applique ces méthodes à la robotique chirurgicale et à l'automatisation de procédures médicales, un domaine où la précision du geste et l'adaptabilité en temps réel posent des défis proches de ceux du soudage industriel. L'épisode aborde par ailleurs l'actualité de la semaine, avec la question des robots humanoïdes en chirurgie au-delà du Da Vinci, les propos du cofondateur d'Agility Robotics avant son entrée en bourse à propos de son robot Digit V5, ainsi que les tensions croissantes entre la NHTSA et les véhicules autonomes interférant avec les services d'urgence aux États-Unis.

IndustrielActu
1 source
AI² Robotics lève 735 millions de dollars pour ses robots humanoïdes à roues, valorisation à 3 milliards
1268Robotics Business Review 

AI² Robotics lève 735 millions de dollars pour ses robots humanoïdes à roues, valorisation à 3 milliards

AI² Robotics, start-up basée à Shenzhen, vient de lever environ 735 millions de dollars lors d'un tour de financement qui porte sa valorisation au-delà de 50 milliards de yuans, soit environ 2,8 milliards de dollars (le titre de l'annonce évoque 3 milliards, un écart qui illustre la façon dont ces valorisations circulent parfois de manière approximative). Le tour de table rassemble un panel d'investisseurs révélateur de l'enjeu stratégique que représente désormais la robotique physique en Chine: des fonds publics comme le National Small and Medium Enterprises Development Fund, des industriels comme Sino Biopharmaceutical et le groupe Moutai, ainsi que des acteurs financiers comme CICC Capital et GSR Ventures. Le produit phare, AlphaBot 2, est un manipulateur mobile à roues doté d'un buste humanoïde et de mains à cinq doigts, avec plus de 34 degrés de liberté et un mécanisme de levage buste-jambes propriétaire. Contrairement à la majorité des constructeurs chinois qui misent sur la bipédie, AI² Robotics a choisi une base roulante: le robot ne peut ni monter d'escaliers ni franchir un terrain accidenté, mais il est nettement moins coûteux à produire, mécaniquement plus robuste et soumis à des contraintes réglementaires bien plus légères pour une exploitation en espace public. L'ensemble tourne sous Alpha Brain, un modèle vision-langage-action (VLA) maison chargé du raisonnement spatial en temps réel, de la compréhension de l'environnement et de la planification de tâches multi-étapes. Ce choix technique traduit un pari assumé sur le compromis coût-fiabilité plutôt que sur la polyvalence locomotrice, et positionne AI² Robotics à contre-courant de la course à la bipédie qui domine la communication du secteur. L'entreprise évite délibérément la rhétorique grand public et cible des environnements structurés où la configuration roues-plus-bras est déjà pertinente: logistique, manufacturing, biotech, services publics et retail. C'est un signal important pour les intégrateurs et décideurs B2B: la validation ne se joue pas sur des démonstrations spectaculaires mais sur la capacité à déployer rapidement dans des entrepôts ou des lignes de production, où un modèle VLA robuste et un robot durable comptent davantage qu'une allure humaine complète. Cette levée s'inscrit dans une séquence de mouvements de capitaux intense sur le marché des humanoïdes: l'introduction en bourse en préparation d'Agility Robotics, les tours de financement récents d'Apptronik et de Neura Robotics, et le rachat de Kinisi Robotics par Bear Robotics. Elle confirme aussi le rôle moteur de capitaux d'État et d'industriels chinois dans le financement de la robotique physique, à un moment où le pays cherche à consolider sa position face aux acteurs américains et européens. Les prochaines étapes attendues concernent le rythme de déploiement industriel d'AlphaBot 2 et la capacité d'Alpha Brain à tenir ses promesses de planification de tâches complexes à grande échelle, un test que la plupart des modèles VLA du secteur n'ont pas encore pleinement réussi.

Chine/AsieOpinion
1 source
Robot-chien dans le navigateur
1269Hackaday Robots Hacks 

Robot-chien dans le navigateur

Un simulateur de chien robot tourne dans le navigateur, sans installation ni matériel. Hackaday présente cet outil basé sur Bittle, le robot quadrupède open source de Petoi vendu sous le nom OpenCat, doté de 9 degrés de liberté : un servomoteur dans la tête et huit répartis sur les quatre pattes. L'ensemble du code s'exécute dans un IDE web gratuit, et l'utilisateur peut piloter le robot virtuel via des boutons à l'écran ou des commandes série documentées, comme "ksit" pour faire asseoir le chien. La logique principale se trouve dans deux fichiers, read_serial, placé de façon surprenante dans src/moduleManager.h, et reaction, dans src/reaction.h. Un clic sur "compile" charge et exécute le code modifié directement dans le robot simulé, permettant de tester des séquences de mouvements, par exemple un enchaînement assis, debout, salto arrière et salto avant répété toutes les 1000 itérations de boucle, sans risquer d'endommager de vrais servomoteurs en cas de chute de bureau. Le sponsor de l'article commercialise le robot en kit ou assemblé, mais la base logicielle étant ouverte, il reste possible de construire sa propre version. Cet outil ne constitue pas un produit commercial ni un déploiement industriel, mais il illustre une tendance utile pour les makers et les développeurs de robotique amateur : tester du code de comportement sur un jumeau virtuel avant tout contact avec le matériel physique, une pratique de simulation-avant-exécution déjà standard chez les plateformes humanoïdes haut de gamme mais rarement accessible sur des quadrupèdes open source à petit budget. Cela réduit le risque de casse de servomoteurs pendant le développement et abaisse la barrière d'entrée pour expérimenter sans acheter de matériel au préalable. L'article souligne aussi le positionnement d'OpenCat entre les jouets bon marché, peu capables, et les plateformes robotiques sérieuses, dont le prix reste élevé : Bittle occupe un créneau intermédiaire, hackable et documenté, mais qui nécessite tout de même un investissement réel pour exploiter pleinement le matériel. OpenCat, déjà couvert par Hackaday par le passé, repose sur un firmware ouvert et des servomoteurs standards, ce qui le distingue de plateformes fermées comme celles de Boston Dynamics ou Unitree, où le code de contrôle n'est pas modifiable par l'utilisateur. Le robot peut aussi être étendu avec des capteurs additionnels montés au niveau de la gueule, ou voir sa tête remplacée par un bras si des servomoteurs suffisamment puissants sont installés. Aucun calendrier de déploiement commercial n'est mentionné : il s'agit d'un outil de développement destiné aux propriétaires actuels ou futurs du robot, pensé pour prototyper des comportements avant tout achat ou assemblage physique.

InfrastructureTuto
1 source
Video Friday : une Coupe du Monde pour robots
1270IEEE Spectrum Robotics 

Video Friday : une Coupe du Monde pour robots

Pour la première fois, deux équipes complètes de robots humanoïdes se sont affrontées dans un match de football à 11 contre 11 sur du matériel réel, lors de RoboCup 2026 à Incheon, en Corée du Sud, une avancée que les organisateurs présentent comme une étape vers un objectif à long terme de la robotique : battre une équipe humaine championne du monde d'ici 2050. Toujours à Incheon, l'équipe néerlandaise Tech United a affronté IRIS en ligue « mid-size ». Dans un autre registre, des ingénieurs du MIT et de l'EPFL à Lausanne ont présenté un robot capable de nager sous l'eau puis de jaillir hors de l'eau pour poursuivre son vol, en s'inspirant de la mécanique des oiseaux plongeurs, dans l'optique de développer une nouvelle classe de drones aériens-aquatiques. La startup 1X a dévolié pour sa plateforme humanoïde NEO une main à 25 degrés de liberté entièrement actionnés, à commande par tendons, dotée d'un retour tactile riche et présentée comme apte à la manipulation fine et à l'usage d'outils de précision, une annonce à prendre avec prudence tant qu'aucune démonstration indépendante n'a été montrée. Boston Dynamics a fait intervenir son robot Atlas devant 80 000 spectateurs au stade NYNJ, lors du match Brésil-Norvège, pour livrer le ballon du coup d'envoi de la seconde mi-temps. Agility Robotics a de son côté mis en scène Digit à la tenue d'un barbecue pour la fête nationale américaine, argument marketing autour du contrôle de force précis de son bras. Enfin, le laboratoire Generalist a annoncé GEN-1, un modèle d'apprentissage robotique affichant un taux de réussite moyen de 99 % contre 64 % pour les modèles précédents sur des tâches physiques simples, une exécution dite trois fois plus rapide, et un entraînement ne nécessitant qu'une heure de données robotiques par tâche. Ces annonces illustrent la bascule en cours dans le secteur, où le spectacle événementiel (Atlas au coup d'envoi, Digit au grill) coexiste avec des progrès techniques plus substantiels sur la manipulation fine et l'apprentissage généraliste. Le chiffre avancé par Generalist, s'il se confirme sur des tâches diversifiées et hors laboratoire, toucherait directement la question du sim-to-real et de la donnée nécessaire au déploiement commercial des VLA, un point de friction majeur pour les intégrateurs industriels. La main à 25 DoF de 1X s'inscrit dans la course à la dextérité, condition jugée indispensable pour sortir les humanoïdes des tâches de manutention basique vers des usages en logistique fine ou en assemblage. Cette semaine s'inscrit dans une accélération plus large du secteur en 2026, entre compétitions sportives comme vitrines technologiques (RoboCup, dont l'ambition affichée reste un horizon 2050) et rivalité entre acteurs américains (Boston Dynamics, Agility, 1X, Figure, Generalist) sur le terrain de l'humanoïde généraliste. Aucun acteur français ou européen n'apparaît dans cette sélection, un signe de la concentration actuelle de l'innovation humanoïde aux États-Unis et en Asie. Les prochains rendez-vous à suivre incluent IROS 2026 à Pittsburgh fin septembre et le Humanoids Summit de Séoul, où ces annonces devraient être confrontées à des démonstrations en conditions réelles.

HumanoïdesActu
1 source
MIT présente un essaim de bateaux robots qui transforme les voies navigables en infrastructure flottante adaptative
1271Interesting Engineering 

MIT présente un essaim de bateaux robots qui transforme les voies navigables en infrastructure flottante adaptative

Des chercheurs du MIT ont développé FloatForm, un essaim de robots-bateaux autonomes capables de s'assembler en structures flottantes reconfigurables sans intervention humaine constante. Chaque robot mesure 21 centimètres de côté et embarque quatre propulseurs omnidirectionnels disposés en configuration X, lui permettant de se déplacer dans toutes les directions et de pivoter sur place. Un mécanisme de verrouillage magnétique inspiré de l'origami, actionné par un unique servomoteur, pousse ou rétracte des aimants permanents sur les quatre faces du robot, autorisant une connexion fiable entre unités séparées de 10 à 15 centimètres. Une boîte de vitesses imprimée en 3D verrouille le loquet en position engagée ou désengagée sans consommer d'énergie, celle-ci n'étant sollicitée que lors des phases de connexion et de séparation. En laboratoire, des flottilles de quatre et huit robots ont assemblé, désassemblé et réassemblé des structures cibles de façon autonome, puis se sont déplacées comme un seul vaisseau rigide, chaque démonstration durant entre quatre et huit minutes. Sur dix essais, le taux de réussite autonome atteint 90% avec quatre robots et chute à 70% avec huit, l'essaim parvenant néanmoins à se remettre seul d'erreurs de navigation et de blocages de formation. Des simulations informatiques suggèrent que le cadre de coordination décentralisé peut s'étendre à des essaims d'au moins 64 robots. L'intérêt du système tient à son architecture décentralisée: contrairement à la plupart des robots auto-assemblants qui dépendent d'un contrôleur central coordonnant chaque mouvement, FloatForm ne confie à un planificateur central que l'attribution des positions finales, chaque robot gérant ensuite localement sa navigation, l'évitement de collisions et la coordination en échangeant des données de position avec ses voisins immédiats. Cette approche permet à tous les robots de bouger simultanément, et surtout découple la charge de calcul du nombre total d'unités puisqu'elle ne dépend que des interactions locales. C'est une distinction importante pour l'industrie de la robotique en essaim: la plupart des démonstrations de ce type restent limitées en échelle par la centralisation du contrôle. Si la scalabilité simulée jusqu'à 64 unités se confirme sur du matériel réel, elle ouvrirait la voie à des infrastructures flottantes à la demande, pont temporaires, plateformes de travail, marchés flottants ou dispositifs d'intervention d'urgence, déployables sur canaux, rivières, ports et zones côtières. Le projet s'inspire directement du comportement des fourmis de feu, capables de former des radeaux flottants collectifs lors d'inondations en ne s'appuyant que sur des décisions individuelles locales. Les équipes du MIT ont dû résoudre plusieurs problèmes d'ingénierie annexes: la puissance des propulseurs provoquait initialement une rotation excessive des robots en raison de leur faible masse, ce qui a nécessité l'ajout d'ailerons stabilisateurs et un raffinement des algorithmes de contrôle pour compenser les différences entre unités individuelles. L'attraction magnétique trop forte entre robots a également dû être corrigée pour garantir un détachement fiable sur commande. Les chercheurs envisagent désormais des versions plus grandes destinées aux canaux, rivières, ports et eaux côtières, sans toutefois avoir communiqué de calendrier de déploiement pilote à ce stade.

RecherchePaper
1 source
Robot foreur descendant : une première mondiale qui pourrait transformer la construction des data centers
1272Interesting Engineering 

Robot foreur descendant : une première mondiale qui pourrait transformer la construction des data centers

Robot DALE de Dewalt (filiale de Stanley Black & Decker), développé avec la société de robotique mobile August Robotics, vient d'être lancé commercialement après une présentation au salon World of Concrete plus tôt cette année. Ce robot est conçu pour le forage vertical descendant dans le béton, une opération jusqu'ici largement manuelle et chronophage sur les chantiers. Il embarque des batteries interchangeables à chaud, un système de supervision à distance, une extraction automatique des poussières et un contrôle qualité assisté par intelligence artificielle. Grâce à la plateforme autonome et multi-robots développée par August Robotics, plusieurs unités DALE peuvent être déployées simultanément sur un même chantier, avec détection d'obstacles et délimitation automatique des zones de travail ; un mode dédié permet aussi de forer à travers des armatures en acier lorsque nécessaire. Selon les chiffres communiqués par Dewalt à l'issue d'un pilote d'un an mené avec une entreprise du secteur (non nommée), le robot aurait atteint une vitesse de forage jusqu'à dix fois supérieure aux méthodes traditionnelles, réduit les délais cumulés de 190 semaines sur 26 phases de construction de data centers, et affiché une précision de 99,97 % sur plus de 230 000 trous percés. Le robot est désormais disponible à la commande sur le site de Dewalt. Ces chiffres, s'ils se confirment en usage réel et à plus grande échelle, marqueraient une avancée notable pour un secteur de la construction de data centers en pleine tension : chaque site nécessite typiquement des milliers de perçages pour ancrer les racks serveurs et les supports des systèmes MEP (mécanique, électrique, plomberie), un travail répétitif, pénible et propice aux erreurs humaines. Pour les intégrateurs et donneurs d'ordre du BTP industriel, la promesse d'un gain de temps aussi important équivaut directement à des économies sur des projets où chaque semaine de retard pèse lourd financièrement, notamment dans la course actuelle à la capacité de calcul. Il faut toutefois noter que ces statistiques proviennent exclusivement du communiqué de Dewalt, sans validation indépendante ni détail sur les conditions précises du pilote, ce qui invite à une lecture prudente des performances annoncées comme un "monde en première mondiale". Ce lancement s'inscrit dans une stratégie plus large de Stanley Black & Decker visant à faire de sa marque Dewalt un acteur de la robotisation des chantiers, au-delà de son cœur historique de l'outillage électroportatif. Le partenariat avec August Robotics, spécialiste des plateformes robotiques autonomes pour la construction, permet à Dewalt d'apporter une brique d'automatisation avancée à ses clients sans développer en interne toute la pile technologique de navigation et de gestion de flotte. Bill Beck, président de la division Tools and Outdoor chez Stanley Black & Decker, a indiqué que l'entreprise entend désormais élargir la distribution de cette technologie à un marché plus vaste. Le secteur du forage robotisé pour la construction reste toutefois un marché naissant, où DALE devra faire ses preuves face à l'adoption progressive d'autres solutions d'automatisation de chantier, dans un contexte où la demande de data centers continue de tirer les investissements en infrastructure.

IndustrielActu
1 source
« NEO, le robot humanoïde, reçoit de nouvelles mains à 25 degrés de liberté pour construire des LEGO et attraper des balles »
1273Interesting Engineering 

« NEO, le robot humanoïde, reçoit de nouvelles mains à 25 degrés de liberté pour construire des LEGO et attraper des balles »

La société norvégienne 1X Technologies a dévoilé une nouvelle génération de mains pour son robot humanoïde NEO, dotées de 25 degrés de liberté (DOF) et d'un système d'entraînement par tendons. Le design comprend 22 articulations actionnées réparties entre doigts et paume, plus trois au poignet, l'ensemble étant entièrement contrôlé en force et rétro-entraînable grâce à des rapports de réduction faibles, entre 5:1 et 15:1, contre des ratios bien plus élevés habituellement utilisés en robotique. Le pouce peut développer un couple de crête de 3,5 Nm, les articulations des doigts jusqu'à 2,6 Nm, avec une force de flexion au bout des doigts atteignant 45 newtons ; le poignet délivre 17,75 Nm de couple. La précision de positionnement est annoncée à ±0,2 mm. Les mains sont étanches IP68, fabriquées en matériaux alimentaires et peuvent être lavées sous l'eau courante ; 1X affirme avoir testé les composants sur plusieurs millions de cycles, et les poignets au-delà de deux millions de cycles sous charge. Des démonstrations vidéo montrent NEO assemblant des LEGO, manipulant vis et pièces de monnaie, utilisant un tournevis, versant du thé, attrapant une balle molle ou branchant un connecteur USB-C. La production de ces nouvelles mains a démarré sur une ligne dédiée à l'usine californienne où 1X a récemment entamé la production en série de NEO. L'enjeu dépasse la simple démonstration technique : en rendant chaque articulation capable de mesurer les forces de contact sans dépendre uniquement de capteurs externes, et en combinant cela à des capteurs tactiles répartis sur les doigts, 1X cherche à déplacer le goulot d'étranglement de la manipulation robotique du matériel vers les données d'entraînement et l'IA. C'est une affirmation structurante pour tout le secteur des humanoïdes, qui peine encore à distinguer les démonstrations soignées des capacités réellement déployables en conditions réelles. Si les chiffres de couple et de précision sont vérifiables sur le papier, les vidéos de démonstration restent, comme souvent dans l'industrie, des séquences sélectionnées, sans garantie de taux de réussite en conditions non contrôlées. Reste que la fiabilité annoncée, testée sur plusieurs millions de cycles, et l'entrée en production de masse constituent des signaux plus concrets que la seule communication marketing. 1X, anciennement Halodi Robotics, positionne NEO comme un robot destiné aux tâches domestiques, un segment que peu d'acteurs humanoïdes ciblent frontalement, la plupart des concurrents comme Figure (Figure 03), Tesla (Optimus) ou Agility Robotics visant d'abord l'industrie et la logistique. Cette annonce s'inscrit dans une escalade générale de la course à la dextérité manuelle, où chaque acteur cherche à prouver que ses robots franchissent le seuil de la manipulation fine utile. La suite dépendra des volumes réels de déploiement en foyers et de la capacité de 1X à alimenter ces mains avec des modèles d'IA suffisamment robustes pour exploiter ce nouveau potentiel matériel.

HumanoïdesActu
1 source
Wisson dévoile son Flexible Charge Universal Service Engine : un robot de recharge VE adaptatif sans latence
1274Pandaily 

Wisson dévoile son Flexible Charge Universal Service Engine : un robot de recharge VE adaptatif sans latence

Le 9 juillet, l'entreprise chinoise Wisson a présenté à Pékin, lors d'une conférence stratégique consacrée à la recharge automatique de véhicules électriques, son nouveau moteur de service universel baptisé Flexible Charge, ainsi que sa gamme de produits associée. Le système revendique une tolérance adaptative quasi instantanée au moment du contact et couvre, selon l'entreprise, l'ensemble des usages de recharge : bornes publiques, flottes dédiées et installations domestiques, avec une architecture technique unique. Wisson justifie cette approche par la variabilité extrême du terrain : des centaines de marques de véhicules, des milliers d'emplacements et de standards de trappes et de connecteurs, auxquels s'ajoutent l'angle de stationnement, les mouvements de passagers, la météo et les obstacles dynamiques. Flexible Charge s'appuie sur l'architecture maison « Pliabot », qui combine structures souples bio-inspirées, compliance passive adaptative et IA multimodale distribuée. Contrairement aux systèmes rigides à articulations, qui nécessitent des boucles perception-action de l'ordre de la centaine de millisecondes, Wisson affirme obtenir une réponse quasi instantanée au premier contact grâce à la flexibilité des matériaux et à la compressibilité de l'air dans ses muscles pneumatiques artificiels, combinée à une génération de trajectoire en temps réel, pour s'adapter en une à deux secondes (durée typique d'insertion d'un connecteur) aux variations de position, d'angle et de force. L'entreprise revendique trois déploiements présentés comme des premières mondiales : une station publique entièrement automatisée dans le parc international de biomédecine de Yizhuang à Pékin, avec 3 millions de cycles de recharge sur plus de 130 modèles de véhicules ; un test en haute altitude à 5 190 mètres, sous 52,9 % de la pression atmosphérique standard, visant les environnements miniers et montagnards ; et des produits domestiques en configurations fixe et coulissante. Le segment de la recharge automatisée est resté longtemps au stade du démonstrateur, faute de solution capable de gérer la diversité mécanique des véhicules sans intervention humaine. Si les volumes avancés par Wisson (3 millions de cycles, 130 modèles) se vérifient à l'échelle annoncée, ils marqueraient un basculement notable du pilote vers une exploitation commerciale récurrente, un seuil que peu d'acteurs du secteur revendiquent publiquement. Le test en altitude cible un marché B2B concret, celui des opérateurs miniers et des flottes en zone reculée, où la fiabilité mécanique par tout temps pèse plus que le coût. L'argument central de Wisson, une mécanique souple tolérant mieux l'imprécision du réel qu'une précision rigide finement calibrée, fait écho à un débat plus large en robotique sur la compliance passive. Les métriques de « réponse zéro seconde » ne sont toutefois étayées par aucune donnée de latence indépendante ni taux d'échec comparé, ce qui invite à la prudence avant audit tiers. L'élargissement visé vers Robotaxi, Robobus, camion autonome et logistique sans chauffeur signale une ambition de fournisseur d'infrastructure critique pour tout l'écosystème autonome chinois, au-delà du simple fabricant de bornes. Wisson s'inscrit dans une vague d'entreprises chinoises développant depuis plusieurs années des robots de recharge, portée par la croissance rapide du parc électrique national et le manque de personnel dans certaines stations. L'architecture Pliabot prolonge des travaux antérieurs de la société sur les structures souples et les actionneurs pneumatiques, une famille de technologies aussi explorée en Occident pour la préhension en environnement non structuré. Sur ce marché, Wisson affronte d'autres acteurs chinois ainsi que des constructeurs automobiles développant leurs propres solutions de branchement robotisé, y compris en Europe où des pilotes existent chez plusieurs équipementiers sans atteindre le stade commercial revendiqué ici. Aucun acteur français ou européen n'apparaît dans cette annonce, circonscrite pour l'instant au marché chinois. Wisson dit vouloir nouer des partenariats avec constructeurs, opérateurs de stations, acteurs des infrastructures énergétiques et collectivités locales pour accélérer le déploiement commercial, sans donner de calendrier ni de volumes cibles pour les prochains pilotes.

Chine/AsieActu
1 source
Les scientifiques IA sont déjà au travail à Pékin : mélange de fluide de conduction en 20 secondes
1275Pandaily 

Les scientifiques IA sont déjà au travail à Pékin : mélange de fluide de conduction en 20 secondes

À Pékin, des laboratoires spécialisés dans l'IA for Science ont commencé à confier certaines tâches expérimentales à des bras robotiques pilotés par IA, capables de concevoir des protocoles, de collecter des données et de proposer de nouvelles pistes de recherche. Un journaliste du Beijing News a pu observer l'un de ces sites : un bras robotique y prépare du liquide conducteur en 20 à 30 secondes par flacon, avec une régularité de geste qui élimine les erreurs de manipulation manuelle. Le laboratoire fonctionne sur des postes d'expérimentation confinés où des bras robotiques manipulent pipettes, réactifs et échantillons avec précision, selon une architecture en trois couches : découverte autonome de lois scientifiques fondamentales par l'expérimentation, création de nouveaux matériaux via des modèles entraînés sur des données de haute qualité générées par le système, et enfin conception inverse de bout en bout où les résultats sont directement validés en application. À l'Institut d'automatisation de l'Académie chinoise des sciences, l'équipe a développé un modèle de fondation baptisé Panshi, avec une approche à deux volets : une version 1.0 qui affine des modèles open source sur des données et de la littérature scientifiques, et une version 2.0 en développement qui entraîne un modèle entièrement nouveau unifiant texte et modalités scientifiques (spectres d'ondes, spectrogrammes, champs électromagnétiques, structures moléculaires) dans un système de tokens commun. Panshi a déjà achevé une adaptation à huit disciplines scientifiques. Cette expérimentation illustre une bascule stratégique dans la course à l'IA scientifique : contrairement aux modèles grand public comme DeepSeek ou ChatGPT, qui se contentent d'exploiter des données déjà disponibles sur internet, les systèmes AI4S doivent produire eux-mêmes de nouvelles données par l'expérimentation réelle, ce qui suppose une intégration étroite entre IA, bras robotiques, capteurs et instruments de laboratoire dans une boucle fermée hypothèse-expérience-collecte-optimisation. Pour l'industrie robotique et les décideurs B2B, c'est un signal que l'automatisation ne se limite plus à la manipulation répétitive en usine mais s'étend à des tâches de précision scientifique à haute valeur ajoutée, où la fiabilité du geste et la vitesse d'exécution (20 à 30 secondes par préparation) deviennent des arguments concrets face au travail manuel de laboratoire. Cette initiative s'inscrit dans une dynamique portée par les autorités pékinoises, qui misent sur la concentration exceptionnelle d'institutions de recherche de premier plan dans la ville, dont l'Académie chinoise des sciences, Tsinghua et l'Université de Pékin, ainsi que sur le pôle scientifique de Huairou, capable de générer des volumes massifs de données d'entraînement, à l'image du collisionneur électron-positron de Pékin qui produit à lui seul 1 téraoctet de données par seconde. En juin 2026, Pékin a publié son plan de mise en œuvre de l'IA for Science, couvrant six domaines prioritaires, avec l'ambition de faire de la ville un pôle d'innovation scientifique en IA d'influence mondiale d'ici 2028.

Chine/AsieActu
1 source
EgoWAM : des modèles monde-action au-delà des pixels grâce à des données humaines égocentriques en conditions réelles
1276arXiv cs.RO 

EgoWAM : des modèles monde-action au-delà des pixels grâce à des données humaines égocentriques en conditions réelles

Des chercheurs du laboratoire RL2 de Georgia Tech publient EgoWAM, un cadre de "World Action Models" qui exploite des vidéos égocentriques humaines filmées en conditions réelles pour entraîner des politiques de manipulation robotique. Le problème identifié: le clonage de comportement classique mélange des éléments transférables comme les objets, les scènes et la sémantique des tâches, avec des facteurs propres à l'humain (morphologie, mouvements de tête, style gestuel) qui n'ont rien à voir avec un bras robotique. Les auteurs testent trois cibles de prédiction du monde différentes, à backbone de politique, tête d'action et mélange de données identiques: la prédiction de pixels bruts, des caractéristiques visuelles DINO, et le flux de mouvement 3D. Sur trois tâches bimanuelles réelles, la prédiction pixel se révèle peu efficace pour le transfert humain-robot, tandis que DINO améliore la généralisation hors distribution (nouveaux objets, nouvelles scènes) jusqu'à 4 fois, et le flux 3D augmente la performance en distribution de 20 à 30%. Le résultat tranche un débat central pour l'industrie robotique: peut-on utiliser la masse de vidéos humaines disponibles sur le web comme signal d'entraînement bon marché, à la manière dont les modèles VLA (vision-langage-action) type Pi-0 de Physical Intelligence ou GR00T de NVIDIA cherchent à le faire? EgoWAM montre que oui, mais pas en imitant les pixels tels quels: il faut une représentation qui abstrait l'apparence et isole les effets physiques indépendants de l'agent, en séparant le mouvement de caméra du changement réel de l'environnement. Pour les intégrateurs et laboratoires qui misent sur la vidéo à l'échelle pour réduire le coût de collecte de données robotiques, cela oriente concrètement le choix des représentations à privilégier plutôt que la simple accumulation de séquences pixel. Le travail s'inscrit dans la lignée des modèles du monde appliqués à la robotique et des jeux de données égocentriques type Ego4D, en réponse aux limites connues du clonage de comportement pur. Le code, les tâches et les détails expérimentaux sont publiés sur gatech-rl2.github.io/egowam.github.io, sans annonce de déploiement industriel à ce stade: il s'agit d'un résultat de recherche contrôlé, pas d'un produit prêt à intégrer.

RechercheActu
1 source
Un nouvel indice de similitude humaine et de confort pour les mouvements de robots suivant des trajectoires prédéfinies
1277arXiv cs.RO 

Un nouvel indice de similitude humaine et de confort pour les mouvements de robots suivant des trajectoires prédéfinies

Des chercheurs publient sur arXiv (arXiv:2607.08620v1, article de type "new") un indice inédit de similarité humaine et de confort pour évaluer les mouvements de robots suivant une trajectoire imposée. L'étude part du constat que la ressemblance visuelle avec le corps humain, propre aux humanoïdes, ne suffit pas à garantir l'acceptation lors d'une interaction physique : celle-ci dépend directement du confort et de l'ergonomie perçus, liés à la qualité du mouvement exécuté. Les auteurs s'appuient sur la caractérisation cinématique du mouvement humain, en particulier les lois temporelles qui régissent le déplacement de l'organe terminal (end-effector) le long d'un chemin donné, et mobilisent le principe de lognormalité, un modèle reconnu pour décrire la vitesse des gestes humains. Cet indice permet d'évaluer a priori, avant toute exécution, si une trajectoire générée par un algorithme paraîtra naturelle. Pour valider l'approche, 68 sujets ont participé à trois campagnes expérimentales impliquant une interaction physique directe avec un robot, en jugeant leur confort face à différents mouvements. Les résultats montrent une tendance globalement cohérente entre le confort perçu et la distribution de l'indice proposé. Pour l'industrie robotique, cet outil offre un moyen concret de comparer et d'optimiser des algorithmes de génération de trajectoires avant leur déploiement, sans attendre des tests utilisateurs coûteux à chaque itération. Il s'inscrit dans une problématique clé pour les intégrateurs de cobots et de robots humanoïdes destinés à travailler aux côtés d'humains : la fluidité perçue d'un geste pèse autant que sa précision technique dans l'acceptation du robot par les opérateurs, un facteur souvent négligé au profit des seules performances cinématiques (vitesse, précision, répétabilité). Le papier s'inscrit dans un courant de recherche en ergonomie robotique qui cherche à quantifier objectivement ce qui, jusqu'ici, relevait surtout d'évaluations subjectives via questionnaires post-interaction. En proposant une métrique calculable en amont de l'exécution, les auteurs ouvrent la voie à son intégration directe dans les boucles de planification de mouvement, avec des validations complémentaires à prévoir sur d'autres morphologies de robots et contextes d'usage industriel.

RecherchePaper
1 source
DexVerse : un référentiel modulaire pour la manipulation dextre multi-tâche et multi-incarnation
1278arXiv cs.RO 

DexVerse : un référentiel modulaire pour la manipulation dextre multi-tâche et multi-incarnation

Un consortium de chercheurs présente DexVerse, un benchmark modulaire à grande échelle pour la manipulation dextre multi-tâches et multi-embodiments. L'ensemble couvre 100 tâches réparties sur des compétences variées : saisie et déplacement d'objets, interaction avec des objets articulés, usage fonctionnel d'outils, coordination bimanuelle, contrôle non préhensile, comportements riches en contact, exécution multi-objectifs et tâches longues à plusieurs étapes. Le système prend en charge 3 bras robotiques et 6 mains dextres différentes, et reste extensible à de nouvelles tâches, de nouveaux actifs et de nouveaux embodiments. Pour tester la généralisation visuomotrice, DexVerse propose des variations visuelles paramétrables (textures, arrière-plans, éclairage, points de vue caméra). Les auteurs fournissent aussi une interface de téléopération en réalité virtuelle ainsi que 3 180 démonstrations avec observations synchronisées : données proprioceptives, images RGB, profondeur, nuages de points et états. Quatre méthodes représentatives ont été évaluées sur 19 tâches : Diffusion Policy, DP3, OpenVLA et π0.5. Les résultats révèlent des difficultés importantes de généralisation entre tâches et de robustesse visuomotrice, même pour ces politiques d'apprentissage jugées à la pointe. Pour l'industrie robotique, ce constat vient nuancer l'enthousiasme actuel autour des modèles VLA (vision-langage-action) présentés comme des solutions généralistes prêtes à l'échelle : DexVerse montre que la performance chute nettement dès que les conditions visuelles ou la nature de la tâche s'écartent du contexte d'entraînement. C'est un signal utile pour les intégrateurs et décideurs B2B qui évaluent des politiques de manipulation dextre avant déploiement industriel : la démonstration en laboratoire ne garantit pas la robustesse en conditions réelles variables. DexVerse s'inscrit dans une lignée de benchmarks robotiques cherchant à dépasser les évaluations sur tâche isolée, un manque identifié dans les jeux d'essai existants, limités en diversité de tâches, de couverture d'embodiments ou de variation visuelle contrôlable. En couvrant simultanément plusieurs bras, plusieurs mains et un large éventail de conditions, il se positionne comme un terrain d'essai de référence pour comparer des approches comme Diffusion Policy ou les modèles de la famille π face à des architectures VLA telles qu'OpenVLA. La page du projet est disponible à l'adresse ycyao216.github.io/DexVerse.site, laissant présager de futures évaluations élargies et l'ajout d'autres méthodes et tâches.

RecherchePaper
1 source
EVIS : un plugin de caméra événementielle ancré dans la physique pour NVIDIA Isaac Sim
1279arXiv cs.RO 

EVIS : un plugin de caméra événementielle ancré dans la physique pour NVIDIA Isaac Sim

Des chercheurs du SpikeLab de l'université Johns Hopkins ont publié EVIS, un plugin de caméra événementielle physiquement fondé pour le simulateur NVIDIA Isaac Sim, décrit dans un article déposé sur arXiv (référence 2607.08098) et accompagné d'un dépôt de code ouvert sur GitHub (spikelab-jhu/isaac-sim-event-camera-plugin). L'outil génère des flux d'événements haute fréquence et entièrement annotés directement à l'intérieur du moteur physique d'Isaac Sim, en s'appuyant sur un modèle de contraste log-intensité fidèle au fonctionnement réel des capteurs événementiels, avec mise à jour asynchrone de référence pixel par pixel. Le plugin migre depuis une caméra RGB standard avec peu de modifications et s'intègre à n'importe quelle scène Isaac Sim ou Isaac Lab, héritant ainsi de la physique du simulateur et d'une vérité terrain parfaite image par image. Une option d'interpolation permet de ne rendre que des images clés éparses puis de synthétiser les images intermédiaires par déformation bidirectionnelle par vecteurs de mouvement, rendant possible une génération en temps réel sur un seul GPU. Du bruit capteur et du flou de mouvement optionnels réduisent encore l'écart avec des caméras réelles. L'enjeu est concret pour la robotique événementielle: les caméras à événements offrent une résolution temporelle de l'ordre de la microseconde, une latence très faible et une large plage dynamique, des atouts pour la perception rapide et le contrôle en boucle fermée. Mais les données labellisées pour un robot et une scène donnés restent rares et coûteuses à collecter, ce qui freine le développement d'algorithmes de perception et de contrôle basés sur ces capteurs. En générant des flux directement exploitables par des réseaux événementiels pré-entraînés, EVIS réduit ce goulot d'étranglement et s'attaque frontalement au problème classique du fossé simulation-réel. Le projet s'inscrit dans l'écosystème Isaac Sim, largement utilisé par les laboratoires de robotique et les équipes d'apprentissage par renforcement pour l'entraînement en simulation avant déploiement physique. En rendant la simulation événementielle native et configurable au sein d'un outil déjà répandu, les auteurs visent à accélérer les cycles de recherche sur des tâches de perception et de contrôle à haute vitesse, sans attendre la constitution coûteuse de jeux de données réels capteur par capteur.

RechercheActu
1 source
StreamVLN : navigation vision-langage en flux continu via modélisation contextuelle SlowFast
1280arXiv cs.RO 

StreamVLN : navigation vision-langage en flux continu via modélisation contextuelle SlowFast

Chercheurs présentent StreamVLN, un framework de navigation vision-langage (VLN) conçu pour fonctionner en flux continu plutôt que sur des séquences vidéo pré-découpées. Publié sur arXiv (version 2, remplaçant une première mouture du 05/07/2025 sous la référence 2507.05240), le système repose sur une architecture dite "slow-fast" : un contexte de dialogue rapide gère une fenêtre glissante d'échanges multi-tours pour générer des actions avec une latence minimale, tandis qu'une mémoire à mise à jour lente compresse l'historique visuel via une stratégie d'élagage de tokens tenant compte de la géométrie 3D de la scène. Grâce à la réutilisation du cache KV, StreamVLN maintient des dialogues en temps réel sur des flux vidéo longs, avec une taille de contexte et un coût d'inférence bornés, quelle que soit la durée du flux. Sur les benchmarks VLN-CE, référence du domaine pour évaluer la navigation guidée par instructions en environnement continu, les auteurs revendiquent des performances état de l'art combinées à une faible latence. L'enjeu dépasse la simple performance sur benchmark : les modèles vidéo-LLM appliqués à la navigation robotique butent généralement sur un compromis entre compréhension visuelle fine, mémorisation du contexte long terme et coût de calcul, un compromis qui freine leur déploiement embarqué sur robots mobiles ou humanoïdes à ressources limitées. En bornant le coût d'inférence indépendamment de la longueur du flux vidéo, StreamVLN répond directement à un obstacle pratique du secteur : faire tourner un agent VLA (vision-language-action) en continu, sans dérive de latence ni explosion mémoire, condition nécessaire pour une navigation autonome réactive en environnement réel plutôt qu'en simulation contrôlée ou sur clips vidéo courts. Le travail s'inscrit dans la lignée des approches VLN basées sur des Video-LLM apparues ces deux dernières années, qui cherchaient à exploiter les capacités de raisonnement multimodal de ces modèles pour l'instruction-following robotique, au prix jusqu'ici d'architectures gourmandes en contexte. La publication d'une version 2 sur arXiv indique une itération après retours ou revue, sans changement de statut : il s'agit toujours d'un travail de recherche, avec code et démonstrations disponibles sur la page projet (streamvln.github.io), et non d'un produit ou d'un déploiement industriel annoncé. La suite logique pour ce type d'approche reste son intégration et sa validation sur plateformes robotiques physiques, au-delà des benchmarks simulés VLN-CE.

RechercheActu
1 source
SeFA-Policy : apprentissage rapide et précis de politiques visuomotrices par alignement de flux sélectif
1281arXiv cs.RO 

SeFA-Policy : apprentissage rapide et précis de politiques visuomotrices par alignement de flux sélectif

Une équipe de recherche a publié SeFA-Policy (Selective Flow Alignment), une nouvelle méthode d'apprentissage de politiques visuomotrices par imitation pour la robotique, décrite dans une version révisée sur arXiv (2511.08583v2) et accompagnée d'un code source disponible sur GitHub (RongXueZoe/SeFA). Le problème ciblé concerne les approches récentes de "rectified flow", qui accélèrent la génération d'actions robotiques mais souffrent d'un défaut connu : après distillation itérative, les actions générées finissent par dévier des actions réelles associées à l'observation visuelle en cours, ce qui accumule l'erreur au fil des cycles de reflow et déstabilise l'exécution des tâches. SeFA introduit un mécanisme de correction de cohérence qui réaligne sélectivement les actions générées sur les démonstrations expertes, tout en conservant la capacité du modèle à représenter plusieurs solutions possibles (multimodalité). Sur des tâches de manipulation simulées et réelles, les auteurs annoncent une précision et une robustesse supérieures aux politiques de référence basées sur la diffusion ou sur le flow, avec une latence d'inférence réduite de plus de 98%. Pour l'industrie robotique, l'enjeu dépasse la performance académique brute : le goulot d'étranglement des politiques par diffusion a toujours été le nombre d'étapes de débruitage nécessaires à chaque décision, incompatible avec du contrôle temps réel sur bras manipulateurs ou robots mobiles. Les méthodes à un seul pas d'inférence promettent de lever ce verrou, mais au prix, jusqu'ici, d'une fidélité dégradée aux observations réelles. En traitant explicitement ce compromis précision/vitesse plutôt qu'en l'ignorant, SeFA apporte un signal utile aux intégrateurs qui évaluent si les politiques de type flow sont mûres pour un déploiement embarqué, au-delà des démonstrations en laboratoire. Ce travail s'inscrit dans la lignée des Diffusion Policy puis des politiques par rectified flow, apparues ces deux dernières années comme alternative aux architectures de type transformer pour l'apprentissage par imitation en robotique. Il se positionne explicitement contre les méthodes de diffusion et de flow "state of the art" existantes, sans toutefois nommer d'acteur industriel ni annoncer de déploiement commercial : il s'agit d'une contribution de recherche, publiée en v2 après une première soumission, avec code ouvert pour reproduction par la communauté.

RechercheActu
1 source
Comprendre et réduire l'écart de généralisation vidéo-action grâce au ratio temporel
1282arXiv cs.RO 

Comprendre et réduire l'écart de généralisation vidéo-action grâce au ratio temporel

Des chercheurs mettent en évidence un défaut structurel des modèles vidéo-action (VAM) et monde-action (WAM) utilisés en robotique : lorsqu'ils sont finetunés sur des données d'actions robotiques, ces modèles perdent la capacité de généralisation compositionnelle héritée des modèles vidéo génératifs de base, un phénomène baptisé "video-action generalization gap". L'étude, publiée sur arXiv (2607.08127), teste un large espace de configurations de VAM sans trouver de schéma explicatif évident dans les choix de conception standards. Les auteurs introduisent alors le Temporal Ratio (TR), une mesure basée sur l'attention qui quantifie à quel point la tête d'action d'un modèle s'appuie sur les projections latentes futures plutôt que sur l'image ancrée au présent. Le TR se révèle être à la fois un prédicteur de la capacité de généralisation compositionnelle d'un modèle et un indicateur qui varie naturellement selon la phase de la tâche : l'attention se porte vers le futur pendant la planification, puis revient au présent pour les phases de manipulation fine nécessitant de la précision. Les tests ont été menés sur le benchmark LIBERO ainsi que sur des tâches réelles. Cette découverte a une portée directe pour les concepteurs de politiques robotiques de type VLA (vision-language-action), un domaine où l'écart entre performances en démonstration et robustesse réelle reste un point de friction majeur pour les intégrateurs. En identifiant un mécanisme mesurable et exploitable au moment de l'inférence, l'équipe propose une méthode de guidage adaptatif qui amplifie dynamiquement le signal de conditionnement vidéo compositionnel précisément quand la politique dépend des projections futures. Cela permettrait de réduire l'écart de généralisation OOD-ID (hors distribution vs distribution d'entraînement) sans réentraîner le modèle, une piste concrète pour fiabiliser le déploiement de politiques apprises par vidéo sur des tâches non vues. Ce travail s'inscrit dans la lignée des efforts récents pour comprendre pourquoi les modèles fondation vidéo, malgré leurs forts a priori compositionnels, ne transfèrent pas systématiquement ces capacités une fois adaptés à la robotique, un sujet également abordé par des familles de modèles comme GR00T N2 ou Pi-0. La suite logique serait une validation à plus grande échelle sur des plateformes robotiques variées et une comparaison directe du TR face à d'autres métriques de diagnostic des politiques VLA.

RecherchePaper
1 source
Harness VLA : orienter les VLA figés vers des primitives de manipulation fiables via des agents guidés par la mémoire
1283arXiv cs.RO 

Harness VLA : orienter les VLA figés vers des primitives de manipulation fiables via des agents guidés par la mémoire

Des chercheurs présentent Harness VLA, un framework agentique décrit dans un article publié le 10 juillet 2026 sur arXiv (2607.08448v1), qui vise à rendre les modèles Vision-Language-Action (VLA) plus fiables sans réentraînement. Le système transforme un VLA figé en une primitive de manipulation "contact-rich" réessayable, orchestrée par un agent doté de mémoire et couplée à une bibliothèque fixe de primitives analytiques couvrant le grounding, le staging, le transport, la navigation et le relâchement d'objet. Plutôt que d'élargir le répertoire de compétences du robot, le harness apprend la plage de fonctionnement de ces primitives à partir de traces d'exécution spécifiques à la tâche, de règles de succès globales et de modèles d'échec. Testé sur trois bancs d'essai simulés perturbés (manipulation de table, cuisine domestique, et manipulation bimanuelle avec transfert propre-vers-aléatoire), le système améliore les performances de 38,6 points de pourcentage sur LIBERO-Pro et de 25,4 points sur RoboCasa365 par rapport aux meilleures baselines existantes, et atteint 58,4% de réussite sur RoboTwin C2R. Ce travail s'attaque à un problème central dans le déploiement des VLA end-to-end : entraînés sur des trajectoires en distribution, ces modèles s'effondrent souvent dès que le contexte de déploiement s'écarte du jeu d'entraînement, que ce soit par un changement sémantique de la tâche, un repositionnement spatial des objets ou une instabilité de contact locale. Les agents LLM apportent un raisonnement compositionnel complémentaire, mais échouent typiquement sur les phases de préhension irrégulière, de placement contraint ou d'interaction avec des objets articulés, précisément là où les VLA excellent. En confiant au planificateur le re-ancrage sémantique et l'exécution non contactuelle, et en réservant le VLA figé aux phases de contact fin, Harness VLA prolonge la distribution effective des compétences d'un modèle pré-entraîné sans le retoucher. Pour les intégrateurs et les équipes de recherche en robotique, l'intérêt est double : cela réduit le coût de réentraînement à chaque nouvel environnement et adresse directement l'écart entre démonstrations contrôlées et robustesse en conditions perturbées, un point sensible depuis que la plupart des annonces commerciales de robots humanoïdes s'appuient sur des vidéos filtrées. Le papier s'inscrit dans la lignée des travaux récents combinant modèles VLA (Pi-0, GR00T N2, Helix, ou les architectures propriétaires de Figure et Tesla Optimus) avec des couches de planification symbolique, une tendance qui s'accélère à mesure que les limites du end-to-end pur en dehors du laboratoire deviennent visibles. Contrairement à des approches qui étendent le répertoire de compétences via de nouvelles données ou du finetuning, Harness VLA mise sur l'orchestration et la mémoire d'exécution pour exploiter au mieux un modèle existant, une direction qui pourrait intéresser les acteurs cherchant à déployer des VLA génériques sur du matériel varié sans long cycle de réentraînement. Les résultats restent pour l'instant limités à des bancs d'essai simulés (LIBERO-Pro, RoboCasa365, RoboTwin C2R) ; aucun déploiement sur robot physique n'est mentionné dans l'abstract, ce qui invite à la prudence avant d'extrapoler ces gains à des conditions réelles d'usine ou de foyer.

RechercheActu
1 source
ContactMimic : interaction avec des objets par un robot humanoïde grâce au contrôle des contacts
1284arXiv cs.RO 

ContactMimic : interaction avec des objets par un robot humanoïde grâce au contrôle des contacts

Wiping a board, sitting on a chair ou pousser un meuble : ces tâches semblent réussies dès que le robot atteint la bonne posture, mais sans contact physique réel avec l'objet, elles échouent en pratique. C'est le constat de départ de CONTACTMIMIC, un framework d'apprentissage présenté dans un article publié le 10 juillet sur arXiv (2607.08742). L'équipe y ajoute aux trajectoires de points-clés classiques (keypoint tracking) des commandes de contact binaires, définies au niveau de chaque partie du corps. La politique résultante s'appuie sur deux ingrédients : des récompenses qui suivent explicitement le contact et un schéma d'augmentation de trajectoires conçu pour casser la corrélation entre géométrie des points-clés et étiquettes de contact. Résultat, le robot peut produire ou supprimer un contact à la demande, indépendamment de sa pose. Sur 10 mouvements d'interaction homme-objet testés en simulation, CONTACTMIMIC dépasse les trackers uniquement basés sur les points-clés, sans recourir à des récompenses spécifiques à chaque tâche. Le transfert sim-to-real a été validé sur 5 mouvements réels. L'enjeu dépasse la démonstration technique : la plupart des pipelines d'imitation de mouvement pour humanoïdes optimisent la fidélité cinématique, pas l'interaction physique effective, un angle mort qui limite l'utilité pratique des politiques de manipulation whole-body déployées sur des plateformes comme Figure 03, Optimus ou des architectures VLA type GR00T N2, Pi-0 ou Helix. Découpler contact et géométrie ouvre la voie à des contrôleurs capables d'exécuter des tâches ménagères ou industrielles réelles (essuyer, pousser, s'asseoir) sans réentraînement par tâche, un prérequis pour que les humanoïdes sortent de la démonstration scriptée. Le travail s'inscrit dans la lignée des méthodes de suivi de points-clés pour le contrôle corps entier des humanoïdes, dont il expose les limites via des ablations confirmant la nécessité de l'augmentation de trajectoires. Aucun partenaire industriel n'est mentionné : il s'agit pour l'instant d'une contribution de recherche en simulation et validation restreinte en réel, dont les vidéos sont disponibles en ligne, sans calendrier de déploiement annoncé.

RecherchePaper
1 source
Main d'AnyDexRT : retargeting dextérique sans calibration guidé par peu de démonstrations humaines
1285arXiv cs.RO 

Main d'AnyDexRT : retargeting dextérique sans calibration guidé par peu de démonstrations humaines

Des chercheurs viennent de publier sur arXiv (arXiv:2607.08341, 10 juillet 2026) une nouvelle méthode baptisée AnyDexRT, conçue pour le retargeting cinématique des mains robotiques dextres en téléopération. Le retargeting consiste à traduire les mouvements de la main d'un opérateur humain en mouvements réalisables par une main robotique, une étape cruciale pour la téléopération et pour la collecte de démonstrations utilisées en apprentissage par imitation. Contrairement aux approches existantes, qui reposent souvent sur des objectifs conçus manuellement, un calibrage précis ou un appariement global des formes entre la main humaine et la main robotique, AnyDexRT ne nécessite aucune calibration préalable. La méthode combine un apprentissage auto-supervisé des correspondances entre le bout des doigts humains et robotiques avec un guidage humain en few-shot, c'est-à-dire à partir de très peu d'exemples, pour ancrer la correspondance dans les zones pertinentes pour la tâche. Un classificateur de contact affine ensuite spécifiquement les poses de préhension en pince. Cette approche répond à un problème concret et sous-estimé du secteur : la fragilité des pipelines de téléopération dès qu'on change de main robotique ou d'opérateur, ce qui limite la scalabilité de la collecte de données pour l'apprentissage par imitation, un goulot d'étranglement identifié dans le développement des modèles VLA (vision-langage-action) comme Pi-0 ou GR00T N2. En supprimant la calibration manuelle, AnyDexRT pourrait accélérer la production de démonstrations de qualité pour l'entraînement de politiques robotiques, un enjeu central pour les intégrateurs et laboratoires qui cherchent à faire passer leurs mains dextres de la démonstration en laboratoire à des déploiements plus robustes. Les auteurs rapportent des gains en qualité de retargeting et une réduction du réglage manuel sur des mains dextres variées et des tâches de téléopération réelles, sans toutefois préciser de métriques chiffrées vérifiables dans le résumé. Le travail s'inscrit dans la lignée des recherches sur le retargeting cross-embodiment, un axe actif face à la multiplication des mains robotiques commerciales aux morphologies différentes. Un site de projet accompagne la publication, mais aucun code, benchmark comparatif détaillé ni partenariat industriel n'est mentionné à ce stade : il s'agit d'une contribution académique, pas d'un produit prêt à déployer.

RecherchePaper
1 source
Cadre de contrôle par vision monoculaire pour la préhension
1286arXiv cs.RO 

Cadre de contrôle par vision monoculaire pour la préhension

Des chercheurs présentent un système de préhension robotique piloté uniquement par une caméra RGB monoculaire, capable de manipuler aussi bien des objets rigides que déformables avec un seul pipeline de contrôle, sans capteur tactile ni pince spécialisée. Le framework combine détection d'objets en vocabulaire ouvert, segmentation d'image, assignation de points sensible aux contours, suivi de points en temps réel et estimation de profondeur monoculaire pour reconstruire la géométrie et le mouvement des objets à partir de la seule vision. Son élément central est un modèle qui estime la raideur attendue d'un objet à partir de sa description sémantique, fournissant un a priori pour choisir la stratégie de préhension avant tout contact. Pour les objets déformables, l'adaptation de la prise s'appuie sur une mesure de dissimilarité de type Procrustes calculée sur des points-clés suivis, utilisée comme indicateur visuel de déformation. Pour les objets rigides, l'écartement de la pince est réglé par la mise à l'échelle des distances entre points suivis. Le système a été testé sur un bras Franka Emika Research 3, en conditions réelles de prise et dépose, sur de la salade, de la mozzarella fraîche, des croissants, du papier essuie-tout et des bouteilles en plastique rigide. L'intérêt pratique tient à l'unification: la plupart des approches existantes traitent séparément le rigide et le souple, en s'appuyant souvent sur des capteurs tactiles, des modèles spécifiques par objet ou des pinces dédiées. Démontrer une préhension stable sur les deux catégories avec une seule pipeline vision, sans tactile, ouvre une piste économique et généralisable pour la manutention alimentaire et la manipulation domestique, deux domaines où la variabilité des objets rend coûteuse toute solution sur mesure. Le travail s'inscrit dans la lignée des recherches en préhension robotique cherchant à réduire la dépendance au capteur tactile au profit de la vision seule, à l'heure où les modèles vision-langage-action gagnent en popularité pour la manipulation généraliste. Les auteurs positionnent leur approche comme une alternative sensor-efficient à ces pipelines multimodaux plus lourds, la validation restant pour l'instant limitée à un jeu restreint d'objets en laboratoire.

RecherchePaper
1 source
Vers des exogants souples robotisés pour la manipulation musculo-squelettique, afin de réduire douleur et spasticité
1287arXiv cs.RO 

Vers des exogants souples robotisés pour la manipulation musculo-squelettique, afin de réduire douleur et spasticité

Des chercheurs présentent le développement préliminaire d'un exogant robotique souple (soft robotic exoglove) conçu pour traiter simultanément deux problèmes distincts chez les patients atteints de spasticité de la main, un trouble qui touche 12 millions de personnes dans le monde, dont des survivants d'AVC, des patients arthritiques et des personnes souffrant de déficiences musculaires ou nerveuses. Le gant intègre des actionneurs pneumatiques souples personnalisés selon la topologie et la cinématique de la main de chaque utilisateur, permettant une conformabilité optimale et une mobilité ciblée. Les chercheurs ont conçu, modélisé en 3D et analysé ces actionneurs par éléments finis sous des pressions de 100 et 200 kPa, puis optimisé les géométries pour minimiser les contraintes avant fabrication. Trois types d'actionneurs ont été testés avec succès : un actionneur dorsal pour doigt personnalisé offrant un contact conforme complet et une distribution de force maximale, un actionneur ventral capable de se comprimer fortement pour s'adapter à l'espace réduit d'un doigt en hyperflexion spastique, et un actionneur palmaire imprimé par stéréolithographie, démontrant le potentiel de géométries complexes en impression 3D. Le gant assemblé a été porté par un utilisateur pilote pour valider les premiers résultats de confort et d'efficacité. L'enjeu principal réside dans la combinaison, au sein d'un seul dispositif, d'une fonction de mobilité et d'une fonction thérapeutique de type massage compressif pour détendre les muscles spastiques, deux besoins généralement traités séparément par les exogants existants. Pour les concepteurs de dispositifs médicaux et les intégrateurs en robotique de réadaptation, cette approche illustre l'intérêt croissant de la personnalisation géométrique par modélisation par éléments finis et fabrication additive, plutôt que des designs génériques à taille unique. Il s'agit toutefois d'un travail à un stade très précoce : un seul utilisateur pilote, pas de données cliniques comparatives, et aucune mesure quantifiée de réduction de la douleur ou du spasme n'est rapportée dans ce résumé, ce qui limite pour l'instant la portée des conclusions à une preuve de faisabilité technique. Ce travail s'inscrit dans la lignée des exogants souples développés ces dernières années pour l'assistance à la préhension chez les patients neurologiques, un domaine où des instituts comme le Wyss Institute ou des laboratoires universitaires de robotique douce ont déjà exploré des actionneurs pneumatiques textiles pour l'AVC. La spécificité ici est la triple architecture d'actionneurs (dorsal, ventral, palmaire) combinée à l'impression 3D par stéréolithographie pour des géométries complexes. Les prochaines étapes attendues, bien que non détaillées dans l'article, porteraient logiquement sur des essais cliniques élargis avec davantage de participants et des mesures objectives de douleur et de spasticité avant d'envisager une commercialisation.

ExosquelettesPaper
1 source
Navigation par objectif à vocabulaire ouvert : généraliser la cartographie sémantique avec CLIP dense
1288arXiv cs.RO 

Navigation par objectif à vocabulaire ouvert : généraliser la cartographie sémantique avec CLIP dense

Des chercheurs ont publié une nouvelle version (v2) de l'article arXiv 2407.09016, qui présente OVExp, un framework d'exploration en vocabulaire ouvert pour la navigation robotique vers des objets-cibles non catégorisés au préalable. Le système s'appuie sur des modèles Dense CLIP pour généraliser la cartographie sémantique, sans recourir à l'inférence coûteuse de grands modèles de langage (LLM) ni à un entraînement intensif par apprentissage par renforcement (RL) de bout en bout. L'innovation centrale est une stratégie de transfert cross-modal sur cartographie sémantique : le réseau apprend d'abord uniquement à partir de texte, puis transfère ces représentations, au moment du test, vers une cartographie multimodale combinant localisation spatiale précise des objets et représentations visuelles généralisables. Les auteurs annoncent une généralisation robuste vers des objets-cibles inédits, validée sur les benchmarks établis d'ObjectNav, malgré un entraînement reposant sur des mises en page textuelles limitées en nombre d'objets. Pour l'industrie robotique et les intégrateurs, ce travail cible un problème concret de coût et de latence : les approches actuelles de navigation en vocabulaire ouvert, qui appellent un LLM à chaque décision ou nécessitent des heures d'entraînement RL par environnement, restent difficiles à déployer à grande échelle sur des robots mobiles autonomes (AMR) ou des plateformes d'inspection. En montrant qu'un réseau de prédiction d'objectifs basé sur une carte sémantique peut généraliser sans réentraînement lourd ni appel LLM en boucle, OVExp propose une alternative aux architectures VLA gourmandes en ressources, ce qui intéresse directement tout acteur cherchant à doter des robots de capacités de recherche d'objets flexibles sans exploser les coûts d'inférence en production. Ce travail s'inscrit dans la lignée des recherches sur ObjectNav, la tâche de navigation vers un objet-cible désigné par catégorie ou par image dans un environnement inconnu, un benchmark phare de la navigation embarquée depuis plusieurs années. Il se positionne face à deux familles de méthodes concurrentes : celles qui exploitent des LLM sans entraînement supplémentaire pour raisonner sur la scène, coûteuses en inférence, et celles qui affinent des politiques par RL de bout en bout, limitées en généralisation hors distribution. En s'appuyant sur CLIP, déjà largement utilisé pour l'ancrage vision-langage, et sur un entraînement texte-seul transférable au moment du test, les auteurs proposent une voie plus économe en ressources. Publié en v2 sur arXiv, l'article reste à ce stade une contribution académique évaluée en simulation, sans annonce de déploiement matériel ni de partenariat industriel.

RecherchePaper
1 source
Système d'exploitation de tubes spatiotemporels sous contraintes d'entrée pour la navigation sûre de systèmes Euler-Lagrange inconnus en environnements dynamiques
1289arXiv cs.RO 

Système d'exploitation de tubes spatiotemporels sous contraintes d'entrée pour la navigation sûre de systèmes Euler-Lagrange inconnus en environnements dynamiques

Une équipe de chercheurs propose un nouveau cadre de contrôle en temps réel permettant à des robots dont la dynamique est inconnue de naviguer en sécurité dans des environnements changeants, tout en respectant les limites physiques de leurs actionneurs. Publiés sur arXiv (2607.08189v1), ces travaux étendent le cadre des « spatiotemporal tubes » (STT), une technique qui définit des corridors de trajectoires garantissant qu'un système atteint une zone cible, évite les obstacles et s'y maintient dans un temps fini, propriété désignée par les auteurs sous l'acronyme FT-RAS (finite-time reach-avoid-stay). La nouveauté consiste à intégrer explicitement les contraintes d'entrée, c'est-à-dire la puissance ou le couple maximal disponible sur les actionneurs, directement dans la conception du contrôleur, avec des conditions de faisabilité vérifiables hors ligne. L'approche a été validée par simulation sur trois types de systèmes Euler-Lagrange, un robot mobile, un quadrotor et un engin spatial, ainsi que par des expériences matérielles sur un robot mobile réel. L'enjeu dépasse la démonstration académique. La plupart des méthodes de navigation sûre reposent soit sur un modèle dynamique précis du robot, rarement disponible en conditions réelles, soit sur une optimisation résolue en continu pendant le mouvement, coûteuse en calcul et difficile à certifier en temps réel. En s'affranchissant de ces deux contraintes, ce cadre dit « approximation-free » vise les cas concrets où les robots opèrent dans des environnements dynamiques avec une puissance d'actionnement limitée, un enjeu direct pour les intégrateurs déployant des AMR ou des drones en entrepôt, où sous-estimer les limites moteur peut compromettre les garanties de sécurité formulées en amont. Le papier se positionne comme une extension du cadre STT existant, en réponse à une limite connue des méthodes de contrôle sûr comparables, comme les fonctions barrières de contrôle ou la commande prédictive, qui exigent généralement soit un modèle fiable soit une résolution d'optimisation embarquée. Il s'agit ici d'un résultat de recherche théorique et expérimentale à petite échelle, sans annonce de déploiement industriel ni de partenaire commercial identifié à ce stade.

RecherchePaper
1 source
Politique de non-fabrication : je ne dois pas inventer de traduction pour un titre d'article sans contexte vérifiable au-delà de ce qui est donné, mais ici la tâche est simplement de traduire le titre fourni, donc je peux procéder
1290arXiv cs.RO 

Politique de non-fabrication : je ne dois pas inventer de traduction pour un titre d'article sans contexte vérifiable au-delà de ce qui est donné, mais ici la tâche est simplement de traduire le titre fourni, donc je peux procéder

Des chercheurs publient sur arXiv (2607.08283) une nouvelle architecture baptisée TFP (Temporally Conditioned Memory-Fusion Policies), conçue pour améliorer les politiques vision-langage-action (VLA) comme π0.5 ou OpenVLA, aujourd'hui limitées par leur caractère réactif : l'action suivante est prédite uniquement à partir de l'observation courante, sans mémoire de la progression de la tâche. TFP ajoute une croyance locale à l'épisode, mise à jour via une dynamique de type Liquid Time-Constant, injectée directement dans le décodeur d'action par flow-matching. Avec un modèle de 3,3 milliards de paramètres, le taux de succès moyen passe de 96,9% à 98,75% sur le benchmark LIBERO et de 91,4% à 93,77% sur LIBERO-plus. Sur le diagnostic MIKASA ShellGameTouch, spécifiquement conçu pour tester la mémoire, TFP atteint jusqu'à 75% de réussite. Les auteurs montrent aussi que les variations du gain d'écriture de la mémoire sont environ six fois plus fortes près des événements de manipulation (contact, relâchement, sous-objectif) que dans les phases stables. Pour l'industrie robotique, ce travail cible un angle mort connu des VLA actuels : la gestion des tâches à étapes, où deux états visuellement identiques nécessitent des actions différentes selon l'historique des interactions, par exemple lors d'occlusions temporaires ou de sous-tâches séquentielles. Un module de mémoire événementielle, plutôt qu'un simple historique passif, pourrait réduire les échecs sur des manipulations complexes en usine ou en logistique, sans nécessiter de refonte complète des backbones VLA existants. Le papier s'inscrit dans la lignée des travaux sur les politiques génératives par flow-matching, après RT-2, OpenVLA et la famille π0 de Physical Intelligence, ainsi que GR00T N2 de NVIDIA. Il s'agit ici d'une contribution de recherche académique évaluée sur des benchmarks de simulation (LIBERO, MIKASA), sans déploiement réel ni intégration annoncée sur un robot commercial. Les auteurs présentent TFP comme un module greffable sur des backbones VLA existants, une piste à confirmer sur des tâches physiques réelles plutôt qu'en simulation.

RechercheActu
1 source
Adaptation de la planification avec pensées vision-langage entrelacées
1291arXiv cs.RO 

Adaptation de la planification avec pensées vision-langage entrelacées

Une équipe de recherche présente APIVOT (Adaptive Planning with Interleaved Vision-Language Thoughts), un planificateur pour robots basé sur un modèle vision-langage (VLM), détaillé dans un article publié sur arXiv le 8 juillet 2026 (référence 2607.08024v1). Le système cible la planification à long horizon, c'est-à-dire des tâches robotiques composées de plusieurs étapes successives, comme des scénarios de cuisine impliquant la manipulation d'objets dans un espace contraint. Sa particularité est d'alterner de façon adaptative entre deux types de raisonnement: du texte pour décomposer les objectifs, sélectionner les objets pertinents et séquencer les actions, et des représentations visuelles générées pour imaginer les états futurs de la scène et vérifier en interne si un plan est géométriquement réalisable, notamment en cas d'espace libre limité ou de risque de collision entre objets. Sur des tâches de cuisine à long horizon, APIVOT surpasse à la fois des VLM généralistes et les frameworks de planification existants, avec l'écart de performance le plus marqué dans les environnements les plus contraints spatialement. Ce résultat s'inscrit dans un débat central pour l'industrie robotique: les modèles vision-langage-action (VLA) et les grands VLM généralistes savent-ils vraiment raisonner sur la géométrie d'une scène, ou se contentent-ils d'un raisonnement sémantique de surface qui échoue dès que l'espace se complique. En montrant qu'un module de vérification visuelle interne améliore concrètement le taux de succès et l'efficacité du raisonnement, APIVOT apporte un argument en faveur d'architectures hybrides plutôt que de VLM purement textuels pour la planification robotique, un enjeu direct pour les intégrateurs qui déploient des bras ou robots mobiles autonomes dans des environnements encombrés. L'article se positionne explicitement par rapport aux VLM généralistes et aux frameworks de planification antérieurs, utilisés comme lignes de base de comparaison, sans toutefois nommer de plateforme robotique commerciale précise ni d'acteur industriel. Il s'agit à ce stade d'une contribution de recherche évaluée en simulation ou en environnement contrôlé de cuisine, sans indication de déploiement produit ni de partenariat industriel annoncé; les auteurs présentent le "modality selection" adaptatif comme la piste principale à explorer pour les futurs systèmes de planification robotique.

RecherchePaper
1 source
FabriVLA : un modèle vision-langage-action léger pour une manipulation précise multi-tâches
1292arXiv cs.RO 

FabriVLA : un modèle vision-langage-action léger pour une manipulation précise multi-tâches

FabriVLA, un modèle vision-langage-action (VLA) léger dédié à la manipulation robotique multi-tâches de précision, vient d'être présenté sur arXiv (2607.08575v1). L'architecture associe un backbone vision-langage InternVL3.5 à une tête d'action par flow-matching, dotée d'une auto-attention filtrée entre les tokens d'action et d'une fusion superficielle des couches du VLM pour enrichir le contexte spatial. Le modèle est entraîné en une seule étape d'optimisation conjointe, à partir d'un VLM pré-entraîné combiné à une tête d'action initialisée aléatoirement. Sur le benchmark Meta-World MT50, qui couvre 50 tâches de manipulation variées, FabriVLA atteint un taux de réussite moyen par palier de 90,0%, avec un VLM d'à peine 1 milliard de paramètres. Ce résultat pèse dans le débat sur la taille optimale des modèles VLA. Jusqu'ici, les meilleures performances en manipulation semblaient réservées aux backbones de plusieurs milliards de paramètres, comme Pi-0 ou GR00T N2. Un modèle compact atteignant 90% de réussite sur un benchmark aussi large que MT50 laisse entrevoir des coûts d'inférence et de déploiement embarqué nettement réduits, un enjeu concret pour les intégrateurs travaillant sur des bras robotiques industriels ou des plateformes mobiles aux ressources de calcul limitées. Cela conforte aussi l'hypothèse qu'une conception spécialisée de la tête d'action, via flow-matching et attention inter-tokens, peut compenser la taille réduite du VLM sous-jacent. FabriVLA s'inscrit dans la lignée des modèles VLA ayant suivi RT-2 et Octo, et plus récemment les approches par flow-matching popularisées par Pi-0 chez Physical Intelligence ou les architectures GR00T N2 de NVIDIA. Le choix d'InternVL3.5, backbone open plus modeste que certains VLM propriétaires concurrents, illustre une tendance à réutiliser des composants déjà optimisés plutôt qu'à entraîner des architectures VLA depuis zéro. À ce stade, les résultats restent une validation en simulation sur Meta-World; la suite logique attendue par la communauté robotique sera la démonstration de ces gains sur des tâches de manipulation réelle, hors benchmark simulé.

IA physiqueActu
1 source
Time-to-collision : évitement dynamique d'obstacles pour robots en environnements non structurés via modèles de vision préentraînés
1293arXiv cs.RO 

Time-to-collision : évitement dynamique d'obstacles pour robots en environnements non structurés via modèles de vision préentraînés

Une équipe de recherche présente une méthode d'évitement d'obstacles dynamiques pour robots mobiles autonomes évoluant en extérieur, dans des environnements non structurés, publiée sur arXiv (arXiv:2607.07885v1). Contrairement aux approches classiques qui nécessitent un entraînement massif spécifique au robot ou des politiques apprises en simulation, cette méthode fonctionne entièrement sur données réelles et évite le problème de transfert simulation-vers-réel. Le pipeline s'appuie sur UniDepth, un modèle pré-entraîné d'estimation de profondeur monoculaire, pour générer des cartes de profondeur denses à partir d'une simple caméra RGB, sans besoin de stéréovision ni de LiDAR au moment de l'inférence. Le système étend le pipeline de correspondance de points-clés SuperPoint et SuperGlue pour suivre des points caractéristiques sur de longues séquences d'images, les projeter en 3D via les intrinsèques caméra et la profondeur estimée, puis calculer un ajustement de faisceaux et un temps avant collision (TTC) par point-clé. Une primitive de mouvement 2D dans le plan au sol permet ensuite d'éloigner le robot du point de rapprochement minimal. Testée sur le jeu de données réel M3ED, la méthode atteint une précision de 0,49 et un rappel de 0,38 pour détecter les images avec un TTC réel inférieur à une seconde, et génère la bonne direction d'évitement dans 84% des détections correctes. Elle détecte au moins une image à risque pour 20 des 22 obstacles physiques uniques testés. L'intérêt principal tient à l'efficacité en données: seulement 74 secondes de données ont suffi pour le réglage des hyperparamètres, contre des milliers d'heures habituellement nécessaires aux méthodes end-to-end apprises. Pour les intégrateurs et décideurs en robotique mobile, cela ouvre une voie de déploiement rapide sans les coûts d'entraînement massif ni les risques de décalage sim-to-real, un problème persistant qui limite la fiabilité des politiques apprises en simulation lors du transfert vers le monde réel. Les chiffres de précision et rappel restent toutefois modestes (0,49 et 0,38), signe que la méthode n'est pas encore prête pour un déploiement critique sans garde-fous supplémentaires, mais la comparabilité et l'interprétabilité de l'approche par rapport aux boîtes noires apprises constituent un argument de poids pour la robotique de sécurité. Cette approche s'inscrit dans une tendance plus large de réutilisation de modèles de vision pré-entraînés à grande échelle (comme UniDepth, SuperPoint, SuperGlue) pour construire des briques robotiques sans réentraînement spécifique, une alternative aux politiques VLA ou aux pipelines de bout en bout qui dominent actuellement la recherche en navigation autonome. Elle se positionne face aux méthodes de simulation-vers-réel largement utilisées chez les acteurs de la robotique mobile et de la navigation extérieure, en misant sur l'interprétabilité plutôt que sur la performance brute. Les auteurs évoquent des perspectives d'amélioration de la précision et du rappel, ainsi qu'une validation plus large sur davantage de types d'obstacles et de conditions environnementales.

RecherchePaper
1 source
FSD-VLN : modélisation duale rapide-lente pour la navigation aérienne vision-langage à long horizon
1294arXiv cs.RO 

FSD-VLN : modélisation duale rapide-lente pour la navigation aérienne vision-langage à long horizon

Des chercheurs publient sur arXiv (papier 2607.08359, juillet 2026) FSD-VLN, une architecture de navigation aérienne guidée par le langage destinee aux drones (UAV) évoluant en environnement inconnu, sans dépendance GPS ni trajectoire préprogrammée. Le système repose sur deux flux asynchrones : un flux "lent" qui extrait des priors sémantiques stables a partir de modèles vision-langage pré-entraines, et un flux "rapide" fonde sur un Diffusion Transformer (DiT) qui modélise les distributions d'actions dans le temps pour générer des commandes de vol cohérentes. Un optimiseur adaptatif sensible au temps a été intègre pour stabiliser l'entrainement sur de longues séquences et limiter les oscillations de gradient. En simulation a grande échelle sur des scenarios de vol a basse altitude, FSD-VLN atteint un taux de réussite de navigation jusqu'a deux fois supérieur aux méthodes de référence sur des scènes inédites, tout en réduisant de plus de 50% le délai d'inférence par action et la durée totale des taches. L'enjeu technique vise juste : les systèmes de navigation aérienne par langage souffrent généralement d'un désalignement entre compréhension multimodale globale et génération d'actions séquentielles, ce qui produit des trajectoires saccadées et une latence de décision pénalisante sur les missions longues. En découplant explicitement raisonnement sémantique et génération de commandes bas niveau, FSD-VLN reprend une logique "système rapide / système lent" déjà explorée cote robotique humanoïde (Pi-0, GR00T N2, Helix) et l'applique au vol de drone, un domaine ou la contrainte de latence est encore plus stricte qu'au sol. Pour les intégrateurs de drones industriels (inspection, logistique, surveillance), c'est une piste crédible pour rendre la navigation instructable en langage naturel viable sur des taches longues, même si les gains annonces restent, a ce stade, mesures uniquement en simulation. La navigation vision-langage (VLN) s'est imposée ces dernières années comme alternative aux systèmes GPS-dépendants, en promettant une interaction homme-machine plus intuitive et une meilleure adaptabilité environnementale, au prix d'une charge de calcul et de coordination bien plus lourde qu'un pilotage classique. FSD-VLN s'inscrit dans une lignée de travaux cherchant a résoudre ce compromis vitesse/compréhension, déjà au cœur des débats sur les modèles VLA en robotique générale. Les auteurs présentent leurs résultats comme un "paradigme pratique" plutôt qu'un système déployé : la prochaine étape logique, non couverte par cette publication, sera la validation en conditions de vol réelles, seule capable de confirmer si les gains constates en simulation résistent au bruit sensoriel et aux perturbations physiques du monde réel.

RechercheActu
1 source
Adaptation biomécanique guidée par la physique de la démarche pour la locomotion humanoïde sur terrains extrêmement pentus
1295arXiv cs.RO 

Adaptation biomécanique guidée par la physique de la démarche pour la locomotion humanoïde sur terrains extrêmement pentus

Des chercheurs présentent HumoSlope, un framework d'apprentissage par renforcement en deux étapes conçu pour la locomotion humanoïde sur pentes raides, détaillé dans un article publié sur arXiv (référence 2607.07830v1). Le constat de départ : avec des formulations de récompense génériques, les politiques de RL convergent souvent vers des démarches lentes et prudentes, en position accroupie et centre de masse abaissé, pour compenser le biais gravitationnel constant imposé par un terrain incliné. La première étape du framework introduit un régularisateur ZMP (Zero Moment Point) adapté à la pente, évalué directement sur le plan de support incliné local plutôt que sur une référence horizontale globale, ce qui établit un a priori d'équilibre cohérent avec le terrain. La seconde étape, baptisée Biomechanical Slope Gait Adapter (BSGA), exploite des descripteurs macroscopiques du terrain comme signaux privilégiés, disponibles uniquement à l'entraînement, pour moduler dynamiquement la hauteur du centre de masse et la coordination des membres inférieurs selon la géométrie de pente estimée, favorisant une propulsion dominée par la hanche en montée et un freinage piloté par le genou en descente. Point notable : l'acteur finalement déployé reste entièrement proprioceptif, sans capteur extéroceptif embarqué. Les essais sim-to-real ont permis une traversée aveugle et continue de pentes herbeuses extérieures atteignant 62,7 % d'inclinaison, soit 32,1 degrés. L'intérêt principal tient à la démonstration qu'un contrôle purement proprioceptif, sans vision ni LiDAR embarqués, peut gérer des pentes extrêmes en conditions réelles extérieures, réduisant la dépendance à une perception embarquée coûteuse et fragile hors environnement contrôlé. Le résultat contredit aussi l'idée qu'un RL générique suffit : sans priors physiques et biomécaniques explicites, les politiques dégénèrent vers des démarches accroupies sous-optimales. Pour les acteurs de l'humanoïde, dont la plupart des déploiements actuels restent cantonnés aux sols plats d'usine ou d'entrepôt, ce travail pointe une voie concrète pour élargir la robustesse en terrain extérieur non structuré, une faiblesse encore largement non résolue du secteur. La locomotion humanoïde par apprentissage par renforcement a fortement progressé ces dernières années sur terrains plats ou discrets, marches et escaliers notamment, mais les pentes raides restent un axe peu exploré comparé à d'autres défis comme les obstacles ou les terrains accidentés. Aucune plateforme robotique commerciale n'est nommée dans l'article, qui reste à ce stade une contribution de recherche validée en simulation puis en conditions réelles. Les suites naturelles évoquées incluent l'intégration à des piles de contrôle plus larges et des tests sur d'autres surfaces comme la neige, le gravier ou la boue.

RecherchePaper
1 source
D-CLIPSE : localisation par consensus distribué avec écoute passive sur échange d'état partagé
1296arXiv cs.RO 

D-CLIPSE : localisation par consensus distribué avec écoute passive sur échange d'état partagé

Le nom complet du papier est D-CLIPSE, pour "Distributed Consensus-based Localization with Passive Listening on Shared State Exchange" (arXiv:2607.07995v1). Il s'agit d'un nouveau cadre de filtrage distribué pour la localisation multi-robots, conçu pour rester cohérent (au sens statistique du terme) tout en limitant la charge de communication entre robots. Le principe: chaque robot embarque son propre filtre et estime à la fois son état et celui de ses voisins, en échangeant de l'odométrie préintégrée ainsi que des états partagés pertinents via communication inter-robot. Contrairement à une architecture centralisée qui fusionnerait de façon optimale toutes les mesures de capteurs de l'équipe mais qui reste rarement viable en pratique (contraintes matérielles, de bande passante et de puissance de calcul), D-CLIPSE cherche à s'en approcher sans passer par un nœud central. Les auteurs valident leur méthode à la fois en simulation et lors d'expériences réelles, avec des résultats de précision et surtout de cohérence proches d'une solution centralisée. L'enjeu dépasse la simple prouesse académique: la localisation multi-robots est un prérequis direct pour la planification de trajectoire et le contrôle dans toute flotte coordonnée, qu'il s'agisse d'AMR en entrepôt, d'essaims de drones ou de robots d'inspection travaillant en équipe. Le problème classique des filtres décentralisés est la sous-estimation de l'incertitude quand les mêmes informations sont comptées plusieurs fois dans le réseau, ce qui rend les estimations de position trop confiantes et potentiellement dangereuses pour la prise de décision en aval. En visant explicitement la cohérence statistique en plus de la précision, et en réduisant le volume de données échangées entre robots, D-CLIPSE s'attaque directement à ce qui limite aujourd'hui le déploiement de flottes robotiques réellement décentralisées à grande échelle, sans dépendre d'une infrastructure de calcul centrale fragile ou coûteuse en latence. Le papier se positionne explicitement contre l'état de l'art actuel des approches décentralisées, dont il revendique dépasser les performances en cohérence tout en restant efficace en communication, un compromis que la littérature peine généralement à tenir simultanément. Les approches distribuées existantes s'appuient typiquement sur des variantes de filtres de Kalman étendus ou des méthodes d'intersection de covariance pour éviter le double comptage d'information, souvent au prix d'une dégradation de précision ou d'un surcoût de calcul. En publiant à la fois des résultats simulés et expérimentaux, les auteurs cherchent à démontrer une applicabilité concrète plutôt qu'un simple gain théorique, ouvrant la voie à des tests sur des flottes physiques plus larges et à une intégration potentielle dans des piles de navigation multi-robots existantes.

RecherchePaper
1 source
Robot binoculaire non préhensile : apprentissage de primitives de manipulation par catégorie
1297arXiv cs.RO 

Robot binoculaire non préhensile : apprentissage de primitives de manipulation par catégorie

BiNoMaP présente un nouveau cadre pour l'apprentissage de primitives de manipulation bimanuelle non préhensile, c'est-à-dire des gestes robotiques qui ne saisissent pas l'objet mais le manipulent par contact, comme pousser, faire pivoter, envelopper ou pousser du bout des doigts. Contrairement à la plupart des travaux antérieurs limités à un seul bras ou dépendants de supports environnementaux favorables (murs, rebords), les chercheurs proposent une configuration bimanuelle générique. Leur méthode se distingue aussi par son approche sans apprentissage par renforcement (RL-free), articulée en trois étapes: extraction de trajectoires de mouvement des mains à partir de vidéos de démonstration en vue égocentrique, puis raffinement de ces trajectoires brutes via un algorithme d'optimisation géométrique pour corriger le bruit de perception et les écarts morphologiques entre humain et robot, et enfin paramétrage des primitives selon des attributs géométriques de l'objet, principalement sa taille, pour permettre une généralisation à des instances inédites. Les primitives ont été testées sur deux plateformes robotiques bimanuelles réelles aux configurations cinématiques distinctes, démontrant un transfert cross-embodiment sans redesign de la structure des compétences. L'intérêt pour l'industrie robotique tient à l'angle mort que ce travail comble: la manipulation non préhensile reste largement sous-exploitée car son caractère riche en contacts la rend difficile à modéliser analytiquement, alors que de nombreuses tâches industrielles ou domestiques (repositionner un objet encombrant, l'orienter, le pousser dans un bac) ne se prêtent pas à une simple préhension. En s'appuyant sur des démonstrations vidéo plutôt que sur du RL coûteux en simulation, l'approche répond aussi à un problème récurrent du secteur, le fossé entre simulation et réalité (sim-to-real gap), en apprenant directement des trajectoires exécutables. Pour les intégrateurs et décideurs B2B travaillant sur des bras bimanuels ou des plateformes humanoïdes à deux bras, cela suggère une voie pour doter les robots de compétences de manipulation plus polyvalentes sans multiplier les cycles d'entraînement par RL ni redessiner les primitives à chaque changement de robot. Ce travail s'inscrit dans la lignée des recherches en apprentissage par imitation à partir de vidéos humaines, un axe de plus en plus exploré face aux limites du RL pur pour les tâches de contact complexes, aux côtés d'approches VLA comme GR00T N2 ou Pi-0 qui visent la généralisation à l'échelle. La publication, une version révisée d'un article initialement déposé sur arXiv (2509.21256), a été validée par des expériences robot réel sur "divers objets et configurations spatiales", sans toutefois préciser de partenaire industriel ou de calendrier de déploiement commercial. Aucun acteur français ou européen n'est mentionné dans cette publication, qui reste à ce stade un travail de recherche académique plutôt qu'un produit prêt à déployer.

RecherchePaper
1 source
X-ACTA : algorithme de distribution de tension du centre analytique étendu pour robots parallèles à câbles fixes et mobiles
1298arXiv cs.RO 

X-ACTA : algorithme de distribution de tension du centre analytique étendu pour robots parallèles à câbles fixes et mobiles

Les robots parallèles à câbles (Cable-Driven Parallel Robots, CDPR) utilisent plusieurs câbles tendus pour déplacer une plateforme mobile, une architecture prisée pour les grandes portées et les charges lourdes, du levage industriel à l'assistance médicale. Leur fonctionnement reste toutefois contraint à un espace de travail dit "faisable en efforts" (Wrench-Feasible Workspace, WFW), une zone où les tensions de câbles peuvent équilibrer les forces externes sans jamais devenir négatives. Un article publié sur arXiv (identifiant 2607.08265) propose une méthode baptisée X-ACTA (eXtended Analytic Center Tension distribution Algorithm), conçue pour piloter ces robots au-delà de ce WFW, notamment lors de manœuvres agressives ou après la rupture d'un câble. La méthode étend l'approche dite du "centre analytique" en conservant des profils de tension continus et différentiables, une convergence rapide vers une solution unique compatible avec un usage temps réel, et des contraintes non linéaires prises en compte nativement. Contrairement aux formulations existantes basées sur le relâchement de câbles ("slack-based"), elle limite les erreurs de torseur (wrench) à une zone marginale du WFW. Les auteurs valident la supériorité de leur méthode en douceur des trajectoires et en précision d'effort via une dominance de Pareto face à l'état de l'art, complétée par des expériences numériques. Cette avancée touche un point aveugle connu des CDPR : la plupart des algorithmes de calcul de tensions fonctionnent bien à l'intérieur du WFW, mais deviennent instables ou imprécis dès qu'un robot en sort, que ce soit volontairement pour étendre sa portée opérationnelle ou accidentellement après une défaillance matérielle. Pour les intégrateurs industriels qui déploient des CDPR fixes ou mobiles dans des environnements exigeants, comme les grands entrepôts, les chantiers ou les applications de levage, disposer d'un contrôleur capable de gérer une perte de câble sans à-coups ni divergence numérique est un enjeu direct de sécurité et de continuité opérationnelle. La différentiabilité garantie par X-ACTA facilite aussi son intégration dans des boucles de commande plus larges, un critère souvent négligé par les méthodes purement géométriques. Le calcul de la distribution des tensions dans les CDPR est un sujet mature en robotique, mais la littérature s'est historiquement concentrée sur l'optimisation à l'intérieur du WFW plutôt que sur la robustesse aux sorties de cet espace. X-ACTA s'inscrit dans une lignée de travaux cherchant à combler ce manque, en se positionnant explicitement contre les méthodes "slack-based" dominantes. L'article, encore au stade de preprint, ouvre la voie à des implémentations sur robots à câbles mobiles et fixes, sans toutefois préciser à ce stade de partenaire industriel ou de calendrier de transfert vers un produit commercial.

RecherchePaper
1 source
TriphiBot : un robot triphibie combinant propulsion FOC et conception excentrique
1299arXiv cs.RO 

TriphiBot : un robot triphibie combinant propulsion FOC et conception excentrique

TriphiBot est un robot capable de trois modes de déplacement, aérien, terrestre et aquatique, présenté dans un article arXiv (2602.01385v2, version révisée). Le design combine une structure de quadricoptère classique avec deux roues passives, sans actionneur supplémentaire dédié à la locomotion terrestre. Les chercheurs ont introduit un centre de gravité excentré qui aligne naturellement la poussée des rotors avec la direction de déplacement au sol, évitant ainsi les mécanismes de transformation mécanique complexes habituellement nécessaires. Pour piloter la propulsion dans l'air comme dans l'eau, deux milieux aux propriétés très différentes, l'équipe a développé un système unifié basé sur le contrôle orienté champ (FOC), qui résout les problèmes d'adéquation du couple moteur et permet une poussée bidirectionnelle rapide et précise. La stabilité du robot et ses transitions entre domaines reposent sur un système de contrôle hybride combinant commande prédictive non linéaire (HNMPC) et PID. Les essais expérimentaux confirment la capacité du robot à se mouvoir dans les trois milieux et à transiter entre eux. L'intérêt de ce travail tient à son adressage d'un angle mort de la robotique multi-domaine: la plupart des robots dits amphibies ou hybrides existants ne gèrent que deux modes de déplacement, et les rares designs triphibiques souffrent soit d'une complexité mécanique élevée, soit d'une propulsion peu efficace au sol. En proposant une architecture minimaliste, sans actionneur additionnel, et un système de propulsion unique capable de s'adapter électroniquement (via FOC) plutôt que mécaniquement aux deux fluides, TriphiBot ouvre une voie pour des robots plus légers et plus simples à fabriquer, potentiellement utiles pour l'inspection, la surveillance environnementale ou les interventions en zones sinistrées mêlant terre, air et eau. Ce travail s'inscrit dans la lignée des recherches sur les robots multi-modaux, où la plupart des designs antérieurs privilégiaient des architectures dédiées à deux milieux avec des mécanismes de transformation spécifiques pour chaque transition. En misant sur l'excentricité du centre de gravité plutôt que sur des pièces mobiles supplémentaires, et sur un contrôle électronique unifié plutôt que sur des propulseurs séparés par milieu, les auteurs positionnent leur approche comme une alternative plus sobre face aux plateformes triphibiques à haute complexité mécanique. L'article, publié en version révisée sur arXiv, reste à ce stade une validation expérimentale en laboratoire, sans indication de déploiement ou de partenariat industriel.

RecherchePaper
1 source
Robot Control : un pré-entraînement vidéo-action natif pour un contrôle robotique généralisable
1300arXiv cs.RO 

Robot Control : un pré-entraînement vidéo-action natif pour un contrôle robotique généralisable

Une équipe de recherche présente, dans un preprint publié sur arXiv (arXiv:2607.08639v1), LingBot-VA 2.0, un modèle fondation vidéo-action conçu spécifiquement pour le contrôle robotique, en succession directe de LingBot-VA. Quatre changements architecturaux structurent cette évolution. D'abord, l'équipe abandonne les VAE classiques axés sur la reconstruction d'image au profit d'un tokenizer visuel-action sémantique, qui aligne les représentations visuelles à la fois sur le sens et sur l'action, ce qui améliore le suivi d'instructions et la précision des gestes lors de l'apprentissage de politiques. Ensuite, le modèle adopte un pré-entraînement causal from scratch plutôt qu'une architecture bidirectionnelle adaptée après coup, pour éviter l'oubli catastrophique observé lors de ce type d'adaptation. Troisième point, un backbone MoE (mixture of experts) épars permet d'augmenter la capacité du modèle sans alourdir l'inférence, condition nécessaire pour du contrôle à haute fréquence. Enfin, un schéma d'inférence asynchrone prédit les futurs états latents en parallèle de l'exécution des actions, en recalant chaque rollout sur la dernière observation via une dynamique prédictive apprise, pour du contrôle en boucle fermée temps réel. Le papier ne précise ni le nombre de degrés de liberté, ni le payload, ni les sites ou volumes de déploiement, ni de calendrier commercial. Cette publication s'inscrit dans la course aux modèles VLA (vision-language-action) pour la robotique généraliste, où l'enjeu central est de dépasser le simple réemploi de générateurs vidéo pensés pour le contenu numérique, souvent inadaptés à la physique du monde réel faute d'ancrage dans l'action. En traitant frontalement l'oubli catastrophique et le coût d'inférence, LingBot-VA 2.0 répond à deux limites fréquemment citées des modèles fondation robotiques actuels: la difficulté à tenir un contrôle réactif et la fragilité des architectures reconverties depuis la génération vidéo pure. LingBot-VA 2.0 vient after LingBot-VA, dans un paysage où rivalisent des modèles comme GR00T N2 (Nvidia), Helix (Figure) ou Pi-0 (Physical Intelligence). Le papier revendique une validation par déploiement réel et une généralisation few-shot sur des tâches de manipulation complexes, mais sans benchmark chiffré ni comparaison directe publiée à ce stade, la portée exacte de ces résultats reste à confirmer par des évaluations indépendantes.

IA physiqueActu
1 source