Aller au contenu principal
Robostral, le robot de Mistral qui navigue en autonomie
IA physiquearXiv cs.RO 

Robostral, le robot de Mistral qui navigue en autonomie

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent Robostral Navigate, un modèle vision-langage de 8 milliards de paramètres dédié à la navigation robotique, entraîné à partir d'un unique flux de caméra RGB monoculaire. Contrairement aux systèmes actuels qui s'appuient sur des capteurs de profondeur, des rigs multi-caméras ou des cartes préconstruites, le modèle prédit directement des points de passage en pointant vers la prochaine position cible dans l'image de la caméra courante. Cette approche, opérant en espace image plutôt qu'en coordonnées propres au robot, le rend robuste aux variations d'intrinsèques caméra et d'échelle de scène. L'équipe a généré 2,4 millions de trajectoires sur 350 000 scènes simulées pour limiter la collecte de données réelles, et développé une recette d'entraînement par mise en cache de préfixes qui réduit le nombre de tokens d'entraînement d'un facteur 22, ramenant le temps d'entraînement de plusieurs mois à quelques jours. Un masque d'attention arborescent empêche le modèle de se reposer sur les actions vérité-terrain précédentes, et de l'apprentissage par renforcement améliore ensuite ses capacités d'exploration et de récupération. Sur les benchmarks R2R-CE et RxR-CE, Robostral Navigate établit un nouvel état de l'art : 77,4% de taux de réussite sur R2R-CE (10,5 points devant la meilleure méthode monoculaire, 5,3 points devant le meilleur système à profondeur ou multi-caméras), et 75,1% sur RxR-CE, devançant toutes les références monoculaires.

L'intérêt pour l'industrie tient au découplage entre performance de navigation et richesse capteur : un seul flux RGB suffit désormais à surpasser des systèmes équipés de capteurs de profondeur, ce qui réduit le coût matériel de déploiement et permet, en théorie, une portabilité directe entre robots à roues, robots à pattes et drones sans recalibration. Cela remet en question l'hypothèse répandue selon laquelle la perception de profondeur explicite serait nécessaire pour une navigation fiable en environnement complexe.

Il s'agit toutefois d'un travail de recherche publié sur arXiv (arXiv:2607.20785v1), entraîné et validé en simulation sur des benchmarks académiques standards de navigation vision-langage (Room-to-Room et Room-Across-Room en environnements continus), sans mention de déploiement sur robot physique ni de partenaire industriel. La méthode s'inscrit dans la lignée des modèles VLA appliqués à la navigation, où la généralisation inter-embodiments et la réduction des coûts de collecte de données réelles restent des enjeux centraux pour un passage à l'échelle en production.

Dans nos dossiers

À lire aussi

FlowPilot : modélisation monde-action en temps réel pour la navigation agile de drones
1arXiv cs.RO 

FlowPilot : modélisation monde-action en temps réel pour la navigation agile de drones

Des chercheurs présentent FlowPilot, un modèle compact de navigation temps réel pour drones, fonctionnant entièrement à bord à partir d'un flux de profondeur. Contrairement aux pipelines classiques qui reconstruisent une carte locale avant d'optimiser une trajectoire, ou aux politiques bout-en-bout sans prédiction de scène, FlowPilot débruite conjointement les observations de profondeur futures et les trajectoires exécutables via du flow matching. L'architecture associe un mélange de transformeurs à double flux, où un expert vidéo et un expert action partagent l'attention pour s'informer mutuellement. Au déploiement, seul le flux d'action est actif : le système produit une trajectoire paramétrée en polynômes de Bernstein de degré 7, l'état courant fixant les points de contrôle initiaux et le réseau prédisant cinq points libres, garantissant une continuité C² avec vitesse, accélération et jerk en forme close. Le modèle est entraîné sur une pyramide de données à trois niveaux (simulation haut débit, simulation photoréaliste, données réelles embarquées). En simulation, il surpasse les méthodes d'apprentissage et d'optimisation concurrentes face à un encombrement croissant et des vitesses jusqu'à 8 m/s. Sur un quadricoptère physique, le pipeline perception-action complet tourne en moins de 18 ms sur un Jetson Orin NX, avec des vols jusqu'à 5,5 m/s en intérieur encombré et en forêt, sans assistance extérieure. Cette démonstration cible un point de friction connu de l'autonomie aérienne : l'écart entre performance en simulation et robustesse réelle en environnement encombré à haute vitesse. En fusionnant prédiction de scène et génération de trajectoire dans un seul modèle plutôt qu'en deux étages séparés, FlowPilot transpose à l'aérien une logique de "world-action model" jusqu'ici surtout explorée en manipulation robotique au sol. Le budget de calcul, 18 ms de bout en bout sur du matériel embarqué léger, intéresse directement les intégrateurs d'inspection industrielle ou de logistique par drone, où poids et consommation du calculateur restent contraignants. L'écart entre les 8 m/s simulés et les 5,5 m/s atteints en vol réel rappelle toutefois que la validation reste celle d'un seul papier académique, sans comparaison indépendante ni déploiement commercial. Ce travail s'inscrit dans la recherche sur la navigation de drones par apprentissage, où les approches oscillent entre cartographie-puis-optimisation et politiques bout-en-bout. Les modèles par flow matching, popularisés récemment en génération d'image et en robotique de manipulation à l'image des politiques VLA telles que Pi-0 ou GR00T N2, sont ici transposés à la navigation aérienne pour produire des trajectoires lisses et dynamiquement réalisables. Publié sur arXiv fin juillet 2026 en prépublication non relue par les pairs, l'article ne mentionne aucune affiliation industrielle ni calendrier commercial. Les suites attendues porteraient sur l'extension à des vitesses et environnements plus variés, et sur une comparaison indépendante face aux meilleures méthodes de navigation par optimisation déjà déployées sur drones commerciaux.

IA physiqueActu
1 source
Mistral AI lance Robostral Navigate
2Robot Magazine FR 

Mistral AI lance Robostral Navigate

Reformuler ce communiqué en article journalistique neutre, en signalant que les chiffres proviennent uniquement de la communication Mistral, sans donnée sim-to-real indépendante. --- Mistral AI a présenté Robostral Navigate, un modèle de navigation robotique construit selon une architecture Vision-Language-Action : une caméra RGB classique et des instructions en langage naturel remplacent la combinaison habituelle LiDAR, caméras de profondeur, centrale inertielle et cartographie SLAM. Le modèle compte 8 milliards de paramètres, une taille pensée pour tourner sur des plateformes embarquées à ressources limitées plutôt que sur des clusters distants. Selon Mistral, l'entraînement s'est appuyé sur près de 400 000 trajectoires générées dans plus de 6 000 environnements simulés, couvrant bureaux, entrepôts, usines et logements. En fonctionnement, le pipeline doit interpréter le flux vidéo, comprendre la consigne, localiser la cible, planifier une trajectoire, éviter les obstacles fixes et mobiles, et corriger sa position en continu, l'ensemble devant tenir dans un budget de quelques dizaines de millisecondes par cycle de décision. L'intérêt pour les fabricants de robots mobiles tient d'abord au coût : une caméra RGB se chiffre en dizaines d'euros contre plusieurs centaines, voire milliers d'euros pour un LiDAR industriel, ce qui allège aussi bien la facture matérielle que l'intégration logicielle. Sur le fond, Robostral Navigate teste à l'échelle de la navigation pure une hypothèse déjà explorée côté manipulation par les modèles VLA : qu'un système entraîné majoritairement en simulation puisse généraliser à des environnements réels variés sans empiler les capteurs. C'est une promesse à vérifier plutôt qu'un résultat acquis, les chiffres de 400 000 trajectoires et 6 000 environnements provenant uniquement de la communication de Mistral, sans benchmark tiers ni donnée publiée sur l'écart sim-to-real en conditions réelles. Pour les intégrateurs et décideurs industriels, la question qui reste ouverte est celle de la robustesse hors simulation, dans des lieux encombrés, mal éclairés ou changeants. Mistral AI, jusque-là identifiée aux grands modèles de langage (Mistral Large, Mixtral) et positionnée comme l'alternative européenne face à OpenAI et Google, franchit ici son premier pas affiché vers la Physical AI, terrain déjà occupé par NVIDIA avec GR00T N2, Figure AI avec Helix, ou Physical Intelligence avec Pi-0. L'entreprise française n'a pas communiqué de calendrier de déploiement industriel ni de partenariat matériel identifié à ce stade ; Robostral Navigate reste, en l'état des informations disponibles, une annonce de capacité logicielle plutôt qu'un produit livré ou testé en flotte réelle.

UEMistral AI, entreprise française et alternative européenne aux géants américains de l'IA, franchit son premier pas vers la robotique physique, ce qui renforce le positionnement technologique de la France et de l'UE face aux acteurs américains et chinois du secteur.

FR/EU ecosystemeActu
1 source
Un robot qui apprend à partir de vidéos courtes en 29 secondes : HOST, la nouvelle recette d'IA incarnée de X Square Robot
3Pandaily 

Un robot qui apprend à partir de vidéos courtes en 29 secondes : HOST, la nouvelle recette d'IA incarnée de X Square Robot

Le robot humanoïde chinois X Square Robot a mis en open source HOST, un framework d'apprentissage par vidéo qui permet à un robot de reproduire une tâche dès sa première tentative, après avoir simplement regardé un clip de démonstration de 29 secondes. Sur ce test, HOST atteint un taux de réussite de 62%, contre 38% pour la méthode standard actuelle qui nécessite environ 50 démonstrations expertes et quatre heures de fine-tuning. Le système repose sur deux modules: un module de vision qui reconstruit la scène observée du point de vue du robot, et un module d'action qui calcule la trajectoire articulaire correspondante, le tout aligné par un mécanisme de dynamic time warping qui réduit l'erreur d'alignement d'un facteur dix environ. Fondée fin 2023 à Pékin, X Square Robot a levé plus d'un milliard de yuans sur huit tours de table, avec Meituan Strategic Investment, Alibaba Cloud, Lenovo Capital et Delian Capital parmi ses investisseurs. L'enjeu dépasse la simple prouesse technique: la collecte de données par téléopération, aujourd'hui dominante dans le secteur, repose sur des ingénieurs équipés de casques VR qui pilotent un bras robotique geste par geste, des dizaines de fois, pour chaque tâche. Un robot de collecte coûte plusieurs centaines de milliers de dollars et chaque démonstration peut dépasser cent dollars en coût marginal, un modèle que même les "fabriques de données" en Inde ou les travailleurs à temps partiel des zones rurales chinoises ne parviennent pas à rendre réellement scalable. En inversant la logique, c'est à dire en apprenant à l'inférence plutôt qu'en réentraînant hors ligne sur des données massives, HOST attaque directement ce goulot d'étranglement économique. Si l'approche tient à l'échelle au-delà du benchmark de recherche, elle rebattrait les cartes pour les intégrateurs et décideurs industriels en réduisant drastiquement le coût d'acquisition de nouvelles compétences robotiques, un argument central dans la course actuelle entre laboratoires embodied-AI. Il faut toutefois noter que le chiffre de 62% reste une mesure de recherche sur benchmark, pas une performance de déploiement en conditions réelles, et l'article ne précise pas la diversité des tâches testées ni les conditions d'évaluation. L'approche s'inspire de la théorie cognitive de la simulation, selon laquelle l'humain répète mentalement le résultat visé avant d'agir, une logique que l'équipe chinoise transpose à l'apprentissage robotique en remplaçant l'imitation articulation par articulation par une reconstruction de la scène finale suivie d'un calcul de trajectoire. Le choix de l'open source vise explicitement à capter l'attention des développeurs comme tremplin vers des pilotes en entreprise, une stratégie de positionnement qui s'inscrit dans la compétition plus large entre approches VLA telles que Pi-0, GR00T N2 ou Helix, où la question du passage à l'échelle depuis la démonstration jusqu'au déploiement industriel reste largement ouverte.

IA physiqueOpinion
1 source
Autonomique déploie des robots semi-humanoïdes et de l'IA chez un équipementier automobile canadien de rang 1
4Robotics Business Review 

Autonomique déploie des robots semi-humanoïdes et de l'IA chez un équipementier automobile canadien de rang 1

Autonomique Inc., startup californienne fondée en 2024 et issue des laboratoires de SRI International (Menlo Park), annonce le passage en déploiement industriel de sa plateforme d'IA physique chez F&P Manufacturing, équipementier automobile Tier 1 canadien basé à Tottenham, Ontario, spécialisé dans les systèmes de chassis et de suspension. La société ne commercialise pas de robot propre mais une couche logicielle hardware-agnostique conçue pour ajouter dextérité et raisonnement à des bras industriels existants, issus notamment de Denso, Staubli et RealMan Robotics. Son PDG, Vikrant Tomar, docteur en IA et ancien fondateur de Fluent.ai, insiste sur la distinction entre démonstration et production : les métriques annoncées (temps de cycle, précision, réduction de rebuts) restent à ce stade déclaratifs, sans données publiques indépendantes pour les valider. Le déploiement chez F&P est présenté comme un pilote progressant vers une industrialisation, non comme un rollout à l'échelle déjà opérationnel. L'intérêt technique réside dans l'architecture dite "généraliste-spécialiste" : plutôt qu'un unique modèle vision-langage-action (VLA) monolithique, la plateforme orchestre dynamiquement des compétences déterministes (apprentissage par renforcement en ligne pour les insertions de précision, par exemple) et des modèles VLA plus flexibles pour gérer les anomalies ou les tâches non prévues. Cette approche répond à une critique structurelle du secteur : les VLA génériques peinent à tenir les cadences et la répétabilité exigées en production réelle. Si Autonomique tient ses promesses chez F&P, ce serait un signal concret que le sim-to-real gap peut être comblé sur des workflows multi-étapes en environnement industriel contraint, sans recours à des end-effectors coûteux comme les mains robotiques polyarticulées. Autonomique s'appuie sur des licences de technologies SRI, dont le système de télé-opération déjà utilisé par l'armée américaine pour le déminage et par des laboratoires pharmaceutiques en salles blanches, ce qui donne à sa base de données d'entraînement une provenance inhabituelle pour une startup robotique. Ses concurrents directs dans le segment "software layer for industrial arms" incluent Covariant (racheté par Amazon), Machina Labs ou Physical Intelligence (Pi-0), tandis que des acteurs comme 1X Technologies ou Figure AI ciblent l'humanoïde complet, segment qu'Autonomique juge prématuré pour la production. Les prochaines étapes annoncées : extensions de partenariats avec Holiday Robotics et Rainbow Robotics, discussions en cours avec des développeurs d'humanoïdes, et réplication du blueprint F&P sur d'autres lignes et sites. Aucun acteur européen ou français n'est impliqué à ce stade.

💬 La couche logicielle sur bras existants, c'est le seul modèle qui colle vraiment avec la réalité des usines : pas besoin de remplacer le hardware. L'architecture généraliste-spécialiste d'Autonomique (déterminisme pour les tâches de précision, VLA pour gérer les exceptions) s'attaque enfin au problème que personne n'avait résolu proprement en prod réelle. Reste à valider les chiffres sur la durée, parce que pour l'instant c'est Autonomique qui parle d'Autonomique.

IA physiqueOpinion
1 source