Aller au contenu principal
Du chaos à l'ordre : révolution de la fourniture de données et structuration des compétences pour l'IA incarnée
Chine/Asie36Kr 

Du chaos à l'ordre : révolution de la fourniture de données et structuration des compétences pour l'IA incarnée

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Lors de la conférence AI+ Industry 2026 de Beijing Yizhuang, Xu Liangwei, CTO et cofondateur de Zhiyu Jishi (智域基石), a exposé un pipeline de compilation de données en cinq couches destiné à l'intelligence incarnée (embodied AI). Son argument central: la loi de mise à l'échelle (Scaling Law) qui sous-tend les grands modèles de langage ne se transfère pas aux robots. Un LLM peut absorber des textes hétérogènes en masse, mais un robot opérant dans le monde physique nécessite des données multimodales couplées dans le temps et dans l'espace, où qualité et traçabilité priment sur le volume brut. Le pipeline de Zhiyu Jishi comprend cinq étapes séquentielles: contrôle qualité des données brutes, alignement spatio-temporel, extraction sémantique et causale (séquence contexte-action-conséquence), traitement à grande échelle avec indexation multi-dimensionnelle, et livraison aux équipes de modèles. Xu Liangwei précise que ce pipeline s'applique indifféremment aux architectures VLA (Vision-Language-Action, apprentissage par imitation) et aux world models, les deux paradigmes convergeant vers le même besoin: des données physiques structurées et tracées.

L'enjeu concret pour les intégrateurs et les équipes de modèles est la traçabilité des défaillances terrain. En 2026, certains robots commencent à passer de pilotes laboratoire à des déploiements industriels en petit lot, et les équipes peinent à relier un comportement anormal à un sample d'entraînement défaillant. Xu Liangwei précise que les modèles fixent le plafond de capacité d'un robot, mais que la qualité des données dans les cas d'échec, de reprise et de retry conditionne la fiabilité en environnement dégradé. Sans cette traçabilité bout en bout, la boucle fermée données-modèle-terrain-données ne peut pas converger à l'échelle industrielle, rendant impossible le passage du petit lot à la production réelle.

Zhiyu Jishi se positionne dans une niche émergente, les "data foundry" pour l'embodied AI, distincte des services de labeling classiques par la dimension temporelle et multimodale des données robotiques. Le discours de Xu Liangwei s'oppose implicitement au modèle fragmenté actuel, où fabricants de plateformes matérielles, développeurs de modèles et intégrateurs industriels produisent chacun leurs données en silo. Sa proposition est de structurer un écosystème à trois acteurs avec une séparation claire des responsabilités, comparable à une couche d'infrastructure partagée. La présentation ne comporte aucun chiffre de déploiement vérifiable ni de client cité, ce qui la positionne davantage comme une communication de positionnement stratégique que comme un bilan d'exécution. La suite annoncée est l'ouverture de ce pipeline à l'ensemble de l'écosystème robotique chinois, sans calendrier précis communiqué.

À lire aussi

Kaiwang Data, startup d'infrastructure de données pour l'IA incarnée, lève plus de 100 millions de RMB
1TechNode 

Kaiwang Data, startup d'infrastructure de données pour l'IA incarnée, lève plus de 100 millions de RMB

Kaiwang Data (恺望数据), startup chinoise spécialisée dans l'infrastructure de données pour l'IA incarnée, vient de boucler un tour de financement stratégique de plus de 100 millions de yuans (environ 13,9 millions de dollars). L'opération a été menée conjointement par le Beijing E-Town Industrial Upgrade Fund, Huafang Capital et Skyline Capital (天际资本), avec la participation de plusieurs entreprises de robotique : Lumai Robotics, Songyan Power, Zizibianliang Robotics et Mifeng Technology, cette dernière affiliée à AGIBOT. Kaiwang Data collecte, annote et gère des données multimodales destinées à la conduite autonome, aux world models et aux robots humanoïdes : vidéos en vue subjective de mains nues, données de gants tactiles, manipulations par pinces et prises de vue panoramiques. L'entreprise affirme produire désormais environ 100 000 heures de données exploitables par mois, un volume qu'elle dit stabilisé, et avoir signé des accords d'achat en gros avec plusieurs grands groupes. Ce tour de table illustre un phénomène qui prend de l'ampleur dans l'écosystème robotique chinois : la donnée d'entraînement devient elle-même un marché à part entière, distinct de la fabrication des robots. Les modèles vision-langage-action (VLA) et les world models qui alimentent les humanoïdes de nouvelle génération réclament des volumes massifs de données de manipulation réelle, coûteuses et lentes à collecter en interne. Que des fabricants comme Songyan Power ou une filiale d'AGIBOT investissent directement dans un fournisseur de données suggère une logique d'intégration verticale défensive, destinée à sécuriser l'approvisionnement plutôt qu'à le laisser au marché spot. Les chiffres avancés par Kaiwang, notamment les 100 000 heures mensuelles, restent toutefois auto déclarés et non audités. Les fonds levés serviront à développer une plateforme d'échange de données, à faire progresser la technologie des world models et à étendre la capacité de collecte dans des environnements commerciaux, industriels et domestiques. L'opération s'inscrit dans une vague plus large d'investissements chinois dans l'infrastructure de l'IA incarnée, portée notamment par l'écosystème AGIBOT, alors que Pékin cherche à structurer une chaîne de valeur complète, de la donnée brute jusqu'au robot humanoïde déployé sur le terrain.

Chine/AsieActu
1 source
L'ex-directeur tech de Meituan crée un modèle du monde pour la restauration à l'ère de l'IA incarnée
236Kr 

L'ex-directeur tech de Meituan crée un modèle du monde pour la restauration à l'ère de l'IA incarnée

AtomBite.AI (元节智能), startup chinoise d'intelligence incarnée, vient de boucler un tour d'amorçage de plusieurs dizaines de millions de yuans mené par le fonds Yinno Innovation, avec la participation du Shuimu Tsinghua Alumni Seed Fund. La société cible un terrain peu médiatisé mais à forte récurrence : la cuisine professionnelle de restauration et la chaîne d'exécution des commandes de livraison de repas. Son équipe fondatrice porte l'ADN de Meituan : Wang Dong (CEO, docteur en informatique) y dirigeait l'ingénierie de Meituan Waimai, supervisant mille ingénieurs et des algorithmes traitant des dizaines de millions de commandes quotidiennes ; Li Tao pilotait les systèmes algorithmiques et data de la même division ; Li Haozhe, troisième co-fondateur, est un entrepreneur en série à dimension internationale. La technologie centrale est un "World Action Model" (WAM) dédié à la restauration, décliné en architecture VT-WAM combinant vision et retour tactile, en rupture explicite avec l'approche VLA (Vision-Language-Action) dominante dans le secteur. Un premier déploiement pilote en cuisine professionnelle est attendu d'ici fin 2026, avec plusieurs lettres d'intention déjà signées avec des opérateurs nationaux et internationaux. Le choix de la restauration résulte d'un audit de plusieurs mois conduit en Amérique du Nord et à Singapour. Wang Dong y a identifié un triptyque rare : besoin universel (même problématique en Chine, aux États-Unis et en Asie du Sud-Est), ROI mesurable pour le restaurateur (réduction des erreurs de commande, gains à l'emballage, allègement de la masse salariale) et cycle de décision court chez les PME, contrairement aux scénarios domestiques ou médico-sociaux. L'industrie est structurellement sous pression : hausse soutenue des salaires horaires en Amérique du Nord, turnover chronique et difficultés de recrutement persistantes en Chine. Sur le plan technique, AtomBite.AI conteste le paradigme VLA en affirmant que le contrôle moteur réel ne passe pas par le langage mais par la compréhension visuelle et physique. L'approche VT-WAM fusionne ces deux modalités dans un espace latent pour prédire les conséquences de contact avant exécution : inférer si un gobelet est plein ou chaud modifie les forces de friction et le centre de gravité lors de la saisie, ce que la vision seule ne permet pas de capturer. AtomBite.AI prend le contre-pied de la stratégie "modèle universel d'abord" adoptée par la plupart de ses concurrents. Les opérations répétitives de la cuisine, emballage, tri et transfert de commandes, génèrent un flux naturel de données d'interaction physique difficile à reproduire en simulation, alimentant un cycle d'amélioration continue du modèle depuis le terrain réel. L'architecture se décompose en trois couches : modèle monde incarné pour la perception et la planification d'actions, moteur d'orchestration des tâches, et couche matérielle combinant composants propriétaires et hardware standard. Les gestes récurrents s'exécutent en local sur des modèles légers pour limiter la latence ; le cloud gère les exceptions comme un ingrédient manquant ou un objet détecté hors place. Sur ce segment, Miso Robotics aux États-Unis et Keenon Robotics en Chine sont déjà présents, sur des périmètres différents (friture automatisée, service en salle). La feuille de route prévoit une extension progressive vers le tri, la logistique interne de restaurant, et à terme la cuisine domestique.

Chine/AsieActu
1 source
Xiaomi présente Xiaomi-Robotics-U0 pour l'IA incarnée et la génération de robots
3TechNode 

Xiaomi présente Xiaomi-Robotics-U0 pour l'IA incarnée et la génération de robots

Xiaomi a dévoilé mercredi Xiaomi-Robotics-U0, un modèle de fondation multimodal autorégressif de 38 milliards de paramètres conçu pour l'IA incarnée (embodied AI). L'entreprise affirme que ce modèle unifie quatre capacités au sein d'un même framework : la génération de scènes pour robots, le transfert de comportements robotiques, la génération de vidéos d'interaction robot-environnement, et la génération et l'édition d'images à usage général. Concrètement, le système peut créer des environnements exploitables par des robots à partir de simples prompts textuels, adapter des trajectoires robotiques existantes à de nouvelles scènes tout en préservant le mouvement d'origine, produire des vidéos d'interaction à partir d'instructions de tâches, et exploiter des connaissances visuelles à l'échelle d'internet pour des applications d'IA incarnée. L'annonce a été rapportée par TechNode. Cette annonce s'inscrit dans une tendance de fond du secteur robotique : l'utilisation de modèles génératifs pour produire des données d'entraînement synthétiques et combler l'écart entre simulation et réalité, un problème central pour les acteurs du VLA (vision-language-action) comme Pi-0 de Physical Intelligence ou GR00T N2 de Nvidia. Si la promesse de générer des environnements et trajectoires synthétiques à la demande tient ses promesses, elle pourrait réduire le coût de collecte de données réelles, un goulot d'étranglement majeur pour l'entraînement des robots humanoïdes et bras manipulateurs. Toutefois, à ce stade, il s'agit d'une annonce de capacités techniques, sans démonstration publique détaillée ni benchmark comparatif, ni précision sur un déploiement matériel réel. Xiaomi investit depuis plusieurs années dans la robotique, avec son robot quadrupède CyberDog et des incursions dans les véhicules autonomes et l'IA embarquée. Ce modèle de 38 milliards de paramètres le positionne face aux laboratoires spécialisés en IA incarnée tels que Physical Intelligence, Figure AI ou Nvidia, ainsi que face aux géants chinois de la tech comme Baidu ou Alibaba, également actifs sur les modèles fondation pour la robotique. Aucune date de disponibilité, de partenariat industriel ou de déploiement pilote n'a été précisée à ce stade.

Chine/AsieActu
1 source
Tencent Robotics X en open source de trois modèles fondation incarnés : le scientifique en chef Zhang Zhengyou explique l'architecture cérébrale à trois couches pour la vitesse de réaction des robots
4Pandaily 

Tencent Robotics X en open source de trois modèles fondation incarnés : le scientifique en chef Zhang Zhengyou explique l'architecture cérébrale à trois couches pour la vitesse de réaction des robots

Tencent Robotics X Laboratory a présenté au salon WAIC 2026 trois modèles fondationnels d'intelligence incarnée, désormais disponibles en open source : Hy-Embodied-VLM-1.0, dédié à la compréhension spatiale et des scènes, Hy-Embodied-RxBrain-1.0, chargé de la planification cognitive, et Hy-Embodied-VLA-0.5, qui traduit des objectifs de haut niveau en commandes motrices continues. Le chercheur en chef Zhang Zhengyou a expliqué que cette architecture à trois couches répond à un problème mal traité par les approches VLA actuelles : le monde physique fonctionne à plusieurs échelles temporelles, et l'intelligence robotique doit donc opérer à des fréquences différentes selon la tâche. Cette conclusion découle d'un échec concret : une tentative de faire tourner des capacités robotiques sur OpenClaw a produit des dizaines de secondes de latence, alors qu'un délai cognitif de seulement 2 à 3 secondes est déjà problématique pour un robot physique. Tencent a précisé que Hy-Embodied-VLA est entré en phase de test en production dans une usine de produits chimiques ménagers, sur des lignes d'assemblage multi-références à petits lots, avec un temps de cycle par pièce inférieur à 6 secondes et une capacité d'adaptation à une nouvelle référence après seulement 8 heures de collecte de données et de réentraînement. Ce déploiement en usine, avec objets positionnés aléatoirement, éclairage variable et interruptions de production, marque une bascule notable : Tencent affirme viser un taux d'échec quasi nul en conditions réelles plutôt qu'un score de démonstration, Zhang Zhengyou allant jusqu'à qualifier de "valeur quasi nulle" une démo qui obtiendrait 80 à 90 points sans déploiement effectif, une formule qui mérite d'être lue comme une critique implicite de nombreuses vitrines du secteur plutôt qu'un résultat mesuré indépendamment. Pour les intégrateurs et décideurs industriels, l'apport le plus concret est ailleurs, dans Hy-Embodied-RxBrain : au lieu de faire communiquer les modules par du texte, comme le faisaient les précédents systèmes Tairos, ce modèle "imagine" un état visuel du monde après chaque sous-tâche, ce qui règle le goulot d'étranglement du langage pour décrire des relations spatiales. Tencent le présente prudemment comme un modèle cognitif incarné plutôt qu'un véritable "world model", le secteur n'ayant pas encore convergé vers une architecture unifiée en la matière. Cette annonce s'inscrit dans la course mondiale aux modèles vision-langage-action, aux côtés d'acteurs comme Tesla, Figure AI, Physical Intelligence ou NVIDIA, dans un contexte où l'écart entre démonstration et exploitation industrielle reste le principal point de friction. En ouvrant l'ensemble de sa pile Tairos, incluant les trois modèles, Tencent met à disposition des développeurs et industriels une architecture pensée pour la fréquence, issue directement de ses propres échecs et itérations, sans toutefois communiquer de calendrier précis pour un déploiement à plus grande échelle au-delà du site pilote chimique.

Chine/AsieActu
1 source