
G0.5 : un flux autorégressif unique pour le raisonnement et l'action des robots
G0.5, publie en aout 2026 sur arXiv (2608.11739), est un modèle Vision-Language-Action (VLA) dont un décodeur transformeur unique génère raisonnement et tokens d'action sous un seul objectif, au lieu de séparer un VLM pré-entraine et un expert d'action entraine a part par flow-matching. Trois briques le rendent tenable a l'échelle d'un modèle de fondation : un tokenizeur d'action apprenable traduisant des actions robotiques hétérogènes dans un vocabulaire commun entre robots, un flux de chaine de pensée natif mêlant décomposition de taches, ancrage des objets et indices d'action, et un module de mémoire visuelle injectant plusieurs secondes d'historique.

















































