
InternVLA-A1.5 : unifier compréhension, prévision latente et action pour une généralisation compositionnelle
Des chercheurs présentent InternVLA-A1.5, un modèle unifie de manipulation robotique qui embarque a la fois les capacités sémantiques d'un VLM preentraine et une prévision physique du futur, le tout dans une seule politique de contrôle. L'architecture conserve un backbone VLM natif qui continue de s'entrainer sur des taches de question-réponse visuelle et de prédiction de sous-taches, auquel est attache un expert léger dédié a la génération continue d'actions. L'innovation clé porte sur la prévision du futur, reformulée comme un problème de "latent-querying": un petit ensemble de jetons de prévision apprenables condense les éléments du futur pertinents pour la tache en un code latent compact, sous la supervision d'un modèle de génération vidéo preentraine et gelé, sans jamais apprendre de génération au niveau du pixel. La branche vidéo est abandonnee au moment de l'inférence, ce qui préservé le contrôle en temps réel. Preentraine sur 1,2 million d'épisodes robotiques et 3 millions d'échantillons multimodaux, InternVLA-A1.5 obtient les meilleurs résultats globaux sur six benchmarks de simulation, et affiche en conditions réelles la généralisation compositionnelle la plus solide sur des combinaisons d'instructions inédites.
Ce travail s'attaque a un problème récurrent des modèles VLA unifies: entrainer conjointement compréhension sémantique et prédiction d'action tend a dégrader les priors du VLM d'origine, créé des interférences entre objectifs hétérogènes, et oblige souvent a réapprendre la prévision visuelle depuis zero en espace pixel, sans exploiter les modèles de génération vidéo déjà entraines. En évitant cette dernière étape couteuse tout en gardant un contrôle temps réel, l'approche laisse entrevoir, pour les intégrateurs et les équipes de recherche en robotique, une voie pour combiner raisonnement de haut niveau et dynamique physique sans sacrifier la vitesse d'exécution ni la robustesse face a des consignes formulées différemment de celles vues a l'entrainement, un point sensible pour tout déploiement commercial au-delà de la démo.
Le papier s'inscrit dans la vague des modèles vision-langage-action généralistes portée ces deux dernières années par des acteurs comme Physical Intelligence avec pi-0, Nvidia avec GR00T N2, ou Figure AI avec Helix, tous confrontes au même arbitrage entre sémantique préservée et dynamique apprise. InternVLA-A1.5 reste pour l'instant une contribution de recherche publiée sur arXiv, évaluée sur benchmarks de simulation et expériences réelles limitées, et non un produit déployé a grande échelle; la suite logique serait une validation sur des plateformes robotiques tierces et des taches manufacturières plus complexes pour confirmer que les gains de généralisation tiennent hors laboratoire.
Dans nos dossiers




