RynnBrain 1.1 : le cerveau VLA d’Alibaba DAMO cuisine le steak sur Unitree G1 et Astribot-S1

Robot Unitree G1 pilote par RynnBrain 1.1 cuisine un steak en cuisine moderne

Alibaba DAMO Academy vient de publier RynnBrain 1.1, une nouvelle version de son modèle VLA (Vision-Language-Action) conçu pour piloter des robots humanoïdes sur des tâches longues et complexes. Particularité notable : le modèle tourne désormais sur trois plateformes distinctes, le Unitree G1, l’Astribot-S1 et le Wuji, avec des démonstrations en une seule prise sans intervention humaine.

Trois tailles de modèle, un seul cadre d’entraînement

RynnBrain 1.1 se décline en trois variantes : 2B, 9B et 122B-A10B paramètres. Ce dernier format mélange architecture dense et mixture-of-experts pour trouver un équilibre entre performance et coût d’inférence. Les trois modèles partagent le même cadre d’entraînement spatio-temporel et de grounding physique, qui permet au robot de percevoir son environnement, de raisonner sur les objets, de se localiser dans l’espace et de planifier ses gestes en temps réel.

Concrètement, le modèle gère simultanément la perception incarnée, le raisonnement spatial, la localisation, l’ancrage aux objets physiques et la planification d’actions. C’est ce que les ingénieurs d’Alibaba DAMO désignent par « unified spatiotemporal and physical grounding training framework », une approche qui vise à éliminer la discontinuité habituelle entre la vision du robot et ses commandes motrices.

Des démonstrations en cuisine et en service

La page projet de RynnBrain 1.1 présente trois démonstrations enregistrées en une prise, sans téléopération ni coupure : livraison de repas, cuisson d’un steak et une troisième tâche de manipulation. Sur le Unitree G1, le robot exécute les gestes de cuisine avec une précision suffisante pour manipuler une poêle chaude et retourner la viande. Sur l’Astribot-S1 et le Wuji, les scénarios de service et de transport sont similaires.

Ces démonstrations en « long-horizon » sont un marqueur de maturité pour les modèles VLA. La plupart des robots actuels peinent à enchaîner plus de cinq ou six gestes distincts sans replanning. RynnBrain 1.1 vise à repousser cette limite en intégrant directement le grounding physique dans la boucle de planification.

Pourquoi c’est important

L’approche multi-plateformes d’Alibaba DAMO est stratégique. En faisant tourner le même modèle sur des robots de constructeurs différents (Unitree, Astribot, Wuji), l’équipe démontre une généralisation qui était difficile à obtenir avec les méthodes précédentes. Le modèle 122B-A10B ouvre la voie à des déploiements en usine ou en restauration, où la répétabilité et la robustesse sont prioritaires sur la latence.

Reste à voir si ces performances se maintiennent hors conditions contrôlées. Les démos one-take sont impressionnantes, mais le secteur attend des résultats sur des tâches totalement inédites et dans des environnements non structurés. RynnBrain 1.1 constitue en tout cas une référence technique solide pour la robotique VLA chinoise en 2026.

Fiches Robodex citées

Le briefing RoboActu

L’essentiel de la robotique, une fois par semaine.

Une sélection courte des annonces, usages et robots à suivre.

Continuer sur ce sujet

Comparer les robots