Gemini Robotics 2 : Google DeepMind offre le contrôle du corps entier aux robots humanoïdes

Gemini Robotics 2 Apptronik Apollo 2 humanoide controle corps entier Google DeepMind

Google DeepMind a lancé Gemini Robotics 2, une suite de trois modèles d’IA qui donne aux robots humanoïdes un contrôle complet du corps, de la tête aux pieds. La démonstration phare : un robot Apptronik Apollo 2 qui marche, s’accroupit, attrape des objets et range une pièce sans aucune téléopération.

Trois modèles pour une intelligence complète

Gemini Robotics 2 ne désigne pas un seul modèle, mais un ensemble de trois briques complémentaires. Le premier, baptisé Gemini Robotics 2, est un modèle VLA (vision-language-action) : il convertit ce que le robot voit et entend en commandes motrices concrètes. Première dans la gamme, il peut contrôler un humanoïde complet, du bout des orteils aux extrémités des doigts.

Le deuxième modèle, Gemini Robotics ER 2, est un moteur de raisonnement dit « embodied ». C’est lui qui planifie les tâches longues, communique avec les humains et coordonne plusieurs robots entre eux. Google DeepMind cite une classification de vidéo de tâche avec près de 60 % de précision, soit un bond significatif par rapport à la version précédente.

Le troisième volet, Gemini Robotics On-Device 2, est conçu pour fonctionner directement sur le matériel du robot, sans connexion cloud. Il peut s’adapter à un nouveau type de bras ou de plateforme robotique en quelques heures seulement, avec un volume limité de données d’entraînement.

Des mains à cinq doigts et la coordination multi-robots

Concrètement, Gemini Robotics 2 permet à Apollo 2 équipé de mains SharpaWave à cinq doigts d’effectuer des tâches de précision : nouer un sac poubelle, dévisser une ampoule, ranger des objets dans les bons compartiments d’une étagère. Ces gestes restaient hors de portée des versions précédentes.

L’autre nouveauté clé : la collaboration multi-robots. Gemini Robotics ER 2 permet à des machines de types différents (humanoïde et bras dual-arm, par exemple) de se coordonner sur une tâche commune. Plus besoin qu’un seul robot effectue chaque étape en séquence.

Google DeepMind décrit cette architecture comme la « couche d’intelligence » des robots de prochaine génération. L’objectif annoncé est de créer un robot généraliste capable d’agir sur instruction verbale, sans programmation préalable de chaque geste.

Disponibilité et partenariats

Le modèle Gemini Robotics ER 2 est disponible en accès public via Google AI Studio et en préversion privée sur le Gemini Enterprise Agent Platform. Les deux autres modèles (VLA complet et On-Device) restent en accès restreint pour l’instant.

Apptronik, le fabricant d’Apollo 2, participe à l’entraînement des modèles via son installation Robot Park, où des humanoïdes collectent des données en continu. Le robot Franka F3 Duo dual-arm est également utilisé dans certaines démos de collaboration multi-robots.

C’est une étape concrète vers ce que les ingénieurs de DeepMind appellent « physical AGI » : un robot capable d’exécuter n’importe quelle tâche physique sur simple instruction humaine.

Fiches Robodex citées

Le briefing RoboActu

L’essentiel de la robotique, une fois par semaine.

Une sélection courte des annonces, usages et robots à suivre.

Continuer sur ce sujet

Comparer les robots