Unitree ouvre UnifoLM-WLA-1.0 pour piloter 64 tâches robotiques

Le robot humanoïde Unitree G1 exécute une tâche avec le modèle UnifoLM-WLA-1.0
UnifoLM-WLA-1.0 coordonne des tâches sur table et des manipulations mobilisant tout le corps. Visuel officiel Unitree.

Unitree a présenté UnifoLM-WLA-1.0, un modèle de fondation robotique de 6 milliards de paramètres destiné à commander avec un seul système des tâches de manipulation sur table et des mouvements mobilisant tout le corps d’un humanoïde. Le constructeur affirme l’avoir entraîné sur environ 2 500 heures de données issues de robots réels et l’évaluer sur 64 tâches.

Cette publication prolonge la stratégie logicielle de Unitree autour de ses humanoïdes. Le modèle associe perception multimodale, représentation des évolutions probables de la scène et génération d’actions. Les démonstrations officielles utilisent notamment le Unitree G1 avec des pinces à deux doigts ou différentes mains à cinq doigts.

Un même modèle pour 64 tâches

D’après la documentation d’UnifoLM-WLA-1.0, l’entraînement couvre 54 tâches de manipulation sur table et dix tâches mobilisant le corps entier. Le système doit ainsi pouvoir nettoyer une table, plier une serviette, installer un téléphone ou ranger des objets, sans changer de modèle entre chaque famille de mouvements.

Unitree met en avant la généralisation entre tâches et effecteurs. L’espace d’action est séparé en trois composantes : la pose des effecteurs, les articulations des mains ou pinces et les articulations du bas du corps. Chaque séquence est discrétisée, puis combinée avec les images, les consignes et l’état du robot dans une représentation commune.

Le socle multimodal, baptisé UnifoLM-ER-1, est dérivé de Qwen3-VL-4B et entraîné sur plus de cinq millions d’exemples. Il traite notamment le pointage dans l’image, la détection d’objets, le raisonnement spatial, la prédiction de trajectoires et la compréhension de scènes en plusieurs vues.

Prédire les zones qui vont changer

Une partie du modèle apprend à anticiper les régions de l’image qui devraient évoluer après une action. Unitree extrait le mouvement entre deux images et transforme les zones dynamiques en jetons. Le modèle peut ainsi concentrer son calcul sur l’objet manipulé et sur les changements attendus dans la scène.

La couche de génération d’actions s’appuie ensuite sur un expert de diffusion. Elle reçoit les observations, la consigne et l’état du robot, puis produit les trajectoires continues nécessaires. Le constructeur affirme qu’une même politique peut coordonner la manipulation et les déplacements du corps entier sur des configurations différentes.

Les chiffres de performance publiés restent ceux de Unitree et devront être comparés sur des protocoles indépendants. Les 2 500 heures de données réunissent les jeux ouverts du constructeur et d’autres corpus robotiques, mais ne suffisent pas à établir la fiabilité en production sur toutes les tâches montrées.

Notre analyse

L’intérêt d’UnifoLM-WLA-1.0 tient à la convergence entre raisonnement visuel et contrôle physique. Au lieu d’empiler un modèle de perception et une politique spécialisée par geste, Unitree cherche à mutualiser les représentations et les données entre plusieurs corps et effecteurs. Cette voie peut accélérer l’adaptation d’un humanoïde à un nouvel atelier, mais elle déplace le défi vers la qualité des données, la sûreté du contrôle et la reproductibilité des résultats. La mise à disposition des composants annoncés permettra de vérifier jusqu’où l’ouverture va réellement.

Sources : page technique officielle et annonce de Unitree sur X.

Fiches Robodex citées

Le briefing RoboActu

L’essentiel de la robotique, une fois par semaine.

Une sélection courte des annonces, usages et robots à suivre.

Continuer sur ce sujet

Comparer les robots