Innodata a ouvert dans le New Jersey un laboratoire de capture de mouvement destiné à produire des données d’entraînement pour les robots humanoïdes et industriels. L’installation doit aussi mesurer de façon indépendante les mouvements réels d’un robot afin de comparer ses performances à sa propre télémétrie.
Le spécialiste des données a équipé le site de caméras infrarouges Vicon. Elles suivent en trois dimensions les personnes, les robots et les objets qu’ils manipulent, avec une précision annoncée inférieure au millimètre et une latence de l’ordre de la milliseconde.
Capturer les contacts, pas seulement les gestes
Les modèles de robotique ont besoin de données qui décrivent davantage qu’une silhouette en mouvement. Pour apprendre à saisir une tasse, un robot doit connaître la position de la main, l’orientation de l’objet, les contacts et le contexte de la tâche. Une reconstruction tirée d’une vidéo 2D peut introduire des erreurs de profondeur ou masquer une partie du geste.
Le laboratoire enregistre directement les trajectoires en 3D. Innodata prévoit de travailler avec des humanoïdes, des systèmes téléopérés, des capteurs portés par des humains et des pinces de type Universal Manipulator Interface. Les données pourront ensuite être adaptées à différentes plateformes ou utilisées pour construire des jumeaux numériques.
L’entreprise veut combiner des séquences captées dans le monde réel avec la simulation. Les mouvements observés servent de base, tandis que l’environnement virtuel permet de varier la position des objets ou les conditions d’exécution sans répéter chaque scénario physiquement.
Un banc de mesure extérieur au robot
Les clients pourront acheter des jeux de données, commander une collecte sur mesure ou envoyer un robot au laboratoire. Les caméras observeront alors la machine de l’extérieur. Cette mesure exocentrique doit vérifier la précision des capteurs et des journaux internes, qui peuvent être incomplets ou bruités.
Innodata prévoit aussi des scénarios où plusieurs personnes et robots interagissent. Ce type de séquence reste plus rare que les démonstrations réalisées par un seul opérateur, alors qu’il est nécessaire pour tester les distances de sécurité, les réactions aux imprévus et la coordination.
Pourquoi cette infrastructure compte
Les modèles vision-langage-action progressent, mais ils dépendent de données physiques coûteuses à produire. Un laboratoire instrumenté peut améliorer la qualité des exemples et réduire la quantité de séquences inutilisables. Il ne remplace toutefois pas les essais dans les usines, les logements ou les hôpitaux où les robots devront réellement fonctionner.
Le principal enjeu sera donc la diversité. Des gestes précis enregistrés dans un espace contrôlé constituent une base solide, mais les développeurs devront encore couvrir les variations de morphologie, d’éclairage, d’objets et de comportement humain rencontrées sur le terrain.
