xAI a mis en ligne deux nouvelles capacités majeures pour Grok fin juillet 2026 : un modèle de voix temps réel avec la technologie Speech-to-Speech, et un modèle vidéo natif 1080p couvrant text-to-video, image-to-video et reference-to-video. En quelques semaines, Musk étend son écosystème IA au-delà du texte sur trois modalités simultanées.
Grok Voice Think Fast 2.0 : la voix sans intermédiaire
Grok Voice Think Fast 2.0 est disponible via l’API xAI depuis fin juillet. Le modèle supporte la technologie Speech to Speech : l’entrée est de la parole, la sortie est de la parole. Pas de transcription intermédiaire, pas de synthèse vocale séparée. Cela réduit la latence perçue et préserve la prosodie naturelle de la conversation.
À partir du 5 août 2026, grok-voice-latest sera automatiquement redirigé vers grok-voice-think-fast-2.0, remplaçant la version 1.0. xAI indique que des tests A/B sur la plateforme Starlink montrent une amélioration du taux de satisfaction et du taux de résolution sans escalade. En pratique, les assistants vocaux intégrés à Starlink seront mis à jour automatiquement. C’est un cas d’usage réel, pas une démo : Starlink mesure si ses clients obtiennent de l’aide sans transfert vers un opérateur humain.
La mise à jour voix s’accompagne aussi d’un ajustement du seuil VAD (Voice Activity Detection) pour la transcription Speech-to-Text : le paramètre vad_threshold permet désormais de capter de la parole plus faible ou dans des environnements bruités, utile pour la téléphonie à bande étroite.
Grok Imagine Video 1.5 : trois modes de génération en 1080p natif
Grok Imagine Video 1.5 ouvre trois modes de génération : text-to-video (T2V), image-to-video (I2V) et reference-to-video. Les deux premiers produisent de la vidéo native en 1080p, ce que peu de modèles génératifs grand public proposent actuellement. Le mode reference-to-video permet en plus d’ajouter des voix préréglées à la vidéo générée.
Ces trois modes sont accessibles via l’API Imagine de xAI. La mise à jour arrive après que xAI a introduit la possibilité de stocker les résultats Imagine dans son API Files : générer un asset vidéo et le publier avec une URL partageable en un seul appel API.
Un écosystème multimodal qui rivalise avec les grands
En quelques semaines, xAI couvre trois modalités majeures : texte avec Grok 4.5 (disponible dans l’UE depuis mi-juillet), voix temps réel avec Grok Voice Think Fast 2.0, et vidéo avec Grok Imagine Video 1.5. La comparaison directe avec les concurrents est inévitable : OpenAI couvre texte, voix et vidéo (Sora), Google Gemini couvre les trois modalités, Anthropic Claude reste centré sur le texte.
Pour les développeurs, la question devient le choix entre une plateforme cohérente ou l’assemblage du meilleur de chaque fournisseur. xAI propose une API unifiée avec des fonctions inter-modalités (images stockées en Files réutilisables dans Imagine, par exemple). L’enjeu de distribution reste le vrai différenciant : avec Tesla, Starlink et X comme canaux captifs, xAI a des débouchés opérationnels que les autres labos n’ont pas. Grok Voice 2.0 sur Starlink en est la démonstration la plus concrète.
Notre analyse
xAI monte en puissance à un rythme qui mérite attention. Le modèle voix améliore des métriques réelles sur Starlink, pas des benchmarks de laboratoire. La vidéo 1080p native positionne Grok Imagine au-dessus de la majorité des outils génératifs actuellement disponibles en API publique. Les prochains mois diront si ces capacités multimodales s’intègrent dans des produits grand public ou restent des fonctionnalités d’API pour développeurs.
