OpenAI lance GPT-Live-1, un modèle vocal qui écoute pendant qu’il parle

Présentation officielle de GPT-Live-1 par OpenAI Developers sur un écran bleu
GPT-Live-1 traite l’écoute et la parole dans une même session vocale.

OpenAI rend GPT-Live-1 disponible dans son API. Ce modèle vocal fonctionne en full duplex : il peut écouter et parler en même temps, gérer une interruption et poursuivre l’échange pendant qu’un autre modèle traite le raisonnement ou appelle des outils.

https://x.com/OpenAIDevs/status/2098099269551149398
OpenAI Developers présente le fonctionnement vocal simultané de GPT-Live-1.

Une conversation sans alternance rigide

Les assistants vocaux classiques découpent souvent l’échange en étapes successives : transcription, génération d’une réponse, puis synthèse vocale. GPT-Live-1 réunit l’entrée et la sortie audio dans un même modèle. Il peut ainsi détecter qu’une personne reprend la parole, suspendre sa réponse et intégrer la nouvelle instruction sans attendre la fin d’un tour.

OpenAI indique que le modèle distingue la voix du bruit ambiant et adapte son débit, son ton et son expressivité. Les développeurs peuvent fixer la langue, la longueur des réponses et le style de parole. L’objectif est de rendre les échanges moins mécaniques, notamment dans le support client, l’accueil téléphonique ou les assistants embarqués.

Le modèle accepte du texte et de l’audio en entrée et produit les mêmes modalités en sortie. Il ne prend pas en charge les images ou la vidéo. L’accès passe par le nouvel endpoint v1/live/sessions, avec le streaming et les appels de fonctions, mais sans sorties structurées ni ajustement fin.

Déléguer le raisonnement à un autre modèle

GPT-Live-1 peut continuer à écouter et à parler pendant qu’un modèle placé en arrière-plan effectue une recherche, raisonne ou utilise un outil. Cette séparation permet de réserver le modèle vocal à la fluidité de la conversation, puis de confier les opérations plus lourdes à l’agent choisi par le développeur.

D’après OpenAI, l’association de GPT-Live-1 avec GPT-6 Astra à un niveau de raisonnement moyen a terminé 83,6 % des tâches au premier essai sur Tau3. Ce test couvre des scénarios de support dans l’aérien, le commerce et les télécommunications. Le résultat reste publié par le fournisseur et devra être comparé à des appels réels, où les accents, les coupures réseau et les outils externes ajoutent des sources d’erreur.

Un tarif à la durée

La documentation officielle fixe le prix de la session vocale à 0,05 dollar par minute, facturé à la seconde. Les appels du modèle d’arrière-plan et des outils sont comptés séparément. L’offre gratuite n’est pas prise en charge et les limites dépendent du niveau du compte, de 25 sessions simultanées au premier palier à 500 au cinquième.

Ce mode de facturation rend le coût lisible pour la couche audio, mais pas nécessairement pour l’application complète. Un service qui délègue fréquemment à un modèle de raisonnement, consulte une base documentaire ou déclenche des actions doit additionner ces consommations.

Le full duplex apporte surtout une nouvelle contrainte de sûreté. Un agent qui écoute en continu, parle et agit doit signaler clairement quand un outil est sollicité, gérer les confirmations et éviter qu’un bruit ou une voix tierce déclenche une opération. La qualité de GPT-Live-1 se mesurera donc autant à sa latence qu’à sa capacité à rester compréhensible et contrôlable dans une conversation réelle.

Le briefing RoboActu

L’essentiel de la robotique, une fois par semaine.

Une sélection courte des annonces, usages et robots à suivre.

Continuer sur ce sujet

Comparer les robots