OpenAI rend GPT-Live-1 disponible dans son API. Ce modèle vocal fonctionne en full duplex : il peut écouter et parler en même temps, gérer une interruption et poursuivre l’échange pendant qu’un autre modèle traite le raisonnement ou appelle des outils.
Une conversation sans alternance rigide
Les assistants vocaux classiques découpent souvent l’échange en étapes successives : transcription, génération d’une réponse, puis synthèse vocale. GPT-Live-1 réunit l’entrée et la sortie audio dans un même modèle. Il peut ainsi détecter qu’une personne reprend la parole, suspendre sa réponse et intégrer la nouvelle instruction sans attendre la fin d’un tour.
OpenAI indique que le modèle distingue la voix du bruit ambiant et adapte son débit, son ton et son expressivité. Les développeurs peuvent fixer la langue, la longueur des réponses et le style de parole. L’objectif est de rendre les échanges moins mécaniques, notamment dans le support client, l’accueil téléphonique ou les assistants embarqués.
Le modèle accepte du texte et de l’audio en entrée et produit les mêmes modalités en sortie. Il ne prend pas en charge les images ou la vidéo. L’accès passe par le nouvel endpoint v1/live/sessions, avec le streaming et les appels de fonctions, mais sans sorties structurées ni ajustement fin.
Déléguer le raisonnement à un autre modèle
GPT-Live-1 peut continuer à écouter et à parler pendant qu’un modèle placé en arrière-plan effectue une recherche, raisonne ou utilise un outil. Cette séparation permet de réserver le modèle vocal à la fluidité de la conversation, puis de confier les opérations plus lourdes à l’agent choisi par le développeur.
D’après OpenAI, l’association de GPT-Live-1 avec GPT-6 Astra à un niveau de raisonnement moyen a terminé 83,6 % des tâches au premier essai sur Tau3. Ce test couvre des scénarios de support dans l’aérien, le commerce et les télécommunications. Le résultat reste publié par le fournisseur et devra être comparé à des appels réels, où les accents, les coupures réseau et les outils externes ajoutent des sources d’erreur.
Un tarif à la durée
La documentation officielle fixe le prix de la session vocale à 0,05 dollar par minute, facturé à la seconde. Les appels du modèle d’arrière-plan et des outils sont comptés séparément. L’offre gratuite n’est pas prise en charge et les limites dépendent du niveau du compte, de 25 sessions simultanées au premier palier à 500 au cinquième.
Ce mode de facturation rend le coût lisible pour la couche audio, mais pas nécessairement pour l’application complète. Un service qui délègue fréquemment à un modèle de raisonnement, consulte une base documentaire ou déclenche des actions doit additionner ces consommations.
Le full duplex apporte surtout une nouvelle contrainte de sûreté. Un agent qui écoute en continu, parle et agit doit signaler clairement quand un outil est sollicité, gérer les confirmations et éviter qu’un bruit ou une voix tierce déclenche une opération. La qualité de GPT-Live-1 se mesurera donc autant à sa latence qu’à sa capacité à rester compréhensible et contrôlable dans une conversation réelle.
