OpenAI a publié aujourd’hui de nouveaux modèles conversationnels, appelés GPT-Live-1 et GPT-Live-1 mini, affirmant qu’ils semblent plus naturels et peuvent mieux gérer le tour de rôle. Il s’agit de modèles full-duplex, ce qui signifie qu’ils peuvent parler et écouter en même temps, permettant aux utilisateurs d’interrompre naturellement et activant des fonctionnalités telles que la traduction en direct.
La société remplace également son mode vocal avancé actuel dans ChatGPT par GPT-Live-1 mini par défaut. Les utilisateurs de tiers payants pourront accéder au modèle GPT-Live-1 plus large. Le modèle précédent combinait un modèle de synthèse vocale pour transcrire la parole, un modèle de langage étendu pour générer des réponses et un modèle de synthèse vocale pour fournir la réponse finale.
La société a déclaré lors d’un point de presse que les nouveaux modèles résolvent des problèmes tels que l’interruption des utilisateurs pendant qu’ils parlent et le manque d’intelligence pour répondre aux questions. Les nouveaux modèles d’OpenAI enverront la requête à ses derniers modèles de texte comme GPT-5.5 pour des capacités de recherche, de raisonnement ou d’agent tout en poursuivant la conversation.
OpenAI a également montré que le modèle peut rester silencieux pendant une longue période et absorber le contexte de la conversation jusqu’à ce qu’il soit sollicité. De plus, comme le nouveau mode vocal a accès aux modèles GPT les plus récents, il peut également présenter certaines informations sous un format visuel. D’autres startups comme Monogram, qui a levé 40 millions de dollars en financement de démarrage auprès de DST et Lux Capital, s’appuient également sur des réponses visuelles pour rendre les assistants plus interactifs.
La société a déclaré que le nouveau mode vocal de ChatGPT est conçu pour avoir des conversations plus longues. Au cours du briefing, Atty Eleti, responsable produit de ChatGPT Voice, a déclaré qu’il avait eu des conversations de 30 à 40 minutes avec la fonction vocale lors de promenades.
OpenAI pense que la voix pourrait être la principale interface informatique pour les travaux complexes. Des rapports suggèrent qu’il pourrait lancer cette année une paire d’écouteurs dotés de capacités d’IA. Cependant, il ne fournit aucune information sur les produits matériels.
« Au fil du temps, nous pensons que cela débloquera également la possibilité d’utiliser la voix comme une sorte d’interface principale avec l’informatique et de gérer un travail agent de plus en plus complexe et de longue durée. Le genre de cas d’utilisation étonnants que nous voyons des gens utiliser Codex et ChatGPT pour accomplir, nous pensons que la voix peut être la future interface pour toutes sortes de travaux », a déclaré Eleti.
OpenAI a travaillé au renforcement des fonctionnalités vocales au cours des dernières années pour rendre le mode vocal de ChatGPT plus naturel. La société a déclaré que plus de 150 millions de personnes parlent à ChatGPT en utilisant des fonctionnalités telles que la voix et la dictée.
Les concurrents tentent également de rendre les assistants plus expressifs.
Apple et Amazon ont mis à jour leurs assistants pour qu’ils soient plus conversationnels et offrent une meilleure gestion du contexte. Des startups comme Sesame, fondée par Brendan Iribe et Ankit Kumar, co-fondateur d’Oculus, ont également lancé des assistants IA avec une conversation plus naturelle tout en accomplissant des tâches en arrière-plan.
OpenAI va dans la même direction, visant à permettre aux utilisateurs de parler plus longtemps avec son assistant en mains libres. Malgré son affirmation selon laquelle le nouveau mode vocal semble plus naturel, la société a souligné qu’elle n’aime pas en faire un compagnon d’IA. Il a noté que les nouveaux modèles comportent des garanties intégrées pour donner aux adolescents des réponses adaptées à leur âge et fournir des ressources si la conversation tourne sur des sujets tels que l’automutilation.
Le nouveau mode vocal a encore besoin de travail. Au cours de la démo, lorsque la société a montré sa fonction de traduction en direct en hindi, l’assistant avait un fort accent américain et parlait dans un hindi qui n’était pas naturel et avait un ton légèrement livresque. La société a déclaré que le nouveau mode était optimisé pour « la plupart des langues parlées », mais n’a pas précisé lesquelles.
Lorsque vous achetez via des liens dans nos articles, nous pouvons gagner une petite commission. Cela n’affecte pas notre indépendance éditoriale.

