OpenAI parie gros sur l’IA audio, et il ne s’agit pas seulement d’améliorer le son de ChatGPT. Selon un nouveau rapport de The Information, la société a unifié plusieurs équipes d’ingénierie, de produits et de recherche au cours des deux derniers mois pour réviser ses modèles audio, le tout en vue d’un premier appareil personnel audio dont le lancement est prévu dans environ un an.
Cette décision reflète la direction que prend l’ensemble de l’industrie technologique : vers un avenir où les écrans deviennent un bruit de fond et où l’audio occupe une place centrale. Les haut-parleurs intelligents ont déjà intégré les assistants vocaux dans plus d’un tiers des foyers américains. Meta vient de déployer une fonctionnalité pour ses lunettes intelligentes Ray-Ban qui utilise un réseau de cinq microphones pour vous aider à entendre les conversations dans des pièces bruyantes, transformant essentiellement votre visage en un appareil d’écoute directionnel. Google, quant à lui, a commencé à expérimenter en juin des « aperçus audio » qui transformaient les résultats de recherche en résumés conversationnels. Et Tesla intègre Grok et d’autres LLM dans ses véhicules pour créer des assistants vocaux conversationnels capables de tout gérer, de la navigation à la climatisation, en passant par un dialogue naturel.
Ce ne sont pas seulement les géants de la technologie qui font ce pari. Une équipe hétéroclite de startups a émergé avec la même conviction, mais avec plus ou moins de succès. Les fabricants du Humane AI Pin ont dépensé des centaines de millions de dollars avant que leur portable sans écran ne devienne un récit édifiant. Le pendentif Friend AI, un collier qui enregistre votre vie et offre de la compagnie, a suscité dans une égale mesure des problèmes de confidentialité et une peur existentielle. Et maintenant, au moins deux sociétés, dont Sandbar et une dirigée par le fondateur de Pebble, Eric Migicovsky, construisent des anneaux d’IA qui devraient faire leurs débuts en 2026, permettant aux porteurs de parler littéralement à la main.
Les facteurs de forme peuvent différer, mais la thèse est la même : l’audio est l’interface du futur. Chaque espace – votre maison, votre voiture, même votre visage – devient une interface.
Le nouveau modèle audio d’OpenAI, prévu pour début 2026, semblerait plus naturel, gérerait les interruptions comme un véritable interlocuteur et parlerait même pendant que vous parlez, ce que les modèles actuels ne peuvent pas gérer. La société envisagerait également une famille d’appareils, comprenant éventuellement des lunettes ou des haut-parleurs intelligents sans écran, qui agiraient moins comme des outils que comme des compagnons.
Comme le note The Information, l’ancien chef du design d’Apple, Jony Ive, qui a rejoint les efforts matériels d’OpenAI grâce à l’acquisition par la société de sa société io pour 6,5 milliards de dollars en mai, a fait de la réduction de la dépendance aux appareils une priorité, considérant la conception audio comme une opportunité de « réparer les torts » des anciens gadgets grand public.

