Las principales empresas de inteligencia artificial (IA) se están apresurando para lograr que las conversaciones con los chatbots se sientan más naturales, apostando a que el habla superará la escritura como la forma dominante en que las personas interactúan con los agentes de IA, a pesar de la incomodidad social que supone hablar con máquinas.

OpenAI y Google han actualizado recientemente sus ofertas de voz para que la IA suene menos como un robot que lee de una pantalla y más como un colega que entiende las instrucciones y el contexto.

Sus últimos productos llegan en medio de una demanda explosiva por parte de consumidores y empresas, y representan un cambio significativo respecto a los asistentes de voz anteriores, que convertían el habla en texto, generaban una respuesta de texto y luego la leían en voz alta.

Los modelos más recientes pueden procesar y producir el habla directamente, lo que ayuda a reducir los retrasos, el tono incómodo y la pérdida de contexto que hacían que los productos anteriores se sintieran mecánicos.

"A la gente le encanta usar su voz para hacer preguntas… para tener esa conversación recíproca similar a la humana", dijo Atty Eleti, líder de productos de OpenAI para la voz de ChatGPT. "El texto está muy bien, pero escribir requiere mucho esfuerzo".

La apuesta es que, a medida que los sistemas de IA pasen de responder preguntas a realizar tareas de mayor duración, hablarles se sentirá más natural que escribir instrucciones en la ventana de un chatbot.

Pero este impulso también está sacando a la luz los viejos problemas de la tecnología de voz, desde el retraso y el ruido de fondo hasta la incomodidad social de hablar con máquinas en público.

Las empresas de IA dicen que este cambio ya está modificando el comportamiento de los usuarios. Google informó que su uso de voz en tiempo real se duplicó en el último año hasta abril, y que las conversaciones con chatbots duran, en promedio, cinco veces más que las de texto. En OpenAI, más de 150 millones de personas usan la voz en ChatGPT cada semana.

La voz como medio "realmente está comenzando a resurgir con estos agentes de larga duración, con los que resulta muy natural asignarles tareas a través de la voz", dijo Sarah Bird, directora de productos de IA responsable en Microsoft.

OpenAI señaló que la tecnología de voz se veía anteriormente limitada por un "retraso en la inteligencia". Hasta el lanzamiento de ChatGPT Live la semana pasada —su primer modelo de voz en dos años— el modelo de voz de OpenAI había sido criticado por ser lento y confundir los diferentes idiomas o acentos.

Leland Rechis, quien dirige las experiencias de voz en Google, dijo que Google optó por un "estilo conversacional mucho más espontáneo" después de descubrir que los usuarios se sentían más cómodos hablando con la IA una vez que los grandes modelos de lenguaje estaban "detrás del micrófono".

Un caso de uso inicial es la programación, donde sus defensores dicen que la voz puede ayudar a los usuarios a describir su intención y las restricciones de manera más completa que una instrucción escrita.

Sandro Gianella, quien trabaja en estrategia y operaciones internacionales en OpenAI, dijo que la voz se ha convertido en una parte importante de la forma en que utiliza Codex, la herramienta de programación de OpenAI.

El auge de las herramientas de voz ha llevado a algunas empresas emergentes de Silicon Valley a invertir en nuevos micrófonos y en insonorización de oficinas para evitar que los sistemas confundan el audio con el ruido de fondo. Estos incluyen desde micrófonos de solapa hasta otros alojados en un tubo negro y un protector bucal.

Este cambio ha abierto un nuevo frente para las empresas emergentes de hardware que buscan hacer que la entrada de voz sea menos llamativa y más confiable, como los pequeños dispositivos de dictado portátiles de Pocket y Plaud.

También se espera que OpenAI lance a principios del próximo año el primer dispositivo de su línea de productos, que será un asistente de voz ambiental con cámara, micrófono y altavoz, según varias personas familiarizadas con el proyecto.

Las empresas emergentes de voz con IA también están generando un mayor interés entre los inversores. La inversión de capital de riesgo aumentó a 7000 millones de dólares en el primer trimestre de este año, en comparación con poco menos de 1000 millones de dólares en el mismo período del año pasado, según datos de PitchBook.

La empresa emergente Sandbar, con sede en Nueva York, ha diseñado un anillo al que se le puede hablar para dar órdenes o grabar notas, y que responde únicamente a la voz del usuario. El director ejecutivo y cofundador, Mina Fahmi, dijo que desarrolló el producto después de que los productos existentes le resultaran incómodos de usar.

Evan Goldschmidt, director de tecnología de Tolan, una empresa emergente de voz con un avatar alienígena impulsado por IA, señaló que la tecnología aún tiene margen de mejora en cuanto al ruido de fondo, la confiabilidad y la capacidad de responder al usuario con el tono emocional y el contexto adecuados. "Pero es solo cuestión de tiempo antes de que la voz se convierta en el paradigma de interacción dominante".

Cristina Criddle. Copyright The Financial Times Limited 2026 © 2026 The Financial Times Ltd. All rights reserved. Please do not copy and paste FT articles and redistribute by email or post to the web.


Financial Times

El Financial Times (FT) es reconocido globalmente como una de las organizaciones de noticias más importantes, destacada por su autoridad e integridad editorial. Fundado en 1888, ha evolucionado de ser un diario enfocado en Londres a convertirse en una corporación mediática global. El 93% de sus lectores son digitales.

Ver más