OpenAI lanza GPT-Live: modelos de voz que escuchan y hablan en tiempo real
OpenAI ha lanzado GPT-Live, una nueva familia de modelos de voz capaces de escuchar y hablar simultáneamente. Con GPT-Live-1 y su versión ligera GPT-Live-1 mini, las conversaciones con IA pierden por fin ese lado robótico hecho de pausas y latencias. La interrupción natural se hace posible: se puede cortar a la IA a mitad de frase, como se haría con un interlocutor humano.
El fin de las conversaciones por turnos
Hasta ahora, los asistentes de voz funcionaban en modo "walkie-talkie": el usuario habla, la IA espera al final, procesa y luego responde. Este retraso, incluso reducido a unos cientos de milisegundos, basta para hacer la conversación artificial. Con GPT-Live, el modelo procesa el audio de forma continua, permitiendo intercambios en tiempo real donde la IA puede ser interrumpida, relanzada, o responder antes de que el usuario haya terminado su frase.
En la práctica, esto significa que un asistente de voz puede ahora gestionar conversaciones complejas: negociar una cita, tomar un pedido con modificaciones, responder a preguntas anidadas. Los casos de uso en soporte al cliente, toma de pedidos telefónicos, o asistencia interna se vuelven notablemente más fluidos.
Dos modelos para dos usos
GPT-Live-1 es el modelo completo, optimizado para conversaciones sofisticadas que requieren razonamiento avanzado. Está adaptado para asistentes de gama alta: conserjes virtuales, soporte técnico de nivel 2, asistentes de dirección. El coste por minuto de conversación es más alto, pero la calidad de las respuestas justifica la inversión en estos casos de uso premium.
GPT-Live-1 mini apunta a usos de alto volumen donde la rapidez prima sobre la profundidad del razonamiento: reserva de citas, confirmación de pedidos, FAQs vocales. El coste reducido permite desplegar asistentes de voz en volúmenes importantes sin explotar el presupuesto.
Impacto para las empresas
Para las empresas que contemplan automatizar su recepción telefónica o desplegar asistentes de voz internos, GPT-Live cambia las reglas del juego. La calidad de la experiencia se acerca por fin a lo que los usuarios esperan de una conversación telefónica. Los casos de abandono ligados a la frustración frente a sistemas de voz lentos y rígidos deberían disminuir significativamente.
La API está disponible desde ahora, con una tarificación basada en la duración de la conversación más que en el número de tokens. Para las empresas que ya tienen integraciones OpenAI, añadir capacidades de voz en tiempo real se integra naturalmente en la arquitectura existente.
Este anuncio se inscribe en una tendencia de fondo: la IA conversacional abandona el texto para volverse multimodal. Los chatbots empresariales del mañana hablarán tanto como escribirán. Para explorar cómo estas nuevas capacidades pueden integrarse en sus procesos, nuestra auditoría IA identifica los casos de uso relevantes para su contexto.