Ciencia y Tecnología

GPT-Live-1: la IA de voz que escucha e interrumpe menos, según OpenAI

El modelo de voz llegó a la API el 10 de septiembre. La promesa: conversaciones más fluidas; la prueba real estará en cada aplicación.

Por admin 3 min de lectura
Una trabajadora de atención al cliente conversa con una clienta mientras usa una laptop y audífonos.

OpenAI anunció el 10 de septiembre GPT-Live-1 para su API, un modelo de voz que, según la empresa, puede escuchar y hablar en paralelo. La propuesta busca que los asistentes conversacionales suenen menos como una llamada con turnos rígidos y respondan mejor a pausas e interrupciones.

En una arquitectura tradicional, el audio suele convertirse primero en texto, pasar por un modelo y luego volver a voz. Cada transición puede agregar latencia o perder matices. OpenAI sostiene que un modelo que procese entrada y salida de audio de forma conjunta simplifica esa cadena.

La compañía también dice que el modelo puede delegar razonamiento más complejo a otro sistema de texto y conectarse con herramientas. Eso podría servir para tareas como reservas o atención al cliente, aunque la respuesta y las acciones disponibles dependen de cómo cada desarrollador configure el sistema.

El anuncio incluye una evaluación temprana de la plataforma de aprendizaje de idiomas Speak: OpenAI afirma que las interrupciones bajaron casi 80% frente a sistemas anteriores basados en turnos. Es un resultado comunicado por la empresa en una prueba de cliente; no demuestra que todas las aplicaciones obtendrán el mismo resultado.

La función “full-duplex” permite que el sistema escuche mientras habla, pero eso hace aún más importante que las personas sepan cuándo están conversando con una máquina y qué datos de voz se almacenan. Una interfaz más natural no vuelve humana a la herramienta ni elimina la necesidad de revisar sus respuestas.

OpenAI lista un precio de 0.05 dólares por minuto para la capa frontal de voz. Ese costo no necesariamente representa el total de una aplicación: puede sumarse el modelo que atiende el razonamiento, el uso de herramientas, el almacenamiento y la infraestructura que el desarrollador incorpore.

El anuncio señala disponibilidad en la API, pero no ofrece en esa página una garantía de compatibilidad con cada país, idioma, acento o sector. Para un proyecto mexicano, habría que probar comprensión de español local, ruido de calle, nombres propios y cambios de tema antes de usarlo con clientes.

Una evaluación responsable debería medir latencia, precisión, errores, derivación a una persona y costo por interacción completa. También debería incluir un mecanismo para detener la conversación, corregir datos o pedir ayuda humana cuando la voz automatizada no entienda.

El avance apunta a asistentes que conversan con más naturalidad, no a una atención infalible. Para el público, la diferencia no estará sólo en lo bien que suena la voz, sino en si resuelve la solicitud, cuida los datos y deja claro cuándo interviene una persona.

Comparte esta nota: Facebook X WhatsApp Email
admin

Redacción de Acción Informativa.

Deja un comentario

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *