OpenAI introdujo GPT‑Live, el modelo de voz más reciente que impulsa la experiencia conversacional de ChatGPT en aplicaciones móviles y navegadores web. A diferencia del sistema basado en turnos anterior, GPT‑Live opera en una arquitectura de duplex completo que permite al asistente escuchar y responder al mismo tiempo. Los usuarios ahora escuchan breves interjecciones naturales - "mhmm", "yeah" - mientras hablan, reduciendo las pausas y cortes incómodos que plagaban las versiones anteriores.

El nuevo modelo se ejecuta en un solo motor multimodal, que maneja la conversión de voz a texto, la generación de lenguaje y la síntesis de texto a voz en una sola tubería. Cuando una pregunta requiere una comprensión o investigación más profunda, GPT‑Live puede silenciosamente transferir la tarea a modelos de backend más capaces como GPT‑5.5, manteniendo la conversación fluida sin retrasos notables.

El acceso a GPT‑Live varía según el nivel de suscripción. Los usuarios de ChatGPT Pro, Plus y Go reciben el modelo GPT‑Live‑1 completo, mientras que aquellos en el plan gratuito están limitados a GPT‑Live‑1 mini, una versión más ligera sin la configuración de inteligencia personalizable. Para iniciar una sesión de voz, los usuarios pulsán el icono de onda en el borde derecho de la caja de texto, otorgan permiso de micrófono si se les solicita, y una esfera flotante aparece en la pantalla. La esfera permanece activa incluso si el usuario cambia de aplicación o bloquea el dispositivo.

Los suscriptores pagos pueden ajustar el nivel de "inteligencia" del modelo - Instant, Medio o Alto - a través del menú de configuración. Los niveles más altos agregan un segundo adicional de tiempo de procesamiento, lo que permite al modelo realizar un razonamiento más exhaustivo antes de responder. El modelo mini no admite esta personalización. Los usuarios también pueden seleccionar diferentes voces, cambiar la configuración del idioma o establecer el modo de voz como la opción de lanzamiento predeterminada.

Aunque GPT‑Live marca un paso significativo hacia adelante, todavía no admite la compartición de pantalla o video. Los usuarios que deseen revertir al modelo de voz anterior pueden hacerlo navegando a la configuración de voz y seleccionando una opción anterior. La actualización, sin embargo, ya ha ganado elogios por su fluidez. Los revisores señalan que el asistente ya no interrumpe en medio de una oración, y el ritmo conversacional se siente casi anticipatorio, especialmente durante las consultas más largas.

Más allá de las charlas casuales, GPT‑Live muestra promesa para tareas de traducción en vivo. Una transcripción del intercambio hablado siempre está disponible desplazándose hacia abajo, y el modelo puede generar widgets interactivos cuando una respuesta visual es adecuada. El nivel de inteligencia Instant predeterminado maneja las preguntas cotidianas rápidamente, mientras que los temas más exigentes se benefician de los niveles Medio o Alto, que invocan un análisis más profundo sin romper el flujo natural.

En general, GPT‑Live posiciona a ChatGPT como un asistente de voz más accesible para los usuarios que prefieren hablar sobre escribir. Al fusionar la escucha y el habla en un bucle sin fisuras y descargar el razonamiento pesado a modelos de backend, OpenAI busca hacer que las conversaciones de IA se sientan menos como interactuar con un guión y más como hablar con un socio conocedor.

Cet article a été rédigé avec l'assistance de l'IA.
News Factory APP - actualités agentiques pour booster votre SEO et AEO.