OpenAI ha lanzado el 8 de julio de 2026 la reescritura más profunda de
su modo de voz desde que existe ChatGPT: GPT-Live, disponible ya en
iOS, Android y ChatGPT.com para más de 150 millones de personas que
usan funciones de voz cada semana.

El problema real que resolvía el Modo de Voz Avanzado

Hasta ahora, ChatGPT hablaba en cascada: un modelo transcribía tu voz a texto, otro generaba la respuesta, y un tercero la convertía de vuelta en audio — cada paso añadía latencia y perdía matices, dando ese tono de "teleoperadora de los 90" que cualquiera que haya usado un asistente de voz reconoce al instante.

GPT-Live elimina esa cascada con una arquitectura full-duplex de
verdad: procesa el audio de entrada y genera la salida de forma
simultánea, tomando decisiones conversacionales (hablar, escuchar,
pausar, usar una herramienta) varias veces por segundo.

Full-duplex, no solo una palabra de marketing

La diferencia se nota en lo concreto: puedes interrumpir a mitad de
una explicación con una pregunta, y el sistema para, escucha y
responde. Si te quedas callado pensando, GPT-Live espera en vez de
lanzarse a hablar sobre tu silencio. Durante la conversación, emite
señales activas de escucha ("mmm", "sí", "ya veo") — no es cosmético,
es lo que en una llamada real te confirma que la otra persona sigue
ahí.

La pieza inteligente: separar conversación de razonamiento

Lo que hace técnicamente interesante a GPT-Live no es solo la voz en
sí, es la delegación: el modelo mantiene el hilo conversacional
ligero y rápido, y cuando una pregunta exige búsqueda web, razonamiento
profundo o capacidades agénticas, delega en segundo plano a GPT-5.5
— mientras ese trabajo pesado ocurre, GPT-Live sigue hablando contigo
sin cortar la conversación. Esta separación es la que explica un salto
de rendimiento notable: en BrowseComp (búsqueda web agéntica), pasa
de un 0,7% del Modo de Voz Avanzado a un 75,2% — la capa de voz se
queda ligera, el modelo pesado hace el trabajo real por detrás.

Los números que respaldan la mejora

OpenAI construyó nuevas evaluaciones humanas centradas específicamente
en naturalidad y fluidez conversacional (no solo precisión), comparando
conversaciones de 5 a 10 minutos. GPT-Live-1 fue preferido en un 75,7%
de las comparaciones frente al modo anterior. En GPQA (razonamiento
científico de nivel experto), pasa de un 45,3% a un 84,2% — casi el
doble, gracias precisamente a esa delegación a GPT-5.5.

Quién recibe qué modelo

GPT-Live-1 mini sustituye por defecto al Modo de Voz Avanzado para
usuarios gratuitos. GPT-Live-1 (el modelo completo) es el
predeterminado para planes Go, Plus y Pro, con tres niveles de
razonamiento seleccionables (Instant, Medium, High) según cuánta
profundidad necesites en cada pregunta.

Lo que todavía no incluye

No hay soporte de vídeo ni pantalla compartida en el lanzamiento
—para eso, el Modo de Voz Avanzado anterior sigue disponible—, y la
API para desarrolladores está anunciada como "próximamente" sin fecha
ni precio concretos, así que construir un agente telefónico propio
sobre GPT-Live todavía no es posible.

El matiz honesto: el idioma importa, y no todos están igual de pulidos

Aquí está el punto que conviene tener en cuenta antes de asumir que
funciona igual de bien en cualquier idioma: la propia OpenAI reconoce
que la calidad varía según el idioma, y en la demostración de
traducción al hindi la voz mostró un acento marcado y un tono poco
natural. Para español con acentos y modismos regionales, conviene
probarlo con conversaciones reales antes de asumir el mismo nivel de
pulido que en inglés.