Google DeepMind ha publicado dos nuevos modelos de audio: Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking. La empresa los describe como sus modelos de diálogo en vivo más avanzados hasta la fecha.
Ambos son nativos de voz a voz. No hay un paso intermedio de transcribir y volver a sintetizar; entra audio y sale audio.
El hueco al que apuntan
El lanzamiento apunta a una carencia concreta: agentes de voz capaces de razonar y ejecutar herramientas sin romper el flujo de la conversación.
En los montajes actuales, el agente se quedaba callado mientras llamaba a una herramienta y la conversación se cortaba. Por eso la versión Extended Thinking llega como modelo aparte: para resolver tareas que exigen más deliberación sin interrumpir el intercambio.
La separación de Extended Thinking también crea una elección de uso. En un bot de citas, deliberar más es coste desperdiciado; en un flujo que consulta un pedido e inicia una devolución, es necesario. Conectar los dos modelos a flujos distintos del mismo producto es posible.
La diferencia de precio
La línea llamativa es el precio. Google cobra 1,38 dólares por hora de conversación, muy por debajo del GPT-Live-1 de OpenAI.
| Criterio | Gemini 3.8 Live | GPT-Live-1 |
|---|---|---|
| Hora de conversación | 1,38 dólares | bastante más alto |
| Clasificación | Encabeza la lista de voz a voz | — |
| Naturalidad | — | Más natural gracias al dúplex completo |
La última fila importa: se espera que el modelo de OpenAI suene aún más natural porque funciona en dúplex completo. La elección no es unidimensional; hay un intercambio entre coste y fluidez conversacional.
Encabezar la clasificación tampoco basta por sí solo. Las listas de voz a voz miden sobre todo en inglés; cómo se comporta el mismo modelo en otra lengua sigue siendo otra pregunta.
Dónde está disponible
Ambos modelos están activos en la Gemini Live API y en Google AI Studio. Se ofrecen como modelos alojados y, al no publicarse pesos abiertos, no hay opción de ejecutarlos en servidores propios.
Eso fija la primera pregunta al montar un centro de llamadas que trate datos personales: dónde se procesa el audio y cuánto se guarda. La ventaja de precio cambia de sentido según esa respuesta.
El resto de la familia
Los nuevos modelos se apoyan en la familia de audio que Google amplió el mes pasado con Gemini 3.5 Transcribe. La empresa construye una línea complementaria y no piezas sueltas: transcripción, diálogo en vivo y deliberación extendida se posicionan como productos distintos.
En un despliegue fuera del inglés, lo decisivo es el idioma antes que el precio. Por mucho que baje el coste por hora, si la tasa de malentendidos sigue alta en tu lengua el agente de voz no sirve en atención al cliente; por eso medir con tus propias grabaciones debe preceder a la decisión.