Google lanzó Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking el 15 de septiembre, llamándolos sus modelos de audio más avanzados hasta el momento.
Ambos modelos pueden hablar, razonar y realizar tareas. Pero, ¿Cómo los clasifican los analistas independientes? La versión Extended Thinking ocupó el primer lugar en el Speech-to-Speech Index de Artificial Analysis con 82.6, por delante de GPT-Live-1 y Grok Voice.
¿Cómo los resultados comparativos califican el modelo de IA conversacional más reciente de Google?
El índice de Artificial Analysis promedia razonamiento del habla, desempeño como agente, preferencia en arena y tasa de éxito en tareas.
Gemini 3.8 Live Extended Thinking, probado con alto nivel de razonamiento, debutó en primer lugar. GPT-Live-1 Astra quedó en segundo con 81.5 y Grok Voice Think Fast 2.0 High en tercero con 81.3.
El modelo estándar Gemini 3.8 Live se ubicó en quinto lugar con una puntuación de 76.0. Ambas variantes superan a Gemini 3.1 Flash Live High, que obtuvo 71.5.
La diferencia como agente es aún mayor. Extended Thinking logró 68.6% en la prueba Tau Voice, frente al 37.7% de la generación anterior.
En la prueba de razonamiento del habla, Extended Thinking alcanzó 97.7%, superando a Grok Voice con 97.2%. Sin embargo, quedó detrás de Qwen Audio 3.0 Realtime Plus, que obtuvo 99.2%.
Los evaluadores humanos todavía prefieren el modelo antiguo de Gemini
La mayor diferencia está en el precio. El modelo estándar cuesta 0.84 dólares por hora de audio de entrada. Esto es aproximadamente la mitad del precio de su predecesor, 1.75 dólares, y la tarifa más baja del índice.
Extended Thinking cuesta 3.50 dólares por hora. Es más barato que GPT-Live-1 Sol, que cuesta 4.47 dólares y Grok Voice Think Fast 2.0 High, que vale 4.80 dólares.
La latencia también bajó. El tiempo promedio hasta recibir el primer audio es de solo 1.18 segundos, comparado con 2.99 segundos del modelo anterior de Gemini.
Pero los oyentes aún no están completamente convencidos. Gemini 3.1 Flash Live sigue liderando en preferencia en las conversaciones a ciegas de Speech Agent Arena, con un Elo de 1096.
Gemini 3.8 Live queda en segundo lugar con 1083. La variante Extended Thinking está más atrás, con 990, aunque completa el 89.1% de sus tareas.
Ahora la inteligencia artificial de voz se evalúa en dos escalas que van en direcciones diferentes. Las pruebas comparativas favorecen al modelo que mejor razona. La preferencia favorece al que habla mejor. Google actualmente lidera ambos aspectos, con diferentes modelos.
El post Google lanza su modelo de audio más avanzado: ¿De qué se trata? fue visto por primera vez en BeInCrypto.
