En este artículo
Vale, hablemos de Gemini 3. El 18 de noviembre de 2025, Google presentó Gemini 3 Pro en versión preliminar y lo describió como su modelo más inteligente hasta entonces. Y ¿sabéis qué? Había bastante que merecía atención.

Estas fueron mis impresiones tras 48 horas revisando el material del lanzamiento, las evaluaciones de Artificial Analysis y las experiencias de quienes lo probaron. Son pruebas de distinto tipo: resultados publicados por Google, mediciones de un evaluador independiente y experiencias individuales. Esto es lo que permiten concluir, y por qué aun así no le daría las llaves de un negocio sin supervisión.
Los datos que me hicieron parpadear fuerte
Empiezo con la cifra del titular: 1.501 Elo. Fue la puntuación de LMArena que Google publicó para Gemini 3 Pro en su lanzamiento. Era una señal llamativa de preferencia humana en esas comparaciones; no un certificado de superioridad para cualquier trabajo que le encargues. Anuncio de lanzamiento de Google
El análisis de Artificial Analysis del 18 de noviembre situó Gemini 3 Pro Preview primero en su índice de inteligencia, tres puntos por delante de GPT-5.1. Es un buen resultado de lanzamiento en ese conjunto de pruebas. Pero con la fecha al lado: una clasificación es una foto, no un premio a toda una carrera. Análisis de lanzamiento de Artificial Analysis
Pero aquí viene lo loco. Las mejoras publicadas en razonamiento matemático llamaban la atención:
- MathArena Apex: 23,4 % para Gemini 3 Pro frente al 0,5 % de Gemini 2.5 Pro: 22,9 puntos porcentuales más, o unas 47 veces la cifra inicial publicada.
- ARC-AGI-2: Google publicó un 45,1 % para el modo separado Gemini 3 Deep Think con ejecución de código. En el lanzamiento, ese modo seguía en manos de los evaluadores de seguridad.
- AIME 2025: 100 % con ejecución de código, frente a un 95 % sin herramientas para Gemini 3 Pro.
La configuración importa. Si una prueba utiliza código o un modo de razonamiento distinto, hay que decirlo. Anuncio de Google · Tabla de evaluación de noviembre de 2025
Un millón de tokens también necesita revisión
Una ventana de un millón de tokens suena gloriosa. Describe cuánto texto de entrada acepta el modelo; no promete recordar perfectamente cada detalle.
La tabla de Google de noviembre de 2025 publicó un 26,3 % para Gemini 3 Pro en MRCR v2 a 1M tokens, frente al 16,4 % de Gemini 2.5 Pro. La cifra a 128K era una media acumulada y la de 1M, una medición puntual. Ninguna establece un límite universal de fiabilidad en 128K.
Mi conclusión práctica: prueba la recuperación de información y el razonamiento con tus documentos, y revisa los detalles importantes estén donde estén. Que el texto quepa es solo el principio. Metodología de evaluación de Google
Prepárate para sacar la cartera
Hablemos de pasta, porque Google desde luego quiere la tuya. Las tarifas de lanzamiento citadas aquí eran por millón de tokens:
- Hasta 200K tokens en la entrada: 2 USD de entrada / 12 USD de salida.
- Con más de 200K tokens en la entrada: 4 USD de entrada / 18 USD de salida.
Artificial Analysis calculó un aumento del 12 % en el coste de ejecutar su índice de inteligencia respecto a Gemini 2.5 Pro. Ese cálculo combina tarifas y consumo de tokens; no es una subida general de precios del 12 %. Análisis de lanzamiento de Artificial Analysis
Con esas tarifas, 350.000 tokens de entrada y 15.000 tokens de salida facturados suman 1,67 USD por solicitud. Cien solicitudes diarias durante 30 días suman 5.010 USD al mes, sin caché ni descuentos. El cálculo original de 50–70 USD al mes era incorrecto.
La comparación útil es cuánto cuesta completar tu trabajo con una calidad aceptable. Una clasificación no te va a preparar ese presupuesto.
El “agente autónomo” que necesita un canguro
Aquí es donde la cosa se vuelve hilarante (o frustrante). Google está empujando fuerte su plataforma Antigravity —un entorno de desarrollo controlado por IA que supuestamente construye software solo. Las demos son magia. La realidad, no tanto.
En su análisis del lanzamiento, Matt Shumer explicó que Antigravity podía pasar por alto errores de compilación y problemas visibles al comprobar la web. Recomendó revisar su trabajo y repetir las pruebas. Es la experiencia de un probador, pero recuerda algo útil: un mensaje de tarea completada no es el resultado de una prueba. Análisis de Matt Shumer
Mi baño de realidad favorito vino de la prueba de audio de Simon Willison. Con una grabación municipal de 3 horas y 33 minutos, la respuesta situó el cierre en 1:04:00, en vez de 3:31:05, y resumió algunas intervenciones en lugar de transcribirlas literalmente. Tanto como transcripción perfecta, pues no. Era un caso documentado, no una prueba universal de si el modelo sabe decir la hora. Prueba original de Willison
Dónde destacaban los resultados del lanzamiento y sus límites
La tabla comparativa de noviembre de 2025 mostraba varios resultados fuertes de Gemini 3 Pro. Eran cifras publicadas por Google y otros proveedores, con una configuración específica para cada prueba:
- Comprensión de pantallas: 72,7 % en ScreenSpot-Pro, frente al 36,2 % de Claude Sonnet 4.5 y al 3,5 % de GPT-5.1. Google usó una herramienta de captura y la resolución
extra_high, anunciada entonces como futura; con resoluciónhigh, publicó un 60,5 %. - Precisión factual: 72,1 % en SimpleQA Verified, frente al 34,9 % de GPT-5.1.
- Análisis de vídeo: 87,6 % en Video-MMMU.
- Código: 76,2 % en SWE-bench Verified, frente al 77,2 % de Claude Sonnet 4.5. Es una diferencia de 1,0 punto porcentual entre resultados con distintas herramientas e infraestructuras de ejecución, no una prueba de mayor fiabilidad en producción.
Tabla y metodología de Google de noviembre de 2025
Por separado, Artificial Analysis publicó una tasa de alucinación del 88 % en AA-Omniscience. La métrica cuenta respuestas incorrectas entre las respuestas no correctas; no mide la confianza ni significa que el 88 % de todas las respuestas sean falsas. Análisis del lanzamiento · Definición de la métrica
La disponibilidad dependía del producto. Gemini 3 Pro comenzó a desplegarse mundialmente; Gemini Agent requería inicialmente Google AI Ultra y estaba disponible en la web en Estados Unidos. Eso es distinto de afirmar que Gemini estaba bloqueado en toda Europa. Anuncio original de la aplicación
Las tres cosas que SÍ son revolucionarias
Quitando la fanfarria, tres capacidades sí cambian el juego:
- El salto en matemáticas es mutación, no evolución — pasar de 0,5 % a 23,4 % es como si tu calculadora empezara a entender filosofía
- La comprensión de pantallas prometía: los resultados del lanzamiento invitaban a probar la automatización visual, teniendo presentes las herramientas de captura y la resolución utilizadas.
- Mejores herramientas de programación: en un testimonio de lanzamiento publicado por Google Cloud, JetBrains afirmó que, con Gemini 3 Pro, el número de tareas de evaluación resueltas aumentó más de un 50 % respecto a Gemini 2.5 Pro. Era una evaluación del modelo realizada por un socio, no un estudio independiente de Antigravity. Aun así, invitaba a probar las herramientas. Artículo de lanzamiento de Google Cloud
Mi opinión honesta tras 48 horas
Google construyó algo impresionante. Los resultados del lanzamiento me daban motivos para probarlo con problemas matemáticos difíciles, análisis de vídeo e interfaces. No me daban motivos para dejar de revisar su trabajo.
La ventana admite mucho material, pero capacidad no equivale a recuerdo fiable. Los agentes de programación siguen necesitando revisión. Y responder bien a preguntas es distinto de saber reconocer la incertidumbre. Becario brillante, te presento a tu supervisor responsable.
¿Deberías cambiarte?
En aquel lanzamiento, mi consejo era probar Gemini 3 Pro donde las mejoras publicadas pudieran ser útiles:
- Preguntas matemáticas y científicas cuyas respuestas puedas comprobar.
- Análisis de imágenes y vídeo, revisando también detalles y marcas temporales.
- Documentos largos con una lista de datos importantes que recuperar y verificar.
- Tareas de programación con pruebas funcionales y un proceso realista de revisión.
Compáralo con tu herramienta habitual usando las mismas tareas. Mide calidad, correcciones, tiempo y coste total. Revisa la disponibilidad de la función concreta que necesitas. Una pequeña ventaja en una evaluación no justifica migrar producción a ciegas.
Cuando se escribió este artículo, en noviembre de 2025, Gemini 3 acababa de lanzarse. Seguíamos en plena luna de miel. Mi veredicto: una herramienta potente e interesante que merecía evaluarse para trabajos concretos, con la supervisión todavía incluida en el trato.
Bienvenido al futuro: un razonamiento impresionante puede convivir con una marca de audio que te manda al momento equivocado de la reunión.

Conversación
Comentarios
No hay comentarios publicados