Volver al blog
Análisis3 min de lectura

Extra high no siempre gana

Subir el esfuerzo de razonamiento no equivale a elegir un modelo más capaz: puede introducir errores y encarecer una respuesta sin mejorarla. El artículo propone ajustar el nivel a la tarea, empezar por uno bajo para trabajos sencillos y aumentarlo cuando se pueda comprobar una mejora.

Escrito por

Idir Ouhab

Registro editado el 8 sept 2026
Portada de «Extra high no siempre gana»

Escribo a título personal. Este artículo no representa la posición de OpenAI.

Generalmente ves extra high y lo activas por si acaso. Total, quién va a querer usar medium y quedarse con la sensación de perder capacidad de hacer algo grande con IA.

Y si que llevo unos meses que me preocupa que estemos convirtiendo el nivel de razonamiento en el "ponme el bueno" de los modelos. Lo seleccionamos para cualquier tarea y damos por hecho que el resultado va a ser mejor.

El problema es que puede que acabemos pagando más por una respuesta peor.

Por qué pensar más puede acabar en menos aciertos

Si el modelo es más capaz y le doy más tiempo, responderá mejor, dicho así tiene un montón de sentido porque es una máquina, ¿pero cuántos de nosotros nos hemos ido de un exámen porque por mucho que nos quedemos calentando la silla no vamos a conseguir una respuesta mejor? OpenAI enseñó con o1 que dedicar más cómputo al razonamiento mejoraba el rendimiento en problemas exigentes. (aquí os dejo el link para que lo leaís si no sois perezosos Investigación sobre o1).

Pero elegir un modelo más capaz y subir su nivel de razonamiento son decisiones distintas. Con la segunda sigues usando el mismo modelo, con más margen para explorar y revisar soluciones.

Pero... revisar una respuesta no garantiza corregirla por que puede introducir una suposición equivocada o dar importancia a información que debería haber ignorado.

Si te lees [Inverse Scaling in Test-Time Compute](https://alignment.anthropic.com/2025/inverse-scaling/) hablan justo de que algunos modelos consideraban la solución sencilla, pero después volvían a enredarse con detalles irrelevantes y terminaban respondiendo mal.

En una prueba de contar dos objetos con código absurdo, Claude Opus 4 pasó de una precisión casi perfecta a aproximadamente el 80 % al subir el razonamiento. La cosa es que había que contar hasta 2, pero se vino arriba.

Luego hay casos que se salen, porque OpenAI o3 mejoró con más esfuerzo en esa misma prueba, pero era pruebas para estudiar fallos.

Qué se recomienda sobre high y extra high

Con GPT-5.5 se advierte de posibles pérdidas de calidad al aumentar el esfuerzo cuando hay instrucciones contradictorias, criterios poco claros sobre cuándo terminar o acceso demasiado abierto a herramientas, incluso hace búsquedas innecesarias y razonamiento excesivo.

No hace falta que explique, que si usas el razonamiento superalto, y la respuesta no es tan buena, la respuesta de la API se te va facturar igualmente.

Ya pasó (pasa) con la ventana de contexto

Me recuerda a la carrera por tener la ventana de contexto más grande. Y hablo de hace menos de 1 año.

Pero poder meter más información no garantiza aprovecharla mejor. Y esto es algo que posiblemente ya lo sepais pero Lost in the Middle habló claramente que los modelos evaluados podían perder precisión cuando la información relevante quedaba en medio de un contexto largo, por eso amigos Codex sacó "auto-compaction".

Cómo elegir el nivel de razonamiento

Tener distintos modelos y niveles de razonamiento permite ajustar los recursos al trabajo. No hace falta probar todas las combinaciones. Yo aquí tengo una pequeña table para empezar.

Caso de usoModeloRazonamiento
Extraer datos, clasificar y resumir textosGPT-5.6 LunaBajo
Reescribir textos y crear scripts sencillosGPT-5.6 LunaBajo
Programación habitual, informes y hojas de cálculoGPT-5.6 TerraMedio
Comparar fuentes y preparar propuestasGPT-5.6 SolMedio
Depuración compleja y decisiones de arquitecturaGPT-5.6 SolAlto
Investigación profunda con múltiples fuentes y contradiccionesGPT-6 AstraAlto

Sube el esfuerzo cuando puedas comprobar qué mejora. Tu factura ya sabe subir sola.

Temas

Esfuerzo de razonamientoSelección de modelosEvaluación de IACostes de API

Esta web utiliza almacenamiento necesario para recordar tu idioma y tus preferencias. Con tu permiso, Idir Ouhab también mide visitas con Google Analytics y permite contenido externo. Puedes rechazar los usos opcionales y cambiar tu elección en el pie de página.

Cómo se utilizan las cookies y el almacenamiento
Siempre activo

Recuerda tu idioma y tus preferencias de cookies. Una cookie de sesión independiente mantiene el acceso de administración. No se utilizan para publicidad.

Tu elección es válida durante 180 días en este navegador. Las finalidades opcionales están desactivadas inicialmente. Si el almacenamiento del navegador no está disponible, tu elección solo se conserva en esta página.

Puedes retirar tu permiso aquí en cualquier momento. Si ya se ha cargado contenido opcional, la página se recarga para detenerlo; podrían perderse cambios de formularios que no hayas enviado.

Cómo se utilizan las cookies y el almacenamiento