Extra high no siempre gana
Subir el esfuerzo de razonamiento no equivale a elegir un modelo más capaz: puede introducir errores y encarecer una respuesta sin mejorarla. El artículo propone ajustar el nivel a la tarea, empezar por uno bajo para trabajos sencillos y aumentarlo cuando se pueda comprobar una mejora.
Escrito porIdir Ouhab

Escribo a título personal. Este artículo no representa la posición de OpenAI.
Generalmente ves extra high y lo activas por si acaso. Total, quién va a querer usar medium y quedarse con la sensación de perder capacidad de hacer algo grande con IA.
Y si que llevo unos meses que me preocupa que estemos convirtiendo el nivel de razonamiento en el "ponme el bueno" de los modelos. Lo seleccionamos para cualquier tarea y damos por hecho que el resultado va a ser mejor.
El problema es que puede que acabemos pagando más por una respuesta peor.
Por qué pensar más puede acabar en menos aciertos
Si el modelo es más capaz y le doy más tiempo, responderá mejor, dicho así tiene un montón de sentido porque es una máquina, ¿pero cuántos de nosotros nos hemos ido de un exámen porque por mucho que nos quedemos calentando la silla no vamos a conseguir una respuesta mejor? OpenAI enseñó con o1 que dedicar más cómputo al razonamiento mejoraba el rendimiento en problemas exigentes. (aquí os dejo el link para que lo leaís si no sois perezosos Investigación sobre o1).
Pero elegir un modelo más capaz y subir su nivel de razonamiento son decisiones distintas. Con la segunda sigues usando el mismo modelo, con más margen para explorar y revisar soluciones.
Pero... revisar una respuesta no garantiza corregirla por que puede introducir una suposición equivocada o dar importancia a información que debería haber ignorado.
Si te lees Inverse Scaling in Test-Time Compute hablan justo de que algunos modelos consideraban la solución sencilla, pero después volvían a enredarse con detalles irrelevantes y terminaban respondiendo mal.
En una prueba de contar dos objetos con código absurdo, Claude Opus 4 pasó de una precisión casi perfecta a aproximadamente el 80 % al subir el razonamiento. La cosa es que había que contar hasta 2, pero se vino arriba.
Luego hay casos que se salen, porque OpenAI o3 mejoró con más esfuerzo en esa misma prueba, pero era pruebas para estudiar fallos.
Qué se recomienda sobre high y extra high
Con GPT-5.5 se advierte de posibles pérdidas de calidad al aumentar el esfuerzo cuando hay instrucciones contradictorias, criterios poco claros sobre cuándo terminar o acceso demasiado abierto a herramientas, incluso hace búsquedas innecesarias y razonamiento excesivo.
No hace falta que explique, que si usas el razonamiento superalto, y la respuesta no es tan buena, la respuesta de la API se te va facturar igualmente.
Ya pasó (pasa) con la ventana de contexto
Me recuerda a la carrera por tener la ventana de contexto más grande. Y hablo de hace menos de 1 año.
Pero poder meter más información no garantiza aprovecharla mejor. Y esto es algo que posiblemente ya lo sepais pero Lost in the Middle habló claramente que los modelos evaluados podían perder precisión cuando la información relevante quedaba en medio de un contexto largo, por eso amigos Codex sacó "auto-compaction".
Cómo elegir el nivel de razonamiento
Tener distintos modelos y niveles de razonamiento permite ajustar los recursos al trabajo. No hace falta probar todas las combinaciones. Yo aquí tengo una pequeña table para empezar.
| Caso de uso | Modelo | Razonamiento |
|---|---|---|
| Extraer datos, clasificar y resumir textos | GPT-5.6 Luna | Bajo |
| Reescribir textos y crear scripts sencillos | GPT-5.6 Luna | Bajo |
| Programación habitual, informes y hojas de cálculo | GPT-5.6 Terra | Medio |
| Comparar fuentes y preparar propuestas | GPT-5.6 Sol | Medio |
| Depuración compleja y decisiones de arquitectura | GPT-5.6 Sol | Alto |
| Investigación profunda con múltiples fuentes y contradicciones | GPT-6 Astra | Alto |
Sube el esfuerzo cuando puedas comprobar qué mejora. Tu factura ya sabe subir sola.