Análisis4 min de lectura

Cometí un error sobre TOON y aquí están los datos que me demostraron que estaba equivocado

Rectifico mi recomendación de TOON: el ahorro de tokens debe evaluarse junto con la precisión, la estructura de los datos y el modelo utilizado.

Escrito porIdir Ouhab

Me lancé a hablar de un tema sin haber investigado lo suficiente.

Portada de «Cometí un error sobre TOON y aquí están los datos que me demostraron que estaba equivocado»

Antes de escribir el artículo del 11 de noviembre de 2025, leí que TOON era la nueva forma de comunicarte con una IA: eficiente, rápido y facilísimo de leer. Y claro, yo, inocente de mí, pensé que con cambiar un parámetro ya podría abandonar mi querido JSON sin mirar atrás.

Ahora siento que he hecho trampas, y espero que me lo perdones. Pero, sobre todo, quiero enseñarte los datos que me han hecho cambiar de opinión.

Por qué me emocioné con TOON

Si no lo has visto aún, échale un ojo a mi post anterior, donde contaba maravillas de TOON como formato para ahorrar tokens (dinero). La promesa era clara: usar TOON permitía gastar entre un 30% y un 60% menos de tokens con la misma precisión.

Sonaba bien, ¿no?

La pregunta que encendió mis dudas

Compartí orgulloso mi artículo en LinkedIn. Entonces, Till Simon lanzó una pregunta aparentemente inocente: «¿El modelo responde con la misma calidad?»

Esa pregunta se me quedó clavada. Y me puse a investigar.

Lo que dicen de verdad los datos

Aquí es donde empieza lo interesante… y lo complicado.

La versión de los benchmarks oficiales de TOON de noviembre de 2025:

  • TOON: 68,7% de acierto con 4.389 tokens
  • JSON: 65,7% de acierto con 7.260 tokens
  • Ahorro de tokens: 39,5%

Tiene buena pinta, ¿no? TOON gana en ambos frentes.

Pero las pruebas independientes cuentan otra historia:

En los tests de improvingagents.com con datos tabulares usando GPT-4.1-nano:

  • TOON: 47,5% de acierto (puesto 9 de 12 formatos)
  • JSON: 52,3% de acierto
  • Markdown-KV: 60,7% (el mejor del test)

En la prueba separada con datos anidados y GPT-5-nano:

  • TOON: 43,1% de acierto (último)
  • JSON: 50,3%
  • YAML: 62,1%

¿Por qué salen resultados tan distintos?

Después de comparar ambos benchmarks, esto es lo que he aprendido:

1. Importan los datos y la tarea Las pruebas usaron datos y preguntas distintos. Sus autores no identificaron qué diferencias causaron la brecha; los resultados no demuestran que el benchmark oficial se diseñara para favorecer a TOON.

2. El rendimiento cambia muchísimo según el modelo

  • GPT-5-nano con TOON: 88,6% en los tests oficiales, pero solo 43,1% en datos anidados
  • Claude Haiku con TOON: 50,7%
  • Elegir un modelo u otro cambia completamente el resultado

3. El ahorro de tokens es real, pero… En esa prueba tabular, Markdown-KV tuvo la mayor precisión, pero usó 52.104 tokens, frente a los 21.518 de TOON. La comparación no demuestra por qué cambió la precisión.

Lo que debería haberte contado

Lo que probaría:

  • TOON, JSON compacto y otros formatos adecuados con las mismas entradas
  • El modelo, el prompt y la tarea exactos de la aplicación
  • Calidad, tokens y coste total, incluidos los reintentos

Conserva JSON donde lo exija el contrato de la API. Estos resultados no justifican una regla universal para GPT-5, Claude, modelos pequeños o sistemas en producción.

Lo que he aprendido

El comportamiento de un LLM depende de más factores que el formato de entrada. Cambiar solo el formato de los datos altera el sistema de formas que aún no entendemos del todo. Lo que funciona en un caso se desmorona en otro.

La lección real: prueba siempre las cosas tú mismo. No te fíes del hype, incluido el de mi artículo anterior.

TOON es una herramienta interesante y especializada. Mi recomendación original era demasiado amplia: mide el consumo de tokens y la calidad de las respuestas en tu tarea antes de cambiar de formato.


Fuentes:

Sobre el autor

Idir Ouhab

Ingeniero de despliegue de IA en OpenAI, formador y creador de Prompt&Play. Escribo sobre lo que aprendo llevando la IA a producción.

Tu siguiente paso

¿Tu equipo está trabajando en algo parecido?

Descubre en un minuto en qué etapa está tu proyecto, del prompt a producción, y cuál sería tu siguiente paso.

Compartir

Temas

  • toon
  • análisis de datos
  • corrección
  • ideas
  • error
  • aprendizaje
  • evidencia
  • investigación
  • revisión
Siempre activo

Recuerda tu idioma y tus preferencias de cookies. Una cookie de sesión independiente mantiene el acceso de administración. No se utilizan para publicidad.

Tu elección es válida durante 180 días en este navegador. Las finalidades opcionales están desactivadas inicialmente. Si el almacenamiento del navegador no está disponible, tu elección solo se conserva en esta página.

Puedes retirar tu permiso aquí en cualquier momento. Si ya se ha cargado contenido opcional, la página se recarga para detenerlo; podrían perderse cambios de formularios que no hayas enviado.

Cómo se utilizan las cookies y el almacenamiento