Me lancé a hablar de un tema sin haber investigado lo suficiente.

Antes de escribir el artículo del 11 de noviembre de 2025, leí que TOON era la nueva forma de comunicarte con una IA: eficiente, rápido y facilísimo de leer. Y claro, yo, inocente de mí, pensé que con cambiar un parámetro ya podría abandonar mi querido JSON sin mirar atrás.
Ahora siento que he hecho trampas, y espero que me lo perdones. Pero, sobre todo, quiero enseñarte los datos que me han hecho cambiar de opinión.
Por qué me emocioné con TOON
Si no lo has visto aún, échale un ojo a mi post anterior, donde contaba maravillas de TOON como formato para ahorrar tokens (dinero). La promesa era clara: usar TOON permitía gastar entre un 30% y un 60% menos de tokens con la misma precisión.
Sonaba bien, ¿no?
La pregunta que encendió mis dudas
Compartí orgulloso mi artículo en LinkedIn. Entonces, Till Simon lanzó una pregunta aparentemente inocente: «¿El modelo responde con la misma calidad?»
Esa pregunta se me quedó clavada. Y me puse a investigar.
Lo que dicen de verdad los datos
Aquí es donde empieza lo interesante… y lo complicado.
La versión de los benchmarks oficiales de TOON de noviembre de 2025:
- TOON: 68,7% de acierto con 4.389 tokens
- JSON: 65,7% de acierto con 7.260 tokens
- Ahorro de tokens: 39,5%
Tiene buena pinta, ¿no? TOON gana en ambos frentes.
Pero las pruebas independientes cuentan otra historia:
En los tests de improvingagents.com con datos tabulares usando GPT-4.1-nano:
- TOON: 47,5% de acierto (puesto 9 de 12 formatos)
- JSON: 52,3% de acierto
- Markdown-KV: 60,7% (el mejor del test)
En la prueba separada con datos anidados y GPT-5-nano:
- TOON: 43,1% de acierto (último)
- JSON: 50,3%
- YAML: 62,1%
¿Por qué salen resultados tan distintos?
Después de comparar ambos benchmarks, esto es lo que he aprendido:
1. Importan los datos y la tarea Las pruebas usaron datos y preguntas distintos. Sus autores no identificaron qué diferencias causaron la brecha; los resultados no demuestran que el benchmark oficial se diseñara para favorecer a TOON.
2. El rendimiento cambia muchísimo según el modelo
- GPT-5-nano con TOON: 88,6% en los tests oficiales, pero solo 43,1% en datos anidados
- Claude Haiku con TOON: 50,7%
- Elegir un modelo u otro cambia completamente el resultado
3. El ahorro de tokens es real, pero… En esa prueba tabular, Markdown-KV tuvo la mayor precisión, pero usó 52.104 tokens, frente a los 21.518 de TOON. La comparación no demuestra por qué cambió la precisión.
Lo que debería haberte contado
Lo que probaría:
- TOON, JSON compacto y otros formatos adecuados con las mismas entradas
- El modelo, el prompt y la tarea exactos de la aplicación
- Calidad, tokens y coste total, incluidos los reintentos
Conserva JSON donde lo exija el contrato de la API. Estos resultados no justifican una regla universal para GPT-5, Claude, modelos pequeños o sistemas en producción.
Lo que he aprendido
El comportamiento de un LLM depende de más factores que el formato de entrada. Cambiar solo el formato de los datos altera el sistema de formas que aún no entendemos del todo. Lo que funciona en un caso se desmorona en otro.
La lección real: prueba siempre las cosas tú mismo. No te fíes del hype, incluido el de mi artículo anterior.
TOON es una herramienta interesante y especializada. Mi recomendación original era demasiado amplia: mide el consumo de tokens y la calidad de las respuestas en tu tarea antes de cambiar de formato.
Fuentes:

Conversación
Comentarios
No hay comentarios publicados