Costes, contexto y evaluación de LLM
Una petición más barata a un modelo de lenguaje solo sirve si el resultado cumple lo que exige la tarea. Compara calidad, latencia y coste con los mismos ejemplos representativos. El esfuerzo de razonamiento, el contexto repetido y los formatos de datos son cambios distintos: cada uno necesita su propia medición y una comprobación de que el resultado sigue siendo útil.
Una guía de lectura de Idir OuhabMide la tarea completa
Establece una referencia antes de cambiar el modelo o las instrucciones. Define una respuesta aceptable, reúne entradas realistas y registra los fallos además de las ejecuciones correctas. Incluye llamadas a herramientas, reintentos y trabajo de revisión al comparar alternativas. Reducir los tokens de entrada no demuestra por sí solo un menor coste total por tarea completada, y razonar durante más tiempo no demuestra que la respuesta sea mejor.
Cambia una variable en una comparación repetible
En un flujo que extrae datos de documentos, conserva un pequeño conjunto de documentos representativos y los campos esperados. Ejecuta la configuración actual y compara después un cambio: el nivel de razonamiento, un prefijo estable y reutilizable o una representación distinta de la entrada. Comprueba los campos y la información que falta antes de comparar el consumo y el tiempo empleado. Incluye documentos poco habituales y peticiones fallidas. Guarda los ejemplos y la configuración del modelo junto a los resultados para repetir la comparación tras una actualización.
Un orden de lectura sugerido
Sigue el recorrido o empieza por la pregunta que necesitas resolver.
Extra high no siempre gana
Empieza por el argumento a favor de adaptar el esfuerzo de razonamiento a la tarea, en lugar de asumir que un nivel más alto siempre mejora el resultado.
Las sugerencias para elegir modelo son puntos de partida para evaluar, no una comparativa medida de tu carga de trabajo.
3 min de lectura
Prompt caching: guía técnica sobre la caché de prompts
Continúa con el contexto repetido y cómo un prefijo estable puede permitir su reutilización según las reglas de caché del proveedor.
La disponibilidad, la retención y los límites de caché dependen del modelo y de la API. Confirma el acierto de caché en los datos de uso antes de dar por hecho el ahorro.
4 min de lectura
Cometí un error sobre TOON y aquí están los datos que me demostraron que estaba equivocado
Lee la corrección de TOON antes de la propuesta original. Explica por qué hay que contrastar una reducción de tokens con la representación, la tarea y la calidad del resultado.
Esta corrección matiza la afirmación anterior; es el punto de partida para evaluar TOON en este recorrido.
4 min de lectura
TOON frente a JSON: ahorro de tokens y límites de la recomendación original
Lee el artículo original de TOON como el argumento histórico que dio lugar a la corrección, teniendo esta presente.
Contexto histórico: el ahorro del titular no es una recomendación general ni una garantía para los modelos y las entradas actuales.
3 min de lectura
Las empresas han descubierto que la inteligencia artificial cuesta dinero
Termina con el comentario sobre el retorno de la inversión para conectar las mediciones técnicas con la evidencia necesaria para decidir una inversión.
El artículo comenta resultados declarados en una encuesta y utiliza la sátira. Esas cifras no demuestran el retorno de un proyecto concreto.
5 min de lectura
Antes de decidir
Utiliza estas preguntas para concretar la siguiente decisión.
Define qué resultado cuenta
Elige tareas representativas y criterios de aceptación. Identifica fallos que vuelven inútil una respuesta aunque esté bien redactada.
Haz una comparación justa
Utiliza las mismas entradas y comprobaciones. Cambia un ajuste importante cada vez y registra las versiones del modelo, las instrucciones y las herramientas.
Consulta el consumo real
Revisa los datos de uso que devuelve la API y los precios y condiciones de caché vigentes del proveedor. Incluye reintentos, herramientas y la revisión necesaria para completar la tarea.
Repite la evaluación cuando algo cambie
Conserva los ejemplos difíciles en el conjunto de evaluación. Repite la comparación al cambiar el modelo, el contexto, el flujo o los criterios de aceptación.
Alcance y límites
Es una forma de plantear comparaciones, no una promesa de ahorro ni una tabla de precios actualizados. Los artículos combinan explicaciones técnicas, correcciones y opinión. Utiliza la documentación del proveedor y las mediciones de tu tarea para decidir cómo implementarla.
Comprueba los detalles de implementación
La caché depende del proveedor. Consulta la documentación de la API que utilizas: modelos compatibles, coincidencia de prefijos, retención y datos de uso.
Convierte una duda de costes en una decisión comprobable
Un taller puede trabajar con un ejemplo concreto de evaluación. Una asesoría puede revisar una comparación propuesta, la evidencia que necesita o el equilibrio entre coste y calidad de un flujo. La tarea, los datos disponibles y el alcance determinan el trabajo.