Volver al blog
Opinión4 min de lectura

¿Están los LLMs perdiendo su inteligencia?

Me preocupa que el contenido generado sin criterio vuelva a los datos de entrenamiento: una reflexión sobre la calidad de las fuentes, no una prueba de que todos los LLM empeoren.

Escrito por

Idir Ouhab

Registro editado el 6 sept 2026

Uno de los mejores avances del siglo XXI ha sido traer la inteligencia artificial a nuestras casas. Ya no solo para ayudarnos a preguntarle a ChatGPT cuál es la altura de un caniche, sino para usarla en tareas un poco más útiles (no mucho más) como ayudarme a hacer mejor mi trabajo.

Pero en este post no vengo a hablarte de automatizaciones, sino de la calidad de los datos que se usan para entrenar a los ya famosos LLM. Si no sabes lo que es un LLM te recomiendo que veas este vídeo de Dot CSV antes de continuar.

😡🤬 Los malditos emojis 🤯🚀

¿Cuántos emojis han aparecido de repente en los posts de LinkedIn, Facebook y demás redes sociales de los pseudocreadores de contenido? ¿Cuántos de ellos crees que son generados?

AñoImpacto de IAEstadísticas notables
2024IA predictiva😭 usado 761M veces
2025Inserción automatizada (IA)Adopción de emoji commits subió 3x a 75%

Fuentes:

¿Y por qué importa esto? Porque esos emojis automáticos son solo la señal visible de un problema mucho más profundo: contenido generado que se está convirtiendo en verdad.

Las nuevas páginas de la verdad

Como he dicho, estamos inundando internet con texto generado por IA y eso se almacenará durante años, y eso será la nueva verdad.

Ten en cuenta que la información suele caducar rápido, así que el nuevo contenido es lo que se considera veraz porque aún no ha caducado.

Así que el post generado por IA que ha hecho Jaime Jimenez Jerga, ahora se convierte en... 🥁 LA INFORMACIÓN QUE LA IA VA A USAR PARA ENTRENARSE

IA que se entrena con IA

¿Conocéis el juego de los espejos? Pues esto es algo parecido:

  1. Una IA genera el post para Mr. Wonderful
  2. Mr. Wonderful lo publica en LinkedIn, en Twitter y hasta en su mensaje de Buenos días a sus padres
  3. Google lo almacena y lo indexa.
  4. Otros LLM lo leen y lo interpretan como contenido válido.

¿Se puede llamar esto autofagia digital?

El colapso del modelo

Ese riesgo tiene un nombre: colapso del modelo. Me preocupa que entrenar modelos con contenido generado por otros modelos, sin cuidar la calidad y la diversidad de los datos, termine produciendo resultados 💩.

Un estudio de Nature de 2024 demostró que después de solo 5 generaciones de entrenamiento con datos sintéticos, los modelos perdían hasta un 50% de su capacidad de generar contenido diverso.

Fuentes:

La salvación del ser humano

Al hablar de este tema con mi compañero Mandip Gosal, de n8n, surgió una posibilidad: recurrir al lenguaje hablado.

Es decir, a día de hoy, aún no hemos introducido la IA de manera rutinaria en nuestras interacciones verbales con otras personas, por lo que las transcripciones de las conversaciones podrían ser la clave para mantener unos modelos sólidos y limpios de ruido digital.

¡AYUDA!

Dos cosas que puedes hacer HOY:

  1. Verifica todo: Dedica cinco minutos más a revisar que los datos sean correctos.
  2. Aporta tu experiencia única: La IA no ha vivido tu experiencia, úsala.

El problema no es usar IA, es usarla sin pensamiento crítico.

Temas

modelos de lenguajeinteligencia artificialLLMtecnologíaprocesamiento de lenguaje naturaldesafíos de IAaprendizaje automáticointeligencia