← Últimos artículos
💬 NLP

Measuring AI "Slop" in Text

Este artículo aborda la falta de una definición estándar para el "slop" de la IA mediante el desarrollo de una taxonomía y dimensiones interpretables a través de entrevistas con expertos, demostrando que, si bien los juicios binarios son subjetivos, estos se correlacionan con factores latentes como la coherencia y la relevancia para permitir una mejor evaluación del texto generado por IA.

Autores originales: Chantal Shaib, Tuhin Chakrabarty, Diego Garcia-Olano, Byron C. Wallace

Publicado 2026-01-27
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Chantal Shaib, Tuhin Chakrabarty, Diego Garcia-Olano, Byron C. Wallace

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que el internet es un mercado gigante y bullicioso. Durante mucho tiempo, los vendedores (humanos) vendieron productos frescos y hechos a mano. Pero recientemente, ha llegado una inundación de artículos baratos y producidos en masa. Se ven bien desde la distancia, pero de cerca, se sienten endebles, repetitivos y vacíos. En el mundo de la IA, la gente ha empezado a llamar a este contenido de baja calidad generado por IA "slop" (basura o contenido de relleno).

Este artículo es como un equipo de expertos intentando construir un manual de control de calidad para este slop. Quieren responder dos grandes preguntas: ¿Qué es exactamente lo que hace que un texto se sienta como "slop"? y ¿Podemos construir una máquina que lo detecte automáticamente?

Aquí está el desglose de sus hallazgos, utilizando analogías sencillas:

1. Definiendo el "Slop" (La Taxonomía)

Los investigadores no solo adivinaron qué es el slop. Entrevistaron a 19 expertos —escritores, periodistas, filósofos y científicos de la IA— para obtener una definición clara. Se dieron cuenta de que el slop no es solo una cosa; es una mezcla de tres problemas principales, como una mala comida que está demasiado salada, demasiado insípida y servida en un plato sucio.

Organizaron estos problemas en una lista de verificación llamada Taxonomía:

  • Utilidad de la Información (El "Cuenco Vacío"):
    • Densidad: El texto está lleno de palabras pero tiene muy poca carne real. Es como una sopa que es 90% agua y 10% caldo.
    • Relevancia: El texto habla de cosas que no importan a la pregunta realizada. Es como pedir una hamburguesa y recibir una conferencia sobre la historia de las vacas.
  • Calidad de la Información (Los "Ingredientes Podridos"):
    • Veracidad: El texto inventa cosas o comete errores de hecho (alucinaciones).
    • Sesgo: El texto suena demasiado robótico o neutral cuando debería tener una voz humana, o toma una postura extraña y unilateral.
  • Calidad del Estilo (La "Mala Presentación"):
    • Repetición y Estructura de Plantilla: La IA sigue diciendo lo mismo o utiliza la misma estructura de oración una y otra vez, como un disco rayado.
    • Verbosidad: Utiliza 100 palabras para decir lo que podría decirse en 10. Es "palabrero" sin ser "sabio".
    • Coherencia y Tono: Las ideas no fluyen lógicamente, o el tono se siente extraño (como un robot intentando contar un chiste).

2. La Prueba Humana (Anotando el "Slop")

Para ver si su lista de verificación funcionaba, contrataron a editores de textos profesionales para que leyeran 150 artículos de noticias y 100 pasajes de preguntas y respuestas (Q&A). Pidieron a los editores que resaltaran las partes "descuidadas" (sloppy) del texto.

La Sorpresa:
Incluso los expertos no siempre estaban de acuerdo en qué era "slop".

  • El Problema de la Subjetividad: Un editor puede pensar que un texto es "slop" porque es demasiado verboso, mientras que otro piensa que está bien.
  • La Conexión: Sin embargo, cuando los editores sí coincidían en que un texto era slop, generalmente era porque el texto carecía de relevancia (no respondía a la pregunta) o de densidad (era demasiado vacío).
  • La Diferencia de Dominio:
    • En Noticias, el slop se trataba principalmente de mal estilo y tono (demasiado formal, demasiado repetitivo).
    • En Preguntas y Respuestas (Q&A), el slop se trataba principalmente de cometer errores de hechos o de ser estructuralmente desordenado.

3. ¿Pueden las Máquinas Detectarlo? (El Control Automático)

Los investigadores intentaron ver si las herramientas de IA actuales podían detectar este slop automáticamente sin ayuda humana. Probaron tres cosas:

  1. Métricas Matemáticas Estándar: Utilizaron herramientas matemáticas de la vieja escuela (como contar la longitud de las palabras o verificar palabras repetidas).
    • Resultado: Estas herramientas eran aceptables para detectar texto "palabrero", pero fallaron al intentar captar lo sutil, como "¿es esto relevante?" o "¿tiene sentido?".
  2. Modelos de Recompensa de IA: Utilizaron modelos de IA avanzados entrenados para calificar la calidad de la escritura.
    • Resultado: Estos modelos podían notar la diferencia entre una escritura "buena" y una "mala" en general, pero no podían identificar específicamente el "slop" tal como lo definieron los humanos. Perdieron el matiz.
  3. Jueces de IA (LLMs como Jueces): Pidieron a modelos de IA potentes (como GPT-5 y otros) que leyeran el texto y dijeran: "¿Es esto slop?" y "Resalta las partes malas".
    • Resultado: Fallaron estrepitosamente. Los jueces de IA fueron terribles en esto. A menudo pasaban por alto el slop por completo o resaltaban las partes incorrectas. Tendían a enfocarse solo en la "verbosidad" e ignoraban todo lo demás.

La Conclusión Final

El artículo concluye que, si bien tenemos una buena lista de verificación definida por humanos sobre cómo luce el "slop" (se trata principalmente de ser irrelevante, vacío o repetitivo), todavía no tenemos un robot confiable que pueda encontrarlo automáticamente.

Actualmente, si quieres saber si un texto es "slop", todavía necesitas a un humano que lo lea y use su juicio. Las herramientas automáticas son como un detector de metales que solo encuentra rocas grandes pero pierde de vista las pequeñas gemas valiosas (o los pequeños y molestos trozos de basura) escondidos en la arena.

Lo que el artículo NO afirma:

  • No dice que debamos prohibir la escritura por IA.
  • No afirma que este método vaya a arreglar la IA en el futuro (solo dice que es un desafío abierto).
  • No sugiere usar esto para decisiones médicas o legales.
  • Se enfoca estrictamente en definir el problema y mostrar que las soluciones automatizadas actuales aún no están listas para resolverlo.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →