← Últimos artículos
💬 NLP

Characterizing Narrative Content in Web-scale LLM Pretraining Data

Este artículo introduce un nuevo marco de trabajo y un conjunto de datos, NarraDolma, para caracterizar la estructura narrativa detallada de los datos de preentrenamiento de los LLM a escala web, revelando que las cualidades narrativas están presentes de manera mensurable pero se distribuyen de forma desigual entre fuentes y temas de maneras que las prácticas de curación actuales pasan por alto.

Autores originales: Teagan Johnson, Elliott Ash, Andrew Piper, Maria Antoniak

Publicado 2026-06-19
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Teagan Johnson, Elliott Ash, Andrew Piper, Maria Antoniak

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás horneando un pastel gigante para una fiesta masiva. La receta pide "harina", pero no sabes qué tipo de harina tienes. ¿Es harina para pastel fina y sedosa? ¿Trigo integral grueso? ¿Está mezclada con arena?

Durante mucho tiempo, los científicos que construían "Modelos de Lenguaje Extensos" (LLM) —los cerebros de IA superinteligentes detrás de herramientas como los chatbots— han estado mezclando su "harina" (el texto de internet con el que entrenan) sin saber realmente cuáles son los ingredientes específicos. Sabían que algunas partes eran "tóxicas" o "sobre matemáticas", pero no sabían mucho sobre las historias que hay dentro de la mezcla.

Este artículo es como un equipo de científicos de alimentos que decidió tomar un microscopio para observar ese enorme montón de harina. Querían responder: ¿Cuánta narración hay realmente ahí dentro y cómo se ve?

Aquí está el desglose de su investigación:

1. El libro de recetas (El marco de trabajo)

Los investigadores no se limitaron a preguntar: "¿Es esto una historia?" (Sí/No). En su lugar, crearon un detallado perfil de sabor basado en cómo los humanos cuentan historias. Desglosaron la "narración" en tres ingredientes principales:

  • El Actor (Agencia): ¿Quién está realizando la acción? ¿Estamos viendo el mundo a través de sus ojos? ¿Sentimos sus emociones o escuchamos sus pensamientos? (Piensa en esto como el "corazón" de la historia).
  • El Escenario (Entorno): ¿Dónde y cuándo está sucediendo esto? ¿Es un "en algún lugar" vago, o es una habitación específica y polvorienta en el París de 1920? (Piensa en esto como el "telón de fondo").
  • La Trama (Eventos): ¿Qué sucede realmente? ¿Cambian las cosas? ¿Hay una cadena de causa y efecto, o es solo una lista de cosas? (Piensa en esto como la "acción").

Convirtieron esto en 11 "diales" o controles deslizantes específicos que pueden calificarse del 1 al 5.

2. La prueba de sabor (Los datos)

Tomaron una biblioteca masiva de texto de internet llamada DOLMA (que es enorme —3 billones de palabras, como una biblioteca que te tomaría toda una vida leer—).

  • Paso 1: No podían leerlo todo. Así que construyeron un asistente robot (un modelo llamado NARRABERT) para ayudarlos.
  • Paso 2: Primero, contrataron a expertos humanos para que leyeran 400 fragmentos aleatorios y los calificaran en esos 11 diales. Este fue el "estándar de oro".
  • Paso 3: Luego, enseñaron al asistente robot a imitar a los humanos.
  • Paso 4: El robot revisó 3 millones de fragmentos y los calificó a todos. Crearon un nuevo mapa llamado NARRADOLMA.

3. Los hallazgos sorprendentes

Cuando miraron el mapa, encontraron tres cosas importantes:

A. Las historias no están simplemente "encendidas" o "apagadas".
No es como un interruptor de luz donde un texto es una historia o no lo es. Es más como un regulador de intensidad (dimmer). Algunos textos son muy tenues (datos aburridos), otros son brillantes (novelas dramáticas), y la mayoría está en algún punto intermedio. Los investigadores descubrieron que la "narración" en internet es un paisaje continuo y multidimensional, no una categoría simple.

B. La "harina" está mezclada de forma desigual.
Si piensas que "Reddit" está lleno de historias y "Wikipedia" está llena de hechos, tienes razón en su mayor parte, pero es más complejo.

  • Reddit y los Libros son como un estante de especias lleno de "sentimientos internos" y "pensamientos de personajes". Son altos en los diales del "Actor".
  • Wikipedia y las Noticias son como un mapa. Son altos en "Eventos" y "Tiempo/Lugar", pero bajos en "Sentimientos".
  • Los blogs de viajes y comida son como una pintura. Son altos en "detalles sensoriales" (olores, vistas) pero bajos en "conflicto".

C. No puedes simplemente "añadir más historias" añadiendo más libros.
Los investigadores descubrieron que incluso dentro de una sola fuente (como Reddit), la "narración" varía enormemente. Algunos posts de Reddit son puro drama; otros son solo preguntas técnicas.

  • La Metáfora: Imagina que quieres que tu pastel sea más "esponjoso". Podrías pensar: "¡Añadiré más harina para pastel!". Pero si esa bolsa de harina en realidad contiene una mezcla de harina para pastel, arena y grava, añadir más de la misma bolsa no garantiza un pastel más esponjoso. Necesitas saber qué parte específica de la bolsa es la buena harina.

4. Por qué esto es importante

El artículo concluye que las personas que construyen modelos de IA han estado tratando sus fuentes de datos (como "Reddit" o "Noticias") como si todas fueran el mismo tipo de narrador. No lo son.

Si una IA es entrenada principalmente con "Noticias" (altos eventos, bajos sentimientos), podría ser buena informando hechos pero mala comprendiendo las emociones humanas. Si es entrenada principalmente con "Reddit" (altos sentimientos, baja estructura), podría ser buena en empatía pero mala en la lógica de causa y efecto.

La conclusión fundamental:
Este artículo no inventó una nueva IA ni arregló una que estuviera rota. En su lugar, construyó una cinta métrica para las historias de internet. Nos mostró que la parte de la "historia" en nuestros datos es desordenada, variada y está distribuida de forma desigual. Antes de que podamos enseñar a la IA a contar mejores historias, primero tenemos que entender exactamente qué tipo de historias hay actualmente en la mezcla.

Los investigadores han publicado su cinta métrica (el modelo) y su mapa (el conjunto de datos) para que cualquier otra persona pueda usarlos, de modo que todos podamos empezar a hornear mejores pasteles en el futuro.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →