An Information-Theoretic Approach to Identifying Formulaic Clusters in Textual Data
Este artículo presenta un algoritmo de teoría de la información que utiliza distribuciones de autoinformación ponderadas para identificar cúmulos formulaicos y capas estilísticas en datos textuales de alta dimensión, demostrando su eficacia en el análisis cuantitativo de patrones compositivos dentro de la Biblia hebrea multiautor.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que eres un detective tratando de resolver un misterio dentro de una biblioteca antigua y masiva. Esta biblioteca no solo está llena de historias aleatorias; es una colección de textos que han sido escritos, editados y copiados por cientos de personas diferentes a lo largo de miles de años. Algunas partes fueron escritas por un solo autor con una voz única, mientras que otras fueron ensambladas a partir de diferentes fuentes, como un retal de tela. El desafío es: ¿cómo averiguar a qué sastre pertenece cada retal sin tener que preguntar a los sastres? No puedes simplemente mirar las palabras porque algunos escritores podrían usar las mismas palabras por razones distintas. Necesitas una forma de medir el "ritmo" o la "predictibilidad" de la escritura.
Aquí es donde entra en juego una rama de la ciencia llamada Teoría de la Información. Piensa en esto como una forma de medir qué tan sorprendido te sientes cuando lees la siguiente palabra en una oración. Si estás leyendo una historia donde cualquier cosa puede pasar, estás constantemente sorprendido; el contenido de información es alto, y la escritura se siente "suelta" o "creativa". Pero si estás leyendo una receta o un contrato legal, sabes exactamente qué palabra sigue. "Añada una taza de..." casi siempre va seguido de "harina". Esa predictibilidad significa que el contenido de información es bajo porque el patrón es rígido y repetitivo. En este artículo, los autores utilizan este concepto de "sorpresa" (o falta de ella) para encontrar patrones ocultos en textos antiguos. Quieren ver si pueden detectar automáticamente las secciones "similares a una receta" de un libro frente a las secciones "similares a una historia", simplemente midiendo qué tan predecibles son las palabras.
La nueva herramienta del detective
Los autores, Gideon Yoffe, Yair Segev y Barak Sober, han construido una nueva lupa digital. La llaman un enfoque informacional-teórico no supervisado. Desglosemos eso: "No supervisado" significa que la computadora no necesita un maestro que le diga qué buscar; ella lo descubre por sí misma. "Informacional-teórico" significa que utiliza las matemáticas para medir la predictibilidad.
Su idea principal es simple pero poderosa: El texto formulaico es predecible. Cuando un escritor utiliza una estructura rígida, como una lista de ancestros o un conjunto de leyes religiosas, repite las mismas frases una y otra vez. Debido a que estas frases aparecen con tanta frecuencia, se vuelven muy predecibles. En el lenguaje de la teoría de la información, las cosas predecibles tienen una baja auto-información (baja sorpresa). La narrativa creativa e impredecible tiene una alta auto-información (alta sorpresa).
El equipo desarrolló un algoritmo que escanea un texto, buscando fragmentos de escritura que sean inusualmente predecibles. No solo adivina; calcula una puntuación para cada parte del texto basada en qué tan "sorprendido" estaría un modelo de probabilidad por las palabras que ve. Si una sección está llena de frases formulaicas y repetitivas, el modelo no se sorprende en absoluto y la puntuación se mantiene baja. Si la sección es una narrativa salvaje y creativa, la puntuación sube. Al agrupar las secciones de baja puntuación, el algoritmo puede aislar los "clústeres formulaicos": las partes del texto que se sienten como si hubieran sido escritas por una mano diferente o para un propósito distinto.
Probando la herramienta en textos antiguos
Para ver si su nueva herramienta realmente funciona, los autores la probaron en la Biblia Hebrea, específicamente en los tres primeros libros: Génesis, Éxodo y Levítico. Estos libros son famosos entre los estudiosos por ser "compuestos", lo que significa que se cree que están hechos de diferentes fuentes entrelazadas. Una de las preguntas más debatidas es cómo separar la Fuente Sacerdotal (P) —que es conocida por ser muy estructurada, legalista y repetitiva— de las otras partes narrativas del texto.
Los investigadores no solo miraron las palabras; miraron la estructura de las palabras. Dividieron el texto en pequeños fragmentos (como oraciones o versículos) y contaron con qué frecuencia aparecían ciertos patrones. Luego ejecutaron su algoritmo para ver si podía separar naturalmente el texto en dos grupos: uno que era altamente repetitivo (baja sorpresa) y otro que era más variado (alta sorpresa).
Esto es lo que encontraron:
- En Génesis: Observaron la diferencia entre las largas y aburridas listas de árboles genealógicos (genealogías) y las emocionantes historias de Abraham e Isaac. El algoritmo identificó con éxito las genealogías como el clúster altamente predecible y formulaico. Esto tiene sentido porque las listas familiares siguen un patrón estricto y repetitivo, mientras que las historias son más fluidas.
- En Éxodo: Probaron la separación entre las secciones Sacerdotales (P) (que contienen leyes sobre la construcción del Tabernáculo y rituales religiosos) y las secciones narrativas no sacerdotales. El algoritmo separó de manera confiable estas dos capas, coincidiendo con lo que los estudiosos tradicionales han creído durante mucho tiempo. Las partes Sacerdotales aparecieron como la zona de "baja sorpresa" porque están llenas de instrucciones repetitivas.
- En Levítico: Esta fue la prueba más difícil. Levítico está lleno de leyes, pero los estudiosos debaten si contiene dos capas diferentes: la Fuente Sacerdotal (P) y un "Código de Santidad" (H) posterior. Ambos son repetitivos, pero tienen diferencias sutiles. Los autores encontraron que su método podía distinguir entre ellos, pero solo cuando miraban el texto a través de la "lente" adecuada. Dependiendo de cómo dimensionaran los fragmentos de texto analizados, el algoritmo a veces resaltaba las reglas Sacerdotales como las más repetitivas, y otras veces resaltaba el Código de Santidad. Esto sugiere que ambos son formulaicos, pero siguen diferentes tipos de patrones que se manifiestan a distintas escalas.
¿Qué tan seguros están?
Los autores son cuidadosos de no afirmar que han resuelto el misterio de la Biblia de una vez por todas. En cambio, muestran que su método sugiere una forma de cuantificar estas diferencias.
Primero probaron su algoritmo con datos falsos generados por computadora para asegurarse de que pudiera encontrar patrones en un entorno controlado. En esas simulaciones, su método funcionó mejor que las herramientas de agrupamiento estándar (como k-means o Modelos de Mezcla Gaussiana), especialmente cuando los datos eran dispersos y de alta dimensionalidad (que es exactamente como son los textos antiguos).
Cuando aplicaron su método a la Biblia real, los resultados fueron prometedores pero matizados. En el libro de Éxodo, su método coincidió con las clasificaciones de los expertos en el 68% de las diferentes configuraciones de parámetros que probaron, en comparación con solo el 30% del método k-means estándar. En Génesis, coincidió en el 40% de los casos frente al 14.6% de k-means. En Levítico, coincidió en el 45.5% de los casos frente al 29.8% de k-means.
Estos números sugieren que el enfoque de la teoría de la información es una herramienta sólida para encontrar estas capas ocultas, pero no es una varita mágica que funcione perfectamente siempre. El hecho de que los resultados cambien dependiendo de cómo se divida el texto (el tamaño de los grupos de palabras y la ventana de versículos) nos dice que la naturaleza "formulaica" de estos textos es compleja. No es una sola cosa; es una mezcla de patrones que aparecen a diferentes escalas.
Por qué esto es importante
Este artículo no solo nos da una nueva forma de clasificar libros; nos ofrece una nueva forma de escucharlos. Al usar las matemáticas para medir la "sorpresa", los autores proporcionan una forma objetiva de ver dónde cambia el ritmo de un texto. Si una historia de repente se vuelve muy predecible, puede ser una señal de que un autor diferente tomó la pluma, o que el texto fue copiado de una plantilla.
Los autores concluyen que este método es particularmente útil para textos que han sido editados y superpuestos a lo largo del tiempo, como la Biblia Hebrea. Permite a los investigadores ver el "andamiaje estructural" de un texto sin necesidad de adivinar de antemano qué palabras son importantes. No demuestra exactamente quién escribió qué, pero proporciona un marco cuantitativo que respalda muchas de las teorías tradicionales sobre cómo se compusieron estos libros antiguos. Convierte el arte del análisis literario en una ciencia de patrones, mostráéndonos que incluso en las historias más complejas, las huellas dactilares de la estructura y la repetición pueden encontrarse si sabes cómo medir la sorpresa.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.