Pretraining Language Models on Historical Text
Este artículo presenta TypewriterLM, un modelo de lenguaje de 7.24B entrenado exclusivamente en textos en inglés anteriores a 1913, junto con su correspondiente TypewriterCorpus de 54B de tokens, conjuntos de datos de post-entrenamiento léxicamente fundamentados y el benchmark History-Event para abordar los desafíos en la calidad de los datos, la filtración temporal y la evaluación para modelos de lenguaje históricos.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que estás tratando de enseñarle a un viajero en el tiempo a hablar y pensar exactamente como alguien que vive en el año 1912. Si le das un libro de texto moderno o le permites navegar por internet, accidentalmente aprenderá sobre aviones, el internet y las teorías de la relatividad de Einstein. Entonces, podría decirte con confianza que los "computadores" son las grandes máquinas en tu sótano, sin darse cuenta de que en 1912, un "computador" era una persona que hacía cálculos a mano.
Este es el problema que los autores de este artículo están resolviendo. Construyeron una IA especial, llamada TYPEWRITERLM, que tiene estrictamente prohibido saber cualquier cosa que haya sucedido después de 1913.
Así es como lo hicieron, explicado mediante analogías sencillas:
1. La biblioteca de la "Cápsula del Tiempo" (Los Datos)
Para entrenar esta IA, los investigadores no pudieron usar el internet moderno. En su lugar, construyeron una enorme biblioteca digital llamada TYPEWRITERCORPUS.
- La Fuente: Reunieron 54 mil millones de palabras de libros antiguos, registros parlamentarios, artículos científicos y transcripciones judiciales de los años 1700 a 1913.
- La Limpieza: Los libros antiguos escaneados por computadoras suelen tener "errores" (como las palabras "Digitalizado por Google" o números de página modernos). El equipo actuó como bibliotecarios estrictos, eliminando cada artefacto moderno, URL o nota anacrónica para asegurar que la biblioteca fuera puramente histórica.
- El Resultado: Una enorme pila de texto que representa el mundo exactamente como era antes de la Primera Guerra Mundial.
2. La regla del "Bibliotecario Estricto" (Ajuste de Instrucciones)
Normalmente, cuando enseñamos a una IA a seguir instrucciones, usamos ejemplos modernos o pedimos a una IA superinteligente moderna que escriba las respuestas. Pero eso arruinaría la "precisión de la época" del viajero en el tiempo.
Por ello, los investigadores inventaron un nuevo método llamado Ajuste de Instrucciones con Base Léxica.
- La Analogía: Imagina que estás jugando un juego en el que debes responder preguntas usando solo las palabras encontradas en un libro antiguo específico. No puedes inventar palabras nuevas ni usar jerga moderna.
- El Proceso: Crearon dos nuevos conjuntos de datos (HISTORY-LIMA y HISTORY-SELFINSTRUCT). Para cada pregunta que se le hace a la IA, la respuesta se construye directamente a partir del texto de los documentos de la era de 1913. Si la palabra "avión" no está en el texto de origen, la IA no tiene permitido usarla. Esto asegura que la IA no "filtre" accidentalmente conocimiento moderno en sus respuestas.
3. La "Prueba de la Sorpresa" (Evaluación)
¿Cómo sabes si la IA realmente desconoce el futuro? La prueban con una "Prueba de la Sorpresa" llamada HISTORY-EVENT.
- La Prueba: Le mostraron a la IA descripciones de eventos históricos.
- Evento A: Ocurrió en 1850 (Antes del límite de corte).
- Evento B: Ocurrió en 1950 (Después del límite de corte).
- La Reacción: Midieron qué tan "sorprendida" estaba la IA al leer el texto.
- Cuando la IA (TYPEWRITERLM) leyó sobre eventos de 1950, estaba genuinamente confundida y sorprendida, como si nunca hubiera oído hablar de ellos.
- En contraste, una IA moderna estándar (como Llama) no estaba sorprendida en absoluto; conocía los hechos porque los había leído durante su entrenamiento.
- La Verificación de Filtraciones: También revisaron si la IA sabía accidentalmente hechos que no debería conocer. Descubrieron que, aunque la IA era muy buena manteniéndose en el pasado, una fracción diminuta, muy pequeña, de información moderna aún se "filtraba" (menos del 1%), demostando que mantener una máquina del tiempo perfectamente sellada es increíblemente difícil.
4. Los Resultados
- El Viajero en el Tiempo: La IA resultante (TYPEWRITERLM) es un modelo de 7.24 mil millones de parámetros que habla y razona como una persona de 1913.
- La Comparación: Cuando se probó en acertijos de lógica general, compitió competitivamente contra otras IAs históricas, a pesar de haber sido entrenada con mucha menos información que los modelos modernos.
- La Lección: El artículo demuestra que se puede construir una IA inteligente que sea "ciega" al futuro, siempre que se sea extremadamente cuidadoso con los datos que se le suministran y con la forma en que se le enseña a responder preguntas.
En resumen: Los autores construyeron una máquina del tiempo digital. Le alimentaron solo con libros antiguos, le enseñaron a responder preguntas usando solo las palabras encontradas en esos libros, y demostraron que realmente no sabe qué sucede después de 1913. Esto permite a historiadores e investigadores estudiar el pasado sin que la IA accidentalmente "arruine" la trama con conocimiento moderno.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.