← Últimos artículos
💬 NLP

Unfolding Scientific Papers into Multi-Turn Generation Trajectories for Continued Pre-Training

Este artículo presenta un flujo de trabajo que transforma artículos científicos estructurados en trayectorias de generación de múltiples turnos para el preentrenamiento continuo y la evaluación comparativa, demostrando que este enfoque mejora significativamente las capacidades de escritura académica al tiempo que preserva el razonamiento general y la comprensión de documentos extensos.

Autores originales: Qiankai Xu, Qiguang Chen, Zixin Su, Wenhao Huang, Yue Gao, Jiaheng Liu, Ge Zhang

Publicado 2026-08-27
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Qiankai Xu, Qiguang Chen, Zixin Su, Wenhao Huang, Yue Gao, Jiaheng Liu, Ge Zhang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Los modelos de lenguaje extensos, los poderosos programas informáticos que pueden escribir historias, resolver problemas y responder preguntas, han llegado a un punto en el que se están quedando sin texto humano fresco y de alta calidad para aprender. Durante años, los investigadores han alimentado estos sistemas con vastas cantidades de libros, sitios web y artículos. Ahora, a medida que la mejor escritura humana escasea, los científicos están recurriendo a los datos sintéticos: texto creado por las propias computadoras. Un enfoque común ha sido tomar artículos web cortos existentes y reescribirlos en formatos más limpios y similares a los de un libro de texto. Sin embargo, este método cambia el contenido original y trata a los documentos como simples flujos de palabras, ignorando cómo un autor humano realmente planeó y estructuró una pieza de escritura. Una idea más reciente sugiere que, en lugar de simplemente reescribir el texto final, deberíamos intentar reconstruir el proceso de pensamiento oculto que lo condujo. El desafío ha sido que la mayoría del texto existente es demasiado corto para tener una estructura compleja, dejando poco espacio para recuperar el plan original del autor.

Un equipo de investigadores ha tomado ahora este concepto y lo ha aplicado a artículos científicos, los cuales están escritos con una estructura clara y uniforme y con ideas densas y comprimidas. Desarrollaron un método para "desplegar" un artículo científico terminado de vuelta hacia el viaje de múltiples pasos de su creación. Imagine una casa terminada; en lugar de solo mirar las paredes, este proceso reconstruye el boceto inicial del arquitecto, la lista de materiales, las notas tomadas antes de colocar cada ladrillo y la inspección final que llevó al plano. Los investigadores construyeron un sistema que toma un artículo científico real y trabaja hacia atrás para generar la solicitud de escritura que lo inició, el plan global de sus secciones y los pensamientos específicos que un autor habría tenido antes de escribir cada párrafo. Crucialmente, el texto real del artículo permanece exactamente como lo escribieron los autores originales; el sistema solo inventa el proceso de pensamiento circundante que explica cómo llegó a ser ese texto.

El equipo aplicó este proceso de despliegue a 1.8 millones de artículos científicos del repositorio arXiv, una colección masiva de investigaciones preimpresas. Al ejecutar esta reconstrucción en artículos desde 2006 hasta principios de 2026, transformaron 30 mil millones de palabras de texto de artículos brutos en un nuevo conjunto de datos de entrenamiento que contiene aproximadamente 60 mil millones de palabras de "trayectorias". Cada trayectoria es una conversación de múltiples turnos donde una computadora actúa como un profesor, primero pidiendo un artículo, luego trazando un plan, luego deliberando sobre cómo escribir cada sección antes de finalmente producir el texto real. Este proceso efectivamente duplicó el tamaño de los datos de entrenamiento y también extendió la longitud de los documentos que los modelos debían procesar, moviendo el promedio de la longitud del documento de entrenamiento de unas 11,000 palabras a casi 29,000 palabras. Los investigadores encontraron que usar este proceso de pensamiento reconstruido ayudó a los modelos a aprender a escribir mucho mejor que simplemente alimentarlos con los mismos artículos como texto plano.

Los resultados mostraron que este método mejoró las habilidades de escritura de los modelos en todos los ámbitos, incluyendo contextos académicos e de ingeniería, sin perjudicar su capacidad para razonar o resolver acertijos lógicos. Incluso cuando los modelos fueron posteriormente ajustados con otros conjuntos de datos de escritura pública, los modelos que primero aprendieron de estas trayectorias "desplegadas" siguieron desempeñándose mejor que aquellos que no lo habían hecho. El estudio también demostró que esta misma técnica de ingeniería inversa podía usarse para crear nuevos tipos de datos de instrucción e incluso un nuevo campo de prueba para la escritura académica. Al tomar un artículo que el modelo nunca había visto antes, el sistema podía generar una pregunta específica sobre él, junto con una lista de verificación detallada y una guía de calificación para evaluar la respuesta. Esto creó un referente llamado PAW-Bench, que contiene casi 3,000 tareas ancladas en investigaciones reales.

Uno de los hallazgos más sorprendentes fue que el tamaño del modelo de computadora utilizado para generar el proceso de pensamiento importaba menos que el método mismo. Los investigadores utilizaron tres modelos diferentes para crear los datos de pensamiento: uno pequeño, uno mediano y uno grande. Contrario a la intuición de que un modelo más inteligente y grande produciría mejores datos de entrenamiento, el más pequeño fue el que produjo mejores resultados para la escritura y el razonamiento. Los datos generados por los modelos más grandes eran demasiado uniformes y repetitivos, mientras que los datos del modelo más pequeño contenían más variedad y "sorpresas" que obligaban al modelo de aprendizaje a trabajar más duro y aprender de manera más efectiva. Esto sugiere que el valor reside en la estructura de la reconstrucción —el acto de desplegar el proceso de escritura— más que en la inteligencia de la máquina que realiza el despliegue.

Los investigadores también observaron que este método ayudó a los modelos a comprender mejor los documentos largos. Debido a que las trayectorias reconstruidas eran significativamente más largas que los artículos originales, los modelos se volvieron más cómodos leyendo y razonando sobre miles de palabras a la vez. Esta mejora en la capacidad de contexto largo no se observó en los modelos que fueron entrenados con los mismos artículos pero dejados como texto plano. El estudio concluye que, al tratar la escritura humana real como la respuesta final y reconstruir los pasos que la condujeron, los investigadores pueden crear una nueva y poderosa forma de datos de entrenamiento. Este enfoque permite que la inteligencia artificial aprenda no solo qué escribir, sino cómo pensar sobre la escritura, cerrando la brecha entre la información bruta y el proceso estructurado y deliberado de la creación humana.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →