← Últimos artículos
💬 NLP

PERK: Long-Context Reasoning as Test-Time Learning

El artículo presenta PERK, un marco de trabajo eficiente en parámetros que utiliza actualizaciones de gradiente en tiempo de prueba mediante bucles de meta-aprendizaje anidados para codificar contextos largos en adaptadores de bajo rango, superando significativamente al ajuste fino estándar y a los modelos especializados en tareas de razonamiento de contexto largo a través de diversas escalas de modelos.

Autores originales: Zeming Chen, Angelika Romanou, Gail Weiss, Antoine Bosselut

Publicado 2026-09-01
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Zeming Chen, Angelika Romanou, Gail Weiss, Antoine Bosselut

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Los modelos de lenguaje extensos son herramientas poderosas que han aprendido a leer y escribir estudiando vastas cantidades de texto. Sobresalen al encontrar patrones y responder preguntas cuando la información está justo frente a ellos. Sin embargo, estos modelos enfrentan un obstáculo significativo cuando la información que necesitan está enterrada dentro de una enorme pared de texto, como un documento de la longitud de un libro o una transcripción larga. A medida que el texto crece en longitud, los modelos suelen tener dificultades para ignorar el ruido irrelevante y encontrar el dato específico necesario para resolver un problema. Esta dificultad se ve agravada por una tendencia en muchos modelos a centrarse excesivamente en el principio o en el final de un texto, perdiendo el rastro de los detalles ocultos en el medio. Los investigadores han buscado durante mucho tiempo formas de ayudar a estos modelos a manejar tales tareas de "contexto largo" sin requerir que sean reentrenados desde cero, un proceso que a menudo es prohibitivamente costoso y lento.

En un nuevo estudio presentado en la conferencia ICLR 2026, investigadores de la EPFL proponen una solución llamada PERK, que significa Razonamiento Paramétricamente Eficiente sobre el Conocimiento (Parameter Efficient Reasoning over Knowledge). En lugar de intentar forzar al modelo a leer un documento masivo de una sola vez, PERK trata el acto de leer como un proceso de aprendizaje que ocurre justo en el momento en que se hace la pregunta. Imagine a un estudiante que, al recibir un libro de texto grueso y una pregunta específica, escanea rápidamente las páginas para escribir un conjunto conciso de notas en un bloc de notas. Una vez que esas notas están escritas, el estudiante puede guardar el libro de texto y responder la pregunta usando solo las notas. PERK funciona de manera similar. Cuando se presenta un documento largo, el modelo no mantiene todo el texto en su memoria activa. En su lugar, utiliza una breve fase de aprendizaje interno para comprimir las partes más importantes de ese texto en un conjunto pequeño y eficiente de ajustes en sus propios ajustes internos. Estos ajustes actúan como un módulo de memoria especializado, almacenando la esencia de ese documento largo. Una vez que este "bloc de notas" es creado, el texto original se descarta, y el modelo utiliza sus nuevos ajustes actualizados para responder preguntas sobre el contenido.

Los investigadores desarrollaron un método de entrenamiento que enseña al modelo cómo realizar esta compresión y recuperación de manera efectiva. Utilizaron una técnica que involucra dos capas de aprendizaje. En la primera capa, el modelo aprende a codificar rápidamente un fragmento de texto en sus ajustes de memoria. En la segunda capa, el modelo aprende cómo usar esos ajustes para responder preguntas con precisión. Para mantener este proceso eficiente y evitar que la computadora se quede sin memoria, el modelo solo actualiza una fracción diminuta de sus parámetros totales; específicamente, un componente ligero de adición conocido como adaptador de bajo rango (low-rank adapter). Esto permite que el modelo aprenda del contexto sin alterar su base de conocimiento central. Los investigadores probaron este enfoque en diversas tareas desafiantes, incluyendo la búsqueda de un único dato específico oculto dentro de miles de páginas de texto, la respuesta a preguntas complejas que requieren conectar múltiples piezas de información, y la recuperación de datos de largas listas de registros de apariencia similar.

Los resultados mostraron que PERK superó significativamente a los métodos estándar donde los modelos son simplemente entrenados en textos largos para responder preguntas más tarde. En pruebas que involucraron al modelo Qwen-2.5, PERK mejoró la precisión hasta en un 20 por ciento en comparación con estos enfoques estándar. El método demostró ser robusto incluso cuando se le pidió al modelo manejar textos mucho más largos de lo que había visto durante el entrenamiento, generalizando con éxito a contextos de 64,000 e incluso 128,000 tokens. Además, PERK demostró una capacidad única para ignorar la posición de la información. Mientras que otros modelos a menudo fallan cuando el dato relevante se mueve del principio o del final de un texto hacia el medio, PERK mantuvo una alta precisión independientemente de dónde apareciera la información. Esto sugiere que, al codificar el texto en una estructura de memoria flexible en lugar de depender de posiciones fijas, el modelo puede razonar de manera más confiable. El enfoque funcionó consistentemente a través de diferentes tamaños de modelo, desde modelos muy pequeños de 0.5 mil millones de parámetros hasta otros más grandes de 8 mil millones, e incluso igualó o superó el rendimiento de modelos masivos especializados diseñados específicamente para contextos largos.

Más allá de la precisión, el estudio destacó la eficiencia de este método. Debido a que el modelo procesa el texto en fragmentos más pequeños y manejables y descarta el texto original después de la codificación, requiere significativamente menos memoria de computadora para manejar documentos extremadamente largos. En pruebas donde los métodos estándar colapsaron debido a límites de memoria a los 128,000 tokens, PERK continuó funcionando, procesando la información en una fracción del tiempo y usando una fracción de la memoria. Los investigadores concluyeron que al reformular el razonamiento de contexto largo como una tarea de aprendizaje en el tiempo de prueba, donde el modelo adapta su propia memoria sobre la marcha, es posible lograr un rendimiento superior sin el pesado costo computacional del entrenamiento tradicional. Este enfoque ofrece un camino prometedor para hacer que los modelos de lenguaje extensos sean más capaces de manejar la vasta y compleja información que se encuentra en el mundo real.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →