← Últimos artículos
🤖 AI

Can Scientific Claims Be Removed from Large Language Models? A Systematic Evaluation of Claim-Level Unlearning

Este artículo introduce la tarea de el desaprendizaje de afirmaciones científicas (Scientific Claim Unlearning) y un nuevo referente, SciUnlearn, para demostrar que los métodos actuales de desaprendizaje de máquinas fallan al intentar eliminar eficazmente afirmaciones científicas interconectadas y evolutivas de los modelos de lenguaje extensos, resultando a menudo en una mera supresión superficial en lugar de una verdadera eliminación del conocimiento.

Autores originales: Snigdha Paul, Manasi Patwardhan, Arman Cohan

Publicado 2026-08-24
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Snigdha Paul, Manasi Patwardhan, Arman Cohan

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Los sistemas modernos de inteligencia artificial, a menudo llamados modelos de lenguaje extensos, actúan como vastas bibliotecas del conocimiento humano. Son entrenados mediante la lectura de enormes colecciones de texto, incluyendo artículos científicos, para aprender cómo responder preguntas y resolver problemas. Sin embargo, la ciencia no es un archivo estático; es un proceso vivo y respirable de revisión constante. Cuando un nuevo estudio demuestra que una idea antigua es errónea, o cuando un artículo es retractado debido a un error, el registro científico se actualiza. El problema es que estos modelos de IA no se actualizan automáticamente. Una vez que han aprendido un hecho, tienden a aferrarse a él, incluso después de que la comunidad científica lo haya declarado falso. Esto crea un riesgo en el que una IA podría repetir con confianza información desactualizada o refutada, potencialmente engañando a investigadores o incluso causando daños en campos como la medicina.

Para abordar esto, los investigadores han desarrollado una técnica llamada desaprendizaje de máquinas (machine unlearning). El objetivo es enseñar a un modelo a "olvidar" piezas específicas de información mientras mantiene su capacidad de responder otras preguntas intacta. Imagine a un bibliotecario que debe retirar un libro específico e incorrecto de los estantes sin perturbar el resto de la biblioteca o perder la capacidad de encontrar otros libros. Si bien esto se ha probado para eliminar datos personales o material protegido por derechos de autor, los científicos aún no han descubierto cómo eliminar eficazmente afirmaciones científicas específicas. Estas afirmaciones son complicadas porque están profundamente interconectadas; saber un hecho a menudo depende de la comprensión de muchos otros. Si se intenta eliminar un hecho, el modelo podría simplemente aprender a parafrasearlo ligeramente para mantener el conocimiento vivo, o podría olvidar accidentalmente todo lo demás.

Un equipo de investigadores de TCS Research y la Universidad de Yale se propuso resolver este problema específico. Crearon un nuevo entorno de prueba llamado SciUnlearn para ver si los modelos de IA actuales podían realmente olvidar afirmaciones científicas. Construyeron un conjunto de datos utilizando artículos científicos reales de ciencias de la computación y medicina, incluyendo un conjunto de artículos que habían sido oficialmente retractados. Para cada artículo, extrajeron las afirmaciones científicas centrales y las convirtieron en varios tipos de preguntas, tales como de opción múltiple, de verdadero o falso y de completar el espacio en blanco. Para asegurar que la prueba fuera justa, dividieron las preguntas en dos grupos: un grupo para enseñar al modelo a olvidar, y otro grupo de preguntas parafraseadas basadas en los mismos hechos subyacentes para ver si el modelo realmente había olvidado el concepto o si solo había memorizado las preguntas específicas.

Luego, los investigadores tomaron métodos de desaprendizaje existentes y los aplicaron a estos modelos. Pidieron a los modelos que olvidaran el primer grupo de preguntas y luego los probaron con el segundo grupo, así como con preguntas de conocimiento general para asegurar que los modelos no se hubieran vuelto inútiles. Los resultados fueron reveladores. Los métodos funcionaron bien para hacer que los modelos fallaran en las preguntas específicas para las que fueron entrenados a olvidar. Sin embargo, al enfrentarse a las preguntas parafraseadas que probaban la misma afirmación científica subyacente, los modelos a menudo todavía acertaban las respuestas. Esto sugiere que los modelos no estaban eliminando realmente el conocimiento, sino que simplemente estaban suprimiendo los patrones específicos de palabras utilizados en las preguntas de entrenamiento. Era como si el modelo hubiera aprendido a ignorar una oración específica en lugar de borrar el hecho que hay detrás de ella.

El estudio también analizó qué tan bien recordaban los modelos otra información no relacionada. Algunos métodos que intentaban olvidar las afirmaciones objetivo también degradaron accidentalmente la capacidad del modelo para responder preguntas generales, mientras que otros lograron mantener intacto el resto del conocimiento. Los investigadores encontraron que la dificultad de olvidar una afirmación dependía de qué tan profundamente estaba incrustada esa afirmación en la literatura científica. Las afirmaciones de artículos que eran citados frecuentemente por muchos otros estudios eran mucho más difíciles de eliminar. Estas ideas altamente citadas eran reforzadas por una amplia red de textos relacionados, lo que las hacía resistentes a ser borradas por un solo intento de desaprendizaje. En contraste, las afirmaciones de artículos menos citados eran más fáciles de perturbar, pero incluso entonces, el olvido era a menudo limitado a la forma superficial exacta de la pregunta.

En última instancia, el estudio concluye que los métodos actuales aún no son capaces de un verdadero desaprendizaje de afirmaciones científicas. Pueden ocultar instancias específicas de conocimiento, pero luchan por eliminar la comprensión conceptual subyacante. Los investigadores sugieren que el trabajo futuro debe centrarse en métodos que puedan apuntar a estas conexiones más profundas y estructuradas dentro del conocimiento del modelo, en lugar de solo suprimir patrones de superficie. Hasta entonces, estos modelos de IA pueden continuar cargando con el peso de la ciencia desactualizada, aferrándose a hechos que el resto del mundo ya ha dejado atrás.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →