← Últimos artículos
💻 computer science

What to Forget in Unlearning? Forget Set Curation for Language Models

Este artículo presenta CleanSlate, un referente que demuestra que la curación de los conjuntos de olvido es un desafío ascendente crítico en el desaprendizaje de máquinas, donde los métodos de selección simples fallan al suprimir el contenido objetivo mientras que las estrategias excesivamente agresivas causan un daño colateral significativo a las capacidades del modelo.

Autores originales: Animesh Jha, Arpandeep Khatua, Youssef Allouah, Sanmi Koyejo

Publicado 2026-08-18
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Animesh Jha, Arpandeep Khatua, Youssef Allouah, Sanmi Koyejo

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina un mundo donde las vastas bibliotecas del conocimiento humano se comprimen en un único programa informático increíblemente inteligente. Este programa, conocido como modelo de lenguaje, aprende leyendo billones de palabras de libros, sitios web y canciones. Se vuelve tan bueno en esto que puede imitar el estilo de un poeta o terminar una frase de una novela famosa. Pero a veces, los propietarios de estos programas necesitan eliminar información específica. Quizás se utilizó una canción sin permiso, o una historia privada fue memorizada accidentalmente. El objetivo es hacer que la computadora "desaprenda" esa pieza de contenido específica sin tener que borrar toda su memoria y empezar de cero. Este proceso se llama desaprendizaje automático (machine unlearning). Durante años, los investigadores se han centrado en la mecánica de cómo borrar los datos una vez que saben exactamente qué palabras atacar. Han tratado la lista de palabras para olvidar como un punto de partida simple, asumiendo que si le dices a la computadora que olvide una oración específica, simplemente lo hará.

Sin embargo, un nuevo estudio de la Universidad de Stanford sugiere que esta suposición ignora un paso crucial y difícil. Los investigadores se dieron cuenta de que, en el mundo real, una solicitud para olvidar algo rara vez viene con una lista precisa de palabras. Un usuario podría pedirle a un modelo que deje de cantar una canción específica, pero esa canción existe en la memoria de la computadora de muchas formas diferentes. Puede aparecer en la letra oficial, pero también en un artículo de noticias que cita un verso, en un foro de fans que discute la melodía, en un archivo de código que almacena el texto, o en una reseña que menciona el estribillo. La computadora no conoce la canción solo por una copia perfecta; la conoce a partir de una nube dispersa de estas diversas menciones. La nueva investigación plantea una pregunta fundamental: ¿cómo encuentras todos esos fragmentos dispersos de una canción o un libro dentro de una biblioteca masiva de texto, para poder decirle a la computadora que los olvide? El equipo llama a este paso faltante "curación del conjunto de olvido" (forget set curation), y descubrieron que equivocarse en ello puede hacer que la computadora pierda mucho más que la canción no deseada.

Para investigar esto, los investigadores construyeron un campo de pruebas llamado CLEANSLATE. Reunieron miles de canciones de las listas Billboard Hot 100 que abarcan desde 1970 hasta 2025, junto con cincuenta libros. Luego probaron qué tan bien diferentes métodos podían identificar los fragmentos de texto específicos que debían eliminarse. Compararon dos enfoques principales. El primer enfoque dependía de herramientas de búsqueda estándar, similares a cómo una persona podría usar un motor de búsqueda para encontrar un libro. Estas herramientas buscaban coincidencias exactas de palabras o frases. El segundo enfoque era más agresivo: buscaba directamente las partes específicas del texto que la computadora era más propensa a reproducir y las seleccionaba para su eliminación, esencialmente saltándose el paso de búsqueda para atacar las áreas problemáticas exactas.

Los resultados revelaron una complejidad sorprendente. Cuando los investigadores usaron las herramientas de búsqueda estándar para encontrar el texto, los resultados fueron a menudo débiles. La computadora continuaba cantando la canción o recitando el libro, incluso después de que las herramientas de búsqueda hubieran eliminado las copias obvias. Esto sucedió porque la computadora había aprendido la canción de muchas fuentes pequeñas y dispersas que las herramientas de búsqueda pasaron por alto. La "huella" de una canción no es solo la letra oficial; es una red difusa de citas, referencias y fragmentos esparcidos por internet. Cuando los investigadores intentaron ser más minuciosos y apuntaron a las ventanas de texto exactas que la computadora utilizaba para generar la canción, lograron un tipo diferente de problema. Lograron que la computadora dejara de cantar la canción, pero al hacerlo, dañaron la capacidad de la computadora para recordar otras cosas. El modelo se volvió peor respondiendo preguntas sobre los hechos de la canción, y también perdió algunas de sus habilidades generales, como su capacidad para razonar o resolver problemas matemáticos.

El estudio mostró que la elección de qué texto eliminar no es solo un detalle técnico; es una parte importante de la solución misma. Los investigadores encontraron que la misma lista de texto para olvidar podía conducir a resultados muy diferentes dependiendo de qué algoritmo se utilizara para borrarlo. En algunos casos, un método que funcionaba perfectamente para un modelo de computadora causaba un daño significativo a otro. Esto significa que no puedes simplemente elegir una lista de palabras y asumir que la eliminación será limpia. El proceso de seleccionar los datos y el proceso de borrarlos están profundamente conectados. Si seleccionas muy poco, el comportamiento no deseado permanece. Si seleccionas demasiado, o el tipo de texto incorrecto, corres el riesgo de borrar conocimiento valioso y dañar la inteligencia general de la computadora.

En última instancia, la investigación sugiere que la idea de una lista simple y perfecta de cosas para olvidar es una ilusión. En la realidad desordenada de cómo aprenden estos modelos, una canción o un libro están sostenidos por una vasta e invisible red de texto. Para que una computadora desaprenda verdaderamente una pieza de contenido sin dañar el resto de su mente, la selección de los datos debe hacerse con extremo cuidado, teniendo en cuenta exactamente cómo ese modelo de computadora específico aprendió dicho contenido. El estudio concluye que el desaprendizaje práctico no puede resolverse simplemente mejorando las herramientas de eliminación; requiere una nueva forma de pensar sobre cómo encontramos y elegimos los datos en primer lugar. El camino a seguir implica diseñar un sistema donde la selección de qué olvidar y el método de olvido se planifiquen juntos, asegurando que la computadora pueda dejar ir una solicitud específica sin perder su capacidad de comprender el mundo que la rodea.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →