← Últimos artículos
💬 NLP

Position: The Term "Machine Unlearning" Is Overused in LLMs

Este documento de posición argumenta que el término "desaprendizaje de máquinas" se utiliza actualmente en exceso en la investigación de LLM para describir tareas diversas como el rechazo o la supresión, y hace un llamado a reservar el término estrictamente para la eliminación definida por el conjunto de datos con garantías de equivalencia de reentrenamiento para evitar evaluaciones engañosas y asegurar la terminología apropiada para diferentes objetivos.

Autores originales: Sangyeon Yoon, Yeachan Jun, Albert No

Publicado 2026-06-29
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Sangyeon Yoon, Yeachan Jun, Albert No

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La gran idea: El término "Desaprendizaje" se está usando mal

Imagina que tienes a un estudiante que estudió una biblioteca masiva de libros para convertirse en un experto. Ahora, imagina que uno de esos libros fue robado, o que el autor exige que sea eliminado de la mente del estudiante.

El artículo sostiene que los investigadores están usando el término "Desaprendizaje de Máquina" (Machine Unlearning) de forma demasiado laxa. Están llamando "desaprendizaje" a muchas cosas diferentes que, en realidad, cumplen funciones muy distintas.

Los autores dicen que debemos dejar de confundirlas. Debemos reservar el término estricto de "Desaprendizaje de Máquina" para un trabajo específico y muy difícil, y usar nombres diferentes para los otros trabajos más fáciles.


1. La definición estricta: "El Borrador"

Lo que realmente significa:
El verdadero "Desaprendizaje de Máquina" es como usar un borrador mágico en una pintura. Quieres eliminar un conjunto específico de pinceladas (el "conjunto de olvido") de forma tan perfecta que la pintura luzca exactamente igual a como si el artista nunca hubiera pintado esas pinceladas en primer lugar.

  • El estándar de oro: Para demostrar que hiciste un buen trabajo, tienes que comparar tu pintura "borrada" con una pintura nueva hecha por un artista que comenzó desde cero con los libros restantes, sin haber visto nunca el libro robado.
  • El objetivo: Las dos pinturas deben ser indistinguibles. Si el estudiante aún puede resolver un problema matemático que aprendió únicamente del libro robado, entonces no ha "desaprendido" realmente, incluso si se niega a responder la pregunta específica sobre él.

2. La confusión: Lo que la gente realmente hace

Actualmente, muchos investigadores dicen que están "desaprendiendo" cuando en realidad están haciendo una de estas otras cosas:

  • El "Rechazo" (El perro guardián): El modelo es entrenado para decir "No lo sé" o "No puedo responder eso" cuando se le pregunta sobre el tema prohibido.
    • Analogía: Es como un perro guardián que ladra y no te deja entrar a la habitación. El perro sabe que la habitación existe, pero no te deja entrar. El perro no ha olvidado la habitación; solo ha sido entrenado para bloquearte.
  • La "Supresión" (El botón de silencio): El modelo es ajustado para que sea muy poco probable que diga las palabras específicas asociadas con el tema prohibido.
    • Analogía: Es como poner un botón de silencio a una palabra específica. La palabra sigue en el diccionario, pero el hablante está entrenado para saltársela.
  • La "Edición" (La reescritura): Al modelo se le enseña un nuevo dato para reemplazar el antiguo.
    • Analogía: En lugar de borrar el recuerdo de "París es la capital de Francia", lo sobrescribes con "Londres es la capital". El viejo recuerdo podría seguir ahí, simplemente enterrado bajo uno nuevo.

El problema: Los investigadores suelen afirmar que han "desaprendido" algo porque el modelo dejó de responder preguntas (el Perro Guardián ladró). Pero los autores dicen que esto es un truco. El modelo podría seguir sabiendo la información en su interior; solo está fingiendo que no sabe.

3. El peligro oculto: "Capacidades Derivadas"

Esta es la parte más crítica del artículo. A veces, aprender algo específico te otorga un superpoder que va más allá de ese solo dato.

  • La analogía: Imagina que un estudiante aprende a resolver un tipo específico de problema matemático usando un libro de texto robado. Incluso si le haces "olvidar" las respuestas específicas del libro, es posible que aún haya aprendido la lógica o la habilidad de razonamiento al leerlo.
  • El riesgo: Si solo verificas si puede recitar las respuestas (Fallo de Salida), podría fallar la prueba. Pero si le planteas un problema matemático nuevo que utilice la misma lógica, es posible que lo resuelva perfectamente.
  • El punto del artículo: El verdadero "desaprendizaje" significa eliminar también ese superpoder. Si el libro robado le dio una habilidad, y tú la "desaprendes", debería perder esa habilidad, incluso si eso lo hace ligeramente peor en matemáticas en general. Si conserva la habilidad, no ha desaprendido realmente la influencia de ese libro.

4. Por qué las pruebas actuales están fallando

El artículo señala que la mayoría de las pruebas actuales son como exámenes de opción múltiple.

  • Prueba actual: "¿Puede el modelo responder a la Pregunta A?" Si el modelo dice "No lo sé", la prueba dice: "¡Genial! ¡Lo olvidaste!".
  • El fallo: Esto solo prueba si el modelo está escondiendo la respuesta. No prueba si el modelo ha eliminado el conocimiento.
  • La solución: Necesitamos comparar el modelo "desaprendido" con un modelo "reentrenado" (aquel que nunca vio los datos erróneos). Si el modelo desaprendido sigue siendo mejor que el reentrenado en una tarea específica, significa que los "datos malos" todavía lo están influenciando.

5. La solución de los autores: Un nuevo reglamento

Los autores proponen tres cambios principales para arreglar este caos:

  1. Dejar de usar "Desaprendizaje" como un término genérico.

    • Si solo estás haciendo que el modelo se niegue a responder, llámalo "Rechazo" o "Supresión".
    • Si realmente estás eliminando la influencia del entrenamiento para coincidir con un modelo reentrenado, entonces llámalo "Desaprendizaje de Máquina".
  2. Usar un "Modelo de Referencia" para la comparación.

    • No puedes simplemente decir "El modelo lo olvidó". Tienes que decir: "El modelo se comporta exactamente como un modelo que fue entrenado sin esos datos".
    • (Los autores admiten que reentrenar modelos gigantes es costoso, pero dicen que debemos usar el mejor posible sustituto o admitir que no estamos haciendo un verdadero desaprendizaje).
  3. Probar los "Superpoderes" (Capacidades Derivadas).

    • No le hagas al modelo las mismas preguntas en las que fue entrenado. Hazle nuevas preguntas que requieran las habilidades que pudo haber aprendido de los datos erróneos. Si aún puede realizar esas nuevas tareas, el desaprendizaje falló.

Resumen

El artículo es un llamado a la honestidad científica.

  • No llames "Desaprendizaje" (borrar el recuerdo) a un "Rechazo" (decir "no lo sé").
  • No pienses que porque un modelo no responde una pregunta, ha olvidado el conocimiento. Podría estar jugando al escondite.
  • compara tus resultados con un modelo que nunca vio los datos erróneos en primer lugar.
  • comprueba si el modelo aún posee los "superpoderes" que obtuvo de los datos erróneos.

Si no arreglamos esta terminología, podríamos pensar que somos seguros y cumplidores cuando en realidad solo estamos ocultando la verdad.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →