← Últimos artículos
🤖 machine learning

On the importance of multiple training seeds for evaluating machine unlearning

Este artículo sostiene que evaluar los algoritmos de desaprendizaje de máquinas utilizando únicamente una única semilla de entrenamiento puede producir resultados no representativos debido a la sensibilidad a la inicialización del entrenamiento, y demuestra que aumentar las semillas de desaprendizaje no puede compensar esta limitación, lo que hace necesario el uso de múltiples semillas de entrenamiento para una evaluación empírica robusta.

Autores originales: Jamie Lanyon, Axel Finke, Petros Andreou, Georgina Cosma

Publicado 2026-06-08
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Jamie Lanyon, Axel Finke, Petros Andreou, Georgina Cosma

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La visión general: La receta "olvidada"

Imagina que tienes a un maestro chef (el Modelo de Aprendizaje Automático) que ha aprendido a cocinar un plato complejo usando un libro de cocina masivo (Datos de Entrenamiento). De repente, un cliente exige que se elimine un ingrediente específico (un Punto de Dato específico) de la receta porque está caducado o es ofensivo.

El objetivo del Desaprendizaje de Máquina (Machine Unlearning) es hacer que el chef "olvide" ese ingrediente para que ya no pueda usarlo, sin tener que tirar todo el libro de cocina y empezar a cocinar desde cero (lo cual es demasiado caro y lento).

¿El problema? La mayoría de los trucos de "desaprendizaje" son solo aproximaciones. Intentan retocar la receta ligeramente para eliminar el mal ingrediente, pero no estamos 100% seguros de si realmente funcionaron o si el chef simplemente tuvo suerte. Para estar seguros, los científicos ejecutan estos trucos muchas veces para ver si funcionan de manera consistente.

El error: Lanzar los dados una sola vez

El artículo argumenta que los científicos han estado cometiendo un error crítico en la forma en que prueban estos trucos de "olvido".

La forma antigua (La prueba defectuosa):
Imagina que quieres probar si una nueva técnica de "olvido" funciona.

  1. Horneas un pastel usando un conjunto específico de ingredientes aleatorios y una temperatura de horno específica (esta es la Semilla de Entrenamiento).
  2. Luego intentas "deshornear" o eliminar un sabor específico de ese pastel diez veces diferentes usando diez varitas mágicas diferentes y aleatorias (estas son las Semillas de Desaprendizaje).
  3. Promedias los resultados de esas diez varitas y dices: "¡Mira, la técnica funciona!".

El hallazgo del artículo:
Los autores dicen que esto es como juzgar un billete de lotería comprando diez billetes el mismo día con los mismos números de la suerte. Si el sorteo de ese día específico fue un golpe de suerte, tus diez billetes se verán geniales, pero no te dicen si la lotería es realmente justa.

El artículo muestra que el punto de partida (el pastel que horneaste primero) importa mucho más que la herramienta que usas para eliminar el sabor.

  • Si horneas el pastel con una temperatura de horno ligeramente diferente o con un lote de harina diferente (una Semilla de Entrenamiento diferente), el truco de "olvido" podría fallar por completo, incluso si funcionó perfectamente en el primer pastel.
  • Al probar solo en un pastel inicial, los investigadores obtienen un resultado "no representativo". Podrían pensar que un método es excelente cuando en realidad solo tuvo suerte.

La analogía: El jardinero y el suelo

Piensa en la Semilla de Entrenamiento como el suelo y la Semilla de Desaprendizaje como la herramienta del jardinero.

  • La práctica antigua: Un jardinero prueba una nueva herramienta de "eliminación de maleza" en un parche de suelo específico. Usa la herramienta 10 veces en ese mismo parche. Si la maleza sale, declara que la herramienta es un éxito.
  • La realidad: ¿Qué pasa si ese parche de suelo específico era inusualmente blando? La herramienta podría fallar estrepitosamente en un parche de arcilla dura.
  • El consejo del artículo: Para saber si la herramienta realmente funciona, debes probarla en muchos parches de suelo diferentes (muchas Semillas de Entrenamiento). Incluso si solo usas la herramienta una vez en cada parche, obtienes una imagen mucho más real de su rendimiento que si la usaras 100 veces en un solo parche.

¿Por qué no podemos simplemente usar más "varitas"?

Podrías preguntar: "Si no puedo hornear 75 pasteles diferentes, ¿no puedo simplemente usar 75 varitas diferentes en el único pastel que tengo?"

El artículo dice que no.

  • Los "oleajes" o variaciones causados por usar diferentes varitas (Semillas de Desaprendizaje) suelen ser diminutos.
  • Los "oleajes" causados por usar diferentes pasteles iniciales (Semillas de Entrenamiento) son enormes.
  • Si solo tienes un pastel, ningún amount de oleaje con diferentes varitas solucionará el hecho de que el pastel mismo podría ser un golpe de suerte. Necesitas más pasteles (Semillas de Entrenamiento) para obtener una respuesta real.

La solución: Cómo gastar tu tiempo sabiamente

Los autores proporcionan una guía sobre cómo gastar tu tiempo de computación (presupuesto) de manera inteligente:

  • No gastes todo tu tiempo ejecutando el truco de desaprendizaje 10 veces en un solo modelo.
  • gasta tu tiempo entrenando 10 modelos diferentes (con diferentes semillas de inicio) y ejecutando el truco de desaprendizaje solo una o dos veces en cada uno.

Este enfoque ofrece una respuesta mucho más honesta y fiable sobre si el modelo de aprendizaje automático realmente ha olvidado algo.

¿Se aplica esto en todas partes?

El artículo probó esta idea en tres mundos diferentes:

  1. Clasificación de imágenes: Reconocer fotos (como gatos vs. perros).
  2. Aprendizaje Federado de Clasificación (Federated Learning-to-Rank): Ordenar resultados de búsqueda basados en clics de usuarios.
  3. Modelos de Lenguaje Extensos (LLMs): Chatbots que escriben texto.

En los tres casos, el resultado fue el mismo: la semilla de inicio importa más que la semilla de desaprendizaje. Ya sea que estés enseñando a un robot a ver, a clasificar resultados de búsqueda o a escribir una historia, no puedes confiar en los resultados si solo pruebas en un único modelo inicial.

Resumen

Para saber si un modelo de aprendizaje automático ha "olvidado" realmente algo, no puedes simplemente probar el truco de olvido en una versión específica del modelo. Debes probarlo en muchas versiones diferentes del modelo. De lo contrario, podrías estar celebrando un éxito que solo fue un accidente de la suerte.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →