← Últimos artículos
💻 computer science

The FID Lottery: Quantifying Hidden Randomness in Generative-Model Evaluation

Este artículo revela que la Distancia de Inception de Fréchet (FID) exhibe una aleatoriedad oculta significativa impulsada principalmente por las semillas de entrenamiento en lugar de por las variaciones de muestreo, lo que motiva la recomendación de reportar el FID con barras de error y tratar las brechas pequeñas de rendimiento como estadísticamente inconclusas.

Autores originales: Nicolas Dufour, Alexei A. Efros, Patrick Pérez

Publicado 2026-06-19
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Nicolas Dufour, Alexei A. Efros, Patrick Pérez

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que eres un juez en una competencia de cocina. Cada chef (un modelo de IA generativa) presenta un plato, y tú les das una puntuación basada en qué tan delicioso se ve y sabe. En el mundo de la generación de imágenes por IA, esta puntuación se llama FID (Distancia de Inception de Fréchet). Cuanto menor sea la puntuación, mejor es el plato.

Durante años, la comunidad ha tratado esta puntuación como un hecho perfecto e inalterable. Si el Chef A obtiene una puntuación de 34.0 y el Chef B obtiene 33.5, todos asumen que el Chef B es definitivamente mejor.

Este artículo, "The FID Lottery" (La Lotería del FID), argumenta que esto es una ilusión peligrosa. Los autores afirman que la puntuación que ves no es solo una medida de la habilidad del chef; también es una medida de la suerte.

Aquí está el desgate de sus hallazgos usando analogías simples:

1. Las dos loterías

Los autores dicen que cada vez que una IA genera una imagen, se juegan dos "loterías" diferentes:

  • La Lotería del Entrenamiento (La Grande): Antes de que el chef siquiera comience a cocinar, lanza los dados en tres cosas:

    1. Los Ingredientes: Cómo se mezclan y ordenan los datos.
    2. La Configuración de la Despensa: Cómo se inicializa el cerebro de la IA (los pesos) al principio.
    3. El Proceso de Cocción: Un tipo específico de "ruido" (estática aleatoria) que se añade a la receta en cada uno de los pasos del entrenamiento.
    • El Resultado: Incluso si dos chefs siguen exactamente la misma receta, aquel que obtuvo el lanzamiento de dados "afortunado" durante el entrenamiento terminará con un plato ligeramente diferente (y a menudo mejor).
  • La Lotería de la Generación (La Pequeña): Una vez cocinado el plato, el chef tiene que emplatarlo. Tiene que elegir un punto de partida aleatorio para la guarnición final.

    • El Resultado: Si le pides al mismo chef que emplate el plato 10 veces, las puntuaciones variarán ligeramente, pero no mucho.

El Gran Descubrimiento: Los autores descubrieron que reentrenar el modelo (jugar la Lotería del Entrenamiento de nuevo) cambia la puntuación 3.2 veces más que simplemente volver a emplatar el mismo plato (jugar la Lotería de la Generación).

2. El "suelo de ruido" oculto

El papel revela que existe un "suelo de ruido" para estas puntuaciones.

  • Imagina que la puntuación es un termómetro. Los autores encontraron que la temperatura fluctúa naturalmente entre un 1% y un 2% solo debido a la suerte, incluso si el chef no hace nada diferente.
  • El Problema: Muchos artículos recientes de IA afirman haber mejorado la puntuación por cantidades minúsculas (por ejemplo, pasar de 34.0 a 33.8). Los autores argumentan que si la mejora es menor que este "margen de suerte" del 1–2%, podría no ser una mejora real en absoluto. Podría ser simplemente que los dados afortunados rodaron a su favor esa vez.

3. Más grande no siempre es mejor (respecto a la suerte)

Podrías pensar que si construyes una IA más grande y poderosa (una cocina más grande), el factor de la suerte desaparecería.

  • El Hallazgo: No. Ya sea que la IA sea pequeña o enorme, el "margen de suerte" se mantiene aproximadamente igual (1–2%).
  • La Analogía: Es como lanzar dados. Ya sea que lances un solo dado o mil dados, la aleatoriedad sigue ahí. Hacer el modelo más grande no hace que los dados sean menos aleatorios.

4. El "Billete Dorado" (La suerte del sorteo)

Los autores descubrieron que algunas ejecuciones de entrenamiento son increíblemente afortunadas.

  • El Hallazgo: Una semilla de entrenamiento "afortunada" (un comienzo afortunado) puede alcanzar la misma puntuación de alta calidad que una semilla "desafortunada", pero puede hacerlo el doble de rápido.
  • La Implicación: Si un investigador afirma que su nuevo método hizo que el entrenamiento fuera 2 veces más rápido, es posible que simplemente esté comparando su método antiguo "desafortunado" contra una nueva ejecución "afortunada". Es posible que no hayan mejorado realmente el código; simplemente tuvieron suerte con los dados.

5. Ajustar la Guía (La "Salsa Secreta")

El artículo también analizó un ajuste llamado "Guía Libre de Clasificador" (CFG), que es como un dial que le dice a la IA qué tan estrictamente debe seguir una instrucción.

  • El Hallazgo: Si ajustas este dial perfectamente para cada una de las ejecuciones de entrenamiento, puedes reducir el margen de ruido a la mitad.
  • La Trampa: Hacer esto cambia las clasificaciones. La semilla "afortunada" que era la número 1 antes, podría caer al puesto número 5 después de ajustar el dial. Es como si ajustaras la temperatura del horno para cada pastel; el que era el mejor a 350°F podría no ser el mejor a 360°F.

Las Nuevas Reglas del Juego

Basándose en estos hallazgos, los autores sugieren una nueva forma de reportar resultados para que dejemos de ser engañados por la suerte:

  1. No confíes en un solo número: No te limites a reportar una sola puntuación. Reporta un "margen de error" (un rango) basado en ejecutar el entrenamiento múltiples veces con diferentes semillas.
  2. Ignora las victorias diminutas: Si un nuevo método solo mejora la puntuación en menos de un ~1.3%, trátalo como "inconcluyente". Probablemente sea solo ruido.
  3. Ajusta el dial: Si estás usando guía, ajústala específicamente para cada ejecución, pero recuerda que esto cambia cuáles ejecuciones se consideran "mejores".

En resumen: El artículo nos dice que, en el mundo de la generación de imágenes por IA, la suerte juega un papel masivo. Hemos estado tratando fluctuaciones aleatorias como avances científicos. Para saber si un nuevo método es realmente mejor, necesitamos realizar el experimento muchas veces y ver si la mejora se mantiene frente al "ruido" de la lotería.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →