← Últimos artículos
💬 NLP

Detecting Data Contamination in LLMs via In-Context Learning

El artículo presenta CoDeC, un método práctico y automatizado que detecta y cuantifica la contaminación de los datos de entrenamiento en modelos de lenguaje grandes analizando cómo el aprendizaje en contexto afecta la confianza del modelo, distinguiendo entre datos de entrenamiento memorizados y distribuciones no vistas.

Autores originales: Michał Zawalski, Meriem Boubdir, Klaudia Bałazy, Besmira Nushi, Pablo Ribalta

Publicado 2026-05-13
📖 4 min de lectura☕ Lectura para el café

Autores originales: Michał Zawalski, Meriem Boubdir, Klaudia Bałazy, Besmira Nushi, Pablo Ribalta

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que eres un profesor calificando el examen de un estudiante. Quieres saber: ¿Aprendió realmente este estudiante el material, o simplemente memorizó las respuestas de una clave de respuestas filtrada?

Durante mucho tiempo, verificar si los Modelos de Lenguaje Grandes (LLM) han "trampeado" memorizando sus preguntas de examen durante el entrenamiento ha sido como buscar una aguja en un pajar. Los métodos tradicionales eran lentos, requerían acceso a los archivos secretos de entrenamiento del modelo o daban resultados confusos.

Este artículo introduce una nueva herramienta simple llamada CoDeC (Detección de Contaminación mediante Contexto). Piensa en CoDeC como un examen de "Quiz Sorpresa con una Pista".

La Idea Central: La Prueba de la "Pista"

Así es como funciona CoDeC, usando una analogía simple:

1. El Escenario "No Visto" (El Estudiante Honesto)
Imagina que le pides a un estudiante un problema de matemáticas que nunca ha visto antes.

  • Sin una pista: Podría luchar un poco.
  • Con una pista: Le muestras un problema similar que tampoco ha visto antes. De repente, tiene un "momento de iluminación". La pista le ayuda a entender el estilo de la pregunta, y responde con más confianza.
  • Observación de CoDeC: Cuando un modelo ve un conjunto de datos que no ha memorizado, darle ejemplos de ese mismo conjunto de datos actúa como una pista útil. El modelo se vuelve más inteligente y más seguro.

2. El Escenario "Memorizado" (El Estudiante Tramposo)
Ahora, imagina que le pides al estudiante un problema que ya ha memorizado de una clave de respuestas filtrada.

  • Sin una pista: Recita la respuesta perfectamente porque la conoce de memoria.
  • Con una pista: Le muestras otro problema de la misma clave filtrada. En lugar de ayudar, esta nueva información lo confunde. ¿Por qué? Porque su cerebro está atrapado en "modo recitación". La nueva pista interrumpe su patrón de memoria rígido, haciendo que tropiece y responda con menos confianza.
  • Observación de CoDeC: Cuando un modelo ha memorizado los datos, añadir más ejemplos de esos mismos datos en realidad disminuye su confianza porque rompe su ritmo de memorización.

Cómo Mide Esto CoDeC

El método es sorprendentemente simple y automatizado:

  1. Toma una pregunta de un conjunto de datos que sospechas que podría estar en los datos de entrenamiento del modelo.
  2. Pide al modelo que la responda (Mide su confianza).
  3. Añade una "pista": Coloca algunas otras preguntas aleatorias de ese mismo conjunto de datos justo antes de la pregunta objetivo.
  4. Pide al modelo de nuevo: ¿Sube o baja su confianza?
    • ¿Sube la confianza? Es probable que el modelo esté limpio (está aprendiendo del contexto).
    • ¿Baja la confianza? Es probable que el modelo esté contaminado (está memorizando, y el contexto extra lo está desordenando).

Haciendo esto para cientos de preguntas, CoDeC te da una puntuación porcentual.

  • 0–20%: El modelo es probablemente honesto; está razonando, no memorizando.
  • 80–100%: Es probable que el modelo haya memorizado este conjunto de datos. Está "trampando".

Por Qué Esto Es Importante

  • No Se Necesitan Claves Secretas: No necesitas ver los archivos de entrenamiento del modelo (que a menudo son secretos). Solo necesitas hablar con el modelo.
  • Funciona en Todas Partes: Funciona en exámenes de matemáticas, desafíos de programación y preguntas de conocimiento general.
  • Atrapa el "Tramposo Suave": No solo atrapa copias exactas. Atrapa modelos que han visto datos muy similares (como una versión reescrita de una pregunta de examen o una versión sintética de una prueba). Si el modelo ha memorizado la "vibra" de la prueba, CoDeC lo atrapará.

Lo Que Encontraron los Autores

Los investigadores probaron CoDeC en docenas de modelos, incluidos algunos con datos de entrenamiento públicos (así que conocían la verdad) y otros con datos de entrenamiento secretos.

  • Los Resultados: CoDeC fue increíblemente preciso (99.9% de precisión al distinguir datos vistos vs. no vistos).
  • Las Líneas Base: Los métodos antiguos (como verificar qué tan "fácil" encuentra el modelo la pregunta) fallaron al separar a los tramposos de los estudiantes honestos.
  • Hallazgos del Mundo Real: Cuando aplicaron CoDeC a modelos populares y recientes, encontraron varios casos en los que los modelos obtuvieron puntuaciones muy altas en pruebas específicas, lo que sugiere que esos modelos probablemente habían visto los datos de la prueba (o datos muy similares) durante su entrenamiento.

La Conclusión

CoDeC es como un detector de mentiras para las pruebas de referencia de IA. No solo pregunta: "¿Conoces la respuesta?". Pregunta: "¿Te ayuda ver más de este tema, o te confunde?". Si te confunde, probablemente ya conocías la respuesta de memoria. Esto ayuda a la comunidad de IA a confiar más en las puntuaciones de las pruebas y asegura que los modelos sean juzgados por su capacidad de aprender, no solo por su capacidad de memorizar.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →