← Últimos artículos
⚡ electrical engineering

Flow-Corrected Thompson Sampling for Non-Stationary Contextual Bandits

Este artículo introduce el Muestreo de Thompson con Corrección de Flujo (fcTS), un algoritmo bayesiano para bandidos contextuales lineales no estacionarios que mejora la eficiencia de muestreo al modelar y transportar explícitamente las recompensas pasadas al presente con correcciones ponderadas por confianza, superando así a los métodos tradicionales basados en el olvido en entornos con deriva temporal estructurada.

Autores originales: AmirHossein Naghdi, Ali Baheri

Publicado 2026-06-24
📖 5 min de lectura🧠 Análisis profundo

Autores originales: AmirHossein Naghdi, Ali Baheri

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que eres un chef intentando perfeccionar una receta de sopa que cambia ligeramente de sabor cada día. Tal vez los tomates son un poco más dulces hoy, o el caldo es un poco más salado mañana.

En el mundo de la informática, esto se llama un problema de Bandido Contextual (Contextual Bandit). La computadora (el chef) tiene que elegir una acción (una receta de sopa) basada en la situación actual (los ingredientes disponibles) para obtener la mejor recompensa (la sopa más sabrosa).

El gran problema es la No Estacionariedad: las reglas del juego cambian constantemente. En los viejos tiempos, las computadoras simplemente tiraban sus notas viejas. Decían: "Esa receta funcionó ayer, pero hoy es diferente, así que olvidaré todo lo que aprendí y empezaré de cero". Esto es como un chef que tira todo su libro de cocina cada vez que cambia el clima. Es seguro, pero increíblemente ineficiente porque tiene que reaprender todo desde el principio.

Este artículo presenta un nuevo método llamado Muestreo de Thompson Corregido por Flujo (FC-TS). En lugar de tirar las notas viejas, el FC-TS dice: "Mantengamos las notas viejas, pero tradúzcanlas para que tengan sentido para hoy".

Así es como funciona, utilizando tres analogías sencillas:

1. El "Traductor de Viajes en el Tiempo" (Deriva Lineal)

Imagina que la sopa se vuelve un poco más salada cada día.

  • La Vieja Forma: Si probaras una sopa de hace 10 días, dirías: "¡Eso es demasiado salado para hoy!" e ignorarías la lección.
  • La Forma de FC-TS: Miras la nota antigua: "Hace 10 días, esta receta necesitaba 1 cucharada de sal". Sabes que la sopa se ha estado volcionando más salada por 0.1 cucharadas al día. Entonces, haces la matemática: "Está bien, si añado 1 cucharada de sal a esa receta antigua, habría sido perfecta hoy".
  • El Resultado: No tiras la información vieja; la "transportas" hacia adelante en el tiempo. Usas la lección antigua, pero la ajustas para que encaje con el momento presente.

2. El "Calendario Estacional" (Variación Periódica)

Imagina que la sopa sabe diferente dependiendo de la estación. En invierno, necesita más pimienta; en verano, menos.

  • La Vieja Forma: Una computadora podría mirar solo los datos de los últimos pocos días. Si actualmente es verano, olvida lo que aprendió sobre el invierno, aunque el invierno regresará el próximo año.
  • La Forma de FC-TS: Se da cuenta de: "¡Oye, hoy es el mismo día del año que el del año pasado!". Mira las notas del verano del año pasado y dice: "Estos datos siguen siendo válidos porque la estación es la misma". Reutiliza los datos antiguos que coinciden con la "fase" actual del ciclo.

3. Los "Cambios de Habitación" (Regímenes Recurrentes)

Imagina que estás cocinando en una cocina que tiene tres habitaciones diferentes (Regimen A, B y C). A veces estás en la Habitación A, luego pasas a la Habitación B, y más tarde vuelves a la Habitación A.

  • La Vieja Forma: Cuando sales de la Habitación A, borras la pizarra limpia. Cuando regresas a la Habitación A más tarde, tienes que empezar a dibujar la receta desde cero.
  • La Forma de FC-TS: Mantiene una pizarra separada para cada habitación. Cuando sales de la Habitación A, guarda la pizarra. Cuando entras de nuevo en la Habitación A, saca la pizarra guardada y dice: "Ah, recuerdo cómo cocinar aquí". No olvida; simplemente hace una pausa y cambia de archivo.

El Ingrediente Secreto: Pesos de Confianza

El artículo también menciona una función de seguridad. ¿Qué pasa si la computadora adivina mal la "traducción"? ¿Qué pasa si piensa que la sopa se vuelve más salada, pero en realidad se vuelve más dulce?

  • FC-TS asigna un Peso de Confianza a cada nota antigua. Si la computadora está muy segura de la traducción, confía completamente en la nota antigua. Si no está segura, trata la nota antigua como algo "difuso" o "con ruido" y le presta menos atención. Esto evita que la computadora se confunda con malas conjeturas.

¿Por qué es esto mejor?

Los autores probaron esto contra los métodos de "tirar todo" (como las ventanas deslizantes o los reinicios).

  • El Resultado: En casi todas las pruebas, el FC-TS cometió menos errores (menor "arrepentimiento" o regret).
  • La Gran Victoria: Destaca especialmente cuando los cambios son estructurados. Si el mundo cambia en un patrón predecible (como una deriva constante, un ciclo repetitivo o cambios entre estados conocidos), el FC-TS es un maestro en reutilizar su pasado. Aprende más rápido porque no pierde tiempo reaprendiendo cosas que ya sabe, siempre y cuando pueda "traducir" ese conocimiento al presente.

En resumen: En lugar de tratar la historia como basura para ser descartada, el FC-TS trata la historia como una biblioteca. No solo lee los libros; los traduce para que tengan sentido para hoy, permitiendo que la computadora aprenda de manera mucho más rápida y más inteligente.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →