← Últimos artículos
🤖 AI

Learning optimal policies from event logs through reinforcement learning: a comparison of deep and MDP-based approaches

Este artículo propone un marco de Aprendizaje por Refuerzo para el Monitoreo Prescriptivo de Procesos que aprende políticas de comportamiento óptimas directamente de los registros de eventos históricos para recomendar acciones para optimizar los Indicadores Clave de Desempeño, comparando un enfoque de Proceso de Decisión de Markov basado en modelos con un método de Aprendizaje por Refuerzo Profundo libre de modelo y demostrando que ambos mejoran eficazmente los KPI mientras que el enfoque basado en modelos ofrece una eficiencia computacional superior.

Autores originales: Stefano Branchi, Andrei Buliga, Chiara Di Francescomarino, Chiara Ghidini, Riccardo Graziosi, Francesca Meneghello, Massimiliano Ronzani

Publicado 2026-06-15
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Stefano Branchi, Andrei Buliga, Chiara Di Francescomarino, Chiara Ghidini, Riccardo Graziosi, Francesca Meneghello, Massimiliano Ronzani

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que eres el gerente de un banco muy concurrido. Cada día, los clientes solicitan préstamos. A veces el préstamo es aprobado, otras veces es rechazado y, a veces, el cliente simplemente se retira. Tu objetivo es simple: lograr que la mayor cantidad de clientes digan "Sí" a tu oferta de préstamo posible.

Sin embargo, tú no lo controlas todo. Controlas las acciones del banco (como enviar una oferta o pedir más información), pero no controlas las acciones del cliente (como decidir aceptar, rechazar o cancelar). Es como jugar una partida de ajedrez donde solo puedes mover tus propias piezas, pero tu oponente (el cliente) mueve las suyas de forma aleatoria según su estado de ánimo.

Este artículo trata sobre enseñar a una computadora a ser la mejor posible gerente de banco observando registros antiguos de cómo el banco jugó el juego en el pasado. El objetivo es descubrir la estrategia perfecta para ganar con más frecuencia.

Los dos "Entrenadores"

Los investigadores probaron dos formas diferentes (o "entrenadores") de enseñar a la computadora esta estrategia utilizando Aprendizaje por Refuerzo (un tipo de IA que aprende mediante ensayo y error, pero en este caso, aprende de un libro de historia en lugar de jugar en vivo).

1. El "Creador de Mapas" (Enfoque basado en MDP)

Este entrenador observa los miles de solicitudes de préstamos pasadas e intenta construir un mapa detallado del juego.

  • Cómo funciona: Agrupa situaciones similares (como "El cliente pidió $10k y nosotros enviamos una oferta") y calcula las probabilidades de lo que sucede después. Crea un libro de reglas claro: "Si estás en la Situación A, realiza la Acción B".
  • La analogía: Imagina un GPS que ha mapeado cada una de las calles de una ciudad. Sabe exactamente qué giro lleva al tráfico y cuál lleva a un atajo. Construye un modelo completo de la ciudad antes de decirte hacia dónde ir.
  • El inconveniente: Construir este mapa requiere algo de trabajo, y si el mapa es demasiado detallado, podría confundirse con eventos raros y extraños. Para solucionar esto, los investigadores añadieron un "filtro" para ignorar rutas raras y poco fiables en el libro de historia.

2. El "Aprendiz Profundo" (RL Profundo Offline)

Este entrenador no intenta construir un mapa. En su lugar, utiliza una red neuronal súper inteligente (como un cerebro con muchas capas) para observar el libro de historia y adivinar el mejor movimiento directamente.

  • Cómo funciona: Lee los registros pasados e intenta encontrar patrones ocultos que un humano o un mapa simple podrían pasar por alto. Aprende mirando los datos una y otra vez.
  • La analogía: Imagina a un gran maestro de ajedrez que ha visto millones de partidas. No necesita dibujar un mapa del tablero; simplemente "siente" el movimiento correcto basándose en la intuición construida a partir de la experiencia.
  • El inconveniente: Este "cerebro" es muy pesado. Tarda mucho tiempo en entrenarse y requiere mucha potencia de cómputo, como intentar resolver un rompecabezas gigante con una supercomputadora.

El Experimento: La Arena de Simulación

Dado que no puedes simplemente empezar a dar malos consejos a clientes reales para ver qué sucede (eso le costaría dinero al banco), los investigadores construyeron una simulación virtual.

  • Crearon una versión de "videojuego" del proceso de préstamo.
  • Dejaron que la computadora jugara el juego miles de veces utilizando las estrategias que aprendió.
  • Midieron la puntuación: ¿Cuántas ganancias obtuvo el banco? (Ganancia = Intereses ganados menos el tiempo dedicado a trabajar en el préstamo).

Lo que encontraron

Los resultados fueron interesantes:

  1. Ambos Entrenadores Ganaron: Tanto el "Creador de Mapas" como el "Aprendiz Profundo" descubrieron estrategias que eran mucho mejores que la forma antigua y estándar de hacer las cosas del banco. Ambos ayudaron al banco a obtener más respuestas de "Sí" de los clientes.
  2. El Creador de Mapas fue Ligeramente Mejor: El "Creador de Mapas" (MDP) encontró consistentemente estrategias ligeramente mejores, especialmente en las situaciones complicadas y raras. Fue más fiable a la hora de saber exactamente qué hacer.
  3. El Creador de Mapas fue Mucho Más Rápido: Esta fue la mayor diferencia. El "Creador de Mapas" aprendió su estrategia en cuestión de minutos. El "Aprendiz Profundo" tardó horas (o incluso días, dependiendo del tamaño de los datos) en entrenarse.
    • Analogía: El Creador de Mapas fue como un estudiante que estudió un libro de texto y aprobó el examen en 10 minutos. El Aprendiz Profundo fue como un estudiante que tuvo que releer toda la enciclopedia 100 veces para obtener la misma nota.

La Conclusión

El artículo concluye que si quieres enseñar a una computadora cómo dirigir un proceso de negocio (como las aprobaciones de préstamos) utilizando datos pasados:

  • No siempre necesitas la IA más compleja y pesada (Aprendizaje Profundo).
  • Un enfoque más simple que construye un modelo claro del proceso (MDP) funciona igual de bien, si no mejor, y es mucho más rápido y económico de ejecutar.

Es un recordatorio de que, a veces, un buen y claro mapa es mejor que un cerebro súper complejo, especialmente cuando solo quieres hacer el trabajo de manera eficiente.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →