← Últimos artículos
💻 computer science

SHAP and LIME Explainability in Financial Machine Learning: A Systematic Review of Methods, Evaluation Gaps, and Barriers to Deployment

Esta revisión sistemática de 297 estudios revela que, si bien SHAP y LIME son ampliamente adoptados para la explicabilidad en el aprendizaje automático financiero —particularmente para el modelado de crédito—, sufren una falta crítica de evaluación formal, con solo un 9,1% de los artículos evaluando la calidad de la explicación, lo que resalta una necesidad urgente de estándares de validación y despliegue más sólidos para asegurar el cumplimiento regulatorio y la confianza.

Autores originales: Manpreet Singh, Akshatha Srikantha, Keshav Kaushik, Prajwal Bajpai

Publicado 2026-08-18
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Manpreet Singh, Akshatha Srikantha, Keshav Kaushik, Prajwal Bajpai

Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

En el mundo financiero moderno, los bancos, las aseguradoras y las firmas de negociación dependen en gran medida de complejos programas informáticos para tomar decisiones de alto riesgo. Estos programas, a menudo llamados modelos de aprendizaje automático, pueden predecir si una persona pagará un préstamo, señalar una transacción como fraudulenta o determinar el precio de una póliza de seguro. Si bien estas herramientas son increíblemente poderosas, a menudo operan como "cajas negras". Esto significa que incluso las personas que las construyeron no pueden ver fácilmente cómo la computadora llegó a una respuesta específica. Cuando se deniega un préstamo o se congela una cuenta, el cliente, el auditor y el regulador necesitan saber por qué. Para resolver esto, los investigadores han desarrollado un campo llamado IA Explicable. Estas son herramientas diseñadas para arrojar luz sobre la caja negra, traduciendo la compleja matemática de la computadora en razones legibles para los humanos. Dos de las herramientas más populares para este trabajo se conocen como SHAP y LIME. Actúan como traductores, tomando una predicción terminada y trabajando hacia atrás para mostrar qué factores, como los ingresos o el historial de gastos, importaron más. Sin embargo, el hecho de que una herramienta pueda producir una explicación no significa que esa explicación sea correcta, estable o lo suficientemente confiable como para ser utilizada en un tribunal real o en una sucursal bancaria.

Un equipo de investigadores de la Universidad de Boston, la Universidad de California, Irvine, la Universidad de Sharda y el Instituto Indio de Tecnología de Kanpur decidió investigar exactamente qué tan bien se están utilizando estas herramientas en el mundo real de las finanzas. No solo buscaron ideas nuevas; realizaron una revisión sistemática masiva de casi 300 estudios científicos publicados entre 2016 y 2026. Su objetivo era auditar la evidencia. Querían ver si los investigadores solo estaban presumiendo imágenes bonitas de cómo funciona un modelo, o si realmente estaban demostrando que esas imágenes eran precisas y confiables. El equipo siguió un protocolo estricto, buscando a través de miles de registros académicos para encontrar solo aquellos estudios donde SHAP o LIME se aplicaran genuinamente a datos financieros, como la calificación crediticia o la detección de fraude. Luego examinaron cada detalle: qué tipo de problema financiero se estaba resolviendo, qué tipo de modelo informático se estaba explicando y, lo más importante, si los investigadores probaron la calidad de sus explicaciones.

Los resultados de esta revisión revelan una brecha significativa entre la rapidez con la que se están adoptando estas herramientas y la meticulosidad con la que se están probando. Los investigadores encontraron que el campo se ha movido muy rápido. La gran mayoría de los estudios que analizaron, aproximadamente el 74 por ciento, se centraron en decisiones simples de sí o no, como aprobar un préstamo o detectar un fraude. En estos estudios, la herramienta conocida como SHAP fue la favorita indiscutible, apareciendo en casi el 94 por ciento de todos los artículos. Esta popularidad se debe en gran medida a que SHAP funciona muy bien con el tipo específico de modelos informáticos que los bancos utilizan con más frecuencia. La segunda herramienta, LIME, se utilizó con mucha menos frecuencia y generalmente solo como una nota al pie de SHAP, en lugar de como un método primario. Aunque los investigadores encontraron que casi todos los estudios informaron qué tan bien su modelo informático predijo el resultado, la historia cambió completamente cuando observaron las explicaciones en sí mismas.

El hallazgo más sorprendente fue que casi nadie estaba realmente comprobando si sus explicaciones eran buenas. De los 297 estudios revisados, solo 21, que es aproximadamente el 7 por ciento, realizaron una prueba formal para ver si la explicación coincidía con el comportamiento real del modelo. Otros 6 estudios ofrecieron alguna evidencia limitada, pero la gran mayoría simplemente generó una explicación y asumió que era correcta. Los investigadores señalaron que este es un descuido peligrooso. En finanzas, una explicación no es solo un apoyo visual; es una parte crítica del proceso de toma de decisiones. Si un banco le dice a un cliente que se le denegó un préstamo debido a su historial crediticio, pero la explicación es en realidad errónea o inestable, se crean riesgos legales y éticos. La revisión encontró que los investigadores a menudo trataban el acto de generar una explicación como lo mismo que validarla, pero la evidencia muestra que estas son dos cosas muy diferentes.

El estudio también analizó los obstáculos que impiden que estas herramientas se utilicen de forma segura en sistemas del mundo real. Los investigadores encontraron que el 72 por ciento de los estudios mencionaron barreras técnicas o relacionadas con los datos. El problema más común citado fue el "desequilibrio de clases", una situación en la que el evento que se predice, como un incumplimiento de préstamo o un caso de fraude, ocurre muy raramente en comparación con los casos normales. Esta rareza dificulta que las herramientas de explicación den respuestas consistentes. Otras barreras incluyeron la necesidad de resultados rápidos, las preocupaciones de privacidad y el hecho de que los datos financieros cambian con el tiempo. Sin embargo, la revisión destacó una desconexión: aunque los investigadores frecuentemente enumeraron estas barreras como problemas, rara vez probaron cómo estos problemas dañaban realmente la calidad de las explicaciones. Nombraron los obstáculos pero no midieron el daño.

Cuando los investigadores observaron cómo los científicos intentaban construir confianza en sus resultados, encontraron que la mayoría dependía de métodos débiles. Cerca del 36 por ciento de los estudios mencionaron alguna forma de validación, pero el enfoque más común fue simplemente comparar los resultados de SHAP con LIME. Si las dos herramientas estaban de acuerdo, los investigadores a menudo asumían que la explicación era correcta. La revisión argumenta que esto no es prueba suficiente, porque ambas herramientas podrían estar equivocadas de la misma manera. Métodos más fuertes, como probar cómo la explicación se mantiene cuando los datos cambian ligeramente, o pedir a expertos humanos que juzguen los resultados, se utilizaron en una fracción minúscula de los estudios. Los autores concluyeron que el campo ha dominado el arte de producir explicaciones, pero ha fallado ampliamente en demostrar que esas explicaciones son confiables. Proponen un nuevo estándar para la investigación futura, instando a los científicos a dejar de tratar la generación de una explicación como el paso final. En su lugar, deben tratar la explicación misma como un producto que necesita pruebas rigurosas, tal como el modelo financiero que describe, antes de que se utilice para tomar decisiones que afecten la vida de las personas.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →