← Últimos artículos
💻 computer science

DiligenceProv: A Truth-Ledger Benchmark for Verifiable Financial Due-Diligence Answers from Large Language Models

Este artículo presenta DiligenceProv, un nuevo referente y metodología de construcción que utiliza salas de operaciones sintéticas con imperfecciones registradas para evaluar y mejorar la verificabilidad, la recuperación de evidencia y la precisión de las definiciones de los modelos de lenguaje de gran tamaño en procesos de debida diligencia financiera de alto riesgo.

Autores originales: Yunguo Yu

Publicado 2026-09-14
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Yunguo Yu

Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Cuando una empresa es comprada o vendida, el proceso depende de una revisión rigurosa de su salud financiera, una etapa conocida como debida diligencia (due diligence). Los asesores pasan semanas analizando una "sala de datos" (deal room), una colección de documentos que van desde estados financieros auditados e informes de resultados hasta borradores de contratos y presentaciones de la gerencia. Su trabajo es responder preguntas críticas: ¿Cuánto gana realmente la empresa? ¿Qué riesgos conllevan sus clientes más grandes? En este entorno de alto riesgo, una respuesta es tan buena como la prueba que la respalda. Un revisor debe ser capaz de verificar no solo el número final, sino también la definición específica utilizada para calcularlo y el documento exacto que sustenta la afirmación. Si una respuesta parece segura pero es errónea, puede inducir a error en una decisión de inversión de forma más peligrosa que la ausencia de una respuesta.

La inteligencia artificial, específicamente los modelos de lenguaje extensos, está comenzando a entrar en este campo, prometiendo acelerar la lectura y el análisis de estos complejos documentos. Sin embargo, persiste un obstáculo significativo. Los sistemas de IA actuales pueden leer texto con fluidez, pero tienen dificultades con el tipo específico de verificación que se requiere en las finanzas. Pueden producir un número plausible que en realidad es incorrecto, o pueden citar un documento que no respalda su conclusión. El desafío central no es si la IA puede leer las palabras, sino si puede navegar por una colección desordenada de información contradictoria para encontrar la verdad única que un experto humano aceptaría.

Para abordar esto, investigadores han creado un nuevo campo de pruebas llamado DiligenceProv. Este no es un test estándar basado en informes financieros públicos y limpios donde las respuestas ya están conciliadas y acordadas. En su lugar, los investigadores crearon una empresa ficticia y generaron un conjunto realista de treinta documentos, incluyendo estados financieros, cronogramas de deuda y presentaciones de la gerencia. Introdujeron deliberadamente los tipos de desorden que se encuentran en las transacciones reales: la misma medida de ganancias definida de tres maneras diferentes, números desactualizados que parecen actuales y preguntas que los documentos simplemente no pueden responder. El objetivo era ver si un sistema de IA podía proporcionar respuestas que un revisor humano pudiera verificar, comprobando el número, la definición y la evidencia, todo al mismo tiempo.

Los investigadores descubrieron que el simple hecho de hacer que los documentos parecieran realistas no era suficiente para desafiar a los sistemas de IA más avanzados. En una prueba inicial con un conjunto de documentos realistas pero perfectamente consistentes, un modelo comercial de primer nivel respondió correctamente a todas las preguntas, incluso cuando las preguntas eran complicadas. El sistema no tuvo problemas porque los documentos no contenían los tipos específicos de trampas que existen en las negociaciones reales. Los investigadores se dieron cuenta de que, para probar verdaderamente estos sistemas, tenían que diseñar la dificultad. Crearon un "libro de registro de la verdad" (truth ledger), un registro maestro de cada hecho, y luego escribieron los documentos para que contuvieran imperfecciones registradas. Estas incluían conflictos entre diferentes documentos, distracciones realistas que parecían la respuesta correcta pero eran erróneas, y vacíos silenciosos donde la información faltaba pero nunca se declaraba explícitamente como ausente.

Cuando probaron los modelos de IA contra este desorden diseñado, los resultados cambiaron drásticamente. Los modelos más avanzados, que previamente habían puntuado perfectamente, comenzaron a fallar cuando tuvieron que navegar por estas imperfecciones registradas. De manera más sorprendente, los investigadores descubrieron que, para muchos de los modelos de gama media, entregarle a la IA el conjunto completo de los treinta documentos hacía que su rendimiento fuera peor que si se le entregaban solo seis páginas cuidadosamente seleccionadas. Cuando la IA tenía acceso a la sala completa, a menudo se distraía con números desactualizados o citas fabricadas que aparecían en el texto adicional. Tomaba la versión incorrecta de un número o inventaba un documento que no existía. Sin embargo, cuando los investigadores proporcionaban solo los pasajes más relevantes, la IA funcionaba significamente mejor. En este caso, el proceso de recuperación actuaba como un filtro protector, blindando al modelo del ruido y la confusión del conjunto completo de documentos.

El estudio también reveló que la parte más difícil para estos sistemas de IA no era encontrar la evidencia, sino entender cómo usarla. Incluso cuando los investigadores les daban los documentos correctos y los números exactos, los modelos seguían cometiendo errores. A menudo no lograban aplicar la definición correcta de una métrica financiera o no podían distinguir entre una versión preliminar de un contrato y la versión final. Los errores no se debían a una falta de información, sino a una falta de disciplina al aplicar las reglas de la transacción. Los investigadores categorizaron estos fallos en tipos específicos, tales como "respuestas erróneas con confianza", donde la IA afirma un hecho falso con certeza, o "captura de distractores", donde se aferra a un número engañoso.

Un hallazgo particularmente preocupante fue la incapacidad de la IA para admitir que no sabía algo. En el mundo real, si un documento no contiene una previsión específica, la respuesta correcta es decir que la información falta. En las pruebas, los modelos de IA rara vez se negaban a responder. En su lugar, ante la falta de datos, a menudo intentaban adivinar o extrapolar, creando un número fabricado que parecía estructurado y profesional. Este es un comportamiento peligroso en las finanzas, donde un número erróneo con apariencia de seguridad puede ser más perjudicial que una clara admisión de información faltante.

Los investigadores concluyeron que la dificultad en la debida diligencia financiera no es solo la complejidad del texto, sino la forma en que se accede y se gestiona la evidencia. Para los sistemas de IA más fuertes, tener acceso al contexto completo de todos los documentos les permitió alcanzar puntuaciones casi perfectas, lo que sugiere que su principal limitación es simplemente tener la información adecuada disponible. Para otros modelos, tener demasiada información era una desventaja. El estudio sugiere que, para que estos sistemas sean confiables en transacciones reales, necesitan flujos de trabajo que prioricen la verificación y la definición sobre la simple recuperación. El benchmark ahora está disponible para que otros investigadores lo utilicen, proporcionando una forma de medir y mejorar estos sistemas antes de que se les confíe dinero real. El trabajo demuestra que, para tareas financieras de alto riesgo, el camino hacia la fiabilidad no consiste en hacer que la IA sea más inteligente, sino en construir sistemas que puedan verificar sus propias respuestas contra un conjunto estricto de reglas y evidencia.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →