← Últimos artículos
💬 NLP

INS-ActBench: A Comprehensive Benchmark for Assessing Professional Actuarial Capability of Large Language Models

El artículo presenta INS-ActBench, un banco de pruebas exhaustivo que comprende más de 12.000 preguntas de 16 asociaciones actuariales para evaluar los modelos de lenguaje de gran tamaño a través del conocimiento, el razonamiento de casos de contexto largo y la práctica basada en herramientas, revelando que, si bien los modelos de frontera sobresalen en el conocimiento estandarizado, todavía presentan un rezago significativo en flujos de trabajo profesionales complejos.

Autores originales: Changyu Chen, Chenwei Lin, Xian Xu

Publicado 2026-07-28
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Changyu Chen, Chenwei Lin, Xian Xu

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás enseñando a un robot a ser un mago financiero. Ya le has mostrado cómo leer un diccionario de términos monetarios y cómo hacer matemáticas básicas. Pero ser un verdadero mago no es solo saber los hechizos; es saber cuándo usarlos, cómo mezclarlos cuando la situación es caótica y tener las manos firmes para lanzar el hechizo sin más bien incendiar el castillo. Este es el mundo de los Modelos de Lenguaje Extensos (LLM): programas informáticos superinteligentes que pueden leer, escribir y razonar como los humanos. Durante mucho tiempo, hemos probado a estos robots en tareas aisladas: "¿Puedes definir esta palabra?" o "¿Puedes resolver este problema matemático?". Pero en el mundo real, los profesionales no trabajan de forma aislada. Tienen que leer un contrato de cien páginas, encontrar la cláusula diminuta que importa, calcular el riesgo y luego usar una hoja de cálculo o código para demostrar que su respuesta es correcta. Este artículo plantea una gran pregunta: ¿Pueden estos magos de la IA realizar realmente todo el trabajo, o son solo buenos memorizando fichas de estudio?

Entra INS-ActBench, un nuevo y masivo "examen final" creado por investigadores de la Universidad de Fudan para poner a prueba a la IA en el trabajo específico y de alto riesgo de la Ciencia Actuarial. Piensa en un actuario como un detective de riesgos profesional que trabaja para compañías de seguros. Utilizan las matemáticas, la estadística y la economía para determinar qué tan probable es que algo malo suceda (como un choque de auto o un incendio en una casa) y cuánto dinero debe ahorrar la empresa para pagarlo. Es un trabajo que requiere conocer las reglas, leer historias complejas sobre desastres del mundo real y realizar cálculos precisos que no pueden fallar. Los investigadores construyeron un banco de pruebas de 12.050 preguntas extraídas de exámenes reales realizados por actuarios en todo el mundo. No se limitaron a hacer preguntas de cultura general simple; diseñaron la prueba para ver si la IA podía manejar tres niveles diferentes de dificultad:

  1. Las Fichas de Estudio (INS-Act-Know): ¿Puede la IA recordar las definiciones y fórmulas?
  2. La Novela de Misterio (INS-Act-Case): ¿Puede la IA leer una historia larga y complicada sobre las finanzas de una empresa, encontrar las pistas ocultas y hacer una suposición inteligente sobre el futuro?
  3. El Taller (INS-Act-Practice): ¿Puede la IA realizar realmente el trabajo escribiendo el código de computadora o las fórmulas de hoja de cálculo correctas para obtener un número que pueda ser verificado?

Cuando los investigadores sometieron a nueve modelos de IA diferentes a este agotador examen, los resultados fueron una mezcla de "guau" y "vaya". Los modelos de IA fueron sorprendentemente buenos en el primer nivel. Dominaron las fichas de estudio, puntuando a menudo más alto que los expertos humanos en preguntas de conocimiento estandarizadas. Resulta que, si solo le pides a una IA que recite una regla o resuelva un problema matemático simple, es un genio.

Sin embargo, en el momento en que la prueba se volvió caótica, los robots tropezaron. Cuando la IA tenía que leer un caso de seguros largo y complejo (el nivel de la "Novela de Misterio"), sus puntuaciones bajaron drásticamente. Les costó conectar los puntos entre las diferentes partes de la historia. Peor aún, cuando tenían que entrar al "Taller" y realmente escribir el código o las fórmulas de la hoja de cálculo para producir un número final, no pudieron hacerlo de manera confiable. El estudio encontró que, aunque la IA podía hablar sobre las matemáticas, a menudo no podía hacer las matemáticas de una manera consistente y verificable.

Los investigadores también descubrieron que el rendimiento de la IA cambiaba dependiendo de dónde provenían las reglas. Las leyes de seguros son diferentes en los EE. UU., el Reino Unido y Japón. Los modelos de IA eran excelentes con las reglas "estándar" que veían con frecuencia en su entrenamiento, pero se confundían cuando las preguntas provenían de diferentes países con regulaciones locales distintas. También encontraron que los mayores fallos de la IA no se debían usualmente a que olvidaran cómo usar una herramienta (como una calculadora); era porque usaban la herramienta correctamente pero aplicaban la lógica o la fórmula incorrecta al problema.

En resumen, este artículo sugiere que, si bien la IA se ha convertido en una fantástica enciclopedia de conocimiento actuarial, aún no es un asistente profesional confiable. Puede pasar el examen escrito, pero no está lista para sentarse en la oficina y tomar las decisiones finales que mantienen seguras a las compañías de seguros. Los investigadores concluyen que, para que la IA ayude verdaderamente en este campo, necesita mejorar mucho en la conexión de puntos en historias largas y en la ejecución de flujos de trabajo complejos paso a paso sin cometer errores pequeños pero costosos. Por ahora, el experto humano sigue siendo el que sostiene la pluma.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →