← Últimos artículos
💬 NLP

LexKairos: Benchmarking Legal Temporal Capabilities in LLMs

Este artículo presenta LexKairos, un benchmark exhaustivo diseñado para evaluar las capacidades temporales de los grandes modelos de lenguaje en el contexto jurídico chino a través del conocimiento estatutario, la modelización de casos y el razonamiento, revelando que incluso los modelos con mejor desempeño todavía tienen dificultades con tareas jurídicas precisas y sensibles al tiempo.

Autores originales: Chenyang Li, Zejia Feng, Yuqin Huang, Yuxiao Ye, Huiyuan Xie

Publicado 2026-08-11
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Chenyang Li, Zejia Feng, Yuqin Huang, Yuxiao Ye, Huiyuan Xie

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina un mundo donde la ley no es solo una gigantesca biblioteca de reglas, sino una máquina viva que respira y que solo funciona si giras los controles adecuados en el momento exacto. En este mundo, una ley puede ser una herramienta poderosa hoy, pero ayer fue un juguete roto, y mañana podría ser una máquina completamente diferente. Este es el reino de las Capacidades Temporales Legales. Aunque las computadoras se han vuelto muy buenas leyendo leyes y entendiendo lo que dicen (el "qué"), todavía están luchando por entender cuándo se aplican (el "cuándo"). Piensa en ello como un GPS que conoce todos los nombres de las calles pero se confunde con los semáforos y las zonas de construcción que cambian cada hora. Si una computadora no puede distinguir entre una regla que está activa ahora frente a una que expiró el año pasado, no puede dar asesoría legal sin causar un desastre masivo. Es por esto que los investigadores están compitiendo para enseñar a la Inteligencia Artificial cómo mantener un tiempo perfecto con la ley.

Entra LexKairos, una nueva "prueba de viaje en el tiempo" diseñada por investigadores de la Universidad de Oxford, la Universidad de Sun Yat-Sen y la Universidad de Tsinghua para ver qué tan bien pueden los cerebros de la IA moderna manejar el tic-tac del reloj del sistema legal chino. No se limitaron a pedirle a la IA que adivinara; construyeron una rigurosa pista de obstáculos con nueve desafíos diferentes, que iban desde simples cuestionarios de memoria sobre cuándo comenzaron las leyes, hasta complejos acertijos donde la IA debe mezclar hechos de un caso judicial con plazos estrictos de un libro de reglas. Pusieron a ocho modelos de IA diferentes a través de este circuito, permitiendo que algunos pensaran silenciosamente antes de responder y otros simplemente lanzaran una respuesta inmediata.

¿Los resultados? Es un poco variado, como una carrera donde los corredores son rápidos pero siguen tropezando con sus propios cordones. Los mejores desempeños, como Gemini-3-Flash y GPT-5.4, lograron puntuar alrededor del 84.57% y 82.75% respectivamente cuando se les permitió usar sus modos de "pensamiento". Eso suena impresionante, pero los investigadores descubrieron que incluso los modelos más inteligentes tropiezan estrepitosamente cuando se les pide recordar detalles específicos sobre qué versión de una ley estaba activa en un día determinado. Resulta que, si bien la IA es excelente descifrando el orden de los eventos en una historia (como quién hizo qué primero en un caso judicial), es sorprendentemente mala recordando las "fechas de nacimiento" y "fechas de expiración" exactas de las leyes mismas.

Uno de los descubrimientos más interesantes fue cómo fallan estos modelos de IA. Cuando se les pedía identificar la versión correcta de una ley, los modelos no se equivocaban de forma aleatoria; tenían personalidades distintas en sus errores. Un modelo, GPT-5.4, era como un estudiante tímido que tenía miedo de adivinar, dejando a menudo la respuesta en blanco o perdiendo la etiqueta de la versión por completo (un error de "etiqueta ausente"). Otro modelo, LegalOne-8B, era como un estudiante excesivamente confiado que inventaba hechos, creando números de versión que no existían (un error de "etiqueta alucinada"). Cuando los investigadores activaron el "modo de pensamiento" —permitiendo que los modelos hicieran una pausa y razonaran el problema— el modelo tímido empezó a adivinar más (reduciendo sus etiquetas ausentes) pero empezó a inventar más versiones falsas, mientras que el modelo excesivamente confiado se volvió más cauteloso pero empezó a perder etiquetas con más frecuencia. Es como si darles más tiempo para pensar no arreglara su memoria; solo intercambiaba un tipo de error por otro.

Además, el estudio sugiere que simplemente dejar que una IA "piense" en voz alta no siempre es la solución mágica. Para algunos modelos, el proceso de pensamiento era tan largo y sinuoso que se quedaban sin espacio para terminar su respuesta, cortándose justo antes de la solución. Los investigadores descubrieron que, al darle a la IA una lista de verificación específica y estructurada de pasos legales a seguir (un "prompt específico de la tarea"), podían obtener resultados igual de buenos pero con respuestas que eran hasta 3.4 veces más cortas. Esto sugiere que para el viaje en el tiempo legal, un tour guiado puede ser mejor que dejar que la IA deambule sin rumbo.

En última instancia, LexKairos sugiere que, aunque la IA está mejorando en el razonamiento legal, la parte del "cuándo" de la ley sigue siendo un desafío obstinado. Incluso los mejores modelos son propensos a errores cuando lo que está en juego son fechas precisas y plazos procesales. El artículo no afirma que este problema esté resuelto; más bien destaca que necesitamos construir una IA que no sea solo inteligente, sino también increíblemente precisa con el tiempo, porque en el mundo legal, llegar un día tarde puede significar la diferencia entre la justicia y un caso perdido.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →