The Saudi Legal Corpus for AI: An Auditable, Official-Source-Grounded, Article-Level Corpus of Saudi Arabian Legislation
Este artículo presenta el Corpus Legal Saudí para la IA, un conjunto de datos exhaustivo, de fuentes oficiales y auditable a nivel de artículo compuesto por 290 instrumentos legislativos saudíes que presenta un seguimiento de procedencia único, capas analíticas estructuradas como grafos de citas y glosarios de términos definidos, y un banco de pruebas de recuperación que demuestra el rendimiento superior de la búsqueda mejorada con metadatos sobre las líneas base estándar para el procesamiento de lenguaje natural jurídico en árabe.
Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
En el mundo moderno, se pide cada vez más a las computadoras que respondan preguntas sobre la ley. Para hacerlo con precisión, recurren a una técnica llamada generación aumentada por recuperación. Este proceso funciona como un bibliotecario que, antes de responder una pregunta, busca primero en una vasta biblioteca de documentos confiables para encontrar el pasaje exacto que contiene la respuesta. Si la computadora puede encontrar el texto correcto, puede resumirlo para el usuario sin inventar cosas. Sin embargo, este sistema solo funciona si la biblioteca existe en un formato que la computadora pueda leer y entender. Para muchos idiomas y sistemas legales, especialmente en el mundo árabe, esta biblioteca ha estado ausente. Las leyes de Arabia Saudita, una de las principales economías globales, se publican en gacetas oficiales y en sitios web gubernamentales, pero existen como páginas y documentos legibles para humanos, no como datos estructurados que el software pueda buscar fácilmente. Sin una versión de estas leyes que sea legible por máquinas, la inteligencia artificial no puede asistir de manera confiable con preguntas legales en el Reino, dejando una brecha significativa tanto en la tecnología como en el acceso a la justicia.
Para cerrar esta brecha, un investigador llamado Abdullah Almohammedi ha construido el Corpus Jurídico Saudí para la IA, una enorme y estructurada colección digital de las leyes del Reino. Esta no es una simple lista de enlaces o una colección de PDF escaneados. En su lugar, es una base de datos cuidadosamente organizada que contiene 290 instrumentos legislativos distintos, que van desde leyes estatutarias principales hasta regulaciones implementadoras detalladas y reglas procesales. La colección cubre doce áreas diferentes del derecho, incluyendo negocios comerciales, justicia penal, derechos laborales y tributación. El núcleo de este trabajo es la transformación de 290 leyes en 15,689 registros individuales a nivel de artículo. Cada registro es una pieza de texto única y autónoma, como un artículo específico de una ley, que suma aproximadamente 1.2 millones de palabras en árabe. Toda la colección está diseñada para ser auditable, lo que significa que cada pieza de texto puede rastrearse hasta su fuente oficial exacta, asegurando que la computadora esté leyendo la ley real y no un resumen o una suposición.
La construcción de este corpus sigue un conjunto estrico de reglas para garantizar la precisión y la confianza. La regla más importante es que el texto oficial en árabe es la única versión que cuenta. Si bien la colección incluye traducciones al inglés y al chino, estas están claramente marcadas como referencias no autoritativas, útiles para la comprensión pero no legalmente vinculantes. Cada uno de los artículos en la base de datos lleva una etiqueta que explica exactamente de dónde proviene y cómo fue verificado. El investigador utilizó un sistema de cuatro niveles para calificar la fiabilidad de cada fuente, distinguiendo entre leyes que fueron cotejadas contra múltiples documentos oficiales y aquellas que provenían de una sola fuente. Este nivel de detalle permite a los usuarios filtrar los datos según cuánta evidencia necesiten. Por ejemplo, un sistema diseñado para asesoría legal de alto riesgo podría utilizar solo las fuentes verificadas con mayor rigor, mientras que un proyecto de investigación podría aceptar un rango más amplio. La base de datos también incluye un "manifiesto de frescura", una lista que señala 16 pistas específicas donde el portal gubernamental oficial podría aún no tener las enmiendas más recientes, asegurando que los usuarios estén conscientes de la posible información desactualizada en lugar de ser engañados por ella.
Más allá de solo almacenar el texto, el investigador añadió varias capas de análisis que nunca habían existido para la ley saudí. El corpus incluye un mapa de cómo las leyes se referencian entre sí, mostrando qué artículos citan a otros artículos. Este grafo de citas contiene más de 3,600 referencias, revelando qué leyes actúan como centros neurálgicos en el sistema legal, tales como la Ley Laboral y la Ley de Sociedades, que son frecuentemente citadas por otras regulaciones. También hay un mapa clasificado manualmente que muestra qué leyes han reemplazado o derogado a otras más antiguas, ayudando a rastrear la historia de los cambios legales. Además, el proyecto creó un glosario de casi 2,000 términos que están definidos específicamente dentro de las propias leyes, junto con más de 3,300 definiciones. Esto ayuda a aclarar cómo una misma palabra puede significar cosas distintas en diferentes contextos. Para que los datos estén listos para las herramientas de IA modernas, el texto también fue dividido en fragmentos más pequeños y manejables, permitiendo que las computadoras procesen secciones específicas de una ley sin perderse en miles de páginas de texto.
Para probar qué tan bien funciona este nuevo recurso, el investigador creó un benchmark utilizando 519 preguntas específicas sobre la ley saudí, cada una emparejada con el artículo correcto que contiene la respuesta. Estas preguntas fueron escritas mediante la lectura de las leyes reales y la formulación de consultas que una persona podría realizar. Cuando los investigadores probaron un método de búsqueda estándar contra este nuevo sistema rico en metadatos, los resultados fueron reveladores. El nuevo sistema identificó correctamente el artículo adecuado el 93.3 por ciento de las veces, en comparación con el 90.4 por ciento del método estándar. La diferencia fue más notable cuando las preguntas pedían definiciones, como "¿qué es un contrato de venta?". En estos casos, el nuevo sistema fue significativamente más preciso, encontrando la definición correcta el 90.9 por ciento de las veces frente al 74.5 por ciento del método estándar. Esta brecha demuestra que el trabajo adicional puesto en organizar los datos y añadir etiquetas detalladas rinde frutos, haciendo que sea mucho más fácil para las computadoras encontrar la información correcta incluso cuando los términos de búsqueda no coinciden perfectamente con el texto.
El lanzamiento de este corpus es un paso significativo hacia adelante para la tecnología legal en la región, pero conlleva límites y limitaciones claros. La colección no es exhaustiva; cubre las leyes principales pero no incluye cada decisión ministerial o regla municipal. El investigador es transparente al respecto, documentando el alcance de la colección y los riesgos específicos asociados con cada pieza de datos. El trabajo no es explícitamente una publicación oficial del gobierno, y las capas en inglés y chino no son traducciones oficiales. El único texto vinculante sigue siendo el árabe original tal como se publica en la gaceta oficial. Al proporcionar este recurso estructurado, verificado y auditable, el proyecto ofrece una base para construir asistentes legales confiables y realizar estudios más profundos sobre la estructura de la ley saudí. Proporciona un modelo de cómo otros países sin gacetas oficiales legibles por máquinas pueden organizar sus propios sistemas legales para la era digital, asegurando que la ley permanezca accesible, comprensible y fundamentada en los hechos.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.