Retrieval Augmented Generation Framework for the Nepali Legal Domain Question Answering
Este estudio introduce el primer marco de Generación Aumentada por Recuperación para la resolución de preguntas legales en nepalí, aprovechando el archivo Nepal Kanun Patrika para lograr puntuaciones de alta precisión y veracidad, abordando así los desafíos de escasez de datos en dominios legales de bajos recursos.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina el sistema legal de Nepal como una biblioteca antigua y masiva. Esta biblioteca contiene miles de sentencias judiciales (jurisprudencia) escritas en nepalí. Sin embargo, hay dos grandes problemas:
- Los libros están desordenados: Están escritos en un lenguaje anticuado, dispersos por diferentes lugares y no todos están digitalizados adecuadamente.
- El bibliotecario es nuevo: Los modelos de Inteligencia Artificial (IA) suelen ser entrenados con libros en inglés. Cuando les preguntas sobre leyes nepalíes, a menudo se confunden o inventan cosas porque no han "leído" suficientes textos legales en nepalí para aprender las reglas.
Este artículo presenta una nueva forma de solucionar esto utilizando un sistema llamado RAG (Generación Aumentada por Recuperación). Piensa en el RAG no como un estudiante que intenta memorizar un libro de texto, sino como un asistente de investigación inteligente al que se le permite buscar respuestas en una biblioteca antes de hablar.
Así es como los investigadores construyeron y probaron este asistente:
1. La Biblioteca (Los Datos)
El equipo acudió al archivo digital oficial de la Corte Suprema de Nepal (llamado Nepal Kanun Patrika). Recopilaron y limpiaron 10,320 documentos legales.
- El Desafío: No podían simplemente alimentar estos enormes documentos a la IA. Es como intentar encontrar una frase específica en un libro de 500 páginas leyendo todo el libro a la vez.
- La Solución: Fragmentaron los documentos en trozos más pequeños (como cortar una historia larga en párrafos cortos) para que la IA pudiera manejarlos mejor.
2. El Motor de Búsqueda (Encontrar la página correcta)
Antes de que la IA pueda responder una pregunta, necesita encontrar la página correcta en la biblioteca. Los investigadores probaron dos formas diferentes de búsqueda:
Método A: El "Cazador de Palabras Clave" (BM25)
- Cómo funciona: Este es como un bibliotecario tradicional que busca palabras exactas. Si preguntas: "¿Cuál es la pena por robo?", el bibliotecario escanea las palabras exactas "pena", "robo" y "ley".
- El Resultado: Este método fue el campeón. Encontró el documento correcto el 91% de las veces al buscar en fragmentos pequeños, y el 88% al buscar en documentos completos. Fue muy preciso porque el lenguaje legal suele ser muy específico y repetitivo.
Método B: El "Emparejador de Significados" (Recuperación Densa)
- Cómo funciona: Este es como un bibliotecario que entiende la vibra o el significado de una pregunta, incluso si las palabras son diferentes. Utiliza matemáticas avanzadas (embeddings) para adivinar que "robar" y "robo" son lo mismo.
- El Resultado: Este método fue bueno, pero no excelente para este trabajo específico. Solo encontró el documento correcto el 75% de las veces. Los investigadores descubrieron que para la ley nepalí, la coincidencia exacta de palabras funciona mejor que adivinar el significado, probablemente porque los términos legales son muy rígidos.
La Trampa de Velocidad:
El "Cazador de Palabras Clave" (BM25) tenía un inconveniente. Cuando fragmentaron los documentos en trozos diminutos para hacerlo más preciso, la búsqueda se volvió muy lenta (como buscar a través de 110,000 pequeñas fichas de índice en lugar de 10,000 libros). Para mantener el sistema lo suficientemente rápido como para ser útil, eligieron la versión de "Documento Completo" del Cazador de Palabras Clave. Era ligeramente menos preciso, pero mucho más rápido.
3. El Escritor de Respuestas (Generar la Respuesta)
Una vez que el sistema encontró el documento correcto, necesitaba escribir la respuesta.
- La Regla: Se le dijo estrictamente a la IA: "No inventes cosas".
- La Estrategia: Los investigadores utilizaron un proceso de dos pasos. Primero, la IA tenía que señalar la frase exacta en el documento que probaba la respuesta. Segundo, escribía la respuesta basándose únicamente en esa frase. Si no encontraba pruebas, se le ordenaba decir: "No lo sé", en lugar de suponer.
4. Los Resultados (¿Funcionó?)
El equipo probó este sistema con 100 preguntas escritas por expertos legales. Así es como se desempeñó la mejor versión (Cazador de Palaves Clave + Documentos Completos):
- Tasa de Éxito: Generó con éxito una respuesta para el 92% de las preguntas.
- Veracidad: Cuando fue revisado por otra IA y por abogados humanos, las respuestas fueron un 85% veraces (lo que significa que no mintieron ni inventaron hechos).
- Fundamentación: El 74% de las respuestas estaban directamente respaldadas por el texto encontrado en la biblioteca.
La Conclusión
Este artículo demuestra que para un idioma con pocos recursos como el nepalí, no necesitas una IA súper inteligente que lo haya memorizado todo. En su lugar, necesitas una herramienta de búsqueda confiable que encuentre el texto legal exacto y una IA estricta que se niegue a hablar a menos que tenga el texto frente a ella.
Al combinar un método de búsqueda simple y rápido (BM25) con un proceso de escritura cuidadoso, crearon el primer sistema que puede responder de manera confiable a preguntas legales en nepalí sin inventar hechos. Es una base que eventualmente podría ayudar a las personas comunes a comprender sus derechos legales sin necesidad de un título en derecho.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.