← Últimos artículos
💬 NLP

Structure-Guided Entity Resolution: Fine-Tuning LLMs for Robust Name Matching in Complex Linguistic Contexts

Este artículo introduce la Resolución de Entidades Guiada por Estructura (SGER), un marco de ajuste fino curricular en dos fases para Modelos de Lenguaje Grandes que logra una precisión de vanguardia en la coincidencia de nombres personales complejos y multilingües, y que actualmente se despliega a gran escala para el cumplimiento de KYC en la plataforma de Dream11.

Autores originales: Shivam Chourasia, Hitesh Kapoor, Nilesh Patil

Publicado 2026-05-25
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Shivam Chourasia, Hitesh Kapoor, Nilesh Patil

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando comparar los nombres de dos personas, pero los nombres están escritos de manera caótica y desordenada. Una persona podría aparecer como "Rajesh Kumar", otra como "Kumar Rajesh", una tercera como "RajeshKumar" (sin espacio) y una cuarta como "Rajeshbhai" (con un título amigable añadido). En un país tan diverso como la India, donde los nombres cambian según la región, el idioma e incluso la forma en que los tecleó un empleado, esto es una pesadilla para las computadoras.

Este artículo presenta un nuevo sistema llamado SGER (Resolución de Entidades Guiada por Estructura) que resuelve este problema con un método de entrenamiento inteligente de dos pasos. Así es como funciona, explicado de forma sencilla:

El Problema: El Rompecabezas del "Nombre Desordenado"

En el mundo de las verificaciones de "Conozca a su Cliente" (KYC), donde las empresas verifican quién es usted antes de permitirle jugar o abrir cuentas, las computadoras a menudo fallan.

  • La Vieja Forma: Las computadoras tradicionales utilizan reglas simples, como contar cuántas letras son diferentes entre dos nombres. Es como intentar resolver un rompecabezas mirando solo el color de las piezas, ignorando su forma. Si alguien escribe "Shubham" en lugar de "Subham", la computadora se confunde.
  • La Nueva Forma (Modelos de Lenguaje Grande - LLM): Los Modelos de Lenguaje Grande (IA) son inteligentes, pero si simplemente les preguntas "¿Son estos dos nombres la misma persona?", a veces adivinan mal porque no han aprendido primero la gramática de los nombres. Intentan aprender la estructura y la respuesta al mismo tiempo, lo cual es como pedirle a un estudiante que escriba una tesis y resuelva un problema de matemáticas simultáneamente.

La Solución: Una "Escuela" de Dos Fases para la IA

Los autores crearon un plan de estudios (un plan de lecciones) para enseñar a su modelo de IA, basado en un sistema llamado Llama 3, en dos fases distintas. Piénselo como entrenar a un nuevo empleado:

Fase 1: La Clase de "Arquitecto de Nombres"
Antes de que la IA intente comparar nombres, se le enseña a descomponerlos.

  • La Tarea: Le das a la IA un nombre desordenado como "Kirtan Singh Rathore".
  • La Lección: La IA debe generar una lista ordenada y estructurada (como un archivo JSON) que diga: Nombre: Kirtan, Segundo Nombre: Singh, Apellido: Rathore.
  • La Analogía: Imagina enseñarle a un niño a tomar una pila desordenada de bloques de Lego y clasificarlos en "ruedas", "ventanas" y "paredes" antes de intentar construir un coche. La IA aprende que "Singh" suele ser un segundo nombre o un apellido, y que "Rathore" es el apellido, independientemente del orden en que aparezcan.

Fase 2: La Clase de "Detective"
Ahora que la IA entiende cómo se construyen los nombres, es promovida al rol de detective.

  • La Tarea: Le das dos nombres (por ejemplo, "Rajeshk" y "Rajesh Kumar") y preguntas: "¿Son estas la misma persona?"
  • La Ventaja: Como la IA ya sabe cómo descomponer los nombres de la Fase 1, no tiene que adivinar la estructura mientras toma la decisión. Puede enfocarse puramente en la coincidencia.
  • El Resultado: Se vuelve increíblemente precisa al detectar que "Rajeshk" es simplemente un error tipográfico o una abreviatura de "Rajesh Kumar".

Los Resultados: Un Sistema Superpreciso

El equipo probó este sistema en 50,000 ejemplos del mundo real de la India, un lugar conocido por tener algunas de las convenciones de nombres más complejas y variadas del mundo.

  • Métodos Antiguos: Obtuvieron una precisión de aproximadamente 57% a 85%.
  • IA Estándar (sin el entrenamiento de dos pasos): Obtuvo una precisión de aproximadamente 91%.
  • SGER (El Nuevo Sistema): Logró una precisión del 99.02%.

Esto significa que el sistema es casi perfecto para determinar si dos nombres pertenecen a la misma persona, incluso cuando los nombres están mal escritos, intercambiados o les faltan espacios.

Impacto en el Mundo Real: Dream11

Esto no es solo una teoría; ya está funcionando. El sistema está implementado en Dream11, la plataforma de deportes fantásticos más grande del mundo, que atiende a más de 250 millones de usuarios.

  • Antes: Cuando la computadora no estaba segura, tenía que enviar el caso a un humano para que lo verificara manualmente. Esto era lento y costoso.
  • Después: La IA maneja casi todo automáticamente.
  • El Beneficio: La empresa ahorra más de 500,000 dólares al año porque ya no necesita pagar a humanos para verificar estos casos, y los usuarios legítimos se verifican instantáneamente sin tener que esperar.

Resumen

El artículo argumenta que para hacer que la IA sea buena en un trabajo específico y desordenado (como comparar nombres en la India), no debes simplemente lanzarle datos. En su lugar, debes enseñarle primero las reglas del juego (cómo se estructuran los nombres) y luego enseñarle a jugar el juego (comparar los nombres). Este enfoque de "plan de estudios" convirtió a una buena IA en una casi perfecta, resolviendo un enorme dolor de cabeza para una empresa global.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →