← Últimos artículos
💬 NLP

A System for Name and Address Parsing with Large Language Models

Este artículo presenta un marco impulsado por prompts y centrado en la validación que aprovecha los modelos de lenguaje de gran tamaño sin realizar ajustes finos para transformar de manera confiable texto no estructurado de nombres y direcciones en un esquema consistente de 17 campos mediante la integración de normalización de entrada, decodificación restringida y validación estricta basada en reglas.

Autores originales: Adeeba Tarannum, Muzakkiruddin Ahmed Mohammed, Mert Can Cakmak, Shames Al Mandalawi, John Talburt

Publicado 2026-01-27
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Adeeba Tarannum, Muzakkiruddin Ahmed Mohammed, Mert Can Cakmak, Shames Al Mandalawi, John Talburt

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes una pila gigante y desordenada de cartas escritas a mano. Algunas están escritas en inglés, otras en español, algunas tienen la tinta corrida y otras carecen de comas o tienen errores tipográficos como "123 Main St Apt 4B" escrito como "123MainStApt4B". Tu objetivo es convertir este caos en una hoja de cálculo limpia y organizada donde cada pieza de información (Nombre, Calle, Código Postal) tenga su propia columna específica.

Este documento describe una nueva forma de hacer ese trabajo utilizando un cerebro de computadora muy inteligente (llamado Modelo de Lenguaje Extenso, o LLM), pero con un giro: en lugar de enseñarle al cerebro de la computadora un nuevo idioma desde cero (lo que sería como contratar a un nuevo empleado y entrenarlo durante meses), los autores construyeron un sistema estricto de "lista de verificación y supervisor" a su alrededor.

Así es como funciona su sistema, desglosado en pasos sencillos:

1. El "Chef de Preparación" (Normalización de Entrada)

Antes de que la computadora inteligente siquiera mire los datos, un "Chef de Preparación" los limpia.

  • El Problema: Los datos brutos son desordenados. Una persona escribió "Ave." y otra escribió "Avenue.". Otra escribió "N.E." y otra "NE.".
  • La Solución: El sistema estandariza todo automáticamente. Convierte todas las abreviaturas en palabras completas, corrige las mayúsculas y elimina símbolos extraños. Es como un chef que pica todos los vegetales exactamente del mismo tamaño antes de cocinar, para que la receta funcione perfectamente siempre.

2. La "Receta Estricta" (Ensamblaje de Prompts)

En lugar de dejar que el cerebro de la computadora adivine qué hacer, los autores le dan una tarjeta de receta muy específica e inalterable.

  • El Problema: Si solo le pides a una computadora inteligente: "Aquí hay una dirección, dime las partes", podría inventar hechos o dar el formato de la respuesta de manera diferente cada vez.
  • La Solución: La tarjeta de receta dice: "Eres un analizador experto. Debes generar exactamente 17 campos en este orden exacto. Si no sabes algo, déjalo en blanco. No inventes datos". Es como darle a un robot un manual de ensamblaje estricto: "Pon el tornillo aquí, el perno allá. No improvises".

3. La "Línea de Ensamblaje" (Inferencia Restringida)

La computadora procesa los datos en grupos pequeños y fijos (lotes de 16), tal como una línea de ensamblaje que mueve 16 autos a la vez.

  • El Objetivo: Esto asegura que la computadora no se vuelva "creativa" ni se canse. Mantiene la configuración bloqueada para que, si ejecutas el mismo trabajo dos veces, obtengas exactamente el mismo resultado. Es como una máquina de fábrica que nunca cambia su velocidad o sus ajustes.

4. El "Inspector de Control de Calidad" (Validación)

Esta es la parte más importante. Una vez que la computadora termina su trabajo, un estricto "Inspector de Control de Calidad" revisa cada línea.

  • Las Reglas:
    • ¿El Código Postal coincide con el Estado? (por ejemplo, un Código Postal de California no puede estar en Nueva York).
    • ¿La computadora inventó un nombre de calle que no existe?
    • ¿Hay exactamente 17 campos?
  • El Resultado: Si la computadora comete un error, el Inspector lo detecta de inmediato. Si la computadora no está segura, el sistema lo marca para que un humano lo revise más tarde. Esto garantiza que la hoja de cálculo final sea casi perfecta.

¿Qué Encontraron?

Los autores probaron este sistema con 1,500 registros de direcciones diferentes, incluyendo registros desordenados de EE. UU., Puerto Rico y otros países.

  • La Puntuación: El sistema acertó el 99.8% de las veces.
  • La Comparación: Funcionó ligeramente mejor que los sistemas antiguos basados en reglas (que son como manuales de instrucciones rígidos) y no necesitó ser "reentrenado" o enseñarle cosas nuevas para funcionar.
  • La Confianza: El sistema también te decía qué tan seguro estaba de su respuesta. Cuando decía que estaba un 90% o más seguro, casi siempre tenía razón.

La Gran Conclusión

El artículo argumenta que no es necesario entrenar modelos de IA costosos y personalizados para arreglar datos desordenados. En su lugar, puedes usar un modelo de IA potente y comercial, pero envolverlo en una red de seguridad estricta basada en reglas.

Piénsalo como contratar a un escritor brillante y creativo (la IA) para completar un formulario de impuestos. Si solo dejas que escriba, podría inventar números. Pero si le das un formulario con casillas estrictas, una lista de verificación de reglas y un supervisor que revisa cada casilla antes de que se envíe, obtendrás un formulario de impuestos perfecto cada vez, sin necesidad de enseñarle al escritor cómo hacer impuestos desde cero.

Este enfoque hace posible convertir texto desordenado del mundo real en datos limpios y confiables de manera rápida y económica, sin necesidad de reentrenar la IA para cada nuevo país o idioma.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →