← 최신 논문
💬 NLP

A System for Name and Address Parsing with Large Language Models

본 논문은 입력 정규화, 제약 기반 디코딩, 그리고 엄격한 규칙 기반 검증을 통합함으로써, 미세 조정 없이 대규모 언어 모델을 활용하여 비정형 이름 및 주소 텍스트를 일관된 17개 필드 스키마로 신뢰성 있게 변환하는 프롬프트 주도형, 검증 중심형 프레임워크를 제시한다.

원저자: Adeeba Tarannum, Muzakkiruddin Ahmed Mohammed, Mert Can Cakmak, Shames Al Mandalawi, John Talburt

게시일 2026-01-27
📖 3 분 읽기☕ 가벼운 읽기

원저자: Adeeba Tarannum, Muzakkiruddin Ahmed Mohammed, Mert Can Cakmak, Shames Al Mandalawi, John Talburt

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 거대하고 엉망진창인 손편지 더미가 있다고 상상해 보세요. 어떤 것은 영어로 쓰여 있고, 어떤 것은 스페인어로 되어 있으며, 어떤 것은 잉크가 번져 있고, 또 어떤 것은 쉼표가 빠져 있거나 "123 Main St Apt 4B"가 "123MainStApt4B"처럼 적혀 있는 식입니다. 당신의 목표는 이 혼란스러운 더미를 가져와서 모든 정보(이름, 거리, 도시, 우편번호)가 각각의 특정 열에 들어 있는 깔끔하고 정리된 스프레드시트로 만드는 것입니다.

이 논문은 이 작업을 수행하는 새로운 방법을 설명합니다. 바로 매우 똑똑한 컴퓨터 두뇌(거대 언어 모델, 즉 LLM)를 사용하는 것인데, 여기에 한 가지 반전이 있습니다. 단순히 컴퓨터 두에게 새로운 언어를 처음부터 가르치는 것이 아니라(이는 마치 새 직원을 채용하여 몇 달 동안 교육하는 것과 같습니다), 그 주변에 엄격한 "체크리스트와 감독관" 시스템을 구축했다는 점입니다.

이 시스템이 어떻게 작동하는지 간단한 단계별로 설명하면 다음과 같습니다.

1. "재료 준비 셰프" (입력 정규화)

스마트한 컴퓨터가 데이터를 보기 전에, "재료 준비 셰프"가 먼저 데이터를 깨끗하게 정리합니다.

  • 문제점: 원본 데이터는 엉망입니다. 어떤 사람은 "Ave."라고 쓰고, 다른 사람은 "Avenue"라고 씁니다. 어떤 사람은 "N.E."라고 쓰고, 다른 사람은 "NE"라고 씁니다.
  • 해결책: 시스템은 자동으로 모든 것을 표준화합니다. 모든 약어를 전체 단어로 바꾸고, 대소문자를 교정하며, 이상한 기호들을 제거합니다. 이는 요리사가 레시피가 매번 완벽하게 작동하도록 요리하기 전에 모든 채소를 정확히 같은 크기로 다지는 것과 같습니다.

2. "엄격한 레시피" (프롬프트 조립)

컴퓨터 두뇌가 무엇을 할지 스스로 추측하게 두는 대신, 저자들은 매우 구체적이고 변경 불가능한 레시피 카드를 제공합니다.

  • 문제점: 만약 당신이 똑똑한 컴퓨터에게 "여기 주소가 있으니 각 부분을 알려줘"라고 요청한다면, 컴퓨터는 사실을 지어내거나 매번 다른 형식으로 답할 수 있습니다.
  • 해결로: 레시피 카드는 다음과 같이 말합니다: "당신은 전문 파서(parser)입니다. 반드시 정확히 17개의 필드를 지정된 순서대로 출력해야 합니다. 모르는 내용이 있다면 빈칸으로 남겨두십시오. 데이터를 임의로 만들어내지 마십시오." 이는 로봇에게 "여기에 나사를 끼우고, 저기에 볼트를 끼우세요. 즉흥적으로 행동하지 마세요"라고 엄격한 조립 설명서를 주는 것과 같습니다.

3. "조립 라인" (제약된 추론)

컴퓨터는 마치 한 번에 16대의 자동차를 처리하는 조립 라인처럼, 데이터를 작은 고정 그룹(16개 단위 배치)으로 처리합니다.

  • 목표: 이는 컴퓨터가 "창의적"이 되거나 지치지 않도록 보장합니다. 설정을 고정해 두어 동일한 작업을 두 번 실행하더라도 항상 정확히 같은 결과를 얻게 합니다. 이는 속도나 설정이 절대 변하지 않는 공장 기계와 같습니다.

4. "품질 관리 검사관" (검증)

컴퓨터가 작업을 마친 후, 엄격한 "품질 관리 검사관"이 모든 줄을 하나하나 확인합니다.

  • 규칙:
    • 우편번호가 주(State)와 일치하는가? (예: 캘리포니아를 위한 우편번호가 뉴욕에 있을 수는 없습니다.)
    • 컴퓨터가 존재하지 않는 거리 이름을 지어냈는가?
    • 정확히 17개의 필드가 있는가?
  • 결과: 만약 컴퓨터가 실수를 하면, 검사관이 즉시 잡아냅니다. 만약 컴퓨터가 확신하지 못한다면, 시스템은 나중에 사람이 확인할 수 있도록 표시를 남깁니다. 이를 통해 최종 스프레드시트가 거의 완벽하도록 보장합니다.

무엇을 발견했는가?

저자들은 미국, 푸에르토리코 및 기타 국가의 지저로 된 주소 기록을 포함하여 1,500개의 서로 다른 주소 레코드를 대상으로 이 시스템을 테스트했습니다.

  • 점수: 시스템은 **99.8%**의 확률로 정확했습니다.
  • 비교: 이 시스템은 기존의 규칙 기반 시스템(엄격한 지침서와 같은 방식)보다 약간 더 뛰어난 성능을 보였으며, 작동을 위해 새로운 것을 "재학습"시키거나 가르칠 필요가 없었습니다.
  • 신뢰도: 시스템은 또한 자신의 답변에 대해 얼마나 확신하는지도 알려주었습니다. 시스템이 90% 이상의 확신을 가졌을 때, 그 답변은 거의 항상 옳았습니다.

핵심 요약

이 논문은 엉망인 데이터를 수정하기 위해 값비싼 맞춤형 AI 모델을 훈련할 필요가 없다고 주장합니다. 대신, 강력한 기성 AI 모델을 사용하되 그 주변을 엄격한 규칙 기반의 안전망으로 감싸면 됩니다.

이는 마치 창의적이고 똑똑한 작가(AI)를 고용하여 세금 양식을 작성하게 하는 것과 같습니다. 만약 그냥 글을 쓰게 내버려 둔다면, 숫자를 지어낼 수도 있습니다. 하지만 엄격한 칸이 있고, 체크리스트 형태의 규칙이 있으며, 제출하기 전에 모든 칸을 확인하는 감독관이 있는 양식을 준다면, 당신은 작가에게 세금 계산법을 처음부터 가르칠 필요 없이 매번 완벽한 세금 양식을 얻을 수 있습니다.

이러한 접근 방식은 새로운 국가나 언어에 맞춰 AI를 다시 훈련시키지 않고도, 지저분한 실제 텍스트를 깨끗하고 신뢰할 수 있는 데이터로 빠르고 저렴하게 바꿀 수 있게 해줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →