← 최신 논문
💬 NLP

Information Extraction from Electricity Invoices with General-Purpose Large Language Models

본 연구는 파인튜닝 없이 스페인어 전기 요금표에서 정보를 추출하는 범용 대규모 언어 모델의 경우 성능을 결정하는 핵심 요인이 프롬프트 엔지니어링의 품질이며, 퓨샷 전략이 제로샷 기준을 크게 능가하여 96% 를 초과하는 F1 점수를 달성함을 보여준다.

원저자: Javier Gómez, Javier Sánchez

게시일 2026-04-30
📖 4 분 읽기☕ 가벼운 읽기

원저자: Javier Gómez, Javier Sánchez

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

다양한 회사에서 나온 거대한 전기세 청구서 더미를 상상해 보세요. 어떤 것은 깔끔하고 정돈되어 있고, 다른 것들은 지저분하며, 모두 약간씩 다르게 생겼습니다. 당신의 목표는 각 청구서에서 "총 비용"이나 "고객 이름"과 같은 특정 숫자와 이름을 추출하여 깔끔한 스프레드시트에 넣는 것입니다.

수년 동안 컴퓨터는 이 작업에 어려움을 겪었습니다. 구식 프로그램은 경직된 로봇과 같았습니다. 훈련된 것과 조금이라도 다르게 보이는 청구서가 들어오면 혼란을 겪고 실패했습니다.

이 논문은 모든 새로운 디자인마다 재훈련할 필요 없이 이러한 청구서를 읽을 수 있도록 새로운 종류의 "초지능 로봇"(대규모 언어 모델, 즉 LLM) 을 가르치는 것에 관한 것입니다. 연구자들은 다음과 같이 질문했습니다: 우리가 이 똑똑한 로봇들에게 올바른 지시사항만 주면, 그들이 스스로 해결할 수 있을까요?

다음은 일상적인 비유를 사용하여 그들의 발견 사항을 정리한 것입니다:

1. "요리사 모자"보다 "레시피"가 더 중요하다

연구자들은 두 가지 다른 "요리사"(AI 모델) 를 테스트했습니다: Gemini 1.5 Pro(거대하고 복잡한 요리사) 와 Mistral-small(작고 빠르고 효율적인 요리사) 입니다.

그들은 또한 "요리 설정"(온도와 무작위성 같은 기술적 매개변수) 을 조정해 보기도 했습니다. 아마도 더 큰 요리사나 완벽한 요리 설정이 가장 큰 차이를 만들 것이라고 예상했습니다.

놀라운 사실: 어떤 요리사를 사용했는지나 설정을 어떻게 조정했는지는 크게 중요하지 않았습니다. 결과의 차이는 99% 완벽한 케이크와 99.5% 완벽한 케이크 사이의 차이처럼 미미했습니다.

실제 승자: 프롬프트(AI 에게 주어진 지시사항) 입니다.
프롬프트를 레시피라고 생각하세요.

  • Zero-Shot(레시피 없음): "이 청구서를 읽고 숫자를 알려줘"라고만 말하는 것은 요리사에게 레시피 없이 요리를 하라고 하는 것과 같습니다. 결과는 괜찮았지만 (약 78% 정확도), 훌륭하지는 않았습니다.
  • Few-Shot(예시 포함): "이것이 청구서이고 이것이 내가 원하는 데이터입니다"라는 몇 가지 예시를 AI 에게 주는 것은 요리사에게 복사할 샘플 요리를 제공하는 것과 같습니다. 정확도는 96% 이상으로 급상승했습니다.

교훈: 가장 비싼 요리사나 가장 화려한 오븐을 갖는 것이 아니라, 정말 좋은 레시피를 작성하는 것입니다.

2. "모방자" 전략이 가장 효과적입니다

연구자들은 예시를 제공하는 다양한 방법을 시도했습니다:

  • "One-Shot" 방법: 하나의 예시를 보여주는 것입니다. 좋지만 최선은 아닙니다.
  • "Cross-Validation(교차 검증)" 방법: 이것이 챔피언입니다. 그들은 AI 에게 세 가지 다른 유형의 청구서 (예: 표 형식, 목록 형식, 복잡한 형식) 를 보여준 후, 본 적이 없는 네 번째 유형을 읽도록 요청했습니다.
    • 결과: AI 는 마스터 모방자가 되었습니다. 그것은 특정 청구서의 모양이 아니라 전기세 청구서의 개념을 배웠습니다. Gemini 로는 97.6% 정확도를, Mistral 로는 **96.1%**를 달성했습니다.

3. "번역" 문제

AI 가 청구서를 읽을 수 있도록 하기 전에, 연구자들은 PDF 파일을 텍스트 (Markdown) 로 변환해야 했습니다.

  • 비유: 더러운 창문을 통해 복사된 손글씨 메모를 읽으려 한다고 상상해 보세요. 메모가 깔끔한 표에 있다면 텍스트는 선명하게 나옵니다. 하지만 메모가 지저분하고 다중 열 레이아웃에 빽빽하게 채워져 있다면 텍스트는 뒤죽박죽이 됩니다.
  • 발견: AI 는 받은 텍스트만큼만 좋았습니다. 청구서가 깔끔하고 표와 같은 레이아웃을 가졌을 때 AI 는 거의 완벽했습니다. 하지만 청구서가 지저분하고 빽빽한 디자인이었을 때, PDF 에서 텍스트로의 "번역" 과정에서 중요한 단서들이 손실되었기 때문에 AI 는 어려움을 겪었습니다.

4. "환각" 함정

그들은 두 요리사 사이의 성격 차이를 발견했습니다:

  • Gemini(신중한 요리사): 숫자가 어디 있는지 확신이 없으면 "보이지 않습니다"라고 말했습니다. 매우 정확했지만 때로는 무언가를 놓치기도 했습니다.
  • Mistral(자신감 있는 요리사): 확신이 없어도 어쨌든 숫자를 추측했습니다. 거의 모든 것을 찾았지만 (높은 "재현율"), 실제로 존재하지 않는 숫자도 만들어냈습니다 (낮은 "정밀도").
  • 교훈: 숫자가 진짜인지 100% 확신해야 한다면 신중한 요리사를 원합니다. 모든 것을 찾고 나중에 답변을 확인할 수 있다면 자신감 있는 요리사도 괜찮습니다.

5. 구식 로봇을 이기기

이 논문은 이러한 새로운 AI 요리사들을 구식 "로봇"(전통적인 머신러닝) 과 비교합니다.

  • 구식 로봇: A 형 청구서로 훈련했다면 A 형 청구서를 완벽하게 읽을 수 있었습니다 (91% 정확도). 하지만 B 형 청구서를 건네면 붕괴되었습니다 (67% 정확도로 하락). 그것은 청구서의 의미가 아니라 모양을 외웠습니다.
  • 새로운 AI: B 형 청구서로 훈련할 필요가 없었습니다. 그것은 전기세 청구서의 의미를 이해했기 때문에 새로운 유형을 95% 이상의 정확도로 읽었습니다. 패턴을 외우는 대신 기술을 일반화했습니다.

요약

이 논문은 컴퓨터가 비즈니스 문서를 완벽하게 읽게 하려면 모든 문서 유형마다 맞춤형 두뇌를 만들 필요가 없다고 결론 내립니다. 대신, 더 나은 지시사항을 작성하고 몇 가지 좋은 예시를 보여주면 됩니다.

"비밀 소스"는 AI 모델의 크기나 복잡한 수학 설정이 아니라, 프롬프트 (지시사항) 의 품질과 AI 가 읽을 수 있도록 문서를 텍스트로 변환하는 방법의 질입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →