← 최신 논문
🤖 AI

A Reliability Evaluation of Hybrid Deterministic-LLM Based Approaches for Academic Course Registration PDF Information Extraction

이 논문은 컴퓨팅 자원이 제한된 환경에서 학술 과정 등록 PDF 문서의 정보 추출 신뢰성을 평가한 결과, 결정론적 방법과 LLM 을 결합한 하이브리드 접근법, 특히 Camelot 기반 파이프라인과 LLM 백업 전략이 정확도와 효율성 측면에서 가장 우수한 성능을 보였음을 입증합니다.

원저자: Muhammad Anis Al Hilmi, Neelansh Khare, Noel Framil Iglesias

게시일 2026-04-02
📖 3 분 읽기☕ 가벼운 읽기

원저자: Muhammad Anis Al Hilmi, Neelansh Khare, Noel Framil Iglesias

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

📚 배경: 왜 이 연구가 필요할까요?

한국 대학에서도 매 학기 시작할 때 학생들은 '수강신청'을 합니다. 이때 생성되는 파일이 **PDF 형태의 수강 신청서 (KRS)**입니다.

  • 문제: 이 파일은 학생 정보, 수강 과목, 교수님 이름 등이 섞여 있습니다. 학교 시스템이 구식이라서 이 데이터를 자동으로 뽑아내기가 어렵고, 데이터를 외부로 보내면 개인정보 유출 우려가 있습니다.
  • 목표: 그래서 내 컴퓨터 (노트북) 안에서만 이 PDF 를 읽어서 정리해 주는 똑똑한 프로그램을 만들고 싶었습니다.

🤖 세 가지 실험 방법 (비유로 이해하기)

연구팀은 이 작업을 수행할 세 가지 방법을 시험해 보았습니다.

1. 오직 AI 만 믿기 (LLM Only)

  • 비유: "이건 AI 비서에게 맡겨!"라고 말하고, 비서에게 PDF 전체를 보여주고 "이거 정리해 줘"라고 요청하는 방식입니다.
  • 현실: AI 는 문맥을 잘 이해하지만, 매우 느립니다. 마치 아주 똑똑하지만 피곤해서 글을 읽는 속도가 느린 비서처럼, 한 장을 정리하는 데 1 분 30 초~2 분이 걸렸습니다. 또한, AI 모델에 따라 실수가 생기기도 했습니다.

2. 규칙 + AI 의 조합 (Hybrid Deterministic-LLM)

  • 비유: "이름과 학번은 **규칙 (레고 블록)**대로 딱딱 맞춰서 뽑고, 복잡한 과목 목록은 AI 비서에게 맡겨보자!"는 방식입니다.
  • 현실: 간단한 정보 (이름, 학번) 는 규칙으로 빠르게 뽑아내고, 어려운 부분만 AI 에게 맡겼으니 속도가 조금 빨라지고 정확도도 좋아졌습니다. 하지만 여전히 AI 가 처리하는 시간이 길어 전체 속도는 느렸습니다.

3. 자동화 기계 + AI 의 '백업' 시스템 (Camelot + LLM Fallback) ⭐ 최고의 방법

  • 비유: 이 방식은 **자동화 기계 (Camelot)**를 주력으로 사용합니다. 이 기계는 PDF 의 '표 (Table)' 구조를 눈으로 보고 데이터를 뽑는 데 매우 빠릅니다.
    • 작동 원리:
      1. 먼저 자동화 기계가 데이터를 뽑습니다. (속도: 1 초 미만!)
      2. 만약 기계가 "이건 내가 못 읽겠어"라고 하면, 그때서야 AI 비서가 나서서 도와줍니다.
  • 결과: 이 방식이 가장 훌륭했습니다. 대부분의 파일은 기계가 1 초 만에 처리했고, AI 는 아주 드물게만 사용되었습니다. 정확도는 거의 100% 에 가까웠습니다.

🏆 연구 결과: 누가 가장 잘했을까?

  1. 가장 똑똑한 AI: 여러 AI 모델 (Gemma, Phi, Qwen) 을 테스트한 결과, **'Qwen 2.5'**라는 모델이 가장 안정적으로 잘했습니다. 다른 모델들은 실수를 하거나 느렸지만, Qwen 은 거의 실수 없이 잘해냈습니다.
  2. 가장 빠른 방법: 위에서 설명한 '자동화 기계 + AI 백업' 방식이 압도적으로 빨랐습니다. 860 개의 파일을 처리하는 데 걸린 시간이, AI 만 사용하는 방식보다 훨씬 짧았습니다.
  3. 컴퓨터 사양: 이 모든 실험은 고성능 그래픽 카드 (GPU) 가 없는 일반적인 노트북에서 이루어졌습니다. 즉, 비싼 장비 없이도 가능하다는 뜻입니다.

💡 핵심 교훈 (한 줄 요약)

"모든 일을 AI 에게 맡기면 느리고 비싸지만, **단순한 일은 규칙이나 기계로 빠르게 처리하고, 어려운 부분만 AI 에게 맡기는 '혼합 전략'**이 가장 빠르고 똑똑하며 안전합니다."

🔮 앞으로의 전망

이 연구는 대학이나 기관에서 개인정보가 포함된 문서를 처리할 때, 비싼 서버 없이도 내 노트북으로 빠르고 안전하게 데이터를 뽑아낼 수 있는 방법을 제시했습니다. 앞으로는 더 많은 종류의 문서 (스캔된 이미지 등) 나 더 빠른 처리를 위해 그래픽 카드를 사용하는 실험도 계획하고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →