A Reliability Evaluation of Hybrid Deterministic-LLM Based Approaches for Academic Course Registration PDF Information Extraction
이 논문은 컴퓨팅 자원이 제한된 환경에서 학술 과정 등록 PDF 문서의 정보 추출 신뢰성을 평가한 결과, 결정론적 방법과 LLM 을 결합한 하이브리드 접근법, 특히 Camelot 기반 파이프라인과 LLM 백업 전략이 정확도와 효율성 측면에서 가장 우수한 성능을 보였음을 입증합니다.
원저자:Muhammad Anis Al Hilmi, Neelansh Khare, Noel Framil Iglesias
한국 대학에서도 매 학기 시작할 때 학생들은 '수강신청'을 합니다. 이때 생성되는 파일이 **PDF 형태의 수강 신청서 (KRS)**입니다.
문제: 이 파일은 학생 정보, 수강 과목, 교수님 이름 등이 섞여 있습니다. 학교 시스템이 구식이라서 이 데이터를 자동으로 뽑아내기가 어렵고, 데이터를 외부로 보내면 개인정보 유출 우려가 있습니다.
목표: 그래서 내 컴퓨터 (노트북) 안에서만 이 PDF 를 읽어서 정리해 주는 똑똑한 프로그램을 만들고 싶었습니다.
🤖 세 가지 실험 방법 (비유로 이해하기)
연구팀은 이 작업을 수행할 세 가지 방법을 시험해 보았습니다.
1. 오직 AI 만 믿기 (LLM Only)
비유: "이건 AI 비서에게 맡겨!"라고 말하고, 비서에게 PDF 전체를 보여주고 "이거 정리해 줘"라고 요청하는 방식입니다.
현실: AI 는 문맥을 잘 이해하지만, 매우 느립니다. 마치 아주 똑똑하지만 피곤해서 글을 읽는 속도가 느린 비서처럼, 한 장을 정리하는 데 1 분 30 초~2 분이 걸렸습니다. 또한, AI 모델에 따라 실수가 생기기도 했습니다.
2. 규칙 + AI 의 조합 (Hybrid Deterministic-LLM)
비유: "이름과 학번은 **규칙 (레고 블록)**대로 딱딱 맞춰서 뽑고, 복잡한 과목 목록은 AI 비서에게 맡겨보자!"는 방식입니다.
현실: 간단한 정보 (이름, 학번) 는 규칙으로 빠르게 뽑아내고, 어려운 부분만 AI 에게 맡겼으니 속도가 조금 빨라지고 정확도도 좋아졌습니다. 하지만 여전히 AI 가 처리하는 시간이 길어 전체 속도는 느렸습니다.
3. 자동화 기계 + AI 의 '백업' 시스템 (Camelot + LLM Fallback) ⭐ 최고의 방법
비유: 이 방식은 **자동화 기계 (Camelot)**를 주력으로 사용합니다. 이 기계는 PDF 의 '표 (Table)' 구조를 눈으로 보고 데이터를 뽑는 데 매우 빠릅니다.
작동 원리:
먼저 자동화 기계가 데이터를 뽑습니다. (속도: 1 초 미만!)
만약 기계가 "이건 내가 못 읽겠어"라고 하면, 그때서야 AI 비서가 나서서 도와줍니다.
결과: 이 방식이 가장 훌륭했습니다. 대부분의 파일은 기계가 1 초 만에 처리했고, AI 는 아주 드물게만 사용되었습니다. 정확도는 거의 100% 에 가까웠습니다.
🏆 연구 결과: 누가 가장 잘했을까?
가장 똑똑한 AI: 여러 AI 모델 (Gemma, Phi, Qwen) 을 테스트한 결과, **'Qwen 2.5'**라는 모델이 가장 안정적으로 잘했습니다. 다른 모델들은 실수를 하거나 느렸지만, Qwen 은 거의 실수 없이 잘해냈습니다.
가장 빠른 방법: 위에서 설명한 '자동화 기계 + AI 백업' 방식이 압도적으로 빨랐습니다. 860 개의 파일을 처리하는 데 걸린 시간이, AI 만 사용하는 방식보다 훨씬 짧았습니다.
컴퓨터 사양: 이 모든 실험은 고성능 그래픽 카드 (GPU) 가 없는 일반적인 노트북에서 이루어졌습니다. 즉, 비싼 장비 없이도 가능하다는 뜻입니다.
💡 핵심 교훈 (한 줄 요약)
"모든 일을 AI 에게 맡기면 느리고 비싸지만, **단순한 일은 규칙이나 기계로 빠르게 처리하고, 어려운 부분만 AI 에게 맡기는 '혼합 전략'**이 가장 빠르고 똑똑하며 안전합니다."
🔮 앞으로의 전망
이 연구는 대학이나 기관에서 개인정보가 포함된 문서를 처리할 때, 비싼 서버 없이도 내 노트북으로 빠르고 안전하게 데이터를 뽑아낼 수 있는 방법을 제시했습니다. 앞으로는 더 많은 종류의 문서 (스캔된 이미지 등) 나 더 빠른 처리를 위해 그래픽 카드를 사용하는 실험도 계획하고 있습니다.
1. 연구 배경 및 문제 정의 (Problem)
배경: 인도네시아의 대학에서는 학기 시작 시 학생들이 'KRS(학습 계획서)'를 작성하여 수강 과목을 등록합니다. 이 KRS 데이터는 PDF 형태로 생성되며, 학사 관리뿐만 아니라 출석 기록, 성적 관리, 강의 평가 등 다양한 목적으로 활용되어야 합니다.
문제점:
기존 캠퍼스 정보 시스템은 API 접근이 제한적이거나 레거시 코드 수정이 어려워 데이터 추출이 어렵습니다.
직접 데이터베이스 접근은 권한 문제와 관리자의 우려로 인해 불가능한 경우가 많습니다.
따라서 학생의 KRS PDF 에서 직접 데이터를 추출해야 하지만, 개인정보 보호를 위해 외부 클라우드 서비스 없이 **로컬 환경 (Local Execution)**에서 처리해야 합니다.
KRS PDF 는 텍스트 기반이지만, 전공별 과목 수, 강사 정보, 유니코드 리거처 (ligature, 예: 'fi'가 하나로 합쳐진 글자) 등 데이터 구조와 인코딩의 변이가 심하여 기존 규칙 기반 (Regex) 추출만으로는 한계가 있습니다.
2. 연구 방법론 (Methodology)
이 연구는 세 가지 다른 추출 전략을 비교 평가했습니다. 모든 실험은 GPU 가 없는 소비자용 CPU 노트북 (Advan Workplus, Ryzen 5, 16GB RAM) 에서 수행되었습니다.
사용된 모델: Ollama 를 통해 로컬에서 실행된 12~14B 파라미터 규모의 3 가지 LLM:
Gemma 3:12b
Phi 4:14b
Qwen 2.5:14b
평가 데이터셋:
4 개 전공 (전기공학, 토목공학, 도시지역공학, 정보공학) 의 KRS PDF 총 140 개 (LLM 및 하이브리드 테스트용).
Camelot 파이프라인 평가를 위해 860 개의 추가 PDF 사용.
Ground Truth (GT) 는 클라우드 기반 엔터프라이즈 모델과 수동 검증을 통해 생성된 JSON 파일.
세 가지 접근 방식:
LLM Only: 전체 텍스트를 LLM 에 직접 입력하여 JSON 으로 추출.
Hybrid Deterministic–LLM:
Regex: 학생 신상 정보 (Metadata) 등 고정된 패턴의 데이터 추출.
LLM: 과목 목록 및 강사 목록 등 복잡한 테이블 데이터 추출.
유니코드/리거처 정규화 및 JSON 유효성 검사를 수행.
Camelot 기반 파이프라인 (LLM Fallback):
텍스트 기반 PDF 의 테이블 구조를 인식하는 Camelot 라이브러리 사용 (Lattice 및 Stream 모드).
Camelot 이 실패할 경우 LLM 을 백업 (Fallback) 으로 활용.
Regex 는 여전히 메타데이터 추출에 사용.
평가 지표:
Exact Match (EM): Ground Truth 와의 완전 일치 여부.
Levenshtein Similarity (LS): 오타나 공백 등 미세한 차이를 허용하는 유사도 (임계값 0.7 적용).
3. 주요 결과 (Key Results)
A. 모델 및 모드별 성능 비교 (140 개 샘플 기준)
Qwen 2.5:14b: 모든 전공과 모드에서 가장 일관된 높은 성능을 보였습니다. 특히 LLM Only 모드에서도 0.99~1.00 의 높은 정확도를 기록했습니다.
Gemma 3:12b: LLM Only 모드에서는 성능이 저하되었으나, 하이브리드 (Regex+LLM) 모드에서는 모든 전공에서 완벽한 점수 (1.00) 를 기록했습니다. 이는 결정론적 방법이 LLM 의 부하를 줄이고 안정성을 높였음을 시사합니다.
Phi 4:14b: 메타데이터와 과목 목록에서는 양호했으나, 강사 목록 추출 시 오류가 빈번했습니다. 특히 강사 이름이 중복될 때 이를 제거하거나 순서를 혼동하는 경향이 있어 점수가 낮아졌습니다.
처리 속도 (Throughput):
하이브리드 및 LLM Only 모드는 PDF 당 약 **1.51.8 분 (95112 초)**이 소요되어 대량 처리에는 비효율적이었습니다.
Phi 4 하이브리드 모드가 가장 빨랐으나 (0.69 PDF/분), 여전히 실시간 처리에는 한계가 있었습니다.
B. Camelot 기반 파이프라인 성능 (860 개 샘플 기준)
효율성: Camelot (Lattice/Stream) 을 주력으로 사용할 경우, **PDF 당 1 초 미만 (약 0.6~0.76 초)**의 처리 속도를 달성하여 기존 방식 대비 압도적인 효율성을 보였습니다.
정확도: 전체 860 개 중 799 개 (Lattice) 와 52 개 (Stream) 가 Camelot 으로 성공적으로 처리되었으며, 정확도 (EM/LS) 가 0.99~1.00에 달했습니다.
Fallback 역할: 약 9 개의 파일 (복잡한 레이아웃 또는 짧은 행 등) 에서 Camelot 이 실패하자 LLM 이 백업으로 작동하여 전체 파이프라인의 신뢰성을 확보했습니다.
결론: Camelot + LLM Fallback 방식이 정확성과 계산 효율성의 최적 균형을 이룬 것으로 확인되었습니다.
4. 주요 기여 (Key Contributions)
인도네시아 학술 문서 (KRS) 추출에 대한 최초의 체계적 평가: 특정 지역 및 문서 유형에 대한 신뢰성 평가와 데이터 프라이버시 (로컬 실행) 를 고려한 연구가 부족했던 점을 해소했습니다.
하이브리드 접근법의 유효성 입증: 순수 LLM 방식보다 결정론적 방법 (Regex) 과 LLM 을 결합한 하이브리드 방식이 메타데이터 추출의 안정성을 크게 향상시키고 LLM 의 부하를 줄인다는 것을 실증했습니다.
제한된 하드웨어 환경 (CPU Only) 에서의 최적화 전략: 고사양 GPU 없이도 소비자용 노트북에서 고품질 정보 추출이 가능한 파이프라인 (Camelot + LLM Fallback) 을 제안했습니다.
모델별 특성 분석: Qwen 2.5 가 가장 안정적이며, Phi 4 는 중복 데이터 처리에 취약하고, Gemma 는 하이브리드 환경에서 가장 잘 작동한다는 구체적인 인사이트를 제공했습니다.
5. 의의 및 결론 (Significance & Conclusion)
기술적 의의: 텍스트 기반 학술 문서 추출에 있어 단일 LLM 의존에서 벗어나, **결정론적 방법 (Regex) + 레이아웃 인식 라이브러리 (Camelot) + 신경망 백업 (LLM)**의 계층적 (Progressive Fallback) 접근법이 정확성, 안정성, 효율성 측면에서 가장 우월함을 증명했습니다.
실용적 의의: 개인정보 보호가 필수적인 교육 환경에서, 외부 API 없이 로컬 CPU 만으로도 빠르고 정확한 데이터 추출 시스템 구축이 가능함을 보여주었습니다. 이는 레거시 시스템이 있는 대학이나 IT 자원이 부족한 기관에 매우 실용적인 솔루션입니다.
향후 과제: GPU 가속 환경으로의 확장, 모델 양자화 (Quantization) 및 파인튜닝을 통한 성능 개선, 그리고 스캔된 이미지 기반 PDF (OCR 필요) 로의 적용 범위 확대가 필요하다고 제언했습니다.
요약하자면, 이 연구는 Qwen 2.5 모델을 기반으로 Camelot 라이브러리를 주력으로 하고 LLM 을 백업으로 활용하는 하이브리드 파이프라인이 제한된 컴퓨팅 자원 환경에서도 학술 문서 정보 추출의 신뢰성과 효율성을 동시에 달성할 수 있는 최적의 전략임을 입증했습니다.