HistoRAG: Embedding Historical Methodology in Retrieval-Augmented Generation Through Critical Technical Practice
이 논문은 표준적인 RAG의 사실적 편향을 해결하고 해석적 학술 관행을 더 잘 지원하기 위해 시간적 윈도잉(temporal windowing), 검색과 생성의 분리, 투명한 LLM-as-judge 평가와 같은 사학적 원칙을 통합함으로써 역사 연구에 맞게 검색 증강 생성(Retrieval-Augmented Generation)을 적응시킨 프레임워크인 HistoRAG를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 1950년부터 1979년 사이 독일에서 사람들이 컴퓨터에 대해 어떻게 느꼈는지 이해하려는 역사학자라고 상상해 보십시오. 당신에게는 10만 개 이상의 신문 기사가 담긴 방대한 도서관이 있습니다.
만약 당신이 표준 AI 도구(이를 "RAG"라고 부릅니다)를 사용하여 도움을 받는다면, 그것은 매우 빠르지만 약간 서투른 사서처럼 행동할 것입니다. 당신이 "사람들은 컴퓨터에 대해 어떻게 생각했나요?"라고 물으면, 사서는 서가로 달려가서 "컴퓨터"라는 단어가 포함된 책들을 집어 들어 당신에게 건네줄 것입니다.
문제는 이 사서가 가진 몇 가지 나쁜 습관이 역사 연구를 망친다는 점입니다:
- 그들은 현대의 속어만 사용합니다. 만약 당신이 1970년대의 단어를 사용하여 "컴퓨터"에 대해 묻는다면, 그들은 1950년대의 책들을 무시할 것입니다. 왜냐하면 그 당시에는 사람들이 그것을 "전자 두뇌(electronic brains)"라고 불렀기 때문입니다. 사서는 가장 중요한 초기 역사를 놓치게 됩니다.
- 그들은 목소리가 큰 책들을 집어 옵니다. 만약 어떤 주제가 1970년에 아주 많이 논의되었다면, 사서는 1970년대의 책을 거대한 더미로 가져오고, 똑같이 중요하지만 더 조용했던 1950년대의 논의들은 무시할 것입니다.
- 그들은 당신이 '왜' 묻는지 이해하지 못합니다. 그들은 단지 당신의 질문과 비슷해 보이는 책들을 집어 올 뿐이며, 그 책들이 인간의 공포나 희망에 관한 당신의 구체적인 연구 질문에 실제로 답하는지는 고려하지 않습니다.
이 논문은 HistoRAG(Historical RAG)를 소개합니다. 이것을 더 빠른 사서가 아니라, 역사의 규칙을 존중하는 새로운 방식의 연구 조수와 일하는 방법이라고 생각하십시오.
HistoRAG이 세 가지 간단한 기술을 사용하여 어떻게 작동하는지 설명하겠습니다.
1. "두 단계의 춤" (검색과 생성의 분리)
일반적인 AI 시스템에서는 질문을 하면 즉시 답변을 줍니다. 그것은 마치 마법의 8번 구슬(Magic 8-ball) 같습니다.
HistoRAG에서 과정은 두 개의 뚜렷한 단계로 나뉩니다:
- 1단계: 사냥 (Heuristik). AI는 나가서 많은 잠재적 출처를 수집합니다. 하지만 거기서 멈춥니다. 그것들을 테이블 위에 올려놓고 이렇게 말합니다. "여기 후보들이 있습니다. 당신, 즉 역사학자가 이것들 중 무엇을 읽을 가치가 있는지 결정해야 합니다."
- 2단계: 분석 (Interpretation). 당신이 최고의 출처를 고른 후에야 AI는 요약문을 작성하거나 패턴을 찾는 것을 도와줍니다.
비유: 당신이 탐정이라고 상상해 보십시오. 일반적인 AI는 용의자를 찾아내자마자 바로 최종 변론을 쓰는 탐정과 같습니다. HistoRAG은 용의자 목록을 찾아 당신에게 건네며 "당신이 누구를 인터뷰할지 결정하십시오. 일단 적절한 사람들을 뽑고 나면, 그때 제가 보고서 작성을 돕겠습니다"라고 말하는 탐정과 같습니다. 이는 인간 역사가가 이야기의 주도권을 유지하도록 보장합니다.
2. "시간 여행자의 격자" (Temporal Windowing)
표준 AI 도구들은 현재에 편향되어 있습니다. 만약 당신이 "컴퓨터"에 대해 묻는다면, AI는 언어가 더 잘 일치하는 최근 기사들을 주로 가져올 것입니다. 그것은 마치 현대의 요리 용어로만 검색하여 옛날 레시피를 찾는 것과 같습니다. 당신은 오래된 레시피들을 놓치게 될 것입니다.
HistoRAG은 AI가 공정하도록 강제합니다. 이 30년의 기간을 작은 시간 블록(예: 5년 단위)으로 나눕니다. 그런 다음 다음과 같이 말합니다. "1970년에 '컴퓨터' 관련 기사가 아무리 많더라도, 당신은 1950년, 1955년, 1960년 등에서 반드시 동일한 수의 기사를 가져와야 합니다."
비유: 당신이 과일 샐러드를 만들고 있다고 상상해 보십시오. 일반적인 AI는 (지금 어디에나 있기 때문에) 딸기가 가득 담긴 양동이를 가져오고 지난 시즌의 블루베리는 무시합니다. HistoRRAG은 엄격한 요리사로서 "우리는 모든 계절로부터 정확히 한 컵의 과일이 필요합니다. 설령 딸기가 더 인기 있더라도 말입니다"라고 말하는 것과 같습니다. 이는 당신이 가장 인기 있는 시대가 아니라, 전체 역사를 맛볼 수 있도록 보장합니다.
3. "인간 같은 심판" (LLM-as-Judge)
AI가 올바른 시기를 가져왔다 하더라도, 여전히 잘못된 종류의 기사를 가져올 수 있습니다. AI는 당신이 원했던 시민의 편지 대신 딱딱한 기술 매뉴얼을 가져올 수도 있습니다.
HistoRAG은 확인을 위한 두 번째 층을 추가합니다. AI가 기사를 가져온 후, 그것은 인간 역사가처럼 행동하는 "심판(Judge, 또 다른 AI)"을 통과합니다. 이 심판은 기사를 읽고 다음과 같이 묻습니다. "이것이 실제로 공포나 희망에 대해 이야기하고 있는가?" 심판은 기사에 점수를 매기고 그 이유를 작성합니다.
비유: 당신이 오디션 프로그램을 보고 있다고 상상해 보십시오. 첫 번째 AI는 노래할 수 있는 사람을 찾는 "캐스팅 디렉터"입니다. "심판"은 그들의 노래를 듣고 다음과 같이 결정하는 "음악 평론가"입니다. "좋아요, 노래는 할 줄 알지만, 우리가 찾고 있는 감성적인 발라드를 부르는 것은 아니군요." 심판은 단순히 음표를 세는 것이 아니라, 노래의 감정을 이해합니다.
결과: "Zwischentexte" (중간 텍스트)
마지막으로, 이 논문은 AI가 실제로 무엇을 쓰는지에 대해 이야기합니다. 일반적인 시스템에서 AI는 당신에게 최종 답변을 주려고 노력합니다. HistoRAG에서 AI는 저자들이 Zwischentexte(중간 텍스트)라고 부르는 것을 생성합니다.
비유: 이것들을 완성된 소설이 아니라 초안이나 스케치라고 생각하십시오. AI는 다음과 같이 말합니다. "여기에 1964년에 사람들이 어떻게 느꼈는지에 대한 가능한 해석이 있습니다. 제가 발견한 패턴은 이것입니다. 하지만 저는 도구일 뿐입니다. 당신, 즉 역사학자가 제 작업을 확인하고, 출처를 검증하며, 제 스케치가 정확한지 결정해야 합니다."
이것이 왜 중요한가
이 논문은 역사 및 기타 해석적 분야를 위해서, 우리가 단지 "가장 빠른" 답변을 원하는 것이 아니라고 주장합니다. 우리는 다음과 같은 시스템을 원합니다:
- 언어가 변했다고 해서 과거를 잊지 않는 시스템.
- 가장 인기 있는 시대가 조용한 시대를 덮어버리지 않도록 하는 시스템.
- 인간이 "나는 그 결론에 동의하지 않는다"라고 말할 수 있도록 그 추론 과정을 가시화하는 시스템.
HistoRAG은 AI가 전지전능한 신탁이 아니라 겸손한 연구 조수로서 기능하도록 만드는 청사진이며, 이를 통해 인간 역사가가 과거의 의미를 결정하는 주체가 되도록 보장합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.