← 최신 논문
🤖 AI

Comparing RAG and GraphRAG for Page-Level Retrieval Question Answering on a Math Textbook

이 논문은 477개 항목의 데이터셋을 사용하여 수학 교과서에 대한 페이지 단위 질의응답을 대상으로 RAG와 GraphRAG를 평가하며, 임베딩 기반 RAG(특히 voyage-3-large를 사용한 경우)가 검색 정확도와 답변 품질 측면에서 GraphRAG를 유의미하게 능가하는 동시에 더 효율적이며, BM25가 강력한 베이스라인 역할을 수행하고 RAG가 비용 효율적인 저사양 로컬 LLM에 비례적으로 더 큰 이점을 제공한다는 것을 밝혀냈다.

원저자: Eason Chen, Chuangji Li, Eric Li, Zimo Xiao, Jionghao Lin, Kenneth R. Koedinger

게시일 2026-07-29
📖 4 분 읽기☕ 가벼운 읽기

원저자: Eason Chen, Chuangji Li, Eric Li, Zimo Xiao, Jionghao Lin, Kenneth R. Koedinger

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 아주 까다로운 수학 문제를 풀려고 노력 중이라고 상상해 보세요. 하지만 당신의 뇌는 인터넷 전체를 읽은 초지능 로봇과 같습니다. 그 로봇은 아는 것은 매우 많지만, 가끔은 내용을 지어내거나 당신의 특정 교과서 어느 페이지에 정답이 있는지 정확히 기억하지 못하기도 합니다. 이것이 바로 '거대 언어 모델(LLM)'의 세계입니다. LLM은 대화를 나누고 문제를 해결할 수 있지만, 때로는 자신의 방대한 지식 속에서 길을 잃기도 합니다. 이를 해결하기 위해 과학자들은 '검색 증강 생성(RAG)'이라는 기술을 발명했습니다. RAG를 로봇에게 도서관 카드와 사서 한 명을 주는 것이라고 생각해 보세요. 기억에 의존해 추측하는 대신, 로봇은 사서에게 "이봐요, 이 책의 어느 페이지가 이 내용에 대해 말하고 있죠?"라고 묻습니다. 그러면 사서는 올바른 페이지를 찾아 로봇에게 건네주고, 로봇은 그 신선한 정보를 사용하여 정확한 답변을 내놓습니다. 그런데 만약 사서가 너무 의욕이 넘친다면 어떻게 될까요? 만약 그들이 단 한 문장을 찾기 위해 책 한 권 전체, 혹은 도서관 전체를 통째로 가져온다면 어떨까요? 바로 거기에서 'GraphRAG'라는 더 새롭고 화려한 아이디어가 등장합니다. GraphRAG는 모든 아이디어가 다른 모든 아이디어와 어떻게 연결되는지를 지도처럼 그려내어, 마치 거대한 지식의 거미줄을 따라 실을 추적하듯 답을 찾으려 노력합니다. 학생과 교사들에게 던지는 큰 질문은 이것입니다. 수학 시험 공부를 위해 수학책의 특정 페이지를 찾아야 할 때, 어떤 사서가 더 나을까요? 정확한 페이지를 빠르게 잡아내는 사서일까요, 아니면 거대한 연결의 웹을 구축하는 사서일까요?

카네기 멜론 대학교와 홍콩 대학교의 연구진은 실제 학부 수학 교과서를 사용하여 이 두 사서를 테스트해 보기로 했습니다. 그들은 477개의 질문으로 구성된 데이터셋을 만들었는데, 각 질문은 책의 특정 페이지와 연결되어 있었습니다. 그리고 다양한 AI 시스템에 적절한 페이지를 찾은 뒤 질문에 답하도록 요청했습니다. 그들은 다섯 가지 서로 다른 '임베딩(embedding)' 모델(단어의 '의미'를 이해하는 스마트한 검색 엔진과 같은 것)과, 단순히 일치하는 단어를 찾는 고전적인 검색 방식인 BM25(매우 구식인 색인과 같은 방식), 그리고 화려한 GraphRAG 시스템을 비교했습니다.

결과는 복잡한 웹을 사랑하는 기술 애호가들에게는 다소 놀라웠습니다. 연구진은 임베딩 기반 RAG의 단순하고 직접적인 접근 방식이 특정 페이지를 찾는 데 있어 명확한 승자라는 것을 발견했습니다. 가장 뛰어난 모델인 'voyage-3-large'는 상위 10개의 결과만 볼 수 있도록 허용했을 때, 정답 페이지를 99.4%의 확률로 찾아냈습니다. 심지어 고전적인 단어 매칭 방식인 BM25조차도 몇몇 더 복잡한 신경망 모델들을 제치고 훌륭한 성적을 거두었습니다. 반면, GraphRAG는 정밀함에서 어려움을 겪었습니다. 관련 있는 정보를 일부 찾아내기는 했지만, 종종 너무 많은 맥락을 가져왔습니다. 다른 방식들이 3,700단어를 사용한 것에 비해 약 47,000단어의 텍스트를 가져온 것입니다. 이러한 '정보 과부하'는 AI를 혼란스럽게 만들었고, 최종 답변의 질을 약간 떨어뜨렸습니다. 이 연구는 수학 시험 공부처럼 특정 페이지 참조가 필요한 작업에서는, 우주의 모든 연결을 지도화하려는 사서보다 단순하고 집중력 있는 사서가 훨씬 더 낫다는 점을 시사합니다.

연구팀은 또한 실수 유형에 대해서도 조사했습니다. 가장 뛰어난 AI 모델이 잘못된 페이지를 가져왔을 때, 그것은 주로 '아까운 실수(near miss)'였습니다. 약 63%의 경우, 모델은 같은 장(chapter) 내에서 불과 몇 페이지 차이 나는 페이지를 가져왔습니다. 이는 사실 도움이 되는 결과입니다! 만약 학생이 증명을 찾고 있는데 정리(theorem)가 적힌 페이지를 받게 된다면, 학생은 여전히 올바른 내용을 학습하고 있는 것이며, 단지 순서가 약간 다를 뿐입니다. 이는 마치 튜터가 "너는 지금 해답을 찾고 있지만, 먼저 이 페이지를 확인해 보렴. 여기에서 규칙을 설명하고 있단다"라고 말해주는 것과 같습니다.

마지막으로, 연구진은 이러한 결과가 비싼 클라우드 서버를 요구하지 않는 저렴한 오픈 소스 AI 모델에서도 유효한지 테스트했습니다. 그들은 작은 모델들이 스스로 질문에 답하는 능력은 떨어졌지만, 읽어야 할 교과서 페이지를 제공받았을 때 품질이 극적으로 향상된다는 것을 발견했습니다. 오픈 소스 모델은 검색의 도움을 받아 품질이 39% 상승한 반면, 강력한 상용 모델은 16% 상승에 그쳤습니다. 이는 학교나 학생들이 비싼 AI 서비스를 이용할 여유가 없을 때, 책의 올바른 페이지를 짚어주는 단순한 시스템만으로도 로컬에서 실행되는 무료 AI 튜터를 놀라울 정도로 효과적으로 만들 수 있음을 시사합니다.

결론적으로, 이 논문은 교육 분야의 페이지 단위 검색에 있어서는 '적은 것이 더 많은 것(less is more)'이라고 결론짓습니다. 화려하고 복잡한 GraphRAG 시스템은 이 특정 작업에 적합한 도구가 아니었습니다. 그것은 너무 많은 노이즈를 가져왔고 정밀함이 부족했습니다. 대신, 상위 몇 개의 페이지를 찾아내어 AI가 읽게 하는 단순한 검색 방식이 학생들이 실제로 공부할 수 있는 신뢰할 수 있는 AI 튜터를 구축하는 가장 확실한 방법입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →