Scientific Knowledge Discovery in the Age of Large Language Models
이 장은 학술 문헌의 급격한 증가로 인한 과제를 해결하기 위해, 생성형 거대 언어 모델이 문헌 검색과 적격성 기준에 따른 후보 연구 선별을 자동화함으로써 어떻게 과학적 지식 발견을 개선할 수 있는지 탐구하는 34편의 동료 검토 논문을 조사한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
과학의 세계를 거대하고 끊임없이 확장되는 도서관이라고 상상해 보십시오. 매일 수천 권의 새로운 책(연구 논문)이 쓰여지고 서가에 추가됩니다. 과거에는 사서(연구자)가 복도를 걸어 다니며 필요한 책을 찾고, 그 책이 사용할 만한 가치가 있는지 확인할 수 있었습니다. 하지만 이제 도서관은 너무 빠르게 성장하고 있어서 사서는 물에 빠져 죽을 지경입니다. 모든 책을 다 읽을 수도 없고, 가장 중요한 책을 놓치거나 같은 책을 실수로 두 번 구매할 수도 있습니다. 이것이 바로 "과학적 지식 발견(scientific knowledge discovery)"의 문제입니다. 이를 돕기 위해 과학자들은 새로운 종류의 도구인 대규모 언어 모델(LLM)을 시도하고 있습니다. 이것을 단순히 "개"나 "고양이" 같은 키워드를 매칭하는 단순한 검색 엔진이 아니라, 질문의 의미를 이해하고, 눈 깜짝할 사이에 수백만 페이지를 훑어보고, "이봐, 이 책이 바로 당신이 찾던 거야" 또는 "아니, 이건 규칙에 맞지 않아"라고 말해줄 수 있는 아주 똑똑한 독서 로봇이라고 생각하십시오.
이 논문은 이 독서 로봇들이 실제로 얼마나 자신의 직무를 잘 수행하고 있는지에 대한 탐정의 보고서와 같습니다. 저자인 엘레니 아다미디(Eleni Adamidi), 세라핌 차토풀로스(Serafeim Chatzopoulos), 타나시스 베르굴리스(Thanasis Vergoulis)는 이 AI 도구들이 두 가지 특정 문제를 해결하는 데 어떻게 사용되고 있는지 알아보기 위해 최근 34개의 연구(2024년에서 2026년 사이에 발표된 연구)를 수집했습니다. 그들은 이 AI 도구들이 문헌 검색(Literature Retrieval)(올바른 책을 찾는 것)과 문헌 선별(Literature Screening)(어떤 책이 충분히 좋은지 결정하는 것)이라는 두 가지 문제를 해결하는 데 사용되고 있는지 확인하고자 했습니다. 그들은 알고 싶었습니다. 이 로봇들이 지친 사서를 대체할 만큼 똑똑한가? 어떤 종류의 로봇들이 사용되고 있는가? 그리고 우리는 그들이 실제로 일을 잘하고 있다는 것을 어떻게 알 수 있는가?
위대한 도서관 탐색: 올바른 책 찾기
보고서의 전반부는 문헌 검색을 다룹니다. 이것은 "검색" 단계입니다. 여러분이 사서에게 "부서진 로봇 팔을 고치는 방법에 대한 책이 필요해요"라고 묻는다고 상상해 보십시오. 전통적인 검색 엔진은 제목에 "로봇"과 "팔"이라는 단어가 들어간 모든 책을 가져올 수 있습니다. 설령 그것이 장난감 로봇이나 사람의 팔에 관한 책일지라도 말입니다. 새로운 AI 도구들은 사용자가 기계용 기계 팔을 의미한다는 것을 이해하려고 노력합니다.
논문은 연구자들이 이 로봇들을 더 똑똑하게 만들기 위해 다양한 기술을 시도하고 있다고 밝히고 있습니다. 어떤 이들은 AI를 사용하여 큰 질문을 더 작고 쉬운 질문들로 나누는 데 사용합니다(마치 형사가 사건을 세분화하는 것처럼 말이죠). 다른 이들은 AI를 사용하여 서로 다른 책들 사이의 연결 지도를 구축함으로써, 단순한 검색으로는 놓칠 수 있는 숨겨진 연결 고리를 찾습니다. 어떤 시스템은 심지어 협력하는 여러 개의 AI 에이전트를 사용하기도 합니다. 한 에이전트는 검색을 계획하고, 다른 에이전트는 책을 찾으며, 세 번째 에이전트는 결과가 타당한지 확인합니다.
하지만 보고서는 까다로운 문제를 지적합니다. 이 AI 도구들이 답변을 생성하는 데는 뛰어나지만, 답변을 얼마나 잘 찾아내는지에 대해서는 항상 테스트되지 않는다는 점입니다. 많은 연구에서 연구자들은 AI가 쓴 최종 이야기가 좋은지만 확인했을 뿐, AI가 그 이야기를 쓰기 위해 올바른 책들을 골랐는지는 확인하지 않았습니다. 이는 마치 요리사가 재료를 제대로 사용했는지 확인하지 않고 오직 수프의 맛만으로 요리사를 평가하는 것과 같습니다. 논문은 이러한 영리한 새로운 시스템들이 있음에도 불구하고, 실제로 올바른 논문을 찾아내는 데 있어 기존의 방식보다 더 나은지에 대한 충분한 증거가 아직 없다고 언급합니다. 또한, 대부분의 이러한 "로봇"들은 특정 작업을 위해 맞춤형 로봇을 훈련시키기보다는 이미 만들어진 기성 모델(마치 유명한 셰프에게 요리를 부탁하는 것처럼)을 사용하고 있습니다.
문지기: 무엇을 남길지 결정하기
보고서의 후반부는 문헌 선별에 초점을 맞춥니다. 이것은 "필터링" 단계입니다. 여러분에게 1,000권의 책이 있지만, 오직 "로봇 팔"에 관한 것이고 최근 5년 이내에 쓰인 책만을 원한다고 가정해 봅시다. 인간은 그 책이 적합한지 결정하기 위해 모든 책의 제목과 요약을 읽어야 합니다. 이것은 느리고 지루한 작업입니다.
여기서 AI 로봇은 문지기로 사용됩니다. 논문은 연구자들이 이 작업을 수행하기 위해 두 가지 주요 방식을 테스트하고 있다고 밝힙니다. 첫 번째 방식은 "원샷(One-Shot)" 방식입니다. 로봇에게 책을 건네주며 "남길까, 버릴까?"라고 묻고, 로봇은 답을 내놓습니다. 두 번째 방식은 "팀워크(Teamwork)" 방식입니다. 로봇 팀 전체를 사용하는 것입니다. 한 로봇은 책을 읽고, 다른 로봇은 사실 관계를 확인하며, 만약 그들이 의견이 다를 경우 세 번째 로봇이 판사 역할을 하여 최종 결정을 내립니다.
보고서는 "팀워크" 접근 방식이 더 유망해 보인다고 제안합니다. 이는 단 한 명의 사람 대신 심사위원단을 두는 것과 같습니다. 한 심사위원이 실수를 하더라도 다른 이들이 잡아낼 수 있기 때문입니다. 논문은 또한 이러한 테스트가 주로 의학과 생물학 분야에서 이루어지고 있다는 점을 강조합니다. 왜 그럴까요? 의학 분야에서는 무엇이 "증거"로 간주되는지에 대한 엄격한 규칙이 있고, 연구자들이 로봇의 정확성을 테스트하기 위해 사용할 수 있는 과거의 방대한 결정 데이터(예: 의학적 검토를 위해 어떤 연구들이 채택되었는지에 대한 기록)가 이미 존재하기 때문입니다. 역사나 공학 같은 다른 분야에는 아직 이러한 명확한 규칙이나 테스트용 데이터 뭉치가 없기 때문에, 로봇이 일을 잘하고 있는지 알기가 더 어렵습니다.
종합적인 견해
그렇다면 최종 결론은 무엇일까요? 논문은 우리가 AI를 사용하여 도서관을 관리하는 초기적이고 흥미로운 시대에 와 있다고 제-안합니다. 로봇들은 복잡한 질문을 이해하고 팀으로 협력하는 데 점점 더 능숙해지고 있습니다. 그러나 이들은 여전히 주로 의료 분야에서 사용되고 있으며, 우리는 이들이 실제로 인간보다 더 잘 책을 찾아내는지에 대한 더 많은 증거가 필요합니다.
저자들은 기술이 빠르게 움직이고 있지만, 주의가 필요하다고 지적합니다. 로봇이 멋진 요약본을 쓸 수 있다고 해서 반드시 올바른 출처를 찾아냈다는 뜻은 아닙니다. 또한, 어떤 사람들은 강력하고 비싼 "폐쇄형" 로봇(대형 기술 기업의 유명한 모델들처럼)을 사용하는 반면, 다른 이들은 비용을 절감하고 비밀을 유지하기 위해 자신의 컴퓨터에서 실행할 수 있는 개방형의 맞춤형 로봇을 사용하기 시작했습니다.
요약하자면, AI 사서는 유능한 새로운 조수이지만, 아직 도서관 전체를 맡아 운영할 준비는 되지 않았습니다. 로봇이 오랫동안 이 힘든 일을 해온 인간 연구자들을 완전히 대체하기 위해서는 더 많은 훈련과 더 나은 테스트, 그리고 아마도 조금 더 많은 팀워크가 필요합니다. 미래는 밝아 보이지만, 지금으로서는 우리는 로봇이 글을 읽는 법을 배우는 과정을 지켜보고 있는 중입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.