← 최신 논문
🤖 AI

Self-prompting and cross-model consensus enable reproducible data extraction from scientific literature with large language models

이 논문은 거대 언어 모델과 함께 셀프 프롬프팅 및 교차 모델 합의를 결합하는 것이 실질적인 분업을 통한 전문가의 감독을 유지하면서도 과학 문헌으로부터 재현 가능하고 확장 가능한 데이터 추출을 가능하게 함을 입증한다.

원저자: Valentin Romanov, Monique Bax, Steven Niederer

게시일 2026-08-20
📖 4 분 읽기☕ 가벼운 읽기

원저자: Valentin Romanov, Monique Bax, Steven Niederer

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

과학은 과거의 발견들이 모인 방대한 도서관에 의존하고 있지만, 그 오래된 논문들 속에 숨겨진 구체적인 사실을 찾아내는 일은 느리고 지루한 작업입니다. 예를 들어, 한 연구자가 특정 조건에서 심장 근육 단백질이 어떻게 행동하는지 정확히 알아야 한다고 가정해 봅시다. 그들은 온도, 화학 농도, 측정 방법과 같은 미세한 세부 사항을 찾기 위해 수십 편의 논문을 읽어야 하며, 이 논문 중 일부는 수십 년 전에 작성된 것일 수도 있습니다. 이러한 세부 사항들은 밀집된 텍스트 속에 파묻혀 있거나 표 곳에 흩어져 있는 경우가 많으며, 단 하나라도 놓치면 새로운 연구에 오류를 초래할 수 있습니다. 수년 동안 과학자들은 컴퓨터 프로그램이 이 힘든 일을 대신 해주기를 희망해 왔지만, 최근까지도 이러한 도구들은 이토록 섬세한 작업을 맡기기에는 신뢰도가 너무 낮았습니다. 이 프로그램들은 중요한 맥락을 놓치거나 존재하지도 않는 사실을 지어내곤 했습니다.

임페리얼 칼리지 런던과 케임브리지 대학교 연구진의 새로운 연구는 최신 세대의 인공지능이 마침로 이 문제를 해결할 수 있는지 테스트합니다. 연구팀은 단순히 컴퓨터에게 논문을 읽으라고 시킨 것이 아니라, 세심한 교육과 감독이 필요한 주니어 연구 보조원처럼 컴퓨터를 대했습니다. 그들은 컴퓨터가 과학 논문에서 특정 데이터를 얼마나 잘 추출할 수 있는지 확인하기 위해 일련의 실험을 설정했습니다. 실험은 인간이 명확한 지침을 제공하는 단순한 작업부터, 컴퓨터가 스스로 논문을 찾아야 하는 복합적인 작업에 이르기까지 다양했습니다. 목표는 이 기계들이 어디에서 성공하고, 어디에서 여전히 인간의 손길을 통한 안내가 필요한지를 정확히 지도화하는 것이었습니다.

연구진은 먼저 간단한 도전 과제로 시작했습니다. 컴퓨터가 18편의 서로 다른 과학 논문으로부터 칼슘이 심장 단백질에 어떻게 결합하는지에 대한 정밀한 수치를 추출할 수 있는가 하는 점이었습니다. 그들은 가장 진보된 7개의 컴퓨터 프로그램에 전문가가 작성한 상세한 지침을 제공하고, 각 실험에 대해 사용된 동물의 종류, 온도, 화학적 수치와 같이 7가지의 구체적인 정보를 찾도록 요청했습니다. 결과는 놀라울 정도로 강력했습니다. 가장 우수한 프로그램들은 95% 이상의 확률로 숫자를 정확히 맞혔습니다. 실제로 컴퓨터가 숫자 자체만을 찾는 요청을 받았을 때는 거의 100%에 가깝게 정확했습니다. 그러나 기계들은 숫자 뒤에 숨겨진 이야기를 이해하는 데는 어려움을 겪었습니다. 그들은 테스트된 단백질의 정확한 버전이나 측정이 수행된 구체적인 조건을 식별하는 데 자주 실패했습니다. 이는 컴퓨터가 숫자를 찾는 데는 탁월하지만, 그 숫자를 의미 있게 만드는 과학적 맥락을 이해하는 데는 여전히 배우는 단계에 있음을 보여주었습니다.

컴퓨터가 인간의 지침 없이 더 잘 수행할 수 있는지 확인하기 위해, 연구진은 프로그램들이 스스로 가이드를 작성하도록 했습니다. 연구진은 각 컴퓨터에게 질문을 던지는 최선의 방법을 검색하고, 해당 과업을 위한 마스터 지침서를 만들도록 요청했습니다. 컴퓨터들은 유용한 가이드를 만들어냈지만, 스스로 작성한 지침을 사용하여 추출한 데이터는 인간 전문가의 원래 계획을 따랐을 때보다 약간 덜 정확했습니다. 상위 프로그램들의 경우 그 격차가 작았으나, 다른 프로그램들에서는 격차가 더 커졌습니다. 이는 컴퓨터가 좋은 질문을 던지는 법을 배울 수는 있지만, 과학적 문제의 특정한 뉘앙스를 구성하는 데 있어서는 여전히 인간 전문가가 최고라는 것을 시사했습니다.

연구팀은 컴퓨터를 더 밀어붙여, 그들이 자율적인 연구자로 활동하도록 했습니다. 이 시나리오에서 프로그램들은 인간의 도움 없이 스스로 관련 과학 논문을 찾아 읽고 데이터를 추출해야 했습니다. 여기서 시스템은 벽에 부딪혔습니다. 가장 진보된 프로그램들조차 찾아야 할 논문의 절반 이상을 놓쳤습니다. 일부는 존재하지 않는 논문에 대한 인용을 지어내는 '환각(hallucination)' 현상을 보였고, 다른 프로그램들은 적절한 출처를 찾는 데 아예 실패하기도 했습니다. 연구는 컴퓨터가 스스로 정보를 찾아야 할 때 신뢰도가 훨씬 떨어진다는 것을 발견했습니다. 이는 마치 학생에게 보고서를 쓰라고 하면서 도서관 출입증을 주지 않는 것과 같습니다. 학생은 맞는 책을 추측할 수는 있겠지만, 제목을 지어낼 가능성 또한 매우 높습니다.

연구의 마지막 부분은 이 과정을 실제 환경에서 어떻게 작동시킬 것인가를 살펴보았습니다. 연구진은 여러 대의 컴퓨터를 사용하여 서로의 작업을 검토하게 하는 방법을 테스트했습니다. 그들은 한 컴퓨터가 실수를 하면 다른 컴퓨터가 이를 잡아내는 경우가 많다는 것을 발견했습니다. 동일한 과업을 다섯 번 실행하고 가장 흔한 답을 취함으로써, 연구팀은 정확도를 크게 높일 수 있었습니다. 또한, 동일한 문제를 두고 서로 다른 컴퓨터들이 작업하는 것이 한 대의 컴퓨터가 과업을 다섯 번 반복하는 것보다 더 효과적이라는 사실도 발견했습니다. 이러한 접근 방식은 컴퓨터가 까다로운 사례를 표시하여 인간이 검토할 수 있도록 하는 안전망을 구축했습니다. 연구는 이러한 도구들을 사용하는 최선의 방법이 인간 과학자를 대체하는 것이 아니라, 파트너십을 형성하는 것이라고 결론지었습니다. 이 새로운 워크플로우에서 컴퓨터는 데이터의 탐색과 추출이라는 반복적인 업무를 담당하고, 인간 전문가는 까다로운 부분을 검증하고 기계 간의 의견 차이를 해결하기 위해 개입합니다. 이러한 분업을 통해 과학자들은 인간만이 제공할 수 있는 신중한 판단력을 잃지 않으면서도 방대한 양의 문헌을 빠르게 처리할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →