← 최신 논문
🤖 AI

Do LLMs Know a Good Hypothesis When They See One? Logit-Based Energy Scoring Outperforms Prompted LLM-as-Judge for Scientific Hypothesis Ranking

이 논문은 언어 모델의 내재적 신뢰도를 활용하는 로짓 기반 에너지 스코어링 방법이 여러 학문 분야에 걸쳐 과학적 가설의 순위를 매기는 데 있어 프롬프트 기반의 LLM-as-judge 접근 방식보다 성능이 현저히 우수함을 입증한다.

원저자: Swati Rajwal, Sanjay Das, Tirthankar Ghosal

게시일 2026-08-19
📖 4 분 읽기☕ 가벼운 읽기

원저자: Swati Rajwal, Sanjay Das, Tirthankar Ghosal

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

과학은 항상 우리가 알고 있는 것과 우리가 발견할지도 모르는 것 사이의 대화였습니다. 연구자가 복잡한 문제 앞에 섰을 때, 그들은 먼저 자신이 수집한 사실에 부합하는 가능한 설명, 즉 가설을 상상해야 합니다. 수십 년 동안 이 단계는 전적으로 인간의 직관에 의존해 왔지만, 이제 새로운 도구가 실험실에 들어왔습니다. 바로 거대 언어 모델입니다. 이들은 방대한 양의 텍스트를 학습하여 문장을 쓰고, 연구를 요약하며, 심지어 새로운 과학적 아이디어를 제안할 수도 있는 강력한 컴퓨터 프로그램입니다. 그러나 결정적인 질문이 여전히 해결되지 않은 채 남아 있습니다. 만약 컴퓨터가 현상에 대한 가능한 설명 목록을 생성할 수 있다면, 우리는 그중 어떤 것이 실제로 옳은지 어떻게 알 수 있을까요? 현재 이 질문에 답하기 위한 표준 방식은 더 큰 다른 컴퓨터 프로그램에게 그 목록을 읽고 가장 좋은 것을 고르라고 요청하는 것입니다. 이는 마치 교사가 시험지를 채점하는 것과 비슷합니다. 하지만 이 방법에는 결함이 있습니다. 이 방식은 진정으로 새롭거나 과학적으로 타당한 아이디어보다는, 익숙하거나 잘 쓰인 것처럼 보이는 아이디어를 선호하는 경향이 있습니다.

오크리지 국립연구소(Oak Ridge National Laboratory)의 연구팀은 다른 접근 방식을 테스트하기로 했습니다. 모델에게 아이디어를 비교하고 언어적 의견을 내라고 요청하는 대신, 단순히 각 아이디어의 '무게'를 '느끼도록' 요청했습니다. 그들은 컴퓨터의 내부적 확신을 하나의 신호로 취급했습니다. 모델이 자신이 예상하는 문장을 읽을 때 확신을 느끼듯, 낯설거나 일어날 법하지 않은 것을 읽을 때는 놀라움을 느낍니다. 연구진은 이 가공되지 않은 내부적 느낌이 공식적인 언어적 순위 매기기보다 과학적 진실을 판단하는 데 더 나은 판별기가 될 수 있는지 궁금했습니다. 그들은 컴퓨터가 선택을 하도록 지시받지 않고도, 과학 논문의 이야기 속에 얼마나 자연스럽게 녹아드는지를 통해 좋은 가설을 인식할 수 있는지 알아보고자 했습니다.

이를 테스트하기 위해 연구진은 천문학, 물리학부터 법률, 경영에 이르기까지 12개 분야에서 추출한 1,323개의 실제 과학 논문 모음을 수집했습니다. 각 논문에 대해 연구자들이 다루는 배경 정보와 구체적인 질문을 정리했습니다. 그런 다음, 컴퓨터 모델을 위한 도전 과제를 만들었습니다. 바로 16개의 가능한 가설 목록입니다. 이 중 단 하나만이 원래 과학자들이 사용했던 실제 가설이며, 나머지 15개는 정교하게 작성되었지만 틀린 대안들입니다. 목표는 컴퓨터가 15개의 잘못된 가설 무리 속에서 단 하나의 올바른 가설을 식별할 수 있는지 확인하는 것이었습니다.

연구팀은 매우 작은 오픈 소스 프로그램부터 거대한 독점 시스템에 이르기까지 7가지 서로 다른 컴퓨터 모델을 사용하여 이 테스트를 수행했습니다. 그들은 가설을 판단하는 두 가지 방법을 비교했습니다. 첫 번째 방법은 전통적인 방식으로, 대형 상용 모델에게 16개의 옵션을 모두 읽고 최선부터 최악까지 순위를 매기도록 유발하는 것이었습니다. 두 번째 방법은 새로운 방식으로, 각 가설을 배경 맥락과 함께 모델에 하나씩 입력하고 모델의 내부 확신 점수를 측정하는 것이었습니다. 이 점수는 주어진 맥락을 바탕으로 특정 단어가 다음에 나타날 확률이 얼마나 높은지에 기초합니다. 연구진은 이를 두 번 수행했는데, 한 번은 표준 확률 계산을 사용했고, 다른 한 번은 예측이 매끄럽게 다듬어지기 전의 강도를 포착하는 모델의 원시 에너지(raw energy) 측정을 사용했습니다.

결과는 놀라웠으며, 이러한 도구들이 작동하는 방식에 대한 이해를 바꾸어 놓았습니다. 대형 모델이 판사 역할을 하며 목록을 순위 매기도록 요청했던 전통적인 방식은 성능이 저조했습니다. 이 방식은 약 16.6%의 경우에만 상위 가설을 정확히 식별했습니다. 반면, 명시적인 순위 지정 지시 없이 모델의 내부 확신에 의존한 방법은 훨씬 더 우수한 성능을 보였습니다. 연구진이 가장 뛰어난 모델과 점수 산출 방식의 조합을 살펴보았을 때, 원시 에너지 점수를 사용한 상대적으로 작은 오픈 소스 모델이 올바른 가설을 53.1%의 확률로 정확히 식별해 냈습니다. 이는 단순히 텍스트를 '느끼는' 평범한 컴퓨터 프로그램이, 명시적으로 비교와 순위 매기기를 수행하도록 지시받은 훨씬 더 크고 정교한 시스템보다 올-바른 과학적 아이디어를 찾는 데 세 배 이상 효과적이었음을 의미합니다.

이 연구는 모델의 크기가 반드시 더 나은 성능을 보장하는 것은 아니라는 점도 밝혀냈습니다. 가장 성공적인 구성은 복잡한 추론에 흔히 사용되는 거대 시스템에 비해 아주 작은 10억 개의 파라미터를 가진 모델이었습니다. 실제로 테스트된 가장 큰 모델들이 순위를 매기라는 요청을 받았을 때 항상 최상의 성능을 보인 것은 아니었습니다. 연구진은 내부 확신 신호가 모든 모델에서 균일하게 나타나지는 않는다는 점에 주목했습니다. 어떤 모델에게는 원시 에너지 점수가 강력한 도구였던 반면, 다른 모델에게는 효과가 덜했습니다. 이는 모델이 어떻게 구축되고 훈련되었는지가 이 특정 작업에 있어 단순한 규모보다 더 중요하다는 것을 시사합니다. 또한 이 방법은 대부분의 과학 분야에서 일관되게 잘 작동했지만, 분야 간의 차이는 결정적인 규칙으로 간-주할 수 없을 만큼 미미했습니다.

이 연구의 가장 중요한 시사점 중 하나는 우리가 현재 컴퓨터에게 과학적 아이디어를 평가하도록 요구하는 방식에 결함이 있을 수 있다는 것입니다. 모델에게 선호도를 명확히 표현하고 옵션의 순위를 매기도록 강요함으로써, 우리는 모델의 진정한 이해를 가로막는 오류를 도입하고 있을지도 모릅니다. 연구진은 모델의 자체적인 가능성, 즉 특정 단어 배열에 대한 조용한 확신이 모델의 언어적 판단보다 과학적 타당성을 나타내는 더 정직하고 신뢰할 수 있는 지표일 수 있다고 제안합니다. 이것이 문제가 해결되었음을 의미하는 것은 아닙니다. 연구진은 이번 테스트가 이미 출판된 논문의 가설들을 사용했기 때문에, 모델이 진정으로 과학을 이해하기보다는 익숙한 문구를 인식했을 수도 있다는 점을 인정했습니다. 그들은 다음 단계로, 답을 알 수 없는 새로운 미출판 아이디어들에 대해 이 방법들을 테스트하고, 인간 전문가가 결과를 판단하게 하는 과정을 제안했습니다.

궁극적으로, 이 연구는 과학을 위한 신뢰할 수 있는 인공지능의 새로운 길을 제시합니다. 우리는 올바른 답을 찾기 위해 컴퓨터 프로그램 간의 복잡한 언어적 논쟁에 의존할 필요가 없다는 것을 시사합니다. 대신, 우리는 모델의 조용하고 내부적인 신호를 신뢰할 수 있으며, 이를 통해 더 작고 접근하기 쉬운 도구들이 과학적 발견 과정에서 핵심적인 역할을 할 수 있게 할 수 있습니다. 연구는 현재의 방식에 한계가 있지만, 모델의 본질적인 확신을 사용하여 과학적 가설을 평가하는 잠재력은 실재하며 더 많은 탐구가 필요하다고 결론지었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →