← 최신 논문
🤖 AI

Science Edge Evaluation: SEE the Missing Step Toward Real Scientific Discovery

Science Edge Evaluation (SEE) 벤치마크는 현재의 멀티모달 거대 언어 모델들이 화학, 생물학, 재료 과학 분야의 실험 데이터로부터 근거에 기반한 통찰을 안정적으로 도출하는 데 어려움을 겪고 있으며, 도구 사용 시에도 최대 52.7%의 정확도를 기록하는 데 그친다는 점을 밝혀냈는데, 이는 확립된 개념을 설명하는 것과 실제 과학적 발견을 수행하는 것 사이의 결정적인 격차를 강조한다.

원저자: Taolin Han, Yuchen Zhang, Jinghang Wang, Yun Wu, Wai Yuet Chiu, Zhaohai Li, Yifei Zhang, Jinxin Wang, Yuhao Zhou, Chen Zhao, Jiajia Li, Jiaxin Li, Qile Jin, Kewei Sun, Shuang Wu, Weiqi Zhai, Renquan L
게시일 2026-08-10
📖 4 분 읽기☕ 가벼운 읽기

원저자: Taolin Han, Yuchen Zhang, Jinghang Wang, Yun Wu, Wai Yuet Chiu, Zhaohai Li, Yifei Zhang, Jinxin Wang, Yuhao Zhou, Chen Zhao, Jiajia Li, Jiaxin Li, Qile Jin, Kewei Sun, Shuang Wu, Weiqi Zhai, Renquan Lv, Junchao Li, Ruodan Chen, Qingteng Chen, Zhibo Yang, Hu Wei, Lin Qu, Shuai Bai, Bing Zhao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 마치 미스터리를 풀려는 탐정이라고 상상해 보세요. 단순히 목격자의 진술을 읽는 것이 아니라, 흐릿한 사진, 지문, 화학 테스트 결과, 그리고 찢어진 지도를 동시에 살펴봐야 합니다. 이것이 바로 실제 과학적 발견의 모습입니다. 과학자들은 단순히 교과서의 사실들을 암기하는 것이 아닙니다. 그들은 아주 작은 세포의 이미지, 기계에서 나온 구불구불한 선, 실험에서 얻은 숫자와 같은 무질서하고 실제적인 데이터들을 바라보며 실제로 무슨 일이 일어나고 있는지 파악해야 합니다. 그들은 자신이 생각하기에 그래야만 하는 것에 근거해 추측하는 것이 아니라, 오직 증거가 실제로 보여주는 것에만 주의를 기울여야 합니다.

오랫동안 우리는 "대규모 언어 모델(LLM)"이라 불리는 컴퓨터 두뇌가 이 탐정 업무를 도울 만큼 똑똑한지 테스트해 왔습니다. 이들은 이야기를 쓰거나 상식 퀴즈에 답할 수 있는 것과 같은 유형의 AI입니다. 하지만 큰 의문이 하나 있습니다. 과연 AI가 이 무질서하고, 시각적이며, 복적인 현실을 다룰 수 있을까요? 만약 AI가 새로운 약품이나 재료를 발견하는 데 과학자를 돕고자 한다면, 단순히 말을 잘하는 것이 아니라, 좋은 관찰자이자 "아직 단서가 충분하지 않다"라고 말할 줄 아는 신중한 사고가가 되어야 합니다.


위대한 실험실 테스트: AI는 과학을 "볼" 수 있는가?

연구진들은 이 AI 탐정들에게 궁극의 시험을 치르게 하기로 했습니다. 그들은 **Science Edge Evaluation (SEE)**라는 새로운 도전 과제를 만들었습니다. SEE를 "프랑스의 수도는 어디인가?"라거나 "물의 공식은 무엇인가?"라고 묻는 시험이 아니라, 거대하고 매우 어려운 시험이라고 생각하십시오. 대신, 이 시험은 AI에게 실제 과학적 미스터리를 던져줍니다. 현미경 슬라이드 사진, 화학 실험 그래프, 그리고 그 모든 점들을 연결하여 답을 찾아내야 하는 질문을 주는 식입니다.

이 시험은 세 가지 주요 분야를 다룹니다: 화학(물질의 변화), 생물학(생명의 원리), 그리고 재료 과학(새로운 물질을 만드는 법)입니다. 질문들은 실제 발표된 과학 논문과 실제 실험실 실험에서 가져왔습니다. 총 1,116개의 질문이 있으며, 이 질문들은 까다롭게 설계되었습니다. 어떤 질문은 AI에게 그래프에서 특정 숫자를 읽어낼 것을 요구하고, 어떤 질문은 생물학 도표에서 실수를 찾아내라고 하며, 또 어떤 질문은 생물학과 화학의 지식을 함께 결합할 것을 요구합니다.

결과: 현실 점검

연구진은 이 시험에 19개의 서로 다른 AI 모델을 테스트했습니다. 여기에는 가장 크고 유명한 "범용(general)" AI(모든 것을 할 수 있는 AI)와 "과학 특화(science-specialized)" AI(과학 서적을 전문적으로 학습한 AI)들이 포함되었습니다.

여기 놀라운 사실이 있습니다: 그 어떤 모델도 우수한 성적으로 통과하지 못했습니다.

실제로 가장 뛰어난 성능을 보인 모델인 **GPT-5.6-Sol (Max)**조차 정답률이 **48.7%**에 불과했습니다. 이는 절반도 안 되는 수치입니다! 다른 모델들은 훨씬 더 낮은 성적을 기록했으며, 일부는 **15.9%**까지 떨어졌습니다. 이는 마치 학생이 기말고사를 보고 D- 학점을 받은 것과 같습니다.

더 흥러운 점은, "과학 특화" 모델들(과학 수업을 열심히 공부한 모델들)이 오히려 범용 모델들보다 평균적으로 더 낮은 성적을 거두었다는 것입니다. 범용 모델들의 평균 정답률은 **34.9%**였던 반면, 과학 전문가 모델들의 평균은 **22.2%**였습니다. 이는 단순히 많은 과학적 사실을 암기하는 것만으로는 부족하다는 것을 시사합니다. AI는 무질서한 실제 사진을 볼 때 그 사실들을 어떻게 사용할지를 알아야 합니다.

"도구"의 문제: 계산기가 도움이 될까?

연구진은 다음과 같이 궁금해했습니다. "만약 우리가 AI에게 계산기와 검색 엔진을 준다면 어떨까?" 그들은 상위 6개 모델이 웹 검색(사실을 찾아보기 위해)과 코드 인터프리터(수학을 계산하거나 이미지를 분석하기 위해)와 같은 도구를 사용하게 했습니다.

도구를 주는 것은 도움이 되었지만, 그 정도는 미미했습니다. 가장 뛰어난 모델의 점수는 **48.7%**에서 **52.7%**로 올라갔습니다. 약간의 개선은 있었지만, 여전히 합격점에는 미치지 못했습니다. 도구들은 AI에게 더 많은 정보를 주었지만, AI는 여전히 어떤 정보가 중요한지, 그리고 그것들을 어떻게 결합해야 하는지 파악하는 데 어려움을 겪었습니다. 때때로 도구들은 AI를 혼란스럽게 만들어 잘못된 경로를 선택하게 하거나 과도한 생각의 굴레에 빠지게 만들기도 했습니다.

진짜 문제: 왜 실패하는가?

논문은 AI가 왜 실패하는지 그 이유를 깊이 파고듭니다. 문제는 AI가 충분한 사실을 알지 못해서가 아니었습니다. 문제는 AI가 증거를 고수하는 능력이 부족하다는 것이었습니다.

  1. "맹목적 추측" 습관: 연구진이 사진을 제거하고 텍-트스트만 제공했을 때, AI는 "사진 없이는 이 문제를 풀 수 없습니다!"라고 말하는 대신, 이전에 읽었던 내용을 바탕으로 그냥 추측해 버렸습니다. AI는 사진 속의 단서를 보는 대신 자신의 기억력을 이용해 미스터리를 풀려고 시도했습니다. 실제로 AI가 정보가 부족하다고 인정한 경우는 단 **4.6%**에 불과했습니다.
  2. 사진 무시하기: 만약 사진이 AI가 예상했던 것과 일치하지 않는 이상한 것을 보여주더라도, AI는 종종 사진을 무시하고 자신의 "직감"(학습 데이터로부터 배운 것)을 따랐습니다. 이는 마치 탐정이 용의자의 이야기와 맞지 않는다는 이유로 지문을 무시하는 것과 같습니다.
  3. 과도한 자신감: AI는 빈칸을 채우려 애썼습니다. 만약 실험이 불완전하더라도, AI는 마치 모든 데이터를 가진 것처럼 결론을 지어냈습니다. 실제 과학자들은 때때로 결론을 내리기 위한 증거가 충분하지 않을 수 있다는 점을 알고 있지만, AI는 답을 내놓는 데 너무 급급했습니다.

누락된 단계

이 논문은 우리가 AI를 유용하게 만드는 데 있어 결정적인 단계를 놓치고 있다고 결론짓습니다. 우리는 지금까지 AI를 도서관(사실을 저장하는 곳)이나 계산기(수학을 하는 도구)로 만들기 위해 노력해 왔습니다. 하지만 실제 과학은 AI가 무질서한 증거를 살피고, 자신이 모른다는 것을 인정하며, 오직 눈에 보이는 것에 의해 엄격히 뒷받침되는 결론만을 내릴 수 있는 탐정이 되기를 요구합니다.

저자들은 AI가 진정으로 과학적 발견을 돕기 위해서는 증거를 관리하는 법을 배워야 한다고 제안합니다. AI는 언제 추측을 멈춰야 하는지, 그리고 언제 더 많은 데이터를 요청해야 하는지를 배워야 합니다. AI가 그 일을 할 수 있게 될 때까지, AI는 보고서를 쓰는 데는 훌륭한 조수가 될 수 있겠지만, 실험실을 직접 운영할 준비는 아직 되지 않았습니다. "사실을 아는 것"과 "증거로부터 추론하는 것" 사이의 간극이 바로 실제 과학적 발견을 향한 누락된 단계입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →