← 최신 논문
🤖 AI

LLM Jaggedness Unlocks Scientific Creativity

본 논문은 과학 도메인 전반에 걸친 대규모 언어 모델의 능력 발전이 불균형적이고 '불규칙적'임을 보여주는 SciAidanBench 벤치마크를 제시하여, 이러한 특성을 앙상블 방법을 통해 전략적으로 활용함으로써 단일 모델의 한계를 넘어 AI 기반 과학적 창의성을 획기적으로 향상시킬 수 있음을 입증합니다.

원저자: Shray Mathur, J. Anibal Boscoboinik, Esther H. R. Tsai, Kevin G. Yager

게시일 2026-05-12
📖 4 분 읽기☕ 가벼운 읽기

원저자: Shray Mathur, J. Anibal Boscoboinik, Esther H. R. Tsai, Kevin G. Yager

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

과학자들이 새로운 실험과 발견을 도출하는 데 도움이 되는 궁극적인 '아이디어 머신'을 구축하려 한다고 상상해 보세요. 이러한 기계 (AI 모델) 가 더 커지고 똑똑해질수록 모든 것이 매끄럽고 예측 가능하게 향상될 것이라고 가정할 수 있습니다.

하지만 이 논문은 그렇지 않다고 주장합니다. 대신 AI 의 진보는 '불규칙하게 들쭉날쭉합니다 (jagged)'.

AI 모델을 매끄럽고 평평한 도로가 아니라 거친 산맥으로 생각하세요. 산의 일부는 AI 가 천재성을 발휘하는 높은 봉우리이고, 다른 부분은 AI 가 넘어지고 실패하는 깊은 골짜기입니다. 때로는 산을 더 높게 만드는 것 (모델 크기 증가) 이 골짜기를 해결하지 못합니다. 오히려 절벽을 더 가파르게 만들 수도 있습니다.

연구자들이 발견한 내용을 간단한 비유로 정리해 보겠습니다.

1. '불규칙한' 지형

연구자들은 SciAidanBench라는 테스트를 개발했습니다. "새로운 자연력을 어떻게 탐지할 수 있는가?"부터 "특정 세포에 약물을 어떻게 전달할 수 있는가?"까지 155 개의 개방형 과학 질문이 담긴 거대한 상자를 상상해 보세요.

그들은 30 개의 서로 다른 AI 모델에게 이 질문들에 답하도록 요청했습니다. 단순히 하나의 정답을 원하는 것이 아니라, 모델들이 가능한 한 많은 독특하고 일관된 아이디어를 생성하기를 원했습니다.

발견 사항:

  • 일반적 능력 vs 과학적 능력: 일반적인 창의적 글쓰기 (예: 이야기 쓰기) 에 탁월한 AI 가 반드시 과학적 창의성에서도 뛰어난 것은 아닙니다. 케이크 굽기는 천재이지만 스테이크 구이는 형편없는 요리사와 같습니다. 기술은 매끄럽게 이전되지 않습니다.
  • "돌발" 효과: 가장 똑똑한 AI 모델조차 일관성이 없습니다. 어떤 질문에서는 천재적인 "돌발" 현상이 일어나 50 개의 훌륭한 아이디어를 생성하는가 하면, 다음 질문에서는 단 2 개만 생성할 수도 있습니다. 더 강력한 모델이 모든 것을 단순히 더 많이 수행하는 것이 아니라, '보통'과 '놀라운' 사이의 진폭이 더 넓어질 뿐입니다.
  • "뾰족한" 전문가: 단일 모델 내에서도 AI 는 물리학에서는 천재일 수 있지만 생물학에서는 어려움을 겪을 수 있습니다. 그 지식은 매끄러운 담요가 아니라 날카로운 가시들의 집합체입니다.

2. '불규칙함'을 슈퍼파워로 전환하기

보통 사람들은 이러한 불균형적인 능력을 결함이라고 생각합니다. 하지만 연구자들은 아니요, 그것은 기능입니다라고 말합니다.

각자 다른 분야에서 뛰어난 능력을 가진 사람들로 팀을 구성하면 슈퍼팀을 만들 수 있습니다. 연구자들은 이러한 '불규칙한' AI 모델들을 결합하여 **메타 모델 (AI 팀이 함께 작동하는 시스템)**을 만들기 위해 세 가지 방법을 시도했습니다.

  • 더 오래 생각하기 (추론 시간 계산):
    • 비유: 학생에게 수학 문제를 풀게 한다고 상상해 보세요. 첫 번째 답을 바로 말하게 하면 틀릴 수 있습니다. 하지만 "5 분 동안 생각한 후 단계를 적고 답을 확인하라"고 말하면 훨씬 더 잘 풀게 됩니다.
    • 결과: AI 가 답변하기 전에 더 오래 '생각'하도록 (더 많은 내부 추론 단계를 생성하도록) 허용했을 때, 훨씬 더 창의적인 과학적 아이디어를 산출했습니다.
  • 지식 통합 (라우터):
    • 비유: 병원을 상상해 보세요. 심장 외과 의사에게 다리를 고치게 하지 않습니다. 환자를 전문가에게 연결합니다.
    • 결과: 연구자들은 질문을 분석하는 시스템을 구축했습니다. 물리학 관련 질문이면 물리학에 가장 뛰어난 AI 로, 생물학 관련 질문이면 생물학 전문가 AI 로 보냈습니다. 이 '라우터' 팀은 항상 작업에 맞는 전문가를 활용했기 때문에 단일 AI 모델보다 더 좋은 성과를 냈습니다.
  • 함께 브레인스토밍하기:
    • 비유: 한 방에 모인 예술가 그룹을 상상해 보세요. 예술가 A 가 선을 그리고, 예술가 B 는 그 선을 보고 형태를 추가합니다. 예술가 C 는 그 형태를 보고 색을 입힙니다. 그들은 서로의 작업을 기반으로 발전시킵니다.
    • 결과: 연구자들은 다섯 개의 서로 다른 AI 모델이 한 목록에 아이디어를 번갈아 추가하도록 했습니다. 한 모델이 아이디어를 제안하면, 다음 모델이 그것을 읽고 개선하거나 확장하려 했습니다. 이러한 아이디어의 '연쇄 반응'은 단일 모델이 혼자 할 수 있는 것보다 훨씬 풍부한 해결책을 만들어냈습니다.

3. 궁극적인 팀 (Top-5-Parallel)

연구자들은 이 세 가지 방법을 모두 결합했습니다. 상위 다섯 개의 AI 모델을 선정하여 깊이 생각하게 한 후, 서로의 아이디어를 볼 수 있는 브레인스토밍 세션에서 함께 작업하게 했습니다.

결과: 이 '슈퍼팀'은 단일 AI 모델보다 모든 면에서 더 뛰어난 성과를 냈습니다. 단순히 조금 더 잘한 것이 아니라, 불규칙한 가장자리를 매끄럽게 만들었습니다. 한 모델이 '골짜기 (약점)'를 가진 곳에서는 다른 모델이 '봉우리'를 가지고 있었으며, 함께 전체 산맥을 커버했습니다.

결론

이 논문은 모든 것에 뛰어난 하나의 '완벽한' AI 를 구축하려 해서는 안 된다고 결론 내립니다. 대신 AI 들이 불균형적이라는 사실을 받아들여야 합니다. 그들의 구체적인 강점과 약점을 인식하고, 팀으로 함께 작동하게 함으로써 단일 기계가 혼자서는 결코 달성할 수 없는 수준의 과학적 창의성을 unlocking 할 수 있습니다.

간단히 말해: AI 는 매끄럽고 완벽한 기계가 아닙니다. 그것은 불규칙하고 거친 지형입니다. 하지만 바위를 어떻게 헤쳐 나가고 올바른 등반가들을 어떻게 모을지 안다면, 가장 높은 봉우리에 도달할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →