← 최신 논문
💬 NLP

Evaluating LLMs' Divergent Thinking Capabilities for Scientific Idea Generation with Minimal Context

이 논문은 단일 키워드 프롬프트를 기반으로 LLM 의 과학적 아이디어 생성 및 수렴적 사고 능력을 평가하는 'LiveIdeaBench' 벤치마크를 제안하고, 일반 지능 지표와 과학적 아이디어 생성 능력 간의 괴리를 발견하여 이를 향상시키기 위한 전용 평가 체계와 훈련 전략의 필요성을 강조합니다.

원저자: Kai Ruan, Xuan Wang, Jixiang Hong, Peng Wang, Yang Liu, Hao Sun

게시일 2026-02-24
📖 3 분 읽기☕ 가벼운 읽기

원저자: Kai Ruan, Xuan Wang, Jixiang Hong, Peng Wang, Yang Liu, Hao Sun

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

1. 기존 시험 vs 새로운 시험: "레시피 따라 하기" vs "재미있는 요리 발명하기"

지금까지 AI 를 평가할 때는 주로 기존의 지식을 얼마나 잘 이해하고, 정해진 답을 찾아내는 능력을 봤습니다.

  • 비유: "이 레시피를 보고 요리해 보세요" 또는 "이 수학 문제를 풀어보세요" 같은 시험입니다. 정답이 명확하고, 주어진 정보 (레시피나 문제) 가 풍부합니다.

하지만 이 연구는 새로운 아이디어를 뚝딱 만들어내는 능력을 봅니다.

  • 비유: "단 한 가지 재료 (예: '토마토') 만 주어졌을 때, AI 는 어떤 새로운 요리를 생각해 낼 수 있을까요?"
  • 핵심: AI 에게 책이나 논문 같은 방대한 정보를 주지 않고, 단어 하나만 던져주면 얼마나 다양하고 독창적인 과학적 아이디어를 쏟아낼 수 있는지 테스트합니다. 이를 심리학에서는 **'분산적 사고 (Divergent Thinking)'**라고 합니다.

2. 새로운 시험지 (LiveIdeaBench) 의 특징

이 연구팀은 22 개의 과학 분야 (물리, 생물, 경제 등) 에서 1,180 개의 키워드를 뽑아 40 개 이상의 최신 AI 모델들에게 "이 단어로 과학적 아이디어를 100 단어 안에 써봐"라고 요청했습니다.

그리고 AI 가 만든 아이디어를 평가할 때 5 가지 기준을 적용했습니다.

  1. 독창성 (Originality): 남들이 생각지 못한 새로운 아이디어인가? (새로운 레시피인가?)
  2. 실행 가능성 (Feasibility): 실제로 구현 가능한 과학적인 내용인가? (요리할 수 있는 재료인가?)
  3. 명확성 (Clarity): 설명이 명확하고 이해하기 쉬운가?
  4. 유창성 (Fluency): 같은 단어로 얼마나 많은 다른 아이디어를 냈는가? (토마토로 스프, 샐러드, 케첩 등 여러 가지를 만들었는가?)
  5. 유연성 (Flexibility): 다양한 과학 분야에서 골고루 잘하는가?

3. 놀라운 발견: "IQ 가 높다고 해서 '창의성'이 높은 건 아니다"

이 연구에서 가장 충격적인 결과는 무엇일까요? 바로 AI 의 '일반 지능 (IQ)' 점수와 '과학적 아이디어 창출 능력'은 서로 거의 관련이 없다는 것입니다.

  • 비유: 어떤 학생은 수학 경시대회에서 1등을 하지만, 그림 그리기나 글쓰기 창의성 테스트에서는 평범할 수 있습니다. 반대로 수학은 조금 부족해도 상상력이 뛰어난 학생이 있을 수 있죠.
  • 실제 결과:
    • Claude 3.7 Sonnet: 일반 지능 (IQ) 점수가 매우 높고, 아이디어 창출 능력도 뛰어났습니다. (모범생)
    • QwQ-32B-preview: 일반 지능 점수는 상대적으로 낮았지만, 과학적 아이디어를 내는 능력은 Claude 와 거의 비슷하거나 오히려 더 좋았습니다. (창의적인 천재)
    • o3-mini-high: 일반 지능은 매우 높았지만, 아이디어를 내는 능력은 기대에 미치지 못했습니다. (지식만 많고 창의성은 부족함)

즉, "지능이 높으면 무조건 창의적일 것이다"라는 공식은 AI 에게도 통하지 않습니다.

4. 왜 이런 결과가 나왔을까요?

연구팀은 AI 가 아이디어를 내는 능력은 단순히 두뇌의 크기 (파라미터 수) 나 논리 추론 능력만으로 결정되지 않는다고 말합니다.

  • 훈련 데이터의 차이: 어떤 AI 는 과학 논문이나 창의적인 글로 더 많이 훈련받았을 수 있습니다.
  • 학습 방식: 정답을 맞추는 훈련 (수렴적 사고) 과 다양한 답을 찾는 훈련 (분산적 사고) 은 서로 다른 기술을 요구합니다.

5. 이 연구가 우리에게 주는 메시지

  1. AI 는 과학자의 '조력자'가 될 수 있다: AI 가 새로운 가설을 제안하거나, 인간이 생각지 못한 연결고리를 찾아낼 수 있습니다.
  2. 맞춤형 AI 가 필요하다: 모든 일을 다 잘하는 '만능 AI'보다는, 아이디어를 낼 때는 창의적인 AI, 실행 계획을 세울 때는 논리적인 AI 처럼 각자의 강점에 맞는 AI 도구를 조합해야 합니다.
  3. 새로운 평가 기준의 필요성: 앞으로 AI 를 평가할 때는 "정답을 얼마나 잘 맞추는가"뿐만 아니라 "새로운 가능성을 얼마나 많이 제시하는가"를 함께 봐야 합니다.

요약

이 논문은 **"AI 가 지능이 높다고 해서 무조건 과학적 혁신을 이끌지는 않는다"**는 사실을 증명했습니다. 마치 IQ 가 높은 사람이 무조건 위대한 발명가는 아닌 것과 같습니다. 앞으로는 AI 에게 "정답"을 찾는 능력을 넘어, "새로운 가능성"을 상상하는 능력을 기르고 평가하는 것이 과학 발전의 핵심 열쇠가 될 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →