← 최신 논문
💬 NLP

CresOWLve: Benchmarking Creative Problem-Solving Over Real-World Knowledge

이 논문은 기존 벤치마크의 한계를 극복하기 위해 실제 세계 지식을 기반으로 한 창의적 문제 해결 평가 기준인 CresOWLve 를 제안하고, 최신 대형 언어 모델들이 사실적 지식 회수에는 능숙하지만 이를 창의적으로 연결하여 해결책을 도출하는 데에는 여전히 큰 어려움을 겪고 있음을 규명합니다.

원저자: Mete Ismayilzada, Renqing Cuomao, Daniil Yurshevich, Anna Sotnikova, Lonneke van der Plas, Antoine Bosselut

게시일 2026-04-07
📖 3 분 읽기☕ 가벼운 읽기

원저자: Mete Ismayilzada, Renqing Cuomao, Daniil Yurshevich, Anna Sotnikova, Lonneke van der Plas, Antoine Bosselut

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 **"CRESOWLVE"**라는 이름의 새로운 시험지를 소개하고, 최신 인공지능 (LLM) 이 이 시험지를 얼마나 잘 풀었는지 분석한 연구입니다.

비유하자면, 이 연구는 **"인공지능이 '지식'을 얼마나 많이 가지고 있는지"가 아니라, "그 지식을 어떻게 '요리'해서 새로운 요리를 만들어낼 수 있는지"**를 테스트하는 것입니다.

다음은 이 논문의 핵심 내용을 일상적인 언어와 비유로 설명한 것입니다.


1. 왜 이 시험지가 필요했을까요? (문제 제기)

지금까지 인공지능을 테스트할 때는 주로 **"암기력"**이나 **"논리력"**을 확인하는 문제를 냈습니다.

  • 기존 시험: "파리의 수도는 어디인가요?" (단순 암기) 또는 "2+2 는 몇인가요?" (단순 논리)
  • 한계: 이런 문제는 인공지능이 책 내용을 다 외우고 있다면 쉽게 풀 수 있습니다. 하지만 실제 인간은 **서로 전혀 상관없어 보이는 두 가지 정보를 연결해서 새로운 통찰을 얻는 능력 (창의적 문제 해결)**이 필요합니다.

예를 들어, "비행기 날개와 물고기의 지느러미는 어떻게 비슷할까?"라고 물었을 때, 단순히 "둘 다 물/공기에서 움직인다"는 사실만 아는 게 아니라, 유체역학이라는 공통 원리를 찾아내어 연결하는 능력이 필요합니다. 기존 시험지는 이런 '연결하는 능력'을 제대로 못 봤습니다.

2. CRESOWLVE 란 무엇인가요? (해결책)

연구팀은 러시아의 유명한 지능 게임 **"무엇? 어디서? 언제? (What? Where? When?)"**에서 문제를 가져와 새로운 시험지를 만들었습니다.

  • 비유: 이 게임은 마치 **"지식 보물상자"**입니다. 상자에는 역사, 문학, 과학, 예술 등 온갖 분야의 보물 (지식) 이 들어있는데, 문제는 이 보물들을 서로 다른 방식으로 조합해서 하나의 열쇠를 만들어내는 것입니다.
  • 특징:
    • 단순히 사실을 아는 게 아니라, 비유 (Metaphor), 유머 (Joke), **은유 (Analogy)**를 이해해야 합니다.
    • 예를 들어, "시인 사이프 사라이는 1.5 세기 전에 코페르니쿠스를 선구자로 여겼다. 왜?"라는 질문은 단순히 연도를 외우는 게 아니라, 시의 비유와 천문학 지식을 연결해야 풀립니다.

3. 인공지능은 이 시험지를 잘 풀었나요? (결과)

최고급 인공지능 모델들 (GPT-4, Gemini, Qwen 등) 을 이 시험지에 도전시켰습니다. 결과는 생각보다 안 좋았습니다.

  • 현실: 인공지능은 **사실 (Fact)**을 물어보면 80~90% 를 맞췄지만, **창의적 연결 (Creative Connection)**이 필요한 문제에서는 50% 이하로 떨어졌습니다.
  • 비유: 인공지능은 **"전 세계 도서관의 모든 책을 다 읽은 도서관 사서"**입니다. 하지만 사서에게 "이 책의 내용과 저 책의 내용을 섞어서 새로운 시를 써봐"라고 하면, 사서는 책 내용을 다 알고 있음에도 불구하고 그걸 섞어내는 '요리법'을 몰라 실패합니다.
  • 핵심 발견: 인공지능이 실패한 이유는 '지식이 부족해서'가 아니라, 알고 있는 지식을 창의적으로 연결하는 '접착제'가 부족해서였습니다.

4. '생각하는' 인공지능은 더 잘했나요?

최근 등장한 **'생각하는 모델 (Thinking Models)'**은 답을 바로 말하기 전에 잠시 머릿속으로 고민하는 시간을 가집니다.

  • 결과: 이 모델들은 일반 모델보다 훨씬 잘 풀었습니다.
  • 비유: 일반 모델이 **"순간적인 직감으로 대답하는 학생"**이라면, 생각하는 모델은 **"시험지 문제를 꼼꼼히 읽고, 관련 지식을 찾아보고, 논리적으로 연결해 보는 성실한 학생"**입니다. 하지만 여전히 인간 전문가 수준에는 미치지 못했습니다.

5. 인공지능이 틀린 이유는 무엇인가요? (오류 분석)

연구팀은 인공지능이 왜 틀렸는지 자세히 분석했습니다. 가장 큰 원인은 다음과 같습니다.

  1. 창의적 연결 실패 (Missing Creative Connection): 정답에 필요한 지식은 다 알고 있었지만, "아! 이 두 가지가 이렇게 연결되는구나!"라는 **순간적인 통찰 (Aha moment)**을 놓쳤습니다.
  2. 과도한 생각 (Overthinking): 정답을 찾았을 때, "아니, 이건 너무 단순한데? 다른 뜻이 있겠지?"라고 생각이 너무 많아져서 오히려 틀린 답을 고르는 경우가 많았습니다.
  3. 비유와 은유 이해 실패: 시나 유머에 담긴 숨은 뜻을 이해하지 못해, 글자 그대로만 해석했습니다.

6. 결론: 인공지능에게 남은 과제

이 연구는 **"인공지능이 지식을 많이 아는 것은 중요하지만, 그 지식을 창의적으로 섞어서 새로운 통찰을 만들어내는 능력은 아직 인간에 비해 부족하다"**는 것을 보여줍니다.

  • 마무리 비유: 인공지능은 이제까지 **"지식의 저장고"**로서는 훌륭했지만, **"지식을 요리하는 셰프"**로서는 아직 요리 실력이 부족합니다. 앞으로 인공지능이 진짜로 창의적인 일을 하려면, 단순히 책을 더 많이 읽는 것뿐만 아니라, 서로 다른 아이디어를 연결하는 '요리법'을 배워야 합니다.

이 CRESOWLVE 시험지는 바로 그 '요리 실력'을 측정하고, 인공지능이 더 발전할 수 있도록 돕기 위해 만들어진 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →