← 최신 논문
💬 NLP

Explaining Puzzle Solutions in Natural Language: An Exploratory Study on 6x6 Sudoku

이 탐색적 연구는 6x6 스도쿠 퍼즐에 대해 다섯 개의 대규모 언어 모델을 평가한 결과, 한 모델은 제한된 해결 능력을 보이지만 어떤 모델도 전략적 추론이나 직관적 문제 해결을 반영하는 설명을 제공하지 못한다는 점을 발견하여 효과적인 인간-AI 협업 의사결정에 대한 중대한 장벽을 부각시켰습니다.

원저자: Anirudh Maiya, Razan Alghamdi, Maria Leonor Pacheco, Ashutosh Trivedi, Fabio Somenzi

게시일 2026-04-28
📖 3 분 읽기☕ 가벼운 읽기

원저자: Anirudh Maiya, Razan Alghamdi, Maria Leonor Pacheco, Ashutosh Trivedi, Fabio Somenzi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 매우 똑똑하고 독서량이 풍부한 로봇 팀이 있다고 가정해 봅시다. 여러분은 이들에게 솔로마 (Sudoku) 라는 논리 퍼즐 (구체적으로는 더 작은 6×6 버전) 을 풀도록 요청하고, 더 중요하게는 그들이 그것을 어떻게 풀었는지 평이한 영어로 여러분에게 가르쳐 주도록 요청합니다.

이 논문은 이러한 로봇 다섯 대에 대한 성적표와 같으며, 두 가지 사항을 점검합니다:

  1. 정답을 맞혔습니까?
  2. 그들의 사고 과정을 인간이 실제로 이해할 수 있는 방식으로 설명할 수 있었습니까?

여기서는 일상적인 비유를 사용하여 연구자들이 발견한 내용을 정리해 보겠습니다.

설정: "솔로마 테스트"

연구자들은 약 2,300 개의 이러한 6×6 퍼즐을 만들었습니다. 이러한 퍼즐을 두뇌를 위한 운동실로 생각하세요. 이들은 세계에서 가장 어려운 퍼즐 (9×9 버전과 같은) 은 아니지만, 단순히 추측해서는 안 될 정도로 까다롭습니다. 숫자를 어디에 넣어야 하는지 파악하려면 논리와 규칙을 사용해야 합니다.

연구자들은 채팅 봇 뒤에 있는 AI 두뇌인 대규모 언어 모델 (LLM) 이 훌륭한 튜터 역할을 할 수 있는지 확인하고 싶었습니다. 좋은 튜터는 단순히 정답지만 주는 것이 아니라, 왜 그 행동을 했는지 이해할 수 있도록 단계를 차근차근 설명해 줍니다.

결과: "해결사" 대 "설명자"

1. 오픈소스 로봇들 ("아마추어 시간")

연구자들은 Llama, Gemma, Mistral 과 같은 네 가지 다른 오픈소스 모델을 테스트했습니다.

  • 결과: 이 로봇들은 기본적으로 테스트에 실패했습니다. 2,293 개의 퍼즐 중 전체 퍼즐을 1% 미만으로만 정확히 맞혔습니다.
  • 비유: 한 무리의 사람들에게 십자말풀이를 채우도록 요청한다고 상상해 보세요. 이 로봇들은 무작위 단어를 추측하는 사람들과 같았습니다. 운 좋게 몇 글자를 맞출 수는 있었지만, 전체 그림을 일관성 있게 유지할 수는 없었습니다. 쓰기를 시작하자마자 규칙을 잊어버렸습니다.

2. 스타 학생: OpenAI 의 "o1-preview"

그다음 OpenAI 의 o1-preview라는 특정 모델이 있었습니다.

  • 결과: 이 모델은 해결 분야에서 스타였습니다. 전체 퍼즐을 약 65% 의 확률로 정확히 맞혔습니다. 더 쉬운 퍼즐에서는 완벽했습니다 (100%).
  • 단점: 퍼즐이 어려워질수록 ("악마적" 수준) 성능이 떨어졌습니다. 수학 숙제는 잘하지만 시험이 정말 어려워지면 혼란에 빠지는 학생처럼 실수를 하기 시작했습니다.

3. 진짜 문제: "나쁜 설명자"

여기서 연구가 흥미로워집니다. 연구자들은 o1-preview 가 올바르게 푼 20 개의 퍼즐을 가져와 인간 전문가에게 단계별 설명을 요청했습니다.

  • 결과: 설명은 참담했습니다.

    • 정당화: 로봇이 실제로 숫자를 선택한 이유를 설명한 경우는 **5%**에 불과했습니다. 대부분의 경우 "여기에 5 를 넣었습니다"라고만 말했을 뿐, 왜 그런지 설명하지 않았습니다.
    • 명확성: 설명은 혼란스러웠고, 맥락을 벗어나며, 용어를 잘못 사용했습니다.
    • 교육적 가치: 이 로봇에게서 솔로마를 푸는 법을 배우려 한다면 아무것도 배울 수 없습니다. 어떤 전략도 가르치지 않았습니다.
  • 비유: 완벽한 스테이크를 요리할 수 있는 마스터 셰프를 상상해 보세요. "어떻게 그렇게 했나요?"라고 물으면,

    • 좋은 설명: "고온에서 2 분간 구운 후 온도를 낮췄습니다..."
    • o1-preview 가 한 일: 스테이크를 건네주며 "다 됐어요. 맛있어요. 스테이크입니다"라고 말했습니다. 결과는 주었지만 레시피를 공유하기를 거부했거나 (또는 할 수 없었습니다). 마술사가 마술을 완벽하게 수행했지만, 어떻게 했는지 물으면 "그냥 했어요"라고 말하고 실제 발생한 것과 맞지 않는 가짜 이유를 지어내는 것과 같았습니다.

큰 교훈

이 논문은 AI 가 일을 수행하는 것 (퍼즐을 푸는 것) 은 점점 나아지고 있지만, 일을 어떻게 했는지 이야기하는 것은 여전히 형편없다고 결론 내립니다.

저자들은 AI 가 인간, 특히 의법이나 법률과 같은 중요한 직종에서의 진정한 파트너가 되려면 자신의 작업을 명확하게 보여줄 수 있어야 한다고 주장합니다. 현재로서는 가장 똑똑한 AI 라도 시험에서 'A'를 받지만 선생님에게 답을 설명할 수 없는 학생과 같습니다.

다음은 무엇일까요?

이 논문은 AI 가 완전히 독자적으로 인간처럼 "생각"하도록 시도하기보다는, AI 를 논리 도구 (전용 수학 소프트웨어 등) 와 결합해야 한다고 제안합니다.

  • 아이디어: 논리 소프트웨어가 100% 정확한지 보장하기 위해 어렵고 엄격한 수학 계산을 수행하게 하세요. 그런 다음 AI 가 번역기 역할을 하여 그 엄격하고 지루한 수학을 인간에게 친숙하고 이해하기 쉬운 이야기로 바꾸게 하세요.

간단히 말해: AI 는 퍼즐을 풀 수는 있지만, 아직 여러분에게 푸는 법을 가르칠 수는 없습니다. 훌륭한 노동자이지만, terrible 한 교사입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →