← 최신 논문
💬 NLP

RELIC: Evaluating Complex Reasoning via the Recognition of Languages In-Context

이 논문은 컨텍스트 내에서의 맥락 자유 언어 인식 능력을 테스트함으로써 대규모 언어 모델의 복잡한 추론을 평가하는 RELIC 프레임워크를 제시하며, 이는 심지어 최첨단 모델조차 작업 난이도에 따라 추론 연산량을 확장하지 못하고 복잡성이 증가함에 따라 알고리즘적 추론에서 추측으로 전환하는 경향이 있음을 보여줍니다.

원저자: Jackson Petty, Michael Y. Hu, Wentao Wang, Shauli Ravfogel, William Merrill, Tal Linzen

게시일 2026-04-29
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jackson Petty, Michael Y. Hu, Wentao Wang, Shauli Ravfogel, William Merrill, Tal Linzen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매우 똑똑하고 독서량이 많은 조수를 고용하여 퍼즐을 풀게 한다고 상상해 보세요. 당신은 그들에게 새로운 규칙집 (문법) 과 특정 문장 (문자열) 을 제공합니다. 당신의 질문은 간단합니다. "이 문장이 책의 규칙을 따르고 있나요?"

이것은 바로 RELIC 논문이 다루는 내용입니다. 이는 ChatGPT 와 같은 도구의 배경에 있는 AI 두뇌인 대규모 언어 모델 (LLM) 이 즉흥적으로 새로운 지시를 받았을 때, 복잡하고 다단계적인 문제를 실제로 어떻게 '생각'해 내는지 테스트하는 새로운 방법입니다.

다음은 논문의 발견 사항을 간단한 비유로 정리한 것입니다:

1. 테스트: "규칙집 퍼즐"

연구자들은 AI 가 문법 탐정처럼 행동해야 하는 게임을 만들었습니다.

  • 설정: 그들은 수천 개의 고유하고 가상의 규칙집을 생성했습니다. 이들은 영어나 스페인어가 아니라 추상적인 규칙 집합 (예: "A 는 반드시 B 뒤에 와야 한다" 또는 "C 는 D 로 변한다"와 같은 규칙) 입니다.
  • 과제: AI 는 규칙집과 무작위 기호로 구성된 문장 (예: t43 t51 t66) 을 봅니다. 그리고 "예" (이 문장은 규칙을 따릅니다) 또는 "아니요" (규칙을 위반합니다) 라고 말해야 합니다.
  • 반전: 그들은 규칙집을 더 크게 만들고 문장을 더 길게 만들어 퍼즐을 더 어렵게 만듭니다.

2. 기대: "산 오르기" 비유

이러한 퍼즐을 푸는 것은 산을 오르는 것과 같습니다.

  • 작은 산 (쉬운 퍼즐): 규칙집이 작고 문장이 짧다면, AI 는 쉽게 정상에 도달할 수 있습니다. 논리적 지도 (알고리즘) 를 사용하여 모든 단계를 확인합니다.
  • 큰 산 (어려운 퍼즐): 규칙집이 거대해지고 문장이 길어질수록 산은 더 가파르게 됩니다. 이를 올바르게 해결하려면 AI 는 모든 가능성을 확인하기 위해 더 많은 정신적 에너지 (더 많은 '생각 토큰') 를 사용해야 합니다. 이는 더 높은 봉우리를 오르기 위해 더 큰 배낭과 더 많은 물이 필요한 것과 같습니다.

3. 발견: "조용한 퇴사"

이것은 논문의 가장 놀랍고 중요한 발견입니다. 연구자들은 퍼즐이 어려워질수록 AI 가 더 많은 사고력을 사용하여 "더 열심히 노력할 것"이라고 예상했습니다.

그 대신, AI 는 '조용히 퇴사'하기 시작했습니다.

  • 비유: 한 직원이 간단한 수학 문제를 풀도록 요청받았다고 상상해 보세요. 그들은 계산기를 꺼내 작업을 수행합니다. 하지만 거대하고 복잡한 방정식을 주면, 슈퍼 계산기를 꺼내 더 오래 일하는 대신 추측하기만 합니다. 그들은 수학을 하려고 노력하는 것을 멈추고 직감에 기반한 답을 만들어내기 시작합니다.
  • 증거:
    • 퍼즐이 어려워졌을 때, AI 는 더 많은 사고 시간을 사용하지 않았습니다. 오히려 사용했습니다.
    • AI 는 가능성의 나무를 구축하는 것과 같은 논리적 단계별 추론을 멈추고 나쁜 단서 (휴리스틱) 에 의존하기 시작했습니다.
    • 심지어 가장 진보된 '추론' 모델들 (깊게 생각하도록 설계된 모델들) 도 이를 행했습니다. 그들은 좋은 계획으로 시작하지만, 압도당하면 조용히 추측으로 전환합니다.

4. 결과: "틀린 이유로 맞은 답"

논문에 따르면 AI 가 '조용히 퇴사'할 때, 종종 우연히 정답을 맞추지만 그 이유는 완전히 틀립니다.

  • 예시: AI 는 규칙이 실제로 긴 문장을 허용함에도 불구하고 문장이 "너무 길다"는 이유만으로 문장을 거부할 수 있습니다. '아니요'라는 답을 올바르게 얻었지만, 그 논리는 완전히 깨져 있습니다.
  • 문제점: AI 의 사고 과정을 볼 수 없다면 (많은 상업용 모델의 경우 사실입니다), 정답을 맞췄기 때문에 AI 가 똑똑하다고 생각할 수 있습니다. 하지만 실제로는 추측일 뿐이며, 다음 어려운 문제에서는 실패할 것입니다.

5. 결론: 부서지기 쉬운 두뇌

논문의 결론은 현재 AI 모델이 부서지기 쉽다는 것입니다.

  • 그들은 작업이 쉬울 때 그 아이디어를 이해합니다.
  • 하지만 문제의 난이도에 맞춰 노력을 확장할 수는 없습니다.
  • "이건 어렵다, 더 많은 시간을 써야겠다"라고 말하는 신뢰할 수 있는 '내부 엔진'이 없습니다. 대신 그들은 포기하고 추측합니다.

요약

이 논문은 AI 추론을 위한 스트레스 테스트로 RELIC을 소개합니다. 이는 오늘날 가장 똑똑한 AI 모델들조차 쉬운 숙제는 풀 수 있지만, 어려운 시험에 직면하면 문제를 해결하려고 노력하는 것을 멈추고 무작위로 오답란을 채우는 학생들과 같음을 보여줍니다. 그들은 어려운 작업에서 '조용히 퇴사'하여, 실제로 규칙을 따르고 추측하는 것이 아니라 복잡한 현실 세계의 추론이 필요할 때 신뢰할 수 없게 만듭니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →