← 최신 논문
💬 NLP

When LLMs Stop Following Steps: A Diagnostic Study of Procedural Execution in Language Models

본 논문은 대규모 언어 모델이 짧은 절차적 작업에서는 높은 정확도를 달성하지만, 복잡성이 증가함에 따라 단계별 알고리즘을 충실히 실행하는 능력은 현저히 저하된다는 것을 보여주는 진단용 벤치마크를 제시하며, 이는 강력한 벤치마크 성능이 종종 지시 따르기에서의 상당한 약점을 가리고 있음을 드러냅니다.

원저자: Sailesh Panda, Pritam Kadasi, Abhishek Upperwal, Mayank Singh

게시일 2026-05-04
📖 3 분 읽기☕ 가벼운 읽기

원저자: Sailesh Panda, Pritam Kadasi, Abhishek Upperwal, Mayank Singh

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

다음은 "LLM 이 단계를 따르는 것을 멈출 때"라는 논문에 대한 설명으로, 쉬운 언어와 창의적인 비유를 사용하여 작성되었습니다.

핵심 아이디어: "레시피" 테스트

상상해 보세요. 요리사에게 케이크를 굽는 매우 구체적이고 단계별 레시피를 주었다고 가정해 봅시다. 레시피에는 이렇게 적혀 있습니다: "밀가루와 설탕을 섞으세요. 그다음 계란을 넣으세요. 그다음 10 초간 저으세요. 그다음 굽으세요."

당신은 요리사가 모든 지시를 순서대로 따를 것이라고 기대할 수 있습니다. 하지만 만약 요리사가 단계를 따르는 대신, 케이크가 보통 어떤 맛인지 추측해서 결과를 건네준다면 어떨까요? 아니면 중간까지 진행하다가 마지막 세 단계를 잊어버리고 그냥 "여기 케이크가 있습니다"라고 말한다면 어떨까요?

이 논문은 연구자들이 14 개의 서로 다른 "요리사" AI 모델 (대규모 언어 모델) 에게 수천 개의 이러한 구체적인 레시피를 제공한 거대한 테스트 주방과 같습니다. 레시피는 간단한 수학 문제였지만, 길고 까다롭게 설계되었습니다. 목표는 AI 가 어려운 수학 문제를 풀 수 있는지 보는 것이 아니라, 시작부터 끝까지 지시를 신실하게 따르는지 확인하는 것이었습니다.

설정: "끝없는 계단"

연구자들은 작업을 더 어렵게 만드는 두 가지 주요 방식으로 특수한 테스트를 구성했습니다.

  1. 계단의 길이: 그들은 AI 에게 5 단계에서 95 단계까지 다양한 길이의 레시피를 주었습니다. 계단을 상상해 보세요. 5 단계 계단은 오르기 쉽지만, 95 단계 계단은 지칩니다.
  2. "되돌아보기" 규칙: 일부 레시피에서는 10 단계가 단순히 9 단계의 결과를 사용하는 것이 아니었습니다. "되돌아가서 3 단계의 결과를 사용하세요"라고 말할 수도 있었습니다. 이는 등산객에게 "한 걸음 앞으로 나아가고, 지나간 세 번째 나무로 돌아가 그곳에서 돌을 주우세요"라고 말하는 것과 같습니다. 이는 AI 가 과거의 매우 먼 시점의 것을 기억하도록 강요합니다.

그들이 발견한 것: "기억 상실"

결과는 놀라웠습니다. 수학은 단순한 것 (덧셈, 뺄셈, 곱셈, 나눗셈) 이었지만, 레시피가 길어질수록 AI 들의 성능은 점점 더 나빠졌습니다.

  • 하락: 짧은 5 단계 레시피에서는 AI 들이 약 **61%**의 확률로 정답을 맞췄습니다. 하지만 긴 95 단계 레시피에서는 성공률이 **20%**로 급락했습니다.
  • "되돌아보기" 문제: AI 가 과거의 단계 (예: 3 단계) 를 기억해야 할 때, 그 성능은 더욱 떨어졌습니다. 마치 AI 가 이야기 속에서 자신이 어디에 있는지 혼란스러워한 것처럼 보였습니다.

AI 들이 실패한 방식: "속임수"를 쓰는 요리사들

연구자들은 최종 답변만 본 것이 아니라, AI 가 문제를 해결하려는 방식을 지켜보았습니다. 그들은 AI 들이 실제로 작업을 수행하지 않고 종종 여러 가지 재미있는 방식으로 "속임수"를 쓰거나 "우회"하려 했음을 발견했습니다.

  1. "조기 종료" (미수행): 이것이 가장 흔한 실패였습니다. AI 는 레시피를 시작하고 몇 단계를 수행하다가 지루해하거나 혼란스러워지면, 마치 모든 것을 끝낸 것처럼 바로 끝으로 뛰어갔습니다. 이는 에세이의 첫 문장을 쓴 후 중간 부분을 생략하고 결론으로 건너뛰는 학생과 같습니다.
  2. "환각"된 단계: 때로는 AI 가 레시피에 전혀 없던 추가 단계를 만들어내기도 했습니다. 이는 레시피에 그런 지시가 전혀 없는데도 요리사가 "유니콘 가루를 뿌리세요"라고 추가하는 것과 같습니다.
  3. "자기 수정" 함정: 때로는 AI 가 답을 틀렸다는 것을 깨닫고 텍스트 후반부에 이를 수정하려 했습니다. 하지만 수정할 때는 이미 최종 결과를 망쳐놓은 후였습니다.
  4. "패턴 매처": 일부 AI 들은 수학을 수행하는 대신 숫자의 모양을 바탕으로 답을 추측하는 것처럼 보였으며, 실제로 단계를 따르지는 않았습니다.

주요 결론

이 논문은 AI 가 "타당한" 최종 답변을 제공한다고 해서, 실제로 작업을 수행한 것은 아니라고 결론 내립니다.

시험을 치르는 학생이라고 생각해 보세요. 그들이 정답을 맞췄다면, 그들이 공부했다고 생각할 수 있습니다. 하지만 이 논문은 때로는 그들이 문제를 단계별로 실제로 해결하는 대신, 추측하거나 이전 시험의 답을 기억하고 있을 뿐임을 보여줍니다.

간단히 말해: 현재의 AI 모델은 똑똑하게 들리고 최종 결과를 제공하는 데 뛰어나지만, 쓰여진 대로 길고 지루한 지시 목록을 정확하게 따르는 신뢰할 수 있는 로봇처럼 행동하는 데는 어려움을 겪습니다. 지시가 너무 길어지거나 과거의 정보를 너무 많이 기억해야 할 때, AI 는 방향을 잃고 규칙을 따르는 것을 멈추는 경향이 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →