← 최신 논문
💬 NLP

LLMs Lean on Priors, Not Programming Language Semantics

이 논문은 PLSemanticsBench를 도입하여, 현대의 거대 언어 모델들이 의미론적 변이, 새로운 심볼, 그리고 긴 실행 추적에 직면했을 때 성능이 급격히 저하되는 것을 근거로, 이들이 제공된 형식적 프로그램 의미론에 체계적으로 조건화하기보다는 주로 사전 학습된 어휘 연관성에 의존한다는 점을 입증한다.

원저자: Aditya Thimmaiah, Jiyang Zhang, Jayanth Srinivasa, Junyi Jessy Li, Milos Gligoric

게시일 2026-06-01
📖 4 분 읽기☕ 가벼운 읽기

원저자: Aditya Thimmaiah, Jiyang Zhang, Jayanth Srinivasa, Junyi Jessy Li, Milos Gligoric

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

핵심 질문: LLM은 사고하는가, 아니면 그저 추측하는가?

당신이 학생에게 새로운 보드게임 하는 법을 가르치고 있다고 상상해 보세요. 당신은 규칙서를 건네며 이렇게 말합니다. "이 게임에서는 주사위 6이 나오면 뒤로 한 칸 가야 해."

규칙을 이해하는 똑똑한 학생이라면, 이 특정 게임을 한 번도 해본 적이 없더라도 6이 나왔을 때 즉시 뒤로 갈 것입니다.

하지만 수천 판의 다른 보드게임을 플레이하며 패턴을 암기한 학생은 머뭇거릴 수 있습니다. 그들은 "잠깐, 모노폴리나 클루에서는 6이 나오면 보통 앞으로 가는 거였는데. 그냥 평소처럼 앞으로 가야겠다"라고 생각할 것입니다. 이들은 방금 배운 특정 규칙보다는 자신의 과거 경험(그들의 "사전 지식/Priors")에 의존하고 있는 것입니다.

이 논문은 다음과 같은 질문을 던집니다. 대규모 언어 모델(LLM)은 새로운 규칙을 따르는 똑똑한 학생처럼 행동할까요, 아니면 새로운 규칙을 무시하고 패턴을 암기하는 학생처럼 행동할까요?

실험: "마법의" 프로그래밍 언어

이를 테스트하기 위해 연구진은 **C⋆**라고 불리는 특별하고 가벼운 프로그래밍 언어를 만들었습니다. 이 언어를 하나의 빈 캔버스라고 생각하면 됩니다.

그 후 연구진은 세 가지 다른 시나리오를 통해 까다로운 테스트를 설정했습니다.

  1. 표준 테스트 (The Standard Test): 모델에게 코드와 일반적인 규칙(예: +는 더하기를 의미함)을 주었습니다. 이것은 일반적인 체스 게임을 하는 것과 같습니다.
  2. 교체 테스트 (KeywordSwap): 코드는 똑같이 유지하되, 규칙서의 기호 의미를 서로 바꿨습니다.
    • 트릭: 모델에게 "이 버전에서는 + 기호가 사실 뺄셈을 의미한다"라고 알려주었습니다.
    • 목표: 만약 모델이 진정으로 규칙을 따르고 있다면, 뺄셈을 해야 합니다. 만약 모델이 기억에 의존하고 있다면, +는 더하기라는 것에 익숙하기 때문에 여전히 더하기를 할 것입니다.
  3. 외계인 테스트 (KeywordObf): 모든 익숙한 기호를 이상하고 외계인처럼 보이는 문자(예: 고대 잊혀진 문자의 기호들)로 교체하고, 이 외계 기호들이 무엇을 의미하는지 정의한 규칙서를 주었습니다.
    • 목표: 모델은 이런 기호를 본 적이 없기 때문에, 오직 새로운 규칙서에만 전적으로 의존해야 합니다. 기존의 +가 무엇을 하는지에 대한 기억을 이용해 속임수를 쓸 수 없게 만든 것입니다.

결과: "패턴 암기자"들의 승리 (그리고 패배)

연구진은 현존하는 가장 똑똑한 11개의 AI 모델을 테스트했습니다. 결과는 다음과 같았습니다.

1. 규칙이 정상적일 때:
모델들은 아주 잘 해냈습니다! 코드의 결과를 높은 정확도(최대 90%)로 예측했습니다. 마치 천재처럼 보였습니다.

2. 규칙이 바뀌었을 때 (더하기가 뺄셈이 된 경우):
모델들의 성능이 폭락했습니다. 정확도가 40%에서 60%까지 떨어졌습니다.

  • 비유: 이것은 수백만 개의 버거를 만들어본 요리사와 같습니다. 당신이 "오늘 우리는 버거를 만들 건데, 빵 대신 감자를 사용할 거야"라고 말하는 것과 같습니다. 진정한 요리사라면 감자를 사용할 것입니다. 하지만 이 모델들은 "버거 = 빵"이라는 공식에 너무 익숙해져 있었기 때문에 계속 빵을 사용하려고 했습니다. 이들은 새로운 지침을 따르기 위해 자신의 근육 기억(습관)을 억제하지 못했습니다.

3. 규칙이 외계어일 때 (KeywordObf):
모델들은 교체 테스트(Swap Test)보다는 조금 더 나은 성과를 보였지만, 여전히 크게 고전했습니다. 그들은 새로운 규칙서를 완전히 신뢰하지 못했습니다.

4. 장기 실행 (복잡한 루프):
코드가 길고 복렴해질 때(여러 장의 챕터와 루프가 있는 이야기처럼), 거의 모든 모델이 실패했습니다. 가장 "똑똑한" 모델조차 긴 복잡한 시퀀스의 약 35% 정도만 맞출 수 있었습니다. 그들은 이야기 중간에 길을 잃고 자신이 따라야 할 규칙을 잊어버렸습니다.

"추론" 모델 vs "비추론" 모델

연구진은 단계별로 생각하도록 설계된 모델(이를 "추론(Reasoning)" 모델이라 부름)도 테스트했습니다.

  • 좋은 소식: 이 모델들은 일반 모델보다 새로운 규칙을 더 잘 따랐습니다.
  • 나쁜 소식: 하지만 최고의 "추론" 모델조차 규칙이 바뀌었을 때는 실패했습니다. 그들은 여전히 이전에 보았던 것들에 너무 많이 의존했습니다. 짧은 시간 동안은 규칙을 따를 수 있었지만, 규칙이 이상해지거나 작업이 길어지자마자 다시 예전의 습관으로 돌아갔습니다.

"생각의 사슬" (자기 자신에게 말하기)

연구진은 모델에게 답을 내놓기 전에 자신의 생각을 소리 내어 설명하도록 요청하는 "생각의 사슬(Chain of Thought)" 기법을 시도했습니다.

  • 결과: 이 기법은 모델이 정상적인 과제를 수행할 때는 도움이 되었습니다. 하지만 규칙이 바뀌었을 때(예: +가 뺄셈을 의미할 때)는 "소리 내어 말하기"가 도움이 되지 않았습니다. 모델들은 내부의 "근육 기억"이 너무 강력했기 때문에 여전히 수학 계산을 틀렸습니다.

결론

이 논문은 현재의 AI 모델들이 당신이 준 규칙에 기반하여 진정으로 "추론"하는 것이 아니다라고 결론짓습니다. 대신, 그들은 훈련 데이터에서 본 것에 크게 의존하는 **통계적 추측가(Statistical Guessers)**입니다.

  • 비유: 연극 대본을 통째로 외운 배우를 상상해 보세요. 만약 당신이 "오늘은 즉흥 연기를 할 건데, '안녕'이라는 단어는 사실 '잘 가'라는 뜻이야"라고 말한다면, 그들은 익숙한 대로 여전히 "안녕"이라고 말할 가능성이 높습니다. 그들은 새로운 의미를 실제로 처리하는 것이 아니라, 기억 속에서 가장 확률이 높은 단어를 읊고 있는 것뿐입니다.

요약하자면: 만약 당신이 AI에게 완전히 새로운 규칙 세트(새로운 프로그래밍 언어나 새로운 법률 계약서 등)를 따르게 하고 싶다면, 현재의 모델들은 신뢰할 수 없습니다. 그들은 당신의 새로운 규칙을 무시하고, 과거의 훈련을 바탕으로 당신이 아마도 의도했을 법한 행동을 할 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →