← 최신 논문
🤖 machine learning

Measuring in-context algorithmic reasoning in language models against an exact Bayes-optimal standard

이 논문은 튜링 완전한 기계로부터 유도된 정확한 베이즈 최적 표준을 사용하는 벤치마크인 F-ICL을 도입하여, 거대 언어 모델들이 높은 정확도에도 불구하고 진정한 알고리즘적 추론을 수행하는 대신 저차 통계에 의존하며 이론적 최적치와 크게 괴리되는 비단조적 업데이트 동작을 보인다는 점을 밝혀낸다.

원저자: Hector Zenil, Luan Ozelim

게시일 2026-08-04
📖 5 분 읽기🧠 심층 분석

원저자: Hector Zenil, Luan Ozelim

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 퍼즐을 푸는 법을 가르치려 한다고 상상해 보세요. 당신은 몇 가지 예시를 보여줍니다. "내가 여기에 빨간 블록을 놓으면, 저기에 파란 블록이 나타나." 그러고 나서 로봇에게 다음에 어떤 일이 일어날지 예측하라고 묻습니다. 때때로 로봇은 정답을 맞히지만, 이것이 정말로 퍼즐의 규칙을 '생각'하고 있는 것일까요, 아니면 그저 단어들이 보통 어떻게 어울리는지에 따라 추측하는 것일까요? 이것이 오늘날 우리가 사용하는 초지능형 AI 챗봇인 현대 "대규모 언어 모델(LLM)" 뒤에 숨겨진 거대한 미스터리입니다. 과학자들은 이를 "인컨텍스트 러닝(in-context learning)"이라고 부릅니다. 즉, 프롬프트에 담긴 몇 가지 예시를 읽는 것만으로 새로운 과업을 학습하는 능력입니다. 문제는 우리가 로봇이 진정으로 추론을 하고 있는 것인지, 아니면 단순히 패턴 매칭을 하고 있는 것인지를 측정할 완벽한 자를 가지고 있지 않다는 점입니다. 보통 우리는 한 로봇을 다른 로봇이나 인간과 비교할 수 있을 뿐, 무엇이 '완벽한' 정답인지에 대한 "신의 관점(God's eye view)"은 알지 못합니다.

이를 해결하기 위해, 이 논문의 저자들은 특별하고 작으며 완벽하게 통제된 우주를 구축했습니다. 그들은 F-ICL이라는 벤치마크를 만들었습니다. 이것은 특정 유형의 이진 퍼즐(0과 1만을 사용하는)을 풀 수 있는 모든 가능한 단순 컴퓨터 프로그램의 거대하고 철저한 도서관이라고 생각하면 됩니다. 그들은 이 15억 개의 작은 프로그램들을 하나하나 모두 나열했기 때문에, 어떤 퍼즐에 대해서도 수학적으로 완상적인 정답을 계산할 수 있습니다. 이 완벽한 정답을 "베이즈 최적(Bayes-optimal)" 솔루션이라고 부릅니다. 이것은 황금 표준입니다. 즉, 주어진 증거를 바탕으로 기계가 내릴 수 있는 절대적인 최선의 추측입니다. 이제 드디어 우리는 실제 AI 모델을 이 황금 표준에 대조하여, 모델이 얼마나 벗어나 있는지 정확히 확인할 수 있습니다. 이는 마치 도시의 완벽한 지도를 가지고 나서, GPS 앱이 실제로 어제의 교통 패턴을 보고 추측하는 것인지, 아니면 정말로 최단 경로를 안내하고 있는지 확인하는 것과 같습니다.

거대한 추론의 간극

연구진은 오픈 소스 프로젝트부터 최고 기술 연구소의 가장 진보된 "프런티어" 시스템에 이르기까지 105개의 다양한 AI 모델을 선발하여 F-ICL 테스트를 통과시켰습니다. 그들은 이 모델들이 새로운 증거가 들어옴에 따라 논리적으로 신념을 업데이트하는 완벽한 베이즈 추론자처럼 행동할 수 있는지 알고 싶었습니다.

여기 놀라운 반전이 있습니다. 모델들은 정답을 맞히는 데는 뛰어나지만, 완벽한 기계처럼 추론하는 데는 형편없습니다.

일부 모델이 최종 정답을 최대 92%까지 맞혔음에도 불구하고, 그들의 내부 "추측 분포(guessing distribution)"(다양한 가능성에 무게를 두는 방식)는 종종 단순한 무작위 추측기보다도 나빴습니다. 사실, 46개 모델 중 45개가 "키스트로크 참조(keystroke reference)"보다 성능이 낮았습니다. 원숭이가 키보드를 무작위로 두드리는 것을 상상해 보세요. 그 무작위 원숭이가 만들어낸 확률 분포가 대부분의 첨단 AI 모델보다 수학적 진리에 더 가까웠습니다. 모델들은 단순히 약간 틀린 것이 아니라, 근본적인 논리에 대해 확신을 가지고 틀리고 있었습니다.

"과잉 확신(Over-Commitment)" 결함

가장 흥미롭고 드러내는 바가 많은 발견 중 하나는, 단 하나의 예시를 주었을 때 모델들이 어떻게 행동하는가 하는 점입니다. 완벽한 추론자라면 새로운 단서가 생길 때마다 조금씩 더 나아질 것입니다. 하지만 이 AI 모델들은 새로운 단서를 하나 본 직후에 오히려 성능이 떨어졌다가, 그 후에야 다시 좋아지기 시작하는 경우가 많았습니다.

이는 마치 탐정에게 범죄에 관한 단서 하나를 보여주었더니, 신중하게 생각하는 대신 즉시 "범인은 이 사람이야!"라고 외치며 엉뚱한 용의자에게 달려드는 것과 같습니다. 몇 가지 단서를 더 보여주고 나서야 비로소 탐정이 천천히 물러나 다시 증거를 살피기 시작하는 상황 말입니다. 연구 결과, 81번의 모델 실행 중 69번이 이러한 실수를 저질렀으며, 너무 빨리 결론을 내리는 경향을 보였습니다. 그들은 전체 그림을 보기 위해 기다리는 대신, 눈앞의 첫 번째 데이터에 "과잉 확신"하여 성급하게 결론을 내리고 있었습니다.

크기가 논리를 해결하지 못한다

더 크고 똑똑한 모델이라면 이 문제를 해결할 것이라고 생각할 수도 있습니다. 연구진은 0.8억 개의 파라미터를 가진 아주 작은 모델부터 6,750억 개의 파라미터를 가진 거대한 모델까지, 수십억 개의 파라미터(AI의 "뇌 크기")를 가진 모델들을 테스트했습니다. 결과는 어땠을까요? 모델이 커질수록 정답을 맞히는 능력은 좋아졌지만, 추론 능력은 전혀 개선되지 않았습니다.

모델의 행동과 완벽한 수학적 표준 사이의 간극은 모델이 아무리 거대해지더라도 똑같이 유지되었습니다. 모델이 10억 개의 파라미터를 가졌든 6,000억 개의 파라미터를 가졌든, 여전히 완벽한 "베이즈 최적" 논리에 부합하는 데 어려움을 겪었습니다. 이는 마치 학생에게 점점 더 큰 도서관(더 많은 데이터)을 제공했지만, 학생은 여전히 지도를 사용하는 법을 배우지 못한 채 책 제목을 암기하는 데만 능숙해진 것과 같습니다.

"안전성"과 "학습"의 함정

논문은 또한 모델이 "사후 학습(post-trained)"될 때, 즉 인간이 모델을 더 도움이 되거나, 지시를 잘 따르거나, "안전"하도록 미세 조정할 때 어떤 일이 일어나는지도 살펴보았습니다. 놀랍게도, 이러한 학습은 추론의 간극을 더 넓게 만들었습니다.

모델이 "지시 이행(instruction-following)"을 하도록 또는 더 "생각"하도록 튜닝되었을 때, 모델은 오히려 완벽한 논리적 표준에서 더 멀어졌습니다. 모델에게 예의 바르게 행동하거나 특정 채팅 형식을 따르도록 가르치는 것이, 오히려 문제의 가공되지 않은 논리적 구조를 무시하도록 가르치는 것일 수도 있습니다. 이는 체스 선수에게 경기 후 항상 "즐거운 게임이었습니다"라고 말하도록 가르치는 것과 같습니다. 그러면 더 정중해질 수는 있겠지만, 실제 게임의 규칙은 잊어버릴 수도 있습니다.

전선(Frontier)은 정체되어 있다

연구진은 지난 2년 동안 출시된 가장 크고 비싼 최신 모델들도 살펴보았습니다. 그 결과, 완벽한 논리적 표준에 대한 충실도는 전혀 개선되지 않았음을 발견했습니다. 최신 모델들은 과거의 모델들만큼이나 완벽한 추론자로부터 멀어져 있습니다. 사실, 테스트한 가장 오래된 모델(2024년 5월 모델)이 논리적 표준에 가장 충실했으며, 최신 모델들은 오히려 약간 더 나빴습니다.

"종결(Termination)"의 문제

모델들이 낮은 점수를 받은 구체적인 이유 중 하나는 문장의 끝을 처리하는 방식이었습니다. 완벽한 수학적 모델은 0과 1의 시퀀스가 언제 멈춰야 하는지 정확히 알고 있습니다. 그러나 AI 모델들은 이 부분에서 매우 취약했습니다. 모델들은 시퀀스가 끝나야 할 때 끝난다고 판단하지 못하거나, 혹은 끝나지 말아야 할 때 계속 이어가는 실수를 자주 범했습니다. 이 특정 오류가 전체 실수의 거의 90%를 차지했습니다. 이는 모델들이 이야기를 쓰는 데는 뛰어나지만, 문장의 마침표를 찍는 법은 모르는 것과 같습니다.

결론

이 논문은 이러한 AI 모델들이 패턴 완성(pattern completion)—즉, 이전에 보았던 것에 기반해 가장 가능성 높은 다음 단어를 찾는 것—에는 매우 뛰어나지만, 아직 **진정한 알고리즘적 추론(algorithmic reasoning)**을 하고 있는 것은 아니라고 결론짓습니다. 그들은 규칙의 정신적 모델을 구축하는 것이 아니라, 단지 패턴을 엮어내고 있을 뿐입니다.

저자들은 다른 과학자들이 계속해서 테스트할 수 있도록 이 벤치마크인 F-ICL을 공개 도구로 배포했습니다. 그들은 현재의 모델들이 무작위 추측과 완벽한 논리적 추론 사이의 "패턴 매칭" 영역에 머물러 있으며, 무작위 추측에 훨씬 더 가깝다는 것을 발견했습니다. 모델이 이 간극을 메우지 못한다면, 에세이를 쓰거나 코드를 짜는 데는 뛰어날지 몰라도, 우리가 기대하는 방식의 진정한 "사고"는 하지 못할 것입니다. 모델을 더 크게 만들거나 더 오래 학습시킨다고 해서 이 간극이 해결되지는 않습니다. 이는 정보가 처리되는 방식에 대한 근본적인 변화가 필요함을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →