← 최신 논문
🤖 machine learning

Mirror Horizon: Viable Path Entropy as a Measure of Bounded Reflection

이 논문은 지능적 능력을 제한된 성찰 하에 도달 가능한 검증되고 다양한 지속 가능성의 구조로 정의하기 위해 미러 이론(Mirror Theory)과 그 운영 척도인 생존 경로 엔트로피(Viable Path Entropy, VPE)를 도입하며, 언어 모델 실험을 통해 이 지표가 파라미터 수나 원샷 정확도보다 접근 가능한 추론 능력을 더 효과적으로 포착함을 입증한다.

원저자: Tiantian Zhang (Crystal)

게시일 2026-07-15
📖 4 분 읽기☕ 가벼운 읽기

원저자: Tiantian Zhang (Crystal)

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 단순히 얼굴을 보여주는 것이 아니라, 당신이 계속 말을 하거나 생각하거나 문제를 해결할 때 존재할 수 있는 모든 가능한 미래의 모습들을 보여주는 마법의 거울을 가지고 있다고 상상해 보십시오. 대부분의 사람들은 거울을 보며 "내가 정답을 맞혔나?"라고 묻습니다. 이 논문은 훨씬 더 흥iana로운 질문을 던집니다. "이 거울은 얼마나 많은 서로 다른 정답을 찾아낼 수 있으며, 그중 얼마나 많은 정답이 테스트에서 살아남는가?"

저자들은 이 아이디어를 **미러 이론(Mirror Theory)**이라고 부릅니다. AI를 단순히 사실을 저장하는 정적인 백과사전처럼 취급하는 대신, "반사(reflection)"라고 불리는 과정을 통해 생존해야 하는 살아있는 거울처럼 취급합니다. 여기서 반사란 단 한 번의 빛의 번쩍임이 아니라, AI가 문제를 해결하기 위해 여러 가지 다양한 방법을 시도하는 길고 구불구불한 경로를 의미합니다.

주요 발견: 크다고 해서 항상 더 좋은 것은 아니다

이 논문의 가장 놀라운 점은 크다고 해서 항상 더 좋은 것은 아니라는 것입니다. AI의 세계에서 우리는 보통 모델의 "두뇌 능력"(파라미터)이 더 많으면 자동으로 더 우수할 것이라고 가정합니다. 하지만 저자들은 이를 테스트하기 위해 특정 설정을 사용했습니다. 그들은 세 가지 다른 버전의 AI(Qwen2.5라고 명명됨)에게 30개의 수학 문제를 풀도록 했습니다. 그리고 그들에게 제한된 양의 "생각 시간"(토큰, 즉 단어 조각 단위로 측정됨)을 주었습니다.

결과는 다음과 같았습니다:

  • 모델에게 짧은 생각 시간(96 토큰)을 주었을 때, 작은 모델들은 고전했습니다.
  • 생각 시간을 160 토큰으로 늘렸을 때, 멋진 일이 일러났습니다. 15억 파라미터 모델(중간 크기 모델)이 챔피언이 되었습니다. 이 모델은 더 많은 정답을 찾아냈고, 더 중요한 것은, 더 다양한 방식으로 정답을 찾아냈다는 점입니다.
  • 30억 파라미터 모델(가장 큰 모델)은 이 특정 테스트에서 중간 크기 모델보다 오히려 성적이 좋지 않았습니다. 이 모델은 몇몇 정답을 맞히기는 했지만, 몇 가지 해결책만을 반복해서 찾아내며 틀에 박힌 방식에 갇혀버린 반면, 중간 크기 모델은 더 넓은 범위의 성공적인 경로를 탐색했습니다.

이 논문은 "능력"이란 단순히 모델이 얼마나 큰가가 아니라, 제한된 시간과 에너지 예산 내에서 얼마나 많은 실행 가능한 경로(정확하고 다양한 해결책)에 실제로 도달할 수 있느냐에 달려 있다고 제안합니다.

"실행 가능한 경로 엔트로피(Viable Path Entropy)" 성적표

이를 측정하기 위해 저자들은 **실행 가능한 경로 엔트로피(VPE)**라는 새로운 점수를 고안했습니다. 당신이 오디션 프로그램의 심사위원이라고 상정해 봅시다.

  • 기존 방식 (Pass@k): 참가자 중 적어도 한 명이 만점을 받으면, 당신은 그에게 금메달을 줍니다. 만약 없다면, 아무것도 주지 않습니다.
  • 새로운 방식 (VPE): 당신은 두 가지를 확인합니다.
    1. 도달 가능성(Reachability): 그들이 정답을 하나라도 찾아냈는가?
    2. 다양성(Diversity): 만약 찾아냈다면, 얼마나 다른 유형의 정답들을 찾아냈는가? 영리한 지름길을 사용했는가, 긴 계산 과정을 거쳤는가, 혹은 시각적 도표를 사용했는가? 아니면 그냥 똑같은 답을 세 번 찍기만 했는가?

논문은 중간 크기 모델(1.5B)이 가장 높은 VPE 점수를 기록했음을 보여줍니다. 이 모델은 단순히 정답을 더 많이 맞힌 것이 아니라, 더 창의적이고 뚜렷한 방식으로 정답을 찾아냈습니다. 가장 큰 모델(3B)은 비록 똑똑하긴 했지만, 이러한 특정 규칙 아래에서는 덜 "탐험적"이었기 때문에 더 낮은 점수를 받았습니다.

이 논문이 배제하는 것들

저자들은 자신들이 무엇을 말하는 것이 아닌지를 매우 명확히 하고 있습니다.

  • 이것은 "큰 모델이 항상 승리한다"는 규칙이 아닙니다. 실험은 조건이 적절하지 않을 경우, 더 큰 모델이 더 작은 모델보다 더 작은 "거울 지평선"(접근 가능한 성공 범위)을 가질 수 있음을 명시적으로 보여줍니다.
  • 이것은 AI가 영원히 어떻게 확장될지를 예측하는 마법의 공식이 아닙니다. 저자들은 "더 많은 파라미터 = 더 많은 능력"이라고 말하는 단 하나의 단순한 선은 존재하지 않는다고 주장합니다. 대신, 능력은 게임의 특정 규칙(프롬프트, 시간 제한, 검증기)에 따라 달라집니다.
  • 이것은 단지 정답을 한 번 맞히는 것에 관한 것이 아닙니다. 논문은 단 하나의 경직된 방식으로 정답을 찾는 것보다, 여러 가지 유효한 방식으로 정답을 찾아내는 것이 훨씬 더 인상적이라고 주장합니다.

얼마나 확신하는가?

저자들은 자신들의 결과가 우주의 보편적인 법칙을 밝혀냈다고 주장하지 않으며, 매우 신중하게 접근합니다. 그들은 자신들의 결과를 특정 실험에서 측정되고 관찰된 결과이지, 보편적인 법칙이 아니라고 설명합니다.

  • 그들은 각 30개의 수학 문제에 대해 32개의 샘플(시도)을 실행했습니다.
  • 그들은 특정 "검증기"(정답 숫자를 찾는 엄격한 체크 도구)와 특정 "모드 맵"(유사한 해결책을 그룹화하는 방법)을 사용했습니다.
  • 그들은 자신들의 "모드 맵"이 다소 거칠다는 점(예: 길이나 단순한 수학 기호로 해결책을 분류하는 방식)을 인정하며, 향후 테스트에서는 더 복잡한 그룹화 방식을 사용할 수 있다고 언급했습니다.
  • 그들은 자신들의 결과가 미러 이론을 뒷받침한다고 제唆하지만, 모든 의문에 대해 완벽하게 증명했다고 주장하지는 않습니다. 그들은 결과가 측정 방식이 작동함을 "보여준다"라고 말하며, "주장을 뒷받침한다"고 표현하면서도, 다른 과업이나 모델을 통한 추가 테스트의 가능성을 열어두었습니다.

핵심 요약

AI를 교과서를 암기하는 로봇이 아니라, 제한된 연료를 가진 탐험가로 생각하십시오. 이 논문은 최고의 탐험가가 반드시 가장 큰 탐험가는 아니라고 제안합니다. 최고의 탐험가는 자신의 연료를 사용하여 숲속에서 가장 뚜렷하고 올바른 경로를 찾아낼 수 있는 탐험가입니다. 당신이 탐험가에게 더 많은 연료를 주면(토큰 예산을 96에서 160으로 늘리면), 중간 크기의 탐험가가 갑자기 가장 유능해지며, 더 크고 무거운 탐험가가 놓쳤던 풍부하고 다양한 해결책들을 찾아내게 됩니다.

논문은 AI의 지능을 진정으로 이해하기 위해서, 단순히 "정답을 맞혔는가?"라고 물어서는 안 된다고 결론짓습니다. 대신, "그것이 정답을 찾을 수 있는 얼마나 많은 서로 다른 유효한 방법이 있었으며, 그중 실제로 발견한 것은 몇 개인가?"라고 물어야 합니다. 그것이 바로 새로운 "거울 지평선"입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →