← 최신 논문
🤖 AI

On the Smallness of the Large Language Models Scaling Exponents

이 논문은 현재의 거대 언어 모델 스케일링 지수가 비제로 손실 한계(non-zero loss limits)의 "페데스탈 효과(pedestal effect)"를 고려한 후에도 지속되는 지속 불가능한 에너지 체제를 나타낸다고 주장하며, 또한 데이터의 매끄러움(smoothness)이 이러한 지수에 미치는 영향을 논하기 위해 유체 난류와의 유사성을 이끌어낸다.

원저자: Sauro Succi, Peter V. Coveney, Alex Hansen

게시일 2026-06-24
📖 4 분 읽기☕ 가벼운 읽기

원저자: Sauro Succi, Peter V. Coveney, Alex Hansen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

개요: "더 큰 것이 더 좋다"는 문제

로봇에게 완벽하게 말하는 법을 가르치려 한다고 상상해 보세요. 현재 AI 세계의 규칙은 이렇습니다: "로봇이 커질수록 더 말을 잘한다." "벽이 없다(no-wall)"라고 불리는 이 아이디어는, 만약 우리가 계속해서 더 많은 데이터와 더 많은 컴퓨터 연산 능력을 추가하기만 한다면, 로봇이 영원히 더 똑똑해질 것이라고 제안합니다.

하지만 이 논문의 저자들은 이 전략이 지속 불가능하다고 주장합니다. 그들은 우리가 아직 지능의 벽에 부딪힌 것은 아닐지라도, 에너지 소비의 벽에는 부딪히고 있다고 말합니다.

핵심 문제: 수확 체감 (Diminimishing Returns)

이 논문은 왜 이것이 문제가 되는지를 설명하기 위해 간단한 수학적 개념을 사용합니다. 아주 더러운 창문을 닦으려고 노력한다고 상상해 보세요.

  • 목표: 창문을 완벽하게 깨끗하게 만드는 것 (오류 제로).
  • 현재의 현실: 창문을 단지 절반만큼 덜 더럽게 만들기 위해서, 당신은 두 배의 노력이 필요한 것이 아닙니다. 1,000배의 노력이 필요합니다.

저자들은 현재의 거대 언어 모델(LLM)이 가진 "스케일링 지수(scaling exponent, 모델이 얼마나 빨리 나아지는지를 측정하는 숫자)"가 매우 작다(약 0.05에서 0.1 사이)는 점을 지적합니다.

  • 비유: AI의 성능을 아주 조금이라도 개선하고 싶다면, 당신은 산더미 같은 새로운 데이터를 먹여야 하고 엄청난 양의 전기를 태워야 합니다. 이는 마치 위로 올라갈수록 점점 더 가팔라지는 언덕 위로 바위를 밀어 올리려는 것과 같습니다. 논문은 이것이 에너지 자원의 막다른 길이라고 주장합니다.

"받침대(Pedestal)" 방어론: 그냥 기다릴 수 없는 이유

일부 비판자들은 이렇게 말합니다. "걱정 마세요! 우리는 실제로 AI가 완벽할(오류 제로) 필요는 없습니다. 우리는 그저 AI가 헛소리를 하지 않을 정도로만 '충분히 좋으면' 됩니다. 우리는 바닥에 닿기 전에 훈련을 멈추면 됩니다."

저자들은 이를 **"받침대 효과(Pedestal Effect)"**라고 부릅니다. 그들은 AI의 오류가 아무리 많은 데이터를 주더라도 결코 내려갈 수 없는 바닥(받침대)을 상상합니다.

  • 논문의 반박: 설령 우리가 완벽함을 요구하지 않는다고 하더라도, 수학적으로는 여전히 성립하지 않습니다. 저자들은 "바닥"이 시작점 대비 너무 높기 때문에, "충분히 좋은" 구간에 도출되는 속도가 매우 빠르며, 그럼에도 불구하고 작은 스케일링 지수가 여전히 적용된다는 것을 보여줍니다.
  • 은유: 욕조에 물을 채우려고 한다고 상상해 보세요. 당신은 "욕조가 끝까지 찰 필요는 없습니다. 물이 몇 인치 정도만 있으면 됩니다"라고 주장합니다. 저자들은 "그 목표치가 낮더라도, 수도꼭지에서 물이 너무 느리게 뚝뚝 떨어지기 때문에, 그 몇 인치를 채우기도 전에 물(에너지)이 다 떨어져 버릴 것"이라고 말합니다.

숫자가 왜 그렇게 작은가? ("데이터의 거칠기")

논문은 다음과 같이 질문합니다. 왜 AI는 이렇게 느리게 발전하는가?

그들은 AI 훈련을 유체 난류(강물에서 소용돌이치는 물이나 피어오르는 연기 같은 것)에 비유합니다.

  1. 매끄러움 vs 거칠음: 만약 당신이 매끄럽고 예측 가능한 패턴(직선 같은 것)을 배우려 한다면, 빠르게 배울 수 있습니다. 하지만 실제 세상의 데이터(언어, 이미지, 복잡한 시스템)는 폭풍 치는 바다처럼 "거칠고" 혼란스럽습니다.
  2. 프랙탈과의 연결: 저자들은 물리학의 비유를 사용합니다. 폭풍 속에서는 에너지가 고르게 퍼져 있지 않고, 작고 혼란스러운 소용돌이에 집중되어 있습니다. 폭풍을 이해하려면 그 작은 소용돌이들을 들여다봐야 합니다.
  3. 결과: 데이터가 "거칠고" 혼란스럽기 때문에, AI는 패턴을 찾는 데 훨씬 더 많은 노력을 기울여야 합니다. 논문은 데이터의 "거칠기"가 스케일링 지수를 매우 낮게 유지하도록 강제한다고 제안합니다.

"숨겨진 지도" 이론

논문은 Sharma와 Kaplan(SK)의 이론을 인용하며, 학습 속도는 데이터의 **고유 차원(Intrinsic Dimension)**에 달려 있다고 제안합니다.

  • 비유: 도서관을 상상해 보세요.
    • 임베딩 공간(Embedding Space) (도서관의 크기)은 매우 큽니다. 아마 수백만 개의 선반이 있을 것입니다.
    • 고유 차원(Intrinsic Dimension) (실제 이야기를 담고 있는 책의 수)은 훨씬 작지만, 여전히 매우 큽니다.
  • 문제: LLM이 거대한 도서관 속에 숨겨진 "진짜 이야기"를 찾아내는 데(데이터 압축)는 뛰어나지만, 그 "진짜 이야기" 자체가 너무 복잡하여(차원이 너무 많아서) 세상의 에너지를 다 태워버리지 않고서는 효율적으로 학습할 수 없다는 것입니다.

결론: "더 크게"를 쫓는 것을 멈춰라

저자들은 "더 큰 것이 더 좋다"는 접근 방식이 에너지 고갈로 가는 레시피라고 결론짓습니다.

  • 판결: AI가 얼마나 똑똑해지든 간에, 데이터가 복잡하고 "거칠다면", 그것을 조금 더 똑똑하게 만드는 데 필요한 에너지는 항상 너무 높을 것입니다.
  • 제시된 경로: 단순히 더 많은 전기를 잡아먹는 더 크고 멍청한 모델을 만드는 대신, 우리는 **기초적인 물리 법칙을 인식하는 모델(world models라고 불리는 모델)**로 돌아가야 합니다. 이 모델들은 단순히 거대한 데이터베이스의 패턴을 암기하는 것이 아니라, 세상이 어떻게 작동하는지(중력이나 인과관계 같은 것)를 이해하는 시스템입니다.

요약하자면: 우리는 복잡한 퍼즐을 풀기 위해 점점 더 많은 사람을 투입하려 하고 있지만, 퍼즐이 너무 어려워서 퍼즐을 풀기도 전에 커피(에너지)가 먼저 떨어지고 있습니다. 우리는 전략을 바꾸어야 하지, 단순히 일꾼을 더 늘려서는 안 됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →