← 최신 논문
💻 computer science

What Counts as Compute? An Empirical Analysis of Accounting Conventions in Compute-Optimal Transformer Training

이 논문은 파라미터와 연산량을 산정하는 회계 관행의 변화가 연산 최적화 훈련 프런티어의 적합 지수를 크게 변화시키지만, 손실 지형의 평탄함으로 인해 결과적인 실질적 훈련 효율에 미치는 영향은 미미하며, 구체적인 회계 방식은 단순한 아키텍처 비율로부터 예측 가능하다는 점을 입증한다.

원저자: Alexander Memming

게시일 2026-07-28
📖 3 분 읽기☕ 가벼운 읽기

원저자: Alexander Memming

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 완벽한 케이크를 굽고 싶어 하는데 레시피가 없다고 상상해 보세요. 당신은 맛이 두 가지 요소, 즉 밀가루를 얼마나 사용하는지(케이크의 크기)와 얼마나 오래 굽는지(굽는 시간)에 달려 있다는 것을 알고 있습니다. 인공지능의 세계에서 과학자들은 거대한 뇌와 같은 컴퓨터인 '트랜스포머'를 훈련시키기 위한 완벽한 '레시피'를 찾으려고 노력하고 있습니다. 그들은 다음과 같은 질문을 던집니다. 만약 전기와 컴퓨터 사용 시간에 쓸 수 있는 돈이 정해져 있다면, 아주 작은 뇌를 만들어 엄청난 양의 데이터를 먹여야 할까요, 아니면 거대한 뇌를 만들어 아주 적은 양의 데이터만 먹여야 할까요?

이를 알아내기 위해 연구자들은 수학을 사용해야 합니다. 그들은 '재료'(뇌의 크기)와 '노력'(컴퓨터 작업량)을 계산합니다. 하지만 까다로운 점은, 제빵사가 밀가루의 무게만 잴 것인지 아니면 그릇의 무게까지 포함할 것인지에 따라 '컵 단위'를 다르게 세는 것과 마찬가지로, AI 과학자들도 '재료'와 '노력'을 서로 다른 방식으로 계산한다는 것입니다. 어떤 이들은 뇌의 모든 부분을 하나하나 세는 반면, 어떤 이들은 주요 사고 부분만을 셉니다. 어떤 이들은 가공되지 않은 수학 연산 횟수를 세는 반면, 어떤 이들은 컴퓨터가 실제로 작동한 시간을 셉니다. 수년 동안 사람들은 우리가 연구하는 뇌들이 너무나 거대해서 그 추가적인 부분들이 미미하기 때문에 이런 계산 방식의 차이가 별로 중요하지 않다고 가정해 왔습니다. 하지만 만약 당신이 거대한 웨딩 케이크가 아니라 작은 컵케이크를 굽고 있다면 어떨까요? 재료를 세는 방식이 갑자기 레시피를 바꿔놓게 될까요?

독립 연구자인 알렉산더 메밍(Alexander Memming)이 작성한 이 논문은 바로 그 질문을 던집니다. 저자는 추측하는 것을 멈추고 측정을 시작하기로 했습니다. 거대 기업들만이 감당할 수 있는 거대하고 비싼 AI 모델을 보는 대신, 메밍은 35개의 작고 관리 가능한 AI 모델 그리드를 구축했습니다. 그는 이 모델들을 모두 동일한 교육용 텍스트로, 동일한 규칙을 사용하여 훈련시켰지만, '크기'와 '비용'을 세는 방식만을 바꾸어 결과를 네 가지 방식으로 분석했습니다.

이 발견은 마치 당신의 주방 저울이 작은 양을 잴 때만 거짓말을 하고 있다는 사실을 발견한 것과 비슷합니다. 논문에 따르면, 기존의 단순한 방식(뇌의 '출력 헤드'를 무시하는 방식)을 사용할 경우, 수학적 계산은 당신이 더 정밀한 측정값보다 약 19배 더 작은 모델을 만들어야 한다고 제안합니다. 즉, 어떤 '자(ruler)'를 사용하느냐에 따라 권장되는 레시피가 크게 달라진다는 것입니다. 모델이 얼마나 빨리 성장해야 하는지를 알려주는 지수인 지수(exponent)는 계측 방법만 바뀌었을 뿐인데 0.25에서 0.42로 변했습니다. 이는 매우 큰 차이이며, 두 명의 과학자가 정확히 동일한 훈련 과정을 관찰하고 있더라도 서로 다른 정의를 사용했다는 이유만으로 완전히 다른 '최적의' 레시피를 발표할 수 있음을 시사합니다.

하지만 실제로 이러한 모델을 만드는 사람들에게 이 상황이 덜 무섭게 느껴지게 만드는 반전이 있습니다. 종이 위에서는 레시피가 매우 달라 보였지만, 실제 만들어진 '케이크'의 맛은 거의 비슷했다는 점입니다. 저자는 최상의 성능을 내는 '골짜기'가 매우 평평하다는 것을 발견했습니다. 이는 만약 당신이 잘못된 레시피(기존의 단순한 계측법에 기반한 레시피)를 따른다 하더라도, 예산을 통째로 날리지는 않는다는 것을 의미합니다. 약 18%의 컴퓨팅 자원을 낭비할 수는 있겠지만, 최종 결과물은 여전히 최상의 결과에 매우 근접해 있습니다. 이 논문은 과학자들이 서로를 동일한 기준으로 비교할 수 있도록 숫자를 보고할 때 매우 주의해야 하지만, 계측을 약간 틀렸을 때 발생하는 실질적인 비용은 놀라울 정도로 작다고 결론짓습니다. '완벽한' 레시피는 목표가 계속 움직이는 대상이지만, '충분히 좋은' 레시피의 범위는 우리가 생각했던 것보다 훨씬 넓습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →