← 최신 논문
🤖 AI

FLOPs vs Real Work: The Importance of Replication in AI Efficiency Assessment

이 논문은 AI 효율성에 관한 연구를 재현하여 가공되지 않은 FLOPs만으로는 실행 시간을 예측하기에 불충분함을 확인하는 동시에, 제안된 α\alpha-FLOPs 추정 공식이 현대 시스템의 하드웨어 불안정성을 설명하지 못한다는 점을 밝히고 하드웨어 의존적 연구에서 투명한 재현 패키지의 결정적인 필요성을 강조한다.

원저자: Enrique Barba Roque, Luís Cruz

게시일 2026-08-18
📖 5 분 읽기🧠 심층 분석

원저자: Enrique Barba Roque, Luís Cruz

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

컴퓨터 프로그램이 글을 쓰고, 예술을 창조하며, 복잡한 문제를 해결하는 법을 배우고 있는 급격히 확장되는 인공지능의 세계에서, 조용하지만 결정적인 질문이 하나 떠올랐습니다. 과연 실제로 얼마나 많은 작업이 수행되고 있는가 하는 점입니다. 수년간 연구자들과 엔지니어들은 이러한 디지털 두뇌가 요구하는 노력을 측정하기 위해 표준적인 방법을 의존해 왔습니다. 그들은 모델이 결론에 도상 도달하기 위해 수행해야 하는 기본적인 수학적 계산, 구체적으로는 부동 소수점 연산의 수를 셉니다. 이는 벽을 쌓는 데 시간이 얼마나 걸릴지 추측하기 위해 벽돌의 개수를 세는 것과 비슷합니다. 그 논리는 타당해 보입니다. 더 많은 계산은 더 많은 시간과 더 많은 에너지를 의미해야 하기 때문입니다. 이 지표는 서로 다른 AI 모델을 비교하는 보편적인 언어가 되었으며, 개발자들이 어떤 설계가 효율적이고 어떤 설계가 낭비적인지를 결정하는 데 도움을 줍니다. 하지만 이 단순한 계측은 계산이 어떻게 조직되거나 어떤 종류의 컴퓨터가 작업을 수행하는지와 관계없이 모든 계산이 동일한 시간과 에너지를 소모한다고 가정합니다.

이러-한 가정은 AI 모델이 거대한 규모로 성장하며 막대한 양의 전기를 소비하고 전력망에 부담을 주게 됨에 따라 정밀한 검토를 받게 되었습니다. 만약 표준적인 계산 방식이 결함이 있다면, 이는 차세대 지능형 시스템의 환경적 비용과 속도에 대한 심각한 오계산을 초로 이어질 수 있습니다. 최근 한 연구는 이 전통적인 계산 방식이 현대의 강력한 컴퓨터 칩에서도 여전히 유효한지 테스트하기 위해 시작되었습니다. 연구진은 수학적 연산의 수가 실제 실행 시간의 신뢰할 수 있는 예측 인자인지, 아니면 현실이 훨씬 더 복잡한지를 확인하고자 했습니다. 그들은 이미지 인식이나 비디오 이해에 널리 사용되는 컨볼루션 신경망(convolutional neural network)이라는 특정 유형의 AI 아키텍처에 집중했습니다. 최첨단 그래픽 카드에서 수천 번의 실험을 수행함으로써, 제안된 수학적 보정치가 모델이 실행되는 데 걸리는 시간을 정확하게 예측할 수 있는지, 아니면 새로운 하드웨어가 기존의 공식으로는 볼 수 없는 숨겨진 복잡성을 도입했는지를 검증하고자 했습니다.

연구팀은 먼저 수학 연산의 원시 계수가 실행 시간을 예측하는 데 신뢰할 수 없는 예측 인자라는 점을 시사했던 이전 연구를 재검토하는 것으로 시작했습니다. 그 초기 연구는 계산이 발생하는 위치가 얼마나 많은 계산을 하느냐만큼 중요하다는 것을 보여주었습니다. 공장의 조립 라인을 상상해 보십시오. 넓은 컨베이어 벨트를 통해 물건을 이동시키는 것이 좁고 뒤틀린 터널을 통해 동일한 수의 물건을 밀어 넣는 것보다 훨씬 빠르고 관리하기 쉽습니다. AI의 세계에서도 이미지의 너비와 높이와 같은 공간적 차원으로 배열된 계산은 더 깊고 복잡한 층에 배열된 계산보다 훨씬 더 쉽게 병렬로 처리될 수 있습니다. 이전 연구자들은 이러한 차원을 바탕으로 원시 계수를 조정하는 공식을 개발했으며, 이를 통해 특정 하드웨어에서 모델이 실행되는 데 걸리는 시간을 정확하게 추정할 수 있는 도구를 만들고자 했습니다.

이 공식이 여전히 작동하는지 테스트하기 위해, 델프트 공과대학교(Delft University of Technology)의 연구진은 원래 실험의 엄격한 재현 실험을 설정했습니다. 그들은 원래 연구에 사용된 장비보다 훨씬 더 강력한 현대적인 그래픽 카드인 NVIDIA RTX 4090을 사용했습니다. 그들의 목표는 동일한 패턴이 유지되는지, 그리고 공식이 여전히 정확한 예측을 제공할 수 있는지를 확인하는 것이었습니다. 그러나 그들은 즉시 중대한 장애물에 부딪혔습니다. 원래의 연구가 작업을 정확하게 재현하는 데 필요한 완전한 코드나 상세한 지침을 제공하지 않았기 때문입니다. 연구진은 소프트웨어 라이브러리와 드라이버에 대한 구체적인 세부 정보를 알 수 없었으며, 공식을 만드는 데 사용된 원본 데이터도 보유하지 못했습니다. 이러한 투명성의 부족은 팀이 실험을 설정하는 과정에서 교육적인 추측(educated guesses)을 하게 만들었고, 결과에 불확실성을 초래했습니다.

이러한 어려움에도 불구하고, 팀은 각 구성 요소가 실행되는 데 걸리는 시간을 확인하기 위해 수천 가지의 서로 다른 구성을 실행하며 측정을 진행했습니다. 그들은 첫 번째 주요 발견을 확인했습니다. 즉, 수학 연산의 원시 계수는 모델의 실행 시간을 예측하는 데 있어 형편없는 예측 인자라는 사실입니다. 두 구성이 정확히 동일한 수의 계산을 요구하더라도, 그 계산들이 어떻게 배열되어 있는지에 따라 실행 시간은 크게 달랐습니다. 연구진은 이미지의 너비와 높이에 걸쳐 퍼져 있는 연산이 깊은 층에 밀집된 연산보다 훨씬 더 빠르게 처리된다는 것을 발견했으며, 이는 데이터의 물리적 배치가 전체 작업량보다 더 중요하다는 것을 확인시켜 주었습니다.

그러나 그들이 제안된 공식을 새로운 더 빠른 하드웨어에 적용하려고 했을 때, 결과는 훨씬 더 낙담스러웠습니다. 오래된 장비에서는 상당히 잘 작동했던 이 공식은 현대적인 그래픽 카드가 작업을 완료하는 데 걸리는 시간을 지속적으로 과소평가했습니다. 많은 경우, 실제 소요 시간은 공식이 예측한 것보다 훨씬 더 길었습니다. 더욱 놀랍게도, 연구진은 실행 시간이 작업량이 증가함에 따라 매끄럽고 꾸준하게 증가하는 것이 아님을 발견했습니다. 대신, 시간은 예측 불가능한 방식으로 급증하거나 요동쳤습니다. 입력 데이터의 크기를 아주 미세하게 늘렸을 때, 이를 처리하는 시간은 갑자기 치솟거나 떨어졌으며, 이는 직선이 아닌 들쭉날쭉하고 불규칙한 패턴을 만들어냈습니다. 이러한 급증은 종종 4의 배수나 다른 작은 정수와 관련된 특정 숫자에서 나타났으며, 이는 현대 칩의 내부 아키텍처가 단순한 공식으로는 포착할 수 없는 복잡하고 비선적인 방식으로 데이터에 반응하고 있음을 시사했습니다.

이 연구는 계산의 수와 그에 소요되는 시간 사이의 관계가 이전에 생각했던 것보다 훨씬 더 취약하고 하드웨어 의존적이라는 사실을 드러냈습니다. 이 공식은 입력 및 출력 채널의 영향을 고려하지 못했는데, 이 채널들은 이전 시스템보다 새로운 하드웨어에서 실행 시간에 훨씬 더 큰 역할을 했습니다. 또한, 연구진은 현대 칩의 최적화 기술, 예를 들어 대규모 메모리 캐시와 특화된 프로세싱 유닛이 시간의 갑작스러운 변화를 일으키는 새로운 동작을 유발한다는 것을 관찰했습니다. 이러한 동작들은 낮은 해상도의 데이터 포인트를 사용하여 몇 개의 값만을 샘플링했던 원래 연구에서는 숨겨져 있었습니다. 팀이 모든 가능한 값을 테스트했을 때, 시스템의 숨겨진 불안정성이 드러난 것입니다.

연구진은 공간적 배치가 깊은 층보다 더 효율적이라는 일반적인 아이디어는 여전히 유효하지만, 실행 시간을 예측하기 위해 설계된 구체적인 수학적 도구는 현대적 하드웨어에서는 더 이상 신뢰할 수 없다고 결론지었습니다. 공식이 급격히 진화하는 컴퓨터 칩에 적응하지 못한다는 점은, 이 공식이 에너지 소비나 속도를 추정하기 위한 보편적인 표준으로 사용될 수 없음을 의미합니다. 이 연구는 또한 과학 연구의 중요한 문제, 즉 완전하고 정확한 재현 패키지의 부재를 강조했습니다. 원본 코드, 특정 소프트웨어 버전, 원시 데이터가 없다면 왜 공식이 실패했는지 정확히 알기 어렵습니다. 이 실패가 하드웨어 자체 때문인지, 아니면 누락된 정보로 인해 연구진이 내려야 했던 가정 때문인지는 여전히 불분명합니다.

궁극적으로, 이 작업은 인공지능이라는 빠르게 움직이는 분야에서 단순한 지표가 오해를 불러일으킬 수 있다는 점을 상기시켜 줍니다. AI 모델의 효율성은 단순히 연산 횟수를 세는 문제가 아니라, 모델의 설계, 모델이 실행되는 특정 하드웨어, 그리고 그 과정을 관리하는 소프트웨어 사이의 복잡한 상호작용입니다. 연구진은 자신의 완전한 데이터 세트와 코드를 공개하여, 이러한 투명성이 미래를 위한 더 나은 도구를 구축하는 데 도움이 되기를 희망하고 있습니다. 그들의 발견은 AI가 계속 성장함에 따라, 우리가 단순한 계수를 넘어 이러한 디지털 시스템이 실제 세상에서 실제로 어떻게 작동하는지에 대한 더 깊고 미묘한 이해를 발전시켜야 함을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →