← 최신 논문
🤖 machine learning

On the Infinite Width and Depth Limits of Predictive Coding Networks

이 논문은 예측 코딩 네트워크(Predictive Coding Networks)의 무한 너비 및 깊이 극한을 조사하여, 훈련 폭발을 방지하는 안정적인 매개변수화를 도출하고, 넓은 네트워크에서 예측 코딩 그래디언트가 역전파 그래디언트로 수렴함을 입증함으로써, 심층 구조를 위한 생물학적으로 타당한 국소 학습 메커니즘을 제공한다.

원저자: Francesco Innocenti, El Mehdi Achour, Rafal Bogacz

게시일 2026-08-11
📖 3 분 읽기☕ 가벼운 읽기

원저자: Francesco Innocenti, El Mehdi Achour, Rafal Bogacz

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대한 다층 구조의 로봇 팀에게 퍼즐을 푸는 법을 가르치고 있다고 상상해 보십시오. 인공지능의 세계에서 이를 수행하는 표준적인 방법은 '역전파(backpropagation)'라고 불립니다. 이것은 마치 조립 라인의 맨 끝에 서 있는 엄격한 관리자와 같습니다. 그는 최종적인 실수를 확인한 뒤, 처음까지 거슬러 올라가 모든 로봇에게 정확히 어떻게 실수했는지 구체적인 지침을 외치며 달려갑니다. 이 방식은 컴퓨터에게 매우 효과적이지만, 자연이 작동하는 방식과는 다릅니다. 실제 뇌는 시간을 거슬러 올라가 지시를 내리는 중앙 관리자를 두지 않습니다. 대신, 각 뉴런은 오직 자신의 즉각적인 이웃이 무엇을 하고 있는지만을 압니다.

여기 '예측 부호화(Predictive Coding)'라는 이론이 등장합니다. 이 이론은 뇌가 마치 날씨를 추측하려는 친구들의 모임처럼 학습한다고 제안합니다. 각 개인(뉴런)은 이웃이 말하는 것을 바탕으로 예측을 하고, 자신의 추측이 틀렸을 때 약간의 '오차'를 느끼며, 더 잘 어울릴 수 있도록 자신의 활동을 조정합니다. 모두가 논쟁을 멈추고 차분한 합의(평형)에 도달하면, 그들은 다음번에 더 잘하기 위해 자신들의 연결을 미세하게 조정합니다. 이 방식은 모두가 이웃하고만 대화하기 때문에 생물학적으로 현실적입니다. 하지만 오랫동안 과학자들은 이 방식이 현대 AI에 필요한 거대하고 깊은 네트워크를 감당할 수 있을지 확신하지 못했습니다. 이 국소적이고 수다스러운 방식이 정말로 슈퍼컴퓨터 규모까지 확장될 수 있을까요, 아니면 무너져 내릴까요?

이 논문은 네트워크를 무한히 넓게 만들고(옆으로 수많은 뉴량을 추가) 무한히 깊게 만들 때(위로 수많은 층을 쌓음) 어떤 일이 일어나는지를 살펴봄으로써 바로 그 질문을 파고듭니다. 연구자들인 프란체스코 이노첸티(Francesco Innocenti), 엘 메디 아쿠르(El Mehdi Achour), 그리고 라팔 보가츠(Rafal Bogacz)는 예측 부호화 네트워크의 '조절 노브'를 조정하여, 오늘날 우리가 사용하는 표준 역전파 네트워크처럼 안정적이고 효과적으로 학습할 수 있는지 알고 싶었습니다.

그들의 조사 결과는 놀라운 반전을 보여줍니다. 예측 부호화가 거대한 규모에서 작동하려면, 표준 역전파 방식과 정확히 동일한 설정과 스케일링 규칙을 사용해야 한다는 것을 발견했습니다. 만약 대부분의 사람들이 PyTorch와 같은 소프트웨어에서 사용하는 '표준' 설정을 사용하려고 한다면, 예측 부호화 네트워크의 출력은 마이크를 스피커에 너무 가까이 가져갔을 때처럼 혼돈 속으로 폭발하며 커질 것입니다. 하지만 특정 수학적으로 정밀한 규칙(소위 '평균장' 또는 '최대 업데이트' 매개변수화로 알려진)으로 전환하면 네트워크는 안정화됩니다.

이 안정적인 조건 하에서, 논문은 네트워크가 믿기지 않을 정도로 넓어짐에 따라 예측 부호화가 학습하는 방식이 역전파와 거의 구별할 수 없을 정도로 유사해진다는 것을 보여줍니다. 사실, 네트워크가 깊이보다 훨씬 더 넓을 때(높고 얇은 탑보다는 넓고 얕은 팬케이크처럼), 예측 부호화의 '국소적' 업데이트는 역전파의 '전역적' 업데이트와 완벽하게 일치합니다. 저자들은 단순한 선형 네트워크에 대해 이를 수학적으로 증명했으며, 합성곱 신경망(CNN) 및 트랜스포머(Transformer)와 같은 복잡한 비선형 모델을 통해 이를 실험적으로 확인했습니다.

또한 이 연구는 몇 가지 흥미로운 가능성을 배제합니다. 일부 연구자들이 기존 설정을 사용하여 깊이가 너비보다 더 깊은 네트워크에서 관찰했던 '빠른' 학습 속도는 사실 불안정성으로 인한 착각이었음을 시사합니다. 즉, 그 설정들은 네트워크가 성장함에 따라 붕괴됩니다. 나아가, 이 논문은 뇌가 역전파의 강력함을 달성하기 위해 예측 부호화와 유사한 국소적 학습 규칙을 사용할 수도 있다는 점을 시사하면서도, 이것이 효율적으로 작동하려면 뇌가 '너비가 깊이보다 훨씬 넓어야' 한다는 가설을 덧붙였습니다. 이는 현재의 생물학적 이해와 일치하는 부분입니다.

궁극적으로 이 연구는 단순히 "예측 부호화가 작동한다"라고 말하는 데 그치지 않고, 그것이 "어떻게" 작동할 수 있는지에 대한 엄격한 경계를 그려줍니다. 이 작업은 예측 부호화를 현대 AI의 규모로 확장하기 위해서는 단순히 무작위로 조정해서는 안 되며, 표준 AI를 작동시키는 것과 동일한 엄격한 수학적 스케일링을 채택해야 함을 알려줍니다. 이는 뇌가 오늘의 전역적 역전파 훈련을 받는 컴퓨터들이 해결하는 것과 동일한 복잡한 문제들을 풀기 위해, 실제로 국소적인 에너지 최소화 댄스를 사용하고 있을지도 모른다는 중요한 진전을 의미합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →