← 최신 논문
🤖 AI

Rational Neural Networks have Expressivity Advantages

이 논문은 학습 가능한 저차 유리 함수 활성화 함수를 활용하는 신경망이 표준 고정 활성화 함수를 사용하는 신경망보다 현저히 더 높은 표현력과 파라미터 효율성을 달يث하며, 이론적으로 증명 가능하고 경험적으로 검증된 지수적 근사 이점을 제공한다는 것을 입증한다.

원저자: Maosen Tang, Alex Townsend

게시일 2026-06-25
📖 4 분 읽기☕ 가벼운 읽기

원저자: Maosen Tang, Alex Townsend

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 복잡한 퍼즐을 풀기 위해 로봇의 뇌(신경망)를 만들고 있다고 상상해 보세요. 이 뇌를 똑똑하게 만들기 위해서는 "활성화 함수(activation functions)"를 주어야 합니다. 이것들을 뇌의 스위치 또는 게이트라고 생각하면 됩니다. 이 스위치는 정보가 한 뉴런 층에서 다음 층으로 어떻게 흐를지를 결정합니다.

수년 동안 엔지니어들은 두 가지 주요 유형의 스위치를 사용해 왔습니다:

  1. "조각적(Piecewise)" 스위치: 계단과 같습니다. 날카롭고 각져 있습니다 (예: ReLU).
  2. "매끄러운(Smooth)" 스위치: 완만하고 굽이치는 언덕과 같습니다 (예: GELU, Swish, Sigmoid). 이들은 현대 AI의 챔피언입니다.

위대한 발견
이 논문은 **유리 함수 활성화(Rational Activation)**라는 새로운 유형의 스위치를 소개합니다. 이 스위치는 고정된 모양(예: 미리 만들어진 플라스틱 틀)이 아니라, 학습 가능한(trainable) 형태입니다. 이들은 "유리 함수(다항식의 분수 형태)"로 구축되었으며, 이는 AI가 해결하고 있는 특정 퍼즐에 맞춰 자신의 스위치 모양을 스스로 학습하여 재형성할 수 있음을 의미합니다.

저자들은 이 새로운 스위치가 기존의 매끄러운 스위치보다 두 가지 주요 측면에서 우월하다고 주장합니다:

1. "마법 렌즈" 비유 (효율성)

당신이 뾰족한 산봉우리를 그리려고 한다고 상상해 보세요.

  • 매끄러운 스위치 (기존 방식): 만약 매끄럽고 완만한 언덕들만을 사용하여 날카로운 산을 그리려 한다면, 그 날카로움을 흉내 내기 위해 수천 개의 작은 언덕을 겹겹이 쌓아야 합니다. 이를 제대로 구현하기 위해 많은 노력과 재료(파라미터)가 필요합니다.
  • 유리 함수 스위치 (새로운 방식): 이 스위치는 날카로운 모서리와 갑작스러운 낙차를 자연스럽게 포착할 수 있는 마법 렌즈와 같습니다. 당신은 단 몇 개의 층만으로도 동일한 산을 그려낼 수 있습니다.

수학적 마법: 이 논문은 이 새로운 유리 함수 스위치를 사용하는 네트워크가 표준 매끄러운 스위치를 사용하는 네트워크와 동일한 정확도에 도달하기 위해, 지수적으로 적은 파라미터가 필요함을 증명합니다.

  • 매끄러운 네트워크가 정확도를 위해 XX 크기가 필요하다면, 유리 함수 네트워크는 단지 log(log(X))\log(\log(X))의 크기만 필요할 수도 있습니다.
  • 쉬운 설명: 이것은 이야기를 설명하기 위해 도서관 가득 책이 필요한 것과, 단 한 페이지의 완벽하게 쓰인 글이 필요한 것의 차이와 같습니다.

2. "맥가이버 칼" vs "고정된 도구"

  • 고정된 스위치 (GELU, ReLU 등): 이것들은 망치와 같습니다. 못을 박는 데는 훌륭하지만, 나무를 자르거나 나사를 돌려야 할 때는 어려움을 겪습니다. 모양이 고정되어 있어 변할 수 없습니다.
  • 유리 함수 스위치: 이것들은 자신의 칼날을 스스로 재형성할 수 있는 맥가이버 칼과 같습니다. 데이터가 매끄러운 곡선 형태라면 스위치는 매끄러워집니다. 데이터에 날카로운 스파이크가 있다면, 스위치는 즉시 날카로운 모서리를 갖도록 변형될 수 있습니다. 형태를 적응시킬 수 있기 때문에 훨씬 더 효율적으로 복잡한 패턴을 표현할 수 있습니다.

실험 결과

저자들은 단순히 수학적 계산만 한 것이 아니라, 이를 실제 세계에서 테스트했습니다:

  • 이미지 인식 (CIFAR-10 & Tiny ImageNet): 이미지 분류기에 표준 스위치 대신 유리 함수 스위치를 적용했을 때, AI는 더 빠르게 학습하고 더 높은 정확도를 보였습니다.
    • 재미있는 사실: 한 실험에서는 유리 함수 스위치가 단독으로 이를 처리할 수 있는지 확인하기 위해 "정규화 층(normalization layers, AI의 표준 안전 장치)"을 제거해 보았습니다. 기존 스위치는 작동이 멈추고 실패했지만, 유리 함수 스위치는 계속 작동했을 뿐만 아니라 실제로 더 나은 성능을 보여주었습니다.
  • 로봇 제어 (강화 학습): 그들은 로봇이 걷는 법을 배우는 시뮬레이션 환경에서 이를 테스트했습니다. 유리 함수 스위치는 동일한 컴퓨팅 자원을 사용하여 로봇이 더 나은 전략을 배울 수 있게 해주었습니다.

주의점 (The "Safety Valve" Issue)

이 논문은 또한 하나의 경고를 발견했습니다. 유리 함수 스위치는 매우 유연하지만, 그만큼 민감합니다.

  • 비유: 매우 민민감한 마이크를 상상해 보세요. 만약 마이크를 소리를 증폭하는 스피커 바로 옆에 둔다면, 녹음물을 망치는 커다란 피드백 소음(하울링)이 발생할 것입니다. (여기서 '정규화' 층이 스피커 역할을 합니다.)
  • 해결책: 저자들은 이 유리 함수 스위치들이 가장 잘 작동하기 위해서는, 보통 그 앞에 위치하는 표준 "정규화" 층을 꺼두어야 한다는 것을 발견했습니다. 정규화 층을 제거했을 때, 유리 함수 스위치는 더욱 밝게 빛났습니다.

요약

이 논문은 학습 가능한 유리 함수 활성화 함수가 오늘날 우리가 사용하는 고정된 매끄러운 스위치보다 더 강력하고, 효율적이며, 유연한 AI 구축 도구라고 주장합니다. 이들은 훨씬 적은 "두뇌 용량(파라미터)"으로 동일한 작업을 수행할 수 있으며, 다른 스위치들이 흉내 내기 힘든 날카롭고 복잡한 패턴에 적응할 수 있습니다. 이것은 고정된 플라스틱 틀 세트에서, AI가 필요로 하는 무엇이든 될 수 있는 스스로 모양을 바꾸는 점토 세트로 업그레이드하는 것과 같습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →