← 최신 논문
🤖 machine learning

TESLA: Taylor Expansion of Sinusoidal Learnable Activations

이 논문은 일반화 성능과 강건성을 향상시키기 위해 다항식 차수를 이론적으로 제어하는 학습 가능한 사인 함수 조합에 기반한 새로운 활성화 함수인 TESLA를 소개하며, 까다로운 패리티(parity) 및 포렐레이션(Forrelation) 작업뿐만 아니라 ImageNet-100과 같은 표준 비전 벤치마크에서도 우수한 성능을 입증한다.

원저자: Daehwa Ko, Jaehyeon Kim, Seunghyun Ham, Jay Hoon Jung

게시일 2026-08-13
📖 4 분 읽기☕ 가벼운 읽기

원저자: Daehwa Ko, Jaehyeon Kim, Seunghyun Ham, Jay Hoon Jung

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

전체 그림의 퍼즐

당신이 로봇에게 얼굴을 인식하는 법을 가르치려 한다고 상상해 보세요. 당신은 사진 한 장을 보여주고, 로봇은 코를 보고, 그다음 눈을 보고, 그다음 입을 봅니다. 신경망이라고 불리는 표준적인 컴퓨터 두뇌들은 이런 종류의 '국소적(local)' 탐정 업무에 매우 능숙합니다. 이들은 단순한 단계별 스위치(마치 불을 켜거나 끄는 것과 같은)를 사용하여 작은 세부 사항들을 파악합니다. 이는 고양이 사진을 찾아내거나 문장을 번역하는 것처럼, 답이 주변의 단서들에 의존하는 일에는 놀라운 효과를 발휘합니다.

하지만 어떤 퍼즐들은 훨씬 더 까다롭습니다. 예를 들어, 아주 긴 줄의 전등 스위치가 있고, 정답이 줄 전체에 달려 있는 게임을 상상해 보세요. "켜진 스위치의 총 개수가 홀수인가 짝수인가?"라는 문제입니다. 이 문제를 풀기 위해 로봇은 단 하나의 스위치나 작은 그룹만을 봐서는 안 됩니다. 전체를 한꺼번에 세어야 합니다. 이것은 '전역적(global)'인 문제입니다. 전통적인 로봇 두뇌는 작은 부분들을 먼저 보도록 설계되어 있기 때문에 여기서 어려움을 겪습니다. 그들은 너무 작은 세부 사항에만 집중한 나머지, 큰 그림을 놓치고 길을 잃곤 합니다. 과학자들은 엄청나게 거대하거나 깊어지지 않고도 자연스럽게 이러한 거대한 전체 패턴을 이해할 수 있는 로봇 두뇌를 만들기 위해 노력해 왔습니다. 바로 여기서 TESLA라는 새로운 아이디어가 등장합니다.

음악적 활성화의 마법

이 연구를 진행한 한국항공대학교의 연구진은 이 로봇 두뇌들이 '생각하는' 새로운 방식을 제안합니다. 그들은 자신들의 발명품을 TESLA(Taylor Expansion of Sinusoidal Learnable Activations)라고 부릅니다. 그들이 무엇을 했는지 이해하기 위해, 표준적인 로봇 뉴런이 어떻게 작동하는지 살펴봅시다. 보통 뉴런은 입력을 받아 단순하고 경직된 스위치를 통과시켜 결과를 전달합니다. 이는 마치 충분히 세게 밀어야만 열리는 문과 같으며, 스스로 어떤 선율을 내거나 변화하지는 않습니다.

TESLA는 이 경직된 스위치를 악기로 대체합니다. 단순한 온/오프 버튼 대신, 뉴런은 사인(sine)과 코사인(cosine) 파동의 조합을 사용합니다. 이것은 소리나 바다의 파도처럼 부드럽게 굽이치는 파동을 생각하면 됩니다. 하지만 여기서 마법이 일어납니다. TESLA는 단순히 하나의 파동만을 사용하는 것이 아닙니다. 각기 다른 볼륨 조절 노브(knob)를 가진 여러 파동을 혼합하여 맞춤형 노래를 만들어냅니다. 로봇은 훈련 과정에서 이 노브들을 올리거나 내리는 법을 배웁니다.

이것이 왜 중요할까요? 수학의 세계에서, 이 파동들을 결합하면 복잡한 다항식(많은 굴곡이 있는 곡선)처럼 보이는 형태를 만들 수 있습니다. 노브를 조절함으로써, 로봇은 자신의 사고가 얼마나 '구불구불하게' 혹은 복잡하게 만들어질지를 결정할 수 있습니다. 문제가 단순하다면 부드러운 저주파 파동을 사용합니다. 만약 문제가 (앞서 말한 홀짝 스위치 게임처럼) 까다로운 전역적 퍼즐이라면, 표준적인 로봇들이 놓치는 복잡한 전체 패턴을 포착하기 위해 고주파 파동을 높일 수 있습니다.

"홀수 또는 짝수" 미스터리 해결하기

연구팀은 이 아이디어를 **패리티 문제(parity problem)**라고 불리는 유명하고 어려운 퍼즐로 테스트했습니다. 32개의 스위치가 있는 줄을 상상해 보세요. 로봇은 '켜진' 스위치의 총합이 홀수인지 짝수인지를 맞춰야 합니다. 이는 표준적인 로봇들에게는 악몽과 같은 일인데, 왜냐하면 답이 모든 스위치가 서로 상호작용하는 방식에 달려 있기 때문입니다.

실험에서 연구진은 100,000개의 예시를 통해 TESLA 기반의 로봇을 훈련시켰습니다. 32개 스위치의 가능한 조합이 40억 개가 넘는다는 점을 고려하면(즉, 로봇은 가능성의 아주 극소수만을 본 것입니다), TESLA 로봇은 규칙을 믿기 힘들 정도로 잘 학습했습니다. 깨끗한 데이터에 대해서는 거의 완벽한 정확도를 달了습니다. 더욱 놀라운 점은, 연구진이 데이터를 의도적으로 조작하여(답을 30% 정도 뒤집어 로봇을 속임으로써) 데이터를 망가뜨렸을 때도, TESLA 로봇은 강력하게 버티며 정확하게 예측했다는 것입니다.

반면, 오래된 방식의 스위치(ReLU 등)나 다른 파동 기반 로봇(SIREN 등)을 사용하는 "표준" 로봇들은 완전히 무너졌습니다. 스위치의 개수가 늘어남에 따라 이들의 정확도는 약 50%로 떨어졌는데, 이는 단순히 앞면이나 뒷면을 찍는 것과 다를 바 없는 수준이었습니다. 그러나 TESLA 로봇은 데이터가 노이즈로 가득하고 엉망인 상황에서도 전역적인 패턴을 볼 수 있었습니다.

수학 퍼즐에서 실제 사진으로

연구진은 수학 퍼즐에서 멈추지 않았습니다. 그들은 이 '음악적' 사고가 이미지 인식과 같은 실제 작업에도 도움이 될 수 있는지 확인하고 싶었습니다. 그들은 ResNet이나 Vision Transformer와 같은 인기 있는 로봇 두뇌 구조를 사용하여 ImageNet-100 데이터셋에 대해 TESLA를 테스트했습니다.

결과는 유망했습니다. TESLA 로봇은 이미지를 식별하는 데 있어 표준 로봇만큼 잘 수행했을 뿐만 아니라, 결정적인 차이점인 '안정성'을 보여주었습니다. 다른 파동 기반 방식(SIREN 등)을 이러한 대규모 이미지 작업에 적용했을 때, 로봇들은 불안정해지고 학습에 실패했습니다. 반면 TESLA는 저자들이 '계수 예산(coefficient budget)'이라고 부르는 세심한 노브 설계 덕분에 침착함을 유지하며 효과적으로 학습했습니다. 또한 이 과정에서 로봇의 속도를 늦추거나 크기를 키우지 않고도, 평소보다 약 1% 정도의 미미한 추가 작업만으로 이를 해냈습니다.

미래를 위한 의미

이 논문은 로봇 뉴런에게 스스로의 '주파수'와 복잡성을 조절할 수 있는 능력을 부여함으로써, 부분적인 것이 아닌 전체를 보아야 하는 문제를 해결하도록 도울 수 있음을 시사합니다. 저자들은 이 접근 방식이 단순한 이론적 기교가 아니라, 물리학 방정식을 푸는 것부터 얼굴을 인식하는 것에 이르기까지 모든 분야에서 작동하는 실용적인 도구임을 보여줍니다.

이 논문은 TESLA가 이러한 특정 테스트에서 매우 효과적임을 증명하고 표준적인 스위치를 대체할 강력한 도구가 될 수 있음을 시사하지만, 연구진은 여전히 탐구할 영역이 많다는 점을 주의 깊게 언급하고 있습니다. 그들은 이 음악적 뉴런을 컴퓨터 칩에서 어떻게 더 빠르게 만들 수 있는지, 그리고 대규모 언어 모델이 길고 복잡한 이야기를 이해하는 데 어떻게 도움을 줄 수 있을지 조사할 계획입니다. 하지만 현재로서는, TESLA가 기계에게 단순히 음표를 세는 법이 아니라 데이터 속의 음악을 듣는 법을 가르치는 영리한 새로운 방법이라는 점이 분명합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →