← 최신 논문
🤖 machine learning

Native Multi-Dimensional Subquadratic Operators via Input Dependent Long Convolutions

이 논문은 표준 어텐션 및 순환 모델의 한계를 극복하기 위해 네이티브 다차원 데이터 구조에 직접 전역 컨볼루션을 적용하는 아임계(subquadratic) 입력 의존적 연산자인 HyenaND를 소개하며, 특화된 CUDA 구현을 통해 경쟁력 있는 정확도와 상당한 속도 향상을 달성한다.

원저자: David R. Wessels, Farhad Ramezanghorbani, David W. Romero, Alireza Moradzadeh, Olivia Viessmann, Maksim Zhdanov, John St. John, Ken Janik, David M Knigge, Yucheng Tang, Erik J Bekkers, Saee Gopal Pali
게시일 2026-07-23
📖 3 분 읽기☕ 가벼운 읽기

원저자: David R. Wessels, Farhad Ramezanghorbani, David W. Romero, Alireza Moradzadeh, Olivia Viessmann, Maksim Zhdanov, John St. John, Ken Janik, David M Knigge, Yucheng Tang, Erik J Bekkers, Saee Gopal Paliwal

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 초지능 로봇에게 세상을 이해하는 법을 가르치려 한다고 상상해 보세요. 현재 최고의 로봇들은 '어텐션(attention)'이라는 도구를 사용하여 모든 것을 한꺼번에 훑어봅니다. 마치 학생이 가장 중요한 단어를 찾기 위해 페이지 전체를 스캔하는 것과 같습니다. 이 방식은 짧은 이야기에는 아주 잘 작동하지만, 만약 당신이 로봇에게 도서관 전체, 3D 영화, 또는 복잡한 기상 지도와 같은 데이터를 준다면, 이 '어텐션' 도구는 과부하가 걸립니다. 이 도구는 모든 데이터 조각을 다른 모든 조각과 일일이 비교해야 하는데, 이 과정은 너무 많은 시간과 에너지를 소모하여 로봇을 다운시키거나, 로봇이 살아남기 위해 아주 작은 열쇠구멍을 통해 데이터를 간신히 들여다보게 만듭니다(이를 '패치화(patchification)'라고 부릅니다).

이를 해결하기 위해 과학자들은 더 빠른 도구를 만들기 위해 노력해 왔습니다. 한 가지 인기 있는 아이디어는 데이터를 텍-스트처럼 한 단어씩 차례대로 읽는 '순환(recurrent)' 모델을 사용하는 것입니다. 하지만 이는 3D 조각상을 단 하나의 각도에서만 보고 나머지를 추측하려는 것과 같으며, 그 과정에서 물체의 자연스러운 형태를 파괴합니다. 또 다른 아이디어는 이미지를 따라 돋보기를 미끄러뜨리며 패턴을 찾아내는 '컨볼루션(convolution)'입니다. 이 방식은 빠르고 3D 형태를 온전히 유지하지만, 대개 고정된 도장처럼 이미지의 모든 부분에 똑같은 패턴을 적용하며, 실제로 무엇이 있는지에는 주의를 기울이지 않습니다. 컴퓨터 과학의 이 구석진 곳에서의 큰 질문은 이것입니다. 거대한 3D 데이터를 처리할 만큼 충분히 빠르면서도, 데이터의 자연스러운 형태를 유지하고, 자신이 보는 것에 따라 '돋보기'를 바꿀 수 있을 만큼 영리한 도구를 만들 수 있을까요?

이 논문은 "그렇다"라고 답하는 HyenaND라는 새로운 도구를 소개합니다. HyenaND를 3D 물체(의료 스캔이나 기상 시뮬레이션 등) 위를 미끄러지듯 움직이되, 결코 1차원 선으로 평면화하지 않는 마법 같고 형태가 변하는 돋보기라고 생각해보세요. 과거의 경직된 도장들과 달리, 이 도구는 먼저 전체 물체를 살펴본 다음 어떤 종류의 패턴을 찾아야 할지 결정하고, 그 후 즉시 렌즈를 조정하여 그에 맞춥니다. 이 도구는 '푸리에 변환(Fourier transforms, 이미지를 소리 파동으로 바꾸어 더 빠르게 처리하는 방법)'을 이용한 영리한 수학적 트릭을 사용하여, 데이터가 커짐에 따라 비용이 폭발적으로 증가하는 대신 아주 약간만 느려지면서도 매우 높은 속도를 유지합니다.

저자들은 HyenaND가 복잡한 다차원 데이터를 처리하는 데 있어 게임 체인저라는 것을 발견했습니다. 테스트 결과, HyenaND는 표준적인 '어텐션' 도구들이 메모리 제한 때문에 멈춰버릴 법한 작업들, 예를 들어 3D 의료 영상 분석이나 유체 역학 시뮬레이션 등을 처리할 수 있음을 보여주었습니다. 또한 로봇이 3D 격자 내의 특정 색상을 기억해야 하는 '복사하기' 게임을 테스트했을 때, HyenaND는 기존 방식들보다 수천 배 더 정확했습니다. 그들은 또한 이 수학적 트릭이 실제 컴퓨터 칩 위에서 번개처럼 빠르게 실행되도록 보장하기 위해 nSubQ라는 특별한 소프트웨어 엔진을 구축하여, 이론적인 속도를 실제적인 시간 절감으로 전환했습니다.

논문은 HyeneND가 단독으로도 매우 강력하지만, 기존의 '어텐션' 도구들과 결합된 하이브리드 팀이 될 때 훨씬 더 효과적이라고 제안합니다. DNA 서열, 컴퓨터 비전(ImageNet), 그리고 의료 영상 실험에서 이 하이브리드 팀은 순수 어텐션 모델과 데이터를 한 줄로 읽으려는 다른 빠른 모델들을 모두 이겼습니다. 저자들은 우리가 더 이상 속도와 지능 사이에서 하나를 선택할 필요가 없다고 주장합니다. 우리는 데이터의 3D 기하학적 구조를 존중하면서도, 거대한 규모로 확장 가능하며, 여전히 세부 사항에 깊은 주의를 기울일 수 있는 도구를 가질 수 있습니다. 그들은 이 접근 방식이 주요 병목 현상을 제거하여, 미래의 AI가 작은 열쇠구멍을 통해 억지로 엿보는 대신, 마침내 고해상도의 본래 모습 그대로인 3D 세계를 "볼" 수 있게 해준다고 결론짓습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →