← 최신 논문
🤖 machine learning

Journey Operators for Structured Multi-Axis Composition

이 논문은 회전 위치 임베딩(Rotary Position Embeddings)을 콘텐츠 적응형 설정으로 일반화하는 "저니 연산자(journey operators)"를 사용하여 구조화된 다축 데이터 구성을 위한 이론적 프레임워크를 도입하고, 경로 독립성을 위한 조건으로 가환성(commutativity)을 확립하며, 비전, 언어 및 길이 일반화 작업에서 성능 향상을 위해 이러한 귀납적 편향(inductive biases)을 활용하는 JoFormer 모델을 제안한다.

원저자: Mahesh Godavarti

게시일 2026-07-30
📖 5 분 읽기🧠 심층 분석

원저자: Mahesh Godavarti

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 거대한 마법 도서관을 만들려고 노력하고 있다고 상상해 보세요. 그곳의 모든 책은 자신이 선반의 정확히 어디에 속해 있는지 알고 있습니다. 인공지능, 특히 문장을 읽거나 이미지를 보는 종류의 AI 세계에서, 이 "책"들은 단어나 픽셀 같은 데이터 조각들입니다. 오랫동안 컴퓨터는 이러한 조각들이 무엇인지(내용)는 아주 잘 이해해 왔지만, 그것들이 서로에 대해 상대적으로 어디에 있는지(위치)는 조금 어려워했습니다. 이것을 "위치 인코딩(positional encoding)"이라고 부릅니다. 이것은 데이터의 GPS와 같습니다. 위치 인코딩이 없다면, 컴퓨터는 문장에 "개"와 "사람"이 있다는 것은 알 수 있지만, 개가 사람을 물었는지 아니면 사람이 개를 물었는지는 알 수 없습니다.

이를 해결하기 위해 과학자들은 수학을 사용하여 모든 데이터 조각에 위치에 따른 아주 작고 보이지 않는 "회전"을 부여합니다. 나침반 바늘이 오른쪽으로 한 걸음 갈 때마다 약간씩 회전하고, 아래로 한 걸음 갈 때마다 또 다르게 회전하는 것을 상상해 보세요. 만약 당신이 오른쪽으로 이동한 다음 아래로 이동한다면, 나침반 바늘은 아래로 이동한 다음 오른쪽으로 이동했을 때와 같은 지점에 있어야 합니다. 이렇게 공간을 이동하며 방향을 추적하는 아이디어가 우리가 탐구할 논문의 기초입니다. 이 논문은 단순하지만 심오한 질문을 던집니다. "우리가 이 '회전'들을 완벽하게 조화시켜서, 컴퓨터가 텍-스트의 줄이든, 픽셀의 격자든, 혹은 3D 볼륨이든 상관없이 세상의 구조를 이해하게 만들 수 있을까?"


데이터의 여정

"구조적 다축 구성을 위한 여정 연산자(Journey Operators for Structured Multi-Axis Composition)"라는 제목의 이 논문은 데이터가 AI 내부에서 어떻게 이동하고 섞이는지에 대한 새로운 방식을 소개합니다. Mahesh Godavarti가 이끄는 저자들은 모든 데이터 조각이 단순히 그 내용(예: "고양이"라는 단어나 빨간색 픽셀)뿐만 아니라, 움직일 수 있는 모든 방향에 대한 작은 "변환" 또는 "회전"을 함께 운반하는 프레임워크를 제안합니다.

재기발랄한 비유를 들어보겠습니다. 모든 데이터 포인트를 배낭을 멘 여행자라고 상상해 보세요. 표준적인 AI 모델에서 배낭은 그저 여행자의 물건을 담고 있을 뿐입니다. 하지만 이 새로운 프레임워크에서는, 모든 여행자가 모든 방향(위, 아래, 왼쪽, 오른쪽)으로 걸어갈 수 있는 특별한 "나침반"을 함께 가지고 있습니다. 두 여행자가 만나서 그들의 이야기를 결합할 때(이것이 AI가 데이터를 처리하는 방식입니다), 첫 번째 여행자는 자신의 나침반을 사용하여 두 번째 여행자의 배낭을 결합하기 전에 회전시킵니다. 이 회전은 첫 번째 여행자가 어디에 서 있느냐에 따라 두 번째 여행자의 이야기가 전달되는 방식을 변화시킵니다.

논문에서는 이 과정을 "여정(journey)"이라고 부릅니다. 만약 당신이 점 A에 있는 데이터 조각이 점 B에 있는 데이터 조각과 어떻게 관계를 맺는지 알고 싶다면, A에서 B까지 걸어갔을 때 얻게 될 전체 회전값인 "여정 연산자(journey operator)"를 계산하면 됩니다.

거대한 발견: "평평한" 세계 vs "휘어진" 세계

이 논문에서 가장 흥ile한 부분은 이러한 여정들이 타당한지를 결정하는 규칙을 발견한 것입니다. 저자들은 AI가 "오른쪽으로 이동한 후 아래로 이동하는 것"이 "아래로 이동한 후 오른쪽으로 이동하는 것"과 같다는 것을 이해하기 위해서는(이를 **경로 독립성(path independence)**이라고 합니다), 나침반(회전)들이 **가환(commute)**해야 한다는 것을 발견했습니다.

수학적으로 "가환(commuting)"한다는 것은 연산의 순서가 중요하지 않음을 의미합니다. 만약 종이를 오른쪽으로 90도 회전시킨 다음 아래로 90도 회전시키면, 아래로 먼저 회전시킨 다음 오른쪽으로 회전시킨 결과와 달라질 수 있습니다. 단, 당신의 회전이 특별한 경우를 제외하고 말이죠. 논문은 만약 회전이 "평평하다면"(즉, X축과 Y축을 독립적으로 회전시키는 것처럼 데이터의 서로 간섭하지 않는 별개의 부분에 작용한다면), 그 여정이 일관될 것임을 증명합니다. 하지만 회전이 "휘어져 있다면"(즉, 서로 간섭한다면), 여정은 당신이 취한 정확한 경로에 따라 달라지며, 이는 AI를 혼란스럽게 할 수 있습니다.

이 논문은 이러한 AI 모델을 구축하는 가장 좋은 방법은 "평평한" 영역을 고수하는 것이라고 제안합니다. 이것이 기존의 방식인 RoPE(Rotary Position Embedding)가 왜 그렇게 잘 작동하는지를 설명해 줍니다. RoPE는 자연스럽게 가환하며 평평한 회전을 사용하기 때문입니다. 논문은 만약 더 복잡하고 엉킨 회전(dense, tangled rotations)을 사용하려고 시도한다면, 일관된 방향 감각을 잃게 되어 위치 구조가 무너진다는 것을 보여줍니다.

새로운 모델: JoFormer

이 이론을 바탕으로 저자들은 JoFormer(Journey-based Transformer)라는 새로운 모델을 설계했습니다. 여기서 핵심 혁신은 JoFormer가 단순히 이전 모델들처럼 한 단어가 다른 단어에 얼마나 주의를 기울여야 하는지(attention score)를 결정하기 위해 이 회전을 사용하는 것이 아니라, 데이터(the "values")가 결합되기 전에 실제 데이터를 *변형(transform)*하는 데에도 이 회전을 사용한다는 점입니다.

이렇게 생각해 보세요. 기존 모델에서 AI는 "나는 '짖다' 근처에 있기 때문에 '개'라는 단어에 관심이 있다"라고 말할 수 있습니다. 하지만 JoFormer에서 AI는 "나는 '개'라는 단어에 관심이 있으며, 또한 '개'의 의미를 나로부터 얼마나 떨어져 있는지에 따라 '회전'시켜서, 내 현재 문장에 완벽하게 들어맞도록 만들겠다"라고 말합니다.

논문은 JoFormer를 세 가지 다른 유형의 작업에 대해 테스트했습니다:

  1. 비전 (이미지): CIFAR-100과 ImageNet에 대해 테스트했습니다. 결과는 이 "값의 회전(value rotation)"(데이터를 회전시키는 것)을 추가하는 것이 모델의 시각 능력을 향상시킨다는 것을 시사합니다. 예를 들어, CIFAR-100에서 특정 버전의 JoFormer는 표준 방식보다 정확도가 약 2% 향상되었습니다. ImageNet에서는 0.40%의 작지만 일관된 이득을 보였습니다.
  2. 언어 (텍스트): 위키피디아 언어 모델을 테스트했습니다. 결과는 새로운 모델(특히 회전이 텍스트의 내용에 의존하는 "투영된" 버전)이 다음 단어를 더 잘 예측하여, 표준 모델보다 낮은 "퍼플렉시티(perplexity, 모델이 얼마나 놀라는지를 나타내는 척도)"를 달성했음을 보여줍니다.
  3. 길이 일반화 (Length Generalization): 이것은 멋진 테스트입니다. 그들은 모델을 짧은 문장(512 단어)으로 학습시킨 후, 훨씬 긴 문장(최대 4096 단어)을 읽게 했습니다. 표준 모델은 매우 혼란스러워하며 성능이 급격히 떨어졌습니다. 그러나 JoFormer는 긴 텍스트를 훨씬 더 잘 처리했으며, 표준 모델이 6.29배나 급락한 것에 비해 성능 저하가 매우 적었습니다(1.02배 비율).

이 논문이 주장하지 않는

이 논문이 무엇을 주장하지 않는지 명확히 하는 것이 중요합니다. 저자들은 자신들의 결과가 "단일 시드 산티티 체크(single-seed sanity checks)"라고 매우 신중하게 언급합니다. 이는 그들이 원리가 작동하는지 확인하기 위해 특정 무작위 시작점에서 실험을 한 번 수행한 것이지, 자신들이 세상에서 가장 뛰어난 AI를 만들었다고 주장하는 것이 아님을 의미합니다. 그들은 자신들의 결과가 아직 "최첨단(state-of-the-art)" 벤치마크 기록이라고 주장하지 않습니다.

또한 그들은 특정 아이디어들을 배제합니다. 예를 들어, 그들은 만약 더 단순하고 평평한 회전 대신 더 완전하고 복잡한 회전 시스템(전체 직교군 O(d)O(d))을 사용하려고 한다면, AI가 위치에 대한 모든 감각을 잃게 된다는 것을 증명했습니다. 이는 마치 모든 거리 표지판이 서로 다른 방향을 가리켜서 혼란스러운 도시를 항해하는 것과 같으며, 모델은 위치를 파악하는 것을 포기하게 됩니다.

요약

간단히 말해, 이 논문은 AI가 구조를 이해하게 만드는 비결이 단순히 더 많은 데이터를 추가하거나 더 큰 컴퓨터를 사용하는 것이 아니라, 어떤 방향으로 돌더라도 동일하게 작동하는 일관된 수학적 "나침반"을 데이터에 부여하는 것이라고 주장합니다. 이러한 나침반들이 서로 충돌하지 않도록(가환) 보장하고, 데이터가 네트워크를 통과할 때 실제로 데이터를 회전시키는 데 이들을 사용함으로써, 저자들은 이미지, 텍텍스트, 그리고 긴 시퀀스를 처리하기 위한 더 견고한 방법을 제시하는 JoFormer라는 모델을 만들어냈습니다.

이 논문이 모든 것을 해결했다고 주장하는 것은 아니지만, 특정 방법들이 왜 작동하는지에 대한 강력한 이론적 지도를 제공하며, 더 똑똑하고 구조화된 AI 시스템을 구축하기 위한 새롭고 유망한 길을 제시합니다. 실험 결과는 이 접근 방식이 특히 긴 입력이나 복잡한 시각적 패턴을 다룰 때 실질적이고 관찰 가능한 이점을 제공한다는 것을 보여주지만, 그 잠재력을 완전히 이해하기 위한 여정은 이제 막 시작되었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →