← 최신 논문
💻 computer science

GRAMformer: Any-Order Modality Interactions via Volumetric Multimodal Cross-Attention

이 논문은 쿼리(query)와 키(key) 벡터의 결합된 기하학적 부피를 기반으로 어텐션 점수를 계산함으로써 기존의 쌍별(pairwise) 또는 연결(concatenated) 방식의 한계를 극복하고, 임의 차수의 모달리티 상호작용을 효율적으로 모델링하기 위해 볼륨트릭 멀티모달 교차 어텐션(Volumetric Multimodal cross-Attention, VMA)을 채택한 새로운 멀티모달 트랜스포머 아키텍처인 GRAMformer를 소개한다.

원저자: Giordano Cicchetti, Eleonora Grassucci, Danilo Comminiello

게시일 2026-06-05
📖 3 분 읽기☕ 가벼운 읽기

원저자: Giordano Cicchetti, Eleonora Grassucci, Danilo Comminiello

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

세 명의 친구가 동시에 이야기를 들려주는 복잡한 상황을 이해하려고 한다고 상상해 보세요. 한 명은 말하고 있고, 한 명은 영상을 보여주고 있으며, 다른 한 명은 음악을 연주하고 있습니다.

과거의 방식: "일대일" 인터뷰
현재 대부분의 스마트폰에 탑재된 것과 같은 기존 AI 모델들은 이 이야기를 이해하기 위해 각 친구를 따로 인터뷰합니다.

  • 먼저, AI는 화자에게 "음악에 대해 어떻게 생각하니?"라고 묻습니다.
  • 그다음, AI는 화자에게 "영상에 대해 어떻게 생각하니?"라고 묻습니다.
  • 마지막으로, AI는 화자에게 "영상과 음악을 함께 고려했을 때 어떻게 생각하니?"라고 묻습니다.

문제는 AI가 음악과 영상을 서로 모르는 사이처럼 취급한다는 점입니다. AI는 "음악과 영상이 결합되었을 때 화자가 하는 말의 의미를 어떻게 변화시키는가?"라는 질문은 던지지 않습니다. 즉, 세 가지 요소가 정확히 같은 순간에 하나로 맞물릴 때 발생하는 마법 같은 효과를 놓치게 됩니다. 또한, 만약 네 번째 친구(예: 온도 센서)가 추가된다면, AI는 더 많은 개별 인터뷰를 수행해야 하므로, 마치 성장하는 팀을 위해 일일이 미팅 일정을 잡으려는 매니저처럼 점점 느려지고 더 많은 메모리를 필요로 하게 됩니다.

새로운 방식: "그룹 허들" (GRAMformer)
이 논문의 저자인 지오르다노 치케티(Giordano Cicchetti)와 그의 팀은 GRAMformer라는 새로운 시스템을 구축했습니다. 이들은 개별적인 인터뷰를 하는 대신, **체적 다중 모달 교차 주의(Volumetric Multimodal Cross-Attention, VMA)**라는 "그룹 허들" 메커니즘을 만들었습니다.

작동 방식은 다음과 같은 간단한 비유를 통해 설명할 수 있습니다.

1. 대화의 "형태"

화자, 영상, 오디오가 공간에 떠 있는 세 개의 막대기라고 상상해 보세요.

  • 기존 AI: 단순히 화자가 영상과 얼마나 가까운지, 그리고 화자가 오디오와 얼마나 가까운지만 측정합니다. 이 세 막대기가 만드는 전체적인 형상은 무시합니다.
  • GRAMformer: 세 막대기를 모두 연결했을 때 만들어지는 3D 형태(부피)를 살펴봅니다.
    • 만약 막대기들이 모두 같은 방향을 가리키고 있다면(정렬되어 있다면), 그 형태는 평평하며 부피가 거의 없습니다.
    • 만약 막대기들이 서로 다른 방향을 가리키고 있지만 여로 일관된 구조를 형성하고 있다면, 그 형태는 특정한 부피를 가집니다.
    • AI는 이 "부피"를 점수로 사용합니다. AI는 이렇게 묻습니다: "이 세 가지 정보 조각들이 결합되어 견고하고 의미 있는 형태를 이루는가?"

이를 통해 AI는 세 가지(또는 그 이상) 요소의 관계를 쌍별로 추측하는 것이 아니라, 세 요소 간의 결합된 관계를 즉각적으로 이해할 수 있습니다.

2. 왜 더 똑똑하고 가벼운가요?

  • 더 이상의 "이차 함수적" 혼란은 없습니다: 기존 방식에서는 새로운 친구가 추가될 때마다 AI가 두 배의 일을 해야 합니다. 이는 파티에 사람 한 명을 초대했을 뿐인데, 갑자기 모든 사람 사이의 짝을 지어 미팅을 잡아야 하는 것과 같습니다.
  • GRAMformer의 해결책: 이 모델은 "그룹 부피"를 한꺼번에 살펴보기 때문에, 친구를 더 추가하더라도 수학적 계산량이 폭발적으로 늘어나지 않습니다. 이는 모든 사람에게 일일이 전화를 거는 전화 통보 방식이 아니라, 모두가 동시에 말하는 단체 채팅방처럼 효율적입니다.

3. 무엇을 테스트했나요?

연구팀은 컴퓨터가 인간의 감정과 행동을 이해해야 하는 작업들을 대상으로 이 새로운 "그룹 허들" 시스템을 테스트했습니다. 이들은 다음을 포함하는 데이터셋을 사용했습니다:

  • 감성 분석 (Sentiment Analysis): 텍스트, 목소리, 얼굴 표정을 종합적으로 살펴봄으로써 특정 영상 클립이 행복한지, 슬픈지, 혹은 화가 났는지 판단합니다.
  • 유머와 풍자 (Humor and Sarcasm): 농담이 정말 재미있는 것인지 아니면 비꼬는 것인지 파악합니다.
  • 로보틱스 (Robotics): 로봇이 시각적 데이터와 함께 힘 및 촉각 센서를 이해하도록 돕습니다.

결과:
이 테스트에서 GRAMformer는 기존의 시스템보다 "그룹의 분위기(group vibe)"를 더 잘 이해할 수 있었습니다. 감정과 풍자를 맞히는 데 있어 더 높은 점수를 기록했으며, 비교 대상이 된 무겁고 복잡한 모델들보다 더 적은 컴퓨터 메모리더 적은 파라미터(필요한 "두뇌 능력")를 사용하여 이를 수행해 냈습니다.

요약

기존의 AI를 용의자들을 한 명씩 인터뷰하여 진실을 추측하려는 형사라고 생각해보세요. GRAMformer는 모든 용의자를 한 방에 모아 놓고 그들이 서로 어떻게 상호작作用하는지를 관찰함으로써 전체 그림을 즉각적으로 파악하는 형사입니다. 이 모델은 더 빠르고, 더 가벼우며, 서로 다른 정보 조각들이 어떻게 하나의 팀으로서 작동하는지를 훨씬 더 잘 이해합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →