← 최신 논문
🤖 machine learning

NEST: Nested Event Stream Transformer for Sequences of Multisets

이 논문은 기존 평탄화 모델의 계산 비효율성과 표현 한계를 극복하기 위해 이벤트 시퀀스(다중 집합의 시퀀스)의 계층적 구조를 보존하는 NEST(중첩 이벤트 스트림 트랜스포머)를 소개하며, 사전 학습 효율성과 하류 작업 성능을 모두 향상시키기 위해 새로운 마스킹 집합 모델링 패러다임을 활용합니다.

원저자: Minghui Sun, Haoyu Gong, Xingyu You, Jillian Hurst, Benjamin Goldstein, Matthew Engelhard

게시일 2026-05-15
📖 4 분 읽기☕ 가벼운 읽기

원저자: Minghui Sun, Haoyu Gong, Xingyu You, Jillian Hurst, Benjamin Goldstein, Matthew Engelhard

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

환자의 병력을 이해하거나 고객의 쇼핑 습관을 파악하려 한다고 상상해 보세요. 현실 세계에서는 이러한 사건들이 줄에 꿰인 구슬처럼 완벽하게 한 줄로 하나씩 일어나지 않습니다. 대신, 사건들은 그룹 단위로 발생합니다.

  • 병원에서: 의사가 환자를 진료합니다 (이를 '진료 encounter'라고 합니다). 그 진료 동안 환자는 혈액 검사, 처방전, 진단을 동시에 받을 수 있습니다. 이 세 가지 사건의 정확한 순서는 중요하지 않을 수 있으며, 기록이 정리되지 않았을 수도 있습니다. 하지만 그 사건들의 그룹은 그 특정 진료에 속합니다.
  • 식료품점에서: 고객이 쇼핑을 합니다. 그들은 우유, 빵, 계란을 카트에 담습니다. 그 '장바구니'가 바로 그룹입니다. 사물을 집어 올린 순서는 중요하지 않으며, 중요한 것은 장바구니 전체입니다.

대부분의 기존 AI 모델 (Transformer 라고 불림) 은 이러한 그룹들을 단일한 긴 사건 열로 평평하게 만들려고 시도합니다. 그들은 우유, 빵, 계란이 같은 쇼핑 trip 의 일부였음을 무시한 채, 마치 그 사물들이 하나씩 차례로 발생했다고 간주합니다. 이는 영화의 각 장면이 어떻게 연결되는지 알지 못한 채 모든 프레임의 목록만 보고 영화를 이해하려는 것과 같습니다. 이는 계산 비용이 많이 들며 종종 더 큰 그림을 놓치게 만듭니다.

NEST(Nested Event Stream Transformer) 의 등장입니다.

이 논문의 저자들은 이러한 자연스러운 그룹을 존중하는 새로운 AI 모델인 NEST를 개발했습니다. 간단한 비유를 들어 작동 방식을 설명해 보겠습니다.

1. 두 단계 춤 (아키텍처)

데이터를 평평하게 만드는 대신, NEST 는 (병원 진료나 쇼핑 장바구니와 같은) '그룹'들을 그대로 유지합니다. 이는 모델의 두뇌 내 모든 레이어에서 다음과 같은 교묘한 두 단계 과정을 사용합니다.

  • 단계 A: 그룹 회합 (Set-Wise Encoder): 먼저, 모델은 한 그룹 (예: 한 번의 병원 진료) 을 보고 그 그룹 내의 모든 사건들이 서로 대화하도록 합니다. 모델은 그 진료 내에서 무엇을 발생했는지 파악합니다. 이는 각자가 특정 업무를 논의하는 팀 회의와 같습니다.
  • 단계 B: 글로벌 라운드테이블 (Cross-Set Encoder): 다음으로, 모델은 각 그룹의 '캡틴'들 ( [CLS] 라고 불리는 특수 토큰) 을 살펴봅니다. 이 캡틴들은 각자 속한 그룹에서 일어난 일들을 나머지 타임라인과 공유하기 위해 만납니다. 이를 통해 모델은 진료 A 가 진료 B 와 어떻게 관련되는지 이해하는 데 도움을 받습니다.

마법 같은 트릭: 대부분의 모델은 모든 그룹에 대해 단계 A 를 수행한 후, 모든 그룹에 대해 단계 B 를 수행합니다. 하지만 NEST 는 이를 **교차 (interleaved)**로 수행합니다. 조금씩 단계 A 를 수행하고, 조금씩 단계 B 를 수행한 뒤 다시 단계 A 로 돌아갑니다.

  • 이것이 중요한 이유: 계주 경기를 상상해 보세요. 만약 계봉을 넘기기 전에 전체 1 구역을 먼저 달린다면, 그 과정에서 일부 정보를 잃을 수 있습니다. NEST 는 계봉을 끊임없이 오가며 넘깁니다. 이는 모델이 큰 그림을 이해하려 할 때 특정 사건에서 나온 세부 사항이 손실되지 않도록 보장합니다. 이 논문은 수학적으로 이러한 '우회 (bypass)' 방식이 기존 방식보다 더 많은 정보를 살아있게 유지한다는 것을 증명했습니다.

2. '캡틴의 보고서' (마스크드 세트 모델링)

기존 방식에서는 AI 가 모든 데이터를 처리한 후, 전체 진료를 단일 점수로 요약하는 방법을 추측해야 했습니다. 이는 학생에게 vague 한 힌트만 주고 책 한 장을 읽은 후 전체 장을 요약하라고 요구하는 것과 같습니다.

NEST 는 **마스크드 세트 모델링 (Masked Set Modeling, MSM)**이라는 새로운 학습 게임을 도입합니다.

  • 작동 방식: 모델은 사건 그룹 (예: 쇼핑 장바구니) 을 보지만, 실제 항목들은 숨겨진 채로 '캡틴' 토큰을 기반으로 그 그룹의 내용을 추측해야 합니다.
  • 결과: 이로 인해 '캡틴' 토큰은 전체 그룹의 완벽한 요약본이 되도록 강요받습니다. 나중에 messy 한 추측성 요약이 필요해지는 대신, 모델은 향후 어떤 작업이든 사용할 수 있는 고품질 요약본을 이미 준비하고 있게 됩니다.

3. 왜 더 나은가 (결과)

저자들은 NEST 를 실제 세계 데이터로 테스트했습니다.

  • 의료 기록 (EHR): 병원 데이터 (MIMIC-IV) 와 사립 소아과 데이터베이스를 사용했습니다.
  • 쇼핑: 식료품 데이터 (Instacart) 를 사용했습니다.

연구 결과:

  • 더 빠르고 가벼움: NEST 는 그룹을 존중하기 때문에, 모든 단일 사건 간의 연결을 계산할 필요가 없습니다. 그룹 내부와 그룹 캡틴 간의 연결만 계산하면 됩니다. 이는 더 많은 '두뇌 능력 (파라미터)'을 가지고 있음에도 불구하고 기존 모델보다 더 빠르고 컴퓨터 메모리를 적게 사용합니다.
  • 더 똑똑한 예측: NEST 는 다음과 같은 것들을 예측하는 데 더 뛰어났습니다.
    • 환자가 입원 중 사망할까요?
    • 환자가 30 일 이내에 재입원할까요?
    • 고객이 다음에 무엇을 구매할까요?
  • 추가 '후처리' 불필요: 모델이 학습 중에 그룹을 요약하는 법을 배웠기 때문에, 데이터를 이해하기 위해 학습 후 어색한 휴리스틱 트릭을 사용할 필요가 없었습니다. 요약본은 바로 사용할 준비가 되어 있었습니다.

요약

NEST 는 문맥이 중요하다는 것을 마침내 이해하는 모델이라고 생각하세요. NEST 는 같은 병원 진료 중에 이루어진 혈액 검사와 처방전이 하나의 팀이며, 그 팀이 환자의 삶이라는 더 큰 이야기의 일부임을 알고 있습니다. 이러한 그룹들을 함께 유지하고 효율적으로 소통하게 함으로써, NEST 는 모든 것을 단일한 긴 줄로 강제로 밀어 넣으려 하는 모델들보다 더 빠르게 학습하고, 에너지를 적게 사용하며, 더 나은 예측을 수행합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →