← 최신 논문
🤖 machine learning

Heteroscedastic Diffusion for Multi-Agent Trajectory Modeling

본 논문은 네 가지 스포츠 데이터셋에서 기존 최첨단 방법들을 능가하며, 생성된 모드에 대한 상태별 이분산 불확실성 추정과 오차 확률 순위 제공과 동시에 다중 에이전트 궤적 완성 및 예측을 수행하는 통합 확산 모델인 U2Diffine 를 소개합니다.

원저자: Guillem Capellera, Antonio Rubio, Luis Ferraz, Antonio Agudo

게시일 2026-05-12
📖 4 분 읽기☕ 가벼운 읽기

원저자: Guillem Capellera, Antonio Rubio, Luis Ferraz, Antonio Agudo

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

혼란스러운 농구 경기를 보고 있다고 상상해 보세요. 선수들이 질주하고, 패스하고, 서로를 피하며 움직입니다. 이제 여러분이 코치라면 다음 몇 초 동안 모든 선수가 어디에 있을지 예측하려 할 것입니다. 또는 비디오 편집자라면 카메라가 잠시 선수를 추적하지 못해 생기는 결함을 수정하려 할 것입니다. 이때 '누락된 프레임'을 채워 비디오가 다시 매끄럽게 보이게 해야 합니다.

이 논문은 바로 그 일을 수행하도록 설계된 새로운 컴퓨터 두뇌, 즉 AI 모델인 U2Diffine(그리고 더 빠른 버전인 U2Diff)을 소개합니다. 이 모델은 여러 사람 (또는 사물) 의 이동 경로를 동시에 예측하고 복구하는 역할을 합니다.

다음은 그들이 수행한 작업을 간단한 비유로 설명한 내용입니다:

1. 문제: 미래 (그리고 과거) 를 추측하기

대부분의 이동 예측 AI 모델은 과거만 보고 미래를 추측하는 점술사와 같습니다. 그들은 "네가 어디에 있었는지에 기반하면, 너는 아마도 여기로 갈 것이다"라고 말합니다.

  • 결함: 그들은 종종 '만약에'라는 시나리오를 무시합니다. 실제 경기에서 선수는 멈추거나, 방향을 틀거나, 막힐 수 있습니다. 하지만 AI 는 보통 그 추측에 대한 신뢰도를 알려주지 않은 채, 하나의 '최고의 추측' 경로나 몇 가지 무작위 추측만 제시합니다.
  • 부족한 부분: AI 가 불확실할 때는 "내가 확신하지 못해, 이 넓은 원 안 어디든 경로일 수 있다"라고 말해야 합니다. 확신할 때는 "내가 매우 확신해, 경로는 이 작은 선이다"라고 말해야 합니다. 이 논문은 이를 '불확실성'이라고 부릅니다.

2. 해결책: '불확실성 인지' 확산 모델

저자들은 **확산 모델 (Diffusion Models)**을 기반으로 한 시스템을 구축했습니다. 확산을 점토로 작업하는 조각가로 생각하세요.

  • 과정: 완벽한 동상 (실제 이동 경로) 이 있다고 가정해 봅시다. AI 는 먼저 이를 노이즈 (무작위 정적) 덩어리로 바꿉니다. 그런 다음, 그 노이즈를 동상으로 되돌리는 방법을 단계별로 학습합니다.
  • 전환점: 보통 조각가는 동상이 올바르게 보이게 하려고 노력합니다. 하지만 저자들은 그들의 조각가에게 매 단계마다 손이 얼마나 흔들리는지에 대한 정신적 메모를 남기도록 가르쳤습니다.
    • 손이 흔들리면, AI 는 경로 주변에 크고 흐릿한 구름을 그립니다.
    • 손이 안정적이면, AI 는 꽉 조여진 정밀한 선을 그립니다.
  • 결과: AI 는 단순히 경로만 제공하는 것이 아니라, 예측이 위험한 부분과 안전한 부분을 정확히 보여주는 신뢰도 지도와 함께 경로를 제공합니다.

3. 두 가지 버전: '정밀함' 대 '속도'

저자들은 서로 다른 필요에 맞춰 이 AI 의 두 가지 버전을 만들었습니다:

  • U2Diffine (정밀 조각가): 이 버전은 매우 신중합니다. 노이즈에서 실제 세계로 불확실성이 어떻게 퍼지는지 정확히 계산하기 위해 복잡한 수학 (1 차 테일러 근사라고 함) 을 사용합니다. 이는 밀리미터 단위로 측정하는 대가 조각가와 같습니다. 가장 정확하지만 실행 시간이 더 오래 걸립니다.
  • U2Diff (스피드 스타): 이 버전은 시간을 절약하기 위해 복잡한 수학을 생략합니다. 모든 무거운 계산을 수행하지 않고 불확실성에 대해 현명한 추측을 합니다. 정밀 버전보다 약 4 배 빠르며, 경로 예측 능력은 거의 비슷하지만 '신뢰도 지도' 측면에서는 약간 덜 정밀합니다.

4. '순위 매기기' 보조자 (RankNN)

때때로 AI 는 20 개의 서로 다른 가능한 미래 (20 개의 다른 '만약에' 시나리오) 를 생성합니다. 어떤 것이 가장 발생할 가능성이 높은지 어떻게 알 수 있을까요?

  • 옛 방법: 가장 '매끄러운' 것을 선택할 수 있습니다.
  • 새 방법 (RankNN): 저자들은 20 개의 모든 시나리오를 살펴보고 각 시나리오에 틀릴 가능성 점수를 부여하는 특별한 '심판'(신경망) 을 추가했습니다.
  • 비유: 스포츠 분석가가 20 개의 다른 경기 리플레이를 보고 있다고 상상해 보세요. 단순히 추측하는 대신, 이 분석가는 선수들의 움직임과 예측의 '흔들림'을 살펴가며 "시나리오 #3 은 90% 확률로 맞을 가능성이 높지만, 시나리오 #15 는 아마 틀릴 것이다"라고 말합니다. 이를 통해 자동으로 최고의 예측을 선택할 수 있습니다.

5. 어디에서 테스트했나요?

그들은 의료 데이터나 자율주행차로 테스트하지 않았습니다 (논문에서 그렇게 언급하지 않는 한, 실제로도 언급하지 않았습니다). 그들은 엄격하게 스포츠 데이터로만 테스트했습니다:

  • 농구: 10 명의 선수와 공을 추적.
  • 미식축구: 22 명의 선수와 공을 추적.
  • 축구: 22 명의 선수와 공을 추적.

6. 큰 승리

이 논문은 그들의 방법이 현재 최첨단 (State-of-the-Art) 방법보다 두 가지 주요 측면에서 더 뛰어나다고 주장합니다:

  1. 정확성: 특히 비디오의 누락된 부분을 '수정'할 때 (궤적 완성), 선수들이 어디에 있을지 더 정확하게 예측합니다.
  2. 신뢰성: 자신이 불확실할 때를 훨씬 더 잘 파악합니다. AI 가 "내가 확신하지 못해"라고 말하면, 실제로 상황이 혼란스럽거나 예측하기 어려운 경우가 많습니다. 이는 스포츠 영상 복원 같은 실제 응용 분야에서 시스템을 훨씬 더 신뢰할 수 있게 만듭니다.

요약하자면: 그들은 컴퓨터가 스포츠를 보고, 선수의 움직임을 예측하며, 손상된 비디오 기록을 수정하는 더 스마트한 방법을 개발했습니다. 그리고 추측할 때와 확신할 때를 솔직하게 인정하도록 만들었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →