← 최신 논문
🤖 AI

Ultralytics YOLO26: Unified Real-Time End-to-End Vision Models

Ultralytics YOLO26은 듀얼 헤드 아키텍처와 고급 훈련 전략을 통해 비최대 억제(NMS)와 분포 초점 손실(DFL)을 제거함으로써, 탐지, 세그멘테이션, 포즈 추정 및 오픈 보캐블러리 추론을 포함한 다양한 작업에서 최첨단 정확도-지연 시간 성능을 달나하는 실시간 엔드 투 엔드 비전 모델의 통합 패밀리를 도입합니다.

원저자: Glenn Jocher, Jing Qiu, Mengyu Liu, Shuai Lyu, Fatih Cagatay Akyon, Muhammet Esat Kalfaoglu

게시일 2026-06-03
📖 4 분 읽기☕ 가벼운 읽기

원저자: Glenn Jocher, Jing Qiu, Mengyu Liu, Shuai Lyu, Fatih Cagatay Akyon, Muhammet Esat Kalfaoglu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 비디오 스트림에서 실시간으로 물체를 포착하는 임무를 맡은 초고속 보안 요원이 있다고 상상해 보세요. 수년 동안 최고의 요원들(YOLO 모델이라 불리는)은 매우 뛰어났지만, 몇 가지 짜증 나는 습관이 있었습니다. 그들은 물체를 발견한 후 약간의 "재확인" 단계를 거쳐야 했고, 속도를 늦추는 무거운 데이터 배낭을 메고 다녔으며, 훈련 규칙이 너무 엄격하여 작고 멀리 있는 물체를 놓치기도 했습니다.

이 논문은 이전보다 더 빠르고, 가볍고, 더 날카로워지도록 설계된 새로운 세대의 비전 요원인 YOLO26을 소개합니다. 여기에는 이들이 기존의 문제들을 어떻게 해결했는지 일상적인 비유를 들어 설명되어 있습니다.

1. "재확인 금지" 규칙 (NMS-Free 추론)

기존의 문제: 이전에는 경비원이 자동차를 발견하면, 자동차를 약간씩 다른 위치에서 세 번 또는 네 번 발견할 수 있었습니다. 그러면 그들은 가장 좋은 추측 하나를 고르고 중복된 것들을 버리기 위해 느리고 수동적인 "NMS(Non-Maximum Suppression)"라는 재확인 과정을 수행하며 멈춰 서야 했습니다. 이는 시간을 잡아먹었습니다.
YOLO26의 해결책: YOLO26은 듀얼 헤드(dual-head) 설계를 사용합니다. 이것은 두 명의 전문화된 작업자가 있는 것과 같습니다.

  • 작업자 A (스피드스터): 이 작업자는 모든 물체에 대해 즉시 정확히 하나의 완벽한 추측을 선택하도록 훈련되었습니다. 재확인이 필요 없습니다. 마치 첫 시도에 바로 목표물을 맞히는 저격수와 같습니다.
  • 작업자 B (맥시마이저): 이 작업자는 여전히 모든 것을 살펴보고, 만약 당신이 절대적인 최고 정확도가 필요하고 추가적인 "재확인" 시간을 감수할 수 있다면 사용될 수 있습니다.
    결과: 당신은 이미지를 보는 것에서부터 곧바로 정답을 내놓는, 즉 중간에 멈춰서 제2의 의견을 구할 필요가 없는 "엔드 투 엔드(end-to-end)" 시스템을 얻게 됩니다.

2. 무거운 배낭 버리기 (DFL 제거)

기존의 문제: 최근의 모델들은 무거운 "DFL(Distribution Focal Loss)" 배낭을 메고 다녔습니다. 이 배낭은 모든 가장자리마다 16가지의 서로 다른 가능성 목록 중에서 크기를 예측하려고 노력했습니다. 이는 모델을 무겁게(메모리 점유) 만들고, 특히 작은 모델들의 경우 속도를 느리게 만들었습니다. 또한 "최대 크기" 제한이 있어서, 물체가 목록보다 너무 크면 모델이 혼란에 빠졌습니다.
YOLO26의 해결책: 그들은 배낭을 던져버렸습니다. 목록에서 추측하는 대신, 모델은 이제 메뉴에서 고르는 대신 직접 자로 재듯이 크기를 측정합니다.
결과: 모델은 더 가볍고 빨라졌으며, 이제 "천장"에 부딪히지 않고도 매우 큰 물체를 정확하게 측정할 수 있습니다.

3. "작은 물체" 안전망 (STAL)

기존의 문제: 예전의 훈련 규칙은 "특정 격자 안에만 숨을 수 있다"는 규칙이 있는 숨바꼭질 게임과 같았습니다. 만약 아주 작은 물체(예: 멀리 있는 새)가 격자 칸보다 작다면, 경비원은 단순히 그것을 볼 수 없었습니다. 모델은 그 물체에 주의를 기울이지 않았고 훈련 과정에서도 무시되었습니다.
YOLO26의 해결책: 이들은 STAL(Small-Target-Aware Label Assignment)을 도입했습니다. 작은 것들을 위한 특별한 돋보기를 경비원에게 준 것이라고 상상해 보세요. 작은 물체가 표준 격자에 맞지 않더라도, 시스템은 격자를 그 물체를 덮을 수 있을 만큼 일시적으로 "늘려서" 경비원이 그 물체에 주의를 기울이도록 강제합니다.
결과: 모델은 더 이상 가장 작고 보기 힘든 물체들을 무시하지 않습니다.

4. "스마트 코치" (MuSGD & 점진적 손실)

기존의 문제: 이러한 모델을 훈련시키는 것은 마치 코치가 600마일의 마라톤 내내 똑같은 지시를 외치는 것과 같았습니다. 실력이 좋아지는 데 오랜 시간이 걸렸습니다. 또한, 코치는 "스피드스터" 작업자와 "맥시마이저" 작업자가 서로 다른 일을 하고 있음에도 불구하고 똑같이 대우했습니다.
YOLO26의 해결책:

  • MuSGD (스마트 코치): 그들은 기존의 훈련 방식을 더 빠르게 배우는 새로운 옵티마이저인 MuSGD로 교체했습니다. 이는 마치 러너가 더 적은 거리(더 적은 훈련 에포크)를 달리고 완주할 수 있도록 페이스를 정확히 조절하는 코치와 같습니다.
  • 점진적 손실 (커리큘럼): 그들은 훈련 일정을 변경했습니다. 시작 단계에서는 강력한 기초를 쌓기 위해 "맥시마이저" 작업자에 집중합니다. 훈련이 진행됨에 따라 점차 "스피드스터" 작업자로 초점을 옮겨, 최종 결과물이 빠른 추론(no-check inference)에 완벽하게 최적화되도록 합니다.

5. 다양한 직무를 위한 전문 기술

경비원이 자동차를 찾는 데 빠르다고 해서 모든 일에 능숙하다는 뜻은 아닙니다. YOLO26은 다른 작업들을 위한 전문 도구들을 추가했습니다.

  • 형태 따기 (Segmentation): 배경을 더 잘 이해하도록 돕는 멀티 스케일 시스템을 추가하여, 물체의 정확한 윤곽을 그려내는 것을 더 쉽게 만들었습니다.
  • 사람 추적 (Pose Estimation): 관절(예: 팔꿈치)에 대한 경비원의 "불확실성"을 추측하는 방법을 추가했습니다. 만약 팔꿈치가 가려져 있다면, 모델은 무턱대고 추측하는 대신 자신이 확신할 수 없음을 인정합니다.
  • 회전된 물체 (OBB): 항상 똑바로 서 있지 않은 배나 비행기 같은 물체들을 위해, 모델이 물체가 기울어져 있을 때 혼란을 겪지 않도록 수학적 계산을 수정했습니다.

6. "오픈 보캐블러리" 업그레이드 (YOLOE-26)

마지막으로, 그들은 경비원에게 "만능 통역기"를 주는 것과 같은 YOLOE-26을 도입했습니다.

  • 텍스트 프롬프트: 당신은 경비원에게 "빨간색 소화전을 찾아줘"라고 말할 수 있으며, 모델이 소화전에 대해 명시적으로 훈련받지 않았더라도 그것을 찾아낼 것입니다.
  • 시각적 프롬프트: 당신은 특정 장난감 사진을 경비원에게 보여줄 수 있고, 그러면 모델은 비디오 속에서 그 장난감을 찾아낼 것입니다.
  • 프롬프트 없음: 모델은 스스로 주변을 둘러보고 보이는 것을 설명할 수도 있습니다.

핵심 요약

YOLO26은 이전 모델들보다 더 빠르고, 더 가볍고, 더 정확한 통합 모델 제품군입니다. 이들은 불필요한 짐을 제거하고, 작은 물체를 포착하기 위한 규칙을 수정하며, 더 스마트한 훈련 코치를 사용함으로써 이를 달성했습니다. 당신이 절대적인 최고 속도(NMS-free 경로)를 원하든, 혹은 가능한 최고 정확도(NMS 경로)를 원하든, YOLO26은 "속도 대 정확도" 차트의 맨 꼭대기에 위치하는 버전을 제공합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →