Colon-Bench: An Agentic Workflow for Scalable Dense Lesion Annotation in Full-Procedure Colonoscopy Videos
이 논문은 대장암 조기 검진을 위한 AI 개발의 핵심 장벽인 대규모 밀집 주석 데이터의 부재를 해결하기 위해, 다단계 에이전트 워크플로우를 통해 생성된 528 개의 전체 대장내시경 영상과 14 가지 병변 범주, 30 만 개 이상의 바운딩 박스 등을 포함한 'Colon-Bench'를 소개하고 이를 통해 최신 멀티모달 대규모 언어 모델 (MLLM) 의 성능을 평가하고 새로운 프롬프트 전략을 제안합니다.
대장내시경은 장을 다 확인하기 위해 2 시간까지 걸리는 긴 작업입니다. 여기서 의사가 찾아야 할 것은 작은 종양 (폴립) 이나 출혈 같은 병변입니다.
비유: 마치 수십 시간 분량의 긴 영화를 보는데, 그 안에 수천 개의 바늘이 숨어 있고, 그중 진짜 바늘은 아주 작고 흐릿하게 보인다고 상상해 보세요. 게다가 영화는 흔들리기도 하고, 물방울이 튀거나 변기 같은 것들이 가리기도 합니다.
현실: 기존에는 AI 가 이 '바늘'을 찾아내도록 훈련시키려면, 사람이 일일이 영상을 보며 "여기에 병이 있다"라고 표시해 줘야 했습니다. 하지만 이 작업은 너무 힘들고 비싸서, AI 가 배울 수 있는 데이터가 매우 부족했습니다.
2. 해결책: "스마트한 자동화 팀 (에이전트 워크플로우)"
저자들은 이 문제를 해결하기 위해 사람과 AI 가 팀을 이루는 새로운 방식을 고안했습니다. 마치 수천 권의 책을 정리하는 도서관 사서 팀처럼요.
AI 사서 A (초기 탐색): 먼저 AI 가 긴 영상 전체를 빠르게 훑어보며 "여기 뭔가 이상해!"라고 의심스러운 장면을 찾아냅니다. (하지만 이 AI 는 실수가 많아요.)
AI 사서 B (검증 및 추적): 의심스러운 장면을 다시 자세히 보고, "정말 병변일까?"라고 확인합니다. 그리고 병변이 움직일 때 따라가도록 표시를 붙입니다.
AI 사서 C (최종 확인): AI 가 표시한 병변 위에 박스를 그려서 다시 한번 확인합니다.
인간 전문가 (최종 심사위원): AI 가 걸러낸 '진짜 병변'만 최종적으로 의사가 한 번 더 봅니다. AI 가 이미 90% 이상 걸러냈기 때문에, 의사는 아주 짧은 시간만 투자하면 됩니다.
이 과정을 통해 528 개의 긴 영상에서 30 만 개 이상의 병변을 정확하게 찾아내고 표시했습니다.
3. 결과물: "대장내시경의 백과사전 (Colon-Bench)"
이 과정을 통해 만들어진 데이터셋은 대장내시경 AI 를 위한 최고의 교과서가 되었습니다.
규모: 528 개의 영상, 46 만 개의 프레임, 30 만 개의 병변 표시, 그리고 의사들이 쓴 13 만 단어의 설명이 포함되어 있습니다.
다양성: 단순히 '폴립'만 찾는 게 아니라, 출혈, 궤양, 염증 등 14 가지의 다양한 병변을 구분할 수 있습니다.
의미: 이제 AI 는 단순히 "병이 있다"라고 말하는 것을 넘어, "이 병은 모양이 어떻고, 어디에 있으며, 어떤 특징을 가졌는지"까지 이해할 수 있게 되었습니다.
4. 실험: "AI 의 실력 테스트"
저자들은 이 새로운 교과서 (Colon-Bench) 를 이용해 최신 AI 모델들 (GPT, Gemini, Qwen 등) 의 실력을 시험했습니다.
놀라운 결과: 일반적인 영상 인식 AI(예: SAM-3) 보다 최신의 **멀티모달 AI(문자와 영상을 동시에 보는 AI)**들이 대장내시경 영상에서 훨씬 뛰어난 성능을 보였습니다.
비유: 기존 AI 가 "여기에 빨간 점이 있어"라고만 한다면, 최신 AI 는 "여기에 평평하게 붙어 있는 (sessile) 작은 붉은 점이 있어. 이건 폴립일 가능성이 높아"라고 설명할 수 있게 된 것입니다.
5. 핵심 기술: "의사에게서 배운 비법 (Colon-Skill)"
연구진은 AI 들이 자주 틀리는 실수 패턴을 분석했습니다. 그리고 그 실수들을 교정하는 **특별한 지시사항 (프롬프트)**을 만들었습니다.
비유: 마치 수험생에게 "시험에 자주 나오는 함정 문제"를 알려주는 요약 노트를 주는 것과 같습니다.
예: "구멍 (Diverticulum) 을 병변으로 착각하지 마라."
예: "색이 하얀 평평한 병변은 궤양이 아니라 'SSL'일 수 있다."
효과: 이 '비법 노트'를 AI 에게 알려주자, 학습 없이도 AI 의 정답률이 최대 9.7% 까지 급상승했습니다.
6. 결론: 왜 중요한가?
이 연구는 대장암 조기 발견을 위한 AI 의 길을 닦은 것입니다.
비용 절감: 의사가 일일이 모든 영상을 확인할 필요 없이, AI 가 먼저 병변을 찾아내면 의사는 중요한 부분만 확인하면 됩니다.
정확도 향상: AI 가 병변의 종류와 위치를 더 정확하게 이해하게 되어, 놓치는 병변을 줄일 수 있습니다.
미래: 앞으로는 이 기술이 실제 병원에서 실시간으로 작동하여, 누구나 더 쉽고 정확하게 대장암 검진을 받을 수 있게 될 것입니다.
한 줄 요약:
"사람과 AI 가 팀을 이루어 대장내시경 영상을 분석하는 초고속 자동화 공장을 세웠고, 그 결과 대장암을 찾는 AI 의 눈과 지능을 비약적으로 발전시킨 최고의 학습 데이터를 만들었습니다."
Colon-Bench: 전체 절차 대장내시경 영상을 위한 확장 가능한 밀집 병변 주석을 위한 에이전트 워크플로우
이 논문은 대장암 예방을 위한 대장내시경의 중요성에도 불구하고, 현재 AI 시스템 개발을 저해하는 밀집된 주석이 달린 장기간 비디오 데이터셋의 부재 문제를 해결하기 위해 제안된 Colon-Bench와 그 생성 방법론을 소개합니다.
1. 문제 정의 (Problem)
데이터 부족: 기존 대장내시경 데이터셋은 주로 단일 클래스 (폴립) 탐지에 집중하거나, 해부학적 분할에 국한되어 있습니다. 현대의 멀티모달 대규모 언어 모델 (MLLMs) 을 평가하기 위해 필요한 풍부한 공간적, 시간적, 언어적 주석이 부족합니다.
주석의 어려움: 대장내시경 영상은 움직임 흐림 (motion blur), 가려짐 (occlusion), 잔여물 (stool/debris) 등으로 인해 병변이 희소하고 시각적 분석이 어렵습니다. 또한, 수동으로 전체 절차 영상을 밀집하게 주석하는 것은 노동 집약적이고 일관성이 떨어집니다.
평가 기준 부재: MLLM 이 복잡한 대장내시경 절차의 시공간적 분석을 얼마나 잘 이해하는지 체계적으로 평가할 수 있는 벤치마크가 없었습니다.
2. 방법론 (Methodology)
저자들은 **다단계 에이전트 워크플로우 (Multi-stage Agentic Workflow)**를 통해 확장 가능하고 고품질의 밀집 주석 데이터셋을 구축했습니다.
2.1 에이전트 기반 주석 파이프라인
초기 제안 (Temporal Proposals): 비전 - 언어 모델 (VLM) 을 사용하여 60 개의 대장내시경 영상 (REAL-COLON 데이터셋 기반) 에서 1,325 개의 잠재적 병변 윈도우를 식별했습니다.
검증 및 필터링 (Verification Filtering): 에이전트가 제안된 윈도우를 검토하여 병변 존재 여부를 확인하고, 잘못된 탐지를 제거했습니다.
바운딩 박스 추적 (Bounding Box Tracking): EdgeTAM (SAM 기반 추적 모델) 을 사용하여 병변의 공간적 위치를 프레임 단위로 추적하고 바운딩 박스를 생성했습니다.
AI 기반 시각적 확인 (AI-driven Visual Confirmation): 추적된 바운딩 박스를 오버레이하여 AI 에이전트가 병변을 시각적으로 재확인하도록 하여 오탐지를 줄였습니다.
인간 - 루프 검토 (Human-in-the-loop Review): 최종적으로 숙련된 외과 의사가 AI 필터링된 597 개의 윈도우 중 528 개를 최종 승인했습니다. (거부율은 11.6% 로 낮아 AI 필터의 신뢰도가 높음을 보여줌)
2.2 Colon-Bench 데이터셋 구성
규모: 528 개의 curated 윈도우, 464,035 프레임 (약 12.89 시간).
주석 내용:
병변 카테고리: 폴립, 출혈, 궤양 등 14 가지 다양한 병변 유형.
밀집 주석: 300,132 개의 바운딩 박스, 213,067 개의 분할 마스크.
언어적 주석: 133,000 단어 이상의 임상적 설명 (Clinical Descriptions).
평가 태스크: 이 데이터셋은 4 가지 주요 태스크를 위한 벤치마크를 제공합니다.
이진 병변 분류 (Binary Lesion Classification)
오픈-어휘 비디오 객체 분할 (Open-Vocabulary Video Object Segmentation, OV-VOS)
비디오 시각적 질문 응답 (Video VQA, prompted 및 unprompted)
병변 탐지 (Detection)
2.3 Colon-Skill 프롬프트 전략
MLLM 의 오류 패턴을 분석하여 **"Colon-Skill"**이라는 구조화된 텍스트 가이드를 도출했습니다. 이는 병변의 형태적 단서, 혼동하기 쉬운 함정 (예: 디버티큘라 vs 함몰 병변), 결정 체크리스트 등을 포함하며, 학습 없이 프롬프트에 추가하여 모델 성능을 향상시킵니다.
3. 주요 결과 (Key Results)
3.1 벤치마크 성능
MLLM 성능: Gemini 3 Pro 및 Gemini 3 Flash 가 모든 태스크 (VQA, 분할, 분류) 에서 가장 우수한 성능을 보였습니다. 특히 분할 (Segmentation) 태스크에서 Gemini 3 Flash 는 mIoU 48.3%, Dice 54.7% 를 기록했습니다.
전문화된 모델 대비 우위: MLLM 들은 대장내시경 특화 모델인 Endo-CLIP 보다 병변 탐지에서 약 30% 더 높은 성능을 보였으며, SAM-3 보다 오픈-어휘 분할 성능에서 32% 이상 우월한 결과를 달성했습니다.
모델별 특징:
Seed 1.6: 오픈 가중치 모델 중 가장 강력하며, 분류 태스크에서 85.0% 의 높은 정밀도를 보였습니다.
Qwen 시리즈: 대형 모델 (397B, 235B) 은 VQA 는 잘 수행했으나, 병변 탐지 태스크에서는 대부분 음성 (정상) 으로 분류하는 경향 (Recall < 1%) 을 보였습니다.
3.2 Colon-Skill 효과
Colon-Skill 프롬프트를 적용한 결과, 대부분의 MLLM 에서 최대 9.7%p의 VQA 정확도 향상을 보였습니다. 이는 모델의 오류 패턴을 구조화된 지식으로 변환하여 추론 시 맥락을 제공하는 것이 효과적임을 입증했습니다.
3.3 분석 (Ablation Study)
프레임 수 영향: 분할 태스크에서 입력 프레임 수를 1 개에서 7 개로 늘리면 성능이 지속적으로 향상되었으나, 3 개의 등간격 프레임이 효율성과 성능의 최적 균형점으로 선정되었습니다.
시간적 컨텍스트: 단일 프레임 입력보다 전체 비디오 입력이 VQA 및 분류 태스크에서 더 높은 성능을 보였습니다.
4. 기여 및 의의 (Contributions & Significance)
혁신적인 주석 파이프라인: 시간적 제안, 추적, AI 확인, 인간 검토를 결합한 다단계 에이전트 워크플로우를 통해 대장내시경 영상에 대한 대규모 밀집 주석을 확장 가능하게 구축했습니다.
포괄적인 벤치마크 (Colon-Bench): 14 가지 병변 유형, 30 만 개 이상의 바운딩 박스, 21 만 개 이상의 마스크, 그리고 임상 텍스트를 포함하는 최초의 대규모 다중 태스크 대장내시경 벤치마크를 제공합니다. 이는 MLLM 의 의료 영상 이해 능력을 평가하는 새로운 표준이 될 것입니다.
MLLM 의 의료 적용 가능성 입증: 최신 MLLM 이 전문적인 의료 영상 (대장내시경) 에서도 뛰어난 공간적 위치 파악 및 고수준 추론 능력을 보일 수 있음을 입증했습니다.
학습 없는 성능 향상 (Colon-Skill): 추가 학습 없이 구조화된 도메인 지식 (Colon-Skill) 을 프롬프트에 추가함으로써 MLLM 의 성능을 획기적으로 개선하는 방법을 제시했습니다.
5. 결론
Colon-Bench 는 대장내시경 AI 연구의 중요한 격차를 해소하며, 향후 실시간 임상 배포를 위한 에이전트 기반 파이프라인 최적화 및 저비용 정밀한 대장암 선별 시스템 개발의 기초를 마련했습니다. 이 데이터셋과 코드는 공개되어 향후 연구에 활용될 예정입니다.