← 최신 논문
💻 computer science

DRAgent: Discriminative Reasoning Agent for Referring Expression Segmentation

DRAGent는 직접적인 좌표 생성 대신 디텍터가 생성한 공간에서 최적의 후보를 선택하는 판별적 추론 메커니즘을 통해 파운데이션 세그멘테이션 모델을 가이드함으로써 로컬라이제이션 정확도를 향상시키는, 지칭 표현 분할(Referring Expression Segmentation)을 위한 새로운 MLLM 기반 프레임워크이다.

원저자: Yujie Qi, Luyan Zhang

게시일 2026-08-25
📖 2 분 읽기☕ 가벼운 읽기

원저자: Yujie Qi, Luyan Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인공지능의 세계에는 지칭 표현 분할(referring expression segmentation)이라고 알려진 특정한 과제가 있습니다. 컴퓨터가 사진을 보고 있는 상황에서 사람이 "파란 의자 위에 놓인 빨간 공을 찾아줘"라고 말한다고 상상해 보십시오. 목표는 단순히 공과 의자가 존재한다는 것을 인식하는 것이 아니라, 그 특정 빨간 공의 윤곽을 픽셀 단위로 정밀하게 그려내는 것입니다. 이러한 능력은 물리적 세계와 상호작용해야 하는 로봇과 자율 시스템에게 매우 중요한데, 기계는 물체가 정확히 어디서 시작해서 어디서 끝나는지를 먼저 식별하지 못하면 그 물체를 집어 올릴 수 없기 때문입니다. 수년 동안 연구자들은 대규모 언어 모델이 기계의 눈 역할을 하도록 가르쳐, 마치 지도상의 좌표를 적어 내려가듯 대상 물체의 좌표를 직접 생성하도록 함으로써 이 문제를 해결하려고 노력해 왔습니다. 그러나 이 방식에는 근본적인 결함이 있습니다. 컴퓨터가 연속적인 시각적 공간을 텍ền 형태의 숫자 문자열로 변환하려고 할 때, 종종 길을 잃게 되어 특히 비슷하게 생긴 물체가 많은 복잡한 장면에서 흐릿하거나 부정확한 윤곽을 만들어내곤 합니다.

한 연구팀은 이 퍼즐을 풀기 위해 컴퓨터의 역할을 '지도 제작자'에서 '신중한 선택자'로 전환하는 다른 방법을 제안했습니다. 인공지능에게 대상의 위치를 처음부터 스스로 만들어내라고 요구하는 대신, 별도의 특화된 도구를 사용하여 이미지 내에서 보이는 모든 잠재적 물체를 표시함으로써 넓은 그물을 먼저 던지게 하는 것입니다. 그러면 대규모 언어 모델은 더 단순하고 신뢰할 수 있는 작업, 즉 이 표시된 가능성들의 목록을 살펴보고 어떤 것이 설명과 일치하는지 결정하는 임무를 맡게 됩니다. DRAgent라고 불리는 이 방법은 이 과업을 위치를 생성하는 것이 아니라 옵션들 사이를 판별하는 것으로 취급합니다. 시스템은 먼저 목록을 스크리닝하여 가장 가능성 높은 후보들을 남긴 다음, 남은 소수의 옵션들에 대해 어떤 것이 정말로 설명에 부합하는지 확인하기 위해 두 번째의 더 세밀한 검사를 수행합니다. 일단 올바른 상자가 선택되면, 세그멘테이션 모델이 그 상자를 사용하여 최종적이고 정밀한 윤곽을 그려냅니다.

연구진은 이러한 스크리닝과 검증이라는 2단계 과정이 기존 방식들을 괴롭히던 오류를 크게 줄여준다는 것을 발견했습니다. 시각적 공간을 직접 텍스트 좌표로 변환하는 어려운 과업을 피함으로써, 시스템은 단어와 이미지 사이의 더 명확한 연결성을 유지합니다. 언어 모델이 이러한 선택 과정을 더욱 잘 수행할 수 있도록, 연구팀은 신뢰할 수 없는 추론을 걸러내는 훈련 방법을 개발했습니다. 그들은 모델이 자신의 작업을 스스로 점검하도록 가르쳐, 물체를 선택하는 데 사용하는 논리가 단순히 그럴듯하게 들리는 것이 아니라 실제로 사진에 보이는 것과 일치하도록 했습니다. 수천 장의 이미지와 복잡한 설명이 포함된 표준 벤치마크에서 테스트했을 때, 이 새로운 접근 방식은 특히 물체가 밀집되어 있거나 설명이 길고 상세한 시나리오에서 매우 정확한 결과를 달성했습니다. 이러한 결과는 기계가 시각적 지시를 진정으로 이해하기 위해서는, 아무것도 없는 상태에서 답을 추측하도록 강요하기보다 명확한 가능성들의 집합 중에서 선택하게 하는 것이 종종 더 효과적이라는 점을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →