← 최신 논문
💻 computer science

Mitigating Mask Prior Drift and Positional Attention Collapse in Large Diffusion Vision-Language Models

본 논문은 긴 형식의 생성 작업에서 특히 성능을 크게 향상시키는 훈련이 불필요하고 플러그 앤 플레이 방식의 전략을 제안함으로써, 반복적 생성을 유발하는 마스크 사전 편향 이동과 시각적 근거를 저하시키는 위치적 주의력 붕괴라는 대규모 확산 비전 - 언어 모델의 두 가지 치명적인 실패 모드를 식별하고 해결합니다.

원저자: Sujung Hong, Chanyong Yoon, Seongjae Hwang

게시일 2026-05-15
📖 3 분 읽기☕ 가벼운 읽기

원저자: Sujung Hong, Chanyong Yoon, Seongjae Hwang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 매우 똑똑하고 예술적인 로봇이 사진을 보고 이에 대한 상세한 이야기를 작성할 수 있다고 말입니다. 이 로봇은 **대규모 확산 비전 - 언어 모델 (LDVLM)**이라는 새로운 유형의 인공지능입니다. 한 번에 한 단어씩 이야기를 작성하는 이전의 로봇들 (사람이 타이핑하는 것과 유사) 과는 달리, 이 새로운 로봇은 처음에 전체 이야기를 한 번에 작성한 뒤, 그것이 의미가 있도록 점차적으로 '연마'해 나갑니다. 마치 회색 정전기로 덮인 빈 캔버스에서 시작해 점차 그 아래에 숨겨진 그림을 드러내는 것과 같습니다.

그러나 이 논문에서 연구자들은 이 로봇이 길고 상세한 이야기를 작성하려 할 때 약간 미친 듯이 행동하기 시작한다는 사실을 발견했습니다. 이는 두 가지 주요 문제로 이어집니다:

1. '고장 난 레코드' 문제 (마스크 사전 드리프트, Mask Prior Drift)

유사성: 그림을 그리려는데, 브러시를 들 때마다 정확히 같은 회색 페인트에 담겨 있다고 상상해 보세요. 무엇을 그리려 해도 계속 회색을 덧칠하게 됩니다. 결국 당신의 걸작은 거대한 회색 덩어리처럼 보일 뿐입니다.

무슨 일이 일어나는지: 로봇이 작성을 시작할 때 '마스크 토큰 (빈 회색 자리표시자라고 생각하세요)'으로 시작합니다. 연구자들은 로봇이 이러한 자리표시자를 실제 단어로 바꾸려 할 때, 그 '회색 페인트 (인공지능의 뇌 내 특정 수학 방향)'가 단어를 다시 똑같은 지루하고 반복적인 상태로 끌어당긴다는 사실을 발견했습니다.

  • 결과: 로봇은 "고양이가 매트 위에 앉았다"라고 쓰는 대신, "고양이가 매트 위에 앉았다. 고양이가 매트 위에 앉았다. 고양이가 매트 위에 앉았다..."라고 멈추지 않고 말하거나, 같은 몇 단어를 계속해서 반복할 수 있습니다.

2. '터널 시야' 문제 (위치적 주의력 붕괴, Positional Attention Collapse)

유사성: 붐비는 방에서 멀리 떨어진 특정 사람을 묘사하려 한다고 상상해 보세요. 하지만 당신의 눈은 바로 옆에 서 있는 사람들에게 고정되어 있어 그들을 지나쳐 볼 수 없습니다. 방 건너편에 있는 사람을 묘사해야 하는데도, 계속 옆에 있는 사람에 대해 이야기하게 됩니다.

무슨 일이 일어나는지: 로봇은 문장 내에서 사물의 위치를 이해하기 위해 RoPE 라는 특수한 수학 트릭을 사용합니다. 연구자들은 이 트릭이 로봇을 현재 작성 중인 단어의 바로 옆에 있는 단어에 집착하게 만든다는 사실을 발견했습니다. 이는 시퀀스 내에서 '멀리 떨어진' 중요한 시각적 단서 (실제 이미지 등) 를 무시하게 만듭니다.

  • 결과: 로봇은 이미지의 맥락을 잃습니다. 빨간 차를 파란색으로 묘사하거나, 그림에 고양이가 있는데도 개에 대해 이야기할 수 있습니다. 이는 시각적 증거에 주의를 기울이지 않게 되었기 때문입니다.

해결책: '조절 노브' 접근법

이 논문의 가장 좋은 점은 연구자들이 로봇을 재학습시키거나 새로운 것을 가르칠 필요가 없었다는 것입니다. 그들은 로봇이 작동하는 동안 두 개의 '조절 노브'를 추가했을 뿐입니다.

수정 #1: '회색 페인트' 필터 (마스크 사전 억제, Mask Prior Suppression)

  • 작동 원리: 그들은 최종 단어에 들어가기 전에 '회색 페인트 (반복적 성향)'를 포착하는 작은 필터를 만들었습니다. 지루하고 반복적인 단어를 걸러내고 신선하고 창의적인 단어로 대체하는 체와 같습니다.
  • 효과: 로봇은 반복을 멈추고 다양하고 흥미로운 문장을 쓰기 시작합니다.

수정 #2: '원거리 렌즈' 줌 (단조 RoPE 스케일링, Monotonic RoPE Scaling)

  • 작동 원리: 그들은 수학 트릭을 조정하여 로봇의 '눈'이 줌아웃할 수 있도록 했습니다. 옆에 서 있는 사람만 보는 대신, 이제 로봇은 방 건너편에 있는 사람 (시각적 이미지) 을 보도록 강요받습니다.
  • 효과: 로봇은 마침내 묘사해야 할 이미지에 주의를 기울이게 되어, 설명이 정확하고 현실에 기반하게 됩니다.

결론

연구자들은 이 두 가지 간단한 조정을 다양한 유형의 인공지능 로봇에 적용하여 테스트했습니다. 결과는 명확했습니다:

  • 로봇들은 반복을 멈췄습니다.
  • 그림에 없는 세부 사항을 만들어내지 않게 되었습니다.
  • 길고 상세한 설명을 작성하는 능력이 훨씬 향상되었습니다.

이 모든 것은 로봇에게 새로운 것을 가르치거나 핵심 뇌 구조를 변경하지 않고 이루어졌습니다. 단지 작업하는 동안 그들을 현명하게 안내하는 방법일 뿐이며, 이로 인해 복잡한 작업에 훨씬 더 신뢰할 수 있게 되었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →