← 최신 논문
💬 NLP

PEA-DPO: Perception-Enhanced Alignment Direct Preference Optimization for MLLMs Alignment

이 논문은 시각적 선호 신호를 명시적으로 활용함으로써 멀티모달 거대 언어 모델의 시각적 둔감성 문제를 해결하고, 이를 통해 언어 능력을 유지하면서도 환각 현상을 크게 줄이고 멀티모달 정렬을 개선하는 새로운 프레임워크인 인지 강화 정렬 직접 선호 최적화(Perception-Enhanced Alignment Direct Preference Optimization, PEA-DPO)를 소개한다.

원저자: Jiawei Feng, Jiancan Wu, Xingyu Zhu, Junkang Wu, Xiang Wang, Xiangnan He

게시일 2026-08-21
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jiawei Feng, Jiancan Wu, Xingyu Zhu, Junkang Wu, Xiang Wang, Xiangnan He

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인공지능이 급격히 진화하는 세상에서, 보고 동시에 말할 수 있는 새로운 세대의 시스템이 등장했습니다. 이러한 멀티모달 거대 언어 모델은 이미지를 보고 그 장면을 묘사하거나 사진에 관한 질문에 답하도록 훈련받습니다. 이 기계들이 진정으로 유용하고 안전해지기 위해서는 인간의 가치와 일치해야 하며, 이는 그들의 답변이 정확하고 도움이 되며, 그들에게 제시된 시각적 현실에 근거해야 함을 의미합니다. 이러한 시스템을 가르치는 데 있어 주요한 과제는 환각 현상, 즉 존재하지 않는 사물이나 동작을 자신 있게 묘사하는 경향이었습니다. 이를 해결하기 위해 연구자들은 직접 선호도 최적화(direct preference optimization)라고 불리는 기술에 주목했습니다. 이는 모델에게 하나의 좋은 답변과 하나의 나쁜 답변이 쌍으로 된 답변들을 보여주고, 왜 첫 번째 답변이 더 나은지를 학습하게 하는 방법입니다. 이 접근 방식은 텍스트 전용 모델에는 놀라운 효과를 거두었지만, 이미지를 함께 처리하는 시스템에 적용했을 때, 명확한 사진과 가장 중요한 세부 사항이 가려진 사진 사이의 차이를 진정으로 "보는" 것을 방절하는 숨겨진 결함이 발견되었습니다.

중국 과학기술대학교와 싱가포르 국립대학교의 연구팀은 이 구체적인 약점을 식별하고 이를 치료할 새로운 프레임워크를 개발했습니다. 그들은 표준 훈련 방식이 이미지를 단순히 대화의 배경이나 정적인 설정으로 취급할 뿐, 모델이 의존해야 할 일차적인 진실의 원천으로 취급하지 않는다는 것을 발견했습니다. 이 때문에 모델들은 시각적으로 둔감해졌습니다. 연구진의 실험에 따르면, 이러한 모델들은 사람들이 피크닉을 즐기는 사진과 책을 읽고 있는 사진을 구분하지 못했는데, 심지어 한쪽의 시각적 증거가 완전히 제거된 경우에도 그러했습니다. 모델들은 거의 동일한 응답을 생성하며 핵심적인 시각적 단서가 누락되었다는 사실을 알아차리지 못했습니다. 또한 그들은 화장실 솔을 일반적인 도구로 혼동하는 것과 같이, 단일 이미지 내의 특정 사물을 구별하는 데 어려움을 겪었는데, 이는 그들이 사물을 정의하는 결정적인 시각적 단서에 충분히 주의를 기울이지 않았기 때문입니다.

이를 해결하기 위해 연구진은 '지각 강화 정렬(Perception-Enhanced Alignment)'이라 불리는 방법을 만들었습니다. 단순히 모델에게 더 나은 텍스트 답변을 선택하도록 가르치는 대신, 그들은 모델이 시각적 맥락 자체에 주의를 기울이도록 강제함으로써 훈련 과정을 재설계했습니다. 연구진은 먼저 선명한 이미지를 가져와 무작위로 일부 영역을 가린 일련의 변형된 버전들을 만들었습니다. 그 후 별도의 매우 민밀한 시각 시스템을 사용하여, 어떤 변형된 버전이 질문에 올바르게 답하는 데 필요한 핵심 정보를 가장 많이 잃었는지 식별하여, 핵심 세부 사항이 누락된 '거부된' 이미지를 효과적으로 만들어냈습니다. 그런 다음 이 정보가 누락된 이미지와 원래의 완전한 이미지를 쌍으로 묶었습니다. 훈련 과정에서 모델은 동일한 질문과 동일한 텍스트 답변을 받되, 완전한 이미지와 불완전한 이미지를 각각 순차적으로 보여주는 방식으로 제시되었습니다. 모델은 시각적 증거가 완전할 때는 해당 답변을 강력하게 선호해야 하며, 핵심적인 시각적 맥락이 사라졌을 때는 그 답변의 신뢰도가 낮아진다는 것을 인식하도록 학습되었습니다.

이 이중적인 접근 방식은 모델에게 두 가지를 동시에 가르쳤습니다. 첫째, 이전과 마찬가지로 좋은 텍스트 응답과 나쁜 응답을 구별하는 법을 배웠습니다. 둘째, 더 중요한 것은 시각적 증거가 주장을 뒷받침하기에 불충분할 때를 인식하는 법을 배웠다는 것입니다. 연구진은 이 새로운 방법을 70억 개의 파라미터를 가진 모델과 130억 개의 파라미터를 가진 두 가지 크기의 이미지-텍스트 모델에 대해 테스트했습니다. 결과는 놀라웠습니다. 모델이 얼마나 자주 사실이 아닌 것을 지어내는지 측정하기 위해 설계된 표준 테스트에서, 새로운 방법은 환각 현상을 상당한 수준으로 감소시켰습니다. 더 작은 모델의 경우, 한 주요 벤치마크에서 지어낸 세부 사항의 비율이 거의 3분의 1로 줄어들었고, 다른 벤치마크에서는 90% 이상 감소했습니다. 더 큰 모델 역시 유사한 개선을 보였으며, 종종 가장 진보된 상용 시스템들조차 능가하는 성능을 보여주었습니다. 모델들은 일반적인 지식에 기반해 추측하는 대신, 책 제목이나 특정 도구와 같이 사진 속에 실제로 있는 것을 정확하게 묘사하는 능력이 훨씬 향려되었습니다.

연구진은 또한 이러한 시각적 정확성에 대한 새로운 집중이 모델의 다른 작업 능력을 저하시키지 않는지 확인했습니다. 그들은 모델이 지시를 따르고 일반적인 질문에 답하는 능력을 유지하고 있으며, 어떤 경우에는 일반적인 작업에서의 성능이 오히려 약간 향상되었다는 것을 발견했습니다. 유일하게 눈에 띄는 트레이드오프는 모델이 다소 보수적으로 변했다는 점이었습니다. 즉, 확신이 없을 때 추측할 가능성이 낮아졌으며, 이는 때때로 전체적인 세부 정보의 양은 적을 수 있지만, 제공된 세부 정보는 훨씬 더 진실에 가까워졌음을 의미했습니다. 시각적 증거를 텍스트만큼 가치 있게 여기도록 명시적으로 가르침으로써, 연구진은 인공지능이 단순히 사진을 보는 것이 아니라 진정으로 '본다'는 것이 가능하다는 것을 입증했습니다. 이 연구는 기계가 시각적 세계를 이해하는 신뢰할 수 있는 파트너가 되기 위해서는, 누락된 정보의 무게를 느낄 수 있도록 훈련되어야 하며, 이를 통해 그들의 확신이 항상 눈앞에 있는 실제 명료함과 일치하도록 보장해야 함을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →