← 최신 논문
🤖 AI

MELLON - Multimodal Enhanced LLM for Online Navigation

이 논문은 텍스트와 이미지를 정렬하여 추론과 계획 능력을 향착시킴으로써 WebShop 벤치마크에서 웹 내비게이션 에이전트의 성능을 크게 향상시킨 멀티모달 프레임워크인 MELLON을 소개하며, 단 1 에포크(epoch)의 학습만으로 9.26%의 정확도 향상을 달성했습니다.

원저자: Ruiyu Li, Haoyang Cai, Zhitong Guo, Tong Hu

게시일 2026-08-11
📖 3 분 읽기☕ 가벼운 읽기

원저자: Ruiyu Li, Haoyang Cai, Zhitong Guo, Tong Hu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 인터넷 쇼핑을 하는 법을 가르치고 있다고 상상해 보세요. 여러분은 "빨간색 셔츠를 사줘"와 같은 텍스트 명령어를 주면, 로봇이 웹사이트를 읽고 버튼을 클릭할 것이라고 생각할지도 모릅니다. 하지만 여기 함정이 있습니다. 웹사이트는 단순히 텍스트만 있는 벽이 아닙니다. 웹사이트는 사진, 레이아웃, 디자인으로 가득 찬 다채롭고 시각적인 공간입니다. 만약 사람에게 특정 신발 한 켤레를 찾아달라고 요청한다면, 사람은 단순히 설명을 읽는 데 그치지 않습니다. 색상, 스타일, 모양을 확인하기 위해 사진을 봅니다. 오랫동안 웹을 탐색하려는 가장 똑똑한 컴퓨터 프로그램들은 마치 눈먼 쇼퍼와 같았습니다. 텍스트는 완벽하게 읽을 수 있었지만, 이미지를 "볼" 수는 없었던 것입니다. 이 논문은 인공지능의 세계, 구체적으로는 "웹 내비게이션 에이전트(Web Navigation-Agents)"에 초점을 맞추고 있습니다. 이들은 자연어 명령을 이해하고 물건을 사거나 티켓을 예약하는 것과 같이 실제 웹사이트에서 작업을 수행하도록 설계된 디지털 조력자들입니다. 연구자들이 던지는 핵심 질문은 이것입니다. 우리는 이 에이전트들에게 인간처럼 시각(이미지 보기)과 두뇌(텍스트 읽기)를 동시에 사용할 수 있도록 가르칠 수 있을까요?

MELLON이라는 프로젝트를 수행 중인 이 연구진은 이 아이디어를 WebShop이라는 시뮬레이션된 온라인 스토어에서 테스트하기로 했습니다. 그들은 AI 에이전트에게 제품 사진을 텍스트 설명과 함께 보여주는 것이 더 나은 결정을 내리는 데 도움이 될지 확인하고 싶었습니다. 그들은 단순히 추측만 한 것이 아니라, 이 퍼즐을 풀기 위해 세 가지 서로 다른 실험적 도구를 구축했습니다. 첫 번째이자 가장 성공적이었던 것은 MELLлоN 자체였습니다. MELLON을 시각적 세계를 AI의 뇌가 이해할 수 있는 언어로 번역해 주는 특수 안경을 쓴 매우 똑똑한 쇼퍼라고 생각해 보세요. 연구팀은 이 에이전트를 단 한 번의 학습 단계(one epoch) 동안 훈련시킨 것만으로도 작업 수행 능력이 크게 향상된다는 것을 발견했습니다. 구체적으로, 텍스트만 보는 기본 버전과 비교했을 때 작업 완료 정확도가 9.26% 상승했습니다. 이는 시각과 텍스트를 혼합하는 것이 AI의 웹 탐색을 돕는 강력한 방법임을 시사하지만, 시스템에는 여전히 성장통이 남아 있음을 보여줍니다.

하지만 이야기는 "멀티모달(multimodal)이 항상 더 낫다"는 식의 단순한 승전보로 끝나지는 않습니다. 연구팀은 기대만큼 잘 작동하지 않은 두 가지 다른 창의적인 접근 방식도 시도했습니다. 한 가지 아이디어는 쇼핑 과제를 "시각적 질의응답(Visual Question Answering, VQAgent)" 게임처럼 취급하는 것이었습니다. 즉, AI가 사진과 질문을 보고 정답을 고르게 하는 방식입니다. 그들은 쇼핑이 이미지에 대한 질문에 답하는 것과 유사하기 때문에 이 방식이 효과적일 것이라고 생각했습니다. 하지만 그들은 WebShop이라는 복잡한 실제 맥락 속에서 텍스트 설명이 사진보다 더 중요한 단서를 쥐고 있다는 사실을 발견했습니다. AI가 이미지에 너무 의존하도록 훈련되었기 때문에, 텍스트가 실제 해결의 열쇠인 상황에서 혼란을 겪은 것입니다. 이는 마치 세밀한 글 속에 답이 숨겨져 있는데, 그림을 뚫어지게 쳐다보며 수수께끼를 풀려고 애쓰는 것과 같습니다.

세 번째 시도는 "멀티모달 랭커(Multimodal Ranker)"를 포함했습니다. 이 도구는 에이전트가 눈에 보이는 첫 번째 것을 바로 집어 드는 대신, 페이지의 모든 항목을 잠시 멈춰 서서 주의 깊게 비교하도록 설계되었습니다. 이러한 추가적인 사고 시간이 더 나은 결과로 이어질 것이라는 희망이 있었습니다. 그러나 실험 결과, 이러한 과도한 신중함은 오히려 에이전트를 더 느리고 부정확하게 만들었습니다. 연구진은 이미지와 텍스트 사이의 유사성을 측정하는 도구(BERT 및 CLIP 점수)가 게임의 점수 체계에서 무엇이 "좋은 매칭"인지를 판단하는 기준과 잘 맞지 않는다는 것을 발견했습니다. 결국 모든 옵션을 순위를 매기려 노력하는 것은, 마치 옷가게의 모든 셔츠를 한 시간 동안 비교하며 시간을 보낸 뒤, 결국에는 너무 많은 정보에 압도되어 엉뚱한 옷을 사고 마는 쇼퍼와 같았습니다.

그렇다면 이 디지털 쇼핑 모험의 최종 결론은 무엇일까요? 이 논문은 AI 에이전트에게 웹을 "보는" 능력을 부여하는 것이 유망한 길이지만, 그것이 마법 지팡이는 아니라는 점을 시사합니다. MELLON 에이전트는 이미지와 텍스트를 정렬하는 것이 성능을 높일 수 있음을 입증했지만, 다른 실험들은 단순히 더 복적인 시각적 추론을 추가하거나 에이전트가 모든 것을 보게 만드는 것이 항상 옳은 전략은 아니라는 것을 보여주었습니다. 연구진은 우리가 어떻게 하면 시각적 단서와 텍스트 단서를 가장 잘 혼합할 수 있을지 계속 탐구해야 한다고 결론지었습니다. 예를 들어, 에이전트를 더 오래 훈련시키거나 미래에 더 똑똑한 "두뇌"(거대 언어 모델)를 사용하는 방식 등이 있습니다. 현재로서는, 약간의 시각적 능력이 큰 도움이 된다는 것을 보여주었지만, AI는 여전히 언제 사진을 보고 언제 세부 사항을 읽어야 하는지를 배워야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →