← 최신 논문
💬 NLP

Agent-X: Evaluating Deep Multimodal Reasoning in Vision-Centric Agentic Tasks

본 논문은 6 가지 다양한 환경에 걸친 828 개의 실제 다중 모달 태스크를 포함하는 대규모 벤치마크인 Agent-X 와 비전 중심 에이전트의 심층 추론을 평가하기 위한 세분화된 단계별 평가 프레임워크를 소개하며, 이를 통해 현재 최첨단 모델들이 복잡하고 다단계 시나리오에서 전체 체인 성공을 달성하는 데 어려움을 겪고 있음을 밝힙니다.

원저자: Tajamul Ashraf, Amal Saqib, Hanan Ghani, Muhra AlMahri, Yuhao Li, Noor Ahsan, Umair Nawaz, Jean Lahoud, Hisham Cholakkal, Mubarak Shah, Philip Torr, Fahad Shahbaz Khan, Rao Muhammad Anwer, Salman Khan

게시일 2026-05-26
📖 3 분 읽기☕ 가벼운 읽기

원저자: Tajamul Ashraf, Amal Saqib, Hanan Ghani, Muhra AlMahri, Yuhao Li, Noor Ahsan, Umair Nawaz, Jean Lahoud, Hisham Cholakkal, Mubarak Shah, Philip Torr, Fahad Shahbaz Khan, Rao Muhammad Anwer, Salman Khan

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 초지능 로봇 비서를 만들었다고 가정해 봅시다. 이 로봇에게 카메라, 두뇌, 그리고 돋보기, 계산기, 웹 브라우저 같은 다양한 도구들이 가득 담긴 도구 상자를 쥐여줍니다. 그리고 "파리행 가장 저렴한 항공권 찾아서, 현지 날씨 확인한 뒤 우산이 필요한지 알려줘"처럼 까다로운 퍼즐을 풀어달라고 요청합니다.

오랫동안 우리는 이 로봇들을 비디오 게임 레벨처럼 보이는 단순하고 가짜 퍼즐로 테스트해 왔습니다. 하지만 실제 세계는 혼란스럽고, 동영상을 포함하며, 로봇이 한 번이 아닌 여러 단계로 생각해야 하는 작업을 요구합니다.

이제 Agent-X가 등장합니다. 이 논문은 로봇 비서들이 실제 세계에서 얼마나 깊이 사고하고 도구를 활용하는지 테스트하기 위해 특별히 설계된, 매우 까다로운 새로운 "장애물 코스"를 만든 것이라고 생각하시면 됩니다.

다음은 일상적인 비유를 사용해 그들이 무엇을 했는지 설명한 내용입니다:

1. 문제: "비디오 게임" 대 "실제 세계"

이전 테스트는 로봇에게 벽에 적힌 규칙을 따르도록 하는 비디오 게임 레벨을 주는 것과 같았습니다. "빨간 열쇠로 파란 문을 열어라." 로봇은 단순히 지시를 따릅니다.

하지만 실제 생활에서는 어떤 도구를 써야 하는지 누가 알려주지 않습니다. 그저 *"새는 수도꼭지 고쳐줘"*라고 말할 뿐입니다. 로봇은 스스로 판단해야 합니다. 렌치가 필요할까? 동영상 튜토리얼을 찾아봐야 할까? 배관공을 부를까?

저자들은 현재의 로봇들은 특정 시험을 위한 답을 외우는 데는 뛰어나지만, 본 적이 없는 문제를 해결하라고 하면 얼어붙는 학생들과 같다고 말합니다. 그들은 여러 단계의 사고를 연결하는 데 어려움을 겪습니다.

2. 해결책: "Agent-X" 장애물 코스

이 팀은 828 개의 실제 세계 도전 과제로 구성된 대규모 컬렉션인 Agent-X를 만들었습니다.

  • 시나리오: 가짜 이미지 대신, 삶의 여섯 가지 다른 "이웃"에서 가져온 실제 사진, 동영상, 스크린샷을 사용했습니다:
    • 운전: 자동차 동영상을 보고 보행자가 횡단보도를 건너려는지 파악하기.
    • 감시: 보안 영상을 보고 수상한 인물을 찾아내기.
    • 스포츠: 경기 영상을 분석해 선수 수를 세거나 승자를 예측하기.
    • 웹 브라우징: 어떤 버튼을 눌러야 하는지 정확히 알려주지 않고 웹사이트를 탐색해 특정 정보 찾기.
    • 수학 및 일반 논리: 이미지에서 발견된 방정식 풀기나 여러 이미지 비교하기.
  • 반전: 로봇들에게 체크리스트를 주지 않습니다. 대신 로봇은 이미지를 보고 무엇이 부족한지 파악한 뒤, 도구 상자에서 올바른 도구를 선택해 사용하고, 그 결과를 본 다음 다음 행동을 결정해야 합니다.

3. "심판": 로봇들을 어떻게 평가하는가

이 부분이 가장 중요합니다. 보통 우리는 로봇이 최종 답을 맞혔는지 여부만 확인합니다 (선생님이 수학 시험을 채점하듯이).

Agent-X 는 단계별 심판을 도입합니다. 최종 답만 보는 것이 아니라 학생의 풀이 과정을 지켜보는 선생님을 상상해 보세요.

  • 올바른 도구를 선택했는가? (예: 돋보기 대신 계산기를 사용했는가?)
  • 도구를 올바르게 사용했는가? (예: 숫자를 올바른 순서로 입력했는가?)
  • 논리가 타당한가? (예: 증거를 보지 않고 결론을 도출했는가?)

로봇이 정답을 맞췄더라도, 사실을 왜곡하거나 (할루시네이션) 단계를 건너뛰어 도달했다면 Agent-X 는 불합격 점수를 줍니다. 이는 잘못된 재료를 사용해 맛있는 케이크를 만든 셰프와 같습니다. 케이크는 맛있지만 과정은 결함이 있습니다.

4. 결과: 로봇들은 여전히 학습 중입니다

저자들은 GPT-4, Gemini, Qwen 같은 주요 모델들을 포함해 이용 가능한 가장 똑똑한 AI 모델 12 개를 테스트했습니다.

판단: 가장 똑똑한 로봇들조차 어려움을 겪고 있습니다.

  • 점수: 최상위 모델들도 처음부터 끝까지 모든 과제를 완전히 올바르게 수행한 비율이 50% 미만입니다.
  • 병목 현상: 로봇들은 이미지를 보고 그 내용에 대해 이야기하는 데는 능숙하지만, 계획을 세우는 데는 매우 서툴러서 다음과 같은 실수를 자주 저지릅니다:
    • 필요한 도구를 사용하는 것을 잊음.
    • 존재하지 않는 도구를 사용하는 것 (존재하지 않는 도구를 할루시네이션함).
    • 동영상을 보고 시간에 따라 일어나는 일을 추적해야 할 때 혼란스러워함.
    • 답변 형식을 잘못 작성함 (예: 양식을 작성해야 하는데 편지를 씀).

5. 교훈

이 논문은 이러한 AI 에이전트들이 인상적이기는 하지만, 아직 완전한 자율 근무자로 준비되지 않았다고 결론 내립니다. 그들은 많은 사실을 알고 있지만, 어떻게 일을 수행할지 파악하기 위해 지속적인 감독이 필요한 천재적인 인턴과 같습니다.

저자들은 Agent-X 를 "스트레스 테스트"로 구축하여 로봇들이 어디서 실패하는지 정확히 보여줌으로써, 연구자들이 계획 수립과 도구 사용을 담당하는 "두뇌"의 특정 부분을 수정할 수 있도록 했습니다. 그들은 단순히 "이 질문에 답할 수 있는가?"라고 묻는 것이 아니라, "이 문제를 해결하기 위해 어떻게 생각할 수 있는가?"라고 묻고 있으며, 지금까지의 답은 "아직은 아니다"입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →