← 최신 논문
🤖 AI

InfantAgent-Next: A Multimodal Generalist Agent for Automated Computer Interaction

본 논문은 OSWorld, GAIA, SWE-Bench 등 다양한 벤치마크에서 최첨단 성능을 달성하며 협업적이고 단계별 컴퓨터 상호작용을 가능하게 하기 위해 도구 기반 기능과 순수 시각 기능을 통합한 고도로 모듈화된 멀티모달 범용 에이전트인 InfantAgent-Next 를 소개합니다.

원저자: Bin Lei, Weitai Kang, Zijian Zhang, Winson Chen, Xi Xie, Shan Zuo, Mimi Xie, Ali Payani, Mingyi Hong, Yan Yan, Caiwen Ding

게시일 2026-05-04
📖 4 분 읽기☕ 가벼운 읽기

원저자: Bin Lei, Weitai Kang, Zijian Zhang, Winson Chen, Xi Xie, Shan Zuo, Mimi Xie, Ali Payani, Mingyi Hong, Yan Yan, Caiwen Ding

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 매우 똑똑하지만 약간 서툰 개인 비서 InfantAgent-Next가 있다고 말입니다.

컴퓨터 자동화 세계에서 오늘날 대부분의 비서는 한 가지 일만 매우 잘하는 전문가이거나, 모든 일을 시도하지만 종종 혼란에 빠지는 일반인들과 같습니다.

  • 어떤 비서들은 사서와 같습니다: 그들은 특정 도구 목록 (예: "웹 검색" 또는 "파일 열기") 을 사용하는 데 뛰어나지만, 이전에 본 적이 없는 화면의 버튼을 클릭하라고 요청하면 그 특정 버튼을 위한 도구가 없기 때문에 얼어붙습니다.
  • 다른 비서들은 예술가와 같습니다: 그들은 화면을 보고 그곳에 무엇이 있는지 "볼" 수는 있지만, 계산기나 텍스트 편집기 없이 눈만으로 모든 일을 하려고 하기 때문에 복잡한 수학 문제를 풀거나 코드를 작성하는 데 어려움을 겪습니다.

InfantAgent-Next는 다릅니다. 이는 한 사람을 고용하는 대신 스위스 아미 나이프 팀을 고용하는 것과 같습니다.

작동 방식: "두뇌와 손" 팀

모든 일을 하려고 하는 거대한 두뇌 하나 대신, InfantAgent-Next 는 모든 작업을 작은 단계로 나누고 각 단계를 가장 적합한 전문가에게 보냅니다.

  1. 매니저 (기획자): "이 웹페이지를 내 북마크에 저장해 주세요"라고 요청하면, 고수준의 "매니저" 모델이 요청을 읽습니다. 매니저는 스스로 마우스를 클릭하려고 하지 않습니다. 대신, "좋아, 브라우저를 열고 북마크 버튼을 찾아서 클릭해야 해"라고 말합니다.
  2. 전문가들: 매니저는 작업에 맞는 적절한 전문가를 소집합니다.
    • 눈 (시각적 그라운딩): "빨간색 버튼을 클릭해"라는 작업이 있다면, 전문화된 시각 모델이 화면을 보고 그 빨간색 버튼의 정확한 픽셀 좌표를 찾아 시스템에 어디를 클릭해야 하는지 알려줍니다. 이는 눈이 밝은 관측자가 눈가린 궁수를 안내하는 것과 같습니다.
    • 계산기 (코드 실행): "이 엑셀 파일을 분석해"라는 작업이 있다면, 매니저는 파일을 코딩 전문가에게 넘겨주어 스크립트를 작성해 즉각적으로 계산을 수행하게 합니다. 화면을 보며 행을 세려고 시도하는 대신 말입니다.
    • 귀 (음성 분석): 녹음 파일을 업로드하고 "어떤 페이지 번호가 언급되었나요?"라고 요청하면, 전문화된 음성 모델이 파일을 듣고 답변을 추출합니다.
  3. 기억: 시스템은 공유된 노트를 유지합니다. 전문가가 단계를 완료할 때마다 그 내용을 적어둡니다. 다음 전문가는 노트를 받아 무슨 일이 있었는지 읽고 이야기를 이어갑니다. 이를 통해 팀이 목표를 잃지 않도록 보장합니다.

이것이 중요한 이유 (마법 같은 기술)

이 논문은 이 시스템이 해결하는 두 가지 주요 문제를 강조합니다.

  • "클릭" 문제: 많은 AI 에이전트가 화면의 올바른 위치를 클릭하는 데 서툴러서 버튼을 놓치고 5 픽셀 왼쪽을 클릭할 수도 있습니다. InfantAgent-Next 는 "확대 (Zoom-In)"기술을 사용합니다. 버튼을 클릭해야 할 때 단순히 추측하지 않습니다. 화면의 사진을 찍어 일반적인 영역을 찾고, 그 영역을 잘라내어 크게 만든 후, 버튼을 다시 찾고 다시 잘라낸 다음 그제서야 클릭합니다. 이는 헤이 stack 에서 바늘을 찾기 위해 돋보기를 사용하는 것과 같아 클릭이 정밀하도록 보장합니다.
  • "편집" 문제: 텍스트 파일을 편집할 때 AI 는 종종 행 번호를 잘못 파악합니다 (예: 6 행이어야 하는데 "5 행을 변경해"라고 하는 경우). InfantAgent-Next 는 "이중 확인"시스템을 갖추고 있습니다. 변경 사항을 제안한 후 실제 텍스트를 살펴보고 "5 행이 실제로 내가 생각하는 내용을 담고 있는가?"를 확인합니다. 그렇지 않다면 편집을 수행하기 전에 계획을 조정하여 엉망이 되는 실수를 방지합니다.

가능한 일 (증거)

연구진은 이 "전문가 팀"을 세 가지 유형의 도전 과제에서 다른 최상위 AI 에이전트들과 비교하여 테스트했습니다.

  1. 실제 데스크톱 작업 (OSWorld): 에이전트에게 "파일 다운로드", "문서 편집", "웹사이트 탐색"과 같은 일을 하도록 요청했습니다. InfantAgent-Next 는 유명한 "Claude Computer Use" 에이전트보다 7.27% 더 높은 성능을 보였습니다. 인간 도움 없이 실제로 작업을 완료하는 데 더 뛰어났습니다.
  2. 코딩 및 버그 수정 (SWE-Bench): 에이전트에게 실제 소프트웨어 프로젝트의 고장 난 코드를 수정하도록 요청했습니다. 이는 많은 비싼 폐쇄형 상용 에이전트만큼이나, 혹은 그 이상으로 잘 수행했습니다.
  3. 일반 지식 및 논리 (GAIA): 웹 검색, 파일 읽기, 추론이 필요한 복잡한 질문을 던졌습니다. InfantAgent-Next 는 모든 오픈소스 에이전트 중 2 위를 차지하여 까다로운 다단계 논리를 처리할 수 있음을 입증했습니다.

결론

InfantAgent-Next 는 모든 것이 되려고 하는 거대한 AI 모델 하나가 아닙니다. 이는 정확히 언제 "눈", "귀", "코더", 또는 "마우스 클릭기"를 소집해야 하는지 아는 모듈식 지휘자입니다. 각 전문가가 가장 잘하는 일을 하도록 함으로써 전체 시스템은 훨씬 더 똑똑하고 정확해지며, 우리가 매일 컴퓨터에서 마주치는 messy 한 실제 작업을 처리할 수 있게 됩니다.

연구진은 이 "전문가 팀"의 코드를 누구나 사용할 수 있도록 공개하여 미래에 더 나은 컴퓨터 비서를 구축하는 데 도움이 되기를 바랍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →