← 최신 논문
💬 NLP

Sandboxed Coding Agents are Competitive Omni-modal Task Solvers

이 논문은 샌드박스 도구를 갖춘 텍스트 전용 코딩 에이전트가 멀티모달 문제를 정보 처리 워크플로우로 변환함으로써 복잡한 오디오-비디오 작업을 효과적으로 해결할 수 있으며, 종종 네이티브 옴니모달 모델보다 뛰어난 성능을 보인다는 점을 입증하는 동시에, 오픈 소스 다중 모달리티 처리를 발전시키기 위한 Code-X 학습 레시피와 TerminalBench-O 벤치마크를 소개한다.

원저자: Dongping Chen, Xuanao Huang, Zhihan Hu, Qingyuan Shi, Dianqi Li, Tianyi Zhou

게시일 2026-06-02
📖 4 분 읽기☕ 가벼운 읽기

원저자: Dongping Chen, Xuanao Huang, Zhihan Hu, Qingyuan Shi, Dianqi Li, Tianyi Zhou

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

핵심 아이디어: "똑똑한 인턴" vs. "천재적인 초능력자"

당신에게 비디오 클립, 오디오 녹음, 문서로 구성된 거대하고 복잡한 퍼즐이 있다고 상상해 보세요. 당신은 이 퍼즐을 풀어야 합니다.

오랫동안 기술 업계는 이 문제를 해결하기 위해 "천재적인 초능력자"(네이티브 옴니모달 AI)가 필요하다고 가정해 왔습니다. 이 초능력자는 비디오와 오디오 파일 전체를 통째로 "삼켜서", 자신의 뇌 속에 모든 프레임과 음파를 한꺼번에 이해하려고 시도하는 모델입니다.

이 논문은 이 문제를 해결하기 위해 반드시 초능력자가 필요한 것은 아니라고 주장합니다. 대신, 당신은 "똑똑한 인턴"(코딩 에이전트)을 사용할 수 있습니다.

똑똑한 인턴은 비디오 전체를 통째로 삼키려 하지 않습니다. 대신, 인턴에게는 도구 상자가 있습니다. 인턴은 파일을 살펴보고, 특정 도구(예: 비디오 편집기나 음성-텍스트 변환기)를 집어 들어, 자신이 필요로 하는 아주 작은 정보 조각(예: 대본이나 특정 프레임)만을 추출한 뒤, 그 작은 증거를 사용하여 퍼즐을 해결합니다.

이 논문의 주요 주장: 도구를 사용하는 똑똑한 인턴은 모든 것을 한꺼번에 암기하려는 초능력자보다 실제로 더 빠르고, 저렴하며, 종종 이 퍼즐을 더 잘 풀어냅니다.


"똑똑한 인턴"은 어떻게 작동하는가

똑똑한 인턴을 도서관에 있는 탐정이라고 생각해보세요.

  1. 기존 방식 (네이티브 모델): 초능력자는 도서관에 걸어 들어와 선반 위에 있는 모든 책을 읽고, 모든 오디오 테이프를 듣고, 모든 영화를 동시에 보려고 합니다. 그러면 과부하가 걸리고, 많은 에너지(토큰)를 소모하며, 한꺼번에 너무 많은 것을 처리하려다 보니 때로는 세부 사항을 놓치기도 합니다.
  2. 새로운 방식 (샌드박스 에이전트): 똑똑한 인턴은 도서관에 들어가지만, 자신에게 꼭 필요한 특정 책이나 테이프만을 가져갑니다.
    • 만약 누군가 말한 내용을 알아야 한다면, 음성-텍스트 변환 도구를 사용하여 오디오를 텍ang(텍스트)으로 바꿉니다.
    • 만약 비디오 안에 무엇이 있는지 알아야 한다면, 프레임 추출 도구를 사용하여 몇 개의 핵심 장면을 뽑아냅니다.
    • 그런 다음, 그 텍스트를 읽거나 사진을 보고 질문에 답합니다.

결과: 똑똑한 인턴은 도서관 전체를 머릿속에 담고 다니지 않기 때문에 훨씬 적은 에너지(적은 "토큰")를 사용합니다. 오직 필요한 구체적인 증거만을 가지고 다닙니다.

증거: 누가 경주에서 승리하는가?

연구진은 비디오와 오디오가 포함된 네 가지 "퍼즐 경연 대회"(벤치마크)를 통해 이를 테스트했습니다.

  • 결과: 똑똑한 인턴들(GPT-5.4 및 Claude Opus와 같은 모델 사용)이 최고의 초능력자 모델들(Gemini 3.1 Pro 등)을 여러 카테고리에서 이겼습니다.
  • 비유: 이것은 퀴즈 질문에 답하기 위해 백과사전 전체를 암기하려는 사람과, 도서관 색인에서 정확히 어떤 페이지를 찾아봐야 할지 아는 사람 사이의 경주와 같습니다. 색인을 가진 사람이 효율적이고 정확하기 때문에 승리합니다.

왜 그들이 승리하는가? (도구의 이점)

연구진은 똑똑한 인턴이 비디오/오디오를 기억 장치에 저장해야 할 기억이 아니라, 처리해야 할 원재료로 취급하기 때문에 승리한다는 것을 발견했습니다.

  • 선택적 검색: 90분짜리 축구 경기를 보며 단 하나의 골 장면을 찾는 대신, 인턴은 "골" 이벤트들을 스캔하는 도구를 사용하여 해당 30초 구간만을 살펴봅니다.
  • 오류 수정: 만약 도구가 실패한다면(예: 음성-텍스트 변환기가 소음 때문에 혼란을 겪는 경우), 인턴은 다른 도구를 시도하거나 문제를 해결하기 위한 작은 스크립트를 작성할 수 있습니다. 반면 초능력자는 소음 때문에 그대로 막혀버리는 경우가 많습니다.

무엇이 잘못되는가? (실패 분류학)

똑똑한 인턴도 실수를 합니다. 연구진은 왜 이런 실수가 발생하는지 설명하기 위해 "실패 메뉴"를 만들었습니다:

  1. 잘못된 청력: 음성-텍스트 도구가 오디오를 잘못 들었습니다.
  2. 잘못된 시력: 도구가 잘못된 비디오 프레임을 선택했습니다.
  3. 너무 빨리 포기함: 에이전트가 답을 찾기 전에 단서를 찾는 것을 멈췄습니다.
  4. 잘못된 사실: 올바른 비디오를 찾았지만, 데이터베이스에서 잘못된 정보를 찾아냈습니다.
  5. 계산 실수: 올바른 사실을 가졌지만, 계산을 틀렸습니다.
  6. 고장 난 도구: 컴퓨터에 도구를 실행할 적절한 소프트웨어가 설치되어 있지 않았습니다.

인턴을 더 똑똑하게 가르칠 수 있는가? (기술 주입)

연구진은 다음과 같이 질문했습니다: "인턴의 뇌를 다시 만들지 않고도 더 똑똑하게 만들 수 있을까?"

그들은 세 가지 방법을 시도했습니다:

  1. 인간 코칭: 전문가가 작성한 매뉴얼을 인턴에게 제공합니다.
  2. 자기 연습: 인턴이 스스로 시도하고, 실패하고, 단순한 "정답/오답" 체크를 바탕으로 자신의 규칙을 조정하도록 합니다.
  3. 로그로부터 학습: 두 번째 AI가 인턴의 작업 로그를 관찰하여, 무엇이 효과적이었고 무엇이 그렇지 않았는지 패턴을 찾아내고, 인턴을 위한 새로운 "최선의 실무 지침(Best Practices)"을 작성하게 합니다.

승자: 로그 기반 자기 증류(Log-driven Self-Distillation, 로그로부터 학습) 방식이 가장 효과적이었습니다. 이것은 마치 코치가 인턴의 경기 영상을 검토한 뒤, "너는 항상 시간을 추측하기 전에 타임스탬프를 확인하는 것을 잊어버리는구나"라고 말해주는 것과 같았습니다. 이 방식은 인턴의 정확도를 크게 향상시켰습니다.

미래: "이해"에서 "수행"으로

이 논문은 우리가 AI가 미디어를 단순히 이해하는 시대(비디오에 대해 질문에 답하는 것)에서 미디어를 처리하는 시대(비디오를 편집하고, 오디오를 자르고, 새로운 파일을 생성하는 것)로 이동하고 있다고 주장합니다.

그들은 이를 측정하기 위해 TerminalBench-O라는 새로운 테스트를 도입했습니다.

  • 과제: 단순히 "이 영상에 누가 있나요?"라고 묻는 대신, AI는 하이라이트 영상을 만들고, 캡션을 쓰고, 파일을 저장해야 합니다.
  • 도전 과제: 이것은 훨씬 더 어렵습니다. 심지어 최고의 AI조차 이러한 과제의 약 24%만을 통과했습니다. 이는 긴 계획 수립과 신뢰할 수 있는 도구 사용 능력을 요구하며, 이것이 바로 이 "똑똑한 인턴"들의 다음 개척지입니다.

요약

복잡한 문제를 해결하기 위해 모든 비디오와 소리를 암기하는 거대하고 비싼 뇌가 필요한 것은 아닙니다. 대신, 구체적인 증거를 추출하기 위해 도구를 사용하는 법을 아는 똑똑하고 효율적인 에이전트가 필요합니다. 이 접근 방식은 모든 것을 한꺼번에 "이해"하려고 노력하는 것보다 더 저렴하고, 빠르며, 종종 더 정확합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →