OpenVisTool: An Open Recipe for Synthesizing Instructive Visual Tool-Use Trajectories
이 논문은 정답의 정확성과 도구 관측의 인과적 기여도를 모두 필터링하여 교육적인 시각적 도구 사용 궤적을 합성하는 프레임워크인 OpenVisTool을 소개하며, 이는 모델이 단순히 호출 패턴을 모방하는 것이 아니라 증거에 기반하여 도구 사용을 접지하도록 가르침으로써 멀티모달 에이전트의 성능을 유의미하게 향상시키는 데이터셋과 벤치마크를 결과로 낳는다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 로봇에게 미스터리를 해결하는 법을 가르치고 있다고 상상해 보세요. 당신에게는 단서(이미지)가 가득한 거대한 도서관과, 이미지의 특정 부분을 확대하거나 자르거나 강조할 수 있는 특별한 돋보기(도구) 세트가 있습니다. 인공지능의 세계에서 이러한 "멀티모달 에이전트"들은 점점 더 똑똑해지고 있지만, 종종 벽에 부딪히곤 합니다. 바로 초기 스냅샷에 보이는 것만 볼 수 있다는 점입니다. 만약 단서가 아주 작은 글씨나 흐릿한 구석에 숨겨져 있다면, 로봇은 그것을 놓치게 됩니다. 이를 해결하기 위해 과학자들은 로봇이 답을 내기 전에 새로운 증거를 수집하도록 돋보기를 능동적으로 사용하는 법을 가르치고 있습니다. 하지만 여기서 까다로운 문제가 발생합니다. 로봇이 도구를 사용해서 정답을 맞혔다고 해서, 그 도구가 실제로 도움이 되었다는 뜻은 아니라는 점입니다. 어쩌면 로봇은 이미 기억 속에서 답을 알고 있었음에도, 도구를 사용하라는 지시를 받았기 때문에 단순히 사용하는 척했을 수도 있습니다. 이 논문은 중요한 질문을 던집니다: 어떻게 하면 로봇에게 단순히 도구를 사용하는 습관을 흉내 내는 것이 아니라, 도구가 진정으로 필요할 때만 도구를 사용하도록 가르칠 수 있을까요?
이 연구를 진행한 연구진은 OpenVisTool이라고 주장하며, 현재 이러한 로봇을 훈련시키는 방식에 결함이 있다고 말합니다. 그들은 로봇에게 도구를 사용하여 정답을 맞힌 "성공적인" 이야기를 보여주는 것은, 학생에게 복잡한 공식을 다 적지는 않았지만 정답을 맞힌 수학 시험지를 보여주는 것과 같다고 말합니다. 학생은 "공식을 쓰는 것이 좋은 성적을 가져다준다"라고 배우지만, 왜 그 공식이 필요했는지는 배우지 못합니다. 저자들은 더 엄격한 훈련 데이터 레시피를 제안합니다. 그들은 훈련 예시가 유용하려면 두 가지 조건이 충족되어야 한다고 강조합니다. 첫째, 로봇이 정답을 맞춰야 하며(결과 타당성, Outcome Validity), 둘째, 로봇이 그 답에 도달하기 위해 실제로 도구가 필요했어야 합니다(인과적 유용성, Causal Utility). 만약 로봇이 도구 없이도 문제를 풀 수 있었다면, 그 예시는 버려집니다.
이를 증명하기 위해 팀은 차트 읽기, 표 분석, 컴퓨터 화면 탐색, 시각적 세부 사항 검색, 웹 페이지를 코드로 변환하기 등 다섯 가지 서로 다른 시각적 세계에 걸쳐 정교하게 필터링된 42,000개의 예시를 담은 거대한 새로운 데이터셋인 OpenVisTool-42K를 구축했습니다. 그들은 세 단계의 과정을 통해 이 데이터셋을 만들었습니다. 첫째, 도구 없이는 해결할 수 없는 "어려운" 문제들을 선별했습니다. 둘째, 매우 똑똑한 "선생님" 로봇이 각 유형의 퍼즐에 맞는 특정 전략을 사용하여 이 문제들을 해결했습니다. 마지막으로, 그들은 엄격한 "감독 검증(supervision verification)" 테스트를 실시했습니다. 선생님의 솔루션을 가져와서 더 약한 "학생" 로봇에게 동일한 문제를 풀게 했습니다. 만약 학생 로봇이 선생님의 도구 노트 없이는 실패했지만, 그것이 있으면 성공했다면 그 예시는 유지되었습니다. 만약 학생이 도구 유무와 상관없이 문제를 풀 수 있었다면, 그 예시는 "중복"된 것으로 간了 보고 폐기되었습니다.
결과는 인상적이었습니다. 연구진이 네 가지 서로 다른 로봇 모델(40억 개의 파라미터부터 270억 개의 파라미터를 가진 소규모 모델까지)을 이 새로운 데이터셋으로 미세 조정했을 때, 로봇들은 도구 사용 능력이 눈에 띄게 향상되었습니다. 그들의 자체 테스트 벤치인 OpenVisTool-Bench에서 모델들은 평균 10.7 포인트 개선되었습니다. 가장 큰 폭의 상승은 시각적 탐색에서 나타났는데, 모델들은 23.8 포인트를 획득했습니다. 더욱 흥고한 점은, 이 데이터로 훈련된 작은 오픈 소스 모델들이 보통 이 분야를 지배하는 거대 폐쇄형 모델(GPT-5.5와 같은)만큼이나 잘 수행했다는 것입니다. 예를 들어, OpenVisTool-42K로 훈련된 Qwen3.5-9B 모델은 평균 45.8점을 기록하여, 도구 없이 훈련되지 않은 GPT-5.5(41.9점)를 앞질렀으며, 도구를 사용한 GPT-5.5(49.0점)에 매우 근접했습니다.
이 연구는 또한 이 새로운 훈련 방식이 다양한 유형의 퍼즐에 걸쳐 작동하는 "메타 기술"을 가르친다는 것을 발견했습니다. 그들이 훈련받은 로봇을 한 번도 본 적 없는 문제(out-of-distribution tasks)로 테스트했을 때, 로봇들은 이전의 덜 엄격한 데이터로 훈련된 로봇들보다 여전히 더 나은 성능을 보였습니다. 그러나 저자들은 특정 유형의 퍼즐(예: 차트만 학습)에 대해서만 훈련하는 것이 때때로 다른 유형(예: 웹 페이지)의 성능을 저해할 수 있다는 사실도 발견했으며, 이는 다양한 도전 과제의 혼합이 최선임을 시사합니다. 궁극적으로, 이 논문은 로봇에게 도구를 사용하는 법을 가르치는 비결은 단순히 성공 사례를 보여주는 것이 아니라, 도구가 진정한 영웅이었던 이야기를 보여주는 것이라고 제안합니다. "가짜" 도구 사용을 걸러냄으로써, OpenVisTool은 로봇이 단순히 돋보기를 어떻게 사용하는지가 아니라, 언제 실제로 그것을 집어 들어야 하는지를 배우도록 돕습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.