← 최신 논문
🤖 machine learning

HyperEyes: Dual-Grained Efficiency-Aware Reinforcement Learning for Parallel Multimodal Search Agents

HyperEyes는 시각적 기반과 검색을 동시 행동으로 융합하는 이중 세분화 효율 인식 강화 학습 프레임워크를 통해 훈련된 병렬 다중 모달 검색 에이전트로, 기존 순차적 에이전트보다 뛰어난 정확도와 현저히 감소된 추론 비용을 달성합니다.

원저자: Guankai Li, Jiabin Chen, Yi Xu, Xichen Zhang, Yuan Lu

게시일 2026-05-11
📖 3 분 읽기☕ 가벼운 읽기

원저자: Guankai Li, Jiabin Chen, Yi Xu, Xichen Zhang, Yuan Lu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

한 장의 사진에 등장하는 여섯 명의 용의자를 수사하는 형사가 되어 상상해 보세요.

기존 방식 (직렬 검색):
전통적인 AI 에이전트는 매우 꼼꼼하지만 느린 형사처럼 작동합니다. 그들은 사진을 보고 첫 번째 사람을 선택한 뒤, 그 사람의 얼굴을 잘라내어 인터넷에서 검색하고 결과를 읽은 다음 두 번째 사람으로 이동합니다. 이 과정을 한 명씩 반복합니다.

  • 문제점: 사진에 여섯 명이 있다면, 형사는 도서관을 여섯 번 따로 방문해야 합니다. 여섯 번째 사람에 도달할 때쯤이면 첫 다섯 번의 방문으로 노트가 너무 많은 정보로 뒤덮여 집중하기 어려워집니다. 이는 여섯 가지 코스 요리 중 한 냄비의 물을 끓이고 기다린 뒤 다음 냄비를 끓이는 방식으로 요리를 하는 것과 같습니다. 시간이 매우 오래 걸리고 에너지를 낭비합니다.

새로운 방식 (HyperEyes):
이 논문은 **"더 길게가 아니라 더 넓게 검색하라"**는 철학을 따르는 새로운 AI 에이전트인 HyperEyes를 소개합니다.
HyperEyes 는 도서관을 여섯 번 방문하는 대신, 사진 전체를 보고 여섯 명의 용의자를 한 번에 식별한 뒤 한 번의 방문으로 여섯 개의 검색 요청을 동시에 보냅니다. 이는 여섯 명의 다른 연구원을 동시에 도서관으로 보내고, 모두 병렬로 작업하게 하여 단일하고 조직화된 보고서를 가져오게 하는 것과 같습니다.

HyperEyes 의 훈련 과정 ("학교" 비유)

연구자들은 AI 에게 단순히 더 빠르게 하라고 지시한 것이 아니라, 두 가지 주요 단계로 구성된 특별한 훈련 학교를 구축했습니다.

1. "엄격한 교사" 단계 (데이터 합성):
먼저, 그들은 방대한 양의 연습 문제 도서관을 만들었습니다. 하지만 그들은 단순히 어떤 정답을 원한 것이 아니라, 가장 빠른 정답을 원했습니다.

  • 그들은 **Progressive Rejection Sampling(점진적 기각 샘플링)**이라는 기법을 사용했습니다. 이는 교사가 학생에게 시험을 치르게 하는 상황으로 상상해 보세요. 학생이 문제를 푸는 데 10 분이 걸리면 교사는 그 시도를 폐기합니다. 2 분 만에 풀면 교사는 그것을 보관합니다. 그들은 AI 가 처음부터 날카롭게 반응하도록 가르치기 위해 가장 빠르고 효율적인 해결책들만 남겼습니다.

2. "이중 세분화된" 코칭 단계 (강화 학습):
AI 가 기초를 익힌 후, 연구자들은 두 가지 수준의 특수 코칭 시스템을 적용했습니다.

  • 매크로 수준 (큰 그림): 그들은 TRACE라는 보상 시스템을 AI 에게 부여했습니다. 이는 "3 단계로 미스터리를 해결하면 금별을 주고, 5 단계로 풀면 패널티를 받는다"고 말하는 코치와 같습니다. 중요한 점은 코치가 시간이 지남에 따라 더 엄격해진다는 것입니다. AI 가 3 단계로 해결하는 법을 배우면, 코치는 기준을 2 단계로 높입니다. 이는 AI 가 단순히 정확할 뿐만 아니라 지속적으로 더 효율적으로 만들도록 강요합니다.
  • 마이크로 수준 (세부 사항): 때때로 AI 는 halfway 에서 실수를 합니다. **On-Policy Distillation(OPD)**은 AI 가 실패할 때만 개입하는 "유령 작가"처럼 작동합니다. 유령 작가 (더 똑똑하고 큰 AI) 는 학생 AI 에게 올바른 다음 단어를 속삭여, 이미 올바르게 처리한 부분에 시간을 낭비하지 않고 정확히 어디에서 잘못되었는지 가르쳐 줍니다.

새로운 점수판 (IMEB)

연구자들은 기존 테스트가 AI 가 정답을 맞혔는지 여부만 중시하고, 소요 시간이나 수행한 "도서관 방문 횟수 (도구 호출)"는 무시한다는 점을 깨달았습니다.
그들은 **IMEB(Image Multi-Entity Benchmark)**라는 새로운 벤치마크를 만들었습니다.

  • 비유: 경기를 채점하는 상황을 상상해 보세요. 기존 테스트는 누가 결승선을 먼저 통과했는지만 보았습니다. 새로운 테스트 (IMEB) 는 누가 결승선을 통과했는지 그리고 누가 가장 적은 연료를 사용했는지를 봅니다. 그들은 정확성은 보상하되 시간과 에너지 낭비는 강력하게 패널티를 부과하는 **비용 인식 점수 (Cost-Aware Score)**를 도입했습니다.

결과

HyperEyes 를 기존 최상위 AI 에이전트들과 비교 테스트했을 때:

  • 정확도: 경쟁사보다 더 자주 정답을 맞혔습니다 (구체적으로, 최상위 오픈소스 라이벌보다 9.9% 더 높음).
  • 효율성: 압도적으로 빨랐습니다. 동일한 문제를 해결하는 데 필요한 "도서관 방문 횟수"가 5.3 배 적었습니다.

요약

HyperEyes 는 교통 체증이 발생하는 1 차선 도로에서 다차선 고속도로로 업그레이드하는 것과 같습니다. AI 에게 모든 단서를 한 번에 보도록 가르치고 불필요한 우회로를 취하는 것을 처벌함으로써, 연구자들은 단순히 더 똑똑할 뿐만 아니라 훨씬 더 효율적인 에이전트를 만들었습니다. 이는 복잡한 시각 퍼즐을 기존 시간의 일부만으로 해결합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →