← 최신 논문
🤖 AI

ICA: Information-Aware Credit Assignment for Visually Grounded Long-Horizon Information-Seeking Agents

본 논문은 안정적인 웹페이지 스냅샷을 활용하여 고효용 정보 단위를 식별하고 중간 단계에 조밀한 보상을 할당함으로써, 여러 벤치마크에 걸쳐 장기 시각적 근거 정보 탐색 에이전트의 성능을 크게 향상시키는 증거 중심 프레임워크인 정보 인지 신용 할당(Information-Aware Credit Assignment, ICA)을 제안한다.

원저자: Cong Pang, Xuyu Feng, Yujie Yi, Jiaqi Su, Zixuan Chen, Jiawei Hong, Tiankuo Yao, Nang Yuan, Jiapeng Luo, Lewei Lu, Xin Lou

게시일 2026-08-26
📖 3 분 읽기☕ 가벼운 읽기

원저자: Cong Pang, Xuyu Feng, Yujie Yi, Jiaqi Su, Zixuan Chen, Jiawei Hong, Tiankuo Yao, Nang Yuan, Jiapeng Luo, Lewei Lu, Xin Lou

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인터넷이라는 거대하고 변화무쌍한 풍경 속에서, 단 하나의 구체적인 사실을 찾아내는 것은 끊임없이 재배치되는 건초더미 속에서 바늘을 찾는 것과 같이 느껴질 수 있습니다. 인공지능에게 이 과업은 핵심적인 도전 과제가 되었습니다. '에이전트'라고 불리는 현대의 컴퓨터 프로그램들은 디지털 연구가처럼 행동하도록 설계되었습니다. 이들은 질문을 읽고, 웹을 검색하며, 링크를 클릭하고, 정보를 짜맞추어 답을 형성할 수 있습니다. 이러한 작업이 단순할 때는 프로그램들이 잘 작동합니다. 하지만 검색이 여러 단계를 거쳐야 하고, 먼 곳에 있는 점들을 연결하기 위해 정보의 층위 속으로 깊숙이 파고들어야 할 때, 프로그램들은 종종 어려움을 겪습니다. 핵심적인 어려움은 컴퓨터가 자신의 실수로부터 배우는 방식에 있습니다. 만약 프로그램이 몇 시간 동안 검색한 끝에 마침내 정답을 찾아낸다면, 프로그램은 자신이 성공했다는 사실은 알게 됩니다. 하지만 어떤 구체적인 검색이나 어떤 특정 웹페이지가 그 성공의 열쇠였는지는 알지 못합니다. 이는 마치 기말고사에서 만점을 받았지만, 어떤 학습 세션이나 어떤 교과서의 장이 자신에게 실제로 가장 도움이 되었는지 설명하지 못하는 학생과 같습니다. 무엇이 효과적이었는지 알지 못한다면, 프로그램은 다음번을 위한 전략을 개선할 수 없습니다.

한 연구팀은 디지털 에이전트가 웹을 바라보는 방식과 여정으로부터 배우는 방식을 바꿈으로써 이 문제를 해결했습니다. 그들은 컴퓨터가 일반적으로 웹페이지를 처리하는 방식, 즉 시각적 레이아웃을 제거하고 모든 것을 평문 텍스트로 축소하는 방식이 중요한 단서들을 유실하게 만든다는 점을 깨달았습니다. 웹페이지가 단순한 단어의 목록으로 변환될 때, 정답을 담고 있을 수 있는 구조, 표, 그리고 시각적 맥락은 사라집니다. 이를 해결하기 위해 연구진은 에이전트가 웹페이지를 화면을 찍은 사진처럼 완전한 시각적 스냅샷으로 취급하도록 가르쳤습니다. 이는 레이아웃과 시각적 단서들을 보존하여, 정보를 더 안정적이고 다양한 검색 과정에서도 인식하기 쉽게 만듭니다.

이러한 더 명확한 시야를 바탕으로, 연구팀은 '정보 인지적 신용 할당(information-aware credit assignment)'이라 부르는 새로운 교수법을 도입했습니다. 이 방법은 긴 검색이 끝날 때까지 기다려 성공이나 실패에 대해 단 하나의 등급만을 매기는 대신, 과정 중의 모든 단계 하나하나를 살펴봅니다. 이 방법은 다음과 같은 간단한 질문을 던집니다. "이 특정 행동이 유용한 정보 조각을 가져왔는가?" 수천 번의 서로 다른 검색 시도를 비교함으로써, 시스템은 에이전트가 정답을 찾았을 때 일관되게 존재했던 특정 웹페이지나 검색 결과를 식별할 수 있습니다. 그런 다음 시스템은 유용한 정보 조각들이 발견된 검색의 특정 순간들에 '보상'을 부여합니다. 이는 모호하고 전부 아니면 전무인(all-or-nothing) 방식의 학습을, 무엇이 효과적이었고 무엇이 그렇지 않았는지에 대한 상세한 지도로 바꾸어 놓습니다.

이 접근 방식의 결과는 심도 있는 다단계 추론을 요구하는 일련의 어려운 정보 탐색 과제들을 통해 테스트되었습니다. 연구진은 이 새로운 시스템을 방대한 양의 컴퓨팅 파워와 독점 데이터를 사용하는 일부 프로그램을 포함한 다른 선도적인 프로그램들과 비교했습니다. 더 작은 모델 크기에도 불구하고, 이 시스템은 다른 프로그램들을 지속적으로 능가했습니다. 복잡한 브라우징을 포함하는 한 어려운 벤치마크에서, 이 새로운 방법은 25%의 성공률을 달ographic했는데, 이는 차순위 오픈 소스 시스템이 달성한 15%보다 현저히 높은 수치였습니다. 일반적인 AI 비서 역량을 측정하기 위해 설계된 또 다른 테스트에서, 이 시스템은 3배 더 큰 시스템들을 능가하며 거의 70%의 정확도에 도달했습니다. 이러한 개선은 단순히 더 많은 정답을 맞히는 것뿐만 아니라 효율성에 관한 것이기도 했습니다. 시각적 스냅샷이 페이지의 구조를 보존했기 때문에, 시스템은 콘텐츠를 이해하기 위해 훨씬 적은 양의 단어를 처리해야 했으며, 끝없는 원시 텍스트 덩어리를 읽으려 할 때 발생하는 혼란을 피할 수 있었습니다.

연구진은 또한 에이전트가 수집한 구체적인 정보 조각들을 살펴봄으로써 왜 이 방법이 잘 작동하는지 조사했습니다. 그들은 시스템이 가장 가치 있는 단서들을 식별하는 데 매우 뛰어나다는 것을 발견했습니다. 시스템이 유용하다고 표시한 상위 평가된 증거들만을 추출했을 때, 에이전트는 무작위 정보나 가장 유용하지 않은 정보를 사용했을 때보다 훨씬 더 자주 질문에 올바르게 답할 수 있었습니다. 이는 검색 시간이 얼마나 길든 상관없이 유효했으며, 이는 시스템이 소음 속에서 신호를 인식하는 법을 배우고 있음을 입증했습니다. 이 연구는 인공지능을 웹의 시각적 실재에 접목시키고, 적절한 시기에 올바른 정보 조각들을 가치 있게 여기도록 가르침으로써, 우리가 단순히 더 빠른 것이 아니라 지식 탐구에 있어 더 똑똑하고 신뢰할 수 있는 에이전트를 만들 수 있음을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →