← 최신 논문
🤖 AI

SchemaRouter: Field-Aware Tool Routing for Efficient Heterogeneous Agentic RAG

SchemaRouter는 스키마 그래프를 활용하여 실행 가능한 도구 계획을 생성함으로써, 베이스라인 방식과 비교하여 답변 정확도는 경쟁력 있는 수준으로 유지하면서도 토큰 사용량과 지연 시간을 크게 줄이고 검증 가능한 출처를 제공하는, 이질적인 에이전트 기반 RAG 시스템을 위한 경량의 필드 인식 라우팅 계층입니다.

원저자: Yong-eun Cho

게시일 2026-08-25
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yong-eun Cho

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

현대 디지털 환경에서 인공지능 시스템은 방대한 외부 자원 네트워크에 접속하여 답을 찾는 과업을 점점 더 많이 맡고 있습니다. 연구자가 컴퓨터에게 새로운 재료의 특정 특성, 화합물의 화학적 조성, 또는 과학 저널의 최신 연구 결과 등을 찾아달라고 요청하는 상황을 상상해 보십시오. 이를 위해 컴퓨터는 에이전트로서 역할을 수행하며, 각각의 조각을 보유한 서로 다른 데이터베이스, 도서관, 그리고 도구들에 연결됩니다. 이러한 도구들은 각기 고유한 책들과 정보를 요청하는 규칙을 가진 전문 도서관과 같습니다. 컴퓨터의 과제는 단순히 어떤 도서관을 방문할지를 아는 것이 아니라, 정확히 어떤 책을 선반에서 꺼내어 어느 페이지를 읽어야 하는지를 아는 것입니다. 만약 너무 많은 정보를 요청하면 시스템은 느려지고 비용이 많이 들며 불필요한 데이터에 잠식될 것입니다. 반대로 너무 적은 정보를 요청하면 정답을 내는 데 필요한 결정적인 사실들을 놓치게 됩니다. 효율성과 완결성 사이의 이 균형 잡기는 연구자들이 해결하고자 하는 핵심 문제입니다.

한 연구자는 이 복잡한 정보망을 탐색하기 위해 'SchemaRouter'라는 새로운 방법을 개발했습니다. 가능한 모든 도구에 대해 모든 데이터를 무작정 묻거나, 유사한 단어를 찾기 위해 컴퓨터의 추측에 의존하는 대신, SchemaRouter는 사용 가능한 도구들의 구조화된 지도(map)를 사용합니다. 이 지도, 즉 스키마(schema)는 어떤 도구가 존재하는지뿐만 아니라, 그 도구들이 포함하는 구체적인 데이터 필드, 사용하는 측정 단위, 그리고 접근에 필요한 법적 권한까지 상세히 기술합니다. 사용자가 질문을 던지면, 시스템은 먼저 핵심 의도와 관련된 구체적인 개념을 이해하기 위해 작고 집중적인 단계를 거칩니다. 그 후, 지도를 참조하여 해당 질문에 답하기 위해 필요한 정확한 도구와 정확한 데이터 필드만을 선택합니다. 이 과정은 결정론적(deterministic)입니다. 즉, 추측에 의존하는 것이 아니라 지도에 기반한 엄격한 규칙을 따르며, 이를 통해 데이터의 출처와 소유권 등 필요한 모든 세부 사항을 포함하는 유효한 계획을 수립합니다.

연구자는 재이 분야처럼 다양한 출처로부터 정확한 데이터에 크게 의존하는 재료 과학 분야와 관련된 110개의 질문 벤치마크를 사용하여 이 접근 방식을 테스트했습니다. 그들은 이 새로운 방법을 여러 기존 전략들과 비교했습니다. 한 가지 흔한 전략은 모든 질문에 대해 전체 도구 목록과 그 설명을 컴퓨터의 메모리에 입력하는 방식이며, 또 다른 방식은 단어 매칭 기술을 사용하여 질문과 유사하게 들리는 도구를 찾는 방식입니다. 결과에 따르면, SchemaRouter는 높은 수준의 정답 정확도를 달alog 달성했으며, 이는 모든 것을 가져오는 방식의 성능과 일치하면서도 훨씬 적은 양의 데이터를 사용했습니다. 구체적으로, 새로운 방법은 0.71의 답변 정확도에 도달하기 위해 단 227단어의 컨텍스트만을 검색한 반면, 모든 것을 가져오는 방식은 유사한 수준의 정확도에 도달하기 위해 2,000단어 이상의 컨텍스트가 필요했습니다. 이러한 데이터 볼륨의 감소는 작업 완료 속도의 상당한 개선으로도 이어져, 새 시스템은 모든 정보를 로드하는 방식보다 약 2.7배 더 빠르게 작업을 완료했습니다.

이 연구의 결정적인 발견은 데이터 필드를 최소화하는 것이 자원을 절약하는 최선의 방법이라는 해당 분야의 일반적인 가설에 도전합니다. 연구자는 선택하는 데이터 필드의 수를 절대적인 최소한으로 줄이려고 시도하는 지나친 절약(parsimonious)이 오히려 최종 답변의 품질을 저해한다는 것을 발견했습니다. 필드 선택을 최소한으로 줄였을 때, 토큰 수는 거의 변하지 않았음에도 불구하고 답변 정확도는 크게 떨어졌습니다. 성공의 열쇠는 필드의 개수를 최소화하는 것이 아니라, 질문에 올바르게 답할 수 있는 능력을 유지할 수 있도록 '올바른' 필드를 선택하는 것이었습니다. 관련 데이터 그룹의 안전망을 유지함으로써, 시스템은 방대한 양의 불필요한 정보를 가져오는 것을 피하면서도 높은 정확도를 유지할 수 있었습니다. 이는 목표가 단순히 가장 적은 양의 컨텍스트를 가져오는 것이 아니라, '올바른' 컨텍스트를 가져오는 것이어야 함을 시사합니다.

속도와 정확성을 넘어, 이 새로운 방법은 신뢰성 측면에서 뚜렷한 이점을 제공합니다. 시스템은 검색된 모든 데이터의 출처와 라이선스를 명시적으로 추적하기 때문에, 어떤 데이터베이스가 어떤 조건 하에 정보를 제공했는지 밝히는 명확한 인용을 답변에 첨부할 수 있습니다. 테스트 결과, 새로운 방법은 답변의 62%에서 이러한 구체적인 출처 및 라이선스 세부 정보를 포함했습니다. 반면, 이러한 메타데이터를 모델링하지 않는 다른 방법들은 거의 모든 경우에서 이러한 인용을 제공하는 데 실패했습니다. 이는 컴퓨터가 일반적인 지식만으로는 이러한 구체적인 법적 문자열을 만들어낼 수 없으며, 반드시 출처로부터 직접 검색해야 하기 때문에 매우 중요한 진전입니다. 이러한 능력은 답변을 검증 가능하게 만들며, 이는 사실의 기원을 아는 것이 사실 자체만큼이나 중요한 과학적 및 전문적 응용 분야에서 필수적입니다.

연구자는 또한 사용 가능한 도구의 수가 늘어남에 따라 이 방식이 훨씬 더 잘 확장된다는 점에 주목했습니다. 모든 도구를 컴퓨터 메모리에 나열하는 전통적인 방식은 빠르게 비현실적이 됩니다. 도구의 수가 증가함에 따라 이를 설명하는 텍ang의 양이 선형적으로 증가하여 결국 시스템의 메모리 한계를 초과하게 되기 때문입니다. 그러나 새로운 방법은 도구의 수와 상관없이 늘어나지 않는 고정된 명령 세트를 사용합니다. 이는 시스템이 몇십 개의 도구에서 수백 개로 확장되더라도, 검색 계획을 세우는 데 드는 비용과 시간은 거의 일정하게 유지됨을 의미합니다. 본 연구는 정밀한 측정을 위해 데이터가 고정된 시뮬레이션 환경에서 수행되었으며, 저자는 결과가 유망하지만, 접근 방식의 한계를 완전히 이해하기 위해서는 다양한 유형의 질문과 더 약한 컴퓨터 모델을 사용한 추가 테스트가 필요하다는 점을 인정했습니다.

궁극적으로, 이 연구는 구조화되고 필드를 인식하는(field-aware) 라우팅 방식이 인공지능 에이전트를 더 효율적이고 신뢰할 수 있게 만드는 실질적인 방법임을 입증합니다. 데이터 필드 선택을 추측 게임이 아닌 정밀한 규칙 기반 프로세스로 다룸으로써, 시스템은 더 빠르고 투명하게 정확한 답변을 제공할 수 있습니다. 이 연구 결과는 미래에 이러한 지능형 시스템을 구축하는 가장 효과적인 방법은 단순히 가능한 많은 정보를 모으는 것이 아니라, 검증 가능한 기원을 가진 '올바른 컨텍스트'를 검색하는 데 집중하는 것임을 시사합니다. 이러한 전략적 전환을 통해 기술은 가용한 데이터의 엄청난 양에 압도되지 않고 복잡한 현실 세계의 과업을 처리할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →