← 최신 논문
💬 NLP

WorkSurface-Bench: Benchmarking Enterprise Agents on Multi-Surface Knowledge Routing

이 논문은 이질적인 지식 표면(문서, 표, 그래프) 전반에 걸쳐 질의를 라우팅하는 엔터프라이즈 에이전트의 능력을 평가하기 위해 설계된 1,151개의 감사 가능한 태스크로 구성된 새로운 벤치마크인 WorkSurface-Bench를 소개하며, 에이전트가 높은 라우팅 정확도를 달agi할 수 있음에도 불구하고 올바른 표면 선택만으로는 높은 태스크 완료율을 달성하기에 불충분하다는 점을 밝혀낸다.

원저자: Hao Liang, Meiyi Qiang, Sizhe Qiu, Linzhuang Sun, Wentao Zhang

게시일 2026-07-29
📖 4 분 읽기☕ 가벼운 읽기

원저자: Hao Liang, Meiyi Qiang, Sizhe Qiu, Linzhuang Sun, Wentao Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 바쁜 사무실을 운영하기 위해 아주 똑똑한 로봇 비서를 고용한다고 상상해 보세요. 당신은 로봇에게 "지난달 배송비로 얼마를 썼고, 어떤 파일들이 지연을 일으키고 있나요?"와 같은 복잡한 질문을 던집니다. 이 질문에 답하기 위해 로봇은 단순히 추측해서는 안 되며, 정보를 찾아봐야 합니다. 하지만 여기 함정이 있습니다. 사무실에는 성격이 매우 다른 세 종류의 정보 선반이 있습니다. 보고서와 PDF가 가득한 도서관(Library), 숫자와 계산식이 줄지어 있는 스프레드시트 룸(Spreadsheet Room), 그리고 모든 파일이 서로 어떻게 연결되어 있는지 보여주는 **지도 룸(Map Room)**이 그것입니다.

오랫동안 로봇을 테스트하던 과학자들은 주로 "정답을 맞혔는가?"만을 물었습니다. 만약 로봇이 엉뚱한 방을 뒤졌거나, 잘못된 책을 골랐거나, 계산을 틀렸다면, 테스트 결과는 그냥 "실패"라고만 나왔습니다. 하지만 이는 왜 실패했는지 알려주지 않습니다. 로봇이 지도 룸에 가야 한다는 사실을 몰랐던 걸까요? 아니면 지도 룸에 가서 올바른 지도를 찾았지만, 그것을 읽는 과정에서 혼란을 겪은 걸까요? 이 논문은 그 간극을 메우기 위해 등장했습니다. 이 논문은 어떤 종류의 지식이 필요한지 결정하는 행위와 일단 그 안에 들어간 후 퍼즐을 푸는 행위를 분리하여 로봇을 테스트하는 새로운 방법을 소개합니다. 즉, 로봇이 본격적으로 찾아보기 전에 자신이 어떤 유형의 지식을 필요로 하는지 파악할 수 있는지를 묻는 것입니다.

새로운 게임: WorkSurface-Bench

연구진은 WorkSurface-Bench라는 새로운 테스트 환경을 구축했습니다. 이것을 1,151개의 서로 다른 과업이 존재하는 거대하고 현실적인 사무실 시뮬레이션이라고 생각하면 됩니다. 그들은 다섯 가지의 "페르소나"(예: 물류 매니저 또는 재무 분석가)를 설정하고, 이들에게 문서 라이브러리, 테이블 데이터베이스, 파일 관계 그래프라는 세 가지 뚜렷한 표면(surface)에 대한 접근 권한을 주었습니다.

여기서 핵심적인 혁신은 로봇을 채점하는 방식입니다. 최종 답변에 대해 단순히 합격 또는 불합격을 주는 대신, 두 가지 별개의 요소를 점수화합니다:

  1. 경로(Route): 로봇이 올바른 "표면"(도서관, 스프레드시트, 또는 지도)을 선택했는가?
  2. 답변(Answer): 선택한 표면에서 실제로 문제를 올바르게 해결했는가?

그들은 모든 답변에 대해 "골드 스탠다드(황금 표준)"를 만들었습니다. 수학 계산이 필요한 과업의 경우, 실제 코드를 실행하여 진정한 정답을 얻었습니다. 문서를 읽어야 하는 경우, 소스의 정확한 단어를 확인했습니다. 파일 연결이 필요한 경우, 실제 경로를 추적했습니다. 이는 "정답"이 단순히 다른 AI의 추측이 아니라, 검증된 사실임을 의미합니다.

큰 반전: 어디를 봐야 할지 아는 것만으로는 충분하지 않다

연구진은 가장 똑똑한 네 가지 AI 모델(GPT-4o-mini, DeepSeek-V4-Pro, Gemini-3.1-Pro, GPT-5.5 포함)을 대상으로 여섯 가지 시나리오를 테스트했습니다. 그들은 로봇에게 정확히 어느 방으로 가야 하는지 알려줌으로써 로봇의 실수를 바로잡을 수 있는지 확인하고자 했습니다.

결과는 다음과 같았으며, 이는 약간의 반전이 있는 결말입니다: 어디를 봐야 할지 아는 것이 정답을 찾는다는 것을 보장하지는 않습니다.

연구진이 로봇에게 올바른 표면만을 사용하도록 강제했을 때( "Gold-constrained" 설정), 로봇은 올바른 방을 선택하는 데 거의 완벽해졌습니다. 그들의 "경로(Route)" 점수는 98.7%에서 99.8% 사이로 급등했습니다. 그들은 어디로 가야 할지 정확히 알고 있었습니다.

하지만 실제 솔루션의 정확도를 나타내는 "답변(Answer)" 점수는 56.1%에서 75.3% 사이에 머물렀습니다.

이는 로봇이 올바른 방에 서서 올바른 지도를 손에 쥐고 있을 때조차, 여전히 4번 중 1번 이상은 오답을 냈다는 것을 의미합니다. 로봇이 올바른 파일을 찾았더라도 숫자를 잘못 읽었거나, 스프레드시트와 문서의 정보를 잘못 결합했을 수 있습니다. 이 논문은 "올바른 도구를 선택하는 것"과 "도구를 올바르게 사용하는 것"이 완전히 다른 기술이며, 하나를 잘한다고 해서 자동으로 다른 것도 잘하게 되는 것은 아님을 보여줍니다.

힌트 vs 제한 사항

연구진은 또한 "힌트를 주는 게임"과 "방해 요소를 제거하는 게임"을 진행했습니다.

  • 힌트: 그들은 로봇에게 "스프레드시트와 지도를 봐야 합니다"라고 말했습니다. 이는 로봇이 올바른 표면을 더 잘 선택하도록 도왔고, 일부 모델의 경우 최종 답변을 약간 개선하기도 했습니다.
  • 제한 사항: 그다음, 로봇에게 필요하지 않은 나머지 도구들을 모두 빼앗았습니다. 이를 통해 로봇은 훨씬 빠르고 효율적이 되었으며, 올바른 표면을 훨씬 더 잘 선택했습니다. 하지만 놀랍게도, 이것이 항상 최종 답변을 좋게 만든 것은 아니었습니다. 사실, 일부 모델의 경우 다른 도구를 이용해 자신의 작업을 재확인할 수 있는 능력을 잃었기 때문에, 도구를 제거하는 것이 오히려 문제를 푸는 데 약간 더 부정적인 영향을 미치기도 했습니다.

미래를 위한 시사점

이 논문은 우리가 더 이상 AI 에이전트의 최종 점수만 봐서는 안 된다고 결론짓습니다. 만약 AI가 질문에 틀린 답을 했다면, 그것이 무엇을 찾아야 할지 몰라서 틀린 것인지, 아니면 올바른 곳을 찾았지만 그곳에서 찾은 것을 제대로 처리하지 못해서 틀린 것인지 알아내야 합니다.

저자들은 로봇의 27,624번의 시도를 통해 이를 측정했으며, 인간 검수자와 엄격한 규칙을 통해 결과를 감사했으므로 이 수치들에 대해 매우 확신하고 있습니다. 그들은 최고의 로봇들이 경로 선택(98% 이상)에는 매우 능숙해지고 있지만, 조각들을 올바르게 맞추는 마지막 단계(약 56~75%)에서는 여전히 어려움을 겪고 있다는 것을 발견했습니다.

요컨대, 스마트한 사무실 로봇의 미래는 단순히 사무실의 더 나은 지도를 주는 것에 있지 않습니다. 그것은 도착한 곳에서 표지판을 읽고 수학 계산을 하는 법을 가르치는 것에 달려 있습니다. 이 논문은 개발자들이 로봇의 특정 부분이 어디서 고장 났는지 추적하여, 전체가 좋아지기를 막연히 기다리는 대신 그 구체적인 부분을 고칠 수 있도록 돕는 상세한 점수판을 제공합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →