EnterpriseRAG: Benchmarking LLM Instruction Adherence and Robustness under Non-Ideal Enterprise Retrieval
이 논문은 6개 도메인에 걸쳐 전문가가 검증한 983개의 샘플로 구성된 종합적인 벤치마크인 EnterpriseRAG를 소개하며, 이는 노이즈가 있는 검색, 지식 공백, 사실적 충돌이 수반되는 실제 운영 환경에서 거대 언어 모델이 개별적인 제약 조건은 종종 충족할지라도 전체적인 지시 이행 능력은 현저히 무너진다는 점을 드러냄으로써 기업용 검색 증강 생성(RAG) 시스템의 결정적인 "오케스트레이션 격차"를 폭로한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 아주 똑똑한 로봇에게 도움이 되는 비서가 되는 법을 가르치고 있다고 상상해 보세요. 당신은 로봇에게 지식 베이스인 도서관 한 권을 주고 질문을 던집니다. 로봇은 도서관으로 가서 몇 페이지를 집어 들고, 읽고, 답을 작성합니다. 이것을 RAG(검색 증강 생성, Retrieval-Augmented Generation)라고 부릅니다. 이는 마치 오픈북 테스트를 치르는 학생과 같습니다. 모든 것을 암기할 필요는 없지만, 정답을 맞히기 위해 적절한 페이지를 찾아 주의 깊게 읽어야 합니다.
하지만 여기 함정이 있습니다. 현실 세계의 도서관은 엉망진창일 때가 많습니다. 때로는 로봇이 질문과 전혀 상관없는 페이지를 집어 들기도 하고(노이즈), 어떤 때는 책에 답이 아예 없기도 하며(지식 공백), 또 어떤 때는 서로 다른 두 권의 책이 동일한 사실에 대해 상반된 내용을 말하기도 합니다(충돌). 대부분의 로봇 테스트는 도서관이 완벽하고 "프랑스의 수도는 어디인가?"와 같이 질문이 단순하다고 가정합니다. 하지만 실제 세상은 "지난 분기 매출을 표로 요약하되, 만약 데이터가 누락되었다면 추측하지 말고 '모름'이라고 답하고, 만약 두 보고서의 내용이 충돌한다면 둘 다 기재하라"와 같은 요청을 하는 것과 같습니다.
이 지점에서 상황은 까다로워집니다. 우리는 로봇 비서가 단순히 사실을 찾는 것을 넘어, 엄격한 규칙을 따르고, 막혔을 때는 인정할 줄 알며, 복잡한 상황에서도 헛소리를 하지 않고 문제를 해결하기를 원합니다. 만약 로봇이 이 일을 해내지 못한다면, 확신에 찬 태도로 틀린 답을 내놓을 수 있으며, 이는 중요한 결정을 내려야 하는 기업에 재앙이 될 수 있습니다.
거대한 "수행 능력(Follow-Through)"의 실패
중국 모바일(China Mobile)의 지우티안 연구소(Jiutian Research) 연구진은 이 AI 로봇들이 실제로 현실 세계의 번거로운 상황들을 얼마나 잘 처리하는지 확인하기 위해 더 강력하고 까прав한 테스트인 EnterpriseRAG를 구축했습니다. 이 테스트를 AI를 위한 일종의 "스트레스 테스트"라고 생각하면 됩니다. 이 테스트는 명령이 복잡하거나 정보가 깨져 있거나 상충할 때 AI가 얼마나 침착함을 유지할 수 있는지 확인하도록 설계되었습니다.
연구진은 에너지, 의료, 법률, 금융 등 6가지 분야에 걸쳐 983개의 까다로운 시나리오를 만들었습니다. 이 시나리오에서 그들은 단순히 간단한 질문을 던지지 않았습니다. "표를 사용하라", "추측하지 마라", "출처를 밝혀라", "만약 모순이 발견되면 나에게 알려라"와 같이 여러 규칙이 포함된 복잡한 지침을 로봇에게 주었습니다. 그런 다음, 로봇이 찾은 정보를 의도적으로 망가뜨렸습니다. 무관한 쓰레기 정보를 추가하거나, 답을 통째로 삭제하거나, 가짜 모순을 심어 놓았습니다.
거대한 발견: "오케스트레이션 격차(Orchestration Gap)"
결과는 다소 충격적이었습니다. 연구진이 로봇이 개별적인 규칙을 잘 따르는지 확인했을 때는 꽤 괜찮은 성적을 보였습니다. 약 **84%**의 경우, 로봇은 올바른 형식을 사용하거나 출처를 밝히는 것과 같은 단일 규칙을 제대로 수행했습니다. 이는 마치 학생이 모든 수학 풀이 단계는 맞혔지만 마지막 정답을 쓰는 것을 잊어버린 것과 같았습니다.
하지만 로봇이 모든 규칙을 동시에 따르는지 확인했을 때는 점수가 급락하여 고작 **27%**에 그쳤습니다. 연구진은 이를 **57점의 "오케스트레이션 격차"**라고 부릅니다. AI 모델들은 한 번에 한 가지 일을 하는 데는 뛰어나지만, 여러 복잡한 지침을 동시에 다뤄야 할 때는 무너진다는 사실이 드러났습니다. 형식은 맞췄지만 사실을 왜곡(환각)하거나, 정답은 찾았지만 데이터가 없을 때 "모름"이라고 말하는 것을 잊어버리기도 합니다.
"도움이 되고 싶은 욕구(Helpfulness)"의 함정
가장 흥iente한 발견 중 하나는 책에 답이 없을 때 로봇이 어떻게 반응하는가였습니다. 인간은 무언가를 모를 때 "모른다"라고 말해야 한다는 것을 압니다. 하지만 이 AI 로봇들은 강한 "도움이 되고 싶은 편향(helpfulness bias)"을 가지고 있습니다. 그들은 정말 도움이 되고 싶어 하기 때문에, 답을 찾을 수 없을 때 그냥 지어내는 경우가 많습니다.
테스트 결과, 정보가 누락되었을 때 답변을 거부(정답하게 '모름'이라고 말함)한 비율은 (가장 뛰어난 모델인 Claude-Opus-4.5조차) 약 **42.7%**에 불과했습니다. 나머지 **57.3%**의 경우, 그들은 자신 있게 추측하거나 환각 현상을 보이며 답을 만들어냈습니다. 이는 확신에 찬 틀린 답이 아무 답도 없는 것보다 훨씬 위험하기 때문에 매우 중요합니다.
추론은 도움이 되지만, 마법의 지팡이는 아니다
연구진은 또한 일반적인 모델보다 먼저 "생각"하는 시간(문제를 풀기 위해 잠시 멈추는 학생처럼)을 갖는 "추론(reasoning)" 모델들을 테스트했습니다. 이 모델들은 표준 모델보다 더 나은 모습을 보였습니다. 예를 들어, 이들은 두 문서가 서로 충돌하는 상황을 포착하는 데 훨씬 뛰어났습니다. 가장 좋은 추론 모델은 충돌을 **44.3%**의 확률로 포착해 낸 반면, 다른 모델들은 훨씬 낮았습니다.
그러나 "생각하는" 모델들조차 완벽하지는 않았습니다. 그들은 여전히 여러 규칙을 동시에 따르는 데 어려움을 겪었으며, 여전히 패배를 인정해야 할 때 멋대로 추측하곤 했습니다. 이 논문은 단순히 AI를 더 많이 "생각"하게 만드는 것만으로는 문제가 해결되지 않는다는 점을 시사합니다. 로봇들에게는 자신이 충분한 정보를 가지고 있는지 판단하는 법과, 흐트러짐 없이 복잡한 프로토콜을 따르는 법에 대한 더 나은 훈련이 필요합니다.
결론
이 논문은 AI가 영원히 고장 났다고 주장하는 것이 아니라, 우리가 이러한 시스템이 진지한 실무에 투입될 준비가 되었다고 과대평가하고 있음을 보여줍니다. AI가 시를 쓰거나 간단한 질문에 답할 수 있다고 해서, 그것이 복잡한 비즈니스 업무와 지저istically한 데이터, 그리고 엄격한 규칙을 처리할 수 있다는 뜻은 아닙니다. 이 시스템들을 신뢰할 수 있게 만들려면, 우리는 완벽하고 깨끗한 환경에서 테스트하는 것을 멈추고, 그들이 실제로 살아가야 할 지저분하고, 소음이 가득하며, 모순적인 세상에서 테스트를 시작해야 합니다. 우리가 이 57점의 격차를 메우기 전까지는, 이 로봇들이 스스로 중요한 결정을 내리도록 맡기는 데 매우 신중해야 합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.