NightFeats @ MMU-RAGent NeurIPS 2025: A Context-Optimized Multi-Agent RAG System for the Text-to-Text Track
NightFeats는 협소한 지표 최적화가 아닌 구조적 투명성과 검증 가능한 근거 기반의 그라운딩을 통해 독점적 베이스라인들을 능가하며, 검색(retrieval), 선별(curation), 구성(composition)이라는 원칙적인 3단계 파이프라인을 채택함으로써 NeurIPS 2025에서 Best Dynamic Evaluation을 수상한 컨텍스트 최적화 멀티 에이전트 RAG 시스템이다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
완벽하고 신뢰할 수 있는 보고서를 쓰려고 노력 중인 한 명의 전문가를 상상해 보세요. 하지만 혼자서 모든 것을 하는 대신, 세 명의 전문가가 협력하는 팀이 있습니다. 이것이 바로 NightFeats의 본질입니다. 질문에 정확하게 답하고, 스스로의 작업을 검토하며, 항상 자신의 근거(인용)를 제시하도록 설계된 스마트한 3인 AI 에이전트 팀입니다.
이 팀은 최근 NeurIPS 2025에서 열린 MMU-RAGent라는 큰 대회에 참가했습니다. 다른 팀들이 컴퓨터 테스트에서 정답처럼 보이게 만드는 데 집중할 때, NightFeats는 **"최고의 동적 평가(Best Dynamic Evaluation)"**라는 특별상을 받았습니다. 이는 컴퓨터의 자동 점수 산정 방식에서는 최고점을 받지 못했을지라도, 실제 사람들이 보기에 그들의 답변이 더 신뢰할 수 있고 이해하기 쉬웠음을 의미합니다.
NightFeats 팀이 어떻게 작동하는지 간단한 단계별로 설명하면 다음과 같습니다.
1. 세 명의 전문가 (에이전트)
모든 것을 한 번에 처리하려는 하나의 AI 대신, NightFeats는 뉴스룸처럼 업무를 세 가지 명확한 역할로 나눕니다.
리서처 (ResearchAgent): 이 역할은 탐정입니다. 질문을 받으면 리서처는 단순히 눈에 띄는 첫 번째 정보를 가져오는 것에 그치지 않습니다. 두 가지 서로 다른 곳에서 정보를 찾아 나섭니다.
- "최신" 도서관: 뉴스나 최근 사건을 위해 가장 최신의 웹 검색 결과를 찾습니다.
- "역사" 도서관: 오래되고 기초적인 사실들을 위해 방대한 아카이브를 뒤집니다.
- 비결: 리서처는 관련성(얼마나 좋은 답변인가)과 신선도(얼마나 새로운가) 사이의 균형을 맞추기 위해 특별한 공식을 사용합니다. 이는 역사에는 10년 된 책이 완벽할 수 있지만, 오늘의 주식 시장에는 10분 전 블로그 글이 더 적합하다는 것을 아는 사서와 같습니다.
에디터 (GeneratorAgent): 이 역할은 팩트 체크 담당입니다. 리서처가 에디터에게 문서 뭉치를 보내면, 에디터는 이를 읽고 핵심 사실을 추출하며 충돌 지점을 찾습니다.
- "모순" 체크: 만약 한 소스에서는 "하늘은 파랗다"라고 하고 다른 소스에서는 "하늘은 초록색이다"라고 한다면, 에디터는 그냥 추측하지 않습니다. 이를 문제로 표시합니다. 만약 이 갈등이 심각하다면, 에디터는 논쟁을 해결할 수 있는 추가 증거를 찾기 위해 리서처를 다시 현장으로 보냅니다. 무한 루프에 빠지는 것을 방지하기 위해 이 과정은 몇 번의 제한된 횟수 내에서만 수행됩니다.
라이터 (WriterAgent): 이 역할은 스토리텔러입니다. 에디터가 깨끗하게 검증된 사실 목록을 만들고 나면, 라이터는 이를 매끄럽고 읽기 쉬운 답변으로 바꿉니다.
- 황금률: 라이터가 작성하는 모든 문장에는 반드시 "영수증"(인용)이 첨부되어야 합니다. 단순히 무언가를 말하는 것이 아니라, 그것을 어디서 들었는지 증명해야 합니다. 이 덕분에 최종 답변은 완전히 추적 가능해집니다.
2. 승리 요인 ("동적 평가" 수상)
대회에는 시스템을 판단하는 두 가지 주요 방법이 있었습니다.
- 로봇 심사위원: 답변이 "완벽한" 정답과 동일한 단어를 사용하는지 확인하는 컴퓨터 프로그램입니다.
- 인간 심사위원: 답변을 직접 읽고 가장 마음에 드는 것을 선택하는 실제 사람들입니다.
로봇 심사위원의 문제점:
NightFeats는 실제로 로봇 심사위원의 테스트(특히 ROUGE-L이라는 지표)에서 더 낮은 점수를 받았습니다. 왜일까요? NightFeats는 인용과 참조(예: "출처 A, 출처 B")를 많이 포함하기 때문입니다. 로봇 심사위원은 "이 답변은 너무 많은 추가 단어와 숫자를 가지고 있다. 정답과 정확히 일치하지 않는다!"라고 판단한 것입니다.
인간 심사위원의 승리:
하지만 실제 사람들은 NightFeats를 좋아했습니다. 사람들은 "Claude-SonnetV2"나 "Nova-Pro" 같은 고가의 하이테크 시스템보다 NightFeats를 선호했습니다. 인간들은 명확한 출처와 검증된 사실이 포함된 답변이, 그럴듯하게 들리지만 가짜일 수도 있는 답변보다 훨씬 더 신뢰할 수 있다는 것을 깨달았습니다.
3. 핵심 철학
이 논문은 AI를 구축하는 것이 단순히 컴퓨터를 속여 높은 점수를 받는 것이 아니어야 한다고 주장합니다. 대신 다음과 같은 시스템을 구축해야 한다고 말합니다.
- 스스로의 작업을 검토할 것 (팩트 체크 기능처럼)
- 정보가 얼마나 오래되었는지 알 것 (시간적 인식)
- 출처를 밝힐 것 (인용 추적 가능성)
트레이드오프 (Trade-off)
논문은 한 가지 단점에 대해서도 솔직하게 밝히고 있습니다. NightFeats는 사실 확인을 위해 리서처를 다시 보내고 모순을 확인하기 위해 에디터를 거쳐야 하기 때문에, 더 빠르고 단순한 시스템(68초)에 비해 답변을 얻는 데 시간이 조금 더 걸립니다(약 1015초).
요약하자면:
NightFeats는 세 명의 사람이 사실을 확인하고, 날짜를 검증하며, 모든 주장 뒤에 영수증을 첨부하기 전까지는 기사를 발행하지 않는 고급 뉴스룸과 같습니다. 이 과정이 시간이 조금 더 걸리고 컴퓨터 스캐너에게는 다소 "지저도" 보일 수 있지만, 실제 사람들은 그것이 정직하고 정확하며 투명하기 때문에 더 신뢰합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.