← 최신 논문
💻 computer science

Evaluating Deep Research Agents on Expert Consulting Work: A Benchmark with Verifiers, Rubrics, and Cognitive Traps

본 논문은 인지적 함정이 포함된 중소기업 전문가가 작성한 프롬프트를 사용하여 전문가 컨설팅 작업에서 심층 연구 에이전트를 평가하기 위한 엄격한 벤치마크를 제시하며, 이는 환각, 산술 오류, 일관성 없는 추론과 같은 고유한 실패 양상으로 인해 현재 최첨단 모델 (Claude, o3, Gemini) 이 일관되게 낮은 승인율을 보임을 드러냅니다.

원저자: Tanmay Asthana, Aman Saksena, Divyansh Sahu

게시일 2026-05-19
📖 4 분 읽기☕ 가벼운 읽기

원저자: Tanmay Asthana, Aman Saksena, Divyansh Sahu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 복잡한 업무를 수행할 수 있는 초지능 연구 보조 인력 팀을 고용한다고 가정해 봅시다. 그들은 지저분하게 쌓인 문서들을 읽고, 특정 숫자를 찾아내어, 일부 계산을 수행한 뒤, CEO 를 위한 전문 보고서를 작성해야 합니다. 만약 그들이 숫자 하나만 틀리게 되면, CEO 는 수십억 달러 규모의 실수를 저지를 수 있습니다.

이 논문은 오늘날 이용 가능한 가장 첨단 AI 연구 보조 인력 세 명 (Claude, o3, Gemini) 을 대상으로 한 엄격한 직무 면접과 같습니다. 데칸 AI 연구소 (Deccan AI Research) 소속 저자들은 이러한 AI 들이 인간 경영 컨설턴트가 수행하는 세밀하고 고위험의 업무를 실제로 해낼 수 있는지, 아니면 단순히 간단한 상식 질문에만 능한지 확인하고자 했습니다.

다음은 그들의 실험을 간단한 비유로 정리한 내용입니다:

1. 시험: 함정이 가득한 장애물 코스

대부분의 이전 AI 평가는 "프랑스의 수도는 무엇인가?"와 같은 질문 (사실 회상) 을 하는 것이었습니다. 하지만 이번 시험은 달랐습니다. 저자들은 실제 컨설팅 업무를 기반으로 42 가지 복잡한 시나리오를 만들었습니다.

이러한 시나리오를 AI 를 속이도록 설계된 생존 코스로 생각하세요. AI 에게 제공된 문서에는 다음과 같은 '인지적 함정'이 포함되어 있었습니다:

  • "붉은 청어" 함정: 100 페이지 분량의 텍스트로 가득 찬 파일이지만, 정답은 98 페이지의 작은 각주에 숨겨져 있습니다.
  • "모순" 함정: 한 문서에서는 가격이 50 달러라고 명시되어 있지만, 각주에는 "화요일이 아닌 경우 60 달러"라고 되어 있습니다.
  • "수학 함정: 평균을 요구하지만, 올바른 방법은 가중 평균을 계산하는 것입니다 (각 시험의 비중을 고려해 학점을 계산하는 것처럼).

만약 AI 가 표면만 훑어보거나 추측했다면, 실패했을 것입니다.

2. 심사위원: 두 단계의 채점 시스템

이 논문은 단순히 AI 가 AI 를 채점하게 두지 않았습니다. 대신 이중 채점 시스템을 사용했습니다:

  • 1 단계: 로봇 검사관 (검증자): 이들은 엄격한 자동화된 검사입니다. AI 가 파일을 생성했는가? 올바른 숫자를 사용했는가? 올바른 출처를 인용했는가? AI 가 수학 단계 하나만 틀려도 이 단계에서 실패로 판정되었습니다.
  • 2 단계: 인간 전문가 (SME): 실제 인간 컨설턴트 (15 년 이상 경력) 가 AI 가 작성한 보고서를 읽었습니다. 그들은 다음 다섯 가지 항목으로 채점했습니다:
    • 데이터 무결성: 사실을 지어냈는가?
    • 분석적 엄밀성: 논리가 타당한가?
    • 관련성: 질문에 답했는가, 아니면 막연히 떠들었는가?
    • 실행: 계산을 올바르게 수행했는가?
    • 형식: 보고서는 전문적이고 사용 가능한가?

최종 점수는 이 두 단계가 결합되었습니다. 시험에 "합격"하려면 AI 는 로봇 검사관의 통과 기준을 충족하고 인간 전문가의 인상을 받아야만 했습니다.

3. 결과: "합격률"이 충격적으로 낮았습니다

총 126 회 시도 (42 개 작업 × 3 개 AI) 중 거의 아무도 합격하지 못했습니다.

  • Gemini는 약 **21%**의 비율로 합격했습니다.
  • Claudeo3는 단 **9.5%**의 비율로 합격했습니다.

즉, 이러한 AI 중 하나를 백만 달러 규모의 컨설팅 프로젝트에 고용한다면, 79% 에서 90% 의 확률로 사용 가능하고 정확한 보고서를 제공하지 못할 것입니다.

4. 각 AI 가 실패한 방식 (실패의 "성격")

이 논문은 각 AI 가 세 명의 다른 학생이 어려운 시험을 치르듯, 각자 고유한 방식으로 실패했다고 발견했습니다:

  • Claude (자신감 넘치는 위조자):

    • 강점: 실제로 최종 파일 (Word 문서나 Excel 시트 등) 을 생성하는 데 가장 능했습니다. 과제를 제출하는 것을 잊는 경우는 드뭅니다.
    • 약점: 거짓말을 할 가능성이 가장 높았습니다. 문서에서 답을 찾을 수 없을 때, 빈 공간을 채우기 위해 자신 있게 숫자나 출처를 지어냈습니다. 모든 사실을 지어냈지만 아름다운 에세이를 쓴 학생과 같았습니다.
  • o3 (신중하지만 서투른 수학자):

    • 강점: 추론을 수행했을 때, 그 논리는 종종 가장 깔끔했습니다.
    • 약점: 자주 보고서의 필수 섹션을 생략하거나 연쇄적인 수학 오류를 범했습니다. 첫 단계를 실수하면 나머지 수학 계산도 모두 틀렸습니다. 또한 파일 생성 지시를 무시하고 텍스트 답변만 제공하는 경우도 있었습니다.
  • Gemini (롤러코스터):

    • 강점: 작동할 때는 종종 가장 뛰어났습니다. "완벽한" 점수를 받은 횟수가 가장 많았습니다.
    • 약점: 불안정했습니다. "0 점"을 받은 횟수가 가장 많았습니다. 때로는 충돌하거나, 답변을 거부하거나, 깨진 코드가 포함된 파일을 생성했습니다. 시험을 완벽하게 통과하거나, 아예 출석조차 하지 못할 정도로 너무 못해서 실패한 학생과 같았습니다.

5. 주요 교훈

이 논문은 이러한 AI 에이전트들이 인상적이기는 하지만, 고위험의 의사결정 등급 업무에는 아직 준비가 되지 않았다고 결론 내립니다.

인간 컨설턴트가 실수를 하면 보통 사소한 실수입니다. 하지만 이러한 AI 가 실수를 하면 종종 치명적인 실패가 됩니다. 그들은 가짜 출처를 만들어내거나, 소프트웨어를 충돌시키거나, 전체 비즈니스 의사결정을 바꾸는 중요한 각주를 놓칠 수 있습니다.

저자들은 현재 이 시험의 두 번째이자 더 큰 버전을 준비 중이지만, 당분간 메시지는 명확합니다: 아직은 이러한 AI 를 회사의 수십억 달러 규모 의사결정에 신뢰해서는 안 됩니다. 그들은 여전히 신뢰할 수 있는 연구원이 되는 법을 배우고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →