← 최신 논문
💬 NLP

DS@GT ARC at Touché: Large Language Models for Retrieval-Augmented Debate

이 논문은 Touché 2025를 위한 DS@GT ARC 팀의 검색 증강 토론 시스템을 소개하며, 이 시스템은 응답 생성 및 평가를 위해 6개의 프런티어 LLM을 활용하는 한편, 다중 LLM 평가자들이 강력한 내부 합의를 보여줌에도 불구하고 이러한 합의가 특히 Quality 극대화와 관련하여 공식적인 성능을 안정적으로 예측하는 데는 실패한다는 점을 밝히고 있다.

원저자: Anthony Miyaguchi, Conor Johnston

게시일 2026-08-11
📖 6 분 읽기🧠 심층 분석

원저자: Anthony Miyaguchi, Conor Johnston

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

컴퓨터가 단순히 대화하는 것을 넘어 실제로 논쟁을 벌이는 세상을 상상해 보십시오. 이것은 기계가 대화를 나누고, 논점을 토론하며, 심지어 변호사의 역할을 수행하도록 학습하는 과학의 한 분야인 **대화형 AI(Conversational AI)**의 놀이터입니다. 하지만 여기서 까다로운 문제가 있습니다. 컴퓨터가 논쟁을 '잘' 하고 있는지 어떻게 알 수 있을까요? 인간의 세계에는 명확하게 말하기, 진실 말하기, 너무 많이 혹은 너무 적게 말하지 않기 등 좋은 대화를 위한 규칙이 있습니다. 여러분이 읽게 될 이 논문에서 연구자들은 **그라이스 격률(Gricean Maxims)**이라는 유명한 규칙 세트(생각해 보세요, 이는 "예의 바르고 효과적인 대화를 위한 규칙"입니다)를 사용합니다. 또한 그들은 검색 증강 생성(Retrieval-Augmented Generation), 즉 컴퓨터가 말을 하기 전에 도서관에서 사실을 찾아보는 방식(단순히 지어내지 않도록 하는 방법)을 사용합니다. 모두가 던지는 큰 질문은 이것입니다. 만약 우리가 여러 대의 초지능 AI 컴퓨터에게 서로의 논쟁을 채점하게 한다면, 그들은 서로 동의할까요? 그리고 만약 그들이 모두 동의한다면, 그것이 정말로 훌륭한 논쟁이라는 뜻일까요?

조지아 공과대학교(Georgia Tech)의 DS@GT 팀이 작성한 이 논문은 로봇 토론가를 만드는 것이 목표였던 최근의 대회인 Touché 2025를 깊이 파고듭니다. 이 팀은 두 가지 역할, 즉 토론 응답을 생성하고 이를 채점하기 위해 여섯 가지 서로 다른 "슈퍼 브레인"(거대 언어 모델)을 사용하는 시스템을 구축했습니다. 그들은 이 슈퍼 브레인들이, 특히 먼저 사실을 찾아볼 수 있을 때, 논쟁을 생성하는 데 매우 뛰어나다는 것을 발견했습니다. 하지만 진짜 놀라운 점은 그들이 이 AI 브레인들을 심판으로 사용하려고 했을 때 나타났습니다. 연구진은 AI 심판들이 서로의 의견에 자주 동의하지만, 그들의 동의는 일종의 함정이라는 것을 발견했습니다. 이것은 마치 여섯 명의 쌍둥이에게 시험지를 채점하게 하는 것과 같습니다. 그들은 같은 집에서 자랐고 생각하는 방식이 비슷하기 때문에 정답을 맞혀서가 아니라, 서로 똑같이 생각하기 때문에 같은 점수를 주는 것입니다.

연구팀은 지구가 평평하다는 주장과 같은 주제로 AI 토론자들이 논쟁하는 시뮬레이션을 실행했습니다. 그들은 AI 심판들이 어떤 규칙(예: 관련성)에는 매우 엄격하지만, 다른 규칙(예: 예의)에는 놀라울 정도로 관대하다는 것을 발견했습니다. 가장 충격적인 발견은 **품질(Quality)**에 관한 것이었습니다. AI 심판들은 종종 어떤 논증이 "고품질"이라고 동의하며 높은 점수를 주곤 했지만, 인간 운영진이 공식적인 정답을 확인했을 때 AI는 자주 틀렸습니다. AI 심판들은 설득력 있게 들리지만 실제로는 사실 관계가 불분명한 논증에 속아 넘어갔습니다. 이 논문은 여러 AI 모델이 점수에 대해 합의했다고 해서 그 점수가 반드시 신뢰할 수 있는 것은 아니라는 점을 시사합니다. 특히 사실 여부를 확인하는 문제에 있어서는 더욱 그렇습니다. 요컨대, AI 심판들은 문장이 잘 쓰였는지(well-written)를 포착하는 데는 뛰어나지만, 그 문장이 실제로 사실인지(true)를 포착하는 데는 서투르며, 잘못된 이유로 서로 동의하는 경향이 있습니다.

로봇 토론자 이야기

연구진은 토론을 위한 디지털 아레나를 설정했습니다. 한쪽에는 주장을 펼치는 시뮬레이션된 인간 사용자가 있었고, 반대편에는 DS@GT 팀의 AI 시스템이 대응해야 했습니다. 하지만 이것은 단순한 채팅이 아니었습니다. 이것은 **검색 증강 토론(Retrieval-Augmented Debate)**이었습니다. AI가 말하기 전에, AI는 디지털 도서관(논증 데이터베이스)으로 가서 자신의 주장을 뒷받침할 상위 10개의 증거를 반드시 추출해야 했습니다. 이것이 "RAG" 부분입니다. AI는 단순히 추측할 수 없었으며, 반드시 근거(receipts)를 가져와야 했습니다.

팀은 세 회사(OpenAI, Google, Anthropic)에서 제공하는 여섯 가지 서로 다른 "프런티어" 모델(당시 사용 가능한 가장 진보된 AI)을 사용했습니다. 그들은 이 모델들에 gpt-4.1, gemini-2.5-pro, claude-opus-4와 같은 이름을 붙였습니다. 이 모델들은 사용자의 논증에 대한 응답을 생성하는 특정 임무를 부여받았습니다. 그 후 팀은 이 응답들을 가져와 동일한 모델(및 다른 모델들)에게 심판 역할을 하도록 요청했습니다. 심판들은 네 가지 규칙에 따라 응답을 채점해야 했습니다:

  1. 양(Quantity): 충분히 말했는가, 혹은 너무 많이 말하지 않았는가?
  2. 품질(Quality): 사실이며 증거에 의해 뒷받침되는가?
  3. 관계(Relation): 주제에서 벗어나지 않았는가?
  4. 방식(Manner): 명확하고 예의 바른가?

"쌍둥이" 문제

여기서 이야기는 흥미로워집니다. 연구진은 다음과 같이 알고 싶었습니다. "만약 이 모든 AI 심판들이 같은 점수를 준다면, 그 점수를 믿을 수 있는가?" 그들은 100개의 서로 다른 토론 주제와 수천 번의 턴을 포함하는 대규모 시뮬레이션을 실행했습니다.

먼저, 그들은 AI 모델들이 토론자로서 어떻게 수행하는지 살펴보았습니다. 결과는 인상적이었습니다. "사실을 먼저 찾아보는" 전략을 사용한 모델들은 매우 잘 수행했습니다. 예를 들어, gpt-4.1 모델은 대화 규칙을 따르는 데 있어 평균 0.70의 점수를 기록했는데, 이는 대회에서 가장 높은 점수 중 하나였습니다. 이는 AI에게 도서관 접근 권한을 주는 것이 논쟁을 더 잘하게 만든다는 것을 보여주었습니다.

하지만 그다음, 그들은 AI 모델들을 심판으로서 살펴보았습니다. 그들은 물었습니다. "이 심판들은 서로 동의하는가?" 대답은 강력한 **"예"**였지만, 함정이 있었습니다. 같은 회사 출신의 심판들(예를 들어, 두 개의 구글 모델이나 두 개의 앤스로픽 모델)은 거의 완벽하게 일치했습니다. 예를 들어, 두 앤스로픽 심판은 모든 규칙에 걸쳐 0.844의 상관관을 보였습니다. 이것은 두 명의 쌍둥이가 퍼즐을 완성하고 나서, 하늘을 직접 보았기 때문이 아니라 같은 환경에서 자랐기 때문에 "우리 둘 다 하늘이 파랗다고 생각해"라고 말하는 것과 같습니다.

연구진은 이 높은 일치도가 오해의 소지가 있다는 것을 깨달았습니다. 그들은 AI 심판들의 점수를 인간 운영진이 준 공식 점수와 비교했습니다. 결과는 불일치했습니다.

  • **양(Quantity)**과 **관계(Relation)**에 대해서는 AI 심판들의 합의가 인간의 점수와 어느 정도 근접했습니다.
  • 하지만 **품질(Quality)**에 대해서는 격차가 매우 컸습니다. AI 심판들은 응답이 훌륭하다고 생각하여 높은 점수를 주었지만, 인간 운영진은 매우 낮은 점수를 주었습니다. 공식 결과에서 gpt-4.1 실행은 품질 면에서 단 0.17을 기록했는데, 이는 대부분의 경우 사실적으로 올바른 논증을 제공하는 데 실패했음을 의미합니다. 그럼에도 불구하고 AI 심사위원들은 높은 점수를 주었습니다.

"약한 감독(Weak Supervision)" 실험

팀은 이 문제를 해결하려고 시도했습니다. 그들은 궁금했습니다. "만약 우리가 '더 약한' 심판들을 섞는다면 어떨까?" 그들은 "쌍둥이" 식의 합의를 깨뜨릴 수 있는지 확인하기 위해, 다른 팀인 SINAI가 사용한 더 작은 오픈 소스 모델들(예: LLaMA-8B)과 간단한 컴퓨터 규칙(예: 단어 길이 세기)을 추가했습니다.

그들은 이 다양한 의견들을 결합하기 위해 **약한 감독(weak supervision)**이라는 통계적 기법을 사용했습니다. 그들은 서로 다르게 생각하는 심판들을 추가함으로써 더 정확한 점수를 얻을 수 있기를 희망했습니다.

  • 더 약한 심판들을 추가했을 때 순위가 약간 변했습니다.
  • 그러나 AI 심판들의 "합의"와 인간의 "공식 점수" 사이의 상관관계는 여전히 낮았습니다. 품질(Quality) 지표의 경우, 확장된 풀을 사용했을 때 상관관계는 0.224였고, 의존성을 고려한 모델에서는 0.286이었습니다.

이는 그들이 상황을 섞으려고 노력했을 때조차도, AI 심판들이 인간이 무엇을 "좋은" 논증이라고 생각하는지 신뢰성 있게 예측할 수 없음을 의미합니다. 이 논문은 AI 심판들이 스타일(문장이 매끄러운가? 예의 바른가?)을 포착하는 데는 뛰어나지만, 실체(그 사실이 진짜인가?)를 포착하는 데는 서투르다는 점을 시사합니다.

핵심 결론

이 논문은 AI 토론자를 만드는 모든 이들에게 경고를 하며 끝을 맺습니다. 여러 명의 초지능 AI 모델이 어떤 논증이 "좋다"고 합의했다고 해서 그것이 반드시 사실인 것은 아닙니다. 그들은 단지 유사한 데이터로 훈련되었고 동일한 편향을 공유하기 때문에 합의하는 것일 수도 있습니다. 이는 특히 품질(Quality) 측면에서 두드러집니다. AI 모델들은 자신감 있고 구조적으로 잘 짜여 있지만 실제로는 거짓이나 조작된 사실으로 가득 찬 응답에 속을 수 있습니다.

저자들은 미래에 우리가 단순히 AI가 AI를 채점하도록 맡겨서는 안 된다고 제안합니다. 우리는 더 구체적이어야 합니다. AI에게 "이것이 좋은 논증인가?"라고 묻는 대신, "이 사실이 참인가?"와 "이 증거가 실제인가?"를 별도로 물어야 합니다. 우리가 그렇게 할 수 있을 때까지, AI 심판들의 "합의"는 방 안의 사람들이 고개를 끄덕이며 동의하는 것과 같습니다. 그들은 모두 틀릴 수 있으며, 모두 같은 이유로 틀릴 수 있습니다. 이 논문은 이 문제를 해결했다고 주장하는 것이 아니라, 빛을 비추어 보여주는 것입니다. 즉, 신뢰할 수 있는 AI 토론으로 가는 길은 단순히 AI에게 스스로를 채점하게 하는 것보다 훨씬 더 어렵다는 것을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →