← 최신 논문
💻 computer science

OpenDeepThink: Parallel Reasoning via Bradley--Terry Aggregation

OpenDeepThink 는 모델 재튜닝 없이 Codeforces 와 같은 객관적 벤치마크에서 상당한 성능 향상을 이루며, 후보 솔루션을 선택, 변이, 진화시키기 위해 쌍별 Bradley-Terry 비교를 집계함으로써 LLM 추론을 강화하는 인구 기반 테스트 시간 계산 프레임워크입니다.

원저자: Shang Zhou, Wenhao Chai, Kaiyuan Liu, Huanzhi Mao, Qiuyang Mang, Jingbo Shang

게시일 2026-05-15
📖 4 분 읽기☕ 가벼운 읽기

원저자: Shang Zhou, Wenhao Chai, Kaiyuan Liu, Huanzhi Mao, Qiuyang Mang, Jingbo Shang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매우 어려운 퍼즐, 예를 들어 복잡한 수학 문제나 까다로운 코딩 챌린지를 풀려고 한다고 상상해 보세요. 보통 AI 에게 이를 해결해 달라고 요청하면, AI 는 하나의 긴 직선으로 문제를 생각하며 접근합니다. 만약 초반에 작은 실수를 범하면 전체 답변이 무너져 버리고, 처음부터 다시 시작해야 합니다.

이 논문은 OpenDeepThink이라는 새로운 방법을 소개합니다. 이 방법은 AI 에게 단일한 직선으로 생각하도록 요청하는 대신, 군중 속에서 생각하도록 요청합니다.

다음은 비유를 사용하여 단순한 단계로 분해한 작동 원리입니다:

1. "브레인스토밍 파티" (병렬 샘플링)

OpenDeepThink 은 AI 에게 하나의 답변만 요구하는 대신, 동시에 20 개의 서로 다른 답변을 생성하도록 요청합니다.

  • 비유: 당신이 수학 문제를 풀라고 20 명의 학생에게 질문하는 교사일 때를 상상해 보세요. 당신은 가장 똑똑한 아이의 답변만 기다리는 것이 아니라, 모두에게 즉시 자신의 해법을 적어보게 합니다. 어떤 이는 훌륭하고, 어떤 이는 보통이며, 어떤 이는 완전히 틀린 해법을 제시할 것입니다.

2. "토너먼트" (쌍별 비교)

이제 20 개의 해법이 있지만, 어떻게 가장 좋은 것을 고를까요? 보통은 AI 에게 "이 답변이 좋은가?"라고 물어볼 수 있습니다. 하지만 논문은 AI 가 고립된 상태에서 자신의 작업을 평가하는 데는 서툴다고 말합니다 (과도하게 자신감 있거나 편향되는 경향이 있습니다).

  • 해결책: "이게 좋은가?"라고 묻는 대신, AI 에게 두 개의 답변을 나란히 비교하도록 요청합니다. "해법 A 와 해법 B 중 어느 것이 더 좋고, 그 이유는 무엇인가?"
  • 비유: 스포츠 토너먼트를 생각해 보세요. 단순히 선수들을 보고 "세계 최고의 선수"가 누구인지 말하기는 어렵습니다. 하지만 선수 A 와 선수 B 를 한 경기에서 맞붙게 한다면, 누가 승리하는지 훨씬 쉽게 알 수 있습니다. AI 는 심판 역할을 하여 해법 쌍들이 서로 경쟁하게 하고, 각 쌍마다 승자를 선언합니다.

3. "스코어보드" (브래들리 - 테리 집계)

AI 가 여러 쌍을 비교한 후, 단순히 승리 횟수를 세는 것이 아닙니다. 전 세계적 순위를 매기기 위해 특수한 수학 공식 (브래들리 - 테리) 을 사용합니다.

  • 비유: 축구 리그 테이블을 상상해 보세요. 팀 A 가 팀 B 를 이기고, 팀 B 가 팀 C 를 이겼다면, 수학은 두 팀이 아직 서로 경기하지 않았더라도 팀 A 가 팀 C 보다 더 강력할 가능성이 높다는 것을 압니다. 이는 20 개의 해법에 대한 신뢰할 수 있는 "리더보드"를 생성합니다.

4. "진화" (변이와 선택)

이제 마법이 일어납니다. 시스템은 단순히 승자를 선택하고 멈추지 않습니다. 여러 라운드 (세대) 에 걸쳐 해법을 진화시킵니다.

  • 하위 25% (패배자): 가장 나쁜 해법들은 폐기됩니다.
  • 상위 25% (엘리트): 가장 좋은 해법들은 안전하게 보관되지만, 개선할 기회도 얻습니다.
  • 중간 75% (변이체): AI 는 "비판" (한 해법이 다른 해법을 이긴 이유) 을 가져와 해법을 다시 작성합니다.
    • 비유: 코치가 선수들에게 이야기하는 상황을 상상해 보세요. 단순히 "잘했다"라고 말하는 대신, "너는 달리기 속도가 너무 느려서 졌다"라고 말합니다. 선수들은 그 구체적인 피드백을 바탕으로 전략을 변경합니다. AI 는 피드백이 완전히 새로운 접근이 필요하다고 제안하면 해법을 완전히 다시 작성할 수도 있습니다.

5. "최종 대결"

이 "토너먼트와 훈련" 루프를 몇 번 거친 후, 시스템은 남은 최상위 해법들에 대해 한 번 더 매우 상세한 비교를 수행하여 제출할 단일 최상의 답변을 선택합니다.

이것이 왜 중요한가요?

  • "요약지" 불필요: 보통 AI 가 맞는지 확인하려면 인간이나 컴퓨터 프로그램이 답변을 점검해야 합니다 (검증자). OpenDeepThink 는 그런 것이 필요 없습니다. AI 가 스스로와 비교함으로써 최상의 답변을 찾아냅니다.
  • 어려운 문제에 강함: 이 논문은 매우 어려운 코딩 문제 (경쟁적 프로그래밍 등) 에서 이 방법을 테스트했습니다. 그 결과, 이 방법은 최상위 AI(Gemini 3.1 Pro) 가 훨씬 더 높은 수준의 전문가처럼 작동하도록 하여, 그 "기술 등급"을 400 점 이상 향상시켰습니다.
  • 한계를 인지함: 이 방법은 수학이나 코딩처럼 명확한 정답과 오답이 있는 주제에서는 훌륭하게 작동합니다. 하지만 에세이를 쓰거나 역사를 논의하는 것과 같은 주관적인 주제에서는 오히려 성능이 떨어질 수 있습니다. 이는 "사실"을 비교하는 것보다 "의견"을 비교하는 것이 더 어렵기 때문입니다. 심판 (AI) 이 좋은 의견과 나쁜 의견을 구분하지 못하면 전체 시스템이 혼란에 빠집니다.

비용

대가는 속도와 비용입니다. AI 가 20 개의 답변을 생성하고, 쌍별로 비교하며, 여러 번 다시 작성해야 하기 때문에 많은 컴퓨팅 파워와 시간이 소요됩니다 (테스트에서 문제당 약 27 분). 이는 한 사람에게만 묻는 것이 아니라, 한 문제를 해결하기 위해 전문가 팀 전체와 판사 패널을 고용하는 것과 같습니다.

요약하자면: OpenDeepThink 는 AI 의 추론을 "혼자 달리는 스프린트"에서 "팀 토너먼트"로 바꿉니다. AI 가 스스로와 경쟁하고 비교를 통해 자신의 실수에서 배움으로써, 혼자일 때보다 훨씬 더 어려운 문제를 해결합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →