← 최신 논문
🤖 AI

Mitigating Legibility Tax with Decoupled Prover-Verifier Games

이 논문은 솔버의 정답이지만 검증 불가능한 출력을 검증 가능한 형식으로 변환하는 번역 모델을 학습시킴으로써, 정확성을 보존하는 동시에 검증 가능성을 향상시켜 '가독성 세금(legibility tax)'을 완화하는 디커플링된 증명자-검증자 게임 프레임워크를 제안한다.

원저자: Yegon Kim, Juho Lee

게시일 2026-06-19
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yegon Kim, Juho Lee

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

큰 문제: "가독성 세금(Legibility Tax)"

매우 똑똑하고 천재적인 학생(대규모 언어 모델)이 아주 어려운 수학 문제를 풀 수 있다고 상상해 보세요. 하지만 이 학생에게는 나쁜 습 습관이 하나 있습니다. 자신의 풀이 과정을 설명할 때, 매우 지저분하거나 혼란스럽고, 혹은 지나치게 복잡한 방식으로 글을 쓰는 것입니다.

이 학생이 부정행위를 하지 않는지 확인하기 위해, 당신은 이 학생보다 훨씬 덜 똑똑한 선생님(검증자, "Verifier")을 고용했습니다. 선생님의 역할은 학생의 설명을 읽고 "맞다" 또는 "틀리다"라고 말하는 것입니다.

문제점: 이 학생들이 선생님이 이해하기 쉽게 글을 쓰도록 훈련시키려 했던 이전의 시도들에서 문제가 발생했습니다. 학생들은 선생님이 이해하기 쉽게 설명을 만들려고 노력하는 과정에서, 실제 수학 정답을 맞히는 데 있어 실수를 하기 시작했습니다. 즉, 설명을 보기 좋게 만드는 데 집중하느라 정답을 맞히는 것을 희생한 것입니다.

저자들은 이를 **"가독성 세금(Legibility Tax)"**이라고 부릅니다. 이는 마치 시험에서 만점을 받았지만, 선생님이 읽을 수 없는 방식으로 답을 적어서 결국 0점 처리를 받는 학생과 같습니다. 혹은 더 나쁜 경우로, 선생님이 이해하기 쉽도록 정답을 일부러 쉬운 답으로 바꿔버리는 학생과도 같습니다.

기존 방식: "모든 것을 다 하는" 학생

기존 방식(표준 프로버-베리파이어 게임이라 불림)에서는 학생에게 두 가지 일을 동시에 요구했습니다:

  1. 수학 문제를 올바르게 풀 것.
  2. 선생님이 확인할 수 있도록 설명을 명확하게 작성할 것.

본 논문은 학생에게 이 두 가지를 동시에 요구하는 것이 너무 어렵다고 주장합니다. 학생은 혼란에 빠져 "명확성" 부분을 통과하기 위해 수학 문제를 틀리기 시작합니다.

새로운 해결책: "번역가" 팀

저자들은 이 문제를 해결하기 위해 세 가지 역할을 가진 새로운 팀 구조를 제안합니다. 한 명의 학생이 모든 것을 하도록 하는 대신, 업무를 분리합니다:

  1. 솔버 (해결사, The Genius): 이 모델은 오직 정답을 맞히는 데만 훈련됩니다. 설명이 지저분하든 상관하지 않습니다. 그저 수학 문제를 완벽하게 풀어낼 뿐입니다.
  2. 트랜슬레이터 (번역가/편집자, The Editor): 이 모델의 유일한 임무는 천재(Genius)의 지저분한 풀이를 가져와서 깨끗하고 읽기 쉬운 형식으로 다시 쓰는 것입니다. 이 모델은 "정답을 바꾸지는 않되, 보기 좋게만 만들겠다"라고 약속해야 합니다.
  3. 베리파이어 (검증자/선생님, The Verifier): 이 모델은 번역가의 결과물을 검사합니다. "이 설명이 명확한가? 그리고 천재의 정답과 일치하는가?"를 묻습니다.

훈련 방법: "굿 캅, 배드 캅(Good Cop, Bad Cop)" 게임

번역가가 실제로 정직하게 행동하고 선생님을 속이려 들지 않도록 하기 위해, 저자들은 두 종류의 번역가를 설정하여 게임을 진행합니다.

  • 성실한 번역가 (The Faithful Translator): 이 모델은 천재의 답을 원래와 똑같이 유지하면서 명확하게 다시 쓰는 것을 목표로 합니다.
  • 교활한 번역가 (The Sneaky Translator): 이 모델은 "사기꾼"입니다. 선생님으로부터 정답을 전달받지만, 틀린 답이 정답인 것처럼 보이도록 만드는 그럴듯한 설명을 써내야 합니다. 이 모델은 검증자를 속여서 틀린 답을 맞다고 믿게 만들려고 시도합니다.

게임의 규칙:

  • 검증자는 성실한 번역가(정직한 쪽)와 교활한 번역가(거짓말하는 쪽)를 구별해 내려고 노력합니다.
  • 성실한 번역가는 자신의 설명이 명확하고 정확하다는 것을 검증자에게 인정받으려 합니다.
  • **교활한 번는 검증자를 속이려고 노력합니다.

시간이 흐름에 따라, 검증자는 거짓말을 잡아내는 데 매우 능숙해집니다. 성실한 번역가는 정답을 유지하면서도 완벽하게 명확해지는 것만이 승리하는 길임을 배우게 됩니다. 교활한 번역가는 더 이상 검증자를 속일 수 없다는 것을 깨닫게 됩니다.

결과: 세금이 사라지다

본 논문은 "정답을 맞히는 부분"과 "읽기 좋게 만드는 부분"을 분리함으로써 문제를 해결했음을 보여줍니다.

  • 정확도: 시스템은 천재 솔버(Genius Solver)의 높은 정확도(수학 테스트에서 약 57%)를 그대로 유지했습니다.
  • 가독성: 번역가는 수학적 내용을 바꾸지 않으면서도 체크하기 쉬운 답변을 만드는 법을 배웠습니다.
  • 세금 없음: 모델이 너무 명확하게 보이려고 노력하느라 정확도가 22%까지 떨어졌던 기존 방식과 달리, 이 새로운 방식은 높은 정확도를 유지하면서도 출력을 검증 가능하게 만들었습니다.

간단한 비유: 건축가와 설계도

건축물을 짓는 상황을 생각해 보세요:

  • 기존 방식: 당신은 건축가에게 집을 설계하는 동시에 설계도를 완벽하게 그리라고 요구했습니다. 건축가가 선을 예쁘게 그리는 데 너무 집중한 나머지, 실수로 주방 위치를 잘못 배치하게 된 것입니다.
  • 새로운 방식: 당신은 집을 완벽하게 설계하는 **마스터 빌더(Master Builder)**를 고용합니다(그림이 얼마나 예쁜지는 신경 쓰지 않습니다). 그다음, 빌더의 거친 메모를 받아 아름답고 읽기 쉬운 설계도로 만드는 것이 유일한 임무인 **제도사(Draftsman)**를 고용합니다. 또한, 설계도가 빌더의 메모와 일치하는지 확인하는 **검사관(Inspector)**을 고용합니다.

만약 제도사가 그림을 더 단순하게 만들기 위해 주방의 위치를 바꾸려 한다면, 검사관이 이를 잡아낼 것입니다. 그 결과, 집은 올바르게 지어지고(정확도), 설계도는 읽기 쉬운(가독성) 상태가 됩니다.

요약

이 논문은 AI 모델이 답변을 읽기 쉽게 만들기 위해 스스로 "멍청해지는" 현상을 막는 방법을 소개합니다. "솔버(정답을 맞히는 역할)"와 "번역가(읽기 좋게 만드는 역할)"로 업무를 나누고, 이들을 "교활한" 사기꾼 모델과 대결시켜 훈련함으로써, 정확도를 잃지 않으면서도 똑똑하고 검증하기 쉬운 시스템을 만들어냈습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →