← 최신 논문
🤖 AI

Visored: A Controlled-Natural-Language Prover for LLM-Generated Mathematics

이 논문은 자연어와 유사한 인터페이스와 규칙 기반 자동화를 사용하여 증명을 검증된 Lean 파일로 변환함으로써, LLM이 생성한 수학과 형식 검증 사이를 연결하는 의존 타입 기반의 증명기인 Visored를 소개하며, 별도의 특화된 학습 없이도 miniF2F 벤치마크에서 효과적인 성능을 입증한다.

원저자: Xiyu Zhai, Xinyi Chen, Yiping Wang, Runlong Zhou, Liao Zhang, Simon S. Du

게시일 2026-06-17
📖 3 분 읽기☕ 가벼운 읽기

원저자: Xiyu Zhai, Xinyi Chen, Yiping Wang, Runlong Zhou, Liao Zhang, Simon S. Du

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 천재적이지만 약간의 환각(hallucination) 증세를 보이는 학생(AI)에게 수학 증명을 쓰는 법을 가르치려 한다고 상상해 보십시오. 이 학생은 평이한 영어로 증명의 '이야기'를 쓰는 데는 뛰어나지만, 엄격한 수학 선생님이 믿음을 갖기 위해 반드시 확인해야 하는 아주 작고 지루한 세부 사항들을 자주 건너뛰곤 합니다.

현재, 만약 당신이 이 학생에게 엄격하고 컴퓨터가 읽을 수 있는 언어(예: Lean)로 증명을 쓰라고 요구한다면, 학생은 종종 막히게 됩니다. 어떤 구체적인 "라이브러리 규칙"을 선택해야 할지 모르거나, "0으로 나눌 수 없다"와 같은 아주 작은 세부 사항을 틀려버리기 때문입니다.

Visored는 이를 해결하기 위해 설계된 새로운 도구입니다. 이것은 학생의 자연어와 엄격한 컴퓨터 언어 사이에 위치하는 번역기이자 안전망 역할을 합니다.

작동 방식은 다음과 같습니다.

1. "제어된 자연어" (The Script)

Visored는 AI에게 Lean과 같은 경직된 코드 형태의 언어를 즉시 쓰도록 강요하는 대신, 제어된 버전의 영어로 쓰도록 허용합니다.

  • 비유: 이것은 마치 "매드립스(Mad Libs)" 스타일의 대본과 같습니다. AI는 아무렇게나 글을 쓸 수 없습니다. 반드시 "x를 ...라고 하자", "가정하자...", "그러면..."과 같은 특정 문장 템플릿을 사용해야 합니다.
  • 도움이 되는 이유: 이는 AI가 자신의 편안한 영역(영어 쓰기)에 머물게 하면서도, 구조는 컴퓨터가 이해할 수 있을 만큼 엄격하게 유지해 줍니다. 이는 빈 페이지 대신 빈칸 채우기 학습지를 주는 것과 같습니다.

2. "중간 관리자" (The IR)

Visored는 단순히 AI가 의도한 바를 추측하지 않습니다. 대신 그 영어 대본을 중간 계층 표현(IR이라고 불림)으로 변환합니다.

  • 비유: AI가 초안을 작성한다고 상상해 보십시오. Visored는 그 초안을 가져와서 AI가 건너뛴 모든 보이지 않는 "각주"를 채워 넣습니다. AI가 xx가 양수라고 가정했나요? Visored는 그것을 기록합니다. AI가 변수로 나누었나요? Visored는 그 변수가 0이 아닌지 확인합니다.
  • 마법 같은 점: 만약 AI가 실수를 하면, Visored는 단순히 "틀렸다"라고 말하는 데 그치지 않습니다. 마치 선생님이 빨간 펜으로 특정 오류를 동그라미 치듯, 논리가 깨진 정확한 문장을 지목합니다. 이는 AI에게 다음 시도를 어떻게 수정해야 할지에 대한 명확한 신호를 줍니다.

3. "규칙 기반 솔버" (The Auto-Grader)

Visored가 중간 계층 형식으로 증명을 완성하면, 이 "지루한" 단계들을 점검하기 위해 규칙 기반 엔진을 사용합니다.

  • 비유: 수학 교과서를 생각해 보십시오. 교과서에서 "따라서 ~이다"라고 말할 때, 인간에게는 당연해 보이기 때문에 종종 대수학적 과정을 생략하곤 합니다. Visored의 솔버는 이러한 생략된 단계들을 자동으로 채워주는 지치지 않는 로봇과 같습니다. 이 솔버는 작은 단계들의 산술, 대수, 그리고 논리를 점검합니다.
  • 결과: AI가 주요 아이디어를 제공하면, Visored가 사소한 단계들을 증명하는 지루한 "잡무"를 처리합니다.

4. "역번역" (The Back-Translation, Lean 출력)

만약 Visored가 증명에 만족한다면, 최종 검증을 위해 이를 Lean 코드(엄격한 언어)로 다시 번역할 수 있습니다.

  • 주의사항: 논문은 현재의 번역 방식이 매우 "장황하다"고 인정합니다. 이는 마치 1페이지짜리 요약본을 가지고, 모든 단어가 법적으로 정밀하도록 만들기 위해 200페이지 분량의 법률 계약서로 확장하는 것과 같습니다. 작동은 하지만, 규모가 매우 커집니다.

실제로 무엇을 달성했는가?

연구진은 이 방식을 244개의 수학 문제(대부분 중등 경시 대회 문제)에 테스트했습니다.

  • 결과: Visored를 사용하는 AI 에이전트는 이 문제 중 **91%**를 성공적으로 해결했습니다.
  • 주의점: AI가 단독으로 해결한 것이 아닙니다. AI는 루프(loop) 안에서 작동했습니다: AI가 초안을 쓰고, Visored가 이를 점검하며 "여기서 오류 발생"이라고 알려주면, AI가 이를 수정하고 다시 시도하는 방식입니다.
  • 한계: 매우 어려운 문제들(예: 국제 수학 올림피아드 문제)에서는 고전했습니다. 이는 Visored의 "규칙집"에 아직 고급 수학 기법들이 들어있지 않기 때문입니다.

핵심 요약

Visored는 어려운 수학 문제를 즉시 해결하는 마법 지팡이가 아닙니다. 대신, 이것은 협업 공간입니다. AI가 자신이 이해할 수 있는 언어(영어)로 증명을 쓸 수 있게 해주면서, 컴퓨터 시스템이 엄격한 논리와 오류 검사를 처리하도록 합니다.

이 논문은 이러한 "중간 관리자" 접근 방식을 사용함으로써, AI가 처음부터 어려운 엄격한 코딩 언어를 배울 필요 없이, 실제로 신뢰할 수 있는 수학 증명을 생성할 수 있다고 주장합니다. 이는 AI의 "환각"을 구조화되고 검증 가능한 프로세스로 전환합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →