← 최신 논문
🤖 AI

ImProver 2: Iteratively Self-Improving LMs for Neurosymbolic Proof Optimization

이 논문은 데이터 효율적인 전문가 반복과 구조적 발판 시스템을 결합하여 작은 언어 모델이 Lean 4 에서 복잡한 형식적 증명들을 효과적으로 최적화할 수 있도록 하고, 훨씬 더 큰 모델들을 크게 능가하면서도 증명 최적화를 확장 가능하고 학습 가능한 작업으로 확립하는 신경기호 프레임워크인 ImProver 2 를 소개합니다.

원저자: Riyaz Ahuja, Tate Rowney, Jeremy Avigad, Sean Welleck

게시일 2026-05-25
📖 4 분 읽기☕ 가벼운 읽기

원저자: Riyaz Ahuja, Tate Rowney, Jeremy Avigad, Sean Welleck

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

수학적 증명들의 거대하고 성장하는 도서관을 상상해 보세요. 이들은 단순한 이야기가 아닙니다. 사실성을 입증하는 엄격하고 컴퓨터로 검증된 청사진들입니다. 최근 컴퓨터 (특히 인공지능) 가 인간이 이러한 증명을 작성하는 것을 돕기 시작하면서 이 도서관의 규모는 폭발적으로 증가했습니다.

하지만 문제가 하나 있습니다: 도서관이 지저분해지고 있습니다. 일부 증명은 정확하지만 혼란스러운 스타일로 작성되었고, 다른 것들은 너무 길며, 일부는 유지 보수가 어렵게 만드는 방대한 규칙 목록에 의존합니다. 배관 시스템은 작동하지만 배관은 엉켜 있고, 벽은 상반된 색상으로 칠해져 있으며, 전등을 켜기 위해 추가 도구가 가득 찬 배낭을 들고 다녀야 하는 집과 같습니다.

ImProver 2 가 등장합니다.

ImProver 2 는 단순히 책을 정리하는 것이 아니라 더 좋게 다듬기 위해 책을 다시 쓰는 초기율적이고 자기 개선 능력을 갖춘 사서라고 생각하세요. 이의 임무는 올바른 증명을 받아 수학적으로 깨뜨리지 않으면서 더 짧고, 깔끔하며, 모듈화된 형태로 다시 쓰는 것입니다.

다음은 몇 가지 간단한 비유를 통해 그 작동 방식을 설명한 것입니다:

1. "연습이 완벽을 만든다" 루프 (반복적 자기 개선)

일반적으로 컴퓨터에게 작업을 가르치려면 인간이 작성한 수천 개의 예시를 보여줍니다. 하지만 증명 최적화의 경우, 좋은 예시는 드뭅니다.

ImProver 2 는 스스로 가르치는 방식으로 이를 해결합니다.

  • 초안: 증명을 가져와서 다양한 방식으로 다시 써봅니다 (이야기에 대한 10 가지 다른 결말을 브레인스토밍하는 작가처럼).
  • 채점: 어떤 재작성이 여전히 수학적으로 올바른지 확인합니다. 그런 다음 우리가 원하는 기준에 따라 점수를 매깁니다: 더 짧은가? 외부 참조가 적은가? 더 명확한 단계로 나뉘었는가?
  • 교훈: 이기는 재작성과 지는 재작성을 비교합니다. "아, 내가 이렇게 했을 때 증명이 짧아졌고 여전히 정확했어. 내가 저렇게 했을 때는 깨졌어."라고 배웁니다.
  • 재생 버퍼: AI 가 배운 것을 잊거나 나쁜 아이디어의 순환에 빠지지 않도록, 오래된 좋은 예시와 새로운 예시를 섞은 '기억 은행'을 유지합니다. 이는 동일한 실수를 반복하는 것이 아니라 시간이 지남에 따라 계속 발전하도록 보장합니다.

2. "뉴로심볼릭 발판" (훈련용 바퀴)

매뉴얼이나 도표 없이 복잡한 엔진을 수리해 보라고 상상해 보세요. 어렵습니다. 이제 정확히 어떤 부분을 작업하고 있는지 강조하고, 그 부분이 무엇을 하는지 평이한 영어로 설명하며, 필요한 도구를 근처에 나열하는 도표가 있다고 상상해 보세요.

ImProver 2 는 모든 증명에 대해 AI 에게 이러한 '도표'를 제공합니다. 이를 뉴로심볼릭 증강이라고 합니다. 이는 다음을 제공합니다:

  • 지도: 증명의 현재 상태 (지금까지 증명된 것, 남은 작업) 를 보여줍니다.
  • 맥락: 해당 증명과 관련된 특정 정의와 규칙을 불러와 AI 가 추측할 필요가 없게 합니다.
  • 번역: 증명이 무엇을 하려는지 '평이한 영어'로 요약하여 AI 가 코드를 작성하기 전에 목표를 이해하도록 돕습니다.

이러한 '발판'은 작고 덜 강력한 컴퓨터조차 훨씬 크고 똑똑한 컴퓨터처럼 작동하도록 돕습니다.

3. 세 가지 목표 (지표)

사서는 증명이 단순히 '올바르기만' 하기를 원하지 않습니다. 요리사가 레시피를 조정하듯이 특정 품질을 최적화하기를 원합니다:

  • 길이 (골프 지표): 골프에서 공을 홀에 넣기 위해 최소한의 스윙으로 하는 것과 같습니다. ImProver 2 는 불필요한 단계를 제거하여 증명을 짧게 하려고 노력합니다.
  • 의존성 (자기 완결성 지표): "이웃집의 비밀 소스를 추가하세요"라고 말하는 레시피를 상상해 보세요. 이것이 의존성입니다. ImProver 2 는 증명을 다시 써서 외부 '이웃집 소스'에 그렇게 많이 의존하지 않도록 하여, 독립적으로 이해하고 사용하기 쉽게 만듭니다.
  • 모듈성 (레고 지표): 지저분한 증명은 거대한 점토 덩어리와 같습니다. 모듈화된 증명은 레고 세트처럼 작고, 구별되며, 재사용 가능한 조각들입니다. ImProver 2 는 논리가 더 명확해지도록 큰 증명을 더 작고 독립적인 하위 증명 (예: "h1 가 있음", "h2 가 있음") 으로 분해하려고 노력합니다.

결과: 작지만 강력함

가장 놀라운 발견은 ImProver 2 가 작은 AI 모델 (70 억 개 파라미터) 을 가져와 이러한 작업에 더 능숙하도록 훈련시켰다는 점이며, 이는 이러한 특별한 훈련을 받지 않은 거대한 AI 모델들 (일부는 수천억 개 파라미터) 보다 더 뛰어났습니다.

이는 컴팩트하고 효율적인 스포츠카를 가져와 엔진을 완벽하게 튜닝하여, 더 큰 엔진을 가진 거대하고 무거운 트럭이 특정 경주에서 이기게 하는 것과 같습니다. 올바른 '발판'과 올바른 '연습 루프'를 부여받은 작은 모델은 거인들보다 복잡한 수학적 논증을 재구성하는 법을 더 잘 배웠습니다.

요약하자면: ImProver 2 는 작은 AI 모델들을 전문가 수준의 증명 편집자로 가르치는 시스템입니다. 문제의 명확한 지도를 제공하고 스스로의 최선의 시도들로부터 학습하게 함으로써, 지저분한 수학적 도서관을 정리하여 더 짧고, 깔끔하며, 유지 보수가 쉬워지게 만듭니다. 이는 가장 비싸고 거대한 슈퍼컴퓨터가 필요하지 않습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →