← 최신 논문
🤖 machine learning

Sketch-and-Verify: Structured Inference-Time Scaling via Program Sketching

해당 논문은 다양한 알고리즘 스케치를 열거하고 이를 여러 후보로 채워 넣음으로써 평탄한 샘플링보다 우수한 성능을 보이는 소형 코드 모델을 위한 비용 효율적인 추론 시간 확장 전략인 Sketch-and-Verify를 소개하지만, 이는 더 강력한 모델 계층의 성능을 완전히 대체할 수는 없습니다.

원저자: Shan Jiang, Zijian Yi, Chenguang Zhu

게시일 2026-05-12
📖 4 분 읽기☕ 가벼운 읽기

원저자: Shan Jiang, Zijian Yi, Chenguang Zhu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

어려운 퍼즐을 풀려고 노력하고 있는데, 도와줄 수 있는 것은 작고 저렴한 로봇 하나뿐이라고 상상해 보세요. 이 로봇은 빠르고 저렴하지만 나쁜 버릇이 하나 있습니다. 문제를 풀려고 할 때 거의 항상 같은 잘못된 사고방식을 선택한다는 점입니다. 100 번 시도해 보라고 요청하면, 그 로봇은 그 동일한 잘못된 답변의 약간씩 다른 버전 100 개만 돌려줄 것입니다.

이것이 논문 "Sketch-and-Verify(스케치 및 검증)" 가 해결하려는 문제입니다. 이 논문은 슈퍼비싼 거대 로봇으로 업그레이드할 필요 없이, 그 작고 저렴한 로봇을 활용해 더 많은 문제를 해결할 수 있는 새로운 방법을 제시합니다.

이 방법의 작동 원리는 다음과 같이 간단한 단계로 나뉩니다:

1. 문제: "같은 노래"

보통 우리가 AI 에게 코드 작성을 요청할 때, "100 번 시도해 보고 가장 좋은 것을 하나 줘"라고 말합니다.

  • 결함: AI 의 "기본" 아이디어가 잘못되었다면, 100 번 시도해 보라고 요청하는 것은 한 사람이 나쁜 노래의 100 가지 다른 버전을 쓰게 하는 것과 같습니다. 가사나 템포는 바꿀 수 있지만, 멜로디는 여전히 잘못되었습니다. AI 는 근본적으로 다른 접근법을 시도하지 않은 채 변수 이름이나 포맷팅을 바꾸는 등 "외형적" 변화의 함정에 갇히게 됩니다.

2. 해결책: "건축가와 시공자"

저자들은 Sketch-and-Verify라는 두 단계 프로세스를 제안합니다. AI 에게 즉시 전체 코드를 작성하라고 요청하는 대신, 작업을 두 가지 역할로 나눕니다:

  • 1 단계: 건축가 (스케치)
    먼저 AI 에게 건축가처럼 행동하도록 요청합니다. "아직 코드를 작성하지 마. 이 문제를 해결하는 5 가지 완전히 다른 방법을 나열해."라고 말합니다.

    • 예시: "전략 A: 맵을 사용한다. 전략 B: 먼저 리스트를 정렬한다. 전략 C: 루프를 사용한다."
    • AI 가 전략을 선택하면, AI 는 구멍이 있는 대략적인 "청사진"(스케치) 을 그립니다. 이 청사진에는 주요 구조 (벽과 지붕) 가 있지만, 페인트 색상이나 문손잡이 같은 구체적인 세부 사항은 ?? 로 표시된 빈 칸으로 남겨둡니다.
    • 이것이 도움이 되는 이유: 이는 AI 가 건물을 짓기 시작하기 전에 다른 경로에 대해 멈춰서 생각하도록 강제합니다. AI 가 같은 곳에서 빙글빙글 돌며 걷는 대신, 서로 다른 "이웃" 해결책을 탐색하도록 보장합니다.
  • 2 단계: 시공자 (채우기)
    이제 각 청사진에 대해 AI 는 시공자 역할을 합니다. ?? 구멍을 채워 완전한 프로그램을 만듭니다.

    • AI 가 5 개의 청사진 (전략) 을 만들고 각각을 10 번씩 채웠다면, 이제 테스트할 50 개의 완전히 다른 프로그램을 갖게 됩니다.
    • 청사진들이 서로 다르기 때문에, 이 50 개의 프로그램은 구조적으로 다양합니다. 이들은 단순히 같은 아이디어를 다시 쓴 것이 아니라, 진정으로 다른 접근법들입니다.
  • 3 단계: 검사관 (검증)
    마지막으로, 이 모든 프로그램을 테스트에 통과시킵니다. 작동하는 것들을 유지하고 가장 좋은 것을 선택합니다.

3. 결과: 저렴함 vs 비쌈

연구진은 구글의 Gemini AI 세 가지 버전을 사용하여 표준 코딩 테스트인 HumanEval+ 에서 이 방법을 테스트했습니다:

  • Lite: 작고, 저렴하며, 빠른 모델.
  • Flash: 중간 모델.
  • Pro: 크고, 비싸며, 똑똑한 모델.

주요 발견 사항:

  1. 저렴한 로봇 (Lite) 의 경우: "Sketch-and-Verify" 방법은 게임 체인저였습니다.

    • Lite 로봇에게 단순히 100 번 시도해 보라고 요청한 경우 (Flat Sampling), 어려운 문제의 약 53% 를 해결했습니다.
    • Sketch-and-Verify 방법 (10 개의 청사진을 만들고 각각을 10 번씩 채움) 을 사용한 경우, 어려운 문제의 79% 를 해결했습니다.
    • 비유: 학생에게 "같은 주제에 대해 에세이 100 편을 쓰지 말고, 10 개의 서로 다른 주제에 대한 개요 10 개를 작성한 다음 채워 넣으라"고 말하는 것과 같습니다. 학생은 같은 노력으로 더 많이 배우고 더 좋은 성적을 얻습니다.
  2. 비싼 로봇 (Pro) 의 경우: 이 방법은 큰 도움이 되지 않았습니다.

    • Pro 로봇은 이미 너무 똑똑해서 그 "기본" 아이디어가 보통은 옳습니다. 다양한 전략을 스케치하도록 강요하면 오히려 약간 더 나빠졌는데, 이는 최선의 직관에서 주의를 분산시켰기 때문입니다.
    • 규칙: 만약 초지능 로봇을 가지고 있다면, 그냥 깊이 생각하게 하십시오 (Greedy). 만약 저렴한 로봇만 있다면, Sketch-and-Verify 를 사용하여 창의적으로 생각하도록 강제하십시오.

4. 결론

이 논문은 Sketch-and-Verify가 더 작고 저렴한 AI 모델에 갇혀 있을 때 추가 컴퓨팅 자원을 현명하게 사용하는 방법이라고 주장합니다.

  • 마법이 아닙니다: 약한 모델을 강한 모델보다 더 강력하게 만들지는 않습니다. 비싼 "Pro" 모델을 감당할 수 있다면, 그냥 그것을 사용하십시오.
  • 전략입니다: (예산이나 속도 때문에) 반드시 저렴한 모델을 사용해야 한다면, 이 방법이 그 모델에서 추가적인 성능을 끌어내는 최선의 방법입니다. 이는 AI 가 고착되는 것을 막고 인간 브레인스토밍 세션처럼 다양한 해결책을 탐색하도록 강제합니다.

요약하자면: AI 에게 더 열심히 시도하라고 요청하지 말고, 다르게 시도하라고 요청하십시오.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →