← 최신 논문
🤖 machine learning

Beyond Inference-Time Search: Reinforcement Learning Synthesizes Reusable Solvers

본 논문은 조합 최적화 문제를 위한 재사용 가능하고 제약 조건을 인지하는 솔버를 생성하도록 강화 학습을 통해 코드 LLM 을 학습시키는 것이 해의 품질과 계산 효율성 측면에서 기존 추론 시간 탐색 방법보다 훨씬 우수한 성능을 보임을 입증한다.

원저자: Soheyl Massoudi, Gabriel Apaza, Milad Habibi, Mark Fuge

게시일 2026-05-19
📖 4 분 읽기☕ 가벼운 읽기

원저자: Soheyl Massoudi, Gabriel Apaza, Milad Habibi, Mark Fuge

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

"추론 시간 검색을 넘어: 강화 학습이 재사용 가능한 솔버를 합성한다"라는 논문에 대한 설명을 간단한 언어와 창의적인 비유로 제시합니다.

핵심 아이디어: "매번 추측하기"에서 "매뉴얼 작성하기"로

매우 똑똑하지만 약간 혼란스러운 조수 (대형 언어 모델, LLM) 가 있다고 상상해 보세요. 여러분이 어려운 퍼즐을 줄 때마다, 이 조수는 처음부터 다시 시작하여 추측하고, 확인하고, 다시 추측하는 방식으로 해결하려 합니다. 때로는 정답을 맞추기도 하지만, 종종 막히거나 어리석은 실수를 범합니다. 이것이 오늘날 대부분의 AI 가 문제를 해결하는 방식입니다: 질문할 때마다 매번 추론합니다.

이 논문은 다른 질문을 던집니다: 만약 AI 가 퍼즐을 매번 푸는 대신, 누구나 사용할 수 있는 완벽한 지침서 (솔버) 를 작성하는 법을 배운다면 어떨까요?

연구자들은 AI 가 "추측하는 조수"가 되는 것을 멈추고 "컴파일러"처럼 행동하도록 훈련할 수 있는지 확인하고자 했습니다. 새로운 고객마다 작업을 수행하는 대신, AI 는 규칙을 한 번 배운 후 재사용 가능한 프로그램을 작성하고, 그 프로그램이 향후 수천 개의 문제를 즉시 해결할 수 있게 됩니다.

테스트: "기만적인" 퍼즐 상자

이를 테스트하기 위해 연구자들은 **상호의존적 선택 (Synergistic Dependency Selection, SDS)**이라고 불리는 특정 유형의 퍼즐을 만들었습니다.

  • 비유: 무게 제한이 있는 배낭을 가진 보물찾기를 상상해 보세요. 여러분은 가치가 있는 아이템을 고르고 싶습니다. 하지만 함정이 있습니다. 어떤 아이템은 함께 선택했을 때만 가치가 있습니다 (상호작용), 그리고 어떤 아이템은 둘 다 선택하면 서로 상쇄됩니다 (갈등). 또한, 어떤 아이템은 특정 다른 아이템을 먼저 선택해야만 합니다 (선행 조건).
  • 함정: 이 퍼즐은 "기만적"으로 설계되었습니다. 단순하고 탐욕스러운 전략 (예: "가장 무거운 아이템부터 고르자") 은 작동하는 것처럼 보이지만, 실제로는 막다른 길로 이끕니다. 직관적이고 쉬운 경로가 실제로는 벽으로 이어지는 미로와 같습니다.

"기반" AI 의 문제점

연구자들은 먼저 표준적인 미훈련 AI 모델을 사용하여 이러한 퍼즐을 해결해 보았습니다. 그들은 AI 가 각 퍼즐마다 64 번 시도하게 하고 (이 방법을 "Best-of-64"라고 함) 가장 좋은 답변을 선택했습니다.

  • 결과: 64 번 시도함에도 불구하고, AI 는 달성할 수 있었던 가치의 약 **71%**만 얻었습니다 (28.7% 의 격차).
  • 이유: AI 는 논리를 "환각"하고 있었습니다. AI 는 좋은 전략의 이름 (예: "시뮬레이션 어닐링", 이는 "상자를 흔들어 최상의 배열을 찾는 것"이라는 fancy 한 표현) 을 알고 있었지만, 그 전략에 대한 코드를 작성할 때 치명적인 논리 오류를 범했습니다. 마치 케이크 레시피를 아는 요리사가 오븐을 켜는 것을 잊거나, 더 나쁘게는 케이크를 냉동실에 넣는 것과 같습니다.

해결책: AI 에게 자신의 논리를 "수정"하도록 가르치기

연구자들은 이후 **강화 학습 (Reinforcement Learning, RL)**이라는 기법을 사용했습니다. 이는 단순히 "잘했어!" 또는 "나빠!"라고 말하는 것이 아니라 구체적인 피드백을 주는 엄격한 코치와 같습니다:

  1. "실행 가능성 게이트": 코치는 말합니다. "만약 당신의 코드가 규칙을 위반하면 (예: 서로 충돌하는 두 개의 아이템을 선택하는 경우), 점수가 아무리 좋아도 점수 0 점을 받습니다." 이는 AI 가 높은 점수를 얻는 것보다 규칙을 따르는 것을 우선시하도록 강제합니다.
  2. "게으름 방지" 페널티: 코치는 AI 가 쉬운 길 (예: 복잡한 상호작용을 무시하고 아이템을 무게순으로 정렬하는 것) 을 택하려 하면 처벌합니다.
  3. "발판": 그들은 AI 에게 구체적인 사고 템플릿을 제공했습니다. "문제를 분해하고, 전략을 추측하고, 자신의 추측을 비판한 후 코드를 작성하라."

결과: 재사용 가능한 "솔버" 탄생

이 훈련 후 AI 는 단순히 추측을 잘하게 된 것이 아니라, 근본적으로 작동 방식을 바꾸었습니다.

  • "컴파일러" 효과: AI 는 "시뮬레이션 어닐링" 전략을 올바르게 구현한 단일 재사용 가능 코드 (솔버) 를 작성하는 법을 배웠습니다.
  • 마법: **99.8%**의 경우, AI 는 이 올바른 패턴을 따르는 코드를 작성했습니다. 미훈련 AI 가 계속 저지르던 논리 오류를 수정한 것입니다.
  • 성능: 새로운 "영웅" 솔버는 이론상 가능한 최선의 답변과 5% 이내의 점수를 달성했습니다.
  • 비용: 이것이 가장 흥미로운 부분입니다.
    • 이전 방식 (퍼즐당 64 번 추측) 은 새로운 퍼즐마다 많은 컴퓨터 시간을 소모했습니다.
    • 새로운 방식 (솔버를 한 번 작성) 은 컴퓨터가 무거운 작업을 한 번만 수행하면 된다는 것을 의미했습니다. 그 후 솔버는 수천 개의 퍼즐을 즉시 실행할 수 있었습니다.
    • 수학: 새로운 방법은 기존 "추측" 방식 대비 퍼즐당 컴퓨터 시간 기준으로 91 배 더 저렴했습니다.

작동하지 않은 것 ("부정적" 교훈)

논문은 특수 훈련 기법을 제거하면 어떤 일이 일어나는지 또한 테스트했습니다:

  • 규칙 없음: AI 에게 제약 조건을 엄격히 따르는 규칙 없이 창의적으로 시도하도록만 하면, 실수를 반복하게 됩니다.
  • 부드러운 규칙: "점수가 높다면 규칙을 조금 깨도 괜찮다"고 AI 에게 말하면 실패합니다. AI 는 규칙을 존중하도록 배우기 위해 단단한 "정지" 신호가 필요합니다.
  • 프롬프트만: 지시사항에 "똑똑해져라"라고만 말하고 보상 시스템으로 훈련하지 않으면 여전히 실패합니다. 지시사항은 단지 지도일 뿐이며, 훈련은 실제로 차를 운전하는 차량입니다.

결론

이 논문은 AI 모델을 "즉석 추측자"가 아닌 "프로그래머"로 훈련시킬 수 있음을 증명합니다. 엄격한 규칙을 갖춘 강화 학습을 통해 AI 는 개별적으로 해결하는 데 고군분투하는 대신, 어려운 문제의 전체 계열을 올바르게 해결하는 재사용 가능한 도구를 합성할 수 있습니다.

이는 매일 여러분을 위해 수학 문제를 풀어주는 사람을 고용하는 것 (비싸고 느림) 과 그 사람에게 문제를 영원히 풀어줄 계산기를 만들도록 가르치는 것 (싸고 빠름) 의 차이와 같습니다. 연구자들은 올바른 훈련을 통해 AI 가 그 계산기를 만들 수 있음을 보여주었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →