Algorithm Discovery With LLMs: Evolutionary Search Meets Reinforcement Learning
본 논문은 강화학습 미세 조정을 통해 LLM 검색 연산자를 지속적으로 정제함으로써 알고리즘 발견을 위한 LLM 기반 진화 탐색을 강화하여 조합 최적화 작업에서 우수한 해의 식별을 가속화하는 새로운 프레임워크를 제안한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
완벽한 케이크를 굽기 위한 새롭고 초고효율 레시피를 발명하려 한다고 상상해 보세요. 당신은 레시피를 작성할 수 있는 매우 재능 있는 셰프 (대형 언어 모델, 또는 LLM) 를 보유하고 있습니다.
구식 방법: "정적 셰프"
이전 방법들 (예: "FunSearch"라고 불리는 방법) 에서는 셰프에게 레시피를 작성하도록 요청했습니다. 당신은 그 레시피로 케이크를 굽고 맛을 본 후, 그것이 좋은지 확인합니다. 괜찮다면 그대로 유지하고, 훌륭하다면 셰프에게 그 훌륭한 레시피를 살펴보고 그基础上 약간 더 나은 레시피를 작성해 보라고 요청합니다. 이 과정을 수천 번 반복합니다.
문제는 무엇일까요? 셰프는 실제로 그 과정에서 배우지 않습니다. 그들은 매 시도마다 모든 것을 잊어버리는 천재와 같습니다. 그들은 원래 훈련에 기반하여 계속 추측하며, 순전히 운에 의해 더 나은 레시피를 우연히 찾아내기를 바랍니다. 그들은 좋은 케이크를 만드는 요인에 대한 내부 지식을 업데이트하지 않습니다.
새로운 방법: "EvoTune" (배우는 셰프)
이 논문의 저자들은 EvoTune이라는 새로운 방법을 제안합니다. 이는 동일한 재능 있는 셰프를 고용하는 것과 같지만, 이번에는 그들에게 특별한 학습 루프를 제공합니다:
- 맛보기 테스트 (진화적 탐색): 이전과 마찬가지로 셰프는 많은 레시피를 작성합니다. 당신은 그것들을 굽고 맛을 본 후 점수를 매깁니다. 가장 좋은 것들은 유지하고 나쁜 것들은 폐기합니다.
- 교훈 (강화 학습): 이것이 마법의 단계입니다. 나쁜 레시피를 단순히 폐기하는 대신, 셰프에게 "승자"와 "패자"를 보여주고 "차이를 보십시오! 승자는 이것을 했고, 패자는 저것을 했습니다"라고 말합니다.
- 업데이트: 그런 다음 이러한 교훈을 바탕으로 셰프에게 빠른 "리프레시 코스" (파인튜닝) 를 제공합니다. 셰프의 뇌는 실제로 승자 레시피가 왜 작동했는지 이해하도록 변화합니다.
- 반복: 이제 셰프에게 다음 배치의 레시피를 작성하도록 요청할 때, 그들은 더 이상 단순히 추측하지 않습니다. 그들은 새로 업데이트된 지식을 활용하여 좋은 지점을 훨씬 빠르게 목표로 합니다.
왜 이것이 더 나은가요?
거대한 숲에서 숨겨진 보물을 찾는다고 생각해 보세요.
- 구식 방법: 지도는 있지만 기억력은 없는 정찰병을 보냅니다. 그들은 헤매다가 한 장소를 찾아 보물을 확인한 후 모든 것을 잊어버립니다. 그들은 다음 장소를 찾기 위해 다시 무작위로 헤매야 합니다.
- EvoTune: 정찰병은 한 장소를 찾아 "아, 여기 나무가 더 빽빽하니 보물이 근처에 있을 것 같다"고 깨닫고 내부 지도를 업데이트합니다. 다음에 나갈 때 그들은 무작위로 헤매지 않고 유망한 지역을 향해 곧장 걸어갑니다.
무엇을 테스트했나요?
연구자들은 컴퓨터가 물건을 조직하는 최선의 방법을 찾아야 하는 세 가지 어려운 "퍼즐" 게임에서 이를 테스트했습니다:
- Bin Packing (박스 적재): 다양한 크기의 상자를 가능한 한 적은 수의 트럭에 담으려고 시도합니다.
- Traveling Salesman (외판원 순회 문제): 경로를 되돌리지 않고 도시 목록을 방문하는 최단 경로를 찾습니다.
- Flatpack: 서로 겹치지 않도록 격자에 기이한 모양의 블록을 끼워 넣는 것 (복잡한 테트리스와 유사).
결과
연구자들은 "배우는 셰프" (EvoTune) 가 "정적 셰프" (구식 방법) 보다 훨씬 빠르게 더 나은 해법을 찾았음을 발견했습니다.
- 더 나은 점수: EvoTune 이 찾은 레시피 (알고리즘) 는 더 효율적이었습니다.
- 더 많은 다양성: 배우는 셰프는 하나의 좋은 레시피를 찾은 후 멈추지 않았습니다. 그들은 더 넓고 다양한 고유한 고품질 해법을 발견했습니다.
- 실제 세계 승리: 하나의 특정 도전 과제 (데이터 센터에 서버를 배치하는 구글의 Hash Code 대회) 에서 EvoTune 은 대회 내 인간 팀들이 찾은 최선 해법보다 실제로 더 나은 해법을 찾았습니다.
비밀 소스
이 논문은 셰프가 창의력을 유지하도록 돕기 위해 사용한 특정 트릭도 언급합니다. 때로는 모델을 너무 많이 가르치면 그것이 "고착"되어 같은 것만 반복적으로 작성하게 됩니다. 이를 방지하기 위해 그들은 셰프가 여전히 승자들로부터 배우면서도 새로운 아이디어를 계속 탐색하도록 강요하는 특수한 수학 규칙 ("Forward KL"이라고 함) 을 사용했습니다.
한 줄 요약
EvoTune 은 탐색 (많은 것을 시도하는 것) 과 학습 (작동한 것에 기반하여 AI 의 뇌를 업데이트하는 것) 을 결합한 시스템입니다. 이는 정적 도구를 문제를 해결할수록 더 똑똑해지는 자기 개선형 파트너로 변화시킵니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.