One Tool Is Enough: Reinforcement Learning for Repository-Level LLM Agents
이 논문은 증류에 의존하지 않고 더 크고 폐쇄형 소스 모델을 능가하며 단일 실행 인식 '정의 이동' 도구를 활용하여 최첨단 수준의 저장소 단위 이슈 국소화를 달성하는 강화 학습 기반 LLM 에이전트인 RepoNavigator 를 소개합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
"한 가지 도구면 충분하다"라는 논문을 간단한 언어와 창의적인 비유로 설명합니다.
큰 문제: 디지털 도서관에서 길을 잃다
거대한 다층 도서관에서 고장 난 기계를 수리하려는 형사가 되어 보십시오. 이 도서관에는 수백만 권의 책 (코드 파일) 이 들어 있으며, 모두 복잡하게 연결되어 있습니다. 누군가 "분리성 (separability) 기능에 문제가 있다"고 말하지만, 어떤 책이나 어떤 페이지를 찾아야 하는지는 알려주지 않습니다.
과거의 AI 형사들 (LLM) 은 수십 가지의 다양한 전문 도구가 들어간 거대한 도구 상자를 들고 이 문제를 해결하려 했습니다. "저자별 검색" 도구, "제목별 찾기" 도구, "색인 확인" 도구, "목차 읽기" 도구 등이 그 예입니다.
- 문제점: 이 모든 도구를 들고 다니는 것은 무겁고 혼란스럽습니다. AI 는 종종 압도당해 잘못된 도구를 선택하거나 순서를 잘못 사용합니다. 마치 열 개의 손전등을 동시에 흔들며 건초 더미 속에서 특정 바늘을 찾으려 하는 것과 같습니다.
새로운 해결책: "마법 점프"
이 논문의 저자들인 RepoNavigator는 다른 접근 방식을 시도하기로 결정했습니다. 그들은 이렇게 물었습니다: 형사에게 하나의 초강력 도구만 준다면 어떨까요?
그들은 **"점프 (Jump)"**라는 단일 도구를 만들었습니다.
- 작동 원리: 형사가 책을 읽다가 이해하지 못하는 단어 (기호) 를 보았다고 가정해 보십시오. 어디를 찾아야 할지 추측하는 대신, 단순히 그 단어로 "점프!"라고 말하면 됩니다. 즉시 형사는 그 단어가 원래 정의된 정확한 페이지로 순간 이동합니다.
- 비유: 웹사이트에서 하이퍼링크에 "Ctrl+클릭"을 하는 것과 같습니다. 인터넷 전체를 검색할 필요가 없습니다. 링크를 클릭하기만 하면 바로 소스로 이동합니다.
훈련: 직접 배우기 (강화 학습)
AI 는 이 도구를 얻고 단순히 운을 기대한 것이 아닙니다. 저자들은 **강화 학습 (RL)**이라는 방법을 사용하여 이를 훈련시켰습니다.
- 옛 방식: 보통 AI 를 가르칠 때는 다른 똑똑한 AI 가 문제를 해결하는 예시를 보여줍니다 (학생이 선생님의 숙제를 베끼는 것과 같습니다). 이 논문은 "아니요, 그렇게 하지 말자"라고 말합니다.
- 새로운 방식: AI 가 스스로 문제를 해결하도록 했습니다.
- AI 가 추측을 하고 "점프" 도구를 사용합니다.
- 올바른 곳으로 점프하면 "간식" (보상) 을 받습니다.
- 잘못된 곳으로 점프하거나 막히면 "아니오" (페널티) 를 받습니다.
- 수천 번의 시도 끝에 AI 는 고장 난 코드 부분을 찾기 위해 정확히 어떤 단어로 "점프"해야 하는지 최선의 경로를 학습합니다.
결과: 작지만 강력함
이 논문은 GitHub 에서 찾을 수 있는 실제 소프트웨어 프로젝트에서 이 시스템을 테스트했습니다. 결과는 놀라웠습니다.
- 작은 모델이 큰 모델을 이겼다: 이 방법으로 훈련된 작은 AI(70 억 개 파라미터) 가 기존 "다양한 도구" 방식을 사용한 더 크고 비싼 AI(140 억 개 파라미터) 보다 더 좋은 성과를 냈습니다.
- 거인들을 꺾다: 그들의 AI 의 가장 큰 버전 (320 억 개 파라미터) 은 대부분의 테스트에서 가장 진보된 폐쇄형 소스 모델 (GPT-5 등) 보다 더 뛰어난 성능을 보였습니다.
- 단순함의 승리: 다섯 개나 여섯 개 대신 단 하나의 도구만 사용함으로써 시스템은 더 빨라지고, 더 신뢰할 수 있으며, 제어하기 쉬워졌습니다. 완벽한 날카로운 외과용 메스 한 자루가 일을 더 잘해낸다면, 스위스 아미 나이프가 필요 없다는 것을 증명했습니다.
요약
이 논문은 복잡한 코드를 탐색할 때 적은 것이 더 많다고 주장합니다. AI 에게 여러 검색 도구가 뒤섞인 지저분한 도구 상자를 주는 대신, 코드가 실제로 실행되는 흐름을 따르는 하나의 "점프" 도구를 제공하십시오. 강화 학습을 통해 시행착오를 겪으며 학습하도록 훈련된 이 간단한 에이전트는 버그를 수정할 정확한 위치를 찾는 데 놀라울 정도로 능숙해지며, 종종 훨씬 더 크고 복잡한 시스템보다 뛰어난 성과를 냅니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.