← 최신 논문
🤖 machine learning

Deep Reinforcement Learning solution for pickup and delivery routing problems with time window and capacity constraints

본 논문은 수정된 JAMPR 모델에 기반하여 용량 및 시간 창 제약이 있는 중규모 픽업 및 배송 문제(CPDPTW)를 실시간으로 효과적으로 해결하고, 200개 노드를 초과하는 대규모 인스턴스에 대해 빠른 차선해를 제공하는 새로운 심층 강화 학습 접근 방식을 제시한다.

원저자: Andrew Soroka, Alex Meshcheryakov, Sergey Gerasimov

게시일 2026-08-17
📖 3 분 읽기☕ 가벼운 읽기

원저자: Andrew Soroka, Alex Meshcheryakov, Sergey Gerasimov

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 번화하고 끊임없이 성장하는 도시에서 배송 트럭 함대의 선장이라고 상상해 보십시오. 당신의 업무는 수백 명의 고객에게 소포를 배달하고 반품 물품을 수거하는 것이지만, 당신에게는 엄격한 규칙이 있습니다. 트럭이 실을 수 있는 화물의 양이 정해져 있고, 모든 고객은 집에서 택배를 받을 수 있는 특정한 시간대가 정해져 있다는 점입니다. 너무 일찍 도착하거나 너무 늦게 도착하면, 혹은 트 van 뒷면에 상자를 너무 많이 쑤셔 넣으려고 하면 계획은 실패합니다. 이것이 바로 "픽업 및 배송 문제(Pickup and Delivery Problem)"이며, 사람(고객)이 늘어날수록 점점 더 어려워지는 거대한 퍼즐입니다.

수십 년 동안 컴퓨터는 이 문제를 해결하기 위해 초고속 계산기처럼 행동하며, 완벽한 경로를 찾기 위해 수백만 가지의 가능한 경로를 하나씩 테스트해 왔습니다. 하지만 도시가 성장하고 정지 지점(stops)의 수가 폭발적으로 증가함에 따라, 이 계산기들은 길을 잃게 됩니다. 그들은 인간이 몇 분 만에 스케치할 수 있는 경로를 찾는 데 몇 시간을 허비하거나, 최악의 경우 아예 포기하며 "이 문제를 풀 수 없습니다"라고 말해버립니다. 여기서 새로운 종류의 컴퓨터 두뇌가 등장합니다: 심층 강화 학습(Deep Reinforcement Learning)입니다. 이것을 계산기가 아니라, 게임을 하며 배우는 비디오 게임 캐릭터라고 생각하십시오. 모든 가능성을 계산하는 대신, 이 모델은 이 배송 게임을 수천 번 플레이하며 매 라운드마다 더 빠르고 똑똑해집니다. 즉, 모든 옵션을 일일이 확인하지 않고도 최선의 움직임을 포착하는 법을 배우는 것입니다.

이 논문에서 모스크바 국립 대학교와 러시아 과학 아카데미 우주 연구소의 안드레이 소로카(Andrew Soroka)와 그의 팀은 이 "비디오 게임 두뇌"에게 트럭의 제한된 공간과 엄격한 시간대라는 현실 세계의 복잡한 규칙을 처리하는 법을 가르치기로 했습니다. 그들은 기존의 스마트 모델인 JAMPR를 가져와서, 트럭이 한 곳에서 물건을 집어 다른 곳에서 전달해야 하는 '픽업 앤 딜리버리' 규칙(용량 제한을 준수하면서 물건을 주고받는 과정)을 이해할 수 있도록 특별한 업그레이드를 가했습니다.

연구진은 업그레이드된 모델이 중소 규모의 도시(정지 지점 50~200개)에서 속도의 제왕이라는 것을 발견했습니다. 이러한 시나리오에서 AI는 단 몇 초 만에 거의 완벽한 경로를 내놓을 수 있으며, 이는 경로를 계산하기 시작하는 데 훨씬 더 많은 시간이 걸리는 전통적인 "계산기" 방식들을 압도합니다. 이는 마치 배송 기사가 도시를 너무 잘 알아서 최적의 경로를 즉시 외칠 수 있는 반면, 구식 컴퓨터는 여전히 지도를 읽으려고 애쓰고 있는 것과 같습니다.

하지만 도시가 거대해지면(정지 지점 400~1,000개) 이야기는 조금 더 복잡해집니다. 여기서 AI는 속도 면에서는 여전히 승자입니다. 전통적인 방식들이 첫 1분 동안 유효한 경로조차 찾지 못해 헤매는 동안, AI는 거의 즉각적으로 "충분히 좋은" 해답을 제시합니다. 그러나 AI가 아직 완벽한 것은 아닙니다. 이 거대한 도시들을 위한 절대적인 최선의 경로를 얻으려면 AI는 며칠 동안 "훈련"을 해야 하는데, 이는 매우 긴 시간입니다. 훈련을 마친 후에도 가장 큰 규모의 문제에 대해서는 AI의 최종 경로가 무제한의 시간을 가진 전통적 방식이 결국 찾아낼 수 있는 최선의 솔루션보다 거리 측면에서 약 20% 더 비쌉니다. 실제로 최적화 시간이 불과 몇 분만 지나도, 전통적인 방식이 AI가 추가적인 훈련 없이 도달할 수 없는 더 나은 경로를 찾아내며 AI를 추월합니다.

팀은 또한 이 AI가 규칙이 변할 때 얼마나 강한지(toughness)도 테스트했습니다. 그들은 AI가 특정 테스트 조건 내에서 매우 신뢰할 수 있다는 것을 발견했습니다. 즉, 동일한 분포의 문제에 대해 전통적인 컴퓨터가 "불가능하다"며 포기했을 때조차, AI는 결코 실패하지 않고 어떤 식으로든 해답을 제시했습니다. 다만, 도시의 레이아웃이 급격하게 변하는 경우(예: 무작위로 퍼져 있는 집들의 형태에서 모두가 좁은 원 안에 모여 사는 패턴으로 변하는 경우), AI의 성능은 다소 떨어지지만 여데도 해결을 위한 첫 한 시간 동안은 전통적인 방식들을 능가합니다.

요약하자면, 이 논문은 심층 학습 접근 방식이 실시간 물류를 위한 강력한 새로운 도구임을 시사합니다. 이는 절대적인 완벽한 답이 필요한 가장 크고 복잡한 퍼즐을 위해 기존의 방식들을 완전히 대체하는 것이 아닙니다. 하지만 교통 체증이나 갑작스러운 주문 폭주에 대응하는 택배 서비스처럼, 지금 당장 빠르고 신뢰할 수 있는 답이 필요한 상황에서 이 AI는 게임 체인저입니다. 전통적인 도구들이 멈춰 서거나 실패하는 곳에서 빠르고 견고한 솔루션을 제공하기 때문입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →