← 최신 논문
🤖 machine learning

Rethinking Efficiency in Neural Combinatorial Optimization: Batched Preference Optimization with Mamba

이 논문은 메모리 효율적인 Mamba 백본과 훈련 중 로컬 서치(local search)에 의해 유도되는 디커플링된 배치형 직접 선호 최적화(Direct Preference Optimization) 파이프라인을 결합하여, TSP 및 CVRP 작업에서 우수한 성능과 하드웨어 활용도를 달성하는 효율적인 신경 조합 최적화 프레임워크인 ECO를 소개한다.

원저자: Zhenxing Xu, Zeyuan Ma, Weidong Bao, Yan Zheng, Chongshuang Hu, Ji Wang, Zhiguang Cao

게시일 2026-07-21
📖 3 분 읽기☕ 가벼운 읽기

원저자: Zhenxing Xu, Zeyuan Ma, Weidong Bao, Yan Zheng, Chongshuang Hu, Ji Wang, Zhiguang Cao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 수천 명의 손님을 위한 거대한 연회를 준비하려는 숙련된 셰프라고 상상해 보십시오. 당신에게는 식재료 목록(노드)과 일련의 규칙이 있습니다: 모든 식재료를 정확히 한 번씩 방문해야 하며, 카트가 담을 수 있는 양만큼만 운반해야 하고, 가능한 한 빨리 주방으로 모든 것을 가져와야 합니다. 이것이 바로 **조합 최적화(Combinatorial Optimization)**의 세계입니다. 수십 년 동안 인간은 이 퍼즐을 풀기 위해 정교하게 손으로 만든 레시피(알고리즘)를 사용해 왔지만, 이는 느리고 새로운 연회가 열릴 때마다 인간 전문가가 매번 미세하게 조정해 주어야 했습니다.

최근 과학자들은 컴퓨터가 스스로 레시피를 학습하도록 가르치기 시작했습니다. 이 신경망을 수천 개의 사례를 지켜보며 다음 최선의 움직임을 추측하려고 노력하는 열정적인 견습생이라고 생각하십시오. 하지만 함정이 있습니다. 이 견습생들을 교육하는 데는 엄청난 비용이 듭니다. 이는 마치 견습생에게 요리 한 접시를 만들고, 맛을 보고, 버린 다음, 단 하나의 새로운 기술을 배우기 위해 이 과정을 수백만 번 반복하라고 요구하는 것과 같습니다. 이 과정은 너무 느리고 메모리를 많이 소모하여, 견습생이 실력을 갖추기도 전에 컴퓨터가 과부하로 멈춰버리곤 합니다. 연구자들의 큰 질문은 이것이었습니다: 우리는 이 AI 셰프들이 더 똑똑하면서도, 훨씬 더 빠르고 낭비 없이 배울 수 있도록 가르칠 수 있을까?

이 논문은 ECO(Efficient Combinatorial Optimization)라는 새로운 프레임워크를 소개하며 그 답이 "예"라고 말합니다. 저자들은 품질을 떨어뜨리지 않으면서 속도를 높이기 위한 두 가지 마법 같은 기술을 제안합니다. 첫째, 그들은 학습 스타일을 바꿉니다. 견습생이 요리하고, 맛보고, 하나의 요리마다 혼란스러운 루프 속에서 배우는 대신, ECO는 견습생이 한 번에 한 묶음의 요리를 만들고, 서로 비교한 뒤, 가장 좋은 것들로부터 한꺼번에 배우도록 합니다. 그들은 이를 "배치 선호 최적화(Batched Preference Optimization)"라고 부릅니다. 이는 선생님이 학생에게 열 개의 에세이를 보여주며, "이것이 제일 좋고 저것은 제일 나쁘다. 차이가 보이니? 이 차이를 보고 배워라"라고 말하는 것과 같습니다. 하나하나 채점하고 학생이 다시 쓰기를 기다렸다가 다음 것을 채점하는 방식과는 다릅니다.

둘째, 그들은 견습생의 두뇌를 업그레이드합니다. 대부분의 AI 모델은 "트랜스포머(Transformer)" 구조를 사용하는데, 이는 특정 페이지 사이의 연결 고리를 찾기 위해 서가의 모든 책을 읽어야 하는 사서와 같습니다. 만약 서가가 너무 길어지면(수천 개의 식재료), 사서는 압도되어 메모리가 부족해집니다. ECO는 이 대신 맘바(Mamba) 백본을 사용합니다. 맘바를 효율적인 스캐너라고 상상해 보십시오. 맘바는 서가를 매끄럽고 연속적인 흐름으로 읽으며, 필요한 것만을 기억하며 따라갑니다. 이를 통해 시스템은 컴퓨터가 멈추지 않고도 거대한 연회(수천 개의 노드)를 처리할 수 있습니다.

저자들은 이 기술을 두 가지 고전적인 문제인 외판원 문제(여러 도시를 방문하는 가장 짧은 경로 찾기)와 차량 경로 결정 문제(제한된 트럭 공간 내에서 여러 고객에게 패키지를 배달하기)에 대해 테스트했습니다. 그 결과 ECO는 믿기지 않을 정도로 빠르다는 것을 발견했습니다. 5,000개의 도시가 있는 문제에서 ECO는 테스트 세트를 단 2.5분 만에 해결한 반면, 다른 신경망 방식은 훨씬 오래 걸렸고 전통적인 정확한 해법(exact solvers)은 몇 시간이 걸렸습니다. 결정적으로, 저자들은 ECO가 최종 테스트 중에 "지역 탐색(local search, 빠른 수정)"을 사용하여 속임수를 쓰는 것이 아니라, AI가 훈련 과정에서 스스로 기술을 배웠음을 보여줍니다.

이 논문은 이 새로운 "배치형" 학습 스타일과 효율적인 맘바 두뇌를 결합함으로써, 이전보다 훨씬 더 빠르고 거대하고 복잡한 경로 문제를 해결하도록 AI를 훈련할 수 있음을 시사합니다. 결과는 ECO가 특히 문제가 매우 커질 때 기존의 최선인 AI 방법들과 경쟁할 수 있거나 오히려 더 나은 성능을 보인다는 것을 보여줍니다. 다만, 저자들은 "두뇌(인코더)"는 더 효율적이 되었지만, 다음 움직임을 선택하는 최종 단계는 여전히 상당한 작업량을 요구하기 때문에 전체 과정이 완벽하게 선형적이지는 않다는 점을 주의 깊게 언급하고 있습니다. 하지만 이는 과거의 방식들에 비해 엄청난 개선입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →