Learning to Coordinate via Quantum Entanglement in Multi-Agent Reinforcement Learning
이 논문은 에이전트들이 공유된 양자 얽힘을 통해 협력할 수 있게 하는 새로운 다중 에이전트 강화 학습 프레임워크를 소개하며, 블랙박스 게임과 Dec-POMDP 모두를 통해 이 접근 방식이 고전적인 공유 무작위성만으로는 달성할 수 없는 우수한 협력 성능을 달성할 수 있음을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
친구들이 함께 퍼즐을 풀려고 노력하지만, 서로 대화하는 것이 금지된 상황을 상상해 보세요. 서로 문자도 보낼 수 없고, 속삭일 수도 없으며, 심지어 눈을 맞추는 것조차 불가능합니다. 컴퓨터 과학의 세계에서 이것은 "다중 에이전트 강화 학습(Multi-Agent Reinforcement Learning, MARL)"의 전형적인 골칫거리입니다. 이는 컴퓨터 프로그램(에이전트)들이 마치 강아지가 기술을 배우듯 시행착오를 통해 의사결정 방법을 배우는 분야인데, 여러 에이전트가 하나의 팀으로 일할 때 그들은 서로의 비밀을 공유할 수 없기 때문에 종종 정체기에 빠지곤 합니다.
이 침묵하는 팀원들이 협력할 수 있도록 돕기 위해, 과학자들은 오랫동안 "공유된 무작ness(shared randomness)"라는 기술을 사용해 왔습니다. 모든 친구에게 게임 시작 전에 똑같이 섞인 카드 한 덱을 나누어 준다고 상상해 보세요. 그들은 대화할 수 없지만, 만약 둘 다 "스페이드 에이스"를 뽑는다면, 그들은 같은 동작을 수행해야 한다는 것을 알게 됩니다. 이것은 말하지 않고도 서로를 동기화하는 영리한 방법입니다. 하지만 여기에는 함정이 있습니다. 아무리 많은 카드를 섞더라도, 이 "카드 덱" 전략으로는 도저히 이길 수 없는 퍼즐들이 존재한다는 것입니다.
여기에 물리학의 와일드카드가 등장합니다: 바로 "양자 얽힘(quantum entanglement)"입니다. 이것은 입자들 사이의 기묘한 연결로, 두 존재가 매우 깊게 연결되어 있어서 하나를 측정하는 것만으로도 다른 하나가 무엇인지 즉각적으로 알 수 있는 현상입니다. 이는 수 마일 떨어져 있더라도 마찬가지입니다. 마치 두 개의 마법 주사위가 있어서, 아무리 멀리 떨어져서 굴리더라도 항상 같은 숫자가 나오도록 연결되어 있는 것과 같습니다. 물리학자들은 수십 년 동안 이러한 "마법 주사위"가 일반적인 카드 덱보다 특정 협력 퍼즐을 더 잘 해결할 수 있다는 것을 알고 있었습니다. 하지만 지금까지는 학습하는 컴퓨터 에이전트들에게 실제로 이 양자 마법을 사용하여 업무를 더 잘 수행하도록 가르치는 방법은 아무도 알아내지 못했습니다.
이 논문은 이 에이전트들을 위한 훈련 체육관을 구축하여, 그들이 말 한마디 없이도 양자 얽힘을 활용해 협력하는 법을 배우는 데 성공한 최초의 사례입니다. 연구진은 에이전트들이 양자 측정을 일종의 비밀 언어로 취급하도록 학습하는 새로운 시스템을 만들었습니다. 그들은 이를 단순한 일회성 게임에 테스트하여, 에이전트들이 실제로 "카드 덱" 방식보다 더 나은 전략을 학습하여 "양자 우위(quantum advantage)"를 달 추출할 수 있음을 발견했습니다. 그다음 단계로, 트래픽 라우터와 서버 큐가 포함된 복잡하고 지속적인 시나리오에서 협력하도록 가르쳤습니다. 이 시뮬레이션에서 얽힌 에이전트들은 얽히지 않은 에이전트들보다 고객 대기 시간을 더 짧게 유지하며, 양자 연결이 고전적인 기술보다 훨씬 더 효율적으로 침묵하는 팀이 협력하도록 도울 수 있음을 증명했습니다.
침묵하는 팀과 마법 주사위
이야기 속으로 들어가 봅시다. 당신과 당신의 절친한 친구가 고액의 판돈이 걸린 비디오 게임을 하고 있다고 상상해 보세요. 당신은 맵의 반대편에 있고, 규칙은 다음과 같습니다: 대화 금지. 메시지를 보낼 수도 없고, 캐릭터로 신호를 보낼 수도 없으며, 서로의 화면을 볼 수도 없습니다. 당신의 목표는 승리하는 것이지만, 그러기 위해서는 친구의 움직임과 완벽하게 일치하는 움직임을 만들어야 합니다.
인공지능의 세계에서 이것은 "다중 에이전트 강화 학습(MARL)" 문제입니다. 이들은 행동을 통해 배우는 AI 에이전트들입니다. 보통 이들이 대화할 수 없을 때는 **공유된 무작ness(Shared Randomness)**에 의존합니다. 이것을 게임 전 의식이라고 생각하세요. 당신과 친구가 모두 동전을 던지는 것입니다. 앞면이 나오면 둘 다 점프하고, 뒷면이 나오면 둘 다 숙입니다. 이는 말하지 않고도 서로를 동기화하는 방법입니다. 과학자들은 이를 오랫동안 사용해 왔고, 효과도 적절합니다. 하지만 한계가 있습니다. 어떤 매우 까다로운 퍼즐의 경우, 단순히 동전을 던지는 것만으로는 완벽한 승률을 얻기에 충분하지 않습니다.
그다음은 **양자 얽힘(Quantum Entanglement)**입니다. 이것은 우리의 일상적인 논리를 거스르는 입자 간의 실제 물리 현상입니다. 만약 당신이 한 쌍의 얽힌 입자를 가지고 있다면, 하나를 측정하는 순간 다른 하나의 상태가 즉시 드러납니다. 거리가 아무리 멀어도 마찬가지입니다. 마치 연결된 두 개의 "마법 주사위"를 가진 것과 같습니다. 당신의 주사위에서 6이 나오면, 친구의 주사위도 은하계 반대편에 있더라도 즉시 6을 보여줍니다. 물리학자들은 일반적인 동전 대신 이 마법 주사위를 사용하면 일반적인 동수보다 더 높은 확률로 특정 게임에서 이길 수 있다는 것을 오래전부터 알고 있었습니다. 이것을 "양자 우위"라고 부릅니다.
하지만 여기서 중요한 질문이 생깁니다. 우리는 학습하는 AI 에이전트들에게 실제로 이 마법 주사위를 사용하여 협력하도록 가르칠 수 있을까요? 아니면 양자 얽힘은 단지 컴퓨터가 사용할 수 없는 멋진 물리학적 트릭에 불과할까요?
새로운 훈련 체육관
이 논문의 저자들인 나스닥(Nasdaq)과 펜실베이니아 대학교의 연구팀은 이를 알아내기 위해 훈련 체육관을 만들기로 했습니다. 그들은 AI 에이전트들이 인간으로부터 정답을 듣지 않고도, 순수하게 경험을 통해 양자 얽힘을 이용한 전략을 학습할 수 있는지 확인하고 싶었습니다.
이를 위해 그들은 AI가 양자 역학을 "생각"하는 새로운 방식을 발명해야 했습니다. 보통 AI는 신경망의 숫자(가중치)를 조정하며 학습합니다. 하지만 양자 역학은 표준적인 AI 도구에 딱 들어맞지 않는 복잡한 수학을 포함합니다. 연구팀은 QuantumSoftmax라고 부르는 새로운 도구를 만들었습니다.
당신이 로봇에게 저글링을 가르치려 한다고 상상해 보세요. 단순히 "저글링 해"라고 말할 수는 없습니다. 아주 미세하고 조정 가능한 움직임으로 나누어야 합니다. QuantumSoftmax는 로봇의 무질서하고 가공되지 않은 수학을 유효한 "양자 측정"으로 변환하는 특별한 번역기입니다. 이는 로봇이 결정하는 것이 무엇이든 양자 물리학의 엄격한 규칙을 따르도록 보장합니다. 이를 통해 AI는 시행착오를 통해 학습하는 표준 방식인 "경사 하강법(gradient descent)"을 사용하여 자신의 양자 전략을 점점 더 낫게 다듬을 수 있습니다.
그들은 또한 팀을 위한 새로운 구조를 설계했습니다. 그들은 의사결정을 두 부분으로 나누었습니다:
- 로컬 액터(Local Actors): 이들은 개별 에이전트(플레이어)입니다. 이들은 자신이 보는 것을 보고 무엇을 할지 결정합니다.
- 양자 코디네이터(Quantum Coordinator): 이것이 "마법" 같은 부분입니다. 이것은 플레이어들에게 무엇을 할지 직접 지시하지 않습니다. 대신, 얽힌 입자를 사용하여 각 플레이어에게 "조언"(무작위 숫자 또는 신호)을 생성해 줍니다. 입자들이 얽혀 있기 때문에, 플레이어 A에게 주어진 조언은 플레이어 B에게 주어진 조언과 완벽하게 상관관을 갖습니다. 비록 그들이 대화하지 않았더라도 말이죠.
플레이어들은 이 조언을 받아 자신의 관찰 내용과 결합하여 최종 움직임을 결정합니다. 이는 코디네이터가 각 플레이어에게 "빨간 불이 보이면 X를 하라"는 비밀 노트를 건네주는 것과 같지만, 그 노트는 서로 완벽하게 일치하도록 보장되는 마법 주사위에 의해 생성됩니다.
결과: 시뮬레이션에서의 마법
연구팀은 두 가지 방식으로 새로운 시스템을 테스트했습니다.
첫째, 워밍업 게임:
그들은 "비국소 게임(nonlocal games)"이라 불리는 단순한 일회성 게임으로 시작했습니다. 이는 물리학자들이 양자 역학이 기묘하다는 것을 증명하기 위해 사용하는 퍼즐과 같습니다. 유명한 예로 CHSH 게임이 있습니다. 이 게임에서 플레이어들은 무작위 입력을 바탕으로 서로의 움직임을 추측하려고 노력합니다.
- 결과: 연구팀은 밑바닥부터 에이전트를 훈련시켰습니다. 어떤 도움도 없이, 에이전트들은 양자 얽힘을 사용하는 법을 배웠습니다. 그들은 단순히 "공유된 무작ness"(동전 던지기)를 사용하는 전략보다 더 자주 게임에서 승리하는 전략을 발견했습니다.
- 함정: 연구팀은 약간의 "엔트로피"(AI가 너무 예측 가능하지 않고 조금 더 무작위성을 갖도록 장려하는 용어)를 추가하는 것이 에이전트들이 오래된 고전적 전략에 갇히는 것을 피하는 데 도움이 된다는 것을 발견했습니다. 이 조정을 통해, 모든 훈련 과정에서 매번 승리하는 양자 전략을 찾아냈습니다.
둘째, 실제 환경 시뮬레이션:
그들은 단순한 게임에서 멈추지 않았습니다. 이 방식이 복잡하고 지속적인 상황에서도 작동하는지 보고 싶었습니다. 그들은 "다중 라우터 다중 서버 큐잉 문제(multi-router multi-server queueing problem)"를 모델링했습니다. 두 개의 라우터(에이전트)가 서버로 데이터 패킷을 보내는 바쁜 인터넷 네트워크를 상상해 보세요. 라우터들은 서로 대화할 수 없지만, 어떤 서버도 과부하되지 않고 어떤 패킷도 너무 오래 기다리지 않도록 부하를 분산해야 합니다.
- 설정: 이것은 복잡한 순차적 의사결정 문제입니다. 라우터들은 시간에 따라 일련의 선택을 내려야 합니다.
- 결과: 양자 얽힘 프레임워크로 훈련된 에이전트들은 공유된 무작ness만을 사용하는 에이전트들보다 더 잘 협력하는 법을 배웠습니다. 구체적으로, "초과 대기 시간"(완벽한 이론적 한계와 비교했을 때 고객이 얼마나 더 오래 기다렸는지)이 얽힌 에이전트들에서 더 낮았습니다.
- 의의: 이는 양자 얽힘이 단순한 일회성 퍼즐뿐만 아니라 복잡하고 실제 세계와 유사한 시나리오에서도 협력하는 데 도움이 될 수 있음을 확인시켜 줍니다. 에이전트들은 교통 흐름을 더 원활하게 유지하기 위해 "마법 주사위"를 사용하는 법을 배웠습니다.
이것이 의미하는 것 (그리고 그렇지 않은 것)
이 논문은 자신들이 성취한 것과 여전히 미지수로 남아 있는 것에 대해 매우 명확하게 밝히고 있습니다.
그들이 증명한 것:
그들은 AI 에이전트가 처음부터 양자 전략을 학습하는 것이 가능함을 보여주었습니다. 그들은 에이전트들이 통신 없이도 협력하기 위해 얽힘을 사용할 수 있도록 하는 프레임워크를 구축했습니다. 시뮬레이션에서 이는 단순한 게임과 복잡한 큐잉 문제 모두에서 고전적인 방법보다 더 나은 성능을 보였습니다.
그들이 하지 않은 것:
- 실제 양자 하드웨어 없음: 에이전트들은 실제 양자 컴퓨터나 실제 얽힌 입자를 사용하지 않았습니다. "얽힘"은 고전적인 컴퓨터 상에서 수학적으로 시뮬레이션되었습니다. 그들은 개념이 작동함을 증명했지만, 아직 물리적인 양자 로봇 팀을 구축한 것은 아닙니다.
- 즉각적인 통신 없음: 이 논문은 얽힘이 빛보다 빠른 통신을 허용한다는 아이디어를 명시적으로 배제합니다. 에이전트들은 여전히 대화할 수 없습니다. "마법"은 단지 그들의 결정이 무작위 확률보다 더 잘 상관되도록 만드는 방법일 뿐입니다.
- 해결된 문제는 아님: 그들은 이러한 특정 시뮬레이션에서 양자 우위를 발견했지만, 모든 문제가 양자 얽힘에 의해 해결될 것이라고 주장하지는 않습니다. 그들은 양자 얽힘이 도움이 될 수 있는 설정이 많지만, 정확히 어떤 것인지는 파악해야 한다고 제안합니다.
침묵하는 팀의 미래
저자들은 밝지만 추측에 기반한 미래를 보고 있습니다. 그들은 고빈도 매매(컴퓨터가 밀리초 단위로 주식을 사고파는 곳)에서 통신으로 인한 지연이 큰 문제라고 언급합니다. 만약 트레이더들이 대화 없이 협력하기 위해 얽힘을 사용할 수 있다면, 그들은 더 빠르게, 더 효율적으로 반응할 수 있을 것입니다.
그러나 그들은 또한 장애물도 지적합니다. 실제 양자 시스템은 무질서합니다. 오류가 있고, 크기가 제한적이며, 측정이 불완전합니다. 다음 단계는 AI 에이전트가 이러한 실제 세계의 불완전함을 다루도록 가르치는 것입니다. 또한 그들은 얽힘이 단일 순간뿐만 아니라 시간이 지남에 따라 에이전트들이 협력하는 데 도움이 될 수 있는지 궁금해하며, 이는 장기적인 과업에 매우 중요할 것입니다.
요약하자면, 이 논문은 개념 증명(proof-of-concept)입니다. 이것은 자동차가 얼음으로 된 트랙 위를 달릴 수 있다는 것을 보여주는 것과 같습니다. 물리학이 작동하며 엔진이 미끄러운 표면을 감당할 수 있다는 것을 증 proves 합니다. 하지만 우리가 얼어붙은 툰드라를 가로지르기 위해 실제 차를 운전하기 전에는, 우리는 실제 차가 추위와 바람, 그리고 둔턱을 견딜 수 있도록 만들어야 합니다. 저자들은 엔진을 만들었습니다. 이제 세상이 그 차를 만들 차례입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.