NeuroSynth: A Biologically Inspired Continual Reinforcement Learning Architecture for Mitigating Catastrophic Forgetting
이 논문은 생물학적 영감을 받은 연속 강화 학습 아키텍처인 NeuroSynth를 소개하며, 이는 이중 경로 통합 메커니즘을 통해 파괴적 망각을 완화함으로써 순차적 탐색 작업에서 표준 PPO 및 EWC 베이스라인에 비해 이전 작업 지식의 보유 능력을 유의미하게 향상시킴을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
뇌가 절대 잊지 않는 비밀 (그리고 로봇이 어려움을 겪는 이유)
새로운 비디오 게임을 배우려고 노력하고 있다고 상상해 보세요. 첫 번째 레벨에서는 정말 잘하지만, 두 번째 레벨을 시작하는 순간 당신의 뇌가 "리셋" 버튼을 누른 것처럼 첫 번째 레벨을 플레이하는 법을 잊어버립니다. 이것은 단순히 인간의 기벽이 아닙니다. 인공지능(AI)에게는 거대한 골칫거리입니다. 머신러닝의 세계에서 이를 "파괴적 망각(catastrophic forgetting)"이라고 부릅니다. 이는 AI가 새로운 작업을 학습할 때 기존 작업에 사용했던 코드를 실수로 덮어쓰는 현상으로, 마치 카세트테이프에 새로운 노래를 녹음하면서 90년대의 히트곡을 지워버리는 것과 같습니다.
과학자들은 우리 뇌가 이 문제를 어떻게 해결하는지 연구해 왔습니다. 그들은 우리 뇌가 영리한 두 부분의 시스템을 사용한다고 믿습니다. 한 부분인 해마는 정보를 즉각적으로 잡아내는 초고속 메모장과 같습니다. 다른 부분인 신피질은 정보를 정리하고 장기 기억으로 저장하기 위해 시간이 걸리는 느린 요리 방식의 도서관과 같습니다. 우리는 새로운 것을 배우면서도 기존의 것을 잃지 않지만, 대부분의 AI 시스템은 모든 것을 한꺼번에 처리하려는 하나의 거대한 뇌처럼 설계되어 있어 그 좌절스러운 "리셋" 버튼 효과를 일으킵니다. 큰 질문은 이것입니다. 과연 우리는 기존의 기술을 유지하면서 새로운 기술을 마스터하는, 인간처럼 학습하는 AI를 만들 수 있을까요?
NeuroSynth: 자신의 뿌리를 기억하는 AI
고등학생 연구원 야쉬 키니(Yash Kini)가 만든 새로운 AI 아키텍처, NeuroSynth를 소개합니다. 이 모델은 이러한 기억 상실을 막기 위해 설계되었습니다. NeuroSynth를 하나의 뇌가 아니라, "플래너(Planner)"와 "습관 형성자(Habit-Former)"라는 두 명의 전문가 팀이라고 생각해보세요.
플래너는 뇌의 해마에서 영감을 받았습니다. 이 모델은 빠른 학습자입니다. AI가 새로운 도전에 직면하면 플래너가 투입되어 빠르게 문제를 파악한 뒤, 결정적으로, 그 지식을 "동결(freeze)"합니다. 이는 마치 완벽한 사진을 찍어 금고에 넣어둠으로써 실수로 지워지지 않도록 잠가두는 것과 같습니다. 뇌의 피질에서 영감을 받은 습관 형성자는 유연한 작업자입니다. 이 모델은 열려 있는 상태를 유지하며 새로운 것들을 계속 학습합니다. 하지만 여기서 마법 같은 기술이 등장합니다. 습관 형성자는 독자적으로 학습하는 것이 아닙니다. 이 모델은 금고 속의 동결된 사진(플래너)을 끊임없이 관찰하며, "리플레이(replay, 예전 게임을 상상하는 것)"와 "증류(distillation, 플래너의 스타일을 복제하는 것)"라는 기술을 사용하여 예전의 동작들을 연습합니다. 이런 방식을 통해 AI는 이전 레벨을 삭제하지 않고도 새로운 레벨을 배울 수 있습니다.
이 뇌 모사 팀이 표준 AI보다 더 나은 성능을 보이는지 테스트하기 위해, 연구진은 NeuroMaze-CL이라는 디지털 미로에 세 가지 서로 다른 모델을 투입했습니다. 목표는 간단했습니다. 격자를 탐색하여 특정 출구를 찾는 것입니다. 반전은 무엇일까요? 출구는 매번 움직였습니다. AI는 첫 번째 출구를 학습한 다음, 두 번째, 세 번째를 학습해야 했으며, 이 과정에서 첫 두 개를 다시 연습할 기회는 전혀 주어지지 않았습니다. 이 "비재방문(non-revisitation)" 규칙은 기말고사 공부만 허용되고 예전 노트를 절대 다시 볼 수 없는 학생처럼, AI가 반드시 망각하도록 강제하기 위해 설계되었습니다.
결과는 뇌 모사 접근 방식의 명백한 승리였습니다. 표준 AI 모델인 PPO는 기억력 면에서 처참한 결과를 보였습니다. 세 번째 미로를 학습한 후, PPO는 첫 번째 미로를 완전히 잊어버려 Task A에서 단 **0.33%**의 성공률을 기록했습니다. 마치 AI가 첫 번째 미로를 본 적이 없는 것과 같았습니다. 두 번째 모델인 EWC는 업데이트를 매우 조심스럽게 수행함으로써 기존 기억을 보호하려 노력했지만, 너무 신중한 나머지 새로운 미로를 효과적으로 학습하는 데 어려움을 겪었습니다.
반면, NeuroSynth는 최적의 지점을 찾아냈습니다. 동일한 훈련 후, NeuroSynth는 첫 번째 미로를 **18.00%**의 성공률로 기억해냈습니다. 이는 PPO의 거의 제로에 가까운 성능보다 훨씬 뛰어난 결과입니다. NeuroSynth는 단순히 첫 번째 작업만을 기억한 것이 아니라, 두 번째 작업에서도 훨씬 더 잘 버텨내며 Task B에서 PPO의 0.00% 대비 **35.33%**의 성공률을 달enc성했습니다. 마지막이자 가장 어려운 작업(Task C)에 대해서도 NeuroSynth는 신중한 EWC 모델(9.00%)보다 더 나은 성능(2.00%)을 보였으나, 이 특정 차이는 통계적으로 확정적인 승리라고 부르기에는 아주 강력하지는 않았습니다.
이 연구는 "빠른 학습"과 "느린 기억"을 분리하고 리플레이를 통해 예전 기술을 연습함으로써, 안정적이면서도 유연한 AI를 구축할 수 있음을 시사합니다. 이것이 아직 로보틱스나 의료용 AI의 모든 문제를 해결하는 마법의 해결책은 아니지만, 뇌의 두 경로 시스템을 모방하는 것이 로봇이 새로운 것을 배울 때마다 그 좌절스러운 "망각" 버튼을 누르는 것을 막는 유망한 방법임을 보여줍니다. 저자가 언급했듯이, 이는 기계가 이미 마스터한 기술을 잃지 않으면서 평생의 기술을 진정으로 학습할 수 있는 단계로 향하는 길입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.