← 최신 논문
🤖 machine learning

Emergent Sparsity in Frozen Random CNN Feature Extractors for Deep Reinforcement Learning

이 논문은 동결된 무작위 초기화 CNN 특징 추출기로 학습된 심층 강화 학습 에이전트가 명시적인 희소성 유도 목적 함수 없이도 작업 복잡도에 따라 확장되며 달성 가능한 성능을 효과적으로 제한하는 극도로 희소한 완전 연결 표현을 자발적으로 발달시킨다는 것을 입증하며, 이를 통해 기저 문제의 내재적 차원을 드러낸다.

원저자: Scott M. Norton

게시일 2026-07-30
📖 6 분 읽기🧠 심층 분석

원저자: Scott M. Norton

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

컴퓨터가 매뉴얼을 읽는 대신, 화면을 뚫어지게 쳐ras보며 다음에 무엇을 할지 추측하며 게임을 배우는 세상을 상상해 보세요. 이것이 바로 **심층 강화 학습(Deep Reinforcement Learning, DRL)**의 영역입니다. 이것은 마치 강아지를 훈련시키는 것과 같습니다. 당신은 강아지에게 프리스비(원반)를 어떻게 잡아야 하는지 알려주지 않습니다. 그저 프리스비를 잡았을 때 간식을 주고, 못 잡았을 때 "안 돼"라고 말할 뿐이죠. 시간이 흐르면 강아지는 스스로 그 기술을 터득합니다. 컴퓨터 세계에서 이 "강아지"는 신경망, 즉 인간의 뇌를 모방한 거대한 수학적 연결의 그물망입니다. 보통 이러한 컴퓨터를 똑똑하게 만들기 위해, 우리는 이 그물망의 모든 연결을 미세하게 조정하여 세상의 최선의 방식을 찾아내도록 합니다. 하지만 여기에는 함정이 있습니다. 이 컴퓨터 뇌들은 종종 엄청나게 비대해진다는 것입니다. 수백만 개의 연결을 가지고 있어, 마치 나무가 너무 많은 숲처럼 어떤 것이 실제로 일을 하고 있고 어떤 것이 방해가 되는지 파악하기 어렵게 만듭니다. 과학자들은 오랫동안 궁금해해 왔습니다. 이 거대한 뇌들이 반드시 그렇게 커야만 하는지, 아니면 이 문제를 해결할 더 단순하고 효율적인 방법이 있는지 말입니다.

여기서 스콧 M. 노튼(Scott M. Norton)이라는 호기심 많은 연구자가 매우 기묘한 실험을 들고 나타났습니다. 그는 컴퓨터의 "눈"(화면을 보는 부분)이 학습하고 변하는 대신, 그것을 얼려버렸습니다. 그는 무작위로 생성된, 훈련되지 않은 카메라 렌즈를 가져와서 고정시킨 뒤, 그 렌즈가 아무것도 새로 배우지 못하도록 잠가버렸습니다. 그러고 나서 그는 컴퓨터에게 이 얼려진 무작 most의 무작위 렌즈만을 사용하여 아타리(Atari) 게임을 배우라고 명령했습니다. 예상대로라면 컴퓨터는 처참하게 실패하거나, 적어도 이 흐릿하고 무작위적인 이미지들을 이해하는 데 큰 어려움을 겪어야 했습니다. 하지만 마법 같고도 예상치 못한 일이 일어났습니다. 컴퓨터는 단순히 학습한 것을 넘어, 믿을 수 없을 정도로 효율적으로 학습했습니다. 아무도 그것에게 단순해지라고 말하지 않았음에도, 컴퓨터는 스스로 전체 뇌 용량의 95%를 무시하기로 결정했습니다. 거의 모든 뉴런을 꺼버리고 단 몇 줌의 뉴런만을 사용하여 게임을 풀어낸 것입니다. 이는 마치 무작위 페이지들이 서로 붙어 있는 교과서를 건네받은 학생이, 단 세 문장만을 암기하여 시험에서 만점을 받은 것과 같았습니다.

얼려진 렌즈 실험

이 연구에서 연구자는 퐁(Pong)(공을 주고받는 디지털 테니스 게임)이라는 고전 비디오 게임 시나리오를 설정했습니다. 그는 표준적인 AI 에이전트를 구축했지만, 한 가지 반전이 있었습니다. 비디오 이미지를 처리하는 부분(합성곱 신경망, CNN)을 무작위 숫자로 초기화한 뒤 얼려버린(frozen) 것입니다. 이 부분은 결코 새로운 것을 배울 수 없도록 고정되었습니다. 오직 AI의 마지막 의사결정 층, 즉 이미지 데이터를 받아 패들을 위, 아래로 움직일지 아니면 가만히 있을지를 결정하는 "완전 연결(fully connected)" 부분만이 학습할 수 있었습니다.

보통 이러한 AI 에이전트를 훈련할 때는 시스템 전체가 함께 학습하도록 둡니다. "눈"은 공을 포착하는 법을 배우고, "뇌"는 패들을 움직이는 법을 배웁니다. 하지만 이 실험에서 "눈"은 무작위적이고 훈련되지 않은 세상을 보고 있었습니다. 연구자들은 AI가 서툴 것이라고 예상했습니다. 그러나 결과는 달랐습니다. AI의 뇌는 자발적으로 **희소 표현(sparse representation)**을 발달시켰습니다.

"희소성(Sparsity)"은 "매우 적게 사용한다"는 뜻의 멋진 단어입니다. 상상해 보세요. 방 안에 64개의 전등 스위치가 있습니다. 일반적인, 완전히 훈련된 AI라면 게임을 플레이하는 동안 64개 스위치 거의 대부분이 깜빡거리며 복잡하고 노이즈 섞인 패턴을 만들어낼 것입니다. 하지만 이 얼려진 실험에서 AI는 사용 가능한 64개의 스위치 중 단 1~3개의 스위치만을 켰습니다. 나머지 61개의 스위치는 완전히 무시했습니다. 그것들은 필요하지 않았기 때문입니다. AI는 무작위로 얼려진 렌즈가 게임을 풀기에 딱 적절한 몇 개의 "채널" 정보를 가지고 있다는 것을 알아차렸고, 에너지 소비를 줄이고 집중하기 위해 나머지 모든 것을 꺼버렸습니다.

"딱 필요한 만큼"의 규칙

이 발견에서 가장 매혹적인 부분은 AI가 사용한 스위치의 개수가 무작위가 아니었다는 점입니다. 그 수는 게임의 난이도와 일치했습니다.

  • 퐁(Pong): 공 하나와 두 개의 패들만 있는 단순한 게임입니다. AI는 이를 마스터하는 데 단 1~3개의 뉴런(뇌 속의 작은 처리 단위)만을 필요로 했습니다.
  • 브레이크아웃(Breakout): 공, 패들, 그리고 벽돌 벽이 포함된 더 복적인 게임입니다. AI는 19~26개의 뉴런이 필요했습니다.
  • 스페이스 인베이더(Space Invaders): 외계인, 총알, 방패가 등장하는 혼란스러운 게임입니다. AI는 약 42개의 뉴런을 필요로 했습니다.

연구자들은 AI의 뇌를 더 넓게 만들어(선택할 수 있는 스위치를 더 많이 제공하여) 이를 테스트했습니다. AI에게 64개 대신 128개의 스위치를 주었음에도 불구하고, AI는 여전히 게임을 풀기 위해 동일한 작은 숫자(3~14개)만을 사용했습니다. 더 많은 스위치가 있다고 해서 더 많이 사용하지 않았습니다. AI는 게임의 "진정한 복잡성"을 감지하고, 엄격하게 필요한 만큼의 뇌 용량만을 사용하는 듯 보였습니다.

이것이 중요한 이유 (그리고 그렇지 않은 이유)

여러분은 "AI가 운이 좋았던 것 아닌가요?"라고 물을 수도 있습니다. 연구자들은 이를 철저히 확인했습니다. 그들은 AI가 사용하던 특정 뉴런 몇 개를 추출하여 꺼버리는 과정(절제, ablation)을 거쳤을 때, AI가 즉시 게임을 플레이하는 법을 잊어버리고 완전히 무작위로 행동한다는 것을 발견했습니다. 이는 그 몇 개의 뉴런이 모든 핵심적인 역할을 수행했음을 증명합니다. 나머지 뇌는 해당 작업에 정말로 쓸모가 없었습니다.

하지만 논문은 이것이 모든 상황에 적용되는 마법의 해결책이라고 주장하지 않도록 주의를 기울였습니다. 연구자들은 이 "얼려진 렌즈" 기법이 퐁이나 브레이크아웃처럼 명확하고 반응적인 구조를 가진 게임에서 가장 잘 작동한다는 것을 발견했습니다. 프리웨이(Freeway) 같은 게임에서는 AI가 매번 위로 움직이는 방식으로 "꼼수"를 써서 실제 학습 없이도 문제를 풀 수 있었습니다. 그런 경우, "희소성"은 지능의 징표가 아니라 지름길을 찾은 것에 불 old였습니다. 하지만 실제 기술이 필요한 게임에서, 얼려진 무작위 렌즈는 AI가 가능한 가장 효율적인 경로를 찾도록 강제했습니다.

거시적 관점: 노이즈 속에서 신호 찾기

이 이야기는 효율성에 관한 것입니다. 우리는 흔se 어려운 문제를 해결하려면 거대하고 복잡한 기계가 필요하다고 생각합니다. 하지만 이 논문은 만약 기계에게 고정된 무작위 도구들을 준다면, 기계는 자연스럽게 그것들을 사용하는 가장 단순한 방법을 찾아낼 것이라고 제안합니다. 이는 누군가에게 백만 개의 무작위 도구가 들어있는 거대한 도구 상자를 주는 것과 같습니다. 똑똑한 사람은 그 모든 것을 사용하려고 애쓰는 대신, "아, 이 의자를 고치려면 이 드라이버 하나와 이 망치 하나만 있으면 되겠구나"라고 빠르게 깨달을 것입니다.

연구자들은 또한 이 현상이 언제 발생하는지에 대해서도 주목했습니다. AI는 훈련 초기, 때로는 첫 1500만 단계 이내에 어떤 뉴런을 사용할지 결정했습니다. AI는 실제로 게임을 잘하기 시작하기 훨씬 전부터 그 선택을 확정 지었습니다. 마치 AI가 첫날에 팀원을 선발하고, 이후 1억 단계를 그 특정 팀원들과 함께 연습하는 데 보낸 것과 같았습니다.

유쾌한 비유: 라디오 튜너

얼려진 CNN은 특정 무작위 주파수에 고정된 라디오와 같습니다. 들어오는 신호는 정적(static)과 음악이 섞여 있습니다. 대부분의 사람들은 "이 라디오는 고장 났어. 안테나를 고쳐야 해"라고 생각할 것입니다. 하지만 이 AI는 다릅로습니다. AI는 안테나를 고치려 하지 않습니다. 대신, 정적 속에서 귀를 기울이며 "아, 이 정적의 아주 작은 조각에 채널을 맞추면 음악을 완벽하게 들을 수 있구나"라고 깨닫습니다. 그리고 나머지는 무시합니다.

AI의 세계에서 우리는 보통 더 나은 안테나를 만들려고 노력합니다(전체 네트워크를 훈련시킵니다). 이 논문은 때때로 무작위 안테나를 그대로 두더라도, AI가 자연스럽게 신호의 아주 작은 조각을 찾아내고 나머지는 무시할 수 있음을 보여줍니다. 이는 때때로 '적은 것이 더 많다(less is more)'는 것을, 그리고 자연(또는 이 경우의 고정된 무작위 네트워크)은 우리가 방해하지 않는다면 가장 단순한 해결책을 찾는 방법이 있다는 것을 상기시켜 줍니다.

연구자들은 이 현상이 미래에 더 똑똑하고 작은 AI 시스템을 구축하는 데 도움이 될 수 있다고 제안합니다. 거대하고 낭비적인 네트워크를 만드는 대신, 고정된 무작위 특징들을 사용하여 AI가 문제의 "고유 차원(intrinsic dimension)", 즉 실제로 중요한 아주 작은 변수들을 찾도록 도울 수 있습니다. 이는 단순히 강력한 AI가 아니라, 우아하고 효율적인 AI를 향한 한 걸음입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →