← 최신 논문
🔬 condensed matter

Learning Pseudorandom Numbers with Transformers: Permuted Congruential Generators, Curricula, and Interpretability

이 논문은 트랜스포머 모델이 커리큘럼 학습과 비트 단위의 회전 불변 표현을 발견함으로써 복잡한 치환 합동 생성기(PCG)의 시퀀스를 성공적으로 학습하고 예측할 수 있음을 입증하며, 필요한 컨텍스트 길이가 모듈러스의 제곱근에 따라 성장하는 스케일링 법칙을 밝혀낸다.

원저자: Tao Tao, Maissam Barkeshli

게시일 2026-07-17
📖 4 분 읽기☕ 가벼운 읽기

원저자: Tao Tao, Maissam Barkeshli

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 마술의 다음 숫자를 예측하는 법을 가르치려 한다고 상상해 보세요. 당신은 로봇에게 3, 7, 15, 31과 같은 수열을 보여주고, 로봇은 다음에 올 숫자가 무엇인지 맞춰야 합니다. 현실 세계에서 컴퓨터는 우리가 보는 카드 덱의 셔플이나 오래된 TV의 노이즈처럼 완전히 무작위인 것처럼 보이는 숫자를 만들어내기 위해 '의사 난수 생성기(Pseudo-Random Number Generators, PRNG)'라는 특별한 레시피를 사용합니다. 하지만 컴퓨터에게 이 숫자들은 전혀 무작위가 아닙니다. 그것들은 엄격하고 숨겨진 수학적 규칙을 따릅니다. 만약 당신이 그 규칙과 시작 숫자를 알고 있다면, 그 수열의 미래 전체를 완벽하게 예측할 수 있습니다.

오랫동안 과학자들은 궁금해했습니다. 현대의 AI, 특히 '트랜스포머(Transformer)'라고 불리는 유형(많은 챗봇과 이미지 생성기의 배후에 있는 바로 그 종류)이 예시를 관찰하는 것만으로 이러한 숨겨진 규칙을 찾아낼 수 있을까? 이것은 마치 학생이 자물쇠가 어떻게 작동하는지 직접 듣지 않고도, 누군가 자물쇠를 여는 모습을 몇 번 지켜보는 것만으로 자물쇠의 비밀 코드를 배울 수 있는지 묻는 것과 같습니다. 이것은 매우 중요한 문제입니다. 왜냐하면 이 숫자 생성기들은 컴퓨터 보안의 근간이기 때문입니다. 만약 AI가 이들을 너무 쉽게 해킹할 수 있다면, 우리의 디지털 자물쇠가 생각보다 안전하지 않을 수도 있다는 뜻이 됩니다. 하지만 만약 AI가 이를 해킹할 수 없다면, 그것은 AI 모델이 패턴을 학습하는 방식과 그 한계가 어디에 있는지에 대해 심오한 사실을 알려줍니다.

논문의 이야기: 반전을 통한 코드 해독

이 논문에서 저자들은 트랜스포머를 상대로 '순열 합동 생성기(Permuted Congruential Generators, PCG)'라는 특정하고 까다로운 계열의 숫자 생성기를 이용한 도전을 설정했습니다. PCG는 일반적인 숫자 생성기가 숫자를 더하고 곱하여 다음 숫자를 얻는 단순한 기계와 같지만, 한 가지 반전이 있습니다. PCG는 결과값을 보여주기 전에, 일련의 시프트(shift), 플립(flip), 회전(rotation)을 사용하여 비트(숫자를 구성하는 0과 1의 아주 작은 단위)를 뒤섞습니다. 이는 마치 비밀 메시지를 작성한 뒤, 원래 메시지는 완벽하게 논리적임에도 불구하고 글자들을 섞어서 겉보기에는 횡설수설하는 것처럼 만드는 것과 같습니다.

연구진은 트랜스포머가 이 작업에 놀라울 정도로 능숙하다는 것을 발견했습니다. 컴퓨터가 출력값의 아주 작고 뒤섞인 조각, 때로는 단순히 '예' 또는 '아니오'와 같은 단 하나의 비트만을 보고 있더라도, 모델은 여전히 높은 정확도로 다음 숫자를 예측할 수 있었습니다. 이는 마치 로봇이 뒤섞인 이미지의 단 하나의 픽셀만을 보고도 어떻게 전체 그림이 어떻게 생겼는지 알아내는 것과 같습니다. 모델은 규칙을 듣지 않고도, 제공된 예시들로부터 패턴을 스스로 파악하여 이를 수행하는 법을 배웠습니다.

하지만 여기에는 함정이 있습니다. 퍼즐이 어려워질수록 로봇은 더 많은 도움이 필요합니다. 저자들은 '스케일링 법칙(scaling law)'을 발견했습니다. 즉, 숫자가 커질수록(구체적으로 모듈러스, 즉 숫자 풀의 크기가 커질수록), 모델은 문제를 해결하기 위해 더 많은 연속적인 예시를 보아야 합니다. 숫자가 작을 때는 약 128개의 예시가 필요합니다. 하지만 숫자가 매우 클 경우(2222^{22}와 같이), 모델은 대략 m\sqrt{m}개의 예시를 보아야 하며, 이는 컨텍스트 길이(context length)가 상당히 늘어나야 함을 의미합니다. 이것은 마치 직소 퍼즐을 맞추는 것과 같습니다. 퍼즐 조각이 작으면, 전체 그림을 보기 위해 손에 쥐고 있어야 할 조각이 훨씬 많아집니다.

가장 흥el한 발견는 모델이 '어떻게' 학습하는가에 관한 것이었습니다. 연구진이 가장 어렵고 큰 퍼즐에 대해 모델을 직접 훈련시키려 했을 때, 모델은 막혀버렸습니다. 모델은 이해하지 못하는 수학 문제 앞에 놓인 학생처럼, 아무런 진전 없이 오랫동안 데이터를 응시하기만 했습니다. 그러나 그들이 '커리큘럼(curriculum)'—쉬운 작은 퍼즐부터 시작하여 점차 어려운 퍼즐을 도입하는 교수 전략—을 사용했을 때, 모델은 갑자기 문제를 해결했습니다. 그것은 마치 모델이 달리기 전에 걷는 법부터 배워야 했던 것과 같았습니다. 작게 시작함으로써, 모델은 숫자 생성의 기본적인 '문법'을 배웠고, 그 후에 거대하고 복잡한 퍼즐에 그 지식을 적용할 수 있었습니다.

저자들은 또한 모델의 '두뇌'(내부 데이터 표현)를 들여다보았고, 거기서 매우 흥 фаating한 사실을 발견했습니다. 모델은 단순히 숫자를 암기하는 것이 아니라, 이진 구조(binary structure)를 기반으로 숫자를 조직화했습니다. 모델은 겉보기에는 완전히 달라 보이는 숫자일지라도, 0과 1의 패턴이 유사한 숫자들을 그룹화했습니다. 모델은 생성기에 사용된 '뒤섞기' 규칙이 특정 비트 패턴을 동일하게 취급한다는 것을 발견했고, 그 규칙을 존중하는 법을 배웠습니다. 이는 모델이 단순히 추측하는 것이 아니라, 숨겨진 수학적 대칭성을 바탕으로 정신적 지도를 구축하고 있음을 시사합니다.

요약하자면, 이 논문은 트랜스포럼이 정보가 크게 축소된 상황에서도 복잡하게 뒤섞인 숫자 시퀀스를 예측하는 법을 배울 수 있음을 보여줍니다. 하지만 그들에게는 적절한 훈련 경로, 즉 작게 시작하여 점차 확장하는 과정이 필요합니다. 비록 그들이 기존의 고전적인 해킹 방식들을 능가할 수는 있지만, 도움을 주는 커리큘럼 없이는 여전히 거대한 숫자의 벽에 부딪힙니다. 이는 AI가 숨겨진 패턴을 찾는 데 점점 더 능숙해지고 있음에도 불구하고, 가장 어려운 수학적 미스터리를 해결하기 위해서는 인간 학생과 마찬가지로 구조화된 학습 방식에 여전히 의존하고 있음을 말해줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →