← 최신 논문
💻 computer science

SamatNext v0.2-B: An Exploratory Study of RMS-Normalized Hybrid Decoders for Curriculum Retention in Small Code Models

이 기술 보고서는 표준 트랜스포머와 비교하여 디퍼런셜 어텐션(Differential-Attention)과 델타넷(DeltaNet)에서 영감을 받은 레이어를 교차 배치함으로써 소규모 코드 모델의 커리큘럼 유지력을 크게 향상시킨 356M 파라미터 규모의 하이브리드 디코더인 SamatNext v0.2-B를 소개하며, 다만 이것이 장기적 관점의 파괴적 망각 문제를 완전히 해결하지는 못했다는 점을 밝힌다.

원저자: Samat Zharassov

게시일 2026-06-23
📖 3 분 읽기☕ 가벼운 읽기

원저자: Samat Zharassov

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 컴퓨터 코드를 쓰는 법을 가르치고 있다고 상상해 보세요. 당신은 단계별로 가르치고 싶습니다. 첫째, 기본적인 문법 규칙(구문)을 배우고, 둘째, 지시 사항을 이해하는 법(의미론)을 배우며, 마지막으로 복잡하고 전문적인 퍼즐을 해결하는 법을 배우는 것입니다.

표준적인 로봇(AI 모델)의 문제는 **"파괴적 망각(Catastrophic Forgetting)"**을 겪는다는 점입니다. 이는 마치 기말고사를 공부하느라 너무 열중한 나머지, 신발 끈을 묶는 법이나 더하기를 하는 법을 완전히 잊어버린 학생과 같습니다. 새로운 어려운 것을 배우자마자 예전에 배웠던 것들이 뇌에서 지워져 버리는 것입니다.

이 논문은 SamatNext v0.2-B라는 새로운 로봇을 소개하며 다음과 같이 질문합니다. 우리는 새로운 것을 배우면서도 기존의 것들을 삭제하지 않는 로봇을 만들 수 있을까?

경주 중인 두 로봇

저자는 똑같은 "뇌 크기"(3억 5,600만 개의 파라미터)를 가진 두 종류의 로봇을 비교했습니다.

  1. 표준 로봇 (Transformer): 일반적인 AI 설계 방식입니다. 강력하지만 새로운 작업을 배울 때 오래된 기억을 덮어쓰는 경향이 있습니다.
  2. 하이브리드 로봇 (SamatNext): 실험적인 설계입니다. 이 로봇의 뇌는 두 가지 서로 다른 유형의 사고 계층이 혼합되어 있습니다.
    • "어텐션(Attention)" 계층: 문장 속의 모든 단어를 조명처럼 비추어 맥락을 이해하는 역할입니다.
    • "상태(State)" 계층: 글을 읽을 때 처음부터 다시 읽는 대신, 정보를 계속 누적하여 기록하는 메모장 같은 역할입니다.

저자는 이 두 가지 유형의 계층을 샌드위치처럼 번갈아 가며(어텐션, 상태, 어텐션, 상태) 섞었고, 신호의 균형을 맞추기 위해 특별한 "보정(calibration)" 노브를 추가했습니다.

테스트: 단계별 커리큘럼

로봇들은 특정 순서에 따라 훈련되었습니다:

  • 1단계 & 2단계: 기본적인 파이썬 구문(문법) 학습.
  • 3단계: 지시 사항을 따르고 의미를 이해하는 법 학습.
  • 5단계: 전문적이고 어려운 코딩 작업 학습.

5단계를 마친 후, 저자는 로봇들이 예전의 것들(3단계와 2단계)을 얼마나 기억하는지 테스트했습니다.

결과: 두 기억의 이야기

표준 로봇:

  • 새로운 것: 마지막의 어려운 과제들을 배우는 데 어려움을 겪었습니다(성공률 49%). 저자가 학습 속도를 조절하여 이를 "구조"하려고 시도하자, 마침내 새로운 것을 배웠지만(성공률 97%), 중간 단계의 내용은 완전히 잊어버렸습니다. 지시 사항을 이해하는 능력은 단 **6%**만 남았습니다.
  • 오래된 것: 마지막 단계 이전에 배웠던 거의 모든 것을 잊어버렸습니다.

하이브리드 로봇 (SamatNext):

  • 새로운 것: 마지막의 어려운 과제들을 완벽하게 마스터했습니다(성공률 100%).
  • 오래된 것: 잊어버리지 않았습니다! 중간 단계에서 배웠던 지시 사항 이해 능력을 **98.8%**나 유지했습니다.

함정 (그 "구문" 문제):
하이브리드 로봇은 지시 사항을 기억하는 데는 놀라웠지만, 아주 초기의 기본적인 문법 규칙(2단계)에는 여전히 약간 어려움을 겪었습니다. 성공률이 0%(표준 로봇)에서 12%로 개선되긴 했지만, 완벽하지는 않았습니다. 이는 이 새로운 설계가 최근의 기억에는 도움이 되지만, 아주 오래된 기억을 아주 오랜 시간 동안 유지하는 문제까지 완전히 해결하지는 못한다는 것을 시사합니다.

핵심 요점

표준 로봇을 새로운 물을 흡수하면 기존의 물을 짜내어 공간을 만드는 스펀지라고 생각해보세요. 하이브리드 로봇은 새로운 물을 빨아들이면서도 기존의 물을 계속 머금고 있을 수 있는 특수한 내부 구조를 가진 스펀지와 같습니다.

이 논문의 주장:

  • 이 특정 하이브리드 설계(어텐션과 상태 계층의 혼합)는 새로운 것을 배우는 것과 오래된 것을 기억하는 것 사이의 더 나은 균형을 만들어냅니다.
  • 이것은 모든 기억 문제를 해결하는 마법의 탄환이 아닙니다(매우 오래된 구문은 여전히 어려움을 겪습니다).
  • 이것은 실제 세계에 바로 투입될 완성된 제품이 아니라, 이 특정 뇌 구조가 통제된 실험실 환경에서 기존의 구조보다 더 잘 작동하는지 확인하기 위한 "탐색적 연구"입니다.

저자는 다음과 같이 말하고 있는 것입니다: "우리는 새로운 뇌 설계를 시도했습니다. 이 설계는 새로운 작업을 배우는 동안 중간 단계의 기억을 유지하는 데 기존 설계보다 훨씬 뛰어났지만, 아주 첫 번째 수업을 기억하는 데는 여전히 빈틈이 있습니다. 우리는 다른 사람들이 이를 검증할 수 있도록 코드를 공개합니다."

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →