← 최신 논문
🤖 machine learning

Continuous Latent Contexts Enable Efficient Online Learning in Transformers

본 논문은 트랜스포머에 연속 잠재 컨텍스트 토큰을 부여함으로써 가중 다수결 및 Q-러닝과 같은 온라인 학습 알고리즘을 효율적으로 구현할 수 있게 하여, 소규모 모델이 장기 적응 작업에서 훨씬 더 큰 대규모 언어 모델보다 월등히 우수한 성능을 발휘할 수 있음을 보여준다.

원저자: Emile Anand, Abdullah Ateyeh, Xinyuan Cao, Max Dabagia

게시일 2026-05-12
📖 4 분 읽기☕ 가벼운 읽기

원저자: Emile Anand, Abdullah Ateyeh, Xinyuan Cao, Max Dabagia

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

네 명의 전문가가 하는 게임을 보고 새로운 게임을 배우려 한다고 상상해 보세요. 매 라운드마다 전문가들이 추측을 하고, 그다음 누가 맞았는지 알게 됩니다. 당신의 목표는 시간이 지남에 따라 어떤 전문가가 가장 신뢰할 만한지 파악하여 가능한 한 최상의 추측을 하는 것입니다.

이 논문은 AI 모델 (특히 "트랜스포머") 이 새로운 정보를 얻을 때마다 매번 전체 "뇌"(매개변수) 를 다시 작성할 필요 없이, 이러한 종류의 학습을 효율적으로 수행하는 방법을 가르치는 것에 관한 것입니다.

다음은 그들의 발견을 간단한 비유로 정리한 내용입니다:

1. 문제: "단기 기억" AI

표준 대규모 언어 모델 (LLM) 은 긴 대화를 보고 다음에 무엇이 올지 추측하는 데 뛰어납니다. 이를 "맥락 학습 (in-context learning)"이라고 합니다. 그러나 게임이 수백 라운드에 걸쳐 길어지면 이러한 모델들은 어려움을 겪습니다. 그들은 전체적인 그림을 잊어버리거나 과거의 추측이 너무 많아서 혼란을 겪는 경향이 있습니다. 마치 머릿속에 계속되는 요약을 유지하는 대신, 마지막 몇 문장만 보고 100 페이지 분량의 이야기를 기억하려는 사람처럼 행동합니다.

2. 해결책: "연속적인 메모지"

저자들은 AI 에게 특별한 도구를 제공하는 것을 제안합니다: 연속 잠재 맥락 토큰 (Continuous Latent Context Tokens).

  • 옛 방식 (이산 토큰): "전문가 A 는 좋다" 또는 "전문가 B 는 나쁘다"와 같은 단어를 적어 점수표를 유지하려는 AI 를 상상해 보세요. 이는 많은 공간을 차지하고 지저분해집니다.
  • 새로운 방식 (연속 토큰): AI 가 단어가 아닌 숫자를 적을 수 있는 작고 보이지 않는 메모지를 가지고 있다고 상상해 보세요. 이 숫자는 물감을 섞듯이 서로 혼합될 수 있습니다.
    • "전문가 A 는 80% 신뢰할 만하다"라고 쓰는 대신, 그 80% 신뢰도를 나타내는 단일하고 매끄러운 "색상"을 유지합니다.
    • 새로운 라운드가 발생하면 새로운 문장을 쓸 필요가 없습니다. 대신 메모지의 색상을 미묘하게 변경하여 점수를 업데이트할 뿐입니다.

이 "메모지"는 컴팩트하며 (매우 적은 공간을 차지함) 지속적입니다 (한 라운드에서 다음 라운드로 AI 와 함께 유지됨).

3. 증명: AI 에게 수학 가르치기

연구자들은 이것이 작동하기를 기대만 한 것이 아니라, 수학적으로 증명하고 이를 수행할 수 있도록 작은 AI 를 훈련시켰습니다.

  • 가중 다수결 알고리즘 (Weighted Majority Algorithm): 그들은 이 메모지를 통해 작은 AI 가 전문가 신뢰도를 추적하는 데 사용되는 유명한 수학 알고리즘을 완벽하게 모방할 수 있음을 보여주었습니다. 이는 AI 에게 모든 전문가의 "신뢰 점수"를 즉시 자동으로 업데이트하는 계산기를 주는 것과 같습니다.
  • Q-러닝 (비디오 게임 비유): 그들은 또한 AI 에게 간단한 비디오 게임 (마르코프 결정 과정) 을 플레이하도록 가르쳤습니다. 이 게임에서 AI 는 어떤 행동이 가장 좋은 보상을 주는지 배워야 합니다.
    • 일반적으로 AI 는 모든 가능한 행동의 가치를 기억하기 위해 거대한 표가 필요합니다.
    • 연속적인 메모지를 사용하면 AI 는 이 전체 "가치 표"를 몇 개의 혼합된 숫자로 저장합니다. 마치 인간 플레이어가 경험에서 배우듯이 매 행동 후 즉시 전략을 업데이트할 수 있습니다.

4. 놀라운 사실: 작은 AI 대 거대 AI

이 논문의 가장 놀라운 부분은 "프런티어 (Frontier)" 모델 (DeepSeek-V3 및 Qwen-3-14B 와 같은 거대하고 강력한 AI) 을 사용한 실험입니다.

  • 설정: 그들은 이 거대 AI 들에게 전문가 추측 게임을 플레이하도록 요청했습니다.
  • 결과:
    • 메모지 없이: 거대 AI 들은 어려움을 겪었습니다. 그들은 단기 기억 (예: "마지막 사람이 맞았으니 나도 그렇게 추측하자") 에 의존하여 긴 시퀀스 전반에 걸쳐 성능이 저하되었습니다.
    • 메모지 ( "메모") 로: 연구자들은 거대 AI 들이 매 라운드 후 배운 내용을 요약하는 짧은 "메모"를 작성하도록 허용했습니다.
    • 결과: 거대 AI 들이 이러한 메모를 작성할 수 있게 되었을 때, 그들의 성능은 급격히 향상되었습니다. 그들은 저자들이 구축한 작고 수학적으로 완벽한 AI 처럼 행동하기 시작했습니다.

주의할 점: 거대 AI 들은 본래 좋은 메모를 작성하는 방법을 알지 못했습니다. 그렇게 하도록 프롬프트를 제공해야 했습니다. 그들이 그렇게 했을 때, 그들은 raw(원시) 역사를 기억하는 것보다 과거를 요약하는 것 (예: "전문가 A 는 90% 정확함") 이 훨씬 더 낫다는 것을 깨달았습니다.

5. 결론

이 논문은 연속 잠재 맥락 (보이지 않는 혼합된 숫자 메모지) 이 AI 가 장기 학습에 효율적이게 만드는 핵심이라고 주장합니다.

  • 작은 AI + 메모지: 복잡한 온라인 전략을 완벽하고 효율적으로 배울 수 있습니다.
  • 거대 AI + 메모지: 갑자기 장기 의사 결정 능력이 훨씬 향상되어, 이러한 "상태" 메커니즘이 없는 더 큰 모델들보다 더 좋은 성과를 낼 수 있습니다.

요약하자면, 이 논문은 시간이 지남에 따라 학습하는 데 있어 AI 를 진정으로 똑똑하게 만들기 위해서는 단순히 모델을 더 크게 만드는 것이 아니라, 단어의 긴 목록이 아닌 "연속적인" 내부 상태를 사용하여 배운 내용의 요지를 유지할 더 나은 방법을 제공해야 한다고 제안합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →