← 최신 논문
🤖 machine learning

Stabilizing Recurrent Dynamics for Test-Time Scalable Latent Reasoning in Looped Language Models

본 논문은 자코비안 스펙트럼 반경 정규화를 통해 잠재 상태를 점근적으로 안정된 고정점으로 제약함으로써 루프형 언어 모델의 순환 동역학을 안정화하는 STARS라는 학습 프레임워크를 소개하며, 이를 통해 복잡한 추론 작업에서 신뢰할 수 있는 테스트 시간 확장 및 성능 향상을 가능하게 합니다.

원저자: Xiao-Wen Yang, Ziyu Han, Xi-Hua Zhang, Wen-Da Wei, Jie-Jing Shao, Lan-Zhe Guo, Yu-Feng Li

게시일 2026-05-27
📖 4 분 읽기☕ 가벼운 읽기

원저자: Xiao-Wen Yang, Ziyu Han, Xi-Hua Zhang, Wen-Da Wei, Jie-Jing Shao, Lan-Zhe Guo, Yu-Feng Li

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

"Looped Language Models 에서 테스트 시간 확장 가능한 잠재적 추론을 위한 순환 역동성 안정화"라는 논문에 대한 설명을 간단한 언어와 창의적인 비유로 제시합니다.

큰 문제: 미쳐버리는 "사고 루프"

거대 언어 모델 (LLM) 을 어려운 수학 문제를 풀려고 노력하는 천재 학생이라고 상상해 보세요. 보통 이 학생은 문제를 풀기 위해 종이 위에 긴 사고의 연쇄를 적어냅니다 (이를 "사고의 사슬"이라고 합니다).

최근 연구자들은 **Looped Language Models(LoopLMs)**라는 새로운 접근법을 시도했습니다. 긴 사고의 연쇄를 적는 대신, 이 학생에게 한 장의 종이를 주고 다음과 같이 지시합니다: "네 자신의 답을 읽고, 그것에 대해 생각한 뒤 새로운 버전을 작성하고, 다시 그것을 읽고, 또 생각한 다음 이 과정을 10 번 반복해라."

이 아이디어는 같은 뇌를 반복해서 "루프"에 넣음으로써, 학생이 더 많은 종이나 시간이 필요 없이 각 회차마다 점점 더 똑똑해지고 답을 다듬는다는 것입니다.

하지만 함정이 있습니다:
이 논문은 이 루프가 종종 무너진다는 사실을 발견했습니다.

  • 정점: 처음에는 학생이 나아집니다. 답이 개선됩니다.
  • 추락: 하지만 학생에게 너무 많은 번 (예: 4 번 대신 8 번 또는 10 번) 루프를 돌리라고 하면, 답이 갑자기 끔찍해집니다. 학생은 환각을 보거나 혼란을 겪거나 숫자가 미친 듯이 변합니다.

저자들은 이를 **"불안정한 테스트 시간 확장"**이라고 부릅니다. 모델에게 더 많은 사고 시간 (더 많은 루프) 을 주지만, 똑똑해지지 않고 혼란스러워진다는 것입니다.

진단: 왜 루프가 무너지는가?

연구자들은 동역학 시스템(시간에 따라 사물이 어떻게 변하는지 연구하는 수학의 한 분야)이라는 렌즈를 통해 이러한 모델들의 "내부 작동 원리"를 살펴보았습니다. 그들은 시소와 같은 근본적인 트레이드오프를 발견했습니다.

  1. "야생" 학생 (내부 정규화): 일부 모델은 정보가 자유롭게 흐르도록 설계되어 있습니다. 이는 깊이 있게 사고하는 데 탁월하지만 (효과성), 학생의 "생각"(내부 숫자) 은 매 루프마다 점점 더 커지다가 결국 폭발합니다. 이는 스피커에 너무 가까이 대어진 마이크와 같습니다. 소리가 점점 커지다가 결국 비명처럼 찢어지며 침묵으로 변합니다.
  2. "고착된" 학생 (외부 정규화): 다른 모델들은 숫자를 작고 안전하게 유지하기 위해 강하게 제약을 가합니다 (안정성). 하지만 이는 학생을 너무 조심스럽게 만듭니다. 그들은 깊이 있게 사고하는 것을 멈추고 얕은 생각만 반복합니다. 안전은 유지하지만, 어려운 문제를 결코 해결하지 못합니다.

결론: 기존 모델들은 너무 야생적이어서 (불안정) 또는 너무 조심스러워서 (비효율적) 입니다. 둘 다 동시에 할 수 없습니다.

해결책: STARS("안정적 사고" 프레임워크)

저자들은 STARS(STAbility-driven Recurrent Scaling, 안정성 주도 순환 확장) 라는 새로운 훈련 방법을 제안합니다.

모델의 사고 과정을 언덕을 굴러가는 공으로 생각해 보세요.

  • 목표: 공이 언덕을 굴러가 바닥 (정답) 에 도달하여 거기서 멈추기를 원합니다.
  • 문제: 현재 모델들에서는 공이 세상 끝으로 굴러떨어지거나 (폭발), 언덕 중간에 있는 평평한 곳에 갇혀버립니다 (얕은 사고).

STARS 가 이를 어떻게 고치는가:
STARS 는 야코비안 스펙트럼 반경 정규화라는 수학적 도구를 사용합니다. 이름은 어렵지만, 간단한 버전은 다음과 같습니다.

  1. "속도 제한" 표지판: 연구자들은 모델이 매 단계에서 자신의 "속도"를 확인하도록 가르칩니다. 공을 앞으로 밀어내는 "힘"이 너무 강하지 않도록 보장합니다.
  2. "수렴" 효과: 그들은 모델이 매번 루프를 돌 때마다 최종 답에서 더 멀어지는 것이 아니라, 더 가까워져야 한다는 것을 학습하도록 강제합니다. 수학적으로 그들은 언덕의 "기울기"가 항상 안정적인 휴식 지점 (고정점) 을 향하도록 보장합니다.
  3. 무작위 연습: 그들은 또한 훈련 중에 모델에게 다른 수의 루프 (때로는 2 번, 때로는 10 번) 로 연습하게 합니다. 이는 모델이 특정 루프 횟수를 암기하는 것을 막고, 사고하는 시간이 얼마나 길어지든 스스로 안정화하는 법을 배우도록 강제합니다.

결과: 신뢰할 수 있는 사고자

이 논문은 두 가지 항목에서 이를 테스트했습니다.

  1. 간단한 수학: 큰 숫자 더하기.
  2. 어려운 수학: 복잡한 추론 문제 (GSM8K 데이터셋과 같은).

무슨 일이 일어났는가?

  • 기존 모델: 8 번 루프로 사고하도록 요청받았을 때, 정확도가 급격히 떨어졌습니다. 그들은 추락했습니다.
  • STARS 모델:
    • 더 높은 정점 성능에 도달했습니다 (더 빨리 똑똑해짐).
    • 결정적으로, 그들에게 더 많은 루프 (8 번, 10 번 등) 로 사고하도록 강요했을 때 추락하지 않았습니다. 안정적으로 유지되었습니다. 정확도는 붕괴되는 대신 약간만 떨어졌습니다.

핵심 교훈

이 논문은 컴퓨터가 자신의 출력을 반복하여 "사고"하려면 안정성을 갖도록 훈련되어야 한다고 주장합니다. 좋은 사고자가 정신을 잃지 않고 아이디어를 다듬어야 하듯, STARS 는 AI 가 내부 생각을 조직화하고 진실에 수렴하도록 가르쳐, 사고하는 시간이 얼마나 길어지든 이를 가능하게 합니다.

간단히 말해: STARS 는 AI 에게 더 많은 사고 시간을 주었을 때 미쳐버리는 것을 막아주어, 추론 능력을 신뢰할 수 있게 확장할 수 있게 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →