← 최신 논문
🤖 machine learning

Real-Time Progress Prediction in Reasoning Language Models

본 논문은 은닉 상태가 진행 정보를 인코딩하며 미세 조정된 모델이 정확한 진행 추정을 생성할 수 있음을 보여줌으로써 추론 언어 모델에서 실시간 진행 예측의 실현 가능성을 조사하며, 더 큰 모델이 남은 해결 길이 변동의 감소로 인해 더 큰 라벨 안정성을 보인다는 점을 포함합니다.

원저자: Hans Peter Lyngsøe Raaschou-Jensen, Constanza Fierro, Anders Søgaard

게시일 2026-05-27
📖 4 분 읽기☕ 가벼운 읽기

원저자: Hans Peter Lyngsøe Raaschou-Jensen, Constanza Fierro, Anders Søgaard

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 아주 똑똑하지만 약간 수다스러운 로봇에게 복잡한 수학 문제를 풀라고 요청한다고요. 로봇이 바로 답을 알려주는 대신, "소리를 내어 생각하기"를 시작하며 최종적으로 "정답은 2220 입니다"라고 말하기 전에 긴 사고의 연쇄를 적어 내려갑니다.

문제는 무엇일까요? 로봇이 생각하는 동안 10 초가 걸릴 수도 있고 10 분이 걸릴 수도 있습니다. 얼마나 더 걸릴지 전혀 알 수 없습니다. 마치 화면이 검은 영화를 보고 있는 것과 같습니다. 줄거리의 10% 를 진행했는지 90% 를 진행했는지 알 수 없는 채로요. 그저 기다리며 희망을 가져야 할 뿐입니다.

이 논문은 다음과 같은 질문을 던집니다: 우리는 로봇에게 실시간으로 현재 진행 상황을 알려주도록 가르칠 수 있을까요? 비디오 다운로드의 진행률 표시줄처럼, 하지만 로봇의 사고 과정에 적용된 것입니다.

연구자들이 간단한 비유를 사용하여 이 문제를 어떻게 해결하려 했는지 살펴봅시다:

1. "마음 읽기" 테스트 (잠재 상태)

먼저, 연구자들은 로봇의 뇌 (내부 "잠재 상태") 가 입 밖으로 내지 않더라도 현재 진행 상황을 이미 알고 있는지 궁금해했습니다.

  • 비유: 로봇이 어두운 미로를 걷고 있다고 상상해 보세요. 로봇은 출구를 볼 수 없지만, 발걸음 (내부 데이터) 이 리듬을 가지고 있어 끝까지 얼마나 가까운지 알려줄지도 모릅니다.
  • 실험: 연구자들은 로봇의 내부 사고를 듣기 위한 간단한 "디코더"(선형 프로브) 를 구축했습니다.
  • 결과: 디코더는 약 30% 의 확률로 진행 상황을 맞혔습니다. 완벽하지는 않았지만, 로봇이 뇌 속에 "얼마나 진행되었는지"에 대한 일종의 감각을 지니고 있음을 증명했습니다. 비록 다소 흐릿하더라도요.

2. "진행률 표시줄" 훈련 (파인튜닝)

로봇이 진행 상황에 대한 숨겨진 감각을 가지고 있었기 때문에, 연구자들은 로봇이 실제로 그것을 입 밖으로 내도록 훈련하기로 결정했습니다. 그들은 로봇이 사고의 일부 덩어리를 마칠 때마다 <progressbar> 45% </progressbar>와 같은 작은 태그를 삽입하도록 가르쳤습니다.

  • 비유: 마라톤 선수가 마일마다 멈춰서 "40% 지점에 왔습니다!"라고 외쳐 군중이 언제 박수를 치는지 알 수 있게 하는 것과 같습니다.
  • 도전 과제: 단순히 로봇에게 "45% 라고 말해라"고만 하면, 로봇이 속일 수 있습니다. 로봇은 100 번째 단어에서 "45%"라고 말했다면, 110 번째 단어에서는 실제로 수학을 이해하는 것이 아니라 단어 수만 세는 것으로 "50%"라고 말해야겠다고 깨달을 수 있습니다.
  • 해결책: 그들은 "마스킹" 기술을 사용했습니다. 훈련 중에 로봇의 이전 진행 상황 보고를 때때로 숨겼습니다. 이로 인해 로봇은 지금까지 입력한 단어 수를 세는 것이 아니라, 실제 수학 문제를 보고 진행 상황을 추측하도록 강요받았습니다.

3. 결과: 로봇은 얼마나 잘했을까요?

연구자들은 이 방법을 수학 문제에 대해 테스트했습니다.

  • 최고의 로봇: 더 큰 모델 (QWEN3-4B) 이 이 작업에 매우 능숙해졌습니다. 그 "진행률 표시줄"은 평균적으로 약 16% 만 벗어났습니다 (예: 50% 라고 말했다면, 실제로는 34% 에서 66% 사이에서 완료된 상태였습니다).
  • 비교: 이는 문제가 보통 얼마나 걸리는지에 기반한 단순 추측보다 더 좋았습니다.
  • 단점: 로봇에게 진행 상황에 대해 말하도록 가르치는 것은 때때로 실제 수학 문제를 푸는 능력을 약간 떨어뜨렸습니다. 이는 트레이드오프입니다: 언제 끝났는지 알려주는 데 뛰어난 로봇은 일을 수행하는 데는 약간 더 느릴 수 있습니다.

4. "안개 낀 미래" 문제 (모호성)

연구자들은 사고의 본질에 대해 흥미로운 점도 발견했습니다.

  • 비유: 당신이 이야기를 쓰고 있다고 상상해 보세요. halfway 지점에서 "거의 끝났구나"라고 생각할 수 있습니다. 하지만 그다음에 새로운 등장인물을 추가하기로 결정하면, 갑자기 이야기가 두 배로 길어질 필요가 생깁니다. 당신의 "중간 지점"은 미래가 불확실했기 때문에 잘못되었습니다.
  • 발견: 로봇의 사고는 다소 무작위적이기 때문에 (답에 도달하는 다른 경로를 취할 수 있음), "진짜" 진행 상황은 때때로 흐릿합니다. 그러나 더 크고 똑똑한 로봇들 (QWEN3-4B) 은 덜 흐릿했습니다. 그들은 경로 길이에 대해 더 일관적이었기 때문에 진행률 표시줄이 더 신뢰할 수 있었습니다.

요약

이 논문은 우리가 AI 모델에게 사고하는 동안 실시간 "진행률 표시줄"을 제공하도록 가르칠 수 있음을 보여줍니다.

  • 작동했나요? 네, 모델들은 합리적인 정확도로 진행 상황을 추정하는 법을 배웠습니다.
  • 완벽한가요? 아닙니다. 때때로 로봇이 답에 이르는 경로가 변할 수 있거나, 사고하는 대신 단어 수만 세기 때문에 잘못된 추측을 합니다.
  • 왜 중요한가요? 이는 인간이 언제 기다리는 것을 멈추고 언제 답을 기대해야 하는지 알 수 있게 하여, 사고의 "블랙박스"를 우리가 엿볼 수 있는 것으로 바꿔줍니다.

연구자들은 이 기술이 작동하지만 여전히 불완전한 수정구슬이며, 가장 좋은 결과는 작업 소요 시간에 대해 마음을 바꾸지 않을 가능성이 더 낮은 더 크고 똑똑한 모델들에서 나온다고 결론지었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →