← 최신 논문
🤖 AI

When Entropy Is Not Enough: Reclaiming Lost Semantics in LLM Output Length Prediction

이 논문은 토큰 엔트로피와 어텐션 기반의 의미론적 중요도 점수를 결합하여 더 효율적인 길이 인식 스케줄링을 가능하게 하고 계산 오버헤드를 줄임으로써 LLM 출력 길이 예측을 개선하는 경량 프레임워크인 ESTP를 소개한다.

원저자: Feiyang Ren, Shengtao Wen, Lingbing Guo, Yu Tian, Yuanning Cui, Xiang Chen

게시일 2026-08-18
📖 3 분 읽기☕ 가벼운 읽기

원저자: Feiyang Ren, Shengtao Wen, Lingbing Guo, Yu Tian, Yuanning Cui, Xiang Chen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인공지능의 세계에서 거대 언어 모델은 문장에서 다음 단어를 예측함으로써 질문에 답하고 문제를 해결하며 텍스트를 생성하는 강력한 엔진 역할을 합니다. 이러한 엔진을 컴퓨터 하드웨어에서 효율적으로 실행하기 위해, 엔지니어들은 종-처럼 여러 명의 승객을 실은 버스처럼 많은 요청을 하나로 묶곤 합니다. 그러나 하드웨어가 그룹 내의 모든 요청을 가장 긴 요청인 것처럼 취급해야 하기 때문에, 짧은 응답을 이에 맞추기 위해 빈 공간으로 패딩(padding)을 채우는 과정에서 지속적인 비효전성이 발생합니다. 이 낭비되는 공간은 모델이 복잡한 추론을 수행하거나 길고 상세한 답변을 생성하도록 요청받을 때 시스템 전체를 느리게 만듭니다. 이를 해결하기 위해 연구자들은 오랫동안 답변이 완전히 작성되기 전에 그 길이가 정확히 얼마가 될지를 예측하여, 시스템이 자원을 정밀하게 할당할 수 있는 방법을 찾아왔습니다. 한동안 이러한 예측을 위한 주요 방법은 모델의 불확실성, 즉 모델이 다음 단어에 대해 얼마나 확신이 없는지를 측정하는 '엔트로피'라는 개념에 의존해 왔습니다.

새로운 연구는 불확실성만이 이 과업을 위한 최선의 지침이라는 가설에 이의를 제기합니다. 연구진은 불확실성이 유용하기는 하지만, 그것이 의미의 결정적인 층위를 놓치고 있다는 사실을 발견했습니다. 텍스트를 생성하는 과정에서 모델은 방대한 양의 신호를 생성하는데, 어떤 신호는 혼란이나 망설임을 나타내는 반면, 다른 신호는 가장 중요한 사실, 숫자 또는 지침을 강조합니다. 불확실성에 크게 의존했던 기존 방식들은 종종 불확실한 전이 단어들을 가장 중요한 것으로 취급하는 반면, 정작 응답의 길이와 구조를 결정하는 견고하고 사실적인 토큰들은 의도치 않게 경시하는 경향이 있었습니다. 이는 마치 안개 낀 교차로에만 주의를 기울이고 명확한 표지판은 무시한 채 도시를 항해하려는 것과 같습니다. 그 결과, 핵심 콘텐츠를 놓치게 되어 예측이 자주 틀리게 됩니다.

이를 해결하기 위해 연구팀은 불확실성 측정치와 각 단어의 중요성을 직접적으로 결과를 결합한 ESTP라는 새로운 프레임워크를 도입했습니다. 이 새로운 방법은 단순히 모델이 얼마나 확신이 없는지를 묻는 대신, 모델이 특정 단어에 얼마나 많은 주의(attention)를 기울이고 있는지도 함께 묻습니다. 이러한 모델의 구조에서 '어텐션'은 현재 사고 과정을 주도하고 있는 단어가 무엇인지 보여주는 스포트라이트 역할을 합니다. 연구진은 핵심 개체, 특정 숫자, 핵심 지침과 같이 의미론적 무게가 큰 단어들이 모델이 매우 확신하고 있을 때조차 높은 어텐션을 받는다는 것을 발견했습니다. 이 어텐션 기반의 중요도와 전통적인 불확실성 신호를 결합함으로써, 새로운 시스템은 텍스트에 대한 균형 잡힌 시각을 만들어냅니다. 이 시스템은 답변의 길이를 정의하는 데 필요한 결정적인 정보를 가치 있게 여기는 동시에, 더 많은 상세 설명이 필요함을 알리는 불확실한 부분들도 인정하는 법을 배웁니다.

연구진은 여러 가지 거대 언어 모델을 사용하여 복잡한 수학적 추론 및 동적 샘플링 시나리오를 포함한 다양한 도전적인 과업에서 이 접근 방식을 테스트했습니다. 그 결과, 이 결합된 방법이 기존의 최선 기법들보다 출력 길이를 더 정확하게 예측한다는 것을 발견했습니다. 많은 경우, 특히 기존 방식들이 가장 어려움을 겪었던 복잡한 추론 과업에서 오류율이 크게 감소했습니다. 연구는 기존 시스템에 의해 과대평가되었던 토큰들의 상당 부분이 실제로는 가치가 낮은 채우기용 단어였던 반면, 과소평가되었던 토큰들 중 다수가 최종 길이를 결정하는 바로 그 사실들이었다는 것을 보여주었습니다. 이러한 불일치를 바로잡음으로써, 새로운 시스템은 컴퓨터 하드웨어에 훨씬 더 명확한 신호를 제공했습니다.

이 방법이 AI 요청을 관리하도록 설계된 전체 시스템에 통합되었을 때, 이러한 개선은 실질적인 현실 세계의 이점으로 이어졌습니다. 시스템은 작업을 더 효율적으로 스케줄링할 수 있었고, 이는 패딩으로 채워져야 했던 낭비되는 빈 공간을 줄이는 결과로 이어졌습니다. 이는 하드웨어가 요청을 처리하는 속도를 눈에 띄게 높이고 작업 완료 시간을 단축했습니다. 이 방법은 모델이 이미 생성하고 있는 내부 신호를 재사용했기 때문에 추가적인 메모리를 요구하거나 모델을 느리게 만들지 않고도 이러한 이득을 달Ach했습니다. 연구 결과는 AI 시스템이 진정으로 효율적이 되기 위해서는 단순한 불확실성 측면을 넘어, 그들이 처리하는 단어의 의미론적 중요성을 인식하는 법을 배워야 함을 시사합니다. 이러한 전환은 기술이 복잡하고 긴 형태의 추론을 이전에는 도달할 수 없었던 수준의 정밀도로 처리할 수 있게 하여, 더 빠르고 신뢰할 수 있는 AI 서비스를 위한 길을 열어줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →