← 최신 논문
💬 NLP

Breaking the Autoregressive Chain: Hyper-Parallel Decoding for Efficient LLM-Based Attribute Value Extraction

본 논문은 출력 시퀀스의 조건부 독립성을 활용하여 비순차적 병렬 토큰 생성을 가능하게 함으로써 속성 값 추출과 같은 작업에 대한 대규모 언어 모델 추론을 가속화하는 새로운 알고리즘인 하이퍼-병렬 디코딩 (HPD) 을 소개하며, 이를 통해 품질을 저하시키지 않으면서 추론 시간과 비용을 최대 13.8 배까지 절감합니다.

원저자: Theodore Glavas, Nikhita Vedula, Dushyanta Dhyani, Yilun Zhu, Shervin Malmasi

게시일 2026-04-30
📖 3 분 읽기☕ 가벼운 읽기

원저자: Theodore Glavas, Nikhita Vedula, Dushyanta Dhyani, Yilun Zhu, Shervin Malmasi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 뛰어난 능력을 갖춘 사서 (AI) 라고 상상해 보십시오. 당신의 임무는 거대한 제품 카드 더미를 작성하는 것입니다. 각 카드에는 '화면 크기', '디스플레이 유형', '해상도'와 같이 채워야 할 빈 필드 목록이 있습니다.

기존 방식 (자기회귀적 디코딩):
전통적으로 사서는 위쪽에서 아래쪽으로 엄격하게 하나씩 이 필드를 채웁니다. '화면 크기'를 쓰기 전에 '해상도'에 대해 생각조차 할 수 없습니다. 비록 '화면 크기'가 '해상도'와 전혀 관련이 없더라도, 사서는 다음 작업을 시작하기 전에 첫 번째 작업이 완료되기를 기다려야 합니다. 이는 앞차가 이동하기 전까지 모든 차가 기다려야 하는 일차선 도로와 같습니다. 사서가 순차적으로 작업하기 때문에 이는 느리고 비용이 많이 듭니다.

새로운 방식 (초병렬 디코딩 또는 HPD):
이 논문은 **초병렬 디코딩 (HPD)**이라는 교묘한 트릭을 소개합니다. 저자들은 이러한 작업의 경우 답변들이 실제로 독립적임을 깨달았습니다. 화면 크기를 아는 것이 해상도를 바꾸지 않기 때문입니다. 그렇다면 왜 기다려야 할까요?

HPD 는 사서가 모든 빈 필드를 동시에 작업할 수 있게 합니다.

그렇다면 사서의 뇌 (AI 모델) 를 손상시키지 않고 이 마법 같은 트릭을 어떻게 수행할까요?

  1. '가짜' 간격: 사서는 단어의 위치를 보고 순서를 이해하도록 훈련되었습니다. HPD 는 문장 내에 '가짜 간격'을 만들어 사서를 속입니다. 사서가 첫 번째 답변이 1 번 위치에 있고, 두 번째 답변이 마법처럼 10 번 위치로 건너뛰어 있으며, 세 번째는 20 번 위치로 건너뛰는 목록을 본다고 상상해 보십시오.
  2. 간격 채우기: 사서는 이러한 답변들이 문장 내에서 멀리 떨어져 있다고 생각하기 때문에, 동시에 모두 작성해도 문제가 없습니다. 이는 '화면 크기'의 첫 글자, '해상도'의 첫 글자, '디스플레이 유형'의 첫 글자를 모두 같은 순간에 생성할 수 있습니다.
  3. 조립 라인: 다음 순간에는 세 가지 답변 모두의 두 번째 글자를 한 번에 채웁니다. 모든 필드가 채워질 때까지 이를 계속 반복합니다.

'적층' 보너스:
논문은 **문서 적층 (Document Stacking)**이라는 두 번째 트릭도 언급합니다. 하나의 카드를 작성하는 대신 사서에게 10 장의 카드 더미를 주어 모든 카드에 대해 동일한 필드를 한 번에 채우라고 한다고 상상해 보십시오. HPD 는 이를 '가짜 간격' 트릭과 결합합니다. 이제 사서는 한 장의 카드에 있는 3 개의 필드를 채우는 것이 아니라, 10 개의 서로 다른 카드에 있는 3 개의 필드를 동시에 채웁니다. 이는 여러 제품을 병렬로 처리함으로써 갑자기 속도를 두 배로 높인 공장 조립 라인과 같습니다.

결과:
논문은 실제 전자상거래 데이터 (예: TV 사양) 로 이를 테스트했습니다. 그 결과 다음과 같은 사실을 발견했습니다.

  • 속도: 기존 방식보다 최대 13.8 배 더 빠르게 처리할 수 있었습니다.
  • 비용: 훨씬 더 빠르기 때문에 실행 비용이 최대 13.8 배 더 적게 듭니다.
  • 품질: 답변은 느린 기존 방식만큼 정확했습니다. 어떤 경우에는 오히려 약간 더 좋았습니다.

핵심 요약:
이 논문은 새로운 사서를 발명하는 것이 아니라 책상을 정리하는 새로운 방식을 발명합니다. '위치 ID'(좌석 번호) 를 재배열하고 사서가 어떤 단어를 볼지 알려주는 특수 마스크를 사용하여 "한 번에 한 가지 일만 해야 한다"는 규칙을 깨뜨렸습니다. 이는 느린 일차선 도로를 시간과 비용을 대폭 절약해 주는 비즈니스에 필요한 수백만 개의 제품 설명에서 데이터를 추출할 수 있는 고속 다차선 고속도로로 바꿉니다.

중요 참고 사항: 저자들은 이 방식이 답변이 독립적인 작업 (예: 제품 속성) 에만 작동한다고 명시적으로 밝힙니다. 한 질문의 답변이 이전 질문의 답변에 크게 의존하는 작업 (예: 복잡한 이야기 작성이나 수학 문제 단계별 해결) 에는 작동하지 않는다고 주장하지 않습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →