← 최신 논문
💬 NLP

Just Pass Twice: Efficient Token Classification with LLMs for Zero-Shot NER

이 논문은 인과적 대규모 언어 모델이 구조적 변경 없이 전체 양방향 문맥을 허용하도록 입력 텍스트를 결합함으로써 효율적인 최첨단 제로샷 개체명 인식(Named Entity Recognition)을 수행할 수 있게 하는 "Just Pass Twice" (JPT) 방법을 제안하며, 이를 통해 자기회귀 생성의 한계를 극복하는 동시에 20배 이상의 빠른 추론을 달성한다.

원저자: Ahmed Ewais, Ahmed Hashish, Amr Ali

게시일 2026-08-27
📖 3 분 읽기☕ 가벼운 읽기

원저자: Ahmed Ewais, Ahmed Hashish, Amr Ali

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

언어는 맥락의 그물망이며, 단 하나의 단어의 의미도 종종 그 뒤에 오는 단어들에 전적으로 의존합니다. "파리(Paris)"라는 단어를 생각해 보십시오. 문장 시작 부분에서 이 단어를 마주했을 때, 당신의 뇌는 이것이 프랑스의 수도를 가리키는지, 아니면 새 앨범을 발표한 음악가를 가리키는지 아직 알지 못합니다. 이 모호함을 해결하기 위해, 당신은 문장 전체를 읽어야만 합니다. 수십 년 동안 컴퓨터는 이와 동일한 문제로 고군분투해 왔습니다. 텍스트에서 사람, 장소, 조직의 이름을 찾는 전통적인 도구들은 단어가 나타나는 순서대로 하나씩 뒤를 돌아보며 분석하도록 만들어졌습니다. 그것들은 미래를 볼 수 없었기에, 결정적인 단서가 문장 뒤쪽에 나타날 때 종종 잘못된 추측을 하곤 했습니다. 한편, 가장 최신의 가장 강력한 언어 모델들은 방대한 양의 인간 지식을 이해할 수 있었지만, 그것들은 텍스트를 작성하기 위해 만들어졌을 뿐 라벨을 붙이기 위해 만들어진 것이 아니었습니다. 그들 역시 오직 뒤를 돌아볼 수밖에 없었기에, 텍스트 블록 내의 특정 단어를 식별하라는 요청을 받으면 느려지고 오류가 발생하기 쉬웠습니다.

WitnessAI의 연구진은 기존의 설계를 변경하지 않고도 이러한 강력한 모델들에게 전체 그림을 볼 수 있는 능력을 부여하는 방법을 찾아냈습니다. 그들은 이 방법을 "저스트 패스 트와이스(Just Pass Twice, 두 번 통과하기)"라고 부릅니다. 해결책은 매우 단순합니다. 컴퓨터 모델에 문장을 단 한 번만 입력하는 대신, 문장을 연속해서 두 번 입력하는 것입니다. 첫 번째로 모델은 문장을 정상적으로 읽습니다. 두 번째로 모델은 정확히 같은 문장을 다시 읽습니다. 모델은 지금까지 본 모든 것을 기억하도록 설계되어 있기 때문에, 두 번째 읽기 과정에서 모든 단어는 첫 번째 읽기의 전체 내용을 "뒤돌아볼" 수 있게 됩니다. 즉, 모델이 두 번째 통과 중에 "파리(Paris)"라는 단어를 분석할 때, 이미 첫 번째 통과에서 뒤에 등장했던 "새 앨범"이라는 단어를 볼 수 있게 되는 것입니다. 이 기법은 모델이 문장 전체를 한 번에 보는 효과를 주어, 모델이 각 단어의 의미를 정밀하게 결정할 수 있게 하며, 이 모든 과정은 이전의 최고 방법들보다 20배 이상 빠른 속도로 실행됩니다.

연구진은 이 접근 방식을 음악, 정치, 과학 등 다양한 분야에서 사람, 조직, 위치와 같은 특정 유형의 정보를 식별해야 하는 광범위한 작업에 테스트했습니다. 그들은 이 "두 번 읽기" 기법을 각 엔티티(entity) 유형에 대한 명확한 서술형 정의와 결래하여 사용함으로써 모델이 놀라운 정확도를 갖게 된다는 것을 발견했습니다. 테스트 결과, 이 모델은 기존의 가장 뛰어난 방법들을 상당한 차이로 앞질렀으며, 평균적으로 정확도를 거의 8포인트 향상시켰습니다. 이는 수십 년 동안 연구되어 온 작업에서 상당한 성능의 도약입니다. 모델은 단순히 추측을 더 잘한 것이 아니라, 맥락을 더 깊이 이해했습니다. 예를 들어, 모델은 단순히 이름 목록을 암기하는 것이 아니라 제공된 특정 정의에 의존함으로써 "사람"과 "정치인" 또는 "국가"와 "조직"을 구별할 수 있었습니다.

이 발견이 특히 놀라운 점은 인공지능의 일반적인 트레이드오프(trade-off, 상충 관계)를 우회한다는 것입니다. 일반적으로 모델을 더 정확하게 만들기 위해서는 더 느리거나 더 복잡하게 만들어야 합니다. 텍xt를 단어 단위로 생성하는 생성 모델은 각 단어를 쓴 후에 다음 단어로 넘어가야 하므로 느립니다. 단순히 단어에 라벨을 붙이는 판별 모델은 빠르지만, 최신 대규모 모델들이 가진 깊은 이해력은 부족한 경우가 많습니다. "저스트 패스 트와이스" 방식은 이 간극을 메웁니다. 이는 거대하고 지식이 풍부한 모델이 텍스트에 라벨을 붙이는 빠르고 정밀한 작업을 수행할 수 있게 해줍니다. 연구진은 모델의 구조를 변경하거나 처음부터 다시 학습시킬 필요 없이 이 일을 해냈습니다. 그들은 단지 입력을 변경하여, 모델이 느린 순차적 계산이 아닌 단일한 병렬적 계산 폭발 속에서 처리할 수 있도록 텍스트를 복제했을 뿐입니다.

이 연구의 함의는 단순히 텍스트에서 이름을 찾는 것을 넘어 확장됩니다. 이는 현대 언어 모델의 한계가 항상 지능의 부족 때문이 아니라, 때로는 모델이 작동하도록 요청받는 방식 때문임을 보여줍니다. 연구진은 모델이 문장의 전체 맥락을 볼 수 있는 방법을 찾아냄으로써, 이 모델들의 새로운 수준의 효율성과 정확도를 끌어냈습니다. 그들의 방법은 마법 같은 기술이나 복잡한 알고리즘의 개편이 아니라, 모델의 기존 역량을 새로운 방식으로 활용하는 단순하고 우아한 조정입니다. 그 결과, 이 시스템은 더 빠르고 똑똑하며, 이전에는 이 부류의 도구들이 도달할 수 없었던 수준의 정밀도로 인간 언어의 뉘앙스를 다룰 수 있게 되었습니다. 이 접근 방식은 인공지능의 앞날이 반드시 더 크고 복잡한 기계를 만드는 것이 아니라, 우리가 이미 가지고 있는 것들을 사용하는 더 단순하고 우아한 방법을 찾는 데 있을 수 있음을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →