← 최신 논문
🤖 AI

STORM: Stepwise Token Optimization with Reward-Guided Beam Search

STORM은 보상 유도 빔 서치를 사용하여 검색 지표에 대해 토큰 수준의 생성을 최적화함으로써 어휘 쿼리 확장을 강화하는 자기 지도 학습 프레임워크로, 특수한 인덱싱을 요구하지 않으면서도 밀집 신경 모델에 필적하는 효율적이고 투명하며 고성능인 검색을 가능하게 한다.

원저자: Arthur Satouf, Giulio D'Erasmo, Yuxuan Zong, Habiboulaye Amadou Boubacar, Pablo Piantanida, Benjamin Piwowarski

게시일 2026-06-10
📖 3 분 읽기☕ 가벼운 읽기

원저자: Arthur Satouf, Giulio D'Erasmo, Yuxuan Zong, Habiboulaye Amadou Boubacar, Pablo Piantanida, Benjamin Piwowarski

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대한, 혼란스러운 도서관에서 특정 레시피를 찾으려고 한다고 상상해 보세요. 당신은 사서(검색 엔진)에게 "케이크를 어떻게 만드나요?"라고 묻습니다.

문제점: 어휘의 격차 (The Vocabulary Gap)
사서는 매우 빠르고 표준화된 분류 체계(BM25)를 사용합니다. 하지만 사서는 당신이 입력한 정확한 단어만을 찾습니다. 만약 도서관에서 가장 좋은 레시피의 제목이 "버터크림을 곁들인 맛있는 바닐라 스폰지 케이크"인데, 당신이 단지 "케이크"라고만 물었다면, 제목에 "케이크"라는 단어가 없기 때문에 사서는 이를 놓칠 수 있습니다.

이것이 바로 "어휘 불일치"입니다. 당신은 사서가 "케이크"가 "스폰지", "디저트", 또는 "제과류"라고도 불릴 수 있다는 것을 이해하도록 도와줘야 합니다.

기존의 해결책들

  1. 인간 조력자: 당신의 질문을 더 나은 표현으로 다시 써줄 사람을 고용할 수 있습니다. 하지만 인간은 비용이 많이 들고 느립니다.
  2. AI의 추측: 똑똑한 AI(대규모 언어 모델)에게 더 나은 단어를 추측해 달라고 요청할 수 있습니다. 하지만 AI는 종종 그럴듯하게 들리지만 실제로는 검색에 도움이 되지 않는 단어를 제안합니다. 예를 들어 "베이킹"이나 "밀가루" 같은 단어를 제안할 수 있는데, 이는 너무 흔해서 검색 결과를 어지럽힐 뿐입니다.
  3. 맹목적인 시행착오: 어떤 방식들은 AI가 문장 전체를 추측하게 한 뒤, 그것이 효과가 있었는지 확인합니다. 만약 실패하면, AI는 처음부터 다시 시작하여 새로운 문장을 추측해야 합니다. 이는 AI가 어떤 특정 단어 때문에 실패했는지 알 수 없기 때문에 느리고 비효율적입니다.

새로운 해결책: STORM
이 논문은 STORM(Stepwise Token Optimization with Reward-guided beam search)을 소개합니다. STORM을 AI가 완벽한 검색 쿼리를 작성하도록 돕는 스마트한 실시간 편집자라고 생각하세요. 단 한 단어씩, 도서관의 분류 체계를 끊임없이 확인하면서 말이죠.

작동 방식은 다음과 같습니다 (창의적인 비유를 사용하겠습니다):

"나무 타기" 비유

AI가 최고의 열매(최고의 검색어)를 찾기 위해 나무를 오르고 있다고 상상해 보세요.

  • 표준 AI: AI는 나뭇가지를 하나 선택해 꼭대기까지 끝까지 올라갑니다. 꼭대기에 도달해서야 "아차, 이 가지에는 열매가 없네"라고 확인합니다. 그러면 다시 바닥까지 내려와서 다른 가지를 시도해야 합니다. 이는 느리고 낭비가 심합니다.
  • STORM: STORM은 **보상 유도형 빔 서치(reward-guided beam search)**를 사용합니다. AI가 나무를 오를 때, 매 단계마다(새로운 단어를 추가할 때마다) "점수 기록원"이 즉시 도서관 인덱스를 확인합니다.
    • 만약 AI가 "스폰지"라는 단어를 추가하면, 점수 기록원은 "좋아요! 실제 레시피와 일치합니다. 계속 가세요!"라고 말합니다.
    • 만약 AI가 "맛있는"이라는 단어를 추가하면, 점수 기록원은 "멈추세요! 그 단어는 너무 흔해서 특정 레시피를 찾는 데 도움이 되지 않습니다. 이 가지를 즉시 잘라내세요."라고 말합니다.

STORM은 나쁜 가지들이 자라나기도 전에 가지치기(pruning)를 합니다. 오직 좋은 결과로 이어지는 경로만을 유지합니다.

이것이 왜 중요한가

1. 암기가 아닌 실행을 통해 배웁니다
STORM은 인간에게 무엇이 "좋은" 검색 쿼리인지 가르칠 필요가 없습니다. 스스로 학습합니다. 쿼리를 생성하고, 그것이 좋은 문서를 찾아내는지 확인하며, 만약 그렇다면 그 경로를 기억합니다. 그렇지 않다면 그 경로를 잊어버립니다. 이는 마치 개가 올바른 공을 가져왔을 때만 칭찬을 받으며 공 가져오기를 배우는 것과 같습니다.

2. 번개처럼 빠릅 old
많은 AI 검색 도구들은 당신이 원하는 것을 설명하기 위해 길고 화려한 문장을 쓰기 때문에 느립니다. STORM은 다릅니다. STORM은 짧고 핵심적인 키워드 목록(예: "스폰지", "바닐라", "버터")을 작성합니다.

  • 결과: 기존 방식보다 더 나은 결과를 찾아내면서도, 기본적인 단순 검색 엔진(BM25)만큼 빠르게 수행합니다. 도서관의 분류 체계를 새로 구축할 필요 없이, 단지 사서의 언어를 더 잘 구사할 뿐입니다.

3. 영어만 배웠음에도 여러 언어를 구사합니다
이 논문의 가장 놀라운 점은 STORM이 영어 데이터로만 훈련되었다는 것입니다. 그럼에도 불구하고, 18가지 다른 언어(프랑스어, 중국어, 스와히리어 등)로 테스트했을 때, 해당 언어들을 위해 특별히 만들어진 값비싼 전문 AI 모델보다 더 나은 성능을 보였습니다.

  • 비유: 이는 영어를 사용하여 체스 규칙을 배운 사람이, 배우지 않았음에도 불구하고 스페인어, 프랑스어, 일본어로 완벽하게 체스를 두는 것과 같습니다. AI는 특정 영어 단어를 배운 것이 아니라, 좋은 단어를 찾는 '논리'를 배운 것입니다.

결론

STORM은 검색 엔진을 더 느리거나 더 비싸게 만들지 않으면서도 더 똑똑하게 만드는 새로운 방법입니다. 이는 AI를 위한 실시간 코치처럼 작동하며, 매 단계마다 "좋은 단어예요, 계속 가세요!" 또는 "나쁜 단어예요, 거기서 멈추세요!"라고 속삭여 줍니다. 이를 통해 훨씬 작고 저렴한 AI 모델들도 거대하고 비싼 모델들만큼(혹은 그보다 더 잘) 정보를 찾아낼 수 있게 하며, 도서관이 수십 년 동안 사용해 온 단순하고 빠른 분류 체계를 그대로 활용할 수 있게 해줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →