← 최신 논문
🤖 machine learning

Amortizing intractable inference in large language models

이 논문은 대규모 언어 모델에서 난해한 추론을 분할 계산(amortize)하기 위해 GFlowNet을 사용하는 방안을 제안하며, 이를 통해 전통적인 최대 가능도 또는 보상 극대화 학습의 데이터 효율적인 대안으로서 제약 조건이 있는 생성 및 사고 사슬(chain-of-thought) 추론과 같은 작업에 대해 복잡한 사후 분포로부터 샘플링하는 것을 가능하게 한다.

원저자: Edward J. Hu, Moksh Jain, Eric Elmoznino, Younesse Kaddar, Guillaume Lajoie, Yoshua Bengio, Esmeralda S. Whitammer

게시일 2026-09-01
📖 3 분 읽기☕ 가벼운 읽기

원저자: Edward J. Hu, Moksh Jain, Eric Elmoznino, Younesse Kaddar, Guillaume Lajoie, Yoshua Bengio, Esmeralda S. Whitammer

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

대규모 언어 모델은 인간 지식의 방대한 도서관이며, 앞선 단어를 바탕으로 문장의 다음 단어를 예측하는 디지털 네트워크로 압축되어 있습니다. 이 모델들은 시작점이 주어졌을 때 이야기를 이어가거나 질문에 답하는 데 탁로하도록 훈련되었으며, 이 과정은 왼쪽에서 오른쪽으로 자연스럽게 흐릅니다. 그러나 우리가 이 모델들에게 수행시키고자 하는 가장 흥미로운 과제 중 상당수는 역방향으로 생각하거나 이야기의 중간 부분을 채우는 것을 요구합니다. 이야기의 시작과 끝을 주고 그 중간을 만들어내라고 요청받거나, 특정 답변 뒤에 숨겨진 추론 과정을 설명하라고 요청받는 상황을 상상해 보십시오. 이러한 시나리오에서 모델은 단순히 다음 단어를 추측하는 것에 그칠 수 없습니다. 모델은 시작과 끝을 연결하는 특정한 경로를 찾기 위해 거대하고 복용한 가능성의 풍경을 탐색해야 합니다. 이는 가능한 경로의 수가 너무 많아 하나씩 확인하는 것이 불가능하기 때문에 매우 어려운 수학적 문제입니다. 또한, 이 풍경을 탐색하는 표준적인 방법들은 종종 한두 개의 흔한 경로에만 머물러 존재할 수 있는 풍부하고 다양한 유효한 해결책들을 놓치곤 합니다.

Mila – 퀘벡 AI 연구소와 옥스퍼드 대학교의 연구진은 이러한 모델들이 그 복잡한 풍경을 탐색하는 법을 가르치는 새로운 방법을 개발했습니다. 모델이 단순히 '최선의' 답변에 대해 점수를 극대화하도록 훈련하는 대신(이는 종종 반복적이고 좁은 사고로 이어집니다), 그들은 '아모티제이션된 추론(amortized inference)'이라 불리는 방법을 사용했습니다. 이 접근 방식은 문제를 단 하나의 완벽한 답을 찾는 것이 아니라, 다양한 정답 집합을 찾는 과정으로 취급합니다. 이를 위해 그들은 '생성적 흐름 네트워크(generative flow network)'라고 알려진 기술을 도입했는데, 이는 모델이 하나의 과도하게 사용된 패턴으로 붕괴되지 않고 다양한 유효한 추론 사슬을 탐색할 수 있도록 전체 범위의 솔루션으로부터 샘플링하는 법을 배우는 가이드 역할을 합니다.

연구팀은 산술 계산이나 영화 리뷰가 의견을 나타내는지 사실을 나타내는지 분류하는 것과 같이 다단계 추론이 필요한 문제를 풀도록 대규모 언어 모델을 미세 조정함으로써 이를 입증했습니다. 한 실험에서, 그들은 모델에게 이야기의 시작과 끝이 주어졌을 때 짧은 이야기의 누락된 중간 문장을 채우도록 요청했습니다. 표준적인 방법들은 문법적으로는 맞지만 서사의 흐름에는 맞지 않는 문장을 생성하는 경우가 많았습니다. 그러나 새로운 방법은 시작과 끝을 일관되게 연결하는 중간 문장을 성공적으로 생성하여, 전체 맥락을 이해하는 능력이 훨씬 높음을 보여주었습니다. 계산기를 도구로 사용하는 간단한 수학 문제를 포함한 또 다른 테스트에서는, 모델에게 계산 과정을 단계별로 나누도록 요청했습니다. 기존의 훈련 방식들은 모델이 숫자를 반복하거나 도구를 올바르게 사용하지 못하게 만든 반면, 새로운 접근 방식은 모델이 단계를 신중하게 계획하도록 가르쳐 특히 처음 보는 문제들에 대해 정확도를 극적으로 향상시켰습니다.

결과는 이 방법이 데이터가 부족할 때 특히 강력하다는 것을 시사합니다. 단 10개의 영화 리뷰 예시만을 학습한 테스트에서, 이 새로운 방법은 표준 훈련 기술보다 현저히 높은 정확도를 달aba 성취했으며, 50개의 예시가 있을 때도 계속해서 이를 능가했습니다. 연구진은 모델이 다양한 추론 경로를 샘플링하도록 장려하고 그 결론들을 결합함으로써 시스템이 더 견고하고 신뢰할 수 있게 된다는 것을 발견했습니다. 이는 모델이 단순히 문제를 해결하는 단 하나의 방법을 암기하는 것이 아니라, 그것을 어떻게 추론해 나가는지에 대한 근본적인 구조를 배우고 있다는 점에서 매우 중요한 차이입니다. 이 연구는 목표를 '가장 가능성 높은 단 하나의 답 찾기'에서 '정답의 전체 다양성 탐색'으로 전환함으로써, 우리가 이 강력한 도구들을 더 유연하게 만들고 복잡한 추론 과제에 더 적합하게 만들 수 있음을 보여줍니다.

또한 이 작업은 현재 모델들이 훈련되는 방식의 한계를 강조합니다. 모델이 보상을 극대화하도록 강요될 때, 모델은 높은 점수를 얻기 위해 동일한 구절을 반복하거나 실제 논리를 무시하는 등의 지름길을 찾는 경향이 있습니다. 연구진은 그들의 방법이 가능한 솔루션의 전체 분포를 일치시킴으로써, 모델이 단일하고 결함이 있는 사고 패턴으로 붕괴되지 않도록 하여 이러한 함정을 피한다는 것을 보여주었습니다. 이 접근 방식은 모델이 훈련받은 것보다 더 많은 숫자가 포함된 산술 문제를 푸는 것과 같이 새로운 상황에 더 잘 일반화할 수 있게 해줍니다. 이러한 발견은 인공지능을 단순한 패턴 매칭을 넘어, 논거를 구성하고 단계별로 문제를 해결하는 법을 이해하는 더 미묘한 수준의 진정한 추론을 할 수 있는 방향으로 나아가게 하는 유망한 길을 제시합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →