← 최신 논문
🤖 machine learning

The Expressivity Boundary of Probabilistic Circuits: A Comparison with Large Language Models

본 논문은 자기회귀 언어 모델링에서 확률적 회로와 대규모 언어 모델 간의 표현력 격차를 규명하고 분석하여, 로그-스페이스 파라미터화와 분해 가능한 아키텍처가 특정 병목 현상을 완화할 수 있지만, 구조화된 분해 가능 확률적 회로의 고정된 라우팅 구조가 트랜스포머에 비해 이질적인 의존성 토폴로지를 모델링하는 능력을 근본적으로 제한한다는 점을 드러냅니다.

원저자: Zhiyu Zhao, Xuejie Liu, Muhan Zhang, Anji Liu

게시일 2026-05-14
📖 4 분 읽기☕ 가벼운 읽기

원저자: Zhiyu Zhao, Xuejie Liu, Muhan Zhang, Anji Liu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

두 가지 서로 다른 유형의 로봇이 문장 내 다음 단어를 예측하도록 가르치려 한다고 상상해 보세요. 하나는 현대 챗봇을 구동하는 **대규모 언어 모델 (LLM)**과 같은 로봇이고, 다른 하나는 수학적으로 "정직"하며 추측 없이 정확한 확률을 계산할 수 있는 것으로 알려진 **확률 회로 (PC)**라는 모델 유형입니다.

오랫동안 언어 작업에서 LLM 로봇이 승리해 왔고, PC 로봇은 고군분투해 왔습니다. 이 논문은 다음과 같은 질문을 던집니다: 이론적으로 매우 강력한데도 왜 PC 로봇은 언어 작업에서 그렇게 훨씬 더 열악한 것일까요?

저자들은 PC 로봇이 "멍청해서" 실패하는 것이 아니라, 사고하고 말하는 방식에 있는 두 가지 구체적인 병목 현상(교통 체증) 때문에 실패한다고 발견했습니다.

1. "출력 병목 현상": 페인트 믹서 대 레이저 프린터

LLM 을 레이저 프린터라고 생각해 보세요. 다음에 말할 단어를 결정할 때, LLM 은 사전에 있는 모든 가능한 단어에 대한 "점수"(로그트) 목록을 내보냅니다. 점수가 이상한 숫자인지 여부는 상관없이 그냥 출력하고, 최종 필터 (Softmax) 가 이를 하나의 단어가 선명하게 빛나고 나머지는 희미해지는 선명한 그림으로 변환합니다. 이는 문맥이 보통 매우 구체적인 단어를 가리키는 언어에는 완벽합니다.

반면 PC 로봇은 페인트 믹서처럼 행동합니다. 몇 가지 미리 만들어진 "기본 색상"(확률 분포) 을 섞어 다음 단어를 만들려고 시도합니다.

  • 문제: 매우 선명하고 구체적인 색상 (단일 단어를 나타내는 선명한 빨간색 같은 것) 이 필요할 때, 통에서 몇 가지 기본 페인트를 섞으면 대개 탁하고 흐릿한 색이 나옵니다. 다른 것들을 단순히 평균내는 것만으로는 "선명한" 분포를 쉽게 만들 수 없습니다.
  • 해결책: 이 논문은 PC 로봇이 통에서 페인트를 섞는 것을 멈추고 레이저 프린터처럼 "점수"를 내보내도록 하면 (확률 공간 대신 "로그트 공간"에서 작동하도록), 갑자기 언어 작업에서 훨씬 더 나아진다고 보여줍니다. 이로 인해 격차가 크게 좁혀집니다.

2. "문맥 병목 현상": 고정된 기차 선로 대 동적 도로

이것이 더 큰 문제입니다. 로봇이 현재 단어를 이해하기 위해 이전 단어들을 되돌아봐야 한다고 상상해 보세요.

  • LLM (동적 도로): LLM 은 "자기 주의 (Self-Attention)"라는 메커니즘을 사용합니다. 문장 내의 어떤 두 지점이라도 연결할 수 있는 새로운 도로를 GPS 가 즉시 그릴 수 있다고 상상해 보세요. 문장이 "고양이는 방석 위에 앉았다"라면, LLM 은 50 개의 단어가 중간에 있더라도 "고양이"와 "방석" 사이에 즉시 도로를 그릴 수 있습니다. 문장이 실제로 무엇을 필요로 하는지에 따라 연결을 적응적으로 조정합니다.
  • PC (고정된 기차 선로): PC 로봇은 vtree(고정된 트리 다이어그램) 라는 경직된 구조 위에 구축되어 있습니다. 기차가 달리기 전에 선로가 영구적으로 놓여 있는 기차 시스템을 상상해 보세요.
    • 문장 구조가 선로와 일치할 때 (예: 지역적 단어들이 즉각적인 이웃과 연결되는 경우), PC 는 매끄럽게 작동하여 LLM 과 거의 비슷하게 성능을 발휘합니다.
    • 문제: 문장이 선로가 지원하지 않는 연결을 요구할 때 (예: 특정 방식으로 첫 번째 단어와 마지막 단어를 연결하는 경우), PC 는 갇히게 됩니다. 우회할 수 없습니다. 잘못된 방향으로 가는 기차 선로에서 차를 운전하려는 것과 같습니다.

이 논문은 PC 가 이론적으로 복잡한 연결을 처리할 수 있지만, 오직 해당 특정 문장에 대해 "기차 선로"가 정확히 올바르게 놓여 있을 때만 그렇게 할 수 있음을 증명합니다. 실제 언어는 messy 하고 구조가 끊임없이 변하기 때문에, PC 의 고정된 선로는 큰 장애물입니다.

"슈퍼-PC" 아이디어

저자들은 또한 "슈퍼-PC" 아이디어를 테스트했습니다. PC 로봇이 여러 세트의 선로를 가지고 각 문장에 대해 가장 좋은 것을 선택할 수 있다면 어떨까요?

  • 이론: 수학적으로, 이 "유연한" 버전의 PC 는 경직된 버전보다 엄격하게 더 강력합니다.
  • 현실: 단순한 인위적 테스트에서는 더 잘 작동하지만, 이러한 유연한 모델을 실제 세계 데이터로 훈련시키는 것은 매우 어렵습니다. 논문은 우리가 그들을 더 강력하게 만드는 방법을 알고 있지만, 효과적으로 학습하도록 가르치는 최선의 방법을 아직 찾아내지 못했다고 결론 내립니다.

요약

이 논문은 확률 회로가 "고장 난" 것이 아니라, 단지 언어에 부적합할 뿐이라고 결론 내립니다:

  1. 점수를 출력하는 대신 페인트를 섞는다: 예측을 출력하는 방식을 변경하면 큰 도움이 됩니다.
  2. 고정된 선로에 갇혀 있다: LLM 처럼 단어를 동적으로 연결할 수 없으므로, 문장 구조가 복잡해지면 불리해집니다.

우리가 "페인트 섞기" 문제를 해결하고 유연한 "선로 전환" 모델을 훈련할 방법을 찾으면, PC 는 정확한 수학 연산을 수행하는 특별한 능력을 유지하면서 언어 작업에서 마침내 LLM 에 뒤처지지 않을지도 모릅니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →