← 최신 논문
📊 statistics

Total Variation Distance Estimation in Autoregressive Models

이 논문은 샘플, 로짓, 노이지 로짓 액세스 모델 하에서 두 개의 길이 nn 자기회귀 분포 사이의 총 변동 거리를 추정하기 위한 효율적인 알고리즘을 제시하며, 이는 기존 방법론보다 상당한 개선을 제공하고 현대 LLM 추론 엔진 간의 분포적 차이를 정량화하는 데 있어 실질적인 유용성을 입증한다.

원저자: Eric Price, Kevin Tian, Zhiyang Xun, Yusong Zhu

게시일 2026-07-23
📖 5 분 읽기🧠 심층 분석

원저자: Eric Price, Kevin Tian, Zhiyang Xun, Yusong Zhu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

보이지 않는 차이: AI 쌍둥이들

똑같이 생긴 쌍둥이가 있다고 상상해 보세요. 그들은 정확히 같은 집에서 자랐고, 같은 음식을 먹으며, 같은 DNA를 가지고 있습니다. 만약 당신이 그들에게 질문을 던진다면, 당신은 그들이 토씨 하나 틀리지 않고 똑같은 대답을 할 것이라고 기대할 것입니다. 인공지능(AI), 특히 거대언어모델(LLM)의 세계에서 'DNA'는 모델의 가중치(weights), 즉 파일에 저장된 수학적 두뇌 능력을 의미합니다. 하지만 현실 세계는 그렇게 단순하지 않습니다. 쌍둥이가 피곤하거나 배가 고프거나 혹은 친구와 대화하고 있는지에 따라 다르게 반응할 수 있듯이, AI 모델도 어떤 컴퓨터 하드웨어에서 실행되는지, 한 번에 얼마나 많은 질문에 답하고 있는지, 혹은 소프트웨어 코드의 아주 작고 보이지 않는 결함이 있는지에 따라 다른 결과를 만들어낼 수 있습니다.

두 대상이 얼마나 다른지 측정하기 위해 과학자들은 종종 '전변동 거리(Total Variation Distance, TV)'라는 도구를 사용합니다. 이것을 '불일치 측정기'라고 생각하면 됩니다. 만약 당신에게 두 봉지의 구슬이 있고 각각 하나씩 꺼낸다면, TV 거리는 두 구슬의 색깔이 다를 최대 확률을 알려줍니다. 이는 "이 두 대상이 서로 얼마나 다를 가능성이 있는가?"에 대한 완벽한 점수입니다. 이는 모델이 단 한 단어라도 다를 때 완전히 무너질 수 있는, 모델이 얼마나 '놀랐는지'를 측정하려는 다른 도구들과는 다릅니다. 연구자들이 던지는 큰 질문은 이것입니다: 만약 두 회사가 정확히 동일한 AI 모델을 실행한다고 주장한다면, 그들은 실제로 당신에게 똑같은 경험을 제공하고 있는 것일까요, 아니면 코드 속에 숨겨진 차이가 도사리고 있는 것일까요?

논문의 미션: 기계 속의 유령을 잡아라

"자기회귀 모델에서의 전변동 거리 추정(Total Variation Distance Estimation in Autoregressive Models)"이라는 제목의 이 논문은 이러한 숨겨진 차이를 찾아내는 탐정 이야기입니다. 저자들인 텍사스 대학교 오스틴 캠퍼스의 연구팀은 두 AI 엔진이 서류상으로는 동일해 보일지라도, '배칭(batching, 여러 질문에 동시에 답하는 것)'이나 '양자화(quantization, 공간 절약을 위해 숫자를 단순화하는 것)'와 같은 이유로 인해 실제로 텍스트를 생성하는 방식이 달라질 수 있다는 점을 깨달았습니다. 그들은 두 AI 엔진 사이의 전변동 거리를 측정하여 얼마나 많은 차이가 있는지 확인하기 위한 신뢰할 수 있는 방법을 구축하고자 했습니다.

저자들은 이 거리를 측정하는 것이 까다롭다는 것을 발견했습니다. 왜냐하면 AI 모델은 단순히 답을 내뱉는 것이 아니라, 마치 연쇄 반응처럼 한 번에 한 단어씩 글을 만들어 나가기 때문입니다. 만약 당신이 최종 답변(샘플)만을 볼 수 있다면, 그것은 영화의 마지막 장면만 보고 전체 줄거리를 추측하려는 것과 같습니다. 이를 해결하기 위해 그들은 내부를 들여다볼 수 있는 세 가지 서로 다른 '초능력' 혹은 방법을 개발했으며, 더 많이 볼 수 있을수록 작업이 쉬워진다는 것을 발견했습니다.

1. "샘플" 초능력 (눈 가리고 하는 추측)
AI를 확인하는 가장 기본적인 방법은 질문을 던지고 무엇이라고 말하는지 보는 것입니다. 이를 '샘플 접근(sample access)'이라고 합니다. 저자들은 만약 이 관점만을 가진다면, 좋은 측정을 위해 아주 많은 질문을 던져야 한다는 것을 발견했습니다. 구체적으로, 필요한 질문의 수는 이야기의 길이(n2n^2)와 어휘 목록의 '활성' 크기(KK)의 제곱에 비례하여 증가합니다. 이는 거대한 숲을 하나의 길만 걸어서 지도화하려는 것과 같습니다. 숨겨진 빈터를 놓치지 않았다고 확신하려면 그 길을 아주 많이, 여러 번 걸어야 합니다. 그들의 방법은 이전의 시도들보다 개선되어 더 빠르긴 하지만, 여전히 방대한 양의 쿼리가 필요합니다.

2. "로짓" 초능력 (X-레이 시력)
많은 AI 시스템은 모델이 다음 단어를 결정하기 위해 사용하는 원시 숫자, 즉 최종 선택으로 변환되기 전의 '로짓(logits)'을 보여줍니다. 이것은 AI의 내부 사고 과정을 보는 것과 같습니다. 저자들은 이 숫자들에 접근할 수 있다면 작업이 믿기 힘들 정도로 쉬워진다는 것을 보여주었습니다. 스토리 길이(nn)에 선형적으로 비례하는 수의 쿼리만 있으면 됩니다. 이는 숲을 걷는 것에서 헬리콥터를 타고 숲 위를 나는 것으로 전환하는 것과 같은 엄청난 도약입니다. 그들은 이것이 절대적으로 가장 빠른 방법임을 증와했습니다. 이보다 더 빠르게 수행할 수는 없습니다.

3. "노이즈 섞인 로짓" 초능력 (안개 낀 창문)
여기서부터 매우 흥미로워집니다. 현실 세계에서 그 '로짓' 숫자들은 항상 완벽하지는 않습니다. 때때로 컴퓨터가 바쁘거나 소프트웨어가 약간 버그가 있어 숫자가 다소 흐릿하거나 '노이즈(noise)'가 섞여서 돌아올 수 있습니다. 저자들은 이 노이즈를 이미 알고 있는 양(예를 들어 창문에 안개가 얼마나 끼었는지 아는 것과 같은)으로 취급한다면, 여전히 훌륭한 측정이 가능하다는 것을 깨달았습니다. 그들은 '눈 가린' 방식과 'X-레이' 방식을 부드럽게 혼합하는 방법을 만들었습니다. 노이즈가 적으면 X-레이 시력을 가진 것처럼 행동하고, 노이즈가 많으면 눈을 가린 상태처럼 행동합니다. 이것이 가장 실용적인 도구인데, 왜냐하면 AI가 완벽하게 작동하지 않을 때도 작동하기 때문입니다.

실전 테스트: 현실 세계의 대결

그들의 방법이 작동한다는 것을 증명하기 위해, 저자들은 실험실에만 머물지 않았습니다. 그들은 동일한 모델(Qwen3-0.6B)을 실행하는 두 가지 인기 있는 AI 엔진인 vllmsglang을 비교하는 실제 실험을 설정했습니다. 그들은 이 두 엔진이 동일하게 작동하도록 설계되었음에도 불구하고, 실제로 동일한 텍스트를 생성하는지 확인하고자 했습니다.

그들은 두 엔진이 서로 다르다는 것을 발견했습니다. 500단어 길이의 이야기에서 두 엔진 사이의 전변동 거리는 약 0.586이었습니다. 이 숫자는 두 엔진 사이의 가능한 모든 결과에 대한 확률 차이의 최댓값을 나타냅니다. 실질적인 관점에서, 이는 만약 당신이 두 엔진을 구별하기 위한 특정 테스트를 실행한다면, 최선의 테스트가 약 59%의 확률로 성공할 것임을 의미합니다. 이는 임의의 단일 문장이 서로 다를 직접적인 확률이라기보다는, 두 엔진을 구별할 수 있는 정도를 나타내는 척도입니다.

이 연구는 또한 왜 그들이 서로 다른지에 대해서도 밝혀냈습니다. 때때로 한 엔진은 다른 엔진이 불가능하다고 간주한 단어를 선택하여(이것을 '지원 불일치(support mismatch)'라고 합니다) 거리가 급증하기도 했습니다. 또 다른 경우에는 같은 단어를 선택했지만 서로 다른 확률을 할당하기도 했습니다. 저자들은 또한 시스템의 '노이즈'가 엔진 구성에 따라 변한다는 점을 관찰했습니다. 예를 들어, 엔진에 256개의 질문을 동시에 처리하도록 요청하면 노이즈가 증가하여 측정이 더 흐릿해졌습니다. 하지만 그들의 새로운 '다단계(multilevel)' 방법은 이를 처리할 만큼 영리했습니다. 같은 질문을 여러 번 던지고 결과를 평균함으로써, 그들은 노이즈를 걸러내고 진정한 거리를 찾아낼 수 있었습니다.

요약

이 논문은 두 AI 엔진이 서로 다른 하드웨어에서 실행되거나 서로 다른 소프트웨어 기술을 사용하더라도, 우리가 두 엔진이 얼마나 다른지 신뢰할 수 있게 측정할 수 있다고 결론짓습니다. 저자들은 최종 답변만을 볼 수 있다면 이 작업이 매우 어렵지만, 내부 숫자를 엿볼 수 있다면 훨씬 쉬워진다는 것을 증명했습니다. 가장 중요한 것은, 그 숫자들이 다소 노이즈가 섞여 있더라도 새로운 통계적 기법을 사용하면 정확한 그림을 얻을 수 있다는 것을 보여주었다는 점입니다.

이것이 중요한 이유는 AI가 보편화됨에 따라, 기업들이 자신들의 '저렴한' 버전의 모델이 실제로 '비싼' 버전과 동일한지, 혹은 더 빠른 새로운 소프트웨어 업데이트가 비밀리에 AI의 동작 방식을 바꾸고 있지는 않은지 알 필요가 있기 때문입니다. 저자들은 이러한 보이지 않는 차이를 측정할 수 있는 자를 제공함으로써, 우리가 두 AI가 같다고 말할 때 실제로 그렇다는 것을 보장해 주었습니다. 그들의 코드는 누구나 사용할 수 있도록 공개되어 있으며, 이 복잡한 수학을 AI의 미래를 위한 실용적인 도구로 바꾸어 놓았습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →