← 최신 논문
💬 NLP

Language Model Maps for Prompt-Response Distributions via Log-Likelihood Vectors

이 논문은 로그-가능도 벡터를 기반으로 언어 모델 간의 조건부 분포를 비교하고 모델 간 거리를 KL 발산으로 근사하는 지도를 구축하여, 모델 속성, 작업 수행 능력, 프롬프트 수정의 체계적 변화 및 조합 효과를 분석할 수 있는 새로운 프레임워크를 제안합니다.

원저자: Yusuke Takase, Momose Oyama, Hidetoshi Shimodaira

게시일 2026-03-20
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yusuke Takase, Momose Oyama, Hidetoshi Shimodaira

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🗺️ 1. 핵심 아이디어: "AI 모델들의 지도 만들기"

생각해 보세요. 수백 개의 서로 다른 AI 모델이 있습니다. 어떤 모델은 수학에 강하고, 어떤 모델은 창의적인 글을 잘 쓰고, 어떤 모델은 사실에 충실하죠. 이들을 어떻게 비교할까요?

이 논문은 각 AI 모델을 특정 질문 (프롬프트) 에 대한 답변의 확률을 측정하여, 마치 지도 위의 한 점으로 표시하는 방법을 제안합니다.

  • 비유: 각 AI 모델을 '여행자'라고 상상해 보세요.
    • 우리가 "일본의 수도는 어디인가요?"라고 물었을 때, 각 여행자가 "도쿄"라고 답할 확률이 얼마나 높은지 측정합니다.
    • 이 확률들을 모아보면, 각 여행자가 지도의 어디에 서 있는지 알 수 있습니다.
    • 가까운 점들은 서로 비슷한 성향 (예: 같은 회사 모델, 비슷한 학습 데이터) 을 가진 AI 들이고, 멀리 떨어진 점들은 전혀 다른 성향을 가진 AI 들입니다.

🔍 2. 기존 방식과의 차이: "무조건적인 말" vs "질문에 대한 답변"

기존 연구들은 AI 가 "무조건적으로" 어떤 말을 할 확률을 측정했습니다. (예: "하늘은 파랗다"라는 문장 자체의 확률)
하지만 이 논문은 **"질문 (프롬프트) 이 주어졌을 때, 어떤 답변을 할 확률"**을 측정합니다.

  • 기존 방식: AI 가 혼자 떠드는 모습을 관찰하는 것.
  • 이 논문의 방식: AI 에게 "질문"을 던지고, 그 대답을 관찰하는 것.
    • 이는 실제 우리가 AI 를 사용할 때 (채팅, 질문 답변) 의 상황과 정확히 일치합니다.

🧭 3. 주요 발견 1: "질문 바꾸기"의 효과 (Prompt Shift)

이 지도의 가장 신기한 점은 질문 (프롬프트) 을 살짝 바꿀 때, AI 의 위치가 어떻게 움직이는지를 보여준다는 것입니다.

  • 실험: "일본의 수도는?"이라는 질문에 대해,
    1. 그냥 묻기 (Base)
    2. "단계별로 생각해보자"라는 문장을 덧붙이기 (CoT)
    3. 질문을 두 번 반복하기 (Repeat)
      를 해보았습니다.
  • 결과: AI 모델들의 위치가 지도 위에서 일관되게 움직였습니다.
    • 예를 들어, "단계별로 생각해보자"를 붙이면 모든 모델이 지도의 'A 방향'으로 이동합니다.
    • 질문을 반복하면 'B 방향'으로 이동합니다.

🧩 4. 주요 발견 2: "레고 블록처럼 쌓기" (Additive Compositionality)

이게 가장 놀라운 부분입니다. 질문을 바꿀 때의 이동은 레고 블록처럼 단순하게 합쳐진다는 것입니다.

  • 비유:
    • A 방향 이동 (단계별 생각) + B 방향 이동 (질문 반복) = AB 방향 이동 (단계별 생각 + 질문 반복)
    • 마치 "빨간색 레고 + 파란색 레고 = 보라색 레고"처럼, 두 가지 질문 변경을 합치면 그 효과가 단순히 더해져 나타납니다.
  • 의미: 우리는 아직 해보지 않은 복잡한 질문 조합을 만들어도, 개별 효과들을 더하기만 하면 AI 가 어떻게 반응할지 예측할 수 있습니다.

🧹 5. 잡음 제거: "PMI 벡터" (Training Data 찾기)

AI 모델은 학습한 데이터의 특징을 가지고 있습니다. 하지만 때로는 질문 자체의 특성 때문에 그 특징이 가려지기도 합니다.

  • 해결책: 연구진은 **PMI(점별 상호 정보량)**라는 개념을 도입했습니다.
    • 비유: AI 가 "무조건적으로" 좋아하는 말 (예: AI 가 자주 쓰는 관용구) 을 빼고, 오직 **"질문과 답변의 연결고리"**만 남긴 것입니다.
    • 이렇게 하면, **"어떤 AI 가 어떤 데이터로 학습되었는지"**를 더 명확하게 구분할 수 있습니다. 마치 안경을 써서 흐릿한 배경을 제거하고, AI 의 본질적인 학습 데이터를 선명하게 보는 것과 같습니다.

💡 요약: 이 연구가 왜 중요한가요?

  1. 비교의 표준: 수백 개의 AI 모델을 하나의 지도 위에 올려놓고, 누가 어디에 있는지, 누가 서로 비슷한지 한눈에 볼 수 있게 했습니다.
  2. 성능 예측: 지도상의 거리를 보면 모델의 성능이나 특징을 예측할 수 있습니다.
  3. 질문 조작의 예측: "질문을 이렇게 바꾸면 AI 의 답변이 어떻게 변할까?"를 수학적으로 예측할 수 있는 길을 열었습니다.

결론적으로, 이 논문은 AI 들의 복잡한 행동을 지도 위의 점과 화살표로 단순화하여, 우리가 AI 를 더 잘 이해하고 다룰 수 있게 도와주는 나침반을 제공했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →