← 최신 논문
🤖 AI

The Silent Vote: Improving Zero-Shot LLM Reliability by Aggregating Semantic Neighborhoods

본 논문은 제로샷 LLM 분류에서 재규격화 편향과 이로 인한 '침묵 투표'를 완화하기 위해 의미적 이웃으로부터 점수를 집계하는 추론 시 방법인 시맨틱 소프트맥스를 소개함으로써, 여러 벤치마크 전반에 걸쳐 모델 보정 및 판별 성능을 크게 향상시킵니다.

원저자: Sanket Badhe, Priyanka Tiwari, Deep Shah

게시일 2026-05-12
📖 4 분 읽기☕ 가벼운 읽기

원저자: Sanket Badhe, Priyanka Tiwari, Deep Shah

원본 논문은 CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/)에 따라 공공 도메인에 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

"침묵하는 투표"라는 제목의 논문을 쉬운 언어와 일상적인 비유로 설명합니다.

문제: "침묵하는 투표"와 "강제 선택"

재능 쇼에서 심사위원이라고 상상해 보세요. 선택할 수 있는 세 가지 특정 카테고리가 있습니다: 기쁨, 슬픔, 또는 분노.

"흥분"과 "자부심"이 섞인 듯한 공연을 지켜봅니다. 당신의 머릿속에서는 "흥분"과 "자부심"이 "기쁨"과 매우 가까운 친척이라는 것을 알고 있습니다. 사실, 당신의 뇌는 이 친척 단어들이 그 느낌을 매우 잘 표현한다고 판단하여 그 단어들에게 작은 "투표"를 부여합니다.

하지만 이 특정 재능 쇼의 규칙은 엄격합니다: 당신은 세 가지 공식 카테고리 중 하나만 적을 수 있습니다. "흥분"이나 "자부심"을 적을 수는 없습니다.

기존 방식 (결함):
현재의 AI 시스템에서는 모델이 공식 목록에서 하나만 선택하도록 강요받을 때, 마치 그 "친척" 투표들을 무시하는 심사위원처럼 행동합니다. "흥분"과 "자부심"에 대한 증거를 폐기하고 다음과 같이 말합니다. "글쎄, 저것들을 고를 수 없으니, 남은 것 중 '기쁨'이 가장 가깝다면, 그것은 100% 기쁨이 틀림없다!"

이 논문은 이를 **재규격화 편향 (Renormalization Bias)**이라고 부릅니다. "침묵하는 투표들"(동의어 및 관련 단어) 을 폐기함으로써 AI 는 인위적으로 과도한 자신감을 갖게 됩니다. 정답이 실제로는 다소 모호함에도 불구하고 AI 는 99% 확신으로 답을 알고 있다고 생각합니다. 이는 AI 가 언제 추측하고 있는지 알지 못하기 때문에 위험합니다.

해결책: "시맨틱 소프트맥스 (Semantic Softmax)" (이웃 감시단)

저자들은 시맨틱 소프트맥스라는 새로운 방법을 제안합니다. 이 방법은 친척들을 무시하는 대신, 똑똑한 이웃 감시단처럼 작동합니다.

작동 원리:

  1. 온전한 이웃을 살펴보기: AI 에게 딱 하나의 레이블만 선택하도록 강요하기 전에, 이 방법은 공식 목록에 없더라도 AI 가 생각했던 "상위 50 개" 단어를 살펴봅니다.
  2. 투표 수집: "이봐, '흥분'이라는 단어가 '기쁨'과 비슷해? '자부심'은 '기쁨'과 비슷해?"라고 묻습니다.
  3. 증거 통합: AI 가 "흥분"과 "자부심"을 생각했다면, 그 "투표들"을 "기쁨" 더미에 추가합니다.
  4. 결과: "나는 100% 확신해, 이건 기쁨이야"라고 말하는 대신, AI 는 "대부분 기쁨이지만 관련된 것일 가능성도 높으니, 약 75% 정도만 확신해"라고 말할 수 있습니다.

이것은 AI 를 보정된 (calibrated) 상태로 만듭니다. AI 는 자신이 불확실할 때 이를 인정하므로, 실제 세계에서의 활용에 훨씬 더 신뢰할 수 있습니다.

비유: 붐비는 방

AI 의 두뇌를 사람 (단어) 으로 가득 찬 붐비는 방이라고 생각하세요.

  • 옛 방식: 당신은 AI 에게 "빨간색, 파란색, 또는 초록색 모자를 쓴 사람들만 들어라"라고 말합니다. 만약 방 안에 있는 보라색 모자 (동의어) 를 쓴 사람이 가장 크게 소리를 지르고 있다면, AI 는 그 사람을 무시합니다. 그런 다음 빨간색 모자를 쓴 사람을 보고 "보라색이 사라졌으니, 빨간색이 가장 크게 소리를 지르고 있겠지!"라고 말합니다. AI 는 실제로 빨간색이 얼마나 크게 소리를 지르는지에 대해 스스로에게 거짓말을 하고 있는 것입니다.
  • 새로운 방식 (시맨틱 소프트맥스): AI 는 보라색 모자를 쓴 사람을 듣고, 그들이 빨간색 모자를 쓴 사람과 같은 이야기를 하고 있음을 깨닫고, 그 목소리를 빨간색 더미에 추가합니다. 이제 AI 는 사이드라인에서 이를 지지하던 모든 목소리를 포함하여 "빨간색" 그룹이 실제로 얼마나 크게 소리를 지르는지 정확하게 측정할 수 있습니다.

논문에서 발견한 점

연구자들은 두 가지 다른 데이터셋을 사용하여 두 가지 인기 있는 AI 모델 (Qwen-3 과 Phi-4-mini) 에서 이 방법을 테스트했습니다:

  1. GoEmotions: 인간의 감정 ("감탄", "자부심", "기쁨" 등) 에 관한 데이터셋.
  2. Civil Comments: 독성 댓글에 관한 데이터셋으로, 사람들이 어떤 것이 독성인지 아닌지에 대해 종종 이견을 보이는 (모호한) 경우를 다룹니다.

결과:

  • 과도한 자신감 감소: 새로운 방법은 "기대 보정 오차 (Expected Calibration Error)"를 극적으로 줄였습니다. 이는 AI 가 자신의 확신에 대해 얼마나 자주 틀리는지를 측정하는 점수입니다. 간단히 말해, AI 는 실제로 추측하고 있을 때 천재인 척하는 것을 멈췄습니다.
  • 정확도 향상: 놀랍게도, 불확실성을 인정함으로써 AI 는 실제로 올바른 레이블을 선택하는 능력이 향상되었습니다. 서로 다른 카테고리 사이를 구분하는 능력이 개선되었습니다.
  • 인간과 유사한 불확실성: 사람들이 이견을 보인 경우 (예: "이 댓글은 무례한 것일까, 아니면 단순히 직설적인 것일까?"), 새로운 방법을 사용한 AI 는 단호한 "예" 또는 "아니오"를 강요하는 대신, 평균적인 인간의 의견과 일치하는 점수를 제시했습니다.

중요한 한계점 (논문이 말하는 바)

저자들은 이 방법이 무엇을 하지 않는지 주의 깊게 지적합니다:

  • 편향을 위한 마법 같은 해결책이 아님: AI 의 두뇌가 특정 집단에 대해 편향되어 있다면, 이 방법은 그것을 고치지 않습니다. 단지 AI 가 자신의 불확실성에 대해 더 정직하게 만들 뿐입니다.
  • "Zero-Shot" 작업을 위한 것임: 이는 AI 를 재학습시키지 않고 목록에서 레이블을 선택하도록 요청하는 상황에 맞춰 설계되었습니다. 긴 이야기나 에세이를 생성하는 용도가 아닙니다.
  • 약간의 시간이 소요됨: 이 방법은 AI 가 "이웃" 단어를 찾기 위해 약간의 추가 계산을 수행해야 하므로, 한 번에 수백만 단어를 처리할 경우 속도가 약간 느려질 수 있습니다.
  • 좋은 "지도"가 필요함: 이 방법은 AI 가 단어 간의 관계를 잘 이해하고 있는지에 의존합니다. AI 의 내부 언어 지도가 엉망이라면 이 방법은 혼란을 겪을 수 있습니다.

결론

이 논문은 우리가 AI 에게 짧은 목록에서 단일 레이블을 선택하도록 강요할 때, 실수로 AI 가 얼마나 확신하는지에 대해 거짓말하게 만든다고 주장합니다. 유사한 단어들의 "침묵하는 투표"를 AI 가 계산하도록 허용함으로써, 우리는 AI 를 더 정직하고, 더 정확하며, 답을 모를 때 이를 아는 데 더 능숙하게 만들 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →