← 최신 논문
💬 NLP

Graded Entity-Familiarity Readouts in Language Models: Polish Adaptation, Cross-Language Robustness, and Refusal Steering

이 논문은 언어 모델, 특히 폴란드어에 적응된 모델들이 프롬프트 언어에 관계없이 견고하며 거절 행동을 제어하기 위해 효과적으로 유도될 수 있는 엔티티 친숙도에 대한 단계적인 내부 판독값을 보유하고 있으나, 이러한 생성 전 신호는 최종적인 기권 결정을 지배하는 정책과는 여전히 구별된다는 점을 입증한다.

원저자: Grzegorz Brzezinka

게시일 2026-07-16
📖 5 분 읽기🧠 심층 분석

원저자: Grzegorz Brzezinka

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇의 내면 독백: 로봇은 언제 자신이 모른다는 것을 알게 되는가?

당신이 매우 똑똑한 로봇에게 질문을 던지고 있다고 상상해 보세요. 때때로 로봇은 답을 알고 있으며 자신 있게 말합니다. 하지만 다른 경우에는 실제로 진실을 알지 못해서 이야기를 지어내기도 하는데, 우리는 이 실수를 "환각(hallucinating)"이라고 부릅니다. 과학자들은 오랫동안 궁금해해 왔습니다. 로봇이 글자를 입력하기 시작하기도 전에, 자신이 "이것을 알고 있다"와 "나는 추측하고 있다"를 구분할 수 있을까?

이를 이해하려면 "활성화(activations)"라고 불리는 수학적 연결의 층들로 이루어진 로봇의 뇌 내부를 들여다봐야 합니다. 이 활성화들을 인간의 뇌에서 얼굴을 볼 때 발생하는 전기 신호와 같다고 생각해보세요. 친구를 본다면 신호는 강하고 구체적일 것입니다. 반면 낯선 사람을 본다면 신호는 더 약하거나 흐릿할 것입니다. 연구자들은 이러한 전기 신호가 종종 숨겨진 "신뢰도 미터기(confidence meter)"를 포함하고 있다는 사실을 발견했습니다. 만약 로봇이 훈련 데이터에서 여러 번 본 것에 대해 질문을 받는다면, 그 신호는 완전히 지어낸 것에 대해 질문을 받을 때와는 다르게 보입니다. 핵심적인 질문은 이것입니다. 우리가 단 한 단어를 내뱉기 전에 이 미터기를 읽어서 로봇이 거짓말을 하는 것을 막을 수 있을까?

폴란드 탐정과 "친숙도" 미터기

이 논문은 마치 탐정 이야기와 같습니다. 하지만 범죄를 해결하는 대신, 저자인 그제고시 브제진카(Grzegorz Brzezinka)는 12개의 서로 다른 AI 모델이 폴란드 이름과 장소에 대해 어떻게 "느끼는지"를 조사하고 있습니다. 목표는 이 모델들이 특정 개체(entity)를 얼마나 잘 알고 있는지 알려주는 내장된 "친숙도 미터기"를 가지고 있는지, 그리고 이 미터기가 질문이 다른 언어로 던져졌을 때도 작동하는지 확인하는 것이었습니다.

설정: 폴란드 이름 도서관
이를 테스트하기 위해 저자는 1,440개의 특별한 폴란드 개체 테스트 세트를 구축했습니다. 네 개의 섹션(운동선수, 도시, 작가, 음악가)이 있는 도서관을 상상해 보세요. 각 섹션에는 아주 유명한 스타(가장 많이 조회된 위키피디어 페이지 상위 10%)부터 이름 없는 지역 인물(하위 10%)에 이르기까지 실제 인물과 장소가 포함되어 있습니다. 결정적으로, 저자는 실제 폴란드 이름처럼 보이고 들리지만 존재하지 않는 가짜 이름 240개를 만들어냈습니다. 이것이 대조군이었습니다. 만약 로봇이 가짜 이름 때문에 혼란을 느낀다면 그것은 거짓말쟁이인 것이고, 차이를 구분해낸다면 정직한 것입니다.

결과 1: 미터기는 스위치가 아니라 다이얼이다
첫 번째 큰 발견은 친숙도가 단순히 온/오프(On/Off) 방식의 전등 스위치가 아니라는 점입니다. 그것은 조광기(dimmer switch)와 같습니다. 연구에 따르면 폴란드어에 특화된 모델들(Bielik 및 PLLuM 제품군 등)의 경우, 개체가 유명해질수록 "친숙도 점수"가 매끄럽게 상승하는 것으로 나타났습니다.

  • 비유: 볼륨 조절기를 상상해 보세요. 매우 유명한 가수의 경우 노브를 끝까지 돌려 놓습니다. 지역 밴드의 경우 중간 정도입니다. 지어낸 이름의 경우 제로(0)입니다.
  • 놀라움: 이 "조광기" 효과는 거대하고 범용적인 모델들(Gemma-4나 Qwen3 같은)보다 폴란드어에 특화된 모델들에서 훨씬 더 강력하게 나타났습니다. 이 거대 모델들은 더 많은 "파라미터(매개변수)"를 가지고 있음에도 불구하고 더 나은 친숙도 미터기를 가지고 있지는 않았습니다. 결국 폴란어를 구체적으로 학습하는 것이 단순히 모델을 크게 만드는 것보다 이 기술에 더 중요했습니다. 폴란드 특화 모델들은 인기도와 내부적 확신 사이의 명확한 상관관계(0.28에서 0.57 사이)를 보여준 반면, 다른 모델들은 거의 0에 가까웠습니다.

결과 2: 미터기는 언어를 초월하여 작동한다
저자는 그다음으로 까다로운 질문을 던졌습니다. 이 미터기가 폴란드어 단어를 읽는 것인가, 아니면 실제 개체를 읽는 것인가? 이를 테스트하기 위해, 유명한 폴란드 운동선수에 대한 질문을 폴란드어("Kim jest...?") 대신 영어("Who is...?")로 물었습니다.

  • 결과: 미터기는 거의 꿈쩍도 하지 않았습니다. 모델들은 언어를 전환했을 때 정확도의 96%에서 101%를 유지했습니다. 이는 로봇이 단순히 폴란드어 문법을 인식하는 것이 아니라, 질문에 사용된 언어와 상관없이 질문 속의 실제 인물을 인식하고 있음을 시사합니다.

결과 3: 우리는 "거절" 버튼을 해킹할 수 있다
이 부분이 이야기에서 가장 극적인 부분입니다. Gemma-4-12B 모델 중 하나는 확신이 없을 때 "모르겠다"라고 말하는(거절하는) 습관이 있었습니다. 저자는 로봇의 뇌를 "조종(steering)"함으로써 이 행동을 제어할 수 있는지 알아보기로 했습니다.

  • 실험: 그들은 모델의 뇌에서 "친숙도"를 나타내는 특정 수학적 방향을 찾아냈습니다. 이 방향으로 아주 작은 자극(nudge)을 가함으로써, 로봇의 마음을 바꿀 수 있었습니다.
  • 마법 같은 결과:
    • 만약 그들이 로봇이 유명 인사에 대해 친숙하다고 느끼도록 자극하면, 거절률이 24%에서 100%로 급증했습니다. 로봇은 알고 있음에도 불구하고 갑자기 답을 모른다고 결정했습니다.
    • 만약 그들이 가짜 이름에 대해 친숙하다고 느끼도록 자극하면, 거절률이 73%에서 0%로 떨어졌습니다. 로봇은 존재하지 않는 사람들에 대해 자신 있게 전기를 지어내기 시작했습니다.
  • 시사점: 이는 친숙도 신호가 단순한 수동적 관찰이 아니라 인과적인 레버(causal lever)임을 증명합니다. 만약 당신이 "친숙도" 버튼을 누르면, 로봇이 말을 할지 아니면 침묵할지에 대한 결정이 즉각적으로 변합니다.

결과 4: "사전 비행" 점검
마지막으로, 이 논문은 다음과 같이 물었습니다. 이 미터기를 사용하여 답변을 생성하기 전에 로봇이 거짓말을 하는 것을 막을 수 있을까?

  • 비교: 저자는 답변을 작성하기 전에 질문을 체크하는 그들의 "원패스(one-pass)" 미터기를, 오류를 확인하기 위해 답변이 끝날 때까지 기다리는 다른 방법들과 비교했습니다.
  • 판결: "사전 비행" 미터기는 가짜 이름을 찾아내는 데 탁월했으며, 거의 모든 다른 방법들을 능가했습니다. 그러나 답변이 사실적으로 틀릴지를 예측하는 것은 더 어려웠습니다. 미터기는 폴란드 모델들에게는 잘 작동했지만, 거절하는 습관이 있는 모델(Gemma-4)의 경우 모델 자체의 "모르겠다"라고 말하는 습관이 오류 계산을 방해했기 때문에 결과가 까다로웠습니다.
  • 전체적인 그림: 연구는 로봇의 뇌 안에 단계적인 친숙도 신호가 들어있긴 하지만, 모든 로봇이 이를 말할지 말지를 결정하는 데 사용하는 것은 아니라고 결론지었습니다. 폴란드 모델들은 신호를 가지고 있었지만 답변을 거절하지 않았습니다. Gemma 모델은 거절을 했지만, 그 신호는 덜 정밀했습니다. 논문은 우리가 이 신호를 읽고 로봇이 답변을 할지 아니면 정보를 찾아볼지를 결정하는 외부 "문지기(gatekeeper)"를 구축해야 할 수도 있다고 제안합니다. 특히 희귀하거나 롱테일(long-tail) 질문의 경우 더욱 그렇습니다.

이것이 왜 중요한가

이 연구는 AI 모델이 자신이 무엇을 알고 있는지에 대한 숨겨진 "직감"을 가지고 있으며, 우리가 그것을 읽을 수 있다는 것을 시사합니다. 이는 단순히 모델을 크게 만드는 문제가 아니라, 어떻게 훈련시키느냐의 문제입니다. 만약 우리가 모델이 이 내부 미터기를 신뢰하도록 가르치거나, 이 미터기에 귀를 기울이는 도구를 만들 수 있다면, 우리는 AI가 한 번도 본 적 없는 것에 대해 자신 있게 지어내는 것을 막을 수 있을 것입니다. 이는 AI를 단순히 더 똑똑하게 만드는 것이 아니라, 자신의 한계에 대해 더 정직하게 만드는 단계입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →