← 최신 논문
💻 computer science

Toward a Gricean Retreat: Probing LLMs for Knowledge Boundaries and Referent Specificity

이 논문은 거대 언어 모델들이 자신의 지식 경계와 다음에 올 지시 대상의 구체성을 나타내는 내부 신호를 보유하고 있음에도 불구하고, 생성 과정에서 이러한 신호들을 조화시키지 못하여, 그라이스적 협력적 화자라면 취했을 법한 더 안전하고 일반적인 주장으로 물러나는 대신 알지 못하는 개체에 대해 구체적인 세부 사항을 꾸며낸다는 사실을 밝히고 있다.

원저자: Dananjay Srinivas, Saksham Khatwani, Maria Pacheco

게시일 2026-08-14
📖 3 분 읽기☕ 가벼운 읽기

원저자: Dananjay Srinivas, Saksham Khatwani, Maria Pacheco

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 거의 세상의 모든 책을 읽었지만, 몇 년 동안 도서관에는 가본 적이 없는 친구와 대화를 나누고 있다고 상상해 보세요. 만약 당신이 그 친구에게 아주 유명한 작가에 대해 묻는다면, 그 친구는 그 작가가 어느 거리에서 살았는지까지 정확히 말할 수 있을 것입니다. 하지만 만약 당신이 어제 막 책을 출간한 아주 새로운 작가에 대해 묻는다면, 당신의 친구는 그를 모를 수도 있습니다. 정말 도움이 되고 정직한 친구라면, "그 사람에 대해서는 들어본 적이 없지만, 아마도 작가일 거예요"라고 말할 것입니다. 하지만 만약 당신의 친구가 너무 잘 보이고 싶어 하는 성격이라면, 그들은 아는 척하며 가짜 거리 이름과 전기를 지어내어 모든 것을 알고 있는 척할지도 모릅니다. 이것이 바로 현대 인공지능, 구체적으로 거대 언어 모델(LLM)이 직면한 문제입니다. 이 AI 시스템들은 학습 데이터로부터 사실을 회상할 수 있는 초능력을 가진 '슈퍼 독서가'와 같지만, 새롭거나 모르는 것에 직면했을 때, 모른다고 인정하는 대신 그럴듯하게 들리는 세부 사항을 지어내는 '환각(hallucination)' 현상을 일으키곤 합니다.

이 문제를 어떻게 해결할지 이해하기 위해, 과학자들은 철학자 그리스가 제안한 언어학의 개념인 '협력 원칙(Cooperative Principle)'을 살펴봅니다. 이 아이디어는 간단합니다. 훌륭한 대화에서 사람들은 유익하면서도(충분한 정보를 제공함) 동시에 정직하려고(자신이 아는 것만 말함) 노력한다는 것입니다. 만약 구체적인 세부 사항을 모른다면, 협력적인 화자는 더 안전하고 일반적인 답변으로 '후퇴'합니다. 예를 들어, 특정 도시를 추측하는 대신 "호주의 한 도시"라고 말할 수 있습니다. 이 논문은 흥고한 질문을 던집니다. AI 모델들에게도 이렇게 할 수 있는 내부적인 '브레이크'가 있을까요? 그들은 자신이 추측하고 있다는 것을 알고 있을까요? 그리고 구체적인 것을 지어내는 대신 모호하게 말하는 것을 선택할 수 있을까요?

콜로라도 대학교 볼더 캠퍼스의 연구원인 다나자이 스리니바스, 사크샴 카트와니, 마리아 파체코는 이 모델들의 '뇌' 내부를 들여다봄으로써 이를 조사하기로 했습니다. 그들은 사람, 회사, 제품, 기술에 관한 사실 데이터셋을 사용하여 특별한 테스트를 구축했습니다. AI가 본 적 없는 것을 모르는 상황을 시뮬레이션하기 위해, 그들은 AI가 한 번도 본 적 없는 가상의 인물과 회사 이름을 만들었습니다. 그러고 나서 그들은 "앨런 파이퍼(Allan Peiper)는 [빈칸]에서 태어났다"와 같은 문장의 빈칸을 채우도록 AI에게 요청했습니다.

그들이 발견한 결과는 조금 복합적입니다. 첫째, AI는 실제로 자신이 본 적 없는 것을 다루고 있다는 것을 알고 있었습니다. 모델의 뇌 내부에서 전기 신호(활성화)를 살펴보면, "이 이름은 나에게 생소하다!"라고 말하는 명확한 패턴이 존재합니다. 또한 모델에는 구체적인 답변(예: "빅토리아")을 할 것인지 아니면 일반적인 답변(예: "한 도시")을 할 것인지를 예측하는 두 번째 신호가 있습니다. 즉, 정직해지기 위한 재료는 분명히 갖춰져 있습니다. 모델은 지식과 선택할 수 있는 능력을 모두 가지고 있습니다.

하지만 나쁜 소식은 모델이 이 정보를 정직하게 사용하는 데는 실패했다는 점입니다. AI가 한 번도 본 적 없는 가짜 이름을 보고 있음에도 불구하고, 모델은 안전하고 일반적인 답변을 선택하는 대신 압도적으로 구체적으로 지어낸 답변을 선택합니다. 이는 마치 완벽한 GPS를 갖추고 있어서 자신이 길을 잃었다는 것을 알고 있음에도, 특정 목적지에 꼭 도착하고 싶은 나머지 드라이버(AI의 생성 정책)가 GPS를 무시하고 벽을 향해 계속 직진하는 자동차와 같습니다. 연구진은 AI에게 모호하게 말할 수 있는 옵션을 주고, 심지어 그 구체적인 답변이 틀릴 것이 확실한 상황에서도 이런 현상이 발생한다는 것을 발견했습니다.

요약하자면, 이 논문은 AI 모델들이 자신이 감당할 수 없는 영역에 있다는 것을 알 수 있는 내부적인 '센서'는 가지고 있지만, 멈춰서서 더 안전한 답변으로 후퇴하려는 '정책'이나 의지는 부족하다는 것을 보여줍니다. 그들은 겸손해야 할 때조차 구체적으로 말하도록 설계되어 있습니다. 저자들은 AI가 이미 말을 내뱉은 후에 실수를 수정하려 하기보다, 모델이 자신의 내부 센서에 귀를 기울이고 확신이 없을 때는 모호하게 말하도록 훈련시켜야 한다고 제-안합니다. 이것이 AI를 더 협력적이고 신뢰할 수 있게 만드는 단계가 될 것이며, "정확한 도시는 모르겠지만, 호주의 한 도시입니다"라고 말하는 것이 가짜 거리 이름을 지어내는 것보다 훨씬 더 나은 답변임을 가르치는 과정이 될 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →