← 최신 논문
💬 NLP

Where Norms and References Collide: Evaluating LLMs on Normative Reasoning

이 논문은 규범 기반 참조 해결(norm-based reference resolution)에 대한 대규모 언어 모델을 평가하기 위한 인간 검증 테스트베드인 SNIC을 소개하며, 최첨단 모델들조차 상황적이고 체화된 상호작용에 필수적인 암묵적 사회 규범을 일관되게 식별하고 적용하는 데 어려움을 겪고 있음을 밝힌다.

원저자: Mitchell Abrams, Kaveh Eskandari Miandoab, Felix Gervits, Vasanth Sarathy, Matthias Scheutz

게시일 2026-02-04
📖 4 분 읽기☕ 가벼운 읽기

원저자: Mitchell Abrams, Kaveh Eskandari Miandoab, Felix Gervits, Vasanth Sarathy, Matthias Scheutz

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 친구와 함께 북적이는 주방에 있다고 상상해 보세요. 당신은 "머그컵 하나만 줄래?"라고 묻습니다. 카운터 위에는 세 개의 머그컵이 있습니다. 하나는 아주 깨끗하고, 나머지 두 개는 말라붙은 커피 얼룩이 묻어 있습니다.

당신이 인간이라면, 친구가 깨끗한 머그컵을 건네줄 것이라는 사실을 즉각적으로 알게 됩니다. 당신은 친구에게 "깨끗한 거로 줘"라고 굳이 말할 필요가 없습니다. 왜냐하면 당신들은 하나의 암묵적인 규칙을 공유하고 있기 때문입니다: 다른 사람의 더 더러운 컵을 쓰지 않는다. 이 보이지 않는 규칙이 바로 **사회적 규범(social norm)**입니다.

**"규범과 참조가 충돌하는 곳(Where Norms and References Collide)"**이라는 제목의 이 논문은 다음과 같은 간단하지만 까다로운 질문을 던집니다: 현대의 AI(특히 거대 언어 모델 또는 LLM)는 명시적으로 설명해주지 않아도 당신이 어떤 머그컵을 의미하는지 알아낼 수 있을까?

다음은 일상적인 비유를 사용한 연구 결과의 요약입니다:

문제: AI의 "사각지대"

LLM을 도서관의 거의 모든 책을 읽은 매우 똑똑한 학생이라고 생각해보세요. 그들은 상식 퀴즈를 풀거나 논리 퍼즐을 해결하는 데 능숙합니다. 하지만 이 학생은 실제로 주방이나 도서관, 혹은 레스토랑에서 살아본 적이 없습니다. 그들은 "머그컵"이 무엇인지는 알지만, 그 장소에서 사람들이 어떻게 행동하는지에 대한 미묘하고 성문화되지 않은 규칙들은 배우지 못했습니다.

연구진은 이 결여된 기술을 **규범 기반 참조 해결(Norm-Based Reference Resolution, NBRR)**이라고 부릅니다. 이는 혼란스러운 장면을 보고, "사회적 문법(행동 규칙)"을 이해하며, 누군가가 가리키는 대상이 무엇인지 추측하는 능력입니다.

실험: "규범 함정" 만들기

이를 테스트하기 위해 연구팀은 SNIC(Situated Norms in Context, 맥락 속의 상황적 규범)라는 데이터셋을 만들었습니다.

  • 설정: 청소, 음식 서빙, 정리 정돈과 같은 일상적인 과업을 포함하는 9,000개의 짧은 이야기(vignettes)를 제작했습니다.
  • 함정: 모든 이야기에서 모호해 보일 수 있는 질문을 던졌습니다. 예를 들어, "접시를 집어 들어라"라고 합니다.
    • 시나리오 A: 방을 청소 중인 상황입니다. AI는 더러운 접시를 집어야 합니다.
    • 시나리오 B: 방에 음식을 서빙 중인 상황입니다. AI는 깨끗한 접시를 집어야 합니다.
  • 인간 테스트: AI를 신뢰하기 전에, 210명의 실제 사람들에게 이 퍼즐을 풀게 했습니다. 사람들은 대부분 "규범적인" 답(예: "청소 중이니까 더러운 것을 집어야 한다")에 동의했으며, 이는 인간들에게 규칙이 명확하다는 것을 증명했습니다.

결과: 지도가 없으면 길을 잃는 AI

연구진은 여러 최상위 AI 모델(GPT-4, Llama, Phi 등)을 이 9,000개의 이야기에 대해 테스트했습니다. 결과는 마치 한 번도 방문해 본 적 없는 도시를 항해하려는 GPS를 보는 것과 같았습니다:

  1. "추측 게임"의 실패: AI에게 단순히 이야기만 주고 적절한 물체를 고르라고 했을 때, AI는 고전했습니다. AI는 정답률이 평균적으로 절반에도 미치지 못했습니다. AI는 "청소 작업"과 "서빙 작업" 사이의 차이를 구분하지 못하는 경우가 많았는데, 이는 작업 뒤에 숨겨진 규범을 이해하지 못했기 때문입니다.
  2. "형식 언어"의 막다른 길: 연구진은 모호함을 제거하기 위해 장면을 매우 정밀하고 수학적인 설명(Prolog라는 코드 언어 사용)으로 제공해 보았습니다. 놀랍게도, 이것은 큰 도움이 되지 않았습니다. 이는 운전자에게 완벽한 지도를 주면서도 "당신은 여전히 교통법규를 모른다"라고 말하는 것과 같습니다. AI는 사실(facts)은 알았지만, 여로 *도로의 규칙(rules of the road)*은 알지 못했습니다.
  3. "치트 시트"의 성공: 연구진이 AI에게 따라야 할 규칙 목록을 명시적으로 제공했을 때(예: "규칙: 청소 작업 중에는 더러운 물건을 선택한다"), AI의 성능은 급격히 향 정도로 치솟았습니다. AI는 갑자기 정답을 맞히기 시작했습니다.

핵심 요약

이 논문은 현재의 AI 모델이 훌륭한 백과사전이지만 서툰 이웃과 같다고 결론짓습니다.

  • 그들은 머그컵이 무엇인지 압니다.
  • 그들은 청소가 무엇인지 압니다.
  • 하지만 명시적으로 규칙을 알려주지 않는 한, 사회적 맥락 속에서 사람들이 머그컵을 어떻게 사용하는지는 본질적으로 알지 못합니다.

저자들은 이것이 하나의 "사각지대"라고 주장합니다. AI 모델은 텍스트로 학습되지만, 사회적 규범은 종종 암묵적(글로 쓰여 있지 않음)이며 물리적으로 근거(실제 사물 및 행동과 연결됨)를 두고 있기 때문입니다. 이러한 규칙들은 책에 명확하게 기술되지 않는 경우가 많으므로, AI는 이를 놓치게 됩니다.

이것이 왜 중요한가 (논문에 따르면)

논문은 만약 우리가 로봇이나 AI 비서가 실제 가정이나 사무실에서 일하기를 원한다면, 이들이 이러한 보이지 않는 사회적 규칙을 배워야 한다고 제안합니다. 현재의 AI는 당신이 음료를 달라고 요청했을 때 더러운 머그컵을 건네줄 수도 있는데, 이는 그들이 "멍청해서"가 아니라, "우리는 그렇게 하지 않는다"라는 암묵적인 사회적 계약을 배우지 못했기 때문입니다.

요약하자면: 이 논문은 AI가 일상의 "불문율"을 이해하는지 확인하기 위한 테스트를 구축했습니다. 연구 결과, AI는 매우 똑똑하지만, 우리가 그 불문율에 의존하여 무언가를 말할 때 그것을 추측하는 데는 현재 매우 서투르며, 이는 우리가 먼저 규칙을 상세히 설명해주지 않는 한 그렇다는 것을 발견했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →