← 최신 논문
💬 NLP

Prompting from the bench: Large-scale pretraining is not sufficient to prepare LLMs for ordinary meaning analysis

본 논문은 대규모 사전 학습만으로는 대규모 언어 모델이 신뢰할 수 있는 법적 "일반적 의미" 분석을 수행하기에 충분하지 않다고 주장하는데, 이는 실증적 증거가 이러한 모델의 결론이 약간의 프롬프트 변화에 대해 견고하지 않으며 인간의 판단과 단지 중간 정도의 상관관계만 보임을 드러내어 고위험 사법적 맥락에서 권위 있는 용도로는 부적합함을 보여주기 때문이다.

원저자: Abhishek Purushothama, Junghyun Min, Brandon Waldon, Nathan Schneider

게시일 2026-05-15
📖 3 분 읽기☕ 가벼운 읽기

원저자: Abhishek Purushothama, Junghyun Min, Brandon Waldon, Nathan Schneider

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

법정에서 판사가 법의 모호한 단어가 일반인에게 실제로 어떤 의미를 지니는지 파악하려고 노력하는 상황을 상상해 보십시오. 예를 들어, 계약 조항인 "조경"이 트램펄린 설치까지 포함하는 것일까요? 전통적으로 판사들은 "이웃 사람은 어떻게 생각할까?"라고 자문하거나 사전에서 단어를 찾아보곤 했습니다.

최근 일부 법률 전문가와 판사들은 이 질문에 답하기 위해 대규모 언어 모델 (LLM), 즉 채팅봇을 구동하는 동일한 종류의 인공지능에 의존하기 시작했습니다. 그 아이디어는 다음과 같습니다: "인터넷에 존재하는 거의 모든 글을 읽은 AI 이라면, 일반인들이 단어를 어떻게 사용하는지 정확히 알고 있을 테니, 맞지 않겠습니까?"

이 논문은 그 아이디어가 사실인지 검증하기 위해 수행된 방대하고 신중한 실험입니다. 연구자들은 판석에 앉은 "엄격한 비평가" 역할을 하며, 이러한 AI 모델들을 엄격한 스트레스 테스트에 노출시켰습니다. 그들이 발견한 바를 간단히 설명하면 다음과 같습니다:

1. "고장 난 시계" 문제

연구자들은 15 개의 다양한 AI 모델 (작은 모델부터 거대한 GPT-4 까지) 에게 138 가지의 서로 다른 보험 시나리오가 보장되는지 여부를 판단하도록 요청했습니다.

  • 결과: 일부 AI 모델은 "No"에 고정된 고장 난 시계와 같았습니다. 이야기가 어떤 내용이었든 상관없이, 그들은 매번 똑같은 답변을 내놓았습니다.
  • 비유: 기상 예보관에게 "비 오나요?"라고 물었다고 상상해 보십시오. 만약 그들이 맑은 날, 흐린 날, 폭설이 내리는 날 모두 "네"라고 답한다면, 그들은 실제로 하늘을 보고 있는 것이 아닙니다. 그저 대본을 반복하고 있을 뿐입니다. 몇몇 AI 모델은 정확히 이렇게 행동하여 법적 사건의 구체적인 세부 사항을 실제로 "읽지" 못했습니다.

2. 프롬프팅의 "마술"

연구자들은 그다음 마술을 시도했습니다. 똑같은 질문을 했지만, 질문하는 방식만 바꾸어 보았습니다.

  • 시나리오 A: "존이 보장되나요? 예 또는 아니오?"
  • 시나리오 B: "존이 보장되지 않나요? 예 또는 아니오?"
  • 시나리오 C: "존이 보장된다는 데 동의하십니까?"
  • 결과: AI 의 답변은 극적으로 뒤바뀌었습니다. 질문의 한 버전에서는 AI 가 존이 보장된다는 데 90% 확신을 보일 수 있었습니다. 하지만 "아니오"를 추가하거나 옵션 순서를 바꾸는 등 질문을 약간만 다르게 하면, AI 는 존이 보장되지 않는다는 데 90% 확신을 보일 수 있었습니다.
  • 비유: 이는 쓰는 종이의 색상에 따라 마음을 바꾸는 제안함과 같습니다. 모델을 한 가지 방식으로 질문하면 "예"라고 말합니다. 같은 질문이라도 "아니오" 옵션을 먼저 제시하면 "아니오"라고 말합니다. 이는 변호사가 원하는 답변을 주는 프롬프트를 찾아다니게 할 수 있음을 의미하며, 진실을 얻는 것이 아니라 원하는 답을 구하는 것이 될 수 있습니다.

3. 언어를 구사하지 못하는 "통역사"

연구자들은 AI 의 답변과 실제 인간 (일반적인 영어 화자) 이 실제로 어떻게 생각했는지를 비교했습니다.

  • 결과: AI 와 인간은 보통 정도로만 일치했습니다. 심지어 가장 우수한 AI 모델 (GPT-4 등) 들조차 확률 점수를 정확히 해석하는 방법을 알고 있다면 약 83% 의 정확도를 보였습니다. 하지만 실제 법정에서는 점수를 엿볼 수 없으며, 오직 답변만 받습니다.
  • 비유: 군중의 생각을 알려달라고 통역사를 고용했다고 상상해 보십시오. 통역사가 83% 의 정확도로 맞춘다면 그건 좋은 것처럼 들립니다. 하지만 법적 사건에서는 6 번 중 1 번을 틀리는 것은 재앙입니다. 이는 GPS 가 83% 의 확률로 올바른 도시로 데려다주지만, 나머지 17% 에는 늪에 떨어뜨리는 것과 같습니다.

결론

이 논문은 AI 가 방대한 양의 데이터 (대규모 사전 학습) 를 읽었다고 해서 일반인의 사고방식을 이해한다는 뜻은 아니다고 주장합니다.

저자들은 이러한 AI 모델들이 현재 법적 사건의 최종 결정권으로 사용되기에는 너무 취약하고 신뢰할 수 없다고 결론 내립니다. 그들은 아직 "일반적 의미"에 대한 권위 있는 출처가 아닙니다. 판사가 그들의 작업을 확인하지 않고 이에 의존한다면, 고장 난 시계나 글꼴 크기에 따라 마음을 바꾸는 제안함을 신뢰하는 것과 다를 바 없습니다.

요약하자면: AI 는 유창한 화자이지만, 단어의 의미가 일반인에게 무엇을 의미하는지 결정하는 데 있어서는 신뢰할 수 있는 사고 주체가 아닙니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →