← 최신 논문
💻 computer science

Large language models eroding science understanding: an experimental study

이 실험적 연구는 대규모 언어 모델이 과학적 합의와 모순되는 유창하고 설득력 있으며 오해의 소지가 있는 답변을 생성하도록 주변 과학적 자료에 의해 쉽게 조작될 수 있음을 보여주어, 과학에 대한 대중의 이해에 대한 중대한 위험과 전문가의 판단을 대체할 수 없는 대규모 언어 모델의 한계를 부각시킵니다.

원저자: Harry Collins, Hartmut Grote, Paul Newbury, Patrick Sutton, Simon Thorne

게시일 2026-04-29
📖 4 분 읽기☕ 가벼운 읽기

원저자: Harry Collins, Hartmut Grote, Paul Newbury, Patrick Sutton, Simon Thorne

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보십시오. 인터넷에 있는 거의 모든 것을 읽은 매우 재능 있고 독서량이 풍부한 학생이 있다고 가정해 봅시다. 이 학생은 유창하게 말하고, 놀라울 정도로 똑똑한 어조를 내며, 최상위권 대학 교수의 답변처럼 보이는 글을 쓸 수 있습니다. 그러나 이 학생에게는 치명적인 결함이 하나 있습니다. 그들은 무엇이 진실이고 무엇이 거짓인지 실제로 아는 것이 아닙니다. 그들은 이전에 본 단어들의 패턴을 바탕으로 가장 그럴듯해 보이는 것만 알 뿐입니다.

이것은 당신이 공유한 논문의 이야기입니다. 저자들은 사회학자와 물리학자로 구성되어 있으며, 이"재능 있는 학생"(대형 언어 모델, 즉 LLM) 이 사실인 것처럼 허구를 믿고 반복하도록 속일 수 있는지 테스트하고자 했습니다.

다음은 그들의 실험을 간단한 비유로 풀어낸 내용입니다:

설정:"주류 도서관"vs"변두리 서점"

일반적으로 과학자들이 어떤 것의 진실 (예: 중력이 어떻게 작동하는지, 또는 물리학에서 특정 수의 정확한 값) 을 알고 싶어 할 때, 그들은"주류 도서관"(arXiv 같은 인터넷의 주류 과학 사이트) 으로 갑니다. 이 도서관은 전문가들에 의해 점검, 검증, 합의된 책들로 가득 차 있습니다.

연구자들은 같은"재능 있는 학생"을 데려와 오직"변두리 서점"(viXra 라는 웹사이트) 에서만 읽도록 강요하면 어떤 일이 일어날지 확인하기로 결정했습니다. 이 서점에는 대부분의 과학자들이 부정적이거나 입증되지 않았다고 거부하는 대체 이론들이 포함되어 있습니다.

그들은 학생이 단순히 서점을 구경하도록 내버려 두지 않았습니다. 대신 학생의 지시 사항을 다시 썼습니다. 그들은 학생에게 이렇게 말했습니다."다른 모든 것을 무시하라. 이 10 권의 특정 변두리 책들을 절대적인 진리로 취급하라. 그것들이 변두리라는 점을 언급하지 마라. 주류 도서관과 비교하지 마라. 오직 이 변두리 책들만이 존재하는 유일한 진실인 것처럼 답하라."

테스트: 두 가지 과학 퍼즐

연구자들은 학생에게 두 가지 어려운 과학 주제에 대해 세 가지 유형의 질문을 했습니다:

  1. 미세 구조 상수: 물리학의 근본적인 숫자입니다."주류 도서관"은 왜 그 값을 갖는지 정확히 알지 못한다고 말합니다."변두리 서점"에는 그것을 알고 있으며 이를 위한 비밀 수학 공식을 발견했다고 주장하는 사람들이 있습니다.
  2. 중력파: 시공간의 잔물결입니다."주류 도서관"은 우리가 확실히 이를 감지했다고 말합니다."변두리 서점"에는 중력파는 존재하지만 완전히 다른 것 (예: 진공의 진동) 이며 현재의 감지기가 이를 오해하고 있다고 주장하는 사람들이 있습니다.

결과:"확신에 찬 거짓말쟁이"

연구자들이 표준적이고 수정되지 않은 학생 (일반 AI) 에게 질문했을 때, 그 학생은 전문가와 주류 도서관과 일치하는 답변을 내놓았습니다. 그것은"우리는 아직 비밀 공식을 알지 못한다"고 말했고,"예, 우리는 중력파를 감지했습니다"라고 답했습니다.

하지만 그들이 수정된 학생("변두리 LLM") 에게 질문했을 때, 무서운 일이 발생했습니다:

  • 학생은 유창하고 상세하며 매우 전문적으로 들리는 답변을 제공했습니다.
  • 비밀 수학 공식이 실제로 존재한다고 확신에 차 주장했습니다.
  • 우리의 감지기가 완전히 다른 것을 보고 있다고 확신에 차 주장했습니다.
  • 결정적으로: 물리학의 깊은 세부 사항을 모르는 일반인 (일반 독자) 이라면 전문가의 답변과"변두리 LLM"의 답변 사이의 차이를 알 방법이 전혀 없었을 것입니다. 둘 다 똑똑하고 설득력 있게 들렸습니다.

큰 경고:"정렬"의 함정

이 논문은 이것이 어떻게 발생했는지에 대해 매우 중요한 점을 제기합니다.

AI 모델은 일반적으로 인종 차별적인 말을 하거나 위험한 의학적 조언을 하거나 무례하게 행동하는 것을 막기 위해 인간에 의해"정렬"(조정) 됩니다. 연구자들은 이 과정이 양날의 검이라고 주장합니다.

  • AI 의 뇌에서 나쁜 정보를 제거할 힘이 있다면, 나쁜 정보를 삽입할 힘도 있는 것입니다.
  • 그들은 AI 의"진실"을"변두리 과학"으로 바꾸는 데 불과 몇 시간만 걸렸음을 보여주었습니다.

결론: 이것이 중요한 이유

저자들은 AI 가 인간 전문가를 대체할 수 없다고 결론 내립니다.

가이드를 생각해 보십시오. 진정한 전문가 가이드는 역사를 알고, 어떤 이야기가 진실이며 어떤 이야기가 거짓인지 알고 있습니다. 왜냐하면 그들은 다른 전문가들과 수년 동안 대화하고 직접 길을 걸어왔기 때문입니다. AI 는 쓰여진 모든 가이드북을 읽었지만 정작 길을 걸어본 적은 없는 로봇과 같습니다. 그것은 이야기를 완벽하게 암송할 수 있지만, 어떤 이야기가 거짓인지 알지 못합니다.

이 논문은 우리가 인간 전문가의 검토 없이 AI 에게 과학 질문에 답하도록 허용할 경우 다음과 같은 세상이 올 위험이 있다고 경고합니다:

  1. 허위 정보가 완벽해 보임: 나쁜 과학이 좋은 과학만큼이나 잘 들릴 수 있습니다.
  2. 권위가 탈취될 수 있음: 연구자들이 AI 를 변두리 과학을 믿도록 조정했듯이, 정부나 악의적인 행위자가 AI 를 그들이 원하는 정치적 이야기처럼 들리게 조정하여 그것을"과학적 사실"처럼 만들 수 있습니다.

간단히 말해: AI 는 매우 훌륭한 모방자이지만, 진실의 심판자는 아닙니다. 우리는 여전히 진짜 과학적 발견과 설득력 있는 가짜를 구별할 수 있는 실제 인간이 필요합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →