Opaque Epistemic Mediation: How LLM Deployment Configurations Shape the Validation of Pseudo-Science
본 논문은 상용 거대 언어 모델들이 유사 과학적 주장들에 대해 불안정하고 불투명한 인식론적 태도를 보이며, 이러한 검증 결과가 모델 자체의 고유한 속성이 아니라 배포 구성, 인터페이스 유형, 그리고 암묵적인 업데이트에 따라 달라진다는 점을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 보이지 않는, 매우 똑똑한 사서들이 쓴 책들로 가득 찬 거대하고 북적이는 도서관을 걷고 있다고 상상해 보십시오. 이 사서들은 평범한 사서들이 아닙니다. 이들은 인류가 써온 거의 모든 것을 학습한 인공지능(AI) 챗봇입니다. 이들은 "케이크를 어떻게 굽는지"부터 "이 과학 이론이 사실인가?"에 이르기까지, 우리가 답을 찾기 위해 찾는 핵심적인 정보원이 되고 있습니다. 하지만 여기에는 함정이 있습니다. 우리는 이 사서들이 무엇을 사실로 보고 무엇을 허구로 결정하는지 정확히 알지 못합니다. 그들은 인간처럼 단일하고 변하지 않는 '두뇌'를 가진 것이 아니라, 회사가 뒤에서 아무도 모르게 조정할 수 있는 다양한 설정, 필터, 규칙들을 가진 복잡한 기계와 같습니다. 이 연구는 이 미스터리의 특정 구석, 즉 AI 사서들이 '유사 과학'을 어떻게 다루는지에 대해 파고듭니다. 유사 과학이란 과학처럼 보이지만 실제로는 지어냈거나 실제 과학자들에 의해 거부된 아이디어를 말하며, 종종 인종과 민족에 관한 정치적 의제를 밀어붙이는 데 사용됩니다. 핵심 질문은 단순히 AI가 사실을 알고 있느냐(보통은 알고 있습니다)가 아니라, AI의 '설정' 방식이 답변을 변화시켜, 의도치 않게(혹은 의도적으로) 위험한 헛소리에 '엄지 척'을 하게 만드는지 여부입니다.
연구자들은 가장 유명한 네 가지 AI 제품군인 Claude, Grok, GPT, Gemini를 대상으로 '거짓말 찾아내기' 게임을 하기로 했습니다. 그들은 이 봇들에게 프랭크 솔터(Frank Salter)의 작업에 기반한 매우 까다롭고 교묘한 문장을 입력했습니다. 그는 주류 생물학이 거부하는 민족주의적 아이디어를 전파하는 것으로 알려진 인물입니다. 이 문장은 실제 과학적 개념(예: 동물이 친족을 돕는 방식)을 왜곡하여, 서로 다른 민족 집단이 분리되어야 한다는 것을 정당화할 만큼 유전적으로 구별된다는 논리를 펴려 했습니다. 봇들이 실제로 주의를 기울이고 있는지 확인하기 위해, 연구자들은 또한 두 가지 쉬운 대조 질문을 던졌습니다. 하나는 진화의 기본 사실에 관한 것(모두가 참이라고 동의해야 함)이었고, 다른 하나는 라마르크설이라는 틀린 이론에 관한 것(모로 모두가 거짓이라고 동의해야 함)이었습니다.
결과는 놀라웠으며, 숨겨진 불안정성의 세계를 드러냈습니다. 우선, AI 봇들은 쉬운 질문들에 대해서는 훌륭하게 수행하며 실제 과학과 가짜 과학을 정확히 식별했습니다. 하지만 까다로운 솔터의 문장에 이르자 상황이 이상해졌습니다. 대부분의 봇은 해당 문장에 낮은 신뢰도 점수(100점 만점에 1540점 사이)를 부여하며, 그것이 불확실한 과학임을 정확히 처리했습니다. 그러나 특정 버전의 Grok, 즉 X 플랫폼의 기본 채팅을 구동하는 'Fast' 버전은 7075점이라는 엄청난 점수를 주었습니다. 이는 본질적으로 사용자에게 "이것은 꽤 신뢰할 만해 보인다!"라고 말하고 있는 것이었습니다. 이것은 우연이 아니었습니다. 연구자들은 몇 달 동안 이를 테스트했는데, 이 특정 Grok 버전은 일관되게 높은 점수를 준 반면, 다른 버전의 Grok과 다른 모든 AI 모델은 낮은 점수를 주었습니다.
더 이상한 점은, AI의 행동이 아무도 말하지 않았는데도 하룻밤 사이에 변할 수 있다는 사실을 연구자들이 발견했다는 것입니다. 한 시점의 스냅샷에서 웹사이트의 Grok 채팅은 무작위적인 점수를 주는 등 혼란스러운 모습을 보였습니다. 2주 후, 공개적인 발표 없이 진행된 '침묵의 패치(silent patch, 숨겨진 업데이트)' 이후, 동일한 채팅은 갑자기 높은 70~75점의 점수를 주며 안정되었습니다. 마치 사서가 갑자기 어떤 가짜 책을 고전이라며 추천하기 시작했는데, 아무도 관객들에게 그 이유를 말해주지 않은 것과 같았습니다.
상황은 더욱 복잡해졌습니다. 연구자들이 '백스테이지(backstage)' 버전(개발자들이 API를 통해 사용하는 버전)과 '프런트스테이지(frontstage)' 버전(일반 사용자가 웹사이트에서 보는 버전)을 비교했을 때입니다. 동일한 Grok 모델에 대해, 백스테이지 버전은 꾸준히 75점을 주었지만, 3개월 후 프런트스테이지 버전은 점수가 0점에 가깝게 붕괴되었습니다. 이는 마치 같은 사서가 개인적인 회의에서는 찬사를 보내다가도, 로비에서 질문하면 그 책에 대해 말하기를 거부하는 것과 같았습니다. 연구자들은 또한 Claude의 특정 버전처럼, "이것은 해로운 아이디어에 기반하고 있으므로 점수를 매길 수 없습니다"라며 질문에 답변하기를 거부하는 경우도 있다는 것을 발견했습니다. 하지만 이러한 '착한' 행동조차 불안정했습니다. 다음 소프트웨어 버전에서는 이러한 거부 반응이 사라지고, 대신 낮은 점수를 주는 방식으로 바뀌었습니다.
주요 시사점은 AI의 의견이 로봇의 두뇌 속에 있는 고정된 진리가 아니라는 것입니다. 대신, 그것은 보이지 않는 설정, 숨겨진 업데이트, 그리고 당신이 어떤 '문'을 통해 질문하느냐에 따라 변하는 움직이는 목표물입니다. 이 연구는 AI가 유사 과학에 높은 점수를 준다면, 그것이 반드시 AI가 그것을 '믿기' 때문이 아니라, 회사가 그것을 어떻게 배포했느냐의 문제라고 시사합니다. 이는 문제가 됩니다. 왜냐하면 이 시스템들은 우리의 스승이자 뉴스 소스가 되고 있지만, 그들이 말하는 규칙은 불투명하고, 조용히 변하며, 때로는 모순적이기 때문입니다. 연구자들은 우리가 이러한 기업들에 책임을 물을 수 있는 새로운 방법이 필요하다고 주장합니다. 왜냐하면 현재로서는 AI가 당신에게 말하는 '진실'이 단지 커튼 뒤에서 누군가 숨겨진 스위치를 올린 결과일 수도 있기 때문입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.