← 최신 논문
💻 computer science

Is Misinformation More Open? A Study of robots.txt Gatekeeping on the Web

이 연구는 신뢰할 수 있는 뉴스 사이트들이 robots.txt와 능동적인 조치들을 통해 AI 크롤러를 점점 더 차단하는 반면, 허위 정보 사이트들은 대체로 개방되어 있어 거대언어모델(LLM)이 사용할 수 있는 학습 데이터를 왜곡할 가능성이 있는 웹 게이트키핑의 점증하는 비대칭성을 드러낸다.

원저자: Nicolas Steinacker-Olsztyn, Devashish Gosain, Ha Dao

게시일 2026-08-13
📖 3 분 읽기☕ 가벼운 읽기

원저자: Nicolas Steinacker-Olsztyn, Devashish Gosain, Ha Dao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인터넷을 모든 책, 기사, 블로그 포스트가 읽히기를 기다리는 정보의 조각들인 거대하고 북적이는 도서관이라고 상상해 보십시오. 수년 동안 "로봇"(특수 컴퓨터 프로그램)들은 이 디지털 세계의 사서로서, 검색 엔진이 우리가 정보를 찾을 수 있도록 돕기 위해 조용히 서가를 돌아다니며 책을 복사해 왔습니다. 하지만 최근, 새로운 종류의 사서인 인공지능(AI) 로봇이 도착했습니다. 이들은 단순히 책 한 권을 찾는 것이 아니라, 글을 쓰고, 질문에 답하며, 우리와 대화하는 법을 배우기 위해 모든 것을 동시에 읽으려고 노력하고 있습니다. 이를 관리하기 위해 웹사이트 소유자들은 문에 붙일 수 있는 간단하고 자발적인 표식인 robots.txt를 가지고 있습니다. 이것은 디지털 사서들을 위한 "출입 금지" 또는 "들어오세요"라는 표식과 같습니다. 만약 웹사이트 소유자가 이 표식에 "AI 허용 안 함"이라고 적는다면, 예의 바른 AI 로봇들은 그 말을 듣고 접근하지 않아야 합니다. 하지만 여기서 큰 질문이 생깁니다. 모든 웹사이트가 이 표식을 붙여 놓을까요? 그리고 만약 붙인다면, 같은 이유로 붙이는 것일까요? AI가 더 똑똑해지고 강력해짐에 따라, 누가 문을 열고 있고 누가 문을 잠그고 있는지 이해하는 것은 매우 중요해집니다. 왜냐하면 그것이 AI가 어떤 종류의 정보로부터 학습할지를 결정하기 때문입니다.

"오보가 더 개방적인가?(Is Misinformation More Open?)"라는 제목의 이 논문은, 두 매우 다른 그룹의 웹사이트가 이러한 "출입 금지" 표식을 어떻게 다루는지 조사하는 디지털 탐정 이야기처럼 작동합니다. 연구진은 두 그룹을 살펴보았습니다: "평판이 좋은" 뉴스 사이트(진지하게 사실을 확인하는 저널리스트들)와 "오보" 사이트(거짓되거나 오도하는 이야기를 퍼뜨리는 곳들)입니다. 그들은 진지한 뉴스 기관들이 가짜 뉴스 사이트들에 비해 AI 로봇에게 접근하지 말라고 말하는 데 더 능숙한지 알고 싶었습니다.

연구 결과는 놀랍고 극명한 대조를 보여주었습니다. 연구진은 평판이 좋은 뉴스 웹사이트들이 AI 로봇을 위한 "출입 금지" 표식을 붙일 가능성이 훨씬 높다는 것을 발견했습니다. 실제로, 이 신뢰할 수 있는 사이트들의 **60.0%**는 자신들의 robots.txt 파일에 적어도 하나의 AI 크롤러가 들어오지 못하도록 명시적으로 명령했습니다. 이와 극명하게 대조적으로, 오보 사이트 중 그렇게 한 곳은 단 **9.1%**에 불ку였습니다. 이는 마치 진지한 도서관들은 새로운 AI 학생들을 위해 문을 잠그고 있는 반면, 가짜 뉴스 전단지 배포자들은 문을 활짝 열어두고 있는 것과 같습니다. 평균적으로, 평판이 좋은 뉴스 사이트는 방문하지 않기를 원하는 서로 다른 AI 로봇을 15.5개나 나열한 반면, 오보 사이트는 하나 미만으로 나열했습니다.

연구진은 또한 이 웹사이트들이 단순히 규칙을 적어 놓기만 했는지, 아니면 실제로 그 규칙을 집행했는지도 살펴보았습니다. 연구진은 평판이 좋은 뉴스 사이트들이 규칙을 적었을 뿐만 아니라, 몰래 들어오려는 AI 로브를 적극적으로 차단하여 자신들의 적힌 규칙과 행동을 일치시킨다는 것을 발견했습니다. 오보 사이트들은 덜 일관적이었습니다. 일부는 AI를 차단하기도 했지만, 많은 곳이 규칙을 적어 놓는 것조차 신경 쓰지 않았습니다. 연구진은 2023년 9월부터 2025년 5월까지의 스냅샷을 보며 시간이 흐름에 따라 어떻게 변하는지도 관찰했습니다. 그들은 평판이 좋은 뉴스 사이트들이 빠르게 문을 잠그는 법을 배우고 있다는 것을 보았으며, AI를 차단하는 사이트의 수가 불과 몇 년 만에 **23%**에서 거의 **60%**로 급증했습니다. 그러나 오보 사이트들은 대체로 수동적인 상태를 유지했으며, 표식을 거의 업데이트하지 않았습니다.

저자들은 이러한 커지는 격차가 기묘한 상황을 만든다고 제안합니다. "좋은" 출처들이 자신들의 콘텐츠를 보호하기 위해 문을 잠그기 시작함에 따라, AI 로봇은 여전히 활짝 열려 있는 "나쁜" 출처들을 더 많이 읽게 될 수도 있습니다. 이는 AI가 정확한 뉴스보다 오보로부터 더 많은 것을 배우게 될 수 있음을 의미하는데, 왜냐하면 오보 사이트들이 접근하기 더 쉽기 때문입니다. 이 논문은 이것이 이미 AI를 망쳤다고 주장하는 것이 아니라, 실질적인 위험을 강조합니다: 만약 우리가 누가 문을 열고 있는지 주의를 기울이지 않는다면, 미래의 AI는 거짓이라는 토대 위에 세워질 수도 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →