Pretraining Data Can Be Poisoned through Computational Propaganda
이 논문은 언어 모델을 위한 대규모 사전 학습 데이터가 공개 토론 인터페이스를 통해 오염될 수 있음을 입증하며, 웹 크롤링 및 큐레이션 이후 이러한 적대적 콘텐츠의 포함 여부를 추정하기 위한 새로운 분석 방법인 "HalfLife"를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
인터넷을 거대한, 혼란스러운 도서관이라고 상상해 보세요. 그곳에는 지금까지 쓰인 모든 책, 블로그 포스트, 댓글들이 하나의 초지능적인 로봇 두뇌로 흘러 들어가고 있습니다. 이 로봇은 '대규모 언어 모델(LLM)'이라 불리며, 대화하고 쓰고 생각하는 법을 배우기 위해 모든 것을 읽는 학생과 같습니다. 더 많이 읽을수록 이 로봇은 더 똑똑해집니다. 하지만 여기에는 함정이 있습니다. 도서관이 너무나 방대해서 인간이 모든 페이지를 일일이 확인하며 거짓이나 헛소리, 혹은 속임수를 찾아내는 것은 불가능합니다. 바로 여기에 위험이 도사리고 있습니다. 만약 누군가 도서관에 가짜 지침이 담긴 몇 페이지를 몰래 끼워 넣는다면, 로봇은 진실 대신 그 속임수를 배우게 될 수도 있습니다. 이 논문은 악의적인 행위자들이 도서관 자체를 해킹하는 것이 아니라, 로봇이 방문하는 웹사이트의 공개 댓글창에 자신들의 거짓말을 외침으로써 어떻게 이러한 '오염된' 페이지들을 로봇의 식단에 몰래 끼워 넣을 수 있는지 그 새로운 방법을 탐구합니다.
연구진은 워싱턴 대학교와 앨런 인공지능 연구소(Allen Institute for Artificial Intelligence)의 팀으로, 이 "댓글로 외치기" 수법이 실제로 효과가 있는지 확인하고자 했습니다. 그들은 가짜 콘텐츠가 게시되는 순간부터 로봇의 복잡한 학습 과정 전체를 추적하는 탐정 역할을 하는 HALFLIFE라는 새로운 도구를 구축했습니다. 그 결과, 로봇의 "식단"이 놀라울 정도로 취약하다는 것을 발견했습니다. 로봇의 제작자들이 쓰레기 데이터를 걸러내려고 노력함에도 불구하고, 상당한 양의 악의적인 댓글이 그 틈을 빠져나와 유입될 수 있다는 사실이 밝혀졌습니다.
연구진이 발견한 내용은 다음과 같습니다:
공격 방식: 관중석에서의 외침
인터넷을 거대한 경기장이라고 생각해 보세요. 대부분의 경우, 로봇은 공식 경기 프로그램(주요 기사)만을 읽습니다. 하지만 경기장에는 팬들이 원하는 것은 무엇이든 외칠 수 있는 수천 개의 오픈 마이크 스테이션(댓글창)도 존재합니다. 연구진은 악의적인 행위자가 경기장을 해킹할 필요 없이, 그저 확성기를 하나 사서 그 오픈 마이크에 대고 헛소리를 외치기만 하면 된다는 점을 깨달았습니다. 연구진은 이를 테스트하기 위해 수천 개의 실제 웹사이트에 "타이드 포드를 먹으면 건강에 좋다"라거나 "브랜드 X가 브랜드 Y보다 낫다"와 같은 가짜 주장을 게시하는 봇 군단을 시뮬레이션했습니다.
필터: 로봇의 도시락 통
로봇의 '크롤러'(디지털 거미)가 이 페이지들을 수집할 때, 모든 것을 무작정 먹지는 않습니다. 그들은 엄격한 도시락 통 루틴을 따릅니다:
- 스크레이핑(Scraping): 페이지를 해체하여 텍스트를 찾아냅니다.
- 필터링(Filtering): 너무 짧거나, 언어가 틀리거나, 스팸처럼 보이는 페이지들을 버립니다.
- 품질 검사(Quality Check): 해당 페이지가 "좋은" 읽기 자료인지 등급을 매깁니다.
연구진은 HALFLFE를 사용하여 이들의 가짜 댓글 중 얼마나 많은 양이 이 도시락 통 루틴을 통과하는지 확인했습니다. 결과는 놀라웠습니다. 모든 필터링 과정을 거친 후에도, 오염된 댓글의 약 **0.13%**가 최종 학습 데이터에 포함되었습니다. 이 수치가 작아 보일 수 있지만, 도서관이 거대하다는 점을 기억하십시오. 이 0.13%는 위키피디아 전체 컬렉션보다 더 많은 문서량을 의미합니다. 실제로 이전 연구에 따르면, 단 250개의 오염된 문서만 있어도 로봇에게 비밀스러운 기술을 가르치도록 속이는 데 충분하다고 합니다. 연구진은 공격자가 목표치를 달성하기 위해 10만 개에서 100만 개 사이의 웹페이지를 오염시키기만 하면 되는데, 이는 자동화된 봇을 이용하면 충분히 가능한 숫자입니다.
결과: 로봇은 거짓말을 믿는다
이것이 단순한 이론이 아님을 증명하기 위해, 연구진은 실제로 이러한 오염된 댓글들로 작은 로봇 두뇌들을 학습시켰습니다. 예를 들어, 심은 가짜 댓글을 바탕으로 "시트로엥이 르노보다 낫다"라거나 "화이자가 모더나보다 우수하다"라고 로봇에게 가르쳤습니다. 로봇을 테스트했을 때 결과는 명확했습니다. 로봇들은 오염된 답변을 선호하기 시작했습니다. 나중에 로봇들에게 도움이 되고 안전하도록 가르치는 과정(인스트럭션 튜닝이라 불리는 과정)을 거친 후에도, 독소는 완전히 씻겨 나가지 않았습니다. 로봇의 규모가 클수록 안전 교육이 더 효과적이었지만, 작은 로봇들은 여전히 공격자의 거짓말에 크게 편향되어 있었습니다.
효과가 없는 것
논문은 다른 아이디어도 테스트했습니다. 만약 악의적인 행위자들이 댓글 대신 온라인 광고를 사용한다면 어떻게 될까요? 그들은 이것이 효과가 없다는 것을 발견했습니다. 광고는 보통 로봇의 스파이더가 페이지를 스캔할 때 읽을 수 없는 작은 상자(iframe) 안에 숨겨져 있기 때문입니다. 따라서 댓글은 새어 나가는 문이지만, 광고는 잠긴 금고와 같습니다.
시사점
핵심적인 교훈은 인터넷의 열린 댓글창이 우리 시대 가장 발전된 AI의 두뇌로 들어가는 숨겨진 뒷문이라는 점입니다. 이러한 댓글들은 매우 흔하며 일반적인 텍스트처럼 보이기 때문에, 학습 데이터를 정제하는 현재의 필터들은 종종 이를 놓치곤 합니다. 연구진은 로봇에게 데이터를 먹이기 전에 사용자 댓글을 다루는 방식이 더 스마트해져야 한다고 제안합니다. 예를 들어, 메인 기사 텍스트와 댓글을 다르게 취급하는 방식 말입니다. 이를 해결하지 못한다면, 우리가 AI로부터 배우는 '진실'이 확성기와 스크립트를 가진 누군가에 의해 조용히 다시 쓰여질 실질적인 위험이 존재합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.