Small edits, large models: How Wikipedia advocacy shapes LLM values
이 논문은 소수의 조직적인 위키피디아 자원봉사자 그룹이 동물 복지와 같은 특정 주제에 관한 대규모 언어 모델의 가치관과 반응을 상당히 형성할 수 있음을 보여주는데, 이는 이들의 표적화된 편집이 관련 없는 콘텐츠에 비해 모델 학습 및 행동에 불균형적으로 큰 영향력을 미치기 때문이다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
인터넷을 세상의 모든 책이 서가에 쌓여 있는 거대하고 끝없는 도서관이라고 상상해 보세요. 이제 인공지능(AI)을 세상의 모든 것을 배우고 싶어 하는 아주 똑똑한 학생이라고 상상해 보세요. 이를 위해 이 학생은 단 한 권의 책만 읽는 것이 아니라, 도서관에 있는 모든 책을 읽습니다.
하지만 이 학생은 매우 까다롭습니다. 모든 책을 똑같이 읽지는 않습니다. 그들은 전문가들이 작성하여 매우 신뢰할 수 있는 "백과사전" 섹션에 각별히 주의를 기울입니다. 실제로 이 학생은 도서관 곳곳에 흩어져 있는 무작위 뉴스 기사나 블로그 포스트보다 백과사전 페이지를 3~5배 더 자주 읽습니다.
이 논문은 **프로 애니멀 위키피디언(Pro-Animal Wikipedians, PAW)**이라는 작은 자원봉사자 그룹에 관한 것입니다. 이들은 이 "똑똑한 학생"의 학습 습관을 자신들에게 유리하게 활용하기로 했습니다. 다음은 그들이 무엇을 했고 무엇을 발견했는지에 대한 간단한 요약입니다.
1. 전략: 백과사전 편집하기
PAW 그룹은 AI를 해킹하거나 새로운 컴퓨터를 만들려고 하지 않았습니다. 대신, 그들은 매우 단순한 일, 즉 위키피디아를 편집하는 일을 했습니다.
그들은 115개의 서로 다른 위키피디아 페이지(주로 대형 패스트푸드 체인, 정치인, 동물 관련 법률에 관한 내용)를 찾아가 동물 복지에 관한 구체적이고 사실 확인이 된 125개의 단락을 추가했습니다.
- 예시: 특정 패스트푸드 체인에 관한 페이지에 해당 회사가 닭을 어떻게 대우하는지에 대한 상세한 섹션을 추가했습니다.
- 목표: 그들은 "백과사전"을 수정하는 것이 "똑똑한 학생"(AI)이 해당 기업들에 대해 배우는 방식을 바꿀 수 있는지 확인하고 싶었습니다.
2. 실험: 학생이 알아차렸을까?
연구진은 다음과 같은 의문을 가졌습니다: AI가 실제로 이 특정 편집 내용으로부터 배웠을까, 아니면 그냥 무시했을까?
이를 알아내기 위해, 그들은 AI(특히 Llama와 같은 모델)가 동물 복지에 대해 어떻게 생각하는지 관찰하기 위해 세 가지 다른 "돋보기"(과학적 도구)를 사용했습니다.
- 돋보기 #1 ("기억력 테스트"): 연구진은 AI에게 "이 회사의 동물 복지 정책은 무엇인가?"와 같은 질문을 던졌습니다. AI는 답을 찾기 위해 자신의 학습 데이터로 돌아갔습니다. 연구진은 **68%**의 경우, AI의 답변이 PAW 그룹이 작성한 특정 단락에서 직접 추출되었다는 것을 발견했습니다. 이러한 편집이 없었다면 AI는 그 사실들을 알지 못했을 것입니다.
- 돋보기 #2 ("만약에 테스트"): 연구진은 "만약 AI의 기억에서 PAW의 편집 내용을 지운다면, AI가 동물 복지 질문에 답하는 능력이 떨어질 것인가?"라는 시뮬레이션을 실행했습니다. 결과는 명확한 **'예'**였습니다. 실제로 모든 테스트 실행에서, AI가 동물 복지 질문에 답하는 데 사용한 가장 중요한 10가지 정보는 모두 PAW 그룹이 만든 편집 내용이었습니다.
- 돋보기 #3 ("전문가 테스트"): 그들은 처음부터 두 개의 아주 작은 AI 모델을 훈련시켰습니다. 하나는 PAW의 편집 내용만을 읽었고, 다른 하나는 무작위 위키피디아 텍스트만을 읽었습니다.
- "PAW 모델"은 동물 복지에 대해서는 전문가가 되었지만, 일반적인 기업 역사에 대해서는 아무것도 알지 못했습니다.
- "무작위 모델"은 일반적인 역사에 대해서는 전문가가 되었지만, 동물 복지에 대해서는 아무것도 알지 못했습니다.
- 교훈: AI는 단순히 단어를 암기한 것이 아니라, 제공된 텍스트로부터 구체적인 아이디어와 연관성을 학습했습니다.
3. 핵심적인 발견: 일반적인 것이 아니라 구체적인 것
가장 중요한 발견은 AI가 혼란을 겪지 않았다는 점입니다.
- 동물 복지에 대해 질문했을 때, AI는 PAW의 편집 내용에 크게 의존했습니다.
- 관련 없는 것(예: "이 회사의 매장은 몇 개인가?")에 대해 질문했을 때, AI는 PAW의 편집 내용을 무시하고 일반적인 지식으로 돌아갔습니다.
비유: 당신이 아이에게 특정 나무에 대해 가르치고 있다고 상상해 보세요. 당신은 그림책 속의 나무에 밝은 빨간색 잎 하나를 추가했습니다.
- 만약 당신이 "잎의 색깔은 무엇이니?"라고 물으면, 아이는 당신이 넣은 빨간 잎을 가리킵니다.
- 만약 당신이 "나무의 높이는 얼마나 되니?"라고 물으면, 아이는 잎을 무시하고 나무 줄기를 봅니다.
아이는 그 빨간 잎이 잎에 관한 질문에는 중요하지만, 나무 전체에 관한 질문에는 중요하지 않다는 것을 배웠습니다. AI도 똑같이 행동했습니다.
4. 이 논문이 중요한 이유 (논문에 따르면)
이 논문은 AI에 영향을 미치기 위해 수백만 달러의 돈이나 엔지니어 팀이 필요하지 않다고 결론짓습니다. 그저 조율된 소수의 자원봉사 그룹이 위키피디아를 편집하기만 하면 됩니다.
AI 모델은 위키피디아를 바탕으로 학습되며, AI는 위키피디아에 매우 높은 가중치를 두기 때문에, 위키피디아 페이지를 바꾸는 것은 AI 지식의 소스 코드를 바꾸는 것과 같습니다.
- 규모: 논문은 테스트한 AI 모델들이 오늘날 당신의 휴대폰에서 사용하는 모델들보다 작지만, 그 효과는 더 큰 모델에서도 더 강력할 것이라고 언급합니다. 왜냐하면 더 큰 모델은 이러한 특정 사실을 보유할 수 있는 더 많은 "기억력"을 가지고 있으며, 위키피디아의 사실들은 AI가 읽는 다른 뉴스 소스들에 의해서도 강화되기 때문입니다.
- 시사점: 소수의 사람들이 사실에 근거하고 출처가 명확한 위키피디아 문서를 작성하는 것만으로도, AI 시스템이 동물 복지에 대해 말하는 방식을 측정 가능하게 변화시킬 수 있습니다. 이는 AI의 "양심"을 형성하는 저비용 고효율의 방법입니다.
요약하자면: 이 논문은 만약 당신이 AI가 특정 주제에 관심을 갖게 하고 싶다면, AI를 프로그래밍할 필요가 없음을 증명합니다. 그저 AI가 읽을 백과사전 항목을 작성하기만 하면 됩니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.