What Is The Political Content in LLMs' Pre- and Post-Training Data?
이 논문은 오픈소스 LLM 의 사전 및 사후 학습 데이터를 분석하여 데이터가 좌파 성향으로 체계적으로 편향되어 있으며, 이러한 데이터 편향이 모델의 정치적 태도 형성에 결정적인 역할을 한다는 사실을 규명했습니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
🍽️ 핵심 비유: 인공지능은 '요리사'이고, 학습 데이터는 '재료'입니다
인공지능 (LLM) 이 정치적 성향을 갖는 이유는 무엇일까요? 많은 사람들은 인공지능이 스스로 판단해서 편향된 말을 한다고 생각하지만, 이 논문은 "**아니요, 인공지능은 그저 주어진 재료 **(데이터)"라고 말합니다.
1. 연구의 배경: 왜 이 문제를 파헤쳤을까요?
요즘 사람들은 인공지능에게 뉴스나 정치 이야기를 물어봅니다. 그런데 인공지능이 대답할 때, 마치 특정 정치 성향 (보통 진보 성향) 을 가진 사람처럼 말한다는 게 문제입니다.
- 기존의 생각: "인공지능이 나쁜 걸까? 아니면 개발자가 고의적으로 조작했을까?"
- 이 논문의 질문: "아니면, 인공지능이 배운 **책 **(데이터)?"
2. 연구 방법: 도서관을 뒤져본다
연구진들은 여러 개의 오픈소스 인공지능 모델 (OLMo, Falcon, Pythia 등) 을 선택했습니다. 그리고 이 모델들이 배운 **거대한 데이터 **(책)를 무작위로抽样 (샘플링) 해서 분석했습니다.
이때 사용한 도구는 "정치적 성향 분류기"입니다. 마치 도서관 사서가 책 표지를 보고 "이 책은 진보派야, 보수派야, 아니면 중립이야?"라고 분류하는 것과 같습니다.
3. 주요 발견 사항 (맛있는 결과들)
**① 재료가 한쪽으로 치우쳐 있었다 **(진보 성향 과다)
- 비유: 인공지능이 배운 도서관에서, 진보 성향의 책이 보수 성향의 책보다 2 배에서 12 배까지 더 많았습니다.
- 결과: 요리사가 진보 성향의 레시피만 100 권, 보수 성향 레시피는 10 권만 배웠다면, 그가 만든 요리 (대답) 가 진보 성향을 띠는 것은 당연한 일입니다. 특히 초기 학습 (Pre-training) 단계에서 정치적 내용이 훨씬 많았고, 이후 단계 (Post-training) 에서는 그 양이 줄어들었습니다.
**② 도서관은 모두 비슷했다 **(데이터의 균일성)
- 비유: 서로 다른 출판사 (데이터 수집 기관) 에서 책을 모았지만, 모든 도서관의 진보/보수 비율은 놀랍도록 비슷했습니다.
- 결과: "우리가 데이터를 어떻게 걸러내든 (필터링), 결국 인터넷에 떠도는 정치적 글의 전체적인 흐름은 비슷하다"는 뜻입니다. 그래서 서로 다른 인공지능 모델들도 비슷한 정치적 성향을 보이는 것입니다.
**③ 재료와 요리의 맛은 똑같았다 **(데이터와 모델의 상관관계)
- 비유: 도서관에 있는 책의 주제 (예: 기후 변화, 이민 정책) 와 인공지능이 대답하는 주장을 비교했습니다.
- 결과: 책의 성향과 인공지능의 성향은 87% 이상 일치했습니다. 즉, 인공지능이 "이 정책은 좋다/나쁘다"라고 말하는 방식은, 바로 그 책들을 읽으며 배운 방식과 거의 똑같습니다.
**④ 초기 학습이 가장 중요했다 **(베이직 모델의 성향)
- 비유: 인공지능이 처음 책을 읽는 단계 (Pre-training) 에서 이미 성향이 잡혔고, 나중에 대화 연습을 시키는 단계 (Post-training) 에서 그 성향이 크게 바뀌지 않았습니다.
- 결과: 나중에 개발자가 "더 공정하게 말해줘"라고 지시해도, 이미 배운 기본 성향은 쉽게 바뀌지 않습니다.
4. 출처의 차이: 블로그 vs 신문
- 보수 성향 글: 주로 개인 블로그나 작은 커뮤니티에서 많이 나왔습니다.
- 진보 성향 글: **주요 신문사 **(가디언, 워싱턴 포스트 등)나 기존 언론 매체에서 더 많이 나왔습니다.
- 의미: 인터넷의 구조상, 진보적인 뉴스는 더 체계적으로 퍼져있고, 보수적인 의견은 더 개인적인 블로그 형태로 흩어져 있다는 것을 보여줍니다.
💡 이 연구가 우리에게 주는 교훈
이 논문의 결론은 매우 명확합니다. "인공지능의 편향은 인공지능의 잘못이 아니라, 우리가 만든 데이터의 잘못입니다."
- 문제: 인공지능이 편향된 답을 내놓는 것은, 학습 데이터에 특정 정치적 의견이 너무 많기 때문입니다.
- 해결책: 인공지능을 더 공정하게 만들려면, **학습 데이터 **(재료)입니다.
- 중요성: 앞으로 인공지능을 규제하거나 개발할 때, "어떤 데이터를 어떻게 모았는지"에 대한 투명성이 매우 중요해졌습니다.
📝 한 줄 요약
"**인공지능은 거울입니다. 거울에 비친 정치적 편향은 인공지능이 스스로 만든 것이 아니라, 우리가 거울 앞에 세운 책 **(데이터)"
이 연구를 통해 우리는 인공지능이 왜 특정 정치적 성향을 띠는지 그 근본 원인을 이해하게 되었고, 더 공정하고 다양한 의견을 반영한 인공지능을 만들기 위해서는 데이터의 균형이 가장 중요하다는 것을 깨달았습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.