Using AI Agents to Automate Black-Box Audits of Personalization Algorithms at Scale
이 논문은 고정된 페르소나를 가진 생성형 AI 에이전트를 활용하여 사용자 속성이 콘텐츠 전달에 어떻게 영향을 미치는지에 대한 확장 가능한 반사실적 분석을 가능하게 하는 블랙박스 개인화 알고리즘 감사용 새로운 프레임워크를 소개하며, X(구 트위터)에 대한 대규모 연구를 통해 해당 플랫폼의 알고리즘이 양극화된 콘텐츠를 증폭시키고 사용자의 이데올로기에 따라 인구통계학적 신호에 다르게 반응한다는 것을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 거대하고 투명한 도서관에 들어선다고 상상해 보세요. 그곳의 책들은 당신이 누구냐에 따라 서가에서 계속 바뀝니다. 만약 당신이 젊은 사람처럼 보인다면 다른 책들을 보게 될 것이고, 나이가 지긋한 사람처럼 보인다면 또 다른 책들을 보게 될 것입니다. 만약 당신이 도시에서 사는 것처럼 보인다면 도시용 책들을 보게 되고, 시골에서 사는 것처럼 보인다면 시골용 책들을 보게 됩니다. 이것이 바로 소셜 미디어 알고리즘이 작동하는 방식입니다. 알고리즘은 당신의 프로필과 과거 행동을 바탕으로 당신에게 보여줄 콘텐츠를 선별합니다.
문제는 이 도서관들이 '블랙박스'라는 점입니다. 우리는 사서의 규칙 노트를 볼 수 없습니다. "왜 나에게 이것을 보여주었나요?"라고 물을 수도 없습니다. 우리는 오직 일어나는 현상을 지켜볼 수 있을 뿐입니다.
이 논문은 실제 인간 대신 AI 에이전트(첨단 AI로 구동되는 컴퓨터 프로그램)를 사용하여 커튼 뒤를 엿볼 수 있는 영리하고 새로운 방법을 소개합니다.
기존 방식의 문제점
이전에는 연구자들이 두 가지 방식으로 이 도서관들을 감사(audit)하려고 시도했으나, 두 방법 모두 결함이 있었습니다.
- 실제 인간: 실제 사람들을 고용하여 앱을 사용하게 했습니다. 이는 현실적이었지만, 비용이 많이 들고 통제가 어려우며 규모를 키우기가 불가능했습니다. "만약 이 25세 청년이 사실은 55세라면 어떻게 될까?"라고 묻고 싶어도, 새로운 사람을 찾아야 하기 때문에 쉽게 물을 수 없습니다.
- 스크립트 기반 봇 (소셜 풋/Sock Puppets): 단순한 컴퓨터 스크립트로 제어되는 가짜 계정을 만들었습니다. 이는 저렴하고 확장성이 좋았지만, '평면적'이었습니다. 이들은 엄격한 규칙(예: "고양이를 보면 '좋아요'를 클릭하라")을 따르는 로봇처럼 행동했습니다. 이들은 생각하거나 자연스럽게 반응하지 않았기에, 도서관은 이들을 실제 사람처럼 대우하지 않았습니다.
새로운 해결책: "AI 배우 (AI Actors)"
연구진은 생성형 AI 에이전트를 사용하는 프레임워크를 만들었습니다. 이들을 로봇이 아니라 연극 속의 배우라고 생각하십시오.
- 대본 (페르소나): 연극이 시작되기 전, 각 배우에게는 상세한 캐릭터 대본이 주어집니다. 이 대본은 그들의 나이, 성별, 위치, 교육 수준, 정치적 신념을 정의합니다. 이 대본은 미국의 인구 조사와 퓨 리서치 센터(Pew Research Center)의 실제 데이터를 기반으로 합니다.
- 연기: 배우가 화면에서 게시물을 보면, AI는 자신의 캐릭터 대본에 근거하여 그것에 대해 '생각'하고 무엇을 할지(좋아요, 팔로우, 읽기 또는 무시 등) 결정합니다. 이것은 경직된 규칙이 아니라 자연스러운 반응입니다.
- 실험: 연구진은 이 1,120명의 배우를 만들었습니다. 이들은 14가지의 서로 다른 '캐릭터 유형'(페르소나)으로 그룹화되었습니다. 각 캐릭터 유형에 대해 여러 개의 복제본(replica)을 만들었습니다.
- 반전: 모든 '캐릭터 A'의 복제본들은 똑같이 행동합니다. 하지만 연구진은 일부의 경우 단 하나의 눈에 보이는 세부 사항만을 변경했습니다. 예를 들어, 어떤 복제본은 25세라고 말하고 다른 복제본은 55세라고 말할 수 있습니다. 혹은 한 명은 뉴욕에 살고, 다른 한 명은 텍사스에 산다고 설정할 수 있습니다.
이러한 설정은 연구진에게 강력한 질문을 던질 수 있게 해줍니다: "만약 똑같은 사람(똑같은 행동 양식을 가진)이 자신의 나이나 위치를 바꾼다면, 도서관은 그에게 다른 책들을 보여줄 것인가?"
사례 연구: 2024년 대선
연구팀은 2024년 미국 대통령 선거 직후, 소셜 미디어 플랫폼인 **X (구 트위터)**에 이 1,120명의 AI 배우들을 배치했습니다. 그들은 플랫폼의 '추천(For You)' 피드와 '팔로잉(Following)' 피드(시간순 피드)를 비교하며 관찰했습니다.
그들이 발견한 결과는 다음과 같습니다.
1. 알고리즘은 드라마와 우파적 관점을 좋아한다
표준적인 시간순 목록과 비교했을 때, '추천' 피드는 다음과 같은 콘텐츠를 현저히 더 많이 보여주었습니다:
- 독성 콘텐츠 (Toxic content): 못되거나 화가 난 듯한 게시물.
- 양극화된 콘텐츠 (Polarizing content): 집단 간의 대립을 부추기는 게시물.
- 정치적 콘텐츠: 특히 우파 쪽으로 치우친 콘텐츠.
- 놀라운 점: 알고 \text{는 좌파 성향의 콘텐츠를 크게 증폭시키지 않았습니다. 사실, 우파 성향의 사용자들에게는 알고리즘이 좌파 성향의 콘텐츠를 적극적으로 '억제'했습니다.
2. "에코 체임버(Echo Chamber)"는 비대칭적이다
알고리즘은 단순히 모든 사람에게 우파적인 내용을 더 많이 보여주는 것에 그치지 않았습니다. 사용자마다 다르게 취급했습니다:
- 좌파 성향 사용자들은 독성 콘텐츠의 급증을 경험했습니다 (기준치보다 80% 더 많음).
- 우파 성향 사용자들은 우파 성향의 콘텐츠가 급증했지만, 이들의 독성 콘텐츠는 크게 변하지 않았습니다.
- 결과: 우파 성향의 사용자들은 반대 의견이 숨겨지는 일방적인 버블 속에 놓인 반면, 좌파 성향의 사용자들은 분노와 독성 콘텐츠가 넘쳐나는 환경에 놓였습니다.
3. 인구통계학적 특성은 중요하지만, 복잡하다
연구진은 사용자의 눈에 보이는 나이, 성별, 위치를 바꾸는 것이 무엇을 보게 되는지에 영향을 미치는지 테스트했습니다.
- 평균적인 결과: 모든 사용자를 통틀어 보면, 이러한 세부 사항을 바꾸는 것은 큰 영향을 미치지 않는 것처럼 보였습니다. 평균적인 효과는 거의 0에 가까웠습니다.
- 진짜 이야기: 특정 캐릭터 유형을 자세히 들여다보았을 때, 결과는 매우 격렬했습니다. 어떤 신호(예: 나이)를 바꾸는 것이 어떤 캐릭터에게는 더 많은 독성 콘텐츠를 보게 만들 수 있지만, 다른 캐릭터에게는 독성 콘텐츠를 덜 보게 만들 수도 있었습니다.
- 비유: 온도 조절기가 단순히 방의 온도에 따라 열을 올리거나 내리는 것이 아니라, 그 사람이 누구냐에 따라 어떤 사람에게는 열을 올리고 어떤 사람에게는 열을 내리는 상황을 상상해 보십시오. 만약 집 전체의 '평균' 온도를 측정한다면, 온도 조절기가 전혀 작동하지 않는다고 생각할 수도 있습니다. 하지만 각 방을 들여다본다면, 그것이 매우 구체적이고 서로 다른 일을 하고 있다는 것을 알게 될 것입니다.
이것이 왜 중요한가
이 논문은 알고리즘을 감사할 때 단순히 "평균적인" 결과만을 봐서는 안 된다고 결론짓습니다. 데이터를 평균화해 버리면, 알고리즘이 서로 완전히 다른 방식으로 다양한 집단의 사람들을 대한다는 사실을 놓치게 됩니다.
이러한 AI "배우"들을 사용함으로써, 연구자들은 이제 수천 명의 실제 인간을 모집하거나 멍청한 스크립트 기반의 봇에 의존하지 않고도, 알고리즘이 특정 특성에 어떻게 반응하는지 정확히 확인하기 위한 통제된 실험을 수행할 수 있습니다. 이는 우리가 온라인에서 보는 것을 결정하는 보이지 않는 규칙들을 이해하기 위한 새로운 도구입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.