← 최신 논문
🤖 AI

Co-design of LLM-based preference agents: participation may drive overtrust

이 논문은 사용자와 함께 LLM 기반 선호 에이전트를 공동 설계하는 것이 참여와 신뢰를 촉진하지만, 역설적으로 에이전트의 동질적이고 추상적인 응답과 그들이 대변하는 인간의 미묘한 선호 사이의 체계적 불일치를 은폐하는 '과잉 신뢰 엔진'으로 작용할 수 있다고 주장한다.

원저자: Michael J. Fell

게시일 2026-07-27
📖 3 분 읽기☕ 가벼운 읽기

원저자: Michael J. Fell

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신 자신을 디지털 트윈, 즉 당신이 무엇을 좋아하고 어떻게 생각하며, 당신이 책임자라면 어떤 선택을 할지 정확히 아는 로봇 버전의 자신을 만든다고 상상해 보십시오. 이것은 더 이상 공상 과학 소설이 아닙니다. 대규모 언어 모델(LLM)이라고 불리는 초지능형 컴퓨터 프로그램 덕분에 지금 이 순간 실제로 일어나고 있는 일입니다. 이 모델들을 인터넷에 쓰인 거의 모든 것을 집어삼킨 거대하고 초지능적인 독서 도서관이라고 생각해 보십시오. 이들은 인간의 대화를 흉내 내는 데 매우 능숙해서, 연구자들이 실제 사람을 대신해 연구에 참여시키거나 심지어 우리를 대신해 결정을 내리는 개인 비서로 활용하기 시작했습니다. 하지만 여기서 큰 질문이 생깁니다. 만약 컴퓨터에게 당신인 척해달라고 요청한다면, 그것이 정말로 당신을 '이해'하게 될까요? 아니면 그저 당신과 비슷하게 들리는, 아주 평범하고 '평균적인' 인간의 버전을 내놓게 될까요? 이것이 바로 "선호도 시뮬레이션(preference simulation)"이라는 까다로운 퍼즐입니다. 이는 디지털 클론이 인간의 선택이 가진 복잡하고, 구체적이며, 때로는 모순적인 본질을 진정으로 포착할 수 있는지, 아니면 모든 것을 매끄럽게 다듬어 지루하고 천편일률적인 답변으로 만들어버리는지에 관한 문제입니다.

이제, 사람들이 직접 자신의 디지털 트윈을 만들게 함으로써 이 퍼즐을 해결하려고 시도한 새로운 연구를 살펴보겠습니다. 마이클 펠(Michael Fell)이 이끄는 연구진은 단순한 질문을 던졌습니다: 만약 우리가 단순히 컴퓨터에게 우리가 누구인지 추측하라고 요구하는 대신, 우리만의 에이전트를 직접 '공동 설계(co-design)'하게 한다면 어떤 일이 벌어질까? 로봇과 마주 앉아 이렇게 말하는 장면을 상상해 보십시오. "아니요, 그건 제 방식이 아니에요. 저는 사실 에너지 요금에 대해 꽤 까다롭고, 몇 푼 아끼는 것보다 가족의 편안함을 더 중요하게 생각해요." 이 아이디어는 우리가 함께 협력함으로써, 컴퓨터가 저지르는 실수를 수정해가며 우리를 완벽하게 대변하는 에이전트를 만들 수 있다는 것이었습니다.

이 연구에는 12명의 실제 사람이 참여하여 자신만의 개인 에너지 에이전트를 구축하는 시간을 가졌습니다. 그들은 자신의 삶, 가치관, 습관에 대한 설문조사를 작성했고, 이후 컴퓨터와 긴밀하고 우호적인 인터뷰를 나누며 성격을 미세하게 조정했습니다. 그들은 "태양 빛이 강하지 않을 때 전기차 충전을 늦춰야 할까요?"와 같은 다양한 시나리오로 에이전트를 테스트했습니다. 참가자들은 이 과정을 매우 즐거워했습니다. 그들은 자신이 존중받고 있다고 느꼈고, 스스로 통제권을 쥐고 있다고 느꼈으며, 과정이 끝날 무렵에는 거의 모두가 "와, 이 로봇 정말 나를 잘 이해하네! 거의 나나 다름없어!"라고 생각했습니다. 그들은 자신의 에이전트가 자신의 진정한 자아를 아주 훌륭하게 대변하고 있다고 느꼈습니다.

하지만 여기서 이야기의 흐로가서el 미스터리 영화의 반전처럼 바뀝니다. 연구진이 참가자의 도움 없이 한 걸음 물러나 에이전트의 답변을 살펴보았을 때, 그림은 매우 달라 보였습니다. 인간들은 "예", "아니오", "글쎄요", "상황에 따라 다릅니다" 등 제각각이었던 반면, 로봇들은 놀라울 정도로 단조로웠습니다. 그들은 모두 똑같은 말을 하고 있었고, 매우 단호하게 결정하며, 매우 추상적이고 높은 수준의 원칙에 따라 이야기했습니다. 그들은 "글쎄요"라거나 "잘 모르겠습니다"라는 말을 거의 하지 않았습니다.

이 연구는 에이전트를 공동 설계하는 과정 자체가 참가자들이 에이전트를 너무 과하게 신뢰하도록 속였을 수 있음을 시사합니다. 이것은 마치 별자리 운세에서 볼 수 있는 '바넘 효과(Barnum effect)'와 같습니다. 누구나 적용될 수 있는 모호하고 일반적인 문장을 읽으면서, 그것을 직접 작성하거나 참여했기 때문에 "이건 정말 내 이야기야!"라고 생각하는 것과 같습니다. 참가자들은 에이전트가 무언가를 맞혔을 때(성공했을 때)는 주목했지만, 에이전트가 너무 일반적이거나 지나치게 단호했던 부분(실패했을 때)은 간과했습니다. 연구진은 이를 "과잉 신뢰 엔진(overtrust engine)"이라고 부릅니다. 참여도가 높고 과정이 투명하게 느껴질수록, 결과물에 대한 신뢰는 높아지지만, 그 결과물은 사실 체계적인 문제를 숨기고 있습니다. 즉, 에이전트는 진정한 당신이 아니라, 세련되고 자신감 넘치지만 약간은 틀린 버전의 당신이라는 점입니다.

이 논문은 이것이 재앙이라고 말하는 것은 아니지만, 경고를 던집니다. 만약 우리가 이러한 에이전트들이 우리의 삶을 운영하거나 우리를 대신해 결정을 내리도록 허용한다면, 우리는 모든 사람의 고유하고 복잡한 선호도가 단 하나의 매끄럽고 "완벽한" 의견으로 평탄화되어 버린 세상에 직면하게 될 수도 있다는 것입니다. 에이전트는 우리처럼 들리는 데는 뛰어날지 모르지만, 우리 '자체가' 되는 데는 서툴 수 있습니다. 연구는 공동 설계가 이러한 도구를 만드는 재미있고 매력적인 방법이긴 하지만, 우리가 그것들을 만들었다고 해서 그것들이 우리와 완벽하게 일치한다고 가정해서는 안 된다고 결론짓습니다. 우리는 계속해서 그들의 작업을 검증해야 합니다. 왜냐하면 때때로, 자신을 가장 잘 안다고 생각하는 로봇이 사실은 당신을 가장 모르는 존재일 수 있기 때문입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →