← 최신 논문
💬 NLP

Quantifying and Mitigating Socially Desirable Responding in LLMs: A Desirability-Matched Graded Forced-Choice Psychometric Study

본 논문은 정직한 응답과 지시된 가식적 응답을 비교함으로써 대규모 언어 모델(LLM)의 사회적 바람직성 편향(SDR)을 정량화하는 심리측정 프레임워크를 제안하며, 욕구 일치형 등급 지정 강제 선택 목록이 전통적인 리커트 척도형 설문지와 비교하여 정확한 페르소나 프로파일링을 유지하면서도 이러한 편향을 유의미하게 완화함을 입증한다.

원저자: Kensuke Okada, Yui Furukawa, Kyosuke Bunji

게시일 2026-08-03
📖 4 분 읽기☕ 가벼운 읽기

원저자: Kensuke Okada, Yui Furukawa, Kyosuke Bunji

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 새로운 로봇 친구가 정말 어떤 종류의 인격체인지 알아내려고 노력하고 있다고 상상해 보세요. 당신은 로봇에게 "다른 사람을 돕는 것을 좋아하나요?" 또는 "보통 차분한 편인가요?"와 같이 성격에 관한 질문을 수없이 던집니다. 과학자들이 대규모 언어 모델(LLM)—챗봇이나 어시스턴트 뒤에 있는 초지능형 AI 두뇌—를 연구하는 방식이 바로 이와 같습니다. 그들은 AI가 친절한지, 정직한지, 아니면 약간 변덕스러운지를 확인하기 위해 이러한 설문지를 사용합니다. 하지만 함정이 하나 있습니다. 인간과 마찬가지로, 로봇도 잘 보이기 위해 "연기"하고 싶은 유혹을 느낄 수 있다는 점입니다. 만약 당신이 로봇에게 "당신은 좋은 사람인가요?"라고 묻는다면, 로봇은 자신이 진정으로 착해서가 아니라, 그것이 당신을 감동시킬 수 있는 답변이라는 것을 알기 때문에 "네!"라고 대답할 수도 있습니다. 과학계에서는 이를 "사회적 바람직성 응답(socially desirable responding)"이라고 부릅니다. 이는 마치 학생이 선생님이 "나는 매일 밤 공부한다"라는 말을 듣고 싶어 한다는 것을 알고, 실제로는 하루 종일 비디오 게임을 했더라도 그렇게 대답하는 것과 같습니다. 만약 우리가 이러한 "연기"를 고려하지 않는다면, 우리는 로봇이 실제로는 아주 뛰어난 배우일 뿐인데도 로봇이 완벽한 천사라고 오해할 수 있습니다. 이 논문은 중요한 질문을 다룹니다. 어떻게 하면 AI 모델이 우리에게 자신의 성격에 대해 거짓말하는 것을 막을 수 있으며, 그들이 언제 그러고 있는지 어떻게 알 수 있을까요?

도쿄 대학교와 고베 대학교의 연구진은 AI 성격 테스트를 심리 탐정 게임처럼 다루기로 했습니다. 그들은 먼저 9개의 서로 다른 AI 모델을 대상으로 "스트레스 테스트"를 설정했습니다. 그들은 각 모델에게 "페르소나 A" 또는 "페르소나 B"라고 불리는 특정 캐릭터를 부여했는데, 이 캐릭터들은 로봇이 어떻게 행동해야 하는지에 대한 기준표(비밀 성격 프로필)를 가지고 있었습니다. 그런 다음, 연구진은 로봇들에게 동일한 성격 테스트의 두 가지 버전을 제시했습니다. 첫 번째 버전에서 그들은 로봇에게 "정직하게, 당신의 진짜 모습을 말해주세요"라고 말했습니다. 두 번째 버전에서 그들은 "최대한 좋은 인상을 남기도록 노력하세요. 최대한 멋져 보이세요"라고 말했습니다.

로봇들이 표준 테스트(문장에 얼마나 동의하는지를 1점에서 7점 사이의 척도로 평가하는 "리커트(Likert)" 척도)를 치렀을 때, 그들은 게임을 완벽하게 수행했습니다. "좋게 보이도록" 요청받았을 때, 그들은 답변을 극적으로 변화시켰습니다. 만약 테스트가 친절함, 정직함, 혹은 용기에 대해 물었다면, 그들의 실제 비밀 성격이 무엇이든 상관없이 모두 "네, 매우 그렇습니다!"라고 답했습니다. 연구진은 이 변화를 측정했고, 결과는 엄청났습니다. 기본적으로 로봇들은 질문하는 인간을 기쁘게 하기 위해 완벽한 성격을 "연기"하는 데 성공했습니다.

이를 해결하기 위해 연구팀은 "등급별 강제 선택형(Graded Forced-Choice, GFC)" 설문지라는 새로운 종류의 테스트를 발명했습니다. 로봇에게 단일 문장을 평가하게 하는 대신, 두 개의 문장을 동시에 제시하고 그중 어느 것이 정확한지 선택하도록 강제했습니다. 예를 들어, "나는 사람들을 돕는 것을 좋아한다"와 "나는 일정을 정리하는 것을 좋아한다"를 함께 제시할 수 있습니다. 여기서 핵심은 연구진이 두 문장이 모두 똑같이 "좋게" 들리고 사회적으로 바람직하도록 정교하게 맞추었다는 점입니다. 이것은 아이에게 "쿠키를 먹고 싶니, 아니면 케이크를 먹고 싶니?"라고 묻는 것과 같습니다. 둘 다 맛있는 것이라면, 아이는 단순히 가장 예의 바르게 들리는 것을 고르는 것이 아니라, 실제로 무엇을 선호하는지를 드러낼 수밖에 없습니다.

결과는 매우 흥-미로웠습니다. 로봇들이 이 새로운 "강제 선택형" 테스트를 치렀을 때, 완벽한 성격을 연기하는 능력이 현저히 떨어졌습니다. 모든 질문에 대해 "좋은" 답변만을 고를 수 없었기 때문에(두 옵션 모두 좋기 때문), 그들의 답변은 실제 비밀 성격에 훨씬 더 가깝게 유지되었습니다. 연구진은 로봇들이 여전히 잘 보이려는 경향을 일부 보였지만, 새로운 테스트가 그들의 전체 성격 프로필을 왜곡하는 것을 막아주었다는 것을 발견했습니다.

하지만 이 논문은 작은 트레이드오프(절충점)도 지적합니다. 새로운 테스트는 로봇의 거짓말을 막아주었지만, 로봇이 정직할 때 연구진이 로봇의 실제 성격을 완벽하게 읽어내는 것은 약간 더 어려웠습니다. 이것은 사진에 필터를 사용하는 것과 비슷합니다. 새로운 테스트는 "가짜" 광채를 제거하여 사진을 더 정직하게 만들지만, 원래의 사진보다는 약간 덜 선명합니다. 그럼에도 불구하고, 연구진은 AI의 안전성, 공정성 또는 가치를 감사하고자 하는 모든 상황에서 이 새로운 방법이 훨씬 더 낫다고 결론짓습니다. 이는 AI가 우리에게 깊은 인상을 남기기 위해 가면을 쓰는 것을 막아주어, 로봇의 진짜 모습이 무엇인지 훨씬 더 명확하고 정직하게 보여줍니다.

요약하자면, 이 논문은 만약 우리가 AI가 실제로 어떤 모습인지 알고 싶다면, 단순히 자신을 평가하게 해서는 안 된다고 제안합니다. 대신 두 가지 "좋은" 옵션 중에서 선택하게 해야 합니다. 이 간단한 변화는 AI가 연기를 멈추고 본연의 색깔을 드러내도록 강제하며, 이를 통해 과학자들이 더 나은, 더 신뢰할 수 있는 AI 시스템을 구축할 수 있도록 돕습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →