← 최신 논문
💬 NLP

Detection != Reliable Control: Decodable Empathy Directions Yield at Most Partial Shifts in Automated Empathy Scores

이 논문은 지시 튜닝된 거대언어모델(LLM)에서 디코딩 가능한 공감 방향이 자동화된 공감 점수를 신뢰성 있게 탐지하고 부분적으로 변화시킬 수는 있지만, 그것이 포괄적인 제어를 위한 신뢰할 수 있는 인과적 레버를 구성하지는 못하며, 특히 인간이 인지하는 측정 가능한 변화나 서로 다른 공감의 측면 및 모델 전반에 걸친 일관된 효과를 생성하는 데 실패한다는 점을 입증한다.

원저자: Haoran Jisun

게시일 2026-08-27
📖 4 분 읽기☕ 가벼운 읽기

원저자: Haoran Jisun

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인공지능이 급격히 발전하는 세상에서, 연구자들은 기계가 진정으로 인간의 감정을 이해할 수 있는지에 대해 점점 더 많은 관심을 기울이고 있습니다. 한 대중적인 아이디어는 만약 우리가 컴퓨터의 뇌 내부에서 공감과 같은 감정에 대응하는 특정 패턴을 찾아낼 수 있다면, 다이얼을 돌려 기계가 그것을 더 많이 표현하도록 만들 수 있을 것이라고 제안합니다. 이 개념은 컴퓨터가 특정 특성을 가지고 있음을 보여주는 것을 '읽어낼' 수 있다면, 그 특성을 의도적으로 변화시키도록 '조종'할 수도 있다는 믿음에 근거합니다. 이는 이러한 시스템들이 정서적 고통을 겪는 사람들에게 정서적 지원을 제공하기 위해 배치되고 있는 상황에서 특히 중요한데, 왜냐하면 도움이 되는 반응과 냉담한 반응 사이의 차이가 매우 클 수 있기 때문입니다. 그러나 기계 내부에서 감정을 감지하는 것이 그것을 신뢰성 있게 제어할 수 있는 것과 같다는 가정은 복잡한 현실 세계의 맥고인 공감의 맥락에서 엄격하게 검증된 적이 없습니다.

남가주대학교(USC)의 새로운 연구는 현대의 많은 챗봇 뒤에 있는 강력한 AI 시스템인 세 가지 서로 다른 대규모 언어 모델을 조사함으로써 이 가설에 이의를 제기합니다. 연구진은 심리학자들이 오랫동안 인식해 온 공감의 두 가지 뚜렷한 부분, 즉 타인의 관점을 이해하는 능력인 '인지적 공감'과 타인의 감정을 공유하거나 공명하는 능력인 '정서적 공감'에 초점을 맞추었습니다. 연구팀은 먼저 이 두 가지 특성에 대한 신호를 AI 모델의 내부 작동 방식 내에서 실제로 감지할 수 있음을 확인했습니다. 그들은 중립적인 반응과 높은 공감을 보이는 반응을 명확하게 구분하는 데이터상의 특정 방향을 찾아냈습니다. 이러한 감지는 잘 작동했으며, 이는 모델들이 이러한 개념에 대한 내부적 표상을 보유하고 있음을 시사합니다.

그러나 결정적인 테스트는 이러한 감지된 신호의 방향으로 작은 밀어주기(push)를 가했을 때, 실제로 AI의 행동을 의미 있는 방식으로 변화시킬 수 있는지 여부였습니다. 연구진은 이러한 밀어주기를 적용하여 모델을 더 공감하도록 유도했고, 이후 여러 자동화된 판정관과 특화된 분류기를 사용하여 결과를 측정했습니다. 결과는 두 유형의 공감 사이에 뚜렷한 차이를 드러냈습니다. 연구팀이 정서적, 즉 감정적 공명(resonance)을 높이려고 시도했을 때, 측정 가능한 변화가 나타났으나 이는 부분적인 것에 불과했습니다. 가장 성능이 좋았던 모델의 경우, 이러한 개입은 중립적인 반응과 완전히 공감하는 반응 사이의 자연스러운 격차 중 약 4분의 1 정도를 높였습니다. AI가 완전히 공감하게 된 것이 아니라, 단지 그 방향으로 약간 이동했을 뿐입니다. 테스트된 다른 모델들에서는 그 효과가 훨씬 작았으며, 때로는 거의 눈에 띄지 않을 정도였습니다.

타인의 상황을 이해하고 설명하는 능력인 인지적 공감에 대해서는 이야기가 달랐습니다. 연구진은 모델을 조종하려고 어떻게 시도하더라도 자동화된 점수가 변하지 않는다는 것을 발견했습니다. 그러나 이 연구는 중요한 뉘앙스를 제공합니다. 이러한 변화의 부재가 반드시 AI가 더 공감적으로 만들어질 수 없다는 증거는 아니라는 점입니다. 대신, 인지적 공감을 측정하는 데 사용된 도구들이 개입이 만들어냈을지도 모를 미세한 차이를 감지하기에는 너무 투박하다는 것이 밝혀졌습니다. 측정 도구들은 완전히 중립적인 메시지와 매우 감정적인 메시지의 차이는 구별할 수 있었지만, 정서적 지원의 영역 내에서 서로 다른 수준의 이해를 신뢰성 있게 구별하지는 못했습니다. 측정 도구 자체가 충분히 민감하지 않았기 때문에, 연구진은 조종의 효과가 '제로'라기보다는 '측정 불가능'한 것이라고 결론지었습니다.

아마도 가장 중요한 점은, 자동화된 점수가 변화했을 때조차 인간 독자들이 그 변화를 인지할 것이라는 증거가 없었다는 사실입니다. 인간 자원봉사자 패널에게 조종된 응답들을 판단하도록 요청했으나, 그들은 어떤 응답이 더 공감적인지를 일관되게 식별해내지 못했습니다. 이는 AI가 수행한 변화가 인간이 인지하거나 가치 있게 여길 만한 종류의 변화가 아니었음을 시사합니다. 연구진은 또한 공감 신호를 완전히 제거했을 때 AI가 덜 공감적이게 되는지를 테스트했습니다. 한 특정 모델에서 인지적 이해를 위한 신호를 제거했을 때 점수가 낮아지기는 했으나, 이 효과는 AI가 더 짧은 답변을 작성하는 것과 연관되어 있었으며, 측정 도구가 이를 감점하는 경향이 있었습니다. 연구진이 텍스트 길이를 고려했을 때도 인지적 점수에 대한 효과는 남아 있었지만, 여전히 AI의 행동을 제어하는 데 사용할 수 있는 깨끗하고 신뢰할 수 있는 스위치는 아니었습니다.

궁극적으로, 이 연구는 AI 내부에서 공감 신호를 찾는 것이 그것을 만들어내기 위한 신뢰할 수 있는 제어권을 갖는 것과 같지 않음을 보여줍니다. 모델이 정서적 공명을 조금 더 보여주도록 유도할 수는 있지만, 그 효과는 제한적이며 인간이 인지하는 개선으로 이어지지는 않습니다. 어떤 특성을 감지할 수 있는 능력이 그것을 조종할 수 있는 능력을 보장하지는 않으며, 특히 결과를 측정하는 도구가 변화를 포착할 만큼 정교하지 못할 때 더욱 그러합니다. 이 연구 결과는 AI를 정서적 지원에 배치하고자 하는 이들에게 주의를 주는 것으로, 단순히 공감을 위한 '다이얼'을 높이는 것만으로는 필요한 진정한 인간적인 연결을 만들어낼 수 없음을 나타냅니다. 이 연구는 기계가 무엇을 말하게 할 수 있는지와 인간이 실제로 경험하는 공감 사이의 간극을 강조하며, 이러한 복잡한 행동을 측정하고 제어하는 방식에 대해 더 신중한 접근을 촉구합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →