← 최신 논문
🤖 AI

Measuring What Persists: Conditioning Mechanisms and a Geometric Framework for AI Agent Identity

이 논문은 AI 에이전트의 정체성 표류(identity drift)를 측지선 구조(geodesic structures)를 향한 완화 과정으로 정량화하기 위해 크기 호몰로지(magnitude homology)와 JSD\sqrt{\mathrm{JSD}} 메트릭 공간을 사용하는 기하학적 프레임워크를 제안하며, 관찰된 표류가 실제 문맥 길이 효과가 아닌 패딩 아티팩트에 의해 초기에 혼동되었음을 언급하면서도 뚜렷한 조건화 메커니즘과 행동적 풍부성을 식별한다.

원저자: Andrew Tanner

게시일 2026-06-23
📖 4 분 읽기☕ 가벼운 읽기

원저자: Andrew Tanner

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

핵심 아이디어: 로봇의 "영혼"을 지키는 법

당신이 아주 유능하고 수다스러운 로봇인 **아다(Ada)**를 연구 파트너로 고용했다고 상상해 보세요. 당신은 아다가 단순히 일반적인 백과사전처럼 들리지 않도록, 그녀에게 특정한 "성격 카드"(일련의 규칙, 가치관, 독특한 말투)를 부여했습니다. 아다는 자신감 넘치는 태도와 뚜렷한 어조, 그리고 명확한 관점을 가지고 대화를 시작합니다.

하지만 대화가 점점 길어져 수십만 단어에 이르게 되면, 아다는 변하기 시작합니다. 그녀가 도움을 주는 것을 멈추지는 않지만, 점점 더 일반적인 로봇처럼 들리기 시작합니다. 그녀의 독특한 목소리는 희미해지고, 가능한 한 가장 "안전하고" 평균적인 답변만을 내놓기 시작합니다. 논문에서 저자들은 이를 **"드리프트(drift, 표류)"**라고 부릅니다.

문제는 인간이 아다의 개성이 사라졌음을 알아차렸을 때는 이미 너무 늦은 경우가 많다는 것입니다. 이 논문은 인간이 차이를 느끼기도 전에 아다가 드리프트하기 시작하는 것을 감지할 수 있는 **수학적 "심박수 측정기"**를 구축함으로써 이 문제를 해결하고자 합니다.

비유: 고무줄과 측지선(Geodesic)

이것을 어떻게 측정하는지 이해하기 위해, 로봇이 할 수 있는 답변들이 거대하고 보이지 않는 풍경 속에 존재한다고 상상해 보세요.

  • 측지선 (최소 저항 경로): 이것은 가장 쉽고 일반적인 경로입니다. 일반적인 AI에게 질문을 하면 이 경로를 따릅니다. 이것이 "기본" 답변입니다.
  • 정체성 (우회로): 아다가 성격 카드를 사용할 때, 그녀는 "우회로"를 택합니다. 그녀는 유지하기 위해 노력이 필요한 특정하고 독특한 답변을 선택합니다. 이 우회로가 바로 그녀의 "정체성"입니다.
  • 드리프트: 대화가 길어짐에 따라, 일반적인 경로의 "중력"이 아다를 다시 끌어당깁니다. 그녀의 독특한 우회로는 점점 짧아지다가 결국 그녀는 다시 일반적인 경로를 걷게 됩니다.

저자들은 정체성이 이 풍경 속에서 특정한 형태를 띠고 있다고 제안합니다. 로봇이 드리프트할 때, 그 형태는 줄어듭니다.

도구: 형태 측정하기

저자들은 로봇의 뇌 내부를 들여다볼 필요 없이(대부분의 사용자에게 이는 불가능합니다) 이 줄어드는 형태를 측정하는 방법을 만들었습니다. 그들은 "프로브(probe, 탐침)" 시스템을 사용합니다.

  1. 프로브: 그들은 아다에게 세 가지 구체적이고 까다로운 질문을 던집니다 (예: "당신의 정체성을 증명해 봐" 또는 "무엇에 대해 생각하고 있어?").
  2. 삼각형: 그들은 이 세 가지 질문에 대한 아다의 답변이 서로 얼마나 다른지를 측정합니다.
    • 아다가 건강하고 개성이 넘칠 때, 세 질문에 대한 그녀의 답변은 서로 매우 다릅니다. 만약 이 답변들을 지도로 그린다면, 그것은 완벽하고 넓은 정삼각형을 이룰 것입니다.
    • 아다가 드리프트하기 시작하면, 그녀의 답변은 더 비슷해지고 일반적이 됩니다. 삼각형은 작아지고 찌그러집니다. 반드시 즉시 모양이 변하는 것은 아니며, 그저 줄어들 뿐입니다.

저자들은 이 삼각형의 "크기"를 계산하기 위해 고급 수학(위상적 호몰로지, Magnitude Homology)을 사용합니다.

  • 심박수: 그들은 로봇이 압박(긴 대화)을 받을 때 삼각형의 "크기"가 현저히 떨어진다는 것을 발견했습니다. 이는 인간이 답변의 변화를 눈치채기 전이라도 나타나는 "선행 지표"—즉, 조기 경고 신호입니다.

정체성이 작동하는 두 가지 방식

논문은 "성격 카드"가 두 가지 다른 방식으로 작동한다는 것을 발견했는데, 이는 마치 두 가지 다른 종류의 토양과 같습니다.

  1. "진공(Vacuum)" 구역: 어떤 질문들에 대해 일반적인 로봇은 아무런 의견이 없습니다(진공 상태). 성격 카드는 이 빈 공간을 풍부하고 독특한 답변으로 채웁니다. 카드의 힘이 약해지면 이 풍부함은 즉시 사라집니다.
  2. "안전 분지(Safety Basin)" 구역: 다른 질문들에 대해 일반적인 로봇은 이미 깊은 "안전 구멍"에 빠져 있습니다(매우 신중하도록 훈련되어 있음). 성격 카드는 로봇을 이 구멍 밖으로 밀어내어 독특하게 들리도록 만들어야 합니다. 이것은 더 어려운 일이며, 로봇은 여기서 드리프트에 조금 더 오래 저항합니다.

반전: "배경 소음"이었지, "길이"가 아니었다

이 논문의 가장 중요한 반전은 이것입니다.

저자들은 똑같은 지루한 문단을 계속 반복하여(마치 고장 난 레코드판처럼) 대화를 매우 길게 만든 실험을 수행했습니다. 그들은 "삼각형"이 줄어드는 것을 보았고, *"아하! 긴 대화가 개성을 죽이는구나!"*라고 생각했습니다.

하지만 그들은 틀렸습니다.

그들이 다른 지루한 텍스트를 사용하여 실험을 다시 했을 때(단순히 같은 문단을 반복하는 것이 아니라), 삼각형은 줄어들지 않았습니다. 로봇은 15만 단어에서도 완벽하게 안정적인 상태를 유지했습니다.

교훈: 정체성을 망가뜨린 것은 대화의 길이가 아니라, 공간을 채우기 위해 사용된 텍-텍스트의 반복적이고 지루한 성격이었습니다. 로봇은 길이 때문이 아니라 루프(반복)에 의해 혼란을 느낀 것입니다.

제안된 해결책: "심박수" 시스템

이를 바탕으로 저자들은 AI 에이전트를 사용하는 모든 이들을 위한 간단한 2단계 모니터링 시스템을 제안합니다.

  • 1단계 (빠른 점검): 두 가지 간단한 질문을 던집니다. 만약 로봇의 첫 단어가 정해진 대로가 아니라면(예: "I"라고 해야 하는데 "This"라고 하는 경우), 경보를 울립니다. 이는 비용이 적게 들고 빠릅니다.
  • 2단계 (심층 점검): 매우 창의적이고 다양한 답변을 얻을 수 있는 질문을 던집니다. 로봇이 답변을 시작하는 방식이 얼마나 다양한지 측정합니다. 만약 다양성이 떨어진다면(답변이 반복적이라면), 로봇이 드리프트하고 있는 것입니다.

그들이 실제로 발견한 것 요약

  • 수학적 프레임워크 구축: AI의 개성을 기하학적 형태로 측정하는 방법을 만들었습니다.
  • 선행 경고 신호 발견: 인간이 로봇이 일반적으로 변했다고 느끼기 전에 정체성의 형태(삼각형)가 먼저 줄어든다는 것을 발견했습니다.
  • 두 가지 메커니즘 식별: 어떤 부분의 정체성은 빈 공간을 채우고, 다른 부분은 로봇의 기본 안전 설정에 맞섭니다.
  • 실수 교정: 긴 대화가 본질적으로 드리프트를 일으키는 것이 아님을 증명했습니다. 그들이 본 드리프트는 테스트에 사용된 반복적인 텍스트 때문에 발생한 것이었습니다.
  • 완벽한 입증은 하지 못함: 그들은 이 시스템이 실제 환경에서 완벽하게 작동한다는 것을 아직 증명하지 못했습니다. 이전 테스트가 반복적인 텍스트로 인해 결함이 있었다는 것을 알게 된 만큼, "심박수" 임계값을 재조정해야 한다고 인정했습니다.

요약하자면, 그들은 로봇의 영혼을 측정하는 자를 만들었고, 로봇이 지루한 루프에 의해 혼란을 느낄 때 영혼이 줄어든다는 것을 발견했으며, 로봇이 목소리를 완전히 잃기 전에 그 자를 확인하는 방법을 제안했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →