← 최신 논문
💬 NLP

Analysing Self-Harm Representations in Language Models: a Cross-Architecture Study

이 연구는 네 가지 아키텍처와 두 개의 데이터셋을 통해 거대 언어 모델이 자해 콘텐츠를 어떻게 표현하는지 분석하며, 이러한 정보가 네트워크 레이어의 마지막 3~7%에서 결정화된다는 점과 가장 정확한 탐지 프로브가 반드시 가장 선형적으로 분리 가능한 방향에 의존하는 것은 아니라는 점, 그리고 Gemma-3-4B가 구별되는 표현 패턴을 보인다는 점을 밝혀낸다.

원저자: Luis Espinosa-Anke, Carla Perez-Almendros

게시일 2026-07-27
📖 3 분 읽기☕ 가벼운 읽기

원저자: Luis Espinosa-Anke, Carla Perez-Almendros

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 세상의 모든 책이 저장된 거대하고 마법 같은 도서관을 가지고 있다고 상상해 보세요. 하지만 그 책들은 오직 도서관의 로봇들만이 읽을 수 있는 비밀 코드로 쓰여 있습니다. 이 도서관은 '거대 언어 모델(LLM)'이며, 시를 쓰는 것부터 질문에 답하는 것까지 인간의 언어를 이해하는 것이 이들의 임무입니다. 하지만 까다로운 점이 하나 있습니다. 이 로봇들은 우리처럼 무언가를 단순히 '아는' 것이 아니라, 수천 개의 수학적 연결로 이루어진 숨겨진 내부 지도를 가지고 있다는 것입니다. 과학자들은 이 로봇들이 자해와 같은 위험한 주제에 대해 어떻게 '생각'하는지 파악하려고 노력 중입니다. 로봇의 뇌를 다층 구조의 초고층 빌딩이라고 생각해 보세요. 메시지가 들어오면 건물 위층으로 올라갑니다. 맨 아래층에서 메시지는 그저 가공되지 않은 소음일 뿐입니다. 메시지가 위로 올라갈수록 로봇은 그것을 이해하기 시작합니다. 여기서 핵심적인 질문은 이것입니다. 정확히 몇 층에 도달했을 때 로봇은 비로소 "아, 이것은 도움을 요청하는 외침이구나"라고 깨닫게 되는가? 그리고 일단 깨닫고 나면, 그 생각은 단순하고 곧은 선의 형태로 저장되는가, 아니면 복잡하게 뒤틀린 미로 속에 숨겨져 있는가? AI가 위기에 처한 사람을 안전하게 포착하고 도울 수 있는 기술을 만들고 싶다면, 우리는 기계 내부에서 그 '위험 신호'가 정확히 어디에서 어떻게 불을 밝히는지 알아야 합니다.

이 연구에서 연구자들은 네 가지 서로 다른 AI 빌딩(Qwen3-0.6B, Llama 3.2-1B, Llama 3.2-3B, Gemma-3-4B라는 이름의 모델들)의 내부 작동 방식을 들여다보는 탐정 역할을 했습니다. 그들은 이 모델들이 자해에 관한 게시물을 어떻게 표현하는지 알고 싶어 했습니다. 그들은 두 가지 주요 실험을 수행했습니다. 첫째, 그들은 건물의 모든 층마다 단순한 '탐지기'(선형 프로브라고 불림)를 구축하여 AI가 자해 관련 게시물과 일반 게시물을 구분할 수 있는지 확인했습니다. 그 결과, AI는 건물의 꼭대기에 도달하기 전까지는 사실상 이를 제대로 이해하지 못한다는 것을 발견했습니다. 구체적으로, 자해에 대한 정보는 마지막 3%에서 7%의 층에서 '결정화(crystallize)'됩니다. 즉, 정보가 명확하고 단단해집니다. 34층짜리 건물이라면, AI는 마지막 2~3개 층에서만 위험을 완전히 이해하게 됩니다. 그 이전 단계에서는 신호가 너무 흐릿해서 신뢰성 있게 포착할 수 없습니다.

두 번째 실험은 훨씬 더 흥-미로웠습니다. 연구자들은 AI의 수학적 공간에서 자해를 직접 가리키는 단 하나의 '방향'을 찾으려 노력했습니다. 마치 항상 '위험'을 가리키는 나침반 바늘을 찾는 것처럼 말이죠. 그들은 자해를 가장 잘 포착하는 AI 모델이 가장 명확하고 곧은 나침반 바늘을 가질 것이라고 예상했습니다. 하지만 놀라운 사실을 발견했습니다. 자해를 가장 잘 포착했던 모델은 Gemma-3-4B였지만, 이 모델의 '위험 나침반'은 가장 덜 곧고 단순하지 않았습니다. 즉, Gemma는 자해라는 개념을 하나의 쉽고 찾기 쉬운 선에 저장하는 것이 아니라, 여러 다른 방향에 걸쳐 신호를 분산시켜 저장한다는 것이 밝혀졌습니다. 이는 단순한 나침반으로는 찾기 어렵게 만들지만, 실제 상황을 인식하는 데에는 오히려 더 효과적입니다.

연구팀은 또한 메시지가 건물을 타고 올라감에 따라 AI가 이 위험을 표현하는 방식이 변한다는 사실도 발견했습니다. 건물 아래쪽에서의 '위험 신호' 방향은 위쪽에서의 방향과 거의 완전히 다릅니다. 마치 메시지가 아래쪽에서는 빨간 화살표로 시작했다가, 꼭대기에 도달할 때쯤에는 파란색 나선형으로 회전하고 변한 것과 같습니다. 이는 AI의 안전 기능을 이해하기 위해 단순히 초기 층들을 살펴보는 것만으로는 부족하며, 반드시 맨 마지막 층을 확인해야 함을 의미합니다.

마지막으로, 연구진은 탐지기를 훈련시키는 데 사용한 두 가지 데이터 세트를 비교했습니다. 한 세트는 은유를 사용하거나 뉴스 기사 속에서 자해를 언급하는 등 다소 복잡하고 모호한 게시물들이 섞여 있었고, 다른 한 세트는 매우 명확하고 직접적이었습니다. 그들은 AI가 명확하고 직접적인 데이터에서 훨씬 더 높은 성능과 일관성을 보인다는 것을 발견했습니다. 이는 AI에게 제공하는 예시의 품질이 엄청나게 중요하다는 것을 시사합니다. 만약 훈련 데이터가 혼란스럽거나 까다로운 은유로 가득 차 있다면, AI의 내부 지도는 훨씬 더 흐릿해집니다.

요약하자면, 이 논문은 이러한 AI 모델들에게 있어 자해라는 개념은 네트워크의 상단 몇 개 층에서 발생하는 후기 단계의 깨달음이라는 점을 시사합니다. 또한, 가장 정확한 AI는 반드시 가장 단순한 '위험 신호'를 가진 모델이 아니라, 오히려 위험을 더 복럽고 분산된 방식으로 인코딩하는 모델이라는 점을 보여줍니다. 이는 우리가 더 안전한 AI를 만드는 방식에 대한 새로운 관점을 제공합니다. 즉, 단순히 로봇이 알아서 잘해주기를 바라는 대신, 그 생각이 정확히 어디에서 어떻게 형성되는지 이해함으로써, 우리는 이러한 결정적인 순간을 처리할 수 있도록 AI의 특정 뇌 부위를 정교하게 설계할 수 있을 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →