Safin-1: Safety from Within through Memory-Native State Evolution
이 논문은 외부 제약에 의존하는 대신 메모리 네이티브 상태 진화를 통해 안전성을 내재적이고 적응적으로 유지 가능한 능력으로 임베딩하기 위해 MARCh(Memory-Anchor Routing across Context History) 아키텍처를 활용하는 파운데이션 모델 제품군인 Safin-1을 소개한다.
원본 논문은 CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/)에 따라 공공 도메인에 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
인공지능의 세계에는 기억과 안전성 사이의 지속적인 긴장이 존재합니다. 거대 언어 모델은 유능한 조수가 되도록 설계되었지만, 길고 복잡한 대화를 나눌 때 흐름을 놓치지 않기 위해 이전에 말한 내용을 기억해야만 합니다. 전통적으로 이러한 모델들은 대화 중에 오가는 모든 단어를 실행 목록으로 유지함으로써 기억을 처리하는데, 이는 대화가 길어질수록 무거워지고 느려집니다. 동시에, 이러한 모델을 유해한 요청으로부터 안전하게 보호하는 작업은 보통 외부 규칙을 추가하거나 시스템 전체를 재학습시키는 과정을 포함하며, 이는 모델의 유연성을 떨어뜨리거나 무해한 질문에 대해서도 답변을 거부하게 만들 수 있습니다. 연구자들의 과제는 모델이 장기적인 문맥을 자연스럽게 유지하면서도, 단순히 사후에 덧붙여진 것이 아니라 그 구조 자체에 안전성이 내장된 시스템을 구축하는 것입니다.
상하이 AI 연구소(Shanghai AI Laboratory)의 연구진은 Safin-1이라는 모델 제품군을 통해 이 문제를 해결할 새로운 방법을 제안했습니다. 이들은 안전을 일련의 외부 규칙이나 별도의 코드 계층으로 취급하는 대신, 마치 사람이 다양한 상황에서 자신의 행동을 안내하는 일련의 개인적 가치관을 지니는 것처럼, 모델이 안전을 내부 상태로서 지니도록 설계했습니다. 이들의 혁신의 핵심은 모델이 정기적인 간격으로 자신의 내부 사고 과정의 스냅샷을 저장할 수 있게 하는 메커니즘입니다. 모델이 긴 문서를 읽거나 복잡한 지시를 따를 때, 모델은 주기적으로 멈추어 현재 이해하고 있는 내용의 압축된 요약본을 저장합니다. 나중에 모델이 과거의 무언가를 회상해야 할 때, 모델은 대화의 전체 이력을 한꺼번에 처리하는 대신, 저장된 스냅샷들을 검색하여 가장 관련 있는 정보를 찾아낼 수 있습니다. 연구진이 '메모리 네이티브 상태 진화(memory-native state evolution)'라고 부르는 이 접근 방식은 모델의 기억을 과거의 수동적인 기록에서, 필요에 따라 조회하고 업데이트할 수 있는 능동적인 도구로 변화시킵니다.
연구진은 이 아이디어가 제대로 작동하는지 확인하기 위해 먼저 작은 규모의 모델들로 테스트를 진행했습니다. 그들은 이 특정 과거 상태를 검색하는 능력을 추가함으로써, 모델이 긴 문맥을 이해하고 텍형 깊숙이 숨겨진 정보를 찾는 능력이 현저히 향상되었다는 것을 발견했습니다. 모델이 수천 단어의 건초더미 속에서 특정 바늘을 찾아야 하는 테스트에서, 이 새로운 설계는 이전의 방식들을 능가했으며, 특히 텍스트의 길이가 모델이 훈련 과정에서 본 적 없는 수준으로 길었을 때 더욱 두드러졌습니다. 이는 과거의 상태를 선택적으로 회상하는 능력이 모델이 정보의 방대한 양에 길을 잃지 않고도 장기간 동안 집중력과 추론 능력을 유지하는 데 도움을 준다는 것을 시사합니다.
이러한 초기 성공을 바탕으로, 연구팀은 이 기술을 40억 개에서 350억 개의 파라미터에 이르는 훨씬 더 큰 모델들로 확장했습니다. 그들은 동일한 메모리 라우팅 시스템을 이 더 큰 모델들에 적용한 뒤, 특정 응용 분야인 '안전성'을 테스트했습니다. 그들은 모델에 부착할 수 있는 특별하고 지속적인 '안전 상태(safety state)'를 만들었습니다. 이 상태는 유해한 요청을 인식하고 모델을 안전한 응답으로 유도하도록 훈련되었지만, 탈착이 가능하도록 설계되었습니다. 연구진은 이 안전 상태가 활성화되었을 때, 모델이 모델을 속여 유해한 콘텐츠를 생성하도록 유도하려는 시도에 훨씬 더 잘 저항한다는 것을 발견했습니다. 한 테스트 세트에서, 이 새로운 접근 방식은 표준 모델과 비교했을 때 이러한 속임수 시도의 성공률을 거의 절반 가까이 줄였습니다. 결정적으로, 이러한 안전성의 향상은 모델의 유능함(helpfulness)을 희생시키며 이루어지지 않았습니다. 과도한 주의로 인해 정당한 질문에 답변을 거부하는 경우가 빈번한 다른 방법들과 달리, 이 새로운 접근 방식은 위험한 요청은 차단하면서도 무해한 요청을 거부하는 경우는 훨씬 적게 유지하며 높은 수준의 유능함을 유지했습니다.
이 연구는 우리가 안전한 인공지능을 구축하는 방식에 대해 어떻게 생각해야 하는지에 대한 변화를 강조합니다. 단순히 외부 필터에 의존하거나 모델의 전체 뇌를 끊임없이 재학습시키는 대신, 이 연구는 안전이 모델의 내부 기계 장치의 본질적인 부분이 될 수 있음을 시사합니다. 모델이 상황에 따라 켜고 끌 수 있는 특화된 상태를 지닐 수 있도록 함으로써, 연구진은 적응력과 견고함을 모두 갖춘 시스템을 만들어냈습니다. 결과는 이 방법이 안전을 외부에서 부과된 제약이 아니라, 모델 자체의 기억과 추론 과정 내에서 자연스럽게 진화하는 능력으로서 제시하는 유망한 경로임을 보여줍니다. 연구진은 이것이 초기 탐색 단계이며 이 비전을 완전히 실현하기 위해서는 더 많은 작업이 필요하다고 언급했지만, 이 발견은 안전이 어떻게 기계가 생각하고 기억하는 방식의 근간에 엮일 수 있는지를 보여주는 구체적인 증거를 제공합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.