← 최신 논문
💻 computer science

Where Abstention Lives: A Pre-Registered Four-Way Comparison of Abstention Interfaces in a Small Language Model with Versioned Memory

이 사전 등록된 연구는 버전 관리된 메모리를 가진 소규모 언어 모델에서, 별도의 이진 헤드를 통해 기권(abstention)을 구현하는 것이 결정 과정을 생성 소프트맥스(softmax)로부터 분리함으로써 어휘 토큰이나 메모리 슬롯보다 현저히 우수한 성능을 보이며, 이를 통해 제한된 정확도 마진에서도 "모른다"라고 말하는 능력을 학습 가능하게 만든다는 것을 입증한다.

원저자: Maximiliano Rodrigo Speranza

게시일 2026-08-28
📖 4 분 읽기☕ 가벼운 읽기

원저자: Maximiliano Rodrigo Speranza

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인공지능의 세계에서, 컴퓨터가 저지를 수 있는 가장 위험한 실수는 자신이 길을 잃었다는 사실을 인정하지 못하는 것이라는 인식이 확산되고 있습니다. 언어 모델이 답할 수 없는 질문을 받았을 때, 종종 그럴듯하게 들리는 거짓말을 지어내곤 하는데, 연구자들은 이 현상을 '환각(hallucination)'이라고 부릅니다. 이를 방지하기 위해 과학자들은 이 시스템들에게 새로운 기술, 즉 "모른다"라고 말할 수 있는 능력을 가르치기 위해 노력해 왔습니다. 이것은 단순히 단순한 정지 표지판을 프로그래밍하는 문제가 아닙니다. 그것은 기계에게 자신의 지식의 경계를 인식하고, 조작 대신 침묵을 선택하도록 가르치는 일입니다. 문제는 기계가 그 선택을 어떻게 하느냐에 달려 있습니다. 침묵하기로 하는 결정이 모델의 어휘 사전에 추가된 특별한 단어여야 할까요, 제어 패널 위의 별도 스위치여야 할까요, 아니면 내부 메모리에 숨겨진 메모(note)여야 할까요? 수년 동안 이러한 다양한 방법들이 개별적으로 테스트되어 왔지만, 어떤 접근 방식이 실제로 가장 효과적인지에 대한 명확한 지침을 실무자들에게 제공하지 못했습니다.

맥시밀리아노 스페란자(Maximiliano Speranza)라는 연구자는 결정의 위치를 제외한 모든 변수를 일정하게 유지하는 통제된 실험을 실행함으로써 이 질문을 해결하고자 했습니다. 그는 매개변수가 100만 개가 채 되지 않는 작은 언어 모델을 처음부터 구축했고, 나중에 업데이트되거나 수정되는 일련의 사실들을 학습시켜 모델이 정답을 알 때도 있고 모를 때도 있는 시나리오를 만들었습니다. 목표는 "모른다"를 처리하는 네 가지 주요 방식 중 어떤 방식이 모델이 이 기술을 가장 효과적으로 학습하게 하는지 확인하는 것이었습니다. 결과는 명확한 승자와 다른 방법들이 실패한 놀라운 이유를 밝혀냈습니다.

실험은 네 가지 뚜렷한 접근 방식을 테스트했습니다. 첫 번째는 "IDK"와 같은 고유한 단어인 특별한 토큰을 모델의 어휘 사전에 추가하여, 모델이 확신이 없을 때 단순히 그 단어를 말하게 하는 것이었습니다. 두 번째는 별도의 이진 헤드(binary head), 즉 답변을 할지 아니면 침묵할지를 결정하는 임무만을 수행하는 아주 작은 전용 출력 채널을 추가하는 것이었습니다. 세 번째는 해당 특별한 단어의 벡터를 재정규화(renormalize)하는 것으로, 이는 그 단어가 다른 단어들과 비교했을 때 가중치가 불균형하다는 의심을 해결하기 위한 기술적 조정이었습니다. 네 번째는 모델의 메모리에 "여기에 아무것도 없음"이라는 개념을 저장하기 위한 전용 슬롯을 추가하는 것이었습니다.

연구 결과는 결정적이었습니다. 별도의 이진 헤드가 가장 효과적인 방법임이 입증되었습니다. 세 번의 서로 다른 학습 실행 중 세 번 모두에서, 이 접근 방식은 어휘 토큰 방식에 비해 오경보(모델이 실제로 답을 알고 있음에도 침묵하는 경우) 발생률을 2배에서 거의 3배까지 줄였습니다. 더 중요한 것은, 이 방법이 모델이 아직 사실 관계에 대해 완벽하게 수행하지 못하는 상태에서도 침묵하는 기술을 배울 수 있게 해주었다는 점입니다. 별도의 헤드를 사용하면, 완벽한 모델보다 정확도가 약 10% 정도 낮은 모델이라도 침묵하는 법을 배울 수 있었습니다. 특별한 어휘 단어와 메모리 슬롯을 포함한 다른 방법들은 동일한 조건 하에서 모델에게 이러한 절제력을 가르치는 데 실패했습니다.

이 연구는 또한 어휘 토큰 방식이 왜 실패했는지에 대한 대중적인 이론을 해체했습니다. "모른다" 토큰의 원래 제작자들은 작은 모델에서 이 방식이 실패한 이유가 해당 단어에 할당된 수치적 값이 너무 약하거나 초기화가 잘못되었기 때문이라고 제안했습니다. 스페란자는 이 단어의 강도를 다른 단어들과 일치하도록 명시적으로 조정함으로써 이를 테스트했습니다. 만약 그 이론이 맞다면 이 수정 작업이 효과가 있어야 했습니다. 하지만 효과가 없었습니다. 문제는 단어의 강도가 아니라, 모델이 하나의 단일 메커니즘을 사용하여 '사실을 선택하는 것'과 '침묵을 선택하는 것'이라는 두 가지 매우 다른 결정을 내려야 했다는 사실이었습니다. 이 두 가지 상충하는 목표가 동일한 의사결정 공간을 공유하도록 강요되었을 때, 모델은 침묵하는 법을 배우는 데 어려움을 겪었습니다.

메모리 슬롯 방식은 특히 교훈적인 실패를 보여주었습니다. 모델에게 메모리에 "답 없음"을 저장할 특정 공간을 주었음에도 불구하고, 모델은 이 슬롯을 완전히 무시했습니다. 질문에 답이 없음을 인식하는 대신, 모델은 단순히 질문에 답이 없는 빈도에 대한 통계적 평균을 학습했습니다. 모델은 약 40%의 확률로 답이 없다는 것을 깨달았고, 실제 질문 내용과 상관없이 매번 "답 없음" 슬롯에 대해 일정한 수준의 낮은 주의(attention)를 할당했습니다. 이 주의 수준이 침묵을 유발할 만큼 높아지지 않았기 때문에, 모델은 결코 멈춰 서서 "모른다"라고 말하지 못했습니다. 모델은 현실이 아닌 확률을 학습한 것입니다.

가장 뼈아픈 발견은 모델이 자신이 모른다는 것을 아는 능력이 원시적인 지능이나 용량의 문제가 아니라, 보정(calibration)의 문제라는 점이었습니다. 올바른 결정을 내리는 데 필요한 정보는 모델의 내부 신호에 존재했지만, 모델은 구체적인 감독 가이드 없이는 그 정보를 사용하는 방법을 몰랐습니다. 연구진이 레이블이나 직접적인 피드백 없이 모델에게 스스로의 불확실성을 인식하도록 가르치려 했을 때, 모델은 완전히 실패했습니다. 모델은 현재 질문에 틀린 정보라 할지라도 자신이 저장한 실제 정보에 답변을 고착시켰으며, 이로 인해 확신에 찬 추측과 진정한 사실 사이의 차이를 구별하는 것이 불가능해졌습니다.

이 연구는 모든 시스템에 대한 인공지능 환각 문제를 해결했다고 주장하는 것이 아닙니다. 실험은 매우 작은 모델과 제한된 어휘를 대상으로 수행되었으며, 그 결과가 오늘날 사용되는 거대하고 복잡한 시스템으로 직접 전달되지는 않을 수 있습니다. 그러나 이 연구는 특정한 구조적 질문에 대해 명확하고 측정된 답을 제공합니다. 만약 작은 언어 모델이 언제 침묵해야 하는지를 배우게 하고 싶다면, 특별한 단어나 메모리 슬롯을 사용하도록 요구하는 것보다 별도의 전용 스위치를 주어 그 결정을 내리게 하는 것이 훨씬 더 우월합니다. 교훈은 결정의 위치가 매우 중요하다는 것이며, 때로는 가장 우아한 해결책이 단순히 기계에게 "모른다"라고 말할 수 있는 별도의 장소를 마련해 주는 것일 수도 있다는 점입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →