← 최신 논문
💻 computer science

J-space Forecasts Model Collapse, but Only Anchoring the Function Prevents It

합성 데이터에 대한 재귀적 학습은 J-공간 표현 부공간에서의 전역적 드리프트로 나타나는 모델 붕괴를 유발하지만, 해당 연구는 이러한 기하학적 구조를 안정화하는 것은 효과가 없는 반면, 소수의 실제 시퀀스를 사용하여 모델의 입출력 함수를 붕괴 전 상태에 고정하는 것이 거의 모든 손상을 성공적으로 방지한다는 것을 발견했다.

원저자: ChaeWoo Son

게시일 2026-08-18
📖 4 분 읽기☕ 가벼운 읽기

원저자: ChaeWoo Son

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

언어 모델로 알려진 인공지능 시스템은 이야기를 쓰고, 질문에 답하며, 인간의 대화를 흉내 낼 수 있는 능력을 갖추며 점점 더 흔해지고 있습니다. 이 시스템들은 인터넷과 책에 있는 방대한 양의 텍스트를 읽으며 학습합니다. 그러나 한 가지 우려스러운 현상이 나타났습니다. 만약 이 모델들이 스스로 작성한 텍스트를 학습하게 되면, 성능이 저하되기 시작한다는 것입니다. '모델 붕괴(model collapse)'라고 불리는 이 과정은 AI가 인간 언어의 전체 범위를 이해하는 능력을 상실하게 만듭니다. 다양하고 미묘한 응답을 생성하는 대신, 모델은 반복적인 표현에 집중하고 결국 언어를 풍부하게 만드는 희귀하고 복잡한 아이디어들을 잊어버리게 됩니다. 인터넷상의 콘텐츠가 점점 더 AI에 의해 생성됨에 따라, 미래의 모델들이 의도치 않게 이러한 저하된 출력물로부터 학습하게 되어 지능이 서서히 침식되는 피드백 루프가 생성될 수 있다는 점에서 이 위험은 실재합니다.

수년 동안 과학자들은 모델의 최종 출력을 관찰하며 텍스트의 품질이 저하되는 것을 지켜봄으로써 이 붕괴를 관찰해 왔습니다. 하지만 독립 연구자인 채우 선(ChaeWoo Son)의 새로운 연구는 더 깊은 질문을 던집니다. "정확히 기계 내부의 어디에서 손상이 발생하는가?" 즉, 이 부상은 모델이 아이디어를 표현하는 방식에서 발생하는 것인가, 아니면 다음에 무엇을 말할지 결정하는 방식에서 발생하는 것인가 하는 점입니다. 이를 알아내기 위해 연구자는 소규모 언어 모델을 사용하여 통제된 실험을 구축하고, 모델이 여러 세대에 걸쳐 자신의 합성 텍스트로부터 학습하도록 강제했습니다. 목표는 손상이 발생하는 과정을 추적하고, 모델의 특정 내부 구조를 보호함으로써 이를 막을 수 있는지 확인하는 것이었습니다.

연구는 모델을 대량의 실제 인간 저작물로 학습시키는 것으로 시작되었습니다. 모델이 준비되면 연구자는 하나의 주기를 시작했습니다. 모델이 백만 단어의 자체 텍스트를 생성하면, 그 새로운 텍스트로 모델을 다시 학습시키는 방식입니다. 이 과정은 여섯 번 반복되었습니다. 예상대로, 실제 인간의 텍스트에 대한 모델의 성능은 매우 빠르게 악화되었습니다. 단 한 차례의 자가 학습만으로도 문장에서 다음 단어를 예측하는 모델의 능력은 크게 떨어졌습니다. 하지만 모델의 출력이 실패의 징후를 보이기 전, 연구자는 기계 내부에서 다른 일이 일어나고 있음을 발견했습니다. 모델이 개념을 저장하는 저차원 공간 중 하나를 살펴본 결과, 연구자는 모델이 정보를 표현하는 방식에서 거대한 변화를 목격했습니다. 이 내부적 변화는 외부에서 관찰할 수 있는 성능 저하보다 10배나 더 빠르게 일어났습니다.

그러나 이 조기 경고 신호는 붕괴에만 고유한 것은 아니었습니다. 모델이 자신의 출력물 대신 신선하고 품질 높은 인간의 텍스트를 학습했을 때도 동일한 내부 공간이 움직였지만, 그 변화는 훨씬 작고 일관성이 없었습니다. 핵심적인 차이는 변화의 속도와 깊이였습니다. 모델이 자신의 나쁜 데이터로부터 학습할 때 내부적 변화는 거대하고 일관적이었으며, 모델의 이해도를 매우 낮은 바닥 수준까지 몰아넣었습니다. 반면 좋은 데이터로부터 학습할 때의 변화는 미미했습니다. 이는 내부 공간이 문제를 알리는 민감한 척도는 될 수 있지만, 반드시 손상이 가해지는 지점은 아님을 시사했습니다.

이를 테스트하기 위해 연구자는 내부 구조를 고정함으로써 붕괴를 막으려 시도했습니다. 연구자는 모델이 나쁜 합성 데이터를 통해 학습하는 동안에도 모델의 내부 표현이 학습 시작 전과 똑같이 유지되도록 강제했습니다. 이는 내부 공간을 안정적으로 유지하는 데는 완벽하게 작동했지만, 모델을 구하는 데는 실패했습니다. 모델은 여로전히 붕괴하여 실제 텍스트를 처리하는 능력을 대부분 상실했습니다. 연구자가 작은 공간뿐만 아니라 모델의 전체 레이어를 잠갔을 때조차 보호 효과는 미미했습니다. 이는 매우 중요한 발견이었습니다. 즉, 부상이 모델이 아이디어를 저장하는 방식에서 발생하는 것이 아니라 다른 곳에서 발생하고 있음을 증명한 것입니다.

해결책은 연구자가 내부 지도를 보호하는 전략에서 행동을 보호하는 전략으로 바꿨을 때 나타났습니다. 모델의 내부 구조를 얼리는 대신, 모델이 소수의 실제 인간 문장에 대한 예측을 처음과 똑같이 유지하도록 강제하는 규칙을 추가했습니다. 이는 마치 학생에게 "네가 무엇을 공부하든 상관없지만, 이 특정 질문들에 대해서는 여전히 정확하게 답할 수 있어야 한다"라고 말하는 것과 같습니다. 이 규칙이 적용되었을 때, 모델은 거의 완전히 구제되었습니다. 모델은 실제 인간의 텍스트를 이해하는 능력을 잃지 않으면서도 나쁜 합성 데이터로부터 학습했습니다. 사실, 이 방법은 과학자들이 이 문제를 해결하기 위해 사용하는 표준 방식인 실제 인간의 문장을 학습 데이터에 섞는 것보다 훨씬 더 효과적이었습니다. 데이터 혼합 방식은 약 절반 정도만을 예방한 반면, 행동 규칙은 거의 모든 손상을 방지했습니다.

이 연구는 AI 모델의 붕괴가 모델의 내부 기억이나 개념을 저장하는 능력의 실패가 아님을 밝혀냈습니다. 대신, 그것은 모델이 보는 것과 모델이 말하기로 결정하는 것 사이의 연결의 실패입니다. 손상은 아이디어의 정적인 표현이 아니라, 입력에서 출력으로 가는 함수, 즉 매핑 과정에서 발생합니다. 이 함수를 건강한 참조점에 고정함으로써 모델은 자신의 출력물으로부터 오는 부패로부터 보호받을 수 있습니다. 비록 이 실험은 소규모 모델을 대상으로 수행되었지만, 이 결과는 미래의 더 큰 시스템들을 보호할 수 있는 강력하고 효율적인 방법을 제시합니다. 소수의 실제 인간 사례를 사용하여 모델의 행동을 고정할 수 있다면, 인터넷이 점점 더 기계가 생성한 콘텐츠로 채워지더라도 인공지능의 느린 퇴보를 막는 것이 가능할지도 모릅니다. 이 연구는 명확한 방향을 제시합니다. 모델의 내부 상태를 보존하려고만 하지 말고, 실제 세상에 대해 올바르게 행동하는 능력을 보존하십시오.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →