← 최신 논문
💬 NLP

LLM generation novelty through the lens of semantic similarity

이 논문은 LLM 생성물의 참신함을 전체 사전 학습 코퍼스에 대해 측정하기 위한 확장 가능한 3단계 시맨틱 검색 프레ме워크를 제안하며, 이를 통해 모델이 이전에 생각했던 것보다 더 긴 시퀀스에 걸쳐 데이터를 활용하고, 도메인 특화된 참신함 패턴을 보이며, 인스트럭션 튜닝을 통해 참신함이 증가한다는 것을 밝혀낸다.

원저자: Philipp Davydov, Ameya Prabhu, Matthias Bethge, Elisa Nguyen, Seong Joon Oh

게시일 2026-08-04
📖 3 분 읽기☕ 가벼운 읽기

원저자: Philipp Davydov, Ameya Prabhu, Matthias Bethge, Elisa Nguyen, Seong Joon Oh

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 학생이 시험에서 내용을 그대로 복제하고 있는지 알아내려는 탐정이라고 상상해 보십시오. 만약 학생이 교과서의 문장을 토씨 하나 틀리지 않고 그대로 베꼈다면 그것은 명백한 복제입니다. 하지만 학생이 장 전체를 읽고 개념을 이해한 뒤, 의미는 정확히 같지만 완전히 새로운 문장을 썼다면 어떨까요? 그것은 복제일까요, 아니면 진정한 학습일까요? 이것이 바로 인공지능(AI)을 연구하는 과학자들이 직면한 거대한 질문입니다. 대규모 언어 모델(LLM)이라고 불리는 이 AI 모델들은 인터넷의 거의 모든 것을 읽은 초강력 학생과 같습니다. 이들은 이야기를 쓰고, 수학 문제를 풀며, 우리와 대화를 나눌 수 있습니다. 하지만 때때로 이들은 이전에 읽었던 내용을 단순히 반복하기도 하고, 때로는 새로운 무언가를 만들어내기도 합니다. 까다로운 점은 AI가 출처를 숨기는 데 너무 능숙하기 때문에, '복제'와 '창조' 사이의 차이를 구별해내는 것입니다. 과학자들은 알고 싶어 합니다. AI가 실제로 사고하고 일반화하고 있는 것인지, 아니면 그저 자신이 암기한 패턴을 반복하는 화려한 앵무새에 불과한 것인지를 말입니다.

이 논문은 그 미스터리를 풀기 위한 영리하고 새로운 방법을 소개합니다. 저자들은 단순히 단어가 일치하는지를 찾는 것(마치 맞춤법 검사기처럼) 대신, 단어 이면에 담긴 '의미'를 들여다보는 시스템을 구축했습니다. 그들은 이를 '의미적 유사성(semantic similarity)'이라고 부릅니다. 이것은 마치 두 점을 비교하는 것과 같습니다. 만약 당신이 오직 붓터치만을 본다면 두 그림은 완전히 달라 보일 수 있습니다. 하지만 전체적인 이미지를 본다면, 당신은 두 그림 모두 같은 노을을 그리고 있다는 사실을 깨달을 수 있습니다. 연구진은 이 아이디어를 사용하여 AI가 훈련받은 방대한 데이터 라이브러리를 스캔했습니다. 그들은 단순히 "AI가 이 문장을 복사했는가?"라고 묻지 않았습니다. 대신 "AI가 비록 다른 단어를 사용했을지라도, 이 문장의 '아이디어'를 복사했는가?"라고 물었습니다.

이를 테스트하기 위해 연구팀은 SmolLM이라는 AI 모델 제품군을 사용했습니다. 그들은 3단계 조사 과정을 설정했습니다. 첫째, 빠른 검색 도구를 사용하여 훈련 라이브러리에서 가장 유사한 아이디어들을 찾아냈습니다. 둘째, 단순히 짧고 쉬운 일치 여부가 아니라, 적절한 종류의 유사성을 찾고 있는지 확인하기 위해 그 결과들의 순위를 다시 매겼습니다. 마지막으로, 가장 중요한 단계로, AI의 답변을 실제 사람이 작성한 답변과 비교했습니다. 이는 마치 요리사가 간이 제대로 맞는지 확인하기 위해 표준 레시피와 대조하며 음식을 맛보는 것과 같은 '보정(calibration)' 도구 역할을 했습니다. 이를 통해 연구진은 AI의 출력이 얼마나 '새로운지(novel)'—즉, 얼마나 새롭고 다른지—를, 그것이 화려하게 들리든 단순하게 들리든 상관없이 측정할 수 있었습니다.

결과는 놀라웠으며, 우리가 이 AI 모델들을 생각하는 방식을 바꾸어 놓았습니다. 첫째, AI 모델들이 기존에 생각했던 것보다 훨씬 더 긴 구간의 텍스트에 걸쳐 훈련 데이터로부터 내용을 끌어오고 있다는 사실을 발견했습니다. 단순히 한 문장을 복사하는 것이 아니라, 긴 단락에서 아이디어들을 엮어내고 있었습니다. 둘째, 과제의 유형이 매우 중요했습니다. AI가 수학 문제를 푸는 것처럼 매우 엄격한 과제를 수행할 때는 정답을 말하는 방식이 하나뿐이기 때문에 참신함이 떨어지는 경전이 있습니다. 하지만 이야기를 쓰거나 까다로운 질문에 답하라고 요청받을 때는 훨씬 더 창의적이 되며 복제꾼의 모습에서 벗어납니다.

아마도 가장 흥-미로운 발견은 '지시어 튜닝(instruction tuning)'에 관한 것이었을 것입니다. 이것은 AI에게 "도움이 되는 비서처럼 행동하라"와 같은 특정 명령을 따르도록 가르치는 과정입니다. 연구진은 이러한 훈련이 단순히 AI의 스타일만 바꾸는 것이 아니라, 실제로 AI를 더 참신하게 만든다는 것을 발견했습니다. 지시어 튜닝을 거친 모델들은 원래의 훈련 데이터와 덜 유사한, 더 다양한 구절과 구조를 사용하기 시작했습니다. 마치 명령을 따르도록 배운 것이 AI에게 교과서를 반복하는 것을 멈추고 자신만의 이야기를 쓸 수 있는 자신감을 준 것과 같습니다.

연구진은 또한 더 작은 AI 모델들이 거대 모델들보다 더 '참신하다'는 사실을 발견했습니다. 거대 모델들은 마치 자신이 암기한 것에서 벗어나는 것을 두려워하는 것처럼 훈련 데이터에 더 가깝게 머무는 경향이 있었습니다. 이 연구가 이 모델들이 인간과 같은 의미에서 '생각한다'는 것을 증명하는 것은 아니지만, 지시어 튜닝이 단순한 암기를 넘어설 수 있도록 돕는다는 점을 강력하게 시사합니다. 연구진은 이 새로운 방식의 '새로움' 측정이 디지털 두뇌가 정확히 무엇을 배우고 있는지, 그리고 언제 진정으로 새로운 것을 창조하는지를 이해하는 데 도움이 되기를 바라며 모든 도구와 데이터를 공개했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →