← 최신 논문
🤖 AI

SEAT: Sparse Entity-Aware Tuning for Knowledge Adaptation while Preserving Epistemic Abstention

이 논문은 새로운 지식 적응 과정에서 발생할 수 있는 할루시네이션을 방지하기 위해 정렬 데이터나 사후 재조정 없이도 모델이 모르는 것을 인지하는 능력 (인지적 유보) 을 유지하면서 지식을 효과적으로 학습하게 하는 SEAT 라는 희소 엔티티 인식 미세조정 방법을 제안합니다.

원저자: William F. Shen, Xinchi Qiu, Nicola Cancedda, Nicholas D. Lane

게시일 2026-04-22
📖 3 분 읽기☕ 가벼운 읽기

원저자: William F. Shen, Xinchi Qiu, Nicola Cancedda, Nicholas D. Lane

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 **"새로운 지식을 배울 때, '모른다'고 말하는 능력까지 잃어버리지 않는 방법"**에 대한 연구입니다.

인공지능 (LLM) 이 새로운 정보를 배우기 위해 재학습 (파인튜닝) 을 하면, 원래 가지고 있던 **'지적인 겸손함 (자신이 모르는 것은 모른다고 인정하는 태도)'**이 사라지고, 오히려 **거짓말 (할루시네이션)**을 자신 있게 해대는 문제가 생깁니다.

이 문제를 해결하기 위해 제안된 방법인 SEAT를 일상적인 비유로 설명해 드리겠습니다.


🧠 문제 상황: "모른다"는 말을 잊어버린 학생

상상해 보세요. 아주 똑똑한 학생이 있습니다. 이 학생은 원래 "내가 모르는 건 솔직하게 '모른다'고 말해주는" 훌륭한 성품을 가지고 있었습니다.

하지만 이 학생에게 **새로운 역사 사실 (예: 2025 년에 일어난 사건)**을 가르쳐 주려고 합니다.

  • 기존 방식 (일반적인 학습): 학생이 새로운 사실을 외우느라 정신이 팔려서, 원래 가지고 있던 '겸손함'이라는 성품이 사라집니다. 이제 모르는 질문을 받으면, "모른다"고 말하기 대신 상상해서라도 자신 있게 거짓 답변을 뱉어냅니다.
    • 예: "2025 년에 교황이 사망했다"는 거짓말을 사실인 것처럼 말합니다.

이것은 의료나 법률처럼 실수가 치명적인 분야에서 매우 위험합니다.


💡 해결책: SEAT (스마트한 학습법)

연구팀은 이 학생이 새로운 지식을 배우면서도, '모른다'는 태도를 잃지 않게 하는 SEAT라는 새로운 학습법을 고안했습니다. SEAT 는 두 가지 핵심 전략을 사용합니다.

1. "필요한 부분만 공부하기" (희소성 학습 / Sparse Tuning)

  • 비유: 학생의 머릿속을 거대한 도서관이라고 상상해 보세요.
  • 기존 방식: 새로운 책을 넣으려고 도서관 전체를 다 뒤집어엎고 책장을 다시 배치합니다. 이 과정에서 원래 있던 '겸손함'이라는 중요한 책들이 어디로 날아갈지 모릅니다.
  • SEAT 방식: 새로운 지식만 넣을 수 있는 작은 공간 (책장 한 칸) 만 열어두고, 나머지 도서관은 절대 건드리지 않습니다.
    • 이렇게 하면 새로운 정보를 배우는 동안, 원래 도서관의 구조 (겸손함) 가 무너지지 않아 안정적으로 유지됩니다.

2. "가짜 이웃에게도 가르치지 않기" (엔티티 교란 / Entity Perturbation)

  • 비유: 학생이 "김철수 씨가 2025 년에 노벨상을 탔다"는 사실을 배웠다고 칩시다.
  • 문제: 학생이 이 사실을 배우자마자, 이름이 비슷한 "김철수 씨의 친구"나 "유사한 이름의 사람"에게도 그 사실을 무조건 적용해버립니다. (예: "김철수 씨의 친구도 탔겠지?"라고 착각함)
  • SEAT 방식: 학습할 때 **가짜 이름 (예: '김철수'를 '김철수 A'로 바꿈)**을 섞어서 연습시킵니다. 그리고 "아, 이 가짜 이름에는 원래의 지식이 적용되지 않아야 해. 이 경우에는 '모른다'고 말해야 해"라고 강하게 훈련시킵니다.
    • 이를 통해 배운 지식이 엉뚱한 곳으로 번지지 않게 (Spillover 방지) 막아줍니다.

🏆 SEAT 의 성과

이 방법을 적용한 결과, 다음과 같은 놀라운 일이 일어났습니다.

  1. 새로운 지식은 완벽하게 배웠습니다: 새로운 사실을 기억하는 능력은 기존 방법과 다름없이 뛰어났습니다.
  2. 모르는 것은 확실하게 모른다고 말했습니다: 새로운 지식을 배우고 난 뒤에도, 모르는 질문에는 여전히 "모른다"고 정중하고 정확하게 답했습니다.
  3. 거짓말을 하지 않았습니다: 다른 방법들은 모르는 질문에 대해 엉뚱한 거짓말을 했지만, SEAT 는 18%~101% 더 많이 "모른다"는 정직한 답변을 했습니다.

📝 한 줄 요약

**"새로운 지식을 배울 때, 도서관 전체를 헐어내지 않고 필요한 책장만 살짝 열어주며 (희소성), 배운 지식이 엉뚱한 곳으로 퍼지지 않게 철저히 통제하는 (엔티티 교란) 방법"**을 통해, 인공지능이 똑똑해지되 '지적인 겸손함'까지 잃지 않도록 만든 것입니다.

이 기술은 의료, 법률 등 실수가 치명적인 분야에서 인공지능을 안전하게 활용하는 데 큰 도움이 될 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →