← 최신 논문
🤖 AI

Different Feedback, Different Updates: Selective Self-Learning from User Interactions for Large Language Models

이 논문은 사용자 피드백을 작업 유효 수정(task-valid fixes), 조건 특정 사양(condition-specific specs), 그리고 무효 구성 요소(null components)로 분해하여, 고정된 백본(frozen backbone) 상에서 상호 보완적인 범용(Generalist) 및 전문(Specialist) LoRA 어댑터를 학습시킴으로써 대규모 언어 모델이 적절한 일반화 범위와 함께 지속적으로 개선될 수 있도록 하는 선택적 자기 학습 프레임워크인 SLIFT를 소개한다.

원저자: Xuanchen Li, Haitao Li, Yujia Zhou, Qingyi Pan, Heng Wang, Yiqun Liu, Min Zhang, Qingyao Ai

게시일 2026-08-11
📖 4 분 읽기☕ 가벼운 읽기

원저자: Xuanchen Li, Haitao Li, Yujia Zhou, Qingyi Pan, Heng Wang, Yiqun Liu, Min Zhang, Qingyao Ai

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매우 똑똑하지만 약간 고집스러운 로봇에게 더 나은 대화법을 가르치고 있다고 상상해 보세요. 당신은 단순히 스크립트를 암기시키는 것이 아니라, 로봇이 실제 사람들과 나누는 모든 대화로부터 배우기를 원합니다. 이것이 바로 챗봇과 글쓰기 보조 도구의 뒤에 있는 초지능적인 AI 두뇌인 **거대 언어 모델(LLM)**의 세계입니다. 이 모델들은 인간 지식의 거대한 도서관과 같지만, 실수를 하거나, 요점을 놓치거나, 기술적으로는 정답이지만 짜증 날 정도로 지루한 답변을 내놓기도 합니다.

이를 해결하기 위해 우리는 보통 사용자 피드백에 의존합니다. 사람이 "그건 틀렸어"라거나 "더 짧게 만들어줘"라고 말하면, 모델은 힌트를 얻습니다. 하지만 여기서 까다로운 점은, 사용자의 메시지 하나가 여러 가지 지시가 뒤섞인 복잡한 칵테일과 같다는 것입니다. 한 문장은 "이 수학 오류를 수정해줘"(강제 규칙)라고 말하는 반면, 다음 문장은 "재미있는 어조로 해줘"(선호 사항)라고 하고, 세 번째 문장은 "그나저나 고양이에 대한 농담 좀 해줘"(원래의 수학 문제와는 전혀 상관없는 내용)라고 할 수 있습니다. 만약 로봇이 이 모든 것을 한꺼번에 똑같은 것으로 간격하고 학습하려 한다면, 혼란에 빠져 수학 시험 중에 농담을 던지거나 기본적인 산술 능력을 잊어버릴 수도 있습니다. 연구자들이 던지는 핵심 질문은 이것입니다: 어떻게 하면 로봇이 메시지의 '올바른' 부분에 귀를 기울이고 나머지는 무시하게 하여, 이상해지지 않으면서도 시간이 흐를수록 더 똑똑해지도록 가르칠 수 있을까?

이 논문은 바로 이 문제를 해결하기 위해 SLIFT(Task-Relative Specialization을 통한 상호작용 피드백 기반 자기 학습)라는 영리한 새로운 시스템을 소개합니다. SLIFT를 복잡한 사용자 코멘트로부터 학습하기 위해 협력하는 두 로봇의 매우 조직적인 팀이라고 생각해보세요.

먼저, 시스템은 탐정처럼 행동합니다. 사용자가 피드백 메시지를 보내면, SLIFT는 이를 아주 작고 원자적인 조각들로 분해합니다. 그런 다음 각 조각을 다음 세 가지 바구니 중 하나로 분류합니다:

  1. Fix (수정): 이것들은 "필수 사항"입니다. 만약 사용자가 "답은 3이 아니라 5입니다"라고 말했다면, 이는 이 유형의 질문에 대한 미래의 모든 답변이 반드시 따라야 하는 규칙입니다. 이는 로봇의 기본 동작에 대한 영구적인 변화입니다.
  2. Spec (특수 선호): 이것들은 "있으면 좋은 것" 또는 구체적인 선호 사항입니다. 만약 사용자가 "주방 비유를 들어줘"라고 말했다면, 이는 '이 특정' 수학 문제에는 훌륭하지만, 역사 문제에는 적절하지 않을 수 있습니다. 이는 조건부적인 정교화입니다.
  3. Null (무시): 이것들은 "무시해도 되는" 부분입니다. 만약 수학 솔루션을 요청하는 와중에 갑자기 고양이에 대한 시를 써달라고 한다면, 이는 관련 없는 소음입니다. 이는 로봇의 학습 방식에 아무런 영향을 주어서는 안 됩니다.

피드백이 분류되면, SLIFT는 하나의 뇌가 모든 것을 다 하도록 강요하는 대신, 두 개의 서로 다른 "학습자"(어댑터)를 사용하여 업데이트를 처리합니다.

첫 번째 학습자는 **제너럴리스트(Generalist, 일반 전문가)**입니다. 이는 로봇의 핵심 인격과 같습니다. 이 모델은 오직 Fix 항목만을 봅니다. 만약 사용자가 사실 관계 오류를 지적했다면, 제너럴리스트는 그 오류가 앞으로의 기본 답변에서 다시는 발생하지 않도록 학습합니다. 이 수정 사항을 자신의 영구적인 기억 속에 "구워 넣어(bake)", 매번 그 문제를 다시 생각할 필요가 없도록 만듭니다.

두 번째 학습자는 **스페셜리스트(Specialist, 특수 전문가)**입니다. 이것은 "맥락 확인자" 역할을 합니다. 이 모델은 제너럴리스트의 핵심 인격을 바꾸지 않습니다. 대신, 제너럴리스트가 답변을 내놓을 때까지 기다렸다가 다음과 같이 묻습니다: "잠깐, 우리가 이 특정 상황을 위한 Spec 선호 사항을 놓치지는 않았나?" 만약 제럴리스트가 정답인 수학 답안을 제시했지만 사용자가 원했던 주방 비유를 사용하는 것을 잊었다면, 스페셜리스트가 개입합니다. 스페셜리스트는 "수학은 유지하되, 비유를 추가해"라고 말하며, 딱 그 부분만 고칠 수 있도록 작고 정밀한 자극을 줍니다. 만약 제너럴리스트가 이미 모든 것을 제대로 수행했다면, 스페셜리스트는 "그대로 유지해"라고 말하며 아무것도 하지 않습니다.

연구진은 이 시스템을 두 가지 유형의 데이터, 즉 컴퓨터가 사용자의 역할을 수행한 시뮬레이션 채팅과 실제 사람들의 실제 채팅을 통해 테스트했습니다. 결과는 SLIFT가 매우 잘 작동한다는 것을 보여줍니다. 시뮬레이션 테스트에서, SLIFT는 다른 방법들보다 모델의 점수를 훨씬 더 유의미하게 향상시켰습니다. 실제 환경 테스트에서도, 어려운 추론 문제를 해결하는 능력을 망가뜨리지 않으면서도 지시 이행 능력과 글의 품질을 높였습니다.

저자들은 성공의 핵심이 피드백을 하나의 커다란 덩어리로 취급하지 않는 데 있다는 것을 발견했습니다. "반드시 고쳐야 할" 규칙과 "있으면 좋은" 선호 사항, 그리고 "무시해야 할" 소음을 분리함으로써, 모델은 적절한 시기에 적절한 것을 배울 수 있었습니다. 제너럴리스트는 기초를 더 똑똑하게 배웠고, 스페셜리스트는 특정 상황을 위한 유능한 편집자가 되는 법을 배웠습니다. 이 접근 방식은 AI가 진정으로 인간으로부터 배우기 위해서는, 무엇을 영원히 기억하고 무엇을 잠시 동안만 사용할 것인지 정확히 아는 '선택적 능력'이 필요함을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →