← 최신 논문
💬 NLP

Data Attribution in Large Language Models via Bidirectional Gradient Optimization

이 논문은 생성된 출력물을 바탕으로 베이스 모델을 섭동시켜 학습 샘플 전반에 걸친 손실 변화를 측정함으로써, 모델의 해석 가능성과 책임성을 높이기 위해 영향력 있는 데이터를 식별하는 데 있어 기존 방법들보다 뛰어난 성능을 보이는 대규모 언어 모델용 양방향 그래디언트 최적화 프레임워크를 소개한다.

원저자: Frédéric Berdoz, Luca A. Lanzendörfer, Kaan Bayraktar, Roger Wattenhofer

게시일 2026-06-04
📖 4 분 읽기☕ 가벼운 읽기

원저자: Frédéric Berdoz, Luca A. Lanzendörfer, Kaan Bayraktar, Roger Wattenhofer

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 수천 가지의 요리를 만들 수 있는 방대한 레시피 라이브러리(학습 데이터)를 가진 천재적인 셰프(대규모 언어 모델)가 있다고 상상해 보세요. 어느 날, 이 셰프가 당신에게 "매콤한 토마토 파스타"라는 특정 요리를 내놓았습니다. 당신은 문득 이런 의문이 들 것입니다. 그 라이브러리에 있는 어떤 구체적인 레시피들이 실제로 이 요리에 영감을 주었을까? 이탈리아 할머니의 레시피였을까? 현대적인 퓨전 블로그의 레시피였을까? 아니면 두 가지가 섞인 결과물일까?

이것이 바로 **데이터 귀속(Data Attribution)**의 문제입니다. 이 논문은 이 질문에 답하기 위해 DABGO(양방향 그래디언트 최적화를 통한 데이터 귀속)라고 불리는 새로운 방법을 소개합니다.

DABGO가 어떻게 작동하는지 쉬운 비유를 통해 설명해 드리겠습니다.

문제점: "블랙박스" 주방

보통 셰프가 요리를 만들 때, 우리는 라이브러리의 어떤 재료가 가장 중요했는지 쉽게 알 수 없습니다. 기존 방식들은 단어를 찾아 매칭하는 방식(예: 라이브러리에서 "토마토"라는 단어 검색)으로 추측하려 하지만, 이는 요리의 스타일이나 분위기를 놓치기 쉽습니다. 다른 방식들은 수학적으로 영향력을 계산하려 하지만, 복잡하고 창의적인 요리에는 너무 느리거나 부정확할 수 있습니다.

해결책: "만약에?" 실험

DABGO는 영리한 "만약에?" 전략을 사용합니다. 단순히 라이브러리를 들여다보는 대신, 방금 만든 특정 요리에 대해 셰프의 뇌가 어떻게 반응하는지 보기 위해 일시적으로 셰프의 뇌를 변화시킵니다.

이렇게 생각해보세요:

  1. 설정: 셰프는 이미 "매콤한 토마토 파스타"(생성된 출력물)를 요리했습니다.
  2. 실험: 연구자들은 셰프의 뇌를 가져와서 그 특정 파스타 요리에 대해 두 가지 빠르고 반대되는 시뮬레이션을 실행합니다.
    • 시뮬레이션 A (그래디언트 상승/Gradient Ascent): 셰프의 뇌를 이 파스타를 더욱 사랑하게 만듭니다. 셰프가 "이것은 최고의 파스타야! 나는 이것을 완벽하게 기억해야 해!"라고 생각하도록 만드는 것입니다.
    • 시뮬레이션 B (그래디언트 하강/Gradient Descent): 셰프의 뇌를 이 파스타를 싫어하게 만듭니다. 셰프가 "나는 이 레시피를 완전히 잊고 싶어"라고 생각하도록 만드는 것입니다.
  3. 테스트: 이제, '사랑에 빠진' 뇌와 '미워하는' 뇌를 가진 셰프에게 원래의 레시피 라이브러리를 살펴보라고 합니다.
    • 만약 특정 오래된 레시피가 '사랑에 빠진' 셰프를 매우 행복하게 만들면서 동시에 '미워하는' 셰프를 매우 슬프게 만든다면(혹은 그 반대라면), 그 레시피는 이 파스타에 주요한 영향을 미친 것입니다.
    • 만약 어떤 레시피가 두 시뮬레이션 모두에서 셰프의 감정에 별다른 변화를 주지 않는다면, 그것은 최종 요리에 그리 중요하지 않았을 가능성이 높습니다.

왜 "양방향"이 중요한가

논문에서는 이러한 시뮬레이션 중 하나만 수행하는 것(셰프를 좋아하게만 만들거나, 싫어하게만 만드는 것)은 충분하지 않다는 것을 발견했습니다. 그것은 노래를 이해하기 위해 최대 볼륨으로 듣거나 혹은 속삭임 소리로만 듣는 것과 같습니다. 전체 그림을 얻으려면 양방인 방향이 모두 필요합니다.

  • "사랑"의 방향은 모델이 자연스럽게 모방하고 싶어 했던 레시피를 찾는 데 도움이 됩니다.
  • "미움"의 방향은 모델이 피하려고 했거나 자신을 차별화하려고 했던 레시피를 찾는 데 도움이 됩니다.
    이 두 가지를 결합함으로써, DABGO는 아이디어가 어디에서 왔는지에 대한 훨씬 더 명확한 지도를 얻을 수 있습니다.

무엇을 발견했는가?

연구진은 두 가지 유형의 "요리"에 대해 테스트를 진행했습니다.

  1. 사실적 요리: 사실 관계를 진술하는 것 (예: "파리는 프랑스의 수도이다").
  2. 스타일 요리: 특정 저자의 글쓰기 스타일을 흉내 내는 것 (예: 셰익스피어나 제인 오스틴처럼 쓰기).

결과:

  • 경쟁자보다 우수함: DABGO는 기존 방식들보다 적절한 소스 레시피를 훨씬 더 잘 찾아냈습니다. 기존 방식들이 키워드 검색 엔진과 같아서 적절한 단어는 찾았을지언정 적절한 맥락이나 스타일은 놓쳤던 반면, DABGO는 이를 잡아냈습니다.
  • 스타일의 중요성: 과제가 특정 저자의 스타일을 흉내 내는 것이었을 때, DABGO는 동일한 저자가 쓴 다른 텍스트들을 성공적으로 지목한 반면, 단순한 단어 매칭 도구들은 실패했습니다.
  • 정밀한 확대: DABGO는 매우 정밀하여 전체 레시피뿐만 아니라, 그 레시피 내의 특정 문장이나 심지어 단어까지도 가장 영향력이 컸던 부분을 짚어낼 수 있습니다.

한계점 (Catch)

이 논문은 단점도 솔직하게 밝히고 있습니다. 이 "만약에?" 실험은 계산량이 매우 많습니다. 이는 하나의 새로운 요리를 테스트하기 위해 라이브러리의 모든 레시피를 두 번씩 다시 요리해야 하는 것과 같습니다.

  • 이 방식은 작고 통제된 실험에서는 매우 훌륭하게 작동합니다.
  • 현재로서는 오늘날 빅테크 기업들이 사용하는 거대 규모의 산업용 모델(수십억 개의 단어로 학습된 모델)에 실행하기에는 너무 느리고 비용이 많이 듭니다.

핵심 요약

DABGO는 AI가 그렇게 말했는지를 이해하도록 돕는 새로운 도구입니다. 특정 출력물을 수용하거나 잊으려고 할 때 AI가 어떻게 변할지를 시뮬레이션함으로써, 그 출력을 가장 영향력 있었던 학습 데이터로 추적할 수 있습니다. 이는 AI를 더 투명하고 책임감 있게 만들어, 우리가 "요리" 뒤에 숨겨진 "재료"를 볼 수 있게 해줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →