← 최신 논문
🤖 machine learning

Transmuting prompts into weights

프롬프트와 암묵적 가중치 업데이트 사이의 이론적 연결을 바탕으로, 본 논문은 일시적인 프롬프트 정보를 재사용 가능한 토큰 독립적 사고 벡터 및 행렬로 응축하는 원칙적인 알고리즘을 제안하며, 이를 통해 텍스트 입력을 모델 편집 및 지식 주입을 위한 효과적인 가중치 업데이트로 변환하기 위한 이론적 토대와 직접적인 방법을 제공한다.

원저자: Hanna Mazzawi, Benoit Dherin, Michael Munn, Adrian Goldwaser, Michael Wunder, Javier Gonzalvo

게시일 2026-06-04
📖 4 분 읽기☕ 가벼운 읽기

원저자: Hanna Mazzawi, Benoit Dherin, Michael Munn, Adrian Goldwaser, Michael Wunder, Javier Gonzalvo

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 아주 똑똑하지만 약간 건망증이 있는 로봇 비서(거대 언어 모델)가 있다고 상상해 보세요. 보통, 이 로봇에게 "이 프랑스 단어를 번역해 줘"라거나 "이 문장을 정중하게 만들어 줘"와 같은 특정한 일을 시키려면, 질문을 할 때마다 매번 지시 사항을 반복해서 말해줘야 합니다. 마치 로봇의 귀에 질문을 던질 때마다 매번 똑같은 규칙 책을 소리 높여 외치는 것과 같습니다.

이 논문은 이렇게 소리 지르는 일을 멈추기 위한 영리한 기술을 소개합니다. 지시 사항을 반복하는 대신, 연구진은 그 지시 사항을 바탕으로 로봇의 내부 규칙 책(즉, "가중치")을 영구적으로 다시 쓰는 방법을 찾아냈습니다. 그들은 이 과정을 "프롬프트를 가중치로 변환하기(Transmuting Prompts into Weights)"라고 부릅니다.

다음은 일상적인 비유를 사용하여 이들이 어떻게 이 일을 해냈는지에 대한 간단한 설명입니다.

1. 문제점: "유령" 지시 사항

보통 로봇에게 지시(예: "예의 바르게 행동해")를 내리면, 로봇은 그 대화 동안에만 일시적으로 행동을 바꿉니다. 하지만 대화가 끝나면 로봇은 그것을 잊어버립니다.

  • 기존 방식: 연구진은 매번 로봇의 뇌에 더할 "마법의 숫자"(벡터)를 찾는 방식으로 이를 해결하려 했습니다. 효과는 있었지만, 이는 일종의 추측과 확인의 반복이었습니다.
  • 새로운 방식: 이 논문은 "더 이상 추측하지 말자. 지시 사항이 로봇의 뇌를 어떻게 바꾸는지 수학적으로 정확히 증명한 다음, 그 변화를 로봇의 영구적인 기억 속에 구워 넣자(bake into)"라고 말합니다.

2. 핵심 아이디어: "사고 패치(Thought Patch)"

연구진은 당신이 로봇에게 프롬프트(지시 사항)를 주면, 로봇의 뇌 안에 일시적인 변화의 "그림자"가 생긴다는 것을 발견했습니다.

  • 비유: 로봇을 요리사라고 상상해 보세요. 당신이 "소금을 넣어"라고 말하면, 요리사의 손은 소금을 뿌리기 위해 특정한 방식으로 움직입니다.
    • 토큰 의존적 패치(Token-Dependent Patches): 처음에 연구진은 요리사가 문장의 모든 단어를 말할 때마다 "소금 뿌리는" 동작이 조금씩 다르다는 것을 발견했습니다. 이는 마치 요리사가 문장의 모든 단어마다 새로운 미세한 손동작을 배워야 하는 것과 같습니다. 이는 영구적으로 저장하기에는 너무 복란합니다.
    • "사고 패치(Thought Patch)": 연구진은 이 모든 작고 서로 다른 손동작들을 평균 내어, 전체 문장에 적용할 수 있는 단 하나의 완벽한 손동작으로 만들 수 있다는 것을 깨달았습니다. 그들은 이를 단순한 변화를 위한 **"사고 벡터(Thought Vector)"**와 더 복잡한 변화를 위한 **"사고 행렬(Thought Matrix)"**이라고 부릅니다.

3. 과정: 지시 사항을 "꿰매어 넣기(Stitching)"

논문은 일시적인 지시 사항을 영구적인 변화로 바꾸는 알고리즘(단계별 레시피)을 설명합니다.

  1. 요리사 관찰하기: 로봇이 지시 사항과 작업(예: "번역: Hello" -> "Bonjour")을 모두 읽도록 합니다. 그리고 로봇의 뇌가 정확히 어떻게 활성화되는지 기록합니다.
  2. 지시 사항 없는 상태의 요리사 관찰하기: 로봇에게 지시 사항 없이 작업(예: 그냥 "Hello")을 수행하게 합니다. 그리고 뇌가 어떻게 다르게 활성화되는지 확인합니다.
  3. 차이점 찾기: 두 뇌 상태 사이의 간극을 계산합니다.
  4. 수학적 마법: "최소제곱법(Least Squares, 점들의 구름 사이에서 가장 잘 맞는 선을 찾는 것과 같습니다)"이라는 방법을 사용하여, 그 간극을 메우는 데 필요한 정확한 수학적 공식을 계산합니다.
  5. 영구적인 수정: 그 공식을 가져와서 로봇의 영구적인 가중치에 직접 더합니다.

4. 결과: 로봇이 기억한다

이 과정을 거치고 나면, 로봇은 더 이상 "번역해"라는 지시 사항을 들을 필요가 없습니다. 그 지시는 이제 로봇의 뇌에 **하드와이어링(hardwired, 직접 연결)**되었습니다.

  • 비유: 이는 강아지에게 앉으라고 가르치는 것과 같습니다.
    • 전에는: 당신이 옆에 있을 때마다 "앉아!"라고 말해야 하고, 강아지는 당신이 거기 있기 때문에 듣습니다.
    • 후에는: 당신이 손가락으로 가리키기만 해도 강아지가 자동으로 앉을 수 있도록, 당신은 물리적으로 강아지의 근육을 훈련시킨 것입니다. 명령은 이제 소리가 아니라 강아지의 몸의 일부가 되었습니다.

5. 테스트 내용

연구진은 구글의 작은 모델(Gemma)을 대상으로 테스트를 진행했으며, 다음과 같은 결과를 얻었습니다.

  • 수학 및 논리: 로봇에게 숫자를 곱하거나 유해한 문장을 정화(detoxify)하도록 가르쳤습니다. "사고 패치"를 적용한 후, 로봇은 아무런 지시를 받지 않고도 이 작업들을 완벽하게 수행했습니다.
  • 번역: 로봇에게 프랑스어를 영어로 번역하도록 가르쳤습니다. 패치를 적용한 후, 로봇은 "영어로 번역해"라는 지시가 전혀 언급되지 않았음에도 불구하고 자동으로 프랑스어 단어를 번역했습니다.
  • 새로운 지식: 로봇에게 가상의 사실들(예: "Zog의 수도는 X이다")이 담긴 작은 사전을 가르쳤습니다. 로봇은 이 사실들을 학습했고, 사전이 곁에 없어도 나중에 이를 회상할 수 있었습니다.

주의 사항 (한계점)

논문은 이 "하드와이어링" 방식이 질문이 학습할 때 사용했던 방식과 동일할 때 가장 잘 작동한다고 언급합니다. 만약 학습할 때 사용했던 단어와 매우 다른 단어를 사용하여 질문한다면, 로봇은 혼란에 빠질 수 있습니다. 이는 "수도가 무엇입니까?"라고 훈련받은 로봇이 "수도 도시를 알려주세요"라고 물었을 때 막힐 수 있는 것과 같습니다. 왜냐하면 "사고 패치"가 첫 번째 질문의 특정 어구에 맞춰 튜닝되었기 때문입니다.

요약

요약하자면, 이 논문은 지시 사항은 그저 일시적인 가중치 업데이트일 뿐이라는 수학적 증명을 제공합니다. 이러한 일시적인 업데이트를 평균 내는 방ことで, 언어 모델의 뇌에 지시 사항과 지식을 영구적으로 설치할 수 있는 방법을 만들어냈으며, 이를 통해 매번 지시 사항을 반복할 필요 없이 복잡한 작업을 수행할 수 있게 했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →